Benchmark

MuSR

reasoning text

MuSR (Multistep Soft Reasoning) is a benchmark for evaluating language models on multistep soft reasoning tasks specified in natural language narratives. Created through a neurosymbolic synthetic-to-natural generation algorithm, it generates complex reasoning scenarios like murder mysteries roughly 1000 words in length that challenge current LLMs including GPT-4. The benchmark tests chain-of-thought reasoning capabilities across domains involving commonsense reasoning about physical and social situations.

语言EN
满分1
参评模型1

模型排名

名次 模型 机构 分数 来源
1 Kimi K2 Instruct Moonshot AI 76.4 来源 ↗