Benchmark

Graphwalks parents >128k

reasoning spatial_reasoning long_context text

A graph reasoning benchmark that evaluates language models' ability to find parent nodes in graphs with context length over 128k tokens, testing long-context reasoning and graph structure understanding.

语言EN
满分1
参评模型3

模型排名

名次 模型 机构 分数 来源
1 GPT-4.1 OpenAI 25.0 来源 ↗
2 GPT-4.1 mini OpenAI 11.0 来源 ↗
3 GPT-4.1 nano OpenAI 5.6 来源 ↗