Benchmark

Graphwalks parents <128k

reasoning spatial_reasoning text

A graph reasoning benchmark that evaluates language models' ability to find parent nodes in graphs with context length under 128k tokens, requiring understanding of graph structure and edge relationships.

语言EN
满分1
参评模型7

模型排名

名次 模型 机构 分数 来源
1 GPT-5 OpenAI 73.3 来源 ↗
2 GPT-4.5 OpenAI 72.6 来源 ↗
3 GPT-4.1 mini OpenAI 60.5 来源 ↗
4 o3-mini OpenAI 58.3 来源 ↗
5 GPT-4.1 OpenAI 58.0 来源 ↗
6 GPT-4o OpenAI 35.4 来源 ↗
7 GPT-4.1 nano OpenAI 9.4 来源 ↗