Benchmark

Graphwalks BFS <128k

reasoning spatial_reasoning text

A graph reasoning benchmark that evaluates language models' ability to perform breadth-first search (BFS) operations on graphs with context length under 128k tokens, returning nodes reachable at specified depths.

语言EN
满分1
参评模型7

模型排名

名次 模型 机构 分数 来源
1 GPT-5 OpenAI 78.3 来源 ↗
2 GPT-4.5 OpenAI 72.3 来源 ↗
3 GPT-4.1 OpenAI 61.7 来源 ↗
4 GPT-4.1 mini OpenAI 61.7 来源 ↗
5 o3-mini OpenAI 51.0 来源 ↗
6 GPT-4o OpenAI 41.7 来源 ↗
7 GPT-4.1 nano OpenAI 25.0 来源 ↗