Benchmark

Graphwalks BFS >128k

reasoning spatial_reasoning long_context text

A graph reasoning benchmark that evaluates language models' ability to perform breadth-first search (BFS) operations on graphs with context length over 128k tokens, testing long-context reasoning capabilities.

语言EN
满分1
参评模型3

模型排名

名次 模型 机构 分数 来源
1 GPT-4.1 OpenAI 19.0 来源 ↗
2 GPT-4.1 mini OpenAI 15.0 来源 ↗
3 GPT-4.1 nano OpenAI 2.9 来源 ↗