Benchmark

ERQA

vision reasoning spatial_reasoning multimodal

Embodied Reasoning Question Answering benchmark consisting of 400 multiple-choice visual questions across spatial reasoning, trajectory reasoning, action reasoning, state estimation, and multi-view reasoning for evaluating AI capabilities in physical world interactions

语言EN
满分1
参评模型3

模型排名

名次 模型 机构 分数 来源
1 GPT-5 OpenAI 65.7 来源 ↗
2 o3 OpenAI 64.0 来源 ↗
3 GPT-4o OpenAI 35.2 来源 ↗