Benchmark

EgoSchema

vision reasoning long_context video

A diagnostic benchmark for very long-form video language understanding consisting of over 5000 human curated multiple choice questions based on 3-minute video clips from Ego4D, covering a broad range of natural human activities and behaviors

语言EN
满分1
参评模型9

模型排名

名次 模型 机构 分数 来源
1 Qwen2-VL-72B-Instruct Alibaba Cloud / Qwen Team 77.9 来源 ↗
2 Qwen2.5 VL 72B Instruct Alibaba Cloud / Qwen Team 76.2 来源 ↗
3 GPT-4o OpenAI 72.2 来源 ↗
4 Nova Pro Amazon 72.1 来源 ↗
5 Gemini 2.0 Flash Google 71.5 来源 ↗
6 Nova Lite Amazon 71.4 来源 ↗
7 Qwen2.5-Omni-7B Alibaba Cloud / Qwen Team 68.6 来源 ↗
8 Gemini 2.0 Flash-Lite Google 67.2 来源 ↗
9 Gemini 1.0 Pro Google 55.7 来源 ↗