Benchmark
EgoSchema
vision
reasoning
long_context
video
A diagnostic benchmark for very long-form video language understanding consisting of over 5000 human curated multiple choice questions based on 3-minute video clips from Ego4D, covering a broad range of natural human activities and behaviors
语言EN
满分1
参评模型9
模型排名
| 名次 | 模型 | 机构 | 分数 | 来源 |
|---|---|---|---|---|
| 1 | Qwen2-VL-72B-Instruct | Alibaba Cloud / Qwen Team | 77.9 | 来源 ↗ |
| 2 | Qwen2.5 VL 72B Instruct | Alibaba Cloud / Qwen Team | 76.2 | 来源 ↗ |
| 3 | GPT-4o | OpenAI | 72.2 | 来源 ↗ |
| 4 | Nova Pro | Amazon | 72.1 | 来源 ↗ |
| 5 | Gemini 2.0 Flash | 71.5 | 来源 ↗ | |
| 6 | Nova Lite | Amazon | 71.4 | 来源 ↗ |
| 7 | Qwen2.5-Omni-7B | Alibaba Cloud / Qwen Team | 68.6 | 来源 ↗ |
| 8 | Gemini 2.0 Flash-Lite | 67.2 | 来源 ↗ | |
| 9 | Gemini 1.0 Pro | 55.7 | 来源 ↗ |