Benchmark
VideoMME w sub.
vision
multimodal
video
multimodal
The first-ever comprehensive evaluation benchmark of Multi-modal LLMs in Video analysis. Features 900 videos (254 hours) with 2,700 question-answer pairs covering 6 primary visual domains and 30 subfields. Evaluates temporal understanding across short (11 seconds) to long (1 hour) videos with multi-modal inputs including video frames, subtitles, and audio.
语言EN
满分1
参评模型4
模型排名
| 名次 | 模型 | 机构 | 分数 | 来源 |
|---|---|---|---|---|
| 1 | GPT-5 | OpenAI | 86.7 | 来源 ↗ |
| 2 | Qwen2.5 VL 32B Instruct | Alibaba Cloud / Qwen Team | 77.9 | 来源 ↗ |
| 3 | Qwen2.5-Omni-7B | Alibaba Cloud / Qwen Team | 72.4 | 来源 ↗ |
| 4 | Qwen2.5 VL 7B Instruct | Alibaba Cloud / Qwen Team | 71.6 | 来源 ↗ |