Benchmark

VideoMME w sub.

vision multimodal video multimodal

The first-ever comprehensive evaluation benchmark of Multi-modal LLMs in Video analysis. Features 900 videos (254 hours) with 2,700 question-answer pairs covering 6 primary visual domains and 30 subfields. Evaluates temporal understanding across short (11 seconds) to long (1 hour) videos with multi-modal inputs including video frames, subtitles, and audio.

语言EN
满分1
参评模型4

模型排名

名次 模型 机构 分数 来源
1 GPT-5 OpenAI 86.7 来源 ↗
2 Qwen2.5 VL 32B Instruct Alibaba Cloud / Qwen Team 77.9 来源 ↗
3 Qwen2.5-Omni-7B Alibaba Cloud / Qwen Team 72.4 来源 ↗
4 Qwen2.5 VL 7B Instruct Alibaba Cloud / Qwen Team 71.6 来源 ↗