Benchmark

VideoMME w/o sub.

multimodal video vision multimodal

Video-MME is a comprehensive evaluation benchmark for multi-modal large language models in video analysis. It features 900 videos across 6 primary visual domains with 30 subfields, ranging from 11 seconds to 1 hour in duration, with 2,700 question-answer pairs. The benchmark evaluates MLLMs' capabilities in processing sequential visual data and multi-modal content including video frames, subtitles, and audio.

语言EN
满分1
参评模型3

模型排名

名次 模型 机构 分数 来源
1 Qwen2.5 VL 72B Instruct Alibaba Cloud / Qwen Team 73.3 来源 ↗
2 Qwen2.5 VL 32B Instruct Alibaba Cloud / Qwen Team 70.5 来源 ↗
3 Qwen2.5 VL 7B Instruct Alibaba Cloud / Qwen Team 65.1 来源 ↗