Benchmark

MMBench-Video

video multimodal reasoning multimodal

A long-form multi-shot benchmark for holistic video understanding that incorporates approximately 600 web videos from YouTube spanning 16 major categories, with each video ranging from 30 seconds to 6 minutes. Includes roughly 2,000 original question-answer pairs covering 26 fine-grained capabilities.

语言EN
满分1
参评模型3

模型排名

名次 模型 机构 分数 来源
1 Qwen2.5 VL 72B Instruct Alibaba Cloud / Qwen Team 2.0 来源 ↗
2 Qwen2.5 VL 32B Instruct Alibaba Cloud / Qwen Team 1.9 来源 ↗
3 Qwen2.5 VL 7B Instruct Alibaba Cloud / Qwen Team 1.8 来源 ↗