Benchmark

Video-MME (long, no subtitles)

vision multimodal video multimodal 多语言

Video-MME is the first-ever comprehensive evaluation benchmark for Multi-modal Large Language Models (MLLMs) in video analysis. This variant focuses on long-term videos (30min-60min) without subtitle inputs, testing robust contextual dynamics across 6 primary visual domains with 30 subfields including knowledge, film & television, sports competition, life record, and multilingual content.

语言EN
满分1
参评模型1

模型排名

名次 模型 机构 分数 来源
1 GPT-4.1 OpenAI 72.0 来源 ↗