Benchmark

LVBench

vision multimodal long_context multimodal

LVBench is an extreme long video understanding benchmark designed to evaluate multimodal models on videos up to two hours in duration. It contains 6 major categories and 21 subcategories, with videos averaging five times longer than existing datasets. The benchmark addresses applications requiring comprehension of extremely long videos.

语言EN
满分1
参评模型5

模型排名

名次 模型 机构 分数 来源
1 Qwen2.5 VL 32B Instruct Alibaba Cloud / Qwen Team 49.0 来源 ↗
2 Qwen2.5 VL 72B Instruct Alibaba Cloud / Qwen Team 47.3 来源 ↗
3 Qwen2.5 VL 7B Instruct Alibaba Cloud / Qwen Team 45.3 来源 ↗
4 Nova Pro Amazon 41.6 来源 ↗
5 Nova Lite Amazon 40.4 来源 ↗