Benchmark

MMMUval

vision general reasoning multimodal multimodal

Validation set for MMMU (Massive Multi-discipline Multimodal Understanding and Reasoning) benchmark, designed to evaluate multimodal models on massive multi-discipline tasks demanding college-level subject knowledge and deliberate reasoning across Art & Design, Business, Science, Health & Medicine, Humanities & Social Science, and Tech & Engineering.

语言EN
满分1
参评模型2

模型排名

名次 模型 机构 分数 来源
1 Claude Sonnet 4.5 Anthropic 77.8 来源 ↗
2 Qwen2-VL-72B-Instruct Alibaba Cloud / Qwen Team 64.5 来源 ↗