Benchmark
MMMUval
vision
general
reasoning
multimodal
multimodal
Validation set for MMMU (Massive Multi-discipline Multimodal Understanding and Reasoning) benchmark, designed to evaluate multimodal models on massive multi-discipline tasks demanding college-level subject knowledge and deliberate reasoning across Art & Design, Business, Science, Health & Medicine, Humanities & Social Science, and Tech & Engineering.
语言EN
满分1
参评模型2
模型排名
| 名次 | 模型 | 机构 | 分数 | 来源 |
|---|---|---|---|---|
| 1 | Claude Sonnet 4.5 | Anthropic | 77.8 | 来源 ↗ |
| 2 | Qwen2-VL-72B-Instruct | Alibaba Cloud / Qwen Team | 64.5 | 来源 ↗ |