Benchmark
MMMU-Pro
vision
multimodal
reasoning
general
multimodal
A more robust multi-discipline multimodal understanding benchmark that enhances MMMU through a three-step process: filtering text-only answerable questions, augmenting candidate options, and introducing vision-only input settings. Achieves significantly lower model performance (16.8-26.9%) compared to original MMMU, providing more rigorous evaluation that closely mimics real-world scenarios.
语言EN
满分1
参评模型19
模型排名
| 名次 | 模型 | 机构 | 分数 | 来源 |
|---|---|---|---|---|
| 1 | Gemini 3.5 Flash | 83.6 | 来源 ↗ | |
| 2 | GPT-5.6 Sol | OpenAI | 83.0 | 来源 ↗ |
| 3 | GPT-5.5 | OpenAI | 81.2 | 来源 ↗ |
| 4 | GPT-5.4 | OpenAI | 81.2 | 来源 ↗ |
| 5 | GPT-5.6 Terra | OpenAI | 80.7 | 来源 ↗ |
| 6 | Gemini 3.1 Pro Preview | 80.5 | 来源 ↗ | |
| 7 | GPT-5.6 Luna | OpenAI | 78.4 | 来源 ↗ |
| 8 | GPT-5 | OpenAI | 78.4 | 来源 ↗ |
| 9 | o3 | OpenAI | 76.4 | 来源 ↗ |
| 10 | GPT-4o | OpenAI | 59.9 | 来源 ↗ |
| 11 | Llama 4 Maverick | Meta | 59.6 | 来源 ↗ |
| 12 | Qwen2.5 VL 72B Instruct | Alibaba Cloud / Qwen Team | 51.1 | 来源 ↗ |
| 13 | Qwen2.5 VL 32B Instruct | Alibaba Cloud / Qwen Team | 49.5 | 来源 ↗ |
| 14 | Qwen2-VL-72B-Instruct | Alibaba Cloud / Qwen Team | 46.2 | 来源 ↗ |
| 15 | Llama 3.2 90B Instruct | Meta | 45.2 | 来源 ↗ |
| 16 | Phi-4-multimodal-instruct | Microsoft | 38.5 | 来源 ↗ |
| 17 | Qwen2.5 VL 7B Instruct | Alibaba Cloud / Qwen Team | 38.3 | 来源 ↗ |
| 18 | Qwen2.5-Omni-7B | Alibaba Cloud / Qwen Team | 36.6 | 来源 ↗ |
| 19 | Llama 3.2 11B Instruct | Meta | 33.0 | 来源 ↗ |