Benchmark

MMMU-Pro

vision multimodal reasoning general multimodal

A more robust multi-discipline multimodal understanding benchmark that enhances MMMU through a three-step process: filtering text-only answerable questions, augmenting candidate options, and introducing vision-only input settings. Achieves significantly lower model performance (16.8-26.9%) compared to original MMMU, providing more rigorous evaluation that closely mimics real-world scenarios.

语言EN
满分1
参评模型19

模型排名

名次 模型 机构 分数 来源
1 Gemini 3.5 Flash Google 83.6 来源 ↗
2 GPT-5.6 Sol OpenAI 83.0 来源 ↗
3 GPT-5.5 OpenAI 81.2 来源 ↗
4 GPT-5.4 OpenAI 81.2 来源 ↗
5 GPT-5.6 Terra OpenAI 80.7 来源 ↗
6 Gemini 3.1 Pro Preview Google 80.5 来源 ↗
7 GPT-5.6 Luna OpenAI 78.4 来源 ↗
8 GPT-5 OpenAI 78.4 来源 ↗
9 o3 OpenAI 76.4 来源 ↗
10 GPT-4o OpenAI 59.9 来源 ↗
11 Llama 4 Maverick Meta 59.6 来源 ↗
12 Qwen2.5 VL 72B Instruct Alibaba Cloud / Qwen Team 51.1 来源 ↗
13 Qwen2.5 VL 32B Instruct Alibaba Cloud / Qwen Team 49.5 来源 ↗
14 Qwen2-VL-72B-Instruct Alibaba Cloud / Qwen Team 46.2 来源 ↗
15 Llama 3.2 90B Instruct Meta 45.2 来源 ↗
16 Phi-4-multimodal-instruct Microsoft 38.5 来源 ↗
17 Qwen2.5 VL 7B Instruct Alibaba Cloud / Qwen Team 38.3 来源 ↗
18 Qwen2.5-Omni-7B Alibaba Cloud / Qwen Team 36.6 来源 ↗
19 Llama 3.2 11B Instruct Meta 33.0 来源 ↗