Benchmark
MMMU
multimodal
reasoning
general
multimodal
MMMU (Massive Multi-discipline Multimodal Understanding) is a benchmark designed to evaluate multimodal models on college-level subject knowledge and deliberate reasoning. Contains 11.5K meticulously collected multimodal questions from college exams, quizzes, and textbooks, covering six core disciplines: Art & Design, Business, Science, Health & Medicine, Humanities & Social Science, and Tech & Engineering across 30 subjects and 183 subfields.
语言EN
满分1
参评模型52
模型排名
| 名次 | 模型 | 机构 | 分数 | 来源 |
|---|---|---|---|---|
| 1 | GPT-5 | OpenAI | 84.2 | 来源 ↗ |
| 2 | o3 | OpenAI | 82.9 | 来源 ↗ |
| 3 | Gemini 2.5 Pro Preview 06-05 | 82.0 | 来源 ↗ | |
| 4 | o4-mini | OpenAI | 81.6 | 来源 ↗ |
| 5 | Gemini 2.5 Flash | 79.7 | 来源 ↗ | |
| 6 | Gemini 2.5 Pro | 79.6 | 来源 ↗ | |
| 7 | Grok-3 | xAI | 78.0 | 来源 ↗ |
| 8 | o1 | OpenAI | 77.6 | 来源 ↗ |
| 9 | Gemini 2.0 Flash Thinking | 75.4 | 来源 ↗ | |
| 10 | GPT-4.5 | OpenAI | 75.2 | 来源 ↗ |
| 11 | Claude 3.7 Sonnet | Anthropic | 75.0 | 来源 ↗ |
| 12 | GPT-4.1 | OpenAI | 74.8 | 来源 ↗ |
| 13 | Claude Sonnet 4 | Anthropic | 74.4 | 来源 ↗ |
| 14 | Llama 4 Maverick | Meta | 73.4 | 来源 ↗ |
| 15 | Gemini 2.5 Flash-Lite | 72.9 | 来源 ↗ | |
| 16 | GPT-4.1 mini | OpenAI | 72.7 | 来源 ↗ |
| 17 | GPT-4o | OpenAI | 72.2 | 来源 ↗ |
| 18 | Gemini 2.0 Flash | 70.7 | 来源 ↗ | |
| 19 | QvQ-72B-Preview | Alibaba Cloud / Qwen Team | 70.3 | 来源 ↗ |
| 20 | Qwen2.5 VL 72B Instruct | Alibaba Cloud / Qwen Team | 70.2 | 来源 ↗ |
| 21 | Qwen2.5 VL 32B Instruct | Alibaba Cloud / Qwen Team | 70.0 | 来源 ↗ |
| 22 | Kimi-k1.5 | Moonshot AI | 70.0 | 来源 ↗ |
| 23 | Llama 4 Scout | Meta | 69.4 | 来源 ↗ |
| 24 | Claude 3.5 Sonnet | Anthropic | 68.3 | 来源 ↗ |
| 25 | Gemini 2.0 Flash-Lite | 68.0 | 来源 ↗ | |
| 26 | Grok-2 | xAI | 66.1 | 来源 ↗ |
| 27 | Gemini 1.5 Pro | 65.9 | 来源 ↗ | |
| 28 | Pixtral Large | Mistral AI | 64.0 | 来源 ↗ |
| 29 | Grok-2 mini | xAI | 63.2 | 来源 ↗ |
| 30 | Mistral Small 3.2 24B Instruct | Mistral AI | 62.5 | 来源 ↗ |
| 31 | Gemini 1.5 Flash | 62.3 | 来源 ↗ | |
| 32 | Nova Pro | Amazon | 61.7 | 来源 ↗ |
| 33 | Llama 3.2 90B Instruct | Meta | 60.3 | 来源 ↗ |
| 34 | GPT-4o mini | OpenAI | 59.4 | 来源 ↗ |
| 35 | Mistral Small 3.1 24B Instruct | Mistral AI | 59.3 | 来源 ↗ |
| 36 | Mistral Small 3.1 24B Base | Mistral AI | 59.3 | 来源 ↗ |
| 37 | Qwen2.5-Omni-7B | Alibaba Cloud / Qwen Team | 59.2 | 来源 ↗ |
| 38 | Qwen2.5 VL 7B Instruct | Alibaba Cloud / Qwen Team | 58.6 | 来源 ↗ |
| 39 | Nova Lite | Amazon | 56.2 | 来源 ↗ |
| 40 | GPT-4.1 nano | OpenAI | 55.4 | 来源 ↗ |
| 41 | Phi-4-multimodal-instruct | Microsoft | 55.1 | 来源 ↗ |
| 42 | Gemini 1.5 Flash 8B | 53.7 | 来源 ↗ | |
| 43 | Grok-1.5V | xAI | 53.6 | 来源 ↗ |
| 44 | Grok-1.5 | xAI | 53.6 | 来源 ↗ |
| 45 | Pixtral-12B | Mistral AI | 52.5 | 来源 ↗ |
| 46 | DeepSeek VL2 | DeepSeek | 51.1 | 来源 ↗ |
| 47 | Llama 3.2 11B Instruct | Meta | 50.7 | 来源 ↗ |
| 48 | DeepSeek VL2 Small | DeepSeek | 48.0 | 来源 ↗ |
| 49 | Gemini 1.0 Pro | 47.9 | 来源 ↗ | |
| 50 | Phi-3.5-vision-instruct | Microsoft | 43.0 | 来源 ↗ |
| 51 | DeepSeek VL2 Tiny | DeepSeek | 40.7 | 来源 ↗ |
| 52 | GPT-3.5 Turbo | OpenAI | 0.0 | 来源 ↗ |