Benchmark
MMMLU
language
reasoning
math
general
text
多语言
Multilingual Massive Multitask Language Understanding dataset released by OpenAI, featuring professionally translated MMLU test questions across 14 languages including Arabic, Bengali, German, Spanish, French, Hindi, Indonesian, Italian, Japanese, Korean, Portuguese, Swahili, Yoruba, and Chinese. Contains approximately 15,908 multiple-choice questions per language covering 57 subjects.
语言EN
满分1
参评模型15
模型排名
| 名次 | 模型 | 机构 | 分数 | 来源 |
|---|---|---|---|---|
| 1 | Claude Opus 4.1 | Anthropic | 89.5 | 来源 ↗ |
| 2 | Claude Sonnet 4.5 | Anthropic | 89.1 | 来源 ↗ |
| 3 | Claude Opus 4 | Anthropic | 88.8 | 来源 ↗ |
| 4 | o1 | OpenAI | 87.7 | 来源 ↗ |
| 5 | GPT-4.1 | OpenAI | 87.3 | 来源 ↗ |
| 6 | Qwen3 235B A22B | Alibaba Cloud / Qwen Team | 86.7 | 来源 ↗ |
| 7 | Claude Sonnet 4 | Anthropic | 86.5 | 来源 ↗ |
| 8 | Claude 3.7 Sonnet | Anthropic | 86.1 | 来源 ↗ |
| 9 | GPT-4.5 | OpenAI | 85.1 | 来源 ↗ |
| 10 | Claude Haiku 4.5 | Anthropic | 83.0 | 来源 ↗ |
| 11 | GPT-4o | OpenAI | 81.4 | 来源 ↗ |
| 12 | GPT-4.1 mini | OpenAI | 78.5 | 来源 ↗ |
| 13 | Phi-3.5-MoE-instruct | Microsoft | 69.9 | 来源 ↗ |
| 14 | GPT-4.1 nano | OpenAI | 66.9 | 来源 ↗ |
| 15 | Phi-3.5-mini-instruct | Microsoft | 55.4 | 来源 ↗ |