Benchmark

MMMLU

language reasoning math general text 多语言

Multilingual Massive Multitask Language Understanding dataset released by OpenAI, featuring professionally translated MMLU test questions across 14 languages including Arabic, Bengali, German, Spanish, French, Hindi, Indonesian, Italian, Japanese, Korean, Portuguese, Swahili, Yoruba, and Chinese. Contains approximately 15,908 multiple-choice questions per language covering 57 subjects.

语言EN
满分1
参评模型15

模型排名

名次 模型 机构 分数 来源
1 Claude Opus 4.1 Anthropic 89.5 来源 ↗
2 Claude Sonnet 4.5 Anthropic 89.1 来源 ↗
3 Claude Opus 4 Anthropic 88.8 来源 ↗
4 o1 OpenAI 87.7 来源 ↗
5 GPT-4.1 OpenAI 87.3 来源 ↗
6 Qwen3 235B A22B Alibaba Cloud / Qwen Team 86.7 来源 ↗
7 Claude Sonnet 4 Anthropic 86.5 来源 ↗
8 Claude 3.7 Sonnet Anthropic 86.1 来源 ↗
9 GPT-4.5 OpenAI 85.1 来源 ↗
10 Claude Haiku 4.5 Anthropic 83.0 来源 ↗
11 GPT-4o OpenAI 81.4 来源 ↗
12 GPT-4.1 mini OpenAI 78.5 来源 ↗
13 Phi-3.5-MoE-instruct Microsoft 69.9 来源 ↗
14 GPT-4.1 nano OpenAI 66.9 来源 ↗
15 Phi-3.5-mini-instruct Microsoft 55.4 来源 ↗