Benchmark
MMLU-Redux
language
reasoning
math
general
text
An improved version of the MMLU benchmark featuring manually re-annotated questions to identify and correct errors in the original dataset. Provides more reliable evaluation metrics for language models by addressing dataset quality issues found in the original MMLU.
语言EN
满分1
参评模型17
模型排名
| 名次 | 模型 | 机构 | 分数 | 来源 |
|---|---|---|---|---|
| 1 | Qwen3-235B-A22B-Thinking-2507 | Alibaba Cloud / Qwen Team | 93.8 | 来源 ↗ |
| 2 | DeepSeek-R1-0528 | DeepSeek | 93.4 | 来源 ↗ |
| 3 | Qwen3-235B-A22B-Instruct-2507 | Alibaba Cloud / Qwen Team | 93.1 | 来源 ↗ |
| 4 | Kimi K2-Instruct-0905 | Moonshot AI | 92.7 | 来源 ↗ |
| 5 | Kimi K2 Instruct | Moonshot AI | 92.7 | 来源 ↗ |
| 6 | Qwen3-Next-80B-A3B-Thinking | Alibaba Cloud / Qwen Team | 92.5 | 来源 ↗ |
| 7 | DeepSeek-V3.1 | DeepSeek | 91.8 | 来源 ↗ |
| 8 | Qwen3-Next-80B-A3B-Instruct | Alibaba Cloud / Qwen Team | 90.9 | 来源 ↗ |
| 9 | DeepSeek-V3 | DeepSeek | 89.1 | 来源 ↗ |
| 10 | Qwen3 235B A22B | Alibaba Cloud / Qwen Team | 87.4 | 来源 ↗ |
| 11 | Qwen2.5 72B Instruct | Alibaba Cloud / Qwen Team | 86.8 | 来源 ↗ |
| 12 | Qwen2.5 32B Instruct | Alibaba Cloud / Qwen Team | 83.9 | 来源 ↗ |
| 13 | Qwen2.5 14B Instruct | Alibaba Cloud / Qwen Team | 80.0 | 来源 ↗ |
| 14 | Qwen2.5-Coder 32B Instruct | Alibaba Cloud / Qwen Team | 77.5 | 来源 ↗ |
| 15 | Qwen2.5 7B Instruct | Alibaba Cloud / Qwen Team | 75.4 | 来源 ↗ |
| 16 | Qwen2.5-Omni-7B | Alibaba Cloud / Qwen Team | 71.0 | 来源 ↗ |
| 17 | Qwen2.5-Coder 7B Instruct | Alibaba Cloud / Qwen Team | 66.6 | 来源 ↗ |