Benchmark

MMLU-Redux

language reasoning math general text

An improved version of the MMLU benchmark featuring manually re-annotated questions to identify and correct errors in the original dataset. Provides more reliable evaluation metrics for language models by addressing dataset quality issues found in the original MMLU.

语言EN
满分1
参评模型17

模型排名

名次 模型 机构 分数 来源
1 Qwen3-235B-A22B-Thinking-2507 Alibaba Cloud / Qwen Team 93.8 来源 ↗
2 DeepSeek-R1-0528 DeepSeek 93.4 来源 ↗
3 Qwen3-235B-A22B-Instruct-2507 Alibaba Cloud / Qwen Team 93.1 来源 ↗
4 Kimi K2-Instruct-0905 Moonshot AI 92.7 来源 ↗
5 Kimi K2 Instruct Moonshot AI 92.7 来源 ↗
6 Qwen3-Next-80B-A3B-Thinking Alibaba Cloud / Qwen Team 92.5 来源 ↗
7 DeepSeek-V3.1 DeepSeek 91.8 来源 ↗
8 Qwen3-Next-80B-A3B-Instruct Alibaba Cloud / Qwen Team 90.9 来源 ↗
9 DeepSeek-V3 DeepSeek 89.1 来源 ↗
10 Qwen3 235B A22B Alibaba Cloud / Qwen Team 87.4 来源 ↗
11 Qwen2.5 72B Instruct Alibaba Cloud / Qwen Team 86.8 来源 ↗
12 Qwen2.5 32B Instruct Alibaba Cloud / Qwen Team 83.9 来源 ↗
13 Qwen2.5 14B Instruct Alibaba Cloud / Qwen Team 80.0 来源 ↗
14 Qwen2.5-Coder 32B Instruct Alibaba Cloud / Qwen Team 77.5 来源 ↗
15 Qwen2.5 7B Instruct Alibaba Cloud / Qwen Team 75.4 来源 ↗
16 Qwen2.5-Omni-7B Alibaba Cloud / Qwen Team 71.0 来源 ↗
17 Qwen2.5-Coder 7B Instruct Alibaba Cloud / Qwen Team 66.6 来源 ↗