Benchmark

MMLU-ProX

language reasoning math general text

Extended version of MMLU-Pro providing additional challenging multiple-choice questions for evaluating language models across diverse academic and professional domains. Built on the foundation of the Massive Multitask Language Understanding benchmark framework.

语言EN
满分1
参评模型8

模型排名

名次 模型 机构 分数 来源
1 Qwen3-235B-A22B-Thinking-2507 Alibaba Cloud / Qwen Team 81.0 来源 ↗
2 Qwen3-235B-A22B-Instruct-2507 Alibaba Cloud / Qwen Team 79.4 来源 ↗
3 Qwen3-Next-80B-A3B-Thinking Alibaba Cloud / Qwen Team 78.7 来源 ↗
4 Qwen3-Next-80B-A3B-Instruct Alibaba Cloud / Qwen Team 76.7 来源 ↗
5 Gemma 3n E4B Instructed Google 19.9 来源 ↗
6 Gemma 3n E4B Instructed LiteRT Preview Google 19.9 来源 ↗
7 Gemma 3n E2B Instructed Google 8.1 来源 ↗
8 Gemma 3n E2B Instructed LiteRT (Preview) Google 8.1 来源 ↗