Benchmark

Humanity’s Last Exam

general multimodal

A multi-modal benchmark at the frontier of human knowledge with 2,500 questions across dozens of subjects including mathematics, humanities, and natural sciences, created by nearly 1000 subject expert contributors from over 500 institutions

语言EN
满分1
参评模型22

模型排名

名次 模型 机构 分数 来源
1 Grok-4 Heavy xAI 50.7 来源 ↗
2 Grok-4 xAI 40.0 来源 ↗
3 GPT-5 OpenAI 24.8 来源 ↗
4 o3 OpenAI 24.3 来源 ↗
5 Gemini 2.5 Pro Preview 06-05 Google 21.6 来源 ↗
6 DeepSeek-V3.2-Exp DeepSeek 19.8 来源 ↗
7 GPT OSS 120B OpenAI 19.0 来源 ↗
8 Qwen3-235B-A22B-Thinking-2507 Alibaba Cloud / Qwen Team 18.2 来源 ↗
9 Gemini 2.5 Pro Google 17.8 来源 ↗
10 DeepSeek-R1-0528 DeepSeek 17.7 来源 ↗
11 GPT OSS 20B OpenAI 17.3 来源 ↗
12 GPT-5 mini OpenAI 16.7 来源 ↗
13 DeepSeek-V3.1 DeepSeek 15.9 来源 ↗
14 o4-mini OpenAI 14.7 来源 ↗
15 Gemini 2.5 Flash Google 11.0 来源 ↗
16 Magistral Medium Mistral AI 9.0 来源 ↗
17 GPT-5 nano OpenAI 8.7 来源 ↗
18 GPT-4.1 OpenAI 5.4 来源 ↗
19 GPT-4o OpenAI 5.3 来源 ↗
20 Gemini 2.5 Flash-Lite Google 5.1 来源 ↗
21 Kimi K2 Instruct Moonshot AI 4.7 来源 ↗
22 GPT-4.1 mini OpenAI 3.7 来源 ↗