Benchmark
Humanity’s Last Exam
general
multimodal
A multi-modal benchmark at the frontier of human knowledge with 2,500 questions across dozens of subjects including mathematics, humanities, and natural sciences, created by nearly 1000 subject expert contributors from over 500 institutions
语言EN
满分1
参评模型22
模型排名
| 名次 | 模型 | 机构 | 分数 | 来源 |
|---|---|---|---|---|
| 1 | Grok-4 Heavy | xAI | 50.7 | 来源 ↗ |
| 2 | Grok-4 | xAI | 40.0 | 来源 ↗ |
| 3 | GPT-5 | OpenAI | 24.8 | 来源 ↗ |
| 4 | o3 | OpenAI | 24.3 | 来源 ↗ |
| 5 | Gemini 2.5 Pro Preview 06-05 | 21.6 | 来源 ↗ | |
| 6 | DeepSeek-V3.2-Exp | DeepSeek | 19.8 | 来源 ↗ |
| 7 | GPT OSS 120B | OpenAI | 19.0 | 来源 ↗ |
| 8 | Qwen3-235B-A22B-Thinking-2507 | Alibaba Cloud / Qwen Team | 18.2 | 来源 ↗ |
| 9 | Gemini 2.5 Pro | 17.8 | 来源 ↗ | |
| 10 | DeepSeek-R1-0528 | DeepSeek | 17.7 | 来源 ↗ |
| 11 | GPT OSS 20B | OpenAI | 17.3 | 来源 ↗ |
| 12 | GPT-5 mini | OpenAI | 16.7 | 来源 ↗ |
| 13 | DeepSeek-V3.1 | DeepSeek | 15.9 | 来源 ↗ |
| 14 | o4-mini | OpenAI | 14.7 | 来源 ↗ |
| 15 | Gemini 2.5 Flash | 11.0 | 来源 ↗ | |
| 16 | Magistral Medium | Mistral AI | 9.0 | 来源 ↗ |
| 17 | GPT-5 nano | OpenAI | 8.7 | 来源 ↗ |
| 18 | GPT-4.1 | OpenAI | 5.4 | 来源 ↗ |
| 19 | GPT-4o | OpenAI | 5.3 | 来源 ↗ |
| 20 | Gemini 2.5 Flash-Lite | 5.1 | 来源 ↗ | |
| 21 | Kimi K2 Instruct | Moonshot AI | 4.7 | 来源 ↗ |
| 22 | GPT-4.1 mini | OpenAI | 3.7 | 来源 ↗ |