Benchmark
Humanity’s Last Exam
general
text
语言EN
满分1
参评模型16
模型排名
| 名次 | 模型 | 机构 | 分数 | 来源 |
|---|---|---|---|---|
| 1 | Claude Fable 5 | Anthropic | 64.5 | 来源 ↗ |
| 2 | Muse Spark 1.1 | Meta | 62.1 | 来源 ↗ |
| 3 | GPT-5.4 Pro | OpenAI | 58.7 | 来源 ↗ |
| 4 | Claude Opus 4.8 | Anthropic | 57.9 | 来源 ↗ |
| 5 | GPT-5.5 Pro | OpenAI | 57.2 | 来源 ↗ |
| 6 | Claude Opus 4.7 | Anthropic | 54.7 | 来源 ↗ |
| 7 | GPT-5.5 | OpenAI | 52.2 | 来源 ↗ |
| 8 | GPT-5.4 | OpenAI | 52.1 | 来源 ↗ |
| 9 | Fugu Ultra | Sakana AI | 50.0 | 来源 ↗ |
| 10 | Fugu | Sakana AI | 47.2 | 来源 ↗ |
| 11 | Step 3.7 Flash | StepFun | 47.2 | 来源 ↗ |
| 12 | Claude Sonnet 4.6 | Anthropic | 46.8 | 来源 ↗ |
| 13 | Gemini 3.1 Pro Preview | 44.4 | 来源 ↗ | |
| 14 | Qwen3.7 Max | Alibaba Cloud / Qwen Team | 41.4 | 来源 ↗ |
| 15 | Gemini 3.5 Flash | 40.2 | 来源 ↗ | |
| 16 | Nemotron 3 Ultra 550B A55B | NVIDIA | 37.4 | 来源 ↗ |