Benchmark
FrontierMath
math
reasoning
text
A benchmark of hundreds of original, exceptionally challenging mathematics problems crafted and vetted by expert mathematicians, covering most major branches of modern mathematics from number theory and real analysis to algebraic geometry and category theory.
语言EN
满分1
参评模型13
模型排名
| 名次 | 模型 | 机构 | 分数 | 来源 |
|---|---|---|---|---|
| 1 | GPT-5.6 Sol | OpenAI | 89.0 | 来源 ↗ |
| 2 | GPT-5.6 Terra | OpenAI | 84.9 | 来源 ↗ |
| 3 | GPT-5.6 Luna | OpenAI | 78.6 | 来源 ↗ |
| 4 | GPT-5.5 Pro | OpenAI | 52.4 | 来源 ↗ |
| 5 | GPT-5.5 | OpenAI | 51.7 | 来源 ↗ |
| 6 | GPT-5.4 Pro | OpenAI | 50.0 | 来源 ↗ |
| 7 | GPT-5.4 | OpenAI | 47.6 | 来源 ↗ |
| 8 | GPT-5 | OpenAI | 26.3 | 来源 ↗ |
| 9 | GPT-5 mini | OpenAI | 22.1 | 来源 ↗ |
| 10 | o3 | OpenAI | 15.8 | 来源 ↗ |
| 11 | GPT-5 nano | OpenAI | 9.6 | 来源 ↗ |
| 12 | o3-mini | OpenAI | 9.2 | 来源 ↗ |
| 13 | o1 | OpenAI | 5.5 | 来源 ↗ |