Benchmark

FrontierMath

math reasoning text

A benchmark of hundreds of original, exceptionally challenging mathematics problems crafted and vetted by expert mathematicians, covering most major branches of modern mathematics from number theory and real analysis to algebraic geometry and category theory.

语言EN
满分1
参评模型13

模型排名

名次 模型 机构 分数 来源
1 GPT-5.6 Sol OpenAI 89.0 来源 ↗
2 GPT-5.6 Terra OpenAI 84.9 来源 ↗
3 GPT-5.6 Luna OpenAI 78.6 来源 ↗
4 GPT-5.5 Pro OpenAI 52.4 来源 ↗
5 GPT-5.5 OpenAI 51.7 来源 ↗
6 GPT-5.4 Pro OpenAI 50.0 来源 ↗
7 GPT-5.4 OpenAI 47.6 来源 ↗
8 GPT-5 OpenAI 26.3 来源 ↗
9 GPT-5 mini OpenAI 22.1 来源 ↗
10 o3 OpenAI 15.8 来源 ↗
11 GPT-5 nano OpenAI 9.6 来源 ↗
12 o3-mini OpenAI 9.2 来源 ↗
13 o1 OpenAI 5.5 来源 ↗