Benchmark

AIME 2024

math reasoning text

American Invitational Mathematics Examination 2024, consisting of 30 challenging mathematical reasoning problems from AIME I and AIME II competitions. Each problem requires an integer answer between 0-999 and tests advanced mathematical reasoning across algebra, geometry, combinatorics, and number theory. Used as a benchmark for evaluating mathematical reasoning capabilities in large language models at Olympiad-level difficulty.

语言EN
满分1
参评模型45

模型排名

名次 模型 机构 分数 来源
1 Grok-3 Mini xAI 95.8 来源 ↗
2 o4-mini OpenAI 93.4 来源 ↗
3 Grok-3 xAI 93.3 来源 ↗
4 Gemini 2.5 Pro Google 92.0 来源 ↗
5 o3 OpenAI 91.6 来源 ↗
6 DeepSeek-R1-0528 DeepSeek 91.4 来源 ↗
7 GLM-4.5 Zhipu AI 91.0 来源 ↗
8 GLM-4.5-Air Zhipu AI 89.4 来源 ↗
9 Gemini 2.5 Flash Google 88.0 来源 ↗
10 o3-mini OpenAI 87.3 来源 ↗
11 DeepSeek R1 Zero DeepSeek 86.7 来源 ↗
12 DeepSeek R1 Distill Llama 70B DeepSeek 86.7 来源 ↗
13 o1-pro OpenAI 86.0 来源 ↗
14 Qwen3 235B A22B Alibaba Cloud / Qwen Team 85.7 来源 ↗
15 DeepSeek R1 Distill Qwen 7B DeepSeek 83.3 来源 ↗
16 DeepSeek R1 Distill Qwen 32B DeepSeek 83.3 来源 ↗
17 Qwen3 32B Alibaba Cloud / Qwen Team 81.4 来源 ↗
18 Phi 4 Reasoning Plus Microsoft 81.3 来源 ↗
19 Granite 3.3 8B Instruct IBM 81.2 来源 ↗
20 Granite 3.3 8B Base IBM 81.2 来源 ↗
21 Qwen3 30B A3B Alibaba Cloud / Qwen Team 80.4 来源 ↗
22 DeepSeek R1 Distill Llama 8B DeepSeek 80.0 来源 ↗
23 DeepSeek R1 Distill Qwen 14B DeepSeek 80.0 来源 ↗
24 Claude 3.7 Sonnet Anthropic 80.0 来源 ↗
25 QwQ-32B Alibaba Cloud / Qwen Team 79.5 来源 ↗
26 Kimi-k1.5 Moonshot AI 77.5 来源 ↗
27 Phi 4 Reasoning Microsoft 75.3 来源 ↗
28 o1 OpenAI 74.3 来源 ↗
29 Magistral Medium Mistral AI 73.6 来源 ↗
30 Gemini 2.0 Flash Thinking Google 73.3 来源 ↗
31 Kimi K2 0905 Moonshot AI 72.0 来源 ↗
32 Magistral Small 2506 Mistral AI 70.7 来源 ↗
33 Kimi K2 Instruct Moonshot AI 69.6 来源 ↗
34 Kimi K2-Instruct-0905 Moonshot AI 69.6 来源 ↗
35 DeepSeek-V3.1 DeepSeek 66.3 来源 ↗
36 DeepSeek-V3 0324 DeepSeek 59.4 来源 ↗
37 DeepSeek R1 Distill Qwen 1.5B DeepSeek 52.7 来源 ↗
38 QwQ-32B-Preview Alibaba Cloud / Qwen Team 50.0 来源 ↗
39 GPT-4.1 mini OpenAI 49.6 来源 ↗
40 GPT-4.1 OpenAI 48.1 来源 ↗
41 o1-preview OpenAI 42.0 来源 ↗
42 DeepSeek-V3 DeepSeek 39.2 来源 ↗
43 GPT-4.5 OpenAI 36.7 来源 ↗
44 GPT-4.1 nano OpenAI 29.4 来源 ↗
45 GPT-4o OpenAI 13.1 来源 ↗