Benchmark
AIME 2024
math
reasoning
text
American Invitational Mathematics Examination 2024, consisting of 30 challenging mathematical reasoning problems from AIME I and AIME II competitions. Each problem requires an integer answer between 0-999 and tests advanced mathematical reasoning across algebra, geometry, combinatorics, and number theory. Used as a benchmark for evaluating mathematical reasoning capabilities in large language models at Olympiad-level difficulty.
语言EN
满分1
参评模型45
模型排名
| 名次 | 模型 | 机构 | 分数 | 来源 |
|---|---|---|---|---|
| 1 | Grok-3 Mini | xAI | 95.8 | 来源 ↗ |
| 2 | o4-mini | OpenAI | 93.4 | 来源 ↗ |
| 3 | Grok-3 | xAI | 93.3 | 来源 ↗ |
| 4 | Gemini 2.5 Pro | 92.0 | 来源 ↗ | |
| 5 | o3 | OpenAI | 91.6 | 来源 ↗ |
| 6 | DeepSeek-R1-0528 | DeepSeek | 91.4 | 来源 ↗ |
| 7 | GLM-4.5 | Zhipu AI | 91.0 | 来源 ↗ |
| 8 | GLM-4.5-Air | Zhipu AI | 89.4 | 来源 ↗ |
| 9 | Gemini 2.5 Flash | 88.0 | 来源 ↗ | |
| 10 | o3-mini | OpenAI | 87.3 | 来源 ↗ |
| 11 | DeepSeek R1 Zero | DeepSeek | 86.7 | 来源 ↗ |
| 12 | DeepSeek R1 Distill Llama 70B | DeepSeek | 86.7 | 来源 ↗ |
| 13 | o1-pro | OpenAI | 86.0 | 来源 ↗ |
| 14 | Qwen3 235B A22B | Alibaba Cloud / Qwen Team | 85.7 | 来源 ↗ |
| 15 | DeepSeek R1 Distill Qwen 7B | DeepSeek | 83.3 | 来源 ↗ |
| 16 | DeepSeek R1 Distill Qwen 32B | DeepSeek | 83.3 | 来源 ↗ |
| 17 | Qwen3 32B | Alibaba Cloud / Qwen Team | 81.4 | 来源 ↗ |
| 18 | Phi 4 Reasoning Plus | Microsoft | 81.3 | 来源 ↗ |
| 19 | Granite 3.3 8B Instruct | IBM | 81.2 | 来源 ↗ |
| 20 | Granite 3.3 8B Base | IBM | 81.2 | 来源 ↗ |
| 21 | Qwen3 30B A3B | Alibaba Cloud / Qwen Team | 80.4 | 来源 ↗ |
| 22 | DeepSeek R1 Distill Llama 8B | DeepSeek | 80.0 | 来源 ↗ |
| 23 | DeepSeek R1 Distill Qwen 14B | DeepSeek | 80.0 | 来源 ↗ |
| 24 | Claude 3.7 Sonnet | Anthropic | 80.0 | 来源 ↗ |
| 25 | QwQ-32B | Alibaba Cloud / Qwen Team | 79.5 | 来源 ↗ |
| 26 | Kimi-k1.5 | Moonshot AI | 77.5 | 来源 ↗ |
| 27 | Phi 4 Reasoning | Microsoft | 75.3 | 来源 ↗ |
| 28 | o1 | OpenAI | 74.3 | 来源 ↗ |
| 29 | Magistral Medium | Mistral AI | 73.6 | 来源 ↗ |
| 30 | Gemini 2.0 Flash Thinking | 73.3 | 来源 ↗ | |
| 31 | Kimi K2 0905 | Moonshot AI | 72.0 | 来源 ↗ |
| 32 | Magistral Small 2506 | Mistral AI | 70.7 | 来源 ↗ |
| 33 | Kimi K2 Instruct | Moonshot AI | 69.6 | 来源 ↗ |
| 34 | Kimi K2-Instruct-0905 | Moonshot AI | 69.6 | 来源 ↗ |
| 35 | DeepSeek-V3.1 | DeepSeek | 66.3 | 来源 ↗ |
| 36 | DeepSeek-V3 0324 | DeepSeek | 59.4 | 来源 ↗ |
| 37 | DeepSeek R1 Distill Qwen 1.5B | DeepSeek | 52.7 | 来源 ↗ |
| 38 | QwQ-32B-Preview | Alibaba Cloud / Qwen Team | 50.0 | 来源 ↗ |
| 39 | GPT-4.1 mini | OpenAI | 49.6 | 来源 ↗ |
| 40 | GPT-4.1 | OpenAI | 48.1 | 来源 ↗ |
| 41 | o1-preview | OpenAI | 42.0 | 来源 ↗ |
| 42 | DeepSeek-V3 | DeepSeek | 39.2 | 来源 ↗ |
| 43 | GPT-4.5 | OpenAI | 36.7 | 来源 ↗ |
| 44 | GPT-4.1 nano | OpenAI | 29.4 | 来源 ↗ |
| 45 | GPT-4o | OpenAI | 13.1 | 来源 ↗ |