Benchmark

SWE-Bench Pro

code text
语言EN
满分1
参评模型43

模型排名

名次 模型 机构 分数 来源
1 Claude Fable 5 Anthropic 80.3 来源 ↗
2 Fugu Ultra Sakana AI 73.7 来源 ↗
3 Claude Opus 4.8 Anthropic 69.2 来源 ↗
4 Grok 4.5 xAI 64.7 来源 ↗
5 GPT-5.6 Sol OpenAI 64.6 来源 ↗
6 Claude Opus 4.7 Anthropic 64.3 来源 ↗
7 GPT-5.6 Terra OpenAI 63.4 来源 ↗
8 Claude Sonnet 5 Anthropic 63.2 来源 ↗
9 GPT-5.6 Luna OpenAI 62.7 来源 ↗
10 Ornith 1.0 397B DeepReinforce 62.2 来源 ↗
11 GLM-5.2 Zhipu AI 62.1 来源 ↗
12 Muse Spark 1.1 Meta 61.5 来源 ↗
13 Qwen3.7 Max Alibaba Cloud / Qwen Team 60.6 来源 ↗
14 LongCat-2.0 Meituan 59.5 来源 ↗
15 GPT-5.4 OpenAI 59.1 来源 ↗
16 Fugu Sakana AI 59.0 来源 ↗
17 MiniMax-M3 MiniMax 59.0 来源 ↗
18 GPT-5.5 OpenAI 58.6 来源 ↗
19 MiMo-V2.5-Pro Xiaomi 57.2 来源 ↗
20 Step 3.7 Flash StepFun 56.3 来源 ↗
21 MiniMax-M2.7 MiniMax 56.2 来源 ↗
22 Gemini 3.5 Flash Google 55.1 来源 ↗
23 Gemini 3.1 Pro Preview Google 54.2 来源 ↗
24 Claude Opus 4.6 Anthropic 51.9 来源 ↗
25 MAI-Code-1-Flash Microsoft 51.2 来源 ↗
26 Ornith 1.0 35B DeepReinforce 50.4 来源 ↗
27 Laguna XS 2.1 Poolside 47.6 来源 ↗
28 Claude Opus 4.5 Anthropic 45.9 来源 ↗
29 Claude Sonnet 4.5 (latest) Anthropic 43.6 来源 ↗
30 Gemini 3 Pro Preview Google 43.3 来源 ↗
31 Ornith 1.0 9B DeepReinforce 42.9 来源 ↗
32 Claude Sonnet 4 (latest) Anthropic 42.7 来源 ↗
33 GPT-5.2 Codex OpenAI 41.0 来源 ↗
34 North Mini Code Cohere 40.2 来源 ↗
35 Qwen3-Coder 480B-A35B Instruct Alibaba Cloud / Qwen Team 38.7 来源 ↗
36 MiniMax-M2.1 MiniMax 36.8 来源 ↗
37 Gemini 3 Flash Preview Google 34.6 来源 ↗
38 GPT-5.2 OpenAI 29.9 来源 ↗
39 Kimi K2.6 Moonshot AI 27.3 来源 ↗
40 GLM-5.1 Zhipu AI 19.8 来源 ↗
41 DeepSeek V4 Pro DeepSeek 18.0 来源 ↗
42 Claude Sonnet 4.6 Anthropic 14.9 来源 ↗
43 Llama 4 Maverick 17B Instruct Meta 5.2 来源 ↗