Benchmark
SWE-Bench Verified
reasoning
frontend_development
code
text
A verified subset of 500 software engineering problems from real GitHub issues, validated by human annotators for evaluating language models' ability to resolve real-world coding issues by generating patches for Python codebases.
语言EN
满分1
参评模型72
模型排名
| 名次 | 模型 | 机构 | 分数 | 来源 |
|---|---|---|---|---|
| 1 | Claude Fable 5 | Anthropic | 95.0 | 来源 ↗ |
| 2 | Claude Opus 4.8 | Anthropic | 88.6 | 来源 ↗ |
| 3 | Claude Sonnet 5 | Anthropic | 85.2 | 来源 ↗ |
| 4 | Ornith 1.0 397B | DeepReinforce | 82.4 | 来源 ↗ |
| 5 | DeepSeek V4 Pro | DeepSeek | 80.6 | 来源 ↗ |
| 6 | MiniMax-M3 | MiniMax | 80.5 | 来源 ↗ |
| 7 | Qwen3.7 Max | Alibaba Cloud / Qwen Team | 80.4 | 来源 ↗ |
| 8 | Kimi K2.6 | Moonshot AI | 80.2 | 来源 ↗ |
| 9 | MiniMax-M2.7 | MiniMax | 79.9 | 来源 ↗ |
| 10 | DeepSeek V4 Flash | DeepSeek | 79.0 | 来源 ↗ |
| 11 | MiMo-V2.5-Pro | Xiaomi | 78.9 | 来源 ↗ |
| 12 | Hy3 | Tencent | 78.0 | 来源 ↗ |
| 13 | Mistral Medium (latest) | Mistral AI | 77.6 | 来源 ↗ |
| 14 | Mistral Medium 3.5 | Mistral AI | 77.6 | 来源 ↗ |
| 15 | Qwen3.6 27B | Alibaba Cloud / Qwen Team | 77.2 | 来源 ↗ |
| 16 | Step 3.7 Flash | StepFun | 76.5 | 来源 ↗ |
| 17 | Qwen3.5 397B-A17B | Alibaba Cloud / Qwen Team | 76.4 | 来源 ↗ |
| 18 | MiniMax-M2.5 | MiniMax | 75.8 | 来源 ↗ |
| 19 | Ornith 1.0 35B | DeepReinforce | 75.6 | 来源 ↗ |
| 20 | GPT-5 | OpenAI | 74.9 | 来源 ↗ |
| 21 | GPT-5 Codex | OpenAI | 74.5 | 来源 ↗ |
| 22 | Claude Opus 4.1 | Anthropic | 74.5 | 来源 ↗ |
| 23 | Hy3 preview | Tencent | 74.4 | 来源 ↗ |
| 24 | Step 3.5 Flash | StepFun | 74.4 | 来源 ↗ |
| 25 | MiniMax-M2.1 | MiniMax | 74.0 | 来源 ↗ |
| 26 | GLM-4.7 | Zhipu AI | 73.8 | 来源 ↗ |
| 27 | Qwen3.6 35B-A3B | Alibaba Cloud / Qwen Team | 73.4 | 来源 ↗ |
| 28 | Claude Haiku 4.5 | Anthropic | 73.3 | 来源 ↗ |
| 29 | GLM-5 | Zhipu AI | 72.8 | 来源 ↗ |
| 30 | Claude Sonnet 4 | Anthropic | 72.7 | 来源 ↗ |
| 31 | Claude Opus 4 | Anthropic | 72.5 | 来源 ↗ |
| 32 | Qwen3.5 27B | Alibaba Cloud / Qwen Team | 72.4 | 来源 ↗ |
| 33 | Qwen3.5 122B-A10B | Alibaba Cloud / Qwen Team | 72.0 | 来源 ↗ |
| 34 | MAI-Code-1-Flash | Microsoft | 71.6 | 来源 ↗ |
| 35 | Kimi K2 Thinking | Moonshot AI | 71.3 | 来源 ↗ |
| 36 | Laguna XS 2.1 | Poolside | 70.9 | 来源 ↗ |
| 37 | Grok Code Fast 1 | xAI | 70.8 | 来源 ↗ |
| 38 | Kimi K2.5 | Moonshot AI | 70.8 | 来源 ↗ |
| 39 | Nemotron 3 Ultra 550B A55B | NVIDIA | 70.7 | 来源 ↗ |
| 40 | Claude 3.7 Sonnet | Anthropic | 70.3 | 来源 ↗ |
| 41 | MiniMax-M2 | MiniMax | 69.4 | 来源 ↗ |
| 42 | Ornith 1.0 9B | DeepReinforce | 69.4 | 来源 ↗ |
| 43 | o3 | OpenAI | 69.1 | 来源 ↗ |
| 44 | o4-mini | OpenAI | 68.1 | 来源 ↗ |
| 45 | GLM-4.6 | Zhipu AI | 68.0 | 来源 ↗ |
| 46 | DeepSeek-V3.2-Exp | DeepSeek | 67.8 | 来源 ↗ |
| 47 | North Mini Code | Cohere | 67.6 | 来源 ↗ |
| 48 | Gemini 2.5 Pro Preview 06-05 | 67.2 | 来源 ↗ | |
| 49 | DeepSeek-V3.1 | DeepSeek | 66.0 | 来源 ↗ |
| 50 | Kimi K2-Instruct-0905 | Moonshot AI | 65.8 | 来源 ↗ |
| 51 | GLM-4.5 | Zhipu AI | 64.2 | 来源 ↗ |
| 52 | Gemini 2.5 Pro | 63.2 | 来源 ↗ | |
| 53 | Devstral Medium | Mistral AI | 61.6 | 来源 ↗ |
| 54 | Gemini 2.5 Flash | 60.4 | 来源 ↗ | |
| 55 | GLM-4.7-Flash | Zhipu AI | 59.2 | 来源 ↗ |
| 56 | GLM-4.5-Air | Zhipu AI | 57.6 | 来源 ↗ |
| 57 | GPT-4.1 | OpenAI | 54.6 | 来源 ↗ |
| 58 | Devstral Small 1.1 | Mistral AI | 53.6 | 来源 ↗ |
| 59 | o3-mini | OpenAI | 49.3 | 来源 ↗ |
| 60 | Claude 3.5 Sonnet | Anthropic | 49.0 | 来源 ↗ |
| 61 | DeepSeek-R1-0528 | DeepSeek | 44.6 | 来源 ↗ |
| 62 | DeepSeek-V3 | DeepSeek | 42.0 | 来源 ↗ |
| 63 | o1-preview | OpenAI | 41.3 | 来源 ↗ |
| 64 | o1 | OpenAI | 41.0 | 来源 ↗ |
| 65 | Claude 3.5 Haiku | Anthropic | 40.6 | 来源 ↗ |
| 66 | GPT-4.5 | OpenAI | 38.0 | 来源 ↗ |
| 67 | GPT-4o | OpenAI | 33.2 | 来源 ↗ |
| 68 | Gemini 2.5 Flash-Lite | 31.6 | 来源 ↗ | |
| 69 | GPT-4.1 mini | OpenAI | 23.6 | 来源 ↗ |
| 70 | Gemini Diffusion | 22.9 | 来源 ↗ | |
| 71 | DeepSeek-V2.5 | DeepSeek | 16.8 | 来源 ↗ |
| 72 | GPT-4o mini | OpenAI | 8.7 | 来源 ↗ |