Benchmark
Terminal-Bench
reasoning
code
text
Terminal-Bench is a benchmark for testing AI agents in real terminal environments. It evaluates how well agents can handle real-world, end-to-end tasks autonomously, including compiling code, training models, setting up servers, system administration, security tasks, data science workflows, and cybersecurity vulnerabilities. The benchmark consists of a dataset of ~100 hand-crafted, human-verified tasks and an execution harness that connects language models to a terminal sandbox.
语言EN
满分1
参评模型41
模型排名
| 名次 | 模型 | 机构 | 分数 | 来源 |
|---|---|---|---|---|
| 1 | GPT-5.6 Sol | OpenAI | 88.8 | 来源 ↗ |
| 2 | Claude Fable 5 | Anthropic | 88.0 | 来源 ↗ |
| 3 | GPT-5.6 Terra | OpenAI | 87.4 | 来源 ↗ |
| 4 | GPT-5.6 Luna | OpenAI | 84.7 | 来源 ↗ |
| 5 | GPT-5.5 | OpenAI | 84.1 | 来源 ↗ |
| 6 | Grok 4.5 | xAI | 83.3 | 来源 ↗ |
| 7 | GLM-5.2 | Zhipu AI | 82.7 | 来源 ↗ |
| 8 | Claude Sonnet 5 | Anthropic | 80.4 | 来源 ↗ |
| 9 | Muse Spark 1.1 | Meta | 80.0 | 来源 ↗ |
| 10 | Gemini 3.5 Flash | 76.2 | 来源 ↗ | |
| 11 | GPT-5.4 | OpenAI | 75.1 | 来源 ↗ |
| 12 | Claude Opus 4.8 | Anthropic | 74.6 | 来源 ↗ |
| 13 | Claude Opus 4.7 | Anthropic | 73.8 | 来源 ↗ |
| 14 | LongCat-2.0 | Meituan | 70.8 | 来源 ↗ |
| 15 | Gemini 3.1 Pro Preview | 70.3 | 来源 ↗ | |
| 16 | Claude Opus 4.6 | Anthropic | 70.2 | 来源 ↗ |
| 17 | Qwen3.7 Max | Alibaba Cloud / Qwen Team | 69.7 | 来源 ↗ |
| 18 | Claude Sonnet 4.6 | Anthropic | 67.0 | 来源 ↗ |
| 19 | MiniMax-M3 | MiniMax | 66.0 | 来源 ↗ |
| 20 | GLM-5.1 | Zhipu AI | 65.1 | 来源 ↗ |
| 21 | DeepSeek V4 Pro | DeepSeek | 64.7 | 来源 ↗ |
| 22 | Kimi K2.6 | Moonshot AI | 64.3 | 来源 ↗ |
| 23 | Step 3.7 Flash | StepFun | 59.6 | 来源 ↗ |
| 24 | Nemotron 3 Ultra 550B A55B | NVIDIA | 56.4 | 来源 ↗ |
| 25 | MAI-Code-1-Flash | Microsoft | 54.8 | 来源 ↗ |
| 26 | MiniMax-M2.7 | MiniMax | 51.1 | 来源 ↗ |
| 27 | Claude Sonnet 4.5 | Anthropic | 50.0 | 来源 ↗ |
| 28 | Claude Opus 4.1 | Anthropic | 43.3 | 来源 ↗ |
| 29 | Claude Haiku 4.5 | Anthropic | 41.0 | 来源 ↗ |
| 30 | GLM-4.6 | Zhipu AI | 40.5 | 来源 ↗ |
| 31 | Claude Opus 4 | Anthropic | 39.2 | 来源 ↗ |
| 32 | DeepSeek-V3.2-Exp | DeepSeek | 37.7 | 来源 ↗ |
| 33 | GLM-4.5 | Zhipu AI | 37.5 | 来源 ↗ |
| 34 | Laguna XS 2.1 | Poolside | 37.5 | 来源 ↗ |
| 35 | Claude Sonnet 4 | Anthropic | 35.5 | 来源 ↗ |
| 36 | Claude 3.7 Sonnet | Anthropic | 35.2 | 来源 ↗ |
| 37 | DeepSeek-V3.1 | DeepSeek | 31.3 | 来源 ↗ |
| 38 | GLM-4.5-Air | Zhipu AI | 30.0 | 来源 ↗ |
| 39 | Kimi K2 Instruct | Moonshot AI | 30.0 | 来源 ↗ |
| 40 | Kimi K2-Instruct-0905 | Moonshot AI | 25.0 | 来源 ↗ |
| 41 | DeepSeek-R1-0528 | DeepSeek | 5.7 | 来源 ↗ |