Benchmark

Terminal-Bench Hard

code text
语言EN
满分1
参评模型11

模型排名

名次 模型 机构 分数 来源
1 Step 3.7 Flash StepFun 35.6 来源 ↗
2 Step 3.5 Flash 2603 StepFun 32.6 来源 ↗
3 Step 3.5 Flash StepFun 27.3 来源 ↗
4 Qwen3 Max Alibaba Cloud / Qwen Team 20.5 来源 ↗
5 Devstral 2 Mistral AI 18.9 来源 ↗
6 Mistral Small 4 Mistral AI 17.4 来源 ↗
7 Mistral Large 3 Mistral AI 15.9 来源 ↗
8 Qwen3-Coder 30B-A3B Instruct Alibaba Cloud / Qwen Team 15.2 来源 ↗
9 GPT-4o (2024-11-20) OpenAI 8.3 来源 ↗
10 Mistral Large 2.1 Mistral AI 6.1 来源 ↗
11 Mistral Medium 3 Mistral AI 3.8 来源 ↗