Benchmark

OSWorld-Verified

general text
语言EN
满分1
参评模型11

模型排名

名次 模型 机构 分数 来源
1 Claude Fable 5 Anthropic 85.0 来源 ↗
2 Claude Opus 4.8 Anthropic 83.4 来源 ↗
3 Claude Sonnet 5 Anthropic 81.2 来源 ↗
4 Muse Spark 1.1 Meta 80.8 来源 ↗
5 GPT-5.5 OpenAI 78.7 来源 ↗
6 Claude Sonnet 4.6 Anthropic 78.5 来源 ↗
7 Gemini 3.5 Flash Google 78.4 来源 ↗
8 Claude Opus 4.7 Anthropic 78.0 来源 ↗
9 Gemini 3.1 Pro Preview Google 76.2 来源 ↗
10 GPT-5.4 OpenAI 75.0 来源 ↗
11 MiniMax-M3 MiniMax 70.1 来源 ↗