Benchmark

Internal API instruction following (hard)

general text

Internal API instruction following (hard) benchmark - specific documentation not found in official sources

语言EN
满分1
参评模型7

模型排名

名次 模型 机构 分数 来源
1 GPT-5 OpenAI 64.0 来源 ↗
2 GPT-4.5 OpenAI 54.0 来源 ↗
3 o3-mini OpenAI 50.0 来源 ↗
4 GPT-4.1 OpenAI 49.1 来源 ↗
5 GPT-4.1 mini OpenAI 45.1 来源 ↗
6 GPT-4.1 nano OpenAI 31.6 来源 ↗
7 GPT-4o OpenAI 29.2 来源 ↗