Benchmark

MultiChallenge (o3-mini grader)

reasoning language text

A realistic multi-turn conversation evaluation benchmark that challenges frontier LLMs across four key areas: instruction retention, inference memory, reliable versioned editing, and self-coherence. Despite near-perfect scores on existing benchmarks, frontier models achieve less than 50% accuracy on MultiChallenge.

语言EN
满分1
参评模型7

模型排名

名次 模型 机构 分数 来源
1 GPT-5 OpenAI 69.6 来源 ↗
2 o3-mini OpenAI 50.2 来源 ↗
3 GPT-4.5 OpenAI 50.1 来源 ↗
4 GPT-4.1 OpenAI 46.2 来源 ↗
5 GPT-4.1 mini OpenAI 42.2 来源 ↗
6 GPT-4o OpenAI 39.9 来源 ↗
7 GPT-4.1 nano OpenAI 31.1 来源 ↗