Benchmark

Multi-IF

reasoning communication language text 多语言

Multi-IF benchmarks LLMs on multi-turn and multilingual instruction following. It expands upon IFEval by incorporating multi-turn sequences and translating English prompts into 7 other languages, resulting in 4,501 multilingual conversations with three turns each. The benchmark reveals that current leading LLMs struggle with maintaining accuracy in multi-turn instructions and shows higher error rates for non-Latin script languages.

语言EN
满分1
参评模型11

模型排名

名次 模型 机构 分数 来源
1 Qwen3-235B-A22B-Thinking-2507 Alibaba Cloud / Qwen Team 80.6 来源 ↗
2 o3-mini OpenAI 79.5 来源 ↗
3 Qwen3-Next-80B-A3B-Thinking Alibaba Cloud / Qwen Team 77.8 来源 ↗
4 Qwen3-235B-A22B-Instruct-2507 Alibaba Cloud / Qwen Team 77.5 来源 ↗
5 Qwen3-Next-80B-A3B-Instruct Alibaba Cloud / Qwen Team 75.8 来源 ↗
6 Qwen3 30B A3B Alibaba Cloud / Qwen Team 72.2 来源 ↗
7 GPT-4.1 OpenAI 70.8 来源 ↗
8 GPT-4.5 OpenAI 70.8 来源 ↗
9 GPT-4.1 mini OpenAI 67.0 来源 ↗
10 GPT-4o OpenAI 60.9 来源 ↗
11 GPT-4.1 nano OpenAI 57.2 来源 ↗