Benchmark
Multi-IF
reasoning
communication
language
text
多语言
Multi-IF benchmarks LLMs on multi-turn and multilingual instruction following. It expands upon IFEval by incorporating multi-turn sequences and translating English prompts into 7 other languages, resulting in 4,501 multilingual conversations with three turns each. The benchmark reveals that current leading LLMs struggle with maintaining accuracy in multi-turn instructions and shows higher error rates for non-Latin script languages.
语言EN
满分1
参评模型11
模型排名
| 名次 | 模型 | 机构 | 分数 | 来源 |
|---|---|---|---|---|
| 1 | Qwen3-235B-A22B-Thinking-2507 | Alibaba Cloud / Qwen Team | 80.6 | 来源 ↗ |
| 2 | o3-mini | OpenAI | 79.5 | 来源 ↗ |
| 3 | Qwen3-Next-80B-A3B-Thinking | Alibaba Cloud / Qwen Team | 77.8 | 来源 ↗ |
| 4 | Qwen3-235B-A22B-Instruct-2507 | Alibaba Cloud / Qwen Team | 77.5 | 来源 ↗ |
| 5 | Qwen3-Next-80B-A3B-Instruct | Alibaba Cloud / Qwen Team | 75.8 | 来源 ↗ |
| 6 | Qwen3 30B A3B | Alibaba Cloud / Qwen Team | 72.2 | 来源 ↗ |
| 7 | GPT-4.1 | OpenAI | 70.8 | 来源 ↗ |
| 8 | GPT-4.5 | OpenAI | 70.8 | 来源 ↗ |
| 9 | GPT-4.1 mini | OpenAI | 67.0 | 来源 ↗ |
| 10 | GPT-4o | OpenAI | 60.9 | 来源 ↗ |
| 11 | GPT-4.1 nano | OpenAI | 57.2 | 来源 ↗ |