Benchmark
IFEval
general
text
Instruction-Following Evaluation (IFEval) benchmark for large language models, focusing on verifiable instructions with 25 types of instructions and around 500 prompts containing one or more verifiable constraints
语言EN
满分1
参评模型42
模型排名
| 名次 | 模型 | 机构 | 分数 | 来源 |
|---|---|---|---|---|
| 1 | o3-mini | OpenAI | 93.9 | 来源 ↗ |
| 2 | Claude 3.7 Sonnet | Anthropic | 93.2 | 来源 ↗ |
| 3 | Llama 3.3 70B Instruct | Meta | 92.1 | 来源 ↗ |
| 4 | Nova Pro | Amazon | 92.1 | 来源 ↗ |
| 5 | Gemma 3 27B | 90.4 | 来源 ↗ | |
| 6 | Nemotron Nano 9B v2 | NVIDIA | 90.3 | 来源 ↗ |
| 7 | Gemma 3 4B | 90.2 | 来源 ↗ | |
| 8 | LongCat-2.0 | Meituan | 90.0 | 来源 ↗ |
| 9 | Kimi K2 Instruct | Moonshot AI | 89.8 | 来源 ↗ |
| 10 | Kimi K2-Instruct-0905 | Moonshot AI | 89.8 | 来源 ↗ |
| 11 | Nova Lite | Amazon | 89.7 | 来源 ↗ |
| 12 | Llama 3.1 Nemotron Ultra 253B v1 | NVIDIA | 89.5 | 来源 ↗ |
| 13 | Qwen3-Next-80B-A3B-Thinking | Alibaba Cloud / Qwen Team | 88.9 | 来源 ↗ |
| 14 | Gemma 3 12B | 88.9 | 来源 ↗ | |
| 15 | Qwen3-235B-A22B-Instruct-2507 | Alibaba Cloud / Qwen Team | 88.7 | 来源 ↗ |
| 16 | Llama 3.1 405B Instruct | Meta | 88.6 | 来源 ↗ |
| 17 | GPT-4.5 | OpenAI | 88.2 | 来源 ↗ |
| 18 | Qwen3-235B-A22B-Thinking-2507 | Alibaba Cloud / Qwen Team | 87.8 | 来源 ↗ |
| 19 | Qwen3-Next-80B-A3B-Instruct | Alibaba Cloud / Qwen Team | 87.6 | 来源 ↗ |
| 20 | Llama 3.1 70B Instruct | Meta | 87.5 | 来源 ↗ |
| 21 | GPT-4.1 | OpenAI | 87.4 | 来源 ↗ |
| 22 | Kimi-k1.5 | Moonshot AI | 87.2 | 来源 ↗ |
| 23 | Nova Micro | Amazon | 87.2 | 来源 ↗ |
| 24 | DeepSeek-V3 | DeepSeek | 86.1 | 来源 ↗ |
| 25 | Phi 4 Reasoning Plus | Microsoft | 84.9 | 来源 ↗ |
| 26 | Qwen2.5 72B Instruct | Alibaba Cloud / Qwen Team | 84.1 | 来源 ↗ |
| 27 | GPT-4.1 mini | OpenAI | 84.1 | 来源 ↗ |
| 28 | QwQ-32B | Alibaba Cloud / Qwen Team | 83.9 | 来源 ↗ |
| 29 | Phi 4 Reasoning | Microsoft | 83.4 | 来源 ↗ |
| 30 | Mistral Small 3 24B Instruct | Mistral AI | 82.9 | 来源 ↗ |
| 31 | GPT-4o | OpenAI | 81.0 | 来源 ↗ |
| 32 | Llama 3.1 8B Instruct | Meta | 80.4 | 来源 ↗ |
| 33 | Gemma 3 1B | 80.2 | 来源 ↗ | |
| 34 | Llama 3.1 Nemotron Nano 8B V1 | NVIDIA | 79.3 | 来源 ↗ |
| 35 | Llama 3.2 3B Instruct | Meta | 77.4 | 来源 ↗ |
| 36 | Granite 3.3 8B Instruct | IBM | 74.8 | 来源 ↗ |
| 37 | Granite 3.3 8B Base | IBM | 74.8 | 来源 ↗ |
| 38 | GPT-4.1 nano | OpenAI | 74.5 | 来源 ↗ |
| 39 | Qwen2.5 7B Instruct | Alibaba Cloud / Qwen Team | 71.2 | 来源 ↗ |
| 40 | Phi 4 | Microsoft | 63.0 | 来源 ↗ |
| 41 | IBM Granite 4.0 Tiny Preview | IBM | 63.0 | 来源 ↗ |
| 42 | Pixtral-12B | Mistral AI | 61.3 | 来源 ↗ |