Benchmark

IFEval

general text

Instruction-Following Evaluation (IFEval) benchmark for large language models, focusing on verifiable instructions with 25 types of instructions and around 500 prompts containing one or more verifiable constraints

语言EN
满分1
参评模型42

模型排名

名次 模型 机构 分数 来源
1 o3-mini OpenAI 93.9 来源 ↗
2 Claude 3.7 Sonnet Anthropic 93.2 来源 ↗
3 Llama 3.3 70B Instruct Meta 92.1 来源 ↗
4 Nova Pro Amazon 92.1 来源 ↗
5 Gemma 3 27B Google 90.4 来源 ↗
6 Nemotron Nano 9B v2 NVIDIA 90.3 来源 ↗
7 Gemma 3 4B Google 90.2 来源 ↗
8 LongCat-2.0 Meituan 90.0 来源 ↗
9 Kimi K2 Instruct Moonshot AI 89.8 来源 ↗
10 Kimi K2-Instruct-0905 Moonshot AI 89.8 来源 ↗
11 Nova Lite Amazon 89.7 来源 ↗
12 Llama 3.1 Nemotron Ultra 253B v1 NVIDIA 89.5 来源 ↗
13 Qwen3-Next-80B-A3B-Thinking Alibaba Cloud / Qwen Team 88.9 来源 ↗
14 Gemma 3 12B Google 88.9 来源 ↗
15 Qwen3-235B-A22B-Instruct-2507 Alibaba Cloud / Qwen Team 88.7 来源 ↗
16 Llama 3.1 405B Instruct Meta 88.6 来源 ↗
17 GPT-4.5 OpenAI 88.2 来源 ↗
18 Qwen3-235B-A22B-Thinking-2507 Alibaba Cloud / Qwen Team 87.8 来源 ↗
19 Qwen3-Next-80B-A3B-Instruct Alibaba Cloud / Qwen Team 87.6 来源 ↗
20 Llama 3.1 70B Instruct Meta 87.5 来源 ↗
21 GPT-4.1 OpenAI 87.4 来源 ↗
22 Kimi-k1.5 Moonshot AI 87.2 来源 ↗
23 Nova Micro Amazon 87.2 来源 ↗
24 DeepSeek-V3 DeepSeek 86.1 来源 ↗
25 Phi 4 Reasoning Plus Microsoft 84.9 来源 ↗
26 Qwen2.5 72B Instruct Alibaba Cloud / Qwen Team 84.1 来源 ↗
27 GPT-4.1 mini OpenAI 84.1 来源 ↗
28 QwQ-32B Alibaba Cloud / Qwen Team 83.9 来源 ↗
29 Phi 4 Reasoning Microsoft 83.4 来源 ↗
30 Mistral Small 3 24B Instruct Mistral AI 82.9 来源 ↗
31 GPT-4o OpenAI 81.0 来源 ↗
32 Llama 3.1 8B Instruct Meta 80.4 来源 ↗
33 Gemma 3 1B Google 80.2 来源 ↗
34 Llama 3.1 Nemotron Nano 8B V1 NVIDIA 79.3 来源 ↗
35 Llama 3.2 3B Instruct Meta 77.4 来源 ↗
36 Granite 3.3 8B Instruct IBM 74.8 来源 ↗
37 Granite 3.3 8B Base IBM 74.8 来源 ↗
38 GPT-4.1 nano OpenAI 74.5 来源 ↗
39 Qwen2.5 7B Instruct Alibaba Cloud / Qwen Team 71.2 来源 ↗
40 Phi 4 Microsoft 63.0 来源 ↗
41 IBM Granite 4.0 Tiny Preview IBM 63.0 来源 ↗
42 Pixtral-12B Mistral AI 61.3 来源 ↗