Benchmark

LiveCodeBench

reasoning general code text

LiveCodeBench is a holistic and contamination-free evaluation benchmark for large language models for code. It continuously collects new problems from programming contests (LeetCode, AtCoder, CodeForces) and evaluates four different scenarios: code generation, self-repair, code execution, and test output prediction. Problems are annotated with release dates to enable evaluation on unseen problems released after a model's training cutoff.

语言EN
满分1
参评模型53

模型排名

名次 模型 机构 分数 来源
1 Fugu Ultra Sakana AI 93.2 来源 ↗
2 Fugu Sakana AI 92.9 来源 ↗
3 Nemotron 3 Ultra 550B A55B NVIDIA 89.0 来源 ↗
4 Grok-3 Mini xAI 80.4 来源 ↗
5 Grok 4 Fast xAI 80.0 来源 ↗
6 Grok-4 Heavy xAI 79.4 来源 ↗
7 Grok-3 xAI 79.4 来源 ↗
8 Grok-4 xAI 79.0 来源 ↗
9 DeepSeek-V3.2-Exp DeepSeek 74.1 来源 ↗
10 DeepSeek-R1-0528 DeepSeek 73.3 来源 ↗
11 GLM-4.5 Zhipu AI 72.9 来源 ↗
12 Nemotron Nano 9B v2 NVIDIA 71.1 来源 ↗
13 GLM-4.5-Air Zhipu AI 70.7 来源 ↗
14 Qwen3 235B A22B Alibaba Cloud / Qwen Team 70.7 来源 ↗
15 Gemini 2.5 Pro Preview 06-05 Google 69.0 来源 ↗
16 Llama 3.1 Nemotron Ultra 253B v1 NVIDIA 66.3 来源 ↗
17 Qwen3 32B Alibaba Cloud / Qwen Team 65.7 来源 ↗
18 QwQ-32B Alibaba Cloud / Qwen Team 63.4 来源 ↗
19 Qwen3 30B A3B Alibaba Cloud / Qwen Team 62.6 来源 ↗
20 DeepSeek R1 Distill Llama 70B DeepSeek 57.5 来源 ↗
21 DeepSeek R1 Distill Qwen 32B DeepSeek 57.2 来源 ↗
22 DeepSeek-V3.1 DeepSeek 56.4 来源 ↗
23 Qwen2.5 72B Instruct Alibaba Cloud / Qwen Team 55.5 来源 ↗
24 Phi 4 Reasoning Microsoft 53.8 来源 ↗
25 Kimi K2-Instruct-0905 Moonshot AI 53.7 来源 ↗
26 DeepSeek R1 Distill Qwen 14B DeepSeek 53.1 来源 ↗
27 Phi 4 Reasoning Plus Microsoft 53.1 来源 ↗
28 Magistral Small 2506 Mistral AI 51.3 来源 ↗
29 Magistral Medium Mistral AI 50.3 来源 ↗
30 QwQ-32B-Preview Alibaba Cloud / Qwen Team 50.0 来源 ↗
31 DeepSeek R1 Zero DeepSeek 50.0 来源 ↗
32 DeepSeek-V3 0324 DeepSeek 49.2 来源 ↗
33 Llama 4 Maverick Meta 43.4 来源 ↗
34 DeepSeek R1 Distill Llama 8B DeepSeek 39.6 来源 ↗
35 DeepSeek-V3 DeepSeek 37.6 来源 ↗
36 DeepSeek R1 Distill Qwen 7B DeepSeek 37.6 来源 ↗
37 Gemini 2.0 Flash Google 35.1 来源 ↗
38 Gemini 2.5 Flash-Lite Google 33.7 来源 ↗
39 Llama 4 Scout Meta 32.8 来源 ↗
40 Qwen2.5-Coder 32B Instruct Alibaba Cloud / Qwen Team 31.4 来源 ↗
41 Gemini Diffusion Google 30.9 来源 ↗
42 Gemma 3 27B Google 29.7 来源 ↗
43 Qwen2.5 7B Instruct Alibaba Cloud / Qwen Team 28.7 来源 ↗
44 Qwen2 7B Instruct Alibaba Cloud / Qwen Team 26.6 来源 ↗
45 Gemma 3 12B Google 24.6 来源 ↗
46 Qwen2.5-Coder 7B Instruct Alibaba Cloud / Qwen Team 18.2 来源 ↗
47 DeepSeek R1 Distill Qwen 1.5B DeepSeek 16.9 来源 ↗
48 Gemma 3n E4B Instructed LiteRT Preview Google 13.2 来源 ↗
49 Gemma 3n E4B Instructed Google 13.2 来源 ↗
50 Gemma 3n E2B Instructed LiteRT (Preview) Google 13.2 来源 ↗
51 Gemma 3n E2B Instructed Google 13.2 来源 ↗
52 Gemma 3 4B Google 12.6 来源 ↗
53 Gemma 3 1B Google 1.9 来源 ↗