Benchmark

EvalPlus

reasoning code text

A rigorous code synthesis evaluation framework that augments existing datasets with extensive test cases generated by LLM and mutation-based strategies to better assess functional correctness of generated code, including HumanEval+ with 80x more test cases

语言EN
满分100
参评模型4

模型排名

名次 模型 机构 分数 来源
1 Kimi K2 Base Moonshot AI 80.3 来源 ↗
2 Qwen2 72B Instruct Alibaba Cloud / Qwen Team 79.0 来源 ↗
3 Qwen3 235B A22B Alibaba Cloud / Qwen Team 77.6 来源 ↗
4 Qwen2 7B Instruct Alibaba Cloud / Qwen Team 70.3 来源 ↗