Benchmark

MultiPL-E

general language text 多语言

MultiPL-E is a scalable and extensible system for translating unit test-driven code generation benchmarks to multiple programming languages. It extends HumanEval and MBPP Python benchmarks to 18 additional programming languages, enabling evaluation of neural code generation models across diverse programming paradigms and language features.

语言EN
满分1
参评模型12

模型排名

名次 模型 机构 分数 来源
1 Qwen3-235B-A22B-Instruct-2507 Alibaba Cloud / Qwen Team 87.9 来源 ↗
2 Qwen3-Next-80B-A3B-Instruct Alibaba Cloud / Qwen Team 87.8 来源 ↗
3 Kimi K2 Instruct Moonshot AI 85.7 来源 ↗
4 Kimi K2-Instruct-0905 Moonshot AI 85.7 来源 ↗
5 Qwen2.5 32B Instruct Alibaba Cloud / Qwen Team 75.4 来源 ↗
6 Qwen2.5 72B Instruct Alibaba Cloud / Qwen Team 75.1 来源 ↗
7 Qwen2.5 14B Instruct Alibaba Cloud / Qwen Team 72.8 来源 ↗
8 Qwen2.5 7B Instruct Alibaba Cloud / Qwen Team 70.4 来源 ↗
9 Qwen2 72B Instruct Alibaba Cloud / Qwen Team 69.2 来源 ↗
10 Qwen3 235B A22B Alibaba Cloud / Qwen Team 65.9 来源 ↗
11 Qwen2.5-Omni-7B Alibaba Cloud / Qwen Team 65.8 来源 ↗
12 Qwen2 7B Instruct Alibaba Cloud / Qwen Team 59.1 来源 ↗