Benchmark
MultiPL-E
general
language
text
多语言
MultiPL-E is a scalable and extensible system for translating unit test-driven code generation benchmarks to multiple programming languages. It extends HumanEval and MBPP Python benchmarks to 18 additional programming languages, enabling evaluation of neural code generation models across diverse programming paradigms and language features.
语言EN
满分1
参评模型12
模型排名
| 名次 | 模型 | 机构 | 分数 | 来源 |
|---|---|---|---|---|
| 1 | Qwen3-235B-A22B-Instruct-2507 | Alibaba Cloud / Qwen Team | 87.9 | 来源 ↗ |
| 2 | Qwen3-Next-80B-A3B-Instruct | Alibaba Cloud / Qwen Team | 87.8 | 来源 ↗ |
| 3 | Kimi K2 Instruct | Moonshot AI | 85.7 | 来源 ↗ |
| 4 | Kimi K2-Instruct-0905 | Moonshot AI | 85.7 | 来源 ↗ |
| 5 | Qwen2.5 32B Instruct | Alibaba Cloud / Qwen Team | 75.4 | 来源 ↗ |
| 6 | Qwen2.5 72B Instruct | Alibaba Cloud / Qwen Team | 75.1 | 来源 ↗ |
| 7 | Qwen2.5 14B Instruct | Alibaba Cloud / Qwen Team | 72.8 | 来源 ↗ |
| 8 | Qwen2.5 7B Instruct | Alibaba Cloud / Qwen Team | 70.4 | 来源 ↗ |
| 9 | Qwen2 72B Instruct | Alibaba Cloud / Qwen Team | 69.2 | 来源 ↗ |
| 10 | Qwen3 235B A22B | Alibaba Cloud / Qwen Team | 65.9 | 来源 ↗ |
| 11 | Qwen2.5-Omni-7B | Alibaba Cloud / Qwen Team | 65.8 | 来源 ↗ |
| 12 | Qwen2 7B Instruct | Alibaba Cloud / Qwen Team | 59.1 | 来源 ↗ |