Benchmark

SWE-Lancer (IC-Diamond subset)

reasoning code text

SWE-Lancer (IC-Diamond subset) is a benchmark of real-world freelance software engineering tasks from Upwork, ranging from $50 bug fixes to $32,000 feature implementations. It evaluates AI models on independent engineering tasks using end-to-end tests triple-verified by experienced software engineers, and includes managerial tasks where models choose between technical implementation proposals.

语言EN
满分1
参评模型4

模型排名

名次 模型 机构 分数 来源
1 GPT-5 OpenAI 100.0 来源 ↗
2 GPT-4.5 OpenAI 17.4 来源 ↗
3 GPT-4o OpenAI 12.4 来源 ↗
4 o3-mini OpenAI 7.4 来源 ↗