Benchmark

SWE-Lancer

reasoning code text

A benchmark for evaluating large language models on real-world freelance software engineering tasks from Upwork. Contains over 1,400 tasks valued at $1 million USD total, ranging from $50 bug fixes to $32,000 feature implementations. Includes both independent engineering tasks graded via end-to-end tests and managerial tasks assessed against original engineering managers' choices.

语言EN
满分1
参评模型3

模型排名

名次 模型 机构 分数 来源
1 GPT-4.5 OpenAI 37.3 来源 ↗
2 GPT-4o OpenAI 32.6 来源 ↗
3 o3-mini OpenAI 18.0 来源 ↗