Benchmark

ComplexFuncBench

long_context reasoning text

ComplexFuncBench is a benchmark designed to evaluate large language models' capabilities in handling complex function calling scenarios. It encompasses multi-step and constrained function calling tasks that require long-parameter filling, parameter value reasoning, and managing contexts up to 128k tokens. The benchmark includes 1,000 samples across five real-world scenarios.

语言EN
满分1
参评模型6

模型排名

名次 模型 机构 分数 来源
1 GPT-4o OpenAI 66.5 来源 ↗
2 GPT-4.1 OpenAI 65.5 来源 ↗
3 GPT-4.5 OpenAI 63.0 来源 ↗
4 GPT-4.1 mini OpenAI 49.3 来源 ↗
5 o3-mini OpenAI 17.6 来源 ↗
6 GPT-4.1 nano OpenAI 5.7 来源 ↗