Benchmark

BFCL

general reasoning text

The Berkeley Function Calling Leaderboard (BFCL) is the first comprehensive and executable function call evaluation dedicated to assessing Large Language Models' ability to invoke functions. It evaluates serial and parallel function calls across multiple programming languages (Python, Java, JavaScript, REST API) using a novel Abstract Syntax Tree (AST) evaluation method. The benchmark consists of over 2,000 question-function-answer pairs covering diverse application domains and complex use cases including multiple function calls, parallel function calls, and multi-turn interactions.

语言EN
满分1
参评模型10

模型排名

名次 模型 机构 分数 来源
1 Llama 3.1 405B Instruct Meta 88.5 来源 ↗
2 Llama 3.1 70B Instruct Meta 84.8 来源 ↗
3 Llama 3.1 8B Instruct Meta 76.1 来源 ↗
4 Qwen3 235B A22B Alibaba Cloud / Qwen Team 70.8 来源 ↗
5 Qwen3 32B Alibaba Cloud / Qwen Team 70.3 来源 ↗
6 Qwen3 30B A3B Alibaba Cloud / Qwen Team 69.1 来源 ↗
7 Nova Pro Amazon 68.4 来源 ↗
8 Nova Lite Amazon 66.6 来源 ↗
9 QwQ-32B Alibaba Cloud / Qwen Team 66.4 来源 ↗
10 Nova Micro Amazon 56.2 来源 ↗