Benchmark

TAU-bench Retail

reasoning communication text

A benchmark for evaluating tool-agent-user interaction in retail environments. Tests language agents' ability to handle dynamic conversations with users while using domain-specific API tools and following policy guidelines. Evaluates agents on tasks like order cancellations, address changes, and order status checks through multi-turn conversations.

语言EN
满分1
参评模型22

模型排名

名次 模型 机构 分数 来源
1 Claude Sonnet 4.5 Anthropic 86.2 来源 ↗
2 Claude Opus 4.1 Anthropic 82.4 来源 ↗
3 Claude Opus 4 Anthropic 81.4 来源 ↗
4 Claude 3.7 Sonnet Anthropic 81.2 来源 ↗
5 Claude Sonnet 4 Anthropic 80.5 来源 ↗
6 GLM-4.5 Zhipu AI 79.7 来源 ↗
7 GLM-4.5-Air Zhipu AI 77.9 来源 ↗
8 o4-mini OpenAI 71.8 来源 ↗
9 o1 OpenAI 70.8 来源 ↗
10 Qwen3-Next-80B-A3B-Thinking Alibaba Cloud / Qwen Team 69.6 来源 ↗
11 Claude 3.5 Sonnet Anthropic 69.2 来源 ↗
12 GPT-4.5 OpenAI 68.4 来源 ↗
13 GPT-4.1 OpenAI 68.0 来源 ↗
14 Qwen3-235B-A22B-Thinking-2507 Alibaba Cloud / Qwen Team 67.8 来源 ↗
15 GPT OSS 120B OpenAI 67.8 来源 ↗
16 Qwen3-Next-80B-A3B-Instruct Alibaba Cloud / Qwen Team 60.9 来源 ↗
17 GPT-4o OpenAI 60.3 来源 ↗
18 o3-mini OpenAI 57.6 来源 ↗
19 GPT-4.1 mini OpenAI 55.8 来源 ↗
20 GPT OSS 20B OpenAI 54.8 来源 ↗
21 Claude 3.5 Haiku Anthropic 51.0 来源 ↗
22 GPT-4.1 nano OpenAI 22.6 来源 ↗