Benchmark

WritingBench

writing creativity communication text 多语言

A comprehensive benchmark for evaluating large language models' generative writing capabilities across 6 core writing domains (Academic & Engineering, Finance & Business, Politics & Law, Literature & Art, Education, Advertising & Marketing) and 100 subdomains. Contains 1,239 queries with a query-dependent evaluation framework that dynamically generates 5 instance-specific assessment criteria for each writing task, using a fine-tuned critic model to score responses on style, format, and length dimensions.

语言EN
满分1
参评模型4

模型排名

名次 模型 机构 分数 来源
1 Qwen3-235B-A22B-Thinking-2507 Alibaba Cloud / Qwen Team 88.3 来源 ↗
2 Qwen3-Next-80B-A3B-Instruct Alibaba Cloud / Qwen Team 87.3 来源 ↗
3 Qwen3-235B-A22B-Instruct-2507 Alibaba Cloud / Qwen Team 85.2 来源 ↗
4 Qwen3-Next-80B-A3B-Thinking Alibaba Cloud / Qwen Team 84.6 来源 ↗