Benchmark

TLDR9+ (test)

summarization language text

A large-scale summarization dataset containing over 9 million training instances extracted from Reddit, designed for extreme summarization (generating one-sentence summaries with high compression and abstraction). More than twice larger than previously proposed datasets.

语言EN
满分1
参评模型1

模型排名

名次 模型 机构 分数 来源
1 Llama 3.2 3B Instruct Meta 19.0 来源 ↗