Benchmark

FRAMES

reasoning search text

Factuality, Retrieval, And reasoning MEasurement Set - a unified evaluation dataset of 824 challenging multi-hop questions for testing retrieval-augmented generation systems across factuality, retrieval accuracy, and reasoning capabilities, requiring integration of 2-15 Wikipedia articles per question

语言EN
满分1
参评模型1

模型排名

名次 模型 机构 分数 来源
1 DeepSeek-V3 DeepSeek 73.3 来源 ↗