Benchmark

LongFact Objects

general reasoning text

LongFact is a benchmark for evaluating long-form factuality in large language models. It comprises 2,280 fact-seeking prompts spanning 38 topics, designed to test a model's ability to generate accurate, long-form responses. The benchmark uses SAFE (Search-Augmented Factuality Evaluator) to evaluate factual accuracy.

语言EN
满分1
参评模型1

模型排名

名次 模型 机构 分数 来源
1 GPT-5 OpenAI 0.8 来源 ↗