Benchmark

TydiQA

language reasoning text 多语言

A multilingual question answering benchmark covering 11 typologically diverse languages with 204K question-answer pairs. Questions are written by people seeking genuine information and data is collected directly in each language without translation to test model generalization across diverse linguistic structures.

语言EN
满分1
参评模型2

模型排名

名次 模型 机构 分数 来源
1 Llama 4 Maverick Meta 31.7 来源 ↗
2 Llama 4 Scout Meta 31.5 来源 ↗