Benchmark

OmniBench

multimodal reasoning multimodal

A novel multimodal benchmark designed to evaluate large language models' ability to recognize, interpret, and reason across visual, acoustic, and textual inputs simultaneously. Comprises 1,142 question-answer pairs covering 8 task categories from basic perception to complex inference, with a unique constraint that accurate responses require integrated understanding of all three modalities.

语言EN
满分1
参评模型1

模型排名

名次 模型 机构 分数 来源
1 Qwen2.5-Omni-7B Alibaba Cloud / Qwen Team 56.1 来源 ↗