Benchmark

Hallusion Bench

vision reasoning multimodal

A comprehensive benchmark designed to evaluate image-context reasoning in large visual-language models (LVLMs) by challenging models with 346 images and 1,129 carefully crafted questions to assess language hallucination and visual illusion

语言EN
满分1
参评模型2

模型排名

名次 模型 机构 分数 来源
1 Qwen2.5 VL 72B Instruct Alibaba Cloud / Qwen Team 55.2 来源 ↗
2 Qwen2.5 VL 7B Instruct Alibaba Cloud / Qwen Team 52.9 来源 ↗