Benchmark

BLINK

vision multimodal reasoning multimodal

BLINK: Multimodal Large Language Models Can See but Not Perceive. A benchmark for multimodal language models focusing on core visual perception abilities. Reformats 14 classic computer vision tasks into 3,807 multiple-choice questions paired with single or multiple images and visual prompting. Tasks include relative depth estimation, visual correspondence, forensics detection, multi-view reasoning, counting, object localization, and spatial reasoning that humans can solve 'within a blink'.

语言EN
满分1
参评模型1

模型排名

名次 模型 机构 分数 来源
1 Phi-4-multimodal-instruct Microsoft 61.3 来源 ↗