Benchmark

MMVet

vision multimodal reasoning general spatial_reasoning math multimodal

MM-Vet is an evaluation benchmark that examines large multimodal models on complicated multimodal tasks requiring integrated capabilities. It assesses six core vision-language capabilities: recognition, knowledge, spatial awareness, language generation, OCR, and math through questions that require one or more of these capabilities.

语言EN
满分1
参评模型2

模型排名

名次 模型 机构 分数 来源
1 Qwen2.5 VL 72B Instruct Alibaba Cloud / Qwen Team 76.2 来源 ↗
2 Qwen2.5 VL 7B Instruct Alibaba Cloud / Qwen Team 67.1 来源 ↗