Benchmark

MM IF-Eval

multimodal reasoning multimodal

A challenging multimodal instruction-following benchmark that includes both compose-level constraints for output responses and perception-level constraints tied to input images, with comprehensive evaluation pipeline.

语言EN
满分1
参评模型1

模型排名

名次 模型 机构 分数 来源
1 Pixtral-12B Mistral AI 52.7 来源 ↗