Benchmark

PolyMATH

math reasoning spatial_reasoning multimodal vision multimodal

Polymath is a challenging multi-modal mathematical reasoning benchmark designed to evaluate the general cognitive reasoning abilities of Multi-modal Large Language Models (MLLMs). The benchmark comprises 5,000 manually collected high-quality images of cognitive textual and visual challenges across 10 distinct categories, including pattern recognition, spatial reasoning, and relative reasoning.

语言EN
满分1
参评模型4

模型排名

名次 模型 机构 分数 来源
1 Qwen3-235B-A22B-Thinking-2507 Alibaba Cloud / Qwen Team 60.1 来源 ↗
2 Qwen3-Next-80B-A3B-Thinking Alibaba Cloud / Qwen Team 56.3 来源 ↗
3 Qwen3-235B-A22B-Instruct-2507 Alibaba Cloud / Qwen Team 50.2 来源 ↗
4 Qwen3-Next-80B-A3B-Instruct Alibaba Cloud / Qwen Team 45.9 来源 ↗