Benchmark
CC-OCR
vision
multimodal
text-to-image
multimodal
多语言
A comprehensive OCR benchmark for evaluating Large Multimodal Models (LMMs) in literacy. Comprises four OCR-centric tracks: multi-scene text reading, multilingual text reading, document parsing, and key information extraction. Contains 39 subsets with 7,058 fully annotated images, 41% sourced from real applications. Tests capabilities including text grounding, multi-orientation text recognition, and detecting hallucination/repetition across diverse visual challenges.
语言EN
满分1
参评模型3
模型排名
| 名次 | 模型 | 机构 | 分数 | 来源 |
|---|---|---|---|---|
| 1 | Qwen2.5 VL 72B Instruct | Alibaba Cloud / Qwen Team | 79.8 | 来源 ↗ |
| 2 | Qwen2.5 VL 7B Instruct | Alibaba Cloud / Qwen Team | 77.8 | 来源 ↗ |
| 3 | Qwen2.5 VL 32B Instruct | Alibaba Cloud / Qwen Team | 77.1 | 来源 ↗ |