Qwen2.5-VL is a vision-language model from the Qwen family. Key enhancements include visual understanding (objects, text, charts, layouts), visual agent capabilities (tool use, computer/phone control), long video comprehension with event pinpointing, visual localization (bounding boxes/points), and structured output generation.
发布日期2025年2月28日
参数规模33.5B
上下文长度—
许可证Apache 2.0
知识截止—
Benchmarks
评测成绩
| 评测基准 | 类别 | 分数 | 来源 |
|---|---|---|---|
| DocVQA | vision multimodal | 94.8 | 来源 |
| Android Control Low_EM | multimodal reasoning | 93.3 | 来源 |
| HumanEval | reasoning code | 91.5 | 来源 |
| ScreenSpot | vision multimodal spatial_reasoning | 88.5 | 来源 |
| MBPP | reasoning general | 84.0 | 来源 |
| InfoVQA | vision multimodal | 83.4 | 来源 |
| AITZ_EM | multimodal reasoning | 83.1 | 来源 |
| MATH | math reasoning | 82.2 | 来源 |
| MMLU | general reasoning language math | 78.4 | 来源 |
| VideoMME w sub. | vision multimodal video | 77.9 | 来源 |
| CC-OCR | vision multimodal text-to-image | 77.1 | 来源 |
| MathVista-Mini | math vision multimodal | 74.7 | 来源 |
| VideoMME w/o sub. | multimodal video vision | 70.5 | 来源 |
| MMMU | multimodal reasoning general | 70.0 | 来源 |
| Android Control High_EM | multimodal reasoning | 69.6 | 来源 |
| MMStar | vision multimodal reasoning general | 69.5 | 来源 |
| MMLU-Pro | language reasoning math general | 68.8 | 来源 |
| OCRBench-V2 (zh) | vision image-to-text | 59.1 | 来源 |
| OCRBench-V2 (en) | vision image-to-text | 57.2 | 来源 |
| CharadesSTA | video language multimodal | 54.2 | 来源 |
| MMMU-Pro | vision multimodal reasoning general | 49.5 | 来源 |
| LVBench | vision multimodal long_context | 49.0 | 来源 |
| GPQA | reasoning general | 46.0 | 来源 |
| ScreenSpot Pro | vision multimodal spatial_reasoning | 39.4 | 来源 |
| MathVision | math vision multimodal | 38.4 | 来源 |
| AndroidWorld_SR | general multimodal reasoning | 22.0 | 来源 |
| OSWorld | multimodal general vision | 5.9 | 来源 |
| MMBench-Video | video multimodal reasoning | 1.9 | 来源 |
Pricing
API 价格对比
暂无 API 价格。