Qwen2.5-VL is the new flagship vision-language model of Qwen, significantly improved from Qwen2-VL. It excels at recognizing objects, analyzing text/charts/layouts in images, acting as a visual agent, understanding long videos (over 1 hour) with event pinpointing, performing visual localization (bounding boxes/points), and generating structured outputs from documents.
发布日期2025年1月26日
参数规模72B
上下文长度131K
许可证tongyi-qianwen
知识截止—
Benchmarks
评测成绩
| 评测基准 | 类别 | 分数 | 来源 |
|---|---|---|---|
| DocVQA | vision multimodal | 96.4 | 来源 |
| Android Control Low_EM | multimodal reasoning | 93.7 | 来源 |
| ChartQA | reasoning vision multimodal | 89.5 | 来源 |
| OCRBench | vision image-to-text | 88.5 | 来源 |
| AI2D | vision reasoning multimodal | 88.4 | 来源 |
| MMBench | vision multimodal reasoning | 88.0 | 来源 |
| ScreenSpot | vision multimodal spatial_reasoning | 87.1 | 来源 |
| AITZ_EM | multimodal reasoning | 83.2 | 来源 |
| CC-OCR | vision multimodal text-to-image | 79.8 | 来源 |
| EgoSchema | vision reasoning long_context | 76.2 | 来源 |
| MMVet | vision multimodal reasoning general spatial_reasoning math | 76.2 | 来源 |
| TempCompass | vision multimodal reasoning | 74.8 | 来源 |
| MathVista-Mini | math vision multimodal | 74.8 | 来源 |
| MLVU-M | general | 74.6 | 来源 |
| VideoMME w/o sub. | multimodal video vision | 73.3 | 来源 |
| PerceptionTest | video multimodal reasoning physics spatial_reasoning | 73.2 | 来源 |
| MMStar | vision multimodal reasoning general | 70.8 | 来源 |
| MVBench | vision video multimodal spatial_reasoning reasoning | 70.4 | 来源 |
| MMMU | multimodal reasoning general | 70.2 | 来源 |
| MobileMiniWob++_SR | multimodal frontend_development | 68.0 | 来源 |
| Android Control High_EM | multimodal reasoning | 67.4 | 来源 |
| OCRBench-V2 (en) | vision image-to-text | 61.5 | 来源 |
| Hallusion Bench | vision reasoning | 55.2 | 来源 |
| MMMU-Pro | vision multimodal reasoning general | 51.1 | 来源 |
| LVBench | vision multimodal long_context | 47.3 | 来源 |
| ScreenSpot Pro | vision multimodal spatial_reasoning | 43.6 | 来源 |
| MathVision | math vision multimodal | 38.1 | 来源 |
| AndroidWorld_SR | general multimodal reasoning | 35.0 | 来源 |
| OSWorld | multimodal general vision | 8.8 | 来源 |
| MMBench-Video | video multimodal reasoning | 2.0 | 来源 |
Pricing
API 价格对比
| 服务商 | 输入价 | 输出价 | 上下文 | 吞吐(tok/s) | 延迟(s) | 函数调用 | 代码执行 | 联网搜索 |
|---|---|---|---|---|---|---|---|---|
| LLM Gateway | $0.13 | $0.40 | 33K | — | — | ✓ | ✗ | ✗ |
| Alibaba (China) | $2.29 | $6.88 | 131K | — | — | ✓ | ✗ | ✗ |
| Alibaba | $2.80 | $8.40 | 131K | — | — | ✓ | ✗ | ✗ |
价格单位:美元/百万 token,数据来自社区整理,仅供参考。