Model

Qwen2.5 VL 32B Instruct

Alibaba Cloud / Qwen Team
开源 Apache 2.0 多模态

Qwen2.5-VL is a vision-language model from the Qwen family. Key enhancements include visual understanding (objects, text, charts, layouts), visual agent capabilities (tool use, computer/phone control), long video comprehension with event pinpointing, visual localization (bounding boxes/points), and structured output generation.

发布日期2025年2月28日
参数规模33.5B
上下文长度
许可证Apache 2.0
知识截止

Benchmarks

评测成绩

评测基准 类别 分数 来源
DocVQA vision multimodal 94.8 来源
Android Control Low_EM multimodal reasoning 93.3 来源
HumanEval reasoning code 91.5 来源
ScreenSpot vision multimodal spatial_reasoning 88.5 来源
MBPP reasoning general 84.0 来源
InfoVQA vision multimodal 83.4 来源
AITZ_EM multimodal reasoning 83.1 来源
MATH math reasoning 82.2 来源
MMLU general reasoning language math 78.4 来源
VideoMME w sub. vision multimodal video 77.9 来源
CC-OCR vision multimodal text-to-image 77.1 来源
MathVista-Mini math vision multimodal 74.7 来源
VideoMME w/o sub. multimodal video vision 70.5 来源
MMMU multimodal reasoning general 70.0 来源
Android Control High_EM multimodal reasoning 69.6 来源
MMStar vision multimodal reasoning general 69.5 来源
MMLU-Pro language reasoning math general 68.8 来源
OCRBench-V2 (zh) vision image-to-text 59.1 来源
OCRBench-V2 (en) vision image-to-text 57.2 来源
CharadesSTA video language multimodal 54.2 来源
MMMU-Pro vision multimodal reasoning general 49.5 来源
LVBench vision multimodal long_context 49.0 来源
GPQA reasoning general 46.0 来源
ScreenSpot Pro vision multimodal spatial_reasoning 39.4 来源
MathVision math vision multimodal 38.4 来源
AndroidWorld_SR general multimodal reasoning 22.0 来源
OSWorld multimodal general vision 5.9 来源
MMBench-Video video multimodal reasoning 1.9 来源

Pricing

API 价格对比

暂无 API 价格。