Qwen2.5-Omni is the flagship end-to-end multimodal model in the Qwen series. It processes diverse inputs including text, images, audio, and video, delivering real-time streaming responses through text generation and natural speech synthesis using a novel Thinker-Talker architecture.
发布日期2025年3月27日
参数规模7B
上下文长度—
许可证Apache 2.0
知识截止—
Benchmarks
评测成绩
| 评测基准 | 类别 | 分数 | 来源 |
|---|---|---|---|
| DocVQA | vision multimodal | 95.2 | 来源 |
| VocalSound | audio | 93.9 | 来源 |
| GSM8k | math reasoning | 88.7 | 来源 |
| GiantSteps Tempo | audio | 88.0 | 来源 |
| ChartQA | reasoning vision multimodal | 85.3 | 来源 |
| TextVQA | vision multimodal image-to-text | 84.4 | 来源 |
| AI2D | vision reasoning multimodal | 83.2 | 来源 |
| MMBench-V1.1 | vision multimodal reasoning | 81.8 | 来源 |
| HumanEval | reasoning code | 78.7 | 来源 |
| CRPErelation | healthcare reasoning | 76.5 | 来源 |
| VoiceBench Avg | general reasoning safety communication | 74.1 | 来源 |
| MBPP | reasoning general | 73.2 | 来源 |
| VideoMME w sub. | vision multimodal video | 72.4 | 来源 |
| MATH | math reasoning | 71.5 | 来源 |
| MMLU-Redux | language reasoning math general | 71.0 | 来源 |
| MVBench | vision video multimodal spatial_reasoning reasoning | 70.3 | 来源 |
| RealWorldQA | vision spatial_reasoning | 70.3 | 来源 |
| MMAU Music | audio multimodal reasoning | 69.2 | 来源 |
| EgoSchema | vision reasoning long_context | 68.6 | 来源 |
| MathVista | math vision multimodal | 67.9 | 来源 |
| MMAU Sound | audio multimodal reasoning | 67.9 | 来源 |
| PointGrounding | vision spatial_reasoning multimodal | 66.5 | 来源 |
| MultiPL-E | general language | 65.8 | 来源 |
| MMAU | audio multimodal reasoning | 65.6 | 来源 |
| MMStar | vision multimodal reasoning general | 64.0 | 来源 |
| MME-RealWorld | vision multimodal general | 61.6 | 来源 |
| MMAU Speech | audio multimodal reasoning speech-to-text | 59.8 | 来源 |
| MMMU | multimodal reasoning general | 59.2 | 来源 |
| MuirBench | vision multimodal reasoning | 59.2 | 来源 |
| OCRBench_V2 | vision image-to-text | 57.8 | 来源 |
| Meld | multimodal psychology | 57.0 | 来源 |
| OmniBench | multimodal reasoning | 56.1 | 来源 |
| OmniBench Music | multimodal audio | 52.8 | 来源 |
| MMLU-Pro | language reasoning math general | 47.0 | 来源 |
| ODinW | vision | 42.4 | 来源 |
| CoVoST2 en-zh | audio speech-to-text language | 41.4 | 来源 |
| MMMU-Pro | vision multimodal reasoning general | 36.6 | 来源 |
| MusicCaps | audio multimodal | 32.8 | 来源 |
| GPQA | reasoning general | 30.8 | 来源 |
| LiveBench | math reasoning general | 29.6 | 来源 |
| MathVision | math vision multimodal | 25.0 | 来源 |
| Common Voice 15 | audio speech-to-text language | 7.6 | 来源 |
| MM-MT-Bench | multimodal communication | 6.0 | 来源 |
| NMOS | general | 4.5 | 来源 |
| FLEURS | language speech-to-text | 4.1 | 来源 |
Pricing
API 价格对比
暂无 API 价格。