Model

Qwen2.5-Omni-7B

Alibaba Cloud / Qwen Team
开源 Apache 2.0 多模态

Qwen2.5-Omni is the flagship end-to-end multimodal model in the Qwen series. It processes diverse inputs including text, images, audio, and video, delivering real-time streaming responses through text generation and natural speech synthesis using a novel Thinker-Talker architecture.

发布日期2025年3月27日
参数规模7B
上下文长度
许可证Apache 2.0
知识截止

Benchmarks

评测成绩

评测基准 类别 分数 来源
DocVQA vision multimodal 95.2 来源
VocalSound audio 93.9 来源
GSM8k math reasoning 88.7 来源
GiantSteps Tempo audio 88.0 来源
ChartQA reasoning vision multimodal 85.3 来源
TextVQA vision multimodal image-to-text 84.4 来源
AI2D vision reasoning multimodal 83.2 来源
MMBench-V1.1 vision multimodal reasoning 81.8 来源
HumanEval reasoning code 78.7 来源
CRPErelation healthcare reasoning 76.5 来源
VoiceBench Avg general reasoning safety communication 74.1 来源
MBPP reasoning general 73.2 来源
VideoMME w sub. vision multimodal video 72.4 来源
MATH math reasoning 71.5 来源
MMLU-Redux language reasoning math general 71.0 来源
MVBench vision video multimodal spatial_reasoning reasoning 70.3 来源
RealWorldQA vision spatial_reasoning 70.3 来源
MMAU Music audio multimodal reasoning 69.2 来源
EgoSchema vision reasoning long_context 68.6 来源
MathVista math vision multimodal 67.9 来源
MMAU Sound audio multimodal reasoning 67.9 来源
PointGrounding vision spatial_reasoning multimodal 66.5 来源
MultiPL-E general language 65.8 来源
MMAU audio multimodal reasoning 65.6 来源
MMStar vision multimodal reasoning general 64.0 来源
MME-RealWorld vision multimodal general 61.6 来源
MMAU Speech audio multimodal reasoning speech-to-text 59.8 来源
MMMU multimodal reasoning general 59.2 来源
MuirBench vision multimodal reasoning 59.2 来源
OCRBench_V2 vision image-to-text 57.8 来源
Meld multimodal psychology 57.0 来源
OmniBench multimodal reasoning 56.1 来源
OmniBench Music multimodal audio 52.8 来源
MMLU-Pro language reasoning math general 47.0 来源
ODinW vision 42.4 来源
CoVoST2 en-zh audio speech-to-text language 41.4 来源
MMMU-Pro vision multimodal reasoning general 36.6 来源
MusicCaps audio multimodal 32.8 来源
GPQA reasoning general 30.8 来源
LiveBench math reasoning general 29.6 来源
MathVision math vision multimodal 25.0 来源
Common Voice 15 audio speech-to-text language 7.6 来源
MM-MT-Bench multimodal communication 6.0 来源
NMOS general 4.5 来源
FLEURS language speech-to-text 4.1 来源

Pricing

API 价格对比

暂无 API 价格。