Model

Gemma 3 12B

Google
开源 Gemma 多模态

Gemma 3 12B is a 12-billion-parameter vision-language model from Google, handling text and image input and generating text output. It features a 128K context window, multilingual support, and open weights. Suitable for question answering, summarization, reasoning, and image understanding tasks.

发布日期2025年3月12日
参数规模12B
上下文长度131K
许可证Gemma
知识截止

Benchmarks

评测成绩

评测基准 类别 分数 来源
GSM8k math reasoning 94.4 来源
IFEval general 88.9 来源
DocVQA vision multimodal 87.1 来源
BIG-Bench Hard reasoning math language 85.7 来源
HumanEval reasoning code 85.4 来源
AI2D vision reasoning multimodal 84.2 来源
MATH math reasoning 83.8 来源
Natural2Code reasoning general 80.7 来源
FACTS Grounding reasoning 75.8 来源
ChartQA reasoning vision multimodal 75.7 来源
MBPP reasoning general 73.0 来源
VQAv2 (val) vision multimodal language reasoning 71.6 来源
Global-MMLU-Lite general language reasoning 69.5 来源
TextVQA vision multimodal image-to-text 67.7 来源
InfoVQA vision multimodal 64.9 来源
MathVista-Mini math vision multimodal 62.9 来源
MMLU-Pro language reasoning math general 60.6 来源
MMMU (val) vision multimodal reasoning general 59.6 来源
HiddenMath math reasoning 54.5 来源
WMT24++ language 51.6 来源
Bird-SQL (dev) reasoning 47.9 来源
GPQA reasoning general 40.9 来源
LiveCodeBench reasoning general code 24.6 来源
BIG-Bench Extra Hard reasoning general language 16.3 来源
ECLeKTic language reasoning 10.3 来源
SimpleQA general reasoning 6.3 来源

Pricing

API 价格对比

服务商 输入价 输出价 上下文 吞吐(tok/s) 延迟(s) 函数调用 代码执行 联网搜索
Helicone $0.05 $0.10 131K

价格单位:美元/百万 token,数据来自社区整理,仅供参考。