Gemma 3 12B is a 12-billion-parameter vision-language model from Google, handling text and image input and generating text output. It features a 128K context window, multilingual support, and open weights. Suitable for question answering, summarization, reasoning, and image understanding tasks.
发布日期2025年3月12日
参数规模12B
上下文长度131K
许可证Gemma
知识截止—
Benchmarks
评测成绩
| 评测基准 | 类别 | 分数 | 来源 |
|---|---|---|---|
| GSM8k | math reasoning | 94.4 | 来源 |
| IFEval | general | 88.9 | 来源 |
| DocVQA | vision multimodal | 87.1 | 来源 |
| BIG-Bench Hard | reasoning math language | 85.7 | 来源 |
| HumanEval | reasoning code | 85.4 | 来源 |
| AI2D | vision reasoning multimodal | 84.2 | 来源 |
| MATH | math reasoning | 83.8 | 来源 |
| Natural2Code | reasoning general | 80.7 | 来源 |
| FACTS Grounding | reasoning | 75.8 | 来源 |
| ChartQA | reasoning vision multimodal | 75.7 | 来源 |
| MBPP | reasoning general | 73.0 | 来源 |
| VQAv2 (val) | vision multimodal language reasoning | 71.6 | 来源 |
| Global-MMLU-Lite | general language reasoning | 69.5 | 来源 |
| TextVQA | vision multimodal image-to-text | 67.7 | 来源 |
| InfoVQA | vision multimodal | 64.9 | 来源 |
| MathVista-Mini | math vision multimodal | 62.9 | 来源 |
| MMLU-Pro | language reasoning math general | 60.6 | 来源 |
| MMMU (val) | vision multimodal reasoning general | 59.6 | 来源 |
| HiddenMath | math reasoning | 54.5 | 来源 |
| WMT24++ | language | 51.6 | 来源 |
| Bird-SQL (dev) | reasoning | 47.9 | 来源 |
| GPQA | reasoning general | 40.9 | 来源 |
| LiveCodeBench | reasoning general code | 24.6 | 来源 |
| BIG-Bench Extra Hard | reasoning general language | 16.3 | 来源 |
| ECLeKTic | language reasoning | 10.3 | 来源 |
| SimpleQA | general reasoning | 6.3 | 来源 |
Pricing
API 价格对比
| 服务商 | 输入价 | 输出价 | 上下文 | 吞吐(tok/s) | 延迟(s) | 函数调用 | 代码执行 | 联网搜索 |
|---|---|---|---|---|---|---|---|---|
| Helicone | $0.05 | $0.10 | 131K | — | — | ✗ | ✗ | ✗ |
价格单位:美元/百万 token,数据来自社区整理,仅供参考。