Gemma 3 4B is a 4-billion-parameter vision-language model from Google, handling text and image input and generating text output. It features a 128K context window, multilingual support, and open weights. Suitable for question answering, summarization, reasoning, and image understanding tasks.
发布日期2025年3月12日
参数规模4B
上下文长度—
许可证Gemma
知识截止2024年8月1日
Benchmarks
评测成绩
| 评测基准 | 类别 | 分数 | 来源 |
|---|---|---|---|
| IFEval | general | 90.2 | 来源 |
| GSM8k | math reasoning | 89.2 | 来源 |
| DocVQA | vision multimodal | 75.8 | 来源 |
| MATH | math reasoning | 75.6 | 来源 |
| AI2D | vision reasoning multimodal | 74.8 | 来源 |
| BIG-Bench Hard | reasoning math language | 72.2 | 来源 |
| HumanEval | reasoning code | 71.3 | 来源 |
| Natural2Code | reasoning general | 70.3 | 来源 |
| FACTS Grounding | reasoning | 70.1 | 来源 |
| ChartQA | reasoning vision multimodal | 68.8 | 来源 |
| MBPP | reasoning general | 63.2 | 来源 |
| VQAv2 (val) | vision multimodal language reasoning | 62.4 | 来源 |
| TextVQA | vision multimodal image-to-text | 57.8 | 来源 |
| Global-MMLU-Lite | general language reasoning | 54.5 | 来源 |
| InfoVQA | vision multimodal | 50.0 | 来源 |
| MathVista-Mini | math vision multimodal | 50.0 | 来源 |
| MMMU (val) | vision multimodal reasoning general | 48.8 | 来源 |
| WMT24++ | language | 46.8 | 来源 |
| MMLU-Pro | language reasoning math general | 43.6 | 来源 |
| HiddenMath | math reasoning | 43.0 | 来源 |
| Bird-SQL (dev) | reasoning | 36.3 | 来源 |
| GPQA | reasoning general | 30.8 | 来源 |
| LiveCodeBench | reasoning general code | 12.6 | 来源 |
| BIG-Bench Extra Hard | reasoning general language | 11.0 | 来源 |
| ECLeKTic | language reasoning | 4.6 | 来源 |
| SimpleQA | general reasoning | 4.0 | 来源 |
Pricing
API 价格对比
暂无 API 价格。