Model

Gemma 3 4B

Google
开源 Gemma 多模态

Gemma 3 4B is a 4-billion-parameter vision-language model from Google, handling text and image input and generating text output. It features a 128K context window, multilingual support, and open weights. Suitable for question answering, summarization, reasoning, and image understanding tasks.

发布日期2025年3月12日
参数规模4B
上下文长度
许可证Gemma
知识截止2024年8月1日

Benchmarks

评测成绩

评测基准 类别 分数 来源
IFEval general 90.2 来源
GSM8k math reasoning 89.2 来源
DocVQA vision multimodal 75.8 来源
MATH math reasoning 75.6 来源
AI2D vision reasoning multimodal 74.8 来源
BIG-Bench Hard reasoning math language 72.2 来源
HumanEval reasoning code 71.3 来源
Natural2Code reasoning general 70.3 来源
FACTS Grounding reasoning 70.1 来源
ChartQA reasoning vision multimodal 68.8 来源
MBPP reasoning general 63.2 来源
VQAv2 (val) vision multimodal language reasoning 62.4 来源
TextVQA vision multimodal image-to-text 57.8 来源
Global-MMLU-Lite general language reasoning 54.5 来源
InfoVQA vision multimodal 50.0 来源
MathVista-Mini math vision multimodal 50.0 来源
MMMU (val) vision multimodal reasoning general 48.8 来源
WMT24++ language 46.8 来源
MMLU-Pro language reasoning math general 43.6 来源
HiddenMath math reasoning 43.0 来源
Bird-SQL (dev) reasoning 36.3 来源
GPQA reasoning general 30.8 来源
LiveCodeBench reasoning general code 12.6 来源
BIG-Bench Extra Hard reasoning general language 11.0 来源
ECLeKTic language reasoning 4.6 来源
SimpleQA general reasoning 4.0 来源

Pricing

API 价格对比

暂无 API 价格。