Model

Llama 3.2 11B Instruct

Meta
开源 Llama 3.2 Community License 多模态

Llama 3.2 11B Vision Instruct is an instruction-tuned multimodal large language model optimized for visual recognition, image reasoning, captioning, and answering general questions about an image. It accepts text and images as input and generates text as output.

发布日期2024年9月25日
参数规模10.6B
上下文长度128K
许可证Llama 3.2 Community License
知识截止2023年12月31日

Benchmarks

评测成绩

评测基准 类别 分数 来源
AI2D vision reasoning multimodal 91.1 来源
DocVQA vision multimodal 88.4 来源
ChartQA reasoning vision multimodal 83.4 来源
VQAv2 (test) vision multimodal reasoning 75.2 来源
MMLU general reasoning language math 73.0 来源
MGSM math reasoning 68.9 来源
MATH math reasoning 51.9 来源
MathVista math vision multimodal 51.5 来源
MMMU multimodal reasoning general 50.7 来源
MMMU-Pro vision multimodal reasoning general 33.0 来源
GPQA reasoning general 32.8 来源

Pricing

API 价格对比

服务商 输入价 输出价 上下文 吞吐(tok/s) 延迟(s) 函数调用 代码执行 联网搜索
LLM Gateway $0.07 $0.33 128K

价格单位:美元/百万 token,数据来自社区整理,仅供参考。