Llama 3.2 11B Vision Instruct is an instruction-tuned multimodal large language model optimized for visual recognition, image reasoning, captioning, and answering general questions about an image. It accepts text and images as input and generates text as output.
发布日期2024年9月25日
参数规模10.6B
上下文长度128K
许可证Llama 3.2 Community License
知识截止2023年12月31日
Benchmarks
评测成绩
| 评测基准 | 类别 | 分数 | 来源 |
|---|---|---|---|
| AI2D | vision reasoning multimodal | 91.1 | 来源 |
| DocVQA | vision multimodal | 88.4 | 来源 |
| ChartQA | reasoning vision multimodal | 83.4 | 来源 |
| VQAv2 (test) | vision multimodal reasoning | 75.2 | 来源 |
| MMLU | general reasoning language math | 73.0 | 来源 |
| MGSM | math reasoning | 68.9 | 来源 |
| MATH | math reasoning | 51.9 | 来源 |
| MathVista | math vision multimodal | 51.5 | 来源 |
| MMMU | multimodal reasoning general | 50.7 | 来源 |
| MMMU-Pro | vision multimodal reasoning general | 33.0 | 来源 |
| GPQA | reasoning general | 32.8 | 来源 |
Pricing
API 价格对比
| 服务商 | 输入价 | 输出价 | 上下文 | 吞吐(tok/s) | 延迟(s) | 函数调用 | 代码执行 | 联网搜索 |
|---|---|---|---|---|---|---|---|---|
| LLM Gateway | $0.07 | $0.33 | 128K | — | — | ✗ | ✗ | ✗ |
价格单位:美元/百万 token,数据来自社区整理,仅供参考。