Llama 3.2 90B is a large multimodal language model optimized for visual recognition, image reasoning, and captioning tasks. It supports a context length of 128,000 tokens and is designed for deployment on edge and mobile devices, offering state-of-the-art performance in image understanding and generative tasks.
发布日期2024年9月25日
参数规模90B
上下文长度—
许可证Llama 3.2
知识截止—
Benchmarks
评测成绩
| 评测基准 | 类别 | 分数 | 来源 |
|---|---|---|---|
| AI2D | vision reasoning multimodal | 92.3 | 来源 |
| DocVQA | vision multimodal | 90.1 | 来源 |
| MGSM | math reasoning | 86.9 | 来源 |
| MMLU | general reasoning language math | 86.0 | 来源 |
| ChartQA | reasoning vision multimodal | 85.5 | 来源 |
| VQAv2 | vision multimodal reasoning | 78.1 | 来源 |
| TextVQA | vision multimodal image-to-text | 73.5 | 来源 |
| MATH | math reasoning | 68.0 | 来源 |
| MMMU | multimodal reasoning general | 60.3 | 来源 |
| MathVista | math vision multimodal | 57.3 | 来源 |
| InfographicsQA | vision multimodal | 56.8 | 来源 |
| GPQA | reasoning general | 46.7 | 来源 |
| MMMU-Pro | vision multimodal reasoning general | 45.2 | 来源 |
Pricing
API 价格对比
暂无 API 价格。