Model

Llama 3.2 90B Instruct

Meta
开源 Llama 3.2 多模态

Llama 3.2 90B is a large multimodal language model optimized for visual recognition, image reasoning, and captioning tasks. It supports a context length of 128,000 tokens and is designed for deployment on edge and mobile devices, offering state-of-the-art performance in image understanding and generative tasks.

发布日期2024年9月25日
参数规模90B
上下文长度
许可证Llama 3.2
知识截止

Benchmarks

评测成绩

评测基准 类别 分数 来源
AI2D vision reasoning multimodal 92.3 来源
DocVQA vision multimodal 90.1 来源
MGSM math reasoning 86.9 来源
MMLU general reasoning language math 86.0 来源
ChartQA reasoning vision multimodal 85.5 来源
VQAv2 vision multimodal reasoning 78.1 来源
TextVQA vision multimodal image-to-text 73.5 来源
MATH math reasoning 68.0 来源
MMMU multimodal reasoning general 60.3 来源
MathVista math vision multimodal 57.3 来源
InfographicsQA vision multimodal 56.8 来源
GPQA reasoning general 46.7 来源
MMMU-Pro vision multimodal reasoning general 45.2 来源

Pricing

API 价格对比

暂无 API 价格。