Llama 3.1 8B Instruct is a multilingual large language model optimized for dialogue use cases. It features a 128K context length, state-of-the-art tool use, and strong reasoning capabilities.
发布日期2024年7月23日
参数规模8B
上下文长度120K
许可证Llama 3.1 Community License
知识截止2023年12月31日
Benchmarks
评测成绩
| 评测基准 | 类别 | 分数 | 来源 |
|---|---|---|---|
| GSM-8K (CoT) | math reasoning | 84.5 | 来源 |
| ARC-C | reasoning general | 83.4 | 来源 |
| API-Bank | reasoning | 82.6 | 来源 |
| IFEval | general | 80.4 | 来源 |
| BFCL | general reasoning | 76.1 | 来源 |
| MMLU (CoT) | language reasoning math general | 73.0 | 来源 |
| MBPP EvalPlus (base) | reasoning general | 72.8 | 来源 |
| HumanEval | reasoning code | 72.6 | 来源 |
| MMLU | general reasoning language math | 69.4 | 来源 |
| Multilingual MGSM (CoT) | math reasoning | 68.9 | 来源 |
| DROP | reasoning math | 59.5 | 来源 |
| Multipl-E MBPP | general reasoning | 52.4 | 来源 |
| MATH (CoT) | math reasoning | 51.9 | 来源 |
| Multipl-E HumanEval | language general | 50.8 | 来源 |
| MMLU-Pro | language reasoning math general | 48.3 | 来源 |
| Nexus | general | 38.5 | 来源 |
| GPQA | reasoning general | 30.4 | 来源 |
| Gorilla Benchmark API Bench | reasoning code | 8.2 | 来源 |
Pricing
API 价格对比
| 服务商 | 输入价 | 输出价 | 上下文 | 吞吐(tok/s) | 延迟(s) | 函数调用 | 代码执行 | 联网搜索 |
|---|---|---|---|---|---|---|---|---|
| Helicone | $0.02 | $0.05 | 16K | — | — | ✓ | ✗ | ✗ |
| Regolo AI | $0.05 | $0.25 | 120K | — | — | ✓ | ✗ | ✗ |
价格单位:美元/百万 token,数据来自社区整理,仅供参考。