Phi-3.5-mini-instruct is a 3.8B-parameter model that supports up to 128K context tokens, with improved multilingual capabilities across over 20 languages. It underwent additional training and safety post-training to enhance instruction-following, reasoning, math, and code generation. Ideal for environments with memory or latency constraints, it uses an MIT license.
发布日期2024年8月23日
参数规模3.8B
上下文长度128K
许可证MIT
知识截止—
Benchmarks
评测成绩
| 评测基准 | 类别 | 分数 | 来源 |
|---|---|---|---|
| GSM8k | math reasoning | 86.2 | 来源 |
| ARC-C | reasoning general | 84.6 | 来源 |
| RULER | long_context reasoning | 84.1 | 来源 |
| PIQA | reasoning physics general | 81.0 | 来源 |
| OpenBookQA | reasoning general | 79.2 | 来源 |
| BoolQ | language reasoning | 78.0 | 来源 |
| RepoQA | long_context reasoning code | 77.0 | 来源 |
| Social IQa | reasoning psychology | 74.7 | 来源 |
| MEGA XStoryCloze | reasoning language | 73.5 | 来源 |
| MBPP | reasoning general | 69.6 | 来源 |
| HellaSwag | reasoning | 69.4 | 来源 |
| BIG-Bench Hard | reasoning math language | 69.0 | 来源 |
| MMLU | general reasoning language math | 69.0 | 来源 |
| Winogrande | reasoning language | 68.5 | 来源 |
| TruthfulQA | general reasoning legal healthcare finance | 64.0 | 来源 |
| MEGA XCOPA | reasoning language | 63.1 | 来源 |
| HumanEval | reasoning code | 62.8 | 来源 |
| MEGA TyDi QA | language reasoning | 62.2 | 来源 |
| MEGA MLQA | language reasoning | 61.7 | 来源 |
| MMMLU | language reasoning math general | 55.4 | 来源 |
| MATH | math reasoning | 48.5 | 来源 |
| MGSM | math reasoning | 47.9 | 来源 |
| MMLU-Pro | language reasoning math general | 47.4 | 来源 |
| MEGA UDPOS | language | 46.5 | 来源 |
| Qasper | reasoning long_context | 41.9 | 来源 |
| Arena Hard | general reasoning creativity | 37.0 | 来源 |
| GPQA | reasoning general | 30.4 | 来源 |
| GovReport | summarization long_context | 25.9 | 来源 |
| SQuALITY | summarization long_context language | 24.3 | 来源 |
| QMSum | summarization long_context | 21.3 | 来源 |
| SummScreenFD | summarization long_context | 16.0 | 来源 |
Pricing
API 价格对比
| 服务商 | 输入价 | 输出价 | 上下文 | 吞吐(tok/s) | 延迟(s) | 函数调用 | 代码执行 | 联网搜索 |
|---|---|---|---|---|---|---|---|---|
| Azure | $0.13 | $0.52 | 128K | — | — | ✗ | ✗ | ✗ |
| Azure Cognitive Services | $0.13 | $0.52 | 128K | — | — | ✗ | ✗ | ✗ |
价格单位:美元/百万 token,数据来自社区整理,仅供参考。