Quality-first multi-agent model for hard research, analysis, and competitions
发布日期2026年6月15日
参数规模—
上下文长度1.0M
许可证Proprietary
知识截止—
Benchmarks
评测成绩
| 评测基准 | 类别 | 分数 | 来源 |
|---|---|---|---|
| GPQA Diamond | general | 95.5 | 来源 |
| MRCRv2 | general | 93.6 | 来源 |
| LiveCodeBench | reasoning general code | 93.2 | 来源 |
| LiveCodeBench Pro | code | 90.8 | 来源 |
| CharXiv Reasoning | general | 86.6 | 来源 |
| Terminal Bench 2.1 | code | 82.1 | 来源 |
| SWE Bench Pro | code | 73.7 | 来源 |
| Long Context Reasoning | general | 73.3 | 来源 |
| CTI-REALM | general | 69.4 | 来源 |
| SciCode | reasoning math physics chemistry code | 58.7 | 来源 |
| Humanity’s Last Exam | general | 50.0 | 来源 |
| τ3 Banking | general | 20.6 | 来源 |
Pricing
API 价格对比
| 服务商 | 输入价 | 输出价 | 上下文 | 吞吐(tok/s) | 延迟(s) | 函数调用 | 代码执行 | 联网搜索 |
|---|---|---|---|---|---|---|---|---|
| LLM Gateway | $5.00 | $30.00 | 1.0M | — | — | ✓ | ✗ | ✗ |
| Sakana AI | $5.00 | $30.00 | 1.0M | — | — | ✓ | ✗ | ✗ |
| EmpirioLabs AI | $7.50 | $45.00 | 1.0M | — | — | ✓ | ✗ | ✗ |
价格单位:美元/百万 token,数据来自社区整理,仅供参考。