GPT-5 is our flagship model for coding, reasoning, and agentic tasks across domains. The best model for coding and agentic tasks with higher reasoning capabilities and medium speed.
发布日期2025年8月7日
参数规模—
上下文长度400K
许可证Proprietary
知识截止2024年9月30日
Benchmarks
评测成绩
| 评测基准 | 类别 | 分数 | 来源 |
|---|---|---|---|
| SWE-Lancer (IC-Diamond subset) | reasoning code | 100.0 | 来源 |
| COLLIE | language reasoning writing | 99.0 | 来源 |
| Tau2 telecom | communication reasoning | 96.7 | 来源 |
| OpenAI-MRCR: 2 needle 128k | long_context reasoning | 95.2 | 来源 |
| AIME 2025 | math reasoning | 94.6 | 来源 |
| HumanEval | reasoning code | 93.4 | 来源 |
| HMMT 2025 | math | 93.3 | 来源 |
| MMLU | general reasoning language math | 92.5 | 来源 |
| BrowseComp Long Context 128k | reasoning search | 90.0 | 来源 |
| BrowseComp Long Context 256k | reasoning search | 88.8 | 来源 |
| Aider-Polyglot | general code | 88.0 | 来源 |
| OpenAI-MRCR: 2 needle 256k | long_context reasoning | 86.8 | 来源 |
| VideoMME w sub. | vision multimodal video | 86.7 | 来源 |
| GPQA | reasoning general | 85.7 | 来源 |
| MATH | math reasoning | 84.7 | 来源 |
| VideoMMMU | multimodal vision reasoning | 84.6 | 来源 |
| MMMU | multimodal reasoning general | 84.2 | 来源 |
| Tau2 retail | communication reasoning | 81.1 | 来源 |
| CharXiv-R | reasoning vision multimodal | 81.1 | 来源 |
| MMMU-Pro | vision multimodal reasoning general | 78.4 | 来源 |
| Graphwalks BFS <128k | reasoning spatial_reasoning | 78.3 | 来源 |
| SWE-Bench Verified | reasoning frontend_development code | 74.9 | 来源 |
| Graphwalks parents <128k | reasoning spatial_reasoning | 73.3 | 来源 |
| Scale MultiChallenge | reasoning communication general | 69.6 | 来源 |
| MultiChallenge (o3-mini grader) | reasoning language | 69.6 | 来源 |
| ERQA | vision reasoning spatial_reasoning | 65.7 | 来源 |
| Internal API instruction following (hard) | general | 64.0 | 来源 |
| Tau2 airline | reasoning communication | 62.6 | 来源 |
| BrowseComp | reasoning search | 54.9 | 来源 |
| FrontierMath | math reasoning | 26.3 | 来源 |
| Humanity's Last Exam | general | 24.8 | 来源 |
| HealthBench Hard | healthcare | 1.6 | 来源 |
| FactScore | reasoning | 1.0 | 来源 |
| LongFact-Objects | general reasoning | 0.8 | 来源 |
| LongFact-Concepts | general reasoning | 0.7 | 来源 |
Pricing
API 价格对比
| 服务商 | 输入价 | 输出价 | 上下文 | 吞吐(tok/s) | 延迟(s) | 函数调用 | 代码执行 | 联网搜索 |
|---|---|---|---|---|---|---|---|---|
| OpenCode Zen | $1.07 | $8.50 | 272K | — | — | ✓ | ✗ | ✗ |
| 302.AI | $1.25 | $10.00 | 272K | — | — | ✓ | ✗ | ✗ |
| Abacus | $1.25 | $10.00 | 272K | — | — | ✓ | ✗ | ✗ |
| Azure | $1.25 | $10.00 | 272K | — | — | ✓ | ✗ | ✗ |
| Azure Cognitive Services | $1.25 | $10.00 | 272K | — | — | ✓ | ✗ | ✗ |
| Helicone | $1.25 | $10.00 | 400K | — | — | ✓ | ✗ | ✗ |
| LLM Gateway | $1.25 | $10.00 | 272K | — | — | ✓ | ✗ | ✗ |
| Neon | $1.25 | $10.00 | 272K | — | — | ✓ | ✗ | ✗ |
| OpenAI | $1.25 | $10.00 | 272K | — | — | ✓ | ✗ | ✗ |
| SAP AI Core | $1.25 | $10.00 | 272K | — | — | ✓ | ✗ | ✗ |
价格单位:美元/百万 token,数据来自社区整理,仅供参考。