
# 2026 OpenAI 官方 Token 价表怎么读:输入/输出/缓存字段全拆解
OpenAI API 开发者与对账者必读的2026最新价表解读指南。
本文专为每月需精确计算账单的用户设计,帮助你轻松拆解 GPT-5.6 Luna/Terra/Sol 系列的输入、输出、缓存字段,以及长上下文差异,避免 $ / M tokens 混淆。
适合:
- 使用 OpenAI API 的开发者
- 需要每月对账的人
- 想区分 ChatGPT Plus 与 API 计费的团队
核心决策方法:以官方开发者文档页面为准,直接复制表格字段计算你的请求。数据基于2026年8月官方最新挂牌(标准处理)。
2026 OpenAI API 官方价格更新概述
OpenAI 于2026年7月30日对 GPT-5.6 系列进行价格调整,Luna 和 Terra 价格分别下降80%和20%,Sol 保持不变,同时新增 Prompt Caching 机制,Cache Writes 明确计费规则。
定价单位为 $ / M tokens(每百万 tokens)。官方开发者文档已更新完整字段对比表,覆盖短上下文(<272K tokens)和长上下文(≥272K tokens)。
推荐直接查看官方数据:
查看 OpenAI API 官方定价页面(含标准/Batch/Fast Mode 完整表格)
GPT-5.6 Luna/Terra/Sol 核心价表字段对比
以下表格来自官方标准定价(短上下文为主,长上下文另计)。移动端横向滚动查看完整字段。
| 字段 | Luna ($/M) | Terra ($/M) | Sol ($/M) | 说明 |
|---|---|---|---|---|
| 输入(Standard) | 0.20 | 2.00 | 5.00 | 普通 Prompt |
| 缓存输入(Cached input) | 0.02 | 0.20 | 0.50 | 命中 Cache 时 90% 折扣 |
| Cache Writes | 0.25 | 2.50 | 6.25 | 首次写入 Cache(1.25× 输入价) |
| 输出 | 1.20 | 12.00 | 30.00 | 输出 Token 通常为输入的 6× |
长上下文规则(≥272K tokens):
- 输入字段 ×2
- 缓存输入 ×2
- Cache Writes ×2
- 输出 ×1.5
示例对比(标准处理):
| 模型 | 输入(短) | 输出(短) | 缓存输入 | Cache Writes |
|---|---|---|---|---|
| Luna | 0.20 | 1.20 | 0.02 | 0.25 |
| Terra | 2.00 | 12.00 | 0.20 | 2.50 |
| Sol | 5.00 | 30.00 | 0.50 | 6.25 |
输入与输出 Token 如何分开计费(真实例子)
OpenAI API 严格分开 输入 和 输出 计费,无混合。
真实例子(Luna 模型,短上下文,1次完整请求):
- 系统提示 + 用户消息:10K 输入 tokens
- 生成回复:500 输出 tokens
费用计算:
- 输入:10K × 0.0000002 = $0.002
- 输出:500 × 0.0000012 = $0.0006
- 总计:$0.0026
即使输出 token 量很少,只要有大 Prompt 也会产生费用。建议在 API 控制台开启 Token Counting 预估,避免超支。
Prompt Caching 缓存输入与 Cache Writes 解析
Prompt Caching(缓存机制)是2026年 GPT-5.6 新增核心优化:
- 缓存输入:命中 Cache 的部分仅按 10% 价格计费(90% 节省)。
- Cache Writes:首次写入 Cache 的 token 按 1.25× 标准输入价计费(例如 Luna 写 Cache 成本 0.25 $/M)。
使用场景:
- 重复系统提示、工具描述、RAG 文档等固定内容。
- 启用后,重复请求可大幅降低成本(官方称可省 90% 输入费用)。
注意:Cache Writes 首次写入时会产生额外费用,建议将稳定部分写 Cache,再用动态部分。
长上下文(Short vs Long Context)计费规则
官方明确区分:
- 短上下文:输入 < 272K tokens,按标准价。
- 长上下文:输入 ≥ 272K tokens,输入字段 ×2,输出字段 ×1.5。
长上下文示例(Luna):
- 300K 输入 tokens → 按 0.40 $/M 计算(而非 0.20)
- 即使缓存命中,缓存输入也按 ×2 计费。
决策建议:
- 日常任务保持 Prompt < 272K,使用 Luna 最划算。
- 超长上下文时,优先选择 Sol(旗舰性能),Luna 性价比最高。
Batch API 与 Fast Mode 折扣适用场景
- Batch API:提交后异步处理,标准折扣 50%(Luna 输入 0.10 $/M,输出 0.60 $/M)。适合离线批量任务(如日志分析、数据处理)。
- Fast Mode(原 Priority Processing):2× 标准价格,换取最高速度(Luna 输入 0.40 $/M,输出 2.40 $/M)。适合实时交互或低延迟需求。
适用场景:
- Batch:高量非实时任务(如每月报表)。
- Fast Mode:聊天、工具调用需快速响应的场景。
每月账单估算公式与对账清单模板
简单估算公式(Luna 示例,假设 50% 缓存命中率):
总费用 ($) = (输入 tokens / 1,000,000 × 0.20 × 0.5) + (输出 tokens / 1,000,000 × 1.20) + (缓存写入 tokens / 1,000,000 × 0.25)
对账清单模板(复制使用):
1. 统计本月:
- 输入 tokens(短 + 长)
- 输出 tokens
- 缓存命中率/写入量(从 API Dashboard 导出)
2. 按模型拆分计算:
| 模型 | 输入(M) | 输出(M) | 缓存写入(M) | 估算费用 |
|---|---|---|---|---|
| Luna | 50 | 10 | 30 | ≈ $15.5 |
| Terra | 10 | 5 | 5 | ≈ $18 |
| 总计 | - | - | - | ≈ $33.5 |
3. 对比 ChatGPT Plus:API 使用消耗更少时,建议切换 API。
常见误读与优化建议
常见误读:
- “Luna 便宜”只看输入价,忽略输出(输出通常 6× 输入)。
- 忘记长上下文 ×2 规则,导致超支。
- 未开启缓存,错过 90% 节省机会。
优化建议:
- 使用 Luna 处理日常,Sol 做复杂任务。
- 定期优化 Prompt 拆分(系统 + 用户分开缓存)。
- 在 API Dashboard 设置预算提醒。
- 查看官方 Token Counting 工具预估每次请求。
查看完整官方定价与 Token Counting 指南:
延伸阅读
风险与边界
以上内容仅供参考,以 OpenAI 官方开发者文档为准(https://developers.openai.com/api/docs/pricing)。价格可能随模型更新调整,建议每次使用前核对最新数据。
非法律意见声明:本文不构成法律、税务或财务建议。如需精确对账,请咨询 OpenAI 官方支持或专业会计师。