官方API

2026 OpenAI 官方 Token 价表怎么读:输入/输出/缓存字段全拆解

本指南专为 OpenAI API 开发者与对账者提供2026最新官方价表解读方法,重点拆解 GPT-5.6 系列(Luna/Terra/Sol)输入、输出、缓存字段,以及长上下文差异,帮你准确计算每月账单。

ガイド一覧 · 本文は主に簡体字中国語です。国際向けの要点は English summary をご利用ください。

封面:2026 OpenAI 官方 Token 价表怎么读:输入/输出/缓存字段全拆解

# 2026 OpenAI 官方 Token 价表怎么读:输入/输出/缓存字段全拆解

OpenAI API 开发者与对账者必读的2026最新价表解读指南

本文专为每月需精确计算账单的用户设计,帮助你轻松拆解 GPT-5.6 Luna/Terra/Sol 系列的输入、输出、缓存字段,以及长上下文差异,避免 $ / M tokens 混淆。

适合:

  • 使用 OpenAI API 的开发者
  • 需要每月对账的人
  • 想区分 ChatGPT Plus 与 API 计费的团队

核心决策方法:以官方开发者文档页面为准,直接复制表格字段计算你的请求。数据基于2026年8月官方最新挂牌(标准处理)。

2026 OpenAI API 官方价格更新概述

OpenAI 于2026年7月30日对 GPT-5.6 系列进行价格调整,Luna 和 Terra 价格分别下降80%和20%,Sol 保持不变,同时新增 Prompt Caching 机制,Cache Writes 明确计费规则。

定价单位为 $ / M tokens(每百万 tokens)。官方开发者文档已更新完整字段对比表,覆盖短上下文(<272K tokens)和长上下文(≥272K tokens)。

推荐直接查看官方数据

查看 OpenAI API 官方定价页面(含标准/Batch/Fast Mode 完整表格)

GPT-5.6 Luna/Terra/Sol 核心价表字段对比

以下表格来自官方标准定价(短上下文为主,长上下文另计)。移动端横向滚动查看完整字段。

字段 Luna ($/M) Terra ($/M) Sol ($/M) 说明
输入(Standard) 0.20 2.00 5.00 普通 Prompt
缓存输入(Cached input) 0.02 0.20 0.50 命中 Cache 时 90% 折扣
Cache Writes 0.25 2.50 6.25 首次写入 Cache(1.25× 输入价)
输出 1.20 12.00 30.00 输出 Token 通常为输入的 6×

长上下文规则(≥272K tokens):

  • 输入字段 ×2
  • 缓存输入 ×2
  • Cache Writes ×2
  • 输出 ×1.5

示例对比(标准处理):

模型 输入(短) 输出(短) 缓存输入 Cache Writes
Luna 0.20 1.20 0.02 0.25
Terra 2.00 12.00 0.20 2.50
Sol 5.00 30.00 0.50 6.25

输入与输出 Token 如何分开计费(真实例子)

OpenAI API 严格分开 输入输出 计费,无混合。

真实例子(Luna 模型,短上下文,1次完整请求):

  • 系统提示 + 用户消息:10K 输入 tokens
  • 生成回复:500 输出 tokens

费用计算

  • 输入:10K × 0.0000002 = $0.002
  • 输出:500 × 0.0000012 = $0.0006
  • 总计:$0.0026

即使输出 token 量很少,只要有大 Prompt 也会产生费用。建议在 API 控制台开启 Token Counting 预估,避免超支。

Prompt Caching 缓存输入与 Cache Writes 解析

Prompt Caching(缓存机制)是2026年 GPT-5.6 新增核心优化:

  • 缓存输入:命中 Cache 的部分仅按 10% 价格计费(90% 节省)。
  • Cache Writes:首次写入 Cache 的 token 按 1.25× 标准输入价计费(例如 Luna 写 Cache 成本 0.25 $/M)。

使用场景

  • 重复系统提示、工具描述、RAG 文档等固定内容。
  • 启用后,重复请求可大幅降低成本(官方称可省 90% 输入费用)。

注意:Cache Writes 首次写入时会产生额外费用,建议将稳定部分写 Cache,再用动态部分。

长上下文(Short vs Long Context)计费规则

官方明确区分:

  • 短上下文:输入 < 272K tokens,按标准价。
  • 长上下文:输入 ≥ 272K tokens,输入字段 ×2,输出字段 ×1.5。

长上下文示例(Luna):

  • 300K 输入 tokens → 按 0.40 $/M 计算(而非 0.20)
  • 即使缓存命中,缓存输入也按 ×2 计费。

决策建议

  • 日常任务保持 Prompt < 272K,使用 Luna 最划算。
  • 超长上下文时,优先选择 Sol(旗舰性能),Luna 性价比最高。

Batch API 与 Fast Mode 折扣适用场景

  • Batch API:提交后异步处理,标准折扣 50%(Luna 输入 0.10 $/M,输出 0.60 $/M)。适合离线批量任务(如日志分析、数据处理)。
  • Fast Mode(原 Priority Processing):2× 标准价格,换取最高速度(Luna 输入 0.40 $/M,输出 2.40 $/M)。适合实时交互或低延迟需求。

适用场景

  • Batch:高量非实时任务(如每月报表)。
  • Fast Mode:聊天、工具调用需快速响应的场景。

每月账单估算公式与对账清单模板

简单估算公式(Luna 示例,假设 50% 缓存命中率):

总费用 ($) = (输入 tokens / 1,000,000 × 0.20 × 0.5) + (输出 tokens / 1,000,000 × 1.20) + (缓存写入 tokens / 1,000,000 × 0.25)

对账清单模板(复制使用):

1. 统计本月:

- 输入 tokens(短 + 长)

- 输出 tokens

- 缓存命中率/写入量(从 API Dashboard 导出)

2. 按模型拆分计算:

模型 输入(M) 输出(M) 缓存写入(M) 估算费用
Luna 50 10 30 ≈ $15.5
Terra 10 5 5 ≈ $18
总计 - - - ≈ $33.5

3. 对比 ChatGPT Plus:API 使用消耗更少时,建议切换 API。

常见误读与优化建议

常见误读

  • “Luna 便宜”只看输入价,忽略输出(输出通常 6× 输入)。
  • 忘记长上下文 ×2 规则,导致超支。
  • 未开启缓存,错过 90% 节省机会。

优化建议

  • 使用 Luna 处理日常,Sol 做复杂任务。
  • 定期优化 Prompt 拆分(系统 + 用户分开缓存)。
  • 在 API Dashboard 设置预算提醒。
  • 查看官方 Token Counting 工具预估每次请求。

查看完整官方定价与 Token Counting 指南

OpenAI API 官方定价与工具

延伸阅读

风险与边界

以上内容仅供参考,以 OpenAI 官方开发者文档为准(https://developers.openai.com/api/docs/pricing)。价格可能随模型更新调整,建议每次使用前核对最新数据。

非法律意见声明:本文不构成法律、税务或财务建议。如需精确对账,请咨询 OpenAI 官方支持或专业会计师。