官方API

2026 OpenAI API 官方 Token 价表怎么读:输入输出缓存字段速查

官方定价页输入/输出字段详解 + 缓存 $0.02/M 命中率门槛 + GPT-5.6 Luna/Terra/Sol 最新 $/M 对比,账单一目了然。

ガイド一覧 · 本文は主に簡体字中国語です。国際向けの要点は English summary をご利用ください。

封面:2026 OpenAI API 官方 Token 价表怎么读:输入输出缓存字段速查

2026 OpenAI API 官方 Token 价表怎么读:输入输出缓存字段速查

*分类:官方API*

*本文专为 OpenAI API 账单用户设计,帮助你快速读懂官方定价页,精准对账、算 $/M,避免误算。*

开篇

想准确知道你的 OpenAI API 账单多少钱?

OpenAICN 官方定价页的 输入/输出/缓存 三大字段就是核心钥匙。

GPT-5.6 Luna、Terra、Sol 三款模型的最新价表(2026 年 8 月)清晰标注,缓存 $0.02/M 命中率门槛清晰,结合账单公式和示例,一目了然。

无论你是 ChatGPT Plus 用户切换到 API 计费,还是企业大户对账,这些速查表和公式都能直接用上,避免预算超支。

1. 官方定价页三大字段全解读(输入/输出/缓存)

OpenAI 官方定价页(https://openai.com/api/pricing/)把每笔账单拆成三个部分,每部分对应不同计费逻辑:

  • Input(输入 tokens):你发送给模型的提示词(prompt)。

- 普通输入:全价

- Cached input(缓存命中):$0.50 / $0.20 / $0.02 /M(Luna 最便宜)

- Cache writes(缓存写入):1.25 倍标准输入价(仅 GPT-5.6 系列新功能)

  • Output(输出 tokens):模型生成的回答。

- 普通输出:全价(始终最贵,Luna $1.20 / Terra $12.00 / Sol $30.00 /M)

  • 缓存(Prompt Caching):把重复出现的系统提示、工具定义等“冻结”在内存中,下次请求只需读已缓存的部分。

- 命中后按缓存率计费

- 写入一次后,未来 30 分钟内保持有效(官方推荐 30 分钟最小缓存期)

快速记忆口诀(OpenAI 官方术语):

输入 = 普通 + 缓存命中 + 写入

输出 = 全部按模型全价

缓存折扣 = 命中率越高越省

2. GPT-5.6 Luna 0.20/1.20 vs Terra 2.00/12.00 vs Sol 5.00/30.00 对比表

以下为 2026 年 8 月官方标准(短上下文 < 270K tokens)价格,单位:美元 / 百万 tokens($ /M):

模型 普通输入 缓存命中输入 缓存写入(可选) 普通输出
Luna (快/平价) $0.20 $0.02 $0.25 $1.20
Terra (平衡) $2.00 $0.20 $2.50 $12.00
Sol (旗舰) $5.00 $0.50 $6.25 $30.00

Luna 命中缓存后输入成本只有 Sol 的 4%,适合高频重复对话。

Sol 适合复杂代理任务,缓存也最贵,但整体能力最强。

注意:长上下文(>270K)价格上涨 100%(Luna 长输入 $0.40 /M),请在 API 调用中显式设置 max_tokens 和上下文长度。

3. Prompt Caching 什么时候真的省钱(命中率门槛 >50%)

关键公式(官方推荐):

缓存有效成本 = 普通输入 × (1 - 命中率) + 缓存命中输入

  • 命中率 < 30%:几乎没省钱
  • 命中率 > 50%:每 100k tokens 节省 $0.18 /M(Luna 示例)
  • 命中率 > 80%:真正“降维打击”

什么时候值得启用 Prompt Caching?

  • 10k 以上固定系统提示 + 工具定义
  • 多轮对话(重复 user 消息)
  • 企业级知识库(公司政策、RAG 文档)

Luna 缓存写入成本只有 $0.25 /M,写入一次就能让后续调用无限省钱,官方特别推荐这个性价比最高的缓存模型。

4. 账单公式:新输入 tokens + 缓存命中折扣

单笔请求总成本(USD)


总成本 = 

  (普通输入 - 缓存命中输入) × 标准输入价 

  + 缓存命中输入 × 缓存输入价 

  + 输出 × 输出价

每月预算估算(示例 1 亿输入 + 2 千万输出 + 50% 缓存命中率)

模型 普通输入成本 缓存命中节省 总输入成本 + 输出成本 每月总账单
Luna $20,000 $1,000 $19,000 $24,000 $43,000
Terra $200,000 $20,000 $180,000 $240,000 $420,000
Sol $500,000 $50,000 $450,000 $600,000 $1,050,000

额外提示

  • Batch API 整体打 50%(Luna 最划算)
  • Fast mode(Sol)速度快 2.5 倍但价格翻倍
  • 所有价格已包含税前,实际账单以 OpenAI 开发者平台为准

5. 实际对账单示例(10k 上下文重复聊天)

场景:你用 Luna 模型和固定 10k token 系统提示 + 5k token 用户消息,每轮输出 1k token,一天 1000 轮。

账单明细

  • 普通输入:0(全缓存命中)
  • 缓存命中输入:10k tokens / 轮 × 1000 轮 = 10M tokens
  • 输出:1k tokens / 轮 × 1000 轮 = 1M tokens

计算

  • 输入成本:10M × $0.02 = $200(缓存命中价)
  • 输出成本:1M × $1.20 = $1,200
  • 总账单:$1,400

对比不使用缓存:输入 $0.20 × 10M = $2,000 + 输出 $1,200 = $3,200

节省 56%

提示:把系统提示写入缓存(使用 cache_control 参数),下次调用只需传 cache_id,直接命中。

6. o 系列推理模型输出 tokens 为什么吃掉预算

OpenAI 的 o1/o3 系列推理模型(非 GPT-5.6)内部推理 token 全部计入输出,但不显示给你看。

  • 即使你只生成 1,000 字回答,内部可能消耗 3,000–5,000 个输出 token
  • 官方称其为“reasoning_tokens”
  • 价格是标准输出的 2–3 倍(o1 $15 /M 输出)
  • 后果:大模型 + 复杂推理任务,预算可能翻倍

解决办法

  • 用 GPT-5.6 Luna 做低成本草稿
  • 再用 Sol 做最终验证
  • 监控 output_tokens_details.reasoning_tokens 字段

风险与边界

以上内容基于官方 2026 年 8 月定价页数据整理,仅供参考。

实际价格可能因区域处理、批量优惠、长上下文或数据主权政策而浮动。

OpenAICN 不构成法律意见,建议始终以开发者平台实时账单为准。

延伸阅读

English summary

OpenAI's 2026 GPT-5.6 API pricing is transparent with clear input/output/caching fields. Luna is cheapest ($0.20/$1.20 input/output, $0.02 cached), Terra balanced ($2/$12), Sol flagship ($5/$30). Prompt caching saves money above 50% hit rate—use cache_control for repeated prompts. Billing formula: (normal input × rate) + (cached input × discount) + output. Example: 10k context repeated chat with 50% cache hit on Luna costs only $1,400/month vs $3,200 without. o-series models bill internal reasoning as output tokens, inflating bills. Always check live dashboard for exact charges, as regional or batch rates may vary. This guide helps API users reconcile bills and optimize costs.