刷新

OpenAI GPT-5.6 官方缓存价格详解:Cache 怎么读与省钱门槛

内容刷新 / GEO:补 English summary 与最新核对清单 — oa-2026-gpt-5-6-cache-discount

返回指南列表

封面:OpenAI GPT-5.6 官方缓存价格详解:Cache 怎么读与省钱门槛

OpenAI GPT-5.6 官方缓存价格详解:Cache 怎么读与省钱门槛

分类:刷新

摘要: 本文介绍 OpenAI GPT-5.6 系列模型的官方 Prompt Caching 功能如何通过 Cache Read 实现输入令牌(Input Tokens)的定价折扣(通常输入价的 1/10 左右),并详细说明 Cache 如何读写、有效缓存期限、触发条件以及实际省钱门槛。适用于所有使用 OpenAI API 的开发者、ChatGPT Plus 企业级用户和企业级账号,对账单时需要精确区分 Cached Input 与普通 Input。数据以 OpenAI 官方 API 定价页面为准,适用于 GPT-5.6 Sol、Terra、Luna 等子模型。

现状与数据更新

GPT-5.6 于 2026 年 6 月底至 7 月初在 ChatGPT、Codex 和 OpenAI API 上正式发布,包含 Sol、Terra、Luna 三款变体。官方 Prompt Caching 在这些模型上得到显著优化,引入了更稳定的缓存点中断和最短 30 分钟缓存时长。 [[1]](https://openai.com/pt-PT/index/gpt-5-6/)

目前 GPT-5.6 官方定价(输入 / 输出 / Cached Input,每百万 Tokens)如下表所示(数据来源于 OpenAI 定价页面,价格可能随促销调整):

模型 Input ($/M) Cached Input ($/M) Output ($/M)
GPT-5.6 Sol 5.00 0.50 30.00
GPT-5.6 Terra 2.50 0.25 15.00
GPT-5.6 Luna 1.00 0.10 6.00

相比普通 Input,Cache Read 可带来 80%~90% 的输入成本节省,这正是开发者在高频对话或多轮代码编辑场景中能大幅降低账单的关键。

核对清单

在使用 GPT-5.6 时,以下清单可帮助你快速验证缓存是否生效、账单是否正确:

  • 是否启用 Prompt Caching:在 API 调用中添加 cache_control 参数(OpenAI SDK 已默认支持)。
  • 查看 Cache Hit:响应头中会出现 x-ratelimit-remaining-tokens 或 OpenAI Dashboard 的缓存统计字段。
  • Cached Input 与普通 Input 对比:账单中输入 Token 总额中,Cache Hit 部分按 10% 价计费。
  • Cache 有效期限:缓存条目最短 30 分钟,过期后自动失效。
  • 输出 Token 不参与 Cache Discount:仅输入部分享受折扣。
  • API 版本更新:确保使用最新 SDK(v1.54+ 或更高),旧版本可能无法触发缓存点。
  • 企业级验证:ChatGPT Plus/Pro/Business/Enterprise 账户支持相同缓存机制,但需在 Dashboard 的 “Usage” 页面查看 Token 细分。

建议在 /official-api 页面查看最新模型列表和实时定价。

风险与边界

注意:本内容仅为 OpenAICN 基于公开官方文档和定价页面的说明,非法律意见或专业财务咨询。请以 OpenAI 官方定价页面或开发者控制台为准,实际账单可能因促销、地区税费、批量处理等因素略有差异。

风险边界包括:

  • 缓存点丢失:若对话上下文发生重大改变(例如用户输入与系统提示不匹配),缓存会被立即清空,导致原价计费。
  • 企业级 vs API 价格:ChatGPT Plus 订阅与纯 API 定价不同,企业用户可能享受额外折扣,但 Cache Read 规则一致。
  • 本地测试误判:在 Cursor、Claude Code 等第三方 IDE 中测试时,需确认调用路径是否正确,否则无法验证 Cache Hit。
  • 大模型变体差异:Luna 系列缓存节省最明显,但 Sol 系列最强性能下缓存折扣仍保持一致。
  • 对不上账:如果账单中输入 Token 总量与 Dashboard 显示不符,通常是缓存过期或 API 版本问题,建议联系 OpenAI 支持。

若未正确配置缓存,实际支出将接近普通 Input 价格(节省门槛无法达到)。

站内路径

延伸阅读

English summary

This guide explains OpenAI GPT-5.6 official Prompt Caching prices in detail: how to read cache hits and what the savings threshold is. GPT-5.6 (Sol, Terra, Luna variants) launched in July 2026 with improved caching, offering automatic discounts on input tokens (typically 80-90% off) when the same prompt context is reused. OpenAI charges full input prices for new tokens but only a fraction (~10% of input rate) for cache reads, saving significantly on long conversations or repeated code edits in tools like Cursor. Cache expires after a minimum of 30 minutes; output tokens do not qualify for discounts. Pricing as of September 2026: GPT-5.6 Sol $5/M input (cache $0.50/M), Terra $2.50/M ($0.25/M), Luna $1/M ($0.10/M). Always verify latest rates in the OpenAI Dashboard and ensure proper cache_control usage. This is useful for accurate billing, distinguishing Plus subscriptions from pure API costs, and avoiding unexpected charges. For developers building agents or multi-turn apps, caching is essential to stay within budget.

(正文字数约 2450,去除空白字符后中文为主,适合搜索引擎与移动端阅读)