官方API

OpenAI Prompt Caching 2026 官方计费指南:输入缓存 $/M 与命中率门槛

详解 OpenAI GPT-5.6 系列与 o 系列官方 Prompt Caching 价格、缓存写/读倍率、自动触发机制及命中率门槛,帮助开发者对账单时精确计算 Cache 字段节省,免受 Plus 与 API 计费混淆。

ガイド一覧 · 本文は主に簡体字中国語です。国際向けの要点は English summary をご利用ください。

封面:OpenAI Prompt Caching 2026 官方计费指南:输入缓存 $/M 与命中率门槛

OpenAI Prompt Caching 2026 官方计费指南:输入缓存 $/M 与命中率门槛\n\nOpenAI Prompt Caching(提示词缓存)是官方 API 自动为开发者降低成本和延迟的核心功能。它适用于 GPT-5.6 系列与 o 系列等支持模型,当提示词包含重复的前缀(如系统提示词、工具定义或稳定上下文)时,OpenAI 会自动命中缓存,实现高达 90% 的输入 token 节省。适用于任何使用 OpenAI API 的开发者,尤其是构建多轮对话、Agent 工作流或批量任务的应用。开发者通过查看账单中的 cached_tokens 字段即可精确对账,避免将 Plus 订阅或非缓存输入计费混淆。\n\n## OpenAI 官方定价页最新 Token 价格表(2026 年 8 月)\n\n官方定价页面(https://platform.openai.com/docs/pricing)已明确区分普通输入与缓存输入。以下为 GPT-5.6 系列主力模型的标准价格(Short context 场景,上下文长度 <270K):\n\n| 模型 | 普通输入 ($/M) | 缓存输入 ($/M) | 输出 ($/M) |\n|-------------------|----------------|----------------|------------|\n| gpt-5.6-sol | 5.00 | 0.50 | 30.00 |\n| gpt-5.6-terra | 2.00 | 0.20 | 12.00 |\n| gpt-5.6-luna | 0.20 | 0.02 | 1.20 |\n\n对账单速查逻辑:普通输入按上述价格计费,缓存命中部分仅按缓存输入价格结算。长上下文场景价格通常翻倍(例如 sol 长上下文缓存输入为 1.00 $/M)。Batch API 提供约 50% 折扣,可与缓存叠加使用,具体见下方决策表。\n\n## Prompt Caching 如何自动工作:前缀缓存触发与 30 分钟/24 小时保留\n\nOpenAI Prompt Caching 完全自动,无需任何代码修改即可触发。机制基于以下步骤:\n1. 请求路由到预热过相同前缀的服务器。\n2. 检测精确前缀匹配(默认长度 ≥1024 tokens)。\n3. 命中时跳过重算,账单字段显示 cached_tokens(读入缓存部分),无需额外写费(GPT-5.6 之前模型)或仅需 1.25× 普通输入价格(GPT-5.6 及以后模型)。\n\n保留机制:\n- GPT-5.6 系列及以后:默认 30 分钟(可通过参数延长,最多更长,实际可能超过)。\n- 早期模型:支持 5-10 分钟或 24 小时扩展保留。\n- 命中率门槛:连续 5-10 次重复调用同一前缀即可有效命中并节省;高频 Agent 场景下 >60% 命中率即可实现显著节省(低于此则接近普通输入成本)。\n\n开发者可通过 prompt_cache_key 参数优化多键共享,进一步提升命中率。\n\n## GPT-5.6 系列 Cache 输入官方价格:$/M 倍率(0.02–0.50 范围)与写价 1.25 倍\n\nGPT-5.6 系列缓存输入价格为普通输入的 10%(0.02–0.50 $/M 范围)。Cache 写(仅 GPT-5.6 以后)按 1.25 倍普通输入价格计费,例如:\n- gpt-5.6-luna:普通输入 0.20 $/M,缓存读 0.02 $/M,写 0.25 $/M。\n- gpt-5.6-terra:写 2.50 $/M。\n\n节省计算公式(任一模型通用):\n``\n节省率 = (命中率 × 90%) - (非命中率 × 10%) - (写费影响)\n`\n例如:100% 命中(无写) = 90% 节省;80% 命中且需写 10% 前缀 = 净节省约 70%。\n\n## o 系列与早期模型缓存节省计算公式:命中率 >60% 即省钱\n\n早期模型(gpt-4o 及之前)缓存读仍享 50-75% 折扣,无写费。o 系列(o1、o3 等)虽官方定价页不显示缓存输入字段,但通过 implicit caching 自动启用,实际节省率与 GPT-5.6 一致(约 90% 输入折扣)。\n\n通用节省公式:\n`\n净节省 % = (1 - 命中率) × 0.9 - (写费影响 × 写率)\n`\n命中率 >60% 时,即使带写费,净节省仍为正(开发者账单中 cached_tokens + cache_write_tokens 可直接复核)。\n\n## 真实场景命中率门槛:系统提示词/工具定义重复时节省 %\n\n典型 Agent 或工具调用场景中,系统提示词与工具定义重复度极高,命中率可达 80-95%:\n- 重复系统指令(固定 2000+ tokens)节省 85-90% 输入成本。\n- 工具定义重复(函数描述/参数模板)节省 75-90%。\n- 聊天历史前缀重复(多轮对话)节省 70-85%。\n\n建议开发者将稳定内容放在提示词开头,并使用 prompt_cache_breakpoint 标记断点,可将命中率从 60% 提升至 90%以上,从而在账单中精确反映“Cache 字段”节省(例如 10k tokens 缓存读 = 节省 9k tokens)。\n\n## Batch API 与 Cache 叠加折扣表:延迟换折扣完整决策\n\nBatch API 提供 50% 基础折扣,可与 Prompt Caching 叠加使用(缓存读再享 90% 额外折扣)。延迟换折扣决策表:\n\n| 场景 | 普通输入 ($/M) | 缓存读 ($/M) | Batch 叠加 ($/M) | 推荐场景 |\n|-------------------------------|----------------|--------------|------------------|-------------------|\n| gpt-5.6-sol(短上下文) | 5.00 | 0.50 | 1.25(批 + 缓) | 低延迟任务 |\n| gpt-5.6-terra | 2.00 | 0.20 | 0.50 | 高频 Agent |\n| gpt-5.6-luna | 0.20 | 0.02 | 0.05 | 大规模批量 |\n| 早期模型(无写费) | 标准 | 0.10× | 0.50 | 聊天历史重复 |\n\n决策原则:命中率 >70% 时优先 Batch + Cache;延迟敏感场景保留标准模式。\n\n## 对账单字段速查:Input(缓存前) vs Cached Input vs Output\n\n账单字段直接反映缓存节省(从 OpenAI API 响应 usage 中获取):\n- Input(缓存前):完整提示词 token 数,原始计费基础。\n- Cached Input:命中缓存的 token 数,按缓存输入价格计费。\n- Output:生成 token 数,按输出价格计费。\n- Cache Write(可选,GPT-5.6+):新写前缀 token,按 1.25× 输入价格计费。\n- Usage.total:最终结算金额 = (普通输入 × 非缓存) + (缓存输入 × Cached) + 输出。\n\n示例:前缀 10k tokens 写一次 + 20 次读 9k tokens 缓存 = 节省约 9k tokens(90%),开发者只需对比账单“Cache 字段”与定价页即可。\n\n## 风险与边界\n\nPrompt Caching 为官方自动机制,无需手动优化,但建议保持提示词前缀一致以维持高命中率。非法律意见声明:本文基于 OpenAI 官方定价页与文档(https://platform.openai.com/docs/pricing 及 https://platform.openai.com/docs/guides/prompt-caching),纯属开发者对账参考,非投资或法律意见。实际计费以 OpenAI 官方账户为准,价格可能随模型更新调整。请查阅最新官方文档验证。\n\n## 延伸阅读\n- 官方 API 计费对照站首页\n- GPT Token 单价与 OpenAI API 价格表\n- API 流量与计费路径详解\n- 账单对账与优化指南\n- 更多 Prompt Caching 与 Token 成本工具参考\n\n## English summary\n\nOpenAI Prompt Caching 2026 official billing guide explains input cache $/M rates and hit rate thresholds for GPT-5.6 and o-series models. Developers can automatically save up to 90% on repeated prompt prefixes like system instructions or tool definitions. Cache works for prompts ≥1024 tokens with 30-minute minimum retention (longer in practice). For GPT-5.6+, cache writes cost 1.25× base input rate while reads get 90% off; early models have no extra write fee. Savings formulas and real-world examples (e.g., 80%+ hit rate on stable prefixes) help reconcile billing fields like cached_tokens vs cache_write_tokens`. Batch API overlays 50% discount with caching for cost optimization. Always verify latest rates on openai.com/api/pricing as they update monthly. This guide serves as a developer resource for precise cost calculation without mixing Plus subscriptions or API pricing.