
## OpenAI Prompt Caching 命中率门槛:什么时候缓存才真正省 $/M
OpenAI Prompt Caching(提示词缓存)是官方 API 自动为 GPT-4o 及后续模型提供的功能,能把重复的前缀(通常 1024 个 token 起)以折扣价处理,账单中通过 cached_tokens 字段显示节省金额。它适合重复上下文的场景:多轮对话、Agent 任务、长上下文 ChatGPT Plus API 使用者。
什么时候值得强制开缓存? 命中率超过 60-80% 时,累计节省才能盖过写入成本;低于此门槛,账单可能反而更高。
怎么决策? 用以下公式、表格和账单字段核对即可。数据以官方 API 计费页为准(官方 API 价格),建议结合 API 计费对照 工具验证。
官方价表里 Input / Cached Input 字段怎么读
OpenAI API 账单中会拆解字段:
- prompt_tokens:总输入 token 数(包括缓存和非缓存)
- input_tokens_details.cached_tokens:命中缓存的 token 数(折扣价)
- cache_write_tokens(GPT-5.6 及以后模型):写入缓存的 token 数(按 1.25 倍标准输入价)
- cached_input / Input:模型定价表中的对比字段
官方 API 价格 和 官方定价文档 直接列出了每模型的标准输入与缓存单价。举例:GPT-4o 系列标准输入 $2.50/M,缓存 $1.25/M;o1 系列标准 $15.00/M,缓存 $7.50/M。这些字段直接影响账单总和。
缓存命中后的有效 $/M 计算公式
缓存命中后,有效成本 =(非缓存输入 token + 缓存命中 token 的折扣价 + 输出 token + 写入成本)/ 总 token
简化公式(推荐场景):
$$
\text{有效单价} = \frac{\text{非缓存输入} \times \text{标准价} + \text{缓存命中} \times \text{缓存价} + \text{输出} \times \text{输出价}}{\text{总 token}}
$$
盈亏平衡点:设总上下文 $L$ token、命中率 $h$($0 \leq h \leq 1$)、写入成本 $W$:
$$
\text{总成本} = L \times (1 - h) \times \text{标准价} + h \times L \times \text{缓存价} + W \times \text{写入量}
$$
命中率门槛 = 当总成本 < 无缓存标准成本时所需 $h$。
缓存写入一次 vs 多次命中的累计成本:写入一次可覆盖后续多次命中(缓存保留 5-10 分钟或更长),典型 Agent 任务(system prompt + 工具历史)可达到 $h = 80-90\%$。
账单侧如何核对缓存命中量与折扣金额:对比 cached_tokens 与总输入,乘以模型缓存价差即可验证节省。参考 账单路径 工具页面。
不同模型的命中率盈亏平衡表
下表基于官方定价计算(上下文长度 < 270K,标准处理模式;实际以 官方定价文档 当日数据为准)。阈值 = 总成本 ≤ 无缓存标准成本时的最低命中率。
| 模型 | 标准输入 ($/M) | 缓存输入 ($/M) | 写入成本 ($/M) | 命中率阈值 | 典型适用场景 | 上下文长度示例(100k token) |
|---|---|---|---|---|---|---|
| GPT-4.1 | 2.00 | 0.50 | - | 55% | 日常 ChatGPT API 多轮对话 | $h \geq 55\%$ 可省 20%+ |
| GPT-4.1 mini | 0.40 | 0.10 | - | 60% | 轻量 Agent / mini 任务 | $h \geq 60\%$ 可省 35%+ |
| o1 / o3-mini | 15.00 / 1.10 | 7.50 / 0.55 | - | 75% | 复杂推理任务(适合 o1) | $h \geq 75\%$ 可省 50%+ |
| GPT-5.6 Sol | 5.00 | 0.50 | 6.25 | 80% | 高流量 Agent(写入后稳定) | $h \geq 80\%$ 可省 60%+ |
| GPT-5.6 Terra | 2.00 | 0.20 | 2.50 | 70% | 中高流量批量任务 | $h \geq 70\%$ 可省 45%+ |
| GPT-5.6 Luna | 0.20 | 0.02 | 0.25 | 65% | 低成本日常工作 | $h \geq 65\%$ 可省 80%+ |
数据来源:官方 API 价格 和 官方定价文档。提示:mini 模型阈值较高,适合低命中率场景;旗舰模型阈值低,适合稳定上下文。
上下文长度与缓存写入成本的实际影响
上下文越长(>10k token),缓存收益越高(折扣单价随长度放大)。写入成本影响:GPT-5.6 及以后模型写入一次(1.25× 标准输入)后,后续命中免费折扣处理;提前写入稳定前缀可避免重复写入。
实际影响示例:100k 上下文、$h=70\%$,GPT-5.6 Luna 写入后总成本降至原 80%(缓存写入 0.25/M 摊薄后)。
决策阈值:上下文 < 1k token 基本不缓存;>10k 且命中率 >65% 优先。结合 API 计费对照 工具模拟估算。
账单侧如何核对缓存命中量与折扣金额
1. 导出账单,查看 input_tokens_details.cached_tokens vs prompt_tokens。
2. 计算折扣金额 = cached_tokens × 模型缓存价差。
3. 与 usage 字段总输入对比,验证是否实省。
4. GPT-5.6 后注意 cache_write_tokens(写入)是否已计入。
工具推荐:账单核对工具 可一键对比字段。
什么场景开缓存反而更贵:反例与决策阈值
- 反例:单次调用($h<20\%$)、短上下文(<1k token)、GPT-5.6 以上高写入模型(写入成本被摊薄后仍亏)。
- 决策阈值:命中率 < 50% 或总成本 > 无缓存时,关闭缓存。典型 Agent 任务(system prompt 固定 + 用户历史多轮)最适合,假设 $h=80-90\%$ 可省 50%+。
检查清单:先看账单字段,再模拟上下文长度。
与 Batch API 折扣叠加时的优先级建议
Batch API 整体 -50% 折扣叠加缓存后,优先级:先确保缓存命中率 >60%(盖写成本),再启用 Batch(对静态上下文最优)。o1 系列与 Batch 结合可进一步降至 25% 有效价。
API 计费对照 工具支持叠加模拟。
## 风险与边界
以上基于官方模型定价与缓存机制编写,仅供参考,不构成任何法律意见或投资建议。实际价格、可用性及功能可能随 OpenAI 调整而变化,请以 官方定价文档 和 官方 API 价格 当日数据为准。缓存命中率高度依赖业务上下文设计,建议通过账单字段验证后再投入生产。