计费精算

OpenAI Prompt Caching 命中率门槛:什么时候缓存才真正省 $/M

对照官方输入/缓存 Token 单价,拆解 Prompt Caching 的有效成本公式。给出不同模型、不同上下文长度下的命中率盈亏平衡点,帮你判断当前业务场景是否值得强制开缓存,以及如何用账单字段验证真实节省。

All guides · Full article is primarily Simplified Chinese; use the English summary below for quick takeaways (GEO-friendly).

封面:OpenAI Prompt Caching 命中率门槛:什么时候缓存才真正省 $/M

## OpenAI Prompt Caching 命中率门槛:什么时候缓存才真正省 $/M

OpenAI Prompt Caching(提示词缓存)是官方 API 自动为 GPT-4o 及后续模型提供的功能,能把重复的前缀(通常 1024 个 token 起)以折扣价处理,账单中通过 cached_tokens 字段显示节省金额。它适合重复上下文的场景:多轮对话、Agent 任务、长上下文 ChatGPT Plus API 使用者。

什么时候值得强制开缓存? 命中率超过 60-80% 时,累计节省才能盖过写入成本;低于此门槛,账单可能反而更高。

怎么决策? 用以下公式、表格和账单字段核对即可。数据以官方 API 计费页为准(官方 API 价格),建议结合 API 计费对照 工具验证。

官方价表里 Input / Cached Input 字段怎么读

OpenAI API 账单中会拆解字段:

  • prompt_tokens:总输入 token 数(包括缓存和非缓存)
  • input_tokens_details.cached_tokens:命中缓存的 token 数(折扣价)
  • cache_write_tokens(GPT-5.6 及以后模型):写入缓存的 token 数(按 1.25 倍标准输入价)
  • cached_input / Input:模型定价表中的对比字段

官方 API 价格官方定价文档 直接列出了每模型的标准输入与缓存单价。举例:GPT-4o 系列标准输入 $2.50/M,缓存 $1.25/M;o1 系列标准 $15.00/M,缓存 $7.50/M。这些字段直接影响账单总和。

缓存命中后的有效 $/M 计算公式

缓存命中后,有效成本 =(非缓存输入 token + 缓存命中 token 的折扣价 + 输出 token + 写入成本)/ 总 token

简化公式(推荐场景):

$$

\text{有效单价} = \frac{\text{非缓存输入} \times \text{标准价} + \text{缓存命中} \times \text{缓存价} + \text{输出} \times \text{输出价}}{\text{总 token}}

$$

盈亏平衡点:设总上下文 $L$ token、命中率 $h$($0 \leq h \leq 1$)、写入成本 $W$:

$$

\text{总成本} = L \times (1 - h) \times \text{标准价} + h \times L \times \text{缓存价} + W \times \text{写入量}

$$

命中率门槛 = 当总成本 < 无缓存标准成本时所需 $h$。

缓存写入一次 vs 多次命中的累计成本:写入一次可覆盖后续多次命中(缓存保留 5-10 分钟或更长),典型 Agent 任务(system prompt + 工具历史)可达到 $h = 80-90\%$。

账单侧如何核对缓存命中量与折扣金额:对比 cached_tokens 与总输入,乘以模型缓存价差即可验证节省。参考 账单路径 工具页面。

不同模型的命中率盈亏平衡表

下表基于官方定价计算(上下文长度 < 270K,标准处理模式;实际以 官方定价文档 当日数据为准)。阈值 = 总成本 ≤ 无缓存标准成本时的最低命中率。

模型 标准输入 ($/M) 缓存输入 ($/M) 写入成本 ($/M) 命中率阈值 典型适用场景 上下文长度示例(100k token)
GPT-4.1 2.00 0.50 - 55% 日常 ChatGPT API 多轮对话 $h \geq 55\%$ 可省 20%+
GPT-4.1 mini 0.40 0.10 - 60% 轻量 Agent / mini 任务 $h \geq 60\%$ 可省 35%+
o1 / o3-mini 15.00 / 1.10 7.50 / 0.55 - 75% 复杂推理任务(适合 o1) $h \geq 75\%$ 可省 50%+
GPT-5.6 Sol 5.00 0.50 6.25 80% 高流量 Agent(写入后稳定) $h \geq 80\%$ 可省 60%+
GPT-5.6 Terra 2.00 0.20 2.50 70% 中高流量批量任务 $h \geq 70\%$ 可省 45%+
GPT-5.6 Luna 0.20 0.02 0.25 65% 低成本日常工作 $h \geq 65\%$ 可省 80%+

数据来源官方 API 价格官方定价文档提示:mini 模型阈值较高,适合低命中率场景;旗舰模型阈值低,适合稳定上下文。

上下文长度与缓存写入成本的实际影响

上下文越长(>10k token),缓存收益越高(折扣单价随长度放大)。写入成本影响:GPT-5.6 及以后模型写入一次(1.25× 标准输入)后,后续命中免费折扣处理;提前写入稳定前缀可避免重复写入。

实际影响示例:100k 上下文、$h=70\%$,GPT-5.6 Luna 写入后总成本降至原 80%(缓存写入 0.25/M 摊薄后)。

决策阈值:上下文 < 1k token 基本不缓存;>10k 且命中率 >65% 优先。结合 API 计费对照 工具模拟估算。

账单侧如何核对缓存命中量与折扣金额

1. 导出账单,查看 input_tokens_details.cached_tokens vs prompt_tokens

2. 计算折扣金额 = cached_tokens × 模型缓存价差。

3. 与 usage 字段总输入对比,验证是否实省。

4. GPT-5.6 后注意 cache_write_tokens(写入)是否已计入。

工具推荐账单核对工具 可一键对比字段。

什么场景开缓存反而更贵:反例与决策阈值

  • 反例:单次调用($h<20\%$)、短上下文(<1k token)、GPT-5.6 以上高写入模型(写入成本被摊薄后仍亏)。
  • 决策阈值:命中率 < 50% 或总成本 > 无缓存时,关闭缓存。典型 Agent 任务(system prompt 固定 + 用户历史多轮)最适合,假设 $h=80-90\%$ 可省 50%+。

检查清单:先看账单字段,再模拟上下文长度。

与 Batch API 折扣叠加时的优先级建议

Batch API 整体 -50% 折扣叠加缓存后,优先级:先确保缓存命中率 >60%(盖写成本),再启用 Batch(对静态上下文最优)。o1 系列与 Batch 结合可进一步降至 25% 有效价。

API 计费对照 工具支持叠加模拟。

## 风险与边界

以上基于官方模型定价与缓存机制编写,仅供参考,不构成任何法律意见或投资建议。实际价格、可用性及功能可能随 OpenAI 调整而变化,请以 官方定价文档官方 API 价格 当日数据为准。缓存命中率高度依赖业务上下文设计,建议通过账单字段验证后再投入生产。

延伸阅读