计费精算

2026 OpenAI Prompt Caching 有效单价怎么算:命中率门槛与 $/M 对照

把官方 Prompt Caching 的输入/输出/缓存字段拆开,用命中率门槛把「标价」换算成真实有效 $/M,方便对账单时快速判断缓存是否真的省钱。

가이드 목록 · 본문은 주로 중국어 간체입니다. 영문 요약(English summary)을 참고하세요.

封面:2026 OpenAI Prompt Caching 有效单价怎么算:命中率门槛与 $/M 对照

## 2026 OpenAI Prompt Caching 有效单价怎么算:命中率门槛与 $/M 对照

OpenAI 的 Prompt Caching 功能在 2026 年已全面升级,能自动为重复的前缀输入(cached input)提供折扣。许多使用 OpenAI API 的开发者会看到账单里标价时直接套用常规输入单价,但实际只占 10% 的 cached 部分却按更低价格计费。本文针对对账单的读者,拆解官方价表中的 cached input 字段、给出命中率门槛公式、结合 GPT-4o / o 系列等常见模型的真实 $/M 数据,教你把「看起来省」变成「对得上账单」。

官方价表里缓存字段的准确含义:cached input 与普通 input 的差异

OpenAI API 定价页把输入 token 分成两类:普通 input(全价)和 cached input(折扣价)。后者仅适用于精确匹配的前缀(通常前 1024+ tokens),OpenAI 会自动缓存并重复利用这些 token,跳过注意力计算,成本和延迟都大幅下降。

字段 含义 典型场景 计费特点
cached input 命中缓存的输入 token 重复系统提示、工具定义等 按折扣率计费(约 10% 的常规输入价)
ordinary input 未命中缓存的新输入 token 每次变动的用户消息或上下文 按全价计费
cache_write 写入缓存的 token(GPT-5.6 及以后) 首次命中时的前缀 部分模型按 1.25 倍全价计费

注意:这些字段在 usage 响应体里可见,开发者无需额外代码即可触发(适用于所有支持缓存的模型,包括 GPT-4o 及更新版本)。

命中率门槛公式:什么时候缓存后的有效单价才低于无缓存

公式非常简单:只要有效单价($ /M)低于无缓存标价,就值得启用。关键是 cached input 部分按折扣率计费。

有效单价 =(cached tokens × cached_rate + uncached tokens × standard_rate) / total_input_tokens

门槛公式(cached_rate / standard_rate = 0.1 时):

  • 命中率 > 50% 时,缓存必定省钱(即使只有一半 token 命中,整体已低于全价)。
  • 实际门槛约 40–50%,具体看折扣力度(GPT-5.6 系列通常 90% 折扣,GPT-4o 约 50%)。

示例计算(假设 cached_rate = standard_rate / 10):

  • 标准输入 5.00 $/M,缓存后 0.50 $/M。
  • 总输入 10,000 tokens,命中率 60%(6,000 cached + 4,000 uncached)。
  • 有效单价 = (6,000 × 0.50 + 4,000 × 5.00) / 10,000 = 2.20 $/M < 5.00 $/M → 节省 56%。

如果你对账单发现 cached_tokens 字段占比低,优先优化提示结构,让常用前缀固定。

常见模型(GPT-4o / o 系列)的缓存折扣与 token 计费规则对照

2026 年 GPT-5 系列是主力,GPT-4o 仍支持但折扣稍弱。以下是官方数据对照(短上下文标准处理价,长期上下文另议):

模型 标准 input $/M cached input $/M 折扣 缓存写入费(GPT-5.6 后) 输出 $/M 适用场景
gpt-5.6-sol 5.00 0.50 90% 6.25 30.00 大模型代理,最高命中率
gpt-5.6-terra 2.00 0.20 90% 2.50 12.00 日常对话与工具调用
gpt-5.6-luna 0.20 0.02 90% 0.25 1.20 高频轻量任务
gpt-5.5 5.00 0.50 90% 30.00 经典 o 系列兼容
o3 / o4-mini 2.00 0.50 75% 8.00 推理密集任务
gpt-4o 2.50 1.25 50% 10.00 老项目仍可复用

中文 token 近似:中文常比英文多 20–40% tokens,实际对账时以官方 tokenizer 为准。ChatGPT Plus 试用订阅的用户可对比官方定价页,快速判断是否转用 API 更划算。

对账单实操:如何从 usage 日志提取缓存命中 tokens 并反推有效 $/M

OpenAI 官方 API 返回的 usage 对象包含精确字段:

1. 在请求响应体中找到 usage.prompt_tokens_details.cached_tokens(或 input_tokens_details.cached_tokens)。

2. prompt_tokens = 总输入 token。

3. 命中率 = cached_tokens / prompt_tokens。

4. 总输入成本 = (cached_tokens × cached_rate + (prompt_tokens - cached_tokens) × standard_rate) / 1,000,000。

5. 输出成本直接用 output 字段计费。

快速工具建议:参考 官方 API 文档计费对照指南,开发者可在代码中打印 usage 字段,导入到 Excel 或脚本中一键计算。结合 Batch API(异步模式)还能再减半,进一步优化。

缓存失效场景与重新写入成本:避免「看起来省、实际不省」

缓存默认保留 5–10 分钟(GPT-5.6 后默认 24 小时非零数据保留),但:

  • 上下文修改、会话超时、用户输入差异都会导致 miss。
  • GPT-5.6 系列首次写入按 1.25 倍标准输入计费(例如 6.25 $/M vs 5.00 $/M)。

避免策略

  • 固定系统提示和工具定义为缓存断点。
  • 让用户消息变化小,上下文增长缓慢。
  • 监控日志:miss 率 > 30% 时需优化提示模板。
  • 失效后重新写入成本仅在低频场景显著增加,适合高并发应用。

与 Batch API 折扣的叠加决策:何时同时启用更划算

Batch API 可把输入价直接减半(例如 GPT-5.6-sol 批处理输入 2.50 $/M)。Prompt Caching 与 Batch 兼容,但需注意:

  • Batch 支持缓存写入,但首次写入可能仍按 1.25 倍计费。
  • 推荐场景:高频且上下文稳定的任务(如批量数据处理)同时启用,叠加可达 70%+ 节省。
  • 决策 checklist:缓存命中率 > 60% + Batch 任务量 > 1,000 tokens/请求 时叠加最划算。

快速速查表:不同命中率下的有效单价对照

(基于 gpt-5.6-terra 标准价 2.00 $/M,缓存 0.20 $/M 示例,横向滚动查看)

命中率(%) cached input 贡献 有效单价($/M) vs 无缓存节省 推荐动作
50 1,000 / 2,000 1.10 45% 立即启用
70 1,400 / 2,000 0.74 63% 优化缓存断点
90 1,800 / 2,000 0.38 81% 批量任务优先
30 600 / 2,000 1.40 30% 检查提示结构

## 延伸阅读

风险与边界

缓存命中率受上下文匹配度影响,极端情况下(完全随机前缀)可能不省钱。官方数据以 OpenAI 官方定价页 或开发者平台为准,本文仅供参考,非法律意见。实际账单请以 OpenAI 后台最终计费为准。