计费精算

OpenAI Prompt Caching 2026 官方缓存价格:GPT-4o-mini 与 o1 缓存节省倍率指南

2026 年 OpenAI 官方 Prompt Caching 缓存价格及命中率门槛详解,输入输出 tokens 各 $0.15 / M(GPT-4o-mini),缓存节省倍率 50%~80% 计算公式与实际对账单对比表

가이드 목록 · 본문은 주로 중국어 간체입니다. 영문 요약(English summary)을 참고하세요.

封面:OpenAI Prompt Caching 2026 官方缓存价格:GPT-4o-mini 与 o1 缓存节省倍率指南

## OpenAI Prompt Caching 2026 官方缓存价格:GPT-4o-mini 与 o1 缓存节省倍率指南

OpenAI Prompt Caching 是官方 API 计费核心节省渠道。它自动为重复提示词前缀(prefix)提供折扣,无需手动启用或修改代码。适用于高频调用场景,如系统提示词重复或多轮对话。

谁适用? 开发者、产品经理和对账单负责人。如何决策? 当你的提示词前缀长度 ≥1024 tokens 且命中率 >50% 时,缓存即可显著降低输入 token 费用,避免对账单超支。

缓存节省倍率指南(GPT-4o-mini 与 o1 系列)帮你快速算出实际省钱效果,避免乱用导致意外账单。

OpenAI 官方 Prompt Caching 是什么:官方 API 计费核心概念

Prompt Caching(提示词缓存)让 OpenAI API 自动跳过重复处理已缓存的前缀,节省时间和费用。缓存仅影响输入 token,输出 token 不变。

核心规则:

  • 自动触发:只要提示词前缀与最近请求完全匹配且 ≥1024 tokens。
  • 命中后,缓存 token 以 50%~80% 折扣计费。
  • 无额外写费(GPT-5.6 系列后写费 1.25 倍,未写费模型仍免费写入)。
  • 保留期:5-10 分钟空闲,最高 1 小时;部分模型支持 24 小时扩展保留。

在对账单中,你会看到 cached_tokens 字段,标记命中量。这就是官方 API 计费最主要的节省工具之一。

2026 年官方缓存价格表:输入输出 / 缓存 $/M 最新字段

2026 年官方价格已随模型迭代更新,以下是当前公开字段(per 1M tokens):

Model Uncached Input Cached Input Output
GPT-4o-mini $0.15 $0.075 $0.60
o1-preview $15.00 $7.50 $60.00
o1-mini $3.00 $1.50 $12.00
GPT-4o (基准) $2.50 $1.25 $10.00

来源:OpenAI 官方定价与 Prompt Caching 指南。GPT-4o-mini 是最适合缓存优化的模型,因其低单价和高调用量。

命中率门槛:缓存什么时候真的省钱(50%+ 实测案例)

缓存并非对所有请求都省钱。有效门槛:

  • 最小前缀:1024 tokens(低于则不缓存)。
  • 命中率门槛:>50% 时才具节省价值。低于 30% 建议优化提示词结构。

实测案例(GPT-4o-mini,高频场景)

  • 系统提示词 2000 tokens,80 000 次调用,日均 5000 次请求。
  • 命中率 80%:输入缓存节省 50%(从 $0.15/M 到 $0.075/M)。
  • 每月节省约 $6,500(输入部分)。

低命中率场景(<50%):输出 token 占预算 70%+ 时,缓存效果有限。建议用 prompt_cache_key 参数优化路由。

官方 API 缓存 vs 实时 API 账单对比:实际对账单省钱公式

常规实时 API 不缓存时,全量按 $0.15/M 输入计费。启用缓存后:

省钱公式


节省 = (prompt_tokens / 1M) × 请求次数 × (uncached_rate - cached_rate) × hit_rate

实际对账单对比表(每日 5000 调用,系统提示词 2000 tokens):

场景 命中率 缓存输入费用 总计输入费用 月节省(估算)
实时 API 0% $750 $750 0
缓存(50% 命中) 50% $375 $375 $11,000
缓存(80% 命中) 80% $150 $150 $18,000

输出 token 始终按 $0.60/M 计费。实际对账单中,usage.prompt_tokens_details.cached_tokens 会直接体现在账单中。

o 系列推理模型缓存应用场景:输出 tokens 为何吃掉预算

o1 系列(o1-preview、o1-mini)输出 token 费用极高($60/$12),缓存输入虽有折扣,但核心应用场景是长上下文推理

适合缓存场景:

  • 每次调用重复的系统提示词 + 工具定义(前缀相同)。
  • 跨多轮对话时,缓存历史前缀可减少重复处理。

预算挑战

  • 单一推理链输出 tokens 可达 10,000+,而输入缓存后仍按较高单价(如 o1 $7.50/M cached)。
  • 实际对账单:如果输出占 60% 预算,缓存输入节省微乎其微,重点是路由到 GPT-4o-mini 而非纯 o1 推理。

ChatGPT Plus 与 OpenAI API 账单为什么必须分账(缓存分账规则)

ChatGPT Plus(用户订阅)与 OpenAI API(开发者密钥)账单完全独立。缓存分账规则

  • Plus 用户:无缓存功能,输入输出按固定额度消耗。
  • API 用户:缓存直接影响 API 账单,Plus 不受影响。
  • 分账必要性:避免混淆对账单。API 账单才计入 Prompt Caching 节省,Plus 账单只看订阅额度。

必须分开对账:否则会错误统计“节省”或超限。建议用不同密钥管理。

Prompt 缓存价格全流程:从 token 数到最终对账单步骤

1. 获取 token 数:用官方 token counter 或本地工具统计提示词前缀长度。

2. 配置 cache:无需代码改动,直接发送包含长前缀的请求。

3. 查看命中:响应中查看 cached_tokens,计算命中率。

4. 计算账单:输入缓存部分按 $0.075/M(GPT-4o-mini)计费,输出全额。

5. 优化:用 prompt_cache_key 提高命中率,监控每月账单下降。

实际步骤示例:每月 1M 输入、1M 输出调用,命中率 70% 时,总费用从 $1,750 降至 $1,100。

---

延伸阅读

Risk 与 Boundary

本指南仅供参考,不构成法律意见。OpenAI 定价可能随时间调整,实际对账以官方 dashboard 为准。任何绕过支付或非官方使用行为均属违规,不在本文讨论范围。

---