计费精算

OpenAI Prompt Caching 有效单价怎么算:命中后输入$/M 到底降多少

对照官方 Token 价表,拆解 Prompt Caching 的缓存读写字段、命中率门槛与真实有效单价公式,帮助对账单的人快速判断缓存是否真的省钱,以及和普通输入输出的分账差异。

返回指南列表

封面:OpenAI Prompt Caching 有效单价怎么算:命中后输入$/M 到底降多少

OpenAI Prompt Caching 有效单价怎么算:命中后输入$/M 到底降多少\n\nOpenAI Prompt Caching 让同一系统提示或多轮对话的前缀在官方 API 中自动被缓存,命中后输入令牌价格直接下调至原价的 50%~90%(视模型而定),输出令牌不受影响。这对对账单的用户特别实用,能帮你快速判断实际支付是否比标价更低。\n\n如果你主要跑 ChatGPT API、多轮对话或长上下文应用,Prompt Caching 是当前官方计费里最容易产生有效单价偏差的字段。本文对照 OpenAI 官方最新 Token 价表,拆解缓存读写字段、命中率门槛与真实有效单价公式,帮助你从 usage 日志里直接重算账单,避免“看起来省却实际亏”或“白算”的情况。适用于所有 OpenAI API 开发者,对账、预算规划或优化 prompt 策略时必看。\n\n### 官方价表里缓存相关字段怎么读:输入、输出、缓存读、缓存写的 $/M\n\nOpenAI API 价格页面明确列出每百万令牌(per 1M tokens)的标准价、缓存输入价(Cached input)、缓存写价(Cache writes)和输出价。以下是 2026 年 8 月最新支持模型的核心价格(数据以官方平台.openai.com/docs/pricing 为准,价格可能随更新调整,请以 Dashboard 为准):\n\n| 模型 | 输入 $/M | 缓存读 $/M | 缓存写 $/M | 输出 $/M |\n|-----------------------|----------|------------|------------|----------|\n| gpt-4o-2024-08-06 | $2.50 | $1.25 | 免费 | $10.00 |\n| gpt-4o-mini-2024-07-18 | $0.15 | $0.075 | 免费 | $0.60 |\n| o1-preview | $15.00 | $7.50 | 免费 | $60.00 |\n| o1-mini | $3.00 | $1.50 | 免费 | $12.00 |\n| gpt-5.6-sol (含长语境) | $5.00 | $0.50 | $6.25 | $30.00 |\n| gpt-5.5 (标准) | $5.00 | $0.50 | 免费 | $30.00 |\n\n关键字段说明(来自官方 usage 对象):\n- prompt_tokens:本次请求的总输入令牌数(缓存读 + 未命中部分)。\n- prompt_tokens_details.cached_tokens:命中缓存的输入令牌数。\n- cache_write_tokens(GPT-5.6 及之后模型):本次请求写入缓存的令牌数。\n- 输出令牌与 completion_tokens 完全按标准输出价计费。\n\n提示:缓存读写字段仅在支持 Prompt Caching 的模型(gpt-4o 及以上)中出现。低于 1024 令牌的请求 cached_tokens 始终为 0。\n\n### 命中率门槛与有效单价公式:什么时候缓存开始真正压低账单\n\nOpenAI 自动启用缓存,无需代码修改。条件为:\n- 请求前缀 ≥ 1024 令牌。\n- 缓存位置从 1024 令牌起,每 128 令牌递增。\n- 命中率门槛:实际命中越多,折扣越明显。首次写入(cache write)通常免费(老模型),新模型按 1.25 倍标准输入价计费。\n\n有效单价公式(简化版):\n\\[\n\\text{每百万令牌有效价格} = \\frac{(\\text{未命中输入} \\times \\text{标准输入价}) + (\\text{命中输入} \\times \\text{缓存读价}) + (\\text{缓存写} \\times \\text{缓存写价}) + (\\text{输出} \\times \\text{输出价})}{\\text{总令牌}}\n\\]\n\n更精确的单请求公式(用于对账):\n\\[\n\\text{本次请求成本} = (\\text{未命中输入} \\times \\text{标准输入价}) + (\\text{命中输入} \\times \\text{缓存读价}) + (\\text{缓存写} \\times \\text{缓存写价}) + (\\text{输出} \\times \\text{输出价})\n\\]\n\\[\n\\text{有效单价} = \\frac{\\text{本次请求成本}}{\\text{总令牌}}\n\\]\n\n示例:gpt-4o 跑 5000 令牌输入(缓存命中 4000,写入 500,未命中 500),输出 1000 令牌。成本 = (500×2.5) + (4000×1.25) + (500×0) + (1000×10) = 1.25 + 5 + 0 + 10 = $16.25。有效单价 = 16.25 / 6000 ≈ $0.0027(对比普通 $0.005 /M)。\n\n### 典型场景拆解:长系统提示 + 多轮对话 vs 短一次性请求的缓存收益差\n\n场景 1:长系统提示 + 多轮对话(推荐场景,收益最大) \n- 5000 令牌系统提示 + 2000 令牌用户问题(每轮缓存命中 4000)。 \n- 10 轮对话总输入 50k,命中率 80%。 \n- 按 gpt-4o 价算:普通输入成本 $125,缓存后 $25(折扣 80%)。 \n- 优势:输出不变,但输入成本降 80%,单月轻松省几千美元。\n\n场景 2:短一次性请求 \n- 仅 600 令牌系统提示 + 一次问答。 \n- 因 <1024,无法缓存(cached_tokens=0)。 \n- 收益:0%。\n\n收益差对比(gpt-4o 为例): \n- 长提示多轮:折扣 80%+,最划算。 \n- 短请求:0%,无差异。\n\n### 对账单实操:如何从 usage 日志里分离缓存命中 tokens 并重算有效单价\n\n1. 登录 OpenAI Platform > Usage 查看日志,每行记录 prompt_tokens_details.cached_tokenscache_write_tokensprompt_tokens。\n2. 导出 CSV,筛选支持模型行。\n3. 用公式计算: \n 总缓存读成本 = cached_tokens × 缓存读 $/M \n 总未命中输入成本 = (prompt_tokens - cached_tokens) × 标准输入 $/M \n (老模型无需加写费,新模型加 cache_write_tokens × 缓存写价)\n4. 求和得月总成本,换算为有效 $/M。\n5. 工具推荐:用 Excel 或 Python 脚本(输入标准价、缓存读价、缓存写价),一键重算。\n\n示例日志(gpt-4o):\n``\nprompt_tokens: 2006\ncached_tokens: 1920\ncache_write_tokens: 0\noutput: 300\n`\n成本 = (86 × 2.5) + (1920 × 1.25) + 3000 = 215 + 2400 + 3000 = $5615。有效单价 ≈ $0.0028。\n\n### 与 Plus 订阅的分账提醒:API 缓存折扣不影响 ChatGPT Plus 月费\n\nChatGPT Plus($20/月)订阅仅限 ChatGPT Web/App 界面,缓存折扣完全不影响你的 Plus 月费。Plus 模式下所有对话都走 ChatGPT 官方通道(非 OpenAI API),使用不同计费逻辑和限额。 \nAPI 缓存折扣仅适用于 OpenAI API,独立于 Plus。建议同时使用:Plus 日常聊天 + API 生产任务,互不干扰。\n\n### 常见误区:把缓存写费用当成普通输入、忽略最低命中量导致「看起来省却实际亏」\n\n- 误区 1:将 cache_write_tokens 当成普通输入算。GPT-5.6 及之后模型写入会额外计费(1.25 倍),但老模型免费。计算时别漏掉。\n- 误区 2:低命中量(<1024)或无重用场景。看起来“免费”却无实际折扣。\n- 误区 3:只看标价表,不看 usage 日志。官方价表列的是“最大折扣”,实际有效单价取决于命中率。\n- 误区 4:把缓存写费用当成普通输入。正确:老模型免费,新模型按 1.25 倍标准输入计。\n\n避免方法:始终用 cached_tokens 从 usage 字段分离重新计算,避免月费偏差。\n\n### 风险与边界\n\n以上信息基于 OpenAI 官方定价文档整理,仅供参考。实际价格以 OpenAI Platform Dashboard 为准,可能因地区、数据存储、批处理等因素调整。缓存命中率和保留时长也受服务器负载、缓存策略影响,不保证 100% 命中。本文非法律意见,仅供开发者对账和预算规划参考。使用 Prompt Caching 需符合 OpenAI 服务条款,缓存非永久共享。\n\n## 延伸阅读\n- OpenAI 官方 API 价格表\n- 官方 API 计费对照指南\n- 如何从 API usage 日志精确对账\n- OpenAI Prompt Caching 完整使用教程\n\n## English summary\n\nOpenAI Prompt Caching automatically caches the longest prefix of prompts (minimum 1,024 tokens) on supported models (GPT-4o and newer, including o1 series). It applies a 50%-90% discount on cached input tokens while leaving output tokens at full price, with no extra cost for older models and a 1.25x write fee for GPT-5.6+.\n\nKey official rates (per 1M tokens): GPT-4o input $2.50 vs cached $1.25; GPT-4o-mini $0.15 vs $0.075; GPT-5.5 $5.00 vs $0.50. Use fields like cached_tokens, cache_write_tokens, and prompt_tokens` from the usage response to calculate exact effective price.\n\nEffective price formula: \n(total cost) / total tokens = [(uncached input × standard) + (cached input × cache read) + (write × write price) + (output × output)] / total.\n\nLong system prompts + multi-turn conversations yield the highest savings (up to 80-90% on input). Short or one-off requests (<1,024 tokens) get zero benefit.\n\nTo reconcile bills: extract usage logs, separate cache hits, and apply the formula. API caching discounts do not affect ChatGPT Plus subscriptions.\n\nCommon pitfalls include ignoring write fees on newer models, low hit rates, or misreading logs. Always verify against your dashboard.

OpenAI Prompt Caching 有效单价怎么算:命中后输入$/M 到底降多少 · OpenAICN