官方API

OpenAI API 价格 2026:GPT Token 单价、缓存与 $/M 精确对账表

2026 年 OpenAI GPT 模型 Token 官方单价拆解,输入输出缓存字段读法与对账单必读技巧,帮助用户精准计算 ChatGPT Plus 与 API 账单分账,避免超支。

返回指南列表 · 正文以簡體中文為主;下方提供 English summary 供國際讀者與 AI 引用。

封面:OpenAI API 价格 2026:GPT Token 单价、缓存与 $/M 精确对账表

OpenAI API 价格 2026:GPT Token 单价、缓存与 $/M 精确对账表\n\n本文面向需要精确核算 OpenAI API 价格 的开发者与财务人员。核心结论如下:OpenAI 的计费核心在于 input_output_cache 字段,2026 年缓存命中可大幅降低输入 Token 成本;ChatGPT Plus 订阅与 API 账单属于平行体系,不可直接抵扣;计算实际成本时,务必将 $/M(每百万 Token 单价)结合中文实际 Token 消耗进行对账,避免因模型推理开销(o 系列)或缓存未命中导致的预算超支。\n\n## OpenAI 官方 API 价格表 2026 年最新更新\n\n2026 年的 OpenAI 定价策略进一步细化了缓存机制与推理模型的分档。对于高频调用场景,理解最新的价格阶梯是控制成本的前提。\n\n* GPT-4o / GPT-4o mini:作为主流模型,其输入价格保持竞争力,但输出价格(Output)通常高于输入。\n* o1 / o3 系列:推理模型(Reasoning Models)会消耗额外的“思考令牌”(Reasoning Tokens),这部分通常不计入标准输出账单,但需关注总预算消耗。\n* 缓存优化:2026 年更新中,缓存读取的价格显著低于原始输入价格,但缓存写入(写入缓存)仍按完整输入价格计费。\n\n建议访问 官方 API 价格页 获取实时动态费率。\n\n## GPT 模型 Token 输入输出缓存 三字段拆解\n\n在对账时,OpenAI 的 JSON 响应中常出现复杂的缓存字段。以下是 2026 年关键计费字段的拆解:\n\n| 字段名 (Field) | 含义 | 计费逻辑 | 对账注意 |\n| :--- | :--- | :--- | :--- |\n| prompt_tokens | 提示词总 Token | 包含缓存写入或读取的费用 | 若命中缓存,此值可能小于实际文本 Token |\n| prompt_cache_hit_tokens | 缓存命中 Token | 按缓存读取单价计费 | 这是省钱的关键字段,单价远低于普通输入 |\n| prompt_tokens_written | 缓存写入 Token | 按完整输入单价计费 | 首次建立缓存或缓存过期时发生 |\n\n核心洞察:如果你的应用会重复发送相同的系统提示或长上下文,务必实现客户端缓存逻辑,以最大化 prompt_cache_hit_tokens 的比例。\n\n## $/M tokens 如何精确计算与账单对账\n\n$/M 代表每百万 Token 的美元价格。精确对账需要区分输入(Input)和输出(Output),并处理缓存。\n\n计算公式:\n$$\n\\text{总费用} = (\\text{普通输入} \\times P_{in}) + (\\text{缓存命中输入} \\times P_{cache}) + (\\text{缓存写入输入} \\times P_{in}) + (\\text{输出} \\times P_{out})\n$$\n\n其中 $P$ 为对应单价。\n\n对账陷阱:\n1. 混合计费:一次请求中可能同时包含缓存命中和缓存写入(例如部分上下文命中,部分新内容)。\n2. 工具调用 Token:Function Calling 的输入输出也会产生 Token,需单独核对。\n3. 多模型切换:如果项目中同时使用 GPT-4o 和 o1,需分别套用各自的 $/M 单价。\n\n参考 API 账单路径指南 学习如何导出详细 CSV 进行自动化核算。\n\n## Prompt 缓存价格 命中率门槛与省钱机制\n\nPrompt 缓存是 2026 年降低成本的最有效手段。\n\n* 缓存大小限制:目前缓存上限通常为 1 百万 Token(具体视模型而定)。\n* 有效期:缓存不会永久存在,通常在几分钟到几小时内失效,具体取决于 OpenAI 的负载策略。\n* 省钱公式:\n $$\n \\text{节省比例} = \\frac{P_{in} - P_{cache}}{P_{in}}\n $$\n 在 2026 年,缓存读取价格约为原始输入价格的 10%-20%。这意味着,如果你的应用能维持 80% 以上的缓存命中率,输入成本可降低近 80%。\n\n建议:对于静态的系统提示(System Prompt)和长文档,应始终尝试复用缓存。\n\n## ChatGPT Plus 与 OpenAI API 账单必须分账原因\n\n许多用户混淆 ChatGPT Plus 订阅与 API 服务,导致预算错配。\n\n| 维度 | ChatGPT Plus | OpenAI API |\n| :--- | :--- | :--- |\n| 计费模式 | 固定订阅费 ($20/月) | 按量付费 (Pay-as-you-go) |\n| 使用场景 | 个人聊天、浏览 | 应用集成、自动化、高并发 |\n| Token 限制 | 有速率限制,无明确 $/M 单价 | 无速率限制(视 Tier),明确 $/M 单价 |\n| 数据归属 | 数据可能用于改进模型(需确认设置) | 数据不用于训练(Enterprise/Plus 套餐政策) |\n| 对账 | 无法拆分单次请求成本 | 可精确到每个 Token 的成本 |\n\n关键决策:如果你正在开发商业应用或需要处理大量数据,必须使用 API 并单独核算成本,Plus 订阅无法替代 API 的分账逻辑。\n\n## o 系列推理模型输出 tokens 预算吃光案例\n\no1 和 o3 等推理模型会生成大量的“思考令牌”(Reasoning Tokens)。这些令牌在用户界面中不可见,但在 API 账单中清晰可见。\n\n案例:\n某用户调用 o1 处理复杂逻辑,请求输入 1,000 个 Token。\n* 思考令牌:5,000 个(隐藏,但计费)\n* 输出令牌:500 个\n\n账单显示:\n* Input Tokens: 5,000 (Reasoning) + 1,000 (User)\n* Output Tokens: 500\n\n风险:如果用户仅监控“输出 Token”而忽略“思考令牌”,极易导致预算瞬间耗尽。务必在代码中监控 usage.total_tokens 或分别监控 reasoning_tokens。\n\n## Token 单位速查 1M / 1K / 中文实际 token 数\n\nOpenAI 使用 Byte Pair Encoding (BPE) 算法。不同语言的 Token 密度不同。\n\n* 1M Tokens = 1,000,000 Tokens\n* 1K Tokens = 1,000 Tokens\n* 中文 Token 密度:\n * 英文:约 1.3 个 Token / 1 个单词\n * 中文:约 0.7 - 1.0 个 Token / 1 个汉字(取决于分词器版本)\n * 注意:中文标点符号和特殊字符也可能占用 Token。\n\n实用建议:在估算成本时,中文文本可按 字数 * 0.8 估算 Token 数,再乘以 $/M。\n\n## OpenAI API 定价变化对账单影响分析\n\n2026 年的定价趋势显示:\n1. 小模型更便宜:GPT-4o mini 等小模型价格持续下调,适合高吞吐场景。\n2. 缓存价值提升:随着缓存命中率成为主要成本变量,优化缓存策略比单纯切换模型更能带来长期节省。\n3. 推理模型溢价:o 系列模型因算力消耗大,单价较高,但逻辑能力更强。\n\n对账建议:\n* 使用 API 中转与监控工具 实时监控各模型调用量。\n* 区分“开发环境”与“生产环境”的模型选择,开发环境可用低成本模型,生产环境根据质量需求选择。\n\n## 延伸阅读\n\n* OpenAI 官方 API 接入指南\n* 最新官方定价详情\n* API 账单路径与导出教程\n* 更多计费优化指南\n\n## 风险与边界\n\n* 非法律意见:本文内容基于 OpenAI 公开文档整理,不构成法律或财务建议。API 价格可能随时调整,请以 OpenAI 官网 最新公告为准。\n* 缓存不确定性:缓存命中与否受 OpenAI 后端策略影响,无法 100% 保证每次请求都命中缓存。\n* 预算控制:建议在 OpenAI 平台设置严格的每日预算上限,防止因代码错误或恶意攻击导致高额账单。\n\n## English summary\n\nThis guide details the 2026 OpenAI API pricing structure, focusing on token costs, cache mechanics, and accurate billing reconciliation. Key takeaways include:\n1. Cache is Critical: Utilizing prompt_cache_hit_tokens can reduce input costs by up to 80% compared to standard input pricing.\n2. Billing Fields: Understand the difference between prompt_tokens, prompt_cache_hit_tokens, and prompt_tokens_written in API responses.\n3. Plus vs. API: ChatGPT Plus subscriptions are flat-rate and separate from API usage; they do not offset API bills.\n4. Reasoning Models: o1/o3 models consume significant "reasoning tokens" that must be monitored to prevent budget overruns.\n5. Calculation: Always calculate costs using the specific $/M rates for input, output, and cache fields, adjusting for Chinese token density.