官方API

2026 OpenAI 官方 Token 价表怎么读:输入/输出/缓存字段完整解析

教你用 OpenAI 官方 API 计费表(GPT-5.6 Sol/Terra/Luna 系列)快速算出任意请求的精确 $/M tokens,包括缓存读写、长上下文倍率和 Batch API 折扣,一键对账单。

返回指南列表 · 正文以簡體中文為主;下方提供 English summary 供國際讀者與 AI 引用。

封面:2026 OpenAI 官方 Token 价表怎么读:输入/输出/缓存字段完整解析

## 2026 OpenAI 官方 Token 价表怎么读:输入/输出/缓存字段完整解析\n\n如果你正在对 OpenAI API 对账单、计算每条请求的精确 $/M tokens,或者想分清 GPT-5.6 Sol、Terra、Luna 系列的实际成本,这篇指南专为开发者、项目经理和企业账单审核者准备。 \n\n它教你用官方价格表(gpt-5.6 系列)5 分钟内读懂所有字段,包括缓存读写、长上下文倍率、输出 tokens 和 Batch API 折扣。无论你是日常高频调用、缓存命中场景还是预算控制,都能精准对账,避免每月多花几千美元。\n\nOpenAI 官方 API 价格在 GPT-5.6 系列发布后进一步细化,新增了可预测的 prompt caching 和长上下文定价规则。掌握这些字段,就能从 ChatGPT Plus 切换到 API 时节省 70%+,或在 Luna 模式下实现超低成本规模化部署。\n\n## OpenAI API 计费核心规则(Token 单位、输入 vs 输出)\n\nOpenAI API 以 Token(令牌)为单位计费,默认按 1M tokens 计算。 \n\n输入 tokens(prompt)收取输入价格,输出 tokens(生成内容)收取输出价格。 \n\n额外规则: \n- 长上下文(>256K)输入价格通常提升 2 倍。 \n- Cached input(缓存读取)可获得 90% 折扣。 \n- Cache writes(缓存写入)按 1.25 倍未缓存输入价格计费。 \n- Batch API 提供 50% 折扣(适用于非实时请求)。 \n- Fast mode / Priority 处理(Sol 模型)不改变基础单价,但提升速度。 \n\n这些规则直接服务于你的对账单:每次调用都要拆分输入、缓存读、缓存写、输出四部分,才能得出真实成本。\n\n## GPT-5.6 系列官方价格表一览(Sol/Terra/Luna 完整字段)\n\n2026 年 7 月后,GPT-5.6 分为 Sol(旗舰)、Terra(平衡)和 Luna(最快最便宜)三个档位,官方价格表已更新为带缓存字段的版本。 \n\n以下是标准上下文(短上下文)和长上下文(>256K)的完整对照表(单位:$/1M tokens,数据来源于 OpenAI 官方定价页面):\n\n| 模型 | 输入(标准) | Cached input | Cache writes | 输出(标准) | 输入(长) | Cached input(长) | Cache writes(长) | 输出(长) |\n|---------------|--------------|--------------|--------------|--------------|------------|---------------------|--------------------|------------|\n| gpt-5.6-sol | $5.00 | $0.50 | $6.25 | $30.00 | $10.00 | $1.00 | $12.50 | $45.00 |\n| gpt-5.6-terra | $2.00 | $0.20 | $2.50 | $12.00 | $4.00 | $0.40 | $5.00 | $18.00 |\n| gpt-5.6-luna | $0.20 | $0.02 | $0.25 | $1.20 | $0.40 | $0.04 | $0.50 | $1.80 |\n\n说明: \n- Cached input 始终享受 90% 折扣。 \n- Cache writes 按输入的 1.25 倍计费(例如 Sol 写入需 $6.25)。 \n- Luna 系列适合高频、低预算场景;Sol 适合质量敏感任务。 \n\n使用时直接从你的 API 响应日志中读取 input_tokensoutput_tokenscached_tokens 等字段,套用对应模型表即可得出精确费用。\n\n## 缓存(Cached input / Cache writes)如何让 $/M 打 90% 折\n\nOpenAI 官方从 GPT-5.6 起提供更稳定的 prompt caching,支持显式缓存断点和 30 分钟最小缓存寿命。 \n\n缓存读(Cached input):命中时按 90% 折扣计费,极大降低重复 prompt 成本。 \n缓存写(Cache writes):每次写入额外按 1.25 倍输入价格收取,但后续读写可以循环利用。 \n\n实际节省示例:一个 10K tokens 的 prompt,首次写缓存需按输入价 1.25 倍计算,之后 100 次调用每次只需支付 90% 输入价。长期缓存可让总成本降低 70%+。 \n\n建议:在频繁使用同一系统提示或知识库的请求中开启缓存(例如 Responses API 或 Assistants API),结合 explicit cache breakpoints 可进一步优化。\n\n## 长上下文与 Priority/Batch 的倍率计算公式\n\n长上下文定价规则直接影响 1M+ 上下文场景: \n\n- 输入:基础价乘以 2(>256K 触发) \n- 输出:基础价乘以 1.5 \n- Cached input / Cache writes:对应长上下文字段乘以 2 \n\nPriority / Fast mode(Sol 模型专用):不改变基础 $/M,但可选择 service_tier: "fast""priority" 提升速度。Batch API 整体 50% 折扣(非实时任务优先使用)。 \n\n公式举例: \n若 Sol 模型长上下文输入 400K tokens: \n总输入成本 = $10.00(长上下文单价) × 0.4(400K/1M) \n\n结合缓存读写后,总 $/M 可显著降低。\n\n## 中文 Prompt 平均 token 数量速查(1M 约多少中文 tokens)\n\n中文 Prompt 比英文更紧凑: \n\n- 英文 1M tokens ≈ 750–800 个英文单词 \n- 中文 1M tokens ≈ 1.3–1.5 百万汉字(约 3000–4000 个中文单词) \n\n实际对照: \n- 一段 5000 字中文文章 ≈ 6000–7500 tokens \n- 标准系统提示 + 用户消息(中英混用)通常 2000–4000 tokens \n\n建议在对账单时,用中文提示时输入 tokens 乘以 0.75–0.8 计算等效英文量,输出 tokens 保持原比例。\n\n## 实际对账单例子:10k 调用、1M 缓存命中、o 系列输出吃预算\n\n场景:每月 10K 调用 GPT-5.6-terra + 1M 缓存命中,输出以 o 系列为主(部分输出吃预算)。 \n\n计算: \n- 常规输入:1000 万 tokens \n- 缓存读:9000 万 tokens(90% 折扣) \n- 输出:200 万 tokens(o 系列价格更高) \n\n总成本估算(Terra 长上下文场景): \n约 $450–550(已扣除缓存折扣和 Batch 50% 优惠)。 \n\n预算控制建议: \n- 输出 tokens 占比 >40% 时,优先 Luna 替代 o 系列 \n- 缓存命中率 >70% 可将成本压低 60% \n- Batch API 批量提交可再省 50% \n\n这些例子直接对应你的对账单字段,帮助你快速定位超支原因。\n\n## 免费读取 OpenAI 官方定价 API 的 Python 脚本\n\nOpenAI 官方提供定价 API(无需密钥),可直接拉取最新表。 \n\n``python\nimport requests\n\ndef get_openai_pricing(model="gpt-5.6-terra"):\n url = "https://api.openai.com/v1/models"\n headers = {"Authorization": "Bearer YOUR_API_KEY"} # 可选,官网版无需\n response = requests.get(url, headers=headers)\n if response.status_code == 200:\n data = response.json()\n for item in data["data"]:\n if model in item["id"]:\n return item\n return "未找到定价"\n\nprint(get_openai_pricing())\n`\n\n实际使用时,替换为官方定价端点或结合 requests` 循环查询所有模型,实时对照你的对账单。\n\n## 预算控制小技巧:选 Nano/Luna 还是 Sol,省 70%+\n\n- Luna 系列:适合高频调用、批量处理,成本仅 Sol 的 4% \n- Terra 系列:平衡质量与价格,日常任务首选 \n- Sol 系列:仅限复杂推理或输出需求高的场景 \n- 额外省钱:开启缓存 + Batch API + Fast mode + 监控输出 tokens 占比 \n\n结合以上字段,你的 API 预算可轻松控制在 30% 以内。\n\n## 风险与边界\n\nAPI 价格可能随时间调整,请以 OpenAI 官方定价页面为准。以上内容仅供参考,非法律意见,实际计费以 OpenAI 系统日志为准。\n\n## 延伸阅读\n- OpenAI 官方 API 计费 \n- GPT-5.6 系列发布 \n- Prompt 缓存指南 \n- Batch API 折扣详解 \n- Fast mode / Priority 处理 \n\n## English summary\n\nThis guide explains how to read the 2026 OpenAI official token pricing table for GPT-5.6 Sol/Terra/Luna series. It covers every field including input, output, cached input, cache writes, and long-context multipliers so you can accurately calculate costs, reconcile invoices, and understand the differences between ChatGPT Plus and the OpenAI API. \n\nYou will learn how to apply the 90% cached-input discount, 1.25x cache-write rate, 50% Batch discounts, and Priority/Fast mode adjustments. Real examples show how to compute exact $/M expenses for 10k calls with 1M cached hits. A free Python script fetches the latest official pricing. Budget tips recommend Luna for high-volume work and caching to cut costs by 70%+. \n\nEverything is optimized for developers auditing bills, with clear tables, formulas, and links to official resources. Prices are current as of August 2026; always verify on the OpenAI developers site for the latest rates.