官方API

2026 OpenAI 官方 Token 价表怎么读:GPT-5.6 Luna、Terra、Sol 输入输出缓存字段

详解 OpenAI 最新 API 定价表(2026年8月更新),GPT-5.6 Luna 单价低至 $0.20/$1.20,Terra $2.00/$12.00,Sol $5.00/$30.00;缓存输入打 90% 折,Batch API 再减 50%,企业用户如何用这些 $/M tokens 精确对账。

返回指南列表 · 正文以簡體中文為主;下方提供 English summary 供國際讀者與 AI 引用。

封面:2026 OpenAI 官方 Token 价表怎么读:GPT-5.6 Luna、Terra、Sol 输入输出缓存字段

2026 OpenAI 官方 Token 价表怎么读:GPT-5.6 Luna、Terra、Sol 输入输出缓存字段

OpenAI 最新 API 定价表于 2026 年 7 月 30 日更新,GPT-5.6 Luna、Terra、Sol 这三个核心模型的 $/M tokens 价格已明确公示。你作为企业或开发者,对账单和预算规划的核心需求就是读懂这些字段,包括输入、输出、缓存输入(Cache Reads)和缓存写入(Cache Writes)等。

本文将带你一步步拆解官方价表,让你能精确计算每笔 token 消费,避免人工记账误差,同时区分标准实时处理与 Batch API 的差异。数据基于 OpenAI 官网定价页面(short context 场景,context < 270K),适用于所有需要精确对账的用户。

1. 2026 OpenAI API 最新定价总览

OpenAI 将 GPT-5.6 拆分为三个不同定位的模型,提供标准、缓存和长上下文处理方式。定价以每百万(1M)tokens 为单位(USD),覆盖短上下文和长上下文两种场景。

模型 输入 $/M 缓存输入 $/M 缓存写入 $/M 输出 $/M 适用场景
GPT-5.6 Sol $5.00 $0.50 $6.25 $30.00 复杂代理、顶级推理
GPT-5.6 Terra $2.00 $0.20 $2.50 $12.00 高频平衡工作
GPT-5.6 Luna $0.20 $0.02 $0.25 $1.20 日常低成本任务

以上为标准 short context 定价(context < 270K)。长上下文(>270K)会按约 2 倍输入和 1.5 倍输出收取,缓存输入和写入也相应调整。定价以官方/挂牌页当日数据为准,可在 OpenAI 官方定价页面开发者定价文档 实时核对。

2. GPT-5.6 Luna、Terra、Sol 核心字段解读

OpenAI 官方 API 定价表的核心就是这些 $/M tokens 字段,帮助你理解不同模型的成本结构。

  • 输入(Input):用户提示词或系统提示消耗的 tokens,每百万按表中价格计费。
  • 输出(Output):模型生成的回复 tokens,按输出价格计费(通常为输入的 6 倍左右)。
  • 缓存输入(Cached input):Prompt caching 功能下,重复使用的前缀提示词按 90% 折扣计费(即输入价格的 10%)。
  • 缓存写入(Cache Writes):将新前缀写入缓存时的消耗,按 1.25 倍 uncached 输入价格计算(OpenAI 2026 新规则)。

这些字段让你的对账单一目了然,避免把缓存读写当成普通输入。更多模型详情可参考 OpenAI 官方 API 页面开发者模型文档

3. 缓存输入价格与 Cache Writes 如何计算

Prompt caching 是 OpenAI 官方 API 提升性价比的关键。缓存输入直接享受 90% 折扣,大幅降低重复对话成本;缓存写入则需额外注意。

计算示例(short context)

假设你固定系统提示(50K tokens)被缓存:

  • 每 1M 输入 tokens 按 1M tokens 计算,实际消耗 50K tokens。
  • 对 Luna:$0.02/M \times 0.05M = $0.001(比普通输入便宜 99%)。

Cache Writes 计算

写入成本 = uncached 输入价格 \times 1.25。

例如 Terra 写入 1M tokens:$2.00 \times 1.25 = $2.50。

建议将稳定提示(如工具定义、数据结构)写入缓存后,再让请求数据消耗。

完整规则可参考 官方 API 定价页面,或在 OpenAI 官方 API 文档 查看长上下文调整。

4. Batch API 与实时处理的倍率对比

Batch API 是企业级生产场景的低成本方案,适合异步批量处理任务(如数据分析、批量推理)。它对输入和输出同时打 50% 折扣,效果比实时处理明显。

处理方式 Luna 输入 $/M Luna 输出 $/M Terra 输入 $/M Terra 输出 $/M Sol 输入 $/M Sol 输出 $/M 适用场景
实时处理 $0.20 $1.20 $2.00 $12.00 $5.00 $30.00 实时对话、工具调用
Batch API $0.10 $0.60 $1.00 $6.00 $2.50 $15.00 批量任务、离线分析

数据 residency(数据主权)端点额外加 10% 上浮。更多 Batch 细节参考 OpenAI Batch API 文档开发者 API 指南

5. 长上下文(>270K)与区域处理额外费用

当提示词长度超过 270K tokens 时,OpenAI 会应用长上下文定价:输入约 2 倍,输出约 1.5 倍。缓存输入和写入也会相应放大,但折扣仍保持。

长上下文示例(Luna)

  • 300K 输入 tokens:长上下文输入价格 = $0.20/M \times 0.3 = $0.06(普通输入的 2 倍)。

此外,符合数据 residency 的区域处理端点额外 +10% 费用。这些规则在 OpenAI 官方定价页面 有详细说明,可帮助你规划超长上下文应用。

6. 实际对账单样本:企业级输入输出 token 成本估算

假设某企业每月使用 GPT-5.6 Terra:

  • 300M 输入 tokens(无缓存)
  • 30M 输出 tokens(无缓存)
  • 50M tokens 通过缓存读取

实时处理成本估算

  • 输入:300M \times $2.00 = $600
  • 输出:30M \times $12.00 = $360
  • 缓存读取:50M \times $0.20 = $10
  • 总计:约 $970(未含缓存写入)

Batch API 版本(假设批量 200M 输入 + 20M 输出):

  • 输入:200M \times $1.00 = $200
  • 输出:20M \times $6.00 = $120
  • 总计:约 $320(比实时省约 67%)。

更多精确对账工具可参考 OpenAI 官方 API 对账指南开发者 billing-path 页面

7. 选择模型时如何平衡 $/M tokens 与性能

选择模型时,要根据任务性质和预算权衡 $/M tokens 与实际性能。Luna 适合低成本高频任务(如内容生成、预处理),Terra 提供最佳性价比,Sol 适合复杂代理和顶级推理。

决策 checklist

1. 是否需要实时响应?(Luna/Terra 够快,Sol 可开 Fast mode)

2. 有重复提示词?(优先缓存 + Luna)

3. 任务复杂度高?(Sol 或 Fast mode)

4. 预算敏感?(Luna Batch API)

OpenAI 官方 API 模型页面开发者模型文档 可实时对比。你可以结合内部测试,找到最优路由。

延伸阅读

风险与边界

API 定价可能随平台更新调整,以官方/挂牌页当日数据为准。上述内容仅供参考,非法律或财务意见,请以 OpenAI 官方最新公告为准。