
## Assistants / Responses 计费与普通 Chat Completions 差异
如果你正在计算 OpenAI API 月账单、想知道 Assistants 或 Responses API 的真实 $/M 成本,或正在把 ChatGPT Plus 试用(热门订阅选项)转为生产环境,这些内容会直接帮你拆清账单。
普通 Chat Completions 按模型输入/输出 Token 直接计费,而 Assistants / Responses 提供线程、工具和文件检索功能,但底层 Token 费用相同,仅额外收取内置工具(如 Code Interpreter、File Search)的调用或存储费用。
你适用 Assistants / Responses 的场景是:需要持久对话历史 + 上传文件 RAG 的复杂代理任务;反之,Chat Completions 更适合简单单次回复。
决策时,优先用站内工具计算具体 Token 消耗,再对比官方挂牌价,避免预算超支。
现状与数据更新
2026 年 8 月,OpenAI 将 Assistants API 官方宣告弃用并将于 2026-08-26 正式关闭(开发者文档已明确提示)。Responses API 成为新推荐路径,功能已实现与 Assistants 的特征对齐,但计费逻辑发生实质变化。
核心区别在于:Responses API 不再隐藏在 Thread 中管理状态,而是直接通过 previous_response_id 链式调用,减少重复发送系统提示和历史消息。File Search 的工具调用费用($2.50 / 1k 调用)在 Responses API 中明确收费,而旧 Assistants API 可能存在模糊处理。
底层模型 Token 价格(来自官方定价页面)保持一致,所有三个 API(Assistants、Responses、Chat Completions)均按同一模型输入/输出率计费,无单独定价。实际差异来自工具和服务:
- Code Interpreter:$0.03 / 20 分钟会话(默认 1 GB 容器)
- File Search 存储:$0.10 / GB / 天(首 1 GB 免费)
- File Search 工具调用(Responses API 专属):$2.50 / 1k 调用
- Web Search 工具:$10.00 / 1k 调用 + 检索内容按模型 Token 率计费
这些额外费用仅在实际调用时产生,普通 Chat Completions 无此项。Prompt 缓存折扣(Cached input 通常打 50%)在所有 API 中自动生效,但状态化工具会增加输入 Token 总量。
核对清单
使用以下清单核对你的账单,避免遗漏:
1. 登录 OpenAI 平台(platform.openai.com)查看 Billing Dashboard,筛选 Assistants 或 Responses 用量行项。
2. 确认模型(如 gpt-5.6-terra 或 gpt-4.1)输入/输出 Token 数量,乘以官方 $/M 价(如 gpt-5.6-terra 输入 $2.00 / 1M)。
3. 统计 Code Interpreter 会话数(每 20 分钟 $0.03)。
4. 计算 File Search 存储:向量库大小(GB)乘 $0.10/天。
5. 计数 File Search 或 Web Search 工具调用($2.50/1k 或 $10/1k)。
6. 验证 Prompt 缓存折扣是否正常应用(API 响应中 cached_tokens 字段)。
7. 跨月比较:Chat Completions vs Responses,检查是否有额外 20%+ Token 消耗。
8. 模拟迁移测试:将同一对话转 Responses,记录 Token 变化。
9. 监控 API 密钥,确认无未授权线程积累。
10. 参考官方定价页实时核对(工具地址:/official-prices)。
推荐内链:通过 官方 API 定价页 验证最新 Token 价。
风险与边界
风险边界:Assistants / Responses 适合高上下文需求场景,Chat Completions 更简洁高效。使用时注意 Rate Limit 差异(Assistants Thread 级限流更严格)。旧 Assistants API 即将关闭,需立即规划迁移到 Responses + Conversations API,避免中断。
非法律意见声明:以上信息基于公开官方文档与定价页面,仅供参考。计费以 OpenAI 当日挂牌数据为准,实际以 API 响应为准。xAI/Grok 不为任何账单纠纷或费用纠纷负责。建议自行登录 OpenAI 平台核实,并咨询专业计费顾问。
站内路径
- 官方 API 定价页:直接查看模型 Token 价表与缓存折扣。
- 官方 API 计费对照站:核对 GPT Token 单价与 API 分账。
- API 计费对账工具:一键输入 Token 数据自动计算 $/M 与缓存节省。
- 账单路径与迁移指南:查看 Responses API 迁移全流程。
- OpenAI API 计费详解:绑定实体场景与可执行方法。
延伸阅读
- ChatGPT Plus 试用订阅对比:如何从订阅转为 API 节省成本。
- API 计费对账工具:实时模拟 Responses 与 Chat Completions 差异。
- 官方 API 定价页:最新 Token 与工具费用对照表。
English summary
OpenAI’s Assistants API (deprecated, shutdown Aug 26 2026) and Responses API differ from the classic Chat Completions API mainly in extra costs for built-in tools and state management, not in base Token pricing. All three APIs bill the same model rates—e.g., gpt-5.6-terra input $2.00 / 1M tokens, output $12.00 / 1M—with automatic 50% Prompt Caching discounts on cached input.
Additional fees (per official pricing page, 2026-08 data): Code Interpreter at $0.03 per 20-minute session; File Search storage $0.10/GB/day (1 GB free); File Search tool calls $2.50/1k calls (Responses API only); Web Search $10/1k calls + retrieval tokens. Responses API reduces Token overhead via previous_response_id chaining compared to Assistants Threads, often lowering total spend for multi-turn agent workflows.
Use Responses for new persistent agents with file retrieval; fall back to Chat Completions for simple queries to minimize costs. Always verify live billing on platform.openai.com, as extra tool usage can add 20-50% to bills depending on frequency. This guide equips readers to reconcile API bills, calculate exact $/M, and decide between Plus subscriptions and pay-per-use for production apps. Data current as of August 2026; check official sources for updates.