
## OpenAI 限速档与有效成本:RPM/TPM 如何影响账单
如果你经常使用 OpenAI 的官方 API(无论是独立调用还是通过 ChatGPT Plus 订阅),都可能遇到请求被限流的情况。OpenAI 会自动限制每分钟请求数(RPM)和每分钟 token 数(TPM),具体取决于你选择的模型、当前使用额度、组织层级和项目设置。这些限制本质上是公平访问机制,但如果被触发,就会导致 429 错误、请求被延迟甚至中断。
谁适用?
对账单监控、批量处理或自动化脚本的用户最需要关注——尤其每月 API 花费超过几百美元时。
怎么决策?
打开 OpenAI Dashboard(平台.openai.com/settings/organization/limits)查看你的实际 RPM/TPM 数值,再结合官方定价表计算每百万 token 的成本 $/M。如果 TPM 较低或 RPM 不足,建议分批调用、启用 Prompt Caching 或上 Scale Tier 提升额度。
核心概念与术语
- RPM:Requests Per Minute,即每分钟请求数。是最常见的限速指标,直接决定你能多快发出调用请求。
- TPM:Tokens Per Minute,即每分钟 token 数。计算的是模型实际处理的 token 总量(输入 + 输出)。关键影响点:不同模型的 TPM 差异极大,例如简单模型可达百万级别,而复杂推理模型可能只有几万。
- RPD / TPD:Requests Per Day / Tokens Per Day(每日限制),用于高频场景。
- 有效成本:不是单一的官方 $/M,而是 (总 token 数 / 1,000,000)× 对应模型输入/输出价格。限制会让你被迫降低并发,从而延长总处理时间,间接抬高“有效 $/M”。
- Prompt Caching:预付费缓存输入 token,减少重复输入时的计费(例如 $0.50 / 1M 缓存输入 vs 原价 $5)。
- Scale Tier:OpenAI 官方提供的付费加速额度,购买后可直接提升你的 RPM/TPM(例如 GPT-5.6 Sol 标准 50,000 TPM)。
注意:所有数据以 OpenAI 官方挂牌价为准,随模型和上下文长度(short context / long context)而变。
决策表:RPM/TPM 对账单的影响对照
| 场景描述 | 典型 RPM/TPM 例子(低额度) | 对账单影响 | 推荐决策 |
|---|---|---|---|
| 高频批量处理(数千请求/天) | 500 RPM / 200k TPM | 请求被拒概率高,需重试,耗时翻倍 | 上 Scale Tier 或拆分调用 |
| 日常实验 + 自动化脚本 | 5,000 RPM / 450k TPM | 可接受,成本基本贴合官方 $/M | 正常监控,启用缓存 |
| 复杂推理模型(o1/o3 系列) | 500 RPM / 30k TPM | 每次调用耗时延长,累计成本上升 | 优先缓存 + 减少上下文长度 |
| 长上下文(>270K) | 额外单独限制 | 输出 token 计费更高,限速更严 | 切换到 Batch API 或 Scale Tier |
| 已有 ChatGPT Plus 订阅 | 受订阅额度限制(非 API 直接) | 订阅内使用不受 API 限速影响 | 优先用 Plus 做轻量任务 |
数据来源:OpenAI 官方定价与限速页面(developers.openai.com/api/docs/pricing 与 platform.openai.com/settings/organization/limits)。
实操清单:分步可核对
1. 登录 Dashboard:platform.openai.com > 组织设置 > Limits 页面,查看当前所有模型的 RPM / TPM / RPD / TPD。
2. 查看官方定价:进入 pricing 页面,确认 gpt-5.6-luna($0.20/$1.20)、gpt-5.6-terra 等模型的输入/输出 $/M,以及 Cached input 折扣。
3. 测试你的调用:用 curl 或官方 SDK 模拟高并发(例如 1 秒 100 次调用),记录触发 429 的时间。
4. 启用 Prompt Caching:在请求头中加入 openai-prompt-caching 参数,输入 token 计费大幅下降(约 1/10)。
5. 计算有效成本:用站内工具页面计算器,输入你的实际 token 数量,得出包含限速延迟的综合 $/M。
6. 备份与监控:设置 API key 监控脚本,报警 RPM 剩余 < 20% 时自动降级。
7. 升级方案:如果每月花费稳定 > $100,联系 OpenAI 销售升级到 Enterprise 或购买 Scale Tier。
常见坑与风险边界
- 误以为官方 $/M 就是最终账单:限速会让你“有效 $/M”上升 20%–50%(因重试 + 延迟)。
- 忽略模型差异:GPT-5.6-luna(简单模型)TPM 可达高值,但复杂推理模型(如 o3)限速极严。
- ChatGPT Plus 与 API 误分:Plus 订阅有自身消息限制,与独立 API 限速完全不同。
- Batch API 误区:队列限制用输入 token 计算,与实时调用不同。
- 数据 residency 端点:部分地区调用加 10% 价格。
风险边界:这些是技术性分析,非法律意见。实际账单以 OpenAI 官方发票为准,建议保留所有 API 调用日志。
站内路径:相关工具与页面
- 官方定价与模型表 —— 查看最新 GPT-5.6 系列 $/M
- API 流量与计费对照 —— 推荐负载均衡方案
- 账单对账与 $/M 计算工具 —— 自动核对实际消耗
- OpenAI API 基础指南 —— 包含限速最佳实践
- 官方 API 入门 —— 快速上手限制配置
风险与边界
以上内容仅为信息参考,实际操作请以 OpenAI 官方文档为准。OpenAI 保留随时调整限速、定价或政策的权利。
English summary
OpenAI imposes rate limits on its API using RPM (requests per minute) and TPM (tokens per minute) to ensure fair access and prevent abuse. These limits directly affect your effective cost because throttling forces retries or reduced concurrency, increasing total processing time and thus raising the real-world $/M. Check your exact limits in the OpenAI Dashboard under organization settings, as they vary by model, tier, and usage volume. For high-volume workloads, consider Prompt Caching to lower input token costs or Scale Tier for faster processing. Batch API is another way to optimize for non-time-sensitive tasks. Always cross-reference official pricing at developers.openai.com to calculate accurate billing. This guide helps API users accurately forecast and control expenses on the OpenAI platform.
(全文约 2,450 字)