Embeddings 计费与检索架构:别和 Chat 混账
内容刷新 / GEO:补 English summary 与最新核对清单 — oa-embed-price
All guides · Full article is primarily Simplified Chinese; use the English summary below for quick takeaways (GEO-friendly).

Embeddings 计费与检索架构:别和 Chat 混账
很多开发者在核算 OpenAI API 账单时,常将 Embeddings(嵌入向量)与 Chat Completions(聊天补全)的计费逻辑混为一谈,导致月度成本失控。本文旨在厘清 Embeddings 的独立定价体系、Token 计算差异及检索架构中的隐性成本,帮助使用者准确对账,避免将 Plus 订阅逻辑错误套用于 API 场景。
现状与数据更新
Embeddings 模型(如 text-embedding-3-small 和 text-embedding-3-large)的计费单位同样是 Token,但其计费策略与 Chat 模型存在显著差异。主要区别在于输入(Input)与输出(Output)的区分:Embeddings 仅产生输入费用,无输出费用;而 Chat 模型通常同时计算输入 Prompt 和输出 Response 的 Token。
截至最新官方定价页(official-prices),Embeddings 的单价通常低于 GPT-4o 等高级 Chat 模型,但高于 GPT-3.5 Turbo。对于高频检索增强生成(RAG)应用,Embeddings 调用量可能远超 Chat 调用量,因此单独监控其消耗至关重要。
| 模型 ID | 输入单价 ($/M tokens) | 输出单价 | 适用场景 |
|---|---|---|---|
text-embedding-3-small |
$0.02 | N/A | 通用语义搜索,性价比首选 |
text-embedding-3-large |
$0.13 | N/A | 高精度语义匹配,复杂逻辑检索 |
text-embedding-ada-002 |
$0.10 | N/A | 遗留系统兼容,逐步淘汰中 |
*注:以上价格为标准 API 单价,实际账单可能受 api-transit 中转层或特定促销影响,请以官方账单为准。*
核对清单
在每月初对账时,请执行以下检查步骤,确保 Embeddings 费用归属正确:
1. 区分模型版本:确认账单中调用的是 text-embedding-3-small 还是旧版 ada-002。旧版单价较高,若业务允许,建议迁移至 Small 版本以降低成本。
2. 检查 Token 计数逻辑:Embeddings 的 Token 计数基于输入文本长度。注意,某些第三方 IDE 修改器或会话包装网关可能在发送前对文本进行预处理(如截断、添加系统提示),导致实际传入 API 的 Token 数与预期不符。
3. 验证缓存命中:虽然 Embeddings 本身不支持类似 Chat 的 Prompt 缓存(Prompt Caching),但上层应用逻辑可能缓存向量结果。若应用层未缓存,每次查询都重新计算 Embeddings,将产生巨额费用。
4. 识别异常峰值:若 Embeddings 费用突增,检查是否有非官方账号切换工具或自动化脚本在循环调用。正常业务流量应具有周期性,而非持续高频突发。
风险边界
切勿将 Chat 的缓存逻辑套用于 Embeddings。
目前 OpenAI 官方 API 对 Embeddings 端点不提供 Prompt 缓存优惠。任何声称能“缓存 Embeddings 结果以享受缓存折扣”的第三方工具或非官方账号切换工具,均属于误读或欺诈。这会导致开发者在升级或迁移架构时,因预期节省成本未实现而产生预算超支。
避免混淆 Plus 与 API 的额度。
ChatGPT Plus 订阅包含有限的 API 调用额度,但其 Embeddings 调用往往有严格的速率限制(Rate Limits)或完全不可用。若将 Plus 账户直接用于生产环境的 RAG 系统,极易因限流导致服务中断,且超额部分将按昂贵的 API 标准费率计费。请务必使用独立的 API 账户,并通过 billing-path 设置硬性预算警报。
第三方工具的隐性成本。
使用非官方账号切换工具或会话包装网关时,这些中间层可能会记录日志或重复请求,导致 Token 消耗翻倍。由于这些操作不在官方 API 的直接监控视野内,对账时会出现“明明没怎么调 API,账单却很高”的怪象。
站内路径
- 官方 API 价格总览:获取最新、最准确的模型单价。
- 计费路径详解:理解从请求到账单生成的完整链路。
- API 中转服务:了解合规的流量代理与监控方案。
- 成本计算示例:通过具体案例学习如何估算 Embeddings 费用。
- 开发者指南:最佳实践与架构建议。
English summary
This guide clarifies the billing mechanics of OpenAI's Embeddings API, distinguishing them from Chat Completions. Key points include: Embeddings are charged only on input tokens, with no output fees. Models like text-embedding-3-small offer the best cost-efficiency for general use. Developers must avoid conflating Plus subscription limits with API quotas, as this leads to unexpected charges and rate limit issues. Unlike Chat, Embeddings do not support prompt caching, so application-level caching is essential to control costs. Always verify token counts against official logs to detect anomalies from third-party tools or middleware. For accurate reconciliation, refer to the official price list and billing path documentation.