
# Embeddings 计费与检索架构:别和 Chat 混账
OpenAI 的 Embeddings API 专为创建文本向量而设计,主要服务于检索增强生成(RAG)、语义搜索、分类和聚类等场景。它与 Chat 模型完全不同,不参与输出生成,仅按输入 token 计费,且价格远低于 GPT 系列。适用于 1M+ token 月级别的项目开发者和需要精确语义匹配的开发者。
核心概念与术语
- Embeddings(嵌入):将文本转换为固定维度的浮点数向量(如 1536 或 3072 维),向量距离越近表示语义越相似。
- Embedding API:OpenAI 专属接口(
POST /v1/embeddings),用于生成向量。 - Token 计费单位:仅输入 token(非输出),与 Chat 模型的
/v1/chat/completions完全独立。 - 模型类型:
- text-embedding-3-small:推荐首选,性价比高,MTEB 得分 62.3%。
- text-embedding-3-large:追求更高准确性,MTEB 得分 64.6%。
- text-embedding-ada-002:老一代模型,仍可使用但已过时。
决策表:Embeddings 何时与 Chat 模型混用
| 场景 | 推荐模型 | 是否混用 Chat | 原因与决策依据 |
|---|---|---|---|
| RAG 知识库检索 | text-embedding-3-small | 否 | 向量距离匹配最优,成本最低 |
| 语义搜索与分类 | text-embedding-3-small | 否 | 实时响应,输入量大时更经济 |
| 高精度聚类/推荐 | text-embedding-3-large | 否 | 准确率胜出,适合离线/批量处理 |
| ChatGPT Plus 订阅 | 无需 Embeddings | 是 | 仅聊天,Embeddings 另计费 |
| 混合应用(Chat + 检索) | Embeddings + Chat | 否 | 向量仅 Embeddings 计费,Chat 单独计费 |
决策原则:项目中使用向量检索时,必须选择 Embeddings API;如果同时调用 Chat 模型,价格完全独立,按实际 token 统计。
实操清单:分步可核对计费
1. 创建 API Key:进入 OpenAI 平台,生成并保存。
2. 选择模型:在请求中指定 model: "text-embedding-3-small"(或 large/ada)。
3. 构建请求:
{
"input": ["文本1", "文本2"], // 数组支持批量
"model": "text-embedding-3-small"
}
4. 调用 API:使用 curl、Python requests 或官方 SDK。
5. 检查计费:响应中 usage.prompt_tokens 即为计费 token;查看 OpenAI 计费页面 对照公式计算。
6. 批量优化:开启 Batch API 可减半价格($0.01/M for small)。
示例(per 1M tokens):
- text-embedding-3-small:$0.02(标准),Batch 后 $0.01
- text-embedding-3-large:$0.13(标准),Batch 后 $0.065
常见坑与风险边界
- 误以为 Chat 计费:Embeddings 没有输出 token,很多人把向量视为“生成结果”导致低估成本。
- 维度混淆:
text-embedding-3-large为 3072 维,small为 1536 维,影响存储和查询速度。 - Batch 延迟:24 小时返回,不适合实时应用。
- 价格变动:以 OpenAI 官方定价页 当日数据为准,历史模型已迁移至新版。
- 输入长度限制:单个请求最大约 300,000 tokens。
非法律意见声明:以上信息基于公开官方文档整理,仅供参考,不构成任何法律或专业咨询。实际计费以 OpenAI 平台实时数据为准,请自行核对 API 文档与计费页面。
站内路径:相关工具与页面
- 官方 API 入门指南:完整模型列表与快速上手
- OpenAI API 价格一览:实时定价对照表
- API 流量与计费监控:实时费用追踪与优化建议
- 计费核对全流程:账单拆解与 API 明细查询
- API 使用最佳实践指南:Embeddings 与 Chat 混合开发示例