All models

text-embedding-ada-002

OpenAIEmbedding
Input 0.14 Credits / 1M
Get your API key
text-embedding-ada-002

面向既有知识库与语义检索的经典文本嵌入模型

text-embedding-ada-002 是 OpenAI 的经典文本嵌入模型,将自然语言与代码转换为可比较的数值向量,用于语义检索、相似内容匹配和代码搜索。它以统一的表示方式连接查询与文档,适合维护已有 ada-002 向量库,也可作为检索实验的基线;输出是向量,而不是聊天回答。

OpenAI模型品牌
向量模型类型
向量任务能力

规格与接口特性

在选型前明确容量、输入输出与调用方式。

原生输入容量
8192 tokens 上下文长度
完整向量维度
1536 维
输入方式
非空文本、文本批次、token 数组或 token 数组批次
批次数量
文本批次与 token 批次最多 2048 项
输出编码
float 或 base64,默认 float
调用方式
POST /openai/embeddings;model=text-embedding-ada-002

8192 tokens 与 1536 维是公开原生规格,批次形式和返回编码是本平台入口的调用设置,批次数量不等同于总 token 容量。

核心能力

了解 text-embedding-ada-002 能为你的工作带来什么。

用语义连接查询与文档

模型把查询和文档转换为同一种向量表示,适合寻找措辞不同但含义接近的内容。相比仅依赖关键词的检索方式,它可承担语义候选召回环节;应用再结合关键词、业务筛选或排序规则,形成最终搜索结果,而不是把相似度直接当作事实判断。

统一文本与代码搜索

ada-002 将文本相似度、查询与文档搜索、自然语言与代码搜索统一到一个模型中。既能为说明文档建立索引,也能表示代码片段,支持按功能描述寻找相关实现。这里的代码能力是语义表示与检索,不是编写程序、运行代码或验证程序正确性。

结构化向量便于应用接入

完整输出为 1536 维向量,便于按固定维度配置索引。返回数据带有 index,可用于关联批次中的输入,并提供 token 用量信息。默认 float 便于数值处理;选择 base64 时,需要按编码方式解码后再交给向量计算或存储组件。

适用场景

从具体任务出发,找到模型发挥作用的位置。

维护已有知识库检索

把新增帮助文档、产品说明和内部制度切分成文本块,继续用 ada-002 生成向量并写入既有索引。用户问题也使用同一模型编码,检索出相关片段后交给回答模型。交付物是可追溯的候选文档与片段,不是嵌入接口直接生成的答案。

发现相似内容与重复主题

输入工单正文、文章摘要或产品描述,得到向量后进行相似度排序或聚类,可用于寻找相近问题、归并重复主题与推荐相关内容。应用需自行设定阈值并抽样检查结果,尤其要区分主题相近与业务上完全重复,避免自动合并重要差异。

建立代码片段搜索

将函数片段、注释和开发文档分别编码,再把“解析配置文件”等自然语言需求转换为查询向量,返回相关代码位置与说明。适合代码库导航和实现参考;索引中应保留文件路径与版本信息,便于开发者回到原文件检查实际逻辑。

如何选择这个模型

结合任务复杂度、输入材料与预期结果选择。

已有 ada 索引时优先考虑一致性

如果现有文档向量由 ada-002 生成,继续使用它处理新增内容和查询,有利于保持检索空间一致。不要因为另一模型也输出相同维数,就直接混入旧索引。计划升级时,应重新编码文档,并用真实查询对比召回结果、存储开销与迁移成本,再决定是否切换。

新项目同时评估第三代嵌入

新建检索系统时,建议同时评估 text-embedding-3-small 和 text-embedding-3-large。官方比较显示,两者在多语言检索和英文任务平均基准上均优于 ada-002,并具备原生向量缩短能力。ada-002 更适合作为既有系统的延续或实验基线,选择仍应以业务数据测试为准。

开始使用

从一次小规模任务到正式接入。

01

准备任务与材料

明确目标、必要输入与输出要求,使用真实业务样例作为起点。

02

在 API 调试区试用

打开试用页,确认此入口支持的参数,再提交小规模任务查看结果。

03

按 API 文档接入

保留完整模型 ID,使用文档规定的请求格式,并在 Pricing 页确认计费规则。

使用边界

在正式使用前,了解输出质量与能力范围。

  • 8192 tokens 是输入容量,不是中文字符数;长文应先计数并按内容边界切分。批次最多 2048 项也不代表每项都能同时用满原生容量。合理分块不仅有助于控制请求大小,也能让检索结果定位到更具体的段落。
  • 不要将 ada-002 当作支持原生可变维度的模型使用,常规索引应按完整 1536 维设计。随意截断向量不能视为等价替代;若目标向量库要求更低维数,可评估具备原生缩短能力的 text-embedding-3 系列。
  • 检索能力不等于所有分类任务都更好。官方指出,它在 SentEval 线性探测分类基准上未超过 text-similarity-davinci-001;若要在向量上训练轻量分类层,应单独验证标签区分效果,而非沿用搜索任务的结论。

常见问题

解答使用 text-embedding-ada-002 时的常见疑问。

ada-002 能直接回答知识库问题吗?

不能直接生成回答。它把问题和文档转换成向量,应用据此找出相关片段,再由生成模型组织答案。构建知识库问答时,需要另行完成文档存储、相似度检索和回答生成,嵌入接口负责其中的文本表示环节。

如何批量生成向量并对应原文?

向 input 提交非空字符串数组,或提交 token 数组组成的批次;这两种批次形式最多 2048 项。响应 data 中每项带有 index,可据此关联输入。建议同时保存业务文档 ID,以便向量写入索引后仍能找到原始内容。

能直接提交 PDF、图片或网页地址吗?

这个入口接收文本或 token 数组,不是文件解析接口。PDF 需先提取文字,图片内容需先转换为可检索文本,网页则需先获取正文。网址即使作为字符串提交,也不意味着模型会自动打开页面并读取其中的内容。

float 和 base64 会改变向量维度吗?

它们用于选择返回编码,不是选择模型或维度。float 返回数值数组,适合直接进行向量处理;base64 返回编码字符串,需要解码后使用。ada-002 的完整向量为 1536 维,不能把传输格式变化理解成向量缩短。

改用 text-embedding-3-small 要重建索引吗?

应重新编码文档并建立对应索引,查询也要使用同一个新模型。不同模型产生的向量不应仅因维数相同就混合比较。迁移前可保留旧索引做对照,使用实际搜索问题检查结果质量,再逐步切换检索流程。

模型资料 · 更新日期:2026-10-01。调用参数与计费规则请查看 API 和定价栏目。

把 text-embedding-ada-002 用到你的下一项任务

从清晰的目标开始,在实际结果中判断它是否适合你的工作。