Embedding
1. 3 秒看懂
Embedding(嵌入)是将符号、ID 等离散对象映射到低维、稠密、连续向量空间的表示技术。它让机器能够计算“语义距离”,并作为所有深度学习模型理解原始世界的第一层翻译。从搜索、推荐、广告到生成式AI,Embedding 已渗透至几乎每一个 AI 系统的入口。
2. 3 分钟产业解释
深度学习模型不能直接理解文字、商品编号或图像文件名,必须先将这些符号转化为数值。最原始的做法是 one‑hot 编码,但会带来稀疏、维度爆炸且无法表达相似性的问题。Embedding 层通过学习为每个对象生成一个固定长度的实数向量(例如 128 维),使得语义相近的对象在向量空间中彼此靠近(余弦相似度高,或点积值大)。
产业中,Embedding 层无处不在:GPT 系列将词或子词映射为向量;推荐系统将用户 ID 和物品 ID 映射为向量后做内积来预估点击率;图神经网络将节点映射为向量用于分类与链接预测;现代检索增强生成(RAG)将文档切片转化为向量,再用向量数据库做相似性召回。随着应用深入,Embedding 的训练早已从静态查表发展为复杂网络的一部分,甚至出现了专门对外提供 Embedding 服务的 API(Embedding as a Service)。与此同时,向量数据库(Vectordb)基础设施因 RAG 和语义搜索的爆发而快速成长,形成了从上游语料、算力到下游应用的完整产业链。
3. 技术原理
深度学习中的 Embedding 本质是一个可训练的查表映射,数学上等价于一个无激活函数的全连接层权重矩阵。给定整数索引 i,输出向量为该矩阵的第 i 行。在训练过程中,损失函数的梯度通过该行回传,驱动向量向能减轻任务损失的方向移动,从而逐步获得语义。
其训练目标决定了向量的几何性质。在语言模型中,目标可能是根据上下文预测缺失词;在推荐系统中,目标可能是区分用户正、负交互物品。无论目标函数如何,最终每个离散符号都被嵌入到同一个向量流形上,使得下游任务可通过简单的向量运算(相加、点积、余弦相似度)来捕捉语义关系。
在现代 Transformer 架构中,静态的词嵌入会与位置编码相加,再经过多头注意力机制与多层网络交互,最终输出高度上下文相关的表示。因此,“Embedding”不再只是一个浅层查表,而是与整个模型联合优化的表示学习过程。工业界的大规模推荐模型(如 Meta 的 DLRM、Google 的双塔模型)中,物品 ID 的 Embedding 参数量可占模型总参数量的 90% 以上,对分布式存储与通信提出极高要求。
4. 关键参数
- 词汇量(Vocabulary Size):需要嵌入的离散符号总数。在 NLP 中通常为 3 万~32 万(BPE 词汇表),在推荐系统中商品/视频 ID 可达数十亿量级。
- 嵌入维度(Embedding Dimension):超参数,记为
d。常见取值有 32、64、128、256、768、1024 等,通常选择 2 的幂以便硬件对齐。较低维度可能欠拟合,过高则增加存储与过拟合风险。根据 Covington 等人在 YouTube 推荐系统论文(2016)中的实践,128~256 维是平衡效果与成本的经验区间;BERT 模型(Devlin et al., 2019)使用 768 维以获得丰富的语义表示。 - 参数量与存储:总参数量 = 词汇量 × 维度 × 每参数字节数(通常 float32 为 4 字节)。例如,10 亿个物品 ID × 128 维 = 1280 亿参数,约 512 GB 显存(FP32),远超出单卡能力。工业界通过哈希、维度压缩(SVD)、混合粒度嵌入或参数服务器分片来应对。
- 相似度度量:常见有余弦相似度、欧氏距离和内积。内积常用于双塔模型中进行高效 top‑K 召回,配合近似最近邻(ANN)索引。
- 训练方式与更新频率:静态 Embedding(如 Word2Vec、GloVe)通常预训练后固定;动态 Embedding 随模型在线学习持续更新。增量更新时需监控向量漂移幅度(如最近 7 天同一 ID 向量的余弦差异中位数),以判断是否存在分布偏移。
- OOV(词表外)处理:使用子词切分(BPE、WordPiece)或子词 n‑gram 求和(fastText)为零样本或罕见词生成向量,保证覆盖度。
- 索引与查询参数:在海量向量中检索 top‑K 时,ANN 库(如 Faiss、ScaNN)需设定索引类型(IVF、HNSW)、构建时间、召回率 @K 和查询延迟(毫秒级)。不同配置直接影响成本与服务质量。
以上为通用技术参数说明,具体数值依任务与模型而异。
5. 技术路线
自 2013 年 Word2Vec 提出以来,Embedding 技术经历了多轮迭代,形成了多条并存路线:
| 路线 | 代表方法/模型 | 核心思想 | 上下文敏感性 | 典型维度 | 典型应用 |
|---|---|---|---|---|---|
| 静态词向量 | Word2Vec, GloVe | 从大规模语料学习固定词向量,词与向量一一对应 | 否 | 100–300 | 文本分类、浅层特征 |
| 子词增强与快速 Text | fastText | 用字符 n‑gram 向量合成词向量,解决 OOV | 否 | 100–300 | 多语言、形态丰富语言 |
| 上下文动态嵌入 | ELMo, BERT, GPT | 静态嵌入+位置编码经深层网络得到上下文相关表示 | 是 | 768–4096 | 通用 NLU、NLG |
| 双塔编码器(ID Embedding) | YouTube DNN, DLRM, DSSM | 分别对用户塔和物品塔编码,顶部内积或余弦 | 可融合上下文 | 32–256 | 推荐召回、广告点击率预估 |
| 对比学习多模态对齐 | CLIP, ALIGN, SigLIP | 各模态编码器输出对比损失对齐,形成统一嵌入空间 | 是 | 512–768 | 图文互搜、零样本分类 |
| 稀疏/多向量表示 | SPLADE, ColBERT | 每个文档产生一组带权词向量,而非单向量 | 是 | 多向量 | 精细文本排序、确保词级匹配 |
| 基于哈希的嵌入 | Hash Embedding | 多个哈希函数压缩大词汇表,降低参数量 | 随模型训练 | 可变 | 超大规模 ID 快速部署 |
当前趋势集中于:① 大模型驱动的高质量通用文本嵌入服务(如 OpenAI text-embedding-3、Cohere Embed v3),支持可变维度以平衡成本与精度;② 开源嵌入模型的社区绩效竞赛(MTEB 榜单),涌现出 BGE、E5、GTE 等系列;③ 多模态与多语言统一表示的探索,目标是“一个嵌入空间统治一切”;④ 与向量数据库深度融合,实现毫秒级十亿向量检索。
6. 上游
- 数据与语料:高质量文本、用户行为日志、图文对是大规模 Embedding 训练的基石。Common Crawl、大规模书籍、Reddit 对话等公开数据集被广泛使用;工业推荐系统多使用脱敏后的内部交互日志。
- 标注与弱监督信号:自监督信号(掩码词预测、下一句预测、共现统计)是主流预训练方式。对比学习需要构造正负样本对,负采样策略(批内负采样、难负样本挖掘)直接影响嵌入质量。
- 算力与芯片:训练数十亿参数模型需数百至数千张 GPU/TPU 并配以高带宽互联(NVLink、InfiniBand)。HBM 容量是限制超大规模 ID 嵌入的关键因素,因此 FP32→FP16/BF16 量化、梯度累积与参数服务器是标配。
- 基础框架与平台:PyTorch 的
nn.Embedding及sparse梯度支持,TensorFlow 的 ParameterServerStrategy;分布式训练框架(如 DeepSpeed、Megatron‑LM)将嵌入与主干网络协同切分。HuggingFace Hub 和 ModelScope 汇集了数万预训练嵌入模型,成为事实上的模型分发中心。 - 向量索引库:Faiss、ScaNN、hnswlib 等提供高性能 ANN 检索能力,是 Embedding 应用生态的基础件。
7. 下游
- 搜索与推荐系统:向量召回已成为搜索、推荐、广告的核心链路之一。用户与物品的主 Embedding 实时计算相似度,支撑万亿级在线查询。粗排/精排阶段常结合上下文特征强化学习。
- 大模型应用与 RAG:文档块向量化存储于向量数据库中,用户问题转换为向量后检索相关块,注入 LLM 提示以生成答案。RAG 已成为解决知识截止和幻觉问题的主流架构。
- 自然语言处理:文本分类、情感分析、语义相似度、命名实体识别等任务均依赖高质量文本嵌入。
- 计算机视觉与多模态:以图像嵌入(如 ViT)进行图像检索、重复检测、视频片段匹配;CLIP 嵌入使零样本图文分类和跨模态检索成为现实。
- 知识图谱与实体链接:实体嵌入用于链接预测、推理,以及将知识图谱注入语言模型。
- 生物信息与分子表示:蛋白质序列、分子结构通过嵌入表示后进行功能预测或药物设计。
- 异常检测与风控:行为序列的嵌入可捕捉异常模式,广泛应用于金融反欺诈等领域。
8. 受益公司
(本节仅描述产业结构和公司定位,不构成任何投资建议或价值判断)
- AI 公有云与模型厂商:OpenAI 通过 text-embedding-3 系列提供低成本、可变维度的嵌入 API;Google 旗下 Vertex AI Embedding 和 Universal Sentence Encoder 服务于 GCP 生态;亚马逊 AWS 推出 Titan Embeddings;微软 Azure AI 整合 OpenAI 与自研嵌入模型。这些公司的 Embedding 服务直接随大模型应用的调用量增长。
- 向量数据库公司:Pinecone(2023 年 4 月完成 1 亿美元 B 轮融资,由 a16z 领投,来源:TechCrunch)提供全托管向量数据库;开源向量数据库 Milvus 的母公司 Zilliz 获得多轮融资;Weaviate、Qdrant、Chroma、LanceDB 等也在各自的生态位快速发展。随着 RAG 模式推广,向量存储与检索基础设施需求强劲。
- 推荐系统与广告平台:Meta、Google、字节跳动、阿里巴巴等互联网巨头在内部构建了万亿级 ID Embedding 系统,并沉淀了大量工程实践经验。它们既是 Embedding 技术的最大消费者,也是相关技术专利和框架的产出方。
- 开源社区与 MLOps 工具链:HuggingFace 通过 Hub 聚合海量预训练嵌入模型,形成模型分发的中心节点;LangChain、LlamaIndex 等框架将嵌入与向量数据库作为标准组件集成,降低了应用门槛。
- 硬件与算力服务商:NVIDIA GPU、定制 ASIC、高速存储和网络设备是嵌入训练与在线查表的物理底座,随产业扩大而持续受益。
9. 市场规模
(本节数据均需标注年份、口径和来源,未获得权威数据的部分明确标注“公开资料未见”)
- 向量数据库市场:根据 Fortune Business Insights 于 2023 年 10 月发布的报告,2022 年全球向量数据库市场规模约为 12.1 亿美元,预计 2030 年将增长至 88.4 亿美元,2023–2030 年间复合年增长率(CAGR)达 28.2%。另一研究机构 MarketsandMarkets 在 2024 年 1 月给出的近似口径为 2023 年约 15 亿美元,2028 年有望达到 55 亿美元。两者均将增长归因于语义搜索与生成式 AI 的广泛部署。
- Embedding API 调用量:公开资料未见第三方对全球 Embedding API 市场规模的独立统计。行业感知层面,OpenAI 在 2024 年 1 月推出 text-embedding-3 系列后,显著下调了输入价格(text-embedding-3-small 每 1000 token 输入价格 0.00002 美元),推动调用量高速增长,但绝对收入数字公司未单独披露。
- 推荐系统嵌入存储成本:大型推荐平台每日处理万亿级 ID Embedding 更新,存储与网络带宽成本可达每年数亿美元量级,属于企业内部开销,无公开市场报告。
- 支出结构趋势:根据 Gartner 对云 AI 服务的估算,2024 年全球云 AI 开发者服务支出约 75 亿美元,其中自然语言 API(含嵌入调用)占比扩大,但具体份额未公开。
注:上述市场数据均来自第三方报告或公司公开定价,数字仅反映当时的预测口径,实际发展可能偏离。
10. 玩家对比
(基于公开基准测试和官方发布信息,截至 2024 年 5 月)
文本嵌入服务/模型对比
| 厂商/项目 | 代表模型 | 最大维度 | 最大输入 Token | 价格(每 1k token 输入,美元) | MTEB 性能概况(来源) | 特点 |
|---|---|---|---|---|---|---|
| OpenAI | text-embedding-3-small | 512(可调) | 8191 | $0.00002 | 在检索和分类任务中接近上一代大模型性能 | 可变维度,高性价比 |
| OpenAI | text-embedding-3-large | 3072(可调) | 8191 | $0.00013 | MTEB 平均得分领先多数商业模型(来源:OpenAI 官方评测) | 极高准确度,适合复杂任务 |
| Cohere | Embed v3 | 1024 | 512 | 免费试用/付费 | 在检索和聚类任务上表现强劲,多语言支持 | 专注企业搜索,支持特定压缩 |
| Google (Vertex AI) | textembedding-gecko、text-embedding-preview-0409 | 768、3072 | 2048~32768 | 按每 1k 字符计费,约 $0.0001~ | MTEB 排名中上游,与 GCP 服务深度集成 | 与 BigQuery、Vertex AI 搜索联动 |
| 开源 BGE 系列(BAAI) | bge-large-en-v1.5 | 1024 | 512 | 免费 | MTEB 综合得分在 2024 年 2 月曾位列开源第一(来源:HuggingFace MTEB Leaderboard) | 多版本,支持中英文 |
| 开源 E5 系列(Microsoft) | e5-large-v2 | 1024 | 512 | 免费 | MTEB 平均得分 65+,文本相似度突出 | 需添加前缀“query: ”和“passage: ” |
| 阿里云 | text-embedding-v1/v2 | 1536 | 2048 | 按输入 Token 计费,公开报价约 0.0005 元/千 token | 公开资料未见独立 MTEB 详细排名,中文语义任务评测领先 | 支持中英双语 |
| 百度 | Embedding-V1 | 1024 | 384 | 按调用量阶梯计费,价格未完全公开 | 公开资料未见 MTEB 横向对比数据 | 深度应用于百度搜索与推荐生态 |
说明:MTEB 指 Massive Text Embedding Benchmark,排行榜持续更新,以上性能描述仅反映特定时间截面的相对位置,实际选择需根据语言、任务和延迟成本综合评估。价格信息均来自各厂商官方定价页,截至 2024 年 5 月。
11. 风险
- 技术风险:嵌入向量可能固化训练数据中的偏见,导致公平性缺失;对抗样本可微小扰动向量空间,造成检索或分类错误;模型升级后新旧嵌入空间不一致,导致下游应用断裂。
- 运维与工程风险:超大规模 ID Embedding 面临频繁的增量更新,可能出现参数过期、向量漂移,使得相似度塌陷或查询召回率衰退。分布式组件间的网络延迟与单点故障影响业务连续性。
- 供应商锁定:大量应用深度绑定单一 Embedding 模型或向量数据库的 API 与特定维度,切换成本高。模型服务价格变动、版本废止或质量变更均会对下游造成冲击。
- 隐私与合规:文本嵌入向量在理论上有被攻击者复原为原始输入的风险(属性推断攻击)。在金融、医疗等强监管领域,使用云端 Embedding API 可能涉及数据出境或合规风险。
- 市场与竞争风险:开源嵌入模型性能快速提升,部分已接近商业模型,可能侵蚀收费 API 的市场;向量数据库赛道拥挤,同质化竞争严重,部分初创企业面临资金链压力。
- 过度期望:部分非结构化数据(如长尾稀有模式)的嵌入质量仍不理想,RAG 过度依赖 Embedding 可能引入噪声或遗漏关键信息,需配备完整的评估与防护体系。
12. 误读纠偏
- “Embedding 维度越高,表示一定越好”
事实:维度应与信息量、任务复杂度匹配。过大的维度易导致过拟合、存储膨胀,并放大噪声。实际工作中需通过交叉验证或维度压缩(如 PCA、量化)确定最优维度。例如,推荐系统中上千亿物品的嵌入通常仅用 32–128 维,效果反而优于更大维度。 - “Embedding 只是简单的查表,没有技术含量”
事实:工业级 Embedding 包括分布式存储分片、一致性写入、高频淘汰、冷启动初始化、在线学习与近实时更新等系统工程难题。此外,表示学习中的负采样策略、困难样本挖掘、多任务联合训练同样是核心技术。 - “大模型出来了,直接用 LLM 生成嵌入,不需要专项嵌入模型”
事实:LLM 可作为通用文本嵌入生成器,但无法自然表达海量非文本 ID(如设备指纹、商品 SKU)的协同过滤信号。双塔等专用的 ID Embedding 依然是推荐与广告回流的基石。两者更多是互补:LLM 处理语义,ID Embedding 捕获交互,常通过混合塔或特征交互融合。 - “余弦相似度大于 0.9 就一定非常相关”
事实:余弦相似度的分布高度依赖于训练目标、维度、正则化方式和数据类型。部分模型在微调后,相似度整体偏高或偏低,需要依据具体验证集的阈值校准,而不是武断使用绝对值。 - “任何向量数据库都能直接替代专用 Embedding 服务”
事实:向量数据库解决的是存储与检索,而非生成高质量向量的能力。最终效果取决于嵌入模型本身的表示能力。不更换模型只更换数据库,无法提升语义召回质量。
13. 最新事件
(截至 2024 年 5 月,来源均为公开信息)
- 2024‑01‑25:OpenAI 发布 text-embedding-3-small 和 text-embedding-3-large,支持可变维度(用户可指定输出维度,无需重新训练),大幅降低价格,成为嵌入 API 市场标志性事件。(来源:OpenAI Blog)
- 2024‑02–03:多家研究机构更新 MTEB 排行榜,开源模型 BGE-M3 和 E5‑mistral‑7b 在多语言和长文本任务中取得突破,缩小与商业模型的差距。(来源:HuggingFace MTEB Leaderboard)
- 2024‑03:Cohere 推出 Embed v3 的改进版,支持 multi‑vector 输出和压缩,进一步降低检索成本。(来源:Cohere 官方博客)
- 2024‑04:Google 在 Cloud Next ‘24 上宣布 textembedding-gecko 和 text-embedding-preview-0409(3072 维)的公开预览,并与 BigQuery 和 Vertex AI Agent Builder 深度集成。(来源:Google Cloud Blog)
- 2024‑04–05:向量数据库赛道持续吸金,Weaviate 获得 5000 万美元 B 轮追加;国产向量数据库公司如智聚集成(Zilliz)、矩阵起源等也有新版本或战略合作发布。(来源:Press 报道)
- 2024‑05:阿里云“通义”系列 embedding 模型更新至 v2,支持 2k tokens,中英文场景在内部评测中较上一代提升明显,但未公开 MTEB 横向对比。(来源:阿里云官网公告)
14. 跟踪指标
- MTEB 榜单变动:关注文本嵌入在分类、聚类、Pair Classification、重排序、检索、STS 和摘要 7 大任务的平均得分及排名变化,特别是新模型的发布与旧模型失效节奏。
- 嵌入 API 成本与延迟:核心厂商每百万 token 的价格、最大输入窗口和平均查询延迟(P50/P99),例如 OpenAI 和 Cohere 的定期定价变更。
- 向量数据库基准:ANN‑benchmarks 记录的 QPS、召回率@10、索引构建时间、内存占用等,关注 scann、faiss‑ivf‑hnsw 等算法的性能进展。
- 开源模型下载量与社区活跃度:HuggingFace 和 ModelScope 上知名嵌入模型的月下载量、Stars,反映开发者采用趋势。
- RAG 框架集成度:LangChain、LlamaIndex 等框架默认推荐的嵌入模型组合,可间接反映行业共识。
- 检索质量业务指标:对于企业内部,应监控自建搜索/推荐系统的在线召回率、cover rate、点击率、向量漂移指数和 ANN 索引刷新频率。
- 专利与论文:以“embedding”、“文本向量”、“向量数据库”为关键词的专利数与顶会论文数,可反映技术密集度。
- 事件驱动:头部云厂商模型停用(如 OpenAI 曾废弃 Ada v2 嵌入)、重大安全漏洞或数据泄露事件,会影响产业布局。
15. 信源
- Mikolov, T. et al. “Efficient Estimation of Word Representations in Vector Space.” arXiv preprint arXiv:1301.3781, 2013.
- Pennington, J. et al. “GloVe: Global Vectors for Word Representation.” EMNLP, 2014.
- Devlin, J. et al. “BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding.” NAACL, 2019.
- Radford, A. et al. “Learning Transferable Visual Models From Natural Language Supervision.” ICML, 2021. (CLIP)
- Covington, P. et al. “Deep Neural Networks for YouTube Recommendations.” RecSys, 2016.
- Naumov, M. et al. “Deep Learning Recommendation Model for Personalization and Recommendation Systems.” arXiv, 2019. (DLRM)
- OpenAI. “New embedding models and API updates.” OpenAI Blog, Jan 25, 2024.
- Google Cloud. “Vertex AI Embeddings for Text.” Google Cloud Documentation, 2024.
- Cohere. “Cohere Embed v3: The industry’s leading search model.” Cohere Blog, 2023/2024.
- HuggingFace MTEB Leaderboard, https://huggingface.co/spaces/mteb/leaderboard, accessed May 2024.
- Fortune Business Insights. “Vector Database Market Size, Share & COVID-19 Impact Analysis… 2023-2030.” Report ID: FBI107395, Oct 2023.
- MarketsandMarkets. “Vector Database Market – Global Forecast to 2028.” Market Research Report, Jan 2024.
- Gartner. “Forecast: Public Cloud Services, Worldwide, 2022-2024.” Gartner Research, 2024.
- TechCrunch. “Pinecone raises $100M Series B…”, Apr 27, 2023.
- Various press releases and official pricing pages from Alibaba Cloud, Baidu AI Cloud, Zilliz, Weaviate, Qdrant.
(未在正文中引述到的其他公开资料,读者可根据关键词自行检索。)