模型层 开放阅读

Embedding

Embedding

概念 ID
embedding
更新时间
2026-05-29
来源数量
待补

Embedding

1. 3 秒看懂

Embedding(嵌入)是将符号、ID 等离散对象映射到低维、稠密、连续向量空间的表示技术。它让机器能够计算“语义距离”,并作为所有深度学习模型理解原始世界的第一层翻译。从搜索、推荐、广告到生成式AI,Embedding 已渗透至几乎每一个 AI 系统的入口。

2. 3 分钟产业解释

深度学习模型不能直接理解文字、商品编号或图像文件名,必须先将这些符号转化为数值。最原始的做法是 one‑hot 编码,但会带来稀疏、维度爆炸且无法表达相似性的问题。Embedding 层通过学习为每个对象生成一个固定长度的实数向量(例如 128 维),使得语义相近的对象在向量空间中彼此靠近(余弦相似度高,或点积值大)。

产业中,Embedding 层无处不在:GPT 系列将词或子词映射为向量;推荐系统将用户 ID 和物品 ID 映射为向量后做内积来预估点击率;图神经网络将节点映射为向量用于分类与链接预测;现代检索增强生成(RAG)将文档切片转化为向量,再用向量数据库做相似性召回。随着应用深入,Embedding 的训练早已从静态查表发展为复杂网络的一部分,甚至出现了专门对外提供 Embedding 服务的 API(Embedding as a Service)。与此同时,向量数据库(Vectordb)基础设施因 RAG 和语义搜索的爆发而快速成长,形成了从上游语料、算力到下游应用的完整产业链。

3. 技术原理

深度学习中的 Embedding 本质是一个可训练的查表映射,数学上等价于一个无激活函数的全连接层权重矩阵。给定整数索引 i,输出向量为该矩阵的第 i 行。在训练过程中,损失函数的梯度通过该行回传,驱动向量向能减轻任务损失的方向移动,从而逐步获得语义。

其训练目标决定了向量的几何性质。在语言模型中,目标可能是根据上下文预测缺失词;在推荐系统中,目标可能是区分用户正、负交互物品。无论目标函数如何,最终每个离散符号都被嵌入到同一个向量流形上,使得下游任务可通过简单的向量运算(相加、点积、余弦相似度)来捕捉语义关系。

在现代 Transformer 架构中,静态的词嵌入会与位置编码相加,再经过多头注意力机制与多层网络交互,最终输出高度上下文相关的表示。因此,“Embedding”不再只是一个浅层查表,而是与整个模型联合优化的表示学习过程。工业界的大规模推荐模型(如 Meta 的 DLRM、Google 的双塔模型)中,物品 ID 的 Embedding 参数量可占模型总参数量的 90% 以上,对分布式存储与通信提出极高要求。

4. 关键参数

  • 词汇量(Vocabulary Size):需要嵌入的离散符号总数。在 NLP 中通常为 3 万~32 万(BPE 词汇表),在推荐系统中商品/视频 ID 可达数十亿量级。
  • 嵌入维度(Embedding Dimension):超参数,记为 d。常见取值有 32、64、128、256、768、1024 等,通常选择 2 的幂以便硬件对齐。较低维度可能欠拟合,过高则增加存储与过拟合风险。根据 Covington 等人在 YouTube 推荐系统论文(2016)中的实践,128~256 维是平衡效果与成本的经验区间;BERT 模型(Devlin et al., 2019)使用 768 维以获得丰富的语义表示。
  • 参数量与存储:总参数量 = 词汇量 × 维度 × 每参数字节数(通常 float32 为 4 字节)。例如,10 亿个物品 ID × 128 维 = 1280 亿参数,约 512 GB 显存(FP32),远超出单卡能力。工业界通过哈希、维度压缩(SVD)、混合粒度嵌入或参数服务器分片来应对。
  • 相似度度量:常见有余弦相似度、欧氏距离和内积。内积常用于双塔模型中进行高效 top‑K 召回,配合近似最近邻(ANN)索引。
  • 训练方式与更新频率:静态 Embedding(如 Word2Vec、GloVe)通常预训练后固定;动态 Embedding 随模型在线学习持续更新。增量更新时需监控向量漂移幅度(如最近 7 天同一 ID 向量的余弦差异中位数),以判断是否存在分布偏移。
  • OOV(词表外)处理:使用子词切分(BPE、WordPiece)或子词 n‑gram 求和(fastText)为零样本或罕见词生成向量,保证覆盖度。
  • 索引与查询参数:在海量向量中检索 top‑K 时,ANN 库(如 Faiss、ScaNN)需设定索引类型(IVF、HNSW)、构建时间、召回率 @K 和查询延迟(毫秒级)。不同配置直接影响成本与服务质量。

以上为通用技术参数说明,具体数值依任务与模型而异。

5. 技术路线

自 2013 年 Word2Vec 提出以来,Embedding 技术经历了多轮迭代,形成了多条并存路线:

路线代表方法/模型核心思想上下文敏感性典型维度典型应用
静态词向量Word2Vec, GloVe从大规模语料学习固定词向量,词与向量一一对应100–300文本分类、浅层特征
子词增强与快速 TextfastText用字符 n‑gram 向量合成词向量,解决 OOV100–300多语言、形态丰富语言
上下文动态嵌入ELMo, BERT, GPT静态嵌入+位置编码经深层网络得到上下文相关表示768–4096通用 NLU、NLG
双塔编码器(ID Embedding)YouTube DNN, DLRM, DSSM分别对用户塔和物品塔编码,顶部内积或余弦可融合上下文32–256推荐召回、广告点击率预估
对比学习多模态对齐CLIP, ALIGN, SigLIP各模态编码器输出对比损失对齐,形成统一嵌入空间512–768图文互搜、零样本分类
稀疏/多向量表示SPLADE, ColBERT每个文档产生一组带权词向量,而非单向量多向量精细文本排序、确保词级匹配
基于哈希的嵌入Hash Embedding多个哈希函数压缩大词汇表,降低参数量随模型训练可变超大规模 ID 快速部署

当前趋势集中于:① 大模型驱动的高质量通用文本嵌入服务(如 OpenAI text-embedding-3、Cohere Embed v3),支持可变维度以平衡成本与精度;② 开源嵌入模型的社区绩效竞赛(MTEB 榜单),涌现出 BGE、E5、GTE 等系列;③ 多模态与多语言统一表示的探索,目标是“一个嵌入空间统治一切”;④ 与向量数据库深度融合,实现毫秒级十亿向量检索。

6. 上游

  • 数据与语料:高质量文本、用户行为日志、图文对是大规模 Embedding 训练的基石。Common Crawl、大规模书籍、Reddit 对话等公开数据集被广泛使用;工业推荐系统多使用脱敏后的内部交互日志。
  • 标注与弱监督信号:自监督信号(掩码词预测、下一句预测、共现统计)是主流预训练方式。对比学习需要构造正负样本对,负采样策略(批内负采样、难负样本挖掘)直接影响嵌入质量。
  • 算力与芯片:训练数十亿参数模型需数百至数千张 GPU/TPU 并配以高带宽互联(NVLink、InfiniBand)。HBM 容量是限制超大规模 ID 嵌入的关键因素,因此 FP32→FP16/BF16 量化、梯度累积与参数服务器是标配。
  • 基础框架与平台:PyTorch 的 nn.Embeddingsparse 梯度支持,TensorFlow 的 ParameterServerStrategy;分布式训练框架(如 DeepSpeed、Megatron‑LM)将嵌入与主干网络协同切分。HuggingFace Hub 和 ModelScope 汇集了数万预训练嵌入模型,成为事实上的模型分发中心。
  • 向量索引库:Faiss、ScaNN、hnswlib 等提供高性能 ANN 检索能力,是 Embedding 应用生态的基础件。

7. 下游

  • 搜索与推荐系统:向量召回已成为搜索、推荐、广告的核心链路之一。用户与物品的主 Embedding 实时计算相似度,支撑万亿级在线查询。粗排/精排阶段常结合上下文特征强化学习。
  • 大模型应用与 RAG:文档块向量化存储于向量数据库中,用户问题转换为向量后检索相关块,注入 LLM 提示以生成答案。RAG 已成为解决知识截止和幻觉问题的主流架构。
  • 自然语言处理:文本分类、情感分析、语义相似度、命名实体识别等任务均依赖高质量文本嵌入。
  • 计算机视觉与多模态:以图像嵌入(如 ViT)进行图像检索、重复检测、视频片段匹配;CLIP 嵌入使零样本图文分类和跨模态检索成为现实。
  • 知识图谱与实体链接:实体嵌入用于链接预测、推理,以及将知识图谱注入语言模型。
  • 生物信息与分子表示:蛋白质序列、分子结构通过嵌入表示后进行功能预测或药物设计。
  • 异常检测与风控:行为序列的嵌入可捕捉异常模式,广泛应用于金融反欺诈等领域。

8. 受益公司

(本节仅描述产业结构和公司定位,不构成任何投资建议或价值判断)

  • AI 公有云与模型厂商:OpenAI 通过 text-embedding-3 系列提供低成本、可变维度的嵌入 API;Google 旗下 Vertex AI Embedding 和 Universal Sentence Encoder 服务于 GCP 生态;亚马逊 AWS 推出 Titan Embeddings;微软 Azure AI 整合 OpenAI 与自研嵌入模型。这些公司的 Embedding 服务直接随大模型应用的调用量增长。
  • 向量数据库公司:Pinecone(2023 年 4 月完成 1 亿美元 B 轮融资,由 a16z 领投,来源:TechCrunch)提供全托管向量数据库;开源向量数据库 Milvus 的母公司 Zilliz 获得多轮融资;Weaviate、Qdrant、Chroma、LanceDB 等也在各自的生态位快速发展。随着 RAG 模式推广,向量存储与检索基础设施需求强劲。
  • 推荐系统与广告平台:Meta、Google、字节跳动、阿里巴巴等互联网巨头在内部构建了万亿级 ID Embedding 系统,并沉淀了大量工程实践经验。它们既是 Embedding 技术的最大消费者,也是相关技术专利和框架的产出方。
  • 开源社区与 MLOps 工具链:HuggingFace 通过 Hub 聚合海量预训练嵌入模型,形成模型分发的中心节点;LangChain、LlamaIndex 等框架将嵌入与向量数据库作为标准组件集成,降低了应用门槛。
  • 硬件与算力服务商:NVIDIA GPU、定制 ASIC、高速存储和网络设备是嵌入训练与在线查表的物理底座,随产业扩大而持续受益。

9. 市场规模

(本节数据均需标注年份、口径和来源,未获得权威数据的部分明确标注“公开资料未见”)

  • 向量数据库市场:根据 Fortune Business Insights 于 2023 年 10 月发布的报告,2022 年全球向量数据库市场规模约为 12.1 亿美元,预计 2030 年将增长至 88.4 亿美元,2023–2030 年间复合年增长率(CAGR)达 28.2%。另一研究机构 MarketsandMarkets 在 2024 年 1 月给出的近似口径为 2023 年约 15 亿美元,2028 年有望达到 55 亿美元。两者均将增长归因于语义搜索与生成式 AI 的广泛部署。
  • Embedding API 调用量:公开资料未见第三方对全球 Embedding API 市场规模的独立统计。行业感知层面,OpenAI 在 2024 年 1 月推出 text-embedding-3 系列后,显著下调了输入价格(text-embedding-3-small 每 1000 token 输入价格 0.00002 美元),推动调用量高速增长,但绝对收入数字公司未单独披露。
  • 推荐系统嵌入存储成本:大型推荐平台每日处理万亿级 ID Embedding 更新,存储与网络带宽成本可达每年数亿美元量级,属于企业内部开销,无公开市场报告。
  • 支出结构趋势:根据 Gartner 对云 AI 服务的估算,2024 年全球云 AI 开发者服务支出约 75 亿美元,其中自然语言 API(含嵌入调用)占比扩大,但具体份额未公开。

注:上述市场数据均来自第三方报告或公司公开定价,数字仅反映当时的预测口径,实际发展可能偏离。

10. 玩家对比

(基于公开基准测试和官方发布信息,截至 2024 年 5 月)

文本嵌入服务/模型对比

厂商/项目代表模型最大维度最大输入 Token价格(每 1k token 输入,美元)MTEB 性能概况(来源)特点
OpenAItext-embedding-3-small512(可调)8191$0.00002在检索和分类任务中接近上一代大模型性能可变维度,高性价比
OpenAItext-embedding-3-large3072(可调)8191$0.00013MTEB 平均得分领先多数商业模型(来源:OpenAI 官方评测)极高准确度,适合复杂任务
CohereEmbed v31024512免费试用/付费在检索和聚类任务上表现强劲,多语言支持专注企业搜索,支持特定压缩
Google (Vertex AI)textembedding-gecko、text-embedding-preview-0409768、30722048~32768按每 1k 字符计费,约 $0.0001~MTEB 排名中上游,与 GCP 服务深度集成与 BigQuery、Vertex AI 搜索联动
开源 BGE 系列(BAAI)bge-large-en-v1.51024512免费MTEB 综合得分在 2024 年 2 月曾位列开源第一(来源:HuggingFace MTEB Leaderboard)多版本,支持中英文
开源 E5 系列(Microsoft)e5-large-v21024512免费MTEB 平均得分 65+,文本相似度突出需添加前缀“query: ”和“passage: ”
阿里云text-embedding-v1/v215362048按输入 Token 计费,公开报价约 0.0005 元/千 token公开资料未见独立 MTEB 详细排名,中文语义任务评测领先支持中英双语
百度Embedding-V11024384按调用量阶梯计费,价格未完全公开公开资料未见 MTEB 横向对比数据深度应用于百度搜索与推荐生态

说明:MTEB 指 Massive Text Embedding Benchmark,排行榜持续更新,以上性能描述仅反映特定时间截面的相对位置,实际选择需根据语言、任务和延迟成本综合评估。价格信息均来自各厂商官方定价页,截至 2024 年 5 月。

11. 风险

  • 技术风险:嵌入向量可能固化训练数据中的偏见,导致公平性缺失;对抗样本可微小扰动向量空间,造成检索或分类错误;模型升级后新旧嵌入空间不一致,导致下游应用断裂。
  • 运维与工程风险:超大规模 ID Embedding 面临频繁的增量更新,可能出现参数过期、向量漂移,使得相似度塌陷或查询召回率衰退。分布式组件间的网络延迟与单点故障影响业务连续性。
  • 供应商锁定:大量应用深度绑定单一 Embedding 模型或向量数据库的 API 与特定维度,切换成本高。模型服务价格变动、版本废止或质量变更均会对下游造成冲击。
  • 隐私与合规:文本嵌入向量在理论上有被攻击者复原为原始输入的风险(属性推断攻击)。在金融、医疗等强监管领域,使用云端 Embedding API 可能涉及数据出境或合规风险。
  • 市场与竞争风险:开源嵌入模型性能快速提升,部分已接近商业模型,可能侵蚀收费 API 的市场;向量数据库赛道拥挤,同质化竞争严重,部分初创企业面临资金链压力。
  • 过度期望:部分非结构化数据(如长尾稀有模式)的嵌入质量仍不理想,RAG 过度依赖 Embedding 可能引入噪声或遗漏关键信息,需配备完整的评估与防护体系。

12. 误读纠偏

  1. “Embedding 维度越高,表示一定越好”
    事实:维度应与信息量、任务复杂度匹配。过大的维度易导致过拟合、存储膨胀,并放大噪声。实际工作中需通过交叉验证或维度压缩(如 PCA、量化)确定最优维度。例如,推荐系统中上千亿物品的嵌入通常仅用 32–128 维,效果反而优于更大维度。
  2. “Embedding 只是简单的查表,没有技术含量”
    事实:工业级 Embedding 包括分布式存储分片、一致性写入、高频淘汰、冷启动初始化、在线学习与近实时更新等系统工程难题。此外,表示学习中的负采样策略、困难样本挖掘、多任务联合训练同样是核心技术。
  3. “大模型出来了,直接用 LLM 生成嵌入,不需要专项嵌入模型”
    事实:LLM 可作为通用文本嵌入生成器,但无法自然表达海量非文本 ID(如设备指纹、商品 SKU)的协同过滤信号。双塔等专用的 ID Embedding 依然是推荐与广告回流的基石。两者更多是互补:LLM 处理语义,ID Embedding 捕获交互,常通过混合塔或特征交互融合。
  4. “余弦相似度大于 0.9 就一定非常相关”
    事实:余弦相似度的分布高度依赖于训练目标、维度、正则化方式和数据类型。部分模型在微调后,相似度整体偏高或偏低,需要依据具体验证集的阈值校准,而不是武断使用绝对值。
  5. “任何向量数据库都能直接替代专用 Embedding 服务”
    事实:向量数据库解决的是存储与检索,而非生成高质量向量的能力。最终效果取决于嵌入模型本身的表示能力。不更换模型只更换数据库,无法提升语义召回质量。

13. 最新事件

(截至 2024 年 5 月,来源均为公开信息)

  • 2024‑01‑25:OpenAI 发布 text-embedding-3-small 和 text-embedding-3-large,支持可变维度(用户可指定输出维度,无需重新训练),大幅降低价格,成为嵌入 API 市场标志性事件。(来源:OpenAI Blog)
  • 2024‑02–03:多家研究机构更新 MTEB 排行榜,开源模型 BGE-M3 和 E5‑mistral‑7b 在多语言和长文本任务中取得突破,缩小与商业模型的差距。(来源:HuggingFace MTEB Leaderboard)
  • 2024‑03:Cohere 推出 Embed v3 的改进版,支持 multi‑vector 输出和压缩,进一步降低检索成本。(来源:Cohere 官方博客)
  • 2024‑04:Google 在 Cloud Next ‘24 上宣布 textembedding-gecko 和 text-embedding-preview-0409(3072 维)的公开预览,并与 BigQuery 和 Vertex AI Agent Builder 深度集成。(来源:Google Cloud Blog)
  • 2024‑04–05:向量数据库赛道持续吸金,Weaviate 获得 5000 万美元 B 轮追加;国产向量数据库公司如智聚集成(Zilliz)、矩阵起源等也有新版本或战略合作发布。(来源:Press 报道)
  • 2024‑05:阿里云“通义”系列 embedding 模型更新至 v2,支持 2k tokens,中英文场景在内部评测中较上一代提升明显,但未公开 MTEB 横向对比。(来源:阿里云官网公告)

14. 跟踪指标

  • MTEB 榜单变动:关注文本嵌入在分类、聚类、Pair Classification、重排序、检索、STS 和摘要 7 大任务的平均得分及排名变化,特别是新模型的发布与旧模型失效节奏。
  • 嵌入 API 成本与延迟:核心厂商每百万 token 的价格、最大输入窗口和平均查询延迟(P50/P99),例如 OpenAI 和 Cohere 的定期定价变更。
  • 向量数据库基准:ANN‑benchmarks 记录的 QPS、召回率@10、索引构建时间、内存占用等,关注 scann、faiss‑ivf‑hnsw 等算法的性能进展。
  • 开源模型下载量与社区活跃度:HuggingFace 和 ModelScope 上知名嵌入模型的月下载量、Stars,反映开发者采用趋势。
  • RAG 框架集成度:LangChain、LlamaIndex 等框架默认推荐的嵌入模型组合,可间接反映行业共识。
  • 检索质量业务指标:对于企业内部,应监控自建搜索/推荐系统的在线召回率、cover rate、点击率、向量漂移指数和 ANN 索引刷新频率。
  • 专利与论文:以“embedding”、“文本向量”、“向量数据库”为关键词的专利数与顶会论文数,可反映技术密集度。
  • 事件驱动:头部云厂商模型停用(如 OpenAI 曾废弃 Ada v2 嵌入)、重大安全漏洞或数据泄露事件,会影响产业布局。

15. 信源

  1. Mikolov, T. et al. “Efficient Estimation of Word Representations in Vector Space.” arXiv preprint arXiv:1301.3781, 2013.
  2. Pennington, J. et al. “GloVe: Global Vectors for Word Representation.” EMNLP, 2014.
  3. Devlin, J. et al. “BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding.” NAACL, 2019.
  4. Radford, A. et al. “Learning Transferable Visual Models From Natural Language Supervision.” ICML, 2021. (CLIP)
  5. Covington, P. et al. “Deep Neural Networks for YouTube Recommendations.” RecSys, 2016.
  6. Naumov, M. et al. “Deep Learning Recommendation Model for Personalization and Recommendation Systems.” arXiv, 2019. (DLRM)
  7. OpenAI. “New embedding models and API updates.” OpenAI Blog, Jan 25, 2024.
  8. Google Cloud. “Vertex AI Embeddings for Text.” Google Cloud Documentation, 2024.
  9. Cohere. “Cohere Embed v3: The industry’s leading search model.” Cohere Blog, 2023/2024.
  10. HuggingFace MTEB Leaderboard, https://huggingface.co/spaces/mteb/leaderboard, accessed May 2024.
  11. Fortune Business Insights. “Vector Database Market Size, Share & COVID-19 Impact Analysis… 2023-2030.” Report ID: FBI107395, Oct 2023.
  12. MarketsandMarkets. “Vector Database Market – Global Forecast to 2028.” Market Research Report, Jan 2024.
  13. Gartner. “Forecast: Public Cloud Services, Worldwide, 2022-2024.” Gartner Research, 2024.
  14. TechCrunch. “Pinecone raises $100M Series B…”, Apr 27, 2023.
  15. Various press releases and official pricing pages from Alibaba Cloud, Baidu AI Cloud, Zilliz, Weaviate, Qdrant.

(未在正文中引述到的其他公开资料,读者可根据关键词自行检索。)

source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型