模型層 開放閱讀

Embedding

Embedding

概念 ID
embedding
更新時間
2026-05-29
來源數量
待補

Embedding

1. 3 秒看懂

Embedding(嵌入)是將符號、ID 等離散物件對映到低維、稠密、連續向量空間的表示技術。它讓機器能夠計算“語義距離”,並作為所有深度學習模型理解原始世界的第一層翻譯。從搜尋、推薦、廣告到生成式AI,Embedding 已滲透至幾乎每一個 AI 系統的入口。

2. 3 分鐘產業解釋

深度學習模型不能直接理解文字、商品編號或影像檔名,必須先將這些符號轉化為數值。最原始的做法是 one‑hot 編碼,但會帶來稀疏、維度爆炸且無法表達相似性的問題。Embedding 層通過學習為每個物件生成一個固定長度的實數向量(例如 128 維),使得語義相近的物件在向量空間中彼此靠近(餘弦相似度高,或點積值大)。

產業中,Embedding 層無處不在:GPT 系列將詞或子詞對映為向量;推薦系統將使用者 ID 和物品 ID 對映為向量後做內積來預估點選率;圖神經網路將節點對映為向量用於分類與連結預測;現代檢索增強生成(RAG)將文件切片轉化為向量,再用向量資料庫做相似性召回。隨著應用深入,Embedding 的訓練早已從靜態查表發展為複雜網路的一部分,甚至出現了專門對外提供 Embedding 服務的 API(Embedding as a Service)。與此同時,向量資料庫(Vectordb)基礎設施因 RAG 和語義搜尋的爆發而快速成長,形成了從上游語料、算力到下游應用的完整產業鏈。

3. 技術原理

深度學習中的 Embedding 本質是一個可訓練的查表對映,數學上等價於一個無啟用函式的全連線層權重矩陣。給定整數索引 i,輸出向量為該矩陣的第 i 行。在訓練過程中,損失函式的梯度通過該行回傳,驅動向量向能減輕任務損失的方向移動,從而逐步獲得語義。

其訓練目標決定了向量的幾何性質。在語言模型中,目標可能是根據上下文預測缺失詞;在推薦系統中,目標可能是區分使用者正、負互動物品。無論目標函式如何,最終每個離散符號都被嵌入到同一個向量流形上,使得下游任務可通過簡單的向量運算(相加、點積、餘弦相似度)來捕捉語義關係。

在現代 Transformer 架構中,靜態的詞嵌入會與位置編碼相加,再經過多頭注意力機制與多層網路互動,最終輸出高度上下文相關的表示。因此,“Embedding”不再只是一個淺層查表,而是與整個模型聯合最佳化的表示學習過程。工業界的大規模推薦模型(如 Meta 的 DLRM、Google 的雙塔模型)中,物品 ID 的 Embedding 引數量可佔模型總引數量的 90% 以上,對分散式儲存與通訊提出極高要求。

4. 關鍵引數

  • 詞彙量(Vocabulary Size):需要嵌入的離散符號總數。在 NLP 中通常為 3 萬~32 萬(BPE 詞彙表),在推薦系統中商品/影片 ID 可達數十億量級。
  • 嵌入維度(Embedding Dimension):超引數,記為 d。常見取值有 32、64、128、256、768、1024 等,通常選擇 2 的冪以便硬體對齊。較低維度可能欠擬合,過高則增加儲存與過擬合風險。根據 Covington 等人在 YouTube 推薦系統論文(2016)中的實踐,128~256 維是平衡效果與成本的經驗區間;BERT 模型(Devlin et al., 2019)使用 768 維以獲得豐富的語義表示。
  • 引數量與儲存:總引數量 = 詞彙量 × 維度 × 每引數位元組數(通常 float32 為 4 位元組)。例如,10 億個物品 ID × 128 維 = 1280 億引數,約 512 GB 視訊記憶體(FP32),遠超出單卡能力。工業界通過雜湊、維度壓縮(SVD)、混合粒度嵌入或引數伺服器分片來應對。
  • 相似度度量:常見有餘弦相似度、歐氏距離和內積。內積常用於雙塔模型中進行高效 top‑K 召回,配合近似最近鄰(ANN)索引。
  • 訓練方式與更新頻率:靜態 Embedding(如 Word2Vec、GloVe)通常預訓練後固定;動態 Embedding 隨模型線上學習持續更新。增量更新時需監控向量漂移幅度(如最近 7 天同一 ID 向量的餘弦差異中位數),以判斷是否存在分佈偏移。
  • OOV(詞表外)處理:使用子詞切分(BPE、WordPiece)或子詞 n‑gram 求和(fastText)為零樣本或罕見詞生成向量,保證覆蓋度。
  • 索引與查詢引數:在海量向量中檢索 top‑K 時,ANN 庫(如 Faiss、ScaNN)需設定索引型別(IVF、HNSW)、建置時間、召回率 @K 和查詢延遲(毫秒級)。不同配置直接影響成本與服務質量。

以上為通用技術引數說明,具體數值依任務與模型而異。

5. 技術路線

自 2013 年 Word2Vec 提出以來,Embedding 技術經歷了多輪迭代,形成了多條並存路線:

路線代表方法/模型核心思想上下文敏感性典型維度典型應用
靜態詞向量Word2Vec, GloVe從大規模語料學習固定詞向量,詞與向量一一對應100–300文本分類、淺層特徵
子詞增強與快速 TextfastText用字元 n‑gram 向量合成詞向量,解決 OOV100–300多語言、形態豐富語言
上下文動態嵌入ELMo, BERT, GPT靜態嵌入+位置編碼經深層網路得到上下文相關表示768–4096通用 NLU、NLG
雙塔編碼器(ID Embedding)YouTube DNN, DLRM, DSSM分別對使用者塔和物品塔編碼,頂部內積或餘弦可融合上下文32–256推薦召回、廣告點選率預估
對比學習多模態對齊CLIP, ALIGN, SigLIP各模態編碼器輸出對比損失對齊,形成統一嵌入空間512–768圖文互搜、零樣本分類
稀疏/多向量表示SPLADE, ColBERT每個文件產生一組帶權詞向量,而非單向量多向量精細文本排序、確保詞級匹配
基於雜湊的嵌入Hash Embedding多個雜湊函式壓縮大詞彙表,降低引數量隨模型訓練可變超大規模 ID 快速部署

當前趨勢集中於:① 大型模型驅動的高質量通用文本嵌入服務(如 OpenAI text-embedding-3、Cohere Embed v3),支援可變維度以平衡成本與精度;② 開源嵌入模型的社群績效競賽(MTEB 排行榜),湧現出 BGE、E5、GTE 等系列;③ 多模態與多語言統一表示的探索,目標是“一個嵌入空間統治一切”;④ 與向量資料庫深度融合,實現毫秒級十億向量檢索。

6. 上游

  • 資料與語料:高質量文本、使用者行為日誌、圖文對是大規模 Embedding 訓練的基石。Common Crawl、大規模書籍、Reddit 對話等公開資料集被廣泛使用;工業推薦系統多使用脫敏後的內部互動日誌。
  • 標註與弱監督訊號:自監督訊號(掩碼詞預測、下一句預測、共現統計)是主流預訓練方式。對比學習需要構造正負樣本對,負取樣策略(批內負取樣、難負樣本挖掘)直接影響嵌入質量。
  • 算力與晶片:訓練數十億引數模型需數百至數千張 GPU/TPU 並配以高頻寬互聯(NVLink、InfiniBand)。HBM 容量是限制超大規模 ID 嵌入的關鍵因素,因此 FP32→FP16/BF16 量化、梯度累積與引數伺服器是標配。
  • 基礎架構與平台:PyTorch 的 nn.Embeddingsparse 梯度支援,TensorFlow 的 ParameterServerStrategy;分散式訓練架構(如 DeepSpeed、Megatron‑LM)將嵌入與主幹網路協同切分。HuggingFace Hub 和 ModelScope 彙集了數萬預訓練嵌入模型,成為事實上的模型分發中心。
  • 向量索引庫:Faiss、ScaNN、hnswlib 等提供高效能 ANN 檢索能力,是 Embedding 應用生態的基礎件。

7. 下游

  • 搜尋與推薦系統:向量召回已成為搜尋、推薦、廣告的核心鏈路之一。使用者與物品的主 Embedding 即時計算相似度,支撐萬億級線上查詢。粗排/精排階段常結合上下文特徵強化學習。
  • 大型模型應用與 RAG:文件塊向量化儲存於向量資料庫中,使用者問題轉換為向量後檢索相關塊,注入 LLM 提示以生成答案。RAG 已成為解決知識截止和幻覺問題的主流架構。
  • 自然語言處理:文本分類、情感分析、語義相似度、命名實體識別等任務均依賴高質量文本嵌入。
  • 計算機視覺與多模態:以影像嵌入(如 ViT)進行影像檢索、重複檢測、影片片段匹配;CLIP 嵌入使零樣本圖文分類和跨模態檢索成為現實。
  • 知識圖譜與實體連結:實體嵌入用於連結預測、推論,以及將知識圖譜注入語言模型。
  • 生物資訊與分子表示:蛋白質序列、分子結構通過嵌入表示後進行功能預測或藥物設計。
  • 異常檢測與風控:行為序列的嵌入可捕捉異常模式,廣泛應用於金融反欺詐等領域。

8. 受益公司

(本節僅描述產業結構和公司定位,不構成任何投資建議或價值判斷)

  • AI 公有雲端與模型廠商:OpenAI 通過 text-embedding-3 系列提供低成本、可變維度的嵌入 API;Google 旗下 Vertex AI Embedding 和 Universal Sentence Encoder 服務於 GCP 生態;亞馬遜 AWS 推出 Titan Embeddings;微軟 Azure AI 整合 OpenAI 與自研嵌入模型。這些公司的 Embedding 服務直接隨大型模型應用的呼叫量增長。
  • 向量資料庫公司:Pinecone(2023 年 4 月完成 1 億美元 B 輪融資,由 a16z 領投,來源:TechCrunch)提供全託管向量資料庫;開源向量資料庫 Milvus 的母公司 Zilliz 獲得多輪融資;Weaviate、Qdrant、Chroma、LanceDB 等也在各自的生態位快速發展。隨著 RAG 模式推廣,向量儲存與檢索基礎設施需求強勁。
  • 推薦系統與廣告平台:Meta、Google、字節跳動、阿里巴巴等網際網路巨頭在內部建置了萬億級 ID Embedding 系統,並沉澱了大量工程實踐經驗。它們既是 Embedding 技術的最大消費者,也是相關技術專利和架構的產出方。
  • 開源社群與 MLOps 工具鏈:HuggingFace 通過 Hub 聚合海量預訓練嵌入模型,形成模型分發的中心節點;LangChain、LlamaIndex 等架構將嵌入與向量資料庫作為標準組件整合,降低了應用門檻。
  • 硬體與算力服務商:NVIDIA GPU、定製 ASIC、高速儲存和網路裝置是嵌入訓練與線上查表的物理底座,隨產業擴大而持續受益。

9. 市場規模

(本節資料均需標註年份、口徑和來源,未獲得權威資料的部分明確標註“公開資料未見”)

  • 向量資料庫市場:根據 Fortune Business Insights 於 2023 年 10 月釋出的報告,2022 年全球向量資料庫市場規模約為 12.1 億美元,預計 2030 年將增長至 88.4 億美元,2023–2030 年間複合年增長率(CAGR)達 28.2%。另一研究機構 MarketsandMarkets 在 2024 年 1 月給出的近似口徑為 2023 年約 15 億美元,2028 年有望達到 55 億美元。兩者均將增長歸因於語義搜尋與生成式 AI 的廣泛部署。
  • Embedding API 呼叫量:公開資料未見第三方對全球 Embedding API 市場規模的獨立統計。行業感知層面,OpenAI 在 2024 年 1 月推出 text-embedding-3 系列後,顯著下調了輸入價格(text-embedding-3-small 每 1000 token 輸入價格 0.00002 美元),推動呼叫量高速增長,但絕對營收數字公司未單獨揭露。
  • 推薦系統嵌入儲存成本:大型推薦平台每日處理萬億級 ID Embedding 更新,儲存與網路頻寬成本可達每年數億美元量級,屬於企業內部開銷,無公開市場報告。
  • 支出結構趨勢:根據 Gartner 對雲端 AI 服務的估算,2024 年全球雲端 AI 開發者服務支出約 75 億美元,其中自然語言 API(含嵌入呼叫)佔比擴大,但具體份額未公開。

注:上述市場資料均來自第三方報告或公司公開定價,數字僅反映當時的預測口徑,實際發展可能偏離。

10. 玩家對比

(基於公開基準測試和官方釋出資訊,截至 2024 年 5 月)

文本嵌入服務/模型對比

廠商/專案代表模型最大維度最大輸入 Token價格(每 1k token 輸入,美元)MTEB 效能概況(來源)特點
OpenAItext-embedding-3-small512(可調)8191$0.00002在檢索和分類任務中接近上一代大型模型效能可變維度,高性價比
OpenAItext-embedding-3-large3072(可調)8191$0.00013MTEB 平均得分領先多數商業模型(來源:OpenAI 官方評測)極高準確度,適合複雜任務
CohereEmbed v31024512免費試用/付費在檢索和聚類任務上表現強勁,多語言支援專注企業搜尋,支援特定壓縮
Google (Vertex AI)textembedding-gecko、text-embedding-preview-0409768、30722048~32768按每 1k 字元計費,約 $0.0001~MTEB 排名中上游,與 GCP 服務深度整合與 BigQuery、Vertex AI 搜尋聯動
開源 BGE 系列(BAAI)bge-large-en-v1.51024512免費MTEB 綜合得分在 2024 年 2 月曾位列開源第一(來源:HuggingFace MTEB Leaderboard)多版本,支援中英文
開源 E5 系列(Microsoft)e5-large-v21024512免費MTEB 平均得分 65+,文本相似度突出需新增字首“query: ”和“passage: ”
阿里雲端text-embedding-v1/v215362048按輸入 Token 計費,公開報價約 0.0005 元/千 token公開資料未見獨立 MTEB 詳細排名,中文語義任務評測領先支援中英雙語
百度Embedding-V11024384按呼叫量階梯計費,價格未完全公開公開資料未見 MTEB 橫向對比資料深度應用於百度搜索與推薦生態

說明:MTEB 指 Massive Text Embedding Benchmark,排行榜持續更新,以上效能描述僅反映特定時間截面的相對位置,實際選擇需根據語言、任務和延遲成本綜合評估。價格資訊均來自各廠商官方定價頁,截至 2024 年 5 月。

11. 風險

  • 技術風險:嵌入向量可能固化訓練資料中的偏見,導致公平性缺失;對抗樣本可微小擾動向量空間,造成檢索或分類錯誤;模型升級後新舊嵌入空間不一致,導致下游應用斷裂。
  • 運維與工程風險:超大規模 ID Embedding 面臨頻繁的增量更新,可能出現引數過期、向量漂移,使得相似度塌陷或查詢召回率衰退。分散式元件間的網路延遲與單點故障影響業務連續性。
  • 供應商鎖定:大量應用深度繫結單一 Embedding 模型或向量資料庫的 API 與特定維度,切換成本高。模型服務價格變動、版本廢止或質量變更均會對下游造成衝擊。
  • 隱私與合規:文本嵌入向量在理論上有被攻擊者復原為原始輸入的風險(屬性推斷攻擊)。在金融、醫療等強監管領域,使用雲端端 Embedding API 可能涉及資料出境或合規風險。
  • 市場與競爭風險:開源嵌入模型效能快速提升,部分已接近商業模型,可能侵蝕收費 API 的市場;向量資料庫賽道擁擠,同質化競爭嚴重,部分初創企業面臨資金鍊壓力。
  • 過度期望:部分非結構化資料(如長尾稀有模式)的嵌入質量仍不理想,RAG 過度依賴 Embedding 可能引入噪聲或遺漏關鍵資訊,需配備完整的評估與防護體系。

12. 誤讀糾偏

  1. “Embedding 維度越高,表示一定越好”
    事實:維度應與資訊量、任務複雜度匹配。過大的維度易導致過擬合、儲存膨脹,並放大噪聲。實際工作中需通過交叉驗證或維度壓縮(如 PCA、量化)確定最優維度。例如,推薦系統中上千億物品的嵌入通常僅用 32–128 維,效果反而優於更大維度。
  2. “Embedding 只是簡單的查表,沒有技術含量”
    事實:工業級 Embedding 包括分散式儲存分片、一致性寫入、高頻淘汰、冷啟動初始化、線上學習與近即時更新等系統工程難題。此外,表示學習中的負取樣策略、困難樣本挖掘、多工聯合訓練同樣是核心技術。
  3. “大型模型出來了,直接用 LLM 生成嵌入,不需要專項嵌入模型”
    事實:LLM 可作為通用文本嵌入生成器,但無法自然表達海量非文本 ID(如裝置指紋、商品 SKU)的協同過濾訊號。雙塔等專用的 ID Embedding 依然是推薦與廣告迴流的基石。兩者更多是互補:LLM 處理語義,ID Embedding 捕獲互動,常通過混合塔或特徵互動融合。
  4. “餘弦相似度大於 0.9 就一定非常相關”
    事實:餘弦相似度的分佈高度依賴於訓練目標、維度、正則化方式和資料型別。部分模型在微調後,相似度整體偏高或偏低,需要依據具體驗證集的閾值校準,而不是武斷使用絕對值。
  5. “任何向量資料庫都能直接替代專用 Embedding 服務”
    事實:向量資料庫解決的是儲存與檢索,而非生成高質量向量的能力。最終效果取決於嵌入模型本身的表示能力。不更換模型只更換資料庫,無法提升語義召回質量。

13. 最新事件

(截至 2024 年 5 月,來源均為公開資訊)

  • 2024‑01‑25:OpenAI 釋出 text-embedding-3-small 和 text-embedding-3-large,支援可變維度(使用者可指定輸出維度,無需重新訓練),大幅降低價格,成為嵌入 API 市場標誌性事件。(來源:OpenAI Blog)
  • 2024‑02–03:多家研究機構更新 MTEB 排行榜,開源模型 BGE-M3 和 E5‑mistral‑7b 在多語言和長文本任務中取得突破,縮小與商業模型的差距。(來源:HuggingFace MTEB Leaderboard)
  • 2024‑03:Cohere 推出 Embed v3 的改進版,支援 multi‑vector 輸出和壓縮,進一步降低檢索成本。(來源:Cohere 官方部落格)
  • 2024‑04:Google 在 Cloud Next ‘24 上宣佈 textembedding-gecko 和 text-embedding-preview-0409(3072 維)的公開預覽,並與 BigQuery 和 Vertex AI Agent Builder 深度整合。(來源:Google Cloud Blog)
  • 2024‑04–05:向量資料庫賽道持續吸金,Weaviate 獲得 5000 萬美元 B 輪追加;國產向量資料庫公司如智聚整合(Zilliz)、矩陣起源等也有新版本或戰略合作釋出。(來源:Press 報道)
  • 2024‑05:阿里雲端“通義”系列 embedding 模型更新至 v2,支援 2k tokens,中英文場景在內部評測中較上一代提升明顯,但未公開 MTEB 橫向對比。(來源:阿里雲端官網公告)

14. 追蹤指標

  • MTEB 排行榜變動:關注文本嵌入在分類、聚類、Pair Classification、重排序、檢索、STS 和摘要 7 大任務的平均得分及排名變化,特別是新模型的釋出與舊模型失效節奏。
  • 嵌入 API 成本與延遲:核心廠商每百萬 token 的價格、最大輸入視窗和平均查詢延遲(P50/P99),例如 OpenAI 和 Cohere 的定期定價變更。
  • 向量資料庫基準:ANN‑benchmarks 記錄的 QPS、召回率@10、索引建置時間、記憶體佔用等,關注 scann、faiss‑ivf‑hnsw 等演算法的效能進展。
  • 開源模型下載量與社群活躍度:HuggingFace 和 ModelScope 上知名嵌入模型的月下載量、Stars,反映開發者採用趨勢。
  • RAG 架構整合度:LangChain、LlamaIndex 等架構預設推薦的嵌入模型組合,可間接反映行業共識。
  • 檢索質量業務指標:對於企業內部,應監控自建搜尋/推薦系統的線上召回率、cover rate、點選率、向量漂移指數和 ANN 索引重新整理頻率。
  • 專利與論文:以“embedding”、“文本向量”、“向量資料庫”為關鍵詞的專利數與頂會論文數,可反映技術密集度。
  • 事件驅動:頭部雲端廠商模型停用(如 OpenAI 曾廢棄 Ada v2 嵌入)、重大安全漏洞或資料洩露事件,會影響產業版面配置。

15. 信源

  1. Mikolov, T. et al. “Efficient Estimation of Word Representations in Vector Space.” arXiv preprint arXiv:1301.3781, 2013.
  2. Pennington, J. et al. “GloVe: Global Vectors for Word Representation.” EMNLP, 2014.
  3. Devlin, J. et al. “BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding.” NAACL, 2019.
  4. Radford, A. et al. “Learning Transferable Visual Models From Natural Language Supervision.” ICML, 2021. (CLIP)
  5. Covington, P. et al. “Deep Neural Networks for YouTube Recommendations.” RecSys, 2016.
  6. Naumov, M. et al. “Deep Learning Recommendation Model for Personalization and Recommendation Systems.” arXiv, 2019. (DLRM)
  7. OpenAI. “New embedding models and API updates.” OpenAI Blog, Jan 25, 2024.
  8. Google Cloud. “Vertex AI Embeddings for Text.” Google Cloud Documentation, 2024.
  9. Cohere. “Cohere Embed v3: The industry’s leading search model.” Cohere Blog, 2023/2024.
  10. HuggingFace MTEB Leaderboard, https://huggingface.co/spaces/mteb/leaderboard, accessed May 2024.
  11. Fortune Business Insights. “Vector Database Market Size, Share & COVID-19 Impact Analysis… 2023-2030.” Report ID: FBI107395, Oct 2023.
  12. MarketsandMarkets. “Vector Database Market – Global Forecast to 2028.” Market Research Report, Jan 2024.
  13. Gartner. “Forecast: Public Cloud Services, Worldwide, 2022-2024.” Gartner Research, 2024.
  14. TechCrunch. “Pinecone raises $100M Series B…”, Apr 27, 2023.
  15. Various press releases and official pricing pages from Alibaba Cloud, Baidu AI Cloud, Zilliz, Weaviate, Qdrant.

(未在正文中引述到的其他公開資料,讀者可根據關鍵詞自行檢索。)

source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型