Embedding
1. 3 秒看懂
Embedding(嵌入)是將符號、ID 等離散物件對映到低維、稠密、連續向量空間的表示技術。它讓機器能夠計算“語義距離”,並作為所有深度學習模型理解原始世界的第一層翻譯。從搜尋、推薦、廣告到生成式AI,Embedding 已滲透至幾乎每一個 AI 系統的入口。
2. 3 分鐘產業解釋
深度學習模型不能直接理解文字、商品編號或影像檔名,必須先將這些符號轉化為數值。最原始的做法是 one‑hot 編碼,但會帶來稀疏、維度爆炸且無法表達相似性的問題。Embedding 層通過學習為每個物件生成一個固定長度的實數向量(例如 128 維),使得語義相近的物件在向量空間中彼此靠近(餘弦相似度高,或點積值大)。
產業中,Embedding 層無處不在:GPT 系列將詞或子詞對映為向量;推薦系統將使用者 ID 和物品 ID 對映為向量後做內積來預估點選率;圖神經網路將節點對映為向量用於分類與連結預測;現代檢索增強生成(RAG)將文件切片轉化為向量,再用向量資料庫做相似性召回。隨著應用深入,Embedding 的訓練早已從靜態查表發展為複雜網路的一部分,甚至出現了專門對外提供 Embedding 服務的 API(Embedding as a Service)。與此同時,向量資料庫(Vectordb)基礎設施因 RAG 和語義搜尋的爆發而快速成長,形成了從上游語料、算力到下游應用的完整產業鏈。
3. 技術原理
深度學習中的 Embedding 本質是一個可訓練的查表對映,數學上等價於一個無啟用函式的全連線層權重矩陣。給定整數索引 i,輸出向量為該矩陣的第 i 行。在訓練過程中,損失函式的梯度通過該行回傳,驅動向量向能減輕任務損失的方向移動,從而逐步獲得語義。
其訓練目標決定了向量的幾何性質。在語言模型中,目標可能是根據上下文預測缺失詞;在推薦系統中,目標可能是區分使用者正、負互動物品。無論目標函式如何,最終每個離散符號都被嵌入到同一個向量流形上,使得下游任務可通過簡單的向量運算(相加、點積、餘弦相似度)來捕捉語義關係。
在現代 Transformer 架構中,靜態的詞嵌入會與位置編碼相加,再經過多頭注意力機制與多層網路互動,最終輸出高度上下文相關的表示。因此,“Embedding”不再只是一個淺層查表,而是與整個模型聯合最佳化的表示學習過程。工業界的大規模推薦模型(如 Meta 的 DLRM、Google 的雙塔模型)中,物品 ID 的 Embedding 引數量可佔模型總引數量的 90% 以上,對分散式儲存與通訊提出極高要求。
4. 關鍵引數
- 詞彙量(Vocabulary Size):需要嵌入的離散符號總數。在 NLP 中通常為 3 萬~32 萬(BPE 詞彙表),在推薦系統中商品/影片 ID 可達數十億量級。
- 嵌入維度(Embedding Dimension):超引數,記為
d。常見取值有 32、64、128、256、768、1024 等,通常選擇 2 的冪以便硬體對齊。較低維度可能欠擬合,過高則增加儲存與過擬合風險。根據 Covington 等人在 YouTube 推薦系統論文(2016)中的實踐,128~256 維是平衡效果與成本的經驗區間;BERT 模型(Devlin et al., 2019)使用 768 維以獲得豐富的語義表示。 - 引數量與儲存:總引數量 = 詞彙量 × 維度 × 每引數位元組數(通常 float32 為 4 位元組)。例如,10 億個物品 ID × 128 維 = 1280 億引數,約 512 GB 視訊記憶體(FP32),遠超出單卡能力。工業界通過雜湊、維度壓縮(SVD)、混合粒度嵌入或引數伺服器分片來應對。
- 相似度度量:常見有餘弦相似度、歐氏距離和內積。內積常用於雙塔模型中進行高效 top‑K 召回,配合近似最近鄰(ANN)索引。
- 訓練方式與更新頻率:靜態 Embedding(如 Word2Vec、GloVe)通常預訓練後固定;動態 Embedding 隨模型線上學習持續更新。增量更新時需監控向量漂移幅度(如最近 7 天同一 ID 向量的餘弦差異中位數),以判斷是否存在分佈偏移。
- OOV(詞表外)處理:使用子詞切分(BPE、WordPiece)或子詞 n‑gram 求和(fastText)為零樣本或罕見詞生成向量,保證覆蓋度。
- 索引與查詢引數:在海量向量中檢索 top‑K 時,ANN 庫(如 Faiss、ScaNN)需設定索引型別(IVF、HNSW)、建置時間、召回率 @K 和查詢延遲(毫秒級)。不同配置直接影響成本與服務質量。
以上為通用技術引數說明,具體數值依任務與模型而異。
5. 技術路線
自 2013 年 Word2Vec 提出以來,Embedding 技術經歷了多輪迭代,形成了多條並存路線:
| 路線 | 代表方法/模型 | 核心思想 | 上下文敏感性 | 典型維度 | 典型應用 |
|---|---|---|---|---|---|
| 靜態詞向量 | Word2Vec, GloVe | 從大規模語料學習固定詞向量,詞與向量一一對應 | 否 | 100–300 | 文本分類、淺層特徵 |
| 子詞增強與快速 Text | fastText | 用字元 n‑gram 向量合成詞向量,解決 OOV | 否 | 100–300 | 多語言、形態豐富語言 |
| 上下文動態嵌入 | ELMo, BERT, GPT | 靜態嵌入+位置編碼經深層網路得到上下文相關表示 | 是 | 768–4096 | 通用 NLU、NLG |
| 雙塔編碼器(ID Embedding) | YouTube DNN, DLRM, DSSM | 分別對使用者塔和物品塔編碼,頂部內積或餘弦 | 可融合上下文 | 32–256 | 推薦召回、廣告點選率預估 |
| 對比學習多模態對齊 | CLIP, ALIGN, SigLIP | 各模態編碼器輸出對比損失對齊,形成統一嵌入空間 | 是 | 512–768 | 圖文互搜、零樣本分類 |
| 稀疏/多向量表示 | SPLADE, ColBERT | 每個文件產生一組帶權詞向量,而非單向量 | 是 | 多向量 | 精細文本排序、確保詞級匹配 |
| 基於雜湊的嵌入 | Hash Embedding | 多個雜湊函式壓縮大詞彙表,降低引數量 | 隨模型訓練 | 可變 | 超大規模 ID 快速部署 |
當前趨勢集中於:① 大型模型驅動的高質量通用文本嵌入服務(如 OpenAI text-embedding-3、Cohere Embed v3),支援可變維度以平衡成本與精度;② 開源嵌入模型的社群績效競賽(MTEB 排行榜),湧現出 BGE、E5、GTE 等系列;③ 多模態與多語言統一表示的探索,目標是“一個嵌入空間統治一切”;④ 與向量資料庫深度融合,實現毫秒級十億向量檢索。
6. 上游
- 資料與語料:高質量文本、使用者行為日誌、圖文對是大規模 Embedding 訓練的基石。Common Crawl、大規模書籍、Reddit 對話等公開資料集被廣泛使用;工業推薦系統多使用脫敏後的內部互動日誌。
- 標註與弱監督訊號:自監督訊號(掩碼詞預測、下一句預測、共現統計)是主流預訓練方式。對比學習需要構造正負樣本對,負取樣策略(批內負取樣、難負樣本挖掘)直接影響嵌入質量。
- 算力與晶片:訓練數十億引數模型需數百至數千張 GPU/TPU 並配以高頻寬互聯(NVLink、InfiniBand)。HBM 容量是限制超大規模 ID 嵌入的關鍵因素,因此 FP32→FP16/BF16 量化、梯度累積與引數伺服器是標配。
- 基礎架構與平台:PyTorch 的
nn.Embedding及sparse梯度支援,TensorFlow 的 ParameterServerStrategy;分散式訓練架構(如 DeepSpeed、Megatron‑LM)將嵌入與主幹網路協同切分。HuggingFace Hub 和 ModelScope 彙集了數萬預訓練嵌入模型,成為事實上的模型分發中心。 - 向量索引庫:Faiss、ScaNN、hnswlib 等提供高效能 ANN 檢索能力,是 Embedding 應用生態的基礎件。
7. 下游
- 搜尋與推薦系統:向量召回已成為搜尋、推薦、廣告的核心鏈路之一。使用者與物品的主 Embedding 即時計算相似度,支撐萬億級線上查詢。粗排/精排階段常結合上下文特徵強化學習。
- 大型模型應用與 RAG:文件塊向量化儲存於向量資料庫中,使用者問題轉換為向量後檢索相關塊,注入 LLM 提示以生成答案。RAG 已成為解決知識截止和幻覺問題的主流架構。
- 自然語言處理:文本分類、情感分析、語義相似度、命名實體識別等任務均依賴高質量文本嵌入。
- 計算機視覺與多模態:以影像嵌入(如 ViT)進行影像檢索、重複檢測、影片片段匹配;CLIP 嵌入使零樣本圖文分類和跨模態檢索成為現實。
- 知識圖譜與實體連結:實體嵌入用於連結預測、推論,以及將知識圖譜注入語言模型。
- 生物資訊與分子表示:蛋白質序列、分子結構通過嵌入表示後進行功能預測或藥物設計。
- 異常檢測與風控:行為序列的嵌入可捕捉異常模式,廣泛應用於金融反欺詐等領域。
8. 受益公司
(本節僅描述產業結構和公司定位,不構成任何投資建議或價值判斷)
- AI 公有雲端與模型廠商:OpenAI 通過 text-embedding-3 系列提供低成本、可變維度的嵌入 API;Google 旗下 Vertex AI Embedding 和 Universal Sentence Encoder 服務於 GCP 生態;亞馬遜 AWS 推出 Titan Embeddings;微軟 Azure AI 整合 OpenAI 與自研嵌入模型。這些公司的 Embedding 服務直接隨大型模型應用的呼叫量增長。
- 向量資料庫公司:Pinecone(2023 年 4 月完成 1 億美元 B 輪融資,由 a16z 領投,來源:TechCrunch)提供全託管向量資料庫;開源向量資料庫 Milvus 的母公司 Zilliz 獲得多輪融資;Weaviate、Qdrant、Chroma、LanceDB 等也在各自的生態位快速發展。隨著 RAG 模式推廣,向量儲存與檢索基礎設施需求強勁。
- 推薦系統與廣告平台:Meta、Google、字節跳動、阿里巴巴等網際網路巨頭在內部建置了萬億級 ID Embedding 系統,並沉澱了大量工程實踐經驗。它們既是 Embedding 技術的最大消費者,也是相關技術專利和架構的產出方。
- 開源社群與 MLOps 工具鏈:HuggingFace 通過 Hub 聚合海量預訓練嵌入模型,形成模型分發的中心節點;LangChain、LlamaIndex 等架構將嵌入與向量資料庫作為標準組件整合,降低了應用門檻。
- 硬體與算力服務商:NVIDIA GPU、定製 ASIC、高速儲存和網路裝置是嵌入訓練與線上查表的物理底座,隨產業擴大而持續受益。
9. 市場規模
(本節資料均需標註年份、口徑和來源,未獲得權威資料的部分明確標註“公開資料未見”)
- 向量資料庫市場:根據 Fortune Business Insights 於 2023 年 10 月釋出的報告,2022 年全球向量資料庫市場規模約為 12.1 億美元,預計 2030 年將增長至 88.4 億美元,2023–2030 年間複合年增長率(CAGR)達 28.2%。另一研究機構 MarketsandMarkets 在 2024 年 1 月給出的近似口徑為 2023 年約 15 億美元,2028 年有望達到 55 億美元。兩者均將增長歸因於語義搜尋與生成式 AI 的廣泛部署。
- Embedding API 呼叫量:公開資料未見第三方對全球 Embedding API 市場規模的獨立統計。行業感知層面,OpenAI 在 2024 年 1 月推出 text-embedding-3 系列後,顯著下調了輸入價格(text-embedding-3-small 每 1000 token 輸入價格 0.00002 美元),推動呼叫量高速增長,但絕對營收數字公司未單獨揭露。
- 推薦系統嵌入儲存成本:大型推薦平台每日處理萬億級 ID Embedding 更新,儲存與網路頻寬成本可達每年數億美元量級,屬於企業內部開銷,無公開市場報告。
- 支出結構趨勢:根據 Gartner 對雲端 AI 服務的估算,2024 年全球雲端 AI 開發者服務支出約 75 億美元,其中自然語言 API(含嵌入呼叫)佔比擴大,但具體份額未公開。
注:上述市場資料均來自第三方報告或公司公開定價,數字僅反映當時的預測口徑,實際發展可能偏離。
10. 玩家對比
(基於公開基準測試和官方釋出資訊,截至 2024 年 5 月)
文本嵌入服務/模型對比
| 廠商/專案 | 代表模型 | 最大維度 | 最大輸入 Token | 價格(每 1k token 輸入,美元) | MTEB 效能概況(來源) | 特點 |
|---|---|---|---|---|---|---|
| OpenAI | text-embedding-3-small | 512(可調) | 8191 | $0.00002 | 在檢索和分類任務中接近上一代大型模型效能 | 可變維度,高性價比 |
| OpenAI | text-embedding-3-large | 3072(可調) | 8191 | $0.00013 | MTEB 平均得分領先多數商業模型(來源:OpenAI 官方評測) | 極高準確度,適合複雜任務 |
| Cohere | Embed v3 | 1024 | 512 | 免費試用/付費 | 在檢索和聚類任務上表現強勁,多語言支援 | 專注企業搜尋,支援特定壓縮 |
| Google (Vertex AI) | textembedding-gecko、text-embedding-preview-0409 | 768、3072 | 2048~32768 | 按每 1k 字元計費,約 $0.0001~ | MTEB 排名中上游,與 GCP 服務深度整合 | 與 BigQuery、Vertex AI 搜尋聯動 |
| 開源 BGE 系列(BAAI) | bge-large-en-v1.5 | 1024 | 512 | 免費 | MTEB 綜合得分在 2024 年 2 月曾位列開源第一(來源:HuggingFace MTEB Leaderboard) | 多版本,支援中英文 |
| 開源 E5 系列(Microsoft) | e5-large-v2 | 1024 | 512 | 免費 | MTEB 平均得分 65+,文本相似度突出 | 需新增字首“query: ”和“passage: ” |
| 阿里雲端 | text-embedding-v1/v2 | 1536 | 2048 | 按輸入 Token 計費,公開報價約 0.0005 元/千 token | 公開資料未見獨立 MTEB 詳細排名,中文語義任務評測領先 | 支援中英雙語 |
| 百度 | Embedding-V1 | 1024 | 384 | 按呼叫量階梯計費,價格未完全公開 | 公開資料未見 MTEB 橫向對比資料 | 深度應用於百度搜索與推薦生態 |
說明:MTEB 指 Massive Text Embedding Benchmark,排行榜持續更新,以上效能描述僅反映特定時間截面的相對位置,實際選擇需根據語言、任務和延遲成本綜合評估。價格資訊均來自各廠商官方定價頁,截至 2024 年 5 月。
11. 風險
- 技術風險:嵌入向量可能固化訓練資料中的偏見,導致公平性缺失;對抗樣本可微小擾動向量空間,造成檢索或分類錯誤;模型升級後新舊嵌入空間不一致,導致下游應用斷裂。
- 運維與工程風險:超大規模 ID Embedding 面臨頻繁的增量更新,可能出現引數過期、向量漂移,使得相似度塌陷或查詢召回率衰退。分散式元件間的網路延遲與單點故障影響業務連續性。
- 供應商鎖定:大量應用深度繫結單一 Embedding 模型或向量資料庫的 API 與特定維度,切換成本高。模型服務價格變動、版本廢止或質量變更均會對下游造成衝擊。
- 隱私與合規:文本嵌入向量在理論上有被攻擊者復原為原始輸入的風險(屬性推斷攻擊)。在金融、醫療等強監管領域,使用雲端端 Embedding API 可能涉及資料出境或合規風險。
- 市場與競爭風險:開源嵌入模型效能快速提升,部分已接近商業模型,可能侵蝕收費 API 的市場;向量資料庫賽道擁擠,同質化競爭嚴重,部分初創企業面臨資金鍊壓力。
- 過度期望:部分非結構化資料(如長尾稀有模式)的嵌入質量仍不理想,RAG 過度依賴 Embedding 可能引入噪聲或遺漏關鍵資訊,需配備完整的評估與防護體系。
12. 誤讀糾偏
- “Embedding 維度越高,表示一定越好”
事實:維度應與資訊量、任務複雜度匹配。過大的維度易導致過擬合、儲存膨脹,並放大噪聲。實際工作中需通過交叉驗證或維度壓縮(如 PCA、量化)確定最優維度。例如,推薦系統中上千億物品的嵌入通常僅用 32–128 維,效果反而優於更大維度。 - “Embedding 只是簡單的查表,沒有技術含量”
事實:工業級 Embedding 包括分散式儲存分片、一致性寫入、高頻淘汰、冷啟動初始化、線上學習與近即時更新等系統工程難題。此外,表示學習中的負取樣策略、困難樣本挖掘、多工聯合訓練同樣是核心技術。 - “大型模型出來了,直接用 LLM 生成嵌入,不需要專項嵌入模型”
事實:LLM 可作為通用文本嵌入生成器,但無法自然表達海量非文本 ID(如裝置指紋、商品 SKU)的協同過濾訊號。雙塔等專用的 ID Embedding 依然是推薦與廣告迴流的基石。兩者更多是互補:LLM 處理語義,ID Embedding 捕獲互動,常通過混合塔或特徵互動融合。 - “餘弦相似度大於 0.9 就一定非常相關”
事實:餘弦相似度的分佈高度依賴於訓練目標、維度、正則化方式和資料型別。部分模型在微調後,相似度整體偏高或偏低,需要依據具體驗證集的閾值校準,而不是武斷使用絕對值。 - “任何向量資料庫都能直接替代專用 Embedding 服務”
事實:向量資料庫解決的是儲存與檢索,而非生成高質量向量的能力。最終效果取決於嵌入模型本身的表示能力。不更換模型只更換資料庫,無法提升語義召回質量。
13. 最新事件
(截至 2024 年 5 月,來源均為公開資訊)
- 2024‑01‑25:OpenAI 釋出 text-embedding-3-small 和 text-embedding-3-large,支援可變維度(使用者可指定輸出維度,無需重新訓練),大幅降低價格,成為嵌入 API 市場標誌性事件。(來源:OpenAI Blog)
- 2024‑02–03:多家研究機構更新 MTEB 排行榜,開源模型 BGE-M3 和 E5‑mistral‑7b 在多語言和長文本任務中取得突破,縮小與商業模型的差距。(來源:HuggingFace MTEB Leaderboard)
- 2024‑03:Cohere 推出 Embed v3 的改進版,支援 multi‑vector 輸出和壓縮,進一步降低檢索成本。(來源:Cohere 官方部落格)
- 2024‑04:Google 在 Cloud Next ‘24 上宣佈 textembedding-gecko 和 text-embedding-preview-0409(3072 維)的公開預覽,並與 BigQuery 和 Vertex AI Agent Builder 深度整合。(來源:Google Cloud Blog)
- 2024‑04–05:向量資料庫賽道持續吸金,Weaviate 獲得 5000 萬美元 B 輪追加;國產向量資料庫公司如智聚整合(Zilliz)、矩陣起源等也有新版本或戰略合作釋出。(來源:Press 報道)
- 2024‑05:阿里雲端“通義”系列 embedding 模型更新至 v2,支援 2k tokens,中英文場景在內部評測中較上一代提升明顯,但未公開 MTEB 橫向對比。(來源:阿里雲端官網公告)
14. 追蹤指標
- MTEB 排行榜變動:關注文本嵌入在分類、聚類、Pair Classification、重排序、檢索、STS 和摘要 7 大任務的平均得分及排名變化,特別是新模型的釋出與舊模型失效節奏。
- 嵌入 API 成本與延遲:核心廠商每百萬 token 的價格、最大輸入視窗和平均查詢延遲(P50/P99),例如 OpenAI 和 Cohere 的定期定價變更。
- 向量資料庫基準:ANN‑benchmarks 記錄的 QPS、召回率@10、索引建置時間、記憶體佔用等,關注 scann、faiss‑ivf‑hnsw 等演算法的效能進展。
- 開源模型下載量與社群活躍度:HuggingFace 和 ModelScope 上知名嵌入模型的月下載量、Stars,反映開發者採用趨勢。
- RAG 架構整合度:LangChain、LlamaIndex 等架構預設推薦的嵌入模型組合,可間接反映行業共識。
- 檢索質量業務指標:對於企業內部,應監控自建搜尋/推薦系統的線上召回率、cover rate、點選率、向量漂移指數和 ANN 索引重新整理頻率。
- 專利與論文:以“embedding”、“文本向量”、“向量資料庫”為關鍵詞的專利數與頂會論文數,可反映技術密集度。
- 事件驅動:頭部雲端廠商模型停用(如 OpenAI 曾廢棄 Ada v2 嵌入)、重大安全漏洞或資料洩露事件,會影響產業版面配置。
15. 信源
- Mikolov, T. et al. “Efficient Estimation of Word Representations in Vector Space.” arXiv preprint arXiv:1301.3781, 2013.
- Pennington, J. et al. “GloVe: Global Vectors for Word Representation.” EMNLP, 2014.
- Devlin, J. et al. “BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding.” NAACL, 2019.
- Radford, A. et al. “Learning Transferable Visual Models From Natural Language Supervision.” ICML, 2021. (CLIP)
- Covington, P. et al. “Deep Neural Networks for YouTube Recommendations.” RecSys, 2016.
- Naumov, M. et al. “Deep Learning Recommendation Model for Personalization and Recommendation Systems.” arXiv, 2019. (DLRM)
- OpenAI. “New embedding models and API updates.” OpenAI Blog, Jan 25, 2024.
- Google Cloud. “Vertex AI Embeddings for Text.” Google Cloud Documentation, 2024.
- Cohere. “Cohere Embed v3: The industry’s leading search model.” Cohere Blog, 2023/2024.
- HuggingFace MTEB Leaderboard, https://huggingface.co/spaces/mteb/leaderboard, accessed May 2024.
- Fortune Business Insights. “Vector Database Market Size, Share & COVID-19 Impact Analysis… 2023-2030.” Report ID: FBI107395, Oct 2023.
- MarketsandMarkets. “Vector Database Market – Global Forecast to 2028.” Market Research Report, Jan 2024.
- Gartner. “Forecast: Public Cloud Services, Worldwide, 2022-2024.” Gartner Research, 2024.
- TechCrunch. “Pinecone raises $100M Series B…”, Apr 27, 2023.
- Various press releases and official pricing pages from Alibaba Cloud, Baidu AI Cloud, Zilliz, Weaviate, Qdrant.
(未在正文中引述到的其他公開資料,讀者可根據關鍵詞自行檢索。)