模型層 開放閱讀

語義搜尋

Semantic Search

概念 ID
semantic-search
更新時間
2026-05-29
來源數量
待補

語義搜尋

3秒看懂

語義搜尋不再拘泥於關鍵詞的字面匹配,而是通過深度學習理解查詢背後的意圖和內容的深層含義,將文本轉化為高維語義向量,在向量空間中“懂你”地檢索出概念關聯的結果。

3分鐘產業解釋

傳統搜尋引擎依賴倒排索引和TF-IDF等詞頻統計,對於同義詞、上下文、抽象概念(如“便宜的跑車”很難用關鍵詞表達)表現乏力。語義搜尋通過預訓練語言模型(如BERT、Sentence-BERT)將任意長度的文本壓縮成固定維度的稠密向量(dense vector),使得“Apple手機”“iPhone”在向量空間中距離很近。查詢時,系統將查詢向量與被檢索文件向量進行最近鄰搜尋(ANN),返回語義相似度最高的結果。這一技術已在電商搜尋、企業知識庫、法律文書檢索、AI對話的知識召回(RAG)等場景落地。其核心瓶頸是向量化模型的表達能力、索引效率與即時更新成本。近年來,隨著大語言模型(LLM)和向量資料庫(如Pinecone, Milvus, Weaviate, Qdrant等)的成熟,語義搜尋正從單一的向量匹配走向混合搜尋(向量+關鍵詞+結構化過濾)與多模態搜尋,成為生成式AI應用的標準召回元件。

15分鐘專家深入

語義搜尋的完整技術棧可分為:文本預處理 → 向量化編碼(Embedding) → 向量索引建置(ANN index) → 線上檢索與重排序。向量化編碼是核心,主流方法包括:

  • 基於預訓練BERT的句子向量:取[CLS] token或對最後一層做均值/最大池化得到句子向量。早期BERT直接產生的向量語義表示能力不足,Sentence-BERT利用孿生網路和對比損失(如cosine similarity + softmax)微調,使得向量空間具有語義聚集性。
  • 對比學習範式:SimCSE通過dropout構造正例,無需標註資料;或使用自然語言推論(NLI)資料集進行精細訓練。近期,基於解碼器架構的大型模型(如GPT、LLaMA)通過提示工程或專門的表示模型(如E5, BGE, GTE, Cohere Embed)生成高質量向量,支援中英文及跨語言。
  • 多向量與遲互動(ColBERT):拋棄單個向量壓縮,保留每個token的向量,在檢索時使用MaxSim操作計算細粒度匹配,平衡了效率與精度,避免了單向量資訊損失。

向量索引方面,由於精確KNN計算代價太高,實際採用近似最近鄰(ANN)演算法,如HNSW(分層可導航小世界圖)、IVF(倒排多維度索引)+PQ(乘積量化)等,在召回率>95%條件下實現毫秒級檢索。向量資料庫將這些演算法工程化,提供CRUD、過濾、分片、混合檢索能力。

實際系統通常採用多路召回:語義向量召回 + 關鍵詞召回(BM25) + 結構化過濾,然後由精排模型(如交叉編碼器)對候選集重新打分。精排可以使用更重的互動模型(query-document聯合編碼),犧牲部分效能換取準確性。

生成式搜尋(RAG):語義搜尋作為檢索基礎,檢索到的相關文件片段餵給LLM,生成帶有上下文的答案,顯著降低幻覺風險,但也會引入檢索噪音和延遲開銷。評估搜尋質量的主要指標是召回率、MRR、NDCG,以及端到端的答案忠實度與相關性。

技術原理

向量化本質:將Token id的高維稀疏空間,通過多層Transformer對映到d維連續向量空間(如768、1024維),使得語義上相近的文本有較小的餘弦距離或歐氏距離。

訓練目標:常見對比損失 InfoNCE $$ \mathcal{L} = -\log \frac{\exp(\text{sim}(q, d^+)/\tau)}{\sum_{d \in {d^+, d^-}} \exp(\text{sim}(q, d)/\tau)} $$ 其中q為查詢向量,d+正例文件,d-負例(in-batch negatives或硬負例),τ為溫度係數。訓練批次大小與負例質量顯著影響表示質量,通常需大batch(數千)和困難負例挖掘。

ANN演算法示例(HNSW)

層級圖
頂層稀疏,近似“高速公路”,底層稠密用於精細搜尋
插入時隨機賦予層級,自頂向下貪心搜尋最近鄰然後連邊
檢索時從頂層入口點出發,逐層下降至底層,最終在底層執行區域性beam search

HNSW的查詢複雜度約為O(log N),建置後索引無須訓練,支援增量更新(適度)。

混合搜尋架構

客戶端查詢
├── 向量化 → ANN向量檢索(Top K1)
├── 分析器 → 關鍵詞檢索(BM25 Top K2)
├── 結構化過濾(如時間、標籤)

└── 融合(RRF: Reciprocal Rank Fusion) → 合併候選集
    └── 重排序模型(Cross-encoder) → 最終Top K返回

端到端RAG流程

使用者問題 → Query改寫/擴充套件 → 混合召回 → 粗排 → 精排(可選) → 上下文片段 → LLM生成答案

涉及延遲約束:檢索<100ms,生成<3s是良好體驗基線。

技術演進史

  • 1990s以前:基於結構化檢索、目錄導航(Yahoo)。
  • 1998-2010:關鍵詞搜尋引擎(Google PageRank + TF-IDF + 倒排索引),引入詞幹提取、同義詞擴充套件,仍為字面匹配。
  • 2013:word2vec/GloVe 詞向量,可捕捉詞語語義關係,但文件級別需平均池化等,效果有限。
  • 2018:ELMo、BERT出世,上下文感知的token向量,為語義表示帶來突破。直接使用[CLS]作為句子向量效果一般,需微調。
  • 2019:Sentence-BERT (Reimers & Gurevych) 提出使用孿生網路微調BERT得到高質量句子嵌入,大大加速語義搜尋的實用化。
  • 2020:Facebook DPR (Dense Passage Retrieval) 用於開放域問答,拉動了向量檢索在IR社群的熱度;向量資料庫Pinecone、Weaviate等興起;ColBERT提出遲互動。
  • 2021:SimCSE簡單高效無監督句子嵌入;多模態模型CLIP實現圖文語義對齊,推動多模態搜尋。
  • 2022-2023:基於大型語言模型的嵌入模型如text-embedding-ada-002、E5、BGE系列、Cohere Embed,利用大型模型知識蒸餾或微調,效能大幅提升;向量資料庫成為PaaS標準組件;RAG模式引爆企業知識庫、客服、AI搜尋。
  • 2024至今:多語言、多向量、長上下文嵌入模型最佳化;混合搜尋在向量資料庫中深度融合;語義搜尋與對話式AI、Agent結合,實現從搜尋到行動的閉環。

技術路線對比(量化表)

路線查詢理解文件表示匹配方式精度召回延遲可解釋性更新成本
純關鍵詞 (BM25)詞頻統計稀疏向量(BoW)倒排索引精確匹配極低極低
詞向量平均 (fastText)詞向量平均池化近似餘弦
單向量雙塔 (SBERT, DPR)預訓練LM單稠密向量ANN/HNSW高(重embed)
多向量遲互動 (ColBERT)每token向量每token向量MaxSim + 近似搜尋極高極高
混合搜尋 (向量+BM25)多訊號混合ANN+倒排+RRF極高極高中低
重排後混合 (CrossEncoder)聯合編碼聯合編碼交叉注意力打分最高最高(有限候選)高(線上)
生成式搜尋 (RAG)LLM改寫文本片段向量+關鍵詞+LLM高(綜合)低(黑盒)

注:精度/召回/延遲為相對定性比較,具體數值取決於模型、索引引數和硬體,此處不標註具體數字。[評分基於行業公開基準綜合估計]

上下游

上游

  • 基礎模型:提供預訓練語言模型和嵌入模型(如OpenAI, Cohere, Hugging Face上的BGE, E5等開源模型),以及多模態模型(CLIP、ImageBind)。
  • 向量資料庫/搜尋基礎設施:專用向量資料庫(Milvus, Qdrant, Weaviate, Pinecone)、在已有資料庫上加向量擴充套件(PostgreSQL + pgvector, Elasticsearch + 向量外掛, Redis)或自研ANN庫(FAISS, ScaNN, hnswlib)。
  • 硬體:GPU/TPU用於模型推論與訓練,SSD/記憶體用於索引儲存,高速網路支援分散式檢索。
  • 資料標註服務:為微調嵌入模型提供查詢-文件對,以及精排模型的訓練資料。

中游

  • 搜尋平台:將上述元件整合為端到端的語義搜尋服務,提供API、視覺化配置(Algolia NeuralSearch, Elasticsearch Learning to Rank, 自研中臺)。
  • RAG架構:如LangChain, LlamaIndex, Haystack,封裝檢索和生成流程。
  • 企業搜尋解決方案:面向法律、電商、醫療等垂直領域的定製化語義搜尋產品。

下游

  • 企業知識管理:內部知識庫、文件問答。
  • 電商與內容推薦:商品搜尋“暖冬外套”與“加厚羽絨服”語義關聯。
  • 客服與AI助手:幫助機器人找到相關FAQ、政策文件。
  • 法律/金融/醫療文件審查:快速定位相關條款、病例。
  • 學術搜尋:語義查詢相關論文。

關鍵指標

  • 向量維度:常用768、1024、4096維,更高維度通常表示能力更強但儲存和計算開銷更大。
  • 索引建置時間查詢延遲(P99)
  • 召回率@K(Recall@K):在返回的Top-K結果中,相關文件被命中的比例。
  • MRR (Mean Reciprocal Rank):第一個相關文件排名的倒數平均值,反映首位命中能力。
  • NDCG@K:考慮相關度等級和位置,衡量排序質量。
  • 吞吐量 (QPS):受限於硬體、索引型別和併發。
  • 向量編碼吞吐:每秒可生成的向量數,影響資料注入速度。
  • 更新支援:是否支援即時增刪改,或需重建索引。

供需與市場資料

根據多家市場研究機構的定性描述,全球語義搜尋市場正處於高速增長期,主要驅動力來自企業數字化轉型、非結構化資料爆炸和生成式AI的普及。北美仍佔主導份額,亞太地區增速最快。由於本次檢索受限,無法引述具體規模數字,但據行業公開資訊,到2026年,語義搜尋和向量資料庫相關市場有望達到數十億美元級別。開源向量資料庫的流行(Milvus在GitHub start數超30k)和商業公司融資活躍(如Pinecone估值在2023年達7億美元,Weaviate融資合計超6千萬美元)反映了資本市場熱情。RAG模式使語義搜尋成為LLM生態的關鍵基礎設施。

代表公司與資本對映

  • 向量資料庫領域:Pinecone(向量搜尋即服務)、Weaviate、Qdrant、Milvus/Zilliz、Chroma。其中Pinecone已獲多輪融資;Zilliz(Milvus開發者)也獲得過億美元融資。
  • 嵌入式模型與服務:OpenAI (text-embedding-ada-002/3)、Cohere (Embed)、智源 (BGE)、Jina AI,Hugging Face開源生態。國內如網易伏羲、百度(ERNIE embedding)也有版面配置。
  • 搜尋平台:Elastic(Elasticsearch內嵌向量搜尋+語義搜尋)、Algolia(電商語義搜尋)、微軟Bing(使用大型模型語義理解)、Google(多工統一模型MUM)。
  • RAG架構與解決方案:LangChain, LlamaIndex,以及基於它們建置的創業公司(Contextual AI, Vectara)。
  • 大廠版面配置:AWS Kendra、Azure Cognitive Search、Google Vertex AI Search 等雲端原生的智慧搜尋服務。

資本對映:投資邏輯圍繞“資料飛輪”和“平台鎖定”。向量資料庫和嵌入模型是粘性較強的中間層,一旦企業將大量文件向量化並基於此建置應用,遷移成本高。一級市場追捧相關初創。二級市場方面,傳統搜尋巨頭Elastic、MongoDB(提供vector search)等通過融入語義搜尋增強產品競爭力,提升ARPU。

投資邏輯

  1. 基礎設施受益確定性:無論上層應用誰勝出,向量資料和檢索量會持續增長,向量資料庫和嵌入API作為算力、儲存之上的必須元件,具備確定的增長空間。關注具備高可用、多雲端、混合搜尋能力的向量資料庫公司。
  2. 與AI應用深度繫結:投資那些能將語義搜尋與生成式AI深度結合、提供端到端解決方案的廠商,它們往往能收取更高的價值分成(如基於檢索成功計費或SaaS訂閱)。
  3. 垂直行業壁壘:在高度管制行業(律所、醫療)的語義搜尋需要資料安全、領域微調、合規性,這建置了護城河,投資具有行業Know-how和私有資料訓練能力的服務商會獲得超額回報。
  4. 開源與商業化平衡:注意Milvus/Qdrant等開源專案的商業化路線,它們採用雲端服務和企業版方式,類似MongoDB,可能重演開源資料庫的資本成功故事。
  5. 規避純技術同質化風險:單純的向量搜尋API競爭激烈,嵌入模型差異逐漸縮小,差異化在於生態(整合度)、效能、成本和混合搜尋能力。
  6. 硬體與加速:高維向量檢索對記憶體和計算需求大,關注GPU向量檢索加速(如NVIDIA RAFT, CAGRA)等硬體關聯技術,可能會顛覆現有軟體實現。

常見誤讀糾偏

1. “語義搜尋就是同義詞替換”
誤讀:一些人誤以為語義搜尋只是關鍵詞+詞林擴充套件。實際上,它通過深層神經網路捕捉語境和抽象意圖,例如“2022年世界盃決賽”和“阿根廷點球擊敗法國”,關鍵詞無重疊,但語義高度相關,這是基於大規模預訓練獲得的語言知識,而非簡單同義詞典。

2. “向量搜尋就是語義搜尋,用向量資料庫足夠了”
實際工業級語義搜尋幾乎都採用混合搜尋。純粹向量召回容易忽略精確術語匹配(如產品型號“EA-218”),且可能受長尾查詢或模糊實體的困擾。系統還要處理時效性、個性化、點選反饋等訊號,向量只是其中一路。重排序、規則干預均是成熟語義搜尋系統的必選項。

3. “嵌入模型越大語義搜尋效果越好”
模型大小與表示質量並非線性關係。專為檢索微調的小模型(如110M引數的單語模型)在某些域上可能優於通用大型模型生成的向量。且推論延遲和成本是實際部署的關鍵考量,需要權衡。

4. “語義搜尋可以替代關鍵詞搜尋”
不可替代,而是補充與增強。對搜尋意圖明確的精確匹配(如訂單號、身份證號),關鍵詞搜尋更為高效可靠。語義搜尋在處理意圖模糊、自然語言問題時凸顯優勢。

學習路徑

入門

  • 閱讀相關深度學習教材,理解詞嵌入與語言模型。
  • 親手搭建一個小型搜尋:使用Sentence-Transformers庫生成向量,FAISS索引,並實現查詢。
  • 執行SBERT官方示例,感受句子相似度計算。

進階

  • 學習並復現DPR、ColBERT,理解兩階段檢索。
  • 研究對比學習在表示學習中的應用,trace SimCSE、OpenAI embedding論文。
  • 部署一個向量資料庫(如Milvus Lite),匯入維基百科切片,建置問答原型。

深入

  • 掌握ANN索引原理,閱讀HNSW、IVF-PQ原始論文,調優引數對召回/延遲影響。
  • 混合搜尋架構實踐:Elasticsearch + dense_vector + BM25 並實現RRF融合。
  • 端到端RAG管線建置:LangChain/LlamaIndex + 向量資料庫 + LLM,處理檢索噪音,加入重排序和查詢改寫。
  • 評估體系:使用BEIR、MTEB等基準測試不同嵌入模型和檢索策略。

研究前沿

  • 多模態語義搜尋(CLIP, ImageBind),將視覺/音訊語義統一。
  • 基於大型模型直接生成搜尋結果的替代方案(AIGS:Answer-Integrated Generative Search),可能重新定義“搜尋”。
  • 檢索增強的持續學習,使嵌入隨著領域資料流式更新而不遺忘。

一句話總結

語義搜尋是讓機器理解“意思”而非“字面”的檢索技術,它通過深度學習將資訊對映到語義向量空間,結合近似最近鄰索引實現高效匹配,已成為現代搜尋、推薦和生成式AI應用不可缺失的基石。

延伸閱讀與來源

  • 論文
    • Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks (Reimers & Gurevych, 2019)
    • Dense Passage Retrieval for Open-Domain Question Answering (Karpukhin et al., 2020)
    • ColBERT: Efficient and Effective Passage Search via Contextualized Late Interaction
source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型