模型層 開放閱讀

混合檢索

Hybrid Search

概念 ID
hybrid-search
更新時間
2026-05-29
來源數量
待補

3 秒看懂

混合檢索(Hybrid Search)是一種將關鍵詞匹配(稀疏檢索,如 BM25/倒排索引)與語義匹配(稠密向量檢索,如 embedding + 向量相似度)結合起來的搜尋範式,通過融合排序補足單一方法的短板:詞彙匹配精確但缺乏語義泛化,語義匹配能理解意圖但在專有名詞、低頻術語上易漏。它不是兩個分數簡單相加,而是一套“稀疏‑稠密協同+結果融合”的檢索引擎設計模式,廣泛用於 RAG、企業搜尋、電商、法律文書等場景。


3 分鐘產業解釋

  • 為什麼需要混合 關鍵詞檢索(稀疏檢索)把使用者 query 和文件都拆成詞,用倒排索引做 TF‑IDF/BM25 等統計匹配,對於精確名稱、程式碼、編號天然準確,但處理同義詞、句式變化、模糊意圖時效果很差。 向量檢索(稠密檢索)把文本對映到高維語義空間,靠餘弦相似度/內積召回語義相近內容,但對專有名詞、低頻組合、數值範圍天生不敏感,容易出現語義漂移。 現實搜尋場景往往是“語義相近且包含關鍵實體”——比如“治療高血脂的一線藥物”需要理解“一線藥物”語義,同時準確命中“阿托伐他汀”等實體名。只用一種方法必有一端失配。
  • 融合方式分離召回+融合排序:分別從 BM25 索引和向量索引各取 Top‑K,再通過倒數排名融合(RRF)、線性加權、學習型排序(如 Lambdamart)等合併。 ②單一索引同時支援:部分引擎(如 Elasticsearch 8+, Milvus 2.4+)兼具稀疏向量欄位和稠密向量欄位,查詢時在同一請求中打分融合。 ③多階段:粗排用融合分數,精排用大型模型或交叉編碼器(Cross‑encoder)重打分。
  • 典型產品形態 開源:Elasticsearch (lexical + dense vector + RRF), Milvus (Hybrid Search with BM25 embedding), Weaviate (hybrid ranking)。商業:Pinecone, Cohere, Zilliz Cloud。RAG 架構 LangChain/LlamaIndex 均內建混合檢索介面。

15 分鐘專家深入

混合檢索表面上只是兩種檢索結果的線性組合,但深入工程與演算法設計,會發現它涉及多模態索引架構分數歸一化查詢意圖自適應權重稀疏‑稠密聯合訓練等一連串課題。

  • 稀疏檢索的實現基礎 基於倒排索引的 BM25 是當前工業界事實標準,其打分函式涉及詞頻(TF)、逆文件頻率(IDF)、文件長度歸一化。BM25 可視為一種基於詞袋的機率檢索模型,優點是零樣本、可解釋、對精確詞匹配魯棒,缺點是完全不考慮詞序和上下文。

  • 稠密檢索的實現基礎 典型 pipeline:利用雙塔模型(如 BERT‑base 的 bi‑encoder)對 query 和文件分別編碼,得到固定維度的密集向量,再通過近似最近鄰(ANN)索引(如 HNSW、IVF‑PQ)快速檢索 Top‑K。雙塔模型通常用對比損失(如 InfoNCE)訓練,讓相關 pair 向量距離近,不相關 pair 距離遠。 更精細的做法是 ColBERT 式的遲互動:將 query 和文件編碼為多向量,後期用 MaxSim 算分,在佔用與單向量接近的儲存下保留部分詞級互動。

  • 融合演算法

    • RRF(倒數排名融合): score(d) = Σ 1/(k + rank_i(d)),k 常取 60。優點是不依賴原始分數的尺度,無需歸一化,魯棒性極強。
    • 線性加權:需要縮放兩種分數到同一量級。常用技巧是以校準集擬合權重,或通過sigmoid處理分數。若權重固定,無法適應查詢變化。
    • 學習型融合:以稀疏分數、向量分數、query 特徵等作為輸入特徵,訓一個小的梯度提升樹(如 LightGBM)輸出最終排名。可捕捉非線性關係,但需要標註資料。
  • 關鍵引數空間

    引數含義典型範圍
    alpha稀疏/稠密權重比0.1~0.9,不同場景調優
    sparse_top_kBM25 召回數100~2000
    dense_top_k向量召回數100~2000
    fusion_kRRF 中的 k 常數10~120,常用 60
    final_top_k返回給使用者的文件數10~100
  • 自適應權重 最簡單的自適應是根據 query 的稀疏/稠密特性決定權重。例如:若 query 中實體名詞多且向量相似度方差低(說明文件向量分佈平坦),則提升稀疏權重;若 query 是長句、描述性強,則提稠密權重。更先進的方法是用小型分類模型線上預測最佳 α。

  • 多模態混合 在包含了影像、表格的多模態檢索中,混合檢索可擴充套件為“文本關鍵詞+文本語義+影像語義”等,融合機制類似,只是向量來自不同編碼器,需做跨模態對齊。


技術原理

整體架構

Query

  ├──> 分析器(分詞/實體識別)
  │      ├──> BM25/倒排索引 (稀疏檢索) ──> 稀疏候選集 [score_sparse]
  │      └──> 嵌入編碼器 (e.g. BGE, E5) ──> 向量索引 (ANN) ──> 密集候選集 [score_dense]

  └──> 融合模組 (RRF / 線性組合 / 學習型)
          └──> 重排序 (Cross-encoder / LLM) ──> 最終結果

稀疏檢索:BM25 打分機制

對於文件 D 與查詢 Q (詞項集合):

BM25(D,Q) = Σ_{t∈Q} IDF(t)·( f(t,D)·(k1+1) ) / ( f(t,D) + k1·(1-b+b·|D|/avgdl) )
  • f(t,D): 詞 t 在 D 中的詞頻
  • IDF(t): 逆文件頻率,平滑版常為 log((N - n(t) + 0.5)/(n(t) + 0.5) + 1)
  • k1(1.2~2.0), b(0.75) 為調節引數

稠密檢索:雙塔與 ANN

  • 雙塔模型 E_q(query), E_d(doc) 輸出歸一化向量,相似度通常用餘弦相似度或點積。
  • ANN 索引:HNSW(分層可導航小世界圖)建置多層近鄰圖,查詢複雜度近似 O(log N); IVF‑PQ 對向量聚類並用乘積量化壓縮,記憶體佔用和速度平衡。
  • 訓練損失:InfoNCE L = -log( exp(s(q,d+)/τ) / ( exp(s(q,d+)/τ) + Σ_{d-} exp(s(q,d-)/τ) ) ) 其中 τ 為溫度係數。

融合:RFF 公式

RFF_score(d) = Σ_{i∈{sparse,dense}} 1/(k+rank_i(d))
  • 若文件在某個列表中未出現,rank 設為無窮大,貢獻為 0。
  • k 越大,排名差異越被平滑;60 是經驗值,可微調。

完整查詢示例(pseudo)

b25_results = bm25_index.search(query, top_k=200)
dense_results = vector_index.search(embed(query), top_k=200)

# RRF 融合
scores = {}
for rank, doc in enumerate(b25_results):
    scores[doc.id] = scores.get(doc.id, 0) + 1/(60+rank+1)
for rank, doc in enumerate(dense_results):
    scores[doc.id] = scores.get(doc.id, 0) + 1/(60+rank+1)

final = sorted(scores.items(), key=lambda x: x[1], reverse=True)[:20]

技術演進史

  • 2000年前: 純關鍵詞檢索主導(布林模型、向量空間模型、機率模型 BM25 等)。
  • 2013‑2018: 詞嵌入(word2vec, GloVe)興起,出現基於詞向量平均的淺層語義匹配,但不能端到端最佳化檢索。
  • 2019‑2020: 預訓練語言模型(BERT)出現,單塔(Cross‑encoder)重排序大幅提升精度,但推斷慢;雙塔(如 DPR)實現高效向量檢索,在開放域問答大放異彩。此時學界開始探討“sparse‑dense hybrid”。
  • 2021‑2022: 工業搜尋引擎引入向量能力。Elasticsearch 7.x 初步支援 dense vector; Weaviate、Milvus、Pinecone 等向量資料庫開始原生支援混合檢索(稀疏向量+稠密向量)。混合檢索成為 RAG 流水線的標準模組。
  • 2023‑2024: RRF 成為一種流行的無參融合方式,被 Elasticsearch、LlamaIndex、LangChain 內建。ColBERT v2、SPLADE 等學習型稀疏擴充套件了“稀疏”的邊界(從關鍵詞到學到的稀疏向量)。混合檢索進入精細化權重自適應與多模態融合階段。

技術路線對比

維度純關鍵詞(BM25)純向量/語義混合檢索(經典)學習型稀疏(SPLADE等)多向量遲互動(ColBERT)
核心機制倒排索引 TF‑IDF/BM25雙塔+ANN 向量索引BM25+向量+融合(RRF/加權)學到的稀疏權重,仍可用倒排query/doc 多向量,MaxSim 算分
索引儲存小(倒排表)中等(向量+結構)兩部分均需儲存,空間開銷大大(但可壓縮)更大(多向量儲存與索引)
查詢速度極快快(ANN)快(兩路並行)快(類似倒排)中(多向量運算略重)
精度(通用)低(無語義)中(實體詞易漏)高,互補高,兼具語義與詞級匹配很高,保留細粒度互動
專有名詞/編號通過稀疏路補償,高較高(結合了稀疏顯式匹配)較高(有詞級訊號)
訓練需求需標註或自監督可無(無參融合),也可帶參學習需訓練稀疏編碼器需訓練多向量表徵
可解釋性高(關鍵詞命中)可通過稀疏路提供解釋中(可看詞重要性)中(詞級互動)
代表實現Lucene BM25Faiss, Milvus(向量)Elasticsearch 8+, Milvus 2.4+, WeaviateSPLADE v2ColBERT v2

上下游

  • 上游
    • 基礎演算法/預訓練模型: 稠密編碼器(BGE、E5、GTE)、稀疏學習模型(SPLADE)、重排序模型(Cross‑encoder, LLM)。
    • 索引引擎與向量資料庫: Lucene、Faiss、HNSWlib、Milvus、Weaviate、Elasticsearch。
    • 硬體: GPU/NPU 用於嵌入計算和模型訓練, CPU/記憶體/SSD 用於索引儲存和檢索。
  • 中游: 搜尋/問答系統整合商,如 RAG 架構(LangChain, LlamaIndex)、企業搜尋平台(Algolia, Coveo, 中國如百度企業搜尋、達觀資料)。
  • 下游: 最終應用場景——企業知識庫、電商搜尋、客戶支援 chatbot、醫療文獻檢索、金融合規文件審查、法律案例檢索等。

關鍵指標

  • 檢索質量
    • NDCG@K(歸一化折損累計增益):衡量排序質量。
    • Recall@K:前 K 個結果中相關文件佔比。
    • MRR(平均倒數排名):第一個相關文件出現位置的倒數平均。
  • 效率
    • P95 查詢延遲:通常要求 < 200ms(含兩路召回和融合)。
    • 索引吞吐:文件/秒入庫速度。
    • 儲存開銷:原始文件 + 倒排索引 + 向量索引的大小。混合儲存通常為純向量索引的 1.2‑1.8 倍,因需額外儲存稀疏後設資料。
  • 權重魯棒性: 混合權重 α 變化 ±0.2 時 NDCG 降幅 < 3% 視為穩定。

供需與市場資料

由於缺乏即時聯網檢索資料(搜尋受阻),以下為行業趨勢定性描述,具體數字未充分揭露,不編造精確值。

  • 需求端: 以 RAG 為核心的生成式 AI 應用在 2023‑2024 年快速增長,推動了對高效能混合檢索的需求。企業搜尋市場進一步從“關鍵詞”轉向“語義增強”,混合檢索幾乎成為中大型知識庫系統的標配。
  • 供給端: 開源向量資料庫(Milvus, Weaviate, Qdrant)以及傳統的 Elasticsearch 紛紛融入混合檢索能力,降低了使用門檻。商業化託管服務如 Zilliz Cloud、Pinecone、Elastic Cloud 提供混合檢索的一鍵部署。
  • 競爭態勢: 純關鍵詞搜尋引擎(如 Solr)被迫向量化,純向量資料庫為了對抗關鍵資訊漏檢而加入 BM25。未來,學習型稀疏表示可能模糊稀疏與稠密的界線,形成“全神經排序”新範式,但混合架構仍會在過渡期長期存在。

代表公司與資本對映

  • 開源/商業資料庫類
    • Elastic (Elasticsearch): 老牌搜尋公司,市值數十億美元,自 8.0 起深度整合向量和 RRF。
    • Zilliz (Milvus): 中國背景的開源向量資料庫,已獲 B 輪融資,2023 年推出混合搜尋。
    • Weaviate: 歐洲開源向量資料庫,內建 hybrid 搜尋,獲 Index Ventures 等投資。
    • Pinecone: 美國向量資料庫 SaaS 獨角獸,2023 年估值約 7.5 億美元(據公開報道),原生支援混合檢索。
  • 架構/平台類
    • LangChain / LlamaIndex: 開發者架構,抽象了混合檢索介面,不直接提供資料庫。
    • Cohere, OpenAI: 通過 Embedding API 提供稠密向量,間接成為混合檢索的上游。
  • 中國本土
    • 達觀資料、拓爾思: 提供智慧搜尋與知識管理,融入語義檢索能力。
    • Proxima/Faiss 引擎(阿里、百度內部): 支撐自家搜尋。

(以上公司融資與估值基於歷史公開資訊,當前精確資料未能在本次檢索更新,請以最新公告為準。)


產業對映

  1. RAG 基礎設施的“鏟子”生意 混合檢索是 RAG 系統的核心召回部件,未來任何需要“高質量知識注入”的 AI 應用都依賴它。向量資料庫和搜尋平台因此受益。
  2. 從“能搜”到“搜得準”的轉變 企業搜尋的高價值場景(法律、醫療、金融)對準確率要求極高,單一方法無法滿足,混合檢索成為唯一可行選擇,助推相關廠商 ARPU 增長。
  3. 成本優勢 較之於完全使用 LLM 處理全量文件(成本高、速度慢),混合檢索在追求價效比的行業落地中勝出。那些能將混合檢索與 LLM 重排序、快取等深度整合的公司擁有護城河。
  4. 開源生態 vs. 商業化 開源產品(如 Milvus, Weaviate, Elasticsearch 基礎版)大幅降低使用成本,但企業級特性(安全、管理、穩定權重調優、技術支撐)是付費點。“開源的商業化雲端服務”模式是觀察廠商營收質量和客戶留存的一個分析維度。
  5. 潛在風險
    • 純基於大型語言模型的長上下文視窗(如 Gemini 1.5 Pro 200萬 token)可能減少對檢索精度的依賴,但不會完全取代,因上下文成本和幻覺控制仍需高質量召回。
    • 學習型稀疏可能讓混合檢索架構被“全向量”方法取代,逐步擠壓傳統混合的市場份額,需觀察技術迭代。

常見誤讀糾偏

  • 誤讀 1:“混合檢索就是向量檢索裡面的一個 filter” 事實上,在很多系統中稠密向量檢索可以加過濾(如 metadata),但這不是混合檢索。混合檢索核心在於同時利用稀疏詞義和稠密語義進行相關性排序,而非簡單的屬性過濾。
  • 誤讀 2:“混合檢索總能提升效果” 不一定。若查詢本身對關鍵詞高度敏感(如輸入“R12‑345 申請表”),語義路可能引入噪聲;若查詢完全是抽象概念(“關於可持續發展的報告”),關鍵詞路貢獻很小。需要根據評測集調整權重,否則可能比單路差。
  • 誤讀 3:“RRF 必須用 k=60” 60 是經驗值,源自《Reciprocal Rank Fusion outperforms Condorcet and individual rank learning methods》論文,在不同資料集和召回深度下需微調。k 越小,高排名文件的話語權越大;k 越大多樣性更高。

學習路徑

  1. 基礎概念
    • 閱讀資訊檢索導論(Manning 等)中關於倒排索引、BM25 的章節。
    • 理解詞向量與 Transformer 雙塔原理,推薦 DPR 論文 (Karpukhin et al.)。
  2. 動手實踐
    • 用 Elasticsearch 8+ 搭建圖文混合搜尋,體驗 knn query + query (BM25) + RRF。
    • 用 Milvus 2.4 的 Hybrid Search 示例,建置一箇中文 RAG 系統,對比純向量與混合的效果。
  3. 演算法細節
    • 精讀 RRF 原文,嘗試在公開資料集(如 MS MARCO)上實現自定義權重搜尋。
    • 探索 ColBERT、SPLADE 等稀疏‑稠密聯合模型,理解其訓練方式和索引工程。
  4. 系統設計
    • 研究大型搜尋引擎(如 Bing、Google)的架構論文,瞭解多階段排名如何在混合檢索中應用。
    • 實踐多路召回融合加 Cross‑encoder 重排的全鏈路,最佳化延遲與精度。

一句話總結

混合檢索不是兩種分數的簡單混搭,而是把最具人類可解釋性的關鍵詞匹配最富語義理解力的向量搜尋在架構層和解碼層深度融合,為 AI 驅動的資訊獲取提供既精準又泛化的召回底座。


延伸閱讀與來源

  • 基礎論文
    • Trotman et al. “Improvements to BM25 and Language Models Examined”. (BM25 最新變種)
    • Karpukhin et al. “Dense Passage Retrieval for Open-Domain Question Answering” (DPR)
    • Cormack et al. “Reciprocal Rank Fusion outperforms Condorcet and individual rank learning methods” (RRF)
  • 工程實現
  • 前沿探索
    • Formal et al. “SPLADE: Sparse Lexical and Expansion Model for First Stage Ranking” (學習型稀疏)
    • Santhanam et al. “ColBERTv2: Effective and Efficient Retrieval via Lightweight Late Interaction” (多向量)
  • 行業分析 由於本文基於先驗知識無最新檢索資料,建議關注 Gartner 關於“Insight Engine”或 DB‑Engines 向量資料庫趨勢報告,以及各廠商最新發布。具體財報資料請查閱官方。

以上內容基於截至2025年3月的公開技術知識與行業共識,由於即時搜尋不可用,未包含最新市場份額或具體財務數字,相關表述採用定性推測或註明需進一步查證。

source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型