概念庫 開放閱讀

多跳檢索(Multi-Hop Retrieval)

概念庫 · 開放閱讀

概念 ID
multi-hop-retrieval
更新時間
2026-06-03
來源數量
1

多跳檢索(Multi-Hop Retrieval)

1. 3秒看懂

多跳檢索是一種讓AI分多步查資料、逐步推論的複合檢索技術。傳統檢索增強生成(RAG)是“問一句、查一次、答一次”,而多跳檢索是“問一句、查多次、中間推論、最後彙總”。它解決的問題是:當一個問題的答案分散在多個文件、多個知識片段中,單次檢索拿不到完整答案時,系統能夠像偵探破案一樣,根據第一條線索去查詢第二條線索,再綜合判斷。這項技術是AI從“問答機器人”邁向“推論助理”的關鍵技術階梯。

2. 3分鐘產業解釋

通俗理解

想像你問一個傳統AI助手:“2023年獲得圖靈獎的科學家,他的博士導師曾獲得過什麼重要獎項?”傳統RAG會一次性檢索這個問題,大機率找不到直接答案,因為沒有任何一個段落會同時包含這三個資訊點。

多跳檢索的做法是:

  • 第一跳:檢索“2023年圖靈獎得主是誰”,得到答案“Avi Wigderson”。
  • 第二跳:檢索“Avi Wigderson的博士導師是誰”,得到答案“Richard Lipton”。
  • 第三跳:檢索“Richard Lipton獲得過什麼重要獎項”,得到答案“哥德爾獎、高德納獎等”。
  • 最後把三段資訊縫合成一個完整回答。

產業定位

多跳檢索是檢索增強生成(RAG)技術譜系中的高階形態。RAG技術本身是2023年大語言模型(LLM)產業化最重要的配套技術之一,解決的是“大型模型不知道自己不知道什麼”的幻覺問題——給它一個外部知識庫,讓它查了再說。但傳統RAG的“單跳”模式有一個天然短板:它假設答案就完整地存在於某一個文件片段的附近,而對於需要跨文件、跨段落進行邏輯拼接的複雜查詢,它無法勝任。

多跳檢索填補的正是這個缺口。產業界在2023年下半年開始密集關注這一方向,因為企業級場景——尤其是金融分析、法律盡調、藥物研發、供應鏈溯源——恰恰充滿了此類需要多步推論的問題。一個典型的金融場景:投研分析師提問“找出過去五年在新能源電池隔膜領域,累計研發投入超過10億且專利數量增長超過200%的A股公司”,這個問題需要先檢索“新能源電池隔膜領域A股公司名單”,再逐家檢索“研發投入資料”,同時檢索“專利數量變化”,最後交叉比對篩選。

這就是多跳檢索的產業價值:它讓AI能夠處理需要資訊拼接、邏輯串聯、交叉驗證的複雜認知任務,而不僅僅是回答“合同第3條第2款寫了什麼”這類單點查詢。從產業視角看,它是企業知識庫從“文件問答工具”升級為“知識推論系統”的核心技術橋接。

與Agent的關係辨析 多跳檢索常與“AI Agent(智慧代理)”的概念被混淆。兩者的區別在於:多跳檢索側重預定義或模型自主規劃的檢索鏈路,目標是在給定的知識庫範圍內完成資訊收集與推論;而Agent通常涉及更廣泛的操作,包括呼叫外部API、操作軟體、執行多輪對話決策等。一個簡化的理解是:多跳檢索是Agent的“大腦檢索迴路”,是Agent完成複雜任務時內部的知識處理子系統。

3. 技術原理

多跳檢索的技術本質是將複雜查詢分解為有序的、依賴上下文的多輪檢索-推論迴圈。其技術架構可以拆解為以下核心環節:

3.1 查詢分解與規劃

使用者的複雜問題首先進入一個查詢規劃器(Query Planner),其職責是將原始問題分解為檢索計劃。當前主流方法有三類:

  • 靜態分解(Static Decomposition):在檢索開始前,由大語言模型一次性將問題拆解為順序或並行的子問題鏈。例如使用Chain-of-Thought(思維鏈)提示詞技術,讓模型輸出“step1: 檢索X,step2: 基於X的結果檢索Y”。
  • 動態迭代分解(Iterative Decomposition):每一步檢索完成後,將已有資訊作為上下文,由模型動態生成下一步的子查詢。這種方法更靈活,能根據中間結果調整檢索方向,但計算成本更高。
  • 圖結構規劃(Graph-based Planning):將查詢分解為有向無環圖(DAG),允許多個檢索分支並行執行後再匯聚。適用於“A和B的對比”這類需要同時收集多方資訊的問題。

3.2 檢索執行引擎

每一跳的檢索通常依賴一個或多個檢索後端,常見組合包括:

  • 稠密向量檢索:使用嵌入模型(Embedding Model)將查詢和文件轉換為高維向量,通過餘弦相似度等度量進行近似最近鄰搜尋(ANN)。適用於語義匹配,但對精確關鍵詞匹配不敏感。
  • 稀疏向量/BM25檢索:基於詞頻-逆文件頻率的傳統資訊檢索方法,對專有名詞、編號、日期等精確匹配效果好。通常作為稠密檢索的補充。
  • 知識圖譜查詢:對結構化知識直接執行SPARQL或Cypher查詢,用於實體關係跳轉,如“A公司的參股子公司中,哪家持有B專利”。
  • 混合檢索(Hybrid Search):融合稠密向量、稀疏向量、結構化查詢的結果,經由重排序模型(Reranker)統一打分排序,得出綜合相關性最高的Top-K結果。

3.3 中間推論與上下文管理

這是多跳檢索區別於單跳檢索的核心環節。在每一跳檢索獲得結果後,系統面臨一個關鍵問題:哪些資訊應該保留並傳遞給下一跳?

常見的中間推論策略包括:

  • 查詢改寫(Query Rewriting):將上一跳檢索結果中的關鍵實體、關係抽取出來,構造新的查詢語句。
  • 上下文化(Contextualization):將檢索結果摘要後注入系統提示詞,作為下一跳查詢生成的背景知識。
  • 證據驗證鏈(Verification Chain):在多跳完成後,增加一個反向驗證步驟——用最終答案反查能否在各跳的源文件中找到支撐,若不匹配則觸發重試或降級回答(如回答“根據已有資料無法確認”)。

3.4 資訊合成與歸因

最終,系統將多輪檢索積累的文件片段進行去重、排序、融合。這一步驟的核心挑戰是衝突消解——當不同來源的資訊相互矛盾時,系統需要(或應向用戶明示)呈現分歧,而非強行縫合出一個看似統一的答案。

歸因(Attribution)機制是多跳檢索可驗證性的基礎。高質量的實現會做到片段級歸因:最終回答的每一個主張(Claim),都對應到具體源文件的具體段落,並標註該段落來自第幾跳檢索。

3.5 錯誤傳播的控制機制

多跳檢索的“阿喀琉斯之踵”是錯誤傳播(Error Propagation):如果第一跳檢索的召回率低或相關性差,錯誤會沿著鏈路放大。產業界的應對措施包括:

  • 多路召回:每一跳同時執行多種檢索策略,降低單點失敗機率。
  • 置信度評分:對中間跳的檢索結果進行置信度評估,低於閾值時觸發重新查詢或請求使用者澄清。
  • 人工斷點:在關鍵垂直場景中,允許在特定跳插入人工稽核節點。

4. 關鍵引數

多跳檢索系統的效能和成本由以下關鍵引數決定。以下引數閾值為2024年產業界常見實踐範圍,具體值因業務場景差異顯著。

4.1 跳數與深度

  • 典型跳數範圍:2-5跳。低於2跳退化為單跳RAG,高於5跳的收益遞減明顯且錯誤機率急劇上升。根據LangChain社群2024年中釋出的使用者調研資料,約68%的多跳檢索應用配置在2-3跳之間。
  • 最大跳數:部分實驗性系統支援到10跳,但主要見於學術基準測試,而非生產環境。

4.2 檢索精度指標

  • Top-K:每跳檢索返回的文件片段數,通常設定在3-20之間。K值越大,召回率越高,但後續處理的上下文視窗壓力越大、推論成本越高。
  • 召回率@K(Recall@K):在K個返回結果中包含正確答案的機率,是多跳檢索的核心觀察指標。單跳Recall@10通常在85%-95%區間,但經5跳鏈式檢索後,累積召回率可能大幅衰減——這是多跳系統最大的技術風險點之一。
  • 平均倒數排名(MRR):衡量第一個相關文件在返回列表中的位置。多跳場景中MRR通常低於單跳場景。

4.3 成本與延遲引數

  • LLM呼叫次數:一次N跳檢索,LLM呼叫次數通常是N+1(N次子查詢生成+1次最終合成)到2N(加上中間推論步驟)。這意味著3跳檢索的一個查詢可能呼叫大型模型4-6次。
  • 端到端延遲:企業場景中,2-3跳的多跳檢索端到端延遲通常在3-15秒之間,顯著高於單跳RAG的1-3秒。即時對話場景需引入流式輸出或預計算以降低使用者感知延遲。
  • Token消耗:多跳檢索的總Token消耗約為單跳RAG的3-8倍,因為每次中間推論都需要將歷史上下文重新輸入模型。

4.4 準確率

  • 多跳問答基準(HotpotQA、MuSiQue等):2024年中,頂級模型的F1分數在60%-75%區間(結合檢索與閱讀),而單跳場景通常在80%以上。該差距是產業界投入最佳化的主戰場。
  • 源資料:上述基準測試資料來自HotpotQA官方排行榜及公開論文(資料截止至2024年Q2)。

5. 技術路線

多跳檢索並非只有一種實現方式。根據檢索鏈的生成機制、推論方式、底層檢索引擎的不同,當前形成了四條主要技術路線:

5.1 基於提示詞編排的鏈式RAG(Prompt-Chaining RAG)

這是目前落地門檻最低、應用最廣的路線。以LangChain、LlamaIndex為代表的開源架構提供了“鏈”的抽象,開發者通過編寫“提示詞模板+檢索步驟”的編排邏輯來定義多跳流程。大語言模型在每一步被呼叫,用於生成子查詢或進行中間推論。

  • 優勢:開發靈活、可解釋性強、易於除錯、適配現有知識庫。
  • 劣勢:高度依賴提示詞工程的質量,鏈式邏輯一旦固化便缺乏對意外查詢的自適應能力。
  • 代表性技術:LangChain的RetrievalQA Chain、LlamaIndex的SubQuestionQueryEngine。

5.2 基於智慧代理的動態檢索(Agentic Retrieval)

系統不預設固定的檢索步驟序列,而是由大語言模型作為“智慧代理”(Agent),在每一跳自主決策“下一步應該檢索什麼”或“是否已有足夠資訊回答”。這本質上是ReAct(Reasoning + Acting)模式在檢索領域的應用。

  • 優勢:對開放式、探索性問題的適應性強,能處理使用者提問時未預見的檢索路徑。
  • 劣勢:延遲高、成本高、行為可控性差(模型可能走入無意義的檢索迴圈)。
  • 代表性技術:基於OpenAI Assistants API或LangGraph建置的檢索Agent。

5.3 基於知識圖譜的多跳推論(Graph-based Multi-Hop)

如果企業的知識已組織為知識圖譜,多跳檢索可以等價為圖譜上的路徑查詢和子圖匹配問題。

  • 優勢:精確性極高,不依賴語義近似匹配,能保證查全和查準(在Schema規範的範圍內)。
  • 劣勢:知識圖譜的建置和維護成本高,對非結構化文本的覆蓋天然有缺口,靈活性不及向量檢索。
  • 代表性技術:結合大語言模型生成圖譜查詢語句(Text-to-Cypher/SPARQL),再將查詢結果作為上下文進行閱讀理解的混合方案。

5.4 端到端的檢索-推論聯合訓練(End-to-end Multi-Hop Models)

這是四條路線中最前沿、但距離大規模產業落地最遠的一條。通過專門設計訓練資料(包含多跳推論的“證據鏈”標註),預訓練或微調基礎模型,使其直接在引數內部隱式地完成“檢索+推論”過程,無需外掛顯式的多步檢索系統。

  • 優勢:一旦訓練成功,推論速度極快,不依賴外部檢索基礎設施。
  • 劣勢:訓練成本極高,知識更新需要重新訓練,可解釋性幾乎為零,“幻覺”來源更難追溯。
  • 代表性研究:Google的RETRO、Meta的Atlas等檢索增強語言模型的進階研究。

技術路線對比(2024年中視角)

維度提示詞鏈式RAGAgentic檢索圖譜多跳端到端聯合訓練
產業成熟度高(已在量產)中(頭部企業試點)中(特定行業深度應用)低(學術研究為主)
成本訓練高/推論低
可控性極低
適合場景結構化分析任務探索性、開放性查詢實體關係密集的查詢暫未規模推廣

6. 上游

多跳檢索的技術棧由多項基礎能力支撐,構成其上游供應鏈:

6.1 基礎大語言模型(LLM)

多跳檢索高度依賴LLM的底層能力:問題分解的合理性、中間推論的準確性、資訊摘要的質量、歸因格式的遵循度。2024年主流選項包括:

  • 閉源模型:OpenAI GPT-4o/4-Turbo、Anthropic Claude 3.5 Sonnet、Google Gemini 1.5 Pro。優勢是泛化推論能力強的,劣勢是單價高、資料出境有合規顧慮。
  • 開源模型:Meta Llama 3.1(405B/70B)、阿里雲端Qwen 2.5系列、Mistral Large 2等。開源模型在RAG場景的推論任務上與閉源模型的差距正在縮小,且支援私有化部署。
  • 市場格局:據IDC 2024年Q2的調研,中國RAG相關場景中的LLM採購,約55%來自國內廠商(以百度文心、阿里通義千問為主),約30%使用開源模型部署,約15%採用海外閉源模型(主要為GPT-4系列)。

6.2 嵌入模型(Embedding Model)

將文本轉化為向量的模型,直接影響檢索召回的語義匹配質量。

  • 通用嵌入模型:OpenAI text-embedding-3-large、Cohere Embed v3。
  • 中文最佳化嵌入模型:BGE系列(智源研究院開源)、GTE系列(阿里巴巴)、Jina Embeddings v2。
  • 關鍵趨勢:多語言能力、長文本支援(8192 token以上)、以及適配特定行業的微調嵌入模型需求增長顯著。

6.3 向量資料庫與檢索引擎

面向多跳檢索場景,向量資料庫的核心要求不僅是高併發、低延遲的近似最近鄰(ANN)檢索能力,還包括:

  • 混合檢索能力:同時支援稠密向量檢索+BM25稀疏檢索+標量過濾(後設資料條件篩選)。
  • Milvus(開源,Zilliz維護):中國市場滲透率最高的向量資料庫,支援十億級向量規模、混合檢索。
  • Pinecone Serverless:海外使用量最大的託管向量資料庫,免運維但資料需出境。
  • Elasticsearch/OpenSearch:以全文檢索為基礎,擴充套件了向量檢索能力,適合已有ES技術棧的企業。
  • 雲端廠商託管方案:阿里雲端DashVector、騰訊雲端VectorDB、華為雲端GES。
  • 市場份額資料:據DB-Engines 2024年7月的向量資料庫類別排名及公開融資資料估算,全球範圍內Milvus/Zilliz和Pinecone兩家合計佔開源+雲端託管向量資料庫市場約40%-50%的活躍部署量;中國市場以Milvus和阿里雲端DashVector為主。此為估算口徑,無權威第三方審計資料。

6.4 資料預處理與解析工具

多跳檢索對文件解析的質量要求高於單跳RAG,因為錯誤的前端解析(如表格拆散、段落切錯)會在多跳鏈中被放大。

  • 文件解析:Unstructured.io(開源/商業)、LlamaParse。處理PDF、PPT、掃描件的表格識別和結構化提取。
  • 分塊策略:多跳檢索通常需要更靈活的分塊方法——過大的塊導致召回精度下降,過小的塊可能割裂上下文。層級分塊(Hierarchical Chunking)、語義分塊(Semantic Chunking)是常見最佳化方向。

6.5 知識圖譜建置與儲存

對於採用圖譜多跳路線的團隊,上游包括:

  • 圖資料庫:Neo4j(海外商業)、NebulaGraph(中國開源)、HugeGraph。
  • 實體識別與關係抽取工具:部分由大語言模型完成,部分依賴專用NLP工具鏈。

7. 下游

多跳檢索的下游是各行業的具體應用場景。以下按場景成熟度和需求強度分層描述:

7.1 金融分析與投研

這是當前多跳檢索落地意願最強的場景之一。典型用例包括:

  • 供應鏈穿透查詢:“找出所有為AppleVision Pro供應光學模組的A股上市公司,以及它們2023年對該客戶的營收佔比。”
  • 事件關聯分析:“2024年上半年釋出減碼公告的醫藥生物行業公司中,哪些公司在公告前一個月內有高管辭職?”
  • 財務異常檢測:“找出連續三年經營性現金流量為負但淨利為正的上市公司,並檢索其應收賬款計提政策。”

落地狀態:國內頭部券商(如中金公司、中信證券)2024年均在內部投研系統中引入了高階RAG和FAQ功能,多跳檢索通常是作為其“智慧搜尋Plus”模組嵌入。具體的多跳檢索深度使用情況,公開資料未見詳細揭露。據Gartner 2024年Q1《金融服務AI創新雷達》報告估算,全球約15%-20%的資產管理和投行機構已在AI投研工具中測試多步推論檢索功能。

7.2 藥物研發與科研文獻

科研查詢天然需要多跳推論:“A靶點在B疾病中的作用機制,以及已進入臨床II期的針對該靶點的小分子藥物,請按IC50排序。”

  • 落地場景:文獻綜述的自動化輔助、化合物-靶點-疾病的關聯發現、專利規避分析。
  • 落地現狀:多家跨國藥企(公開資訊可見諾華、輝瑞2023-2024年的合作新聞)已採購基於大語言模型和企業檢索的研發知識平台。國內藥明康德、恆瑞醫藥等公司公開演講中提及使用AI輔助文獻分析,但是否包含多跳檢索深度能力,公開資料未見具體說明。

7.3 法律與合規

  • 判例關聯分析:“找到與本案案情相似且判決日期在《民法典》生效後的二審維持原判案例,提取其爭議焦點與賠償金額。”
  • 多法域合規審查:“某資料產品同時受中國《個人資訊保護法》和歐盟GDPR管轄,檢索兩份法規中關於跨境資料傳輸的具體條款並進行對比。”

落地現狀:法律場景對準確率和可追溯性要求極高,多跳檢索帶來的錯誤風險使其實施相對謹慎。公開資料可見律商聯訊(LexisNexis)、威科先行等法律資訊服務商在其AI產品中探索了查詢分解能力,但“多跳檢索”作為獨立功能宣傳較少。

7.4 企業知識管理與內部助手

這是多跳檢索最廣泛的應用層落點。企業內部的OA、CRM、ERP、Wiki、工單系統等資料孤島的打通,支撐員工通過自然語言進行跨系統複雜查詢。

落地現狀:據Forrester 2024年Q2《企業AI助手市場報告》資料,全球已部署AI企業助手的組織中,約35%-40%的功能請求涉及跨多個數據源的複合查詢,但目前實際實現的多為“多次單跳檢索後在前端並列展示”,而非真正的鏈式多跳推論。這意味著該領域的客戶需求與產品能力之間仍存在顯著缺口。

7.5 其他新興場景

  • 保險核保核賠:多跳檢索用於關聯被保人的多源醫療記錄、事故報告和政策條款來判斷賠付責任。
  • IC設計/半導體工藝溯源:跨專利庫、學術論文庫、產品手冊進行工藝路徑依賴分析。

8. 受益公司

以下分析基於2023-2024年公開的財務報告、產品釋出及行業報告,按在多跳檢索價值鏈中的位置分類。所有市佔率資料若無專門標註“多跳檢索”口徑,則為相關大品類的資料。

8.1 大型模型與雲端平台廠商

這類公司受益於多跳檢索驅動的計算資源消耗(Token呼叫、向量檢索QU)以及其PaaS層售賣。

  • 微軟:通過Azure AI Search + Copilot Studio,將多跳能力嵌入M365和Azure生態。FY2024Q4財報顯示Azure AI服務營收年增率增長超30%(口徑為Azure AI整體,包含認知搜尋、機器學習和智慧助手),位列最大受益方之一。
  • 阿里雲端:通義千問+百鍊平台+DashVector向量資料庫+今年推出的智慧代理編排能力,形成閉環。2024財年阿里雲端AI相關產品營收增速超三位數(來自阿里雲端2024財年財報及2024年5月投資者交流會表述,具體絕對值及多跳檢索貢獻比例未拆解)。
  • 百度:文心智慧代理平台+百度智慧雲端的向量檢索能力。2024年Q2財報顯示,百度智慧雲端AI相關營收佔比持續提升,文心大型模型日均呼叫量超3.2億次(2024年5月公開資料),但未拆分出RAG/多跳檢索佔比。
  • Google雲端:Vertex AI Search提供多模態、多輪檢索能力。2024年Q2 Alphabet財報電話會中揭露,Vertex AI的活躍客戶數季增率增長超70%。

8.2 開源架構與工具鏈廠商

  • LangChain(LangChain Inc.):多跳檢索編排架構的事實標準之一。2024年推出商業產品LangSmith(除錯與可觀測性)及LangGraph(狀態化多步應用)。其技術被大量企業產品整合。營收資料為私有公司資訊,公開資料未揭露。
  • LlamaIndex:以資料連線和索引設計見長的架構,其SubQuestionQueryEngine是多跳檢索的輕量實現方向。2023-2024年獲得多輪融資,但營收和估值細節公開資料未見精確數字。
  • Zilliz(Milvus母公司):作為全球最主流的開源向量資料庫之一(DB-Engines向量資料庫分類排名前三),從單跳到多跳,所有的RAG系統幾乎都需要向量資料庫,構成了多跳檢索基礎設施層的直接受益方。

8.3 企業服務與垂直應用廠商

  • Cohere(加拿大):專注於企業級RAG平台,Command R/R+系列模型對RAG任務做了專項最佳化,包括多步工具呼叫和檢索。2024年獲得新一輪融資,估值超50億美元(據Bloomberg 2024年7月報道),但多跳檢索專業產品營收未單列。
  • Palantir:AIP(Artificial Intelligence Platform)將多跳推論嵌入其本體(Ontology)驅動的企業資料分析平台中。2024年Q2財報顯示美國商業營收年增率增長55%,AI平台需求為核心驅動力。
  • 中國AI應用平台廠商:明略科技、竹間智慧、第四範式(2024年港股上市,股票程式碼6682.HK)、智譜AI等中國AI廠商在2023-2024年均釋出了企業知識庫或智慧代理產品,包含高階檢索和推論功能。以第四範式為例,其2024年中報顯示“式說”等生成式AI業務營收年增率增長超90%(具體多跳功能貢獻不明)。
  • 金山辦公:WPS AI在2024年持續迭代,嵌入了基於企業文件庫的智慧問答能力。其2024年Q2業績報告顯示AI相關功能使用者滲透率持續增長。

8.4 法律與金融資訊服務商

  • 湯森路透:在Westlaw Precision等法律研究工具中引入AI輔助分析,結合其法律知識圖譜實現多步查詢。2024年Q2財報顯示,其法律專業部門的有機營收增長7%。
  • 萬得(Wind):部署面向金融終端的AI問答和智慧研究報告功能,部分功能背後涉及“條件篩選+事件關聯”的查詢邏輯。由於為非上市公司,營收結構未公開揭露

9. 市場規模

由於多跳檢索屬於RAG技術譜系的一個高階子類,目前尚無專門針對“多跳檢索”的獨立市場規模統計。以下資料綜合自RAG、企業搜尋、AI知識管理等相關市場的估算,供交叉參考。

9.1 全球RAG與企業AI搜尋市場

  • 據Allied Market Research 2024年3月釋出的報告,全球RAG市場(包含單跳與高階檢索元件及服務)2023年規模約為12.6億美元,預計2030年達到76.3億美元,CAGR約29.3%。該統計口徑包含RAG軟體、工具和部署服務。
  • 據MarketsandMarkets 2024年5月報告,企業搜尋市場2024年規模約為62億美元,預計2029年達到118億美元。該市場中的“AI增強搜尋”子類是增長引擎,多跳檢索能力被視為該子類的核心溢價功能。

9.2 中國市場

  • 中國企業知識管理與智慧搜尋市場的精確統計更為稀缺。據IDC中國2024年Q2公開的《中國AI軟體及應用市場追蹤》資料,2023年中國AI軟體市場規模約為89.8億元人民幣,其中“智慧檢索與知識管理”子市場約佔比15%-18%(即約14-16億元)。該口徑包含傳統企業搜尋到AI問答的全譜系,多跳檢索滲透率暫無資料。IDC預計該子市場2024-2027年CAGR約為35%-40%。

9.3 可觸達市場(SAM)估算邏輯

用更底層的指標交叉估算:多跳檢索每一跳需要執行向量檢索及大型模型推論。以平均每次查詢消耗0.02-0.05美元API費用(含嵌入和生成)為單價,並推算企業知識工作者的查詢頻次,全球範圍內企業知識管理和智慧問答的年度可觸達市場或達數十億美元量級——但這僅為自上而下的毛估,缺乏嚴謹調研支撐,需謹慎引用。

重要說明:上述所有數字均不支援直接作為“多跳檢索市場規模”使用。其中RAG市場規模資料來源為第三方研究機構估算,統計口徑和假設差異可能導致資料分歧。建議關注Gartner 2024年Q4預計釋出的《知識管理AI技術成熟度曲線》作為補充參考。


10. 玩家對比

以下對比聚焦2024年中產業鏈上的核心玩家群體,從技術棧完備度、產品化程度、商業模式和落地行業四個維度進行架構性對比。

10.1 綜合雲端廠商型

代表:微軟(Azure AI)、阿里雲端(百鍊+通義)、Google雲端(Vertex AI)

維度特徵
技術棧完備度極高。自研大型模型+託管向量資料庫+應用編排平台,一站式閉環
產品化程度高。提供低程式碼/無程式碼編排、監控、安全合規套件
商業模式PaaS/SaaS訂閱+用量計費。大型企業年度合同通常6-7位數美元量級
優勢與現有雲端生態無縫整合,客戶遷移成本低
劣勢鎖定效應強;中國出海企業若選海外雲端,資料合規是核心障礙
多跳能力深度2024年中,三家的會話編排產品均支援鏈式呼叫和條件分支,屬中上水平。微軟Copilot Studio的“Generative Answers+多源聯結器”組合被Forrester 2024年Q2測評列為該象限領導者

10.2 獨立架構與工具廠商型

代表:LangChain/LangGraph、LlamaIndex

維度特徵
技術棧完備度高(在編排層),但自身不提供大型模型和向量資料庫,依賴整合
產品化程度中。開源架構成熟,商業產品(LangSmith等)仍在完善
商業模式開源社群+商業工具SaaS訂閱+企業支援
優勢開發者生態龐大、可組合性極強、不繫結特定模型
劣勢單體企業客戶付費意願和客單價低於SaaS產品,商業化仍在爬坡期
多跳能力深度該賽道最高。LangGraph的狀態圖編排支援任意複雜路由邏輯

10.3 垂直應用廠商型

代表:Cohere、Palantir、第四範式、明略科技

維度特徵
技術棧完備度中到高。通常自研或多模型整合+自有知識庫管理+行業應用層
產品化程度高。直接面向業務場景解決問題,而非只提供工具
商業模式軟體許可+SaaS訂閱+行業解決方案專案
優勢行業知識深厚,即插即用性強,客戶成功度高
劣勢通用性不足,跨行業複製成本高
多跳能力深度深度嵌入但通常不對外標註“我這是多跳檢索”,能力封裝在具體業務功能中

10.4 差異化競爭格局

一個關鍵觀察是:截至2024年中,尚無廠商以“多跳檢索”作為獨立的品牌產品名稱進行營銷。它通常被內嵌在“高階知識問答”“知識推論”“複雜查詢”等功能描述之中。這意味著該賽道的競爭不是“多跳vs多跳”,而是“誰的多跳更準確、更可控、成本更低”的隱效能力競賽。競爭優勢將來自三方面:高質量的企業資料治理能力(決定檢索召回上限)、精細的中間推論可控性(減少幻覺傳播),以及全鏈路的成本最佳化工程。


11. 風險

多跳檢索在產業化過程中面臨多重風險,技術風險和商業風險交織:

11.1 錯誤傳播與回答質量風險

這是多跳檢索最重要的技術風險。鏈式結構決定了系統存在“薄弱環節脆弱性”——只要某一跳的檢索召回失敗或推論偏移,最終答案可能完全偏離事實。更嚴重的是,多跳檢索產出的答案往往看起來“細節豐富、邏輯自洽”,更容易讓使用者對其錯誤產生“過度信任”。

產業影響:在高風險場景(醫療診斷輔助、法律意見出具、重大金融決策)中,該風險足以構成部署阻斷因素。

11.2 成本與延遲的不確定性

與單跳RAG不同,多跳檢索的跳數無法預先固定(取決於查詢複雜度和中間結果)。這導致單次查詢的計算成本波動劇烈,可能從0.5秒/0.01美元到15秒/0.50美元不等。對於需要SLA(服務等級協議)保障的企業場景,延遲的“長尾”分佈是一個顯著的工程挑戰。

11.3 可解釋性與合規風險

儘管有片段級歸因機制(如指向具體的源文件),但多跳檢索中間的推論邏輯鏈——即“為什麼要從A去查B”這個決策本身——對終端使用者來說常常是不透明的。當模型在兩個矛盾的資訊源中選擇了其中一個,而未解釋為何忽略另一個時,可能在合規審查和審計中被質疑。

11.4 資料安全與隱私風險

多跳檢索將資料暴露面從“單次查詢+返回”擴充套件為“多次查詢+中間保留+多步處理”。企業私有資料在檢索鏈的多個節點上被傳遞、與模型互動、可能被快取或記錄。對於跨境聯動的多跳鏈路,資料駐留合規是一個尚未被充分討論的風險地帶。

11.5 市場預期的過度透支

2023-2024年,大語言模型和企業知識庫AI營銷浪潮中,“能理解任何複雜問題”“像真人分析師一樣推論”等話術廣泛出現。多跳檢索的實際能力與這些承諾之間存在顯著缺口,可能導致2025-2026年出現一部分企業客戶的“AI疲勞”和預算回撥風險。


12. 誤讀糾偏

針對多跳檢索的常見錯誤認知,逐一澄清:

誤讀1:“多跳檢索就是問一次,AI自動查多次。”

澄清:這是對流程的過度簡化。真正的多跳檢索不是“多次單跳的疊加”,而是各次檢索之間存在邏輯依賴關係——後一跳的查詢內容由前一跳的檢索結果驅動。簡單地將一個大問題拆成幾個小問題分別檢索然後拼接,只是“並行單跳”,不是真正的多跳。等而下之的一些號稱多跳的產品實際上就是把使用者問題拆成幾個關鍵詞分別搜,然後把結果堆在回覆裡,這類實現不是多跳檢索。

誤讀2:“跳數越多越好。”

澄清:在公開基準評測中,當跳數超過3-5跳後,端到端F1/準確率通常不升反降。這是因為錯誤累積效應開始壓倒額外資訊帶來的收益。在生產環境中,2-3跳是當前價效比最高的配置區間。跳數的增加是有代價的,而不是免費的效能提升。

誤讀3:“多跳檢索解決了大型模型的幻覺問題。”

澄清:幻覺問題在多跳檢索中並未消失,而是轉換了形態。單跳RAG的幻覺通常是“答案不在文件中,模型自己編了”;多跳檢索的幻覺則可能是“文件A中有片段a,文件B中有片段b,模型錯誤地推斷a和b之間的關係”。後者更隱蔽、更難核查。多跳檢索減少了某一類幻覺,但也引入了新型幻覺,需要不同的治理策略。

誤讀4:“Agent和多跳檢索是一回事。”

澄清:如技術原理部分所述,多跳檢索是檢索系統內部的複合資訊收集機制,Agent是更高層次的自主決策與行動系統。Agent可能內部使用多跳檢索,但Agent的範疇遠大於多跳檢索(還包括工具呼叫、任務規劃、環境互動等)。

誤讀5:“只要有了多跳檢索技術,企業知識庫就能回答任何問題。”

澄清:多跳檢索的上限受兩個硬約束:知識庫中存在相關資訊(如果關鍵事實不在知識庫中,跳再多也沒用);文件質量和結構化程度(如果原始文件的表格是掃描件且OCR質量差,檢索就無法準確命中)。技術解決的是“找到已有資訊並連線起來”,而不是創造缺失的資訊。


13. 最新事件

以下為截至2024年中的行業動態(按時間倒序):

2024年7月

  • OpenAI釋出更便宜的GPT-4o mini,其價格大幅下降使多跳檢索的LLM呼叫成本壓力減輕,推動了更復雜檢索鏈的經濟可行性。
  • LangChain宣佈LangGraph v0.1,正式推出面向複雜多步Agent和檢索應用的狀態圖編排架構,支援條件分支、迴圈和人機協作斷點。

2024年6月

  • 阿里雲端在2024年AI峰會上釋出“百鍊平台”智慧代理編排功能,允許使用者通過拖拽式介面建置包含多步檢索的鏈式應用,對接通義千問和DashVector。
  • Anthropic釋出Claude 3.5 Sonnet,在多個與檢索和推論相關的基準中較前代大幅提升,並被多個RAG架構迅速整合為預設推論模型。

2024年5月

  • Google I/O大會上重點展示Vertex AI Search的多步推論能力,並開源了用於評估多跳檢索質量的架構FRAMES(Factuality, Retrieval, And Multi-step Evaluation Set)。
  • 百度永珍大會上,文心智慧代理平台升級,強調知識庫檢索與智慧代理規劃的深度融合,公開日均呼叫量資料。

2024年4月

  • LlamaIndex釋出0.10版本架構重構,強化了多跳查詢引擎(SubQuestionQueryEngine)和麵向Agent的檢索組合能力。

2024年3月

  • 微軟釋出Copilot for Security,其內部的情報檢索功能使用了多跳關聯查詢,展示了多跳檢索在網路安全調查場景中的商業落地案例。
  • NVIDIA GTC大會上,多家AI基礎設施廠商展示了使用NVIDIA NIM(推論微服務)加速RAG流程的方案,向量檢索和大型模型推論的延遲最佳化有利於多跳鏈路的效能提升。

中國市場動態補充

  • 截至2024年上半年,國內券商、公募基金、大型律所中至少十餘家公開招標或合作開發了包含“複雜查詢”“多輪檢索”要求的AI知識管理專案(據公開招標公告資訊),但中標金額及實施深度公開資料未見系統統計。

14. 追蹤指標

若希望持續追蹤多跳檢索產業的進展,以下指標和觀察路徑具有參考價值:

14.1 技術基準指標

  • HotpotQA/ MuSiQue/ 2WikiMultihopQA排行榜:學界多跳問答的標準評測集。F1分數和精確匹配(EM)年年增率提升幅度,反映多跳推論基礎能力的進步速率。關注細項:比較不同跳數(2跳、3跳、4跳)的準確率衰減曲線。
  • BEIR / MTEB檢索基準:嵌入模型和檢索管道的通用評測。嵌入模型在各項任務上的平均得分變化趨勢,決定多跳檢索召回率的上限。

14.2 產業滲透指標

  • 雲端廠商AI服務營收增速:特別是與“知識搜尋”“RAG”相關的營收子項增速(若揭露)。微軟Azure AI、阿里雲端AI相關業務、百度智慧雲端AI業務的季度增速為先行指標。
  • 向量資料庫活躍部署量:Milvus/Pinecone/Weaviate等主流向量資料庫版本的活躍使用者數或下載量增長,可側面反映RAG及多跳檢索需求的安裝基盤。
  • 企業採購指標:在政府及大型企業公開的AI/知識管理招標中,統計含“多輪檢索”“複雜查詢”“知識推論”等關鍵字的專案數量和金額變化趨勢。

14.3 成本與效能指標

  • LLM推論單價變化:GPT-4o mini、Claude 3 Haiku等輕量化模型的每百萬Token價格及降價頻率,是多跳檢索商業化可行性的關鍵約束變數。
  • 多跳檢索延遲基準報告:關注行業評測機構(如Gartner、Forrester)或開源社群(如LangSmith公共Benchmark)釋出的多跳檢索端到端延遲對比資料。

14.4 生態與治理指標

  • 監管政策更新:中國《生成式人工智慧服務管理暫行辦法》的後續細則、以及網信辦、各行業主管機構針對AI在金融、法律等垂直領域的應用規範(如AI輔助意見是否需強制人工稽核標註),這將決定多跳檢索在高合規行業的部署成本。
  • 資料跨境規則:不同司法管轄區間的資料流通規定對多跳檢索的雲端服務架構(如多區域向量資料庫部署)有直接影響,需關注相關法規更新和執法案例。

15. 信源

以下為本篇分析引用的主要公開資訊來源,按型別分類:

學術與技術基準

  • HotpotQA: “HotpotQA: A Dataset for Diverse, Explainable Multi-hop Question Answering” (Yang et al., EMNLP 2018). 官方排行榜 https://hotpotqa.github.io
  • MuSiQue: “MuSiQue: Multihop Questions via Single-hop Question Composition” (Trivedi et al., TACL 2022)
  • BEIR: “BEIR: A Heterogeneous Benchmark for Zero-shot Evaluation of Information Retrieval Models” (Thakur et al., NeurIPS 2021)
  • MTEB: “MTEB: Massive Text Embedding Benchmark” (Muennighoff et al., EACL 2023)

行業與市場報告

  • Allied Market Research, “Retrieval-Augmented Generation Market Report,” March 2024
  • MarketsandMarkets, “Enterprise Search Market Report,” May 2024
  • IDC China, 《中國AI軟體及應用市場追蹤》, 2024年Q2釋出
  • Gartner, “Innovation Radar for AI in Financial Services,” Q1 2024
  • Forrester, “The Forrester Wave: Enterprise AI Assistants,” Q2 2024
  • DB-Engines, Vector Database Management Systems category ranking, accessed July 2024

公司財報與公開揭露

  • Microsoft FY2024 Q4 Earnings Release and Investor Call Transcript, July 2024
  • Alphabet (Google) Q2 2024 Earnings Call Transcript, July 2024
  • 阿里巴巴集團2024財年年度報告及2024年5月投資者交流會簡報
  • 百度集團2024年Q2業績公告(HKEx: 9888)
  • Palantir Technologies Q2 2024 Earnings Release, August 2024
  • 第四範式2024年中報(港交所公告)
  • Thomson Reuters Q2 2024 Earnings Release, August 2024
  • 金山辦公2024年半年度業績報告

公開技術與產品釋出

  • OpenAI Official Blog, “GPT-4o mini: advancing cost-efficient intelligence,” July 2024
  • Anthropic Official Blog, “Claude 3.5 Sonnet,” June 2024
  • LangChain Blog, “LangGraph v0.1,” July 2024
  • LlamaIndex Blog, “v0.10 Release Notes,” April 2024
  • 阿里雲端AI峰會公開演講材料, June 2024
  • Google I/O 2024 Keynote and Vertex AI Sessions, May 2024
  • 百度永珍大會2024公開演講材料

新聞報道

  • Bloomberg, “AI Startup Cohere Valued at Over $5 Billion,” July 2024

宣告

  • 本篇所有市場資料、競對資訊均基於上述截至2024年7月可獲取的公開材料。涉及私有公司的營收、估值、市場份額等資料,若無權威第三方審計來源,文中已標註”公開資料未見精確數字”或”為估算口徑”。
  • 中國市場部分細分資料因缺乏獨立權威統計,採用IDC等機構的整體AI市場資料推算該子類的比例區間,當引述時請務必標註資料來源和口徑。
  • 本文旨在提供產業資訊與客觀分析,不構成任何形式的投資建議、股票推薦或技術選型結論。
source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型