多跳检索(Multi-Hop Retrieval)
1. 3秒看懂
多跳检索是一种让AI分多步查资料、逐步推理的复合检索技术。传统检索增强生成(RAG)是“问一句、查一次、答一次”,而多跳检索是“问一句、查多次、中间推理、最后汇总”。它解决的问题是:当一个问题的答案分散在多个文档、多个知识片段中,单次检索拿不到完整答案时,系统能够像侦探破案一样,根据第一条线索去查找第二条线索,再综合判断。这项技术是AI从“问答机器人”迈向“推理助理”的关键技术阶梯。
2. 3分钟产业解释
通俗理解
想象你问一个传统AI助手:“2023年获得图灵奖的科学家,他的博士导师曾获得过什么重要奖项?”传统RAG会一次性检索这个问题,大概率找不到直接答案,因为没有任何一个段落会同时包含这三个信息点。
多跳检索的做法是:
- 第一跳:检索“2023年图灵奖得主是谁”,得到答案“Avi Wigderson”。
- 第二跳:检索“Avi Wigderson的博士导师是谁”,得到答案“Richard Lipton”。
- 第三跳:检索“Richard Lipton获得过什么重要奖项”,得到答案“哥德尔奖、高德纳奖等”。
- 最后把三段信息缝合成一个完整回答。
产业定位
多跳检索是检索增强生成(RAG)技术谱系中的高级形态。RAG技术本身是2023年大语言模型(LLM)产业化最重要的配套技术之一,解决的是“大模型不知道自己不知道什么”的幻觉问题——给它一个外部知识库,让它查了再说。但传统RAG的“单跳”模式有一个天然短板:它假设答案就完整地存在于某一个文档片段的附近,而对于需要跨文档、跨段落进行逻辑拼接的复杂查询,它无法胜任。
多跳检索填补的正是这个缺口。产业界在2023年下半年开始密集关注这一方向,因为企业级场景——尤其是金融分析、法律尽调、药物研发、供应链溯源——恰恰充满了此类需要多步推理的问题。一个典型的金融场景:投研分析师提问“找出过去五年在新能源电池隔膜领域,累计研发投入超过10亿且专利数量增长超过200%的A股公司”,这个问题需要先检索“新能源电池隔膜领域A股公司名单”,再逐家检索“研发投入数据”,同时检索“专利数量变化”,最后交叉比对筛选。
这就是多跳检索的产业价值:它让AI能够处理需要信息拼接、逻辑串联、交叉验证的复杂认知任务,而不仅仅是回答“合同第3条第2款写了什么”这类单点查询。从产业视角看,它是企业知识库从“文档问答工具”升级为“知识推理系统”的核心技术桥接。
与Agent的关系辨析 多跳检索常与“AI Agent(智能体)”的概念被混淆。两者的区别在于:多跳检索侧重预定义或模型自主规划的检索链路,目标是在给定的知识库范围内完成信息收集与推理;而Agent通常涉及更广泛的操作,包括调用外部API、操作软件、执行多轮对话决策等。一个简化的理解是:多跳检索是Agent的“大脑检索回路”,是Agent完成复杂任务时内部的知识处理子系统。
3. 技术原理
多跳检索的技术本质是将复杂查询分解为有序的、依赖上下文的多轮检索-推理循环。其技术架构可以拆解为以下核心环节:
3.1 查询分解与规划
用户的复杂问题首先进入一个查询规划器(Query Planner),其职责是将原始问题分解为检索计划。当前主流方法有三类:
- 静态分解(Static Decomposition):在检索开始前,由大语言模型一次性将问题拆解为顺序或并行的子问题链。例如使用Chain-of-Thought(思维链)提示词技术,让模型输出“step1: 检索X,step2: 基于X的结果检索Y”。
- 动态迭代分解(Iterative Decomposition):每一步检索完成后,将已有信息作为上下文,由模型动态生成下一步的子查询。这种方法更灵活,能根据中间结果调整检索方向,但计算成本更高。
- 图结构规划(Graph-based Planning):将查询分解为有向无环图(DAG),允许多个检索分支并行执行后再汇聚。适用于“A和B的对比”这类需要同时收集多方信息的问题。
3.2 检索执行引擎
每一跳的检索通常依赖一个或多个检索后端,常见组合包括:
- 稠密向量检索:使用嵌入模型(Embedding Model)将查询和文档转换为高维向量,通过余弦相似度等度量进行近似最近邻搜索(ANN)。适用于语义匹配,但对精确关键词匹配不敏感。
- 稀疏向量/BM25检索:基于词频-逆文档频率的传统信息检索方法,对专有名词、编号、日期等精确匹配效果好。通常作为稠密检索的补充。
- 知识图谱查询:对结构化知识直接执行SPARQL或Cypher查询,用于实体关系跳转,如“A公司的参股子公司中,哪家持有B专利”。
- 混合检索(Hybrid Search):融合稠密向量、稀疏向量、结构化查询的结果,经由重排序模型(Reranker)统一打分排序,得出综合相关性最高的Top-K结果。
3.3 中间推理与上下文管理
这是多跳检索区别于单跳检索的核心环节。在每一跳检索获得结果后,系统面临一个关键问题:哪些信息应该保留并传递给下一跳?
常见的中间推理策略包括:
- 查询改写(Query Rewriting):将上一跳检索结果中的关键实体、关系抽取出来,构造新的查询语句。
- 上下文化(Contextualization):将检索结果摘要后注入系统提示词,作为下一跳查询生成的背景知识。
- 证据验证链(Verification Chain):在多跳完成后,增加一个反向验证步骤——用最终答案反查能否在各跳的源文档中找到支撑,若不匹配则触发重试或降级回答(如回答“根据已有资料无法确认”)。
3.4 信息合成与归因
最终,系统将多轮检索积累的文档片段进行去重、排序、融合。这一步骤的核心挑战是冲突消解——当不同来源的信息相互矛盾时,系统需要(或应向用户明示)呈现分歧,而非强行缝合出一个看似统一的答案。
归因(Attribution)机制是多跳检索可验证性的基础。高质量的实现会做到片段级归因:最终回答的每一个主张(Claim),都对应到具体源文档的具体段落,并标注该段落来自第几跳检索。
3.5 错误传播的控制机制
多跳检索的“阿喀琉斯之踵”是错误传播(Error Propagation):如果第一跳检索的召回率低或相关性差,错误会沿着链路放大。产业界的应对措施包括:
- 多路召回:每一跳同时执行多种检索策略,降低单点失败概率。
- 置信度评分:对中间跳的检索结果进行置信度评估,低于阈值时触发重新查询或请求用户澄清。
- 人工断点:在关键垂直场景中,允许在特定跳插入人工审核节点。
4. 关键参数
多跳检索系统的性能和成本由以下关键参数决定。以下参数阈值为2024年产业界常见实践范围,具体值因业务场景差异显著。
4.1 跳数与深度
- 典型跳数范围:2-5跳。低于2跳退化为单跳RAG,高于5跳的收益递减明显且错误概率急剧上升。根据LangChain社区2024年中发布的用户调研数据,约68%的多跳检索应用配置在2-3跳之间。
- 最大跳数:部分实验性系统支持到10跳,但主要见于学术基准测试,而非生产环境。
4.2 检索精度指标
- Top-K:每跳检索返回的文档片段数,通常设置在3-20之间。K值越大,召回率越高,但后续处理的上下文窗口压力越大、推理成本越高。
- 召回率@K(Recall@K):在K个返回结果中包含正确答案的概率,是多跳检索的核心观察指标。单跳Recall@10通常在85%-95%区间,但经5跳链式检索后,累积召回率可能大幅衰减——这是多跳系统最大的技术风险点之一。
- 平均倒数排名(MRR):衡量第一个相关文档在返回列表中的位置。多跳场景中MRR通常低于单跳场景。
4.3 成本与延迟参数
- LLM调用次数:一次N跳检索,LLM调用次数通常是N+1(N次子查询生成+1次最终合成)到2N(加上中间推理步骤)。这意味着3跳检索的一个查询可能调用大模型4-6次。
- 端到端延迟:企业场景中,2-3跳的多跳检索端到端延迟通常在3-15秒之间,显著高于单跳RAG的1-3秒。实时对话场景需引入流式输出或预计算以降低用户感知延迟。
- Token消耗:多跳检索的总Token消耗约为单跳RAG的3-8倍,因为每次中间推理都需要将历史上下文重新输入模型。
4.4 准确率
- 多跳问答基准(HotpotQA、MuSiQue等):2024年中,顶级模型的F1分数在60%-75%区间(结合检索与阅读),而单跳场景通常在80%以上。该差距是产业界投入优化的主战场。
- 源数据:上述基准测试数据来自HotpotQA官方排行榜及公开论文(数据截止至2024年Q2)。
5. 技术路线
多跳检索并非只有一种实现方式。根据检索链的生成机制、推理方式、底层检索引擎的不同,当前形成了四条主要技术路线:
5.1 基于提示词编排的链式RAG(Prompt-Chaining RAG)
这是目前落地门槛最低、应用最广的路线。以LangChain、LlamaIndex为代表的开源框架提供了“链”的抽象,开发者通过编写“提示词模板+检索步骤”的编排逻辑来定义多跳流程。大语言模型在每一步被调用,用于生成子查询或进行中间推理。
- 优势:开发灵活、可解释性强、易于调试、适配现有知识库。
- 劣势:高度依赖提示词工程的质量,链式逻辑一旦固化便缺乏对意外查询的自适应能力。
- 代表性技术:LangChain的RetrievalQA Chain、LlamaIndex的SubQuestionQueryEngine。
5.2 基于智能体的动态检索(Agentic Retrieval)
系统不预设固定的检索步骤序列,而是由大语言模型作为“智能体”(Agent),在每一跳自主决策“下一步应该检索什么”或“是否已有足够信息回答”。这本质上是ReAct(Reasoning + Acting)模式在检索领域的应用。
- 优势:对开放式、探索性问题的适应性强,能处理用户提问时未预见的检索路径。
- 劣势:延迟高、成本高、行为可控性差(模型可能走入无意义的检索循环)。
- 代表性技术:基于OpenAI Assistants API或LangGraph构建的检索Agent。
5.3 基于知识图谱的多跳推理(Graph-based Multi-Hop)
如果企业的知识已组织为知识图谱,多跳检索可以等价为图谱上的路径查询和子图匹配问题。
- 优势:精确性极高,不依赖语义近似匹配,能保证查全和查准(在Schema规范的范围内)。
- 劣势:知识图谱的构建和维护成本高,对非结构化文本的覆盖天然有缺口,灵活性不及向量检索。
- 代表性技术:结合大语言模型生成图谱查询语句(Text-to-Cypher/SPARQL),再将查询结果作为上下文进行阅读理解的混合方案。
5.4 端到端的检索-推理联合训练(End-to-end Multi-Hop Models)
这是四条路线中最前沿、但距离大规模产业落地最远的一条。通过专门设计训练数据(包含多跳推理的“证据链”标注),预训练或微调基础模型,使其直接在参数内部隐式地完成“检索+推理”过程,无需外挂显式的多步检索系统。
- 优势:一旦训练成功,推理速度极快,不依赖外部检索基础设施。
- 劣势:训练成本极高,知识更新需要重新训练,可解释性几乎为零,“幻觉”来源更难追溯。
- 代表性研究:Google的RETRO、Meta的Atlas等检索增强语言模型的进阶研究。
技术路线对比(2024年中视角)
| 维度 | 提示词链式RAG | Agentic检索 | 图谱多跳 | 端到端联合训练 |
|---|---|---|---|---|
| 产业成熟度 | 高(已在量产) | 中(头部企业试点) | 中(特定行业深度应用) | 低(学术研究为主) |
| 成本 | 中 | 高 | 中 | 训练高/推理低 |
| 可控性 | 高 | 低 | 高 | 极低 |
| 适合场景 | 结构化分析任务 | 探索性、开放性查询 | 实体关系密集的查询 | 暂未规模推广 |
6. 上游
多跳检索的技术栈由多项基础能力支撑,构成其上游供应链:
6.1 基础大语言模型(LLM)
多跳检索高度依赖LLM的底层能力:问题分解的合理性、中间推理的准确性、信息摘要的质量、归因格式的遵循度。2024年主流选项包括:
- 闭源模型:OpenAI GPT-4o/4-Turbo、Anthropic Claude 3.5 Sonnet、Google Gemini 1.5 Pro。优势是泛化推理能力强的,劣势是单价高、数据出境有合规顾虑。
- 开源模型:Meta Llama 3.1(405B/70B)、阿里云Qwen 2.5系列、Mistral Large 2等。开源模型在RAG场景的推理任务上与闭源模型的差距正在缩小,且支持私有化部署。
- 市场格局:据IDC 2024年Q2的调研,中国RAG相关场景中的LLM采购,约55%来自国内厂商(以百度文心、阿里通义千问为主),约30%使用开源模型部署,约15%采用海外闭源模型(主要为GPT-4系列)。
6.2 嵌入模型(Embedding Model)
将文本转化为向量的模型,直接影响检索召回的语义匹配质量。
- 通用嵌入模型:OpenAI text-embedding-3-large、Cohere Embed v3。
- 中文优化嵌入模型:BGE系列(智源研究院开源)、GTE系列(阿里巴巴)、Jina Embeddings v2。
- 关键趋势:多语言能力、长文本支持(8192 token以上)、以及适配特定行业的微调嵌入模型需求增长显著。
6.3 向量数据库与检索引擎
面向多跳检索场景,向量数据库的核心要求不仅是高并发、低延迟的近似最近邻(ANN)检索能力,还包括:
- 混合检索能力:同时支持稠密向量检索+BM25稀疏检索+标量过滤(元数据条件筛选)。
- Milvus(开源,Zilliz维护):中国市场渗透率最高的向量数据库,支持十亿级向量规模、混合检索。
- Pinecone Serverless:海外使用量最大的托管向量数据库,免运维但数据需出境。
- Elasticsearch/OpenSearch:以全文检索为基础,扩展了向量检索能力,适合已有ES技术栈的企业。
- 云厂商托管方案:阿里云DashVector、腾讯云VectorDB、华为云GES。
- 市场份额数据:据DB-Engines 2024年7月的向量数据库类别排名及公开融资数据估算,全球范围内Milvus/Zilliz和Pinecone两家合计占开源+云托管向量数据库市场约40%-50%的活跃部署量;中国市场以Milvus和阿里云DashVector为主。此为估算口径,无权威第三方审计数据。
6.4 数据预处理与解析工具
多跳检索对文档解析的质量要求高于单跳RAG,因为错误的前端解析(如表格拆散、段落切错)会在多跳链中被放大。
- 文档解析:Unstructured.io(开源/商业)、LlamaParse。处理PDF、PPT、扫描件的表格识别和结构化提取。
- 分块策略:多跳检索通常需要更灵活的分块方法——过大的块导致召回精度下降,过小的块可能割裂上下文。层级分块(Hierarchical Chunking)、语义分块(Semantic Chunking)是常见优化方向。
6.5 知识图谱构建与存储
对于采用图谱多跳路线的团队,上游包括:
- 图数据库:Neo4j(海外商业)、NebulaGraph(中国开源)、HugeGraph。
- 实体识别与关系抽取工具:部分由大语言模型完成,部分依赖专用NLP工具链。
7. 下游
多跳检索的下游是各行业的具体应用场景。以下按场景成熟度和需求强度分层描述:
7.1 金融分析与投研
这是当前多跳检索落地意愿最强的场景之一。典型用例包括:
- 供应链穿透查询:“找出所有为苹果Vision Pro供应光学模组的A股上市公司,以及它们2023年对该客户的营收占比。”
- 事件关联分析:“2024年上半年发布减持公告的医药生物行业公司中,哪些公司在公告前一个月内有高管辞职?”
- 财务异常检测:“找出连续三年经营性现金流为负但净利润为正的上市公司,并检索其应收账款计提政策。”
落地状态:国内头部券商(如中金公司、中信证券)2024年均在内部投研系统中引入了高级RAG和FAQ功能,多跳检索通常是作为其“智能搜索Plus”模块嵌入。具体的多跳检索深度使用情况,公开资料未见详细披露。据Gartner 2024年Q1《金融服务AI创新雷达》报告估算,全球约15%-20%的资管和投行机构已在AI投研工具中测试多步推理检索功能。
7.2 药物研发与科研文献
科研查询天然需要多跳推理:“A靶点在B疾病中的作用机制,以及已进入临床II期的针对该靶点的小分子药物,请按IC50排序。”
- 落地场景:文献综述的自动化辅助、化合物-靶点-疾病的关联发现、专利规避分析。
- 落地现状:多家跨国药企(公开信息可见诺华、辉瑞2023-2024年的合作新闻)已采购基于大语言模型和企业检索的研发知识平台。国内药明康德、恒瑞医药等公司公开演讲中提及使用AI辅助文献分析,但是否包含多跳检索深度能力,公开资料未见具体说明。
7.3 法律与合规
- 判例关联分析:“找到与本案案情相似且判决日期在《民法典》生效后的二审维持原判案例,提取其争议焦点与赔偿金额。”
- 多法域合规审查:“某数据产品同时受中国《个人信息保护法》和欧盟GDPR管辖,检索两份法规中关于跨境数据传输的具体条款并进行对比。”
落地现状:法律场景对准确率和可追溯性要求极高,多跳检索带来的错误风险使其实施相对谨慎。公开资料可见律商联讯(LexisNexis)、威科先行等法律信息服务商在其AI产品中探索了查询分解能力,但“多跳检索”作为独立功能宣传较少。
7.4 企业知识管理与内部助手
这是多跳检索最广泛的应用层落点。企业内部的OA、CRM、ERP、Wiki、工单系统等数据孤岛的打通,支撑员工通过自然语言进行跨系统复杂查询。
落地现状:据Forrester 2024年Q2《企业AI助手市场报告》数据,全球已部署AI企业助手的组织中,约35%-40%的功能请求涉及跨多个数据源的复合查询,但目前实际实现的多为“多次单跳检索后在前端并列展示”,而非真正的链式多跳推理。这意味着该领域的客户需求与产品能力之间仍存在显著缺口。
7.5 其他新兴场景
- 保险核保核赔:多跳检索用于关联被保人的多源医疗记录、事故报告和政策条款来判断赔付责任。
- IC设计/半导体工艺溯源:跨专利库、学术论文库、产品手册进行工艺路径依赖分析。
8. 受益公司
以下分析基于2023-2024年公开的财务报告、产品发布及行业报告,按在多跳检索价值链中的位置分类。所有市占率数据若无专门标注“多跳检索”口径,则为相关大品类的数据。
8.1 大模型与云平台厂商
这类公司受益于多跳检索驱动的计算资源消耗(Token调用、向量检索QU)以及其PaaS层售卖。
- 微软:通过Azure AI Search + Copilot Studio,将多跳能力嵌入M365和Azure生态。FY2024Q4财报显示Azure AI服务收入同比增长超30%(口径为Azure AI整体,包含认知搜索、机器学习和智能助手),位列最大受益方之一。
- 阿里云:通义千问+百炼平台+DashVector向量数据库+今年推出的智能体编排能力,形成闭环。2024财年阿里云AI相关产品收入增速超三位数(来自阿里云2024财年财报及2024年5月投资者交流会表述,具体绝对值及多跳检索贡献比例未拆解)。
- 百度:文心智能体平台+百度智能云的向量检索能力。2024年Q2财报显示,百度智能云AI相关收入占比持续提升,文心大模型日均调用量超3.2亿次(2024年5月公开数据),但未拆分出RAG/多跳检索占比。
- 谷歌云:Vertex AI Search提供多模态、多轮检索能力。2024年Q2 Alphabet财报电话会中披露,Vertex AI的活跃客户数环比增长超70%。
8.2 开源框架与工具链厂商
- LangChain(LangChain Inc.):多跳检索编排框架的事实标准之一。2024年推出商业产品LangSmith(调试与可观测性)及LangGraph(状态化多步应用)。其技术被大量企业产品集成。收入数据为私有公司信息,公开资料未披露。
- LlamaIndex:以数据连接和索引设计见长的框架,其SubQuestionQueryEngine是多跳检索的轻量实现方向。2023-2024年获得多轮融资,但收入和估值细节公开资料未见精确数字。
- Zilliz(Milvus母公司):作为全球最主流的开源向量数据库之一(DB-Engines向量数据库分类排名前三),从单跳到多跳,所有的RAG系统几乎都需要向量数据库,构成了多跳检索基础设施层的直接受益方。
8.3 企业服务与垂直应用厂商
- Cohere(加拿大):专注于企业级RAG平台,Command R/R+系列模型对RAG任务做了专项优化,包括多步工具调用和检索。2024年获得新一轮融资,估值超50亿美元(据Bloomberg 2024年7月报道),但多跳检索专业产品收入未单列。
- Palantir:AIP(Artificial Intelligence Platform)将多跳推理嵌入其本体(Ontology)驱动的企业数据分析平台中。2024年Q2财报显示美国商业收入同比增长55%,AI平台需求为核心驱动力。
- 中国AI应用平台厂商:明略科技、竹间智能、第四范式(2024年港股上市,股票代码6682.HK)、智谱AI等中国AI厂商在2023-2024年均发布了企业知识库或智能体产品,包含高级检索和推理功能。以第四范式为例,其2024年中报显示“式说”等生成式AI业务收入同比增长超90%(具体多跳功能贡献不明)。
- 金山办公:WPS AI在2024年持续迭代,嵌入了基于企业文档库的智能问答能力。其2024年Q2业绩报告显示AI相关功能用户渗透率持续增长。
8.4 法律与金融信息服务商
- 汤森路透:在Westlaw Precision等法律研究工具中引入AI辅助分析,结合其法律知识图谱实现多步查询。2024年Q2财报显示,其法律专业部门的有机收入增长7%。
- 万得(Wind):部署面向金融终端的AI问答和智能研报功能,部分功能背后涉及“条件筛选+事件关联”的查询逻辑。由于为非上市公司,收入结构未公开披露。
9. 市场规模
由于多跳检索属于RAG技术谱系的一个高级子类,目前尚无专门针对“多跳检索”的独立市场规模统计。以下数据综合自RAG、企业搜索、AI知识管理等相关市场的估算,供交叉参考。
9.1 全球RAG与企业AI搜索市场
- 据Allied Market Research 2024年3月发布的报告,全球RAG市场(包含单跳与高级检索组件及服务)2023年规模约为12.6亿美元,预计2030年达到76.3亿美元,CAGR约29.3%。该统计口径包含RAG软件、工具和部署服务。
- 据MarketsandMarkets 2024年5月报告,企业搜索市场2024年规模约为62亿美元,预计2029年达到118亿美元。该市场中的“AI增强搜索”子类是增长引擎,多跳检索能力被视为该子类的核心溢价功能。
9.2 中国市场
- 中国企业知识管理与智能搜索市场的精确统计更为稀缺。据IDC中国2024年Q2公开的《中国AI软件及应用市场追踪》数据,2023年中国AI软件市场规模约为89.8亿元人民币,其中“智能检索与知识管理”子市场约占比15%-18%(即约14-16亿元)。该口径包含传统企业搜索到AI问答的全谱系,多跳检索渗透率暂无数据。IDC预计该子市场2024-2027年CAGR约为35%-40%。
9.3 可触达市场(SAM)估算逻辑
用更底层的指标交叉估算:多跳检索每一跳需要执行向量检索及大模型推理。以平均每次查询消耗0.02-0.05美元API费用(含嵌入和生成)为单价,并推算企业知识工作者的查询频次,全球范围内企业知识管理和智能问答的年度可触达市场或达数十亿美元量级——但这仅为自上而下的毛估,缺乏严谨调研支撑,需谨慎引用。
重要说明:上述所有数字均不支持直接作为“多跳检索市场规模”使用。其中RAG市场规模数据来源为第三方研究机构估算,统计口径和假设差异可能导致数据分歧。建议关注Gartner 2024年Q4预计发布的《知识管理AI技术成熟度曲线》作为补充参考。
10. 玩家对比
以下对比聚焦2024年中产业链上的核心玩家群体,从技术栈完备度、产品化程度、商业模式和落地行业四个维度进行框架性对比。
10.1 综合云厂商型
代表:微软(Azure AI)、阿里云(百炼+通义)、谷歌云(Vertex AI)
| 维度 | 特征 |
|---|---|
| 技术栈完备度 | 极高。自研大模型+托管向量数据库+应用编排平台,一站式闭环 |
| 产品化程度 | 高。提供低代码/无代码编排、监控、安全合规套件 |
| 商业模式 | PaaS/SaaS订阅+用量计费。大型企业年度合同通常6-7位数美元量级 |
| 优势 | 与现有云生态无缝集成,客户迁移成本低 |
| 劣势 | 锁定效应强;中国出海企业若选海外云,数据合规是核心障碍 |
| 多跳能力深度 | 2024年中,三家的会话编排产品均支持链式调用和条件分支,属中上水平。微软Copilot Studio的“Generative Answers+多源连接器”组合被Forrester 2024年Q2测评列为该象限领导者 |
10.2 独立框架与工具厂商型
代表:LangChain/LangGraph、LlamaIndex
| 维度 | 特征 |
|---|---|
| 技术栈完备度 | 高(在编排层),但自身不提供大模型和向量数据库,依赖集成 |
| 产品化程度 | 中。开源框架成熟,商业产品(LangSmith等)仍在完善 |
| 商业模式 | 开源社区+商业工具SaaS订阅+企业支持 |
| 优势 | 开发者生态庞大、可组合性极强、不绑定特定模型 |
| 劣势 | 单体企业客户付费意愿和客单价低于SaaS产品,商业化仍在爬坡期 |
| 多跳能力深度 | 该赛道最高。LangGraph的状态图编排支持任意复杂路由逻辑 |
10.3 垂直应用厂商型
代表:Cohere、Palantir、第四范式、明略科技
| 维度 | 特征 |
|---|---|
| 技术栈完备度 | 中到高。通常自研或多模型集成+自有知识库管理+行业应用层 |
| 产品化程度 | 高。直接面向业务场景解决问题,而非只提供工具 |
| 商业模式 | 软件许可+SaaS订阅+行业解决方案项目 |
| 优势 | 行业知识深厚,即插即用性强,客户成功度高 |
| 劣势 | 通用性不足,跨行业复制成本高 |
| 多跳能力深度 | 深度嵌入但通常不对外标注“我这是多跳检索”,能力封装在具体业务功能中 |
10.4 差异化竞争格局
一个关键观察是:截至2024年中,尚无厂商以“多跳检索”作为独立的品牌产品名称进行营销。它通常被内嵌在“高级知识问答”“知识推理”“复杂查询”等功能描述之中。这意味着该赛道的竞争不是“多跳vs多跳”,而是“谁的多跳更准确、更可控、成本更低”的隐性能力竞赛。竞争优势将来自三方面:高质量的企业数据治理能力(决定检索召回上限)、精细的中间推理可控性(减少幻觉传播),以及全链路的成本优化工程。
11. 风险
多跳检索在产业化过程中面临多重风险,技术风险和商业风险交织:
11.1 错误传播与回答质量风险
这是多跳检索最重要的技术风险。链式结构决定了系统存在“薄弱环节脆弱性”——只要某一跳的检索召回失败或推理偏移,最终答案可能完全偏离事实。更严重的是,多跳检索产出的答案往往看起来“细节丰富、逻辑自洽”,更容易让用户对其错误产生“过度信任”。
产业影响:在高风险场景(医疗诊断辅助、法律意见出具、重大金融决策)中,该风险足以构成部署阻断因素。
11.2 成本与延迟的不确定性
与单跳RAG不同,多跳检索的跳数无法预先固定(取决于查询复杂度和中间结果)。这导致单次查询的计算成本波动剧烈,可能从0.5秒/0.01美元到15秒/0.50美元不等。对于需要SLA(服务等级协议)保障的企业场景,延迟的“长尾”分布是一个显著的工程挑战。
11.3 可解释性与合规风险
尽管有片段级归因机制(如指向具体的源文档),但多跳检索中间的推理逻辑链——即“为什么要从A去查B”这个决策本身——对终端用户来说常常是不透明的。当模型在两个矛盾的信息源中选择了其中一个,而未解释为何忽略另一个时,可能在合规审查和审计中被质疑。
11.4 数据安全与隐私风险
多跳检索将数据暴露面从“单次查询+返回”扩展为“多次查询+中间保留+多步处理”。企业私有数据在检索链的多个节点上被传递、与模型交互、可能被缓存或记录。对于跨境联动的多跳链路,数据驻留合规是一个尚未被充分讨论的风险地带。
11.5 市场预期的过度透支
2023-2024年,大语言模型和企业知识库AI营销浪潮中,“能理解任何复杂问题”“像真人分析师一样推理”等话术广泛出现。多跳检索的实际能力与这些承诺之间存在显著缺口,可能导致2025-2026年出现一部分企业客户的“AI疲劳”和预算回调风险。
12. 误读纠偏
针对多跳检索的常见错误认知,逐一澄清:
误读1:“多跳检索就是问一次,AI自动查多次。”
澄清:这是对流程的过度简化。真正的多跳检索不是“多次单跳的叠加”,而是各次检索之间存在逻辑依赖关系——后一跳的查询内容由前一跳的检索结果驱动。简单地将一个大问题拆成几个小问题分别检索然后拼接,只是“并行单跳”,不是真正的多跳。等而下之的一些号称多跳的产品实际上就是把用户问题拆成几个关键词分别搜,然后把结果堆在回复里,这类实现不是多跳检索。
误读2:“跳数越多越好。”
澄清:在公开基准评测中,当跳数超过3-5跳后,端到端F1/准确率通常不升反降。这是因为错误累积效应开始压倒额外信息带来的收益。在生产环境中,2-3跳是当前性价比最高的配置区间。跳数的增加是有代价的,而不是免费的性能提升。
误读3:“多跳检索解决了大模型的幻觉问题。”
澄清:幻觉问题在多跳检索中并未消失,而是转换了形态。单跳RAG的幻觉通常是“答案不在文档中,模型自己编了”;多跳检索的幻觉则可能是“文档A中有片段a,文档B中有片段b,模型错误地推断a和b之间的关系”。后者更隐蔽、更难核查。多跳检索减少了某一类幻觉,但也引入了新型幻觉,需要不同的治理策略。
误读4:“Agent和多跳检索是一回事。”
澄清:如技术原理部分所述,多跳检索是检索系统内部的复合信息收集机制,Agent是更高层次的自主决策与行动系统。Agent可能内部使用多跳检索,但Agent的范畴远大于多跳检索(还包括工具调用、任务规划、环境交互等)。
误读5:“只要有了多跳检索技术,企业知识库就能回答任何问题。”
澄清:多跳检索的上限受两个硬约束:知识库中存在相关信息(如果关键事实不在知识库中,跳再多也没用);文档质量和结构化程度(如果原始文档的表格是扫描件且OCR质量差,检索就无法准确命中)。技术解决的是“找到已有信息并连接起来”,而不是创造缺失的信息。
13. 最新事件
以下为截至2024年中的行业动态(按时间倒序):
2024年7月
- OpenAI发布更便宜的GPT-4o mini,其价格大幅下降使多跳检索的LLM调用成本压力减轻,推动了更复杂检索链的经济可行性。
- LangChain宣布LangGraph v0.1,正式推出面向复杂多步Agent和检索应用的状态图编排框架,支持条件分支、循环和人机协作断点。
2024年6月
- 阿里云在2024年AI峰会上发布“百炼平台”智能体编排功能,允许用户通过拖拽式界面构建包含多步检索的链式应用,对接通义千问和DashVector。
- Anthropic发布Claude 3.5 Sonnet,在多个与检索和推理相关的基准中较前代大幅提升,并被多个RAG框架迅速集成为默认推理模型。
2024年5月
- Google I/O大会上重点展示Vertex AI Search的多步推理能力,并开源了用于评估多跳检索质量的框架FRAMES(Factuality, Retrieval, And Multi-step Evaluation Set)。
- 百度万象大会上,文心智能体平台升级,强调知识库检索与智能体规划的深度融合,公开日均调用量数据。
2024年4月
- LlamaIndex发布0.10版本架构重构,强化了多跳查询引擎(SubQuestionQueryEngine)和面向Agent的检索组合能力。
2024年3月
- 微软发布Copilot for Security,其内部的情报检索功能使用了多跳关联查询,展示了多跳检索在网络安全调查场景中的商业落地案例。
- NVIDIA GTC大会上,多家AI基础设施厂商展示了使用NVIDIA NIM(推理微服务)加速RAG流程的方案,向量检索和大模型推理的延迟优化有利于多跳链路的性能提升。
中国市场动态补充
- 截至2024年上半年,国内券商、公募基金、大型律所中至少十余家公开招标或合作开发了包含“复杂查询”“多轮检索”要求的AI知识管理项目(据公开招标公告信息),但中标金额及实施深度公开资料未见系统统计。
14. 跟踪指标
若希望持续跟踪多跳检索产业的进展,以下指标和观察路径具有参考价值:
14.1 技术基准指标
- HotpotQA/ MuSiQue/ 2WikiMultihopQA排行榜:学界多跳问答的标准评测集。F1分数和精确匹配(EM)年同比提升幅度,反映多跳推理基础能力的进步速率。关注细项:比较不同跳数(2跳、3跳、4跳)的准确率衰减曲线。
- BEIR / MTEB检索基准:嵌入模型和检索管道的通用评测。嵌入模型在各项任务上的平均得分变化趋势,决定多跳检索召回率的上限。
14.2 产业渗透指标
- 云厂商AI服务收入增速:特别是与“知识搜索”“RAG”相关的收入子项增速(若披露)。微软Azure AI、阿里云AI相关业务、百度智能云AI业务的季度增速为先行指标。
- 向量数据库活跃部署量:Milvus/Pinecone/Weaviate等主流向量数据库版本的活跃用户数或下载量增长,可侧面反映RAG及多跳检索需求的安装基盘。
- 企业采购指标:在政府及大型企业公开的AI/知识管理招标中,统计含“多轮检索”“复杂查询”“知识推理”等关键字的项目数量和金额变化趋势。
14.3 成本与效能指标
- LLM推理单价变化:GPT-4o mini、Claude 3 Haiku等轻量化模型的每百万Token价格及降价频率,是多跳检索商业化可行性的关键约束变量。
- 多跳检索延迟基准报告:关注行业评测机构(如Gartner、Forrester)或开源社区(如LangSmith公共Benchmark)发布的多跳检索端到端延迟对比数据。
14.4 生态与治理指标
- 监管政策更新:中国《生成式人工智能服务管理暂行办法》的后续细则、以及网信办、各行业主管机构针对AI在金融、法律等垂直领域的应用规范(如AI辅助意见是否需强制人工审核标注),这将决定多跳检索在高合规行业的部署成本。
- 数据跨境规则:不同司法管辖区间的数据流通规定对多跳检索的云服务架构(如多区域向量数据库部署)有直接影响,需关注相关法规更新和执法案例。
15. 信源
以下为本篇分析引用的主要公开信息来源,按类型分类:
学术与技术基准
- HotpotQA: “HotpotQA: A Dataset for Diverse, Explainable Multi-hop Question Answering” (Yang et al., EMNLP 2018). 官方排行榜 https://hotpotqa.github.io
- MuSiQue: “MuSiQue: Multihop Questions via Single-hop Question Composition” (Trivedi et al., TACL 2022)
- BEIR: “BEIR: A Heterogeneous Benchmark for Zero-shot Evaluation of Information Retrieval Models” (Thakur et al., NeurIPS 2021)
- MTEB: “MTEB: Massive Text Embedding Benchmark” (Muennighoff et al., EACL 2023)
行业与市场报告
- Allied Market Research, “Retrieval-Augmented Generation Market Report,” March 2024
- MarketsandMarkets, “Enterprise Search Market Report,” May 2024
- IDC China, 《中国AI软件及应用市场追踪》, 2024年Q2发布
- Gartner, “Innovation Radar for AI in Financial Services,” Q1 2024
- Forrester, “The Forrester Wave: Enterprise AI Assistants,” Q2 2024
- DB-Engines, Vector Database Management Systems category ranking, accessed July 2024
公司财报与公开披露
- Microsoft FY2024 Q4 Earnings Release and Investor Call Transcript, July 2024
- Alphabet (Google) Q2 2024 Earnings Call Transcript, July 2024
- 阿里巴巴集团2024财年年度报告及2024年5月投资者交流会简报
- 百度集团2024年Q2业绩公告(HKEx: 9888)
- Palantir Technologies Q2 2024 Earnings Release, August 2024
- 第四范式2024年中报(港交所公告)
- Thomson Reuters Q2 2024 Earnings Release, August 2024
- 金山办公2024年半年度业绩报告
公开技术与产品发布
- OpenAI Official Blog, “GPT-4o mini: advancing cost-efficient intelligence,” July 2024
- Anthropic Official Blog, “Claude 3.5 Sonnet,” June 2024
- LangChain Blog, “LangGraph v0.1,” July 2024
- LlamaIndex Blog, “v0.10 Release Notes,” April 2024
- 阿里云AI峰会公开演讲材料, June 2024
- Google I/O 2024 Keynote and Vertex AI Sessions, May 2024
- 百度万象大会2024公开演讲材料
新闻报道
- Bloomberg, “AI Startup Cohere Valued at Over $5 Billion,” July 2024
声明
- 本篇所有市场数据、竞对信息均基于上述截至2024年7月可获取的公开材料。涉及私有公司的收入、估值、市场份额等数据,若无权威第三方审计来源,文中已标注”公开资料未见精确数字”或”为估算口径”。
- 中国市场部分细分数据因缺乏独立权威统计,采用IDC等机构的整体AI市场数据推算该子类的比例区间,当引述时请务必标注数据源和口径。
- 本文旨在提供产业信息与客观分析,不构成任何形式的投资建议、股票推荐或技术选型结论。