RAG
3秒看懂
RAG(检索增强生成)是一种让大语言模型回答问题时先“查资料”再生成答复的技术框架。它通过外部知识检索 + 上下文注入,大幅缓解模型的“幻觉”和知识截止问题,是当前让通用大模型落地到企业私域知识、事实密集型场景的核心方案之一。
3分钟产业解释
传统大语言模型在回答时只依赖其内部参数中存储的“记忆”,存在知识过时、无法覆盖私有数据、容易杜撰事实等弱点。RAG 的思路是:
- 构建外部知识库——将企业文档、网页、数据库等经分块、嵌入(向量化)后存入向量数据库。
- 查询时检索——用户提问被转化为向量,从知识库中召回最相关的若干文档片段。
- 增强生成——将检索到的文本片段与原始问题一起拼装进提示词,交给大模型生成最终答案。
这种模式让大模型由“闭卷考试”变为“开卷考试”,既能保留大模型的推理与表达优势,又能严格基于提供的内容作答,使答案溯源清晰、更新成本低(仅需更新知识库,无需重新训练模型)。 RAG 已广泛应用于智能客服、企业知识库问答、法律/医疗辅助、代码助手中的私有文档查询等场景,并被微软、谷歌、Anthropic 等主流厂商集成进其产品生态。
15分钟专家深入
RAG 并非单一的算法,而是一个高度可配置的系统设计范式,其关键技术维度包括:
1. 索引管道
- 文档解析与分块:解析 PDF、HTML、Markdown 等格式,并按段落、句子或滑动窗口切分成适当大小的片段。分块大小直接影响检索粒度和上下文完整度。
- 嵌入模型选择:使用预训练的文本嵌入模型(如 OpenAI text-embedding-3、BGE、E5 等)将文本片段映射为稠密向量。嵌入模型的质量决定了语义匹配的精度。
- 向量数据库:负责存储向量索引并支持高效的近似最近邻(ANN)搜索(如 HNSW、IVF-PQ 等算法)。主流产品包括 Pinecone、Weaviate、Milvus、Qdrant、Chroma 等。
2. 检索管道
- 查询改写/扩展:对原始用户查询进行拼写纠错、同义词扩展、子问题分解(多步推理),甚至使用 LLM 生成假设答案来提取更好的检索关键词(HyDE 技术)。
- 检索策略:可一次检索(单轮),也可进行多跳检索(基于前一步检索结果调整后续查询)。支持稀疏检索(BM25)与稠密检索结合,形成混合检索,提升召回。
- 重排序(Reranking):用更重的交叉编码器模型对初检片段进行二次排序,筛选最相关的少数片段,平衡召回与精确。
3. 生成管道
- 上下文拼装与引用:将检索片段、用户问题、系统提示模板组织成最终提示,要求模型基于给定内容作答并注明来源。
- 生成控制:可调整温度、top-p 等参数以减少随机性;可要求模型在无法作答时拒绝回答,以降低幻觉。
- 高级模式:支持并行检索、树状检索、自我反思循环(如生成后检查答案是否与检索片段一致,不一致则重新检索/生成)。
4. 训练耦合深度
- 黑盒 RAG:检索器、嵌入模型、生成模型均为固定预训练组件,仅通过提示工程串联。部署快,无训练成本。
- 微调检索器:针对特定领域,用领域内问题-文档对微调嵌入模型或重排序器。
- 联合训练:检索器与生成器一同端到端优化(如 REALM、Atlas),可更深入地学习“检索什么对生成有利”,但工程与算力成本高昂。
- 检索器固定、生成器训练:如 RETRO,检索器为冻结的预训练模型,基于预计算索引,训练期间不更新检索器参数,仅训练生成器通过交叉注意力利用外部知识。该模式避免了同时训练检索器的巨大开销,但需要维护较大规模的静态索引。
5. 评估与监控
- 检索评估:Recall@k、MRR 等,衡量检索器能否找到正确答案所在片段。
- 生成评估:忠实度(答案是否完全基于检索片段)、答案准确率(EM/F1)、幻觉检测。
- 系统质量:端到端延迟、token 消耗、系统稳定性与可观测性。
在实际部署中,架构师需重点权衡检索延迟与召回质量、块大小与上下文长度、模型选择与成本,以及知识库的实时更新机制(增量索引、流式处理)。RAG 已从单轮简单检索发展到具备 agentic 推理能力的复杂系统,成为 LLM 应用架构的事实标准之一。
技术原理(最深)
核心流程(以基础黑盒 RAG 为例):
用户提问
│
▼
查询向量化 ───────► 向量数据库 ANN 检索
│ │
▼ ▼
查询文本 [片段1, 片段2, …, 片段k]
│ │
└────── 拼接 ────────┘
│
▼
提示模板:{系统指令} 上下文:{片段} 问题:{用户提问}
│
▼
大语言模型生成
│
▼
最终答案(含引用来源)
关键机制与参数(定性无精确数据,基于常见实践估算)
- 嵌入维度:通常 768、1024、1536 等,与所选嵌入模型一致。维度越高表达能力越强,但计算和存储开销增大。
- 分块大小:典型范围在 128–1024 tokens 之间。过小会失去上下文连贯性,过大则稀释检索精度并可能超出模型的上下文窗口。常用分块技巧还会加上与前一块的重叠(overlap)以保证边界处的语义完整。
- Top-k 检索:初检通常取 50–200 个候选,经重排序后保留 3–10 个片段送入生成器。数值需针对具体场景做 trade-off:片段越多,上下文越丰富,但可能引入噪声且成本更高。
- 检索算法:近似最近邻(ANN)的主流实现是 HNSW(层级可导航小世界图),在数千万向量级别可提供毫秒级延迟。
- 生成约束:提示中通常明确指令“仅基于提供的上下文回答,如果上下文中没有答案,就说不知道”,以降低幻觉。
- 多步/多跳推理:某些复杂问题需要从检索片段 A 中提取实体,再检索关于该实体的新片段 B,这种迭代架构常见于 ReAct、IRCoT 等。
数学直觉(非严格公式,仅示意)
- 检索分数(余弦相似度等):
score(q, d) = cosine(E_q(q), E_d(d)),其中 E 为嵌入模型。 - 最终生成概率(条件生成):
P(y | x, D_r),其中D_r是检索到的上下文集合,x 是用户问题。 - 朴素 RAG 相当于在推理时提供了一条额外的检索路径,它没有改变模型参数,而是改变了模型的条件分布。
由于无法获取精确的检索结果支持,本部分不给出具体数值下的性能声明,一切量化结论须通过实际场景测试验证。
技术演进史
RAG 的发展轨迹可概括为检索式问答 + 预训练语言模型的深度结合逐步升级的过程:
-
2017~2019:开放域 QA 与稠密检索萌芽 早期神经网络阅读器依赖 TF-IDF 或 BM25 检索,以 DrQA(2017)为代表。随后,稠密段落检索(DPR, 2020)通过双塔模型将问题与文档映射到同一空间做内积匹配,显著提升了开放域问答的检索质量,为后续 RAG 奠定基础。
-
2020:RAG 提出 Lewis 等人(Facebook AI)在论文《Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks》中正式提出 RAG。模型使用 DPR 作为检索器,BART 或 T5 作为生成器,并展示了 RAG-Sequence(检索多个文档后分别计算生成概率再融合)和 RAG-Token(在解码每个 token 时动态选择文档)两种变体,在知识密集型任务上表现优异且参数无需存储全部知识。
-
2020~2021:联合训练与实时检索 REALM(Google, 2020)将检索器与生成器在预训练阶段端到端联合优化,模型学会检索对语言建模最有用的知识。随后,FiD(Fusion-in-Decoder, 2020)将多个检索片段独立编码再到解码器中融合,使 T5 能有效处理大量上下文。
-
2022~2023:大规模检索增强模型 RETRO(DeepMind, 2021)在75亿参数规模上,将外部 2 万亿 tokens 的知识库以分块形式与模型交叉注意力交互,实现了参数减半但性能匹敌更大模型的效果。Atlas(Meta, 2022)进一步探索联合训练和少样本学习。
-
2023 至今:工程化与企业落地爆发 随着 ChatGPT 引爆大模型应用,LangChain、LlamaIndex 等框架将 RAG 抽象为标准化管道,向量数据库如 Pinecone、Weaviate、Milvus 成为基础设施。业界涌现大量 RAG 增强的产品,如 Microsoft 365 Copilot、Perplexity AI。近两年重心转向Agentic RAG(多步检索、工具调用)、多模态 RAG、图+RAG 以及完全离线/边缘部署 RAG。
技术路线对比(量化表)
下表比较不同 RAG 范式,指标采用定性级别(高/中/低)或常见范围,精确数值因实现而异,未获得检索关键数据,故标注“估算”。
| 范式 | 检索器训练 | 生成器耦合 | 检索粒度 | 生成灵活性 | 幻觉控制 | 部署成本 | 典型应用 |
|---|---|---|---|---|---|---|---|
| 黑盒 RAG(无微调) | 预训练固定 | 松耦合 | 文档片段 | 高 | 中(依赖指令) | 低 | 企业知识库客服、原型验证 |
| 领域微调检索器(嵌入+重排序) | 领域微调 | 松耦合 | 片段/句子 | 高 | 较高 | 中 | 医疗、法律等领域专用问答 |
| RAG-Sequence / RAG-Token | 预训练 | 紧耦合(端到端微调) | 文档 | 中(受融合策略影响) | 较高 | 高(需联合训练) | 学术研究、知识密集型 NLG |
| RETRO | 预先构建静态索引 | 紧耦合(交叉注意力) | 分块(约数百字节) | 高 | 较高 | 极高(大规模索引) | 大规模语言建模、代码生成 |
| REALM / Atlas | 联合预训练 | 极紧耦合 | 文档级 | 中 | 较高 | 极高 | 知识密集型预训练 |
| Agentic RAG(多步/自反思) | 通常黑盒检索器 | 松耦合 | 多轮检索片段 | 极高 | 高 | 中高(多轮调用) | 复杂推理、开放式研究 |
说明:
- “幻觉控制”指答案与检索内容的一致性保障程度,耦合越紧、约束越强通常越难偏离检索内容,但也可能牺牲部分创造力。
- 部署成本估算受模型规模、索引规模、联网依赖等影响,未获取量化数据。
上下游
上游核心组件与供给方
- 数据源与处理:企业文档、网页、数据库、知识图谱。ETL 工具(如 Unstructured.io、Apify)负责解析清洗。
- 嵌入模型:OpenAI (text-embedding-3)、Cohere (Embed)、智源 (BGE)、Hugging Face (E5/Instructor) 等。选择影响语义匹配和语言覆盖。
- 向量数据库:Pinecone(全托管、高可用)、Weaviate(具备向量+键值混合搜索)、Milvus(开源,高性能ANN)、Qdrant(Rust实现,高性能)、Chroma(轻量,开发者友好)、Elasticsearch(结合 BM25)。
- 大语言模型:作为生成器,如 GPT-4o、Claude 3、Gemini、Llama 3、Qwen 等。通常通过 API 或本地部署调用。
中间层(编排与框架)
- LangChain / LlamaIndex:提供 RAG 管道抽象,简化索引、检索、提示管理。
- Haystack:基于 pipeline 的 NLP 框架,支持可插拔的检索器和生成器。
- Semantic Kernel / DSPy:更编程化/声明式的 LLM 框架。
下游应用
- 企业知识库问答:内部文档助手,减少员工信息搜寻时间。
- 客服机器人:基于产品手册、知识库实时检索解答。
- 法律/医疗助理:检索相关判例或文献辅助生成建议。
- 代码助手:结合私有代码库或文档回答开发者问题。
- 精准搜索与总结:搜索引擎的生成式结果(如 Bing Chat、Perplexity)。
产业生态特点:上下游高度解耦,创业者可专注某一层(如向量数据库、嵌入模型、RAG 应用平台),技术整合门槛逐年下降。
关键指标
1. 检索质量
- Recall@K:前K个检索结果中包含正确答案的比例。K 通常取 5、10、20。
- Mean Reciprocal Rank (MRR):第一个正确答案的排名的倒数平均。
- NDCG:归一化折损累计增益,考虑排序位置。 这些指标依赖标注数据集,在自建知识库场景需自行构建测试集。
2. 生成质量
- 忠实度:答案是否与检索上下文一致,可用自然语言推理模型或人工评测。
- 答案准确性:Exact Match (EM)、F1 分数,判断答案是否包含正确答案的关键内容。
- 幻觉率:生成内容中无法追溯到检索片段的部分占比,常用人工评估或自动检测工具(如 RAGAS)。
3. 系统性能
- 端到端延迟:从提问到获取完整答案的时间,含检索时间、LLM 推理时间。
- 吞吐量:单位时间可处理的查询数。
- 成本:每次查询的 token 消耗(嵌入 token + 提示上下文 token + 生成 token)及计算费用。
4. 运维指标
- 知识库更新延迟:新文档从上传到可被检索的时间。
- 索引重建/增量更新效率。
- 系统可用性、灾难恢复。
注明:具体基准数据因测试集和实现而异,公开权威对比数据需查阅 TREC、MTEB 等排行榜或厂商披露的案例研究,本文未获取精确检索证据,不提供数字。
供需与市场数据
RAG 市场正处于爆发期,但准确统计市场规模、增长率等量化数据需要引用付费市场研究报告(如 Gartner、MarketsandMarkets 等),本次检索未获取有效信息,因此只做定性判断:
- 需求端:几乎所有部署大模型的企业都面临知识私域化、更新延迟和幻觉问题,RAG 成为事实上的解决方案,企业级需求极为强劲。
- 供给端:向量数据库、嵌入模型、RAG 框架赛道融资频繁,巨头(微软、谷歌、AWS)均已推出相关托管服务,供给快速增加。
- 趋势:RAG 正从“单次检索”向“多步推理+工具调用”进化,推动算力消耗与市场扩大;同时小模型+边缘 RAG 也带来新增长点。
- 制约:高质量数据预处理成本、检索延迟与准确性平衡、安全性(敏感文档权限控制)仍是落地瓶颈。
如需具体市场预测数据,建议查阅权威分析机构的最新报告。
代表公司与资本映射
基础设施层
- 向量数据库:Pinecone(估值约 7.5 亿美元,2023 年 B 轮)、Weaviate(约 5000 万美元融资)、Milvus 背后的 Zilliz(约 1.13 亿美元)、Qdrant(融资 1000 万美元左右)。
- 嵌入模型:OpenAI(嵌入 API)、Cohere(嵌入与重排序 API)、智源研究院(BGE 开源系列)、Jina AI。
平台与框架层
- LangChain(融资超千万美元)和 LlamaIndex(开源项目,公司化运作)是开发者最常使用的编排工具。
- Haystack 由 deepset 支持,也在融资中。
应用层
- 微软:通过 Azure AI Search + OpenAI 将 RAG 深度集成到 Copilot、Bing Chat 等产品。
- Google:Vertex AI Search 与对话机器人结合,Gemini 模型利用 Google 搜索实现 RAG。
- Perplexity AI:以 RAG 驱动的对话式搜索引擎,估值已超 10 亿美元。
- Anthropic:Claude 支持通过工具检索外部文档。
- 其他创业公司:如 Cognition(Devin 代码助手背后也有 RAG 影子)、Quivr、Cognosys 等。
资本映射:资金大量流入向量数据库和 RAG 应用层,反映市场对“让模型更可信”的迫切需求。一级市场标的分散,具体融资数据请以 PitchBook/Crunchbase 为准。
投资逻辑
-
RAG 是 LLM 落地的标配,其价值在于将不确定的幻觉问题转化为可追溯的信息检索,是企业客户买单的关键理由。因此,投资切入方向包括:
- 向量数据库:作为新基础设施,替代传统关键词搜索数据库,壁垒在于性能、规模、生态集成。
- 数据预处理与 ETL:非结构化数据的清洗、分块、多模态处理是瓶颈环节,提供高效工具的公司有溢价空间。
- 垂直领域 RAG 方案:医疗、法律、金融等对安全性和准确性要求极高的领域,需要定制化的检索和合规方案。
- 评估与安全层:检测 RAG 输出忠实度、防止数据泄露的创业公司逐步兴起。
-
风险点:
- 开源框架(LangChain、LlamaIndex)降低了实现门槛,可能导致部分中间层价值被压缩。
- 大模型自身的上下文窗口不断扩大(如 512k 甚至百万 token),有可能在部分场景直接“内化”外部知识,削弱对检索的依赖,但成本、延迟和长期记忆管理的复杂性仍为 RAG 留下空间。
- 巨头(云厂商)提供一站式 RAG 服务,可能挤压独立向量数据库或小厂商的生存空间。
-
价值锚点:关注能显著提升检索质量(召回率、延迟)、降低总拥有成本的差异化技术,以及具备网络效应(如开源社区积累的嵌入模型或评估数据集)的公司。
常见误读纠偏(≥2)
误读 1:RAG 就是简单地给 LLM 拼上一段搜索结果 纠偏:简单的关键词搜索+拼接确实是 RAG 的一种朴素实现,但完整的 RAG 系统包含语义搜索、重排序、动态分块、查询改写、拒绝策略等一系列工程优化。真正的企业级 RAG 更像一个信息检索与生成有机结合的决策系统,而非机械拼接。
误读 2:使用 RAG 后 LLM 就完全不会产生幻觉 纠偏:RAG 可以显著降低幻觉,但无法根除。模型可能忽略或曲解检索内容,当检索到的信息不充分或自相矛盾时,模型仍可能自行“脑补”。因此,高要求场景还需配合人工审核、自动化事实核查,甚至采用“逐句勾稽溯源”的后处理。
额外误读:认为 RAG 与微调(Fine-tuning)是对立选择。实际上,两者可以互补:微调教会模型领域术语和表达风格,RAG 提供事实性和实时知识,许多优秀实践是将微调模型作为生成器嵌入 RAG 管道。
学习路径
- 入门:阅读 LangChain 或 LlamaIndex 的官方文档,跟随 Quickstart 搭建一个简单的 PDF 问答机器人。
- 核心论文:
- Lewis et al., “Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks” (2020)
- Karpukhin et al., “Dense Passage Retrieval for Open-Domain Question Answering” (2020)
- Guu et al., “REALM: Retrieval-Augmented Language Model Pre-Training” (2020)
- Borgeaud et al., “Improving language models by retrieving from trillions of tokens” (RETRO, 2021)
- 进阶实践:
- 学习向量数据库的原理和选型(对比 Qdrant, Weaviate, Milvus)。
- 尝试高级检索技巧:HyDE、多跳检索、上下文压缩。
- 使用 RAGAS 或 TruLens 评估你的 RAG 系统。
- 深入架构:
- 阅读 Haystack 的 Pipeline 设计、Semantic Kernel 的 Agent 集成。
- 研究 FiD、Atlas 的融合解码机制。
- 社区与资讯:关注 r/LocalLLaMA、LangChain Discord、向量数据库公司的技术博客,以及多位 AI 研究者的推特。
一句话总结
RAG 通过“先检索、后生成”让大模型拥有可更新、可追溯、可控的外部记忆,是弥合通用智能与领域事实鸿沟的关键工程方案。
延伸阅读与来源
本页内容基于作者对 RAG 领域公开论文、开源框架文档、产业报道的积累撰写,但受限于本次检索未获取外部链接,无法提供精确的检索来源。 以下为建议阅读的权威资源(可自行搜索获取):
- 论文:Lewis et al. (2020) “Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks”
- 论文:Karpukhin et al. (2020) “Dense Passage Retrieval for Open-Domain Question Answering”
- LangChain 官方文档:https://docs.langchain.com
- LlamaIndex 文档:https://docs.llamaindex.ai
- 向量数据库对比:各大数据库的官方基准测试
- 2024 年 RAG 全景图:首推 a16z 等机构的分析文章
免责:文中任何涉及具体性能数字、市场规模、融资额的部分,若无明确标注来源,均为基于行业常识的趋势性描述或范围估算,请读者查阅一手资料核实。