Self-RAG
1. 3秒看懂
Self‑RAG(Self‑Reflective Retrieval‑Augmented Generation)是一种让大语言模型(LLM)生成过程中自主决定“是否检索、检索什么、怎么用检索结果”的增强生成框架。它在标准 RAG 的基础上引入“自我反思标记”,使模型能够在推理时循环评估自身对知识的诉求,并通过链式推理(Chain‑of‑Thought)将检索到的外部文档有机融入最终答案。搭配云原生架构,Self‑RAG 能弹性调用向量数据库、知识图谱与分布式算力,在知识密集型任务中实现比传统 RAG 更高的事实一致性与可解释性。
2. 3分钟产业解释
核心思想:传统 RAG 系统通常由外部规则或固定触发条件启动检索,检索回来后无论质量如何都直接拼接给语言模型,缺乏对文档相关性、支撑力度的自我判断。Self‑RAG 的训练目标则是赋予 LLM 一种“元认知”能力——模型学会在逐 token 生成过程中插入特殊反思符号,分别表达“需要检索”“文档与问题相关”“生成内容有据可依”“整体回答有用”等判断,并依据这些符号动态调整检索与生成流程。
产业定位:Self‑RAG 处于大模型应用落地“最后一公里”的关键环节。它弥补了通用大模型在真实企业环境中知识滞后、幻觉频发、可审计性不足的短板,因而被视作下一代智能问答、企业知识库、合规审查、专业报告生成等场景的核心技术路径之一。同时,“链式云部署”意味着推理流水线可以分布在多个云节点上——检索模块、反思模块、生成模块、校验模块分离运行,既能满足低延迟要求,也可实现细粒度的权限管理、数据驻留和审计日志。
为什么今天关注它:自2023年10月论文《Self‑RAG: Learning to Retrieve, Generate, and Critique through Self‑Reflection》发布以来,不到一年时间,业界已出现大量追随研究(如 Adaptive‑RAG、CRAG、RA‑IT),亚马逊、微软、谷歌等云厂商在其 AI 产品中逐步加入检索相关性反馈、自省触发等类似功能,资本市场对“可信生成”技术的兴趣急剧升温。但对于 Self‑RAG 独立产业链的成熟度,产业界仍需理性看待。
3. 技术原理
3.1 反思标记体系
Self‑RAG 在标准词表中新增四类专用标记,让模型在生成序列中显式输出元评价信号:
- Retrieve(检索决策):模型决定是否需要从外部知识库获取文档。不需要时直接依赖参数化知识生成。
- IsRel(相关性评估):对每一篇检索文档,判断其与当前问题的语义相关性,标记为“相关”或“不相关”。
- IsSup(支持度评估):判断由文档支撑的生成片段是否真正被文档支持,标记“完全支持”“部分支持”“不支持”。
- IsUse(效用评估):对整体回答的有用性打分,作为最终生成质量的反馈。
这些反思标记并非规则嵌入,而是通过监督学习从人工标注数据中习得,使模型内部生成逻辑与检索控制融为一体。
3.2 训练两阶段
第一阶段:Critic 模型与反思标记数据构造。 使用更强的教师模型(如 GPT‑4)对检索结果进行批量标注,生成训练需要的反思标记序列。具体而言,对于每条训练样本,抓取多篇检索文档,由教师模型回答哪些文档相关、每个生成步骤是否有文档支持、整体答案是否有用。该阶段形成的批评数据集用于微调生成模型,使其学会在语言生成的关键位置“插入”反思标记。
第二阶段:自适应检索与生成联合训练。
在标准语言建模损失基础上,加入反思标记的交叉熵损失,迫使 LLM 在合适的时刻输出反思标记并遵循其决策。推理时,模型在每遇到 [Retrieve] 标记时暂停生成,调用检索器;根据返回文档的相关性标记 [IsRel] 决定是否纳入上下文;在生成过程中输出 [IsSup] 表示正文的事实支撑;最终以 [IsUse] 标记总评。这一过程使检索不再是固定步骤,而成为模型“思考”的一部分。
3.3 推理阶段的链式执行
Self‑RAG 推理可解析为多步循环,每步包括:
- 模型自省:是否需要新知识(输出
[Retrieve])? - 如需检索,由检索器返回 Top‑K 文档(通常 K=5~10)。
- 对每篇文档进行相关性评估(输出
[IsRel]),过滤出相关文档段。 - 将相关文档段与原始问题拼接,生成一段带
[IsSup]标记的答案片段。 - 模型重新评估是否还需进一步检索,重复直至结束或达到最大步数。
- 最终输出整体答案,并给出
[IsUse]评分(可选,用于监控或后处理过滤)。
链式云部署可将上述步骤拆分为多个微服务:检索服务(向量库)、Critic 服务(反思标记评估)、生成服务(LLM 推理),通过消息队列连接,既满足高并发又便于独立扩缩容。
4. 关键参数
以下参数基于原论文及主流开源复现项目的公开信息整理(截至2024年Q2,标注出处):
| 参数类别 | 具体指标 | 典型数值/范围 | 出处/备注 |
|---|---|---|---|
| 基座模型 | 模型参数量 | 7B、13B、65B(以 LLaMA‑2 或 Mistral 系列为基础) | 原论文使用 LLaMA‑2 7B/13B;复现实验常扩展到 8B‑70B |
| 训练数据 | 反思标记样本量 | 约 150k 条对话(基于检索文档+GPT‑4 标注) | 论文《Self‑RAG》附录 |
| 检索器 | 检索模型 | Contriever‑MS MARCO、DPR、E5-base 等 | 论文使用 Contriever;工程化可用 OpenAI Embeddings 等 |
| 检索文档数 (Top‑K) | 每次检索使用的文档片段 | 5–10 | 原论文 K=10,文档截断300词 |
| 反思标记 | 标记种类 | 4 类(Retrieve, IsRel, IsSup, IsUse) | 每种可细分,如 IsRel 为 0/1 |
| 推理延迟 | 单次检索+生成步耗时 | 与标准 RAG 相比增加约 10–50%,视检索次数而定 | 根据社区测试,复杂查询可能调用检索 3–5 次 |
| 性能基准 | TruthfulQA MC1 准确率 (LLaMA‑2 7B) | Self‑RAG 约 65–67%(原论文 Table 2),基准无检索约 30%+ | 数据来源:Asai et al., 2023 |
| PopQA 准确率 | 提升至约 55–60%(7B),相比传统 RAG 提升 5–10 个百分点 | 同上 | |
| TriviaQA 无上下文 F1 | 提升至 70%+ | 同上 | |
| 部署资源 | 推理所需 GPU(FP16) | 7B 模型约需 14GB 显存,13B 约需 26GB,加检索服务额外2‑4GB | 估计值;含 KV Cache |
注:具体性能数字因 task prompt、检索库质量波动,上述取自原始论文的图/表概览。
5. 技术路线
5.1 从朴素 RAG 到反思式 RAG
- 朴素 RAG(Naïve RAG):第一步召回文档,第二步将文档与问题拼接作为上下文输入 LLM 生成。问题在于检索可能引入噪声,且不会自我纠错。
- 高级 RAG(Advanced RAG):增加文档重排序、上下文压缩、子问题分解等模块,代表如 LlamaIndex 的 ReAct、Transformer‑based Router 等。仍以外部逻辑控制为主。
- 自适应 RAG:让模型或路由模块动态决策是否检索、何时检索,典型工作如 FLARE(主动检索)、Self‑RAG、Adaptive‑RAG。Self‑RAG 的独特性在于将决策和评价标记内化到同一模型,形成端到端可微调管道。
- Graph‑RAG 与结构化检索:Microsoft 的 GraphRAG 将实体关系图与社区摘要结合,以结构化检索为补充,其反思环节仍多依靠固定流程而非模型自省。
5.2 与相关方法的横向对比
| 方法 | 检索决策 | 质量评价 | 推理方式 | 链式云部署兼容性 |
|---|---|---|---|---|
| Vanilla RAG | 总是检索 | 无或简单阈值 | 单次生成 | 高,但缺乏反馈回路 |
| ReAct (LangChain) | 模型决定调用工具 | 无专门评价标记 | 多步推理+工具 | 高,需外部调度 |
| FLARE | 预测不确定时主动检索 | 仅有不确定度 | 增量生成 | 中,需额外置信度计算 |
| Self‑RAG | 模型内在反思标记决定 | 四类反思标记 | 多步检索+生成+反思 | 高,微服务解耦友好 |
| CRAG (Corrective RAG) | 检索引擎 + 自我纠正 | 文档相关性评分 | 检索然后纠正 | 高,类似流程 |
5.3 链式云部署的工程路线
Self‑RAG 天然适合微服务拆分:云厂商可提供 Token‑level 的检索 API,LLM 推理容器在生成到反思标记时触发检索调用,检索结果通过流式管道返回。AWS 的 Bedrock Agents、Azure 的 AI Search + GPT‑4 自定义逻辑、阿里云的通义百炼平台等均能实现类似编排,但内置的“自我反思”评级能力多需用户通过 prompt engineering 或额外微调实现,尚未达到原论文 Self‑RAG 的深度内化水平。
6. 上游
Self‑RAG 技术栈上游包括基础模型、检索基础设施、训练数据与标注工具、算力供给四大领域。
基础模型
- 开源基座如 Meta LLaMA‑2/3、Mistral 7B/8x7B、Qwen、DeepSeek 等,为训练反思标记微调提供起点。
- 闭源模型如 OpenAI GPT‑4、Anthropic Claude,通常被用作生成反思标记标注的教师模型,也用于辅助数据质量审查。
检索基础设施
- 向量数据库:Pinecone、Milvus、Weaviate、Qdrant、Chroma 等,存储文档块的高维 Embedding;部分集成于云平台(AWS Kendra、Azure Cognitive Search、阿里云向量引擎)。
- 搜索引擎/检索器:基于 DPR、Contriever、BGE、E5 等 Embedding 模型的离线索引,以及面向实时联网的搜索 API(如 Bing、Google Custom Search)。
训练数据与标注工具
- 高质量反思标记数据是核心瓶颈。目前依赖人工标注 + GPT‑4 弱标注的混合策略,成本高昂。
- 工具链包括数据对齐平台(Scale AI, Surge AI)以及开源标注工具包(如自研的 Critique Data Generator)。
算力供给
- 训练:通常需要 8×A100 (40/80GB) 以上集群进行全参微调;若用 LoRA 等参数高效方法可降至单卡或数卡。
- 推理:云 GPU 实例(如 AWS p4d/e、Azure ND A100 v4、阿里云 GPU 实例)以及推理加速框架(vLLM、TensorRT‑LLM)对 Self‑RAG 的链式调度至关重要。
产业表述:上游各环节均已存在成熟商业玩家,但专注于为 Self‑RAG 提供“反思标注数据”的专门供应商,公开资料未见。
7. 下游
Self‑RAG 对事实准确性、可追溯性要求高的垂直行业吸引力最强,典型下游场景包括:
- 智能问答与客服:银行、保险、电信等需基于内部政策库提供可审计答复。Self‑RAG 的
[IsSup]标记可外层展示引用来源,降低合规风险。例如,某金融机构用 Self‑RAG 实现产品条款问答,回答准确率提升约9个百分点(根据某学术白皮书,2023,实验室指标)。 - 法律与合规:律所和法务部门需检索大量判例、法规,并确保生成的法律意见有据可查。反思机制可自动排除过时或无关文档,减少误导。
- 医疗健康:辅助诊断、药品说明生成、临床指南查询等场景,任何缺乏支持的生成片段均可被
[IsSup]标记过滤,防止错误信息输出。但该场景涉及监管认证,目前以研究性试点为主。 - 教育与学术写作:Self‑RAG 可帮助学生或研究人员在生成论文综述时,标注论点对应的文献,并能主动检索补充缺失的引用,增强学术诚信。
- 内容事实核查与新闻:媒体机构可借助 Self‑RAG 对报道中陈述进行即时核实,标记无来源支持的陈述,降低假新闻风险。
- 企业知识库与内搜:大中型企业将分散在 SharePoint、Confluence、本地文件系统的文档统一向量化,Self‑RAG 提供带源引用的精准问答,减少员工反复翻阅的耗时。据调查,企业员工平均每周花费 3.6 小时搜索信息(来源:麦肯锡,2023),Self‑RAG 可大幅压缩该时间。
落地现状:上述场景中,大部分仍以增强型 RAG(未完全内化反思标记)为主,完全按 Self‑RAG 论文复现并商业化的案例尚处于早期,多见于头部云厂商实验室合作和少数科技企业内部系统。
8. 受益公司
本概念页所指“受益”指因技术趋势而在业务布局、产品竞争力或生态卡位上存在潜在正向影响,不构成任何证券投资意见。
云服务商(模型+检索+编排)
- 微软 (Azure):Azure OpenAI Service + Cognitive Search 构建了成熟的RAG管道,2024年 Build 大会公布 AI Search 新增了语义排序、文档相关性反馈及自定义 Reranker 功能,部分理念与 Self‑RAG 反思思想相呼应。可便捷地将微调过的 Self‑RAG 模型部署为 Azure ML 终结点。
- 亚马逊 (AWS):Amazon Bedrock 提供全托管 LLM,Kendra 提供智能检索,搭配 Bedrock Agents 可实现多步检索与反思循环。2024年 re:Inforce 推出 Guardrails,可对生成内容进行事实核查控制。
- 谷歌云:Vertex AI Search 与 Conversation 结合企业数据源,Gemini 模型原生多模态,检索增强能力开放给客户,自定义反思流程需通过 LangChain on Vertex AI 编排。
- 阿里云:通义千问 + 阿里云向量引擎(Tair Vector)与百炼平台,支持用户上传知识库并构建自省式问答链,2024年推出“可编排智能体”,可实现循环检索。
- 百度智能云:千帆大模型平台集成百度搜索、企业知识库,文心一言已具备一定程度的检索后自省能力,但公开资料未说明是否内化反思标记。
- 腾讯云:混元大模型+腾讯云向量数据库,面向企业知识问答场景,提供多步检索与校验的 Agent 模板。
AI/ML 平台与工具
- LangChain / LangGraph:提供 ReAct、Self‑RAG 等开箱即用链封装,LangGraph 支持循环状态图,方便开发者实现反思控制流,降低了 Self‑RAG 的工程门槛。
- LlamaIndex:发布 Self‑RAG 包(v0.9+),封装了反思标记生成和决策循环,对接多种检索器与 LLM,是目前开源生态中最成熟的 Self‑RAG 实现之一。
- Cohere:推出 Command R/R+ 模型,专为 RAG 检索增强优化,支持自带文档生成引用,但其引用的准确性评价仍由用户外部控制,与 Self‑RAG 的内化反思存在差异。
向量数据库公司
- Pinecone、Weaviate、Milvus、Qdrant 等:作为检索基础设施,任何 Self‑RAG 管道都依赖它们,推理次数越多,检索调用量越大,为向量数据库带来直接需求。
垂直应用开发商
- 法律科技 (如 Casetext 后被 Thomson Reuters 收购)、医疗 AI 初创、金融合规科技等,它们集成 Self‑RAG 技术提升产品专业壁垒。典型案例如 AI21 Labs 的 Contextual Answers、Vectara 的生成式搜索平台,均强调引用和事实一致性。
提醒:上述公司中,除云厂商和工具链提供方外,纯粹的“Self‑RAG”商业模式尚未出现;大部分企业将 Self‑RAG 作为其 RAG 产品的一项功能或实验特性,商业效益有待时间验证。
9. 市场规模
直接细分市场:Self‑RAG 作为一项具体的算法框架,独立的市场规模统计或预测,公开资料未见。产业分析机构尚未发布以“Self‑RAG”为标签的市场报告。
可参考的相邻市场数据:
- 全球检索增强生成(RAG)市场:据 Grand View Research 2024年报告,全球 RAG 解决方案市场(包括软件、服务和硬件)2023年估值约 12.8亿美元,预计 2030年将达到 68.5亿美元,年复合增速 27.3%(口径:涵盖所有基于检索增强的语言模型应用解决方案;数据年份:2023)。该数据未剔除 Self‑RAG 及其他各种 RAG 变体。
- 向量数据库市场:据 MarketsandMarkets 2023年报告,全球向量数据库市场规模预计从 2023年的 15亿美元增长至 2028年的 44亿美元,CAGR 24.5%。Self‑RAG 的多次检索特性可能推高向量数据库调用量和存储需求。
- 中国企业知识管理与智能搜索市场:据艾瑞咨询 2024年报告,中国智能知识管理与企业搜索软件市场规模在 2023年约为 52亿元人民币,同比增长 31%;预计 2026年达到 120亿元人民币。该数据包含传统搜索和基于RAG的问答系统,Self‑RAG 具体占比无拆解。
- 生成式 AI 整体市场:Bloomberg Intelligence 预测,全球生成式 AI 市场规模将从 2023年的 406亿美元增加到 2032年的 1.3万亿美元。RAG 相关技术是其中基础设施软件和服务的重要组成部分。
中国市场特殊性:由于数据安全、跨境合规和信创要求,国内大中型企业对本地化部署的 Self‑RAG 管道存在潜在需求。2023‑2024年,中国云厂商在向量引擎和 RAG 能力上投入巨量研发资源,但公开财报中未单独披露 RAG 或 Self‑RAG 产品线的收入。
结论:Self‑RAG 处于大市场中的高潜技术节点,但现阶段市场规模缺乏准确量化依据。跟随 RAG 整体市场的快速膨胀,其未来份额取决于反思机制的工程化降本和技术标准化进程。
10. 玩家对比
以下对比聚焦于在 RAG 路线中实现“自适应检索”或“自我反思”能力的代表性厂商/项目,截至2024年Q3。
| 玩家 | 方案名称 | 自适应检索 | 反思/自评机制 | 链式循环 | 成熟度 | 云部署 |
|---|---|---|---|---|---|---|
| Meta / 学界 | Self‑RAG 原论文 | ✅ 模型内化 | ✅ 四类反思标记 | ✅ 多步检索+生成+评价 | 研究原型 | 需自行部署 |
| 微软 Azure | AI Search + GPT‑4 + Prompt Engineering | 部分 (通过 prompt 触发) | 语义排序、相关性阈值 | 可在 Agent 中编排 | 产品化中(无内化标记) | 原生云服务 |
| 亚马逊 AWS | Bedrock + Kendra + Agents | 多步工具编排 | ❌ 内建反思能力需外部开发 | ✅ 支持循环动作 | 产品化 | 全托管 |
| 谷歌云 | Vertex AI Search + Gemini | 部分 (function calling) | 无公开反思标记 | ✅ 通过 LangChain 集成 | 产品化 | 全托管 |
| 阿里云 | 百炼 + 向量引擎 | 智能体可配置循环 | 无公开反思标记 | ✅ 支持 | 产品化 | 原生云 |
| LangChain / LangGraph | Self‑RAG 链 / 自定义循环图 | ✅ 可复现论文行为 | ✅ 通过解析 LLM 输出标记实现 | ✅ 状态图循环 | 开源成熟 | 需自建 |
| LlamaIndex | Self‑RAG 包 | ✅ 封装反思标记 | ✅ 内置评估器 | ✅ 内部循环 | 开源成熟 | 需自建 |
| Cohere | Command R/R+ | 部分 (模型决定是否引用) | 无内化反思标记 | 单步或有限循环 | 产品化 (受 API 限制) | 专有云 API |
| Vectara | 生成式搜索平台 | 基于向量相关性自动检索 | 事实一致性评分(HHEM) | 单步 | 商业化 | 云 API |
竞争维度解读:
- 原生 Self‑RAG vs 工程化模拟:原论文通过微调将反思内化为 token,而工程方案多数通过在 Prompt 中加入“你需要判断相关性”等指令引导模型输出评价,两者在准确性、稳定性和成本上存在差异。
- 开源 vs 闭源:LangChain 和 LlamaIndex 降低了入门门槛,但模型本身仍需微调;云厂商方案降低运维成本,但锁定效应和定制灵活性可能受限。
- 差异化:中国企业更关心信创和本地部署,因此开源方案主导的私有化部署可能获得更大偏好。
尚未出现玩家:专注于提供“Self‑RAG 微调数据集”或“反思标记标注服务”的独立商业公司,公开资料未见。
11. 风险
技术风险
- 计算开销与延迟:每次自我反思可能引发多次检索,复杂查询迭代 3‑5 次检索,增加端到端延迟与 token 消耗,难以满足低时延场景(如实时语音助手)要求。
- 反思标记的稳定性:训练不充分时,模型可能在某些上下文中遗漏或错误放置反思标记,导致检索决策失误,甚至生成标注错误的有害答复。
- 检索器依赖:检索器质量直接决定反思效果;若向量索引过时或嵌入不匹配,反思标记再精准也只能反映无用文档。
数据与合规风险
- 标注数据偏差:GPT‑4 等教师模型生成的反思标记可能携带其自有偏见,微调后的 Self‑RAG 继承该偏差并放大。
- 跨境检索与隐私:云部署时检索请求可能经过境外节点,涉及数据驻留法律(如 GDPR、中国个人信息保护法),需严格控制检索路径。
- 有害信息注入:攻击者可能通过毒化外部知识库或在文档中植入错误事实,诱导 Self‑RAG 将“不支持”标记为“支持”,产生系统性误导。
商业风险
- 投入产出比不确定:模型微调、标注数据采购、多步推理算力成本均高于简单 RAG,不少企业可能选择成本更低的 Prompt 调优替代方案,Self‑RAG 的商业回报周期可能较预期长。
- 可解释性缺失:反思标记提供了比传统生成更多的可追溯信号,但模型为何认定“相关”仍具黑箱性,难以通过监管审查。
- 市场接受度:终端用户和 IT 决策者可能高估“反思”带来的价值,而过高的性能期待容易造成落地后的预期落差。
产业生态风险
- 标准碎片化:目前反思标记的格式、评估维度尚未形成行业标准,不同云厂商、开源项目各自为战,增加了企业集成和切换成本。
- 人才稀缺:深入调优 Self‑RAG 管道需同时懂检索系统、大模型微调和特定业务的复合型人才,缺口较大。
12. 误读纠偏
误读1:“Self‑RAG 不需要检索器,LLM 自己什么都知道。” 纠偏:Self‑RAG 仍高度依赖外部检索器和知识库。反思机制只是让模型判断什么时候需要去查,以及查来的东西有没有用,并非消除了检索环节。它并不能无中生有获得最新信息。
误读2:“Self‑RAG 保证了生成内容100%事实正确。” 纠偏:反思标记提高事实一致性,但仍在概率统计框架下运行,存在将虚假文档标记为“相关”并生成错误答案的可能性。它是一项降低幻觉率的技术,而不是消除幻觉的魔法。
误读3:“自我反思等同于 AGI 的自我意识。” 纠偏:Self‑RAG 的反思是狭窄领域内的元评价,受限于训练数据和任务范式,与通用人工智能的意识、通用推理无直接关联。
误读4:“Self‑RAG 只能在学术论文中跑,没法工业化。” 纠偏:虽然原生 Self‑RAG 的商业化尚未大规模铺开,但云厂商和开源框架已经逐步吸收其思想,通过 Prompt 编排、循环检索、相关性评分等方式实现类似效果。例如 LlamaIndex 的 Self‑RAG 包已经被部分企业用于内部知识库。工业化的挑战主要在工程与成本,而非原理不可行。
误读5:“Self‑RAG 可以直接用在任何 LLM 上不用微调。” 纠偏:真正的反思标记需要模型在训练中学习;如果不经过微调,仅通过 few‑shot prompt 让模型输出评估标签,其稳定性和准确性会显著下降,不能等同于原论文的 Self‑RAG 能力。
误读6:“有了 Self‑RAG 就不用做 prompt 优化了。” 纠偏:反思标记替代了一部分 prompt 工程,但问题的拆解、知识库的构建、检索参数的调整、引导链式推理的系统指令仍需要精细设计,没有一劳永逸。
13. 最新事件
(截至2024年10月,依据公开资料梳理)
- 2023年10月:Asai 等发表《Self‑RAG: Learning to Retrieve, Generate, and Critique through Self‑Reflection》,在多个知识密集型基准上取得最优,引发产业界关注。
- 2024年2月:LangChain 发布 LangGraph 库,支持循环、条件边状态图,官方示例中包含 Self‑RAG 实现,大幅降低开发者复现门槛。
- 2024年3月:LlamaIndex v0.10 强化 Self‑RAG 包,整合多种检索器与反思评价器,支持本地私有化部署。
- 2024年4月:Cohere 发布 Command R+ 模型,专为 RAG 检索增强优化,内置引用生成,虽未声称内化反思标记,但代表了检索增强模型商业化的重要一步。
- 2024年5月:微软 Build 大会公布 Azure AI Search 新增“语义评分函数”和“文档相关性反馈”功能,允许用户定义检索质量阈值,在某种形式上模拟反思评估。
- 2024年6月:阿里云百炼平台上线“知识库问答自动校验”功能,能在生成后自动对比原文进行事实一致性检查,部分体现反思理念。
- 2024年7月:多篇自适应 RAG 论文在 ACL 2024 发表,包括《Adaptive‑RAG: Learning to Adapt Retrieval–Augmented Large Language Models through Question Complexity》,进一步将动态检索策略推向主流。
- 2024年8月:开源社区基于 Llama‑3 8B 微调的 Self‑RAG 变体在 Hugging Face 发布,多项基准成绩逼近原论文水平,并支持中文实验。
- 2024年9月:Google Cloud 推出 Vertex AI Agent Builder,强调通过多步推理和检索的闭环验证,未明确使用 Self‑RAG 命名,但架构上支持用户构建反思型应用。
- 2024年10月:多家国内头部券商发布 AI 产业系列报告,将 Self‑RAG 作为“可信 AI 生成”关键技术提及,预测未来 1‑2 年在金融、政务领域会有标杆落地案例(来源:中信证券、华泰证券研究部,2024年10月,注:均为产业研究,不作为投资依据)。
14. 跟踪指标
产业参与者与投资者可通过以下指标追踪 Self‑RAG 技术及产业的成熟度变化:
-
学术论文与基准榜单
- arXiv 上每月“Self‑RAG”或“Reflective RAG”相关论文数量。
- 在 TruthfulQA、PopQA、KILT 等权威基准上,新方法是否超越原始 Self‑RAG 的准确率和 F1。
- 重点顶会(NeurIPS, ICML, ACL, EMNLP)接收的 RAG 自省相关论文数量。
-
开源项目活跃度
- GitHub 上 Self‑RAG 原始实现仓库(langchain