模型层 开放阅读

ReAct

Reason + Act

概念 ID
reason-act
更新时间
2026-05-29
来源数量
待补

ReAct

1. 3 秒看懂

ReAct(Reason + Act)是一套提示框架,引导大语言模型在回答复杂问题时,反复交替执行“推理(Thought)→行动(Action)→观察(Observation)”循环。模型像人类专家一样:先想一步、再调用搜索、计算器等外部工具,根据工具返回的真实信息继续思考,最终给出有据可查、可追溯的答案。它不改变模型权重,完全依靠上下文学习,是当前 AI Agent 的核心控制逻辑。

2. 3 分钟产业解释

传统大模型仅依赖静态训练数据生成答案,容易产生“幻觉”或使用过时知识。ReAct 把模型的内部推理过程和工具调用记录为一条完整的、可公开查阅的思维链。这样,模型就能主动查询实时搜索引擎、调用计算器、检索企业数据库或代码解释器,将内部推理与外部真实信息持续对齐。
在 ChatGPT 插件、LangChain Agent、AutoGPT、MetaGPT 等现象级产品背后,ReAct 或其变体是让模型“动手又动脑”的关键机制。它不仅将复杂问答、事实核查、多步决策等任务的成功率显著推高,还让模型行为变得透明、可调试、可审计——每一步的思考与动作都被记录下来,为企业级合规与风控提供了基础。
随着 OpenAI、Anthropic、Google 等先后推出原生 function calling / tool use 能力,以及微软、AWS 将智能体能力融入办公与云平台,ReAct 范式已从学术论文快速演进为产业标准件。

3. 技术原理

核心循环机制

ReAct 系统维持一个动态扩展的上下文窗口,累积所有历史 Thought / Action / Observation 三元组。每一轮,大语言模型都基于当前上下文预测下一段内容,直至输出完成信号。典型循环可用如下伪代码表示:

while True:
    llm_output = llm.generate(context)
    parse thought, action, action_input from llm_output
    context.append(f"Thought: {thought}")
    context.append(f"Action: {action}[{action_input}]")
    if action == "Finish":
        return action_input   # 最终答案
    else:
        observation = environment.step(action, action_input)
        context.append(f"Observation: {observation}")

动作空间通常限定为可解析的有限集合,例如:

  • Search[query]:调用搜索引擎并返回摘要
  • Lookup[keyword]:在已检索文档中定位具体段落
  • Math[expression]:执行数值计算
  • SQL[query]:查询数据库
  • Finish[answer]:结束任务并输出最终答案

实际实现中,ThoughtAction 往往在同一次模型生成中产出,由特定分隔符或解析器自动拆分,保证程序可稳定提取。

协同机制:推理辅助行动,行动反哺推理

  • 推理辅助行动:模型在准备执行“搜索”时,先在思考中明确“需要查什么关键词”,从而提升工具调用的精准度。
  • 行动反哺推理:从外部环境(搜索引擎、知识库、代码解释器等)返回的观察结果,可纠正模型内部知识的谬误或填补信息空白,使后续推理建立在事实基础上,有效抑制幻觉。

以下为信息‑行动‑推理的耦合示意:

        ┌──────────────┐
        │  User Query  │
        └──────┬───────┘
               v
┌─────────────────────────────────┐
│  Thought: "需要查当前汇率"     │
│  Action:  Search[USD CNY]      │
└──────────────┬──────────────────┘
               v
┌─────────────────────────────────┐
│  Observation: "1 USD ≈ 7.2 CNY"│
└──────────────┬──────────────────┘
               v
┌─────────────────────────────────┐
│  Thought: "现在计算 100 USD"    │
│  Action:  Math[100 * 7.2]       │
└──────────────┬──────────────────┘
               v
       ┌──────────────┐
       │ Observation: │
       │   720        │
       └──────┬───────┘
              v
┌─────────────────────────────────┐
│ Thought: "答案是720 CNY"       │
│ Action:  Finish[720 CNY]        │
└─────────────────────────────────┘

与底层模型的关系

ReAct 完全依赖提示工程激发 LLM 的上下文学习(in-context learning)能力,不修改模型权重。因此,其表现上限受制于基础模型的推理能力与指令跟随能力。代码预训练较强或经过高质量指令微调的模型(如 GPT‑4o、Claude 3.5 Sonnet、Gemini 1.5 Pro 等)能更稳定地执行 ReAct 提示。同时,支持更长上下文的模型可容纳更丰富的工具返回内容与多轮历史,进一步增强复杂任务的处理能力。

4. 关键参数

ReAct 系统的行为稳定性与任务成功率高度依赖以下参数设计,工程落地时需要细致调优:

  • 最大推理步数(Max Steps):通常设为 5~15 步。步数过低可能无法完成复杂多步任务,过高则增加延迟与 API 费用,且易陷入循环。
  • Few‑shot 示例数量与组成:提示词中提供 6~10 个精心设计的示例,覆盖不同工具组合、异常处理(如搜索无结果时切换关键词、调整策略)。示例质量直接影响模型对格式和策略的学习。
  • 观察截断长度:搜索引擎或数据库返回的文本可能极长,需按字数(如 500~2000 字符)截断或使用重排序保留最相关片段,避免挤占上下文窗口,同时保证信息完整度。
  • 动作/思考解析格式:必须定义严格且鲁棒的解析器(例如基于正则表达式或特定 JSON schema),确保 Thought:Action: 字段可被程序可靠捕获,否则循环将中断。
  • 工具超时与重试机制:外部 API 可能出现超时或错误,需设置合理的超时(如 515 秒)与重试次数(通常 13 次),并让模型根据异常观察调整动作。
  • 模型温度与采样策略:较低的 temperature(如 0~0.3)有助于生成更确定、符合格式的思考与动作;过高的随机性可能导致解析失败或逻辑漂移。
  • 上下文窗口管理:随着循环进行,历史对话快速累积,需预留足够空间给最新工具返回结果,必要时可裁剪较早的观察但保留 Thought 摘要。

这些参数共同决定了 ReAct 系统的可信度、响应延迟和运营成本,是产业化的核心优化空间。

5. 技术路线

主要方案对比

方法是否生成推理是否调用外部工具决策机制透明度典型表现主要局限
Chain‑of‑Thought (CoT)是(纯推理)仅生成文本无外部知识时瓶颈明显容易产生幻觉或依赖过时信息
Self‑Ask是(子问题)否(可搭配搜索)分步自问自答结构清晰,但缺乏实时事实源无法主动获取新信息
Toolformer (微调)否(隐式)是(通过特殊令牌)端到端决定调用高效,但时机与方式不透明失去可解释推理链
ReAct (提示)是(显式思维链)是(显式动作)思维引导动作,观察反馈思维在事实核查、多步搜索任务中达SOTA级表现;可追溯对底层LLM指令跟随和推理能力要求高;多步延迟较高
Reflexion / Self‑Refine是(包含反思)评价之前输出并修正在长期任务中自愈能力增强步数更多,成本增加
AutoGPT / BabyAGI 类是(通常)是(丰富工具集)自主规划、执行、评估开放域自主性强稳定性差,易陷入无限循环或目标漂移

注:典型表现基于已发表文献的定性结论,具体数值请参阅原论文;性能指标受模型版本、任务设定影响,无统一硬性数字。

产业演进与融合

2023 年以来,OpenAI 推出的 function calling 与 Assistants API,以及 Anthropic 的 tool use 功能,在底层格式上未强制要求显式推理文本,但其“模型自主决定调用哪个函数/工具、传递什么参数,并基于返回结果继续生成”的范式与 ReAct 同源。同时,开源框架 LangChain、LlamaIndex 将 ReAct 作为默认 Agent 类型,并衍生出 LangGraph 等支持多步、有状态、可回退的编排方案。2024‑2025 年,主流云厂商(微软 Copilot Studio、AWS Agents for Bedrock、Google Vertex AI Agent Builder)均推出低代码/无代码 Agent 构建器,内部默认采用类 ReAct 循环,进一步巩固了该范式的产业地位。

6. 上游

ReAct 范式依赖以下几层上游支撑,构成其运行的基础设施与工具栈:

  • 基座大模型:具备强指令跟随、推理和长上下文处理能力的 LLM,如 OpenAI GPT‑4o、Anthropic Claude 3.5 Sonnet/Opus、Google Gemini 1.5 Pro、Meta Llama 3 以及国产模型(通义千问、DeepSeek‑R1 等)。模型迭代速度直接决定 ReAct 性能上限。
  • 工具与 API 提供商:搜索引擎 API(Google Custom Search、Bing Search API)、计算服务、数据库查询接口、代码执行环境(如 E2B、Code Interpreter)、企业 ERP/CRM 系统 API 等。它们的可靠性、响应速度和返回格式影响整个循环的稳定性。
  • 提示工程与编排框架:LangChain、LlamaIndex、Semantic Kernel、Dify 等提供工具集成、安全的解析器、记忆管理、错误重试等能力,是连接模型与工具的中间件。
  • 数据与知识底座:向量数据库(Pinecone、Weaviate、Milvus 等)和知识图谱,支撑检索增强生成(RAG)场景,当工具为“检索知识库”时,上游知识库的质量直接影响答案准确率。
  • 安全与网关层:为工具调用提供鉴权、限流、审计和敏感数据脱敏的 API 网关与 AI 防火墙,确保企业环境下的合规与安全。
  • 算力与推理平台:GPU 云服务(NVIDIA、AWS、Azure 等)和推理优化引擎,决定模型响应的延迟和吞吐,间接限制 ReAct 循环的实际可用性。

7. 下游

ReAct 范式已在多个行业场景落地,推动“AI 员工”从概念走向生产力:

  • 智能体平台与自主助理:AutoGPT、MetaGPT、CrewAI、AutoGen 等以 ReAct 循环为单智能体内核,实现任务规划、分解与执行。
  • 企业知识问答与客服:结合 RAG 的客户服务系统,用 ReAct 动态决定何时检索文档、何时生成回答、何时转人工,提升首次解决率。
  • 自动化办公与业务流程:邮件自动处理、合同审核、数据报表生成、竞品分析等场景,模型自主操作办公软件、数据库和 API。
  • 垂直领域决策辅助:医疗辅助诊断(先检索文献,再推理鉴别)、法律案件检索与分析(查法条、判例,逐步推演结论)、金融投研(抽取财报、计算指标、生成简报)。
  • 研发与数据分析:代码生成与调试(调用解释器、查看执行结果、修正代码)、数据科学辅助(自然语言查询数据库、生成图表)。
  • IoT 与机器人控制:部分研究将 ReAct 思想扩展至具身智能,通过推理规划动作序列,并观察环境反馈。

8. 受益公司

以下公司与机构在 ReAct 范式驱动的智能体生态中占据关键位置,其受益逻辑基于公开产品与战略布局(不构成任何投资建议):

  • 基础模型厂商:

    • OpenAI(微软生态):ChatGPT 的 Plugins、Code Interpreter、Assistants API 均体现类 ReAct 模式;2024 年推出 GPT‑4o 支持更快速、低成本的工具调用。微软将智能体能力整合进 Copilot Studio、Azure AI Studio,是产业化的最大受益方之一。
    • Anthropic:Claude 的 tool use 功能允许用户定义工具并让模型自主决定调用时机,企业级安全与合规定位使其在金融、医疗等场景有差异化优势。
    • Google:凭借 Gemini 模型和 Vertex AI Agent Builder 提供搜索、代码执行等内置工具,结合谷歌生态(搜索引擎、Workspace)形成闭环。
    • Meta:开源 Llama 3 系列支持工具调用能力,为非敏感场景的自部署 Agent 提供低成本选择。
  • 中间件与框架:

    • LangChain(LangChain Inc.):已将 ReAct 作为核心 Agent 类型,2024 年完成 2500 万美元 A 轮融资(来源:Sequoia Capital 公告,2024 年 4 月),同时推出有状态编排框架 LangGraph。
    • LlamaIndex:专注数据与 LLM 的连接,其 Agent 实现同样内嵌 ReAct 循环,获 Greylock 等机构投资(具体金额见公开披露)。
    • 微软 Semantic Kernel:作为轻量级 SDK,集成原生 ReAct 步骤编排,深度绑定 Azure 生态。
  • 应用与平台型公司:

    • Salesforce:Einstein GPT 及 Agentforce 平台利用类似范式驱动客户关系管理自动化。
    • ServiceNow:在 ITSM 流程中引入 AI Agent 进行工单分类、自动补全和知识检索。
    • Adobe:通过 Firefly 与智能体能力将创作工具与外部资源检索相融合。
    • SAP、Oracle:在 ERP 产品中嵌入自然语言驱动的 Agent 助手,实现业务流程自动化。
  • 算力与基础设施:

    • NVIDIA:GPU 需求随 Agent 推理的增多而持续增长,推出 NIM 微服务和 Agent 参考架构。
    • 云服务商(AWS、Azure、GCP):各自的 Agent 构建服务和模型托管直接受益于智能体工作负载的扩大。

注:以上公司列举基于 2024‑2025 年公开产品与战略信息,不意味着对其投资价值的判断。

9. 市场规模

由于撰写时未能联网实时核验,以下市场规模数据主要来自已公开的第三方行业报告,具体年份、口径与来源均已标注;若某数据点缺乏权威统计,则注明“公开资料未见”。

  • AI Agent 整体市场:据市场研究机构 MarketsandMarkets 于 2024 年 6 月发布的报告《AI Agents Market by Component, Technology, Application, Vertical and Region – Global Forecast to 2030》估计,全球 AI Agent 市场规模在 2024 年约为 51 亿美元,预计到 2030 年将增长至 471 亿美元,2024‑2030 年复合年增长率(CAGR)为 44.8%。(来源:MarketsandMarkets,报告 ID: TC 8933;该口径涵盖软件、服务,且包含基于规则的与基于 LLM 的 Agent)
  • Agentic AI 在企业中的渗透率:公开资料见 Gartner 于 2024 年发布的预测提及,到 2028 年,超过 25% 的企业软件应用将嵌入一定程度的 Agentic AI 能力(来源:Gartner,具体报告名称待查)。但准确数值和覆盖范围需以最新 Gartner 发布为准,此处引用不构成确定性陈述。
  • Agent 框架与中间件市场:公开资料未见单一机构对 LangChain 等中间件市场规模做出统计。从融资端看,2023‑2024 年 Agent 编排框架类初创公司(如 LangChain、LlamaIndex、CrewAI 等)累计融资额已超过数亿美元(具体金额以 Crunchbase 及各自官方公告为准),侧面印证资本对该细分赛道的乐观预期。
  • 相关云服务与推理算力市场:IDC 等机构对 AI 平台与云服务市场的统计包含 Agent 功能,但未单独拆分;公开资料未见到专门针对 ReAct 范式带动的算力支出测算。结合 Agent 调用频次高、多步推理的特点,预计将显著推升大模型推理 API 与 GPU 云的市场消耗,但确切数据有待第三方机构后续细化。

重要提示:市场预测具有高度不确定性,以上数字均为特定时间节点的行业估计,不构成对未来表现的承诺。

10. 玩家对比

从产品化和开发者使用角度,当前市场上主流类 ReAct 方案可对比如下(信息截至 2025 年 4 月,基于公开文档与体验):

玩家方案名称透明度工具集成难度模型可选性成本适用场景
OpenAIAssistants API / Function Calling低(默认不公开思维链)低(函数定义清晰)仅限 OpenAI 模型API 按 token 计费追求快速落地、已绑定 Azure/OpenAI 生态的企业
AnthropicClaude Tool Use低(可通过提示要求解释,但不强制)低(类似于 function calling)仅限 Claude 系列API 按 token 计费对安全性和指令遵循要求极高的金融、医疗场景
GoogleVertex AI Agent Builder + Gemini中(可启用思考记录)低(与 Google 服务深度绑定)Google 模型按调用和计算资源计费已使用 Google Cloud 且需要搜索引擎集成的企业
LangChain (开源)ReAct Agent (with tools)高(完整记录 Thought/Action/Observation)中(需编写工具封装)任意 LLM(Open/闭源)自托管成本 + 模型 API 费需要高度可解释、可审计或私有化部署的场景
AutoGPT / MetaGPT自定义循环中(日志可查但结构不规范)中(需定义工具和任务)任意自托管成本探索性研究、自主学习原型,稳定性待提高
阿里百炼 / 通义千问Agent 构建平台通义系列按 API 计费中文企业场景、需要合规部署于中国云的客户

注:透明度指是否默认输出可读的推理与动作步骤日志;成本为相对定性概述,具体费用需查阅各厂商最新价目表。

11. 风险

在产业快速推进中,基于 ReAct 的智能体系统仍需正视以下风险:

  • 技术稳定性风险:多步循环可能因模型幻觉或解析错误而中断;工具 API 的不稳定、返回格式变化会级联导致任务失败。当前在复杂开放域下的整体任务成功率仍未达到企业大规模无人值守的可靠性要求。
  • 推理延迟与成本可控性:多步调用使延迟线性增加,消耗大量 token,容易导致单次交互成本数倍于无 Agent 场景。若吞吐量较大,云成本可能超出预算,影响规模化 ROI。
  • 安全与合规风险:工具调用可能泄露敏感数据(如违反企业数据边界调用外部搜索引擎)、执行危险操作(如误写 SQL 删除数据)。需要在网关层施加严格的权限控制和输入输出过滤,否则可能引发合规事故。
  • 解释性与审计鸿沟:尽管 ReAct 理论透明,但实际产品为降低成本常常隐藏或压缩思考链,这会削弱对错误决策的追溯能力,难以满足强监管行业(如金融、医疗)的审计要求。
  • 模型锁定与生态碎片化:ReAct 的最佳实践高度依赖特定模型的指令跟随能力,切换模型可能导致性能骤降。厂商迅速分化为不同生态(如 OpenAI 的 function calling 格式、Anthropic 的 tool use 规范),框架适配成本上升。
  • 竞争与商业化风险:Agent 中间件赛道拥挤,开源框架与云厂商的托管服务形成竞争,创业公司可能面临客户被大型云平台直接整合的风险。同时,市场预期过高可能导致投资泡沫。
  • 法律与伦理:Agent 在执行时可能做出侵权决策(如错误引用版权内容),责任归属尚不明确;在部分职业领域,Agent 自主执行可能违反行业资质规定。

12. 误读纠偏

误读 1:ReAct 是某种新型模型架构。
事实:ReAct 完全是一种提示工程方法,通过 few‑shot 示例与格式约束引导模型行为,任何支持长上下文和指令跟随的 LLM 均可尝试。它不涉及预训练或微调模型权重。

误读 2:ReAct 必须严格分两步——先思考完再行动。
事实:大多数实现会在单次前向传播中同时生成 Thought 和 Action 字段,逻辑上依旧是连续循环,思考隐含在对动作的选择与参数构造中。

误读 3:ReAct 能完全消除幻觉。
事实:ReAct 只能降低因外部知识缺失而导致的幻觉,但无法消除因推理逻辑错误、工具返回信息不准确或模型过度解读而产生的幻觉。在开放应用中,仍需额外的护栏(如人工审核、结果校验)才能达到高可靠性。

误读 4:所有 Agent 都在用 ReAct。
事实:部分 Agent 使用纯规则触发,或通过隐式微调的调用策略,并未显式生成可读的推理路径,这些不属于 ReAct 范畴。但 ReAct 因其可解释性,在需要审计的场景中已成为主流选择。

误读 5:ReAct 只能用在文本问答。
事实:ReAct 的思想可扩展至多模态、代码执行、机器人任务规划等,只要定义适当的动作空间和观察接口即可。例如,调用视觉模型识别图像内容,或控制机械臂执行物理动作。

13. 最新事件

(时间跨度:2024 年 1 月至 2025 年 4 月,基于公开新闻报道与官方发布)

  • 2024 年 1‑3 月:OpenAI 推出 Assistants API 正式版,支持代码解释器、检索和函数调用,并实现多工具并行调用;LangChain 发布 LangGraph,提供有状态、可回退的 Agent 循环编排能力。
  • 2024 年 4 月:LangChain 完成 2500 万美元 A 轮融资(来源:Sequoia Capital 官方博客及 TechCrunch 报道),验证了 Agent 中间件层的商业价值。
  • 2024 年 5 月:Anthropic 推出 Claude 的 Tool Use 功能正式公测,允许用户定义工具并让模型自行决定调用时机和参数,并支持多轮工具交互。
  • 2024 年 8‑10 月:Google 发布 Gemini 1.5 Pro 的长上下文版本,并在 Vertex AI 中提供 Agent Builder 预览;微软在 Ignite 2024 大会上宣布 Copilot Studio 支持自主 Agent,可串联多个工具和连接器。
  • 2024 年 11‑12 月:AWS 在 re:Invent 2024 上推出 multi‑agent orchestration 功能,允许 Agent 之间相互协作并调用 Bedrock 工具;Meta 发布 Llama 3.3,开源模型工具调用能力进一步提升。
  • 2025 年 1‑3 月:DeepSeek‑R1 等具备显式“推理链”的模型发布,其在推理时以类 ReAct 的方式自我分解任务,展示了开源模型在复杂 Agent 任务中的潜力。同季度,多家人力资源与财务软件厂商(如 Workday、SAP)宣布在核心产品中嵌入基于 ReAct 的 Agent 助手。

以上事件展示了 ReAct 范式从框架到平台、从闭源到开源的加速渗透,产业推进节奏明显加快。

14. 跟踪指标

若希望持续观察 ReAct 范式及其产业的演进,可关注以下维度的指标与信号:

  • 模型任务成功率:在公开基准(如 HotpotQA、FEVER、GAIA)上,主流模型+ReAct 配置的端到端准确率/精确匹配率,以及引入新工具后的提升幅度。
  • 推理延迟与步数:典型任务的平均完成步数、首 token 生成时间与总交互时间,以及各厂商为降低延迟所做的优化(如 speculative decoding、并行工具调用)。
  • 工具调用准确率:模型生成恰当工具名称与参数的比例,这直接影响任务完成度;部分研究论文与厂商评测会公开该指标。
  • 企业采用调研:Gartner、McKinsey、Deloitte 等机构发布的 AI 采用率调查中,“Agentic AI”或“自主智能体”相关指标的变化,以及计划在未来 12‑18 个月内部署 Agent 的企业占比。
  • 开源社区活跃度:LangChain、LlamaIndex、AutoGPT 等代码库的 GitHub star 数、月度活跃贡献者、版本更新频率,以及新 Agent 框架的涌现速度。
  • 融资与并购事件:Agent 中间件及工具链初创公司的融资轮次与金额,以及云平台和大厂对相关团队的收购情况,反映资本热度。
  • 合规与安全标准进展:各国针对自主 Agent 行为的法规草案出台情况,以及行业联盟对 Agent 可解释性、审计日志格式的标准化努力。
  • 云厂商 Agent 产品策略变化:如新增的工具商店、Agent 模板数量、是否将 Agent 能力集成至核心 SaaS 等。

15. 信源

  • 核心论文:Yao, S., Zhao, J., Yu, D., Du, N., Shafran, I., Narasimhan, K., & Cao, Y. (2022). ReAct: Synergizing Reasoning and Acting in Language Models. arXiv preprint arXiv:2210.03629.
  • 相关学术工作:Wei et al. “Chain‑of‑Thought Prompting Elicits Reasoning in Large Language Models”; Press et al. “Measuring and Narrowing the Compositionality Gap in Language Models” (Self‑Ask); Schick et al. “Toolformer: Language Models Can Teach Themselves to Use Tools”; Shinn et al. “Reflexion: Language Agents with Verbal Reinforcement Learning”.
  • 市场报告:MarketsandMarkets, AI Agents Market by Component, Technology, Application, Vertical and Region – Global Forecast to 2030, June 2024 (Report ID: TC 8933).
  • 企业公开信息:OpenAI 官方文档(Assistants API, Function Calling);Anthropic 官方文档(Claude Tool Use);Google Cloud Vertex AI Agent Builder 文档;Microsoft Ignite 2024 公告;AWS re:Invent 2024 新功能发布。
  • 融资与产品动态:Sequoia Capital 关于 LangChain A 轮融资的博客(2024.04);LangChain 官方博客及 GitHub 仓库;Crunchbase 相关记录。
  • 分析师观点:Gartner 对 Agentic AI 的预测(多次引用,具体报告名称见 Gartner 官网)。
  • 声明:由于撰写时未进行实时联网检索,所有具体数字均源自记忆中的公开权威来源,并已尽可能标注年份与出处。若个别细节与最新发布存在出入,请以源文件为准。本文不构成任何投资建议或对未来市场表现的预测。
source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型