模型层 开放阅读

Agent 长程规划

Long-Horizon Agent Planning

概念 ID
agent-planning
更新时间
2026-05-28
来源数量
26

Agent 长程规划

1. 3 秒看懂(≤25 字)

Agent 长程规划把 1 次回答拆成 5-100 步可验证任务。123

2. 3 分钟产业解释(120-180 字)

Agent 长程规划是云端 AI 执行层的“任务分解 + 工具调用 + 反思修正 + 搜索选择”,核心目标是把 1 个自然语言目标拆成 5-100 个带状态、权限和验收条件的动作。123 ReAct 在 2022 年把 reasoning trace 与 action 交替执行,Reflexion 在 2023 年用语言反馈把失败经验写入下一轮,Tree of Thoughts 在 2023 年把单链推理扩展为多分支搜索;三者共同把 Agent 从“会聊天”推向“会试错、会回滚、会选择”。123 产业化瓶颈是长链错误复利:若单步成功率为 98%,20 步直通率只有 66.8%;若单步成功率降至 95%,20 步直通率降至 35.8%,因此规划器、验证器和审计层会成为云厂与企业软件厂的新增预算项。45

3. 15 分钟专家深入(400-600 字)

长程规划的投资价值不在“模型多想几秒”,而在把推理时间转化为可计费的任务成功率、成本/成功和企业可控边界。46 单轮问答的成本近似为 tokens × 单价,长程 Agent 的成本近似为 规划分支数 × 每分支步数 × 平均 tokens × 模型单价 + 工具调用费 + 失败回滚费 + 人工验收费;当 Tree of Thoughts 把搜索分支从 1 条扩到 5 条时,推理成本约增加 5 倍,但若成功率从 40% 提升到 80%,每次成功成本反而下降 50%。36

ReAct、Reflexion 和 Tree of Thoughts 对应 3 类可商业化能力。ReAct 解决“下一步该调用什么工具”,适合网页、代码、数据库、工单和 CRM 等开放环境;论文显示 interleaved reasoning/action 可以提升任务可解释性,并让模型用外部环境更新计划。1 Reflexion 解决“失败后如何改进”,它不更新模型权重,而是把失败原因写成语言记忆,再在下一轮行动前读取;这类能力映射到企业软件里的 replay、postmortem、case memory 和 workflow analytics。2 Tree of Thoughts 解决“多个方案如何比较”,它把中间想法作为搜索节点,用生成器、评估器和搜索算法做前瞻;论文在 Game of 24 上报告 GPT-4 + ToT 成功率 74%,显著高于 chain-of-thought 的 4%,说明搜索预算能换取复杂规划任务的成功率。3

商业上,Agent 长程规划会先被云厂和企业软件厂内嵌,而不是独立成为 1 个应用类别。OpenAI 2025 年推出 ChatGPT agent,披露其统一了 Operator、deep research 和 ChatGPT 的能力,并在 Humanity’s Last Exam 上给出 41.6% pass@1 的系统口径。78 Salesforce FY26Q4 披露 Agentforce ARR 8.0 亿美元 [CRM]、同比增长 169%,说明规划能力已经开始进入 CRM 预算。9 ServiceNow 2026 年把 AI Control Tower 扩展到跨系统 Agent 观测、治理和安全,说明企业客户为“规划是否越权、失败能否追责、ROI 能否量化”付费。10 可算收入链为 企业任务池 × 可自动化比例 × 长程成功率 × 每次成功收费或席位 ARPU × 平台份额 = Agent 规划收入,反证指标是 2026-2028 年 AI ARR 是否从演示和试点转为可续费生产工作流。91011

4. 技术原理(200-300 字)

长程规划器通常包含 6 个模块:目标解析器把用户目标拆成 3-50 个子目标,状态跟踪器维护文件、网页、数据库和工具返回,行动策略选择 API/浏览器/代码/检索,反思模块把失败写入短期或长期记忆,搜索模块在 2-10 条候选路径中评分,验证器用规则、测试或人工审批判定最终状态。123 ReAct 的最小循环是 Thought -> Action -> Observation,优点是每 1 步都能吸收环境反馈,缺点是错误观察会污染后续计划。1 Reflexion 在循环外增加 verbal feedback 与 episodic memory,优点是无需 fine-tuning 就能用 1-3 次失败改善策略,缺点是错误反思会形成“自信但错误”的记忆。2 Tree of Thoughts 增加 breadth-first、depth-first 或 beam search,优点是可在 5-10 个候选解之间回溯,缺点是 token 成本、延迟和评估器误判同步上升。3 2026 年技术分水岭是规划器能否在第 N 步定位失败并自动重试,而不是只在最终答案失败后重新生成 1 次。612

5. 上游依赖 / 下游影响

上游依赖

  • Frontier reasoning models:OpenAI o3/o4-mini 2025 年披露工具使用可显著提升 AIME 2025 表现,说明规划模型需要同时具备推理、视觉、浏览器和代码工具能力。12
  • Agent benchmark 与 replay:GAIA 覆盖 466 个真实助理任务,OSWorld 覆盖 369 个真实桌面/网页任务,SWE-bench Verified 覆盖 500 个经人工验证的软件修复任务,三类基准共同约束“长程成功率”的可比口径。456
  • 状态机与工作流编排:LangGraph、AutoGen、ServiceNow AI Agent Studio、UiPath Maestro 等框架把开放循环压缩成节点、边、重试和审批,方向是把 10-100 步任务变成可审计 DAG。101314
  • 企业权限与审计:OAuth、RBAC、日志、数据驻留和人工审批决定 Agent 能否从只读摘要进入可写系统;ServiceNow 2026 年把 AI Control Tower 连接到 NVIDIA Enterprise AI Factory,说明治理边界正从桌面扩展到数据中心。10

下游影响

  • CRM 与客服:Salesforce FY2026 Agentforce ARR 8.0 亿美元 [CRM]、同比增长 169%,长程规划把“推荐话术”升级为“自动建单、更新字段、触发流程”。9
  • ITSM 与 HR:ServiceNow 2026 年 AI Control Tower GA 预期在 2026-08,把多 Agent 观测、风险控制和 ROI 度量纳入平台订阅。10
  • RPA 与后台流程:UiPath FY2025 ARR 为 16.66 亿美元、同比增长 14%,Agentic automation 的增量在于把非结构化输入接入已有机器人和队列。14
  • 研发与知识工作:Atlassian FY2025 收入 52 亿美元、AI 月活 230 万,Rovo 与 Teamwork Graph 把规划能力放进 Jira/Confluence 工作流。15

6. 技术路线对比表

路线速率/吞吐典型功耗或成本距离或维度标准成熟度量产概率 2026反证指标
ReAct 单 Agent 循环5-50 步行动-观察步数 × tokens × 单价网页、代码、检索、API2022 年论文成熟,工程框架普及85%20 步任务直通率低于 50% 或日志无法复现失败点14
Reflexion 失败记忆1-3 轮 retry + verbal memory失败重试成本增加 1-3 倍编程、问答、交互环境2023 年论文成熟,生产记忆需治理70%反思记忆导致错误策略重复 3 次以上2
Tree of Thoughts / Beam Search2-10 条候选路径并行分支数增加 2-10 倍 token 成本数学、规划、复杂决策2023 年论文成熟,企业评估器仍早期60%成功率提升小于成本增幅,或延迟超过人工 SLA3
图状态机 Agent3-50 个节点 + 条件边节点重试降低失败回滚成本企业审批、客服、ITSMLangGraph/AutoGen/ServiceNow 路线成熟度上升80%SOC2/ISO/金融审计无法接受开放循环1013
多 Agent 规划2-10 个角色协作token 成本约为单 Agent 的 2-5 倍研发、运营、投研复合任务2024-2026 年快速迭代55%多角色互相确认但最终验收错误率高于单 Agent6
人类在环规划关键节点 1-5 次审批人工成本换取风险下降财务、法务、采购、人事企业上线最现实路径90%人工接管率超过 30% 后 ROI 低于传统流程自动化11

7. 关键指标(5-7 项 + 怎么追)

  • 长程成功率:按 GAIA Level 3、OSWorld、WebArena、SWE-bench Verified/Pro 和内部 replay 追踪,若复杂任务成功率低于 60%,生产部署应降级为 copilot 或审批模式。456
  • 成本/成功:用 模型费 + 工具费 + 回滚费 + 人工复核费 ÷ 成功任务数 计算,若 2026 年高频流程成本仍高于人工成本 50%,结果付费模型难以成立。11
  • 搜索预算回报:记录 ToT/beam search 的分支数、平均步数和成功率增量,若 5 条分支只提升 5 个百分点成功率,规划器应收缩为 ReAct 或状态机。3
  • 失败定位粒度:按第 N 步、工具名、输入输出和审批节点记录错误,若超过 20% 失败无法定位到具体节点,企业审计和保险定价会受阻。610
  • AI ARR / Agent ARR:Salesforce FY26Q4 已披露 Agentforce ARR 8.0 亿美元 [CRM],ServiceNow 披露 AI Control Tower 和大客户交易,后续追 AI 收入占总收入是否超过 5%。910
  • 人工接管率:对 10-100 步任务记录 HITL 次数,若 20 步任务超过 6 次人工审批,Agent 更像流程建议而非自动执行。11
  • 安全事件率:按每 1,000 次执行中的越权、错误写入、数据泄露和高危工具调用计数,若高危事件超过 1 次,金融、医疗和政企部署会延后。810

8. 可算传导表

8.1 市场闭环模型

驱动变量20242025E2026E2027E来源
美国 AI Agents 市场 TAM16.03 亿美元22.29 亿美元31.94 亿美元 = 22.29 × 1.43345.77 亿美元 = 31.94 × 1.433Grand View Research;2026/2027 按 43.3% CAGR 推算。11
长程规划可服务比例20% 情景25% 情景30% 情景35% 情景情景假设;关键拆分未披露。
→ 规划 TAM3.21 亿美元5.57 亿美元9.58 亿美元16.02 亿美元AI Agents TAM × 可服务比例
付费工作流出货[未核实 — 待补 A/B 源][未核实 — 待补 A/B 源][未核实 — 待补 A/B 源][未核实 — 待补 A/B 源]厂商未披露统一工作流出货口径。
ASP/ARPUAgentforce ARR/客户待披露AI Control Tower SKU 待披露结果付费 ASP 待披露同左关键价格拆分缺少 A/B 公开源。910
收入公式TAM × 规划比例 × 份额任务数 × 成功率 × 单价AI ARR + 用量费结果费 + 平台分成推算。
毛利率SaaS 公司 GM 约 70%-84% 区间推理成本压低短期 GM缓存/路由改善 GM结果付费提升 NRRSalesforce/ServiceNow/Atlassian 财报区间。91516
PE/估值口径2026-05-27 美股完整收盘,美元,shares × close / TTM EPS同左同左同左C 级行情仅用于估值快照。26

8.2 代表公司弹性测算

驱动变量SalesforceServiceNowUiPath来源/公式
相关收入基数FY2026 revenue 415 亿美元 [CRM];Agentforce ARR 8.0 亿美元 [CRM]FY2025 revenue 132.8 亿美元;2030 subscription revenue target 300 亿美元以上FY2025 revenue 14.30 亿美元;ARR 16.66 亿美元公司财报和公告。91416
长程规划收入占比8.0 / 415 = 1.9% 的 Agentforce ARR 口径AI ACV 与 AI Control Tower 收入待披露Maestro/agentic automation ARR 待披露推算;拆分不足。
→ 2026E 本概念收入Agentforce ARR × 规划功能占比,占比待披露AI ACV × 转收入率 × 规划占比,待披露agentic ARR × 规划占比,待披露关键拆分待披露。
毛利率FY2026 non-GAAP operating margin 34.1%;GAAP operating margin 20.1%FY2025 gross profit 102.95 亿美元 / revenue 132.8 亿美元 = 77.5%FY2025 gross margin 待补 A/B 源财报披露。91416
→ 毛利贡献规划收入 × CRM 软件毛利率规划收入 × 77.5%规划收入 × PATH gross margin推算。
净利率/EPS 传导新增 ARR × 稳态 EBIT margin 30%+ ÷ 稀释股本AI ACV × 转收入率 × operating margin新增 ARR × 自动化软件 margin推算。
市值/PE 口径市值 1,689.9 亿美元;PE TTM 23.7x;2026-05-27 收盘口径市值 1,061.9 亿美元;PE TTM 60.1x;2026-05-27 收盘口径市值 60.2 亿美元;PE TTM 26.6x;2026-05-27 收盘口径C 级行情快照。26

9. 同业硬指标对比表

公司收入增速GM净利FCF margin客户集中度技术代际PE TTM反证条件
SalesforceFY2026 415 亿美元 [CRM]+10%gross margin 待补 10-K;non-GAAP op margin 34.1%GAAP operating margin 20.1%144 / 415 = 34.7%大客户分散;RPO 720 亿美元Agentforce + Data 360 + workflow planner20.61x [CRM],2026-05-27 16:00 EDT,USDAgentforce ARR 增速低于 50% 或付费 attach 停滞926
ServiceNowFY2025 132.8 亿美元+21%77.5%net income 待补 10-KFCF 待补 A/B 源630 个 ACV 超 500 万美元客户AI Control Tower + AI Agent Studio60.1x,2026-05-27,USDAI Control Tower 无法转化为 subscription uplift101626
UiPathFY2025 14.30 亿美元+9%待补 A/B 源待补 A/B 源待补 A/B 源ARR ≥10 万美元客户贡献 87% 收入Maestro + RPA + Agentic Automation26.6x,2026-05-27,USDARR 增速低于 10% 或 NRR 低于 105%1426
AtlassianFY2025 52 亿美元+20%cloud gross margin 83%-84% 目标口径GAAP net income 2.57 亿美元14 / 52 = 26.9%30 万+组织客户Rovo + Teamwork Graph + Jira planner-108.6x,2026-05-27,USDAI MAU 无法转化为付费 Collection1526
MicrosoftFY2025 2,817 亿美元 [MSFT]+15%集团 GM 待补 10-Knet income 1,018 亿美元FCF 待补 A/B 源企业客户极分散Copilot Studio + Azure AI Foundry24.58x,2026-05-27 16:00 EDT,USD [MSFT]Copilot 停留在摘要层,未进入可写工作流1726
AppianFY2025 收入待补 A/B 源待补 A/B 源待补 A/B 源待补 A/B 源待补 A/B 源政企流程客户Low-code + process automation + planner1082.0x,2026-05-27,USD低代码流程被内嵌 Agent 和云平台替代26

10. 投资逻辑 + 业绩传导(200-300 字 + ASCII 传导图)

Agent 长程规划的投资主线是企业软件从“辅助生成”升级到“可审计执行”,收入从普通 Copilot 席位加价转向 Agent ARR、用量费和结果付费。91011 ReAct 提升工具调用闭环,Reflexion 降低重复失败,Tree of Thoughts 用更高推理预算换更高复杂任务成功率;这 3 类能力会被 CRM、ITSM、RPA、协同办公和开发平台吸收,而不是单独以“算法 SKU”售卖。123 2026-2028 年的关键反证不是 demo 数量,而是长程成功率、人工接管率和成本/成功能否让企业从试点预算转入生产预算;若 Gartner 预测的 2028 年 33% 企业软件含 agentic AI、15% 日常工作决策自动化无法兑现,估值应回到普通 SaaS 增长框架。18

企业任务池 × 可自动化比例 × Agent 渗透率
        ↓
ReAct 工具闭环 × Reflexion 失败记忆 × ToT 搜索预算
        ↓
长程成功率 / 成本每成功 / 人工接管率
        ↓
AI ARR + 用量费 + 结果付费
        ↓
收入 × SaaS 毛利率 - 推理与审计成本
        ↓
EPS × PE = 情景市值框架/股价

11. 常见误读纠偏(≥2 条)

误读 1:长程规划等于“让模型多写 chain-of-thought”。

实际情况:ReAct 至少包含行动和观察 2 个外部环节,Reflexion 至少增加失败反馈和记忆 2 个环节,Tree of Thoughts 至少增加候选生成、评分和搜索 3 个环节;因此生产系统要评估工具状态、权限、日志和回滚,而不是只评估文本推理长度。123

证据:ReAct 论文强调 reasoning 与 acting 交替,Reflexion 论文强调 verbal reinforcement,ToT 论文强调多路径搜索和自评估,三者都不是单一 prompt 技巧。123

误读 2:Tree of Thoughts 成功率高,所以企业应默认开启多分支搜索。

实际情况:ToT 在 Game of 24 上把 GPT-4 成功率从 4% 提升到 74%,但分支搜索会把 token、延迟和评估器成本同步放大 2-10 倍;企业应只在高价值、低频、可等待的任务上开启 ToT,而在客服、工单和字段更新里优先使用 ReAct 或状态机。3

证据:ToT 的收益来自候选路径生成和评估,而不是免费能力;若 5 条分支只提升 5 个百分点成功率,成本/成功会恶化。3

误读 3:Agent 规划越自主,商业价值越高。

实际情况:20 步任务在单步 98% 成功率下直通率只有 66.8%,在单步 95% 成功率下降至 35.8%;金融、医疗、法务和人事流程需要 1-5 个 HITL 节点来换取低事故率和可追责,而不是追求 100% 无人值守。4510

证据:GAIA、OSWorld 和 SWE-bench Verified 都把最终状态正确性作为核心,ServiceNow AI Control Tower 的定位也从“自主”转向“治理、观测、安全和 ROI”。45610

12. 最新事件(3-5 条带前缀)

  • [已发生] 2025-07-17:OpenAI 发布 ChatGPT agent,披露统一 agentic system,并在 Humanity’s Last Exam 上给出 41.6% pass@1 系统口径。78
  • [已发生] 2025-08-15:Atlassian FY2025 披露收入 52 亿美元、AI 月活 230 万,Rovo 与 Teamwork Graph 成为协同规划入口。15
  • [已发生] 2026-02-26:Salesforce FY26Q4 披露 Agentforce ARR 8.0 亿美元 [CRM]、同比增长 169%,Agentforce and Data 360 ARR 超过 29 亿美元 [CRM]。9
  • [指引] 2026-05-04:ServiceNow 扩展 AI Control Tower,披露新能力在 2026-05 进入 Innovation Lab、2026-08 预期 GA。10
  • [行业预测] 2024-03-11:Gartner 预测 2028 年 33% 企业软件应用将包含 agentic AI,15% 日常工作决策将由 AI Agent 自主完成。18

13. 来源 footnotes

1 ReAct: Synergizing Reasoning and Acting in Language Models — Yao et al., ICLR / arXiv — 2022-10-06 — https://arxiv.org/abs/2210.03629 (A)

2 Reflexion: Language Agents with Verbal Reinforcement Learning — Shinn et al., NeurIPS / arXiv — 2023-03-20 — https://arxiv.org/abs/2303.11366 (A)

3 Tree of Thoughts: Deliberate Problem Solving with Large Language Models — Yao et al., NeurIPS / arXiv — 2023-05-17 — https://arxiv.org/abs/2305.10601 (A)

4 GAIA: a benchmark for General AI Assistants — Meta / Hugging Face / AutoGPT team, arXiv — 2023-11-21 — https://arxiv.org/abs/2311.12983 (A)

5 OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments — NeurIPS 2024 / arXiv — 2024-04-11 — https://arxiv.org/abs/2404.07972 (A)

6 Introducing SWE-bench Verified — OpenAI — 2024-08-13 — https://openai.com/index/introducing-swe-bench-verified/ (B)

7 Introducing ChatGPT agent: bridging research and action — OpenAI — 2025-07-17 — https://openai.com/index/introducing-chatgpt-agent/ (B)

8 ChatGPT agent System Card — OpenAI — 2025-07-17 — https://openai.com/index/chatgpt-agent-system-card (B)

9 Salesforce Delivers Record Fourth Quarter Fiscal 2026 Results — Salesforce Investor Relations — 2026-02-26 — https://investor.salesforce.com/news/news-details/2026/Salesforce-Delivers-Record-Fourth-Quarter-Fiscal-2026-Results/default.aspx (B)

10 ServiceNow expands AI Control Tower to discover, observe, govern, secure, and measure AI deployed across any system in the enterprise — ServiceNow Newsroom — 2026-05-04 — https://newsroom.servicenow.com/press-releases/details/2026/ServiceNow-expands-AI-Control-Tower-to-discover-observe-govern-secure-and-measure-AI-deployed-across-any-system-in-the-enterprise/default.aspx (B)

11 U.S. AI Agents Market Size and Share, 2030 — Grand View Research — 2025 — https://www.grandviewresearch.com/industry-analysis/us-ai-agents-market-report (A)

12 Introducing OpenAI o3 and o4-mini — OpenAI — 2025-04-16 — https://openai.com/index/introducing-o3-and-o4-mini/ (B)

13 AutoGen: Enabling Next-Gen LLM Applications via Multi-Agent Conversation — Microsoft Research / arXiv — 2023-08-16 — https://arxiv.org/abs/2308.08155 (A)

14 UiPath FY2025 Form 10-K — UiPath / SEC — 2025-03-24 — https://ir.uipath.com/financials/sec-filings/content/0001734722-25-000007/0001734722-25-000007.pdf (A)

15 Atlassian FY2025 Annual Report and Q4 FY2025 Results — Atlassian / SEC — 2025-08-15 — https://www.sec.gov/Archives/edgar/data/1650372/000165037225000060/team2025annualreport.pdf (A)

16 ServiceNow FY2025 Form 10-K / Annual Results — ServiceNow / SEC — 2026-01-29 — https://s205.q4cdn.com/537566246/files/doc_news/2025/q4/ServiceNow-Reports-Fourth-Quarter-and-Full-Year-2025-Financial-Results-Board-of-Directors-Authorizes-Additional-5B-for-Share-Repurchase-Program.pdf (A/B)

17 Microsoft FY2025 Form 10-K — Microsoft / SEC — 2025-07-30 — https://www.sec.gov/Archives/edgar/data/789019/000095017025100235/msft-20250630.htm (A)

18 Gartner Predicts One-Third of Interactions with GenAI Services Will Use Action Models and Autonomous Agents by 2028 — Gartner — 2024-03-11 — https://www.gartner.com/en/newsroom/press-releases/2024-03-11-gartner-predicts-one-third-of-interactions-with-genai-services-will-use-action-models-and-autonomous-agents-for-task-completion-by-2028 (A)

19 AgentBench: Evaluating LLMs as Agents — ICLR 2024 / arXiv — 2023-08-07 — https://arxiv.org/abs/2308.03688 (A)

20 WebArena: A Realistic Web Environment for Building Autonomous Agents — ICLR 2024 / arXiv — 2023-07-31 — https://arxiv.org/abs/2307.13854 (A)

21 Graph of Thoughts: Solving Elaborate Problems with Large Language Models — Besta et al., AAAI / arXiv — 2023-08-18 — https://arxiv.org/abs/2308.09687 (A)

22 Voyager: An Open-Ended Embodied Agent with Large Language Models — Wang et al., arXiv — 2023-05-25 — https://arxiv.org/abs/2305.16291 (A)

23 Language Agent Tree Search Unifies Reasoning Acting and Planning in Language Models — Zhou et al., arXiv — 2023-10-18 — https://arxiv.org/abs/2310.04406 (A)

24 ServiceNow Launches AI Control Tower, a Centralized Command Center to Govern, Manage, Secure, and Realize Value From Any AI Agent, Model, and Workflow — ServiceNow Newsroom — 2025-04-29 — https://newsroom.servicenow.com/press-releases/details/2025/ServiceNow-Launches-AI-Control-Tower-a-Centralized-Command-Center-to-Govern-Manage-Secure-and-Realize-Value-From-Any-AI-Agent-Model-and-Workflow/ (B)

25 ChatGPT agent release notes — OpenAI Help Center — 2025-07-17 — https://help.openai.com/en/articles/11794368-chatgpt-agent-release-notes (B)

26 Public market valuation snapshot for CRM/NOW/PATH/TEAM/MSFT/APPN — quote-feed finance data, retrieved 2026-05-28 before U.S. regular session; values treated as 2026-05-27 complete close proxy and must be refreshed before publication — 2026-05-28 — C 级行情源,仅用于估值快照,不支撑收入、利润率、份额或产能关键数 (C)

source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型