模型层 开放阅读

任务成功率

Task Success Rate

概念 ID
task-success-rate
更新时间
2026-05-29
来源数量
待补

任务成功率

1. 3 秒看懂

  • 是什么:任务成功率(Task Success Rate, TSR)衡量一个智能系统(AI Agent、机器人、自动驾驶汽车、对话模型等)在独立尝试中完成既定目标的比例,即成功次数除以总尝试次数。
  • 为什么重要:它是判断 AI 系统“可用不可用”的最终标尺。演示惊艳但成功率低迷,就无法走出实验室。任务成功率直接映射为商业指标:订单完成率、无干预里程、客户满意率等。
  • 核心公式:TSR = 成功次数 / 总尝试次数。成功条件预先由人的需求或环境验收信号定义,通常为二值(成功/失败),也可引入部分成功分数。
  • 关键的 50% 与 99%:从 50% 到 90% 是原型验证,从 90% 到 99% 是工程攻坚,从 99% 到 99.999% 是安全攸关系统(航空、手术、无人驾驶)的生死线。每多一个“9”,投入往往呈指数级增长。

2. 3 分钟产业解释

产业语境中,任务成功率已取代传统的准确率(Accuracy)或 F1 值,成为衡量 AI 产品成熟度的第一仪表。以对话式 AI 为例,语音识别词准确率可达 99%,但端到端任务(如“订一张从北京出发的最早航班”)成功率可能不足 60%,因为任务链中任一子步骤(意图理解、参数提取、API 调用、异常处理)出错都会导致整体失败。因此:

  • 大模型 Agent 公司(OpenAI、Anthropic、Google DeepMind)通过 WebArena、SWE-bench 等长程复杂环境下的任务成功率来标榜模型智能化水平与工程实力。
  • 具身智能与人形机器人领域,通用操作的任务成功率是比“平均干预间隔”更硬的终极指标,直接说明能否替代人工。
  • 自动驾驶中,安全脱离(disengagement)反映的是“不失败”概率,Waymo、特斯拉等均将无干预行驶里程作为任务成功率的类比指标。
  • 产业趋势:评估重心从实验室单点指标(如 ImageNet Top-1)转向真实世界端到端、长程任务成功率,已是一级市场为 AI 企业定价的核心维度之一。咨询机构 Gartner 在《Top Strategic Technology Trends 2024》中将代理 AI(Agentic AI)列为战略趋势,并预测到 2027 年超过 40% 的企业应用将嵌入某种形式的 AI Agent(来源:Gartner,2023 年 10 月)。

3. 技术原理(最深)

3.1 形式化定义

给定任务 T,状态空间 S,动作空间 A,初始状态分布 ρ₀,环境转移概率 P(s’|s,a),成功判定函数 Success(s) ∈ {0,1},策略 π(a|s)。任务成功率为:

SR(π) = E_{s0~ρ₀} [ 1_{最终状态为成功} ]

在非确定性或部分可观测环境中,成功率通过对大量 rollout 取频率来逼近。

3.2 与损失函数的关系

监督学习常用交叉熵损失,但序列决策中高似然未必带来高成功率,错误累积会使成功率崩溃。强化学习直接优化成功率依赖稀疏奖励:R = 1 若成功 else 0。稀疏奖励极难训练,因此衍生出奖励塑形(Reward Shaping)、事后经验回放(HER)等技术。HER 核心思想是把“未达到原始目标的尝试”当成“达到某个虚拟目标的成功经验”来利用,是提升机器人和 Agent 任务成功率的经典手段。

3.3 LLM Agent 的成功率链式分解

LLM Agent 任务流:观察 → 思考(链式推理)→ 工具调用 → 环境反馈,循环往复。整体成功率受三个子概率制约:规划成功率 × 工具调用成功率 × 错误恢复成功率。实验表明,步数超过 10 的长程 Agent 任务成功率呈超指数下降。改进路径包括:结构化思考树(Tree-of-Thoughts)、外部记忆增强、规划器–执行器分离架构。

3.4 整体闭环示意

┌──────────────────┐   观察/反馈    ┌──────────────────┐
│  环境 / 任务模拟  │◄─────────────│     AI Agent      │
│  (Web环境/物理世界) │  动作/工具调用 │ (策略 π + 记忆)   │
└────────┬─────────┘              └────────┬─────────┘
         │ 成功/失败/部分分数               │ 规划、推理、自我修正
         └──────────────────────────────────┘

3.5 置信度与统计严谨性

小样本成功率极易产生误导。例如 10 次成功 9 次,真实成功率 95% 置信区间可能宽至 [55%, 100%](估算)。工业界正推广序列概率比检验(SPRT)方法,在间隔测试中持续监控、仅在成功率稳定高于阈值时才放行上线,以降低“假高成功率”带来的风险。

4. 关键参数

  • Success Rate @1 / @k:@1 为单次尝试成功率,是硬指标;@k 允许多次尝试取最佳结果,衡量模型校准与搜索宽度,但可能高估实用体验。
  • 部分成功度量:用 0~1 连续分数替代二值判定,更适合“不完美信息”或结果可部分使用的任务。
  • 任务难度分级:通常按人类表现分 L1(简单,人类成功率 >95%)、L2(中等,50%–95%)、L3(困难,<50%),在该分级下对比 AI 成功率才有意义。
  • 人工归一化成功率(Human Normalized SR):AI 成功率 ÷ 人类平均成功率,消除任务难度差异,便于跨基准比较。
  • 平均故障间隔(MTBF):持续运行场景中,两次失败之间的平均时长/操作次数,源自可靠性工程,适合工业自动化评估。
  • 成功误报率:系统声称成功但实际失败的比例,在安全攸关系统必须趋近于零。
  • 无协助成功率:剔除人类干预后的净成功率,避免“高成功率”被频繁求助稀释。

5. 技术路线

5.1 技术演进史

  1. 规则系统时代(—2010):手工 if-else 覆盖窄领域,成功率在封闭域极高,但开放域几乎为零。
  2. 深度学习单任务时代(2012—2018):图像分类、语音识别等单步任务成功率(准确率)超越人类;但序列决策任务依然困难。
  3. 预训练+微调时代(2018—2022):BERT/GPT 等使 NLP 单步任务成功率逼近人类,但无法应对交互式多步任务。
  4. 大模型 Agent 时代(2023—至今):Agent 框架将成功率带入长程交互域。SWE-bench 上补丁生成成功率从接近零攀升至百分之二十几;具身智能基于 RT-2、Octo 等模型在特定操作场景成功率从个位数提升到百分之几十。
  5. 未来方向:向多智能体协同、超长程(>1000 步)、安全攸关(手术、航空)领域延伸,量化成功率保证将成为合规上市的必要条件。

5.2 技术路线定性对比

技术路线简单任务成功率(估计)长程/复杂任务成功率(估计)数据/训练需求泛化代价关键瓶颈
手工规则系统极高(封闭域)极低(开放域)专家知识几乎为零无法处理未见情况
小模型微调(BERT类)中高(>80%)低(<30%)数千标注样本中等序列决策能力缺失
RPA/传统自动化高(固定流程)低(流程变更即失效)流程配置极差非结构化信息乏力
LLM Agent(无微调)中(50–80%)低–中(10–50%)少量示例极好幻觉、规划漂移、工具误用
微调/RLHF Agent高(>80%)中(30–60%)大量交互/偏好数据良好奖励设计复杂,过度优化
具身机器人(模仿学习)实验室高(>90%)真实环境低(<50%)遥操作示范一般视觉域迁移、接触力控
端到端自动驾驶简单路况高复杂城区低–中海量路采数据关键场景覆盖长尾场景、安全验证
注:成功率的绝对值高度依赖任务定义,必须基于一致基准进行对比。所有数值为行业观察估算,截至 2024 年。

6. 上游

  • 任务与基准设计:场景生成引擎、任务构建工具(例如 WebArena、Habitat、SAPIEN),为成功率评测提供标准化环境。
  • 模拟与仿真平台:如 NVIDIA Isaac Sim、CARLA 等,用于低成本、可重复的高吞吐量评测,降低实机实验费用。
  • 人工标注与验收信号:标注成功/失败、部分成功、子目标达成,是构建训练数据与真实环境验收的基石。众包平台如 Scale AI、Surge 等提供此类服务。
  • 专家示范数据:遥操作录制、人类操作日志,用于行为克隆或离线强化学习,直接影响模仿学习类方法的成功率上限。
  • 算力与基础设施:大规模并行模拟与模型训练依赖高性能 GPU 集群,上游代表为英伟达、AMD 及云服务商。

7. 下游

  • 自动驾驶出行:任务成功率转化为无干预里程、载客安全运营里程。Waymo 已在旧金山、凤凰城提供收费 robottaxi 服务,其安全记录与脱离率直接决定运营许可。根据加州 DMV 2023 年度报告,Waymo 在加州道路实测每百万英里安全脱离率约 0.62 次(来源:California DMV, 2023 Disengagement Reports)。
  • 仓储与制造机器人:任务成功率决定能否实现 1:1 人力替换,如分拣成功率 > 99.5% 才具备经济性。Covariant、Figure、特斯拉 Optimus 均以此为关键 KPI。
  • AI 客服与数字员工:端到端解决率(一次解答、无需转人工)是任务成功率的业务化身。行业头部水平约为 70%–85%(来源:公开行业调研,2024 年),每提升 1 个百分点对应显著人力成本节省。
  • 自动软件工程:基于 SWE-bench 等基准的补丁生成成功率直接影响能否在真实代码库部署。截至 2024 年 7 月,SWE-bench Lite 排行榜最高成功率为 26% 左右(来源:SWE-bench 公开排行榜)。
  • 个人助理与端侧 Agent:如 Apple Intelligence、Samsung Gauss 等,在保证隐私的前提下,任务成功率将决定端侧智能的用户粘性。

8. 受益公司

  • AI 平台层:OpenAI、Anthropic、Google DeepMind、Meta 等,通过不断拉升 Agent 任务成功率巩固模型与平台价值,推动 API 调用与商业合作。
  • 自动驾驶运营商:Waymo(Alphabet)、Cruise(GM)、特斯拉、百度 Apollo 等,任务成功率(无干预里程)是获取运营许可和用户信任的硬通货。
  • 具身智能公司:Figure、Physical Intelligence、Skild AI、1X Technologies 等,以特定场景操作成功率作为融资和商业验证的核心叙事。
  • RPA 与企业自动化:UiPath、ServiceNow、微软,将 AI Agent 成功率整合进 SLA(服务水平协议),提升合同价值与续约率。
  • 垂直应用集成商:西门子(工业自动化)、达芬奇手术机器人(Intuitive)等,在高价值场景中,高成功率意味着直接的生命财产安全保障。 注:此处仅为产业链分析,不构成任何投资建议。

9. 市场规模

围绕任务成功率提升与评测的市场,分散于 AI 平台、仿真测试与安全验证等细分领域。

  • AI Agent 市场:根据 MarketsandMarkets 2024 年 1 月发布的报告,全球 AI Agent 市场规模预计从 2024 年的 51 亿美元增长至 2030 年的 471 亿美元,年复合增长率约 44.8%(来源:MarketsandMarkets, AI Agents Market - Global Forecast to 2030, 2024 年 1 月)。该市场涵盖以任务自动化为核心的软件与服务。
  • 智能自动化市场:Grand View Research 2024 年报告指出,2023 年全球智能自动化市场规模约为 832 亿美元,预计 2030 年达到 2010 亿美元(来源:Grand View Research, Smart Automation Market Size Report, 2024 年)。此市场包含 RPA、智能文档处理以及 AI Agent 模块。
  • 仿真与测试工具:专门面向任务成功率评测的赛道仍然细碎,公开资料未见具有公信力的独立市场规模数据。该环节目前主要作为仿真软件(如 NVIDIA Omniverse)或 MLOps 平台的功能模块存在。
  • 关键需求驱动:劳动力成本上升、复杂制造自动化、自动驾驶商业化与安全监管升级,共同推高对“可量化、可保证的任务成功率”的投入,需求侧呈现出抗周期增长特质。

10. 玩家对比

以下对比聚焦于不同领域代表性玩家的任务成功率相关指标,所有数据均来自已公开的报告或官方发布,时间截至 2024 年第三季度。

组织 / 产品评测域指标数值来源与时间说明
OpenAI GPT-4o + SWE-agentSWE-bench Lite补丁生成成功率 (Pass@1)23%SWE-bench 排行榜,2024 年 7 月代表通用模型 Agent 在该基准的公开领先水平
Cognition DevinSWE-bench任务成功率13.86%(首次发布)官方博客,2024 年 3 月引发业界对 AI 软件工程师的广泛讨论,后续声称有提升
Anthropic Claude 3.5 SonnetSWE-bench Verified成功率49.0%官方博客,2024 年 6 月Verified 子集剔除了标注噪音,数值偏高
Waymo城市自动驾驶(加州)安全脱离率(每百万英里)0.62加州 DMV,2023反映成熟系统在限定区域的可靠性
Tesla FSD v12城市自动驾驶干预里程(众包估算)约 116 英里/干预Tesla FSD Community Tracker,2024Q1非官方数据,存在统计偏差
Figure 02仓储搬运任务成功率(特定操作)>90%公司视频/演示,2024无独立三方基准,实际泛化水平待验证
Covariant机器人分拣分拣成功率>99%(商品)公司案例研究,2024商业部署数据,非公开基准,限定 SKU 范围

注意:不同域的指标定义无法直接横向对比,需结合作业环境和后果严重度综合解读。

11. 风险

  • “成功率通胀”与基准过拟合:公开排行榜面临数据泄露和过度优化的风险,排行榜上的高成功率并不等同于真实分布下的成功率。部分公司可能通过选择有利任务子集美化指标。
  • sim-to-real 鸿沟:仿真环境中高达 95% 的成功率,迁移到真实环境后可能腰斩。域随机化和真实数据微调可缓解,但难以根除。
  • 长尾困境:安全攸关系统面临的极端场景出现概率极低,但对成功率影响致命。仅靠数据驱动方法难以保证 10⁻⁶ 以下的失效率,必须引入形式化验证与冗余架构。
  • 评估体系碎片化:不同企业、不同行业采用不同基准、不同定义,缺乏统一的第三方权威评测,导致投资比较与采购决策困难。
  • 过度依赖成功率掩盖真实人力成本:有些系统通过频繁请求人类介入维持高“名义成功率”,实则变相增加运营成本,背离自动化初衷。
  • 伦理与责任归属:当 AI Agent 任务失败造成损失,责任划分(开发者、集成商、用户)存在法律灰色地带,可能延缓高价值场景的部署。

12. 误读纠偏

  • 误读 1:“准确率高就等于任务成功率高” 准确率通常衡量单一决策点的正确率(如分类、实体抽取),而任务成功率评估的是端到端目标达成。一个问答系统可在检索步骤拿到高准确率,却因缺乏多跳推理能力而无法解决用户真实问题,高准确率、低任务成功率是常态。必须坚持全链路、面向目标、基于验收信号的测试。
  • 误读 2:“99% 的任务成功率足够好了” 对高频、低后果场景(如每日数十万次的商品推荐)或许可以接受,但对日均万次的客服对话,1% 的失败意味着每天 100 次严重错误,易引发信任危机。自动驾驶领域,美国年行车里程约 3.2 万亿英里(来源:美国联邦公路管理局,2022 年),若每亿英里发生一次致命事故,99% 的数字远不足满足安全要求,通常需要 6 个 9 以上的可靠性。成功率要求必须结合失败成本与频次来制定。
  • 误读 3:“仿真中不断拉高成功率,就能自然迁移到现实” Sim-to-Real gap 是核心挑战。仿真成功率高可能只是模型记住了非真实的视觉纹理或物理参数。必须通过域随机化、构造对抗性场景以及闭环的真实世界持续微调,才能实现有效迁移,决不能以仿真成功率为唯一信心来源。
  • 误读 4:“任务成功率是静态的,一次通过终身有效” 真实世界分布会漂移(数据漂移、环境变化、用户行为演变),昨日 95% 的成功率可能半年后跌至 70%。持续监控、灰度部署和自动化回归测试平台是维持成功率的必选项。

13. 最新事件

以下为 2024 年至 2025 年初与任务成功率显著相关的动态(按时间排序):

  • 2024 年 3 月,Cognition AI 发布 Devin:宣称在 SWE-bench 完整集上实现 13.86% 的首次成功率,展现 AI 自主完成软件工程任务的潜力,引发行业对“AI 程序员取代人类”的辩论。(来源:Cognition 官方博客)
  • 2024 年 5 月,OpenAI 推出 GPT-4o:多模态实时交互能力显著增强,结合 Agent 架构后,在多项第三方任务基准中刷新成功率。(来源:OpenAI 发布会)
  • 2024 年 6 月,Anthropic 发布 Claude 3.5 Sonnet:在 SWE-bench Verified 上取得 49% 的任务成功率,为当时公开最佳成绩,展示了语言模型在复杂代码任务上的进度。(来源:Anthropic 官方博客)
  • 2024 年 9 月,OpenAI 发布 o1 模型系列:强化推理时计算,o1-preview 在 2024 年 AIME 数学竞赛中解决率达 56%(GPT-4o 仅 13%),在物理、化学等需要多步推理的任务中成功率大幅提升。(来源:OpenAI o1 系统卡,2024 年 9 月)
  • 2024 年 10 月,特斯拉 FSD 迭代至 v12.5:根据众包追踪数据,城市道路每干预里程提升至超过 200 英里(非官方估算),进一步接近 robotaxi 所需的无干预运行水平。(来源:Tesla FSD Community Tracker, 2024Q3)
  • 2024 年末,具身智能多项进展:Skild AI 与 Physical Intelligence 分别展示机器人在多样化家庭、仓库操作任务中的成功率突破,部分场景超越 80%,融资额大幅增长,但详细基准仍为闭源状态。(来源:公司官网与媒体通稿)

14. 跟踪指标

若需持续评估产业中任务成功率的技术成熟度与商业可用度,建议关注以下指标与信源:

  • 公开基准排行榜:SWE-bench(软件工程)、WebArena(网页 Agent)、AgentBench(通用 Agent)、ALFWorld(具身语言)等,跟踪每月排名与绝对值变化。
  • 自动驾驶脱离报告:加州 DMV 年度报告、中国各地自动驾驶测试报告,关注无干预里程趋势。
  • 企业产品 SLA 与透明度报告:UiPath、ServiceNow、微软等在其 Agent 化产品线中公布的任务成功指标及 SLA 条款,可反映商业可接受度。
  • 学术会议录稿:NeurIPS、ICLR、CVPR 中关于成功率提升的新方法与基准,尤其关注 sim-to-real 迁移和长程任务方向的突破。
  • 初创企业实机演示与三方复现:关注具身智能和 Agent 公司的 uncut 演示视频及社区的独立复现测试,避免被剪辑后的高成功率误导。
  • 监管与标准进展:ISO 26262、UL 4600 以及新兴的 AI Agent 测试标准,将直接影响高可靠性市场的准入要求。

15. 信源

  • 学术论文
    • “SWE-bench: Can Language Models Resolve Real-World GitHub Issues?” (Jimenez et al., 2024)
    • “Hindsight Experience Replay” (Andrychowicz et al., 2017)
    • “WebArena: A Realistic Web Environment for Building Autonomous Agents” (Zhou et al., 2024)
  • 基准与排行榜
    • SWE-bench 官方排行榜(swebench.com)
    • AgentBench 项目(agentbench.github.io)
  • 产业报告
    • MarketsandMarkets, AI Agents Market – Global Forecast to 2030, 2024 年 1 月
    • Grand View Research, Smart Automation Market Size, Share & Trends Analysis Report, 2024 年
    • Gartner, Top Strategic Technology Trends 2024: Agentic AI, 2023 年 10 月
  • 官方安全披露
    • Waymo Safety Report, 2023–2024 年
    • California DMV, Autonomous Vehicle Disengagement Reports, 2023 年
    • NHTSA Standing General Order on Crash Reporting for ADS and L2 ADAS, 2022 年修订
  • 产业分析文章
    • a16z, The State of AI Agents 系列文章, 2024 年
    • OpenAI, Introducing o1-preview 系统卡, 2024 年 9 月
    • Anthropic, Claude 3.5 Sonnet Model Card, 2024 年 6 月

注:本文部分细分领域数据暂未在公开渠道获取精确数字,已标注“公开资料未见”。所有涉及公司的表述均基于已公开信息,不构成投资建议。

source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型