模型層 開放閱讀

任務成功率

Task Success Rate

概念 ID
task-success-rate
更新時間
2026-05-29
來源數量
待補

任務成功率

1. 3 秒看懂

  • 是什麼:任務成功率(Task Success Rate, TSR)衡量一個智慧系統(AI Agent、機器人、自動駕駛汽車、對話模型等)在獨立嘗試中完成既定目標的比例,即成功次數除以總嘗試次數。
  • 為什麼重要:它是判斷 AI 系統“可用不可用”的最終標尺。演示驚豔但成功率低迷,就無法走出實驗室。任務成功率直接對映為商業指標:訂單完成率、無干預里程、客戶滿意率等。
  • 核心公式:TSR = 成功次數 / 總嘗試次數。成功條件預先由人的需求或環境驗收訊號定義,通常為二值(成功/失敗),也可引入部分成功分數。
  • 關鍵的 50% 與 99%:從 50% 到 90% 是原型驗證,從 90% 到 99% 是工程攻堅,從 99% 到 99.999% 是安全攸關係統(航空、手術、無人駕駛)的生死線。每多一個“9”,投入往往呈指數級增長。

2. 3 分鐘產業解釋

產業語境中,任務成功率已取代傳統的準確率(Accuracy)或 F1 值,成為衡量 AI 產品成熟度的第一儀表。以對話式 AI 為例,語音識別詞準確率可達 99%,但端到端任務(如“訂一張從北京出發的最早航班”)成功率可能不足 60%,因為任務鏈中任一子步驟(意圖理解、引數提取、API 呼叫、異常處理)出錯都會導致整體失敗。因此:

  • 大型模型 Agent 公司(OpenAI、Anthropic、Google DeepMind)通過 WebArena、SWE-bench 等長程複雜環境下的任務成功率來標榜模型智慧化水平與工程實力。
  • 具身智慧與人形機器人領域,通用操作的任務成功率是比“平均干預間隔”更硬的終極指標,直接說明能否替代人工。
  • 自動駕駛中,安全脫離(disengagement)反映的是“不失敗”機率,Waymo、特斯拉等均將無干預行駛里程作為任務成功率的類比指標。
  • 產業趨勢:評估重心從實驗室單點指標(如 ImageNet Top-1)轉向真實世界端到端、長程任務成功率,已是一級市場為 AI 企業定價的核心維度之一。諮詢機構 Gartner 在《Top Strategic Technology Trends 2024》中將代理 AI(Agentic AI)列為戰略趨勢,並預測到 2027 年超過 40% 的企業應用將嵌入某種形式的 AI Agent(來源:Gartner,2023 年 10 月)。

3. 技術原理(最深)

3.1 形式化定義

給定任務 T,狀態空間 S,動作空間 A,初始狀態分佈 ρ₀,環境轉移機率 P(s’|s,a),成功判定函式 Success(s) ∈ {0,1},策略 π(a|s)。任務成功率為:

SR(π) = E_{s0~ρ₀} [ 1_{最終狀態為成功} ]

在非確定性或部分可觀測環境中,成功率通過對大量 rollout 取頻率來逼近。

3.2 與損失函式的關係

監督學習常用交叉熵損失,但序列決策中高似然未必帶來高成功率,錯誤累積會使成功率崩潰。強化學習直接最佳化成功率依賴稀疏獎勵:R = 1 若成功 else 0。稀疏獎勵極難訓練,因此衍生出獎勵塑形(Reward Shaping)、事後經驗回放(HER)等技術。HER 核心思想是把“未達到原始目標的嘗試”當成“達到某個虛擬目標的成功經驗”來利用,是提升機器人和 Agent 任務成功率的經典手段。

3.3 LLM Agent 的成功率鏈式分解

LLM Agent 任務流:觀察 → 思考(鏈式推論)→ 工具呼叫 → 環境反饋,迴圈往復。整體成功率受三個子機率制約:規劃成功率 × 工具呼叫成功率 × 錯誤恢復成功率。實驗表明,步數超過 10 的長程 Agent 任務成功率呈超指數下降。改進路徑包括:結構化思考樹(Tree-of-Thoughts)、外部記憶增強、規劃器–執行器分離架構。

3.4 整體閉環示意

┌──────────────────┐   觀察/反饋    ┌──────────────────┐
│  環境 / 任務模擬  │◄─────────────│     AI Agent      │
│  (Web環境/物理世界) │  動作/工具呼叫 │ (策略 π + 記憶)   │
└────────┬─────────┘              └────────┬─────────┘
         │ 成功/失敗/部分分數               │ 規劃、推論、自我修正
         └──────────────────────────────────┘

3.5 置信度與統計嚴謹性

小樣本成功率極易產生誤導。例如 10 次成功 9 次,真實成功率 95% 置信區間可能寬至 [55%, 100%](估算)。工業界正推廣序列機率比檢驗(SPRT)方法,在間隔測試中持續監控、僅在成功率穩定高於閾值時才放行上線,以降低“假高成功率”帶來的風險。

4. 關鍵引數

  • Success Rate @1 / @k:@1 為單次嘗試成功率,是硬指標;@k 允許多次嘗試取最佳結果,衡量模型校準與搜尋寬度,但可能高估實用體驗。
  • 部分成功度量:用 0~1 連續分數替代二值判定,更適合“不完美資訊”或結果可部分使用的任務。
  • 任務難度分級:通常按人類表現分 L1(簡單,人類成功率 >95%)、L2(中等,50%–95%)、L3(困難,<50%),在該分級下對比 AI 成功率才有意義。
  • 人工歸一化成功率(Human Normalized SR):AI 成功率 ÷ 人類平均成功率,消除任務難度差異,便於跨基準比較。
  • 平均故障間隔(MTBF):持續執行場景中,兩次失敗之間的平均時長/操作次數,源自可靠性工程,適合工業自動化評估。
  • 成功誤報率:系統聲稱成功但實際失敗的比例,在安全攸關係統必須趨近於零。
  • 無協助成功率:剔除人類干預後的淨成功率,避免“高成功率”被頻繁求助稀釋。

5. 技術路線

5.1 技術演進史

  1. 規則系統時代(—2010):手工 if-else 覆蓋窄領域,成功率在封閉域極高,但開放域幾乎為零。
  2. 深度學習單任務時代(2012—2018):影像分類、語音識別等單步任務成功率(準確率)超越人類;但序列決策任務依然困難。
  3. 預訓練+微調時代(2018—2022):BERT/GPT 等使 NLP 單步任務成功率逼近人類,但無法應對互動式多步任務。
  4. 大型模型 Agent 時代(2023—至今):Agent 架構將成功率帶入長程互動域。SWE-bench 上補丁生成成功率從接近零攀升至百分之二十幾;具身智慧基於 RT-2、Octo 等模型在特定操作場景成功率從個位數提升到百分之幾十。
  5. 未來方向:向多智慧代理協同、超長程(>1000 步)、安全攸關(手術、航空)領域延伸,量化成功率保證將成為合規上市的必要條件。

5.2 技術路線定性對比

技術路線簡單任務成功率(估計)長程/複雜任務成功率(估計)資料/訓練需求泛化代價關鍵瓶頸
手工規則系統極高(封閉域)極低(開放域)專家知識幾乎為零無法處理未見情況
小模型微調(BERT類)中高(>80%)低(<30%)數千標註樣本中等序列決策能力缺失
RPA/傳統自動化高(固定流程)低(流程變更即失效)流程配置極差非結構化資訊乏力
LLM Agent(無微調)中(50–80%)低–中(10–50%)少量示例極好幻覺、規劃漂移、工具誤用
微調/RLHF Agent高(>80%)中(30–60%)大量互動/偏好資料良好獎勵設計複雜,過度最佳化
具身機器人(模仿學習)實驗室高(>90%)真實環境低(<50%)遙操作示範一般視覺域遷移、接觸力控
端到端自動駕駛簡單路況高複雜城區低–中海量路採資料關鍵場景覆蓋長尾場景、安全驗證
注:成功率的絕對值高度依賴任務定義,必須基於一致基準進行對比。所有數值為行業觀察估算,截至 2024 年。

6. 上游

  • 任務與基準設計:場景生成引擎、任務建置工具(例如 WebArena、Habitat、SAPIEN),為成功率評測提供標準化環境。
  • 模擬與模擬平台:如 NVIDIA Isaac Sim、CARLA 等,用於低成本、可重複的高吞吐量評測,降低實機實驗費用。
  • 人工標註與驗收訊號:標註成功/失敗、部分成功、子目標達成,是建置訓練資料與真實環境驗收的基石。眾包平台如 Scale AI、Surge 等提供此類服務。
  • 專家示範資料:遙操作錄製、人類操作日誌,用於行為克隆或離線強化學習,直接影響模仿學習類方法的成功率上限。
  • 算力與基礎設施:大規模並行模擬與模型訓練依賴高效能 GPU 叢集,上游代表為輝達、AMD 及雲端服務商。

7. 下游

  • 自動駕駛出行:任務成功率轉化為無干預里程、載客安全運營里程。Waymo 已在舊金山、鳳凰城提供收費 robottaxi 服務,其安全記錄與脫離率直接決定運營許可。根據加州 DMV 2023 年度報告,Waymo 在加州道路實測每百萬英里安全脫離率約 0.62 次(來源:California DMV, 2023 Disengagement Reports)。
  • 倉儲與製造機器人:任務成功率決定能否實現 1:1 人力替換,如分揀成功率 > 99.5% 才具備經濟性。Covariant、Figure、特斯拉 Optimus 均以此為關鍵 KPI。
  • AI 客服與數字員工:端到端解決率(一次解答、無需轉人工)是任務成功率的業務化身。行業頭部水平約為 70%–85%(來源:公開行業調研,2024 年),每提升 1 個百分點對應顯著人力成本節省。
  • 自動軟體工程:基於 SWE-bench 等基準的補丁生成成功率直接影響能否在真實程式碼庫部署。截至 2024 年 7 月,SWE-bench Lite 排行榜最高成功率為 26% 左右(來源:SWE-bench 公開排行榜)。
  • 個人助理與端側 Agent:如 Apple Intelligence、Samsung Gauss 等,在保證隱私的前提下,任務成功率將決定端側智慧的使用者粘性。

8. 受益公司

  • AI 平台層:OpenAI、Anthropic、Google DeepMind、Meta 等,通過不斷拉昇 Agent 任務成功率鞏固模型與平台價值,推動 API 呼叫與商業合作。
  • 自動駕駛運營商:Waymo(Alphabet)、Cruise(GM)、特斯拉、百度 Apollo 等,任務成功率(無干預里程)是獲取運營許可和使用者信任的硬通貨。
  • 具身智慧公司:Figure、Physical Intelligence、Skild AI、1X Technologies 等,以特定場景操作成功率作為融資和商業驗證的核心敘事。
  • RPA 與企業自動化:UiPath、ServiceNow、微軟,將 AI Agent 成功率整合進 SLA(服務水平協議),提升合同價值與續約率。
  • 垂直應用整合商:西門子(工業自動化)、達芬奇手術機器人(Intuitive)等,在高價值場景中,高成功率意味著直接的生命財產安全保障。 注:此處僅為產業鏈分析,不構成任何投資建議。

9. 市場規模

圍繞任務成功率提升與評測的市場,分散於 AI 平台、模擬測試與安全驗證等細分領域。

  • AI Agent 市場:根據 MarketsandMarkets 2024 年 1 月釋出的報告,全球 AI Agent 市場規模預計從 2024 年的 51 億美元增長至 2030 年的 471 億美元,年複合增長率約 44.8%(來源:MarketsandMarkets, AI Agents Market - Global Forecast to 2030, 2024 年 1 月)。該市場涵蓋以任務自動化為核心的軟體與服務。
  • 智慧自動化市場:Grand View Research 2024 年報告指出,2023 年全球智慧自動化市場規模約為 832 億美元,預計 2030 年達到 2010 億美元(來源:Grand View Research, Smart Automation Market Size Report, 2024 年)。此市場包含 RPA、智慧文件處理以及 AI Agent 模組。
  • 模擬與測試工具:專門面向任務成功率評測的賽道仍然細碎,公開資料未見具有公信力的獨立市場規模資料。該環節目前主要作為模擬軟體(如 NVIDIA Omniverse)或 MLOps 平台的功能模組存在。
  • 關鍵需求驅動:勞動力成本上升、複雜製造自動化、自動駕駛商業化與安全監管升級,共同推高對“可量化、可保證的任務成功率”的投入,需求側呈現出抗週期增長特質。

10. 玩家對比

以下對比聚焦於不同領域代表性玩家的任務成功率相關指標,所有資料均來自已公開的報告或官方釋出,時間截至 2024 年第三季度。

組織 / 產品評測域指標數值來源與時間說明
OpenAI GPT-4o + SWE-agentSWE-bench Lite補丁生成成功率 (Pass@1)23%SWE-bench 排行榜,2024 年 7 月代表通用模型 Agent 在該基準的公開領先水平
Cognition DevinSWE-bench任務成功率13.86%(首次釋出)官方部落格,2024 年 3 月引發業界對 AI 軟體工程師的廣泛討論,後續聲稱有提升
Anthropic Claude 3.5 SonnetSWE-bench Verified成功率49.0%官方部落格,2024 年 6 月Verified 子集剔除了標註噪音,數值偏高
Waymo城市自動駕駛(加州)安全脫離率(每百萬英里)0.62加州 DMV,2023反映成熟系統在限定區域的可靠性
Tesla FSD v12城市自動駕駛干預里程(眾包估算)約 116 英里/干預Tesla FSD Community Tracker,2024Q1非官方資料,存在統計偏差
Figure 02倉儲搬運任務成功率(特定操作)>90%公司影片/演示,2024無獨立三方基準,實際泛化水平待驗證
Covariant機器人分揀分揀成功率>99%(商品)公司案例研究,2024商業部署資料,非公開基準,限定 SKU 範圍

注意:不同域的指標定義無法直接橫向對比,需結合作業環境和後果嚴重度綜合解讀。

11. 風險

  • “成功率通脹”與基準過擬合:公開排行榜面臨資料洩露和過度最佳化的風險,排行榜上的高成功率並不等同於真實分佈下的成功率。部分公司可能通過選擇有利任務子集美化指標。
  • sim-to-real 鴻溝:模擬環境中高達 95% 的成功率,遷移到真實環境後可能腰斬。域隨機化和真實資料微調可緩解,但難以根除。
  • 長尾困境:安全攸關係統面臨的極端場景出現機率極低,但對成功率影響致命。僅靠資料驅動方法難以保證 10⁻⁶ 以下的失效率,必須引入形式化驗證與冗餘架構。
  • 評估體系碎片化:不同企業、不同行業採用不同基準、不同定義,缺乏統一的第三方權威評測,導致投資比較與採購決策困難。
  • 過度依賴成功率掩蓋真實人力成本:有些系統通過頻繁請求人類介入維持高“名義成功率”,實則變相增加運營成本,背離自動化初衷。
  • 倫理與責任歸屬:當 AI Agent 任務失敗造成損失,責任劃分(開發者、整合商、使用者)存在法律灰色地帶,可能延緩高價值場景的部署。

12. 誤讀糾偏

  • 誤讀 1:“準確率高就等於任務成功率高” 準確率通常衡量單一決策點的正確率(如分類、實體抽取),而任務成功率評估的是端到端目標達成。一個問答系統可在檢索步驟拿到高準確率,卻因缺乏多跳推論能力而無法解決使用者真實問題,高準確率、低任務成功率是常態。必須堅持全鏈路、面向目標、基於驗收訊號的測試。
  • 誤讀 2:“99% 的任務成功率足夠好了” 對高頻、低後果場景(如每日數十萬次的商品推薦)或許可以接受,但對日均萬次的客服對話,1% 的失敗意味著每天 100 次嚴重錯誤,易引發信任危機。自動駕駛領域,美國年行車裡程約 3.2 萬億英里(來源:美國聯邦公路管理局,2022 年),若每億英里發生一次致命事故,99% 的數字遠不足滿足安全要求,通常需要 6 個 9 以上的可靠性。成功率要求必須結合失敗成本與頻次來制定。
  • 誤讀 3:“模擬中不斷拉高成功率,就能自然遷移到現實” Sim-to-Real gap 是核心挑戰。模擬成功率高可能只是模型記住了非真實的視覺紋理或物理引數。必須通過域隨機化、構造對抗性場景以及閉環的真實世界持續微調,才能實現有效遷移,決不能以模擬成功率為唯一信心來源。
  • 誤讀 4:“任務成功率是靜態的,一次通過終身有效” 真實世界分佈會漂移(資料漂移、環境變化、使用者行為演變),昨日 95% 的成功率可能半年後跌至 70%。持續監控、灰度部署和自動化迴歸測試平台是維持成功率的必選項。

13. 最新事件

以下為 2024 年至 2025 年初與任務成功率顯著相關的動態(按時間排序):

  • 2024 年 3 月,Cognition AI 釋出 Devin:宣稱在 SWE-bench 完整集上實現 13.86% 的首次成功率,展現 AI 自主完成軟體工程任務的潛力,引發行業對“AI 程式設計師取代人類”的辯論。(來源:Cognition 官方部落格)
  • 2024 年 5 月,OpenAI 推出 GPT-4o:多模態即時互動能力顯著增強,結合 Agent 架構後,在多項第三方任務基準中重新整理成功率。(來源:OpenAI 釋出會)
  • 2024 年 6 月,Anthropic 釋出 Claude 3.5 Sonnet:在 SWE-bench Verified 上取得 49% 的任務成功率,為當時公開最佳成績,展示了語言模型在複雜程式碼任務上的進度。(來源:Anthropic 官方部落格)
  • 2024 年 9 月,OpenAI 釋出 o1 模型系列:強化推論時計算,o1-preview 在 2024 年 AIME 數學競賽中解決率達 56%(GPT-4o 僅 13%),在物理、化學等需要多步推論的任務中成功率大幅提升。(來源:OpenAI o1 系統卡,2024 年 9 月)
  • 2024 年 10 月,特斯拉 FSD 迭代至 v12.5:根據眾包追蹤資料,城市道路每干預里程提升至超過 200 英里(非官方估算),進一步接近 robotaxi 所需的無干預執行水平。(來源:Tesla FSD Community Tracker, 2024Q3)
  • 2024 年末,具身智慧多項進展:Skild AI 與 Physical Intelligence 分別展示機器人在多樣化家庭、倉庫操作任務中的成功率突破,部分場景超越 80%,融資額大幅增長,但詳細基準仍為閉源狀態。(來源:公司官網與媒體通稿)

14. 追蹤指標

若需持續評估產業中任務成功率的技術成熟度與商業可用度,建議關注以下指標與信源:

  • 公開基準排行榜:SWE-bench(軟體工程)、WebArena(網頁 Agent)、AgentBench(通用 Agent)、ALFWorld(具身語言)等,追蹤每月排名與絕對值變化。
  • 自動駕駛脫離報告:加州 DMV 年度報告、中國各地自動駕駛測試報告,關注無干預里程趨勢。
  • 企業產品 SLA 與透明度報告:UiPath、ServiceNow、微軟等在其 Agent 化產品線中公佈的任務成功指標及 SLA 條款,可反映商業可接受度。
  • 學術會議錄稿:NeurIPS、ICLR、CVPR 中關於成功率提升的新方法與基準,尤其關注 sim-to-real 遷移和長程任務方向的突破。
  • 初創企業實機演示與三方復現:關注具身智慧和 Agent 公司的 uncut 演示影片及社群的獨立復現測試,避免被剪輯後的高成功率誤導。
  • 監管與標準進展:ISO 26262、UL 4600 以及新興的 AI Agent 測試標準,將直接影響高可靠性市場的准入要求。

15. 信源

  • 學術論文
    • “SWE-bench: Can Language Models Resolve Real-World GitHub Issues?” (Jimenez et al., 2024)
    • “Hindsight Experience Replay” (Andrychowicz et al., 2017)
    • “WebArena: A Realistic Web Environment for Building Autonomous Agents” (Zhou et al., 2024)
  • 基準與排行榜
    • SWE-bench 官方排行榜(swebench.com)
    • AgentBench 專案(agentbench.github.io)
  • 產業報告
    • MarketsandMarkets, AI Agents Market – Global Forecast to 2030, 2024 年 1 月
    • Grand View Research, Smart Automation Market Size, Share & Trends Analysis Report, 2024 年
    • Gartner, Top Strategic Technology Trends 2024: Agentic AI, 2023 年 10 月
  • 官方安全揭露
    • Waymo Safety Report, 2023–2024 年
    • California DMV, Autonomous Vehicle Disengagement Reports, 2023 年
    • NHTSA Standing General Order on Crash Reporting for ADS and L2 ADAS, 2022 年修訂
  • 產業分析文章
    • a16z, The State of AI Agents 系列文章, 2024 年
    • OpenAI, Introducing o1-preview 系統卡, 2024 年 9 月
    • Anthropic, Claude 3.5 Sonnet Model Card, 2024 年 6 月

注:本文部分細分領域資料暫未在公開渠道獲取精確數字,已標註“公開資料未見”。所有涉及公司的表述均基於已公開資訊,不構成投資建議。

source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型