任務成功率
1. 3 秒看懂
- 是什麼:任務成功率(Task Success Rate, TSR)衡量一個智慧系統(AI Agent、機器人、自動駕駛汽車、對話模型等)在獨立嘗試中完成既定目標的比例,即成功次數除以總嘗試次數。
- 為什麼重要:它是判斷 AI 系統“可用不可用”的最終標尺。演示驚豔但成功率低迷,就無法走出實驗室。任務成功率直接對映為商業指標:訂單完成率、無干預里程、客戶滿意率等。
- 核心公式:TSR = 成功次數 / 總嘗試次數。成功條件預先由人的需求或環境驗收訊號定義,通常為二值(成功/失敗),也可引入部分成功分數。
- 關鍵的 50% 與 99%:從 50% 到 90% 是原型驗證,從 90% 到 99% 是工程攻堅,從 99% 到 99.999% 是安全攸關係統(航空、手術、無人駕駛)的生死線。每多一個“9”,投入往往呈指數級增長。
2. 3 分鐘產業解釋
產業語境中,任務成功率已取代傳統的準確率(Accuracy)或 F1 值,成為衡量 AI 產品成熟度的第一儀表。以對話式 AI 為例,語音識別詞準確率可達 99%,但端到端任務(如“訂一張從北京出發的最早航班”)成功率可能不足 60%,因為任務鏈中任一子步驟(意圖理解、引數提取、API 呼叫、異常處理)出錯都會導致整體失敗。因此:
- 大型模型 Agent 公司(OpenAI、Anthropic、Google DeepMind)通過 WebArena、SWE-bench 等長程複雜環境下的任務成功率來標榜模型智慧化水平與工程實力。
- 具身智慧與人形機器人領域,通用操作的任務成功率是比“平均干預間隔”更硬的終極指標,直接說明能否替代人工。
- 自動駕駛中,安全脫離(disengagement)反映的是“不失敗”機率,Waymo、特斯拉等均將無干預行駛里程作為任務成功率的類比指標。
- 產業趨勢:評估重心從實驗室單點指標(如 ImageNet Top-1)轉向真實世界端到端、長程任務成功率,已是一級市場為 AI 企業定價的核心維度之一。諮詢機構 Gartner 在《Top Strategic Technology Trends 2024》中將代理 AI(Agentic AI)列為戰略趨勢,並預測到 2027 年超過 40% 的企業應用將嵌入某種形式的 AI Agent(來源:Gartner,2023 年 10 月)。
3. 技術原理(最深)
3.1 形式化定義
給定任務 T,狀態空間 S,動作空間 A,初始狀態分佈 ρ₀,環境轉移機率 P(s’|s,a),成功判定函式 Success(s) ∈ {0,1},策略 π(a|s)。任務成功率為:
SR(π) = E_{s0~ρ₀} [ 1_{最終狀態為成功} ]
在非確定性或部分可觀測環境中,成功率通過對大量 rollout 取頻率來逼近。
3.2 與損失函式的關係
監督學習常用交叉熵損失,但序列決策中高似然未必帶來高成功率,錯誤累積會使成功率崩潰。強化學習直接最佳化成功率依賴稀疏獎勵:R = 1 若成功 else 0。稀疏獎勵極難訓練,因此衍生出獎勵塑形(Reward Shaping)、事後經驗回放(HER)等技術。HER 核心思想是把“未達到原始目標的嘗試”當成“達到某個虛擬目標的成功經驗”來利用,是提升機器人和 Agent 任務成功率的經典手段。
3.3 LLM Agent 的成功率鏈式分解
LLM Agent 任務流:觀察 → 思考(鏈式推論)→ 工具呼叫 → 環境反饋,迴圈往復。整體成功率受三個子機率制約:規劃成功率 × 工具呼叫成功率 × 錯誤恢復成功率。實驗表明,步數超過 10 的長程 Agent 任務成功率呈超指數下降。改進路徑包括:結構化思考樹(Tree-of-Thoughts)、外部記憶增強、規劃器–執行器分離架構。
3.4 整體閉環示意
┌──────────────────┐ 觀察/反饋 ┌──────────────────┐
│ 環境 / 任務模擬 │◄─────────────│ AI Agent │
│ (Web環境/物理世界) │ 動作/工具呼叫 │ (策略 π + 記憶) │
└────────┬─────────┘ └────────┬─────────┘
│ 成功/失敗/部分分數 │ 規劃、推論、自我修正
└──────────────────────────────────┘
3.5 置信度與統計嚴謹性
小樣本成功率極易產生誤導。例如 10 次成功 9 次,真實成功率 95% 置信區間可能寬至 [55%, 100%](估算)。工業界正推廣序列機率比檢驗(SPRT)方法,在間隔測試中持續監控、僅在成功率穩定高於閾值時才放行上線,以降低“假高成功率”帶來的風險。
4. 關鍵引數
- Success Rate @1 / @k:@1 為單次嘗試成功率,是硬指標;@k 允許多次嘗試取最佳結果,衡量模型校準與搜尋寬度,但可能高估實用體驗。
- 部分成功度量:用 0~1 連續分數替代二值判定,更適合“不完美資訊”或結果可部分使用的任務。
- 任務難度分級:通常按人類表現分 L1(簡單,人類成功率 >95%)、L2(中等,50%–95%)、L3(困難,<50%),在該分級下對比 AI 成功率才有意義。
- 人工歸一化成功率(Human Normalized SR):AI 成功率 ÷ 人類平均成功率,消除任務難度差異,便於跨基準比較。
- 平均故障間隔(MTBF):持續執行場景中,兩次失敗之間的平均時長/操作次數,源自可靠性工程,適合工業自動化評估。
- 成功誤報率:系統聲稱成功但實際失敗的比例,在安全攸關係統必須趨近於零。
- 無協助成功率:剔除人類干預後的淨成功率,避免“高成功率”被頻繁求助稀釋。
5. 技術路線
5.1 技術演進史
- 規則系統時代(—2010):手工 if-else 覆蓋窄領域,成功率在封閉域極高,但開放域幾乎為零。
- 深度學習單任務時代(2012—2018):影像分類、語音識別等單步任務成功率(準確率)超越人類;但序列決策任務依然困難。
- 預訓練+微調時代(2018—2022):BERT/GPT 等使 NLP 單步任務成功率逼近人類,但無法應對互動式多步任務。
- 大型模型 Agent 時代(2023—至今):Agent 架構將成功率帶入長程互動域。SWE-bench 上補丁生成成功率從接近零攀升至百分之二十幾;具身智慧基於 RT-2、Octo 等模型在特定操作場景成功率從個位數提升到百分之幾十。
- 未來方向:向多智慧代理協同、超長程(>1000 步)、安全攸關(手術、航空)領域延伸,量化成功率保證將成為合規上市的必要條件。
5.2 技術路線定性對比
| 技術路線 | 簡單任務成功率(估計) | 長程/複雜任務成功率(估計) | 資料/訓練需求 | 泛化代價 | 關鍵瓶頸 |
|---|---|---|---|---|---|
| 手工規則系統 | 極高(封閉域) | 極低(開放域) | 專家知識 | 幾乎為零 | 無法處理未見情況 |
| 小模型微調(BERT類) | 中高(>80%) | 低(<30%) | 數千標註樣本 | 中等 | 序列決策能力缺失 |
| RPA/傳統自動化 | 高(固定流程) | 低(流程變更即失效) | 流程配置 | 極差 | 非結構化資訊乏力 |
| LLM Agent(無微調) | 中(50–80%) | 低–中(10–50%) | 少量示例 | 極好 | 幻覺、規劃漂移、工具誤用 |
| 微調/RLHF Agent | 高(>80%) | 中(30–60%) | 大量互動/偏好資料 | 良好 | 獎勵設計複雜,過度最佳化 |
| 具身機器人(模仿學習) | 實驗室高(>90%) | 真實環境低(<50%) | 遙操作示範 | 一般 | 視覺域遷移、接觸力控 |
| 端到端自動駕駛 | 簡單路況高 | 複雜城區低–中 | 海量路採資料 | 關鍵場景覆蓋 | 長尾場景、安全驗證 |
| 注:成功率的絕對值高度依賴任務定義,必須基於一致基準進行對比。所有數值為行業觀察估算,截至 2024 年。 |
6. 上游
- 任務與基準設計:場景生成引擎、任務建置工具(例如 WebArena、Habitat、SAPIEN),為成功率評測提供標準化環境。
- 模擬與模擬平台:如 NVIDIA Isaac Sim、CARLA 等,用於低成本、可重複的高吞吐量評測,降低實機實驗費用。
- 人工標註與驗收訊號:標註成功/失敗、部分成功、子目標達成,是建置訓練資料與真實環境驗收的基石。眾包平台如 Scale AI、Surge 等提供此類服務。
- 專家示範資料:遙操作錄製、人類操作日誌,用於行為克隆或離線強化學習,直接影響模仿學習類方法的成功率上限。
- 算力與基礎設施:大規模並行模擬與模型訓練依賴高效能 GPU 叢集,上游代表為輝達、AMD 及雲端服務商。
7. 下游
- 自動駕駛出行:任務成功率轉化為無干預里程、載客安全運營里程。Waymo 已在舊金山、鳳凰城提供收費 robottaxi 服務,其安全記錄與脫離率直接決定運營許可。根據加州 DMV 2023 年度報告,Waymo 在加州道路實測每百萬英里安全脫離率約 0.62 次(來源:California DMV, 2023 Disengagement Reports)。
- 倉儲與製造機器人:任務成功率決定能否實現 1:1 人力替換,如分揀成功率 > 99.5% 才具備經濟性。Covariant、Figure、特斯拉 Optimus 均以此為關鍵 KPI。
- AI 客服與數字員工:端到端解決率(一次解答、無需轉人工)是任務成功率的業務化身。行業頭部水平約為 70%–85%(來源:公開行業調研,2024 年),每提升 1 個百分點對應顯著人力成本節省。
- 自動軟體工程:基於 SWE-bench 等基準的補丁生成成功率直接影響能否在真實程式碼庫部署。截至 2024 年 7 月,SWE-bench Lite 排行榜最高成功率為 26% 左右(來源:SWE-bench 公開排行榜)。
- 個人助理與端側 Agent:如 Apple Intelligence、Samsung Gauss 等,在保證隱私的前提下,任務成功率將決定端側智慧的使用者粘性。
8. 受益公司
- AI 平台層:OpenAI、Anthropic、Google DeepMind、Meta 等,通過不斷拉昇 Agent 任務成功率鞏固模型與平台價值,推動 API 呼叫與商業合作。
- 自動駕駛運營商:Waymo(Alphabet)、Cruise(GM)、特斯拉、百度 Apollo 等,任務成功率(無干預里程)是獲取運營許可和使用者信任的硬通貨。
- 具身智慧公司:Figure、Physical Intelligence、Skild AI、1X Technologies 等,以特定場景操作成功率作為融資和商業驗證的核心敘事。
- RPA 與企業自動化:UiPath、ServiceNow、微軟,將 AI Agent 成功率整合進 SLA(服務水平協議),提升合同價值與續約率。
- 垂直應用整合商:西門子(工業自動化)、達芬奇手術機器人(Intuitive)等,在高價值場景中,高成功率意味著直接的生命財產安全保障。 注:此處僅為產業鏈分析,不構成任何投資建議。
9. 市場規模
圍繞任務成功率提升與評測的市場,分散於 AI 平台、模擬測試與安全驗證等細分領域。
- AI Agent 市場:根據 MarketsandMarkets 2024 年 1 月釋出的報告,全球 AI Agent 市場規模預計從 2024 年的 51 億美元增長至 2030 年的 471 億美元,年複合增長率約 44.8%(來源:MarketsandMarkets, AI Agents Market - Global Forecast to 2030, 2024 年 1 月)。該市場涵蓋以任務自動化為核心的軟體與服務。
- 智慧自動化市場:Grand View Research 2024 年報告指出,2023 年全球智慧自動化市場規模約為 832 億美元,預計 2030 年達到 2010 億美元(來源:Grand View Research, Smart Automation Market Size Report, 2024 年)。此市場包含 RPA、智慧文件處理以及 AI Agent 模組。
- 模擬與測試工具:專門面向任務成功率評測的賽道仍然細碎,公開資料未見具有公信力的獨立市場規模資料。該環節目前主要作為模擬軟體(如 NVIDIA Omniverse)或 MLOps 平台的功能模組存在。
- 關鍵需求驅動:勞動力成本上升、複雜製造自動化、自動駕駛商業化與安全監管升級,共同推高對“可量化、可保證的任務成功率”的投入,需求側呈現出抗週期增長特質。
10. 玩家對比
以下對比聚焦於不同領域代表性玩家的任務成功率相關指標,所有資料均來自已公開的報告或官方釋出,時間截至 2024 年第三季度。
| 組織 / 產品 | 評測域 | 指標 | 數值 | 來源與時間 | 說明 |
|---|---|---|---|---|---|
| OpenAI GPT-4o + SWE-agent | SWE-bench Lite | 補丁生成成功率 (Pass@1) | 23% | SWE-bench 排行榜,2024 年 7 月 | 代表通用模型 Agent 在該基準的公開領先水平 |
| Cognition Devin | SWE-bench | 任務成功率 | 13.86%(首次釋出) | 官方部落格,2024 年 3 月 | 引發業界對 AI 軟體工程師的廣泛討論,後續聲稱有提升 |
| Anthropic Claude 3.5 Sonnet | SWE-bench Verified | 成功率 | 49.0% | 官方部落格,2024 年 6 月 | Verified 子集剔除了標註噪音,數值偏高 |
| Waymo | 城市自動駕駛(加州) | 安全脫離率(每百萬英里) | 0.62 | 加州 DMV,2023 | 反映成熟系統在限定區域的可靠性 |
| Tesla FSD v12 | 城市自動駕駛 | 干預里程(眾包估算) | 約 116 英里/干預 | Tesla FSD Community Tracker,2024Q1 | 非官方資料,存在統計偏差 |
| Figure 02 | 倉儲搬運 | 任務成功率(特定操作) | >90% | 公司影片/演示,2024 | 無獨立三方基準,實際泛化水平待驗證 |
| Covariant | 機器人分揀 | 分揀成功率 | >99%(商品) | 公司案例研究,2024 | 商業部署資料,非公開基準,限定 SKU 範圍 |
注意:不同域的指標定義無法直接橫向對比,需結合作業環境和後果嚴重度綜合解讀。
11. 風險
- “成功率通脹”與基準過擬合:公開排行榜面臨資料洩露和過度最佳化的風險,排行榜上的高成功率並不等同於真實分佈下的成功率。部分公司可能通過選擇有利任務子集美化指標。
- sim-to-real 鴻溝:模擬環境中高達 95% 的成功率,遷移到真實環境後可能腰斬。域隨機化和真實資料微調可緩解,但難以根除。
- 長尾困境:安全攸關係統面臨的極端場景出現機率極低,但對成功率影響致命。僅靠資料驅動方法難以保證 10⁻⁶ 以下的失效率,必須引入形式化驗證與冗餘架構。
- 評估體系碎片化:不同企業、不同行業採用不同基準、不同定義,缺乏統一的第三方權威評測,導致投資比較與採購決策困難。
- 過度依賴成功率掩蓋真實人力成本:有些系統通過頻繁請求人類介入維持高“名義成功率”,實則變相增加運營成本,背離自動化初衷。
- 倫理與責任歸屬:當 AI Agent 任務失敗造成損失,責任劃分(開發者、整合商、使用者)存在法律灰色地帶,可能延緩高價值場景的部署。
12. 誤讀糾偏
- 誤讀 1:“準確率高就等於任務成功率高” 準確率通常衡量單一決策點的正確率(如分類、實體抽取),而任務成功率評估的是端到端目標達成。一個問答系統可在檢索步驟拿到高準確率,卻因缺乏多跳推論能力而無法解決使用者真實問題,高準確率、低任務成功率是常態。必須堅持全鏈路、面向目標、基於驗收訊號的測試。
- 誤讀 2:“99% 的任務成功率足夠好了” 對高頻、低後果場景(如每日數十萬次的商品推薦)或許可以接受,但對日均萬次的客服對話,1% 的失敗意味著每天 100 次嚴重錯誤,易引發信任危機。自動駕駛領域,美國年行車裡程約 3.2 萬億英里(來源:美國聯邦公路管理局,2022 年),若每億英里發生一次致命事故,99% 的數字遠不足滿足安全要求,通常需要 6 個 9 以上的可靠性。成功率要求必須結合失敗成本與頻次來制定。
- 誤讀 3:“模擬中不斷拉高成功率,就能自然遷移到現實” Sim-to-Real gap 是核心挑戰。模擬成功率高可能只是模型記住了非真實的視覺紋理或物理引數。必須通過域隨機化、構造對抗性場景以及閉環的真實世界持續微調,才能實現有效遷移,決不能以模擬成功率為唯一信心來源。
- 誤讀 4:“任務成功率是靜態的,一次通過終身有效” 真實世界分佈會漂移(資料漂移、環境變化、使用者行為演變),昨日 95% 的成功率可能半年後跌至 70%。持續監控、灰度部署和自動化迴歸測試平台是維持成功率的必選項。
13. 最新事件
以下為 2024 年至 2025 年初與任務成功率顯著相關的動態(按時間排序):
- 2024 年 3 月,Cognition AI 釋出 Devin:宣稱在 SWE-bench 完整集上實現 13.86% 的首次成功率,展現 AI 自主完成軟體工程任務的潛力,引發行業對“AI 程式設計師取代人類”的辯論。(來源:Cognition 官方部落格)
- 2024 年 5 月,OpenAI 推出 GPT-4o:多模態即時互動能力顯著增強,結合 Agent 架構後,在多項第三方任務基準中重新整理成功率。(來源:OpenAI 釋出會)
- 2024 年 6 月,Anthropic 釋出 Claude 3.5 Sonnet:在 SWE-bench Verified 上取得 49% 的任務成功率,為當時公開最佳成績,展示了語言模型在複雜程式碼任務上的進度。(來源:Anthropic 官方部落格)
- 2024 年 9 月,OpenAI 釋出 o1 模型系列:強化推論時計算,o1-preview 在 2024 年 AIME 數學競賽中解決率達 56%(GPT-4o 僅 13%),在物理、化學等需要多步推論的任務中成功率大幅提升。(來源:OpenAI o1 系統卡,2024 年 9 月)
- 2024 年 10 月,特斯拉 FSD 迭代至 v12.5:根據眾包追蹤資料,城市道路每干預里程提升至超過 200 英里(非官方估算),進一步接近 robotaxi 所需的無干預執行水平。(來源:Tesla FSD Community Tracker, 2024Q3)
- 2024 年末,具身智慧多項進展:Skild AI 與 Physical Intelligence 分別展示機器人在多樣化家庭、倉庫操作任務中的成功率突破,部分場景超越 80%,融資額大幅增長,但詳細基準仍為閉源狀態。(來源:公司官網與媒體通稿)
14. 追蹤指標
若需持續評估產業中任務成功率的技術成熟度與商業可用度,建議關注以下指標與信源:
- 公開基準排行榜:SWE-bench(軟體工程)、WebArena(網頁 Agent)、AgentBench(通用 Agent)、ALFWorld(具身語言)等,追蹤每月排名與絕對值變化。
- 自動駕駛脫離報告:加州 DMV 年度報告、中國各地自動駕駛測試報告,關注無干預里程趨勢。
- 企業產品 SLA 與透明度報告:UiPath、ServiceNow、微軟等在其 Agent 化產品線中公佈的任務成功指標及 SLA 條款,可反映商業可接受度。
- 學術會議錄稿:NeurIPS、ICLR、CVPR 中關於成功率提升的新方法與基準,尤其關注 sim-to-real 遷移和長程任務方向的突破。
- 初創企業實機演示與三方復現:關注具身智慧和 Agent 公司的 uncut 演示影片及社群的獨立復現測試,避免被剪輯後的高成功率誤導。
- 監管與標準進展:ISO 26262、UL 4600 以及新興的 AI Agent 測試標準,將直接影響高可靠性市場的准入要求。
15. 信源
- 學術論文:
- “SWE-bench: Can Language Models Resolve Real-World GitHub Issues?” (Jimenez et al., 2024)
- “Hindsight Experience Replay” (Andrychowicz et al., 2017)
- “WebArena: A Realistic Web Environment for Building Autonomous Agents” (Zhou et al., 2024)
- 基準與排行榜:
- SWE-bench 官方排行榜(swebench.com)
- AgentBench 專案(agentbench.github.io)
- 產業報告:
- MarketsandMarkets, AI Agents Market – Global Forecast to 2030, 2024 年 1 月
- Grand View Research, Smart Automation Market Size, Share & Trends Analysis Report, 2024 年
- Gartner, Top Strategic Technology Trends 2024: Agentic AI, 2023 年 10 月
- 官方安全揭露:
- Waymo Safety Report, 2023–2024 年
- California DMV, Autonomous Vehicle Disengagement Reports, 2023 年
- NHTSA Standing General Order on Crash Reporting for ADS and L2 ADAS, 2022 年修訂
- 產業分析文章:
- a16z, The State of AI Agents 系列文章, 2024 年
- OpenAI, Introducing o1-preview 系統卡, 2024 年 9 月
- Anthropic, Claude 3.5 Sonnet Model Card, 2024 年 6 月
注:本文部分細分領域資料暫未在公開渠道獲取精確數字,已標註“公開資料未見”。所有涉及公司的表述均基於已公開資訊,不構成投資建議。