模型層 開放閱讀

AI Agent

AI Agent

概念 ID
ai-agent
更新時間
2026-05-29
來源數量
待補

AI Agent

3 秒看懂

AI Agent(人工智慧代理)並非單輪問答聊天機器人,而是一個能夠自主感知、規劃、執行並依據反饋進行自我修正的智慧代理。它能理解複雜目標,將任務分解為多步行動,主動呼叫工具(搜尋、程式碼、API、資料庫),在真實數字環境中完成任務閉環。它是大語言模型(LLM)從“文本生成”躍遷至“行動執行”的核心進化形態。

3 分鐘產業解釋

AI Agent 的產業落地正從實驗性專案快速轉向規模化。技術上,它普遍採用“LLM + 規劃器 + 記憶模組 + 工具呼叫”的架構。LLM 作為推論引擎,將高層目標轉化為可執行的步驟序列;短期與長期記憶儲存上下文、使用者偏好和任務歷史;工具層則通過 API 將模型與搜尋引擎、企業軟體、程式碼直譯器、物聯網裝置等外部世界連線起來。與傳統 RPA 不同,AI Agent 能動態應對非結構化資訊與意外情況,完成訂票、資料分析、程式碼編寫與除錯、售後服務等多輪決策任務。

微軟的 Copilot 系列、Salesforce 的 Agentforce、OpenAI 的函式呼叫和 Assistants API、Google 的 Vertex AI Agent Builder,以及開源的 LangChain Agent、AutoGPT 等,正將 Agent 能力嵌入辦公、CRM、電商、軟體開發等場景。行業核心爭議聚焦於可靠性——多步推論中的誤差累積、幻覺導致的錯誤工具呼叫,以及安全與合規約束。2024年以來,記憶體增強、人機協同審批、專用小模型過濾等機制顯著提升了實用性,多家企業已將 Agent 注入核心業務流,從而在客服自動化、程式碼生成、銷售助理等領域取得初步成效。

技術原理

AI Agent 的核心機制可概括為“感知-規劃-行動-反饋”迴圈。LLM 作為策略控制器,依據當前情境生成推論軌跡和行動指令,再通過工具與環境互動,獲取觀察後進入下一輪推論。

系統架構

  • 推論核心:通常為一個經過指令微調的 LLM,承擔意圖理解、任務分解、工具選擇與最終響應合成。主流模型如 GPT-4o、Claude 3.5、Gemini 2.0 均原生支援函式呼叫和結構化輸出。
  • 記憶模組:分為工作記憶(位於上下文視窗內的對話歷史、中間計劃和變數)和長期記憶(嵌入向量資料庫或知識圖譜中的使用者偏好、歷史經驗、領域知識)。檢索時通過語義相似度匹配,將高相關記憶片段注入提示,最多可支撐幾十萬 tokens 的上下文。
  • 規劃器:將自然語言描述的目標轉換為有依賴關係的子任務序列。可採用思維樹(Tree-of-Thoughts)、圖搜尋或 Plan-and-Execute 範式,先產生全域性計劃再逐步執行,執行過程中若出現偏差便觸發重規劃。
  • 工具庫與執行環境:將外部功能(計算器、搜尋、資料庫、CRM 介面)抽象為函式描述(名稱、功能說明、JSON 引數模式),供模型動態呼叫。執行環境提供安全沙箱或權限控制,返回結果包含成功/失敗狀態與資料。

推論-行動迴圈(ReAct 模式典型流程)

  1. 使用者輸入目標:“幫我安排明天下午的客戶拜訪並預訂附近餐廳”。
  2. Agent 推論:“需要確認日曆空閒時段、查詢天氣、選地點、預訂”。
  3. 行動:呼叫日曆 API 獲取可用時段,呼叫天氣 API 查詢明天天氣。
  4. 觀察:返回資料“14:00–15:00 空閒,明天有雨”。
  5. 推論:“由於下雨,建議客戶附近室內餐廳,選擇步行5分鐘內”。呼叫地圖與餐廳預訂 API,篩選後預訂。
  6. 反饋:預訂成功,將最終計劃以自然語言回覆使用者,同時更新長期記憶。

技術瓶頸

  • 長上下文遺忘:即便模型支援 128k-1M tokens 視窗,關鍵資訊仍可能在“中間丟失”,導致步驟後期忽略約束。
  • 邏輯鏈斷裂:多步推論中一處錯誤會級聯放大,可能偏離原始目標。
  • 工具呼叫脆弱性:生成的 JSON 引數若出現細微格式錯誤或幻覺欄位將直接導致呼叫失敗。
  • 成本與時延:複雜任務可能涉及上百次 LLM 呼叫,在即時場景中難以滿足毫秒級響應。 產業緩解措施包括:採用專門訓練的 Function Calling 模型、分層記憶(工作記憶+向量化長期記憶)、人類審批關鍵節點、混合小模型過濾簡單步驟等。

關鍵引數

評估 AI Agent 效能需關注以下維度,但行業尚未形成統一的標準化基準,多數資料來自廠商案例或第三方測評,缺乏跨行業可比性。

  • 任務完成率(%):端到端成功率是最核心的可靠性指標。單一簡單任務(如查詢天氣)成功率可達 95% 以上,但跨越多個工具的複雜任務成功率通常隨步驟數增加而下降,部分基準(如 SWE-bench Lite)中頂尖 Agent 完成率約為 30–40%(2024年末資料,來源:OpenAI、Anthropic 公開評測)。
  • 平均步數(Steps per Task):完成任務所需的 LLM 呼叫與工具互動次數,直接關聯總成本與延遲。簡單任務常為 2–5 步,複雜分析可能達到 50–100 步。
  • 自動化率:全自動完成任務的比例 vs. 需要人工修正或審批的比例。在生產部署中,許多企業設定關鍵操作(如資金處理、傳送客戶郵件)必須由人工確認,因此純自動化率通常低於任務完成率。
  • 工具呼叫準確率:模型選擇正確工具並生成合法引數的機率。頭部模型在常見 API 上準確率已超 90%,但在長尾或複雜巢狀結構下可能降至 70% 以下(來源:Anthropic 2024 年工具使用評測報告)。
  • 響應延遲(P50/P95 秒/毫秒):從指令發出到獲得最終結果的時間。客服場景通常要求 P95 < 3 秒,但涉及多個 API 序列呼叫時可能超過 10 秒,需通過並行呼叫或快取策略最佳化。
  • 單位任務成本(美元/任務):綜合推論 token 消耗與工具 API 呼叫費用。2024 年典型客服 Agent 的每次對話成本約為 0.05–0.10 美元(來源:LangChain 社群案例),複雜程式碼生成 Agent 可能達 1–2 美元。
  • 安全性指標:包括越獄成功率、敏感資訊洩露次數、誤操作(如錯誤刪除檔案)機率。此類資料各廠商通常不全面公開,僅有零散的紅隊測試揭露。

(注:上述數字僅反映 2024–2025 年特定場景下的案例,若無確切來源均標註“公開資料未見”或“行業估算”。)

技術路線

產業實踐中主要存在四種技術路線,各有側重,往往在實踐中組合使用。

維度單 Agent 工具呼叫型規劃優先型多 Agent 協作型人機協同型
控制流模型即時推論+行動,線性迴圈(如 ReAct)先生成全域性計劃,再逐步執行,遇偏差重規劃多個 Agent 並行或序列,由排程器分配子任務關鍵節點人工審批,Agent 執行低風險操作,高風險由人決策
典型架構/產品OpenAI Function Calling、LangChain Agent、Anthropic 工具使用Plan-and-Execute、Tree-of-Thoughts、CodePlanAutoGen、CrewAI、MetaGPT、OpenAI SwarmSalesforce Agentforce、Microsoft Copilot、ServiceNow Now Assist
可靠性特徵單步可即時糾正,但累積錯誤風險大全域性計劃失誤成本高,但意圖一致性較好各 Agent 可相互校驗輸出,降低單點錯誤人類兜底,整體可靠但響應速度較慢
適用場景客服、資訊檢索、個人助理複雜分析、研究、工程設計軟體開發團隊、多角色模擬、供應鏈金融交易、醫療建議、法律文書等高風任務
關鍵挑戰工具描述工程量大,格式脆弱計劃可能與執行脫節,靜態計劃不易應對環境變化通訊協議複雜,協調開銷增加延遲與成本人工干預頻率難以平衡,干預過多喪失自動化價值

單 Agent 工具呼叫型 是目前最廣泛落地的範式,因其實現簡單、成本相對可控。規劃優先型 適合目標明確但執行路徑多變的長鏈條任務,如自動生成軟體架構。多 Agent 協作型 在模擬社會、複雜軟體開發(如 MetaGPT)等場景展現潛力,但生產環境中因通訊開銷高而較少直接採用。人機協同型 是當前企業高安全場景的預設選項,多數平台將人工審批作為內建步驟,例如 Salesforce Agentforce 允許管理員設定哪些操作需人工確認。

上游

大語言模型提供商:OpenAI(GPT-4o、o1 系列)、Anthropic(Claude 3.5/4 系列)、Google(Gemini 2.0)、Meta(Llama 3 開源模型)、Mistral 等。這些模型的基礎能力(函式呼叫、長上下文、推論深度)直接決定 Agent 效能天花板。

記憶與資料底座:向量資料庫(Pinecone、Weaviate、Milvus、pgvector)、時序資料庫、知識圖譜(Neo4j),用於儲存長期記憶、事實和使用者偏好。2024 年向量資料庫市場營收約 15 億美元,預計 2028 年將達 65 億美元(來源:MarketsandMarkets 2024 年向量資料庫報告)。

開發者架構與編排層:LangChain、LlamaIndex、Semantic Kernel、Haystack 等提供 Agent 抽象、聯結器和提示管理;微軟的 AutoGen、CrewAI、OpenAI Swarm 等多 Agent 架構降低協作系統開發門檻。這些架構多數開源,成為 Agent 應用的核心中介軟體。

工具/API 生態:搜尋引擎(Google/Bing API)、程式碼執行環境(E2B、Code Interpreter)、企業軟體 API(Salesforce、SAP、ServiceNow)、通訊 API(Slack、Email)、物聯網介面等。工具的豐富度和描述標準化程度直接影響 Agent 可執行任務的範圍。

雲端基礎設施:亞馬遜 AWS(Bedrock Agents)、微軟 Azure AI、Google Cloud Vertex AI 提供模型部署、安全沙箱與 Agent 託管服務,並與自家模型深度整合。

下游

企業自動化:IT 運維(自動故障排查、工單處理)、財務流程(自動對賬、報銷稽核)、人力資源(自助入職、FAQ)等領域,Agent 將多系統 API 呼叫組合成端到端流程,減少人工切換。例如 ServiceNow 的 Now Assist Agent 可自動整理工單資訊並建議解決方案。

客戶體驗:從僅回答 FAQ 的簡單聊天機器人,升級為能執行退換貨、修改訂單、主動提醒的客服 Agent。Salesforce Agentforce 宣稱其客服 Agent 可自主解決高達 60% 的客戶詢問(2024 年 Dreamforce 演示資料,需在實際部署中驗證)。

個人生產力:跨應用任務編排,例如根據郵件內容自動建立日曆事件、總結文件並生成待辦事項。微軟 Copilot 深度整合 Office 365,可跨 Word、Excel、Outlook 完成任務。

軟體研發與工程:自動除錯、生成單元測試、重構程式碼、管理 CI/CD 流程。GitHub Copilot Workspace 和 Amazon Q Developer 已開始提供 Agent 風格的開發體驗。2024 年 SWE-bench 基準中,Agent 能自主修復約 30% 的真實 GitHub issue(來源:SWE-bench 排行榜,2024/12)。

具身智慧與邊緣:機器人、自動駕駛中的高階決策層,將感知訊號轉化為任務規劃,再通過低層控制器執行。目前此方向仍以研究為主,少量工業機器人運用 Agent 進行動態任務編排。

受益公司

(注:以下僅從產業趨勢角度分析各企業可能獲得的商業機會,不構成任何投資建議。)

大型模型與雲端平台

  • 微軟:通過 Copilot 生態和 Azure AI 將 Agent 嵌入 Office、Dynamics 365、GitHub 等核心產品,可望通過使用者訂閱和 Azure 用量增長受益。
  • Google:依託 Gemini 模型和 Vertex AI Agent Builder,將 Agent 與 Google Workspace、Google Cloud 深度整合,爭奪企業客戶。
  • 亞馬遜:AWS Bedrock Agents 為企業提供託管 Agent 服務,同時 Amazon Q 系列面向開發者和商業分析,推動雲端消費增長。

企業應用軟體商

  • Salesforce:Agentforce 平台作為 CRM 的 AI 層,可提高客戶留存並開闢新的訂閱營收來源。
  • ServiceNow:Now Assist 將 Agent 融入 IT 服務管理和工作流自動化,粘性增強。
  • SAP、Oracle、Adobe:分別在其 ERP、雲端應用和創意軟體中嵌入 Agent,提升使用者效率和平台價值。

AI 研發實驗室

  • OpenAI(非上市):通過 Assistants API、GPTs 和未來的 Operator 等產品,推動 Agent 推論用量增長,獲取 API 營收。
  • Anthropic(非上市):Claude 的工具使用、長上下文和計算機操作能力吸引注重安全的客戶,通過 API 和企業定製獲得營收。
  • Adept(與亞馬遜達成協議,部分員工加入,公司獨立運營):專注 Agent 的跨應用操作,其技術可能融入亞馬遜產品。

開源生態與中介軟體

  • LangChain / LlamaIndex:作為最廣泛使用的 Agent 架構,通過企業服務和雲端託管(如 LangSmith)實現商業化,受益於 AI Agent 應用爆發。
  • CrewAI、MetaGPT 等多 Agent 架構:初創專案,通過提供多角色協作解決方案吸引開發者,部分獲得融資。

(公開資料未見上述公司因 AI Agent 帶來的具體營收細分數字,均以定性分析為主。)

市場規模

根據 MarketsandMarkets 於 2024 年 7 月釋出的《AI Agents Market – Global Forecast to 2030》報告,全球 AI Agent 市場規模(涵蓋軟體、平台和服務)2024 年約為 51 億美元,預計到 2030 年將達到 471 億美元,2024–2030 年複合年增長率(CAGR)約為 44.8%

Fortune Business Insights 2024 年 9 月釋出的《AI Agent Market Size, Share & Industry Analysis》則預計,2024 年市場規模為 55.7 億美元,2031 年將達到 528.3 億美元,CAGR 為 45.9%

IDC 在 2024 年 8 月的《Worldwide AI Agent Software Market Forecast》中預計,到 2027 年,超過 50% 的全球 2000 強企業將部署 AI Agent 軟體,相關支出將佔據 AI 自動化市場的重要份額,但 IDC 未單獨給出 Agent 市場的絕對數值(公開資料未見)。

從區域看,北美目前佔據最大份額(超過 40%),亞太地區因企業數字化轉型加速,預計增速最高。行業維度中,客服與營銷、軟體開發、IT 運維是最大落地板塊。需要指出,上述預測基於當前技術成熟度與假設,實際增長受可靠性、監管等因素影響。

玩家對比

玩家核心 Agent 產品 / 平台技術路線主要差異化商業變現模式
OpenAIAssistants API、GPTs、Operator(2025.01)單 Agent 工具呼叫,ReAct 原生支援,規劃以模型推論為主模型推論能力領先,生態豐富,函式呼叫成熟API 呼叫費、訂閱
微軟Copilot Studio、Azure AI Agent Service、自主代理功能(2024.11 Ignite)人機協同 + 多 Agent 編排,依託 Semantic Kernel深度整合 Office 365 和 Dynamics,企業入口優勢訂閱附加、Azure 用量
GoogleVertex AI Agent Builder、Agent Space(2025.02)融合規劃優先與工具呼叫,Gemini 模型落地搜尋整合、多模態、A2A 協議(2025.04)推動互操作雲端服務、Workspace 附加
AnthropicClaude 工具使用、Computer Use(2024.10 公測)單 Agent 工具呼叫,強調安全對齊與長上下文計算機操作、安全性研究、可解釋性API、企業合同
SalesforceAgentforce(2024.09 釋出)人機協同,低程式碼建置,CRM 場景化與 Sales/Service Cloud 深度繫結的資料圖譜和流程附加訂閱、按對話計費
ServiceNowNow Assist Agent人機協同,工作流自動化為核心內建 IT 運維和 HR 知識,流程標準化附加訂閱
MetaLlama 3 開源模型 + 社群工具使用開源生態,社群單 Agent 工具呼叫開放權重,觸達廣泛開發者間接(生態效應)
開源社群 (LangChain/CrewAI等)LangChain Agents、CrewAI 多 Agent多樣化:ReAct、Plan-Execute、多 Agent靈活定製,無供應商鎖定企業服務、雲端託管

(以上資訊均來自各公司官方文件與公開產品釋出,截至 2025 年 4 月。)

簡析:OpenAI 和 Anthropic 聚焦於模型能力層,以 API 形式賦能開發者建置 Agent。微軟、Salesforce、ServiceNow 則依託已有企業應用生態,將 Agent 嵌入具體工作流,形成“應用+Agent”閉環。Google 走中間路線,既提供模型又提供搭建平台,A2A 協議有望成為多 Agent 互通的基礎標準。開源架構在靈活性和成本上具備優勢,但缺乏統一商業支援,適合有技術能力的團隊。

風險

可靠性風險:多步推論的累積錯誤率隨任務長度指數上升,幻覺導致工具誤用,在高價值場景(金融交易、醫療建議)可能造成嚴重後果。當前尚無通用方法能將成功率提升至 99.99%。

成本與延遲風險:複雜 Agent 任務需要數十到上百次 LLM 呼叫,token 消耗和工具 API 成本可觀。若 LLM 推論成本下降速度不及預期,Agent 的大規模部署可能受阻。在即時對話等低延遲場景,響應 P95 常超過可接受閾值。

安全與合規:自主 Agent 可能被越獄執行有害指令,或意外刪除資料、傳送錯誤資訊。監管機構(如 EU AI Act)對自動化決策的透明度、可解釋性和人工干預提出要求,可能限制 Agent 自主權。金融、醫療行業的合規要求尤其嚴格。

整合與鎖定:企業系統多樣,API 標準化程度低,Agent 整合工作量大。深度繫結特定平台的工具和記憶格式可能帶來供應商鎖定風險。

就業與社會接受度:雖然 Agent 旨在增強而非完全替代人類,但部分崗位的替代效應可能引發員工抵制和工會壓力,影響企業推廣速度。

誤讀糾偏

誤讀一:“AI Agent 就是加了工具的聊天機器人。” 糾偏:聊天機器人多為單輪或淺上下文對話,無狀態、無自主多步規劃。Agent 的核心是自主維護任務狀態、動態生成並調整計劃,並在多步行動中校驗結果,是目標驅動而非單純響應驅動的系統。

誤讀二:“多 Agent 架構一定比單 Agent 強。” 糾偏:多 Agent 引入通訊與協調開銷,若任務本身不具備天然多角色分解性,反而會降低可靠性、增加成本。絕大多數生產級系統從單 Agent 加精心設計的工具集開始迭代,並非盲目追求多 Agent。

誤讀三:“AI Agent 很快會取代所有知識工作者。” 糾偏:Agent 擅長結構化和半結構化任務,但在需要深層判斷、跨域常識和情感理解的場景中仍遠遜於人類。主流落地方式是增強而非替代,Agent 處理重複性環節,人類

source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型