Computer Use(計算機操控)
3 秒看懂
一句話定義: 讓大語言模型像人一樣”看螢幕、動滑鼠、敲鍵盤”,直接操控桌面計算機完成任務——從”會說”進化到”會做”。
類比: 你僱了一個遠端助手,他通過螢幕共享看到你的電腦桌面,用遠端桌面控制工具幫你操作軟體、填寫表格、搜尋網頁。
3 分鐘產業解釋
這是什麼?
2024 年 10 月,Anthropic 在釋出 Claude 3.5 Sonnet 更新版的同時,推出了 Computer Use(Beta) 功能。這是業界首個由主流大型模型廠商公開提供的、模型直接操控桌面計算機介面的 API 能力。
核心機制極為直覺:
- 截圖 → 模型獲取當前螢幕截圖(影像輸入)
- 理解 → 利用多模態視覺能力識別 UI 元素、文本、按鈕等
- 行動 → 輸出結構化指令:移動游標座標、點選、鍵入文字、滾動、按鍵組合
- 迴圈 → 再次截圖,觀察操作結果,繼續下一步
這形成了一個 感知-決策-執行 的閉環,把 LLM 從”生成文本”升級為”在真實計算環境中執行任務”的 Agent。
為什麼重要?
| 維度 | 意義 |
|---|---|
| 應用範式 | 任何有 GUI 的軟體(無需 API 整合)都可被 AI 操控,大幅降低自動化門檻 |
| RPA 升級 | 傳統 RPA 依賴固定指令碼/規則,Computer Use 用自然語言描述任務即可 |
| Agent 基礎設施 | 是通向通用 AI Agent 的關鍵一步——讓模型不僅”思考”,還能”動手” |
| 生態影響 | 直接觸動 UI 自動化、辦公自動化、軟體測試、客服自動化等萬億級市場 |
當前狀態(截至 2025 年初)
- Beta 狀態:Anthropic 明確標註為 Beta,不建議用於高風險/無人監督場景
- 開源參考實現:Anthropic 在 GitHub 釋出了參考程式碼架構供開發者整合
- 競爭態勢:Google(Project Mariner/Jarvis)、OpenAI(Operator, 2025年1月釋出)、Microsoft(Copilot Actions)等均在版面配置類似能力
15 分鐘專家深入
核心技術架構
Computer Use 的本質是將 GUI Agent 問題拆解為三個子系統的組合:
┌─────────────────────────────────────────────────┐
│ Claude Model │
│ (多模態 LLM + Tool Use 架構) │
│ │
│ 輸入: 截圖(影像) + 任務描述(文本) + 歷史動作序列 │
│ 輸出: 結構化 Action (座標/文本/按鍵) │
└──────────┬──────────────────────┬────────────────┘
│ 感知層 │ 決策層
▼ ▼
┌──────────────────┐ ┌──────────────────────────┐
│ Screen Capture │ │ Action Space Definition │
│ (螢幕截圖服務) │ │ (動作空間定義) │
└──────────────────┘ └──────────┬───────────────┘
│ 執行層
▼
┌──────────────────────────┐
│ Execution Runtime │
│ (滑鼠/鍵盤模擬執行器) │
└──────────────────────────┘
1. 感知層:螢幕理解
模型接收的不是 DOM 樹、不是 Accessibility Tree(雖然輔助能力可以結合使用),而是 原始畫素截圖。這意味著:
- 通用性極強:任何視覺化介面理論上都可理解(桌面應用、網頁、遊戲、遠端桌面)
- 挑戰巨大:模型需要從畫素中提取語義——識別按鈕在哪、文本框是什麼、下拉選單展開了沒有
- 解析度與取樣率的權衡:截圖解析度越高,視覺細節越豐富,但 token 消耗越大;取樣頻率越高,即時性越好,但成本越高。Anthropic 建議在實用性和成本間取平衡,具體引數因場景而異 [Anthropic 官方文件]
2. 決策層:動作空間(Action Space)
Anthropic Computer Use API 定義的核心動作包括:
| 動作 | 說明 |
|---|---|
mouse_move | 移動游標到指定 (x, y) 座標 |
left_click / right_click / double_click | 滑鼠點選 |
type | 在當前焦點位置鍵入字串 |
key_press | 按下特定鍵(如 Enter、Tab、Ctrl+C 等組合鍵) |
scroll | 在指定方向滾動 |
screenshot | 請求重新截圖以獲取最新螢幕狀態 |
關鍵設計決策:使用絕對畫素座標而非相對位置。 模型需要輸出如 (1247, 83) 這樣的座標來定位按鈕。這對模型的視覺空間推論能力要求極高。
3. 執行層:Runtime
參考實現通常包含:
- 截圖服務(週期性或按需)
- 滑鼠/鍵盤模擬(通過作業系統級別的輸入注入,如 Python 的
pyautogui、xdotool等) - 一個編排迴圈(Orchestrator Loop):截圖 → 傳送給模型 → 獲取動作 → 執行 → 截圖 → …
與其他 Tool Use 的關係
Computer Use 在 Anthropic 的架構中是 Tool Use(工具呼叫) 架構的一種特殊例項。與 text_editor、bash 等工具並列,但 Computer Use 的特殊之處在於:
- 它是最通用的工具——理論上可以包裝任何其他工具(開啟文本編輯器再用它編輯 = 間接實現 text_editor)
- 它也是最低效的——每一步操作都需要截圖-傳輸-推論-執行,延遲遠高於直接 API 呼叫
- 它是最後手段——當沒有 API/CLI 可用時,GUI 操作是唯一的互動路徑
核心技術挑戰
a) 座標精度與視覺 grounding
模型需要將”點選儲存按鈕”這樣的語義指令對映到精確的畫素座標。這要求強大的 visual grounding 能力。當前模型在此方面已相當不錯,但在密集 UI(多個小按鈕緊鄰)或非標準 UI 中仍易出錯。
b) 動作規劃(Planning)
完成一個多步任務(如”在 Excel 中開啟檔案,找到第三行資料,複製到新檔案”)需要長程規劃。模型需要:
- 分解任務為子步驟
- 記住已完成的操作(上下文視窗管理)
- 處理意外情況(彈窗、錯誤提示、載入延遲)
c) 延遲與成本
每個”看一步做一步”的迴圈都需要一次完整的模型推論呼叫,加上截圖傳輸和處理的開銷。對於需要數十步的複雜任務,端到端延遲可能達到分鐘級別,API 成本也不可忽視。
d) 安全與權限
模型擁有滑鼠和鍵盤的完全控制權,意味著它可以:
- 訪問任何已開啟的應用
- 刪除檔案、傳送郵件、修改資料
- 理論上操控任何作業系統功能
Anthropic 對此設定了多層防護:模型層面的拒絕訓練、API 層面的速率限制、建議使用者在沙箱/虛擬機器中執行。但從根本上,這是”AI 擁有系統級權限”的安全邊界問題,遠未完全解決。
e) 魯棒性
螢幕解析度變化、UI 主題/語言切換、動態內容載入、視窗遮擋等因素都會影響截圖解讀的準確性。Beta 階段使用者普遍反饋在滾動操作、拖拽、複雜表單填寫等場景下穩定性不足。
技術原理
完整推論迴圈機制
使用者任務: "幫我在這個網站上註冊一個賬號,郵箱 test@example.com"
Step 1: 初始截圖
┌─────────────────────────────────────────┐
│ [瀏覽器視窗截圖 - 顯示網站首頁] │
│ 模型推論: 需要找到"註冊"按鈕 │
│ 輸出: mouse_move(856, 412), left_click │
└─────────────────────────────────────────┘
│ 執行
▼
Step 2: 截圖觀察結果
┌─────────────────────────────────────────┐
│ [瀏覽器視窗截圖 - 顯示登錄檔單] │
│ 模型推論: 看到了郵箱輸入框 │
│ 輸出: mouse_move(640, 300), left_click, │
│ type("test@example.com") │
└─────────────────────────────────────────┘
│ 執行
▼
Step 3: 繼續截圖 → 填寫密碼欄位 → 提交 → ...
...迴圈直到任務完成或模型判斷無法繼續
底層多模態處理流程
截圖 (PNG/JPEG 影像, 如 1280×800)
│
▼
Vision Encoder (如 ViT 變體)
→ 將影像編碼為 patch-level 特徵向量序列
→ 每個 patch 覆蓋影像的一個區域性區域
│
▼
特徵對映到 LLM 的 token 空間
→ 影像特徵序列與文本 token 序列拼接
→ 輸入 Transformer decoder
│
▼
LLM 推論 (含任務描述 + 歷史動作 + 當前截圖)
→ 模型在理解視覺內容的基礎上進行推論
→ 輸出結構化的動作指令 (座標 + 動作型別 + 引數)
Tool Use 協議
Computer Use 通過 Anthropic API 的標準 Tool Use 介面實現。模型被訓練為可以在對話過程中識別何時需要呼叫 computer_use 工具,並生成符合工具 schema 的 JSON 輸出。關鍵的 schema 欄位:
{
"tool": "computer_use",
"action": "left_click",
"coordinate": [856, 412]
}
座標的參考系為截圖的畫素座標系,原點在左上角。
空間推論能力的技術基礎
模型能夠將語義指令對映到座標,依賴於:
- 大規模視覺-語言對齊訓練:模型在海量圖文對資料上訓練,建立了文本描述與視覺區域之間的關聯
- 指令微調(Instruction Tuning):針對 GUI 操作場景的專門微調資料(螢幕截圖 + 對應操作標註)
- 推論鏈(Chain-of-Thought):模型在輸出座標前,會內部推論”註冊按鈕在頁面右上角,大約座標 (856, 412)“這樣的中間步驟
⚠️ 具體訓練資料構成和微調細節 Anthropic 未充分公開揭露,上述為基於公開資訊的合理技術推斷。
技術演進史
| 時間 | 事件 | 意義 |
|---|---|---|
| 2017-2019 | 學術界出現 GUI Agent 研究(如 RICO 資料集、AITW 資料集) | 早期探索,基於小模型,實用性有限 |
| 2020-2022 | RPA 市場繁榮(UiPath 等),基於規則/指令碼的 UI 自動化 | 確定了需求存在,但維護成本高、泛化能力差 |
| 2023 | GPT-4V 釋出,多模態 LLM 具備螢幕理解能力;學術界湧現大量 LLM-based GUI Agent 論文(如 CogAgent、SeeClick、OS-Atlas) | 技術可行性得到驗證 |
| 2024.04 | Microsoft UFO(UI-Focused Agent)專案公開 | 大廠開始正式版面配置 GUI Agent |
| 2024.10 | Anthropic 釋出 Computer Use (Beta) + Claude 3.5 Sonnet 更新 | 首個主流大型模型廠商公開提供 Computer Use API |
| 2024.11 | Google 展示 Project Mariner(Chrome 瀏覽器內 Agent) | 瀏覽器場景的 Computer Use 變體 |
| 2025.01 | OpenAI 釋出 Operator | 競爭者跟進,驗證賽道共識 |
| 2025.Q1+ | Claude 3.5/3.7 Sonnet 持續迭代,Computer Use 能力隨之提升;多家廠商推出類似功能 | 從 Beta 向產品化演進中 |
技術路線的代際劃分:
- 第一代(2017-2022):基於 OCR + 規則匹配 + 固定指令碼 → 無泛化能力
- 第二代(2023):基於多模態 LLM + 簡單提示 → 概念驗證,準確率不足
- 第三代(2024-至今):基於專門訓練的視覺-動作模型 + Tool Use 架構 + 安全防護 → 可用但仍為 Beta
技術路線對比
Computer Use 技術方案對比
| 維度 | Anthropic Computer Use | OpenAI Operator | Google Project Mariner | 學術方案(CogAgent 等) |
|---|---|---|---|---|
| 釋出時間 | 2024.10 [Anthropic] | 2025.01 [OpenAI] | 2024.11 展示 [Google] | 2023-2024(各論文) |
| 底層模型 | Claude 3.5 Sonnet (更新版) | GPT-4o(Operator 專用版本,[未完全揭露]) | Gemini 系列 [未完全揭露] | 專用視覺-語言模型 |
| 感知方式 | 截圖(原始畫素) | 截圖 + 輔助資訊 [推測] | 截圖 + 瀏覽器 DOM/輔助資訊 [推測] | 截圖為主 |
| 操作範圍 | 桌面全應用 | 瀏覽器為主(沙箱化) | Chrome 瀏覽器 | 實驗環境 |
| 動作空間 | 滑鼠/鍵盤/截圖 | 瀏覽器互動 [未完全揭露] | 瀏覽器互動 | 滑鼠/鍵盤/觸屏 |
| 開放程度 | API 公開(Beta),有參考實現 | API 公開(有限區域/使用者) | 有限預覽 | 開源(學術論文/程式碼) |
| 安全策略 | 模型拒訓 + 建議沙箱 | 專用沙箱瀏覽器環境 | 瀏覽器沙箱 | 無生產級安全措施 |
| 成熟度 | ★★★☆ | ★★☆☆ | ★★☆☆ | ★☆☆☆ |
注:OpenAI Operator 和 Google Mariner 的技術細節公開程度有限,上表中部分資訊為基於公開演示和文件的推斷,已標註。
與傳統 RPA 對比
| 維度 | Computer Use(LLM-based) | 傳統 RPA(UiPath/Automation Anywhere 等) |
|---|---|---|
| 任務定義 | 自然語言描述 | 視覺化流程設計器 / 指令碼編寫 |
| 泛化能力 | 高(理解語義,適應 UI 變化) | 低(UI 變化需重新錄製/修改指令碼) |
| 可靠性 | 中(Beta 級,偶有錯誤) | 高(規則確定,但脆弱性在 UI 變化時暴露) |
| 速度 | 沒(每步需模型推論,秒級延遲) | 快(直接定位元素,毫秒級操作) |
| 成本 | 按 token/API 呼叫計費,複雜任務費用可觀 | 軟體許可費,邊際成本低 |
| 部署複雜度 | 低(API 呼叫 + 執行環境) | 中-高(需配置開發環境、維護指令碼) |
上下游
上游(供給端)
┌──────────────────────────────────────────────────────┐
│ 模型層 │
│ 多模態大型模型 (Claude, GPT-4o, Gemini...) │
│ └── 視覺編碼器 (ViT 變體) │
│ └── 語言模型 (Transformer Decoder) │
│ └── 視覺-動作對齊訓練資料 │
├──────────────────────────────────────────────────────┤
│ 算力層 │
│ GPU/TPU 推論叢集 │
│ └── 多模態推論的高算力需求 (影像 token 量大) │
│ └── 每步操作一次推論 → 頻繁呼叫 │
├──────────────────────────────────────────────────────┤
│ 執行環境層 │
│ 虛擬機器 / 容器 / 沙箱 │
│ └── 雲端桌面服務 (AWS WorkSpaces, Azure Virtual Desktop)│
│ └── 瀏覽器沙箱 │
│ └── 輸入模擬庫 (pyautogui, xdotool 等) │
└──────────────────────────────────────────────────────┘
下游(需求端/應用場景)
| 場景 | 描述 | 成熟度 |
|---|---|---|
| 辦公自動化 | 自動填寫表單、操作 Excel、收發郵件、檔案管理 | 中(Beta 級可用) |
| Web 操作 | 網站註冊、資料採集、線上購物、資訊查詢 | 中 |
| 軟體測試 | GUI 自動化測試、迴歸測試、跨應用端到端測試 | 低-中(需更高可靠性) |
| 客服/支援 | 遠端協助使用者操作軟體、幫助排障 | 低(安全和可靠性要求高) |
| 無障礙輔助 | 幫助殘障人士操作計算機(自然語言驅動) | 早期探索 |
| 資料錄入/遷移 | 在缺乏 API 的舊系統間搬運資料 | 中(RPA 的直接替代場景) |
| 安全研究 | 滲透測試、漏洞發現(自動化 GUI 探索) | 特殊場景,需審慎對待 |
關鍵指標
評估 Computer Use 能力的核心指標
| 指標 | 說明 | 當前狀態 |
|---|---|---|
| OSWorld 基準得分 | 學術界常用的 OS 級 GUI Agent 評測基準 | Anthropic 未在官方釋出中引用此基準的標準化得分,學術論文中各方案得分差異大 [需查閱最新論文] |
| WebArena 得分 | Web 任務完成率基準 | 類上,需查閱最新對照實驗 |
| 單步操作準確率 | 模型輸出的座標/動作是否正確執行了意圖 | 定性:Beta 階段”大部分簡單操作正確”,複雜 UI 偶有失誤 [使用者社群反饋] |
| 端到端任務完成率 | 多步任務從頭到尾成功完成的比例 | 定性:簡單任務(<10步)可用,長程任務(>20步)失敗率顯著上升 |
| 每步延遲 | 從截圖到執行完動作的端到端時間 | 定性:通常在數秒級別(取決於模型推論時間 + 截圖大小 + 網路) |
| 每步成本 | 單次截圖-推論-執行的 API 費用 | 取決於截圖解析度和模型定價,具體費率參照 Anthropic 官方定價頁 |
⚠️ 精確的基準得分和效能資料請以最新論文/官方釋出為準,此處不做無依據的數字羅列。
供需與市場資料
市場定位
Computer Use 解鎖的是一個現有巨大市場的 AI-native 替代方案:
| 相關市場 | 規模參考 | 資料來源 |
|---|---|---|
| 全球 RPA 市場 | 數十億美元級(2024年),持續增長 | 各研究機構報告,具體數字因口徑而異 |
| 全球商業流程外包(BPO)市場 | 千億美元級 | 行業報告 |
| 企業辦公軟體市場 | 萬億美元級(含 Office/SaaS 等) | 各廠商財報彙總 |
Computer Use 並非直接替代以上市場,而是作為 AI Agent 的基礎設施層,為上述市場提供新的自動化範式。
需求驅動力
- 長尾應用無 API:大量企業內部軟體、遺留系統沒有開放 API,GUI 操作是唯一自動化途徑
- RPA 維護成本高:傳統 RPA 在 UI 更新後頻繁”斷鏈”,LLM 的語義理解可緩解此問題
- 自然語言互動期望:使用者期望用自然語言描述任務,而非學習指令碼/流程設計器
供給側瓶頸
- 模型推論成本:每步都需呼叫多模態大型模型,高頻操作的成本可觀
- 可靠性不足:Beta 級產品尚不適合無人監督的生產環境
- 延遲:即時互動場景對延遲敏感,當前方案的響應速度仍有差距
- 安全/合規:讓 AI 擁有系統級操控權限,在金融、醫療等監管嚴格行業面臨合規障礙
代表公司與資本對映
| 公司 | 角色 | 相關版面配置 | 資本市場關聯 |
|---|---|---|---|
| Anthropic | 核心發起者 | Claude Computer Use (Beta);直接產品/API | 一級市場高估值融資(Amazon/Google 投資) |
| OpenAI | 跟進競爭者 | Operator(2025.01) | 一級市場 + 微軟戰略合作 |
| Google DeepMind | 跟進競爭者 | Project Mariner(Chrome 內 Agent) | Alphabet 上市公司 (GOOGL) |
| Microsoft | 基礎設施+應用 | Copilot 生態、Azure 虛擬桌面 | MSFT |
| UiPath | 傳統 RPA 領導者 | 已在整合 AI/LLM 能力(Document Understanding 等),面臨範式替代風險與機會 | PATH (NYSE) |
| Automation Anywhere | 傳統 RPA | 類似 UiPath,正在融合 AI Agent 能力 | 私有 |
| 學術專案 | 技術供給 | CogAgent(清華)、SeeClick(阿里)、OS-Atlas、WebArena 等基準和開源模型 | — |
投資對映邏輯:
- 直接受益:提供 Computer Use 能力的模型廠商(Anthropic、OpenAI 等)——但多為非上市/有限參與
- 間接受益:提供算力/雲端基礎設施的公司(NVIDIA、AWS、Azure、GCP)
- 潛在被顛覆:傳統 RPA 廠商(UiPath 等)面臨技術替代風險
- 潛在被賦能:所有擁有 GUI 軟體但缺乏 API 的企業應用——自動化門檻降低
投資邏輯
看多邏輯
- Agent 敘事的核心拼圖:Computer Use 賦予 AI “行動力”,是從”聊天機器人”到”自主 Agent”的關鍵一步。Agent 是 AI 應用層最大的想像空間。
- 巨大的存量市場可替代:RPA/BPO/辦公自動化市場規模龐大,Computer Use 提供了一種更通用、更低門檻的替代方案。
- 飛輪效應:更多使用者使用 → 更多運算元據 → 模型更強 → 更多場景可用。資料飛輪一旦轉起來,先發優勢顯著。
- 平台效應:誰的 Computer Use 生態最先成熟,誰就可能成為 AI Agent 時代的”作業系統”。
看空/審慎邏輯
- 仍是 Beta:可靠性不足以支撐生產環境,從 Demo 到可靠產品的路還很長。
- 成本結構不友好:每步操作都需呼叫大型模型,複雜任務的總成本可能遠超傳統 RPA 方案。
- 安全/合規障礙大:在企業環境中,給予 AI 系統級操控權限的安全審計和合規審批流程漫長。
- 專用方案可能更優:對於高頻、固定的流程,專用 API/RPA 方案的效率和成本遠優於通用 Computer Use。Computer Use 的真正價值在長尾、臨時、一次性任務。
- 傳統 RPA 廠商不會坐以待斃:UiPath 等正在積極融合 AI,可能形成”AI + RPA”的混合方案,削弱純 Computer Use 的差異化。
關鍵觀察指標
- Computer Use 從 Beta 轉 GA(正式版)的時間線
- 端到端任務完成率的提升速度
- 每步推論成本的下降幅度(模型效率最佳化)
- 企業客戶的實際部署案例和 ROI 資料
- 安全事故/合規案例的出現頻率
常見誤讀糾偏
❌ 誤讀 1:“Computer Use 就是 AI 自己在用電腦,跟人一樣”
糾偏: Computer Use 仍然受限於 截圖-推論-執行 的序列迴圈。它不像人可以同時看到整個螢幕並即時反應。每一步操作都有顯著延遲(秒級),且模型的”理解”是基於單幀截圖的推論,不具有人的連續視覺注意力和肌肉記憶。它更像是一個”每看一眼就做一步決定”的極慢速操作者,而非即時操控。
❌ 誤讀 2:“Computer Use 已經能完全替代 RPA 了”
糾偏: 遠未到這一步。傳統 RPA 在確定性、速度、成本方面仍有巨大優勢。Computer Use 的真正價值在 RPA 覆蓋不到的場景——即那些沒有 API、UI 頻繁變化、需要語義理解的長尾任務。短期內更可能的演進路徑是 AI + RPA 的融合,而非簡單替代。
❌ 誤讀 3:“模型通過看截圖就能像人一樣理解 UI”
糾偏: 模型對截圖的理解能力雖強,但與人有本質差異:模型不理解互動的”慣性”(如按鈕 hover 變色暗示可點選)、不理解操作的因果鏈(如表單驗證失敗需要回改哪些欄位)、不理解非同步狀態(如”提交中”和”提交失敗”的區別可能僅在細微的載入動畫上)。這些都需要額外的幀取樣和推論來彌補,而非真正的”理解”。
❌ 誤讀 4:“Computer Use 只是 Anthropic 的產品,其他家做的是不同東西”
糾偏: Computer Use 是 Anthropic 的 品牌名稱,但 GUI Agent 這一技術方向是全行業的。OpenAI Operator、Google Mariner、學術界的 CogAgent/SeeClick/OS-Atlas 等解決的都是同一類問題——讓 LLM 通過視覺理解和操作 GUI 介面。核心技術挑戰和架構思路高度相似,差異主要在產品化程度、安全策略、操作範圍等方面。
學習路徑
入門級(1-2 小時)
- 閱讀 Anthropic 官方關於 Computer Use 的釋出部落格和技術文件
- 在 Anthropic Console 中嘗試 Computer Use Beta 的 API 呼叫(需有 API 訪問權限)
- 觀看官方 demo 影片,建立直覺
進階級(1-2 天)
- 閱讀 Anthropic 的 GitHub 參考實現原始碼,理解 Orchestrator Loop 的完整流程
- 在本地/雲端虛擬機器中部署參考實現,實際操控一個簡單任務
- 對比嘗試 OpenAI Operator(如有訪問權限),體會不同實現的差異
專家級(1-2 周)
- 閱讀學術論文:
- CogAgent(清華):專注於 GUI 理解的視覺-語言模型
- SeeClick:GUI grounding 的專項研究
- OS-Atlas:跨平台 GUI Agent 的基礎模型
- WebArena / OSWorld:GUI Agent 的評測基準論文
- 研究 LLM Tool Use 的通用架構(Anthropic Tool Use、OpenAI Function Calling)
- 思考 Agent 架構中的 規劃-執行-反饋 迴圈設計模式(參考 ReAct、Reflexion 等)
一句話總結
Computer Use 讓大語言模型從”只會說話”進化為”能動手操作電腦”——通過截圖感知、視覺推論、滑鼠鍵盤執行的閉環,打開了通向通用 AI Agent 的大門,但當前仍處於 Beta 階段,可靠性、成本和安全性的工程挑戰是走向規模應用的核心瓶頸。
延伸閱讀與來源
- Anthropic 官方釋出:《Introducing computer use》部落格文章 + API 文件(2024.10) — 最權威的一手資訊源
- Anthropic GitHub 參考實現:computer-use-demo 開源倉庫 — 程式碼級理解
- OpenAI Operator 釋出:OpenAI 官方部落格(2025.01) — 競品參考
- CogAgent: A Visual Language Model for GUI Agents(清華大學,2023-2024) — 學術技術細節
- SeeClick: Harnessing GUI Grounding for Advanced Visual GUI Agents(阿里等,2024) — 視覺 grounding 技術
- OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments(2024) — 評測基準
- WebArena: A Realistic Web Environment for Building Autonomous Agents(2023) — Web 場景基準
- UiPath / Automation Anywhere 財報與投資者材料 — 傳統 RPA 市場資料參考
⚠️ 本頁技術事實基於公開可查證的釋出資訊和學術論文。涉及具體效能資料、訓練細節、商業資料的部分,已在文中標註資訊來源或註明 [未充分揭露]。搜尋未能成功聯網獲取最新資料,部分內容可能存在時效性滯後,請以各廠商最新官方釋出為準。