模型层 开放阅读

Computer Use

Computer Use

概念 ID
computer-use
更新时间
2026-05-29
来源数量
待补

Computer Use(计算机操控)

3 秒看懂

一句话定义: 让大语言模型像人一样”看屏幕、动鼠标、敲键盘”,直接操控桌面计算机完成任务——从”会说”进化到”会做”。

类比: 你雇了一个远程助手,他通过屏幕共享看到你的电脑桌面,用远程桌面控制工具帮你操作软件、填写表格、搜索网页。

3 分钟产业解释

这是什么?

2024 年 10 月,Anthropic 在发布 Claude 3.5 Sonnet 更新版的同时,推出了 Computer Use(Beta) 功能。这是业界首个由主流大模型厂商公开提供的、模型直接操控桌面计算机界面的 API 能力。

核心机制极为直觉:

  1. 截屏 → 模型获取当前屏幕截图(图像输入)
  2. 理解 → 利用多模态视觉能力识别 UI 元素、文本、按钮等
  3. 行动 → 输出结构化指令:移动光标坐标、点击、键入文字、滚动、按键组合
  4. 循环 → 再次截屏,观察操作结果,继续下一步

这形成了一个 感知-决策-执行 的闭环,把 LLM 从”生成文本”升级为”在真实计算环境中执行任务”的 Agent。

为什么重要?

维度意义
应用范式任何有 GUI 的软件(无需 API 集成)都可被 AI 操控,大幅降低自动化门槛
RPA 升级传统 RPA 依赖固定脚本/规则,Computer Use 用自然语言描述任务即可
Agent 基础设施是通向通用 AI Agent 的关键一步——让模型不仅”思考”,还能”动手”
生态影响直接触动 UI 自动化、办公自动化、软件测试、客服自动化等万亿级市场

当前状态(截至 2025 年初)

  • Beta 状态:Anthropic 明确标注为 Beta,不建议用于高风险/无人监督场景
  • 开源参考实现:Anthropic 在 GitHub 发布了参考代码框架供开发者集成
  • 竞争态势:Google(Project Mariner/Jarvis)、OpenAI(Operator, 2025年1月发布)、Microsoft(Copilot Actions)等均在布局类似能力

15 分钟专家深入

核心技术架构

Computer Use 的本质是将 GUI Agent 问题拆解为三个子系统的组合:

┌─────────────────────────────────────────────────┐
│                  Claude Model                    │
│         (多模态 LLM + Tool Use 框架)              │
│                                                  │
│  输入: 截图(图像) + 任务描述(文本) + 历史动作序列    │
│  输出: 结构化 Action (坐标/文本/按键)               │
└──────────┬──────────────────────┬────────────────┘
           │ 感知层                │ 决策层
           ▼                      ▼
┌──────────────────┐   ┌──────────────────────────┐
│  Screen Capture   │   │  Action Space Definition  │
│  (屏幕截图服务)    │   │  (动作空间定义)            │
└──────────────────┘   └──────────┬───────────────┘
                                  │ 执行层
                                  ▼
                     ┌──────────────────────────┐
                     │   Execution Runtime       │
                     │  (鼠标/键盘模拟执行器)      │
                     └──────────────────────────┘

1. 感知层:屏幕理解

模型接收的不是 DOM 树、不是 Accessibility Tree(虽然辅助能力可以结合使用),而是 原始像素截图。这意味着:

  • 通用性极强:任何可视化界面理论上都可理解(桌面应用、网页、游戏、远程桌面)
  • 挑战巨大:模型需要从像素中提取语义——识别按钮在哪、文本框是什么、下拉菜单展开了没有
  • 分辨率与采样率的权衡:截图分辨率越高,视觉细节越丰富,但 token 消耗越大;采样频率越高,实时性越好,但成本越高。Anthropic 建议在实用性和成本间取平衡,具体参数因场景而异 [Anthropic 官方文档]

2. 决策层:动作空间(Action Space)

Anthropic Computer Use API 定义的核心动作包括:

动作说明
mouse_move移动光标到指定 (x, y) 坐标
left_click / right_click / double_click鼠标点击
type在当前焦点位置键入字符串
key_press按下特定键(如 Enter、Tab、Ctrl+C 等组合键)
scroll在指定方向滚动
screenshot请求重新截屏以获取最新屏幕状态

关键设计决策:使用绝对像素坐标而非相对位置。 模型需要输出如 (1247, 83) 这样的坐标来定位按钮。这对模型的视觉空间推理能力要求极高。

3. 执行层:Runtime

参考实现通常包含:

  • 截屏服务(周期性或按需)
  • 鼠标/键盘模拟(通过操作系统级别的输入注入,如 Python 的 pyautoguixdotool 等)
  • 一个编排循环(Orchestrator Loop):截屏 → 发送给模型 → 获取动作 → 执行 → 截屏 → …

与其他 Tool Use 的关系

Computer Use 在 Anthropic 的架构中是 Tool Use(工具调用) 框架的一种特殊实例。与 text_editorbash 等工具并列,但 Computer Use 的特殊之处在于:

  • 它是最通用的工具——理论上可以包装任何其他工具(打开文本编辑器再用它编辑 = 间接实现 text_editor)
  • 它也是最低效的——每一步操作都需要截图-传输-推理-执行,延迟远高于直接 API 调用
  • 它是最后手段——当没有 API/CLI 可用时,GUI 操作是唯一的交互路径

核心技术挑战

a) 坐标精度与视觉 grounding

模型需要将”点击保存按钮”这样的语义指令映射到精确的像素坐标。这要求强大的 visual grounding 能力。当前模型在此方面已相当不错,但在密集 UI(多个小按钮紧邻)或非标准 UI 中仍易出错。

b) 动作规划(Planning)

完成一个多步任务(如”在 Excel 中打开文件,找到第三行数据,复制到新文件”)需要长程规划。模型需要:

  • 分解任务为子步骤
  • 记住已完成的操作(上下文窗口管理)
  • 处理意外情况(弹窗、错误提示、加载延迟)

c) 延迟与成本

每个”看一步做一步”的循环都需要一次完整的模型推理调用,加上截图传输和处理的开销。对于需要数十步的复杂任务,端到端延迟可能达到分钟级别,API 成本也不可忽视。

d) 安全与权限

模型拥有鼠标和键盘的完全控制权,意味着它可以:

  • 访问任何已打开的应用
  • 删除文件、发送邮件、修改数据
  • 理论上操控任何操作系统功能

Anthropic 对此设置了多层防护:模型层面的拒绝训练、API 层面的速率限制、建议用户在沙箱/虚拟机中运行。但从根本上,这是”AI 拥有系统级权限”的安全边界问题,远未完全解决。

e) 鲁棒性

屏幕分辨率变化、UI 主题/语言切换、动态内容加载、窗口遮挡等因素都会影响截图解读的准确性。Beta 阶段用户普遍反馈在滚动操作、拖拽、复杂表单填写等场景下稳定性不足。


技术原理

完整推理循环机制

用户任务: "帮我在这个网站上注册一个账号,邮箱 test@example.com"

Step 1: 初始截屏
┌─────────────────────────────────────────┐
│  [浏览器窗口截图 - 显示网站首页]          │
│  模型推理: 需要找到"注册"按钮             │
│  输出: mouse_move(856, 412), left_click  │
└─────────────────────────────────────────┘
          │ 执行
          ▼
Step 2: 截屏观察结果
┌─────────────────────────────────────────┐
│  [浏览器窗口截图 - 显示注册表单]          │
│  模型推理: 看到了邮箱输入框               │
│  输出: mouse_move(640, 300), left_click, │
│        type("test@example.com")          │
└─────────────────────────────────────────┘
          │ 执行
          ▼
Step 3: 继续截屏 → 填写密码字段 → 提交 → ...
          ...循环直到任务完成或模型判断无法继续

底层多模态处理流程

截图 (PNG/JPEG 图像, 如 1280×800)
       │
       ▼
Vision Encoder (如 ViT 变体)
  → 将图像编码为 patch-level 特征向量序列
  → 每个 patch 覆盖图像的一个局部区域
       │
       ▼
特征映射到 LLM 的 token 空间
  → 图像特征序列与文本 token 序列拼接
  → 输入 Transformer decoder
       │
       ▼
LLM 推理 (含任务描述 + 历史动作 + 当前截图)
  → 模型在理解视觉内容的基础上进行推理
  → 输出结构化的动作指令 (坐标 + 动作类型 + 参数)

Tool Use 协议

Computer Use 通过 Anthropic API 的标准 Tool Use 接口实现。模型被训练为可以在对话过程中识别何时需要调用 computer_use 工具,并生成符合工具 schema 的 JSON 输出。关键的 schema 字段:

{
  "tool": "computer_use",
  "action": "left_click",
  "coordinate": [856, 412]
}

坐标的参考系为截图的像素坐标系,原点在左上角。

空间推理能力的技术基础

模型能够将语义指令映射到坐标,依赖于:

  • 大规模视觉-语言对齐训练:模型在海量图文对数据上训练,建立了文本描述与视觉区域之间的关联
  • 指令微调(Instruction Tuning):针对 GUI 操作场景的专门微调数据(屏幕截图 + 对应操作标注)
  • 推理链(Chain-of-Thought):模型在输出坐标前,会内部推理”注册按钮在页面右上角,大约坐标 (856, 412)“这样的中间步骤

⚠️ 具体训练数据构成和微调细节 Anthropic 未充分公开披露,上述为基于公开信息的合理技术推断。


技术演进史

时间事件意义
2017-2019学术界出现 GUI Agent 研究(如 RICO 数据集、AITW 数据集)早期探索,基于小模型,实用性有限
2020-2022RPA 市场繁荣(UiPath 等),基于规则/脚本的 UI 自动化确定了需求存在,但维护成本高、泛化能力差
2023GPT-4V 发布,多模态 LLM 具备屏幕理解能力;学术界涌现大量 LLM-based GUI Agent 论文(如 CogAgent、SeeClick、OS-Atlas)技术可行性得到验证
2024.04Microsoft UFO(UI-Focused Agent)项目公开大厂开始正式布局 GUI Agent
2024.10Anthropic 发布 Computer Use (Beta) + Claude 3.5 Sonnet 更新首个主流大模型厂商公开提供 Computer Use API
2024.11Google 展示 Project Mariner(Chrome 浏览器内 Agent)浏览器场景的 Computer Use 变体
2025.01OpenAI 发布 Operator竞争者跟进,验证赛道共识
2025.Q1+Claude 3.5/3.7 Sonnet 持续迭代,Computer Use 能力随之提升;多家厂商推出类似功能从 Beta 向产品化演进中

技术路线的代际划分:

  • 第一代(2017-2022):基于 OCR + 规则匹配 + 固定脚本 → 无泛化能力
  • 第二代(2023):基于多模态 LLM + 简单提示 → 概念验证,准确率不足
  • 第三代(2024-至今):基于专门训练的视觉-动作模型 + Tool Use 框架 + 安全防护 → 可用但仍为 Beta

技术路线对比

Computer Use 技术方案对比

维度Anthropic Computer UseOpenAI OperatorGoogle Project Mariner学术方案(CogAgent 等)
发布时间2024.10 [Anthropic]2025.01 [OpenAI]2024.11 展示 [Google]2023-2024(各论文)
底层模型Claude 3.5 Sonnet (更新版)GPT-4o(Operator 专用版本,[未完全披露])Gemini 系列 [未完全披露]专用视觉-语言模型
感知方式截图(原始像素)截图 + 辅助信息 [推测]截图 + 浏览器 DOM/辅助信息 [推测]截图为主
操作范围桌面全应用浏览器为主(沙箱化)Chrome 浏览器实验环境
动作空间鼠标/键盘/截屏浏览器交互 [未完全披露]浏览器交互鼠标/键盘/触屏
开放程度API 公开(Beta),有参考实现API 公开(有限区域/用户)有限预览开源(学术论文/代码)
安全策略模型拒训 + 建议沙箱专用沙箱浏览器环境浏览器沙箱无生产级安全措施
成熟度★★★☆★★☆☆★★☆☆★☆☆☆

注:OpenAI Operator 和 Google Mariner 的技术细节公开程度有限,上表中部分信息为基于公开演示和文档的推断,已标注。

与传统 RPA 对比

维度Computer Use(LLM-based)传统 RPA(UiPath/Automation Anywhere 等)
任务定义自然语言描述可视化流程设计器 / 脚本编写
泛化能力高(理解语义,适应 UI 变化)低(UI 变化需重新录制/修改脚本)
可靠性中(Beta 级,偶有错误)高(规则确定,但脆弱性在 UI 变化时暴露)
速度没(每步需模型推理,秒级延迟)快(直接定位元素,毫秒级操作)
成本按 token/API 调用计费,复杂任务费用可观软件许可费,边际成本低
部署复杂度低(API 调用 + 执行环境)中-高(需配置开发环境、维护脚本)

上下游

上游(供给端)

┌──────────────────────────────────────────────────────┐
│                    模型层                              │
│  多模态大模型 (Claude, GPT-4o, Gemini...)              │
│  └── 视觉编码器 (ViT 变体)                             │
│  └── 语言模型 (Transformer Decoder)                    │
│  └── 视觉-动作对齐训练数据                              │
├──────────────────────────────────────────────────────┤
│                  算力层                                │
│  GPU/TPU 推理集群                                      │
│  └── 多模态推理的高算力需求 (图像 token 量大)            │
│  └── 每步操作一次推理 → 频繁调用                        │
├──────────────────────────────────────────────────────┤
│                执行环境层                              │
│  虚拟机 / 容器 / 沙箱                                  │
│  └── 云桌面服务 (AWS WorkSpaces, Azure Virtual Desktop)│
│  └── 浏览器沙箱                                        │
│  └── 输入模拟库 (pyautogui, xdotool 等)                │
└──────────────────────────────────────────────────────┘

下游(需求端/应用场景)

场景描述成熟度
办公自动化自动填写表单、操作 Excel、收发邮件、文件管理中(Beta 级可用)
Web 操作网站注册、数据采集、在线购物、信息查询
软件测试GUI 自动化测试、回归测试、跨应用端到端测试低-中(需更高可靠性)
客服/支持远程协助用户操作软件、帮助排障低(安全和可靠性要求高)
无障碍辅助帮助残障人士操作计算机(自然语言驱动)早期探索
数据录入/迁移在缺乏 API 的旧系统间搬运数据中(RPA 的直接替代场景)
安全研究渗透测试、漏洞发现(自动化 GUI 探索)特殊场景,需审慎对待

关键指标

评估 Computer Use 能力的核心指标

指标说明当前状态
OSWorld 基准得分学术界常用的 OS 级 GUI Agent 评测基准Anthropic 未在官方发布中引用此基准的标准化得分,学术论文中各方案得分差异大 [需查阅最新论文]
WebArena 得分Web 任务完成率基准类上,需查阅最新对照实验
单步操作准确率模型输出的坐标/动作是否正确执行了意图定性:Beta 阶段”大部分简单操作正确”,复杂 UI 偶有失误 [用户社区反馈]
端到端任务完成率多步任务从头到尾成功完成的比例定性:简单任务(<10步)可用,长程任务(>20步)失败率显著上升
每步延迟从截屏到执行完动作的端到端时间定性:通常在数秒级别(取决于模型推理时间 + 截图大小 + 网络)
每步成本单次截图-推理-执行的 API 费用取决于截图分辨率和模型定价,具体费率参照 Anthropic 官方定价页

⚠️ 精确的基准得分和性能数据请以最新论文/官方发布为准,此处不做无依据的数字罗列。


供需与市场数据

市场定位

Computer Use 解锁的是一个现有巨大市场的 AI-native 替代方案

相关市场规模参考数据来源
全球 RPA 市场数十亿美元级(2024年),持续增长各研究机构报告,具体数字因口径而异
全球商业流程外包(BPO)市场千亿美元级行业报告
企业办公软件市场万亿美元级(含 Office/SaaS 等)各厂商财报汇总

Computer Use 并非直接替代以上市场,而是作为 AI Agent 的基础设施层,为上述市场提供新的自动化范式。

需求驱动力

  1. 长尾应用无 API:大量企业内部软件、遗留系统没有开放 API,GUI 操作是唯一自动化途径
  2. RPA 维护成本高:传统 RPA 在 UI 更新后频繁”断链”,LLM 的语义理解可缓解此问题
  3. 自然语言交互期望:用户期望用自然语言描述任务,而非学习脚本/流程设计器

供给侧瓶颈

  • 模型推理成本:每步都需调用多模态大模型,高频操作的成本可观
  • 可靠性不足:Beta 级产品尚不适合无人监督的生产环境
  • 延迟:实时交互场景对延迟敏感,当前方案的响应速度仍有差距
  • 安全/合规:让 AI 拥有系统级操控权限,在金融、医疗等监管严格行业面临合规障碍

代表公司与资本映射

公司角色相关布局资本市场关联
Anthropic核心发起者Claude Computer Use (Beta);直接产品/API一级市场高估值融资(Amazon/Google 投资)
OpenAI跟进竞争者Operator(2025.01)一级市场 + 微软战略合作
Google DeepMind跟进竞争者Project Mariner(Chrome 内 Agent)Alphabet 上市公司 (GOOGL)
Microsoft基础设施+应用Copilot 生态、Azure 虚拟桌面MSFT
UiPath传统 RPA 领导者已在集成 AI/LLM 能力(Document Understanding 等),面临范式替代风险与机会PATH (NYSE)
Automation Anywhere传统 RPA类似 UiPath,正在融合 AI Agent 能力私有
学术项目技术供给CogAgent(清华)、SeeClick(阿里)、OS-Atlas、WebArena 等基准和开源模型

投资映射逻辑:

  • 直接受益:提供 Computer Use 能力的模型厂商(Anthropic、OpenAI 等)——但多为非上市/有限参与
  • 间接受益:提供算力/云基础设施的公司(NVIDIA、AWS、Azure、GCP)
  • 潜在被颠覆:传统 RPA 厂商(UiPath 等)面临技术替代风险
  • 潜在被赋能:所有拥有 GUI 软件但缺乏 API 的企业应用——自动化门槛降低

投资逻辑

看多逻辑

  1. Agent 叙事的核心拼图:Computer Use 赋予 AI “行动力”,是从”聊天机器人”到”自主 Agent”的关键一步。Agent 是 AI 应用层最大的想象空间。
  2. 巨大的存量市场可替代:RPA/BPO/办公自动化市场规模庞大,Computer Use 提供了一种更通用、更低门槛的替代方案。
  3. 飞轮效应:更多用户使用 → 更多操作数据 → 模型更强 → 更多场景可用。数据飞轮一旦转起来,先发优势显著。
  4. 平台效应:谁的 Computer Use 生态最先成熟,谁就可能成为 AI Agent 时代的”操作系统”。

看空/审慎逻辑

  1. 仍是 Beta:可靠性不足以支撑生产环境,从 Demo 到可靠产品的路还很长。
  2. 成本结构不友好:每步操作都需调用大模型,复杂任务的总成本可能远超传统 RPA 方案。
  3. 安全/合规障碍大:在企业环境中,给予 AI 系统级操控权限的安全审计和合规审批流程漫长。
  4. 专用方案可能更优:对于高频、固定的流程,专用 API/RPA 方案的效率和成本远优于通用 Computer Use。Computer Use 的真正价值在长尾、临时、一次性任务。
  5. 传统 RPA 厂商不会坐以待毙:UiPath 等正在积极融合 AI,可能形成”AI + RPA”的混合方案,削弱纯 Computer Use 的差异化。

关键观察指标

  • Computer Use 从 Beta 转 GA(正式版)的时间线
  • 端到端任务完成率的提升速度
  • 每步推理成本的下降幅度(模型效率优化)
  • 企业客户的实际部署案例和 ROI 数据
  • 安全事故/合规案例的出现频率

常见误读纠偏

❌ 误读 1:“Computer Use 就是 AI 自己在用电脑,跟人一样”

纠偏: Computer Use 仍然受限于 截屏-推理-执行 的串行循环。它不像人可以同时看到整个屏幕并即时反应。每一步操作都有显著延迟(秒级),且模型的”理解”是基于单帧截图的推理,不具有人的连续视觉注意力和肌肉记忆。它更像是一个”每看一眼就做一步决定”的极慢速操作者,而非实时操控。

❌ 误读 2:“Computer Use 已经能完全替代 RPA 了”

纠偏: 远未到这一步。传统 RPA 在确定性、速度、成本方面仍有巨大优势。Computer Use 的真正价值在 RPA 覆盖不到的场景——即那些没有 API、UI 频繁变化、需要语义理解的长尾任务。短期内更可能的演进路径是 AI + RPA 的融合,而非简单替代。

❌ 误读 3:“模型通过看截图就能像人一样理解 UI”

纠偏: 模型对截图的理解能力虽强,但与人有本质差异:模型不理解交互的”惯性”(如按钮 hover 变色暗示可点击)、不理解操作的因果链(如表单验证失败需要回改哪些字段)、不理解异步状态(如”提交中”和”提交失败”的区别可能仅在细微的加载动画上)。这些都需要额外的帧采样和推理来弥补,而非真正的”理解”。

❌ 误读 4:“Computer Use 只是 Anthropic 的产品,其他家做的是不同东西”

纠偏: Computer Use 是 Anthropic 的 品牌名称,但 GUI Agent 这一技术方向是全行业的。OpenAI Operator、Google Mariner、学术界的 CogAgent/SeeClick/OS-Atlas 等解决的都是同一类问题——让 LLM 通过视觉理解和操作 GUI 界面。核心技术挑战和架构思路高度相似,差异主要在产品化程度、安全策略、操作范围等方面。


学习路径

入门级(1-2 小时)

  1. 阅读 Anthropic 官方关于 Computer Use 的发布博客和技术文档
  2. 在 Anthropic Console 中尝试 Computer Use Beta 的 API 调用(需有 API 访问权限)
  3. 观看官方 demo 视频,建立直觉

进阶级(1-2 天)

  1. 阅读 Anthropic 的 GitHub 参考实现源码,理解 Orchestrator Loop 的完整流程
  2. 在本地/云虚拟机中部署参考实现,实际操控一个简单任务
  3. 对比尝试 OpenAI Operator(如有访问权限),体会不同实现的差异

专家级(1-2 周)

  1. 阅读学术论文:
    • CogAgent(清华):专注于 GUI 理解的视觉-语言模型
    • SeeClick:GUI grounding 的专项研究
    • OS-Atlas:跨平台 GUI Agent 的基础模型
    • WebArena / OSWorld:GUI Agent 的评测基准论文
  2. 研究 LLM Tool Use 的通用框架(Anthropic Tool Use、OpenAI Function Calling)
  3. 思考 Agent 架构中的 规划-执行-反馈 循环设计模式(参考 ReAct、Reflexion 等)

一句话总结

Computer Use 让大语言模型从”只会说话”进化为”能动手操作电脑”——通过截图感知、视觉推理、鼠标键盘执行的闭环,打开了通向通用 AI Agent 的大门,但当前仍处于 Beta 阶段,可靠性、成本和安全性的工程挑战是走向规模应用的核心瓶颈。


延伸阅读与来源

  1. Anthropic 官方发布:《Introducing computer use》博客文章 + API 文档(2024.10) — 最权威的一手信息源
  2. Anthropic GitHub 参考实现:computer-use-demo 开源仓库 — 代码级理解
  3. OpenAI Operator 发布:OpenAI 官方博客(2025.01) — 竞品参考
  4. CogAgent: A Visual Language Model for GUI Agents(清华大学,2023-2024) — 学术技术细节
  5. SeeClick: Harnessing GUI Grounding for Advanced Visual GUI Agents(阿里等,2024) — 视觉 grounding 技术
  6. OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments(2024) — 评测基准
  7. WebArena: A Realistic Web Environment for Building Autonomous Agents(2023) — Web 场景基准
  8. UiPath / Automation Anywhere 财报与投资者材料 — 传统 RPA 市场数据参考

⚠️ 本页技术事实基于公开可查证的发布信息和学术论文。涉及具体性能数据、训练细节、商业数据的部分,已在文中标注信息来源或注明 [未充分披露]。搜索未能成功联网获取最新资料,部分内容可能存在时效性滞后,请以各厂商最新官方发布为准。

source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型