Computer Use(计算机操控)
3 秒看懂
一句话定义: 让大语言模型像人一样”看屏幕、动鼠标、敲键盘”,直接操控桌面计算机完成任务——从”会说”进化到”会做”。
类比: 你雇了一个远程助手,他通过屏幕共享看到你的电脑桌面,用远程桌面控制工具帮你操作软件、填写表格、搜索网页。
3 分钟产业解释
这是什么?
2024 年 10 月,Anthropic 在发布 Claude 3.5 Sonnet 更新版的同时,推出了 Computer Use(Beta) 功能。这是业界首个由主流大模型厂商公开提供的、模型直接操控桌面计算机界面的 API 能力。
核心机制极为直觉:
- 截屏 → 模型获取当前屏幕截图(图像输入)
- 理解 → 利用多模态视觉能力识别 UI 元素、文本、按钮等
- 行动 → 输出结构化指令:移动光标坐标、点击、键入文字、滚动、按键组合
- 循环 → 再次截屏,观察操作结果,继续下一步
这形成了一个 感知-决策-执行 的闭环,把 LLM 从”生成文本”升级为”在真实计算环境中执行任务”的 Agent。
为什么重要?
| 维度 | 意义 |
|---|---|
| 应用范式 | 任何有 GUI 的软件(无需 API 集成)都可被 AI 操控,大幅降低自动化门槛 |
| RPA 升级 | 传统 RPA 依赖固定脚本/规则,Computer Use 用自然语言描述任务即可 |
| Agent 基础设施 | 是通向通用 AI Agent 的关键一步——让模型不仅”思考”,还能”动手” |
| 生态影响 | 直接触动 UI 自动化、办公自动化、软件测试、客服自动化等万亿级市场 |
当前状态(截至 2025 年初)
- Beta 状态:Anthropic 明确标注为 Beta,不建议用于高风险/无人监督场景
- 开源参考实现:Anthropic 在 GitHub 发布了参考代码框架供开发者集成
- 竞争态势:Google(Project Mariner/Jarvis)、OpenAI(Operator, 2025年1月发布)、Microsoft(Copilot Actions)等均在布局类似能力
15 分钟专家深入
核心技术架构
Computer Use 的本质是将 GUI Agent 问题拆解为三个子系统的组合:
┌─────────────────────────────────────────────────┐
│ Claude Model │
│ (多模态 LLM + Tool Use 框架) │
│ │
│ 输入: 截图(图像) + 任务描述(文本) + 历史动作序列 │
│ 输出: 结构化 Action (坐标/文本/按键) │
└──────────┬──────────────────────┬────────────────┘
│ 感知层 │ 决策层
▼ ▼
┌──────────────────┐ ┌──────────────────────────┐
│ Screen Capture │ │ Action Space Definition │
│ (屏幕截图服务) │ │ (动作空间定义) │
└──────────────────┘ └──────────┬───────────────┘
│ 执行层
▼
┌──────────────────────────┐
│ Execution Runtime │
│ (鼠标/键盘模拟执行器) │
└──────────────────────────┘
1. 感知层:屏幕理解
模型接收的不是 DOM 树、不是 Accessibility Tree(虽然辅助能力可以结合使用),而是 原始像素截图。这意味着:
- 通用性极强:任何可视化界面理论上都可理解(桌面应用、网页、游戏、远程桌面)
- 挑战巨大:模型需要从像素中提取语义——识别按钮在哪、文本框是什么、下拉菜单展开了没有
- 分辨率与采样率的权衡:截图分辨率越高,视觉细节越丰富,但 token 消耗越大;采样频率越高,实时性越好,但成本越高。Anthropic 建议在实用性和成本间取平衡,具体参数因场景而异 [Anthropic 官方文档]
2. 决策层:动作空间(Action Space)
Anthropic Computer Use API 定义的核心动作包括:
| 动作 | 说明 |
|---|---|
mouse_move | 移动光标到指定 (x, y) 坐标 |
left_click / right_click / double_click | 鼠标点击 |
type | 在当前焦点位置键入字符串 |
key_press | 按下特定键(如 Enter、Tab、Ctrl+C 等组合键) |
scroll | 在指定方向滚动 |
screenshot | 请求重新截屏以获取最新屏幕状态 |
关键设计决策:使用绝对像素坐标而非相对位置。 模型需要输出如 (1247, 83) 这样的坐标来定位按钮。这对模型的视觉空间推理能力要求极高。
3. 执行层:Runtime
参考实现通常包含:
- 截屏服务(周期性或按需)
- 鼠标/键盘模拟(通过操作系统级别的输入注入,如 Python 的
pyautogui、xdotool等) - 一个编排循环(Orchestrator Loop):截屏 → 发送给模型 → 获取动作 → 执行 → 截屏 → …
与其他 Tool Use 的关系
Computer Use 在 Anthropic 的架构中是 Tool Use(工具调用) 框架的一种特殊实例。与 text_editor、bash 等工具并列,但 Computer Use 的特殊之处在于:
- 它是最通用的工具——理论上可以包装任何其他工具(打开文本编辑器再用它编辑 = 间接实现 text_editor)
- 它也是最低效的——每一步操作都需要截图-传输-推理-执行,延迟远高于直接 API 调用
- 它是最后手段——当没有 API/CLI 可用时,GUI 操作是唯一的交互路径
核心技术挑战
a) 坐标精度与视觉 grounding
模型需要将”点击保存按钮”这样的语义指令映射到精确的像素坐标。这要求强大的 visual grounding 能力。当前模型在此方面已相当不错,但在密集 UI(多个小按钮紧邻)或非标准 UI 中仍易出错。
b) 动作规划(Planning)
完成一个多步任务(如”在 Excel 中打开文件,找到第三行数据,复制到新文件”)需要长程规划。模型需要:
- 分解任务为子步骤
- 记住已完成的操作(上下文窗口管理)
- 处理意外情况(弹窗、错误提示、加载延迟)
c) 延迟与成本
每个”看一步做一步”的循环都需要一次完整的模型推理调用,加上截图传输和处理的开销。对于需要数十步的复杂任务,端到端延迟可能达到分钟级别,API 成本也不可忽视。
d) 安全与权限
模型拥有鼠标和键盘的完全控制权,意味着它可以:
- 访问任何已打开的应用
- 删除文件、发送邮件、修改数据
- 理论上操控任何操作系统功能
Anthropic 对此设置了多层防护:模型层面的拒绝训练、API 层面的速率限制、建议用户在沙箱/虚拟机中运行。但从根本上,这是”AI 拥有系统级权限”的安全边界问题,远未完全解决。
e) 鲁棒性
屏幕分辨率变化、UI 主题/语言切换、动态内容加载、窗口遮挡等因素都会影响截图解读的准确性。Beta 阶段用户普遍反馈在滚动操作、拖拽、复杂表单填写等场景下稳定性不足。
技术原理
完整推理循环机制
用户任务: "帮我在这个网站上注册一个账号,邮箱 test@example.com"
Step 1: 初始截屏
┌─────────────────────────────────────────┐
│ [浏览器窗口截图 - 显示网站首页] │
│ 模型推理: 需要找到"注册"按钮 │
│ 输出: mouse_move(856, 412), left_click │
└─────────────────────────────────────────┘
│ 执行
▼
Step 2: 截屏观察结果
┌─────────────────────────────────────────┐
│ [浏览器窗口截图 - 显示注册表单] │
│ 模型推理: 看到了邮箱输入框 │
│ 输出: mouse_move(640, 300), left_click, │
│ type("test@example.com") │
└─────────────────────────────────────────┘
│ 执行
▼
Step 3: 继续截屏 → 填写密码字段 → 提交 → ...
...循环直到任务完成或模型判断无法继续
底层多模态处理流程
截图 (PNG/JPEG 图像, 如 1280×800)
│
▼
Vision Encoder (如 ViT 变体)
→ 将图像编码为 patch-level 特征向量序列
→ 每个 patch 覆盖图像的一个局部区域
│
▼
特征映射到 LLM 的 token 空间
→ 图像特征序列与文本 token 序列拼接
→ 输入 Transformer decoder
│
▼
LLM 推理 (含任务描述 + 历史动作 + 当前截图)
→ 模型在理解视觉内容的基础上进行推理
→ 输出结构化的动作指令 (坐标 + 动作类型 + 参数)
Tool Use 协议
Computer Use 通过 Anthropic API 的标准 Tool Use 接口实现。模型被训练为可以在对话过程中识别何时需要调用 computer_use 工具,并生成符合工具 schema 的 JSON 输出。关键的 schema 字段:
{
"tool": "computer_use",
"action": "left_click",
"coordinate": [856, 412]
}
坐标的参考系为截图的像素坐标系,原点在左上角。
空间推理能力的技术基础
模型能够将语义指令映射到坐标,依赖于:
- 大规模视觉-语言对齐训练:模型在海量图文对数据上训练,建立了文本描述与视觉区域之间的关联
- 指令微调(Instruction Tuning):针对 GUI 操作场景的专门微调数据(屏幕截图 + 对应操作标注)
- 推理链(Chain-of-Thought):模型在输出坐标前,会内部推理”注册按钮在页面右上角,大约坐标 (856, 412)“这样的中间步骤
⚠️ 具体训练数据构成和微调细节 Anthropic 未充分公开披露,上述为基于公开信息的合理技术推断。
技术演进史
| 时间 | 事件 | 意义 |
|---|---|---|
| 2017-2019 | 学术界出现 GUI Agent 研究(如 RICO 数据集、AITW 数据集) | 早期探索,基于小模型,实用性有限 |
| 2020-2022 | RPA 市场繁荣(UiPath 等),基于规则/脚本的 UI 自动化 | 确定了需求存在,但维护成本高、泛化能力差 |
| 2023 | GPT-4V 发布,多模态 LLM 具备屏幕理解能力;学术界涌现大量 LLM-based GUI Agent 论文(如 CogAgent、SeeClick、OS-Atlas) | 技术可行性得到验证 |
| 2024.04 | Microsoft UFO(UI-Focused Agent)项目公开 | 大厂开始正式布局 GUI Agent |
| 2024.10 | Anthropic 发布 Computer Use (Beta) + Claude 3.5 Sonnet 更新 | 首个主流大模型厂商公开提供 Computer Use API |
| 2024.11 | Google 展示 Project Mariner(Chrome 浏览器内 Agent) | 浏览器场景的 Computer Use 变体 |
| 2025.01 | OpenAI 发布 Operator | 竞争者跟进,验证赛道共识 |
| 2025.Q1+ | Claude 3.5/3.7 Sonnet 持续迭代,Computer Use 能力随之提升;多家厂商推出类似功能 | 从 Beta 向产品化演进中 |
技术路线的代际划分:
- 第一代(2017-2022):基于 OCR + 规则匹配 + 固定脚本 → 无泛化能力
- 第二代(2023):基于多模态 LLM + 简单提示 → 概念验证,准确率不足
- 第三代(2024-至今):基于专门训练的视觉-动作模型 + Tool Use 框架 + 安全防护 → 可用但仍为 Beta
技术路线对比
Computer Use 技术方案对比
| 维度 | Anthropic Computer Use | OpenAI Operator | Google Project Mariner | 学术方案(CogAgent 等) |
|---|---|---|---|---|
| 发布时间 | 2024.10 [Anthropic] | 2025.01 [OpenAI] | 2024.11 展示 [Google] | 2023-2024(各论文) |
| 底层模型 | Claude 3.5 Sonnet (更新版) | GPT-4o(Operator 专用版本,[未完全披露]) | Gemini 系列 [未完全披露] | 专用视觉-语言模型 |
| 感知方式 | 截图(原始像素) | 截图 + 辅助信息 [推测] | 截图 + 浏览器 DOM/辅助信息 [推测] | 截图为主 |
| 操作范围 | 桌面全应用 | 浏览器为主(沙箱化) | Chrome 浏览器 | 实验环境 |
| 动作空间 | 鼠标/键盘/截屏 | 浏览器交互 [未完全披露] | 浏览器交互 | 鼠标/键盘/触屏 |
| 开放程度 | API 公开(Beta),有参考实现 | API 公开(有限区域/用户) | 有限预览 | 开源(学术论文/代码) |
| 安全策略 | 模型拒训 + 建议沙箱 | 专用沙箱浏览器环境 | 浏览器沙箱 | 无生产级安全措施 |
| 成熟度 | ★★★☆ | ★★☆☆ | ★★☆☆ | ★☆☆☆ |
注:OpenAI Operator 和 Google Mariner 的技术细节公开程度有限,上表中部分信息为基于公开演示和文档的推断,已标注。
与传统 RPA 对比
| 维度 | Computer Use(LLM-based) | 传统 RPA(UiPath/Automation Anywhere 等) |
|---|---|---|
| 任务定义 | 自然语言描述 | 可视化流程设计器 / 脚本编写 |
| 泛化能力 | 高(理解语义,适应 UI 变化) | 低(UI 变化需重新录制/修改脚本) |
| 可靠性 | 中(Beta 级,偶有错误) | 高(规则确定,但脆弱性在 UI 变化时暴露) |
| 速度 | 没(每步需模型推理,秒级延迟) | 快(直接定位元素,毫秒级操作) |
| 成本 | 按 token/API 调用计费,复杂任务费用可观 | 软件许可费,边际成本低 |
| 部署复杂度 | 低(API 调用 + 执行环境) | 中-高(需配置开发环境、维护脚本) |
上下游
上游(供给端)
┌──────────────────────────────────────────────────────┐
│ 模型层 │
│ 多模态大模型 (Claude, GPT-4o, Gemini...) │
│ └── 视觉编码器 (ViT 变体) │
│ └── 语言模型 (Transformer Decoder) │
│ └── 视觉-动作对齐训练数据 │
├──────────────────────────────────────────────────────┤
│ 算力层 │
│ GPU/TPU 推理集群 │
│ └── 多模态推理的高算力需求 (图像 token 量大) │
│ └── 每步操作一次推理 → 频繁调用 │
├──────────────────────────────────────────────────────┤
│ 执行环境层 │
│ 虚拟机 / 容器 / 沙箱 │
│ └── 云桌面服务 (AWS WorkSpaces, Azure Virtual Desktop)│
│ └── 浏览器沙箱 │
│ └── 输入模拟库 (pyautogui, xdotool 等) │
└──────────────────────────────────────────────────────┘
下游(需求端/应用场景)
| 场景 | 描述 | 成熟度 |
|---|---|---|
| 办公自动化 | 自动填写表单、操作 Excel、收发邮件、文件管理 | 中(Beta 级可用) |
| Web 操作 | 网站注册、数据采集、在线购物、信息查询 | 中 |
| 软件测试 | GUI 自动化测试、回归测试、跨应用端到端测试 | 低-中(需更高可靠性) |
| 客服/支持 | 远程协助用户操作软件、帮助排障 | 低(安全和可靠性要求高) |
| 无障碍辅助 | 帮助残障人士操作计算机(自然语言驱动) | 早期探索 |
| 数据录入/迁移 | 在缺乏 API 的旧系统间搬运数据 | 中(RPA 的直接替代场景) |
| 安全研究 | 渗透测试、漏洞发现(自动化 GUI 探索) | 特殊场景,需审慎对待 |
关键指标
评估 Computer Use 能力的核心指标
| 指标 | 说明 | 当前状态 |
|---|---|---|
| OSWorld 基准得分 | 学术界常用的 OS 级 GUI Agent 评测基准 | Anthropic 未在官方发布中引用此基准的标准化得分,学术论文中各方案得分差异大 [需查阅最新论文] |
| WebArena 得分 | Web 任务完成率基准 | 类上,需查阅最新对照实验 |
| 单步操作准确率 | 模型输出的坐标/动作是否正确执行了意图 | 定性:Beta 阶段”大部分简单操作正确”,复杂 UI 偶有失误 [用户社区反馈] |
| 端到端任务完成率 | 多步任务从头到尾成功完成的比例 | 定性:简单任务(<10步)可用,长程任务(>20步)失败率显著上升 |
| 每步延迟 | 从截屏到执行完动作的端到端时间 | 定性:通常在数秒级别(取决于模型推理时间 + 截图大小 + 网络) |
| 每步成本 | 单次截图-推理-执行的 API 费用 | 取决于截图分辨率和模型定价,具体费率参照 Anthropic 官方定价页 |
⚠️ 精确的基准得分和性能数据请以最新论文/官方发布为准,此处不做无依据的数字罗列。
供需与市场数据
市场定位
Computer Use 解锁的是一个现有巨大市场的 AI-native 替代方案:
| 相关市场 | 规模参考 | 数据来源 |
|---|---|---|
| 全球 RPA 市场 | 数十亿美元级(2024年),持续增长 | 各研究机构报告,具体数字因口径而异 |
| 全球商业流程外包(BPO)市场 | 千亿美元级 | 行业报告 |
| 企业办公软件市场 | 万亿美元级(含 Office/SaaS 等) | 各厂商财报汇总 |
Computer Use 并非直接替代以上市场,而是作为 AI Agent 的基础设施层,为上述市场提供新的自动化范式。
需求驱动力
- 长尾应用无 API:大量企业内部软件、遗留系统没有开放 API,GUI 操作是唯一自动化途径
- RPA 维护成本高:传统 RPA 在 UI 更新后频繁”断链”,LLM 的语义理解可缓解此问题
- 自然语言交互期望:用户期望用自然语言描述任务,而非学习脚本/流程设计器
供给侧瓶颈
- 模型推理成本:每步都需调用多模态大模型,高频操作的成本可观
- 可靠性不足:Beta 级产品尚不适合无人监督的生产环境
- 延迟:实时交互场景对延迟敏感,当前方案的响应速度仍有差距
- 安全/合规:让 AI 拥有系统级操控权限,在金融、医疗等监管严格行业面临合规障碍
代表公司与资本映射
| 公司 | 角色 | 相关布局 | 资本市场关联 |
|---|---|---|---|
| Anthropic | 核心发起者 | Claude Computer Use (Beta);直接产品/API | 一级市场高估值融资(Amazon/Google 投资) |
| OpenAI | 跟进竞争者 | Operator(2025.01) | 一级市场 + 微软战略合作 |
| Google DeepMind | 跟进竞争者 | Project Mariner(Chrome 内 Agent) | Alphabet 上市公司 (GOOGL) |
| Microsoft | 基础设施+应用 | Copilot 生态、Azure 虚拟桌面 | MSFT |
| UiPath | 传统 RPA 领导者 | 已在集成 AI/LLM 能力(Document Understanding 等),面临范式替代风险与机会 | PATH (NYSE) |
| Automation Anywhere | 传统 RPA | 类似 UiPath,正在融合 AI Agent 能力 | 私有 |
| 学术项目 | 技术供给 | CogAgent(清华)、SeeClick(阿里)、OS-Atlas、WebArena 等基准和开源模型 | — |
投资映射逻辑:
- 直接受益:提供 Computer Use 能力的模型厂商(Anthropic、OpenAI 等)——但多为非上市/有限参与
- 间接受益:提供算力/云基础设施的公司(NVIDIA、AWS、Azure、GCP)
- 潜在被颠覆:传统 RPA 厂商(UiPath 等)面临技术替代风险
- 潜在被赋能:所有拥有 GUI 软件但缺乏 API 的企业应用——自动化门槛降低
投资逻辑
看多逻辑
- Agent 叙事的核心拼图:Computer Use 赋予 AI “行动力”,是从”聊天机器人”到”自主 Agent”的关键一步。Agent 是 AI 应用层最大的想象空间。
- 巨大的存量市场可替代:RPA/BPO/办公自动化市场规模庞大,Computer Use 提供了一种更通用、更低门槛的替代方案。
- 飞轮效应:更多用户使用 → 更多操作数据 → 模型更强 → 更多场景可用。数据飞轮一旦转起来,先发优势显著。
- 平台效应:谁的 Computer Use 生态最先成熟,谁就可能成为 AI Agent 时代的”操作系统”。
看空/审慎逻辑
- 仍是 Beta:可靠性不足以支撑生产环境,从 Demo 到可靠产品的路还很长。
- 成本结构不友好:每步操作都需调用大模型,复杂任务的总成本可能远超传统 RPA 方案。
- 安全/合规障碍大:在企业环境中,给予 AI 系统级操控权限的安全审计和合规审批流程漫长。
- 专用方案可能更优:对于高频、固定的流程,专用 API/RPA 方案的效率和成本远优于通用 Computer Use。Computer Use 的真正价值在长尾、临时、一次性任务。
- 传统 RPA 厂商不会坐以待毙:UiPath 等正在积极融合 AI,可能形成”AI + RPA”的混合方案,削弱纯 Computer Use 的差异化。
关键观察指标
- Computer Use 从 Beta 转 GA(正式版)的时间线
- 端到端任务完成率的提升速度
- 每步推理成本的下降幅度(模型效率优化)
- 企业客户的实际部署案例和 ROI 数据
- 安全事故/合规案例的出现频率
常见误读纠偏
❌ 误读 1:“Computer Use 就是 AI 自己在用电脑,跟人一样”
纠偏: Computer Use 仍然受限于 截屏-推理-执行 的串行循环。它不像人可以同时看到整个屏幕并即时反应。每一步操作都有显著延迟(秒级),且模型的”理解”是基于单帧截图的推理,不具有人的连续视觉注意力和肌肉记忆。它更像是一个”每看一眼就做一步决定”的极慢速操作者,而非实时操控。
❌ 误读 2:“Computer Use 已经能完全替代 RPA 了”
纠偏: 远未到这一步。传统 RPA 在确定性、速度、成本方面仍有巨大优势。Computer Use 的真正价值在 RPA 覆盖不到的场景——即那些没有 API、UI 频繁变化、需要语义理解的长尾任务。短期内更可能的演进路径是 AI + RPA 的融合,而非简单替代。
❌ 误读 3:“模型通过看截图就能像人一样理解 UI”
纠偏: 模型对截图的理解能力虽强,但与人有本质差异:模型不理解交互的”惯性”(如按钮 hover 变色暗示可点击)、不理解操作的因果链(如表单验证失败需要回改哪些字段)、不理解异步状态(如”提交中”和”提交失败”的区别可能仅在细微的加载动画上)。这些都需要额外的帧采样和推理来弥补,而非真正的”理解”。
❌ 误读 4:“Computer Use 只是 Anthropic 的产品,其他家做的是不同东西”
纠偏: Computer Use 是 Anthropic 的 品牌名称,但 GUI Agent 这一技术方向是全行业的。OpenAI Operator、Google Mariner、学术界的 CogAgent/SeeClick/OS-Atlas 等解决的都是同一类问题——让 LLM 通过视觉理解和操作 GUI 界面。核心技术挑战和架构思路高度相似,差异主要在产品化程度、安全策略、操作范围等方面。
学习路径
入门级(1-2 小时)
- 阅读 Anthropic 官方关于 Computer Use 的发布博客和技术文档
- 在 Anthropic Console 中尝试 Computer Use Beta 的 API 调用(需有 API 访问权限)
- 观看官方 demo 视频,建立直觉
进阶级(1-2 天)
- 阅读 Anthropic 的 GitHub 参考实现源码,理解 Orchestrator Loop 的完整流程
- 在本地/云虚拟机中部署参考实现,实际操控一个简单任务
- 对比尝试 OpenAI Operator(如有访问权限),体会不同实现的差异
专家级(1-2 周)
- 阅读学术论文:
- CogAgent(清华):专注于 GUI 理解的视觉-语言模型
- SeeClick:GUI grounding 的专项研究
- OS-Atlas:跨平台 GUI Agent 的基础模型
- WebArena / OSWorld:GUI Agent 的评测基准论文
- 研究 LLM Tool Use 的通用框架(Anthropic Tool Use、OpenAI Function Calling)
- 思考 Agent 架构中的 规划-执行-反馈 循环设计模式(参考 ReAct、Reflexion 等)
一句话总结
Computer Use 让大语言模型从”只会说话”进化为”能动手操作电脑”——通过截图感知、视觉推理、鼠标键盘执行的闭环,打开了通向通用 AI Agent 的大门,但当前仍处于 Beta 阶段,可靠性、成本和安全性的工程挑战是走向规模应用的核心瓶颈。
延伸阅读与来源
- Anthropic 官方发布:《Introducing computer use》博客文章 + API 文档(2024.10) — 最权威的一手信息源
- Anthropic GitHub 参考实现:computer-use-demo 开源仓库 — 代码级理解
- OpenAI Operator 发布:OpenAI 官方博客(2025.01) — 竞品参考
- CogAgent: A Visual Language Model for GUI Agents(清华大学,2023-2024) — 学术技术细节
- SeeClick: Harnessing GUI Grounding for Advanced Visual GUI Agents(阿里等,2024) — 视觉 grounding 技术
- OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments(2024) — 评测基准
- WebArena: A Realistic Web Environment for Building Autonomous Agents(2023) — Web 场景基准
- UiPath / Automation Anywhere 财报与投资者材料 — 传统 RPA 市场数据参考
⚠️ 本页技术事实基于公开可查证的发布信息和学术论文。涉及具体性能数据、训练细节、商业数据的部分,已在文中标注信息来源或注明 [未充分披露]。搜索未能成功联网获取最新资料,部分内容可能存在时效性滞后,请以各厂商最新官方发布为准。