机器人基础模型
1 3 秒看懂
机器人基础模型是一种在海量多模态数据上预训练的大规模神经网络,直接输出机器人末端执行器的连续运动轨迹或离散动作指令。它把视觉感知、语言理解与物理行动统一在一个模型里,让机器人首次具备“看—懂—做”的端到端泛化能力,无需针对每个新物体、新场景重新编程。
2 3 分钟产业解释
传统工业机器人依赖“感知—规划—控制”的分离式流水线,每一环都由人工编写的规则或专用模型驱动。一旦工件形状、光照、背景发生变化,整个系统就需要重新调试,部署成本往往超过硬件本身。机器人基础模型的诞生,本质上是将大语言模型的“规模定律”从文本世界迁移到物理世界,其产业驱动力来自三个条件的同步成熟:
① Transformer 架构的多模态扩展 自回归 Transformer 和扩散 Transformer 可以将相机图像、深度图、机器人关节状态、末端力觉等异构数据统一编码为 token 序列,再以语言指令作为条件,直接生成动作。这打破了以往“视觉归视觉、控制归控制”的模块割裂。
② 机器人操作数据的规模化构建 谷歌、Meta、斯坦福、伯克利等机构已构建起包含数十万乃至上百万条机器人示教轨迹的数据集(如 Open X-Embodiment、DROID 等)。数据来源包括人工遥操作、仿真域随机化、人类执行日常任务的第一人称视频,经逆强化学习或运动重定向补全为机器人可执行轨迹。数据规模正在从“数千条”向“数十万小时”跃迁,初步满足了预训练对数据量的要求。
③ 具身对齐的突破 “拿一个苹果”这样的自然语言指令被直接映射为 6 自由度末端位姿序列或关节角度序列(通常 6 轴或 7 轴),中间无需人工定义“苹果”的形状特征或抓取姿态。这是通过将语言嵌入与动作潜空间进行对齐训练实现的,使模型能够零样本执行“把蓝色积木放进红色杯子”这样的新组合。
产业路线的分野 当前主流路线分成两大阵营:一是从视觉‑语言模型(VLM)扩展,将动作空间离散化成数千个桶,用自回归方式生成下一个动作 token,代表如谷歌 RT-2;二是原生动作扩散模型,用去噪扩散概率模型直接生成连续平滑的力/位轨迹,代表如哥伦比亚大学及丰田研究院的 Diffusion Policy、伯克利 Octo 等。两者的取舍直接决定了模型的精度、推理延迟与可部署场景。
产业意义 机器人第一次从“用编程实现自动化”走向“用数据驱动通用性”。如果基础模型在关键场景的错误率降至可接受水平,系统集成商的成本结构将发生根本性变化——高毛利的知识工程将被“数据采集 + 算力推理”替代,机器人价值链的重心也将从整机集成向数据资产与模型能力迁移。
3 技术原理
机器人基础模型的核心任务可以抽象为:给定时间 $$t$ 的观测 \o_t`(RGB‑D 图像序列、本体关节角 `q_t`、末端力觉)和自然语言指令 $l$$,预测时刻 $$t$ 的动作 `a_t`(末端位姿或关节目标),或者直接输出长度为 $H$$ 的未来动作轨迹 mathbf(a)_{t:t+H}`。其技术原理围绕“表示—融合—解码”三个环节展开,当前存在两条并行的技术路径。
路径一:离散化自回归生成(类语言模型)
将动作空间量化成离散的 bins。例如,末端位置 $$(x,y,z)$$ 在每个维度上以 1 mm 精度离散到 256 个区间,姿态用欧拉角或四元数离散化,夹爪开合二值化。全动作通常需要一个 7~9 维的离散 token 序列。模型采用因果 Transformer 解码器,基于历史视觉 token 与文本嵌入自回归地预测下一个动作 token。训练目标为交叉熵损失:
mathcal(L) = -\sum_{t} \log P(a_t^{text(token)} \mid o_{\le t}, l)
推理时使用温度采样或束搜索。这条路线的最大优势是可以无缝复用大语言模型(LLM)成熟且高度优化的训练与推理基础设施;但离散化会丢失精细操控所要求的微米级精度,并容易出现离散化“颤振”——相邻时间步的动作 token 在两个 bin 之间来回跳变,导致机械臂抖动。
路径二:连续动作扩散模型
以去噪扩散概率模型(DDPM)为核心,把一条长度为 $$H$$ 的动作轨迹 mathbf(a)^0 作为去噪目标。视觉特征由 ViT 提取,语言指令由冻结的预训练 LLM 编码,两者通过 FiLM 或交叉注意力注入去噪网络(通常是 1D 卷积 U‑Net 或 Diffusion Transformer)。训练时对真实动作轨迹逐步加噪:
mathbf(a)^k = \sqrt{\bar{\alpha}_k} mathbf(a)^0 + sqrt(1-\bar{\alpha)_k} \boldsymbol{\epsilon}, \quad \boldsymbol{\epsilon} \sim mathcal(N)(0, mathbf(I))
去噪网络 \epsilon_\theta 预测所加噪声,损失为:
mathcal(L) = mathbb(E)_{k, mathbf(a)^0, \boldsymbol{\epsilon}} \left[ \| \boldsymbol{\epsilon} - \epsilon_\theta(mathbf(a)^k, k, text(vis\_feat), text(lang\_emb)) \|^2 \right]
推理时从纯高斯噪声出发,经数十步迭代去噪,生成平滑的动作轨迹。这种方式输出天然连续、精度高,特别适用于需要力控或阻抗控制的接触密集型操作,但多步前传使得单次推理时延通常为 0.1~1 秒,需要模型蒸馏或一致性模型等加速技术。
路径三(新兴):流匹配与一致性模型 流匹配将扩散过程中的随机微分方程替换为确定性常微分方程,可在少数几步(甚至 2~4 步)内生成高质量动作。Physical Intelligence 等团队已于 2024 年展示将该方法用于通用机器人策略,兼顾速度与轨迹质量。
跨模态融合与记忆 视觉编码器多采用空间-时间 ViT,同时提取当前帧与历史帧特征。语言编码大多冻结预训练 LLM(如 PaLM-E、Llama 3),以保持指令泛化能力。视觉与语言特征通过交叉注意力层或特征线性调制(FiLM)融合后,送入动作解码器。几乎所有实用系统都引入“历史窗口”——将过去 $$k$$ 步的观测‑动作对一并输入,以隐式学习环境动力学和任务进度,有效缓解部分可观测问题。
训练数据形态与训练流程 单条训练样本包含:初始 RGB‑D 图像序列、指令文本、末端位姿序列(或关节角序列)、夹爪开合状态。数据来源及典型规模(据公开文献与行业报告):
- 真实遥操作:通过 3D 鼠标、力反馈手套或同构外骨骼采集,单台装备每小时可产生约 1~2 条高质量示教轨迹。据谷歌 2023 年 RT-2 论文,RT‑1 训练使用了 130k 条真实机器人示教轨迹。
- 仿真生成:基于 Isaac Sim、MuJoCo 等平台,结合域随机化,以极低成本生成海量数据。Open X-Embodiment 数据集中包含大量仿真数据,真实/仿真比例通常介于 1:10 到 1:100(行业估算)。
- 人类视频:如 Ego4D、YouTube 视频,仅提供视觉示范,必须借助逆强化学习、运动重定向或未来预测模型将其“翻译”为机器人动作标签。这类数据的噪声较大,当前主要用于预训练表征。
训练通常分为两阶段:先在大规模跨具身数据集上预训练视觉‑语言‑动作表征,再在特定机器人和目标场景的小样本真实数据上微调。微调数据量可从数十条示教起,极大降低了场景部署成本。
推理部署时的技术约束 底层伺服控制周期通常在 5 ms~50 ms 之间,这意味着模型推理延迟必须低于这一阈值,否则必须与高频反馈控制器解耦,采用“慢策略 + 快伺服”层级架构。现阶段多数扩散模型尚无法直接满足硬实时要求,但可通过一次生成多条轨迹 + 在线插值或模型蒸馏来弥补。
4 关键参数
评价机器人基础模型的技术与商业竞争力,需从技术性能、工程效率、商业回报三个维度考察,以下指标均取自公开论文、行业报告及公司披露,部分数据因厂商未公开而标注“公开资料未见”。
4.1 技术性能指标
- 单步成功率与完整任务序列成功率:衡量模型完成一个动作指令(如“抓起物体”)的概率,以及完成多步长序列任务(如“从抽屉取出螺丝刀并放置在桌面”)的整体成功率。早期系统(如 2022 年谷歌 RT‑1)在已见任务上单步成功率可达 90%+,但在长序列任务上成功率会急剧衰减至 50% 以下(来源:谷歌论文)。到 2024 年,Octo、RT‑2‑X 等开源模型在泛化设定下的 5 步任务成功率约为 60% ~ 80%,具体视任务难度和物体种类而异。
- 泛化衰减率:模型在未见物体、未见背景、未遇语言指令上的成功率相对已见状况的下降幅度。理想目标为 <10 %。2023 年 RT‑2 论文显示,其在未见过物体上的抓取成功率相比见过的物体下降约 15 %~ 25 %(来源:谷歌《RT‑2: Vision-Language-Action Models》)。国内部分整机企业自研模型泛化数据公开资料未见。
- 推理延迟:从相机帧捕获到模型输出动作指令的时间。离散自回归路线通常 <10 ms/步;连续扩散路线为 100 ms
1000 ms/步(10100 步去噪);蒸馏或流匹配版本可压缩到 20 ms~50 ms/步(来源:各模型技术报告)。 - 动作平滑度:以动作序列加速度的方差衡量,单位
(text(m/s)^2)^2或关节角加速度方差。工业应用通常要求加速度方差小于某一经验阈值以防机械臂抖动。扩散模型天然产出平滑轨迹,加速度方差可比离散动作低一个数量级(定性结论,定量阈值因机械臂类型而异)。
4.2 工程指标
- 模型规模与计算量:参数量从数百 M(Octo 约 850 M,2024 年)到数十 B(RT‑2 使用 PaLI‑X‑55B 作为骨干,2023 年)不等。单次推理 FLOPs 从数 G 到数百 G,直接影响边缘推理芯片的选型。
- 数据效率:新场景达到 70% 成功率所需的新增真实示教轨迹数(或时长)。根据 Octo 团队的实验,某些桌面操作任务仅需 10~50 条新示教即可实现合理泛化(来源:Octo 项目 Blog,2024 年)。更高精度、力觉密集型任务可能需要数百条示教。
- 安全违规率:运行期间发生碰撞、力矩超限、速度过冲等异常事件的比例。目前学术界多采用仿真评估,真实工业环境所要求的碰撞率通常低于每千小时一次,行业现阶段公开资料未见达标证明。
4.3 商业参数
- 模型许可费或单价:当前市场处于早期,多数模型以开源或绑定硬件方式交付,独立定价体系未建立。部分初创公司提出“按机器人台数+年限”收费模式,尚未有公开的标准化价格。
- 部署成本降幅:据物流集成商定性反馈,采用基础模型后可缩短现场部署时间 50% ~ 70%(集成商在行业会议分享,非精确统计),但该数字因场景而异,缺乏第三方审计。
- 硬件依赖成本:部署基础模型通常需配置至少一颗边缘 AI 推理芯片(如 NVIDIA Jetson Orin,单颗成本约 199~1999 美元,按型号,2024 年官方定价)及多个 RGB‑D 相机,这些硬件成本对中小型机器人本体形成额外负担。
5 技术路线
当前主流技术路线从动作生成方式、推理速度、精度、数据结构需求等维度形成鲜明对比。下表基于 2024 年末已公开的论文与产品信息综合整理,量化数据标注来源,不确切的以“定性”标注。
| 路线 | 动作形式 | 模型核心 | 推理延迟(典型) | 精度/顺滑度 | 数据需求 | 代表性工作/机构 |
|---|---|---|---|---|---|---|
| 离散自回归 | 分桶离散 token | 因果 Transformer | <10 ms(单 token) | 中等,易有离散颤振 | 大量多维标注动作(RT‑1: 130k 条) | 谷歌 RT‑1、RT‑2(2022‑2023);Gato(DeepMind, 2022) |
| 连续扩散 | 连续轨迹序列 | 扩散 U‑Net / DiT | 100 ms ~ 1 s(多步去噪) | 高,轨迹平滑 | 高质量连续轨迹(精细示教或仿真) | Diffusion Policy(哥伦比亚大学/TRI, 2023);Octo(伯克利等, 2024) |
| 流匹配/一致性模型 | 连续轨迹 | 流匹配 ODE 网络 | 20 ms ~ 50 ms(2~4 步生成) | 高 | 与扩散类似 | Physical Intelligence π0(2024);UC Berkeley 相关预印本 |
| 混合层级架构 | 离散子任务 + 连续动作 | LLM/CLIP 规划+扩散伺服 | 规划 100 ms+ 动作 20 ms | 子任务级鲁棒,动作精细 | 分层数据(语言+动作) | 苏黎世联邦理工、斯坦福 VIMA、Figure 01(部分公开信息) |
路线收敛趋势 2024 ~ 2025 年,头部团队普遍转向“扩散/流匹配 Transformer + 蒸馏”以同时追求高精度与低延迟,纯离散化路线在精细操作领域逐渐退居语义规划层。谷歌 RT‑2 已展现将 VLM 扩展为扩散解码的可能性(后续工作如 RT‑X),OpenAI‑Figure 合作则演示了“大模型规划+扩散动作”的层次化方案。国内企业多采用“VLM 或 LLM 规划 + 自研连续控制器”的混合方案,底层具体细节大多未公开。
6 上游
机器人基础模型的上游供应链由数据生产、算力基础设施、预训练组件三大部分构成,每一环节的产能与价格都可能影响模型迭代速度与商业化成本。
6.1 数据采集与生产
- 遥操作硬件:3Dconnexion 空间鼠标、Haption 力反馈设备、Shadow Hand 灵巧手外骨骼、人形上半身遥操作系统(如宇树提供的专用示教套件)是真实操作数据的主要来源。据业界估算,一套专业级遥操作系统的成本在 2 万~20 万美元(不含机器人本体),量产较低。
- 仿真引擎与生成工具:NVIDIA Isaac Sim、MuJoCo(DeepMind 开源)、CoppeliaSim、RoboDK 等支持程序化场景生成、域随机化、物理真实渲染。英伟达在 GTC 2024 上发布 Isaac Lab 和 GR00T 项目,旨在为各个人形机器人公司提供统一的仿真与数据生成基础设施。
- 人类视频数据源:Ego4D、Epic‑Kitchens、YouTube 等,需经过三维重建、手‑物交互估计、运动重定向等算法后处理。处理后的数据可作为弱监督信号,降低对遥操作的依赖。
6.2 算力基础设施
- 训练算力:大型基础模型训练需上千块 NVIDIA H100/A100 GPU 的集群,算力需求可达数百至数千 petaFLOPS‑days。谷歌 DeepMind、OpenAI、特斯拉均自建超算。据公开报道,特斯拉 2024 年在 Cortex 训练集群上部署了数万块 H100(来源:特斯拉 2024 年 Q2 财报电话会)。
- 边缘推理芯片:部署阶段依赖低功耗、高实时性的 AI 系统级芯片(SoC)。主流选择有 NVIDIA Jetson Orin AGX(275 TOPS,2024 年官方售价 1999 美元/千片)、高通 Robotics RBx 系列(~70 TOPS)、地平线征程 6 等高算力芯片。多家国内整车厂与人形机器人公司正自研或联合定制专用推理 SoC,但多数尚未量产(截至 2025 年初)。
6.3 预训练组件
- 视觉‑语言骨干:以冻结权重使用的 VLM/LLM 是模型基础能力的主要来源,选择包括 PaLI‑X、PaLM‑E、Gemini(谷歌)、Llama 3(Meta)、Qwen‑VL(阿里)等。商用闭源模型需考虑 API 延迟、调用成本和许可证限制;开源模型则需团队有充分的能力进行微调与适配。
- 基础动作表征:一些中游公司开始提供预训练的视觉‑动作编码器作为中间件,让下游集成商只需少量数据即可完成新任务微调,但该商业模式仍处于极早期。
7 下游
机器人基础模型附着于具体硬件和场景,其价值释放与下游各赛道的渗透节奏紧密相关。
7.1 工业与物流
电商仓储的混箱拣选、快递包裹分拣、3C 电子装配中的柔性插拔是当前验证最快的场景。显性需求:将新 SKU 的部署时间从数天压缩到数小时,错误率控制在 ≤ 0.1 %。据公开测试,2024 年 Covariant 的 RFM-1 模型在多家第三方物流仓库执行拾取‑放置任务,单步成功率可达 99% 以上(来源:Covariant 公开博客),但长序列任务仍须依赖人工远程介入。该领域对安全认证(ISO 10218、ISO/TS 15066)有强制要求,会影响模型迭代的节奏。
7.2 人形与服务机器人
人形机器人(Figure 02、Tesla Optimus、1X NEO、宇树 H1/G1、智元远征 A1 等)是基础模型最具想象力的载体。它们须在非结构化家庭与商用环境中执行多步移动操作(如“从冰箱取出牛奶倒入杯中”),对泛化性、安全性、人机交互自然度要求极高。2024 年 Figure 与 OpenAI 合作展示了人形机器人根据口语指令识别物体、拾取并放置的端到端闭环演示;特斯拉 2024 年 Q2 更新显示 Optimus 开始在电池工厂执行简单分拣任务。目前各家人形出货量均为百台级(2024 年),尚未进入大规模家庭部署,产品化仍处研发验证阶段。
7.3 特种与医疗作业
核电检修、太空在轨操作、水下维护等特种场景要求模型在极少数示教数据、窄带通信且计算资源受限的边缘端离线运行。此类场景对模型压缩、蒸馏及安全约束遵守的要求极端苛刻,目前多由国防或航天局资助研究,商用案例稀少(公开资料未见部署数量)。医疗手术机器人则要求模型具备亚毫米精度和可解释性,且须通过 FDA/NMPA 审批,基础模型在该领域的渗透可能长期滞后。
8 受益公司
基础模型将带动整条具身智能产业链的价值再分配。以下仅陈述各环节代表公司所扮演的角色及其受益逻辑,绝非投资建议。
8.1 整机与模型垂直整合商
- 特斯拉 (Tesla):基于自有的人形机器人 Optimus 平台和自动驾驶 FSD 积累的视觉神经网络、仿真及数据引擎,建设自有训练集群,构建从数据采集到模型部署的完全闭环。若成功,可能复刻其电动汽车的垂直整合优势。
- 谷歌 DeepMind / Google Robotics:握有 RT‑2、PaLI‑X、Open X-Embodiment 等核心技术,可借自家 TPU 算力与生态输出模型能力,但硬件端依赖合作(如 Apptronik),商业路径选择趋于开放平台。
- Figure AI:与 OpenAI 深度绑定,利用 GPT‑4o 等 VLM 提供高层推理,自研灵巧手与底层控制器,已获得 2024 年 6.75 亿美元融资(公开报道),估值 26 亿美元,目标是快速落地仓储与制造业。
- 1X Technologies:主打轻量级人形 NEO,采用自研扩散策略,强调安全与协作,2024 年获 OpenAI 等追加投资(金额未完整披露)。
8.2 算力与数据基础设施商
- 英伟达 (NVIDIA):提供从仿真(Isaac Sim、Isaac Lab)到训练芯片(H100/B200)再到边缘推理(Jetson Thor,专为机器人设计,2025 年上市)的全栈基础,有望成为“具身智能的卖水人”。
- 高通、地平线、瑞芯微:受益于机器人对低功耗边缘 AI 芯片需求的指数增长,但各家机器人业务份额目前较小。
8.3 开源模型与初创生态
- Physical Intelligence (π):由 UC Berkeley 等明星团队创办,推出 π0 通用机器人基础模型,2024 年完成 4 亿美元融资(公开报道),以“通用大脑”定位跨硬件赋能。开源策略与商业双轨并行。
- 国内初创(宇树、智元、加速进化、傅利叶、星动纪元等):多家人形本体公司自研基础操作模型,数据多来自自有遥操作平台。由于软件层多数未开源,尚难评估外部模型开发商的进入壁垒。
8.4 潜在受益零部件与工具链
力矩传感器、六维力传感器、高精度编码器、末端微型夹爪、面向机器人的数据标注与遥操作设备商,将在数据采集和模型部署扩张中受益,但透明报价和出货量数据公开有限。
9 市场规模
机器人基础模型的独立市场规模当前几乎为零,因为它尚未形成可独立计价的标准化软件产品或按 API 调用的收入流。其价值主要通过加速机器人整机销售或降低部署成本间接体现。但多家第三方研究机构已尝试对“具身智能软件与基础模型”做出远期估算,以下数字全部注明来源与口径,且均属预测而非实际收入。
- 高盛 (Goldman Sachs) 在 2024 年 2 月发布的报告《人形机器人:从实验室到工厂》(口径为全球人形机器人系统市场规模,包含软硬件)中估计,在乐观情景下,2035 年全球人形机器人市场规模可达 380 亿美元,基础模型及相关软件可能占整体的 20% ~ 30%,即 76~114 亿美元。但该报告同时强调,要达到乐观情形,需克服成本、可靠性及法规等多重障碍。
- MarketsandMarkets 2024 年关于具身 AI 的预测(口径涵盖机器人中间件、AI 平台与认知服务)称,2024 年全球规模约 58 亿美元,预计到 2029 年将达到 265 亿美元,复合年增长率 ~35.4%。需要注意的是,该口径较机器人基础模型宽泛得多,包含传统机器视觉、SLAM 等成熟模块,基础模型仅占其中一小部分。
- 特斯拉管理层在 2024 年股东大会上的非正式远景表述为“Optimus 业务长期可能带来数万亿美元收入”,此为管理层目标,不作为市场共识。
- 中国市场:据中商产业研究院等机构 2024 年报告,中国具身智能(含零部件、本体与软件)2023 年市场规模约 120 亿元人民币,预计 2028 年将超千亿元。其中基础模型作为软件层,受制于整机出货量,规模尚小。
结合当前人形机器人出货量(2024 年全球约 1000 台,工业和物流操作臂数万台部署),基础模型的实际商业价值体现在授权或订阅费用上尚不显著。只有当单个操作机器人年出货量跨过万台门槛,且模型带来的部署成本节省被集成商量化验证后,独立软件市场才可能成型。
10 玩家对比
(注:以下信息综合自 2023 ~ 2025 年公开论文、官方发布与媒体报道,部分未公开数据以“公开资料未见”标注。)
| 玩家 | 模型/方案 | 骨干架构 | 参数量(估计) | 训练数据规模 | 软硬件耦合 | 开源/闭源 | 商业化阶段 | 核心优势与局限 |
|---|---|---|---|---|---|---|---|---|
| 谷歌 DeepMind | RT‑1, RT‑2, RT‑X | Path 自回归+扩散探索 | 数百 M ~ 55B(PaLI‑X 骨干) | 13 万条真实示教 + 大量仿真(来源:论文) | 依赖合作硬件(Apptronik) | 部分权重开源(RT‑1‑X) | 实验室→早期合作 | VLM 泛化强,学术积累深;闭环商业与硬件节奏慢 |
| OpenAI+Figure | Figure 02 模型栈 | 未公开(可能 VLM 规划+扩散控制) | 未公开 | 未公开(自有遥操作数据+仿真) | 与 Figure 硬件强绑定 | 闭源 | 工业测试订单(2024) | 高层推理与多模态对话能力强;动作底层细节未独立验证 |
| 特斯拉 | Optimus 基础模型 | 基于占用网络的端到端策略(公众信息有限) | 未公开 | 基于工厂实操数据和仿真(未公布规模) | 完全自研本体+芯片+超算 | 闭源 | 内部试验(电池分拣) | 数据飞轮闭环,制造与成本控制能力突出;对外技术透明度低 |
| Physical Intelligence | π0 | 流匹配 Transformer + DiT | 未公开(预印本未披露总规模) | 多种机器人平台混合数据(未公开小时数) | 跨硬件通用 | 开源模型权重(2024) | 早期验证(叠衣、收桌) | 跨具身泛化理念先进,核心团队顶尖;可靠性在高精度工业场景待验证 |
| 伯克利 Octo 团队 | Octo | 扩散 Transformer | ~850 M(来源:论文) | Open X-Embodiment 子集(约 80 万轨迹) | 机器人无关 | 完全开源 | 科研及社区微调 | 开源生态加速创新,数据需求和调参难度低于闭源方案;工业级精度待打磨 |
| 宇树科技 | 自研人形操作模型 | 未公开 | 未公开 | 自建遥操作采集(数量未公开) | 捆绑宇树 G1/H1 硬件 | 闭源 | 展示与研究级 | 本体成本低,快速迭代;基础模型透明度和第三方测评缺乏 |
| 智元机器人 | 远征 A1 操作模型 | 未公开 | 未公开 | 未公开 | 与自有本体配合 | 闭源 | 小批量交付与试点 | 国内融资较大;公开技术指标缺失 |
格局判断:目前尚无单一模型在精度、泛化性、延迟、安全性等关键维度上同时满足工业出货要求,竞争仍处于技术验证与数据积累期。开源路线(Octo、π0)有可能拉低整个行业的技术门槛,但也使闭源玩家更依赖于专有的高质量操作数据和硬件耦合来维持护城河。
11 风险
技术风险
- 泛化瓶颈:模型在完全未见的结构化环境(如新货架、新物件)下的成功率可能断崖式下跌,勉强 60 %~ 80% 的成功率远未达到工厂不停机运行的可靠性要求(≥ 99.9%)。
- 长序列任务崩溃概率:每一步的微小错误会累积,导致多步任务成功率呈指数衰减,目前尚无法证明基础模型能在无人工辅助下稳定完成 >20 步的真实操作。
- 实时性‑精度‑安全三角:追求高精度连续运行必然增加推理延迟,而实时碰撞规避和安全约束尚未有机内嵌进扩散生成过程。任何一次安全事故都可能引发监管干预并重创行业声誉。
市场与商业风险
- 硬件成本高企,量滞后割喉:人形机器人单台成本仍在数十万到百万美元级(信源:行业访谈),短期出货量难以支撑独立模型商业的规模效应。场景碎片化意味着每一个新领域的垂直适配仍需不可忽视的工程投入,可能打破“一次训练,遍地部署”的预期。
- 定价模式不清晰:模型价值难以从整体解决方案中剥离计价,开源模型的免费供给进一步压制独立模型公司的议价能力。
数据与合规风险
- 隐私:在家庭、医院等场景中,视觉与语音数据可能触犯 GDPR、国内个人信息保护法等,限制数据获取和跨境传输。
- 遥操作数据成本居高不下:高质量高频率的全身遥操作需要大量熟练操作员,若无自动化数据产线,数据成本可能长期高于传统编程调试成本,削弱基础模型的经济理由。
竞争与人才风险 头部科技公司通过高薪和算力优势吸引有限的世界级具身智能研究者,初创和学术机构人才流失可能放缓整个开源生态的进步。同时,地缘政治导致的 GPU 出口管制可能对中国本土模型训练形成硬件瓶颈(2024 年部分高端 GPU 禁售已对国内算力租用成本产生明显影响)。
12 误读纠偏
误读 1:“机器人基础模型就是给机器人接一个大语言模型” 大语言模型仅提供高层语义理解与任务分解,机器人基础模型的核心在于直接输出物理动作——末端 6 自由度位姿、关节力矩或目标值。这些动作来自专门的动作解码器(扩散或离散化预测),和大语言模型的文本生成有本质不同。简单调用 LLM API 无法完成精密抓取与力控。
误读 2:“有了基础模型就不再需要工程师” 基础模型显著降低场景切换时的重新编程量,但落地仍需大量系统工程:安全边界限定、失效回退规则、技能编排、传感器冗余校验、电气与机械集成等。现场部署时往往还需收集特定场景的微调数据,并设计人机协作交互流程,远非开箱即用。
误读 3:“基础模型能让机器人立刻像人一样灵活” 当前最好的基础模型在桌面操作等受限场景下表现良好,但面对复杂灵巧操作(如系鞋带、插入柔性排线)、双脚移动与上肢操作的动态耦合,失败率仍极高。受限于灵巧手硬件密度和力觉反馈技术,达到人手级别的普适灵巧度仍需数年甚至十数年。
误读 4:“开源模型会立即让所有机器人公司同质化” 开源模型确实降低了入门门槛,但高质量、针对特定硬件的微调数据、控制律整定、安全验证和系统集成仍是差异化关键。就像手机安卓生态一样,开源系统上的终端产品和体验仍然天差地别。
误读 5:“数据越多,模型就越聪明,这是纯粹的大模型故事” 机器人数据不同于互联网文本,生成高质量操作标签成本极高,且数据质量比数据量更重要。少量高质量、多样化的示教数据往往比数以万计的劣质自动化采集数据更能提升泛化性。数据飞轮要想转起来,需要部署机器人在真实场景中持续产生自主改进循环,这在当前故障率下仍有难度。
13 最新事件
以下选取 2024 年至 2025 年初,对机器人基础模型赛道产生重大影响的公开事件,按时间倒序列举。
- 2025 年 1 月,英伟达推出 Cosmos 世界模型平台:CES 2025 上,英伟达发布 Cos