通用机器人
3 秒看懂
通用机器人(General-Purpose Robot)是一类具备多任务执行能力、可跨场景自主适应的具身智能体。其核心目标不是完成单一预设工序,而是通过“通用大脑+标准化本体”实现一机多能、任务可切换、新技能可学习。
区别于传统工业机器人的固定编程模式,通用机器人的本质是软硬件解耦、能力可泛化:硬件本体提供通用的运动与操作平台,软件定义机器人的技能边界。用户通过自然语言下达指令,机器人依赖多模态基础模型理解意图、分解任务并生成连续动作,无需人工示教或逐行编程。
当前产业处于功能验证与小批量试产的早期阶段。人形机器人是当前最受关注的形态路线,但通用性并不等同于人形——具备多模态感知、灵巧操作和自主移动能力的轮式双臂平台,同样是通用机器人的重要技术路径。
核心驱动力来自三股力量:基础模型(视觉-语言-动作大模型)赋予机器人语义理解与泛化能力;模仿学习与强化学习让机器人通过人类演示和试错掌握精细操作;高性能驱动与传感硬件成本下探使本体从实验室原型走向可量产的成本区间。
3 分钟产业解释
产业定位:从“第三只手”到“第三个人”
传统工业机器人是工厂的“第三只手”,每台专精一道工序——焊接、喷涂、码垛,换一个任务就意味着重新编程甚至更换末端工具。通用机器人要成为“第三个人”:能听懂自然语言指令、能看懂未结构化环境、能学会操作陌生物体、能在不同场景间迁移技能。
技术架构:三层递进
技术实现上,通用机器人不再依赖精确坐标编程,而是通过具身基础模型将感知直接映射为运动控制。主流架构分为三层:
- 云端大模型层:负责任务理解与规划。收到“把桌上的苹果放进蓝色托盘”后,大模型将指令分解为导航至餐桌、识别苹果、抓取苹果、识别蓝色托盘、放置等子任务序列。
- 边缘多模态模型层:处理实时环境感知——3D目标检测、6-DoF位姿估计、自由空间分割,为运动控制提供语义化目标坐标。
- 本体控制层:完成亚毫米级关节执行,通常运行在MCU/实时SoC上,以1-10kHz频率闭环控制力矩和位置。
商业进展与时间线
商业层面,特斯拉(Optimus)、Figure AI、1X Technologies是国际领跑者;中国阵营包括宇树科技、傅利叶智能、智元机器人、星动纪元等,普遍处于小批量试产与工厂/仓储场景验证阶段。
产业共识的时间线判断(据高盛2024年2月报告[1]及摩根士丹利2024年6月报告[2]):
- 2025-2027年:功能收敛与供应链打磨期,出货量以千至万台计,主要落地汽车总装、物流分拣等半结构化场景。
- 2028-2030年:硬件BOM下降至$2-3万美元区间,进入商业零售、轻工业辅助等场景。
- 2030年后:若数据飞轮和可靠性问题得到解决,有望渗透家庭服务等高复杂度场景。
技术原理
感知-规划-控制栈(经典分层架构)
经典机器人学采用模块化分层架构,每层职责分明:
┌──────────────────────────────────────┐
│ 云端大模型(任务规划层) │
│ 输入:“把桌上苹果放进蓝色托盘” │
│ 输出:任务树(导航→识别→抓取→放置) │
└──────────────┬───────────────────────┘
│ 子任务序列(非实时)
┌──────────────▼───────────────────────┐
│ 边缘多模态模型(语义感知层) │
│ 3D目标检测·位姿估计·场景分割 │
│ 输出:苹果坐标(x,y,z)、托盘位置 │
└──────────────┬───────────────────────┘
│ 目标位姿+力控模式指令
┌──────────────▼───────────────────────┐
│ 运动控制策略(实时执行层,MCU/SoC) │
│ 全身运动规划·阻抗/导纳控制·触觉伺服 │
│ 输出:关节力矩/位置指令 │
└──────────────┬───────────────────────┘
│ 力矩/位置指令 1-10kHz
┌─────▼─────┐
│ 关节执行器 │ 电机+FOC+力矩传感器闭环
└───────────┘
此架构的优点是可解释、可嵌入安全约束,缺点是模块间存在信息瓶颈,高层语义到低层控制的映射高度依赖人工设计的中间表示(如物体位姿、抓取点)。
端到端模仿学习(现代数据驱动架构)
近年来兴起的端到端学习范式试图打破模块隔离,直接从感知数据生成动作序列。代表性算法包括:
- Action Chunking Transformer(ACT)[3]:将图像序列编码后,用Transformer自回归地生成未来N个时间步的关节目标位置,形成“动作块”,减少累积误差。
- Diffusion Policy[4]:将动作生成建模为扩散过程,从噪声逐步去噪为精确动作轨迹,在精细操作任务(挂衣架、拉链、插插头)中展现超越传统方法的稳定性和多模态表达能力。
训练数据来自遥操作演示:操作员通过主手/外骨骼操控机器人完成指定任务,系统同步采集{多视角RGB图像, 关节位置/力矩, 末端力数据}作为训练样本。推理时,仅凭视觉输入生成连续动作流。
端到端方法的核心优势是不需要显式3D几何建模、无需物体CAD模型,能处理柔体、透明物体等高难度操作对象。核心短板是泛化高度依赖训练数据的多样性和规模,且输出为“黑箱”动作序列,难以嵌入硬性安全约束。
混合架构(当前落地主流)
产业界现阶段普遍采用混合路线:
- 上层任务规划:调用云端多模态大模型(GPT-4o、Gemini等)做语义理解和任务分解。
- 中层操作策略:用端到端模仿学习处理高维灵巧操作(如五指抓取、工具使用),因为传统运动学在这类任务中建模困难。
- 底层全身控制:用模型预测控制或全身控制保证平衡、避障、接触安全,将上层策略输出约束在物理可行域内。
推理时延要求
各层级对实时性的要求有数量级差异(据公开技术文档[5]及行业实践中披露的典型数值):
- 云端大模型任务规划:>500ms,可接受异步。
- 边缘感知模型推理:30-100ms(视觉帧率同步)。
- 底层运动控制回路:<10ms,典型1-5ms,以保证动态稳定和接触安全。
关键参数
人形机器人典型规格(2024-2025年已公开产品)
以下参数基于公开产品手册及技术演示中披露的数据,涵盖特斯拉Optimus Gen2、宇树H1/G1、Figure 02、1X NEO等代表性平台。由于多数产品处于原型/小批量阶段,数据仍在持续迭代,标注为“厂商标称典型值”:
| 参数项 | 典型范围 | 备注 |
|---|---|---|
| 身高/自重 | 160-180cm / 50-80kg | 人形仿生设计;1X NEO为170cm/75kg,宇树H1约180cm/47kg |
| 全身自由度 | 40-60个 | 含双灵巧手;单手3-6个主动自由度不等 |
| 移动速度 | 1.2-3.3 m/s | 宇树H1标称可达3.3m/s(奔跑),常规步行约1.2m/s |
| 单次续航 | 1-2.5小时(厂商标称) | 电池容量约1-2.5kWh,实际续航高度依赖负载和动作强度 |
| 单臂负载 | 3-20kg | 双臂协同可举更重物体;Optimus Gen2标称单臂约20磅(约9kg) |
| 末端重复定位精度 | ±0.1-0.5mm(估算) | 工业机械臂可达±0.02mm;通用机器人因柔性关节和轻量化设计牺牲了精度换取安全性和自由度 |
| 本体感知采样率 | 关节力矩/位置 1-10kHz,视觉 30-90Hz,触觉 100-1000Hz | 典型工业配置;触觉传感器采样率因方案而异(阵列式MEMS vs 逐点式) |
硬件BOM成本演进
BOM(物料清单,Bill of Materials)成本是决定通用机器人能否打开市场的最核心变量。
- 2024年原型阶段:单台人形机器人BOM约$80,000-150,000(据产业链调研[2],不同构型和供应商差异大)。主要成本项依次为:关节执行器(电机+减速器+编码器+驱动板)、力/触觉传感器、计算平台(Jetson Orin/Thor级模组)、电池系统、精密结构件。
- 2025年行业目标:通过设计简化和国产替代,将BOM降至$30,000-50,000。
- 量产目标(2028-2030年):特斯拉、Figure AI等均提出远期BOM <$20,000的目标,前提是年产超10万台,核心零部件(行星滚柱丝杠、六维力传感器)成本较2024年下降超过50%。
训练数据量级
“数据饥饿”是当前通用机器人能力提升的最大瓶颈。一个在特定环境(如某款冰箱前)完成泛化物体抓取和放置任务的端到端策略,大约需要以下数据投入:
- 单任务、单场景达到80%+成功率:约100-500小时遥操作数据(如Stanford ALOHA论文所展示规模[6])。
- 跨场景、跨物体达到稳健泛化:需数千至万小时数据,且要求物体材质、几何、光照有足够覆盖。
- 视觉-语言-动作(VLA)基础模型预训练:Google的RT-2和OpenVLA项目所用轨迹数据量级已经达到百万至千万级片段(Open X-Embodiment数据集当前公开约160万条轨迹[7]),但这离覆盖人类日常操作所需的多样性仍有数量级差距。
技术路线
三种主流通用机器人技术范式
| 维度 | 端到端学习 (Figure AI, 1X, Physical Intelligence) | 分层模型+传统控制 (多数工业派公司) | 仿真训练+Sim2Real迁移 |
|---|---|---|---|
| 数据需求 | 海量真实人类演示数据,依赖遥操作工厂 | 中等规模真实数据+结构化场景知识 | 大规模仿真数据(成本低,可达亿级步数),少量真实精调 |
| 感知-动作映射 | 单一神经网络(像素/点云→关节力矩) | 感知→规划→控制模块化,各层可独立优化 | 仿真环境RL训练策略→域随机化迁移至实物 |
| 泛化能力 | 理论潜力最高,可处理非典型物体和复杂几何 | 泛化受限于感知模块精度和规划算法假设 | 泛化受限于仿真-现实差距(触觉、摩擦力、光照) |
| 安全性保障 | 黑箱系统,难以给出硬性安全边界证明 | 可在规划和控制层嵌入约束,验证相对充分 | 需额外实物安全层,仿真中无法完全模拟接触异常 |
| 代表方案 | Figure 02 + OpenAI VLM;1X NEO + 世界模型;Physical Intelligence的π0通用策略 | Tesla Optimus(部分视觉复用FSD,控制层自研);传统机器人厂商转型产品 | 宇树H1/G1运动策略(Isaac Gym强化学习);ETH Zurich等学术方案 |
| 2025年成熟度判断 | 实验室操作成功率可达85-95%(抓取类任务);真实工厂非结构化操作<70% | 半结构化场景(如固定工位上下料)基本可用;依赖环境改造 | 运动控制(行走、奔跑)Sim2Real已成熟;灵巧操作仍有差距 |
路线判断
2025年行业的主流选择并非单纯的“端到端”与“分层”之争,而是在不同子系统采用不同范式:
- 运动控制(足式平衡+全身协调):基于强化学习在仿真中训练的策略,通过域随机化迁移至实物,已成为普遍做法。宇树H1的人形行走能力主要依赖这一路线,其运动流畅性已接近真人。
- 导航与粗粒度物体搬运:传统SLAM+路径规划+视觉伺服仍为主力,可靠性和可预测性满足工厂要求。
- 灵巧操作(手指级精细动作):端到端模仿学习是目前唯一在复杂操作任务(系鞋带、叠衣物、插插头)中展现可行性的路线,传统抓取规划在此类任务中长期停滞。
这意味着**“仿真预训练泛性运动能力 + 遥操作数据驱动操作技能”的混合路线**,在可预见的未来最具工程可行性。
上游
核心零部件供应链全景
通用机器人的上游可拆分为执行、感知、计算、能源四大板块。2024-2025年的供应链特征是:部分核心零部件高度依赖海外供应商,国产替代正在加速但技术差距仍存。
执行器——关节的动力来源
- 无框力矩电机:瑞士Maxon、德国Faulhaber长期主导高端市场,其转矩密度和可靠性被广泛验证。中国供应商鸣志电器、鼎智科技(江苏雷利子公司)已推出对标产品,转矩密度差距缩小至10-20%,但在数千小时连续运行寿命验证数据上仍需积累。
- 空心杯电机:用于灵巧手微型关节驱动。Maxon和Faulhaber仍为第一梯队;中国兆威机电、深圳拓邦等积极布局,2024年部分厂商进入送样阶段,客户认证周期约6-12个月。
- 减速器:人形机器人主要采用谐波减速器(关节处,结构紧凑)和精密行星减速器(部分负载更大的关节),RV减速器因体积和重量较大,在移动人形机器人中应用少于工业机械臂。谐波减速器领域,日本哈默纳科在精度保持性上领先,中国绿的谐波、来福谐波已经实现大规模国产替代,市占率快速提升;行星减速器领域竞争充分,国产份额较高。
- 行星滚柱丝杠:用于将旋转运动转换为直线运动,是直线关节(如Optimus膝关节)的关键零件。技术壁垒极高,瑞士Rollvis、瑞典SKF/Ewellix长期垄断。中国恒工精密、秦川机床、双环传动等已启动研发和送样,但截至2025年Q1尚未有被主流人形机器人厂商大规模采用的消息(公开资料未见批量供货公告)。此为产业链当前最受资本市场关注的弹性环节,因为一旦突破,单台机器人可能用10-20根。
传感——赋予机器人触觉与力觉
- 六维力/力矩传感器:安装于手腕、脚踝,用于感知接触力和力矩实现柔顺控制和触觉反馈。美国ATI Industrial Automation为高端标杆;中国宇立仪器(SRI)、坤维科技、海伯森等已在谐波减速器厂商和机器人本体厂中送样并获得部分批量订单。2024年中国六维力传感器市场国产份额已达50%以上(据高工机器人2024年度报告),但高端医疗和航空航天级仍有差距。
- 触觉传感器(电子皮肤):方案未收敛,MEMS压阻式、电容式、光学式各有拥趸。美国Gelsight、日本XELA等有成熟产品;中国帕西尼感知科技(深圳)、他山科技(北京)等创新企业走在前列。目前电子皮肤的成本、耐久性和信号一致性仍未达到量产要求,属于早期布局象限。
- IMU(惯导单元):用于姿态估计与平衡控制。博世、TDK/InvenSense主导,国产深迪半导体等可替代,技术门槛相对较低。
计算与通信
- 边缘AI SoC:NVIDIA Jetson Orin/Thor系列为当前主流选择(Thor算力可达2000TOPS,面向2025-2026年量产车型和机器人);高通Robotics RB5/RB6平台亦在争夺设计份额;中国地平线征程系列正在向机器人领域拓展,征程6已官宣机器人应用规划。计算平台的算力、功耗和实时性三者平衡是核心考量。
- MCU与实时控制:STMicroelectronics(STM32系列)、Texas Instruments(C2000系列)的实时MCU在关节控制器中仍占据绝对主导,NXP、英飞凌亦参与竞争。国产MCU(兆易创新GD32等)在部分非安全关键关节中开始小批量测试。
- 通信总线:CAN/CAN FD和EtherCAT为两大主流。EtherCAT在实时性要求高的全身控制中优势明显,倍福(Beckhoff)主导协议生态;CAN在单关节组网中成本更低。
能源
高能量密度锂电池(典型为21700或4680圆柱电芯阵列)是当前主流。电池Pack设计需兼顾容量、重量、散热和安全。部分公司探索换电方案以延长在线时长,但未见行业统一标准。固态电池若在2027-2028年进入商业化,有望显著改善续航痛点,但此为前瞻性判断,具体时间表存在不确定性。
下游
短期落地场景(2025-2028):结构化与半结构化
1. 汽车与新能源制造 整车总装线是公认的“第一战场”。相比焊接、喷涂等已被专用设备高度覆盖的环节,总装线上仍然存在大量依赖人工的柔性操作:线束插接、密封条安装、内饰件装配、螺栓拧紧与对齐。这些任务需要灵巧操作和一定的力控感知,但又不像家电维修那样高度非标,环境相对可控。特斯拉Optimus率先进入自身工厂验证即基于这一逻辑。宝马与Figure AI的合作、奔驰与Apptronik的试点也围绕总装线展开。
2. 物流仓储 分拣、拆垛、卸货是当前自动化渗透率尚低的环节。传统自动化分拣依赖固定形状和尺寸规则,面对混杂SKU、软包装、不规则物体时效率急剧下降。通用机器人“看什么就能抓什么”的能力在此场景有直接变现路径。Amazon(Digit/Sparrow)、GXO Logistics(与Apptronik、Agility合作)已开始小规模试点。中国顺丰、京东物流亦在关注该领域。
3. 数据中心与基础设施运维 服务器巡检、硬盘更换、线缆插拔——这些任务在数据中心内是标准化且重复性高的操作,且对灰尘、震动敏感度低,适合机器人替代。1X Technologies的NEO即定位数据中心运维为早期商业化场景之一。公开资料显示,部分头部云服务商已启动相关概念验证项目。
中长期场景(2028+):服务与家庭
商品零售、酒店递送、医院陪护等服务业场景对机器人的社交交互、安全避障、长续航有更高要求,目前渗透接近零。家庭场景则被普遍视为“终极市场”,但当前面临可靠性、成本、安全和用户信任的多重屏障。摩根士丹利2024年6月报告[2]估计,家庭服务机器人大规模采用(超百万台年出货)可能要到2035年之后。
需求驱动力
下游需求的根本动力并非“劳动力总量短缺”,而是制造业和物流业中重复性、体力要求高、劳动体验差的岗位招工日益困难。日本、韩国、德国已进入深度老龄化,中国制造业工人平均年龄超过41岁(据第七次人口普查数据),年轻一代不愿从事单调体力劳动的趋势不可逆转。通用机器人本质上是对“枯燥体力劳动”的替代方案,不是“取代人”,而是填补人已不愿做的岗位缺口。
受益公司
按产业链层次及2025年公开进展梳理
注:以下公司为行业公开信息的客观呈现,不构成任何形式的投资建议或推荐。公司提及只反映其业务与通用机器人产业链的相关性,不代表未来业绩或股价预测。
零部件层(“卖铲子”)
- 绿的谐波(688017.SH):谐波减速器国内龙头,2024年谐波减速器出货量超20万台(据公司2024年业绩快报),人形机器人专用型号已送样多家头部客户。2025年扩产项目持续推进,规划年产能提升至60万台。
- 鸣志电器(603728.SH):无框力矩电机和空心杯电机均进入人形机器人供应链验证阶段,已获得部分客户小批量订单(据公司2024年半年报及券商调研纪要)。
- 恒工精密(301261.SZ):精密行星滚柱丝杠是其在通用机器人领域被市场关注的核心产品,截至2025年Q1处于研发和客户送样阶段,尚未披露批量供货。公开资料未见明确量产时间表。
- 双环传动(002472.SZ):精密齿轮和RV减速器制造商,同时布局行星滚柱丝杠,2024年已公告与多个机器人厂商的技术合作框架。
- 柯力传感(603662.SH):六维力传感器已推出面向协作机器人的产品,人形机器人用型号在开发中。2024年年报披露力传感器业务营收约2.3亿元人民币。
- NVIDIA(NVDA.US):Jetson和Thor计算平台作为通用机器人的核心“大脑”硬件,几乎出现在每一款主流人形机器人公告中。2025年CES上宣布推出Project GR00T人形机器人基础模型和对应的Jetson Thor计算平台。
本体集成与操作系统层
- 特斯拉(TSLA.US):Optimus项目2022年AI Day首次展示粗糙原型,2023年底Gen2在灵巧手、行走能力和自重控制上进步显著。2024年Q2业绩电话会中,马斯克重申千台量产于2025年内的目标(内部工厂使用),远期成本目标$20,000/台。市场高度关注Optimus的实际交付节奏和成本控制进展。
- Figure AI(未上市):2023年以来累计融资超$7.5亿,OpenAI、Microsoft、NVIDIA、Jeff Bezos等参投,估值$26亿(据PitchBook数据)。2024年Figure 02与宝马的工厂试点受到行业广泛关注。Figure专注于端到端学习架构,OpenAI提供的视觉语言模型是其核心差异化。
- 1X Technologies(未上市):挪威公司,2024年获EQT Ventures等领投的$1亿B轮融资(据Crunchbase)。主打产品NEO为轮式人形机器人,强调柔和接触、居家安全,采用无齿轮直接驱动方案和自研世界模型。与OpenAI亦有关联(后者为早期投资方之一)。
- Apptronik(未上市):美国奥斯汀公司,Apollo机器人已与奔驰、GXO Logistics达成试点协议。创始团队来自UT Austin人本机器人实验室,技术路线偏务实,关注工业物流场景。
- Agility Robotics(未上市):Digit机器人是专门为物流场景设计的双腿机器人(非严格人形,无灵巧手),已与Amazon合作试点。2023年开设美国首个人形机器人工厂(RoboFab),年产能目标上首位。
中国本体公司(含未上市独角兽)
- 宇树科技:从四足机器人(Go2/B2)成功切入人形,H1和G1两款产品以运动性能和性价比引起关注。H1的奔跑能力和动态平衡在中国人形产品中处于第一梯队。2024年B轮融资数亿人民币(据36氪等媒体公开报道)。宇树强调“性价比先”路线,G1售价申报低至$16,000。
- 傅利叶智能:从康复外骨骼机器人转型通用人形,GR系列先期瞄准康复辅助和工业轻量化操作场景。公司有多年力控和运动控制经验积累,是中国康复机器人领域头部企业。2024年完成D轮融资(据企查查/公司官网)。
- 智元机器人:稚晖君(彭志辉)创立,产品从灵巧手到双足本体覆盖完整,强调“本体+大脑”全套自研。已发布远征A1人形机器人。2024年完成A++轮融资,累计融资额超10亿人民币(据公开媒体报道)。
市场规模
行业口径与预测分歧
免责声明:以下所有市场规模预测数据来自投资银行和行业研究机构公开发布的远期估计,存在高度不确定性,实际市场规模可能与此处引用的预测有实质性差异。本段仅供读者了解行业认知现状,绝非确定性判断。
通用机器人市场规模的定义尚未行业统一,部分报告以“人形机器人出货量×均价”测算,部分以“软件+硬件+服务”整体TAM(总可及市场,Total Addressable Market)测算。口径差异导致各机构预测值之间不可直接比较。
- 高盛(2024年2月报告[1]):预计全球人形机器人市场规模在2030年达$60亿,2035年进一步扩张至$240亿;出货量从2025年的数千台增长至2035年的超100万台。高盛强调这项预测高度依赖”BOM成本降至$20,000以下”和”可靠性达到工业部署标准”两个前提条件。
- 摩根士丹利(2024年6月报告[2]):对中国市场2030年人形机器人市场规模给出约$30-50亿的预测,2035年有望扩张至$150亿以上。报告指出,中国市场可能的加速器是政策支持(工信部、科技部相关政策已在制定中)以及制造业劳动力成本持续上升。
- MarketsandMarkets(第三方市场研究,2024):全球通用人形机器人市场2030年约$30亿,CAGR超过50%。该机构口径相对保守。
- 公开资料未见:IDC、Gartner等主流科技产业分析机构截至2025年Q1尚未发布独立的通用机器人市场预测报告,仅将其作为“智能自动化”大市场的一部分进行定性讨论。
市场规模驱动力与制约
驱动因素:全球制造业岗位空缺率上升(据美国劳工统计局数据,2024年美国制造业仍有超过60万个空缺岗位);人口老龄化加深(日本65岁以上人口占比超29%);人形机器人政策支持升温(中国工信部2023年发布《人形机器人创新发展指导意见》)。
制约因素:当前BOM成本仍高于替代人力成本的回收周期(按$15万/BOM和三年回收期计算,时薪需超过$25才有经济性);可靠性(MTBF)离工业可接受标准差距巨大;通用操作成功率在真实环境下仍偏低;社会伦理和法规监管框架尚未建立。
玩家对比
2025年Q1主要人形机器人玩家核心指标对比
下表综合企业公开披露、第三方产品评估及行业报告信息,力求客观呈现各家相对位置。标注“公开资料未见”之处为截至2025年初未找到经核实的具体数据。
| 维度 | Tesla Optimus | Figure AI | 1X NEO | 宇树 H1/G1 | 智元 远征A1 | Agility Digit |
|---|---|---|---|---|---|---|
| 形态 | 全人形(双足+双手) | 全人形 | 轮式+双臂 | 全人形 | 全人形 | 双腿(鸵鸟腿)+无灵巧手 |
| 自由度(全身) | 公开资料未见详细披露,推测40+ | 公开资料未见 | 公开资料未见 | H1约27(不含手) | 49(含灵巧手) | 约20(无灵巧手) |
| 单臂负载 | Gen2标称约9kg | 约10-15kg(公司演示) | 公开资料未见 | G1约3kg | 约5kg(A1标称) | 约16kg |
| 行走速度 | 约1.2m/s(公开演示估算) | 公开资料未见 | 轮式不适用(室内约1.5m/s移动) | H1最高3.3m/s奔跑 | 约1.5m/s | 约1.5m/s |
| 灵巧手 | Gen2有11个自由度,触觉传感器覆盖 | 有灵巧手配置 | 五指灵巧手 | G1可选配灵巧手 | 自研灵巧手 | 无灵巧手(夹爪式) |
| AI架构 | 复用FSD视觉骨干,其余自研,计划自研VLA | OpenAI VLM+自研端到端策略 | 自研世界模型+端到端 | 公开资料未见详细AI方案 | 自研具身基础模型 | 模块化感知+规划 |
| 主要目标场景 | 汽车总装,远期家居 | 汽车/物流制造 | 数据中心运维/家庭 | 科研/轻工业辅助 | 工业辅助 | 物流搬运 |
| 进度(2025Q1) | 内部工厂验证,千台量产起步 | 宝马试点,未披露出货量 | 数据运维试点 | 已对外出货(数量未披露) | 小批量交付 | Amazon仓库试点 |
| 标称售价 | 非卖品(内部使用),远期目标<$20K | 未定价 | 未定价 | G1约$16K起 | 未公开 | 未公开 |
对比要点解读
- 形态差异反映场景定位不同:1X选择轮式(放弃双足行走),因为其目标场景(数据中心、家庭)地面平坦,轮式移动效率远高于双足;Agility Digit放弃灵巧手而用简单夹爪,因为物流搬运任务不需要精细手指操作。这验证了一个核心判断——通用性不等于人性,形态应该服务于场景而非为了仿生而仿生。
- AI架构透明度差异巨大:特斯拉和Figure在AI路线上披露较多,而中国厂商在技术大会上更多强调硬件运动和结构创新,AI算法方案公开细节有限。
- “先出货”不等于“先有收入”:宇树以科研市场为切入点向高校/实验室出货H1/G1,这一策略可以快速获得使用反馈和训练数据,但与工业领域的大规模商业部署有本质区别。
- 特斯拉的规模优势假设只在量产后成立:特斯拉的成本优势叙事建立在复用汽车供应链和Gigafactory经验的基础上,但这一优势要到年产万级时才可能显现,在千台级别并无成本优势。
风险
技术风险
-
路线未收敛:端到端学习、分层控制、仿真迁移三条路线仍在竞争,没有哪条已被证明可以同时兼顾泛化性、可靠性、安全性和成本。过早押注单一路线的公司可能面临技术迭代带来的研发沉没成本。
-
数据飞轮能否转起来的验证空窗:通用机器人当前最核心的商业叙事是“数据飞轮”——先部署机器人收集操作数据、再训练更强策略、再部署更多机器人形成正反馈。但截至2025年初,全球没有任何一家公司展示了确实飞起来了的数据飞轮。这一逻辑在自动驾驶行业曾被广泛信奉,但自动驾驶公司至今仍在努力实现真正闭合的飞轮。通用机器人的物理交互数据成本远高于自动驾驶(需要遥操作而非仅驾驶记录),飞轮逻辑的可行性是最大的单项不确定性。
-
安全性证明缺失:以神经网络生成末端连续力控动作的系统,难以用传统软件验证方法证明其在所有可能场景下的安全行为边界。在家用或人机紧耦合场景中,这一问题会显著放大。
量产与供应链风险
-
行星滚柱丝杠等关键零件的产能瓶颈:行星滚柱丝杠目前全球有效产能有限,瑞士Rollvis、瑞典SKF/Ewellix扩产节奏慢,中国企业尚未进入大规模批量供货。一台人形机器人若用10-20根此类丝杠,当年需求达百万根时(如出货5-10万台),供应链瓶颈将显著暴露。
-
BOM成本下降低于预期的风险:若核心传感器和执行器成本下降速度不及预期,整机价格停留在$5万以上区间,则市场规模将远低于当前乐观预测。这依赖于国产替代进展和规模效应释放,两者都有不确定性。
市场与伦理风险
-
技术热潮与实际需求错配:2024-2025年的风险投资热潮可能推高估值和预期,但下游应用场景的验证仍然稀疏。如果2026-2027年工业验证效果低于预期,行业可能经历“幻灭低谷”。
-
监管与公众接受度:劳动力替代可能引发社会抵制和政策干预,家庭场景中的隐私、数据安全、法律责任归属(机器人伤人的责任归属制造商?算法方?操作者?)尚未在任何司法管辖区建立明确定义的法律框架。
误读纠偏
1. “通用机器人就是人形机器人”
这是最普遍的误读。通用性的定义是任务范围的可扩展性和跨场景迁移能力,而形态是实现通用性的手段之一,不是目的。轮式双臂平台(如1X NEO)、移动操作臂(如Boston Dynamics Stretch)、甚至一个可更换末端工具的AMR,都可以在特定场景集合中实现广义的通用性。人形之所以受追捧,逻辑是人类世界设施为人类形态设计,仿人形迁移成本最低。但花大量成本让机器人用双腿在平地行走(而轮子效率高、可靠性高几个数量级),是否真的是最优工程选择,还远远没有被证明。
2. “有了大模型,机器人马上就能做家务了”
这混淆了“语言层面的世界知识”和“物理世界中的操作能力”。大语言模型可以描述如何叠一件衬衫的步骤,但不代表它能控制机械臂的26个关节协同完成这一任务。将语言指令映射为对物理世界的实时力控动作,需要海量的遥操作数据训练,而这一数据在大多数家务任务上几乎为零。目前最前沿的VLA模型在已知家庭环境中抓取常见物体的成功率在85-95%,但“操作不熟悉的衣物”“打开各种结构的柜门”“应对地面上异形的玩具”等任务的成功率仍在实验室级别(<70%甚至更低)。从“能用语言沟通”到“可靠物理执行”之间的鸿沟,是目前行业重大误读所在。
3. “模仿学习就是看视频学会的”
这是一个被部分媒体报道简化后造成的误解。目前模仿学习(Imitation Learning)指的核心手段是遥操作演示:操作员佩戴外骨骼或操纵主手,真实地控制每一个关节完成物理任务。系统采集的数据是{视觉+本体感觉+关节轨迹}的三元组,而非单纯的视频。让机器人仅凭观看人类YouTube视频就学会操作,这在学术上被称为“从人类视频中进行机器人学习”(Learning from Human Videos),目前仍处于非常早期的研究阶段,距离实际应用存在巨大差距——主要瓶颈是缺少与视觉同步的精细关节动作标签和接触力信息。
4. “通用机器人会大量消灭工作”
这一叙事的误导在于把“自动化某些任务”等同于“消灭就业岗位”。历史数据表明,生产力的进步通常消灭了特定岗位但创造了新的工作类别,且当下制造业、物流业、养老护理业面临的尖锐问题是大量岗位招不到人而非“人太多”。把通用机器人定位为劳动力替代工具是对公众焦虑的不必要触发,更准确的定位是缓解劳动力结构失衡、在“人不愿做”的领域提供辅助。
最新事件
2025年Q1(截至2025年2月):
- Figure AI宣布终止与OpenAI的独家合作(2025年2月,据Figure AI官方博客):Figure创始人Brett Adcock宣称内部端到端AI已取得重大突破,将于30天内展示“前所未有”的具身智能水平。这一合作变数引发行业对其自主AI路线的广泛讨论。
- 1X发布Neo Gamma(2025年2月,据1X官方新闻室):新一代轮式操作机器人在世界模型驱动的操作策略上实现了显著进步,公开演示中展示了多种精细家务操作(叠衣服、使用吸尘器等),引发社区对“纯数据驱动”路线的进一步关注。
- 英伟达2025年CES重点展示机器人战略:Project GR00T作为人形机器人基础模型被置于核心位置,Jetson Thor宣布2025年上半年量产。英伟达CEO黄仁勋将“实体AI”(Physical AI)定位为继大语言模型后的下一个AI浪潮。
- 宇树H1春晚登台表演(2025年1月):宇树H1人形机器人在中国春晚节目中完成编队舞蹈表演,成为首个登上春晚舞台的通用人形机器人产品,极大地提升了公众对该品类的认知度。
2024年H2:
- Tesla Optimus Gen2“自主分类”演示(2024年10月,特斯拉We Robot发布会):Optimus在发布活动中进行物品自主分类和简单对话交互,但后续被部分媒体披露现场有远端遥操作辅助,真实的端到端自主完成比例存在争议。这一事件也暴露了通用机器人在“无辅助真自主”水平的公开透明验证上缺乏行业标准。
跟踪指标
对于关注通用机器人产业进展的读者,以下指标比媒体报道和融资新闻更具实质性的信号意义:
| 指标 | 当前基准(2025Q1) | 关键里程碑 | 观测来源 |
|---|---|---|---|
| 基础模型发布节奏 | RT-2、Octo、OpenVLA、π0已公开 | 哪家率先发布真正面向工业可靠性的VLA开源/商用模型 | arXiv、公司技术博客、顶会(CoRL/ICRA/RSS) |
| 行星滚柱丝杠国内量产节点 | 恒工精密等处于送样阶段 | 首份批量供货合同的公告(若客户为Tesla/宇树/智元等头部本体厂,信号更强) | 上市公司公告(年度报告/重大合同公告) |
| 人形机器人实际出货量 | 全行业2024年出货估计1,000台 | 10,000台/年为行业真正起步阈值 | 公司财报、海关出口数据(如果单独列类) |
| BOM成本下降速度 | 原型机$80-150K;宇树G1标价$16K | 可靠工业等级整机<$30K,标志着规模应用拐点临近 | 供应链调研、零部件供应商报价趋势 |
| 遥操作数据工厂规模 | 各家估计在数十至数百台级别 | 单公司运行超1,000台遥操作采集设备,年采集百万小时级数据 | 公司招聘信息(遥操作员岗位数量)、工厂实地报道 |
| 工业验证里程碑 | 汽车总装试点(Tesla/BMW/Mercedes) | 主机厂公开宣布扩大至第3条以上产线、或扩展至第2个厂区 | 汽车OEM数字制造/工业4.0发布会 |
| 安全标准或法规草案出台 | 无专用标准,引用工业机器人ISO 10218 | 首个针对性的人机协作安全规范或产品认证 | 各国标准组织(ISO/ANSI/国标委)公告 |
| 故障间隔时间(MTBF)公开数据 | 实验室数百小时 | 厂商公布可靠第三方测试>5,000小时的数据 | 公司技术大会/学术论文 |
信源
产业与投资报告
[1] 高盛(Goldman Sachs).《The Rise of Humanoid Robots: A Multi-Decade $6 Billion+ Market by 2030?》. 2024年2月.
[2] 摩根士丹利(Morgan Stanley).《Humanoid Robots: The Next Frontier — China’s Role in the Global Race》. 2024年6月.
[3] 高工机器人(GGII).《2024年中国力传感器行业发展蓝皮书》. 2024年.
核心技术论文
[4] Zhao, Tony Z. et al. “ALOHA: A Low-cost Open-source Hardware System for Bimanual Teleoperation.” arXiv preprint, 2023. (提出了ACT算法和ALOHA遥操作框架)
[5] Chi, Cheng et al. “Diffusion Policy: Visuomotor Policy Learning via Action Diffusion.” Proceedings of Robotics: Science and Systems (RSS), 2023.
[6] Brohan, Anthony et al. “RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control.” arXiv preprint, 2023. (Google DeepMind的VLA基础模型里程碑)
[7] Open X-Embodiment Collaboration. “Open X-Embodiment: Robotic Learning Datasets and RT-X Models.” Proceedings of IEEE ICRA, 2024. (学术界最大的机器人操作轨迹开放数据集)
[8] Black, Kevin et al. “π0: A Vision-Language-Action Flow Model for General Robot Control.” Physical Intelligence Technical Report, 2024.
公司官方来源
- Tesla AI Day 202