世界模型
在内部预测当前状态和动作导致的下一状态,用于行动前仿真。
减少真实世界试错成本Embodied AI
具身智能把感知、决策规划和执行控制耦合进机器人本体,让 AI 在物理世界中完成移动、抓取和操作任务。
MDX 将具身智能拆成感知层、决策规划层、执行控制层,并列出上游硬件与下游应用场景。
在内部预测当前状态和动作导致的下一状态,用于行动前仿真。
减少真实世界试错成本在仿真中训练策略,再通过域随机化和自适应迁移至真实硬件。
规模训练和机器人部署用扩散模型或行动分块 Transformer 生成连续动作序列。
灵巧操作和长时序任务| 来源 | 类型 | 截至 |
|---|---|---|
| 具身智能 MDX | mdx | 2026-05-29 |
具身智能 = 会思考的身体。它让 AI 不仅拥有能推理、规划的“大脑”(算法与模型),更赋予其能在物理世界中进行感知与操作的“身体”(机器人、机械臂等物理实体)。其核心是让智能系统在真实或模拟环境中,实现从感知、理解、推理到行动的完整闭环,不再是只活在屏幕里的程序。
具身智能的产业目标是创造出能适应非结构化环境、并像人类一样进行灵巧操作的智能机器。它不等同于传统的“自动化机器”,后者依赖固定程序,对环境和任务的变动高度敏感;它也并非单纯给现有机器人加上一个语言聊天接口。
真正的具身智能系统包含三个核心闭环:
这一轮产业爆发,主要由三大底层技术交汇驱动:多模态大模型极大提升了机器人的常识推理和零样本任务泛化能力;GPU加速的高保真物理仿真器让机器人在虚拟世界中低成本、大规模地试错学习成为可能;核心硬件供应链(高精度力矩传感器、高性能空心杯电机、边缘端高算力AI芯片)的成熟与成本收敛,使构建复杂、可靠、可量产的人形机器人不再是天方夜谭。目前,落地场景已覆盖汽车总装中的柔性插接、仓储物流中的无序分拣、医疗手术辅助以及家庭陪伴服务等,但距离真正通用的“全能管家”级具身智能仍有相当长的距离。
学术界与产业前沿专家的核心关切集中在:物理交互的不可逆性与样本的低效性。与数字世界不同,现实世界的物理交互一旦出错可能损坏传感器或环境,且一次失败的任务无法像游戏一样重来。因此,研究焦点高度集中于以下方向:
【找杯子】→【抓杯子】→【放入垃圾桶】 的子任务序列。顶层仅传递语义指令,而底层则由训练好的技能库(如抓取、放置、移动)通过高频控制执行。最简明的具身智能闭环架构可抽象如下(简化示例,不含具体参数):
物理世界 (包含各种物体与场景)
│
▼
多模态传感器阵列 ──► 感知融合模块: (视觉+力+触觉+IMU+麦克风) ──► 状态估计与语义场景图
│
▼
┌─ 世界模型(隐式预测)
│ │
▼ ▼
┌─── 任务规划与决策层 ───┐
│ (LLM/VLM规划器 或 端到端VLA模型) │
└──────────┬──────────┘
│ (子任务/技能指令 或 高层动作基元)
▼
┌─── 运动规划 + 全身控制 (WBC) ───┐
│ (阻抗/导纳控制、模型预测控制) │
└──────────────┬─────────────────┘
│ (关节目标位置/力矩指令,100-1000Hz)
▼
执行器(电机/液压/气动)
│
▼
┌ 物理世界状态变化 ──► 新观测 ──┐
└──────────────────────────────┘
核心机制展开:
find(‘mug’) → pick(‘mug’, side='top-down') → place(‘mug’, target='trash_bin')。每一个操作原语再由其专属的底层策略执行,该策略接收实时视觉与本体感觉数据,直接输出高频率的电机控制指令。<task>拿湿纸巾擦掉桌上的咖啡渍</task>。系统经视觉编码器(如ViT)和语言编码器串联,在交叉注意力机制下实现模态融合,并由一个基于扩散模型的动作头逐步从噪声中“降噪”生成一段连贯的未来动作轨迹。训练通常混合使用高质量的人类遥操作示教数据与海量仿真增强数据。由于当前端到端模型一次前向推理的延迟和算力开销,尚难以同时处理亚毫秒级的高带宽触觉反馈。因此,在执行高速接触性任务时,通常需要并联一个高频的底层力控/阻抗控制器作为补偿与安全冗余。衡量具身智能系统性能和成熟度的关键维度与参数包括:
目前主流技术路线呈光谱式分布,既有侧重机理建模的传统派,也有完全拥抱数据驱动的端到端派。
| 维度 | 基于模型的控制 (MPC/最优控制) | 无模型强化学习 | 端到端基础模型 (VLA) | 分层架构 (大模型+技能库) |
|---|---|---|---|---|
| 数据需求 | 极低(仅需系统的物理参数辨识) | 极高(随机试错,离策略或在线策略训练) | 极高(依赖互联网数据+海量遥操作示教) | 中高(底层技能各自需要数据,顶层规划依赖LLM/VLM现有能力) |
| 对新任务的泛化 | 极差,依赖人工重新精确建模 | 中,对训练分布内的变化有较好泛化力 | 中高,表现出令人鼓舞的零样本语言引导泛化,但动作执行尚不稳定 | 高,新任务通常只需重写顶层规划Prompt,无需重训底层技能 |
| 实时控制性能 | 高,但优化求解需较强机载算力 | 极高,推理过程通常只需一次网络前向传播 | 低-中,大模型端侧推理延迟(数百毫秒至秒级)仍是瓶颈 | 中,顶层规划器调用频次低,底层实时性高 |
| 精细力控能力 | 高,可对接触力、力矩施加显式约束 | 中,高度依赖奖励函数的设计技巧 | 低(目前状态),对精细触觉和力反馈的融合尚不成熟 | 高,底层技能策略可专门优化精细力控 |
| 可解释性 | 高,计算过程白盒 | 低,黑盒神经网络 | 极低,黑盒大模型 | 中,顶层规划步骤可读 |
| 典型产业代表 | 高精度工业焊接、打磨 | 腿足式机器人的复杂地形行走 | Google RT系列、Figure 01早期原型机、清华UniTree具身智能大模型 | 特斯拉Optimus(推测)、NVIDIA GR00T平台、大多数商业人形机器人初创公司 |
注:上表综合自公开研究论文与产业发布口径,为定性研判,非精确量化对比。
具身智能的硬件和基础软件供应链:
具身智能的潜在应用市场覆盖国民经济主要部门:
(本节仅基于公开新闻报道和产业链逻辑梳理公司涉足情况,不构成任何投资建议。)
由于具身智能和人形机器人仍处于产业化极早期,缺乏统一口径的权威统计,各界数据均为预测,差异巨大,仅供参考。
对主流人形机器人整机玩家的简要对比:
| 公司 | 代表产品 | 核心技术路线与特点 | 商业化阶段 | 关键进展与时间线 |
|---|---|---|---|---|
| 特斯拉 (Tesla) | Optimus (Gen 2) | 复用FSD视觉神经网络与硬件;自研执行器;强调通用性、低成本量产能力 | 内部工厂测试 | Gen 2于2023年12月公布,实现了更快的步行速度、更轻的重量及多模态感知。马斯克预测2025年小规模生产,但尚未有官方时间表。 |
| Figure AI | Figure 01 | 与OpenAI合作,深度融合多模态大模型,实现端到端语言-视觉-动作控制 | 早期原型,工业验证 | 2024年1月与宝马达成商业协议,推进汽车制造场景。2024年3月公布与大模型结合后令人瞩目的自然语言交互与任务执行能力。 |
| 波士顿动力 (Hyundai) | Atlas | 从液压转向全电动平台,具备世界级的全身动态运动能力(跳跃、后空翻等) | 工业试点 | 2024年4月发布全新全电动Atlas,定位为工业应用,相比液压版更安静、更节能。商业落地以巡检和物料搬运为切入点,母公司现代汽车为首要大客户。 |
| Agility Robotics | Digit | 独特仿鸵鸟双足设计,专注仓储物流搬运的最后一公里 | 早期量产与商业化交付 | 2023年在俄勒冈州开设全球首家人形机器人工厂“RoboFab”,计划年产万台。已在亚马逊仓库进行试点测试。 |
| 优必选 (UBTECH) | Walker S | 中国老牌人形机器人公司(上市),关键零部件如伺服舵机高度自研 | 教育、商用接待到工业探索 | Walker S于2023年发布,已进入蔚来汽车全工艺场景“实训”,在总装车间进行初步操作验证(来源:优必选官方公告)。 |
注:上述技术路线与商业化阶段均为基于公司官方公布信息和公开报道的综合判断。
误读1:“具身智能 = 把 ChatGPT 装进机器人”
纠偏:大语言模型(LLM)能很好地承担高层规划、常识推理和人机交互的角色,但并不负责底层高频、实时的运动控制与物理交互。真正的具身智能必须处理物理接触中的碰撞、摩擦、柔性变形等非线性、瞬时性的复杂动态,这远远超出了纯文本/图像域大模型的能力边界。缺乏精细的环境模型和力控系统,仅靠语言和视觉无法安全、可靠地操作现实世界中的物体。
误读2:“仿真中训练好的策略可以直接‘零样本’完美部署到现实世界”
纠偏:尽管域随机化等技术极大推动了 Sim-to-Real 的成功率,但现实世界存在大量仿真引擎无法完美建模的物理现象(如空气阻力对轻小物体的影响、非均匀摩擦、光线的多次反射和折射、组装的精密配合公差等)。目前的行业实践,仍普遍需要为每个新任务进行少量的现实世界数据微调或在线自适应学习。对高精度、高可靠性任务(如精密装配)而言,零样本完美迁移仍是未解决的前沿难题。
本页面的综合信息主要来自以下公开渠道,而非单一定量研究: