世界模型
在內部預測當前狀態和動作導致的下一狀態,用於行動前模擬。
減少真實世界試錯成本Embodied AI
具身智慧把感知、決策規劃和執行控制耦合進機器人本體,讓 AI 在物理世界中完成移動、抓取和操作任務。
MDX 將具身智慧拆成感知層、決策規劃層、執行控制層,並列出上遊硬體與下游應用場景。
在內部預測當前狀態和動作導致的下一狀態,用於行動前模擬。
減少真實世界試錯成本在模擬中訓練策略,再通過域隨機化和自適應遷移至真實硬體。
規模訓練和機器人部署用擴散模型或行動分塊 Transformer 生成連續動作序列。
靈巧操作和長時序任務| 來源 | 類型 | 截至 |
|---|---|---|
| 具身智慧 MDX | mdx | 2026-05-29 |
具身智慧 = 會思考的身體。它讓 AI 不僅擁有能推論、規劃的“大腦”(演算法與模型),更賦予其能在物理世界中進行感知與操作的“身體”(機器人、機械臂等物理實體)。其核心是讓智慧系統在真實或模擬環境中,實現從感知、理解、推論到行動的完整閉環,不再是隻活在螢幕裡的程式。
具身智慧的產業目標是創造出能適應非結構化環境、並像人類一樣進行靈巧操作的智慧機器。它不等同於傳統的“自動化機器”,後者依賴固定程式,對環境和任務的變動高度敏感;它也並非單純給現有機器人加上一個語言聊天介面。
真正的具身智慧系統包含三個核心閉環:
這一輪產業爆發,主要由三大底層技術交匯驅動:多模態大型模型極大提升了機器人的常識推論和零樣本任務泛化能力;GPU加速的高保真物理模擬器讓機器人在虛擬世界中低成本、大規模地試錯學習成為可能;核心硬體供應鏈(高精度力矩感測器、高效能空心杯電機、邊緣端高算力AI晶片)的成熟與成本收斂,使建置複雜、可靠、可量產的人形機器人不再是天方夜譚。目前,落地場景已覆蓋汽車總裝中的柔性插接、倉儲物流中的無序分揀、醫療手術輔助以及家庭陪伴服務等,但距離真正通用的“全能管家”級具身智慧仍有相當長的距離。
學術界與產業前沿專家的核心關切集中在:物理互動的不可逆性與樣本的低效性。與數字世界不同,現實世界的物理互動一旦出錯可能損壞感測器或環境,且一次失敗的任務無法像遊戲一樣重來。因此,研究焦點高度集中於以下方向:
【找杯子】→【抓杯子】→【放入垃圾桶】 的子任務序列。頂層僅傳遞語義指令,而底層則由訓練好的技能庫(如抓取、放置、移動)通過高頻控制執行。最簡明的具身智慧閉環架構可抽象如下(簡化示例,不含具體引數):
物理世界 (包含各種物體與場景)
│
▼
多模態感測器陣列 ──► 感知融合模組: (視覺+力+觸覺+IMU+麥克風) ──► 狀態估計與語義場景圖
│
▼
┌─ 世界模型(隱式預測)
│ │
▼ ▼
┌─── 任務規劃與決策層 ───┐
│ (LLM/VLM規劃器 或 端到端VLA模型) │
└──────────┬──────────┘
│ (子任務/技能指令 或 高層動作基元)
▼
┌─── 運動規劃 + 全身控制 (WBC) ───┐
│ (阻抗/導納控制、模型預測控制) │
└──────────────┬─────────────────┘
│ (關節目標位置/力矩指令,100-1000Hz)
▼
執行器(電機/液壓/氣動)
│
▼
┌ 物理世界狀態變化 ──► 新觀測 ──┐
└──────────────────────────────┘
核心機制展開:
find(‘mug’) → pick(‘mug’, side='top-down') → place(‘mug’, target='trash_bin')。每一個操作原語再由其專屬的底層策略執行,該策略接收即時視覺與本體感覺資料,直接輸出高頻率的電機控制指令。<task>拿溼紙巾擦掉桌上的咖啡漬</task>。系統經視覺編碼器(如ViT)和語言編碼器串聯,在交叉注意力機制下實現模態融合,並由一個基於擴散模型的動作頭逐步從噪聲中“降噪”生成一段連貫的未來動作軌跡。訓練通常混合使用高質量的人類遙操作示教資料與海量模擬增強資料。由於當前端到端模型一次前向推論的延遲和算力開銷,尚難以同時處理亞毫秒級的高頻寬觸覺反饋。因此,在執行高速接觸性任務時,通常需要並聯一個高頻的底層力控/阻抗控制器作為補償與安全冗餘。衡量具身智慧系統性能和成熟度的關鍵維度與引數包括:
目前主流技術路線呈光譜式分佈,既有側重機理建模的傳統派,也有完全擁抱資料驅動的端到端派。
| 維度 | 基於模型的控制 (MPC/最優控制) | 無模型強化學習 | 端到端基礎模型 (VLA) | 分層架構 (大型模型+技能庫) |
|---|---|---|---|---|
| 資料需求 | 極低(僅需系統的物理引數辨識) | 極高(隨機試錯,離策略或線上策略訓練) | 極高(依賴網際網路資料+海量遙操作示教) | 中高(底層技能各自需要資料,頂層規劃依賴LLM/VLM現有能力) |
| 對新任務的泛化 | 極差,依賴人工重新精確建模 | 中,對訓練分佈內的變化有較好泛化力 | 中高,表現出令人鼓舞的零樣本語言引導泛化,但動作執行尚不穩定 | 高,新任務通常只需重寫頂層規劃Prompt,無需重訓底層技能 |
| 即時控制性能 | 高,但最佳化求解需較強機載算力 | 極高,推論過程通常只需一次網路前向傳播 | 低-中,大型模型端側推論延遲(數百毫秒至秒級)仍是瓶頸 | 中,頂層規劃器呼叫頻次低,底層即時性高 |
| 精細力控能力 | 高,可對接觸力、力矩施加顯式約束 | 中,高度依賴獎勵函式的設計技巧 | 低(目前狀態),對精細觸覺和力反饋的融合尚不成熟 | 高,底層技能策略可專門最佳化精細力控 |
| 可解釋性 | 高,計算過程白盒 | 低,黑盒神經網路 | 極低,黑盒大型模型 | 中,頂層規劃步驟可讀 |
| 典型產業代表 | 高精度工業焊接、打磨 | 腿足式機器人的複雜地形行走 | Google RT系列、Figure 01早期原型機、清華UniTree具身智慧大型模型 | 特斯拉Optimus(推測)、NVIDIA GR00T平台、大多數商業人形機器人初創公司 |
注:上表綜合自公開研究論文與產業釋出口徑,為定性研判,非精確量化對比。
具身智慧的硬體和基礎軟體供應鏈:
具身智慧的潛在應用市場覆蓋國民經濟主要部門:
(本節僅基於公開新聞報道和產業鏈邏輯梳理公司涉足情況,不構成任何投資建議。)
由於具身智慧和人形機器人仍處於產業化極早期,缺乏統一口徑的權威統計,各界資料均為預測,差異巨大,僅供參考。
對主流人形機器人整機玩家的簡要對比:
| 公司 | 代表產品 | 核心技術路線與特點 | 商業化階段 | 關鍵進展與時間線 |
|---|---|---|---|---|
| 特斯拉 (Tesla) | Optimus (Gen 2) | 複用FSD視覺神經網路與硬體;自研執行器;強調通用性、低成本量產能力 | 內部工廠測試 | Gen 2於2023年12月公佈,實現了更快的步行速度、更輕的重量及多模態感知。馬斯克預測2025年小規模生產,但尚未有官方時間表。 |
| Figure AI | Figure 01 | 與OpenAI合作,深度融合多模態大型模型,實現端到端語言-視覺-動作控制 | 早期原型,工業驗證 | 2024年1月與寶馬達成商業協議,推進汽車製造場景。2024年3月公佈與大型模型結合後令人矚目的自然語言互動與任務執行能力。 |
| 波士頓動力 (Hyundai) | Atlas | 從液壓轉向全電動平台,具備世界級的全身動態運動能力(跳躍、後空翻等) | 工業試點 | 2024年4月釋出全新全電動Atlas,定位為工業應用,相比液壓版更安靜、更節能。商業落地以巡檢和物料搬運為切入點,母公司現代汽車為首要大客戶。 |
| Agility Robotics | Digit | 獨特仿鴕鳥雙足設計,專注倉儲物流搬運的最後一公里 | 早期量產與商業化交付 | 2023年在奧勒岡州開設全球首家人形機器人工廠“RoboFab”,計劃年產萬臺。已在亞馬遜倉庫進行試點測試。 |
| 優必選 (UBTECH) | Walker S | 中國老牌人形機器人公司(上市),關鍵零部件如伺服舵機高度自研 | 教育、商用接待到工業探索 | Walker S於2023年釋出,已進入蔚來汽車全工藝場景“實訓”,在總裝車間進行初步操作驗證(來源:優必選官方公告)。 |
注:上述技術路線與商業化階段均為基於公司官方公佈資訊和公開報道的綜合判斷。
誤讀1:“具身智慧 = 把 ChatGPT 裝進機器人”
糾偏:大語言模型(LLM)能很好地承擔高層規劃、常識推論和人機互動的角色,但並不負責底層高頻、即時的運動控制與物理互動。真正的具身智慧必須處理物理接觸中的碰撞、摩擦、柔性變形等非線性、瞬時性的複雜動態,這遠遠超出了純文本/影像域大型模型的能力邊界。缺乏精細的環境模型和力控系統,僅靠語言和視覺無法安全、可靠地操作現實世界中的物體。
誤讀2:“模擬中訓練好的策略可以直接‘零樣本’完美部署到現實世界”
糾偏:儘管域隨機化等技術極大推動了 Sim-to-Real 的成功率,但現實世界存在大量模擬引擎無法完美建模的物理現象(如空氣阻力對輕小物體的影響、非均勻摩擦、光線的多次反射和折射、組裝的精密配合公差等)。目前的行業實踐,仍普遍需要為每個新任務進行少量的現實世界資料微調或線上自適應學習。對高精度、高可靠性任務(如精密裝配)而言,零樣本完美遷移仍是未解決的前沿難題。
本頁面的綜合資訊主要來自以下公開渠道,而非單一定量研究: