模仿學習(Imitation Learning)
3 秒看懂
模仿學習 = 讓 AI 通過”看老師怎麼做”來學,而不是通過”試錯拿獎勵”來學。 核心範式:從專家示範資料中直接學習策略(policy),跳過手動設計獎勵函式的難題。它是機器人操控、自動駕駛端到端落地、以及大型模型對齊(alignment)等前沿領域的關鍵技術基石之一。
3 分鐘產業解釋
為什麼模仿學習突然火了?
傳統強化學習(RL)有一個致命瓶頸:獎勵工程(reward engineering)。在圍棋、遊戲這類規則明確的封閉環境裡,獎勵訊號天然存在;但在真實物理世界——比如讓機器人疊衣服、讓無人車在城區行駛——手動設計一個精確的獎勵函式幾乎是不可能的。獎勵函式設計不好,agent 就會瘋狂”鑽空子”(reward hacking),學到人類完全不想要的行為。
模仿學習的思路徹底繞開了這個問題:直接從人類(或更高階 agent)的示範軌跡中提取策略知識,不依賴環境獎勵訊號。
近兩年產業加速的三個驅動力:
- 具身智慧(Embodied AI)爆發:人形機器人(Figure、1X、Tesla Optimus 等)需要從人類動作示範中學習操控策略,模仿學習是最直接的路徑。
- 端到端自動駕駛:以 Wayve、Tesla FSD v12+ 為代表,用海量人類駕駛資料做行為克隆(Behavior Cloning),再輔以少量 RL 微調,正在取代傳統模組化感知-規劃-控制架構。
- 大型模型對齊的範式融合:DPO(Direct Preference Optimization)等方法在數學形式上可被理解為一種隱式的逆強化學習(IRL),將”從人類偏好中學習”統一到了模仿學習的理論架構下。
一句話產業定位: 模仿學習是連線”人類示範資料”與”AI 策略輸出”的核心學習範式,是從大型模型(數字智慧)通往具身智慧(物理世界智慧)的關鍵橋樑之一。
15 分鐘專家深入
模仿學習的兩大技術流派
模仿學習內部可粗分為兩大技術路線,以及一條融合路線:
| 路線 | 核心思想 | 代表方法 | 優勢 | 劣勢 |
|---|---|---|---|---|
| 行為克隆(Behavioral Cloning, BC) | 將模仿學習化為監督學習,直接擬合 (狀態→動作) 對映 | 最大似然 BC、DAgger | 簡單高效,可直接用深度學習流水線 | 分佈偏移(covariate shift)導致誤差指數級複合 |
| 逆強化學習(Inverse RL, IRL) | 先從示範中恢復(推斷)獎勵函式,再用 RL 最佳化策略 | MaxEnt IRL、GAIL | 理論上能泛化到示範未覆蓋的狀態;學到的獎勵函式有可解釋性 | 計算代價高,內層巢狀 RL 迴圈不穩定 |
| 融合/混合路線 | 在 BC 基礎上引入少量 RL 微調或對比學習 | RLHF(含 PPO/DPO)、Diffusion Policy + RL fine-tune | 兼顧資料效率與策略質量 | 工程複雜度高 |
行為克隆(BC):最直接但有硬傷
核心公式:
給定專家示範資料集 mathcal(D) = {(mathbf(s)_t, mathbf(a)_t)}_{t=1}^{N},BC 通過監督學習求解:
\pi^* = \arg\min_{\pi} mathbb(E)_{(mathbf(s), mathbf(a)) \sim mathcal(D)} \left[ mathcal(L)(\pi(mathbf(s)), mathbf(a)) \right]
對於離散動作,mathcal(L) 通常為交叉熵;對於連續動作,常用 MSE 或高斯負對數似然。
致命問題 —— 分佈偏移與複合誤差(compounding error):
BC 訓練資料來自專家的狀態分佈 d_{\pi_E},但部署時 agent 自己探索,走到的狀態分佈是 d_\pi。一旦 \pi 在某一步犯了一個微小錯誤,狀態就會偏離訓練分佈;偏離後 \pi 在沒見過的狀態上更容易犯錯 → 誤差隨時間步指數級複合。
Ross, Gordon & Bagnell(2011)給出了經典分析:若 BC 的單步期望誤差為 \epsilon,在時間 horizon $T$ 內,總效能損失上界為 O(\epsilon T^2)。
DAgger(Dataset Aggregation)—— 業界最常用的緩解方案:
Ross et al. 2011 提出的 DAgger 通過迭代式資料聚合將上界降至 O(\epsilon T):
DAgger 演算法骨架:
for iteration i = 1, 2, ..., N:
1. 用當前策略 π_i 在環境中執行, 收集狀態序列 {s_t}
2. 請專家標註這些狀態對應的動作 a_t = π_E(s_t)
3. 將新資料加入訓練集, 微調得到 π_{i+1}
侷限:DAgger 需要在部署時有”線上專家”提供即時標註,在很多場景(如真實機器人操控)中成本極高。
逆強化學習(IRL)與 GAIL
IRL 的經典架構(Ng & Russell, 2000):
IRL 做的是 BC 的”逆問題”—— 不直接學策略,而是先推斷出隱含的獎勵函式 R^*,使得在該獎勵下最優策略的行為與專家一致:
R^* = \arg\max_{R} \left[ \min_{\pi} \left( V^{R}(\pi_E) - V^{R}(\pi) \right) \right]
然後在 R^* 上用標準 RL 求解最優策略。
問題:原始 IRL 是一個雙層最佳化問題(bilevel optimization),計算上非常昂貴,且存在多解性(不同的獎勵函式可能產生相同最優策略)。
GAIL(Generative Adversarial Imitation Learning, Ho & Ermon, 2016):
GAIL 受 GAN 啟發,將 IRL 的內層 RL 迴圈替換為對抗訓練:
GAIL 架構:
- Generator = 策略 π(生成動作軌跡)
- Discriminator = D(s,a)(區分專家軌跡與策略軌跡)
訓練目標:
max_D E_{π_E}[log D(s,a)] + E_π[log(1 - D(s,a))]
min_π E_π[log(1 - D(s,a))] - λ·H(π)
其中 H(π) 是策略的熵正則項, 防止策略坍縮
核心洞察:GAIL 的 discriminator 隱式地充當了獎勵函式的角色——R(s,a) = -\log(1 - D(s,a))。這避免了顯式恢復獎勵函式的多解性問題。
最前沿:擴散策略(Diffusion Policy)
Chi et al.(2023, Columbia/Toyota Research)提出的 Diffusion Policy 是近兩年模仿學習領域影響力最大的技術突破之一:
- 核心思路:用去噪擴散機率模型(DDPM)建模策略的動作序列分佈
\pi(mathbf(a)_{0:H} | mathbf(o)),而非單步動作。 - 關鍵優勢:擴散模型天然擅長建模多模態分佈(multimodal distribution),而機器人操控任務的動作分佈通常是高度多模態的(如抓取物體有多種可行姿態)。傳統 BC 用 MSE 迴歸擬合多模態分佈會取平均 → 產生”動作平均化”的失效模式。
- 效能:在多個標準機器人操控 benchmark 上顯著超越傳統 BC 和 GAIL 系方法,尤其在需要精細操控和多步驟協調的任務上。具體效能數字可參見 Chi et al. 原始論文的 RoboMimic benchmark 結果。
與大型模型時代的關係
| 場景 | 模仿學習的角色 |
|---|---|
| LLM SFT(Supervised Fine-Tuning) | 本質就是行為克隆 —— 用高質量人類標註資料做監督學習 |
| RLHF / PPO | 先用 SFT(BC)初始化,再用學習到的獎勵模型做 RL 微調 —— 這是 IRL+RL 的變體 |
| DPO | 繞過顯式獎勵模型,直接從偏好對資料中隱式恢復獎勵並最佳化策略 —— 可視為一種簡化 IRL |
| 具身基礎模型(RT-2, Octo 等) | 在海量機器人示範資料上做 BC 預訓練,再做任務微調 |
技術原理
模仿學習的形式化定義
【MDP 架構下的模仿學習】
給定: MDP = (S, A, T, γ) [注意: 無顯式獎勵函式 R]
專家策略 π_E 產生的示範軌跡 D = {τ_1, τ_2, ..., τ_m}
每條軌跡 τ = {(s_0, a_0), (s_1, a_1), ..., (s_T, a_T)}
目標: 找到策略 π 使得 π 的行為分佈儘可能接近 π_E
行為克隆的監督學習視角
【BC 訓練流程】
Expert Data: {(s_t, a_t)} ~ π_E
│
▼
┌───────────────────────────┐
│ Neural Network π_θ │
│ Input: s_t (state) │
│ Output: a_t (action) │
│ │
│ Loss: │
│ · 離散動作: CrossEntropy │
│ · 連續動作: MSE / NLL │
│ · 混合動作: MDN 等 │
└───────────────────────────┘
│
▼
Deploy: a = π_θ(s) ← 分佈偏移風險
關鍵超引數與設計選擇(定性描述,具體數值因任務而異):
- 網路架構:視覺輸入常用 ResNet/ViT 編碼器 + MLP/Transformer 解碼器;本體感知(proprioceptive)輸入常用 MLP。
- 動作空間表示:連續動作用高斯分佈引數化(輸出 mean + std)或用擴散模型建模;離散動作用分類頭。
- 序列建模:是否用歷史幀棧(frame stacking)或 Transformer 處理時序依賴,對策略質量影響顯著。
GAIL 的對抗訓練機制
【GAIL 網路結構與訓練迴圈】
Expert Trajectories Policy Trajectories
π_E π_θ
│ │
▼ ▼
(s_t, a_t)_E (s_t, a_t)_π
│ │
└─────────┬─────────────────┘
│
▼
┌─────────────────────┐
│ Discriminator D_φ │
│ Input: (s, a) │
│ Output: [0, 1] │
│ (expert vs policy) │
└─────────────────────┘
│ │
D Loss: │ │ Policy gradient signal:
max logD+ │ │ ∇_θ J(θ) = E[∇logπ(a|s)·
log(1-D) │ │ (-log(1-D(s,a)))]
│ │
▼ ▼
Update D_φ Update π_θ (via PPO/TRPO)
關鍵理論結果
(1)BC 的複合誤差界(Ross et al., 2011):
J(\pi_E) - J(\pi_{BC}) \leq O(\epsilon T^2)
其中 \epsilon 為單步分類/迴歸誤差,$T$ 為 episode 長度。DAgger 將此改善為 O(\epsilon T)。
(2)GAIL 與 IRL 的等價性(Ho & Ermon, 2016):
在一定正則條件下,GAIL 的最優解與最大熵 IRL 的最優解對應的策略一致。GAIL 的優勢在於繞過了 IRL 中顯式求解獎勵函式的多解性。
(3)模仿學習與線上 RL 的樣本效率對比(經驗性):
- BC 可以完全離線訓練,不需要環境互動 → 在真實機器人場景中樣本效率遠高於純 RL。
- IRL/GAIL 仍需要策略與環境互動,但所需互動量通常遠少於純 RL(因為有專家示範引導)。
- 具體樣本效率資料因任務和實現差異極大,不宜泛化給出統一數字。
技術演進史
| 時間 | 里程碑 | 意義 |
|---|---|---|
| ~1990s | 最優控制領域的 Learning from Demonstration (LfD) | 機器人學中模仿學習的早期實踐 |
| 2000 | Ng & Russell 發表 IRL 理論架構 | 首次形式化”從最優行為反推獎勵”問題 |
| 2010-2011 | DAgger (Ross et al.) | 提出迭代式資料聚合解決分佈偏移,成為 BC 系列方法的標配 |
| 2016 | GAIL (Ho & Ermon) | GAN 式對抗訓練引入 IRL,大幅降低計算代價 |
| 2017 | DeepMimic (Peng et al.) | 首次用深度 RL + 模仿學習實現物理合理的人體運動技能遷移 |
| 2018-2019 | DAgger + 深度感知在自動駕駛中的應用 | Waymo 等公司開始在真實系統中使用模仿學習 |
| 2020-2021 | 大語言模型 SFT 實質上就是大規模行為克隆 | 模仿學習思想滲透進 LLM 對齊管線 |
| 2022 | Gato (DeepMind) | 通才 agent,在多種任務的示範資料上做 BC 預訓練 |
| 2023 | Diffusion Policy (Chi et al.) | 用擴散模型解決 BC 的多模態動作分佈建模問題 |
| 2023-2024 | RT-2 / Octo / π0 等具身基礎模型 | 在大規模機器人示範資料上做 BC 預訓練 + 下游任務微調 |
| 2024-2025 | 端到端自動駕駛(Tesla FSD v12+、Wayve) | 大規模行為克隆 + 少量 RL 微調成為行業主流路線之一 |
技術路線對比
方法級量化對比(定性 + 部分可查資料)
| 維度 | Behavior Cloning (BC) | DAgger | GAIL | Diffusion Policy | RL(PPO/SAC 等) |
|---|---|---|---|---|---|
| 是否需要環境互動 | ❌ 純離線 | ✅ 需要 | ✅ 需要 | ❌ 通常純離線(可混合) | ✅ 強依賴 |
| 是否需要獎勵函式 | ❌ | ❌ | ❌(隱式) | ❌ | ✅ |
| 需要線上專家 | ❌ | ✅(核心缺點) | ❌ | ❌ | ❌ |
| 分佈偏移問題 | 嚴重(O(\epsilon T^2)) | 緩解(O(\epsilon T)) | 部分緩解(通過探索) | 緩解(多模態建模更魯棒) | 不存在(自探索) |
| 多模態動作分佈處理 | ❌ 差(MSE 取平均) | ❌ 差 | ⭕ 一般 | ✅ 強(擴散模型天然優勢) | 取決於策略引數化 |
| 計算代價 | 低 | 中 | 高(對抗訓練不穩定) | 中高(推論需多步去噪) | 高 |
| 資料效率(vs 純 RL) | 高(離線) | 中 | 中 | 高(離線) | 低 |
| 典型應用場景 | 自動駕駛、操控 | 有模擬器的機器人 | 研究 benchmark | 精細機器人操控 | 遊戲、可控模擬 |
上下游
上游:資料與基礎設施
上游供應鏈:
┌─────────────────────────────────────────────────────┐
│ 資料採集層: │
│ · 遙操作(Teleoperation):VR 手套、外骨骼、主從控制 │
│ · 動作捕捉(MoCap):Vicon、OptiTrack、Xsens │
│ · 人類影片標註:YouTube 影片 + 語言標註 │
│ · 模擬環境資料生成:NVIDIA Isaac Sim、MuJoCo │
│ │
│ 硬體層: │
│ · GPU 叢集(訓練):NVIDIA H100/H200/B200 │
│ · 機器人硬體(資料採集 & 部署):Figure 01/02、 │
│ Unitree H1/G1、Franka Emika 等 │
│ · 感測器:RGB-D 相機、力/力矩感測器、LiDAR │
└─────────────────────────────────────────────────────┘
下游:應用領域
下游應用:
┌─────────────────────────────────────────────────────┐
│ 1. 自動駕駛: Tesla FSD, Wayve, Waabi 等 │
│ 2. 機器人操控: 工廠分揀、家政服務、手術輔助 │
│ 3. LLM 對齊: SFT, RLHF, DPO │
│ 4. 遊戲 NPC: 從玩家行為學習自然互動策略 │
│ 5. 程式碼生成: 從開發者提交歷史學習程式設計風格 │
│ 6. 科學計算: 從專家實驗操作中學習實驗流程 │
└─────────────────────────────────────────────────────┘
關鍵指標
| 指標 | 說明 | 典型量級/趨勢 |
|---|---|---|
| 專家示範數量(demonstrations) | 達到可用策略質量所需的最少軌跡數 | 簡單任務:~10-100 條;複雜操控:~1000+ 條;自動駕駛:百萬級片段(估算) |
| 策略成功率(success rate) | 在目標任務上成功完成的比例 | 高質量 BC + 任務適配架構:通常可達 70%-95%+(因任務差異極大) |
| 分佈偏移衰減率 | 策略隨時間步效能下降的速度 | 純 BC 在長 horizon 任務上衰減顯著;DAgger/Diffusion Policy 可顯著緩解 |
| 推論延遲(latency) | 部署時單步推論時間 | BC(MLP/輕量 Transformer):通常 <10ms;Diffusion Policy:需多步去噪,延遲更高,但可並行最佳化 |
| 泛化能力(泛化到未見場景) | 訓練分佈外場景的表現 | BC 通常泛化能力有限;IRL 系方法理論上更好;大規模預訓練(RT-2 等)正在改善 |
供需與市場資料
需求側
- 具身智慧訓練資料需求正快速增長。根據行業公開討論(非精確預測),機器人示範資料採集可能成為下一個”資料標註”級別的產業環節。
- 自動駕駛領域,端到端路線對高質量人類駕駛資料的需求量級在百萬至千萬級影片片段(行業估算,各廠商未充分揭露具體數字)。
- LLM SFT 資料:高質量指令跟隨資料本質上就是模仿學習資料,市場規模隨 LLM 部署量同步增長。
供給側
- 資料採集基礎設施(遙操作裝置、模擬平台)正在快速商品化:NVIDIA Isaac Sim、Toyota Research 的遙操作平台等。
- 開源示範資料集持續增長:Open X-Embodiment(Google DeepMind 聯合多家機構)彙集了來自 22 個不同機器人的超 100 萬條操控軌跡 [資料來源: Open X-Embodiment 論文,2023]。
市場規模
目前尚無權威第三方報告單獨針對”模仿學習”給出市場規模資料,因其分散在自動駕駛、機器人、AI 對齊等多個賽道中。相關市場資料應參考各下游賽道的獨立報告。
代表公司與資本對映
| 公司/機構 | 角色 | 核心技術/產品 | 模仿學習應用方向 |
|---|---|---|---|
| Tesla | 自動駕駛 + 人形機器人 | FSD v12+(端到端)、Optimus 人形機器人 | 大規模駕駛行為克隆;機器人操控 BC |
| Wayve | 端到端自動駕駛 | GAIA-1/2 世界模型 + 端到端駕駛策略 | 駕駛示範資料的行為克隆 + 世界模型增強 |
| Figure | 人形機器人 | Figure 01/02 | 遙操作示範 + 模仿學習訓練操控策略 |
| 1X Technologies | 人形機器人 | NEO 系列 | 人類示範資料訓練 + 大型模型融合 |
| Toyota Research Institute (TRI) | 機器人研究 | Diffusion Policy 等前沿操控方法 | 推動擴散策略等模仿學習方法的學術突破 |
| NVIDIA | 基礎設施 | Isaac Sim、Project GR00T | 提供模擬資料生成 + 模仿學習訓練平台 |
| Google DeepMind | 基礎研究 + 產品 | RT-2、Open X-Embodiment、Gato | 大規模機器人 BC 預訓練 |
| Physical Intelligence (π) | 機器人基礎模型 | π0 | 通用機器人基礎模型,核心依賴大規模模仿學習 |
| Hugging Face | 開源平台 | LeRobot | 開源模仿學習工具鏈(ACT、Diffusion Policy 等) |
| OpenAI | LLM / 對齊 | ChatGPT 系列 | SFT(BC)→ RLHF/DPO 對齊管線 |
一級市場關注:Physical Intelligence 2024 年獲約 4 億美元融資(公開報道,具體估值未充分揭露),反映資本市場對”具身智慧 + 模仿學習”賽道的高關注度。
投資邏輯
核心邏輯鏈
模仿學習的價值捕獲鏈條:
[資料層] [演算法層] [應用層]
示範資料採集 模仿學習演算法 終端產品
┌──────────┐ ┌──────────┐ ┌──────────┐
│遙操作裝置 │────────→│BC/IRL/ │────────→│自動駕駛 │
│動作捕捉 │ │Diffusion │ │人形機器人│
│模擬平台 │ │Policy等 │ │工業自動化│
│人類影片 │ │ │ │AI 助手 │
└──────────┘ └──────────┘ └──────────┘
產業觀察
- 資料基礎設施是”賣鏟子”機會:遙操作裝置、模擬資料生成平台、大規模資料管理管線——這些環節的需求確定性高,不依賴於具體演算法路線的優勝劣汰。
- 算力需求確定性高:無論 BC 還是 IRL,大規模模仿學習訓練都依賴 GPU 算力,且隨著模型規模和資料量的增長而增長。
- 演算法層競爭格局未定:BC vs Diffusion Policy vs 新興方法(如 Flow Matching Policy 等)的優劣尚在快速演變中,技術路線風險仍需持續追蹤。
- 應用層估值分化:端到端自動駕駛和人形機器人是最大的潛在應用市場,但商業化時間表仍有不確定性。
常見誤讀糾偏
誤讀 1:“行為克隆就是模仿學習的全部”
糾偏:行為克隆只是模仿學習中最簡單的一種方法。模仿學習是一個更大的架構,包括 IRL、GAIL、結構化預測方法、以及利用演示資料做預訓練 + RL 微調的混合範式。在實際產業應用中,純 BC 幾乎總是不夠的——通常需要 DAgger、資料增強、或後續的 RL 微調來提升效能和魯棒性。
誤讀 2:“模仿學習不需要獎勵函式,所以比 RL 簡單”
糾偏:這是對”簡單”的誤讀。模仿學習確實避免了手動設計獎勵函式,但它引入了新的難題:(a)資料質量極度敏感——“garbage in, garbage out”,專家示範的質量和覆蓋度直接決定了策略的上限;(b)分佈偏移仍然是 BC 系方法的核心瓶頸;(c)如果用 IRL/GAIL,本質上又嵌入了 RL 子問題,計算複雜度並不低。此外,“學習到的獎勵函式”本身的質量取決於示範資料是否充分覆蓋了任務的關鍵狀態。
誤讀 3:“DPO 不是模仿學習,它是 RL 的替代品”
糾偏:DPO 的數學推匯出發點是將 RLHF 中的 RL 最佳化目標進行解析重引數化。從更廣義的視角看,DPO 從人類偏好資料(preference pairs)中隱式學習一個獎勵函式並最佳化策略——這與逆強化學習的精神高度一致。可以說 DPO 是一種”隱式 IRL”或”偏好模仿學習”,它不是獨立於模仿學習的全新範式,而是模仿學習理論架構在大型模型對齊場景中的一個優雅特例。
誤讀 4:“模仿學習無法超越專家”
糾偏:這是一個常見但過於絕對的說法。純 BC 確實無法超越示範資料中隱含的專家水平。但通過以下機制,模仿學習系統可以實現超人類表現:(a)IRL 學到獎勵函式後用更強的 RL 最佳化器搜尋(理論上可以找到比專家更優的策略);(b)多專家示範聚合——彙集多位專家的最優行為片段;(c)模仿學習 + 自我博弈/RL 微調的混合路線。AlphaFold 等系統的訓練中也含有從人類專家資料中學習的成分,但最終超越了人類專家。
學習路徑
入門(建立直覺)
- 綜述文章:Osa et al., “An Algorithmic Perspective on Imitation Learning”(2018)—— 最推薦的入門綜述,覆蓋面廣,數學清晰。
- 部落格:Lilian Weng 的 “Imitation Learning” 部落格(lilianweng.github.io)—— 優秀的一站式入門。
進階(理解核心方法)
- 經典論文:Ross, Gordon, Bagnell, “A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning”(2011)—— DAgger 論文,理解分佈偏移的必讀。
- 經典論文:Ho & Ermon, “Generative Adversarial Imitation Learning”(2016)—— GAIL,理解對抗式模仿學習。
- 前沿論文:Chi et al., “Diffusion Policy: Visuomotor Policy Learning via Action Diffusion”(2023)—— 當前模仿學習最具影響力的新範式之一。
前沿(追蹤產業應用)
- 具身智慧:跟進 Google DeepMind 的 RT 系列、Physical Intelligence 的 π0 系列工作。
- 自動駕駛:關注 Tesla AI Day 分享(公開可用部分)、Wayve 技術部落格。
- LLM 對齊:Rafailov et al., “Direct Preference Optimization”(2023)—— 理解模仿學習思想如何滲透進 LLM 對齊。
- 開源實踐:Hugging Face LeRobot 專案(github.com/huggingface/lerobot)—— 用程式碼理解 ACT、Diffusion Policy 等方法的實際實現。
一句話總結
模仿學習的核心價值在於將”人類示範”直接轉化為”AI 策略”,繞開了獎勵工程的難題;從自動駕駛到人形機器人再到 LLM 對齊,它正在成為連線人類智慧與機器智慧的底層學習範式,而擴散策略等新方法的出現正在突破傳統行為克隆的效能天花板。
延伸閱讀與來源
| 來源 | 說明 |
|---|---|
| [Osa et al., 2018] “An Algorithmic Perspective on Imitation Learning” | 推薦入門綜述 |
| [Ross et al., 2011] DAgger 論文 (AISTATS) | 分佈偏移理論與 DA |