模型層 開放閱讀

軌跡

Trajectory

概念 ID
trajectory
更新時間
2026-05-29
來源數量
待補

軌跡(Trajectory)

3 秒看懂

軌跡 = 智慧代理或系統在時序上的一條完整互動路徑。 在強化學習中是一條 (狀態, 動作, 獎勵) 序列;在自動駕駛中是對未來運動路徑的預測;在擴散模型中是從噪聲到資料的生成路徑。它是連線”單步決策”與”全域性最佳化”的橋樑,也是當前 LLM 強化學習微調(RLHF/GRPO)的核心計算單元。

3 分鐘產業解釋

為什麼”軌跡”突然成為產業熱詞?

2024–2025 年,AI 產業有兩條主線同時將”軌跡”推上中心舞臺:

主線一:LLM 強化學習微調(RL for LLMs)

大語言模型從”預訓練 → SFT → RLHF”的經典範式,演進到 DeepSeek-R1 所代表的”純 RL / GRPO”路徑。在這條路徑中,模型生成的**完整回答(completion)**就是一條”軌跡”——它不再只看單個 token 的 reward,而是對整條軌跡做相對比較。這意味著:

  • 每次訓練迭代需要生成大量完整軌跡
  • 推論階段的算力消耗大幅增加(需要多次 rollout)
  • 軌跡級別的獎勵訊號比 token 級別更稀疏但更”對齊”

主線二:自動駕駛的軌跡預測與規劃

自動駕駛的感知-預測-規劃管線中,“軌跡預測”是核心環節——系統需要為周圍每個交通參與者預測未來 3–8 秒的運動軌跡。端到端自動駕駛(如特斯拉 FSD v12+ 範式)進一步將感知、預測、規劃統一為一個模型的”軌跡輸出”。

產業規模直覺: 僅 LLM RL 微調方向,據行業估算,訓練階段的推論算力消耗可達預訓練的 10%–30% 量級 [行業估算],且隨 GRPO 等軌跡級方法普及,該比例仍在上升。

15 分鐘專家深入

一、軌跡在 LLM 強化學習中的角色

核心問題: 如何讓 LLM 在沒有逐步標註的情況下學會推論?

傳統 RLHF(PPO)的做法:

Prompt → 模型生成完整 response(一條軌跡 τ)
→ Reward Model 對完整 response 打分
→ 通過 PPO 的 GAE(廣義優勢估計)將軌跡級獎勵分配到每個 token
→ 策略梯度更新

DeepSeek 提出的 GRPO 做法更簡潔:

Prompt → 模型生成 G 條完整軌跡 {τ₁, τ₂, ..., τ_G}
→ 對每條軌跡計算 reward(可以是規則化的)
→ 在 G 條軌跡之間做相對比較(組內歸一化)
→ 直接用軌跡級優勢做策略梯度,無需 Critic 網路

關鍵區別:

維度PPO (經典 RLHF)GRPO (DeepSeek-R1)
獎勵分配需要 token-level value function軌跡級相對比較
是否需要 Critic是(額外訓練一個價值網路)否(省去 Critic)
推論開銷每 prompt 生成 1 條軌跡 + Critic 評估每 prompt 生成 G 條軌跡(G 通常 ≥ 8)
獎勵訊號可逐步精細更稀疏但全域性對齊
適用場景有 RM 的人類偏好對齊可驗證任務(程式碼、數學)

軌跡質量的”湧現”效應: 當模型經過足夠多輪軌跡級 RL 訓練後,會出現類似”思維鏈湧現”的現象——模型自發學會在軌跡中插入驗證步驟、回溯、自我糾正。這不是逐步監督出來的,而是軌跡級獎勵篩選出來的 [機制性解釋,非硬資料]。

二、軌跡在自動駕駛中的定義

在自動駕駛語境下,“軌跡”通常指:

  • 運動軌跡(Motion Trajectory): 物體在未來 T 個時間步的 (x, y, θ) 序列,通常以 0.1–0.5 秒為間隔,預測時域 3–8 秒
  • 規劃軌跡(Planning Trajectory): 自車未來行駛的 (x, y, θ, v) 序列,需要滿足動力學約束、碰撞安全、交通規則

技術棧:

感知 → 目標檢測 + 追蹤 → 每個目標的當前狀態
    → 軌跡預測模組 → 輸出多模態軌跡分佈(多條候選)
    → 規劃模組 → 自車軌跡(在候選中選最優/做最佳化)
    → 控制模組 → 執行

端到端範式的變化: 特斯拉 FSD v12 等端到端方案將上述管線壓縮為一個神經網路,直接從感測器輸入對映到規劃軌跡,省去顯式的中間表示。這使得”軌跡”從一箇中間預測目標變成了模型的最終輸出。

三、軌跡在擴散模型/Flow Matching 中的含義

在生成模型領域,“軌跡”指資料從噪聲狀態到目標分佈的變換路徑:

  • 擴散模型(Diffusion): 前向過程逐步加噪形成一條”破壞軌跡”,反向過程學習一條”生成軌跡”
  • Flow Matching: 顯式定義從噪聲到資料的連續軌跡(向量場),比擴散更直接

這裡”軌跡”的物理直覺是:生成過程不是一步到位,而是沿著一條精心設計的路徑”走”過去。


技術原理(最深一層)

1. 強化學習中的軌跡數學定義

軌跡 τ = (s₀, a₀, r₀, s₁, a₁, r₁, ..., s_T, a_T, r_T)

其中:
  s_t ∈ S    狀態空間
  a_t ∈ A    動作空間
  r_t ∈ R    即時獎勵
  T          軌跡長度(LLM 中 = response token 數)

軌跡的回報(return):
  G(τ) = Σ_{t=0}^{T} γ^t · r_t    (γ ∈ [0,1] 為折扣因子)

策略梯度(REINFORCE):
  ∇_θ J(θ) = E_{τ~π_θ} [ Σ_t ∇_θ log π_θ(a_t|s_t) · G_t ]

其中 G_t 為從時刻 t 開始的累積獎勵(return),衡量"從當前狀態開始預期的累積回報"。

2. GRPO 的軌跡級優勢估計

GRPO 核心流程(虛擬碼):

    for each prompt x in batch:
        生成 G 條軌跡: {y₁, y₂, ..., y_G} ~ π_θ_old(·|x)
        計算每條軌跡獎勵: {R₁, R₂, ..., R_G}

        組內歸一化:
            Â_i = (R_i - mean(R)) / std(R)    # 組內相對優勢

        策略梯度更新 (clipped surrogate):
            r_i(θ) = π_θ(y_i|x) / π_θ_old(y_i|x)        # 重要性取樣比率
            L = - 1/G Σ_i min( r_i(θ) · Â_i,
                               clip(r_i(θ), 1-ε, 1+ε) · Â_i )
                + β · KL(π_θ || π_ref)                 # KL 懲罰防過擬合

G 的取值影響:

  • G 越大 → 獎勵估計方差越低 → 但推論成本線性增長
  • 實踐中 G 的取值因任務而異 [具體數值因廠商/論文而異,通常在 4–64 範圍]

3. 自動駕駛軌跡預測的典型架構

輸入: 歷史軌跡序列(每個 agent 過去 N 步的 (x, y))
      HD Map 資訊
      → 編碼器(Transformer / GNN)
      → 多模態解碼器
輸出: K 條候選未來軌跡,每條附機率
      {τ₁, p₁}, {τ₂, p₂}, ..., {τ_K, p_K}
      其中每條 τ_k = {(x₁,y₁), (x₂,y₂), ..., (x_T,y_T)}

常用評價指標:
  - ADE (Average Displacement Error): 平均位移誤差
  - FDE (Final Displacement Error): 終點位移誤差
  - MR (Miss Rate): 漏檢率(終點誤差 > 閾值的比例)

4. 擴散/Flow 中的軌跡

擴散模型(簡化版):

前向軌跡(加噪):
  x_t = √(ᾱ_t) · x₀ + √(1-ᾱ_t) · ε,  ε ~ N(0,I)
  t: 0 → T (乾淨 → 純噪聲)

反向軌跡(生成):
  從 x_T ~ N(0,I) 出發
  逐步去噪: x_{t-1} = f_θ(x_t, t)
  經過 T 步回到 x₀(乾淨資料)

Flow Matching:
  定義從噪聲 p₁ 到資料 p₀ 的連續路徑:
  dx_t = v_θ(x_t, t) dt
  網路 v_θ 學習的是"沿軌跡的速度場"

技術演進史

時間里程碑軌跡概念的關鍵變化
1990s–2000s經典 RL(MDP/SARSA/Q-learning)軌跡 = 單條 episode,用於經驗回放
2015DQN / Deep RL 興起軌跡被切分為 transition 存入 replay buffer,軌跡結構被弱化
2017PPO (OpenAI)重新強調軌跡級採集 + GAE 的 token/step 級分配
2017Social-LSTM / 多智慧代理軌跡預測自動駕駛中軌跡預測成為獨立研究方向
2022InstructGPT / RLHF PipelinePPO 用於 LLM 對齊,軌跡 = 一條完整 response
2022Diffusion Policy (機器人)擴散模型的”生成軌跡”概念引入機器人動作規劃
2023DPO 推出試圖繞過顯式軌跡生成(用偏好對直接最佳化),但隱式依賴軌跡分佈
2024DeepSeek-R1 / GRPO軌跡級組相對最佳化成為主流,去掉 Critic,強調多軌跡對比
2024–2025端到端自動駕駛 (FSD v12+, 華為 ADS 等)感知-預測-規劃統一,軌跡作為端到端輸出
2025軌跡級 Scaling Laws 初探業界開始關注”推論時軌跡生成量”與”模型能力提升”的關係

技術路線對比

LLM RL 微調中的軌跡處理方式對比

方法軌跡使用方式需要 Critic?獎勵粒度推論成本適用任務
PPO (RLHF)採集軌跡 → GAE 分配到 tokenToken-level中(1 條/step + Critic)開放域對齊
GRPO採集 G 條軌跡 → 組內相對Trajectory-level高(G 條/step)可驗證任務
DPO隱式(偏好對隱含軌跡分佈比較)Pair-level低(離線資料)偏好對齊
Rejection Sampling採多條軌跡 → 選最優Trajectory-level高(需大量取樣)簡單場景
RLOO採 K 條 → 每條以其餘 K-1 條為 baselineTrajectory-level高(K 條/step)通用

自動駕駛軌跡預測方法對比

方法型別代表範式輸出形式是否多模態即時性
基於錨點預定義軌跡模板 + 分類離散選擇✅(有限)
基於迴歸直接回歸 (x,y) 序列單條確定性
基於機率分佈CVAE / GAN / Diffusion多條+機率
端到端感知→規劃一體直接規劃軌跡因架構而異

上下游

上游(供給端)                          下游(需求端)
┌─────────────────┐                ┌──────────────────┐
│ 算力基礎設施      │                │ LLM 公司          │
│  · 推論晶片      │──── 軌跡生成 ───│  · OpenAI/DeepSeek │
│  · 高頻寬記憶體    │     算力需求    │  · Meta/Google     │
│  · 網際網路絡      │                │  · Anthropic       │
├─────────────────┤                ├──────────────────┤
│ 資料與模擬       │                │ 自動駕駛           │
│  · 駕駛日誌      │──── 軌跡資料 ───│  · Tesla/Waymo     │
│  · 模擬環境      │     供給       │  · 華為/小鵬/蔚來  │
│  · 合成數據      │                │  · 百度 Apollo      │
├─────────────────┤                ├──────────────────┤
│ 演算法架構         │                │ 機器人             │
│  · RL 架構       │──── 軌跡最佳化 ───│  · Figure/1X       │
│  · 擴散策略      │     方法論      │  · 宇樹/智元       │
│  · vLLM/TRT-LLM │                │  · Tesla Optimus   │
└─────────────────┘                └──────────────────┘

關鍵指標

LLM RL 軌跡最佳化

指標含義量級參考
每 prompt 軌跡生成數 (G)GRPO 的組大小通常 4–64 [視任務/論文而異]
平均軌跡長度response token 數因任務差異大:數學推論可達數千 token
軌跡級獎勵訊號方差衡量獎勵質量與獎勵設計/可驗證性相關
推論算力倍數RL 訓練 vs 純 SFT 的推論消耗比據行業估算可達 5–20× [行業估算]
有效軌跡比例生成軌跡中獲得正向獎勵的比例冷啟動階段可能很低

自動駕駛軌跡預測

指標含義行業基準參考
ADE (m)平均位移誤差前沿模型可達 <1.0m(Argoverse 2 等基準)[基準排行,具體值隨時間變化]
FDE (m)終點位移誤差前沿模型可達 <2.0m [同上]
Miss Rate (%)漏檢率頂級方法 <10% [同上]
推論延遲 (ms)單次預測耗時車端要求通常 <50ms
預測時域 (s)預測未來多遠通常 3–8 秒

供需與市場資料

需求側驅動力

1. LLM RL 微調的推論算力需求爆發

  • 據行業估算,DeepSeek-R1 類純 RL 訓練方案中,訓練階段的推論呼叫量遠超傳統 SFT [行業估算,未有廠商精確揭露]
  • GRPO 等方法要求每步生成多條完整軌跡,推論成本與 G 成正比
  • 這直接拉動了推論晶片、KV Cache 最佳化、推論架構的需求

2. 自動駕駛軌跡預測的規模化部署

  • L4 級自動駕駛的落地程序推動高精度軌跡預測需求
  • 端到端方案對模型容量和推論延遲提出更高要求
  • 據行業估算,全球自動駕駛軟體市場規模在 2025 年處於數百億美元級別 [行業估算,口徑差異大]

3. 具身智慧/機器人軌跡規劃

  • 人形機器人產業興起(Figure、特斯拉 Optimus、國內多家廠商)
  • Diffusion Policy 等基於擴散軌跡的機器人動作生成方案受到關注
  • 仍處於早期,商業化規模有限

供給側約束

  • 推論算力瓶頸: 軌跡級 RL 訓練的推論需求成為新瓶頸,對推論晶片、視訊記憶體容量、批處理效率提出挑戰
  • 軌跡資料質量: 自動駕駛高質量軌跡資料的採集和標註成本高
  • 模擬環境成熟度: 合成軌跡資料的保真度仍是開放問題

代表公司與資本對映

領域代表公司/機構與”軌跡”的關係上市/代表標的(非推薦)
LLM RL 微調DeepSeekGRPO 提出者,軌跡級 RL 標杆未上市(幻方量化旗下)
LLM RL 微調OpenAIPPO-based RLHF 先驅未上市
推論晶片NVIDIA軌跡生成的算力供給方NVDA
推論架構vLLM 社群 / 各大廠自研最佳化軌跡生成效率
自動駕駛(端到端)TeslaFSD 端到端軌跡輸出TSLA
自動駕駛Waymo (Alphabet)軌跡預測研究先驅GOOGL
自動駕駛華為 ADS端到端方案,國內領先華為未上市,相關供應鏈: 賽力斯 (601127.SH) 等
自動駕駛小鵬汽車端到端智駕XPEV / 9868.HK
具身智慧Figure AIDiffusion Policy 軌跡規劃未上市
機器人特斯拉 Optimus人形機器人軌跡規劃TSLA
模擬/資料Wayve世界模型 + 軌跡生成未上市

投資邏輯

邏輯一:推論算力受益(確定性較高)

軌跡級 RL 訓練(GRPO 等)大幅提升訓練階段的推論消耗。這意味著:

  • 推論晶片需求增長的斜率可能被低估
  • 推論最佳化技術(Speculative Decoding、KV Cache 壓縮、MoE 負載均衡)的價值凸顯
  • 關注: NVIDIA(推論卡)、推論架構生態、HBM 供應商

邏輯二:自動駕駛落地加速(中期邏輯)

端到端自動駕駛將”軌跡”從中間輸出變為最終輸出,對模型容量、資料閉環、模擬能力提出更高要求。軌跡預測精度直接關係安全性。

  • 關注: 具備端到端能力的智駕方案商、高算力域控晶片、高質量駕駛資料

邏輯三:具身智慧長期想像空間(早期)

Diffusion Policy 等基於軌跡生成的機器人控制範式正在從學術走向工程化,長期來看”通用軌跡規劃器”可能成為具身智慧的核心能力層。

  • 關注: 仍處於早期追蹤階段,商業化拐點尚遠

風險提示

  • GRPO 等方法對可驗證獎勵的依賴限制了其在開放域任務的應用範圍
  • 端到端自動駕駛的安全驗證仍是開放難題
  • 具身智慧軌跡規劃的 sim-to-real gap 仍大

常見誤讀糾偏

❌ 誤讀一:“GRPO 完全不需要 reward model”

糾偏: GRPO 去掉的是 Critic(價值網路),不是 reward model。DeepSeek-R1 在數學/程式碼等可驗證任務上用規則化獎勵(如答案是否正確)替代了顯式 RM,但這一做法僅適用於有明確驗證標準的任務。對於開放域對齊,仍然需要某種形式的獎勵訊號(可能是 RM,也可能是人類偏好標註)。將”不需要 Critic”混同於”不需要任何獎勵設計”是常見誤解。

❌ 誤讀二:“軌跡級 RL 比 token 級 RL 更優越”

糾偏: 兩者各有適用場景,不存在絕對優劣。軌跡級方法(如 GRPO)在獎勵訊號天然為軌跡級時更自然、更簡潔;但在需要精細信用分配(credit assignment)的場景下,token 級方法(如 PPO + GAE)可能更高效。例如,一個長推論鏈中僅有一步關鍵錯誤時,軌跡級獎勵可能無法精確指出問題所在,而 token 級價值估計可以。具體選擇取決於任務特性。

❌ 誤讀三:“自動駕駛的軌跡預測就是預測一個 (x,y) 序列”

糾偏: 現代軌跡預測系統輸出的是多模態機率分佈——多條候選軌跡,每條附機率值,反映不確定性。單一回歸輸出無法處理”路口處車輛可能左轉也可能直行”這類多模態未來。此外,軌跡預測還需考慮互動性(多智慧代理博弈)、物理約束(車輛動力學)、地圖約束(車道拓撲)等。

❌ 誤讀四:“擴散模型的生成軌跡是隨機的、不可控的”

糾偏: 擴散模型的反向去噪軌跡雖然從隨機噪聲起始,但由學習到的得分函式/速度場引導,是確定性的(給定噪聲和模型引數後軌跡唯一)。通過 Classifier Guidance、Classifier-Free Guidance 等技術,可以顯式控制生成軌跡的方向(如風格、語義條件)。在機器人領域,Diffusion Policy 生成的動作軌跡還需要投影到可行動作空間以滿足物理約束。


學習路徑

入門級(建立直覺)

  1. 強化學習基礎中的軌跡概念: 任意經典 RL 教材(Sutton & Barto)的 MDP/Episode 章節
  2. LLM RLHF 流程概述: InstructGPT 原始論文 (Ouyang et al., 2022),理解 response 作為”軌跡”的角色
  3. 自動駕駛軌跡預測綜述: 搜尋近期 survey paper(如 “Motion Forecasting” 相關綜述),瞭解問題定義和評價指標

進階級(理解機制)

  1. PPO 與 GAE: Schulman et al. (2017) 原始論文,理解軌跡採集 → 優勢估計 → 策略更新的完整流程
  2. GRPO 原理: DeepSeek-Math (Shao et al., 2024) 和 DeepSeek-R1 技術報告,對比 PPO 與 GRPO 的軌跡使用方式差異
  3. Diffusion Policy: Chi et al. (2023),理解擴散模型如何生成機器人動作軌跡
  4. Flow Matching: Lipman et al. (2022),理解連續軌跡的生成範式

專家級(前沿追蹤)

  1. 軌跡級 Scaling Laws: 追蹤 RL for LLMs 領域關於”推論時計算量(trajectory samples)與效能關係”的最新工作
  2. 端到端自動駕駛架構: UniAD (Hu et al., 2023) 等統一感知-預測-規劃的架構
  3. 多智慧代理軌跡博弈: 社會可接受軌跡(Socially Acceptable Trajectory)等互動式預測方向

一句話總結

軌跡是 AI 系統從”單步決策”走向”全域性智慧”的關鍵結構化抽象——在 LLM 中它是強化學習最佳化的基本單元,在自動駕駛中它是安全決策的核心輸出,在生成模型中它是從噪聲到資料的橋樑;理解軌跡,就是理解 AI 如何在時間維度上組織智慧行為。


延伸閱讀與來源

類別推薦資源說明
論文Ouyang et al. (2022), “Training language models to follow instructions with human feedback”RLHF 奠基,理解 response 軌跡的角色
論文Schulman et al. (2017), “Proximal Policy Optimization Algorithms”PPO 原始論文,軌跡採集 + GAE 的經典方法
論文Shao et al. (2024), “DeepSeekMath: Pushing the Limits of Mathematical Reasoning”GRPO 提出,軌跡級相對最佳化
論文DeepSeek-AI (2025), “DeepSeek-R1” 技術報告純 RL 訓練中軌跡級方法的工業級實踐
論文Chi et al. (2023), “Diffusion Policy”擴散模型生成機器人動作軌跡
論文Lipman et al. (2022), “Flow Matching for Generative Modeling”連續軌跡生成範式
論文Hu et al. (2023), “UniAD”統一感知-預測-規劃的自動駕駛架構
資料集Argoverse 2 / nuScenes / Waymo Open Motion自動駕駛軌跡預測標準基準
開源實現OpenRLHF / TRL (Hugging Face)PPO/GRPO 訓練程式碼,可閱讀軌跡取樣與優勢計算實現

資料標註說明: 本文中所有未標註來源的定量資料均為行業估算或定性判斷,不構成投資建議。具體模型引數、效能指標請以各公司官方技術報告/財報為準。

source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型