訓練階段化 (Training Stages)
3 秒看懂
大型模型訓練不是”一鍋端”,而是分階段完成:先學語言基礎(預訓練),再學聽指令(SFT),再學人類偏好(RLHF/DPO),最後可能針對性增強推論/長文本/多模態。每個階段用不同資料、目標函式、學習率策略,前一階段成果是後一階段起點。
3 分鐘產業解釋
為什麼不能一階段搞定?
| 階段 | 核心目標 | 資料特徵 | 訓練時長佔比(定性) |
|---|---|---|---|
| 預訓練 | 學語言知識與世界知識 | 海量無標註文本(萬億 token 級) | 極長(數週至數月) |
| SFT | 學會遵循指令格式 | 高質量指令-回答對(萬至百萬級) | 較短(數小時至數天) |
| RLHF/DPO | 對齊人類偏好與價值觀 | 人類偏好標註對 | 短(數小時至數天) |
| 後訓練增強 | 推論/長上下文/多模態等 | 專項資料 | 視目標而定 |
產業關鍵洞察:
- 成本結構:預訓練佔總算力的絕大部分(>90%[估算]),SFT/RLHF 的算力成本相對較小,但資料質量和演算法設計是決定模型可用性的關鍵
- 迭代邏輯:如果 SFT/RLHF 效果不好,不一定要重做預訓練,可以更換資料或演算法重做對齊階段——這是階段化帶來的工程靈活性
- 競爭壁壘轉移:當基礎預訓練能力趨同時,SFT 資料質量、RLHF 工程能力成為差異化的”最後一公里”
階段化的本質
是將一個不可能的最佳化問題分解為多個可解的子問題:
- 預訓練目標(next-token prediction)與最終使用目標(有幫助、安全、誠實的回答)之間存在 gap
- 每個階段負責縮小一個特定的 gap
- 後一階段在前一階段建置的”能力空間”內做定向調整
15 分鐘專家深入
各階段詳解
階段一:預訓練(Pre-training)
目標:在海量文本上學習語言模型的通用表示,獲得基礎的語言理解、知識儲存和生成能力。
典型做法:
- 目標函式:自迴歸模型用 next-token prediction(如 GPT 系列、LLaMA 系列),雙向模型用 masked LM(如 BERT)
- 資料:網頁、書籍、程式碼、學術論文、維基百科等,經過清洗、去重、質量過濾,規模通常為數萬億 token(具體數字因廠商而異,公開揭露的如 LLaMA 系列提到 1-2T token 量級)
- 訓練時長:取決於模型規模和計算叢集,通常為數週到數月
關鍵超引數:
- 學習率:典型採用 warmup + cosine decay 策略,峰值學習率因模型規模而異
- Batch size:可能逐步增大(如 Chinchilla 相關研究討論過 batch size warmup)
- 序列長度:通常為 2K-8K token(預訓練階段)
產出:Base model(基座模型),具備語言能力但不擅長遵循指令,可能輸出不安全或無用內容。
階段二:監督微調(SFT, Supervised Fine-Tuning)
目標:讓模型學會”遵循指令”的格式和能力——給定一個指令,生成符合期望格式的回答。
典型做法:
- 資料格式:
(instruction, input, output)三元組,或對話格式(user_message, assistant_message) - 資料來源:
- 人工標註(成本高但質量可控)
- 從更強模型蒸餾(如用 GPT-4 生成訓練資料,存在法律和道德爭議)
- 自舉方法(Self-Instruct 等)
- 資料規模:通常為數萬到數百萬條(相對於預訓練資料極小,但質量要求高)
訓練細節:
- 學習率:比預訓練低 1-2 個數量級
- 通常只訓練 1-3 個 epoch,防止過擬合
- 可能只對 output 部分計算 loss(而非整個序列)
產出:SFT model,能夠遵循指令但仍可能輸出偏見、幻覺或不符合人類價值觀的內容。
階段三:偏好對齊(RLHF / DPO / GRPO)
目標:讓模型的輸出符合人類的偏好和價值觀——不僅要正確,還要有幫助、無害、誠實。
RLHF(Reinforcement Learning from Human Feedback)經典流程:
┌─────────────────────────────────────────────────────────────┐
│ Step 1: 訓練獎勵模型 (Reward Model, RM) │
│ - 資料:人類對同一 prompt 多個回答的偏好排序 │
│ - 目標:學習一個標量獎勵函式,預測人類偏好 │
│ - 常用損失:Bradley-Terry model 的對比損失 │
├─────────────────────────────────────────────────────────────┤
│ Step 2: 用 RM 作為獎勵訊號,最佳化策略模型 │
│ - 演算法:PPO(Proximal Policy Optimization)等 │
│ - 加入 KL 懲罰項,防止策略偏離 SFT 模型太遠 │
│ - 目標:max E[R(x,y)] - β · KL(π_θ || π_ref) │
└─────────────────────────────────────────────────────────────┘
DPO(Direct Preference Optimization):
- 直接從偏好資料最佳化策略,無需單獨訓練 RM
- 數學上等價於特定形式的 RLHF,但工程更簡單
- 損失函式直接基於偏好對的機率比
GRPO(Group Relative Policy Optimization):
- DeepSeek 提出的方法 [具體技術細節需參考原論文]
- 用於推論任務的強化學習階段
- 以組內相對排名作為獎勵訊號
產出:對齊後的模型,輸出更符合人類期望。
階段四:後訓練增強(Post-training Enhancement)
這是近年來快速發展的領域,包括多個子方向:
4a. 長上下文擴充套件:
- 問題:預訓練通常用較短序列(如 4K),如何擴充套件到 128K、1M?
- 方法:位置編碼外推/內插(如 RoPE 的 NTK-aware scaling、YaRN)、漸進式訓練
- 可能需要在長文本資料上做額外微調
4b. 推論增強(Reasoning Enhancement):
- 核心思想:讓模型學會”慢思考”——生成中間推論步驟
- Chain-of-Thought(思維鏈)提示是基礎
- 專門的推論訓練可能包括:
- 在包含推論過程的資料上微調
- 使用強化學習最佳化推論路徑(如 DeepSeek-R1 的做法)
- 過程獎勵模型(Process Reward Model, PRM)監督中間步驟
4c. 多模態對齊:
- 將視覺/音訊編碼器與語言模型對接
- 訓練跨模態投影層或介面卡
- 在圖文配對資料上微調
技術原理
核心機制:從預訓練到對齊的資訊流
[預訓練]
海量文本 → Next-Token Prediction → Base Model (學習語言分佈 P(x))
↓ checkpoint
[SFT]
指令-回答對 → 條件生成損失 → SFT Model (學習 P(answer|instruction))
↓ checkpoint
[RLHF/DPO]
人類偏好對 → 獎勵最佳化 / 直接偏好損失 → Aligned Model (學習人類偏好的分佈)
↓ checkpoint
[後訓練]
專項資料 → 專項微調/RL → Enhanced Model (特定能力增強)
關鍵技術細節
1. 學習率排程的階段差異
預訓練階段:
lr
↑
| /‾‾‾‾‾‾‾‾‾‾‾‾‾‾‾‾‾‾‾\
| / \ ← cosine decay
| / \_____
|/________________________________→ steps
[warmup]
SFT 階段:
lr
↑
|____
| \_______ ← 通常為線性 decay 或極小值恆定
| \___
|__________________→ steps
(起始值遠低於預訓練峰值)
RLHF 階段:
lr
↑
|___
| \____ ← 通常更低
| \__
|____________→ steps
2. 損失函式的演進
| 階段 | 典型損失函式 | 核心目標 |
|---|---|---|
| 預訓練 | Cross-entropy (next-token) | 最小化預測分佈與真實 token 的差異 |
| SFT | Cross-entropy (僅對 output) | 模仿標註回答的分佈 |
| Reward Model | Bradley-Terry pairwise loss | 學習偏好排序 |
| RLHF (PPO) | Policy gradient + KL penalty | 最大化獎勵同時保持穩定 |
| DPO | Direct preference loss | 直接從偏好對最佳化 |
3. 資料與算力的分配
訓練成本分佈(定性估計):
╔══════════════════════════════════════════════════════════╗
║ 預訓練 ██████████████████████████████████ >90% ║
║ SFT ███ ║
║ RLHF ██ ║
║ 後訓練增強 █~██ ║
╚══════════════════════════════════════════════════════════╝
計算量: 數月 → 數天 → 數小時 → 視情況
技術演進史
時間線:
2018 BERT: 預訓練 + 下游微調 (兩階段範式建立)
│ GPT-1: 生成式預訓練 + 微調
↓
2019 GPT-2: 發現大規模預訓練可直接 zero-shot,減少微調依賴
↓
2020 GPT-3: In-context learning 發現,提示工程興起
│ (但仍缺乏"遵循指令"能力)
↓
2022 InstructGPT 論文 (OpenAI):
│ 提出 RLHF 三階段範式: 預訓練 → SFT → RLHF
│ ← 里程碑: 訓練階段化範式正式確立
│
│ ChatGPT (GPT-3.5 + RLHF):
│ 階段化訓練的首個大眾成功案例
↓
2023 LLaMA 開源生態、DPO 提出簡化 RLHF
│ 多模態階段化: LLaVA 等
↓
2024 推論增強: o1 (OpenAI) 引入推論鏈
│ 長上下文: 擴充套件至百萬 token
↓
2025 DeepSeek-R1 正式釋出 (2025.01) —— 推論階段的強化學習
- 更多子階段 (如多輪對齊、安全加固)
- 資料合成貫穿各階段
- 持續預訓練成為重要補充
關鍵轉折點
- InstructGPT (2022):確立了”預訓練 → SFT → RLHF”三階段範式,證明小量高質量對齊資料可以大幅改善大型模型可用性
- ChatGPT (2022.11):三階段範式的商業化驗證
- DPO (2023):簡化 RLHF,降低階段化門檻
- 推論增強 (2024-2025):新增專門的推論訓練階段
技術路線對比
階段化策略對比
| 維度 | 經典三階段 (InstructGPT 範式) | DPO 簡化路線 | 含推論增強的四階段 |
|---|---|---|---|
| 階段數 | 3 (預訓練→SFT→RLHF) | 3 (預訓練→SFT→DPO) | 4+ (加推論/長上下文等) |
| 對齊演算法 | PPO + Reward Model | DPO (無需 RM) | PPO/DPO + 推論 RL |
| 工程複雜度 | 高 (需同時維護策略模型、RM、參考模型) | 中 (無需 RM) | 高 |
| 資料需求 | 偏好對 + 標註回答 | 偏好對 | 更多樣化的資料集 |
| 典型代表 | InstructGPT、早期 ChatGPT | Zephyr | DeepSeek-R1、o1 系列 |
| 優勢 | 理論成熟,獎勵訊號靈活 | 工程簡單,訓練穩定 | 推論能力顯著提升 |
| 劣勢 | 訓練不穩定,調參複雜 | 可能不如 RLHF 靈活 | 階段更多,整體成本上升 |
對齊演算法對比
| 演算法 | 是否需要 RM | 是否需要線上取樣 | 訓練穩定性 | 典型應用 |
|---|---|---|---|---|
| PPO (RLHF) | ✅ | ✅ | 較低 | ChatGPT 系列 |
| DPO | ❌ | ❌ | 較高 | LLaMA 2 (部分)、Zephyr |
| GRPO | 視實現 | ✅ | 中 | DeepSeek-R1 |
| KTO | ❌ | ❌ | 高 | 減少配對資料需求 |
注:具體演算法效果對比依賴實驗設定,上表為定性總結
上下游
上游
訓練階段化的上游供應:
┌─────────────────────────────────────────────────────────┐
│ │
│ [資料層] │
│ ├─ 預訓練語料: Common Crawl, 書籍, 程式碼, 學術論文 │
│ ├─ SFT 資料: 人工標註, 模型蒸餾, Self-Instruct │
│ ├─ 偏好資料: 人類標註偏好對 │
│ └─ 專項資料: 數學/程式碼/推論資料集 │
│ │
│ [算力層] │
│ ├─ GPU/加速器: NVIDIA H100/H200, AMD MI300X │
│ ├─ 互聯: NVLink, InfiniBand │
│ └─ 儲存: 高速分散式儲存 │
│ │
│ [架構層] │
│ ├─ 訓練架構: Megatron-LM, DeepSpeed, FSDP │
│ ├─ RLHF 架構: TRL, OpenRLHF, verl │
│ └─ 資料處理: 資料清洗、去重、質量評估工具 │
│ │
│ [基礎設施層] │
│ ├─ 雲端服務: 各大雲端廠商 GPU 叢集 │
│ └─ 叢集管理: 任務排程、容錯 │
│ │
└─────────────────────────────────────────────────────────┘
下游
訓練階段化的下游應用:
┌─────────────────────────────────────────────────────────┐
│ │
│ [直接產出] │
│ ├─ Chat 產品 (ChatGPT, Claude, Gemini) │
│ ├─ 程式碼助手 (Copilot, Cursor) │
│ ├─ 推論增強模型 (o1, DeepSeek-R1) │
│ └─ 多模態助手 (GPT-4V, Gemini) │
│ │
│ [衍生應用] │
│ ├─ Agent 架構 (基於對齊後的模型) │
│ ├─ RAG 系統 │
│ ├─ 行業垂直模型 (金融/醫療/法律微調) │
│ └─ 端側模型 (蒸餾後部署) │
│ │
└─────────────────────────────────────────────────────────┘
關鍵指標
各階段評估指標
| 階段 | 常用評估指標 | 說明 |
|---|---|---|
| 預訓練 | Perplexity (PPL) | 越低越好,衡量語言建模能力 |
| 預訓練 | 下游 benchmark (MMLU, HellaSwag 等) | 零樣本/少樣本能力 |
| SFT | 指令遵循率 | 模型是否按指令格式回答 |
| SFT | 人工評估 / LLM-as-judge | 回答質量綜合評分 |
| RLHF/DPO | Win rate (vs. baseline) | 人類偏好評比中的勝率 |
| RLHF/DPO | Reward model score | 獎勵模型打分(如果使用 RM) |
| RLHF/DPO | KL divergence (vs. reference) | 對齊程度,防止 reward hacking |
| 推論增強 | 數學/邏輯 benchmark (GSM8K, MATH, ARC) | 推論正確率 |
| 推論增強 | 推論鏈質量 | 中間步驟的合理性和準確性 |
訓練成本指標(估算量級)
| 指標 | 預訓練 | SFT | RLHF | 推論增強 |
|---|---|---|---|---|
| GPU 時間 | 數週-數月 | 數小時-數天 | 數小時-數天 | 視規模 |
| 資料量 | 萬億 token | 萬-百萬條 | 萬-百萬對 | 視任務 |
| 標註成本 | 低(可自動) | 中-高 | 高(偏好標註) | 中 |
注:以上為量級估算,具體取決於模型規模、資料量、硬體配置等因素
供需與市場資料
階段化訓練服務市場
供給端:
- 頭部廠商(OpenAI, Anthropic, Google, Meta, 位元組, 阿里等)自建全棧訓練能力
- 第三方訓練平台和工具(如 Anyscale, Modal, Together AI)提供算力和架構支援
- 資料標註公司(Scale AI, Surge 等)提供 SFT 和偏好資料
需求端:
- 基礎模型廠商:需要完整階段化訓練能力
- 垂直行業:通常在開源基座上做 SFT 和可能的 RLHF
- 企業私有化部署:關注 SFT 和安全對齊
市場趨勢(定性判斷):
- 訓練階段化帶來的工具鏈和平台需求增長
- 資料質量服務價值凸顯
- 對齊演算法和工具快速迭代
注:具體市場規模資料未獲得可靠來源,不列出數字
代表公司與資本對映
訓練階段化能力分佈
| 能力層級 | 代表公司 | 特點 |
|---|---|---|
| 全棧自研 (預訓練→對齊) | OpenAI, Anthropic, Google DeepMind, Meta AI | 擁有完整階段化能力,自研演算法 |
| 全棧自研 (中國) | 位元組 (豆包), 阿里 (通義), DeepSeek, 智譜 | 國內頭部,快速迭代 |
| 開源基座 + 定製對齊 | 眾多中小廠商、垂直行業公司 | 基於 LLaMA/Qwen 等開源模型做 SFT/RLHF |
| 工具鏈/平台 | Anyscale, Modal, Together AI, Hugging Face | 提供訓練架構、算力平台 |
| 資料服務 | Scale AI, Surge AI | 提供高質量 SFT 和偏好資料 |
關鍵技術專利/論文來源
- RLHF 範式: OpenAI (InstructGPT 論文, 2022)
- DPO: Stanford (2023)
- DeepSeek-R1 訓練範式: DeepSeek (2025)
- LLaMA 系列: Meta (2023-2024)
投資邏輯
核心觀點
-
階段化訓練 = 大型模型能力的”生產流程”
- 理解階段化就是理解大型模型是怎麼造出來的
- 每個階段都有對應的供應商和服務機會
-
投資機會分層:
高確定性 (剛需):
├─ 算力供應 (GPU, 雲端服務) —— 各階段都需要
├─ 資料服務 (高質量標註) —— SFT/RLHF 的關鍵瓶頸
└─ 訓練架構/平台 —— 工程化必需
中等確定性 (趨勢性):
├─ 對齊演算法/工具 —— 技術快速迭代,格局未定
├─ 推論增強訓練 —— 新方向,價值待驗證
└─ 合成數據 —— 可能改變資料供給結構
低確定性 (遠期):
├─ 自動化訓練流程 (Auto-Training)
└─ 新範式替代階段化
- 關鍵風險:
- 如果出現新的訓練範式替代階段化,現有產業鏈可能重構
- 對齊演算法技術路線不確定(RLHF vs DPO vs 新方法)
- 開源模型能力追趕可能壓縮閉源模型的獲利空間
常見誤讀糾偏
誤讀一:“SFT 是訓練階段化中最關鍵的”
糾偏:
- 預訓練決定了模型能力的上限(知識量、推論基礎)
- SFT/RLHF 是在預訓練基礎上做方向調整,不能創造預訓練中不存在的能力
- 類比:預訓練是”上學讀書”,SFT/RLHF 是”面試培訓”——沒有前者,後者無從談起
- 從成本角度,預訓練佔據絕大部分算力投入
誤讀二:“DPO 完全取代了 RLHF”
糾偏:
- DPO 確實簡化了工程流程(無需訓練 RM),但並非嚴格優於 RLHF
- RLHF 使用獨立的 RM 和線上取樣,在某些場景下可能更靈活
- 兩者各有適用場景,目前業界兩者都有使用,未出現一方完全取代另一方的趨勢
- GRPO 等新方法也在探索中,格局仍在演進
誤讀三:“訓練階段化是固定的三步”
糾偏:
- 三階段(預訓練→SFT→RLHF)是基礎範式,但實際操作中遠比這複雜
- 可能包含多輪迭代(如 SFT→RLHF→再SFT→再RLHF)
- 後訓練階段(推論增強、長上下文等)已成為標配第四階段甚至更多
- 不同廠商的具體流程差異很大,階段劃分並非標準化的
誤讀四:“用更強模型蒸餾 SFT 資料就能得到好模型”
糾偏:
- 蒸餾可以提升指令遵循能力,但無法超越教師模型的能力上限
- 存在法律和倫理問題(如用 GPT-4 輸出訓練競品模型)
- 蒸餾資料可能存在系統性偏差
- 好的 SFT 資料需要多樣性和任務覆蓋,不是簡單的”好模型生成 = 好資料”
學習路徑
入門路徑(建立直覺)
Step 1: 理解單階段訓練
→ 學習語言模型基礎 (next-token prediction)
→ 跑一個簡單 LM 訓練程式碼
Step 2: 理解為什麼需要 SFT
→ 對比 base model vs. chat model 的行為差異
→ 瞭解 instruction tuning 的概念
Step 3: 理解 RLHF/DPO 的動機
→ 閱讀 InstructGPT 論文的核心思想
→ 理解"偏好"是如何被學習的
Step 4: 動手實踐
→ 使用 Hugging Face TRL 庫跑一個簡單的 SFT + DPO 流程
→ 觀察各階段模型行為的變化
進階路徑(深入機制)
Step 5: 精讀經典論文
→ InstructGPT (2022): 訓練階段化範式奠基
→ DPO (2023): 簡化對齊
→ LLaMA 2 (2023): 開源階段化實踐
→ DeepSeek-R1 (2025): 推論增強階段
Step 6: 理解工程細節
→ 學習 Megatron-LM / DeepSpeed 的分散式訓練
→ 瞭解 PPO 的實現細節
→ 學習資料清洗和質量評估方法
Step 7: 關注前沿
→ 追蹤對齊演算法新進展
→ 關注推論增強和多模態階段化
→ 瞭解合成數據在各階段的應用
推薦資源
| 型別 | 資源 | 說明 |
|---|---|---|
| 論文 | InstructGPT (Ouyang et al., 2022) | 階段化範式奠基 |
| 論文 | DPO (Rafailov et al., 2023) | 簡化對齊方法 |
| 論文 | DeepSeek-R1 (2025) | 推論增強階段化 |
| 程式碼庫 | Hugging Face TRL | 實用的階段化訓練工具 |
| 程式碼庫 | OpenRLHF | RLHF 訓練架構 |
| 課程 | Stanford CS224N / CS324 | NLP 和 LLM 基礎 |
一句話總結
訓練階段化是將大型模型從”會說話的鸚鵡”變為”有幫助的助手”的工程方法論——通過預訓練學知識、SFT 學格式、RLHF 學偏好、後訓練學專項能力,分階段降低最佳化難度,是當前大型模型生產的核心流程。
延伸閱讀與來源
核心論文
- Ouyang et al., “Training language models to follow instructions with human feedback” (InstructGPT), 2022. — 確立 RLHF 三階段範式
- Rafailov et al., “Direct Preference Optimization: Your Language Model is Secretly a Reward Model” (DPO), 2023. — 簡化對齊方法
- Touvron et al., “LLaMA 2: Open Foundation and Fine-Tuned Chat Models”, 2023. — 開源階段化實踐
- DeepSeek-AI, “DeepSeek-R1”, 2025. — 推論增強階段化
技術部落格與資料
- Hugging Face TRL 文件: https://huggingface.co/docs/trl
- Anthropic 研究部落格關於 RLHF 的討論
- OpenAI 關於 InstructGPT 的技術報告
資料來源宣告
- 本文中涉及的具體數字(模型引數量、訓練 token 數等)來自廠商公開揭露,未標註來源的為定性描述或估算
- 訓練成本、市場規模等敏感資料未獲得充分公開來源,以定性描述為主
- 技術演進時間線基於公開論文和產品釋出記錄
本頁基於公開論文、技術報告和行業共識撰寫。訓練階段化是快速演進的領域,具體實踐因廠商而異,建議以最新論文和官方技術報告為準。