模型層 開放閱讀

訓練階段化

Training Stages

概念 ID
training-stages
更新時間
2026-05-29
來源數量
待補

訓練階段化 (Training Stages)

3 秒看懂

大型模型訓練不是”一鍋端”,而是分階段完成:先學語言基礎(預訓練),再學聽指令(SFT),再學人類偏好(RLHF/DPO),最後可能針對性增強推論/長文本/多模態。每個階段用不同資料、目標函式、學習率策略,前一階段成果是後一階段起點。

3 分鐘產業解釋

為什麼不能一階段搞定?

階段核心目標資料特徵訓練時長佔比(定性)
預訓練學語言知識與世界知識海量無標註文本(萬億 token 級)極長(數週至數月)
SFT學會遵循指令格式高質量指令-回答對(萬至百萬級)較短(數小時至數天)
RLHF/DPO對齊人類偏好與價值觀人類偏好標註對短(數小時至數天)
後訓練增強推論/長上下文/多模態等專項資料視目標而定

產業關鍵洞察

  • 成本結構:預訓練佔總算力的絕大部分(>90%[估算]),SFT/RLHF 的算力成本相對較小,但資料質量和演算法設計是決定模型可用性的關鍵
  • 迭代邏輯:如果 SFT/RLHF 效果不好,不一定要重做預訓練,可以更換資料或演算法重做對齊階段——這是階段化帶來的工程靈活性
  • 競爭壁壘轉移:當基礎預訓練能力趨同時,SFT 資料質量、RLHF 工程能力成為差異化的”最後一公里”

階段化的本質

將一個不可能的最佳化問題分解為多個可解的子問題

  • 預訓練目標(next-token prediction)與最終使用目標(有幫助、安全、誠實的回答)之間存在 gap
  • 每個階段負責縮小一個特定的 gap
  • 後一階段在前一階段建置的”能力空間”內做定向調整

15 分鐘專家深入

各階段詳解

階段一:預訓練(Pre-training)

目標:在海量文本上學習語言模型的通用表示,獲得基礎的語言理解、知識儲存和生成能力。

典型做法

  • 目標函式:自迴歸模型用 next-token prediction(如 GPT 系列、LLaMA 系列),雙向模型用 masked LM(如 BERT)
  • 資料:網頁、書籍、程式碼、學術論文、維基百科等,經過清洗、去重、質量過濾,規模通常為數萬億 token(具體數字因廠商而異,公開揭露的如 LLaMA 系列提到 1-2T token 量級)
  • 訓練時長:取決於模型規模和計算叢集,通常為數週到數月

關鍵超引數

  • 學習率:典型採用 warmup + cosine decay 策略,峰值學習率因模型規模而異
  • Batch size:可能逐步增大(如 Chinchilla 相關研究討論過 batch size warmup)
  • 序列長度:通常為 2K-8K token(預訓練階段)

產出:Base model(基座模型),具備語言能力但不擅長遵循指令,可能輸出不安全或無用內容。

階段二:監督微調(SFT, Supervised Fine-Tuning)

目標:讓模型學會”遵循指令”的格式和能力——給定一個指令,生成符合期望格式的回答。

典型做法

  • 資料格式(instruction, input, output) 三元組,或對話格式 (user_message, assistant_message)
  • 資料來源
    • 人工標註(成本高但質量可控)
    • 從更強模型蒸餾(如用 GPT-4 生成訓練資料,存在法律和道德爭議)
    • 自舉方法(Self-Instruct 等)
  • 資料規模:通常為數萬到數百萬條(相對於預訓練資料極小,但質量要求高)

訓練細節

  • 學習率:比預訓練低 1-2 個數量級
  • 通常只訓練 1-3 個 epoch,防止過擬合
  • 可能只對 output 部分計算 loss(而非整個序列)

產出:SFT model,能夠遵循指令但仍可能輸出偏見、幻覺或不符合人類價值觀的內容。

階段三:偏好對齊(RLHF / DPO / GRPO)

目標:讓模型的輸出符合人類的偏好和價值觀——不僅要正確,還要有幫助、無害、誠實。

RLHF(Reinforcement Learning from Human Feedback)經典流程

┌─────────────────────────────────────────────────────────────┐
│  Step 1: 訓練獎勵模型 (Reward Model, RM)                      │
│  - 資料:人類對同一 prompt 多個回答的偏好排序                    │
│  - 目標:學習一個標量獎勵函式,預測人類偏好                      │
│  - 常用損失:Bradley-Terry model 的對比損失                     │
├─────────────────────────────────────────────────────────────┤
│  Step 2: 用 RM 作為獎勵訊號,最佳化策略模型                       │
│  - 演算法:PPO(Proximal Policy Optimization)等               │
│  - 加入 KL 懲罰項,防止策略偏離 SFT 模型太遠                    │
│  - 目標:max E[R(x,y)] - β · KL(π_θ || π_ref)               │
└─────────────────────────────────────────────────────────────┘

DPO(Direct Preference Optimization)

  • 直接從偏好資料最佳化策略,無需單獨訓練 RM
  • 數學上等價於特定形式的 RLHF,但工程更簡單
  • 損失函式直接基於偏好對的機率比

GRPO(Group Relative Policy Optimization)

  • DeepSeek 提出的方法 [具體技術細節需參考原論文]
  • 用於推論任務的強化學習階段
  • 以組內相對排名作為獎勵訊號

產出:對齊後的模型,輸出更符合人類期望。

階段四:後訓練增強(Post-training Enhancement)

這是近年來快速發展的領域,包括多個子方向:

4a. 長上下文擴充套件

  • 問題:預訓練通常用較短序列(如 4K),如何擴充套件到 128K、1M?
  • 方法:位置編碼外推/內插(如 RoPE 的 NTK-aware scaling、YaRN)、漸進式訓練
  • 可能需要在長文本資料上做額外微調

4b. 推論增強(Reasoning Enhancement)

  • 核心思想:讓模型學會”慢思考”——生成中間推論步驟
  • Chain-of-Thought(思維鏈)提示是基礎
  • 專門的推論訓練可能包括:
    • 在包含推論過程的資料上微調
    • 使用強化學習最佳化推論路徑(如 DeepSeek-R1 的做法)
    • 過程獎勵模型(Process Reward Model, PRM)監督中間步驟

4c. 多模態對齊

  • 將視覺/音訊編碼器與語言模型對接
  • 訓練跨模態投影層或介面卡
  • 在圖文配對資料上微調

技術原理

核心機制:從預訓練到對齊的資訊流

[預訓練]
海量文本 → Next-Token Prediction → Base Model (學習語言分佈 P(x))

         ↓ checkpoint

[SFT]
指令-回答對 → 條件生成損失 → SFT Model (學習 P(answer|instruction))

         ↓ checkpoint

[RLHF/DPO]
人類偏好對 → 獎勵最佳化 / 直接偏好損失 → Aligned Model (學習人類偏好的分佈)

         ↓ checkpoint

[後訓練]
專項資料 → 專項微調/RL → Enhanced Model (特定能力增強)

關鍵技術細節

1. 學習率排程的階段差異

預訓練階段:
  lr

  |   /‾‾‾‾‾‾‾‾‾‾‾‾‾‾‾‾‾‾‾\
  |  /                       \  ← cosine decay
  | /                         \_____
  |/________________________________→ steps
  [warmup]

SFT 階段:
  lr

  |____
  |    \_______  ← 通常為線性 decay 或極小值恆定
  |            \___
  |__________________→ steps
  (起始值遠低於預訓練峰值)

RLHF 階段:
  lr

  |___
  |   \____  ← 通常更低
  |        \__
  |____________→ steps

2. 損失函式的演進

階段典型損失函式核心目標
預訓練Cross-entropy (next-token)最小化預測分佈與真實 token 的差異
SFTCross-entropy (僅對 output)模仿標註回答的分佈
Reward ModelBradley-Terry pairwise loss學習偏好排序
RLHF (PPO)Policy gradient + KL penalty最大化獎勵同時保持穩定
DPODirect preference loss直接從偏好對最佳化

3. 資料與算力的分配

訓練成本分佈(定性估計):
╔══════════════════════════════════════════════════════════╗
║ 預訓練        ██████████████████████████████████  >90%    ║
║ SFT           ███                                    ║
║ RLHF          ██                                     ║
║ 後訓練增強     █~██                                   ║
╚══════════════════════════════════════════════════════════╝
  計算量: 數月 → 數天 → 數小時 → 視情況

技術演進史

時間線:
2018        BERT: 預訓練 + 下游微調 (兩階段範式建立)
  │         GPT-1: 生成式預訓練 + 微調

2019        GPT-2: 發現大規模預訓練可直接 zero-shot,減少微調依賴

2020        GPT-3: In-context learning 發現,提示工程興起
  │         (但仍缺乏"遵循指令"能力)

2022        InstructGPT 論文 (OpenAI): 
  │         提出 RLHF 三階段範式: 預訓練 → SFT → RLHF
  │         ← 里程碑: 訓練階段化範式正式確立

  │         ChatGPT (GPT-3.5 + RLHF): 
  │         階段化訓練的首個大眾成功案例

2023        LLaMA 開源生態、DPO 提出簡化 RLHF
  │         多模態階段化: LLaVA 等

2024        推論增強: o1 (OpenAI) 引入推論鏈
  │         長上下文: 擴充套件至百萬 token

2025        DeepSeek-R1 正式釋出 (2025.01) —— 推論階段的強化學習
            - 更多子階段 (如多輪對齊、安全加固)
            - 資料合成貫穿各階段
            - 持續預訓練成為重要補充

關鍵轉折點

  • InstructGPT (2022):確立了”預訓練 → SFT → RLHF”三階段範式,證明小量高質量對齊資料可以大幅改善大型模型可用性
  • ChatGPT (2022.11):三階段範式的商業化驗證
  • DPO (2023):簡化 RLHF,降低階段化門檻
  • 推論增強 (2024-2025):新增專門的推論訓練階段

技術路線對比

階段化策略對比

維度經典三階段 (InstructGPT 範式)DPO 簡化路線含推論增強的四階段
階段數3 (預訓練→SFT→RLHF)3 (預訓練→SFT→DPO)4+ (加推論/長上下文等)
對齊演算法PPO + Reward ModelDPO (無需 RM)PPO/DPO + 推論 RL
工程複雜度高 (需同時維護策略模型、RM、參考模型)中 (無需 RM)
資料需求偏好對 + 標註回答偏好對更多樣化的資料集
典型代表InstructGPT、早期 ChatGPTZephyrDeepSeek-R1、o1 系列
優勢理論成熟,獎勵訊號靈活工程簡單,訓練穩定推論能力顯著提升
劣勢訓練不穩定,調參複雜可能不如 RLHF 靈活階段更多,整體成本上升

對齊演算法對比

演算法是否需要 RM是否需要線上取樣訓練穩定性典型應用
PPO (RLHF)較低ChatGPT 系列
DPO較高LLaMA 2 (部分)、Zephyr
GRPO視實現DeepSeek-R1
KTO減少配對資料需求

注:具體演算法效果對比依賴實驗設定,上表為定性總結


上下游

上游

訓練階段化的上游供應:
┌─────────────────────────────────────────────────────────┐
│                                                         │
│  [資料層]                                               │
│   ├─ 預訓練語料: Common Crawl, 書籍, 程式碼, 學術論文     │
│   ├─ SFT 資料: 人工標註, 模型蒸餾, Self-Instruct       │
│   ├─ 偏好資料: 人類標註偏好對                           │
│   └─ 專項資料: 數學/程式碼/推論資料集                      │
│                                                         │
│  [算力層]                                               │
│   ├─ GPU/加速器: NVIDIA H100/H200, AMD MI300X          │
│   ├─ 互聯: NVLink, InfiniBand                          │
│   └─ 儲存: 高速分散式儲存                               │
│                                                         │
│  [架構層]                                               │
│   ├─ 訓練架構: Megatron-LM, DeepSpeed, FSDP            │
│   ├─ RLHF 架構: TRL, OpenRLHF, verl                   │
│   └─ 資料處理: 資料清洗、去重、質量評估工具              │
│                                                         │
│  [基礎設施層]                                           │
│   ├─ 雲端服務: 各大雲端廠商 GPU 叢集                        │
│   └─ 叢集管理: 任務排程、容錯                           │
│                                                         │
└─────────────────────────────────────────────────────────┘

下游

訓練階段化的下游應用:
┌─────────────────────────────────────────────────────────┐
│                                                         │
│  [直接產出]                                             │
│   ├─ Chat 產品 (ChatGPT, Claude, Gemini)               │
│   ├─ 程式碼助手 (Copilot, Cursor)                        │
│   ├─ 推論增強模型 (o1, DeepSeek-R1)                    │
│   └─ 多模態助手 (GPT-4V, Gemini)                       │
│                                                         │
│  [衍生應用]                                             │
│   ├─ Agent 架構 (基於對齊後的模型)                      │
│   ├─ RAG 系統                                           │
│   ├─ 行業垂直模型 (金融/醫療/法律微調)                  │
│   └─ 端側模型 (蒸餾後部署)                             │
│                                                         │
└─────────────────────────────────────────────────────────┘

關鍵指標

各階段評估指標

階段常用評估指標說明
預訓練Perplexity (PPL)越低越好,衡量語言建模能力
預訓練下游 benchmark (MMLU, HellaSwag 等)零樣本/少樣本能力
SFT指令遵循率模型是否按指令格式回答
SFT人工評估 / LLM-as-judge回答質量綜合評分
RLHF/DPOWin rate (vs. baseline)人類偏好評比中的勝率
RLHF/DPOReward model score獎勵模型打分(如果使用 RM)
RLHF/DPOKL divergence (vs. reference)對齊程度,防止 reward hacking
推論增強數學/邏輯 benchmark (GSM8K, MATH, ARC)推論正確率
推論增強推論鏈質量中間步驟的合理性和準確性

訓練成本指標(估算量級)

指標預訓練SFTRLHF推論增強
GPU 時間數週-數月數小時-數天數小時-數天視規模
資料量萬億 token萬-百萬條萬-百萬對視任務
標註成本低(可自動)中-高高(偏好標註)

注:以上為量級估算,具體取決於模型規模、資料量、硬體配置等因素


供需與市場資料

階段化訓練服務市場

供給端

  • 頭部廠商(OpenAI, Anthropic, Google, Meta, 位元組, 阿里等)自建全棧訓練能力
  • 第三方訓練平台和工具(如 Anyscale, Modal, Together AI)提供算力和架構支援
  • 資料標註公司(Scale AI, Surge 等)提供 SFT 和偏好資料

需求端

  • 基礎模型廠商:需要完整階段化訓練能力
  • 垂直行業:通常在開源基座上做 SFT 和可能的 RLHF
  • 企業私有化部署:關注 SFT 和安全對齊

市場趨勢(定性判斷)

  • 訓練階段化帶來的工具鏈和平台需求增長
  • 資料質量服務價值凸顯
  • 對齊演算法和工具快速迭代

注:具體市場規模資料未獲得可靠來源,不列出數字


代表公司與資本對映

訓練階段化能力分佈

能力層級代表公司特點
全棧自研 (預訓練→對齊)OpenAI, Anthropic, Google DeepMind, Meta AI擁有完整階段化能力,自研演算法
全棧自研 (中國)位元組 (豆包), 阿里 (通義), DeepSeek, 智譜國內頭部,快速迭代
開源基座 + 定製對齊眾多中小廠商、垂直行業公司基於 LLaMA/Qwen 等開源模型做 SFT/RLHF
工具鏈/平台Anyscale, Modal, Together AI, Hugging Face提供訓練架構、算力平台
資料服務Scale AI, Surge AI提供高質量 SFT 和偏好資料

關鍵技術專利/論文來源

  • RLHF 範式: OpenAI (InstructGPT 論文, 2022)
  • DPO: Stanford (2023)
  • DeepSeek-R1 訓練範式: DeepSeek (2025)
  • LLaMA 系列: Meta (2023-2024)

投資邏輯

核心觀點

  1. 階段化訓練 = 大型模型能力的”生產流程”

    • 理解階段化就是理解大型模型是怎麼造出來的
    • 每個階段都有對應的供應商和服務機會
  2. 投資機會分層

高確定性 (剛需):
├─ 算力供應 (GPU, 雲端服務) —— 各階段都需要
├─ 資料服務 (高質量標註) —— SFT/RLHF 的關鍵瓶頸
└─ 訓練架構/平台 —— 工程化必需

中等確定性 (趨勢性):
├─ 對齊演算法/工具 —— 技術快速迭代,格局未定
├─ 推論增強訓練 —— 新方向,價值待驗證
└─ 合成數據 —— 可能改變資料供給結構

低確定性 (遠期):
├─ 自動化訓練流程 (Auto-Training)
└─ 新範式替代階段化
  1. 關鍵風險
    • 如果出現新的訓練範式替代階段化,現有產業鏈可能重構
    • 對齊演算法技術路線不確定(RLHF vs DPO vs 新方法)
    • 開源模型能力追趕可能壓縮閉源模型的獲利空間

常見誤讀糾偏

誤讀一:“SFT 是訓練階段化中最關鍵的”

糾偏

  • 預訓練決定了模型能力的上限(知識量、推論基礎)
  • SFT/RLHF 是在預訓練基礎上做方向調整,不能創造預訓練中不存在的能力
  • 類比:預訓練是”上學讀書”,SFT/RLHF 是”面試培訓”——沒有前者,後者無從談起
  • 從成本角度,預訓練佔據絕大部分算力投入

誤讀二:“DPO 完全取代了 RLHF”

糾偏

  • DPO 確實簡化了工程流程(無需訓練 RM),但並非嚴格優於 RLHF
  • RLHF 使用獨立的 RM 和線上取樣,在某些場景下可能更靈活
  • 兩者各有適用場景,目前業界兩者都有使用,未出現一方完全取代另一方的趨勢
  • GRPO 等新方法也在探索中,格局仍在演進

誤讀三:“訓練階段化是固定的三步”

糾偏

  • 三階段(預訓練→SFT→RLHF)是基礎範式,但實際操作中遠比這複雜
  • 可能包含多輪迭代(如 SFT→RLHF→再SFT→再RLHF)
  • 後訓練階段(推論增強、長上下文等)已成為標配第四階段甚至更多
  • 不同廠商的具體流程差異很大,階段劃分並非標準化的

誤讀四:“用更強模型蒸餾 SFT 資料就能得到好模型”

糾偏

  • 蒸餾可以提升指令遵循能力,但無法超越教師模型的能力上限
  • 存在法律和倫理問題(如用 GPT-4 輸出訓練競品模型)
  • 蒸餾資料可能存在系統性偏差
  • 好的 SFT 資料需要多樣性和任務覆蓋,不是簡單的”好模型生成 = 好資料”

學習路徑

入門路徑(建立直覺)

Step 1: 理解單階段訓練
        → 學習語言模型基礎 (next-token prediction)
        → 跑一個簡單 LM 訓練程式碼

Step 2: 理解為什麼需要 SFT
        → 對比 base model vs. chat model 的行為差異
        → 瞭解 instruction tuning 的概念

Step 3: 理解 RLHF/DPO 的動機
        → 閱讀 InstructGPT 論文的核心思想
        → 理解"偏好"是如何被學習的

Step 4: 動手實踐
        → 使用 Hugging Face TRL 庫跑一個簡單的 SFT + DPO 流程
        → 觀察各階段模型行為的變化

進階路徑(深入機制)

Step 5: 精讀經典論文
        → InstructGPT (2022): 訓練階段化範式奠基
        → DPO (2023): 簡化對齊
        → LLaMA 2 (2023): 開源階段化實踐
        → DeepSeek-R1 (2025): 推論增強階段

Step 6: 理解工程細節
        → 學習 Megatron-LM / DeepSpeed 的分散式訓練
        → 瞭解 PPO 的實現細節
        → 學習資料清洗和質量評估方法

Step 7: 關注前沿
        → 追蹤對齊演算法新進展
        → 關注推論增強和多模態階段化
        → 瞭解合成數據在各階段的應用

推薦資源

型別資源說明
論文InstructGPT (Ouyang et al., 2022)階段化範式奠基
論文DPO (Rafailov et al., 2023)簡化對齊方法
論文DeepSeek-R1 (2025)推論增強階段化
程式碼庫Hugging Face TRL實用的階段化訓練工具
程式碼庫OpenRLHFRLHF 訓練架構
課程Stanford CS224N / CS324NLP 和 LLM 基礎

一句話總結

訓練階段化是將大型模型從”會說話的鸚鵡”變為”有幫助的助手”的工程方法論——通過預訓練學知識、SFT 學格式、RLHF 學偏好、後訓練學專項能力,分階段降低最佳化難度,是當前大型模型生產的核心流程。


延伸閱讀與來源

核心論文

  • Ouyang et al., “Training language models to follow instructions with human feedback” (InstructGPT), 2022. — 確立 RLHF 三階段範式
  • Rafailov et al., “Direct Preference Optimization: Your Language Model is Secretly a Reward Model” (DPO), 2023. — 簡化對齊方法
  • Touvron et al., “LLaMA 2: Open Foundation and Fine-Tuned Chat Models”, 2023. — 開源階段化實踐
  • DeepSeek-AI, “DeepSeek-R1”, 2025. — 推論增強階段化

技術部落格與資料

資料來源宣告

  • 本文中涉及的具體數字(模型引數量、訓練 token 數等)來自廠商公開揭露,未標註來源的為定性描述或估算
  • 訓練成本、市場規模等敏感資料未獲得充分公開來源,以定性描述為主
  • 技術演進時間線基於公開論文和產品釋出記錄

本頁基於公開論文、技術報告和行業共識撰寫。訓練階段化是快速演進的領域,具體實踐因廠商而異,建議以最新論文和官方技術報告為準。

source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型