模型层 开放阅读

训练阶段化

Training Stages

概念 ID
training-stages
更新时间
2026-05-29
来源数量
待补

训练阶段化 (Training Stages)

3 秒看懂

大模型训练不是”一锅端”,而是分阶段完成:先学语言基础(预训练),再学听指令(SFT),再学人类偏好(RLHF/DPO),最后可能针对性增强推理/长文本/多模态。每个阶段用不同数据、目标函数、学习率策略,前一阶段成果是后一阶段起点。

3 分钟产业解释

为什么不能一阶段搞定?

阶段核心目标数据特征训练时长占比(定性)
预训练学语言知识与世界知识海量无标注文本(万亿 token 级)极长(数周至数月)
SFT学会遵循指令格式高质量指令-回答对(万至百万级)较短(数小时至数天)
RLHF/DPO对齐人类偏好与价值观人类偏好标注对短(数小时至数天)
后训练增强推理/长上下文/多模态等专项数据视目标而定

产业关键洞察

  • 成本结构:预训练占总算力的绝大部分(>90%[估算]),SFT/RLHF 的算力成本相对较小,但数据质量和算法设计是决定模型可用性的关键
  • 迭代逻辑:如果 SFT/RLHF 效果不好,不一定要重做预训练,可以更换数据或算法重做对齐阶段——这是阶段化带来的工程灵活性
  • 竞争壁垒转移:当基础预训练能力趋同时,SFT 数据质量、RLHF 工程能力成为差异化的”最后一公里”

阶段化的本质

将一个不可能的优化问题分解为多个可解的子问题

  • 预训练目标(next-token prediction)与最终使用目标(有帮助、安全、诚实的回答)之间存在 gap
  • 每个阶段负责缩小一个特定的 gap
  • 后一阶段在前一阶段构建的”能力空间”内做定向调整

15 分钟专家深入

各阶段详解

阶段一:预训练(Pre-training)

目标:在海量文本上学习语言模型的通用表示,获得基础的语言理解、知识存储和生成能力。

典型做法

  • 目标函数:自回归模型用 next-token prediction(如 GPT 系列、LLaMA 系列),双向模型用 masked LM(如 BERT)
  • 数据:网页、书籍、代码、学术论文、维基百科等,经过清洗、去重、质量过滤,规模通常为数万亿 token(具体数字因厂商而异,公开披露的如 LLaMA 系列提到 1-2T token 量级)
  • 训练时长:取决于模型规模和计算集群,通常为数周到数月

关键超参数

  • 学习率:典型采用 warmup + cosine decay 策略,峰值学习率因模型规模而异
  • Batch size:可能逐步增大(如 Chinchilla 相关研究讨论过 batch size warmup)
  • 序列长度:通常为 2K-8K token(预训练阶段)

产出:Base model(基座模型),具备语言能力但不擅长遵循指令,可能输出不安全或无用内容。

阶段二:监督微调(SFT, Supervised Fine-Tuning)

目标:让模型学会”遵循指令”的格式和能力——给定一个指令,生成符合期望格式的回答。

典型做法

  • 数据格式(instruction, input, output) 三元组,或对话格式 (user_message, assistant_message)
  • 数据来源
    • 人工标注(成本高但质量可控)
    • 从更强模型蒸馏(如用 GPT-4 生成训练数据,存在法律和道德争议)
    • 自举方法(Self-Instruct 等)
  • 数据规模:通常为数万到数百万条(相对于预训练数据极小,但质量要求高)

训练细节

  • 学习率:比预训练低 1-2 个数量级
  • 通常只训练 1-3 个 epoch,防止过拟合
  • 可能只对 output 部分计算 loss(而非整个序列)

产出:SFT model,能够遵循指令但仍可能输出偏见、幻觉或不符合人类价值观的内容。

阶段三:偏好对齐(RLHF / DPO / GRPO)

目标:让模型的输出符合人类的偏好和价值观——不仅要正确,还要有帮助、无害、诚实。

RLHF(Reinforcement Learning from Human Feedback)经典流程

┌─────────────────────────────────────────────────────────────┐
│  Step 1: 训练奖励模型 (Reward Model, RM)                      │
│  - 数据:人类对同一 prompt 多个回答的偏好排序                    │
│  - 目标:学习一个标量奖励函数,预测人类偏好                      │
│  - 常用损失:Bradley-Terry model 的对比损失                     │
├─────────────────────────────────────────────────────────────┤
│  Step 2: 用 RM 作为奖励信号,优化策略模型                       │
│  - 算法:PPO(Proximal Policy Optimization)等               │
│  - 加入 KL 惩罚项,防止策略偏离 SFT 模型太远                    │
│  - 目标:max E[R(x,y)] - β · KL(π_θ || π_ref)               │
└─────────────────────────────────────────────────────────────┘

DPO(Direct Preference Optimization)

  • 直接从偏好数据优化策略,无需单独训练 RM
  • 数学上等价于特定形式的 RLHF,但工程更简单
  • 损失函数直接基于偏好对的概率比

GRPO(Group Relative Policy Optimization)

  • DeepSeek 提出的方法 [具体技术细节需参考原论文]
  • 用于推理任务的强化学习阶段
  • 以组内相对排名作为奖励信号

产出:对齐后的模型,输出更符合人类期望。

阶段四:后训练增强(Post-training Enhancement)

这是近年来快速发展的领域,包括多个子方向:

4a. 长上下文扩展

  • 问题:预训练通常用较短序列(如 4K),如何扩展到 128K、1M?
  • 方法:位置编码外推/内插(如 RoPE 的 NTK-aware scaling、YaRN)、渐进式训练
  • 可能需要在长文本数据上做额外微调

4b. 推理增强(Reasoning Enhancement)

  • 核心思想:让模型学会”慢思考”——生成中间推理步骤
  • Chain-of-Thought(思维链)提示是基础
  • 专门的推理训练可能包括:
    • 在包含推理过程的数据上微调
    • 使用强化学习优化推理路径(如 DeepSeek-R1 的做法)
    • 过程奖励模型(Process Reward Model, PRM)监督中间步骤

4c. 多模态对齐

  • 将视觉/音频编码器与语言模型对接
  • 训练跨模态投影层或适配器
  • 在图文配对数据上微调

技术原理

核心机制:从预训练到对齐的信息流

[预训练]
海量文本 → Next-Token Prediction → Base Model (学习语言分布 P(x))

         ↓ checkpoint

[SFT]
指令-回答对 → 条件生成损失 → SFT Model (学习 P(answer|instruction))

         ↓ checkpoint

[RLHF/DPO]
人类偏好对 → 奖励优化 / 直接偏好损失 → Aligned Model (学习人类偏好的分布)

         ↓ checkpoint

[后训练]
专项数据 → 专项微调/RL → Enhanced Model (特定能力增强)

关键技术细节

1. 学习率调度的阶段差异

预训练阶段:
  lr
  ↑
  |   /‾‾‾‾‾‾‾‾‾‾‾‾‾‾‾‾‾‾‾\
  |  /                       \  ← cosine decay
  | /                         \_____
  |/________________________________→ steps
  [warmup]

SFT 阶段:
  lr
  ↑
  |____
  |    \_______  ← 通常为线性 decay 或极小值恒定
  |            \___
  |__________________→ steps
  (起始值远低于预训练峰值)

RLHF 阶段:
  lr
  ↑
  |___
  |   \____  ← 通常更低
  |        \__
  |____________→ steps

2. 损失函数的演进

阶段典型损失函数核心目标
预训练Cross-entropy (next-token)最小化预测分布与真实 token 的差异
SFTCross-entropy (仅对 output)模仿标注回答的分布
Reward ModelBradley-Terry pairwise loss学习偏好排序
RLHF (PPO)Policy gradient + KL penalty最大化奖励同时保持稳定
DPODirect preference loss直接从偏好对优化

3. 数据与算力的分配

训练成本分布(定性估计):
╔══════════════════════════════════════════════════════════╗
║ 预训练        ██████████████████████████████████  >90%    ║
║ SFT           ███                                    ║
║ RLHF          ██                                     ║
║ 后训练增强     █~██                                   ║
╚══════════════════════════════════════════════════════════╝
  计算量: 数月 → 数天 → 数小时 → 视情况

技术演进史

时间线:
2018        BERT: 预训练 + 下游微调 (两阶段范式建立)
  │         GPT-1: 生成式预训练 + 微调
  ↓
2019        GPT-2: 发现大规模预训练可直接 zero-shot,减少微调依赖
  ↓
2020        GPT-3: In-context learning 发现,提示工程兴起
  │         (但仍缺乏"遵循指令"能力)
  ↓
2022        InstructGPT 论文 (OpenAI): 
  │         提出 RLHF 三阶段范式: 预训练 → SFT → RLHF
  │         ← 里程碑: 训练阶段化范式正式确立
  │
  │         ChatGPT (GPT-3.5 + RLHF): 
  │         阶段化训练的首个大众成功案例
  ↓
2023        LLaMA 开源生态、DPO 提出简化 RLHF
  │         多模态阶段化: LLaVA 等
  ↓
2024        推理增强: o1 (OpenAI) 引入推理链
  │         长上下文: 扩展至百万 token
  ↓
2025        DeepSeek-R1 正式发布 (2025.01) —— 推理阶段的强化学习
            - 更多子阶段 (如多轮对齐、安全加固)
            - 数据合成贯穿各阶段
            - 持续预训练成为重要补充

关键转折点

  • InstructGPT (2022):确立了”预训练 → SFT → RLHF”三阶段范式,证明小量高质量对齐数据可以大幅改善大模型可用性
  • ChatGPT (2022.11):三阶段范式的商业化验证
  • DPO (2023):简化 RLHF,降低阶段化门槛
  • 推理增强 (2024-2025):新增专门的推理训练阶段

技术路线对比

阶段化策略对比

维度经典三阶段 (InstructGPT 范式)DPO 简化路线含推理增强的四阶段
阶段数3 (预训练→SFT→RLHF)3 (预训练→SFT→DPO)4+ (加推理/长上下文等)
对齐算法PPO + Reward ModelDPO (无需 RM)PPO/DPO + 推理 RL
工程复杂度高 (需同时维护策略模型、RM、参考模型)中 (无需 RM)
数据需求偏好对 + 标注回答偏好对更多样化的数据集
典型代表InstructGPT、早期 ChatGPTZephyrDeepSeek-R1、o1 系列
优势理论成熟,奖励信号灵活工程简单,训练稳定推理能力显著提升
劣势训练不稳定,调参复杂可能不如 RLHF 灵活阶段更多,整体成本上升

对齐算法对比

算法是否需要 RM是否需要在线采样训练稳定性典型应用
PPO (RLHF)较低ChatGPT 系列
DPO较高LLaMA 2 (部分)、Zephyr
GRPO视实现DeepSeek-R1
KTO减少配对数据需求

注:具体算法效果对比依赖实验设置,上表为定性总结


上下游

上游

训练阶段化的上游供应:
┌─────────────────────────────────────────────────────────┐
│                                                         │
│  [数据层]                                               │
│   ├─ 预训练语料: Common Crawl, 书籍, 代码, 学术论文     │
│   ├─ SFT 数据: 人工标注, 模型蒸馏, Self-Instruct       │
│   ├─ 偏好数据: 人类标注偏好对                           │
│   └─ 专项数据: 数学/代码/推理数据集                      │
│                                                         │
│  [算力层]                                               │
│   ├─ GPU/加速器: NVIDIA H100/H200, AMD MI300X          │
│   ├─ 互联: NVLink, InfiniBand                          │
│   └─ 存储: 高速分布式存储                               │
│                                                         │
│  [框架层]                                               │
│   ├─ 训练框架: Megatron-LM, DeepSpeed, FSDP            │
│   ├─ RLHF 框架: TRL, OpenRLHF, verl                   │
│   └─ 数据处理: 数据清洗、去重、质量评估工具              │
│                                                         │
│  [基础设施层]                                           │
│   ├─ 云服务: 各大云厂商 GPU 集群                        │
│   └─ 集群管理: 任务调度、容错                           │
│                                                         │
└─────────────────────────────────────────────────────────┘

下游

训练阶段化的下游应用:
┌─────────────────────────────────────────────────────────┐
│                                                         │
│  [直接产出]                                             │
│   ├─ Chat 产品 (ChatGPT, Claude, Gemini)               │
│   ├─ 代码助手 (Copilot, Cursor)                        │
│   ├─ 推理增强模型 (o1, DeepSeek-R1)                    │
│   └─ 多模态助手 (GPT-4V, Gemini)                       │
│                                                         │
│  [衍生应用]                                             │
│   ├─ Agent 框架 (基于对齐后的模型)                      │
│   ├─ RAG 系统                                           │
│   ├─ 行业垂直模型 (金融/医疗/法律微调)                  │
│   └─ 端侧模型 (蒸馏后部署)                             │
│                                                         │
└─────────────────────────────────────────────────────────┘

关键指标

各阶段评估指标

阶段常用评估指标说明
预训练Perplexity (PPL)越低越好,衡量语言建模能力
预训练下游 benchmark (MMLU, HellaSwag 等)零样本/少样本能力
SFT指令遵循率模型是否按指令格式回答
SFT人工评估 / LLM-as-judge回答质量综合评分
RLHF/DPOWin rate (vs. baseline)人类偏好评比中的胜率
RLHF/DPOReward model score奖励模型打分(如果使用 RM)
RLHF/DPOKL divergence (vs. reference)对齐程度,防止 reward hacking
推理增强数学/逻辑 benchmark (GSM8K, MATH, ARC)推理正确率
推理增强推理链质量中间步骤的合理性和准确性

训练成本指标(估算量级)

指标预训练SFTRLHF推理增强
GPU 时间数周-数月数小时-数天数小时-数天视规模
数据量万亿 token万-百万条万-百万对视任务
标注成本低(可自动)中-高高(偏好标注)

注:以上为量级估算,具体取决于模型规模、数据量、硬件配置等因素


供需与市场数据

阶段化训练服务市场

供给端

  • 头部厂商(OpenAI, Anthropic, Google, Meta, 字节, 阿里等)自建全栈训练能力
  • 第三方训练平台和工具(如 Anyscale, Modal, Together AI)提供算力和框架支持
  • 数据标注公司(Scale AI, Surge 等)提供 SFT 和偏好数据

需求端

  • 基础模型厂商:需要完整阶段化训练能力
  • 垂直行业:通常在开源基座上做 SFT 和可能的 RLHF
  • 企业私有化部署:关注 SFT 和安全对齐

市场趋势(定性判断)

  • 训练阶段化带来的工具链和平台需求增长
  • 数据质量服务价值凸显
  • 对齐算法和工具快速迭代

注:具体市场规模数据未获得可靠来源,不列出数字


代表公司与资本映射

训练阶段化能力分布

能力层级代表公司特点
全栈自研 (预训练→对齐)OpenAI, Anthropic, Google DeepMind, Meta AI拥有完整阶段化能力,自研算法
全栈自研 (中国)字节 (豆包), 阿里 (通义), DeepSeek, 智谱国内头部,快速迭代
开源基座 + 定制对齐众多中小厂商、垂直行业公司基于 LLaMA/Qwen 等开源模型做 SFT/RLHF
工具链/平台Anyscale, Modal, Together AI, Hugging Face提供训练框架、算力平台
数据服务Scale AI, Surge AI提供高质量 SFT 和偏好数据

关键技术专利/论文来源

  • RLHF 范式: OpenAI (InstructGPT 论文, 2022)
  • DPO: Stanford (2023)
  • DeepSeek-R1 训练范式: DeepSeek (2025)
  • LLaMA 系列: Meta (2023-2024)

投资逻辑

核心观点

  1. 阶段化训练 = 大模型能力的”生产流程”

    • 理解阶段化就是理解大模型是怎么造出来的
    • 每个阶段都有对应的供应商和服务机会
  2. 投资机会分层

高确定性 (刚需):
├─ 算力供应 (GPU, 云服务) —— 各阶段都需要
├─ 数据服务 (高质量标注) —— SFT/RLHF 的关键瓶颈
└─ 训练框架/平台 —— 工程化必需

中等确定性 (趋势性):
├─ 对齐算法/工具 —— 技术快速迭代,格局未定
├─ 推理增强训练 —— 新方向,价值待验证
└─ 合成数据 —— 可能改变数据供给结构

低确定性 (远期):
├─ 自动化训练流程 (Auto-Training)
└─ 新范式替代阶段化
  1. 关键风险
    • 如果出现新的训练范式替代阶段化,现有产业链可能重构
    • 对齐算法技术路线不确定(RLHF vs DPO vs 新方法)
    • 开源模型能力追赶可能压缩闭源模型的利润空间

常见误读纠偏

误读一:“SFT 是训练阶段化中最关键的”

纠偏

  • 预训练决定了模型能力的上限(知识量、推理基础)
  • SFT/RLHF 是在预训练基础上做方向调整,不能创造预训练中不存在的能力
  • 类比:预训练是”上学读书”,SFT/RLHF 是”面试培训”——没有前者,后者无从谈起
  • 从成本角度,预训练占据绝大部分算力投入

误读二:“DPO 完全取代了 RLHF”

纠偏

  • DPO 确实简化了工程流程(无需训练 RM),但并非严格优于 RLHF
  • RLHF 使用独立的 RM 和在线采样,在某些场景下可能更灵活
  • 两者各有适用场景,目前业界两者都有使用,未出现一方完全取代另一方的趋势
  • GRPO 等新方法也在探索中,格局仍在演进

误读三:“训练阶段化是固定的三步”

纠偏

  • 三阶段(预训练→SFT→RLHF)是基础范式,但实际操作中远比这复杂
  • 可能包含多轮迭代(如 SFT→RLHF→再SFT→再RLHF)
  • 后训练阶段(推理增强、长上下文等)已成为标配第四阶段甚至更多
  • 不同厂商的具体流程差异很大,阶段划分并非标准化的

误读四:“用更强模型蒸馏 SFT 数据就能得到好模型”

纠偏

  • 蒸馏可以提升指令遵循能力,但无法超越教师模型的能力上限
  • 存在法律和伦理问题(如用 GPT-4 输出训练竞品模型)
  • 蒸馏数据可能存在系统性偏差
  • 好的 SFT 数据需要多样性和任务覆盖,不是简单的”好模型生成 = 好数据”

学习路径

入门路径(建立直觉)

Step 1: 理解单阶段训练
        → 学习语言模型基础 (next-token prediction)
        → 跑一个简单 LM 训练代码

Step 2: 理解为什么需要 SFT
        → 对比 base model vs. chat model 的行为差异
        → 了解 instruction tuning 的概念

Step 3: 理解 RLHF/DPO 的动机
        → 阅读 InstructGPT 论文的核心思想
        → 理解"偏好"是如何被学习的

Step 4: 动手实践
        → 使用 Hugging Face TRL 库跑一个简单的 SFT + DPO 流程
        → 观察各阶段模型行为的变化

进阶路径(深入机制)

Step 5: 精读经典论文
        → InstructGPT (2022): 训练阶段化范式奠基
        → DPO (2023): 简化对齐
        → LLaMA 2 (2023): 开源阶段化实践
        → DeepSeek-R1 (2025): 推理增强阶段

Step 6: 理解工程细节
        → 学习 Megatron-LM / DeepSpeed 的分布式训练
        → 了解 PPO 的实现细节
        → 学习数据清洗和质量评估方法

Step 7: 关注前沿
        → 跟踪对齐算法新进展
        → 关注推理增强和多模态阶段化
        → 了解合成数据在各阶段的应用

推荐资源

类型资源说明
论文InstructGPT (Ouyang et al., 2022)阶段化范式奠基
论文DPO (Rafailov et al., 2023)简化对齐方法
论文DeepSeek-R1 (2025)推理增强阶段化
代码库Hugging Face TRL实用的阶段化训练工具
代码库OpenRLHFRLHF 训练框架
课程Stanford CS224N / CS324NLP 和 LLM 基础

一句话总结

训练阶段化是将大模型从”会说话的鹦鹉”变为”有帮助的助手”的工程方法论——通过预训练学知识、SFT 学格式、RLHF 学偏好、后训练学专项能力,分阶段降低优化难度,是当前大模型生产的核心流程。


延伸阅读与来源

核心论文

  • Ouyang et al., “Training language models to follow instructions with human feedback” (InstructGPT), 2022. — 确立 RLHF 三阶段范式
  • Rafailov et al., “Direct Preference Optimization: Your Language Model is Secretly a Reward Model” (DPO), 2023. — 简化对齐方法
  • Touvron et al., “LLaMA 2: Open Foundation and Fine-Tuned Chat Models”, 2023. — 开源阶段化实践
  • DeepSeek-AI, “DeepSeek-R1”, 2025. — 推理增强阶段化

技术博客与资料

数据来源声明

  • 本文中涉及的具体数字(模型参数量、训练 token 数等)来自厂商公开披露,未标注来源的为定性描述或估算
  • 训练成本、市场规模等敏感数据未获得充分公开来源,以定性描述为主
  • 技术演进时间线基于公开论文和产品发布记录

本页基于公开论文、技术报告和行业共识撰写。训练阶段化是快速演进的领域,具体实践因厂商而异,建议以最新论文和官方技术报告为准。

source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型