训练阶段化 (Training Stages)
3 秒看懂
大模型训练不是”一锅端”,而是分阶段完成:先学语言基础(预训练),再学听指令(SFT),再学人类偏好(RLHF/DPO),最后可能针对性增强推理/长文本/多模态。每个阶段用不同数据、目标函数、学习率策略,前一阶段成果是后一阶段起点。
3 分钟产业解释
为什么不能一阶段搞定?
| 阶段 | 核心目标 | 数据特征 | 训练时长占比(定性) |
|---|---|---|---|
| 预训练 | 学语言知识与世界知识 | 海量无标注文本(万亿 token 级) | 极长(数周至数月) |
| SFT | 学会遵循指令格式 | 高质量指令-回答对(万至百万级) | 较短(数小时至数天) |
| RLHF/DPO | 对齐人类偏好与价值观 | 人类偏好标注对 | 短(数小时至数天) |
| 后训练增强 | 推理/长上下文/多模态等 | 专项数据 | 视目标而定 |
产业关键洞察:
- 成本结构:预训练占总算力的绝大部分(>90%[估算]),SFT/RLHF 的算力成本相对较小,但数据质量和算法设计是决定模型可用性的关键
- 迭代逻辑:如果 SFT/RLHF 效果不好,不一定要重做预训练,可以更换数据或算法重做对齐阶段——这是阶段化带来的工程灵活性
- 竞争壁垒转移:当基础预训练能力趋同时,SFT 数据质量、RLHF 工程能力成为差异化的”最后一公里”
阶段化的本质
是将一个不可能的优化问题分解为多个可解的子问题:
- 预训练目标(next-token prediction)与最终使用目标(有帮助、安全、诚实的回答)之间存在 gap
- 每个阶段负责缩小一个特定的 gap
- 后一阶段在前一阶段构建的”能力空间”内做定向调整
15 分钟专家深入
各阶段详解
阶段一:预训练(Pre-training)
目标:在海量文本上学习语言模型的通用表示,获得基础的语言理解、知识存储和生成能力。
典型做法:
- 目标函数:自回归模型用 next-token prediction(如 GPT 系列、LLaMA 系列),双向模型用 masked LM(如 BERT)
- 数据:网页、书籍、代码、学术论文、维基百科等,经过清洗、去重、质量过滤,规模通常为数万亿 token(具体数字因厂商而异,公开披露的如 LLaMA 系列提到 1-2T token 量级)
- 训练时长:取决于模型规模和计算集群,通常为数周到数月
关键超参数:
- 学习率:典型采用 warmup + cosine decay 策略,峰值学习率因模型规模而异
- Batch size:可能逐步增大(如 Chinchilla 相关研究讨论过 batch size warmup)
- 序列长度:通常为 2K-8K token(预训练阶段)
产出:Base model(基座模型),具备语言能力但不擅长遵循指令,可能输出不安全或无用内容。
阶段二:监督微调(SFT, Supervised Fine-Tuning)
目标:让模型学会”遵循指令”的格式和能力——给定一个指令,生成符合期望格式的回答。
典型做法:
- 数据格式:
(instruction, input, output)三元组,或对话格式(user_message, assistant_message) - 数据来源:
- 人工标注(成本高但质量可控)
- 从更强模型蒸馏(如用 GPT-4 生成训练数据,存在法律和道德争议)
- 自举方法(Self-Instruct 等)
- 数据规模:通常为数万到数百万条(相对于预训练数据极小,但质量要求高)
训练细节:
- 学习率:比预训练低 1-2 个数量级
- 通常只训练 1-3 个 epoch,防止过拟合
- 可能只对 output 部分计算 loss(而非整个序列)
产出:SFT model,能够遵循指令但仍可能输出偏见、幻觉或不符合人类价值观的内容。
阶段三:偏好对齐(RLHF / DPO / GRPO)
目标:让模型的输出符合人类的偏好和价值观——不仅要正确,还要有帮助、无害、诚实。
RLHF(Reinforcement Learning from Human Feedback)经典流程:
┌─────────────────────────────────────────────────────────────┐
│ Step 1: 训练奖励模型 (Reward Model, RM) │
│ - 数据:人类对同一 prompt 多个回答的偏好排序 │
│ - 目标:学习一个标量奖励函数,预测人类偏好 │
│ - 常用损失:Bradley-Terry model 的对比损失 │
├─────────────────────────────────────────────────────────────┤
│ Step 2: 用 RM 作为奖励信号,优化策略模型 │
│ - 算法:PPO(Proximal Policy Optimization)等 │
│ - 加入 KL 惩罚项,防止策略偏离 SFT 模型太远 │
│ - 目标:max E[R(x,y)] - β · KL(π_θ || π_ref) │
└─────────────────────────────────────────────────────────────┘
DPO(Direct Preference Optimization):
- 直接从偏好数据优化策略,无需单独训练 RM
- 数学上等价于特定形式的 RLHF,但工程更简单
- 损失函数直接基于偏好对的概率比
GRPO(Group Relative Policy Optimization):
- DeepSeek 提出的方法 [具体技术细节需参考原论文]
- 用于推理任务的强化学习阶段
- 以组内相对排名作为奖励信号
产出:对齐后的模型,输出更符合人类期望。
阶段四:后训练增强(Post-training Enhancement)
这是近年来快速发展的领域,包括多个子方向:
4a. 长上下文扩展:
- 问题:预训练通常用较短序列(如 4K),如何扩展到 128K、1M?
- 方法:位置编码外推/内插(如 RoPE 的 NTK-aware scaling、YaRN)、渐进式训练
- 可能需要在长文本数据上做额外微调
4b. 推理增强(Reasoning Enhancement):
- 核心思想:让模型学会”慢思考”——生成中间推理步骤
- Chain-of-Thought(思维链)提示是基础
- 专门的推理训练可能包括:
- 在包含推理过程的数据上微调
- 使用强化学习优化推理路径(如 DeepSeek-R1 的做法)
- 过程奖励模型(Process Reward Model, PRM)监督中间步骤
4c. 多模态对齐:
- 将视觉/音频编码器与语言模型对接
- 训练跨模态投影层或适配器
- 在图文配对数据上微调
技术原理
核心机制:从预训练到对齐的信息流
[预训练]
海量文本 → Next-Token Prediction → Base Model (学习语言分布 P(x))
↓ checkpoint
[SFT]
指令-回答对 → 条件生成损失 → SFT Model (学习 P(answer|instruction))
↓ checkpoint
[RLHF/DPO]
人类偏好对 → 奖励优化 / 直接偏好损失 → Aligned Model (学习人类偏好的分布)
↓ checkpoint
[后训练]
专项数据 → 专项微调/RL → Enhanced Model (特定能力增强)
关键技术细节
1. 学习率调度的阶段差异
预训练阶段:
lr
↑
| /‾‾‾‾‾‾‾‾‾‾‾‾‾‾‾‾‾‾‾\
| / \ ← cosine decay
| / \_____
|/________________________________→ steps
[warmup]
SFT 阶段:
lr
↑
|____
| \_______ ← 通常为线性 decay 或极小值恒定
| \___
|__________________→ steps
(起始值远低于预训练峰值)
RLHF 阶段:
lr
↑
|___
| \____ ← 通常更低
| \__
|____________→ steps
2. 损失函数的演进
| 阶段 | 典型损失函数 | 核心目标 |
|---|---|---|
| 预训练 | Cross-entropy (next-token) | 最小化预测分布与真实 token 的差异 |
| SFT | Cross-entropy (仅对 output) | 模仿标注回答的分布 |
| Reward Model | Bradley-Terry pairwise loss | 学习偏好排序 |
| RLHF (PPO) | Policy gradient + KL penalty | 最大化奖励同时保持稳定 |
| DPO | Direct preference loss | 直接从偏好对优化 |
3. 数据与算力的分配
训练成本分布(定性估计):
╔══════════════════════════════════════════════════════════╗
║ 预训练 ██████████████████████████████████ >90% ║
║ SFT ███ ║
║ RLHF ██ ║
║ 后训练增强 █~██ ║
╚══════════════════════════════════════════════════════════╝
计算量: 数月 → 数天 → 数小时 → 视情况
技术演进史
时间线:
2018 BERT: 预训练 + 下游微调 (两阶段范式建立)
│ GPT-1: 生成式预训练 + 微调
↓
2019 GPT-2: 发现大规模预训练可直接 zero-shot,减少微调依赖
↓
2020 GPT-3: In-context learning 发现,提示工程兴起
│ (但仍缺乏"遵循指令"能力)
↓
2022 InstructGPT 论文 (OpenAI):
│ 提出 RLHF 三阶段范式: 预训练 → SFT → RLHF
│ ← 里程碑: 训练阶段化范式正式确立
│
│ ChatGPT (GPT-3.5 + RLHF):
│ 阶段化训练的首个大众成功案例
↓
2023 LLaMA 开源生态、DPO 提出简化 RLHF
│ 多模态阶段化: LLaVA 等
↓
2024 推理增强: o1 (OpenAI) 引入推理链
│ 长上下文: 扩展至百万 token
↓
2025 DeepSeek-R1 正式发布 (2025.01) —— 推理阶段的强化学习
- 更多子阶段 (如多轮对齐、安全加固)
- 数据合成贯穿各阶段
- 持续预训练成为重要补充
关键转折点
- InstructGPT (2022):确立了”预训练 → SFT → RLHF”三阶段范式,证明小量高质量对齐数据可以大幅改善大模型可用性
- ChatGPT (2022.11):三阶段范式的商业化验证
- DPO (2023):简化 RLHF,降低阶段化门槛
- 推理增强 (2024-2025):新增专门的推理训练阶段
技术路线对比
阶段化策略对比
| 维度 | 经典三阶段 (InstructGPT 范式) | DPO 简化路线 | 含推理增强的四阶段 |
|---|---|---|---|
| 阶段数 | 3 (预训练→SFT→RLHF) | 3 (预训练→SFT→DPO) | 4+ (加推理/长上下文等) |
| 对齐算法 | PPO + Reward Model | DPO (无需 RM) | PPO/DPO + 推理 RL |
| 工程复杂度 | 高 (需同时维护策略模型、RM、参考模型) | 中 (无需 RM) | 高 |
| 数据需求 | 偏好对 + 标注回答 | 偏好对 | 更多样化的数据集 |
| 典型代表 | InstructGPT、早期 ChatGPT | Zephyr | DeepSeek-R1、o1 系列 |
| 优势 | 理论成熟,奖励信号灵活 | 工程简单,训练稳定 | 推理能力显著提升 |
| 劣势 | 训练不稳定,调参复杂 | 可能不如 RLHF 灵活 | 阶段更多,整体成本上升 |
对齐算法对比
| 算法 | 是否需要 RM | 是否需要在线采样 | 训练稳定性 | 典型应用 |
|---|---|---|---|---|
| PPO (RLHF) | ✅ | ✅ | 较低 | ChatGPT 系列 |
| DPO | ❌ | ❌ | 较高 | LLaMA 2 (部分)、Zephyr |
| GRPO | 视实现 | ✅ | 中 | DeepSeek-R1 |
| KTO | ❌ | ❌ | 高 | 减少配对数据需求 |
注:具体算法效果对比依赖实验设置,上表为定性总结
上下游
上游
训练阶段化的上游供应:
┌─────────────────────────────────────────────────────────┐
│ │
│ [数据层] │
│ ├─ 预训练语料: Common Crawl, 书籍, 代码, 学术论文 │
│ ├─ SFT 数据: 人工标注, 模型蒸馏, Self-Instruct │
│ ├─ 偏好数据: 人类标注偏好对 │
│ └─ 专项数据: 数学/代码/推理数据集 │
│ │
│ [算力层] │
│ ├─ GPU/加速器: NVIDIA H100/H200, AMD MI300X │
│ ├─ 互联: NVLink, InfiniBand │
│ └─ 存储: 高速分布式存储 │
│ │
│ [框架层] │
│ ├─ 训练框架: Megatron-LM, DeepSpeed, FSDP │
│ ├─ RLHF 框架: TRL, OpenRLHF, verl │
│ └─ 数据处理: 数据清洗、去重、质量评估工具 │
│ │
│ [基础设施层] │
│ ├─ 云服务: 各大云厂商 GPU 集群 │
│ └─ 集群管理: 任务调度、容错 │
│ │
└─────────────────────────────────────────────────────────┘
下游
训练阶段化的下游应用:
┌─────────────────────────────────────────────────────────┐
│ │
│ [直接产出] │
│ ├─ Chat 产品 (ChatGPT, Claude, Gemini) │
│ ├─ 代码助手 (Copilot, Cursor) │
│ ├─ 推理增强模型 (o1, DeepSeek-R1) │
│ └─ 多模态助手 (GPT-4V, Gemini) │
│ │
│ [衍生应用] │
│ ├─ Agent 框架 (基于对齐后的模型) │
│ ├─ RAG 系统 │
│ ├─ 行业垂直模型 (金融/医疗/法律微调) │
│ └─ 端侧模型 (蒸馏后部署) │
│ │
└─────────────────────────────────────────────────────────┘
关键指标
各阶段评估指标
| 阶段 | 常用评估指标 | 说明 |
|---|---|---|
| 预训练 | Perplexity (PPL) | 越低越好,衡量语言建模能力 |
| 预训练 | 下游 benchmark (MMLU, HellaSwag 等) | 零样本/少样本能力 |
| SFT | 指令遵循率 | 模型是否按指令格式回答 |
| SFT | 人工评估 / LLM-as-judge | 回答质量综合评分 |
| RLHF/DPO | Win rate (vs. baseline) | 人类偏好评比中的胜率 |
| RLHF/DPO | Reward model score | 奖励模型打分(如果使用 RM) |
| RLHF/DPO | KL divergence (vs. reference) | 对齐程度,防止 reward hacking |
| 推理增强 | 数学/逻辑 benchmark (GSM8K, MATH, ARC) | 推理正确率 |
| 推理增强 | 推理链质量 | 中间步骤的合理性和准确性 |
训练成本指标(估算量级)
| 指标 | 预训练 | SFT | RLHF | 推理增强 |
|---|---|---|---|---|
| GPU 时间 | 数周-数月 | 数小时-数天 | 数小时-数天 | 视规模 |
| 数据量 | 万亿 token | 万-百万条 | 万-百万对 | 视任务 |
| 标注成本 | 低(可自动) | 中-高 | 高(偏好标注) | 中 |
注:以上为量级估算,具体取决于模型规模、数据量、硬件配置等因素
供需与市场数据
阶段化训练服务市场
供给端:
- 头部厂商(OpenAI, Anthropic, Google, Meta, 字节, 阿里等)自建全栈训练能力
- 第三方训练平台和工具(如 Anyscale, Modal, Together AI)提供算力和框架支持
- 数据标注公司(Scale AI, Surge 等)提供 SFT 和偏好数据
需求端:
- 基础模型厂商:需要完整阶段化训练能力
- 垂直行业:通常在开源基座上做 SFT 和可能的 RLHF
- 企业私有化部署:关注 SFT 和安全对齐
市场趋势(定性判断):
- 训练阶段化带来的工具链和平台需求增长
- 数据质量服务价值凸显
- 对齐算法和工具快速迭代
注:具体市场规模数据未获得可靠来源,不列出数字
代表公司与资本映射
训练阶段化能力分布
| 能力层级 | 代表公司 | 特点 |
|---|---|---|
| 全栈自研 (预训练→对齐) | OpenAI, Anthropic, Google DeepMind, Meta AI | 拥有完整阶段化能力,自研算法 |
| 全栈自研 (中国) | 字节 (豆包), 阿里 (通义), DeepSeek, 智谱 | 国内头部,快速迭代 |
| 开源基座 + 定制对齐 | 众多中小厂商、垂直行业公司 | 基于 LLaMA/Qwen 等开源模型做 SFT/RLHF |
| 工具链/平台 | Anyscale, Modal, Together AI, Hugging Face | 提供训练框架、算力平台 |
| 数据服务 | Scale AI, Surge AI | 提供高质量 SFT 和偏好数据 |
关键技术专利/论文来源
- RLHF 范式: OpenAI (InstructGPT 论文, 2022)
- DPO: Stanford (2023)
- DeepSeek-R1 训练范式: DeepSeek (2025)
- LLaMA 系列: Meta (2023-2024)
投资逻辑
核心观点
-
阶段化训练 = 大模型能力的”生产流程”
- 理解阶段化就是理解大模型是怎么造出来的
- 每个阶段都有对应的供应商和服务机会
-
投资机会分层:
高确定性 (刚需):
├─ 算力供应 (GPU, 云服务) —— 各阶段都需要
├─ 数据服务 (高质量标注) —— SFT/RLHF 的关键瓶颈
└─ 训练框架/平台 —— 工程化必需
中等确定性 (趋势性):
├─ 对齐算法/工具 —— 技术快速迭代,格局未定
├─ 推理增强训练 —— 新方向,价值待验证
└─ 合成数据 —— 可能改变数据供给结构
低确定性 (远期):
├─ 自动化训练流程 (Auto-Training)
└─ 新范式替代阶段化
- 关键风险:
- 如果出现新的训练范式替代阶段化,现有产业链可能重构
- 对齐算法技术路线不确定(RLHF vs DPO vs 新方法)
- 开源模型能力追赶可能压缩闭源模型的利润空间
常见误读纠偏
误读一:“SFT 是训练阶段化中最关键的”
纠偏:
- 预训练决定了模型能力的上限(知识量、推理基础)
- SFT/RLHF 是在预训练基础上做方向调整,不能创造预训练中不存在的能力
- 类比:预训练是”上学读书”,SFT/RLHF 是”面试培训”——没有前者,后者无从谈起
- 从成本角度,预训练占据绝大部分算力投入
误读二:“DPO 完全取代了 RLHF”
纠偏:
- DPO 确实简化了工程流程(无需训练 RM),但并非严格优于 RLHF
- RLHF 使用独立的 RM 和在线采样,在某些场景下可能更灵活
- 两者各有适用场景,目前业界两者都有使用,未出现一方完全取代另一方的趋势
- GRPO 等新方法也在探索中,格局仍在演进
误读三:“训练阶段化是固定的三步”
纠偏:
- 三阶段(预训练→SFT→RLHF)是基础范式,但实际操作中远比这复杂
- 可能包含多轮迭代(如 SFT→RLHF→再SFT→再RLHF)
- 后训练阶段(推理增强、长上下文等)已成为标配第四阶段甚至更多
- 不同厂商的具体流程差异很大,阶段划分并非标准化的
误读四:“用更强模型蒸馏 SFT 数据就能得到好模型”
纠偏:
- 蒸馏可以提升指令遵循能力,但无法超越教师模型的能力上限
- 存在法律和伦理问题(如用 GPT-4 输出训练竞品模型)
- 蒸馏数据可能存在系统性偏差
- 好的 SFT 数据需要多样性和任务覆盖,不是简单的”好模型生成 = 好数据”
学习路径
入门路径(建立直觉)
Step 1: 理解单阶段训练
→ 学习语言模型基础 (next-token prediction)
→ 跑一个简单 LM 训练代码
Step 2: 理解为什么需要 SFT
→ 对比 base model vs. chat model 的行为差异
→ 了解 instruction tuning 的概念
Step 3: 理解 RLHF/DPO 的动机
→ 阅读 InstructGPT 论文的核心思想
→ 理解"偏好"是如何被学习的
Step 4: 动手实践
→ 使用 Hugging Face TRL 库跑一个简单的 SFT + DPO 流程
→ 观察各阶段模型行为的变化
进阶路径(深入机制)
Step 5: 精读经典论文
→ InstructGPT (2022): 训练阶段化范式奠基
→ DPO (2023): 简化对齐
→ LLaMA 2 (2023): 开源阶段化实践
→ DeepSeek-R1 (2025): 推理增强阶段
Step 6: 理解工程细节
→ 学习 Megatron-LM / DeepSpeed 的分布式训练
→ 了解 PPO 的实现细节
→ 学习数据清洗和质量评估方法
Step 7: 关注前沿
→ 跟踪对齐算法新进展
→ 关注推理增强和多模态阶段化
→ 了解合成数据在各阶段的应用
推荐资源
| 类型 | 资源 | 说明 |
|---|---|---|
| 论文 | InstructGPT (Ouyang et al., 2022) | 阶段化范式奠基 |
| 论文 | DPO (Rafailov et al., 2023) | 简化对齐方法 |
| 论文 | DeepSeek-R1 (2025) | 推理增强阶段化 |
| 代码库 | Hugging Face TRL | 实用的阶段化训练工具 |
| 代码库 | OpenRLHF | RLHF 训练框架 |
| 课程 | Stanford CS224N / CS324 | NLP 和 LLM 基础 |
一句话总结
训练阶段化是将大模型从”会说话的鹦鹉”变为”有帮助的助手”的工程方法论——通过预训练学知识、SFT 学格式、RLHF 学偏好、后训练学专项能力,分阶段降低优化难度,是当前大模型生产的核心流程。
延伸阅读与来源
核心论文
- Ouyang et al., “Training language models to follow instructions with human feedback” (InstructGPT), 2022. — 确立 RLHF 三阶段范式
- Rafailov et al., “Direct Preference Optimization: Your Language Model is Secretly a Reward Model” (DPO), 2023. — 简化对齐方法
- Touvron et al., “LLaMA 2: Open Foundation and Fine-Tuned Chat Models”, 2023. — 开源阶段化实践
- DeepSeek-AI, “DeepSeek-R1”, 2025. — 推理增强阶段化
技术博客与资料
- Hugging Face TRL 文档: https://huggingface.co/docs/trl
- Anthropic 研究博客关于 RLHF 的讨论
- OpenAI 关于 InstructGPT 的技术报告
数据来源声明
- 本文中涉及的具体数字(模型参数量、训练 token 数等)来自厂商公开披露,未标注来源的为定性描述或估算
- 训练成本、市场规模等敏感数据未获得充分公开来源,以定性描述为主
- 技术演进时间线基于公开论文和产品发布记录
本页基于公开论文、技术报告和行业共识撰写。训练阶段化是快速演进的领域,具体实践因厂商而异,建议以最新论文和官方技术报告为准。