应用层 开放阅读

强化学习

Reinforcement Learning

概念 ID
reinforcement-learning
更新时间
2026-05-29
来源数量
待补

强化学习(Reinforcement Learning)

3 秒看懂

一句话:智能体(Agent)通过”试错-奖惩”循环,在与环境的交互中自主学会最优决策策略——不靠标注数据,靠奖励信号驱动学习。

产业关键词:RLHF 驱动大模型对齐 · 自动驾驶决策 · 机器人控制 · 游戏 AI · 药物分子设计

一句话产业定位:强化学习是 AI 从”模式识别”进化到”自主决策”的核心算法范式,尤其在 LLM 对齐(RLHF)中已成为产业标配;算力需求需结合训练频次、在线反馈规模和模型迭代节奏逐项验证。

3 分钟产业解释

为什么现在 RL 突然成为产业焦点?

过去十年,深度学习的主旋律是监督学习——给模型大量标注好的 (输入, 输出) 对,让它学会映射。这解决了图像识别、语音转写等”模式匹配”问题。

但 AI 要真正落地到决策场景——对话该说什么、机械臂该怎么抓、自动驾驶该怎么变道——就没有现成的”标准答案”可以标注。这些场景的共同特征是:

  1. 动作空间巨大:一个大型语言模型每步生成有数万个 token 可选
  2. 反馈延迟:一个决策的好坏可能要等到很多步之后才知道
  3. 没有最优标签:人类自己也未必知道最优答案,只能判断”哪个更好”

强化学习天然适合这类问题。而 2022-2023 年的大模型爆发,让 RL 从学术象牙塔一步跨入产业核心——

RLHF(基于人类反馈的强化学习) 成为 ChatGPT、Claude、Gemini 等主流大模型对齐人类偏好的关键技术路径。这个过程中,RL 不再只是”下棋的 AI”,而是成为把通用语言能力转化为有用、安全、可控行为的”最后一公里”算法。

产业规模感知

  • RL 本身不是一个独立的硬件或软件市场,而是横跨算力基础设施、模型训练平台、应用终端的技术层
  • 在 LLM 训练成本中,RLHF 阶段的算力占比因架构而异,通常需要多次策略迭代,每轮涉及大量推理(生成候选回复)和训练(更新策略),是算力消耗的重要组成部分 [行业估算]
  • 机器人、自动驾驶领域的 RL 仿真训练同样消耗大量 GPU 算力,但数据多在仿真环境中自动生成,边际成本结构不同于 LLM

15 分钟专家深入

一、RL 的核心范式:马尔可夫决策过程(MDP)

强化学习的数学基础是马尔可夫决策过程,由五元组 (S, A, P, R, γ) 定义:

符号含义LLM 对齐场景举例
S状态空间当前对话历史 + 上下文
A动作空间下一个 token 的选择
P状态转移概率给定上文,语言模型本身定义了转移
R奖励函数奖励模型对回复质量的打分
γ折扣因子权衡即时回复质量与对话整体连贯性

Agent 的目标:找到一个策略 π(a|s),使得累积折扣奖励的期望值最大化

max_π  E[ Σ_{t=0}^{∞} γ^t · r_t ]

这个优化目标看似简洁,但在实践中面临的核心挑战包括:信用分配(哪一步动作导致了最终好坏?)、探索-利用权衡(该试新动作还是重复已知好动作?)、样本效率(需要多少交互才能学到好策略?)。

二、RL 算法家族谱系

从策略更新方式看,RL 算法大致分三大流派:

强化学习算法
├── 基于值函数(Value-based)
│   ├── Q-Learning(表格型)
│   ├── DQN(Deep Q-Network, 2015, DeepMind)
│   ├── Double DQN / Dueling DQN / Rainbow
│   └── 适用:离散动作空间,Atari 游戏等
│
├── 策略梯度(Policy Gradient)
│   ├── REINFORCE(蒙特卡洛策略梯度)
│   ├── PPO(Proximal Policy Optimization, 2017, OpenAI)
│   ├── TRPO(Trust Region Policy Optimization)
│   └── 适用:连续/高维动作空间,机器人控制
│
└── Actor-Critic(混合架构)
    ├── A2C / A3C(Advantage Actor-Critic)
    ├── SAC(Soft Actor-Critic)
    ├── TD3(Twin Delayed DDPG)
    └── 适用:兼顾稳定性与样本效率

在 LLM 对齐中,PPO 是目前最主流的 RL 算法选择,原因在于:它通过 clipped surrogate objective 限制策略更新幅度,训练相对稳定;同时天然适配大规模分布式训练框架。

三、RLHF 的完整技术管线(大模型对齐核心)

这是当前 RL 最具产业影响力的应用场景,完整流程如下:

┌──────────────────────────────────────────────────────┐
│          Stage 1: 监督微调 (SFT)                       │
│  高质量人工标注数据 → 微调基座模型 → SFT 模型           │
└──────────────────────┬───────────────────────────────┘
                       ▼
┌──────────────────────────────────────────────────────┐
│          Stage 2: 奖励模型训练 (RM)                    │
│  收集同一 prompt 的多条回复 → 人工排序标注              │
│  训练 Bradley-Terry 偏好模型 → RM(回复) → 标量分数     │
└──────────────────────┬───────────────────────────────┘
                       ▼
┌──────────────────────────────────────────────────────┐
│          Stage 3: RL 策略优化 (PPO)                    │
│  循环迭代:                                            │
│    ① 策略模型生成回复(推理阶段,算力密集)             │
│    ② RM 对回复打分                                    │
│    ③ PPO 更新策略模型(训练阶段)                      │
│    ④ KL 散度惩罚,防止策略偏离 SFT 太远                │
└──────────────────────────────────────────────────────┘

关键工程细节

  • KL 惩罚:PPO 目标函数中加入 β · KL(π_θ || π_ref) 项,防止模型为追求高奖励而”reward hacking”(生成 RM 认为好但人类实际觉得奇怪的回复)
  • 参考策略冻结:Stage 3 中 SFT 模型作为 π_ref 被冻结,只更新 π_θ
  • 算力结构:每轮迭代需要先跑一轮推理(生成回复),再跑一轮训练(PPO 更新),所以 RLHF 的推理算力占比远高于纯 SFT 阶段
  • 分布式实现:通常需要四组模型并行运行——策略模型、参考模型、奖励模型、价值函数模型,显存开销巨大 [行业共识]

四、DPO:绕过显式奖励模型的替代路径

2023 年,Stanford 研究团队提出 Direct Preference Optimization (DPO),核心洞察是:在 Bradley-Terry 偏好模型假设下,最优策略可以直接从偏好数据中解析求得,无需先训练 RM 再做 PPO。

DPO 损失函数(简化):

L_DPO = -E[ log σ( β · (log π_θ(y_w|x)/π_ref(y_w|x)
                       - log π_θ(y_l|x)/π_ref(y_l|x)) ) ]

其中 y_w = 偏好回复, y_l = 非偏好回复

DPO 的优势:训练流程大幅简化,无需在线推理生成,显存需求降低,训练更稳定。

DPO 的争议:离线数据可能导致分布偏移;在复杂对齐任务(安全性、多轮对话)中,PPO 的在线探索能力可能仍有优势。当前产业中 PPO 和 DPO 均有大规模应用,部分厂商采用混合方案 [公开技术报告/未充分披露]。

五、RL 超越对齐:更广阔的应用版图

应用领域RL 的角色代表案例
LLM 对齐偏好优化RLHF/DPO(ChatGPT, Claude, Gemini)
代码生成通过执行反馈优化基于测试用例的 RL 奖励
机器人控制运动策略学习腿式机器人行走、灵巧手操作
自动驾驶决策规划模拟环境中的策略优化
芯片设计EDA 布局优化Google 的芯片 Floorplanning
药物发现分子生成优化基于目标属性的分子空间探索
推荐系统长期用户价值优化从短期点击率到长期留存
科学发现实验设计DeepMind GNoME 材料发现

技术原理(最深)

6.1 策略梯度定理——RL 的理论基石

所有策略梯度方法的起点是这个定理:

∇_θ J(θ) = E_{τ~π_θ}[ Σ_t ∇_θ log π_θ(a_t|s_t) · A_t ]

其中:
  J(θ) = 策略 π_θ 的期望累积回报
  τ    = 一条完整轨迹 (s_0, a_0, r_0, s_1, a_1, r_1, ...)
  A_t  = 优势函数 = Q^π(s_t, a_t) - V^π(s_t)
         ("这个动作比平均好多少")

直觉:对于每一步决策,如果它的优势为正(实际回报高于预期),就增加选择这个动作的概率;反之则降低。梯度的权重是优势值,不是原始回报——这避免了”赢了就全对、输了就全错”的简单归因。

6.2 PPO 的 Clipped Objective——为什么它成为标配

L_CLIP(θ) = E_t[ min( r_t(θ) · A_t,  clip(r_t(θ), 1-ε, 1+ε) · A_t ) ]

其中:
  r_t(θ) = π_θ(a_t|s_t) / π_old(a_t|s_t)   (新旧策略概率比)
  ε      = 裁剪范围,典型值 0.1~0.2

机制解析

  • 当 A_t > 0(好动作):r_t 被上界裁剪,不允许策略对这个动作的概率增加太多
  • 当 A_t < 0(坏动作):r_t 被下界裁剪,不允许概率下降太快
  • 效果:每次策略更新幅度被约束在信任域内,训练更加稳定
  • 相比 TRPO 需要计算和求解 Fisher 信息矩阵的逆(二次优化),PPO 只用一个 clip 操作,实现简单、计算高效、易分布式——这是它在工业界胜出的关键

6.3 RLHF 中的完整优化目标

max_&#123;π_θ}  E_&#123;x~D, y~π_θ(·|x)}[ R_φ(x, y) ]
           - β · KL[ π_θ(·|x) || π_ref(·|x) ]

第一项:最大化奖励模型的打分(对齐人类偏好)
第二项:惩罚策略偏离参考模型太远(保持语言能力、防止退化)
β:KL 系数,控制"优化奖励"和"保持稳定"的权衡

这个目标函数的平衡感是 RLHF 成功的核心——太激进地追求奖励会导致”reward hacking”(比如生成冗长讨好但无实质的回复),太保守则模型行为没有实质改善。

6.4 RL 的算力需求结构

RLHF 训练一次迭代的计算流:

┌─────────────────────────────────────────┐
│  阶段 1: 在线推理(生成候选回复)         │
│  - 策略模型前向推理                       │
│  - 通常需要 N 条采样(N ≥ 1)             │
│  - 推理算力 ≈ 策略模型参数量 × 序列长度   │
│  - GPU 占用:策略模型 + 参考模型副本       │
└───────────────────┬─────────────────────┘
                    ▼
┌─────────────────────────────────────────┐
│  阶段 2: 奖励模型打分                     │
│  - RM 前向推理                           │
│  - 相对轻量(RM 通常小于策略模型)         │
└───────────────────┬─────────────────────┘
                    ▼
┌─────────────────────────────────────────┐
│  阶段 3: PPO 训练更新                     │
│  - 策略模型前向+反向                      │
│  - 价值函数模型前向+反向                   │
│  - 梯度计算和参数更新                      │
│  - 训练算力 ≈ 策略模型参数量 × 3~4 倍      │
│    (因为同时维护策略/价值/参考/RM 四个模型)│
└─────────────────────────────────────────┘

关键结论:RLHF 不只是”训练算力”,推理算力占比显著——每轮迭代都要先生成回复。这使得 RLHF 训练集群对推理吞吐显存容量的要求都极高,是 HBM 容量和互联带宽的重度消耗场景 [行业共识/工程推导]。


技术演进史

时期里程碑意义
1950s-1980s动态规划、时间差分(TD)学习RL 的理论基础成型(Bellman、Sutton)
1992TD-Gammon(IBM)用 TD 学习训练西洋双陆棋,接近人类顶尖水平
2013DQN(DeepMind)深度网络 + Q-Learning,Atari 游戏超越人类
2016AlphaGo(DeepMind)MCTS + 策略网络 + 价值网络,击败围棋世界冠军
2017AlphaZero纯自我对弈,无需人类棋谱,通用棋类 AI
2017PPO(OpenAI)简洁高效的策略梯度算法,成为后续工业标准
2019OpenAI FiveRL 训练的 Dota2 AI 击败世界冠军战队
2022.01InstructGPT / RLHF 原型(OpenAI)基于 RLHF 的 LLM 对齐首次大规模应用
2022.11ChatGPT 发布RLHF 走入公众视野,证明 RL 对齐的巨大商业价值
2023DPO(Stanford)、RRHF、SLiC 等去 RM 的简化对齐路线涌现
2023-2024Process Reward Models, RLHF 多轮优化RL 对齐技术持续迭代
2024-2025RL 用于推理能力(如 o1 类模型的思维链优化)RL 从”对齐”延伸到”推理增强”

技术路线对比

维度PPO-based RLHFDPORLHF + Process RM纯 SFT(对照)
是否需要显式 RM✅ 需要训练独立 RM❌ 隐式内嵌✅ 需要,且需过程级标注
训练稳定性中等(需调 KL、clip 参数)较高(类似监督学习)中等
对齐效果上限高(在线探索能力强)中-高(受限于离线数据分布)最高(可做细粒度信用分配)
计算成本高(推理+训练,四模型并行)低(仅策略模型训练)最高(过程级奖励标注+推理)最低
推理算力需求极高
工程复杂度高(分布式四模型协调)极高最低
适用场景复杂对齐、安全敏感资源受限、快速迭代数学/代码等可验证推理简单指令跟随
产业采用度最高(OpenAI、Anthropic 等头部)广泛(中小团队偏爱)正在增长基线/初步对齐

:上表为基于公开学术论文和开源社区实践的定性对比,各厂商内部方案细节 [未充分披露]。


上下游

上游(RL 训练需要什么)

算力层
├── GPU/加速卡:NVIDIA H100/B200(主流);AMD MI300X(部分部署)
├── HBM 内存:RLHF 四模型并行对显存需求极高
├── 高速互联:NVLink/NVSwitch(卡间通信)、InfiniBand(节点间)
└── 云计算:AWS/Azure/GCP 的 GPU 集群

软件框架层
├── 训练框架:DeepSpeed、Megatron-LM、FSDP(PyTorch)、veRL
├── RL 库:TRL(HuggingFace)、OpenRLHF、RLHFlow
├── 推理引擎:vLLM、TensorRT-LLM(在线生成阶段)
└── 分布式调度:Ray、Slurm

数据层
├── 人类偏好标注:专业标注员对回复排序(成本高、周期长)
├── 合成偏好数据:AI 辅助标注(降低成本但引入偏差)
└── 红队测试数据:安全性对齐专用

下游(RL 产出什么)

直接产出
├── 对齐后的 LLM(ChatGPT、Claude、Gemini 等核心产品)
├── 机器人控制策略(运控模型)
└── 自动驾驶决策策略

衍生价值
├── 更高的用户留存和付费意愿(对齐质量 → 产品体验)
├── 安全合规(满足监管要求的基础)
└── 新能力涌现(推理增强类模型依赖 RL)

关键指标

指标含义产业参考水平
Win Rate(胜率)RLHF 模型 vs SFT 模型的人类评估偏好比例典型提升 60%→75%+ [学术论文,因任务而异]
Reward Score奖励模型对生成回复的打分随训练迭代上升,但需监控 KL 不失控
KL Divergence策略与参考模型的偏离程度典型控制在 3~15 nats(过低无效果,过高易退化)
Reward Hacking RateRM 打分上升但人类评价下降的频率训练不稳定的信号,需及时调整
训练吞吐(tokens/s)RLHF 集群处理效率受四模型并行架构限制,远低于纯 SFT
人类标注一致性(IAA)不同标注员对同一对偏好的一致率Cohen’s κ > 0.6 通常认为可用
每轮迭代采样数每个 prompt 生成的候选回复数通常 1~8 条,影响探索多样性

供需与市场数据

需求侧

  • LLM 对齐是 RL 最大的产业需求来源:所有主流对话式 AI 产品(ChatGPT、Claude、Gemini、文心一言、通义千问等)均经历 RLHF 或其变体对齐流程 [各厂商公开技术报告]
  • 推理类模型(如 o1 系列) 将 RL 从”行为对齐”扩展到”推理能力增强”,需求场景进一步扩大
  • 具身智能(机器人) 是 RL 的另一个潜在大规模落地方向,但当前仍处于研发/小批量部署阶段

供给侧

  • 算力:RLHF 训练高度依赖高端 GPU 集群。单次完整 RLHF 训练(从 SFT 到对齐完成)的算力消耗因模型规模和迭代轮次不同而差异巨大,但可占总训练成本的相当比例 [行业估算/未充分精确披露]
  • 人类标注:高质量偏好数据是稀缺资源。专业 RLHF 标注团队薪资成本高,且需要严格的质量控制流程。头部厂商已大量采用 AI 辅助标注以降低成本
  • 工程人才:能大规模实施 RLHF 分布式训练的工程团队在全球范围内仍然稀缺

市场格局

  • RLHF/RL 对齐不是一个独立的可交易市场,而是嵌入在大模型训练成本结构中的关键环节
  • 但其对算力消耗的拉动是可观测的:RLHF 的推理密集特性使 GPU 云服务的推理收入占比提升
  • 合成数据 + AI 辅助标注正在重塑偏好数据的供给曲线,降低边际成本

代表公司与资本映射

公司/机构RL 角色技术特点资本相关
OpenAIRLHF 开创者PPO-based RLHF 是其核心竞争力之一非上市,估值千亿美元级
AnthropicConstitutional AI (CAI)用 AI 反馈部分替代人类偏好标注非上市,融资百亿美元级
Google DeepMindRL 学术先驱AlphaGo/AlphaZero/AlphaFold 系列Alphabet 子公司
Meta (FAIR)开源 RL 工具链Open-source Llama 对齐方案,推动 RLHF 民主化META
Hugging FaceTRL 开源库降低 RLHF 工程门槛非上市
NVIDIARL 训练算力底座GPU + NVLink 互联是 RLHF 集群的基础NVDA
字节跳动/百度/阿里中文大模型 RLHF 实践基于自研基座的对齐管线各有上市实体

投资映射逻辑:RL 不是直接可投资标的,但通过两条路径传导价值——① 拉动高端算力需求(利好 NVIDIA、云厂商);② 对齐质量决定 AI 产品竞争力(利好头部 AI 公司的用户留存和商业化)。


投资逻辑

核心判断

  1. RL 是 AI 从”能力”到”产品”的必经之路。基座模型再强,不对齐就无法安全部署。这意味着 RL 相关算力需求具有结构性而非周期性。

  2. 推理算力的增量逻辑。RLHF 的在线推理阶段(生成候选回复)消耗大量推理算力,这与”训练完就只推理”的传统认知不同——RL 训练过程中本身就是推理的大客户。随着 o1 类推理模型兴起,推理链更长 → 单次推理算力更大 → RL 训练的推理需求进一步放大

  3. 数据飞轮效应。RLHF 依赖人类偏好标注,头部厂商积累的高质量偏好数据和 RM 形成数据护城河——先发者 RM 更准 → 对齐更好 → 用户更多 → 收集更多偏好反馈 → RM 更准。

  4. DPO 等简化路线降低了中小团队的参与门槛,但头部厂商在复杂对齐(安全、多轮、工具使用)上仍倾向 PPO 类在线 RL,技术差距可能扩大而非缩小。

风险因素

  • Reward hacking 始终是工程风险:RM 不完美,优化过程可能找到 RM 的漏洞而非真正提升质量
  • 监管不确定性:部分监管可能要求对齐过程可审计,纯 RL 迭代的黑箱特性可能面临挑战
  • 技术路线迭代快:从 PPO 到 DPO 到 DPO+ 到 RLOO 到 KTO,技术路线仍在快速演进,押注单一方案有风险

常见误读纠偏

误读 1:“RLHF 就是让 AI 学会说话”

纠偏:RLHF 不教模型语言能力(那是预训练和 SFT 干的事),它教的是在多种可能的回复中,选择人类偏好的那种。打个比方:预训练给了模型一本百科全书,SFT 教它如何回答问题,RLHF 教它如何在”诚实但可能冒犯”和”讨好但不诚实”之间做正确选择。没有 RLHF,模型照样能说话,但可能有毒、偏见、不安全或答非所问。

误读 2:“RL 训练比 SFT 简单,就是打个分更新参数”

纠偏:RLHF 的工程复杂度远高于 SFT。SFT 只需一套模型做前向+反向,RLHF 需要四套模型(策略、参考、RM、价值函数)同时在线,且需要在线生成(推理)→ 打分 → 训练的循环。分布式协调、显存管理、超参数调优(KL 系数、clip 范围、学习率衰减)的复杂度是数量级的差异。这也是为什么很多开源模型在 SFT 上效果不错,但 RLHF 效果参差不齐——工程能力门槛极高

误读 3:“DPO 会完全取代 PPO/RLHF”

纠偏:DPO 在简单指令遵循任务上效果接近 PPO 且成本更低,但在复杂安全对齐、多轮交互、需要在线探索的场景中,PPO 的优势仍然明显。当前头部厂商的实际做法多为混合方案:用 DPO 做初步对齐降低成本,再用 PPO 做精细调整。完全取代的说法过于简化。

误读 4:“RL 在大模型中主要用于对齐,跟推理能力无关”

纠偏:这个认知正在过时。o1 系列等推理增强模型的核心技术路径之一就是用 RL 优化思维链(chain-of-thought)的过程和结果。RL 不仅优化”说什么”,也开始优化”怎么想”——通过过程级奖励模型(Process RM)对推理链中的每一步打分,这是 RL 从”对齐工具”向”能力增强引擎”演进的重要方向。


学习路径

入门(建立直觉)

  1. 《Reinforcement Learning: An Introduction》(Sutton & Barto)—— RL 圣经,第 1-4 章建立基础概念(免费在线阅读)
  2. OpenAI Spinning Up(spinningup.openai.com)—— 极好的入门教程,从理论到代码
  3. David Silver 的 UCL 课程—— DeepMind 研究科学家的经典 RL 课程

进阶(理解核心算法)

  1. PPO 原始论文:Schulman et al., “Proximal Policy Optimization Algorithms”, 2017
  2. InstructGPT 论文:Ouyang et al., “Training language models to follow instructions with human feedback”, 2022 —— RLHF 的里程碑
  3. DPO 论文:Rafailov et al., “Direct Preference Optimization”, 2023
  4. 实践:用 HuggingFace TRL 库跑一个小型 RLHF 流程

专家(工程与前沿)

  1. DeepSpeed-Chat / OpenRLHF / veRL—— 大规模分布式 RLHF 工程实现
  2. Process Reward Models:Lightman et al., “Let’s Verify Step by Step”, 2023
  3. 追踪最新动态:arXiv RL 标签、ICML/NeurIPS RL track、Lilian Weng 的博客

一句话总结

强化学习是 AI 能力从”识别”到”决策”跃迁的核心算法引擎,在大模型时代通过 RLHF 成为将通用智能转化为可部署产品的关键一环,其对推理算力和高质量偏好数据的结构性需求,使其成为 AI 产业链中不可忽视的隐性驱动力。


延伸阅读与来源

来源内容链接/备注
Sutton & BartoRL 经典教材http://incompleteideas.net/book/the-book.html
Schulman et al., 2017PPO 论文arXiv:1707.06347
Ouyang et al., 2022InstructGPT / RLHF 论文arXiv:2203.02155
Rafailov et al., 2023DPO 论文arXiv:2305.18290
Lightman et al., 2023Process Reward ModelsarXiv:2305.20050
OpenAI Spinning UpRL 入门教程https://spinningup.openai.com
HuggingFace TRLRLHF 开源工具库https://github.com/huggingface/trl
Anthropic, 2022Constitutional AI 论文arXiv:2212.08073
Christiano et al., 2017Deep RL from Human PreferencesarXiv:1706.03741(RLHF 思想源头)
OpenRLHF开源大规模 RLHF 框架https://github.com/OpenRLHF/OpenRLHF

免责声明:本文为技术概念学习材料,不构成投资建议。涉及公司的具体技术实现细节以各公司官方披露为准,未充分披露的部分已明确标注。

source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型