强化学习(Reinforcement Learning)
3 秒看懂
一句话:智能体(Agent)通过”试错-奖惩”循环,在与环境的交互中自主学会最优决策策略——不靠标注数据,靠奖励信号驱动学习。
产业关键词:RLHF 驱动大模型对齐 · 自动驾驶决策 · 机器人控制 · 游戏 AI · 药物分子设计
一句话产业定位:强化学习是 AI 从”模式识别”进化到”自主决策”的核心算法范式,尤其在 LLM 对齐(RLHF)中已成为产业标配;算力需求需结合训练频次、在线反馈规模和模型迭代节奏逐项验证。
3 分钟产业解释
为什么现在 RL 突然成为产业焦点?
过去十年,深度学习的主旋律是监督学习——给模型大量标注好的 (输入, 输出) 对,让它学会映射。这解决了图像识别、语音转写等”模式匹配”问题。
但 AI 要真正落地到决策场景——对话该说什么、机械臂该怎么抓、自动驾驶该怎么变道——就没有现成的”标准答案”可以标注。这些场景的共同特征是:
- 动作空间巨大:一个大型语言模型每步生成有数万个 token 可选
- 反馈延迟:一个决策的好坏可能要等到很多步之后才知道
- 没有最优标签:人类自己也未必知道最优答案,只能判断”哪个更好”
强化学习天然适合这类问题。而 2022-2023 年的大模型爆发,让 RL 从学术象牙塔一步跨入产业核心——
RLHF(基于人类反馈的强化学习) 成为 ChatGPT、Claude、Gemini 等主流大模型对齐人类偏好的关键技术路径。这个过程中,RL 不再只是”下棋的 AI”,而是成为把通用语言能力转化为有用、安全、可控行为的”最后一公里”算法。
产业规模感知
- RL 本身不是一个独立的硬件或软件市场,而是横跨算力基础设施、模型训练平台、应用终端的技术层
- 在 LLM 训练成本中,RLHF 阶段的算力占比因架构而异,通常需要多次策略迭代,每轮涉及大量推理(生成候选回复)和训练(更新策略),是算力消耗的重要组成部分 [行业估算]
- 机器人、自动驾驶领域的 RL 仿真训练同样消耗大量 GPU 算力,但数据多在仿真环境中自动生成,边际成本结构不同于 LLM
15 分钟专家深入
一、RL 的核心范式:马尔可夫决策过程(MDP)
强化学习的数学基础是马尔可夫决策过程,由五元组 (S, A, P, R, γ) 定义:
| 符号 | 含义 | LLM 对齐场景举例 |
|---|---|---|
| S | 状态空间 | 当前对话历史 + 上下文 |
| A | 动作空间 | 下一个 token 的选择 |
| P | 状态转移概率 | 给定上文,语言模型本身定义了转移 |
| R | 奖励函数 | 奖励模型对回复质量的打分 |
| γ | 折扣因子 | 权衡即时回复质量与对话整体连贯性 |
Agent 的目标:找到一个策略 π(a|s),使得累积折扣奖励的期望值最大化:
max_π E[ Σ_{t=0}^{∞} γ^t · r_t ]
这个优化目标看似简洁,但在实践中面临的核心挑战包括:信用分配(哪一步动作导致了最终好坏?)、探索-利用权衡(该试新动作还是重复已知好动作?)、样本效率(需要多少交互才能学到好策略?)。
二、RL 算法家族谱系
从策略更新方式看,RL 算法大致分三大流派:
强化学习算法
├── 基于值函数(Value-based)
│ ├── Q-Learning(表格型)
│ ├── DQN(Deep Q-Network, 2015, DeepMind)
│ ├── Double DQN / Dueling DQN / Rainbow
│ └── 适用:离散动作空间,Atari 游戏等
│
├── 策略梯度(Policy Gradient)
│ ├── REINFORCE(蒙特卡洛策略梯度)
│ ├── PPO(Proximal Policy Optimization, 2017, OpenAI)
│ ├── TRPO(Trust Region Policy Optimization)
│ └── 适用:连续/高维动作空间,机器人控制
│
└── Actor-Critic(混合架构)
├── A2C / A3C(Advantage Actor-Critic)
├── SAC(Soft Actor-Critic)
├── TD3(Twin Delayed DDPG)
└── 适用:兼顾稳定性与样本效率
在 LLM 对齐中,PPO 是目前最主流的 RL 算法选择,原因在于:它通过 clipped surrogate objective 限制策略更新幅度,训练相对稳定;同时天然适配大规模分布式训练框架。
三、RLHF 的完整技术管线(大模型对齐核心)
这是当前 RL 最具产业影响力的应用场景,完整流程如下:
┌──────────────────────────────────────────────────────┐
│ Stage 1: 监督微调 (SFT) │
│ 高质量人工标注数据 → 微调基座模型 → SFT 模型 │
└──────────────────────┬───────────────────────────────┘
▼
┌──────────────────────────────────────────────────────┐
│ Stage 2: 奖励模型训练 (RM) │
│ 收集同一 prompt 的多条回复 → 人工排序标注 │
│ 训练 Bradley-Terry 偏好模型 → RM(回复) → 标量分数 │
└──────────────────────┬───────────────────────────────┘
▼
┌──────────────────────────────────────────────────────┐
│ Stage 3: RL 策略优化 (PPO) │
│ 循环迭代: │
│ ① 策略模型生成回复(推理阶段,算力密集) │
│ ② RM 对回复打分 │
│ ③ PPO 更新策略模型(训练阶段) │
│ ④ KL 散度惩罚,防止策略偏离 SFT 太远 │
└──────────────────────────────────────────────────────┘
关键工程细节:
- KL 惩罚:PPO 目标函数中加入
β · KL(π_θ || π_ref)项,防止模型为追求高奖励而”reward hacking”(生成 RM 认为好但人类实际觉得奇怪的回复) - 参考策略冻结:Stage 3 中 SFT 模型作为
π_ref被冻结,只更新π_θ - 算力结构:每轮迭代需要先跑一轮推理(生成回复),再跑一轮训练(PPO 更新),所以 RLHF 的推理算力占比远高于纯 SFT 阶段
- 分布式实现:通常需要四组模型并行运行——策略模型、参考模型、奖励模型、价值函数模型,显存开销巨大 [行业共识]
四、DPO:绕过显式奖励模型的替代路径
2023 年,Stanford 研究团队提出 Direct Preference Optimization (DPO),核心洞察是:在 Bradley-Terry 偏好模型假设下,最优策略可以直接从偏好数据中解析求得,无需先训练 RM 再做 PPO。
DPO 损失函数(简化):
L_DPO = -E[ log σ( β · (log π_θ(y_w|x)/π_ref(y_w|x)
- log π_θ(y_l|x)/π_ref(y_l|x)) ) ]
其中 y_w = 偏好回复, y_l = 非偏好回复
DPO 的优势:训练流程大幅简化,无需在线推理生成,显存需求降低,训练更稳定。
DPO 的争议:离线数据可能导致分布偏移;在复杂对齐任务(安全性、多轮对话)中,PPO 的在线探索能力可能仍有优势。当前产业中 PPO 和 DPO 均有大规模应用,部分厂商采用混合方案 [公开技术报告/未充分披露]。
五、RL 超越对齐:更广阔的应用版图
| 应用领域 | RL 的角色 | 代表案例 |
|---|---|---|
| LLM 对齐 | 偏好优化 | RLHF/DPO(ChatGPT, Claude, Gemini) |
| 代码生成 | 通过执行反馈优化 | 基于测试用例的 RL 奖励 |
| 机器人控制 | 运动策略学习 | 腿式机器人行走、灵巧手操作 |
| 自动驾驶 | 决策规划 | 模拟环境中的策略优化 |
| 芯片设计 | EDA 布局优化 | Google 的芯片 Floorplanning |
| 药物发现 | 分子生成优化 | 基于目标属性的分子空间探索 |
| 推荐系统 | 长期用户价值优化 | 从短期点击率到长期留存 |
| 科学发现 | 实验设计 | DeepMind GNoME 材料发现 |
技术原理(最深)
6.1 策略梯度定理——RL 的理论基石
所有策略梯度方法的起点是这个定理:
∇_θ J(θ) = E_{τ~π_θ}[ Σ_t ∇_θ log π_θ(a_t|s_t) · A_t ]
其中:
J(θ) = 策略 π_θ 的期望累积回报
τ = 一条完整轨迹 (s_0, a_0, r_0, s_1, a_1, r_1, ...)
A_t = 优势函数 = Q^π(s_t, a_t) - V^π(s_t)
("这个动作比平均好多少")
直觉:对于每一步决策,如果它的优势为正(实际回报高于预期),就增加选择这个动作的概率;反之则降低。梯度的权重是优势值,不是原始回报——这避免了”赢了就全对、输了就全错”的简单归因。
6.2 PPO 的 Clipped Objective——为什么它成为标配
L_CLIP(θ) = E_t[ min( r_t(θ) · A_t, clip(r_t(θ), 1-ε, 1+ε) · A_t ) ]
其中:
r_t(θ) = π_θ(a_t|s_t) / π_old(a_t|s_t) (新旧策略概率比)
ε = 裁剪范围,典型值 0.1~0.2
机制解析:
- 当 A_t > 0(好动作):r_t 被上界裁剪,不允许策略对这个动作的概率增加太多
- 当 A_t < 0(坏动作):r_t 被下界裁剪,不允许概率下降太快
- 效果:每次策略更新幅度被约束在信任域内,训练更加稳定
- 相比 TRPO 需要计算和求解 Fisher 信息矩阵的逆(二次优化),PPO 只用一个 clip 操作,实现简单、计算高效、易分布式——这是它在工业界胜出的关键
6.3 RLHF 中的完整优化目标
max_{π_θ} E_{x~D, y~π_θ(·|x)}[ R_φ(x, y) ]
- β · KL[ π_θ(·|x) || π_ref(·|x) ]
第一项:最大化奖励模型的打分(对齐人类偏好)
第二项:惩罚策略偏离参考模型太远(保持语言能力、防止退化)
β:KL 系数,控制"优化奖励"和"保持稳定"的权衡
这个目标函数的平衡感是 RLHF 成功的核心——太激进地追求奖励会导致”reward hacking”(比如生成冗长讨好但无实质的回复),太保守则模型行为没有实质改善。
6.4 RL 的算力需求结构
RLHF 训练一次迭代的计算流:
┌─────────────────────────────────────────┐
│ 阶段 1: 在线推理(生成候选回复) │
│ - 策略模型前向推理 │
│ - 通常需要 N 条采样(N ≥ 1) │
│ - 推理算力 ≈ 策略模型参数量 × 序列长度 │
│ - GPU 占用:策略模型 + 参考模型副本 │
└───────────────────┬─────────────────────┘
▼
┌─────────────────────────────────────────┐
│ 阶段 2: 奖励模型打分 │
│ - RM 前向推理 │
│ - 相对轻量(RM 通常小于策略模型) │
└───────────────────┬─────────────────────┘
▼
┌─────────────────────────────────────────┐
│ 阶段 3: PPO 训练更新 │
│ - 策略模型前向+反向 │
│ - 价值函数模型前向+反向 │
│ - 梯度计算和参数更新 │
│ - 训练算力 ≈ 策略模型参数量 × 3~4 倍 │
│ (因为同时维护策略/价值/参考/RM 四个模型)│
└─────────────────────────────────────────┘
关键结论:RLHF 不只是”训练算力”,推理算力占比显著——每轮迭代都要先生成回复。这使得 RLHF 训练集群对推理吞吐和显存容量的要求都极高,是 HBM 容量和互联带宽的重度消耗场景 [行业共识/工程推导]。
技术演进史
| 时期 | 里程碑 | 意义 |
|---|---|---|
| 1950s-1980s | 动态规划、时间差分(TD)学习 | RL 的理论基础成型(Bellman、Sutton) |
| 1992 | TD-Gammon(IBM) | 用 TD 学习训练西洋双陆棋,接近人类顶尖水平 |
| 2013 | DQN(DeepMind) | 深度网络 + Q-Learning,Atari 游戏超越人类 |
| 2016 | AlphaGo(DeepMind) | MCTS + 策略网络 + 价值网络,击败围棋世界冠军 |
| 2017 | AlphaZero | 纯自我对弈,无需人类棋谱,通用棋类 AI |
| 2017 | PPO(OpenAI) | 简洁高效的策略梯度算法,成为后续工业标准 |
| 2019 | OpenAI Five | RL 训练的 Dota2 AI 击败世界冠军战队 |
| 2022.01 | InstructGPT / RLHF 原型(OpenAI) | 基于 RLHF 的 LLM 对齐首次大规模应用 |
| 2022.11 | ChatGPT 发布 | RLHF 走入公众视野,证明 RL 对齐的巨大商业价值 |
| 2023 | DPO(Stanford)、RRHF、SLiC 等 | 去 RM 的简化对齐路线涌现 |
| 2023-2024 | Process Reward Models, RLHF 多轮优化 | RL 对齐技术持续迭代 |
| 2024-2025 | RL 用于推理能力(如 o1 类模型的思维链优化) | RL 从”对齐”延伸到”推理增强” |
技术路线对比
| 维度 | PPO-based RLHF | DPO | RLHF + Process RM | 纯 SFT(对照) |
|---|---|---|---|---|
| 是否需要显式 RM | ✅ 需要训练独立 RM | ❌ 隐式内嵌 | ✅ 需要,且需过程级标注 | ❌ |
| 训练稳定性 | 中等(需调 KL、clip 参数) | 较高(类似监督学习) | 中等 | 高 |
| 对齐效果上限 | 高(在线探索能力强) | 中-高(受限于离线数据分布) | 最高(可做细粒度信用分配) | 低 |
| 计算成本 | 高(推理+训练,四模型并行) | 低(仅策略模型训练) | 最高(过程级奖励标注+推理) | 最低 |
| 推理算力需求 | 高 | 低 | 极高 | 无 |
| 工程复杂度 | 高(分布式四模型协调) | 低 | 极高 | 最低 |
| 适用场景 | 复杂对齐、安全敏感 | 资源受限、快速迭代 | 数学/代码等可验证推理 | 简单指令跟随 |
| 产业采用度 | 最高(OpenAI、Anthropic 等头部) | 广泛(中小团队偏爱) | 正在增长 | 基线/初步对齐 |
注:上表为基于公开学术论文和开源社区实践的定性对比,各厂商内部方案细节 [未充分披露]。
上下游
上游(RL 训练需要什么)
算力层
├── GPU/加速卡:NVIDIA H100/B200(主流);AMD MI300X(部分部署)
├── HBM 内存:RLHF 四模型并行对显存需求极高
├── 高速互联:NVLink/NVSwitch(卡间通信)、InfiniBand(节点间)
└── 云计算:AWS/Azure/GCP 的 GPU 集群
软件框架层
├── 训练框架:DeepSpeed、Megatron-LM、FSDP(PyTorch)、veRL
├── RL 库:TRL(HuggingFace)、OpenRLHF、RLHFlow
├── 推理引擎:vLLM、TensorRT-LLM(在线生成阶段)
└── 分布式调度:Ray、Slurm
数据层
├── 人类偏好标注:专业标注员对回复排序(成本高、周期长)
├── 合成偏好数据:AI 辅助标注(降低成本但引入偏差)
└── 红队测试数据:安全性对齐专用
下游(RL 产出什么)
直接产出
├── 对齐后的 LLM(ChatGPT、Claude、Gemini 等核心产品)
├── 机器人控制策略(运控模型)
└── 自动驾驶决策策略
衍生价值
├── 更高的用户留存和付费意愿(对齐质量 → 产品体验)
├── 安全合规(满足监管要求的基础)
└── 新能力涌现(推理增强类模型依赖 RL)
关键指标
| 指标 | 含义 | 产业参考水平 |
|---|---|---|
| Win Rate(胜率) | RLHF 模型 vs SFT 模型的人类评估偏好比例 | 典型提升 60%→75%+ [学术论文,因任务而异] |
| Reward Score | 奖励模型对生成回复的打分 | 随训练迭代上升,但需监控 KL 不失控 |
| KL Divergence | 策略与参考模型的偏离程度 | 典型控制在 3~15 nats(过低无效果,过高易退化) |
| Reward Hacking Rate | RM 打分上升但人类评价下降的频率 | 训练不稳定的信号,需及时调整 |
| 训练吞吐(tokens/s) | RLHF 集群处理效率 | 受四模型并行架构限制,远低于纯 SFT |
| 人类标注一致性(IAA) | 不同标注员对同一对偏好的一致率 | Cohen’s κ > 0.6 通常认为可用 |
| 每轮迭代采样数 | 每个 prompt 生成的候选回复数 | 通常 1~8 条,影响探索多样性 |
供需与市场数据
需求侧
- LLM 对齐是 RL 最大的产业需求来源:所有主流对话式 AI 产品(ChatGPT、Claude、Gemini、文心一言、通义千问等)均经历 RLHF 或其变体对齐流程 [各厂商公开技术报告]
- 推理类模型(如 o1 系列) 将 RL 从”行为对齐”扩展到”推理能力增强”,需求场景进一步扩大
- 具身智能(机器人) 是 RL 的另一个潜在大规模落地方向,但当前仍处于研发/小批量部署阶段
供给侧
- 算力:RLHF 训练高度依赖高端 GPU 集群。单次完整 RLHF 训练(从 SFT 到对齐完成)的算力消耗因模型规模和迭代轮次不同而差异巨大,但可占总训练成本的相当比例 [行业估算/未充分精确披露]
- 人类标注:高质量偏好数据是稀缺资源。专业 RLHF 标注团队薪资成本高,且需要严格的质量控制流程。头部厂商已大量采用 AI 辅助标注以降低成本
- 工程人才:能大规模实施 RLHF 分布式训练的工程团队在全球范围内仍然稀缺
市场格局
- RLHF/RL 对齐不是一个独立的可交易市场,而是嵌入在大模型训练成本结构中的关键环节
- 但其对算力消耗的拉动是可观测的:RLHF 的推理密集特性使 GPU 云服务的推理收入占比提升
- 合成数据 + AI 辅助标注正在重塑偏好数据的供给曲线,降低边际成本
代表公司与资本映射
| 公司/机构 | RL 角色 | 技术特点 | 资本相关 |
|---|---|---|---|
| OpenAI | RLHF 开创者 | PPO-based RLHF 是其核心竞争力之一 | 非上市,估值千亿美元级 |
| Anthropic | Constitutional AI (CAI) | 用 AI 反馈部分替代人类偏好标注 | 非上市,融资百亿美元级 |
| Google DeepMind | RL 学术先驱 | AlphaGo/AlphaZero/AlphaFold 系列 | Alphabet 子公司 |
| Meta (FAIR) | 开源 RL 工具链 | Open-source Llama 对齐方案,推动 RLHF 民主化 | META |
| Hugging Face | TRL 开源库 | 降低 RLHF 工程门槛 | 非上市 |
| NVIDIA | RL 训练算力底座 | GPU + NVLink 互联是 RLHF 集群的基础 | NVDA |
| 字节跳动/百度/阿里 | 中文大模型 RLHF 实践 | 基于自研基座的对齐管线 | 各有上市实体 |
投资映射逻辑:RL 不是直接可投资标的,但通过两条路径传导价值——① 拉动高端算力需求(利好 NVIDIA、云厂商);② 对齐质量决定 AI 产品竞争力(利好头部 AI 公司的用户留存和商业化)。
投资逻辑
核心判断
-
RL 是 AI 从”能力”到”产品”的必经之路。基座模型再强,不对齐就无法安全部署。这意味着 RL 相关算力需求具有结构性而非周期性。
-
推理算力的增量逻辑。RLHF 的在线推理阶段(生成候选回复)消耗大量推理算力,这与”训练完就只推理”的传统认知不同——RL 训练过程中本身就是推理的大客户。随着 o1 类推理模型兴起,推理链更长 → 单次推理算力更大 → RL 训练的推理需求进一步放大。
-
数据飞轮效应。RLHF 依赖人类偏好标注,头部厂商积累的高质量偏好数据和 RM 形成数据护城河——先发者 RM 更准 → 对齐更好 → 用户更多 → 收集更多偏好反馈 → RM 更准。
-
DPO 等简化路线降低了中小团队的参与门槛,但头部厂商在复杂对齐(安全、多轮、工具使用)上仍倾向 PPO 类在线 RL,技术差距可能扩大而非缩小。
风险因素
- Reward hacking 始终是工程风险:RM 不完美,优化过程可能找到 RM 的漏洞而非真正提升质量
- 监管不确定性:部分监管可能要求对齐过程可审计,纯 RL 迭代的黑箱特性可能面临挑战
- 技术路线迭代快:从 PPO 到 DPO 到 DPO+ 到 RLOO 到 KTO,技术路线仍在快速演进,押注单一方案有风险
常见误读纠偏
误读 1:“RLHF 就是让 AI 学会说话”
纠偏:RLHF 不教模型语言能力(那是预训练和 SFT 干的事),它教的是在多种可能的回复中,选择人类偏好的那种。打个比方:预训练给了模型一本百科全书,SFT 教它如何回答问题,RLHF 教它如何在”诚实但可能冒犯”和”讨好但不诚实”之间做正确选择。没有 RLHF,模型照样能说话,但可能有毒、偏见、不安全或答非所问。
误读 2:“RL 训练比 SFT 简单,就是打个分更新参数”
纠偏:RLHF 的工程复杂度远高于 SFT。SFT 只需一套模型做前向+反向,RLHF 需要四套模型(策略、参考、RM、价值函数)同时在线,且需要在线生成(推理)→ 打分 → 训练的循环。分布式协调、显存管理、超参数调优(KL 系数、clip 范围、学习率衰减)的复杂度是数量级的差异。这也是为什么很多开源模型在 SFT 上效果不错,但 RLHF 效果参差不齐——工程能力门槛极高。
误读 3:“DPO 会完全取代 PPO/RLHF”
纠偏:DPO 在简单指令遵循任务上效果接近 PPO 且成本更低,但在复杂安全对齐、多轮交互、需要在线探索的场景中,PPO 的优势仍然明显。当前头部厂商的实际做法多为混合方案:用 DPO 做初步对齐降低成本,再用 PPO 做精细调整。完全取代的说法过于简化。
误读 4:“RL 在大模型中主要用于对齐,跟推理能力无关”
纠偏:这个认知正在过时。o1 系列等推理增强模型的核心技术路径之一就是用 RL 优化思维链(chain-of-thought)的过程和结果。RL 不仅优化”说什么”,也开始优化”怎么想”——通过过程级奖励模型(Process RM)对推理链中的每一步打分,这是 RL 从”对齐工具”向”能力增强引擎”演进的重要方向。
学习路径
入门(建立直觉)
- 《Reinforcement Learning: An Introduction》(Sutton & Barto)—— RL 圣经,第 1-4 章建立基础概念(免费在线阅读)
- OpenAI Spinning Up(spinningup.openai.com)—— 极好的入门教程,从理论到代码
- David Silver 的 UCL 课程—— DeepMind 研究科学家的经典 RL 课程
进阶(理解核心算法)
- PPO 原始论文:Schulman et al., “Proximal Policy Optimization Algorithms”, 2017
- InstructGPT 论文:Ouyang et al., “Training language models to follow instructions with human feedback”, 2022 —— RLHF 的里程碑
- DPO 论文:Rafailov et al., “Direct Preference Optimization”, 2023
- 实践:用 HuggingFace TRL 库跑一个小型 RLHF 流程
专家(工程与前沿)
- DeepSpeed-Chat / OpenRLHF / veRL—— 大规模分布式 RLHF 工程实现
- Process Reward Models:Lightman et al., “Let’s Verify Step by Step”, 2023
- 追踪最新动态:arXiv RL 标签、ICML/NeurIPS RL track、Lilian Weng 的博客
一句话总结
强化学习是 AI 能力从”识别”到”决策”跃迁的核心算法引擎,在大模型时代通过 RLHF 成为将通用智能转化为可部署产品的关键一环,其对推理算力和高质量偏好数据的结构性需求,使其成为 AI 产业链中不可忽视的隐性驱动力。
延伸阅读与来源
| 来源 | 内容 | 链接/备注 |
|---|---|---|
| Sutton & Barto | RL 经典教材 | http://incompleteideas.net/book/the-book.html |
| Schulman et al., 2017 | PPO 论文 | arXiv:1707.06347 |
| Ouyang et al., 2022 | InstructGPT / RLHF 论文 | arXiv:2203.02155 |
| Rafailov et al., 2023 | DPO 论文 | arXiv:2305.18290 |
| Lightman et al., 2023 | Process Reward Models | arXiv:2305.20050 |
| OpenAI Spinning Up | RL 入门教程 | https://spinningup.openai.com |
| HuggingFace TRL | RLHF 开源工具库 | https://github.com/huggingface/trl |
| Anthropic, 2022 | Constitutional AI 论文 | arXiv:2212.08073 |
| Christiano et al., 2017 | Deep RL from Human Preferences | arXiv:1706.03741(RLHF 思想源头) |
| OpenRLHF | 开源大规模 RLHF 框架 | https://github.com/OpenRLHF/OpenRLHF |
免责声明:本文为技术概念学习材料,不构成投资建议。涉及公司的具体技术实现细节以各公司官方披露为准,未充分披露的部分已明确标注。