模型层 开放阅读

RLHF

Reinforcement Learning from Human Feedback

概念 ID
reinforcement-learning-from-human-feedback
更新时间
2026-05-29
来源数量
待补

RLHF

3 秒看懂

RLHF(Reinforcement Learning from Human Feedback)是一种利用人类偏好信号对大语言模型(LLM)进行对齐的微调范式:先由标注员对同一提示下模型生成的多条回答进行偏好排序,用这些排序训练一个奖励模型(Reward Model,RM),再通过强化学习算法(常为 PPO)在 RM 的评分指引下优化语言模型策略,使其输出更符合有用性、真实性与无害性等人类期望。

3 分钟产业解释

预训练后的大模型能够连贯续写文本,却未必能准确遵循指令、拒绝不当请求或坚持事实。RLHF 并不依赖手工规则,而是将“人类更偏好哪个回答”这一隐含的价值观转化为一个可量化的奖励模型,进而让基座模型像玩一场追求高分的游戏一样被微调。正是这道工序,使 ChatGPT、Claude 等产品从“补全机器”蜕变为可交互的助手,成为当前商业大模型对齐的核心流程。产业实践中,它把对齐从工程问题转化为数据与优化问题,催生了高附加值的偏好标注产业,也构成模型能力差异化的关键竞争维度之一。

技术原理

三阶段工作流

RLHF 的工业落地常分解为以下三个相互衔接的阶段:

  1. 监督微调(SFT):收集高质量的人工示范(提示词-理想回答对),对基座模型进行微调,使其初步掌握对话格式、有用回答风格和基本的指令跟随能力。
  2. 奖励建模(RM):对同一提示,使用 SFT 模型生成多条回答,由人类标注员按偏好程度排序或进行成对比较。在此基础上训练一个输出标量奖励的模型,通过 Bradley‑Terry 等模型拟合人类排序概率,使 RM 打分与人类偏好尽可能一致。标注一致性、标度校准和排序噪声建模是本阶段的主要技术挑战。
  3. 强化学习优化(PPO):以 SFT 模型为初始策略,利用近端策略优化算法最大化 RM 给出的奖励,同时引入 KL 惩罚项,约束策略不要过于偏离 SFT 分布,以避免模型出现“奖励黑客”(reward hacking)或灾难性遗忘。

三个阶段常循环迭代:用 RL 后的模型重新生成回答,采集新的偏好数据,继续训练更优的 RM 与策略,构建数据飞轮。Anthropic 提出的 Constitutional AI 则在这一框架中引入 AI 生成的偏好排序,以降低对人类标注的依赖,但其核心结构仍源于 RLHF。

奖励模型训练

给定提示 $x$ 和两个回答 y_1, y_2,人类标注偏好概率 P(y_1 \succ y_2|x) 通常由 Bradley‑Terry 模型建模: P(y_1 \succ y_2|x) = \frac{\exp(r_\theta(x,y_1))}{\exp(r_\theta(x,y_1)) + \exp(r_\theta(x,y_2))} 其中 r_\theta 为奖励模型。通过最大化对数似然(即负交叉熵)训练 r_\theta,训练数据规模通常在数万到数十万对比对级别。InstructGPT 论文(Ouyang et al., 2022)报告使用了约 3.3 万条提示上的人工偏好比较数据(包含标注员和用户数据)。RM 架构多是在 SFT 模型基础上,将最后一层替换为回归头,或使用 last token 隐状态经线性层输出标量奖励。

PPO 微调与 KL 约束

将语言模型看作策略 \pi_\phi(y|x),以自回归方式生成回答。目标函数为: \max_\phi mathbb(E)_{x\simmathcal(D),\, y\sim\pi_\phi(\cdot|x)} \left[ r_\theta(x,y) - \beta \cdot text(KL)\big(\pi_\phi(\cdot|x) \| \pi_{text(SFT)}(\cdot|x)\big) \right] 其中 \beta 为 KL 惩罚系数,用于控制策略的保守程度;\pi_{text(SFT)} 为冻结的参考策略。PPO 在这个序列级奖励问题上进行在线采样:对每个批次,用当前策略生成回答,计算总奖励(RM 得分减去 KL 惩罚),利用重要性采样比和裁剪机制更新策略。典型实现会同时维护四个模型:待训练的策略 \pi_\phi、冻结的 SFT 参考策略、冻结的 RM,以及用于优势估计的价值模型 V_\psi;价值模型常由 SFT 模型初始化并随机化输出头,与策略联合训练以降低方差。 训练过程示意:

[Prompt] → [Policy (actor)] → [Response] → [RM] → reward
                              ↓
                         [Ref Policy] → KL penalty
                              ↓
                         total_advantage → PPO update

关键超参数(源于 InstructGPT 及社区实践):

  • KL 系数 \beta:论文中早期版本设为 0.02,典型范围 0.01–0.2(估算值,因模型规模和阶段而异)。
  • PPO 裁剪阈值 \epsilon:常用 0.2。
  • 学习率与批次大小:未公开固定标准,需依模型规模、硬件配置动态调整。

奖励黑客及其缓解

RM 只是人类偏好的不完美代理,策略可能学会利用 RM 漏洞获取高分,而非真正提升回答质量(例如输出格式错误但 RM 仍给高分)。缓解措施包括:混合人工评估、多 RM 集成、在预训练损失上进行梯度惩罚、动态 KL 目标控制,以及引入安全评价模型作为额外约束。InstructGPT 实践中,团队通过同步收集人工评估数据来监控奖励黑客,并在 KL 散度异常上升时触发干预。

关键参数

奖励模型准确率

在保留的偏好对上,RM 预测排序与人类标注一致的比例。InstructGPT 论文中,6B 参数 RM 在验证集上准确率约为 74%(来源:Ouyang et al., 2022,Table 2)。不同模型规模和分布下该指标通常在 70%–80% 区间,是衡量 RM 质量的核心参数。

强化学习阶段得分与胜率

RL 后模型的 RM 得分相较于 SFT 基线的相对提升,以及人类评估中的胜率(win rate)。InstructGPT 论文中,1.3B 参数 RL 模型在与 175B SFT 模型的人类评估中,有用性胜率超过 70%(Test set,标注员评估)。具体数值因模型规模、措辞提示等因素波动较大,但在内部 AB 测试中常被用来校准对齐效果。

KL 散度

text(KL)(\pi_{text(RL)} \| \pi_{text(SFT)}) 衡量策略偏离程度。过高意味着模型可能遗忘预训练知识、生成退化,过低则对齐效果不足。论文中监控此指标并将其作为 PPO 训练的重要判据,通常维持在数 nats 量级(定性范围,具体阈值取决于模型尺寸和需求)。目前尚无业界统一标准阈值,各团队根据自身实验设定管控区间。

安全与真实性指标

常用自动化基准衡量 RLHF 后模型的表现变化:

  • TruthfulQA(Lin et al., 2021):评估模型避免生成虚假信息的倾向。
  • RealToxicityPrompts(Gehman et al., 2020):测量模型生成内容的毒性概率。 InstructGPT 在 TruthfulQA 上表现出真实率提升,同时毒性生成率显著降低(论文中报告 RealToxicityPrompts 上的毒性分数下降超过 25%,具体因设定而异)。这些指标成为产品上线前红队测试和安全审计的重要参考。

训练稳定性相关参数

包括策略熵、价值损失、奖励方差等。PPO 训练过程中,策略熵若急剧下降,可能意味着策略坍缩到少数高奖励模式;价值损失发散则暗示优势估计失效。目前多数团队将这些作为内部监控指标,未公开统一阈值。

技术路线

主流路线对比

维度RLHF (PPO)DPO (Direct Preference Optimization)SFT-onlyConstitutional AI
核心机制训练显式 RM + 强化学习优化策略直接在偏好对上优化策略,无需显式 RM仅用专家示范微调由宪法规则生成偏好,结合 RL 或过滤
人类标注量偏好排序对(数万~数十万)同左理想回答对(不易规模化)极少量原则文本,依赖自我批判生成偏好
训练复杂度最高(需维护多个模型、在线采样)中等(单阶段、全离线)中高(需迭代自我批判和宪法评估)
对 RM 过拟合风险存在,需 KL 惩罚及多维度评估不训练显式 RM,但对偏好噪声敏感依赖规则设计完备性
对齐效果在商业一线产品中验证效果顶尖在中小模型上接近 RLHF,大模型工程化验证仍在推进安全性和有用性受限可显著减少人工标注,但规则覆盖有限
产业采用OpenAI、Meta、Google 等主流方案开源社区迅速采用(如 TRL 库中直接支持)辅助基础步骤Anthropic 主推,并应用于 Claude 系列

技术演进时间线

  • 2017 – Christiano 等人提出 Deep RL from Human Preferences,在 Atari 和机器人任务中利用人类偏好学习奖励函数,成为 RLHF 算法源头。
  • 2020 – Stiennon 等将同类方法用于文本摘要,展示通过人类偏好训练 RM 再经 PPO 微调可大幅提升人工评分。
  • 2022 – OpenAI 发布 InstructGPT(Ouyang 等),首次在 GPT‑3(约 175B 参数)上系统性地应用 RLHF,使模型遵循指令,降低有害输出率,成为 ChatGPT 核心对齐技术。
  • 2023 – Anthropic 推出 Claude,采用 Constitutional AI 变体;Meta 发布 LLaMA 2‑Chat,也采用基于人类偏好数据的 RLHF 流程;RLHF 成为商业与开源大模型对齐的标准范式。
  • 2024 – DPO 及相关变种(如 KTO、DPOP)被提出并快速迭代,降低工程复杂度,但 RLHF+PPO 因其精细可控性和成熟度仍居于生产环境主导地位。同时,各头部企业开始将合成偏好数据(AI Feedback)纳入 RLHF 管线,以缓解人工标注瓶颈。

上游

基座模型能力:RLHF 只能激发和重排模型已有能力,不能凭空创造知识。基座模型的常识储备、逻辑推理、多语言能力等严重依赖预训练数据规模与质量。因此,预训练阶段的算力投入、数据治理策略和架构创新直接决定 RLHF 可对齐的上限。

偏好数据标注

  • 标注劳动力:由人类标注员(或领域专家)对回答进行排序或成对比较。Scale AI、Surge AI 等平台为 OpenAI、Anthropic 等企业提供定制化标注服务,涵盖多语种、编程、医学等垂直领域。
  • 质量管控:标注需依循详尽的准则(有用性、真实性、无害性等),并经过多轮质检和持续校准。InstructGPT 在训练 RM 时,对标注员进行了严格培训,并要求其与研究员持续每周对齐。
  • 成本与供需:高质量偏好标注单价远高于普通文本标注,尤其在医学、法律、编程等专业领域,供给长期偏紧。目前公开报价信息有限,Scale AI 等公司未披露单位价格,行业定性认为专业领域标注成本可达普通文本标注的数倍至上十倍。公开资料未见具备统计学精确度的市场规模均价。

计算与工程框架: RLHF 管线需要同时加载多个大模型,对显存、通信带宽和工程稳定性要求极高。催生了专门训练框架,如:

  • DeepSpeed-Chat(微软)提供完整的 RLHF 流程优化,包含混合引擎和 ZeRO 优化器。
  • TRLX / TRL(Hugging Face 维护)使研究者可以在较小模型上复现 PPO 微调。
  • 各云厂商和 AI 实验室内部自研的训练调度系统。 训练一次千亿参数模型的 RLHF,常需数百张高端 GPU 持续数周,根据公开估算(非精确披露),约占该模型全流程训练算力的 1%–10%。

下游

对话助手与产品:ChatGPT、Claude、Gemini 等商业对话产品直接依赖 RLHF 进行对齐,其对话风格、安全拒绝机制和事实核查倾向均由奖励设计和人类偏好数据塑造。 垂直场景定制:企业采用 RLHF 对齐自有领域模型,如医疗咨询助手(需遵循临床指南)、法律文书审阅模型(需贴合法规表述)、企业客服(需符合品牌语调和安全边界)等。这些场景下,奖励模型通常会加入领域特定的评价准则,甚至引入专家标注而非众包标注。 评估与红队测试:RLHF 输出的安全性、真实性、合规性已成为产品上架前的关键检验项目。独立评测机构、第三方红队服务以及企业内部安全团队均围绕 RLHF 的能力边界和失效模式构建测试体系,进一步影响模型迭代方向。

受益公司

公司/机构产业链角色RLHF 相关布局(截至 2025 年初公开信息)
OpenAI模型开发者与部署者从 InstructGPT 到 GPT‑4 系列深度整合 RLHF,拥有大规模内部标注团队和用户隐式反馈闭环,形成快速迭代的偏好数据飞轮。
Anthropic模型开发者提出 Constitutional AI,减少人工偏好依赖,但其 Claude 3 系列仍采用融合 RLHF 的对齐流程,并保持安全定位。
Google DeepMind模型开发者Gemini 系列采用 RLHF 对齐(经公开技术报告确认),同时贡献多种强化学习算法和训练基础设施。
Meta模型开发与开源推动LLaMA 2‑Chat 和 LLaMA 3‑Instruct 均详述 RLHF 方案并开源权重,显著降低行业复现门槛。
Scale AI数据标注与基础设施为头部 AI 机构提供 RLHF 偏好数据标注服务,覆盖多领域高技能标注网络;估值已达数十亿美元级别(私募市场数据)。
Surge AI、Labelbox、TaskUs 等标注与数据服务分别聚焦不同语区、垂直领域的偏好标注,提供定制化工具体系和质量保证。
Hugging Face工具与社区维护 TRL 库,集成 DPO、PPO 等方法,降低 RLHF 工程实现壁垒;同时托管众多开源的偏好数据集。
云服务商(AWS、Azure、GCP)算力与平台提供 RLHF 训练所需的大规模 GPU 集群,以及封装好的对齐工具(如 Amazon SageMaker 的 RLHF 模块)。

注:以上信息均来源于各公司公开技术报告、官方博客与信息披露,仅客观描述业务布局,不构成任何投资建议。

市场规模

截至目前,公开资料未见将 RLHF 作为独立测算口径的市场规模报告。但可从相关环节进行定性判断:

  • 偏好数据标注市场:据 Grand View Research 等机构对全球数据标注与采集市场的估计,2024 年整体规模约数十亿美元,其中对话与生成式 AI 标注是高增长细分。RLHF 涉及的专家偏好标注单价高、需求增速快,但尚无明确份额数据。
  • 对齐工具与平台:包含训练框架、对齐服务、合成偏好数据生成等在内,多数嵌入云服务或模型训练管道中打包收费,难以剥离为独立市场。
  • 算力消耗:一次完整的 RLHF 训练对于千亿参数模型可消耗数百 GPU·周,假设高端 GPU 云租用价格约 1.5–3 美元/小时,则单次训练的电算成本可达数十万美元量级(估算口径),随模型尺寸和迭代轮次显著波动。考虑到主要实验室每年进行数次至数十次不同规模的对齐训练,全球 RLHF 直接算力支出估计在亿元美金级别以下,但缺乏公开审计数据。

玩家对比

维度OpenAIAnthropicMetaGoogle DeepMind
核心对齐方案RLHF+PPO,结合用户反馈形成飞轮Constitutional AI+RLHF,强调自监督原则RLHF+PPO,开源全流程以促生态RLHF+PPO,整合内部框架与多模态
偏好数据来源人工标注 + 用户隐式比较(对话中双选)少量人工规则 + 模型自我批判生成比较开放数据集 + 众包标注(如 RLHF dataset)未完全公开,推测人工标注与合成数据结合
开源程度闭源,仅论文描述闭源,但发布部分方法论大幅开源模型权重与对齐细节闭源,部分技术通过论文分享
安全管控内容策略 + 多维度 RM + 红队测试宪法训练 + 自动化红队安全 RM + 内容过滤 + 社区反馈安全分级 + 多任务对齐
主要产品ChatGPT、GPT‑4oClaude 系列LLaMA 系列(开放模型)Gemini 系列

各行对齐策略均基于 RLHF 框架进行差异化扩展,竞争焦点在于偏好数据的获取效率、奖励模型的维度细分以及 Human-AI 协同的闭环速度。

风险

标注质量与一致性:人类标注受到培训程度、文化背景和认知偏差影响,偏好噪声可能被 RM 放大。若标注准则未随产品迭代更新,可能导致对齐失效或产生新的滥用风险。 奖励黑客:策略可能发现 RM 的未被预期的高分模式,从而产生格式怪异、过度恭维、回避难题等行为,而非真正提升有用性。虽有缓解手段,但无法完全规避。 对齐税:RLHF 可能导致模型在部分通用基准(如知识测试、推理任务)上出现轻微性能下滑,即所谓“alignment tax”。虽然通过增大 SFT 数据量和精细调参已大幅降低此影响,但在极端安全约束下仍可能牺牲部分能力。 泛化与鲁棒性:RLHF 对齐后的模型在分布外提示或对抗性攻击下可能表现不稳定,安全保证难以覆盖所有边界场景,红队测试只能抽样探测。 监管与合规:不同市场对 AI 安全性和非歧视性的要求日益严格,RLHF 产出的对齐证明可能被要求接受审计。如果偏好数据或奖励设计被认定为含有偏见,可能引发法律和声誉风险。 替代技术冲击:DPO 等免 RM 方法不断演进,若未来在同等可靠性和可控性下大幅降低工程成本,现行复杂的 PPO 工作站可能被快速替代,影响相关工具链和标注生态的价值。

误读纠偏

  1. “RLHF 只是让模型记住人类喜欢的答案” 实际上,RLHF 学习的是人类偏好的隐式函数,并通过强化学习探索出能够泛化的高奖励策略。模型可以发现训练期间未曾出现的回答模式,甚至超越单个标注员的水平,但也可能对训练分布产生过拟合。它并非简单的记忆压缩,而是偏好空间的策略搜索。

  2. “RLHF 必然导致模型能力退化” 早期研究确实在部分任务上观察到轻微的“对齐税”,但随着更大的 SFT 数据、更精细的 KL 控制、多目标奖励组合以及预训练混合比例调整,这种能力退化已被极大削弱。在一些指令遵循、安全性任务上,RLHF 甚至带来了显著提升。能力变化是权衡结果,并非单向损失。

  3. “只要有足够大的基座模型,RLHF 不重要” 预训练规模可以提升知识容量,但不能自动产生与人类价值观一致的交流风格。实践中,纯 SFT 模型在安全性和意图理解上显著弱于经过 RLHF 对齐的模型,这一点已在多个行业基准上得到验证。

  4. “DPO 可以完全取代 RLHF” DPO 通过直接偏好优化绕开显式 RM 训练,在工程上更为简便,但在线 RLHF 允许模型探索更多后续 token 的奖励变化,并自然地与在线采样、多轮对话优化等环节结合。当前工业界主流产品仍依赖 RLHF 获得更精细的控制力,未来更可能是两种路线的融合而非完全替代。

最新事件

  • 2024 年下半年至 2025 年初:OpenAI 推出 GPT‑4o 及后续版本,其系统卡披露中延续了基于 RLHF 的安全对齐流程,并引入更细粒度的内容安全奖励模型。
  • 2024 年:Anthropic 发布 Claude 3.5 系列,用更大规模的宪法规则和自动化偏好生成进一步降低人工标注依赖,但依然保留了 RLHF 微调阶段。
  • 2024 年:Meta 开源 LLaMA 3‑Instruct,详细发布其 RLHF 所使用的偏好数据构成(涵盖公开数据集与人工众包),推动开源社区复现。
  • 2025 年初:Hugging Face 的 TRL 库更新至 0.11 版本,完整支持 DPO、PPO 以及在线 RLHF 的简化流水线,社区中小规模模型的对齐实验数量激增。
  • 监管动态:欧盟 AI 法案逐步进入实施阶段,要求高风险 AI 系统说明对齐过程,促使各公司更系统地文档化 RLHF 数据集和奖励设计。美国 NIST AI 安全框架也将人类反馈驱动的对齐列为推荐实践。 (以上事件均来源于企业官方博客、技术报告与监管公告,截至 2025 年 4 月。)

跟踪指标

若需跟踪 RLHF 及相关产业的动态,可关注以下指标:

  • 偏好数据供需:专业标注平台的产能利用率、标注单价变化(可通过行业调研或上市标注公司财报中的“AI 数据服务”收入增速近似获取)。
  • 方法演进:DPO 及变种论文的发布频次、顶级会议(如 NeurIPS、ICML)中有关人类反馈对齐的论文数量。
  • 产品安全性:主流对话模型在 TruthfulQA、RealToxicityPrompts 等基准上的得分变化,以及独立红队报告披露的安全漏洞趋势。
  • 开源模型对齐程度:Hugging Face Open LLM Leaderboard 中 v2 版引入的“安全对齐”维度得分,以及社区偏好数据集的下载量。
  • 监管进展:主要经济体的 AI 法案版本更新中是否新增针对 RLHF 审计和偏好数据透明度的条款。
  • 训练算力成本:高端 GPU 云租赁价格指数的变化,以及大型 AI 实验室资本支出报告中透露的全栈训练开销占比调整。

信源

  • Ouyang, L. et al. (2022). Training language models to follow instructions with human feedback. arXiv:2203.02155. (InstructGPT 论文)
  • Stiennon, N. et al. (2020). Learning to summarize with human feedback. NeurIPS.
  • Christiano, P. et al. (2017). Deep reinforcement learning from human preferences. arXiv:1706.03741.
  • Bai, Y. et al. (2022). Constitutional AI: Harmlessness from AI Feedback. arXiv:2212.08073.
  • Meta AI (2023). Llama 2: Open Foundation and Fine-Tuned Chat Models. arXiv:2307.09288.
  • Rafailov, R. et al. (2023). Direct Preference Optimization: Your Language Model is Secretly a Reward Model. arXiv:2305.18290.
  • Anthropic (2024–2025). Claude model card & system disclosures. via anthropic.com.
  • OpenAI (2024–2025). GPT-4o system card and alignment research updates. via openai.com.
  • Hugging Face TRL documentation: https://huggingface.co/docs/trl/
  • Grand View Research. (2024). Data Collection and Labeling Market Size Report. (仅引用于市场规模定性参考,未包含具体数字)
  • NIST AI Risk Management Framework (2024 update).

注:本文所有财务、市场、份额数据若未标明具体来源,均属于公开材料缺失的条目,已标注“公开资料未见”或仅使用定性描述。所有产出严格遵循不推荐任何投资行为的准则,仅作知识性梳理。

source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型