模型層 開放閱讀

RLHF

Reinforcement Learning from Human Feedback

概念 ID
reinforcement-learning-from-human-feedback
更新時間
2026-05-29
來源數量
待補

RLHF

3 秒看懂

RLHF(Reinforcement Learning from Human Feedback)是一種利用人類偏好訊號對大語言模型(LLM)進行對齊的微調範式:先由標註員對同一提示下模型生成的多條回答進行偏好排序,用這些排序訓練一個獎勵模型(Reward Model,RM),再通過強化學習演算法(常為 PPO)在 RM 的評分展望下最佳化語言模型策略,使其輸出更符合有用性、真實性與無害性等人類期望。

3 分鐘產業解釋

預訓練後的大型模型能夠連貫續寫文本,卻未必能準確遵循指令、拒絕不當請求或堅持事實。RLHF 並不依賴手工規則,而是將“人類更偏好哪個回答”這一隱含的價值觀轉化為一個可量化的獎勵模型,進而讓基座模型像玩一場追求高分的遊戲一樣被微調。正是這道工序,使 ChatGPT、Claude 等產品從“補全機器”蛻變為可互動的助手,成為當前商業大型模型對齊的核心流程。產業實踐中,它把對齊從工程問題轉化為資料與最佳化問題,催生了高附加值的偏好標註產業,也構成模型能力差異化的關鍵競爭維度之一。

技術原理

三階段工作流

RLHF 的工業落地常分解為以下三個相互銜接的階段:

  1. 監督微調(SFT):收集高質量的人工示範(提示詞-理想回答對),對基座模型進行微調,使其初步掌握對話格式、有用回答風格和基本的指令跟隨能力。
  2. 獎勵建模(RM):對同一提示,使用 SFT 模型生成多條回答,由人類標註員按偏好程度排序或進行成對比較。在此基礎上訓練一個輸出標量獎勵的模型,通過 Bradley‑Terry 等模型擬合人類排序機率,使 RM 打分與人類偏好儘可能一致。標註一致性、標度校準和排序噪聲建模是本階段的主要技術挑戰。
  3. 強化學習最佳化(PPO):以 SFT 模型為初始策略,利用近端策略最佳化演算法最大化 RM 給出的獎勵,同時引入 KL 懲罰項,約束策略不要過於偏離 SFT 分佈,以避免模型出現“獎勵駭客”(reward hacking)或災難性遺忘。

三個階段常迴圈迭代:用 RL 後的模型重新生成回答,採集新的偏好資料,繼續訓練更優的 RM 與策略,建置資料飛輪。Anthropic 提出的 Constitutional AI 則在這一架構中引入 AI 生成的偏好排序,以降低對人類標註的依賴,但其核心結構仍源於 RLHF。

獎勵模型訓練

給定提示 $x$ 和兩個回答 y_1, y_2,人類標註偏好機率 P(y_1 \succ y_2|x) 通常由 Bradley‑Terry 模型建模: P(y_1 \succ y_2|x) = \frac{\exp(r_\theta(x,y_1))}{\exp(r_\theta(x,y_1)) + \exp(r_\theta(x,y_2))} 其中 r_\theta 為獎勵模型。通過最大化對數似然(即負交叉熵)訓練 r_\theta,訓練資料規模通常在數萬到數十萬對比對級別。InstructGPT 論文(Ouyang et al., 2022)報告使用了約 3.3 萬條提示上的人工偏好比較資料(包含標註員和使用者資料)。RM 架構多是在 SFT 模型基礎上,將最後一層替換為迴歸頭,或使用 last token 隱狀態經線性層輸出標量獎勵。

PPO 微調與 KL 約束

將語言模型看作策略 \pi_\phi(y|x),以自迴歸方式生成回答。目標函式為: \max_\phi mathbb(E)_{x\simmathcal(D),\, y\sim\pi_\phi(\cdot|x)} \left[ r_\theta(x,y) - \beta \cdot text(KL)\big(\pi_\phi(\cdot|x) \| \pi_{text(SFT)}(\cdot|x)\big) \right] 其中 \beta 為 KL 懲罰係數,用於控制策略的保守程度;\pi_{text(SFT)} 為凍結的參考策略。PPO 在這個序列級獎勵問題上進行線上取樣:對每個批次,用當前策略生成回答,計算總獎勵(RM 得分減去 KL 懲罰),利用重要性取樣比和裁剪機制更新策略。典型實現會同時維護四個模型:待訓練的策略 \pi_\phi、凍結的 SFT 參考策略、凍結的 RM,以及用於優勢估計的價值模型 V_\psi;價值模型常由 SFT 模型初始化並隨機化輸出頭,與策略聯合訓練以降低方差。 訓練過程示意:

[Prompt] → [Policy (actor)] → [Response] → [RM] → reward

                         [Ref Policy] → KL penalty

                         total_advantage → PPO update

關鍵超引數(源於 InstructGPT 及社群實踐):

  • KL 係數 \beta:論文中早期版本設為 0.02,典型範圍 0.01–0.2(估算值,因模型規模和階段而異)。
  • PPO 裁剪閾值 \epsilon:常用 0.2。
  • 學習率與批次大小:未公開固定標準,需依模型規模、硬體配置動態調整。

獎勵駭客及其緩解

RM 只是人類偏好的不完美代理,策略可能學會利用 RM 漏洞獲取高分,而非真正提升回答質量(例如輸出格式錯誤但 RM 仍給高分)。緩解措施包括:混合人工評估、多 RM 整合、在預訓練損失上進行梯度懲罰、動態 KL 目標控制,以及引入安全評價模型作為額外約束。InstructGPT 實踐中,團隊通過同步收集人工評估資料來監控獎勵駭客,並在 KL 散度異常上升時觸發干預。

關鍵引數

獎勵模型準確率

在保留的偏好對上,RM 預測排序與人類標註一致的比例。InstructGPT 論文中,6B 引數 RM 在驗證集上準確率約為 74%(來源:Ouyang et al., 2022,Table 2)。不同模型規模和分佈下該指標通常在 70%–80% 區間,是衡量 RM 質量的核心引數。

強化學習階段得分與勝率

RL 後模型的 RM 得分相較於 SFT 基線的相對提升,以及人類評估中的勝率(win rate)。InstructGPT 論文中,1.3B 引數 RL 模型在與 175B SFT 模型的人類評估中,有用性勝率超過 70%(Test set,標註員評估)。具體數值因模型規模、措辭提示等因素波動較大,但在內部 AB 測試中常被用來校準對齊效果。

KL 散度

text(KL)(\pi_{text(RL)} \| \pi_{text(SFT)}) 衡量策略偏離程度。過高意味著模型可能遺忘預訓練知識、生成退化,過低則對齊效果不足。論文中監控此指標並將其作為 PPO 訓練的重要判據,通常維持在數 nats 量級(定性範圍,具體閾值取決於模型尺寸和需求)。目前尚無業界統一標準閾值,各團隊根據自身實驗設定管控區間。

安全與真實性指標

常用自動化基準衡量 RLHF 後模型的表現變化:

  • TruthfulQA(Lin et al., 2021):評估模型避免生成虛假資訊的傾向。
  • RealToxicityPrompts(Gehman et al., 2020):測量模型生成內容的毒性機率。 InstructGPT 在 TruthfulQA 上表現出真實率提升,同時毒性生成率顯著降低(論文中報告 RealToxicityPrompts 上的毒性分數下降超過 25%,具體因設定而異)。這些指標成為產品上線前紅隊測試和安全審計的重要參考。

訓練穩定性相關引數

包括策略熵、價值損失、獎勵方差等。PPO 訓練過程中,策略熵若急劇下降,可能意味著策略坍縮到少數高獎勵模式;價值損失發散則暗示優勢估計失效。目前多數團隊將這些作為內部監控指標,未公開統一閾值。

技術路線

主流路線對比

維度RLHF (PPO)DPO (Direct Preference Optimization)SFT-onlyConstitutional AI
核心機制訓練顯式 RM + 強化學習最佳化策略直接在偏好對上最佳化策略,無需顯式 RM僅用專家示範微調由憲法規則生成偏好,結合 RL 或過濾
人類標註量偏好排序對(數萬~數十萬)同左理想回答對(不易規模化)極少量原則文本,依賴自我批判生成偏好
訓練複雜度最高(需維護多個模型、線上取樣)中等(單階段、全離線)中高(需迭代自我批判和憲法評估)
對 RM 過擬合風險存在,需 KL 懲罰及多維度評估不訓練顯式 RM,但對偏好噪聲敏感依賴規則設計完備性
對齊效果在商業一線產品中驗證效果頂尖在中小模型上接近 RLHF,大型模型工程化驗證仍在推進安全性和有用性受限可顯著減少人工標註,但規則覆蓋有限
產業採用OpenAI、Meta、Google 等主流方案開源社群迅速採用(如 TRL 庫中直接支援)輔助基礎步驟Anthropic 主推,並應用於 Claude 系列

技術演進時間線

  • 2017 – Christiano 等人提出 Deep RL from Human Preferences,在 Atari 和機器人任務中利用人類偏好學習獎勵函式,成為 RLHF 演算法源頭。
  • 2020 – Stiennon 等將同類方法用於文本摘要,展示通過人類偏好訓練 RM 再經 PPO 微調可大幅提升人工評分。
  • 2022 – OpenAI 釋出 InstructGPT(Ouyang 等),首次在 GPT‑3(約 175B 引數)上系統性地應用 RLHF,使模型遵循指令,降低有害輸出率,成為 ChatGPT 核心對齊技術。
  • 2023 – Anthropic 推出 Claude,採用 Constitutional AI 變體;Meta 釋出 LLaMA 2‑Chat,也採用基於人類偏好資料的 RLHF 流程;RLHF 成為商業與開源大型模型對齊的標準範式。
  • 2024 – DPO 及相關變種(如 KTO、DPOP)被提出並快速迭代,降低工程複雜度,但 RLHF+PPO 因其精細可控性和成熟度仍居於生產環境主導地位。同時,各頭部企業開始將合成偏好資料(AI Feedback)納入 RLHF 管線,以緩解人工標註瓶頸。

上游

基座模型能力:RLHF 只能激發和重排模型已有能力,不能憑空創造知識。基座模型的常識儲備、邏輯推論、多語言能力等嚴重依賴預訓練資料規模與質量。因此,預訓練階段的算力投入、資料治理策略和架構創新直接決定 RLHF 可對齊的上限。

偏好資料標註

  • 標註勞動力:由人類標註員(或領域專家)對回答進行排序或成對比較。Scale AI、Surge AI 等平台為 OpenAI、Anthropic 等企業提供定製化標註服務,涵蓋多語種、程式設計、醫學等垂直領域。
  • 質量管控:標註需依循詳盡的準則(有用性、真實性、無害性等),並經過多輪質檢和持續校準。InstructGPT 在訓練 RM 時,對標註員進行了嚴格培訓,並要求其與研究員持續每週對齊。
  • 成本與供需:高質量偏好標註單價遠高於普通文本標註,尤其在醫學、法律、程式設計等專業領域,供給長期偏緊。目前公開報價資訊有限,Scale AI 等公司未揭露單位價格,行業定性認為專業領域標註成本可達普通文本標註的數倍至上十倍。公開資料未見具備統計學精確度的市場規模均價。

計算與工程架構: RLHF 管線需要同時載入多個大型模型,對視訊記憶體、通訊頻寬和工程穩定性要求極高。催生了專門訓練架構,如:

  • DeepSpeed-Chat(微軟)提供完整的 RLHF 流程最佳化,包含混合引擎和 ZeRO 最佳化器。
  • TRLX / TRL(Hugging Face 維護)使研究者可以在較小模型上覆現 PPO 微調。
  • 各雲端廠商和 AI 實驗室內部自研的訓練排程系統。 訓練一次千億引數模型的 RLHF,常需數百張高階 GPU 持續數週,根據公開估算(非精確揭露),約佔該模型全流程訓練算力的 1%–10%。

下游

對話助手與產品:ChatGPT、Claude、Gemini 等商業對話產品直接依賴 RLHF 進行對齊,其對話風格、安全拒絕機制和事實核查傾向均由獎勵設計和人類偏好資料塑造。 垂直場景定製:企業採用 RLHF 對齊自有領域模型,如醫療諮詢助手(需遵循臨床指南)、法律文書審閱模型(需貼合法規表述)、企業客服(需符合品牌語調和安全邊界)等。這些場景下,獎勵模型通常會加入領域特定的評價準則,甚至引入專家標註而非眾包標註。 評估與紅隊測試:RLHF 輸出的安全性、真實性、合規性已成為產品上架前的關鍵檢驗專案。獨立評測機構、第三方紅隊服務以及企業內部安全團隊均圍繞 RLHF 的能力邊界和失效模式建置測試體系,進一步影響模型迭代方向。

受益公司

公司/機構產業鏈角色RLHF 相關版面配置(截至 2025 年初公開資訊)
OpenAI模型開發者與部署者從 InstructGPT 到 GPT‑4 系列深度整合 RLHF,擁有大規模內部標註團隊和使用者隱式反饋閉環,形成快速迭代的偏好資料飛輪。
Anthropic模型開發者提出 Constitutional AI,減少人工偏好依賴,但其 Claude 3 系列仍採用融合 RLHF 的對齊流程,並保持安全定位。
Google DeepMind模型開發者Gemini 系列採用 RLHF 對齊(經公開技術報告確認),同時貢獻多種強化學習演算法和訓練基礎設施。
Meta模型開發與開源推動LLaMA 2‑Chat 和 LLaMA 3‑Instruct 均詳述 RLHF 方案並開源權重,顯著降低行業復現門檻。
Scale AI資料標註與基礎設施為頭部 AI 機構提供 RLHF 偏好資料標註服務,覆蓋多領域高技能標註網路;估值已達數十億美元級別(私募市場資料)。
Surge AI、Labelbox、TaskUs 等標註與資料服務分別聚焦不同語區、垂直領域的偏好標註,提供定製化工具體系和質量保證。
Hugging Face工具與社群維護 TRL 庫,整合 DPO、PPO 等方法,降低 RLHF 工程實現壁壘;同時託管眾多開源的偏好資料集。
雲端服務商(AWS、Azure、GCP)算力與平台提供 RLHF 訓練所需的大規模 GPU 叢集,以及封裝好的對齊工具(如 Amazon SageMaker 的 RLHF 模組)。

注:以上資訊均來源於各公司公開技術報告、官方部落格與資訊揭露,僅客觀描述業務版面配置,不構成任何投資建議。

市場規模

截至目前,公開資料未見將 RLHF 作為獨立測算口徑的市場規模報告。但可從相關環節進行定性判斷:

  • 偏好資料標註市場:據 Grand View Research 等機構對全球資料標註與採集市場的估計,2024 年整體規模約數十億美元,其中對話與生成式 AI 標註是高增長細分。RLHF 涉及的專家偏好標註單價高、需求增速快,但尚無明確份額資料。
  • 對齊工具與平台:包含訓練架構、對齊服務、合成偏好資料生成等在內,多數嵌入雲端服務或模型訓練管道中打包收費,難以剝離為獨立市場。
  • 算力消耗:一次完整的 RLHF 訓練對於千億引數模型可消耗數百 GPU·周,假設高階 GPU 雲端租用價格約 1.5–3 美元/小時,則單次訓練的電算成本可達數十萬美元量級(估算口徑),隨模型尺寸和迭代輪次顯著波動。考慮到主要實驗室每年進行數次至數十次不同規模的對齊訓練,全球 RLHF 直接算力支出估計在億元美金級別以下,但缺乏公開審計資料。

玩家對比

維度OpenAIAnthropicMetaGoogle DeepMind
核心對齊方案RLHF+PPO,結合使用者反饋形成飛輪Constitutional AI+RLHF,強調自監督原則RLHF+PPO,開源全流程以促生態RLHF+PPO,整合內部架構與多模態
偏好資料來源人工標註 + 使用者隱式比較(對話中雙選)少量人工規則 + 模型自我批判生成比較開放資料集 + 眾包標註(如 RLHF dataset)未完全公開,推測人工標註與合成數據結合
開源程度閉源,僅論文描述閉源,但釋出部分方法論大幅開源模型權重與對齊細節閉源,部分技術通過論文分享
安全管控內容策略 + 多維度 RM + 紅隊測試憲法訓練 + 自動化紅隊安全 RM + 內容過濾 + 社群反饋安全分級 + 多工對齊
主要產品ChatGPT、GPT‑4oClaude 系列LLaMA 系列(開放模型)Gemini 系列

各行對齊策略均基於 RLHF 架構進行差異化擴充套件,競爭焦點在於偏好資料的獲取效率、獎勵模型的維度細分以及 Human-AI 協同的閉環速度。

風險

標註質量與一致性:人類標註受到培訓程度、文化背景和認知偏差影響,偏好噪聲可能被 RM 放大。若標註準則未隨產品迭代更新,可能導致對齊失效或產生新的濫用風險。 獎勵駭客:策略可能發現 RM 的未被預期的高分模式,從而產生格式怪異、過度恭維、迴避難題等行為,而非真正提升有用性。雖有緩解手段,但無法完全規避。 對齊稅:RLHF 可能導致模型在部分通用基準(如知識測試、推論任務)上出現輕微效能下滑,即所謂“alignment tax”。雖然通過增大 SFT 資料量和精細調參已大幅降低此影響,但在極端安全約束下仍可能犧牲部分能力。 泛化與魯棒性:RLHF 對齊後的模型在分佈外提示或對抗性攻擊下可能表現不穩定,安全保證難以覆蓋所有邊界場景,紅隊測試只能抽樣探測。 監管與合規:不同市場對 AI 安全性和非歧視性的要求日益嚴格,RLHF 產出的對齊證明可能被要求接受審計。如果偏好資料或獎勵設計被認定為含有偏見,可能引發法律和聲譽風險。 替代技術衝擊:DPO 等免 RM 方法不斷演進,若未來在同等可靠性和可控性下大幅降低工程成本,現行復雜的 PPO 工作站可能被快速替代,影響相關工具鏈和標註生態的價值。

誤讀糾偏

  1. “RLHF 只是讓模型記住人類喜歡的答案” 實際上,RLHF 學習的是人類偏好的隱式函式,並通過強化學習探索出能夠泛化的高獎勵策略。模型可以發現訓練期間未曾出現的回答模式,甚至超越單個標註員的水平,但也可能對訓練分佈產生過擬合。它並非簡單的記憶壓縮,而是偏好空間的策略搜尋。

  2. “RLHF 必然導致模型能力退化” 早期研究確實在部分任務上觀察到輕微的“對齊稅”,但隨著更大的 SFT 資料、更精細的 KL 控制、多目標獎勵組合以及預訓練混合比例調整,這種能力退化已被極大削弱。在一些指令遵循、安全性任務上,RLHF 甚至帶來了顯著提升。能力變化是權衡結果,並非單向損失。

  3. “只要有足夠大的基座模型,RLHF 不重要” 預訓練規模可以提升知識容量,但不能自動產生與人類價值觀一致的交流風格。實踐中,純 SFT 模型在安全性和意圖理解上顯著弱於經過 RLHF 對齊的模型,這一點已在多個行業基準上得到驗證。

  4. “DPO 可以完全取代 RLHF” DPO 通過直接偏好最佳化繞開顯式 RM 訓練,在工程上更為簡便,但線上 RLHF 允許模型探索更多後續 token 的獎勵變化,並自然地與線上取樣、多輪對話最佳化等環節結合。當前工業界主流產品仍依賴 RLHF 獲得更精細的控制力,未來更可能是兩種路線的融合而非完全替代。

最新事件

  • 2024 年下半年至 2025 年初:OpenAI 推出 GPT‑4o 及後續版本,其系統卡揭露中延續了基於 RLHF 的安全對齊流程,並引入更細粒度的內容安全獎勵模型。
  • 2024 年:Anthropic 釋出 Claude 3.5 系列,用更大規模的憲法規則和自動化偏好生成進一步降低人工標註依賴,但依然保留了 RLHF 微調階段。
  • 2024 年:Meta 開源 LLaMA 3‑Instruct,詳細釋出其 RLHF 所使用的偏好資料構成(涵蓋公開資料集與人工眾包),推動開源社群復現。
  • 2025 年初:Hugging Face 的 TRL 庫更新至 0.11 版本,完整支援 DPO、PPO 以及線上 RLHF 的簡化流水線,社群中小規模模型的對齊實驗數量激增。
  • 監管動態:歐盟 AI 法案逐步進入實施階段,要求高風險 AI 系統說明對齊過程,促使各公司更系統地文件化 RLHF 資料集和獎勵設計。美國 NIST AI 安全架構也將人類反饋驅動的對齊列為推薦實踐。 (以上事件均來源於企業官方部落格、技術報告與監管公告,截至 2025 年 4 月。)

追蹤指標

若需追蹤 RLHF 及相關產業的動態,可關注以下指標:

  • 偏好資料供需:專業標註平台的產能利用率、標註單價變化(可通過行業調研或上市標註公司財報中的“AI 資料服務”營收增速近似獲取)。
  • 方法演進:DPO 及變種論文的釋出頻次、頂級會議(如 NeurIPS、ICML)中有關人類反饋對齊的論文數量。
  • 產品安全性:主流對話模型在 TruthfulQA、RealToxicityPrompts 等基準上的得分變化,以及獨立紅隊報告揭露的安全漏洞趨勢。
  • 開源模型對齊程度:Hugging Face Open LLM Leaderboard 中 v2 版引入的“安全對齊”維度得分,以及社群偏好資料集的下載量。
  • 監管進展:主要經濟體的 AI 法案版本更新中是否新增針對 RLHF 審計和偏好資料透明度的條款。
  • 訓練算力成本:高階 GPU 雲端租賃價格指數的變化,以及大型 AI 實驗室資本支出報告中透露的全棧訓練開銷佔比調整。

信源

  • Ouyang, L. et al. (2022). Training language models to follow instructions with human feedback. arXiv:2203.02155. (InstructGPT 論文)
  • Stiennon, N. et al. (2020). Learning to summarize with human feedback. NeurIPS.
  • Christiano, P. et al. (2017). Deep reinforcement learning from human preferences. arXiv:1706.03741.
  • Bai, Y. et al. (2022). Constitutional AI: Harmlessness from AI Feedback. arXiv:2212.08073.
  • Meta AI (2023). Llama 2: Open Foundation and Fine-Tuned Chat Models. arXiv:2307.09288.
  • Rafailov, R. et al. (2023). Direct Preference Optimization: Your Language Model is Secretly a Reward Model. arXiv:2305.18290.
  • Anthropic (2024–2025). Claude model card & system disclosures. via anthropic.com.
  • OpenAI (2024–2025). GPT-4o system card and alignment research updates. via openai.com.
  • Hugging Face TRL documentation: https://huggingface.co/docs/trl/
  • Grand View Research. (2024). Data Collection and Labeling Market Size Report. (僅引用於市場規模定性參考,未包含具體數字)
  • NIST AI Risk Management Framework (2024 update).

注:本文所有財務、市場、份額資料若未標明具體來源,均屬於公開材料缺失的條目,已標註“公開資料未見”或僅使用定性描述。所有產出嚴格遵循不推薦任何投資行為的準則,僅作知識性梳理。

source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型