強化學習(Reinforcement Learning)
3 秒看懂
一句話:智慧代理(Agent)通過”試錯-獎懲”迴圈,在與環境的互動中自主學會最優決策策略——不靠標註資料,靠獎勵訊號驅動學習。
產業關鍵詞:RLHF 驅動大型模型對齊 · 自動駕駛決策 · 機器人控制 · 遊戲 AI · 藥物分子設計
一句話產業定位:強化學習是 AI 從”模式識別”進化到”自主決策”的核心演算法範式,尤其在 LLM 對齊(RLHF)中已成為產業標配;算力需求需結合訓練頻次、線上反饋規模和模型迭代節奏逐項驗證。
3 分鐘產業解釋
為什麼現在 RL 突然成為產業焦點?
過去十年,深度學習的主旋律是監督學習——給模型大量標註好的 (輸入, 輸出) 對,讓它學會對映。這解決了影像識別、語音轉寫等”模式匹配”問題。
但 AI 要真正落地到決策場景——對話該說什麼、機械臂該怎麼抓、自動駕駛該怎麼變道——就沒有現成的”標準答案”可以標註。這些場景的共同特徵是:
- 動作空間巨大:一個大型語言模型每步生成有數萬個 token 可選
- 反饋延遲:一個決策的好壞可能要等到很多步之後才知道
- 沒有最優標籤:人類自己也未必知道最優答案,只能判斷”哪個更好”
強化學習天然適合這類問題。而 2022-2023 年的大型模型爆發,讓 RL 從學術象牙塔一步跨入產業核心——
RLHF(基於人類反饋的強化學習) 成為 ChatGPT、Claude、Gemini 等主流大型模型對齊人類偏好的關鍵技術路徑。這個過程中,RL 不再只是”下棋的 AI”,而是成為把通用語言能力轉化為有用、安全、可控行為的”最後一公里”演算法。
產業規模感知
- RL 本身不是一個獨立的硬體或軟體市場,而是橫跨算力基礎設施、模型訓練平台、應用終端的技術層
- 在 LLM 訓練成本中,RLHF 階段的算力佔比因架構而異,通常需要多次策略迭代,每輪涉及大量推論(生成候選回覆)和訓練(更新策略),是算力消耗的重要組成部分 [行業估算]
- 機器人、自動駕駛領域的 RL 模擬訓練同樣消耗大量 GPU 算力,但資料多在模擬環境中自動生成,邊際成本結構不同於 LLM
15 分鐘專家深入
一、RL 的核心範式:馬爾可夫決策過程(MDP)
強化學習的數學基礎是馬爾可夫決策過程,由五元組 (S, A, P, R, γ) 定義:
| 符號 | 含義 | LLM 對齊場景舉例 |
|---|---|---|
| S | 狀態空間 | 當前對話歷史 + 上下文 |
| A | 動作空間 | 下一個 token 的選擇 |
| P | 狀態轉移機率 | 給定上文,語言模型本身定義了轉移 |
| R | 獎勵函式 | 獎勵模型對回覆質量的打分 |
| γ | 折扣因子 | 權衡即時回覆質量與對話整體連貫性 |
Agent 的目標:找到一個策略 π(a|s),使得累積折扣獎勵的期望值最大化:
max_π E[ Σ_{t=0}^{∞} γ^t · r_t ]
這個最佳化目標看似簡潔,但在實踐中面臨的核心挑戰包括:信用分配(哪一步動作導致了最終好壞?)、探索-利用權衡(該試新動作還是重複已知好動作?)、樣本效率(需要多少互動才能學到好策略?)。
二、RL 演算法家族譜系
從策略更新方式看,RL 演算法大致分三大流派:
強化學習演算法
├── 基於值函式(Value-based)
│ ├── Q-Learning(表格型)
│ ├── DQN(Deep Q-Network, 2015, DeepMind)
│ ├── Double DQN / Dueling DQN / Rainbow
│ └── 適用:離散動作空間,Atari 遊戲等
│
├── 策略梯度(Policy Gradient)
│ ├── REINFORCE(蒙特卡洛策略梯度)
│ ├── PPO(Proximal Policy Optimization, 2017, OpenAI)
│ ├── TRPO(Trust Region Policy Optimization)
│ └── 適用:連續/高維動作空間,機器人控制
│
└── Actor-Critic(混合架構)
├── A2C / A3C(Advantage Actor-Critic)
├── SAC(Soft Actor-Critic)
├── TD3(Twin Delayed DDPG)
└── 適用:兼顧穩定性與樣本效率
在 LLM 對齊中,PPO 是目前最主流的 RL 演算法選擇,原因在於:它通過 clipped surrogate objective 限制策略更新幅度,訓練相對穩定;同時天然適配大規模分散式訓練架構。
三、RLHF 的完整技術管線(大型模型對齊核心)
這是當前 RL 最具產業影響力的應用場景,完整流程如下:
┌──────────────────────────────────────────────────────┐
│ Stage 1: 監督微調 (SFT) │
│ 高質量人工標註資料 → 微調基座模型 → SFT 模型 │
└──────────────────────┬───────────────────────────────┘
▼
┌──────────────────────────────────────────────────────┐
│ Stage 2: 獎勵模型訓練 (RM) │
│ 收集同一 prompt 的多條回覆 → 人工排序標註 │
│ 訓練 Bradley-Terry 偏好模型 → RM(回覆) → 標量分數 │
└──────────────────────┬───────────────────────────────┘
▼
┌──────────────────────────────────────────────────────┐
│ Stage 3: RL 策略最佳化 (PPO) │
│ 迴圈迭代: │
│ ① 策略模型生成回覆(推論階段,算力密集) │
│ ② RM 對回覆打分 │
│ ③ PPO 更新策略模型(訓練階段) │
│ ④ KL 散度懲罰,防止策略偏離 SFT 太遠 │
└──────────────────────────────────────────────────────┘
關鍵工程細節:
- KL 懲罰:PPO 目標函式中加入
β · KL(π_θ || π_ref)項,防止模型為追求高獎勵而”reward hacking”(生成 RM 認為好但人類實際覺得奇怪的回覆) - 參考策略凍結:Stage 3 中 SFT 模型作為
π_ref被凍結,只更新π_θ - 算力結構:每輪迭代需要先跑一輪推論(生成回覆),再跑一輪訓練(PPO 更新),所以 RLHF 的推論算力佔比遠高於純 SFT 階段
- 分散式實現:通常需要四組模型並行執行——策略模型、參考模型、獎勵模型、價值函式模型,視訊記憶體開銷巨大 [行業共識]
四、DPO:繞過顯式獎勵模型的替代路徑
2023 年,Stanford 研究團隊提出 Direct Preference Optimization (DPO),核心洞察是:在 Bradley-Terry 偏好模型假設下,最優策略可以直接從偏好資料中解析求得,無需先訓練 RM 再做 PPO。
DPO 損失函式(簡化):
L_DPO = -E[ log σ( β · (log π_θ(y_w|x)/π_ref(y_w|x)
- log π_θ(y_l|x)/π_ref(y_l|x)) ) ]
其中 y_w = 偏好回覆, y_l = 非偏好回覆
DPO 的優勢:訓練流程大幅簡化,無需線上推論生成,視訊記憶體需求降低,訓練更穩定。
DPO 的爭議:離線資料可能導致分佈偏移;在複雜對齊任務(安全性、多輪對話)中,PPO 的線上探索能力可能仍有優勢。當前產業中 PPO 和 DPO 均有大規模應用,部分廠商採用混合方案 [公開技術報告/未充分揭露]。
五、RL 超越對齊:更廣闊的應用版圖
| 應用領域 | RL 的角色 | 代表案例 |
|---|---|---|
| LLM 對齊 | 偏好最佳化 | RLHF/DPO(ChatGPT, Claude, Gemini) |
| 程式碼生成 | 通過執行反饋最佳化 | 基於測試用例的 RL 獎勵 |
| 機器人控制 | 運動策略學習 | 腿式機器人行走、靈巧手操作 |
| 自動駕駛 | 決策規劃 | 模擬環境中的策略最佳化 |
| 晶片設計 | EDA 版面配置最佳化 | Google 的晶片 Floorplanning |
| 藥物發現 | 分子生成最佳化 | 基於目標屬性的分子空間探索 |
| 推薦系統 | 長期使用者價值最佳化 | 從短期點選率到長期留存 |
| 科學發現 | 實驗設計 | DeepMind GNoME 材料發現 |
技術原理(最深)
6.1 策略梯度定理——RL 的理論基石
所有策略梯度方法的起點是這個定理:
∇_θ J(θ) = E_{τ~π_θ}[ Σ_t ∇_θ log π_θ(a_t|s_t) · A_t ]
其中:
J(θ) = 策略 π_θ 的期望累積回報
τ = 一條完整軌跡 (s_0, a_0, r_0, s_1, a_1, r_1, ...)
A_t = 優勢函式 = Q^π(s_t, a_t) - V^π(s_t)
("這個動作比平均好多少")
直覺:對於每一步決策,如果它的優勢為正(實際回報高於預期),就增加選擇這個動作的機率;反之則降低。梯度的權重是優勢值,不是原始回報——這避免了”贏了就全對、輸了就全錯”的簡單歸因。
6.2 PPO 的 Clipped Objective——為什麼它成為標配
L_CLIP(θ) = E_t[ min( r_t(θ) · A_t, clip(r_t(θ), 1-ε, 1+ε) · A_t ) ]
其中:
r_t(θ) = π_θ(a_t|s_t) / π_old(a_t|s_t) (新舊策略機率比)
ε = 裁剪範圍,典型值 0.1~0.2
機制解析:
- 當 A_t > 0(好動作):r_t 被上界裁剪,不允許策略對這個動作的機率增加太多
- 當 A_t < 0(壞動作):r_t 被下界裁剪,不允許機率下降太快
- 效果:每次策略更新幅度被約束在信任域內,訓練更加穩定
- 相比 TRPO 需要計算和求解 Fisher 資訊矩陣的逆(二次最佳化),PPO 只用一個 clip 操作,實現簡單、計算高效、易分散式——這是它在工業界勝出的關鍵
6.3 RLHF 中的完整最佳化目標
max_{π_θ} E_{x~D, y~π_θ(·|x)}[ R_φ(x, y) ]
- β · KL[ π_θ(·|x) || π_ref(·|x) ]
第一項:最大化獎勵模型的打分(對齊人類偏好)
第二項:懲罰策略偏離參考模型太遠(保持語言能力、防止退化)
β:KL 係數,控制"最佳化獎勵"和"保持穩定"的權衡
這個目標函式的平衡感是 RLHF 成功的核心——太激進地追求獎勵會導致”reward hacking”(比如生成冗長討好但無實質的回覆),太保守則模型行為沒有實質改善。
6.4 RL 的算力需求結構
RLHF 訓練一次迭代的計算流:
┌─────────────────────────────────────────┐
│ 階段 1: 線上推論(生成候選回覆) │
│ - 策略模型前向推論 │
│ - 通常需要 N 條取樣(N ≥ 1) │
│ - 推論算力 ≈ 策略模型引數量 × 序列長度 │
│ - GPU 佔用:策略模型 + 參考模型副本 │
└───────────────────┬─────────────────────┘
▼
┌─────────────────────────────────────────┐
│ 階段 2: 獎勵模型打分 │
│ - RM 前向推論 │
│ - 相對輕量(RM 通常小於策略模型) │
└───────────────────┬─────────────────────┘
▼
┌─────────────────────────────────────────┐
│ 階段 3: PPO 訓練更新 │
│ - 策略模型前向+反向 │
│ - 價值函式模型前向+反向 │
│ - 梯度計算和引數更新 │
│ - 訓練算力 ≈ 策略模型引數量 × 3~4 倍 │
│ (因為同時維護策略/價值/參考/RM 四個模型)│
└─────────────────────────────────────────┘
關鍵結論:RLHF 不只是”訓練算力”,推論算力佔比顯著——每輪迭代都要先生成回覆。這使得 RLHF 訓練叢集對推論吞吐和視訊記憶體容量的要求都極高,是 HBM 容量和互聯頻寬的重度消耗場景 [行業共識/工程推導]。
技術演進史
| 時期 | 里程碑 | 意義 |
|---|---|---|
| 1950s-1980s | 動態規劃、時間差分(TD)學習 | RL 的理論基礎成型(Bellman、Sutton) |
| 1992 | TD-Gammon(IBM) | 用 TD 學習訓練西洋雙陸棋,接近人類頂尖水平 |
| 2013 | DQN(DeepMind) | 深度網路 + Q-Learning,Atari 遊戲超越人類 |
| 2016 | AlphaGo(DeepMind) | MCTS + 策略網路 + 價值網路,擊敗圍棋世界冠軍 |
| 2017 | AlphaZero | 純自我對弈,無需人類棋譜,通用棋類 AI |
| 2017 | PPO(OpenAI) | 簡潔高效的策略梯度演算法,成為後續工業標準 |
| 2019 | OpenAI Five | RL 訓練的 Dota2 AI 擊敗世界冠軍戰隊 |
| 2022.01 | InstructGPT / RLHF 原型(OpenAI) | 基於 RLHF 的 LLM 對齊首次大規模應用 |
| 2022.11 | ChatGPT 釋出 | RLHF 走入公眾視野,證明 RL 對齊的巨大商業價值 |
| 2023 | DPO(Stanford)、RRHF、SLiC 等 | 去 RM 的簡化對齊路線湧現 |
| 2023-2024 | Process Reward Models, RLHF 多輪最佳化 | RL 對齊技術持續迭代 |
| 2024-2025 | RL 用於推論能力(如 o1 類模型的思維鏈最佳化) | RL 從”對齊”延伸到”推論增強” |
技術路線對比
| 維度 | PPO-based RLHF | DPO | RLHF + Process RM | 純 SFT(對照) |
|---|---|---|---|---|
| 是否需要顯式 RM | ✅ 需要訓練獨立 RM | ❌ 隱式內嵌 | ✅ 需要,且需過程級標註 | ❌ |
| 訓練穩定性 | 中等(需調 KL、clip 引數) | 較高(類似監督學習) | 中等 | 高 |
| 對齊效果上限 | 高(線上探索能力強) | 中-高(受限於離線資料分佈) | 最高(可做細粒度信用分配) | 低 |
| 計算成本 | 高(推論+訓練,四模型並行) | 低(僅策略模型訓練) | 最高(過程級獎勵標註+推論) | 最低 |
| 推論算力需求 | 高 | 低 | 極高 | 無 |
| 工程複雜度 | 高(分散式四模型協調) | 低 | 極高 | 最低 |
| 適用場景 | 複雜對齊、安全敏感 | 資源受限、快速迭代 | 數學/程式碼等可驗證推論 | 簡單指令跟隨 |
| 產業採用度 | 最高(OpenAI、Anthropic 等頭部) | 廣泛(中小團隊偏愛) | 正在增長 | 基線/初步對齊 |
注:上表為基於公開學術論文和開源社群實踐的定性對比,各廠商內部方案細節 [未充分揭露]。
上下游
上游(RL 訓練需要什麼)
算力層
├── GPU/加速卡:NVIDIA H100/B200(主流);AMD MI300X(部分部署)
├── HBM 記憶體:RLHF 四模型並行對視訊記憶體需求極高
├── 高速互聯:NVLink/NVSwitch(卡間通訊)、InfiniBand(節點間)
└── 雲端運算:AWS/Azure/GCP 的 GPU 叢集
軟體架構層
├── 訓練架構:DeepSpeed、Megatron-LM、FSDP(PyTorch)、veRL
├── RL 庫:TRL(HuggingFace)、OpenRLHF、RLHFlow
├── 推論引擎:vLLM、TensorRT-LLM(線上生成階段)
└── 分散式排程:Ray、Slurm
資料層
├── 人類偏好標註:專業標註員對回覆排序(成本高、週期長)
├── 合成偏好資料:AI 輔助標註(降低成本但引入偏差)
└── 紅隊測試資料:安全性對齊專用
下游(RL 產出什麼)
直接產出
├── 對齊後的 LLM(ChatGPT、Claude、Gemini 等核心產品)
├── 機器人控制策略(運控模型)
└── 自動駕駛決策策略
衍生價值
├── 更高的使用者留存和付費意願(對齊質量 → 產品體驗)
├── 安全合規(滿足監管要求的基礎)
└── 新能力湧現(推論增強類模型依賴 RL)
關鍵指標
| 指標 | 含義 | 產業參考水平 |
|---|---|---|
| Win Rate(勝率) | RLHF 模型 vs SFT 模型的人類評估偏好比例 | 典型提升 60%→75%+ [學術論文,因任務而異] |
| Reward Score | 獎勵模型對生成回覆的打分 | 隨訓練迭代上升,但需監控 KL 不失控 |
| KL Divergence | 策略與參考模型的偏離程度 | 典型控制在 3~15 nats(過低無效果,過高易退化) |
| Reward Hacking Rate | RM 打分上升但人類評價下降的頻率 | 訓練不穩定的訊號,需及時調整 |
| 訓練吞吐(tokens/s) | RLHF 叢集處理效率 | 受四模型並行架構限制,遠低於純 SFT |
| 人類標註一致性(IAA) | 不同標註員對同一對偏好的一致率 | Cohen’s κ > 0.6 通常認為可用 |
| 每輪迭代取樣數 | 每個 prompt 生成的候選回覆數 | 通常 1~8 條,影響探索多樣性 |
供需與市場資料
需求側
- LLM 對齊是 RL 最大的產業需求來源:所有主流對話式 AI 產品(ChatGPT、Claude、Gemini、文心一言、通義千問等)均經歷 RLHF 或其變體對齊流程 [各廠商公開技術報告]
- 推論類模型(如 o1 系列) 將 RL 從”行為對齊”擴充套件到”推論能力增強”,需求場景進一步擴大
- 具身智慧(機器人) 是 RL 的另一個潛在大規模落地方向,但當前仍處於研發/小批次部署階段
供給側
- 算力:RLHF 訓練高度依賴高階 GPU 叢集。單次完整 RLHF 訓練(從 SFT 到對齊完成)的算力消耗因模型規模和迭代輪次不同而差異巨大,但可佔總訓練成本的相當比例 [行業估算/未充分精確揭露]
- 人類標註:高質量偏好資料是稀缺資源。專業 RLHF 標註團隊薪資成本高,且需要嚴格的質量控制流程。頭部廠商已大量採用 AI 輔助標註以降低成本
- 工程人才:能大規模實施 RLHF 分散式訓練的工程團隊在全球範圍內仍然稀缺
市場格局
- RLHF/RL 對齊不是一個獨立的可交易市場,而是嵌入在大型模型訓練成本結構中的關鍵環節
- 但其對算力消耗的拉動是可觀測的:RLHF 的推論密集特性使 GPU 雲端服務的推論營收佔比提升
- 合成數據 + AI 輔助標註正在重塑偏好資料的供給曲線,降低邊際成本
代表公司與資本對映
| 公司/機構 | RL 角色 | 技術特點 | 資本相關 |
|---|---|---|---|
| OpenAI | RLHF 開創者 | PPO-based RLHF 是其核心競爭力之一 | 非上市,估值千億美元級 |
| Anthropic | Constitutional AI (CAI) | 用 AI 反饋部分替代人類偏好標註 | 非上市,融資百億美元級 |
| Google DeepMind | RL 學術先驅 | AlphaGo/AlphaZero/AlphaFold 系列 | Alphabet 子公司 |
| Meta (FAIR) | 開源 RL 工具鏈 | Open-source Llama 對齊方案,推動 RLHF 民主化 | META |
| Hugging Face | TRL 開源庫 | 降低 RLHF 工程門檻 | 非上市 |
| NVIDIA | RL 訓練算力底座 | GPU + NVLink 互聯是 RLHF 叢集的基礎 | NVDA |
| 字節跳動/百度/阿里 | 中文大型模型 RLHF 實踐 | 基於自研基座的對齊管線 | 各有上市實體 |
投資對映邏輯:RL 不是直接可投資標的,但通過兩條路徑傳導價值——① 拉動高階算力需求(利好 NVIDIA、雲端廠商);② 對齊質量決定 AI 產品競爭力(利好頭部 AI 公司的使用者留存和商業化)。
投資邏輯
核心判斷
-
RL 是 AI 從”能力”到”產品”的必經之路。基座模型再強,不對齊就無法安全部署。這意味著 RL 相關算力需求具有結構性而非週期性。
-
推論算力的增量邏輯。RLHF 的線上推論階段(生成候選回覆)消耗大量推論算力,這與”訓練完就只推論”的傳統認知不同——RL 訓練過程中本身就是推論的大客戶。隨著 o1 類推論模型興起,推論鏈更長 → 單次推論算力更大 → RL 訓練的推論需求進一步放大。
-
資料飛輪效應。RLHF 依賴人類偏好標註,頭部廠商積累的高質量偏好資料和 RM 形成資料護城河——先發者 RM 更準 → 對齊更好 → 使用者更多 → 收集更多偏好反饋 → RM 更準。
-
DPO 等簡化路線降低了中小團隊的參與門檻,但頭部廠商在複雜對齊(安全、多輪、工具使用)上仍傾向 PPO 類線上 RL,技術差距可能擴大而非縮小。
風險因素
- Reward hacking 始終是工程風險:RM 不完美,最佳化過程可能找到 RM 的漏洞而非真正提升質量
- 監管不確定性:部分監管可能要求對齊過程可審計,純 RL 迭代的黑箱特性可能面臨挑戰
- 技術路線迭代快:從 PPO 到 DPO 到 DPO+ 到 RLOO 到 KTO,技術路線仍在快速演進,押注單一方案有風險
常見誤讀糾偏
誤讀 1:“RLHF 就是讓 AI 學會說話”
糾偏:RLHF 不教模型語言能力(那是預訓練和 SFT 乾的事),它教的是在多種可能的回覆中,選擇人類偏好的那種。打個比方:預訓練給了模型一本百科全書,SFT 教它如何回答問題,RLHF 教它如何在”誠實但可能冒犯”和”討好但不誠實”之間做正確選擇。沒有 RLHF,模型照樣能說話,但可能有毒、偏見、不安全或答非所問。
誤讀 2:“RL 訓練比 SFT 簡單,就是打個分更新引數”
糾偏:RLHF 的工程複雜度遠高於 SFT。SFT 只需一套模型做前向+反向,RLHF 需要四套模型(策略、參考、RM、價值函式)同時線上,且需要線上生成(推論)→ 打分 → 訓練的迴圈。分散式協調、視訊記憶體管理、超引數調優(KL 係數、clip 範圍、學習率衰減)的複雜度是數量級的差異。這也是為什麼很多開源模型在 SFT 上效果不錯,但 RLHF 效果參差不齊——工程能力門檻極高。
誤讀 3:“DPO 會完全取代 PPO/RLHF”
糾偏:DPO 在簡單指令遵循任務上效果接近 PPO 且成本更低,但在複雜安全對齊、多輪互動、需要線上探索的場景中,PPO 的優勢仍然明顯。當前頭部廠商的實際做法多為混合方案:用 DPO 做初步對齊降低成本,再用 PPO 做精細調整。完全取代的說法過於簡化。
誤讀 4:“RL 在大型模型中主要用於對齊,跟推論能力無關”
糾偏:這個認知正在過時。o1 系列等推論增強模型的核心技術路徑之一就是用 RL 最佳化思維鏈(chain-of-thought)的過程和結果。RL 不僅最佳化”說什麼”,也開始最佳化”怎麼想”——通過過程級獎勵模型(Process RM)對推論鏈中的每一步打分,這是 RL 從”對齊工具”向”能力增強引擎”演進的重要方向。
學習路徑
入門(建立直覺)
- 《Reinforcement Learning: An Introduction》(Sutton & Barto)—— RL 聖經,第 1-4 章建立基礎概念(免費線上閱讀)
- OpenAI Spinning Up(spinningup.openai.com)—— 極好的入門教程,從理論到程式碼
- David Silver 的 UCL 課程—— DeepMind 研究科學家的經典 RL 課程
進階(理解核心演算法)
- PPO 原始論文:Schulman et al., “Proximal Policy Optimization Algorithms”, 2017
- InstructGPT 論文:Ouyang et al., “Training language models to follow instructions with human feedback”, 2022 —— RLHF 的里程碑
- DPO 論文:Rafailov et al., “Direct Preference Optimization”, 2023
- 實踐:用 HuggingFace TRL 庫跑一個小型 RLHF 流程
專家(工程與前沿)
- DeepSpeed-Chat / OpenRLHF / veRL—— 大規模分散式 RLHF 工程實現
- Process Reward Models:Lightman et al., “Let’s Verify Step by Step”, 2023
- 追蹤最新動態:arXiv RL 標籤、ICML/NeurIPS RL track、Lilian Weng 的部落格
一句話總結
強化學習是 AI 能力從”識別”到”決策”躍遷的核心演算法引擎,在大型模型時代通過 RLHF 成為將通用智慧轉化為可部署產品的關鍵一環,其對推論算力和高質量偏好資料的結構性需求,使其成為 AI 產業鏈中不可忽視的隱性驅動力。
延伸閱讀與來源
| 來源 | 內容 | 連結/備註 |
|---|---|---|
| Sutton & Barto | RL 經典教材 | http://incompleteideas.net/book/the-book.html |
| Schulman et al., 2017 | PPO 論文 | arXiv:1707.06347 |
| Ouyang et al., 2022 | InstructGPT / RLHF 論文 | arXiv:2203.02155 |
| Rafailov et al., 2023 | DPO 論文 | arXiv:2305.18290 |
| Lightman et al., 2023 | Process Reward Models | arXiv:2305.20050 |
| OpenAI Spinning Up | RL 入門教程 | https://spinningup.openai.com |
| HuggingFace TRL | RLHF 開源工具庫 | https://github.com/huggingface/trl |
| Anthropic, 2022 | Constitutional AI 論文 | arXiv:2212.08073 |
| Christiano et al., 2017 | Deep RL from Human Preferences | arXiv:1706.03741(RLHF 思想源頭) |
| OpenRLHF | 開源大規模 RLHF 架構 | https://github.com/OpenRLHF/OpenRLHF |
免責宣告:本文為技術概念學習材料,不構成投資建議。涉及公司的具體技術實現細節以各公司官方揭露為準,未充分揭露的部分已明確標註。