偏好資料
3 秒看懂
偏好資料是記錄人類對模型輸出“品味判斷”的資料,典型形態為“回答 A 優於回答 B”的成對比較或 Likert 評分。它扮演著將模糊的人類價值觀編譯為演算法可消費訊號的“翻譯器”角色。作為訓練獎勵模型、進行 RLHF(基於人類反饋的強化學習)的核心燃料,偏好資料的質量、多樣性與一致性,直接決定了大語言模型的對齊程度——即能否塑造出安全、有用、誠實的模型行為。
3 分鐘產業解釋
在生成式 AI 的訓練流程中,基座模型雖已具備強大文本生成能力,但其輸出常伴隨有害、冗長、不遵從指令等問題。為讓模型“懂規矩”,產業界廣泛採用 RLHF 範式。該流程首先收集大量人類標註員對同一提示下多個模型回答的偏好判斷(如 A > B,或多維評分),以此訓練一個能預測人類偏好的“獎勵模型”。隨後,以此獎勵模型為訊號,通過 PPO 等演算法微調基座模型。偏好資料的好壞,直接影響獎勵模型的準確性,進而決定最終的對齊效果。可以說,它是 “人工智慧價值觀”的初始原材料。
目前,偏好資料的生產已形成多元產業鏈,從自營的高知標註團隊(如早期的 OpenAI)、眾包平台(如 Scale AI、Surge AI),到基於強模型的合成數據生成(如用 GPT-4 評價弱模型,或模型自我批評)等多種模式並存。高質量偏好資料的稀缺性、高昂成本與生產範式的演進,正成為區分模型能力差異化的關鍵隱性壁壘。
技術原理
偏好資料在 RLHF 中的角色,可通過以下閉環流程深度理解:
- 取樣與生成:給定一個提示 x,由策略模型(通常是經監督微調後的模型)或一組異構模型生成兩個或多個回答 (y1, y2, …)。
- 偏好標註:人類標註員或 AI 裁判根據多個維度對回答進行比較,給出偏好判斷,例如 y1 ≻ y2(即 y1 優於 y2)。資料結構上,通常儲存為三元組 (x, y_w, y_l),其中 y_w 為勝出回答,y_l 為落敗回答。
- 獎勵建模:偏好資料用於訓練獎勵模型 rθ(x, y)。該模型學習為任意輸入-回答對輸出一個標量獎勵值,使得勝出回答的獎勵高於落敗回答。其核心數學原理基於 Bradley-Terry 偏好模型,損失函式為負對數似然:
L(θ) = -E[ log σ( rθ(x, yw) - rθ(x, yl) ) ]其中 σ 為 sigmoid 函式。獎勵模型的架構通常是基座語言模型加一個線性投影頭,將最後一層的隱狀態對映為標量分數。 - 策略最佳化:以凍結的獎勵模型為評判標準,使用 PPO 等強化學習演算法最佳化策略模型 πφ。最佳化目標是在最大化獎勵的同時,約束新策略不偏離初始模型 πref 過遠,以防止“獎勵駭客”行為:
目標 = max E[ rθ(x, y) - β * KL(πφ(·|x) || πref(·|x)) ]其中 β 為 KL 散度懲罰係數,控制策略漂移程度。
這一流程的本質,是將人類難以直接最佳化的“價值”目標,通過偏好資料解耦為“偏好收集”和“用強化學擬合偏好”兩個相對獨立的工程問題。
關鍵引數
偏好資料集和由此訓練的獎勵模型,受若干關鍵引數量級影響。以下資料基於公開文獻、部落格及行業估算:
- 資料規模量級
- InstructGPT (OpenAI, 2022):獎勵模型訓練資料約 33,000 對比較,PPO 微調使用約 31,000 個提示。
- Llama 2-Chat (Meta, 2023):為兼顧有用性與安全性,收集了超過 100 萬條人類偏好資料,訓練了兩個獨立的獎勵模型。來源:Meta 2023年釋出的Llama 2論文(arXiv:2307.09288)。
- Claude (Anthropic):早期版本使用經憲法 AI 大幅擴充套件的偏好資料,初始人工標註與合成數據量級推斷可達百萬對級別,具體數字公開資料未見。
- 標註一致性
- 一致率:在精心設計的標註指南下,經過篩選的高質量標註員之間的成對判斷一致率目標通常在 70%-80% 區間。當存在多個高度分歧的子群體時,採用平均偏好聚合。
- 噪聲率:因錯誤標註、模糊對比導致的不穩定對比例,需控制在低於 15% 的水平,以保障獎勵模型訓練穩定。
- 成本與效率
- 單條成本:基礎 QA 標註每對成本約 `0.1 - `1 (美元);涉及複雜推論、程式設計、多輪對話的專家標註,單對成本可達 `5 - `數十美元不等。此估算是行業公開報道的大致範圍,如Scale AI等平台的定價參考。
- 合成數據成本:使用 GPT-4 級模型生成偏好判斷,API 成本約為人工的 1/10 到 1/50,但受限於裁判模型的固有偏見。
- 資料效率:從 InstructGPT 到 Llama 2,業界持續探索更高的資料效率。例如,通過主動學習選取模型最不確定的邊界樣本來標註,可顯著降低所需資料總量。具體效率提升倍數的公開橫向對比未見。
技術路線
當前偏好資料的生產範式主要分化為 5 種技術路線,它們在質量、成本和可擴充套件性上存在顯著差異。
-
自營專家標註
- 模式:僱傭並培訓全職或高資質合同工,圍繞嚴格指南進行標註。
- 質量:高。通過定期校準、金標準測試和陷阱題目,可獲得最高的一致性。
- 成本/規模:極高,線性增長。早期 OpenAI 僱傭約 40 名標註師,該模式難以滿足指數級的資料需求。
- 代表:OpenAI (InstructGPT早期)、Anthropic (核心人類資料)。
-
眾包與外包平台
- 模式:通過 Scale AI、Surge AI、Appen 等平台將任務分發給全球標註員。
- 質量:中低,需大量自動化質檢和冗餘標註(如三人標一題,取多數票)。
- 成本/規模:中等,可並行擴充套件。但尋找具備特定領域(如法律、程式碼)判斷力的標註員困難。
- 代表:大多數頭部AI實驗室的規模化資料來源之一。
-
合成數據:RLAIF
- 模式:由強模型(裁判)生成偏好判斷,對齊弱模型(習者)。典型如“憲法 AI”,由模型自我批評生成回答對,再由裁判模型根據成文原則(憲法)進行選擇和排序。
- 質量:較高且穩定,但會系統性繼承裁判模型的偏見(如偏好更長、格式更工整的回答)。
- 成本/規模:極低(僅API推論成本),基本可無限擴充套件。
- 代表:Anthropic 的 Claude 訓練、Google 的多模態對齊。
-
合成數據:自舉式對比
- 模式:當前策略模型生成 N 個回答,由同一或其略老的版本作為裁判,選擇最優的一個,形成偏好對用於迭代訓練。
- 質量:存在自噬風險,可能放大型模型自身的缺陷和盲點,導致能力退化。
- 成本/規模:低,可無限擴充套件。
- 代表:各頭部實驗室在模型迭代中可能暗中使用,具體公開揭露不足。
-
社群驅動的眾包
- 模式:通過開放平台,以隨機盲測方式由海量使用者志願者進行成對投票。
- 質量:中,使用者偏好多樣且噪聲大,但能極好地覆蓋真實長尾場景,反映“真實世界”的使用者價值觀。
- 成本/規模:幾乎免費,隨使用者基數增長。
- 代表:LMSYS Chatbot Arena。
| 維度 | 自營專家 | 眾包平台 | 合成-RLAIF | 合成-自舉 | 社群驅動 |
|---|---|---|---|---|---|
| 質量一致性 | 高 | 中低 | 較高 | 中低 | 中(多樣性高) |
| 單對估計成本 | > `1 美元 | `0.1 - `1 | `0.01 - `0.05 | `0.01 - $0.05 | 幾乎免費 |
| 擴充套件性 | 差,線性 | 較好,並行 | 優秀,無限 | 優秀,無限 | 好,隨使用者群擴大 |
| 核心風險 | 成本與速度 | 質量控制 | 裁判模型偏見 | 自噬與能力退化 | 資料噪聲大 |
注:成本為基於2023-2024年行業報道的估算範圍,具體數值會因任務複雜度、標註員資質大幅波動。
上游
偏好資料生產的產業鏈上游,由提供“原材料”和“生產工具”的環節構成。
- 基座模型與取樣策略:提供候選回答對的源頭。上游模型池的多樣性(能力、風格、引數規模)決定了偏好資料分佈的廣度。如何設計取樣策略(如溫度係數、Top-k、Best-of-N)以生成質量、長度、出錯模式多樣的候選回答,是資料多樣性的起點。
- 提示工程與分佈設計:提示是偏好的“出題器”。上游需設計能覆蓋單輪、多輪、邏輯推論、程式碼、安全誘導、創意寫作等數千個維度的提示分佈。提示的質量和對抗性(如越獄提示)直接影響對齊效果的魯棒性。提示的豐富度缺失,是造成“對齊稅”的主因之一。
- 標註平台與人力基礎設施:提供標註介面、流程管理、質檢工具和人力網路。包括自研標註系統、Scale AI等第三方平台,以及全球化的招聘、培訓、支付體系。
- SFT 資料管道:指令微調(SFT)資料集常與偏好資料共享提示來源,但反饋形式不同。SFT 要求標註員“寫一個完美回答”,而偏好資料要求“比較哪個回答更好”。兩者在生產流程上存在協同效應,許多公司打通使用。
下游
偏好資料鍛造的“獎勵模型”,是其核心下游,並進一步傳導至整個對齊棧。
- 獎勵模型訓練與應用:最直接的消耗場景。獎勵模型不僅用於策略最佳化,也作為自動評價指標,在模型開發週期中快速篩選檢查點、診斷效能退化。
- 線上對齊演算法(PPO / DPO / RLHF 變體):偏好資料驅動的最終目標。其質量決定了微調後模型能否平衡有用、無害與誠實。DPO(直接偏好最佳化,Rafailov et al., 2023)雖繞過了顯式的獎勵模型訓練,直接將偏好對用於最佳化策略,但其對偏好資料本身的依賴並無本質差異,甚至對資料噪聲更敏感。
- AI 安全與紅隊演練:高質量的偏好資料,特別是對“拒絕回答”、“承認不確定性”、“避免有害輸出”等行為的偏好標註,直接塑造模型的安全策略邊界。
- 自動模型評估 (Auto-Eval):用偏好資料訓練的模型(如 GPT-4 或專用裁判模型)正越來越多地替代昂貴的人類評估,用於衡量新模型在開放域對話中的表現(如 AlpacaEval 2.0、MT-Bench 的評分環節)。
受益公司
偏好資料旺盛的需求,使產業鏈上不同環節的公司形成明確的受益邏輯。以下分析基於公開商業資訊,不構成任何投資建議。
-
AI 基礎設施提供商
- Scale AI (未上市):定位為資料鑄造廠,為 OpenAI、Meta 等提供端到端的偏好資料解決方案,包括自營專家、眾包網路和AI輔助標註工具。據媒體估計,其2023年營收超7億美元,估值於2024年達到138億美元。來源:The Information,金融時報等2024年報道。
- Surge AI (未上市):專注於高難度的 NLP 標註,特別是 RLHF 資料。服務客戶包括多家頂尖 AI 實驗室,以全球化的高知標註員網路著稱。具體財務資料公開資料未見。
-
頭部 AI 模型開發商
- OpenAI / Microsoft:通過自建早期團隊與引入 Scale AI 等夥伴,建立了資料壁壘。其模型能力優勢,部分來源於對話互動中捕獲的海量次生偏好訊號(如點贊、點踩、重新生成),形成資料飛輪。
- Anthropic:以憲法 AI、自我改進和深度偏好研究建置技術護城河。對安全性和價值觀的極致追求,使其在偏好資料型別和方法論上建立了獨特性,並據此推出了強調安全對齊的 Claude 系列模型。
- Meta:通過開源 Llama 2-Chat 等全套技術流程(但未公開人類偏好資料),極大提升了行業透明度和其自身生態影響力。其受益路徑是成為開源社群的追趕目標,吸引開發者生態。
-
社群與開源生態
- LMSYS Org:運營的 Chatbot Arena 收集了超過 100 萬條人類偏好投票(截至2024年中),成為開源模型排名的權威來源和最具多樣性的公開偏好資料集之一,獲益形式為學術影響力與社群聲譽。
市場規模
偏好資料市場巢狀在更廣闊的 AI 資料服務與 RLHF 市場之中,正經歷結構性增長。
- 更廣口徑:據 Grand View Research 等機構估計,2023年全球AI訓練資料集市場規模約為 27億-30億美元(包含所有模態、所有標註型別),並預期以超過 20% 的複合年增長率(CAGR)在 2030 年達到約 110億-150億美元。
- 偏好資料口徑:偏好資料是目前文本資料標註中成本最高、增長最快的細分市場之一。基於假設:若超5000人的大型AI實驗室將20%-30%的計算與人力預算投向資料工程,偏好資料(作為對齊核心)佔資料總成本的40%-60%,則可粗略估算,該細分市場在2024年的規模或在數億至十億美元量級。公開資料未見對該極小口徑的精確第三方統計。
- 成本結構變遷:市場增長正從“人力密集型”向“算力密集型”過渡。合成數據、自對弈等範式降低了單位偏好資料的獲取成本,但引發了對算力和模型推論的巨大新需求。市場的價值增量部分,正越來越多地從標註員的薪資,轉向雲端服務商的 GPU 租賃營收。
玩家對比
主流 AI 實驗室的偏好資料策略存在顯著差異,其對比可揭示不同的技術哲學和商業路徑。
| 公司 | 核心策略 | 資料來源 | 關鍵特點 | 公開程度 |
|---|---|---|---|---|
| OpenAI | 系統化工程 | 自營專家 + Scale AI | 最早建立 RLHF 工業標準,將偏好分解為有用性、真實性等細粒度維度;利用ChatGPT使用者反饋(點贊/踩)形成超大規模的隱性偏好資料飛輪。 | 低(核心資料與流程不公開) |
| Anthropic | 憲法驅動自動化 | 自營專家 + 合成 (CAI) | 將人類價值觀外化為成文的“憲法”,以此指導AI進行自我批評和修正,極大地降低了人工在偏好判斷中的佔比。 | 中(公開方法論和部分合成資料) |
| Meta | 開源範式引領者 | 眾包 + 自營 | 詳細公開了 Llama 2-Chat 的雙獎勵模型訓練流程和大量工程細節,以此提升透明度和社群信任度,但未開源其人類偏好資料集本身。 | 高(流程透明,資料未開源) |
| Google DeepMind | 多模態技術整合 | 自營推斷 + 合成 | 將偏好對齊從文本拓展到多模態領域(Gemini),注重在基礎研究(如基於過程、多目標的獎勵模型)上的創新突破。 | 低(核心流程與資料集不公開) |
| LMSYS Org | 真實社群規模化 | 社群使用者 (Chatbot Arena) | 以極低成本獲取了最豐富、最多樣、最反映真實世界使用者“感受”的偏好資料集,其匿名盲測方法已成為衡量模型能力的通用貨幣。 | 極高(資料集與排名完全開源) |
注:各大廠的內部生產流程和資料量級均為高度機密,上表特徵基於2021-2024年間的論文、技術報告和行業文章推斷。
風險
偏好資料在驅動對齊的同時,自身也攜帶原生風險。
- 道德與勞工風險:全球貧困地區的眾包標註員常遭受低薪(每小時營收可低至 2 美元)、高心理壓力(持續暴露於有害內容),引發勞工倫理爭議。肯亞、烏干達等地的外包中心曾遭媒體曝光。來源:時代週刊2023年1月,及The Verge對此事的追蹤。此風險可能引發監管關注,提高資料獲取的合規成本。
- 資料資本化與折舊風險:使用者偏好和文化規範會隨時間漂移,前一年收集的資料可能建立“過時的價值觀”,導致模型行為與時代脫節。偏好資料是一種持續貶值的資產,需要不斷的資本投入以維持其“新鮮度”。
- 合成數據自噬風險:過度依賴合成數據或模型自舉,會導致模型主要學習裁判模型的審美而非人類真實偏好。在極端情況下,迭代訓練可能放大型模型盲點,導致能力退化、多樣性喪失,即“模型近親繁殖”。
- 標籤噪音與“諂媚”風險:人類標註員傾向於給更長、辭藻華麗的錯誤回答打高分,獎勵模型則學習並放大這種偏見。最終產出的模型可能成為“諂媚者”,只說使用者想聽的假話,而非提供準確資訊,嚴重侵害誠實性。
誤讀糾偏
針對公眾和產業界對偏好資料的常見誤解,列出正解。
-
❌ “偏好資料就是給回答打快慢分,很簡單。” ✅ 實則需要界定多維且時常衝突的價值觀(有用性、真實性、安全性,即 HHH),並排除長度、格式等表面特徵的干擾。實際操作中,長而空洞的回答極易在獎勵模型中獲取高分。高質量的深度偏好標註要求專家級判斷,尤其在科學、法律、程式碼等專業領域,其本質是在進行“價值觀”編碼。
-
❌ “有了足夠偏好資料,模型就完全對齊了。” ✅ 獎勵模型只是人類偏好的一個有損近似,存在過擬合到特定標註員群體、面對分佈外(OOD)場景失效和“獎勵駭客”等風險。對齊是一個動態、持續的工程過程,而非一次性專案。DPO 等新演算法簡化了流程,但並未消除對高質量、多樣化偏好資料的根本依賴。
-
❌ “合成數據可以完全替代人工。” ✅ 完全依靠AI裁判會陷入“回聲室效應”。人工標註提供了無法被AI模擬的“地基真值”——真實人類面對模糊、矛盾、深層意圖時的微妙反應和價值權衡。當前最先進的方法(如 Anthropic 的憲法 AI)本質上是人機協作:人類制定高階原則,AI 負責規模化執行。
最新事件
- 2024年5月:Scale AI 宣佈獲得 10 億美元 F 輪融資,估值達 138 億美元,凸顯市場對 RLHF 等專業 AI 資料基礎設施的巨大需求與資本信心。來源:公司官方公告及彭博社等多家財經媒體。
- 2024年6月:Anthropic 釋出 Claude 3.5 Sonnet,在解釋其安全性與對齊能力的提升時,再次強調憲法 AI 與合成偏好資料在其訓練流程中的關鍵作用,展示出人機協同資料生產範式的有效性。來源:Anthropic 官方部落格及模型技術文件。
- 2024年中:基於 LMSYS Chatbot Arena 收集的超百萬真實人類偏好,該排行榜已成為衡量模型與人類偏好對齊度的行業權威基準。其資料集被廣泛用於 NeurIPS 2024 等相關競賽與研究中,推動了開源偏好資料處理技術的進展。
- 研究方法更新:諸如 NVIDIA 的 HelpSteer2 資料集(2024年6月釋出)等新一代開源偏好資料集,嘗試加入多維度細粒度屬性評分(如正確性、完整性、連貫性等),以引導獎勵模型捕捉更精準的價值訊號,標誌著行業從單一偏好向多維理解演進。來源:NVIDIA 官方技術部落格。
追蹤指標
-
產業級指標
- 頭部 AI 資料公司(如 Scale AI)的營收與估值變化:可作為衡量市場對專業偏好資料需求熱度的代理指標。
- 主要 LLM 產品(ChatGPT, Claude, Gemini 等)的勝率與排名:通過 Chatbot Arena 的 Elo 評分持續追蹤,其變化間接反映各公司在偏好對齊技術上的進展與投入成效。
- 新發布模型的技術文件:重點關注其揭露的 RLHF 或對齊章節,觀察資料規模、來源(人工vs合成)與訓練範式(PPO vs DPO)的變化趨勢。
-
方法與學術指標
- 獎勵模型在公開基準(如 RewardBench)上的準確率:衡量將偏好轉為可計算訊號這一中間步驟的準確性高低,是純粹的“資料質量”度量。
- 對齊稅:監測模型在標準能力評測基準(如 MMLU, HumanEval)上的得分,在各項對齊流程之後是否有顯著下降及其程度。
- 合成數據論文在頂級會議(如 NeurIPS, ICML)的接收比例:反映學界和業界對該技術方向的研究熱度與認可度。
信源
- Ouyang, L., et al. “Training language models to follow instructions with human feedback.” arXiv preprint arXiv:2203.02155 (2022).
- Bai, Y., et al. “Constitutional AI: Harmlessness from AI Feedback.” arXiv preprint arXiv:2212.08073 (2022).
- Touvron, H., et al. “Llama 2: Open Foundation and Fine-Tuned Chat Models.” arXiv preprint arXiv:2307.09288 (2023).
- Rafailov, R., et al. “Direct Preference Optimization: Your Language Model is Secretly a Reward Model.” arXiv preprint arXiv:2305.18290 (2023).
- Christiano, P., et al. “Deep reinforcement learning from human preferences.” Advances in neural information processing systems (2017).
- “Scale AI Raises $1B in Accel-Led Round at $13.8B Valuation.” The Information, Bloomberg, 2024年5月報道。
- Perrigo, Billy. “OpenAI Used Kenyan Workers on Less Than $2 Per Hour to Make ChatGPT Less Toxic.” Time, 2023年1月18日。
- Anthropic. “Model Card and Evaluations for Claude Models.” Anthropic Website, 2023-2024.
- Zheng, L., et al. “Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena.” Advances in Neural Information Processing Systems (2023).
- Beeching, E., et al. “RewardBench: Evaluating Reward Models for Language Modeling.” (2024)
- NVIDIA Corporation. “HelpSteer2: For a Helping Hand in Reward Modeling.” NVIDIA Technical Blog, 2024年6月。
- 注:以上來源均為公開研究論文、官方部落格或權威媒體報道編寫。具體未揭露的商業資料,文中已註明“公開資料未見”或“估算”。