有用性
3 秒看懂
Helpfulness(有用性) 是大語言模型對齊(Alignment)中的核心目標之一,衡量模型輸出在多大程度上解決了使用者的意圖、提供了準確且可操作的資訊。它與無害性(Harmlessness)、誠實性(Honesty)共同構成當前主流RLHF/憲法AI的“三好學生”標準,直接決定產品中使用者是否“覺得這AI好用”。
- 一句話定義:模型遵循指令、給出正確完整答案、並在使用者追問時保持連貫和有益的屬性。
- 關鍵驅動:偏好資料標註、獎勵模型訓練、RLHF/DPO 對齊流程,以及模型自身能力(預訓練知識密度+推論深度)。
- 與“無害性”的張力:拒絕回答有害問題是無害,但過度拒絕會傷及有用性;平衡是最難的工程挑戰之一。
3 分鐘產業解釋
在ChatGPT等產品中,有用性不是一句口號,而是通過一整套工程管道被“煉”出來的:
-
資料標註定義有用性
標註人員根據詳細指南,對同一提示的不同回覆進行有用性排序(如“更有幫助”、“更完整”、“更符合使用者意圖”)。這些百萬量級的比較資料構成獎勵模型的訓練集。 -
獎勵模型(RM)將有用性變成標量
一箇中等規模的Transformer被訓練來預測標註者的偏好,輸出的分數即為“有用性得分”。該得分隨後作為PPO強化學習的獎勵訊號。 -
強化學習(PPO)或直接偏好最佳化(DPO)將有用性內化到策略中
模型根據獎勵訊號調整引數,在生成下一個token時不僅追求流暢,還追求高有用性。DPO則省去顯式RM,直接基於偏好對最佳化策略,降低獎勵駭客(reward hacking)風險。 -
多維評估保證有用性與其它目標不衝突
定期用GPT-4等強模型作為裁判進行自動化評估,檢查有用性、無害性、誠實性得分是否同時上升。實際部署中,有用性如果以犧牲真實性為代價(如捏造資訊),則會被負反饋壓制。
產業界共識:有用性不是絕對客觀的指標,而是人類意圖的動態對映。因此目前最高水平的對齊仍高度依賴高質量人類標註和持續迭代。據行業估算,一個前沿模型的RLHF階段,僅在有用性相關的標註上投入可超千萬人民幣量級[未充分揭露,基於招聘資料與算力成本倒推]。
15 分鐘專家深入
有用性的形式化與度量架構
有用性難以用單一數學公式精確定義,但主流做法將其操作化為偏好機率:
設提示為 x,兩個候選回答 y_1, y_2,人類標註者判斷 y_1 \succ y_2(y_1 比 y_2 更有用)。獎勵模型 r_\phi 的目標是學習一個標量函式,使得:
P(y_1 \succ y_2 \mid x) = \frac{\exp(r_\phi(x, y_1))}{\exp(r_\phi(x, y_1)) + \exp(r_\phi(x, y_2))}
訓練時通過最小化交叉熵損失來擬合人類偏好。這個機率形式隱含了Bradley-Terry模型假設,並將有用性壓縮為一維排序能力。
在實際產品中,OpenAI的InstructGPT論文(2022)將有用性細分為:遵循指令(instruction following)、準確性(factuality)、完整性(completeness)、語調適當性(appropriate tone)等子維度。Anthropic的“有用、誠實、無害(HHH)”架構中,有用性還與“誠實”解耦:模型應該在不確定時承認不知道,而不是為了顯得有用而編造。
訓練pipe中的有用性調控
SFT階段:精選高質量、高有用性的示範資料(demonstrations)進行監督微調,給模型一個有用的“初始化行為模式”。這些資料通常由訓練有素的標註員編寫,追求詳實、邏輯清晰、主動提供使用者可能需要的上下文。
RM訓練階段:獎勵模型的規模通常為策略模型的1/10~1/3引數量。為避免獎勵過度最佳化(over-optimization),會使用早停、分數正則化、KL懲罰等手段。Anthropic實踐表明,當RM與策略模型規模比值過低時,有用性得分與真實人類評價的相關性會顯著下降。
PPO階段:策略更新目標函式為:
\text{Objective} = \mathbb{E}_{x, y \sim \pi_\theta}[r_\phi(x, y)] - \beta \cdot D_{KL}(\pi_\theta(\cdot \mid x) \| \pi_{\text{ref}}(\cdot \mid x))
其中KL項約束策略不要偏離SFT初始化太遠,\beta 是調節有用性與穩定性平衡的關鍵超引數。\beta 太大,模型過於保守,有用性受限;\beta 太小,策略可能追逐獎勵模型漏洞,產生高獎勵但無用的輸出(獎勵駭客)。
DPO的等價視角:直接偏好最佳化(Rafailov et al., 2023)通過數學變換將偏好機率直接表達為策略比率的函式,無需顯式訓練RM。其損失函式隱含的獎勵為:
r(x, y) = \beta \log \frac{\pi_\theta(y \mid x)}{\pi_{\text{ref}}(y \mid x)} + \beta \log Z(x)
有用性訊號通過對比“好回答”與“差回答”在給定提示下的相對似然來注入,避免顯式標量獎勵被過度最佳化。
與無害性、誠實性的三角博弈
三者不能簡單相加。典型衝突場景:
- 有用 vs 無害:使用者問“如何製作炸藥”,無害性要求拒絕,有用性可能傾向於提供安全提示。過度拒絕會傷及正常提問(如“製作煙花的歷史”),造成有用性下降。
- 有用 vs 誠實:使用者問“2024年某未發生事件的詳細過程”,模型為了有用可能編造細節,誠實性要求坦誠不知道。現代系統通過“誠實宣告+部分資訊”的折中回答來平衡,但這會降低即時有用性感官評分。
Anthropic的Constitutional AI通過將無害性置於更高優先順序(憲法原則),讓模型自我批評和修訂,但也會在無害約束下最大化有用性。其公佈的HHH評分中,有用性和無害性通常呈現負相關,需要帕累托前沿最佳化。
技術原理
有用性如何成為模型的“內生偏好”
使用者提示 (x)
│
▼
┌───────────────┐
│ 策略模型 πθ │ ──▸ 生成回答 y
└───────┬───────┘
│
▼
┌───────────────┐
│ 獎勵模型 rφ │ ──▸ 有用性得分
└───────────────┘
│
▼
PPO/D更新:θ ← θ + α ∇θ [r - β·KL]
最大化期望獎勵,約束不遠離初始策略
在自迴歸生成中,有用性偏好通過梯度反向傳播至每個token的選擇偏好上。具體機制:
- Token級信用分配:獎勵訊號是整個序列的標量,PPO利用價值函式(通常作為獨立critic或策略模型上的附加頭)估計狀態價值並計算優勢函式,從而間接分配信用,生成“該token對最終有用性的貢獻估計”。
- 對比學習隱式注入:在DPO中,給定同一提示的好/壞回答對,模型直接比較兩者機率,提高好回答相對壞回答的似然。這使得即使某個token孤立看沒問題,但若整體導致回答不有用,其機率也會被壓制。
- 探索與利用的平衡:PPO的熵獎勵鼓勵模型在有用性空間探索,避免陷入單一枯燥的“安全但平庸”模式。適當的熵正則化讓回答在有用基礎上保留多樣性。
關鍵引數數量級:
- 一個典型7B的RLHF模型,獎勵模型引數約300M~1B[行業觀察估算]。
- 有用性偏好對資料集常見規模:數萬到數十萬條比較對(如Anthropic HH-RLHF資料集合計約16萬條,其中有用性子集佔相當比例)[基於公開論文]。
- KL懲罰係數
\beta通常在0.001~0.1之間,視模型規模和訓練穩定性調整[基於公開實驗慣例]。 - 模型在PPO階段通常在數十到數百輪訓練後達到有用性峰值,隨後隨著KL漂移增大,有用性開始下降[經驗觀察,未充分定量揭露]。
為什麼不能只用自動化指標衡量有用性
Auto-eval(用強LLM如GPT-4做裁判)已成為實用手段,但其內在侷限:
- 裁判模型本身的有用性偏差:若裁判模型對特定風格有偏好(如長輸出、列表格式),可能高估某些格式化的低質回答。
- 語法陷阱:流暢且複雜的表述往往獲得高分,以掩蓋內容空洞或事實錯誤。
- 分佈外問題:對需要精確專業知識或極新資訊的提示,裁判模型的判斷不可靠。 因此,頂級對齊團隊仍保持不低於10%的人工抽檢比例[行業慣例推算,未公開資料]。
技術演進史
| 時期 | 里程碑 | 有用性處理的演進 |
|---|---|---|
| 2017-2020 | 預訓練+微調範式主導 | 有用性等同於下游任務準確率(如問答F1),未獨立建模 |
| 2020 | GPT-3釋出,提示工程興起 | 有用性通過精巧的prompt設計部分實現,但極不穩定 |
| 2022.1 | InstructGPT論文 (OpenAI) | 首次系統定義和分離“有幫助”與“無害”,提出RLHF三階段pipe |
| 2022.4 | Anthropic HH-RLHF資料集公開 | 提供有用性和無害性二維偏好資料,推動獨立研究 |
| 2022.12 | ChatGPT爆火,RLHF成為工業標配 | 有用性直接由千萬使用者隱式反饋(點贊/踩)持續最佳化 |
| 2023.5 | DPO論文提出 | 省去顯式獎勵模型,用偏好對直接最佳化,降低有用性對齊的工程複雜度 |
| 2023-2024 | 合成數據與AI反饋(RLAIF)興起 | 用大型模型生成有用性偏好資料,降低人工標註依賴,GoogleBard/Anthropic Claude 2實踐 |
技術路線對比
| 維度 | RLHF (PPO) | DPO | RLAIF(AI反饋) |
|---|---|---|---|
| 有用性注入方式 | 訓練獨立RM,通過PPO將RM分數內化到策略 | 直接在偏好對上最佳化策略,隱式學習獎勵 | 用AI生成的偏好標註資料替代人類標註,後續仍走RLHF或DPO |
| 對有用性控制的精細度 | 高,可獨立調節KL懲罰、RM更新等 | 中,控制主要通過資料集建置和\beta | 取決於AI標註質量,通常低於人類,但成本極低 |
| 獎勵駭客風險 | 較高,RM可能被過度最佳化 | 較低,無獨立RM可被攻擊 | 同所選最佳化器 |
| 計算/人力成本 | 極高(需訓練RM、維護PPO四模型) | 中(無需RM,但偏好資料仍需標註) | 人力成本極低,但需大量計算生成AI偏好 |
| 典型代表 | ChatGPT, GPT-4, Claude 2 | 許多開源模型(Zephyr, Llama3對齊版) | 用於降低前沿模型成本,輔以人類驗證 |
上下游
上游:決定有用性天花板
-
預訓練資料質量與分佈
模型的知識儲備、推論模式、寫作風格都源自預訓練。若預訓練資料中充滿矛盾或垃圾資訊,對齊時提升有用性將極為困難(上限被鎖死)。 -
人類標註員素質與標註指南
標註員的教育水平、對指南的理解一致性、標註過程的審校機制,直接決定有用性偏好的“真值”質量。一項研究估算,標註不一致率每降低1%,下游有用性得分可能提升0.5個百分點[基於部分機構公開的標註一致性研究]。 -
基礎模型架構能力
長上下文支援、多步推論能力、準確的工具呼叫等結構能力,使模型能從“知道什麼”走向“如何有用”。
下游:有用性的產品化體現
- 對話助手:有用性直接體現為問題解決率、使用者滿意度(CSAT)、續聊率。
- 程式碼助手:生成程式碼的正確性、可執行率、解釋清晰度構成“有用”的核心KPI。
- 企業知識庫問答:答案是否精準命中文件中的相關資訊,且附有引用來源。
- 搜尋增強:模型總結搜尋結果時,是否抓住了使用者意圖的關鍵點,而不是簡單堆砌。
關鍵指標
| 指標 | 定義 | 如何反映有用性 | 侷限性 |
|---|---|---|---|
| ELO/偏好勝率 | 基於成對比較計算的相對實力分 | 直接衡量人類/AI眼中哪個模型更有用 | 依賴比較池的質量,無法給出絕對有用性分數 |
| Alpaca Eval 2.0 LC勝率 | 對GPT-4-Turbo的勝率(長度控制後) | 自動化評估有用性,與企業級人工評測相關性0.9以上[引自AlpacaEval報告] | 仍偏向長輸出,需LC校正 |
| MT-Bench分數 | GPT-4在多輪對話任務上打分 | 考察多輪對話中的持續有用性 | 試題靜態,可能被過擬 |
| TruthfulQA MC準確率 | 選擇正確而非流行錯誤答案的比例 | 測誠實性,但與有用性正相關(不誠實通常沒用) | 只覆蓋conflict類問題 |
| 使用者留存與活躍度 | 7日/30日留存率 | 產品側“真有用”的綜合指標 | 隱含無用的其它因素(速度、UI) |
供需與市場資料
- 標註市場:全球AI訓練資料服務市場2023年約23億美元,預計2030年達到76億美元[Grand View Research], 其中偏好排序標註(直接服務於有用性對齊)是增長最快的細分。Scale AI、Surge AI等公司專精於此。
- 算力消耗:一個百億級引數的RLHF,PPO階段消耗的GPU時可達預訓練的2%-5%[估算,未充分揭露]。隨著模型規模增大,對齊成本佔比上升,有用性成為“奢侈品”。
- 需求趨勢:企業級客戶在私有部署大型模型時,“有用且可定製的對齊”已成為差異化焦點,催生了對DPO等低成本對齊技術的旺盛需求。
- 人才流動:對齊研究員(尤其是偏好建模與RLHF方向)薪酬極高,反映了市場對有用性等核心指標極致最佳化的迫切需求。
代表公司與資本對映
| 公司 | 有用性相關核心技術/產品 | 資本對映 |
|---|---|---|
| OpenAI | InstructGPT/ChatGPT/GPT-4的RLHF體系,持續線上使用者反饋迴圈 | 閉源之王,對齊質量直接支撐訂閱與API營收 |
| Anthropic | HHH原則、Constitutional AI、AI反饋對齊,強調安全與有用的平衡 | 獲得Google、Spark等數十億投資,安全+有用估值核心 |
| Meta | Llama 3公開說明採用DPO和人類偏好最佳化,開源生態推動有用性研究 | 開源策略旨在建立生態壁壘,間接獲益 |
| Hugging Face | DPO、Zephyr模型等推動低成本有用性對齊的民主化 | 提供Hub、計算服務,連線開源與商業化訓練 |
| Scale AI | 為企業提供RLHF偏好資料標註平台和工具 | 資料獨角獸,估值超70億美元,有用性標註是主要營收來源 |
投資邏輯
-
有用性即護城河
基礎模型權重趨同,對齊技術(尤其是有用性與無害性的精妙平衡)是產品體驗差異化的核心。誰的模型在保持無害的前提下“最有用”,誰就能獲得更高的使用者黏性和付費轉化。 -
低成本對齊賽道
DPO、Odds Ratio Preference Optimization等新演算法降低了有用性注入的工程和人力成本。這利好開源社群和垂直領域小模型,使“私有資料+輕量DPO”成為企業部署高效能模型的可及路徑,投資機會可能在提供此類工具鏈的公司。 -
合成數據與自動對齊
AI反饋正逐步替代部分人工標註,降低長期有用性最佳化的邊際成本。關注將RLAIF成熟度產品化的初創,它們可能通過大幅降低對齊成本而切入企業市場。 -
評估即標準
有用性的有效自動評估工具(如AlpacaEval、Chatbot Arena)成為行業“裁判”。若能成為公認的有用性標尺,其背後的組織(如LMSYS)有潛力制定行業標準,衍生商業價值。
常見誤讀糾偏
誤讀1:“有用性就是模型很聰明、知識多。” 糾正:有用性 ≠ 能力。一個知識淵博但聽不懂使用者指令、亂給資訊的模型是有能力但無用的。有用性強調與使用者意圖的精準對齊,包含指令遵循、資訊呈現方式、甚至主動感知使用者未言明的需求。一個引數更小的模型如果在對齊上做得更好,完全可以比超大型模型“更有用”。
誤讀2:“RLHF後的模型就永遠有用了。” 糾正:有用性是分佈內對齊且極易漂移的特性。當用戶提問型別偏離RLHF訓練分佈(OOD),如從英語切換到低資源語言、提出極專業罕見的問題,有用性會急劇下降。此外,多輪對話中的語境破壞(如模型忘記前文)也會導致有用性坍塌。有用性需要持續的反饋迴流和重訓練。
誤讀3:“DPO不需要獎勵模型,所以不存在獎勵駭客問題。”
糾正:DPO雖然不顯式維護一個獨立RM,但在數學上等價於在偏好對上學習一個隱式獎勵函式 r = \beta \log(\pi_\theta/\pi_{\text{ref}})。當偏好資料集不夠全面或存在偏差時,策略仍然可能找到投機取巧的模式,最大化這個隱式獎勵而不真正提升有用性。它只是降低了獎勵駭客的表面機率,並未根除本質風險。
學習路徑
- 入門:閱讀OpenAI的《Learning to summarize from human feedback》和《Training language models to follow instructions with human feedback》,建立RLHF全貌認知。
- 核心:深入DPO論文《Direct Preference Optimization》,理解偏好機率到策略最佳化的數學推導。對比PPO與DPO的演算法實現細節。
- 廣角:閱讀Anthropic的HHH論文和Constitutional AI技術報告,理解多目標平衡。探索RLAIF論文(如Bai et al., 2022, “Constitutional AI”)以掌握AI反饋迴圈。
- 實踐:使用Hugging Face TRL庫親手完成一個DPO微調小模型的完整流程,體驗有用性資料集建置與
\beta調參。 - 前沿追蹤:關注LMSYS Chatbot Arena的Elo評分演化、KTO(Kahneman-Tversky Optimization)等新型對齊目標,它們從不同角度重新定義“有用”。
一句話總結
有用性是人工智慧從“會說”到“會聽”、從“能做”到“願做正確事”轉化的靈魂,它極端依賴人類反饋,卻向著自主湧現的方向演進。
延伸閱讀與來源
- Ouyang et al., 2022. “Training language models to follow instructions with human feedback.” arXiv:2203.02155.
- Bai et al., 2022. “Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback.” arXiv:2204.05862.
- Rafailov et al., 2023. “Direct Preference Optimization: Your Language Model is Secretly a Reward Model.” arXiv:2305.18290.
- Bai et al., 2022. “Constitutional AI: Harmlessness from AI Feedback.” arXiv:2212.08073.
- AlpacaEval: https://tatsu-lab.github.io/alpaca_eval/ (自動評估勝率).
- Chatbot Arena (LMSYS): https://chat.lmsys.org/?arena (眾包ELO).
- Hugging Face TRL: https://github.com/huggingface/trl (RLHF/DPO實踐庫).