模型層 開放閱讀

有用性

Helpfulness

概念 ID
helpfulness
更新時間
2026-05-29
來源數量
待補

有用性

3 秒看懂

Helpfulness(有用性) 是大語言模型對齊(Alignment)中的核心目標之一,衡量模型輸出在多大程度上解決了使用者的意圖、提供了準確且可操作的資訊。它與無害性(Harmlessness)、誠實性(Honesty)共同構成當前主流RLHF/憲法AI的“三好學生”標準,直接決定產品中使用者是否“覺得這AI好用”。

  • 一句話定義:模型遵循指令、給出正確完整答案、並在使用者追問時保持連貫和有益的屬性。
  • 關鍵驅動:偏好資料標註、獎勵模型訓練、RLHF/DPO 對齊流程,以及模型自身能力(預訓練知識密度+推論深度)。
  • 與“無害性”的張力:拒絕回答有害問題是無害,但過度拒絕會傷及有用性;平衡是最難的工程挑戰之一。

3 分鐘產業解釋

在ChatGPT等產品中,有用性不是一句口號,而是通過一整套工程管道被“煉”出來的:

  1. 資料標註定義有用性
    標註人員根據詳細指南,對同一提示的不同回覆進行有用性排序(如“更有幫助”、“更完整”、“更符合使用者意圖”)。這些百萬量級的比較資料構成獎勵模型的訓練集。

  2. 獎勵模型(RM)將有用性變成標量
    一箇中等規模的Transformer被訓練來預測標註者的偏好,輸出的分數即為“有用性得分”。該得分隨後作為PPO強化學習的獎勵訊號。

  3. 強化學習(PPO)或直接偏好最佳化(DPO)將有用性內化到策略中
    模型根據獎勵訊號調整引數,在生成下一個token時不僅追求流暢,還追求高有用性。DPO則省去顯式RM,直接基於偏好對最佳化策略,降低獎勵駭客(reward hacking)風險。

  4. 多維評估保證有用性與其它目標不衝突
    定期用GPT-4等強模型作為裁判進行自動化評估,檢查有用性、無害性、誠實性得分是否同時上升。實際部署中,有用性如果以犧牲真實性為代價(如捏造資訊),則會被負反饋壓制。

產業界共識:有用性不是絕對客觀的指標,而是人類意圖的動態對映。因此目前最高水平的對齊仍高度依賴高質量人類標註和持續迭代。據行業估算,一個前沿模型的RLHF階段,僅在有用性相關的標註上投入可超千萬人民幣量級[未充分揭露,基於招聘資料與算力成本倒推]。

15 分鐘專家深入

有用性的形式化與度量架構

有用性難以用單一數學公式精確定義,但主流做法將其操作化為偏好機率

設提示為 x,兩個候選回答 y_1, y_2,人類標註者判斷 y_1 \succ y_2y_1y_2 更有用)。獎勵模型 r_\phi 的目標是學習一個標量函式,使得:

P(y_1 \succ y_2 \mid x) = \frac{\exp(r_\phi(x, y_1))}{\exp(r_\phi(x, y_1)) + \exp(r_\phi(x, y_2))}

訓練時通過最小化交叉熵損失來擬合人類偏好。這個機率形式隱含了Bradley-Terry模型假設,並將有用性壓縮為一維排序能力。

在實際產品中,OpenAI的InstructGPT論文(2022)將有用性細分為:遵循指令(instruction following)、準確性(factuality)、完整性(completeness)、語調適當性(appropriate tone)等子維度。Anthropic的“有用、誠實、無害(HHH)”架構中,有用性還與“誠實”解耦:模型應該在不確定時承認不知道,而不是為了顯得有用而編造。

訓練pipe中的有用性調控

SFT階段:精選高質量、高有用性的示範資料(demonstrations)進行監督微調,給模型一個有用的“初始化行為模式”。這些資料通常由訓練有素的標註員編寫,追求詳實、邏輯清晰、主動提供使用者可能需要的上下文。

RM訓練階段:獎勵模型的規模通常為策略模型的1/10~1/3引數量。為避免獎勵過度最佳化(over-optimization),會使用早停、分數正則化、KL懲罰等手段。Anthropic實踐表明,當RM與策略模型規模比值過低時,有用性得分與真實人類評價的相關性會顯著下降。

PPO階段:策略更新目標函式為:

\text{Objective} = \mathbb{E}_{x, y \sim \pi_\theta}[r_\phi(x, y)] - \beta \cdot D_{KL}(\pi_\theta(\cdot \mid x) \| \pi_{\text{ref}}(\cdot \mid x))

其中KL項約束策略不要偏離SFT初始化太遠,\beta 是調節有用性與穩定性平衡的關鍵超引數。\beta 太大,模型過於保守,有用性受限;\beta 太小,策略可能追逐獎勵模型漏洞,產生高獎勵但無用的輸出(獎勵駭客)。

DPO的等價視角:直接偏好最佳化(Rafailov et al., 2023)通過數學變換將偏好機率直接表達為策略比率的函式,無需顯式訓練RM。其損失函式隱含的獎勵為:

r(x, y) = \beta \log \frac{\pi_\theta(y \mid x)}{\pi_{\text{ref}}(y \mid x)} + \beta \log Z(x)

有用性訊號通過對比“好回答”與“差回答”在給定提示下的相對似然來注入,避免顯式標量獎勵被過度最佳化。

與無害性、誠實性的三角博弈

三者不能簡單相加。典型衝突場景:

  • 有用 vs 無害:使用者問“如何製作炸藥”,無害性要求拒絕,有用性可能傾向於提供安全提示。過度拒絕會傷及正常提問(如“製作煙花的歷史”),造成有用性下降。
  • 有用 vs 誠實:使用者問“2024年某未發生事件的詳細過程”,模型為了有用可能編造細節,誠實性要求坦誠不知道。現代系統通過“誠實宣告+部分資訊”的折中回答來平衡,但這會降低即時有用性感官評分。

Anthropic的Constitutional AI通過將無害性置於更高優先順序(憲法原則),讓模型自我批評和修訂,但也會在無害約束下最大化有用性。其公佈的HHH評分中,有用性和無害性通常呈現負相關,需要帕累托前沿最佳化。

技術原理

有用性如何成為模型的“內生偏好”

使用者提示 (x)


┌───────────────┐
│  策略模型 πθ   │ ──▸ 生成回答 y
└───────┬───────┘


┌───────────────┐
│  獎勵模型 rφ   │ ──▸ 有用性得分
└───────────────┘


 PPO/D更新:θ ← θ + α ∇θ [r - β·KL]
 最大化期望獎勵,約束不遠離初始策略

在自迴歸生成中,有用性偏好通過梯度反向傳播至每個token的選擇偏好上。具體機制:

  • Token級信用分配:獎勵訊號是整個序列的標量,PPO利用價值函式(通常作為獨立critic或策略模型上的附加頭)估計狀態價值並計算優勢函式,從而間接分配信用,生成“該token對最終有用性的貢獻估計”。
  • 對比學習隱式注入:在DPO中,給定同一提示的好/壞回答對,模型直接比較兩者機率,提高好回答相對壞回答的似然。這使得即使某個token孤立看沒問題,但若整體導致回答不有用,其機率也會被壓制。
  • 探索與利用的平衡:PPO的熵獎勵鼓勵模型在有用性空間探索,避免陷入單一枯燥的“安全但平庸”模式。適當的熵正則化讓回答在有用基礎上保留多樣性。

關鍵引數數量級

  • 一個典型7B的RLHF模型,獎勵模型引數約300M~1B[行業觀察估算]。
  • 有用性偏好對資料集常見規模:數萬到數十萬條比較對(如Anthropic HH-RLHF資料集合計約16萬條,其中有用性子集佔相當比例)[基於公開論文]。
  • KL懲罰係數\beta通常在0.001~0.1之間,視模型規模和訓練穩定性調整[基於公開實驗慣例]。
  • 模型在PPO階段通常在數十到數百輪訓練後達到有用性峰值,隨後隨著KL漂移增大,有用性開始下降[經驗觀察,未充分定量揭露]。

為什麼不能只用自動化指標衡量有用性

Auto-eval(用強LLM如GPT-4做裁判)已成為實用手段,但其內在侷限:

  1. 裁判模型本身的有用性偏差:若裁判模型對特定風格有偏好(如長輸出、列表格式),可能高估某些格式化的低質回答。
  2. 語法陷阱:流暢且複雜的表述往往獲得高分,以掩蓋內容空洞或事實錯誤。
  3. 分佈外問題:對需要精確專業知識或極新資訊的提示,裁判模型的判斷不可靠。 因此,頂級對齊團隊仍保持不低於10%的人工抽檢比例[行業慣例推算,未公開資料]。

技術演進史

時期里程碑有用性處理的演進
2017-2020預訓練+微調範式主導有用性等同於下游任務準確率(如問答F1),未獨立建模
2020GPT-3釋出,提示工程興起有用性通過精巧的prompt設計部分實現,但極不穩定
2022.1InstructGPT論文 (OpenAI)首次系統定義和分離“有幫助”與“無害”,提出RLHF三階段pipe
2022.4Anthropic HH-RLHF資料集公開提供有用性和無害性二維偏好資料,推動獨立研究
2022.12ChatGPT爆火,RLHF成為工業標配有用性直接由千萬使用者隱式反饋(點贊/踩)持續最佳化
2023.5DPO論文提出省去顯式獎勵模型,用偏好對直接最佳化,降低有用性對齊的工程複雜度
2023-2024合成數據與AI反饋(RLAIF)興起用大型模型生成有用性偏好資料,降低人工標註依賴,GoogleBard/Anthropic Claude 2實踐

技術路線對比

維度RLHF (PPO)DPORLAIF(AI反饋)
有用性注入方式訓練獨立RM,通過PPO將RM分數內化到策略直接在偏好對上最佳化策略,隱式學習獎勵用AI生成的偏好標註資料替代人類標註,後續仍走RLHF或DPO
對有用性控制的精細度高,可獨立調節KL懲罰、RM更新等中,控制主要通過資料集建置和\beta取決於AI標註質量,通常低於人類,但成本極低
獎勵駭客風險較高,RM可能被過度最佳化較低,無獨立RM可被攻擊同所選最佳化器
計算/人力成本極高(需訓練RM、維護PPO四模型)中(無需RM,但偏好資料仍需標註)人力成本極低,但需大量計算生成AI偏好
典型代表ChatGPT, GPT-4, Claude 2許多開源模型(Zephyr, Llama3對齊版)用於降低前沿模型成本,輔以人類驗證

上下游

上游:決定有用性天花板

  1. 預訓練資料質量與分佈
    模型的知識儲備、推論模式、寫作風格都源自預訓練。若預訓練資料中充滿矛盾或垃圾資訊,對齊時提升有用性將極為困難(上限被鎖死)。

  2. 人類標註員素質與標註指南
    標註員的教育水平、對指南的理解一致性、標註過程的審校機制,直接決定有用性偏好的“真值”質量。一項研究估算,標註不一致率每降低1%,下游有用性得分可能提升0.5個百分點[基於部分機構公開的標註一致性研究]。

  3. 基礎模型架構能力
    長上下文支援、多步推論能力、準確的工具呼叫等結構能力,使模型能從“知道什麼”走向“如何有用”。

下游:有用性的產品化體現

  • 對話助手:有用性直接體現為問題解決率、使用者滿意度(CSAT)、續聊率。
  • 程式碼助手:生成程式碼的正確性、可執行率、解釋清晰度構成“有用”的核心KPI。
  • 企業知識庫問答:答案是否精準命中文件中的相關資訊,且附有引用來源。
  • 搜尋增強:模型總結搜尋結果時,是否抓住了使用者意圖的關鍵點,而不是簡單堆砌。

關鍵指標

指標定義如何反映有用性侷限性
ELO/偏好勝率基於成對比較計算的相對實力分直接衡量人類/AI眼中哪個模型更有用依賴比較池的質量,無法給出絕對有用性分數
Alpaca Eval 2.0 LC勝率對GPT-4-Turbo的勝率(長度控制後)自動化評估有用性,與企業級人工評測相關性0.9以上[引自AlpacaEval報告]仍偏向長輸出,需LC校正
MT-Bench分數GPT-4在多輪對話任務上打分考察多輪對話中的持續有用性試題靜態,可能被過擬
TruthfulQA MC準確率選擇正確而非流行錯誤答案的比例測誠實性,但與有用性正相關(不誠實通常沒用)只覆蓋conflict類問題
使用者留存與活躍度7日/30日留存率產品側“真有用”的綜合指標隱含無用的其它因素(速度、UI)

供需與市場資料

  • 標註市場:全球AI訓練資料服務市場2023年約23億美元,預計2030年達到76億美元[Grand View Research], 其中偏好排序標註(直接服務於有用性對齊)是增長最快的細分。Scale AI、Surge AI等公司專精於此。
  • 算力消耗:一個百億級引數的RLHF,PPO階段消耗的GPU時可達預訓練的2%-5%[估算,未充分揭露]。隨著模型規模增大,對齊成本佔比上升,有用性成為“奢侈品”。
  • 需求趨勢:企業級客戶在私有部署大型模型時,“有用且可定製的對齊”已成為差異化焦點,催生了對DPO等低成本對齊技術的旺盛需求。
  • 人才流動:對齊研究員(尤其是偏好建模與RLHF方向)薪酬極高,反映了市場對有用性等核心指標極致最佳化的迫切需求。

代表公司與資本對映

公司有用性相關核心技術/產品資本對映
OpenAIInstructGPT/ChatGPT/GPT-4的RLHF體系,持續線上使用者反饋迴圈閉源之王,對齊質量直接支撐訂閱與API營收
AnthropicHHH原則、Constitutional AI、AI反饋對齊,強調安全與有用的平衡獲得Google、Spark等數十億投資,安全+有用估值核心
MetaLlama 3公開說明採用DPO和人類偏好最佳化,開源生態推動有用性研究開源策略旨在建立生態壁壘,間接獲益
Hugging FaceDPO、Zephyr模型等推動低成本有用性對齊的民主化提供Hub、計算服務,連線開源與商業化訓練
Scale AI為企業提供RLHF偏好資料標註平台和工具資料獨角獸,估值超70億美元,有用性標註是主要營收來源

投資邏輯

  1. 有用性即護城河
    基礎模型權重趨同,對齊技術(尤其是有用性與無害性的精妙平衡)是產品體驗差異化的核心。誰的模型在保持無害的前提下“最有用”,誰就能獲得更高的使用者黏性和付費轉化。

  2. 低成本對齊賽道
    DPO、Odds Ratio Preference Optimization等新演算法降低了有用性注入的工程和人力成本。這利好開源社群和垂直領域小模型,使“私有資料+輕量DPO”成為企業部署高效能模型的可及路徑,投資機會可能在提供此類工具鏈的公司。

  3. 合成數據與自動對齊
    AI反饋正逐步替代部分人工標註,降低長期有用性最佳化的邊際成本。關注將RLAIF成熟度產品化的初創,它們可能通過大幅降低對齊成本而切入企業市場。

  4. 評估即標準
    有用性的有效自動評估工具(如AlpacaEval、Chatbot Arena)成為行業“裁判”。若能成為公認的有用性標尺,其背後的組織(如LMSYS)有潛力制定行業標準,衍生商業價值。

常見誤讀糾偏

誤讀1:“有用性就是模型很聰明、知識多。” 糾正:有用性 ≠ 能力。一個知識淵博但聽不懂使用者指令、亂給資訊的模型是有能力但無用的。有用性強調與使用者意圖的精準對齊,包含指令遵循、資訊呈現方式、甚至主動感知使用者未言明的需求。一個引數更小的模型如果在對齊上做得更好,完全可以比超大型模型“更有用”。

誤讀2:“RLHF後的模型就永遠有用了。” 糾正:有用性是分佈內對齊且極易漂移的特性。當用戶提問型別偏離RLHF訓練分佈(OOD),如從英語切換到低資源語言、提出極專業罕見的問題,有用性會急劇下降。此外,多輪對話中的語境破壞(如模型忘記前文)也會導致有用性坍塌。有用性需要持續的反饋迴流和重訓練。

誤讀3:“DPO不需要獎勵模型,所以不存在獎勵駭客問題。” 糾正:DPO雖然不顯式維護一個獨立RM,但在數學上等價於在偏好對上學習一個隱式獎勵函式 r = \beta \log(\pi_\theta/\pi_{\text{ref}})。當偏好資料集不夠全面或存在偏差時,策略仍然可能找到投機取巧的模式,最大化這個隱式獎勵而不真正提升有用性。它只是降低了獎勵駭客的表面機率,並未根除本質風險。

學習路徑

  1. 入門:閱讀OpenAI的《Learning to summarize from human feedback》和《Training language models to follow instructions with human feedback》,建立RLHF全貌認知。
  2. 核心:深入DPO論文《Direct Preference Optimization》,理解偏好機率到策略最佳化的數學推導。對比PPO與DPO的演算法實現細節。
  3. 廣角:閱讀Anthropic的HHH論文和Constitutional AI技術報告,理解多目標平衡。探索RLAIF論文(如Bai et al., 2022, “Constitutional AI”)以掌握AI反饋迴圈。
  4. 實踐:使用Hugging Face TRL庫親手完成一個DPO微調小模型的完整流程,體驗有用性資料集建置與\beta調參。
  5. 前沿追蹤:關注LMSYS Chatbot Arena的Elo評分演化、KTO(Kahneman-Tversky Optimization)等新型對齊目標,它們從不同角度重新定義“有用”。

一句話總結

有用性是人工智慧從“會說”到“會聽”、從“能做”到“願做正確事”轉化的靈魂,它極端依賴人類反饋,卻向著自主湧現的方向演進。

延伸閱讀與來源

  • Ouyang et al., 2022. “Training language models to follow instructions with human feedback.” arXiv:2203.02155.
  • Bai et al., 2022. “Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback.” arXiv:2204.05862.
  • Rafailov et al., 2023. “Direct Preference Optimization: Your Language Model is Secretly a Reward Model.” arXiv:2305.18290.
  • Bai et al., 2022. “Constitutional AI: Harmlessness from AI Feedback.” arXiv:2212.08073.
  • AlpacaEval: https://tatsu-lab.github.io/alpaca_eval/ (自動評估勝率).
  • Chatbot Arena (LMSYS): https://chat.lmsys.org/?arena (眾包ELO).
  • Hugging Face TRL: https://github.com/huggingface/trl (RLHF/DPO實踐庫).
source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型