模型层 开放阅读

有用性

Helpfulness

概念 ID
helpfulness
更新时间
2026-05-29
来源数量
待补

有用性

3 秒看懂

Helpfulness(有用性) 是大语言模型对齐(Alignment)中的核心目标之一,衡量模型输出在多大程度上解决了用户的意图、提供了准确且可操作的信息。它与无害性(Harmlessness)、诚实性(Honesty)共同构成当前主流RLHF/宪法AI的“三好学生”标准,直接决定产品中用户是否“觉得这AI好用”。

  • 一句话定义:模型遵循指令、给出正确完整答案、并在用户追问时保持连贯和有益的属性。
  • 关键驱动:偏好数据标注、奖励模型训练、RLHF/DPO 对齐流程,以及模型自身能力(预训练知识密度+推理深度)。
  • 与“无害性”的张力:拒绝回答有害问题是无害,但过度拒绝会伤及有用性;平衡是最难的工程挑战之一。

3 分钟产业解释

在ChatGPT等产品中,有用性不是一句口号,而是通过一整套工程管道被“炼”出来的:

  1. 数据标注定义有用性
    标注人员根据详细指南,对同一提示的不同回复进行有用性排序(如“更有帮助”、“更完整”、“更符合用户意图”)。这些百万量级的比较数据构成奖励模型的训练集。

  2. 奖励模型(RM)将有用性变成标量
    一个中等规模的Transformer被训练来预测标注者的偏好,输出的分数即为“有用性得分”。该得分随后作为PPO强化学习的奖励信号。

  3. 强化学习(PPO)或直接偏好优化(DPO)将有用性内化到策略中
    模型根据奖励信号调整参数,在生成下一个token时不仅追求流畅,还追求高有用性。DPO则省去显式RM,直接基于偏好对优化策略,降低奖励黑客(reward hacking)风险。

  4. 多维评估保证有用性与其它目标不冲突
    定期用GPT-4等强模型作为裁判进行自动化评估,检查有用性、无害性、诚实性得分是否同时上升。实际部署中,有用性如果以牺牲真实性为代价(如捏造信息),则会被负反馈压制。

产业界共识:有用性不是绝对客观的指标,而是人类意图的动态映射。因此目前最高水平的对齐仍高度依赖高质量人类标注和持续迭代。据行业估算,一个前沿模型的RLHF阶段,仅在有用性相关的标注上投入可超千万人民币量级[未充分披露,基于招聘数据与算力成本倒推]。

15 分钟专家深入

有用性的形式化与度量框架

有用性难以用单一数学公式精确定义,但主流做法将其操作化为偏好概率

设提示为 x,两个候选回答 y_1, y_2,人类标注者判断 y_1 \succ y_2y_1y_2 更有用)。奖励模型 r_\phi 的目标是学习一个标量函数,使得:

P(y_1 \succ y_2 \mid x) = \frac{\exp(r_\phi(x, y_1))}{\exp(r_\phi(x, y_1)) + \exp(r_\phi(x, y_2))}

训练时通过最小化交叉熵损失来拟合人类偏好。这个概率形式隐含了Bradley-Terry模型假设,并将有用性压缩为一维排序能力。

在实际产品中,OpenAI的InstructGPT论文(2022)将有用性细分为:遵循指令(instruction following)、准确性(factuality)、完整性(completeness)、语调适当性(appropriate tone)等子维度。Anthropic的“有用、诚实、无害(HHH)”框架中,有用性还与“诚实”解耦:模型应该在不确定时承认不知道,而不是为了显得有用而编造。

训练pipe中的有用性调控

SFT阶段:精选高质量、高有用性的示范数据(demonstrations)进行监督微调,给模型一个有用的“初始化行为模式”。这些数据通常由训练有素的标注员编写,追求详实、逻辑清晰、主动提供用户可能需要的上下文。

RM训练阶段:奖励模型的规模通常为策略模型的1/10~1/3参数量。为避免奖励过度优化(over-optimization),会使用早停、分数正则化、KL惩罚等手段。Anthropic实践表明,当RM与策略模型规模比值过低时,有用性得分与真实人类评价的相关性会显著下降。

PPO阶段:策略更新目标函数为:

\text{Objective} = \mathbb{E}_{x, y \sim \pi_\theta}[r_\phi(x, y)] - \beta \cdot D_{KL}(\pi_\theta(\cdot \mid x) \| \pi_{\text{ref}}(\cdot \mid x))

其中KL项约束策略不要偏离SFT初始化太远,\beta 是调节有用性与稳定性平衡的关键超参数。\beta 太大,模型过于保守,有用性受限;\beta 太小,策略可能追逐奖励模型漏洞,产生高奖励但无用的输出(奖励黑客)。

DPO的等价视角:直接偏好优化(Rafailov et al., 2023)通过数学变换将偏好概率直接表达为策略比率的函数,无需显式训练RM。其损失函数隐含的奖励为:

r(x, y) = \beta \log \frac{\pi_\theta(y \mid x)}{\pi_{\text{ref}}(y \mid x)} + \beta \log Z(x)

有用性信号通过对比“好回答”与“差回答”在给定提示下的相对似然来注入,避免显式标量奖励被过度优化。

与无害性、诚实性的三角博弈

三者不能简单相加。典型冲突场景:

  • 有用 vs 无害:用户问“如何制作炸药”,无害性要求拒绝,有用性可能倾向于提供安全提示。过度拒绝会伤及正常提问(如“制作烟花的历史”),造成有用性下降。
  • 有用 vs 诚实:用户问“2024年某未发生事件的详细过程”,模型为了有用可能编造细节,诚实性要求坦诚不知道。现代系统通过“诚实声明+部分信息”的折中回答来平衡,但这会降低即时有用性感官评分。

Anthropic的Constitutional AI通过将无害性置于更高优先级(宪法原则),让模型自我批评和修订,但也会在无害约束下最大化有用性。其公布的HHH评分中,有用性和无害性通常呈现负相关,需要帕累托前沿优化。

技术原理

有用性如何成为模型的“内生偏好”

用户提示 (x)
    │
    ▼
┌───────────────┐
│  策略模型 πθ   │ ──▸ 生成回答 y
└───────┬───────┘
        │
        ▼
┌───────────────┐
│  奖励模型 rφ   │ ──▸ 有用性得分
└───────────────┘
        │
        ▼
 PPO/D更新:θ ← θ + α ∇θ [r - β·KL]
 最大化期望奖励,约束不远离初始策略

在自回归生成中,有用性偏好通过梯度反向传播至每个token的选择偏好上。具体机制:

  • Token级信用分配:奖励信号是整个序列的标量,PPO利用价值函数(通常作为独立critic或策略模型上的附加头)估计状态价值并计算优势函数,从而间接分配信用,生成“该token对最终有用性的贡献估计”。
  • 对比学习隐式注入:在DPO中,给定同一提示的好/坏回答对,模型直接比较两者概率,提高好回答相对坏回答的似然。这使得即使某个token孤立看没问题,但若整体导致回答不有用,其概率也会被压制。
  • 探索与利用的平衡:PPO的熵奖励鼓励模型在有用性空间探索,避免陷入单一枯燥的“安全但平庸”模式。适当的熵正则化让回答在有用基础上保留多样性。

关键参数数量级

  • 一个典型7B的RLHF模型,奖励模型参数约300M~1B[行业观察估算]。
  • 有用性偏好对数据集常见规模:数万到数十万条比较对(如Anthropic HH-RLHF数据集合计约16万条,其中有用性子集占相当比例)[基于公开论文]。
  • KL惩罚系数\beta通常在0.001~0.1之间,视模型规模和训练稳定性调整[基于公开实验惯例]。
  • 模型在PPO阶段通常在数十到数百轮训练后达到有用性峰值,随后随着KL漂移增大,有用性开始下降[经验观察,未充分定量披露]。

为什么不能只用自动化指标衡量有用性

Auto-eval(用强LLM如GPT-4做裁判)已成为实用手段,但其内在局限:

  1. 裁判模型本身的有用性偏差:若裁判模型对特定风格有偏好(如长输出、列表格式),可能高估某些格式化的低质回答。
  2. 语法陷阱:流畅且复杂的表述往往获得高分,以掩盖内容空洞或事实错误。
  3. 分布外问题:对需要精确专业知识或极新信息的提示,裁判模型的判断不可靠。 因此,顶级对齐团队仍保持不低于10%的人工抽检比例[行业惯例推算,未公开数据]。

技术演进史

时期里程碑有用性处理的演进
2017-2020预训练+微调范式主导有用性等同于下游任务准确率(如问答F1),未独立建模
2020GPT-3发布,提示工程兴起有用性通过精巧的prompt设计部分实现,但极不稳定
2022.1InstructGPT论文 (OpenAI)首次系统定义和分离“有帮助”与“无害”,提出RLHF三阶段pipe
2022.4Anthropic HH-RLHF数据集公开提供有用性和无害性二维偏好数据,推动独立研究
2022.12ChatGPT爆火,RLHF成为工业标配有用性直接由千万用户隐式反馈(点赞/踩)持续优化
2023.5DPO论文提出省去显式奖励模型,用偏好对直接优化,降低有用性对齐的工程复杂度
2023-2024合成数据与AI反馈(RLAIF)兴起用大模型生成有用性偏好数据,降低人工标注依赖,谷歌Bard/Anthropic Claude 2实践

技术路线对比

维度RLHF (PPO)DPORLAIF(AI反馈)
有用性注入方式训练独立RM,通过PPO将RM分数内化到策略直接在偏好对上优化策略,隐式学习奖励用AI生成的偏好标注数据替代人类标注,后续仍走RLHF或DPO
对有用性控制的精细度高,可独立调节KL惩罚、RM更新等中,控制主要通过数据集构建和\beta取决于AI标注质量,通常低于人类,但成本极低
奖励黑客风险较高,RM可能被过度优化较低,无独立RM可被攻击同所选优化器
计算/人力成本极高(需训练RM、维护PPO四模型)中(无需RM,但偏好数据仍需标注)人力成本极低,但需大量计算生成AI偏好
典型代表ChatGPT, GPT-4, Claude 2许多开源模型(Zephyr, Llama3对齐版)用于降低前沿模型成本,辅以人类验证

上下游

上游:决定有用性天花板

  1. 预训练数据质量与分布
    模型的知识储备、推理模式、写作风格都源自预训练。若预训练数据中充满矛盾或垃圾信息,对齐时提升有用性将极为困难(上限被锁死)。

  2. 人类标注员素质与标注指南
    标注员的教育水平、对指南的理解一致性、标注过程的审校机制,直接决定有用性偏好的“真值”质量。一项研究估算,标注不一致率每降低1%,下游有用性得分可能提升0.5个百分点[基于部分机构公开的标注一致性研究]。

  3. 基础模型架构能力
    长上下文支持、多步推理能力、准确的工具调用等结构能力,使模型能从“知道什么”走向“如何有用”。

下游:有用性的产品化体现

  • 对话助手:有用性直接体现为问题解决率、用户满意度(CSAT)、续聊率。
  • 代码助手:生成代码的正确性、可执行率、解释清晰度构成“有用”的核心KPI。
  • 企业知识库问答:答案是否精准命中文档中的相关信息,且附有引用来源。
  • 搜索增强:模型总结搜索结果时,是否抓住了用户意图的关键点,而不是简单堆砌。

关键指标

指标定义如何反映有用性局限性
ELO/偏好胜率基于成对比较计算的相对实力分直接衡量人类/AI眼中哪个模型更有用依赖比较池的质量,无法给出绝对有用性分数
Alpaca Eval 2.0 LC胜率对GPT-4-Turbo的胜率(长度控制后)自动化评估有用性,与企业级人工评测相关性0.9以上[引自AlpacaEval报告]仍偏向长输出,需LC校正
MT-Bench分数GPT-4在多轮对话任务上打分考察多轮对话中的持续有用性试题静态,可能被过拟
TruthfulQA MC准确率选择正确而非流行错误答案的比例测诚实性,但与有用性正相关(不诚实通常没用)只覆盖conflict类问题
用户留存与活跃度7日/30日留存率产品侧“真有用”的综合指标隐含无用的其它因素(速度、UI)

供需与市场数据

  • 标注市场:全球AI训练数据服务市场2023年约23亿美元,预计2030年达到76亿美元[Grand View Research], 其中偏好排序标注(直接服务于有用性对齐)是增长最快的细分。Scale AI、Surge AI等公司专精于此。
  • 算力消耗:一个百亿级参数的RLHF,PPO阶段消耗的GPU时可达预训练的2%-5%[估算,未充分披露]。随着模型规模增大,对齐成本占比上升,有用性成为“奢侈品”。
  • 需求趋势:企业级客户在私有部署大模型时,“有用且可定制的对齐”已成为差异化焦点,催生了对DPO等低成本对齐技术的旺盛需求。
  • 人才流动:对齐研究员(尤其是偏好建模与RLHF方向)薪酬极高,反映了市场对有用性等核心指标极致优化的迫切需求。

代表公司与资本映射

公司有用性相关核心技术/产品资本映射
OpenAIInstructGPT/ChatGPT/GPT-4的RLHF体系,持续在线用户反馈循环闭源之王,对齐质量直接支撑订阅与API收入
AnthropicHHH原则、Constitutional AI、AI反馈对齐,强调安全与有用的平衡获得谷歌、Spark等数十亿投资,安全+有用估值核心
MetaLlama 3公开说明采用DPO和人类偏好优化,开源生态推动有用性研究开源策略旨在建立生态壁垒,间接获益
Hugging FaceDPO、Zephyr模型等推动低成本有用性对齐的民主化提供Hub、计算服务,连接开源与商业化训练
Scale AI为企业提供RLHF偏好数据标注平台和工具数据独角兽,估值超70亿美元,有用性标注是主要收入来源

投资逻辑

  1. 有用性即护城河
    基础模型权重趋同,对齐技术(尤其是有用性与无害性的精妙平衡)是产品体验差异化的核心。谁的模型在保持无害的前提下“最有用”,谁就能获得更高的用户黏性和付费转化。

  2. 低成本对齐赛道
    DPO、Odds Ratio Preference Optimization等新算法降低了有用性注入的工程和人力成本。这利好开源社区和垂直领域小模型,使“私有数据+轻量DPO”成为企业部署高性能模型的可及路径,投资机会可能在提供此类工具链的公司。

  3. 合成数据与自动对齐
    AI反馈正逐步替代部分人工标注,降低长期有用性优化的边际成本。关注将RLAIF成熟度产品化的初创,它们可能通过大幅降低对齐成本而切入企业市场。

  4. 评估即标准
    有用性的有效自动评估工具(如AlpacaEval、Chatbot Arena)成为行业“裁判”。若能成为公认的有用性标尺,其背后的组织(如LMSYS)有潜力制定行业标准,衍生商业价值。

常见误读纠偏

误读1:“有用性就是模型很聪明、知识多。” 纠正:有用性 ≠ 能力。一个知识渊博但听不懂用户指令、乱给信息的模型是有能力但无用的。有用性强调与用户意图的精准对齐,包含指令遵循、信息呈现方式、甚至主动感知用户未言明的需求。一个参数更小的模型如果在对齐上做得更好,完全可以比超大模型“更有用”。

误读2:“RLHF后的模型就永远有用了。” 纠正:有用性是分布内对齐且极易漂移的特性。当用户提问类型偏离RLHF训练分布(OOD),如从英语切换到低资源语言、提出极专业罕见的问题,有用性会急剧下降。此外,多轮对话中的语境破坏(如模型忘记前文)也会导致有用性坍塌。有用性需要持续的反馈回流和重训练。

误读3:“DPO不需要奖励模型,所以不存在奖励黑客问题。” 纠正:DPO虽然不显式维护一个独立RM,但在数学上等价于在偏好对上学习一个隐式奖励函数 r = \beta \log(\pi_\theta/\pi_{\text{ref}})。当偏好数据集不够全面或存在偏差时,策略仍然可能找到投机取巧的模式,最大化这个隐式奖励而不真正提升有用性。它只是降低了奖励黑客的表面概率,并未根除本质风险。

学习路径

  1. 入门:阅读OpenAI的《Learning to summarize from human feedback》和《Training language models to follow instructions with human feedback》,建立RLHF全貌认知。
  2. 核心:深入DPO论文《Direct Preference Optimization》,理解偏好概率到策略优化的数学推导。对比PPO与DPO的算法实现细节。
  3. 广角:阅读Anthropic的HHH论文和Constitutional AI技术报告,理解多目标平衡。探索RLAIF论文(如Bai et al., 2022, “Constitutional AI”)以掌握AI反馈循环。
  4. 实践:使用Hugging Face TRL库亲手完成一个DPO微调小模型的完整流程,体验有用性数据集构建与\beta调参。
  5. 前沿追踪:关注LMSYS Chatbot Arena的Elo评分演化、KTO(Kahneman-Tversky Optimization)等新型对齐目标,它们从不同角度重新定义“有用”。

一句话总结

有用性是人工智能从“会说”到“会听”、从“能做”到“愿做正确事”转化的灵魂,它极端依赖人类反馈,却向着自主涌现的方向演进。

延伸阅读与来源

  • Ouyang et al., 2022. “Training language models to follow instructions with human feedback.” arXiv:2203.02155.
  • Bai et al., 2022. “Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback.” arXiv:2204.05862.
  • Rafailov et al., 2023. “Direct Preference Optimization: Your Language Model is Secretly a Reward Model.” arXiv:2305.18290.
  • Bai et al., 2022. “Constitutional AI: Harmlessness from AI Feedback.” arXiv:2212.08073.
  • AlpacaEval: https://tatsu-lab.github.io/alpaca_eval/ (自动评估胜率).
  • Chatbot Arena (LMSYS): https://chat.lmsys.org/?arena (众包ELO).
  • Hugging Face TRL: https://github.com/huggingface/trl (RLHF/DPO实践库).
source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型