模型层 开放阅读

GPQA

Graduate-Level Google-Proof Q&A

概念 ID
graduate-level-google-proof-q-a
更新时间
2026-05-29
来源数量
待补

GPQA

3 秒看懂

GPQA 是一个用于”难倒”前沿大模型的高难度学术问答基准。 它由人类领域专家(博士级别)精心编写物理、化学、生物等学科的四选一选择题,刻意设计为无法通过搜索引擎直接找到答案。截至 2024 年末,最强模型在 GPQA 钻石集上的表现已超过人类专家水平,这使其成为衡量 AI 是否真正具备”研究生级推理能力”的核心标尺之一。

3 分钟产业解释

为什么需要”Google-Proof”?

在大模型能力飞速提升的背景下,传统问答基准(如 MMLU、TriviaQA)已被认为存在严重的数据污染(data contamination) 问题——模型在预训练阶段很可能已经”见过”这些问题或其变体,导致测试成绩虚高,无法反映真实推理能力。

GPQA 的设计逻辑是:

如果一个问题连精心搜索都很难找到答案,那么模型答对它就更可能是”真本事”而非”背答案”。

谁在用它?

  • 前沿实验室:OpenAI、Anthropic、Google DeepMind、Meta AI 等将其纳入内部评估体系,用于衡量模型在”最难档”上的表现。
  • AI 安全与对齐研究者:GPQA 的高难度特性使其成为测试”能力上限”和”推理链可靠性”的工具。
  • 学术界:作为衡量模型在科学推理、专业知识方面是否达到”研究生水平”的基准之一。

在产业中的位置

GPQA 属于 “评估基础设施” 这一细分赛道,与 MMLU-Pro、ARC-Challenge、MATH、HumanEval 等共同构成模型能力评估的”标尺矩阵”。它不是产品,而是衡量 AI 系统能否在高难度科学问题上”可信推理”的测试集。

15 分钟专家深入

核心设计理念:三层过滤

GPQA 的问题设计遵循一个严格的”反检索”逻辑链:

层级目的实现方式
第一层:专家编写确保问题本身具有”研究生级”深度由 PhD 学生或领域从业者出题,涉及专业知识的交叉应用
第二层:同行验证确保问题有唯一正确答案且表述无歧义由同领域另一位专家审核,确认答案唯一且推理链清晰
第三层:非专家尝试确保问题”Google-proof”由非该领域专家(但具备基本科学素养)尝试通过搜索解答,若能轻松找到答案则淘汰

数据集构成

根据公开论文(David Rein 等人,2023)的描述:

子集描述规模(约)
主集(Main Set)完整的问题集,涵盖物理、化学、生物约 448 题 [原始论文披露]
钻石集(Diamond Set)经过更严格筛选的高质量子集,问题更”干净”约 198 题 [原始论文披露]

注意:具体题目数量可能因版本迭代有所变化,以上数据来源于论文初版,后续版本请以官方发布为准。

性能基准参考

以下为论文及公开评测中披露的参考数据(不同模型版本和测试设置下可能有差异):

参与者大致准确率(钻石集)备注
随机猜测~25%四选一
非专家(无搜索)~34% [论文报告]有科学背景但非该领域专家
领域专家~65% [论文报告]PhD 级别,有充足时间
GPT-4(早期版本)~40-50% [公开评测,待确认]不同测试设置差异较大
前沿模型(2024 年末)~78% [OpenAI o1-preview 报告]已超越人类专家,准确率仍在提升

关键洞察:最强模型已超越领域专家平均表现,但距离满分仍有较大空间,GPQA 尚未被完全“刷穿”,仍具备较强的区分能力。

题目示例(概念性描述)

GPQA 的问题通常具有以下特征:

  1. 需要多步推理:不能仅靠”记住”一个知识点,而是需要结合多个概念进行推导。
  2. 涉及前沿或小众知识:问题可能涉及较新的研究成果或教科书中的细节,而非”常识”。
  3. 选项具有迷惑性:错误选项通常是”看起来合理”的近似答案,需要精确推理才能排除。

技术原理

基准构建的底层机制

┌─────────────────────────────────────────────────────────────────┐
│                    GPQA 问题构建流程                             │
├─────────────────────────────────────────────────────────────────┤
│                                                                 │
│  [领域专家 A] ──(出题)──▶ [问题草稿 + 参考答案]                 │
│                                  │                              │
│                                  ▼                              │
│  [领域专家 B] ──(验证)──▶ [确认答案唯一/推理链清晰]             │
│                                  │                              │
│                                  ▼                              │
│  [非专家 C] ──(Google测试)──▶ [能否通过搜索找到答案?]          │
│                                  │                              │
│                    ┌─────────────┴─────────────┐                │
│                    ▼                           ▼                │
│              [难/找不到答案]              [易/可搜索到]          │
│                    │                           │                │
│                    ▼                           ▼                │
│              [纳入数据集]               [淘汰/重新设计]          │
│                                                                 │
└─────────────────────────────────────────────────────────────────┘

”Google-Proof” 的技术定义

这里的 “Google-Proof” 并非指”绝对无法在互联网上找到任何相关信息”,而是指:

  • 无法通过简单搜索(如直接复制问题粘贴到搜索引擎)得到答案
  • 答案需要在搜索结果基础上进行进一步的推理、整合或计算
  • 问题的表述方式(如改变数值、调整语境)使其与已知来源不完全匹配

这意味着问题可以涉及公开存在的知识,但其组合方式和推理路径是新颖的。

评估方法论

对于被测模型,评估流程通常为:

  1. 输入:将问题(含四个选项)以标准化 prompt 格式输入模型
  2. 输出:模型生成答案(通常是 A/B/C/D 中的一个)
  3. 比对:将模型输出与标准答案比对,计算准确率
  4. 分析:对错误答案进行分类(推理错误 vs. 知识缺失 vs. 选项混淆等)

注意:不同研究者在评估时使用的 prompt 格式、是否允许 Chain-of-Thought(CoT)、是否使用 few-shot 示例等设置可能不同,这会导致同一模型在不同评测中的成绩有差异。因此,比较不同来源的数据时需注意测试设置的一致性。


技术演进史

基准评估的代际演进

GPQA 是 AI 评估基准演进历程中的一个里程碑,反映了评估理念的升级:

代际代表基准核心特点局限性
第一代:常识/知识TriviaQA, WebQuestions测试模型”知道什么”易被记忆型预训练覆盖
第二代:综合知识MMLU, ARC多学科、多难度覆盖仍存在数据污染风险,“常识化”倾向
第三代:深度推理GPQA, MATH, AIME专家级、Google-Proof、需要多步推理数据集规模较小,学科覆盖有限
第四代:综合能力未来方向(推测)多模态、长上下文、多轮交互、真实任务尚在探索中

GPQA 的时间线

  • 2023 年:David Rein 等人发布 GPQA 论文,提出”Google-Proof”概念并公开数据集。主要覆盖物理、化学、生物。
  • 2024 年:GPQA 逐渐成为主流评估基准之一,被多个前沿实验室纳入评测体系。社区开始出现对 GPQA 的扩展讨论(如增加更多学科、提高题目难度等)。同年末,OpenAI o1-preview 在钻石集上达到约 78%,首次超越人类专家基线。

注意:GPQA 是一个相对较新的基准(2023 年发布),其影响力仍在积累中。未来是否有重大更新或扩展,需关注官方动态。


技术路线对比

GPQA 与其他高难度评估基准

维度GPQAMMLU-ProAIMEMATHHumanEval
领域物理、化学、生物14+ 学科数学(竞赛级)数学(广泛)编程
题型四选一选择题十选一选择题数值填空数值填空代码生成
难度定位研究生/专家级本科-研究生级高中竞赛级高中-本科级本科编程课级
反污染设计✅ Google-Proof部分(重写选项)❌(公开题库)❌(公开题库)❌(公开题库)
数据集规模约 448 题约 12,000 题约 15 题/年约 12,500 题约 164 题
区分能力强(前沿模型尚未满分)中(已有模型接近饱和)强(竞赛题)中-强中(代码任务多样性有限)
核心价值测试”真正理解”综合知识广度数学竞赛能力数学推理能力编程能力

为什么 GPQA 的”区分能力”仍然强?

在许多基准上,前沿模型已经达到或接近人类专家水平(如 MMLU 上 GPT-4 级别模型准确率已超 86%),导致这些基准的”区分度”下降。

GPQA 的优势在于:

  1. 题目设计的”反检索”特性:降低了数据污染的风险
  2. 专家级难度:需要深度理解和多步推理,而非简单记忆
  3. 数据集规模较小但精炼:每一道题都经过严格筛选

上下游

上游:谁提供数据?

上游环节参与者角色
问题编写领域专家(PhD 学生、研究人员、从业者)编写高质量、Google-Proof 的问题
问题验证同领域专家审核答案唯一性、推理链清晰度
平台支持研究机构(如 NYU)提供论文支撑、数据托管

下游:谁消费数据?

下游环节参与者角色
模型评估前沿实验室(OpenAI, Anthropic, Google DeepMind 等)衡量模型能力上限
学术研究AI 安全/对齐研究者测试模型推理可靠性
排行榜/评测平台Open LLM Leaderboard, Papers With Code 等公开比较不同模型
产业决策技术选型团队作为模型选择的参考指标之一

价值链简图

[领域专家] ──(出题)──▶ [GPQA 数据集] ──(评估)──▶ [模型能力报告]
                                │                        │
                                ▼                        ▼
                        [排行榜/评测平台]        [模型选型/研发决策]

关键指标

衡量 GPQA 相关模型能力的核心指标

指标定义意义
准确率(Accuracy)正确回答的题目数 / 总题目数最直接的能力衡量
专家差距(Expert Gap)人类专家准确率 - 模型准确率衡量模型与”真正理解”之间的距离(可能为负值,表示模型超越专家)
与搜索基线差距(Google Gap)模型准确率 - 非专家(无搜索)准确率衡量模型是否超越”无搜索”的普通人
在钻石集 vs. 主集的差异两个子集上的准确率差异衡量模型对”更难/更干净”问题的鲁棒性

解读注意事项

  • 不同 prompt 设置下的成绩不可直接比较:Chain-of-Thought(CoT)通常会提升成绩,但不同研究使用的 CoT 格式可能不同。
  • 多次采样 vs. 单次生成:有些评测使用”多次采样取众数”(如 pass@k),有些使用单次生成,这也会影响结果。
  • 模型版本差异:同一模型的不同版本(如 GPT-4 vs. GPT-4 Turbo vs. GPT-4o)在 GPQA 上的表现可能有显著差异。

供需与市场数据

评估基准的”市场规模”

GPQA 本身不是一个商业化产品,而是学术研究产出。但从评估基础设施的角度看:

  • 需求侧:随着大模型能力提升,评估基准的需求持续增长。前沿实验室每年在内部评估体系上投入大量资源(包括数据收集、评测流程维护等)。
  • 供给侧:高质量评估基准(如 GPQA)的供给是稀缺的。编写一个”Google-Proof”且有唯一正确答案的研究生级问题,成本很高(需要领域专家投入时间)。

相关市场趋势

  • 基准”通货膨胀”:随着模型能力提升,旧基准逐渐饱和(如 MMLU),市场对更高难度基准的需求增加。
  • 评估即服务(Evaluation-as-a-Service):一些公司开始提供商业化的模型评估服务,GPQA 可能被纳入其评估矩阵。
  • 合成数据与基准生成:未来可能由 AI 辅助生成高难度问题,但如何保证”Google-Proof”特性仍是挑战。

注意:以上为基于行业趋势的定性分析,无确切市场数据支撑。


代表公司与资本映射

GPQA 的”利益相关方”

角色代表机构与 GPQA 的关系
数据集创建者NYU, David Rein 等研究者论文发布方,数据集维护者
重度使用者OpenAI, Anthropic, Google DeepMind, Meta AI内部评估体系中使用 GPQA
评测平台Hugging Face (Open LLM Leaderboard), Papers With Code公开托管 GPQA 排行榜
投资者视角AI 基金、VCGPQA 的表现是衡量”模型壁垒”的间接指标

资本映射逻辑

对于投资者而言,GPQA 的意义在于:

  • 模型能力的”硬指标”:如果一家 AI 公司的模型在 GPQA 上表现突出,说明其在深度科学推理方面有优势。
  • 数据壁垒的反映:GPQA 的”Google-Proof”特性意味着,模型需要真正的推理能力而非记忆,这可能是技术壁垒的体现。
  • 评估基准的竞争:谁能创建更难、更可信的评估基准,谁就掌握了衡量 AI 能力的”话语权”。

投资逻辑

从 GPQA 看 AI 能力演进

  1. 推理能力是关键差异化因素:在”记忆型”任务逐渐饱和的背景下,推理能力(如 GPQA 测试的)成为区分模型水平的关键。
  2. 科学 AI 的价值凸显:GPQA 聚焦于科学领域,这与 AI for Science(科学 AI)的趋势高度相关。如果模型能在 GPQA 上接近专家水平,可能在药物发现、材料科学等领域产生价值。
  3. 评估基础设施的价值:随着 AI 应用落地,可信的评估基准(如 GPQA)将成为”信任基础设施”的一部分。

需要注意的风险

  • 基准局限性:GPQA 仅覆盖物理、化学、生物,且为选择题形式,不能完全代表模型的综合能力。
  • 游戏化风险:如果模型开发者针对 GPQA 进行专门优化(即”过拟合基准”),可能降低其作为通用能力指标的价值。
  • 数据集更新频率:如果 GPQA 长期不更新,可能逐渐被新基准取代。

常见误读纠偏

❌ 误读 1:“GPQA 的题目在互联网上完全找不到”

纠偏:GPQA 的”Google-Proof”并非指题目所涉及的知识点在互联网上不存在,而是指无法通过简单搜索直接获得答案。题目可能涉及教科书或论文中的知识,但其表述方式(如改变数值、调整语境、组合多个知识点)使得直接搜索无法命中答案。此外,有些题目可能需要整合多个来源的信息并进行推理,这也超出了简单搜索的能力范围。

❌ 误读 2:“模型在 GPQA 上得分高就说明它比人类专家聪明”

纠偏:截至 2024 年末,最强模型(如 OpenAI o1-preview)在 GPQA 钻石集上的准确率(约 78%)已超过人类专家平均水平(约 65%)。即便模型得分超越人类专家,也需要注意:

  • 人类专家有时间限制,而模型的推理速度远超人类。
  • 选择题形式无法完全衡量深度理解(如开放性问题、实验设计等)。
  • 模型可能在某些学科上表现好,而在另一些学科上表现差,整体平均分可能掩盖学科差异

❌ 误读 3:“GPQA 可以完全替代其他评估基准”

纠偏:GPQA 的数据集规模较小(约 448 题),且主要覆盖科学领域。它不能替代 MMLU(广度覆盖)、MATH(数学推理)、HumanEval(编程能力)等基准。评估模型能力需要多个基准的”组合标尺”,GPQA 只是其中一个重要维度。

❌ 误读 4:“任何模型在 GPQA 上的表现都能直接比较”

纠偏:不同评测的prompt 格式、是否使用 CoT、是否多次采样等设置可能不同,导致同一模型在不同评测中的成绩有差异。比较不同来源的数据时,需确保测试设置的一致性,或至少注明差异。


学习路径

入门级(1 小时)

  1. 阅读 GPQA 论文摘要和引言:了解问题定义、设计理念和主要结果。
    • 论文标题:GPQA: A Graduate-Level Google-Proof Q&A Benchmark
    • 作者:David Rein 等
  2. 浏览 GPQA 数据集:实际看几道题目,感受难度和风格。

进阶级(3-5 小时)

  1. 阅读论文全文:理解数据构建流程、评估方法论、实验结果和讨论。
  2. 尝试在 GPQA 上评估开源模型:使用 Hugging Face 上的评测脚本或 Open LLM Leaderboard 的数据。
  3. 对比 GPQA 与其他基准(如 MMLU, MATH):思考不同基准的优劣势。

专家级(10+ 小时)

  1. 研究 GPQA 题目的错误模式:分析模型在哪些类型的题目上犯错,是推理错误、知识缺失还是选项混淆?
  2. 探索 GPQA 的扩展可能性:如增加更多学科、设计更难的题目、生成合成题目等。
  3. 阅读相关论文:如 MMLU-Pro、ARC、AIME 等,理解评估基准设计的更广泛研究范式。

推荐资源

资源类型链接/来源
GPQA 论文论文arXiv:2311.12022
GPQA 数据集GitHub/Hugging Face搜索 “GPQA benchmark”
Open LLM Leaderboard排行榜Hugging Face
Papers With Code排行榜paperswithcode.com

一句话总结

GPQA 是一个由专家精心设计的”反作弊”学术问答基准,它通过 Google-Proof 的机制测试 AI 是否真正具备研究生级深度推理能力,而非仅仅是”背答案”。当前最强模型已超越人类专家,这使其成为衡量 AI 能力边界的关键标尺之一。


延伸阅读与来源

核心文献

来源描述
Rein, D. et al. (2023). GPQA: A Graduate-Level Google-Proof Q&A Benchmark. arXiv:2311.12022GPQA 原始论文,详细描述了数据构建流程和评估结果
Wang, Y. et al. (2024). MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark. arXiv:2406.01574MMLU-Pro 论文,与 GPQA 同属”抗污染”评估基准
Cobbe, K. et al. (2021). Training Verifiers to Solve Math Word Problems. arXiv:2110.14168GSM8K 论文,数学推理评估的经典基准

行业分析

来源描述
各前沿实验室技术报告(如 OpenAI System Card, Anthropic Model Card)通常包含在 GPQA 等基准上的评估结果
AI 评测平台(Hugging Face, Papers With Code)提供公开的模型排行榜和评测结果

学习资源

来源描述
论文配套的 GitHub 仓库包含数据集、评测脚本等
Hugging Face Datasets可直接下载 GPQA 数据集进行实验

免责说明:本文中的具体数字(如数据集规模、准确率)主要来源于原始论文及公开评测,不同版本或测试设置下可能有差异。标注 [估算] 或 [待确认] 的数据为基于公开信息的推测,非精确数据。如需最新准确数据,请参考 GPQA 官方仓库或论文。

source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型