模型層 開放閱讀

GPQA

Graduate-Level Google-Proof Q&A

概念 ID
graduate-level-google-proof-q-a
更新時間
2026-05-29
來源數量
待補

GPQA

3 秒看懂

GPQA 是一個用於”難倒”前沿大型模型的高難度學術問答基準。 它由人類領域專家(博士級別)精心編寫物理、化學、生物等學科的四選一選擇題,刻意設計為無法通過搜尋引擎直接找到答案。截至 2024 年末,最強模型在 GPQA 鑽石集上的表現已超過人類專家水平,這使其成為衡量 AI 是否真正具備”研究生級推論能力”的核心標尺之一。

3 分鐘產業解釋

為什麼需要”Google-Proof”?

在大型模型能力飛速提升的背景下,傳統問答基準(如 MMLU、TriviaQA)已被認為存在嚴重的資料汙染(data contamination) 問題——模型在預訓練階段很可能已經”見過”這些問題或其變體,導致測試成績虛高,無法反映真實推論能力。

GPQA 的設計邏輯是:

如果一個問題連精心搜尋都很難找到答案,那麼模型答對它就更可能是”真本事”而非”背答案”。

誰在用它?

  • 前沿實驗室:OpenAI、Anthropic、Google DeepMind、Meta AI 等將其納入內部評估體系,用於衡量模型在”最難檔”上的表現。
  • AI 安全與對齊研究者:GPQA 的高難度特性使其成為測試”能力上限”和”推論鏈可靠性”的工具。
  • 學術界:作為衡量模型在科學推論、專業知識方面是否達到”研究生水平”的基準之一。

在產業中的位置

GPQA 屬於 “評估基礎設施” 這一細分賽道,與 MMLU-Pro、ARC-Challenge、MATH、HumanEval 等共同構成模型能力評估的”標尺矩陣”。它不是產品,而是衡量 AI 系統能否在高難度科學問題上”可信推論”的測試集。

15 分鐘專家深入

核心設計理念:三層過濾

GPQA 的問題設計遵循一個嚴格的”反檢索”邏輯鏈:

層級目的實現方式
第一層:專家編寫確保問題本身具有”研究生級”深度由 PhD 學生或領域從業者出題,涉及專業知識的交叉應用
第二層:同行驗證確保問題有唯一正確答案且表述無歧義由同領域另一位專家稽核,確認答案唯一且推論鏈清晰
第三層:非專家嘗試確保問題”Google-proof”由非該領域專家(但具備基本科學素養)嘗試通過搜尋解答,若能輕鬆找到答案則淘汰

資料集構成

根據公開論文(David Rein 等人,2023)的描述:

子集描述規模(約)
主集(Main Set)完整的問題集,涵蓋物理、化學、生物約 448 題 [原始論文揭露]
鑽石集(Diamond Set)經過更嚴格篩選的高質量子集,問題更”乾淨”約 198 題 [原始論文揭露]

注意:具體題目數量可能因版本迭代有所變化,以上資料來源於論文初版,後續版本請以官方釋出為準。

效能基準參考

以下為論文及公開評測中揭露的參考資料(不同模型版本和測試設定下可能有差異):

參與者大致準確率(鑽石集)備註
隨機猜測~25%四選一
非專家(無搜尋)~34% [論文報告]有科學背景但非該領域專家
領域專家~65% [論文報告]PhD 級別,有充足時間
GPT-4(早期版本)~40-50% [公開評測,待確認]不同測試設定差異較大
前沿模型(2024 年末)~78% [OpenAI o1-preview 報告]已超越人類專家,準確率仍在提升

關鍵洞察:最強模型已超越領域專家平均表現,但距離滿分仍有較大空間,GPQA 尚未被完全“刷穿”,仍具備較強的區分能力。

題目示例(概念性描述)

GPQA 的問題通常具有以下特徵:

  1. 需要多步推論:不能僅靠”記住”一個知識點,而是需要結合多個概念進行推導。
  2. 涉及前沿或小眾知識:問題可能涉及較新的研究成果或教科書中的細節,而非”常識”。
  3. 選項具有迷惑性:錯誤選項通常是”看起來合理”的近似答案,需要精確推論才能排除。

技術原理

基準建置的底層機制

┌─────────────────────────────────────────────────────────────────┐
│                    GPQA 問題建置流程                             │
├─────────────────────────────────────────────────────────────────┤
│                                                                 │
│  [領域專家 A] ──(出題)──▶ [問題草稿 + 參考答案]                 │
│                                  │                              │
│                                  ▼                              │
│  [領域專家 B] ──(驗證)──▶ [確認答案唯一/推論鏈清晰]             │
│                                  │                              │
│                                  ▼                              │
│  [非專家 C] ──(Google測試)──▶ [能否通過搜尋找到答案?]          │
│                                  │                              │
│                    ┌─────────────┴─────────────┐                │
│                    ▼                           ▼                │
│              [難/找不到答案]              [易/可搜尋到]          │
│                    │                           │                │
│                    ▼                           ▼                │
│              [納入資料集]               [淘汰/重新設計]          │
│                                                                 │
└─────────────────────────────────────────────────────────────────┘

”Google-Proof” 的技術定義

這裡的 “Google-Proof” 並非指”絕對無法在網際網路上找到任何相關資訊”,而是指:

  • 無法通過簡單搜尋(如直接複製問題貼上到搜尋引擎)得到答案
  • 答案需要在搜尋結果基礎上進行進一步的推論、整合或計算
  • 問題的表述方式(如改變數值、調整語境)使其與已知來源不完全匹配

這意味著問題可以涉及公開存在的知識,但其組合方式和推論路徑是新穎的。

評估方法論

對於被測模型,評估流程通常為:

  1. 輸入:將問題(含四個選項)以標準化 prompt 格式輸入模型
  2. 輸出:模型生成答案(通常是 A/B/C/D 中的一個)
  3. 比對:將模型輸出與標準答案比對,計算準確率
  4. 分析:對錯誤答案進行分類(推論錯誤 vs. 知識缺失 vs. 選項混淆等)

注意:不同研究者在評估時使用的 prompt 格式、是否允許 Chain-of-Thought(CoT)、是否使用 few-shot 示例等設定可能不同,這會導致同一模型在不同評測中的成績有差異。因此,比較不同來源的資料時需注意測試設定的一致性。


技術演進史

基準評估的代際演進

GPQA 是 AI 評估基準演進歷程中的一個里程碑,反映了評估理念的升級:

代際代表基準核心特點侷限性
第一代:常識/知識TriviaQA, WebQuestions測試模型”知道什麼”易被記憶型預訓練覆蓋
第二代:綜合知識MMLU, ARC多學科、多難度覆蓋仍存在資料汙染風險,“常識化”傾向
第三代:深度推論GPQA, MATH, AIME專家級、Google-Proof、需要多步推論資料集規模較小,學科覆蓋有限
第四代:綜合能力未來方向(推測)多模態、長上下文、多輪互動、真實任務尚在探索中

GPQA 的時間線

  • 2023 年:David Rein 等人釋出 GPQA 論文,提出”Google-Proof”概念並公開資料集。主要覆蓋物理、化學、生物。
  • 2024 年:GPQA 逐漸成為主流評估基準之一,被多個前沿實驗室納入評測體系。社群開始出現對 GPQA 的擴充套件討論(如增加更多學科、提高題目難度等)。同年末,OpenAI o1-preview 在鑽石集上達到約 78%,首次超越人類專家基線。

注意:GPQA 是一個相對較新的基準(2023 年釋出),其影響力仍在積累中。未來是否有重大更新或擴充套件,需關注官方動態。


技術路線對比

GPQA 與其他高難度評估基準

維度GPQAMMLU-ProAIMEMATHHumanEval
領域物理、化學、生物14+ 學科數學(競賽級)數學(廣泛)程式設計
題型四選一選擇題十選一選擇題數值填空數值填空程式碼生成
難度定位研究生/專家級本科-研究生級高中競賽級高中-本科級本科程式設計課級
反汙染設計✅ Google-Proof部分(重寫選項)❌(公開題庫)❌(公開題庫)❌(公開題庫)
資料集規模約 448 題約 12,000 題約 15 題/年約 12,500 題約 164 題
區分能力強(前沿模型尚未滿分)中(已有模型接近飽和)強(競賽題)中-強中(程式碼任務多樣性有限)
核心價值測試”真正理解”綜合知識廣度數學競賽能力數學推論能力程式設計能力

為什麼 GPQA 的”區分能力”仍然強?

在許多基準上,前沿模型已經達到或接近人類專家水平(如 MMLU 上 GPT-4 級別模型準確率已超 86%),導致這些基準的”區分度”下降。

GPQA 的優勢在於:

  1. 題目設計的”反檢索”特性:降低了資料汙染的風險
  2. 專家級難度:需要深度理解和多步推論,而非簡單記憶
  3. 資料集規模較小但精煉:每一道題都經過嚴格篩選

上下游

上游:誰提供資料?

上游環節參與者角色
問題編寫領域專家(PhD 學生、研究人員、從業者)編寫高質量、Google-Proof 的問題
問題驗證同領域專家稽核答案唯一性、推論鏈清晰度
平台支援研究機構(如 NYU)提供論文支撐、資料託管

下游:誰消費資料?

下游環節參與者角色
模型評估前沿實驗室(OpenAI, Anthropic, Google DeepMind 等)衡量模型能力上限
學術研究AI 安全/對齊研究者測試模型推論可靠性
排行榜/評測平台Open LLM Leaderboard, Papers With Code 等公開比較不同模型
產業決策技術選型團隊作為模型選擇的參考指標之一

價值鏈簡圖

[領域專家] ──(出題)──▶ [GPQA 資料集] ──(評估)──▶ [模型能力報告]
                                │                        │
                                ▼                        ▼
                        [排行榜/評測平台]        [模型選型/研發決策]

關鍵指標

衡量 GPQA 相關模型能力的核心指標

指標定義意義
準確率(Accuracy)正確回答的題目數 / 總題目數最直接的能力衡量
專家差距(Expert Gap)人類專家準確率 - 模型準確率衡量模型與”真正理解”之間的距離(可能為負值,表示模型超越專家)
與搜尋基線差距(Google Gap)模型準確率 - 非專家(無搜尋)準確率衡量模型是否超越”無搜尋”的普通人
在鑽石集 vs. 主集的差異兩個子集上的準確率差異衡量模型對”更難/更乾淨”問題的魯棒性

解讀注意事項

  • 不同 prompt 設定下的成績不可直接比較:Chain-of-Thought(CoT)通常會提升成績,但不同研究使用的 CoT 格式可能不同。
  • 多次取樣 vs. 單次生成:有些評測使用”多次取樣取眾數”(如 pass@k),有些使用單次生成,這也會影響結果。
  • 模型版本差異:同一模型的不同版本(如 GPT-4 vs. GPT-4 Turbo vs. GPT-4o)在 GPQA 上的表現可能有顯著差異。

供需與市場資料

評估基準的”市場規模”

GPQA 本身不是一個商業化產品,而是學術研究產出。但從評估基礎設施的角度看:

  • 需求側:隨著大型模型能力提升,評估基準的需求持續增長。前沿實驗室每年在內部評估體系上投入大量資源(包括資料收集、評測流程維護等)。
  • 供給側:高質量評估基準(如 GPQA)的供給是稀缺的。編寫一個”Google-Proof”且有唯一正確答案的研究生級問題,成本很高(需要領域專家投入時間)。

相關市場趨勢

  • 基準”通貨膨脹”:隨著模型能力提升,舊基準逐漸飽和(如 MMLU),市場對更高難度基準的需求增加。
  • 評估即服務(Evaluation-as-a-Service):一些公司開始提供商業化的模型評估服務,GPQA 可能被納入其評估矩陣。
  • 合成數據與基準生成:未來可能由 AI 輔助生成高難度問題,但如何保證”Google-Proof”特性仍是挑戰。

注意:以上為基於行業趨勢的定性分析,無確切市場資料支撐。


代表公司與資本對映

GPQA 的”利益相關方”

角色代表機構與 GPQA 的關係
資料集建立者NYU, David Rein 等研究者論文釋出方,資料集維護者
重度使用者OpenAI, Anthropic, Google DeepMind, Meta AI內部評估體系中使用 GPQA
評測平台Hugging Face (Open LLM Leaderboard), Papers With Code公開託管 GPQA 排行榜
投資者視角AI 基金、VCGPQA 的表現是衡量”模型壁壘”的間接指標

資本對映邏輯

對於投資者而言,GPQA 的意義在於:

  • 模型能力的”硬指標”:如果一家 AI 公司的模型在 GPQA 上表現突出,說明其在深度科學推論方面有優勢。
  • 資料壁壘的反映:GPQA 的”Google-Proof”特性意味著,模型需要真正的推論能力而非記憶,這可能是技術壁壘的體現。
  • 評估基準的競爭:誰能建立更難、更可信的評估基準,誰就掌握了衡量 AI 能力的”話語權”。

投資邏輯

從 GPQA 看 AI 能力演進

  1. 推論能力是關鍵差異化因素:在”記憶型”任務逐漸飽和的背景下,推論能力(如 GPQA 測試的)成為區分模型水平的關鍵。
  2. 科學 AI 的價值凸顯:GPQA 聚焦於科學領域,這與 AI for Science(科學 AI)的趨勢高度相關。如果模型能在 GPQA 上接近專家水平,可能在藥物發現、材料科學等領域產生價值。
  3. 評估基礎設施的價值:隨著 AI 應用落地,可信的評估基準(如 GPQA)將成為”信任基礎設施”的一部分。

需要注意的風險

  • 基準侷限性:GPQA 僅覆蓋物理、化學、生物,且為選擇題形式,不能完全代表模型的綜合能力。
  • 遊戲化風險:如果模型開發者針對 GPQA 進行專門最佳化(即”過擬合基準”),可能降低其作為通用能力指標的價值。
  • 資料集更新頻率:如果 GPQA 長期不更新,可能逐漸被新基準取代。

常見誤讀糾偏

❌ 誤讀 1:“GPQA 的題目在網際網路上完全找不到”

糾偏:GPQA 的”Google-Proof”並非指題目所涉及的知識點在網際網路上不存在,而是指無法通過簡單搜尋直接獲得答案。題目可能涉及教科書或論文中的知識,但其表述方式(如改變數值、調整語境、組合多個知識點)使得直接搜尋無法命中答案。此外,有些題目可能需要整合多個來源的資訊並進行推論,這也超出了簡單搜尋的能力範圍。

❌ 誤讀 2:“模型在 GPQA 上得分高就說明它比人類專家聰明”

糾偏:截至 2024 年末,最強模型(如 OpenAI o1-preview)在 GPQA 鑽石集上的準確率(約 78%)已超過人類專家平均水平(約 65%)。即便模型得分超越人類專家,也需要注意:

  • 人類專家有時間限制,而模型的推論速度遠超人類。
  • 選擇題形式無法完全衡量深度理解(如開放性問題、實驗設計等)。
  • 模型可能在某些學科上表現好,而在另一些學科上表現差,整體平均分可能掩蓋學科差異

❌ 誤讀 3:“GPQA 可以完全替代其他評估基準”

糾偏:GPQA 的資料集規模較小(約 448 題),且主要覆蓋科學領域。它不能替代 MMLU(廣度覆蓋)、MATH(數學推論)、HumanEval(程式設計能力)等基準。評估模型能力需要多個基準的”組合標尺”,GPQA 只是其中一個重要維度。

❌ 誤讀 4:“任何模型在 GPQA 上的表現都能直接比較”

糾偏:不同評測的prompt 格式、是否使用 CoT、是否多次取樣等設定可能不同,導致同一模型在不同評測中的成績有差異。比較不同來源的資料時,需確保測試設定的一致性,或至少註明差異。


學習路徑

入門級(1 小時)

  1. 閱讀 GPQA 論文摘要和引言:瞭解問題定義、設計理念和主要結果。
    • 論文標題:GPQA: A Graduate-Level Google-Proof Q&A Benchmark
    • 作者:David Rein 等
  2. 瀏覽 GPQA 資料集:實際看幾道題目,感受難度和風格。

進階級(3-5 小時)

  1. 閱讀論文全文:理解資料建置流程、評估方法論、實驗結果和討論。
  2. 嘗試在 GPQA 上評估開源模型:使用 Hugging Face 上的評測指令碼或 Open LLM Leaderboard 的資料。
  3. 對比 GPQA 與其他基準(如 MMLU, MATH):思考不同基準的優劣勢。

專家級(10+ 小時)

  1. 研究 GPQA 題目的錯誤模式:分析模型在哪些型別的題目上犯錯,是推論錯誤、知識缺失還是選項混淆?
  2. 探索 GPQA 的擴充套件可能性:如增加更多學科、設計更難的題目、生成合成題目等。
  3. 閱讀相關論文:如 MMLU-Pro、ARC、AIME 等,理解評估基準設計的更廣泛研究範式。

推薦資源

資源型別連結/來源
GPQA 論文論文arXiv:2311.12022
GPQA 資料集GitHub/Hugging Face搜尋 “GPQA benchmark”
Open LLM Leaderboard排行榜Hugging Face
Papers With Code排行榜paperswithcode.com

一句話總結

GPQA 是一個由專家精心設計的”反作弊”學術問答基準,它通過 Google-Proof 的機制測試 AI 是否真正具備研究生級深度推論能力,而非僅僅是”背答案”。當前最強模型已超越人類專家,這使其成為衡量 AI 能力邊界的關鍵標尺之一。


延伸閱讀與來源

核心文獻

來源描述
Rein, D. et al. (2023). GPQA: A Graduate-Level Google-Proof Q&A Benchmark. arXiv:2311.12022GPQA 原始論文,詳細描述了資料建置流程和評估結果
Wang, Y. et al. (2024). MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark. arXiv:2406.01574MMLU-Pro 論文,與 GPQA 同屬”抗汙染”評估基準
Cobbe, K. et al. (2021). Training Verifiers to Solve Math Word Problems. arXiv:2110.14168GSM8K 論文,數學推論評估的經典基準

行業分析

來源描述
各前沿實驗室技術報告(如 OpenAI System Card, Anthropic Model Card)通常包含在 GPQA 等基準上的評估結果
AI 評測平台(Hugging Face, Papers With Code)提供公開的模型排行榜和評測結果

學習資源

來源描述
論文配套的 GitHub 倉庫包含資料集、評測指令碼等
Hugging Face Datasets可直接下載 GPQA 資料集進行實驗

免責說明:本文中的具體數字(如資料集規模、準確率)主要來源於原始論文及公開評測,不同版本或測試設定下可能有差異。標註 [估算] 或 [待確認] 的資料為基於公開資訊的推測,非精確資料。如需最新準確資料,請參考 GPQA 官方倉庫或論文。

source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型