模型層 開放閱讀

ARC

AI2 Reasoning Challenge

概念 ID
ai2-reasoning-challenge
更新時間
2026-05-29
來源數量
待補

ARC(AI2 Reasoning Challenge)

3 秒看懂

ARC 是艾倫人工智慧研究所(AI2)於 2018 年釋出的一項科學常識推論基準測試,由約 7,787 道美國小學科學考試多選題構成,分為 EasyChallenge 兩個子集。ARC-Challenge 專門篩選出那些”靠關鍵詞匹配和簡單檢索答不對、必須多步推論才能解對”的題目,長期被業界視為衡量大型模型常識推論能力的標杆任務之一。

3 分鐘產業解釋

為什麼一個”小學科學題”能成為產業級基準?

2017–2018 年,NLP 領域的 SQuAD、GLUE 等閱讀理解基準紛紛被”刷爆”,但業界逐漸意識到——模型可能只是在做淺層模式匹配,並沒有真正”理解”。AI2 的 Peter Clark 等人於是做了一件樸素但關鍵的事:從美國各州標準化考試中收集小學科學題,然後按照”簡單檢索法答不對”的標準,把題目分成 Easy 和 Challenge 兩檔。

  • ARC-Easy:大部分題目可以通過關鍵詞共現 + 簡單文本檢索獲得正確答案,基線較低。
  • ARC-Challenge:被篩選後剩餘的難題,要求模型具備物理直覺、因果推論、多步邏輯鏈等能力。這一子集才是產業界重點關注物件。

產業角色定位

ARC-Challenge 在 LLM 評測生態中的地位相當於”常識推論的高考卷”:

  • 它是 OpenAI GPT-4 技術報告中的官方評測項之一;
  • 它被納入 Stanford HELM(Holistic Evaluation of Language Models)的核心場景;
  • 它是 Hugging Face Open LLM Leaderboard 早期採用的基準之一;
  • 多家模型廠商在釋出新模型時,會單獨報告 ARC-Challenge 得分。

從產業鏈角度看,ARC 不是某項技術或產品,而是一把標尺——它衡量的是 AI 系統在需要”世界知識 + 多步推論”場景下的真實能力上限。

15 分鐘專家深入

1. 資料集構成

維度數值來源
總題量~7,787 道[AI2 原始論文, Clark et al. 2018]
ARC-Easy~5,197 道[同上]
ARC-Challenge~2,590 道[同上]
題目形式多選題(多數為 4 選 1)[同上]
學科範圍物理、生物、化學、地球科學等[同上]
年級範圍美國小學 3–9 年級(對應 K-12 標準化考試)[同上]

注意:以上精確數字來自 AI2 釋出論文中的統計口徑。後續若有增補版本,題量可能有微調,需以官方資料為準。

2. Challenge 子集的篩選邏輯

ARC-Challenge 並非”更難的題”這種模糊定義,而是有演算法化篩選標準

對於每道題,如果一個基於 IR(資訊檢索)+ Bigram 共現 的簡單基線方法能夠答對,則歸入 Easy;否則歸入 Challenge。[Clark et al., 2018]

這意味著 Challenge 集的”難”不是人類視角的難,而是對淺層 NLP 方法天然免疫。例如:

  • Easy 題(簡化示例):“Which of the following is a source of energy? (A) Sun (B) Rock…” → 文本中”sun”+“energy”共現頻率高,檢索即可命中。
  • Challenge 題(簡化示例):需要先理解”金屬導熱”原理,再排除語義干擾項,關鍵詞檢索無法直接命中。

3. 知識層級分析

ARC-Challenge 的題目覆蓋多種推論型別:

推論型別示例難度驅動因素
事實檢索(但需消除歧義)“植物的哪個部分負責吸收水分?“干擾選項包含常見誤解
因果推論”如果地球自轉停止,白天黑夜會怎樣變化?“需要物理建模
多步過程推論”水迴圈中,蒸氣→雲端→降雨→逕流”需要串聯多個因果環節
類比推論”電路中電阻增加→電流減小”需要將已知物理定律遷移到新情境
定量推論”速度 = 距離 / 時間”需要計算,不是純文本匹配

4. 從 ARC 看 LLM 推論能力的階梯式躍遷

ARC-Challenge 可以被視為一條清晰的推論能力時間軸

推論能力

  │  GPT-4 / Claude 3+         ~95-96%+  (2023-2024) [OpenAI報告/各廠商公告]
  │  ◆─────────────────── 人類非專家平均基線 ~85% [AI2估計]

  │  LLaMA-2 70B / Mixtral 8x7B  ~65-70%  (2023) [開源社群評測,口徑不一]
  │  (注:Mistral-7B 的 ARC-Challenge 得分約 60-62%,未達此區間)

  │  RoBERTa (fine-tuned)       ~75-78%  (2020-2021) [公開學術結果]

  │  BERT-Large                  ~46%     (2019) [公開學術結果]

  │  ── Random Baseline ──      ~25%     (4選1)
  └──────────────────────────────────────────────→ 時間
     2018    2019    2020    2021    2022    2023

宣告:上圖中各模型得分來自各時間段公開的論文/技術報告/社群評測結果,不同評測設定(零樣本/少樣本/微調)差異顯著,此處僅呈現大致趨勢,非嚴格同口徑對比。具體得分請以各模型官方技術報告為準。

關鍵觀察

  1. BERT → RoBERTa 階段:預訓練最佳化(更大語料、更長訓練、動態 masking)使微調後得分從 ~46% 躍升至 ~75-78%,說明通用語言理解能力對科學題有幫助,但仍遠未”解決”。
  2. RoBERTa → GPT-3/InstructGPT 階段:大規模預訓練 + 指令微調 / RLHF 帶來進一步提升,但 Challenge 子集仍是區分度指標。
  3. GPT-4 突破:GPT-4 在 ARC-Challenge 上據報道達到約 96%+ [OpenAI GPT-4 技術報告],標誌著該基準接近飽和。但需注意,GPT-4 的評測可能是 few-shot 設定,且訓練資料中是否包含類似題目存在爭議(資料汙染問題)。
  4. 後 ARC 時代:隨著強模型使 ARC-Challenge 分數趨於飽和,業界開始轉向更難的推論基準(如 ARC-AGI、GPQA、MATH、SWE-bench 等)。

技術原理

ARC 的評測架構結構

┌─────────────────────────────────────────────┐
│              ARC 評測架構                      │
│                                              │
│  輸入: 題幹 + 選項 (A/B/C/D)                  │
│         ↓                                    │
│  ┌──────────────────────────┐                │
│  │  模型推論層               │                │
│  │  (可選策略):              │                │
│  │  ① 直接分類 (多選頭)      │                │
│  │  ② 生成式 (P(answer|q,a)) │                │
│  │  ③ CoT 鏈式思維           │                │
│  │  ④ 檢索增強 (RAG)         │                │
│  └──────────────────────────┘                │
│         ↓                                    │
│  輸出: 預測選項                                │
│         ↓                                    │
│  評估: Accuracy (準確率)                      │
│  ├─ ARC-Easy 準確率                           │
│  └─ ARC-Challenge 準確率                      │
└─────────────────────────────────────────────┘

評分方式

  • 指標:多選準確率(Multiple-Choice Accuracy)。
  • 計算:對於生成式模型,通常計算每個選項在給定題幹條件下的條件機率 P(option | question),選擇機率最高的選項作為預測答案。對於指令跟隨模型,也可直接讓模型輸出選項字母。
  • Challenge 子集獨立報告:業界慣例是將 ARC-Challenge 作為主要衡量指標,因為 Easy 子集對現代大型模型區分度極低(多數強模型已接近 100%)。

ARC 與其他推論基準的機制差異

特徵ARC-ChallengeHellaSwagWinoGrandeMMLUGPQA
領域科學常識日常常識常識指代消解多學科知識研究生級科學
推論深度中等(需多步)低(模式匹配可解大量)中等知識密集型高(專家級)
題源標準化考試自動化生成眾包+篩選專家命題博士/博士後命題
飽和狀態接近飽和已飽和接近飽和尚未飽和遠未飽和
主要區分能力常識因果推論事件預測語義消歧世界知識廣度專家級推論

資料截至 2024 年,模型得分持續變化,以上為定性判斷。


技術演進史

時間線:
2018.03  ARC 資料集釋出 (Clark et al., "Think you have Solved 
         Question Answering? Try ARC, the AI2 Reasoning Challenge")
         ├─ 來源: 美國各州 K-12 標準化考試題
         ├─ 分析: 當時 SOTA 模型在 Challenge 上僅 ~45-50%
         └─ 核心發現: IR + 簡單 NLI 系統在 Challenge 上幾乎隨機
         
2019     BERT 時代: BERT-Large 微調達到 ~46% (Challenge) 
         [公開學術結果]
         
2019-20  知識增強方法興起:
         ├─ ARISTO (AI2 自研): 多模型整合 + 知識檢索
         ├─ UnifiedQA (Khashabi et al., 2020): 跨任務統一QA
         └─ 檢索增強: 搜尋引擎 + 閱讀理解級聯

2020-21  大規模預訓練模型突破:
         ├─ RoBERTa 微調: ~75-78%
         ├─ T5 / UnifiedQA: 達到 ~80%+ 區間
         └─ 少樣本 + 文本檢索成為主流 pipeline

2022     InstructGPT / ChatGPT 時代:
         ├─ 零樣本/少樣本指令跟隨大幅縮小與微調模型差距
         └─ Chain-of-Thought (CoT) 推論帶來顯著提升

2023     GPT-4 釋出:
         ├─ ARC-Challenge 約 96%+ [OpenAI 技術報告]
         ├─ 基準接近飽和, 業界開始質疑"是否還值得測"
         └─ ARC-AGI (由 François Chollet 提出) 作為替代基準出現

2024     後 ARC 時代:
         ├─ 開源模型 (LLaMA-3, Mistral-Large 等) 也接近飽和水平
         ├─ ARC-Challenge 在 Open LLM Leaderboard 中權重下降
         ├─ 產業關注點轉向: MATH, GPQA, SWE-bench, ARC-AGI 等
         └─ ARC 仍作為"基線體檢指標"保留在評測套件中

技術路線對比(量化表)

不同方法在 ARC-Challenge 上的大致表現區間

方法路線典型代表ARC-Challenge 得分割槽間訓練/推論成本備註
IR + 關鍵詞共現BM25 + Bigram~25-35%極低Challenge 集的篩選基線
傳統 NLP 特徵 + 分類器SVM + 依存特徵~35-45%2018 前後基線
BERT 類微調BERT-Large~45-50%中(單卡微調)[公開學術結果]
強預訓練模型微調RoBERTa-Large / DeBERTa~75-80%[公開學術結果]
統一 QA 模型UnifiedQA / T5~80-85%中-高跨任務遷移有效
大型模型 + CoT (零樣本)GPT-3.5~85%推論成本高[公開社群評測,口徑不一]
頂級大型模型 (少樣本)GPT-4 / Claude 3 Opus~95-96%+推論成本極高[廠商技術報告]
知識增強 + 檢索ARISTO / RAG pipeline~80-90%中-高(依賴檢索質量)AI2 內部系統

宣告:以上得分為不同時期、不同評測設定下的大致區間,非嚴格同口徑對比。具體數字以各論文/技術報告原始資料為準。得分割槽間存在 [學術文獻綜合估計] 性質。


上下游

ARC 在 AI 評測產業鏈中的位置

上游: 資料與知識來源
├── 美國各州 K-12 標準化考試題庫 (版權: 各州教育部門)
├── 科學課程標準 (NGSS 等) → 定義知識範圍
└── 標註團隊 (AI2 內部) → 資料清洗、Easy/Challenge 分層

中游: 評測平台與工具
├── AI2 官方評測指令碼
├── Hugging Face Open LLM Leaderboard (曾納入)
├── Stanford HELM 評測架構
├── Eleuther AI LM Evaluation Harness
└── 各廠商內部評測管線

下游: 消費評測結果的主體
├── 模型廠商 (釋出時引用 ARC-Challenge 得分)
├── 投資機構 / 分析師 (判斷模型能力的維度之一)
├── 學術研究者 (對比方法優劣)
└── 企業 AI 採購方 (評估 LLM 供應商能力)

與 ARC-AGI 的關係

需要區分兩個概念:

  • ARC (AI2 Reasoning Challenge):本文所討論的基準,科學常識多選題。
  • ARC-AGI (Abstraction and Reasoning Corpus for AGI):由 François Chollet 於 2019 年提出的視覺推論基準,任務是識別抽象的網格變換規則。兩者名字相似但完全不同——ARC-AGI 關注的是抽象推論泛化,目前 LLM 得分仍很低(GPT-4 據報約 5-25%,視具體設定而異),遠未飽和。

這是高頻混淆點,在投資研究中務必區分。


關鍵指標

指標含義產業意義
Challenge Accuracy在 ARC-Challenge 子集上的準確率核心指標,衡量模型常識推論深度
Easy Accuracy在 ARC-Easy 子集上的準確率輔助指標,現代模型區分度低
Overall Accuracy全集準確率區分度最低,權重已弱化
Few-shot vs Zero-shot評測設定差異同一模型在不同設定下得分可能差 5-15%
使用 Wikipedia 檢索輔助是否用 IR 表檢索增強可顯著提升,但引入外部依賴
資料汙染指標訓練資料是否包含 ARC 原題學術界持續關注,但缺乏標準化檢測方法

供需與市場資料

ARC 的”市場”不是產品市場,而是評測影響力市場

ARC-Challenge 作為基準的影響力可從以下維度觀察:

  • 引用量:原始論文 [Clark et al., 2018] 被引用超過 2,000 次 [Google Scholar 粗略估計,截至 2024 年,需即時確認]。
  • 被納入主流評測套件:HELM、Open LLM Leaderboard(已更新換代)、Eleuther LM Eval Harness 等。
  • 模型釋出必引用:幾乎所有主流 LLM 的技術報告(GPT-4、PaLM、LLaMA、Claude 等)都會報告 ARC 相關得分。
  • 評測頻率:隨著基準接近飽和,新模型在 ARC-Challenge 上的得分差異越來越小,邊際資訊價值遞減。

趨勢判斷

  • ARC-Challenge 正從”核心區分指標”向”基礎體檢指標”轉變。
  • 新一代推論基準(MATH、GPQA、SWE-bench、ARC-AGI、HumanEval)正在分流 ARC 的注意力。
  • 但 ARC 作為”科學常識推論”維度的標準化度量,短期內不會被完全替代。

代表公司與資本對映

直接相關方

角色公司/機構關係
資料集建立方Allen Institute for AI (AI2)非營利研究機構,Paul Allen 創立
模型評測方OpenAIGPT-4 技術報告中報告 ARC-Challenge 得分
模型評測方Meta AILLaMA 系列技術報告中包含 ARC 得分
模型評測方AnthropicClaude 系列技術報告中包含 ARC 得分
評測平台方Hugging FaceOpen LLM Leaderboard 曾納入 ARC
評測平台方Stanford CRFMHELM 架構納入 ARC

資本對映角度

ARC 本身不是投資標的,但它是判斷 AI 模型能力的一根座標軸

  • 某公司在 ARC-Challenge 上的得分變化,可作為其推論能力進步的代理指標之一。
  • 當一個新模型在 ARC-Challenge 上得分大幅提升,通常意味著其常識推論能力有實質進展(需排除資料汙染)。
  • 當 ARC-Challenge 被”刷爆”,說明業界推論能力門檻提升,競爭轉向更難基準。

投資邏輯

ARC 對 AI 投資分析的價值

1. 作為模型能力評估的”體檢單”之一

  • 如果一家 AI 公司釋出的模型在 ARC-Challenge 上得分顯著低於同規模競品,說明其推論能力可能是短板,需追問原因。
  • 反之,得分領先但其他基準(如 MATH、程式碼)落後,則說明強項在常識推論

2. ARC 飽和本身是一個投資訊號

  • ARC-Challenge 接近飽和意味著:科學常識推論不再是 LLM 能力的主要瓶頸
  • 投資關注點應轉向尚未飽和的維度:數學推論(MATH)、程式碼生成(SWE-bench)、專家級科學推論(GPQA)、抽象推論(ARC-AGI)。

3. Benchmark 輪替週期

  • 基準從釋出 → 被刷爆 → 被替代的週期約為 3-5 年。ARC(2018→2023 飽和)符合這一節奏。
  • 分析模型能力演進時,應繼續追蹤下一個”ARC”是什麼——目前看,GPQA 和 ARC-AGI 是候選。

風險提示

  • 資料汙染風險:部分模型可能在訓練過程中見過 ARC 原題或高度相似的題目,導致得分虛高。這是所有公開基準的共性問題。
  • Benchmark ≠ 實際產品價值:ARC 得分高不代表模型在實際應用場景中表現好,反之亦然。

常見誤讀糾偏

誤讀 1:“ARC 是測試 AGI 的基準”

糾偏:ARC(AI2 Reasoning Challenge)是一套小學科學多選題,測試的是科學常識推論能力,而非 AGI。與”AGI”相關的是 ARC-AGI(François Chollet 的抽象推論語料庫),二者名稱相似但完全不同。很多討論中將兩者混為一談,是嚴重的概念錯誤。

誤讀 2:“GPT-4 在 ARC 上得 96%,說明它達到了 96% 的人類推論能力”

糾偏

  • 96% 的基線不明確——是零樣本還是少樣本?是否包含檢索增強?
  • 人類在 ARC-Challenge 上的準確率並非 100%(據報道非專家約 85% [AI2 估計]),但人類的認知過程(推論鏈、因果建模)與 LLM 的統計模式匹配在機制層面根本不同
  • 高分不等於”類人推論”,可能包含了訓練資料中的模式記憶

誤讀 3:“ARC-Challenge 的題目對人類很簡單,只是對 AI 難”

糾偏:ARC-Challenge 中的部分題目對非專業成年人也有一定難度,尤其是在物理和地球科學領域。其難度梯度是面向 K-12 學生的,但篩選標準是”簡單檢索法答不對”,而非”人類答不對”。

誤讀 4:“公開基準不受資料汙染影響”

糾偏:ARC 資料集在網際網路上公開多年,題乾和答案均可通過搜尋引擎獲取。大型模型的預訓練語料中是否包含 ARC 原題,是一個幾乎無法完全排除的可能性。多家機構已開始研究汙染檢測方法,但尚無行業統一標準。


學習路徑

Level 1: 入門(30 分鐘)

  • 閱讀 AI2 的 ARC 官方頁面:allenai.org/data/arc
  • 瀏覽 10-20 道 Challenge 題目,直覺感受難度
  • 瞭解 Easy vs Challenge 的分層邏輯

Level 2: 理解(2 小時)

  • 閱讀原始論文:Clark et al. (2018), “Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge”
  • 瞭解論文中對各類 baseline 方法的分析
  • 在 Hugging Face 上找到 ARC 資料集,觀察資料結構

Level 3: 實踐(1 天)

  • 使用 Hugging Face evaluate 庫對某個開源 LLM 進行 ARC 評測
  • 嘗試不同 prompting 策略(零樣本 vs 少樣本 vs CoT)
  • 對比自己的結果與 leaderboard 上的結果

Level 4: 深度研究

  • 閱讀 ARISTO 系統論文,瞭解 AI2 如何通過多模型整合 + 檢索 + 推論鏈攻克 ARC
  • 研究資料汙染檢測方法
  • 對比 ARC 與 ARC-AGI、GPQA 的設計理念差異
  • 思考:如果要設計一個”後 ARC 時代的常識推論基準”,應該怎麼做?

一句話總結

ARC-Challenge 是 AI 常識推論能力的”標準化體檢單”——它在 2018 年揭示了模型只會”關鍵詞匹配”的短板,又在 2023 年被 GPT-4 基本”刷爆”,標誌性的從”難題”變成”基線”,其生命週期本身就是 AI 推論能力快速進步的縮影。


延伸閱讀與來源

核心文獻

  1. Clark, P. et al. (2018). “Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge.” arXiv:1803.05457
  2. Clark, P. et al. (2020). “From ‘F’ to ‘A’ on the N.Y. Regents Science Exams: An Overview of the ARISTO Project.” arXiv:1909.01958
  3. Khashabi, D. et al. (2020). “UnifiedQA: Crossing Format Boundaries with a Single QA System.” arXiv:2005.00700

模型技術報告

  1. OpenAI (2023). “GPT-4 Technical Report.” — ARC-Challenge 得分引用
  2. Meta AI (2023). “LLaMA: Open and Efficient Foundation Language Models.” — ARC 得分引用

評測架構

  1. Liang, P. et al. (2022). “Holistic Evaluation of Language Models (HELM).”
  2. Gao, L. et al. (2023). “A framework for few-shot language model evaluation.” (Eleuther LM Evaluation Harness)

補充

  1. Chollet, F. (2019). “On the Measure of Intelligence.” — ARC-AGI 提出 [需與 ARC 區分]
  2. Hugging Face Open LLM Leaderboard — 可即時檢視最新模型 ARC 得分

資料準確性宣告:本文中所有具體數字均標註來源口徑。無確切來源的數值已用區間或定性表述替代。如需用於投資決策,請以各廠商官方技術報告中的原始資料為準。

source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型