模型层 开放阅读

ARC

AI2 Reasoning Challenge

概念 ID
ai2-reasoning-challenge
更新时间
2026-05-29
来源数量
待补

ARC(AI2 Reasoning Challenge)

3 秒看懂

ARC 是艾伦人工智能研究所(AI2)于 2018 年发布的一项科学常识推理基准测试,由约 7,787 道美国小学科学考试多选题构成,分为 EasyChallenge 两个子集。ARC-Challenge 专门筛选出那些”靠关键词匹配和简单检索答不对、必须多步推理才能解对”的题目,长期被业界视为衡量大模型常识推理能力的标杆任务之一。

3 分钟产业解释

为什么一个”小学科学题”能成为产业级基准?

2017–2018 年,NLP 领域的 SQuAD、GLUE 等阅读理解基准纷纷被”刷爆”,但业界逐渐意识到——模型可能只是在做浅层模式匹配,并没有真正”理解”。AI2 的 Peter Clark 等人于是做了一件朴素但关键的事:从美国各州标准化考试中收集小学科学题,然后按照”简单检索法答不对”的标准,把题目分成 Easy 和 Challenge 两档。

  • ARC-Easy:大部分题目可以通过关键词共现 + 简单文本检索获得正确答案,基线较低。
  • ARC-Challenge:被筛选后剩余的难题,要求模型具备物理直觉、因果推理、多步逻辑链等能力。这一子集才是产业界重点关注对象。

产业角色定位

ARC-Challenge 在 LLM 评测生态中的地位相当于”常识推理的高考卷”:

  • 它是 OpenAI GPT-4 技术报告中的官方评测项之一;
  • 它被纳入 Stanford HELM(Holistic Evaluation of Language Models)的核心场景;
  • 它是 Hugging Face Open LLM Leaderboard 早期采用的基准之一;
  • 多家模型厂商在发布新模型时,会单独报告 ARC-Challenge 得分。

从产业链角度看,ARC 不是某项技术或产品,而是一把标尺——它衡量的是 AI 系统在需要”世界知识 + 多步推理”场景下的真实能力上限。

15 分钟专家深入

1. 数据集构成

维度数值来源
总题量~7,787 道[AI2 原始论文, Clark et al. 2018]
ARC-Easy~5,197 道[同上]
ARC-Challenge~2,590 道[同上]
题目形式多选题(多数为 4 选 1)[同上]
学科范围物理、生物、化学、地球科学等[同上]
年级范围美国小学 3–9 年级(对应 K-12 标准化考试)[同上]

注意:以上精确数字来自 AI2 发布论文中的统计口径。后续若有增补版本,题量可能有微调,需以官方数据为准。

2. Challenge 子集的筛选逻辑

ARC-Challenge 并非”更难的题”这种模糊定义,而是有算法化筛选标准

对于每道题,如果一个基于 IR(信息检索)+ Bigram 共现 的简单基线方法能够答对,则归入 Easy;否则归入 Challenge。[Clark et al., 2018]

这意味着 Challenge 集的”难”不是人类视角的难,而是对浅层 NLP 方法天然免疫。例如:

  • Easy 题(简化示例):“Which of the following is a source of energy? (A) Sun (B) Rock…” → 文本中”sun”+“energy”共现频率高,检索即可命中。
  • Challenge 题(简化示例):需要先理解”金属导热”原理,再排除语义干扰项,关键词检索无法直接命中。

3. 知识层级分析

ARC-Challenge 的题目覆盖多种推理类型:

推理类型示例难度驱动因素
事实检索(但需消除歧义)“植物的哪个部分负责吸收水分?“干扰选项包含常见误解
因果推理”如果地球自转停止,白天黑夜会怎样变化?“需要物理建模
多步过程推理”水循环中,蒸气→云→降雨→径流”需要串联多个因果环节
类比推理”电路中电阻增加→电流减小”需要将已知物理定律迁移到新情境
定量推理”速度 = 距离 / 时间”需要计算,不是纯文本匹配

4. 从 ARC 看 LLM 推理能力的阶梯式跃迁

ARC-Challenge 可以被视为一条清晰的推理能力时间轴

推理能力
  ▲
  │  GPT-4 / Claude 3+         ~95-96%+  (2023-2024) [OpenAI报告/各厂商公告]
  │  ◆─────────────────── 人类非专家平均基线 ~85% [AI2估计]
  │
  │  LLaMA-2 70B / Mixtral 8x7B  ~65-70%  (2023) [开源社区评测,口径不一]
  │  (注:Mistral-7B 的 ARC-Challenge 得分约 60-62%,未达此区间)
  │
  │  RoBERTa (fine-tuned)       ~75-78%  (2020-2021) [公开学术结果]
  │
  │  BERT-Large                  ~46%     (2019) [公开学术结果]
  │
  │  ── Random Baseline ──      ~25%     (4选1)
  └──────────────────────────────────────────────→ 时间
     2018    2019    2020    2021    2022    2023

声明:上图中各模型得分来自各时间段公开的论文/技术报告/社区评测结果,不同评测设置(零样本/少样本/微调)差异显著,此处仅呈现大致趋势,非严格同口径对比。具体得分请以各模型官方技术报告为准。

关键观察

  1. BERT → RoBERTa 阶段:预训练优化(更大语料、更长训练、动态 masking)使微调后得分从 ~46% 跃升至 ~75-78%,说明通用语言理解能力对科学题有帮助,但仍远未”解决”。
  2. RoBERTa → GPT-3/InstructGPT 阶段:大规模预训练 + 指令微调 / RLHF 带来进一步提升,但 Challenge 子集仍是区分度指标。
  3. GPT-4 突破:GPT-4 在 ARC-Challenge 上据报道达到约 96%+ [OpenAI GPT-4 技术报告],标志着该基准接近饱和。但需注意,GPT-4 的评测可能是 few-shot 设置,且训练数据中是否包含类似题目存在争议(数据污染问题)。
  4. 后 ARC 时代:随着强模型使 ARC-Challenge 分数趋于饱和,业界开始转向更难的推理基准(如 ARC-AGI、GPQA、MATH、SWE-bench 等)。

技术原理

ARC 的评测框架结构

┌─────────────────────────────────────────────┐
│              ARC 评测框架                      │
│                                              │
│  输入: 题干 + 选项 (A/B/C/D)                  │
│         ↓                                    │
│  ┌──────────────────────────┐                │
│  │  模型推理层               │                │
│  │  (可选策略):              │                │
│  │  ① 直接分类 (多选头)      │                │
│  │  ② 生成式 (P(answer|q,a)) │                │
│  │  ③ CoT 链式思维           │                │
│  │  ④ 检索增强 (RAG)         │                │
│  └──────────────────────────┘                │
│         ↓                                    │
│  输出: 预测选项                                │
│         ↓                                    │
│  评估: Accuracy (准确率)                      │
│  ├─ ARC-Easy 准确率                           │
│  └─ ARC-Challenge 准确率                      │
└─────────────────────────────────────────────┘

评分方式

  • 指标:多选准确率(Multiple-Choice Accuracy)。
  • 计算:对于生成式模型,通常计算每个选项在给定题干条件下的条件概率 P(option | question),选择概率最高的选项作为预测答案。对于指令跟随模型,也可直接让模型输出选项字母。
  • Challenge 子集独立报告:业界惯例是将 ARC-Challenge 作为主要衡量指标,因为 Easy 子集对现代大模型区分度极低(多数强模型已接近 100%)。

ARC 与其他推理基准的机制差异

特征ARC-ChallengeHellaSwagWinoGrandeMMLUGPQA
领域科学常识日常常识常识指代消解多学科知识研究生级科学
推理深度中等(需多步)低(模式匹配可解大量)中等知识密集型高(专家级)
题源标准化考试自动化生成众包+筛选专家命题博士/博士后命题
饱和状态接近饱和已饱和接近饱和尚未饱和远未饱和
主要区分能力常识因果推理事件预测语义消歧世界知识广度专家级推理

数据截至 2024 年,模型得分持续变化,以上为定性判断。


技术演进史

时间线:
2018.03  ARC 数据集发布 (Clark et al., "Think you have Solved 
         Question Answering? Try ARC, the AI2 Reasoning Challenge")
         ├─ 来源: 美国各州 K-12 标准化考试题
         ├─ 分析: 当时 SOTA 模型在 Challenge 上仅 ~45-50%
         └─ 核心发现: IR + 简单 NLI 系统在 Challenge 上几乎随机
         
2019     BERT 时代: BERT-Large 微调达到 ~46% (Challenge) 
         [公开学术结果]
         
2019-20  知识增强方法兴起:
         ├─ ARISTO (AI2 自研): 多模型集成 + 知识检索
         ├─ UnifiedQA (Khashabi et al., 2020): 跨任务统一QA
         └─ 检索增强: 搜索引擎 + 阅读理解级联

2020-21  大规模预训练模型突破:
         ├─ RoBERTa 微调: ~75-78%
         ├─ T5 / UnifiedQA: 达到 ~80%+ 区间
         └─ 少样本 + 文本检索成为主流 pipeline

2022     InstructGPT / ChatGPT 时代:
         ├─ 零样本/少样本指令跟随大幅缩小与微调模型差距
         └─ Chain-of-Thought (CoT) 推理带来显著提升

2023     GPT-4 发布:
         ├─ ARC-Challenge 约 96%+ [OpenAI 技术报告]
         ├─ 基准接近饱和, 业界开始质疑"是否还值得测"
         └─ ARC-AGI (由 François Chollet 提出) 作为替代基准出现

2024     后 ARC 时代:
         ├─ 开源模型 (LLaMA-3, Mistral-Large 等) 也接近饱和水平
         ├─ ARC-Challenge 在 Open LLM Leaderboard 中权重下降
         ├─ 产业关注点转向: MATH, GPQA, SWE-bench, ARC-AGI 等
         └─ ARC 仍作为"基线体检指标"保留在评测套件中

技术路线对比(量化表)

不同方法在 ARC-Challenge 上的大致表现区间

方法路线典型代表ARC-Challenge 得分区间训练/推理成本备注
IR + 关键词共现BM25 + Bigram~25-35%极低Challenge 集的筛选基线
传统 NLP 特征 + 分类器SVM + 依存特征~35-45%2018 前后基线
BERT 类微调BERT-Large~45-50%中(单卡微调)[公开学术结果]
强预训练模型微调RoBERTa-Large / DeBERTa~75-80%[公开学术结果]
统一 QA 模型UnifiedQA / T5~80-85%中-高跨任务迁移有效
大模型 + CoT (零样本)GPT-3.5~85%推理成本高[公开社区评测,口径不一]
顶级大模型 (少样本)GPT-4 / Claude 3 Opus~95-96%+推理成本极高[厂商技术报告]
知识增强 + 检索ARISTO / RAG pipeline~80-90%中-高(依赖检索质量)AI2 内部系统

声明:以上得分为不同时期、不同评测设置下的大致区间,非严格同口径对比。具体数字以各论文/技术报告原始数据为准。得分区间存在 [学术文献综合估计] 性质。


上下游

ARC 在 AI 评测产业链中的位置

上游: 数据与知识来源
├── 美国各州 K-12 标准化考试题库 (版权: 各州教育部门)
├── 科学课程标准 (NGSS 等) → 定义知识范围
└── 标注团队 (AI2 内部) → 数据清洗、Easy/Challenge 分层

中游: 评测平台与工具
├── AI2 官方评测脚本
├── Hugging Face Open LLM Leaderboard (曾纳入)
├── Stanford HELM 评测框架
├── Eleuther AI LM Evaluation Harness
└── 各厂商内部评测管线

下游: 消费评测结果的主体
├── 模型厂商 (发布时引用 ARC-Challenge 得分)
├── 投资机构 / 分析师 (判断模型能力的维度之一)
├── 学术研究者 (对比方法优劣)
└── 企业 AI 采购方 (评估 LLM 供应商能力)

与 ARC-AGI 的关系

需要区分两个概念:

  • ARC (AI2 Reasoning Challenge):本文所讨论的基准,科学常识多选题。
  • ARC-AGI (Abstraction and Reasoning Corpus for AGI):由 François Chollet 于 2019 年提出的视觉推理基准,任务是识别抽象的网格变换规则。两者名字相似但完全不同——ARC-AGI 关注的是抽象推理泛化,目前 LLM 得分仍很低(GPT-4 据报约 5-25%,视具体设置而异),远未饱和。

这是高频混淆点,在投资研究中务必区分。


关键指标

指标含义产业意义
Challenge Accuracy在 ARC-Challenge 子集上的准确率核心指标,衡量模型常识推理深度
Easy Accuracy在 ARC-Easy 子集上的准确率辅助指标,现代模型区分度低
Overall Accuracy全集准确率区分度最低,权重已弱化
Few-shot vs Zero-shot评测设置差异同一模型在不同设置下得分可能差 5-15%
使用 Wikipedia 检索辅助是否用 IR 表检索增强可显著提升,但引入外部依赖
数据污染指标训练数据是否包含 ARC 原题学术界持续关注,但缺乏标准化检测方法

供需与市场数据

ARC 的”市场”不是产品市场,而是评测影响力市场

ARC-Challenge 作为基准的影响力可从以下维度观察:

  • 引用量:原始论文 [Clark et al., 2018] 被引用超过 2,000 次 [Google Scholar 粗略估计,截至 2024 年,需实时确认]。
  • 被纳入主流评测套件:HELM、Open LLM Leaderboard(已更新换代)、Eleuther LM Eval Harness 等。
  • 模型发布必引用:几乎所有主流 LLM 的技术报告(GPT-4、PaLM、LLaMA、Claude 等)都会报告 ARC 相关得分。
  • 评测频率:随着基准接近饱和,新模型在 ARC-Challenge 上的得分差异越来越小,边际信息价值递减。

趋势判断

  • ARC-Challenge 正从”核心区分指标”向”基础体检指标”转变。
  • 新一代推理基准(MATH、GPQA、SWE-bench、ARC-AGI、HumanEval)正在分流 ARC 的注意力。
  • 但 ARC 作为”科学常识推理”维度的标准化度量,短期内不会被完全替代。

代表公司与资本映射

直接相关方

角色公司/机构关系
数据集创建方Allen Institute for AI (AI2)非营利研究机构,Paul Allen 创立
模型评测方OpenAIGPT-4 技术报告中报告 ARC-Challenge 得分
模型评测方Meta AILLaMA 系列技术报告中包含 ARC 得分
模型评测方AnthropicClaude 系列技术报告中包含 ARC 得分
评测平台方Hugging FaceOpen LLM Leaderboard 曾纳入 ARC
评测平台方Stanford CRFMHELM 框架纳入 ARC

资本映射角度

ARC 本身不是投资标的,但它是判断 AI 模型能力的一根坐标轴

  • 某公司在 ARC-Challenge 上的得分变化,可作为其推理能力进步的代理指标之一。
  • 当一个新模型在 ARC-Challenge 上得分大幅提升,通常意味着其常识推理能力有实质进展(需排除数据污染)。
  • 当 ARC-Challenge 被”刷爆”,说明业界推理能力门槛提升,竞争转向更难基准。

投资逻辑

ARC 对 AI 投资分析的价值

1. 作为模型能力评估的”体检单”之一

  • 如果一家 AI 公司发布的模型在 ARC-Challenge 上得分显著低于同规模竞品,说明其推理能力可能是短板,需追问原因。
  • 反之,得分领先但其他基准(如 MATH、代码)落后,则说明强项在常识推理

2. ARC 饱和本身是一个投资信号

  • ARC-Challenge 接近饱和意味着:科学常识推理不再是 LLM 能力的主要瓶颈
  • 投资关注点应转向尚未饱和的维度:数学推理(MATH)、代码生成(SWE-bench)、专家级科学推理(GPQA)、抽象推理(ARC-AGI)。

3. Benchmark 轮替周期

  • 基准从发布 → 被刷爆 → 被替代的周期约为 3-5 年。ARC(2018→2023 饱和)符合这一节奏。
  • 分析模型能力演进时,应继续跟踪下一个”ARC”是什么——目前看,GPQA 和 ARC-AGI 是候选。

风险提示

  • 数据污染风险:部分模型可能在训练过程中见过 ARC 原题或高度相似的题目,导致得分虚高。这是所有公开基准的共性问题。
  • Benchmark ≠ 实际产品价值:ARC 得分高不代表模型在实际应用场景中表现好,反之亦然。

常见误读纠偏

误读 1:“ARC 是测试 AGI 的基准”

纠偏:ARC(AI2 Reasoning Challenge)是一套小学科学多选题,测试的是科学常识推理能力,而非 AGI。与”AGI”相关的是 ARC-AGI(François Chollet 的抽象推理语料库),二者名称相似但完全不同。很多讨论中将两者混为一谈,是严重的概念错误。

误读 2:“GPT-4 在 ARC 上得 96%,说明它达到了 96% 的人类推理能力”

纠偏

  • 96% 的基线不明确——是零样本还是少样本?是否包含检索增强?
  • 人类在 ARC-Challenge 上的准确率并非 100%(据报道非专家约 85% [AI2 估计]),但人类的认知过程(推理链、因果建模)与 LLM 的统计模式匹配在机制层面根本不同
  • 高分不等于”类人推理”,可能包含了训练数据中的模式记忆

误读 3:“ARC-Challenge 的题目对人类很简单,只是对 AI 难”

纠偏:ARC-Challenge 中的部分题目对非专业成年人也有一定难度,尤其是在物理和地球科学领域。其难度梯度是面向 K-12 学生的,但筛选标准是”简单检索法答不对”,而非”人类答不对”。

误读 4:“公开基准不受数据污染影响”

纠偏:ARC 数据集在互联网上公开多年,题干和答案均可通过搜索引擎获取。大模型的预训练语料中是否包含 ARC 原题,是一个几乎无法完全排除的可能性。多家机构已开始研究污染检测方法,但尚无行业统一标准。


学习路径

Level 1: 入门(30 分钟)

  • 阅读 AI2 的 ARC 官方页面:allenai.org/data/arc
  • 浏览 10-20 道 Challenge 题目,直觉感受难度
  • 了解 Easy vs Challenge 的分层逻辑

Level 2: 理解(2 小时)

  • 阅读原始论文:Clark et al. (2018), “Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge”
  • 了解论文中对各类 baseline 方法的分析
  • 在 Hugging Face 上找到 ARC 数据集,观察数据结构

Level 3: 实践(1 天)

  • 使用 Hugging Face evaluate 库对某个开源 LLM 进行 ARC 评测
  • 尝试不同 prompting 策略(零样本 vs 少样本 vs CoT)
  • 对比自己的结果与 leaderboard 上的结果

Level 4: 深度研究

  • 阅读 ARISTO 系统论文,了解 AI2 如何通过多模型集成 + 检索 + 推理链攻克 ARC
  • 研究数据污染检测方法
  • 对比 ARC 与 ARC-AGI、GPQA 的设计理念差异
  • 思考:如果要设计一个”后 ARC 时代的常识推理基准”,应该怎么做?

一句话总结

ARC-Challenge 是 AI 常识推理能力的”标准化体检单”——它在 2018 年揭示了模型只会”关键词匹配”的短板,又在 2023 年被 GPT-4 基本”刷爆”,标志性的从”难题”变成”基线”,其生命周期本身就是 AI 推理能力快速进步的缩影。


延伸阅读与来源

核心文献

  1. Clark, P. et al. (2018). “Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge.” arXiv:1803.05457
  2. Clark, P. et al. (2020). “From ‘F’ to ‘A’ on the N.Y. Regents Science Exams: An Overview of the ARISTO Project.” arXiv:1909.01958
  3. Khashabi, D. et al. (2020). “UnifiedQA: Crossing Format Boundaries with a Single QA System.” arXiv:2005.00700

模型技术报告

  1. OpenAI (2023). “GPT-4 Technical Report.” — ARC-Challenge 得分引用
  2. Meta AI (2023). “LLaMA: Open and Efficient Foundation Language Models.” — ARC 得分引用

评测框架

  1. Liang, P. et al. (2022). “Holistic Evaluation of Language Models (HELM).”
  2. Gao, L. et al. (2023). “A framework for few-shot language model evaluation.” (Eleuther LM Evaluation Harness)

补充

  1. Chollet, F. (2019). “On the Measure of Intelligence.” — ARC-AGI 提出 [需与 ARC 区分]
  2. Hugging Face Open LLM Leaderboard — 可实时查看最新模型 ARC 得分

数据准确性声明:本文中所有具体数字均标注来源口径。无确切来源的数值已用区间或定性表述替代。如需用于投资决策,请以各厂商官方技术报告中的原始数据为准。

source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型