ARC(AI2 Reasoning Challenge)
3 秒看懂
ARC 是艾伦人工智能研究所(AI2)于 2018 年发布的一项科学常识推理基准测试,由约 7,787 道美国小学科学考试多选题构成,分为 Easy 和 Challenge 两个子集。ARC-Challenge 专门筛选出那些”靠关键词匹配和简单检索答不对、必须多步推理才能解对”的题目,长期被业界视为衡量大模型常识推理能力的标杆任务之一。
3 分钟产业解释
为什么一个”小学科学题”能成为产业级基准?
2017–2018 年,NLP 领域的 SQuAD、GLUE 等阅读理解基准纷纷被”刷爆”,但业界逐渐意识到——模型可能只是在做浅层模式匹配,并没有真正”理解”。AI2 的 Peter Clark 等人于是做了一件朴素但关键的事:从美国各州标准化考试中收集小学科学题,然后按照”简单检索法答不对”的标准,把题目分成 Easy 和 Challenge 两档。
- ARC-Easy:大部分题目可以通过关键词共现 + 简单文本检索获得正确答案,基线较低。
- ARC-Challenge:被筛选后剩余的难题,要求模型具备物理直觉、因果推理、多步逻辑链等能力。这一子集才是产业界重点关注对象。
产业角色定位
ARC-Challenge 在 LLM 评测生态中的地位相当于”常识推理的高考卷”:
- 它是 OpenAI GPT-4 技术报告中的官方评测项之一;
- 它被纳入 Stanford HELM(Holistic Evaluation of Language Models)的核心场景;
- 它是 Hugging Face Open LLM Leaderboard 早期采用的基准之一;
- 多家模型厂商在发布新模型时,会单独报告 ARC-Challenge 得分。
从产业链角度看,ARC 不是某项技术或产品,而是一把标尺——它衡量的是 AI 系统在需要”世界知识 + 多步推理”场景下的真实能力上限。
15 分钟专家深入
1. 数据集构成
| 维度 | 数值 | 来源 |
|---|---|---|
| 总题量 | ~7,787 道 | [AI2 原始论文, Clark et al. 2018] |
| ARC-Easy | ~5,197 道 | [同上] |
| ARC-Challenge | ~2,590 道 | [同上] |
| 题目形式 | 多选题(多数为 4 选 1) | [同上] |
| 学科范围 | 物理、生物、化学、地球科学等 | [同上] |
| 年级范围 | 美国小学 3–9 年级(对应 K-12 标准化考试) | [同上] |
注意:以上精确数字来自 AI2 发布论文中的统计口径。后续若有增补版本,题量可能有微调,需以官方数据为准。
2. Challenge 子集的筛选逻辑
ARC-Challenge 并非”更难的题”这种模糊定义,而是有算法化筛选标准:
对于每道题,如果一个基于 IR(信息检索)+ Bigram 共现 的简单基线方法能够答对,则归入 Easy;否则归入 Challenge。[Clark et al., 2018]
这意味着 Challenge 集的”难”不是人类视角的难,而是对浅层 NLP 方法天然免疫。例如:
- Easy 题(简化示例):“Which of the following is a source of energy? (A) Sun (B) Rock…” → 文本中”sun”+“energy”共现频率高,检索即可命中。
- Challenge 题(简化示例):需要先理解”金属导热”原理,再排除语义干扰项,关键词检索无法直接命中。
3. 知识层级分析
ARC-Challenge 的题目覆盖多种推理类型:
| 推理类型 | 示例 | 难度驱动因素 |
|---|---|---|
| 事实检索(但需消除歧义) | “植物的哪个部分负责吸收水分?“ | 干扰选项包含常见误解 |
| 因果推理 | ”如果地球自转停止,白天黑夜会怎样变化?“ | 需要物理建模 |
| 多步过程推理 | ”水循环中,蒸气→云→降雨→径流” | 需要串联多个因果环节 |
| 类比推理 | ”电路中电阻增加→电流减小” | 需要将已知物理定律迁移到新情境 |
| 定量推理 | ”速度 = 距离 / 时间” | 需要计算,不是纯文本匹配 |
4. 从 ARC 看 LLM 推理能力的阶梯式跃迁
ARC-Challenge 可以被视为一条清晰的推理能力时间轴:
推理能力
▲
│ GPT-4 / Claude 3+ ~95-96%+ (2023-2024) [OpenAI报告/各厂商公告]
│ ◆─────────────────── 人类非专家平均基线 ~85% [AI2估计]
│
│ LLaMA-2 70B / Mixtral 8x7B ~65-70% (2023) [开源社区评测,口径不一]
│ (注:Mistral-7B 的 ARC-Challenge 得分约 60-62%,未达此区间)
│
│ RoBERTa (fine-tuned) ~75-78% (2020-2021) [公开学术结果]
│
│ BERT-Large ~46% (2019) [公开学术结果]
│
│ ── Random Baseline ── ~25% (4选1)
└──────────────────────────────────────────────→ 时间
2018 2019 2020 2021 2022 2023
声明:上图中各模型得分来自各时间段公开的论文/技术报告/社区评测结果,不同评测设置(零样本/少样本/微调)差异显著,此处仅呈现大致趋势,非严格同口径对比。具体得分请以各模型官方技术报告为准。
关键观察:
- BERT → RoBERTa 阶段:预训练优化(更大语料、更长训练、动态 masking)使微调后得分从 ~46% 跃升至 ~75-78%,说明通用语言理解能力对科学题有帮助,但仍远未”解决”。
- RoBERTa → GPT-3/InstructGPT 阶段:大规模预训练 + 指令微调 / RLHF 带来进一步提升,但 Challenge 子集仍是区分度指标。
- GPT-4 突破:GPT-4 在 ARC-Challenge 上据报道达到约 96%+ [OpenAI GPT-4 技术报告],标志着该基准接近饱和。但需注意,GPT-4 的评测可能是 few-shot 设置,且训练数据中是否包含类似题目存在争议(数据污染问题)。
- 后 ARC 时代:随着强模型使 ARC-Challenge 分数趋于饱和,业界开始转向更难的推理基准(如 ARC-AGI、GPQA、MATH、SWE-bench 等)。
技术原理
ARC 的评测框架结构
┌─────────────────────────────────────────────┐
│ ARC 评测框架 │
│ │
│ 输入: 题干 + 选项 (A/B/C/D) │
│ ↓ │
│ ┌──────────────────────────┐ │
│ │ 模型推理层 │ │
│ │ (可选策略): │ │
│ │ ① 直接分类 (多选头) │ │
│ │ ② 生成式 (P(answer|q,a)) │ │
│ │ ③ CoT 链式思维 │ │
│ │ ④ 检索增强 (RAG) │ │
│ └──────────────────────────┘ │
│ ↓ │
│ 输出: 预测选项 │
│ ↓ │
│ 评估: Accuracy (准确率) │
│ ├─ ARC-Easy 准确率 │
│ └─ ARC-Challenge 准确率 │
└─────────────────────────────────────────────┘
评分方式
- 指标:多选准确率(Multiple-Choice Accuracy)。
- 计算:对于生成式模型,通常计算每个选项在给定题干条件下的条件概率 P(option | question),选择概率最高的选项作为预测答案。对于指令跟随模型,也可直接让模型输出选项字母。
- Challenge 子集独立报告:业界惯例是将 ARC-Challenge 作为主要衡量指标,因为 Easy 子集对现代大模型区分度极低(多数强模型已接近 100%)。
ARC 与其他推理基准的机制差异
| 特征 | ARC-Challenge | HellaSwag | WinoGrande | MMLU | GPQA |
|---|---|---|---|---|---|
| 领域 | 科学常识 | 日常常识 | 常识指代消解 | 多学科知识 | 研究生级科学 |
| 推理深度 | 中等(需多步) | 低(模式匹配可解大量) | 中等 | 知识密集型 | 高(专家级) |
| 题源 | 标准化考试 | 自动化生成 | 众包+筛选 | 专家命题 | 博士/博士后命题 |
| 饱和状态 | 接近饱和 | 已饱和 | 接近饱和 | 尚未饱和 | 远未饱和 |
| 主要区分能力 | 常识因果推理 | 事件预测 | 语义消歧 | 世界知识广度 | 专家级推理 |
数据截至 2024 年,模型得分持续变化,以上为定性判断。
技术演进史
时间线:
2018.03 ARC 数据集发布 (Clark et al., "Think you have Solved
Question Answering? Try ARC, the AI2 Reasoning Challenge")
├─ 来源: 美国各州 K-12 标准化考试题
├─ 分析: 当时 SOTA 模型在 Challenge 上仅 ~45-50%
└─ 核心发现: IR + 简单 NLI 系统在 Challenge 上几乎随机
2019 BERT 时代: BERT-Large 微调达到 ~46% (Challenge)
[公开学术结果]
2019-20 知识增强方法兴起:
├─ ARISTO (AI2 自研): 多模型集成 + 知识检索
├─ UnifiedQA (Khashabi et al., 2020): 跨任务统一QA
└─ 检索增强: 搜索引擎 + 阅读理解级联
2020-21 大规模预训练模型突破:
├─ RoBERTa 微调: ~75-78%
├─ T5 / UnifiedQA: 达到 ~80%+ 区间
└─ 少样本 + 文本检索成为主流 pipeline
2022 InstructGPT / ChatGPT 时代:
├─ 零样本/少样本指令跟随大幅缩小与微调模型差距
└─ Chain-of-Thought (CoT) 推理带来显著提升
2023 GPT-4 发布:
├─ ARC-Challenge 约 96%+ [OpenAI 技术报告]
├─ 基准接近饱和, 业界开始质疑"是否还值得测"
└─ ARC-AGI (由 François Chollet 提出) 作为替代基准出现
2024 后 ARC 时代:
├─ 开源模型 (LLaMA-3, Mistral-Large 等) 也接近饱和水平
├─ ARC-Challenge 在 Open LLM Leaderboard 中权重下降
├─ 产业关注点转向: MATH, GPQA, SWE-bench, ARC-AGI 等
└─ ARC 仍作为"基线体检指标"保留在评测套件中
技术路线对比(量化表)
不同方法在 ARC-Challenge 上的大致表现区间
| 方法路线 | 典型代表 | ARC-Challenge 得分区间 | 训练/推理成本 | 备注 |
|---|---|---|---|---|
| IR + 关键词共现 | BM25 + Bigram | ~25-35% | 极低 | Challenge 集的筛选基线 |
| 传统 NLP 特征 + 分类器 | SVM + 依存特征 | ~35-45% | 低 | 2018 前后基线 |
| BERT 类微调 | BERT-Large | ~45-50% | 中(单卡微调) | [公开学术结果] |
| 强预训练模型微调 | RoBERTa-Large / DeBERTa | ~75-80% | 中 | [公开学术结果] |
| 统一 QA 模型 | UnifiedQA / T5 | ~80-85% | 中-高 | 跨任务迁移有效 |
| 大模型 + CoT (零样本) | GPT-3.5 | ~85% | 推理成本高 | [公开社区评测,口径不一] |
| 顶级大模型 (少样本) | GPT-4 / Claude 3 Opus | ~95-96%+ | 推理成本极高 | [厂商技术报告] |
| 知识增强 + 检索 | ARISTO / RAG pipeline | ~80-90% | 中-高(依赖检索质量) | AI2 内部系统 |
声明:以上得分为不同时期、不同评测设置下的大致区间,非严格同口径对比。具体数字以各论文/技术报告原始数据为准。得分区间存在 [学术文献综合估计] 性质。
上下游
ARC 在 AI 评测产业链中的位置
上游: 数据与知识来源
├── 美国各州 K-12 标准化考试题库 (版权: 各州教育部门)
├── 科学课程标准 (NGSS 等) → 定义知识范围
└── 标注团队 (AI2 内部) → 数据清洗、Easy/Challenge 分层
中游: 评测平台与工具
├── AI2 官方评测脚本
├── Hugging Face Open LLM Leaderboard (曾纳入)
├── Stanford HELM 评测框架
├── Eleuther AI LM Evaluation Harness
└── 各厂商内部评测管线
下游: 消费评测结果的主体
├── 模型厂商 (发布时引用 ARC-Challenge 得分)
├── 投资机构 / 分析师 (判断模型能力的维度之一)
├── 学术研究者 (对比方法优劣)
└── 企业 AI 采购方 (评估 LLM 供应商能力)
与 ARC-AGI 的关系
需要区分两个概念:
- ARC (AI2 Reasoning Challenge):本文所讨论的基准,科学常识多选题。
- ARC-AGI (Abstraction and Reasoning Corpus for AGI):由 François Chollet 于 2019 年提出的视觉推理基准,任务是识别抽象的网格变换规则。两者名字相似但完全不同——ARC-AGI 关注的是抽象推理泛化,目前 LLM 得分仍很低(GPT-4 据报约 5-25%,视具体设置而异),远未饱和。
这是高频混淆点,在投资研究中务必区分。
关键指标
| 指标 | 含义 | 产业意义 |
|---|---|---|
| Challenge Accuracy | 在 ARC-Challenge 子集上的准确率 | 核心指标,衡量模型常识推理深度 |
| Easy Accuracy | 在 ARC-Easy 子集上的准确率 | 辅助指标,现代模型区分度低 |
| Overall Accuracy | 全集准确率 | 区分度最低,权重已弱化 |
| Few-shot vs Zero-shot | 评测设置差异 | 同一模型在不同设置下得分可能差 5-15% |
| 使用 Wikipedia 检索辅助 | 是否用 IR 表 | 检索增强可显著提升,但引入外部依赖 |
| 数据污染指标 | 训练数据是否包含 ARC 原题 | 学术界持续关注,但缺乏标准化检测方法 |
供需与市场数据
ARC 的”市场”不是产品市场,而是评测影响力市场
ARC-Challenge 作为基准的影响力可从以下维度观察:
- 引用量:原始论文 [Clark et al., 2018] 被引用超过 2,000 次 [Google Scholar 粗略估计,截至 2024 年,需实时确认]。
- 被纳入主流评测套件:HELM、Open LLM Leaderboard(已更新换代)、Eleuther LM Eval Harness 等。
- 模型发布必引用:几乎所有主流 LLM 的技术报告(GPT-4、PaLM、LLaMA、Claude 等)都会报告 ARC 相关得分。
- 评测频率:随着基准接近饱和,新模型在 ARC-Challenge 上的得分差异越来越小,边际信息价值递减。
趋势判断
- ARC-Challenge 正从”核心区分指标”向”基础体检指标”转变。
- 新一代推理基准(MATH、GPQA、SWE-bench、ARC-AGI、HumanEval)正在分流 ARC 的注意力。
- 但 ARC 作为”科学常识推理”维度的标准化度量,短期内不会被完全替代。
代表公司与资本映射
直接相关方
| 角色 | 公司/机构 | 关系 |
|---|---|---|
| 数据集创建方 | Allen Institute for AI (AI2) | 非营利研究机构,Paul Allen 创立 |
| 模型评测方 | OpenAI | GPT-4 技术报告中报告 ARC-Challenge 得分 |
| 模型评测方 | Meta AI | LLaMA 系列技术报告中包含 ARC 得分 |
| 模型评测方 | Anthropic | Claude 系列技术报告中包含 ARC 得分 |
| 评测平台方 | Hugging Face | Open LLM Leaderboard 曾纳入 ARC |
| 评测平台方 | Stanford CRFM | HELM 框架纳入 ARC |
资本映射角度
ARC 本身不是投资标的,但它是判断 AI 模型能力的一根坐标轴:
- 某公司在 ARC-Challenge 上的得分变化,可作为其推理能力进步的代理指标之一。
- 当一个新模型在 ARC-Challenge 上得分大幅提升,通常意味着其常识推理能力有实质进展(需排除数据污染)。
- 当 ARC-Challenge 被”刷爆”,说明业界推理能力门槛提升,竞争转向更难基准。
投资逻辑
ARC 对 AI 投资分析的价值
1. 作为模型能力评估的”体检单”之一
- 如果一家 AI 公司发布的模型在 ARC-Challenge 上得分显著低于同规模竞品,说明其推理能力可能是短板,需追问原因。
- 反之,得分领先但其他基准(如 MATH、代码)落后,则说明强项在常识推理。
2. ARC 饱和本身是一个投资信号
- ARC-Challenge 接近饱和意味着:科学常识推理不再是 LLM 能力的主要瓶颈。
- 投资关注点应转向尚未饱和的维度:数学推理(MATH)、代码生成(SWE-bench)、专家级科学推理(GPQA)、抽象推理(ARC-AGI)。
3. Benchmark 轮替周期
- 基准从发布 → 被刷爆 → 被替代的周期约为 3-5 年。ARC(2018→2023 饱和)符合这一节奏。
- 分析模型能力演进时,应继续跟踪下一个”ARC”是什么——目前看,GPQA 和 ARC-AGI 是候选。
风险提示
- 数据污染风险:部分模型可能在训练过程中见过 ARC 原题或高度相似的题目,导致得分虚高。这是所有公开基准的共性问题。
- Benchmark ≠ 实际产品价值:ARC 得分高不代表模型在实际应用场景中表现好,反之亦然。
常见误读纠偏
误读 1:“ARC 是测试 AGI 的基准”
纠偏:ARC(AI2 Reasoning Challenge)是一套小学科学多选题,测试的是科学常识推理能力,而非 AGI。与”AGI”相关的是 ARC-AGI(François Chollet 的抽象推理语料库),二者名称相似但完全不同。很多讨论中将两者混为一谈,是严重的概念错误。
误读 2:“GPT-4 在 ARC 上得 96%,说明它达到了 96% 的人类推理能力”
纠偏:
- 96% 的基线不明确——是零样本还是少样本?是否包含检索增强?
- 人类在 ARC-Challenge 上的准确率并非 100%(据报道非专家约 85% [AI2 估计]),但人类的认知过程(推理链、因果建模)与 LLM 的统计模式匹配在机制层面根本不同。
- 高分不等于”类人推理”,可能包含了训练数据中的模式记忆。
误读 3:“ARC-Challenge 的题目对人类很简单,只是对 AI 难”
纠偏:ARC-Challenge 中的部分题目对非专业成年人也有一定难度,尤其是在物理和地球科学领域。其难度梯度是面向 K-12 学生的,但筛选标准是”简单检索法答不对”,而非”人类答不对”。
误读 4:“公开基准不受数据污染影响”
纠偏:ARC 数据集在互联网上公开多年,题干和答案均可通过搜索引擎获取。大模型的预训练语料中是否包含 ARC 原题,是一个几乎无法完全排除的可能性。多家机构已开始研究污染检测方法,但尚无行业统一标准。
学习路径
Level 1: 入门(30 分钟)
- 阅读 AI2 的 ARC 官方页面:
allenai.org/data/arc - 浏览 10-20 道 Challenge 题目,直觉感受难度
- 了解 Easy vs Challenge 的分层逻辑
Level 2: 理解(2 小时)
- 阅读原始论文:Clark et al. (2018), “Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge”
- 了解论文中对各类 baseline 方法的分析
- 在 Hugging Face 上找到 ARC 数据集,观察数据结构
Level 3: 实践(1 天)
- 使用 Hugging Face
evaluate库对某个开源 LLM 进行 ARC 评测 - 尝试不同 prompting 策略(零样本 vs 少样本 vs CoT)
- 对比自己的结果与 leaderboard 上的结果
Level 4: 深度研究
- 阅读 ARISTO 系统论文,了解 AI2 如何通过多模型集成 + 检索 + 推理链攻克 ARC
- 研究数据污染检测方法
- 对比 ARC 与 ARC-AGI、GPQA 的设计理念差异
- 思考:如果要设计一个”后 ARC 时代的常识推理基准”,应该怎么做?
一句话总结
ARC-Challenge 是 AI 常识推理能力的”标准化体检单”——它在 2018 年揭示了模型只会”关键词匹配”的短板,又在 2023 年被 GPT-4 基本”刷爆”,标志性的从”难题”变成”基线”,其生命周期本身就是 AI 推理能力快速进步的缩影。
延伸阅读与来源
核心文献
- Clark, P. et al. (2018). “Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge.” arXiv:1803.05457
- Clark, P. et al. (2020). “From ‘F’ to ‘A’ on the N.Y. Regents Science Exams: An Overview of the ARISTO Project.” arXiv:1909.01958
- Khashabi, D. et al. (2020). “UnifiedQA: Crossing Format Boundaries with a Single QA System.” arXiv:2005.00700
模型技术报告
- OpenAI (2023). “GPT-4 Technical Report.” — ARC-Challenge 得分引用
- Meta AI (2023). “LLaMA: Open and Efficient Foundation Language Models.” — ARC 得分引用
评测框架
- Liang, P. et al. (2022). “Holistic Evaluation of Language Models (HELM).”
- Gao, L. et al. (2023). “A framework for few-shot language model evaluation.” (Eleuther LM Evaluation Harness)
补充
- Chollet, F. (2019). “On the Measure of Intelligence.” — ARC-AGI 提出 [需与 ARC 区分]
- Hugging Face Open LLM Leaderboard — 可实时查看最新模型 ARC 得分
数据准确性声明:本文中所有具体数字均标注来源口径。无确切来源的数值已用区间或定性表述替代。如需用于投资决策,请以各厂商官方技术报告中的原始数据为准。