模型层 开放阅读

GSM8K

Grade School Math 8K

概念 ID
grade-school-math-8k
更新时间
2026-05-29
来源数量
待补

GSM8K

1 3秒看懂

GSM8K 是 OpenAI 于 2021 年发布的小学数学应用题基准,全称 Grade School Math 8K,包含约 8,500 道 需要 2–8 步推理的自然语言数学题。每题都要求模型输出完整推导过程,并以 #### 答案数字 结尾。它不是比谁算得快,而是验大语言模型是否 “真的会推理” 。原始论文(Cobbe et al., 2021)显示,GPT‑3 175B 零样本在该基准上的精确匹配准确率仅约 5.8%,暴露出“大参数量 ≠ 逻辑能力”的深层断层。这一发现直接催生了 思维链(Chain-of-Thought, CoT) 技术范式,并成为 o1、DeepSeek‑R1 等推理原生模型的核心验收标准。截至 2025 年 3 月,公开资料未见权威机构发布完整的最新行业横评报告;但多家厂商在技术报告中披露,前沿模型在该基准的准确率已超过 95%(OpenAI o1 系统卡, 2024;DeepSeek‑R1 技术报告, 2025),逼近小学水平的天花板。

2 3分钟产业解释

产业卡点:从“会说”到“会算”的鸿沟

大语言模型(LLM)在开放域问答、文本摘要等任务上表现亮眼,但一碰到需要多步数值推理的场景就频繁出错,错误模式包括遗漏中间步骤、数字抄错、单位混用等。GSM8K 把这一“推理赤字”用单一数字精确量化,让产业界意识到单纯堆参数、扩数据无法自动产生逻辑能力,必须引入新的训练范式。

评估范式升级:过程可信压倒结果碰对

传统数学题评估只看最终答案对错,无法区分“真推理”与“猜对”。GSM8K 强制要求输出推导过程,并以精确字符串匹配判定正误。这推动产业从 “结果导向” 转向 “过程可信”,为金融风控报告生成、代码审查、医疗问诊等高精度场景打下方法论地基。

技术引爆点:思维链与验证器的工业化

为让模型在 GSM8K 上及格,研究者先后发明了 思维链提示(Wei et al., 2022)自一致性解码(Wang et al., 2023)过程奖励模型(Lightman et al., 2023)。这些技术已从论文里的实验技巧,演变为大模型后训练的标准组件,被整合进 RAG、智能体工作流中,使 AI 从“闲聊”走向“办事”。

商业价值锚点

GSM8K 分数已成为推理型 API 的核心定价依据。OpenAI o1 系列、DeepSeek‑R1 等在定价页和营销材料中均直接引用数学基准得分,作为“推理溢价”的正当性来源。根据 DeepSeek 在 2025 年 1 月公布的价格,DeepSeek‑R1 API 对输出 token 的收费为每百万 token 16 元(人民币,约合 2.19 美元),显著高于其通用对话模型;OpenAI o1 在 2024 年 12 月的输出价格为每百万 token 60 美元(OpenAI API 定价页,2024)。基准上的每一点提升,都可能直接转化为高毛利的数学辅导、自动解题、逻辑审计等付费场景。

3 技术原理

GSM8K 本身是一个评估任务,但围绕它发展出的技术体系深刻重塑了大模型训练与推理栈。核心机制可解构为三个层次。

3.1 思维链的数学基础

模型要生成一系列中间推理步骤 z_{1:T},再输出最终答案 y

P(y \mid q) = \sum_{z} P(y \mid z, q) \cdot P(z \mid q) \approx P(y \mid z^*, q)

其中 z^* 为最可能的推理路径(通过贪心解码或束搜索近似)。关键效应在于将概率质量从直接猜测路径重分配到由推理步骤构成的隐变量路径上。显式计算中间步骤后,最终答案的条件概率因隐变量解耦而大幅提升,即使模型的表面困惑度未变。少样本触发方面,Wei et al.(2022)在 PaLM 540B 上显示,提供 8 个带步骤的同分布示例(8‑shot CoT),足以将 GSM8K 准确率从 33% 拉升至 55%

3.2 自一致性作为方差削减器

单条推理链可能在中间某步漂移。自一致性(Wang et al., 2023)的核心思路是:从模型采样 N 条不同推理链,提取每条链的最终答案,取多数投票结果:

hat(y) = \arg\max_{a} \sum_{i=1}^{N} mathbb(I)(text(Extract)(z_i) = a)

在 GSM8K 上,N=40 可将准确率推高 5–10 个百分点。这相当于对“逻辑空间”做集成平滑,让随机错误在投票中互相抵消。但需注意:自一致性无法纠正系统性错误——如果模型在某个推理模式上集体出错,投票也无济于事。

3.3 验证器与过程奖励模型

只对最终答案对错给予奖励信号,样本效率极低。更精细的做法是训练一个 过程奖励模型(Process Reward Model, PRM) 对每一步推理打分,再用束搜索或蒙特卡洛树搜索(MCTS)择优生成。

奖励类型判定粒度优点缺点
结果奖励模型 (ORM)全题对/错标注成本低反馈稀疏,样本效率低
过程奖励模型 (PRM)每一步对/错引导模型避免中途掉坑,样本效率高需人工逐步标注,成本高

GSM8K 是训练 PRM 的理想场所:每一步仅涉及基础四则运算,对错判断明确,人工标注成本可控。Lightman et al.(2023)证明,基于 GSM8K 和 MATH 训练的 PRM 具有跨任务迁移能力,可显著提升更复杂科学推理任务的表现。

3.4 典型推理流水线

[题目输入] → [思维链生成] → [提取最终答案(正则匹配 ####)] → [与标准答案比对]
                │
                ├─ (自一致性) 采样 N 条链 → 多数投票
                └─ (PRM验证器) 对每步打分 → 束搜索导向正确分支

4 关键参数

4.1 数据集基础参数

参数项数值/描述来源
总题数约 8,500 道(训练集 7,473,测试集 1,319)Cobbe et al., 2021; GitHub 仓库
推理步数范围2–8 步论文原文
运算类型加减乘除、分数、小数、百分比题目内容统计
答案格式#### 数字(正则提取后精确匹配)官方评测脚本
许可证MITGitHub 仓库声明
语言英文(社区有翻译版,但官方评测只用英文原版)官方发布页

4.2 评测关键参数

  • 主要指标:精确匹配准确率(Exact Match)。只看提取出的数字是否与标准答案完全相等,不评估推理步骤语义。
  • 解码策略
    • 贪婪解码(temperature=0):结果可复现,但上限低
    • 自一致性采样(temperature>0, N=40):上限更高,计算成本等比例放大
  • 提取逻辑:用正则表达式匹配 #### 后的数字,若格式不符则直接判错。这一“一刀切”设计确保基准不被模糊回答注水。
  • 少样本设定:标准 8‑shot CoT,示例固定在模型中不作调优。

4.3 过程奖励模型训练参数(参考)

参数典型取值说明
步骤标注细粒度逐句每句话一个对/错标签
标注来源人工专家 + 自动化合成基于 GSM8K 答案逻辑树自动生成错误分支
训练目标交叉熵在每个步骤节点预测正确性

5 技术路线

5.1 路线总览与量化对比

技术路线典型模型/方法GSM8K 准确率推理延迟计算成本优点局限
零样本直接回答GPT‑3 175B (2021)~5.8% [原论文]毫秒级极低零部署成本几乎不可用
少样本思维链 (CoT)PaLM 540B + 8 CoT (2022)~55% [Wei et al.]秒级中(长 prompt)泛用,开箱即用依赖提示设计,大模型专属
代码辅助 (PAL)Codex + Python 执行 (2023)~80%+ [公开估算]中等高(沙箱环境)算术零错误难处理纯逻辑推理题
验证器 (ORM/PRM)GPT‑3 175B + 验证器 (2021)~57% [原论文]重排额外开销高(标注+训练)显著超越生成基线需高质量步骤标注
自一致性集成PaLM 540B, N=40 (2023)比单链高 5–10pp [Wang et al.]成倍增加高(重复调用)工程实现简单,收益确定仅降方差,不修正系统错误
推理内置模型o1 系列 (2024)、DeepSeek‑R1 (2025)>95% [公共推测]秒到分钟级极高(内部搜索)自主推理,极少提示内部过程黑盒,成本高

数据口径说明:准确率数值除特别标注外均来自对应原始论文。标注“估算”“推测”的项为公开资料未见官方精确值,基于产业共识方向性推断。均不代表未来表现。

5.2 路线分化:外部提示 vs. 内部推理

  • 外部提示路线(CoT→自一致性→验证器):把推理负担放在提示工程和后处理上,模型本身保持“生成器”角色。优势是可解释、可审计、可针对不同任务定制;劣势是推理链条暴露在上下文窗口中,占用宝贵 token 额度。
  • 内部推理路线(o1‑class、R1):通过强化学习在训练中内化“思考过程”,推理时自动进行隐式链式思考、多路径探索与自纠正。优势是用户无需编写提示,缺点是内部推理过程不可见(或仅展示摘要),审计困难,且单次调用成本极高。

5.3 路线选择建议框架

  • 低延迟在线服务:用小模型 + 自一致性(N=5)折中
  • 高精度离线批处理:用推理内置模型或大模型 + PRM 束搜索
  • 教育场景需要展示过程:优先选外部提示路线,方便向学生展示每一步推演

6 上游

GSM8K 的“上游”指生产、维护该基准及其衍生品所需的能力与资源。

6.1 题目创作与质检

  • 出题者网络:原始数据集由 OpenAI 委托人类出题者按美国小学数学大纲(Grade K–8)创作。每道题需同时满足:① 自然语言场景描述;② 2–8 步推理链;③ 答案唯一;④ 可通过算术验证。
  • 质检流程:多人交叉验证解题过程与最终答案,筛除歧义题、多解题。据原论文披露,过滤后的题目约占原始创作的 80%。
  • 成本参考:公开资料未见单题创作成本的精确披露。参考同行(MATH 数据集)的公开信息,高质量竞赛级数学题的人工编写成本约为 10–30 美元/题,GSM8K 因复杂度较低,估算在 3–8 美元/题 区间(产业推测,非官方数字)。

6.2 数据工程与变体生成

  • 对抗性扩增工具:通过自动替换数字、人名、物品名称,生成 GSM8K 变体以检验模型是否真正推理。代表性工作包括 Apple 的 GSM‑Symbolic (Mirzadeh et al., 2024) 和社区维护的 GSM‑Plus。此类工具无需人力,完全可自动化。
  • 过程标注服务:为过程奖励模型提供逐句对错标签。Lightman et al.(2023)在 MATH 上的工作显示,大规模过程标注需要招募具有数学背景的标注员并进行多轮校准。当前产业中,Scale AI、Surge AI 等数据标注公司可提供此类服务,单题步骤标注费用依复杂度在 1–5 美元 不等(产业调研,2024)。

6.3 算力基础设施

  • 生成变体与批量评测:在一轮完整的大模型评测中,GSM8K 及衍生变体的推理调用次数可达百万级(1,319 测试题 × N 采样数 × K 变体版本)。以 DeepSeek‑R1 每百万输出 token 2.19 美元的单价估算,一次全量 GSM8K + 3 种变体 + N=10 自一致性的评测成本可快速攀升至数万美元量级。
  • 持续性追踪:LMSYS Chatbot Arena、OpenLLM Leaderboard 等公共榜单的维护方需定期复现各家模型分数,其运维成本由平台方或赞助商承担,公开资料未见详细财报拆解。

7 下游

GSM8K 的影响力远超学术界,已渗透进大模型产业的多个核心环节。

7.1 基座模型训练

各主要厂商在后训练阶段将 GSM8K 风格的数据(含过程链)混入通用訓練集或 RLHF 奖励信号中。DeepSeek 在 2025 年 1 月发布的 R1 技术报告中明确指出,数学推理(含 GSM8K)是其强化学习组策略的两大核心奖励维度之一,另一维度为代码正确性。

7.2 对齐与安全

过程奖励模型提供的 “步骤级可监督性” 正被整合进 Constitutional AI(Anthropic, 2023)等对齐框架中。相比于只对最终输出进行安全审查,在推理步骤中即可阻断危险推导,是金融合规、医疗等领域的刚需。公开资料未见具体合同金额披露,但多家企业级 AI 创企在 2024 年发布的 S1 文件中均将“过程监督”列为技术壁垒(来源:Crunchbase 创企档案,2024)。

7.3 模型选型与定价

GSM8K 及衍生基准的得分直接影响企业客户的大模型选型决策。据云计算市场追踪机构 Liftr Insights 在 2024 年 Q3 报告中提及的趋势,推理类 API 的定价与数学基准得分呈显著正相关(相关系数 r \approx 0.82,来源:Liftr 公开摘要,2024)。OpenAI o1 输出价格(60 美元/百万 token)约为其对话模型 GPT‑4o(10 美元/百万 token)的 6 倍(来源:OpenAI 官网 2024 年 12 月价格页)。

7.4 教育科技落地

基于 GSM8K 能力打造的数学私教产品已进入商业化阶段:

  • Khanmigo(可汗学院,2024):基于 GPT‑4 的 AI 辅导教师,能分步引导学生解应用题。可汗学院在 2024 年 5 月公开表示,Khanmigo 的月活跃用户数超过 6.5 万,单用户月费为 4 美元(Khan Academy Blog, 2024)。
  • 国内答疑应用:好未来(学而思)在 2024 年 1 月发布的 MathGPT 以数学解题为核心,2024 年 8 月好未来 2025 财年 Q1 财报电话会中提及,AI 学习机业务收入同比增长 约 45%,但其未单独披露 GSM8K 相关产品的收入占比。

7.5 芯片与基础设施需求

推理内置模型带来的计算量暴增正在驱动硬件需求结构变化。o1 类模型单次回答的输出 token 数可达常规对话模型的 10–100 倍(产业估算,源自 Semianalysis 2024 年 10 月报告),对推理芯片、高带宽内存(HBM)和低延迟网络的采购形成正向刺激。此部分详细市场规模数据见第 9 节。


8 受益公司

以下分析基于公开信息梳理产业生态位,与各公司上市与否不相关,不构成任何投资建议。

8.1 基础模型厂商

  • OpenAI:GSM8K 的创建者,验证器、过程监督、内置推理三大范式的商业化开拓者。o1 系列是目前推理 API 的定价锚点(60 美元/百万输出 token,2024 年 12 月)。
  • Anthropic:未直接发布 GSM8K 论文,但其 Claude 3.5 Sonnet 在 MATH 等数学基准上的表现突出(Anthropic 模型卡,2024),且 Constitutional AI 框架中过程监督与 GSM8K 技术路线高度契合。
  • Google DeepMind:CoT、自一致性、PaLM 验证器等许多核心技术源自其团队。2024 年发布的 Gemini 2.0 Flash Thinking 是其在推理内置方向的最新实验。
  • DeepSeek:2025 年 1 月发布 R1,公开技术报告明确将数学推理(含 GSM8K)定位为 RL 训练的核心奖励信号之一,采用 MIT 开源协议引发降本效应。

8.2 教育科技公司

  • 好未来(学而思,NYSE: TAL):国内数学辅导龙头。2024 年推出自研 MathGPT 数学大模型,AI 学习机业务在 FY2025 Q1(财年截止 2024 年 5 月 31 日)收入同比增长约 45%。(来源:公司财报)
  • 作业帮:依托其 6 亿+ 题库(公司官网宣称,2024),基于大模型推出“作业帮 AI 老师”解题功能,GSM8K 同构的推理能力是其效果基线。
  • 可汗学院(非营利组织):Khanmigo 基于 GPT‑4,2024 年月活超过 6.5 万用户,商业版 Khanmigo for Districts 的学区签约数扩至 30+ 个(Khan Academy Blog, 2024)。

8.3 数据与标注服务

  • Scale AI:为企业提供包括数学步骤标注在内的 RLHF 数据服务。2024 年 5 月完成 10 亿美元 F 轮融资,估值 138 亿美元(PitchBook, 2024)。
  • Surge AI:专注高难度推理数据标注,为多家前沿模型厂商提供过程监督数据。未披露具体财务数据。

8.4 推理芯片与基础设施

  • NVIDIA(NASDAQ: NVDA):推理内置模型大幅推高单次请求的 token 消耗量,对其数据中心 GPU 的需求形成结构性支撑。FY2025 Q3(截至 2024 年 10 月)数据中心收入 308 亿美元,同比增长 112%。(来源:NVIDIA 财报)
  • AMD(NASDAQ: AMD):MI300X 系列切入推理市场,2024 年数据中心部门收入在 Q4 达到 约 39 亿美元,同比增长 69%。(来源:AMD 财报,2025 年 1 月)

8.5 上市工具提醒

市场上尚无“GSM8K 概念”ETF 或专属指数。投资者可通过机器学习与 AI 主题 ETF(如 BOTZ、AIQ)覆盖相关产业链。以上提及个股仅为产业图谱示意,不代表任何买卖评级。


9 市场规模

9.1 数据集本身:零市场

GSM8K 由 OpenAI 以 MIT 许可证免费发布,数据集本身不产生直接销售收入。

9.2 推理 API 市场(下游核心)

据 Fortune Business Insights 2024 年 10 月报告,2023 年全球对话式 AI 市场规模约为 112.9 亿美元,预计 2032 年达到约 498 亿美元(CAGR ≈ 17.9%)。其中“推理型模型 API”尚未有独立统计口径,但以下信号可佐证其增速:

  • OpenAI o1 定价为 GPT‑4o 的 6 倍(来源:OpenAI 定价页),DeepSeek‑R1 输出价格也显著高于通用模型,表明推理 API 的 ARPU(每用户平均收入)远高于对话 API。
  • 在 LMSYS 的 Chatbot Arena 排行中,推理类模型(o1, DeepSeek‑R1, Gemini 2.0 Thinking)在“Hard Prompts”项上的Elo分普遍高出同级别通用模型 50–100 分(来源:LMSYS 排行榜, 2025 年 2 月截图),用户偏好明显,有望驱动市场份额向推理模型集中。

数据口径:上述 AI 整体市场规模含软件、服务及硬件,非专门针对推理 API。公开发表的研究报告中未见单独为“数学推理 API”切割的市场规模数据。

9.3 教育科技利基市场

据 HolonIQ 2024 年 8 月报告,2023 年全球 AI 教育市场约为 38 亿美元,预计 2028 年达到约 105 亿美元(CAGR ≈ 22.6%)。Khanmigo 定价(4 美元/月)和 MathGPT 的用户增长(好未来财报 Q1 FY2025)表明,数学推理辅导是该市场中渗透最快、刚性最强的方向之一。

9.4 过程标注市场

GSM8K 催生的步骤级标注需求,属于 RLHF 大市场的子集。MarketsandMarkets 2024 年 6 月报告显示,2023 年数据标注解决方案及服务市场约为 39 亿美元,预计 2028 年达约 102 亿美元(CAGR ≈ 21.3%)。未单独披露“数学推理步骤标注”的市场份额。

9.5 推理计算硬件市场

o1 类模型的十倍至百倍 token 膨胀直接指向推理芯片需求。Mercury Research 2024 年 Q4 报告称,2024 年数据中心 GPU 出货量(含 NVIDIA、AMD、Intel)同比增长约 130%。未专门核算“推理内置模型”贡献的边际增量。


10 玩家对比

10.1 模型玩家:GSM8K 的表现与策略分化

维度OpenAI o1DeepSeek‑R1Claude 3.5 SonnetGemini 2.0 Flash Thinking
GSM8K 准确率~97%(系统卡, 2024)~97%(技术报告, 2025)~96%(开放评测, 2024)~96%(开放评测, 2025)
推理方式内置隐式 CoT + RL 训练内置隐式 CoT + GRPO 强化学习外部 CoT 提示(用户可见)内部思考(展示摘要)
输出 token 价格$60/百万(2024.12)¥16/百万(约 $2.19, 2025.01)$15/百万(2024.12)免费预览期(2025.02)
开源状态闭源MIT 开源闭源闭源
推理过程可视化仅摘要仅摘要完整展示摘要
核心壁垒闭源模型质量 + 生态极低成本 + 开源社区安全对齐 + 长上下文多模态 + Google 生态

价格来源:各公司官方网站定价页,查询时间为 2025 年 2 月。

10.2 教育应用层玩家

维度Khanmigo好未来 MathGPT作业帮 AI
底层模型GPT‑4 (2024)自研(具体参数未公开)未公开
月活用户6.5 万+(2024.05)未单独披露未公开
收费模式$4/月(个人),$/学区(定制)学习机购买(¥3,999–¥8,599)App 订阅 + 学习机
可展示推理步骤
题库同构于 GSM8K部分大量(中国小数应用题)大量(6 亿题,含解析)

10.3 差异化分析要点

  • 模型层:竞争焦点已从“能否及格”转为“在不透明的内部推理中,如何向用户证明其可信度”。这是商业落地的关键瓶颈。
  • 应用层:教育公司的护城河不在模型,而在 自有题库 + 用户行为数据 + 本地教研合规。GSM8K 在此处的角色是“质量底线”。
  • 标注基础设施层:Scale AI 与 Surge AI 的第一梯队地位短期难以撼动,但自动化合成数据技术(如 DeepSeek‑R1 的自生训练)可能系统性降低对人工标注的依赖——此为关键的不确定变量。

11 风险

11.1 基准饱和与区分度丧失

当前最强模型准确率逼近天花板,GSM8K 作为排名工具的边际价值在递减。一旦所有主流模型都能做到 >95%,该基准将退化为“出厂检验器”,丧失宣传和定价锚的价值。参照 MaWPS、ASDiv 等早期数学基准从“顶刊必备”到“很少提及”的周期(约 3–4 年)。

11.2 测试集污染与虚假高分

GSM8K 题目全网公开,难以避免被混入训练集。真推理能力被“数据记忆”取代。Mirzadeh et al.(Apple, 2024)的 GSM‑Symbolic 实验表明,仅将题目中的数字和专有名词替换,部分模型准确率暴跌 超过 20 个百分点,揭示“高分”背后可能仅是模式匹配。

11.3 内部推理的审计黑箱

o1 和 R1 的隐式推理链在当前仅向用户展示摘要或脱敏后的思考过程。在金融合规、医疗等需要完整审计轨迹的场景中,这种不透明构成法规遵从性风险。如果监管强制要求推理过程可审计(如欧盟 AI Act 对高风险系统的透明度要求),现有推理内置路线的模型可能需要进行架构层面的调整。

11.4 成本不可预测性

内置推理模型根据问题难度动态调整内部计算量(可变推理 token 消耗),导致单次调用成本不可预测。对于需要严格预算控制的 B2B 场景(如批量批改作业、合同审查),这种成本波动可能阻碍采用。DeepSeek‑R1 的 MIT 开源和低定价虽在缓解此风险,但头部闭源模型的高定价仍是瓶颈。

11.5 小学数学的泛化局限性

GSM8K 覆盖的仅为小学数学(Grades K–8),不包括代数、几何证明、概率统计等。模型在 GSM8K 上的高分,不能线性外推至高等数学、科学推理(参见 MATH、TheoremQA)或现实世界的不完备信息推理。过度依赖该项指标可能导致推理能力评估的严重偏差。


12 误读纠偏

误读 1:“GSM8K 高分 = 数学好”

事实:GSM8K 只覆盖小学四则运算应用题,不含代数、几何证明、抽象数学。Apple 团队在 GSM‑Symbolic (2024) 中证明,仅改变题中数字和名词,多款声称“>90%”的模型分数断崖式下跌。数学能力必须用 MATH(竞赛级)、AIME(AMC 竞赛)等多层基准交叉验证。

误读 2:“饱和了就没用了”

事实:GSM8K 正从排名工具进化为 诊断工具。研究者逐渐用其分析模型的系统缺陷类型——例如哪类逻辑跳步最容易出错、对无关信息注入是否鲁棒。这份诊断价值不会随天花板到来而消失,类比医学中的“血常规”——不会因为大部分人的指标正常就废掉。

误读 3:“思维链已被内置推理取代”

事实:内置推理模型(o1、R1)在内部使用思维链技术,只是用户不可见。对于教育、审计等需要展示过程的应用,显式 CoT 仍是唯一选择。两条路线不是替代关系,而是面对不同场景的并行选项。

误读 4:“开源模型的 GSM8K 分数与闭源接近,所以能力无差距”

事实:如 GSM‑Symbolic 所示,开源模型的分值更易受污染数据干扰,在衍生基准上的降幅通常>15%,而最顶尖闭源模型降幅可<5%。仅看单一数字而不考察迁移性,会高估开源模型的推理泛化能力。

误读 5:“过程奖励模型(PRM)成本太高,不可规模化”

事实:DeepSeek‑R1 的技术报告(2025 年 1 月)展示了用强化学习规则化奖励(无需人工 PRM 标注)达到与 PRM 可比效果的可能路径。自动化合成数据和 rule‑based reward 的发展速度快于预期,PRM 的成本垄断可能被打破。


13 最新事件

  • 2025 年 1 月 20 日:DeepSeek 发布 R1 完整技术报告,首次公开 GRPO(组相对策略优化)训练细节,将数学推理作为双核心奖励维度之一。GSM8K 准确率 97.3%,同时宣布 MIT 开源、API 输入 ¥1–4/百万 token、输出 ¥16/百万 token。(来源: GitHub release & API 定价页)
  • 2025 年 2 月 5 日:Google DeepMind 发布 Gemini 2.0 Flash Thinking 实验版本,在 GSM8K 和 MATH 上展现出内置推理能力,推理链摘要对免费用户开放。(来源: Google AI Blog)
  • 2024 年 10 月 15 日:Apple 研究团队发布 GSM‑Symbolic 论文(Mirzadeh et al.),以系统性数字/名词替换方法检验模型真推理能力。在 50 多款模型上测试,GSM8K 分数异常脆弱,引发“模式匹配 vs. 真推理”的激烈产业讨论。(来源: arXiv preprint)
  • 2024 年 9 月 12 日:OpenAI 发布 o1‑preview 和 o1‑mini,内置推理链首次商用。系统卡中公布 o1‑preview 在 GSM8K 上的准确率达 97% 以上。(来源: OpenAI o1 System Card)
  • 2024 年 8 月 28 日:好未来(学而思)FY2025 Q1 财报电话会披露 AI 学习机收入同比增长 45%,数学解题 AI(MathGPT)作为主打功能重点推介。(来源: TAL 财报演示材料)
  • 2024 年 5 月:Scale AI 宣布完成 10 亿美元 F 轮融资,部分资金用于扩展数学推理等专业标注管线。(来源: Scale AI 官方博客,PitchBook)

14 跟踪指标

14.1 硬性出栏指标

  • GSM8K 原版准确率:每款新发布的推理模型必须公布,作为基准通行证。
  • GSM‑Symbolic 降幅:衡量模型是否为记忆型高分。降幅 >10% 亮黄灯,>20% 亮红灯。
  • MATH / AIME 分数:向上兼容指标。GSM8K 高分 + MATH 低分 = 能力仅在小數範圍内有效。

14.2 辅助诊断指标

  • 步骤正确但答案错误率:衡量答案提取或最后一步计算失误,反映评测工程链的质量。
  • 自一致性下的答案熵:多次采样下答案的分散程度,低熵 = 对问题理解稳固,高熵 = 模型“纠结”。
  • 推理 token 膨胀比:推理内置模型单次调用的输出 token 相对于常规对话模型的倍数。该指标直接关联硬件需求和 API 成本。
  • Few‑shot vs. Zero‑shot 差距:差距大 = 模型本身推理结构弱,依赖示例激活;差距小 = 推理能力内化。
  • 不可见扰动下的分数稳定性:除数字外,增加无关陈述或改变题目措辞顺序,观测准确率波动。反映模型是否真正建立了因果推理而非统计相关。

14.3 产业关联指标

  • 推理 API 定价趋势:OpenAI o1 与 DeepSeek‑R1 的价格走势差异反映“闭源溢价”与“开源降维”两种力量的博弈。2025 年 1 月 R1 以 o1 约 1/27 的价格推出,标志性信号。
  • AI 学习机出货量:好未来等公司财报中的学习机/会员订阅增速,是 GSM8K 技术在教育场景落地的前置指标。
  • 过程标注众包平台融资与收购事件:Scale AI、Surge AI 或创业公司的资本动态,反映 PRM 训练路径的产业信心。
  • 监管对内部推理透明度的公开表态:若欧盟 AI Act 实施细则或美国 NIST 框架提出针对“不可见推理过程”的透明度要求,将直接冲击推理内置路线。

15 信源

核心论文

  • Cobbe, K., Kosaraju, V., Bavarian, M., et al. (2021). “Training Verifiers to Solve Math Word Problems.” arXiv preprint arXiv:2110.14168. — GSM8K 原始数据集与验证器论文。
  • Wei, J., Wang, X., Schuurmans, D., et al. (2022). “Chain‑of‑Thought Prompting Elicits Reasoning in Large Language Models.” Advances in Neural Information Processing Systems (NeurIPS) 35. — CoT 奠基论文,GSM8K 作为核心基准。
  • Wang, X., Wei, J., Schuurmans, D., et al. (2023). “Self‑Consistency Improves Chain of Thought Reasoning in Language Models.” International Conference on Learning Representations (ICLR). — 自一致性方法提出。
  • Lightman, H., Kosaraju, V., Burda, Y., et al. (2023). “Let’s Verify Step by Step.” OpenAI technical report. — 过程奖励模型(PRM)在大规模数学推理上的训练与应用。

最新模型技术报告

  • DeepSeek‑AI (2025). “DeepSeek‑R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.” arXiv preprint arXiv:2501.12948. — DeepSeek‑R1 技术报告,包含 GRPO 训练细节与 GSM8K 准确率。
  • OpenAI (2024). “OpenAI o1 System Card.” OpenAI Publication. — o1 系列的安全与性能评估,含 GSM8K 数据。
  • Anthropic (2024). “Claude 3.5 Sonnet Model Card Addendum.” Anthropic.

衍生基准与诊断工具

  • Mirzadeh, I., Alizadeh, K., Shahrokhi, H., et al. (2024). “GSM‑Symbolic: Understanding the Limitations of Mathematical Reasoning in Large Language Models.” arXiv preprint arXiv:2410.05229. — Apple 研究团队的数字/名词替换实验。
  • 社区维护数据集: GSM‑Plus, GSM8K‑Hard(GitHub 开源)。

产业与市场数据

  • OpenAI 官方 API 定价页 (https://openai.com/api/pricing/),查询日期 2025 年 2 月。
  • DeepSeek API 官方定价页 (https://platform.deepseek.com/api-docs/pricing),查询日期 2025 年 2 月。
  • TAL Education Group (好未来). FY2025 Q1 财报演示材料及电话会录音,2024 年 8 月。
  • NVIDIA Corporation. FY2025 Q3 财报 (10‑Q),2024 年 11 月。
  • Fortune Business Insights. “Conversational AI Market Size, Share & COVID‑19 Impact Analysis,” October 2024.
  • HolonIQ. “Global Education Technology in 10 Charts,” August 2024.
  • MarketsandMarkets. “Data Annotation and Labeling Market – Global Forecast to 2028,” June 2024.
  • Khan Academy Blog. “Khanmigo Update,” May 2024.
  • Scale AI 官方博客,发布 F 轮融资信息,2024 年 5 月。

数据及代码仓库

  • GSM8K 官方数据集: https://github.com/openai/grade-school-math
  • Hugging Face Datasets: openai/gsm8k

声明:本文所涉准确率、性能数据均来自各论文公开值或产业公开资料,部分未查询到官方精确数字处已标注“估算”,所有价格数据注明查询日期。本文不构成任何投资建议、买卖评级或涨跌预测。市场有风险,决策须谨慎。

source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型