概念库 开放阅读

Grokking

概念库 · 开放阅读

概念 ID
grokking
更新时间
2026-06-03
来源数量
1

Grokking

1. 3 秒看懂

Grokking 指深度神经网络在长时间训练后,从单纯“记住”训练数据突然跃迁到“真正理解”数据规律的现象。模型在训练损失几乎不再下降的阶段后,测试准确率却出现戏剧性飙升,从一个“只会背答案”的系统变成一个“能推广到新题目”的系统。这颠覆了传统观念中“过拟合后性能即停滞”的认知,揭示出深度学习模型内部可能存在一种缓慢的、延迟发生的泛化机制。Grokking 不仅是学术好奇,它还直接影响模型训练预算、算力需求评估,以及对大模型“涌现”能力的理解,因此是连接算法研究与算力产业链的桥梁概念。

2. 3 分钟产业解释

Grokking 不是指普通意义上的“模型变好了”,而是一种高度特异的动力学现象:模型先在训练集上达到接近 100% 的准确率(完美记忆),但测试准确率长期停留在近乎随机猜测的水平;当所有人都以为模型已经过拟合、训练可以终止时,只要继续训练数倍甚至数十倍于原先的时间,测试准确率突然从 50% 左右跳跃到 95% 以上。这个概念最初由 OpenAI 研究团队在 2022 年发表的工作中系统描述,在小规模 Transformer 模型和算法类任务(如模运算)上被清晰展示。

对产业界而言,Grokking 意味着:

  • 训练终止策略需要重写:以往以验证损失不再改善为停步信号的方法,可能让模型永远停留于“记忆”阶段,而错过后面才到来的“理解”阶段。
  • 算力需求天花板被抬高:若要激发 Grokking,所需的训练计算量可能远高于当前标准估算,直接利好 AI 芯片、云计算和服务器产业链。
  • 产品部署与迭代节奏受影响:过早将只经历过短时间训练的模型推入生产环境,可能埋没模型的真实潜力;但等待一个无法精确预测的 Grokking 事件,又会带来工期与成本的双重不确定性。

因此,Grokking 既是推动算力需求长期增长的底层科学理由之一,也是训练工具链、监控平台和优化算法发力的新靶点。

3. 技术原理

3.1 现象定义与经典实验

Grokking 的经典观察场景来自 Power 等人(2022)的实验:用只有几层的 Transformer 模型学习模算术(如 a + b mod p)等算法任务。训练过程明显分成三个阶段:

  1. 记忆阶段(memorization):训练准确率很快达到 100%,模型能完美复现训练集中的所有答案;但测试准确率仅略高于随机猜测(例如对于二分类约 50%),说明模型并“不懂”背后规则,只是死记硬背。
  2. 停滞阶段(plateau):训练损失和训练准确率均已达到饱和,验证损失也长期不下降。按照传统早停策略,训练应该在此处终止。
  3. 泛化飞跃阶段(grokking):在训练步数继续增加 10 倍甚至 100 倍后,测试准确率突然从 50% 骤升至接近 100%,同时模型的内部表征发生质变,能够推广到未见过的运算组合。

3.2 延迟泛化的理论解释

围绕为什么泛化会延迟发生,学术界提出了多条解释线索,尚未完全统一:

  • 捷径特征与底层规则竞争假说:模型早期倾向于学习训练集中出现频率高、但无法泛化的“捷径特征”(如单个 token 的统计相关性),后期通过持续的梯度下降,那些能捕捉真实算法逻辑的“底层规则”特征在权重空间中缓慢壮大,最终取代捷径特征。
  • 权重范数最小化与隐式正则化:在采用权重衰减(weight decay)的条件下,即便训练损失已经很低,优化器仍会不断寻找范数更小、更平滑的解,这一过程天然有利于发现简洁、可泛化的函数。测试准确率的跳跃就对应着模型找到了一组具有更好泛化性质的权重配置。
  • 表示学习的几何相变:有研究将 Grokking 描述为表示空间中的“突发式解纠缠”——模型从混合记忆编码突然转变到结构化的、模块化的表征,这种转变在损失曲线上未必有明显标志,但可从内部激活和探针分类器上观察到。

3.3 与“涌现能力”的关系

Grokking 常被视作“涌现能力”在小规模任务上的对应物。大模型的涌现能力(如上下文学习、思维链推理)在参数规模或训练计算量越过某个临界值后突然显现,这与 Grokking 在给定模型下随训练时间发生突变的现象,在动力学层面具有一定同构性。两者的共同点在于:

  • 性能变化呈现非线性、阶梯式跳跃。
  • 仅通过观察训练损失无法预测突变发生的时机。
  • 与模型内部的表征相变或结构重组高度相关。

因此,研究 Grokking 成为理解大模型涌现能力的一个简化实验平台。


4. 关键参数

Grokking 的出现与强弱,受多项超参数与数据条件的共同影响。以下参数描述均以 2022 年 OpenAI Grokking 论文及后续复现工作中公开报道的实验设置为基准(除特别标注外,均源于学术论文报告,不涉及生产级大模型)。

  • 模型参数量:在小规模设置下(数十万到数百万参数)容易被观察到。参数量过小则容量不足以形成两阶段分离,过大则记忆与泛化阶段可能交汇,难以形成清晰跳跃。具体临界点高度依赖任务,公开文献中常见范围约为数万到一千万参数。
  • 训练步数:典型实验中,记忆饱和约在数百到数千步内完成,而 Grokking 发生在数万步乃至数十万步后,延迟比达 10 倍甚至更高。生产级大模型(千亿参数以上)的完整 Grokking 实验因成本高昂,公开系统数据仍然极为有限。
  • 优化器与学习率:使用 AdamW 并配合权重衰减(weight decay)是触发明显 Grokking 的前提之一;过大的学习率可能压制权重重组所需的精细梯度信号。
  • 权重衰减系数:这是影响 Grokking 延迟时间和突变陡峭程度的关键参数。衰减过弱,模型长期停留在记忆解;衰减过强,则可能抑制模型容量,使泛化飞跃无法出现。典型实验值在 10⁻³ 到 10⁻¹ 量级(来源:Power et al., 2022)。
  • 数据集规模与可压缩性:Grokking 更容易在具有高度结构化、低熵规则的小数据集上产生(如算法任务、合成符号推理任务)。对于大规模自然语言语料,是否存在同样的明确“跳跃”仍存争议。
  • 测试集划分方式:为了明确区分记忆与泛化,实验通常构建与训练样本不重叠但服从同一底层规则的系统性测试集(如保留所有包含特定组合的样本),而非简单随机划分。

数据缺口说明:在千亿参数大模型训练过程中,是否出现明确的 Grokking 阈值、对应的延迟倍数和权重衰减取值,公开渠道未见完整系统性披露。这与工业界训练成本极高、严格记录尚未公开等因素有关。


5. 技术路线

围绕如何理解、检测和工程化 Grokking,目前形成了若干技术路线,仍以学术探索为主,工具化程度低。

5.1 检测与监控路线

目标是在训练早期预判 Grokking 是否将发生,以及估计剩余时间。

  • 探针方法:在模型的中间层训练线性分类器,监测内部表示的结构化程度。出现表征结构的急剧变化,往往预示泛化飞跃。
  • 损失地貌分析(loss landscape):通过计算 Hessian 矩阵特征值谱或局部曲率,捕捉解空间从“尖锐极小值”向“平坦极小值”移动的趋势。
  • 泛化差异跟踪:追踪训练集准确率与合成或精心构造的泛化测试集准确率之间的差距,设定差距扩张又骤缩的预警线。

5.2 加速与诱导路线

研究如何通过训练算法和策略,使 Grokking 更早发生或更低成本触发。

  • 课程学习(curriculum learning):从简单的子任务开始逐步增加复杂度,有报道称这可以显著缩短甚至消除 Grokking 的停滞期。
  • 正则化策略调谐:动态调整权重衰减或采用锐度感知最小化(Sharpness-Aware Minimization, SAM)等现代优化技术,以直接引导模型走向平坦泛化解。
  • 蒸馏引导:将一个已经经历 Grokking 的教师模型的泛化表征,通过蒸馏注入学生模型,观察是否能绕过漫长的独立训练过程。初步学术实验显示有加速效果,但完全复现教师跳跃尚不成熟。
  • 模型架构调整:探索不同归纳偏置(如使用关系网络、图网络或更模块化的结构)是否天然更容易产生早期 Grokking;这一方向仍处于“观测—假设”阶段。

5.3 大规模验证与仿真路线

鉴于直接在大规模模型上测试 Grokking 成本极高,一些团队尝试:

  • 在小模型上搜索最适条件,建立缩放律(scaling law),外推至大模型。
  • 通过简化数学解析模型(如线性教师-学生网络)推导 Grokking 发生的相变边界,解释为何在特定超参数区间出现延迟泛化。

公开资料未见成熟的商业化工具或云服务专门提供“Grokking 检测与诱导”模块。


6. 上游

Grokking 对上游基础设施层的传导,核心在于它可能大幅提高“达到真实泛化水平所需的等效训练计算量”,这对硬件、云计算和能源环节均产生增量需求。

6.1 AI 训练芯片与服务器

  • GPU/NPU 需求结构变化:如果 Grokking 是各类模型泛化的必经阶段,则客户对单次训练任务的 GPU 时间需求将从“充分收敛即可”延伸为“等待泛化突变”。长周期训练对大显存、高互联带宽、高稳定性训练集群提出更高要求。
  • 芯片架构机遇:能高效执行长时间稳定训练(例如更优的散热、ECC 内存、更低的单位算力开销)的 AI 训练芯片将更具吸引力。
  • 代表性厂商:NVIDIA(H100/B100/B200 系列)、AMD(Instinct MI300 系列)、Intel Gaudi 系列;国内华为昇腾 910 系列、寒武纪思元等。但截至目前,各公司的对外产品路线图说明中,并未直接提及针对 Grokking 场景的专有优化。

6.2 云计算与算力服务

  • 训练即服务(TaaS):更长的训练周期可能推动用户从“购买硬件训练”转向“按 GPU 小时租用云资源”,利好大型公共云。
  • 弹性训练与容错:云平台需提供能在超长训练周期内实现故障恢复、断点续训、多代迭代管理的集群调度能力。相关需求将催生训练编排、监控和成本优化工具。
  • 主要云厂商:AWS(SageMaker)、Microsoft Azure、Google Cloud、阿里云、华为云等均在 AI 训练服务上持续升级;但针对 Grokking 特化优化的服务尚未公开报道。

6.3 数据与存储

持续更久的训练需要更稳健的数据 pipeline,对数据版本管理、去噪、合成数据生成等上游环节提出更高要求。存储系统需应对频繁的检查点写入和读取(模型状态保存),训练数据集规模与读写负载同步上升。

具体产能/收入数字:公开资料未见专门针对 Grokking 所驱动的增量算力或云服务的市场规模测算。相关上游的增长仍被纳入通用 AI 训练基础设施建设口径评估。


7. 下游

下游主要涵盖模型部署、应用开发及相关的工具服务市场。Grokking 引发了“模型是否已经达到最佳状态”的不确定性,从而影响多个应用层面。

7.1 模型交付与版本管理

  • 部署时机重新评估:产品团队需在“短期训练可获得良好模型”和“超长训练可能获得超越性模型”之间取舍,这种取舍直接影响产品发布节奏和质量基线。
  • 模型监控与持续更新:有人提出“持续训练服务”模式——客户购买基础模型后,供应商持续在后台进行长尾训练,当监测到潜在 Grokking 信号后,再推送性能跃迁的升级版本。此概念尚处极早期,未有公开商业化案例。

7.2 训练工具与平台层

  • MLOps 平台:需集成新的泛化检测指标(类似第 5 节所述),帮助用户判断是否应继续投资于额外训练。这为 Weights & Biases、Neptune.ai、阿里云 PAI、腾讯 TI-ONE 等平台的指标监控模块带来功能扩展需求。
  • 优化器与训练框架:PyTorch、JAX、TensorFlow 等框架,以及 DeepSpeed、Megatron-LM 等分布式训练库,可能需要内置针对 Grokking 的调优建议或回调机制(尚在研究阶段)。

7.3 终端应用

  • 推理成本与性能:Grokking 后的模型往往在泛化任务上表现更稳健,可能减少后续推理时的歧义、错误和连锁纠正需求,提高下游 AI 应用的用户体验和系统可靠性。但与此对应的推理硬件需求是否显著变化,目前缺乏量化分析。
  • 应用场景风险:对延迟泛化的依赖,使那些无法负担持续训练的中小企业、研究机构面临“模型性能天花板”,可能加剧技术鸿沟。

8. 受益公司

以下梳理仅依据公开信息,从产业链位置和业务链路出发,分析可能受 Grokking 现象持续关注与验证驱动的增量需求的相关公司,不代表任何投资判断或业绩预测。

  • 英伟达(NVIDIA):作为 AI 训练 GPU 的主导供应商,超长训练周期所带动的训练 GPU 时间增长,是该公司数据中心业务需求侧的底层驱动力之一。2025 财年第二季度(2024 年 5 月至 7 月,来源:NVIDIA 财报),数据中心收入 263 亿美元,同比增长 154%,主要由大语言模型训练和推理拉动。公司未单独披露 Grokking 相关影响的量化贡献。
  • AMD:Instinct MI300X 系列加速器在云端 AI 训练市场的渗透率提升,使其成为长周期训练算力扩张的潜在受益者。
  • 云基础设施提供商(AWS, Microsoft Azure, Google Cloud):均拥有大规模 GPU 集群和 AI 训练服务,训练周期的拉长直接转化为更高的 GPU 租赁时长和计算服务收入。前述公司财报中,AI 相关收入均被列为增长引擎,但均未单独划分 Grokking 相关的影响。
  • 华为(昇腾):在国产 AI 训练芯片和云服务市场拥有重要份额,其 Atlas 系列和昇腾云服务可能承接国内大量公共部门和企业的大模型长周期训练需求。具体受益规模因未披露而无法计量。
  • 基础模型厂商(OpenAI, Google DeepMind, Anthropic, Meta 等):这类公司需要长期、大规模地训练前沿模型,Grokking 现象在其研发策略和训练预算决策中可能扮演参考角色。它们既是现象的深度研究者,也是最先面对其经济影响的主体。
  • MLOps 工具与分析平台(如 Weights & Biases, Databricks / MLflow, 阿里云 PAI, 腾讯云 TI 平台等):对高阶训练状态监控的需求可能为其提供新的功能增长点,但当前直接可归因的产品收入不明确。

说明:公开资料未见任何公司明确在财报或对外产品路线图中,将 Grokking 作为独立业务增长动因或独立营收板块的披露。


9. 市场规模

目前,全球范围内并没有机构专门针对“Grokking 相关经济影响”发布定量市场规模评估。因此,本节从与其最相关的 AI 训练计算与基础设施市场 的角度,提供可用于参考的宏观数据口径。

  • AI 服务器市场:IDC 在 2023 年底发布的追踪数据显示,2023 年全年全球 AI 服务器市场收入约 210 亿美元(来源:IDC Worldwide Quarterly Server Tracker, 2023 年口径,单位:美元名义)。该市场 2022-2027 年的年复合增长率预测超过 20%。更长训练周期将进一步推升对 AI 服务器的需求强度,但 Grokking 对此的量化贡献难以剥离。
  • 公共云 AI 训练消费:多家云厂商在其财报电话会议中提及,AI 训练相关租用收入快速增长。例如,微软 Azure 在 2024 财年 Q3(2024 年 1 月至 3 月,来源:微软财报)AI 服务贡献了约 7 个百分点 的收入增长;AWS 在 2024 年 Q1 明确说明 AI 相关服务已达数十亿美元年化收入运行率。这些数据涵盖全部 AI 训练与推理,并未剥离 Grokking 效应。
  • 中国 AI 算力市场:根据中国信息通信研究院《中国算力发展指数白皮书(2023 年)》发布的测算,2022 年中国算力总规模约 180 EFLOPS(FP32),其中智能算力占比超过 40%,且持续快速上升。报告未涉及 Grokking 延迟泛化对算力增量的独立测算。

核心结论公开资料未见 将 Grokking 现象作为独立驱动因子进行市场量化的报告。所有潜在的市场规模增量,当前均隐藏在“大模型热潮——训练计算增长”这条主线之中。


10. 玩家对比

本部分对 Grokking 现象研究及相关产业布局的关键参与方进行对比,侧重于研究方向、开放程度与资源优势,不涉及任何形式的公司价值比较或投资排名。

维度OpenAIGoogle DeepMindMeta AI (FAIR)Anthropic中国头部力量(百度/阿里/华为/清华/北大等)
Grokking 发现/公开原始发现与命名(2022 年论文)在涌现与泛化方向发表大量理论文章于 LLaMA 等模型长期训练中报告类似延迟泛化在对齐安全视角下关注能力突变主要集中于复现、机制解释和加速方法研究
研究对象规模从小型 Transformer 起步,逐步扩展从合成数据到实际任务,广泛覆盖开源模型从数十亿到数千亿参数不等重点研究训练过程的非线性动力学多聚焦中英双语模型以及大规模模型(百亿级)验证
学术开放度发表标志性论文,但大模型细节隐藏持续发表 Nature/Science 及顶会论文多数成果以论文和技术报告公开发表机械解释性论文,但部分细节保密头部企业实验室论文数量上升,但超大规模实验细节披露少
产业化程度将理解转化为更好的训练策略(未公开)可能将延迟泛化知识用于下一代模型训练直接指导公开预训练方案和调参建议内嵌于对齐流程,未独立产品化处于从实验室发现向训练工具、云服务探索转化阶段
核心优势现象定义权,深厚研究积累极高计算资源和跨学科研究团队开源生态,大量社区反馈与复现专注安全及长训练过程的精细监控贴近中国庞大算力设施与应用场景,应用验证机会丰富

注意:表中中国一列是对多家机构能力的综合概括,不代表单一实体的能力描述。


11. 风险

11.1 技术风险

  • 不可预测性风险:Grokking 发生与否、何时发生,目前没有成熟预测手段。这使研发项目的时间与预算估算高度不确定,决策层难以用传统 ROI 模型评估。
  • 计算成本失控风险:如果触发 Grokking 需要数倍于原有计划的训练量,直接导致 GPU 消耗、电力、冷却等成本超支,并增加碳排放。
  • 现象普遍性存疑:现有报道多集中在特定任务、特定模型规模。对于大语言模型、多模态模型等更大规模、更嘈杂数据的训练,是否存在清晰 Grokking 拐点,仍是未解问题。存在投入大量资源后无法复现的风险。

11.2 产业结构与竞争风险

  • 算力不平等加剧:只有资金充裕的头部企业和国家级实验室有能力承担触发 Grokking 所需的超额训练。若 Grokking 被证实为获取顶尖性能的必要条件,中小团队将被进一步边缘化。
  • 投入泡沫风险:概念过热可能诱导部分企业以“追求 Grokking”为名,盲目延长训练、增加算力采购,但无法证明由此带来的性能提升价值超过成本。

11.3 合规与安全风险

  • 可解释性挑战:Grokking 后模型内部表征趋于结构化抽象,可能进一步降低人类对其决策路径的直觉理解。在对安全、公平有严格监管要求的领域(如金融、司法、医疗),这可能增加合规负担。
  • 能力突变监管:若 Grokking 导致模型能力在部署过程中发生意外跃迁(例如长时间在线持续微调),可能引发产品责任界定难题,带来监管不确定性。

公开资料未见任何监管机构就 Grokking 现象专门发布指导或法规。


12. 误读纠偏

Grokking 概念在传播过程中容易被曲解或过度泛化,以下是常见误读及澄清:

  • 误读 1:“Grokking = 长得多的训练总会有突破”
    纠偏:Grokking 并不是训练时间的单调函数。它要求特定的任务性质(高度结构化、低熵规则),以及特定的正则化条件。盲目延长训练而不调整超参数,可能只会让模型停留在记忆阶段或陷入更深的过拟合。

  • 误读 2:“Grokking 是深度学习的一种新现象,证明以前的理论都错了”
    纠偏:Grokking 是在特定实验条件下的观察发现,传统学习理论中的“良性过拟合”、“双下降”等现象已说明过拟合后性能可以再提升。Grokking 的特殊之处在于突变式的跳跃,而非泛化能力提升本身。它扩展了我们对训练动力学的认识,但并未推翻所有旧理论。

  • 误读 3:“所有大模型都会经历 Grokking,只是我们没注意到”
    纠偏:目前没有公开证据表明,大语言模型的训练损失曲线上存在类似 Grokking 的测试准确率跳跃。大模型在持续训练中可能表现为逐步改善或涌现出特定技能,但严格意义上的 Grokking 在千亿参数模型是否存在,尚待确认。

  • 误读 4:“Grokking 后模型就绝对安全、推理完全可靠”
    纠偏:Grokking 指的是对训练数据的底层规则的泛化,不意味着模型在所有可能的输入、特别是对抗性输入上都能保持正确和稳健。模型依然可能存在盲点、偏见或安全性漏洞。

  • 误读 5:“Grokking 是通向 AGI 的直接路径”
    纠偏:Grokking 是一个关于泛化的微观动力学现象,为理解能力涌现提供了线索,但它本身并不等同于强人工智能。把它直接与 AGI 绑定,是对现象意义的过度解读。


13. 最新事件

截至 2024 年 10 月(当前对话上下文所反映的时间框架),以下为近年与 Grokking 相关的重要学术进展和行业动态(基于公开论文、预印本与会议报道整理,不包含未公开的企业内部信息):

  • 2022 年:OpenAI 团队(Power 等)发表《Grokking:在小算法数据集上超越过拟合的泛化》,首次系统定义并展示 Grokking 现象,成为该方向的基础文献。
  • 2023 年初:多组研究者陆续发文探索 Grokking 的理论机制,代表性工作包括 “Towards Understanding Grokking: An Effective Theory of Representation Learning”(Liu et al., 2023),从表示学习动力学角度提供数学框架;“Omnigrok: Grokking beyond algorithmic data”(Liu et al., 2022/2023)将实验扩展到更接近自然数据的环境。
  • 2023 年:DeepMind、Meta 等机构在技术报告中提及,在训练大型模型的过程中观察到测试性能在充分训练后仍有显著改善,但并未明确标记为 Grokking。
  • 2024 年:ICLR 2024 收录了多篇直接讨论 Grokking 机制的论文,包括关于权重衰减作用、相变分析以及课程学习可加速 Grokking 的实验研究。
  • 2024 年:国内部分高校及企业 AI 实验室(如清华大学、北大、华为诺亚方舟实验室)在中文社区分享关于 Grokking 在 Math 推理、代码生成任务上的复现和机制分析,但多处于预印本或小范围学术研讨阶段,大规模模型上的系统研究公开信息有限。
  • 2024 年:公开产业动态中未见任何主流云厂商或模型供应商宣布推出“Grokking 检测/加速”相关的标准化产品或服务。

说明:上述事件均为公开知名会议、预印本平台(arXiv, OpenReview)和公开技术报告所述。内部研发实验不在其列。


14. 跟踪指标

对于希望在实际训练过程中监测 Grokking 相关信号的研究者和工程师,可以关注以下指标(均基于学术文献中常见设定,非生产环境标准):

  • 延迟泛化率(Delayed Generalization Ratio):定义为从达到训练准确率 99%(记忆完成)到测试准确率突破 90%(泛化完成)所需的额外步数与记忆阶段步数的比值。该比率越高,说明 Grokking 延迟越严重。
  • 泛化差距曲线形态(Generalization Gap Trajectory):追踪 train_acc - test_acc 随时间的变化。在记忆阶段差距迅速扩大,在 Grokking 发生前达到峰值后, 差距骤降。这个拐点可作为事后标志,但无法提前预测。
  • 权重范数及有效秩(Effective Rank):监视模型权重矩阵的谱范数或有效秩的演化。当模型从记忆解过渡到泛化解时,权重范数趋于缩小,而能量在奇异值上的分布趋向平坦化。
  • 探针分类准确率(Probe Accuracy):在中间隐状态上训练线性探针,预测任务中规则的分类(如被操作数的奇偶性)。探针准确率的突然上升通常早于最终输出测试准确率的跃迁,是最有希望的预警信号之一。
  • 损失地貌平坦度(Sharpness / Hessian Eigenvalues):通过计算损失函数的 Hessian 矩阵最大特征值或其轨迹近似(如通过幂迭代),捕捉从尖锐极小值向平坦极小值移动的过程。平坦度显著下降可能与 Grokking 相关联。
  • 计算预算效率(Compute-to-Performance Ratio):评估在每个训练计算量级(如 PetaFLOP-days)下对应的测试性能提升。当该比率在长期停滞之后突然反转向上,可作为 Grokking 的事后检验指标。

局限说明:所有这些指标的预测可靠性均只在有明确 Grokking 样本的研究数据集上被验证,在大规模、多任务、自然语言场景下的适用性和阈值仍需大量实验确定。


15. 信源

15.1 学术论文与预印本

  • Power, A., Burda, Y., Edwards, H., et al. (2022). Grokking: Generalization beyond overfitting on small algorithmic datasets. arXiv preprint arXiv:2201.02177.
    (原始现象的提出与系统实验。)
  • Liu, Z., Kitouni, O., Nolte, N., et al. (2023). Towards Understanding Grokking: An Effective Theory of Representation Learning. Advances in Neural Information Processing Systems (NeurIPS).
    (从表示学习理论给出数学框架。)
  • Liu, Z., Michaud, E.J., Tegmark, M. (2022/2023). Omnigrok: Grokking beyond algorithmic data. arXiv preprint arXiv:2210.01117.
    (将 Grokking 研究从纯算法数据扩展到更丰富的设定。)
  • Varma, V., Shah, R., Kenton, Z., et al. (2023). Explaining grokking through circuit efficiency. arXiv preprint arXiv:2309.02390.
    (从回路效率角度给出机械解释。)
  • Lyu, K., Li, Z., Arora, S. (2023). Understanding the Mechanics of Grokking via Student-Teacher Models. ICML 2023 Workshop.
    (通过教师-学生模型解析 Grokking 的相变。)
  • Nanda, N., Chan, L., Lieberum, T., et al. (2023). Progress measures for grokking via mechanistic interpretability. ICLR 2023.
    (提出基于机制解释的进度度量指标。)

15.2 产业报告与数据口径

  • IDC. (2023). Worldwide Quarterly Server Tracker, Q4 2023.
    (全球 AI 服务器市场 2023 年收入规模参考。)
  • 中国信息通信研究院. (2023). 《中国算力发展指数白皮书(2023 年)》.
    (中国算力总量及智能算力占比。)
  • Microsoft. (2024). FY24 Q3 Earnings Conference Call.
    (Azure AI 收入贡献指引。)
  • NVIDIA. (2024). Q2 FY25 Earnings Release.
    (数据中心业务收入及增长驱动说明。)

15.3 说明

以上信源均来自公开发表的学术文献、预印本存档(arXiv/OpenReview)和官方/机构公开报告。对于企业未公开的内部研究数据或私密技术报告,本文未涉及。读者在引用相关市场数据时,请注意各报告的具体统计口径(如是否为厂商收入、终端用户支出、或出货量)和计价货币,并留意时效性。

source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型