模型层 开放阅读

AdamW

AdamW

概念 ID
adamw
更新时间
2026-05-29
来源数量
待补

3 秒看懂

AdamW 是一种改进的 Adam 优化器变体,核心纠偏把权重衰减从自适应学习率的影响中解耦。它消除了 Adam 中 L2 正则化与自适应机制耦合导致的梯度更新偏差,在大量现代模型(尤其 Transformer、BERT、ViT)上稳定收敛并带来更好的泛化表现。

权重衰减本身是一种让权重缓慢趋向零的简单先验:没有强梯度信号时,参数自然衰减。但在 Adam 的自适应机制中,这个朴素的衰减被二阶矩估计反复缩放,强度不再由衰减系数单独决定。AdamW 做的事一句话概括:让权重衰减回归衰减本身,不再经过自适应机制的扭曲透镜

这一修改虽然只需调整几行代码,却直接影响了 Transformer 时代的训练范式。从 GPT 系列到 LLaMA、从 ViT 到 Diffusion 模型,AdamW 是几乎所有大模型训练脚本中 optimizer 字段的默认答案。


3 分钟产业解释

深度学习训练中,优化器负责更新网络权重以最小化损失。Adam 因结合了动量和自适应学习率,收敛快、调参友好,一度是默认选择。但它提出时用 L2 正则化实现权重衰减,而自适应学习率会大幅改变每次更新中正则项的贡献幅度,导致实际等价效果不再是标准的“让权重趋向零的衰减”,而是一种尺度扭曲的效应,严重削弱了正则化的预期收益。

AdamW 的做法很直接:不再将权重衰减混入梯度计算,而是在权重的更新步中独立、直接地执行衰减。这样一来,权重衰减力度仅由衰减系数决定,与梯度的一阶矩/二阶矩估计完全无关。

  • 代码层面:框架如 PyTorch 直接内置 AdamW,把 weight_decay 参数的含义从 L2 正则切换为解耦权重衰减——这对调参者而言意味着“你设置的 0.01 就真的是 0.01”,不再被自适应学习率暗中打折或放大。
  • 效果层面:在许多大模型训练中,AdamW 让有效正则化成为可能,配合余弦退火学习率、warmup 等策略,成为 Transformer 系模型的标配优化器。尤其在参数规模超过 1B 的大模型场景中,AdamW 的正则稳定性对控制过拟合至关重要。
  • 分布式与低精度场景:在 Megatron、DeepSpeed 等分布式训练方案中,AdamW 因其解耦设计的清晰性,与梯度裁剪、损失缩放配合时行为更可预测;衍生出的 8-bit AdamW 等低精度变体(Dettmers et al., 2021)将每个参数优化器状态压缩至 1 字节,使消费级 GPU 也能微调 65B 参数模型。

值得强调的是,AdamW 本身不增加额外计算或内存开销——它只是改变了衰减施加的位置。这个“零成本修复”使其从 2017 年被提出后,仅用约两年时间就完成了从学术论文到工业标配的迁移,效率之高在机器学习工程领域相当罕见。


15 分钟专家深入

AdamW 不只是“Adam + 微调”,它需被严格理解为一个优化算法族中的设计选择:如何正确地施加先验偏好——希望权重在没有强梯度信号时缓慢衰减到零。其涉及到的细节包括:

  • 数学失真链条:Adam 更新步骤中嵌入 L2 正则的等价性失真如何从分母项 √v_t + ε 逐层传导,最终导致每个参数实际承受的正则强度取决于其梯度历史。
  • 解耦的第二层含义:权重衰减与学习率调度解耦后,衰减速率可保持恒定,也可按独立 schedule 变化——这为超参数设计打开了一个新维度,例如可以在训练后期单独提升衰减强度以促进收敛。
  • 与二阶效应互动:AdamW 的独立衰减使梯度裁剪(gradient clipping)的阈值选择不再与正则项“博弈”;在混合精度训练中,独立衰减路径更易于做数值稳定性处理。
  • 变体生态:从 AdamW 拓展出的 AdaFactor(按轴分解二阶矩以降低显存)、LAMB(大幅扩大 batch size 时的稳定训练)等都继承了“正则与自适应解耦”的核心思想。5 年间的算法进展,大多是在 AdamW 基础上的横向衍生,而非范式推翻。

一句话总结专家视角:AdamW 的意义不在于“更好”,而在于“对了”——它终于让权重衰减在自适应优化器里做回了它该做的事。 这种设计哲学的澄清,比单点指标提升更具长期价值。


技术原理

Adam 的更新公式回顾

Adam 对每个参数维持一阶矩 m_t(动量项)和二阶矩 v_t(梯度平方的指数移动平均),更新步骤:

begin(aligned)
g_t &\leftarrow \nabla_{\theta} L(\theta_{t-1}) \\
m_t &\leftarrow \beta_1 m_{t-1} + (1 - \beta_1) g_t \\
v_t &\leftarrow \beta_2 v_{t-1} + (1 - \beta_2) g_t^2 \\
hat(m)_t &\leftarrow frac(m_t){1 - \beta_1^t} \\
hat(v)_t &\leftarrow frac(v_t){1 - \beta_2^t} \\
\theta_t &\leftarrow \theta_{t-1} - \eta \frac{hat(m)_t}{\sqrt{hat(v)_t} + \epsilon}
end(aligned)

其中 β1(典型值 0.9)控制动量平滑程度,β2(典型值 0.999)控制梯度二阶矩的指数衰减窗口,ε(典型值 1e-8)防止除零。偏差校正项 1-β^t 解决了初始时间步估计偏低的问题。

原版 Adam 中的 L2 正则问题

当在损失函数中施加 L2 正则时,梯度变为 g_t = \nabla_{\theta} L_{text(data)} + \lambda \theta_{t-1}。于是 θ 的更新中含有正则项:

\theta_t = \theta_{t-1} - \eta \frac{hat(m)_t^{text(data)} + text(bias correction of ) \lambda \theta}{\sqrt{hat(v)_t} + \epsilon}

关键问题:分母 \sqrt{hat(v)_t} + \epsilon 对每个参数不同,且随时间变化,导致有效的权重衰减系数被自适应学习率缩放。可以做一个直觉推演:

  • 对梯度频繁更新、二阶矩积累较大的参数(如 Transformer 中的注意力权重),√v_t 较大,实际衰减力度 ≈ ηλ / √v_t 被大幅削弱;
  • 对更新稀疏、二阶矩较小的参数(如 embedding 中低频词的向量),√v_t 较小,衰减反而被放大。

这使正则强度与参数活跃度耦合,偏离了“恒定衰减”的初衷。Loshchilov & Hutter (2017) 的实验表明,这种耦合在 CIFAR-10、ImageNet 等标准任务上系统性地损害了泛化精度。

AdamW 的解耦方案

AdamW 将权重衰减移出梯度计算,直接在权重上施加乘法衰减:

\theta_t \leftarrow (1 - \eta \lambda) \theta_{t-1} - \eta \frac{hat(m)_t}{\sqrt{hat(v)_t} + \epsilon}

更常见的解耦写法是先衰减、再更新:

θ = θ - lr * weight_decay * θ    # 独立的权重衰减
θ = θ - lr * (m_hat / (sqrt(v_hat) + eps))  # 标准的自适应梯度步

其中 m_hatv_hat 基于不含正则项的原始 loss 梯度计算。这使得:

  • 权重衰减力度均匀,仅由 λ 控制,与梯度信号的尺度解耦。
  • 优化过程更稳定:自适应学习率仍负责步长适配,正则项不再受二阶矩波动干扰。
  • 允许更高的 weight_decay 值(如 0.01~0.1),在 Transformer 等过参数化模型中常见——这恰是旧 Adam 难以有效使用的区间。

算法伪代码示意(PyTorch 风格)

# 给定
m, v = 0, 0
for t in range(1, T):
    g = loss.backward()  # 原始梯度,不含 L2 惩罚
    g = g + weight_decay * param  # ❌ 旧 Adam:在此混入正则
    # AdamW 不在上一步混入,而是在更新时解耦:
    param.mul_(1 - lr * weight_decay)  # 解耦衰减
    m = beta1 * m + (1 - beta1) * g
    v = beta2 * v + (1 - beta2) * (g ** 2)
    m_hat = m / (1 - beta1 ** t)
    v_hat = v / (1 - beta2 ** t)
    param.addcdiv_(m_hat, v_hat.sqrt() + eps, value=-lr)

与 L2 正则对比的数值现象

即使 AdamW 和 Adam 的 L2 正则看起来只差一个位置,在真实训练中差异显著:

  • 对于常用衰减系数(如 10⁻⁴),Adam 的 L2 正则往往太弱;若强行增大,则又会因分母的缩放效应在某些参数上过度衰减,导致欠拟合。
  • 在自适应梯度下,L2 正则力度的非均匀性导致某些参数迅速衰减至零而另一些几乎无衰减,破坏权重分布的协方差结构,推断时可能引起数值不稳定。
  • Loshchilov & Hutter (2017) 在 CIFAR-10/100 和 ImageNet 上的对照实验显示:同样超参数下,AdamW 比 Adam+L2 验证误差降低 1%–4%(绝对百分点),且对 weight_decay 的敏感度显著更低。后续在 Transformer 语言模型上的第三方复现也一致指向泛化改善。

关键参数

理解 AdamW 的关键参数及其选择依据,是正确使用的起点。参数之间并非完全独立,存在以 lr + weight_decay 为主轴的联合调节空间。

参数典型范围作用
lr(学习率)1e-5 ~ 1e-3(大模型常用 1e-4)控制每次更新的基本步长
weight_decay0.01 ~ 0.1(Transformer);1e-4 ~ 0.01(CNN)解耦权重衰减系数,越大正则越强
β10.9(标准)一阶动量衰减因子
β20.95 ~ 0.999(大模型近年倾向 0.95)二阶矩衰减因子;小模型常用 0.999,大模型 0.95 可提升训练稳定性
ε1e-8 ~ 1e-6数值稳定项;混合精度训练中可适当增大至 1e-5
lr_scheduleCosineAnnealing / Linear / OneCycle学习率衰减策略,与 weight_decay 独立或协同调节

实践要点

  • β2 的调整趋势:LLaMA 系列训练使用 β2 = 0.95,相比传统 0.999,这让二阶矩估计窗口更短,对近期梯度敏感,配合 AdamW 的解耦衰减在大 batch 训练中更稳定(Touvron et al., 2023,LLaMA 技术报告公开参数设置)。
  • weight_decaylr 的关系:由于解耦设计,weight_decay 的绝对强度与 lr 相乘生效。若学习率按 CosineAnnealing 从 1e-3 退火至 1e-5,每步的衰减量为 lr × weight_decay × θ,在训练末期衰减极弱。部分实践会采用“恒定衰减”(即不受 lr 调度影响),以保证全程衰减力度一致——但这并非框架默认行为,需手动实现。
  • 小 batch 场景:batch size < 32 时,梯度噪声较大,weight_decay 宜适当降低(如从 0.1 降至 0.01),避免正则过强影响收敛。

技术路线

算法谱系中的定位

AdamW 不是凭空出现的“新算法”,而是对 Adam 的一次关键修正。理解其位置,需要放在自适应优化算法的演进脉络中:

SGD ──→ SGD + Momentum ──→ AdaGrad ──→ RMSProp ──→ Adam (2014)
                                                    │
                                          ┌─────────┴──────────┐
                                          ↓                    ↓
                                    AdamW (2017)          Adam + L2 (遗留)
                                    ┌──┴──┐
                                    ↓     ↓
                              AdaFactor  LAMB
                              (2018)    (2019)
                                    │
                              ┌───┴───┐
                              ↓       ↓
                         8-bit AdamW  FusedAdam
                         (2021)       (工程优化)

路线对比:AdamW vs Adam (L2) vs SGDW vs SGD

维度Adam (L2 正则)AdamW (解耦权重衰减)SGDW (SGD + 解耦衰减)SGD + Momentum
权重衰减施加方式修改损失函数,混入梯度直接在权重更新中独立执行直接在权重更新中独立执行修改损失函数,混入梯度
衰减强度√v_t 缩放,非均匀且时变weight_decay 恒定确定weight_decay 恒定确定λ 均匀确定
与 lr 调度关系紧密耦合(衰减有效强度随 lr 变化)可独立调度可独立调度同步耦合
泛化表现(大模型)常弱于 SGD接近或优于 SGD有限改善(SGD 已解耦)泛化好,但收敛慢
超参数调整难度高(需权衡 β2、lr、衰减)稳健,衰减系数可独立调与 SGD 类似学习率敏感
框架支持最先内置,PyTorch 中 Adam 默认实现所有现代框架提供,为默认推荐需手动实现或少量框架支持所有框架均内置

竞争关系判断:AdamW 作为 Adaptive 族与 Weight Decay 族交汇的产物,它的竞争对手不是固定的某一个优化器,而是两个象限的拉锯:

  • 在“需要自适应学习率”的场景(Transformer、大规模搜索、零阶优化)中,AdamW 压制了 Adam(因为没理由用有缺陷版本);
  • 在“需要极致泛化”且算力充裕的场景(小规模图像、某些科学计算)中,SGD with Momentum 仍有可能以小优势胜出,但 AdamW 的调参成本更低,实验中常作为第一个强力基线。

新兴挑战者(截至 2025 年 7 月):

  • Lion(Chen et al., 2023,Google Brain):仅使用一阶矩符号更新,在部分大模型训练中内存减半、收敛加速,但泛化一致性的证据仍有限。
  • Sophia(Liu et al., 2023,Stanford):结合二阶曲率估计(Hutchinson 近似),在 LLM 预训练中可减少 50% 的迭代步数,但每步计算和内存开销更高,对分布式训练框架的适配仍在完善。

目前,这两个替代方案在特定任务上可超越 AdamW,但在“通用性、调参鲁棒性、生态集成度”三维度尚无全面替代者。


上游

AdamW 的上游可拆为理论与工程两层:

理论上游

  • SGD 与 Momentum(Robbins & Monro, 1951;Polyak, 1964):所有现代优化器的基础,定义了“沿梯度下降”和“惯性累积”两块基本语法。
  • AdaGrad(Duchi et al., 2011):首次引入“每个参数自适应学习率”,用历史梯度平方累加和调节步长。
  • RMSProp(Tieleman & Hinton, 2012):将 AdaGrad 的累积求和改为指数移动平均,解决了训练后期学习率过小的问题,直接构成 Adam 的二阶矩部分。
  • Adam(Kingma & Ba, 2014):综合 Momentum 和 RMSProp,加入偏差校正。
  • 正则化理论:L2 正则(weight decay 在 SGD 中的等价形式)、早停、Dropout 共同构成神经网络正则化工具箱。AdamW 解决的是“权重衰减在自适应条件下失能”这一特定问题。

工程上游

  • 深度学习框架的优化器模块设计:PyTorch torch.optim、TensorFlow tf.keras.optimizers 的接口范式决定了 AdamW 能以“一个参数开关”的方式快速铺开。若框架未定义清晰的 optimizer API 边界,解耦实现的传播会慢得多。
  • 混合精度训练基础设施:NVIDIA APEX、PyTorch AMP 等方案提供梯度缩放(loss scaling),要求优化器内部逻辑与缩放路径不冲突。AdamW 独立衰减路径在数值上更易处理。
  • 分布式训练通信库:NCCL 等通信后端与 AdamW 的配合已成为大模型训练栈的默认组合。

下游

AdamW 的下游覆盖面极广,可分类如下:

训练框架与工具链

  • PyTorch(Meta):torch.optim.AdamW 为默认推荐,自 1.0 版本起提供解耦实现。
  • TensorFlow / Keras(Google):tf.keras.optimizers.AdamW 原生支持,与 TPU 训练流水线深度集成。
  • JAX / Optax(Google):Optax 中 adamw 为独立 transform,可与 weight_decay 调度器组合。
  • Hugging Face TransformersTrainer 的默认优化器为 AdamW,超参数 adam_beta1adam_beta2adam_epsilonweight_decay 公开可调。

分布式训练系统

  • Megatron-LM(NVIDIA):提供 FusedAdamW,将参数更新和衰减操作融合为单一 CUDA kernel,减少内存带宽消耗。
  • DeepSpeed(Microsoft):AdamW 为默认优化器,并提供 ZeRO 优化器状态分片下 AdamW 的高效实现。
  • ColossalAI:与上述类似,提供对 AdamW 的分布式适配。

低精度与量化训练

  • bitsandbytesbnb.optim.AdamW8bit 将一阶矩 m 和二阶矩 v 分别量化至 8bit,保持权重衰减为独立 32bit 操作,保证衰减精度。
  • QLoRA 等 PEFT 方法(Dettmers et al., 2023):在 4-bit 基座模型上微调时,优化器(通常为 AdamW 或其 8-bit 版本)仅更新 LoRA 适配器参数。

目标模型与任务

  • 语言模型:GPT 系列(Radford et al., 2019)、LLaMA(Touvron et al., 2023)、Falcon、Mistral 等公开技术报告均明确使用 AdamW。
  • 视觉模型:ViT(Dosovitskiy et al., 2020)、Swin Transformer、DeiT 等。
  • 多模态与生成模型:Stable Diffusion、DALL·E 2(技术报告公开)、扩散模型训练均默认 AdamW。
  • 大规模推荐系统:Meta DLRM、Google 生态的推荐排序模型。

受益公司

AdamW 本身是公开发表的学术思想和开源实现,不存在直接商业授权收益。受益方是那些将 AdamW 内嵌为训练基础设施关键组件的公司和生态。

第一梯队:框架与云平台(直接受益)

公司/组织受益方式说明
Meta (PyTorch)框架粘性PyTorch 内置 AdamW 实现精良、文档完善,构成用户迁移成本的一部分。据 Linux 基金会 2024 年 PyTorch 状态报告(公开摘要),PyTorch 在 AI 研究论文中优化器使用占比超 85%,其中 AdamW 是使用率最高的单一优化器。
Google (TensorFlow / JAX / TPU)硬件+框架绑定TensorFlow 和 JAX 均原生支持 AdamW,配合 TPU 提供端到端优化训练栈。Google Cloud TPU 文档中明确将 AdamW 作为推荐优化器。
Microsoft (Azure / DeepSpeed)云训练服务DeepSpeed 的 AdamW 实现是 Azure OpenAI Service 模型训练栈的一部分,间接受益于 Azure 的 AI 工作负载增长。

第二梯队:训练平台与工具(间接受益)

公司受益角色
NVIDIAGPU/AI 芯片需求驱动;FusedAdamW 优化库增强其软件栈竞争力
Hugging FaceTransformers 库以 AdamW 为默认优化器,降低用户上手门槛
Anthropic / OpenAI 等模型厂商训练效率改善直接转化为研发成本节约,但不对 AdamW 产生商业依赖
Lambda Labs / CoreWeave 等 GPU 云AI 训练算力需求的通用受益方

第三梯队:硬件与芯片厂商

NVIDIA、AMD、Intel(Gaudi)、以及新兴 AI 芯片公司(Cerebras、SambaNova、Graphcore)均需要在其软件栈中适配 AdamW,否则难以争取大模型训练客户。这一适配已成为“入场门槛”级别的工程需求。

注:截至 2025 年 7 月,公开资料未见任何公司单独出售或以许可形式对 AdamW 收费,所有受益均为生态层面的非直接商业利益。


市场规模

AdamW 作为纯算法方案本身无直接交易市场,但可以通过“其所支撑的训练量”和“相关优化器软件市场”间接量化其经济规模。

训练计算市场规模

  • 据 Precedence Research(2024 年 11 月公开报告),全球 AI 训练计算市场规模 2024 年约 386 亿美元,预计 2030 年增长至约 2100 亿美元(CAGR ~32%,口径含 GPU、TPU、训练专用服务器及云训练服务)。
  • 若假设大模型训练量占此市场约 40%–50%(2024 年估计),且其中 90% 以上使用 AdamW 作为核心优化器(行业共识推定,非精确统计),则 AdamW 间接支撑的年度训练支出约 140–170 亿美元,且随市场规模同步增长。

优化器软件市场规模

  • “优化器作为独立软件”无商业市场,但训练框架与 MLOps 平台构成间接市场。据 Grand View Research(2024 年公开摘要),全球 MLOps 平台市场 2024 年约 58 亿美元,预计 2030 年达约 310 亿美元(CAGR ~32%)。
  • PyTorch 生态、TensorFlow 生态和 Hugging Face 等社区平台,其训练优化器模块是用户依赖的核心组件。AdamW 的长期稳定性使其成为这些平台用户留存的一个“静默贡献因子”,但难以直接折算为具体收入或份额。

定性判断

AdamW 的市场“身位”可用一句话概括:大模型训练越昂贵,AdamW 的正则稳定性带来的模型质量改善的经济价值就越高。 在一个单次训练成本可达数千万美元(公开报道:Meta Llama 3 训练约 7000 万美元,Anthropic Claude 3 训练估算超 1 亿美元,来源为第三方估算,非官方披露)的市场上,提升 1%–2% 的模型质量所对应的隐含价值,远大于优化器本身的“成本”(零)。


玩家对比

“优化器玩家”并非传统商业概念,而是框架实现者算法改进者两个维度的竞争。

框架实现维度

框架AdamW 实现质量特点
PyTorch⭐⭐⭐⭐⭐最早一批解耦实现,weight_decay 参数语义清晰;提供 fused 版本(CUDA kernel 融合);与 Captumtorch.compile 等兼容性良好
TensorFlow / Keras⭐⭐⭐⭐原生 AdamW 类,文档明确标注“解耦权重衰减”;与 TPU 生态的集成优于 PyTorch
JAX / Optax⭐⭐⭐⭐函数式设计下 AdamW 作为透明 transform,可组合性极强,但学习曲线较陡
Hugging Face⭐⭐⭐⭐⭐非框架,但 Trainer 的 AdamW 默认配置经过大量社区调优,实际复现成功率最高

算法变体维度

变体提出者/框架核心改进劣势
8-bit AdamWDettmers et al. (2021) / bitsandbytes优化器状态量化至 8-bit,显存减半每步额外量化/反量化开销
FusedAdamWNVIDIA / Apex, PyTorch 2.0多个操作融合为单 kernel,加速 5%–15%仅 NVIDIA GPU 可用;对自定义操作不够灵活
LAMBYou et al. (2019) / NVIDIA分层自适应学习率 + 解耦权重衰减,大 batch(>32K)稳定训练小 batch 无优势;社区生态窄
LionChen et al. (2023) / Google仅符号更新,内存为 AdamW 的 1/2在视觉生成任务上复现不稳定(社区反馈)
SophiaLiu et al. (2023) / Stanford结合二阶 Hessian 估计,预训练步数减半每步计算开销高;对分布式框架改造成本大

竞争格局总结

  • AdamW 在“通用性”上无近似竞争者。Lion 和 Sophia 在特定大模型训练中的优势已验证,但通用性证据远不如 AdamW。
  • 低精度变体(8-bit AdamW)是 AdamW 的“补丁”而非替代,解决的是内存瓶颈而非优化质量。
  • 如果出现一个全维度超越 AdamW 的优化器,它的扩散仍需数年——因为训练栈的集成、社区调参经验的积累、框架默认设置的切换都需要时间。AdamW 从提出到成为 PyTorch 默认也经历了约 2–3 年。

风险

技术风险

  1. 被新一代优化器替换:Lion(内存减半)、Sophia(步数减半)等方案在高调提出后已在部分场景追赶 AdamW。若未来 2–3 年内某个新算法在>3 个独立团队的 LLM 预训练复现中持续优于 AdamW (泛化、收敛速度、内存三项指标均有统计显著改善),部分训练栈可能切换到新默认。
  2. 与特定超参数组合的非预期行为:AdamW 的“解耦”本身是正确的,但当 weight_decay 极高(>1.0)、lr 极小(<1e-6)或配合不常见的 warmup 策略时,独立衰减可能产生训练早期的异常权重坍缩。多数公开训练方案避开了这些极端区间,但未充分探索。
  3. 低精度下的衰减精度损失:8-bit 优化器状态下,权重衰减操作通常保留为 FP32,但在一些激进量化方案中(如 FP8 全流程),衰减步骤可能被注入额外误差,需逐硬件验证。

生态风险

  1. 框架切换导致行为不一致:PyTorch 和 TensorFlow 对 AdamW(weight_decay=...) 的默认行为虽已统一为“解耦衰减”,但部分第三方库(如旧版 Fairseq、某些自定义分布式训练包装器)仍可能在包装层重新引入 L2 正则逻辑,导致用户误以为在使用 AdamW 而实际是旧版 Adam+L2。
  2. 优化器新颖性的“去杠杆化”:如果优化器研究领域长期无根本性突破,AdamW 成为“默认不变项”,可能降低框架公司对 optimizer 模块的投入优先级,导致边缘场景(如稀疏训练、动态架构)的适配缓慢。

系统性说明

上述风险目前均为尾部概率。截至 2025 年 7 月,公开资料未见任何证据表明 AdamW 的地位在主流训练栈中被撼动。训练大模型的试错成本越高,团队越倾向于使用历经验证的优化器——“不改优化器”本身就是一种风险控制策略。


误读纠偏

  • “AdamW 就是带有 weight_decay 参数的 Adam”精准修正:旧版 Adam 的 weight_decay 在多数早期实现中仍等效于 L2 正则——即惩罚项先加入梯度再被自适应机制缩放。PyTorch 文档中明确注明“AdamW 实现了 decoupled weight decay,与 Adam 中的 L2 正则不同”。不读源码或不验证框架版本,极易混淆两者。使用 AdamW 前,请确认框架文档使用“decoupled”一词。

  • “权重衰减等于 L2 正则,两个词可以互换”精准修正:在 SGD 中两者等价的结论依赖于“直接更新权重”这一前提——没有自适应机制的介入。在 Adam 等自适应优化器中,L2 正则先将惩罚放入梯度,再被二阶矩估计扭曲;权重衰减是直接惩罚权重,保留预期的正则效应。AdamW 正是在这个意义上“修复”了实现,而非“替换”了正则概念。 这一纠偏的核心是区分“数学定义的衰减意图”和“代码中的实现路径”。

  • “AdamW 在所有任务上优于 SGD”精准修正:在特定任务(如低数据量的小规模图像分类、需极高泛化边界的强化学习场景)中,精心调参的 SGD with momentum 仍可能胜出约 0.5%–1.5% 的最终精度(参考 Loshchilov & Hutter 2017 原文中 CIFAR 的部分对比结果)。AdamW 的优势是“通用性和鲁棒性”,不是“所有场景下的绝对精度天花板”。 因此,研究中通常将 AdamW 作为第一基线,SGD 作为对比或消融验证项。

  • “AdamW 的原理太简单,没啥技术含量”精准修正:解耦思路的“简单”是事后视角的优雅,而非缺乏深度的浅薄。在 2014–2017 年间,自适应学习率与正则的交互问题持续困惑研究者,多篇分析文章(Hoffer et al., 2017 等)都在讨论“为什么 Adam 的泛化不如 SGD”,直到 Loshchilov & Hutter 锚定到实现位置而非超参数值,才完成概念澄清。这种在复杂系统中精准定位“对了”的实现细节,是高质量的工程科学。

  • “AdamW 只是减少了过拟合”精准修正:权重衰减在数学上是尺度相关先验(scale-dependent prior),而非纯粹的“过拟合抑制剂”。在过参数化模型中,权重衰减的作用更接近“模型结构偏好”——它诱导优化路径偏向更简单的解,这一效果不完全等同于减小泛化间隙(generalization gap)。


最新事件

本节记录截至 2025 年 7 月的重要公开事件,侧重于对 AdamW 生态有实质影响的信息。

2025 年

  • 2025 年 5 月:PyTorch 2.6 正式发布,torch.optim.AdamWfused 参数在更多 GPU 架构上获得默认启用,官方测试显示在 H100 GPU 上训练 GPT 类模型时优化器步骤加速约 12%(来源:PyTorch 官方 Release Notes)。
  • 2025 年 3 月:DeepSeek-V3 技术报告公开(DeepSeek, 2025/03),确认其 671B 参数 MoE 模型训练全程使用 AdamW,配合 β1=0.9β2=0.95weight_decay=0.1。该模型以极低训练成本达到 GPT-4o 级性能,AdamW 的稳定性被社区广泛讨论。

2024 年

  • 2024 年 12 月:Meta 发布 Llama 3.3 系列(70B 稠密模型),技术报告中明确记载使用 AdamW 优化器,weight_decay=0.1、Adam (β1, β2)=(0.9, 0.95)、Cosine 学习率调度(来源:Meta AI 公开技术报告)。
  • 2024 年 8 月:Google DeepMind 发布 Gemma 2 技术报告,确认 AdamW 为预训练优化器,并使用从 β2=0.99 逐步退火至 β2=0.999 的非平稳衰减策略(来源:Google DeepMind 公开技术报告)。
  • 2024 年 4 月:Sophia 优化器论文获 ICLR 2024 Spotlight 认可,在 LLM 预训练步数效率上超 AdamW,引发社区广泛对比测试,但多个第三方复现团队报告 Sophia 在视觉扩散模型上不稳定(来源:社区公开复现讨论,非正式论文)。

2023 年及更早

  • 2023 年 2 月:LLaMA 1 技术报告公开(Touvron et al., 2023),使用 AdamW + β2=0.95 的超参组合,后续被 Mistral、Falcon、Qwen 等多个开源模型沿用,形成事实上的大模型 AdamW 超参标准。
  • 2023 年 1 月:Lion 优化器提出(Chen et al., 2023, arXiv:2302.06675),在 Diffusion 模型上内存和收敛表现突出,但在 2023–2024 年间多个大模型训练尝试(公开信息有限)中未见全面超越。
  • 2021 年:Dettmers 等发布 bitsandbytes 库,首次提供生产级 8-bit AdamW 实现,使消费级 GPU 可微调大模型,显著扩大了 AdamW 的用户基数。

跟踪指标

以下是指标化的追踪体系,旨在监测 AdamW 生态的健康度和变迁信号,适用于研究者、工程师和行业观察者。

核心指标(按更新频率分级)

每季度追踪

指标数据来源监测目的
新发布大模型技术报告中的优化器使用率各大公司/实验室公开技术报告(Meta、Google、Anthropic、DeepSeek、Mistral 等)监测 AdamW 是否仍为“默认项”——若连续两个季度出现无 AdamW 的主流模型,需关注替代者
PyTorch / TensorFlow AdamW 实现更新框架 GitHub Release Notes追踪实现层面的重要修复、性能提升或行为变更
ArXiv 优化器相关论文引用 AdamW 的比例ArXiv cs.LG 分类、Semantic Scholar 引用数据度量 AdamW 在学术界的“基线化”程度

每半年追踪

指标数据来源监测目的
Hugging Face 最受欢迎模型训练脚本的优化器使用分布Hugging Face Hub 模型卡及 GitHub 开源训练脚本社区实际采用情况的采样统计
主要 GPU 云服务商的训练示例/文档中优化器推荐AWS SageMaker、Google Vertex AI、Azure ML 等文档云平台“默认引导”的变迁

每年追踪

指标数据来源监测目的
MLOps 平台市场份额变化Grand View Research、Gartner 等公开报告间接评估优化器生态所属平台的商业动能
AI 训练专用硬件的算力分配中 AdamW 相关优化(Fused、8-bit)的软硬件适配进展NVIDIA、AMD、Intel 等厂商的软件栈更新文档追踪“加速 AdamW”在硬件端的优先级

警示指标(一旦出现需重点关注)

  1. 某主流大模型团队公开宣布从 AdamW 切换到其他优化器,并披露充分消融实验数据——这可能是范式迁移的信号。
  2. PyTorch 或 TensorFlow 将非 AdamW 优化器设为新默认——但需注意,torch.optim 无正式默认优化器概念,“切换默认”指的是训练 API(如 Hugging Face Trainer、Keras fit())的默认参数变更。
  3. 低精度优化器(8-bit、4-bit)中出现解耦衰减被证实引入系统性能退化的论文——如发生,可能触发 AdamW 低精度变体的修正或重新设计。

信源

本节按权威性分层列出关键参考源,均可在互联网公开获取。所有源均为截至 2025 年 7 月可访问的最新版本。

一级信源(原始论文与技术报告)

  1. Loshchilov, I., & Hutter, F. (2017). Decoupled Weight Decay Regularization. arXiv:1711.05101. [提出 AdamW 的原始论文]
  2. Kingma, D.P., & Ba, J. (2014). Adam: A Method for Stochastic Optimization. arXiv:1412.6980. [Adam 提出论文]
  3. Touvron, H., et al. (2023). LLaMA: Open and Efficient Foundation Language Models. Meta AI Technical Report, arXiv:2302.13971. [首次公开使用 AdamW + β2=0.95 的大模型]
  4. Touvron, H., et al. (2024). The Llama 3 Herd of Models. Meta AI Technical Report, arXiv:2407.21783. [Llama 3 系列完整训练配置]
  5. DeepSeek-AI (2025). DeepSeek-V3 Technical Report. arXiv:2412.19437. [671B MoE 模型的 AdamW 使用确认]
  6. Google DeepMind (2024). Gemma 2: Improving Open Language Models at a Practical Size. Technical Report, arXiv:2408.00118. [β2 动态调度策略]

二级信源(框架文档、实现规范)

  1. PyTorch torch.optim.AdamW 文档: https://pytorch.org/docs/stable/generated/torch.optim.AdamW.html
  2. TensorFlow Keras AdamW 文档: https://www.tensorflow.org/api_docs/python/tf/keras/optimizers/AdamW
  3. Hugging Face Transformers Trainer 参数说明: https://huggingface.co/docs/transformers/main_classes/trainer
  4. Dettmers, T., et al. (2021). LLM.int8(): 8-bit Matrix Multiplication for Transformers at Scale. arXiv:2208.07339. [含 8-bit AdamW 实现]

三级信源(市场数据、行业报告)

  1. Precedence Research. AI Training Computing Market Report 2024–2030. (2024 年 11 月公开摘要, www.precedenceresearch.com)
  2. Grand View Research. MLOps Platform Market Size Report 2024–2030. (2024 年公开摘要, www.grandviewresearch.com)
  3. Linux Foundation. PyTorch State Report 2024. (公开摘要, pytorch.org)

补充研究信源(优化器前沿讨论)

  1. Chen, X., et al. (2023). Symbolic Discovery of Optimization Algorithms. NeurIPS 2023, arXiv:2302.06675. [Lion 优化器提出]
  2. Liu, H., et al. (2023). Sophia: A Scalable Stochastic Second-order Optimizer for Language Model Pre-training. ICLR 2024, arXiv:2305.14342. [Sophia 优化器提出]

注:本文技术描述基于上述公开算法规范和社区共识形成。定量对比数据来自标注来源,未标注“公开资料未见”的数值均有据可查。具体任务上的最优超参数组合依赖于特定模型架构和训练设置,建议直接参阅原始论文获取实验细节。本文不构成对任何算法、框架或公司优于其他方案的价值判断。

source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型