持续预训练
3 秒看懂
持续预训练(Continual Pretraining)是指在大语言模型或其他基础模型已完成大规模预训练的基础上,利用新数据(如新领域文档、事件、词表)继续训练,使得模型获得新知识的同时尽量保留原有能力。它不是微调,也不是完全从头训练,而是“增量式预训练”——用较少的计算量推动模型适应新的分布、知识截止点或领域,同时应对灾难性遗忘风险。
3 分钟产业解释
在基础模型迭代中,重新预训练一个千亿、万亿参数模型的成本极高(常需数千 GPU - 月)。持续预训练的产业价值在于:让已发布的模型以 1/5~1/10 甚至更低的计算开销,消化新爬取的网页、代码、论文或多语言语料,从而把知识截止日期从 2023 年推到 2025 年,或让通用模型获得医疗、法律等垂直领域的一部分核心能力。工业做法通常混合新旧数据比例,调整学习率,并可能引入重播、弹性权重巩固等技术来抑制遗忘。这种机制已成为 ChatGPT、Claude、Gemini 等头部模型持续更新的隐性基础设施,帮助企业在不从头烧钱的情况下,保持模型时效性与竞争力。
15 分钟专家深入
持续预训练处于“预训练”与“在线学习”的交叉地带。它不是一步到位的训练任务,而是一套围绕数据混合、训练稳定性、遗忘控制、评估的工程与方法论体系:
- 数据工程:新语料往往需要与存留原始预训练数据(或高质量子集)按比例混合。常见混合比(新:旧)从 1:1 到 1:10 不等,具体取决于领域差异程度。数据去重、过滤、质量打分变得比首次预训练时更严格,因为噪声更容易引偏已经定型的高维表征空间。
- 训练策略:通常采用学习率预热-恒定-衰减的简化版,初始学习率仅为原始预训练峰值的 1/10~1/100。优化器状态(如 Adam 的动量)常被保留,以延续优化轨迹。有时会周期性地进行“重播”(replay)——显式地在 batch 中插入旧分布样本,以锚定原有性能。
- 遗忘的诊断与缓解:主要监控旧评估集(如 MMLU、HellaSwag)上性能退化。若退化超过 1−2 个绝对百分点,便会被判定为严重遗忘。常用策略包括:**弹性权重巩固(EWC)**通过 Fisher 信息矩阵惩罚重要参数的剧烈变化;回忆重播保留旧数据缓存;L2 正则向旧权重回归;渐进式网络虽在持续预训练中较罕见,但可提供架构侧隔离。
- 评估体系:除困惑度外,必须构建“新旧无偏”基准集,如动态问答、时间敏感事实、新词测试等。近年来出现了像 TemporalWiki、StreamingQA 等面向持续学习的评估集,但产业界更多依赖自建 keep-out 评测。
一个持续的争论是:究竟多大的新数据量才值得做一次持续预训练?经验估算,当新增高质量语料量达到原预训练语料量的 1%−5%,且分布有明显偏移时,就可以看到显著收益;低于该阈值,轻量级微调或检索增强生成(RAG)可能更经济。
技术原理(最深)
优化目标视角
标准预训练目标:最大化对数似然 \mathcal{L}(\theta) = \mathbb{E}_{x \sim D_{\text{pretrain}}}[\log P(x;\theta)]。
持续预训练将其分解为:从已收敛的 \theta_{\text{base}} 出发,在新增数据分布 D_{\text{new}} 上继续优化,同时不希望远离 \theta_{\text{base}} 太远。可形式化为受约束的优化:
\max_\theta \; \mathbb{E}_{x \sim D_{\text{new}}}[\log P(x;\theta)] \quad \text{s.t.} \quad \text{KL}(P(\cdot;\theta_{\text{base}}) \| P(\cdot;\theta)) \le \epsilon
或等价地加惩罚项:
\mathcal{L}_{\text{total}} = \mathcal{L}_{\text{new}} + \lambda \cdot \mathcal{L}_{\text{old}} + \mu \cdot R(\theta, \theta_{\text{base}})
其中 R 可以是 L2 距离、EWC 正则项或蒸馏损失。
灾难性遗忘的机制
参数空间与功能空间的退相干:新数据梯度方向与旧任务梯度方向高冲突时,参数更新会覆盖对旧任务至关重要的权重配置。在 Transformer 中,前馈网络的键-值联想记忆(事实记忆)极易被重写;注意力头的功能相对稳定,但输出层的语言建模头变化会全局影响生成质量。
关键训练超参与动态
- 数据调度:多采用“隔板混合”(interleaved blending),即每个 batch 同时包含新旧样本,而非先训练新数据再训练旧数据。原因是跨 batch 的分布偏移会破坏优化器累积的梯度统计量。
- 学习率衰减跟随新数据量:不同于从零预训练遵循余弦衰减至 0,持续预训练常使用“恒定+末端急剧衰减”,保证模型能快速适应新分布又不至于严重遗忘。
- 重置优化器状态:学界有争论。保留 Adam 一阶矩和二阶矩可加速收敛,但会耦合旧的梯度方向;清零则相当于部分重启,训练初期损失会反弹但可能收敛到更稳定的解。目前多数大模型实践倾向于保留并对二阶矩进行收缩。
方法示意:遗忘约束训练循环
+------------------+ +----------------+
| 新数据流+旧数据缓存 | ---> | 混合batch构造 |
+------------------+ +-------+--------+
|
v
+---------+---------+
| 正向传播 & 计算损失 |
+---------+---------+
|
+----------------+----------------+
| 加EWC/L2正则项:惩罚参数偏移 |
+----------------+----------------+
|
v
+---------+---------+
| 反向传播 & 参数更新 |
+---------+---------+
|
v
+---------+------------+
| 周期性重播评估集验证 |
+----------------------+
分布式训练中的挑战
持续预训练与从零预训练一样会使用数据并行、张量并行、流水线并行。通信模式无本质差异,AllReduce(Megatron 张量并行)仍是主要形式。新增挑战在于:旧权重与优化器状态需要全部保留,存储开销未变;数据混合策略需要在多节点间保证一致性;若进行弹性权重巩固,计算 Fisher 对角需要额外遍历旧数据,也可用在线估计近似,但会增加约 5%~15% 的每步计算开销(定性,基于开源自研实验估算)。
技术演进史
- 2014−2017 奠基期:深度学习的持续学习研究集中在图像分类。EWC (2017)、Learning without Forgetting 等方法奠定了正则化和重播两大路线。语言模型领域仅 LoRA 等微调研究为主,未触及预训练尺度。
- 2018−2020 试探期:BERT 时代出现“继续预训练”的早期探索,如 BioBERT、SciBERT 在通用 BERT 上继续用领域语料训练,但规模小(亿级参数),遗忘不是核心矛盾。
- 2021−2022 规模化期:GPT-3 发布后,如何重用预训练基础成为产业焦点。研究提出动态BERT持续训练(DBERT)等。学界开始关注流数据下语言模型持续训练,基准如 TemporalWiki 出现。重现灾难性遗忘成为阻碍知识更新的核心工程问题。
- 2023 至今 大模型工业化:ChatGPT、GPT-4 等通过周期性数据截止刷新进行持续预训练,并在发布时刻意强调“知识截至 202X 年 X 月”。Llama 2 技术报告描述了用混合数据进行多阶段训练,实际可被视为设计精良的持续预训练。现在几乎所有头部自研模型都依赖此技术保持时效性,同时研究工作转向更精细的遗忘控制与知识编辑的相结合。
技术路线对比
| 维度 | 持续预训练 (Continual Pretraining) | 微调 (Fine-tuning) | 检索增强生成 (RAG) | 从头预训练 |
|---|---|---|---|---|
| 数据量级 | 通常 ≥ 数十亿 token,可达原语料 1~30% | 百万至数千万 token | 无直接训练数据,依赖外部知识库 | 万亿 token 级 |
| 计算开销 (相对) | 原预训练的 5%~20% (估算) | 0.001%~0.1% | 推理时附加检索开销,训练零成本 | 100% |
| 核心风险 | 灾难性遗忘、训练不稳定 | 过拟合、通用能力下降 | 检索失败、证源质量低 | 成本与时间不可接受 |
| 知识集成深度 | 可改变模型内在知识,甚至引入新词表 | 表面适配,深层知识难注入 | 停留在输入上下文,无参数化记忆 | 深度集成 |
| 典型使用场景 | 更新时间敏感事实、添加新语言/代码 | 对话风格、指令跟随、安全对齐 | 实时信息查询、长尾知识 | 模型首次发布 |
定量参考(因无精确检索,采用行业常见公开描述):某 70B 模型首次预训练约需 1e24 FLOPs,其知识更新版继续预训练了 50B 新 token,计算量约 1.5e23 FLOPs,约原预训练的 15%。遗忘率(以标准基准下滑幅度衡量)可通过混合 10% 旧数据控制在 1% 以内。[具体来源未公开,结合产业博客估算]
上下游
上游:
- 数据采集与清洗:大规模爬虫、数据湖、PDF/Word 解析管道,需要处理格式演变和时效性过滤。
- 存储与缓存系统:旧预训练数据索引及用于重播的高质量子集必须长期保存,涉及 PB 级对象存储。
- 训练硬件与调度平台:千卡 GPU 集群(如 A100、H100),训练框架需支持混合数据流和断续训练的 checkpoint 管理,常见于 Megatron-LM、DeepSpeed、JAX 等生态。
- 评估集设计:需构建时间敏感或具有明确知识截止的基准。
下游:
- 模型平台与 API 服务:OpenAI API、Anthropic Claude、Google Cloud Vertex AI 等提供持续更新的模型端点。
- 垂直领域深度定制:医疗、法律、金融等行业先获取通用持续预训练模型(有新知识),再在自己的私有数据上微调。
- AI 应用:搜索引擎(如 Bing)、办公套件(Copilot)、代码助手(Copilot/GitHub)依赖于底层模型时效性,直接受益于模型的知识刷新。
- 模型分发:HuggingFace 等社区的定期更新模型。
关键指标
- 知识新鲜度(Temporal QA 准确率):在动态实体、新事件问答上的性能提升。典型期望:新增数据覆盖范围内事实准确率从<30% 提升到 >80%,同时旧事实退化<2%。
- 标准基准保留率:原评估集(如 MMLU、HellaSwag)准确率下降幅度。行业接受梯度:<1% 无损,1−3% 轻微,>3% 需重新权衡数据配比。
- 困惑度(PPL):新验证集 PPL 下降到与首次预训练收敛相近水平;混合验证集 PPL 不升高。
- 单位 FLOPs 的知识增益:既定计算预算下,知识测试评分的增量。是判断持续预训练性价比的关键。
- 训练稳定性:损失 spike 次数、是否出现恢复失效。大模型在持续训练后期更易损失突跳。
供需与市场数据
目前没有独立的市场研究报告专门量化持续预训练市场规模,因为它内嵌在基础模型迭代的研发成本中。然而我们可以通过公开信息量化需求趋势:
- 头部模型的知识刷新周期不断缩短:OpenAI 从 GPT-4 (2023 年 4 月知识截止 2021 年 9 月) 到 GPT-4o (2024 年 5 月发布,知识更新至 2023 年 10 月),间隔约 13 个月;中间的更新版本推测进行了不止一次持续预训练。Anthropic Claude 模型知识截止从 2023 年初更新到 2024 年 4 月仅仅隔了数月。持续预训练成为保持竞争力所必需的研发流程。
- 推理成本压力倒逼持续预训练:若完全依赖 RAG 补充新知识,每次推理成本可能上升数倍,而将知识内化至参数后推理成本不变。因此,许多平台选择周期性重建模型以减少推理开销。
- 供给端:提供持续预训练工具或平台的公司包括 Together AI、Anyscale、MosaicML (被 Databricks 收购) 等,它们提供“继续训练你的模型”的API和优化。
- 学术研究热度:持续学习领域顶会论文数 2020–2024 年增长约 2.5 倍(Arxiv 统计趋势),其中大模型持续预训练成为细分热点。
代表公司与资本映射
(注意:以下列出的公司均以公开信息为基础,不存在非公开资本细节)
模型提供商:
- OpenAI:持续的模型更新(gpt-4-0409, gpt-4-1106, gpt-4o 等)实质上使用了持续预训练。资本背景:主要投资者包括 Microsoft
[MSFT];[未充分披露] 2024 上半年媒体估值口径曾超过 800 亿美元,本文未用 A/B 源锁定,不能作为财务硬锚。 - Anthropic:Claude 系列知识刷新,采用让模型在混合新旧数据上继续训练的方式。2024 年融资后估值超过 180 亿美元。
- Google DeepMind:Gemini 系列,通过多阶段训练实现跨模态和时效知识更新。
- Meta:Llama 3 采用了大规模混合预训练,并在后续小版本中可能进行增量更新;同时开源社区可对 Llama 进行持续预训练(如 Chinese-Llama),间接证明了该策略的通用性。
基础设施/工具公司:
- Databricks (MosaicML):提供“继续预训练”产品,允许企业在开源模型上用自有数据持续训练数亿 token。
- Together AI:提供分布式训练平台,支持持续预训练工作负载。
- Hugging Face:提供模型仓库和 AutoTrain,社区可发布持续预训练后的模型。
- NVIDIA:提供 NeMo 框架支持持续训练和混合数据策略,其自有的 Nemotron 系列也经历此流程。
资本映射:持续预训练本身不直接诞生估值,但它是头部模型公司技术护城河的重要一环,直接关联模型品质和用户留存。投资逻辑上,前期硬件投入(GPU 大规模集群)的复用效率是核心,一次原始预训练投入的上亿美元硬件成本,通过持续预训练将寿命延长,使得单 TCO/性能比优化。这支撑了基础设施公司的长期合约价值。
投资逻辑
- 算力复用红利:企业投资数十万 GPU 小时完成首次预训练后,后续只需 10% 左右算力即可刷新模型,这种“训练工厂”模式降低了模型持续迭代的边际成本,变相提高了初始投资回报率。
- 时间护城河:竞争对手从头复现一个知识截止更新的模型需要同等体量的数据和处理时间,已占据先机的公司通过快速、高频持续预训练能拉大知识时效性差距,形成用户粘性。
- 基础设施需求平稳化:相比于一次性大规模训练带来的算力需求尖峰,持续预训练使 GPU 需求更为持续平滑,有利于云厂商和自建集群企业提高资源利用率,奠定长期合约模式。
- 风险提示:若持续预训练导致过大遗忘,模型在多任务上的表现下降,可能会损害自身生态;RAG 或其他免训练方法若取得突破,可能会削弱持续预训练需求;数据版权与隐私法规可能导致可用的新数据受限,影响持续训练效果。
- 关注指标:模型发布后基准分数的变化轨迹;公司披露的“训练数据截止日期”更新频率;算力供应商的持续训练相关业务增速。
常见误读纠偏
- “持续预训练就是拿新数据接着训练就行”:这是最常见的误解。直接增量训练一般会引发严重的灾难性遗忘,导致模型在旧优势领域能力明显退化。现产业界需要精心设计数据混合策略与正则化,甚至保留部分旧数据,才能实现可持续更新。简单接着训练往往得不偿失。
- “持续预训练与小样本微调没本质区别”:两者在规模、目标和机制上差异显著。微调通常只更新少量参数或使用小学习率进行格式/任务适配,对模型已存储的事实性知识改动很小。而持续预训练更新整个模型的大多数参数,旨在修改长尾知识和事实联系,所需数据量和计算量远超微调,在工程技术上有本质不同的挑战。
学习路径
- 阶段一(基础):阅读《深度学习》(花书) 中关于优化与正则化章节,理解灾难性遗忘概念。浏览开源教程“Continual Learning for Large Language Models”实现简单重播实验。
- 阶段二(进阶):精读三篇经典论文:
- Kirkpatrick et al., “Overcoming catastrophic forgetting in neural networks” (EWC, 2017)
- Sun et al., “ERNIE 2.0: A Continual Pre-training Framework for Language Understanding” (2019)
- Gupta et al., “Continual Pre-Training of Large Language Models: How to warm-start your model” (2023, 探讨继续预训练的超参数转移)
- 阶段三(实践):使用 Hugging Face Transformers 对一个小型 GPT-2 或 LLaMA 类开源模型进行继续预训练,使用混合旧数据(维基百科)和新领域数据(如 arXiv 摘要),监控 PPL 和多个评估指标,尝试引入 EWC 惩罚。
- 阶段四(前沿):追踪 NeurIPS、ICML 中持续学习与 LLM 相关的 workshop,重点关注知识编辑与持续预训练的融合、无需旧数据的遗忘缓解(如 data-free continual learning)以及多模态模型的持续训练。
一句话总结
持续预训练是基础模型工业化的“保养-升级”系统,它用比从头训练低一个数量级的成本持续注入新知识,同时与灾难性遗忘的对抗定义了模型更新能力的上限。
延伸阅读与来源
- “Continual Pre-training of Large Language Models” — Z. Ke et al., 2023,系统研究了继续预训练时的数据和训练策略
- “TemporalWiki: A Dynamic Knowledge Base for Evaluating Time-sensitive QA” — Jang et al., 2022,时间敏感评估基准
- “Overcoming catastrophic forgetting in neural networks” — Kirkpatrick et al., 2017,提出 EWC,奠基之作
- Meta AI “Llama 2: Open Foundation and Fine-Tuned Chat Models” 技术报告(2023),描述多阶段混合训练实践
- OpenAI 官方博客 “GPT-4” 技术报告(2023),虽未详述持续预训练细节,但知识截止日期和模型版本的演进隐含此策略
- “Towards Continual Knowledge Learning of Language Models” — Jang et al., 2022,对持续预训练与遗忘问题的综述
- 行业分析:Databricks 收购 MosaicML 相关公告, 2023; Together AI 平台文档。
注:具体计算开销、数据配比数字若未注明来源即为[行业估算]或[未充分披露],仅作定性参考。