模型層 開放閱讀

持續預訓練

Continual Pretraining

概念 ID
continual-pretraining
更新時間
2026-05-29
來源數量
待補

持續預訓練

3 秒看懂

持續預訓練(Continual Pretraining)是指在大語言模型或其他基礎模型已完成大規模預訓練的基礎上,利用新資料(如新領域文件、事件、詞表)繼續訓練,使得模型獲得新知識的同時儘量保留原有能力。它不是微調,也不是完全從頭訓練,而是“增量式預訓練”——用較少的計算量推動模型適應新的分佈、知識截止點或領域,同時應對災難性遺忘風險。

3 分鐘產業解釋

在基礎模型迭代中,重新預訓練一個千億、萬億引數模型的成本極高(常需數千 GPU - 月)。持續預訓練的產業價值在於:讓已釋出的模型以 1/5~1/10 甚至更低的計算開銷,消化新爬取的網頁、程式碼、論文或多語言語料,從而把知識截止日期從 2023 年推到 2025 年,或讓通用模型獲得醫療、法律等垂直領域的一部分核心能力。工業做法通常混合新舊資料比例,調整學習率,並可能引入重播、彈性權重鞏固等技術來抑制遺忘。這種機制已成為 ChatGPT、Claude、Gemini 等頭部模型持續更新的隱性基礎設施,幫助企業在不從頭燒錢的情況下,保持模型時效性與競爭力。

15 分鐘專家深入

持續預訓練處於“預訓練”與“線上學習”的交叉地帶。它不是一步到位的訓練任務,而是一套圍繞資料混合、訓練穩定性、遺忘控制、評估的工程與方法論體系:

  • 資料工程:新語料往往需要與存留原始預訓練資料(或高質量子集)按比例混合。常見混合比(新:舊)從 1:1 到 1:10 不等,具體取決於領域差異程度。資料去重、過濾、質量打分變得比首次預訓練時更嚴格,因為噪聲更容易引偏已經定型的高維表徵空間。
  • 訓練策略:通常採用學習率預熱-恆定-衰減的簡化版,初始學習率僅為原始預訓練峰值的 1/10~1/100。最佳化器狀態(如 Adam 的動量)常被保留,以延續最佳化軌跡。有時會週期性地進行“重播”(replay)——顯式地在 batch 中插入舊分佈樣本,以錨定原有效能。
  • 遺忘的診斷與緩解:主要監控舊評估集(如 MMLU、HellaSwag)上效能退化。若退化超過 1−2 個絕對百分點,便會被判定為嚴重遺忘。常用策略包括:**彈性權重鞏固(EWC)**通過 Fisher 資訊矩陣懲罰重要引數的劇烈變化;回憶重播保留舊資料快取;L2 正則向舊權重回歸漸進式網路雖在持續預訓練中較罕見,但可提供架構側隔離。
  • 評估體系:除困惑度外,必須建置“新舊無偏”基準集,如動態問答、時間敏感事實、新詞測試等。近年來出現了像 TemporalWiki、StreamingQA 等面向持續學習的評估集,但產業界更多依賴自建 keep-out 評測。

一個持續的爭論是:究竟多大的新資料量才值得做一次持續預訓練?經驗估算,當新增高質量語料量達到原預訓練語料量的 1%−5%,且分佈有明顯偏移時,就可以看到顯著收益;低於該閾值,輕量級微調或檢索增強生成(RAG)可能更經濟。

技術原理(最深)

最佳化目標視角

標準預訓練目標:最大化對數似然 \mathcal{L}(\theta) = \mathbb{E}_{x \sim D_{\text{pretrain}}}[\log P(x;\theta)]。 持續預訓練將其分解為:從已收斂的 \theta_{\text{base}} 出發,在新增資料分佈 D_{\text{new}} 上繼續最佳化,同時不希望遠離 \theta_{\text{base}} 太遠。可形式化為受約束的最佳化:

\max_\theta \; \mathbb{E}_{x \sim D_{\text{new}}}[\log P(x;\theta)] \quad \text{s.t.} \quad \text{KL}(P(\cdot;\theta_{\text{base}}) \| P(\cdot;\theta)) \le \epsilon

或等價地加懲罰項:

\mathcal{L}_{\text{total}} = \mathcal{L}_{\text{new}} + \lambda \cdot \mathcal{L}_{\text{old}} + \mu \cdot R(\theta, \theta_{\text{base}})

其中 R 可以是 L2 距離、EWC 正則項或蒸餾損失。

災難性遺忘的機制

引數空間與功能空間的退相干:新資料梯度方向與舊任務梯度方向高衝突時,引數更新會覆蓋對舊任務至關重要的權重配置。在 Transformer 中,前饋網路的鍵-值聯想記憶(事實記憶)極易被重寫;注意力頭的功能相對穩定,但輸出層的語言建模頭變化會全域性影響生成質量。

關鍵訓練超參與動態

  • 資料排程:多采用“隔板混合”(interleaved blending),即每個 batch 同時包含新舊樣本,而非先訓練新資料再訓練舊資料。原因是跨 batch 的分佈偏移會破壞最佳化器累積的梯度統計量。
  • 學習率衰減跟隨新資料量:不同於從零預訓練遵循餘弦衰減至 0,持續預訓練常使用“恆定+末端急劇衰減”,保證模型能快速適應新分佈又不至於嚴重遺忘。
  • 重置最佳化器狀態:學界有爭論。保留 Adam 一階矩和二階矩可加速收斂,但會耦合舊的梯度方向;清零則相當於部分重啟,訓練初期損失會反彈但可能收斂到更穩定的解。目前多數大型模型實踐傾向於保留並對二階矩進行收縮
方法示意:遺忘約束訓練迴圈
+------------------+       +----------------+
| 新資料流+舊資料快取 | ---> | 混合batch構造  |
+------------------+       +-------+--------+
                                    |
                                    v
                          +---------+---------+
                          | 正向傳播 & 計算損失 |
                          +---------+---------+
                                    |
                   +----------------+----------------+
                   | 加EWC/L2正則項:懲罰引數偏移    |
                   +----------------+----------------+
                                    |
                                    v
                          +---------+---------+
                          | 反向傳播 & 引數更新 |
                          +---------+---------+
                                    |
                                    v
                          +---------+------------+
                          | 週期性重播評估集驗證 |
                          +----------------------+

分散式訓練中的挑戰

持續預訓練與從零預訓練一樣會使用資料並行、張量並行、流水線並行。通訊模式無本質差異,AllReduce(Megatron 張量並行)仍是主要形式。新增挑戰在於:舊權重與最佳化器狀態需要全部保留,儲存開銷未變;資料混合策略需要在多節點間保證一致性;若進行彈性權重鞏固,計算 Fisher 對角需要額外遍歷舊資料,也可用線上估計近似,但會增加約 5%~15% 的每步計算開銷(定性,基於開源自研實驗估算)。

技術演進史

  • 2014−2017 奠基期:深度學習的持續學習研究集中在影像分類。EWC (2017)、Learning without Forgetting 等方法奠定了正則化和重播兩大路線。語言模型領域僅 LoRA 等微調研究為主,未觸及預訓練尺度。
  • 2018−2020 試探期:BERT 時代出現“繼續預訓練”的早期探索,如 BioBERT、SciBERT 在通用 BERT 上繼續用領域語料訓練,但規模小(億級引數),遺忘不是核心矛盾。
  • 2021−2022 規模化期:GPT-3 釋出後,如何重用預訓練基礎成為產業焦點。研究提出動態BERT持續訓練(DBERT)等。學界開始關注流資料下語言模型持續訓練,基準如 TemporalWiki 出現。重現災難性遺忘成為阻礙知識更新的核心工程問題。
  • 2023 至今 大型模型工業化:ChatGPT、GPT-4 等通過週期性資料截止重新整理進行持續預訓練,並在釋出時刻意強調“知識截至 202X 年 X 月”。Llama 2 技術報告描述了用混合資料進行多階段訓練,實際可被視為設計精良的持續預訓練。現在幾乎所有頭部自研模型都依賴此技術保持時效性,同時研究工作轉向更精細的遺忘控制與知識編輯的相結合。

技術路線對比

維度持續預訓練 (Continual Pretraining)微調 (Fine-tuning)檢索增強生成 (RAG)從頭預訓練
資料量級通常 ≥ 數十億 token,可達原語料 1~30%百萬至數千萬 token無直接訓練資料,依賴外部知識庫萬億 token 級
計算開銷 (相對)原預訓練的 5%~20% (估算)0.001%~0.1%推論時附加檢索開銷,訓練零成本100%
核心風險災難性遺忘、訓練不穩定過擬合、通用能力下降檢索失敗、證源質量低成本與時間不可接受
知識整合深度可改變模型內在知識,甚至引入新詞表表面適配,深層知識難注入停留在輸入上下文,無引數化記憶深度整合
典型使用場景更新時間敏感事實、新增新語言/程式碼對話風格、指令跟隨、安全對齊即時資訊查詢、長尾知識模型首次釋出

定量參考(因無精確檢索,採用行業常見公開描述):某 70B 模型首次預訓練約需 1e24 FLOPs,其知識更新版繼續預訓練了 50B 新 token,計算量約 1.5e23 FLOPs,約原預訓練的 15%。遺忘率(以標準基準下滑幅度衡量)可通過混合 10% 舊資料控制在 1% 以內。[具體來源未公開,結合產業部落格估算]

上下游

上游

  • 資料採集與清洗:大規模爬蟲、資料湖、PDF/Word 解析管道,需要處理格式演變和時效性過濾。
  • 儲存與快取系統:舊預訓練資料索引及用於重播的高質量子集必須長期儲存,涉及 PB 級物件儲存。
  • 訓練硬體與排程平台:千卡 GPU 叢集(如 A100、H100),訓練架構需支援混合資料流和斷續訓練的 checkpoint 管理,常見於 Megatron-LM、DeepSpeed、JAX 等生態。
  • 評估集設計:需建置時間敏感或具有明確知識截止的基準。

下游

  • 模型平台與 API 服務:OpenAI API、Anthropic Claude、Google Cloud Vertex AI 等提供持續更新的模型端點。
  • 垂直領域深度定製:醫療、法律、金融等行業先獲取通用持續預訓練模型(有新知識),再在自己的私有資料上微調。
  • AI 應用:搜尋引擎(如 Bing)、辦公套件(Copilot)、程式碼助手(Copilot/GitHub)依賴於底層模型時效性,直接受益於模型的知識重新整理。
  • 模型分發:HuggingFace 等社群的定期更新模型。

關鍵指標

  • 知識新鮮度(Temporal QA 準確率):在動態實體、新事件問答上的效能提升。典型期望:新增資料覆蓋範圍內事實準確率從<30% 提升到 >80%,同時舊事實退化<2%。
  • 標準基準保留率:原評估集(如 MMLU、HellaSwag)準確率下降幅度。行業接受梯度:<1% 無損,1−3% 輕微,>3% 需重新權衡資料配比。
  • 困惑度(PPL):新驗證集 PPL 下降到與首次預訓練收斂相近水平;混合驗證集 PPL 不升高。
  • 單位 FLOPs 的知識增益:既定計算預算下,知識測試評分的增量。是判斷持續預訓練價效比的關鍵。
  • 訓練穩定性:損失 spike 次數、是否出現恢復失效。大型模型在持續訓練後期更易損失突跳。

供需與市場資料

目前沒有獨立的市場研究報告專門量化持續預訓練市場規模,因為它內嵌在基礎模型迭代的研發成本中。然而我們可以通過公開資訊量化需求趨勢:

  • 頭部模型的知識重新整理週期不斷縮短:OpenAI 從 GPT-4 (2023 年 4 月知識截止 2021 年 9 月) 到 GPT-4o (2024 年 5 月釋出,知識更新至 2023 年 10 月),間隔約 13 個月;中間的更新版本推測進行了不止一次持續預訓練。Anthropic Claude 模型知識截止從 2023 年初更新到 2024 年 4 月僅僅隔了數月。持續預訓練成為保持競爭力所必需的研發流程。
  • 推論成本壓力倒逼持續預訓練:若完全依賴 RAG 補充新知識,每次推論成本可能上升數倍,而將知識內化至引數後推論成本不變。因此,許多平台選擇週期性重建模型以減少推論開銷。
  • 供給端:提供持續預訓練工具或平台的公司包括 Together AI、Anyscale、MosaicML (被 Databricks 收購) 等,它們提供“繼續訓練你的模型”的API和最佳化。
  • 學術研究熱度:持續學習領域頂會論文數 2020–2024 年增長約 2.5 倍(Arxiv 統計趨勢),其中大型模型持續預訓練成為細分熱點。

代表公司與資本對映

(注意:以下列出的公司均以公開資訊為基礎,不存在非公開資本細節)

模型提供商

  • OpenAI:持續的模型更新(gpt-4-0409, gpt-4-1106, gpt-4o 等)實質上使用了持續預訓練。資本背景:主要投資者包括 Microsoft [MSFT];[未充分揭露] 2024 上半年媒體估值口徑曾超過 800 億美元,本文未用 A/B 源鎖定,不能作為財務硬錨。
  • Anthropic:Claude 系列知識重新整理,採用讓模型在混合新舊資料上繼續訓練的方式。2024 年融資後估值超過 180 億美元。
  • Google DeepMind:Gemini 系列,通過多階段訓練實現跨模態和時效知識更新。
  • Meta:Llama 3 採用了大規模混合預訓練,並在後續小版本中可能進行增量更新;同時開源社群可對 Llama 進行持續預訓練(如 Chinese-Llama),間接證明了該策略的通用性。

基礎設施/工具公司

  • Databricks (MosaicML):提供“繼續預訓練”產品,允許企業在開源模型上用自有資料持續訓練數億 token。
  • Together AI:提供分散式訓練平台,支援持續預訓練工作負載。
  • Hugging Face:提供模型倉庫和 AutoTrain,社群可釋出持續預訓練後的模型。
  • NVIDIA:提供 NeMo 架構支援持續訓練和混合資料策略,其自有的 Nemotron 系列也經歷此流程。

資本對映:持續預訓練本身不直接誕生估值,但它是頭部模型公司技術護城河的重要一環,直接關聯模型品質和使用者留存。投資邏輯上,前期硬體投入(GPU 大規模叢集)的複用效率是核心,一次原始預訓練投入的上億美元硬體成本,通過持續預訓練將壽命延長,使得單 TCO/效能比最佳化。這支撐了基礎設施公司的長期合約價值。

投資邏輯

  1. 算力複用紅利:企業投資數十萬 GPU 小時完成首次預訓練後,後續只需 10% 左右算力即可重新整理模型,這種“訓練工廠”模式降低了模型持續迭代的邊際成本,變相提高了初始投資回報率。
  2. 時間護城河:競爭對手從頭復現一個知識截止更新的模型需要同等體量的資料和處理時間,已佔據先機的公司通過快速、高頻持續預訓練能拉大知識時效性差距,形成使用者粘性。
  3. 基礎設施需求平穩化:相比於一次性大規模訓練帶來的算力需求尖峰,持續預訓練使 GPU 需求更為持續平滑,有利於雲端廠商和自建叢集企業提高資源利用率,奠定長期合約模式。
  4. 風險提示:若持續預訓練導致過大遺忘,模型在多工上的表現下降,可能會損害自身生態;RAG 或其他免訓練方法若取得突破,可能會削弱持續預訓練需求;資料版權與隱私法規可能導致可用的新資料受限,影響持續訓練效果。
  5. 關注指標:模型釋出後基準分數的變化軌跡;公司揭露的“訓練資料截止日期”更新頻率;算力供應商的持續訓練相關業務增速。

常見誤讀糾偏

  1. “持續預訓練就是拿新資料接著訓練就行”:這是最常見的誤解。直接增量訓練一般會引發嚴重的災難性遺忘,導致模型在舊優勢領域能力明顯退化。現產業界需要精心設計資料混合策略與正則化,甚至保留部分舊資料,才能實現可持續更新。簡單接著訓練往往得不償失。
  2. “持續預訓練與小樣本微調沒本質區別”:兩者在規模、目標和機制上差異顯著。微調通常只更新少量引數或使用小學習率進行格式/任務適配,對模型已儲存的事實性知識改動很小。而持續預訓練更新整個模型的大多數引數,旨在修改長尾知識和事實聯絡,所需資料量和計算量遠超微調,在工程技術上有本質不同的挑戰。

學習路徑

  • 階段一(基礎):閱讀《深度學習》(花書) 中關於最佳化與正則化章節,理解災難性遺忘概念。瀏覽開源教程“Continual Learning for Large Language Models”實現簡單重播實驗。
  • 階段二(進階):精讀三篇經典論文:
    • Kirkpatrick et al., “Overcoming catastrophic forgetting in neural networks” (EWC, 2017)
    • Sun et al., “ERNIE 2.0: A Continual Pre-training Framework for Language Understanding” (2019)
    • Gupta et al., “Continual Pre-Training of Large Language Models: How to warm-start your model” (2023, 探討繼續預訓練的超引數轉移)
  • 階段三(實踐):使用 Hugging Face Transformers 對一個小型 GPT-2 或 LLaMA 類開源模型進行繼續預訓練,使用混合舊資料(維基百科)和新領域資料(如 arXiv 摘要),監控 PPL 和多個評估指標,嘗試引入 EWC 懲罰。
  • 階段四(前沿):追蹤 NeurIPS、ICML 中持續學習與 LLM 相關的 workshop,重點關注知識編輯與持續預訓練的融合、無需舊資料的遺忘緩解(如 data-free continual learning)以及多模態模型的持續訓練。

一句話總結

持續預訓練是基礎模型工業化的“保養-升級”系統,它用比從頭訓練低一個數量級的成本持續注入新知識,同時與災難性遺忘的對抗定義了模型更新能力的上限。

延伸閱讀與來源

注:具體計算開銷、資料配比數字若未註明來源即為[行業估算]或[未充分揭露],僅作定性參考。

source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型