模型層 開放閱讀

預訓練

Pretraining

概念 ID
pretraining
更新時間
2026-05-29
來源數量
待補

預訓練

3 秒看懂

預訓練是深度學習模型的“通識教育”階段:在海量無標註資料上,讓模型通過自監督學習(如填詞、預測下一詞)掌握通用語義、視覺或跨模態規律,再把這份“通才”能力遷移到下游具體任務(微調或零樣本推論)。先學萬物常識,再做專業任務。

3 分鐘產業解釋

預訓練已從學術技巧演進為產業競爭的主戰場。以**大語言模型(LLM)**為代表的預訓練模型,正重構AI產業分工:

  • 範式:模型先在TB~PB級通用語料上完成耗時數週、燒掉數百萬美元算力的預訓練,獲得強大的語言理解與生成基座;再通過輕量微調或提示工程適配客服、寫作、程式設計等場景。
  • 成本結構:預訓練決定了模型能力的“天花板”,其算力消耗通常佔整個模型生命週期總成本的絕大部分。一次千億引數模型的預訓練可能需要數千塊GPU執行數週,電力與裝置折舊高達數百萬至上千萬美元(行業估算)。
  • 資料壁壘:高質量、去重、多語言、覆蓋各領域的長文本資料已成為戰略資源,資料清洗與配比直接影響模型知識邊界和安全性。
  • 開源vs閉源:Meta的LLaMA系列、Mistral等開源模型降低了應用門檻,雖在頂尖基準上可能弱於GPT‑4級閉源模型,但通過社群微調迅速滲透企業私有化部署。

預訓練是AI產業鏈中集中度最高、門檻最硬、對算力依賴最強的環節,正在催生“基礎模型即服務(FMaaS)”的新業態。

15 分鐘專家深入

預訓練的本質是利用自監督訊號從原始資料中提取可遷移的表示,其背後是三個關鍵問題的系統權衡:

  1. 訓練目標設計

    • 掩碼語言建模 (MLM):像完形填空,隨機遮住部分輸入,要求模型還原。典型目標:BERT的“Masked LM”。
    • 因果語言建模 (CLM):自迴歸地逐詞預測下一個詞,構成流暢生成的基礎。GPT系列以此為核心。
    • 去噪自動編碼:打亂或替換輸入片段,再恢復原文,如T5的Span Corruption。
    • 對比學習:拉開正樣本對(語義相近的文本/影像-文本)與負樣本對的距離。代表作:SimCLR、CLIP。
  2. 模型架構適配

    • 僅編碼器(如BERT):雙向關注上下文,擅長理解類任務,但不能直接生成。
    • 僅解碼器(如GPT):自迴歸生成,當前的大語言模型主流架構,可通過縮放展現湧現能力。
    • 編碼器‑解碼器(如T5、BART):兼顧理解與生成,在翻譯、摘要等任務上靈活,但在極大規模時未佔優勢。
    • 多模態擴充套件:在影像、語音、影片等模態上分別設計編碼器,通過對齊(如對比學習)或自迴歸融合,建置跨模態基座。
  3. 分散式訓練策略
    為支撐萬億引數模型,必須將計算、儲存、通訊進行三維並行拆分:

    • 資料並行:每個裝置擁有完整模型副本,並行處理不同批次資料,梯度在裝置間AllReduce同步。
    • 張量並行:將Transformer層的權重矩陣切分到多裝置,通訊依賴AllReduce/ReduceScatter,對卡間頻寬要求極高。
    • 流水線並行:將模型按層切分,各裝置負責連續幾層,資料像流水線般傳遞,減少空閒等待。
    • 序列並行專家並行:前者對長序列維度切分;後者在MoE(混合專家)架構中將不同Token路由到不同專家,通訊模式以All‑to‑All為主。

預訓練的“魔力”還來自尺度效應:當模型引數、資料量、計算量同步擴大時,模型不僅在下游任務上單調提升,還可能湧現出上下文學習、思維鏈等原先小模型完全不具備的能力。然而“尺度定律”的斜率正在放緩,研究者開始追求更高資料質量和更高效的訓練範式。

技術原理

以Transformer解碼器架構下的因果語言建模為例,剖析預訓練最深層的機制。

Transformer 自注意力核心

模型將輸入序列對映為查詢 Q、鍵 K、值 V 三組向量,自注意力計算:
Attention(Q, K, V) = softmax(QK^T / √d_k + Mask) V
其中Mask保證位置t只能看到自身及之前的資訊,實現單向上下文。

預訓練前向與損失

給定一段文本x = (x_1, x_2, ..., x_n),模型逐位置預測下一個Token的機率p_θ(x_t | x_<t)
訓練目標是最大化對數似然:
L(θ) = -∑_{t=1}^n log p_θ(x_t | x_<t)
實際操作中通過Teacher Forcing一次性計算所有位置的損失,極大提高並行效率。

混合精度與最佳化

為加速訓練且節省視訊記憶體,普遍採用FP16/BF16混合精度:前向與反向傳播用半精度,引數更新維持FP32主副本。最佳化器多用AdamW,其解耦的權重衰減策略有助於大型模型訓練的穩定。

分散式訓練的通訊模式(ASCII示意)

+-----------+      AllReduce (梯度求和)    +-----------+
|   GPU 0   | <------------------------> |   GPU 1   |
+-----------+                             +-----------+
      |                                        |
      |  張量並行:正向/反向 AllReduce         |
      |                                        |
+-----------+     流水線並行:啟用 P2P 傳     +-----------+
|   GPU 2   | ------------------------------> |   GPU 3   |
+-----------+                                  +-----------+

MoE 專家路由:All-to-All (Token分發與聚合)

關鍵引數(定性):

  • 批次大小:通常達到全域性數千Token,需平衡梯度噪聲與收斂速度。
  • 學習率排程:採用預熱(warmup) + 餘弦衰減,避免訓練早期的不穩定。
  • 計算量估算(估算公式,非特定模型資料):C ≈ 6 N D,其中N為引數量,D為訓練Token數。[未充分揭露具體常量,上述為通用理論推導]

資料預處理流水線

原始網頁/文件 → 語言過濾 & 質量評分 → 去重(URL、文件級、段落級)→ 個性化資訊脫敏 → 分詞(BPE/WordPiece/SentencePiece) → 打包為定長序列。這一流程的質量決定了預訓練模型的知識上限。

技術演進史

  • 2013‑2016(詞嵌入與上下文稀疏表示):Word2Vec、GloVe提供靜態詞向量。
  • 2017‑2018(Transformer與預訓練爆發):“Attention Is All You Need”奠定底層架構;ULMFiT證明了遷移學習在NLP可行;ELMo用雙向LSTM產生動態表示,展示了上下文感知的優勢;BERT(2018)通過掩碼語言建模和下一句預測,將預訓練範式推向所有NLP任務,成為里程碑。
  • 2019‑2020(規模化與生成式預訓練):GPT‑2展示自迴歸語言模型的零樣本能力;T5統一了所有NLP任務為文本到文本格式;GPT‑3(2020)以175B引數呈現上下文學習,標誌“規模即能力”的時代。
  • 2021‑2022(程式碼、對齊與多模態):Codex/CodeGen引入程式碼預訓練,提升邏輯推論;CLIP、DALL·E預訓練對齊影像與文本;ViT將純Transformer用於影像預訓練(有監督分類,如ImageNet-21k)。
  • 2023‑2024(開放生態與長上下文):LLaMA(1/2/3)、Mistral等開源模型以更小引數展現強勁效能;長上下文擴充套件從數K到百萬Token;MoE架構(如Mixtral、Qwen‑MoE)在固定算力下提升效果;多模態統一預訓練成為前沿方向。

技術路線對比(量化表)

路線典型模型預訓練任務優勢侷限主要適用場景
自迴歸語言模型GPT‑4, LLaMA 3因果語言建模 (CLM)強生成能力,湧現上下文學習/推論雙向上下文較差,推論生成需順序解碼偏慢聊天、創作、程式碼生成
掩碼自編碼BERT, RoBERTa掩碼語言建模 (Masked LM)雙向語義理解強,微調效率高不能直接生成文本,難以擴充套件至極大規模文本分類、實體識別
編碼器‑解碼器T5, BART, UL2去噪重構 (Span Corruption)靈活適配理解與生成,一模型多用在大型模型競賽中未被優先選擇翻譯、摘要、問答
對比多模態CLIP, SigLIP圖文對比 (Contrastive)跨模態檢索,零樣本分類,魯棒性強生成能力有限,需額外解碼器視覺搜尋、多模態理解
掩碼自編碼(CV)MAE, SimMIM掩碼影像塊重建 (MIM)高效學習視覺表示,無需標註下游任務通常需額外檢測頭影像分類、目標檢測
擴散預訓練DiT (Diffusion)加噪去噪生成高質量影像/影片生成,可控性強文本理解較弱,通常需結合文本編碼器文生圖、影片生成

上下游

上游(為預訓練提供“原料”與“產線”):

  • 算力硬體:GPU/TPU叢集、高速網際網路絡(InfiniBand/RoCE)。
  • 資料工程:大規模資料爬取、清洗、標註平台,合成數據生成工具。
  • 訓練架構:DeepSpeed、Megatron‑LM、Colossal‑AI等分散式訓練引擎;Hugging Face Transformers簡化模型實現。

下游(消費預訓練成果):

  • 模型微調與適配:企業通過LoRA/QLoRA等引數高效微調,將基座模型適配到客服、法務、醫療等垂直領域。
  • 模型即服務(MaaS):OpenAI API、百度智慧雲端千帆等,提供推論介面,按Token計費。
  • 端側部署:通過蒸餾、量化將預訓練能力壓縮至手機、汽車等裝置。

關鍵指標

  • 模型引數量:影響記憶容量與推論成本,並非越大越好。當前大規模預訓練常採用MoE架構,通過啟用引數(實際參與計算的引數)而非總引數衡量算力需求。
  • 訓練計算量(FLOPs):核心資源度量,數十億至數萬億TFLOPs不等。
  • 訓練資料量 & 資料質量:Token數量是基礎,但資料去重比例、知識覆蓋度、有害內容過濾率同等關鍵。
  • 預訓練損失(Perplexity / Cross‑Entropy):反映模型對資料壓縮的程度,但不可作為下游效能的唯一指標。
  • 零樣本/少樣本 benchmark 得分:如MMLU、HumanEval、多語言理解分數,是產業界對齊能力的通用標尺。

供需與市場資料

  • 算力供給:高階GPU(如NVIDIA H100等)長期供不應求,交付週期和價格嚴重影響預訓練計劃。雲端廠商租賃叢集等待時間可長達數月。
  • 基礎模型供給:形成“閉源旗艦 + 開源追趕”的雙層結構。閉源模型(GPT‑4級別)通過API控制供給;開源模型(LLaMA系列)使中小團隊也能微調出定製模型,推動社群創新。
  • 市場趨勢:全球預訓練相關投入正從“證明可訓”轉向“如何訓得高效、便宜”。有估算認為,一次頂級模型的預訓練電費及硬體折舊成本已達千萬美元級,行業正在探索稀疏計算、蒸餾和模型壓縮以控制邊際成本。[具體市場數值未公開檢索確認,僅基於行業公開討論定性]

代表公司與資本對映

角色代表機構資本/資源特點
頂級閉源模型研發OpenAI (GPT‑4), Google DeepMind (Gemini)鉅額融資+科技巨頭供血,深度繫結雲端與算力
開源力量與算力變現Meta (LLaMA), Mistral AI開源建立生態,吸聚開發者,反哺雲端業務/品牌
國產預訓練先鋒百度文心, 智譜AI (ChatGLM), 阿里通義國家政策+網際網路生態,自研軟硬體並行
算力“賣鏟人”NVIDIA, AMDAI算力核心供應商,資本追捧
訓練平台與工具鏈Hugging Face, 微軟/雲端伺服器平台型企業,匯聚預訓練與微調流量

投資邏輯

  1. 算力先於模型:預訓練熱潮拉動訓練與推論晶片、光模組、液冷等硬體持續需求,確定性較高。
  2. 資料工程工具:高質量資料篩選、合成、版權合規的中介軟體將成為稀缺服務。
  3. 模型能力“厚度”決定護城河:具備持續Scaling能力並能在多模態、工具使用上保持前沿的閉源模型,有望通過API建置平台型生態。
  4. 開源模型的差異化微調機會:藉助低秩適配(LoRA),垂類資料持有者可低門檻打造專業模型,形成資料飛輪。

常見誤讀糾偏

  1. “預訓練就是從頭到尾把模型所有能力都訓好”
    糾偏:預訓練獲得的是通用基座,後續的微調、對齊(RLHF)、提示工程對實際產品表現同樣關鍵。且很多模型會進行“繼續訓練”或“增量預訓練”來注入新知識,並非一次完成。
  2. “引數越多,模型越強”
    糾偏:引數總量不等於智慧。MoE架構通過只啟用部分專家,可在相同算力下提升效果;資料質量、訓練穩定性和架構選擇也能讓小模型表現超過瞎堆引數的大型模型。湧現能力與計算量、資料量、引數量三重尺度關聯,而非單看引數量。
  3. “預訓練只能用於語言”
    糾偏:計算機視覺(MAE、ViT)、語音識別(Wav2Vec)、藥物發現(分子預訓練)以及多模態統一預訓練都已經成規模應用。預訓練是一種通用方法論。

學習路徑

  1. 基礎:通讀《Attention Is All You Need》,理解自注意力。
  2. 預訓練鼻祖:BERT論文《Pre-training of Deep Bidirectional Transformers》與GPT‑2論文。
  3. 程式碼實踐:使用Hugging Face Transformers載入BERT/GPT‑2,嘗試微調任務。
  4. 規模化:閱讀GPT‑3《Language Models are Few‑Shot Learners》和Chinchilla縮放定律論文,理解算力與資料配比。
  5. 分散式訓練:上手Megatron‑LM/DeepSpeed示例,瞭解3D並行。
  6. 前沿:關注LLaMA開源原始碼、多模態預訓練(如BLIP‑2)、MoE架構技術報告。

一句話總結

預訓練是深度學習將海量無標註資料壓縮為通用認知的工程奇蹟,它定義了AI能力的天花板,其規模、資料與架構的博弈是當今人工智慧競爭的核心軸線。

延伸閱讀與來源

本次聯網檢索未提供可直接引用的即時資料,以下推薦經典文獻與開源資源,供進一步深度學習(均為業界公認基礎資料,非本次搜尋返回結果):

  • Vaswani et al. “Attention Is All You Need” (2017) – Transformer架構基石。
  • Devlin et al. “BERT: Pre-training of Deep Bidirectional Transformers” (2019) – 掩碼語言模型預訓練範式。
  • Brown et al. “Language Models are Few‑Shot Learners” (2020) – GPT‑3及湧現能力。
  • Kaplan et al. “Scaling Laws for Neural Language Models” (2020) – 引數量與計算量的尺度關係。
  • Touvron et al. “LLaMA: Open and Efficient Foundation Language Models” (2023) – 開源高效預訓練實踐。
  • DeepSpeed與Megatron‑LM開源文件,Hugging Face Transformers庫。

(由於資料獲取受限,所有具體硬體規格、精確市場資料均未給出確切數字,實際投資及技術選型需以官方白皮書或專業行業報告為準。)

source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型