模型層 開放閱讀

掩碼語言模型

Masked Language Model, MLM

概念 ID
masked-language-model-mlm
更新時間
2026-05-29
來源數量
待補

掩碼語言模型 (Masked Language Model, MLM)

3 秒看懂

一句話: 把句子裡的詞隨機遮住,讓模型猜被遮住的是什麼——猜對了說明模型”懂了”語言。這就是 BERT 背後的核心訓練範式。

3 分鐘產業解釋

掩碼語言模型(MLM)是自然語言處理(NLP)領域最重要的預訓練範式之一,由 Google 團隊在 2018 年釋出的 BERT(Bidirectional Encoder Representations from Transformers)論文中提出並系統化。

核心思想極簡: 給模型一段文本,隨機遮蓋其中約 15% 的 token,訓練目標是讓模型根據雙向上下文還原被遮蓋的內容。這與 GPT 系列的自迴歸(從左到右逐詞預測)形成根本性區別——MLM 在預測時同時看到左側和右側的上下文,因此獲得更”深”的語言理解能力。

產業意義:

  • 開啟了預訓練-微調範式(Pre-train then Fine-tune): 在大規模無標註語料上預訓練 MLM,再在下游任務(分類、問答、NER 等)上用少量標註資料微調,大幅降低 NLP 應用的資料門檻。
  • 催生了 NLP 商用化浪潮: 2019-2021 年間,幾乎所有搜尋、客服、文件理解、法律/醫療 NLP 產品都以 BERT 類模型為基座。
  • 訓練計算量巨大: BERT-Large 在原文獻中使用了 16 個 Cloud TPU Pod(共 64 個 TPU 晶片)訓練約 4 天 [原始論文],這推動了 AI 算力產業的需求爆發。
  • 至今仍活躍: RoBERTa、ALBERT、DeBERTa、ELECTRA 等一系列改進均建立在 MLM 或其變體之上;Encoder-only 架構在工業界任務中(資訊檢索、語義相似度、命名實體識別)仍廣泛使用。

15 分鐘專家深入

從自迴歸到雙向:MLM 誕生的邏輯鏈

維度自迴歸 LM(GPT 系列)掩碼語言模型(BERT 系列)
訓練方向左→右,單向雙向(同時看左和右)
訓練任務Next Token PredictionMasked Token Prediction
天然適配文本生成文本理解(NLU)
推論方式自迴歸逐 token一次前向傳播完成
代表模型GPT、GPT-2/3/4BERT、RoBERTa、DeBERTa

MLM 的關鍵設計選擇

1. 掩碼比例:15% BERT 原論文 [Devlin et al., 2019] 確立了掩碼 15% token 的慣例。比例太低則訓練訊號稀疏、效率低;比例太高則上下文資訊損失嚴重,模型難以推斷。15% 是實驗調優後的平衡點。

2. 掩碼策略:80-10-10 規則 對被選中的 15% token:

  • 80% 替換為 [MASK] 特殊標記
  • 10% 替換為隨機 token
  • 10% 保持不變

為什麼不做 100% [MASK]?因為微調和推論時輸入中不存在 [MASK] 標記,100% [MASK] 會導致預訓練與微調之間的分佈不匹配(mismatch)。加入隨機替換和保持不變迫使模型在所有情況下都依賴上下文建模。

3. 損失函式 僅在被掩碼位置計算交叉熵損失(Cross-Entropy Loss),未掩碼位置不貢獻梯度。這與自迴歸 LM 在每個位置都計算損失形成對比——意味著 MLM 每個訓練樣本的有效監督訊號量相對更少,需要更多資料和步數達到同等效果。

4. 架構選擇:Transformer Encoder MLM 天然需要雙向注意力(Bidirectional Self-Attention),每個 token 可以 attend 到序列中所有其他 token(包括左側和右側)。這對應 Transformer 的 Encoder 部分(無 causal mask),而非 Decoder(有 causal mask,只能看左側)。

5. 下一句預測(NSP)輔助任務 BERT 原始設計中,除了 MLM 還加入了 NSP 任務:給模型兩個句子,判斷它們是否是原文中相鄰的句子。但後續研究(RoBERTa [Liu et al., 2019])通過實驗表明 NSP 對下游效能貢獻有限甚至有害,此後大多數 MLM 變體去掉了 NSP。

為什麼雙向如此重要?

考慮句子:

“The animal didn’t cross the street because it was too ____.”

要填空,需要理解 “it” 指代什麼。單向模型只能看到 “it was too” 之前的內容;雙向模型同時看到後面可能的線索(如後續句子中 “tired” 還是 “wide”),對指代消解(coreference resolution)等任務有本質優勢。

MLM 的內在侷限

  1. 訓練效率低: 每個樣本僅 15% token 提供損失,相比自迴歸 LM 每個 token 都有損失,資料利用率低約 5-6 倍。
  2. 獨立性假設: BERT 的 MLM 假設被掩碼 token 之間條件獨立——即同時預測多個被掩碼詞時,模型不建模它們之間的依賴關係。這在直覺上是不合理的(例如掩碼了”New”和”York”,兩者應該強相關),但實踐中簡化實現效果尚可。
  3. 推論時 [MASK] 不出現: 預訓練依賴 [MASK] 標記,但下游任務輸入中無此標記,存在內在矛盾。

技術原理(機制級)

掩碼語言模型的前向與訓練流程

┌─────────────────────────────────────────────────────────┐
│                    輸入處理階段                           │
│                                                         │
│  原始: "The capital of France is [Paris]"               │
│                         ↓                               │
│  選中15% token 掩碼: "The capital of [MASK] is [MASK]"  │
│  (應用 80-10-10 規則)                                    │
│                         ↓                               │
│  Tokenizer → Token IDs: [101, 1996, 3007, 1997,        │
│                           103, 2003, 103, 102]          │
│  (103 = [MASK] token id, 101 = [CLS], 102 = [SEP])     │
└─────────────────────────────────────────────────────────┘

┌─────────────────────────────────────────────────────────┐
│               Transformer Encoder (×N層)                 │
│                                                         │
│  每一層包含:                                              │
│  ┌───────────────────────────────────────────┐          │
│  │ Multi-Head Self-Attention (雙向, 無因果遮罩) │          │
│  │   Q = X·W_Q,  K = X·W_K,  V = X·W_V       │          │
│  │   Attention(Q,K,V) = softmax(QK^T/√d_k)V  │          │
│  │   → 每個 token 可以看到所有其他 token       │          │
│  └───────────────────────────────────────────┘          │
│                         ↓                               │
│  ┌───────────────────────────────────────────┐          │
│  │ Add & LayerNorm                           │          │
│  └───────────────────────────────────────────┘          │
│                         ↓                               │
│  ┌───────────────────────────────────────────┐          │
│  │ Feed-Forward Network (2層 MLP + GELU)     │          │
│  └───────────────────────────────────────────┘          │
│                         ↓                               │
│  ┌───────────────────────────────────────────┐          │
│  │ Add & LayerNorm                           │          │
│  └───────────────────────────────────────────┘          │
└─────────────────────────────────────────────────────────┘

┌─────────────────────────────────────────────────────────┐
│                    MLM Head (預測頭)                      │
│                                                         │
│  僅提取 [MASK] 位置的隱藏狀態 h_masked                   │
│         ↓                                               │
│  h_masked → Dense(隱藏維度→詞表大小) → softmax           │
│         ↓                                               │
│  預測分佈 P(token | context)                             │
│         ↓                                               │
│  Loss = CrossEntropy(P, 真實token)                      │
│  (僅對被掩碼位置求和, 再取平均)                           │
└─────────────────────────────────────────────────────────┘

關鍵引數量級(以 BERT-Base 為例)

引數BERT-BaseBERT-Large
層數 (L)1224
隱藏維度 (d_model)7681024
注意力頭數 (h)1216
引數量~110M~340M
最大序列長度512512
詞表大小30,522 (WordPiece)30,522
啟用函式GELUGELU
學習率1e-41e-4 (原文獻)

資料來源: 以上資料來自 [Devlin et al., 2019] 原論文 Table 1。

自注意力的雙向性(與因果遮罩的區別)

自迴歸 LM (Decoder, 因果遮罩):          MLM (Encoder, 雙向):

  t1  t2  t3  t4                          t1  t2  t3  t4
t1 [✓] [✗] [✗] [✗]                     t1 [✓] [✓] [✓] [✓]
t2 [✓] [✓] [✗] [✗]                     t2 [✓] [✓] [✓] [✓]
t3 [✓] [✓] [✓] [✗]                     t3 [✓] [✓] [✓] [✓]
t4 [✓] [✓] [✓] [✓]                     t4 [✓] [✓] [✓] [✓]

✓ = 可以attend到    ✗ = 被遮罩(不可見)    所有位置互相可見

MLM 使用全連線注意力圖,沒有任何因果遮罩。這是其雙向語義理解能力的結構基礎。

MLM 與 CLM 的損失計算對比

CLM (Causal LM):  每個位置都計算 loss
位置:    [The] [capital] [of]  [France] [is]  [Paris]
損失:     ✓      ✓        ✓      ✓       ✓     ✓
有效監督: 6/6 = 100%

MLM (Masked LM):  僅掩碼位置計算 loss
位置:    [The] [capital] [of]  [MASK]  [is]  [MASK]
損失:     ✗      ✗        ✗      ✓      ✗     ✓
有效監督: 2/6 ≈ 33%  (實際為被掩碼的15%)

技術演進史

2013  Word2Vec (Mikolov) ──────────────────────────────┐
       ↓                                                │
2014  GloVe (Pennington)                                │
       ↓  (靜態詞向量時代)                               │
2017  Transformer (Vaswani et al.) ─ "Attention is All │
       ↓  You Need"                                     │
2018  ELMo (Peters et al.) ─ 基於 BiLSTM 的上下文       │
       ↓  詞表示                                        │
2018.06 GPT-1 (OpenAI) ─ Transformer Decoder +          │
       ↓   自迴歸預訓練                                  │
2018.10 ★ BERT (Google) ─ Transformer Encoder +          │
       ↓   MLM + NSP 預訓練; NLP 里程碑                  │
2019.02 GPT-2 (OpenAI) ─ 規模擴充套件 + 零樣本              │
       ↓                                                │
2019.07 RoBERTa (Facebook) ─ 去 NSP, 動態掩碼,          │
       ↓   更多資料, 更長訓練; MLM 最佳實踐                │
2019.09 ALBERT (Google) ─ 引數共享 + 句序預測(SOP)       │
       ↓   替代 NSP                                     │
2019.10 XLNet (Yang et al.) ─ 排列語言模型(PLM),        │
       ↓   試圖融合 AR 與 AE 優勢                        │
2020  ELECTRA (Clark et al.) ─ Replaced Token           │
       ↓   Detection; 每個 token 都有損失,               │
       ↓   訓練效率大幅提升                               │
2020  DeBERTa (Microsoft) ─ 解耦注意力 + 增強掩碼        │
       ↓   解碼器; SuperGLUE 上首次超越人類              │
2020  T5 (Google) ─ Encoder-Decoder + span corruption   │
       ↓   (MLM 的 span 版本)                            │
2024  ModernBERT (2024末-2025) ─ 長上下文 + Flash        │
       ↓   Attention + 現代訓練配方,                      │
       ↓   Encoder-only 復興                             │
至今  MLM 範式持續演化: 科學文獻/程式碼/多語言             │
      垂直領域 MLM 預訓練仍是產業主流之一               │

技術路線對比(量化表)

維度MLM (BERT系)CLM/AR (GPT系)PLM (XLNet)RTD (ELECTRA)
訓練訊號密度~15% token~100% token~100% token~100% token
上下文方向雙向單向(左→右)排列雙向雙向
推論方式單次前向自迴歸迭代自迴歸迭代單次前向
生成能力❌ 不天然支援✅ 天然支援✅ 支援❌ 不天然支援
理解能力✅ 強較弱(受限於單向)✅ 強✅ 強
訓練效率(單位token)較低(僅15%有效)高(100%有效)極高(生成器+判別器)
預訓練計算成本極高高(但效率高)
[MASK] mismatch存在不存在不存在不存在(用[MASK]訓練生成器)
代表任務優勢NLU(分類/NER/QA)NLG(寫作/對話)NLUNLU
代表模型規模110M-340M(BERT)175B+(GPT-3)110M-340M110M-335M

注: 隨著 LLM 時代到來,CLM 在規模效應下也獲得了強大的 NLU 能力(GPT-3/4 的 few-shot 表現),MLM 在小模型場景下的理解優勢仍然顯著。


上下游

上游:模型結構與基礎設施

┌─────────────────────────────────────────────┐
│                上游供應鏈                     │
├─────────────┬───────────────────────────────┤
│ 算力硬體     │ GPU (NVIDIA V100/A100/H100),  │
│             │ TPU (Google v2/v3/v4/v5)       │
├─────────────┼───────────────────────────────┤
│ 架構        │ PyTorch, TensorFlow, JAX       │
├─────────────┼───────────────────────────────┤
│ 訓練庫      │ Hugging Face Transformers,     │
│             │ FairSeq, Megatron-LM           │
├─────────────┼───────────────────────────────┤
│ Tokenizer   │ WordPiece (BERT), BPE,        │
│             │ SentencePiece, Unigram         │
├─────────────┼───────────────────────────────┤
│ 訓練資料     │ 無標註文本語料: 網頁、書籍、     │
│             │ 維基百科、程式碼等                │
└─────────────┴───────────────────────────────┘

下游:任務與應用

┌───────────────────────────────────────────────┐
│              下游應用矩陣                       │
├──────────────────┬────────────────────────────┤
│ 文本分類          │ 情感分析、垃圾郵件、意圖識別  │
├──────────────────┼────────────────────────────┤
│ 序列標註          │ NER、POS Tagging            │
├──────────────────┼────────────────────────────┤
│ 閱讀理解/抽取式QA  │ SQuAD、醫療QA               │
├──────────────────┼────────────────────────────┤
│ 語義相似度         │ 搜尋排序、去重、推薦          │
├──────────────────┼────────────────────────────┤
│ 資訊檢索          │ Dense Retrieval (DPR等)      │
├──────────────────┼────────────────────────────┤
│ 句子對任務         │ 自然語言推論(NLI)、釋義檢測   │
├──────────────────┼────────────────────────────┤
│ 垂直領域NLP       │ 法律文本理解、生物醫學NER、    │
│                  │ 金融資訊抽取                  │
└──────────────────┴────────────────────────────┘

關鍵指標

預訓練階段

指標含義典型值域
MLM Loss被掩碼位置的交叉熵損失預訓練初期 ~10+, 充分收斂 ~1.5-2.5
MLM Accuracy被掩碼 token 預測準確率充分訓練後 ~70-75% [估算]
Perplexity語言模型困惑度 (基於 MLM 的等效計算)視詞表大小, 不直接可比 AR LM
Masked Token Rate被掩碼 token 佔比標準 15%
訓練吞吐量tokens/second/GPU視硬體和序列長度, 量級千-萬級

下游微調階段

指標基準BERT-Base 表現BERT-Large 表現
GLUE 平均分GLUE Benchmark~78 [原始論文]~80.5 [原始論文]
SQuAD 2.0 F1抽取式 QA~76.8 [原始論文]~83.1 [原始論文]
MNLI 準確率自然語言推論~84.4 [原始論文]~86.7 [原始論文]

注: 以上資料來源於 [Devlin et al., 2019] 原論文 Table 1-2。後續改進模型(RoBERTa、DeBERTa 等)在相同基準上有顯著提升。


供需與市場資料

MLM 在產業中的定位(定性)

  • 嵌入與語義理解層基礎設施: MLM 預訓練模型(如 BERT、DeBERTa)是大量 NLP 產品的語義理解基座。搜尋排序中的語義匹配、智慧客服的意圖識別、文件審查中的實體抽取,大量依賴 Encoder-only 的 MLM 預訓練模型。
  • 從”獨立主力”到”模組元件”的演變: 2019-2021 年,BERT 是 NLP 的絕對主角。2022 年 ChatGPT 之後,LLM(Decoder-only CLM)在通用 NLP 上逐漸取代 MLM 的主導地位。但 MLM 模型在以下場景仍不可替代:
    • 延遲敏感的線上服務: Encoder-only 模型一次前向傳播即可完成推論,延遲遠低於自迴歸生成。
    • 嵌入/表示任務: 語義搜尋、向量資料庫、Reranker 需要的是稠密向量表示,Encoder-only 模型天然適配。
    • Token-level 任務: NER、POS 等需要逐 token 標註的任務,Encoder-only 的雙向表示更優。
  • 市場體量估算 [定性]: 企業 NLP 市場中,基於 MLM 的模型仍佔據搜尋、推薦、文件智慧等細分領域的顯著份額,但增長放緩,增量更多來自 LLM。

訓練成本參考

模型硬體預訓練時間估算成本
BERT-Base16 TPUv3 (原論文)約 4 天~數千美元級 [估算]
BERT-Large64 TPUv3 (原論文)約 4 天~數萬美元級 [估算]
RoBERTa-Large1024 V100 32GB (FairSeq)~1天 [原論文 Appendix]~數萬美元級 [估算]
ModernBERT-Base未充分揭露未充分揭露未充分揭露

訓練成本隨硬體代際和規模快速變化,以上為粗略量級估算。


代表公司與資本對映

公司/機構代表貢獻與 MLM 的關係
GoogleBERT, ALBERT, T5MLM 範式發明者; 將 BERT 整合至搜尋排名, 推動產業化
Meta (Facebook)RoBERTa, XLM-R最佳化 MLM 訓練配方; 多語言 MLM 預訓練
MicrosoftDeBERTa, MiniLM在 MLM 架構上做注意力改進, DeBERTa 曾刷榜 SuperGLUE
Hugging FaceTransformers 庫, Model HubMLM 模型的開源分發樞紐, 降低企業接入門檻
SalesforceALBERT (合作)高效 MLM 變體
Google/ELECTRAELECTRA (Clark et al., 2020)改進 MLM 為 Replaced Token Detection, 提升訓練效率
Allen AISciBERT, 通用 NLP 工具垂直領域 MLM 預訓練

產業鏈對映

上游硬體/算力 ─→ MLM預訓練(雲端廠商/大廠實驗室) ─→ 模型分發(HF Hub等)

                                          企業接入(微調+部署)

                                    NLP應用(搜尋/客服/文件智慧/醫療...)

投資邏輯

MLM 相關的投資視角

1. 已進入”價值兌現”階段,非高增長賽道 MLM 預訓練技術成熟,已不是當下 AI 投資的主敘事(主敘事在 LLM/AGI)。但 MLM 模型在企業 NLP 基礎設施中仍扮演”水電煤”角色。

2. 關注”被低估的基礎設施”層

  • 向量檢索/語義搜尋: MLM Encoder 產出的稠密嵌入是 RAG(檢索增強生成)系統中檢索環節的核心。隨著 RAG 成為 LLM 部署標配,Encoder 模型需求反而在增長。
  • Reranker: Cross-Encoder(基於 MLM 架構的雙向互動打分模型)在搜尋 Reranking 和 RAG 中仍是最優方案。
  • Token-level 任務: 工業場景中的實體識別、資訊抽取大量使用 MLM 微調模型,需求穩定。

3. 風險

  • 通用 NLU 任務正被大語言模型的 few-shot/in-context learning 替代,MLM 的純分類/理解市場份額面臨擠壓。
  • Encoder-only 模型的商業價值更多體現在雲端平台的 API 服務中(如 Google Cloud NLP API、Azure AI Language),而非獨立產品,投資對映較分散。

常見誤讀糾偏

❌ 誤讀 1:“MLM 和 CLM 的區別只是訓練方向不同”

糾偏: 區別遠不止訓練方向。結構性差異導致了完全不同的能力畫像:

  • MLM 是雙向注意力(Encoder 架構),推論時一次前向傳播,天然適合理解和表示任務。
  • CLM 是因果注意力(Decoder
source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型