掩碼語言模型 (Masked Language Model, MLM)
3 秒看懂
一句話: 把句子裡的詞隨機遮住,讓模型猜被遮住的是什麼——猜對了說明模型”懂了”語言。這就是 BERT 背後的核心訓練範式。
3 分鐘產業解釋
掩碼語言模型(MLM)是自然語言處理(NLP)領域最重要的預訓練範式之一,由 Google 團隊在 2018 年釋出的 BERT(Bidirectional Encoder Representations from Transformers)論文中提出並系統化。
核心思想極簡: 給模型一段文本,隨機遮蓋其中約 15% 的 token,訓練目標是讓模型根據雙向上下文還原被遮蓋的內容。這與 GPT 系列的自迴歸(從左到右逐詞預測)形成根本性區別——MLM 在預測時同時看到左側和右側的上下文,因此獲得更”深”的語言理解能力。
產業意義:
- 開啟了預訓練-微調範式(Pre-train then Fine-tune): 在大規模無標註語料上預訓練 MLM,再在下游任務(分類、問答、NER 等)上用少量標註資料微調,大幅降低 NLP 應用的資料門檻。
- 催生了 NLP 商用化浪潮: 2019-2021 年間,幾乎所有搜尋、客服、文件理解、法律/醫療 NLP 產品都以 BERT 類模型為基座。
- 訓練計算量巨大: BERT-Large 在原文獻中使用了 16 個 Cloud TPU Pod(共 64 個 TPU 晶片)訓練約 4 天 [原始論文],這推動了 AI 算力產業的需求爆發。
- 至今仍活躍: RoBERTa、ALBERT、DeBERTa、ELECTRA 等一系列改進均建立在 MLM 或其變體之上;Encoder-only 架構在工業界任務中(資訊檢索、語義相似度、命名實體識別)仍廣泛使用。
15 分鐘專家深入
從自迴歸到雙向:MLM 誕生的邏輯鏈
| 維度 | 自迴歸 LM(GPT 系列) | 掩碼語言模型(BERT 系列) |
|---|---|---|
| 訓練方向 | 左→右,單向 | 雙向(同時看左和右) |
| 訓練任務 | Next Token Prediction | Masked Token Prediction |
| 天然適配 | 文本生成 | 文本理解(NLU) |
| 推論方式 | 自迴歸逐 token | 一次前向傳播完成 |
| 代表模型 | GPT、GPT-2/3/4 | BERT、RoBERTa、DeBERTa |
MLM 的關鍵設計選擇
1. 掩碼比例:15% BERT 原論文 [Devlin et al., 2019] 確立了掩碼 15% token 的慣例。比例太低則訓練訊號稀疏、效率低;比例太高則上下文資訊損失嚴重,模型難以推斷。15% 是實驗調優後的平衡點。
2. 掩碼策略:80-10-10 規則 對被選中的 15% token:
- 80% 替換為
[MASK]特殊標記 - 10% 替換為隨機 token
- 10% 保持不變
為什麼不做 100% [MASK]?因為微調和推論時輸入中不存在 [MASK] 標記,100% [MASK] 會導致預訓練與微調之間的分佈不匹配(mismatch)。加入隨機替換和保持不變迫使模型在所有情況下都依賴上下文建模。
3. 損失函式 僅在被掩碼位置計算交叉熵損失(Cross-Entropy Loss),未掩碼位置不貢獻梯度。這與自迴歸 LM 在每個位置都計算損失形成對比——意味著 MLM 每個訓練樣本的有效監督訊號量相對更少,需要更多資料和步數達到同等效果。
4. 架構選擇:Transformer Encoder MLM 天然需要雙向注意力(Bidirectional Self-Attention),每個 token 可以 attend 到序列中所有其他 token(包括左側和右側)。這對應 Transformer 的 Encoder 部分(無 causal mask),而非 Decoder(有 causal mask,只能看左側)。
5. 下一句預測(NSP)輔助任務 BERT 原始設計中,除了 MLM 還加入了 NSP 任務:給模型兩個句子,判斷它們是否是原文中相鄰的句子。但後續研究(RoBERTa [Liu et al., 2019])通過實驗表明 NSP 對下游效能貢獻有限甚至有害,此後大多數 MLM 變體去掉了 NSP。
為什麼雙向如此重要?
考慮句子:
“The animal didn’t cross the street because it was too ____.”
要填空,需要理解 “it” 指代什麼。單向模型只能看到 “it was too” 之前的內容;雙向模型同時看到後面可能的線索(如後續句子中 “tired” 還是 “wide”),對指代消解(coreference resolution)等任務有本質優勢。
MLM 的內在侷限
- 訓練效率低: 每個樣本僅 15% token 提供損失,相比自迴歸 LM 每個 token 都有損失,資料利用率低約 5-6 倍。
- 獨立性假設: BERT 的 MLM 假設被掩碼 token 之間條件獨立——即同時預測多個被掩碼詞時,模型不建模它們之間的依賴關係。這在直覺上是不合理的(例如掩碼了”New”和”York”,兩者應該強相關),但實踐中簡化實現效果尚可。
- 推論時
[MASK]不出現: 預訓練依賴[MASK]標記,但下游任務輸入中無此標記,存在內在矛盾。
技術原理(機制級)
掩碼語言模型的前向與訓練流程
┌─────────────────────────────────────────────────────────┐
│ 輸入處理階段 │
│ │
│ 原始: "The capital of France is [Paris]" │
│ ↓ │
│ 選中15% token 掩碼: "The capital of [MASK] is [MASK]" │
│ (應用 80-10-10 規則) │
│ ↓ │
│ Tokenizer → Token IDs: [101, 1996, 3007, 1997, │
│ 103, 2003, 103, 102] │
│ (103 = [MASK] token id, 101 = [CLS], 102 = [SEP]) │
└─────────────────────────────────────────────────────────┘
↓
┌─────────────────────────────────────────────────────────┐
│ Transformer Encoder (×N層) │
│ │
│ 每一層包含: │
│ ┌───────────────────────────────────────────┐ │
│ │ Multi-Head Self-Attention (雙向, 無因果遮罩) │ │
│ │ Q = X·W_Q, K = X·W_K, V = X·W_V │ │
│ │ Attention(Q,K,V) = softmax(QK^T/√d_k)V │ │
│ │ → 每個 token 可以看到所有其他 token │ │
│ └───────────────────────────────────────────┘ │
│ ↓ │
│ ┌───────────────────────────────────────────┐ │
│ │ Add & LayerNorm │ │
│ └───────────────────────────────────────────┘ │
│ ↓ │
│ ┌───────────────────────────────────────────┐ │
│ │ Feed-Forward Network (2層 MLP + GELU) │ │
│ └───────────────────────────────────────────┘ │
│ ↓ │
│ ┌───────────────────────────────────────────┐ │
│ │ Add & LayerNorm │ │
│ └───────────────────────────────────────────┘ │
└─────────────────────────────────────────────────────────┘
↓
┌─────────────────────────────────────────────────────────┐
│ MLM Head (預測頭) │
│ │
│ 僅提取 [MASK] 位置的隱藏狀態 h_masked │
│ ↓ │
│ h_masked → Dense(隱藏維度→詞表大小) → softmax │
│ ↓ │
│ 預測分佈 P(token | context) │
│ ↓ │
│ Loss = CrossEntropy(P, 真實token) │
│ (僅對被掩碼位置求和, 再取平均) │
└─────────────────────────────────────────────────────────┘
關鍵引數量級(以 BERT-Base 為例)
| 引數 | BERT-Base | BERT-Large |
|---|---|---|
| 層數 (L) | 12 | 24 |
| 隱藏維度 (d_model) | 768 | 1024 |
| 注意力頭數 (h) | 12 | 16 |
| 引數量 | ~110M | ~340M |
| 最大序列長度 | 512 | 512 |
| 詞表大小 | 30,522 (WordPiece) | 30,522 |
| 啟用函式 | GELU | GELU |
| 學習率 | 1e-4 | 1e-4 (原文獻) |
資料來源: 以上資料來自 [Devlin et al., 2019] 原論文 Table 1。
自注意力的雙向性(與因果遮罩的區別)
自迴歸 LM (Decoder, 因果遮罩): MLM (Encoder, 雙向):
t1 t2 t3 t4 t1 t2 t3 t4
t1 [✓] [✗] [✗] [✗] t1 [✓] [✓] [✓] [✓]
t2 [✓] [✓] [✗] [✗] t2 [✓] [✓] [✓] [✓]
t3 [✓] [✓] [✓] [✗] t3 [✓] [✓] [✓] [✓]
t4 [✓] [✓] [✓] [✓] t4 [✓] [✓] [✓] [✓]
✓ = 可以attend到 ✗ = 被遮罩(不可見) 所有位置互相可見
MLM 使用全連線注意力圖,沒有任何因果遮罩。這是其雙向語義理解能力的結構基礎。
MLM 與 CLM 的損失計算對比
CLM (Causal LM): 每個位置都計算 loss
位置: [The] [capital] [of] [France] [is] [Paris]
損失: ✓ ✓ ✓ ✓ ✓ ✓
有效監督: 6/6 = 100%
MLM (Masked LM): 僅掩碼位置計算 loss
位置: [The] [capital] [of] [MASK] [is] [MASK]
損失: ✗ ✗ ✗ ✓ ✗ ✓
有效監督: 2/6 ≈ 33% (實際為被掩碼的15%)
技術演進史
2013 Word2Vec (Mikolov) ──────────────────────────────┐
↓ │
2014 GloVe (Pennington) │
↓ (靜態詞向量時代) │
2017 Transformer (Vaswani et al.) ─ "Attention is All │
↓ You Need" │
2018 ELMo (Peters et al.) ─ 基於 BiLSTM 的上下文 │
↓ 詞表示 │
2018.06 GPT-1 (OpenAI) ─ Transformer Decoder + │
↓ 自迴歸預訓練 │
2018.10 ★ BERT (Google) ─ Transformer Encoder + │
↓ MLM + NSP 預訓練; NLP 里程碑 │
2019.02 GPT-2 (OpenAI) ─ 規模擴充套件 + 零樣本 │
↓ │
2019.07 RoBERTa (Facebook) ─ 去 NSP, 動態掩碼, │
↓ 更多資料, 更長訓練; MLM 最佳實踐 │
2019.09 ALBERT (Google) ─ 引數共享 + 句序預測(SOP) │
↓ 替代 NSP │
2019.10 XLNet (Yang et al.) ─ 排列語言模型(PLM), │
↓ 試圖融合 AR 與 AE 優勢 │
2020 ELECTRA (Clark et al.) ─ Replaced Token │
↓ Detection; 每個 token 都有損失, │
↓ 訓練效率大幅提升 │
2020 DeBERTa (Microsoft) ─ 解耦注意力 + 增強掩碼 │
↓ 解碼器; SuperGLUE 上首次超越人類 │
2020 T5 (Google) ─ Encoder-Decoder + span corruption │
↓ (MLM 的 span 版本) │
2024 ModernBERT (2024末-2025) ─ 長上下文 + Flash │
↓ Attention + 現代訓練配方, │
↓ Encoder-only 復興 │
至今 MLM 範式持續演化: 科學文獻/程式碼/多語言 │
垂直領域 MLM 預訓練仍是產業主流之一 │
技術路線對比(量化表)
| 維度 | MLM (BERT系) | CLM/AR (GPT系) | PLM (XLNet) | RTD (ELECTRA) |
|---|---|---|---|---|
| 訓練訊號密度 | ~15% token | ~100% token | ~100% token | ~100% token |
| 上下文方向 | 雙向 | 單向(左→右) | 排列雙向 | 雙向 |
| 推論方式 | 單次前向 | 自迴歸迭代 | 自迴歸迭代 | 單次前向 |
| 生成能力 | ❌ 不天然支援 | ✅ 天然支援 | ✅ 支援 | ❌ 不天然支援 |
| 理解能力 | ✅ 強 | 較弱(受限於單向) | ✅ 強 | ✅ 強 |
| 訓練效率(單位token) | 較低(僅15%有效) | 高(100%有效) | 高 | 極高(生成器+判別器) |
| 預訓練計算成本 | 高 | 高 | 極高 | 高(但效率高) |
| [MASK] mismatch | 存在 | 不存在 | 不存在 | 不存在(用[MASK]訓練生成器) |
| 代表任務優勢 | NLU(分類/NER/QA) | NLG(寫作/對話) | NLU | NLU |
| 代表模型規模 | 110M-340M(BERT) | 175B+(GPT-3) | 110M-340M | 110M-335M |
注: 隨著 LLM 時代到來,CLM 在規模效應下也獲得了強大的 NLU 能力(GPT-3/4 的 few-shot 表現),MLM 在小模型場景下的理解優勢仍然顯著。
上下游
上游:模型結構與基礎設施
┌─────────────────────────────────────────────┐
│ 上游供應鏈 │
├─────────────┬───────────────────────────────┤
│ 算力硬體 │ GPU (NVIDIA V100/A100/H100), │
│ │ TPU (Google v2/v3/v4/v5) │
├─────────────┼───────────────────────────────┤
│ 架構 │ PyTorch, TensorFlow, JAX │
├─────────────┼───────────────────────────────┤
│ 訓練庫 │ Hugging Face Transformers, │
│ │ FairSeq, Megatron-LM │
├─────────────┼───────────────────────────────┤
│ Tokenizer │ WordPiece (BERT), BPE, │
│ │ SentencePiece, Unigram │
├─────────────┼───────────────────────────────┤
│ 訓練資料 │ 無標註文本語料: 網頁、書籍、 │
│ │ 維基百科、程式碼等 │
└─────────────┴───────────────────────────────┘
下游:任務與應用
┌───────────────────────────────────────────────┐
│ 下游應用矩陣 │
├──────────────────┬────────────────────────────┤
│ 文本分類 │ 情感分析、垃圾郵件、意圖識別 │
├──────────────────┼────────────────────────────┤
│ 序列標註 │ NER、POS Tagging │
├──────────────────┼────────────────────────────┤
│ 閱讀理解/抽取式QA │ SQuAD、醫療QA │
├──────────────────┼────────────────────────────┤
│ 語義相似度 │ 搜尋排序、去重、推薦 │
├──────────────────┼────────────────────────────┤
│ 資訊檢索 │ Dense Retrieval (DPR等) │
├──────────────────┼────────────────────────────┤
│ 句子對任務 │ 自然語言推論(NLI)、釋義檢測 │
├──────────────────┼────────────────────────────┤
│ 垂直領域NLP │ 法律文本理解、生物醫學NER、 │
│ │ 金融資訊抽取 │
└──────────────────┴────────────────────────────┘
關鍵指標
預訓練階段
| 指標 | 含義 | 典型值域 |
|---|---|---|
| MLM Loss | 被掩碼位置的交叉熵損失 | 預訓練初期 ~10+, 充分收斂 ~1.5-2.5 |
| MLM Accuracy | 被掩碼 token 預測準確率 | 充分訓練後 ~70-75% [估算] |
| Perplexity | 語言模型困惑度 (基於 MLM 的等效計算) | 視詞表大小, 不直接可比 AR LM |
| Masked Token Rate | 被掩碼 token 佔比 | 標準 15% |
| 訓練吞吐量 | tokens/second/GPU | 視硬體和序列長度, 量級千-萬級 |
下游微調階段
| 指標 | 基準 | BERT-Base 表現 | BERT-Large 表現 |
|---|---|---|---|
| GLUE 平均分 | GLUE Benchmark | ~78 [原始論文] | ~80.5 [原始論文] |
| SQuAD 2.0 F1 | 抽取式 QA | ~76.8 [原始論文] | ~83.1 [原始論文] |
| MNLI 準確率 | 自然語言推論 | ~84.4 [原始論文] | ~86.7 [原始論文] |
注: 以上資料來源於 [Devlin et al., 2019] 原論文 Table 1-2。後續改進模型(RoBERTa、DeBERTa 等)在相同基準上有顯著提升。
供需與市場資料
MLM 在產業中的定位(定性)
- 嵌入與語義理解層基礎設施: MLM 預訓練模型(如 BERT、DeBERTa)是大量 NLP 產品的語義理解基座。搜尋排序中的語義匹配、智慧客服的意圖識別、文件審查中的實體抽取,大量依賴 Encoder-only 的 MLM 預訓練模型。
- 從”獨立主力”到”模組元件”的演變: 2019-2021 年,BERT 是 NLP 的絕對主角。2022 年 ChatGPT 之後,LLM(Decoder-only CLM)在通用 NLP 上逐漸取代 MLM 的主導地位。但 MLM 模型在以下場景仍不可替代:
- 延遲敏感的線上服務: Encoder-only 模型一次前向傳播即可完成推論,延遲遠低於自迴歸生成。
- 嵌入/表示任務: 語義搜尋、向量資料庫、Reranker 需要的是稠密向量表示,Encoder-only 模型天然適配。
- Token-level 任務: NER、POS 等需要逐 token 標註的任務,Encoder-only 的雙向表示更優。
- 市場體量估算 [定性]: 企業 NLP 市場中,基於 MLM 的模型仍佔據搜尋、推薦、文件智慧等細分領域的顯著份額,但增長放緩,增量更多來自 LLM。
訓練成本參考
| 模型 | 硬體 | 預訓練時間 | 估算成本 |
|---|---|---|---|
| BERT-Base | 16 TPUv3 (原論文) | 約 4 天 | ~數千美元級 [估算] |
| BERT-Large | 64 TPUv3 (原論文) | 約 4 天 | ~數萬美元級 [估算] |
| RoBERTa-Large | 1024 V100 32GB (FairSeq) | ~1天 [原論文 Appendix] | ~數萬美元級 [估算] |
| ModernBERT-Base | 未充分揭露 | 未充分揭露 | 未充分揭露 |
訓練成本隨硬體代際和規模快速變化,以上為粗略量級估算。
代表公司與資本對映
| 公司/機構 | 代表貢獻 | 與 MLM 的關係 |
|---|---|---|
| BERT, ALBERT, T5 | MLM 範式發明者; 將 BERT 整合至搜尋排名, 推動產業化 | |
| Meta (Facebook) | RoBERTa, XLM-R | 最佳化 MLM 訓練配方; 多語言 MLM 預訓練 |
| Microsoft | DeBERTa, MiniLM | 在 MLM 架構上做注意力改進, DeBERTa 曾刷榜 SuperGLUE |
| Hugging Face | Transformers 庫, Model Hub | MLM 模型的開源分發樞紐, 降低企業接入門檻 |
| Salesforce | ALBERT (合作) | 高效 MLM 變體 |
| Google/ELECTRA | ELECTRA (Clark et al., 2020) | 改進 MLM 為 Replaced Token Detection, 提升訓練效率 |
| Allen AI | SciBERT, 通用 NLP 工具 | 垂直領域 MLM 預訓練 |
產業鏈對映
上游硬體/算力 ─→ MLM預訓練(雲端廠商/大廠實驗室) ─→ 模型分發(HF Hub等)
↓
企業接入(微調+部署)
↓
NLP應用(搜尋/客服/文件智慧/醫療...)
投資邏輯
MLM 相關的投資視角
1. 已進入”價值兌現”階段,非高增長賽道 MLM 預訓練技術成熟,已不是當下 AI 投資的主敘事(主敘事在 LLM/AGI)。但 MLM 模型在企業 NLP 基礎設施中仍扮演”水電煤”角色。
2. 關注”被低估的基礎設施”層
- 向量檢索/語義搜尋: MLM Encoder 產出的稠密嵌入是 RAG(檢索增強生成)系統中檢索環節的核心。隨著 RAG 成為 LLM 部署標配,Encoder 模型需求反而在增長。
- Reranker: Cross-Encoder(基於 MLM 架構的雙向互動打分模型)在搜尋 Reranking 和 RAG 中仍是最優方案。
- Token-level 任務: 工業場景中的實體識別、資訊抽取大量使用 MLM 微調模型,需求穩定。
3. 風險
- 通用 NLU 任務正被大語言模型的 few-shot/in-context learning 替代,MLM 的純分類/理解市場份額面臨擠壓。
- Encoder-only 模型的商業價值更多體現在雲端平台的 API 服務中(如 Google Cloud NLP API、Azure AI Language),而非獨立產品,投資對映較分散。
常見誤讀糾偏
❌ 誤讀 1:“MLM 和 CLM 的區別只是訓練方向不同”
糾偏: 區別遠不止訓練方向。結構性差異導致了完全不同的能力畫像:
- MLM 是雙向注意力(Encoder 架構),推論時一次前向傳播,天然適合理解和表示任務。
- CLM 是因果注意力(Decoder