模型层 开放阅读

掩码语言模型

Masked Language Model, MLM

概念 ID
masked-language-model-mlm
更新时间
2026-05-29
来源数量
待补

掩码语言模型 (Masked Language Model, MLM)

3 秒看懂

一句话: 把句子里的词随机遮住,让模型猜被遮住的是什么——猜对了说明模型”懂了”语言。这就是 BERT 背后的核心训练范式。

3 分钟产业解释

掩码语言模型(MLM)是自然语言处理(NLP)领域最重要的预训练范式之一,由 Google 团队在 2018 年发布的 BERT(Bidirectional Encoder Representations from Transformers)论文中提出并系统化。

核心思想极简: 给模型一段文本,随机遮盖其中约 15% 的 token,训练目标是让模型根据双向上下文还原被遮盖的内容。这与 GPT 系列的自回归(从左到右逐词预测)形成根本性区别——MLM 在预测时同时看到左侧和右侧的上下文,因此获得更”深”的语言理解能力。

产业意义:

  • 开启了预训练-微调范式(Pre-train then Fine-tune): 在大规模无标注语料上预训练 MLM,再在下游任务(分类、问答、NER 等)上用少量标注数据微调,大幅降低 NLP 应用的数据门槛。
  • 催生了 NLP 商用化浪潮: 2019-2021 年间,几乎所有搜索、客服、文档理解、法律/医疗 NLP 产品都以 BERT 类模型为基座。
  • 训练计算量巨大: BERT-Large 在原文献中使用了 16 个 Cloud TPU Pod(共 64 个 TPU 芯片)训练约 4 天 [原始论文],这推动了 AI 算力产业的需求爆发。
  • 至今仍活跃: RoBERTa、ALBERT、DeBERTa、ELECTRA 等一系列改进均建立在 MLM 或其变体之上;Encoder-only 架构在工业界任务中(信息检索、语义相似度、命名实体识别)仍广泛使用。

15 分钟专家深入

从自回归到双向:MLM 诞生的逻辑链

维度自回归 LM(GPT 系列)掩码语言模型(BERT 系列)
训练方向左→右,单向双向(同时看左和右)
训练任务Next Token PredictionMasked Token Prediction
天然适配文本生成文本理解(NLU)
推理方式自回归逐 token一次前向传播完成
代表模型GPT、GPT-2/3/4BERT、RoBERTa、DeBERTa

MLM 的关键设计选择

1. 掩码比例:15% BERT 原论文 [Devlin et al., 2019] 确立了掩码 15% token 的惯例。比例太低则训练信号稀疏、效率低;比例太高则上下文信息损失严重,模型难以推断。15% 是实验调优后的平衡点。

2. 掩码策略:80-10-10 规则 对被选中的 15% token:

  • 80% 替换为 [MASK] 特殊标记
  • 10% 替换为随机 token
  • 10% 保持不变

为什么不做 100% [MASK]?因为微调和推理时输入中不存在 [MASK] 标记,100% [MASK] 会导致预训练与微调之间的分布不匹配(mismatch)。加入随机替换和保持不变迫使模型在所有情况下都依赖上下文建模。

3. 损失函数 仅在被掩码位置计算交叉熵损失(Cross-Entropy Loss),未掩码位置不贡献梯度。这与自回归 LM 在每个位置都计算损失形成对比——意味着 MLM 每个训练样本的有效监督信号量相对更少,需要更多数据和步数达到同等效果。

4. 架构选择:Transformer Encoder MLM 天然需要双向注意力(Bidirectional Self-Attention),每个 token 可以 attend 到序列中所有其他 token(包括左侧和右侧)。这对应 Transformer 的 Encoder 部分(无 causal mask),而非 Decoder(有 causal mask,只能看左侧)。

5. 下一句预测(NSP)辅助任务 BERT 原始设计中,除了 MLM 还加入了 NSP 任务:给模型两个句子,判断它们是否是原文中相邻的句子。但后续研究(RoBERTa [Liu et al., 2019])通过实验表明 NSP 对下游性能贡献有限甚至有害,此后大多数 MLM 变体去掉了 NSP。

为什么双向如此重要?

考虑句子:

“The animal didn’t cross the street because it was too ____.”

要填空,需要理解 “it” 指代什么。单向模型只能看到 “it was too” 之前的内容;双向模型同时看到后面可能的线索(如后续句子中 “tired” 还是 “wide”),对指代消解(coreference resolution)等任务有本质优势。

MLM 的内在局限

  1. 训练效率低: 每个样本仅 15% token 提供损失,相比自回归 LM 每个 token 都有损失,数据利用率低约 5-6 倍。
  2. 独立性假设: BERT 的 MLM 假设被掩码 token 之间条件独立——即同时预测多个被掩码词时,模型不建模它们之间的依赖关系。这在直觉上是不合理的(例如掩码了”New”和”York”,两者应该强相关),但实践中简化实现效果尚可。
  3. 推理时 [MASK] 不出现: 预训练依赖 [MASK] 标记,但下游任务输入中无此标记,存在内在矛盾。

技术原理(机制级)

掩码语言模型的前向与训练流程

┌─────────────────────────────────────────────────────────┐
│                    输入处理阶段                           │
│                                                         │
│  原始: "The capital of France is [Paris]"               │
│                         ↓                               │
│  选中15% token 掩码: "The capital of [MASK] is [MASK]"  │
│  (应用 80-10-10 规则)                                    │
│                         ↓                               │
│  Tokenizer → Token IDs: [101, 1996, 3007, 1997,        │
│                           103, 2003, 103, 102]          │
│  (103 = [MASK] token id, 101 = [CLS], 102 = [SEP])     │
└─────────────────────────────────────────────────────────┘
                           ↓
┌─────────────────────────────────────────────────────────┐
│               Transformer Encoder (×N层)                 │
│                                                         │
│  每一层包含:                                              │
│  ┌───────────────────────────────────────────┐          │
│  │ Multi-Head Self-Attention (双向, 无因果遮罩) │          │
│  │   Q = X·W_Q,  K = X·W_K,  V = X·W_V       │          │
│  │   Attention(Q,K,V) = softmax(QK^T/√d_k)V  │          │
│  │   → 每个 token 可以看到所有其他 token       │          │
│  └───────────────────────────────────────────┘          │
│                         ↓                               │
│  ┌───────────────────────────────────────────┐          │
│  │ Add & LayerNorm                           │          │
│  └───────────────────────────────────────────┘          │
│                         ↓                               │
│  ┌───────────────────────────────────────────┐          │
│  │ Feed-Forward Network (2层 MLP + GELU)     │          │
│  └───────────────────────────────────────────┘          │
│                         ↓                               │
│  ┌───────────────────────────────────────────┐          │
│  │ Add & LayerNorm                           │          │
│  └───────────────────────────────────────────┘          │
└─────────────────────────────────────────────────────────┘
                           ↓
┌─────────────────────────────────────────────────────────┐
│                    MLM Head (预测头)                      │
│                                                         │
│  仅提取 [MASK] 位置的隐藏状态 h_masked                   │
│         ↓                                               │
│  h_masked → Dense(隐藏维度→词表大小) → softmax           │
│         ↓                                               │
│  预测分布 P(token | context)                             │
│         ↓                                               │
│  Loss = CrossEntropy(P, 真实token)                      │
│  (仅对被掩码位置求和, 再取平均)                           │
└─────────────────────────────────────────────────────────┘

关键参数量级(以 BERT-Base 为例)

参数BERT-BaseBERT-Large
层数 (L)1224
隐藏维度 (d_model)7681024
注意力头数 (h)1216
参数量~110M~340M
最大序列长度512512
词表大小30,522 (WordPiece)30,522
激活函数GELUGELU
学习率1e-41e-4 (原文献)

数据来源: 以上数据来自 [Devlin et al., 2019] 原论文 Table 1。

自注意力的双向性(与因果遮罩的区别)

自回归 LM (Decoder, 因果遮罩):          MLM (Encoder, 双向):

  t1  t2  t3  t4                          t1  t2  t3  t4
t1 [✓] [✗] [✗] [✗]                     t1 [✓] [✓] [✓] [✓]
t2 [✓] [✓] [✗] [✗]                     t2 [✓] [✓] [✓] [✓]
t3 [✓] [✓] [✓] [✗]                     t3 [✓] [✓] [✓] [✓]
t4 [✓] [✓] [✓] [✓]                     t4 [✓] [✓] [✓] [✓]

✓ = 可以attend到    ✗ = 被遮罩(不可见)    所有位置互相可见

MLM 使用全连接注意力图,没有任何因果遮罩。这是其双向语义理解能力的结构基础。

MLM 与 CLM 的损失计算对比

CLM (Causal LM):  每个位置都计算 loss
位置:    [The] [capital] [of]  [France] [is]  [Paris]
损失:     ✓      ✓        ✓      ✓       ✓     ✓
有效监督: 6/6 = 100%

MLM (Masked LM):  仅掩码位置计算 loss
位置:    [The] [capital] [of]  [MASK]  [is]  [MASK]
损失:     ✗      ✗        ✗      ✓      ✗     ✓
有效监督: 2/6 ≈ 33%  (实际为被掩码的15%)

技术演进史

2013  Word2Vec (Mikolov) ──────────────────────────────┐
       ↓                                                │
2014  GloVe (Pennington)                                │
       ↓  (静态词向量时代)                               │
2017  Transformer (Vaswani et al.) ─ "Attention is All │
       ↓  You Need"                                     │
2018  ELMo (Peters et al.) ─ 基于 BiLSTM 的上下文       │
       ↓  词表示                                        │
2018.06 GPT-1 (OpenAI) ─ Transformer Decoder +          │
       ↓   自回归预训练                                  │
2018.10 ★ BERT (Google) ─ Transformer Encoder +          │
       ↓   MLM + NSP 预训练; NLP 里程碑                  │
2019.02 GPT-2 (OpenAI) ─ 规模扩展 + 零样本              │
       ↓                                                │
2019.07 RoBERTa (Facebook) ─ 去 NSP, 动态掩码,          │
       ↓   更多数据, 更长训练; MLM 最佳实践                │
2019.09 ALBERT (Google) ─ 参数共享 + 句序预测(SOP)       │
       ↓   替代 NSP                                     │
2019.10 XLNet (Yang et al.) ─ 排列语言模型(PLM),        │
       ↓   试图融合 AR 与 AE 优势                        │
2020  ELECTRA (Clark et al.) ─ Replaced Token           │
       ↓   Detection; 每个 token 都有损失,               │
       ↓   训练效率大幅提升                               │
2020  DeBERTa (Microsoft) ─ 解耦注意力 + 增强掩码        │
       ↓   解码器; SuperGLUE 上首次超越人类              │
2020  T5 (Google) ─ Encoder-Decoder + span corruption   │
       ↓   (MLM 的 span 版本)                            │
2024  ModernBERT (2024末-2025) ─ 长上下文 + Flash        │
       ↓   Attention + 现代训练配方,                      │
       ↓   Encoder-only 复兴                             │
至今  MLM 范式持续演化: 科学文献/代码/多语言             │
      垂直领域 MLM 预训练仍是产业主流之一               │

技术路线对比(量化表)

维度MLM (BERT系)CLM/AR (GPT系)PLM (XLNet)RTD (ELECTRA)
训练信号密度~15% token~100% token~100% token~100% token
上下文方向双向单向(左→右)排列双向双向
推理方式单次前向自回归迭代自回归迭代单次前向
生成能力❌ 不天然支持✅ 天然支持✅ 支持❌ 不天然支持
理解能力✅ 强较弱(受限于单向)✅ 强✅ 强
训练效率(单位token)较低(仅15%有效)高(100%有效)极高(生成器+判别器)
预训练计算成本极高高(但效率高)
[MASK] mismatch存在不存在不存在不存在(用[MASK]训练生成器)
代表任务优势NLU(分类/NER/QA)NLG(写作/对话)NLUNLU
代表模型规模110M-340M(BERT)175B+(GPT-3)110M-340M110M-335M

注: 随着 LLM 时代到来,CLM 在规模效应下也获得了强大的 NLU 能力(GPT-3/4 的 few-shot 表现),MLM 在小模型场景下的理解优势仍然显著。


上下游

上游:模型结构与基础设施

┌─────────────────────────────────────────────┐
│                上游供应链                     │
├─────────────┬───────────────────────────────┤
│ 算力硬件     │ GPU (NVIDIA V100/A100/H100),  │
│             │ TPU (Google v2/v3/v4/v5)       │
├─────────────┼───────────────────────────────┤
│ 框架        │ PyTorch, TensorFlow, JAX       │
├─────────────┼───────────────────────────────┤
│ 训练库      │ Hugging Face Transformers,     │
│             │ FairSeq, Megatron-LM           │
├─────────────┼───────────────────────────────┤
│ Tokenizer   │ WordPiece (BERT), BPE,        │
│             │ SentencePiece, Unigram         │
├─────────────┼───────────────────────────────┤
│ 训练数据     │ 无标注文本语料: 网页、书籍、     │
│             │ 维基百科、代码等                │
└─────────────┴───────────────────────────────┘

下游:任务与应用

┌───────────────────────────────────────────────┐
│              下游应用矩阵                       │
├──────────────────┬────────────────────────────┤
│ 文本分类          │ 情感分析、垃圾邮件、意图识别  │
├──────────────────┼────────────────────────────┤
│ 序列标注          │ NER、POS Tagging            │
├──────────────────┼────────────────────────────┤
│ 阅读理解/抽取式QA  │ SQuAD、医疗QA               │
├──────────────────┼────────────────────────────┤
│ 语义相似度         │ 搜索排序、去重、推荐          │
├──────────────────┼────────────────────────────┤
│ 信息检索          │ Dense Retrieval (DPR等)      │
├──────────────────┼────────────────────────────┤
│ 句子对任务         │ 自然语言推理(NLI)、释义检测   │
├──────────────────┼────────────────────────────┤
│ 垂直领域NLP       │ 法律文本理解、生物医学NER、    │
│                  │ 金融信息抽取                  │
└──────────────────┴────────────────────────────┘

关键指标

预训练阶段

指标含义典型值域
MLM Loss被掩码位置的交叉熵损失预训练初期 ~10+, 充分收敛 ~1.5-2.5
MLM Accuracy被掩码 token 预测准确率充分训练后 ~70-75% [估算]
Perplexity语言模型困惑度 (基于 MLM 的等效计算)视词表大小, 不直接可比 AR LM
Masked Token Rate被掩码 token 占比标准 15%
训练吞吐量tokens/second/GPU视硬件和序列长度, 量级千-万级

下游微调阶段

指标基准BERT-Base 表现BERT-Large 表现
GLUE 平均分GLUE Benchmark~78 [原始论文]~80.5 [原始论文]
SQuAD 2.0 F1抽取式 QA~76.8 [原始论文]~83.1 [原始论文]
MNLI 准确率自然语言推理~84.4 [原始论文]~86.7 [原始论文]

注: 以上数据来源于 [Devlin et al., 2019] 原论文 Table 1-2。后续改进模型(RoBERTa、DeBERTa 等)在相同基准上有显著提升。


供需与市场数据

MLM 在产业中的定位(定性)

  • 嵌入与语义理解层基础设施: MLM 预训练模型(如 BERT、DeBERTa)是大量 NLP 产品的语义理解基座。搜索排序中的语义匹配、智能客服的意图识别、文档审查中的实体抽取,大量依赖 Encoder-only 的 MLM 预训练模型。
  • 从”独立主力”到”模块组件”的演变: 2019-2021 年,BERT 是 NLP 的绝对主角。2022 年 ChatGPT 之后,LLM(Decoder-only CLM)在通用 NLP 上逐渐取代 MLM 的主导地位。但 MLM 模型在以下场景仍不可替代:
    • 延迟敏感的在线服务: Encoder-only 模型一次前向传播即可完成推理,延迟远低于自回归生成。
    • 嵌入/表示任务: 语义搜索、向量数据库、Reranker 需要的是稠密向量表示,Encoder-only 模型天然适配。
    • Token-level 任务: NER、POS 等需要逐 token 标注的任务,Encoder-only 的双向表示更优。
  • 市场体量估算 [定性]: 企业 NLP 市场中,基于 MLM 的模型仍占据搜索、推荐、文档智能等细分领域的显著份额,但增长放缓,增量更多来自 LLM。

训练成本参考

模型硬件预训练时间估算成本
BERT-Base16 TPUv3 (原论文)约 4 天~数千美元级 [估算]
BERT-Large64 TPUv3 (原论文)约 4 天~数万美元级 [估算]
RoBERTa-Large1024 V100 32GB (FairSeq)~1天 [原论文 Appendix]~数万美元级 [估算]
ModernBERT-Base未充分披露未充分披露未充分披露

训练成本随硬件代际和规模快速变化,以上为粗略量级估算。


代表公司与资本映射

公司/机构代表贡献与 MLM 的关系
GoogleBERT, ALBERT, T5MLM 范式发明者; 将 BERT 集成至搜索排名, 推动产业化
Meta (Facebook)RoBERTa, XLM-R优化 MLM 训练配方; 多语言 MLM 预训练
MicrosoftDeBERTa, MiniLM在 MLM 框架上做注意力改进, DeBERTa 曾刷榜 SuperGLUE
Hugging FaceTransformers 库, Model HubMLM 模型的开源分发枢纽, 降低企业接入门槛
SalesforceALBERT (合作)高效 MLM 变体
Google/ELECTRAELECTRA (Clark et al., 2020)改进 MLM 为 Replaced Token Detection, 提升训练效率
Allen AISciBERT, 通用 NLP 工具垂直领域 MLM 预训练

产业链映射

上游硬件/算力 ─→ MLM预训练(云厂商/大厂实验室) ─→ 模型分发(HF Hub等)
                                                      ↓
                                          企业接入(微调+部署)
                                                      ↓
                                    NLP应用(搜索/客服/文档智能/医疗...)

投资逻辑

MLM 相关的投资视角

1. 已进入”价值兑现”阶段,非高增长赛道 MLM 预训练技术成熟,已不是当下 AI 投资的主叙事(主叙事在 LLM/AGI)。但 MLM 模型在企业 NLP 基础设施中仍扮演”水电煤”角色。

2. 关注”被低估的基础设施”层

  • 向量检索/语义搜索: MLM Encoder 产出的稠密嵌入是 RAG(检索增强生成)系统中检索环节的核心。随着 RAG 成为 LLM 部署标配,Encoder 模型需求反而在增长。
  • Reranker: Cross-Encoder(基于 MLM 架构的双向交互打分模型)在搜索 Reranking 和 RAG 中仍是最优方案。
  • Token-level 任务: 工业场景中的实体识别、信息抽取大量使用 MLM 微调模型,需求稳定。

3. 风险

  • 通用 NLU 任务正被大语言模型的 few-shot/in-context learning 替代,MLM 的纯分类/理解市场份额面临挤压。
  • Encoder-only 模型的商业价值更多体现在云平台的 API 服务中(如 Google Cloud NLP API、Azure AI Language),而非独立产品,投资映射较分散。

常见误读纠偏

❌ 误读 1:“MLM 和 CLM 的区别只是训练方向不同”

纠偏: 区别远不止训练方向。结构性差异导致了完全不同的能力画像:

  • MLM 是双向注意力(Encoder 架构),推理时一次前向传播,天然适合理解和表示任务。
  • CLM 是因果注意力(Decoder
source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型