掩码语言模型 (Masked Language Model, MLM)
3 秒看懂
一句话: 把句子里的词随机遮住,让模型猜被遮住的是什么——猜对了说明模型”懂了”语言。这就是 BERT 背后的核心训练范式。
3 分钟产业解释
掩码语言模型(MLM)是自然语言处理(NLP)领域最重要的预训练范式之一,由 Google 团队在 2018 年发布的 BERT(Bidirectional Encoder Representations from Transformers)论文中提出并系统化。
核心思想极简: 给模型一段文本,随机遮盖其中约 15% 的 token,训练目标是让模型根据双向上下文还原被遮盖的内容。这与 GPT 系列的自回归(从左到右逐词预测)形成根本性区别——MLM 在预测时同时看到左侧和右侧的上下文,因此获得更”深”的语言理解能力。
产业意义:
- 开启了预训练-微调范式(Pre-train then Fine-tune): 在大规模无标注语料上预训练 MLM,再在下游任务(分类、问答、NER 等)上用少量标注数据微调,大幅降低 NLP 应用的数据门槛。
- 催生了 NLP 商用化浪潮: 2019-2021 年间,几乎所有搜索、客服、文档理解、法律/医疗 NLP 产品都以 BERT 类模型为基座。
- 训练计算量巨大: BERT-Large 在原文献中使用了 16 个 Cloud TPU Pod(共 64 个 TPU 芯片)训练约 4 天 [原始论文],这推动了 AI 算力产业的需求爆发。
- 至今仍活跃: RoBERTa、ALBERT、DeBERTa、ELECTRA 等一系列改进均建立在 MLM 或其变体之上;Encoder-only 架构在工业界任务中(信息检索、语义相似度、命名实体识别)仍广泛使用。
15 分钟专家深入
从自回归到双向:MLM 诞生的逻辑链
| 维度 | 自回归 LM(GPT 系列) | 掩码语言模型(BERT 系列) |
|---|---|---|
| 训练方向 | 左→右,单向 | 双向(同时看左和右) |
| 训练任务 | Next Token Prediction | Masked Token Prediction |
| 天然适配 | 文本生成 | 文本理解(NLU) |
| 推理方式 | 自回归逐 token | 一次前向传播完成 |
| 代表模型 | GPT、GPT-2/3/4 | BERT、RoBERTa、DeBERTa |
MLM 的关键设计选择
1. 掩码比例:15% BERT 原论文 [Devlin et al., 2019] 确立了掩码 15% token 的惯例。比例太低则训练信号稀疏、效率低;比例太高则上下文信息损失严重,模型难以推断。15% 是实验调优后的平衡点。
2. 掩码策略:80-10-10 规则 对被选中的 15% token:
- 80% 替换为
[MASK]特殊标记 - 10% 替换为随机 token
- 10% 保持不变
为什么不做 100% [MASK]?因为微调和推理时输入中不存在 [MASK] 标记,100% [MASK] 会导致预训练与微调之间的分布不匹配(mismatch)。加入随机替换和保持不变迫使模型在所有情况下都依赖上下文建模。
3. 损失函数 仅在被掩码位置计算交叉熵损失(Cross-Entropy Loss),未掩码位置不贡献梯度。这与自回归 LM 在每个位置都计算损失形成对比——意味着 MLM 每个训练样本的有效监督信号量相对更少,需要更多数据和步数达到同等效果。
4. 架构选择:Transformer Encoder MLM 天然需要双向注意力(Bidirectional Self-Attention),每个 token 可以 attend 到序列中所有其他 token(包括左侧和右侧)。这对应 Transformer 的 Encoder 部分(无 causal mask),而非 Decoder(有 causal mask,只能看左侧)。
5. 下一句预测(NSP)辅助任务 BERT 原始设计中,除了 MLM 还加入了 NSP 任务:给模型两个句子,判断它们是否是原文中相邻的句子。但后续研究(RoBERTa [Liu et al., 2019])通过实验表明 NSP 对下游性能贡献有限甚至有害,此后大多数 MLM 变体去掉了 NSP。
为什么双向如此重要?
考虑句子:
“The animal didn’t cross the street because it was too ____.”
要填空,需要理解 “it” 指代什么。单向模型只能看到 “it was too” 之前的内容;双向模型同时看到后面可能的线索(如后续句子中 “tired” 还是 “wide”),对指代消解(coreference resolution)等任务有本质优势。
MLM 的内在局限
- 训练效率低: 每个样本仅 15% token 提供损失,相比自回归 LM 每个 token 都有损失,数据利用率低约 5-6 倍。
- 独立性假设: BERT 的 MLM 假设被掩码 token 之间条件独立——即同时预测多个被掩码词时,模型不建模它们之间的依赖关系。这在直觉上是不合理的(例如掩码了”New”和”York”,两者应该强相关),但实践中简化实现效果尚可。
- 推理时
[MASK]不出现: 预训练依赖[MASK]标记,但下游任务输入中无此标记,存在内在矛盾。
技术原理(机制级)
掩码语言模型的前向与训练流程
┌─────────────────────────────────────────────────────────┐
│ 输入处理阶段 │
│ │
│ 原始: "The capital of France is [Paris]" │
│ ↓ │
│ 选中15% token 掩码: "The capital of [MASK] is [MASK]" │
│ (应用 80-10-10 规则) │
│ ↓ │
│ Tokenizer → Token IDs: [101, 1996, 3007, 1997, │
│ 103, 2003, 103, 102] │
│ (103 = [MASK] token id, 101 = [CLS], 102 = [SEP]) │
└─────────────────────────────────────────────────────────┘
↓
┌─────────────────────────────────────────────────────────┐
│ Transformer Encoder (×N层) │
│ │
│ 每一层包含: │
│ ┌───────────────────────────────────────────┐ │
│ │ Multi-Head Self-Attention (双向, 无因果遮罩) │ │
│ │ Q = X·W_Q, K = X·W_K, V = X·W_V │ │
│ │ Attention(Q,K,V) = softmax(QK^T/√d_k)V │ │
│ │ → 每个 token 可以看到所有其他 token │ │
│ └───────────────────────────────────────────┘ │
│ ↓ │
│ ┌───────────────────────────────────────────┐ │
│ │ Add & LayerNorm │ │
│ └───────────────────────────────────────────┘ │
│ ↓ │
│ ┌───────────────────────────────────────────┐ │
│ │ Feed-Forward Network (2层 MLP + GELU) │ │
│ └───────────────────────────────────────────┘ │
│ ↓ │
│ ┌───────────────────────────────────────────┐ │
│ │ Add & LayerNorm │ │
│ └───────────────────────────────────────────┘ │
└─────────────────────────────────────────────────────────┘
↓
┌─────────────────────────────────────────────────────────┐
│ MLM Head (预测头) │
│ │
│ 仅提取 [MASK] 位置的隐藏状态 h_masked │
│ ↓ │
│ h_masked → Dense(隐藏维度→词表大小) → softmax │
│ ↓ │
│ 预测分布 P(token | context) │
│ ↓ │
│ Loss = CrossEntropy(P, 真实token) │
│ (仅对被掩码位置求和, 再取平均) │
└─────────────────────────────────────────────────────────┘
关键参数量级(以 BERT-Base 为例)
| 参数 | BERT-Base | BERT-Large |
|---|---|---|
| 层数 (L) | 12 | 24 |
| 隐藏维度 (d_model) | 768 | 1024 |
| 注意力头数 (h) | 12 | 16 |
| 参数量 | ~110M | ~340M |
| 最大序列长度 | 512 | 512 |
| 词表大小 | 30,522 (WordPiece) | 30,522 |
| 激活函数 | GELU | GELU |
| 学习率 | 1e-4 | 1e-4 (原文献) |
数据来源: 以上数据来自 [Devlin et al., 2019] 原论文 Table 1。
自注意力的双向性(与因果遮罩的区别)
自回归 LM (Decoder, 因果遮罩): MLM (Encoder, 双向):
t1 t2 t3 t4 t1 t2 t3 t4
t1 [✓] [✗] [✗] [✗] t1 [✓] [✓] [✓] [✓]
t2 [✓] [✓] [✗] [✗] t2 [✓] [✓] [✓] [✓]
t3 [✓] [✓] [✓] [✗] t3 [✓] [✓] [✓] [✓]
t4 [✓] [✓] [✓] [✓] t4 [✓] [✓] [✓] [✓]
✓ = 可以attend到 ✗ = 被遮罩(不可见) 所有位置互相可见
MLM 使用全连接注意力图,没有任何因果遮罩。这是其双向语义理解能力的结构基础。
MLM 与 CLM 的损失计算对比
CLM (Causal LM): 每个位置都计算 loss
位置: [The] [capital] [of] [France] [is] [Paris]
损失: ✓ ✓ ✓ ✓ ✓ ✓
有效监督: 6/6 = 100%
MLM (Masked LM): 仅掩码位置计算 loss
位置: [The] [capital] [of] [MASK] [is] [MASK]
损失: ✗ ✗ ✗ ✓ ✗ ✓
有效监督: 2/6 ≈ 33% (实际为被掩码的15%)
技术演进史
2013 Word2Vec (Mikolov) ──────────────────────────────┐
↓ │
2014 GloVe (Pennington) │
↓ (静态词向量时代) │
2017 Transformer (Vaswani et al.) ─ "Attention is All │
↓ You Need" │
2018 ELMo (Peters et al.) ─ 基于 BiLSTM 的上下文 │
↓ 词表示 │
2018.06 GPT-1 (OpenAI) ─ Transformer Decoder + │
↓ 自回归预训练 │
2018.10 ★ BERT (Google) ─ Transformer Encoder + │
↓ MLM + NSP 预训练; NLP 里程碑 │
2019.02 GPT-2 (OpenAI) ─ 规模扩展 + 零样本 │
↓ │
2019.07 RoBERTa (Facebook) ─ 去 NSP, 动态掩码, │
↓ 更多数据, 更长训练; MLM 最佳实践 │
2019.09 ALBERT (Google) ─ 参数共享 + 句序预测(SOP) │
↓ 替代 NSP │
2019.10 XLNet (Yang et al.) ─ 排列语言模型(PLM), │
↓ 试图融合 AR 与 AE 优势 │
2020 ELECTRA (Clark et al.) ─ Replaced Token │
↓ Detection; 每个 token 都有损失, │
↓ 训练效率大幅提升 │
2020 DeBERTa (Microsoft) ─ 解耦注意力 + 增强掩码 │
↓ 解码器; SuperGLUE 上首次超越人类 │
2020 T5 (Google) ─ Encoder-Decoder + span corruption │
↓ (MLM 的 span 版本) │
2024 ModernBERT (2024末-2025) ─ 长上下文 + Flash │
↓ Attention + 现代训练配方, │
↓ Encoder-only 复兴 │
至今 MLM 范式持续演化: 科学文献/代码/多语言 │
垂直领域 MLM 预训练仍是产业主流之一 │
技术路线对比(量化表)
| 维度 | MLM (BERT系) | CLM/AR (GPT系) | PLM (XLNet) | RTD (ELECTRA) |
|---|---|---|---|---|
| 训练信号密度 | ~15% token | ~100% token | ~100% token | ~100% token |
| 上下文方向 | 双向 | 单向(左→右) | 排列双向 | 双向 |
| 推理方式 | 单次前向 | 自回归迭代 | 自回归迭代 | 单次前向 |
| 生成能力 | ❌ 不天然支持 | ✅ 天然支持 | ✅ 支持 | ❌ 不天然支持 |
| 理解能力 | ✅ 强 | 较弱(受限于单向) | ✅ 强 | ✅ 强 |
| 训练效率(单位token) | 较低(仅15%有效) | 高(100%有效) | 高 | 极高(生成器+判别器) |
| 预训练计算成本 | 高 | 高 | 极高 | 高(但效率高) |
| [MASK] mismatch | 存在 | 不存在 | 不存在 | 不存在(用[MASK]训练生成器) |
| 代表任务优势 | NLU(分类/NER/QA) | NLG(写作/对话) | NLU | NLU |
| 代表模型规模 | 110M-340M(BERT) | 175B+(GPT-3) | 110M-340M | 110M-335M |
注: 随着 LLM 时代到来,CLM 在规模效应下也获得了强大的 NLU 能力(GPT-3/4 的 few-shot 表现),MLM 在小模型场景下的理解优势仍然显著。
上下游
上游:模型结构与基础设施
┌─────────────────────────────────────────────┐
│ 上游供应链 │
├─────────────┬───────────────────────────────┤
│ 算力硬件 │ GPU (NVIDIA V100/A100/H100), │
│ │ TPU (Google v2/v3/v4/v5) │
├─────────────┼───────────────────────────────┤
│ 框架 │ PyTorch, TensorFlow, JAX │
├─────────────┼───────────────────────────────┤
│ 训练库 │ Hugging Face Transformers, │
│ │ FairSeq, Megatron-LM │
├─────────────┼───────────────────────────────┤
│ Tokenizer │ WordPiece (BERT), BPE, │
│ │ SentencePiece, Unigram │
├─────────────┼───────────────────────────────┤
│ 训练数据 │ 无标注文本语料: 网页、书籍、 │
│ │ 维基百科、代码等 │
└─────────────┴───────────────────────────────┘
下游:任务与应用
┌───────────────────────────────────────────────┐
│ 下游应用矩阵 │
├──────────────────┬────────────────────────────┤
│ 文本分类 │ 情感分析、垃圾邮件、意图识别 │
├──────────────────┼────────────────────────────┤
│ 序列标注 │ NER、POS Tagging │
├──────────────────┼────────────────────────────┤
│ 阅读理解/抽取式QA │ SQuAD、医疗QA │
├──────────────────┼────────────────────────────┤
│ 语义相似度 │ 搜索排序、去重、推荐 │
├──────────────────┼────────────────────────────┤
│ 信息检索 │ Dense Retrieval (DPR等) │
├──────────────────┼────────────────────────────┤
│ 句子对任务 │ 自然语言推理(NLI)、释义检测 │
├──────────────────┼────────────────────────────┤
│ 垂直领域NLP │ 法律文本理解、生物医学NER、 │
│ │ 金融信息抽取 │
└──────────────────┴────────────────────────────┘
关键指标
预训练阶段
| 指标 | 含义 | 典型值域 |
|---|---|---|
| MLM Loss | 被掩码位置的交叉熵损失 | 预训练初期 ~10+, 充分收敛 ~1.5-2.5 |
| MLM Accuracy | 被掩码 token 预测准确率 | 充分训练后 ~70-75% [估算] |
| Perplexity | 语言模型困惑度 (基于 MLM 的等效计算) | 视词表大小, 不直接可比 AR LM |
| Masked Token Rate | 被掩码 token 占比 | 标准 15% |
| 训练吞吐量 | tokens/second/GPU | 视硬件和序列长度, 量级千-万级 |
下游微调阶段
| 指标 | 基准 | BERT-Base 表现 | BERT-Large 表现 |
|---|---|---|---|
| GLUE 平均分 | GLUE Benchmark | ~78 [原始论文] | ~80.5 [原始论文] |
| SQuAD 2.0 F1 | 抽取式 QA | ~76.8 [原始论文] | ~83.1 [原始论文] |
| MNLI 准确率 | 自然语言推理 | ~84.4 [原始论文] | ~86.7 [原始论文] |
注: 以上数据来源于 [Devlin et al., 2019] 原论文 Table 1-2。后续改进模型(RoBERTa、DeBERTa 等)在相同基准上有显著提升。
供需与市场数据
MLM 在产业中的定位(定性)
- 嵌入与语义理解层基础设施: MLM 预训练模型(如 BERT、DeBERTa)是大量 NLP 产品的语义理解基座。搜索排序中的语义匹配、智能客服的意图识别、文档审查中的实体抽取,大量依赖 Encoder-only 的 MLM 预训练模型。
- 从”独立主力”到”模块组件”的演变: 2019-2021 年,BERT 是 NLP 的绝对主角。2022 年 ChatGPT 之后,LLM(Decoder-only CLM)在通用 NLP 上逐渐取代 MLM 的主导地位。但 MLM 模型在以下场景仍不可替代:
- 延迟敏感的在线服务: Encoder-only 模型一次前向传播即可完成推理,延迟远低于自回归生成。
- 嵌入/表示任务: 语义搜索、向量数据库、Reranker 需要的是稠密向量表示,Encoder-only 模型天然适配。
- Token-level 任务: NER、POS 等需要逐 token 标注的任务,Encoder-only 的双向表示更优。
- 市场体量估算 [定性]: 企业 NLP 市场中,基于 MLM 的模型仍占据搜索、推荐、文档智能等细分领域的显著份额,但增长放缓,增量更多来自 LLM。
训练成本参考
| 模型 | 硬件 | 预训练时间 | 估算成本 |
|---|---|---|---|
| BERT-Base | 16 TPUv3 (原论文) | 约 4 天 | ~数千美元级 [估算] |
| BERT-Large | 64 TPUv3 (原论文) | 约 4 天 | ~数万美元级 [估算] |
| RoBERTa-Large | 1024 V100 32GB (FairSeq) | ~1天 [原论文 Appendix] | ~数万美元级 [估算] |
| ModernBERT-Base | 未充分披露 | 未充分披露 | 未充分披露 |
训练成本随硬件代际和规模快速变化,以上为粗略量级估算。
代表公司与资本映射
| 公司/机构 | 代表贡献 | 与 MLM 的关系 |
|---|---|---|
| BERT, ALBERT, T5 | MLM 范式发明者; 将 BERT 集成至搜索排名, 推动产业化 | |
| Meta (Facebook) | RoBERTa, XLM-R | 优化 MLM 训练配方; 多语言 MLM 预训练 |
| Microsoft | DeBERTa, MiniLM | 在 MLM 框架上做注意力改进, DeBERTa 曾刷榜 SuperGLUE |
| Hugging Face | Transformers 库, Model Hub | MLM 模型的开源分发枢纽, 降低企业接入门槛 |
| Salesforce | ALBERT (合作) | 高效 MLM 变体 |
| Google/ELECTRA | ELECTRA (Clark et al., 2020) | 改进 MLM 为 Replaced Token Detection, 提升训练效率 |
| Allen AI | SciBERT, 通用 NLP 工具 | 垂直领域 MLM 预训练 |
产业链映射
上游硬件/算力 ─→ MLM预训练(云厂商/大厂实验室) ─→ 模型分发(HF Hub等)
↓
企业接入(微调+部署)
↓
NLP应用(搜索/客服/文档智能/医疗...)
投资逻辑
MLM 相关的投资视角
1. 已进入”价值兑现”阶段,非高增长赛道 MLM 预训练技术成熟,已不是当下 AI 投资的主叙事(主叙事在 LLM/AGI)。但 MLM 模型在企业 NLP 基础设施中仍扮演”水电煤”角色。
2. 关注”被低估的基础设施”层
- 向量检索/语义搜索: MLM Encoder 产出的稠密嵌入是 RAG(检索增强生成)系统中检索环节的核心。随着 RAG 成为 LLM 部署标配,Encoder 模型需求反而在增长。
- Reranker: Cross-Encoder(基于 MLM 架构的双向交互打分模型)在搜索 Reranking 和 RAG 中仍是最优方案。
- Token-level 任务: 工业场景中的实体识别、信息抽取大量使用 MLM 微调模型,需求稳定。
3. 风险
- 通用 NLU 任务正被大语言模型的 few-shot/in-context learning 替代,MLM 的纯分类/理解市场份额面临挤压。
- Encoder-only 模型的商业价值更多体现在云平台的 API 服务中(如 Google Cloud NLP API、Azure AI Language),而非独立产品,投资映射较分散。
常见误读纠偏
❌ 误读 1:“MLM 和 CLM 的区别只是训练方向不同”
纠偏: 区别远不止训练方向。结构性差异导致了完全不同的能力画像:
- MLM 是双向注意力(Encoder 架构),推理时一次前向传播,天然适合理解和表示任务。
- CLM 是因果注意力(Decoder