模型层 开放阅读

预训练

Pretraining

概念 ID
pretraining
更新时间
2026-05-29
来源数量
待补

预训练

3 秒看懂

预训练是深度学习模型的“通识教育”阶段:在海量无标注数据上,让模型通过自监督学习(如填词、预测下一词)掌握通用语义、视觉或跨模态规律,再把这份“通才”能力迁移到下游具体任务(微调或零样本推理)。先学万物常识,再做专业任务。

3 分钟产业解释

预训练已从学术技巧演进为产业竞争的主战场。以**大语言模型(LLM)**为代表的预训练模型,正重构AI产业分工:

  • 范式:模型先在TB~PB级通用语料上完成耗时数周、烧掉数百万美元算力的预训练,获得强大的语言理解与生成基座;再通过轻量微调或提示工程适配客服、写作、编程等场景。
  • 成本结构:预训练决定了模型能力的“天花板”,其算力消耗通常占整个模型生命周期总成本的绝大部分。一次千亿参数模型的预训练可能需要数千块GPU运行数周,电力与设备折旧高达数百万至上千万美元(行业估算)。
  • 数据壁垒:高质量、去重、多语言、覆盖各领域的长文本数据已成为战略资源,数据清洗与配比直接影响模型知识边界和安全性。
  • 开源vs闭源:Meta的LLaMA系列、Mistral等开源模型降低了应用门槛,虽在顶尖基准上可能弱于GPT‑4级闭源模型,但通过社区微调迅速渗透企业私有化部署。

预训练是AI产业链中集中度最高、门槛最硬、对算力依赖最强的环节,正在催生“基础模型即服务(FMaaS)”的新业态。

15 分钟专家深入

预训练的本质是利用自监督信号从原始数据中提取可迁移的表示,其背后是三个关键问题的系统权衡:

  1. 训练目标设计

    • 掩码语言建模 (MLM):像完形填空,随机遮住部分输入,要求模型还原。典型目标:BERT的“Masked LM”。
    • 因果语言建模 (CLM):自回归地逐词预测下一个词,构成流畅生成的基础。GPT系列以此为核心。
    • 去噪自动编码:打乱或替换输入片段,再恢复原文,如T5的Span Corruption。
    • 对比学习:拉开正样本对(语义相近的文本/图像-文本)与负样本对的距离。代表作:SimCLR、CLIP。
  2. 模型架构适配

    • 仅编码器(如BERT):双向关注上下文,擅长理解类任务,但不能直接生成。
    • 仅解码器(如GPT):自回归生成,当前的大语言模型主流架构,可通过缩放展现涌现能力。
    • 编码器‑解码器(如T5、BART):兼顾理解与生成,在翻译、摘要等任务上灵活,但在极大规模时未占优势。
    • 多模态扩展:在图像、语音、视频等模态上分别设计编码器,通过对齐(如对比学习)或自回归融合,构建跨模态基座。
  3. 分布式训练策略
    为支撑万亿参数模型,必须将计算、存储、通信进行三维并行拆分:

    • 数据并行:每个设备拥有完整模型副本,并行处理不同批次数据,梯度在设备间AllReduce同步。
    • 张量并行:将Transformer层的权重矩阵切分到多设备,通信依赖AllReduce/ReduceScatter,对卡间带宽要求极高。
    • 流水线并行:将模型按层切分,各设备负责连续几层,数据像流水线般传递,减少空闲等待。
    • 序列并行专家并行:前者对长序列维度切分;后者在MoE(混合专家)架构中将不同Token路由到不同专家,通信模式以All‑to‑All为主。

预训练的“魔力”还来自尺度效应:当模型参数、数据量、计算量同步扩大时,模型不仅在下游任务上单调提升,还可能涌现出上下文学习、思维链等原先小模型完全不具备的能力。然而“尺度定律”的斜率正在放缓,研究者开始追求更高数据质量和更高效的训练范式。

技术原理

以Transformer解码器架构下的因果语言建模为例,剖析预训练最深层的机制。

Transformer 自注意力核心

模型将输入序列映射为查询 Q、键 K、值 V 三组向量,自注意力计算:
Attention(Q, K, V) = softmax(QK^T / √d_k + Mask) V
其中Mask保证位置t只能看到自身及之前的信息,实现单向上下文。

预训练前向与损失

给定一段文本x = (x_1, x_2, ..., x_n),模型逐位置预测下一个Token的概率p_θ(x_t | x_<t)
训练目标是最大化对数似然:
L(θ) = -∑_{t=1}^n log p_θ(x_t | x_<t)
实际操作中通过Teacher Forcing一次性计算所有位置的损失,极大提高并行效率。

混合精度与优化

为加速训练且节省显存,普遍采用FP16/BF16混合精度:前向与反向传播用半精度,参数更新维持FP32主副本。优化器多用AdamW,其解耦的权重衰减策略有助于大模型训练的稳定。

分布式训练的通信模式(ASCII示意)

+-----------+      AllReduce (梯度求和)    +-----------+
|   GPU 0   | <------------------------> |   GPU 1   |
+-----------+                             +-----------+
      |                                        |
      |  张量并行:正向/反向 AllReduce         |
      |                                        |
+-----------+     流水线并行:激活 P2P 传     +-----------+
|   GPU 2   | ------------------------------> |   GPU 3   |
+-----------+                                  +-----------+

MoE 专家路由:All-to-All (Token分发与聚合)

关键参数(定性):

  • 批次大小:通常达到全局数千Token,需平衡梯度噪声与收敛速度。
  • 学习率调度:采用预热(warmup) + 余弦衰减,避免训练早期的不稳定。
  • 计算量估算(估算公式,非特定模型数据):C ≈ 6 N D,其中N为参数量,D为训练Token数。[未充分披露具体常量,上述为通用理论推导]

数据预处理流水线

原始网页/文档 → 语言过滤 & 质量评分 → 去重(URL、文档级、段落级)→ 个性化信息脱敏 → 分词(BPE/WordPiece/SentencePiece) → 打包为定长序列。这一流程的质量决定了预训练模型的知识上限。

技术演进史

  • 2013‑2016(词嵌入与上下文稀疏表示):Word2Vec、GloVe提供静态词向量。
  • 2017‑2018(Transformer与预训练爆发):“Attention Is All You Need”奠定底层架构;ULMFiT证明了迁移学习在NLP可行;ELMo用双向LSTM产生动态表示,展示了上下文感知的优势;BERT(2018)通过掩码语言建模和下一句预测,将预训练范式推向所有NLP任务,成为里程碑。
  • 2019‑2020(规模化与生成式预训练):GPT‑2展示自回归语言模型的零样本能力;T5统一了所有NLP任务为文本到文本格式;GPT‑3(2020)以175B参数呈现上下文学习,标志“规模即能力”的时代。
  • 2021‑2022(代码、对齐与多模态):Codex/CodeGen引入代码预训练,提升逻辑推理;CLIP、DALL·E预训练对齐图像与文本;ViT将纯Transformer用于图像预训练(有监督分类,如ImageNet-21k)。
  • 2023‑2024(开放生态与长上下文):LLaMA(1/2/3)、Mistral等开源模型以更小参数展现强劲性能;长上下文扩展从数K到百万Token;MoE架构(如Mixtral、Qwen‑MoE)在固定算力下提升效果;多模态统一预训练成为前沿方向。

技术路线对比(量化表)

路线典型模型预训练任务优势局限主要适用场景
自回归语言模型GPT‑4, LLaMA 3因果语言建模 (CLM)强生成能力,涌现上下文学习/推理双向上下文较差,推理生成需顺序解码偏慢聊天、创作、代码生成
掩码自编码BERT, RoBERTa掩码语言建模 (Masked LM)双向语义理解强,微调效率高不能直接生成文本,难以扩展至极大规模文本分类、实体识别
编码器‑解码器T5, BART, UL2去噪重构 (Span Corruption)灵活适配理解与生成,一模型多用在大模型竞赛中未被优先选择翻译、摘要、问答
对比多模态CLIP, SigLIP图文对比 (Contrastive)跨模态检索,零样本分类,鲁棒性强生成能力有限,需额外解码器视觉搜索、多模态理解
掩码自编码(CV)MAE, SimMIM掩码图像块重建 (MIM)高效学习视觉表示,无需标注下游任务通常需额外检测头图像分类、目标检测
扩散预训练DiT (Diffusion)加噪去噪生成高质量图像/视频生成,可控性强文本理解较弱,通常需结合文本编码器文生图、视频生成

上下游

上游(为预训练提供“原料”与“产线”):

  • 算力硬件:GPU/TPU集群、高速互联网络(InfiniBand/RoCE)。
  • 数据工程:大规模数据爬取、清洗、标注平台,合成数据生成工具。
  • 训练框架:DeepSpeed、Megatron‑LM、Colossal‑AI等分布式训练引擎;Hugging Face Transformers简化模型实现。

下游(消费预训练成果):

  • 模型微调与适配:企业通过LoRA/QLoRA等参数高效微调,将基座模型适配到客服、法务、医疗等垂直领域。
  • 模型即服务(MaaS):OpenAI API、百度智能云千帆等,提供推理接口,按Token计费。
  • 端侧部署:通过蒸馏、量化将预训练能力压缩至手机、汽车等设备。

关键指标

  • 模型参数量:影响记忆容量与推理成本,并非越大越好。当前大规模预训练常采用MoE架构,通过激活参数(实际参与计算的参数)而非总参数衡量算力需求。
  • 训练计算量(FLOPs):核心资源度量,数十亿至数万亿TFLOPs不等。
  • 训练数据量 & 数据质量:Token数量是基础,但数据去重比例、知识覆盖度、有害内容过滤率同等关键。
  • 预训练损失(Perplexity / Cross‑Entropy):反映模型对数据压缩的程度,但不可作为下游性能的唯一指标。
  • 零样本/少样本 benchmark 得分:如MMLU、HumanEval、多语言理解分数,是产业界对齐能力的通用标尺。

供需与市场数据

  • 算力供给:高端GPU(如NVIDIA H100等)长期供不应求,交付周期和价格严重影响预训练计划。云厂商租赁集群等待时间可长达数月。
  • 基础模型供给:形成“闭源旗舰 + 开源追赶”的双层结构。闭源模型(GPT‑4级别)通过API控制供给;开源模型(LLaMA系列)使中小团队也能微调出定制模型,推动社区创新。
  • 市场趋势:全球预训练相关投入正从“证明可训”转向“如何训得高效、便宜”。有估算认为,一次顶级模型的预训练电费及硬件折旧成本已达千万美元级,行业正在探索稀疏计算、蒸馏和模型压缩以控制边际成本。[具体市场数值未公开检索确认,仅基于行业公开讨论定性]

代表公司与资本映射

角色代表机构资本/资源特点
顶级闭源模型研发OpenAI (GPT‑4), Google DeepMind (Gemini)巨额融资+科技巨头供血,深度绑定云与算力
开源力量与算力变现Meta (LLaMA), Mistral AI开源建立生态,吸聚开发者,反哺云业务/品牌
国产预训练先锋百度文心, 智谱AI (ChatGLM), 阿里通义国家政策+互联网生态,自研软硬件并行
算力“卖铲人”NVIDIA, AMDAI算力核心供应商,资本追捧
训练平台与工具链Hugging Face, 微软/云服务器平台型企业,汇聚预训练与微调流量

投资逻辑

  1. 算力先于模型:预训练热潮拉动训练与推理芯片、光模块、液冷等硬件持续需求,确定性较高。
  2. 数据工程工具:高质量数据筛选、合成、版权合规的中间件将成为稀缺服务。
  3. 模型能力“厚度”决定护城河:具备持续Scaling能力并能在多模态、工具使用上保持前沿的闭源模型,有望通过API构建平台型生态。
  4. 开源模型的差异化微调机会:借助低秩适配(LoRA),垂类数据持有者可低门槛打造专业模型,形成数据飞轮。

常见误读纠偏

  1. “预训练就是从头到尾把模型所有能力都训好”
    纠偏:预训练获得的是通用基座,后续的微调、对齐(RLHF)、提示工程对实际产品表现同样关键。且很多模型会进行“继续训练”或“增量预训练”来注入新知识,并非一次完成。
  2. “参数越多,模型越强”
    纠偏:参数总量不等于智能。MoE架构通过只激活部分专家,可在相同算力下提升效果;数据质量、训练稳定性和架构选择也能让小模型表现超过瞎堆参数的大模型。涌现能力与计算量、数据量、参数量三重尺度关联,而非单看参数量。
  3. “预训练只能用于语言”
    纠偏:计算机视觉(MAE、ViT)、语音识别(Wav2Vec)、药物发现(分子预训练)以及多模态统一预训练都已经成规模应用。预训练是一种通用方法论。

学习路径

  1. 基础:通读《Attention Is All You Need》,理解自注意力。
  2. 预训练鼻祖:BERT论文《Pre-training of Deep Bidirectional Transformers》与GPT‑2论文。
  3. 代码实践:使用Hugging Face Transformers加载BERT/GPT‑2,尝试微调任务。
  4. 规模化:阅读GPT‑3《Language Models are Few‑Shot Learners》和Chinchilla缩放定律论文,理解算力与数据配比。
  5. 分布式训练:上手Megatron‑LM/DeepSpeed示例,了解3D并行。
  6. 前沿:关注LLaMA开源源码、多模态预训练(如BLIP‑2)、MoE架构技术报告。

一句话总结

预训练是深度学习将海量无标注数据压缩为通用认知的工程奇迹,它定义了AI能力的天花板,其规模、数据与架构的博弈是当今人工智能竞争的核心轴线。

延伸阅读与来源

本次联网检索未提供可直接引用的实时资料,以下推荐经典文献与开源资源,供进一步深度学习(均为业界公认基础资料,非本次搜索返回结果):

  • Vaswani et al. “Attention Is All You Need” (2017) – Transformer架构基石。
  • Devlin et al. “BERT: Pre-training of Deep Bidirectional Transformers” (2019) – 掩码语言模型预训练范式。
  • Brown et al. “Language Models are Few‑Shot Learners” (2020) – GPT‑3及涌现能力。
  • Kaplan et al. “Scaling Laws for Neural Language Models” (2020) – 参数量与计算量的尺度关系。
  • Touvron et al. “LLaMA: Open and Efficient Foundation Language Models” (2023) – 开源高效预训练实践。
  • DeepSpeed与Megatron‑LM开源文档,Hugging Face Transformers库。

(由于资料获取受限,所有具体硬件规格、精确市场数据均未给出确切数字,实际投资及技术选型需以官方白皮书或专业行业报告为准。)

source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型