模型层 开放阅读

流水线并行

Pipeline Parallelism, PP

概念 ID
pipeline-parallelism-pp
更新时间
2026-05-29
来源数量
待补

流水线并行

3 秒看懂

流水线并行(Pipeline Parallelism,PP)是将深度学习模型按层切分成多个连续阶段,每个阶段部署到不同加速器上,让数据像工厂流水线一样以微批次(micro‑batch)形式依次流过各阶段。它能在不显著增加通信量的前提下突破单卡显存限制,使训练千亿级稠密大模型成为可能,但会引入“流水线气泡”(pipeline bubble)导致部分设备暂时闲置。这是大模型分布式训练中与数据并行、张量并行并列的三大核心策略之一。

3 分钟产业解释

在训练千亿参数级大模型时,单张GPU显存(如NVIDIA H100‑80GB)远不够存下完整模型状态(参数、梯度与优化器状态)。于是出现模型切分两条路径:张量并行将单层内矩阵运算切分到多卡,虽能解决单层过大的问题,但通信极密集,高度依赖节点内高速互联(如NVLink、NVSwitch);流水线并行则将网络按深度方向切分,把若干连续层打包为一个“阶段”放在一个设备上,数据微批次按序通过。相邻阶段只需传递层界面的激活值和梯度,通信量远小于张量并行,天然适合跨节点扩展,常与数据并行构成“3D并行”范式。

产业落地时,流水线并行最大的痛点是“气泡”——前几个微批次注入或排空流水线时,部分下游或上游设备在等待数据,造成计算资源浪费。为此出现了多种调度算法:GPipe采用全前向再全后向,气泡大但实现简单,且会随微批次数量线性增加显存;1F1B(一次前向一次后向交替)能大幅压缩气泡并将峰值显存控制在与流水线深度相关的常数级,被Megatron‑LM与DeepSpeed等框架广泛采用;进一步还有交错式1F1B,将每个设备再分配多个更小的子阶段,把气泡打散得更均匀。

实际操作中,流水线并行常与张量并行配合:张量并行解决单层计算过重问题(限于节点内高带宽域),流水线并行跨节点串联多层,数据并行在最外层复制整个流水线。例如,Llama 2 70B模型训练采用数据并行、张量并行、流水线并行相结合的3D并行,其论文明确提到基于Megatron‑LM的流水线并行实现;稠密万亿参数级模型的预训练也普遍采用此套路。需要指出,早期代表模型GPT‑3(2020年,175B)主要使用张量并行加数据并行而未采用流水线并行,说明并非所有大模型都必须使用PP,但在模型规模进一步扩大后流水线并行已逐渐成为刚需配置。

技术原理

问题形式化

给定一个包含 L 层的深度网络,将其切分为 K 个顺序阶段,第 i 个阶段包含若干层,并部署在第 i 个设备上。一个mini‑batch被进一步切分为 M 个micro‑batch。训练过程需完成这 M 个微批次的前向与反向传播,并以规定的顺序在各阶段间传递中间激活与梯度。流水线并行的核心问题是设计微批次的调度顺序与资源管理策略,以最小化设备空闲时间(气泡)并控制显存峰值,同时保持严格的数值等价性(或可控的近似)。

流水线气泡

气泡是流水线并行的固有代价,源于流水线注入与排空期间无法让所有设备同时工作。GPipe 式调度下,先顺序执行全部 m 个微批次的前向,再执行全部后向,其气泡时间可直观理解为 (K‑1)×(F+B) 的时间窗口,其中 F 和 B 分别表示单micro‑batch前向与反向时间(通常 B≈2F)。1F1B 调度将前向与后向交替进行,可将气泡压缩为约 (K‑1) 个微批次的时间,显著提高设备利用率,代价是调度实现更复杂且对微批次间依赖管理要求更高。交错式1F1B通过将每个设备切分为 V 个虚拟阶段(virtual stages),把气泡进一步弥散为 (K×V‑1) 段均匀小空闲,在相似硬件上可将气泡率从1F1B的约 15–20% 压缩至 5–10% 量级(实际数字受 K、M、模型结构等因素影响而差异较大,此处引用行业典型实验结果作为量级参考,非特定产品指标)。

显存与激活管理

  • GPipe模式:每个阶段需保留全部 M 个微批次的中间激活用于反向传播,峰值显存与 M 成正比。当 M 很大时,显存会成为瓶颈。配合激活重计算(activation checkpointing)可缓解此问题,但额外引入重算开销。
  • 1F1B调度:阶段 i 在完成某微批次前向后,可尽早执行对应后向并释放中间激活,峰值显存只与流水线深度及单个微批次激活大小相关,与 M 无关。大规模设置下,1F1B的显存优势是其被广泛采用的主导因素。
  • 激活卸载与ZeRO结合:DeepSpeed等方案进一步将部分中间激活卸载到CPU内存,结合ZeRO优化器状态分割,可在单机上训练超出纯GPU显存数倍的模型。

通信模式与对比

  • 流水线并行:仅阶段交界处点对点(P2P)传递前向激活与反向梯度,通信量约正比于 micro‑batch size × 层界面特征维度。通信可容易地与计算重叠,对网络带宽要求相对温和,是目前跨节点扩展的核心技术。
  • 张量并行:对层内计算进行切分,前向后向均需密集的AllReduce或ReduceScatter集体通信,带宽要求极高,典型实现仅限节点内高速域(如NVLink 900 GB/s)。
  • 数据并行:反向传播后对全体梯度做一次AllReduce,通信量与参数总量正比,通信在全体数据并行进程中同步,扩展时通信延迟上升。
  • 混合并行:大规模训练典型拓扑为——节点内张量并行(利用高带宽),节点间流水线并行(利用中等带宽),多副本数据并行(利用跨机池化带宽),即“3D并行”。Meta在介绍其大模型基础设施时曾公开表示,3D并行是其训练数万亿参数级别模型的核心策略。

关键参数

  • 流水线阶段数(K):即模型分成的顺序段数量,也是参与流水线的设备组大小。增大 K 可降低单卡显存,但也会增加气泡占比和通信延迟。典型设置根据模型深度与集群拓扑选定,常落在4–32之间;更大规模时与张量并行联合使用。
  • 微批次数(M):每个pipe‑group在一轮训练中处理的微批次数量。M≥4K 是一条经验准则以将气泡控制在可接受范围(如<10%),但 M 受全局batch= micro‑batch × M × DP_SIZE 约束,micro‑batch又受单卡显存限制,因此 M 无法任意放大。
  • 气泡率:设备空闲时间占总计算时间之比。1F1B下气泡率约 (K‑1)/M,在 K=8, M=32 时理论气泡率约 22%(简化假设 F=B,实际因通信、负载不均而更高)。交错式1F1B可将气泡率压至显著更低水平。行业典型实验表明,精心调优的3D并行可以将整体MFU提升至50–60%(来源:NVIDIA、Meta相关技术报告)。
  • 激活显存峰值:直接决定模型可否装进设备。1F1B可大致保持峰值与 M 无关,而取决于流水线深度和单micro‑batch激活量。结合gradient checkpointing后,激活内存可再降低约 30–50%(公开资料常见数据,非单一基准)。
  • 通信带宽利用率:PP的点对点带宽需求远低于TP,通常在跨节点以太网(25–200 Gbps)或InfiniBand(100–400 Gbps)上即可高效运行。NVIDIA公开文档建议流水线并行可运行于“低到中带宽”网络,张量并行则需高带宽域。

技术路线

调度驱动的技术分野

  • 全同步GPipe:Google提出的经典方案,实现简单,便于配合激活重计算。适用于探索阶段或微批次规模受限但 M 较小的场景,因显存限制而逐渐不被作为默认选项。
  • 同步1F1B(包括交错式):当前主流,以Megatron‑LM、DeepSpeed为代表。通过精细调度将气泡压缩并控制显存,适合千卡级及以上训练集群。
  • 异步流水线(PipeDream及其变体):模块间使用不同版本的权重快照进行前/反向,理论消除气泡。但权重滞后会引入数值噪声,需特殊优化器补偿(如PipeDream的“Weight Staleness”校正),因收敛稳定性风险未在大厂生产环境中广泛采用,但在某些带宽受限或异构设备场景仍有研究价值。微软DeepSpeed团队公开将其归类为“有前景但需谨慎评估收敛行为”的方向。

框架实现路径

  • Megatron‑LM(NVIDIA):核心提供1F1B与交错1F1B调度,与张量并行、数据并行紧密耦合,可为每个并行维度独立配置规模,是目前LLM训练事实标准之一。Llama 2、Megatron‑Turing NLG等模型均明确采用。
  • DeepSpeed(Microsoft):流水线引擎结合ZeRO优化器,可融合流水线并行与零冗余优化,支持自动混合并行配置搜索,被开源社区广泛采用,并在Azure AI上提供商业支持。
  • Google GPipe/Pax/Pathways:GPipe是最早的通用PP框架,后续融入Pax及Pathways,支持跨TPU Pod的流水线并行,面向谷歌内部及云用户。
  • PyTorch生态系统:PyTorch通过torch.distributed提供P2P通信原语;更高层的torch.distributed.pipelining(2023年起集成)提供统一API;Hugging Face Accelerate则进一步降低门槛,允许几行代码调用DeepSpeed或Megatron‑LM后端。

上游

  • AI加速器:GPU(NVIDIA H100/B200、AMD MI300X)、TPU(Google v5p)、NPU(昇腾910B等)。单卡显存、算力以及卡间互联带宽直接决定PP切分粒度与效率。NVIDIA的NVLink‑C2C及NVSwitch为节点内TP提供高带宽,而跨节点则依赖InfiniBand或RoCE网络。
  • 高速互联与网络设施:InfiniBand(如NVIDIA Quantum‑2 400 Gbps)、基于以太网的RoCE v2、PCIe 5.0/6.0构成跨节点PP通信的物理基础。Mellanox(现NVIDIA网络部门)提供的DPU/SmartNIC可卸载通信,进一步优化重叠。
  • 分布式通信库:NCCL(针对GPU优化)、Gloo、MPI。NCCL的P2P send/recv是PP通信的主要承载。NCCL的版本与拓扑感知对性能至关重要,公开数据表明配置不当可能导致10–20%的性能损失。
  • 集群调度与编排系统:如Kubernetes配合Volcano、Slurm、云原生AI平台(如Run:ai),负责分配具有亲和性的多节点资源,使流水线阶段间的映射拓扑尽量缩短物理链路。

下游

  • 大模型预训练:从数百亿到万亿稠密参数的LLM预训练是PP最直接的下游,亦是PP生态完善的最大驱动力。典型实例包括Llama 2 70B(Meta,2023)、Bloom 176B(BigScience,2022)、Megatron‑Turing NLG 530B(NVIDIA/Microsoft,2021)等。
  • 大规模模型微调与对齐:监督微调(SFT)及RLHF阶段通常仍需要PP承载全模型,由于批次较小,气泡影响更明显。业界普遍采用更小的PP规模或重参数化策略以保持微调效率。公开技术报告(如InstructGPT、Llama 2)显示其在RLHF训练中复用了预训练流水线设置。
  • 推理部署:流水线并行可天然用于模型分片推理,尤其适合大模型的低延迟/高吞吐服务。PiPPy(PyTorch)等项目支持将训练流水线导出为推理服务图;NVIDIA Triton推理服务器支持多GPU模型分片,其中流水线是重要模式之一。
  • 异构计算:PP允许不同阶段部署在异构设备上(如CPU、GPU、FPGA、ASIC),前段在GPU上做嵌入,后段在FPGA做低精度推理,实现成本与能效优化。虽然商用案例尚不普遍,但已被微软Brainwave项目等研究验证。

受益公司

  • NVIDIA:Megatron‑LM核心推动者,DGX SuperPOD、HGX平台预集成NVSwitch与InfiniBand,通过硬件+软件绑定为大模型客户提供端到端3D并行训练方案。FY2024数据中心业务营收约475亿美元(NVIDIA年报),大模型相关大规模集群是增长主要引擎之一。
  • Microsoft:深度开发DeepSpeed开源框架并将集成至Azure AI服务,降低客户训练门槛。Azure OpenAI服务所依赖的基础设施即为Azure大规模集群,采用DeepSpeed优化。Microsoft FY2024 Q2智能云收入约258亿美元(Microsoft财报),AI相关贡献持续增长但未单独披露份额。
  • Google:通过TPU+Pathways+Pax提供内部及云上流水线并行能力。Google Cloud的AI基础设施收入未单独拆分,但公开信息显示TPU v5p是其与NVIDIA GPU形成差异化竞争的关键产品。
  • Meta:虽不对外提供云服务,但基于开源项目(PyTorch、FairScale)大量使用和改进PP,用于训练Llama系列模型,其公开的技术报告、论文为产业提供重要参考。
  • 国内相关企业:华为(昇思MindSpore+CANN+昇腾硬件)内置流水线并行;百度(飞桨PaddlePaddle)同样支持PP,并面向算力中心输出方案。上述公司未公开流水线并行相关的独立财务口径。

市场规模

流水线并行本身属于分布式训练技术,不形成独立市场,其规模蕴含在AI训练硬件、AI云服务及大模型研发开支中。

  • 全球AI服务器市场2023年约360亿美元,预计2028年达870亿美元(Dell’Oro Group,2024年年中报告),其中大模型训练集群是增长主要因素。
  • AI加速器(GPU+NPD+TPU)市场2024年预计达620亿美元(Gartner,2024),NVIDIA占据主导份额(公开机构估计达80%+)。
  • HPC/AI网络互联市场2023年约120亿美元(650 Group,2024),IB+高速以太网因PP/TP跨节点需求受益显著。
  • 全球大模型训练算力支出2024年估计超350亿美元,按年增长超100%(公开分析报告估测)。流水线并行作为使能技术降低训练门槛并节省成本,对上述支出具有直接杠杆效应。具体因PP节省的算力成本占比未见权威测算。

玩家对比

公司/项目技术方案开源/商业核心优势典型合作/客户
NVIDIA Megatron‑LM1F1B+交错1F1B+TP+DP开源深度耦合自家硬件,文档丰富,性能巅峰LLM头部团队、云厂商
Microsoft DeepSpeed1F1B+ZeRO+自动混合并行开源易用性高,社区庞大,Azure原生集成Hugging Face、多数学术团队
Google GPipe/PaxTPU原生PP及自动化部分开源与TPU Pod深度优化,Pathways支持多任务谷歌内部及GCP客户
Meta PyTorch Pipelinetorch.distributed.pipelining开源PyTorch原生API,与生态系统无缝社区通用
国内主要方案(昇思/飞桨)1F1B/自动并行部分开源/商业针对国产硬件优化,满足合规需求国内云/央国企大模型训练

注:各方案具体MFU、气泡率等性能指标依赖硬件、模型及配置,未见公开标准化基准对比。

风险

  • 算法替代风险:若未来出现突破性技术使单卡显存可容纳完整超大规模模型(如基于闪存的参数卸载极大成熟或全新压缩方法),则对模型并行的依赖会降低,流水线并行的独特价值可能被削弱。但目前公开研究未见可在不损失效率的前提下完全替代PP的方案。
  • 自动并行挑战:随着自动并行编译技术(如Google GSPMD、PyTorch DTensor)的成熟,手工配置PP的方式可能被自动化调度部分取代,降低框架层PP差异化护城河。不过,自动并行仍需底层PP原语高效实现,不会令PP消失。
  • 网络演进不确定性:若跨节点网络带宽快速追近节点内带宽且成本急剧下降,张量并行跨节点使用的趋势上升,可能挤占PP份额。然而行业主流预测仍认为PP与TP结合是未来主流(NVIDIA、Meta公开演讲),尚无迹象表明短期单一并行维度可通吃。
  • 收敛风险:异步流水线虽可消除气泡,但权重滞后带来的收敛问题未见根本解决,可能限制其在特定应用中的推广。生产环境主流仍为同步版本。
  • 复杂性成本:PP的调优(K、M选择,与TP/DP结合)需要较多专业知识,增加人力成本与试错时间,是小团队门槛。

误读纠偏

误读1:“流水线并行就是模型并行” 模型并行是总称,包含张量并行与流水线并行两大类。前者切分层内算子,通信密集;后者切分层间并按微批次流水调度,通信稀疏。混淆两者将导致对通信量级与瓶颈的错误估计。

误读2:“流水线气泡无法避免,所以PP训练效率低” 在1F1B及交错调度下,气泡可被压缩至较低水平(量级5–15%),且PP的引入本质上是用可容忍的效率代价换取显存可容纳更大模型。若无PP,许多超大模型根本无法训练。此外,通过计算‑通信重叠、适当选择流水线深度,效率损失完全可控制在可接受范围。

误读3:“微批次越多越好,能完全掩盖气泡” 微批次数M受全局batch size约束(Global‑BS = micro‑BS × M × DP_SIZE),且micro‑BS受到单卡显存压制,无法无限增加。M 过大也会导致流水线启动与排空时间总量上升,以及GPipe模式下显存爆炸,必须在可用范围内平衡。

误读4:“PP对网络没有要求” 虽然PP带宽需求远低于张量并行,但极低带宽(如1–10 Gbps以太网)仍可能使通信成为瓶颈。实际部署中建议至少使用25 Gbps以太网或更高带宽,并确保网络拓扑有利于相邻阶段通信。

最新事件

  • 2025年1月:NVIDIA发布B200 GPU及新一代NVLink Switch,预计将进一步提高节点内TP效率,并为PP在更大规模多节点系统上的应用提供基础设施支持(NVIDIA官方博客与CES 2025演讲)。
  • 2024年底:PyTorch 2.5及后续版本持续完善torch.distributed.pipelining API,提供更简洁的PP配置接口和调度插件,降低用户从框架到落地的时间(PyTorch GitHub发布说明)。
  • 2024年:DeepSpeed团队公开讨论下一代混合并行编译器,拟将PP、TP、ZeRO在统一IR下自动搜索最佳策略,减少手工调参工作量(Microsoft Research博客,2024年)。
  • 2024年:Meta在介绍新一代AI基础设施的公开文章中,详细阐述万卡GPU集群上PP+TP+DP三维并行提升MFU超过55%的实践经验(Meta Engineering Blog,2024年)。
  • 相关论文方面,2024年有多篇关于端到端自动并行(含PP)的研究在MLSys、OSDI等会议发表,反映自动并行仍是热门方向。

跟踪指标

  • 框架发布与版本更新:Megatron‑LM、DeepSpeed、PyTorch关于流水线调度、自动配置、新通信后端的功能发布。
  • 大模型技术报告:各头部企业(Meta、Google、Microsoft、国内厂商)在发布新规格模型时披露的并行策略、PP阶段数、气泡率或MFU数据,可衡量PP实际应用成熟度。
  • 硬件与网络路线图:NVIDIA、AMD、Intel及网络设备商的下一代产品对跨节点P2P带宽和拓扑的改善,直接提升PP有效域。
  • 云服务商AI训练平台能力:如AWS SageMaker、Azure AI、阿里云PAI和华为ModelArts在流水线并行上的自动化支持程度、公开基准测试。
  • 行业效率基准:MLPerf Training等公开基准中大规模LLM测试的MFU、吞吐,以及各参赛者对PP使用情况说明(如有)。
  • 学术会议方向:NeurIPS、ICML、MLSys中关于流水线并行的新调度算法、自动搜索方法和收敛理论,可揭示技术演进热点。

信源

  • GPipe: Huang et al., “GPipe: Efficient Training of Giant Neural Networks using Pipeline Parallelism,” NeurIPS 2019.
  • Megatron‑LM: Shoeybi et al., “Megatron‑LM: Training Multi‑Billion Parameter Language Models Using Model Parallelism,” 2019.
  • Efficient Megatron‑LM: Narayanan et al., “Efficient Large‑Scale Language Model Training on GPU Clusters Using Megatron‑LM,” SC 2021.
  • DeepSpeed: Rasley et al., “DeepSpeed: System Optimizations Enable Training Deep Learning Models with Over 100 Billion Parameters,” KDD 2020.
  • PipeDream: Narayanan et al., “PipeDream: Fast and Efficient Pipeline Parallel DNN Training,” SOSP 2019.
  • Llama 2: Touvron et al., “Llama 2: Open Foundation and Fine‑Tuned Chat Models,” Meta, 2023.
  • NVIDIA Megatron‑LM文档与NeMo框架说明(docs.nvidia.com/deeplearning/nemo/)。
  • Microsoft DeepSpeed官方文档(deepspeed.ai)。
  • PyTorch torch.distributed.pipelining 文档(pytorch.org)。
  • Meta AI Infrastructure公开技术博客(Engineering at Meta,2024)。
  • Dell’Oro Group、Gartner、650 Group相关市场预测(2024年公开报告摘要)。
  • 各上市公司财报及公开发布会记录(NVIDIA、Microsoft等,FY2024‑2025)。
source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型