集群
3 秒看懂
集群(Cluster)是将大量独立计算节点通过高速网络互连、协同完成单一训练任务的大规模并行计算系统。当单卡显存放不下模型、训练时间不可接受时,必须把模型或数据拆分到成百上千个加速器上运行。集群本质上就是这种超大规模训练的物理基础——它把“算力池”与“通信架构”高度耦合,以支撑千亿乃至万亿参数模型的迭代。
3 分钟产业解释
一个面向大模型训练的集群,并非多台 GPU 服务器的简单堆叠。它需要同时解决三个核心矛盾:算力密度、互连带宽与分布式协同。
- 算力密度:单节点通常集成 8 张或更多 AI 加速器,通过高带宽域内互连(如 NVLink、专用总线)形成“超级 GPU”;再以高速网络(InfiniBand、RoCE 等)把数千个节点联成整体。
- 互连带宽:模型切分后,节点间需要频繁交换梯度、参数和中间激活。南北向网络决定系统规模上限,东西向网络(机柜内 NVSwitch、机柜间交换机)直接制约训练效率。带宽不足时大量计算单元空等通信,成为系统短板。
- 分布式协同:涵盖数据并行、张量并行、流水线并行、序列并行及混合策略。集群不仅提供带宽,还需优化通信拓扑(胖树、Dragonfly 等)与集合通信算法(AllReduce、AllGather、ReduceScatter、All-to-All),并依靠调度系统高效分配每一份资源。
产业现实是:万卡乃至十万卡集群已经是大模型头部玩家的“入场门票”。机柜功耗普遍向 40 kW、100 kW 以上演进,液冷、高密度电源和光纤布线同步升级,整个集群正演进为一套高度整合的极限工程系统。
技术原理
1. 通信原语与并行策略的映射
在大规模训练中,核心通信操作由集合通信库(如 NCCL、RCCL)完成。以典型的 3D 混合并行(数据并行 + 流水线并行 + 张量并行)训练千亿参数 Transformer 为例:
- 数据并行:同一份模型参数复制到多个 GPU,分别消费不同的微批次数据。前向/反向独立计算后,所有副本需要聚合梯度,执行 AllReduce。典型算法为 Ring 或 Tree,梯度张量被划分为小块流水线式传递,通信量与参数量成正比。
- 张量并行:将单层权重矩阵切分到多个 GPU。例如 Megatron 的列并行线性层在前向中需要 AllReduce 求和,而行并行线性层需要 ReduceScatter 将输入分发。这类通信频率高、每层发生,延迟要求极为苛刻,通常被约束在节点内的高带宽域(如 NVLink 域)。
- 流水线并行:以层为单位分配到不同 GPU,仅需在阶段边界交换激活和梯度,使用点对点 Send/Recv。通信量相对较小,但必须精细调度微批次以压缩流水线气泡。
- MoE 架构:门控网络将 Token 路由到不同专家,引发 All-to-All 通信——每个 Token 可能去往任意设备,通信模式非规则且突发性强,对集合通信库和高基交换机提出额外要求。
一个简化的 3D 混合并行拓扑逻辑视图(GPU 网格):
流水线阶段0 ── 流水线阶段1 ── ...
| 张量并行组0 | 张量并行组1
| [GPU0,GPU1] | [GPU2,GPU3]
| 数据并行副本组0 | 数据并行副本组0
| 与下方副本组1通过AllReduce同步梯度
流水线阶段0副本1 ── 流水线阶段1副本1 ...
| [GPU4,GPU5] | [GPU6,GPU7]
数据并行梯度同步时,所有持有相同模型参数的副本(如 GPU0 与 GPU4)必须跨节点执行 AllReduce。此时,集群网络需要支撑全互联的对等带宽。
2. 拓扑结构与性能公式
超大规模集群普遍采用胖树(Fat-Tree)无阻塞网络。假设单端口速率为 400 Gbps,理想情况下任意两节点间的全局带宽可达该速率。但 AllReduce 的有效带宽受算法环长等因素影响:对于 N 个节点的 Ring AllReduce,每个 GPU 发送/接收约 2(N‑1)/N 倍的数据量,总传输量接近 2× 数据量。实际中,厂商通过 NVSwitch 分级聚合或交换机内计算(如 Nvidia SHARP)可以大幅减少中间数据移动,使大集群 AllReduce 延迟接近理论下限。
训练吞吐量(Token/s)可粗略表达为:
Throughput = (Batch_size × Seq_len × MFU × Peak_FLOPS) / (FLOPs_per_token)
其中 MFU(模型算力利用率)是度量集群并行效率的核心指标。受通信开销、重计算策略、访存效率等因素影响,千卡级 GPT‑3 类模型的 MFU 通常落在 30%–50%(依据公开文献估算);万卡以上集群若不从拓扑、算法和调度层精细优化,MFU 可能大幅下滑,因此维持高效率是工程核心挑战。
3. 存储与数据供给
海量训练数据依赖高吞吐分布式文件系统或对象存储供给,以避免 GPU 空等。计算节点本地通常部署 NVMe SSD 缓存热数据,后台从中心存储异步预取下一批数据。检查点写入是另一大压力源:千亿参数模型每数百步保存一次检查点即可产生 TB 级突发写入。为此,系统普遍采用异步/增量检查点策略,并将检查点存储与训练网络物理隔离。
4. 软件与调度栈
- 资源调度:通用容器调度器难以处理训练作业的“all‑or‑nothing”特性(需一次性分配全部 GPU),故主流集群使用 Slurm、Volcano 或厂商定制调度器,支持成组分配、亲和性约束和拓扑感知放置。
- 故障恢复:训练任务常持续数周乃至数月,硬件故障、网络闪断、静默数据损坏(如 ECC 错误)几乎不可避免。集群需具备故障自动检测、节点隔离、从最新检查点自动重启的能力,重启开销须控制在分钟级。
- 训练框架:PyTorch、JAX、Megatron‑LM、DeepSpeed 等实现各类并行策略,并通过 NCCL/RCCL 等通信库驱动底层网络。
关键参数
评估一个训练集群的能力,通常关注以下维度(均为公开口径或工程常用指标,具体数值因厂商而异):
- 集群理论总算力:常以 BF16/FP16 稀疏或密集算力表示,单位 EFLOPS(百亿亿次浮点运算每秒)或 PFLOPS。头部训练集群可达数万 PFLOPS 甚至数十 EFLOPS(具体数值未充分披露,仅为行业定性参照)。
- 加速器总数与节点数:例如“万卡集群”指约 10,000 片量级的加速器,按单节点 8 卡计算约 1,250 节点。
- 对分带宽与总网络容量:衡量东西向吞吐,单位 Tbps 或 Pbps。通常要求无阻塞设计,对分带宽与上下行链路总数匹配。
- 单节点单向带宽与有效 AllReduce 带宽:前者指单网卡速率(如 400 Gbps);后者通过
allreduce_perf等工具实测,单位为 GB/s,直接反映通信效率。 - 训练有效吞吐量(Token/s 或 Samples/s)及 MFU:是业务侧最关心的合成指标,综合反映了节点算力、网络和软件协同水平。
- 故障恢复时间:从故障检测到从检查点重启并恢复训练的时间,目标多在 5 分钟以内。
- 能效比:常用 FLOPs/Watt 或 Token/Joule 衡量,受加速器本身功耗、网络部件和散热方案共同影响。
来源:公开技术论文、英伟达 NCCL 文档、MLPerf Training 结果等。具体厂商集群参数多数未完全公开,以上为衡量框架。
技术路线
当前构建大规模训练集群存在三条主流路线,各自在延迟、带宽、扩展性和生态上形成不同权衡。下表为定性对比,因各代际产品参数未完全公开,仅指示技术方向。
| 维度 | InfiniBand 集群 | RoCEv2 以太网集群 | 封闭域超节点(如 NVLink 域) |
|---|---|---|---|
| 通信延迟 | 微秒级,极限低 | 略高,但通过拥塞控制与 ECN 优化后可接近 | 纳秒至亚微秒级(机柜内) |
| 带宽特性 | 400/800 Gbps 逐代迭代,链路层确定性高 | 100/200/400 Gbps 广泛部署,800 Gbps 兴起,依赖 DCQCN 等协议 | 单链路带宽极高(如 900 GB/s 级),逐代翻倍 |
| 扩展能力 | 成熟支撑数万节点,HPC 生态深厚 | 可扩展至万卡以上,云原生友好 | 单域节点有限(如 72/144),需结合上层网络向外扩展 |
| 成本与生态 | 专用交换硬件,单价较高;配套管理工具专用 | 利用通用以太网交换芯片,单位带宽成本较低,运维工具链丰富 | 供应商锁定强,系统集成度高,整机柜交付 |
| 代表方案 | Nvidia Quantum 交换机系列 | 博通/Tomahawk 交换芯片方案,Arista/思科交换机 | Nvidia GB200 NVL72 机柜级系统 |
除了上述路线,AMD 基于 Infinity Fabric 和以太网的 Instinct 集群方案,以及 Google TPU 虚拟机(借助光电路交换机)的 Pod 架构也构成重要流派,其在软件栈和通信策略上各有专攻。
上游
训练集群上游涵盖算力、网络和基础设施三大领域的关键组件:
- AI 加速器:GPU(Nvidia H100/B200 等)、TPU、自定义 ASIC(如 Amazon Trainium、微软 Maia),是集群绝对核心。
- 高速交换芯片:InfiniBand 交换机芯片由 Nvidia(Mellanox)垄断;以太网侧博通 Tomahawk/Jericho 系列、思科 Silicon One 等占主导。
- 光模块 / DAC / AOC:连接 GPU 节点与交换机,速率从 400G 向 800G、1.6T 演进,是集群总成本的重要组成。
- 高速背板与连接器:机柜内 NVLink 铜缆、高密度连接器、PCB 背板等。
- 散热组件:高功耗机柜(40 kW+)迫使冷板式液冷成为标配,带动冷液分配单元(CDU)、水泵、快接头、冷却塔等需求。
- 电源模块:冗余大功率 PSU、机架电源和能源管理单元。
以上仅描述产业链角色,不构成对具体公司经营情况的判断。
下游
集群的下游需求方直接驱动了集群的设计与建设:
- 头部 AI 实验室:OpenAI、Anthropic、xAI、Google DeepMind 等,率先部署数万至十万卡集群,用于前沿模型训练。
- 云服务提供商:AWS、Microsoft Azure、Google Cloud、Oracle Cloud 等,既自建集群用于内部研发,也通过算力租赁对外服务。
- 大型互联网与科技公司:Meta、字节跳动、百度、阿里、腾讯等,自建集群支撑自身大模型与推荐系统训练。
- 国家超算中心与科研机构:用于科学计算与 AI 融合工作负载,采购或联合搭建大型算力平台。
- 算力租赁与算力调度平台:利用采购的集群向中小企业提供训练服务,成为连接上游产能与下游需求的新形态。
受益公司
以下围绕集群建设与运营,按产业链环节梳理公开信息中经常被提及的代表性厂商(仅陈述产业角色,不涉及价值判断):
- 算力芯片:Nvidia(Hopper/Blackwell 系列)、AMD(Instinct 系列)、Intel(Gaudi 系列)等;Google TPU、Amazon Trainium 等自研加速器亦属重要供给。
- 网络芯片与设备:Nvidia(Mellanox InfiniBand 及 Spectrum 以太网交换机)、博通(交换芯片与定制加速器 SerDes)、Marvell(定制 ASIC 与高速 SerDes)、Arista、思科、华为等提供交换机与网络方案。
- 光模块 / 连接器:中际旭创、Coherent、Finisar(II‑VI)、新易盛等参与 400G/800G 光模块供应;安费诺、泰科、Molex 等提供高速背板连接器与铜缆组件。
- 服务器与机柜:超微(Supermicro)、纬创、广达、浪潮、新华三、联想等提供 GPU 服务器与整机柜设计制造。
- 液冷与基础设施:Vertiv、CoolIT、Cooltera、英维克、高澜股份等提供冷板、CDU 及整体液冷解决方案。
- 云与算力平台:三大超大规模云厂商(AWS、Azure、Google Cloud)以及 CoreWeave、Lambda Labs 等新型算力提供商。
市场规模
目前暂无权威第三方发布以“训练集群”为单一口径的市场规模。业界通常从组件市场和云资本支出侧面观察。
- GPU 收入视角:Nvidia 数据中心业务在 2025 财年第三季度(截至 2024 年 10 月 27 日)收入 308 亿美元,同比增长 112%(来源:Nvidia FY2025 Q3 财报)。该收入主要由 AI 训练和推理集群驱动,是观察集群投资热度的核心先行指标。
- 超大规模云厂商资本开支:2024 年第三季度,微软、亚马逊、Alphabet(Google)资本支出合计约 556 亿美元(来源:各公司季报;口径:含融资租赁资本化处理),绝大多数投向云基础设施与 AI 集群建设。
- 光模块市场:LightCounting 在 2024 年 4 月预测,2024 年高速以太网光模块(100G 及以上)市场规模将超过 50 亿美元,800G 模块开始放量,主要驱动力正是 AI 集群网络升级。
- 服务器端:据 TrendForce 集邦咨询 2024 年 12 月数据,2024 年全球 AI 服务器出货量逾 160 万台,同比增长超过 40%(口径:搭载 GPU、FPGA 或 ASIC 且面向 AI 训练/推理的服务器)。
- 集群采购案例:一台配置 8 张 H100 GPU 的典型训练服务器厂商公开报价约 25 万‑35 万美元(来源:超微、戴尔等渠道公开信息;价格随配置波动)。一个万卡集群仅硬件采购成本即可达数亿至约十亿美元量级(具体数额视集群设计与采购规模而定,公开资料未披露统一数字)。
以上数据均为公开间接指标,用于佐证集群建设投入规模,不构成具体财务预测。
玩家对比
以下从方案层面,对几种典型的训练集群构建方式进行比较,数据基于公开技术文档与行业报告,不明之处标注“未公开”。
| 维度 | Nvidia DGX SuperPOD(IB) | 云厂商自研RoCE集群 | Google TPU v5p Pod | AMD Instinct 集群 |
|---|---|---|---|---|
| 加速器 | H100/B200 等,Nvidia GPU | Nvidia GPU 或自研 ASIC(如 Trainium) | TPU v5p,自研 | MI300X 等 Instinct GPU |
| 主要网络 | InfiniBand NDR/NDR400 | RoCEv2 over 以太网(400G/800G) | 光电路交换机(OCS)与专属高速链路 | 以太网及 Infinity Fabric 集成 |
| 最大公开规模 | 数十个 SuperPOD 级联,可达 16,000+ GPU(如 Meta 在 2024 年公开的 H100 集群) | 单集群 10,000 GPU 以上(AWS UltraCluster、Azure 等,具体规模未全公开) | TPU v5p Pod 最多 8,960 芯片(来源:Google 2023 年博客) | 未公开大规模单一训练集群上限;多节点部署已在百亿亿次项目中使用 |
| 软件生态 | CUDA、NCCL、Megatron‑LM 等,生态最成熟 | 依赖供应商自研库与 PyTorch,调度系统自研 | JAX、TensorFlow,配套 Pathways 支持模型并行 | ROCm、RCCL、PyTorch,生态快速完善中 |
| 典型用户 | 头部 AI 实验室、大型企业 | 云厂商自身及通过云服务外售 | Google 内部及 Google Cloud 客户 | 超算中心(如 Frontier)、部分企业 AI 团队 |
注:RoCE 集群与 InfiniBand 集群的上限数字受披露程度影响,公开资料未见清晰行业标准,仅依据各公司博客与论文。
风险
- 供应集中度风险:无论是 GPU 还是 InfiniBand 交换芯片,全球供应高度集中。产能瓶颈(如 CoWoS 封装、HBM 内存)可显著延长集群交付周期,抬高成本。
- 地缘政策与出口管制:高端加速器与网络设备受到多国出口管制,可能限制部分区域获取最新代次硬件,并催生分散的替代方案,但替代方案的软件生态成熟度差距明显。
- 技术路线切换风险:全光互联、板级光学、硅光子等未来技术可能颠覆现有集群网络架构;超节点(NVLink 域)的扩大亦可能削弱 InfiniBand/RoCE 在东西向通信中的份额,影响供应链格局。
- 功耗与散热瓶颈:机柜功率密度持续上升,部分新建集群单机柜已超过 100 kW。对电网容量和液冷基础设施的要求远超传统数据中心,选址和电力获取成为约束。
- 投资回报不确定性:一个十万卡集群总拥有成本可达数十亿美元(公开资料未见精算值),但模型商业回报尚未稳固,若应用端变现不及预期,资本开支压力将显著增大。
- 软件与故障容错难度:规模每扩大一个数量级,故障比例和网络拥塞管理的复杂度呈非线性增长。维持高 MFU 和长时稳定训练需要持续投入软件优化,人才稀缺。
误读纠偏
- 误读一:“千卡集群互联后就是单个超级计算机”
纠偏:尽管通信带宽很高,但跨机 GPU 之间的延迟远高于本地内存访问。不同并行策略下的数据放置、通信与计算重叠需谨慎设计,不能将其等同于一个统一内存的大单体。 - 误读二:“集群的峰值算力直接等于训练速度”
纠偏:峰值算力不反映实际吞吐。MFU 常落在 30%–60%,通信、访存和重计算都会侵蚀有效性能。单纯堆砌加速器而不升级网络和软件,会造成严重的算力浪费。 - 误读三:“All‑to‑All 通信主要出现在张量并行”
纠偏:张量并行主要采用 AllReduce/ReduceScatter,而 All‑to‑All 是 MoE 架构中专家路由的典型模式。两者对网络的压力和优化方式截然不同,需要区分应对。 - 误读四:“只要卡够多,模型就能一直变大”
纠偏:模型规模的扩展受限于最大训练时间窗口、故障率、内存容量和算法本身的收敛行为。集群规模扩大需同步提升存储、检查点和全局批大小调度等外围能力,单纯增加 GPU 数量并不会自动兑换为更大的模型。
最新事件
- xAI Colossus 集群:2024 年夏,xAI 在美国孟菲斯搭建 Colossus 超级集群,初始部署约 10 万张 H100 GPU,并在 2024 年 12 月宣布将规模翻倍至约 20 万张 GPU,网络采用 Nvidia Spectrum‑X 以太网平台(来源:xAI 官方博客、Nvidia 新闻稿)。
- Meta 公开 24k GPU 集群:2024 年 3 月,Meta 披露两个包含 24,576 张 H100 的集群,分别采用 InfiniBand 和 RoCEv2 网络,用于 Llama 3 等模型训练(来源:Meta AI 博文 “Building Meta’s GenAI Infrastructure”)。
- 英伟达 Blackwell 与超节点:2024 年 GTC 上,英伟达发布 Blackwell 架构及 GB200 NVL72 机柜级系统,将 NVLink 域扩展至 72 张 GPU,单机柜总算力宣称高达 1.44 EFLOPS(FP4),原计划 2025 年量产(来源:Nvidia 2024 GTC 主题演讲)。
- 微软与 OpenAI “星门” 计划:2024 年 3 月,The Information 报道微软与 OpenAI 规划分阶段建设大型 AI 集群,涉及最高投资可达 1000 亿美元,内部代号 Stargate,预计 2028 年前部署(来源:The Information,2024 年 3 月 29 日)。该计划的后续进展及官方确认状态尚待观察。
- Amazon Trainium2 集群:2024 年 re:Invent 大会上,亚马逊宣布 Trainium2 实例可用,并规划由超过 10 万片 Trainium2 构成的 UltraCluster,用于下一代模型(来源:AWS re:Invent 2024 公告)。
- 国内万卡集群建设:2024 年内,百度、字节跳动、阿里等先后宣布建成或扩容万卡级别的自研集群,用于旗下大模型的迭代训练。具体节点数量与配置细节多数未完整披露(来源:各公司公开技术文章与行业会议演讲)。
跟踪指标
投资者和从业者可通过以下公开指标跟踪训练集群景气度与产业链变化:
- 英伟达数据中心收入:每季财报中的 Data Center