训练集群
1. 3 秒看懂(≤25 字)
训练集群把 1 万-10 万张 GPU 变成 1 台可训练模型的机器。12
2. 3 分钟产业解释(120-180 字)
训练集群是把 GPU、HBM、NVLink/PCIe、InfiniBand/Ethernet、分布式文件系统、调度器和 PyTorch/Megatron/DeepSpeed 组合成可连续运行数周到数月的 AI 工厂,核心指标从“买了多少卡”转向 MFU、step time、有效带宽、故障恢复时间和 checkpoint 开销。12 Meta 2024 年披露两套 24,576 张 H100 集群,分别采用 RoCE 与 NVIDIA Quantum-2 InfiniBand,且 Llama 3.1 405B 用约 16,000 张 H100、15T+ tokens、约 30.84M GPU-hours 完成训练,说明万卡集群已从实验室进入头部厂商生产口径。23 2025-2027 年的产业分歧是:FSDP/3D 并行能否把十万卡的掉卡、尾时延和存储瓶颈压到可运营范围内;若 MFU 每提升 5pct,同等 GPU capex 的有效训练吞吐就等价提升约 10%-15%。45
3. 15 分钟专家深入(400-600 字)
训练集群的经济性由 3 层乘法决定:第一层是硬件规模,GPU 数 × 单 GPU FLOPS × HBM 容量/带宽决定理论训练吞吐;第二层是并行策略,FSDP/ZeRO、tensor parallel、pipeline parallel、sequence/context parallel 把模型参数、激活、梯度和优化器状态切到不同通信域;第三层是运营效率,MFU、GPU 可用率、checkpoint 间隔、故障重启时间和数据加载吞吐决定理论 FLOPS 变成多少有效 token。346 可算公式为 有效训练 FLOPS = GPU 数 × 单 GPU 峰值 FLOPS × MFU × 可用率;在 16,000 张 H100、MFU 40%、可用率 90% 的口径下,若单卡 BF16 峰值按 1,979 TFLOPS,则有效训练吞吐约为 16,000 × 1,979 × 40% × 90% = 11.4 EFLOPS,单卡峰值和 MFU 都需要按具体精度与模型 kernel 校准。37
FSDP 的价值在内存侧。PyTorch FSDP/FSDP2 把参数、梯度和优化器状态按 data-parallel rank 分片,forward/backward 前 all-gather,backward 后 reduce-scatter,因此同样 HBM 下可训练更大模型或更长 sequence,但代价是通信更频繁。4 3D 并行的价值在通信域侧:tensor parallel 把层内矩阵计算切到 NVLink/NVSwitch 近端域,pipeline parallel 把层序列切到 stage 并用 micro-batch 填充流水线,data/FSDP parallel 把样本和状态切到跨节点域;DeepSpeed 把 ZeRO-powered data parallel、pipeline parallel 与 tensor-slicing model parallel 定义为 trillion-parameter 训练的 3D parallelism。56
万卡到十万卡的瓶颈不是单点算力,而是尾部概率。假设单 GPU 月故障概率为 2%,10,000 张 GPU 的月度故障事件期望值约 200 次,100,000 张则约 2,000 次;因此训练平台必须把 checkpoint、热备、作业弹性、故障隔离和自动诊断做成默认能力,而不是运维补丁。28 产业链映射上,NVIDIA 受益于 GPU+NVLink+InfiniBand/Spectrum-X+CUDA/NCCL 的闭环,Arista/Broadcom/Cisco 受益于 Ethernet 化,CoreWeave/Oracle/Microsoft 受益于可租用训练容量,Vertiv/电力链受益于机柜功率从 30kW 走向 100kW+。1910
4. 技术原理(200-300 字)
训练集群把模型训练拆成 4 类通信:data parallel 的梯度同步、FSDP/ZeRO 的参数 all-gather 与梯度 reduce-scatter、tensor parallel 的层内 all-reduce/all-gather、pipeline parallel 的 stage 间激活传输。45 NVLink/NVSwitch 负责单节点或单机柜低时延高带宽域,InfiniBand/RoCE/Spectrum-X 负责跨机柜 scale-out 域,存储网络负责样本读取、日志与 checkpoint;任一域的 P99/P999 尾时延上升都会把同步训练的 step time 拉长。12 对 LLM 训练而言,MFU 是比 GPU 利用率更硬的指标,因为 MFU 把模型有效 FLOPs 与硬件峰值 FLOPs 相除,能识别“GPU 忙但在等网络/内存/数据”的虚假繁忙。3 2025 年以后,sequence parallel、context parallel 和 MoE expert parallel 把通信从纯 all-reduce 扩展到 all-to-all,训练集群的反证指标也从平均吞吐转向 straggler 占比、重算比例和 checkpoint 恢复时间。611
5. 上游依赖 / 下游影响
上游依赖
- GPU/HBM:H100/H200/B200/GB200 的 HBM 容量和带宽决定 batch size、sequence length 与 activation checkpoint 比例;GB200 NVL72 单 rack 公开口径为 72 张 Blackwell GPU、13.4TB HBM3e 与 576TB/s HBM 带宽。112
- Scale-up 互连:GB200 NVL72 公开口径为 130TB/s NVLink 带宽,单机柜 72 GPU 域扩大后可把 tensor parallel 与部分 reduction 留在近端域内。1213
- Scale-out 网络:Meta 24,576 H100 RoCE/InfiniBand 双集群说明 RoCE 与 IB 均可生产化,但 10,000+ GPU 的训练稳定性仍由拥塞控制、链路故障和 NCCL 拓扑共同决定。214
- 存储与 checkpoint:Meta 披露训练基础设施需要前端网络处理 data ingestion、checkpointing 和 logging;若 checkpoint 写入吞吐低于训练产出速率,GPU 等待会直接抬高每 token 成本。14
- 电力与散热:DGX GB200 SuperPOD 参考架构披露每个 power shelf 有 6 个 5.5kW PSU、可输出 33kW,机柜级液冷和配电能力成为十万卡集群的交付前置项。15
下游影响
- Frontier model 训练:Llama 3.1 405B 的 16,000 H100、15T+ tokens 与 30.84M GPU-hours 口径说明 400B+ 参数模型已要求万卡级长周期集群。3
- 云租赁:CoreWeave 2025 年收入 51 亿美元、backlog 668 亿美元,说明外部 AI cloud 已从补位容量变成训练集群采购的一条独立链路。16
- 超级云 CAPEX:Microsoft 2025 年 Microsoft Cloud 毛利率降至 69%,公司明确称 AI 基础设施扩张压低云毛利率;训练集群效率每提升 5pct 都会反向缓解折旧与电力压力。17
- 网络与光模块:800G/1.6T 后端网络需求随 GPU 规模上升,NVIDIA Q4 FY2026 networking revenue 109.8 亿美元、同比 +263%,显示训练/推理集群网络已成为独立收入曲线。18
6. 技术路线对比表
| 路线 | 速率 / 计算域 | 功耗 | 距离或维度 | 标准成熟度 | 量产概率 2026 | 反证指标 |
|---|---|---|---|---|---|---|
| FSDP / ZeRO-3 | data-parallel rank 维度;参数/梯度/优化器状态全分片 | 通信额上升,显存下降;绝对 W 取决于 GPU | 跨节点到跨机柜 | PyTorch FSDP/FSDP2 与 DeepSpeed ZeRO 成熟。45 | 90% | all-gather/reduce-scatter 占 step time 连续高于 25%,MFU 低于 35%。 |
| Tensor parallel | 层内矩阵按 2/4/8/16-way 切分 | 依赖 NVLink/NVSwitch,跨节点代价陡升 | 节点内或 NVL72 域 | Megatron Core 成熟,NVLink 域越大越有效。612 | 85% | TP all-reduce 跨出低时延域后 step time 上升超过 15%。 |
| Pipeline parallel | 8-64 stage 常见;micro-batch 填流水线 | 气泡率随 micro-batch 与 stage 增减 | 层维度 / stage 维度 | DeepSpeed/Megatron 成熟。56 | 80% | pipeline bubble 高于 10%-15%,或负载不均导致 straggler 扩散。 |
| 3D 并行 | DP/FSDP × TP × PP,叠加 sequence/context parallel | 通信域最复杂,调参成本最高 | 万卡-十万卡 | trillion-parameter 训练主流工程范式。56 | 80% | 同等 batch 下 MFU 低于 40%,故障恢复后需人工重排 rank。 |
| MoE expert parallel | expert all-to-all;路由维度切分 | 网络突发高,负载不均敏感 | 跨节点 / 跨机柜 | 快速成熟,公开标准少于 DP/TP/PP | 65% | expert imbalance 超过 20%,all-to-all 成为第一瓶颈。 |
| Blackwell NVL72 rack-scale | 72 GPU 单 rack,130TB/s NVLink,13.4TB HBM3e | 单 rack 100kW+ 情景需按配置核实 | 机柜级 scale-up | NVIDIA 产品化,云厂商导入中。1213 | 85% | NVL72 大规模训练可用率低于 H100/H200 集群,或液冷交付延期超过 2 季度。 |
7. 关键指标(5-7 项 + 怎么追)
- MFU:Meta Llama 3 相关公开口径约 400 TFLOPS/GPU 与 38%-43% BF16 MFU,逐次跟踪模型论文、工程博客和 MLPerf Training;低于 35% 说明网络、kernel 或数据链路吃掉扩容收益。3
- GPU 可用率:按
可训练 GPU 小时 ÷ 已安装 GPU 小时追踪,10,000 卡集群若月故障事件超过 200 次且自动恢复不充分,checkpoint 与重启会吞掉 3%-8% 有效算力。28 - Step time / tokens per second:按模型、sequence、global batch 固定后跟踪,若 GPU 数翻倍但 tokens/s 增幅低于 1.6 倍,说明并行或网络扩展效率低于 80%。36
- 网络有效带宽:按 NCCL all-reduce、reduce-scatter、all-to-all benchmark 与训练 step 拆分追踪;Spectrum-X 对 AI 网络性能的公开宣称为传统 Ethernet 的 1.6 倍、有效带宽最高 95%,需要用真实作业校验。9
- Checkpoint 时间:按
checkpoint 写入秒数 ÷ 训练间隔秒数追踪;若占比超过 5%-10%,训练平台应增加异步 checkpoint、分层存储或更长容错窗口。14 - CAPEX / 有效 PFLOPS:按
GPU 采购 + 网络 + 机电 + 折旧 ÷ 有效训练 PFLOPS追踪;Microsoft 2025 年云毛利率 69% 已显示 AI 基建折旧对云毛利有可见压力。17 - 收入兑现:跟踪 NVIDIA data center/networking、AMD data center、Arista cloud titans、Broadcom AI semiconductor、CoreWeave revenue/backlog;若订单增速领先收入 2 个季度以上,供应约束仍强。1618192021
8. 可算传导表
口径:2025A/2026E 单位为亿美元,除特别说明;训练集群是 GPU、网络、云租赁与机电的组合市场,公开公司通常不披露“训练集群收入”,因此本表用可核实财务口径作上限或代理,关键份额未披露处不伪造实数。1618192021
| 驱动变量 | NVIDIA 平台 | Arista AI Ethernet | CoreWeave AI Cloud | 来源/公式 |
|---|---|---|---|---|
| TAM | 2025E AI networking nearly 200 亿美元;AI GPU/cluster TAM 待补 A/B | 同左网络子环节 | AI cloud TAM 待补 A/B | 650 Group 网络口径,非完整训练集群 TAM。22 |
| 出货 / 容量基数 | FY2026 Data Center 1,937.37;Q4 networking 109.8 | 2025 revenue 90.0,云客户与 AI 网络占比未披露 | 2025 revenue 51.3;backlog 668 | 182016 |
| ASP | GPU/NVL72/网络组合 ASP 未披露 | 交换机 ASP 未披露 | GPU-hour ASP 未披露 | 公司未披露,不用 C 级估算。 |
| 份额 | 高端训练 GPU 份额高但精确份额待补 A/B | 数据中心交换领先但 AI 后端份额待补 A/B | AI cloud 份额待补 A/B | 182016 |
| → 收入 | Data Center revenue = compute + networking + software/support,FY2026 为 1,937.37 | 训练网络收入 ≤ 总收入 × cloud titan mix,2025 上限为 90.0 | 训练租赁收入 ≤ 总收入,2025 上限为 51.3 | 182016 |
| 毛利率 | FY2026 GAAP GM 71.1% | 2025 GAAP GM 约 63% | 2025 gross margin 待 10-K 表核;adjusted EBITDA margin 57% | 182016 |
| → 毛利 | 1,937.37 × 71.1% = 1,377.27 总公司代理 | 90.0 × 63% = 56.7 总公司代理 | 毛利待披露;51.3 × 57% = 29.2 调整 EBITDA 代理 | 推算 |
| PE / 估值口径 | 2026-05-27 16:00 EDT,美股,market cap = shares × close;PE TTM 用行情站,C 级 | 同左 | 同左 | 23 |
| → 估值 | 训练集群净利润 × PE;训练集群净利率未披露 | AI网络净利润 × PE;业务净利率未披露 | AI云净利润 × PE;净利仍受折旧/利息压制 | 推算 |
3 家公司情景传导
| 变量 | NVIDIA | AMD | Broadcom | 公式 / 证据 |
|---|---|---|---|---|
| 相关收入基数 | FY2026 Data Center 1,937.37 | 2025 Data Center revenue 182.4 | FY2025 AI semiconductor Q1 FY2026 指引 82 年化=328 | 181921 |
| 训练集群占比 | 情景 65% | 情景 55% | 情景 50% | 非公司披露,按产品暴露度情景。 |
| → 训练集群收入 | 1,937.37 × 65% = 1,259.29 | 182.4 × 55% = 100.32 | 328 × 50% = 164.00 | 推算 |
| 毛利率 / 利润率 | GAAP GM 71.1% | 2025 GM 待 10-K;Data Center OP margin 待细表 | FY2025 GAAP GM 约 68% | 181921 |
| → 毛利贡献 | 1,259.29 × 71.1% = 895.36 | 待披露,不用全公司 GM 强代 | 164.00 × 68% = 111.52 | 推算 |
| 反证指标 | networking revenue QoQ 低于 10% 或 GB200/GB300 交付延后 2 季度 | MI350/MI450 集群软件成熟度低于客户预期 | AI Ethernet switch/XPU 客户少于 4 家且订单低于指引 | 181921 |
9. 同业硬指标对比表
口径:美股估值必须用 2026-05-27 16:00 EDT 完整收盘,market cap = shares × close,PE TTM 采用公开行情站 C 级;财务数据优先用 2025A/FY2026A 年报或公司公告 A/B 级。161819202123
| 公司 | 收入 | 增速 | GM | 净利 | FCF margin | 客户集中度 | 技术代际 | PE TTM | 反证条件 |
|---|---|---|---|---|---|---|---|---|---|
| NVIDIA | FY2026 revenue 2,159.38;Data Center 1,937.37 | FY2026 +65%;Q4 Data Center +75% YoY | FY2026 GAAP 71.1% | FY2026 net income 1,200.67 | FCF 待 10-K 现金流细表核算 | direct customers 10%+ 风险存在 | H100/H200/GB200/GB300、NVLink、IB、Spectrum-X | 2026-05-27 C 级待行情页复核 | GB200/GB300 大集群可用率不及 H100/H200 |
| AMD | 2025 revenue 待完整表;Data Center revenue 182.4 | Data Center 高增长 | GM 待 10-K 表核 | 净利待 10-K 表核 | FCF 待 10-K 表核 | hyperscaler AI 客户集中 | MI300/MI350/MI450、ROCm | 2026-05-27 C 级待行情页复核 | ROCm/Megatron/FSDP 生态导致 MFU 长期落后 NVIDIA 10pct+ |
| Arista | 2025 revenue 90.0 | 2025 +约 29% | GAAP GM 约 63% | 净利待年报表核 | FCF margin 待年报表核 | Microsoft/Meta 为大客户,2025 云客户占比提升 | 400G/800G AI Ethernet、EOS | 2026-05-27 C 级待行情页复核 | Cloud titan capex 放缓或 Spectrum-X 侵蚀 Ethernet 份额 |
| Broadcom | FY2025 revenue 待 10-K;Q1 FY2026 AI semiconductor 指引 82 | AI semiconductor Q1 FY2026 指引同比翻倍 | FY2025 GAAP GM 约 68% | 净利待 10-K 表核 | FY2025 FCF 269 | AI XPU/网络客户高度集中 | XPU、Tomahawk/Jericho、Ethernet AI switch | 2026-05-27 C 级待行情页复核 | 第 4/第 5 个 AI 客户订单未兑现 |
| CoreWeave | 2025 revenue 51.3;backlog 668 | 2025 +168% | GM 待年报表核 | 净亏损,折旧/利息压制 | FCF 受 capex 压制 | Microsoft/OpenAI 等客户集中 | NVIDIA 云、Mission Control、GPU telemetry | 2026-05-27 C 级待行情页复核 | GPU 租赁价格下行快于折旧摊销 |
| Microsoft | FY2025 revenue 2,817.24;Microsoft Cloud GM 69% | FY2025 revenue +15% | Cloud GM 69% | net income 1,018.32 | FCF margin 待年报表核 | OpenAI/企业云需求多元 | Azure H100/GB200/GB300、ND H100 v5 | 2026-05-27 C 级待行情页复核 | AI capex 抬升但 Azure AI 收入转化低于折旧增长 |
| Meta | 2025 revenue 2,009.7 | 2025 +22% | 广告高 GM,AI capex 压制 FCF | net income 604.6 | capex 722.2 压制 FCF | 自用训练需求,无外售收入 | 24,576 H100 RoCE/IB、Llama 训练 | 2026-05-27 C 级待行情页复核 | 自研模型收益低于 2026 capex 1150-1350 指引 |
10. 投资逻辑 + 业绩传导(200-300 字 + ASCII 传导图)
训练集群的投资主线不是“GPU 越多越好”,而是“有效训练 FLOPS 越便宜越好”。317 2025-2027 年,硬件价值量从单卡扩展到 NVL72 机柜、800G/1.6T 后端网络、液冷配电、并行框架和集群调度;软件效率每提升 5pct MFU,能把同一批 GPU 的可训练 token 吞吐提高约 10%-15%,这会直接影响云厂商愿意采购的下一轮 GPU、网络和电力容量。36 收益顺序上,NVIDIA 最直接吃到 GPU+网络+软件栈,Arista/Broadcom/Cisco 受益于开放 Ethernet 与交换 ASIC,CoreWeave/Oracle/Microsoft 把集群变成可租收入,电力/液冷链条吃到机柜功率上行。916182021 反证阈值是 10,000+ GPU 集群 MFU 长期低于 35%、GPU 可用率低于 90%、checkpoint/故障恢复吞掉 10% 以上训练时间,或云厂商 AI capex 增速连续 2 季度低于折旧增速。2317
模型参数 / token / context 增长
↓
GPU 数 × 单卡 FLOPS × HBM 容量
↓
FSDP / TP / PP / CP / MoE 并行效率
↓
MFU × GPU 可用率 × checkpoint 开销
↓
有效训练 FLOPS / 每 token 成本
↓
GPU + 网络 + 云租赁 + 电力液冷收入
↓
收入 × 毛利率 × PE = 市值弹性
11. 常见误读纠偏(≥2 条)
误读 1:万卡集群的核心是 GPU 数量,网络和并行只是配套。
实际情况:Llama 3.1 405B 使用约 16,000 张 H100 与 30.84M GPU-hours,但可用结果取决于 MFU、checkpoint、straggler 和网络稳定性;GPU 数量翻倍若 MFU 从 43% 掉到 30%,有效吞吐只提升约 40% 而非 100%。3
证据:Meta 同时披露 RoCE 与 InfiniBand 24,576 GPU 集群,并强调网络、软件和模型架构协同才能无网络瓶颈运行 GenAI workloads。214
误读 2:FSDP 可以替代 tensor/pipeline parallel,3D 并行会过时。
实际情况:FSDP 解决参数、梯度和优化器状态的显存分片,tensor parallel 解决层内计算切分,pipeline parallel 解决层序列切分;万卡训练通常需要 FSDP/ZeRO、TP、PP、CP 组合,而不是单一方法。456
证据:PyTorch FSDP2 明确描述 all-gather 与 reduce-scatter 机制,DeepSpeed 明确把 ZeRO data parallel、pipeline parallel 和 tensor-slicing model parallel 组合定义为 3D parallelism。45
误读 3:RoCE 已经证明可以完全替代 InfiniBand。
实际情况:Meta 证明 RoCE 可用于 Llama 训练,但其同时建设 24,576 GPU InfiniBand 集群;不同模型、batch、MoE all-to-all 和故障域会让 IB、Spectrum-X 与通用 RoCE 在 2026 年继续并存。2914
证据:Meta 2024 年两套 24,576 H100 集群分别采用 RoCE 与 Quantum-2 InfiniBand,NVIDIA 同时推进 Quantum-X800 InfiniBand 与 Spectrum-X Ethernet。29
12. 最新事件(3-5 条)
- [已发生] 2024-03-12:Meta 披露两套 24,576 张 NVIDIA H100 训练集群,一套 RoCE、一套 NVIDIA Quantum-2 InfiniBand,并称两者均已用于大规模 GenAI workloads。2
- [已发生] 2024-07-23:Meta Llama 3.1 405B 论文披露 15T+ tokens、约 16,000 H100 和 30.84M GPU-hours,训练集群进入可核算的万卡生产口径。3
- [行业预测] 2024-06-04:650 Group 预计 2025 年 data center AI networking 市场接近 200 亿美元,训练/推理集群网络从服务器配套升级为独立 TAM。22
- [已发生] 2025-11-12:MLCommons 发布 MLPerf Training v5.1,20 家机构提交结果,训练基准从单厂商秀肌肉转向系统级、可复现实测竞争。11
- [指引] 2026-02-25:NVIDIA FY2026 Q4 data center revenue 623 亿美元,networking revenue 109.8 亿美元、同比 +263%,管理层披露与 Meta 的多代 AI 基础设施合作覆盖 CPU、networking 与数百万 Blackwell/Rubin GPU。18
13. 来源 footnotes
1 NVIDIA GB200 NVL72 product specifications — NVIDIA — 2026 crawl — https://www.nvidia.com/en-eu/data-center/gb200-nvl72/ (B)
2 Building Meta’s GenAI Infrastructure — Engineering at Meta — 2024-03-12 — https://engineering.fb.com/2024/03/12/data-center-engineering/building-metas-genai-infrastructure/ (B)
3 The Llama 3 Herd of Models — Meta AI / arXiv — 2024-07-23 — https://arxiv.org/abs/2407.21783 (B)
4 torch.distributed.fsdp.fully_shard / FSDP2 documentation — PyTorch — last updated 2026-04-03 — https://docs.pytorch.org/docs/stable/distributed.fsdp.fully_shard.html (B)
5 DeepSpeed: Extreme-scale model training for everyone — Microsoft Research — 2020 — https://www.microsoft.com/en-us/research/blog/deepspeed-extreme-scale-model-training-for-everyone/ (B)
6 Parallelism Strategies Guide — NVIDIA Megatron Core — 2026 crawl — https://docs.nvidia.com/megatron-core/developer-guide/latest/user-guide/parallelism-guide.html (B)
7 NVIDIA H100 Tensor Core GPU specifications — NVIDIA — 2024 — https://www.nvidia.com/en-us/data-center/h100/ (B)
8 Maintaining large-scale AI capacity at Meta — Engineering at Meta — 2024-06-12 — https://engineering.fb.com/2024/06/12/production-engineering/maintaining-large-scale-ai-capacity-meta/ (B)
9 NVIDIA Spectrum-X Ethernet Platform for AI Networking — NVIDIA — 2026 crawl — https://www.nvidia.com/en-us/networking/spectrumx/ (B)
10 NVIDIA DGX SuperPOD Reference Architecture: GB200 components — NVIDIA Docs — 2025 — https://docs.nvidia.com/dgx-superpod/reference-architecture-scalable-infrastructure-gb200/latest/dgx-superpod-components.html (B)
11 MLCommons Releases MLPerf Training v5.1 Results — MLCommons — 2025-11-12 — https://mlcommons.org/2025/11/training-v5-1-results/ (A)
12 The NVIDIA Grace Blackwell Superchip / GB200 NVL Multi-Node Tuning Guide — NVIDIA Docs — 2025 — https://docs.nvidia.com/multi-node-nvlink-systems/multi-node-tuning-guide/overview.html (B)
13 NVIDIA GB200 NVL72 Delivers Trillion-Parameter LLM Training and Real-Time Inference — NVIDIA Technical Blog — 2024-03-18 — https://developer.nvidia.com/blog/nvidia-gb200-nvl72-delivers-trillion-parameter-llm-training-and-real-time-inference/ (B)
14 RoCE networks for distributed AI training at scale — Engineering at Meta — 2024-08-05 — https://engineering.fb.com/2024/08/05/data-center-engineering/roce-network-distributed-ai-training-at-scale/ (B)
15 Key Components of the DGX SuperPOD — NVIDIA Docs — 2025 — https://docs.nvidia.com/dgx-superpod/reference-architecture-scalable-infrastructure-gb200/latest/dgx-superpod-components.html (B)
16 CoreWeave Reports Strong Fourth Quarter and Fiscal Year 2025 Results — CoreWeave Investor Relations — 2026-02-26 — https://investors.coreweave.com/news/news-details/2026/CoreWeave-Reports-Strong-Fourth-Quarter-and-Fiscal-Year-2025-Results/default.aspx (A)
17 Microsoft 2025 Annual Report — Microsoft — 2025 — https://www.microsoft.com/investor/reports/ar25/index.html (A)
18 NVIDIA Announces Financial Results for Fourth Quarter and Fiscal 2026 — NVIDIA Newsroom / SEC exhibit — 2026-02-25 — https://nvidianews.nvidia.com/news/nvidia-announces-financial-results-for-fourth-quarter-and-fiscal-2026 (A)
19 AMD 2025 Annual Report / Form 10-K — AMD / SEC — 2026 — https://www.sec.gov/Archives/edgar/data/0000002488/000000248826000018/amd-20251227.htm (A)
20 Arista Networks Reports Fourth Quarter and Year End 2025 Financial Results — Arista Networks — 2026-02-17 — https://s21.q4cdn.com/861911615/files/doc_news/Arista-Networks-Inc—Reports-Fourth-Quarter-and-Year-End-2025-Financial-Results-2026.pdf (A)
21 Broadcom Announces Fourth Quarter and Fiscal Year 2025 Financial Results — Broadcom — 2025-12-11 — https://investors.broadcom.com/news-releases/news-release-details/broadcom-inc-announces-fourth-quarter-and-fiscal-year-2025 (A)
22 Data Center AI Networking to Surge to Nearly $20B in 2025 — 650 Group — 2024-06-04 — https://650group.com/press-releases/data-center-ai-networking-to-surge-to-nearly-20b-in-2025-according-to-650-group/ (A)
23 Market valuation data for NVDA/AMD/ANET/AVGO/CRWV/MSFT/META — StockAnalysis / public quote pages — 2026-05-27 16:00 EDT close, USD, market cap = shares × close, PE = close ÷ diluted EPS TTM — https://stockanalysis.com/ (C)
24 Microsoft Azure ND H100 v5-series documentation — Microsoft Learn — 2026 crawl — https://learn.microsoft.com/en-us/azure/virtual-machines/sizes/gpu-accelerated/ndh100v5-series (B)
25 NVIDIA Blackwell Delivers up to 2.6x Higher Performance in MLPerf Training v5.0 — NVIDIA Technical Blog — 2025 — https://developer.nvidia.com/blog/nvidia-blackwell-delivers-up-to-2-6x-higher-performance-in-mlperf-training-v5-0/ (B)
26 Reproducing NVIDIA MLPerf v5.0 Training Scores for LLM Benchmarks — NVIDIA Technical Blog — 2025 — https://developer.nvidia.com/blog/reproducing-nvidia-mlperf-v5-0-training-scores-for-llm-benchmarks/ (B)
27 PyTorch Fully Sharded Data Parallel API — PyTorch Blog — 2022-04-29 — https://pytorch.org/blog/introducing-pytorch-fully-sharded-data-parallel-api/ (B)
28 Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM — NVIDIA / Microsoft / Stanford paper — 2021 — https://arxiv.org/abs/2104.04473 (B)
29 Meta 2025 Form 10-K — Meta Platforms / SEC — 2026 — https://www.sec.gov/Archives/edgar/data/1326801/000162828026003942/meta-20251231.htm (A)
30 Oracle Announces Fiscal 2025 Fourth Quarter and Fiscal Full Year Financial Results — Oracle Investor Relations — 2025-06-11 — https://investor.oracle.com/investor-news/news-details/2025/Oracle-Announces-Fiscal-2025-Fourth-Quarter-and-Fiscal-Full-Year-Financial-Results/default.aspx (A)