訓練叢集
1. 3 秒看懂(≤25 字)
訓練叢集把 1 萬-10 萬張 GPU 變成 1 臺可訓練模型的機器。12
2. 3 分鐘產業解釋(120-180 字)
訓練叢集是把 GPU、HBM、NVLink/PCIe、InfiniBand/Ethernet、分散式檔案系統、排程器和 PyTorch/Megatron/DeepSpeed 組合成可連續執行數週到數月的 AI 工廠,核心指標從“買了多少卡”轉向 MFU、step time、有效頻寬、故障恢復時間和 checkpoint 開銷。12 Meta 2024 年揭露兩套 24,576 張 H100 叢集,分別採用 RoCE 與 NVIDIA Quantum-2 InfiniBand,且 Llama 3.1 405B 用約 16,000 張 H100、15T+ tokens、約 30.84M GPU-hours 完成訓練,說明萬卡叢集已從實驗室進入頭部廠商生產口徑。23 2025-2027 年的產業分歧是:FSDP/3D 並行能否把十萬卡的掉卡、尾時延和儲存瓶頸壓到可運營範圍內;若 MFU 每提升 5pct,同等 GPU capex 的有效訓練吞吐就等價提升約 10%-15%。45
3. 15 分鐘專家深入(400-600 字)
訓練叢集的經濟性由 3 層乘法決定:第一層是硬體規模,GPU 數 × 單 GPU FLOPS × HBM 容量/頻寬決定理論訓練吞吐;第二層是並行策略,FSDP/ZeRO、tensor parallel、pipeline parallel、sequence/context parallel 把模型引數、啟用、梯度和最佳化器狀態切到不同通訊域;第三層是運營效率,MFU、GPU 可用率、checkpoint 間隔、故障重啟時間和資料載入吞吐決定理論 FLOPS 變成多少有效 token。346 可算公式為 有效訓練 FLOPS = GPU 數 × 單 GPU 峰值 FLOPS × MFU × 可用率;在 16,000 張 H100、MFU 40%、可用率 90% 的口徑下,若單卡 BF16 峰值按 1,979 TFLOPS,則有效訓練吞吐約為 16,000 × 1,979 × 40% × 90% = 11.4 EFLOPS,單卡峰值和 MFU 都需要按具體精度與模型 kernel 校準。37
FSDP 的價值在記憶體側。PyTorch FSDP/FSDP2 把引數、梯度和最佳化器狀態按 data-parallel rank 分片,forward/backward 前 all-gather,backward 後 reduce-scatter,因此同樣 HBM 下可訓練更大型模型或更長 sequence,但代價是通訊更頻繁。4 3D 並行的價值在通訊域側:tensor parallel 把層內矩陣計算切到 NVLink/NVSwitch 近端域,pipeline parallel 把層序列切到 stage 並用 micro-batch 填充流水線,data/FSDP parallel 把樣本和狀態切到跨節點域;DeepSpeed 把 ZeRO-powered data parallel、pipeline parallel 與 tensor-slicing model parallel 定義為 trillion-parameter 訓練的 3D parallelism。56
萬卡到十萬卡的瓶頸不是單點算力,而是尾部機率。假設單 GPU 月故障機率為 2%,10,000 張 GPU 的月度故障事件期望值約 200 次,100,000 張則約 2,000 次;因此訓練平台必須把 checkpoint、熱備、作業彈性、故障隔離和自動診斷做成預設能力,而不是運維補丁。28 產業鏈對映上,NVIDIA 受益於 GPU+NVLink+InfiniBand/Spectrum-X+CUDA/NCCL 的閉環,Arista/Broadcom/Cisco 受益於 Ethernet 化,CoreWeave/Oracle/Microsoft 受益於可租用訓練容量,Vertiv/電力鏈受益於機櫃功率從 30kW 走向 100kW+。1910
4. 技術原理(200-300 字)
訓練叢集把模型訓練拆成 4 類通訊:data parallel 的梯度同步、FSDP/ZeRO 的引數 all-gather 與梯度 reduce-scatter、tensor parallel 的層內 all-reduce/all-gather、pipeline parallel 的 stage 間啟用傳輸。45 NVLink/NVSwitch 負責單節點或單機櫃低時延高頻寬域,InfiniBand/RoCE/Spectrum-X 負責跨機櫃 scale-out 域,儲存網路負責樣本讀取、日誌與 checkpoint;任一域的 P99/P999 尾時延上升都會把同步訓練的 step time 拉長。12 對 LLM 訓練而言,MFU 是比 GPU 利用率更硬的指標,因為 MFU 把模型有效 FLOPs 與硬體峰值 FLOPs 相除,能識別“GPU 忙但在等網路/記憶體/資料”的虛假繁忙。3 2025 年以後,sequence parallel、context parallel 和 MoE expert parallel 把通訊從純 all-reduce 擴充套件到 all-to-all,訓練叢集的反證指標也從平均吞吐轉向 straggler 佔比、重算比例和 checkpoint 恢復時間。611
5. 上游依賴 / 下游影響
上游依賴
- GPU/HBM:H100/H200/B200/GB200 的 HBM 容量和頻寬決定 batch size、sequence length 與 activation checkpoint 比例;GB200 NVL72 單 rack 公開口徑為 72 張 Blackwell GPU、13.4TB HBM3e 與 576TB/s HBM 頻寬。112
- Scale-up 互連:GB200 NVL72 公開口徑為 130TB/s NVLink 頻寬,單機櫃 72 GPU 域擴大後可把 tensor parallel 與部分 reduction 留在近端域內。1213
- Scale-out 網路:Meta 24,576 H100 RoCE/InfiniBand 雙叢集說明 RoCE 與 IB 均可生產化,但 10,000+ GPU 的訓練穩定性仍由擁塞控制、鏈路故障和 NCCL 拓撲共同決定。214
- 儲存與 checkpoint:Meta 揭露訓練基礎設施需要前端網路處理 data ingestion、checkpointing 和 logging;若 checkpoint 寫入吞吐低於訓練產出速率,GPU 等待會直接抬高每 token 成本。14
- 電力與散熱:DGX GB200 SuperPOD 參考架構揭露每個 power shelf 有 6 個 5.5kW PSU、可輸出 33kW,機櫃級液冷和配電能力成為十萬卡叢集的交付前置項。15
下游影響
- Frontier model 訓練:Llama 3.1 405B 的 16,000 H100、15T+ tokens 與 30.84M GPU-hours 口徑說明 400B+ 引數模型已要求萬卡級長週期叢集。3
- 雲端租賃:CoreWeave 2025 年營收 51 億美元、backlog 668 億美元,說明外部 AI cloud 已從補位容量變成訓練叢集採購的一條獨立鏈路。16
- 超級雲端 CAPEX:Microsoft 2025 年 Microsoft Cloud 毛利率降至 69%,公司明確稱 AI 基礎設施擴張壓低雲端毛利率;訓練叢集效率每提升 5pct 都會反向緩解折舊與電力壓力。17
- 網路與光模組:800G/1.6T 後端網路需求隨 GPU 規模上升,NVIDIA Q4 FY2026 networking revenue 109.8 億美元、年增率 +263%,顯示訓練/推論叢集網路已成為獨立營收曲線。18
6. 技術路線對比表
| 路線 | 速率 / 計算域 | 功耗 | 距離或維度 | 標準成熟度 | 量產機率 2026 | 反證指標 |
|---|---|---|---|---|---|---|
| FSDP / ZeRO-3 | data-parallel rank 維度;引數/梯度/最佳化器狀態全分片 | 通訊額上升,視訊記憶體下降;絕對 W 取決於 GPU | 跨節點到跨機櫃 | PyTorch FSDP/FSDP2 與 DeepSpeed ZeRO 成熟。45 | 90% | all-gather/reduce-scatter 佔 step time 連續高於 25%,MFU 低於 35%。 |
| Tensor parallel | 層內矩陣按 2/4/8/16-way 切分 | 依賴 NVLink/NVSwitch,跨節點代價陡升 | 節點內或 NVL72 域 | Megatron Core 成熟,NVLink 域越大越有效。612 | 85% | TP all-reduce 跨出低時延域後 step time 上升超過 15%。 |
| Pipeline parallel | 8-64 stage 常見;micro-batch 填流水線 | 氣泡率隨 micro-batch 與 stage 增減 | 層維度 / stage 維度 | DeepSpeed/Megatron 成熟。56 | 80% | pipeline bubble 高於 10%-15%,或負載不均導致 straggler 擴散。 |
| 3D 並行 | DP/FSDP × TP × PP,疊加 sequence/context parallel | 通訊域最複雜,調參成本最高 | 萬卡-十萬卡 | trillion-parameter 訓練主流工程範式。56 | 80% | 同等 batch 下 MFU 低於 40%,故障恢復後需人工重排 rank。 |
| MoE expert parallel | expert all-to-all;路由維度切分 | 網路突發高,負載不均敏感 | 跨節點 / 跨機櫃 | 快速成熟,公開標準少於 DP/TP/PP | 65% | expert imbalance 超過 20%,all-to-all 成為第一瓶頸。 |
| Blackwell NVL72 rack-scale | 72 GPU 單 rack,130TB/s NVLink,13.4TB HBM3e | 單 rack 100kW+ 情景需按配置核實 | 機櫃級 scale-up | NVIDIA 產品化,雲端廠商匯入中。1213 | 85% | NVL72 大規模訓練可用率低於 H100/H200 叢集,或液冷交付延期超過 2 季度。 |
7. 關鍵指標(5-7 項 + 怎麼追)
- MFU:Meta Llama 3 相關公開口徑約 400 TFLOPS/GPU 與 38%-43% BF16 MFU,逐次追蹤模型論文、工程部落格和 MLPerf Training;低於 35% 說明網路、kernel 或資料鏈路吃掉擴容收益。3
- GPU 可用率:按
可訓練 GPU 小時 ÷ 已安裝 GPU 小時追蹤,10,000 卡叢集若月故障事件超過 200 次且自動恢復不充分,checkpoint 與重啟會吞掉 3%-8% 有效算力。28 - Step time / tokens per second:按模型、sequence、global batch 固定後追蹤,若 GPU 數翻倍但 tokens/s 增幅低於 1.6 倍,說明並行或網路擴充套件效率低於 80%。36
- 網路有效頻寬:按 NCCL all-reduce、reduce-scatter、all-to-all benchmark 與訓練 step 拆分追蹤;Spectrum-X 對 AI 網路效能的公開宣稱為傳統 Ethernet 的 1.6 倍、有效頻寬最高 95%,需要用真實作業校驗。9
- Checkpoint 時間:按
checkpoint 寫入秒數 ÷ 訓練間隔秒數追蹤;若佔比超過 5%-10%,訓練平台應增加非同步 checkpoint、分層儲存或更長容錯視窗。14 - CAPEX / 有效 PFLOPS:按
GPU 採購 + 網路 + 機電 + 折舊 ÷ 有效訓練 PFLOPS追蹤;Microsoft 2025 年雲端毛利率 69% 已顯示 AI 基建折舊對雲端毛利有可見壓力。17 - 營收兌現:追蹤 NVIDIA data center/networking、AMD data center、Arista cloud titans、Broadcom AI semiconductor、CoreWeave revenue/backlog;若訂單增速領先營收 2 個季度以上,供應約束仍強。1618192021
8. 可算傳導表
口徑:2025A/2026E 單位為億美元,除特別說明;訓練叢集是 GPU、網路、雲端租賃與機電的組合市場,公開公司通常不揭露“訓練叢集營收”,因此本表用可核實財務口徑作上限或代理,關鍵份額未揭露處不偽造實數。1618192021
| 驅動變數 | NVIDIA 平台 | Arista AI Ethernet | CoreWeave AI Cloud | 來源/公式 |
|---|---|---|---|---|
| TAM | 2025E AI networking nearly 200 億美元;AI GPU/cluster TAM 待補 A/B | 同左網路子環節 | AI cloud TAM 待補 A/B | 650 Group 網路口徑,非完整訓練叢集 TAM。22 |
| 出貨 / 容量基數 | FY2026 Data Center 1,937.37;Q4 networking 109.8 | 2025 revenue 90.0,雲端客戶與 AI 網路佔比未揭露 | 2025 revenue 51.3;backlog 668 | 182016 |
| ASP | GPU/NVL72/網路組合 ASP 未揭露 | 交換器 ASP 未揭露 | GPU-hour ASP 未揭露 | 公司未揭露,不用 C 級估算。 |
| 份額 | 高階訓練 GPU 份額高但精確份額待補 A/B | 資料中心交換領先但 AI 後端份額待補 A/B | AI cloud 份額待補 A/B | 182016 |
| → 營收 | Data Center revenue = compute + networking + software/support,FY2026 為 1,937.37 | 訓練網路營收 ≤ 總營收 × cloud titan mix,2025 上限為 90.0 | 訓練租賃營收 ≤ 總營收,2025 上限為 51.3 | 182016 |
| 毛利率 | FY2026 GAAP GM 71.1% | 2025 GAAP GM 約 63% | 2025 gross margin 待 10-K 表核;adjusted EBITDA margin 57% | 182016 |
| → 毛利 | 1,937.37 × 71.1% = 1,377.27 總公司代理 | 90.0 × 63% = 56.7 總公司代理 | 毛利待揭露;51.3 × 57% = 29.2 調整 EBITDA 代理 | 推算 |
| PE / 估值口徑 | 2026-05-27 16:00 EDT,美股,market cap = shares × close;PE TTM 用行情站,C 級 | 同左 | 同左 | 23 |
| → 估值 | 訓練叢集淨利 × PE;訓練叢集淨利率未揭露 | AI網路淨利 × PE;業務淨利率未揭露 | AI雲端淨利 × PE;淨利仍受折舊/利息壓制 | 推算 |
3 家公司情景傳導
| 變數 | NVIDIA | AMD | Broadcom | 公式 / 證據 |
|---|---|---|---|---|
| 相關營收基數 | FY2026 Data Center 1,937.37 | 2025 Data Center revenue 182.4 | FY2025 AI semiconductor Q1 FY2026 展望 82 年化=328 | 181921 |
| 訓練叢集佔比 | 情景 65% | 情景 55% | 情景 50% | 非公司揭露,按產品暴露度情景。 |
| → 訓練叢集營收 | 1,937.37 × 65% = 1,259.29 | 182.4 × 55% = 100.32 | 328 × 50% = 164.00 | 推算 |
| 毛利率 / 獲利率 | GAAP GM 71.1% | 2025 GM 待 10-K;Data Center OP margin 待細表 | FY2025 GAAP GM 約 68% | 181921 |
| → 毛利貢獻 | 1,259.29 × 71.1% = 895.36 | 待揭露,不用全公司 GM 強代 | 164.00 × 68% = 111.52 | 推算 |
| 反證指標 | networking revenue QoQ 低於 10% 或 GB200/GB300 交付延後 2 季度 | MI350/MI450 叢集軟體成熟度低於客戶預期 | AI Ethernet switch/XPU 客戶少於 4 家且訂單低於展望 | 181921 |
9. 同業硬指標對比表
口徑:美股估值必須用 2026-05-27 16:00 EDT 完整收盤,market cap = shares × close,PE TTM 採用公開行情站 C 級;財務資料優先用 2025A/FY2026A 年報或公司公告 A/B 級。161819202123
| 公司 | 營收 | 增速 | GM | 淨利 | FCF margin | 客戶集中度 | 技術代際 | PE TTM | 反證條件 |
|---|---|---|---|---|---|---|---|---|---|
| NVIDIA | FY2026 revenue 2,159.38;Data Center 1,937.37 | FY2026 +65%;Q4 Data Center +75% YoY | FY2026 GAAP 71.1% | FY2026 net income 1,200.67 | FCF 待 10-K 現金流量細表核算 | direct customers 10%+ 風險存在 | H100/H200/GB200/GB300、NVLink、IB、Spectrum-X | 2026-05-27 C 級待行情頁複核 | GB200/GB300 大叢集可用率不及 H100/H200 |
| AMD | 2025 revenue 待完整表;Data Center revenue 182.4 | Data Center 高增長 | GM 待 10-K 表核 | 淨利待 10-K 表核 | FCF 待 10-K 表核 | hyperscaler AI 客戶集中 | MI300/MI350/MI450、ROCm | 2026-05-27 C 級待行情頁複核 | ROCm/Megatron/FSDP 生態導致 MFU 長期落後 NVIDIA 10pct+ |
| Arista | 2025 revenue 90.0 | 2025 +約 29% | GAAP GM 約 63% | 淨利待年報表核 | FCF margin 待年報表核 | Microsoft/Meta 為大客戶,2025 雲端客戶佔比提升 | 400G/800G AI Ethernet、EOS | 2026-05-27 C 級待行情頁複核 | Cloud titan capex 放緩或 Spectrum-X 侵蝕 Ethernet 份額 |
| Broadcom | FY2025 revenue 待 10-K;Q1 FY2026 AI semiconductor 展望 82 | AI semiconductor Q1 FY2026 展望年增率翻倍 | FY2025 GAAP GM 約 68% | 淨利待 10-K 表核 | FY2025 FCF 269 | AI XPU/網路客戶高度集中 | XPU、Tomahawk/Jericho、Ethernet AI switch | 2026-05-27 C 級待行情頁複核 | 第 4/第 5 個 AI 客戶訂單未兌現 |
| CoreWeave | 2025 revenue 51.3;backlog 668 | 2025 +168% | GM 待年報表核 | 淨虧損,折舊/利息壓制 | FCF 受 capex 壓制 | Microsoft/OpenAI 等客戶集中 | NVIDIA 雲端、Mission Control、GPU telemetry | 2026-05-27 C 級待行情頁複核 | GPU 租賃價格下行快於折舊攤銷 |
| Microsoft | FY2025 revenue 2,817.24;Microsoft Cloud GM 69% | FY2025 revenue +15% | Cloud GM 69% | net income 1,018.32 | FCF margin 待年報表核 | OpenAI/企業雲端需求多元 | Azure H100/GB200/GB300、ND H100 v5 | 2026-05-27 C 級待行情頁複核 | AI capex 抬升但 Azure AI 營收轉化低於折舊增長 |
| Meta | 2025 revenue 2,009.7 | 2025 +22% | 廣告高 GM,AI capex 壓制 FCF | net income 604.6 | capex 722.2 壓制 FCF | 自用訓練需求,無外售營收 | 24,576 H100 RoCE/IB、Llama 訓練 | 2026-05-27 C 級待行情頁複核 | 自研模型收益低於 2026 capex 1150-1350 展望 |
10. 投資邏輯 + 業績傳導(200-300 字 + ASCII 傳導圖)
訓練叢集的投資主線不是“GPU 越多越好”,而是“有效訓練 FLOPS 越便宜越好”。317 2025-2027 年,硬體價值量從單卡擴充套件到 NVL72 機櫃、800G/1.6T 後端網路、液冷配電、並行架構和叢集排程;軟體效率每提升 5pct MFU,能把同一批 GPU 的可訓練 token 吞吐提高約 10%-15%,這會直接影響雲端廠商願意採購的下一輪 GPU、網路和電力容量。36 收益順序上,NVIDIA 最直接吃到 GPU+網路+軟體棧,Arista/Broadcom/Cisco 受益於開放 Ethernet 與交換 ASIC,CoreWeave/Oracle/Microsoft 把叢集變成可租營收,電力/液冷鏈條吃到機櫃功率上行。916182021 反證閾值是 10,000+ GPU 叢集 MFU 長期低於 35%、GPU 可用率低於 90%、checkpoint/故障恢復吞掉 10% 以上訓練時間,或雲端廠商 AI capex 增速連續 2 季度低於折舊增速。2317
模型引數 / token / context 增長
↓
GPU 數 × 單卡 FLOPS × HBM 容量
↓
FSDP / TP / PP / CP / MoE 並行效率
↓
MFU × GPU 可用率 × checkpoint 開銷
↓
有效訓練 FLOPS / 每 token 成本
↓
GPU + 網路 + 雲端租賃 + 電力液冷營收
↓
營收 × 毛利率 × PE = 市值彈性
11. 常見誤讀糾偏(≥2 條)
誤讀 1:萬卡叢集的核心是 GPU 數量,網路和並行只是配套。
實際情況:Llama 3.1 405B 使用約 16,000 張 H100 與 30.84M GPU-hours,但可用結果取決於 MFU、checkpoint、straggler 和網路穩定性;GPU 數量翻倍若 MFU 從 43% 掉到 30%,有效吞吐只提升約 40% 而非 100%。3
證據:Meta 同時揭露 RoCE 與 InfiniBand 24,576 GPU 叢集,並強調網路、軟體和模型架構協同才能無網路瓶頸執行 GenAI workloads。214
誤讀 2:FSDP 可以替代 tensor/pipeline parallel,3D 並行會過時。
實際情況:FSDP 解決引數、梯度和最佳化器狀態的視訊記憶體分片,tensor parallel 解決層內計算切分,pipeline parallel 解決層序列切分;萬卡訓練通常需要 FSDP/ZeRO、TP、PP、CP 組合,而不是單一方法。456
證據:PyTorch FSDP2 明確描述 all-gather 與 reduce-scatter 機制,DeepSpeed 明確把 ZeRO data parallel、pipeline parallel 和 tensor-slicing model parallel 組合定義為 3D parallelism。45
誤讀 3:RoCE 已經證明可以完全替代 InfiniBand。
實際情況:Meta 證明 RoCE 可用於 Llama 訓練,但其同時建設 24,576 GPU InfiniBand 叢集;不同模型、batch、MoE all-to-all 和故障域會讓 IB、Spectrum-X 與通用 RoCE 在 2026 年繼續並存。2914
證據:Meta 2024 年兩套 24,576 H100 叢集分別採用 RoCE 與 Quantum-2 InfiniBand,NVIDIA 同時推進 Quantum-X800 InfiniBand 與 Spectrum-X Ethernet。29
12. 最新事件(3-5 條)
- [已發生] 2024-03-12:Meta 揭露兩套 24,576 張 NVIDIA H100 訓練叢集,一套 RoCE、一套 NVIDIA Quantum-2 InfiniBand,並稱兩者均已用於大規模 GenAI workloads。2
- [已發生] 2024-07-23:Meta Llama 3.1 405B 論文揭露 15T+ tokens、約 16,000 H100 和 30.84M GPU-hours,訓練叢集進入可核算的萬卡生產口徑。3
- [行業預測] 2024-06-04:650 Group 預計 2025 年 data center AI networking 市場接近 200 億美元,訓練/推論叢集網路從伺服器配套升級為獨立 TAM。22
- [已發生] 2025-11-12:MLCommons 釋出 MLPerf Training v5.1,20 家機構提交結果,訓練基準從單廠商秀肌肉轉向系統級、可復現實測競爭。11
- [展望] 2026-02-25:NVIDIA FY2026 Q4 data center revenue 623 億美元,networking revenue 109.8 億美元、年增率 +263%,管理層揭露與 Meta 的多代 AI 基礎設施合作覆蓋 CPU、networking 與數百萬 Blackwell/Rubin GPU。18
13. 來源 footnotes
1 NVIDIA GB200 NVL72 product specifications — NVIDIA — 2026 crawl — https://www.nvidia.com/en-eu/data-center/gb200-nvl72/ (B)
2 Building Meta’s GenAI Infrastructure — Engineering at Meta — 2024-03-12 — https://engineering.fb.com/2024/03/12/data-center-engineering/building-metas-genai-infrastructure/ (B)
3 The Llama 3 Herd of Models — Meta AI / arXiv — 2024-07-23 — https://arxiv.org/abs/2407.21783 (B)
4 torch.distributed.fsdp.fully_shard / FSDP2 documentation — PyTorch — last updated 2026-04-03 — https://docs.pytorch.org/docs/stable/distributed.fsdp.fully_shard.html (B)
5 DeepSpeed: Extreme-scale model training for everyone — Microsoft Research — 2020 — https://www.microsoft.com/en-us/research/blog/deepspeed-extreme-scale-model-training-for-everyone/ (B)
6 Parallelism Strategies Guide — NVIDIA Megatron Core — 2026 crawl — https://docs.nvidia.com/megatron-core/developer-guide/latest/user-guide/parallelism-guide.html (B)
7 NVIDIA H100 Tensor Core GPU specifications — NVIDIA — 2024 — https://www.nvidia.com/en-us/data-center/h100/ (B)
8 Maintaining large-scale AI capacity at Meta — Engineering at Meta — 2024-06-12 — https://engineering.fb.com/2024/06/12/production-engineering/maintaining-large-scale-ai-capacity-meta/ (B)
9 NVIDIA Spectrum-X Ethernet Platform for AI Networking — NVIDIA — 2026 crawl — https://www.nvidia.com/en-us/networking/spectrumx/ (B)
10 NVIDIA DGX SuperPOD Reference Architecture: GB200 components — NVIDIA Docs — 2025 — https://docs.nvidia.com/dgx-superpod/reference-architecture-scalable-infrastructure-gb200/latest/dgx-superpod-components.html (B)
11 MLCommons Releases MLPerf Training v5.1 Results — MLCommons — 2025-11-12 — https://mlcommons.org/2025/11/training-v5-1-results/ (A)
12 The NVIDIA Grace Blackwell Superchip / GB200 NVL Multi-Node Tuning Guide — NVIDIA Docs — 2025 — https://docs.nvidia.com/multi-node-nvlink-systems/multi-node-tuning-guide/overview.html (B)
13 NVIDIA GB200 NVL72 Delivers Trillion-Parameter LLM Training and Real-Time Inference — NVIDIA Technical Blog — 2024-03-18 — https://developer.nvidia.com/blog/nvidia-gb200-nvl72-delivers-trillion-parameter-llm-training-and-real-time-inference/ (B)
14 RoCE networks for distributed AI training at scale — Engineering at Meta — 2024-08-05 — https://engineering.fb.com/2024/08/05/data-center-engineering/roce-network-distributed-ai-training-at-scale/ (B)
15 Key Components of the DGX SuperPOD — NVIDIA Docs — 2025 — https://docs.nvidia.com/dgx-superpod/reference-architecture-scalable-infrastructure-gb200/latest/dgx-superpod-components.html (B)
16 CoreWeave Reports Strong Fourth Quarter and Fiscal Year 2025 Results — CoreWeave Investor Relations — 2026-02-26 — https://investors.coreweave.com/news/news-details/2026/CoreWeave-Reports-Strong-Fourth-Quarter-and-Fiscal-Year-2025-Results/default.aspx (A)
17 Microsoft 2025 Annual Report — Microsoft — 2025 — https://www.microsoft.com/investor/reports/ar25/index.html (A)
18 NVIDIA Announces Financial Results for Fourth Quarter and Fiscal 2026 — NVIDIA Newsroom / SEC exhibit — 2026-02-25 — https://nvidianews.nvidia.com/news/nvidia-announces-financial-results-for-fourth-quarter-and-fiscal-2026 (A)
19 AMD 2025 Annual Report / Form 10-K — AMD / SEC — 2026 — https://www.sec.gov/Archives/edgar/data/0000002488/000000248826000018/amd-20251227.htm (A)
20 Arista Networks Reports Fourth Quarter and Year End 2025 Financial Results — Arista Networks — 2026-02-17 — https://s21.q4cdn.com/861911615/files/doc_news/Arista-Networks-Inc—Reports-Fourth-Quarter-and-Year-End-2025-Financial-Results-2026.pdf (A)
21 Broadcom Announces Fourth Quarter and Fiscal Year 2025 Financial Results — Broadcom — 2025-12-11 — https://investors.broadcom.com/news-releases/news-release-details/broadcom-inc-announces-fourth-quarter-and-fiscal-year-2025 (A)
22 Data Center AI Networking to Surge to Nearly $20B in 2025 — 650 Group — 2024-06-04 — https://650group.com/press-releases/data-center-ai-networking-to-surge-to-nearly-20b-in-2025-according-to-650-group/ (A)
23 Market valuation data for NVDA/AMD/ANET/AVGO/CRWV/MSFT/META — StockAnalysis / public quote pages — 2026-05-27 16:00 EDT close, USD, market cap = shares × close, PE = close ÷ diluted EPS TTM — https://stockanalysis.com/ (C)
24 Microsoft Azure ND H100 v5-series documentation — Microsoft Learn — 2026 crawl — https://learn.microsoft.com/en-us/azure/virtual-machines/sizes/gpu-accelerated/ndh100v5-series (B)
25 NVIDIA Blackwell Delivers up to 2.6x Higher Performance in MLPerf Training v5.0 — NVIDIA Technical Blog — 2025 — https://developer.nvidia.com/blog/nvidia-blackwell-delivers-up-to-2-6x-higher-performance-in-mlperf-training-v5-0/ (B)
26 Reproducing NVIDIA MLPerf v5.0 Training Scores for LLM Benchmarks — NVIDIA Technical Blog — 2025 — https://developer.nvidia.com/blog/reproducing-nvidia-mlperf-v5-0-training-scores-for-llm-benchmarks/ (B)
27 PyTorch Fully Sharded Data Parallel API — PyTorch Blog — 2022-04-29 — https://pytorch.org/blog/introducing-pytorch-fully-sharded-data-parallel-api/ (B)
28 Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM — NVIDIA / Microsoft / Stanford paper — 2021 — https://arxiv.org/abs/2104.04473 (B)
29 Meta 2025 Form 10-K — Meta Platforms / SEC — 2026 — https://www.sec.gov/Archives/edgar/data/1326801/000162828026003942/meta-20251231.htm (A)
30 Oracle Announces Fiscal 2025 Fourth Quarter and Fiscal Full Year Financial Results — Oracle Investor Relations — 2025-06-11 — https://investor.oracle.com/investor-news/news-details/2025/Oracle-Announces-Fiscal-2025-Fourth-Quarter-and-Fiscal-Full-Year-Financial-Results/default.aspx (A)