裸金屬部署(Bare-metal Provisioning)
3 秒看懂
一句話:跳過虛擬機器/容器抽象層,將作業系統和 AI 訓練架構直接裝到物理 GPU 伺服器上——讓每一顆電晶體都為大型模型幹活。
3 分鐘產業解釋
它解決什麼問題?
大型模型訓練對算力的”壓榨”近乎極致。一次 GPT-4 量級的訓練,數千張 GPU 連續執行數月,即使 2–3% 的效能損失也意味著數百萬美元的額外成本。裸金屬部署就是把這 2–3% 搶回來的核心手段:
| 維度 | 裸金屬 | 虛擬化(VM) |
|---|---|---|
| 虛擬化開銷 | 零(無 hypervisor 層) | 有(CPU 上下文切換、I/O 模擬) |
| GPU 訪問模式 | 原生 PCIe/NVLink 直通 | 需 SR-IOV / vGPU 中間層 |
| 網路延遲(InfiniBand) | 核心旁路原生效 | 需額外配置 passthrough |
| 多租戶隔離 | 弱(物理級隔離) | 強(VM 級隔離) |
| 彈性伸縮速度 | 慢(分鐘級,需重灌 OS) | 快(秒級建立 VM) |
AI 訓練場景幾乎是裸金屬的”必選項”;推論服務則因彈性需求更強,常在容器/VM 中執行。
誰在用?
- 超大規模預訓練:OpenAI、Anthropic、xAI 等萬卡叢集訓練,幾乎全部裸金屬
- 雲端廠商 AI 例項:AWS 的
p4d.metal、g5.metal(裸金屬例項),Azure 的裸金屬基礎設施(如 NDv2 系列),Google Cloud 的某些特定裸金屬型號 - 主權 AI / 私有化部署:國內運營商、科研機構自建智算中心,主流方案即裸金屬 + Slurm 排程
15 分鐘專家深入
為什麼 AI 叢集偏愛裸金屬?—— 三個技術剛性約束
1. GPU 通訊拓撲敏感性
大規模訓練依賴節點內 NVLink/NVSwitch 和節點間 InfiniBand(IB)形成高頻寬低延遲的通訊 fabric。張量並行(TP)要求 GPU 間 < 1μs 的延遲抖動,任何虛擬化層的中斷注入都可能導致 NCCL AllReduce 尾延遲飆升,觸發超時重傳。
2. 拓撲感知排程(Topology-aware Scheduling)
訓練架構(Megatron-LM、DeepSpeed、FSDP)需要精確知道物理拓撲——哪 8 張卡在同一 NVSwitch 域、哪兩個節點通過同一 Leaf Switch 相連——以便把通訊密集的並行維度對映到物理近鄰。VM 層會模糊拓撲檢視。
3. 記憶體頻寬零浪費
HBM 的頻寬是訓練吞吐的命脈。hypervisor 對記憶體頁的二次對映(EPT/NPT)會引入 TLB miss 開銷,對 HBM 密集的 Attention/FFN 計算產生非線性影響。
典型裸金屬部署的技術棧
┌─────────────────────────────────────────────────┐
│ 排程層:Slurm / Kubernetes (配 bare-metal CAPI) │
├─────────────────────────────────────────────────┤
│ 編排層:Ironic (OpenStack) / MAAS / Cobbler │
│ ┌─────────────┐ ┌──────────────────┐ │
│ │ PXE/TFTP 引導│ │ IPMI/BMC 帶外管理│ │
│ └─────────────┘ └──────────────────┘ │
├─────────────────────────────────────────────────┤
│ 作業系統:Ubuntu / Rocky Linux / 定製映象 │
├─────────────────────────────────────────────────┤
│ 驅動 & 執行時: │
│ GPU Driver → CUDA → cuDNN → NCCL → OFED(IB驅動) │
├─────────────────────────────────────────────────┤
│ 儲存:Lustre / GPFS / WekaFS 並行檔案系統 │
├─────────────────────────────────────────────────┤
│ 硬體:GPU 伺服器 + InfiniBand/RoCE 交換 fabric │
└─────────────────────────────────────────────────┘
關鍵流程
- 硬體上架 & 帶外發現:通過 BMC/IPMI 自動發現物理節點,寫入 CMDB
- 網路預配:交換器埠配置 VLAN/PFC/ECN(RoCE 場景),IB 子網管理器(OpenSM)就緒
- PXE 網路引導:節點從 DHCP+TFTP 獲取引導映象
- OS 映象寫入:寫入預建置的 OS 映象(含 GPU 驅動、CUDA、NCCL 等預裝)
- 韌體刷寫:GPU VBIOS、NIC 韌體、BMC 韌體統一升級(部分廠商支援線上)
- 健康檢查 & Burn-in:GPU 視訊記憶體壓力測試、IB Link 檢查、NVLink 頻寬驗證
- 節點註冊入叢集:上報至 Slurm/K8s 排程器,進入 ready 狀態
行業估算:一個萬卡規模叢集從硬體上架到全部節點 ready,典型週期為 4–8 周(含佈線、除錯、Burn-in),裸金屬自動化可將節點級部署從數小時壓縮至 20–40 分鐘/節點 [行業估算,無單一來源]。
技術原理(深入機制)
PXE 引導機制
物理節點 ──[DHCP Discover]──> DHCP Server
│
<──[Offer: IP + TFTP地址]──
│
──[TFTP Get: pxelinux.0 / GRUB]──> TFTP Server
│
<──[載入核心 + initramfs]──
│
──[核心啟動 → 掛載 rootfs(來自 HTTP/NFS/本地盤)]
│
──[cloud-init / cloud-config 執行使用者資料指令碼]
├── 安裝驅動
├── 配置網路(RDMA / SR-IOV)
├── 掛載共享儲存
└── 註冊到排程器
IPMI / Redfish 帶外管理
- IPMI 2.0:傳統協議,通過 BMC 獨立網路介面提供電源控制、感測器讀取、KVM-over-IP
- Redfish (DMTF):RESTful API 替代方案,結構化 JSON,更適合大規模自動化;主流伺服器廠商(Dell iDRAC、HPE iLO、Inspur BMC)均已支援
Ironic(OpenStack 專案)核心流程
節點註冊 → 管理態(managed) → 檢查態(inspect)
→ 可用態(available) → 部署態(active)
↓
[清理階段(cleaning)] → 回到可用態
- 驅動適配層:每個廠商 BMC 有對應 driver(
ipmi,idrac,ilo,redfish等) - RAID 配置:可自動配置 RAID 級別(AI 訓練節點通常用 RAID-0 或直通以獲取最大 I/O 吞吐)
- 映象管理:使用 Glance 儲存 OS 映象,寫入節點本地盤
AI 特有的裸金屬考量
NCCL 環境調優(典型關鍵引數)
| 環境變數 | 作用 | 典型值(示例,非固定) |
|---|---|---|
NCCL_IB_DISABLE | 停用 IB(一般不設) | 0 |
NCCL_SOCKET_IFNAME | 指定通訊網絡卡 | ib0 |
NCCL_TOPO_FILE | 自定義拓撲檔案 | 路徑 |
NCCL_ALGO | 集合通訊演算法 | Ring,Tree |
NCCL_NET_GDR_LEVEL | GPUDirect RDMA 級別 | 視硬體而定 |
以上為定性參考,實際值因叢集規模、GPU 代際、IB 交換器型號差異極大,需逐叢集調優。
GPUDirect RDMA(GDR)
允許 GPU 視訊記憶體與 IB 網絡卡之間 DMA 直傳,繞過 CPU 和系統記憶體。裸金屬環境下的優勢在於:無需穿透 hypervisor 的 IOMMU 對映,端到端延遲更低。
技術演進史
| 時期 | 標誌事件 | 變化 |
|---|---|---|
| ~2000s | Cobbler/Kickstart 出現 | 裸金屬 = 手動裝機 + 指令碼輔助 |
| ~2012 | OpenStack Ironic 立項 | 裸金屬納入雲端管理,API 化 |
| ~2016 | Canonical MAAS 2.0 | ”Metal as a Service”,將裸金屬當雲端資源管理 |
| ~2018–2019 | 雲端廠商推出裸金屬例項 | AWS i3.metal → Oracle BM → Azure 裸金屬;企業開始”混合”使用 |
| ~2020–2022 | 大型模型訓練爆發 | GPU 叢集規模從百卡→千卡→萬卡,裸金屬成為標配 |
| ~2023–2025 | 萬卡叢集時代 | xAI Memphis(號稱 10 萬 H100)、Meta H100 叢集(據報道 24,576 張 H100 訓練 Llama 3.1 405B)均裸金屬部署;自動化工具鏈成熟度成為競爭壁壘 |
技術路線對比
| 維度 | 裸金屬部署 | VM 虛擬化 | 容器化(K8s) |
|---|---|---|---|
| GPU 效能損耗 | ~0% | 2–5%(含 vGPU 開銷)[行業估算] | <1%(device plugin 直通) |
| 隔離性 | 物理級(強) | VM 級(強) | 名稱空間級(中) |
| 多租戶密度 | 低(獨佔物理機) | 高 | 中–高 |
| 部署速度 | 分鐘級/節點 | 秒級 | 秒–分鐘級 |
| 彈性伸縮 | 差 | 優 | 良 |
| 網路 RDMA 支援 | 原生 | 需 SR-IOV passthrough | 需 SR-IOV + Multus CNI |
| 拓撲感知 | 精確 | 可能被抽象層遮蔽 | 需 device plugin 擴充套件 |
| 典型場景 | 萬卡預訓練 | 通用雲端 / 混合雲端 | 推論服務 / 小規模微調 |
| 代表工具 | Ironic, MAAS, Cobbler | vSphere, KVM/QEMU | K8s + GPU Operator |
上下游
上游(硬體與韌體)
├── GPU 伺服器(含 GPU、CPU、NVLink/NVSwitch、記憶體)
├── RDMA 網路(InfiniBand / RoCE NIC + 交換器)
├── 並行儲存(Lustre / WekaFS / GPFS 節點)
├── 帶外管理硬體(BMC 晶片)
└── 機櫃 & 供電(含液冷基礎設施)
中游(裸金屬部署軟體棧)
├── 帶外管理協議(IPMI / Redfish)
├── PXE/TFTP/DHCP 引導服務
├── 裸金屬編排器(Ironic / MAAS / 整合商自研平台)
├── OS 映象建置(Packer / 自定義指令碼)
├── GPU/IB 驅動自動化安裝
└── 健康檢查 & Burn-in 工具
下游(消費方)
├── AI 訓練排程器(Slurm / Kubernetes + Volcano)
├── 大型模型訓練架構(Megatron-LM / DeepSpeed / FSDP)
├── 智算中心運營平台(資源計費、故障自愈)
└── 推論平台(可選容器化,但訓練階段屬裸金屬)
關鍵指標
| 指標 | 含義 | 業界參考範圍 |
|---|---|---|
| 節點部署耗時 | 從上架到 Ready | 20–60 min/節點(自動化)[行業估算] |
| GPU Burn-in 通過率 | 首次點亮健康檢查通過 | >95%(成熟供應鏈)[行業估算] |
| 叢集就緒週期 | 萬卡叢集全量可用 | 4–8 周 [行業估算] |
| 節點故障率(MTBF) | GPU/記憶體/NIC 硬體故障間隔 | GPU 模組:數萬小時量級 [廠商未充分揭露具體值] |
| RDMA 網路無損丟包率 | PFC/ECN 配置正確性 | 目標 0(理想值),實際監控尾延遲 |
| NCCL AllReduce 頻寬利用率 | 實測 vs 理論峰值 | >85% 為優秀 [行業估算] |
供需與市場資料
需求側
- 全球 AI 訓練 GPU 叢集規模:據公開報道,2024 年已出現多家萬卡(H100 等效)叢集,包括 xAI、Meta、Microsoft、Google 等;單叢集最大規模據報已達 10 萬 GPU 量級(xAI Memphis,具體配置未完全公開)。
- 中國:據行業估算,2024 年國內已部署/在建智算中心的 AI 加速卡保有量在 數十萬至百萬張 量級(含國產卡),絕大部分採用裸金屬部署模式。
- 每節點裸金屬部署成本:軟體棧自建成本主要為人力(運維 SRE 團隊),Ironic/MAAS 開源免費但需要專業團隊維護;採購商業方案(如廠商智算中心整體交付)則打包在整體報價中,無法單獨拆分 [未充分揭露]。
供給側
| 玩家型別 | 代表 | 模式 |
|---|---|---|
| 雲端廠商 | AWS / Azure / GCP / 阿里雲端 / 華為雲端 | 裸金屬例項(按需/預留) |
| 智算中心整合商 | 浪潮 / 新華三 / 超聚變 / Dell / HPE | 硬體 + 裸金屬交付整體方案 |
| 開源社群 | OpenStack Ironic / Canonical MAAS | 免費軟體 + 社群支援 |
| AI infra 創業公司 | 部分公司提供 GPU 叢集運維平台 | SaaS / 私有化部署 |
代表公司與資本對映
| 公司 | 與裸金屬的關係 | 上市/融資狀態 |
|---|---|---|
| Dell Technologies | 全球領先 GPU 伺服器供應商,iDRAC 帶外管理,PowerEdge 系列廣泛用於裸金屬叢集 | NYSE: DELL |
| HPE | ProLiant + iLO,深度整合 Ironic | NYSE: HPE |
| 浪潮(Inspur) | 國內 AI 伺服器出貨量前列,自研 BMC | 深交所: 000977(浪潮資訊) |
| 超聚變(xFusion) | 原華為伺服器團隊,FusionServer 系列 | 未上市 |
| Canonical | MAAS(Metal as a Service)維護方 | 未上市 |
| CoreWeave | GPU 雲端服務商,據報大量裸金屬部署訓練叢集 | 已提交 IPO 檔案(截至 2025 年初) |
| Lambda Labs | GPU 雲端/叢集方案商 | 私有融資 |
| 超微(Supermicro) | 高密度 GPU 伺服器供應商 | NASDAQ: SMCI |
注意:上述公司多數不單獨揭露”裸金屬部署”營收,該環節巢狀在更大體量的伺服器/雲端/IaaS 業務中。
投資邏輯
核心看點
- “鏟子效應”確定性高:無論哪家大型模型公司勝出,訓練叢集都必須用裸金屬。賣鏟子(GPU 伺服器 + 部署交付)比賭模型更具確定性。
- 交付能力=競爭壁壘:萬卡叢集的裸金屬部署不是簡單的裝機——需要網路(IB fabric)、儲存(並行 FS)、驅動調優、拓撲最佳化的全棧能力。具備這種交付能力的整合商和雲端廠商擁有護城河。
- 運維粘性強:叢集一旦部署,運維期長達 3–5 年,期間故障自愈、韌體升級、擴容等需求持續產生服務營收。
風險點
- 資本支出波動:GPU 採購週期受 AI 投資熱度影響,如果大型模型訓練 ROI 下降,叢集擴建可能放緩。
- 技術替代風險:長期看,如果虛擬化/容器效能損耗趨近於零(如新一代 SR-IOV、DPU 解除安裝),裸金屬的效能優勢可能縮小,但短期內(2–3 年)不會改變。
- 地緣因素:GPU 出口管制可能影響國內智算中心的擴建節奏和硬體選型。
常見誤讀糾偏
誤讀 1:“裸金屬 = 沒有軟體管理”
糾偏:裸金屬不等於”裸”。它有完整的軟體棧——PXE 引導、IPMI/Redfish 帶外管理、OS 映象自動化寫入、驅動安裝、健康檢查。“裸”指的是沒有 hypervisor 虛擬化層,而非沒有管理軟體。實際上,大型裸金屬叢集的軟體複雜度不亞於一個私有雲端。
誤讀 2:“容器化可以完全替代裸金屬部署”
糾偏:對於推論和微調場景,容器(K8s + GPU Operator)是合理選擇。但對於 千卡以上規模的預訓練,裸金屬仍是主流,原因有三:① InfiniBand 延遲要求嚴格,容器網路棧引入額外開銷;② 拓撲感知在容器中實現複雜;③ Slurm 在 HPC/訓練領域的生態成熟度遠超 K8s 訓練排程外掛。兩者不是替代關係,而是互補——裸金屬打底 + 容器化封裝應用。
誤讀 3:“裸金屬部署技術含量低,就是裝機”
糾偏:傳統資料中心的裸金屬裝機確實門檻不高。但 AI 叢集級裸金屬部署 涉及:IB 子網管理、GPUDirect RDMA 調優、NVLink 拓撲對映、並行儲存掛載與 POSIX 鎖最佳化、GPU 韌體相容性矩陣管理等。萬卡叢集的一次部署調試周期可達數週,是真正的系統工程。能做好這件事的團隊在全球範圍內都是稀缺資源。
學習路徑
入門(1–2 周)
- 瞭解 PXE 啟動原理:搜尋 “PXE boot flow explained”
- IPMI 基礎:閱讀 DMTF IPMI 2.0 白皮書概要
- 動手:在實驗室用
dnsmasq+tftp-hpa搭建一個最小 PXE 服務
進階(1–2 月)
- 閱讀 OpenStack Ironic 官方文件,理解節點生命週期
- 學習 Redfish API(DMTF 官網有互動式模擬器)
- 部署 MAAS 並管理 5–10 臺物理機
專家(持續)
- 研究 NCCL 拓撲檢測機制:閱讀 NVIDIA NCCL 文件中的 “Topology Detection” 章節
- 實操 IB 子網管理:
OpenSM配置、PFC/ECN 調優 - 關注 NVIDIA DGX SuperPOD 部署指南(NVIDIA 提供公開的最佳實踐文件)
- 閱讀 Meta、xAI 等公司的工程部落格(如有公開分享)
一句話總結
裸金屬部署是萬卡 AI 叢集的”地基工程”——不性感,但沒有它,一切上層的分散式訓練架構都是空中樓閣。
延伸閱讀與來源
- OpenStack Ironic 官方文件:https://docs.openstack.org/ironic/latest/
- Canonical MAAS 文件:https://maas.io/docs
- DMTF Redfish 規範:https://www.dmtf.org/standards/redfish
- NVIDIA NCCL 文件(含環境變數與拓撲說明):https://docs.nvidia.com/deeplearning/nccl/
- NVIDIA DGX SuperPOD 部署指南(NVIDIA 官網公開資料)
- Meta “Building Meta’s GenAI Infrastructure”(2024 年公開分享,含叢集部署實踐概述)
- InfiniBand Trade Association:https://www.infinibandta.org/(RDMA 與 IB 規範)
宣告:本文中標註 [行業估算] 的數字為基於公開工程經驗的定性估計,非精確統計資料;標註 [未充分揭露] 的資訊表示公開資料不足以給出確切數值。