網路層 開放閱讀

裸金屬部署

Bare-metal Provisioning

概念 ID
bare-metal-provisioning
更新時間
2026-05-29
來源數量
待補

裸金屬部署(Bare-metal Provisioning)

3 秒看懂

一句話:跳過虛擬機器/容器抽象層,將作業系統和 AI 訓練架構直接裝到物理 GPU 伺服器上——讓每一顆電晶體都為大型模型幹活。

3 分鐘產業解釋

它解決什麼問題?

大型模型訓練對算力的”壓榨”近乎極致。一次 GPT-4 量級的訓練,數千張 GPU 連續執行數月,即使 2–3% 的效能損失也意味著數百萬美元的額外成本。裸金屬部署就是把這 2–3% 搶回來的核心手段:

維度裸金屬虛擬化(VM)
虛擬化開銷零(無 hypervisor 層)有(CPU 上下文切換、I/O 模擬)
GPU 訪問模式原生 PCIe/NVLink 直通需 SR-IOV / vGPU 中間層
網路延遲(InfiniBand)核心旁路原生效需額外配置 passthrough
多租戶隔離弱(物理級隔離)強(VM 級隔離)
彈性伸縮速度慢(分鐘級,需重灌 OS)快(秒級建立 VM)

AI 訓練場景幾乎是裸金屬的”必選項”;推論服務則因彈性需求更強,常在容器/VM 中執行。

誰在用?

  • 超大規模預訓練:OpenAI、Anthropic、xAI 等萬卡叢集訓練,幾乎全部裸金屬
  • 雲端廠商 AI 例項:AWS 的 p4d.metalg5.metal(裸金屬例項),Azure 的裸金屬基礎設施(如 NDv2 系列),Google Cloud 的某些特定裸金屬型號
  • 主權 AI / 私有化部署:國內運營商、科研機構自建智算中心,主流方案即裸金屬 + Slurm 排程

15 分鐘專家深入

為什麼 AI 叢集偏愛裸金屬?—— 三個技術剛性約束

1. GPU 通訊拓撲敏感性

大規模訓練依賴節點內 NVLink/NVSwitch 和節點間 InfiniBand(IB)形成高頻寬低延遲的通訊 fabric。張量並行(TP)要求 GPU 間 < 1μs 的延遲抖動,任何虛擬化層的中斷注入都可能導致 NCCL AllReduce 尾延遲飆升,觸發超時重傳。

2. 拓撲感知排程(Topology-aware Scheduling)

訓練架構(Megatron-LM、DeepSpeed、FSDP)需要精確知道物理拓撲——哪 8 張卡在同一 NVSwitch 域、哪兩個節點通過同一 Leaf Switch 相連——以便把通訊密集的並行維度對映到物理近鄰。VM 層會模糊拓撲檢視。

3. 記憶體頻寬零浪費

HBM 的頻寬是訓練吞吐的命脈。hypervisor 對記憶體頁的二次對映(EPT/NPT)會引入 TLB miss 開銷,對 HBM 密集的 Attention/FFN 計算產生非線性影響。

典型裸金屬部署的技術棧

┌─────────────────────────────────────────────────┐
│  排程層:Slurm / Kubernetes (配 bare-metal CAPI)  │
├─────────────────────────────────────────────────┤
│  編排層:Ironic (OpenStack) / MAAS / Cobbler      │
│         ┌─────────────┐  ┌──────────────────┐    │
│         │ PXE/TFTP 引導│  │ IPMI/BMC 帶外管理│    │
│         └─────────────┘  └──────────────────┘    │
├─────────────────────────────────────────────────┤
│  作業系統:Ubuntu / Rocky Linux / 定製映象         │
├─────────────────────────────────────────────────┤
│  驅動 & 執行時:                                   │
│  GPU Driver → CUDA → cuDNN → NCCL → OFED(IB驅動) │
├─────────────────────────────────────────────────┤
│  儲存:Lustre / GPFS / WekaFS 並行檔案系統          │
├─────────────────────────────────────────────────┤
│  硬體:GPU 伺服器 + InfiniBand/RoCE 交換 fabric     │
└─────────────────────────────────────────────────┘

關鍵流程

  1. 硬體上架 & 帶外發現:通過 BMC/IPMI 自動發現物理節點,寫入 CMDB
  2. 網路預配:交換器埠配置 VLAN/PFC/ECN(RoCE 場景),IB 子網管理器(OpenSM)就緒
  3. PXE 網路引導:節點從 DHCP+TFTP 獲取引導映象
  4. OS 映象寫入:寫入預建置的 OS 映象(含 GPU 驅動、CUDA、NCCL 等預裝)
  5. 韌體刷寫:GPU VBIOS、NIC 韌體、BMC 韌體統一升級(部分廠商支援線上)
  6. 健康檢查 & Burn-in:GPU 視訊記憶體壓力測試、IB Link 檢查、NVLink 頻寬驗證
  7. 節點註冊入叢集:上報至 Slurm/K8s 排程器,進入 ready 狀態

行業估算:一個萬卡規模叢集從硬體上架到全部節點 ready,典型週期為 4–8 周(含佈線、除錯、Burn-in),裸金屬自動化可將節點級部署從數小時壓縮至 20–40 分鐘/節點 [行業估算,無單一來源]。


技術原理(深入機制)

PXE 引導機制

物理節點 ──[DHCP Discover]──> DHCP Server

         <──[Offer: IP + TFTP地址]──

         ──[TFTP Get: pxelinux.0 / GRUB]──> TFTP Server

         <──[載入核心 + initramfs]──

         ──[核心啟動 → 掛載 rootfs(來自 HTTP/NFS/本地盤)]

         ──[cloud-init / cloud-config 執行使用者資料指令碼]
              ├── 安裝驅動
              ├── 配置網路(RDMA / SR-IOV)
              ├── 掛載共享儲存
              └── 註冊到排程器

IPMI / Redfish 帶外管理

  • IPMI 2.0:傳統協議,通過 BMC 獨立網路介面提供電源控制、感測器讀取、KVM-over-IP
  • Redfish (DMTF):RESTful API 替代方案,結構化 JSON,更適合大規模自動化;主流伺服器廠商(Dell iDRAC、HPE iLO、Inspur BMC)均已支援

Ironic(OpenStack 專案)核心流程

節點註冊 → 管理態(managed) → 檢查態(inspect)
   → 可用態(available) → 部署態(active)

   [清理階段(cleaning)] → 回到可用態
  • 驅動適配層:每個廠商 BMC 有對應 driver(ipmi, idrac, ilo, redfish 等)
  • RAID 配置:可自動配置 RAID 級別(AI 訓練節點通常用 RAID-0 或直通以獲取最大 I/O 吞吐)
  • 映象管理:使用 Glance 儲存 OS 映象,寫入節點本地盤

AI 特有的裸金屬考量

NCCL 環境調優(典型關鍵引數)

環境變數作用典型值(示例,非固定)
NCCL_IB_DISABLE停用 IB(一般不設)0
NCCL_SOCKET_IFNAME指定通訊網絡卡ib0
NCCL_TOPO_FILE自定義拓撲檔案路徑
NCCL_ALGO集合通訊演算法Ring,Tree
NCCL_NET_GDR_LEVELGPUDirect RDMA 級別視硬體而定

以上為定性參考,實際值因叢集規模、GPU 代際、IB 交換器型號差異極大,需逐叢集調優。

GPUDirect RDMA(GDR)

允許 GPU 視訊記憶體與 IB 網絡卡之間 DMA 直傳,繞過 CPU 和系統記憶體。裸金屬環境下的優勢在於:無需穿透 hypervisor 的 IOMMU 對映,端到端延遲更低。


技術演進史

時期標誌事件變化
~2000sCobbler/Kickstart 出現裸金屬 = 手動裝機 + 指令碼輔助
~2012OpenStack Ironic 立項裸金屬納入雲端管理,API 化
~2016Canonical MAAS 2.0”Metal as a Service”,將裸金屬當雲端資源管理
~2018–2019雲端廠商推出裸金屬例項AWS i3.metal → Oracle BM → Azure 裸金屬;企業開始”混合”使用
~2020–2022大型模型訓練爆發GPU 叢集規模從百卡→千卡→萬卡,裸金屬成為標配
~2023–2025萬卡叢集時代xAI Memphis(號稱 10 萬 H100)、Meta H100 叢集(據報道 24,576 張 H100 訓練 Llama 3.1 405B)均裸金屬部署;自動化工具鏈成熟度成為競爭壁壘

技術路線對比

維度裸金屬部署VM 虛擬化容器化(K8s)
GPU 效能損耗~0%2–5%(含 vGPU 開銷)[行業估算]<1%(device plugin 直通)
隔離性物理級(強)VM 級(強)名稱空間級(中)
多租戶密度低(獨佔物理機)中–高
部署速度分鐘級/節點秒級秒–分鐘級
彈性伸縮
網路 RDMA 支援原生需 SR-IOV passthrough需 SR-IOV + Multus CNI
拓撲感知精確可能被抽象層遮蔽需 device plugin 擴充套件
典型場景萬卡預訓練通用雲端 / 混合雲端推論服務 / 小規模微調
代表工具Ironic, MAAS, CobblervSphere, KVM/QEMUK8s + GPU Operator

上下游

上游(硬體與韌體)
├── GPU 伺服器(含 GPU、CPU、NVLink/NVSwitch、記憶體)
├── RDMA 網路(InfiniBand / RoCE NIC + 交換器)
├── 並行儲存(Lustre / WekaFS / GPFS 節點)
├── 帶外管理硬體(BMC 晶片)
└── 機櫃 & 供電(含液冷基礎設施)

中游(裸金屬部署軟體棧)
├── 帶外管理協議(IPMI / Redfish)
├── PXE/TFTP/DHCP 引導服務
├── 裸金屬編排器(Ironic / MAAS / 整合商自研平台)
├── OS 映象建置(Packer / 自定義指令碼)
├── GPU/IB 驅動自動化安裝
└── 健康檢查 & Burn-in 工具

下游(消費方)
├── AI 訓練排程器(Slurm / Kubernetes + Volcano)
├── 大型模型訓練架構(Megatron-LM / DeepSpeed / FSDP)
├── 智算中心運營平台(資源計費、故障自愈)
└── 推論平台(可選容器化,但訓練階段屬裸金屬)

關鍵指標

指標含義業界參考範圍
節點部署耗時從上架到 Ready20–60 min/節點(自動化)[行業估算]
GPU Burn-in 通過率首次點亮健康檢查通過>95%(成熟供應鏈)[行業估算]
叢集就緒週期萬卡叢集全量可用4–8 周 [行業估算]
節點故障率(MTBF)GPU/記憶體/NIC 硬體故障間隔GPU 模組:數萬小時量級 [廠商未充分揭露具體值]
RDMA 網路無損丟包率PFC/ECN 配置正確性目標 0(理想值),實際監控尾延遲
NCCL AllReduce 頻寬利用率實測 vs 理論峰值>85% 為優秀 [行業估算]

供需與市場資料

需求側

  • 全球 AI 訓練 GPU 叢集規模:據公開報道,2024 年已出現多家萬卡(H100 等效)叢集,包括 xAI、Meta、Microsoft、Google 等;單叢集最大規模據報已達 10 萬 GPU 量級(xAI Memphis,具體配置未完全公開)。
  • 中國:據行業估算,2024 年國內已部署/在建智算中心的 AI 加速卡保有量在 數十萬至百萬張 量級(含國產卡),絕大部分採用裸金屬部署模式。
  • 每節點裸金屬部署成本:軟體棧自建成本主要為人力(運維 SRE 團隊),Ironic/MAAS 開源免費但需要專業團隊維護;採購商業方案(如廠商智算中心整體交付)則打包在整體報價中,無法單獨拆分 [未充分揭露]。

供給側

玩家型別代表模式
雲端廠商AWS / Azure / GCP / 阿里雲端 / 華為雲端裸金屬例項(按需/預留)
智算中心整合商浪潮 / 新華三 / 超聚變 / Dell / HPE硬體 + 裸金屬交付整體方案
開源社群OpenStack Ironic / Canonical MAAS免費軟體 + 社群支援
AI infra 創業公司部分公司提供 GPU 叢集運維平台SaaS / 私有化部署

代表公司與資本對映

公司與裸金屬的關係上市/融資狀態
Dell Technologies全球領先 GPU 伺服器供應商,iDRAC 帶外管理,PowerEdge 系列廣泛用於裸金屬叢集NYSE: DELL
HPEProLiant + iLO,深度整合 IronicNYSE: HPE
浪潮(Inspur)國內 AI 伺服器出貨量前列,自研 BMC深交所: 000977(浪潮資訊)
超聚變(xFusion)原華為伺服器團隊,FusionServer 系列未上市
CanonicalMAAS(Metal as a Service)維護方未上市
CoreWeaveGPU 雲端服務商,據報大量裸金屬部署訓練叢集已提交 IPO 檔案(截至 2025 年初)
Lambda LabsGPU 雲端/叢集方案商私有融資
超微(Supermicro)高密度 GPU 伺服器供應商NASDAQ: SMCI

注意:上述公司多數不單獨揭露”裸金屬部署”營收,該環節巢狀在更大體量的伺服器/雲端/IaaS 業務中。


投資邏輯

核心看點

  1. “鏟子效應”確定性高:無論哪家大型模型公司勝出,訓練叢集都必須用裸金屬。賣鏟子(GPU 伺服器 + 部署交付)比賭模型更具確定性。
  2. 交付能力=競爭壁壘:萬卡叢集的裸金屬部署不是簡單的裝機——需要網路(IB fabric)、儲存(並行 FS)、驅動調優、拓撲最佳化的全棧能力。具備這種交付能力的整合商和雲端廠商擁有護城河。
  3. 運維粘性強:叢集一旦部署,運維期長達 3–5 年,期間故障自愈、韌體升級、擴容等需求持續產生服務營收。

風險點

  • 資本支出波動:GPU 採購週期受 AI 投資熱度影響,如果大型模型訓練 ROI 下降,叢集擴建可能放緩。
  • 技術替代風險:長期看,如果虛擬化/容器效能損耗趨近於零(如新一代 SR-IOV、DPU 解除安裝),裸金屬的效能優勢可能縮小,但短期內(2–3 年)不會改變。
  • 地緣因素:GPU 出口管制可能影響國內智算中心的擴建節奏和硬體選型。

常見誤讀糾偏

誤讀 1:“裸金屬 = 沒有軟體管理”

糾偏:裸金屬不等於”裸”。它有完整的軟體棧——PXE 引導、IPMI/Redfish 帶外管理、OS 映象自動化寫入、驅動安裝、健康檢查。“裸”指的是沒有 hypervisor 虛擬化層,而非沒有管理軟體。實際上,大型裸金屬叢集的軟體複雜度不亞於一個私有雲端。

誤讀 2:“容器化可以完全替代裸金屬部署”

糾偏:對於推論和微調場景,容器(K8s + GPU Operator)是合理選擇。但對於 千卡以上規模的預訓練,裸金屬仍是主流,原因有三:① InfiniBand 延遲要求嚴格,容器網路棧引入額外開銷;② 拓撲感知在容器中實現複雜;③ Slurm 在 HPC/訓練領域的生態成熟度遠超 K8s 訓練排程外掛。兩者不是替代關係,而是互補——裸金屬打底 + 容器化封裝應用。

誤讀 3:“裸金屬部署技術含量低,就是裝機”

糾偏:傳統資料中心的裸金屬裝機確實門檻不高。但 AI 叢集級裸金屬部署 涉及:IB 子網管理、GPUDirect RDMA 調優、NVLink 拓撲對映、並行儲存掛載與 POSIX 鎖最佳化、GPU 韌體相容性矩陣管理等。萬卡叢集的一次部署調試周期可達數週,是真正的系統工程。能做好這件事的團隊在全球範圍內都是稀缺資源。


學習路徑

入門(1–2 周)

  • 瞭解 PXE 啟動原理:搜尋 “PXE boot flow explained”
  • IPMI 基礎:閱讀 DMTF IPMI 2.0 白皮書概要
  • 動手:在實驗室用 dnsmasq + tftp-hpa 搭建一個最小 PXE 服務

進階(1–2 月)

  • 閱讀 OpenStack Ironic 官方文件,理解節點生命週期
  • 學習 Redfish API(DMTF 官網有互動式模擬器)
  • 部署 MAAS 並管理 5–10 臺物理機

專家(持續)

  • 研究 NCCL 拓撲檢測機制:閱讀 NVIDIA NCCL 文件中的 “Topology Detection” 章節
  • 實操 IB 子網管理:OpenSM 配置、PFC/ECN 調優
  • 關注 NVIDIA DGX SuperPOD 部署指南(NVIDIA 提供公開的最佳實踐文件)
  • 閱讀 Meta、xAI 等公司的工程部落格(如有公開分享)

一句話總結

裸金屬部署是萬卡 AI 叢集的”地基工程”——不性感,但沒有它,一切上層的分散式訓練架構都是空中樓閣。


延伸閱讀與來源

  1. OpenStack Ironic 官方文件https://docs.openstack.org/ironic/latest/
  2. Canonical MAAS 文件https://maas.io/docs
  3. DMTF Redfish 規範https://www.dmtf.org/standards/redfish
  4. NVIDIA NCCL 文件(含環境變數與拓撲說明):https://docs.nvidia.com/deeplearning/nccl/
  5. NVIDIA DGX SuperPOD 部署指南(NVIDIA 官網公開資料)
  6. Meta “Building Meta’s GenAI Infrastructure”(2024 年公開分享,含叢集部署實踐概述)
  7. InfiniBand Trade Associationhttps://www.infinibandta.org/(RDMA 與 IB 規範)

宣告:本文中標註 [行業估算] 的數字為基於公開工程經驗的定性估計,非精確統計資料;標註 [未充分揭露] 的資訊表示公開資料不足以給出確切數值。

source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型