网络层 开放阅读

裸金属部署

Bare-metal Provisioning

概念 ID
bare-metal-provisioning
更新时间
2026-05-29
来源数量
待补

裸金属部署(Bare-metal Provisioning)

3 秒看懂

一句话:跳过虚拟机/容器抽象层,将操作系统和 AI 训练框架直接装到物理 GPU 服务器上——让每一颗晶体管都为大模型干活。

3 分钟产业解释

它解决什么问题?

大模型训练对算力的”压榨”近乎极致。一次 GPT-4 量级的训练,数千张 GPU 连续运行数月,即使 2–3% 的性能损失也意味着数百万美元的额外成本。裸金属部署就是把这 2–3% 抢回来的核心手段:

维度裸金属虚拟化(VM)
虚拟化开销零(无 hypervisor 层)有(CPU 上下文切换、I/O 模拟)
GPU 访问模式原生 PCIe/NVLink 直通需 SR-IOV / vGPU 中间层
网络延迟(InfiniBand)内核旁路原生效需额外配置 passthrough
多租户隔离弱(物理级隔离)强(VM 级隔离)
弹性伸缩速度慢(分钟级,需重装 OS)快(秒级创建 VM)

AI 训练场景几乎是裸金属的”必选项”;推理服务则因弹性需求更强,常在容器/VM 中运行。

谁在用?

  • 超大规模预训练:OpenAI、Anthropic、xAI 等万卡集群训练,几乎全部裸金属
  • 云厂商 AI 实例:AWS 的 p4d.metalg5.metal(裸金属实例),Azure 的裸金属基础设施(如 NDv2 系列),Google Cloud 的某些特定裸金属型号
  • 主权 AI / 私有化部署:国内运营商、科研机构自建智算中心,主流方案即裸金属 + Slurm 调度

15 分钟专家深入

为什么 AI 集群偏爱裸金属?—— 三个技术刚性约束

1. GPU 通信拓扑敏感性

大规模训练依赖节点内 NVLink/NVSwitch 和节点间 InfiniBand(IB)形成高带宽低延迟的通信 fabric。张量并行(TP)要求 GPU 间 < 1μs 的延迟抖动,任何虚拟化层的中断注入都可能导致 NCCL AllReduce 尾延迟飙升,触发超时重传。

2. 拓扑感知调度(Topology-aware Scheduling)

训练框架(Megatron-LM、DeepSpeed、FSDP)需要精确知道物理拓扑——哪 8 张卡在同一 NVSwitch 域、哪两个节点通过同一 Leaf Switch 相连——以便把通信密集的并行维度映射到物理近邻。VM 层会模糊拓扑视图。

3. 内存带宽零浪费

HBM 的带宽是训练吞吐的命脉。hypervisor 对内存页的二次映射(EPT/NPT)会引入 TLB miss 开销,对 HBM 密集的 Attention/FFN 计算产生非线性影响。

典型裸金属部署的技术栈

┌─────────────────────────────────────────────────┐
│  调度层:Slurm / Kubernetes (配 bare-metal CAPI)  │
├─────────────────────────────────────────────────┤
│  编排层:Ironic (OpenStack) / MAAS / Cobbler      │
│         ┌─────────────┐  ┌──────────────────┐    │
│         │ PXE/TFTP 引导│  │ IPMI/BMC 带外管理│    │
│         └─────────────┘  └──────────────────┘    │
├─────────────────────────────────────────────────┤
│  操作系统:Ubuntu / Rocky Linux / 定制镜像         │
├─────────────────────────────────────────────────┤
│  驱动 & 运行时:                                   │
│  GPU Driver → CUDA → cuDNN → NCCL → OFED(IB驱动) │
├─────────────────────────────────────────────────┤
│  存储:Lustre / GPFS / WekaFS 并行文件系统          │
├─────────────────────────────────────────────────┤
│  硬件:GPU 服务器 + InfiniBand/RoCE 交换 fabric     │
└─────────────────────────────────────────────────┘

关键流程

  1. 硬件上架 & 带外发现:通过 BMC/IPMI 自动发现物理节点,写入 CMDB
  2. 网络预配:交换机端口配置 VLAN/PFC/ECN(RoCE 场景),IB 子网管理器(OpenSM)就绪
  3. PXE 网络引导:节点从 DHCP+TFTP 获取引导镜像
  4. OS 镜像写入:写入预构建的 OS 镜像(含 GPU 驱动、CUDA、NCCL 等预装)
  5. 固件刷写:GPU VBIOS、NIC 固件、BMC 固件统一升级(部分厂商支持在线)
  6. 健康检查 & Burn-in:GPU 显存压力测试、IB Link 检查、NVLink 带宽验证
  7. 节点注册入集群:上报至 Slurm/K8s 调度器,进入 ready 状态

行业估算:一个万卡规模集群从硬件上架到全部节点 ready,典型周期为 4–8 周(含布线、调试、Burn-in),裸金属自动化可将节点级部署从数小时压缩至 20–40 分钟/节点 [行业估算,无单一来源]。


技术原理(深入机制)

PXE 引导机制

物理节点 ──[DHCP Discover]──> DHCP Server
                                 │
         <──[Offer: IP + TFTP地址]──
         │
         ──[TFTP Get: pxelinux.0 / GRUB]──> TFTP Server
         │
         <──[加载内核 + initramfs]──
         │
         ──[内核启动 → 挂载 rootfs(来自 HTTP/NFS/本地盘)]
         │
         ──[cloud-init / cloud-config 执行用户数据脚本]
              ├── 安装驱动
              ├── 配置网络(RDMA / SR-IOV)
              ├── 挂载共享存储
              └── 注册到调度器

IPMI / Redfish 带外管理

  • IPMI 2.0:传统协议,通过 BMC 独立网络接口提供电源控制、传感器读取、KVM-over-IP
  • Redfish (DMTF):RESTful API 替代方案,结构化 JSON,更适合大规模自动化;主流服务器厂商(Dell iDRAC、HPE iLO、Inspur BMC)均已支持

Ironic(OpenStack 项目)核心流程

节点注册 → 管理态(managed) → 检查态(inspect)
   → 可用态(available) → 部署态(active)
       ↓
   [清理阶段(cleaning)] → 回到可用态
  • 驱动适配层:每个厂商 BMC 有对应 driver(ipmi, idrac, ilo, redfish 等)
  • RAID 配置:可自动配置 RAID 级别(AI 训练节点通常用 RAID-0 或直通以获取最大 I/O 吞吐)
  • 镜像管理:使用 Glance 存储 OS 镜像,写入节点本地盘

AI 特有的裸金属考量

NCCL 环境调优(典型关键参数)

环境变量作用典型值(示例,非固定)
NCCL_IB_DISABLE禁用 IB(一般不设)0
NCCL_SOCKET_IFNAME指定通信网卡ib0
NCCL_TOPO_FILE自定义拓扑文件路径
NCCL_ALGO集合通信算法Ring,Tree
NCCL_NET_GDR_LEVELGPUDirect RDMA 级别视硬件而定

以上为定性参考,实际值因集群规模、GPU 代际、IB 交换机型号差异极大,需逐集群调优。

GPUDirect RDMA(GDR)

允许 GPU 显存与 IB 网卡之间 DMA 直传,绕过 CPU 和系统内存。裸金属环境下的优势在于:无需穿透 hypervisor 的 IOMMU 映射,端到端延迟更低。


技术演进史

时期标志事件变化
~2000sCobbler/Kickstart 出现裸金属 = 手动装机 + 脚本辅助
~2012OpenStack Ironic 立项裸金属纳入云管理,API 化
~2016Canonical MAAS 2.0”Metal as a Service”,将裸金属当云资源管理
~2018–2019云厂商推出裸金属实例AWS i3.metal → Oracle BM → Azure 裸金属;企业开始”混合”使用
~2020–2022大模型训练爆发GPU 集群规模从百卡→千卡→万卡,裸金属成为标配
~2023–2025万卡集群时代xAI Memphis(号称 10 万 H100)、Meta H100 集群(据报道 24,576 张 H100 训练 Llama 3.1 405B)均裸金属部署;自动化工具链成熟度成为竞争壁垒

技术路线对比

维度裸金属部署VM 虚拟化容器化(K8s)
GPU 性能损耗~0%2–5%(含 vGPU 开销)[行业估算]<1%(device plugin 直通)
隔离性物理级(强)VM 级(强)命名空间级(中)
多租户密度低(独占物理机)中–高
部署速度分钟级/节点秒级秒–分钟级
弹性伸缩
网络 RDMA 支持原生需 SR-IOV passthrough需 SR-IOV + Multus CNI
拓扑感知精确可能被抽象层遮蔽需 device plugin 扩展
典型场景万卡预训练通用云 / 混合云推理服务 / 小规模微调
代表工具Ironic, MAAS, CobblervSphere, KVM/QEMUK8s + GPU Operator

上下游

上游(硬件与固件)
├── GPU 服务器(含 GPU、CPU、NVLink/NVSwitch、内存)
├── RDMA 网络(InfiniBand / RoCE NIC + 交换机)
├── 并行存储(Lustre / WekaFS / GPFS 节点)
├── 带外管理硬件(BMC 芯片)
└── 机柜 & 供电(含液冷基础设施)

中游(裸金属部署软件栈)
├── 带外管理协议(IPMI / Redfish)
├── PXE/TFTP/DHCP 引导服务
├── 裸金属编排器(Ironic / MAAS / 集成商自研平台)
├── OS 镜像构建(Packer / 自定义脚本)
├── GPU/IB 驱动自动化安装
└── 健康检查 & Burn-in 工具

下游(消费方)
├── AI 训练调度器(Slurm / Kubernetes + Volcano)
├── 大模型训练框架(Megatron-LM / DeepSpeed / FSDP)
├── 智算中心运营平台(资源计费、故障自愈)
└── 推理平台(可选容器化,但训练阶段属裸金属)

关键指标

指标含义业界参考范围
节点部署耗时从上架到 Ready20–60 min/节点(自动化)[行业估算]
GPU Burn-in 通过率首次点亮健康检查通过>95%(成熟供应链)[行业估算]
集群就绪周期万卡集群全量可用4–8 周 [行业估算]
节点故障率(MTBF)GPU/内存/NIC 硬件故障间隔GPU 模块:数万小时量级 [厂商未充分披露具体值]
RDMA 网络无损丢包率PFC/ECN 配置正确性目标 0(理想值),实际监控尾延迟
NCCL AllReduce 带宽利用率实测 vs 理论峰值>85% 为优秀 [行业估算]

供需与市场数据

需求侧

  • 全球 AI 训练 GPU 集群规模:据公开报道,2024 年已出现多家万卡(H100 等效)集群,包括 xAI、Meta、Microsoft、Google 等;单集群最大规模据报已达 10 万 GPU 量级(xAI Memphis,具体配置未完全公开)。
  • 中国:据行业估算,2024 年国内已部署/在建智算中心的 AI 加速卡保有量在 数十万至百万张 量级(含国产卡),绝大部分采用裸金属部署模式。
  • 每节点裸金属部署成本:软件栈自建成本主要为人力(运维 SRE 团队),Ironic/MAAS 开源免费但需要专业团队维护;采购商业方案(如厂商智算中心整体交付)则打包在整体报价中,无法单独拆分 [未充分披露]。

供给侧

玩家类型代表模式
云厂商AWS / Azure / GCP / 阿里云 / 华为云裸金属实例(按需/预留)
智算中心集成商浪潮 / 新华三 / 超聚变 / Dell / HPE硬件 + 裸金属交付整体方案
开源社区OpenStack Ironic / Canonical MAAS免费软件 + 社区支持
AI infra 创业公司部分公司提供 GPU 集群运维平台SaaS / 私有化部署

代表公司与资本映射

公司与裸金属的关系上市/融资状态
Dell Technologies全球领先 GPU 服务器供应商,iDRAC 带外管理,PowerEdge 系列广泛用于裸金属集群NYSE: DELL
HPEProLiant + iLO,深度集成 IronicNYSE: HPE
浪潮(Inspur)国内 AI 服务器出货量前列,自研 BMC深交所: 000977(浪潮信息)
超聚变(xFusion)原华为服务器团队,FusionServer 系列未上市
CanonicalMAAS(Metal as a Service)维护方未上市
CoreWeaveGPU 云服务商,据报大量裸金属部署训练集群已提交 IPO 文件(截至 2025 年初)
Lambda LabsGPU 云/集群方案商私有融资
超微(Supermicro)高密度 GPU 服务器供应商NASDAQ: SMCI

注意:上述公司多数不单独披露”裸金属部署”收入,该环节嵌套在更大体量的服务器/云/IaaS 业务中。


投资逻辑

核心看点

  1. “铲子效应”确定性高:无论哪家大模型公司胜出,训练集群都必须用裸金属。卖铲子(GPU 服务器 + 部署交付)比赌模型更具确定性。
  2. 交付能力=竞争壁垒:万卡集群的裸金属部署不是简单的装机——需要网络(IB fabric)、存储(并行 FS)、驱动调优、拓扑优化的全栈能力。具备这种交付能力的集成商和云厂商拥有护城河。
  3. 运维粘性强:集群一旦部署,运维期长达 3–5 年,期间故障自愈、固件升级、扩容等需求持续产生服务收入。

风险点

  • 资本开支波动:GPU 采购周期受 AI 投资热度影响,如果大模型训练 ROI 下降,集群扩建可能放缓。
  • 技术替代风险:长期看,如果虚拟化/容器性能损耗趋近于零(如新一代 SR-IOV、DPU 卸载),裸金属的性能优势可能缩小,但短期内(2–3 年)不会改变。
  • 地缘因素:GPU 出口管制可能影响国内智算中心的扩建节奏和硬件选型。

常见误读纠偏

误读 1:“裸金属 = 没有软件管理”

纠偏:裸金属不等于”裸”。它有完整的软件栈——PXE 引导、IPMI/Redfish 带外管理、OS 镜像自动化写入、驱动安装、健康检查。“裸”指的是没有 hypervisor 虚拟化层,而非没有管理软件。实际上,大型裸金属集群的软件复杂度不亚于一个私有云。

误读 2:“容器化可以完全替代裸金属部署”

纠偏:对于推理和微调场景,容器(K8s + GPU Operator)是合理选择。但对于 千卡以上规模的预训练,裸金属仍是主流,原因有三:① InfiniBand 延迟要求严格,容器网络栈引入额外开销;② 拓扑感知在容器中实现复杂;③ Slurm 在 HPC/训练领域的生态成熟度远超 K8s 训练调度插件。两者不是替代关系,而是互补——裸金属打底 + 容器化封装应用。

误读 3:“裸金属部署技术含量低,就是装机”

纠偏:传统数据中心的裸金属装机确实门槛不高。但 AI 集群级裸金属部署 涉及:IB 子网管理、GPUDirect RDMA 调优、NVLink 拓扑映射、并行存储挂载与 POSIX 锁优化、GPU 固件兼容性矩阵管理等。万卡集群的一次部署调试周期可达数周,是真正的系统工程。能做好这件事的团队在全球范围内都是稀缺资源。


学习路径

入门(1–2 周)

  • 了解 PXE 启动原理:搜索 “PXE boot flow explained”
  • IPMI 基础:阅读 DMTF IPMI 2.0 白皮书概要
  • 动手:在实验室用 dnsmasq + tftp-hpa 搭建一个最小 PXE 服务

进阶(1–2 月)

  • 阅读 OpenStack Ironic 官方文档,理解节点生命周期
  • 学习 Redfish API(DMTF 官网有交互式模拟器)
  • 部署 MAAS 并管理 5–10 台物理机

专家(持续)

  • 研究 NCCL 拓扑检测机制:阅读 NVIDIA NCCL 文档中的 “Topology Detection” 章节
  • 实操 IB 子网管理:OpenSM 配置、PFC/ECN 调优
  • 关注 NVIDIA DGX SuperPOD 部署指南(NVIDIA 提供公开的最佳实践文档)
  • 阅读 Meta、xAI 等公司的工程博客(如有公开分享)

一句话总结

裸金属部署是万卡 AI 集群的”地基工程”——不性感,但没有它,一切上层的分布式训练框架都是空中楼阁。


延伸阅读与来源

  1. OpenStack Ironic 官方文档https://docs.openstack.org/ironic/latest/
  2. Canonical MAAS 文档https://maas.io/docs
  3. DMTF Redfish 规范https://www.dmtf.org/standards/redfish
  4. NVIDIA NCCL 文档(含环境变量与拓扑说明):https://docs.nvidia.com/deeplearning/nccl/
  5. NVIDIA DGX SuperPOD 部署指南(NVIDIA 官网公开资料)
  6. Meta “Building Meta’s GenAI Infrastructure”(2024 年公开分享,含集群部署实践概述)
  7. InfiniBand Trade Associationhttps://www.infinibandta.org/(RDMA 与 IB 规范)

声明:本文中标注 [行业估算] 的数字为基于公开工程经验的定性估计,非精确统计数据;标注 [未充分披露] 的信息表示公开资料不足以给出确切数值。

source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型