裸金属部署(Bare-metal Provisioning)
3 秒看懂
一句话:跳过虚拟机/容器抽象层,将操作系统和 AI 训练框架直接装到物理 GPU 服务器上——让每一颗晶体管都为大模型干活。
3 分钟产业解释
它解决什么问题?
大模型训练对算力的”压榨”近乎极致。一次 GPT-4 量级的训练,数千张 GPU 连续运行数月,即使 2–3% 的性能损失也意味着数百万美元的额外成本。裸金属部署就是把这 2–3% 抢回来的核心手段:
| 维度 | 裸金属 | 虚拟化(VM) |
|---|---|---|
| 虚拟化开销 | 零(无 hypervisor 层) | 有(CPU 上下文切换、I/O 模拟) |
| GPU 访问模式 | 原生 PCIe/NVLink 直通 | 需 SR-IOV / vGPU 中间层 |
| 网络延迟(InfiniBand) | 内核旁路原生效 | 需额外配置 passthrough |
| 多租户隔离 | 弱(物理级隔离) | 强(VM 级隔离) |
| 弹性伸缩速度 | 慢(分钟级,需重装 OS) | 快(秒级创建 VM) |
AI 训练场景几乎是裸金属的”必选项”;推理服务则因弹性需求更强,常在容器/VM 中运行。
谁在用?
- 超大规模预训练:OpenAI、Anthropic、xAI 等万卡集群训练,几乎全部裸金属
- 云厂商 AI 实例:AWS 的
p4d.metal、g5.metal(裸金属实例),Azure 的裸金属基础设施(如 NDv2 系列),Google Cloud 的某些特定裸金属型号 - 主权 AI / 私有化部署:国内运营商、科研机构自建智算中心,主流方案即裸金属 + Slurm 调度
15 分钟专家深入
为什么 AI 集群偏爱裸金属?—— 三个技术刚性约束
1. GPU 通信拓扑敏感性
大规模训练依赖节点内 NVLink/NVSwitch 和节点间 InfiniBand(IB)形成高带宽低延迟的通信 fabric。张量并行(TP)要求 GPU 间 < 1μs 的延迟抖动,任何虚拟化层的中断注入都可能导致 NCCL AllReduce 尾延迟飙升,触发超时重传。
2. 拓扑感知调度(Topology-aware Scheduling)
训练框架(Megatron-LM、DeepSpeed、FSDP)需要精确知道物理拓扑——哪 8 张卡在同一 NVSwitch 域、哪两个节点通过同一 Leaf Switch 相连——以便把通信密集的并行维度映射到物理近邻。VM 层会模糊拓扑视图。
3. 内存带宽零浪费
HBM 的带宽是训练吞吐的命脉。hypervisor 对内存页的二次映射(EPT/NPT)会引入 TLB miss 开销,对 HBM 密集的 Attention/FFN 计算产生非线性影响。
典型裸金属部署的技术栈
┌─────────────────────────────────────────────────┐
│ 调度层:Slurm / Kubernetes (配 bare-metal CAPI) │
├─────────────────────────────────────────────────┤
│ 编排层:Ironic (OpenStack) / MAAS / Cobbler │
│ ┌─────────────┐ ┌──────────────────┐ │
│ │ PXE/TFTP 引导│ │ IPMI/BMC 带外管理│ │
│ └─────────────┘ └──────────────────┘ │
├─────────────────────────────────────────────────┤
│ 操作系统:Ubuntu / Rocky Linux / 定制镜像 │
├─────────────────────────────────────────────────┤
│ 驱动 & 运行时: │
│ GPU Driver → CUDA → cuDNN → NCCL → OFED(IB驱动) │
├─────────────────────────────────────────────────┤
│ 存储:Lustre / GPFS / WekaFS 并行文件系统 │
├─────────────────────────────────────────────────┤
│ 硬件:GPU 服务器 + InfiniBand/RoCE 交换 fabric │
└─────────────────────────────────────────────────┘
关键流程
- 硬件上架 & 带外发现:通过 BMC/IPMI 自动发现物理节点,写入 CMDB
- 网络预配:交换机端口配置 VLAN/PFC/ECN(RoCE 场景),IB 子网管理器(OpenSM)就绪
- PXE 网络引导:节点从 DHCP+TFTP 获取引导镜像
- OS 镜像写入:写入预构建的 OS 镜像(含 GPU 驱动、CUDA、NCCL 等预装)
- 固件刷写:GPU VBIOS、NIC 固件、BMC 固件统一升级(部分厂商支持在线)
- 健康检查 & Burn-in:GPU 显存压力测试、IB Link 检查、NVLink 带宽验证
- 节点注册入集群:上报至 Slurm/K8s 调度器,进入 ready 状态
行业估算:一个万卡规模集群从硬件上架到全部节点 ready,典型周期为 4–8 周(含布线、调试、Burn-in),裸金属自动化可将节点级部署从数小时压缩至 20–40 分钟/节点 [行业估算,无单一来源]。
技术原理(深入机制)
PXE 引导机制
物理节点 ──[DHCP Discover]──> DHCP Server
│
<──[Offer: IP + TFTP地址]──
│
──[TFTP Get: pxelinux.0 / GRUB]──> TFTP Server
│
<──[加载内核 + initramfs]──
│
──[内核启动 → 挂载 rootfs(来自 HTTP/NFS/本地盘)]
│
──[cloud-init / cloud-config 执行用户数据脚本]
├── 安装驱动
├── 配置网络(RDMA / SR-IOV)
├── 挂载共享存储
└── 注册到调度器
IPMI / Redfish 带外管理
- IPMI 2.0:传统协议,通过 BMC 独立网络接口提供电源控制、传感器读取、KVM-over-IP
- Redfish (DMTF):RESTful API 替代方案,结构化 JSON,更适合大规模自动化;主流服务器厂商(Dell iDRAC、HPE iLO、Inspur BMC)均已支持
Ironic(OpenStack 项目)核心流程
节点注册 → 管理态(managed) → 检查态(inspect)
→ 可用态(available) → 部署态(active)
↓
[清理阶段(cleaning)] → 回到可用态
- 驱动适配层:每个厂商 BMC 有对应 driver(
ipmi,idrac,ilo,redfish等) - RAID 配置:可自动配置 RAID 级别(AI 训练节点通常用 RAID-0 或直通以获取最大 I/O 吞吐)
- 镜像管理:使用 Glance 存储 OS 镜像,写入节点本地盘
AI 特有的裸金属考量
NCCL 环境调优(典型关键参数)
| 环境变量 | 作用 | 典型值(示例,非固定) |
|---|---|---|
NCCL_IB_DISABLE | 禁用 IB(一般不设) | 0 |
NCCL_SOCKET_IFNAME | 指定通信网卡 | ib0 |
NCCL_TOPO_FILE | 自定义拓扑文件 | 路径 |
NCCL_ALGO | 集合通信算法 | Ring,Tree |
NCCL_NET_GDR_LEVEL | GPUDirect RDMA 级别 | 视硬件而定 |
以上为定性参考,实际值因集群规模、GPU 代际、IB 交换机型号差异极大,需逐集群调优。
GPUDirect RDMA(GDR)
允许 GPU 显存与 IB 网卡之间 DMA 直传,绕过 CPU 和系统内存。裸金属环境下的优势在于:无需穿透 hypervisor 的 IOMMU 映射,端到端延迟更低。
技术演进史
| 时期 | 标志事件 | 变化 |
|---|---|---|
| ~2000s | Cobbler/Kickstart 出现 | 裸金属 = 手动装机 + 脚本辅助 |
| ~2012 | OpenStack Ironic 立项 | 裸金属纳入云管理,API 化 |
| ~2016 | Canonical MAAS 2.0 | ”Metal as a Service”,将裸金属当云资源管理 |
| ~2018–2019 | 云厂商推出裸金属实例 | AWS i3.metal → Oracle BM → Azure 裸金属;企业开始”混合”使用 |
| ~2020–2022 | 大模型训练爆发 | GPU 集群规模从百卡→千卡→万卡,裸金属成为标配 |
| ~2023–2025 | 万卡集群时代 | xAI Memphis(号称 10 万 H100)、Meta H100 集群(据报道 24,576 张 H100 训练 Llama 3.1 405B)均裸金属部署;自动化工具链成熟度成为竞争壁垒 |
技术路线对比
| 维度 | 裸金属部署 | VM 虚拟化 | 容器化(K8s) |
|---|---|---|---|
| GPU 性能损耗 | ~0% | 2–5%(含 vGPU 开销)[行业估算] | <1%(device plugin 直通) |
| 隔离性 | 物理级(强) | VM 级(强) | 命名空间级(中) |
| 多租户密度 | 低(独占物理机) | 高 | 中–高 |
| 部署速度 | 分钟级/节点 | 秒级 | 秒–分钟级 |
| 弹性伸缩 | 差 | 优 | 良 |
| 网络 RDMA 支持 | 原生 | 需 SR-IOV passthrough | 需 SR-IOV + Multus CNI |
| 拓扑感知 | 精确 | 可能被抽象层遮蔽 | 需 device plugin 扩展 |
| 典型场景 | 万卡预训练 | 通用云 / 混合云 | 推理服务 / 小规模微调 |
| 代表工具 | Ironic, MAAS, Cobbler | vSphere, KVM/QEMU | K8s + GPU Operator |
上下游
上游(硬件与固件)
├── GPU 服务器(含 GPU、CPU、NVLink/NVSwitch、内存)
├── RDMA 网络(InfiniBand / RoCE NIC + 交换机)
├── 并行存储(Lustre / WekaFS / GPFS 节点)
├── 带外管理硬件(BMC 芯片)
└── 机柜 & 供电(含液冷基础设施)
中游(裸金属部署软件栈)
├── 带外管理协议(IPMI / Redfish)
├── PXE/TFTP/DHCP 引导服务
├── 裸金属编排器(Ironic / MAAS / 集成商自研平台)
├── OS 镜像构建(Packer / 自定义脚本)
├── GPU/IB 驱动自动化安装
└── 健康检查 & Burn-in 工具
下游(消费方)
├── AI 训练调度器(Slurm / Kubernetes + Volcano)
├── 大模型训练框架(Megatron-LM / DeepSpeed / FSDP)
├── 智算中心运营平台(资源计费、故障自愈)
└── 推理平台(可选容器化,但训练阶段属裸金属)
关键指标
| 指标 | 含义 | 业界参考范围 |
|---|---|---|
| 节点部署耗时 | 从上架到 Ready | 20–60 min/节点(自动化)[行业估算] |
| GPU Burn-in 通过率 | 首次点亮健康检查通过 | >95%(成熟供应链)[行业估算] |
| 集群就绪周期 | 万卡集群全量可用 | 4–8 周 [行业估算] |
| 节点故障率(MTBF) | GPU/内存/NIC 硬件故障间隔 | GPU 模块:数万小时量级 [厂商未充分披露具体值] |
| RDMA 网络无损丢包率 | PFC/ECN 配置正确性 | 目标 0(理想值),实际监控尾延迟 |
| NCCL AllReduce 带宽利用率 | 实测 vs 理论峰值 | >85% 为优秀 [行业估算] |
供需与市场数据
需求侧
- 全球 AI 训练 GPU 集群规模:据公开报道,2024 年已出现多家万卡(H100 等效)集群,包括 xAI、Meta、Microsoft、Google 等;单集群最大规模据报已达 10 万 GPU 量级(xAI Memphis,具体配置未完全公开)。
- 中国:据行业估算,2024 年国内已部署/在建智算中心的 AI 加速卡保有量在 数十万至百万张 量级(含国产卡),绝大部分采用裸金属部署模式。
- 每节点裸金属部署成本:软件栈自建成本主要为人力(运维 SRE 团队),Ironic/MAAS 开源免费但需要专业团队维护;采购商业方案(如厂商智算中心整体交付)则打包在整体报价中,无法单独拆分 [未充分披露]。
供给侧
| 玩家类型 | 代表 | 模式 |
|---|---|---|
| 云厂商 | AWS / Azure / GCP / 阿里云 / 华为云 | 裸金属实例(按需/预留) |
| 智算中心集成商 | 浪潮 / 新华三 / 超聚变 / Dell / HPE | 硬件 + 裸金属交付整体方案 |
| 开源社区 | OpenStack Ironic / Canonical MAAS | 免费软件 + 社区支持 |
| AI infra 创业公司 | 部分公司提供 GPU 集群运维平台 | SaaS / 私有化部署 |
代表公司与资本映射
| 公司 | 与裸金属的关系 | 上市/融资状态 |
|---|---|---|
| Dell Technologies | 全球领先 GPU 服务器供应商,iDRAC 带外管理,PowerEdge 系列广泛用于裸金属集群 | NYSE: DELL |
| HPE | ProLiant + iLO,深度集成 Ironic | NYSE: HPE |
| 浪潮(Inspur) | 国内 AI 服务器出货量前列,自研 BMC | 深交所: 000977(浪潮信息) |
| 超聚变(xFusion) | 原华为服务器团队,FusionServer 系列 | 未上市 |
| Canonical | MAAS(Metal as a Service)维护方 | 未上市 |
| CoreWeave | GPU 云服务商,据报大量裸金属部署训练集群 | 已提交 IPO 文件(截至 2025 年初) |
| Lambda Labs | GPU 云/集群方案商 | 私有融资 |
| 超微(Supermicro) | 高密度 GPU 服务器供应商 | NASDAQ: SMCI |
注意:上述公司多数不单独披露”裸金属部署”收入,该环节嵌套在更大体量的服务器/云/IaaS 业务中。
投资逻辑
核心看点
- “铲子效应”确定性高:无论哪家大模型公司胜出,训练集群都必须用裸金属。卖铲子(GPU 服务器 + 部署交付)比赌模型更具确定性。
- 交付能力=竞争壁垒:万卡集群的裸金属部署不是简单的装机——需要网络(IB fabric)、存储(并行 FS)、驱动调优、拓扑优化的全栈能力。具备这种交付能力的集成商和云厂商拥有护城河。
- 运维粘性强:集群一旦部署,运维期长达 3–5 年,期间故障自愈、固件升级、扩容等需求持续产生服务收入。
风险点
- 资本开支波动:GPU 采购周期受 AI 投资热度影响,如果大模型训练 ROI 下降,集群扩建可能放缓。
- 技术替代风险:长期看,如果虚拟化/容器性能损耗趋近于零(如新一代 SR-IOV、DPU 卸载),裸金属的性能优势可能缩小,但短期内(2–3 年)不会改变。
- 地缘因素:GPU 出口管制可能影响国内智算中心的扩建节奏和硬件选型。
常见误读纠偏
误读 1:“裸金属 = 没有软件管理”
纠偏:裸金属不等于”裸”。它有完整的软件栈——PXE 引导、IPMI/Redfish 带外管理、OS 镜像自动化写入、驱动安装、健康检查。“裸”指的是没有 hypervisor 虚拟化层,而非没有管理软件。实际上,大型裸金属集群的软件复杂度不亚于一个私有云。
误读 2:“容器化可以完全替代裸金属部署”
纠偏:对于推理和微调场景,容器(K8s + GPU Operator)是合理选择。但对于 千卡以上规模的预训练,裸金属仍是主流,原因有三:① InfiniBand 延迟要求严格,容器网络栈引入额外开销;② 拓扑感知在容器中实现复杂;③ Slurm 在 HPC/训练领域的生态成熟度远超 K8s 训练调度插件。两者不是替代关系,而是互补——裸金属打底 + 容器化封装应用。
误读 3:“裸金属部署技术含量低,就是装机”
纠偏:传统数据中心的裸金属装机确实门槛不高。但 AI 集群级裸金属部署 涉及:IB 子网管理、GPUDirect RDMA 调优、NVLink 拓扑映射、并行存储挂载与 POSIX 锁优化、GPU 固件兼容性矩阵管理等。万卡集群的一次部署调试周期可达数周,是真正的系统工程。能做好这件事的团队在全球范围内都是稀缺资源。
学习路径
入门(1–2 周)
- 了解 PXE 启动原理:搜索 “PXE boot flow explained”
- IPMI 基础:阅读 DMTF IPMI 2.0 白皮书概要
- 动手:在实验室用
dnsmasq+tftp-hpa搭建一个最小 PXE 服务
进阶(1–2 月)
- 阅读 OpenStack Ironic 官方文档,理解节点生命周期
- 学习 Redfish API(DMTF 官网有交互式模拟器)
- 部署 MAAS 并管理 5–10 台物理机
专家(持续)
- 研究 NCCL 拓扑检测机制:阅读 NVIDIA NCCL 文档中的 “Topology Detection” 章节
- 实操 IB 子网管理:
OpenSM配置、PFC/ECN 调优 - 关注 NVIDIA DGX SuperPOD 部署指南(NVIDIA 提供公开的最佳实践文档)
- 阅读 Meta、xAI 等公司的工程博客(如有公开分享)
一句话总结
裸金属部署是万卡 AI 集群的”地基工程”——不性感,但没有它,一切上层的分布式训练框架都是空中楼阁。
延伸阅读与来源
- OpenStack Ironic 官方文档:https://docs.openstack.org/ironic/latest/
- Canonical MAAS 文档:https://maas.io/docs
- DMTF Redfish 规范:https://www.dmtf.org/standards/redfish
- NVIDIA NCCL 文档(含环境变量与拓扑说明):https://docs.nvidia.com/deeplearning/nccl/
- NVIDIA DGX SuperPOD 部署指南(NVIDIA 官网公开资料)
- Meta “Building Meta’s GenAI Infrastructure”(2024 年公开分享,含集群部署实践概述)
- InfiniBand Trade Association:https://www.infinibandta.org/(RDMA 与 IB 规范)
声明:本文中标注 [行业估算] 的数字为基于公开工程经验的定性估计,非精确统计数据;标注 [未充分披露] 的信息表示公开资料不足以给出确切数值。