服务器液冷就绪 (Liquid-cooled Server Ready)
3 秒看懂
一句话定义:服务器硬件从出厂设计即预留/集成液冷散热接口与结构,可直接部署液冷方案,无需后期改造。
核心逻辑:AI芯片单卡功耗突破700W+,传统风冷已触及散热天花板,液冷从”可选”变为”必选”。“液冷就绪”是硬件厂商对这一趋势的标准化响应。
关键词:TDP飙升、PUE合规、冷板式/浸没式、CDU、快速接头
3 分钟产业解释
为什么现在必须谈”液冷就绪”?
功耗倒逼散热革命
功耗演进路径(GPU加速卡,估算):
┌─────────────────────────────────────────────────────┐
│ A100 (2020) ████████░░░░░░░░░░░░ ~400W │
│ H100 SXM (2023) ██████████████░░░░░░ ~700W │
│ H200 (2024) ███████████████░░░░░░ ~700W(带宽↑)│
│ B200 (2024) ████████████████████░ ~1000W │
│ 下一代旗舰 ██████████████████████ 1200W+? │
└─────────────────────────────────────────────────────┘
[注:以上为行业公开披露或分析师估算,实际功耗因配置/工作负载而异]
风冷的物理极限:
- 传统风冷散热能力约在 300-450W/芯片 量级即面临挑战[行业共识]
- 单机架功率密度从传统 8-15kW 向 AI 机架 40-120kW+ 跃升
- 高密度部署下,风冷系统需要巨大进风量,数据中心物理空间和制冷能耗难以为继
“液冷就绪”是什么?
并非指服务器”已经装了液冷”,而是指硬件层面完成以下预置:
- 结构适配:机箱/导轨/背板预留冷管通道、快接头安装位
- 组件兼容:CPU/GPU散热盖板(IHS)设计兼容冷板扣具
- 接口标准化:液路快速断开接头(QD)规格统一,支持热插拔维护
- 监控预埋:温度/流量/漏液传感器接口集成于BMC/IPMI
产业意义:
- 降低数据中心液冷改造的定制成本和工程复杂度
- 为服务器OEM/ODM提供标准化SKU,简化供应链
- 加速液冷方案在新建数据中心的渗透
15 分钟专家深入
一、液冷技术路径概览
当前主流液冷方案分为两大类,“液冷就绪”的侧重点不同:
| 维度 | 冷板式液冷 (Cold Plate/DLC) | 浸没式液冷 (Immersion) |
|---|---|---|
| 原理 | 冷板贴合热源,液体不直接接触电子元件 | 整个服务器浸入绝缘冷却液中 |
| 冷却液 | 水/乙二醇混合物(一次侧)<br>去离子水(二次侧) | 单相:矿物油、合成油<br>两相:氟化液(如3M Novec系列) |
| 液冷就绪关键 | 冷板扣具孔位、QD规格、液路布局 | 机箱密封性、浸没槽结构适配 |
| 改造难度 | 相对低,可针对热源精准部署 | 较高,需浸没槽基础设施 |
| 当前渗透 | [主流选择],占液冷部署大多数 | [仍在探索阶段],特定场景试点 |
| 适用场景 | 存量改造、新建数据中心 | 超高密度、边缘极端环境 |
二、冷板式液冷的硬件”就绪”清单
┌────────────────────────────────────────────────────────────┐
│ 冷板式液冷就绪 - 关键组件 │
├────────────────────────────────────────────────────────────┤
│ 服务器侧: │
│ ├── CPU/GPU 散热盖板设计 → 兼容标准冷板扣具 │
│ ├── 机箱开孔 → 液路进出管预留 │
│ ├── 快速断开接头(QD) → 支持热插拔维护,防漏设计 │
│ ├── 漏液检测传感器 → 集成至BMC告警 │
│ └── 板卡布局 → 避免液路与PCIe/内存冲突 │
│ │
│ 机柜侧(配套): │
│ ├── 行级/柜级 CDU(冷却分配单元) │
│ ├── 一次侧冷却塔/冷水机组 │
│ └── 管路系统与监控平台 │
└────────────────────────────────────────────────────────────┘
三、CDU — 液冷系统的”心脏”
CDU(Cooling Distribution Unit,冷却分配单元)是连接服务器液路与外部冷却源的关键设备:
- 功能:循环驱动、温度调节、流量分配、水质管理、监控告警
- 类型:
- 机柜级CDU:单柜配套,灵活性高,适合分散部署
- 行级CDU:一拖多柜,规模效应,适合密集部署
- 关键参数(定性):
- 换热能力:需匹配目标机柜总功耗
- 流量精度:多节点并联时的均衡分配
- 可靠性:7×24小时不间断运行,N+1冗余设计
四、为什么”液冷就绪”现在成为独立概念?
过去:液冷是”定制化”项目
- 数据中心运营商采购标准风冷服务器 → 联系液冷集成商 → 定制改造(拆机、开孔、配管)
- 工程周期长、成本高、兼容性风险大
现在:液冷成为”标准化”选项
- 服务器OEM(浪潮、联想、超微等)/ODM(富士康、纬颖等)出厂即提供液冷SKU
- “液冷就绪”≈ 硬件接口标准化 + 供应链预制化
- 客户可选择”液冷就绪”机型,配合标准化CDU快速部署
深层驱动:
- 政策端:多国/地区对新建数据中心PUE提出硬性要求(如中国要求新建大型数据中心PUE < 1.3)[政策公开信息]
- 需求端:AI训练集群单机架功率密度飙升,传统制冷方案物理上不可行
- 供给端:头部芯片厂商(NVIDIA GB200 NVL72等)明确推荐/要求液冷方案
技术原理(深度)
一、热传导路径对比
【风冷路径】
芯片热源
│
▼
导热界面材料(TIM)
│
▼
散热器翅片 (铝/铜)
│
▼
强制对流空气 ← 风扇阵列
│
▼
机房热通道 → 精密空调
【冷板式液冷路径】
芯片热源
│
▼
导热界面材料(TIM)
│
▼
冷板(铜/铝微通道)← 冷却液循环
│
▼
CDU(换热)← 一次侧冷却水
│
▼
冷却塔/冷水机组
【浸没式液冷路径】
芯片热源
│
▼
直接接触冷却液(绝缘)
│
▼
液体对流/相变 → 热量传递至液体
│
▼
CDU / 热交换器
│
▼
外部冷却系统
二、关键物理原理
液体 vs 空气的热学性质:
- 水的体积比热容约为空气的 约3500倍 [物理常数]
- 水的导热系数约为空气的 25倍 [物理常数]
- 这意味着同等体积下,液体可带走的热量远超空气
冷板微通道设计:
- 冷板内部蚀刻微通道(通道尺寸通常在毫米/亚毫米级)
- 增大换热面积,强化对流换热
- 设计权衡:通道越细→换热越好,但流阻越大、堵塞风险越高
热阻模型(简化):
总热阻 R_total = R_TIM + R_coldplate + R_convection(液侧)
其中:
R_TIM = 导热界面材料热阻(取决于材料导热系数与厚度)
R_coldplate = 冷板固体传导热阻(通常较小)
R_convection = 液体对流热阻(取决于流量、流道设计)
液冷的核心优势在于 R_convection(液侧对流热阻)远小于风冷的R_convection(气侧对流热阻)。
三、“漏液”——液冷的核心风险与对策
液冷系统最令人担忧的风险是冷却液泄漏导致电子元件损毁。
防护体系:
┌────────────────────────────────────────────────────────┐
│ 漏液防护层级 │
├────────────────────────────────────────────────────────┤
│ 第1层:材料与工艺 │
│ ├── 耐腐蚀液路材料(特种橡胶密封圈、不锈钢管路) │
│ └── 焊接/卡压工艺标准化 │
│ │
│ 第2层:快速断开接头(QD)设计 │
│ ├── 干断式设计:断开时泄漏量极小(行业目标 < 滴级) │
│ └── 阀门自锁机制 │
│ │
│ 第3层:漏液检测与告警 │
│ ├── 传感器部署于关键节点(接头下方、托盘底部) │
│ └── 告警信号集成至BMC/IPMI,触发自动响应 │
│ │
│ 第4层:运维流程 │
│ ├── 带压插拔操作规程 │
│ └── 定期巡检与密封件更换周期 │
└────────────────────────────────────────────────────────┘
四、冷却液选型(浸没式重点)
| 冷却液类型 | 代表物质 | 介电特性 | 沸点 | 成本 | 备注 |
|---|---|---|---|---|---|
| 矿物油 | 白油 | 绝缘 | 高(单相) | 较低 | 粘度大,维护清洁难度较高 |
| 氟化液 | 3M Novec系列等 | 绝缘 | 可调(两相常用低沸点) | 高 | 性能优异但成本是主要障碍 |
| 合成油 | 聚α-烯烃等 | 绝缘 | 高(单相) | 中等 | 介于矿物油与氟化液之间 |
[注:3M计划于2025年底退出PFAS相关氟化液生产,市场格局可能变化,需关注替代供应商进展]
技术演进史
时间轴:液冷技术发展历程
════════════════════════════════════════════════════════════════════
2010s前 HPC/超算领域小规模液冷探索
│ IBM蓝色基因等早期案例
▼
2015-2018 互联网巨头定制化试点
│ Google TPU液冷、部分数据中心试点
│ 仍是"工程定制"模式
▼
2019-2021 AI芯片功耗开始突破风冷舒适区
│ A100 SXM TDP ~400W,风冷勉强应对
│ 冷板式液冷在HPC领域加速渗透
▼
2022-2023 "液冷就绪"概念兴起
│ H100 SXM TDP ~700W,风冷面临挑战
│ 头部OEM开始推出液冷SKU选项
│ 中国政策明确PUE要求(<1.3新建大型DC)
▼
2024-2025 液冷进入规模化阶段
│ GB200 NVL72等系统官方推荐/要求液冷
│ "液冷就绪"成为服务器设计标配考虑
│ CDU、快接头等供应链快速成熟
▼
2025+ 液冷成为AI数据中心默认选项?
│ 下一代芯片单卡功耗1200W+预期
│ 浸没式液冷在特定场景规模化
│ 液冷与储能/余热回收结合探索
技术路线对比
| 维度 | 风冷(传统) | 冷板式液冷 | 单相浸没式 | 两相浸没式 |
|---|---|---|---|---|
| 散热能力 | 中低(<500W/芯片舒适区) | 高(1000W+可覆盖) | 高 | 极高(相变潜热) |
| PUE贡献 | 基线(1.3-1.5+) | 1.1-1.2 [行业案例] | 1.03-1.1 [行业案例] | 理论可达1.0x |
| 改造兼容性 | 无需改造 | 中等(需配液路) | 较低(需浸没槽) | 较低 |
| 存量改造难度 | - | 中等 | 高 | 高 |
| 新建适配性 | 高 | 高 | 中等 | 中等 |
| 运维复杂度 | 低 | 中等 | 中高 | 高(密封、挥发) |
| 冷却液成本 | 无 | 低(水基) | 中高 | 高(氟化液) |
| 技术成熟度 | 极高 | 高,主流量产 | 中,规模试点 | 低,早期探索 |
| 代表厂商 | 传统散热厂 | CoolIT、Vertiv、绿色云图等 | GRC、液冷创新企业 | 小规模试点 |
[注:以上数据为行业公开案例与分析师共识的定性归纳,具体项目表现因设计/环境而异]
上下游
┌─────────────────────────────────────────────────────────────────┐
│ 服务器液冷产业链 │
├─────────────────────────────────────────────────────────────────┤
│ │
│ 【上游 - 核心组件】 │
│ ├── 冷板:铜/铝加工、微通道蚀刻(精密制造能力) │
│ ├── 快速断开接头(QD):密封技术、自锁阀门设计 │
│ ├── CDU(冷却分配单元):换热器、泵组、控制系统 │
│ ├── 冷却液:氟化液/合成油(化工厂商) │
│ ├── 管路系统:特种软管/硬管、卡压/焊接接头 │
│ └── 传感器:温度/流量/漏液检测 │
│ │
│ 【中游 - 集成与制造】 │
│ ├── 服务器OEM:浪潮、联想、新华三、超微(Supermicro)等 │
│ ├── 服务器ODM:富士康、纬颖、广达等 │
│ ├── 液冷系统集成商:提供方案设计+安装+调试 │
│ └── 数据中心集成商:整体机房液冷方案落地 │
│ │
│ 【下游 - 终端需求】 │
│ ├── 云计算厂商:阿里云、腾讯云、AWS、Azure、Google等 │
│ ├── AI公司:大模型训练/推理集群 │
│ ├── 电信运营商:边缘计算节点 │
│ ├── 金融机构:高频交易等低延迟场景 │
│ └── 政府/科研:超算中心、国家实验室 │
│ │
│ 【支撑环节】 │
│ ├── 芯片端:Intel/AMD/NVIDIA的散热设计参考 │
│ ├── 机柜/机架:兼容液冷的机架设计 │
│ └── 运维服务:液冷系统监控、巡检、维护 │
└─────────────────────────────────────────────────────────────────┘
关键指标
| 指标 | 定义 | 意义 | 行业基准(定性) |
|---|---|---|---|
| PUE | 数据中心总能耗/IT设备能耗 | 越低越节能,液冷核心优势 | 风冷 >1.3,液冷目标 <1.2 |
| 单机架功率密度 | 单机架承载的IT设备总功耗 | 决定散热方案选择 | 传统 <15kW,AI机架 40-120kW+ |
| 冷却液进出水温差(ΔT) | 冷板进液温度 vs 出液温度 | 反映换热效率 | 设计目标因方案而异 |
| QD泄漏量 | 快速接头断开时的液体泄漏 | 安全性核心指标 | 行业目标:断开泄漏极小(滴级) |
| CDU换热能力 | CDU单位时间可带走的热量 | 匹配目标机柜功耗 | 需覆盖目标机架总热负荷 |
| 系统可用性 | 液冷系统正常运行时间占比 | 运维关键 | 目标与IT设备同等(99.99%+) |
| TCO | 总拥有成本(设备+能耗+运维) | 经济性核心 | 液冷初期投资高,长期能耗节省可回收 |
供需与市场数据
需求端驱动力
需求增长逻辑链:
┌──────────────────────────────────────────────────────────┐
│ AI算力需求爆发 │
│ │ │
│ ▼ │
│ 大模型训练/推理集群扩张 │
│ │ │
│ ▼ │
│ 高功耗GPU/加速卡大规模部署 │
│ │ │
│ ▼ │
│ 单机架功率密度突破风冷极限 │
│ │ │
│ ▼ │
│ 液冷成为刚需 ──→ "液冷就绪"服务器需求 │
└──────────────────────────────────────────────────────────┘
市场规模(行业估算)
- 全球液冷服务器市场:行业分析机构普遍预期2025-2030年CAGR在 25-40% 区间[多家第三方研究机构口径,具体数字因机构而异]
- 中国市场:受政策推动(PUE要求)和AI需求拉动,增速可能高于全球平均[行业共识]
- 渗透率:当前液冷在服务器整体出货量中占比仍为 个位数百分比,但在AI训练服务器细分中渗透率显著更高[行业估算]
供给端格局
- 上游核心组件(冷板、QD、CDU):国内外厂商均在快速扩产
- 服务器整机:头部OEM/ODM均已推出液冷SKU产品线
- 系统集成:从液冷专业集成商到大型数据中心EPC都在参与
代表公司与资本映射
| 产业链位置 | 代表公司/品牌 | 竞争优势 | 上市/融资状态 |
|---|---|---|---|
| 冷板/热管理 | CoolIT Systems | 冷板技术领先,与头部OEM合作 | 非上市(获战略投资) |
| 冷板/热管理 | Vertiv | 数据中心基础设施全栈 | NYSE: VRT |
| 冷板/热管理 | 绿色云图 | 国内液冷领先企业 | 非上市/部分已上市关联 |
| CDU/冷却分配 | Vertiv、施耐德、维谛技术等 | 传统数据中心制冷延伸 | 多为上市公司 |
| 快速接头(QD) | Staubli、Parker、Nitto Kohki | 精密密封技术壁垒 | 多为跨国上市公司 |
| 冷却液 | 3M(退出中)、索尔维、国内化工企业 | 氟化液配方专利 | 多为大型化工上市公司 |
| 服务器OEM | 浪潮信息、新华三/紫光股份、联想 | 客户资源、规模制造 | SZ:000977 / HK:002368等 |
| 服务器ODM | 工业富联、纬颖、广达 | 制造能力、大客户绑定 | SH:601138 / TW上市等 |
| 系统集成 | 数据港、万国数据、秦淮数据 | 机房资源+集成能力 | NYSE/HK上市 |
| 终端需求 | 阿里、腾讯、字节、百度、华为 | 算力需求体量 | 多为上市/未上市巨头 |
[注:以上为产业链主要参与者列举,不构成投资建议。具体公司液冷业务占比和竞争力需结合财报及调研进一步分析]
投资逻辑
核心逻辑框架
┌─────────────────────────────────────────────────────────────────┐
│ 投资逻辑层次分析 │
├─────────────────────────────────────────────────────────────────┤
│ │
│ 【第一层:确定性】 │
│ AI芯片功耗持续上行是确定趋势 │
│ → 液冷需求增长是确定方向 │
│ → "液冷就绪"服务器渗透率提升是确定逻辑 │
│ │
│ 【第二层:节奏与弹性】 │
│ 需跟踪:AI资本开支节奏、新建DC审批、政策执行力度 │
│ 弹性来源:液冷渗透率从个位数→两位数的跳跃期 │
│ │
│ 【第三层:格局与壁垒】 │
│ 冷板/QD:精密制造+客户认证壁垒 │
│ CDU:传统制冷巨头延伸 vs 新兴专业厂商 │
│ 集成:项目经验与交付能力是核心壁垒 │
│ │
│ 【第四层:产业链价值分配】 │
│ 核心组件(冷板、QD、CDU):技术壁垒高,毛利率相对较好 │
│ 整机集成:规模效应,但液冷增量附加值需评估 │
│ 运维服务:长期现金流,但早期规模有限 │
│ │
└─────────────────────────────────────────────────────────────────┘
关键观察窗口
- NVIDIA/AMD新一代芯片发布:功耗规格直接决定液冷需求天花板
- 头部云厂商资本开支指引:AWS/Azure/阿里/腾讯的AI CapEx是需求先行指标
- 政策执行力度:PUE要求的实际执行与监管力度
- 液冷组件供应链扩产进度:QD、冷板等是否存在供给瓶颈
风险提示
- AI投资周期波动导致需求节奏不及预期
- 液冷组件成本下降慢于预期,TCO优势不明显
- 风冷技术持续演进(如强化风冷方案)延缓液冷渗透
- 浸没式液冷技术突破可能改变格局
常见误读纠偏
误读1:液冷就绪 = 服务器已经装了液冷系统
纠偏:“液冷就绪”是指硬件设计层面兼容液冷方案,出厂时预留了冷板安装接口、液路通道、快速接头安装位等,但冷却液路、CDU等液冷系统本身通常不包含在服务器整机内,需要额外配置。
客户购买”液冷就绪”服务器后,仍需配套液冷基础设施(CDU、管路、冷却塔等)才能实现液冷运行。理解为”开箱即用的液冷服务器”是不准确的。
误读2:液冷一定比风冷省电,所以立刻更划算
纠偏:液冷的优势主要体现在IT设备层面的散热效率提升和PUE降低,但需要综合考虑:
- 初期投资:冷板、QD、CDU、管路、工程安装 → 液冷初期CAPEX显著高于风冷
- 运维成本:液冷系统需要专业运维,密封件定期更换等
- TCO回收期:取决于电价、机柜密度、利用率等因素,高密度AI场景下TCO优势更明显,但低密度通用计算场景下不一定划算
结论:液冷在高密度AI负载场景下经济性优势突出,但并非所有场景都适用。“液冷就绪”的意义在于降低未来升级液冷的边际成本。
误读3:液冷就绪是所有服务器的标准配置
纠偏:目前”液冷就绪”主要针对高功耗AI/高性能计算服务器,传统通用计算服务器(CPU功耗较低)仍以风冷为主。将”液冷就绪”等同于”全行业标准”会高估短期渗透速度。
误读4:浸没式液冷是冷板式的升级替代
纠偏:两者是不同技术路线,各有适用场景,而非简单的代际升级关系:
- 冷板式:改造兼容性好,是当前主流
- 浸没式:散热极限更高,但基础设施改造要求大、运维复杂度高
未来更可能是并存互补而非简单替代,取决于具体场景的技术经济性。
学习路径
入门(1-2小时)
├── 了解数据中心制冷基本概念(PUE、风冷原理)
├── 阅读服务器厂商液冷产品白皮书(浪潮、超微等官网)
└── 理解AI芯片功耗趋势(NVIDIA GPU TDP演进)
进阶(1-2天)
├── 学习冷板式液冷原理(换热、流阻、QD设计)
├── 阅读数据中心基础设施行业报告(赛迪、IDC、Gartner等)
├── 关注液冷组件厂商技术文档(CoolIT、Vertiv等)
└── 了解中国PUE政策演进(工信部、发改委相关文件)
专业(持续跟踪)
├── 参加行业会议(OCP Summit、液冷相关专题论坛)
├── 跟踪头部云厂商技术博客(Meta Open Com