兆瓦容量
3秒看懂
兆瓦容量不是算力指标,而是算力的“饭量”——单个AI集群或数据中心从电网抽取并分配给IT设备的电力总规模。一张H100加速卡热设计功耗约700 W,一万张卡加上网络、存储与冷却开销,轻松吃掉8–10 MW。当训练集群从万卡向十万卡迈进,电力供给与散热能力已取代芯片可获性,成为AI军备竞赛最硬的物理天花板。
3分钟产业解释
在AI产业链中,“兆瓦容量”衡量的是部署大规模GPU/ASIC集群的物理阈值。它不是IT负载的简单加总,而是涵盖IT设备、冷却、配电损耗、后备电源在内的“总输入功率”。“兆瓦”在这里是一个管理单元:电网公司分配容量以MVA/MW为单位,数据中心运营商则将其转化为可部署的算力密度。
产业关注的实质是“可部署算力密度”的瓶颈:即使GPU供应充足,若没有足够的市电接入、无法在合理周期内建成相应的供配电与散热系统,算力规划就只能停留在纸面。城市变电站剩余间隔、高压馈线审批、液冷工程化能力、备用电源占地——这些非芯片因素直接决定模型迭代速度与云厂商资本开支节奏。正因如此,“兆瓦容量”已经从电力工程术语演变为衡量AI基础设施供给弹性的核心量纲。
技术原理
大规模AI训练负载具有高强度、长持续、脉冲式的功率特征:数千张加速卡同步运算时,功耗几乎恒定在热设计上限附近,与普通数据中心负载的波动形态截然不同。这对兆瓦级容量的规划提出三层挑战:物理选址与市电接入、内部配电拓扑、热管理容量的闭环。
电力拓扑:从高压电网到芯片
以典型30 MW容量的AI模块为例,其简化单线图可表示为:
[110 kV/220 kV市电] → [主变压器] → [中压配电(10 kV/20 kV)] → [变压/整流] → [低压配电/直流母线] → [机架PDU] → [服务器电源(PSU)] → [GPU/ASIC]
↑后备发电机/储能 ←┘(ATS自动转换开关)
- 主变压器:将电网高压降至中压,容量需覆盖总负荷加冗余,通常采用N+1或2N架构。对于一个30 MW IT预留的站点,主变容量可能选配40–50 MVA。
- 中压配电:通过环网柜分配至各个电力模块。每个模块包含变压器、低压开关柜、UPS或HVDC系统,输出端再连接至机架。
- 机架级:PSU将交流或高压直流转换为12 V/48 V等板级电压,最终由VRM供给GPU。传统交流多层变换下,从市电进线到GPU芯片的总损耗约12–18%;采用高压直流(240 V/336 V)或中压到机架方案可压缩至8–12%(行业工程估算)。
- 接地与保护:兆瓦级系统需精细设计短路保护与选择性协调,以避免单点故障导致整片集群脱网。
算力-电力换算逻辑
训练能耗与模型架构强相关。以Transformer语言模型为例:总能耗 ≈ ∑(单卡平均功耗 × 训练时长 × 卡数)。当一个集群拥有10 000张H100时,仅GPU部分的IT负载即可达约7 MW;算上网络(400 Gbps/800 Gbps交换机)、存储节点、管理网络等,IT总功率接近8 MW。再计入冷却、配电损耗与适当冗余(假设PUE≈1.3),总输入功率轻松跨过10 MW。这意味着从电网视角看,一个万卡集群就是一个10 MW级用电大户,相当于一个小型工业园区。
值得注意的是,混合专家模型(MoE)因专家间通信与部分专家的“空转”功耗,其单位有效激活参数能耗可能高于同等吞吐的稠密模型。但在相同总训练算力下,总功耗变化需结合具体并行策略与通信开销评估,并非简单的线性缩放。
动态负载行为
兆瓦级AI负载对配电系统冲击明显:
- 数千张GPU在训练步长启动或算力同步时几乎同时拉载,瞬时电流陡升(di/dt极高),可能引发电压骤降或保护误动作。工程上须通过PSU母线电容、HVDC输出滤波、抑或软件层分段上电等手段加以抑制。
- 不同冷却模式下热时间常数差异显著:液冷系统热惯性小,要求冷却容量响应更为迅捷;风冷系统惯性较大,但应对功率突增时仍存在局部热点风险。电力输入最终几乎全部转化为热,若散热能力未按兆瓦水平同步设计,理论接入容量便无法真正兑现为可用算力。
关键参数
衡量兆瓦容量是否被有效利用,需关注以下核心指标(数值范围来自行业典型设计,非特定厂商合约值):
- 总接入容量(MVA):站点与电网签署的合同容量上限,决定了绝对规模天花板。主流AI站点的场站级接入规模常以20 MVA、50 MVA、100 MVA为台阶;超大规模站点可达数百MVA(如Meta、谷歌等超大规模用户的数据中心园区)。
- IT可用功率(MW):扣除冷却、配电损耗及冗余后,实际可分配给服务器的电力。若站点标称具有30 MW接入容量,在PUE为1.25的情况下,IT可用功率约为24 MW;若为冗余配置2N,可用比例将进一步降低。
- 功率密度(kW/机架):兆瓦容量能否转化为算力竞争力,取决于每机架能稳定承载的功率。传统CPU机房约5–8 kW/机架;风冷GPU集群可到15–25 kW/机架;冷板液冷GPU集群可达30–50 kW/机架;浸没式液冷方案可超过80 kW/机架(仍处于早期商用)。
- PUE(电能使用效率):IT设备每消耗1 W电力,数据中心总输入功率。风冷方案PUE通常在1.2–1.5,兆瓦级液冷集群目标可低于1.10;优秀的定制化设计站点公开宣称低于1.05。PUE越低,同样的接入容量可支撑更多算力。
- 备用电源容量与续航:柴油发电机或大容量储能系统须能覆盖IT负载与关键冷却总和。主流配置为全额备用,持续运行时间从数分钟(等待发电机启动)到数小时甚至完全离线运行。大型兆瓦站点通常配置多台10–20 MW级发电机并联。
- 扩展弹性:是否能在不中断运营的情况下从5 MW平滑扩展至10 MW、20 MW,取决于模块化供电与冷却设计。若初期未预留足够的配电间隔和散热总管线,扩容往往意味着部分停机或重新施工。
技术路线
从配电架构与冷却方式演进看,兆瓦级AI集群已形成若干可辨识的技术路线。以下量化表基于行业典型设计值(标注[典型范围]),不可视为任何厂商的合约规格。
| 维度 | 传统风冷UPS | 风冷+高压直流(HVDC) | 冷板液冷+集中供电 | 浸没液冷+MV to Rack |
|---|---|---|---|---|
| 单机架功率密度 (kW) | 5–15 | 15–25 | 30–50 | 50–80+ |
| 典型PUE | 1.3–1.5 | 1.15–1.3 | 1.05–1.15 | <1.05(预期) |
| 后备电源形态 | 铅酸电池UPS | 锂电/飞轮UPS | 分布式锂电/储能 | 模块化燃料电池/储能 |
| 1 MW IT负载占地估算 (㎡) | 约200–300 | 150–250 | 80–150 | 50–100 |
| 典型部署周期(含配电工程) | 12–18个月 | 10–14个月 | 10–14个月 | 14–20个月(早期) |
| 技术成熟度 | 成熟 | 成熟 | 规模部署中 | 早期试用 |
在实际工程决策中,若目标单集群IT负载超过30 MW,液冷几乎成为必选项;若电费高企,高效路线带来的PUE下降可在数年内覆盖增量投资。此外,行业正探索中压直流(MVDC)直接到机架、模块化预制电力方舱、以及小型核能/燃料电池作为常载电源的远期路线,但尚未进入主流商用。
上游
兆瓦容量落地的上游,本质上是电力工程与精密热管理的供应链:
- 电力接入与高压设备:市电变电站、主变压器、GIS组合电器、开关柜。主要供应商包括ABB、西门子能源、施耐德电气、通用电气(GE Grid)、特变电工、中国西电等。项目周期长,受制于上游铜、硅钢片等大宗商品以及关键部件供应。
- 配电与不间断电源:UPS、高压直流系统、配电单元、母线槽。全球头部企业:维谛(Vertiv)、台达电子、伊顿(Eaton)、施耐德电气(APC)、华为数字能源。2023–2024年,受AI订单拉动,高密电源设备交付周期一度拉长(公开资料未见具体周数,可参考各厂商投资者介绍)。
- 冷却系统:冷水机组、冷却塔、CDU(冷液分配单元)、液冷板、冷却液。主要供应商:Vertiv、施耐德、CoolIT Systems、Asetek、Boyd、高澜股份、英维克、曙光数创等。冷板液冷CDU及快接头的产能爬坡是液冷方案能否大规模铺开的关键。
- 备用电源:柴油发电机组(康明斯、卡特彼勒、MTU、科勒),大容量储能电池(宁德时代、三星SDI、特斯拉Megapack等)。兆瓦级数据中心对发电机的瞬态加载能力与排放认证要求严苛,高端机组产能紧俏。
下游
兆瓦容量的下游需求方分为三类:
- 超大规模云与CSP:AWS、微软Azure、谷歌云、Meta、甲骨文,以及国内阿里云、腾讯云、字节跳动等。它们通过自建、租赁或与开发商签订定制协议获取兆瓦级容量,用于内部AI训练/推理和对外AI云服务。此类企业是当前10 MW以上大型集群的主要驱动力,部分签约项目已超过100 MW单站点。
- 大型企业私有AI集群:应用于金融风控、自动驾驶仿真、药物研发、基础科学计算等场景。其单点规模多在1–5 MW区间,但对安全合规、专线供电提出额外要求。
- 中立托管租赁商(colocation):Equinix、Digital Realty、世纪互联、万国数据等,在重点枢纽城市开辟高密AI专区,提供兆瓦级配电包和混合冷却方案。但受限于城市电网增容周期,交付速度相对较慢,部分城市已出现电力容量排队等待现象。
受益公司
(本节仅陈述业务关联,不构成任何投资评价或买卖建议。)
按产业链环节划分,兆瓦容量需求扩张使以下类型企业获得更大业务曝光:
- 高密电源与热管理整体方案商:维谛(Vertiv,NYSE:VRT)的UPS、配电、液冷全栈方案在各大规模AI集群中频繁现身;台达电子提供电源模块与HVDC、冷却子系统,为多家CSP的OEM/ODM关键伙伴;施耐德电气在供配电与数据中心基础设施管理(DCIM)领域占据重要地位。
- 液冷专业厂商:CoolIT Systems(私有,与多个头部OEM合作)、Asetek(美股已退市,仍活跃于液冷市场),以及国内的高澜股份、英维克、曙光数创等,受益于液冷渗透率快速提升,CDU与液冷板需求放量。
- 专用半导体与服务器厂商:英伟达(GPU)、AMD(Instinct)、博通(定制ASIC/TPU基板)等定义了功耗谱系,从而间接决定兆瓦容量的刚性需求;超威、华硕、浪潮、联想等服务器系统商则在单机架功率密度设计上与供电方案深度协同。
- 数据中心开发商与运营商:Digital Realty(NYSE:DLR)、Equinix(NASDAQ:EQIX)等全球托管龙头以及国内万国数据、数据港、旭日数据等,建设高密园区以承接兆瓦级订单。其资产价值与能够稳定交付兆瓦容量的能力直接相关。
- 能源与公用事业伙伴:一些站点直接与电力公司或清洁能源开发商签订长期购电协议(PPA),以锁定绿色电能和电网容量。核电运营商(如Constellation能源)及小型模块化反应堆开发商(NuScale等)也在极远期受到关注,但公开资料暂无现实商业模式验证。
市场规模
由于AI负载增长极快,完整且权威的全球AI兆瓦容量市场规模暂未统一口径。以下引用可交叉验证的部分数据以勾勒量级(均标注来源与年份):
- 数据中心总电力消费:国际能源署(IEA)在2024年1月发布的报告中估计,2022年全球数据中心用电约460 TWh,约占全球电力需求的1%–1.3%;若不采取效率改进,到2026年这一数字可能升至1 000 TWh以上,其中AI训练与推理的贡献显著。
- 超大规模资本开支:Synergy Research Group在2024年二季度报告指出,全球超大规模运营商在2023年的资本支出约为2 280亿美元,2024年预计增长超20%,其中用于AI服务器与相关电力基础设施的占比明显上升。Vertiv在2023年投资者日资料中估算,数据中心电力基础设施(含电源、配电、冷却)占数据中心总建设成本的25%–35%,在AI专用站点中可能更高。
- 液冷市场:第三方研究机构如650 Group、TrendForce在2024年给出预测,数据中心液冷解决方案市场规模预计从2023年的约25亿–30亿美元增长至2028年的80亿–120亿美元。AI集群对单机架30 kW+的需求是主要驱动。
- 区域瓶颈:在北美(北弗吉尼亚、硅谷、德州)、欧洲(法兰克福、都柏林、伦敦)、亚太(新加坡、东京、孟买)等核心枢纽,电力容量紧张已成为新建数据中心最突出的制约因素。例如,新加坡自2019年起暂停新建数据中心审批,直至2022年开放试点,但总量仍严格控制;都柏林的爱尔兰国有电网EirGrid在2024年报告中对数据中心未来接入的可用容量发出预警。具体可用兆瓦数字因电网公司动态调整而频繁变化,公开资料未见统一实时统计。
(注:以上市场数据均来自公开披露的研究概要,并非作者基于模型预测。最新确切数字请读者直接检索报告原文。)
玩家对比
不同算力消耗巨头在兆瓦容量部署上的路径与公开信息如下(截至2025年初,基于公开报道,未核实具体合同条款):
| 公司 | 典型已知集群/计划 | 估算功率区间 | 备注 |
|---|---|---|---|
| Amazon (AWS) | Project Rainier:10万卡Trainium2集群 | 估计IT负载80–100 MW | 计划2025年上线,自研芯片专用集群 |
| Microsoft | Stargate超级计算机项目 | 远期目标数百MW | 与OpenAI合作,分阶段实施,2028年前后呈现 |
| 俄克拉荷马州数据中心园区扩容 | 新增约300 MW合同容量 | 用于TPU与自用AI服务,具体集群配置未披露 | |
| Meta | 2×24 000卡H100集群(2024年);60万卡等效产能规划 | 当前集群约15 MW IT负载;规划总和或超100 MW | 强调开放计算,2024年公开了集群细节 |
| xAI | 孟菲斯“Colossus”10万卡H100集群(2024年上线) | 峰值总输入约150 MW | 宣称最快建成的大规模GPU集群,计划扩展至20万卡 |
| 字节跳动 | 未公开单点规模,但自建数据中心项目增加 | 公开资料未见 | 多处选址风光资源丰富地区,强调绿色电力 |
| 阿里云 | 张北、乌兰察布、河源等绿色数据中心 | 单体园区常驻容量数十MW级 | 开放对外AI算力服务,应用液冷 |
| 腾讯云 | 怀来、清远等集群 | 公开资料未见精确数字 | 同字节,以自研“星星海”服务器与液冷方案配套 |
国内三大云厂商(阿里、腾讯、字节)在兆瓦容量上的具体单项目签约功率,极少在公开渠道细节披露,多数信息来源于地方能源审批公示或环评报告。国际上,Meta、Google等在可持续发展报告中会披露部分电力合同信息,是重要的追踪窗口。
风险
兆瓦容量相关的产业风险主要集中在以下几个方面:
- 电网接入与审批风险:全球多处算力枢纽城市电力容量告急,电网公司的新增申请排队时间可能延迟项目交付。高压专线配套变电站的建设周期往往超过12–18个月,与AI集群的快速迭代节奏形成冲突。
- 电力资产沉没成本:兆瓦级配电与散热设施具有强专用性,若因芯片能效大幅提升或算法突破(如混合精度训练、稀疏化等)导致单瓦算力陡增,部分在建或刚建成的高密站点可能面临容量利用率不足的窘境。
- 冷却技术工程风险:液冷系统虽然提升了密度,但引入流体泄漏、管道腐蚀、水质维护等新的失效模式。液冷运维人才稀缺,操作失误可能导致整个Pod式机柜损坏。
- 供应链集中:超大容量变压器、高等级开关设备、精密冷却CDU等关键设备供应商有限。突发性的需求爆发可能导致供货周期延长(如2024–2025年某特定型号变压器交付周期拉长)。
- 环境与政策合规:高耗电伴随的碳排放约束强化,部分地区可能对新建数据中心的PUE和电力来源设置硬性指标,增加前期投资成本与审批难度。柴油备用发电机也面临排放许可收紧的压力。
- 地缘政治与出口管制:先进GPU的供货限制会影响集群建设计划,从而间接使电力容量规划搁浅或延迟,形成连锁反应。
误读纠偏
-
误读1:“兆瓦容量就是IT设备功率”
实际上,站点获得的“总接入容量”包含冷却、配电损耗、UPS储能功耗及冗余裕量。若一个站点标称30 MW市电接入,其IT可用功率往往仅20 MW左右(视PUE及冗余架构),不可直接全部用于GPU。 -
误读2:“只要机房面积够大,总能堆出更多MW”
兆瓦容量受制于变压器容量、馈线规格及散热总管极限,而非仅楼板空间。若无电网扩容和新增冷却容量,空地再多也无法转化有效算力,这正是老旧数据中心无法直接承载高密度GPU集群的核心原因。 -
误读3:“提高单机架功率密度就自然提高了MW容量利用率”
高密度集中发热需要局部高效散热。若楼宇总体冷却主管路容量已满,强行提升单机架密度反而导致局部过热降频,整体吞吐量不升反降。兆瓦容量的兑现是供电与散热的协同匹配。 -
误读4:“一部集群的铭牌功率等于实际功耗”
铭牌功率(如变压器额定容量)代表的是设备允许承载最大值,而非实时运行功耗。AI训练过程中,数千卡恒载运行,实际功耗往往接近上限,但与铭牌之间仍有安全裕量。混淆两者将导致容量规划失准。
最新事件
(事件选取截止2025年初,基于公开报道)
- 2024年5月:微软宣布在威斯康星州投资33亿美元建设AI数据中心,强调将与当地电网合作升级变电站,预计接入容量达数百MW。
- 2024年6月:字节跳动被报道大幅增加自建数据中心项目,并在中国内陆多个风光资源丰富的地区获取电力容量,具体数字未披露。
- 2024年7月:xAI在田纳西州孟菲斯的“Colossus”集群上线,含10万张H100 GPU,总用电输入约150 MW,创造已知单一GPU集群最大功耗纪录。
- 2024年9月:谷歌签署协议,将在南卡罗来纳州购买超过750 MW的太阳能电力,以支持当地数据中心扩张;同时,其位于俄亥俄州的数据中心扩建项目因当地社区反对高密用电而经历听证。
- 2024年11月:都柏林数据中心新建审批继续收紧,EirGrid对2026年前新增容量发出警告,促动部分云厂商转向北欧选址。
- 2025年1月:英伟达发布GB200系统,单节点功耗进一步上升,预计将推动下一代AI集群的单机架密度超过100 kW,对兆瓦容量规划提出新挑战。
- 2025年2月:DeepSeek引起行业对模型训练效率的讨论,短期市场波动,但产业界多数声音认为总电力需求曲线并未被根本扭转,AI推理和持续扩大化训练仍将推高容量需求。
跟踪指标
若需持续追踪兆瓦容量的供需与产业动向,建议定期观察以下指标:
- 云厂商资本开支指引:AWS、微软、谷歌、Meta在季度财报中披露的资本支出及“AI基础设施”投资额,是兆瓦级需求的前瞻信号。
- PPA签署公告:大型购电协议(尤其是针对数据中心项目)的签订,往往预示未来2–3年的新增电力容量。
- 电网运营商数据:区域电网公司(如PJM、ERCOT、EirGrid)发布的容量可用率、新负荷接入等待队列长度,反映供给约束。
- 高压设备订单与交付周期:变压器、开关柜等长周期设备的主要厂商订单积压情况,可侧面印证数据中心建设活跃度。
- 液冷渗透率:服务器OEM厂商及液冷供应商(如CoolIT、Vertiv、英维克)的营收结构变化,反映兆瓦级高密方案的采用比例。
- PUE公开披露:云厂商年度可持续报告中的PUE水平和新数据中心设计标准,体现对兆瓦容量的利用效率。
- 监管政策落地:各国能耗限额、数据中心选址指引、备用发电机排放标准等法规变更,直接影响兆瓦容量的获取成本与可行性。
信源
由于本页面撰写过程中未进行实时网络检索,文中定量信息多基于已有行业常识与交叉引用的公开摘要。推荐读者通过以下类型原始资料自行核实并获取最新数据:
- 国际能源署(IEA):年度《数据中心和网络能源》报告及电力市场分析,提供全球数据中心用电趋势与预测。
- Uptime Institute:年度全球数据中心调查,涵盖机架密度、PUE、故障率、容量管理实践等详细数据。
- 超大规模公司公开报告:Google环境报告、Microsoft可持续发展报告、Meta数据中心设计白皮书、AWS可持续发展页面等。
- 行业技术白皮书:施耐德电气《数据中心电源和制冷计算器》系列白皮书;Vertiv、台达液冷与供电架构参考设计文件。
- 市场研究机构:Synergy Research Group(云与超大规模资本支出)、650 Group(液冷与网络)、TrendForce(服务器与冷却)、Dell‘Oro Group(数据中心物理基础设施)。
- 专业媒体:Data Center Dynamics (DCD)、The Next Platform、Light Reading、中国IDC圈等,跟踪兆瓦级AI集群建设项目的最新动态。
- 电网与监管公示:各地电网公司新增负荷接入环评公示、区域电力规划白皮书。
(全文完)