OpEx
3秒看懂
运营支出(OpEx)是企业为维持日常业务运转而持续消耗的费用,在AI产业链中体现为电力、带宽、云服务租赁、运维人力等反复发生的成本。与一次性硬件采购的资本支出(CapEx)不同,OpEx直接进入当期损益,影响现金流和利润率。对于依靠大规模集群训练和推理的AI公司,OpEx往往是决定商业模式是否可持续的关键——空有模型能力,若运营开销超出收入,终将陷入“越卖越亏”的陷阱。
3分钟产业解释
AI领域的OpEx主要集中在算力的持续获取与维持环节。无论是自建数据中心还是使用公有云,一旦大模型启动训练或对外提供推理服务,算力就不再是一笔买入后搁置的资产,而变成按小时、按Token计价的运营消耗。典型的AI OpEx构成包括:
- 电力费用:GPU服务器、存储、网络设备及冷却系统的高密度用电,通常占数据中心运营成本50%以上。
- 网络与带宽:跨节点、跨地域的数据传输,All‑Reduce等通信操作的带宽开销,以及面向用户的数据出站流量。
- 云服务/IDC租赁:使用公有云GPU实例、对象存储、数据库即服务等产生的月付费用;若自建机房,则是机柜空间、制冷、安防等基础设施的长期租金或消耗。
- 软件订阅与许可:AI框架商业版、监控平台、数据库、安全工具等的年费或按用量付费。
- 运维人员:集群管理员、SRE、安全工程师、数据工程师的薪酬,这些是典型的人员类OpEx。
- 折旧的转换视角:从会计角度,服务器等物理资产虽以CapEx购入,但其折旧费用会通过“折旧与摊销”科目进入运营费用,实质上反映为一种隐性的OpEx。
2022年底ChatGPT引爆的大模型浪潮,让业界重新审视OpEx的边际结构:生成式AI的推理成本显著高于传统搜索引擎与推荐系统,一个简单的自然语言回答可能消耗数千Token的KV缓存,对应GPU小时成本不容小觑。于是,优化单位算力的运营支出,成为AI公司构建护城河的核心战场——通过模型压缩、蒸馏、MoE稀疏激活、算子融合、高效冷却技术、绿电采购等手段,将每1元OpEx创造的推理请求量或训练吞吐量推向极致。
15分钟专家深入
深入到AI产业的运营逻辑,OpEx不仅是财务部门报表上的几行数字,它直接塑造产业链的博弈格局。
1. 训练阶段的OpEx特征
一次千亿参数模型的预训练,通常需要数千颗GPU运行数周至数月。即便硬件已通过CapEx采购,其运行期间的全部电力、冷却、网络带宽、人员投入均属OpEx。业界估算,一次大型训练任务的纯运营开销(不含硬件折旧)可达数百万至数千万美元量级,其中电费占比往往过半。训练任务具有高度离散、阶段性爆发的特点:研发密集期OpEx陡增,空置期则形成浪费。因此,头部企业通过混合负载(白天训练/夜间推理)或给云厂商提供“训练即服务”来提高利用率。
2. 推理阶段的OpEx模型(最具弹性)
推理成本与用户请求量呈线性或阶梯式增长,构成了AI商业变现的命门。若单次推理的OpEx高于从用户那里获得的收益,产品规模越大亏损越重。推理OpEx可分为:
- 计算功耗:取决于模型尺寸、序列长度、batch size、硬件效率。例如,利用KV缓存、FlashAttention、量化(INT8/FP8)等手段可显著降低单次推理的能耗。
- 显存带宽与HBM功耗:大模型推理的瓶颈常不在FLOPs,而在显存带宽和HBM的功耗,HBM本身就耗电可观,且冷却需求高。
- 网络延迟与出站成本:多卡Tensor并行或跨区域部署会引发额外的通信开销,云厂商的跨AZ/出站流量费用也会计入。
一个典型的推理成本结构(定性估算):电费约占40‑60%,网络与带宽约10‑20%,云实例/托管费(含冷却)占20‑40%,其余为软件与人工。因此,追求能效比(PUE接近1.0的液冷数据中心)和低功耗推理芯片,成为整个行业降低OpEx的物理基础。
3. 自建 vs 上云:OpEx与CapEx的权衡
AI企业经常在“自买GPU建集群”(大量CapEx)与“按需租用云GPU”(纯OpEx)之间摇摆。上云模式将硬件折旧、机房基础设施、运维风险全部转化为按用量付费的OpEx,灵活性极高但长期单价可能更贵;自建模式前期投入巨额CapEx,但边际运营成本更低,适合需求稳定的超大规模用户。现实中,混合模式最为普遍:基础负载用自建集群,弹性峰值用云,实现OpEx与CapEx的帕累托优化。
4. 绿色OpEx:碳成本与合规压力
随着ESG要求趋严,碳排放本身正在成为一种隐性OpEx。欧洲碳边境调节机制、北美碳税讨论,以及客户对绿色算力的偏好,使得企业必须为每兆瓦时电力的碳来源付费或承担合规成本。因此,采购可再生能源PPA、自建风光电站、或使用清洁电力的数据中心,其长期运营支出结构可能更具竞争力。
关键参数视角
- PUE(Power Usage Effectiveness):数据中心总能耗/IT设备能耗,优秀值接近1.1‑1.2,每降低0.1所节省的总电费比例约为0.1/原PUE(例如原PUE从1.5降至1.4节省约6.7%,从1.3降至1.2节省约7.7%),笼统表述为8‑10%会高估节能效果。
- MFU(Model FLOPs Utilization):实际算力利用率,低MFU意味着在闲置功耗上浪费了大量OpEx。
- TOPS/Watt:单位功耗的AI性能,是推理芯片选型的核心指标。
- $ per 1M tokens:大模型供应商普遍采用的定价单位,背后直接映射推理OpEx。
技术原理
以AI推理OpEx为核心的成本方程
可构建一个简化的OpEx模型(ASCII图):
用户请求 -> 前端服务器 -> 推理集群 -> 回传结果
| |
网络流量费用 [GPU集群功耗 + 冷却 + 网络AllReduce]
|
单次推理OpEx = (P_gpu * T_infer + P_mem * T_idle) * 电价
+ (网络设备功耗 + 冷却功耗) * T_total
+ 虚拟化/容器管理开销
+ 软件许可摊销
+ 运维人力分摊
其中:
- P_gpu:GPU板卡实际功耗,随负载动态变化(例如推理时可能低于TDP的60‑80%)。
- T_infer:单次推理的GPU计算与访存时间,取决于模型结构、批处理大小(batch size)和序列长度。
- P_mem:HBM等显存的静态功耗,即便GPU空闲,显存也存在泄漏功耗和刷新功耗。
- T_idle:空闲等待时间,由批处理组装、调度延迟、负载不均等导致,是浪费OpEx的元凶之一。
- 网络设备功耗:光模块、交换机、NIC的耗电,在大规模集群中占比可达10‑15%。
- 冷却功耗:传统风冷下,冷却功耗约为IT功耗的30‑50%;液冷可将这部分降至10%以下。
降低推理OpEx的核心技术路径:
- 模型压缩与稀疏:通过剪枝、蒸馏、量化降低计算与内存带宽需求,直接减少T_infer和P_mem。
- 算子融合与编译优化:利用TensorRT、OpenXLA等将多个kernel合并,减少GPU核心的闲置与数据搬运次数。
- 批处理与并发调度:大batch能提升GPU利用率,但会增大延迟;continuous batching等技术可动态组batch,平衡吞吐与延迟,压缩T_idle。
- 先进冷却与高效电源:浸没液冷、冷板液冷、48V机架供电等均可降低能源转换损失。
- 空间与时间复用:将训练、推理、离线分析任务混合部署于同一集群,利用波峰波谷互补,摊薄固定运维成本。
(本部分无检索数据,所有参数结构为定性描述,具体数字依存于各厂商实现。)
技术演进史
早期(2012‑2016):GPU计算红利初现,OpEx关注甚少
AlexNet(2012)开启深度学习时代,训练用几块到几十块GPU,电力成本相比人力成本微不足道,OpEx讨论停留在“电费是不是该找行政报销”阶段。
中期(2017‑2020):Transformer与预训练范式,训练成本十倍增长
Transformer、BERT、GPT系列出现,训练规模从数百GPU·天跃升至数千GPU·天,单次训练电费可达数万至数十万美元。云厂商推出GPU实例,灵活的OpEx模式助力AI初创公司起步,但大型科技公司开始自建AI集群以压制长期OpEx。该阶段,PUE优化和绿色数据中心概念悄然兴起。
爆发期(2021‑至今):大模型与生成式AI,推理OpEx成为商业核心
GPT‑3(2020)后,千亿参数模型涌现,训练成本以千万美元计,单次训练运营费占比凸显。2022年底ChatGPT将推理成本推至前沿:一次搜索、一个对话,背后是成百上千次矩阵乘加。业界意识到,如果推理OpEx不能指数级下降,生成式AI的经济模型将面临严峻挑战。于是,模型压缩、MoE、量化、专用推理芯片(Groq、Cerebras、LPU等)和低功耗HBM成为热点。液冷方案(GIGABYTE、NVIDIA的参考设计)从可选项变为AIDC的准标配,因为单机架功耗突破30kW,风冷已逼近极限。
趋势总结:OpEx从一个财务KPI逐渐变为AI系统设计的第一性约束。每一次硬件代际更新、每一条新的压缩技术、每一种冷却方案,都可以在单位算力运营成本的下降曲线上找到坐标。
技术路线对比
(以下表格中数据为行业公开讨论的定性量级,非引用具体厂商财报,标注[估算]:)
| 对比维度 | 大模型纯推理OpEx优化路线A:<br>云端通用GPU + 软件优化 | 路线B:<br>云端专用推理芯片(ASIC) | 路线C:<br>边缘‑云协同推理 | 路线D:<br>自建液冷集群 + 蒸馏小模型 |
|---|---|---|---|---|
| 主要硬件 | NVIDIA A100/H100/B200等通用GPU,风冷或部分液冷 | Google TPU v5、AWS Inferentia、自研LPU | 端侧NPU(手机/PC)+ 轻量云GPU | 液冷H800/B200等,部署蒸馏小模型 |
| 单次推理能耗(估算) | 中等(经优化后约0.5‑2 Wh/请求[估算],大模型) | 较低(同模型下可降30‑50%功耗) | 端侧极低(毫瓦级),云侧分摊 | 低(小模型参数少,显存功耗低) |
| OpEx结构 | 电费与云实例费为主,网络弹性开销大 | 芯片单价摊销(云实例溢价),电费降低 | 端侧OpEx不计入服务商,云侧若需则含出站流量与GPU费 | 电费大幅降低,但需承担液冷基础设施CapEx(折旧) |
| 灵活性 | 极高,可随时切换模型和并行策略 | 低,硬件绑定特定编译器/框架,模型适配周期长 | 需模型分割或蒸馏,延迟敏感任务受限 | 较灵活,但蒸馏小模型能力有上限 |
| 适用场景 | 快速迭代、多租户云推理,追求上市时间 | 超大规模、稳定任务(如搜索引擎、推荐) | 隐私敏感、实时AR/VR、离线翻译 | 成本极度敏感且任务相对固定(客服、代码补全) |
| 中长期OpEx趋势 | 依赖GPU演进与规模效应,每年成本下降约20‑30% | 有望通过专用设计实现更陡的下降曲线 | 边缘成本趋零,但模型效果受限 | 受限于小模型天花板,但运营成本极低 |
路线选择本质上是OpEx的确定性与CapEx的灵活性之间的取舍。
上下游
上游:决定OpEx的基础元素
- 能源与供电:电力供应商、可再生能源开发商、电网设施——电价波动直接冲击OpEx的30‑60%。
- 制冷与散热:精密空调、液冷CDU、冷却液厂商(如3M的Novec被淘汰后,新氟化液供应商),其方案效率决定PUE和冷却运营成本。
- 芯片制造:晶圆厂的电耗、EUV光刻机的功耗,最终通过芯片价格和功耗间接影响AI系统的运营电费和冷却需求。
- 网络器件:光模块、交换机芯片(DSP、SerDes功耗),影响集群内部通信能耗。
下游:消化和感知OpEx的参与者
- AI大模型提供商:OpenAI、Anthropic、国内大模型创业公司等,OpEx占收入比例是生死线。
- 公有云厂商:AWS、Azure、GCP、阿里云等,他们将硬件运营成本打包成实例价格,OpEx规模效应是其利润来源。
- SaaS/PaaS企业:依托大模型API提供服务的公司,API调用费直接构成其OpEx,并转嫁给终端用户。
- 终端企业用户与消费者:通过订阅费或按次付费,最终承担所有上游累积的运营成本。
产业链利润在OpEx上的分配
能源和芯片往往是最大受益者,大模型服务商夹在中间,承受议价压力。云厂商通过规模采购和自研芯片力图压低上游成本,向下游提供性价比以抢占市场。整个链条的优化焦点在于如何将不可压缩的物理能耗转化为可规模化复制的智能输出。
关键指标
- 单位算力成本($/GPU‑hour):最直观的OpEx标尺,训练和推理的单价。
- PUE:衡量数据中心冷却等非IT能耗效率,绿色运营的核心。
- WUE(Water Usage Effectiveness):水资源利用率,液冷数据中心需关注的指标,影响水费和处理成本。
- CUE(Carbon Usage Effectiveness):每单位IT能耗的碳排放,对应碳税或碳积分成本。
- 推理单价($/1M tokens) :大模型商业定价的基础,是对推理全栈OpEx的市场化折现。
- 能效比(TOPS/Watt):芯片在单位功耗下的算力输出,直接折算为电费。
- 集群利用率:实际有效算力/理论算力,低利用率意味着固定运维OpEx的浪费。
- 运维人机比:每个运维人员管理的服务器数量,人员类OpEx的杠杆指标。
供需与市场数据
(注:因联网检索失败,本部分采用行业定性判断与方向性阐述,具体数字均标[估算])
- 电力需求爆发:据多家能源机构估算,2024年全球数据中心的电力需求约占总发电量的1‑2%,AI繁重负载推动这一比例未来数年可能提升至3‑5%[估算],引发部分地区电力瓶颈。
- 成本结构变化:传统数据中心IT设备电费占OpEx约40%,而AI集群由于GPU高功耗,电费占比可能达到50‑60%[估算]。
- 液冷市场渗透:单机架 30kW+ 的散热需求会推动液冷从试点走向规模部署,但不同机构对“新建 AIDC”“液冷采用比例”的口径差异较大;本文不写具体到 2027 年的渗透率预测,待补充可追溯报告后再量化。
- 云推理定价竞争:各大云厂商的模型推理服务价格在过去一年下降约50‑80%[估算],倒逼技术降本,利润空间被压缩,部分创业公司难以承受持续的流血运营。
- 人才市场:具有大规模集群SRE经验,能降低OpEx的人才薪酬溢价显著,间接推高运维人力成本。
供需矛盾在于:算力需求爆炸式增长,但电力基础设施扩容非一日之功,导致数据中心选址向电力充沛、绿电廉价地区(如北欧、美国中西部、中国西部)集中,运营成本的区域分化加剧。
代表公司与资本映射
- 公有云巨头(AWS / Azure / GCP):超大规模服务商,通过自研芯片(Graviton、Trainium、TPU)和长期电力协议,压制OpEx,并从中赚取实例溢价。
- NVIDIA:其GPU生态不仅定义算力供给,液冷参考设计、网络方案(Spectrum‑X)等也深度影响用户OpEx。
- 可再生能源与电力公司:NextEra Energy、Orsted、国家电网相关企业,随着AI数据中心成为用能大户,其长期PPA合同成为资本关注的标的。
- 液冷解决方案商:Vertiv、CoolIT、高力热处理(液冷板)、台达等,受益于液冷普及,其产品直接影响AIDC OpEx。
- AI创业公司(模型层):OpenAI、Anthropic、Midjourney、Character.AI等,其财务模型高度依赖推理OpEx的持续下降。即便收入快速增长,巨额的运营开支使得多数仍处于亏损状态,是典型的“高OpEx成长型”企业。
- 边缘推理芯片公司:如Hailo、地平线等,试图通过将推理转移到边缘,从根本上改变OpEx的承担主体。
资本映射:关注那些能系统性地降低AI运营支出的环节——高效芯片设计、先进冷却、可再生能源整合、自动化运维平台。
投资逻辑
- 成本曲线套利:投资于能加速“单位推理成本每年降低50%+”的技术或企业,享受降本带来的渗透率井喷。液冷、定制推理芯片、模型压缩工具等属于该主线。
- 能源瓶颈价值:当成数据中心密集建设与电网扩容脱节,布局具备稳定廉价电力(尤其绿电)的IDC资产,本质是获取“低成本能源作为AI运营必需的稀缺资源”的价差。
- 工具与服务赋能:提供自动化集群管理、可观测性、优化编译器的企业,帮助用户提升GPU利用率5‑10个百分点,相当于直接削减等比例的OpEx,具备强付费意愿和粘性。
- 商业模式筛选:警惕“高OpEx+低附加值”的纯算力转售型公司;重点拆解“利用技术将OpEx转化为数据飞轮”的企业——只有当运营支出能生成独特数据或模型壁垒时,其商业模式才更容易形成长期差异化。
常见误读纠偏
误读1:“上云就是纯OpEx,自建就是纯CapEx,所以要降OpEx就该全部上云。”
纠偏:上云虽将硬件转化为按使用付费的运营支出,但云实例价格中已包含了云厂商的硬件折旧、利润和运营成本,对稳态大规模用户而言,其单卡小时全生命周期成本可能高于自建集群的“折旧+运维OpEx”。因此,降低总拥有成本(TCO)需要在OpEx和CapEx之间寻找最优解,而非一刀切。
误读2:“OpEx越高说明公司投入越大、技术越先进。”
纠偏:高OpEx本身只是成本,唯有伴随高毛利率或快速增长的客户生命周期价值才值得。如果一个AI公司的运营支出增速长期超过收入增速,且每单位收入消耗的OpEx持续高位,那更像是烧钱陷阱而非投资未来。需要区分“创造壁垒的研发OpEx”和“维持现有服务的固定运营支出”。
误读3:“模型越小,推理OpEx一定越低。”
纠偏:小模型单次推理确实功耗较低,但若因精度不足需要额外重排序、多次重试或复杂后处理,反而可能增加总体OpEx。此外,小模型在使用专用推理芯片时可能利用率不高,导致摊销到每次请求的芯片成本上升。因此,OpEx的下限取决于端到端的系统效率,而非单一模型参数量。
学习路径
- 基础会计与财务:了解利润表(Income Statement)中Operating Expense的构成,理解现金支出与权责发生制下折旧的区别。
- 数据中心架构入门:阅读《Datacenter as a Computer》(Google),掌握PUE、冷却、电源拓扑等基础,理解物理运营成本从何而来。
- AI系统性能分析:学习GPU性能剖析工具(nsight、rocProfiler),了解功耗模型、利用率、显存带宽瓶颈,建立“代码‑功耗‑电费”的映射能力。
- 云计算计费模式:实践三大云厂商的计费规则,掌握预留实例、竞价实例、节省计划如何影响OpEx;分析爆款AI应用的月度账单。
- 行业报告跟踪:定期查阅Uptime Institute、IEA(国际能源署)关于数据中心能源的报告;关注半导体的功耗演进(TSMC、NVIDIA GTC)。
- 动手实践:部署一个开源LLM推理服务,测量不同batch size、量化等级下的GPU功耗与吞吐,计算$ per 1M tokens的实际成本,直观感受OpEx。
一句话总结
OpEx是AI商业化的重力场——谁的模型以更低的运营成本实现同等的智能,谁就拥有定义赛道的引力。
延伸阅读与来源
- Barroso, L.A., Hölzle, U., & Ranganathan, P. (2019). The Datacenter as a Computer: An Introduction to the Design of Warehouse-Scale Machines (3rd ed.). Morgan & Claypool.
- Patterson, D., et al. (2021). Carbon Emissions and Large Neural Network Training. arXiv:2104.10350.
- NVIDIA. NVIDIA AI Enterprise Documentation – Power Efficiency and Performance Tuning.
- Uptime Institute. Global Data Center Survey 各年度报告.
- IEA. Data Centres and Data Transmission Networks 专题报告.
- Google Cloud. The Nuts and Bolts of Machine Learning Operations 系列博客.
- 由于本次搜索失败,未获得联网资料,以上推荐仅为方向性指引,具体数字请以各机构最新发布为准。