網路層 開放閱讀

OpEx

Operating Expenditure

概念 ID
operating-expenditure
更新時間
2026-05-29
來源數量
待補

OpEx

3秒看懂

運營支出(OpEx)是企業為維持日常業務運轉而持續消耗的費用,在AI產業鏈中體現為電力、頻寬、雲端服務租賃、運維人力等反覆發生的成本。與一次性硬體採購的資本支出(CapEx)不同,OpEx直接進入當期損益,影響現金流量和獲利率。對於依靠大規模叢集訓練和推論的AI公司,OpEx往往是決定商業模式是否可持續的關鍵——空有模型能力,若運營開銷超出營收,終將陷入“越賣越虧”的陷阱。

3分鐘產業解釋

AI領域的OpEx主要集中在算力的持續獲取與維持環節。無論是自建資料中心還是使用公有雲端,一旦大型模型啟動訓練或對外提供推論服務,算力就不再是一筆買進後擱置的資產,而變成按小時、按Token計價的運營消耗。典型的AI OpEx構成包括:

  • 電力費用:GPU伺服器、儲存、網路裝置及冷卻系統的高密度用電,通常佔資料中心運營成本50%以上。
  • 網路與頻寬:跨節點、跨地域的資料傳輸,All‑Reduce等通訊操作的頻寬開銷,以及面向使用者的資料出站流量。
  • 雲端服務/IDC租賃:使用公有雲端GPU例項、物件儲存、資料庫即服務等產生的月付費用;若自建機房,則是機櫃空間、製冷、安防等基礎設施的長期租金或消耗。
  • 軟體訂閱與許可:AI架構商業版、監控平台、資料庫、安全工具等的年費或按用量付費。
  • 運維人員:叢集管理員、SRE、安全工程師、資料工程師的薪酬,這些是典型的人員類OpEx。
  • 折舊的轉換視角:從會計角度,伺服器等物理資產雖以CapEx購入,但其折舊費用會通過“折舊與攤銷”科目進入運營費用,實質上反映為一種隱性的OpEx。

2022年底ChatGPT引爆的大型模型浪潮,讓業界重新審視OpEx的邊際結構:生成式AI的推論成本顯著高於傳統搜尋引擎與推薦系統,一個簡單的自然語言回答可能消耗數千Token的KV快取,對應GPU小時成本不容小覷。於是,最佳化單位算力的運營支出,成為AI公司建置護城河的核心戰場——通過模型壓縮、蒸餾、MoE稀疏啟用、運算元融合、高效冷卻技術、綠電採購等手段,將每1元OpEx創造的推論請求量或訓練吞吐量推向極致。

15分鐘專家深入

深入到AI產業的運營邏輯,OpEx不僅是財務部門報表上的幾行數字,它直接塑造產業鏈的博弈格局。

1. 訓練階段的OpEx特徵
一次千億引數模型的預訓練,通常需要數千顆GPU執行數週至數月。即便硬體已通過CapEx採購,其執行期間的全部電力、冷卻、網路頻寬、人員投入均屬OpEx。業界估算,一次大型訓練任務的純運營開銷(不含硬體折舊)可達數百萬至數千萬美元量級,其中電費佔比往往過半。訓練任務具有高度離散、階段性爆發的特點:研發密集期OpEx陡增,空置期則形成浪費。因此,頭部企業通過混合負載(白天訓練/夜間推論)或給雲端廠商提供“訓練即服務”來提高利用率。

2. 推論階段的OpEx模型(最具彈性)
推論成本與使用者請求量呈線性或階梯式增長,構成了AI商業變現的命門。若單次推論的OpEx高於從使用者那裡獲得的收益,產品規模越大虧損越重。推論OpEx可分為:

  • 計算功耗:取決於模型尺寸、序列長度、batch size、硬體效率。例如,利用KV快取、FlashAttention、量化(INT8/FP8)等手段可顯著降低單次推論的能耗。
  • 視訊記憶體頻寬與HBM功耗:大型模型推論的瓶頸常不在FLOPs,而在視訊記憶體頻寬和HBM的功耗,HBM本身就耗電可觀,且冷卻需求高。
  • 網路延遲與出站成本:多卡Tensor並行或跨區域部署會引發額外的通訊開銷,雲端廠商的跨AZ/出站流量費用也會計入。

一個典型的推論成本結構(定性估算):電費約佔40‑60%,網路與頻寬約10‑20%,雲端例項/託管費(含冷卻)佔20‑40%,其餘為軟體與人工。因此,追求能效比(PUE接近1.0的液冷資料中心)和低功耗推論晶片,成為整個行業降低OpEx的物理基礎

3. 自建 vs 上雲端:OpEx與CapEx的權衡
AI企業經常在“自買GPU建叢集”(大量CapEx)與“按需租用雲端GPU”(純OpEx)之間搖擺。上雲端模式將硬體折舊、機房基礎設施、運維風險全部轉化為按用量付費的OpEx,靈活性極高但長期單價可能更貴;自建模式前期投入鉅額CapEx,但邊際運營成本更低,適合需求穩定的超大規模使用者。現實中,混合模式最為普遍:基礎負載用自建叢集,彈性峰值用雲端,實現OpEx與CapEx的帕累托最佳化。

4. 綠色OpEx:碳成本與合規壓力
隨著ESG要求趨嚴,碳排放本身正在成為一種隱性OpEx。歐洲碳邊境調節機制、北美碳稅討論,以及客戶對綠色算力的偏好,使得企業必須為每兆瓦時電力的碳來源付費或承擔合規成本。因此,採購可再生能源PPA、自建風光電站、或使用清潔電力的資料中心,其長期運營支出結構可能更具競爭力。

關鍵引數視角

  • PUE(Power Usage Effectiveness):資料中心總能耗/IT裝置能耗,優秀值接近1.1‑1.2,每降低0.1所節省的總電費比例約為0.1/原PUE(例如原PUE從1.5降至1.4節省約6.7%,從1.3降至1.2節省約7.7%),籠統表述為8‑10%會高估節能效果。
  • MFU(Model FLOPs Utilization):實際算力利用率,低MFU意味著在閒置功耗上浪費了大量OpEx。
  • TOPS/Watt:單位功耗的AI效能,是推論晶片選型的核心指標。
  • $ per 1M tokens:大型模型供應商普遍採用的定價單位,背後直接對映推論OpEx。

技術原理

以AI推論OpEx為核心的成本方程

可建置一個簡化的OpEx模型(ASCII圖):

使用者請求 -> 前端伺服器 -> 推論叢集 -> 回傳結果
   |                        |
  網路流量費用         [GPU叢集功耗 + 冷卻 + 網路AllReduce]
                         |
                   單次推論OpEx = (P_gpu * T_infer + P_mem * T_idle) * 電價
                                 + (網路裝置功耗 + 冷卻功耗) * T_total
                                 + 虛擬化/容器管理開銷
                                 + 軟體許可攤銷
                                 + 運維人力分攤

其中:

  • P_gpu:GPU板卡實際功耗,隨負載動態變化(例如推論時可能低於TDP的60‑80%)。
  • T_infer:單次推論的GPU計算與訪存時間,取決於模型結構、批處理大小(batch size)和序列長度。
  • P_mem:HBM等視訊記憶體的靜態功耗,即便GPU空閒,視訊記憶體也存在洩漏功耗和重新整理功耗。
  • T_idle:空閒等待時間,由批處理組裝、排程延遲、負載不均等導致,是浪費OpEx的元兇之一。
  • 網路裝置功耗:光模組、交換器、NIC的耗電,在大規模叢集中佔比可達10‑15%。
  • 冷卻功耗:傳統風冷下,冷卻功耗約為IT功耗的30‑50%;液冷可將這部分降至10%以下。

降低推論OpEx的核心技術路徑:

  1. 模型壓縮與稀疏:通過剪枝、蒸餾、量化降低計算與記憶體頻寬需求,直接減少T_infer和P_mem。
  2. 運算元融合與編譯最佳化:利用TensorRT、OpenXLA等將多個kernel合併,減少GPU核心的閒置與資料搬運次數。
  3. 批處理與併發排程:大batch能提升GPU利用率,但會增大延遲;continuous batching等技術可動態組batch,平衡吞吐與延遲,壓縮T_idle。
  4. 先進冷卻與高效電源:浸沒液冷、冷板液冷、48V機架供電等均可降低能源轉換損失。
  5. 空間與時間複用:將訓練、推論、離線分析任務混合部署於同一叢集,利用波峰波谷互補,攤薄固定運維成本。

(本部分無檢索資料,所有引數結構為定性描述,具體數字依存於各廠商實現。)

技術演進史

早期(2012‑2016):GPU計算紅利初現,OpEx關注甚少
AlexNet(2012)開啟深度學習時代,訓練用幾塊到幾十塊GPU,電力成本相比人力成本微不足道,OpEx討論停留在“電費是不是該找行政報銷”階段。

中期(2017‑2020):Transformer與預訓練範式,訓練成本十倍增長
Transformer、BERT、GPT系列出現,訓練規模從數百GPU·天躍升至數千GPU·天,單次訓練電費可達數萬至數十萬美元。雲端廠商推出GPU例項,靈活的OpEx模式助力AI初創公司起步,但大型科技公司開始自建AI叢集以壓制長期OpEx。該階段,PUE最佳化和綠色資料中心概念悄然興起。

爆發期(2021‑至今):大型模型與生成式AI,推論OpEx成為商業核心
GPT‑3(2020)後,千億引數模型湧現,訓練成本以千萬美元計,單次訓練運營費佔比凸顯。2022年底ChatGPT將推論成本推至前沿:一次搜尋、一個對話,背後是成百上千次矩陣乘加。業界意識到,如果推論OpEx不能指數級下降,生成式AI的經濟模型將面臨嚴峻挑戰。於是,模型壓縮、MoE、量化、專用推論晶片(Groq、Cerebras、LPU等)和低功耗HBM成為熱點。液冷方案(GIGABYTE、NVIDIA的參考設計)從可選項變為AIDC的準標配,因為單機架功耗突破30kW,風冷已逼近極限。

趨勢總結:OpEx從一個財務KPI逐漸變為AI系統設計的第一性約束。每一次硬體代際更新、每一條新的壓縮技術、每一種冷卻方案,都可以在單位算力運營成本的下降曲線上找到座標。

技術路線對比

(以下表格中資料為行業公開討論的定性量級,非引用具體廠商財報,標註[估算]:)

對比維度大型模型純推論OpEx最佳化路線A:<br>雲端端通用GPU + 軟體最佳化路線B:<br>雲端端專用推論晶片(ASIC)路線C:<br>邊緣‑雲端協同推論路線D:<br>自建液冷叢集 + 蒸餾小模型
主要硬體NVIDIA A100/H100/B200等通用GPU,風冷或部分液冷Google TPU v5、AWS Inferentia、自研LPU端側NPU(手機/PC)+ 輕量雲端GPU液冷H800/B200等,部署蒸餾小模型
單次推論能耗(估算)中等(經最佳化後約0.5‑2 Wh/請求[估算],大型模型)較低(同模型下可降30‑50%功耗)端側極低(毫瓦級),雲端側分攤低(小模型引數少,視訊記憶體功耗低)
OpEx結構電費與雲端例項費為主,網路彈性開銷大晶片單價攤銷(雲端例項溢價),電費降低端側OpEx不計入服務商,雲端側若需則含出站流量與GPU費電費大幅降低,但需承擔液冷基礎設施CapEx(折舊)
靈活性極高,可隨時切換模型和並行策略低,硬體繫結特定編譯器/架構,模型適配週期長需模型分割或蒸餾,延遲敏感任務受限較靈活,但蒸餾小模型能力有上限
適用場景快速迭代、多租戶雲端推論,追求上市時間超大規模、穩定任務(如搜尋引擎、推薦)隱私敏感、即時AR/VR、離線翻譯成本極度敏感且任務相對固定(客服、程式碼補全)
中長期OpEx趨勢依賴GPU演進與規模效應,每年成本下降約20‑30%有望通過專用設計實現更陡的下降曲線邊緣成本趨零,但模型效果受限受限於小模型天花板,但運營成本極低

路線選擇本質上是OpEx的確定性與CapEx的靈活性之間的取捨。

上下游

上游:決定OpEx的基礎元素

  • 能源與供電:電力供應商、可再生能源開發商、電網設施——電價波動直接衝擊OpEx的30‑60%。
  • 製冷與散熱:精密空調、液冷CDU、冷卻液廠商(如3M的Novec被淘汰後,新氟化液供應商),其方案效率決定PUE和冷卻運營成本。
  • 晶片製造:晶圓廠的電耗、EUV光刻機的功耗,最終通過晶片價格和功耗間接影響AI系統的運營電費和冷卻需求。
  • 網路器件:光模組、交換器晶片(DSP、SerDes功耗),影響叢集內部通訊能耗。

下游:消化和感知OpEx的參與者

  • AI大型模型提供商:OpenAI、Anthropic、國內大型模型創業公司等,OpEx佔營收比例是生死線。
  • 公有雲端廠商:AWS、Azure、GCP、阿里雲端等,他們將硬體運營成本打包成例項價格,OpEx規模效應是其獲利來源。
  • SaaS/PaaS企業:依託大型模型API提供服務的公司,API呼叫費直接構成其OpEx,並轉嫁給終端使用者。
  • 終端企業使用者與消費者:通過訂閱費或按次付費,最終承擔所有上游累積的運營成本。

產業鏈獲利在OpEx上的分配
能源和晶片往往是最大受益者,大型模型服務商夾在中間,承受議價壓力。雲端廠商通過規模採購和自研晶片力圖壓低上游成本,向下遊提供價效比以搶佔市場。整個鏈條的最佳化焦點在於如何將不可壓縮的物理能耗轉化為可規模化複製的智慧輸出

關鍵指標

  • 單位算力成本($/GPU‑hour):最直觀的OpEx標尺,訓練和推論的單價。
  • PUE:衡量資料中心冷卻等非IT能耗效率,綠色運營的核心。
  • WUE(Water Usage Effectiveness):水資源利用率,液冷資料中心需關注的指標,影響水費和處理成本。
  • CUE(Carbon Usage Effectiveness):每單位IT能耗的碳排放,對應碳稅或碳積分成本。
  • 推論單價($/1M tokens) :大型模型商業定價的基礎,是對推論全棧OpEx的市場化折現。
  • 能效比(TOPS/Watt):晶片在單位功耗下的算力輸出,直接折算為電費。
  • 叢集利用率:實際有效算力/理論算力,低利用率意味著固定運維OpEx的浪費。
  • 運維人機比:每個運維人員管理的伺服器數量,人員類OpEx的槓桿指標。

供需與市場資料

(注:因聯網檢索失敗,本部分採用行業定性判斷與方向性闡述,具體數字均標[估算])

  • 電力需求爆發:據多家能源機構估算,2024年全球資料中心的電力需求約佔總髮電量的1‑2%,AI繁重負載推動這一比例未來數年可能提升至3‑5%[估算],引發部分地區電力瓶頸。
  • 成本結構變化:傳統資料中心IT裝置電費佔OpEx約40%,而AI叢集由於GPU高功耗,電費佔比可能達到50‑60%[估算]。
  • 液冷市場滲透:單機架 30kW+ 的散熱需求會推動液冷從試點走向規模部署,但不同機構對“新建 AIDC”“液冷採用比例”的口徑差異較大;本文不寫具體到 2027 年的滲透率預測,待補充可追溯報告後再量化。
  • 雲端推論定價競爭:各大雲端廠商的模型推論服務價格在過去一年下降約50‑80%[估算],倒逼技術降本,獲利空間被壓縮,部分創業公司難以承受持續的流血運營。
  • 人才市場:具有大規模叢集SRE經驗,能降低OpEx的人才薪酬溢價顯著,間接推高運維人力成本。

供需矛盾在於:算力需求爆炸式增長,但電力基礎設施擴容非一日之功,導致資料中心選址向電力充沛、綠電廉價地區(如北歐、美國中西部、中國西部)集中,運營成本的區域分化加劇。

代表公司與資本對映

  • 公有雲端巨頭(AWS / Azure / GCP):超大規模服務商,通過自研晶片(Graviton、Trainium、TPU)和長期電力協議,壓制OpEx,並從中賺取例項溢價。
  • NVIDIA:其GPU生態不僅定義算力供給,液冷參考設計、網路方案(Spectrum‑X)等也深度影響使用者OpEx。
  • 可再生能源與電力公司:NextEra Energy、Orsted、國家電網相關企業,隨著AI資料中心成為用能大戶,其長期PPA合同成為資本關注的標的。
  • 液冷解決方案商:Vertiv、CoolIT、高力熱處理(液冷板)、臺達等,受益於液冷普及,其產品直接影響AIDC OpEx。
  • AI創業公司(模型層):OpenAI、Anthropic、Midjourney、Character.AI等,其財務模型高度依賴推論OpEx的持續下降。即便營收快速增長,鉅額的運營開支使得多數仍處於虧損狀態,是典型的“高OpEx成長型”企業。
  • 邊緣推論晶片公司:如Hailo、地平線等,試圖通過將推論轉移到邊緣,從根本上改變OpEx的承擔主體。

資本對映:關注那些能系統性地降低AI運營支出的環節——高效晶片設計、先進冷卻、可再生能源整合、自動化運維平台。

投資邏輯

  1. 成本曲線套利:投資於能加速“單位推論成本每年降低50%+”的技術或企業,享受降本帶來的滲透率井噴。液冷、定製推論晶片、模型壓縮工具等屬於該主線。
  2. 能源瓶頸價值:當成資料中心密集建設與電網擴容脫節,版面配置具備穩定廉價電力(尤其綠電)的IDC資產,本質是獲取“低成本能源作為AI運營必需的稀缺資源”的價差。
  3. 工具與服務賦能:提供自動化叢集管理、可觀測性、最佳化編譯器的企業,幫助使用者提升GPU利用率5‑10個百分點,相當於直接削減等比例的OpEx,具備強付費意願和粘性。
  4. 商業模式篩選:警惕“高OpEx+低附加值”的純算力轉售型公司;重點拆解“利用技術將OpEx轉化為資料飛輪”的企業——只有當運營支出能生成獨特資料或模型壁壘時,其商業模式才更容易形成長期差異化。

常見誤讀糾偏

誤讀1:“上雲端就是純OpEx,自建就是純CapEx,所以要降OpEx就該全部上雲端。”
糾偏:上雲端雖將硬體轉化為按使用付費的運營支出,但雲端例項價格中已包含了雲端廠商的硬體折舊、獲利和運營成本,對穩態大規模使用者而言,其單卡小時全生命週期成本可能高於自建叢集的“折舊+運維OpEx”。因此,降低總擁有成本(TCO)需要在OpEx和CapEx之間尋找最優解,而非一刀切。

誤讀2:“OpEx越高說明公司投入越大、技術越先進。”
糾偏:高OpEx本身只是成本,唯有伴隨高毛利率或快速增長的客戶生命週期價值才值得。如果一個AI公司的運營支出增速長期超過營收增速,且每單位營收消耗的OpEx持續高位,那更像是燒錢陷阱而非投資未來。需要區分“創造壁壘的研發OpEx”和“維持現有服務的固定運營支出”。

誤讀3:“模型越小,推論OpEx一定越低。”
糾偏:小模型單次推論確實功耗較低,但若因精度不足需要額外重排序、多次重試或複雜後處理,反而可能增加總體OpEx。此外,小模型在使用專用推論晶片時可能利用率不高,導致攤銷到每次請求的晶片成本上升。因此,OpEx的下限取決於端到端的系統效率,而非單一模型引數量。

學習路徑

  1. 基礎會計與財務:瞭解獲利表(Income Statement)中Operating Expense的構成,理解現金支出與權責發生制下折舊的區別。
  2. 資料中心架構入門:閱讀《Datacenter as a Computer》(Google),掌握PUE、冷卻、電源拓撲等基礎,理解物理運營成本從何而來。
  3. AI系統性能分析:學習GPU效能剖析工具(nsight、rocProfiler),瞭解功耗模型、利用率、視訊記憶體頻寬瓶頸,建立“程式碼‑功耗‑電費”的對映能力。
  4. 雲端運算計費模式:實踐三大雲端廠商的計費規則,掌握預留例項、競價例項、節省計劃如何影響OpEx;分析爆款AI應用的月度賬單。
  5. 行業報告追蹤:定期查閱Uptime Institute、IEA(國際能源署)關於資料中心能源的報告;關注半導體的功耗演進(TSMC、NVIDIA GTC)。
  6. 動手實踐:部署一個開源LLM推論服務,測量不同batch size、量化等級下的GPU功耗與吞吐,計算$ per 1M tokens的實際成本,直觀感受OpEx。

一句話總結

OpEx是AI商業化的重力場——誰的模型以更低的運營成本實現同等的智慧,誰就擁有定義賽道的引力。

延伸閱讀與來源

  • Barroso, L.A., Hölzle, U., & Ranganathan, P. (2019). The Datacenter as a Computer: An Introduction to the Design of Warehouse-Scale Machines (3rd ed.). Morgan & Claypool.
  • Patterson, D., et al. (2021). Carbon Emissions and Large Neural Network Training. arXiv:2104.10350.
  • NVIDIA. NVIDIA AI Enterprise Documentation – Power Efficiency and Performance Tuning.
  • Uptime Institute. Global Data Center Survey 各年度報告.
  • IEA. Data Centres and Data Transmission Networks 專題報告.
  • Google Cloud. The Nuts and Bolts of Machine Learning Operations 系列部落格.
  • 由於本次搜尋失敗,未獲得聯網資料,以上推薦僅為方向性展望,具體數字請以各機構最新發布為準。
source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型