網路層 開放閱讀

容量管理

Capacity Management

概念 ID
capacity-management
更新時間
2026-05-29
來源數量
待補

容量管理

3 秒看懂

容量管理(Capacity Management)是在成本與效能之間持續尋求最優解的一套實踐體系。在 AI 算力時代,它不只是買多少 GPU,而是決定:何時擴容、用什麼形態擴容(自建/租賃/雲端)、如何讓 GPU 叢集在波峰波谷間既不空轉也不過載,並且確保推論延遲不突破業務 SLA。本質是對“供給彈性”與“需求不確定性”的動態匹配。

當前 AI 算力市場正經歷結構性供需失衡:據 Omdia 2024 年測算,全球頭部雲端服務商 GPU 叢集平均利用率僅約 45%–55%,但訓練高峰時段排隊時間仍可達數週(公開資料綜合估算,截至 2024Q3),凸顯容量管理能力分化。有效的容量管理可使同等硬體規模多產出 20%–40% 的有效算力(Goodput),直接轉化為模型迭代速度和市場領先身位。

3 分鐘產業解釋

傳統 IT 容量管理關注 CPU、記憶體、儲存,週期以“月”計。AI 基礎設施的容量管理則被三個因子徹底改寫:

  • 極致的資源集中度:千卡、萬卡叢集是基本單位。據 NVIDIA 2024 年 GTC 揭露資料,單個 H100 8-GPU 節點的系統採購成本約 30 萬–40 萬美元(含網路/儲存配套,價格隨時間與配置浮動),萬卡叢集初期投資超 3 億美元。一個算力池的採購決策踩錯節奏會造成鉅額沉沒成本或機會損失。
  • 負載的高度不可預測性:大型模型訓練任務規模持續膨脹,以 Llama 3 70B 為例,據 Meta 2024 年公開技術報告,其訓練使用約 24,000 塊 H100 GPU,訓練時長約 54 天((引用來源:Meta AI 官方部落格, 2024 年 4 月))。多租戶訓練、推論混部成為常態,作業到達時間、資源需求都近乎隨機。
  • 供給側的物理剛性:GPU 供應受限於台積電 CoWoS 先進封裝產能。據台積電 2024 年 Q2 法說會揭露,CoWoS 產能 2024 年預計年增率增長超 100%,但仍無法滿足全部客戶需求,交期長達數月(公開資訊整理,截至 2024 年 7 月)。HBM 儲存同樣由 SK 海力士、三星、美光三寡頭供應,擴產節奏以年度為單位。

因此,AI 容量管理從“後臺職能”上升為決定 AI 業務天花板和毛利率的核心競爭力。它要求將供應鏈管理、資料中心電力/冷卻規劃、訓練/推論排程策略、FinOps 成本模型熔於一爐。

技術原理

核心邏輯:容量管理 = 需求預測 + 資源抽象 + 排程策略與控制閉環。

1. 需求到容量的對映關係

一個典型的分散式訓練作業對容量的需求可拆解為三個維度:

  • 視訊記憶體容量:模型引數、最佳化器狀態(如 Adam 需額外 2 倍引數量儲存)、啟用值總和必須小於每卡 HBM 容量。以 H100 80GB SXM 版本為例,單卡 HBM 容量 80GB((資料來源:NVIDIA H100 官方規格表, 2024 年))。若超限,需通過張量並行(Tensor Parallelism)、流水線並行(Pipeline Parallelism)或啟用重計算(Activation Recomputation)來拆解,從而影響所需總卡數和通訊開銷。
  • 算力吞吐:受單卡有效 FLOPS、卡間通訊頻寬、並行策略效率共同決定。H100 在 FP8 下標稱 1,979 TFLOPS(稀疏),實際訓練場景有效利用率約 45%–65%(行業經驗值,據 MLCommons 2024 年訓練 benchmark 公開結果推算)。
  • 時間視窗:作業期待的完成時間(SLA)倒推所需並行度和總節點數。訓練作業 SLA 通常以“步時”(step time)和“總時長”雙重約束。

用排隊論簡化表達:若作業到達速率 λ,每作業平均服務時間 1/μ(由叢集規模決定),服務檯數量(泊位數量)c,則平均排隊時間近似適用 Erlang C 公式。容量管理就是要動態調整 c,使排隊時間 < 閾值,同時讓利用率 ρ = λ/(cμ) 儘可能高。實際系統中,λ 和 μ 均隨時間變化,需引入時序預測模型動態估計。

2. 資源池化與彈性伸縮

下圖展示一種典型 AI 雲端容量管理架構的抽象模型(ASCII):

+-----------------------------------------------------+
|                  作業管理層                         |
|  請求佇列 --> 優先順序排序 --> 畫像匹配 --> 授權       |
+------------------+----------------------------------+
                   | 指示需求 (GPU數, 拓撲, 時間)
+------------------v----------------------------------+
|              統一資源排程器                         |
|  資源檢視: [專用池: 已預留/空閒]                    |
|            [彈性池: 執行中/可搶佔/待回收]           |
|  策略引擎: 容量預測 + 決策                         |
|  - 預測未來 L 個時間步的池內空閒容量 (時序模型)     |
|  - 若預測缺口 > 閾值,觸發擴容 (向雲端供應商/裸金屬)  |
|  - 若預測冗餘 > 閾值,縮容或下線節點(需考慮終止代價)|
+------------------+----------------------------------+
                   | 排程指令 (建立/刪除例項,路由流量)
+------------------v----------------------------------+
|            物理 / 虛擬化基礎設施                     |
|  GPU節點池 (每節點: 8xH100/B200 + NVSwitch + 800G)  |
+-----------------------------------------------------+

預測模型通常採用時序方法(如 Prophet、時序 Transformer)擬合每日/每週週期性模式(如夜間推論波谷、日間訓練波峰),並將日曆事件(如新產品釋出預期帶來的推論洪峰)作為外生變數輸入。由於物理 GPU 供應滯後,預測步長需覆蓋“下單→交付→上架→可用”全鏈路週期——在 2024 年供給緊張期,該週期可達 4–6 個月(行業經驗資料),因此對長期趨勢敏感度要求極高。

3. 控制閉環與成本維度

每個擴容決策都伴隨成本核算:自建節點的一次性 Capex + 運營 Opex(電力、頻寬、運維),對比公共雲端按需/預留例項價格。

以某主流雲端服務商 2024 年公開定價為例:H100 8-GPU 裸金屬例項按需價格約 $26–$32/GPU/小時(不同區域有異),年化約 $230,000–$280,000/GPU。而自建同等算力節點的 3 年攤銷成本(含電力、冷卻、運維)約 $150,000–$200,000/GPU/年(行業綜合估算,非精確報價)。容量管理的核心是動態決策使兩者組合的邊際成本最低。

在混合雲端模式下,容量管理需實現成本感知排程:將低優先順序、可中斷任務(如實驗性微調、批次推論)排程至彈性低成本資源池(可搶佔例項、競價例項,折扣通常 60%–90%),高穩定性要求任務(基座模型持續訓練)保留在專有高可用池。

關鍵引數

以下為 AI 容量管理評估中常用的核心引數體系,具體數值因企業與叢集而異:

引數類別引數名稱釋義與影響行業參考區間(2024 年)
利用率指標算力利用率 (MFU)有效計算量/理論峰值計算量,業內標杆訓練 MFU 通常 45%–60%萬卡叢集穩定訓練:50%+,混部後因切換波動可能降至 40%–50%(公開學術論文綜合)
視訊記憶體利用率已分配視訊記憶體/總 HBM 容量推論場景 70%–90% 可接受,訓練場景接近 100%(常態)
節點空置率無作業執行的 GPU 節點佔總節點比例建議低於 5%,但實際因拓撲碎片化常高於此值
延遲指標作業排隊時間 (P95)作業從提交到開始執行的時間高優任務目標 < 1 小時,低優任務可接受數小時至數天
擴容響應時間從擴容決策到新節點可接任務的端到端時間雲端環境:分鐘級;裸金屬供應:數週至數月
質量指標SLA 違約率任務因容量不足超過預期完成時間的比例頭部企業內控目標 < 1%
搶佔率低優任務在執行中被強終止以釋放資源的比例需與排隊時間權衡,高則作業浪費多
成本指標單位有效算力成本總擁有成本(TCO)/ 有效總算力產出需內部橫評,差別可達 30%+
容量緩衝週數現有空閒容量可覆蓋未來幾周需求增長的預估時長業界非公開資料,通常建議 2–4 周

> 注:以上區間為行業公開報告與學術論文中出現的經驗值,非單一企業精確揭露,僅供參考。

技術路線

下表對比幾種容量管理策略的定性差異(基於 2024 年行業實踐綜評):

策略維度靜態專用池多雲端/混合雲端彈性全動態共享池 + 搶佔
利用率潛力低(~30%–50%)中高(~50%–70%)高(>70%)
任務延遲控制極穩定,無排隊擴容延遲(分鐘級)排隊不確定性高,依賴搶佔策略質量
成本結構Capex 為主,折舊剛性Opex 彈性,但 3 年累計成本通常高於自建混合,需精細核算
供應鏈依賴極強(需提前數月採購)中等(依靠雲端廠商資源池)中等,需自有基座 + 雲端溢位
技術複雜度高(排程/預測/回收邏輯複雜,需自研或深度定製)
適用場景確定性極強的基座模型預訓練波峰補充、多區域覆蓋、突發流量大量高優/低優混部實驗場景
代表技術棧手工分配物理叢集K8s Cluster Autoscaler + 雲端廠商預留例項 APIVolcano/自定義排程器 + 統一資源管理器 + 預測引擎

2024–2025 年主流演進方向:企業正從“單一策略”走向“分層混合策略”——核心訓練用專用池(佔總量 30%–50%),彈性任務用可搶佔池(佔 20%–30%),突發需求由雲端溢位(佔 20%–40%)。部分頭部 AI 實驗室已在探索引入強化學習方法,直接最佳化長期擴容動作序列以最小化總成本與違約懲罰的折現值((來源:學術預印本 arXiv,2023–2024 年相關論文,具體廠商應用案例公開資料未見))。

上游

容量管理的上游是物理世界產能與資源配置,構成剛性的外生約束:

  • GPU 晶片及先進封裝:NVIDIA 佔據 AI 訓練/推論 GPU 市場主導份額。據 Mercury Research 與第三方分析師綜合估算(2024Q2),NVIDIA 資料中心 GPU 出貨量市佔率超 90%。下一代 B200/B100 晶片採用台積電 4NP 工藝及 CoWoS-L 封裝,單晶片電晶體數超 2,080 億((來源:NVIDIA 2024 GTC 官方釋出))。台積電 CoWoS 產能 2024 年月產能預計年底達約 3.5 萬–4 萬片晶圓當量,2025 年繼續擴產((來源:台積電 2024Q2 法說會紀要)),但仍為 GPU 供應的核心瓶頸。
  • HBM 高頻寬記憶體:HBM3E 是 H100/B200 的關鍵配套。SK 海力士 2024 年佔據 HBM 市場約 50% 份額((來源:TrendForce 2024Q1 報告)),美光、三星正在追趕。HBM 生產良率和產能擴張節奏直接影響 GPU 出貨量。
  • 資料中心電力與冷卻:單機架功耗從傳統 5–10kW 飆升至 AI 機架的 30–100kW。據 IEA(國際能源署)2024 年報告,全球資料中心電力消耗 2022 年約 460TWh,預計 2026 年達 1,000TWh 以上,AI 負載是主要增量。電力批覆和電網接入成為新建資料中心的關鍵路徑瓶頸,部分地區(如北維吉尼亞、新加坡、荷蘭)已實行限制或排隊審批((來源:公開行業報道綜合))。
  • 網路裝置:InfiniBand(NVIDIA Mellanox)和乙太網路 800G 光模組/交換器是 GPU 叢集互聯的基礎。據 LightCounting 2024 年報告,800G 光模組出貨量 2024 年將達數千萬只級,供應緊張期已過,但仍然集中掌握在少數供應商手中。

容量管理的任務,是精確將這些上游約束內化為自己的“可擴容時間表”與“成本模型”,避免做出無法兌現的擴容承諾。

下游

下游是驅動容量需求的全部業務負載,容量管理將其轉化為對上游的採購訊號:

  • 大型模型訓練:基座模型規模持續擴大。以 GPT-4 為例(未公開官方引數,行業估算約 1.7 萬億–1.8 萬億引數,MoE 架構,來源:SemiAnalysis 2023 年分析),訓練所需算力動輒數萬卡·月。此類任務對容量連續性要求極高,中斷即意味著進度與成本損失。
  • 模型微調與實驗:數百至數千卡規模的中小型訓練任務,頻次高、生命週期短(數小時至數天),是構成需求高度波動的主體。
  • 推論服務:隨著 GPT-4o、Claude 3.5 等大規模模型部署,推論負載出現明顯的“周內潮汐”和“事件激增”(如新版本釋出)。推論對延遲敏感,要求容量管理在靠近終端使用者的邊緣/區域節點預置 GPU。
  • 多租戶 AI 平台:對內服務多業務線的統一 AI 平台,面臨“多優先順序、多SLA”的複雜排隊問題。

容量管理的核心價值之一,是將下游多個團隊的非結構化“期望上線時間”轉化為結構化“資源預約”,並反饋給業務方以引導需求平滑化。

受益公司

以下按業務屬性分類,不構成任何投資建議,僅為產業鏈生態梳理:

1. 公有雲端服務商(海外) Amazon Web Services、Microsoft Azure、Google Cloud 通過全球區域擴張與自研晶片(AWS Trainium2、Google TPU v5p)建置海量資源池。據 Synergy Research 2024Q1 資料,三大海外雲端廠商合計佔全球雲端基礎設施市場份額約 67%。其容量管理能力體現為全球庫存調配與定價策略(預留例項、競價例項、容量預留計劃),資本大量投向資料中心基建,2024 年三家合計 Capex 展望超 1,500 億美元((來源:各公司財報與公開展望,截至 2024Q2))。

2. 公有雲端服務商(國內) 阿里雲端、華為雲端、騰訊雲端等受高階 GPU 供應約束,容量管理更強調“精細分時複用”和“存量挖潛”,催生大量排程平台創新。公開招投標與行業會議資訊顯示,多家國內雲端廠商正大力投入自研排程器與算力池化技術,具體效能資料公開資料未見。

3. 獨立 AI 實驗室與模型公司 部分頭部實驗室(如 OpenAI、Anthropic、國內 DeepSeek、智譜等)長期面臨“有錢買不到卡”或“買了卡但用不好”的困境。容量管理決定了其技術產出的節奏,在融資敘事與商業合同中成為關鍵效率指標。

4. AI 基礎設施軟體公司 一批 FinOps 和 AI 基礎設施管理軟體公司興起,提供跨雲端容量預測、成本最佳化、算力編排工具。例如,基於 Kubernetes 的 AI 排程平台(如 Run:ai,已於 2024 年被 NVIDIA 收購)、向量化成本管理工具等,被資本視為“算力淘金熱中的賣水人”。具體市場份額資料公開資料未見。

市場規模

由於 AI 容量管理屬於基礎設施管理市場中的新興細分,暫無獨立第三方市場規模資料。可從相關市場間接推演典型量級:

  • 全球資料中心基礎設施市場:據 Gartner 2024 年估計,全球資料中心繫統支出(含伺服器、儲存、網路)2024 年將達約 2,600 億美元,其中 AI 相關伺服器佔比正在快速攀升。
  • 雲端基礎設施服務市場:據 Synergy Research Group 2024Q1 資料,全球雲端基礎設施服務市場規模年化超 3,000 億美元(含 IaaS/PaaS,不含 SaaS)。容量管理工具/平台歸屬其中自動化與管理軟體子類,該子類佔比約 5%–8%(估算約 150 億–240 億美元/年)。
  • AI 伺服器出貨:據 TrendForce 2024 年預測,2024 年全球 AI 伺服器出貨量將超 160 萬臺,年增率增長約 40%,2025 年持續增長。AI 伺服器的容量利用率每提升 10 個百分點,相當於釋放數百萬 GPU·小時的有效算力,經濟學含義顯著。
  • FinOps 工具市場:據 IDC 2024 年估算,全球雲端成本管理與最佳化工具市場規模 2024 年約 20 億–25 億美元,預計 2027 年達到 50 億美元。AI 容量管理是 FinOps 的高階演進方向。

> 以上數字均為行業通用市場估算,非精確值,口徑各有差異,不構成對具體公司業績的判斷。

玩家對比

公有雲端自研方案 vs. 第三方平台(基於 2024 年公開產品文件定性比較):

維度雲端廠商原生方案(AWS/ Azure/ GCP)第三方 AI 排程/FinOps 平台
整合深度與自家硬體、網路、預留例項無縫打通需適配多雲端 API,整合成本較高
策略靈活度限於廠商提供的策略模板(如 AWS Compute Optimizer)可深度定製搶佔策略、排隊演算法、成本模型
鎖定風險強繫結單一雲端生態跨雲端/混合雲端友好,降低供應商鎖定
技術門檻開箱即用,適合標準化場景需自建運維與開發能力
費用模型通常與雲端賬單掛鉤(成本最佳化收益分成)訂閱制或按託管節點計費,具體因廠商而異

國內主要 AI 雲端廠商容量管理能力粗略比較(基於公開資訊、行業調研,2024 年定性綜合,不排序):

  • 阿里雲端(通義千問生態):依託自研靈駿智算叢集,支援 ECS 異構計算例項的彈性伸縮,對外提供 PAI-靈駿平台統一排程,強調“訓推一體”資源複用。
  • 華為雲端(昇騰生態):基於 Ascend 910B 組網,推出 ModelArts 平台與盤古大型模型協同,在自有硬體的容量模型一體化方面有天然優勢。
  • 火山引擎:通過自研 Kubernetes 排程系統支撐豆包系列模型,對外提供機器學習平台,強調 GPU 共享與池化能力。
  • 百度智慧雲端:依託百度百舸異構計算平台,對外提供算力排程和最佳化,強調對崑崙芯與 NVIDIA GPU 的異構支援。

> 以上描述均基於各廠商官方產品頁面與2024年技術會議公開分享,不作主觀優劣評價。

風險

  1. 供應鏈預測失準風險:若需求預測系統性偏低,導致算力缺口持續數月,可能直接推遲關鍵模型迭代進度,在競爭視窗期產生不可逆落後。反之,若過度採購而需求增速放緩,則造成產能過剩和資產折舊壓力——GPU 硬體迭代週期僅 2–3 年(H100 到 B200 僅約 2 年),過剩庫存在新一代產品釋出後迅速貶值。
  2. 技術複雜度與管理成本風險:完善的容量管理系統需要一支跨學科團隊(系統工程師、資料科學家、供應鏈專家),人力成本高且人才稀缺。如果自研排程系統的質量不達預期,可能出現“自動化擴大損失”的災難場景(如錯誤地同時回收所有彈性節點)。
  3. 單點依賴與鎖定風險:若過度依賴單一雲端廠商的容量生態(如預留例項、專用叢集),議價能力將隨時間削弱,資料遷移和切換成本高昂。
  4. 物理約束不可抗力:電力批覆延遲、光纖切斷、液冷系統故障等物理事件,可瞬間使精心規劃的容量模型失效。2023–2024 年間已出現多起因電網容量不足導致的新資料中心專案擱置案例((來源:公開新聞搜尋)),具體影響規模公開資料未見系統統計。
  5. 安全與合規風險:跨雲端/多雲端容量管理中,資料與模型在多環境間流動,增加了攻擊面和合規復雜性(如 GDPR 資料跨境約束),可能限制彈性資源的排程範圍。

誤讀糾偏

誤讀 1:“容量管理就是擴容,什麼時候缺了再買。” 糾偏:物理 GPU 交期長達數月(H100 在 2023–2024 年部分時間段交期 > 6 個月),缺了再買意味著數月的創新停滯。真正的容量管理是“先於業務看需要,先於供給下訂單”,預測與決策前置。這要求在需求訊號尚模糊時就啟動供應鏈動作,是一種“管理不確定性”而非“管理確定性”的能力。

誤讀 2:“只要上了 Kubernetes 彈性伸縮,利用率就能大幅提升。” 糾偏:Kubernetes Cluster Autoscaler 提供的是執行機制,而非決策智慧。若無精確的負載預測和精細的成本-效能策略,純粹基於 CPU/GPU 使用率閾值的彈性伸縮可能導致:① 節點頻發建立/銷燬(振盪),增加排程延遲與資源浪費;② 未考慮訓練作業的“粘性”(Checkpoint 儲存/載入的時間成本),盲目回收造成進度丟失。AI 容量管理的核心在“大腦”(預測與決策引擎)而非“四肢”(擴縮容執行器)。

誤讀 3:“容量利用率越高越好。” 糾偏:當利用率超過 70%–80% 時,排隊論效應導致作業等待時間呈指數級增長(Erlang C 的非線性尾部)。在 AI 場景,過度追求高利用率會導致高優先順序訓練任務排隊時間不可控,最終損害業務敏捷性。容量管理的目標是“在 SLA 約束下最大化利用率”,而非絕對最大化利用率。

最新事件

(截至 2025 年 7 月,以下為近期可追蹤的行業動態,基於公開報道整理)

  • NVIDIA Roadmap 加速:NVIDIA 在 2024–2025 年間釋出 Blackwell (B200/B100) 架構並宣佈 Rubin 平台(2026 年預期),AI GPU 代際間隔縮短至約 1 年。容量管理面臨更短的硬體折舊週期和更復雜的異構算力排程挑戰((來源:NVIDIA 官方新聞稿及投資者會議))。
  • 雲端廠商容量預留產品迭代:AWS 推出“Capacity Blocks for ML”功能,允許使用者預約未來日期的 GPU 叢集時間塊,本質是將容量管理中的“確定性需求”對外產品化。Google Cloud 推出“Dynamic Workload Scheduler”類似功能。這標誌著容量管理能力正從內部工具走向對客產品((來源:各雲端廠商 2024 年產品釋出部落格))。
  • AI 資料中心的“電力危機”討論升溫:多家國際媒體(Reuters, Bloomberg, 2024 年)報道,AI 算力需求的電力消耗預期引發監管與ESG關注,部分地區電網已對新增大型資料中心審批趨嚴。容量管理必須納入“電力可獲性”作為一級約束。
  • CoWoS 產能再擴張:台積電 2024 年連續多次上調 CoWoS 產能規劃,並啟動海外先進封裝廠建設(如日本),預期 2025–2026 年產能翻倍以上。這將在中期逐步緩解 GPU 的供給剛性,但對短期(12 個月內)的容量管理決策影響有限((來源:台積電公開法說會及新聞稿))。
  • DeepSeek-V3 等高效模型引發關注:2024 年底–2025 年初,國內 DeepSeek 等團隊釋出的高效模型(如 DeepSeek-V3)在更少算力下達到接近頂級效能,引發“算力效率革命”討論。這並不意味著算力需求見頂,但加劇了企業在容量投資上的“觀望與等待”心理,容量管理決策的博弈性上升((來源:公開技術報告及媒體分析))。

追蹤指標

以下為持續評估和追蹤 AI 容量管理水平及行業態勢的關鍵指標,按頻率分列:

高頻(月度/季度觀察)

  • 主要雲端廠商 GPU 例項可用區域增減(AWS/GCP/Azure 區域列表更新,觀察是否在更多區域上線 H100/B200 例項)
  • GPU 現貨/預留例項的公開價格變動(單位:美元/GPU·小時),反映供需鬆緊
  • 台積電月度營收資料及 CoWoS 產能相關新聞(季報/法說會)
  • AI 頭部企業(如 OpenAI、Anthropic、國內大廠)的模型釋出頻率與訓練規模公開揭露

中頻(季度/半年深度追蹤)

  • 主要資料中心 REITs 和 IDC 公司的財報,觀察電力獲取、上架率、大客戶簽約動向
  • NVIDIA 季度財報中的資料中心業務營收與供給展望(產品過渡期、庫存水平)
  • 雲端廠商資本支出(Capex)總額及與 AI 基礎設施相關項的拆分說明
  • 學術/行業會議(MLSys, OSDI, SIGCOMM)中 GPU 叢集排程前沿論文

低頻(年度戰略參考)

  • IEA 全球資料中心能源消費年度報告
  • Gartner/IDC AI 基礎設施市場預測更新
  • 各主要雲端廠商 AI 容量管理相關新產品的引數對比
  • AI 安全/合規政策變化(如 EU AI Act 對訓練算力的申報要求)

> 涉企業名稱的指標均為公開可獲得資訊,不依賴內幕調查。

信源

  1. NVIDIA – 官方規格表(H100, B200)、GTC 2024/2025 公開 keynote 與新聞稿。
  2. 台積電 – 季度法說會紀要與新聞中心公告(CoWoS 產能相關)。
  3. Meta AI – “Introducing Meta Llama 3” 官方部落格 (2024 年 4 月) 及對應技術報告。
  4. Google DeepMind/Cloud – Borg/Omega/K8s 系列論文及 Autopilot 相關發表;Dynamic Workload Scheduler 產品文件。
  5. Amazon Web Services – Capacity Blocks for ML 及其他預留例項策略官方文件。
  6. Synergy Research Group – 雲端基礎設施市場份額季度報告 (2024Q1)。
  7. TrendForce – AI 伺服器出貨預測及全球 HBM 市場份額 (2024)。
  8. LightCounting – 光模組市場季度報告 (2024)。
  9. IEA – “Electricity 2024 – Analysis and forecast to 2026”。
  10. 學術會議 – MLSys (2023–2024)、OSDI (2022–2024)、SIGCOMM (2023–2024) 中與 GPU 叢集排程、預測性擴容、容量管理相關論文。
  11. 第三方分析 – SemiAnalysis、Omdia、IDC、Gartner 公開摘要(收費報告原文未引)。
  12. 公開新聞報道 – Reuters、Bloomberg、The Information 關於 AI 資料中心電力、GPU 交付延遲的相關報道。

宣告:本文所有涉及市場資料的數字均已標註來源與年份,部分為行業綜合估算區間,口徑差異已在上下文中說明。對於檢索不到的具體企業財務資料或未公開市場份額,均標註為“公開資料未見”。本文僅作概念與行業原理解釋,不構成任何投資建議、薦股或買賣方向判斷。

source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型