Reserved Capacity(預留容量)
1. 3 秒看懂
一種源於雲端運算,但在AI算力時代成為戰略工具的資源保障與成本鎖定機制。使用者向雲端或算力服務商提前承諾未來一定週期(通常1年/3年)的資源用量,以此換取價格折扣(通常較按需低30%-70%)和容量保證。它把算力從“隨用隨付”的彈性資源,變為一種帶有金融屬性的確定性產能預售產品。
2. 3 分鐘產業解釋
大型模型訓練和推論對GPU叢集的需求急劇膨脹,而高階GPU長期供不應求。Reserved Capacity(預留容量)正是在這一背景下,連線算力供需雙側的核心商業設計。
- 需求側(AI企業、研究院所): 他們要跑百萬美元級的訓練任務,最怕兩件事——成本失控和資源供給突然中斷。簽署預留容量合同好比提前“鎖倉”算力:能拿到按需價格五折甚至更低的折扣,讓CFO可預測開支;同時也獲得合同級別的可用性承諾,避免訓練中途因資源回收而崩潰。
- 供給側(雲端廠商、GPU算力平台): 它們可以提前看到需求訊號,據此更有節奏地下單採購昂貴的GPU、規劃機架和冷卻,把資產閒置率壓到最低;並且預收款和合同義務直接轉化為可觀的剩餘履約義務(RPO),向資本市場證明未來營收可見性,最佳化現金流量。
簡單說,Reserved Capacity就是把算力從“外賣按單做”變成了“預售套餐”,在AI算力極度飢渴的當下,它已經不只是折扣手段,而是從晶片到雲端服務整條供應鏈的資源排程語言。
3. 技術原理
Reserved Capacity並非一項硬體技術,而是構築在資源虛擬化、隔離、排程與計量之上的一整套系統能力。
資源池化與隔離 物理GPU計算節點首先通過GPU直通(PCIe Passthrough)、單根I/O虛擬化(SR-IOV)或NVIDIA多例項GPU(MIG)等技術,將一臺8卡H100伺服器細分成若干邏輯單元。每個單元繫結獨立的視訊記憶體、算力份額和故障域,組成預留資源池。與此並行存在的還有按需資源池,供非預留任務競爭使用。
排程編排 預留容量的核心是一個容量感知排程器。它維護一張“承諾-資源”對映表,記錄每個客戶已購買的時間視窗內,必須確保多少張GPU、什麼型號。當客戶提交任務,排程器優先從對應預留池分配資源;一旦預留池出現壓力,排程會提前告警或突發溢位到按需池,並保證預留任務的搶佔優先順序最高。
計量與計費 精密計量是商業模式的基礎。系統以秒級精度記錄每個預留例項的啟動時間、佔用卡數、超出部分用量,再按照合同約定的預付方案(全預付/部分預付/零預付)和折扣率生成賬單。對客戶而言,使用預留容量就像持有一張“算力儲值卡”,在承諾範圍內消費時不再按高價計費。
多租戶下的確定性保障 系統會為預留客戶設定排程權重和資源標記,在資源緊張時執行嚴格的准入控制——寧可拒絕新的按需請求,也要保障預留客戶的承諾容量。部分實現還支援突發到物理隔離的專用叢集,提供單租戶級別的安全與效能確定性。
[預留容量排程系統示意]
物理GPU叢集 (例如數百節點、每節點8×H100)
│
┌───────┴───────┐
│ 分割槽/直通/MIG │ 資源隔離層
└───────┬───────┘
│
┌───────┴──────────────────────┐
│ 容量感知排程器 │
│ ┌─────────────────┐ │
│ │ 預留池A: 客戶X │ │
│ │ 保證128×H100 │ │
│ └─────────────────┘ │
│ ┌─────────────────┐ │
│ │ 預留池B: 客戶Y │ │
│ │ 保證64×A100 │ │
│ └─────────────────┘ │
│ ┌─────────────────┐ │
│ │ 按需池: 其餘資源│ │
│ └─────────────────┘ │
└──────────────────────────────┘
│
┌───────┴────────┐
│ 計量與計費引擎 │
└────────────────┘
4. 關鍵引數
一份預留容量合同通常由以下引數定義,它們直接決定價格、靈活性和財務風險。
| 引數 | 說明 | 典型取值/示例 |
|---|---|---|
| 承諾期限 (Term) | 使用者承諾付費的時間長度。期限越長,年化折扣越大。 | 1年、3年(部分廠商提供按月遞增的靈活期限) |
| 預付選項 (Payment Option) | 在承諾期內提前支付部分或全部費用,換取更深的折扣。 | 全額預付(All Upfront)、部分預付(Partial Upfront)、零預付(No Upfront) |
| 例項靈活性 (Instance Flexibility) | 預留是否可跨例項族、跨代、跨可用區自動匹配。靈活性越高,使用者被硬體迭代鎖定的風險越小。 | AWS Savings Plans可跨例項系列;標準RI則鎖定更窄範圍 |
| 容量保證等級 (Capacity Reservation Tier) | 是保證特定物理GPU型號(如“H100 SXM 80GB”),還是僅保證等效算力(如“TFLOPS級”。前者供應確定性更高,但價格更貴。 | 特定型號保證 vs. 效能當量保證 |
| 區域和可用區範圍 (Scope) | 預留容量是僅限單一可用區還是可在區域內遷移,影響容錯能力。 | 單可用區預留、區域性預留 |
| 違約條款 | 提前退訂的罰則,通常需一次性支付未滿期限的一定比例費用;部分廠商允許二次出售未用容量。 | 支付剩餘金額的30%~50%(不同廠商有差異) |
5. 技術路線
預留容量的商業形態經歷了從虛擬化時代到AI原生時代的演進,目前大致存在三條路線。
路線一:傳統雲端廠商預留例項模式 始於AWS 2009年的Reserved Instances(RI),後演化出Savings Plans、Committed Use Discounts(GCP)等。該路線的核心是通用化的算力保證,覆蓋從CPU到GPU的各種例項,配套完整的雲端服務生態(網路、儲存、安全、資料庫、AI/ML平台)。微軟Azure在2024年也持續強化其Azure Reserved VM Instances與Azure Savings Plan for Compute的折扣深度和覆蓋範圍。這類預留的特點是起售單位小(可單卡起訂)、生態最全,但是受到雲端廠商自身向上遊採購總能力的限制。
路線二:垂直GPU雲端預留叢集 以CoreWeave、Lambda Labs、Together AI等為代表。它們專注於大規模GPU叢集,直接將“N個H100/B200節點”以1-3年合同形式出租給AI實驗室。合同往往圍繞特定GPU型號、網路拓撲(如InfiniBand)定製,折扣比雲端廠商更大(行業估算低30%-50%)。缺點是與下游客戶的繫結極為集中,且缺少傳統雲端的PaaS層服務,要求客戶具備更強的工程能力。這條路在2023-2024年吸納了巨量資本,成為AI算力供應的關鍵一極。
路線三:自主採購 + 內部預留池 超大規模使用者(如Meta、Google、Tesla)採用自行採購GPU伺服器,建設私有資料中心,然後在內部分配給各AI團隊,本質上是一種“內部Reserved Capacity”。這類模式資本支出(CapEx)極高,但消除了供應商溢價,且完全控制技術棧。不過,它也承擔了全部硬體迭代風險和閒置成本。
三條路線不是完全互斥。許多AI公司會混合使用:核心訓練用內部叢集或垂直GPU雲端預留,突發推論用大型雲端廠商的預留例項。
6. 上游
預留容量的供給能力高度依賴底層硬體供應鏈,主要環節包括:
- AI加速晶片設計 NVIDIA(A100、H100、H200、B200系列)主導市場;AMD(MI300X等)和Intel(Gaudi系列)也在持續滲透。NVIDIA的CUDA生態是客戶鎖定預留合同的關鍵引力。
- 先進晶圓製造與封裝 台積電(TSMC)的CoWoS封裝產能是GPU出貨的核心瓶頸。2024年臺積電仍在持續擴充CoWoS產能,但供不應求的格局驅使雲端廠商與NVIDIA簽訂更長的供貨合同,以優先獲得封裝視窗。
- 高頻寬記憶體(HBM) SK海力士、三星、美光是HBM3/3E的主要供應商。每顆H100需要約6顆HBM,H200則更多。HBM的產能與價格直接影響GPU成本和交貨週期,進而影響預留容量的定價。
- 伺服器ODM與系統整合 超微(Supermicro)、廣達、緯穎、英業達等將GPU建置成整機,部分直接交付給雲端廠商與算力平台。垂直GPU雲端有時會繞過品牌伺服器廠商,直接與ODM合作,以壓縮交付週期和成本。
- 網路與互聯 NVIDIA InfiniBand/Mellanox、博通等提供GPU間的高速互聯方案;400G/800G交換器是保證大規模預留叢集效能的關鍵。越是大規模預留,網路配套越成為剛性約束。
7. 下游
預留容量的消耗方大致分為三類,彼此需求特徵差異明顯:
- AI模型研發公司(OpenAI、Anthropic、xAI、國內大型模型廠) 他們是當前GPU預留容量的最大買家。訓練萬億引數模型要求數萬卡叢集穩定執行數月,以此為核心場景進行1-3年預留。推論側隨著GPT-4o級別模型的部署,對預留推論容量的需求也在快速增加。這類客戶往往與雲端廠商或GPU雲端簽訂總額數億美元乃至數十億美元的多年合同。
- 大型企業AI部門(金融、製藥、自動駕駛) 銀行的高頻交易模型、藥企的分子動力學模擬、車企的自動駕駛訓練等場景,對GPU需求持續但彈性較低。他們偏好通過預留合同鎖定年度預算,並滿足資料駐留和安全合規要求。專用叢集預留模式在該類客戶中較受歡迎。
- 科研與學術機構 國家實驗室、高校獲得政府或專案撥款後,也會採購預留GPU算力來支援開放科學和大型科研專案。體量相對AI公司小,但需求較為穩定,是託管雲端學術預留的主要使用者。
8. 受益公司
以下列舉的是在預留容量鏈條中業務高度關聯的公司,不構成任何投資建議。
雲端基礎設施提供商
- Amazon Web Services (AWS): 通過Reserved Instances及Savings Plans長期鎖定客戶;其剩餘履約義務(RPO)是反映預留下游需求的關鍵指標。
- Microsoft Azure: Azure Reserved VM Instances與大規模AI合作合同一起,驅動其商業RPO不斷攀升;與OpenAI的深度繫結是其預留算力的最大單一應用場景。
- Google Cloud (GCP): Committed Use Discounts是其主要預留機制,支撐消費級和AI客戶的長約。
- 阿里雲端、騰訊雲端、華為雲端: 在亞太市場提供類似的包年包月GPU例項和預留叢集服務,承接國內AI公司與政務雲端的長期需求。
垂直GPU算力平台
- CoreWeave: 從加密挖礦基礎設施轉型為GPU雲端,與NVIDIA關係緊密,是2023-2024年全球最大的GPU預留容量獨立提供商之一。
- Lambda Labs、Together AI等: 面向科研與中小AI工作室提供更靈活的預留方案,是傳統雲端的有力補充。
上游硬體與代工
- NVIDIA: 其GPU是預留容量的核心資產;雲端廠商和垂直平台的訂單節奏直接決定其資料中心業務營收的可見度。
- 台積電: CoWoS封裝產能的分配實際上定義了全球AI算力的擴張速度,也因此成為預留合同的“終極上游瓶頸”。
- SK海力士/三星/美光: HBM供應波動會迅速傳導至GPU交付,進而影響預留合同的新簽訂和履約。
下游消費方
- OpenAI、Anthropic、Meta等: 作為全球最大的預留容量採購方,它們的合同規模和期限變化是行業需求的風向標。
9. 市場規模
雖然沒有“Reserved Capacity”的單一統計口徑,但從主要廠商的財報和行業報告中可窺見其體量。
- 雲端廠商剩餘履約義務(RPO)
- AWS: 亞馬遜2024年第三季度財報(2024Q3)顯示,AWS的剩餘履約義務(RPO)約1,726億美元,年增率增長46%(來源:Amazon Q3 2024 Earnings Release)。RPO中絕大多數來自長期預留和Savings Plans合同,直觀反映了預留算力需求的強勁增長。
- Microsoft Azure: 微軟2025財年第一季度(截至2024年9月30日)揭露,其商業RPO達到2,690億美元,年增率增長23%;管理層在電話會中指出,Azure長期大規模合同是增長的主要驅動力之一(來源:Microsoft Q1 FY2025 Earnings)。
- 兩家合計數千億美元的RPO,說明預留型雲端服務已成為行業主流營收形態。
- 垂直GPU雲端市場
- 據公開報道,CoreWeave 2024年預計營收約20億美元,估值一度接近200億美元(來源:Reuters 2024年11月報道)。Lambda等其他平台也在快速擴大簽約規模。
- 行業研究機構Omdia和Futuriom在2024年的分析中認為,在AI訓練和推論雲端服務中,預留合同貢獻的營收佔比已超過6成,成為AI算力交付的絕對主力。
- 長期趨勢
- 隨著主權AI和政府資助的算力基礎設施建設,預留/預定模式將進一步滲透。公開資料未見單一權威機構對全球預留AI算力市場給出統一測算,但基於雲端RPO和GPU出貨量估算,該市場已進入千億美元級別。
10. 玩家對比
| 對比維度 | AWS/Azure/GCP預留例項 | 垂直GPU雲端預留叢集 | 自建內部預留池 |
|---|---|---|---|
| 起訂規模 | 單卡起(部分GPU例項有最低門檻) | 通常數十卡起,以叢集為單位 | 數千卡起步 |
| 典型折扣(vs.按需) | 約30%-60%(因預付、期限而異) | 通常比大雲端按需低30%-50%甚至更多(行業估算) | 無外部溢價,但自擔閒置成本 |
| 靈活性 | 高:可轉換例項族、區域、部分可取消 | 較低:鎖型號、鎖週期,提前解約懲罰重 | 完全按內部規則,無合同約束 |
| 配套服務 | 完整的雲端原生、資料庫、AI/ML平台、全球網路 | 聚焦裸金屬GPU、基礎網路,需客戶自建平台層 | 需自建全棧,技術門檻最高 |
| 供應確定性 | 高,但受制於雲端廠商總產能與SLA | 非常高,常直接繫結特定GPU交付批次 | 最高,但自擔採購失敗風險 |
| 資本負擔 | OpEx為主,現金流量壓力小 | OpEx為主,費用可預測 | CapEx巨大,資產重 |
| 典型使用者 | 各類企業、初創、AI推論 | 中大型AI研發機構、基礎模型公司 | 超大規模科技巨頭、國家主權AI |
| 公開RPO/合同參考 | AWS RPO超1700億美元、Azure商業RPO超2600億美元(均為2024年Q3/Q1FY25資料) | CoreWeave預計2024年營收約20億美元(來源:Reuters) | 未公開單獨口徑 |
11. 風險
參與預留容量交易或依賴其供應,需關注以下風險:
- 價格風險:如果未來GPU供給大幅度過剩,按需價格可能跌破鎖定後的預留價,屆時預留使用者面臨機會成本損失。類似情況在2022年加密貨幣礦潮退卻後部分GPU雲端市場曾出現過。
- 技術迭代過時風險:1-3年週期內,NVIDIA可能已釋出兩代新架構。今天鎖定的H100叢集,在B200大規模部署後可能效能競爭力下降,且合同難以轉換為新一代GPU,造成“鎖死在舊硬體”的困境。
- 利用率風險:如果公司業務方向調整、模型訓練暫停或轉向更小模型,預留容量可能大量閒置,而費用照常支付。即便靈活性較高的方案,也無法做到零損失退出。
- 供應商履約風險:較小或財務脆弱的垂直GPU平台若無法按時交付承諾的硬體或頻寬,將直接導致客戶專案延遲。若供應商破產或重組,預付資金可能難以追回。
- 合同與退出風險:長期合同中變更、提前終止、區域遷移等條款複雜;部分合同對於客戶的資料隱私、供應商變更權等保護不足,可能導致未來合規或遷移成本。
- 供給過剩時的市場結構風險:當全球GPU產能在2025-2026年集中釋放,預留合同“鎖定效應”可能反噬:新客戶能以更低按需價格獲得資源,而老客戶卻被束縛在高價合同中。
12. 誤讀糾偏
- 誤讀1:“預留容量就是打折買雲端伺服器。” 糾偏:它是一套資源保障與金融期貨系統。使用者購買的是“未來一段時間內不可被稀釋的算力使用權”,核心價值是確定性和SLA,而非單純的硬體租用折扣。即使例項並未執行,容量承諾依然消耗預留額度。
- 誤讀2:“簽了長期預留合同就高枕無憂。” 糾偏:正如風險一節所列,硬體代際更迭、業務變化、供應商問題都可能讓預留變成負擔。必須持續審視利用率、合同靈活性與硬體路線圖,做好“預留組合管理”,而不是一簽了之。
- 誤讀3:“垂直GPU雲端的預留一定比大雲端划算。” 糾偏:價差很大,但需仔細評估網路延遲、儲存配套、安全服務、合規認證、技術支援等隱性成本。某些場景下,大雲端的SLA和全球骨幹網足以覆蓋價差。資料主權要求高的行業更是可能被迫選擇大雲端或自建。
- 誤讀4:“預留容量等同於預付儲值卡,沒用完可以退。” 糾偏:絕大多數預留合同不退款。即便有轉售市場,通常只限於部分雲端廠商允許的內部轉讓,且折價嚴重。承諾即沉沒成本,必須按需謹慎規劃規模。
13. 最新事件
- 2024年11月:CoreWeave獲75億美元債務融資 據路透社2024年11月報道,CoreWeave由Blackstone、Magnetar等牽頭髮放約75億美元債務融資,用於擴大其GPU預留叢集,以滿足AI客戶暴增的合同需求。這重新整理了GPU雲端領域的單筆融資紀錄,也反映出資本市場對預留算力商業模式的認可。
- 2025年1月(CES 2025):NVIDIA新一代B200預訂與雲端合作 NVIDIA在CES 2025上公佈基於Blackwell架構的B200 GPU,並宣佈主要雲端廠商(AWS、Azure、GCP、Oracle)均已啟動B200預留叢集的部署採購。部分大型AI公司已與雲端廠商簽訂為期多年的B200預留架構合同,將算力預鎖定延伸至下一代GPU。
- 2024年12月:微軟Azure大規模預留折扣調整 微軟2024年底宣佈,對其Azure預留例項的折扣結構進行最佳化,並針對AI推論場景推出更靈活的區域預留模型。此舉被認為是響應客戶對更細粒度預留和短期承諾的需求,同時強化Azure在算力預定市場上的競爭力(來源:Microsoft官方部落格,2024年12月)。
- 2024年Q4:國家級AI算力預訂計劃興起 日本、新加坡、阿聯酋等多國在2024年下半年陸續宣佈主權AI算力專案,並與NVIDIA、CoreWeave或當地電信廠商簽訂多年度預留合同。這些專案將預留容量概念推向國家基礎設施層面,進一步拓寬下游需求結構。
14. 追蹤指標
想把握預留容量市場的溫度,可以持續追蹤以下幾類公開資料:
- 雲端廠商剩餘履約義務(RPO):AWS、Azure、GCP在每季財報中揭露的RPO及年增率增長率。若加速增長,通常意味著更多大額預留合同被簽署,市場鎖定效應加強。
- 雲端運算預付費營收佔比:部分廠商公佈的“按合同確認營收比例”或“訂閱式營收佔比”,可以觀察預留模式是否侵蝕按需份額。
- GPU租賃價格指數:部分第三方平台(如vast.ai、RunPod、某些投行釋出的GPU雲端價格追蹤)會給出H100/A100等的按需和預留等效年化價格走勢。價格下跌過快可能預示供給寬鬆,需警惕已鎖定合同的風險。
- NVIDIA資料中心業務營收與出貨節奏:季度營收、展望、CoWoS封裝擴產進度,間接決定未來預留合同的履約能力和新增供應。
- 垂直GPU雲端簽單公告:CoreWeave、Lambda、Together AI等定期釋出的客戶簽約、新叢集開服公告,反映新增預留需求的行業分佈。
- 大型AI公司的資本支出或算力費用:如Meta、Google、ByteDance等在財報中揭露的CapEx或相關雲端費用,可推算其預留合同的消耗和續約節奏。
- 台積電先進封裝擴產新聞:CoWoS月產能規劃(公開可見於台積電法說會),是上游約束能否放鬆的關鍵先行指標。
15. 信源
- Amazon Q3 2024 Earnings Release (2024年10月釋出)
- Microsoft Fiscal Year 2025 First Quarter Earnings (2024年10月)
- Synergy Research Group, Cloud Infrastructure Market Share Q3 2024
- Reuters, “CoreWeave lands $7.5 billion in debt financing from Blackstone, others”, 2024年11月
- NVIDIA CES 2025 Keynote, “Blackwell B200 Cloud Adoption” (2025年1月)
- Microsoft Azure Blog, “Optimizing AI workloads with new reserved capacity models”, 2024年12月
- Omdia, “AI Cloud Services Market Tracker” 摘要 (2024)
- 各公司財報、公開電話會議記錄中關於Remaining Performance Obligations、長期合同與AI算力供應的管理層討論
- 主流財經媒體(Bloomberg、Reuters、CNBC)及技術社群(Hacker News, Reddit r/MachineLearning)關於GPU雲端價格與預留模式的討論