模型层 开放阅读

Reserved Capacity

Reserved Capacity

概念 ID
reserved-capacity
更新时间
2026-05-29
来源数量
待补

Reserved Capacity(预留容量)

1. 3 秒看懂

一种源于云计算,但在AI算力时代成为战略工具的资源保障与成本锁定机制。用户向云或算力服务商提前承诺未来一定周期(通常1年/3年)的资源用量,以此换取价格折扣(通常较按需低30%-70%)和容量保证。它把算力从“随用随付”的弹性资源,变为一种带有金融属性的确定性产能预售产品。

2. 3 分钟产业解释

大模型训练和推理对GPU集群的需求急剧膨胀,而高端GPU长期供不应求。Reserved Capacity(预留容量)正是在这一背景下,连接算力供需双侧的核心商业设计。

  • 需求侧(AI企业、研究院所): 他们要跑百万美元级的训练任务,最怕两件事——成本失控和资源供给突然中断。签署预留容量合同好比提前“锁仓”算力:能拿到按需价格五折甚至更低的折扣,让CFO可预测开支;同时也获得合同级别的可用性承诺,避免训练中途因资源回收而崩溃。
  • 供给侧(云厂商、GPU算力平台): 它们可以提前看到需求信号,据此更有节奏地下单采购昂贵的GPU、规划机架和冷却,把资产闲置率压到最低;并且预收款和合同义务直接转化为可观的剩余履约义务(RPO),向资本市场证明未来收入可见性,优化现金流。

简单说,Reserved Capacity就是把算力从“外卖按单做”变成了“预售套餐”,在AI算力极度饥渴的当下,它已经不只是折扣手段,而是从芯片到云服务整条供应链的资源调度语言

3. 技术原理

Reserved Capacity并非一项硬件技术,而是构筑在资源虚拟化、隔离、调度与计量之上的一整套系统能力。

资源池化与隔离 物理GPU计算节点首先通过GPU直通(PCIe Passthrough)、单根I/O虚拟化(SR-IOV)或NVIDIA多实例GPU(MIG)等技术,将一台8卡H100服务器细分成若干逻辑单元。每个单元绑定独立的显存、算力份额和故障域,组成预留资源池。与此并行存在的还有按需资源池,供非预留任务竞争使用。

调度编排 预留容量的核心是一个容量感知调度器。它维护一张“承诺-资源”映射表,记录每个客户已购买的时间窗口内,必须确保多少张GPU、什么型号。当客户提交任务,调度器优先从对应预留池分配资源;一旦预留池出现压力,调度会提前告警或突发溢出到按需池,并保证预留任务的抢占优先级最高。

计量与计费 精密计量是商业模式的基础。系统以秒级精度记录每个预留实例的启动时间、占用卡数、超出部分用量,再按照合同约定的预付方案(全预付/部分预付/零预付)和折扣率生成账单。对客户而言,使用预留容量就像持有一张“算力储值卡”,在承诺范围内消费时不再按高价计费。

多租户下的确定性保障 系统会为预留客户设定调度权重和资源标记,在资源紧张时执行严格的准入控制——宁可拒绝新的按需请求,也要保障预留客户的承诺容量。部分实现还支持突发到物理隔离的专用集群,提供单租户级别的安全与性能确定性。

[预留容量调度系统示意]

物理GPU集群 (例如数百节点、每节点8×H100)
            │
   ┌───────┴───────┐
   │ 分区/直通/MIG │  资源隔离层
   └───────┬───────┘
           │
   ┌───────┴──────────────────────┐
   │     容量感知调度器          │
   │   ┌─────────────────┐       │
   │   │ 预留池A: 客户X  │       │
   │   │  保证128×H100   │       │
   │   └─────────────────┘       │
   │   ┌─────────────────┐       │
   │   │ 预留池B: 客户Y  │       │
   │   │   保证64×A100   │       │
   │   └─────────────────┘       │
   │   ┌─────────────────┐       │
   │   │ 按需池: 其余资源│       │
   │   └─────────────────┘       │
   └──────────────────────────────┘
           │
   ┌───────┴────────┐
   │ 计量与计费引擎 │
   └────────────────┘

4. 关键参数

一份预留容量合同通常由以下参数定义,它们直接决定价格、灵活性和财务风险。

参数说明典型取值/示例
承诺期限 (Term)用户承诺付费的时间长度。期限越长,年化折扣越大。1年、3年(部分厂商提供按月递增的灵活期限)
预付选项 (Payment Option)在承诺期内提前支付部分或全部费用,换取更深的折扣。全额预付(All Upfront)、部分预付(Partial Upfront)、零预付(No Upfront)
实例灵活性 (Instance Flexibility)预留是否可跨实例族、跨代、跨可用区自动匹配。灵活性越高,用户被硬件迭代锁定的风险越小。AWS Savings Plans可跨实例系列;标准RI则锁定更窄范围
容量保证等级 (Capacity Reservation Tier)是保证特定物理GPU型号(如“H100 SXM 80GB”),还是仅保证等效算力(如“TFLOPS级”。前者供应确定性更高,但价格更贵。特定型号保证 vs. 性能当量保证
区域和可用区范围 (Scope)预留容量是仅限单一可用区还是可在区域内迁移,影响容错能力。单可用区预留、区域性预留
违约条款提前退订的罚则,通常需一次性支付未满期限的一定比例费用;部分厂商允许二次出售未用容量。支付剩余金额的30%~50%(不同厂商有差异)

5. 技术路线

预留容量的商业形态经历了从虚拟化时代到AI原生时代的演进,目前大致存在三条路线。

路线一:传统云厂商预留实例模式 始于AWS 2009年的Reserved Instances(RI),后演化出Savings Plans、Committed Use Discounts(GCP)等。该路线的核心是通用化的算力保证,覆盖从CPU到GPU的各种实例,配套完整的云服务生态(网络、存储、安全、数据库、AI/ML平台)。微软Azure在2024年也持续强化其Azure Reserved VM Instances与Azure Savings Plan for Compute的折扣深度和覆盖范围。这类预留的特点是起售单位小(可单卡起订)、生态最全,但是受到云厂商自身向上游采购总能力的限制。

路线二:垂直GPU云预留集群 以CoreWeave、Lambda Labs、Together AI等为代表。它们专注于大规模GPU集群,直接将“N个H100/B200节点”以1-3年合同形式出租给AI实验室。合同往往围绕特定GPU型号、网络拓扑(如InfiniBand)定制,折扣比云厂商更大(行业估算低30%-50%)。缺点是与下游客户的绑定极为集中,且缺少传统云的PaaS层服务,要求客户具备更强的工程能力。这条路在2023-2024年吸纳了巨量资本,成为AI算力供应的关键一极。

路线三:自主采购 + 内部预留池 超大规模用户(如Meta、Google、Tesla)采用自行采购GPU服务器,建设私有数据中心,然后在内部分配给各AI团队,本质上是一种“内部Reserved Capacity”。这类模式资本支出(CapEx)极高,但消除了供应商溢价,且完全控制技术栈。不过,它也承担了全部硬件迭代风险和闲置成本。

三条路线不是完全互斥。许多AI公司会混合使用:核心训练用内部集群或垂直GPU云预留,突发推理用大型云厂商的预留实例。

6. 上游

预留容量的供给能力高度依赖底层硬件供应链,主要环节包括:

  • AI加速芯片设计 NVIDIA(A100、H100、H200、B200系列)主导市场;AMD(MI300X等)和Intel(Gaudi系列)也在持续渗透。NVIDIA的CUDA生态是客户锁定预留合同的关键引力。
  • 先进晶圆制造与封装 台积电(TSMC)的CoWoS封装产能是GPU出货的核心瓶颈。2024年台积电仍在持续扩充CoWoS产能,但供不应求的格局驱使云厂商与NVIDIA签订更长的供货合同,以优先获得封装窗口。
  • 高带宽内存(HBM) SK海力士、三星、美光是HBM3/3E的主要供应商。每颗H100需要约6颗HBM,H200则更多。HBM的产能与价格直接影响GPU成本和交货周期,进而影响预留容量的定价。
  • 服务器ODM与系统集成 超微(Supermicro)、广达、纬颖、英业达等将GPU构建成整机,部分直接交付给云厂商与算力平台。垂直GPU云有时会绕过品牌服务器厂商,直接与ODM合作,以压缩交付周期和成本。
  • 网络与互联 NVIDIA InfiniBand/Mellanox、博通等提供GPU间的高速互联方案;400G/800G交换机是保证大规模预留集群性能的关键。越是大规模预留,网络配套越成为刚性约束。

7. 下游

预留容量的消耗方大致分为三类,彼此需求特征差异明显:

  • AI模型研发公司(OpenAI、Anthropic、xAI、国内大模型厂) 他们是当前GPU预留容量的最大买家。训练万亿参数模型要求数万卡集群稳定运行数月,以此为核心场景进行1-3年预留。推理侧随着GPT-4o级别模型的部署,对预留推理容量的需求也在快速增加。这类客户往往与云厂商或GPU云签订总额数亿美元乃至数十亿美元的多年合同。
  • 大型企业AI部门(金融、制药、自动驾驶) 银行的高频交易模型、药企的分子动力学模拟、车企的自动驾驶训练等场景,对GPU需求持续但弹性较低。他们偏好通过预留合同锁定年度预算,并满足数据驻留和安全合规要求。专用集群预留模式在该类客户中较受欢迎。
  • 科研与学术机构 国家实验室、高校获得政府或项目拨款后,也会采购预留GPU算力来支持开放科学和大型科研项目。体量相对AI公司小,但需求较为稳定,是托管云学术预留的主要使用者。

8. 受益公司

以下列举的是在预留容量链条中业务高度关联的公司,不构成任何投资建议。

云基础设施提供商

  • Amazon Web Services (AWS): 通过Reserved Instances及Savings Plans长期锁定客户;其剩余履约义务(RPO)是反映预留下游需求的关键指标。
  • Microsoft Azure: Azure Reserved VM Instances与大规模AI合作合同一起,驱动其商业RPO不断攀升;与OpenAI的深度绑定是其预留算力的最大单一应用场景。
  • Google Cloud (GCP): Committed Use Discounts是其主要预留机制,支撑消费级和AI客户的长约。
  • 阿里云、腾讯云、华为云: 在亚太市场提供类似的包年包月GPU实例和预留集群服务,承接国内AI公司与政务云的长期需求。

垂直GPU算力平台

  • CoreWeave: 从加密挖矿基础设施转型为GPU云,与NVIDIA关系紧密,是2023-2024年全球最大的GPU预留容量独立提供商之一。
  • Lambda Labs、Together AI等: 面向科研与中小AI工作室提供更灵活的预留方案,是传统云的有力补充。

上游硬件与代工

  • NVIDIA: 其GPU是预留容量的核心资产;云厂商和垂直平台的订单节奏直接决定其数据中心业务营收的可见度。
  • 台积电: CoWoS封装产能的分配实际上定义了全球AI算力的扩张速度,也因此成为预留合同的“终极上游瓶颈”。
  • SK海力士/三星/美光: HBM供应波动会迅速传导至GPU交付,进而影响预留合同的新签订和履约。

下游消费方

  • OpenAI、Anthropic、Meta等: 作为全球最大的预留容量采购方,它们的合同规模和期限变化是行业需求的风向标。

9. 市场规模

虽然没有“Reserved Capacity”的单一统计口径,但从主要厂商的财报和行业报告中可窥见其体量。

  • 云厂商剩余履约义务(RPO)
    • AWS: 亚马逊2024年第三季度财报(2024Q3)显示,AWS的剩余履约义务(RPO)约1,726亿美元,同比增长46%(来源:Amazon Q3 2024 Earnings Release)。RPO中绝大多数来自长期预留和Savings Plans合同,直观反映了预留算力需求的强劲增长。
    • Microsoft Azure: 微软2025财年第一季度(截至2024年9月30日)披露,其商业RPO达到2,690亿美元,同比增长23%;管理层在电话会中指出,Azure长期大规模合同是增长的主要驱动力之一(来源:Microsoft Q1 FY2025 Earnings)。
    • 两家合计数千亿美元的RPO,说明预留型云服务已成为行业主流收入形态。
  • 垂直GPU云市场
    • 据公开报道,CoreWeave 2024年预计收入约20亿美元,估值一度接近200亿美元(来源:Reuters 2024年11月报道)。Lambda等其他平台也在快速扩大签约规模。
    • 行业研究机构Omdia和Futuriom在2024年的分析中认为,在AI训练和推理云服务中,预留合同贡献的收入占比已超过6成,成为AI算力交付的绝对主力。
  • 长期趋势
    • 随着主权AI和政府资助的算力基础设施建设,预留/预定模式将进一步渗透。公开资料未见单一权威机构对全球预留AI算力市场给出统一测算,但基于云RPO和GPU出货量估算,该市场已进入千亿美元级别。

10. 玩家对比

对比维度AWS/Azure/GCP预留实例垂直GPU云预留集群自建内部预留池
起订规模单卡起(部分GPU实例有最低门槛)通常数十卡起,以集群为单位数千卡起步
典型折扣(vs.按需)约30%-60%(因预付、期限而异)通常比大云按需低30%-50%甚至更多(行业估算)无外部溢价,但自担闲置成本
灵活性高:可转换实例族、区域、部分可取消较低:锁型号、锁周期,提前解约惩罚重完全按内部规则,无合同约束
配套服务完整的云原生、数据库、AI/ML平台、全球网络聚焦裸金属GPU、基础网络,需客户自建平台层需自建全栈,技术门槛最高
供应确定性高,但受制于云厂商总产能与SLA非常高,常直接绑定特定GPU交付批次最高,但自担采购失败风险
资本负担OpEx为主,现金流压力小OpEx为主,费用可预测CapEx巨大,资产重
典型用户各类企业、初创、AI推理中大型AI研发机构、基础模型公司超大规模科技巨头、国家主权AI
公开RPO/合同参考AWS RPO超1700亿美元、Azure商业RPO超2600亿美元(均为2024年Q3/Q1FY25数据)CoreWeave预计2024年收入约20亿美元(来源:Reuters)未公开单独口径

11. 风险

参与预留容量交易或依赖其供应,需关注以下风险:

  • 价格风险:如果未来GPU供给大幅度过剩,按需价格可能跌破锁定后的预留价,届时预留用户面临机会成本损失。类似情况在2022年加密货币矿潮退却后部分GPU云市场曾出现过。
  • 技术迭代过时风险:1-3年周期内,NVIDIA可能已发布两代新架构。今天锁定的H100集群,在B200大规模部署后可能性能竞争力下降,且合同难以转换为新一代GPU,造成“锁死在旧硬件”的困境。
  • 利用率风险:如果公司业务方向调整、模型训练暂停或转向更小模型,预留容量可能大量闲置,而费用照常支付。即便灵活性较高的方案,也无法做到零损失退出。
  • 供应商履约风险:较小或财务脆弱的垂直GPU平台若无法按时交付承诺的硬件或带宽,将直接导致客户项目延迟。若供应商破产或重组,预付资金可能难以追回。
  • 合同与退出风险:长期合同中变更、提前终止、区域迁移等条款复杂;部分合同对于客户的数据隐私、供应商变更权等保护不足,可能导致未来合规或迁移成本。
  • 供给过剩时的市场结构风险:当全球GPU产能在2025-2026年集中释放,预留合同“锁定效应”可能反噬:新客户能以更低按需价格获得资源,而老客户却被束缚在高价合同中。

12. 误读纠偏

  • 误读1:“预留容量就是打折买云服务器。” 纠偏:它是一套资源保障与金融期货系统。用户购买的是“未来一段时间内不可被稀释的算力使用权”,核心价值是确定性SLA,而非单纯的硬件租用折扣。即使实例并未运行,容量承诺依然消耗预留额度。
  • 误读2:“签了长期预留合同就高枕无忧。” 纠偏:正如风险一节所列,硬件代际更迭、业务变化、供应商问题都可能让预留变成负担。必须持续审视利用率、合同灵活性与硬件路线图,做好“预留组合管理”,而不是一签了之。
  • 误读3:“垂直GPU云的预留一定比大云划算。” 纠偏:价差很大,但需仔细评估网络延迟、存储配套、安全服务、合规认证、技术支持等隐性成本。某些场景下,大云的SLA和全球骨干网足以覆盖价差。数据主权要求高的行业更是可能被迫选择大云或自建。
  • 误读4:“预留容量等同于预付储值卡,没用完可以退。” 纠偏:绝大多数预留合同不退款。即便有转售市场,通常只限于部分云厂商允许的内部转让,且折价严重。承诺即沉没成本,必须按需谨慎规划规模。

13. 最新事件

  • 2024年11月:CoreWeave获75亿美元债务融资 据路透社2024年11月报道,CoreWeave由Blackstone、Magnetar等牵头发放约75亿美元债务融资,用于扩大其GPU预留集群,以满足AI客户暴增的合同需求。这刷新了GPU云领域的单笔融资纪录,也反映出资本市场对预留算力商业模式的认可。
  • 2025年1月(CES 2025):NVIDIA新一代B200预订与云合作 NVIDIA在CES 2025上公布基于Blackwell架构的B200 GPU,并宣布主要云厂商(AWS、Azure、GCP、Oracle)均已启动B200预留集群的部署采购。部分大型AI公司已与云厂商签订为期多年的B200预留框架合同,将算力预锁定延伸至下一代GPU。
  • 2024年12月:微软Azure大规模预留折扣调整 微软2024年底宣布,对其Azure预留实例的折扣结构进行优化,并针对AI推理场景推出更灵活的区域预留模型。此举被认为是响应客户对更细粒度预留和短期承诺的需求,同时强化Azure在算力预定市场上的竞争力(来源:Microsoft官方博客,2024年12月)。
  • 2024年Q4:国家级AI算力预订计划兴起 日本、新加坡、阿联酋等多国在2024年下半年陆续宣布主权AI算力项目,并与NVIDIA、CoreWeave或当地电信厂商签订多年度预留合同。这些项目将预留容量概念推向国家基础设施层面,进一步拓宽下游需求结构。

14. 跟踪指标

想把握预留容量市场的温度,可以持续追踪以下几类公开数据:

  1. 云厂商剩余履约义务(RPO):AWS、Azure、GCP在每季财报中披露的RPO及同比增长率。若加速增长,通常意味着更多大额预留合同被签署,市场锁定效应加强。
  2. 云计算预付费收入占比:部分厂商公布的“按合同确认收入比例”或“订阅式收入占比”,可以观察预留模式是否侵蚀按需份额。
  3. GPU租赁价格指数:部分第三方平台(如vast.ai、RunPod、某些投行发布的GPU云价格追踪)会给出H100/A100等的按需和预留等效年化价格走势。价格下跌过快可能预示供给宽松,需警惕已锁定合同的风险。
  4. NVIDIA数据中心业务收入与出货节奏:季度营收、指引、CoWoS封装扩产进度,间接决定未来预留合同的履约能力和新增供应。
  5. 垂直GPU云签单公告:CoreWeave、Lambda、Together AI等定期发布的客户签约、新集群开服公告,反映新增预留需求的行业分布。
  6. 大型AI公司的资本开支或算力费用:如Meta、Google、ByteDance等在财报中披露的CapEx或相关云费用,可推算其预留合同的消耗和续约节奏。
  7. 台积电先进封装扩产新闻:CoWoS月产能规划(公开可见于台积电法说会),是上游约束能否放松的关键先行指标。

15. 信源

  • Amazon Q3 2024 Earnings Release (2024年10月发布)
  • Microsoft Fiscal Year 2025 First Quarter Earnings (2024年10月)
  • Synergy Research Group, Cloud Infrastructure Market Share Q3 2024
  • Reuters, “CoreWeave lands $7.5 billion in debt financing from Blackstone, others”, 2024年11月
  • NVIDIA CES 2025 Keynote, “Blackwell B200 Cloud Adoption” (2025年1月)
  • Microsoft Azure Blog, “Optimizing AI workloads with new reserved capacity models”, 2024年12月
  • Omdia, “AI Cloud Services Market Tracker” 摘要 (2024)
  • 各公司财报、公开电话会议记录中关于Remaining Performance Obligations、长期合同与AI算力供应的管理层讨论
  • 主流财经媒体(Bloomberg、Reuters、CNBC)及技术社区(Hacker News, Reddit r/MachineLearning)关于GPU云价格与预留模式的讨论
source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型