概念库 开放阅读

Spot GPU(竞价实例/抢占式算力)

概念库 · 开放阅读

概念 ID
spot-gpu
更新时间
2026-06-03
来源数量
1

Spot GPU(竞价实例/抢占式算力)

1. 3秒看懂

Spot GPU 是云计算厂商将数据中心里空闲的 GPU 算力,以低至原价 1-3 折的折扣,通过“竞价/抢占”模式卖给用户的商业模式。用户得到的算力与按需实例相同,但必须接受一个关键约束:云厂商可在提前通知(通常 30 秒-2 分钟)后强制回收这些资源

一句话记忆口诀:“用随时被砍掉的算力,换 70%-90% 的成本节省。”

2024 年主流云平台上一张 NVIDIA A100(80GB)按需实例月均租金约 11,000-15,000 美元,而同等配置的 Spot 实例价格常年在 3,000-5,000 美元区间浮动(来源:AWS、Google Cloud 2024 年公开定价页面;CoreWeave 2024 H1 官网报价)。这一价差使得 Spot GPU 成为 AI 初创公司和学术机构的算力生命线。

2. 3分钟产业解释

2.1 为什么会有闲置 GPU?

云计算的核心矛盾是“峰值规划悖论”:云厂商必须为所有客户承诺随时可用的算力,因此部署的 GPU 总量必须大于任何时刻的实际需求峰值。但全球客户的请求并非均匀分布——工作日白天需求旺盛,深夜和周末则出现大量闲置。据 Google 2021 年发表在《Communications of the ACM》上的论文《Borg, Omega, and Kubernetes》披露,大型数据中心常态下资源利用率仅为 40%-60%(来源:Google 2021 年学术论文,数据采集自 2019 年生产环境)。

这些“吃不饱”的 GPU 如果在 24 小时内不被使用,其电费、折旧和机柜成本仍在持续发生。Spot GPU 模式的商业本质,是将这部分边际成本趋近于零的库存变现。

2.2 模式的商业逻辑

把 Spot GPU 比作“航空公司的候补票或尾单机票”最为贴切:飞机即将起飞,空座若不卖掉就是纯损失,所以折价出售。但若出现全价票乘客,候补乘客必须让座。GPU 算力同理——当有按需实例的高利润订单涌入,云厂商会立即“赶走”Spot 用户,将资源还给高优先级客户。

对云厂商而言,Spot 模式实现了三重利益:

  • 提升资源利用率:直接推高毛利率,折旧分摊到更多计费小时;
  • 培育生态:吸引价格敏感型长尾客户(初创公司、学生、研究者),转化为未来忠实用户;
  • 形成价格歧视:在不影响全价客户的前提下,对“可中断”的细分市场套利。

2.3 谁能用它?

Spot GPU 的核心使用场景具备两个特征:可中断可恢复。典型场景包括:

  • 分布式大模型训练(通过 checkpoint 断点续训)
  • 超参搜索(Hyperparameter tuning)
  • 批量推理任务(Batch inference)
  • 渲染农场(每帧独立计算)
  • 基因测序(分段对齐计算)

不适合的场景:在线推理 API(需低延迟稳定在线)、实时交互式开发(如 Jupyter Notebook 长时间调试)、金融交易系统等。这些场景下中断导致的机会成本可能远超算力节省。

3. 技术原理

3.1 资源池化与虚拟化

Spot GPU 并非独立的硬件层,而是云计算平台在 IaaS/PaaS 层的资源调度策略

底层实现依赖三大技术栈:

  • GPU 虚拟化:通过 NVIDIA vGPU、MIG(Multi-Instance GPU,A100/H100 支持)将一张物理 GPU 切成多个独立实例,让单卡可同时服务多个 Spot 用户,提高粒度灵活性。MIG 技术允许将 A100 切分为最多 7 个独立实例,H100 最多 7 个,每个实例拥有独立的显存、缓存和计算单元(来源:NVIDIA 2023 年官方 MIG 技术白皮书)。

  • 虚拟机/容器编排:Kubernetes(K8s)成为事实标准。云厂商通过 K8s 的 Node Selector、Taints and Tolerations 机制标记哪些节点提供 Spot 资源,再通过调度器(Scheduler)将可中断任务分配到 Spot 节点。

  • 实时监控与库存系统:每隔数秒采集全集群 GPU 使用率(采样率通常 5-15 秒),当使用率低于阈值(如 70%)的节点累计到一定规模,自动触发 Spot 库存释放。

3.2 动态定价机制

与航空公司收益管理类似,Spot 价格由市场供需曲线实时计算,但并非完全市场化拍卖。

以 AWS 为例(来源:AWS 官方文档,2023 年 12 月更新),其 Spot 定价算法考虑:

  • 该实例规格在目标可用区的当前空闲容量
  • 该可用区未来 1-2 小时的预估需求(结合历史数据)
  • 按需实例价格的百分比上限(AWS 未公开上限系数,行业经验值约为 1.2-1.5 倍)
  • 长期闲置资源的“地板价”(通常为按需实例价格的 10%-20%)

Google Cloud 和 Azure 采用略有不同的路径:Google Spot VMs 提供固定折扣(标准为按需价格的 60%-91%,来源:Google Cloud 2024 年定价文档),而非实时波动价格;Azure Spot VMs 则采用市场驱动定价。

3.3 中断通知与回收

云厂商回收 Spot 实例时,会通过以下路径发送信号:

  1. 实例元数据端点(Instance Metadata Service):提前发出通知,用户程序轮询此端点获取“中断通知”。AWS 的通知提前窗口为 2 分钟(来源:AWS EC2 Spot Instance Interruption Notices,2023 年文档);Google Cloud 为 30 秒(来源:Google Cloud Spot VM 文档,2024 年)。
  2. CloudEvents/EventBridge:事件驱动架构向用户的监控系统推送中断事件。
  3. SIGTERM/SIGKILL:在容器环境中,Kubelet 收到终止指令后,向容器发送 SIGTERM(优雅退出),未在时限内退出的将被 SIGKILL 强制终止。

3.4 容错与续算:Checkpointing

这是用户侧的核心工程挑战。Checkpointing 机制将训练状态(模型权重、优化器状态、学习率调度器、数据加载指针)序列化保存到持久存储(如 S3、NFS、HDFS)。

实现方式包括:

  • 框架原生支持:PyTorch Lightning、Hugging Face Trainer 提供内置 callback(来源:PyTorch Lightning 2024 年 v2.0 文档)。
  • 分布式训练框架:DeepSpeed、Megatron-LM 在分布式训练中支持一致性 checkpoint,需协调多 GPU 上的状态保存(来源:DeepSpeed 2023 年 GitHub 文档)。
  • 存储性能要求:大模型 checkpoint 体积可达数百 GB 至 TB 级(GPT-3 175B 参数的全量 checkpoint 约 2.8TB,来源:OpenAI 2020 年论文)。保存速度取决于网络吞吐和存储系统 IOPS,是决定断点续训效率的关键瓶颈。

4. 关键参数

4.1 折扣率(Save Rate)

Spot 价格 ÷ 对应按需实例价格。2024 年全球主流云平台折扣率区间(来源:各平台 2024 年 Q2 公开定价 API 及 Vantage.sh 2024 年 6 月云成本追踪报告):

  • AWS:A100/H100 Spot 实例常见折扣 50%-80%,极端空闲期可达 90%
  • Google Cloud:固定折扣,GPU 实例为 60%-91%,无波动
  • Azure:市场驱动,中间值约为 50%-75%
  • CoreWeave:弹性算力约为按需价格 30%-60%

4.2 中断概率(Interruption Frequency)

每月 Spot 实例被回收的次数。AWS 历史数据显示(来源:AWS re:Invent 2022 演讲《Deep Dive on Spot Instances》,发布 Spot Instance Advisor 数据),约 5%-20% 的 Spot 实例每月经历至少一次中断,但高度依赖实例规格和可用区。GPU 专用实例(p3/p4/p5 系列)因供需紧张,中断率显著高于通用计算实例,部分区域 GPU Spot 实例的中断率可超过 30%/月(来源:Vantage.sh 2023 年用户社区经验数据,未经官方确认)。

4.3 中断通知窗口(Notice Period)

从发出中断通知到强制回收的时间间隔:

  • AWS:120 秒
  • Google Cloud:30 秒
  • Azure:30 秒(2023 年起缩短,此前为 30 秒-120 秒不等)
  • 阿里云:5 分钟(抢占式实例,来源:阿里云官方帮助中心 2024 年文档)

窗口越长,用户保存 checkpoint 的几率越大。阿里云 5 分钟窗口在行业中相对宽松,是其抢占式实例的技术优势之一。

4.4 可用性 SLA

Spot 实例通常不提供服务等级协议(SLA)。AWS、Google Cloud、Azure 的官方文档均明确声明 Spot 实例不承诺可用性(来源:AWS EC2 Spot Instance FAQ 2024 年、Google Cloud Spot VM SLA 条款 2024 年)。这是与“预留实例(Reserved Instances)”和“包年包月”模式的根本区别。

4.5 现货库存(Spot Inventory Pool Depth)

某一可用区某一实例规格在 Spot 池中的可用容量。库存深度直接影响中断概率和价格波动。公开资料中,云厂商不发布实时库存深度数据,仅 AWS 通过 Spot Instance Advisor 提供“中断率历史频率”作为替代指标(<5%、5-10%、10-15%、15-20%、>20% 五档)。

4.6 计费粒度

  • AWS:1 秒计费(2024 年),最短计费 1 分钟
  • Google Cloud:1 秒计费,最短 1 分钟
  • Azure:1 秒计费
  • 阿里云:1 秒计费(2023 年 Q4 起由小时改为秒级)

5. 技术路线

5.1 云厂商原生路线

代表:AWS EC2 Spot、Google Cloud Spot VMs、Azure Spot VMs、阿里云抢占式实例

特点

  • 与母公司 IaaS 体系深度绑定,提供最原生的控制台、API 和 CLI 工具
  • 库存来自自有数据中心,规模最大(AWS 全球 105 个可用区,截至 2024 年 Q2)
  • 技术成熟度最高,支持实例规格最全(从单 GPU 到 8×GPU 集群)

局限:单云锁定风险,跨云管理需额外抽象层。

5.2 多云聚合/仲裁路线

代表:Spot by NetApp(原 Spotinst,2020 年被 NetApp 收购)、Cast AI、Anyscale

技术路径:在用户应用层和多个云平台之间架设中间件,实时监控各云 Spot 价格和库存,自动在价格最低/中断风险最小的目标平台部署任务,并在中断发生时自动跨云故障转移。

核心技术(来源:Spot by NetApp 2023 年技术白皮书):

  • 多源实时价格监控(轮询频率 <1 分钟)
  • 预测中断算法(基于历史中断数据和机器学习)
  • 自动回滚和配置漂移检测

5.3 GPU 专用云路线

代表:CoreWeave、Lambda Labs、Vast.ai(分布式 GPU 共享市场)

特点:核心资产是自有或长租的 GPU 集群,业务重心在 AI/ML 训练,将弹性算力作为主要产品而非附属。

CoreWeave 2023 年 H2 从 NVIDIA 获得 H100 优先供应,以弹性实例打包出售(来源:CoreWeave 2023 年博客及 The Information 2023 年 8 月报道)。Vast.ai 采用 P2P 市场模式,允许全球 GPU 拥有者出租闲置算力,本质是去中心化 Spot 市场(来源:Vast.ai 官网及 2024 年社区文档)。

5.4 中国本地化路线

中国云厂商的技术路线与全球标准类似,但受芯片出口管制影响,开始出现混合算力池特征:

  • 阿里云灵骏:集成 NVIDIA(存量 A100/H800)和自研平头哥含光芯片的弹性池
  • 华为云:基于昇腾 910B 的竞价实例(来源:华为云 2024 年弹性伸缩文档)
  • 趋动科技 OrionX:通过软件定义 GPU 实现跨品牌(NVIDIA、AMD、国产芯片)资源池化和弹性分配(来源:趋动科技 2023 年产品白皮书)

6. 上游:硬件与基础设施供应商

6.1 GPU 芯片设计与制造

  • NVIDIA:GPU 算力的绝对上游。截至 2024 年 Q2,NVIDIA 数据中心 GPU 市场占有率估计超过 90%(来源:Mercury Research 2024 年 Q1 报告,AI 加速器市场份额数据)。H100/H200/B100 系列决定 Spot 市场顶级算力的供给规模。
  • AMD:MI300X 于 2023 年底发布,2024 年开始向云厂商供货。其性价比优势可能提升 Spot 市场中 AMD 实例的比例(来源:AMD 2023 年 Q4 财报电话会),但当前 CUDA 生态锁定效应严重,AMD Spot 实例尚处早期阶段。
  • 国产 GPU:海光(深算系列)、寒武纪(思元系列)、燧原(邃思系列)已进入部分中国云平台,但 Spot 模式覆盖度有限,主要因生态适配尚不完善(来源:工信部及各地智算中心采购公告 2023-2024 年)。

6.2 云基础设施硬件

  • 服务器 OEM/ODM:超微(Supermicro)、广达、浪潮、新华三是 GPU 服务器的主要供应商,直接决定 GPU 装机速度。
  • 网络设备与光模块:Mellanox(NVIDIA 子公司)、博通、华为提供 InfiniBand/RoCE 网络,高速互联是 Spot 多节点分布式训练瓶颈。
  • 液冷与电力:Vertiv、曙光数创供应数据中心散热方案。H100 单卡功耗 700W,H200 更高,液冷渗透率直接影响 GPU 部署密度,进而影响 Spot 库存(来源:NVIDIA 2024 年 H200 规格表及 Uptime Institute 2023 年液冷市场报告)。

6.3 数据中心与能源

  • 全球:Equinix、Digital Realty 是第三方数据中心巨头,为云厂商提供托管
  • 中国:万国数据、秦淮数据、数据港承建大型智算中心,国家“东数西算”工程主导算力基础设施布局(来源:国家发改委 2022 年《东数西算工程实施方案》及后续政策文件)

7. 下游:使用者与受益生态

7.1 AI 模型训练

这是 Spot GPU 的最大消耗场景。大语言模型训练(从 7B 到 175B 参数级)需成百上千张 GPU 并行运行数周至数月。使用 Spot 可将训练算力成本降低 50%-70%,代价是需工程师投入约 10%-20% 的额外工程时间建设容错基础设施(来源:Anyscale 2023 年针对 200 名 ML 工程师的调查数据,样本量有限,仅供参考)。

典型案例(公开报道):

  • 2022 年,Stability AI 被报道使用 AWS Spot 实例训练 Stable Diffusion 早期版本(来源:Stability AI CEO Emad Mostaque 2022 年 X/Twitter 发言)
  • 2023 年,多家国内大模型初创公司(智谱AI、MiniMax、百川智能等)在公开采访中提及使用抢占式算力降低训练成本(来源:36氪、量子位 2023 年相关报道)

7.2 MLOps 与集群管理平台

Spot 的容错复杂性催生了配套工具链需求,形成下游生态:

  • 分布式训练框架集成:PyTorch(弹性训练模块)、Ray(分布式计算框架)均原生支持抢占式节点管理(来源:Ray 2024 年 v2.9 文档)
  • MLOps 平台:Weights & Biases(实验跟踪 + Spot 管理)、Determined AI(被 HPE 收购,训练平台原生支持 Spot 中断恢复)
  • 数据管道工具:数据预处理 ETL 工作流可在 Spot 上运行,使用 Apache Spark/ Ray Data 实现阶段内中断重试

7.3 其他行业场景

  • 影视渲染:工业光魔、维塔数码等顶级工作室使用云计算进行渲染已有十年历史,Spot 模式使中小型制作团队也能负担(来源:AWS 案例研究 – 2021 年 Weta Digital 迁移到 AWS,但未单独披露 Spot 占比)
  • 量化金融:回测引擎天然适配 Spot——单次回测任务独立,可随意中断和重新发起
  • 药物发现:分子动力学模拟、虚拟筛选受 Spot 成本优势驱动,部分 CRO 企业已采用(来源:Schrödinger 公司 2023 年技术分享提及云上弹性计算,但未明确 Spot 占比)

8. 受益公司(按全产业链分层)

注:以下分类基于公开商业信息和行业逻辑,非投资分析,不构成任何建议。

8.1 提供 Spot 算力产能的头部云厂商

公司Spot 业务定位关键变量
AWS全球 Spot 市场绝对领先者,EC2 Spot 实例覆盖 GPU/CPU 全系列GPU 采购规模、数据中心扩张节奏
Microsoft Azure与 OpenAI MSFT 合作关系紧密,驱动 GPU 部署加速H100/H200 分配量、与 OpenAI 的算力共享协议
Google CloudSpot VM 配合 TPU v5p,自研芯片+抢占有独特生态TPU 的 AI 工作负载适配度、GPU 采购是否持续加大
CoreWeave纯 GPU 云,弹性算力是高毛利核心产品NVIDIA 供应优先级、产能扩张速度和资金储备
Lambda LabsGPU 云+硬件销售双模式,Spot 类服务快速增长相比三大云厂商的规模和价格竞争力

来源:各公司 2023 年全年、2024 年 Q1-Q2 财报及官方博客。CoreWeave 为未上市企业,数据源自 PitchBook 和企业新闻稿。

8.2 中间件/平台层

公司价值主张
Spot by NetApp多云 Spot 管理+成本优化,企业级 SLA 加持
Cast AIKubernetes 环境 Spot 自动化,聚焦成本缩减
Anyscale(Ray 母公司)Ray 框架原生支持 Spot 实例弹性伸缩
趋动科技(中国)GPU 虚拟化+池化,服务政企客户群

8.3 高耗算力的下游应用公司

  • AI 大模型初创企业:OpenAI、Anthropic、国内智谱AI、百川智能等;但需注意头部企业正倾向于包销或自建算力(如 OpenAI 与微软的排他性基础设施合作),长期可能减少 Spot 占比。
  • 制药企:Recursion、Insilico Medicine 等 AI 制药公司
  • 自动驾驶:Waymo、特斯拉(自建 Dojo 超算,但 2023 年仍大量使用云端 GPU,来源:Elon Musk 2023 年 X 平台发言及特斯拉 2023 年 AI Day 公开资料)

9. 市场规模

9.1 全球 GPU 云市场总量

根据 Grand View Research 2024 年 1 月发布的报告,全球 GPU 即服务(GPUaaS)市场 2023 年规模约为 34.2 亿美元,预计 2030 年达 137.6 亿美元,CAGR 约 20%-26%。该口径包括所有 GPU 云服务模式(按需、预留、Spot)。

9.2 Spot GPU 的渗透率与规模估算

云厂商公开数据中,极少单独披露 Spot 业务收入。根据有限线索估算:

  • AWS 前高管 2022 年在播客(The Cloud Pod)中提及,Spot 和预留实例合计占 EC2 计算小时消耗的 40%-50%,其中 Spot 约 15%-25%(非官方数据,未获 AWS 证实)。
  • Google Cloud 2023 年论文《Borg 资源管理》提及,低优先级任务(含 Spot)在 Google 内部集群中占比超过 60%,但未单独分拆 GPU 工作负载比例。
  • 假设 GPU 实例遵循类似占比(25%),则 2023 年全球 Spot GPU 市场包含在约 8.5 亿美元 的潜在 GPU Spot 交易量中。该数字为推导估算,缺乏第三方验证。

9.3 中国市场

公开资料中未见中国 Spot 算力市场的独立统计。中国信通院 2023 年《云计算发展白皮书》提到弹性算力(含抢占式实例)在 AI 训练场景的采用率快速上升,但未给出量化数据。阿里云 2023 年 Q3 财报提及“弹性计算产品收入同比增长”,但未拆分 Spot 占比(来源:阿里集团 2023 Q3 财报分析师电话会)。

另据工信部 2024 年初数据,中国已建和在建的智算中心超过 25 个,总规划算力超过 100 EFLOPS(FP16 口径),这些智算中心的算力调度系统理论上将成为 Spot 模式的供应增量(来源:工信部 2024 年 1 月新闻发布会)。

10. 玩家对比(2024 年数据)

维度AWS SpotGoogle Cloud SpotAzure Spot阿里云抢占式CoreWeave 弹性
折扣方式市场动态价固定折扣 60-91%市场动态价固定折扣+出价模式固定折扣 40-70%
通知窗口2 分钟30 秒30 秒5 分钟未公开标准 SLA
计费粒度1 秒/最低 1 分1 秒/最低 1 分1 秒1 秒(2023 Q4 起)按小时为主
GPU 型号覆盖度最广(含 H100/P5)广(含 TPU)较广NVIDIA+自研混合聚焦 NVIDIA H100/A100
中断率中-高(依赖规格)中(30 秒通知是短板)相对低(5 分通知)中(供应较充裕期)
跨云管理第三方工具第三方工具第三方工具不支持不支持
最低价格/时(A100)~$1.0-1.5~$1.2-1.8~$1.1-1.6¥7-12 元/时(约$1.0-1.7)~$0.9-1.2

来源:各平台 2024 年 Q2 官方定价页面、Vantage.sh 2024 年 6 月云成本跟踪数据。人民币价格按 2024 年 6 月汇率 1 USD ≈ 7.25 CNY 换算。阿里云价格来自阿里云官网 2024 年 GPU 抢占式实例定价页面。CoreWeave 数据来自其官网公开定价及社区讨论,未单独披露 H100 弹性实例价格。

11. 风险

11.1 算力可获得性风险(第一风险)

在算力结构性短缺期(如 2023 年 H2-2024 年 H1 全球 H100 供货紧张),云厂商优先保障高利润按需及预留实例客户,Spot 库存在部分热门区域可能趋近于零。根据 Vantage.sh 社区用户 2023 年 Q4-2024 年 Q1 报告,AWS us-east-1 的 p4d(A100) Spot 实例在 2023 年 12 月-2024 年 1 月期间中断率飙升,且重新获取率大幅降低。此为社区经验数据,未经 AWS 官方确认。

11.2 总拥有成本(TCO)失控风险

中断带来的 checkpoint 保存/加载时间、任务重启排队的等待时间、工程师需额外投入的容错开发时间,这部分隐性成本常被初次使用者低估。一个有代表性的工程经验值是:未充分优化的 Spot 训练任务,中断导致的有效 GPU 利用率下降幅度可达 15%-30%(来源:Anyscale 2023 年白皮书《Best Practices for Spot Instance Training》中引用的内部基准测试,场景为大模型分布式训练)。

11.3 价格倒挂风险

部分规格在极端供需下,Spot 价格可能超过按需实例。AWS 用户有报告过 p3.16xlarge(V100) Spot 价格短暂突破按需价的案例(来源:Reddit r/aws 2022 年用户讨论及 Hacker News 相关讨论),但 2023-2024 年 GPU 实例因长期供不应求,倒挂现象较少见。价格波动带来的预算不可预测性对初创公司尤为致命。

11.4 监管与合规风险(中国市场突出)

中国《网络安全法》《数据安全法》《个人信息保护法》对数据跨境流动和算力基础设施安全提出严格要求。使用跨区域甚至出海 Spot 算力时,需评估数据出境安全评估义务。2022 年 9 月生效的《数据出境安全评估办法》及后续指南对涉及个人信息和重要数据的跨境场景做出严格规范,这导致用户更倾向于使用本地可用区内的 Spot 算力,限制了优惠力度更大的跨境或跨地域 Spot 选择。

11.5 供应链与技术锁定风险

NVIDIA CUDA 生态垄断下,Spot GPU 的降本路径受制于单一上游供应商。若美国出口管制进一步收紧(如 2023 年 10 月 17 日 BIS 新规限制 H800/A800 对华出口的继续升级版本),中国 Spot 用户面临供给收缩和价格上升风险(来源:美国商务部工业安全局 BIS 2023 年 10 月 17 日公告及后续更新)。

12. 误读纠偏

12.1 “Spot GPU 就是便宜的 GPU”

❌ 常见误解:Spot GPU 是低配版或阉割版硬件。

✅ 事实:Spot GPU 与按需实例使用完全相同的物理 GPU 芯片和显存,性能无任何差异。唯一的区别在“使用权的稳定性”——Spot 实例是“可随时收回”的算力,而非“廉价劣质”的算力。“便宜”是以“不确定性”换来的,不是以“低质”换来的。

12.2 “中断就等于任务失败”

❌ 常见误解:一中断训练就白费了。

✅ 事实:合理设计的容错架构下,中断仅意味着算力暂停和 5-30 分钟的重启/排队时间。通过 checkpointing,模型状态得以保存,任务可在新实例上续算。实际损失的是工程师开发容错架构的时间和中断重启的 GPU 空闲等待时间。

12.3 “Spot 模式会彻底替代包年包月”

❌ 常见误解:Spot 未来将成为主流算力采购方式。

✅ 事实:云厂商的经济模型决定了 Spot 是“附属产品”,不是“主营业务”。Spot 收入占比过高会侵蚀 ARPU 和利润结构。云厂商会始终优先保障高利润的预留实例和按需实例客户。在算力供不应求的大背景下,Spot 更像是云厂商调节供需的“缓冲阀”,而非替代传统计费模式的革命力量。

12.4 “Spot 价格是全靠算法决定的公平市场价”

❌ 常见误解:Spot 价格完全由供需自然决定。

✅ 事实:AWS 等厂商已从早期的“竞价拍卖”模型(用户出价,价高者得)转向“市场定价”模型(厂商根据内部供需预测定价,用户无法出价)。这意味着云厂商拥有完全的价格决定权,价格更多反映厂商的利益优化目标而非纯粹的市场供需。AWS 于 2017 年 11 月宣布此次定价模型变更(来源:AWS 官方博客 2017 年 11 月 29 日)。

13. 最新事件

2024 年 Q2(4-6 月)

  • AWS 将 H100 纳入 Spot 实例:2024 年 5 月,AWS 正式发布 p5.48xlarge(8×H100)Spot 实例,北美 3 个可用区首批可用(来源:AWS 官方博客 2024 年 5 月 14 日)。
  • CoreWeave 融资及扩展:2024 年 5 月完成 11 亿美元 C 轮融资,估值 190 亿美元,资金主要用于扩大 H100/B200 GPU 集群(来源:CoreWeave 官方公告 2024 年 5 月及 Bloomberg 报道)。
  • 阿里云 GPU 抢占式实例降价:2024 年 6 月,阿里云宣布 GPU 抢占式实例全面支持秒级计费,并下调 A10/V100 系列基础价格约 15%(来源:阿里云官网 2024 年 6 月产品公告)。

2024 年 Q1(1-3 月)

  • NVIDIA 发布 Blackwell 架构:2024 年 GTC 大会发布 B100/B200,算力较 H100 提升数倍,预计 2024 年底开始量产,将成为下一代 Spot GPU 核心硬件(来源:NVIDIA 2024 年 GTC Keynote 及官方新闻稿)。
  • 英伟达中国特供版 H20 上市:2024 年 Q1 开始量产并向中国云厂商供货,为中国 Spot GPU 市场提供新的合规算力来源(来源:Tom‘s Hardware 2024 年 3 月报道及供应链调研)。

2023 年关键事件回顾

  • 美国对华芯片出口管制升级(2023 年 10 月):BIS 新规限制 H800/A800 等中国特供芯片对华出口,直接影响国内云厂商 GPU 采购计划,间接推高了中国 Spot 算力市场的供需紧张程度。
  • 阿里云推出“灵骏”智算平台(2023 年 Q3):整合 NVIDIA 存量 GPU 及自研芯片,提供弹性训练能力(来源:阿里云 2023 年云栖大会)。

14. 跟踪指标

14.1 供给端指标

指标数据源跟踪频率解读方向
AWS/GCP/Azure GPU 实例新增可用区各云厂商官方博客实时可用区增加=Spot 库存潜在增加
NVIDIA 数据中心 GPU 季度出货量NVIDIA 财报(每季)季度出货上行=远期 Spot 供给向上
全球/中国新建智算中心数量及算力工信部/信通院/国际 IDC 报告半年度算力基建增长=长端 Spot 供给拐点
H100/B100 交付周期服务器 OEM 调研(如 Digitimes)季度交付周期缩短=供给松动

14.2 需求端指标

指标数据源跟踪频率解读方向
头部 AI 企业预训练模型参数量级增长公司论文/博客(OpenAI, Meta, Anthropic)按事件模型持续扩大→训练算力需求↑→Spot 需求↑
全球 AI 风险投资额CB Insights, PitchBook, 中国:IT 桔子/清科季度AI VC 资金↓→初创 Spot 采购能力↓
Hugging Face 模型/数据集上传量增长Hugging Face Hub 统计月度开源 AI 活跃度→长尾开发者和 Spot 需求

14.3 价格与市场指标

指标数据源跟踪频率解读方向
GPU Spot 价格指数(主要规格)Vantage.sh, CloudOptimizer月度价格持续下行→供过于求→用户有利
GPU Spot 中断频率统计Spot Instance Advisor(AWS), 社区数据月度中断频率↑→供给收缩信号
按需/Spot 价格比率变化各平台 API 提取计算月度比率收窄→Spot 供需趋紧

14.4 政策相关的跟踪

  • 美国 BIS 对华半导体出口管制更新(季度或按事件跟踪)
  • 中国“东数西算”工程进度(年度国家发改委/工信部报告)
  • 中国数据出境安全评估最新案例和指南(网信办公告)

15. 信源

以下是本文核心引用来源,按类型分类:

学术论文与研究机构报告

  • Google,《Borg, Omega, and Kubernetes》,《Communications of the ACM》,2021 年(数据中心利用率数据)
  • Grand View Research,《GPU as a Service Market Size, Share & Trends Report》,2024 年 1 月
  • 中国信通院,《云计算发展白皮书 2023》
  • Uptime Institute,《Global Data Center Survey 2023》(液冷渗透率部分)

云厂商公开文档与公告

  • AWS,《EC2 Spot Instances Documentation》,2024 年持续更新
  • AWS,《New EC2 Spot Instance Pricing Model》,2017 年 11 月 29 日官方博客
  • AWS re:Invent 2022,《Deep Dive on Spot Instances》演讲
  • Google Cloud,《Spot VMs Documentation》,2024 年
  • Microsoft Azure,《Azure Spot Virtual Machines Documentation》,2024 年
  • 阿里云,《抢占式实例》帮助中心文档,2024 年
  • 华为云,《竞价计费模式》产品文档,2024 年
  • CoreWeave,官网定价页面及官方博客,2023-2024 年

硬件厂商资料

  • NVIDIA,《MIG Technical Overview》,2023 年白皮书
  • NVIDIA,GTC 2024 Keynote 及 H100/H200/B200 产品规格表
  • AMD,2023 年 Q4 财报电话会记录
  • 趋动科技,《OrionX 产品白皮书》,2023 年

科技媒体与社区

  • Vantage.sh,《Cloud Cost Report》及社区数据,2024 年 6 月
  • The Information,《CoreWeave 融资与 NVIDIA 供应关系报道》,2023 年 8 月
  • 36氪、量子位:中国大模型初创公司公开报道,2023 年
  • Tom’s Hardware,NVIDIA H20 中国特供版报道,2024 年 3 月
  • Reddit r/aws、Hacker News(用户经验分享,经多方交叉验证处标注)

企业与工具

  • Anyscale,《Best Practices for Spot Instance Training》,2023 年技术白皮书
  • DeepSpeed/PyTorch Lightning/Hugging Face/Ray 官方 GitHub 文档,2023-2024 年版本
  • Spot by NetApp,产品技术文档,2023 年

监管文件

  • 美国商务部工业安全局(BIS),2023 年 10 月 17 日出口管制公告
  • 中国《数据出境安全评估办法》(2022 年 9 月 1 日生效)
  • 国家发改委,《东数西算工程实施方案》,2022 年

公司财报

  • 阿里巴巴集团 2023 Q3 财报分析师电话会记录
  • NVIDIA FY2024 季度财报(数据中心业务数据)
  • Microsoft/Google/Alphabet 2023 年全年及 2024 年 Q1-Q2 财报(云业务相关披露)

声明:本文所有信息基于上述公开来源,截至 2024 年 7 月。文中基于公开数据推导的市场规模数字已注明为估算,不代表任何机构官方统计。公司列表基于行业逻辑分层,不构成投资建议。云计算和 AI 市场变化迅速,请以各平台最新官方文档和数据为准。本文不对任何因引用此文信息导致的决策承担责任。

source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型