Spot GPU(竞价实例/抢占式算力)
1. 3秒看懂
Spot GPU 是云计算厂商将数据中心里空闲的 GPU 算力,以低至原价 1-3 折的折扣,通过“竞价/抢占”模式卖给用户的商业模式。用户得到的算力与按需实例相同,但必须接受一个关键约束:云厂商可在提前通知(通常 30 秒-2 分钟)后强制回收这些资源。
一句话记忆口诀:“用随时被砍掉的算力,换 70%-90% 的成本节省。”
2024 年主流云平台上一张 NVIDIA A100(80GB)按需实例月均租金约 11,000-15,000 美元,而同等配置的 Spot 实例价格常年在 3,000-5,000 美元区间浮动(来源:AWS、Google Cloud 2024 年公开定价页面;CoreWeave 2024 H1 官网报价)。这一价差使得 Spot GPU 成为 AI 初创公司和学术机构的算力生命线。
2. 3分钟产业解释
2.1 为什么会有闲置 GPU?
云计算的核心矛盾是“峰值规划悖论”:云厂商必须为所有客户承诺随时可用的算力,因此部署的 GPU 总量必须大于任何时刻的实际需求峰值。但全球客户的请求并非均匀分布——工作日白天需求旺盛,深夜和周末则出现大量闲置。据 Google 2021 年发表在《Communications of the ACM》上的论文《Borg, Omega, and Kubernetes》披露,大型数据中心常态下资源利用率仅为 40%-60%(来源:Google 2021 年学术论文,数据采集自 2019 年生产环境)。
这些“吃不饱”的 GPU 如果在 24 小时内不被使用,其电费、折旧和机柜成本仍在持续发生。Spot GPU 模式的商业本质,是将这部分边际成本趋近于零的库存变现。
2.2 模式的商业逻辑
把 Spot GPU 比作“航空公司的候补票或尾单机票”最为贴切:飞机即将起飞,空座若不卖掉就是纯损失,所以折价出售。但若出现全价票乘客,候补乘客必须让座。GPU 算力同理——当有按需实例的高利润订单涌入,云厂商会立即“赶走”Spot 用户,将资源还给高优先级客户。
对云厂商而言,Spot 模式实现了三重利益:
- 提升资源利用率:直接推高毛利率,折旧分摊到更多计费小时;
- 培育生态:吸引价格敏感型长尾客户(初创公司、学生、研究者),转化为未来忠实用户;
- 形成价格歧视:在不影响全价客户的前提下,对“可中断”的细分市场套利。
2.3 谁能用它?
Spot GPU 的核心使用场景具备两个特征:可中断和可恢复。典型场景包括:
- 分布式大模型训练(通过 checkpoint 断点续训)
- 超参搜索(Hyperparameter tuning)
- 批量推理任务(Batch inference)
- 渲染农场(每帧独立计算)
- 基因测序(分段对齐计算)
不适合的场景:在线推理 API(需低延迟稳定在线)、实时交互式开发(如 Jupyter Notebook 长时间调试)、金融交易系统等。这些场景下中断导致的机会成本可能远超算力节省。
3. 技术原理
3.1 资源池化与虚拟化
Spot GPU 并非独立的硬件层,而是云计算平台在 IaaS/PaaS 层的资源调度策略。
底层实现依赖三大技术栈:
-
GPU 虚拟化:通过 NVIDIA vGPU、MIG(Multi-Instance GPU,A100/H100 支持)将一张物理 GPU 切成多个独立实例,让单卡可同时服务多个 Spot 用户,提高粒度灵活性。MIG 技术允许将 A100 切分为最多 7 个独立实例,H100 最多 7 个,每个实例拥有独立的显存、缓存和计算单元(来源:NVIDIA 2023 年官方 MIG 技术白皮书)。
-
虚拟机/容器编排:Kubernetes(K8s)成为事实标准。云厂商通过 K8s 的 Node Selector、Taints and Tolerations 机制标记哪些节点提供 Spot 资源,再通过调度器(Scheduler)将可中断任务分配到 Spot 节点。
-
实时监控与库存系统:每隔数秒采集全集群 GPU 使用率(采样率通常 5-15 秒),当使用率低于阈值(如 70%)的节点累计到一定规模,自动触发 Spot 库存释放。
3.2 动态定价机制
与航空公司收益管理类似,Spot 价格由市场供需曲线实时计算,但并非完全市场化拍卖。
以 AWS 为例(来源:AWS 官方文档,2023 年 12 月更新),其 Spot 定价算法考虑:
- 该实例规格在目标可用区的当前空闲容量
- 该可用区未来 1-2 小时的预估需求(结合历史数据)
- 按需实例价格的百分比上限(AWS 未公开上限系数,行业经验值约为 1.2-1.5 倍)
- 长期闲置资源的“地板价”(通常为按需实例价格的 10%-20%)
Google Cloud 和 Azure 采用略有不同的路径:Google Spot VMs 提供固定折扣(标准为按需价格的 60%-91%,来源:Google Cloud 2024 年定价文档),而非实时波动价格;Azure Spot VMs 则采用市场驱动定价。
3.3 中断通知与回收
云厂商回收 Spot 实例时,会通过以下路径发送信号:
- 实例元数据端点(Instance Metadata Service):提前发出通知,用户程序轮询此端点获取“中断通知”。AWS 的通知提前窗口为 2 分钟(来源:AWS EC2 Spot Instance Interruption Notices,2023 年文档);Google Cloud 为 30 秒(来源:Google Cloud Spot VM 文档,2024 年)。
- CloudEvents/EventBridge:事件驱动架构向用户的监控系统推送中断事件。
- SIGTERM/SIGKILL:在容器环境中,Kubelet 收到终止指令后,向容器发送 SIGTERM(优雅退出),未在时限内退出的将被 SIGKILL 强制终止。
3.4 容错与续算:Checkpointing
这是用户侧的核心工程挑战。Checkpointing 机制将训练状态(模型权重、优化器状态、学习率调度器、数据加载指针)序列化保存到持久存储(如 S3、NFS、HDFS)。
实现方式包括:
- 框架原生支持:PyTorch Lightning、Hugging Face Trainer 提供内置 callback(来源:PyTorch Lightning 2024 年 v2.0 文档)。
- 分布式训练框架:DeepSpeed、Megatron-LM 在分布式训练中支持一致性 checkpoint,需协调多 GPU 上的状态保存(来源:DeepSpeed 2023 年 GitHub 文档)。
- 存储性能要求:大模型 checkpoint 体积可达数百 GB 至 TB 级(GPT-3 175B 参数的全量 checkpoint 约 2.8TB,来源:OpenAI 2020 年论文)。保存速度取决于网络吞吐和存储系统 IOPS,是决定断点续训效率的关键瓶颈。
4. 关键参数
4.1 折扣率(Save Rate)
Spot 价格 ÷ 对应按需实例价格。2024 年全球主流云平台折扣率区间(来源:各平台 2024 年 Q2 公开定价 API 及 Vantage.sh 2024 年 6 月云成本追踪报告):
- AWS:A100/H100 Spot 实例常见折扣 50%-80%,极端空闲期可达 90%
- Google Cloud:固定折扣,GPU 实例为 60%-91%,无波动
- Azure:市场驱动,中间值约为 50%-75%
- CoreWeave:弹性算力约为按需价格 30%-60%
4.2 中断概率(Interruption Frequency)
每月 Spot 实例被回收的次数。AWS 历史数据显示(来源:AWS re:Invent 2022 演讲《Deep Dive on Spot Instances》,发布 Spot Instance Advisor 数据),约 5%-20% 的 Spot 实例每月经历至少一次中断,但高度依赖实例规格和可用区。GPU 专用实例(p3/p4/p5 系列)因供需紧张,中断率显著高于通用计算实例,部分区域 GPU Spot 实例的中断率可超过 30%/月(来源:Vantage.sh 2023 年用户社区经验数据,未经官方确认)。
4.3 中断通知窗口(Notice Period)
从发出中断通知到强制回收的时间间隔:
- AWS:120 秒
- Google Cloud:30 秒
- Azure:30 秒(2023 年起缩短,此前为 30 秒-120 秒不等)
- 阿里云:5 分钟(抢占式实例,来源:阿里云官方帮助中心 2024 年文档)
窗口越长,用户保存 checkpoint 的几率越大。阿里云 5 分钟窗口在行业中相对宽松,是其抢占式实例的技术优势之一。
4.4 可用性 SLA
Spot 实例通常不提供服务等级协议(SLA)。AWS、Google Cloud、Azure 的官方文档均明确声明 Spot 实例不承诺可用性(来源:AWS EC2 Spot Instance FAQ 2024 年、Google Cloud Spot VM SLA 条款 2024 年)。这是与“预留实例(Reserved Instances)”和“包年包月”模式的根本区别。
4.5 现货库存(Spot Inventory Pool Depth)
某一可用区某一实例规格在 Spot 池中的可用容量。库存深度直接影响中断概率和价格波动。公开资料中,云厂商不发布实时库存深度数据,仅 AWS 通过 Spot Instance Advisor 提供“中断率历史频率”作为替代指标(<5%、5-10%、10-15%、15-20%、>20% 五档)。
4.6 计费粒度
- AWS:1 秒计费(2024 年),最短计费 1 分钟
- Google Cloud:1 秒计费,最短 1 分钟
- Azure:1 秒计费
- 阿里云:1 秒计费(2023 年 Q4 起由小时改为秒级)
5. 技术路线
5.1 云厂商原生路线
代表:AWS EC2 Spot、Google Cloud Spot VMs、Azure Spot VMs、阿里云抢占式实例
特点:
- 与母公司 IaaS 体系深度绑定,提供最原生的控制台、API 和 CLI 工具
- 库存来自自有数据中心,规模最大(AWS 全球 105 个可用区,截至 2024 年 Q2)
- 技术成熟度最高,支持实例规格最全(从单 GPU 到 8×GPU 集群)
局限:单云锁定风险,跨云管理需额外抽象层。
5.2 多云聚合/仲裁路线
代表:Spot by NetApp(原 Spotinst,2020 年被 NetApp 收购)、Cast AI、Anyscale
技术路径:在用户应用层和多个云平台之间架设中间件,实时监控各云 Spot 价格和库存,自动在价格最低/中断风险最小的目标平台部署任务,并在中断发生时自动跨云故障转移。
核心技术(来源:Spot by NetApp 2023 年技术白皮书):
- 多源实时价格监控(轮询频率 <1 分钟)
- 预测中断算法(基于历史中断数据和机器学习)
- 自动回滚和配置漂移检测
5.3 GPU 专用云路线
代表:CoreWeave、Lambda Labs、Vast.ai(分布式 GPU 共享市场)
特点:核心资产是自有或长租的 GPU 集群,业务重心在 AI/ML 训练,将弹性算力作为主要产品而非附属。
CoreWeave 2023 年 H2 从 NVIDIA 获得 H100 优先供应,以弹性实例打包出售(来源:CoreWeave 2023 年博客及 The Information 2023 年 8 月报道)。Vast.ai 采用 P2P 市场模式,允许全球 GPU 拥有者出租闲置算力,本质是去中心化 Spot 市场(来源:Vast.ai 官网及 2024 年社区文档)。
5.4 中国本地化路线
中国云厂商的技术路线与全球标准类似,但受芯片出口管制影响,开始出现混合算力池特征:
- 阿里云灵骏:集成 NVIDIA(存量 A100/H800)和自研平头哥含光芯片的弹性池
- 华为云:基于昇腾 910B 的竞价实例(来源:华为云 2024 年弹性伸缩文档)
- 趋动科技 OrionX:通过软件定义 GPU 实现跨品牌(NVIDIA、AMD、国产芯片)资源池化和弹性分配(来源:趋动科技 2023 年产品白皮书)
6. 上游:硬件与基础设施供应商
6.1 GPU 芯片设计与制造
- NVIDIA:GPU 算力的绝对上游。截至 2024 年 Q2,NVIDIA 数据中心 GPU 市场占有率估计超过 90%(来源:Mercury Research 2024 年 Q1 报告,AI 加速器市场份额数据)。H100/H200/B100 系列决定 Spot 市场顶级算力的供给规模。
- AMD:MI300X 于 2023 年底发布,2024 年开始向云厂商供货。其性价比优势可能提升 Spot 市场中 AMD 实例的比例(来源:AMD 2023 年 Q4 财报电话会),但当前 CUDA 生态锁定效应严重,AMD Spot 实例尚处早期阶段。
- 国产 GPU:海光(深算系列)、寒武纪(思元系列)、燧原(邃思系列)已进入部分中国云平台,但 Spot 模式覆盖度有限,主要因生态适配尚不完善(来源:工信部及各地智算中心采购公告 2023-2024 年)。
6.2 云基础设施硬件
- 服务器 OEM/ODM:超微(Supermicro)、广达、浪潮、新华三是 GPU 服务器的主要供应商,直接决定 GPU 装机速度。
- 网络设备与光模块:Mellanox(NVIDIA 子公司)、博通、华为提供 InfiniBand/RoCE 网络,高速互联是 Spot 多节点分布式训练瓶颈。
- 液冷与电力:Vertiv、曙光数创供应数据中心散热方案。H100 单卡功耗 700W,H200 更高,液冷渗透率直接影响 GPU 部署密度,进而影响 Spot 库存(来源:NVIDIA 2024 年 H200 规格表及 Uptime Institute 2023 年液冷市场报告)。
6.3 数据中心与能源
- 全球:Equinix、Digital Realty 是第三方数据中心巨头,为云厂商提供托管
- 中国:万国数据、秦淮数据、数据港承建大型智算中心,国家“东数西算”工程主导算力基础设施布局(来源:国家发改委 2022 年《东数西算工程实施方案》及后续政策文件)
7. 下游:使用者与受益生态
7.1 AI 模型训练
这是 Spot GPU 的最大消耗场景。大语言模型训练(从 7B 到 175B 参数级)需成百上千张 GPU 并行运行数周至数月。使用 Spot 可将训练算力成本降低 50%-70%,代价是需工程师投入约 10%-20% 的额外工程时间建设容错基础设施(来源:Anyscale 2023 年针对 200 名 ML 工程师的调查数据,样本量有限,仅供参考)。
典型案例(公开报道):
- 2022 年,Stability AI 被报道使用 AWS Spot 实例训练 Stable Diffusion 早期版本(来源:Stability AI CEO Emad Mostaque 2022 年 X/Twitter 发言)
- 2023 年,多家国内大模型初创公司(智谱AI、MiniMax、百川智能等)在公开采访中提及使用抢占式算力降低训练成本(来源:36氪、量子位 2023 年相关报道)
7.2 MLOps 与集群管理平台
Spot 的容错复杂性催生了配套工具链需求,形成下游生态:
- 分布式训练框架集成:PyTorch(弹性训练模块)、Ray(分布式计算框架)均原生支持抢占式节点管理(来源:Ray 2024 年 v2.9 文档)
- MLOps 平台:Weights & Biases(实验跟踪 + Spot 管理)、Determined AI(被 HPE 收购,训练平台原生支持 Spot 中断恢复)
- 数据管道工具:数据预处理 ETL 工作流可在 Spot 上运行,使用 Apache Spark/ Ray Data 实现阶段内中断重试
7.3 其他行业场景
- 影视渲染:工业光魔、维塔数码等顶级工作室使用云计算进行渲染已有十年历史,Spot 模式使中小型制作团队也能负担(来源:AWS 案例研究 – 2021 年 Weta Digital 迁移到 AWS,但未单独披露 Spot 占比)
- 量化金融:回测引擎天然适配 Spot——单次回测任务独立,可随意中断和重新发起
- 药物发现:分子动力学模拟、虚拟筛选受 Spot 成本优势驱动,部分 CRO 企业已采用(来源:Schrödinger 公司 2023 年技术分享提及云上弹性计算,但未明确 Spot 占比)
8. 受益公司(按全产业链分层)
注:以下分类基于公开商业信息和行业逻辑,非投资分析,不构成任何建议。
8.1 提供 Spot 算力产能的头部云厂商
| 公司 | Spot 业务定位 | 关键变量 |
|---|---|---|
| AWS | 全球 Spot 市场绝对领先者,EC2 Spot 实例覆盖 GPU/CPU 全系列 | GPU 采购规模、数据中心扩张节奏 |
| Microsoft Azure | 与 OpenAI MSFT 合作关系紧密,驱动 GPU 部署加速 | H100/H200 分配量、与 OpenAI 的算力共享协议 |
| Google Cloud | Spot VM 配合 TPU v5p,自研芯片+抢占有独特生态 | TPU 的 AI 工作负载适配度、GPU 采购是否持续加大 |
| CoreWeave | 纯 GPU 云,弹性算力是高毛利核心产品 | NVIDIA 供应优先级、产能扩张速度和资金储备 |
| Lambda Labs | GPU 云+硬件销售双模式,Spot 类服务快速增长 | 相比三大云厂商的规模和价格竞争力 |
来源:各公司 2023 年全年、2024 年 Q1-Q2 财报及官方博客。CoreWeave 为未上市企业,数据源自 PitchBook 和企业新闻稿。
8.2 中间件/平台层
| 公司 | 价值主张 |
|---|---|
| Spot by NetApp | 多云 Spot 管理+成本优化,企业级 SLA 加持 |
| Cast AI | Kubernetes 环境 Spot 自动化,聚焦成本缩减 |
| Anyscale(Ray 母公司) | Ray 框架原生支持 Spot 实例弹性伸缩 |
| 趋动科技(中国) | GPU 虚拟化+池化,服务政企客户群 |
8.3 高耗算力的下游应用公司
- AI 大模型初创企业:OpenAI、Anthropic、国内智谱AI、百川智能等;但需注意头部企业正倾向于包销或自建算力(如 OpenAI 与微软的排他性基础设施合作),长期可能减少 Spot 占比。
- 制药企:Recursion、Insilico Medicine 等 AI 制药公司
- 自动驾驶:Waymo、特斯拉(自建 Dojo 超算,但 2023 年仍大量使用云端 GPU,来源:Elon Musk 2023 年 X 平台发言及特斯拉 2023 年 AI Day 公开资料)
9. 市场规模
9.1 全球 GPU 云市场总量
根据 Grand View Research 2024 年 1 月发布的报告,全球 GPU 即服务(GPUaaS)市场 2023 年规模约为 34.2 亿美元,预计 2030 年达 137.6 亿美元,CAGR 约 20%-26%。该口径包括所有 GPU 云服务模式(按需、预留、Spot)。
9.2 Spot GPU 的渗透率与规模估算
云厂商公开数据中,极少单独披露 Spot 业务收入。根据有限线索估算:
- AWS 前高管 2022 年在播客(The Cloud Pod)中提及,Spot 和预留实例合计占 EC2 计算小时消耗的 40%-50%,其中 Spot 约 15%-25%(非官方数据,未获 AWS 证实)。
- Google Cloud 2023 年论文《Borg 资源管理》提及,低优先级任务(含 Spot)在 Google 内部集群中占比超过 60%,但未单独分拆 GPU 工作负载比例。
- 假设 GPU 实例遵循类似占比(25%),则 2023 年全球 Spot GPU 市场包含在约 8.5 亿美元 的潜在 GPU Spot 交易量中。该数字为推导估算,缺乏第三方验证。
9.3 中国市场
公开资料中未见中国 Spot 算力市场的独立统计。中国信通院 2023 年《云计算发展白皮书》提到弹性算力(含抢占式实例)在 AI 训练场景的采用率快速上升,但未给出量化数据。阿里云 2023 年 Q3 财报提及“弹性计算产品收入同比增长”,但未拆分 Spot 占比(来源:阿里集团 2023 Q3 财报分析师电话会)。
另据工信部 2024 年初数据,中国已建和在建的智算中心超过 25 个,总规划算力超过 100 EFLOPS(FP16 口径),这些智算中心的算力调度系统理论上将成为 Spot 模式的供应增量(来源:工信部 2024 年 1 月新闻发布会)。
10. 玩家对比(2024 年数据)
| 维度 | AWS Spot | Google Cloud Spot | Azure Spot | 阿里云抢占式 | CoreWeave 弹性 |
|---|---|---|---|---|---|
| 折扣方式 | 市场动态价 | 固定折扣 60-91% | 市场动态价 | 固定折扣+出价模式 | 固定折扣 40-70% |
| 通知窗口 | 2 分钟 | 30 秒 | 30 秒 | 5 分钟 | 未公开标准 SLA |
| 计费粒度 | 1 秒/最低 1 分 | 1 秒/最低 1 分 | 1 秒 | 1 秒(2023 Q4 起) | 按小时为主 |
| GPU 型号覆盖度 | 最广(含 H100/P5) | 广(含 TPU) | 较广 | NVIDIA+自研混合 | 聚焦 NVIDIA H100/A100 |
| 中断率 | 中-高(依赖规格) | 中(30 秒通知是短板) | 中 | 相对低(5 分通知) | 中(供应较充裕期) |
| 跨云管理 | 第三方工具 | 第三方工具 | 第三方工具 | 不支持 | 不支持 |
| 最低价格/时(A100) | ~$1.0-1.5 | ~$1.2-1.8 | ~$1.1-1.6 | ¥7-12 元/时(约$1.0-1.7) | ~$0.9-1.2 |
来源:各平台 2024 年 Q2 官方定价页面、Vantage.sh 2024 年 6 月云成本跟踪数据。人民币价格按 2024 年 6 月汇率 1 USD ≈ 7.25 CNY 换算。阿里云价格来自阿里云官网 2024 年 GPU 抢占式实例定价页面。CoreWeave 数据来自其官网公开定价及社区讨论,未单独披露 H100 弹性实例价格。
11. 风险
11.1 算力可获得性风险(第一风险)
在算力结构性短缺期(如 2023 年 H2-2024 年 H1 全球 H100 供货紧张),云厂商优先保障高利润按需及预留实例客户,Spot 库存在部分热门区域可能趋近于零。根据 Vantage.sh 社区用户 2023 年 Q4-2024 年 Q1 报告,AWS us-east-1 的 p4d(A100) Spot 实例在 2023 年 12 月-2024 年 1 月期间中断率飙升,且重新获取率大幅降低。此为社区经验数据,未经 AWS 官方确认。
11.2 总拥有成本(TCO)失控风险
中断带来的 checkpoint 保存/加载时间、任务重启排队的等待时间、工程师需额外投入的容错开发时间,这部分隐性成本常被初次使用者低估。一个有代表性的工程经验值是:未充分优化的 Spot 训练任务,中断导致的有效 GPU 利用率下降幅度可达 15%-30%(来源:Anyscale 2023 年白皮书《Best Practices for Spot Instance Training》中引用的内部基准测试,场景为大模型分布式训练)。
11.3 价格倒挂风险
部分规格在极端供需下,Spot 价格可能超过按需实例。AWS 用户有报告过 p3.16xlarge(V100) Spot 价格短暂突破按需价的案例(来源:Reddit r/aws 2022 年用户讨论及 Hacker News 相关讨论),但 2023-2024 年 GPU 实例因长期供不应求,倒挂现象较少见。价格波动带来的预算不可预测性对初创公司尤为致命。
11.4 监管与合规风险(中国市场突出)
中国《网络安全法》《数据安全法》《个人信息保护法》对数据跨境流动和算力基础设施安全提出严格要求。使用跨区域甚至出海 Spot 算力时,需评估数据出境安全评估义务。2022 年 9 月生效的《数据出境安全评估办法》及后续指南对涉及个人信息和重要数据的跨境场景做出严格规范,这导致用户更倾向于使用本地可用区内的 Spot 算力,限制了优惠力度更大的跨境或跨地域 Spot 选择。
11.5 供应链与技术锁定风险
NVIDIA CUDA 生态垄断下,Spot GPU 的降本路径受制于单一上游供应商。若美国出口管制进一步收紧(如 2023 年 10 月 17 日 BIS 新规限制 H800/A800 对华出口的继续升级版本),中国 Spot 用户面临供给收缩和价格上升风险(来源:美国商务部工业安全局 BIS 2023 年 10 月 17 日公告及后续更新)。
12. 误读纠偏
12.1 “Spot GPU 就是便宜的 GPU”
❌ 常见误解:Spot GPU 是低配版或阉割版硬件。
✅ 事实:Spot GPU 与按需实例使用完全相同的物理 GPU 芯片和显存,性能无任何差异。唯一的区别在“使用权的稳定性”——Spot 实例是“可随时收回”的算力,而非“廉价劣质”的算力。“便宜”是以“不确定性”换来的,不是以“低质”换来的。
12.2 “中断就等于任务失败”
❌ 常见误解:一中断训练就白费了。
✅ 事实:合理设计的容错架构下,中断仅意味着算力暂停和 5-30 分钟的重启/排队时间。通过 checkpointing,模型状态得以保存,任务可在新实例上续算。实际损失的是工程师开发容错架构的时间和中断重启的 GPU 空闲等待时间。
12.3 “Spot 模式会彻底替代包年包月”
❌ 常见误解:Spot 未来将成为主流算力采购方式。
✅ 事实:云厂商的经济模型决定了 Spot 是“附属产品”,不是“主营业务”。Spot 收入占比过高会侵蚀 ARPU 和利润结构。云厂商会始终优先保障高利润的预留实例和按需实例客户。在算力供不应求的大背景下,Spot 更像是云厂商调节供需的“缓冲阀”,而非替代传统计费模式的革命力量。
12.4 “Spot 价格是全靠算法决定的公平市场价”
❌ 常见误解:Spot 价格完全由供需自然决定。
✅ 事实:AWS 等厂商已从早期的“竞价拍卖”模型(用户出价,价高者得)转向“市场定价”模型(厂商根据内部供需预测定价,用户无法出价)。这意味着云厂商拥有完全的价格决定权,价格更多反映厂商的利益优化目标而非纯粹的市场供需。AWS 于 2017 年 11 月宣布此次定价模型变更(来源:AWS 官方博客 2017 年 11 月 29 日)。
13. 最新事件
2024 年 Q2(4-6 月)
- AWS 将 H100 纳入 Spot 实例:2024 年 5 月,AWS 正式发布 p5.48xlarge(8×H100)Spot 实例,北美 3 个可用区首批可用(来源:AWS 官方博客 2024 年 5 月 14 日)。
- CoreWeave 融资及扩展:2024 年 5 月完成 11 亿美元 C 轮融资,估值 190 亿美元,资金主要用于扩大 H100/B200 GPU 集群(来源:CoreWeave 官方公告 2024 年 5 月及 Bloomberg 报道)。
- 阿里云 GPU 抢占式实例降价:2024 年 6 月,阿里云宣布 GPU 抢占式实例全面支持秒级计费,并下调 A10/V100 系列基础价格约 15%(来源:阿里云官网 2024 年 6 月产品公告)。
2024 年 Q1(1-3 月)
- NVIDIA 发布 Blackwell 架构:2024 年 GTC 大会发布 B100/B200,算力较 H100 提升数倍,预计 2024 年底开始量产,将成为下一代 Spot GPU 核心硬件(来源:NVIDIA 2024 年 GTC Keynote 及官方新闻稿)。
- 英伟达中国特供版 H20 上市:2024 年 Q1 开始量产并向中国云厂商供货,为中国 Spot GPU 市场提供新的合规算力来源(来源:Tom‘s Hardware 2024 年 3 月报道及供应链调研)。
2023 年关键事件回顾
- 美国对华芯片出口管制升级(2023 年 10 月):BIS 新规限制 H800/A800 等中国特供芯片对华出口,直接影响国内云厂商 GPU 采购计划,间接推高了中国 Spot 算力市场的供需紧张程度。
- 阿里云推出“灵骏”智算平台(2023 年 Q3):整合 NVIDIA 存量 GPU 及自研芯片,提供弹性训练能力(来源:阿里云 2023 年云栖大会)。
14. 跟踪指标
14.1 供给端指标
| 指标 | 数据源 | 跟踪频率 | 解读方向 |
|---|---|---|---|
| AWS/GCP/Azure GPU 实例新增可用区 | 各云厂商官方博客 | 实时 | 可用区增加=Spot 库存潜在增加 |
| NVIDIA 数据中心 GPU 季度出货量 | NVIDIA 财报(每季) | 季度 | 出货上行=远期 Spot 供给向上 |
| 全球/中国新建智算中心数量及算力 | 工信部/信通院/国际 IDC 报告 | 半年度 | 算力基建增长=长端 Spot 供给拐点 |
| H100/B100 交付周期 | 服务器 OEM 调研(如 Digitimes) | 季度 | 交付周期缩短=供给松动 |
14.2 需求端指标
| 指标 | 数据源 | 跟踪频率 | 解读方向 |
|---|---|---|---|
| 头部 AI 企业预训练模型参数量级增长 | 公司论文/博客(OpenAI, Meta, Anthropic) | 按事件 | 模型持续扩大→训练算力需求↑→Spot 需求↑ |
| 全球 AI 风险投资额 | CB Insights, PitchBook, 中国:IT 桔子/清科 | 季度 | AI VC 资金↓→初创 Spot 采购能力↓ |
| Hugging Face 模型/数据集上传量增长 | Hugging Face Hub 统计 | 月度 | 开源 AI 活跃度→长尾开发者和 Spot 需求 |
14.3 价格与市场指标
| 指标 | 数据源 | 跟踪频率 | 解读方向 |
|---|---|---|---|
| GPU Spot 价格指数(主要规格) | Vantage.sh, CloudOptimizer | 月度 | 价格持续下行→供过于求→用户有利 |
| GPU Spot 中断频率统计 | Spot Instance Advisor(AWS), 社区数据 | 月度 | 中断频率↑→供给收缩信号 |
| 按需/Spot 价格比率变化 | 各平台 API 提取计算 | 月度 | 比率收窄→Spot 供需趋紧 |
14.4 政策相关的跟踪
- 美国 BIS 对华半导体出口管制更新(季度或按事件跟踪)
- 中国“东数西算”工程进度(年度国家发改委/工信部报告)
- 中国数据出境安全评估最新案例和指南(网信办公告)
15. 信源
以下是本文核心引用来源,按类型分类:
学术论文与研究机构报告
- Google,《Borg, Omega, and Kubernetes》,《Communications of the ACM》,2021 年(数据中心利用率数据)
- Grand View Research,《GPU as a Service Market Size, Share & Trends Report》,2024 年 1 月
- 中国信通院,《云计算发展白皮书 2023》
- Uptime Institute,《Global Data Center Survey 2023》(液冷渗透率部分)
云厂商公开文档与公告
- AWS,《EC2 Spot Instances Documentation》,2024 年持续更新
- AWS,《New EC2 Spot Instance Pricing Model》,2017 年 11 月 29 日官方博客
- AWS re:Invent 2022,《Deep Dive on Spot Instances》演讲
- Google Cloud,《Spot VMs Documentation》,2024 年
- Microsoft Azure,《Azure Spot Virtual Machines Documentation》,2024 年
- 阿里云,《抢占式实例》帮助中心文档,2024 年
- 华为云,《竞价计费模式》产品文档,2024 年
- CoreWeave,官网定价页面及官方博客,2023-2024 年
硬件厂商资料
- NVIDIA,《MIG Technical Overview》,2023 年白皮书
- NVIDIA,GTC 2024 Keynote 及 H100/H200/B200 产品规格表
- AMD,2023 年 Q4 财报电话会记录
- 趋动科技,《OrionX 产品白皮书》,2023 年
科技媒体与社区
- Vantage.sh,《Cloud Cost Report》及社区数据,2024 年 6 月
- The Information,《CoreWeave 融资与 NVIDIA 供应关系报道》,2023 年 8 月
- 36氪、量子位:中国大模型初创公司公开报道,2023 年
- Tom’s Hardware,NVIDIA H20 中国特供版报道,2024 年 3 月
- Reddit r/aws、Hacker News(用户经验分享,经多方交叉验证处标注)
企业与工具
- Anyscale,《Best Practices for Spot Instance Training》,2023 年技术白皮书
- DeepSpeed/PyTorch Lightning/Hugging Face/Ray 官方 GitHub 文档,2023-2024 年版本
- Spot by NetApp,产品技术文档,2023 年
监管文件
- 美国商务部工业安全局(BIS),2023 年 10 月 17 日出口管制公告
- 中国《数据出境安全评估办法》(2022 年 9 月 1 日生效)
- 国家发改委,《东数西算工程实施方案》,2022 年
公司财报
- 阿里巴巴集团 2023 Q3 财报分析师电话会记录
- NVIDIA FY2024 季度财报(数据中心业务数据)
- Microsoft/Google/Alphabet 2023 年全年及 2024 年 Q1-Q2 财报(云业务相关披露)
声明:本文所有信息基于上述公开来源,截至 2024 年 7 月。文中基于公开数据推导的市场规模数字已注明为估算,不代表任何机构官方统计。公司列表基于行业逻辑分层,不构成投资建议。云计算和 AI 市场变化迅速,请以各平台最新官方文档和数据为准。本文不对任何因引用此文信息导致的决策承担责任。