Spot GPU(競價例項/搶佔式算力)
1. 3秒看懂
Spot GPU 是雲端運算廠商將資料中心裡空閒的 GPU 算力,以低至原價 1-3 折的折扣,通過“競價/搶佔”模式賣給使用者的商業模式。使用者得到的算力與按需例項相同,但必須接受一個關鍵約束:雲端廠商可在提前通知(通常 30 秒-2 分鐘)後強制回收這些資源。
一句話記憶口訣:“用隨時被砍掉的算力,換 70%-90% 的成本節省。”
2024 年主流雲端平台上一張 NVIDIA A100(80GB)按需例項月均租金約 11,000-15,000 美元,而同等配置的 Spot 例項價格常年在 3,000-5,000 美元區間浮動(來源:AWS、Google Cloud 2024 年公開定價頁面;CoreWeave 2024 H1 官網報價)。這一價差使得 Spot GPU 成為 AI 初創公司和學術機構的算力生命線。
2. 3分鐘產業解釋
2.1 為什麼會有閒置 GPU?
雲端運算的核心矛盾是“峰值規劃悖論”:雲端廠商必須為所有客戶承諾隨時可用的算力,因此部署的 GPU 總量必須大於任何時刻的實際需求峰值。但全球客戶的請求並非均勻分佈——工作日白天需求旺盛,深夜和週末則出現大量閒置。據 Google 2021 年發表在《Communications of the ACM》上的論文《Borg, Omega, and Kubernetes》揭露,大型資料中心常態下資源利用率僅為 40%-60%(來源:Google 2021 年學術論文,資料採集自 2019 年生產環境)。
這些“吃不飽”的 GPU 如果在 24 小時內不被使用,其電費、折舊和機櫃成本仍在持續發生。Spot GPU 模式的商業本質,是將這部分邊際成本趨近於零的庫存變現。
2.2 模式的商業邏輯
把 Spot GPU 比作“航空公司的候補票或尾單機票”最為貼切:飛機即將起飛,空座若不賣掉就是純損失,所以折價出售。但若出現全價票乘客,候補乘客必須讓座。GPU 算力同理——當有按需例項的高獲利訂單湧入,雲端廠商會立即“趕走”Spot 使用者,將資源還給高優先順序客戶。
對雲端廠商而言,Spot 模式實現了三重利益:
- 提升資源利用率:直接推高毛利率,折舊分攤到更多計費小時;
- 培育生態:吸引價格敏感型長尾客戶(初創公司、學生、研究者),轉化為未來忠實使用者;
- 形成價格歧視:在不影響全價客戶的前提下,對“可中斷”的細分市場套利。
2.3 誰能用它?
Spot GPU 的核心使用場景具備兩個特徵:可中斷和可恢復。典型場景包括:
- 分散式大型模型訓練(通過 checkpoint 斷點續訓)
- 超參搜尋(Hyperparameter tuning)
- 批次推論任務(Batch inference)
- 渲染農場(每幀獨立計算)
- 基因測序(分段對齊計算)
不適合的場景:線上推論 API(需低延遲穩定線上)、即時互動式開發(如 Jupyter Notebook 長時間除錯)、金融交易系統等。這些場景下中斷導致的機會成本可能遠超算力節省。
3. 技術原理
3.1 資源池化與虛擬化
Spot GPU 並非獨立的硬體層,而是雲端運算平台在 IaaS/PaaS 層的資源排程策略。
底層實現依賴三大技術棧:
-
GPU 虛擬化:通過 NVIDIA vGPU、MIG(Multi-Instance GPU,A100/H100 支援)將一張物理 GPU 切成多個獨立例項,讓單卡可同時服務多個 Spot 使用者,提高粒度靈活性。MIG 技術允許將 A100 切分為最多 7 個獨立例項,H100 最多 7 個,每個例項擁有獨立的視訊記憶體、快取和計算單元(來源:NVIDIA 2023 年官方 MIG 技術白皮書)。
-
虛擬機器/容器編排:Kubernetes(K8s)成為事實標準。雲端廠商通過 K8s 的 Node Selector、Taints and Tolerations 機制標記哪些節點提供 Spot 資源,再通過排程器(Scheduler)將可中斷任務分配到 Spot 節點。
-
即時監控與庫存系統:每隔數秒採集全叢集 GPU 使用率(取樣率通常 5-15 秒),當使用率低於閾值(如 70%)的節點累計到一定規模,自動觸發 Spot 庫存釋放。
3.2 動態定價機制
與航空公司收益管理類似,Spot 價格由市場供需曲線即時計算,但並非完全市場化拍賣。
以 AWS 為例(來源:AWS 官方文件,2023 年 12 月更新),其 Spot 定價演算法考慮:
- 該例項規格在目標可用區的當前空閒容量
- 該可用區未來 1-2 小時的預估需求(結合歷史資料)
- 按需例項價格的百分比上限(AWS 未公開上限係數,行業經驗值約為 1.2-1.5 倍)
- 長期閒置資源的“地板價”(通常為按需例項價格的 10%-20%)
Google Cloud 和 Azure 採用略有不同的路徑:Google Spot VMs 提供固定折扣(標準為按需價格的 60%-91%,來源:Google Cloud 2024 年定價文件),而非即時波動價格;Azure Spot VMs 則採用市場驅動定價。
3.3 中斷通知與回收
雲端廠商回收 Spot 例項時,會通過以下路徑傳送訊號:
- 例項後設資料端點(Instance Metadata Service):提前發出通知,使用者程式輪詢此端點獲取“中斷通知”。AWS 的通知提前視窗為 2 分鐘(來源:AWS EC2 Spot Instance Interruption Notices,2023 年文件);Google Cloud 為 30 秒(來源:Google Cloud Spot VM 文件,2024 年)。
- CloudEvents/EventBridge:事件驅動架構向用戶的監控系統推送中斷事件。
- SIGTERM/SIGKILL:在容器環境中,Kubelet 收到終止指令後,向容器傳送 SIGTERM(優雅退出),未在時限內退出的將被 SIGKILL 強制終止。
3.4 容錯與續算:Checkpointing
這是使用者側的核心工程挑戰。Checkpointing 機制將訓練狀態(模型權重、最佳化器狀態、學習率排程器、資料載入指標)序列化儲存到持久儲存(如 S3、NFS、HDFS)。
實現方式包括:
- 架構原生支援:PyTorch Lightning、Hugging Face Trainer 提供內建 callback(來源:PyTorch Lightning 2024 年 v2.0 文件)。
- 分散式訓練架構:DeepSpeed、Megatron-LM 在分散式訓練中支援一致性 checkpoint,需協調多 GPU 上的狀態儲存(來源:DeepSpeed 2023 年 GitHub 文件)。
- 儲存效能要求:大型模型 checkpoint 體積可達數百 GB 至 TB 級(GPT-3 175B 引數的全量 checkpoint 約 2.8TB,來源:OpenAI 2020 年論文)。儲存速度取決於網路吞吐和儲存系統 IOPS,是決定斷點續訓效率的關鍵瓶頸。
4. 關鍵引數
4.1 折扣率(Save Rate)
Spot 價格 ÷ 對應按需例項價格。2024 年全球主流雲端平台折扣率區間(來源:各平台 2024 年 Q2 公開定價 API 及 Vantage.sh 2024 年 6 月雲端成本追蹤報告):
- AWS:A100/H100 Spot 例項常見折扣 50%-80%,極端空閒期可達 90%
- Google Cloud:固定折扣,GPU 例項為 60%-91%,無波動
- Azure:市場驅動,中間值約為 50%-75%
- CoreWeave:彈性算力約為按需價格 30%-60%
4.2 中斷機率(Interruption Frequency)
每月 Spot 例項被回收的次數。AWS 歷史資料顯示(來源:AWS re:Invent 2022 演講《Deep Dive on Spot Instances》,釋出 Spot Instance Advisor 資料),約 5%-20% 的 Spot 例項每月經歷至少一次中斷,但高度依賴例項規格和可用區。GPU 專用例項(p3/p4/p5 系列)因供需緊張,中斷率顯著高於通用計算例項,部分割槽域 GPU Spot 例項的中斷率可超過 30%/月(來源:Vantage.sh 2023 年使用者社群經驗資料,未經官方確認)。
4.3 中斷通知視窗(Notice Period)
從發出中斷通知到強制回收的時間間隔:
- AWS:120 秒
- Google Cloud:30 秒
- Azure:30 秒(2023 年起縮短,此前為 30 秒-120 秒不等)
- 阿里雲端:5 分鐘(搶佔式例項,來源:阿里雲端官方幫助中心 2024 年文件)
視窗越長,使用者儲存 checkpoint 的機率越大。阿里雲端 5 分鐘視窗在行業中相對寬鬆,是其搶佔式例項的技術優勢之一。
4.4 可用性 SLA
Spot 例項通常不提供服務等級協議(SLA)。AWS、Google Cloud、Azure 的官方文件均明確宣告 Spot 例項不承諾可用性(來源:AWS EC2 Spot Instance FAQ 2024 年、Google Cloud Spot VM SLA 條款 2024 年)。這是與“預留例項(Reserved Instances)”和“包年包月”模式的根本區別。
4.5 現貨庫存(Spot Inventory Pool Depth)
某一可用區某一例項規格在 Spot 池中的可用容量。庫存深度直接影響中斷機率和價格波動。公開資料中,雲端廠商不釋出即時庫存深度資料,僅 AWS 通過 Spot Instance Advisor 提供“中斷率歷史頻率”作為替代指標(<5%、5-10%、10-15%、15-20%、>20% 五檔)。
4.6 計費粒度
- AWS:1 秒計費(2024 年),最短計費 1 分鐘
- Google Cloud:1 秒計費,最短 1 分鐘
- Azure:1 秒計費
- 阿里雲端:1 秒計費(2023 年 Q4 起由小時改為秒級)
5. 技術路線
5.1 雲端廠商原生路線
代表:AWS EC2 Spot、Google Cloud Spot VMs、Azure Spot VMs、阿里雲端搶佔式例項
特點:
- 與母公司 IaaS 體系深度繫結,提供最原生的控制台、API 和 CLI 工具
- 庫存來自自有資料中心,規模最大(AWS 全球 105 個可用區,截至 2024 年 Q2)
- 技術成熟度最高,支援例項規格最全(從單 GPU 到 8×GPU 叢集)
侷限:單雲端鎖定風險,跨雲端管理需額外抽象層。
5.2 多雲端聚合/仲裁路線
代表:Spot by NetApp(原 Spotinst,2020 年被 NetApp 收購)、Cast AI、Anyscale
技術路徑:在使用者應用層和多個雲端平台之間架設中介軟體,即時監控各雲端 Spot 價格和庫存,自動在價格最低/中斷風險最小的目標平台部署任務,並在中斷髮生時自動跨雲端故障轉移。
核心技術(來源:Spot by NetApp 2023 年技術白皮書):
- 多源即時價格監控(輪詢頻率 <1 分鐘)
- 預測中斷演算法(基於歷史中斷資料和機器學習)
- 自動回滾和配置漂移檢測
5.3 GPU 專用雲端路線
代表:CoreWeave、Lambda Labs、Vast.ai(分散式 GPU 共享市場)
特點:核心資產是自有或長租的 GPU 叢集,業務重心在 AI/ML 訓練,將彈性算力作為主要產品而非附屬。
CoreWeave 2023 年 H2 從 NVIDIA 獲得 H100 優先供應,以彈性例項打包出售(來源:CoreWeave 2023 年部落格及 The Information 2023 年 8 月報道)。Vast.ai 採用 P2P 市場模式,允許全球 GPU 擁有者出租閒置算力,本質是去中心化 Spot 市場(來源:Vast.ai 官網及 2024 年社群文件)。
5.4 中國本地化路線
中國雲端廠商的技術路線與全球標準類似,但受晶片出口管制影響,開始出現混合算力池特徵:
- 阿里雲端靈駿:整合 NVIDIA(存量 A100/H800)和自研平頭哥含光晶片的彈性池
- 華為雲端:基於昇騰 910B 的競價例項(來源:華為雲端 2024 年彈性伸縮文件)
- 趨動科技 OrionX:通過軟體定義 GPU 實現跨品牌(NVIDIA、AMD、國產晶片)資源池化和彈性分配(來源:趨動科技 2023 年產品白皮書)
6. 上游:硬體與基礎設施供應商
6.1 GPU 晶片設計與製造
- NVIDIA:GPU 算力的絕對上游。截至 2024 年 Q2,NVIDIA 資料中心 GPU 市場佔有率估計超過 90%(來源:Mercury Research 2024 年 Q1 報告,AI 加速器市場份額資料)。H100/H200/B100 系列決定 Spot 市場頂級算力的供給規模。
- AMD:MI300X 於 2023 年底釋出,2024 年開始向雲端廠商供貨。其價效比優勢可能提升 Spot 市場中 AMD 例項的比例(來源:AMD 2023 年 Q4 財報電話會),但當前 CUDA 生態鎖定效應嚴重,AMD Spot 例項尚處早期階段。
- 國產 GPU:海光(深算系列)、寒武紀(思元系列)、燧原(邃思系列)已進入部分中國雲端平台,但 Spot 模式覆蓋度有限,主要因生態適配尚不完善(來源:工信部及各地智算中心採購公告 2023-2024 年)。
6.2 雲端基礎設施硬體
- 伺服器 OEM/ODM:超微(Supermicro)、廣達、浪潮、新華三是 GPU 伺服器的主要供應商,直接決定 GPU 裝機速度。
- 網路裝置與光模組:Mellanox(NVIDIA 子公司)、博通、華為提供 InfiniBand/RoCE 網路,高速互聯是 Spot 多節點分散式訓練瓶頸。
- 液冷與電力:Vertiv、曙光數創供應資料中心散熱方案。H100 單卡功耗 700W,H200 更高,液冷滲透率直接影響 GPU 部署密度,進而影響 Spot 庫存(來源:NVIDIA 2024 年 H200 規格表及 Uptime Institute 2023 年液冷市場報告)。
6.3 資料中心與能源
- 全球:Equinix、Digital Realty 是第三方資料中心巨頭,為雲端廠商提供託管
- 中國:萬國資料、秦淮資料、資料港承建大型智算中心,國家“東數西算”工程主導算力基礎設施版面配置(來源:國家發改委 2022 年《東數西算工程實施方案》及後續政策檔案)
7. 下游:使用者與受益生態
7.1 AI 模型訓練
這是 Spot GPU 的最大消耗場景。大語言模型訓練(從 7B 到 175B 引數級)需成百上千張 GPU 並行執行數週至數月。使用 Spot 可將訓練算力成本降低 50%-70%,代價是需工程師投入約 10%-20% 的額外工程時間建設容錯基礎設施(來源:Anyscale 2023 年針對 200 名 ML 工程師的調查資料,樣本量有限,僅供參考)。
典型案例(公開報道):
- 2022 年,Stability AI 被報道使用 AWS Spot 例項訓練 Stable Diffusion 早期版本(來源:Stability AI CEO Emad Mostaque 2022 年 X/Twitter 發言)
- 2023 年,多家國內大型模型初創公司(智譜AI、MiniMax、百川智慧等)在公開採訪中提及使用搶佔式算力降低訓練成本(來源:36氪、量子位 2023 年相關報道)
7.2 MLOps 與叢集管理平台
Spot 的容錯複雜性催生了配套工具鏈需求,形成下游生態:
- 分散式訓練架構整合:PyTorch(彈性訓練模組)、Ray(分散式計算架構)均原生支援搶佔式節點管理(來源:Ray 2024 年 v2.9 文件)
- MLOps 平台:Weights & Biases(實驗追蹤 + Spot 管理)、Determined AI(被 HPE 收購,訓練平台原生支援 Spot 中斷恢復)
- 資料管道工具:資料預處理 ETL 工作流可在 Spot 上執行,使用 Apache Spark/ Ray Data 實現階段內中斷重試
7.3 其他行業場景
- 影視渲染:工業光魔、維塔數碼等頂級工作室使用雲端運算進行渲染已有十年曆史,Spot 模式使中小型製作團隊也能負擔(來源:AWS 案例研究 – 2021 年 Weta Digital 遷移到 AWS,但未單獨揭露 Spot 佔比)
- 量化金融:回測引擎天然適配 Spot——單次回測任務獨立,可隨意中斷和重新發起
- 藥物發現:分子動力學模擬、虛擬篩選受 Spot 成本優勢驅動,部分 CRO 企業已採用(來源:Schrödinger 公司 2023 年技術分享提及雲端上彈性計算,但未明確 Spot 佔比)
8. 受益公司(按全產業鏈分層)
注:以下分類基於公開商業資訊和行業邏輯,非投資分析,不構成任何建議。
8.1 提供 Spot 算力產能的頭部雲端廠商
| 公司 | Spot 業務定位 | 關鍵變數 |
|---|---|---|
| AWS | 全球 Spot 市場絕對領先者,EC2 Spot 例項覆蓋 GPU/CPU 全系列 | GPU 採購規模、資料中心擴張節奏 |
| Microsoft Azure | 與 OpenAI MSFT 合作關係緊密,驅動 GPU 部署加速 | H100/H200 分配量、與 OpenAI 的算力共享協議 |
| Google Cloud | Spot VM 配合 TPU v5p,自研晶片+搶佔有獨特生態 | TPU 的 AI 工作負載適配度、GPU 採購是否持續加大 |
| CoreWeave | 純 GPU 雲端,彈性算力是高毛利核心產品 | NVIDIA 供應優先順序、產能擴張速度和資金儲備 |
| Lambda Labs | GPU 雲端+硬體銷售雙模式,Spot 類服務快速增長 | 相比三大雲端廠商的規模和價格競爭力 |
來源:各公司 2023 年全年、2024 年 Q1-Q2 財報及官方部落格。CoreWeave 為未上市企業,資料來源自 PitchBook 和企業新聞稿。
8.2 中介軟體/平台層
| 公司 | 價值主張 |
|---|---|
| Spot by NetApp | 多雲端 Spot 管理+成本最佳化,企業級 SLA 加持 |
| Cast AI | Kubernetes 環境 Spot 自動化,聚焦成本縮減 |
| Anyscale(Ray 母公司) | Ray 架構原生支援 Spot 例項彈性伸縮 |
| 趨動科技(中國) | GPU 虛擬化+池化,服務政企客戶群 |
8.3 高耗算力的下游應用公司
- AI 大型模型初創企業:OpenAI、Anthropic、國內智譜AI、百川智慧等;但需注意頭部企業正傾向於包銷或自建算力(如 OpenAI 與微軟的排他性基礎設施合作),長期可能減少 Spot 佔比。
- 製藥企:Recursion、Insilico Medicine 等 AI 製藥公司
- 自動駕駛:Waymo、特斯拉(自建 Dojo 超算,但 2023 年仍大量使用雲端端 GPU,來源:Elon Musk 2023 年 X 平台發言及特斯拉 2023 年 AI Day 公開資料)
9. 市場規模
9.1 全球 GPU 雲端市場總量
根據 Grand View Research 2024 年 1 月釋出的報告,全球 GPU 即服務(GPUaaS)市場 2023 年規模約為 34.2 億美元,預計 2030 年達 137.6 億美元,CAGR 約 20%-26%。該口徑包括所有 GPU 雲端服務模式(按需、預留、Spot)。
9.2 Spot GPU 的滲透率與規模估算
雲端廠商公開資料中,極少單獨揭露 Spot 業務營收。根據有限線索估算:
- AWS 前高管 2022 年在播客(The Cloud Pod)中提及,Spot 和預留例項合計佔 EC2 計算小時消耗的 40%-50%,其中 Spot 約 15%-25%(非官方資料,未獲 AWS 證實)。
- Google Cloud 2023 年論文《Borg 資源管理》提及,低優先順序任務(含 Spot)在 Google 內部叢集中佔比超過 60%,但未單獨分拆 GPU 工作負載比例。
- 假設 GPU 例項遵循類似佔比(25%),則 2023 年全球 Spot GPU 市場包含在約 8.5 億美元 的潛在 GPU Spot 交易量中。該數字為推導估算,缺乏第三方驗證。
9.3 中國市場
公開資料中未見中國 Spot 算力市場的獨立統計。中國信通院 2023 年《雲端運算發展白皮書》提到彈性算力(含搶佔式例項)在 AI 訓練場景的採用率快速上升,但未給出量化資料。阿里雲端 2023 年 Q3 財報提及“彈性計算產品營收年增率增長”,但未拆分 Spot 佔比(來源:阿里集團 2023 Q3 財報分析師電話會)。
另據工信部 2024 年初資料,中國已建和在建的智算中心超過 25 個,總規劃算力超過 100 EFLOPS(FP16 口徑),這些智算中心的算力排程系統理論上將成為 Spot 模式的供應增量(來源:工信部 2024 年 1 月新聞釋出會)。
10. 玩家對比(2024 年資料)
| 維度 | AWS Spot | Google Cloud Spot | Azure Spot | 阿里雲端搶佔式 | CoreWeave 彈性 |
|---|---|---|---|---|---|
| 折扣方式 | 市場動態價 | 固定折扣 60-91% | 市場動態價 | 固定折扣+出價模式 | 固定折扣 40-70% |
| 通知視窗 | 2 分鐘 | 30 秒 | 30 秒 | 5 分鐘 | 未公開標準 SLA |
| 計費粒度 | 1 秒/最低 1 分 | 1 秒/最低 1 分 | 1 秒 | 1 秒(2023 Q4 起) | 按小時為主 |
| GPU 型號覆蓋度 | 最廣(含 H100/P5) | 廣(含 TPU) | 較廣 | NVIDIA+自研混合 | 聚焦 NVIDIA H100/A100 |
| 中斷率 | 中-高(依賴規格) | 中(30 秒通知是短板) | 中 | 相對低(5 分通知) | 中(供應較充裕期) |
| 跨雲端管理 | 第三方工具 | 第三方工具 | 第三方工具 | 不支援 | 不支援 |
| 最低價格/時(A100) | ~$1.0-1.5 | ~$1.2-1.8 | ~$1.1-1.6 | ¥7-12 元/時(約$1.0-1.7) | ~$0.9-1.2 |
來源:各平台 2024 年 Q2 官方定價頁面、Vantage.sh 2024 年 6 月雲端成本追蹤資料。人民幣價格按 2024 年 6 月匯率 1 USD ≈ 7.25 CNY 換算。阿里雲端價格來自阿里雲端官網 2024 年 GPU 搶佔式例項定價頁面。CoreWeave 資料來自其官網公開定價及社群討論,未單獨揭露 H100 彈性例項價格。
11. 風險
11.1 算力可獲得性風險(第一風險)
在算力結構性短缺期(如 2023 年 H2-2024 年 H1 全球 H100 供貨緊張),雲端廠商優先保障高獲利按需及預留例項客戶,Spot 庫存在部分熱門區域可能趨近於零。根據 Vantage.sh 社群使用者 2023 年 Q4-2024 年 Q1 報告,AWS us-east-1 的 p4d(A100) Spot 例項在 2023 年 12 月-2024 年 1 月期間中斷率飆升,且重新獲取率大幅降低。此為社群經驗資料,未經 AWS 官方確認。
11.2 總擁有成本(TCO)失控風險
中斷帶來的 checkpoint 儲存/載入時間、任務重啟排隊的等待時間、工程師需額外投入的容錯開發時間,這部分隱性成本常被初次使用者低估。一個有代表性的工程經驗值是:未充分最佳化的 Spot 訓練任務,中斷導致的有效 GPU 利用率下降幅度可達 15%-30%(來源:Anyscale 2023 年白皮書《Best Practices for Spot Instance Training》中引用的內部基準測試,場景為大型模型分散式訓練)。
11.3 價格倒掛風險
部分規格在極端供需下,Spot 價格可能超過按需例項。AWS 使用者有報告過 p3.16xlarge(V100) Spot 價格短暫突破按需價的案例(來源:Reddit r/aws 2022 年使用者討論及 Hacker News 相關討論),但 2023-2024 年 GPU 例項因長期供不應求,倒掛現象較少見。價格波動帶來的預算不可預測性對初創公司尤為致命。
11.4 監管與合規風險(中國市場突出)
中國《網路安全法》《資料安全法》《個人資訊保護法》對資料跨境流動和算力基礎設施安全提出嚴格要求。使用跨區域甚至出海 Spot 算力時,需評估資料出境安全評估義務。2022 年 9 月生效的《資料出境安全評估辦法》及後續指南對涉及個人資訊和重要資料的跨境場景做出嚴格規範,這導致使用者更傾向於使用本地可用區內的 Spot 算力,限制了優惠力度更大的跨境或跨地域 Spot 選擇。
11.5 供應鏈與技術鎖定風險
NVIDIA CUDA 生態壟斷下,Spot GPU 的降本路徑受制於單一上游供應商。若美國出口管制進一步收緊(如 2023 年 10 月 17 日 BIS 新規限制 H800/A800 對華出口的繼續升級版本),中國 Spot 使用者面臨供給收縮和價格上升風險(來源:美國商務部工業安全域性 BIS 2023 年 10 月 17 日公告及後續更新)。
12. 誤讀糾偏
12.1 “Spot GPU 就是便宜的 GPU”
❌ 常見誤解:Spot GPU 是低配版或閹割版硬體。
✅ 事實:Spot GPU 與按需例項使用完全相同的物理 GPU 晶片和視訊記憶體,效能無任何差異。唯一的區別在“使用權的穩定性”——Spot 例項是“可隨時收回”的算力,而非“廉價劣質”的算力。“便宜”是以“不確定性”換來的,不是以“低質”換來的。
12.2 “中斷就等於任務失敗”
❌ 常見誤解:一中斷訓練就白費了。
✅ 事實:合理設計的容錯架構下,中斷僅意味著算力暫停和 5-30 分鐘的重啟/排隊時間。通過 checkpointing,模型狀態得以儲存,任務可在新例項上續算。實際損失的是工程師開發容錯架構的時間和中斷重啟的 GPU 空閒等待時間。
12.3 “Spot 模式會徹底替代包年包月”
❌ 常見誤解:Spot 未來將成為主流算力採購方式。
✅ 事實:雲端廠商的經濟模型決定了 Spot 是“附屬產品”,不是“主營業務”。Spot 營收佔比過高會侵蝕 ARPU 和獲利結構。雲端廠商會始終優先保障高獲利的預留例項和按需例項客戶。在算力供不應求的大背景下,Spot 更像是雲端廠商調節供需的“緩衝閥”,而非替代傳統計費模式的革命力量。
12.4 “Spot 價格是全靠演算法決定的公平市場價”
❌ 常見誤解:Spot 價格完全由供需自然決定。
✅ 事實:AWS 等廠商已從早期的“競價拍賣”模型(使用者出價,價高者得)轉向“市場定價”模型(廠商根據內部供需預測定價,使用者無法出價)。這意味著雲端廠商擁有完全的價格決定權,價格更多反映廠商的利益最佳化目標而非純粹的市場供需。AWS 於 2017 年 11 月宣佈此次定價模型變更(來源:AWS 官方部落格 2017 年 11 月 29 日)。
13. 最新事件
2024 年 Q2(4-6 月)
- AWS 將 H100 納入 Spot 例項:2024 年 5 月,AWS 正式釋出 p5.48xlarge(8×H100)Spot 例項,北美 3 個可用區首批可用(來源:AWS 官方部落格 2024 年 5 月 14 日)。
- CoreWeave 融資及擴充套件:2024 年 5 月完成 11 億美元 C 輪融資,估值 190 億美元,資金主要用於擴大 H100/B200 GPU 叢集(來源:CoreWeave 官方公告 2024 年 5 月及 Bloomberg 報道)。
- 阿里雲端 GPU 搶佔式例項降價:2024 年 6 月,阿里雲端宣佈 GPU 搶佔式例項全面支援秒級計費,並下調 A10/V100 系列基礎價格約 15%(來源:阿里雲端官網 2024 年 6 月產品公告)。
2024 年 Q1(1-3 月)
- NVIDIA 釋出 Blackwell 架構:2024 年 GTC 大會發布 B100/B200,算力較 H100 提升數倍,預計 2024 年底開始量產,將成為下一代 Spot GPU 核心硬體(來源:NVIDIA 2024 年 GTC Keynote 及官方新聞稿)。
- 輝達中國特供版 H20 上市:2024 年 Q1 開始量產並向中國雲端廠商供貨,為中國 Spot GPU 市場提供新的合規算力來源(來源:Tom‘s Hardware 2024 年 3 月報道及供應鏈調研)。
2023 年關鍵事件回顧
- 美國對華晶片出口管制升級(2023 年 10 月):BIS 新規限制 H800/A800 等中國特供晶片對華出口,直接影響國內雲端廠商 GPU 採購計劃,間接推高了中國 Spot 算力市場的供需緊張程度。
- 阿里雲端推出“靈駿”智算平台(2023 年 Q3):整合 NVIDIA 存量 GPU 及自研晶片,提供彈性訓練能力(來源:阿里雲端 2023 年雲端棲大會)。
14. 追蹤指標
14.1 供給端指標
| 指標 | 資料來源 | 追蹤頻率 | 解讀方向 |
|---|---|---|---|
| AWS/GCP/Azure GPU 例項新增可用區 | 各雲端廠商官方部落格 | 即時 | 可用區增加=Spot 庫存潛在增加 |
| NVIDIA 資料中心 GPU 季度出貨量 | NVIDIA 財報(每季) | 季度 | 出貨上行=遠期 Spot 供給向上 |
| 全球/中國新建智算中心數量及算力 | 工信部/信通院/國際 IDC 報告 | 半年度 | 算力基建增長=長端 Spot 供給拐點 |
| H100/B100 交付週期 | 伺服器 OEM 調研(如 Digitimes) | 季度 | 交付週期縮短=供給鬆動 |
14.2 需求端指標
| 指標 | 資料來源 | 追蹤頻率 | 解讀方向 |
|---|---|---|---|
| 頭部 AI 企業預訓練模型引數量級增長 | 公司論文/部落格(OpenAI, Meta, Anthropic) | 按事件 | 模型持續擴大→訓練算力需求↑→Spot 需求↑ |
| 全球 AI 風險投資額 | CB Insights, PitchBook, 中國:IT 桔子/清科 | 季度 | AI VC 資金↓→初創 Spot 採購能力↓ |
| Hugging Face 模型/資料集上傳量增長 | Hugging Face Hub 統計 | 月度 | 開源 AI 活躍度→長尾開發者和 Spot 需求 |
14.3 價格與市場指標
| 指標 | 資料來源 | 追蹤頻率 | 解讀方向 |
|---|---|---|---|
| GPU Spot 價格指數(主要規格) | Vantage.sh, CloudOptimizer | 月度 | 價格持續下行→供過於求→使用者有利 |
| GPU Spot 中斷頻率統計 | Spot Instance Advisor(AWS), 社群資料 | 月度 | 中斷頻率↑→供給收縮訊號 |
| 按需/Spot 價格比率變化 | 各平台 API 提取計算 | 月度 | 比率收窄→Spot 供需趨緊 |
14.4 政策相關的追蹤
- 美國 BIS 對華半導體出口管制更新(季度或按事件追蹤)
- 中國“東數西算”工程進度(年度國家發改委/工信部報告)
- 中國資料出境安全評估最新案例和指南(網信辦公告)
15. 信源
以下是本文核心引用來源,按型別分類:
學術論文與研究機構報告
- Google,《Borg, Omega, and Kubernetes》,《Communications of the ACM》,2021 年(資料中心利用率資料)
- Grand View Research,《GPU as a Service Market Size, Share & Trends Report》,2024 年 1 月
- 中國信通院,《雲端運算發展白皮書 2023》
- Uptime Institute,《Global Data Center Survey 2023》(液冷滲透率部分)
雲端廠商公開文件與公告
- AWS,《EC2 Spot Instances Documentation》,2024 年持續更新
- AWS,《New EC2 Spot Instance Pricing Model》,2017 年 11 月 29 日官方部落格
- AWS re:Invent 2022,《Deep Dive on Spot Instances》演講
- Google Cloud,《Spot VMs Documentation》,2024 年
- Microsoft Azure,《Azure Spot Virtual Machines Documentation》,2024 年
- 阿里雲端,《搶佔式例項》幫助中心文件,2024 年
- 華為雲端,《競價計費模式》產品文件,2024 年
- CoreWeave,官網定價頁面及官方部落格,2023-2024 年
硬體廠商資料
- NVIDIA,《MIG Technical Overview》,2023 年白皮書
- NVIDIA,GTC 2024 Keynote 及 H100/H200/B200 產品規格表
- AMD,2023 年 Q4 財報電話會記錄
- 趨動科技,《OrionX 產品白皮書》,2023 年
科技媒體與社群
- Vantage.sh,《Cloud Cost Report》及社群資料,2024 年 6 月
- The Information,《CoreWeave 融資與 NVIDIA 供應關係報道》,2023 年 8 月
- 36氪、量子位:中國大型模型初創公司公開報道,2023 年
- Tom’s Hardware,NVIDIA H20 中國特供版報道,2024 年 3 月
- Reddit r/aws、Hacker News(使用者經驗分享,經多方交叉驗證處標註)
企業與工具
- Anyscale,《Best Practices for Spot Instance Training》,2023 年技術白皮書
- DeepSpeed/PyTorch Lightning/Hugging Face/Ray 官方 GitHub 文件,2023-2024 年版本
- Spot by NetApp,產品技術文件,2023 年
監管檔案
- 美國商務部工業安全域性(BIS),2023 年 10 月 17 日出口管制公告
- 中國《資料出境安全評估辦法》(2022 年 9 月 1 日生效)
- 國家發改委,《東數西算工程實施方案》,2022 年
公司財報
- 阿里巴巴集團 2023 Q3 財報分析師電話會記錄
- NVIDIA FY2024 季度財報(資料中心業務資料)
- Microsoft/Google/Alphabet 2023 年全年及 2024 年 Q1-Q2 財報(雲端業務相關揭露)
宣告:本文所有資訊基於上述公開來源,截至 2024 年 7 月。文中基於公開資料推導的市場規模數字已註明為估算,不代表任何機構官方統計。公司列表基於行業邏輯分層,不構成投資建議。雲端運算和 AI 市場變化迅速,請以各平台最新官方文件和資料為準。本文不對任何因引用此文資訊導致的決策承擔責任。