網路層 開放閱讀

Oversubscription

Oversubscription

概念 ID
oversubscription
更新時間
2026-05-29
來源數量
待補

Oversubscription

3秒看懂

Oversubscription(超額訂閱) 是指在深度學習基礎設施中,有意讓多個任務請求的硬體資源總量 超過物理硬體的實際可用資源,通過分時複用、空間分割槽或記憶體換頁等手段,在效能損失可控的前提下,大幅提升 GPU 等昂貴加速器的利用率,降低總體擁有成本(TCO)。它的本質是 用可控的服務質量換資源效率

3分鐘產業解釋

隨著大語言模型和生成式 AI 的爆發,單張 GPU 的價格居高不下且供應緊張,但許多訓練、微調和推論任務的負載是波動的——峰值時吃滿算力,多數時間存在閒置。超額訂閱允許在同一物理 GPU 上並行執行多個容器、虛擬機器或程序,讓空閒的 SM(流式多處理器)和視訊記憶體被“二次售出”
典型實現形態包括:

  • 計算超額訂閱:NVIDIA 的 MPS(多程序服務)、多例項 GPU(MIG)、以及基於 Time‑Slicing 的 vGPU 方案,允許多個 CUDA 上下文併發執行,提升流處理器利用率。
  • 視訊記憶體超額訂閱:利用統一記憶體(Unified Memory)和系統記憶體交換(Swap),使 GPU 程序能定址超過物理視訊記憶體的容量,以支撐更大的模型訓練或推論,但會引入 CPU‑GPU 間的分頁延遲。
  • 叢集排程超賣:在 Kubernetes 等平台上,將業務申請的 “Requests” 設定得低於實際消耗,使節點的“可排程資源”大於物理資源,實現容器密度的提高。

產業共識是:沒有超額訂閱,GPU 叢集的平均利用率很難突破 30%~40%,而通過合理的超額訂閱,利用率可提升至 70% 以上,這直接轉化為雲端服務商的獲利和終端使用者的成本節省。但關鍵挑戰是隔離性效能抖動——過度超賣會導致相鄰任務爭搶資源,使訓練迭代時間不可預測。

15分鐘專家深入

在深度學習全棧中,超額訂閱貫穿計算、儲存、網路三個維度,且不同技術路徑的權衡差異巨大。

1. 計算資源的超額訂閱

  • 分時多工 + 上下文切換:現代 GPU 具有一定程度的硬體搶佔能力,但 MPS 等超額訂閱技術主要通過上下文合併實現併發,而非依賴搶佔。傳統上依賴 CUDA Stream 或 MPS 來實現多個程序的 Kernel 交錯執行。MPS 會將多個上下文的 Kernel 打包成流水線,消除硬體初始化開銷,在推論等吞吐敏感場景下效果顯著,但一旦出現不可糾正的 GPU 錯誤(如越界訪問),所有共享程序都會崩潰——這是典型的隔離性犧牲。
  • 空間分割槽:MIG(多例項 GPU)是硬體級方案,將一塊 GPU 的 SM、視訊記憶體和 L2 快取切割成多個完全隔離的例項,每個例項就像一塊獨立的“小 GPU”。這是一種非超額訂閱的資源劃分(總量等於物理總量),但設計上允許在例項內部進一步通過 MPS 實現超額訂閱,形成巢狀的超額體系。
  • vGPU/Time‑Slicing:在虛擬機器或容器層通過排程器將 GPU 時間片分配給不同工作負載。超額訂閱比可達物理算力的數倍,但延遲敏感的推論任務可能因搶佔而出現尾部延遲飆升。

2. 視訊記憶體超額訂閱
核心技術是 CUDA 統一記憶體(Unified Memory) 的按需分頁。當工作集超過物理視訊記憶體時,GPU 驅動將冷資料頁換出到系統記憶體(甚至 SSD),並在缺頁時通過 PCIe 或 NVLink 通道拿回。頻寬鴻溝巨大:PCIe Gen4 頻寬僅為 HBM3 的約百分之一量級,因此這種“超額”主要對訪存不密集的核函式、或本身就需要遍歷大引數但計算密集的推論場景更友好。工業界常用 “offloading” 一詞來描述有意識地將部分層放到 CPU 記憶體上訓練,屬於視訊記憶體超額訂閱的分化實踐。

3. 網路超額訂閱
在分散式的 GPU 叢集中,葉‑脊網路存在匯入比(Oversubscription Ratio)。例如接入層 4 個 GPU 節點共享一條上行鏈路,則總上行可能達到收斂比 4:1。這在高流量 AllReduce 通訊時會引發擁塞,增加梯度同步延遲。面向大型模型的 InfiniBand 網路多采用 1:1 無阻塞設計,但乙太網路基於 RoCE 的叢集常採用 2:1 甚至 3:1 超額訂閱來降低成本。

4. 排程層面的超賣
Kubernetes 的 ResourceQuota 和 PriorityClass 允許設定 Overcommit。配合搶佔式例項或 Spot 例項,可以將整體叢集的申請的 CPU/GPU 總量設定為物理總量的 1.5~3 倍,依靠多數任務不會同時達到峰值的統計複用,來消化超額部分。風險在於突發高峰時可能觸發驅逐,這對於一次要跑數週的預訓練任務來說是不可接受的。

技術原理(最深,講機制+關鍵引數)

以 GPU 計算超額訂閱與視訊記憶體超額訂閱的結合為例,深入剖析機制。

1. MPS 的上下文合併流水線

程序 A          程序 B          程序 C
  |               |               |
  v               v               v
+------------------------------------------+
|        MPS 控制守護程序                  |
|  合併 CUDA 上下文 -> 序列化 Kernel 提交    |
+------------------------------------------+
  |
  v
+------------------------------------------+
|         物理 GPU 執行引擎                |
|  SM 組 1:執行 A 的 Kernel               |
|  SM 組 2:執行 B 的 Kernel  (併發)      |
|  L2 Cache & DRAM 共享,無視訊記憶體隔離        |
+------------------------------------------+
  • 關鍵機制:MPS 消除了多個程序間的上下文切換開銷,Kernel 一旦啟動就會佔用一部分 SM 直到完成,其餘 SM 仍可被另一程序使用。超額訂閱發生在申請的總並行度超過物理 SM 數量時,通過流多處理器分時使用實現。
  • 核心限制:所有程序共享同一視訊記憶體地址空間,沒有頁表隔離,一個程序視訊記憶體越界可以汙染另一個程序的資料;同時,一旦發生不可糾正的 GPU 錯誤(如越界訪問),所有共享程序都會崩潰。因此硬隔離缺失是 MPS 超額訂閱的致命弱點。

2. MIG(多例項 GPU)的硬體分割槽原理

物理 GPU (e.g., 7+ SM 分割槽方案,僅作示意)
+-------------------------------------------+
|  GPU 物理資源                             |
|  SM 組 (共 80 SM)  L2 Cache  DRAM 頻寬     |
+---+-------+-------+-------+-------+
    |       |               |
    v       v               v
 例項 1   例項 2         例項 3
 (20 SM)  (40 SM)        (20 SM)
 視訊記憶體 10G  視訊記憶體 20G       視訊記憶體 10G
 L2獨立分割槽  L2獨立分割槽    L2獨立分割槽
 獨立的   獨立的          獨立的
 虛擬功能  虛擬功能       虛擬功能
  • 分割槽方式:驅動通過 SR‑IOV 將 GPU 的物理資源切割成固定組合的“GI 例項”,每個例項獲得專屬的錯誤隔離 ID、SM 的獨佔排程槽、視訊記憶體分割槽和 L2 快取分割槽。在例項內部,可以像使用獨立 GPU 一樣再開啟 MPS 實現超額訂閱,但例項之間資源是硬性切開的,不存在超額。
  • 關鍵引數:物理 GPU 支援的例項配置檔案是定死的(例如只能切成 1G.5GB, 2G.10GB 等,具體款式未依據本次檢索,此處僅示例性描述)。超額訂閱只能發生在軟體排程層面——例如向一個只有 20 SM 的 MIG 例項提交總需求 40 SM 的多程序工作負載,依靠 MPS 分時多工。

3. 視訊記憶體超額訂閱(統一記憶體分頁)流程

 CPU 系統記憶體 (128 GB)              GPU 物理視訊記憶體 (16 GB)
+--------------------+           +--------------------+
| 被換出的頁           |---PCIe-->| 活躍工作集頁面      |
| (模型層、最佳化器狀態)   |<--缺頁中斷-| (當前計算層)       |
+--------------------+           +-------+-----------+
                                        |
                                        v
                                  GPU SM 執行
                                  (從視訊記憶體獲取資料)
  • 驅動機制:CUDA 驅動維護頁表,當 GPU 訪問的地址不在物理視訊記憶體內時,觸發缺頁中斷,驅動暫停該 GPU 引擎,通過 DMA 將所需頁從 CPU 記憶體遷移至 GPU 視訊記憶體,如有必要還需先換出舊頁。
  • 超額效果:程序可以 cudaMallocManaged() 分配遠超物理視訊記憶體的總量,程式看起來擁有“大記憶體”。但由於 PCIe 延遲高且頻寬小(相比 HBM),當工作集頻繁跨頁時,有效吞吐量可能下跌到物理視訊記憶體內執行的不到十分之一(具體比例因工作負載而異,[未依據檢索定量]),這就是超額訂閱的 效能代價
  • 最佳化:CUDA 提供記憶體建議 API(如 cudaMemAdvise)允許預取或指定駐留位置,減少缺頁。實際部署中常結合模型並行或流水線並行,將各層分別固定在視訊記憶體或 CPU 記憶體,構成手動超額管理。

技術演進史

  • 2010s 前期:GPU 僅支援單一計算上下文,多工序列。NVIDIA 推出按時間片輪轉的 vGPU,實現初代超額訂閱,但缺乏記憶體隔離。
  • 2013:MPS 隨 CUDA 5.5 在 Kepler 架構上首次引入,允許合併客戶端程序上下文,大幅提升小任務併發效率,然而隔離性缺失使其主要用於推論。(後續架構持續最佳化,2016‑2017 年已演進至 Pascal/Volta 時期。)
  • 2018‑2020:CUDA 統一記憶體從初始的“全或無”遷移演進到按需分頁(通過 Pascal 架構 GP100 及之後的硬體支援,CUDA 8 率先引入),視訊記憶體超額訂閱得以在訓練側實踐。與此同時,雲端運算推動 Kubernetes GPU 超賣。
  • 2021‑至今:NVIDIA A100 引入 MIG 硬體分割槽(後續代際延續該思路),首次在 GPU 內部實現硬隔離的空間分割槽,使客戶可以在單個 GPU 上安全執行多租戶負載,並巢狀使用 MPS 超額。AMD 在其 MI 系列中推出類似分割槽方案。超大規模雲端廠商基於 MIG + 彈性容器開發出 GPU 細粒度排程產品。

(以上架構及時間線基於產業共識,未依據本次檢索提供的具體資料進行嚴格型號歸屬,細節若有出入請以原廠文件為準。)

技術路線對比(量化表)

方案隔離強度超額訂閱能力效能開銷典型適用場景超額方式
MPS弱(共享視訊記憶體、無錯誤隔離)(可數倍超載 SM)低(合併上下文,額外開銷小)推論服務、批次短任務分時多工 SM
MIG(硬體級分割槽)間接(例項內可再 MPS)零(分割槽無效能磨損)多租戶訓練/推論,需 QoS 保證空間分割槽,例項內可超額
vGPU Time-Slicing中(虛擬化隔離,視訊記憶體可單獨劃分)強(時間片分配倍數)中(搶佔延遲)虛擬桌面、多使用者推論分時多工 + 虛擬切片
視訊記憶體超額訂閱(UM/Offloading)不適用(僅記憶體資源)極強(可超額數倍甚至數十倍)高~極高(取決於缺頁率)大型模型單卡逼近、微調、非即時推論分頁換出/換入
叢集排程超賣無(純排程)強(Requests 低於物理容量)取決於實際資源爭搶彈性訓練、低優先順序作業混合部署QoS 等級驅逐

注:表中強/中/弱等級基於定性評估,具體數字因硬體代際和配置而變化。

上下游

上游

  • GPU 晶片與驅動:NVIDIA、AMD、Intel 提供支援 MPS/MIG/vGPU 的硬體特性和驅動介面。硬體頁表、錯誤隔離引擎是視訊記憶體超額訂閱的基石。
  • 互連技術:PCIe、NVLink、InfiniBand 決定了超額訂閱場景下資料遷移和通訊的頻寬上限,是效能影響的硬約束。

中游

  • 虛擬化與排程軟體:Kubernetes(with GPU device plugin)、VMware vSphere、Run:ai、Determined AI 等平台將硬體超額訂閱能力封裝成面向使用者的資源池,實現細粒度的動態排程和超賣策略。
  • 深度學習架構適配:PyTorch、TensorFlow 對統一記憶體的利用模式(如 pin_memorybatch 策略)決定了超額訂閱的實際效果。

下游

  • 公有雲端 GPU 服務:AWS、Azure、GCP、阿里雲端等通過 MIG 或分時 GPU 例項提供共享型 GPU 產品,超額訂閱是其實現超過 100% 利用率的財務引擎。
  • 企業 AI 平台:內部 GPU 叢集通過超額訂閱支援多個團隊同時實驗,提高投資回報率。
  • 大型模型訓推一體平台:在推論階段大量使用 MPS 超額,以單卡支撐更多併發請求。

關鍵指標

  • 超額訂閱比 (Oversubscription Ratio):GPU 上同時活躍的工作負載總需求 SM/視訊記憶體與物理資源之比,典型範圍 1.2:1 到 4:1 不等(具體依場景,[無精確資料,依賴觀測])。
  • GPU 利用率提升幅度:開啟超額訂閱後 SM 佔用率是否趨近 90% 以上,與未超額時的 30%‑40% 形成對比。
  • 尾部延遲 P99/P999:推論服務在超額後的延遲抖動,是衡量“過量”程度的核心服務等級指標(SLO)。
  • 有效吞吐量下降:視訊記憶體超額訂閱下,因分頁帶來的迭代時間增長倍率。工作負載越密集,下降越劇烈。
  • 作業排隊延遲:超賣排程下,當實際資源使用率達到物理極限時任務被掛起的時間。

供需與市場資料

由於本次檢索未能獲取有效資料,根據產業公開趨勢總結:

  • 需求側:大型模型訓練的高階 GPU(如 A100/H100 等)在 2023‑2024 年全球供不應求,雲端 GPU 例項等待時間長,推動使用者轉向共享 GPU 方案。
  • 供給側:雲端廠商紛紛推出 GPU 分片例項和超額訂閱策略,作為提高現有硬體庫存貨幣化能力的核心手段。部分企業級 AI 基礎設施方案商將自動超賣排程作為產品差異化點。
  • 市場感知:行業估計,恰當的 GPU 超額訂閱能大幅降低每任務算力成本,雖無精確公開調研資料,但已成為所有主流雲端 AI 平台的標配能力。

代表公司與資本對映

公司在超額訂閱領域版面配置
NVIDIAMIG、MPS、vGPU 軟硬體全棧,驅動超額訂閱生態標準;CUDA 統一記憶體持續最佳化
AMDROCm 生態中提供類似分割槽與 MxGPU 方案,追趕 MIG 能力
Intel資料中心 GPU Flex Series / Max 系列配合虛擬化依賴,提供超賣介面
VMware (Broadcom)vSphere Bitfusion GPU 共享方案,支援跨網路超額訂閱
Run:ai專精 AI 工作負載編排,動態超額排程 GPU,結合佇列優先順序實現超賣
Kubernetes 社群Device Plugin、Dynamic Resource Allocation 機制為開源超賣奠基
公有雲端巨頭 (AWS, Azure, GCP, 阿里雲端等)各自推出 MIG 例項、Spot GPU 例項、搶佔式配額,實踐大規模超額訂閱
國內 AI 雲端服務商提供 GPU 共享產品,搭配超賣策略提升自營算力利用率

投資邏輯

  1. 硬體利用率焦慮驅動軟體升級:當 GPU 採購成本佔 AI 基礎設施一半以上時,提高 10% 的利用率就意味著數千萬美元級別的 TCO 改善,因此投資於超額排程、虛擬 GPU 管理的軟體公司(如 Run:ai 及相關排程器供應商)具有明確的 ROI 故事。
  2. 雲端 AI 服務的價值放大器:具備精細超額訂閱能力的雲端服務商可以以更低價格提供 GPU 例項搶佔市場,同時保持毛利率,具備競爭優勢。
  3. 風險:超額訂閱高度依賴負載特徵,如果未來 AI 任務變得更長時間密集(例如萬億引數模型持續預訓練),統計複用空間收窄,超賣的可行性會下降。此外,硬體隔離技術的進步(更細粒度的 MIG)可能會減少對軟體超額的需求。

常見誤讀糾偏

  1. “超額訂閱可以無代價獲得免費資源”
    事實:無論是分時多工還是視訊記憶體超用,總要付出效能代價。MPS 超量會導致 Kernel 排隊、延遲增加;記憶體超額會觸發頻繁換頁,吞吐量可能斷崖式下跌。將超額設為“無限”只會使所有任務同時不可用。
  2. “MIG 本身是一種超額訂閱技術”
    事實:MIG 是嚴格物理分割槽,將一個 GPU 切成幾個小 GPU,整體算力之和等於物理總量,並未超額。超額只發生在 MIG 例項內部進一步使用 MPS 或者排程器錯誤地將超出例項資源的任務分配給該例項時。因此,不能混淆“分割槽”與“超額”。
  3. “視訊記憶體超額訂閱藉助統一記憶體,大型模型訓練就和正常一樣快”
    事實:統一記憶體自動遷移引入的 PCIe 延遲可達若干微秒,遠超 HBM 納秒級延遲。對於那些頻繁訪問全部引數的訓練迴圈(如全引數微調),效能崩壞嚴重;只適用於計算強度極高且訪存區域性性好的部分運算元或層。

學習路徑

  1. 基礎概念:閱讀 NVIDIA CUDA 程式設計指南中“ Unified Memory for CUDA”章節,理解分頁遷移和缺頁過程。
  2. GPU 虛擬化:研讀 NVIDIA MIG 使用者指南與 MPS 文件,瞭解例項配置和上下文合併。
  3. 排程超賣:學習 Kubernetes 官方文件《Resource Management for Pods and Containers》,重點理解 Requests/Limits 與 QoS 類。
  4. 生產實踐:參考雲端廠商 GPU 共享例項的白皮書,以及 Run:ai 等平台的技術部落格,觀察超額排程在混合負載下的策略設計。
  5. 進階論文:檢索關於 GPU 共享公平排程、視訊記憶體超額對訓練收斂影響的相關學術論文,深入量化分析。

一句話總結

Oversubscription 是用有限的物理 GPU 資源通過時間、空間和記憶體的巧妙“欺詐”,來消化現代 AI 負載的巨大彈性需求,本質是成本與效能之間最務實的妥協藝術。

延伸閱讀與來源

  • NVIDIA Multi‑Instance GPU (MIG) 官方文件
  • CUDA C++ Programming Guide – Unified Memory
  • Kubernetes Documentation: Resource Management
  • Run:ai 技術部落格 – Dynamic GPU Oversubscription in Production
  • 各大公有雲端廠商 GPU 例項型別說明

(注:本次聯網檢索未成功,以上參考文獻為基於產業公開來源的推薦;文中技術分析未繫結任何本次未檢索到的特定硬體型號或具體引數,所有定量描述均為定性示例,如需精確決策請查閱原廠最新 datasheet。)

source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型