网络层 开放阅读

Oversubscription

Oversubscription

概念 ID
oversubscription
更新时间
2026-05-29
来源数量
待补

Oversubscription

3秒看懂

Oversubscription(超额订阅) 是指在深度学习基础设施中,有意让多个任务请求的硬件资源总量 超过物理硬件的实际可用资源,通过分时复用、空间分区或内存换页等手段,在性能损失可控的前提下,大幅提升 GPU 等昂贵加速器的利用率,降低总体拥有成本(TCO)。它的本质是 用可控的服务质量换资源效率

3分钟产业解释

随着大语言模型和生成式 AI 的爆发,单张 GPU 的价格居高不下且供应紧张,但许多训练、微调和推理任务的负载是波动的——峰值时吃满算力,多数时间存在闲置。超额订阅允许在同一物理 GPU 上并行运行多个容器、虚拟机或进程,让空闲的 SM(流式多处理器)和显存被“二次售出”
典型实现形态包括:

  • 计算超额订阅:NVIDIA 的 MPS(多进程服务)、多实例 GPU(MIG)、以及基于 Time‑Slicing 的 vGPU 方案,允许多个 CUDA 上下文并发执行,提升流处理器利用率。
  • 显存超额订阅:利用统一内存(Unified Memory)和系统内存交换(Swap),使 GPU 进程能寻址超过物理显存的容量,以支撑更大的模型训练或推理,但会引入 CPU‑GPU 间的分页延迟。
  • 集群调度超卖:在 Kubernetes 等平台上,将业务申请的 “Requests” 设置得低于实际消耗,使节点的“可调度资源”大于物理资源,实现容器密度的提高。

产业共识是:没有超额订阅,GPU 集群的平均利用率很难突破 30%~40%,而通过合理的超额订阅,利用率可提升至 70% 以上,这直接转化为云服务商的利润和终端用户的成本节省。但关键挑战是隔离性性能抖动——过度超卖会导致相邻任务争抢资源,使训练迭代时间不可预测。

15分钟专家深入

在深度学习全栈中,超额订阅贯穿计算、存储、网络三个维度,且不同技术路径的权衡差异巨大。

1. 计算资源的超额订阅

  • 时分复用 + 上下文切换:现代 GPU 具有一定程度的硬件抢占能力,但 MPS 等超额订阅技术主要通过上下文合并实现并发,而非依赖抢占。传统上依赖 CUDA Stream 或 MPS 来实现多个进程的 Kernel 交错执行。MPS 会将多个上下文的 Kernel 打包成流水线,消除硬件初始化开销,在推理等吞吐敏感场景下效果显著,但一旦出现不可纠正的 GPU 错误(如越界访问),所有共享进程都会崩溃——这是典型的隔离性牺牲。
  • 空间分区:MIG(多实例 GPU)是硬件级方案,将一块 GPU 的 SM、显存和 L2 缓存切割成多个完全隔离的实例,每个实例就像一块独立的“小 GPU”。这是一种非超额订阅的资源划分(总量等于物理总量),但设计上允许在实例内部进一步通过 MPS 实现超额订阅,形成嵌套的超额体系。
  • vGPU/Time‑Slicing:在虚拟机或容器层通过调度器将 GPU 时间片分配给不同工作负载。超额订阅比可达物理算力的数倍,但延迟敏感的推理任务可能因抢占而出现尾部延迟飙升。

2. 显存超额订阅
核心技术是 CUDA 统一内存(Unified Memory) 的按需分页。当工作集超过物理显存时,GPU 驱动将冷数据页换出到系统内存(甚至 SSD),并在缺页时通过 PCIe 或 NVLink 通道拿回。带宽鸿沟巨大:PCIe Gen4 带宽仅为 HBM3 的约百分之一量级,因此这种“超额”主要对访存不密集的核函数、或本身就需要遍历大参数但计算密集的推理场景更友好。工业界常用 “offloading” 一词来描述有意识地将部分层放到 CPU 内存上训练,属于显存超额订阅的分化实践。

3. 网络超额订阅
在分布式的 GPU 集群中,叶‑脊网络存在汇入比(Oversubscription Ratio)。例如接入层 4 个 GPU 节点共享一条上行链路,则总上行可能达到收敛比 4:1。这在高流量 AllReduce 通信时会引发拥塞,增加梯度同步延迟。面向大模型的 InfiniBand 网络多采用 1:1 无阻塞设计,但以太网基于 RoCE 的集群常采用 2:1 甚至 3:1 超额订阅来降低成本。

4. 调度层面的超卖
Kubernetes 的 ResourceQuota 和 PriorityClass 允许设置 Overcommit。配合抢占式实例或 Spot 实例,可以将整体集群的申请的 CPU/GPU 总量设置为物理总量的 1.5~3 倍,依靠多数任务不会同时达到峰值的统计复用,来消化超额部分。风险在于突发高峰时可能触发驱逐,这对于一次要跑数周的预训练任务来说是不可接受的。

技术原理(最深,讲机制+关键参数)

以 GPU 计算超额订阅与显存超额订阅的结合为例,深入剖析机制。

1. MPS 的上下文合并流水线

进程 A          进程 B          进程 C
  |               |               |
  v               v               v
+------------------------------------------+
|        MPS 控制守护进程                  |
|  合并 CUDA 上下文 -> 序列化 Kernel 提交    |
+------------------------------------------+
  |
  v
+------------------------------------------+
|         物理 GPU 执行引擎                |
|  SM 组 1:执行 A 的 Kernel               |
|  SM 组 2:执行 B 的 Kernel  (并发)      |
|  L2 Cache & DRAM 共享,无显存隔离        |
+------------------------------------------+
  • 关键机制:MPS 消除了多个进程间的上下文切换开销,Kernel 一旦启动就会占用一部分 SM 直到完成,其余 SM 仍可被另一进程使用。超额订阅发生在申请的总并行度超过物理 SM 数量时,通过流多处理器分时使用实现。
  • 核心限制:所有进程共享同一显存地址空间,没有页表隔离,一个进程显存越界可以污染另一个进程的数据;同时,一旦发生不可纠正的 GPU 错误(如越界访问),所有共享进程都会崩溃。因此硬隔离缺失是 MPS 超额订阅的致命弱点。

2. MIG(多实例 GPU)的硬件分区原理

物理 GPU (e.g., 7+ SM 分区方案,仅作示意)
+-------------------------------------------+
|  GPU 物理资源                             |
|  SM 组 (共 80 SM)  L2 Cache  DRAM 带宽     |
+---+-------+-------+-------+-------+
    |       |               |
    v       v               v
 实例 1   实例 2         实例 3
 (20 SM)  (40 SM)        (20 SM)
 显存 10G  显存 20G       显存 10G
 L2独立分区  L2独立分区    L2独立分区
 独立的   独立的          独立的
 虚拟功能  虚拟功能       虚拟功能
  • 分区方式:驱动通过 SR‑IOV 将 GPU 的物理资源切割成固定组合的“GI 实例”,每个实例获得专属的错误隔离 ID、SM 的独占调度槽、显存分区和 L2 缓存分区。在实例内部,可以像使用独立 GPU 一样再开启 MPS 实现超额订阅,但实例之间资源是硬性切开的,不存在超额。
  • 关键参数:物理 GPU 支持的实例配置文件是定死的(例如只能切成 1G.5GB, 2G.10GB 等,具体款式未依据本次检索,此处仅示例性描述)。超额订阅只能发生在软件调度层面——例如向一个只有 20 SM 的 MIG 实例提交总需求 40 SM 的多进程工作负载,依靠 MPS 时分复用。

3. 显存超额订阅(统一内存分页)流程

 CPU 系统内存 (128 GB)              GPU 物理显存 (16 GB)
+--------------------+           +--------------------+
| 被换出的页           |---PCIe-->| 活跃工作集页面      |
| (模型层、优化器状态)   |<--缺页中断-| (当前计算层)       |
+--------------------+           +-------+-----------+
                                        |
                                        v
                                  GPU SM 执行
                                  (从显存获取数据)
  • 驱动机制:CUDA 驱动维护页表,当 GPU 访问的地址不在物理显存内时,触发缺页中断,驱动暂停该 GPU 引擎,通过 DMA 将所需页从 CPU 内存迁移至 GPU 显存,如有必要还需先换出旧页。
  • 超额效果:进程可以 cudaMallocManaged() 分配远超物理显存的总量,程序看起来拥有“大内存”。但由于 PCIe 延迟高且带宽小(相比 HBM),当工作集频繁跨页时,有效吞吐量可能下跌到物理显存内执行的不到十分之一(具体比例因工作负载而异,[未依据检索定量]),这就是超额订阅的 性能代价
  • 优化:CUDA 提供内存建议 API(如 cudaMemAdvise)允许预取或指定驻留位置,减少缺页。实际部署中常结合模型并行或流水线并行,将各层分别固定在显存或 CPU 内存,构成手动超额管理。

技术演进史

  • 2010s 前期:GPU 仅支持单一计算上下文,多任务串行。NVIDIA 推出按时间片轮转的 vGPU,实现初代超额订阅,但缺乏内存隔离。
  • 2013:MPS 随 CUDA 5.5 在 Kepler 架构上首次引入,允许合并客户端进程上下文,大幅提升小任务并发效率,然而隔离性缺失使其主要用于推理。(后续架构持续优化,2016‑2017 年已演进至 Pascal/Volta 时期。)
  • 2018‑2020:CUDA 统一内存从初始的“全或无”迁移演进到按需分页(通过 Pascal 架构 GP100 及之后的硬件支持,CUDA 8 率先引入),显存超额订阅得以在训练侧实践。与此同时,云计算推动 Kubernetes GPU 超卖。
  • 2021‑至今:NVIDIA A100 引入 MIG 硬件分区(后续代际延续该思路),首次在 GPU 内部实现硬隔离的空间分区,使客户可以在单个 GPU 上安全运行多租户负载,并嵌套使用 MPS 超额。AMD 在其 MI 系列中推出类似分区方案。超大规模云厂商基于 MIG + 弹性容器开发出 GPU 细粒度调度产品。

(以上架构及时间线基于产业共识,未依据本次检索提供的具体资料进行严格型号归属,细节若有出入请以原厂文档为准。)

技术路线对比(量化表)

方案隔离强度超额订阅能力性能开销典型适用场景超额方式
MPS弱(共享显存、无错误隔离)(可数倍超载 SM)低(合并上下文,额外开销小)推理服务、批量短任务时分复用 SM
MIG(硬件级分区)间接(实例内可再 MPS)零(分区无性能磨损)多租户训练/推理,需 QoS 保证空间分区,实例内可超额
vGPU Time-Slicing中(虚拟化隔离,显存可单独划分)强(时间片分配倍数)中(抢占延迟)虚拟桌面、多用户推理时分复用 + 虚拟切片
显存超额订阅(UM/Offloading)不适用(仅内存资源)极强(可超额数倍甚至数十倍)高~极高(取决于缺页率)大模型单卡逼近、微调、非实时推理分页换出/换入
集群调度超卖无(纯调度)强(Requests 低于物理容量)取决于实际资源争抢弹性训练、低优先级作业混合部署QoS 等级驱逐

注:表中强/中/弱等级基于定性评估,具体数字因硬件代际和配置而变化。

上下游

上游

  • GPU 芯片与驱动:NVIDIA、AMD、Intel 提供支持 MPS/MIG/vGPU 的硬件特性和驱动接口。硬件页表、错误隔离引擎是显存超额订阅的基石。
  • 互连技术:PCIe、NVLink、InfiniBand 决定了超额订阅场景下数据迁移和通信的带宽上限,是性能影响的硬约束。

中游

  • 虚拟化与调度软件:Kubernetes(with GPU device plugin)、VMware vSphere、Run:ai、Determined AI 等平台将硬件超额订阅能力封装成面向用户的资源池,实现细粒度的动态调度和超卖策略。
  • 深度学习框架适配:PyTorch、TensorFlow 对统一内存的利用模式(如 pin_memorybatch 策略)决定了超额订阅的实际效果。

下游

  • 公有云 GPU 服务:AWS、Azure、GCP、阿里云等通过 MIG 或分时 GPU 实例提供共享型 GPU 产品,超额订阅是其实现超过 100% 利用率的财务引擎。
  • 企业 AI 平台:内部 GPU 集群通过超额订阅支持多个团队同时实验,提高投资回报率。
  • 大模型训推一体平台:在推理阶段大量使用 MPS 超额,以单卡支撑更多并发请求。

关键指标

  • 超额订阅比 (Oversubscription Ratio):GPU 上同时活跃的工作负载总需求 SM/显存与物理资源之比,典型范围 1.2:1 到 4:1 不等(具体依场景,[无精确数据,依赖观测])。
  • GPU 利用率提升幅度:开启超额订阅后 SM 占用率是否趋近 90% 以上,与未超额时的 30%‑40% 形成对比。
  • 尾部延迟 P99/P999:推理服务在超额后的延迟抖动,是衡量“过量”程度的核心服务等级指标(SLO)。
  • 有效吞吐量下降:显存超额订阅下,因分页带来的迭代时间增长倍率。工作负载越密集,下降越剧烈。
  • 作业排队延迟:超卖调度下,当实际资源使用率达到物理极限时任务被挂起的时间。

供需与市场数据

由于本次检索未能获取有效数据,根据产业公开趋势总结:

  • 需求侧:大模型训练的高端 GPU(如 A100/H100 等)在 2023‑2024 年全球供不应求,云 GPU 实例等待时间长,推动用户转向共享 GPU 方案。
  • 供给侧:云厂商纷纷推出 GPU 分片实例和超额订阅策略,作为提高现有硬件库存货币化能力的核心手段。部分企业级 AI 基础设施方案商将自动超卖调度作为产品差异化点。
  • 市场感知:行业估计,恰当的 GPU 超额订阅能大幅降低每任务算力成本,虽无精确公开调研数据,但已成为所有主流云 AI 平台的标配能力。

代表公司与资本映射

公司在超额订阅领域布局
NVIDIAMIG、MPS、vGPU 软硬件全栈,驱动超额订阅生态标准;CUDA 统一内存持续优化
AMDROCm 生态中提供类似分区与 MxGPU 方案,追赶 MIG 能力
Intel数据中心 GPU Flex Series / Max 系列配合虚拟化依赖,提供超卖接口
VMware (Broadcom)vSphere Bitfusion GPU 共享方案,支持跨网络超额订阅
Run:ai专精 AI 工作负载编排,动态超额调度 GPU,结合队列优先级实现超卖
Kubernetes 社区Device Plugin、Dynamic Resource Allocation 机制为开源超卖奠基
公有云巨头 (AWS, Azure, GCP, 阿里云等)各自推出 MIG 实例、Spot GPU 实例、抢占式配额,实践大规模超额订阅
国内 AI 云服务商提供 GPU 共享产品,搭配超卖策略提升自营算力利用率

投资逻辑

  1. 硬件利用率焦虑驱动软件升级:当 GPU 采购成本占 AI 基础设施一半以上时,提高 10% 的利用率就意味着数千万美元级别的 TCO 改善,因此投资于超额调度、虚拟 GPU 管理的软件公司(如 Run:ai 及相关调度器供应商)具有明确的 ROI 故事。
  2. 云 AI 服务的价值放大器:具备精细超额订阅能力的云服务商可以以更低价格提供 GPU 实例抢占市场,同时保持毛利率,具备竞争优势。
  3. 风险:超额订阅高度依赖负载特征,如果未来 AI 任务变得更长时间密集(例如万亿参数模型持续预训练),统计复用空间收窄,超卖的可行性会下降。此外,硬件隔离技术的进步(更细粒度的 MIG)可能会减少对软件超额的需求。

常见误读纠偏

  1. “超额订阅可以无代价获得免费资源”
    事实:无论是时分复用还是显存超用,总要付出性能代价。MPS 超量会导致 Kernel 排队、延迟增加;内存超额会触发频繁换页,吞吐量可能断崖式下跌。将超额设为“无限”只会使所有任务同时不可用。
  2. “MIG 本身是一种超额订阅技术”
    事实:MIG 是严格物理分区,将一个 GPU 切成几个小 GPU,整体算力之和等于物理总量,并未超额。超额只发生在 MIG 实例内部进一步使用 MPS 或者调度器错误地将超出实例资源的任务分配给该实例时。因此,不能混淆“分区”与“超额”。
  3. “显存超额订阅借助统一内存,大模型训练就和正常一样快”
    事实:统一内存自动迁移引入的 PCIe 延迟可达若干微秒,远超 HBM 纳秒级延迟。对于那些频繁访问全部参数的训练循环(如全参数微调),性能崩坏严重;只适用于计算强度极高且访存局部性好的部分算子或层。

学习路径

  1. 基础概念:阅读 NVIDIA CUDA 编程指南中“ Unified Memory for CUDA”章节,理解分页迁移和缺页过程。
  2. GPU 虚拟化:研读 NVIDIA MIG 用户指南与 MPS 文档,了解实例配置和上下文合并。
  3. 调度超卖:学习 Kubernetes 官方文档《Resource Management for Pods and Containers》,重点理解 Requests/Limits 与 QoS 类。
  4. 生产实践:参考云厂商 GPU 共享实例的白皮书,以及 Run:ai 等平台的技术博客,观察超额调度在混合负载下的策略设计。
  5. 进阶论文:检索关于 GPU 共享公平调度、显存超额对训练收敛影响的相关学术论文,深入量化分析。

一句话总结

Oversubscription 是用有限的物理 GPU 资源通过时间、空间和内存的巧妙“欺诈”,来消化现代 AI 负载的巨大弹性需求,本质是成本与性能之间最务实的妥协艺术。

延伸阅读与来源

  • NVIDIA Multi‑Instance GPU (MIG) 官方文档
  • CUDA C++ Programming Guide – Unified Memory
  • Kubernetes Documentation: Resource Management
  • Run:ai 技术博客 – Dynamic GPU Oversubscription in Production
  • 各大公有云厂商 GPU 实例类型说明

(注:本次联网检索未成功,以上参考文献为基于产业公开来源的推荐;文中技术分析未绑定任何本次未检索到的特定硬件型号或具体参数,所有定量描述均为定性示例,如需精确决策请查阅原厂最新 datasheet。)

source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型