概念库 开放阅读

GPU 直通 (GPU Passthrough)

概念库 · 开放阅读

概念 ID
gpu-passthrough
更新时间
2026-06-03
来源数量
1

GPU 直通 (GPU Passthrough)

1. 3 秒看懂

一句话定义:将物理 GPU 的全部硬件能力,直接、独占地分配给一台虚拟机(VM)或容器使用,绕过虚拟化管理程序的软件模拟层,使虚拟机能以接近原生(性能损失通常 <5%)的方式使用显卡。

解决什么:消除虚拟化环境下 GPU 资源的性能抖动与兼容性问题,为云游戏、AI 训练推理、专业图形渲染等算力敏感负载提供“裸金属级”图形与计算性能。

与常见方案的直觉区别:如果把 GPU 比作一间精装修办公室,传统虚拟 GPU(vGPU)相当于多个租户挤在一起共享工位,每个人只能用一小部分空间且受公共规则约束;GPU 直通则等于把这间办公室完全交给一个租户使用,他可以独自使用所有设施、把钥匙挂在自家门后,不受任何邻居干扰。

2. 3 分钟产业解释

GPU 直通(GPU Passthrough)是云计算与数据中心 GPU 虚拟化的关键技术路线之一。它的运作基础是 x86/ARM 处理器中的 IOMMU(输入输出内存管理单元)——例如 Intel VT-d 与 AMD-Vi——让管理程序直接向虚拟机暴露整个 GPU 设备的 PCIe 资源(设备内存、寄存器、中断线)。虚拟机在得到该设备后,可安装 GPU 厂商的原生驱动程序,无需经过管理程序层的图形 API 转译,因此几乎实现了原机的图形、计算与应用兼容性。

为什么现在重要?

  1. 大模型与高密度推理需求爆发:2023–2024 年,单卡承载多租户推理的 GPU 内存与算力瓶颈凸显。独占式 GPU 可确保推理延迟不因邻居负载而波动,这对金融风控、自动驾驶感知等 SLA 敏感场景至关重要。
  2. 云游戏与实时渲染的商业化推进:NVIDIA GeForce NOW、腾讯 START 等平台,在后端大量采用直通技术保证每帧渲染时间的确定性,提供 1080p 240fps 或 4K 120fps 流能力。
  3. 专业软件许可合规:AutoCAD、CATIA 等工程软件对虚拟机环境的 GPU 识别较为严格,直通方案配合原生驱动被认为是最安全、兼容性最优的虚拟化方式,避免因图形 API 模拟导致的授权失效或功能宕机。
  4. MIG/虚拟化 GPU 无法完全替代直通:虽然 NVIDIA MIG 可硬件切分 A100/H100,但其最大实例数量与每实例内存/缓存仍受限,对于要求全卡内存带宽或全张量核心的任务,直通依然是唯一选择。

核心应用场景

  • 公有云 GPU 实例:AWS p4d、Azure NDm A100 v4、阿里云 GPU 云服务器 gn7i 等提供基于直通或类似技术的单租户实例。
  • 私有数据中心:虚拟桌面基础设施(VDI)中工程师使用 Siemens NX、Ansys Fluent 等重型应用,每个工作台获得独立 GPU 以避免设计软件崩溃。
  • 边缘 AI 推理:在工业视觉、车路协同等场景中,虚拟机化后的 GPU 直通可简化操作系统与驱动更新,同时保障低延迟推理。

3. 技术原理

3.1 IOMMU 机制与 DMA 重映射

GPU 直通的技术基石是 IOMMU。现代 GPU 通过 PCIe 总线与系统内存交互,发起 DMA(直接内存访问)读写操作。在没有 IOMMU 的情况下,设备可直接访问任意物理内存地址,无法进行虚拟化隔离。IOMMU 为每个直通设备提供一套 设备虚拟地址空间,当虚拟机内的 GPU 驱动通过 BAR(基址寄存器)空间发出 DMA 请求时,IOMMU 会实时将虚拟机物理地址(GPA)翻译为主机物理地址(HPA)。这一翻译过程基于管理程序预配置的页表,确保直通 GPU 只能访问分配给该虚拟机的内存区域,实现内存级隔离。

3.2 VFIO 与用户态驱动框架

在 Linux KVM/QEMU 生态中,VFIO(Virtual Function I/O)是 GPU 直通的主要用户态接口。VFIO 通过 /dev/vfio/ 提供对 IOMMU 组的抽象:同一 IOMMU 组内的所有设备必须绑定到同一虚拟机,以避免隔离漏洞。管理员需要将 GPU 及其关联设备(如 HDMI 音频控制器、USB-C 控制器)从宿主机驱动解绑,绑定到 vfio-pci 驱动,再将其分配给 QEMU。VFIO 还负责处理设备中断重映射:直通 GPU 触发的 MSI/MSI-X 中断会被 IOMMU 中断重映射逻辑定向到对应虚拟机的虚拟 LAPIC,从而避免虚机间中断窃听。

3.3 GPU 重置与 FLR

GPU 直通的一大工程难题是 设备重置。当虚拟机重启或 GPU 需要回收时,管理程序必须将 GPU 回退到已知的干净状态,否则下一宿主或虚拟机可能读取到前一用户残留的显存数据,造成安全隐患。理想机制是 Function Level Reset (FLR),即通过 PCIe 的复位域将整个 GPU 函数状态清零。然而,部分消费级 GPU(如 GeForce 系列某些型号)的 FLR 支持不完善,复位后可能出现寄存器残留或固件锁死,需要配合宿主机端的总线复位(Secondary Bus Reset)或 Power Cycle。NVIDIA 数据中心 GPU(A100/H100/ L40S)及部分专业卡则提供完善的 FLR 与 GPU 复位序列。这一差异构成消费级显卡在企业直通方案中推广的现实障碍。

3.4 与 vGPU、SR-IOV 的对比

  • GPU 直通:1:1 映射,整卡独占(或通过 MIG 实现硬件分区),性能损失 <5%;缺点是物理卡数与虚机数线性相关,资源碎片化。
  • vGPU (GRID/Grid vGPU):管理程序提供一个虚拟 GPU 驱动,与客户机驱动通过虚拟化通道交互,调度器在多个虚机间切分 GPU 时间片。性能开销 5–15%,兼容性需通过认证矩阵,但单卡可支持多达 16–32 个并发虚机(NVIDIA vGPU 2023 规格)。
  • SR-IOV:通过 PCIe 单根 I/O 虚拟化将物理 GPU 暴露为多个虚拟功能(VF),每个 VF 可直接分配给虚机。Intel GVT-d 早期即基于此思路,但 GPU 领域的 SR-IOV 成熟度不足,仅有 Intel Data Center GPU Flex 系列和 AMD MxGPU 基于 SR-IOV,NVIDIA 主流产品未原生支持。
  • MIG (多实例 GPU):NVIDIA A100/H100 可在硬件层面切分 GPU 计算单元与显存为最多 7 个独立实例,每个实例获得独立的缓存、内存带宽和错误隔离。MIG 实例的表现类似直通,但粒度固定,且张量核心与显存带宽被分割,比完整直通仍有折中。

4. 关键参数

衡量 GPU 直通方案质量的参数涵盖性能、隔离度、兼容性与管理开销。

参数类别具体指标说明
性能损失率GPU 渲染性能损失(典型 Specviewperf 得分对比)直通方案通常 <5%;vGPU 5–15%(来源:NVIDIA vGPU 性能指南,2023 年 10 月)。
DMA 延迟增量直通后 GPU 内存访问增加的延迟主要来自两级地址翻译(GPA→HPA)。Intel VT-d 具备缓存(IOTLB)减少额外延迟,实测增量约 1–3μs(来源:VMware,2022)。
帧时间标准差 (Frame Time Variance)图形应用首帧到末帧的稳定性直通可维持 1–2ms 的帧时间标准差,vGPU 在高负载下可能扩至 4–8ms(来源:Blur Busters/GamersNexus 测试方法论)。
IOMMU 组粒度同一组内独立重置的设备数理想情况是 GPU 独立成组(ACS support),否则需将组内无关设备一起直通,增加实施复杂度。
GPU 重置成功率连续虚机起停 100 次后 GPU 可用性数据中心 GPU 应达到 99.9%+;消费卡约 95–98%(社区测试,公开资料未见厂商保证)。
最大 VM 支持数单宿主机可直通的 GPU 数量受制于 PCIe 根端口宽度、BIOS 预留 BAR 空间。通常 8–16 卡(例如 Supermicro 4U 10 GPU 系统)。
直通 GPU 迁移支持虚机能热迁移吗?当前主流方案不支持带 GPU 状态的热迁移;NVIDIA 提供 GPU 卸载/重新绑定技术(如 QEMU 的 nvidia-p2p),但仍需重启虚机,尚不成熟(截至 2024 年)。
显存保护与 ECC直通后虚拟机是否能透传 ECC 功能NVIDIA 数据中心 GPU 支持,消费卡无;虚机内可使用显存加密(如 AMD SEV-SNP 配合 CXL 内存加密尚在早期)。

性能与成本的权衡:独占式直通最适用于高帧率实时渲染或长时间训练任务,而不适合知识类 VDI 环境(如 Office 办公),因其会导致 GPU 利用率过低。容量规划时,需根据 GPU 型号的空闲功耗(50–80W)与每瓦特性能比评估经济性。


5. 技术路线

5.1 基于 VFIO 的 KVM/QEMU 路线(开源主力)

KVM/QEMU + VFIO 是 Linux 下实现 GPU 直通的默认栈,广泛用于私有云、超融合和测试环境。关键配套工具包括 libvirt 的 “ 配置、GPU 隔离脚本(如 vfio-pci-override.sh)、ACS override 补丁(用于非理想 IOMMU 分组的消费级主板)。该路线的优势在于开源、可控、成本低;挑战是需要集成驱动黑名单、内核命令行(intel_iommu=on iommu=pt)维护,对操作者经验要求较高。

5.2 VMware vSphere DirectPath I/O

VMware 的商业化方案通过 DirectPath I/O 功能提供 GPU 直通。vCenter 提供 UI 向导,可简化 IOMMU 寻址与设备分配。但对 NVIDIA 消费级卡的兼容性受制于 vSphere 的 PCI 设备认证列表,生产环境通常推荐 Quadro/RTX 专业卡及数据中心 GPU。该路线配套 vMotion 不支持直通设备,但支持通过 NVIDIA GRID 虚拟 GPU 管理器在同一平台上混用直通与 vGPU,灵活度较高。

5.3 云原生容器式直通:NVIDIA GPU Operator + Device Plugin

在 Kubernetes 环境中,NVIDIA GPU Operator 结合 nvidia-device-plugin 支持将整卡 GPU 通过基于 PCIe 的设备映射暴露给容器。这本质上是一种受控的直通(技术路径为在宿主机仍加载 NVIDIA 驱动,容器内通过 NVML 认领 GPU,并透传 /dev/nvidia* 设备节点),可提供接近原生性能。但它不完全等同于 VFIO 直通,因为它依赖宿主机侧驱动干预,不完全绕过 kernel。完全基于 VFIO 的容器方案(如将 GPU 绑定到 VFIO 后通过 vfio-pci 容器化)仍在实验阶段,NVIDIA 2023 年 GTC 提及探索“VFIO IOMMU 安全容器加速”。

5.4 硬件辅助分区:MIG(仅限于 NVIDIA A100/H100)

MIG 可以看作一种固定粒度的直通路线。管理员可将一个 GPU 配置为多个 GPU 实例,它们之间具备硬件隔离,不需要虚拟化层调度。每个 MIG 实例可被分配给独立的 VM 或容器。该路线解决了传统直通物理分割不足的问题,但受限于实例规格(如 1g.5gb、2g.10gb 等),不能动态调整,且 A100 一代在 MIG 下部分功能(如 CUDA Graph 部分支持)存在限制。

5.5 国产路线探索

国内 GPU 创企如火如荼,直通支持路径主要基于标准 PCIe ACS/IOMMU 机制。摩尔线程 MTT S 系列在 Linux 下通过 VFIO 直通已可见社区验证(2024 年 LoongArch 平台上有人成功配置,来源:开源社区帖,公开资料未见企业级批量部署数据)。壁仞 BR100 系列基于自研架构,宣称支持 SR-IOV 与直通,但目前公开资料未见公有云客户案例。


6. 上游

GPU 直通的上游由硬件、固件、处理器平台和标准协议构成。

  • CPU/芯片组厂商 Intel:Xeon 可扩展系列(Sapphire Rapids/Emerald Rapids)及搭配 C741 芯片组,提供原生 VT-d 和最佳 ACS 实现,高端平台支持庞大 PCIe 通道(最多 112 条 PCIe 5.0 通道),是 8–10 GPU 直通服务器的基石。 AMD:EPYC 处理器(Genoa/Bergamo)提供 AMD-Vi,支持 PCIe 5.0,且由于 SoC 本身的 I/O Die 提供多通道,成本相比 Intel 有一定优势。部分超大规模云厂商 2023 年选择 AMD 平台用于 GPU 直通实例(来源:公开新闻,如 TensorWave 部署 MI300X)。 ARM 生态:Ampere Altra Max 在边缘服务器中尝试 GPU 直通,配合 NVIDIA A2 卡,通过 SMMU 实现 IOMMU,但生态仍远小于 x86。

  • GPU 厂商 NVIDIA:掌握最完整的直通技术文档与验证体系。数据中心系列(A100/H100/L40S)出厂即支持 FLR 与 ACS,Professional(RTX 6000 Ada)提供认证的直通支持,消费级 GeForce 在 2021 年后驱动放宽虚拟化限制,允许 GeForce 卡用于直通,但不提供官方技术保证。 AMD:Instinct MI 系列(MI250X、MI300X)与 Radeon Pro 支持直通,但 ROCm 虚拟化生态较 N 卡稍弱,社区用户部署 VFIO 直通的经验文献在 2024 年增多(来源:GitHub 项目 VFIORadeon)。 Intel:Data Center GPU Flex 140/170 系列及 Arc Pro 系列,以 SR-IOV 为主打,但也支持向特定 VM 分配整个物理 GPU 实现直通模式,主要面向媒体转码与 Android 云游戏。

  • PCIe 交换与固件 高端多 GPU 服务器依赖 PCIe 交换芯片(如 Broadcom PEX88000)扩展通道,并需 BIOS/UEFI 支持大 BAR 空间(Resizable BAR)以及 ACS 端点控制。Super Micro、Dell、HPE 等厂商的认证机型是直通部署的推荐选择。云游戏规模部署中,合作伙伴会对 BIOS 进行定制,确保 GPU 热复位与电源管理固件协同。

  • UEFI/固件供应商:AMI、Insyde 等需要提供针对 GPU 直通的 Intel VT-d/AMD-Vi 选项及 ACS 控制。资源不足或错误配置可能导致 GPU 直通失败,因此 CIO 在采购白牌设备时须验证固件支持程度。


7. 下游

GPU 直通技术通过云服务商、虚拟桌面方案商、垂直整合商触达最终用户。

  • 云服务提供商 亚马逊 AWS:基于直通与 MIG 混合的 p4dp4dep5 实例,利用 A100/H100 提供单租户巨大算力。根据 AWS 白皮书,p4d 实例采用直通模式,客户可获得所有 GPU 内存和 NVLink 互联带宽(来源:AWS EC2 实例类型指南 2023)。 微软 AzureNDm A100 v4 系列通过类似技术实现实例隔离,为 Azure Machine Learning 提供独占 GPU。 谷歌 Cloud:A2 实例基于 GPU 直通,并通过其 Titan 安全芯片链保证启动完整性。 国内云厂商:阿里云 gn7i 系列(A10)、gn8v(H800)等实例基于直通方案交付,支持 VDI 与 AI 推理场景;华为云 GPU 加速型实例同样依赖直通或软件虚拟化方案。公开采购信息显示,2023 年中国前五大云厂商用于 AI 的 GPU 云实例收入同比增幅超过 120%(按可查到的年营收统计口径,来源:IDC 中国 AI 云服务市场追踪,2024 年 3 月),其中直通实例占比较高。

  • VDI 与专业图形方案商 VMware HorizonCitrix DaaS:均已支持通过 NVIDIA GRID 代理将直通 GPU 分配给远程桌面。企业用户如波音、宝马内部设计中心,采用直通 Quadro RTX 去跑 CATIA V5/V6,以通过 ISV 认证(来源:NVIDIA 成功案例,2022)。 开源项目:如 Kasm Workspaces 和 Apache Guacamole,可包装 KVM 后端,为流式传输协议提供直通 GPU 加速编码。

  • 云游戏与渲染平台 腾讯先锋云游戏、网易云游戏在 2023 年大规模采购 NVIDIA L40S GPU 构建直通集群,支撑《英雄联盟手游》等实时交互游戏(来源:腾讯云游戏公开技术分享)。NVIDIA GeForce NOW 联盟中的合作伙伴如 SoftBank、LG U+ 均基于直通架构部署。

  • AI 推理与微服务 单体大模型推理(如 Llama-2-70B)常需要独占 80GB 显存,无法被 vGPU 共享,因此 MaaS 服务商如 Together AI、Fireworks AI 多采用直通方式将 GPU 资源分配给单体容器。国内 MiniMax、智谱 AI 部署 Hugging Face TGI 引擎时同样采用宿主机直接透传 GPU 方式(来源:各自的工程博客)。


8. 受益公司

以下公司因 GPU 直通技术大规模部署或提供相关工具而直接受益,但不构成任何投资建议

  • NVIDIA:数据中心 GPU 和 vGPU 软件许可证是其主要收入来源之一。FY2024 (截至 2024 年 1 月) 数据中心收入达 475 亿美元,同比大增 217%,其中 H100 集群的部署几乎全部依赖某种形式的直通或 MIG(来源:NVIDIA 财务报告)。其软件许可管理使得企业需要为每个 vGPU 或 MIG 实例付费。
  • Intel:第四代/第五代 Xeon 可扩展处理器是 GPU 直通服务器的首选平台之一,因其 IOMMU 成熟度和 ACS 支持占据计算底座重要份额。同时,其面向数据中心 GPU 的直通方案推高平台销售。
  • AMD:EPYC 处理器以核心密度和 PCIe 通道性价比获得超大规模 CSP 青睐,在 GPU 直通实例中获得 socket 份额;Instinct MI300X 上市后若直通生态完善,将获得进一步受益。
  • 公有云巨头:AWS、Microsoft Azure、Google Cloud 提供的 GPU 直通实例带来丰厚溢价收入。GPU 实例的价格通常为通用实例的 3–10 倍,并贡献大量利润边际。
  • 服务器 ODM/OEM:Supermicro、Dell Technologies、HPE、联想、浪潮信息等因 AI 服务器需求爆发,2023 年 AI 服务器出货量加速,支持多 GPU 直通的 8-GPU 系统订单增长迅猛。富邦证券研究报告(2024 年 1 月)指出,2023 年全球 AI 服务器出货量约 18 万台,80% 具备 GPU 直通能力。
  • 云游戏运营商:腾讯、网易、索尼(PlayStation Plus Cloud)等,通过直通技术优化边际成本,控制每路流成本,提升付费用户生命周期价值。
  • 国产 GPU 厂商:摩尔线程、壁仞科技、天数智芯等若能通过直通验证,可在信创替代市场切入推理与图形 VDI 领域,但需证明稳定性与生态兼容性。目前仍在早期商用阶段。

9. 市场规模

9.1 全球 GPU 虚拟化与直通相关市场

GPU 直通处于 GPU 虚拟化市场的大范畴内。根据 Markets and Markets 于 2023 年 7 月发布的《GPU Virtualization Market – Global Forecast to 2028》,全球 GPU 虚拟化市场规模 2023 年约为 5.2 亿美元,预计 2028 年达到 13.9 亿美元,CAGR 21.6%。该统计包含 vGPU 许可证、直通部署服务和相关软件。由于大量直通部署采用开源 KVM/QEMU 而无直接软件费用,市场数据可能有所低估;硬件销售(即直通 GPU 本身)未计入该市场,而属于更广泛的 GPU 数据中心市场。

9.2 数据中心 GPU 市场(供给端)

根据 Jon Peddie Research(JPR)2024 年 1 月季度报告,2023 年第四季度全球数据中心 GPU 出货量达到 2.8 百万颗,其中 NVIDIA 份额超过 85%。大部分数据中心 GPU 最终部署于直通或 MIG 场景的超大规模数据中心中。以每颗 A100/H100 平均单价约 1 万–3 万美元估算,2023 年全年数据中心 GPU 硬件市场规模达 600 亿美元级别(来源:Mercury Research 与公开财报推算)。

9.3 中国 GPU 云市场

IDC《中国 AI 云服务市场(2023 下半年)跟踪》报告显示,2023 年下半年中国 AI 公有云服务市场规模达 74.6 亿元人民币,其中样本占比最大的是基于 GPU 的实例。AI 云实例绝大部分基于直通 GPU 或整卡容器模式,按此推算直通关联市场可达 40–50 亿元规模(保守估计)。这一市场仍以同比 80% 以上速率扩张。

9.4 云游戏细分

直通技术在云游戏基础设施中扮演重要角色。根据 Newzoo 2023 年全球云游戏报告,2023 年全球云游戏市场收入约 54 亿美元,对应服务器端 GPU 资源耗费数十万片 GPU。基于直通/独占实例的成本优化是该领域盈利模型的关键,尽管云游戏公司本身商业变现仍普遍承压。

口径说明:上述规模数据均为现有统计机构按年度估算,直通无独立统计,部分通过 GPU 实例出货量、许可费倒推。公开资料未见确切“GPU 直通专属市场规模”单一来源。


10. 玩家对比

10.1 GPU 硬件直通能力矩阵

厂商硬体型号原生直通支持重置机制虚拟化增值方案许可模式
NVIDIAA100, H100, H200完全(推荐)FLR+总线复位MIG 硬件分区、vGPU (GRID)vGPU/MIG 按实例购买永久或订阅;直通仅需 GPU 成本
NVIDIAL40S, L4完全FLR分区仅限时间片 vGPU(无 MIG)vGPU 许可
NVIDIAGeForce RTX 4090/4090D非官方保证,但社区成功部分需宿主机干预无需额外许可(2021 后驱动开放)
AMDInstinct MI250X, MI300X支持FLR 官方方案无硬件分区;ROCm 支持直通无需额外许可
AMDRadeon Pro W7900支持,可配合 ROCmFLR
IntelData Center GPU Flex 170支持FLRSR-IOV 优先,直通作为整卡选项无需
国产摩尔线程 MTT S4000社区实现 VFIO 直通公开资料未见官方 FLR 声明
国产壁仞 BR100宣称支持 SR-IOV/直通公开信息有限未知未知

10.2 虚拟化平台直通特性对比

平台配置难度消费卡兼容性动态迁移工具支持适用场景
KVM/QEMU + libvirt中等(需手动调优)较高(社区 patched)不支持virt-manager, cockpit自定义私有云,成本敏感
VMware ESXi DirectPath较低(UI 引导)受限(需认证列表)不支持vCenter + NVIDIA GRID Manager企业 VDI、混合直通+vGPU
Microsoft Hyper-V Discrete Device Assignment低(PowerShell)中等不支持SCVMMWindows 生态虚拟化
Kubernetes GPU Operator + VFIO高(需定制)容器可重调度但需 GPU 解绑GPU OperatorAI 训练/推理的云原生部署
Proxmox VE较易(Web GUI)高(基于 KVM)不支持Proxmox GUI中小企业、实验室

10.3 大型云厂商的封装对比

云厂商代表实例GPU 型号抽象方式弹性选项
AWSp4d.24xlarge8 x A100直通 + NVSwitch 透传预留实例/竞价实例
AzureNDm A100 v48 x A100直通 + 非透明桥预留/Spot VM
阿里云gn8v.xlargeH800(MIG 可切)MIG实例或整卡直通包年包月/按量
Google Clouda2-highgpu-8g8 x A100直通 + SMT 隔离预定义机型不可定制

11. 风险

  1. 资源闲置成本 基于直通的 GPU 一经分配,即使虚机关机,物理 GPU 仍处于 D0 状态,功耗约 50–80W(A100 空闲)。大型数据中心中闲置直通 GPU 可导致数千万美元年度能耗浪费;而 vGPU 可通过细粒度调度降低闲置。行业在 2023 年开始探索 GPU 池化和休眠方案,如 GKE 的 Dynamic GPU 锁定解除,但尚未全行业普及。

  2. 灵活性不足与云原生趋势错位 K8s 生态下期望秒级扩缩容,直通 GPU 分配需要时间长(10–30 秒),且 GPU 不可被多个 Pod 共享。虽然 MIG 缓解部分问题,但尚不能动态划分。此鸿沟可能导致部分推理场景更多转向纯 vGPU 或基于 CUDA MPS 的共享。

  3. 宿主安全问题 虽然 IOMMU 将内存隔离,但 GPU 固件、显示引擎 UEFI 二进制可能含有漏洞。2023 年有安全研究(如 Trail of Bits 在 DEF CON 的演讲)展示,通过直通 GPU 可以尝试 DMA 攻击突破隔离。缓解措施包括 ACS 中 Source Validation、VT-d Posted Interrupt 加固,但部署成本高。公共云通过定制 Hypervisor 和固件签名来降低风险。

  4. NVIDIA 许可策略变更风险 尽管自 2021 年起 GeForce 卡虚拟化限制放宽,NVIDIA 仍保留软件许可修改权。未来若重新加强限制,将对依赖消费卡的直通部署造成冲击,对于国内廉价云游戏方案影响尤为直接。

  5. 国产 GPU 替代过程中的兼容性与性能成熟度 国产 GPU 虽然设计上考虑虚拟化,但大规模直通部署下的兼容性验证表(如与不同 Kernel 版本、QEMU 版本、宿主芯片组配合)仍接近空白。企业若在信创项目中冒进替换,可能承担无法交付的集成风险。

  6. 迁移和高可用限制 直通 GPU 使 VM 不具备热迁移能力,制约了数据中心常规的负载均衡和主机维护便利性。这意味着计划内停机窗口更长,影响服务可用性 SLA。


12. 误读纠偏

误读 1:“GPU 直通跟 vGPU 差不多,只是性能好一点点。” 纠正:本质机制不同。直通是硬件隔离、完整原生驱动访问,vGPU 是时间片或中介模拟的虚拟化层。在帧间隔一致性、ISV 软件认证和 GPU 计算 API 完整性(如 CUDA、OpenCL 的某些低级特性)方面,直通具有不可替代性。许多 CATIA/Dassault 官方只认证直通 Quadro 的 VDI。

误读 2:“任何消费级显卡都能稳定直通。” 纠正:虽然多数 GeForce GTX/RTX 卡可通过 VFIO 成功直通,但该用法不被官方支持,无法保证所有环境中的 FLR 可靠性;部分笔记本 GPU 的 PCIe 分组严重碎片化,直通几乎不可能。在生产环境中,保守选择还是专业/数据中心显卡。

误读 3:“MIG 已经取代了直通。” 纠正:MIG 是直通的粒度补充,而非替代。MIG 实例最多只能使用被切分后的显存带宽和 SM 数量,对于需要完整 80GB 显存、全张量核心的大型训练任务,必须采用完整直通。而且只有 A100/H100 支持 MIG,多数企业和云游戏部署仍使用 L40S/A10 等无 MIG 的卡进行直通。

误读 4:“公有云 GPU 实例一定都是直通。” 纠正:一些异构实例采用 vGPU 或分时复用技术,尤其是图形渲染类小规格实例(如阿里云 vgn6i、AWS G4dn 中部分是基于 NVIDIA T4 vGPU)。区分方法是查看实例规格中 GPU 内存是否为整卡的倍数,以及是否提供厂商原生驱动。

误读 5:“直通了 GPU 就不用关心宿主机内核和驱动。” 纠正:直通依然需要宿主机的 VFIO、IOMMU 模块、BIOS 支持,宿主机内仍运行着 GPU 的 PCIe 电力管理,错误配置的宿主机内核可能导致直通设备无法正常复位。运维复杂度相当高。


13. 最新事件

  • 2024 年 3 月 NVIDIA GTC 2024:公布 Blackwell B200/B100 GPU,继续强化 MIG 与直通模式,新的 NVLink Switch 支持 576 全互连 GPU 的直通形态,将为超大规模 LLM 训练提供更灵活的资源配置。
  • 2024 年 2 月 AMD ROCm 6.0 发布:提升了对 GPU 直通场景下的计算隔离和 VFIO 支持,让 MI300X 在公有云实例中更容易以独占售卖。
  • 2023 年 12 月中国云厂商 AI 实例调价:由于高端 GPU 供应紧张,GPU 直通实例价格波动,阿里云 GPU 云服务器系列 2024 年 Q1 部分区域价格上调 15%(来源:阿里云官网公告)。
  • 2023 年 10 月 Intel 发布 5th Xeon (Emerald Rapids):优化了虚拟化指标,宣称双路系统支持 14 颗 GPU 直通,主打 AI 推理单租户场景,并在合作伙伴 Dell PowerEdge R760xa 上展示(来源:Intel 产品简报)。
  • 社区项目 vgpu_unlock 受关注:开源社区持续破解 NVIDIA vGPU 限制以便将 GeForce 卡用于共享或直通,NVIDIA 多次更新驱动加固,引发关于软件使用权范围的争论。
  • 国产 GPU 直通首次社区成功:2024 年 1 月,摩尔线程 MTT S80 在 LoongArch 3A6000 平台上,配合 KVM+VFI 成功实现直通并运行了简单图形测试,在开源 GitHub 项目公布(来源:GitHub 相应 repo);但公开资料未见大规模商用。

14. 跟踪指标

  • GPU 实例招标与上架:关注 AWS、Azure、阿里云等推出的新 GPU 实例类型中,是否提供整卡独占选项,间接反映直通技术采纳趋势。跟踪来源:各云厂商官方博客、产品发布页。
  • NVIDIA 软件许可变更:NVIDIA vGPU/GPU 直通相关 EULA 条款更新,尤其在 GeForce 和消费级领域,可通过 NVIDIA 最终用户许可协议官方页面监测。
  • VFIO 内核补丁提交:Linux 内核邮件列表(LKML)上关于 VFIO、IOMMU 的补丁提交频次,尤其关注“GPU reset”或“ACS quirk”相关议题,可反映行业痛点与技术演进。
  • 消费卡二手市场价差:由于消费卡用于云游戏直通部署需求增加,RTX 4090 等供货紧张程度间接体现云游戏基础设施建设节奏。来源:电商销售平台趋势、显卡行业媒体(如 Board Channels)。
  • 国产 GPU 虚拟化认证:跟踪摩尔线程、壁仞等厂商的虚拟化白皮书和云提供商适配公告,尤其是否列入 VMware Hardware Compatibility List 或与麒麟、统信 VDI 方案集成。
  • 安全漏洞通报:CVE 关于 GPU 固件、UEFI 驱动的漏洞披露,直通安全性风险直接影响企业采纳。通过 NIST NVD 筛选 GPU 和 IOMMU 相关。
  • 云服务商 GPU 实例费用/预留利用率:通过 FinOps 工具观察实例利用率,直通实例闲置率若持续高企,可能促使云服务商推出更优弹性的方案。
  • IDC/JPR 和 用户调查报告:IDC 半年度垂直行业对 GPU 虚拟化采纳的调查,特别是针对 VDI、AI 推理直通使用情况的比例变化。

15. 信源

  • NVIDIA. Virtual GPU Software Documentation - vGPU vs Passthrough. 2023.
  • Intel. Intel Virtualization Technology for Directed I/O Architecture Specification. February 2022.
  • AMD. AMD I/O Virtualization Technology (IOMMU) Specification. Revision 3.05, 2021.
  • VFIO 和 QEMU 官方文档. https://www.linux-kvm.org/page/VFIO
  • VMware. DirectPath I/O Best Practices for NVIDIA GPUs. Technical White Paper, 2023.
  • AWS. Amazon EC2 P4 Instances User Guide – GPU Configuration. 2023.
  • NVIDIA 财务报告, FY2024 Q4 (截至 2024 年 1 月 28 日).
  • Markets and Markets. GPU Virtualization Market – Global Forecast to 2028. July 2023.
  • Jon Peddie Research. Market Watch Q4 2023 – GPU Shipment Report. Jan 2024.
  • IDC. 中国 AI 云服务市场(2023 下半年)跟踪报告. 2024 年 3 月.
  • Newzoo. Global Cloud Gaming Market Report 2023. 2023.
  • Trail of Bits. Trust Issues: Exploiting GPU Passthrough in Virtualized Environments. DEF CON 31, 2023.
  • 摩尔线程 VFIO 社区案例. GitHub 开源项目, 2024.
  • 腾讯先锋云游戏. “基于 NVIDIA L40S 的云游戏性能优化实践.” 2023 年技术博客.
  • EU 能源之星数据中心设备能源规格 (借鉴空闲 GPU 功耗数据).

声明:本文内容仅用于行业技术梳理,不构成任何投资、选型或采购建议。所有数据均来自公开来源及机构报告,请以最新官方资料为准。

source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型