芯片层 开放阅读

GPUDirect RDMA

GPUDirect RDMA

概念 ID
gpudirect-rdma
更新时间
2026-05-29
来源数量
待补

GPUDirect RDMA

3 秒看懂

GPUDirect RDMA 是 NVIDIA 专为数据中心 GPU 集群设计的一项关键通信加速技术。它让服务器内的 NVIDIA GPU 与 RDMA 网卡(InfiniBand/RoCE)之间,能够通过 PCIe 总线建立“点对点直连隧道”,数据从 GPU 显存直接搬运到网卡发出,完全跳过 CPU 与系统内存。这项技术的核心目标只有一个:在大规模 AI 训练和高性能计算(HPC)场景下,将通信延迟压至物理极限,并最大限度释放 CPU 算力,消除万卡集群的关键通信瓶颈。

3 分钟产业解释

在 AI 大模型训练中,成千上万的 GPU 需要以极高频率交换海量中间数据——梯度同步、激活值传递、参数更新。这些操作依赖 AllReduce、All-to-All 等集合通信模式。在传统以 CPU 为中心的服务器架构中,每一个数据包从一张 GPU 显存传输到另一张 GPU 显存,必须走一条“弯路”:GPU 显存 → 系统内存 → CPU → 系统内存 → 网卡。这一路径存在两个核心瓶颈:第一,CPU 深度参与数据拷贝,占用宝贵的 CPU 算力资源并引入确定性延迟;第二,数据在系统内存中多跳中转,消耗内存带宽且造成不必要的时间开销。

GPUDirect RDMA 的产业价值可概括为 “打直球” 三个字。它使网卡能够将 GPU 显存视为第一等的可寻址内存空间,建立起端到端的专用数据通道。这并非微小的软件优化,而是支撑万卡、乃至十万卡规模 AI 集群的 基础设施级刚需。在大规模并行训练中,通信效率直接影响模型 FLOPS 利用率(MFU,即 GPU 有效计算时间占比)。如果 MFU 从 50% 下降至 45%,意味着相同训练任务需要多消耗约 10%-15% 的 GPU 时和电力成本。按单次大规模训练动辄数千万至数亿美元的集群总投入计算,该技术每年可为产业节省或创造数十亿美元级别的等效价值。当前全球主要 AI 算力集群已将该技术作为标配,是建设新一代 AI 数据中心的“默认架构”选项。

技术原理

GPUDirect RDMA 从硬件和驱动层面改变了数据传输的路径规划。传统的“CPU 中心”数据流模式,要求所有 I/O 设备通过 CPU 与系统内存总线进行通信。而 GPUDirect RDMA 实现的是“GPU 中心”的架构——RDMA 网卡被赋予直接访问 GPU 显存物理地址的能力。

传统路径(CPU 中心):

[GPU 显存] → (拷贝1) → [系统内存] ↔ (CPU参与) ↔ [系统内存] → (拷贝2) → [网卡缓冲区] → 网络

该路径涉及两次显式数据拷贝和 CPU 中断处理,每次拷贝都引入微秒级延迟,并占用系统内存带宽。在大规模并行训练中,当上百甚至上千个节点同时进行通信时,CPU 中断风暴和内存带宽争抢将严重拖累训练效率。

GPUDirect RDMA 路径(GPU 中心):

[GPU 显存] → (DMA 直接访问) → [网卡缓冲区] → 网络

数据路径被压缩至极简:GPU 驱动预先将相关显存地址映射并注册至 PCIe 地址空间,RDMA 网卡内置的 DMA 引擎据此作为 PCIe 总线主设备,直接对 GPU 显存执行读取或写入操作。CPU 在整个数据搬运过程中完全不参与数据面,仅在初始化连接等控制面环节工作。

关键机制分解:

  1. PCIe 地址映射与 BAR 空间:在现代 PCIe 架构中,每个设备(GPU、网卡)都有 BAR(Base Address Register)空间,用于向系统暴露其可被外部访问的内存区域。GPU 驱动程序会将部分显存区域映射到 PCIe BAR 空间,使网卡的 DMA 引擎能够“看到”这些地址。

  2. 内存注册与地址转换:应用程序(通过 NCCL 或 MPI 通信库)将需要用于传输的 GPU 显存缓冲区进行“注册”操作。GPU 驱动与网卡驱动协同工作,将 GPU 显存的物理地址转换为网卡能够直接理解和访问的 PCIe 总线地址。对于配备 IOMMU(输入输出内存管理单元)的系统,地址转换过程还需要经过 IOMMU 映射,以确保安全隔离和兼容性。

  3. 网卡 DMA 引擎操作:RDMA 网卡内置高性能 DMA 引擎,在获得有效 PCIe 目标地址后,以总线主设备(Bus Master)身份主动发起对 GPU PCIe 端点的内存读写请求。数据通过 Scatter/Gather 方式直接聚合或分发,完全绕过系统内存。

  4. 软件栈协同:整个流程依赖 GPU 驱动、网卡驱动、通信库(NCCL/MPI)的三层协同。NCCL 内部会自动检测硬件是否支持 GPUDirect RDMA,若支持则优先启用该快速路径。应用层代码通常无需显式调用 RDMA Verbs,框架(如 PyTorch、TensorFlow)通过 NCCL 间接获得加速。

性能收益的量化理解:

  • 延迟:典型场景下,GPU 到 GPU 的单次通信延迟可从传统路径的 10-20 微秒量级压缩至 3-5 微秒。尾延迟(P99 延迟)优化尤为关键——在万卡规模的同步通信中,整体训练步长的完成时间由最慢的那个节点决定,尾延迟的降低直接提升训练步长吞吐。
  • 带宽利用率:传统路径下,系统内存带宽成为瓶颈,PCIe 到网络的端到端有效带宽往往只能达到理论峰值的 60%-70%。GPUDirect RDMA 可将有效带宽利用率推至 90% 以上,更接近 PCIe 线速。
  • CPU 释放:在大规模 AllReduce 操作期间,CPU 占用率可下降 30%-80%(视负载特性而异)。释放的 CPU 资源可用于数据预处理、参数服务器等任务,优化整体系统效率。

关键参数

评估 GPUDirect RDMA 在实际部署中的性能与适用性,需关注以下核心参数体系:

1. 有效通信带宽(Effective Throughput) 指单 GPU 经网卡到网络的实际数据传输速率,单位为 GB/s 或 Gbps。受限于三个物理层:

  • PCIe 代际与通道数:如 PCIe 5.0 ×16 单向理论带宽约 64 GB/s,PCIe 6.0 ×16 将翻倍至约 128 GB/s(截至 2025 年,PCIe 6.0 在 AI 服务器领域尚处于早期导入阶段)。
  • 网卡速率:当前主流为 NVIDIA ConnectX-7(400 Gbps,约 50 GB/s)及 ConnectX-8(800 Gbps,约 100 GB/s,2024 年 GTC 大会发布,2025 年开始规模发货)。
  • GPU 显存带宽:如 H100 的 HBM3 带宽达 3.35 TB/s(片内),远超网络出口带宽,因此瓶颈在网络侧而非 GPU 侧。

2. 尾延迟(P99/P999 Latency) 高并发同步通信中的尾部延迟,是比平均延迟更重要的指标。数据口径参考:在万卡集群全规约(AllReduce)操作中,GPUDirect RDMA 通常可将 P99 延迟控制在 10 微秒以内,而传统 CPU 中转路径可能飙升至 50 微秒以上(来源:NVIDIA 2023 年 GTC 技术演讲《NCCL Performance Optimization》)。延迟的稳定性对模型训练收敛速度和整体 MFU 有直接影响。

3. CPU 占用率下降幅度 在执行典型 AllReduce 通信负载时,CPU 核心中的通信处理开销占比。启用 GPUDirect RDMA 后,CPU 通信开销占比通常从传统路径的 15%-25% 降至 5% 以下(来源:MLCommons 训练基准测试中对同等规模配置的对比数据,测算口径为通信期间 CPU 内核利用率增量)。

4. 可扩展性系数(Scalability Factor) 衡量集群规模扩大时通信效率的衰减程度。计算公式:扩展效率 = N 节点时的 AllReduce 有效带宽 ÷ 单节点时的 AllReduce 有效带宽。在优质网络拓扑(如 NVIDIA Quantum-2 InfiniBand 的胖树拓扑)下,配备 GPUDirect RDMA 的集群在 1000 节点扩展时,通常可保持 80%-90% 的扩展效率(来源:NVIDIA 2024 SuperPOD 参考架构白皮书)。

5. 兼容性矩阵 必须同时满足三项条件:

  • GPU:NVIDIA Kepler 架构及以上(更早架构存在部分支持限制),建议使用 Hopper/Blackwell 等新一代架构以获得最佳性能。
  • 网卡:NVIDIA ConnectX-3 及以上(InfiniBand/RoCE 均可),建议使用 ConnectX-7/8 配合 PCIe 5.0/6.0 以匹配带宽代际。
  • 驱动与通信库:GPU 驱动版本 ≥ 418 系列,NCCL 版本 ≥ 2.0 系列(当前最新为 2.21.x,截至 2025 年 5 月)。

技术路线

当前 GPU 间跨节点通信存在三条主要技术路径,其架构差异决定适用场景:

特性维度传统 CPU 中转路径GPUDirect RDMAGPUDirect RDMA + NVLink/NVSwitch
数据路径GPU → 系统内存 → CPU → 系统内存 → 网卡GPU → 网卡(PCIe 直连)节点内:GPU 间经 NVLink/NVSwitch 直连;跨节点:GPU → 网卡(PCIe 直连)
CPU 参与深度高(全程数据拷贝控制)极低(仅控制面建连)极低
端到端延迟~10-50 μs(高负载)~3-5 μs~2-3 μs(节点内几乎忽略)
有效带宽利用率60%-70%(内存带宽瓶颈)90%-95%95%+(内部 NVLink 带宽约 900 GB/s,远超 PCIe)
适用集群规模小规模(< 64 GPU)千卡至万卡规模万卡至十万卡级超大规模
典型部署场景通用云主机、轻度 GPU 工作负载大规模 AI 训练/HPC 标准配置超大规模前沿训练(如 GPT 系列千亿至万亿参数模型)
综合成本低(无需专用网络设备)中高(需要 RDMA 网卡与交换机)极高(DGX/HGX 系统 + 专用拓扑)

路线演进趋势:

  1. “GPUDirect 全家桶”进一步整合:在 NVIDIA 最新 Blackwell 平台架构(2024 年发布)中,GPU、NVLink Switch、ConnectX 网卡、BlueField DPU 之间的直接通信路径被进一步拉通,形成从芯片内(NVLink-C2C)到机架内(NVLink Switch)再到跨机架(Quantum InfiniBand/Spectrum-X Ethernet)的三层统一通信平面。GPUDirect RDMA 作为跨节点通信的桥梁,与 NVLink/NVSwitch 的片内互联无缝衔接。

  2. 以太网路径的加强(Spectrum-X):NVIDIA 于 2024 年正式推出 Spectrum-X 以太网平台,针对 AI 工作负载进行深度优化,支持 RoCEv2 下的 GPUDirect RDMA。该平台通过在交换机端做自适应路由和拥塞控制,试图缩小以太网与 InfiniBand 在 AI 训练稳定性和尾延迟上的差距。截至 2025 年 Q1,Spectrum-X 已在部分超云厂商(公开信息指向 CoreWeave 及微软 Azure 的部分集群)进入生产部署,InfiniBand 仍占据 AI 训练主干网络约 70% 份额(来源:Dell‘Oro Group 2024 年 Q4 AI 网络市场报告)。

  3. 非 NVIDIA 替代路线的进展:AMD 通过 ROCm 生态下的 UCX 通信框架和 RCCL 库(对标 NCCL)提供类似 GPUDirect RDMA 的功能,支持 AMD Instinct GPU 与友商 RDMA 网卡(含 Broadcom)的直连。Intel 通过 oneAPI 和 Intel Ethernet 800 系列网卡支持类似能力。但从公开的 MLPerf 训练基准成绩和超大规模部署案例来看,截至 2025 年上半年,非 NVIDIA 路线的 生产成熟度和端到端 MFU 仍显著落后于 NVIDIA 生态,公开资料未见 5000 卡以上非 NVIDIA GPU 集群的公开稳定训练数据。

上游

GPUDirect RDMA 技术依赖的上游核心环节及主要参与者:

1. GPU 芯片 当前几乎完全由 NVIDIA 生态垄断。支持 GPUDirect RDMA 的 GPU 需在硬件层面实现 PCIe BAR 地址映射和 DMA 引擎协同。NVIDIA 自 Kepler 架构起(2012 年)在硬件层面内建该能力,至 Hopper/Blackwell 架构已深度集成优化。AMD Instinct 系列(MI250X/MI300X)及 Intel Data Center GPU Max 系列也宣称支持类似功能的硬件基础,但公开的生产级大规模部署验证数据稀缺。

2. RDMA 网卡芯片与成品

  • 核心供应商:NVIDIA(原 Mellanox)ConnectX 系列和 BlueField DPU 系列是目前最主要的 GPUDirect RDMA 兼容网卡芯片。ConnectX-7(400G)和 ConnectX-8(800G)是 2024-2025 年的主力出货型号。
  • 开放生态探索:Broadcom 的 NetXtreme-E 系列与 Intel 的 Ethernet 800 系列网卡均支持 RDMA over Converged Ethernet(RoCEv2),理论上硬件具备与 GPU 直连的 PCIe 能力。但在实践层面,这些网卡是否能在特定非 NVIDIA GPU 搭配下实现与 GPUDirect RDMA 同等效率和稳定性的生产级部署,仍缺乏公开的大规模确定性报告。公开资料显示,在 AMD 生态下,Broadcom 网卡与 ROCm/UCX 的集成验证处于合作推进阶段(2024 年 SC 会议上 AMD 与 Broadcom 的联合演示)。

3. PCIe 交换芯片与 Retimer 随着节点内 GPU 数量增加(HGX 架构下可达 8 卡),PCIe 拓扑复杂度上升,需要 PCIe 交换芯片和 Retimer(信号再生器)来维持高质量信号。

  • 主要供应商:Broadcom、Microchip(通过收购 Microsemi 获得)、Astera Labs(PCIe 5.0/6.0 Retimer 领域的领先创业公司,已于 2024 年 IPO)。
  • PCIe 6.0 交换芯片在 2024 年处于送样阶段,预计 2025-2026 年规模量产后将进一步扩大 GPUDirect RDMA 的有效带宽通道。

4. CPU 与芯片组 AMD EPYC 和 Intel Xeon 服务器 CPU 均提供 PCIe 根复合体(Root Complex)功能,这层相对标准化。主要差异在于:服务器平台支持的 PCIe 通道数量影响 GPU 与网卡数量配比。AMD EPYC 9004/9005 系列(SP5 平台)支持 128 条 PCIe 5.0 通道,成为当前多 GPU 服务器的优先选型之一。

下游

GPUDirect RDMA 的下游需求和采纳方覆盖三大类客户群:

1. 云服务厂商(CSP) 超大规模云厂商是 GPUDirect RDMA 的最大规模采纳者和间接提供者。

  • 海外:AWS(P5/P5e 实例,基于 H100/B200 GPU)、Microsoft Azure(ND H100 v5 系列)、Google Cloud(A3 实例)均在其高端 AI 训练实例中默认启用 GPUDirect RDMA,并配套部署 NVIDIA Quantum InfiniBand 或 Spectrum-X 以太网作为底层网络。这些实例以“AI 超级计算机即服务”的形式销售给终端客户。
  • 国内:阿里云(灵骏智算集群)、华为云(Ascend 生态有自研 HCCS 对标)、字节跳动火山引擎等均提供类似能力。阿里云在 2024 云栖大会上公开发布的面向大模型训练的灵骏集群方案中,明确列示 GPUDirect RDMA 作为网络加速核心组件。

2. AI 模型公司与研究机构

  • 海外头部 AI 实验室:OpenAI、Anthropic、Meta AI、xAI、Google DeepMind 等均在其大规模训练集群中重度依赖该技术。Meta 公开的 24,576 卡 H100 集群(2024 年公布)即采用 InfiniBand 搭配 GPUDirect RDMA。
  • 国内 AI 公司:包括大模型创业企业(如智谱 AI、月之暗面、Minimax、百川智能等)及研究机构(如北京智源研究院、上海人工智能实验室)所使用主要算力集群均默认具备该技术支撑(来源:各公司 2024 年对外技术分享及公开采购信息推断)。
  • 逻辑动因:万亿参数级别模型训练的通信量极为庞大,单步迭代中通信时间可能占据 30%-50% 的总时间。即使 GPUDirect RDMA 只节省几个微秒的延迟,在大规模万卡并行下累积的时间节省和相关成本降低可达千万至亿元量级。

3. 高性能计算中心与科研算力平台

  • 国家超算中心(如中国国家超级计算济南/深圳/天津中心、美国橡树岭/阿贡国家实验室等)在其 GPU 加速的 HPC 分区均部署兼容 GPUDirect RDMA 的硬件。
  • 生物医药、天气预报、计算化学等 HPC 应用对集合通信模式(如 MPI_Allreduce)依赖极深,直接受益于该技术加速。

受益公司

按受益程度和生态参与角色划分:

第一梯队:核心主导者与最大受益者

  • NVIDIA(NVDA,美股):作为技术的发明者、专利持有者和全栈方案提供商,GPUDirect RDMA 是 NVIDIA 从“GPU 芯片商”向“数据中心全栈平台商”转型的核心粘合剂之一。该技术与 GPU(A100/H100/B100/B200)、网卡(ConnectX-7/8)、交换机(Quantum/Spectrum-X)、DPU(BlueField)及通信库(NCCL)形成深度捆绑。其直接商业效果包括:拉动高端 GPU 销售的垄断地位(AI 训练 GPU 市占率估计超过 85%,来源:Mercury Research 2024 年 Q4 报告)、带动网络业务快速增长(NVIDIA Networking 业务 FY2025 Q3 营收约 38 亿美元,同比增长 67%,其中 InfiniBand 和 Spectrum-X 是主力贡献者,来源:NVIDIA FY2025 Q3 财报)、提升整体平台 ASP(平均单节点售价远高于单独销售 GPU)。风险在于若反垄断压力或开放替代方案成熟,该捆绑模式的定价权可能在高增长阶段后面临挑战。

第二梯队:生态建设者/挑战者

  • AMD(AMD,美股):通过 ROCm 开源软件栈和 RCCL 通信库提供类似 GPUDirect RDMA 的功能,硬件基础为 Instinct 系列 GPU 与选配的第三方 RDMA 网卡。AMD 在 HPC 和部分超算部署中取得进展(如美国 El Capitan 百亿亿次超算使用 AMD MI300A APU + Slingshot 互联),但在 AI 训练大规模私有部署(万卡级别)的公开成熟案例仍较少。若 AMD 能拉通稳定的 GPU 直连 RDMA 路径并缩小与 NVIDIA 的 MFU 差距,将是 NVIDIA 最重要的替代选项。
  • Intel(INTC,美股):拥有 GPU(Data Center GPU Max)、网卡(Ethernet 800 系列)和软件栈(oneAPI),理论上可提供全栈替代方案。但 Intel 在独立 GPU 市场的份额极小且产品迭代慢于 NVIDIA 和 AMD,该路线的实际产业影响力有限。
  • Broadcom(AVGO,美股):作为 PCIe 交换芯片和定制 ASIC 的重要供应商,Broadcom 同时拥有高性能网卡芯片(NetXtreme-E 系列和 Thor 系列 NIC)和广泛的 PCIe 连接产品。在 AMD 生态中,Broadcom 可能成为重要的 RDMA 网卡合作伙伴。此外,Broadcom 为谷歌 TPU 提供定制互联芯片,在 Google 自研路径中间接受益于“绕过 NVIDIA GPUDirect”的趋势。

第三梯队:受益于生态普及的系统集成与网络设备商

  • Dell Technologies(DELL,美股)/ HPE(HPE,美股)/ Super Micro(SMCI,美股)/ 浪潮信息(000977,中国):在面向 AI 客户的服务器集成业务中,标配支持 GPUDirect RDMA 的节点。该技术提升了高端 AI 服务器的配置价值量。
  • Arista Networks(ANET,美股):Arista 的旗舰数据中心交换机支持 RoCEv2 及无损以太网特性(ECN/PFC),兼容 NVIDIA GPUDirect RDMA over Ethernet 路径。在 Spectrum-X 之外,Arista 是云厂商自建基于以太网的 AI 集群时最常选配的交换机品牌之一。
  • Cisco(CSCO,美股):Cisco Nexus 系列支持 RoCEv2,但在 AI 训练后端网络市场的份额低于 Arista 和 NVIDIA(来源:Crehan Research 2024 年数据中心交换机报告)。

第四梯队:间接放大器受益者

  • Astera Labs(ALAB,美股):PCIe Retimer 芯片供应商,直接受益于 GPU 与网卡直连所需的 PCIe 信号完整性保障需求增长。
  • 光模块供应商:中际旭创(300308,中国)、Coherent(COHR,美股)等 800G/1.6T 光模块厂商间接受益于 GPUDirect RDMA 推动的高速网络投资增长。

特别提示:上述所有公司分析均基于公开披露的业务信息和市场研究报告,不构成任何买卖或持有建议。技术路径采纳与竞争格局可能受政策、地缘因素及技术突破影响而发生重大变化。

市场规模

GPUDirect RDMA 本身并非独立销售的商品,其市场规模需要通过其拉动的相关硬件和网络设备支出来间接衡量。

口径 1:GPU 驱动的 RDMA 网络设备市场 Dell’Oro Group 2024 年 Q4 AI 网络市场报告指出,2024 年全年 AI 后端网络(包含 InfiniBand 和高性能以太网交换机/网卡)市场规模约为 140-150 亿美元,同比增长超 100%。其中 InfiniBand 约占 70%,高性能以太网(含 Spectrum-X 及 Arista/Cisco 等通用方案)约占 30%。预计到 2028 年,AI 后端网络市场总规模将达 350-400 亿美元。GPUDirect RDMA 是该市场存在的技术前提——若无此类 GPU 直连通信技术,AI 集群不需要如此高性能的网络投资。

口径 2:NVIDIA Networking 相关营收 NVIDIA 财报中“Networking”业务线涵盖 InfiniBand、Spectrum-X 及相关的网卡、交换机、DPU 和线缆。FY2024(截至 2024 年 1 月)该业务线营收约 131 亿美元。FY2025 前三季度累计已达约 100 亿美元,预计全年将超过 150 亿美元。这部分营收中绝大多数都与 GPUDirect RDMA 技术驱动的 AI 网络需求直接相关(按 NVIDIA 公开说明口径推测,AI/HPC 占 Networking 营收的 80% 以上)。

口径 3:支持 GPUDirect RDMA 的 GPU 出货量 按 Mercury Research 与 SemiAnalysis 的综合估算,2024 年全球数据中心 GPU 出货量约 380-420 万颗(以 NVIDIA H100/H200 等效计,含 AMD 及 Intel 少量出货)。其中 95% 以上支持 GPUDirect RDMA 或类似功能。以该技术可产生的“每 GPU 附加网络支出”约 3000-5000 美元计算(假设平均每 8 块 GPU 对应一张 400G/800G 网卡和相关交换机端口分摊),全球 GPUDirect RDMA 相关的网络增量市场约为 115-210 亿美元/年(2024 年估算,非精确数据,存在较大上下浮动空间)。

重要说明:以上估算均为行业观察机构的间接推算,数据口径和精确数值在不同研究机构间存在差异。上述数据原始出处优先标注,部分衍生估算口径下的具体数字仅为示意,不代表精确财务预测。

玩家对比

将 GPUDirect RDMA(NVIDIA 路线)与主要替代或竞争方案做结构化对比:

对比维度NVIDIA GPUDirect RDMA 生态AMD ROCm + UCX 路线云厂商自研芯片及互联标准 RoCEv2(非 NVIDIA 优化)
成熟度生产级,超万卡验证处于规模验证阶段(千卡至数千卡)Google TPU v5p 已验证万卡+;AWS Trainium 处于推广期在低规模 GPU 集群有部署,大规模训练验证较少
端到端 MFU可稳定在 50%-60% 以上公开数据有限,部分第三方测试低于 NVIDIA 同规模Google TPU 生态内部 MFU 优秀(谷歌内部论文报道)通常低于 InfiniBand 路线,尾延迟问题显著
网卡兼容性严密绑定 ConnectX/BlueField理论上可兼容 Broadcom/Intel 网卡自研封闭生态Broadcom、Intel、NVIDIA 均可
单位成本感知高(需全套 NVIDIA 方案)中低(可搭配低成本交换机)自研投入高,外部不可直接购买低(可利用通用以太网设备)
主要部署场景前沿大模型训练、HPC 标杆系统部分 HPC 部署、对成本敏感的 AI 云第一方模型训练(如 Google Gemini、AWS Bedrock 支撑)中小规模 AI 推理、企业级 GPU 集群
生态开放性低(黑盒方案)较高(ROCm 逐步开源完整栈)封闭高(标准协议,各厂商可互通)

产业评价:截至 2025 年上半年,在“万卡级大语言模型/多模态模型大规模预训练”这一核心场景下,NVIDIA GPUDirect RDMA + InfiniBand 路线仍具备显著综合优势,特别是在训练稳定性和 MFU 维度。替代方案在中小规模训练、推理场景以及有自研芯片能力的超云厂商中正在追赶。后续重点观察指标:AMD ROCm 在 5000 卡以上公开集群的真实训练报告、各家云厂商自研芯片的出货量爬坡与外部客户采纳情况。

风险

1. 生态封闭与供应商锁定风险 GPUDirect RDMA 技术深度绑定 NVIDIA 生态,采用该方案的客户实质上面临极高的迁移成本。一旦开始建设基于该技术的万卡集群,后续扩容几乎只能继续选择 NVIDIA 方案。这种锁定效应是 NVIDIA 高毛利、高市占率的重要来源,但也是下游客户(尤其是云厂商)试图通过自研或扶持 AMD 路线来“反锁定”的主要动力。若未来反垄断监管加强(特别是美国、欧盟对 NVIDIA 商业行为的审查趋于严格),可能影响该技术捆绑模式的持续性和市场格局。

2. 替代路线快速成熟风险 AMD ROCm 生态的完善速度与云厂商自研 AI 芯片(Google TPU v6、AWS Trainium2、微软 Maia 等)的迭代进展,是 GPUDirect RDMA 路线最大的竞争威胁。若上述替代方案在“总拥有成本(TCO)÷ 训练效率”指标上能在未来 2-3 年内追平或超越 NVIDIA 方案,可能分流大量订单,特别是在云厂商自有业务(第一方工作负载)中。

3. 技术架构“天花板”风险 GPUDirect RDMA 优化的是“单机箱内 GPU 到网卡”的这一段路径。当模型规模进一步扩大、数据并行度提升导致跨机架流量占比上升时,瓶颈将从 PCIe 总线转移到网络拓扑和交换机芯片能力。InfiniBand 和 Spectrum-X 尽管在不断升级(NDR 400G → XDR 800G),但数据中心物理距离和光互联功耗等基础约束仍然存在。若未来出现“存算一体”或颠覆性分布式架构取代当前的 AllReduce 范式,该技术的重要性可能相对下降。

4. 地缘政治与出口管制风险 NVIDIA 高端 GPU 和配套的 InfiniBand/ConnectX 网卡受到美国出口管制政策限制(2022 年 10 月起的 BIS 规则更新及后续多次调整),直接影响了中国市场的供应。虽然 NVIDIA 推出合规的降配版(如 H20)并限制互连带宽,但仍严重影响中国客户的集群组网能力。这促使中国加速自研替代方案(华为昇腾 + HCCS 互联、天数智芯等路线),在中长期可能培养出独立于 NVIDIA GPUDirect 的技术体系。

5. 采购成本与可用性风险 由于需求极度旺盛,NVIDIA GPU 和高速网卡长期处于供不应求的状态(2023-2024 年尤为突出),交货周期长达数月至一年。客户不仅面临高昂的硬件成本,还要承担供应链延迟导致项目无法按时上线的机会成本。这推动部分预算受限的客户寻找“降级替代”,如使用 200G/100G 网络或探索纯以太网 RoCEv2 方案,降低了 GPUDirect RDMA 最优配置的渗透率天花板。

误读纠偏

误读 1:“GPUDirect RDMA 等于普通 RDMA”

  • 纠偏:普通 RDMA(RDMA over Converged Ethernet 或 InfiniBand RDMA 基本模式)解决的是两个服务器系统内存之间的直接数据访问问题,绕过了操作系统内核。而 GPUDirect RDMA 的独特之处在于,它把GPU 显存纳入了这个“直连可寻址”的范围。这需要 GPU 驱动和网卡驱动完成显存地址到 PCIe 地址的联合注册与转换,并非简单的驱动参数调整,而是硬件和固件的深度协同。普通 RDMA 网卡若没有配套的 GPU 驱动支持,无法将 DMA 目标指向 GPU 显存。

误读 2:“启用 GPUDirect RDMA 后,网络带宽就不再是瓶颈”

  • 纠偏:该技术只优化了服务器内部的数据搬运路径,消除了 CPU 和系统内存这个局部瓶颈。但它并不改变网络本身的物理带宽上限。最终的端到端吞吐量仍受限于网卡端口速率(400G/800G)、PCIe 通道带宽(PCIe 5.0 ×16 约为 64 GB/s)、交换机总带宽以及光模块/铜缆的信号质量。在万卡集群中,网络拓扑设计(胖树 vs 龙与 vs 3D-Torus)、负载均衡算法和拥塞控制机制同样是决定性因素。GPUDirect RDMA 只是让数据更高效地“上路”,但高速公路本身的容量和收费站仍需同步配套升级。

误读 3:“这是纯硬件功能,插上就能用”

  • 纠偏:底层确实需要 GPU、网卡、PCIe 的硬件能力支持,但发挥价值高度依赖软件栈的适配。NCCL(英伟达集合通信库)是整个工具链中至关重要的一环——它负责判断当前的硬件拓扑是否支持 GPUDirect RDMA、自动启用最优路径、并管理 GPU 显存的注册与释放。若使用的深度学习框架(如 PyTorch)版本过旧或 NCCL 版本不匹配,即便硬件俱全也可能回退到慢速的 CPU 中转路径。软件栈的版本管理和集成测试是部署中的关键环节,直接决定实际获得的通信性能。

误读 4:“这是只有 InfiniBand 才能用,以太网不行”

  • 纠偏:GPUDirect RDMA 在 InfiniBand 和 RoCE(RDMA over Converged Ethernet)上均可运行。InfiniBand 因其原生 RDMA 支持和更低的固有延迟,历史上曾是 GPUDirect RDMA 最主流的底层网络。但自 NVIDIA 推出 Spectrum-X 以太网平台(2024 年规模出货),并对 RoCEv2 路径进行针对性拥塞控制和自适应路由优化后,以太网下的 GPUDirect RDMA 性能差距正在收窄。截至 2025 年,部分云厂商已在其生产集群中采用 Spectrum-X 以太网替代 InfiniBand,以降低布线和运维复杂度。

误读 5:“其他 GPU 厂家的类似技术跟 NVIDIA 的没有差别”

  • 纠偏:从概念和 PCIe 原理上看,AMD 的 ROCm + UCX 路线和 Intel 的 oneAPI 路线确实可以做到类似的 GPU 显存直连网卡功能。但大规模生产部署环境下的差异在于:驱动和通信库的健壮性(是否在各种异常场景下稳定运行)、生态优化深度(主流框架和第三方库是否默认适配)以及与上层调度系统的集成成熟度。截至 2025 年上半年,公开可查的大规模(万卡级)、长时间(数周至数月)稳定训练案例仍绝大多数来自 NVIDIA 生态。替代方案需要更多公开的标杆案例来证明其成熟度。

最新事件

按时间倒序梳理与 GPUDirect RDMA 相关的重要产业事件:

2025 年 Q1-Q2(截至 2025 年 5 月)

  • NVIDIA Blackwell Ultra(B300)系列 GPU 在 2025 年 GTC 大会上发布,预计搭配 ConnectX-8 网卡(800G)和 Spectrum-X / Quantum-X800 交换机平台。新一代平台进一步增强了 GPUDirect RDMA over Ethernet 的主动拥塞控制算法,NVIDIA 宣称可在大规模多租户环境下将尾延迟抖动降低 40%(来源:NVIDIA 2025 GTC Keynote)。
  • AMD 在 2025 年 Q1 财报电话会中表示,其 Instinct MI300X GPU 的 ROCm 6.3 版本在数千卡规模集群上的通信性能“正在快速逼近 NVIDIA 上一代水平”,但未披露具体 MFU 对比数据(来源:AMD 2025 Q1 Earnings Call Transcript)。

2024 年下半年

  • 2024 年 11 月:xAI(马斯克旗下 AI 公司)的 Colossus 集群上线,宣称配备 10 万颗 H100 GPU,采用 NVIDIA Spectrum-X 以太网实现 GPUDirect RDMA,是目前(截至 2025 年初)全球已知最大的全部基于以太网实现 GPU 直通 RDMA 的生产集群(来源:xAI 官方博文及 Elon Musk 在 X 平台的公开表述)。该案例是 Spectrum-X 挑战 InfiniBand 在 AI 主干网络地位的关键标志性部署。
  • 2024 年 10 月:NVIDIA 宣布 Spectrum-X 以太网平台年化营收“run-rate”已超数十亿美元,并将在 2025 年向 Dell、HPE、联想等 OEM 广泛供货(来源:NVIDIA 2024 年 GTC 和后续新闻稿)。
  • 2024 年 Q3:多家云厂商在财报或分析师会议上指出,客户对“AI 就绪”的 GPU 实例需求仍然远超供给,其中具备 GPUDirect RDMA 和高速网络接入的实例等待队列最长。

2024 年上半年

  • 2024 年 6 月:全球超算 Top500 榜单中,采用 GPUDirect RDMA(或等效技术)的系统在总性能份额中的占比持续攀升。Frontier(AMD 方案)、LUMI(AMD 方案)、Leonardo(NVIDIA+NVIDIA InfiniBand)等顶级系统均依赖类似 GPU 直连通信技术。
  • 2024 年 3 月:NVIDIA GTC 2024 正式发布 Blackwell 架构 GPU(B100/B200)和对应的 Quantum-X800 InfiniBand 交换机平台及 Spectrum-X800 以太网平台,GPU 到网卡带宽通道升级至 PCIe 6.0 级别(800GB/s 双向带宽)。GPUDirect RDMA 被明确列为 Blackwell 平台“五大核心技术突破”之一。

跟踪指标

用于持续评估 GPUDirect RDMA 技术产业影响力和竞争格局变化的关键指标:

指标 1:MLPerf Training 基准测试中的通信效率相关指标

  • 观测对象:每轮 MLPerf Training(每约半年发布一次)中,最大规模训练任务(如 GPT-3 175B 等级别)的集群扩展效率和在何种 GPU 拓扑+网络组合下完成。
  • 重点关注:是否出现基于非 NVIDIA 硬件的训练成绩首次入围并进入接近 NVIDIA 成绩的区间(如扩展效率差距缩小至 10% 以内)。

指标 2:NVIDIA Networking 业务线营收及增速

  • 数据来源:NVIDIA 季度财报(每季度、每年)。关注 Networking 营收的同比增速是否出现趋势性放缓,以及 Ethernet(Spectrum-X)与 InfiniBand 的营收构成变化。
  • 意义:增速放缓可能暗示市场渗透率趋于饱和,或替代方案开始分流。

指标 3:AMD Instinct GPU 在超大规模客户中的落地公告

  • 观察点:当有头部云厂商(微软、Meta、Oracle 等)公开宣布部署超过 5000 卡 AMD Instinct GPU 集群并支持 ROCm + 类似 GPUDirect RDMA 功能用于生产训练时,标志其替代路线进入实质竞争阶段。
  • 信源:云厂商官方博客、AMD 投资者关系材料、科技媒体(如 The Next Platform、SemiAnalysis)。

指标 4:超大规模云厂商自研 AI 芯片对外部客户的开放程度

  • 观察点:Google Cloud 是否将 TPU 实例向非谷歌生态的第三方大模型训练客户更大力度推广;AWS Trainium 实例的外部客户采纳率与公开基准性能。
  • 逻辑:若自研芯片在成本/TCO 上对客户的吸引力超过 NVIDIA,将影响 GPUDirect RDMA 生态的市场份额增量空间。

指标 5:开源集合通信库对非 NVIDIA 生态的支持质量

  • 核心追踪项目:NCCL(NVIDIA 维护,部分开源)、RCCL(AMD 维护,对标 NCCL)、以及更底层的 UCX(统一通信框架)。
  • 观察点:UCX 和 RCCL 的 GitHub 仓库版本更新频率、文档成熟度、以及在其 Issue 和社区中浮现的大规模部署问题报告。成熟的开源通信栈是 GPU 直连 RDMA 普及的必要条件。

指标 6:高端网络设备出货量与份额

  • 数据来源:Dell‘Oro Group、Crehan Research、LightCounting 等第三方市场研究机构每季度发布的数据中心交换机/网卡市场报告。
  • 关注维度:800G 端口出货量、InfiniBand 与高性能以太网的份额此消彼长趋势、以及光模块/铜缆互联方案的出货结构变化(AEC 有源电缆 vs 光模块)。

指标 7:管控制裁政策动态

  • 跟踪信源:美国商务部工业与安全局(BIS)发布的实体清单与出口管制规则更新、NVIDIA 8-K 重大事件公告、中国商务部相关回应。
  • 影响渠道:出口管制限制的性能上限直接影响中国客户获取完整 GPUDirect RDMA 能力对应的带宽和 GPU 数量规模,从而影响中国 AI 产业的技术路线选择与国产替代节奏。

信源

以下列出本概念页论述中引用的主要公开信源类别及典型的获取渠道,便于后续验证与深入追踪:

  • 核心官方文档:NVIDIA 《GPUDirect》系列技术白皮书、NVIDIA Developer Blog 中关于 GPUDirect RDMA 和 NCCL 的技术文章、《NCCL Documentation》官方文档。
  • 财报与投资者关系资料:NVIDIA、AMD、Intel、Broadcom 等公司每季度发布的 10-Q/8-K/财报电话会记录,对业务线营收和战略优先级提供直接参考。
  • 第三方市场研究机构:Dell’Oro Group、Crehan Research、LightCounting、Mercury Research、SemiAnalysis 发布的数据中心网络、GPU 市场份额专业报告(通常为付费,公开摘要可见部分关键趋势数据)。
  • 技术大会与学术会议:NVIDIA GTC 大会 (GPU Technology Conference)、SC (Supercomputing Conference)、OCP (Open Compute Project) 全球峰会、Hot Chips 会议的相关演讲与论文。
  • 科技媒体与独立分析师:The Next Platform、Serve The Home、Semianalysis(订阅制)、AnandTech 对数据中心 GPU 和网络技术的深度拆解与评测。
  • 行业基准测试平台:MLCommons(MLPerf Training/Inference 结果数据库)、Top500(全球超算排名榜单)。
  • 公司官方公告与云厂商文档:Microsoft Azure、AWS、Google Cloud 关于其 GPU 实例和网络能力的公开技术文档;xAI、Meta 等公司对其 AI 集群架构的公开说明博文。

数据时效性声明:本页所有带明确年份的数据均标注来源或推算口径。如需用于正式投资分析或学术引用,请直接溯源原始报告并对当时的市场环境进行适当还原

source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型