GPUDirect RDMA
3 秒看懂
GPUDirect RDMA 是 NVIDIA 專為資料中心 GPU 叢集設計的一項關鍵通訊加速技術。它讓伺服器內的 NVIDIA GPU 與 RDMA 網絡卡(InfiniBand/RoCE)之間,能夠通過 PCIe 匯流排建立“點對點直連隧道”,資料從 GPU 視訊記憶體直接搬運到網絡卡發出,完全跳過 CPU 與系統記憶體。這項技術的核心目標只有一個:在大規模 AI 訓練和高效能運算(HPC)場景下,將通訊延遲壓至物理極限,並最大限度釋放 CPU 算力,消除萬卡叢集的關鍵通訊瓶頸。
3 分鐘產業解釋
在 AI 大型模型訓練中,成千上萬的 GPU 需要以極高頻率交換海量中間資料——梯度同步、啟用值傳遞、引數更新。這些操作依賴 AllReduce、All-to-All 等集合通訊模式。在傳統以 CPU 為中心的伺服器架構中,每一個數據包從一張 GPU 視訊記憶體傳輸到另一張 GPU 視訊記憶體,必須走一條“彎路”:GPU 視訊記憶體 → 系統記憶體 → CPU → 系統記憶體 → 網絡卡。這一路徑存在兩個核心瓶頸:第一,CPU 深度參與資料複製,佔用寶貴的 CPU 算力資源並引入確定性延遲;第二,資料在系統記憶體中多跳中轉,消耗記憶體頻寬且造成不必要的時間開銷。
GPUDirect RDMA 的產業價值可概括為 “打直球” 三個字。它使網絡卡能夠將 GPU 視訊記憶體視為第一等的可定址記憶體空間,建立起端到端的專用資料通道。這並非微小的軟體最佳化,而是支撐萬卡、乃至十萬卡規模 AI 叢集的 基礎設施級剛需。在大規模並行訓練中,通訊效率直接影響模型 FLOPS 利用率(MFU,即 GPU 有效計算時間佔比)。如果 MFU 從 50% 下降至 45%,意味著相同訓練任務需要多消耗約 10%-15% 的 GPU 時和電力成本。按單次大規模訓練動輒數千萬至數億美元的叢集總投入計算,該技術每年可為產業節省或創造數十億美元級別的等效價值。當前全球主要 AI 算力叢集已將該技術作為標配,是建設新一代 AI 資料中心的“預設架構”選項。
技術原理
GPUDirect RDMA 從硬體和驅動層面改變了資料傳輸的路徑規劃。傳統的“CPU 中心”資料流模式,要求所有 I/O 裝置通過 CPU 與系統記憶體匯流排進行通訊。而 GPUDirect RDMA 實現的是“GPU 中心”的架構——RDMA 網絡卡被賦予直接訪問 GPU 視訊記憶體實體地址的能力。
傳統路徑(CPU 中心):
[GPU 視訊記憶體] → (複製1) → [系統記憶體] ↔ (CPU參與) ↔ [系統記憶體] → (複製2) → [網絡卡緩衝區] → 網路
該路徑涉及兩次顯式資料複製和 CPU 中斷處理,每次複製都引入微秒級延遲,並佔用系統記憶體頻寬。在大規模並行訓練中,當上百甚至上千個節點同時進行通訊時,CPU 中斷風暴和記憶體頻寬爭搶將嚴重拖累訓練效率。
GPUDirect RDMA 路徑(GPU 中心):
[GPU 視訊記憶體] → (DMA 直接訪問) → [網絡卡緩衝區] → 網路
資料路徑被壓縮至極簡:GPU 驅動預先將相關視訊記憶體地址對映並註冊至 PCIe 地址空間,RDMA 網絡卡內建的 DMA 引擎據此作為 PCIe 匯流排主裝置,直接對 GPU 視訊記憶體執行讀取或寫入操作。CPU 在整個資料搬運過程中完全不參與資料面,僅在初始化連線等控制面環節工作。
關鍵機制分解:
-
PCIe 地址對映與 BAR 空間:在現代 PCIe 架構中,每個裝置(GPU、網絡卡)都有 BAR(Base Address Register)空間,用於向系統暴露其可被外部訪問的記憶體區域。GPU 驅動程式會將部分視訊記憶體區域對映到 PCIe BAR 空間,使網絡卡的 DMA 引擎能夠“看到”這些地址。
-
記憶體註冊與地址轉換:應用程式(通過 NCCL 或 MPI 通訊庫)將需要用於傳輸的 GPU 視訊記憶體緩衝區進行“註冊”操作。GPU 驅動與網絡卡驅動協同工作,將 GPU 視訊記憶體的實體地址轉換為網絡卡能夠直接理解和訪問的 PCIe 匯流排地址。對於配備 IOMMU(輸入輸出記憶體管理單元)的系統,地址轉換過程還需要經過 IOMMU 對映,以確保安全隔離和相容性。
-
網絡卡 DMA 引擎操作:RDMA 網絡卡內建高效能 DMA 引擎,在獲得有效 PCIe 目標地址後,以匯流排主裝置(Bus Master)身份主動發起對 GPU PCIe 端點的記憶體讀寫請求。資料通過 Scatter/Gather 方式直接聚合或分發,完全繞過系統記憶體。
-
軟體棧協同:整個流程依賴 GPU 驅動、網絡卡驅動、通訊庫(NCCL/MPI)的三層協同。NCCL 內部會自動檢測硬體是否支援 GPUDirect RDMA,若支援則優先啟用該快速路徑。應用層程式碼通常無需顯式呼叫 RDMA Verbs,架構(如 PyTorch、TensorFlow)通過 NCCL 間接獲得加速。
效能收益的量化理解:
- 延遲:典型場景下,GPU 到 GPU 的單次通訊延遲可從傳統路徑的 10-20 微秒量級壓縮至 3-5 微秒。尾延遲(P99 延遲)最佳化尤為關鍵——在萬卡規模的同步通訊中,整體訓練步長的完成時間由最慢的那個節點決定,尾延遲的降低直接提升訓練步長吞吐。
- 頻寬利用率:傳統路徑下,系統記憶體頻寬成為瓶頸,PCIe 到網路的端到端有效頻寬往往只能達到理論峰值的 60%-70%。GPUDirect RDMA 可將有效頻寬利用率推至 90% 以上,更接近 PCIe 線速。
- CPU 釋放:在大規模 AllReduce 操作期間,CPU 佔用率可下降 30%-80%(視負載特性而異)。釋放的 CPU 資源可用於資料預處理、引數伺服器等任務,最佳化整體系統效率。
關鍵引數
評估 GPUDirect RDMA 在實際部署中的效能與適用性,需關注以下核心引數體系:
1. 有效通訊頻寬(Effective Throughput) 指單 GPU 經網絡卡到網路的實際資料傳輸速率,單位為 GB/s 或 Gbps。受限於三個物理層:
- PCIe 代際與通道數:如 PCIe 5.0 ×16 單向理論頻寬約 64 GB/s,PCIe 6.0 ×16 將翻倍至約 128 GB/s(截至 2025 年,PCIe 6.0 在 AI 伺服器領域尚處於早期匯入階段)。
- 網絡卡速率:當前主流為 NVIDIA ConnectX-7(400 Gbps,約 50 GB/s)及 ConnectX-8(800 Gbps,約 100 GB/s,2024 年 GTC 大會發布,2025 年開始規模發貨)。
- GPU 視訊記憶體頻寬:如 H100 的 HBM3 頻寬達 3.35 TB/s(片內),遠超網路出口頻寬,因此瓶頸在網路側而非 GPU 側。
2. 尾延遲(P99/P999 Latency) 高併發同步通訊中的尾部延遲,是比平均延遲更重要的指標。資料口徑參考:在萬卡叢集全規約(AllReduce)操作中,GPUDirect RDMA 通常可將 P99 延遲控制在 10 微秒以內,而傳統 CPU 中轉路徑可能飆升至 50 微秒以上(來源:NVIDIA 2023 年 GTC 技術演講《NCCL Performance Optimization》)。延遲的穩定性對模型訓練收斂速度和整體 MFU 有直接影響。
3. CPU 佔用率下降幅度 在執行典型 AllReduce 通訊負載時,CPU 核心中的通訊處理開銷佔比。啟用 GPUDirect RDMA 後,CPU 通訊開銷佔比通常從傳統路徑的 15%-25% 降至 5% 以下(來源:MLCommons 訓練基準測試中對同等規模配置的對比資料,測算口徑為通訊期間 CPU 核心利用率增量)。
4. 可擴充套件性係數(Scalability Factor) 衡量叢集規模擴大時通訊效率的衰減程度。計算公式:擴充套件效率 = N 節點時的 AllReduce 有效頻寬 ÷ 單節點時的 AllReduce 有效頻寬。在優質網路拓撲(如 NVIDIA Quantum-2 InfiniBand 的胖樹拓撲)下,配備 GPUDirect RDMA 的叢集在 1000 節點擴充套件時,通常可保持 80%-90% 的擴充套件效率(來源:NVIDIA 2024 SuperPOD 參考架構白皮書)。
5. 相容性矩陣 必須同時滿足三項條件:
- GPU:NVIDIA Kepler 架構及以上(更早架構存在部分支援限制),建議使用 Hopper/Blackwell 等新一代架構以獲得最佳效能。
- 網絡卡:NVIDIA ConnectX-3 及以上(InfiniBand/RoCE 均可),建議使用 ConnectX-7/8 配合 PCIe 5.0/6.0 以匹配頻寬代際。
- 驅動與通訊庫:GPU 驅動版本 ≥ 418 系列,NCCL 版本 ≥ 2.0 系列(當前最新為 2.21.x,截至 2025 年 5 月)。
技術路線
當前 GPU 間跨節點通訊存在三條主要技術路徑,其架構差異決定適用場景:
| 特性維度 | 傳統 CPU 中轉路徑 | GPUDirect RDMA | GPUDirect RDMA + NVLink/NVSwitch |
|---|---|---|---|
| 資料路徑 | GPU → 系統記憶體 → CPU → 系統記憶體 → 網絡卡 | GPU → 網絡卡(PCIe 直連) | 節點內:GPU 間經 NVLink/NVSwitch 直連;跨節點:GPU → 網絡卡(PCIe 直連) |
| CPU 參與深度 | 高(全程資料複製控制) | 極低(僅控制面建連) | 極低 |
| 端到端延遲 | ~10-50 μs(高負載) | ~3-5 μs | ~2-3 μs(節點內幾乎忽略) |
| 有效頻寬利用率 | 60%-70%(記憶體頻寬瓶頸) | 90%-95% | 95%+(內部 NVLink 頻寬約 900 GB/s,遠超 PCIe) |
| 適用叢集規模 | 小規模(< 64 GPU) | 千卡至萬卡規模 | 萬卡至十萬卡級超大規模 |
| 典型部署場景 | 通用雲端主機、輕度 GPU 工作負載 | 大規模 AI 訓練/HPC 標準配置 | 超大規模前沿訓練(如 GPT 系列千億至萬億引數模型) |
| 綜合成本 | 低(無需專用網路裝置) | 中高(需要 RDMA 網絡卡與交換器) | 極高(DGX/HGX 系統 + 專用拓撲) |
路線演進趨勢:
-
“GPUDirect 全家桶”進一步整合:在 NVIDIA 最新 Blackwell 平台架構(2024 年釋出)中,GPU、NVLink Switch、ConnectX 網絡卡、BlueField DPU 之間的直接通訊路徑被進一步拉通,形成從晶片內(NVLink-C2C)到機架內(NVLink Switch)再到跨機架(Quantum InfiniBand/Spectrum-X Ethernet)的三層統一通訊平面。GPUDirect RDMA 作為跨節點通訊的橋樑,與 NVLink/NVSwitch 的片內互聯無縫銜接。
-
乙太網路徑的加強(Spectrum-X):NVIDIA 於 2024 年正式推出 Spectrum-X 乙太網路平台,針對 AI 工作負載進行深度最佳化,支援 RoCEv2 下的 GPUDirect RDMA。該平台通過在交換器端做自適應路由和擁塞控制,試圖縮小乙太網路與 InfiniBand 在 AI 訓練穩定性和尾延遲上的差距。截至 2025 年 Q1,Spectrum-X 已在部分超雲端廠商(公開資訊指向 CoreWeave 及微軟 Azure 的部分叢集)進入生產部署,InfiniBand 仍佔據 AI 訓練主幹網路約 70% 份額(來源:Dell‘Oro Group 2024 年 Q4 AI 網路市場報告)。
-
非 NVIDIA 替代路線的進展:AMD 通過 ROCm 生態下的 UCX 通訊架構和 RCCL 庫(對標 NCCL)提供類似 GPUDirect RDMA 的功能,支援 AMD Instinct GPU 與友商 RDMA 網絡卡(含 Broadcom)的直連。Intel 通過 oneAPI 和 Intel Ethernet 800 系列網絡卡支援類似能力。但從公開的 MLPerf 訓練基準成績和超大規模部署案例來看,截至 2025 年上半年,非 NVIDIA 路線的 生產成熟度和端到端 MFU 仍顯著落後於 NVIDIA 生態,公開資料未見 5000 卡以上非 NVIDIA GPU 叢集的公開穩定訓練資料。
上游
GPUDirect RDMA 技術依賴的上游核心環節及主要參與者:
1. GPU 晶片 當前幾乎完全由 NVIDIA 生態壟斷。支援 GPUDirect RDMA 的 GPU 需在硬體層面實現 PCIe BAR 地址對映和 DMA 引擎協同。NVIDIA 自 Kepler 架構起(2012 年)在硬體層面內建該能力,至 Hopper/Blackwell 架構已深度整合最佳化。AMD Instinct 系列(MI250X/MI300X)及 Intel Data Center GPU Max 系列也宣稱支援類似功能的硬體基礎,但公開的生產級大規模部署驗證資料稀缺。
2. RDMA 網絡卡晶片與成品
- 核心供應商:NVIDIA(原 Mellanox)ConnectX 系列和 BlueField DPU 系列是目前最主要的 GPUDirect RDMA 相容網絡卡晶片。ConnectX-7(400G)和 ConnectX-8(800G)是 2024-2025 年的主力出貨型號。
- 開放生態探索:Broadcom 的 NetXtreme-E 系列與 Intel 的 Ethernet 800 系列網絡卡均支援 RDMA over Converged Ethernet(RoCEv2),理論上硬體具備與 GPU 直連的 PCIe 能力。但在實踐層面,這些網絡卡是否能在特定非 NVIDIA GPU 搭配下實現與 GPUDirect RDMA 同等效率和穩定性的生產級部署,仍缺乏公開的大規模確定性報告。公開資料顯示,在 AMD 生態下,Broadcom 網絡卡與 ROCm/UCX 的整合驗證處於合作推進階段(2024 年 SC 會議上 AMD 與 Broadcom 的聯合演示)。
3. PCIe 交換晶片與 Retimer 隨著節點內 GPU 數量增加(HGX 架構下可達 8 卡),PCIe 拓撲復雜度上升,需要 PCIe 交換晶片和 Retimer(訊號再生器)來維持高質量訊號。
- 主要供應商:Broadcom、Microchip(通過收購 Microsemi 獲得)、Astera Labs(PCIe 5.0/6.0 Retimer 領域的領先創業公司,已於 2024 年 IPO)。
- PCIe 6.0 交換晶片在 2024 年處於送樣階段,預計 2025-2026 年規模量產後將進一步擴大 GPUDirect RDMA 的有效頻寬通道。
4. CPU 與晶片組 AMD EPYC 和 Intel Xeon 伺服器 CPU 均提供 PCIe 根複合體(Root Complex)功能,這層相對標準化。主要差異在於:伺服器平台支援的 PCIe 通道數量影響 GPU 與網絡卡數量配比。AMD EPYC 9004/9005 系列(SP5 平台)支援 128 條 PCIe 5.0 通道,成為當前多 GPU 伺服器的優先選型之一。
下游
GPUDirect RDMA 的下游需求和採納方覆蓋三大類客戶群:
1. 雲端服務廠商(CSP) 超大規模雲端廠商是 GPUDirect RDMA 的最大規模採納者和間接提供者。
- 海外:AWS(P5/P5e 例項,基於 H100/B200 GPU)、Microsoft Azure(ND H100 v5 系列)、Google Cloud(A3 例項)均在其高階 AI 訓練例項中預設啟用 GPUDirect RDMA,並配套部署 NVIDIA Quantum InfiniBand 或 Spectrum-X 乙太網路作為底層網路。這些例項以“AI 超級計算機即服務”的形式銷售給終端客戶。
- 國內:阿里雲端(靈駿智算叢集)、華為雲端(Ascend 生態有自研 HCCS 對標)、字節跳動火山引擎等均提供類似能力。阿里雲端在 2024 雲端棲大會上公開發布的面向大型模型訓練的靈駿叢集方案中,明確列示 GPUDirect RDMA 作為網路加速核心元件。
2. AI 模型公司與研究機構
- 海外頭部 AI 實驗室:OpenAI、Anthropic、Meta AI、xAI、Google DeepMind 等均在其大規模訓練叢集中重度依賴該技術。Meta 公開的 24,576 卡 H100 叢集(2024 年公佈)即採用 InfiniBand 搭配 GPUDirect RDMA。
- 國內 AI 公司:包括大型模型創業企業(如智譜 AI、月之暗面、Minimax、百川智慧等)及研究機構(如北京智源研究院、上海人工智慧實驗室)所使用主要算力叢集均預設具備該技術支撐(來源:各公司 2024 年對外技術分享及公開採購資訊推斷)。
- 邏輯動因:萬億引數級別模型訓練的通訊量極為龐大,單步迭代中通訊時間可能佔據 30%-50% 的總時間。即使 GPUDirect RDMA 只節省幾個微秒的延遲,在大規模萬卡並行下累積的時間節省和相關成本降低可達千萬至億元量級。
3. 高效能運算中心與科研算力平台
- 國家超算中心(如中國國家超級計算濟南/深圳/天津中心、美國橡樹嶺/阿貢國家實驗室等)在其 GPU 加速的 HPC 分割槽均部署相容 GPUDirect RDMA 的硬體。
- 生物醫藥、天氣預報、計算化學等 HPC 應用對集合通訊模式(如 MPI_Allreduce)依賴極深,直接受益於該技術加速。
受益公司
按受益程度和生態參與角色劃分:
第一梯隊:核心主導者與最大受益者
- NVIDIA(NVDA,美股):作為技術的發明者、專利持有者和全棧方案提供商,GPUDirect RDMA 是 NVIDIA 從“GPU 晶片商”向“資料中心全棧平台商”轉型的核心粘合劑之一。該技術與 GPU(A100/H100/B100/B200)、網絡卡(ConnectX-7/8)、交換器(Quantum/Spectrum-X)、DPU(BlueField)及通訊庫(NCCL)形成深度捆綁。其直接商業效果包括:拉動高階 GPU 銷售的壟斷地位(AI 訓練 GPU 市佔率估計超過 85%,來源:Mercury Research 2024 年 Q4 報告)、帶動網路業務快速增長(NVIDIA Networking 業務 FY2025 Q3 營收約 38 億美元,年增率增長 67%,其中 InfiniBand 和 Spectrum-X 是主力貢獻者,來源:NVIDIA FY2025 Q3 財報)、提升整體平台 ASP(平均單節點售價遠高於單獨銷售 GPU)。風險在於若反壟斷壓力或開放替代方案成熟,該捆綁模式的定價權可能在高增長階段後面臨挑戰。
第二梯隊:生態建設者/挑戰者
- AMD(AMD,美股):通過 ROCm 開源軟體棧和 RCCL 通訊庫提供類似 GPUDirect RDMA 的功能,硬體基礎為 Instinct 系列 GPU 與選配的第三方 RDMA 網絡卡。AMD 在 HPC 和部分超算部署中取得進展(如美國 El Capitan 百億億次超算使用 AMD MI300A APU + Slingshot 互聯),但在 AI 訓練大規模私有部署(萬卡級別)的公開成熟案例仍較少。若 AMD 能拉通穩定的 GPU 直連 RDMA 路徑並縮小與 NVIDIA 的 MFU 差距,將是 NVIDIA 最重要的替代選項。
- Intel(INTC,美股):擁有 GPU(Data Center GPU Max)、網絡卡(Ethernet 800 系列)和軟體棧(oneAPI),理論上可提供全棧替代方案。但 Intel 在獨立 GPU 市場的份額極小且產品迭代慢於 NVIDIA 和 AMD,該路線的實際產業影響力有限。
- Broadcom(AVGO,美股):作為 PCIe 交換晶片和定製 ASIC 的重要供應商,Broadcom 同時擁有高效能網絡卡晶片(NetXtreme-E 系列和 Thor 系列 NIC)和廣泛的 PCIe 連線產品。在 AMD 生態中,Broadcom 可能成為重要的 RDMA 網絡卡合作伙伴。此外,Broadcom 為Google TPU 提供定製互聯晶片,在 Google 自研路徑中間接受益於“繞過 NVIDIA GPUDirect”的趨勢。
第三梯隊:受益於生態普及的系統整合與網路裝置商
- Dell Technologies(DELL,美股)/ HPE(HPE,美股)/ Super Micro(SMCI,美股)/ 浪潮資訊(000977,中國):在面向 AI 客戶的伺服器整合業務中,標配支援 GPUDirect RDMA 的節點。該技術提升了高階 AI 伺服器的配置價值量。
- Arista Networks(ANET,美股):Arista 的旗艦資料中心交換器支援 RoCEv2 及無損乙太網路特性(ECN/PFC),相容 NVIDIA GPUDirect RDMA over Ethernet 路徑。在 Spectrum-X 之外,Arista 是雲端廠商自建基於乙太網路的 AI 叢集時最常選配的交換器品牌之一。
- Cisco(CSCO,美股):Cisco Nexus 系列支援 RoCEv2,但在 AI 訓練後端網路市場的份額低於 Arista 和 NVIDIA(來源:Crehan Research 2024 年資料中心交換器報告)。
第四梯隊:間接放大器受益者
- Astera Labs(ALAB,美股):PCIe Retimer 晶片供應商,直接受益於 GPU 與網絡卡直連所需的 PCIe 訊號完整性保障需求增長。
- 光模組供應商:中際旭創(300308,中國)、Coherent(COHR,美股)等 800G/1.6T 光模組廠商間接受益於 GPUDirect RDMA 推動的高速網路投資增長。
特別提示:上述所有公司分析均基於公開揭露的業務資訊和市場研究報告,不構成任何買賣或持有建議。技術路徑採納與競爭格局可能受政策、地緣因素及技術突破影響而發生重大變化。
市場規模
GPUDirect RDMA 本身並非獨立銷售的商品,其市場規模需要通過其拉動的相關硬體和網路裝置支出來間接衡量。
口徑 1:GPU 驅動的 RDMA 網路裝置市場 Dell’Oro Group 2024 年 Q4 AI 網路市場報告指出,2024 年全年 AI 後端網路(包含 InfiniBand 和高效能乙太網路交換器/網絡卡)市場規模約為 140-150 億美元,年增率增長超 100%。其中 InfiniBand 約佔 70%,高效能乙太網路(含 Spectrum-X 及 Arista/Cisco 等通用方案)約佔 30%。預計到 2028 年,AI 後端網路市場總規模將達 350-400 億美元。GPUDirect RDMA 是該市場存在的技術前提——若無此類 GPU 直連通訊技術,AI 叢集不需要如此高效能的網路投資。
口徑 2:NVIDIA Networking 相關營收 NVIDIA 財報中“Networking”業務線涵蓋 InfiniBand、Spectrum-X 及相關的網絡卡、交換器、DPU 和線纜。FY2024(截至 2024 年 1 月)該業務線營收約 131 億美元。FY2025 前三季度累計已達約 100 億美元,預計全年將超過 150 億美元。這部分營收中絕大多數都與 GPUDirect RDMA 技術驅動的 AI 網路需求直接相關(按 NVIDIA 公開說明口徑推測,AI/HPC 佔 Networking 營收的 80% 以上)。
口徑 3:支援 GPUDirect RDMA 的 GPU 出貨量 按 Mercury Research 與 SemiAnalysis 的綜合估算,2024 年全球資料中心 GPU 出貨量約 380-420 萬顆(以 NVIDIA H100/H200 等效計,含 AMD 及 Intel 少量出貨)。其中 95% 以上支援 GPUDirect RDMA 或類似功能。以該技術可產生的“每 GPU 附加網路支出”約 3000-5000 美元計算(假設平均每 8 塊 GPU 對應一張 400G/800G 網絡卡和相關交換器埠分攤),全球 GPUDirect RDMA 相關的網路增量市場約為 115-210 億美元/年(2024 年估算,非精確資料,存在較大上下浮動空間)。
重要說明:以上估算均為行業觀察機構的間接推算,資料口徑和精確數值在不同研究機構間存在差異。上述資料原始出處優先標註,部分衍生估算口徑下的具體數字僅為示意,不代表精確財務預測。
玩家對比
將 GPUDirect RDMA(NVIDIA 路線)與主要替代或競爭方案做結構化對比:
| 對比維度 | NVIDIA GPUDirect RDMA 生態 | AMD ROCm + UCX 路線 | 雲端廠商自研晶片及互聯 | 標準 RoCEv2(非 NVIDIA 最佳化) |
|---|---|---|---|---|
| 成熟度 | 生產級,超萬卡驗證 | 處於規模驗證階段(千卡至數千卡) | Google TPU v5p 已驗證萬卡+;AWS Trainium 處於推廣期 | 在低規模 GPU 叢集有部署,大規模訓練驗證較少 |
| 端到端 MFU | 可穩定在 50%-60% 以上 | 公開資料有限,部分第三方測試低於 NVIDIA 同規模 | Google TPU 生態內部 MFU 優秀(Google內部論文報道) | 通常低於 InfiniBand 路線,尾延遲問題顯著 |
| 網絡卡相容性 | 嚴密繫結 ConnectX/BlueField | 理論上可相容 Broadcom/Intel 網絡卡 | 自研封閉生態 | Broadcom、Intel、NVIDIA 均可 |
| 單位成本感知 | 高(需全套 NVIDIA 方案) | 中低(可搭配低成本交換器) | 自研投入高,外部不可直接購買 | 低(可利用通用乙太網路裝置) |
| 主要部署場景 | 前沿大型模型訓練、HPC 標杆系統 | 部分 HPC 部署、對成本敏感的 AI 雲端 | 第一方模型訓練(如 Google Gemini、AWS Bedrock 支撐) | 中小規模 AI 推論、企業級 GPU 叢集 |
| 生態開放性 | 低(黑盒方案) | 較高(ROCm 逐步開源完整棧) | 封閉 | 高(標準協議,各廠商可互通) |
產業評價:截至 2025 年上半年,在“萬卡級大語言模型/多模態模型大規模預訓練”這一核心場景下,NVIDIA GPUDirect RDMA + InfiniBand 路線仍具備顯著綜合優勢,特別是在訓練穩定性和 MFU 維度。替代方案在中小規模訓練、推論場景以及有自研晶片能力的超雲端廠商中正在追趕。後續重點觀察指標:AMD ROCm 在 5000 卡以上公開叢集的真實訓練報告、各家雲端廠商自研晶片的出貨量爬坡與外部客戶採納情況。
風險
1. 生態封閉與供應商鎖定風險 GPUDirect RDMA 技術深度繫結 NVIDIA 生態,採用該方案的客戶實質上面臨極高的遷移成本。一旦開始建設基於該技術的萬卡叢集,後續擴容幾乎只能繼續選擇 NVIDIA 方案。這種鎖定效應是 NVIDIA 高毛利、高市佔率的重要來源,但也是下游客戶(尤其是雲端廠商)試圖通過自研或扶持 AMD 路線來“反鎖定”的主要動力。若未來反壟斷監管加強(特別是美國、歐盟對 NVIDIA 商業行為的審查趨於嚴格),可能影響該技術捆綁模式的持續性和市場格局。
2. 替代路線快速成熟風險 AMD ROCm 生態的完善速度與雲端廠商自研 AI 晶片(Google TPU v6、AWS Trainium2、微軟 Maia 等)的迭代進展,是 GPUDirect RDMA 路線最大的競爭威脅。若上述替代方案在“總擁有成本(TCO)÷ 訓練效率”指標上能在未來 2-3 年內追平或超越 NVIDIA 方案,可能分流大量訂單,特別是在雲端廠商自有業務(第一方工作負載)中。
3. 技術架構“天花板”風險 GPUDirect RDMA 最佳化的是“單機箱內 GPU 到網絡卡”的這一段路徑。當模型規模進一步擴大、資料並行度提升導致跨機架流量佔比上升時,瓶頸將從 PCIe 匯流排轉移到網路拓撲和交換器晶片能力。InfiniBand 和 Spectrum-X 儘管在不斷升級(NDR 400G → XDR 800G),但資料中心物理距離和光互聯功耗等基礎約束仍然存在。若未來出現“存算一體”或顛覆性分散式架構取代當前的 AllReduce 範式,該技術的重要性可能相對下降。
4. 地緣政治與出口管制風險 NVIDIA 高階 GPU 和配套的 InfiniBand/ConnectX 網絡卡受到美國出口管制政策限制(2022 年 10 月起的 BIS 規則更新及後續多次調整),直接影響了中國市場的供應。雖然 NVIDIA 推出合規的降配版(如 H20)並限制互連頻寬,但仍嚴重影響中國客戶的叢集組網能力。這促使中國加速自研替代方案(華為昇騰 + HCCS 互聯、天數智芯等路線),在中長期可能培養出獨立於 NVIDIA GPUDirect 的技術體系。
5. 採購成本與可用性風險 由於需求極度旺盛,NVIDIA GPU 和高速網絡卡長期處於供不應求的狀態(2023-2024 年尤為突出),交貨週期長達數月至一年。客戶不僅面臨高昂的硬體成本,還要承擔供應鏈延遲導致專案無法按時上線的機會成本。這推動部分預算受限的客戶尋找“降級替代”,如使用 200G/100G 網路或探索純乙太網路 RoCEv2 方案,降低了 GPUDirect RDMA 最優配置的滲透率天花板。
誤讀糾偏
誤讀 1:“GPUDirect RDMA 等於普通 RDMA”
- 糾偏:普通 RDMA(RDMA over Converged Ethernet 或 InfiniBand RDMA 基本模式)解決的是兩個伺服器系統記憶體之間的直接資料訪問問題,繞過了作業系統核心。而 GPUDirect RDMA 的獨特之處在於,它把GPU 視訊記憶體納入了這個“直連可定址”的範圍。這需要 GPU 驅動和網絡卡驅動完成視訊記憶體地址到 PCIe 地址的聯合註冊與轉換,並非簡單的驅動引數調整,而是硬體和韌體的深度協同。普通 RDMA 網絡卡若沒有配套的 GPU 驅動支援,無法將 DMA 目標指向 GPU 視訊記憶體。
誤讀 2:“啟用 GPUDirect RDMA 後,網路頻寬就不再是瓶頸”
- 糾偏:該技術只優化了伺服器內部的資料搬運路徑,消除了 CPU 和系統記憶體這個區域性瓶頸。但它並不改變網路本身的物理頻寬上限。最終的端到端吞吐量仍受限於網絡卡埠速率(400G/800G)、PCIe 通道頻寬(PCIe 5.0 ×16 約為 64 GB/s)、交換器總頻寬以及光模組/銅纜的訊號質量。在萬卡叢集中,網路拓撲設計(胖樹 vs 龍與 vs 3D-Torus)、負載均衡演算法和擁塞控制機制同樣是決定性因素。GPUDirect RDMA 只是讓資料更高效地“上路”,但高速公路本身的容量和收費站仍需同步配套升級。
誤讀 3:“這是純硬體功能,插上就能用”
- 糾偏:底層確實需要 GPU、網絡卡、PCIe 的硬體能力支援,但發揮價值高度依賴軟體棧的適配。NCCL(輝達集合通訊庫)是整個工具鏈中至關重要的一環——它負責判斷當前的硬體拓撲是否支援 GPUDirect RDMA、自動啟用最優路徑、並管理 GPU 視訊記憶體的註冊與釋放。若使用的深度學習架構(如 PyTorch)版本過舊或 NCCL 版本不匹配,即便硬體俱全也可能回退到慢速的 CPU 中轉路徑。軟體棧的版本管理和整合測試是部署中的關鍵環節,直接決定實際獲得的通訊效能。
誤讀 4:“這是隻有 InfiniBand 才能用,乙太網路不行”
- 糾偏:GPUDirect RDMA 在 InfiniBand 和 RoCE(RDMA over Converged Ethernet)上均可執行。InfiniBand 因其原生 RDMA 支援和更低的固有延遲,歷史上曾是 GPUDirect RDMA 最主流的底層網路。但自 NVIDIA 推出 Spectrum-X 乙太網路平台(2024 年規模出貨),並對 RoCEv2 路徑進行針對性擁塞控制和自適應路由最佳化後,乙太網路下的 GPUDirect RDMA 效能差距正在收窄。截至 2025 年,部分雲端廠商已在其生產叢集中採用 Spectrum-X 乙太網路替代 InfiniBand,以降低佈線和運維複雜度。
誤讀 5:“其他 GPU 廠家的類似技術跟 NVIDIA 的沒有差別”
- 糾偏:從概念和 PCIe 原理上看,AMD 的 ROCm + UCX 路線和 Intel 的 oneAPI 路線確實可以做到類似的 GPU 視訊記憶體直連網絡卡功能。但大規模生產部署環境下的差異在於:驅動和通訊庫的健壯性(是否在各種異常場景下穩定執行)、生態最佳化深度(主流架構和第三方庫是否預設適配)以及與上層排程系統的整合成熟度。截至 2025 年上半年,公開可查的大規模(萬卡級)、長時間(數週至數月)穩定訓練案例仍絕大多數來自 NVIDIA 生態。替代方案需要更多公開的標杆案例來證明其成熟度。
最新事件
按時間倒序梳理與 GPUDirect RDMA 相關的重要產業事件:
2025 年 Q1-Q2(截至 2025 年 5 月)
- NVIDIA Blackwell Ultra(B300)系列 GPU 在 2025 年 GTC 大會上釋出,預計搭配 ConnectX-8 網絡卡(800G)和 Spectrum-X / Quantum-X800 交換器平台。新一代平台進一步增強了 GPUDirect RDMA over Ethernet 的主動擁塞控制演算法,NVIDIA 宣稱可在大規模多租戶環境下將尾延遲抖動降低 40%(來源:NVIDIA 2025 GTC Keynote)。
- AMD 在 2025 年 Q1 財報電話會中表示,其 Instinct MI300X GPU 的 ROCm 6.3 版本在數千卡規模叢集上的通訊效能“正在快速逼近 NVIDIA 上一代水平”,但未揭露具體 MFU 對比資料(來源:AMD 2025 Q1 Earnings Call Transcript)。
2024 年下半年
- 2024 年 11 月:xAI(馬斯克旗下 AI 公司)的 Colossus 叢集上線,宣稱配備 10 萬顆 H100 GPU,採用 NVIDIA Spectrum-X 乙太網路實現 GPUDirect RDMA,是目前(截至 2025 年初)全球已知最大的全部基於乙太網路實現 GPU 直通 RDMA 的生產叢集(來源:xAI 官方博文及 Elon Musk 在 X 平台的公開表述)。該案例是 Spectrum-X 挑戰 InfiniBand 在 AI 主幹網路地位的關鍵標誌性部署。
- 2024 年 10 月:NVIDIA 宣佈 Spectrum-X 乙太網路平台年化營收“run-rate”已超數十億美元,並將在 2025 年向 Dell、HPE、聯想等 OEM 廣泛供貨(來源:NVIDIA 2024 年 GTC 和後續新聞稿)。
- 2024 年 Q3:多家雲端廠商在財報或分析師會議上指出,客戶對“AI 就緒”的 GPU 例項需求仍然遠超供給,其中具備 GPUDirect RDMA 和高速網路接入的例項等待佇列最長。
2024 年上半年
- 2024 年 6 月:全球超算 Top500 排行榜中,採用 GPUDirect RDMA(或等效技術)的系統在總效能份額中的佔比持續攀升。Frontier(AMD 方案)、LUMI(AMD 方案)、Leonardo(NVIDIA+NVIDIA InfiniBand)等頂級系統均依賴類似 GPU 直連通訊技術。
- 2024 年 3 月:NVIDIA GTC 2024 正式釋出 Blackwell 架構 GPU(B100/B200)和對應的 Quantum-X800 InfiniBand 交換器平台及 Spectrum-X800 乙太網路平台,GPU 到網絡卡頻寬通道升級至 PCIe 6.0 級別(800GB/s 雙向頻寬)。GPUDirect RDMA 被明確列為 Blackwell 平台“五大核心技術突破”之一。
追蹤指標
用於持續評估 GPUDirect RDMA 技術產業影響力和競爭格局變化的關鍵指標:
指標 1:MLPerf Training 基準測試中的通訊效率相關指標
- 觀測物件:每輪 MLPerf Training(每約半年釋出一次)中,最大規模訓練任務(如 GPT-3 175B 等級別)的叢集擴充套件效率和在何種 GPU 拓撲+網路組合下完成。
- 重點關注:是否出現基於非 NVIDIA 硬體的訓練成績首次入圍並進入接近 NVIDIA 成績的區間(如擴充套件效率差距縮小至 10% 以內)。
指標 2:NVIDIA Networking 業務線營收及增速
- 資料來源:NVIDIA 季度財報(每季度、每年)。關注 Networking 營收的年增率增速是否出現趨勢性放緩,以及 Ethernet(Spectrum-X)與 InfiniBand 的營收構成變化。
- 意義:增速放緩可能暗示市場滲透率趨於飽和,或替代方案開始分流。
指標 3:AMD Instinct GPU 在超大規模客戶中的落地公告
- 觀察點:當有頭部雲端廠商(微軟、Meta、Oracle 等)公開宣佈部署超過 5000 卡 AMD Instinct GPU 叢集並支援 ROCm + 類似 GPUDirect RDMA 功能用於生產訓練時,標誌其替代路線進入實質競爭階段。
- 信源:雲端廠商官方部落格、AMD 投資者關係材料、科技媒體(如 The Next Platform、SemiAnalysis)。
指標 4:超大規模雲端廠商自研 AI 晶片對外部客戶的開放程度
- 觀察點:Google Cloud 是否將 TPU 例項向非Google生態的第三方大型模型訓練客戶更大力度推廣;AWS Trainium 例項的外部客戶採納率與公開基準效能。
- 邏輯:若自研晶片在成本/TCO 上對客戶的吸引力超過 NVIDIA,將影響 GPUDirect RDMA 生態的市場份額增量空間。
指標 5:開源集合通訊庫對非 NVIDIA 生態的支援質量
- 核心追蹤專案:NCCL(NVIDIA 維護,部分開源)、RCCL(AMD 維護,對標 NCCL)、以及更底層的 UCX(統一通訊架構)。
- 觀察點:UCX 和 RCCL 的 GitHub 倉庫版本更新頻率、文件成熟度、以及在其 Issue 和社群中浮現的大規模部署問題報告。成熟的開源通訊棧是 GPU 直連 RDMA 普及的必要條件。
指標 6:高階網路裝置出貨量與份額
- 資料來源:Dell‘Oro Group、Crehan Research、LightCounting 等第三方市場研究機構每季度釋出的資料中心交換器/網絡卡市場報告。
- 關注維度:800G 端口出貨量、InfiniBand 與高效能乙太網路的份額此消彼長趨勢、以及光模組/銅纜互聯方案的出貨結構變化(AEC 有源電纜 vs 光模組)。
指標 7:管控制裁政策動態
- 追蹤信源:美國商務部工業與安全域性(BIS)釋出的實體清單與出口管制規則更新、NVIDIA 8-K 重大事件公告、中國商務部相關回應。
- 影響渠道:出口管制限制的效能上限直接影響中國客戶獲取完整 GPUDirect RDMA 能力對應的頻寬和 GPU 數量規模,從而影響中國 AI 產業的技術路線選擇與國產替代節奏。
信源
以下列出本概念頁論述中引用的主要公開信源類別及典型的獲取渠道,便於後續驗證與深入追蹤:
- 核心官方文件:NVIDIA 《GPUDirect》系列技術白皮書、NVIDIA Developer Blog 中關於 GPUDirect RDMA 和 NCCL 的技術文章、《NCCL Documentation》官方文件。
- 財報與投資者關係資料:NVIDIA、AMD、Intel、Broadcom 等公司每季度釋出的 10-Q/8-K/財報電話會記錄,對業務線營收和戰略優先順序提供直接參考。
- 第三方市場研究機構:Dell’Oro Group、Crehan Research、LightCounting、Mercury Research、SemiAnalysis 釋出的資料中心網路、GPU 市場份額專業報告(通常為付費,公開摘要可見部分關鍵趨勢資料)。
- 技術大會與學術會議:NVIDIA GTC 大會 (GPU Technology Conference)、SC (Supercomputing Conference)、OCP (Open Compute Project) 全球峰會、Hot Chips 會議的相關演講與論文。
- 科技媒體與獨立分析師:The Next Platform、Serve The Home、Semianalysis(訂閱制)、AnandTech 對資料中心 GPU 和網路技術的深度拆解與評測。
- 行業基準測試平台:MLCommons(MLPerf Training/Inference 結果資料庫)、Top500(全球超算排名排行榜)。
- 公司官方公告與雲端廠商文件:Microsoft Azure、AWS、Google Cloud 關於其 GPU 例項和網路能力的公開技術文件;xAI、Meta 等公司對其 AI 叢集架構的公開說明博文。
資料時效性宣告:本頁所有帶明確年份的資料均標註來源或推算口徑。如需用於正式投資分析或學術引用,請直接溯源原始報告並對當時的市場環境進行適當還原