GPUDirect Storage 直連儲存
3秒看懂
GPUDirect Storage(GDS)是 NVIDIA 推出的一種視訊記憶體直連儲存技術。它允許 GPU 越過 CPU 與系統記憶體,通過 PCIe 匯流排直接讀寫 NVMe 固態硬碟中的資料。在 AI 大型模型訓練、高效能運算等需要頻繁搬運海量資料的場景中,該技術能夠顯著縮短資料載入耗時,是釋放 GPU 算力的關鍵“資料高速公路”之一,在 “鏈—晶片—核” 分析架構中屬於連線儲存與算力的 “鏈” 環節。
3分鐘產業解釋
在傳統的 GPU 計算流程中,儲存裝置裡的資料必須經過 “NVMe SSD → CPU 系統記憶體 → GPU 視訊記憶體” 的路徑。這一過程需要 CPU 介入資料複製與記憶體管理,不僅佔用寶貴的 CPU 週期和系統記憶體頻寬,還會在 I/O 通路上製造瓶頸,導致 GPU 在等待資料時空轉。大語言模型訓練、自動駕駛資料載入、科學模擬等任務動輒需要處理數十 TB 級別的資料,傳統路徑難以滿足極高吞吐需求。
GPUDirect Storage 通過建立一個從 NVMe SSD 直達 GPU 視訊記憶體的 PCIe 直接記憶體訪問(DMA)通道,讓 GPU 能夠直接發起並完成 I/O 操作。得益於此,資料搬運路徑被簡化為 “NVMe SSD → GPU 視訊記憶體”,極大地釋放了 CPU 負載和系統記憶體頻寬,並能將有效 I/O 頻寬提升數倍。NVIDIA 早在 2021 年就釋出官方實測資料,在典型 AI 負載中,GDS 能夠帶來最高 5 倍的頻寬效率提升(來源:NVIDIA Developer Blog,2021 年)。
從產業定位看,GPUDirect Storage 是 NVIDIA Magnum IO 套件 的組成部分,處在 AI 基礎設施層中“資料平面加速”的樞紐位置。它向上服務於 CUDA 平台上的訓練與推論架構,向下依賴於 NVMe SSD、PCIe 交換器等硬體生態,並需要作業系統、驅動以及並行檔案系統的協同配合。因此,GDS 的滲透過程本質上是 AI 資料中心從“以 CPU 為中心的 I/O”向“以 GPU 為中心的 I/O”遷移的過程,其產業影響隨著 NVIDIA 資料中心 GPU 裝機量的擴張而不斷擴大。
技術原理
GPUDirect Storage 的技術本質,是將 GPU 塑造為一個可以獨立發起 PCIe 記憶體讀寫事務的主裝置,從而繞過傳統 I/O 路徑中必須由 CPU 協調的訪存環節。
傳統路徑的瓶頸
在未啟用 GDS 的系統中,即便 GPU 通過 GPU Direct RDMA 可以直接與網絡卡互動,對本地 NVMe SSD 的訪問仍需經過 CPU。NVMe 驅動執行在主機 CPU 上,資料先經由 PCIe 寫入系統 DRAM,再由 CPU 排程、核心緩衝,最後通過 CUDA API 複製到 GPU 視訊記憶體。多方參與導致:
- CPU 核心因資料搬運而被佔用;
- 系統記憶體頻寬成為瓶頸,尤其在多 GPU 併發讀寫時;
- 延遲鏈條變長,GPU 計算單元常陷入等待。
GPUDirect Storage 的 DMA 路徑
GDS 的核心機制建立在 PCIe 對等通訊(P2P)與 DMA 引擎之上。相容的 NVIDIA GPU 內部具有多個 DMA 引擎,可在基地址暫存器(BAR)對映的地址空間內直接向 NVMe 控制器發出記憶體讀寫事務。具體流程:
- CUDA 應用程式呼叫 cuFile API(GDS 的使用者態庫),請求開啟 NVMe 上的檔案並讀取資料。
- cuFile 驅動將請求分派到核心態的 nvidia-fs 模組,該模組負責與 NVMe 驅動互動,使用 GPU BAR1 空間的記憶體地址作為 DMA 目標。
- NVMe SSD 控制器直接執行 PCIe 的 Memory Write 或 Memory Read 事務,將資料送入 GPU 視訊記憶體或從視訊記憶體讀取,完全避開系統 DRAM 和 CPU。
- 資料傳輸完成後,GPU 立即開始計算,無需額外的同步複製。
這要求硬體具備以下能力:
- GPU 支援:Volta 及後續架構(V100、A100、H100、B200 等)並配備足夠的 PCIe BAR1 空間;
- NVMe SSD:須符合 NVMe 1.2b 以上規範,且能夠正確處理任意長度分散物理區域(PRP/SGL)描述符;
- PCIe 拓撲:要求根複合體(Root Complex)支援訪問控制服務(ACS)和地址翻譯服務(ATS),以保障 DMA 安全高效;對於多 GPU 和多 NVMe 盤的互聯,PCIe 交換器需支援對等通訊;
- 系統軟體:Linux 核心 4.x 以上,且安裝 NVIDIA 驅動與 cuFile 庫,還需對某些 IOMMU 進行適當配置。
相容檔案系統與遠端儲存
初期 GDS 主要用於本地 NVMe 盤上的檔案系統(ext4、xfs 等)。自 CUDA 11.4 起,GDS 開始支援 NVMe over Fabrics(NVMe-oF),即通過 RDMA 網路將遠端 NVMe 裝置直接暴露給 GPU。2022 年後,並行檔案系統廠商如 WEKA、VAST Data、DDN 等相繼宣佈整合 GDS,使得分散式訓練也能受益於繞過 CPU 的 I/O 加速。總體上,GDS 的技術演進正在將“零複製”理念從單節點擴充套件到整個資料中心儲存平面。
關鍵引數
GDS 的效能表現高度依賴硬體組合與工作負載特性。以下梳理主要參考 NVIDIA 官方文件及 2021—2024 年公開的基準測試。
- 頻寬提升:NVIDIA 在 2021 年釋出的測試中(來源:NVIDIA Developer Blog “GPUDirect Storage Performance”),對比傳統緩衝 I/O,GDS 可帶來 2~5 倍的有效頻寬增長。在 DGX A100 系統上,8 塊 PCIe Gen4 NVMe SSD 經 GDS 可達到聚合讀取頻寬約 40 GB/s 以上。
- 延遲縮短:GDS 消除了 CPU 排程和額外的記憶體複製,在 4KB 隨機讀場景下,I/O 延遲可降低 30%~50%(來源:NVIDIA GTC 2022 演講)。對於小 IO 聚集的 AI 資料載入(如小圖片或文本片段)優勢明顯。
- GPU 架構要求:Compute Capability 7.0(Volta)及以上。但最佳體驗推薦 Ampere 或更新架構,因其擁有更寬 PCIe 通道和增強 DMA 引擎。A100 支援 PCIe Gen4,H100 支援 PCIe Gen5,理論上單 GPU 可對接多塊頂級 NVMe SSD 線性擴充套件頻寬。
- NVMe 裝置佇列:cuFile 允許為每個 GPU 同時開啟最多 256 個檔案柄,並能配置最多 64 個並行 I/O 佇列(公開資料未見具體硬上限的更新,以 NVIDIA 官方程式設計指南為準)。
- 相容性:官方維護支援列表,包括三星 PM9A3、Solidigm D7-P5520/D5-P5316、Kioxia CM6 等企業級 NVMe SSD,以及 Broadcom/Microchip PCIe 交換器。啟用 GDS 前需核對 NVMe SSD 韌體、BIOS 設定(如 PCIe ACS 控制)和 GPU 驅動版本。
- 效率開銷:GDS 佔用 GPU 部分 BAR1 空間,通常每個 NVMe 裝置佔用 128 MB BAR1 對映視窗(可調)。當同時掛載過多 NVMe 裝置時,需確保 GPU BAR1 容量(例如 A100 預設為 64 GB)不被耗盡,否則可能導致對映失敗。
技術路線
GPUDirect Storage 的技術演進可分為三個階段,體現了從單機本地加速到分散式、從專有方案到部分協同開放的路徑。
第一階段(2019—2021):本地直連驗證與釋出 2019 年 NVIDIA 首次公佈 GPUDirect Storage 概念,並在 GTC 上演示。2020 年釋出 Beta,2021 年隨 CUDA 11.4 正式面向通用市場。此階段主要解決本地 NVMe SSD 到 GPU 視訊記憶體的直接通路,確立了 cuFile API 與核心驅動架構。
第二階段(2022—2023):擴充套件至 NVMe-oF 與並行檔案系統 NVIDIA 引入對 NVMe-oF 的支援,使 GPU 可通過 RDMA 網路直接訪問遠端 NVMe 子系統的名稱空間,大幅擴充套件儲存池。同期,多家儲存 ISV 主動適配 GDS,例如 WEKA 宣佈其並行檔案系統可借 GDS 繞過 CPU 提供高頻寬,VAST Data 展示其全快閃記憶體平台通過 GDS 實現 AI 訓練檢查點寫入提速。2023 年 NVIDIA 推出 BlueField-3 DPU,為儲存解除安裝和網路直連提供更多組合可能,雖非 GDS 本身,但路線圖顯示未來 DPU 有望協助處理 GDS 中後設資料操作。
第三階段(2024 及以後):跨架構整合與 CXL 展望 2024 年 GTC 上,NVIDIA 推出的 Blackwell 架構 B200/B100 GPU 繼續內建對 GPUDirect Storage 的支援,記憶體頻寬和 PCIe 通道進一步提升。NVIDIA 官方揭露,隨著 CXL 記憶體擴充套件技術逐步落地,GDS 未來可能擴充套件至 CXL 連線的儲存,使 GPU 直接讀寫基於 CXL 的記憶體池和持久記憶體,進一步模糊記憶體與儲存界限。此外,業界也在關注是否會出現基於開放標準的 GPU 直連儲存方案,但截至 2024 年中期,尚未有其他廠商推出可匹敵 GPUDirect Storage 的完整商用方案。
上游
GPUDirect Storage 上游主要由定義標準與提供核心硬體的廠商構成。
1. GPU 計算平台 NVIDIA 是 GDS 技術絕對的源頭與標準制定者。從 Ampere 到 Hopper 乃至 Blackwell,NVIDIA 在晶片設計中預留了面向儲存直連的 DMA 引擎與 BAR 空間對映邏輯,並在 CUDA 工具包中提供 cuFile 庫。沒有 NVIDIA GPU 及其認證驅動,就無法建置 GDS 加速路徑。該技術也被整合進 NVIDIA DGX 系統、HGX 基板 等產品,形成垂直繫結的交付模式。
2. 儲存器件與控制晶片 企業級 NVMe SSD 是資料直連的出口。主要供應商包括:
- Solidigm(原英特爾 NAND 及 SSD 業務,現為 SK 海力士子公司):D7-P5520、D5-P5316 等多款產品通過 NVIDIA 認證,是眾多 AI 白牌伺服器中的核心儲存。
- 三星:PM9A3、PM1733 等系列在 NVIDIA 支援列表中,三星還提供容量點更高的 QLC NVMe SSD,適用於大容量資料湖。
- 鎧俠:CM6、CD8 系列等企業級 SSD 同樣在列,與多家伺服器廠商合作提供 GDS 驗證配置。
- 西部資料:Ultrastar DC SN840、SN650 等產品亦可通過認證實現 GDS 加速。 上述 SSD 所使用的控制器 IP 部分來源自 Marvell、Microchip 或自研,須支援 PRP/SGL 描述符列表及足夠的佇列數量。
3. PCIe 互連晶片 在節點內實現多 GPU 與多 NVMe 盤的直接對等通訊,離不開高效能 PCIe 交換器及重定時器(Retimer)。關鍵廠商包括 Broadcom(PEX89000 系列)、Microchip(Switchtec PAX 系列)等。這些交換器需支援 ACS 和 ATS 以滿足 GDS 對等通訊的安全性和地址翻譯要求。
4. 系統軟體與韌體
上游還包括提供 BIOS/韌體支援的伺服器主機板廠商(如 AME(信驊)等 BMC 廠商對 PCIe 拓撲的管理)以及 Linux 核心社群。NVIDIA 提交的 nvidia-fs 核心模組依賴核心 DMA 對映和 PCIe 子系統,Linux 發行版(Ubuntu、RHEL)的版本緊隨程度直接影響企業使用者的部署難度。
下游
下游涵蓋整合伺服器與儲存系統的原廠、雲端服務商以及最終使用該技術的企業與機構。
1. 伺服器與整合商 Supermicro、Dell Technologies、HPE、Lenovo、浪潮資訊、寧暢 等眾多伺服器廠商均已在其 AI 訓練/推論平台中驗證並推薦使用 GPUDirect Storage。例如 Supermicro 的 GPU 超級工作站和 8U GPU 伺服器常預設 PCIe 拓撲以完美匹配 GDS;浪潮資訊 NF5688M6 等機型提供支援 GDS 的 NVMe 前置擴充套件配置。這些整合商將上游硬體組裝為經過 NVIDIA 認證的企業級系統,並承擔散熱、供電、PCIe 訊號完整性等工程挑戰。
2. 雲端服務商 全球主要公有雲端廠商在其高階 GPU 例項中提供 GDS 能力:
- AWS:P4d/P4de(基於 A100)、即將推出的 P5(基於 H100)例項均允許使用者在掛載的本地 NVMe 或 EBS io2 Block Express 間接體驗高速儲存,但 GDS 目前主要作用於本地 NVMe 例項儲存。
- Microsoft Azure:NDv2、NDm A100 v4 等系列支援 GDS 加速本地 NVMe,適用於大規模分散式訓練。
- Google Cloud:A2 例項配備本地 NVMe SSD,GDS 被 AI 平台和 Vertex AI 工作負載間接利用。
- 阿里雲端、騰訊雲端等:在面向大型模型訓練的 GPU 叢集和智算平台中提供支援 GDS 的節點,客戶可通過 PAI 或 TI-ONE 等平台使用。
3. 終端使用者
- AI 實驗室與大型模型企業:OpenAI、Meta、Anthropic、Google DeepMind 及中國的百度、字節跳動、Moonshot 等,在其萬卡叢集中通過 GDS 加速資料載入,提升模型訓練效率。
- 自動駕駛:Waymo、Cruise、小鵬、蔚來等企業需要從路採資料流水線上載入數 PB 級影片和 Lidar 資料到 GPU 進行感知模型訓練,GDS 對這類 IO 密集型流水線效率提升顯著。
- 生命科學與製藥:冷凍電鏡資料處理、分子動力學模擬和 AlphaFold 類應用需高速載入大量中間檔案,GDS 可縮短整體研究週期。
- 氣象與能源:歐洲中期天氣預報中心(ECMWF)、美國國家可再生能源實驗室等採用 GPU 叢集進行高解析度模擬,GDS 成為資料供給的標配選項。
受益公司
GPUDirect Storage 的滲透直接拉動相關廠商的營收,但絕大多數公司在公開財報中並未單獨揭露 GDS 帶來的營收貢獻,因此以下分析基於產業鏈邏輯與公開宣告。
- NVIDIA:作為 GDS 技術的所有權方,它通過深度繫結 CUDA 生態和技術鎖定,進一步鞏固了在 AI 訓練基礎設施市場的領導地位,並間接推高了 DGX 系統和高階 GPU 的溢價能力。NVIDIA 2024 財年資料中心業務營收達 475.3 億美元(NVIDIA 年報,截至 2024 年 1 月 28 日),GDS 作為平台關鍵功能,是其“軟硬一體”護城河的一部分。
- 儲存原廠:AI 伺服器大規模採購 NVMe SSD,且對認證型號有明顯偏好,這使得進入 NVIDIA 相容列表的 SSD(如 Solidigm D7 系列、三星 PM9A3 等)在分割槽市場中享有溢價。Solidigm 在多篇新聞稿中指出,其與 NVIDIA 的合作正在推動 AI 儲存從 SATA/SAS 向 NVMe 的換代。
- 伺服器 ODM/OEM:Supermicro、Dell、浪潮資訊等由於提供預先驗證的 GDS 配置,得以提升高階 AI 伺服器份額。以 Supermicro 為例,其 2024 財年(截至 2024 年 6 月)營收年增率大幅增長,部分原因即來自搭載 NVIDIA GPU 和高速 NVMe 的 AI 系統熱銷(來源:Supermicro 財務報告)。
- 並行檔案系統與儲存軟體廠商:WEKA、VAST Data、DDN 等公司因為率先整合 GDS,在 AI 儲存賽道上獲得了差異化競爭力。例如 VAST Data 在 2023 年公開表示其平台藉助 GDS 實現了領先的模型載入與檢查點效能,並藉此贏得多個超大規模 AI 客戶。
- 雲端服務商:通過提供支援 GDS 的 GPU 例項,CSP 能夠以更高單價銷售高階計算服務,並提高客戶粘性,間接提升雲端運算營收。
需注意,上述公司的受益程度直接取決於 NVIDIA 高階 GPU 的出貨節奏及 AI 投資景氣度,而非 GDS 單一變數。
市場規模
公開資料未見專注於 GPUDirect Storage 的獨立市場規模統計。 該技術屬於 NVIDIA GPU 平台的內嵌特性,其商業價值隱含在 AI 基礎設施的多個細分市場中。
可參照的關聯市場資料(口徑對齊至 2023—2024 財年):
- NVIDIA 資料中心業務:2024 財年營收 475.3 億美元,年增率大幅增長。該營收主要涵蓋 GPU、DPU 及相關軟體許可,GDS 是提升方案競爭力的組成部分(來源:NVIDIA 10-K 年報)。
- 企業級 NVMe SSD 市場:根據 TrendForce 及 IDC 資料,2023 年全球企業級 SSD 市場中 NVMe 佔比已超 75%,AI 伺服器對高容量、高效能 NVMe SSD 的需求成為關鍵驅動。但具體由 GDS 拉動的增量規模未被量化。
- AI 伺服器系統市場:據 IDC 2024 年初報告,2023 年全球 AI 伺服器市場支出超過 250 億美元(具體數值請參閱 IDC Worldwide Quarterly Server Tracker,此處為近似區間)。凡是搭載 NVIDIA A100/H100 且配置本地 NVMe 的 AI 伺服器,幾乎均與 GDS 相容,意味著潛在適用面極廣。
由於缺乏獨立統計,市場觀察者通常把 GDS 視為 AI 基礎設施加速的一種“隱形滲透”,其成長性與 NVIDIA 資料中心 GPU 出貨量和企業級 NVMe 儲存的更新迭代高度聯動。
玩家對比
當前市場上並不存在與 GPUDirect Storage 完全對等的第三方商業方案,但可比較幾種不同的 GPU 資料供給路徑。
| 方案 | 代表實現 | 資料路徑 | 效能特徵 | 生態與開放性 |
|---|---|---|---|---|
| GPUDirect Storage | NVIDIA + 認證 NVMe SSD + cuFile | NVMe SSD → GPU 視訊記憶體 | 極低 CPU 負載;延遲低;高度依賴 PCIe 拓撲 | 閉源,只限 NVIDIA GPU |
| 傳統 CPU 緩衝 I/O | 通用 Linux,通過記憶體複製 | NVMe SSD → 系統記憶體 → GPU 視訊記憶體 | CPU 介入多,佔用記憶體頻寬;延遲較高 | 開放,所有 GPU 通用 |
| GPU Direct RDMA(網絡卡) | NVIDIA + InfiniBand/RoCE | 遠端 GPU 視訊記憶體/儲存 → GPU 視訊記憶體,繞過 CPU | 主要用於節點間通訊,非本地 SSD 直連 | 需 NVIDIA 網絡卡,與 GDS 互補 |
| AMD DirectGMA / ROCm | AMD GPU + 對等 PCIe 裝置 | 理論上可對映外設記憶體到 GPU,但未形成完整儲存直連方案 | 實際適用於影片採集、FPGA 直連,對 NVMe SSD 直連支援極為有限 | 生態碎片化,儲存加速未形成氣候 |
| Intel GPU 方案 | Intel Data Center GPU Max + 軟體棧 | 截至 2024 年中,尚未釋出對等 GDS 的儲存直連方案,仍走傳統路徑 | 依賴 CPU,對 IO 密集場景有提升需求 | 開放標準,但儲存直連空白 |
| DPU/計算儲存解除安裝 | NVIDIA BlueField / NGD Systems 等計算型 SSD | 儲存端處理部分邏輯,但資料流入 GPU 仍需經過網絡卡/DPU 和 PCIe | 可減少行動數據量,但與 GDS 方向不同 | 多種標準有待統一 |
上表可見,GPUDirect Storage 在 GPU 直連本地或 NVMe-oF 儲存的細分領域幾乎沒有直接競品,因此它實質上成為 AI 訓練基礎設施中的“唯一選項”。這種格局雖保障了使用者體驗的一致性,也引發了社群關於技術壟斷的討論。
風險
1. 技術鎖定與供應商依賴 GDS 是 NVIDIA 私有生態的延伸,應用一旦深度繫結 cuFile API,便很難遷移到其他 GPU 平台。在各國愈發重視科技自主可控的背景下,這種鎖定可能使資料中心面臨供應鏈風險,尤其是在 GPU 出口管制收緊時(參考美國 2022—2023 年出口控制規則)。
2. 生態碎片化與標準缺位 NVMe、PCIe、CXL 等底層標準本身是開放的,但如何將其整合為“GPU 直連儲存”並沒有跨廠商的行業標準。一旦 AMD 或 Intel 推出各自不同的直連方案,ISV 和儲存廠商需適配多套介面,增加了生態成本。
3. 成本集中與部署複雜性 支援 GDS 需要整套平台認證,包括特定廠商的 NVMe SSD、相容的 PCIe 交換器和精心設計的拓撲。在超大規模部署中,散熱、電源和訊號完整性要求急劇上升,且維護人員需要額外技能,整體 TCO 可能被推高。
4. 應用侷限性 GDS 對隨機小 IO 密集、完全不可快取的流式讀取最為有效。對於計算密集且資料集可完全放入系統記憶體快取的模型(例如某些小規模微調),GDS 帶來的加速並不明顯。同時,很多企業依賴的網路附加儲存(NAS)或分散式檔案系統需要上層快取層配合,否則 GDS 難以直接加速。
5. 安全與隔離 允許 GPU 直接向 NVMe 發起 DMA 請求,實際上開闢了一條繞過 CPU 和 IOMMU 嚴格監管的路徑。雖然 NVIDIA 和 Linux 社群加入了必要的訪問控制,但在多租戶雲端環境中,仍存在可能的側通道或 DMA 攻擊面,這是安全審計中需要持續關注的風險。
誤讀糾偏
誤解 1:“開啟 GDS 後所有儲存訪問都變快。” GDS 僅對通過 cuFile 進行本地 NVMe(或 NVMe-oF)的讀寫起效。普通的檔案系統 API 呼叫、網路檔案系統掛載(如 NFS),除非檔案系統廠商主動適配,否則不會自動獲得加速。
誤解 2:“GDS 就是 GPU Direct RDMA 的另一個名字。” 兩者完全不同。GPUDirect RDMA 主要用於 GPU 與網絡卡(以及遠端 GPU)的直接資料交換,而 GPUDirect Storage 特指 GPU 與儲存裝置(SSD)的直接通訊。兩者可以共存,但解決的是不同鏈路的問題。
誤解 3:“只要有 NVMe SSD 和 NVIDIA GPU,GDS 就直接能用。” 硬體需滿足相容性認證,且要求 BIOS 關閉 ACS 或配置合適的 ACS 策略,Linux 核心引數需要調整,NVMe SSD 驅動和韌體也必須符合規範。此外,應用必須顯式呼叫 cuFile 或依賴整合 GDS 的第三方庫(如 TensorFlow 的某些自定義資料載入器),而不是自動替換所有 I/O。
誤解 4:“GDS 消除了大記憶體的需求。” 雖然 GDS