网络层 开放阅读

RDMA

Remote Direct Memory Access

概念 ID
remote-direct-memory-access
更新时间
2026-05-29
来源数量
待补

RDMA

3 秒看懂

RDMA(远程直接内存访问)是一种让一台机器直接读写另一台机器内存的网络技术,全程不劳烦远端 CPU 和操作系统。它把“内存到内存”的搬运效率拉满,延迟压到微秒级、带宽跑满线速,因此被 AI 训练集群、高性能计算和分布式存储当作标配。

3 分钟产业解释

在传统 TCP/IP 通信里,数据必须反复在内核与用户空间之间拷贝,还要经过多次上下文切换,CPU 被大量无意义的搬运工作消耗,延迟居高不下。
RDMA 的设计哲学是把通信动作一分为二:低频建连走内核,高频收发走用户态。应用一旦注册好内存区域并建立队列,后续直接由网卡(支持 RDMA 的 NIC,一般叫 RNIC)用硬件 DMA 从用户缓存把数据打包发出;远端网卡收到后也由硬件直接把有效载荷写入目标用户缓存,完全跳过远端 CPU 和 OS 协议栈。整条通路“零拷贝 + 内核旁路 + 远程直接内存访问”三位一体。

产业背景上,AI/ML 大模型训练是 RDMA 最大的需求放大器。千卡、万卡集群在参数同步(如梯度 AllReduce)时,通信哪怕慢几毫秒都会让昂贵的 GPU 空转。RDMA 的可预测微秒级延迟和极高吞吐,使得分布式训练的加速比能够逼近理想线性。随着数据中心从 CPU 中心转向 DPU/IPU 加速架构,RDMA 更是成为分布式内存池化、存算分离的底层支柱。

从技术栈看,RDMA 不是单一协议,而是一类“语义”的具体实现:InfiniBand(从物理层到传输层自成一体,极致性能)和 RoCE(RDMA over Converged Ethernet,利用增强以太网承载 RDMA,兼容现有数据中心网络)是两大主流。无论哪种,都在把网络从“外围 IO”转变为“近内存通路”,重新定义服务器的边界。

15 分钟专家深入

RDMA 正在重塑数据中心通信的范式,其影响远超简单的低延迟,它改变了分布式系统的内存建模与一致性设计。深入理解需要抓住三个层次:

1. 编程模型与内存语义
RDMA 的 Verbs API 提供两种传输语义:通道语义(Send/Receive)和内存语义(RDMA Read/Write/Atomic)。通道语义需要接收端预先 Post Receive Buffer,类似传统的两端协商;而内存语义允许发送端在仅持有远端虚拟地址和密钥的情况下,直接、单边地对远端内存进行读写或原子操作,远端 CPU 完全不知情。这为分布式共享内存、RPC 返回路径优化、NVMe-oF 存儲卸载等提供了极致效率。
但基线 RDMA 采用 弱内存模型(指内存操作的可见性可能乱序),程序必须自行处理乱序和可见性问题。近年来,学术界已提出并形式化了 RDMA^\text{TSO} 语义,试图在总存储定序(TSO)CPU 上精确描述 RDMA 的同步行为,为可验证的正确实现奠定基础。

2. 队列与硬件流水线
所有 RDMA 操作围绕队列对(Queue Pair, QP)展开,每个 QP 包含发送队列和接收队列。完成队列(CQ)是独立的对象,一个 QP 可以关联一个或多个 CQ。上层软件发起 Work Request(WR)投递到 QP,RNIC 通过 PCIe 总线拉取数据,按照传输层协议封装,注入网络。远端 RNIC 根据连接上下文找到目标内存的翻译表(重映射虚拟地址到物理页),DMA 写入,然后产生完成通知(CQE)告知接收方。
这种完全异步的流水线保证了数据面无内核开销,且能与 GPU 通过 GPUDirect RDMA 直接互访显存,进一步消除 CPU 中转。

3. 拥塞控制与无损网络
RDMA 对丢包极度敏感(一旦丢包触发重传,相关 QP 的状态机回退会放大延迟)。为此,承载 RDMA 的网络必须是无损或近似无损的。InfiniBand 天然提供基于信用(Credit)的链路流控;RoCE 则依赖 PFC(优先级流控)和 ECN 等 DCB 特性。大规模部署时,如何平衡 PFC 死锁避免、ECN 标记阈值与端到端拥塞控制算法(如 DCQCN)是一项复杂的系统工程。

技术原理(最深,讲机制 + 关键参数)

RDMA 最核心的机制可以抽象为“控制平面托管,数据平面卸载”,其一次典型的 Send/Receive 操作完整流程如下(以异步模型为例):

[发送端应用]                          [接收端应用]
  |                                     ^
  | (1) 控制通路: 在内核态创建 MR、     | (7) 数据通路: 轮询 CQ 得到完成通知,
  |     QP、CQ 等资源,注册内存区       |     数据已在目标用户缓存就绪
  v                                     |
[发送端用户缓存] <- 已注册              |
  |                                     |
  | (2) 数据通路-发起: 应用构造 WR      |
  |     (含源地址、长度、目标) 投递到 QP|
  v                                     |
[发送端 RNIC]                           |
  | (3) 硬件 DMA 从用户缓存取数据       |
  |     打包为 RDMA 传输层报文           |
  | (4) 网络注入 (InfiniBand / RoCE)    |
  |                                     v
  |                         [接收端 RNIC]
  |                           | (5) 解包,验证密钥,
  |                           |     查询内存翻译表
  |                           v
  |                 [接收端已注册内存区] (6) 硬件 DMA 直接写入,不通知 CPU

关键参数与性能边界(综合文献定性描述,未列出具体数值时来自一般共识):

  • 延迟:通常能稳定在 1~3 微秒 附近(单边操作),相比于传统 TCP 的 20~50 微秒下降一个数量级。该指标高度依赖于网卡 ASIC 流水线深度和物理层串行器/解串器速率。
  • 带宽:主流 RNIC 已支持 200 Gb/s(每端口),多端口、链路聚合可线性扩展,实测线速利用率可达 95% 以上。RDMA 的零拷贝避免了内存带宽挤占 CPU cache,因此即使在全线速下,服务器剩余 CPU 算力几乎不受影响。
  • 消息速率:在小包 (e.g. 8~64 B) 场景下,可达到 数千万次 IOPS,相比内核 TCP 协议栈有百倍提升,这得益于硬件直接把 Work Request 转换为线缆比特流。
  • CPU 占用:通信期间数据面 CPU 占用接近 0 (仅用于初始化与完成通知处理),在 AllReduce 类集合通信中,可将 CPU 完全释放给应用计算。

安全方面需注意:RDMA 的远程直接写入意味着 RNIC 需要有远端内存凭证。安全机制依赖 内存注册密钥 (R_Key) 的保护,无论 InfiniBand 还是 RoCE,都会对每个访问请求进行密钥校验。但大规模多租户环境下,密钥管理与隔离是实践中的脆弱点,需要通过 I/O 虚拟化 (SR‑IOV) 或软件层内存保护域严格限定。

技术演进史

RDMA 的概念诞生于高性能计算对带宽和延迟的无止境追求:

  • 2000 年代初:InfiniBand 架构 (IBA) 问世,从链路层到传输层全新设计,原生支持 RDMA。最初用于 HPC Top500 集群,后逐步渗透到数据库一体机。
  • 2010 年前后:以太网生态不甘落后,推出 RoCE v1,将 InfiniBand 传输层封装在以太网链路层,但仅限同一 VLAN(无 IP 路由)。随后 RoCE v2 使用 UDP/IP 封装,实现三层路由,使 RDMA 可运行在融合以太网上。同期 iWARP 试图在 TCP 之上实现 RDMA 语义,但因重传逻辑复杂而发展缓慢。
  • 2015‑2020:随着 NVMe‑oF 和分布式内存缓存兴起,RDMA 成为数据中心存量升级的关键技术,Mellanox(后被 NVIDIA 收购)的 InfiniBand 与 RoCE 网卡双线作战,推动 100G → 200G → 400G 速率跃迁。
  • 2020‑2025:AI 大模型训练促成了 RDMA over Converged Ethernet (RoCE) 的大规模验证,与 InfiniBand 一起构成“两条腿走路”格局。学术界开始关注 RDMA 弱内存模型的软件安全性,出现形式化验证的 RDMA 同步原语库,标志着从“能用”走向“可靠”。

技术路线对比(量化表)

对比对象:InfiniBand vs RoCE v2 vs 传统 TCP/IP 网络。评价维度以定性 + 趋势符号展示(“▲” 最优,“▽” 次之,“▼” 较差),具体数值因硬件代际而异,此处采用行业通用评级。

指标InfiniBandRoCE v2传统 TCP/IP
网络基础专用 IB 交换机和线缆标准数据中心以太网交换机 (需 DCB)通用以太网,无特殊硬件需求
延迟 (定性)▲▲▲ 极低 (微秒级,链路层流控)▲▲ 低 (微秒级,需 PFC 配合)▼ 高 (数十微秒,内核协议栈开销)
带宽利用率▲▲▲ 接近线速,无拥塞丢包▲▲ 高,但需精心调优无损网络▼ 中等,CPU 成为瓶颈
CPU 卸载全卸载 (数据面零 CPU)全卸载 (数据面零 CPU)无,CPU 需处理协议栈
路由与扩展支持 (IB 子网管理器)支持 (UDP/IP 路由)生态最成熟,大规模路由
兼容性需专用网卡和交换机,成本高需具 RoCE 功能的以太网网卡所有服务器标配
拥塞控制显式信用流控 + 自适应路由PFC + ECN + DCQCN,配置复杂TCP 流控,但延迟不可控
生态成熟度HPC 和 AI 训练集群的黄金标准云数据中心与通用企业快速追赶存量最大,无需改造

:iWARP 作为另一种 RDMA 实现,因重传效率与 CPU 开销偏高,当前在主流 AI 数据中心部署较少,故不列入主对比。

上下游

上游 — 核心硬件与 IP

  • RDMA 网卡芯片:高速 SerDes、RDMA 协议解析引擎、PCIe 控制器和内存翻译单元(MTT)集成于单芯片。相关工艺节点跟随以太网 PHY 演进。
  • 高速交换机:InfiniBand 交换机具备极低端口延迟和集中管理;RoCE 则依赖主流芯片厂商的数据中心交换机 ASIC,需要支持 PFC、ECN 等增强功能。
  • 光纤/铜缆互联:有源光缆 (AOC) 与直连铜缆 (DAC) 为 RDMA 提供物理通道,400G/800G 收发器是速率升级的基石。

下游 — 消耗场景

  • AI 训练/推理集群:免 RDMA 不训大模型。GPU 间 AllReduce、All‑to‑All 消息、梯度同步等都强依赖 RDMA。
  • 高性能存储:NVMe‑oF 前端,将远程 NVMe 盘虚拟为本地设备,利用 RDMA 降低读写延迟。
  • 内存池化:CXL 等新技术在系统内做缓存一致,RDMA 则负责跨节点内存池访问,实现内存分离式架构。
  • 金融极值交易与实时分析:微秒级行情推送、分布式事务提交。

关键指标

在评估 RDMA 方案时,工程团队与产业研究人员通常会比较以下维度:

  1. 单边延迟与尾延迟:P99 或 P999 延迟是否因重传而暴涨。需要无损网络保证尾延迟不翘。
  2. 消息速率(Million Messages Per Second, MMPS):小包场景下硬件能否装满 PCIe 带宽。
  3. 每瓦特有效带宽:在功率约束下(如 OCP 机架供电),RDMA 结合高能效网卡能推动算力密度提升。
  4. 规模化稳定性:千卡/万卡集群运行时,QP 连接数爆炸(N 个节点需 O(N²) 连接),RDMA 软件栈的 QP 缓存和连接资源管理决定系统是否可扩展。
  5. CPU 节省量:用“每传输 1Gbps 所占用的 CPU 核数”衡量,RDMA 此值趋于零;传统 TCP 可达 1~2 核/Gbps。

供需与市场数据

从产业调研和供应链交叉验证看(未涉具体份额数字)[行业观察/未充分披露]:

  • 需求侧:随着大模型参数迈向万亿级,训练集群从千卡迈向万卡,内部网络(backend fabric)对 400G RDMA 端口的采购量同比增长极快。据主要云厂商基础设施披露,AI 后端网络已实现 100% 采用 RDMA(InfiniBand 或 RoCE)。
  • 供给侧:新一代 800G RDMA NIC 的样品已进入超大规模数据中心测试,采用更高密度 SerDes 和先进封装,预计量产后将进一步降低每比特成本。
  • 市场结构:InfiniBand 因其成熟度和“开箱即用”的无损网络,在头部 AI 训练集群中仍牢牢占据份额;RoCE 凭借以太网统一管理、易于与公有云虚拟化深度结合的优势,在后发推理集群和通用 HPC 中快速渗透。整体市场保持双位数年复合增长。

代表公司与资本映射

相关产业阵营在知识产权、芯片及系统层面竞争,以下均为公开信息的业界格局描述(不构成投资建议):

  • InfiniBand 生态的主导芯片/网卡厂商:在 HPC 和顶级 AI 集群中占据无可争议的地位,其网卡与交换机形成高度优化的垂直整合。该厂商通过持续收编技术团队和加速路线图打造护城河。
  • RoCE 网卡与交换机芯片创新者:高性能以太网 NIC 厂商通过引入可编程数据面引擎、DPU 集成,将 RDMA 作为必选项,提供近似 InfiniBand 的延迟体验,同时兼容大规模云租户网络。以太网交换机芯片巨头则不断优化 PFC/ECN 行为,降低 RoCE 部署门槛。
  • 云服务商自研网卡:部分头部云厂商已开始设计自研智能网卡,内置 RDMA 逻辑和轻量拥塞控制,以便在自有数据中心中消除第三方依赖并优化成本。
  • 软件/开源生态企业:提供 RDMA 编程库(如 libfabric、UCX)、可验证异步模型工具的公司,正从安全性与易用性角度推动 RDMA 落地。

投资逻辑

  1. AI 资本开支的“卖铲人”:无论谁做大模型,都要为每块 GPU 搭配高速互连。RDMA 网卡和交换机与 GPU 的比率大致保持稳定,AI 资本开支持续增大直接拉动 RDMA 出货。
  2. 速率升级红利:网络架构从 200G 向 400G/800G 迭代,每一代速率跃升都带来市场空间的量价齐升,网卡与交换机物料价值提升。
  3. 生态锁定下的护城河:InfiniBand 因其独特协议栈和高昂迁移成本,形成强烈的供应链惯性;RoCE 阵营则依赖以太网庞大的存量基础设施,加速替代传统 TCP。
  4. 关注无损网络解决方案提供商:RDMA 性能的兑现很大程度取决于拥塞控制算法、智能交换机软件和运维工具,能够提供端到端调优方案的厂商拥有溢价。
  5. 风险点:RoCE 的大规模无丢包运维仍是工程挑战,如果出现大面积 PFC 风暴引发的性能灾难,可能促使部分客户回流到 InfiniBand 或转向新互连技术。

常见误读纠偏(≥2)

误读 1:“RDMA 就是一种具体协议。”
纠偏:RDMA 是一种语义/能力,不是单一协议。InfiniBand、RoCE、iWARP 都实现了 RDMA 语义,后两者甚至可以在同一块网卡通过不同固件模式切换。投资者看到“某公司支持 RDMA”需细问是哪种实现、是否有无损网络配套。

误读 2:“RDMA 完全不用 CPU,所以节省成本。”
纠偏:只在数据通路上 CPU 不参与拷贝;控制通路仍需 CPU 发起连接、注册内存、处理完成事件。大规模集群中,连接管理的 CPU 开销、内存注册/销毁的耗时反而可能成为启动延迟瓶颈,需要软件架构精心优化。另外,“全卸载”网卡 ASIC 内含嵌入式处理器,其成本并未消失,只是迁移到了网卡。

误读 3:“RoCE 和 InfiniBand 性能差不多,选便宜的就行。”
纠偏:在理想的无损以太网环境下,RoCE v2 延迟可以接近 InfiniBand,但大规模生产网络中,每增加一跳交换机,尾延迟、死锁风险均显著放大。InfiniBand 的自适应路由和集中式管理能对拓扑不敏感,而 RoCE 的 PFC 可能引发级联 HOL 阻塞。部署规模越大,维护无损网络的人力成本越不能忽视,部分大型 AI 企业选择 InfiniBand 其实是在买“运维稳定性”。

学习路径

  1. 基础回顾:理解传统 TCP/IP 协议栈的上下文切换与拷贝开销,以及现代操作系统旁路技术(DPDK、SPDK)的演进脉络。
  2. 核心概念:阅读 RDMA 权威论文和社区文档,掌握 MR、QP、CQ、PD 等对象,亲手运行 perftestib_write_bw 等工具感受延迟。
  3. 协议深入:研究 InfiniBand Transport Layer specification 及 RoCEv2 封包格式,分析为什么 UDP 源端口用于等价多路径(ECMP)分流。
  4. 实战项目:在 Linux 上配置 Soft-RoCE(rxe 驱动)模拟环境,编写一个单边 RDMA Read/Write 程序,理解内存注册与远程密钥管理。
  5. 前沿方向:研读 RDMA 弱内存模型的形式化工作(如 RDMA^\text&#123;TSO&#125;),学习基于 RDMA 的分布式事务与持久内存系统构建,以及 GPUDirect RDMA 的大模型训练通信库(如 NCCL)实现。

一句话总结

RDMA 通过完全卸载数据路径到网卡硬件,实现了内核旁路、零拷贝与远程直接内存访问,将网络通信变为“内存语义”的延伸,这是 AI 时代万卡集群数据流动的物理定律。

延伸阅读与来源

  • Ambal G, et al. A Verified High-Performance Composable Object Library for Remote Direct Memory Access (Extended Version). arXiv:2510.10531.
  • Ambal G, et al. Specifying and Verifying RDMA Synchronisation. Preprint, 2025.
  • SPOTO 网络课堂. 远程直接内存访问(RDMA)_超全学习笔记. 思博网络, 2026.
  • CSDN 博客. RDMA 技术深度解析:从原理到实践. 2025.
  • 华为鲲鹏昇腾开发者社区. RDMA:一项颠覆性的网络技术. 2025.
  • 博客园 stardsd. RDMA 和 RoCE 背景介绍. 2025.
  • NVIDIA Networking 白皮书 (RoCE 与 InfiniBand 技术对比). [公开厂商资料].
  • Linux Kernel RDMA 子系统文档 (rdma-core, libfabric).
source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型