网络层 开放阅读

RoCEv2

RDMA over Converged Ethernet v2

概念 ID
rdma-over-converged-ethernet-v2
更新时间
2026-05-29
来源数量
待补

RoCEv2

1. 摘要:3 秒看懂 RoCEv2

RoCEv2(RDMA over Converged Ethernet version 2)是当前高性能计算(HPC)与人工智能(AI)训练集群中事实上的默认通信协议。其本质是通过在标准以太网/IP 网络上封装 InfiniBand 传输层,将远程直接内存访问(RDMA)能力无损地引入现有数据中心生态。该协议允许服务器网卡在硬件级别直接从远端主机内存读取或写入数据,完全绕过本机操作系统内核,实现微秒级端到端延迟(典型值 1-3 微秒)与几乎零 CPU 占用的数据搬运。对最终用户而言,RoCEv2 意味着可以用通用的以太网交换机与线缆构建 GPU 集群,同时获得与专用 InfiniBand 网络相当的通信性能,从根本上解决了大规模分布式系统的“通信墙”问题。

2. 产业背景:摩尔定律下的“通信税”与网络瓶颈

随着单芯片算力按摩尔定律持续攀升,分布式计算成为突破单点性能极限的唯一出路。然而,传统 TCP/IP 协议栈在这一进程中日渐成为瓶颈。以 100Gbps 网络为例,标准 Linux 内核网络栈处理一个完整的数据包穿越需要经历应用缓冲区、套接字缓冲区、内核协议栈、驱动队列和网卡 FIFO 等诸多环节,并伴随频繁的用户态与内核态切换。根据一线云厂商在 2023 年的公开技术分享,在 100Gbps 满负荷流量的情况下,处理 TCP 协议栈可消耗约 30-50% 的 CPU 核心资源(Intel Xeon Scalable 平台测试值)。这笔“通信税”直接侵蚀了本该用于业务逻辑或梯度计算的算力,并导致有效端到端时延高达数十甚至上百微秒,对于要求毫秒级屏障同步的分布式 AI 训练而言,成为致命短板。

与此同时,随着 GPU 从几卡扩展到千卡、万卡级,通信模型从早期的参数服务器进化为全规约(All-Reduce)与 All-to-All 集合通信。在这种模式下,每轮迭代中所有节点都要同时参与数据交换,任一节点的网络抖动都会造成全局等待(长尾效应)。因此,网络不仅需要高带宽,更需要可预测的超低延迟无丢包的稳定传输。这直接催生了将 HPC 领域的 RDMA 技术搬上以太网的巨大需求,而 RoCEv2 正好填补了这一空白,并迅速在 2020-2024 年间成为 AI 基础设施的标配网络(据 Crehan Research 的数据,2023 年 RDMA 以太网适配器端口出货量已超过 InfiniBand)。

3. RoCEv2 的核心定义与价值主张

RoCEv2 由 InfiniBand 贸易协会(IBTA)在 2014 年发布的 Annex A17 中正式定义。它将 InfiniBand 的传输层(Transport Layer)封装在 UDP/IP 数据包中,使用标准以太网链路层和 IP 网络层来进行路由。UDP 目的端口固定为 4791,以此标识 RoCEv2 流量。与第一代 RoCE(基于以太网链路层直接封装 IB 传输层,无法跨子网)相比,v2 版本通过 IP 头部实现了路由能力,从而能够无缝运行在已有的三层数据中心网络之上,支持跨网段、跨机架甚至跨数据中心的 RDMA 通信。

其核心价值可归纳为四点:

  1. 极致的性能:通过硬件卸载和内核旁路,实现 1-3 μs 的单向时延和接近线速的吞吐,CPU 占用率近乎为零。
  2. 成熟的生态:继承了以太网完善的交换芯片、光纤、线缆和运维体系,采购成本仅为同等带宽 InfiniBand 的 1/2 至 2/3(产业调研,2024)。
  3. 开放的标准:协议公开、多厂商支持,用户不会被锁定在单一供应商的专有技术栈中。
  4. 平滑的演进:可在现有数据中心网络上逐步引入,无需“推倒重来”,只需更换支持 RoCEv2 的网卡(RNIC)或升级交换机即可逐步部署。

因此,RoCEv2 被广泛视为 SaaS 化高性能计算和 AI 训练集群的理想网络底座,兼具性能与通用性。

4. 技术原理:协议封装与 RDMA 操作语义

从报文封装结构来看,RoCEv2 巧妙地利用了现有网络协议的分层模型:

+---------------------------+
|      Ethernet Header      |  (标准 L2 帧头,包含 MAC 地址、VLAN 标签)
+---------------------------+
|        IP Header          |  (标准 L3 包头,实现子网间路由)
+---------------------------+
|        UDP Header         |  (目的端口 4791,源端口动态分配)
+---------------------------+
| InfiniBand Transport Base |  (IB 传输层头部,承载 RDMA 操作码)
+---------------------------+
|         Payload           |  (应用数据,如梯度张量、存储块)

在 RDMA 传输语义上,RNIC 卡直接实现物理地址与虚拟地址的转换,并提供以下核心操作:

  • SEND / RECV:类似消息传递,接收方必须预先准备好接收缓冲区。
  • RDMA WRITE / READ:一方可直接向远端内存写入或读取数据,远端 CPU 完全无感知,是实现零拷贝的关键。
  • ATOMIC:支持原子性的远端内存比较与交换、抓取并加等操作,适用于分布式锁和计数。

一次典型的 RDMA 写入过程为:发送方应用将数据缓冲区内存注册(Memory Registration)后得到本地密钥和远端密钥,然后将读写请求提交给 RNIC 的工作队列(Queue Pair,QP)。网卡硬件直接经由 PCIe 总线读取数据,在芯片内部完成 IB 传输层封装、UDP/IP 封装和以太网帧封装后发出。接收方 RNIC 解析各层头部后,根据 QP 上下文和内存密钥,直接通过 PCIe 将数据写入目标物理内存,然后生成完成队列事件(Completion Queue,CQ)通知应用程序。整个数据通路不涉及一次内存拷贝,也不用陷入内核,这便是 RoCEv2 能够达到极低延迟的微观机制。

5. 无损网络关键技术:PFC 与 ECN

RDMA 协议原本设计在物理层无丢失的 InfiniBand 链路上运行,对丢包极度敏感。一旦发生丢包,发送方需要依赖上层重传机制(如 Go-Back-N),延迟将陡增至数十微秒甚至毫秒级别,极大破坏性能。因此,RoCEv2 必须运行于“无损以太网”之上,而这依赖两个关键的网络流控技术:

优先级流控(Priority Flow Control,PFC) (IEEE 802.1Qbb 标准):
PFC 允许对以太网链路上的不同流量类别(8 个优先级队列)独立施加暂停帧。典型部署中,RoCEv2 流量被置为优先级 3 或 5,并启用 PFC。当交换机端口队列缓冲区水位超过预设阈值(例如,填充至 128 KB),该交换机便向对端发送暂停帧,要求其停止发送该类流量一段极短时间(量化单位 pause quantum)。这种逐跳反压机制杜绝了缓冲区溢出导致的丢包。然而,PFC 是一把双刃剑,不合理的配置会引发头部阻塞(Head-of-Line Blocking)甚至死锁,因此精确的缓冲区管理和阈值调优至关重要。

显式拥塞通知(Explicit Congestion Notification,ECN) (根据 RFC 3168 扩展):
ECN 在 IP 头部中标记拥塞经历位,使交换机在数据包通过时就能标记拥塞状态,而不需要等到丢包。RoCEv2 使用 ECN 来支持基于速率的拥塞控制算法(DCQCN)。当接收方发现 IP 头部 ECN 标志被置位,会生成显式拥塞通知报文(Congestion Notification Packet,CNP)发回发送方。发送方 RNIC 收到 CNP 后,快速降低注入速率(类似 TCP 的乘性减),然后逐步恢复(加性增),从而在拥塞发生伊始就进行主动调节,避免触发 PFC。这套 DCQCN 算法最早由微软与 Mellanox 联合提出(SIGCOMM 2015),如今已成为几乎所有 RoCEv2 网卡实现的事实标准,是保障万卡集群中不发生拥塞塌缩的核心算法。

6. 硬件实现与智能网卡架构

RoCEv2 的性能高度依赖 RNIC(RDMA 网卡)内的硬件加速引擎。典型的 RNIC 芯片(如 NVIDIA ConnectX 系列、Intel E810、Broadcom Thor)集成了:

  • 传输层卸载引擎:硬件实现 InfiniBand 传输状态机,处理数据包序号、确认、重传(Go-Back-N)、DCQCN 速率调节等。
  • 门铃与队列管理:管理数百万个队列对(QP)上下文,支持零中断轮询模式。
  • 内存保护与地址翻译:在硬件内部实现内存注册表,通过 IOMMU 或专有地址映射模块直接将 RDMA 操作指向物理地址,绕过系统 MMU。
  • PFC 死锁预防与恢复:逻辑实现看门狗和自恢复机制,防止因 PFC 报文丢失导致的永久暂停。

以 NVIDIA ConnectX-7(2023 年发布)为例,其单芯片支持双向 400Gbps 吞吐,RDMA 消息速率可达 215 百万次/秒,并集成了硬件可靠传输(Hardware Reliable Transport)和 PCIe 5.0 x32 接口以上。这类网卡通常工作在轮询模式(Poll Mode),而不是中断模式,以最大化吞吐与低延迟。配合数据平面开发套件(DPDK)或直接与 GPU 通信的 GPU Direct RDMA 技术,数据可以在 GPU 显存和网卡之间直接搬移,彻底解放 GPU 服务器内的 CPU 和系统内存,使万亿参数规模的大模型训练成为可能。

7. 对比视角:RoCEv2 vs InfiniBand vs iWARP

要客观理解 RoCEv2 的定位,必须将其与另外两种主流 RDMA 传输技术进行横向对比。

InfiniBand (IB) 作为 RDMA 的原始载体,IB 使用完全不同的链路层、网络层与物理层,需要专用的交换机、线缆和主机通道适配器(HCA)。其优势在于:

  • 天然无损、极低延迟(端到端 ~1 μs),且通过集中式管理可实现完美的拥塞控制和路由。
  • 应用广泛且生态成熟,尤其在高性能 Top500 榜单中占比极高。 劣势则在于:
  • 成本高昂,同等端口速率价格是以太网的 2-3 倍。
  • 封闭的技术栈,运维团队需额外掌握 IB 子网管理器等专有技能,无法复用常规网络设备。
  • 供应商高度集中于 NVIDIA/Mellanox,存在供应链风险。

iWARP iWARP 在 TCP/IP 层之上实现 RDMA,可以在标准 TCP 卸载引擎(TCP Offload Engine)上运行。优点是完全兼容现有 IP 网络,能穿越路由和 NAT,且不依赖 PFC。但在过去,iWARP 因 TCP 的保序性和重传机制,时延和 CPU 开销均逊于 RoCEv2,且在 100Gbps 以上速率中推广有限。近年来,随着 TCP 卸载技术的改进,iWARP 在高吞吐场景中仍有一席之地,但生态远不如 RoCEv2 繁荣。

RoCEv2 它最大程度地保留了以太网的通用性和成本优势,同时提供了接近 IB 的极致性能。其代价在于必须部署 PFC/ECN 等无损技术,并对网络设计与运维提出更高的要求。但从产业采纳度看,主流公有云厂商(如微软 Azure、阿里云、AWS 2024 年也已提供 RoCEv2 高性能实例)、所有 GPU 集群构建者几乎全部选择 RoCEv2 或将其作为与 IB 并行的关键路径。技术选择已从“要不要用”进入到“如何用得更稳”的阶段。

8. 网络拓扑与部署考量

在实际部署中,RoCEv2 网络通常采用脊叶(Spine-Leaf)架构,以扁平化、高带宽、低收敛比为设计原则。典型的 AI 训练集群(如 4000 卡 H100 集群)会构建 8 个以上的 RoCEv2 域(Rail 优化),每个 GPU 配有 8 个 400Gbps RNIC 端口,连接到各自的叶子交换机。所有叶子再与脊交换机全交叉互联,形成非阻塞交换结构。为了支持 RoCEv2 的无损特性,交换机必须支持:

  • PFC 按队列优先级发送暂停帧,并具备死锁检测与恢复机制。
  • ECN 标记及加权随机早期检测(WRED)功能,以配合 DCQCN。
  • 大缓冲区(通常深达数十 MB)以及合理的动态共享缓存策略,以吸收微突发引起的瞬时拥塞。
  • 硬件多跳 QoS,确保 RoCEv2 流的优先队列不与其他流量相互干扰。

此外,网络操作系统需要提供精细化的队列调度、ARP/ND 广播防护和快速故障切换。运维方面,自动化配置与校验工具不可或缺,任何一条链路 PFC 配置的不一致都可能引发整个 Pod 的性能崩塌。产业实践中,往往通过 RoCEv2 验证套件(如 NVIDIA 的 NCCL 测试、RDMA Core 的 perftest)在投产前进行全链路压力测试与收敛检测,确保万无一失。

9. 应用实践:人工智能与分布式深度学习

AI 大模型训练是当前 RoCEv2 最大的驱动场景。千亿参数级别的 Transformer 模型训练通常采用 3D 并行(数据并行、张量并行、流水线并行)与专家混合(MoE)等复杂策略,每次迭代都会产生 All-Reduce 和 All-to-All 等集合通信操作。以 NCCL(NVIDIA 集合通信库)为例,它原生支持 RoCEv2 并可以通过 IB Verbs 接口充分发挥网卡的 RDMA 能力。在 2023 年 NVIDIA 公布的一个 10,000 卡 H100 集群配置中,RoCEv2 网络承载了超过 90% 的梯度同步流量,All-Reduce 环算法下总带宽利用率达到 95% 以上,并成功运行了混合精度训练。这一实践证明,RoCEv2 已能在万卡级别严格同步训练中替代 InfiniBand。

在推理方面,大规模推理服务(如多节点张量并行推理)同样依赖低延迟的 RDMA 传输来交换中间激活,RoCEv2 的去内核化特性可以显著降低推理请求的首 token 时延和单步推理时间,助力实现交互式 AI 应用的低延迟体验。

10. 应用实践:高性能计算与分布式存储

除 AI 外,RoCEv2 在高性能计算和存储解耦领域也有广泛渗透。在气候模拟、计算流体力学、基因测序等传统 HPC 应用中使用 MPI 库时,MPI 的 Point-to-Point 或 All-to-All 通信可透明地跑在 RoCEv2 上。主流的 MPI 实现(如 Open MPI、Intel MPI)都通过 UCX(Unified Communication X)框架提供了对 RoCEv2 的一流支持,使既有的 HPC 任务无需代码改动即可迁移到 RoCEv2 集群,获得接近 IB 的性能。

在分布式存储中,NVMe over Fabrics(NVMe-oF)的 RDMA 传输(通过 RoCEv2)可让计算节点直接以块设备形式访问远端 NVMe 固态硬盘,绕过远端 CPU,实现数百万 IOPS 和微秒级访问延迟。这极大促进了存储与计算的分离,使得云原生数据库和弹性分析系统都可享用 RDMA 带来的高性能。

11. 标准演进与多厂商互操作性

RoCEv2 的成功离不开 IEEE 和 IETF 等标准组织的持续推动。IBTA 于 2014 年发布 RoCEv2 规范后,IEEE 相继完成了:

  • 802.1Qbb(PFC,2010)
  • 802.1Qaz(增强传输选择,ETS,2011)
  • 802.1Qau(反向拥塞通知,QCN,后演变为 DCQCN 的基础) 尽管 DCQCN 本身并非正式国际标准,但其作为业界共同遵守的事实规范,被各大网卡厂商(NVIDIA、Intel、Marvell 等)和交换机芯片厂商(Broadcom、Cisco、华为等)广泛实现。为保证多厂商设备的互通,IBTA 组织了定期的 Plugfest 测试,并于 2023 年发布了 RoCEv2 互通性测试规范 2.0。中国信息通信研究院也牵头推进了“无损网络”行业标准,如《高性能计算 以太网网络 总体技术要求》,明确了对 RoCEv2 无损参数的一致性要求,进一步提升了国产化设备(如华为 CloudEngine 交换机、寒武纪思元加速卡结合 RoCEv2)的生态兼容性。

12. 产业生态与主要厂商

RoCEv2 的产业生态已经形成从芯片、网卡、交换机到软件的完整链条:

  • 芯片与网卡:NVIDIA/Mellanox(ConnectX-6 Dx, ConnectX-7, BlueField DPU)占据绝对主导地位,其次是 Intel(E810 系列 100G/200G)、Broadcom(NetXtreme-E 系列)和 Marvell(QLogic FastLinQ)。此外,国内厂商如华为(鲲鹏 920 集成 RoCE)、云合智网、星融元等也在推出自研 RNIC 或 SmartNIC。
  • 交换机芯片与设备:Broadcom(Tomahawk 4/5 系列)提供业界最深的 PFC 缓冲区和 ECN 实现,是多数白盒交换机的心脏;Cisco Silicon One 和华为 CloudEngine 交换机也针对 RoCEv2 做了深度优化。Arista、新华三、锐捷等品牌交换机均提供了成熟的 RoCEv2 配置模板和监控工具。
  • 软件与框架:NVIDIA 的 NCCL、UCX、libfabric 是软件生态的核心,对接 PyTorch、TensorFlow、JAX 等主流 AI 框架。管理编排方面,Kubernetes 上的 Multus 和 RDMA 设备插件使得容器化环境也能高效使用 RoCEv2。
  • 云服务:微软 Azure 在 2019 年率先大规模部署 RoCEv2 用于其加速网络,阿里云、华为云、AWS 等都推出了支持 RoCEv2 的 HPC 实例(如 AWS 的 Amazon EC2 UltraClusters)。

13. 面临的挑战与已知局限

尽管 RoCEv2 取得了巨大成功,其在工程实践中仍面临若干显著挑战:

  1. PFC 风暴与死锁:不当的 PFC 配置或网络故障会导致暂停帧蔓延,形成死锁甚至全网络流量停滞。虽然现代交换机具备检测与恢复机制,但完全避免仍需依赖严密的网络拓扑设计和自动化运维。
  2. 规模扩展性:当集群规模超过 10,000 节点时,DCQCN 的响应速度可能不足,需要更精细的拥塞控制方案。部分超大规模部署已开始试验结合带内网络遥测(INT)的主动式拥塞控制。
  3. 运维复杂性:无损网络要求所有链路的 PFC、ECN、缓冲区阈值等参数严格一致,任何微小的配置错误都可能在特定流量模式下引发灾难性性能下降,这对运维团队的技能提出了更高要求。
  4. 与传统 TCP 流量共存:RoCEv2 流量对丢包零容忍,而传统 TCP 拥塞控制本身依赖丢包。尽管可通过以太网调度策略进行隔离,但在混合流量场景下保证 RoCEv2 流的无损依然是个难题。
  5. 供应商锁定风险:虽然有开放标准,但高性能 RNIC 市场高度集中于 NVIDIA,且部分特性(如 GPU Direct RDMA)需要软硬件的深度绑定,这引起业界对生态封闭性的担忧,推动了对开放 RDMA 生态(如 OpenUCX)和跨厂商互通性的强烈需求。

14. 未来展望:迈向 800G 及超大规模算力网络

面向 2025 及以后,RoCEv2 正逐步向 800Gbps 以太网演进,并开始与各种新兴技术融合:

  • 800G 与 Ultra Ethernet:2024 年,800G 光模块开始规模出货。RoCEv2 将自然承载 800G 以太网的物理层。与此同时,超以太网联盟(Ultra Ethernet Consortium,UEC)正在推动下一代 RDMA 传输协议以应对百万级节点,但其目标仍然是以太网兼容,RoCEv2 的经验和生态将是其不可或缺的基础。
  • 与 CXL 的结合:计算快速链路(CXL)提供内存共享和缓存一致性,未来有望将 RoCEv2 的网络与 CXL 的内存域打通,实现跨节点的低延迟内存访问,进一步模糊网络与总线的边界。
  • 可编程 SmartNIC/DPU 的高阶卸载:通过将集合通信操作(如 All-Reduce)整体卸载至 DPU,可显著降低 GPU 通信开销,RoCEv2 将作为底层的可靠传输机制继续发挥关键作用。
  • 智能化运维:利用 AIOps 对 RoCEv2 网络进行流级遥测和自动调优,实现自愈式无损网络,降低运维复杂度,加速其在更广泛行业(如自动驾驶、医疗影像)中的落地。

15. 总结

RoCEv2 成功架起了高性能 RDMA 与通用以太网之间的桥梁,通过硬件卸载、内核旁路、零拷贝等机制,将数据中心的网络延迟降低至微秒级别,CPU 利用率几乎完全释放。它依赖 PFC、ECN 和 DCQCN 等构建的无损以太网方案,为大规模分布式训练和 HPC 提供了媲美专用 InfiniBand 的性能,同时兼具以太网的成本优势、多厂商支持和运维便利性。如今,从公有云的超大规模集群到企业私有 AI 工厂,RoCEv2 已经成为高性能网络的事实标准。在向 800G、百万节点、CXL 融合的未来演进中,RoCEv2 及其衍生技术仍将是连接算力、释放 AI 潜能的关键纽带。

source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型