网络层 开放阅读

RoCE

RDMA over Converged Ethernet

概念 ID
rdma-over-converged-ethernet
更新时间
2026-05-29
来源数量
待补

RoCE

3 秒看懂

RoCE(RDMA over Converged Ethernet)是让数据中心普通以太网卡和交换机,跑出超级计算机专用网络(InfiniBand)才有的“远程直接内存访问”能力。它让服务器 A 的网卡能直接读写服务器 B 的内存,数据包完全由网卡硬件处理,CPU 几乎零参与、延迟从几十微秒压到几微秒。今天几乎所有分布式 AI 训练集群、超大规模云存储的后端网络,都在大规模部署 RoCE(尤其是能跨子网路由的 v2 版本),因为它在“以太网的兼容/低成本”和“RDMA 的极致性能”之间取得了黄金平衡点。

3 分钟产业解释

训练 GPT-4 级别的大模型,几千张 GPU 要频繁同步梯度,如果用传统 TCP/IP 协议栈,CPU 核会有 30%-50% 的时间不是在算矩阵,而是在处理网络协议、拷贝数据,并且通信延迟抖动剧烈,导致昂贵的 GPU 等待数据、利用率暴跌。
RoCE 解决这个痛点的路径非常直白:把数据搬运工从 CPU 变成网卡硬件
它让服务器 B 的一块物理内存区域直接“映射”给服务器 A 的网卡,A 想写数据进去,只需发一条 RDMA Write 指令,B 的网卡硬件直接把数据写入目标内存地址,B 的 CPU 全程不知情。
这件事原本只能在 InfiniBand(IB)那种专用封闭网络上做,但 IB 交换机、线缆、网卡都是独家生态,成本极高,运维也需要另一套知识体系。RoCE 则把 RDMA 的“灵魂”装进了以太网的“身体”:用 UDP/IP 封装 RDMA 报文,跑在标准以太网交换机上。代价是要求网络“无损”——不能有丢包重传,否则性能崩塌,所以需要引入 PFC(优先级流控)、ECN(显式拥塞通知)等一套复杂的拥塞控制机制来保证链路绝对可靠。
产业实际格局是:IB 仍是极致性能塔尖(国家级超算、部分头部 AI 实验室),RoCE 统治了大型云计算和互联网公司的通用 AI 集群,因为它允许用同一张以太网承载计算、存储和 AI 通信,运维复杂度与成本即可控。

15 分钟专家深入

为什么传统 TCP/IP 网络在分布式 AI 训练中成为瓶颈

传统数据通路大致是:应用数据 → 用户态缓冲区 → send() 陷入内核 → 内核 TCP/IP 协议栈分段、封装 → 再次拷贝到内核 socket 缓冲区 → 驱动层 DMA 到网卡发出。接收侧是逆向过程,外加软中断、上下文切换。
大模型训练场景的特征是通信突发、批量大、对尾部延迟极其敏感。例如,Megatron-LM 的张量并行在每次前向/反向计算后都需要一次 AllReduce 通信(通信量 ≈ 参数量 × 数据并行度规模),如果通信延迟尾高,整个同步步调会被最慢的流拖垮。RoCE 提供了一条“用户态网卡直通”的快速路径:应用直接向 RNIC(支持 RDMA 的以太网卡)提交工作请求(Work Request),网卡硬件完成传输,全程旁路内核、零拷贝(Zero-Copy)。

RoCE v1 与 v2 的分化逻辑

  • RoCE v1:RDMA 报文直接封装在以太网帧(Ethertype 0x8915),仅工作在同一广播域。等同于“二层 RDMA”,不能被路由,规模一上去就失效,因此已基本被淘汰,只在极少数孤立小集群中残留。
  • RoCE v2:RDMA 报文封装在 UDP/IP 包内,目的端口号固定为 4791。网络层走 IP 路由,可跨越子网和多级交换机网络。代价是多了 IP/UDP 头开销,但换来了与数据中心整个 IP fabric 的融合能力。当前所有新建 RoCE 集群几乎都是 v2。

无损以太网与拥塞控制——RoCE 的脆弱性根源

RDMA 对数据包丢失的容忍度极低。原因在于 RDMA 传输的状态机(QP 上下文)和乱序重组逻辑大量卸载在网卡硬件中,一旦丢包,会触发“Go-Back-N”或类似的大量重传(严重时整个消息重传),吞吐会断崖式下跌(可能从百 Gbps 掉到个位数 Gbps)。因此 RoCE 要成立,必须让承载网络“无损”,核心武器有三:

  1. PFC(优先级流控制,IEEE 802.1Qbb):在链路层对特定优先级队列(如 CoS 3 专用于 RoCE)发送 PAUSE 帧,让上游交换机停流,防止接收缓冲区溢出。副作用是可能引发“PFC 死锁”、“PAUSE 风暴”等网络级故障,需要精细调优 buffer 大小、门限和部署策略。
  2. ECN(显式拥塞通知):当交换机队列深度超阈值时,在 IP 包中标记 ECN 位。接收方网卡收到后,生成 CNP(拥塞通知包)发回发送端,发送端据此降速。这形成一种端到端的主动拥塞控制环,比粗暴的 PFC 更优雅,是 RoCE v2 网络调优的核心。
  3. DCQCN(数据中心量化拥塞通知):实际大规模部署中,发送端速率调节算法普遍采用 DCQCN,它是基于 ECN 标记的速率控制算法,结合了 QCN 的量化反馈思想,是当前 RoCE v2 生态的事实标准拥塞控制协议。

此外,交换机端口缓冲(Buffer)架构、负载均衡方式(ECMP vs. 逐包 vs. 逐流、DR路由)、优先级队列数量与调度策略都直接影响 RoCE 稳态性能。这些共同构成了“无损以太网”的沉重运维代价,也是 RoCE 相比 IB 最大的软肋——IB 网络的无损是硬件级内生保证,RoCE 的无损要靠“管理+算法”人工达成

技术原理

本节约 1000 字图解 RoCE v2 的报文结构与一次典型 RDMA Write 完整流程。

协议栈封装

+-------------------------------------+
|          RDMA Payload               |  (上层操作码: RDMA Write / Read / Send 等)
+-------------------------------------+
|  RDMA Header (Opcode, QPN, PSN...)  |  (InfiniBand 传输层语义)
+-------------------------------------+
|  UDP Header (Dst Port: 4791)        |  (无连接、轻量)
+-------------------------------------+
|  IP Header (Src/Dst IP)             |  (可路由)
+-------------------------------------+
|  Ethernet Header / FCS              |  (标准以太网帧)
+-------------------------------------+

核心机制:Queue Pair (QP) 与 Work Request

RoCE 的通信基于 QP(队列对)模型,每对 QP 包含:

  • Send Queue / Receive Queue(双边操作,发送方与接收方均需参与)
  • 对于 RDMA Write / Read 这类单边操作,数据直接写入/读取经过事先注册并交换了虚拟地址和内存密钥 (R_Key) 的远程内存区域,远端 CPU 不感知

一次 RDMA Write 流程(简化):

  1. 内存注册与交换:通信前,应用将本地内存区域注册(MR)到网卡保护域,获得本地 L_Key 和远端访问需要的 R_Key。通过应用层交换远端虚拟地址、R_Key。
  2. 提交 WR:发送方用户态库构建 Work Request(含操作类型 Write、本地源地址、远端目标地址/R_Key、长度),提交到 Send Queue。
  3. 网卡硬件处理:RNIC 取走 WR,直接 DMA 读取本地源内存数据,封装成 RoCE v2 报文(IP/UDP/RDMA 头),发送到网络上。
  4. 接收方网卡接收:RNIC 按 QPN 匹配到对应 QP,验证 R_Key 与内存权限,将数据 DMA 直接写入远端目标内存地址,不产生 CQ(Completion Queue)通知。(仅发送方产生 CQ 通知)
  5. 远端 CPU 无感:该过程不产生任何中断或内存拷贝。

单边 vs 双边操作

  • RDMA Write / Read (单边):发送端需要提前知道远端内存地址和密钥,数据直写直读,远端 CPU 零参与,延迟最低。典型场景:分布式存储(NVMe-oF)、参数服务器、AllGather 环形算法中后续环节的数据搬移。
  • RDMA Send / Recv (双边):类似消息传递,接收方必须预投 Recv 工作请求,多用于控制信息、协商、小消息通信。类似 MPI 语义。

这一架构最终呈现给应用层的指标:在合理的无损以太网上,端到端延迟可达 1-3 微秒(同交换机下),单流带宽可打满 100Gbps/200Gbps/400Gbps 线速,且远端 CPU 利用率近乎为 0%。对比 TCP/IP 的典型延迟在 10-100 微秒且 CPU 大量消耗,这是数量级的差距。

技术演进史

  • 2000年代前期 - RDMA 与 IB 的绑定时代:RDMA 最初是 InfiniBand 架构的原生能力(IB Verbs API),其协议在 IB 传输层定义。高阶计算市场完全由 IB 统治,以太网无法承载这种“内存直传”语义。
  • 2010 - RoCE v1 发布:IBTA(InfiniBand Trade Association)组织将 IB 传输层直接映射到以太网链路层,发布 RoCE v1 标准。目的是把 RDMA 生态以最小成本移植到以太网物理链路,但二层不可路由的弊端使其部署受限。
  • 2014 - RoCE v2 发布:IBTA 在补充标准中定义了 RoCE v2,将 IB 传输层封装在 UDP/IP 之上。这一变更使得 RoCE 可以运行在全域 IP 网络,是划时代的适配改造。同期,DCQCN、ECN、PFC 等拥塞控制技术组合逐渐成熟,微软、阿里巴巴等超大规模云厂商开始探索。
  • 2016-2020 - 超大规模验证期:Microsoft Azure 宣布其存储网络全面基于 RoCE v2;阿里巴巴在数据中心大规模部署 RoCE v2 用于分布式存储和 AI 训练;NVIDIA 通过 Mellanox 收购将 RoCE(以 NVMe-oF、GPU Direct RDMA 等形式)深度绑定到自家 GPU 算力方案中,推出“融合加速器”概念,主流计算平台(如 NVIDIA DGX、HGX 系统)推荐或要求使用 RoCE 作为后端高速网络。
  • 2020至今 - 400G/800G 化与 AI 专用交换机时代:以太网物理层跃迁到 400G/800G,博通、思科、华为、新华三等推出深度优化缓冲和 RoCE 感知功能的数据中心交换机。RoCE 与软件定义网络、遥测、智能运维整合,同时新兴的 **Ultra Ethernet Consortium(UEC)**提出“超级以太网”替代性愿景,试图修正 RoCE 在大规模多跳下的缺陷,RoCE 进入演进或被超越的岔路口。

技术路线对比

维度RoCE v2InfiniBand (IB)传统 TCP/IP 以太网
核心协议UDP/IP 封装的 RDMA (IB 传输层)原生 IB 传输层内核栈 TCP/UDP + Socket
延迟 (典型)约 1-3 μs (同交换机)约 <1-2 μs (极优架构下可至 600 ns 级别,视具体产品代际)约 10-100 μs
最大吞吐400 Gbps/端口 (支持 800G 演进)NDR 400 Gbps (NDR200/400),XDR 800 Gbps 路线同物理层速率(但 CPU 开销极限制约有效带宽)
路由能力三层 IP 路由,可跨子网自有子网管理器 (SM),跨子网需额外网关完整 IP 全局路由
网络无损性依赖 PFC/ECN/DCQCN 外部保证(人为配置)链路层信用流控 (Credit-based),硬件内生无损无原生无损保证,依赖上端重传
CPU 卸载完全卸载 (内核旁路,零拷贝)完全卸载高 CPU 消耗 (协议栈 + 拷贝)
兼容性与生态兼容标准以太网基础设施(需特定网卡与交换机)封闭专有生态,网卡/线缆/交换机必须一致完全开放、通用
运维复杂度高(拥塞调优、buffer 规划、PFC 风暴防护)低(网络自愈,SM 集中控制)低(成熟,但性能无优势)
典型适用规模数百至数千节点 (调优后可上万)数万节点超算无特殊上限
典型客户云厂商 AI 集群、企业数据中心超算中心、国家级算力平台、部分金融极速交易通用企业业务、前端业务网络

注:具体延迟和速率数值与网卡代数强相关,IB 和 RoCE 网卡每个代数升级性能都在跃迁,上表为行业常见参考范围和代际属性,非单一固定型号数值。

上下游

上游供应核心

  • 支持 RDMA 的智能网卡 (RNIC):NVIDIA (ConnectX 系列,代表主流)、Intel (E810 系列等)、Broadcom、Marvell (原 Cavium)、云厂商自研 (如 AWS Nitro、阿里神龙 MOC 卡) 等。这些芯片要实现硬件传输卸载、QP 表、内存保护、拥塞控制逻辑等。
  • 无损以太网交换机芯片与系统:博通 (Trident/Tomahawk/Jericho 系列广泛搭载 RoCE 调优特性)、思科 (Silicon One)、Mellanox/NVIDIA (Spectrum 系列)、Innovium (被 Marvell 收购)、华为 (自研 Solar 系列)、新华三/锐捷/中兴等商用交换机厂商。关键要求:大 on-chip buffer、优先级队列 (≥3 个 RoCE 用)、ECN 标记硬件、PFC 精确控制、WRED/动态阈值等。
  • 线缆/光模块:DAC 铜缆 (0.5m-3m 短距低成本无源)、AOC 有源光缆 (3m-100m)、SR/DR/FR 光模块 (100m-2km)。速率从 25G/100G/200G/400G 到 800G,与物理层代际同步。

下游应用场景

  • 分布式 AI 训练与推理:GPU 集群的后端通信网络 (NCCL AllReduce / AllGather / ReduceScatter)。结合 GPUDirect RDMA (GDR) 技术,GPU 显存直接映射给网卡 DMA 读写,避免经 CPU 和系统内存的中转拷贝,延迟再削减一个数量级。此组合是 GPT 级大模型的基础设施刚需。
  • 分布式存储:NVMe-oF (NVMe over Fabrics) 使用 RoCE 作为传输层,实现远程块存储访问延迟接近本地盘,已大规模部署于云虚拟化存储后端 (如 Amazon EBS、阿里云盘古存储的部分流量承载)。
  • 高性能计算 (HPC):并行计算 MPI 库(Open MPI, Intel MPI 等)对 RoCE 接口有原生支持,部分科学计算工作负载使用 RoCE 替代 IB,降低集群建设成本。
  • 内存数据库与云计算资源池化:用 RDMA 语义实现跨服务器的内存池互联、缓存一致性协议加速等。

关键指标

衡量和评估 RoCE 网络质量的核心参数:

  1. 端到端延迟 (Tail Latency):同交换机下期望中值延迟 1-3 μs,需重点关注 P99/P999 尾部延迟。在 AI AllReduce 同步步调中,尾高延迟直接拖慢每步全局迭代时间。
  2. 吞吐带宽满载率 (Link Utilization):在无丢包前提下,单 QP 流能否达物理链路带宽 90% 以上?公平性如何?深层看有效载荷比 (RoCE v2 引入 IP/UDP 头约 40+ 字节,小包时效率下降)。
  3. 丢包与重传率:理想状态应为 0。任何非零丢包率都会触发大规模 Go-Back-N 或 CNP 降速反应,严重影响吞吐,需持续监控。
  4. PFC 触发次数/持续时间:过量 PAUSE 帧可能锤杀整个优先级类别的吞吐,引发“PFC Storm”风险。运维要观测首跳 PFC 统计并设置合理门限。
  5. ECN 标记与 CNP 速率:反映网络队列堆积程度和发送端限速频率。微调目标是保持极低 ECN 标记率下达到高吞吐。
  6. CPU 卸载度:观察网卡完成所有传输工作时主机 CPU 核心的消耗、中断/上下文切换频率,这是 RoCE 价值的直接量化。

这些指标不能孤立看,高吞吐、零丢包、低 PFC 相互作用、零尾高时延很难同时做到,是网络工程师持续对抗的长期课题。

供需与市场数据

  • 市场规模与渗透率:用于 AI 训练的 RDMA 网络(含 IB 和 RoCE)端口出货量在 2023-2024 年爆发式增长。行业报告显示,2024 年全球高速以太网交换机(100G 及以上,支持 DCB/PFC 特性)销售额中,由大规模 AI 集群建设拉动的比例快速上升,部分云厂商整柜采购的基座交换机几乎全部标配 RoCE。[行业报告]
  • 超大规模推动:微软 Azure 公开资料显示其存储与 AI 网络骨干已大量基于 RoCE 构建;阿里云 HPCC (High Precision Congestion Control) 等一系列拥塞控制算法专门针对 RoCE v2 优化,驱动了大规模 RDMA 以太网部署。中国市场,运营商、字节跳动、腾讯等规模采购 400G RoCE 交换机与网卡用于大规模训练平台。[厂商公开技术论文/发布会]
  • 网卡需求潮汐:NVIDIA ConnectX-6/7 系列是 RDMA 以太网卡的重要方案之一,但本页未取得可追溯的分厂商份额口径,不写“市占率最高”等绝对表述。2023 年后 200G/400G 网卡需求随 AI 训练平台扩张显著增加;博通、Intel、新兴 DPU 供应商也获取了一部分份额,整体供应在 2024 年末起趋于平衡,但高端速率(如 800G)仍然紧俏。[供应链估算]
  • 趋势:每代 GPU 计算能力增长远快于网络带宽,且模型增大带来节点数扩充,两者共同推升集群内部东西向流量带宽需求,因此 RoCE 网络从 100G→200G→400G 过渡加快,市场预计 2025-2026 年大规模训练集群后端网络主流将演进到 400G/800G。[行业报告/预测]

代表公司与资本映射

  • NVIDIA (Mellanox):RoCE 生态无可争议的统治者,提供 ConnectX 系列 RNICSpectrum 系列以太网交换机 全套方案。其 GPUDirect RDMA 技术将 GPU 显存、RoCE 网卡和存储直连,构建了私有的“算力-网络-存储”完整闭环,是推高其在 AI 基础设施市占率的核心杠杆。
  • Intel:以太网 800 系列网络适配器支持 RoCE v2,主打开放、兼容,面向云服务器和企业市场;同时通过 IPU/DPU 策略试图重新定义加速卡架构。
  • Broadcom:在交换机芯片领域地位稳固,其 Tomahawk/Jericho 系列对 RoCE 特性的支持深度直接影响了市面上绝大多数白盒交换机厂商的可靠性。
  • Cisco:以 Nexus 系列数据中心交换机直接承载 RoCE 方案,提供端到端的企业/云数据中心网络设计服务,SDN 管理与可视化是其附加价值。
  • 云厂商自研:AWS (Nitro 卡) 和阿里云 (CIPU/神龙 MOC) 基于 RoCE 构建了自研的低延迟网络,以实现虚拟化 I/O 卸载和存储加速,自研加速器部分取代了商用网卡在该场景的角色。
  • 资本映射逻辑:投资 NVIDIA 和 Broadcom 实质是下注 RoCE 和 AI 时代数据中心网络扩张的乘数效应;投资云厂商基础设施,部分是看他们内部对 RDMA 以太网的重资本投入回报。

投资逻辑

  1. AI 集群军备竞赛的“管道受益”:算力规模 x 每卡网络带宽需求同步增长。“每块 GPU 需匹配 200G/400G 网络端口”的趋势保障了 RoCE 端口出货量长期斜率。市场更看好能提供端到端(网卡加交换机)方案的垄断性供应商。
  2. 自研 DPU 对商用网卡的侵蚀风险:头部云厂商自研数据处理单元(DPU)内含 RDMA 引擎,可能减少大量外部采购 ConnectX 卡。需要密切关注云厂商 DPU 渗透率及其中 RDMA 能力的外溢路径。
  3. Ultra Ethernet 等替代性威胁:UEC 试图解决 RoCE 的多跳拥塞控制陋疾,其生态一旦确立成熟产品,可能在中长期分流 RoCE 增量市场。
  4. 运维工具与软件价值:能提供 RoCE 调优、遥测、PFC 故障诊断和管理工具的平台软件(如 NVIDIA NetQ、Cisco Nexus Dashboard、阿里云高性能网络套件)也构成壁垒,纯硬件盒子同质化竞争激烈,但“交钥匙”可运维方案是锁定大规模数据中心客户的抓手。

常见误读纠偏

  1. “RoCE 和 InfiniBand 性能相当,只是更便宜”。错误。IB 的无损机制(链路层信用流控)提供更彻底、更可预测的低延迟,大规模系统均衡性和网络整体健康度好于 RoCE。RoCE 需持续运维调优,极端规模下(如 10K+ 节点)可能因拥塞控制不稳出现间歇性性能退化。两种选择是“性价比与运维复杂度的权衡”,而非性能完全对等。
  2. “RoCE 就是简单给网卡装个驱动就行”。错误。RoCE 运行在无损以太网上,要求交换机全线开启 DCB(PFC、ETS 等)、精确调整 buffer、部署 ECN、规划优先级映射、设计多路径路由、主机端还要配置 CC 算法。任何一个环节缺失就会导致“看似连上但抖动剧烈、吞吐崩坏”,工程门槛远高于即插即用。
  3. “RoCE 只用在 AI 训练”。片面的认识。实际上分布式存储的 NVMe-oF 和部分内存数据库、大数据 shuffle 加速同样严重依赖 RoCE,该领域商用成熟度甚至早于大规模 AI。只是 AI 话题热度更高,让它看似“AI 专属”。

学习路径

  • 第一步:理论根基
    研究 RDMA 编程接口(IB Verbs、RDMA_CM 连接管理器),从理解 Queue Pair、Completion Queue、内存注册(MR)、保护域、Work Request 这些原语开始。读一本《RDMA Aware Networks Programming User Manual》或 官方 RDMA-Core 文档。
  • 第二步:实验性动手
    在两台 Linux 服务器上配置 RoCE v2(需 ConnectX 或类似兼容网卡),用 rpingib_send_bw 测试单边延迟和吞吐。引入 PFC 配置,抓取 mlnx_qos 统计,感受真正的配置层面。
  • 第三步:协议深度
    学习 DCQCN 和 ECN/PFC 交互论文,经典的《Congestion Control for Large-Scale RDMA Deployments》及 Microsoft/阿里巴巴公开的拥塞控制论文。了解 Mellanox 的 DCQCN 具体实现。
  • 第四步:生产级设计
    熟悉带外管理网络、ECMP/LAG 路由设计、交换机 buffer 分配策略、多层 CLOS 架构中过载管理。参考 NVIDIA/思科/Arista 提供的参考设计与案例白皮书。
  • 第五步:前沿跟踪
    关注 Ultra Ethernet Consortium 进展、GPU Direct RDMA 新版本、DPU 架构整合等。

一句话总结

RoCE 是把超级计算机级的远程内存直访能力“注入”普通以太网的关键融合技术,以极高的性价比支撑了当下 AI 大模型集群和超大规模云的通信基础设施,但代价是让网络工程师需要承担精密的拥塞控制艺术。

延伸阅读与来源

  1. IBTA RoCE v2 标准:《Supplement to InfiniBand Architecture Specification Volume 1 Release 1.4 — Annex A17: RDMA over Converged Ethernet (RoCE)》,IBTA 官方定义文件,技术最权威来源。
  2. 微软大规模部署经验:Guo et al., “RDMA over Commodity Ethernet at Scale”, NSDI 2016 / Bai et al., “Congestion Control for Large-Scale RDMA”, ACM SIGCOMM。这两篇是部署 RoCE v2 的工程圣经,详解了 DCQCN、ECN 门限、PFC 设置等。
  3. 阿里巴巴实践:Zhu et al., “Congestion Control for High-throughput RDMA”, NSDI 2018 (HPCC 原始论文) 及后续系列工作,揭示了改进型拥塞控制算法在大规模 RoCE 中的应用。
  4. NVIDIA 官方文档:《Mellanox RoCE Configuration Guide》、《NVIDIA Ethernet Networking and GPUDirect RDMA》,提供具体配置参数、调优示例和拓扑设计。
  5. 超以太网联盟:Ultra Ethernet Consortium (UEC) 官网及其发布的白皮书,阐述对 RoCE 痛点的回应和替代性规范路线。
source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型