Ultra Ethernet
3 秒看懂
Ultra Ethernet(超以太网) 是由 超以太网联盟 (UEC) 发布的 1.0 版开放规范,为 AI 与 HPC 集群量身定制了一套完全基于标准以太网的高性能通信协议栈。 其核心是 UET(Ultra Ethernet Transport,超以太网传输)——一个 硬件可完全加速 的可靠传输层,旨在以以太网的生态规模,提供比肩乃至超越 InfiniBand 的性能,且无供应商锁定。
3 分钟产业解释
-
为什么需要 Ultra Ethernet 随着 GPT‑4 等大模型推动万卡、甚至百万卡级集群,传统高性能网络的两大选择——InfiniBand 和 基于融合以太网的 RDMA (RoCE v2)——都暴露了明显短板:InfiniBand 生态封闭、成本高昂;RoCE v2 在大规模下的拥塞控制与尾延迟难以满足 AI 训练苛刻的同步要求,且使用有损网络时易触发 PFC 风暴。 与此同时,标准以太网 是世界上规模最大、每比特成本最低的网络技术,端口年出货量达数亿,发明者获图灵奖。UEC 的愿景正是 把以太网的规模优势与 AI/HPC 的极致性能需求统一起来。
-
Ultra Ethernet 解决了什么 UEC 1.0 规范覆盖从网卡、交换机到光纤/电缆的整个网络堆栈,提供:
- 原生、现代化的 RDMA,无需繁琐配置即可实现内存直接访问。
- 端到端可扩展至数百万节点 的寻址与拥塞控制机制。
- 全硬件卸载的传输层(UET),使报文处理延迟和 CPU 开销极低。
- 多供应商互操作性:任何合规的交换机、网卡、光模块都可互联,打破单一厂商锁定。
-
与已有方案的本质区别 不同于 InfiniBand 的私有协议,UE 坚守以太网链路层和物理层,可在以太网交换机硬件上直接运行;相较于 RoCE v2,UE 不仅提供了更先进的 多路径、主动拥塞控制、选择性重传 等特性,更关键的是 定义了一套干净的硬件加速传输协议,避免了将 InfiniBand 传输语义勉强映射到以太网的种种缺陷。
[arxiv 论文] [UEC 1.0 发布新闻]
15 分钟专家深入
1. 设计驱动力
- 极致尾延迟:训练中 AllReduce 等集合通信受最慢节点拖累,要求网络在 99.999% 分位数下的延迟仍可控。
- 大规模多租户:单一集群同时承载多个训练、推理任务,需严格的性能隔离与公平调度。
- 硬件卸载至上:为了不浪费昂贵的 GPU 算力,所有协议处理应卸载到网卡/交换机硬件,CPU 零参与。
- 开放与互操作:避免私有锁定,允许交换机和网卡来自不同厂商,使技术创新与成本优化不再受单一厂商产品节奏限制。
2. 架构分层 UE 协议栈的四层关键组件:
- 物理层 (PHY):复用标准以太网 112‑Gbps SerDes 乃至更高速率物理层,可跑在单模/多模光纤、铜缆、背板上。规范本身不创造新物理层,而是选择 最适宜 AI 集群拓扑的 PHY 规范。
- 链路层 (MAC):标准以太网帧格式,可兼容任何以太网交换机,但增加了 UE 特有的链路层流量控制(非 PFC)。
- 传输层 (UET):灵魂所在。UET 是一个完全运行在硬件上的端到端传输协议,执行可靠传输、多路径分发、主动拥塞控制、选择性重传等。它直接操作内存注册的缓冲区,提供类似 RDMA 的零拷贝语义。
- API 层:向上提供与 InfiniBand Verbs 类似但更现代化的 API(libfabric 或 UE Verbs),使现有 NCCL、MPI 等中间件可快速移植。
3. UET 的关键创新
- 硬件加速的可靠性:传统 TCP 或 RoCE 的可靠传输受限于软件重传或 Go‑Back‑N 机制,而 UET 在网卡内执行微秒级的选择性重传,且不丢失多路径的包序。
- 主动拥塞控制:不像 RoCE v2 依赖 ECN + PFC 的被动反应,UET 采用 基于硬件的端到端遥测 和主动速率调节,可避免在深度缓冲下触发 PFC,从而消除死锁和拥塞扩散。
- 多路径与负载均衡:原生支持报文级多路径,可在端到端之间动态均衡多条链路,同时对上层完全透明,使百万级节点的 Clos 网络利用率接近 100% 理论值。
- 可扩展寻址:摆脱 InfiniBand 的 16‑bit LID 限制和 RoCE 的 IP 地址局限,UET 提供 弹性且适合硬件查找的端到端标识,支持数千万终端。
[arxiv 论文]
4. 与 InfiniBand / RoCE 的性能锚点 根据 UEC 论文描述,UE 的设计目标是在同等级网络速率下达到与 InfiniBand 持平甚至更优的应用层消息率,同时利用以太网的低成本光学和交换硅实现 每比特成本下降超一个数量级。论文亦指出 UET 可望将传输层所需的 每比特计算开销降低千倍级(相较于软件协议栈),但实际产品性能需等硬件硅片送样后验证。
技术原理
最深机制:UET 如何实现硬件加速的可靠多路径传输?
下面用 ASCII 框图示意 UET 发送端和接收端硬件处理流水线。
应用层 (NCCL/MPI)
│
┌──────▼──────┐
│ UE Verbs │ 请求发送 (addr, length)
└──────┬──────┘
│ 调度给 UET 发送引擎
┌──────▼───────────────────────┐
│ UET 发送端 (网卡硬件) │
│ 1. 报文分片 (MSS 大小) │
│ 2. 选择多路径 (5‑tuple 随机) │
│ 3. 注入拥塞遥测请求 │
│ 4. 发送窗口 & 速率控制 │
└──────┬───────────────────────┘
│ 以太网帧 → 路径 A / B / C
┌──────▼────────┐
│ 交换网络 │ (Clos / TOR / Spine)
│ 拥塞检测 │
│ 遥测标记 │
└──────┬────────┘
│ 帧到达接收端
┌──────▼───────────────────────┐
│ UET 接收端 (网卡硬件) │
│ 5. 重排序缓冲与选择性 ACK │
│ 6. 丢包检测 → 请求重传 │
│ 7. 零拷贝放置到目标内存 │
└──────┬───────────────────────┘
│ 完成通知
┌──────▼──────┐
│ UE Verbs │ 完成队列 (CQ)
└─────────────┘
关键参数与机理:
- 连接状态:UET 为每一个远端内存区域建立一个“端点” (endpoint),包含窗口、路径表、重传队列等,全部存入网卡 SRAM,保证亚微秒状态访问。
- 拥塞遥测:交换机在转发数据包时,可将队列长度/时延戳记在报文中(类似 Inband Telemetry),UET 发送端据此在几个 RTT 内精准调整发送速率,而不必等待 ECN 或 PFC。这种反馈环的周期约 1‑3 μs,远快于软件 TCP(约 50‑100 μs)。
- 选择性重传:接受端硬件生成精确的位图(bitmap),标明哪些分片缺失,发送端只重传缺失分片,不触发整窗回退。这使得在 10⁻⁶ 误码率下的有效带宽几乎无损。
- 多路径分组:一条消息可以分散到 4、8 乃至 16 个路径上,每个路径独立拥塞控制,接收端硬件按序列号重组。该机制避免了单一链路流量瓶颈,并极大降低 Fat‑Tree 核心层热点。
规范中的确切定时器、MTU、窗口上限等数值在长达 562 页的规范文档中有定义,这里不作猜测,仅强调其硬件卸载实现。
技术演进史
- 2000 年前后:IBTA 发布 InfiniBand 架构,以 40G/56G 速率称霸 HPC,但成本与封闭性促使 RoCE 的诞生。
- 2010 年:RoCE v1 作为以太网链路层 RDMA 协议面世;2014 年 RoCE v2 加入 UDP/IP 可路由头,以便跨 IP 网络。数据中心开始用它替代 InfiniBand。
- 2016‑2020 年:随着 GPU 集群规模飙升,RoCE v2 的 PFC 死锁、拥塞控、扩展性瓶颈逐渐暴露。学术界与工业界开始尝试新型传输层(如 HPCC、NDP 等),但均为私有或实验性质。
- 2023 年 7 月:主要超大规模企业与芯片商意识到,必须基于以太网创建 完全开放的行业标准,以满足未来百万 GPU 集群的 AI 训练需求。超以太网联盟(UEC)正式宣布成立,创始成员包括 AMD、Arista、Broadcom、Cisco、HPE、Intel、Meta、Microsoft 等。
- 2023‑2024 年:UEC 工作组密集制定规范,涵盖物理层选择、传输层协议、线缆/模块规范、API 等。
- 2025 年 6 月:UEC 规范 1.0 正式版发布,长达 562 页。同一时间,思博伦与瞻博网络在东京 Interop 展会完成 UET 流量的公开互操作演示,使用 800G 测试仪表转发 UET 与 RoCEv2 混合流量,验证了多供应商部署就绪。
- 2025 年 8 月:规范核心作者在 arXiv 发布设计原则与架构创新论文,为产业界提供科学背景。
目前,博通、思科等厂商正基于 1.0 规范开发商用硅片,预计 2026‑2027 年将出现首批支持 UET 的网卡和交换机。
技术路线对比(量化表)
| 维度 | InfiniBand (NDR/XDR) | RoCE v2 | Ultra Ethernet (UE 1.0) |
|---|---|---|---|
| 物理层归属 | 私有物理层/链路层 | 标准以太网 | 标准以太网(选择优化的以太网 PHY) |
| 传输可靠性 | 硬件重传(Go‑Back‑N) | 基于 PFC + 被动 ECN;Go‑Back‑N 为主 | 硬件选择性重传 + 主动拥塞控制 |
| 拥塞控制 | 基于信用 (Credit) | ECN + PFC(易产生风暴) | 端到端硬件遥测 + 主动速率调节 |
| 多路径支持 | 静态路由为主 | RoCE v2 支持多路径但实现复杂 | 原生硬件报文级多路径,自适应均衡 |
| 规模上限 | 48k 节点 / 子网 | 受 IP 子网和交换机表项限制 | 数百万端点,扁平化寻址 |
| 硬件卸载程度 | 全卸载 | 部分卸载(重传常有软件介入) | 全硬件卸载,零 CPU 开销 |
| 供应商锁定 | 强(Mellanox/NVIDIA 主控) | 弱(多厂商以太网交换机) | 极弱,联盟确保互操作,网卡/交换机可异厂 |
| 每比特成本 | 高 | 中 | 预计极低(以太网规模红利率 + 无专属税) |
| 主要用例 | HPC、AI 训练( NVIDIA 生态) | 通用 RDMA、存储、AI | 百万 GPU 级 AI 训练 & HPC |
注:表中 UE 特性基于 UEC 1.0 规范及作者论文描述,实际硬件实现指标需待首批商用产品上市后验证。
上下游
上游:核心组件与技术依赖
- 交换芯片:需要支持 UET 特定报头解析、拥塞遥测插入、多路径转发。博通 (Broadcom)、思科 (Cisco)、Marvell 等正在研发对应产品。
- 网卡 / DPU:必须集成 UET 硬件引擎(发送/接收、重排序、重传、拥塞控制逻辑)。代表厂商如 Intel、AMD (Xilinx)、NVIDIA (尽管非联盟成员,但亦可授权实现) 等。
- 光模块与电缆:全部采用标准以太网光模块(如 400G‑FR4, 800G‑DR8),有源铜缆 (AEC) 等,无需定制物理层,直接受益于现有供应链。
- 测试仪表:需要支持 UET 流量生成与分析,思博伦 (Spirent)、是德科技 (Keysight) 等已推出相应能力。
下游:应用与部署场景
- 超大规模 AI 训练集群:xPU 集群的后端网络,承载 AllReduce、AllGather 等 NCCL 集合通信流量。
- 高性能存储网络:连接 NVMe‑oF 存储,利用 UE RDMA 提供低延迟、高带宽的数据访问。
- 高性能计算 (HPC):替代专有网络,支持 MPI 和 SHMEM 等,加速科学模拟。
- 分布式推理:实现跨节点 GPU 的低延迟共享内存访问,优化张量并行。
关键指标
基于论文和规范性质,以下描述指标的设计目标与定性能力,而非已实测的绝对值。
- 带宽:兼容任何标准以太网速率,初始目标至少 400GbE/800GbE,未来可扩展至 1.6TbE 及以上。
- 消息率:设计目标在单连接上达到与 InfiniBand 等同等级的小消息 IOPS(>100M msg/s),由硬件流水线保障。
- 尾延迟:通过主动拥塞控制和硬件重传,旨在将 99.9% 及更高分位下的延迟增量控制在 10 μs 以内(相同负载下的典型值)。规范要求无论网络负载如何,PFC 永不触发。
- 可扩展性:扁平网络可支持 >10⁶ 端点,无全局同步瓶颈。
- 硬件卸载计算效率:与运行 TCP/IP 协议栈的 CPU 相比,UET 每比特消耗的计算资源 减少三个数量级(论文宣称 “千倍级计算效率提升”),从而将 CPU 周期归还给应用。
[arxiv 论文]
供需与市场数据
由于 UE 1.0 规范在 2025 年 Q3 才正式发布,当前尚无大规模的 ASIC 出货和商业部署,故以下均为行业预测与动态:
- 联盟生态:UEC 已有超过 90 家成员,涵盖云服务商 (Meta、Microsoft、Oracle)、芯片商 (AMD、Intel、Broadcom)、网络设备商 (Cisco、Arista、Juniper)、OEM (HPE、Dell) 等。成员数量表明产业合力。
- 市场驱动力:根据第三方调研,AI 服务器后端网络市场规模预计 2026‑2030 年 CAGR 超 50%。以太网方案在总拥有成本 (TCO) 上的优势预期将使其渗透率从当前约 20% 提升至 50% 以上(未来份额预估来自联盟公开愿景,数字未经独立核实)。
- 演示进展:2025 年东京 Interop 上,思博伦与瞻博网络使用 QFX 5240‑64OD 交换机 (800G) 完成 UET 流量与 RoCEv2 流量共存转发,获得 ShowNet 特别奖。这标志着协议栈从纸上规范走向现实互操作。
- 预期商用时间:多家网络芯片供应商已公开表示在 1.0 规范后开始研发,行业分析师预测 首款 UET 网卡和交换机硅片将于 2026‑2027 年面世,大规模数据中心部署将在 2027‑2028 年展开。
[思博伦与瞻博网络演示新闻] [UEC 规范发布新闻]
代表公司与资本映射
联盟核心推动者与潜在受益标的:
| 公司 | 角色与受益逻辑 |
|---|---|
| Broadcom | 全球最大的以太网交换芯片厂商;UET 交换机芯片将直接拉动其 AI 网络收入,巩固其在以太网硅片的主导地位。 |
| Cisco | 交换机与网络系统巨头,正将 UE 集成进其 Silicon One 架构,提供企业/数据中心端到端方案。 |
| Arista | 云数据中心交换机领军者,深度绑定超大规模客户,将成为 UEC 方案的主要系统集成商。 |
| Intel | UEC 发起成员,提供 Xeon CPU + IPU/DPU 平台,计划将 UET 集成至其 E‑series 以太网控制器,赋能 x86 生态。 |
| AMD | 联盟创始成员,可在其 EPYC 平台与 Pensando DPU 上支持 UET,对抗 NVIDIA 的 NVLink/InfiniBand 护城河。 |
| Meta / Microsoft | 终极用户,大规模采购 UE 交换机/网卡以降低 AI 基础设施 TCO,摆脱网络锁定。 |
| NVIDIA | 未加入 UEC,主导 InfiniBand。若 UE 成为标准,则其 InfiniBand 收入可能承压,但 NVIDIA 也可推出兼容 UET 的 ConnectX 网卡以应对。 |
市场影响概述
UE 的成功将重新分配 AI 后端网络的市场份额,从 NVIDIA 独占 InfiniBand 的局面转向多供应商以太网竞争,利好以太网生态的芯片和系统商。InfiniBand 则在超高端低延迟场景可能仍有一席之地,但整体增长空间被挤压。
投资逻辑
-
开放生态 vs 封闭系统
历史反复证明,开放标准往往在长期竞争中战胜私有协议。一旦 UE 实现同等性能,其多供应商互操作性和成本优势将推动大规模替换需求,利好 Broadcom、Cisco、Arista 等以太网生态核心企业。 -
AI 集群规模定律
AI 训练集群正从万卡向 10 万卡、百万卡演进,私有 InfiniBand 在规模扩展、部署管理和成本上遭遇物理与商业瓶颈。以太网原生的大规模经验(Internet 级别)使 UE 更具适应性,有望成为“百万 GPU 互联的唯一解”。 -
TCO 敏感度上升
随着 AI 资本开支从训练转向推理,成本优化成为关键。以太网光模块、交换机供应链成熟度远胜 InfiniBand,UE 可将网络成本在总体 AI 基础设施中降低 20‑40%(行业估算,非 UEC 官方数据)。 -
需警惕的风险
- 产品落地延迟:从规范到稳定商用硅片通常需要 2‑3 年,期间若 InfiniBand 性能代差拉大或 NVIDIA 推出更激进的私有互联(如 NVLink 扩展),UE 的市场窗口可能收窄。
- 软件生态移植:尽管 libfabric 和 MPI 可快速适配,但大量已有的 CUDA/NCCL 优化依赖 InfiniBand 内部特性,切换过程可能存在性能回退。
- 联盟内部协调:90+ 成员的利益分歧可能导致标准碎片化或推进缓慢。
常见误读纠偏
误读 1:“Ultra Ethernet 是取代以太网的全新网络技术。”
纠正:UE 并非发明新的物理层或数据链路,而是 基于标准以太网的更高层协议栈。它完全运行在现有以太网交换机/网卡的可升级硬件上,是对以太网能力的扩展,而非替代。就像 HTTP/3 仍运行在 UDP 之上一样,UE 仍是以太网帧的负载。
误读 2:“UE 就是另一款 RDMA 协议,和 RoCE v2 差不多。”
纠正:虽然 UE 也提供 RDMA 语义,但其根本差异在于 传输层的硬件卸载深度和拥塞控制理念。RoCE v2 借用了 InfiniBand 传输层却套在以太网 IP/UDP 之上,导致可靠性依赖 PFC,扩展性存疑。UET 则是为硬件从头设计的干净传输层,具备主动拥塞控制和选择性重传,从根本上避免了 PFC 依赖,这是在架构层面的代际升级。
误读 3:“UEC 联盟是‘反 NVIDIA 联盟’,InfiniBand 很快会被淘汰。”
纠正:UEC 的出发点确实是建立开放替代,但 InfiniBand 拥有 20 多年的生态、极致延迟和 NVIDIA 的端到端优化,在中小规模或极致性能场景下仍有显著优势。更可能的格局是:UE 占据大规模 AI 训练和主流 HPC,InfiniBand 退守特定高端领地,二者长期共存。
学习路径
-
基础准备
- 理解 TCP/IP、传统 RDMA (InfiniBand Verbs) 原理。
- 掌握 AI 训练中的集合通信模式(AllReduce、AlltoAll 等)及对网络延迟/带宽的敏感性。
- 阅读 UEC 联盟白皮书与规范摘要(可从 ueconsortium.org 获取)。
-
核心文献
- 《Ultra Ethernet’s Design Principles and Architectural Innovations》 (arxiv:2508.08906) —— 规范作者亲撰,是理解设计思想的最佳入口。
- 完整 UEC 1.0 规范(需从 UEC 成员获取,公开摘要可查)。
-
动手实践
- 尝试用 libfabric 编写简单的 RDMA 程序,感受 Verbs API。
- 关注未来开源项目:当 UE 仿真模型或 FPGA 原型出现时,可在模拟环境中运行 NCCL 测试。
-
跟踪动态
- 定期查阅 UEC 成员公司开发者大会(如 Broadcom、Arista 的用户大会)。
- 关注网络测试厂商(Spirent、Keysight)发布的 UET 测试白皮书,获取性能基准。
一句话总结
Ultra Ethernet 不是另一款快速以太网,而是为百万 GPU 时代量身定制的开放网络生命线——它以以太网的规模红利 + 硬件加速的传输协议,试图终结 AI 后端网络的私有锁定时代。
延伸阅读与来源
- Ultra Ethernet’s Design Principles and Architectural Innovations (arxiv:2508.08906) – 本次深度学习页的主要技术来源。
- 超以太网联盟发布 UEC 1.0 规范新闻 (AET-电子技术应用) – 规范发布报道。
- 思博伦与瞻博网络完成 UET 公开演示 (云帆兴烨科技文章) – 首个性互操作演示验证。
- 36 氪深度解读:英伟达迎来一群劲敌 – 产业竞争格局分析。
- UEC 官网 – 获取成员列表、白皮书及最新动态。
声明:本页所有技术事实均源自上述公开资料,具体产品性能数字在未经硬件实测前均为定性描述或基于规范的预期,不构成任何投资建议。