网络层 开放阅读

UEC

Ultra Ethernet Consortium

概念 ID
ultra-ethernet-consortium
更新时间
2026-05-29
来源数量
待补

UEC

1. 3 秒看懂

UEC(Ultra Ethernet,超以太网)是一个开放的、基于标准以太网的完整通信协议栈规范,专门为人工智能(AI)与高性能计算(HPC)集群设计。UEC 1.0 规范已正式发布,目标是为超大规模数据中心提供多供应商可互操作的高性能网络,直接在以太网和 IP 上实现现代 RDMA,端到端可扩展至数百万节点,并承诺零厂商锁定。

2. 3 分钟产业解释

AI 大模型训练需要成千上万个 GPU/加速器高速协同工作,网络互连的延迟、带宽、尾延迟和拥塞控制直接决定训练效率与被浪费的算力比例。过去,这一领域高度依赖英伟达的 InfiniBand 网络——虽然性能出色,但生态封闭,采购成本高,且与标准以太网基础设施无法天然融合,导致用户面临单供应商锁定风险。

超以太网联盟(Ultra Ethernet Consortium,UEC)由 AMD、Arista、博通、思科、Eviden、HPE、英特尔、Meta 等芯片商、交换机巨头、服务器厂商和顶级云用户联合发起。已发布的 UEC 1.0 规范覆盖从网卡(NIC)、交换机、光纤到电缆的全部网络层级,并且整套协议栈坚守标准以太网和 IP,彻底告别私有协议。这意味着数据中心可以直接复用成熟的以太网供应链,以多厂商竞争的方式搭建 AI/HPC 网络,显著降低锁定风险与总拥有成本(TCO)。更关键的是,UEC 将现代 RDMA 深度融入以太网,并配备了专为 AI 工作负载设计的传输协议和拥塞控制机制,使得标准以太网首次在可扩展性、有效吞吐和尾延迟等方面,具备了系统性地替代 InfiniBand 的潜力。

3. 技术原理

总体架构
UEC 1.0 的核心思路是:保留标准以太网物理层(PHY)和 MAC 层的兼容性,重新设计传输层及以上协议语义,以适配 AI/HPC 的极端通信模式。其逻辑分层可概括如下(基于公开信息推导,具体实现需查阅规范原文):

+---------------------------------------------------+
|   应用层 (分布式训练框架: Megatron, PyTorch 等)      |
+---------------------------------------------------+
|   UEC 传输服务 (现代 RDMA、智能重传、拥塞感知传输)   |
+---------------------------------------------------+
|   UEC 网络层 (基于 IP 的大规模寻址与路由)           |
+---------------------------------------------------+
|   标准以太网链路层 (MAC/PHY 兼容)                  |
+---------------------------------------------------+
|   物理层 (网卡、交换机、光纤/铜缆; 充分利用现有以太网速率) |
+---------------------------------------------------+

现代 RDMA over Ethernet/IP
UEC 直接在标准以太网和 IP 之上实现原生 RDMA。GPU 或加速器显存中的缓冲区,经由支持 UEC 的网卡可直接与远端设备显存之间完成数据传输,CPU 全程旁路。与之配套的传输层协议进行了“智能重传”与丢包恢复机制设计,在出现丢包或乱序时不会像传统 TCP 或早期 RoCE 那样出现吞吐断崖式下降,从而保住 AI 训练对尾延迟的苛刻要求。

大规模可扩展性
UEC 将寻址与路由能力扩展到数百万端点。其选址与路由机制适应大规模胖树(Fat‑Tree)、蜻蜓(Dragonfly)及环面等主流 HPC 拓扑,并避免控制平面因规模扩大而出现指数级收敛开销。据联盟说明,这类设计借鉴了超算领域数十年积累的多路径喷洒、动态路由等最佳实践,并在 UEC 1.0 中完成了标准化。

拥塞控制:为 AI 定制
AI 训练中常见的“多打一”(Incast)通信模式,会在瞬时间塞满交换机缓存,引发剧烈尾延迟。UEC 采用端网联动的拥塞控制架构,不再单纯依赖传统 ECN 或 PFC。交换机侧提供快速、精准的拥塞信息,端侧据此即时调整发送速率;同时结合多路径负载分担,将流量更均匀地喷洒到所有可用链路上,以此抑制拥塞扩散并维持网络高利用率。这是 UEC 与 RoCEv2 单纯依赖 PFC 的关键差异之一。

补充说明
UEC 1.0 规范完整细节尚未对所有公众全面开放,部分机制为基于联盟官方声明与行业共识方向的定性阐述。具体算法选择与参数设定需进一步查阅规范原文或等待互操作性验证结果。

4. 关键参数

UEC 1.0 涉及的关键参数与设计目标(综合自 UEC 联盟官方公告及公开访谈,部分性能基准尚未公布):

参数维度说明与指标来源/口径
物理层速率兼容现有及未来以太网 PHY:100G、200G、400G、800G 等,物理介质可选用光纤、铜缆,与 IEEE 802.3 标准同步演进联盟公开说明
协议基础基于标准以太网和 IP,全套规范开放、可互操作UEC 1.0 规范
RDMA 能力现代化 RDMA,低延迟、高吞吐,面向 AI/HPC 设计,支持选择性重传、智能确认同上
端点扩展数宣称可扩展至数百万终端联盟技术目标
拥塞控制端网联合、适配 AI 通信模式,声称大幅削减尾延迟与拥塞扩散公开访谈
互操作性多厂商 NIC、交换机、线缆之间无缝协作,无私有扩展联盟承诺
部署运维继承以太网运维工具链,简化部署,目标为“即插即用”级体验联盟愿景
实际延迟/吞吐/尾延迟基准公开资料未见 具体数值。大规模实测数据需等待首批商用产品及第三方评测

注:上表中部分目标性能(如数百万端点、尾延迟改善幅度)尚无独立测试结果印证,仍属于规范设计目标。

5. 技术路线

演进脉络
AI/HPC 网络从封闭走向开放的历程可概括为:专有互连 → 以太网融入 RDMA → 面向 AI 的行业级开放以太网标准。

  • 专有互连时代:2000 年代起,InfiniBand 凭借高带宽、微秒级延迟和出色的拥塞控制长期统治 HPC 与早期 AI 训练集群,但软硬件栈封闭,成本高昂且与英伟达加速器强绑定。
  • RoCE(RDMA over Converged Ethernet)阶段:工业界尝试在标准以太网上实现 RDMA,诞生了 RoCEv2。它使得 GPU 能在以太网架构下进行直接内存访问,大幅降低门槛。然而 RoCEv2 高度依赖 PFC、ECN 等复杂配置,大规模部署时易诱发拥塞树、死锁和 PFC 风暴,跨厂商微调困难,运维负担极重。
  • UEC 标准化:为彻底解决上述痛点,2020 年代中期,主要芯片商和超大规模云用户联合发起 UEC。UEC 1.0 规范(已正式发布,2025 年 6 月公布)首次以全栈规范的形式定义了面向 AI/HPC 的下一代以太网协议栈,统一并超越 RoCE,同时打开多供应商互操作的通道。

当前技术定位
UEC 仍处于生态构建早期。规范 1.0 完成发布,下一步是互操作性测试、合规计划与首批商用芯片流片。预计首次量产 NIC/交换机将在后续 1‑2 年内问世。

与主流方案的定性对比

对比维度UEC 1.0InfiniBand(英伟达主导)RoCEv2(传统融合以太网)
基础网络标准以太网专用 InfiniBand 协议标准以太网
RDMA 支持以太网/IP 原生 RDMA,专为 AI 优化原生 RDMA,性能极优RDMA over UDP/IP(需无损网络)
可扩展性宣称百万级端点单子网通常数千,更大需多子网路由大规模下配置和稳定性面临挑战
拥塞控制端网联合、AI 负载定制基于信用的链路级流量控制严重依赖 PFC/ECN,易拥塞扩散
厂商锁定开放标准,零锁定相对封闭,与英伟达硬件深度绑定多厂商但互操作调优有限
生态成熟度规范刚发布,生态萌芽极度成熟,现网大量部署已广泛部署,但 AI 大规模痛点明显
部署运维预期继承以太网工具链需专用技能,与以太网管理孤岛配置复杂,需深度调优

量化性能对比(延迟、有效吞吐、尾延迟)暂无法公开获取。

6. 上游

芯片与组件供应

  • 交换芯片与网卡芯片:博通(Broadcom)、英特尔(Intel)、AMD(通过收购 Pensando)等,负责提供支持 UEC 协议的 NIC 控制器和交换机 ASIC。微架构需要实现 UEC 传输层硬化、拥塞感知引擎及多路径喷洒逻辑。
  • 交换机整机设备商:Arista Networks、思科(Cisco)、HPE 等,将芯片集成进盒式或框式交换机,开发匹配 UEC 的软件特性与运维工具。
  • 物理层介质:高速光模块、有源光缆(AOC)、直连铜缆(DAC)供应商,为 UEC 高带宽链路(400G/800G/1.6T)提供物理连接。

IP 与软件

  • 协议栈实现与驱动:各 NIC 厂商、操作系统与分布式训练框架(如 PyTorch、TensorFlow)需要集成 UEC 驱动和通信库(如类似 NCCL 的通信原语适配)。部分 IP 可能来自联盟成员共同开发的参考实现。

产能与供应数据:UEC 兼容产品尚未进入量产,相关产能规划公开资料未见。

7. 下游

直接应用与集成方

  • 超大规模云服务商:Meta、微软、亚马逊等拥有大量 AI 训练集群的用户,是 UEC 早期驱动力。Meta 为联盟发起成员,直接推动规范并计划在内部部署。
  • AI 初创公司与大型企业研发中心:需要大规模 GPU 算力但对成本敏感、不希望被单一网络供应商绑定的团队,将成为 UEC 生态扩展的关键受众。
  • 系统集成商:交付预集成 UEC 网络的整机柜 AI 服务器方案,简化企业部署。
  • 国家超算中心与科研机构:传统 HPC 用户,希望从 InfiniBand 和封闭网络转向更开放的供应链,以降低长期运维成本。

需求特征
下游关注的核心诉求为:网络设备采购成本较 InfiniBand 降低(具体降幅因配置而异,公开资料未给出统一比例)、避免单一厂商锁定、能够复用以太网运维团队及工具、以及在大规模组网时保持稳定的训练效率。

8. 受益公司

以下公司在 UEC 生态中扮演重要角色,并可能因标准的推广而获得新业务机会。此处仅为产业链梳理,不作任何投资建议,也不代表对相关证券价值的判断。

公司在 UEC 生态中的角色公开市场证券(仅信息列示)
AMDGPU 与 DPU/NIC 方案提供商,推动开放网络生态,以对抗英伟达 GPU+InfiniBand 的绑定NASDAQ: AMD
Arista Networks高性能数据中心交换机领导者,深度参与规范定义,预计率先推出 UEC 交换机NYSE: ANET
博通 (Broadcom)全球最大 AI 交换芯片供应商,为 UEC 提供 NIC 与交换机 ASIC 硬件适配NASDAQ: AVGO
思科 (Cisco)企业及云交换机厂商,计划将 UEC 导入其交换机产品线NASDAQ: CSCO
HPE超算/高性能服务器集成商,有望为 AI 集群提供 UEC 网络解决方案NYSE: HPE
英特尔 (Intel)提供网卡芯片和 IPU,参与 UEC 主机侧加速NASDAQ: INTC
Meta超大规模 AI 集群需求方,联合起草规范并推动部署NASDAQ: META
Eviden(Atos 业务线)HPC 系统集成商,为欧洲超算等客户引入 UEC 网络方案巴黎泛欧交易所: ATO

除上述公司外,高速光模块、直连铜缆组件、测试设备等供应商也将间接受益。联盟技术咨询委员会主席 Hugh Holbrook 与 Arista 的关联也反映出交换机厂商在标准推进中的核心作用。

9. 市场规模

AI 后端网络市场现状(数据来自第三方市场研究报告,涵盖 InfiniBand 及高性能以太网交换机、网卡):

  • 据 Dell’Oro Group 2024 年 1 月发布的《AI Networks for AI Workloads》报告,2023 年全球 AI 后端网络市场总收入约为 28 亿美元,其中 InfiniBand 占据约 85% 的份额(口径:厂商营收,包含 InfiniBand 及高速以太网交换机/适配器;年份:2023 全年)。
  • 该机构预测,到 2027 年市场总规模将增长至 超过 100 亿美元,年复合增长率(CAGR)约 40%。增长主要由云服务商和企业 AI 训练、推理集群的规模化扩张驱动。

以太网在 AI 网络中的渗透趋势
多个研究机构(650 Group、LightCounting 等)指出,以太网在 AI 后端网络中的占比正在提升,预计到 2028 年,以太网方案(含 RoCEv2 及未来 UEC)的份额可能与传统 InfiniBand 平分秋色甚至反超。UEC 若成功实现商用落地与互操作认证,将进一步加速这一渗透。

UEC 本身暂未产生销售
截至 2025 年中,UEC 兼容设备尚无出货与营收数据,UEC 联盟本身为非营利标准组织,不直接产生市场规模。其后续商业影响将通过成员企业的 NIC、交换机、光模块等产品间接体现。

10. 玩家对比

除技术路线外,从产业格局看,UEC 阵营与英伟达 InfiniBand/Spectrum‑X 生态之间的抗衡构成了 AI 网络市场的主线。

对比维度UEC 阵营(超以太网联盟)英伟达 InfiniBand / Spectrum‑X
生态模式开放联盟,多厂商互操作垂直整合,由英伟达提供从 GPU 到交换机的全栈方案
供应链多源芯片、多厂商交换机,用户可混合采购主要依赖英伟达交换机、网卡(ConnectX)及线缆
采购成本预期通过竞争降低,具体未量化通常较高,且议价空间有限
用户锁定程度零协议锁定,任意更换兼容设备强绑定,切换网络体系成本高
性能优化深度通用标准化,需生态合力优化紧耦合联动 GPU,可深度优化集合通信库(如 NCCL)
成熟度标准初版发布,产品有待落地用于 Exascale 超算和万卡集群,现网已验证多年
目标场景超大规模云、AI 训练、HPC,注重开放与成本控制对绝对延迟和性能要求极致的高端训练,以及需要英伟达全栈优化的大型集群

目前,英伟达同时推出 Spectrum‑X 以太网平台作为自家以太网方案,与 UEC 形成一定竞争。这意味着未来以太网 AI 网络内部可能出现 Spectrum‑X、UEC 与改进版 RoCEv2 并存的格局。

11. 风险

1. 规范落地与互操作延迟
UEC 1.0 虽已发布,但从规范到稳定、互操作、大规模商用的路径可能长于预期。若芯片流片、合规性验证或跨厂商互操作性测试出现反复,部署时间表可能推后,使前期支持者信心受损。

2. 实际性能与规模验证不确定
UEC 宣称的可扩展至数百万节点、智能拥塞控制等尚未经第三方大规模实测验证。真正用于万卡/十万卡集群时,是否会出现意料之外的尾延迟尖峰、死锁或路由收敛问题,仍是未知数。

3. InfiniBand 及 Spectrum‑X 的竞争
英伟达不断迭代 InfiniBand(如 NDR、XDR)并同时力推 Spectrum‑X 以太网平台,试图以“闭合优化 + 开放选项”双轨策略巩固阵地。这可能在 UEC 成熟之前提前锁定部分开放以太网市场,压缩 UEC 的起飞窗口。

4. 生态碎片化
多厂商互操作虽是优点,却也伴随着调优碎片化风险。不同厂商的 NIC 和交换机在拥塞控制参数、遥测接口实现上的微小差异,可能导致最终用户仍需针对特定组合进行繁重验证,削弱“无缝互操作”的承诺。

5. 标准演进与向后兼容
UEC 后续版本(1.1、2.0 等)的迭代若不能良好向后兼容,可能造成早期设备贬值或网络升级困难,进而让潜在用户采取观望态度。

12. 误读纠偏

误读 1:「UEC 是一种全新的物理层技术,会替代现有以太网」
纠偏:UEC 完全基于标准以太网物理层和链路层,并非另起炉灶。它的创新集中在传输层及以上,最终仍运行在 100G、200G、400G、800G 乃至更高速的通用以太网 PHY 上。UEC 不要求更换数据中心以太网基础。

误读 2:「UEC 一发布,InfiniBand 将很快被淘汰」
纠偏:InfiniBand 在亚微秒级超低延迟、HPC 领域成熟生态以及英伟达软硬件协同优化上的优势依然显著。UEC 的价值不在于“击败 InfiniBand”,而是提供另一种开放、灵活、高性价比的选择。两种体系将在长时间内共存,分别服务不同偏好与预算的客户。

误读 3:「UEC 只是 RoCEv2 的简单重命名」
纠偏:UEC 是面向 AI/HPC 的一次全栈协议重构,包括新的传输层、拥塞控制、网络层语义以及管理平面,远超 RoCEv2 仅替换传输层的范畴。它为 AI 流量的多路径喷洒、智能重传和端网对接提供了标准化框架,而 RoCEv2 仍较多依赖 PFC 等传统无损机制。

误读 4:「加入 UEC 联盟就一定有产品可用」
纠偏:UEC 联盟成员众多,但联盟本身不销售产品。各家成员何时推出符合 UEC 1.0 标准的量产 NIC、交换机,取决于各自的研发进度与芯片流片计划。联盟合规与认证计划仍在制定中,早期产品可能仅实现部分特性。

13. 最新事件

  • 2025 年 6 月:超以太网联盟通过官方活动及公告,正式发布 UEC 1.0 规范。这是业界首个面向 AI/HPC 的完整开放以太网通信协议栈,宣告 UEC 从联盟筹备进入标准落地阶段。
  • 联盟动态:UEC 此前已在不同场合公布其成员构成与技术愿景。1.0 发布后,多家交换机与 NIC 厂商公开表态将开发兼容产品。
  • 相关竞合:同期,英伟达 Spectrum‑X 以太网方案持续迭代,行业对开放以太网 vs 闭合优化的讨论更加激烈。
  • 下一里程碑:联盟正在推进合规与互操作测试计划,预期 2025 年底至 2026 年可以看到首批商用芯片样品及多厂商互联演示。

(事件来源综合自联盟官网及主流科技媒体,见信源部分。)

14. 跟踪指标

要客观评估 UEC 的产业化进展,可重点关注以下量化或事件指标:

  • 产品推出进度:首颗支持 UEC 1.0 的 NIC 芯片、交换机 ASIC 流片与送样时间;首批商用交换机、网卡的正式发布与订购日期。
  • 互操作演示:联盟组织的多厂商互操作性测试(Plugfest)结果,参与的厂商数量,以及成功演示的拓扑规模(如 400G 互联下的 GPU 集合通信基准)。
  • 超大规模用户部署:Meta 等核心用户公开发布的内部 UEC 集群规模 —— 例如“已部署 1000 个 UEC 端点的训练集群,实测 AllReduce 性能相当于 InfiniBand 的 xx%”。
  • 联盟成员变化:新加入的重量级云服务商、芯片商或 OEM 厂商数量,及其贡献的技术提案。
  • 标准迭代:UEC 1.1 或更高版本规范的发布时间,增强特性列表,以及向后兼容性声明。
  • 供应链声量:博通、英特尔、AMD 等主要芯片厂商在财报电话会议或投资者日中提及 UEC 的次数与量产时间表。
  • 独立基准测试:第三方机构(如独立评测实验室、大学)发布的 UEC vs. InfiniBand vs. RoCEv2 的性能对比报告,关注中位延迟、尾延迟(P99)、有效带宽利用率与故障恢复时间。
  • 生态软件就绪度:主流 AI 框架(PyTorch、TensorFlow)及通信库(类似 NCCL)对 UEC 的原生支持版本发布。

15. 信源

source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型