网络层 开放阅读

UET

Ultra Ethernet Transport

概念 ID
ultra-ethernet-transport
更新时间
2026-05-29
来源数量
待补

Ultra Ethernet

3 秒看懂

一句话定义: Ultra Ethernet 是 Ultra Ethernet Consortium(UEC)主导开发的新一代以太网传输协议,专为大规模 AI 训练集群设计,目标是以开放标准替代 NVIDIA InfiniBand 的私有生态,成为 AI 数据中心的”第二条路”。

关键词: 开放生态 / RoCE 替代方案 / 多路径 / AI 集群互联

3 分钟产业解释

为什么需要 Ultra Ethernet?

当前 AI 训练集群的网络互联存在一个”二选一”困境:

方案优势痛点
NVIDIA InfiniBand性能成熟、生态完善私有协议、供应链单一、成本高
传统 RoCE v2基于开放以太网大规模场景性能差距明显、拥塞控制粗糙

Ultra Ethernet 的定位是:以太网的开放性 + InfiniBand 的性能水平

谁在推动?

Ultra Ethernet Consortium(UEC) 成立于 2023 年,成员阵容覆盖产业链多个环节(截至公开信息):

  • 芯片/设备: AMD、Intel、Broadcom、Cisco、Arista
  • 云厂商/终端用户: Meta、Microsoft、Oracle
  • 其他: HPE、Eviden(Atos)等

[注] 部分成员参与程度未充分披露,以上基于公开新闻报道。

产业意义

传统格局:  训练集群网络 ≈ InfiniBand(NVIDIA 垄断)
Ultra Ethernet 目标:  开放以太网方案性能追平 → 用户有选择权 → 降低 AI 基础设施的" NVIDIA 税"

15 分钟专家深入

核心设计哲学

Ultra Ethernet 不是简单地”优化 RoCE”,而是重新设计传输层以适配 AI/HPC 工作负载特征:

1. AI 流量模型 vs 传统数据中心

特征传统数据中心AI 训练集群
流量模式大量小流(mice flow)少量超大象流(elephant flow)
通信模式请求-响应AllReduce、All-to-All 等集合通信
带宽需求中等极高(数千 GPU 同时通信)
时延敏感度中等高(直接影响训练吞吐)

2. Ultra Ethernet 的关键设计原则(基于 UEC 公开技术文档方向)

  • 多路径传输: 单个流可跨多条物理路径,提高有效带宽利用率
  • 改进的拥塞控制: 针对突发、大规模流量设计
  • 可靠传输层重设计: 平衡可靠性与性能开销
  • 可扩展性: 从数千到数十万节点的扩展能力

与 InfiniBand 的直接对比逻辑

InfiniBand 路径:  应用 → IB verbs → IB 传输层 → IB 链路层 → 专有硬件
Ultra Ethernet 路径:         应用 → Ultra Ethernet verbs(兼容扩展)→ Ultra Ethernet 传输层 → 以太网物理层 → 通用交换芯片

关键差异: Ultra Ethernet 需要在”通用以太网硬件”上实现接近”专用 InfiniBand 硬件”的性能,这是技术挑战所在。


技术原理

[重要说明] Ultra Ethernet 规范截至 2024 年仍在制定中,部分细节未公开或未定稿。以下基于 UEC 发布的公开技术概述,具体数值参数标 [规范制定中] 或定性描述。

协议栈架构

┌─────────────────────────────────────────────┐
│              应用层 / 框架层                  │
│         (NCCL, RCCL, oneCCL 等)              │
├─────────────────────────────────────────────┤
│           Ultra Ethernet Transport API        │  ← 新设计层
│    (可靠/不可靠语义, 多路径感知)              │
├─────────────────────────────────────────────┤
│           Ultra Ethernet Transport Layer      │  ← 核心创新
│    (多路径调度, 可靠传输, 拥塞信号)           │
├─────────────────────────────────────────────┤
│         以太网 + 现有/新一代物理层            │
│    (400G/800G, 可能扩展至 1.6T)              │
├─────────────────────────────────────────────┤
│           通用以太网交换芯片                  │
│       (Broadcom、Cisco 等)                    │
└─────────────────────────────────────────────┘

关键机制详解

1. 多路径传输(Multipath Transport)

问题: 传统 RDMA(包括 RoCE)通常单流单路径,在胖树拓扑中易造成链路不均。

Ultra Ethernet 方案:

  • 发送端将单个流拆分为多个”子流”
  • 每个子流可走不同物理路径
  • 接收端负责重组和排序
传统 RoCE:
  GPU_0 ─────────────────────────────> GPU_1
         Path A (拥塞)

Ultra Ethernet 多路径:
  GPU_0 ─── Path A ──────────────────> GPU_1
         ─── Path B ──────────────────>  (汇聚)
         ─── Path C ──────────────────>

技术难点: 乱序重组的开销、路径选择策略、与交换机 ECMP 的配合。

2. 拥塞控制

Ultra Ethernet 需要解决传统 RoCE 在大规模场景下的拥塞问题(如 PFC 死锁、微突发)。

方向性设计(具体算法参数 [规范制定中]):

  • 基于信用/速率的混合控制: 不完全依赖丢包信号
  • 细粒度反馈: 比传统 ECN 更频繁、更精确的拥塞信号
  • 与多路径协同: 拥塞时动态调整子流分配

3. 可靠传输层

  • 选择性重传: 只重传丢失的包,而非整段流
  • 端到端可靠性: 不依赖交换机层面的 PFC(目标)
  • O(1) 内存模型: 接收端缓冲管理优化

关键参数(定性)

参数Ultra Ethernet 设计目标来源口径
支持带宽400G / 800G 起步[UEC 公开技术概述]
扩展规模数万至十万节点级[UEC 公开愿景,具体未验证]
传输层延迟对标 InfiniBand 水平[目标声明,实测数据未公开]
可靠性机制端到端,不依赖 PFC[UEC 设计目标]

技术演进史

时间线 (AI集群网络技术演进)
═══════════════════════════════════════════════════════════════

2000s         InfiniBand 诞生,HPC 领域逐步普及
              │
2010          以太网吞吐量追赶,开始进入 HPC
              │
2014-2016     RoCE v2 发布,RDMA over 以太网成为可能
              │
2018-2020     大规模 ML 训练兴起,InfiniBand 成为 AI 集群标配
              │
2023 Q2       Ultra Ethernet Consortium (UEC) 成立
              │ ← Ultra Ethernet 项目启动
2023-2024     规范制定阶段,成员扩展
              │
2024-2025     规范 v1.0 预期发布 [具体时间未确认]
              │
未来          首批 Ultra Ethernet 兼容产品商用 [时间未确认]

关键节点: UEC 的成立是对”NVIDIA 通过 InfiniBand 绑定 AI 网络”的直接回应,反映了产业链下游对开放替代方案的强烈需求。


技术路线对比

维度InfiniBand (NVIDIA)RoCE v2 (传统)Ultra Ethernet (UEC)
协议性质私有(NVIDIA 主导)开放标准开放标准(新设计)
硬件依赖专用 HCA、交换机通用以太网 + RDMA NIC通用以太网 + 新一代 NIC
多路径能力有(自适应路由)有限(依赖 ECMP)原生设计,多路径为核心特性
拥塞控制成熟,专用优化依赖 PFC + ECN,大规模受限目标:不依赖 PFC 的端到端控制
生态成熟度高,长期验证中,广泛部署但大规模有挑战低,规范制定中
供应链NVIDIA 垄断多厂商(Broadcom、Mellanox 等)多厂商(目标)
目标规模数万节点已验证通常 < 数千节点最优数万至十万节点(目标)
成本高(专用硬件溢价)目标中低(规模效应后)
集合通信优化SHARP(网络内计算)[规范中是否包含未明确]

[注] Ultra Ethernet 列基于设计目标,实际性能需待产品验证。InfiniBand 的 SHARP 能力是其重要差异化优势,Ultra Ethernet 是否有对应方案未充分披露。


上下游

产业链定位

上游(硬件/芯片)           中游(协议/软件)          下游(终端用户)
┌─────────────┐          ┌─────────────┐          ┌─────────────┐
│ 交换芯片     │          │ Ultra Ethernet 协议栈   │          │ 云厂商       │
│ (Broadcom,   │───────> │ UEC 规范    │───────> │ (Meta, Microsoft, │
│  Cisco等)    │          │             │          │  Oracle等)   │
├─────────────┤          ├─────────────┤          ├─────────────┤
│ RDMA NIC     │          │ 驱动/固件    │          │ AI 公司      │
│ (AMD, Intel, │          │ 适配层      │          │ (OpenAI,     │
│  博通等)     │          │             │          │  Anthropic等)│
├─────────────┤          ├─────────────┤          ├─────────────┤
│ 光模块/线缆  │          │ OS/框架集成  │          │ HPC 中心     │
│ (多厂商)     │          │ (NCCL等)    │          │             │
└─────────────┘          └─────────────┘          └─────────────┘

关键环节分析

环节Ultra Ethernet 影响关键厂商
交换芯片需要支持 Ultra Ethernet 特性(或通过端侧实现)Broadcom、Cisco、Intel
NIC需要新的 Ultra Ethernet 硬件加速AMD(Pensando)、Intel(IPU)、NVIDIA(观望)
光互连高带宽需求推动 800G/1.6T中际旭创、光迅科技、II-VI 等
云厂商最终买单方和推动方Meta、Microsoft、Oracle

关键指标

衡量 Ultra Ethernet 成功与否的核心指标

指标说明当前状态
规范完成度Ultra Ethernet v1.0 是否按期发布[制定中]
AllReduce 吞吐标准 AllReduce 操作的有效带宽利用率[无公开基准测试]
尾延迟(P99)万节点规模下的通信尾延迟[无公开数据]
无 PFC 可靠性端到端传输的丢包率和恢复能力[设计目标,未验证]
GPU 有效计算利用率通信占比下降带来的 MFU 提升[需实测]
产品化时间线首批商用产品/部署案例[未公布]

与 InfiniBand 对标的”及格线”

  • AllReduce 带宽利用率: InfiniBand 大规模场景可达理论带宽的 [需查证]% ,Ultra Ethernet 需达到接近水平
  • All-to-All 延迟: MoE 模型训练的关键通信,InfiniBand + SHARP 有优势
  • 可扩展性: 需在 >10,000 节点规模验证

供需与市场数据

需求侧

AI 训练集群网络市场规模估算:

年份AI 网络设备市场(估算)来源口径
2023百亿美元级[行业综合估算,口径不一]
2025E显著增长[增长趋势一致,具体数字分歧大]

需求驱动力:

  • AI 模型参数规模持续增长 → 集群规模扩大 → 网络带宽/延迟要求提升
  • 超大规模训练(万卡以上)成为常态
  • 云厂商希望降低对单一供应商依赖

供给侧

Ultra Ethernet 潜在受益方:

  • 交换芯片厂商(非 NVIDIA): Broadcom、Cisco 等获得新市场机会
  • AMD/Intel NIC 业务: 有了”开放标准”作为竞争筹码
  • 光模块厂商: 800G/1.6T 需求刚性

供给风险:

  • 规范延迟或碎片化
  • 生态建设周期长(驱动、框架适配、用户教育)
  • NVIDIA 可能通过降价或 InfiniBand 性能提升来回应

竞争格局演变

当前:  InfiniBand 占据 AI 训练集群主导地位
       │
       ▼
过渡期: Ultra Ethernet 产品上市,早期用户试水
       │
       ▼
成熟期: 双轨并行 or Ultra Ethernet 蚕食份额?
       │
       └──> 取决于:性能验证、生态成熟度、NVIDIA 应对策略

代表公司与资本映射

UEC 核心成员及相关上市公司

公司角色受益逻辑风险点
AMDNIC(Pensando)、GPU开放生态削弱 NVIDIA 网络绑定优势Ultra Ethernet 规范进展、NIC 竞争力
IntelNIC(IPU)、交换芯片重振网络业务执行力、产品时间线
Broadcom交换芯片、NIC核心基础设施受益方Ultra Ethernet 是否真正在交换机层面深度支持 [未明确]
Cisco网络设备、交换芯片重返 AI 网络主战场市场份额能否从 NVIDIA 夺回
Arista网络设备企业 AI 网络需求与 Cisco、NVIDIA 竞争
HPE系统集成、服务器组建非 NVIDIA AI 集群系统级竞争力

间接受益

公司逻辑
Meta最大推动方之一,降低 NVIDIA 依赖
光模块厂商800G/1.6T 需求不因协议而变

受损方

公司影响
NVIDIA网络业务面临开放竞争,但 GPU 地位短期稳固

[注] 资本映射基于逻辑推理,非投资建议。Ultra Ethernet 商业化时间线存在不确定性。


投资逻辑

核心逻辑

“AI 基础设施开放化”是大趋势,Ultra Ethernet 是网络层的关键变量。

投资框架:
┌────────────────────────────────────────────┐
│  Ultra Ethernet 规范发布 → 产品落地 → 规模部署         │
│     │              │           │           │
│   (2024-2025)   (2025-2026)  (2026+)      │
│     │              │           │           │
│  确定性增加      财务可见性   收入兑现      │
└────────────────────────────────────────────┘

分层投资逻辑

层级逻辑确定性代表标的方向
高确定性无论 Ultra Ethernet 是否成功,AI 网络带宽需求增长光模块、高端交换芯片
中确定性Ultra Ethernet 推动以太网份额提升Broadcom、Cisco、Arista
低确定性特定 Ultra Ethernet NIC 厂商胜出AMD、Intel 网络业务

关键催化剂/风险点

催化剂:

  • Ultra Ethernet v1.0 规范正式发布
  • 首个超大规模用户公开宣布采用 Ultra Ethernet
  • 第三方基准测试显示性能接近 InfiniBand

风险点:

  • 规范持续延期,市场失去耐心
  • 性能实测与宣传差距大
  • NVIDIA 通过 SHARP 升级、降价等策略保持领先
  • 生态碎片化(不同厂商实现不兼容)

常见误读纠偏

❌ 误读 1:“Ultra Ethernet 已经成熟,可以替代 InfiniBand”

纠偏: 截至 2024 年,Ultra Ethernet 仍处于规范制定阶段,尚无商用产品和大规模部署验证。InfiniBand 在万节点级 AI 集群上有多年实战经验。将 Ultra Ethernet 视为”已完成的替代方案”是错误的,当前应视为”有潜力的挑战者”。

❌ 误读 2:“Ultra Ethernet 就是升级版 RoCE v2”

纠偏: Ultra Ethernet 不是 RoCE 的增量升级,而是重新设计的传输层协议。其核心创新(原生多路径、新型拥塞控制、端到端可靠性设计)在架构层面与 RoCE 有本质区别。虽然都运行在以太网上,但协议栈的设计哲学不同。

❌ 误读 3:“Ultra Ethernet 会让 NVIDIA 网络业务崩塌”

纠偏:

  1. NVIDIA 网络业务(Spectrum-X)本身也在演进
  2. 即使 Ultra Ethernet 成功,生态建设需要时间,不会一夜颠覆
  3. NVIDIA 的核心壁垒是 GPU + 网络 + 软件的垂直整合,单点突破影响有限
  4. 短期内更可能是”双轨并存”而非”替代”

❌ 误读 4:“Ultra Ethernet 能大幅降低 AI 集群成本”

纠偏: 网络设备成本在 AI 集群总成本中占比有限(GPU 是大头)。Ultra Ethernet 的价值更多在于供应链多元化避免被绑定,而非直接的成本削减。大规模部署后可能有成本优势,但初期可能反而更贵(成熟度溢价)。


学习路径

入门级(1-2 天)

Step 1: 了解背景
  └── 阅读 UEC 官网 (ultraethernet.org) 的 Overview 文档
  └── 搜索 "Ultra Ethernet vs InfiniBand" 的科普文章

Step 2: 理解问题
  └── 了解 RoCE v2 的基本原理和局限性
  └── 理解 AI 训练中的集合通信模式(AllReduce、All-to-All)

进阶级(1-2 周)

Step 3: 协议深入
  └── 阅读 UEC 发布的技术白皮书/规范草案(如有)
  └── 对比学习 InfiniBand 架构(理解竞争对象)

Step 4: 系统视角
  └── 研究大规模 AI 集群的网络拓扑(Fat-tree、Rail-optimized)
  └── 了解 NCCL 等集合通信库如何利用网络

专家级(持续跟踪)

Step 5: 产业跟踪
  └── 关注 UEC 规范发布进度
  └── 跟踪成员公司产品路线图(AMD Pensando、Intel IPU 等)
  └── 搜索 SIGCOMM/NSDI 等顶会的相关论文

Step 6: 实践验证
  └── 关注第三方基准测试报告
  └── 追踪超大规模用户的公开部署案例

推荐资源

类型资源说明
官方UEC 官网最权威的技术概述和规范进度
行业Data Center 网络相关行业报告了解市场格局
技术NVIDIA InfiniBand 文档理解竞争对手的成熟方案
学术RDMA/AI 网络相关论文理解底层技术挑战

一句话总结

Ultra Ethernet 是以太网阵营对抗 InfiniBand 垄断的”战略武器”,其开放性和架构创新有真实价值,但成败取决于规范质量、产品化速度和生态建设——这是一个”正确方向、尚未验证”的技术赌注。


延伸阅读与来源

权威来源

来源内容获取方式
Ultra Ethernet Consortium (UEC) 官网规范概述、成员信息、技术白皮书ultraethernet.org
UEC 技术工作组发布物协议细节(如公开)UEC 官网或成员渠道

行业分析

来源类型内容可信度标注
半导体/网络行业研报市场规模、竞争格局[券商估算,口径不一]
科技媒体深度报道产业动态、用户视角[需交叉验证]

技术背景

主题推荐方向
RDMA 基础RoCE v2 协议、RDMA verbs
AI 集群通信NCCL、AllReduce 算法、Ring/Tree AllReduce
InfiniBand 架构作为 Ultra Ethernet 的对标对象学习
网络拥塞控制DCQCN、Swift 等数据中心拥塞控制算法

本页信息边界声明

  • 硬规格: 本文档中 Ultra Ethernet 的具体技术参数引用自 UEC 公开技术概述,具体数值待规范最终发布确认
  • 市场数据: 引用行业综合估算,标注了 [估算] 口径,非精确数据
  • 公司映射: 基于公开成员列表和业务逻辑推理,不代表投资建议
  • 时间节点: 基于公开新闻报道,具体时间可能调整

本页最后更新:基于 2024 年公开信息。Ultra Ethernet 规范仍在制定中,建议定期关注 UEC 官方更新。

source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型