網路層 開放閱讀

UET

Ultra Ethernet Transport

概念 ID
ultra-ethernet-transport
更新時間
2026-05-29
來源數量
待補

Ultra Ethernet

3 秒看懂

一句話定義: Ultra Ethernet 是 Ultra Ethernet Consortium(UEC)主導開發的新一代乙太網路傳輸協議,專為大規模 AI 訓練叢集設計,目標是以開放標準替代 NVIDIA InfiniBand 的私有生態,成為 AI 資料中心的”第二條路”。

關鍵詞: 開放生態 / RoCE 替代方案 / 多路徑 / AI 叢集互聯

3 分鐘產業解釋

為什麼需要 Ultra Ethernet?

當前 AI 訓練叢集的網路互聯存在一個”二選一”困境:

方案優勢痛點
NVIDIA InfiniBand效能成熟、生態完善私有協議、供應鏈單一、成本高
傳統 RoCE v2基於開放乙太網路大規模場景效能差距明顯、擁塞控制粗糙

Ultra Ethernet 的定位是:乙太網路的開放性 + InfiniBand 的效能水平

誰在推動?

Ultra Ethernet Consortium(UEC) 成立於 2023 年,成員陣容覆蓋產業鏈多個環節(截至公開資訊):

  • 晶片/裝置: AMD、Intel、Broadcom、Cisco、Arista
  • 雲端廠商/終端使用者: Meta、Microsoft、Oracle
  • 其他: HPE、Eviden(Atos)等

[注] 部分成員參與程度未充分揭露,以上基於公開新聞報道。

產業意義

傳統格局:  訓練叢集網路 ≈ InfiniBand(NVIDIA 壟斷)
Ultra Ethernet 目標:  開放乙太網路方案效能追平 → 使用者有選擇權 → 降低 AI 基礎設施的" NVIDIA 稅"

15 分鐘專家深入

核心設計哲學

Ultra Ethernet 不是簡單地”最佳化 RoCE”,而是重新設計傳輸層以適配 AI/HPC 工作負載特徵:

1. AI 流量模型 vs 傳統資料中心

特徵傳統資料中心AI 訓練叢集
流量模式大量小流(mice flow)少量超大象流(elephant flow)
通訊模式請求-響應AllReduce、All-to-All 等集合通訊
頻寬需求中等極高(數千 GPU 同時通訊)
時延敏感度中等高(直接影響訓練吞吐)

2. Ultra Ethernet 的關鍵設計原則(基於 UEC 公開技術文件方向)

  • 多路徑傳輸: 單個流可跨多條物理路徑,提高有效頻寬利用率
  • 改進的擁塞控制: 針對突發、大規模流量設計
  • 可靠傳輸層重設計: 平衡可靠性與效能開銷
  • 可擴充套件性: 從數千到數十萬節點的擴充套件能力

與 InfiniBand 的直接對比邏輯

InfiniBand 路徑:  應用 → IB verbs → IB 傳輸層 → IB 鏈路層 → 專有硬體
Ultra Ethernet 路徑:         應用 → Ultra Ethernet verbs(相容擴充套件)→ Ultra Ethernet 傳輸層 → 乙太網路物理層 → 通用交換晶片

關鍵差異: Ultra Ethernet 需要在”通用乙太網路硬體”上實現接近”專用 InfiniBand 硬體”的效能,這是技術挑戰所在。


技術原理

[重要說明] Ultra Ethernet 規範截至 2024 年仍在制定中,部分細節未公開或未定稿。以下基於 UEC 釋出的公開技術概述,具體數值引數標 [規範制定中] 或定性描述。

協議棧架構

┌─────────────────────────────────────────────┐
│              應用層 / 架構層                  │
│         (NCCL, RCCL, oneCCL 等)              │
├─────────────────────────────────────────────┤
│           Ultra Ethernet Transport API        │  ← 新設計層
│    (可靠/不可靠語義, 多路徑感知)              │
├─────────────────────────────────────────────┤
│           Ultra Ethernet Transport Layer      │  ← 核心創新
│    (多路徑排程, 可靠傳輸, 擁塞訊號)           │
├─────────────────────────────────────────────┤
│         乙太網路 + 現有/新一代物理層            │
│    (400G/800G, 可能擴充套件至 1.6T)              │
├─────────────────────────────────────────────┤
│           通用乙太網路交換晶片                  │
│       (Broadcom、Cisco 等)                    │
└─────────────────────────────────────────────┘

關鍵機制詳解

1. 多路徑傳輸(Multipath Transport)

問題: 傳統 RDMA(包括 RoCE)通常單流單路徑,在胖樹拓撲中易造成鏈路不均。

Ultra Ethernet 方案:

  • 傳送端將單個流拆分為多個”子流”
  • 每個子流可走不同物理路徑
  • 接收端負責重組和排序
傳統 RoCE:
  GPU_0 ─────────────────────────────> GPU_1
         Path A (擁塞)

Ultra Ethernet 多路徑:
  GPU_0 ─── Path A ──────────────────> GPU_1
         ─── Path B ──────────────────>  (匯聚)
         ─── Path C ──────────────────>

技術難點: 亂序重組的開銷、路徑選擇策略、與交換器 ECMP 的配合。

2. 擁塞控制

Ultra Ethernet 需要解決傳統 RoCE 在大規模場景下的擁塞問題(如 PFC 死鎖、微突發)。

方向性設計(具體演算法引數 [規範制定中]):

  • 基於信用/速率的混合控制: 不完全依賴丟包訊號
  • 細粒度反饋: 比傳統 ECN 更頻繁、更精確的擁塞訊號
  • 與多路徑協同: 擁塞時動態調整子流分配

3. 可靠傳輸層

  • 選擇性重傳: 只重傳丟失的包,而非整段流
  • 端到端可靠性: 不依賴交換器層面的 PFC(目標)
  • O(1) 記憶體模型: 接收端緩衝管理最佳化

關鍵引數(定性)

引數Ultra Ethernet 設計目標來源口徑
支援頻寬400G / 800G 起步[UEC 公開技術概述]
擴充套件規模數萬至十萬節點級[UEC 公開願景,具體未驗證]
傳輸層延遲對標 InfiniBand 水平[目標宣告,實測資料未公開]
可靠性機制端到端,不依賴 PFC[UEC 設計目標]

技術演進史

時間線 (AI叢集網路技術演進)
═══════════════════════════════════════════════════════════════

2000s         InfiniBand 誕生,HPC 領域逐步普及

2010          乙太網路吞吐量追趕,開始進入 HPC

2014-2016     RoCE v2 釋出,RDMA over 乙太網路成為可能

2018-2020     大規模 ML 訓練興起,InfiniBand 成為 AI 叢集標配

2023 Q2       Ultra Ethernet Consortium (UEC) 成立
              │ ← Ultra Ethernet 專案啟動
2023-2024     規範制定階段,成員擴充套件

2024-2025     規範 v1.0 預期釋出 [具體時間未確認]

未來          首批 Ultra Ethernet 相容產品商用 [時間未確認]

關鍵節點: UEC 的成立是對”NVIDIA 通過 InfiniBand 繫結 AI 網路”的直接回應,反映了產業鏈下游對開放替代方案的強烈需求。


技術路線對比

維度InfiniBand (NVIDIA)RoCE v2 (傳統)Ultra Ethernet (UEC)
協議性質私有(NVIDIA 主導)開放標準開放標準(新設計)
硬體依賴專用 HCA、交換器通用乙太網路 + RDMA NIC通用乙太網路 + 新一代 NIC
多路徑能力有(自適應路由)有限(依賴 ECMP)原生設計,多路徑為核心特性
擁塞控制成熟,專用最佳化依賴 PFC + ECN,大規模受限目標:不依賴 PFC 的端到端控制
生態成熟度高,長期驗證中,廣泛部署但大規模有挑戰低,規範制定中
供應鏈NVIDIA 壟斷多廠商(Broadcom、Mellanox 等)多廠商(目標)
目標規模數萬節點已驗證通常 < 數千節點最優數萬至十萬節點(目標)
成本高(專用硬體溢價)目標中低(規模效應後)
集合通訊最佳化SHARP(網路內計算)[規範中是否包含未明確]

[注] Ultra Ethernet 列基於設計目標,實際效能需待產品驗證。InfiniBand 的 SHARP 能力是其重要差異化優勢,Ultra Ethernet 是否有對應方案未充分揭露。


上下游

產業鏈定位

上游(硬體/晶片)           中游(協議/軟體)          下游(終端使用者)
┌─────────────┐          ┌─────────────┐          ┌─────────────┐
│ 交換晶片     │          │ Ultra Ethernet 協議棧   │          │ 雲端廠商       │
│ (Broadcom,   │───────> │ UEC 規範    │───────> │ (Meta, Microsoft, │
│  Cisco等)    │          │             │          │  Oracle等)   │
├─────────────┤          ├─────────────┤          ├─────────────┤
│ RDMA NIC     │          │ 驅動/韌體    │          │ AI 公司      │
│ (AMD, Intel, │          │ 適配層      │          │ (OpenAI,     │
│  博通等)     │          │             │          │  Anthropic等)│
├─────────────┤          ├─────────────┤          ├─────────────┤
│ 光模組/線纜  │          │ OS/架構整合  │          │ HPC 中心     │
│ (多廠商)     │          │ (NCCL等)    │          │             │
└─────────────┘          └─────────────┘          └─────────────┘

關鍵環節分析

環節Ultra Ethernet 影響關鍵廠商
交換晶片需要支援 Ultra Ethernet 特性(或通過端側實現)Broadcom、Cisco、Intel
NIC需要新的 Ultra Ethernet 硬體加速AMD(Pensando)、Intel(IPU)、NVIDIA(觀望)
光互連高頻寬需求推動 800G/1.6T中際旭創、光迅科技、II-VI 等
雲端廠商最終買單方和推動方Meta、Microsoft、Oracle

關鍵指標

衡量 Ultra Ethernet 成功與否的核心指標

指標說明當前狀態
規範完成度Ultra Ethernet v1.0 是否按期釋出[制定中]
AllReduce 吞吐標準 AllReduce 操作的有效頻寬利用率[無公開基準測試]
尾延遲(P99)萬節點規模下的通訊尾延遲[無公開資料]
無 PFC 可靠性端到端傳輸的丟包率和恢復能力[設計目標,未驗證]
GPU 有效計算利用率通訊佔比下降帶來的 MFU 提升[需實測]
產品化時間線首批商用產品/部署案例[未公佈]

與 InfiniBand 對標的”及格線”

  • AllReduce 頻寬利用率: InfiniBand 大規模場景可達理論頻寬的 [需查證]% ,Ultra Ethernet 需達到接近水平
  • All-to-All 延遲: MoE 模型訓練的關鍵通訊,InfiniBand + SHARP 有優勢
  • 可擴充套件性: 需在 >10,000 節點規模驗證

供需與市場資料

需求側

AI 訓練叢集網路市場規模估算:

年份AI 網路裝置市場(估算)來源口徑
2023百億美元級[行業綜合估算,口徑不一]
2025E顯著增長[增長趨勢一致,具體數字分歧大]

需求驅動力:

  • AI 模型引數規模持續增長 → 叢集規模擴大 → 網路頻寬/延遲要求提升
  • 超大規模訓練(萬卡以上)成為常態
  • 雲端廠商希望降低對單一供應商依賴

供給側

Ultra Ethernet 潛在受益方:

  • 交換晶片廠商(非 NVIDIA): Broadcom、Cisco 等獲得新市場機會
  • AMD/Intel NIC 業務: 有了”開放標準”作為競爭籌碼
  • 光模組廠商: 800G/1.6T 需求剛性

供給風險:

  • 規範延遲或碎片化
  • 生態建設週期長(驅動、架構適配、使用者教育)
  • NVIDIA 可能通過降價或 InfiniBand 效能提升來回應

競爭格局演變

當前:  InfiniBand 佔據 AI 訓練叢集主導地位


過渡期: Ultra Ethernet 產品上市,早期使用者試水


成熟期: 雙軌並行 or Ultra Ethernet 蠶食份額?

       └──> 取決於:效能驗證、生態成熟度、NVIDIA 應對策略

代表公司與資本對映

UEC 核心成員及相關上市公司

公司角色受益邏輯風險點
AMDNIC(Pensando)、GPU開放生態削弱 NVIDIA 網路繫結優勢Ultra Ethernet 規範進展、NIC 競爭力
IntelNIC(IPU)、交換晶片重振網路業務執行力、產品時間線
Broadcom交換晶片、NIC核心基礎設施受益方Ultra Ethernet 是否真正在交換器層面深度支援 [未明確]
Cisco網路裝置、交換晶片重返 AI 網路主戰場市場份額能否從 NVIDIA 奪回
Arista網路裝置企業 AI 網路需求與 Cisco、NVIDIA 競爭
HPE系統整合、伺服器組建非 NVIDIA AI 叢集系統級競爭力

間接受益

公司邏輯
Meta最大推動方之一,降低 NVIDIA 依賴
光模組廠商800G/1.6T 需求不因協議而變

受損方

公司影響
NVIDIA網路業務面臨開放競爭,但 GPU 地位短期穩固

[注] 資本對映基於邏輯推論,非投資建議。Ultra Ethernet 商業化時間線存在不確定性。


投資邏輯

核心邏輯

“AI 基礎設施開放化”是大趨勢,Ultra Ethernet 是網路層的關鍵變數。

投資架構:
┌────────────────────────────────────────────┐
│  Ultra Ethernet 規範釋出 → 產品落地 → 規模部署         │
│     │              │           │           │
│   (2024-2025)   (2025-2026)  (2026+)      │
│     │              │           │           │
│  確定性增加      財務可見性   營收兌現      │
└────────────────────────────────────────────┘

分層投資邏輯

層級邏輯確定性代表標的方向
高確定性無論 Ultra Ethernet 是否成功,AI 網路頻寬需求增長光模組、高階交換晶片
中確定性Ultra Ethernet 推動乙太網路份額提升Broadcom、Cisco、Arista
低確定性特定 Ultra Ethernet NIC 廠商勝出AMD、Intel 網路業務

關鍵催化劑/風險點

催化劑:

  • Ultra Ethernet v1.0 規範正式釋出
  • 首個超大規模使用者公開宣佈採用 Ultra Ethernet
  • 第三方基準測試顯示效能接近 InfiniBand

風險點:

  • 規範持續延期,市場失去耐心
  • 效能實測與宣傳差距大
  • NVIDIA 通過 SHARP 升級、降價等策略保持領先
  • 生態碎片化(不同廠商實現不相容)

常見誤讀糾偏

❌ 誤讀 1:“Ultra Ethernet 已經成熟,可以替代 InfiniBand”

糾偏: 截至 2024 年,Ultra Ethernet 仍處於規範制定階段,尚無商用產品和大規模部署驗證。InfiniBand 在萬節點級 AI 叢集上有多年實戰經驗。將 Ultra Ethernet 視為”已完成的替代方案”是錯誤的,當前應視為”有潛力的挑戰者”。

❌ 誤讀 2:“Ultra Ethernet 就是升級版 RoCE v2”

糾偏: Ultra Ethernet 不是 RoCE 的增量升級,而是重新設計的傳輸層協議。其核心創新(原生多路徑、新型擁塞控制、端到端可靠性設計)在架構層面與 RoCE 有本質區別。雖然都執行在乙太網路上,但協議棧的設計哲學不同。

❌ 誤讀 3:“Ultra Ethernet 會讓 NVIDIA 網路業務崩塌”

糾偏:

  1. NVIDIA 網路業務(Spectrum-X)本身也在演進
  2. 即使 Ultra Ethernet 成功,生態建設需要時間,不會一夜顛覆
  3. NVIDIA 的核心壁壘是 GPU + 網路 + 軟體的垂直整合,單點突破影響有限
  4. 短期內更可能是”雙軌並存”而非”替代”

❌ 誤讀 4:“Ultra Ethernet 能大幅降低 AI 叢集成本”

糾偏: 網路裝置成本在 AI 叢集總成本中佔比有限(GPU 是大頭)。Ultra Ethernet 的價值更多在於供應鏈多元化避免被繫結,而非直接的成本削減。大規模部署後可能有成本優勢,但初期可能反而更貴(成熟度溢價)。


學習路徑

入門級(1-2 天)

Step 1: 瞭解背景
  └── 閱讀 UEC 官網 (ultraethernet.org) 的 Overview 文件
  └── 搜尋 "Ultra Ethernet vs InfiniBand" 的科普文章

Step 2: 理解問題
  └── 瞭解 RoCE v2 的基本原理和侷限性
  └── 理解 AI 訓練中的集合通訊模式(AllReduce、All-to-All)

進階級(1-2 周)

Step 3: 協議深入
  └── 閱讀 UEC 釋出的技術白皮書/規範草案(如有)
  └── 對比學習 InfiniBand 架構(理解競爭物件)

Step 4: 系統視角
  └── 研究大規模 AI 叢集的網路拓撲(Fat-tree、Rail-optimized)
  └── 瞭解 NCCL 等集合通訊庫如何利用網路

專家級(持續追蹤)

Step 5: 產業追蹤
  └── 關注 UEC 規範釋出進度
  └── 追蹤成員公司產品路線圖(AMD Pensando、Intel IPU 等)
  └── 搜尋 SIGCOMM/NSDI 等頂會的相關論文

Step 6: 實踐驗證
  └── 關注第三方基準測試報告
  └── 追蹤超大規模使用者的公開部署案例

推薦資源

型別資源說明
官方UEC 官網最權威的技術概述和規範進度
行業Data Center 網路相關行業報告瞭解市場格局
技術NVIDIA InfiniBand 文件理解競爭對手的成熟方案
學術RDMA/AI 網路相關論文理解底層技術挑戰

一句話總結

Ultra Ethernet 是乙太網路陣營對抗 InfiniBand 壟斷的”戰略武器”,其開放性和架構創新有真實價值,但成敗取決於規範質量、產品化速度和生態建設——這是一個”正確方向、尚未驗證”的技術賭注。


延伸閱讀與來源

權威來源

來源內容獲取方式
Ultra Ethernet Consortium (UEC) 官網規範概述、成員資訊、技術白皮書ultraethernet.org
UEC 技術工作組釋出物協議細節(如公開)UEC 官網或成員渠道

行業分析

來源型別內容可信度標註
半導體/網路行業研究報告市場規模、競爭格局[券商估算,口徑不一]
科技媒體深度報道產業動態、使用者視角[需交叉驗證]

技術背景

主題推薦方向
RDMA 基礎RoCE v2 協議、RDMA verbs
AI 叢集通訊NCCL、AllReduce 演算法、Ring/Tree AllReduce
InfiniBand 架構作為 Ultra Ethernet 的對標物件學習
網路擁塞控制DCQCN、Swift 等資料中心擁塞控制演算法

本頁資訊邊界宣告

  • 硬規格: 本文件中 Ultra Ethernet 的具體技術引數引用自 UEC 公開技術概述,具體數值待規範最終釋出確認
  • 市場資料: 引用行業綜合估算,標註了 [估算] 口徑,非精確資料
  • 公司對映: 基於公開成員列表和業務邏輯推論,不代表投資建議
  • 時間節點: 基於公開新聞報道,具體時間可能調整

本頁最後更新:基於 2024 年公開資訊。Ultra Ethernet 規範仍在制定中,建議定期關注 UEC 官方更新。

source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型