網路層 開放閱讀

East-West Traffic

East-West Traffic

概念 ID
east-west-traffic
更新時間
2026-05-29
來源數量
待補

East-West Traffic

3 秒看懂

East-West Traffic(東西向流量)指資料中心內部伺服器、GPU、交換器之間橫向流動的資料,而非進出資料中心(南北向)的流量。在 AI 大型模型訓練叢集中,數以千計的 GPU 必須以極高頻寬和超低延遲互相通訊,由此激增的內部資料流成為決定訓練效率、功耗和叢集總成本的關鍵瓶頸。

3 分鐘產業解釋

傳統資料中心的東西向流量主要來自微服務間的遠端過程呼叫和儲存複製,頻寬需求相對平穩。而深度學習大型模型訓練的興起徹底改變了這一格局:

  • 分散式訓練範式(資料並行、張量並行、流水線並行、專家並行)要求 GPU 間頻繁交換梯度和啟用,單次迭代的總通訊量可達模型引數量的數倍。
  • 以千億引數 MoE(混合專家)模型為例,每次前向傳播需通過 All-to-All 通訊將 token 路由至不同的專家子網路,瞬間產生海量東西向資料流。
  • AI 叢集中東西向流量已佔據總流量的 95% 以上,遠超南北向。這意味著網路架構、交換晶片、光互連和擁塞控制機制都必須圍繞“橫向擴充套件”重新設計。

由此,東西向流量的技術路線——InfiniBand、RoCE v2、NVLink/NVSwitch、Rail-optimized 拓撲——成為產業鏈爭奪的制高點。投資邏輯也從傳統交換器轉向高速矽光模組、共封裝光學(CPO)和專用互連晶片等增量環節。

15 分鐘專家深入

1. 單叢集規模驅動的流量爆炸

  • GPT 級模型通常需要數千至數萬 GPU 協同訓練。每塊 GPU 的計算與通訊需嚴格重疊(overlap),否則大量時間會浪費在等待資料同步上。
  • 以資料並行為例,梯度聚合需在所有參與的 GPU 間執行 AllReduce,每個訓練步的通訊量為 2*(模型引數量) * (GPU數量-1)/GPU數量。當模型引數達到數百 GB 級別時,僅梯度同步就要求幾十至上百 GB 的資料在幾百微秒內完成歸約,這已逼近現有互聯匯流排的物理極限。
  • MoE 模型通過路由決定每個 token 由哪些專家處理,其 All-to-All 通訊模式在 token 集中時會產生極端突發流量(microburst),極易觸發網路擁塞甚至丟包,對無損網路要求苛刻。

2. 硬體架構如何回應

  • 超高頻寬鏈路:GPU 間用 NVLink 建置單一域內極高速匯流排(900 GB/s 雙向頻寬,具體代際數字以廠商揭露為準);跨節點走 InfiniBand 或高速乙太網路,單埠速率已從 200G 演進到 400G/800G,並通過 4×、8× 鏈路聚合獲得 1.6T 以上有效頻寬。
  • 胖樹與基於軌道的拓撲:為消除超規模叢集中的擁塞熱區,業界採用 Rail-optimized 拓撲(如 NVIDIA Quantum InfiniBand 平台中的 DragonFly+ 或 TOR/leaf-spine 最佳化),使 AllReduce 的流量均勻分佈在所有交換埠上。
  • 擁塞控制與自適應路由:InfiniBand 利用 Credit-based 流控實現絕對無損,乙太網路 RoCE 則依賴 PFC(優先順序流控)和 ECN(顯式擁塞通知),輔以後續的 DCQCN 等演算法,盡力減少 PFC 風暴和死鎖。
  • 網內計算:NVIDIA SHARP(Scalable Hierarchical Aggregation and Reduction Protocol)將 AllReduce 的歸約操作解除安裝到交換器晶片內部,大幅削減網路中的資料複製次數和往返延遲,這對東西向流量是顛覆性的最佳化。

3. 關鍵制約因子

  • 組網規模與收斂比:收斂比(上行總頻寬 / 下行總頻寬)設計直接決定阻塞機率。AI 叢集理想狀態下收斂比接近 1:1,但這會極大推高交換器埠和光模組成本。實際部署多在 1:2 到 1:3 之間。
  • 功耗與封裝:高頻寬東西向流量使每個交換器功耗達數百瓦,光模組和電口損耗已成叢集能效的核心難題。CPO(共封裝光學)將光引擎與交換晶片共同封裝,目標降低 pJ/bit 能耗。
  • 協議棧開銷:傳統 TCP/IP 因核心中斷、多次複製已無法滿足微秒級延遲要求,RDMA 成為必須。但 RDMA over Converged Ethernet (RoCE) 在企業場景相容性好,InfiniBand 則在最大規模部署中因更低的尾部延遲和原生解除安裝而佔優。

技術原理

以下通過分散式訓練通訊原語剖析東西向流量產生的深層機制。

1. AllReduce(資料並行 / 張量並行)

GPU0 ──[環形或樹形拓撲]── GPU1 ── ... ── GPU(N-1)
Step 1: Reduce-Scatter (各 GPU 將塊資料歸約到不同 GPU)
Step 2: AllGather (所有 GPU 收集最終結果)
  • 總通訊量:若模型引數大小為 Φ,每一塊 GPU 傳送和接收的總資料量 ≈ 2Φ × (N-1)/N。對於千億引數(~200 GB FP16),N=1024 時,單步梯度同步需要數百 GB 的網路流量。
  • 這是最典型的跨越 Pod 交換器的東西向流量,直接測試胖樹頻寬和交換器緩衝深度。

2. All-to-All(MoE 路由)

Token 分配後:每個 GPU 的 token 分組被散射到對應的專家所在 GPU,
專家處理完後反向散射回原 GPU。
  • 每次前向傳播,每個 GPU 與所有其他 GPU 交換不同大小的訊息,模式不規則且具有高度突發性。網路必須能夠承受瞬間的全互聯通訊,對埠頻寬均勻性和緩衝管理提出極高要求。
  • 總資料量取決於 token 批次大小和專家容量。在典型的 Mixtral 8×7B 等模型中,All-to-All 造成的網路流量可達數百 MB 級 per step,是造成東西向擁塞的元兇之一。

3. 點對點傳輸(流水線並行)

A層 GPU -> 下一層 GPU,傳送中間啟用和梯度。
  • 通訊量相對較小,但對延遲敏感,因為位於關鍵路徑。

4. 通訊計算重疊

  • 訓練架構(如 Megatron-LM)會對通訊與矩陣乘法進行排程,通過 CUDA 流並行將 AllReduce 分解為多塊,在計算下一層時後臺通訊。東西向鏈路的頻寬和延遲決定了重疊的“隱身”效果。

5. 網內計算(SHARP)的流量削減

傳統: A ──[發資料]→B→C→D(匯聚)→... (多次來回報文)
SHARP: A → [交換器內歸約] → 結果直接返回各 GPU
  • SHARP 在交換器 ASIC 內預置 ALU,執行 sum/max/avg 等操作,資料流只需少量往返,將東西向邏輯流量砍掉一半以上。

由於未檢索到最新的參數列,上述技術描述採用定性機制,部分確切位元率、延遲時延數值請參考廠商最新白皮書。

技術演進史

  • 2010年前:資料中心以南北流量為主,東西向僅為少量資料庫副本同步,網路採用傳統三層架構(接入-匯聚-核心),收斂比高達 1:10 以上。
  • 2012-2017(雲端運算興起):東西向流量佔比升至 70%+,虛擬機器和容器間東西向通訊促使 Spine-Leaf 架構普及,並催生 SDN 和 VXLAN 隧道。
  • 2017-2020(分散式深度學習起步):NVIDIA 收購 Mellanox 後,InfiniBand 從高效能運算進入 AI 叢集;RoCE v2 基於乙太網路的無損方案成熟,跨 Pod GPU 通訊的嚴重瓶頸顯現。
  • 2020-至今(超大規模大型模型):千卡~萬卡 GPU 叢集成為剛需,東西向流量密度增百倍。Rail-optimized 拓撲、網內計算、CPO 成為關鍵議題。NVLink Switch 域內頻寬達 TB/s 級,而跨域互連由 200G→400G→800G 單埠迭代推動。
  • 未來趨勢:片間互連用 UCIe、CXL 延伸記憶體池化;交換器晶片向 50Tb/s+ 口吞吐邁進;光互連逐漸滲透到板卡級甚至晶片內,東西向流量的物理邊界進一步模糊。

技術路線對比

指標InfiniBand (IB)RoCE v2 (RDMA over Ethernet)NVLink/NVSwitch (片內域)CXL/PCIe 共享記憶體
物理層IB 專用交換器和 HCA 網絡卡標準乙太網路交換器 + 支援 RoCE 的網絡卡專有片間匯流排 + NVSwitch 晶片PCIe 5.0/6.0/CXL 鏈路
單埠頻寬趨勢400/800 Gb/s(迭代快)同乙太網路演進 400/800 Gb/sTB/s 級(如 900 GB/s 雙向,代際有別)百 GB/s 級 (x16 PCIe 6.0 ≈ 128 GB/s)
延遲亞微秒級(本地 ~1µs,交換 ~2µs)通常略高於 IB(3-5µs),受乙太網路抖動影響ns 級,片上範圍數百 ns 到 µs,取決於拓撲
擁塞控制信用量模型(絕對無損)PFC+ECN+DCQCN(盡力無損,有死鎖風險)無,域內基於批次排程原生無擁塞(點對點)
生態 & 成本封閉,成本極高,NVIDIA 主導開放標準,交換器和光模組利用乙太網路產業鏈降本閉源,僅限 NVIDIA 平台開放標準,但共享記憶體生態尚在初期
適用範圍超大規模 AI 訓練叢集(萬卡級)核心網中小規模或混合雲端訓練叢集,企業可擴充套件單機內/多機同一機架內高速互聯記憶體擴充套件、推論叢集記憶體池化

注:詳細速率和延遲請以各廠商最新資料手冊為準,本表僅展示趨勢性差異。

上下游

  • 上游核心器件
    交換晶片:博通 (Tomahawk/Jericho)、Mellanox (Quantum/Spectrum)、Marvell (Teralynx)、思科 Silicon One;國內有盛科等。
    高速互連 PHY & SerDes:博通、Credo、華為海思。
    光模組/有源光纜 (AOC)/直連銅纜 (DAC):中際旭創、Finisar、Lumentum、華工科技等,速率向 800G、1.6T 演進。
    共封裝光學 (CPO):Intel、Ayar Labs、博通均在版面配置,目標將光引擎和交換晶片封裝在一起,大幅降低東西向流量功耗。
  • 中游系統整合與軟體
    網路裝置商:NVIDIA (Mellanox)、思科、Arista、華為、新華三;
    通訊庫與協議棧:NCCL (NVIDIA),UCX,各家 RoCE 驅動,OFS(Open Fabrics Society)。
  • 下游應用
    超大規模雲端廠商:AWS (自研網路晶片)、Azure、Google (TPU 互連)、Meta (OCP 開放交換器),均在自研 AI 訓練叢集。
    AI 訓練平台提供商:CoreWeave、Lambda、NVIDIA DGX 系統。
    大型模型開發者:OpenAI、Anthropic、國內百模大戰參與者,是最終的需求端。

關鍵指標

  • 總聚合頻寬:一組 GPU 可通過上層交換器獲得的飽和通訊頻寬(通常用 Tb/s 衡量),直接影響 AllReduce 完成時間。
  • 平均端到端延遲:包括網絡卡 DMA、SerDes 序列化、交換轉發和網路傳播時間,要求亞微秒至微秒級,減小 GPU 空閒等待。
  • 尾部延遲 (Tail Latency):P99 或 P99.9 延遲對訓練步長影響巨大,因為同步操作需要所有 GPU 都完成通訊。突發流量下尾部延遲決定訓練吞吐穩定性。
  • 訊息速率 (Message Rate):處理大量小訊息(而非單純頻寬)的能力,MoE All-to-All 會產生大量 128KB-1MB 的訊息。
  • 無丟包能力:RDMA 協議對丟包極其敏感,PFC 風暴或丟包引起 Go-Back-N 重傳會嚴重降速。無損保證是首要之務。
  • 功耗效率 (pJ/bit):在高密東西向流量下,單埠功耗(~20W+)乘以成百上千埠會令機架電力超限,推動 CPO 和 liquid cooling 創新。

供需與市場資料

(因聯網檢索失敗,本節未載入即時資料,僅做定性架構說明)

  • 供給端:交換晶片產能集中在臺積電先進製程(5nm、3nm),受 CoWoS 先進封裝限制。NVIDIA Spectrum-X 平台(乙太網路)試圖將 InfiniBand 生態拓展至更普適市場,但供給仍由博通和 NVIDIA 瓜分大頭。光模組製造商擴產 800G 產能,因矽光技術興起,傳統 EM/DFB 雷射器和 DSP 需持續緊張。
  • 需求端:隨著 GPT-5 等級模型開始訓練,萬卡叢集互聯頻寬需求以指數增長。市場分析機構估計,到 2025 年,AI 網路裝置(交換器和互連)市場規模可達數十億美元,複合增長率超 30%。網際網路巨頭的大規模資本支出計劃(如微軟、Meta)是主要催化劑。
  • 市場結構:InfiniBand 在超大規模訓練中佔據主導,但 RoCE 正從非關鍵任務向中等規模訓練滲透;乙太網路陣營有望在推論叢集和分散式推論中大放異彩,因後者更重成本而非極限延遲。
  • 風險提示:具體份額、規模數字及增長率請以權威調研機構最新報告為準。

代表公司與資本對映

  • NVIDIA (Mellanox):端到端 AI 網路霸主,提供 InfiniBand Quantum 系列交換器和 ConnectX 智慧網絡卡,並在 Grace Hopper 和 Blackwell 架構中深化 NVLink 域。Spectrum-X 乙太網路平台意圖搶佔雲端服務商市場。
  • 博通:Tomahawk/Jericho 交換晶片被 Arista、思科和 ODM 廠商廣泛採用,RJ45 和 QSFP-DD 生態成熟,是 RoCE v2 方案基石。
  • Arista Networks:基於博通晶片的超大規模資料中心交換器領導者,活躍於 Meta 等 AI 叢集的 RoCE 部署,軟體 EOS 針對 RDMA 做了大量最佳化。
  • 中際旭創、新易盛:國內高速光模組龍頭,800G 率先供貨北美雲端廠商,1.6T 加速研發,直接受益於 AI 叢集埠頻寬升級。
  • 華為/新華三:提供端到端乙太網路和 IB 組網方案,在國內超算中心和智算叢集中佔一席之地,同時自研交換器晶片。
    資本對映上,AI 訓練時期的東西向流量升級催生了交換晶片、光模組、DAC/ACC 銅纜三領域的高景氣週期,投資者聚焦於“網路裝置份額提升 + 速率迭代”雙邏輯。

投資邏輯

  1. “算力升級必然帶來網路升級”:每代 GPU 的效能增幅需要匹配更高頻寬的互連,否則算力浪費。NVSwitch、PCIe 6.0/CXL 2.0 等每一次升級都是新增量。
  2. 方案滲透路徑:超大規模叢集先用 InfiniBand,滲透率穩定;中型叢集和未來推論叢集將以 RoCE 為主。關注乙太網路在 AI 網路中的滲透率提升,以及 800G RoCE 交換器/網絡卡的放量節奏。
  3. 光進銅退與 CPO:電口單通道 112G、224G 等推進困難,光互連從交換器線纜向背板、甚至片間延伸,CPO 若商用成功,將對現有光模組格局產生重大重構。
  4. 網內計算與智慧網絡卡:SHARP 和 DPU/SmartNIC 不僅提升訓練效率,還強化供應商粘性,構成附加值高地。
  5. 國產替代邏輯:半導體管制背景下,國產交換晶片(盛科)、高速 PHY 和光模組上游(電晶片、DSP)存在巨大空白市場。

常見誤讀糾偏

誤讀 1:“AI 訓練瓶頸在 GPU 算力,東西向流量只佔很小的成本,不重要。”
事實:當叢集擴充套件至千卡以上時,網路通訊時間佔比可達 30%~50%,成為絕對瓶頸。忽略網路會導致 GPU 大量閒置,總體擁有成本飆升。阿里、Meta 等機構的研究均表明,最佳化的網路拓撲可將訓練吞吐翻倍。
誤讀 2:“所有場景都應使用 InfiniBand,RoCE 完全不可靠。”
事實:InfiniBand 在大規模訓練中優勢明顯,但 RoCE v2 通過 DCQCN、EFA 等最佳化亦可支援數千卡叢集的無損通訊。乙太網路方案生態更開放,成本更低,適合推論叢集、小規模微調以及邊緣 AI 場景。
誤讀 3:“東西向流量就是指 East-West 方向,物理佈線是橫向的。”
事實:東西向是從網路架構視角定義的邏輯方位,與物理佈線方向無關。Spine-Leaf 的橫向葉信機之間的流量都屬於東西向。更多的 Leaf 交換器之間連線就是東西向鏈路。

學習路徑

  1. 分散式訓練通訊原理:閱讀 NVIDIA 的 Megatron-LM 論文《Efficient Large-Scale Language Model Training on GPU Clusters》;理解張量並行、流水線並行、資料並行的通訊模式。
  2. 網路協議:學習 InfiniBand 架構規範概要、RoCE v2 標準與 PFC/ECN 機制;DCQCN 演算法論文(Mellanox/Microsoft)。
  3. 架構白皮書:NVIDIA DGX SuperPOD 網路設計指南、Meta 的 OCP AI 叢集架構揭露、Google TPU v4 論文中的光互連描述。
  4. 擁塞控制與流量工程:學術論文如《Revisiting Network Support for RDMA》、《Congestion Control for High Bandwidth-Delay Product Networks》。
  5. 投資研究:查閱行業分析機構 Omdia、LightCounting 的 AI 網路市場報告,理解光模組和交換晶片的出貨節奏與價格趨勢。

一句話總結

East-West Traffic 是 AI 叢集的迴圈系統,它從根本上定義了分散式訓練的規模上限和成本結構,下一代網路與互連技術的制高點就藏在這些橫向流動的每一位元之中。

延伸閱讀與來源

(本文因檢索工具故障未獲取即時資料,所有效能引數均為定性描述或需參照廠商最新揭露;關鍵判斷基於 NVDIA、Meta、Google 等公開的技術論文與行業共識)

  • NVIDIA Networking 官方技術部落格(developer.nvidia.com/networking)
  • Meta 開放計算專案 AI 訓練網路白皮書 (OCP)
  • 《The Road to 400G and Beyond for AI Networks》 - Broadcom/Arista 技術峰會演講稿
  • 《In-Network Aggregation with SHARP》 - Mellanox 技術報告
  • IEEE/ACM 會議論文:SIGCOMM、NSDI 中關於 RDMA 與擁塞控制的最新研究
  • LightCounting, Omdia 光模組與交換器晶片市場追蹤報告(需訂閱)

注:若需特定產品代際的精確埠數、功耗、價格曲線,請直接參考 NVIDIA Quantum-3/4、博通 Tomahawk 5、思科 Silicon One G200 等產品主頁及最新季度財報演示材料。

source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型