网络层 开放阅读

East-West Traffic

East-West Traffic

概念 ID
east-west-traffic
更新时间
2026-05-29
来源数量
待补

East-West Traffic

3 秒看懂

East-West Traffic(东西向流量)指数据中心内部服务器、GPU、交换机之间横向流动的数据,而非进出数据中心(南北向)的流量。在 AI 大模型训练集群中,数以千计的 GPU 必须以极高带宽和超低延迟互相通信,由此激增的内部数据流成为决定训练效率、功耗和集群总成本的关键瓶颈。

3 分钟产业解释

传统数据中心的东西向流量主要来自微服务间的远程过程调用和存储复制,带宽需求相对平稳。而深度学习大模型训练的兴起彻底改变了这一格局:

  • 分布式训练范式(数据并行、张量并行、流水线并行、专家并行)要求 GPU 间频繁交换梯度和激活,单次迭代的总通信量可达模型参数量的数倍。
  • 以千亿参数 MoE(混合专家)模型为例,每次前向传播需通过 All-to-All 通信将 token 路由至不同的专家子网络,瞬间产生海量东西向数据流。
  • AI 集群中东西向流量已占据总流量的 95% 以上,远超南北向。这意味着网络架构、交换芯片、光互连和拥塞控制机制都必须围绕“横向扩展”重新设计。

由此,东西向流量的技术路线——InfiniBand、RoCE v2、NVLink/NVSwitch、Rail-optimized 拓扑——成为产业链争夺的制高点。投资逻辑也从传统交换机转向高速硅光模块、共封装光学(CPO)和专用互连芯片等增量环节。

15 分钟专家深入

1. 单集群规模驱动的流量爆炸

  • GPT 级模型通常需要数千至数万 GPU 协同训练。每块 GPU 的计算与通信需严格重叠(overlap),否则大量时间会浪费在等待数据同步上。
  • 以数据并行为例,梯度聚合需在所有参与的 GPU 间执行 AllReduce,每个训练步的通信量为 2*(模型参数量) * (GPU数量-1)/GPU数量。当模型参数达到数百 GB 级别时,仅梯度同步就要求几十至上百 GB 的数据在几百微秒内完成归约,这已逼近现有互联总线的物理极限。
  • MoE 模型通过路由决定每个 token 由哪些专家处理,其 All-to-All 通信模式在 token 集中时会产生极端突发流量(microburst),极易触发网络拥塞甚至丢包,对无损网络要求苛刻。

2. 硬件架构如何回应

  • 超高带宽链路:GPU 间用 NVLink 构建单一域内极高速总线(900 GB/s 双向带宽,具体代际数字以厂商披露为准);跨节点走 InfiniBand 或高速以太网,单端口速率已从 200G 演进到 400G/800G,并通过 4×、8× 链路聚合获得 1.6T 以上有效带宽。
  • 胖树与基于轨道的拓扑:为消除超规模集群中的拥塞热区,业界采用 Rail-optimized 拓扑(如 NVIDIA Quantum InfiniBand 平台中的 DragonFly+ 或 TOR/leaf-spine 优化),使 AllReduce 的流量均匀分布在所有交换端口上。
  • 拥塞控制与自适应路由:InfiniBand 利用 Credit-based 流控实现绝对无损,以太网 RoCE 则依赖 PFC(优先级流控)和 ECN(显式拥塞通知),辅以后续的 DCQCN 等算法,尽力减少 PFC 风暴和死锁。
  • 网内计算:NVIDIA SHARP(Scalable Hierarchical Aggregation and Reduction Protocol)将 AllReduce 的归约操作卸载到交换机芯片内部,大幅削减网络中的数据拷贝次数和往返延迟,这对东西向流量是颠覆性的优化。

3. 关键制约因子

  • 组网规模与收敛比:收敛比(上行总带宽 / 下行总带宽)设计直接决定阻塞概率。AI 集群理想状态下收敛比接近 1:1,但这会极大推高交换机端口和光模块成本。实际部署多在 1:2 到 1:3 之间。
  • 功耗与封装:高带宽东西向流量使每个交换机功耗达数百瓦,光模块和电口损耗已成集群能效的核心难题。CPO(共封装光学)将光引擎与交换芯片共同封装,目标降低 pJ/bit 能耗。
  • 协议栈开销:传统 TCP/IP 因内核中断、多次拷贝已无法满足微秒级延迟要求,RDMA 成为必须。但 RDMA over Converged Ethernet (RoCE) 在企业场景兼容性好,InfiniBand 则在最大规模部署中因更低的尾部延迟和原生卸载而占优。

技术原理

以下通过分布式训练通信原语剖析东西向流量产生的深层机制。

1. AllReduce(数据并行 / 张量并行)

GPU0 ──[环形或树形拓扑]── GPU1 ── ... ── GPU(N-1)
Step 1: Reduce-Scatter (各 GPU 将块数据归约到不同 GPU)
Step 2: AllGather (所有 GPU 收集最终结果)
  • 总通信量:若模型参数大小为 Φ,每一块 GPU 发送和接收的总数据量 ≈ 2Φ × (N-1)/N。对于千亿参数(~200 GB FP16),N=1024 时,单步梯度同步需要数百 GB 的网络流量。
  • 这是最典型的跨越 Pod 交换机的东西向流量,直接测试胖树带宽和交换机缓冲深度。

2. All-to-All(MoE 路由)

Token 分配后:每个 GPU 的 token 分组被散射到对应的专家所在 GPU,
专家处理完后反向散射回原 GPU。
  • 每次前向传播,每个 GPU 与所有其他 GPU 交换不同大小的消息,模式不规则且具有高度突发性。网络必须能够承受瞬间的全互联通信,对端口带宽均匀性和缓冲管理提出极高要求。
  • 总数据量取决于 token 批次大小和专家容量。在典型的 Mixtral 8×7B 等模型中,All-to-All 造成的网络流量可达数百 MB 级 per step,是造成东西向拥塞的元凶之一。

3. 点对点传输(流水线并行)

A层 GPU -> 下一层 GPU,发送中间激活和梯度。
  • 通信量相对较小,但对延迟敏感,因为位于关键路径。

4. 通信计算重叠

  • 训练框架(如 Megatron-LM)会对通信与矩阵乘法进行调度,通过 CUDA 流并行将 AllReduce 分解为多块,在计算下一层时后台通信。东西向链路的带宽和延迟决定了重叠的“隐身”效果。

5. 网内计算(SHARP)的流量削减

传统: A ──[发数据]→B→C→D(汇聚)→... (多次来回报文)
SHARP: A → [交换机内归约] → 结果直接返回各 GPU
  • SHARP 在交换机 ASIC 内预置 ALU,执行 sum/max/avg 等操作,数据流只需少量往返,将东西向逻辑流量砍掉一半以上。

由于未检索到最新的参数表,上述技术描述采用定性机制,部分确切比特率、延迟时延数值请参考厂商最新白皮书。

技术演进史

  • 2010年前:数据中心以南北流量为主,东西向仅为少量数据库副本同步,网络采用传统三层架构(接入-汇聚-核心),收敛比高达 1:10 以上。
  • 2012-2017(云计算兴起):东西向流量占比升至 70%+,虚拟机和容器间东西向通信促使 Spine-Leaf 架构普及,并催生 SDN 和 VXLAN 隧道。
  • 2017-2020(分布式深度学习起步):NVIDIA 收购 Mellanox 后,InfiniBand 从高性能计算进入 AI 集群;RoCE v2 基于以太网的无损方案成熟,跨 Pod GPU 通信的严重瓶颈显现。
  • 2020-至今(超大规模大模型):千卡~万卡 GPU 集群成为刚需,东西向流量密度增百倍。Rail-optimized 拓扑、网内计算、CPO 成为关键议题。NVLink Switch 域内带宽达 TB/s 级,而跨域互连由 200G→400G→800G 单端口迭代推动。
  • 未来趋势:片间互连用 UCIe、CXL 延伸内存池化;交换机芯片向 50Tb/s+ 口吞吐迈进;光互连逐渐渗透到板卡级甚至芯片内,东西向流量的物理边界进一步模糊。

技术路线对比

指标InfiniBand (IB)RoCE v2 (RDMA over Ethernet)NVLink/NVSwitch (片内域)CXL/PCIe 共享内存
物理层IB 专用交换机和 HCA 网卡标准以太网交换机 + 支持 RoCE 的网卡专有片间总线 + NVSwitch 芯片PCIe 5.0/6.0/CXL 链路
单端口带宽趋势400/800 Gb/s(迭代快)同以太网演进 400/800 Gb/sTB/s 级(如 900 GB/s 双向,代际有别)百 GB/s 级 (x16 PCIe 6.0 ≈ 128 GB/s)
延迟亚微秒级(本地 ~1µs,交换 ~2µs)通常略高于 IB(3-5µs),受以太网抖动影响ns 级,片上范围数百 ns 到 µs,取决于拓扑
拥塞控制信用量模型(绝对无损)PFC+ECN+DCQCN(尽力无损,有死锁风险)无,域内基于批量调度原生无拥塞(点对点)
生态 & 成本封闭,成本极高,NVIDIA 主导开放标准,交换机和光模块利用以太网产业链降本闭源,仅限 NVIDIA 平台开放标准,但共享内存生态尚在初期
适用范围超大规模 AI 训练集群(万卡级)核心网中小规模或混合云训练集群,企业可扩展单机内/多机同一机架内高速互联内存扩展、推理集群内存池化

注:详细速率和延迟请以各厂商最新数据手册为准,本表仅展示趋势性差异。

上下游

  • 上游核心器件
    交换芯片:博通 (Tomahawk/Jericho)、Mellanox (Quantum/Spectrum)、Marvell (Teralynx)、思科 Silicon One;国内有盛科等。
    高速互连 PHY & SerDes:博通、Credo、华为海思。
    光模块/有源光缆 (AOC)/直连铜缆 (DAC):中际旭创、Finisar、Lumentum、华工科技等,速率向 800G、1.6T 演进。
    共封装光学 (CPO):Intel、Ayar Labs、博通均在布局,目标将光引擎和交换芯片封装在一起,大幅降低东西向流量功耗。
  • 中游系统集成与软件
    网络设备商:NVIDIA (Mellanox)、思科、Arista、华为、新华三;
    通信库与协议栈:NCCL (NVIDIA),UCX,各家 RoCE 驱动,OFS(Open Fabrics Society)。
  • 下游应用
    超大规模云厂商:AWS (自研网络芯片)、Azure、Google (TPU 互连)、Meta (OCP 开放交换机),均在自研 AI 训练集群。
    AI 训练平台提供商:CoreWeave、Lambda、NVIDIA DGX 系统。
    大模型开发者:OpenAI、Anthropic、国内百模大战参与者,是最终的需求端。

关键指标

  • 总聚合带宽:一组 GPU 可通过上层交换机获得的饱和通信带宽(通常用 Tb/s 衡量),直接影响 AllReduce 完成时间。
  • 平均端到端延迟:包括网卡 DMA、SerDes 序列化、交换转发和网络传播时间,要求亚微秒至微秒级,减小 GPU 空闲等待。
  • 尾部延迟 (Tail Latency):P99 或 P99.9 延迟对训练步长影响巨大,因为同步操作需要所有 GPU 都完成通信。突发流量下尾部延迟决定训练吞吐稳定性。
  • 消息速率 (Message Rate):处理大量小消息(而非单纯带宽)的能力,MoE All-to-All 会产生大量 128KB-1MB 的消息。
  • 无丢包能力:RDMA 协议对丢包极其敏感,PFC 风暴或丢包引起 Go-Back-N 重传会严重降速。无损保证是首要之务。
  • 功耗效率 (pJ/bit):在高密东西向流量下,单端口功耗(~20W+)乘以成百上千端口会令机架电力超限,推动 CPO 和 liquid cooling 创新。

供需与市场数据

(因联网检索失败,本节未加载实时数据,仅做定性框架说明)

  • 供给端:交换芯片产能集中在台积电先进制程(5nm、3nm),受 CoWoS 先进封装限制。NVIDIA Spectrum-X 平台(以太网)试图将 InfiniBand 生态拓展至更普适市场,但供给仍由博通和 NVIDIA 瓜分大头。光模块制造商扩产 800G 产能,因硅光技术兴起,传统 EM/DFB 激光器和 DSP 需持续紧张。
  • 需求端:随着 GPT-5 等级模型开始训练,万卡集群互联带宽需求以指数增长。市场分析机构估计,到 2025 年,AI 网络设备(交换机和互连)市场规模可达数十亿美元,复合增长率超 30%。互联网巨头的大规模资本开支计划(如微软、Meta)是主要催化剂。
  • 市场结构:InfiniBand 在超大规模训练中占据主导,但 RoCE 正从非关键任务向中等规模训练渗透;以太网阵营有望在推理集群和分布式推理中大放异彩,因后者更重成本而非极限延迟。
  • 风险提示:具体份额、规模数字及增长率请以权威调研机构最新报告为准。

代表公司与资本映射

  • NVIDIA (Mellanox):端到端 AI 网络霸主,提供 InfiniBand Quantum 系列交换机和 ConnectX 智能网卡,并在 Grace Hopper 和 Blackwell 架构中深化 NVLink 域。Spectrum-X 以太网平台意图抢占云服务商市场。
  • 博通:Tomahawk/Jericho 交换芯片被 Arista、思科和 ODM 厂商广泛采用,RJ45 和 QSFP-DD 生态成熟,是 RoCE v2 方案基石。
  • Arista Networks:基于博通芯片的超大规模数据中心交换机领导者,活跃于 Meta 等 AI 集群的 RoCE 部署,软件 EOS 针对 RDMA 做了大量优化。
  • 中际旭创、新易盛:国内高速光模块龙头,800G 率先供货北美云厂商,1.6T 加速研发,直接受益于 AI 集群端口带宽升级。
  • 华为/新华三:提供端到端以太网和 IB 组网方案,在国内超算中心和智算集群中占一席之地,同时自研交换机芯片。
    资本映射上,AI 训练时期的东西向流量升级催生了交换芯片、光模块、DAC/ACC 铜缆三领域的高景气周期,投资者聚焦于“网络设备份额提升 + 速率迭代”双逻辑。

投资逻辑

  1. “算力升级必然带来网络升级”:每代 GPU 的性能增幅需要匹配更高带宽的互连,否则算力浪费。NVSwitch、PCIe 6.0/CXL 2.0 等每一次升级都是新增量。
  2. 方案渗透路径:超大规模集群先用 InfiniBand,渗透率稳定;中型集群和未来推理集群将以 RoCE 为主。关注以太网在 AI 网络中的渗透率提升,以及 800G RoCE 交换机/网卡的放量节奏。
  3. 光进铜退与 CPO:电口单通道 112G、224G 等推进困难,光互连从交换机线缆向背板、甚至片间延伸,CPO 若商用成功,将对现有光模块格局产生重大重构。
  4. 网内计算与智能网卡:SHARP 和 DPU/SmartNIC 不仅提升训练效率,还强化供应商粘性,构成附加值高地。
  5. 国产替代逻辑:半导体管制背景下,国产交换芯片(盛科)、高速 PHY 和光模块上游(电芯片、DSP)存在巨大空白市场。

常见误读纠偏

误读 1:“AI 训练瓶颈在 GPU 算力,东西向流量只占很小的成本,不重要。”
事实:当集群扩展至千卡以上时,网络通信时间占比可达 30%~50%,成为绝对瓶颈。忽略网络会导致 GPU 大量闲置,总体拥有成本飙升。阿里、Meta 等机构的研究均表明,优化的网络拓扑可将训练吞吐翻倍。
误读 2:“所有场景都应使用 InfiniBand,RoCE 完全不可靠。”
事实:InfiniBand 在大规模训练中优势明显,但 RoCE v2 通过 DCQCN、EFA 等优化亦可支持数千卡集群的无损通信。以太网方案生态更开放,成本更低,适合推理集群、小规模微调以及边缘 AI 场景。
误读 3:“东西向流量就是指 East-West 方向,物理布线是横向的。”
事实:东西向是从网络架构视角定义的逻辑方位,与物理布线方向无关。Spine-Leaf 的横向叶信机之间的流量都属于东西向。更多的 Leaf 交换机之间连接就是东西向链路。

学习路径

  1. 分布式训练通信原理:阅读 NVIDIA 的 Megatron-LM 论文《Efficient Large-Scale Language Model Training on GPU Clusters》;理解张量并行、流水线并行、数据并行的通信模式。
  2. 网络协议:学习 InfiniBand 架构规范概要、RoCE v2 标准与 PFC/ECN 机制;DCQCN 算法论文(Mellanox/Microsoft)。
  3. 架构白皮书:NVIDIA DGX SuperPOD 网络设计指南、Meta 的 OCP AI 集群架构披露、Google TPU v4 论文中的光互连描述。
  4. 拥塞控制与流量工程:学术论文如《Revisiting Network Support for RDMA》、《Congestion Control for High Bandwidth-Delay Product Networks》。
  5. 投资研究:查阅行业分析机构 Omdia、LightCounting 的 AI 网络市场报告,理解光模块和交换芯片的出货节奏与价格趋势。

一句话总结

East-West Traffic 是 AI 集群的循环系统,它从根本上定义了分布式训练的规模上限和成本结构,下一代网络与互连技术的制高点就藏在这些横向流动的每一比特之中。

延伸阅读与来源

(本文因检索工具故障未获取实时数据,所有性能参数均为定性描述或需参照厂商最新披露;关键判断基于 NVDIA、Meta、Google 等公开的技术论文与行业共识)

  • NVIDIA Networking 官方技术博客(developer.nvidia.com/networking)
  • Meta 开放计算项目 AI 训练网络白皮书 (OCP)
  • 《The Road to 400G and Beyond for AI Networks》 - Broadcom/Arista 技术峰会演讲稿
  • 《In-Network Aggregation with SHARP》 - Mellanox 技术报告
  • IEEE/ACM 会议论文:SIGCOMM、NSDI 中关于 RDMA 与拥塞控制的最新研究
  • LightCounting, Omdia 光模块与交换机芯片市场追踪报告(需订阅)

注:若需特定产品代际的精确端口数、功耗、价格曲线,请直接参考 NVIDIA Quantum-3/4、博通 Tomahawk 5、思科 Silicon One G200 等产品主页及最新季度财报演示材料。

source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型