网络层 开放阅读

Cut-through Switching

Cut-through Switching

概念 ID
cut-through-switching
更新时间
2026-05-29
来源数量
待补

Cut-through Switching

3 秒看懂

一句话:交换机读到目的地址就立刻开始转发数据帧,不必等整个帧接收完毕,核心收益是纳秒级转发时延降低

类比:传统”存储转发”像邮局——必须拆开整封信才能转寄;Cut-through 像流水线接力——拿到信封上地址就递出去,内容还在后面跑。

关键词:直通转发 · 零等待转发 · InfiniBand 默认模式 · AI 集群时延关键一环

3 分钟产业解释

为什么这个概念在 2024—2025 年突然被频繁提及?

大模型训练集群(万卡级)的规模爆炸,让网络时延从”技术指标”变成了”成本指标”。一个 AllReduce 操作中的单次消息传输通常跨越数个到数十个网络跳转,每次转发多 100 ns 的时延,在万卡集群中以 O(log N) 级别叠加,直接拉低 GPU 有效利用率(MFU),等于白烧算力。

Cut-through Switching 是交换机转发层面最基础也最底层的时延优化手段——它不涉及拥塞控制、路由协议或智能网卡,纯粹是交换机 ASIC 转发流水线的工程选择。但正因为它是”每跳必经”的基础操作,其影响具有全集群乘数效应。

产业地位

  • InfiniBand 规范(IBTA)从设计之初就以 cut-through 为默认转发模式,这是 NVIDIA(Mellanox)生态在 HPC/AI 领域时延优势的基石之一。
  • 高端数据中心以太网交换机(Arista 7800 系列、Cisco Nexus 9000 系列等)也普遍支持 cut-through 模式,但以太网协议本身(需处理 VLAN tag、QoS 等)使得实际时延通常高于原生 InfiniBand。
  • 在 RoCE v2(RDMA over Converged Ethernet)部署中,选择 cut-through 模式的交换机是降低 RDMA 写操作尾时延的常见工程实践。

15 分钟专家深入

核心机制

以太网(IEEE 802.3)帧的帧格式决定了交换机需要接收多少字节才能做出转发决策:

┌─────────┬─────┬────────────┬────────────┬─────────────┬─────────┬─────┐
│ Preamble│ SFD │ Dst MAC    │ Src MAC    │ EtherType   │ Payload │ FCS │
│ 7 bytes │ 1 B │ 6 bytes    │ 6 bytes    │ 2 bytes     │46-1500B │ 4 B │
└─────────┴─────┴────────────┴────────────┴─────────────┴─────────┴─────┘
                      ↑
              Cut-through 点:读完 Dst MAC(14 字节后)即可查表转发

三种转发模式对比

维度Store-and-ForwardFragment-FreeCut-through
等待字节数整帧(含 FCS)64 字节~14 字节(Dst MAC)
是否检查 CRC/FCS✅ 是❌ 否❌ 否
转发时延最高最低
错误帧转发风险低(可过滤碎片帧)有(会转发 CRC 错误帧)
典型用途通用以太网早期 Catalyst 系列HPC/AI 高性能网络

时延定量分析

转发时延 = 接收前置字节的串行化时间 + ASIC 查表/决策时间 + 输出端口排队时间

其中串行化延迟(Serialization Delay)= 帧长度 / 线速。Cut-through 直接将需要串行化等待的帧长度从”整帧”降到”~14 字节”。

以 1518 字节最大标准以太网帧为例(不含前导码):

线速Store-and-Forward 串行化Cut-through 串行化(~14B)节省
10 Gbps~1.21 μs~11 ns~1.20 μs
25 Gbps~486 ns~4.5 ns~481 ns
100 Gbps~121 ns~1.1 ns~120 ns
400 Gbps~30 ns~0.28 ns~30 ns

注:以上为纯串行化延迟,不含交换 ASIC 内部管线延迟和排队延迟。实际端到端转发时延通常在 100 ns ~ 数百 ns 量级(含 ASIC 处理),具体取决于厂商实现 [行业共识/厂商白皮书]。

关键洞察:随着线速提升到 400G/800G,单帧串行化时间已经很短,cut-through 的相对收益在缩小;但绝对值仍然重要——在多跳级联场景下,每跳节省 30–100 ns 仍是不可忽视的优化。

关键工程细节

  1. 自适应 Cut-through(Adaptive/Silent Cut-through):现代交换 ASIC 通常支持在检测到持续 CRC 错误时,自动回退到 store-and-forward 模式以隔离故障端口,错误恢复后又切回 cut-through。这是多数商用交换机的默认行为。

  2. 缓冲区设计影响:Cut-through 模式下,帧在交换机内停留时间极短,理论上只需要极小的共享缓冲(Shared Buffer)。这也是 InfiniBand 交换机(如 NVIDIA Quantum 系列)通常配备相对较小片上缓冲(数十 MB 量级 [厂商规格表/供应链估算])的架构原因之一。相比之下,需要做流量整形和拥塞吸收的以太网交换机(尤其是面向通用数据中心的型号)往往配备数百 MB 至 GB 级的 HBM/DDR 缓冲。

  3. 与 InfiniBand 的关系:InfiniBand 协议栈(IBTA 规范)天然假设 cut-through 转发,其 Credit-based 流控机制保证了在 cut-through 模式下不会因缓冲区溢出而丢帧。这是 InfiniBand 在确定性低时延方面优于传统以太网的架构基础之一。

  4. 与 RoCE v2 的交互:在以太网上部署 RoCE v2 时,交换机选择 cut-through 模式可降低单跳时延,但还需要配合 PFC(Priority Flow Control)/ECN(Explicit Congestion Notification)等无损/低损机制来避免因缓冲不足导致的丢包(RDMA 对丢包极度敏感,一次超时重传可能导致微秒级时延跳变为毫秒级)。


技术原理(最深)

交换 ASIC 转发管线与 Cut-through 的硬件实现

                     交换 ASIC 转发管线示意(Cut-through 模式)

  输入端口                                                  输出端口
  ───────┐                                           ┌──────────
         │    ┌───────────┐    ┌──────────┐         │
  物理层 ├───→│ 前导码检测  │───→│ Dst MAC  │──┬──→ 转发表查找 ──→ 输出队列 → 发送
  SERDES │    │ & 字节对齐  │    │ 提取 &    │  │       │
         │    └───────────┘    │ 暂存     │  │   ┌───┴───┐
  ───────┘                     └──────────┘  │   │Crossbar│
                                             │   │ / NoC  │
         ◄── 14 字节到达后即发起 ────────────┘   └───┬───┘
            转发表查找,帧数据还在                      │
            后续字节陆续到达                          转发数据
                                                    流水线输出

关键时序

  • T₀:第一个字节到达输入端口
  • T₁₄:14 字节(前导码 + Dst MAC)到齐,触发转发表查找(TCAM/SRAM,通常 <10 ns 完成)
  • T₁₄+Δ:转发决策完成,开始向输出端口转发(帧后续数据还在输入端口陆续到达)
  • 输出端口的第一个字节在 T₁₄+Δ+σ 时刻发出(σ 为 crossbar/NoC 内部穿越时延)

对比 Store-and-Forward

  • 必须等到 T_max(整个帧最后一个字节 + FCS 校验通过),才能开始输出
  • 额外等待时间 = (帧长 - 14) / 线速

对 AI 集体通信的实际影响

在 AllReduce(Ring 或 Tree)操作中,每个 GPU 需要通过网络发送和接收多个 chunk:

  GPU 0 ──→ Switch 0 ──→ Switch 1 ──→ ... ──→ Switch K ──→ GPU 1
            (hop 1)       (hop 2)               (hop K)

  单次通信的网络时延 = Σ(每跳转发时延) + Σ(每跳排队时延) + 传播时延
                     ≈ K × T_cut_through + 排队 + 光纤延迟

在胖树(Fat-Tree)拓扑中,跨 Pod 通信可能经过 3–5 跳交换机。每跳节省 100 ns,3 跳即节省 300 ns。对于一个需要传输 100 GB 数据的 AllReduce(万卡 LLM 训练场景),虽然串行化时间(数据量/带宽)远大于时延,但在小消息通信(如梯度同步的控制消息、Tensor Parallelism 的 AllReduce for attention)场景下,时延是主要瓶颈。

注:实际 AllReduce 性能受消息大小、拓扑、拥塞状况等多因素影响,cut-through 只是诸多优化之一。量化收益需要具体场景模拟,此处为定性分析。


技术演进史

时期里程碑背景
1980s 末Kalpana(后被 Cisco 收购)推出首款以太网交换机,引入 cut-through 概念以太网从共享总线(Hub)转向交换架构
1990sCisco Catalyst 系列支持 fragment-free 模式作为折中碰撞域内碎片帧常见,纯 cut-through 风险高
1999InfiniBand Trade Association 成立,规范将 cut-through 作为默认转发模式HPC 社区追求确定性低时延
2000sBroadcom Memory Switch Architecture 引入共享缓冲 + cut-through 混合设计数据中心开始规模化
2010sArista 7500 系列、Mellanox SwitchX-2 等支持自适应 cut-through万兆以太网普及,HPC 对时延敏感度提升
2019+NVIDIA 收购 Mellanox,InfiniBand Quantum 系列成为 AI 训练集群标配网络大模型训练驱动万卡级集群,网络成为瓶颈
2022+400G/800G 以太网与 InfiniBand NDR/XDR 并行演进,cut-through 在两种协议栈中均为基础能力AI 网络进入”时延 + 带宽”双驱动时代

技术路线对比(量化表)

维度Cut-throughStore-and-Forward适用场景差异
最小转发时延(单跳)~100–200 ns(含 ASIC 处理,典型值 [厂商白皮书])~1–2 μs(1500B 帧 @100G)时延敏感型:HPC/AI、高频交易
CRC 校验❌ 不校验(或延迟校验)✅ 完整校验可靠性要求高:通用企业/运营商
错误帧处理会转发至目的端,由目的端检测在交换机处丢弃恶劣链路环境:S&F 更安全
缓冲区需求较小(帧不停留)较大(需存储整帧)缓冲区成本敏感:Cut-through 更省
对 Jumbo Frame 的影响收益更大(串行化节省更多)基线Jumbo 常见场景(存储网络、AI):Cut-through 收益放大
协议兼容性InfiniBand 原生;以太网需厂商支持以太网默认部署复杂度:Cut-through 以太网需注意与 QoS/VLAN 的交互

上下游

上游(Cut-through 交换机依赖什么)

  交换 ASIC
  ├── 转发表(TCAM / SRAM)    ← 需极低查找时延(&lt;10 ns)
  ├── 共享缓冲(片上 SRAM)     ← 小容量即可(Cut-through 不大量缓存)
  ├── Crossbar / NoC 互联      ← 低时延内部交换矩阵
  └── 高速 SerDes               ← 112G SerDes(400G/800G 端口基础)

  协议栈
  ├── InfiniBand(IBTA 规范)   ← 原生 cut-through + credit 流控
  └── 以太网(IEEE 802.3)      ← 需配合 PFC/ECN 实现近无损

下游(谁在用 Cut-through 交换机)

  AI 训练集群
  ├── 万卡 LLM 训练(GPT-4/Llama 3 级别)
  ├── Tensor Parallelism + Pipeline Parallelism 通信
  └── AllReduce / All-to-All / AllGather 集体通信

  HPC 集群
  ├── 科学仿真(气候、分子动力学)
  └── MPI 通信(点对点 + 集体操作)

  高频交易 / 低时延金融
  └── 订单簿同步、行情分发

关键指标

指标说明典型范围(交换机级)
端口转发时延(Port-to-Port Latency)从输入端口第一个比特到输出端口第一个比特100–300 ns(高性能型号 [厂商白皮书])
串行化时延节省相比 Store-and-Forward 的帧等待时间减少30 ns(400G/1500B)到 ~1.2 μs(10G/1500B)
误帧转发率Cut-through 模式下 CRC 错误帧被转发的比例100%(除非启用自适应回退)
缓冲区大小交换机片上共享缓冲数十 MB(IB 交换机)至数百 MB(以太网交换机)[供应链估算]
跳数放大效应多跳级联下的总时延节省N 跳 × 单跳节省

供需与市场数据

需求侧驱动力

  • AI 训练集群规模增长:单集群 GPU 数从千卡向万卡(甚至十万卡)迈进,对每跳时延的敏感度持续上升。NVIDIA 在 GTC 2024 等场合多次强调网络时延对训练效率(MFU)的影响。
  • 大模型通信模式变化:MoE(Mixture of Experts)架构引入大量 All-to-All 通信(Expert Dispatch),这比传统 AllReduce 对时延更敏感,因为 All-to-All 的通信模式更难预测,排队时延叠加效应更显著。

供给侧格局

  • InfiniBand 阵营:NVIDIA(Mellanox)Quantum-2 / Quantum-X 系列,占 AI 训练网络市场主导份额 [行业报告]。Cut-through 为原生能力。
  • 以太网阵营:Arista(7800R3/7060X5)、Cisco(Nexus 9000)、Broadcom(Memory Switch ASIC)等均支持 cut-through 模式。以太网在 AI 训练网络中的渗透正在加速(尤其超大规模云厂商自研网络方案)。
  • 市场规模参考:全球数据中心交换机市场规模在百亿美元量级 [行业报告],其中 AI 相关网络基础设施为增长最快的细分。

注:以上为定性描述 + 行业共识级别估算,具体数字因统计口径差异较大,未标精确值。


代表公司与资本映射

公司与 Cut-through 的关系资本代码备注
NVIDIAInfiniBand 交换机(Quantum 系列)默认 cut-through,AI 训练网络核心供应商NVDA通过 Mellanox 收购获得完整 IB 生态
BroadcomMemory Switch ASIC 用于多家交换机厂商,支持 cut-through 模式AVGOMemory Switch 架构是业界主流
Arista Networks高端以太网交换机支持 cut-through,AI/DC 网络领先ANET瞄准 RoCE v2 AI 网络市场
CiscoNexus 系列支持 cut-through,但更强调通用数据中心CSCO传统企业网络份额大
Marvell交换 ASIC(Teralynx 系列)支持 cut-through,竞争 BroadcomMRVL专注定制化 ASIC

投资逻辑

为什么 Cut-through Switching 是值得理解的底层技术?

  1. 它是 AI 算力”有效利用率”的乘数因子:网络时延直接影响 MFU(Model FLOPs Utilization)。投资者理解 cut-through,有助于理解为什么”光模块 + 交换机 + 拓扑设计”是 AI Capex 中不可忽视的一环。

  2. InfiniBand vs. 以太网之争的切入点:InfiniBand 的时延优势很大程度上源于协议层面的 cut-through 设计哲学(+credit 流控)。以太网阵营要追赶,不仅需要硬件支持 cut-through,还需解决 ECN/PFC 的部署复杂性。理解 cut-through 有助于判断”IB 会被以太网取代吗”这个关键问题。

  3. 关注点应从”单跳时延”转向”系统级时延”:随着 400G/800G 线速下串行化时延已很小,未来 cut-through 的边际收益在缩小;但排队时延(拥塞管理)和端侧时延(NIC/SmartNIC/BlueField 处理)成为更关键的优化方向。投资视角应关注”系统级时延优化”而非仅”转发时延”。


常见误读纠偏

误读 1:“Cut-through 交换机不需要缓冲区”

纠偏:Cut-through 不等于”零缓冲”。帧在查表、等待输出端口可用期间仍需暂存;多输入端口同时向同一输出端口发送时必须排队。Cut-through 的真实含义是”不等整帧到齐就启动转发”,缓冲需求较小但仍存在。InfiniBand 交换机通常使用数十 MB 量级的片上 SRAM 共享缓冲 [供应链估算]。

误读 2:“Cut-through 一定比 Store-and-Forward 快,所有场景都应该用 Cut-through”

纠偏

  • 在高线速(400G/800G)、短帧(<256B)场景下,cut-through 相比 S&F 的串行化节省可能只有个位数纳秒,优势微乎其微。
  • 在链路质量差(误码率高)的场景下,cut-through 会将 CRC 错误帧转发到目的端,导致上层协议(TCP/RDMA)触发重传,整体时延反而可能劣于 S&F。
  • 在需要精细化 QoS(优先级调度、流量整形)的场景下,cut-through 模式下帧还未完全到达就开始转发,使得基于完整帧头部的优先级判断和调度更复杂。
  • 结论:cut-through 的优势在”高线速 + 长帧 + 低误码率 + 多跳级联”场景下最显著,正是 AI 训练集群的典型特征。

误读 3:“AI 集群的网络瓶颈主要就是转发时延”

纠偏:转发时延(cut-through 可优化的部分)在总网络时延中占比正在下降。排队时延(由拥塞引起)和端侧处理时延(NIC DMA、协议栈处理、GPU 内存拷贝)往往占更大比重。Cut-through 是”必要的基础优化”,但远不是”充分的优化”。Investor 在评估网络方案时,应关注端到端时延优化的完整栈,而非仅交换机转发模式。


学习路径

入门(30 分钟)

  1. 理解以太网帧格式(Preamble → Dst MAC → … → FCS)
  2. 对比 Store-and-Forward vs. Cut-through 的转发时序图
  3. 计算一个 1500B 帧在 100G 线速下的两种模式串行化时延差

进阶(2 小时)

  1. 了解 InfiniBand 协议栈中 cut-through 与 credit-based 流控的协同设计
  2. 阅读 Arista 或 Broadcom 交换机白皮书中关于 cut-through / adaptive cut-through 的配置与限制说明
  3. 理解 Fat-Tree / Rail-Optimized 拓扑下多跳时延的累积效应

深度(1 周+)

  1. 阅读 Mellanox/NVIDIA 关于 InfiniBand vs. RoCE v2 在 AI 训练集群中时延对比的技术文档
  2. 研究网络模拟器(如 SimGrid、OMNeT++)中建模 cut-through vs. S&F 对 AllReduce 性能的影响
  3. 追踪 UEC(Ultra Ethernet Consortium)规范中对以太网 AI 网络转发模式的最新定义

一句话总结

Cut-through Switching 是交换机转发管线中”不等整帧到齐就启动转发”的基础时延优化技术,它在 InfiniBand 中是协议级默认能力,在以太网中是厂商可配置选项,其单跳收益在 AI 万卡集群的多跳级联中具有乘数效应——但它只是端到端时延优化中”必要但不充分”的一环。


延伸阅读与来源

  1. IEEE 802.3 Ethernet Standard — 以太网帧格式与转发规范的基础定义
  2. InfiniBand Trade Association (IBTA) Specification — InfiniBand 协议中 cut-through 与 credit 流控的定义
  3. Arista Networks White Papers — 交换机 cut-through / adaptive cut-through 模式的技术说明
  4. Broadcom Memory Switch Architecture Overview — 交换 ASIC 内部缓冲与转发管线设计
  5. NVIDIA/Mellanox InfiniBand vs. RoCE v2 Technical Comparison — AI 网络中两种协议栈的时延对比分析
  6. J. Mudigonda et al., “NetLord: A Scalable Multi-Tenant Network Architecture for Virtualized Datacenters” (SIGCOMM 2011) — 数据中心交换架构中 cut-through 的讨论
  7. A. Singh et al., “Jupiter Rising: A Decade of Clos Topologies and Centralized Control in Google’s Datacenter Network” (SIGCOMM 2015) — 超大规模数据中心网络架构演进

注:本文硬规格(端口时延范围、缓冲区大小等)标注了来源口径,未充分标注的为行业共识级定性描述。具体厂商产品规格请以其最新数据手册为准。

source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型