Cut-through Switching
3 秒看懂
一句话:交换机读到目的地址就立刻开始转发数据帧,不必等整个帧接收完毕,核心收益是纳秒级转发时延降低。
类比:传统”存储转发”像邮局——必须拆开整封信才能转寄;Cut-through 像流水线接力——拿到信封上地址就递出去,内容还在后面跑。
关键词:直通转发 · 零等待转发 · InfiniBand 默认模式 · AI 集群时延关键一环
3 分钟产业解释
为什么这个概念在 2024—2025 年突然被频繁提及?
大模型训练集群(万卡级)的规模爆炸,让网络时延从”技术指标”变成了”成本指标”。一个 AllReduce 操作中的单次消息传输通常跨越数个到数十个网络跳转,每次转发多 100 ns 的时延,在万卡集群中以 O(log N) 级别叠加,直接拉低 GPU 有效利用率(MFU),等于白烧算力。
Cut-through Switching 是交换机转发层面最基础也最底层的时延优化手段——它不涉及拥塞控制、路由协议或智能网卡,纯粹是交换机 ASIC 转发流水线的工程选择。但正因为它是”每跳必经”的基础操作,其影响具有全集群乘数效应。
产业地位:
- InfiniBand 规范(IBTA)从设计之初就以 cut-through 为默认转发模式,这是 NVIDIA(Mellanox)生态在 HPC/AI 领域时延优势的基石之一。
- 高端数据中心以太网交换机(Arista 7800 系列、Cisco Nexus 9000 系列等)也普遍支持 cut-through 模式,但以太网协议本身(需处理 VLAN tag、QoS 等)使得实际时延通常高于原生 InfiniBand。
- 在 RoCE v2(RDMA over Converged Ethernet)部署中,选择 cut-through 模式的交换机是降低 RDMA 写操作尾时延的常见工程实践。
15 分钟专家深入
核心机制
以太网(IEEE 802.3)帧的帧格式决定了交换机需要接收多少字节才能做出转发决策:
┌─────────┬─────┬────────────┬────────────┬─────────────┬─────────┬─────┐
│ Preamble│ SFD │ Dst MAC │ Src MAC │ EtherType │ Payload │ FCS │
│ 7 bytes │ 1 B │ 6 bytes │ 6 bytes │ 2 bytes │46-1500B │ 4 B │
└─────────┴─────┴────────────┴────────────┴─────────────┴─────────┴─────┘
↑
Cut-through 点:读完 Dst MAC(14 字节后)即可查表转发
三种转发模式对比:
| 维度 | Store-and-Forward | Fragment-Free | Cut-through |
|---|---|---|---|
| 等待字节数 | 整帧(含 FCS) | 64 字节 | ~14 字节(Dst MAC) |
| 是否检查 CRC/FCS | ✅ 是 | ❌ 否 | ❌ 否 |
| 转发时延 | 最高 | 中 | 最低 |
| 错误帧转发风险 | 无 | 低(可过滤碎片帧) | 有(会转发 CRC 错误帧) |
| 典型用途 | 通用以太网 | 早期 Catalyst 系列 | HPC/AI 高性能网络 |
时延定量分析
转发时延 = 接收前置字节的串行化时间 + ASIC 查表/决策时间 + 输出端口排队时间
其中串行化延迟(Serialization Delay)= 帧长度 / 线速。Cut-through 直接将需要串行化等待的帧长度从”整帧”降到”~14 字节”。
以 1518 字节最大标准以太网帧为例(不含前导码):
| 线速 | Store-and-Forward 串行化 | Cut-through 串行化(~14B) | 节省 |
|---|---|---|---|
| 10 Gbps | ~1.21 μs | ~11 ns | ~1.20 μs |
| 25 Gbps | ~486 ns | ~4.5 ns | ~481 ns |
| 100 Gbps | ~121 ns | ~1.1 ns | ~120 ns |
| 400 Gbps | ~30 ns | ~0.28 ns | ~30 ns |
注:以上为纯串行化延迟,不含交换 ASIC 内部管线延迟和排队延迟。实际端到端转发时延通常在 100 ns ~ 数百 ns 量级(含 ASIC 处理),具体取决于厂商实现 [行业共识/厂商白皮书]。
关键洞察:随着线速提升到 400G/800G,单帧串行化时间已经很短,cut-through 的相对收益在缩小;但绝对值仍然重要——在多跳级联场景下,每跳节省 30–100 ns 仍是不可忽视的优化。
关键工程细节
-
自适应 Cut-through(Adaptive/Silent Cut-through):现代交换 ASIC 通常支持在检测到持续 CRC 错误时,自动回退到 store-and-forward 模式以隔离故障端口,错误恢复后又切回 cut-through。这是多数商用交换机的默认行为。
-
缓冲区设计影响:Cut-through 模式下,帧在交换机内停留时间极短,理论上只需要极小的共享缓冲(Shared Buffer)。这也是 InfiniBand 交换机(如 NVIDIA Quantum 系列)通常配备相对较小片上缓冲(数十 MB 量级 [厂商规格表/供应链估算])的架构原因之一。相比之下,需要做流量整形和拥塞吸收的以太网交换机(尤其是面向通用数据中心的型号)往往配备数百 MB 至 GB 级的 HBM/DDR 缓冲。
-
与 InfiniBand 的关系:InfiniBand 协议栈(IBTA 规范)天然假设 cut-through 转发,其 Credit-based 流控机制保证了在 cut-through 模式下不会因缓冲区溢出而丢帧。这是 InfiniBand 在确定性低时延方面优于传统以太网的架构基础之一。
-
与 RoCE v2 的交互:在以太网上部署 RoCE v2 时,交换机选择 cut-through 模式可降低单跳时延,但还需要配合 PFC(Priority Flow Control)/ECN(Explicit Congestion Notification)等无损/低损机制来避免因缓冲不足导致的丢包(RDMA 对丢包极度敏感,一次超时重传可能导致微秒级时延跳变为毫秒级)。
技术原理(最深)
交换 ASIC 转发管线与 Cut-through 的硬件实现
交换 ASIC 转发管线示意(Cut-through 模式)
输入端口 输出端口
───────┐ ┌──────────
│ ┌───────────┐ ┌──────────┐ │
物理层 ├───→│ 前导码检测 │───→│ Dst MAC │──┬──→ 转发表查找 ──→ 输出队列 → 发送
SERDES │ │ & 字节对齐 │ │ 提取 & │ │ │
│ └───────────┘ │ 暂存 │ │ ┌───┴───┐
───────┘ └──────────┘ │ │Crossbar│
│ │ / NoC │
◄── 14 字节到达后即发起 ────────────┘ └───┬───┘
转发表查找,帧数据还在 │
后续字节陆续到达 转发数据
流水线输出
关键时序:
- T₀:第一个字节到达输入端口
- T₁₄:14 字节(前导码 + Dst MAC)到齐,触发转发表查找(TCAM/SRAM,通常 <10 ns 完成)
- T₁₄+Δ:转发决策完成,开始向输出端口转发(帧后续数据还在输入端口陆续到达)
- 输出端口的第一个字节在 T₁₄+Δ+σ 时刻发出(σ 为 crossbar/NoC 内部穿越时延)
对比 Store-and-Forward:
- 必须等到 T_max(整个帧最后一个字节 + FCS 校验通过),才能开始输出
- 额外等待时间 = (帧长 - 14) / 线速
对 AI 集体通信的实际影响
在 AllReduce(Ring 或 Tree)操作中,每个 GPU 需要通过网络发送和接收多个 chunk:
GPU 0 ──→ Switch 0 ──→ Switch 1 ──→ ... ──→ Switch K ──→ GPU 1
(hop 1) (hop 2) (hop K)
单次通信的网络时延 = Σ(每跳转发时延) + Σ(每跳排队时延) + 传播时延
≈ K × T_cut_through + 排队 + 光纤延迟
在胖树(Fat-Tree)拓扑中,跨 Pod 通信可能经过 3–5 跳交换机。每跳节省 100 ns,3 跳即节省 300 ns。对于一个需要传输 100 GB 数据的 AllReduce(万卡 LLM 训练场景),虽然串行化时间(数据量/带宽)远大于时延,但在小消息通信(如梯度同步的控制消息、Tensor Parallelism 的 AllReduce for attention)场景下,时延是主要瓶颈。
注:实际 AllReduce 性能受消息大小、拓扑、拥塞状况等多因素影响,cut-through 只是诸多优化之一。量化收益需要具体场景模拟,此处为定性分析。
技术演进史
| 时期 | 里程碑 | 背景 |
|---|---|---|
| 1980s 末 | Kalpana(后被 Cisco 收购)推出首款以太网交换机,引入 cut-through 概念 | 以太网从共享总线(Hub)转向交换架构 |
| 1990s | Cisco Catalyst 系列支持 fragment-free 模式作为折中 | 碰撞域内碎片帧常见,纯 cut-through 风险高 |
| 1999 | InfiniBand Trade Association 成立,规范将 cut-through 作为默认转发模式 | HPC 社区追求确定性低时延 |
| 2000s | Broadcom Memory Switch Architecture 引入共享缓冲 + cut-through 混合设计 | 数据中心开始规模化 |
| 2010s | Arista 7500 系列、Mellanox SwitchX-2 等支持自适应 cut-through | 万兆以太网普及,HPC 对时延敏感度提升 |
| 2019+ | NVIDIA 收购 Mellanox,InfiniBand Quantum 系列成为 AI 训练集群标配网络 | 大模型训练驱动万卡级集群,网络成为瓶颈 |
| 2022+ | 400G/800G 以太网与 InfiniBand NDR/XDR 并行演进,cut-through 在两种协议栈中均为基础能力 | AI 网络进入”时延 + 带宽”双驱动时代 |
技术路线对比(量化表)
| 维度 | Cut-through | Store-and-Forward | 适用场景差异 |
|---|---|---|---|
| 最小转发时延(单跳) | ~100–200 ns(含 ASIC 处理,典型值 [厂商白皮书]) | ~1–2 μs(1500B 帧 @100G) | 时延敏感型:HPC/AI、高频交易 |
| CRC 校验 | ❌ 不校验(或延迟校验) | ✅ 完整校验 | 可靠性要求高:通用企业/运营商 |
| 错误帧处理 | 会转发至目的端,由目的端检测 | 在交换机处丢弃 | 恶劣链路环境:S&F 更安全 |
| 缓冲区需求 | 较小(帧不停留) | 较大(需存储整帧) | 缓冲区成本敏感:Cut-through 更省 |
| 对 Jumbo Frame 的影响 | 收益更大(串行化节省更多) | 基线 | Jumbo 常见场景(存储网络、AI):Cut-through 收益放大 |
| 协议兼容性 | InfiniBand 原生;以太网需厂商支持 | 以太网默认 | 部署复杂度:Cut-through 以太网需注意与 QoS/VLAN 的交互 |
上下游
上游(Cut-through 交换机依赖什么)
交换 ASIC
├── 转发表(TCAM / SRAM) ← 需极低查找时延(<10 ns)
├── 共享缓冲(片上 SRAM) ← 小容量即可(Cut-through 不大量缓存)
├── Crossbar / NoC 互联 ← 低时延内部交换矩阵
└── 高速 SerDes ← 112G SerDes(400G/800G 端口基础)
协议栈
├── InfiniBand(IBTA 规范) ← 原生 cut-through + credit 流控
└── 以太网(IEEE 802.3) ← 需配合 PFC/ECN 实现近无损
下游(谁在用 Cut-through 交换机)
AI 训练集群
├── 万卡 LLM 训练(GPT-4/Llama 3 级别)
├── Tensor Parallelism + Pipeline Parallelism 通信
└── AllReduce / All-to-All / AllGather 集体通信
HPC 集群
├── 科学仿真(气候、分子动力学)
└── MPI 通信(点对点 + 集体操作)
高频交易 / 低时延金融
└── 订单簿同步、行情分发
关键指标
| 指标 | 说明 | 典型范围(交换机级) |
|---|---|---|
| 端口转发时延(Port-to-Port Latency) | 从输入端口第一个比特到输出端口第一个比特 | 100–300 ns(高性能型号 [厂商白皮书]) |
| 串行化时延节省 | 相比 Store-and-Forward 的帧等待时间减少 | 30 ns(400G/1500B)到 ~1.2 μs(10G/1500B) |
| 误帧转发率 | Cut-through 模式下 CRC 错误帧被转发的比例 | 100%(除非启用自适应回退) |
| 缓冲区大小 | 交换机片上共享缓冲 | 数十 MB(IB 交换机)至数百 MB(以太网交换机)[供应链估算] |
| 跳数放大效应 | 多跳级联下的总时延节省 | N 跳 × 单跳节省 |
供需与市场数据
需求侧驱动力
- AI 训练集群规模增长:单集群 GPU 数从千卡向万卡(甚至十万卡)迈进,对每跳时延的敏感度持续上升。NVIDIA 在 GTC 2024 等场合多次强调网络时延对训练效率(MFU)的影响。
- 大模型通信模式变化:MoE(Mixture of Experts)架构引入大量 All-to-All 通信(Expert Dispatch),这比传统 AllReduce 对时延更敏感,因为 All-to-All 的通信模式更难预测,排队时延叠加效应更显著。
供给侧格局
- InfiniBand 阵营:NVIDIA(Mellanox)Quantum-2 / Quantum-X 系列,占 AI 训练网络市场主导份额 [行业报告]。Cut-through 为原生能力。
- 以太网阵营:Arista(7800R3/7060X5)、Cisco(Nexus 9000)、Broadcom(Memory Switch ASIC)等均支持 cut-through 模式。以太网在 AI 训练网络中的渗透正在加速(尤其超大规模云厂商自研网络方案)。
- 市场规模参考:全球数据中心交换机市场规模在百亿美元量级 [行业报告],其中 AI 相关网络基础设施为增长最快的细分。
注:以上为定性描述 + 行业共识级别估算,具体数字因统计口径差异较大,未标精确值。
代表公司与资本映射
| 公司 | 与 Cut-through 的关系 | 资本代码 | 备注 |
|---|---|---|---|
| NVIDIA | InfiniBand 交换机(Quantum 系列)默认 cut-through,AI 训练网络核心供应商 | NVDA | 通过 Mellanox 收购获得完整 IB 生态 |
| Broadcom | Memory Switch ASIC 用于多家交换机厂商,支持 cut-through 模式 | AVGO | Memory Switch 架构是业界主流 |
| Arista Networks | 高端以太网交换机支持 cut-through,AI/DC 网络领先 | ANET | 瞄准 RoCE v2 AI 网络市场 |
| Cisco | Nexus 系列支持 cut-through,但更强调通用数据中心 | CSCO | 传统企业网络份额大 |
| Marvell | 交换 ASIC(Teralynx 系列)支持 cut-through,竞争 Broadcom | MRVL | 专注定制化 ASIC |
投资逻辑
为什么 Cut-through Switching 是值得理解的底层技术?
-
它是 AI 算力”有效利用率”的乘数因子:网络时延直接影响 MFU(Model FLOPs Utilization)。投资者理解 cut-through,有助于理解为什么”光模块 + 交换机 + 拓扑设计”是 AI Capex 中不可忽视的一环。
-
InfiniBand vs. 以太网之争的切入点:InfiniBand 的时延优势很大程度上源于协议层面的 cut-through 设计哲学(+credit 流控)。以太网阵营要追赶,不仅需要硬件支持 cut-through,还需解决 ECN/PFC 的部署复杂性。理解 cut-through 有助于判断”IB 会被以太网取代吗”这个关键问题。
-
关注点应从”单跳时延”转向”系统级时延”:随着 400G/800G 线速下串行化时延已很小,未来 cut-through 的边际收益在缩小;但排队时延(拥塞管理)和端侧时延(NIC/SmartNIC/BlueField 处理)成为更关键的优化方向。投资视角应关注”系统级时延优化”而非仅”转发时延”。
常见误读纠偏
误读 1:“Cut-through 交换机不需要缓冲区”
纠偏:Cut-through 不等于”零缓冲”。帧在查表、等待输出端口可用期间仍需暂存;多输入端口同时向同一输出端口发送时必须排队。Cut-through 的真实含义是”不等整帧到齐就启动转发”,缓冲需求较小但仍存在。InfiniBand 交换机通常使用数十 MB 量级的片上 SRAM 共享缓冲 [供应链估算]。
误读 2:“Cut-through 一定比 Store-and-Forward 快,所有场景都应该用 Cut-through”
纠偏:
- 在高线速(400G/800G)、短帧(<256B)场景下,cut-through 相比 S&F 的串行化节省可能只有个位数纳秒,优势微乎其微。
- 在链路质量差(误码率高)的场景下,cut-through 会将 CRC 错误帧转发到目的端,导致上层协议(TCP/RDMA)触发重传,整体时延反而可能劣于 S&F。
- 在需要精细化 QoS(优先级调度、流量整形)的场景下,cut-through 模式下帧还未完全到达就开始转发,使得基于完整帧头部的优先级判断和调度更复杂。
- 结论:cut-through 的优势在”高线速 + 长帧 + 低误码率 + 多跳级联”场景下最显著,正是 AI 训练集群的典型特征。
误读 3:“AI 集群的网络瓶颈主要就是转发时延”
纠偏:转发时延(cut-through 可优化的部分)在总网络时延中占比正在下降。排队时延(由拥塞引起)和端侧处理时延(NIC DMA、协议栈处理、GPU 内存拷贝)往往占更大比重。Cut-through 是”必要的基础优化”,但远不是”充分的优化”。Investor 在评估网络方案时,应关注端到端时延优化的完整栈,而非仅交换机转发模式。
学习路径
入门(30 分钟)
- 理解以太网帧格式(Preamble → Dst MAC → … → FCS)
- 对比 Store-and-Forward vs. Cut-through 的转发时序图
- 计算一个 1500B 帧在 100G 线速下的两种模式串行化时延差
进阶(2 小时)
- 了解 InfiniBand 协议栈中 cut-through 与 credit-based 流控的协同设计
- 阅读 Arista 或 Broadcom 交换机白皮书中关于 cut-through / adaptive cut-through 的配置与限制说明
- 理解 Fat-Tree / Rail-Optimized 拓扑下多跳时延的累积效应
深度(1 周+)
- 阅读 Mellanox/NVIDIA 关于 InfiniBand vs. RoCE v2 在 AI 训练集群中时延对比的技术文档
- 研究网络模拟器(如 SimGrid、OMNeT++)中建模 cut-through vs. S&F 对 AllReduce 性能的影响
- 追踪 UEC(Ultra Ethernet Consortium)规范中对以太网 AI 网络转发模式的最新定义
一句话总结
Cut-through Switching 是交换机转发管线中”不等整帧到齐就启动转发”的基础时延优化技术,它在 InfiniBand 中是协议级默认能力,在以太网中是厂商可配置选项,其单跳收益在 AI 万卡集群的多跳级联中具有乘数效应——但它只是端到端时延优化中”必要但不充分”的一环。
延伸阅读与来源
- IEEE 802.3 Ethernet Standard — 以太网帧格式与转发规范的基础定义
- InfiniBand Trade Association (IBTA) Specification — InfiniBand 协议中 cut-through 与 credit 流控的定义
- Arista Networks White Papers — 交换机 cut-through / adaptive cut-through 模式的技术说明
- Broadcom Memory Switch Architecture Overview — 交换 ASIC 内部缓冲与转发管线设计
- NVIDIA/Mellanox InfiniBand vs. RoCE v2 Technical Comparison — AI 网络中两种协议栈的时延对比分析
- J. Mudigonda et al., “NetLord: A Scalable Multi-Tenant Network Architecture for Virtualized Datacenters” (SIGCOMM 2011) — 数据中心交换架构中 cut-through 的讨论
- A. Singh et al., “Jupiter Rising: A Decade of Clos Topologies and Centralized Control in Google’s Datacenter Network” (SIGCOMM 2015) — 超大规模数据中心网络架构演进
注:本文硬规格(端口时延范围、缓冲区大小等)标注了来源口径,未充分标注的为行业共识级定性描述。具体厂商产品规格请以其最新数据手册为准。