Cut-through Switching
3 秒看懂
一句話:交換器讀到目的地址就立刻開始轉發資料幀,不必等整個幀接收完畢,核心收益是納秒級轉發時延降低。
類比:傳統”儲存轉發”像郵局——必須拆開整封信才能轉寄;Cut-through 像流水線接力——拿到信封上地址就遞出去,內容還在後面跑。
關鍵詞:直通轉發 · 零等待轉發 · InfiniBand 預設模式 · AI 叢集時延關鍵一環
3 分鐘產業解釋
為什麼這個概念在 2024—2025 年突然被頻繁提及?
大型模型訓練叢集(萬卡級)的規模爆炸,讓網路時延從”技術指標”變成了”成本指標”。一個 AllReduce 操作中的單次訊息傳輸通常跨越數個到數十個網路跳轉,每次轉發多 100 ns 的時延,在萬卡叢集中以 O(log N) 級別疊加,直接拉低 GPU 有效利用率(MFU),等於白燒算力。
Cut-through Switching 是交換器轉發層面最基礎也最底層的時延最佳化手段——它不涉及擁塞控制、路由協議或智慧網絡卡,純粹是交換器 ASIC 轉發流水線的工程選擇。但正因為它是”每跳必經”的基礎操作,其影響具有全叢集乘數效應。
產業地位:
- InfiniBand 規範(IBTA)從設計之初就以 cut-through 為預設轉發模式,這是 NVIDIA(Mellanox)生態在 HPC/AI 領域時延優勢的基石之一。
- 高階資料中心乙太網路交換器(Arista 7800 系列、Cisco Nexus 9000 系列等)也普遍支援 cut-through 模式,但乙太網路協議本身(需處理 VLAN tag、QoS 等)使得實際時延通常高於原生 InfiniBand。
- 在 RoCE v2(RDMA over Converged Ethernet)部署中,選擇 cut-through 模式的交換器是降低 RDMA 寫操作尾時延的常見工程實踐。
15 分鐘專家深入
核心機制
乙太網路(IEEE 802.3)幀的幀格式決定了交換器需要接收多少位元組才能做出轉發決策:
┌─────────┬─────┬────────────┬────────────┬─────────────┬─────────┬─────┐
│ Preamble│ SFD │ Dst MAC │ Src MAC │ EtherType │ Payload │ FCS │
│ 7 bytes │ 1 B │ 6 bytes │ 6 bytes │ 2 bytes │46-1500B │ 4 B │
└─────────┴─────┴────────────┴────────────┴─────────────┴─────────┴─────┘
↑
Cut-through 點:讀完 Dst MAC(14 位元組後)即可查表轉發
三種轉發模式對比:
| 維度 | Store-and-Forward | Fragment-Free | Cut-through |
|---|---|---|---|
| 等待位元組數 | 整幀(含 FCS) | 64 位元組 | ~14 位元組(Dst MAC) |
| 是否檢查 CRC/FCS | ✅ 是 | ❌ 否 | ❌ 否 |
| 轉發時延 | 最高 | 中 | 最低 |
| 錯誤幀轉發風險 | 無 | 低(可過濾碎片幀) | 有(會轉發 CRC 錯誤幀) |
| 典型用途 | 通用乙太網路 | 早期 Catalyst 系列 | HPC/AI 高效能網路 |
時延定量分析
轉發時延 = 接收前置位元組的序列化時間 + ASIC 查表/決策時間 + 輸出埠排隊時間
其中序列化延遲(Serialization Delay)= 幀長度 / 線速。Cut-through 直接將需要序列化等待的幀長度從”整幀”降到”~14 位元組”。
以 1518 位元組最大標準乙太網路幀為例(不含前導碼):
| 線速 | Store-and-Forward 序列化 | Cut-through 序列化(~14B) | 節省 |
|---|---|---|---|
| 10 Gbps | ~1.21 μs | ~11 ns | ~1.20 μs |
| 25 Gbps | ~486 ns | ~4.5 ns | ~481 ns |
| 100 Gbps | ~121 ns | ~1.1 ns | ~120 ns |
| 400 Gbps | ~30 ns | ~0.28 ns | ~30 ns |
注:以上為純序列化延遲,不含交換 ASIC 內部管線延遲和排隊延遲。實際端到端轉發時延通常在 100 ns ~ 數百 ns 量級(含 ASIC 處理),具體取決於廠商實現 [行業共識/廠商白皮書]。
關鍵洞察:隨著線速提升到 400G/800G,單幀序列化時間已經很短,cut-through 的相對收益在縮小;但絕對值仍然重要——在多跳級聯場景下,每跳節省 30–100 ns 仍是不可忽視的最佳化。
關鍵工程細節
-
自適應 Cut-through(Adaptive/Silent Cut-through):現代交換 ASIC 通常支援在檢測到持續 CRC 錯誤時,自動回退到 store-and-forward 模式以隔離故障埠,錯誤恢復後又切回 cut-through。這是多數商用交換器的預設行為。
-
緩衝區設計影響:Cut-through 模式下,幀在交換器內停留時間極短,理論上只需要極小的共享緩衝(Shared Buffer)。這也是 InfiniBand 交換器(如 NVIDIA Quantum 系列)通常配備相對較小片上緩衝(數十 MB 量級 [廠商規格表/供應鏈估算])的架構原因之一。相比之下,需要做流量整形和擁塞吸收的乙太網路交換器(尤其是面向通用資料中心的型號)往往配備數百 MB 至 GB 級的 HBM/DDR 緩衝。
-
與 InfiniBand 的關係:InfiniBand 協議棧(IBTA 規範)天然假設 cut-through 轉發,其 Credit-based 流控機制保證了在 cut-through 模式下不會因緩衝區溢位而丟幀。這是 InfiniBand 在確定性低時延方面優於傳統乙太網路的架構基礎之一。
-
與 RoCE v2 的互動:在乙太網路上部署 RoCE v2 時,交換器選擇 cut-through 模式可降低單跳時延,但還需要配合 PFC(Priority Flow Control)/ECN(Explicit Congestion Notification)等無損/低損機制來避免因緩衝不足導致的丟包(RDMA 對丟包極度敏感,一次超時重傳可能導致微秒級時延跳變為毫秒級)。
技術原理(最深)
交換 ASIC 轉發管線與 Cut-through 的硬體實現
交換 ASIC 轉發管線示意(Cut-through 模式)
輸入埠 輸出埠
───────┐ ┌──────────
│ ┌───────────┐ ┌──────────┐ │
物理層 ├───→│ 前導碼檢測 │───→│ Dst MAC │──┬──→ 轉發表查詢 ──→ 輸出佇列 → 傳送
SERDES │ │ & 位元組對齊 │ │ 提取 & │ │ │
│ └───────────┘ │ 暫存 │ │ ┌───┴───┐
───────┘ └──────────┘ │ │Crossbar│
│ │ / NoC │
◄── 14 位元組到達後即發起 ────────────┘ └───┬───┘
轉發表查詢,幀資料還在 │
後續位元組陸續到達 轉發資料
流水線輸出
關鍵時序:
- T₀:第一個位元組到達輸入埠
- T₁₄:14 位元組(前導碼 + Dst MAC)到齊,觸發轉發表查詢(TCAM/SRAM,通常 <10 ns 完成)
- T₁₄+Δ:轉發決策完成,開始向輸出埠轉發(幀後續資料還在輸入埠陸續到達)
- 輸出埠的第一個位元組在 T₁₄+Δ+σ 時刻發出(σ 為 crossbar/NoC 內部穿越時延)
對比 Store-and-Forward:
- 必須等到 T_max(整個幀最後一個位元組 + FCS 校驗通過),才能開始輸出
- 額外等待時間 = (幀長 - 14) / 線速
對 AI 集體通訊的實際影響
在 AllReduce(Ring 或 Tree)操作中,每個 GPU 需要通過網路傳送和接收多個 chunk:
GPU 0 ──→ Switch 0 ──→ Switch 1 ──→ ... ──→ Switch K ──→ GPU 1
(hop 1) (hop 2) (hop K)
單次通訊的網路時延 = Σ(每跳轉發時延) + Σ(每跳排隊時延) + 傳播時延
≈ K × T_cut_through + 排隊 + 光纖延遲
在胖樹(Fat-Tree)拓撲中,跨 Pod 通訊可能經過 3–5 跳交換器。每跳節省 100 ns,3 跳即節省 300 ns。對於一個需要傳輸 100 GB 資料的 AllReduce(萬卡 LLM 訓練場景),雖然序列化時間(資料量/頻寬)遠大於時延,但在小訊息通訊(如梯度同步的控制訊息、Tensor Parallelism 的 AllReduce for attention)場景下,時延是主要瓶頸。
注:實際 AllReduce 效能受訊息大小、拓撲、擁塞狀況等多因素影響,cut-through 只是諸多最佳化之一。量化收益需要具體場景模擬,此處為定性分析。
技術演進史
| 時期 | 里程碑 | 背景 |
|---|---|---|
| 1980s 末 | Kalpana(後被 Cisco 收購)推出首款乙太網路交換器,引入 cut-through 概念 | 乙太網路從共享匯流排(Hub)轉向交換架構 |
| 1990s | Cisco Catalyst 系列支援 fragment-free 模式作為折中 | 碰撞域內碎片幀常見,純 cut-through 風險高 |
| 1999 | InfiniBand Trade Association 成立,規範將 cut-through 作為預設轉發模式 | HPC 社群追求確定性低時延 |
| 2000s | Broadcom Memory Switch Architecture 引入共享緩衝 + cut-through 混合設計 | 資料中心開始規模化 |
| 2010s | Arista 7500 系列、Mellanox SwitchX-2 等支援自適應 cut-through | 萬兆乙太網路普及,HPC 對時延敏感度提升 |
| 2019+ | NVIDIA 收購 Mellanox,InfiniBand Quantum 系列成為 AI 訓練叢集標配網路 | 大型模型訓練驅動萬卡級叢集,網路成為瓶頸 |
| 2022+ | 400G/800G 乙太網路與 InfiniBand NDR/XDR 並行演進,cut-through 在兩種協議棧中均為基礎能力 | AI 網路進入”時延 + 頻寬”雙驅動時代 |
技術路線對比(量化表)
| 維度 | Cut-through | Store-and-Forward | 適用場景差異 |
|---|---|---|---|
| 最小轉發時延(單跳) | ~100–200 ns(含 ASIC 處理,典型值 [廠商白皮書]) | ~1–2 μs(1500B 幀 @100G) | 時延敏感型:HPC/AI、高頻交易 |
| CRC 校驗 | ❌ 不校驗(或延遲校驗) | ✅ 完整校驗 | 可靠性要求高:通用企業/運營商 |
| 錯誤幀處理 | 會轉發至目的端,由目的端檢測 | 在交換器處丟棄 | 惡劣鏈路環境:S&F 更安全 |
| 緩衝區需求 | 較小(幀不停留) | 較大(需儲存整幀) | 緩衝區成本敏感:Cut-through 更省 |
| 對 Jumbo Frame 的影響 | 收益更大(序列化節省更多) | 基線 | Jumbo 常見場景(儲存網路、AI):Cut-through 收益放大 |
| 協議相容性 | InfiniBand 原生;乙太網路需廠商支援 | 乙太網路預設 | 部署複雜度:Cut-through 乙太網路需注意與 QoS/VLAN 的互動 |
上下游
上游(Cut-through 交換器依賴什麼)
交換 ASIC
├── 轉發表(TCAM / SRAM) ← 需極低查詢時延(<10 ns)
├── 共享緩衝(片上 SRAM) ← 小容量即可(Cut-through 不大量快取)
├── Crossbar / NoC 互聯 ← 低時延內部交換矩陣
└── 高速 SerDes ← 112G SerDes(400G/800G 埠基礎)
協議棧
├── InfiniBand(IBTA 規範) ← 原生 cut-through + credit 流控
└── 乙太網路(IEEE 802.3) ← 需配合 PFC/ECN 實現近無損
下游(誰在用 Cut-through 交換器)
AI 訓練叢集
├── 萬卡 LLM 訓練(GPT-4/Llama 3 級別)
├── Tensor Parallelism + Pipeline Parallelism 通訊
└── AllReduce / All-to-All / AllGather 集體通訊
HPC 叢集
├── 科學模擬(氣候、分子動力學)
└── MPI 通訊(點對點 + 集體操作)
高頻交易 / 低時延金融
└── 訂單簿同步、行情分發
關鍵指標
| 指標 | 說明 | 典型範圍(交換器級) |
|---|---|---|
| 埠轉發時延(Port-to-Port Latency) | 從輸入埠第一個位元到輸出埠第一個位元 | 100–300 ns(高效能型號 [廠商白皮書]) |
| 序列化時延節省 | 相比 Store-and-Forward 的幀等待時間減少 | 30 ns(400G/1500B)到 ~1.2 μs(10G/1500B) |
| 誤幀轉發率 | Cut-through 模式下 CRC 錯誤幀被轉發的比例 | 100%(除非啟用自適應回退) |
| 緩衝區大小 | 交換器片上共享緩衝 | 數十 MB(IB 交換器)至數百 MB(乙太網路交換器)[供應鏈估算] |
| 跳數放大效應 | 多跳級聯下的總時延節省 | N 跳 × 單跳節省 |
供需與市場資料
需求側驅動力
- AI 訓練叢集規模增長:單叢集 GPU 數從千卡向萬卡(甚至十萬卡)邁進,對每跳時延的敏感度持續上升。NVIDIA 在 GTC 2024 等場合多次強調網路時延對訓練效率(MFU)的影響。
- 大型模型通訊模式變化:MoE(Mixture of Experts)架構引入大量 All-to-All 通訊(Expert Dispatch),這比傳統 AllReduce 對時延更敏感,因為 All-to-All 的通訊模式更難預測,排隊時延疊加效應更顯著。
供給側格局
- InfiniBand 陣營:NVIDIA(Mellanox)Quantum-2 / Quantum-X 系列,佔 AI 訓練網路市場主導份額 [行業報告]。Cut-through 為原生能力。
- 乙太網路陣營:Arista(7800R3/7060X5)、Cisco(Nexus 9000)、Broadcom(Memory Switch ASIC)等均支援 cut-through 模式。乙太網路在 AI 訓練網路中的滲透正在加速(尤其超大規模雲端廠商自研網路方案)。
- 市場規模參考:全球資料中心交換器市場規模在百億美元量級 [行業報告],其中 AI 相關網路基礎設施為增長最快的細分。
注:以上為定性描述 + 行業共識級別估算,具體數字因統計口徑差異較大,未標精確值。
代表公司與資本對映
| 公司 | 與 Cut-through 的關係 | 資本程式碼 | 備註 |
|---|---|---|---|
| NVIDIA | InfiniBand 交換器(Quantum 系列)預設 cut-through,AI 訓練網路核心供應商 | NVDA | 通過 Mellanox 收購獲得完整 IB 生態 |
| Broadcom | Memory Switch ASIC 用於多家交換器廠商,支援 cut-through 模式 | AVGO | Memory Switch 架構是業界主流 |
| Arista Networks | 高階乙太網路交換器支援 cut-through,AI/DC 網路領先 | ANET | 瞄準 RoCE v2 AI 網路市場 |
| Cisco | Nexus 系列支援 cut-through,但更強調通用資料中心 | CSCO | 傳統企業網路份額大 |
| Marvell | 交換 ASIC(Teralynx 系列)支援 cut-through,競爭 Broadcom | MRVL | 專注定製化 ASIC |
投資邏輯
為什麼 Cut-through Switching 是值得理解的底層技術?
-
它是 AI 算力”有效利用率”的乘數因子:網路時延直接影響 MFU(Model FLOPs Utilization)。投資者理解 cut-through,有助於理解為什麼”光模組 + 交換器 + 拓撲設計”是 AI Capex 中不可忽視的一環。
-
InfiniBand vs. 乙太網路之爭的切入點:InfiniBand 的時延優勢很大程度上源於協議層面的 cut-through 設計哲學(+credit 流控)。乙太網路陣營要追趕,不僅需要硬體支援 cut-through,還需解決 ECN/PFC 的部署複雜性。理解 cut-through 有助於判斷”IB 會被乙太網路取代嗎”這個關鍵問題。
-
關注點應從”單跳時延”轉向”系統級時延”:隨著 400G/800G 線速下序列化時延已很小,未來 cut-through 的邊際收益在縮小;但排隊時延(擁塞管理)和端側時延(NIC/SmartNIC/BlueField 處理)成為更關鍵的最佳化方向。投資視角應關注”系統級時延最佳化”而非僅”轉發時延”。
常見誤讀糾偏
誤讀 1:“Cut-through 交換器不需要緩衝區”
糾偏:Cut-through 不等於”零緩衝”。幀在查表、等待輸出埠可用期間仍需暫存;多輸入埠同時向同一輸出埠傳送時必須排隊。Cut-through 的真實含義是”不等整幀到齊就啟動轉發”,緩衝需求較小但仍存在。InfiniBand 交換器通常使用數十 MB 量級的片上 SRAM 共享緩衝 [供應鏈估算]。
誤讀 2:“Cut-through 一定比 Store-and-Forward 快,所有場景都應該用 Cut-through”
糾偏:
- 在高線速(400G/800G)、短幀(<256B)場景下,cut-through 相比 S&F 的序列化節省可能只有個位數納秒,優勢微乎其微。
- 在鏈路質量差(誤位元速率高)的場景下,cut-through 會將 CRC 錯誤幀轉發到目的端,導致上層協議(TCP/RDMA)觸發重傳,整體時延反而可能劣於 S&F。
- 在需要精細化 QoS(優先順序排程、流量整形)的場景下,cut-through 模式下幀還未完全到達就開始轉發,使得基於完整幀頭部的優先順序判斷和排程更復雜。
- 結論:cut-through 的優勢在”高線速 + 長幀 + 低誤位元速率 + 多跳級聯”場景下最顯著,正是 AI 訓練叢集的典型特徵。
誤讀 3:“AI 叢集的網路瓶頸主要就是轉發時延”
糾偏:轉發時延(cut-through 可最佳化的部分)在總網路時延中佔比正在下降。排隊時延(由擁塞引起)和端側處理時延(NIC DMA、協議棧處理、GPU 記憶體複製)往往佔更大比重。Cut-through 是”必要的基礎最佳化”,但遠不是”充分的最佳化”。Investor 在評估網路方案時,應關注端到端時延最佳化的完整棧,而非僅交換器轉發模式。
學習路徑
入門(30 分鐘)
- 理解乙太網路幀格式(Preamble → Dst MAC → … → FCS)
- 對比 Store-and-Forward vs. Cut-through 的轉發時序圖
- 計算一個 1500B 幀在 100G 線速下的兩種模式序列化時延差
進階(2 小時)
- 瞭解 InfiniBand 協議棧中 cut-through 與 credit-based 流控的協同設計
- 閱讀 Arista 或 Broadcom 交換器白皮書中關於 cut-through / adaptive cut-through 的配置與限制說明
- 理解 Fat-Tree / Rail-Optimized 拓撲下多跳時延的累積效應
深度(1 周+)
- 閱讀 Mellanox/NVIDIA 關於 InfiniBand vs. RoCE v2 在 AI 訓練叢集中時延對比的技術文件
- 研究網路模擬器(如 SimGrid、OMNeT++)中建模 cut-through vs. S&F 對 AllReduce 效能的影響
- 追蹤 UEC(Ultra Ethernet Consortium)規範中對乙太網路 AI 網路轉發模式的最新定義
一句話總結
Cut-through Switching 是交換器轉發管線中”不等整幀到齊就啟動轉發”的基礎時延最佳化技術,它在 InfiniBand 中是協議級預設能力,在乙太網路中是廠商可配置選項,其單跳收益在 AI 萬卡叢集的多跳級聯中具有乘數效應——但它只是端到端時延最佳化中”必要但不充分”的一環。
延伸閱讀與來源
- IEEE 802.3 Ethernet Standard — 乙太網路幀格式與轉發規範的基礎定義
- InfiniBand Trade Association (IBTA) Specification — InfiniBand 協議中 cut-through 與 credit 流控的定義
- Arista Networks White Papers — 交換器 cut-through / adaptive cut-through 模式的技術說明
- Broadcom Memory Switch Architecture Overview — 交換 ASIC 內部緩衝與轉發管線設計
- NVIDIA/Mellanox InfiniBand vs. RoCE v2 Technical Comparison — AI 網路中兩種協議棧的時延對比分析
- J. Mudigonda et al., “NetLord: A Scalable Multi-Tenant Network Architecture for Virtualized Datacenters” (SIGCOMM 2011) — 資料中心交換架構中 cut-through 的討論
- A. Singh et al., “Jupiter Rising: A Decade of Clos Topologies and Centralized Control in Google’s Datacenter Network” (SIGCOMM 2015) — 超大規模資料中心網路架構演進
注:本文硬規格(埠時延範圍、緩衝區大小等)標註了來源口徑,未充分標註的為行業共識級定性描述。具體廠商產品規格請以其最新資料手冊為準。