網路層 開放閱讀

Cut-through Switching

Cut-through Switching

概念 ID
cut-through-switching
更新時間
2026-05-29
來源數量
待補

Cut-through Switching

3 秒看懂

一句話:交換器讀到目的地址就立刻開始轉發資料幀,不必等整個幀接收完畢,核心收益是納秒級轉發時延降低

類比:傳統”儲存轉發”像郵局——必須拆開整封信才能轉寄;Cut-through 像流水線接力——拿到信封上地址就遞出去,內容還在後面跑。

關鍵詞:直通轉發 · 零等待轉發 · InfiniBand 預設模式 · AI 叢集時延關鍵一環

3 分鐘產業解釋

為什麼這個概念在 2024—2025 年突然被頻繁提及?

大型模型訓練叢集(萬卡級)的規模爆炸,讓網路時延從”技術指標”變成了”成本指標”。一個 AllReduce 操作中的單次訊息傳輸通常跨越數個到數十個網路跳轉,每次轉發多 100 ns 的時延,在萬卡叢集中以 O(log N) 級別疊加,直接拉低 GPU 有效利用率(MFU),等於白燒算力。

Cut-through Switching 是交換器轉發層面最基礎也最底層的時延最佳化手段——它不涉及擁塞控制、路由協議或智慧網絡卡,純粹是交換器 ASIC 轉發流水線的工程選擇。但正因為它是”每跳必經”的基礎操作,其影響具有全叢集乘數效應。

產業地位

  • InfiniBand 規範(IBTA)從設計之初就以 cut-through 為預設轉發模式,這是 NVIDIA(Mellanox)生態在 HPC/AI 領域時延優勢的基石之一。
  • 高階資料中心乙太網路交換器(Arista 7800 系列、Cisco Nexus 9000 系列等)也普遍支援 cut-through 模式,但乙太網路協議本身(需處理 VLAN tag、QoS 等)使得實際時延通常高於原生 InfiniBand。
  • 在 RoCE v2(RDMA over Converged Ethernet)部署中,選擇 cut-through 模式的交換器是降低 RDMA 寫操作尾時延的常見工程實踐。

15 分鐘專家深入

核心機制

乙太網路(IEEE 802.3)幀的幀格式決定了交換器需要接收多少位元組才能做出轉發決策:

┌─────────┬─────┬────────────┬────────────┬─────────────┬─────────┬─────┐
│ Preamble│ SFD │ Dst MAC    │ Src MAC    │ EtherType   │ Payload │ FCS │
│ 7 bytes │ 1 B │ 6 bytes    │ 6 bytes    │ 2 bytes     │46-1500B │ 4 B │
└─────────┴─────┴────────────┴────────────┴─────────────┴─────────┴─────┘

              Cut-through 點:讀完 Dst MAC(14 位元組後)即可查表轉發

三種轉發模式對比

維度Store-and-ForwardFragment-FreeCut-through
等待位元組數整幀(含 FCS)64 位元組~14 位元組(Dst MAC)
是否檢查 CRC/FCS✅ 是❌ 否❌ 否
轉發時延最高最低
錯誤幀轉發風險低(可過濾碎片幀)有(會轉發 CRC 錯誤幀)
典型用途通用乙太網路早期 Catalyst 系列HPC/AI 高效能網路

時延定量分析

轉發時延 = 接收前置位元組的序列化時間 + ASIC 查表/決策時間 + 輸出埠排隊時間

其中序列化延遲(Serialization Delay)= 幀長度 / 線速。Cut-through 直接將需要序列化等待的幀長度從”整幀”降到”~14 位元組”。

以 1518 位元組最大標準乙太網路幀為例(不含前導碼):

線速Store-and-Forward 序列化Cut-through 序列化(~14B)節省
10 Gbps~1.21 μs~11 ns~1.20 μs
25 Gbps~486 ns~4.5 ns~481 ns
100 Gbps~121 ns~1.1 ns~120 ns
400 Gbps~30 ns~0.28 ns~30 ns

注:以上為純序列化延遲,不含交換 ASIC 內部管線延遲和排隊延遲。實際端到端轉發時延通常在 100 ns ~ 數百 ns 量級(含 ASIC 處理),具體取決於廠商實現 [行業共識/廠商白皮書]。

關鍵洞察:隨著線速提升到 400G/800G,單幀序列化時間已經很短,cut-through 的相對收益在縮小;但絕對值仍然重要——在多跳級聯場景下,每跳節省 30–100 ns 仍是不可忽視的最佳化。

關鍵工程細節

  1. 自適應 Cut-through(Adaptive/Silent Cut-through):現代交換 ASIC 通常支援在檢測到持續 CRC 錯誤時,自動回退到 store-and-forward 模式以隔離故障埠,錯誤恢復後又切回 cut-through。這是多數商用交換器的預設行為。

  2. 緩衝區設計影響:Cut-through 模式下,幀在交換器內停留時間極短,理論上只需要極小的共享緩衝(Shared Buffer)。這也是 InfiniBand 交換器(如 NVIDIA Quantum 系列)通常配備相對較小片上緩衝(數十 MB 量級 [廠商規格表/供應鏈估算])的架構原因之一。相比之下,需要做流量整形和擁塞吸收的乙太網路交換器(尤其是面向通用資料中心的型號)往往配備數百 MB 至 GB 級的 HBM/DDR 緩衝。

  3. 與 InfiniBand 的關係:InfiniBand 協議棧(IBTA 規範)天然假設 cut-through 轉發,其 Credit-based 流控機制保證了在 cut-through 模式下不會因緩衝區溢位而丟幀。這是 InfiniBand 在確定性低時延方面優於傳統乙太網路的架構基礎之一。

  4. 與 RoCE v2 的互動:在乙太網路上部署 RoCE v2 時,交換器選擇 cut-through 模式可降低單跳時延,但還需要配合 PFC(Priority Flow Control)/ECN(Explicit Congestion Notification)等無損/低損機制來避免因緩衝不足導致的丟包(RDMA 對丟包極度敏感,一次超時重傳可能導致微秒級時延跳變為毫秒級)。


技術原理(最深)

交換 ASIC 轉發管線與 Cut-through 的硬體實現

                     交換 ASIC 轉發管線示意(Cut-through 模式)

  輸入埠                                                  輸出埠
  ───────┐                                           ┌──────────
         │    ┌───────────┐    ┌──────────┐         │
  物理層 ├───→│ 前導碼檢測  │───→│ Dst MAC  │──┬──→ 轉發表查詢 ──→ 輸出佇列 → 傳送
  SERDES │    │ & 位元組對齊  │    │ 提取 &    │  │       │
         │    └───────────┘    │ 暫存     │  │   ┌───┴───┐
  ───────┘                     └──────────┘  │   │Crossbar│
                                             │   │ / NoC  │
         ◄── 14 位元組到達後即發起 ────────────┘   └───┬───┘
            轉發表查詢,幀資料還在                      │
            後續位元組陸續到達                          轉發資料
                                                    流水線輸出

關鍵時序

  • T₀:第一個位元組到達輸入埠
  • T₁₄:14 位元組(前導碼 + Dst MAC)到齊,觸發轉發表查詢(TCAM/SRAM,通常 <10 ns 完成)
  • T₁₄+Δ:轉發決策完成,開始向輸出埠轉發(幀後續資料還在輸入埠陸續到達)
  • 輸出埠的第一個位元組在 T₁₄+Δ+σ 時刻發出(σ 為 crossbar/NoC 內部穿越時延)

對比 Store-and-Forward

  • 必須等到 T_max(整個幀最後一個位元組 + FCS 校驗通過),才能開始輸出
  • 額外等待時間 = (幀長 - 14) / 線速

對 AI 集體通訊的實際影響

在 AllReduce(Ring 或 Tree)操作中,每個 GPU 需要通過網路傳送和接收多個 chunk:

  GPU 0 ──→ Switch 0 ──→ Switch 1 ──→ ... ──→ Switch K ──→ GPU 1
            (hop 1)       (hop 2)               (hop K)

  單次通訊的網路時延 = Σ(每跳轉發時延) + Σ(每跳排隊時延) + 傳播時延
                     ≈ K × T_cut_through + 排隊 + 光纖延遲

在胖樹(Fat-Tree)拓撲中,跨 Pod 通訊可能經過 3–5 跳交換器。每跳節省 100 ns,3 跳即節省 300 ns。對於一個需要傳輸 100 GB 資料的 AllReduce(萬卡 LLM 訓練場景),雖然序列化時間(資料量/頻寬)遠大於時延,但在小訊息通訊(如梯度同步的控制訊息、Tensor Parallelism 的 AllReduce for attention)場景下,時延是主要瓶頸。

注:實際 AllReduce 效能受訊息大小、拓撲、擁塞狀況等多因素影響,cut-through 只是諸多最佳化之一。量化收益需要具體場景模擬,此處為定性分析。


技術演進史

時期里程碑背景
1980s 末Kalpana(後被 Cisco 收購)推出首款乙太網路交換器,引入 cut-through 概念乙太網路從共享匯流排(Hub)轉向交換架構
1990sCisco Catalyst 系列支援 fragment-free 模式作為折中碰撞域內碎片幀常見,純 cut-through 風險高
1999InfiniBand Trade Association 成立,規範將 cut-through 作為預設轉發模式HPC 社群追求確定性低時延
2000sBroadcom Memory Switch Architecture 引入共享緩衝 + cut-through 混合設計資料中心開始規模化
2010sArista 7500 系列、Mellanox SwitchX-2 等支援自適應 cut-through萬兆乙太網路普及,HPC 對時延敏感度提升
2019+NVIDIA 收購 Mellanox,InfiniBand Quantum 系列成為 AI 訓練叢集標配網路大型模型訓練驅動萬卡級叢集,網路成為瓶頸
2022+400G/800G 乙太網路與 InfiniBand NDR/XDR 並行演進,cut-through 在兩種協議棧中均為基礎能力AI 網路進入”時延 + 頻寬”雙驅動時代

技術路線對比(量化表)

維度Cut-throughStore-and-Forward適用場景差異
最小轉發時延(單跳)~100–200 ns(含 ASIC 處理,典型值 [廠商白皮書])~1–2 μs(1500B 幀 @100G)時延敏感型:HPC/AI、高頻交易
CRC 校驗❌ 不校驗(或延遲校驗)✅ 完整校驗可靠性要求高:通用企業/運營商
錯誤幀處理會轉發至目的端,由目的端檢測在交換器處丟棄惡劣鏈路環境:S&F 更安全
緩衝區需求較小(幀不停留)較大(需儲存整幀)緩衝區成本敏感:Cut-through 更省
對 Jumbo Frame 的影響收益更大(序列化節省更多)基線Jumbo 常見場景(儲存網路、AI):Cut-through 收益放大
協議相容性InfiniBand 原生;乙太網路需廠商支援乙太網路預設部署複雜度:Cut-through 乙太網路需注意與 QoS/VLAN 的互動

上下游

上游(Cut-through 交換器依賴什麼)

  交換 ASIC
  ├── 轉發表(TCAM / SRAM)    ← 需極低查詢時延(&lt;10 ns)
  ├── 共享緩衝(片上 SRAM)     ← 小容量即可(Cut-through 不大量快取)
  ├── Crossbar / NoC 互聯      ← 低時延內部交換矩陣
  └── 高速 SerDes               ← 112G SerDes(400G/800G 埠基礎)

  協議棧
  ├── InfiniBand(IBTA 規範)   ← 原生 cut-through + credit 流控
  └── 乙太網路(IEEE 802.3)      ← 需配合 PFC/ECN 實現近無損

下游(誰在用 Cut-through 交換器)

  AI 訓練叢集
  ├── 萬卡 LLM 訓練(GPT-4/Llama 3 級別)
  ├── Tensor Parallelism + Pipeline Parallelism 通訊
  └── AllReduce / All-to-All / AllGather 集體通訊

  HPC 叢集
  ├── 科學模擬(氣候、分子動力學)
  └── MPI 通訊(點對點 + 集體操作)

  高頻交易 / 低時延金融
  └── 訂單簿同步、行情分發

關鍵指標

指標說明典型範圍(交換器級)
埠轉發時延(Port-to-Port Latency)從輸入埠第一個位元到輸出埠第一個位元100–300 ns(高效能型號 [廠商白皮書])
序列化時延節省相比 Store-and-Forward 的幀等待時間減少30 ns(400G/1500B)到 ~1.2 μs(10G/1500B)
誤幀轉發率Cut-through 模式下 CRC 錯誤幀被轉發的比例100%(除非啟用自適應回退)
緩衝區大小交換器片上共享緩衝數十 MB(IB 交換器)至數百 MB(乙太網路交換器)[供應鏈估算]
跳數放大效應多跳級聯下的總時延節省N 跳 × 單跳節省

供需與市場資料

需求側驅動力

  • AI 訓練叢集規模增長:單叢集 GPU 數從千卡向萬卡(甚至十萬卡)邁進,對每跳時延的敏感度持續上升。NVIDIA 在 GTC 2024 等場合多次強調網路時延對訓練效率(MFU)的影響。
  • 大型模型通訊模式變化:MoE(Mixture of Experts)架構引入大量 All-to-All 通訊(Expert Dispatch),這比傳統 AllReduce 對時延更敏感,因為 All-to-All 的通訊模式更難預測,排隊時延疊加效應更顯著。

供給側格局

  • InfiniBand 陣營:NVIDIA(Mellanox)Quantum-2 / Quantum-X 系列,佔 AI 訓練網路市場主導份額 [行業報告]。Cut-through 為原生能力。
  • 乙太網路陣營:Arista(7800R3/7060X5)、Cisco(Nexus 9000)、Broadcom(Memory Switch ASIC)等均支援 cut-through 模式。乙太網路在 AI 訓練網路中的滲透正在加速(尤其超大規模雲端廠商自研網路方案)。
  • 市場規模參考:全球資料中心交換器市場規模在百億美元量級 [行業報告],其中 AI 相關網路基礎設施為增長最快的細分。

注:以上為定性描述 + 行業共識級別估算,具體數字因統計口徑差異較大,未標精確值。


代表公司與資本對映

公司與 Cut-through 的關係資本程式碼備註
NVIDIAInfiniBand 交換器(Quantum 系列)預設 cut-through,AI 訓練網路核心供應商NVDA通過 Mellanox 收購獲得完整 IB 生態
BroadcomMemory Switch ASIC 用於多家交換器廠商,支援 cut-through 模式AVGOMemory Switch 架構是業界主流
Arista Networks高階乙太網路交換器支援 cut-through,AI/DC 網路領先ANET瞄準 RoCE v2 AI 網路市場
CiscoNexus 系列支援 cut-through,但更強調通用資料中心CSCO傳統企業網路份額大
Marvell交換 ASIC(Teralynx 系列)支援 cut-through,競爭 BroadcomMRVL專注定製化 ASIC

投資邏輯

為什麼 Cut-through Switching 是值得理解的底層技術?

  1. 它是 AI 算力”有效利用率”的乘數因子:網路時延直接影響 MFU(Model FLOPs Utilization)。投資者理解 cut-through,有助於理解為什麼”光模組 + 交換器 + 拓撲設計”是 AI Capex 中不可忽視的一環。

  2. InfiniBand vs. 乙太網路之爭的切入點:InfiniBand 的時延優勢很大程度上源於協議層面的 cut-through 設計哲學(+credit 流控)。乙太網路陣營要追趕,不僅需要硬體支援 cut-through,還需解決 ECN/PFC 的部署複雜性。理解 cut-through 有助於判斷”IB 會被乙太網路取代嗎”這個關鍵問題。

  3. 關注點應從”單跳時延”轉向”系統級時延”:隨著 400G/800G 線速下序列化時延已很小,未來 cut-through 的邊際收益在縮小;但排隊時延(擁塞管理)和端側時延(NIC/SmartNIC/BlueField 處理)成為更關鍵的最佳化方向。投資視角應關注”系統級時延最佳化”而非僅”轉發時延”。


常見誤讀糾偏

誤讀 1:“Cut-through 交換器不需要緩衝區”

糾偏:Cut-through 不等於”零緩衝”。幀在查表、等待輸出埠可用期間仍需暫存;多輸入埠同時向同一輸出埠傳送時必須排隊。Cut-through 的真實含義是”不等整幀到齊就啟動轉發”,緩衝需求較小但仍存在。InfiniBand 交換器通常使用數十 MB 量級的片上 SRAM 共享緩衝 [供應鏈估算]。

誤讀 2:“Cut-through 一定比 Store-and-Forward 快,所有場景都應該用 Cut-through”

糾偏

  • 在高線速(400G/800G)、短幀(<256B)場景下,cut-through 相比 S&F 的序列化節省可能只有個位數納秒,優勢微乎其微。
  • 在鏈路質量差(誤位元速率高)的場景下,cut-through 會將 CRC 錯誤幀轉發到目的端,導致上層協議(TCP/RDMA)觸發重傳,整體時延反而可能劣於 S&F。
  • 在需要精細化 QoS(優先順序排程、流量整形)的場景下,cut-through 模式下幀還未完全到達就開始轉發,使得基於完整幀頭部的優先順序判斷和排程更復雜。
  • 結論:cut-through 的優勢在”高線速 + 長幀 + 低誤位元速率 + 多跳級聯”場景下最顯著,正是 AI 訓練叢集的典型特徵。

誤讀 3:“AI 叢集的網路瓶頸主要就是轉發時延”

糾偏:轉發時延(cut-through 可最佳化的部分)在總網路時延中佔比正在下降。排隊時延(由擁塞引起)和端側處理時延(NIC DMA、協議棧處理、GPU 記憶體複製)往往佔更大比重。Cut-through 是”必要的基礎最佳化”,但遠不是”充分的最佳化”。Investor 在評估網路方案時,應關注端到端時延最佳化的完整棧,而非僅交換器轉發模式。


學習路徑

入門(30 分鐘)

  1. 理解乙太網路幀格式(Preamble → Dst MAC → … → FCS)
  2. 對比 Store-and-Forward vs. Cut-through 的轉發時序圖
  3. 計算一個 1500B 幀在 100G 線速下的兩種模式序列化時延差

進階(2 小時)

  1. 瞭解 InfiniBand 協議棧中 cut-through 與 credit-based 流控的協同設計
  2. 閱讀 Arista 或 Broadcom 交換器白皮書中關於 cut-through / adaptive cut-through 的配置與限制說明
  3. 理解 Fat-Tree / Rail-Optimized 拓撲下多跳時延的累積效應

深度(1 周+)

  1. 閱讀 Mellanox/NVIDIA 關於 InfiniBand vs. RoCE v2 在 AI 訓練叢集中時延對比的技術文件
  2. 研究網路模擬器(如 SimGrid、OMNeT++)中建模 cut-through vs. S&F 對 AllReduce 效能的影響
  3. 追蹤 UEC(Ultra Ethernet Consortium)規範中對乙太網路 AI 網路轉發模式的最新定義

一句話總結

Cut-through Switching 是交換器轉發管線中”不等整幀到齊就啟動轉發”的基礎時延最佳化技術,它在 InfiniBand 中是協議級預設能力,在乙太網路中是廠商可配置選項,其單跳收益在 AI 萬卡叢集的多跳級聯中具有乘數效應——但它只是端到端時延最佳化中”必要但不充分”的一環。


延伸閱讀與來源

  1. IEEE 802.3 Ethernet Standard — 乙太網路幀格式與轉發規範的基礎定義
  2. InfiniBand Trade Association (IBTA) Specification — InfiniBand 協議中 cut-through 與 credit 流控的定義
  3. Arista Networks White Papers — 交換器 cut-through / adaptive cut-through 模式的技術說明
  4. Broadcom Memory Switch Architecture Overview — 交換 ASIC 內部緩衝與轉發管線設計
  5. NVIDIA/Mellanox InfiniBand vs. RoCE v2 Technical Comparison — AI 網路中兩種協議棧的時延對比分析
  6. J. Mudigonda et al., “NetLord: A Scalable Multi-Tenant Network Architecture for Virtualized Datacenters” (SIGCOMM 2011) — 資料中心交換架構中 cut-through 的討論
  7. A. Singh et al., “Jupiter Rising: A Decade of Clos Topologies and Centralized Control in Google’s Datacenter Network” (SIGCOMM 2015) — 超大規模資料中心網路架構演進

注:本文硬規格(埠時延範圍、緩衝區大小等)標註了來源口徑,未充分標註的為行業共識級定性描述。具體廠商產品規格請以其最新資料手冊為準。

source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型