基礎設施層 開放閱讀

旁路

Bypass

概念 ID
bypass
更新時間
2026-05-29
來源數量
待補

旁路(Bypass)

3 秒看懂

旁路 = 繞過複雜路徑,給資訊/能量/資料一條”快捷通道”。 深度學習中最典型的旁路是 殘差連線(Skip Connection):輸入直接跳過若干層加到輸出,解決深層網路梯度消失;晶片設計中的旁路則是資料繞過快取/流水線級,直接送達計算單元,降低延遲。

3 分鐘產業解釋

“旁路”不是一個單一技術,而是一種跨領域的架構思想:當正向通路(Main Path)存在瓶頸、損耗或風險時,增設一條繞行路徑以保障關鍵功能。

在 AI 產業鏈中,旁路思想至少出現在三個層面:

層面典型形態核心價值
模型架構層殘差連線 / Skip Connection / DenseNet 跨層連線使百層乃至千層網路可訓練,是 LLM 能堆到數千億引數的基石
處理器微架構層資料旁路 / Operand Forwarding / 結果旁路網路解決流水線資料冒險,AI 加速器 MAC 陣列間結果直傳
系統/記憶體層快取旁路 / Non-temporal Access / HBM 直達路徑大批次推論時繞過低層級快取,減少頻寬爭用

產業意義:沒有旁路思想,ResNet 及後續所有深層架構(Transformer 亦依賴殘差流)無法收斂;沒有硬體旁路,AI 晶片的計算單元會在等待資料時頻繁氣泡化(stall)。旁路是”看不見的基礎設施”。

15 分鐘專家深入

一、模型架構中的 Bypass Connection

1. 問題起源:深層退化(Degradation Problem)

在 ResNet 之前,研究者發現:網路層數增加到一定程度後,訓練誤差反而上升——這不是過擬合(測試誤差也升),而是最佳化困難:梯度在反向傳播中逐層衰減或爆炸,深層權重幾乎無法有效更新。

2. 殘差連線的核心公式

輸出 = F(X) + X

其中 X 是輸入(恆等對映),F(X) 是殘差塊的非線性變換。網路只需學習殘差 F(X) = H(X) - X,而非直接擬合目標對映 H(X)。

直覺類比:如果某層不需要做任何變換,只需將 F(X) 學成接近零,輸出就等於輸入——恆等對映”免費”,梯度可以無損回傳。

3. 為何梯度可以回傳?

反向傳播時:

∂Loss/∂X = ∂Loss/∂Output × ∂Output/∂X
         = ∂Loss/∂Output × (∂F/∂X + 1)

那個 “+1” 就是旁路帶來的”梯度高速公路”——無論 ∂F/∂X 多小(梯度消失),總有一個常數 1 項保底,確保訊號能傳回淺層。

4. 在 Transformer 中的體現

┌─────────────────────────────┐
│       Multi-Head Attn       │
│    ┌───────────────────┐    │
│    │  Q,K,V 投影 + 注意力 │    │
│    └─────────┬─────────┘    │
│              │              │
│              ▼              │
│         LayerNorm           │
│              │              │
│              + ◄─── 殘差連線 (旁路)
│              │              │
│    ┌─────────▼─────────┐    │
│    │   FFN (兩個線性層)    │    │
│    └─────────┬─────────┘    │
│              │              │
│              ▼              │
│         LayerNorm           │
│              │              │
│              + ◄─── 殘差連線 (旁路)
│              │              │
└──────────────▼──────────────┘

每一層 Transformer Block 內有 兩次殘差旁路:注意力子層一次、FFN 子層一次。這是 GPT、LLaMA、Claude 等所有主流 LLM 的標準結構。沒有這些旁路,堆疊數十到上百層 Transformer 幾乎不可能收斂。

5. 旁路的變體與演進

變體特點代表工作
ResNet 殘差塊輸出 = F(X) + X,F 為 2-3 層卷積ResNet (2015)
DenseNet 密集連線每層與所有後續層拼接(concat),引數效率高但記憶體大DenseNet (2017)
Highway Network用門控機制選擇通過多少”原始訊號” vs “變換訊號”Srivastava et al. (2015)
Pre-Norm 殘差LayerNorm 放在子層之前(而非之後),訓練更穩定,LLM 主流GPT-2 及後續 LLM
Parallel Attention + FFN注意力和 FFN 平行計算,共享殘差入口,減少序列延遲PaLM, GPT-J 等

二、處理器/硬體中的 Bypass

1. 資料旁路(Operand Forwarding)

在經典 5 級流水線(IF→ID→EX→MEM→WB)中,若指令 B 需要指令 A 的運算結果,但 A 尚未寫回暫存器,就會產生資料冒險(Data Hazard)

旁路解法:在 EX/MEM 階段的結果直接”旁路”到下一條指令的 EX 輸入端,無需等待 WB 階段寫回暫存器。

無旁路:  A: EX → MEM → WB ──→ B: ID(等待) → EX
有旁路:  A: EX → MEM ─────────→ B: ID → EX(直接用)
                   ↑_____________________↑
                     旁路網路直傳

2. AI 加速器中的旁路

在 GPU/TPU/NPU 的脈動陣列(Systolic Array)或 MAC 陣列中:

  • 部分和(partial sum)在 PE 間傳遞時可能需要旁路繞過某些計算單元
  • 結果寫回 SRAM/暫存器堆前,可旁路到下一個流水級的輸入

3. 快取旁路(Cache Bypass)

在推論場景中,當工作集遠大於 L2/L3 快取時,頻繁的快取替換反而拖累效能。此時可使用 Non-temporal load/store 指令,讓資料繞過快取層級,直接與 HBM/GDDR 互動。

這對 AI 推論中的大矩陣讀取尤其重要:權重資料只讀一次,汙染快取無意義。


技術原理(最深)

殘差旁路的數學視角:訊號傳播分析

假設一個 L 層網路,第 l 層的輸出可以展開為:

X_L = X_l + Σ_{i=l}^{L-1} F_i(X_i)

這意味著任意深層 L 的輸出,等於任意淺層 l 的輸入加上各層殘差的累加

關鍵推論

  1. 訊號不會因層數增加而指數衰減(因為恆等旁路保底)
  2. 梯度同樣:∂Loss/∂X_l = ∂Loss/∂X_L × (1 + ∂ΣF_i/∂X_l)

硬體旁路網路拓撲

       ┌──────────────────────────────────────┐
       │          暫存器堆 (Register File)      │
       └──────┬──────────────────┬─────────────┘
              │ 讀埠            │ 寫埠
              ▼                  ▲
       ┌──────────────┐   ┌──────────────┐
       │   譯碼/發射    │   │   寫回(WB)    │
       └──────┬───────┘   └──────┬───────┘
              │                  │
              ▼                  │
       ┌──────────────┐         │
       │  執行單元(EX)  │         │
       └──────┬───────┘         │
              │                  │
              ├──────────────────┘  ← 旁路網路 (Bypass Network)
              │     直傳無需寫回暫存器堆

       ┌──────────────┐
       │  MEM 訪存     │
       └──────────────┘

旁路網路本質是多路複用器(MUX)陣列,根據指令間的資料依賴關係動態選擇資料來源(暫存器堆 vs 上一級 EX 結果)。面積開銷不大,但對 IPC(每週期指令數)提升顯著。


技術演進史

年份里程碑旁路形態意義
1980sRISC 流水線設計資料旁路/Forwarding 成為標配MIPS、SPARC 等 RISC 架構的基石
1997LSTM 門控機制輸入門/遺忘門隱式實現”資訊旁路”長序列記憶,梯度流的早期疏導
2015Highway Network門控旁路,可學習通過比例首次在深度前饋網路中大規模驗證旁路有效性
2015ResNet恆等殘差旁路突破百層,ILSVRC 冠軍,深度學習範式轉折點
2017Transformer每層雙殘差旁路成為 LLM、CV、多模態的統一骨幹
2017DenseNet全密集旁路(concat 形式)特徵複用極致化
2020sGPT-3/LLaMA 等 LLMPre-Norm 殘差 + 可選 Parallel Block數百層 Transformer 穩定訓練

技術路線對比

維度恆等殘差 (ResNet)門控旁路 (Highway)密集連線 (DenseNet)並行殘差 (Parallel)
旁路形式直接相加加權相加 (學習門控)拼接 (concat)注意力與FFN共享入口相加
梯度流保障強(恆等 +1)強(門控趨近1時)極強(直接跨層)
引數效率中(額外門控引數)低(通道數線性增長)
記憶體開銷高(需儲存所有中間特徵)
代表場景CV 骨幹、早期網路早期深度前饋網路密集預測任務LLM (PaLM, GPT-J)

上下游

上游(旁路技術的輸入/依賴)
├── 深度網路理論:反向傳播、梯度分析
├── 流水線微架構理論:冒險檢測、轉發邏輯
└── 半導體工藝:先進製程允許更大面積旁路網路

旁路技術本身
├── 模型側:殘差連線、Skip Connection
├── 晶片側:旁路網路、Operand Forwarding
└── 系統側:快取旁路、記憶體直達

下游(旁路技術的產出/受益)
├── LLM 訓練:數百層 Transformer 可收斂
├── 深層視覺模型:ResNet 系列、Vision Transformer
├── 晶片 IPC 提升:流水線氣泡減少
└── 推論延遲最佳化:快取旁路減少無效訪問

關鍵指標

指標含義量級參考
殘差連線對訓練深度的影響無殘差 vs 有殘差可訓練的最大層數無殘差通常 <20 層退化;有殘差可達 100+ 層 [行業通識]
旁路網路對 IPC 的提升有旁路 vs 無旁路的每週期指令數增幅通常 10%-30% 提升 [估算,依賴工作負載]
快取旁路對推論頻寬的影響大 batch 推論時繞過 L2/L3 的頻寬改善場景相關,需 profiling [未充分揭露統一資料]
殘差連線的引數開銷恆等旁路本身的引數量(恆等對映無引數)

供需與市場資料

旁路作為架構思想,沒有獨立的市場資料,但它是以下市場的隱性支柱:

受益市場規模參考旁路的角色
深度學習架構/訓練全球 AI 訓練市場規模 [未充分揭露精確資料,行業估算百億美元級]殘差連線使深層模型可訓練,是所有現代架構的標配
AI 晶片全球 AI 晶片市場 [行業估算 2025 年數百億美元]流水線旁路網路是處理器標配,影響 IPC 和能效
AI 推論最佳化推論市場快速增長 [行業估算大於訓練市場]快取旁路、記憶體最佳化直接影響吞吐和延遲

核心觀點:旁路不是可選功能,而是現代 AI 計算棧的”空氣級”基礎設施——存在時感知不到,缺失時一切停轉。


代表公司與資本對映

公司/機構旁路相關實踐資本對映
Microsoft (ResNet 出品方 - 當時為 MSR)ResNet 在 MSRA 誕生,奠定殘差旁路範式MSFT
GoogleTransformer 內建殘差旁路;TPU 脈動陣列有專用旁路網路GOOGL
NVIDIAGPU 架構含複雜旁路網路;CUDA 訓練架構對殘差連線最佳化成熟NVDA
Meta (FAIR)LLaMA 系列採用 Pre-Norm 殘差;DenseNet 部分作者來自 FAIRMETA
AppleM 系列晶片的亂序執行引擎含旁路網路AAPL

投資邏輯

旁路本身不是投資標的,但理解旁路有助於判斷:

  1. 模型架構的可持續性

    • 殘差旁路使 Transformer 可堆疊數百層 → LLM 規模化可行 → GPU/AI 晶片需求持續
    • 若未來架構(如 State Space Model、Mamba)找到更高效的旁路/梯度疏導方案,可能改變算力需求結構
  2. 晶片設計競爭力

    • 旁路網路的複雜度和延遲是微架構差異化的隱性指標
    • AI 專用晶片若能設計更高效的結果旁路(如減少暫存器堆訪問),可在同等製程下獲得更高利用率
  3. 推論最佳化軟體棧

    • 理解快取旁路機制 → 判斷推論架構(TensorRT、vLLM 等)的最佳化深度

常見誤讀糾偏

誤讀 1:“殘差連線只是簡單相加,沒什麼技術含量”

糾偏:殘差連線的”簡單”是表面的。其核心價值在於改變了最佳化景觀(loss landscape):

  • 使損失函式更平滑,梯度方向更一致
  • 減少了”高原”(plateau)區域
  • 數學上保證了梯度的下界,避免訊號消失

“簡單”的架構選擇背後是對深層最佳化問題的深刻理解。沒有殘差連線,ImageNet 上 152 層 ResNet 不可能訓練成功,深度學習也不會進入百層、千層時代。

誤讀 2:“硬體旁路只是一個小 MUX,對效能影響很小”

糾偏:在高發射寬度、深流水線的現代處理器中,旁路網路是關鍵效能路徑:

  • 功耗佔比:旁路網路的 MUX 和佈線在亂序核中可佔顯著功耗比例 [估算,具體數字依賴架構]
  • 時序瓶頸:旁路路徑的延遲可成為流水線最小時鐘週期的約束因素
  • AI 加速器:脈動陣列中 PE 間的資料旁路設計直接影響計算利用率

誤讀 3:“快取旁路 = 快取沒用”

糾偏:快取旁路是一種選擇性最佳化,只在特定場景下優於快取:

  • 適合:流式讀取、大工作集、資料複用率低的訪問模式
  • 不適合:資料區域性性好、頻繁複用的訪問模式
  • 現代 CPU/快取系統通常用自適應策略,根據訪問模式動態決定是否旁路

學習路徑

入門
├── 理解流水線冒險(資料冒險、控制冒險)→ 旁路/Forwarding 概念
├── 閱讀 ResNet 論文 (He et al., 2015) → 理解殘差連線動機
└── 動手訓練一個 20 層 CNN,對比有/無殘差連線的收斂差異

進階
├── 學習 Transformer 架構 → 觀察每層的兩次殘差旁路
├── 閱讀 PyTorch 原始碼中 TransformerBlock 的實現 → 看殘差如何程式碼化
└── 瞭解處理器微架構教材(如 Hennessy & Patterson)中旁路網路章節

專家
├── 研究 Pre-Norm vs Post-Norm 殘差的訓練穩定性差異
├── 分析脈動陣列/PE 陣列的旁路拓撲設計
└── 探索非殘差的梯度疏導方案(如梯度檢查點、Mamba 的選擇性狀態傳遞)

一句話總結

旁路是深度學習和計算機體系結構中共通的”繞行智慧”——在模型中讓梯度有路可退,在晶片中讓資料有路可走,是使深度和規模成為可能的隱性基石。


延伸閱讀與來源

  1. ResNet 原始論文:He, K. et al. “Deep Residual Learning for Image Recognition.” CVPR 2016. [學術論文]
  2. Highway Networks:Srivastava, R. K. et al. “Highway Networks.” arXiv:1505.00387, 2015. [學術論文]
  3. DenseNet:Huang, G. et al. “Densely Connected Convolutional Networks.” CVPR 2017. [學術論文]
  4. Transformer 原始論文:Vaswani, A. et al. “Attention Is All You Need.” NeurIPS 2017. [學術論文]
  5. 計算機體系結構:Hennessy & Patterson, “Computer Architecture: A Quantitative Approach” (6th ed.) — 流水線旁路章節 [經典教材]
  6. Pre-Norm vs Post-Norm 分析:Xiong, R. et al. “On Layer Normalization in the Transformer Architecture.” ICML 2020. [學術論文]

本文件中未引用具體來源的資料均標註為 [估算]、[行業通識] 或 [未充分揭露],讀者應結合最新行業報告和廠商揭露交叉驗證。

source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型