基础设施层 开放阅读

旁路

Bypass

概念 ID
bypass
更新时间
2026-05-29
来源数量
待补

旁路(Bypass)

3 秒看懂

旁路 = 绕过复杂路径,给信息/能量/数据一条”快捷通道”。 深度学习中最典型的旁路是 残差连接(Skip Connection):输入直接跳过若干层加到输出,解决深层网络梯度消失;芯片设计中的旁路则是数据绕过缓存/流水线级,直接送达计算单元,降低延迟。

3 分钟产业解释

“旁路”不是一个单一技术,而是一种跨领域的架构思想:当正向通路(Main Path)存在瓶颈、损耗或风险时,增设一条绕行路径以保障关键功能。

在 AI 产业链中,旁路思想至少出现在三个层面:

层面典型形态核心价值
模型架构层残差连接 / Skip Connection / DenseNet 跨层连接使百层乃至千层网络可训练,是 LLM 能堆到数千亿参数的基石
处理器微架构层数据旁路 / Operand Forwarding / 结果旁路网络解决流水线数据冒险,AI 加速器 MAC 阵列间结果直传
系统/内存层缓存旁路 / Non-temporal Access / HBM 直达路径大批量推理时绕过低层级缓存,减少带宽争用

产业意义:没有旁路思想,ResNet 及后续所有深层架构(Transformer 亦依赖残差流)无法收敛;没有硬件旁路,AI 芯片的计算单元会在等待数据时频繁气泡化(stall)。旁路是”看不见的基础设施”。

15 分钟专家深入

一、模型架构中的 Bypass Connection

1. 问题起源:深层退化(Degradation Problem)

在 ResNet 之前,研究者发现:网络层数增加到一定程度后,训练误差反而上升——这不是过拟合(测试误差也升),而是优化困难:梯度在反向传播中逐层衰减或爆炸,深层权重几乎无法有效更新。

2. 残差连接的核心公式

输出 = F(X) + X

其中 X 是输入(恒等映射),F(X) 是残差块的非线性变换。网络只需学习残差 F(X) = H(X) - X,而非直接拟合目标映射 H(X)。

直觉类比:如果某层不需要做任何变换,只需将 F(X) 学成接近零,输出就等于输入——恒等映射”免费”,梯度可以无损回传。

3. 为何梯度可以回传?

反向传播时:

∂Loss/∂X = ∂Loss/∂Output × ∂Output/∂X
         = ∂Loss/∂Output × (∂F/∂X + 1)

那个 “+1” 就是旁路带来的”梯度高速公路”——无论 ∂F/∂X 多小(梯度消失),总有一个常数 1 项保底,确保信号能传回浅层。

4. 在 Transformer 中的体现

┌─────────────────────────────┐
│       Multi-Head Attn       │
│    ┌───────────────────┐    │
│    │  Q,K,V 投影 + 注意力 │    │
│    └─────────┬─────────┘    │
│              │              │
│              ▼              │
│         LayerNorm           │
│              │              │
│              + ◄─── 残差连接 (旁路)
│              │              │
│    ┌─────────▼─────────┐    │
│    │   FFN (两个线性层)    │    │
│    └─────────┬─────────┘    │
│              │              │
│              ▼              │
│         LayerNorm           │
│              │              │
│              + ◄─── 残差连接 (旁路)
│              │              │
└──────────────▼──────────────┘

每一层 Transformer Block 内有 两次残差旁路:注意力子层一次、FFN 子层一次。这是 GPT、LLaMA、Claude 等所有主流 LLM 的标准结构。没有这些旁路,堆叠数十到上百层 Transformer 几乎不可能收敛。

5. 旁路的变体与演进

变体特点代表工作
ResNet 残差块输出 = F(X) + X,F 为 2-3 层卷积ResNet (2015)
DenseNet 密集连接每层与所有后续层拼接(concat),参数效率高但内存大DenseNet (2017)
Highway Network用门控机制选择通过多少”原始信号” vs “变换信号”Srivastava et al. (2015)
Pre-Norm 残差LayerNorm 放在子层之前(而非之后),训练更稳定,LLM 主流GPT-2 及后续 LLM
Parallel Attention + FFN注意力和 FFN 并行计算,共享残差入口,减少串行延迟PaLM, GPT-J 等

二、处理器/硬件中的 Bypass

1. 数据旁路(Operand Forwarding)

在经典 5 级流水线(IF→ID→EX→MEM→WB)中,若指令 B 需要指令 A 的运算结果,但 A 尚未写回寄存器,就会产生数据冒险(Data Hazard)

旁路解法:在 EX/MEM 阶段的结果直接”旁路”到下一条指令的 EX 输入端,无需等待 WB 阶段写回寄存器。

无旁路:  A: EX → MEM → WB ──→ B: ID(等待) → EX
有旁路:  A: EX → MEM ─────────→ B: ID → EX(直接用)
                   ↑_____________________↑
                     旁路网络直传

2. AI 加速器中的旁路

在 GPU/TPU/NPU 的脉动阵列(Systolic Array)或 MAC 阵列中:

  • 部分和(partial sum)在 PE 间传递时可能需要旁路绕过某些计算单元
  • 结果写回 SRAM/寄存器堆前,可旁路到下一个流水级的输入

3. 缓存旁路(Cache Bypass)

在推理场景中,当工作集远大于 L2/L3 缓存时,频繁的缓存替换反而拖累性能。此时可使用 Non-temporal load/store 指令,让数据绕过缓存层级,直接与 HBM/GDDR 交互。

这对 AI 推理中的大矩阵读取尤其重要:权重数据只读一次,污染缓存无意义。


技术原理(最深)

残差旁路的数学视角:信号传播分析

假设一个 L 层网络,第 l 层的输出可以展开为:

X_L = X_l + Σ_{i=l}^{L-1} F_i(X_i)

这意味着任意深层 L 的输出,等于任意浅层 l 的输入加上各层残差的累加

关键推论

  1. 信号不会因层数增加而指数衰减(因为恒等旁路保底)
  2. 梯度同样:∂Loss/∂X_l = ∂Loss/∂X_L × (1 + ∂ΣF_i/∂X_l)

硬件旁路网络拓扑

       ┌──────────────────────────────────────┐
       │          寄存器堆 (Register File)      │
       └──────┬──────────────────┬─────────────┘
              │ 读端口            │ 写端口
              ▼                  ▲
       ┌──────────────┐   ┌──────────────┐
       │   译码/发射    │   │   写回(WB)    │
       └──────┬───────┘   └──────┬───────┘
              │                  │
              ▼                  │
       ┌──────────────┐         │
       │  执行单元(EX)  │         │
       └──────┬───────┘         │
              │                  │
              ├──────────────────┘  ← 旁路网络 (Bypass Network)
              │     直传无需写回寄存器堆
              ▼
       ┌──────────────┐
       │  MEM 访存     │
       └──────────────┘

旁路网络本质是多路复用器(MUX)阵列,根据指令间的数据依赖关系动态选择数据来源(寄存器堆 vs 上一级 EX 结果)。面积开销不大,但对 IPC(每周期指令数)提升显著。


技术演进史

年份里程碑旁路形态意义
1980sRISC 流水线设计数据旁路/Forwarding 成为标配MIPS、SPARC 等 RISC 架构的基石
1997LSTM 门控机制输入门/遗忘门隐式实现”信息旁路”长序列记忆,梯度流的早期疏导
2015Highway Network门控旁路,可学习通过比例首次在深度前馈网络中大规模验证旁路有效性
2015ResNet恒等残差旁路突破百层,ILSVRC 冠军,深度学习范式转折点
2017Transformer每层双残差旁路成为 LLM、CV、多模态的统一骨干
2017DenseNet全密集旁路(concat 形式)特征复用极致化
2020sGPT-3/LLaMA 等 LLMPre-Norm 残差 + 可选 Parallel Block数百层 Transformer 稳定训练

技术路线对比

维度恒等残差 (ResNet)门控旁路 (Highway)密集连接 (DenseNet)并行残差 (Parallel)
旁路形式直接相加加权相加 (学习门控)拼接 (concat)注意力与FFN共享入口相加
梯度流保障强(恒等 +1)强(门控趋近1时)极强(直接跨层)
参数效率中(额外门控参数)低(通道数线性增长)
内存开销高(需保存所有中间特征)
代表场景CV 骨干、早期网络早期深度前馈网络密集预测任务LLM (PaLM, GPT-J)

上下游

上游(旁路技术的输入/依赖)
├── 深度网络理论:反向传播、梯度分析
├── 流水线微架构理论:冒险检测、转发逻辑
└── 半导体工艺:先进制程允许更大面积旁路网络

旁路技术本身
├── 模型侧:残差连接、Skip Connection
├── 芯片侧:旁路网络、Operand Forwarding
└── 系统侧:缓存旁路、内存直达

下游(旁路技术的产出/受益)
├── LLM 训练:数百层 Transformer 可收敛
├── 深层视觉模型:ResNet 系列、Vision Transformer
├── 芯片 IPC 提升:流水线气泡减少
└── 推理延迟优化:缓存旁路减少无效访问

关键指标

指标含义量级参考
残差连接对训练深度的影响无残差 vs 有残差可训练的最大层数无残差通常 <20 层退化;有残差可达 100+ 层 [行业通识]
旁路网络对 IPC 的提升有旁路 vs 无旁路的每周期指令数增幅通常 10%-30% 提升 [估算,依赖工作负载]
缓存旁路对推理带宽的影响大 batch 推理时绕过 L2/L3 的带宽改善场景相关,需 profiling [未充分披露统一数据]
残差连接的参数开销恒等旁路本身的参数量(恒等映射无参数)

供需与市场数据

旁路作为架构思想,没有独立的市场数据,但它是以下市场的隐性支柱:

受益市场规模参考旁路的角色
深度学习框架/训练全球 AI 训练市场规模 [未充分披露精确数据,行业估算百亿美元级]残差连接使深层模型可训练,是所有现代架构的标配
AI 芯片全球 AI 芯片市场 [行业估算 2025 年数百亿美元]流水线旁路网络是处理器标配,影响 IPC 和能效
AI 推理优化推理市场快速增长 [行业估算大于训练市场]缓存旁路、内存优化直接影响吞吐和延迟

核心观点:旁路不是可选功能,而是现代 AI 计算栈的”空气级”基础设施——存在时感知不到,缺失时一切停转。


代表公司与资本映射

公司/机构旁路相关实践资本映射
Microsoft (ResNet 出品方 - 当时为 MSR)ResNet 在 MSRA 诞生,奠定残差旁路范式MSFT
GoogleTransformer 内置残差旁路;TPU 脉动阵列有专用旁路网络GOOGL
NVIDIAGPU 架构含复杂旁路网络;CUDA 训练框架对残差连接优化成熟NVDA
Meta (FAIR)LLaMA 系列采用 Pre-Norm 残差;DenseNet 部分作者来自 FAIRMETA
AppleM 系列芯片的乱序执行引擎含旁路网络AAPL

投资逻辑

旁路本身不是投资标的,但理解旁路有助于判断:

  1. 模型架构的可持续性

    • 残差旁路使 Transformer 可堆叠数百层 → LLM 规模化可行 → GPU/AI 芯片需求持续
    • 若未来架构(如 State Space Model、Mamba)找到更高效的旁路/梯度疏导方案,可能改变算力需求结构
  2. 芯片设计竞争力

    • 旁路网络的复杂度和延迟是微架构差异化的隐性指标
    • AI 专用芯片若能设计更高效的结果旁路(如减少寄存器堆访问),可在同等制程下获得更高利用率
  3. 推理优化软件栈

    • 理解缓存旁路机制 → 判断推理框架(TensorRT、vLLM 等)的优化深度

常见误读纠偏

误读 1:“残差连接只是简单相加,没什么技术含量”

纠偏:残差连接的”简单”是表面的。其核心价值在于改变了优化景观(loss landscape):

  • 使损失函数更平滑,梯度方向更一致
  • 减少了”高原”(plateau)区域
  • 数学上保证了梯度的下界,避免信号消失

“简单”的架构选择背后是对深层优化问题的深刻理解。没有残差连接,ImageNet 上 152 层 ResNet 不可能训练成功,深度学习也不会进入百层、千层时代。

误读 2:“硬件旁路只是一个小 MUX,对性能影响很小”

纠偏:在高发射宽度、深流水线的现代处理器中,旁路网络是关键性能路径:

  • 功耗占比:旁路网络的 MUX 和布线在乱序核中可占显著功耗比例 [估算,具体数字依赖架构]
  • 时序瓶颈:旁路路径的延迟可成为流水线最小时钟周期的约束因素
  • AI 加速器:脉动阵列中 PE 间的数据旁路设计直接影响计算利用率

误读 3:“缓存旁路 = 缓存没用”

纠偏:缓存旁路是一种选择性优化,只在特定场景下优于缓存:

  • 适合:流式读取、大工作集、数据复用率低的访问模式
  • 不适合:数据局部性好、频繁复用的访问模式
  • 现代 CPU/缓存系统通常用自适应策略,根据访问模式动态决定是否旁路

学习路径

入门
├── 理解流水线冒险(数据冒险、控制冒险)→ 旁路/Forwarding 概念
├── 阅读 ResNet 论文 (He et al., 2015) → 理解残差连接动机
└── 动手训练一个 20 层 CNN,对比有/无残差连接的收敛差异

进阶
├── 学习 Transformer 架构 → 观察每层的两次残差旁路
├── 阅读 PyTorch 源码中 TransformerBlock 的实现 → 看残差如何代码化
└── 了解处理器微架构教材(如 Hennessy & Patterson)中旁路网络章节

专家
├── 研究 Pre-Norm vs Post-Norm 残差的训练稳定性差异
├── 分析脉动阵列/PE 阵列的旁路拓扑设计
└── 探索非残差的梯度疏导方案(如梯度检查点、Mamba 的选择性状态传递)

一句话总结

旁路是深度学习和计算机体系结构中共通的”绕行智慧”——在模型中让梯度有路可退,在芯片中让数据有路可走,是使深度和规模成为可能的隐性基石。


延伸阅读与来源

  1. ResNet 原始论文:He, K. et al. “Deep Residual Learning for Image Recognition.” CVPR 2016. [学术论文]
  2. Highway Networks:Srivastava, R. K. et al. “Highway Networks.” arXiv:1505.00387, 2015. [学术论文]
  3. DenseNet:Huang, G. et al. “Densely Connected Convolutional Networks.” CVPR 2017. [学术论文]
  4. Transformer 原始论文:Vaswani, A. et al. “Attention Is All You Need.” NeurIPS 2017. [学术论文]
  5. 计算机体系结构:Hennessy & Patterson, “Computer Architecture: A Quantitative Approach” (6th ed.) — 流水线旁路章节 [经典教材]
  6. Pre-Norm vs Post-Norm 分析:Xiong, R. et al. “On Layer Normalization in the Transformer Architecture.” ICML 2020. [学术论文]

本文档中未引用具体来源的数据均标注为 [估算]、[行业通识] 或 [未充分披露],读者应结合最新行业报告和厂商披露交叉验证。

source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型