链路降速(Link Downspeeding)
3 秒看懂
链路降速是指高速互联链路在物理层协商或运行过程中,因信号完整性劣化而从目标速率回落到更低速率的现象。在万卡级 AI 集群中,一条链路降速可能拖慢整张 AllReduce 通信图,直接影响大模型训练的有效算力利用率。
3 分钟产业解释
为什么 AI 产业链突然关心”链路降速”?
当 AI 训练集群从千卡扩展到万卡乃至十万卡规模时,链路总数跃升到百万级。即便单条链路的降速概率只有万分之几,整个集群中每天都有数量可观的链路在”带病运行”——它们物理上是通的,但速率跑不满。
这不是一个”修根线缆就好”的运维小事:
- 训练吞吐直接掉:AllReduce 等集合通信的完成时间取决于最慢的那条链路(木桶效应)。一条 400G 链路降速到 200G,对应的通信 Group 整体带宽腰斩。
- 排查成本极高:降速链路不等于断链,端口状态是
UP,告警系统未必触发,但训练性能在缓慢下降。 - 影响集群有效利用率:Google、Meta 等公开经验表明,网络互联质量是大规模训练中 GPU 利用率(MFU)波动的第一大非算力因素之一。
产业逻辑:谁能让每条链路都跑满速——靠更好的 SerDes PHY、更好的光模块、更好的线缆、更好的网络监控——谁就能在 AI 集群中”挤出”更多有效算力。这直接关联交换芯片、光模块、DAC/AOC 线缆、网络监控软件等供应链环节。
15 分钟专家深入
从物理层到训练层的全链路视角
1. 降速发生的典型层级
| 层级 | 场景 | 降速表现 |
|---|---|---|
| SerDes / PHY | 112G PAM4 SerDes 无法维持目标 BER | 链路自动回落到更低速率(如 56G PAM4 甚至 NRZ) |
| 以太网链路训练 | 400GbE / 800GbE 链路训练失败 | 设备可能自动以更低速率进行重训练(如降至 200GbE / 400GbE 或更低) |
| PCIe / CXL | 主板走线过长或 via 过多导致 Gen5 信号劣化 | 降速到 Gen4,带宽直接减半 |
| InfiniBand / NVLink | NVLink 通道中部分 lane 信号不达标 | 部分 lane 降速或失效,等效带宽下降 |
| 光链路 | 光模块老化、温度漂移、光纤微弯 | 光功率预算不足,触发降速或 BER 上升 |
2. 为什么 AI 集群特别脆弱?
规模效应 + 同步壁垒是两个核心原因:
- 规模:一个典型万卡 AI 集群包含数十万个高速链路端口。以 Fat-Tree 拓扑为例,仅 Spine 层就可能有数千个 400G 端口。任何一个 Spine 链路降速,都会影响其下挂的整个 Pod。
- 同步:分布式训练中的 AllReduce(Ring/Tree)和 All-to-All(MoE dispatch)要求所有参与者在每一步完成同步。一条慢链路 = 所有参与者等它。通信瓶颈的”放大系数”远超单一链路的带宽损失比例。
3. 降速的物理根源:PAM4 的”窄眼图”困境
现代 AI 集群主流的 100G/lane 及以上速率均采用 PAM4 调制(4 电平脉冲幅度调制,每符号承载 2 bit)。相比传统 NRZ(2 电平),PAM4 的信噪比需求提高约 9.5 dB,眼图高度缩小约 1/3。
这意味着:
- 对 ISI(码间干扰)、串扰、抖动、阻抗失配等损伤因素的容忍度大幅降低
- 走线上的每一个 via、每一处阻抗不连续、每一颗光模块的老化,都更容易把信号推到 FEC 无法纠错的边缘
- 当纠错后残余误码率(Post-FEC BER)无法满足目标阈值时,链路层触发降速
NRZ 眼图(示意) PAM4 眼图(示意)
┌──────────┐ ┌──┐
│ │ │ │ ← 3 个眼,每个都很小
───┘ └─── ───┤ ├──
────── │ │
┌──┐ └──┘
│ │ ───┤ ├──
└──┘ └──┘
4. FEC 与降速的博弈
高速链路普遍依赖 前向纠错(FEC) 来弥补 PAM4 的信噪比劣势。主流 FEC 方案(如 RS-544,514 等 Reed-Solomon 码,具体选择取决于协议标准和厂商实现)能在一定纠错能力范围内将 Pre-FEC BER 压低到可用水平。
降速阈值触发逻辑(定性描述,各厂商实现有差异):
- 物理层持续监测 Post-FEC BER 或 Pre-FEC BER
- 当 BER 持续超过阈值(通常与链路协议/厂商固件相关)一定时间窗口
- 触发链路重新训练(retrain),尝试以更低速率建立连接
- 若更低速率训练成功 → 链路降速运行(端口仍然 UP,但带宽下降)
- 若重训也失败 → 链路 flap 或 DOWN
关键误区:降速链路的端口管理状态仍然是
UP。仅靠端口 up/down 告警系统无法发现降速链路。需要主动监控链路实际协商速率和 BER 统计。
5. 在 AI 集群中的影响建模
对于一个 AllReduce Ring 通信(Ring AllReduce),假设 N 个参与节点,每个节点有上下行链路:
- 理想情况下 Ring 吞吐 = min(上行带宽, 下行带宽)
- 如果 Ring 中任意一条链路降速,整个 Ring 的吞吐被拖到该链路的速率
- 影响放大:一条链路降速 50% → 整个 Ring 吞吐下降约 50%(取决于 Ring 的通信调度策略)
对于 All-to-All(MoE 场景),情况更复杂:
- All-to-All 通常通过交换网络实现,每条路径是独立的
- 但如果降速链路恰好处于多个 flow 的共享路径上(Spine 交换机端口),影响范围会扩展
技术原理
物理层降速机制详解
SerDes 自适应均衡与降速
┌─────────────────────────────────────────────────────┐
│ SerDes 发送端 │
│ │
│ TX FIR (前馈均衡) ──→ DAC ──→ 信道 ──→ │
│ │
├─────────────────────────────────────────────────────┤
│ SerDes 接收端 │
│ │
│ ← ADC ← CTLE(连续时间线性均衡) ← DFE(判决反馈均衡)│
│ ┌───────────┐ │
│ │ BER 监测 │ │
│ │ 均衡器收敛 │ │
│ │ 信号质量评估│ │
│ └─────┬─────┘ │
│ │ │
│ ┌──────▼──────┐ │
│ │ 链路训练状态机│ │
│ │ │ │
│ │ 训练成功 → UP│ │
│ │ 训练失败 → │ │
│ │ 降速重训 │ │
│ │ 或 link DOWN│ │
│ └─────────────┘ │
└─────────────────────────────────────────────────────┘
链路训练(Link Training)过程:
- 发送端和接收端交换训练模式(training pattern)
- 接收端的均衡器(CTLE、DFE、FFE 等)根据接收到的训练序列进行自适应调整
- 均衡器收敛后,切换到正常数据模式
- 开始统计 BER / 错误帧数
- 若 BER 超过阈值,进入重训或降速流程
以太网 Auto-Negotiation 与降速
高速以太网(100G 及以上)的自动协商遵循 IEEE 802.3 Clause 73 定义,主要用于能力交换和 FEC 模式协商,不负责速率的自动回退。链路的目标速率通常由管理配置决定,而实际运行中出现的降速(例如从 400GbE 降至 200GbE)并非标准 auto-negotiation 的结果,而是链路训练失败后,由厂商专有的降速重试机制实现的。
- 双方通过 Clause 73 交换物理层能力,如支持的速率集、FEC 模式等
- 配置的管理速率决定了链路训练的目标速率
- 训练成功后链路进入正常运行
- 如果训练失败(例如因信号完整性不足),某些实现会尝试以低于目标速率的模式重新训练,形成“降速”
400GbE 典型 lane 配置:
- 8 × 50G PAM4(较早期实现)
- 4 × 100G PAM4(较新实现)
当以 100G/lane 为目标训练的链路失败时,设备可能自动尝试以 50G/lane 进行重训练,于是原本的 400G 链路降为 200G 运行。
注意:具体降速粒度和路径取决于交换芯片 SerDes 的可支持速率组合和厂商固件策略,不同厂商实现存在差异。
PCIe / CXL 降速机制
PCIe 规范定义了明确的链路降速(Link Downgrade / Speed Change)机制:
- LTSSM(Link Training and Status State Machine) 在 Detect → Polling → Configuration → L0 各阶段中,如果高速率训练失败,会回退到更低速率
- PCIe Gen5(32 GT/s)仍采用 NRZ 调制,信号完整性要求比 Gen4(16 GT/s, NRZ)大幅提高
- 主板设计中走线长度、via 数量、材料选择(低损耗 PCB vs 标准 FR-4)都直接影响 Gen5 建链成功率
- 实际运行中若检测到链路错误率上升,也可能触发降速
具体 PCIe Gen5 降速到 Gen4 的带宽损失:Gen5 x16 双向理论带宽约为 Gen4 x16 的两倍。降速后带宽减半。
技术演进史
| 时间段 | 速率阶段 | 降速关注度 | 驱动因素 |
|---|---|---|---|
| 2010s 前期 | 10G/25G NRZ | 低 | NRZ 信噪比裕量大,降速罕见 |
| 2015-2018 | 50G NRZ / 56G PAM4 初期 | 中等 | PAM4 引入,信噪比裕量缩小,降速开始成为问题 |
| 2019-2022 | 100G PAM4(SerDes)、200G/400G 端口 | 升高 | 大规模云数据中心部署,链路数量暴增,降速影响规模化 |
| 2022-至今 | 112G SerDes、400G/800G 端口、AI 万卡集群 | 高 | AI 训练对带宽极端敏感,一条降速链路可能影响数千 GPU |
| 2025+ | 224G SerDes(PAM4 或可能的更高阶调制) | 预期更高 | 单 lane 速率再翻倍,信号裕量进一步压缩 |
趋势观察:
- 业界从”链路能通就行”到”每条链路都必须满速”的认知转变
- 网络可观测性(Network Observability)从”锦上添花”变为”刚需基础设施”
- 硅光子、CPO(Co-Packaged Optics)等新技术的推进,部分动因就是解决高速链路的信号完整性瓶颈
技术路线对比
不同互联介质的降速风险对比
| 维度 | 铜缆 DAC | 有源光缆 AOC | 可插拔光模块 | 硅光/CPO(预期) |
|---|---|---|---|---|
| 典型距离 | ≤3m(常规 DAC);≤5m(增强 DAC) | 中长距离,数十米到数百米 | 数百米到数公里 | 片上/封装级,短距为主 |
| 降速风险主因 | 线缆质量不均、连接器氧化、弯曲 | 光器件老化、温度漂移 | 光功率劣化、兼容性问题 | 片上光耦合效率、热管理 |
| 降速概率趋势 | 中等(质量控制是关键) | 中等偏高(器件可靠性) | 中等 | 预期较低(减少光电转换环节) |
| 排查难度 | 中(物理可更换) | 高(模块级更换成本) | 高(多厂商兼容问题) | 低(片上集成,可诊断性好) |
| AI 集群适用性 | 短距机柜内互联首选 | 中距 Spine-Leaf 连接 | 长距跨机房连接 | 未来 GPU-to-Switch 封装级互联 |
行业观察[供应链估算]:在已部署的 AI 集群中,DAC 线缆相关降速事件通常占总降速事件的较高比例(因用量最大),光模块相关降速事件占比在增长(随 800G 光模块大规模上量)。
不同协议/标准的降速处理策略
| 协议 | 降速粒度 | FEC 依赖度 | 降速后的可观测性 |
|---|---|---|---|
| 以太网 | 速率等级回退(如 400G→200G) | 高(PAM4 必须有 FEC) | 需查看 PHY 寄存器/LLDP 能力交换 |
| InfiniBand | 链路训练协商降速 | 高 | 子网管理器(SM)可见,有诊断工具 |
| NVLink | Lane 级降速/屏蔽 | 中等(短距铜互联,设计裕量相对大) | NVIDIA 内部诊断工具可检测 |
| PCIe/CXL | 速率代际回退(Gen5→Gen4) | PCIe 6.0起需要 FEC | LTSSM 状态可观测 |
上下游
链路降速涉及的产业链环节
上游(芯片/器件层)
├── SerDes IP 供应商:Synopsys, Cadence, Alphawave, Credo, Marvell 等
│ └── 关键:SerDes 的均衡能力、PAM4 余量、降速阈值策略
├── 交换芯片厂商:Broadcom (Memory/网络), NVIDIA (Spectrum/Quantum), Marvell 等
│ └── 关键:芯片集成 SerDes 的信号完整性设计
├── 光模块/光器件:Coherent, Lumentum, 中际旭创, 光迅科技 等
│ └── 关键:光器件一致性和可靠性
└── 线缆/连接器:Amphenol, TE, Molex, 立讯精密 等
└── 关键:铜缆/光纤制造精度
中游(系统/方案层)
├── 交换机厂商:NVIDIA, Arista, 思科, 新华三, 锐捷 等
│ └── 关键:整机信号完整性设计、固件降速策略
├── AI 服务器厂商:NVIDIA DGX, 超微, 广达, 纬创 等
│ └── 关键:板级走线质量、NVLink/PCIe 降速率
└── 网络监控/管理软件:NVIDIA UFM, 各厂商 NOS 内建工具 等
└── 关键:降速链路的主动发现和定位
下游(用户/运营层)
├── 云/AI 训练运营商:AWS, Azure, GCP, 字节, 阿里云 等
│ └── 关键:链路健康度持续监控、训练任务调度优化
└── AI 训练框架:Megatron-LM, DeepSpeed, FSDP 等
└── 关键:拓扑感知调度、通信拓扑自适应
关键指标
评估链路降速影响的核心指标
| 指标 | 含义 | 典型阈值/目标 | 备注 |
|---|---|---|---|
| Post-FEC BER | 纠错后残余误码率 | 目标 < 10⁻¹⁵(以太网) | 高于此阈值的链路被认为不可接受 |
| Pre-FEC BER | 纠错前原始误码率 | 反映信道质量 | 越接近 FEC 纠错能力边界,降速风险越大 |
| 链路协商速率 | 实际运行速率 vs 标称速率 | 期望 = 标称速率(如 400G) | 低于标称速率即为降速 |
| 降速链路占比 | 集群中降速端口数 / 总端口数 | 目标 < 0.1% | 大型集群中即使是 0.01% 也可能意味着上百条 |
| 链路 flap 频率 | 单位时间内链路 up/down 次数 | 目标 = 0 | flapping 通常意味着严重信号完整性问题 |
| FEC 纠错率(Correctable Error Rate) | FEC 每秒纠正的符号数 | 持续上升是降速前兆 | 可作为预防性告警指标 |
| 通信有效带宽利用率 | 实际集合通信吞吐 / 理论带宽 | 目标 > 95% | 降速链路会显著拉低此指标 |
供需与市场数据
宏观背景
以下数据主要基于公开行业报告和供应链估算,具体数字标注来源口径。
- AI 集群规模趋势:全球主要 AI 训练集群正在从万卡向十万卡迈进。Meta 公开披露的 GPU 集群已达到数万张级别([Meta 公开博客])。
- 单集群链路数量估算[行业估算]:一个 10 万 GPU 的训练集群,每 GPU 按 8-10 条高速链路(NVLink + InfiniBand/RoCE)计算,总高速链路数在 80 万到 100 万条 量级。
- 降速链路的运维成本:每次降速排查和更换线缆/模块的成本包括人工、停机损失和计算资源浪费,单次事件成本在数百到数千美元不等([运维经验估算],取决于规模和定位速度)。
关联市场规模
- AI 交换芯片市场:800G 及以上交换芯片是链路质量的核心决定因素。主流厂商包括 Broadcom(Memory/网络系列)、NVIDIA(Spectrum-X/Quantum 系列)等。
- AI 光模块市场:800G 光模块正处于大规模出货阶段(2024-2025),市场参与者包括 Coherent、中际旭创等。光模块的一致性和可靠性直接影响降速率。
- DAC/AOC 市场:铜缆 DAC 在 AI 集群短距连接中仍占主导,用量巨大。线缆质量管理成为供应链关键议题。
- 网络监控/可观测性市场:随着 AI 集群规模扩大,链路健康监控成为新增需求,NVIDIA UFM(Unified Fabric Manager)是该领域的代表产品。
趋势[行业观察]:AI 集群运营商正在从”事后被动排查降速”转向”事前主动预测降速”,推动了网络遥测(Network Telemetry)和 AI for Networking(用 AI 管理网络)的需求。
代表公司与资本映射
| 产业链环节 | 代表公司 | 与链路降速的关联 | 备注 |
|---|---|---|---|
| 交换芯片/SerDes | Broadcom, NVIDIA, Marvell, Credo, Alphawave | 芯片内 SerDes 的信号质量直接决定降速率 | Credo, Alphawave 是专注 SerDes IP 的公司 |
| 光模块 | Coherent (COHR), 中际旭创 (300308), 新易盛 (300502), 光迅科技 (002281) | 光模块一致性和可靠性是降速的关键变量 | 800G 光模块出货量增长的同时,质控成为关键 |
| 线缆/连接器 | Amphenol (APH), TE Connectivity (TEL), 立讯精密 (002475) | 铜缆质量和连接器工艺影响短距链路降速率 | AI 集群对 DAC 线缆的需求量级巨大 |
| 交换机/系统 | NVIDIA (NVDA), Arista (ANET), Cisco (CSCO), 新华三, 锐捷 | 整机设计和固件策略影响降速处理 | NVIDIA 的端到端方案(交换机+UFM)有整合优势 |
| 网络监控/管理 | NVIDIA UFM, Arista CloudVision, Cisco ACI | 降速链路的主动发现和诊断 | 这是一个快速增长的细分需求 |
投资视角:链路降速问题的加剧,可能驱动对以下方向的需求增长:(1) 更高一致性的光模块;(2) 更智能的网络管理软件;(3) 下一代 SerDes IP(更宽的信号裕量);(4) CPO 等减少光电转换环节的新技术路线。
投资逻辑
链路降速视角下的 AI 产业链投资思考
核心逻辑:AI 算力的瓶颈正在从”GPU 够不够”扩展到”GPU 之间的路通不通”。链路降速是”路通但不畅”的典型表现。
-
光模块质控溢价:在大规模 AI 集群中,光模块的降速率成为采购决策的核心考量之一。具备更高一致性和更低降速率的光模块供应商,可能获得质量溢价。
-
网络可观测性:降速链路的隐蔽性意味着传统告警系统不够用。能提供主动链路健康监控、预测性维护的解决方案(软件或硬件),面临增量需求。
-
SerDes IP 升级:从 112G 到 224G 的 SerDes 演进中,信号裕量会进一步压缩。SerDes IP 供应商如果能在更高速率下维持低降速率,将获得技术壁垒溢价。
-
CPO(Co-Packaged Optics)/ 硅光子:将光学引擎直接集成到交换芯片封装中,从根本上减少光电转换环节和信号路径长度,是从源头降低降速风险的技术路线。
-
AI 集群运维服务:万卡级 AI 集群的链路健康管理需要专业运维能力。具备大规模网络运维经验的服务商可能获得服务收入增长。
风险提示
- AI 集群技术路线可能快速变化(如从 InfiniBand 转向以太网),影响不同环节的需求结构
- 降速问题可能被交换芯片厂商在下一代产品中大幅改善,降低相关供应链的紧迫性
- 单一技术指标(如降速率)不应作为投资决策的唯一依据,需结合整体技术竞争力和财务基本面
常见误读纠偏
❌ 误读一:“链路降速就是线缆坏了,换根线就好”
纠偏:链路降速的原因是多元的,线缆只是其中一个环节。芯片端 SerDes 的设计裕量、PCB 走线质量、光模块一致性、连接器工艺、温度环境等都可能导致降速。在实际运维中,更换线缆后问题依旧存在的情况并不罕见。正确的做法是系统性排查,从 BER 统计、FEC 错误分布、温度记录等多维数据综合判断根因。
❌ 误读二:“端口状态是 UP 就没问题”
纠偏:这是最常见的运维盲区。链路降速后端口管理状态仍然是 UP——它只是以低于标称速率在运行。如果网络监控系统仅依赖 up/down 告警,完全无法发现降速链路。必须主动读取链路协商速率(通过 LLDP、SNMP、gNMI 或厂商专用 API)和 PHY 层统计信息。在大型 AI 集群中,这一监控盲区可能导致训练性能在数天甚至数周内持续缓慢下降而不被察觉。
❌ 误读三:“AI 集群中链路降速的影响是线性的——降 25% 带速,通信就慢 25%”
纠偏:影响通常非线性且被放大。在 AllReduce Ring 中,一条链路降速会拖慢整个 Ring;在 All-to-All 中,降速链路如果位于流量密集的 Spine 路径上,影响范围远超单条链路。此外,通信和计算是交替进行的(pipeline bubble),通信变慢会导致 GPU 空等(idle),实际 MFU 下降幅度通常超过通信带宽下降比例。
❌ 误读四:“降速只是老链路的问题,新部署不会遇到”
纠偏:新部署同样可能遇到降速问题。常见原因包括:(1) 新批次线缆/光模块质量一致性差异;(2) 新 PCB 设计中的走线问题(尤其在 PCIe Gen5 / NVLink 场景);(3) 环境温度在集群满载运行后上升,导致原本空载时达标的链路在满载时降速。压力测试(满载热机状态下的链路质量验证)是新集群上线前的必要环节。
学习路径
从入门到深入
-
入门:了解以太网物理层基础——PAM4 vs NRZ 调制、BER 概念、FEC 基本原理
- 推荐:IEEE 802.3 标准中关于 100G/400G/800G 以太网物理层的概述章节
-
进阶:理解链路训练(Link Training)和自动协商(Auto-Negotiation)机制
- 关注 SerDes 自适应均衡(CTLE, DFE, FFE)的基本原理
- 了解 PCIe LTSSM 状态机的工作流程
-
深入:理解大规模 AI 集群中的网络拓扑与通信模式
- Fat-Tree、Dragonfly 等拓扑结构
- Ring AllReduce、Tree AllReduce、All-to-All 等集合通信原语
- Megatron-LM 中的张量并行通信模型
-
实战:学习网络可观测性和链路健康监控
- 了解 gNMI/gRPC Network Management Interface 在网络遥测中的应用
- 了解 NVIDIA UFM(Unified Fabric Manager)的功能和链路监控能力
- 关注 DCGM(Data Center GPU Manager)中的网络指标
-
前沿:关注下一代技术路线
- CPO(Co-Packaged Optics)对链路质量的改善
- 224G SerDes 的信号完整性挑战
- UALink(Ultra Accelerator Link)等新兴 AI 互联标准的链路管理策略
一句话总结
链路降速是 AI 万卡集群中的”隐性算力杀手”——端口 UP 但速率不满,一条慢链路拖垮整张通信图,它是物理层信号完整性问题在 AI 训练吞吐上的直接映射。
延伸阅读与来源
-
IEEE 802.3 标准系列:以太网物理层和链路训练规范(400G/800G 相关条款)
- 链接:standards.ieee.org
-
PCI-SIG PCIe 规范:PCIe Gen5/Gen6 链路训练和降速机制
- 链接:pcisig.com
-
NVIDIA UFM(Unified Fabric Manager)文档:InfiniBand 网络管理和链路健康监控
- 链接:network.nvidia.com/products/ufm
-
Meta Engineering Blog — “Building Meta’s GenAI Infrastructure”(2024):大规模 AI 集群网络架构和运维挑战
- 链接:engineering.fb.com
-
Google Cloud Blog — “TPU network architecture” 系列:AI 集群互联中对链路质量的考量
- 链接:cloud.google.com/blog
-
SerDes 与高速信号完整性参考:
- Eric Bogatin, “Signal and Power Integrity — Simplified”(教科书级参考)
- Samtec, Keysight 等厂商的技术白皮书(关于 PAM4 信号完整性测试)
-
800G/1.6T 以太网联盟(Ethernet Technology Consortium):下一代速率标准演进
- 链接:ethernet.org
免责声明:本页中未标注具体来源的数字和判断均为定性分析或行业估算,不构成投资建议。具体技术规格以各厂商官方文档和标准组织发布为准。