QCN
1 3秒看懂
QCN(量化拥塞通知,Quantized Congestion Notification)是IEEE 802.1Qau标准定义的二层端到端拥塞控制协议。交换机主动对端口队列的拥塞程度进行量化采样,一旦拥塞超过阈值,立刻生成拥塞通知帧(CNM)单播回数据源端,指示其精确降速。QCN与逐跳反压的PFC(优先级流控制)协同,构成“端侧快降速、交换机防溢出”的双层无损以太网防护体系,是支撑AI训练集群中RoCEv2 RDMA通信零丢包、低尾延迟的关键网络机制。
2 3分钟产业解释
在生成式AI爆发以前,数据中心普遍依赖标准TCP/IP栈进行后端存储与计算通信。随着GPU集群规模从数百卡迈向万卡甚至十万卡,分布式训练中的AllReduce梯度同步、参数服务器等通信模式产生大量突发流量,传统以太网的随机早期丢弃和TCP重传不仅浪费带宽,还导致毫秒级抖动,严重拖慢训练效率。为此,产业界将RDMA(远程直接内存访问)移植到以太网,形成RoCEv2,让GPU可以绕过CPU直接读写远端内存。但RDMA对丢包极其敏感,一旦发生重传,性能成倍下降。
IEEE数据中心桥接(DCB)任务组为此制定了PFC(802.1Qbb)——一种逐跳流控机制,当交换机队列快满时立即向上一跳发“暂停”,阻止数据进入,避免丢包。PFC虽然堵住了漏洞,却会制造“拥塞树”:一台交换机反压导致上游一连串设备被拖慢,无辜流量也遭到阻塞,甚至引发死锁。QCN正是在这一痛点上被提出。它将拥塞控制的责任下放到源端:交换机仅需少量采样并量化拥塞程度,主动将通知发回数据发送方,让其尽快降低发送速率。这样,拥塞在源头被提前感知、快速掐断,大幅减少PFC的触发频次与作用范围,避免拥塞树和头部阻塞,保障AI网络的高通量、低延迟。
在产业部署中,QCN能力内嵌于支持DCB功能的交换机芯片和智能网卡(如NVIDIA ConnectX系列、Broadcom Trident/Tomahawk系列、Marvell Teralynx系列等)。超大规模云厂商(如Microsoft Azure、Meta、阿里云)和AI厂商部署RoCEv2时,通常启用融合了QCN思想的算法DCQCN,基于网卡和交换机协同,实现高度可调的拥塞管理。随着2023年后大模型竞赛推动AI集群带宽需求达到每GPU 400Gbps–800Gbps,QCN/DCQCN已成为高性能AI网络默认的拥塞控制选项之一。
3 技术原理
QCN由三个核心组件构成:拥塞检测、量化反馈帧生成、源端速率调节。三者闭环运行在二层广播域内,通常覆蓋单个Pod或集群的Spine-Leaf拓扑。
拥塞检测与量化:交换机为每个出口队列维护一个拥塞程度估计值(Qlen),并与两个阈值比较——最小阈值(min_thresh)和最大阈值(max_thresh)。当队列长度在min_thresh附近,认为仅轻微拥塞;超出max_thresh则为严重拥塞。实际实现中,交换机并非全量统计每个包,而是基于数据包或字节进行概率采样(采样权重w可配),以降低硬件资源消耗。每收到或发送一个包,算法更新内部拥塞估计Qeq。当Qeq超过严格阈值(通常定义为Qeq > Q_eq_min),交换机将该数据包所属的流标记为拥塞流,并准备发送拥塞通知。
量化反馈值Fb:拥塞的量化反馈值Fb是一个带符号的整数,表示队列长度相对于阈值的超出比例。具体公式在IEEE 802.1Qau标准中定义为:Fb = −(Qoff + w·Delta),其中Qoff是当前队列长度与参考点的偏移,Delta是队列变化速率,权重w用于平衡两者。负值的Fb表明需要降速,绝对值越大降速越急迫。交换机将Fb封装进一个特殊的控制帧——拥塞通知报文(CNM,Congestion Notification Message)。
CNM帧结构:CNM帧带有专门的以太类型标识,帧体包含CN-TAG(拥塞通知标签),其中嵌入拥塞流ID、Fb值、以及拥塞点信息。交换机根据被采样数据包的源MAC地址,直接单播CNM给源端主机,反馈环路仅需在交换机侧一跳可达,延迟极低(通常数微秒至数十微秒)。为防止CNM风暴,交换机会限制对同一流发送CNM的最小间隔,确保控制开销可忽略。
源端速率调节算法:源端网卡收到CNM后,根据Fb执行乘性减载:当前发送速率TR(Target Rate)立即乘以一个减小系数Gd(例如Gd=1/64,Fb归一化后)得到新的TR = TR × (1 − Gd × |Fb|)。倘若Fb指示拥塞严重,速率断崖式下降,保证队列快速排空。之后,若在预定时间窗口内未收到新的CNM,源端进入快速恢复阶段(Fast Recovery),以步长R_HAI加性增加速率,回升至目标水平的某一比例,再进入主动增加阶段(Active Increase),以更慢步长R_AI逐步恢复至全速。此方式避免了全网流速率同步震荡,实现了公平性和快速收敛。
与PFC的协同逻辑:PFC的门限通常设置在远高于QCN最大阈值的位置(如交换机缓冲的80%–90%),作为最后兜底。QCN在队列刚越过min_thresh时就开始动作,使得多数拥塞在触发PFC前得以化解。这样,PFC只处理极端突发,反压范围被压缩到1跳,显著缓解了拥塞树扩散。
DCQCN扩展:在RoCEv2端侧,产业界普遍采用DCQCN算法。DCQCN将QCN的思想与DCTCP的ECN标记方法结合:交换机在IP报文上打ECN标记(基于队列长度概率标记),而非直接发CNM;但不依赖接收端回传CNP,而是由接收端生成的拥塞通知包(CNP)触发发送端降速,其速率调整算法直接参考QCN的乘性减/加性增,并引入多个可调阶段(Hyper-Active Increase等)。DCQCN成为RoCEv2 RDMA事实上的拥塞控制标准,虽然与纯QCN有差异,但核心数学框架完全继承自IEEE 802.1Qau。
4 关键参数
QCN协议的性能高度依赖参数的选择。IEEE 802.1Qau标准定义了一系列可配置参数,各芯片厂商在ASIC固件中开放调整接口。以下是影响QCN行为的关键参数及典型范围(数据来源:IEEE 802.1Qau-2010标准文档、Broadcom ICOS/Arista EOS公开配置指南、NVIDIA ConnectX固件参考):
- 采样权重(w):平滑队列长度与变化率的权重因子,影响拥塞判断的灵敏度。标准建议缺省值为2,对应平衡型响应;设为1则偏向队列变化率,更快速响应瞬时突发。
- 队列长度阈值(Qeq_min, Qeq_max):定义拥塞程度区域的边界。Qeq_min通常设置在缓冲区的15%–30%处,Qeq_max为30%–60%。当Qeq超过Qeq_min,交换机开始标识拥塞流并产生Fb;接近Qeq_max时,Fb趋向最大值,要求源端快速降速。不同芯片厂商推荐值略有差异,Arista在AI网络参考配置中建议将Qeq_min设为约25%的动态缓冲占用。
- Fb归一化范围:Fb为一个6位有符号整数(-32到+31),正数表示队列低于期望值(可加速),负数表示需要降速。实际映射基于队列偏移量和权重。典型的Fb总为负值,除非网络闲时主动通知加速(极少启用)。
- 通知间隔(CNM Interval):限制对同一流连续生成CNM的最小时间间隔,单位为微秒,范围常见于50 μs至500 μs。间隔太短会导致CNM风暴和CPU中断负载;太长则降速延迟过大。Broadcom芯片推荐缺省为100 μs。
- 速率减小因子(Gd):乘性降速比例因子,标准建议取值范围为1/32至1/256。较高的Gd(如1/32)使降速更激进,适用于对时延极度敏感、希望尽快清除队列的场景,但可能过度牺牲吞吐。NVIDIA在DCQCN的默认配置中,常将降速系数等效为Gd≈1/128。
- 恢复参数(R_HAI, R_AI):快速恢复增量与主动增加增量,通常以百分比每秒表示。R_HAI推荐为5 Mbps阶跃,R_AI为1 Mbps或更细微,均需匹配链路速度。100Gbps链路上,R_HAI常设为50~200 Mbps循环增量。这些参数决定了流在无拥塞时的回升速度,过快会导致新的闪拥,过慢则浪费带宽。
- 拥塞点缓冲深度:交换机实际物理缓冲池大小决定了Qeq阈值的绝对值。现代数据中心交换机能提供数十MB共享缓存,但QCN作用于每个优先级的指定队列,队列缓存单元有限(例如几百KB到几MB)。AI集群交换机如Broadcom Tomahawk 5每端口缓存约为几十MB,但QCN队列阈值可设置为数百KB量级,需结合PFC的无丢包保证精细调节。
- DCQCN的额外参数(如α更新权重、CNP生成间隔、速率增加阶段的α阈值等):不在原始802.1Qau中,但属于下游RoCE实现的核心杠杆,具体数字由网卡厂商预设,也可通过RoCE配置工具修改。公开资料显示,NVIDIA建议DCQCN的α更新加权值g=1/16,CNP每50 μs限发。
参数设定不当的常见后果包括:速率过度震荡、PFC风暴频率不减、带宽不公平。因此,最佳实践是根据真实工作负载在测试床进行灌包调优,并辅以遥测监控。
5 技术路线
QCN的技术演进可从标准、算法协同和下一代替代三条脉络梳理。
标准路线:2010年IEEE 802.1Qau正式发布,定义了二层量化拥塞通知的完整机制。此后,该标准未经历重大修订,但作为DCB协议族的核心组件,被广泛引用。2014年,随着RoCEv2在超大规模网络中试验,Microsoft Research与Mellanox(现NVIDIA)联合提出DCQCN,在SIGCOMM 2015上发表论文“DCQCN: Data Center TCP-like Congestion Control for RDMA”。DCQCN借鉴QCN的乘性减和快速恢复,融合IP ECN标记,形成适用于RDMA网卡的端侧拥塞控制算法,弥补了二层QCN在IP路由环境下的限制。DCQCN迅速成为RoCEv2部署的默认算法,并被写入InfiniBand贸易协会的RoCE规范附录。可以说,技术路线主线已从纯二层QCN发展为“交换机ECN标记+网卡DCQCN”的端网协同方案,但逻辑源头仍是QCN的量化反馈思想。
芯片实现路线:2010年代初期,Broadcom的StrataXGS/Trident系列、Marvell Prestera等首先在交换ASIC中硬件实现QCN采样、CNM生成等逻辑。随着芯片可编程性增强,厂商开始在智能管线中加入更灵活的拥塞通知触发条件。2018年后,商用芯片全面支持DCB和RoCE必备的QCN特性。NVIDIA收购Mellanox后,Spectrum交换机与ConnectX网卡实现了深度联动,可针对DCQCN参数进行端到端优化,甚至通过仿真软件提前验证。2024年,Broadcom发布Jericho3‑AI,内置AI拥塞感知路径,可基于队列深度和网络路径提供更及时的拥塞信息,可以视为QCN量化思想的硬件进化版。Marvell Teralynx系列通过可编程拥塞通知引擎,允许用户自定义类似QCN的反馈逻辑,用于特定场景。
替代与竞争路线:QCN/DCQCN并非唯一技术路径。首先是基于INT(In-band Network Telemetry)的精确拥塞控制,如HPCC(High Precision Congestion Control),利用交换机逐跳插入遥测信息,发送端可获知整条路径的精确负载,实现更平滑公平的速率调整。HPCC在学术界和部分云厂商内部得到验证,但交换机硬件要求高,可部署性受限。其次是Google的Swift协议,为数据中心设计的高效拥塞控制,使用接收端驱动的精确速率分配,但其依赖自定义传输层,与标准RoCE不兼容。再次是超大规模云自发协议,例如AWS的SRD(Scalable Reliable Datagram),不使用RoCE,也就无需QCN。此外,Ultra Ethernet Consortium(UEC)自2023年7月成立,旨在为AI和HPC打造新一代以太网传输,意图在传输层重新设计拥塞控制,可能结合多跳遥测和发送端精准调度,从而淡化传统二层QCN和DCQCN的中心地位。但UEC规范预计2024年底至2025年才会初步成熟,实际芯片和系统商用有待时日。
短期路线判断:在可预见的2~4年内,DCQCN及其变体仍将是RoCEv2 AI网络不可替代的拥塞控制主方案。理由包括:现网存量设备仅需固件升级即可支持优化后的DCQCN;NVIDIA生态中GPU到网卡到交换机的垂直集成形成强大锁定;多数企业AI集群不具备自研传输协议的能力。但中长期若UEC等标准化进展顺利,且多跳遥测硬件成本下降,QCN体系可能逐步被更精准、收敛更快的技术取代。
6 上游
QCN产业的上游,是构成量化拥塞通知完整数据路径的基础技术与组件,主要包括:
-
交换机ASIC设计:实现QCN所需的硬件单元,包括采样引擎、队列深度计量电路、CNM帧生成器、流量调度器。这些模块必须满足线速处理要求(当下51.2Tbps交换机单芯片需处理800Gbps端口),且功耗受到严格限制。上游核心企业为Broadcom(Tomahawk、Jericho系列)、Marvell(Teralynx系列)、NVIDIA(Spectrum系列)、Cisco(Silicon One)、Intel(Tofino系列,可编程)。2023年,Dell’Oro Group数据中心交换机芯片市场报告显示,Broadcom以超过60%的收入份额领先,NVIDIA受益于AI网络需求份额快速上升至约15%(来源:Dell’Oro Group,2024年1月报告,收入口径)。这些芯片需光罩、先进制程(7nm/5nm)以及HBM/GDDR等封装技术支持,进一步可追溯到台积电等代工上游。
-
网卡芯片与SmartNIC:负责接收CNM/CNP并执行速率调节算法,同时维持RDMA无状态卸载。主要供应商是NVIDIA(ConnectX‑7/8系列,基于ASIC)、Broadcom(Stingray系列)、Intel(IPU E2000系列,支持RoCEv2)、AMD/Pensando。这些网卡芯片内嵌拥塞控制状态机,部分支持可编程。根据650 Group发布的“Data Center SmartNIC Market Report (2024)”,2023年全球SmartNIC/DPU市场收入约18亿美元,其中NVIDIA占主导。QCN/DCQCN功能的实现深度直接影响AI网络的性能,成为网卡竞争的关键。
-
PHY/SerDes与光模块:虽然不是直接执行QCN逻辑,但为CNM帧提供物理层的确定性低延迟传输至关重要。上游SerDes IP与PHY芯片供应商包括Broadcom、Marvell、Credo、Alphawave等。当前112Gbps SerDes大批量用于800G端口,单通道延迟在纳秒级,对QCN反馈环路的总延迟影响极小。
-
设计工具与IP授权:芯片设计过程中需要仿真和验证QCN协议栈的合规性,Cadence、Synopsys等提供以太网VIP(验证IP)和接口IP,内部嵌入IEEE 802.1Qau测试用例。
-
标准制定组织:IEEE 802.1工作组是“源头”知识供给者,其会议产生的标准修订、解释文件、互通性指南,直接指导芯片实现。任何QCN特性更新(如对CNM帧格式的扩展)都需该工作组批准。
上游成本结构中,QCN相关功能仅为芯片门级的一小部分,其研发投入被捆绑在整个交换机芯片项目中,没有独立的“QCN芯片”市场规模。公开资料未见专门针对QCN ASIC模块的产值拆解。但从趋势看,随着AI网络要求在交换机中增加基于队列深度的快速反馈,未来几年对可编程拥塞通知引擎的硅面积和研发投入将明显上升,成为上游芯片差异化的重要特征。
7 下游
QCN的下游覆盖从交换机/网卡设备商到最终AI应用方的完整产业链,其需求直接由AI训练和HPC负载驱动。
设备与系统集成:交换机制造商(OEM/ODM)从芯片上游采购ASIC,集成支持QCN的系统产品。代表厂商包括Cisco(Nexus 9000系列,NX-OS支持精细QCN策略)、Arista(7000系列,EOS内置AI网络PFC/QCN配置模板)、Juniper、华为、H3C,以及白盒ODM如Celestica、Accton。他们面向云和企业客户提供支持RoCEv2的交换机产品,通常预置QCN/DCQCN友好的端口配置方案。网卡设备商NVIDIA、Intel等则直接以PCIe插卡或OCP网卡交付。这些设备的采购方主要是云提供商和大型AI公司。
云厂商与超大规模数据中心:Microsoft Azure是RoCEv2+DCQCN大规模部署的先驱,在其内部验证表明,启用DCQCN后RDMA吞吐量提升数倍且尾延迟降低超过90%(根据SIGCOMM 2015论文数据)。Meta的FBNet集群也大量使用QCN/DCQCN,并在OCP峰会分享调优实践,包括为不同负载配置拥塞通知阈值和速率恢复参数。AWS早期试验过RoCE,但目前其自研SRD协议不依赖QCN;但是,非自研协议的云和企业AI服务商,如Oracle Cloud、阿里云、字节跳动等,在内部AI集群中普遍启用DCQCN。根据LightCounting 2024年AI集群网络报告,2023年部署的超过5000 GPU的AI集群中,RoCEv2渗透率约60%,其中绝大多数激活了基于QCN的拥塞控制。
企业AI与HPC:对快速构建AI基础设施的金融机构、自动驾驶公司、生物制药企业等,通过购买NVIDIA DGX SuperPOD或Arista/Cisco+GPU服务器集成方案,无缝继承了QCN/DCQCN。他们对技术细节介入少,但极其依赖网络中QCN的默认良好行为,以保证训练稳定。
软件生态与运维工具:下游还包括提供网络验证、监控与自动化工具的公司,如VMware(NSX)、Arrcus、以及AI网络性能管理初创公司。这些工具帮助用户可视化QCN事件、CNM频率、PFC暂停时间等,降低运维门槛。
下游需求的关键拉动因素有:AI集群规模增速、每GPU网络带宽迭代(从200Gbps向800Gbps跃迁)、多租户网络对无损保质的诉求,以及从单一训练场景扩展到推理+训练混合部署的需求。
8 受益公司
(本节仅客观陈述产业链参与方及其布局,不构成任何投资建议或买卖意见)
-
NVIDIA:全栈受益,Spectrum交换机与ConnectX网卡的QCN/DCQCN协同构筑了其AI网络护城河。NVIDIA的Spectrum-X平台打包了自适应路由与增强DCQCN,专为万卡集群优化。其Mellanox技术遗产提供了丰富的参数调优库,是AI网络事实标准制定者。
-
Broadcom:作为数据中心交换机芯片龙头,其Tomahawk 5和Jericho3-AI系列对QCN功能提供可靠的硬件实现,并对外部软件生态(如SONiC)完全兼容。受益于AI网络交换机大规模铺货及换机潮,其芯片出货量为Arista、Dell等OEM提供了QCN底层能力。
-
Arista Networks:通过高度可编程的EOS,在AI网络中得到大量部署。Arista与Broadcom/NVIDIA合作紧密,其AI网络参考架构集成了经过验证的PFC+QCN模板,降低了云厂商部署门槛。2023年末Arista宣布AI相关收入增长迅速,QCN/PFC的支持是争取AI客户的关键技术点。
-
Cisco:Silicon One芯片家族在企业与云数据中心并存,Nexus交换机对DCB完整支持,QCN参数可通过ACI或NX-OS策略配置。Cisco在传统企业AI部署中占有较大份额,同时积极争夺云白盒市场。
-
Marvell Technology:Teralynx交换机芯片内嵌可编程拥塞通知引擎,可灵活适配QCN及未来变体,云客户可根据自身需求自定义拥塞量化函数。Marvell在2024年强调AI网络将成为其数据中心业务增长引擎。
-
超大规模云厂商的自研部门:如Meta、Microsoft的Networking团队,基于QCN/DCQCN进行大量自主调优,产出论文与白皮书,反向推动芯片和设备商优化。他们虽不售卖产品,但通过开源经验或OCP贡献影响产业方向,并受益于成熟QCN方案使其AI集群快速上线。
-
IP与EDA厂商:Cadence、Synopsys等的以太网验证IP涵盖802.1Qau,使芯片厂商能加速合规性验证,间接受益。
值得注意,一些走自研传输协议的厂商(如AWS的SRD)未直接受益于QCN,但他们从更宏观的拥塞控制演进中获得对比基准。
9 市场规模
由于QCN并非独立售卖的产品,其市场规模须通过相关网络设备和芯片的出货量来间接评估。从多个维度可勾勒其可寻址市场。
数据中心以太网交换机市场:IDC全球季度以太网交换机追踪报告显示,2023年全年数据中心以太网交换机市场规模达到216亿美元,同比增长14%(来源:IDC,2024年3月发布,厂商收入口径)。其中200Gbps/400Gbps及以上高带宽端口增长迅猛,主要由AI/ML部署驱动。这些高性能交换机几乎100%硬件支持DCB/QCN(因为DCB是数据中心交换机标准特性)。假设AI/ML相关负载占2023年数据中心交换机总市场约25%,即为54亿美元,且预测2024年份额继续提升。另外,根据Dell’Oro Group 2024年7月发布的“Data Center Switch Report”预测,2024年全球数据中心交换机市场将突破250亿美元,其中专用于AI后端网络的交换机收入有望超过10亿美元。QCN/DCQCN作为AI后端网络必需功能,涵盖这些市场。
网卡/SmartNIC市场:650 Group数据表明,2023年支持RDMA/RoCE的智能网卡市场收入约18亿美元,预计到2028年超40亿美元。其中,专门面向AI的ConnectX类网卡约占较大比重,默认搭载DCQCN。故与QCN相关的网卡收入在2023年约为数亿美元量级并快速成长。
AI集群网络整体投入:LightCounting估计,2023年全球AI服务器网络连接(包括交换机、网卡、光模块等)总投资约187亿美元,RoCEv2和InfiniBand区隔市场。其中RoCEv2网络部分(涵盖QCN相关设备)在2023年约30亿美元,预计到2028年增至100亿美元(来源:LightCounting,2024年4月报告)。此口径包含了交换机、网卡和光模块,QCN作为软件功能无独立定价,但其附着在这些设备上,间接反映了市场体量。
软件与服务:针对QCN参数调优、网络验证与监控的软件及服务尚无专门的市场统计。公开资料未见划分数字,但在AI网络运维市场中,拥塞控制分析与优化已逐渐成为卖方增值服务内容。
需注意的是,几乎所有市场规模数字均指向更大的“无损网络”或AI网络,QCN的市场规模必须从这个总筐中理解。由于没有QCN单独销售,谈纯粹“QCN市场规模”缺乏财务口径,本节数字均为下游硬件市场的合理参考。
10 玩家对比
在支持QCN/DCQCN的交换机芯片与设备层面,主流玩家在技术实现和应用侧重上存在差异。以下从几个主要维度进行横评,不构成性能优劣判断,仅描述各自特点。
芯片硬件级 QCN支持粒度
- Broadcom Tomahawk/Jericho系列:QCN逻辑固定于标准数据中心桥接流水线,提供低延迟、低抖动的拥塞通知触发,适配业界通用DCQCN。参数可通过交换抽象接口或SONiC配置。Jericho3-AI特别增强了拥塞感知队列,支持基于端口的ecn/qcn混合标记,提供流级区分能力。
- NVIDIA Spectrum系列:硬件深度配合ConnectX网卡DCQCN算法,内置加速器可协助处理CNP/CNM提速,支持动态阈值配置。Spectrum-4还可根据端口级遥测微调拥塞通知策略,可实现与NVIDIA GPUDirect RDMA联合优化。
- Marvell Teralynx系列:强调可编程性,允许用户自定义拥塞量化曲线和CNM生成条件,提供灵活的Fb映射表。适合具有强烈定制需求的大型云厂商。
- Cisco Silicon One/Q系列:集成成熟的DCB流水线,QCN作为基础功能提供,但Cisco的端到端优化多配合其Nexus Dashboard控制器,实现策略集中下发。
- Intel Tofino系列:基于P4可编程,可原生构造QCN-like拥塞通知机制,甚至实现改进版的量化反馈。但功耗与成本限制其在超大规模AI网络中的广泛渗透。
整体端网协同能力
NVIDIA凭借网卡与交换机的同源生态,能实现DCQCN全栈参数一键配置、遥测联动和软件仿真预验证,端网协同性最强。Broadcom虽芯片遍布多数OEM,但网卡端主要依赖同行(如Broadcom自家的Stingray或NVIDIA),端