网络层 开放阅读

DSCP

Differentiated Services Code Point

概念 ID
differentiated-services-code-point
更新时间
2026-05-29
来源数量
待补

DSCP

3 秒看懂

DSCP 是 IP 包头里 6 bit 的”优先级标签”(0–63),路由器/交换机看到它就知道这个包该优先转发还是可以丢弃。在 AI 集群的 RoCEv2 RDMA 网络中,DSCP 是保障训练流量不被阻塞的关键 QoS 机制之一。

3 分钟产业解释

为什么 AI 产业链要关心一个 1998 年的网络协议字段?

大模型训练的本质是一张由数千到数万张 GPU 构成的分布式计算图。GPU 之间通过 AllReduce、All-to-All 等集合通信原语进行海量数据交换。一次训练迭代中,任何一个数据包延迟或丢失都可能导致 GPU 流水线空转(bubble),直接侵蚀宝贵的算力利用率。

问题在于:AI 集群的物理网络不是训练流量的独占通道。至少有三类流量共存:

流量类型特征时延敏感度
训练通信(梯度/激活)大块、突发、吞吐导向极高(尾延迟直接影响迭代时间)
存储 I/O(检查点/数据加载)大块、持续、吞吐导向
管理/监控/SSH小包、低带宽

DSCP 的核心价值:在网络层为不同流量打上”颜色标签”,让交换机按优先级调度,确保训练通信的优先转发权。

产业位置

┌──────────────────────────────────────────────────┐
│                  应用层(PyTorch/Megatron)         │
│              集合通信:AllReduce / All-to-All        │
├──────────────────────────────────────────────────┤
│              传输层(RoCEv2 / UCX / NCCL)          │
├──────────────────────────────────────────────────┤
│  ★ 网络层 QoS ★  ← DSCP 在这里发挥作用              │
│  IP Header: DSCP 字段标记优先级                     │
├──────────────────────────────────────────────────┤
│              链路层(Ethernet + PFC/ECN)            │
│           802.1Qbb Priority Flow Control           │
├──────────────────────────────────────────────────┤
│           物理层(400G/800G 光模块/SerDes)           │
└──────────────────────────────────────────────────┘

DSCP 工作在 IP 层(L3),是端到端 QoS 策略的一部分,与链路层的 PFC(Priority Flow Control,802.1Qbb)协同配合:DSCP 决定”这个包属于哪类业务”,PFC 在链路层实现”该类业务暂停发送”的流控。


15 分钟专家深入

1. DSCP 在 AI 集群中的典型配置实践

在 NVIDIA Spectrum-X 或 Broadcom Memory-Centric Infrastructure 参考架构中,RoCEv2 训练网络通常采用如下 DSCP 映射策略(定性模式,具体值因厂商/OEM 方案而异):

训练 GPU↔GPU 流量    →  DSCP EF (46 / 101110)  →  映射至最高优先级队列
存储流量(NVMe-oF)   →  DSCP AF41 (34 / 100010) →  映射至次高优先级队列
管理/监控流量         →  DSCP CS0 (0 / 000000)   →  尽力而为队列

关键机制链

  1. NCCL/RoCEv2 应用层:由网卡驱动或 NCCL 环境变量设置 DSCP 值
  2. 交换机识别:交换机根据 DSCP 值将数据包分配到对应的硬件队列
  3. 队列调度:采用严格优先级(Strict Priority)或加权调度(WRR/DRR)
  4. 拥塞管理:结合 ECN 标记和 PFC,实现无损或近无损传输

2. DSCP 与 PFC 的协同关系

这是理解 AI 网络 QoS 最容易混淆的地方:

        DSCP(L3 - 网络层)          PFC(L2 - 链路层)
        ┌─────────────────┐        ┌─────────────────┐
        │ 分类:哪个业务?    │  映射   │ 流控:该不该暂停?   │
        │ 64 种代码点       │──────→│ 8 个优先级 CoS     │
        │ 端到端语义         │        │ 逐跳/逐链路语义     │
        └─────────────────┘        └─────────────────┘
  • DSCP → CoS 映射:交换机将入端口的 DSCP 值映射到 802.1Q 的 3-bit PCP/CoS 字段(0–7),从而关联到 PFC 的 8 个优先级
  • 典型做法:训练流量的 DSCP 映射到某个 CoS 值,该 CoS 值启用 PFC;管理流量的 CoS 不启用 PFC(避免非关键流量参与反压)

3. 常用 PHB(Per-Hop Behavior)类型

IETF 定义了以下标准 PHB 组,这是 DSCP 的”语义层”:

PHB 类型DSCP 值(二进制)DSCP 值(十进制)语义AI 集群用途
CS0(Class Selector 0)0000000尽力而为(BE)管理流量默认
CS6/CS7110000 / 11100048 / 56网络控制路由协议(BGP/OSPF)
AF4110001034确保转发,低丢弃优先级存储/数据加载
EF10111046加速转发,低延迟低抖动GPU 训练通信(典型选择)

注意:EF (DSCP 46) 是业界用于”低延迟保障”的经典选择,但在大规模 AI 集群中,部分方案采用 CS7 或自定义映射,具体取决于交换机厂商和集群网络设计。上表为典型模式而非唯一标准

4. 为什么不能只靠 PFC?

PFC 是逐跳(hop-by-hop)的链路层流控,存在以下局限性:

  • 拥塞传播(Congestion Spreading):一个端口的 PFC pause 帧可能导致反压波及上游端口,产生”队列树形阻塞”
  • PFC Storm:配置不当可能产生 PFC 风暴,导致大面积网络瘫痪
  • 无业务感知:PFC 只知道”这个队列满了,暂停”,不知道包里是什么业务

DSCP 的价值在于提供 L3 层的业务分类和端到端语义,与 PFC 形成互补:DSCP 负责”分好类”,PFC 负责”保不失”,ECN 负责”通知拥塞”。


技术原理

1. DSCP 在 IP 报文中的位置

IPv4 报文头的 ToS 字段(8 bit)被 DiffServ 重新定义:

     0                   1                   2                   3
     0 1 2 3 4 5 6 7 8 9 0 1 2 3 4 5 6 7 8 9 0 1 2 3 4 5 6 7 8 9 0 1
    +-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+
    |Version|  IHL  |    DSCP (6b)  |ECN |         Total Length     |
    +-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+
    |         Identification        |Flags|      Fragment Offset    |
    +-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+
    |  TTL  |    Protocol           |         Header Checksum       |
    +-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+
    |                       Source Address                          |
    +-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+
    |                    Destination Address                        |
    +-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+-+

    DSCP 字段:IP 头第 2 字节的高 6 位(bit 0–5)
    ECN 字段:IP 头第 2 字节的低 2 位(bit 6–7)
    → 合起来就是原 ToS 字段的 8 bit

IPv6 类似:Traffic Class 字段(8 bit)同样高 6 位用于 DSCP,低 2 位用于 ECN。

2. DSCP 的作用域模型

         边缘网络                     核心网络                    边缘网络
    ┌──────────────┐            ┌──────────────┐           ┌──────────────┐
    │  Classifier   │           │              │           │  Classifier   │
    │  + Marker     │           │  Per-Hop     │           │  + Marker     │
    │              │           │  Behavior    │           │              │
    │  流量分类 &    │  ── DSCP ─→  基于 DSCP 的 │  ─ DSCP → │  流量分类 &    │
    │  DSCP 标记    │           │  队列调度/    │           │  DSCP 标记    │
    │              │           │  拥塞管理     │           │              │
    └──────────────┘            └──────────────┘           └──────────────┘
         ↑ 信任边界                    ↑ 不修改 DSCP              ↑ 信任边界

核心原则(RFC 2475)

  • DSCP 在网络边缘标记(Classifier + Marker)
  • 核心网络只读取 DSCP 并执行对应的 PHB,原则上不修改
  • 这使得核心路由器无需维护每流状态,实现可扩展的 QoS

3. ECN 与 DSCP 的配合(AI 集群关键)

发送端                              交换机                               接收端
  │                                  │                                    │
  │─── IP 包 (DSCP=46, ECN=10) ───→│                                    │
  │                                  │  队列深度 > 阈值?                   │
  │                                  │  是 → 将 ECN 改为 11 (CE)           │
  │                                  │─── IP 包 (DSCP=46, ECN=11) ────→  │
  │                                  │                                    │
  │←──────── CNP (拥塞通知包) ─────────│←─── 接收端检测到 CE ──────────────│
  │                                    发送 CNP                            │
  │  降低发送速率                                                       │
  • ECN = 10(ECT):发送端声明支持 ECN
  • ECN = 11(CE - Congestion Experienced):交换机在拥塞时标记
  • CNP(Congestion Notification Packet):RoCEv2 接收端发回的拥塞通知

在 AI 集群中,DSCP + ECN + PFC 构成三层拥塞管理体系

层级机制作用时间尺度
L3 网络层DSCP流量分类静态配置
L3 网络层ECN拥塞信号传递微秒–毫秒
L2 链路层PFC无损流控亚微秒
应用层NCCL 速率调整全局调度毫秒–秒

技术演进史

时间里程碑说明
1981RFC 791IPv4 定义 ToS 字段(8 bit),最初用于 IP Precedence(仅高 3 bit)
1992RFC 1349扩展 ToS 字段语义,4 bit TOS 子字段用于延迟/吞吐/可靠性/开销
1998RFC 2474正式定义 DSCP:将 ToS 字段高 6 bit 重新定义为 DSCP,低 2 bit 留给 ECN
1998RFC 2475DiffServ 架构框架:边缘分类标记 + 核心 PHB 执行
1999RFC 2597AF(Assured Forwarding)PHB 定义:4 类 × 3 丢弃优先级 = 12 个 DSCP
1999RFC 2598EF(Expedited Forwarding)PHB 定义:低延迟低抖动保障
2001RFC 3168ECN 标准化,占用 ToS 字段低 2 bit,与 DSCP 共存
2010 年代RoCE v1/v2数据中心 RDMA 技术兴起,DSCP 成为 RoCEv2 QoS 标配
2018–AI 集群规模化万卡训练集群出现,DSCP + PFC + ECN 三位一体成为 AI 网络 QoS 基石
2023–超大规模集群10 万卡集群(如 xAI Colossus)对网络 QoS 提出更精细需求

技术路线对比

AI 集群网络 QoS 技术方案对比

维度DSCP + PFC + ECN(以太网方案)InfiniBand 自有 QoS专用调度(如 HPN/自研)
标准化程度IETF/IEEE 标准成熟,多厂商互操作InfiniBand TA 规范私有协议
部署规模支持数万端口级 AI 集群传统上限约数千节点(单子网),超大规模需多子网因方案而异
精细度6 bit DSCP(64 类)+ 8 CoS + ECNVirtual Lane(VL,最多 16 个)可定制
生态兼容通用以太网设备,供应链丰富需专用 HCA/交换机需定制硬件/软件
成本中(商用交换机 + RoCE 网卡)高(专用硬件)高(定制研发)
典型代表NVIDIA Spectrum-X, Broadcom Jericho/AI 网络NVIDIA Quantum-2 InfiniBandGoogle TPU v4/v5 互联

产业趋势:超大规模 AI 训练正从 InfiniBand 向以太网方案迁移(如 xAI、Meta 的大集群),DSCP 在以太网方案中的地位持续上升。


上下游

上游:谁设置 DSCP?

环节机制
NCCL / PyTorch通过环境变量(如 NCCL_IB_TC 或类似 UCX 参数)控制 RoCEv2 数据包的 DSCP/ToS
操作系统内核tc(traffic control)工具、iptables 的 --set-dscp-mark
网卡驱动NVIDIA/Mellanox OFED 驱动中的 QoS 配置
SDN 控制器集中下发 DSCP 标记策略

下游:谁消费 DSCP?

环节机制
接入交换机基于 DSCP 做分类,映射到硬件队列,决定调度优先级
核心交换机执行 PHB,队列调度(SP/WRR/DRR),ECN 标记
出口网关可能根据 DSCP 做流量整形/限速

供应链映射

[GPU/CPU]  ──  [RDMA 网卡(NVIDIA CX-7/CX-8, Broadcom P 系列)]
                     │
                     ↓  设置 DSCP
              [ToR 交换机(Spectrum-4, Memory 交换芯片)]
                     │
                     ↓  基于 DSCP 调度
              [Leaf/Spine 交换机]
                     │
                     ↓  ECN 标记(如果拥塞)
              [接收端网卡] ──  CNP ──  [发送端降速]

关键指标

指标说明AI 集群典型要求
DSCP 值域6 bit,0–63训练流量一般使用单个 DSCP 值(如 EF=46)
DSCP-to-Queue 映射延迟交换机从识别 DSCP 到完成入队的时间通常纳秒级(硬件转发)
PFC 响应时间从检测到拥塞到上游暂停发送亚微秒(要求极低,是无损网络关键)
ECN 标记阈值触发 ECN CE 标记的队列深度通常配置为队列容量的 10%–30% [厂商建议范围]
端到端尾延迟(P99)从发送到接收的最差情况延迟AI 集群期望 < 10μs(同机架),< 100μs(跨机架)
RoCEv2 丢包率RDMA 流量的丢包比例趋近于零(任何丢包都可能触发超时重传,严重拖慢训练)

供需与市场数据

背景市场

DSCP 本身不产生直接收入,但它是 AI 集群网络解决方案的必要组件,其价值嵌入在以下市场中:

市场估算规模来源/口径与 DSCP 的关系
数据中心交换芯片~$150–200 亿(2025E)[行业报告估算]DSCP 分类调度是交换芯片的基本功能
AI 网络设备(交换+网卡)~$300–400 亿(2025E)[行业报告估算]DSCP 是 AI 网络 QoS 的基础机制
RoCEv2 RDMA 网卡~$50–80 亿(2025E)[供应链估算]网卡负责设置初始 DSCP 值

关键趋势

  • 400G→800G 迁移加速:更高的带宽使单个拥塞事件的影响更大,QoS 机制(DSCP + ECN + PFC)的重要性进一步提升
  • 超以太网联盟(Ultra Ethernet Consortium, UEC):正在制定下一代 AI 以太网标准,预计将在 DSCP 基础上扩展更精细的 QoS 语义
  • 端网协同:DSCP 标记从传统的”静态配置”向”应用层感知动态调整”演进

代表公司与资本映射

环节代表公司DSCP 相关产品/能力关注要点
交换芯片NVIDIA(Spectrum-X)Spectrum-4 芯片,完整的 DSCP/PFC/ECN 端到端方案AI 网络收入高速增长
交换芯片Broadcom(Jericho3-AI)Memory-Centric 交换架构,DSCP-aware 调度最大以太网交换芯片供应商
交换芯片Marvell(Teralynx)面向 AI 的低延迟交换芯片AI 网络份额追赶
交换设备Arista NetworksEOS 操作系统,AI Center 集群网络方案Meta/微软等大客户
交换设备华为CloudEngine 系列,AI Fabric 方案国内 AI 集群主要供应商
RDMA 网卡NVIDIA(ConnectX)ConnectX-7/8,NCCL 原生集成 DSCP 设置生态锁定优势
RDMA 网卡Broadcom(P 系列)面向 AI 的 RDMA 网卡开放生态替代选项
操作系统/软件SONiC开源网络操作系统,DSCP/QoS 配置标准化超大规模用户首选

投资逻辑

核心判断

DSCP 是 AI 集群网络 QoS 的基础协议机制,其投资价值不在于协议本身(免费标准),而在于承载它的硬件和软件平台。

投资主线

  1. AI 以太网替代 InfiniBand 的趋势 → DSCP 在以太网方案中的重要性上升

    • 受益标的:Arista(ANET)、Broadcom(AVGO)、Marvell(MRVL)
    • 逻辑:超大规模 AI 训练从 IB 迁移到以太网,带来以太网交换/网卡增量
  2. 交换芯片高端化 → 支持精细 DSCP 调度的高端芯片 ASP 更高

    • 受益标的:Broadcom、Marvell、NVIDIA
    • 逻辑:AI 集群对 QoS 的严格要求推动交换芯片向更复杂调度引擎升级
  3. 网络软件/自动化 → QoS 策略从手动配置走向意图驱动自动化

    • 受益标的:Arista、Cisco、以及 SDN 软件厂商
    • 逻辑:万卡集群手工配置 DSCP 不现实,需要自动化编排

风险提示

  • DSCP 作为开放标准,不构成直接竞争壁垒,关键在系统级方案整合能力
  • 如果 InfiniBand 在超大规模场景持续保持优势,以太网 QoS 方案的价值可能被压缩

常见误读纠偏

误读 1:“DSCP 就是 QoS 的全部”

纠偏:DSCP 仅是 QoS 体系中的分类标记环节。一个完整的 AI 集群网络 QoS 方案至少包含:

  • DSCP:L3 流量分类(“是什么业务?”)
  • 队列调度:交换机内部如何分配带宽(SP/WRR/DRR)
  • PFC:L2 无损流控(“队列满了暂停上游”)
  • ECN:端到端拥塞通知(“通知发送端降速”)
  • 应用层速率调整:NCCL 级别的全局调度

DSCP 没有流量控制能力,它只是给数据包”贴标签”。

误读 2:“PFC 替代了 DSCP 的作用”

纠偏:PFC 工作在 L2 链路层(802.1Qbb),它的 8 个优先级(CoS)是逐链路的。DSCP 工作在 L3 网络层,是端到端的。二者是协作关系而非替代关系:

  • DSCP 在源端标记,跨越多个交换机跳数保持不变
  • PFC 的 pause 帧只在一跳有效,不跨路由器
  • 跨 L3 边界的场景(如跨 POD/跨 AZ),DSCP 是唯一能保持业务分类语义的机制

误读 3:“DSCP 是 InfiniBand 的竞争技术”

纠偏:DSCP 是 IP/Ethernet 协议栈的组成部分。InfiniBand 使用 Virtual Lane (VL) 实现类似功能,走的是完全不同的协议栈。二者不是竞品,而是分别服务于以太网和 InfiniBand 两种网络架构。当前的竞争格局是以太网(用 DSCP/QoS)vs. InfiniBand(用 VL/QoS) 在 AI 集群网络层面的路线之争。

误读 4:“DSCP 配置是一次性的,设好就不用管”

纠偏:在 AI 训练场景中,不同训练任务的通信模式差异很大(如 Dense Model 的 AllReduce vs. MoE 模型的 All-to-All),最优的 DSCP/队列策略可能随任务变化。更先进的方案正在探索动态 DSCP 策略调整,由网络控制器根据实时拥塞状态和任务特征自动优化。


学习路径

Level 0  理解 OSI 模型和 IP 报文结构
   │       → 推荐:《计算机网络:自顶向下方法》
   ▼
Level 1  理解 DiffServ 基础
   │       → IETF RFC 2474(DSCP 定义)
   │       → IETF RFC 2475(DiffServ 架构)
   ▼
Level 2  理解 AI 网络中的 QoS 三件套
   │       → DSCP + PFC + ECN 协同机制
   │       → 推荐:NVIDIA Networking Community 文档
   │       → 推荐:《Data Center Networks: Topologies, Architectures and Fault-Tolerance Characteristics》
   ▼
Level 3  动手配置
   │       → 在 Linux 中用 `tc` 设置 DSCP
   │       → 在 SONiC/SONiC 配置 DSCP-to-Queue 映射
   │       → 模拟 RoCEv2 环境下的 QoS 验证
   ▼
Level 4  AI 集群级设计
   │       → 端到端 QoS 策略设计(NCCL→网卡→ToR→Leaf→Spine)
   │       → 推荐:NVIDIA AI Networking Best Practices 白皮书
   │       → 推荐:超以太网联盟(UEC)技术文档
   ▼
Level 5  前沿研究
           → UEC 下一代 QoS 语义
           → 意图驱动网络(IBN)中的动态 QoS
           → 大模型训练中的网络感知调度

一句话总结

DSCP 是 IP 报文里 6 bit 的优先级标签,本身极其简单,但在 AI 集群万卡训练场景中,它是保障 GPU 间 RDMA 流量获得优先调度的关键分类机制——理解 DSCP,是理解 AI 网络 QoS 的第一步。


延伸阅读与来源

资源说明
IETF RFC 2474DSCP 定义的权威标准
IETF RFC 2475DiffServ 架构框架
IETF RFC 2597AF PHB 定义
IETF RFC 2598EF PHB 定义
IETF RFC 3168ECN 标准化
InfiniBand Trade AssociationIB QoS (Virtual Lane) 规范
NVIDIA Networking DocumentationSpectrum-X / ConnectX QoS 配置指南
Ultra Ethernet Consortium (UEC)下一代 AI 以太网标准进展
Arista AI Networking WhitepapersAI 集群网络设计实践

本文档基于 IETF 标准文献和公开行业资料撰写。涉及 AI 集群具体配置的内容为行业典型模式的定性描述,实际部署因厂商方案和集群规模而异。市场规模为行业估算,非精确认定。

source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型