网络层 开放阅读

SHARP

Scalable Hierarchical Aggregation and Reduction Protocol

概念 ID
scalable-hierarchical-aggregation-and-reduction-protocol
更新时间
2026-05-29
来源数量
待补

SHARP

3 秒看懂

一句话: SHARP 让交换机在数据”飞过”的过程中直接做归约计算(如梯度求和),大幅降低了传统树状 AllReduce 的上层链路带宽压力——是 NVIDIA InfiniBand 集群在万卡规模下压低通信墙的核心网络内计算技术。

3 分钟产业解释

为什么需要 SHARP?

大模型分布式训练的”最后一公里”瓶颈往往不是算力,而是通信。当数千张 GPU 同步梯度(AllReduce),每个节点既要发送也要接收,网络带宽很快被集体通信操作(collective operations)吃满。

传统路径:梯度数据从每张 GPU → NIC → 交换机 → 交换机 → … → 目标 NIC → 目标 GPU,交换机只做转发(cut-through),不参与任何计算。这意味着 N 张卡做 AllReduce,网络中实际传输的数据量与 N 成正比,且每一跳都只是”搬运工”。

SHARP 的核心思想: 让 InfiniBand 交换机的 ASIC 在转发的同时执行归约运算(reduction:sum、max、min、band OR 等)。数据经过树状拓扑中的每一层交换机时,先被部分聚合,再往上层传递——越往上,流量越少。最终到达根节点时,归约结果已近完成,再广播回来即可。

效果: 降低 AllReduce 的有效网络流量、降低延迟、释放端点 CPU/NIC 的参与负担。

产业地位

SHARP 是 NVIDIA 网络平台(ConnectX NIC + Quantum 系列 InfiniBand 交换机 + SHARP 协议)的差异化护城河之一。在 TOP500 超算和万卡级 AI 集群中,SHARP 是 InfiniBand 方案相对以太网方案的关键竞争要素。它是 NVIDIA “networking as a differentiator”战略的技术锚点。

15 分钟专家深入

1. In-Network Computing 范式

SHARP 属于更广泛的 In-Network Computing(网络内计算) 范式。该范式的基本命题是:

交换机/路由器不再只是转发设备,而是在数据平面(data plane)直接对有效载荷执行计算操作,从而减少总通信轮次和数据量。

SHARP 是该范式中最成熟、部署最广的生产级实现之一(另一代表是 HPE/Cray Slingshot 网络中的部分能力)。

2. SHARP 在 AllReduce 中的价值量化

以一个简化的二叉树拓扑为例,假设有 N=1024 张 GPU,每张产出 G GB 梯度:

指标传统 Tree AllReduce(软件实现)SHARP 加速的 Tree AllReduce
每层归约前数据量全量逐层递减(子树内先聚合)
理论跨层带宽消耗每链路传输数据量为 G,总传输量约 2(N-1)G与传统 Tree AllReduce 相同(每链路 G),收益在于延迟降低和端点卸载
端点参与程度NIC/CPU 全程参与仅需发起和接收,中间归约卸载到交换机
扩展性瓶颈万卡规模带宽墙瓶颈后移(但受限于交换机归约引擎能力)

注意: 实际加速比取决于拓扑深度、归约粒度、SHARP 引擎的并行处理能力,以及数据是否可被有效分片。[NVIDIA/Mellanox 公开白皮书] 中提到在特定基准下可观测到显著的延迟降低,但具体倍数因场景而异,不做通用数值断言

3. SHARP 与 NCCL 的协同

NVIDIA 的集合通信库 NCCL(NVIDIA Collective Communications Library)是 SHARP 的上层消费者之一。当 NCCL 检测到底层网络支持 SHARP 时,可将部分集合操作卸载(offload)到网络中的 SHARP 引擎。这并非完全替代 NCCL 的 AllReduce,而是一种分层协同

  • NCCL 负责 GPU↔NIC 的通信调度和拓扑感知
  • SHARP 负责交换机层面的归约加速
  • 管理层面通过 Sharp Daemon 协调 SHARP 资源分配

技术原理(深入机制)

核心架构

┌─────────────────────────────────────────────────────┐
│              SHARP 协议栈与执行模型                    │
│                                                     │
│  ┌─────────┐    ┌─────────────────────────────┐     │
│  │  NCCL /  │───▶│  SHARP Manager (管理节点)     │     │
│  │ MPI Lib  │    │  - Job/Communicator 管理     │     │
│  └────┬─────┘    │  - SHARP 资源分配             │     │
│       │          └──────────┬──────────────────┘     │
│       ▼                     ▼                        │
│  ┌─────────┐    ┌─────────────────────────────┐     │
│  │ConnectX  │    │  InfiniBand Switch (Quantum) │     │
│  │  NIC     │    │  ┌─────────────────────────┐ │     │
│  │          │    │  │  SHARP Reduction Engine  │ │     │
│  │ SHARP    │◄──▶│  │  - 硬件归约单元          │ │     │
│  │ Agent    │    │  │  - 支持的操作:           │ │     │
│  │          │    │  │    SUM / MAX / MIN / BOR  │ │     │
│  └─────────┘    │  │  - 原地(in-place)归约     │ │     │
│                 │  └─────────────────────────┘ │     │
│  [GPU 0..N]     └─────────────────────────────┘     │
└─────────────────────────────────────────────────────┘

执行流程(以 AllReduce 为例)

          传统 AllReduce (Ring)              SHARP Tree AllReduce
          
  Step 1:  GPU0→GPU1→GPU2→...→GPUn     Step 1: GPU0,1 → L1-SW-A (partial sum A)
  Step 2:  GPU1→GPU2→...→GPUn→GPU0          GPU2,3 → L1-SW-B (partial sum B)
  ...                                        ...
  (2*(N-1) 步)                          Step 2: L1-SW-A + L1-SW-B → L2-SW (further aggregate)
                                             ...
  总传输量 ~ 2*(N-1)*G               Step K: Root-SW holds full reduction result
                                        Step K+1: Result broadcast back to all GPUs
                                        
                                        总传输量 ≈ 2*G*(N-1) (每条链路仅传一次上行和一次下行)
                                        但受制于交换机归约引擎吞吐

关键技术参数(定性,因搜索未能获取精确规格)

参数说明置信度
支持的归约数据类型通常支持常见的数值类型(float16/32、int 等)定性确认
每端口归约引擎数与交换机 ASIC 设计相关,具体数量级未充分披露未充分披露
延迟开销在交换机转发延迟基础上增加归约处理延迟,量级为百纳秒至微秒级[行业估算]
SHARP v1 → v2 的能力扩展v2 扩展了可支持的数据类型和操作种类,增加了对更复杂 collective 的支持定性确认

通信原语:SHARP 与标准 MPI Collectives 的对应

SHARP 主要支持的是归约类(reduction)操作,包括但不限于:

  • AllReduce(最核心场景)
  • Reduce
  • Barrier(同步点卸载)
  • Broadcast(结合归约结果的广播)
  • 部分支持 Reduce-Scatter 等

⚠️ 关键区分: SHARP 处理的是 AllReduce/Reduce 等归约通信,不是 All-to-All。All-to-All 是 MoE(Mixture-of-Experts)场景中 dispatch/combine 的核心通信模式,通常由 NCCL 或专用方案处理,与 SHARP 的归约卸载属于不同维度。


技术演进史

时间线(年份为近似)

2015-2016  Mellanox 提出 In-Network Computing 概念,SHARP v1 开始研发
    │      背景:HPC 社区对集合通信效率的长期不满
    ▼
2017-2018  SHARP v1 随 Mellanox Quantum (HDR 200G) 交换机发布
    │      首次在 InfiniBand 交换机 ASIC 中集成硬件归约引擎
    │      主要面向 HPC 超算(如美国 Summit/Sierra 等 ORNL 系统的通信栈)
    ▼
2019       NVIDIA 以 69 亿美元收购 Mellanox,SHARP 纳入 NVIDIA 网络版图
    │
    ▼
2021-2022  SHARP v2 随 Quantum-2 (NDR 400G) 交换机发布
    │      增强了归约能力,适配更大规模 AI 训练集群
    │      与 NCCL 的协同深度优化
    ▼
2023-2024  SHARP 随 Quantum-X800 (XDR 级别) 进入下一代
    │      面向万卡级 GPU 集群(如 xAI Colossus 等)
    │      SHARP 成为 NVIDIA AI 网络栈"端到端优化"叙事的核心组件
    ▼
  未来     Ultra Ethernet Consortium (UEC) 推动以太网实现类似能力
           SHARP 可能扩展到更多操作类型和更大归约粒度

技术路线对比

SHARP vs 端侧软件 AllReduce vs 竞品方案

维度传统软件 AllReduce (NCCL Ring/Tree)SHARP (InfiniBand In-Network)Ultra Ethernet (UEC 目标)Cray/Slingshot 网络能力
归约位置端点 NIC/GPU交换机 ASIC 内以太网交换机(规划中)Slingshot 交换机(部分能力)
网络类型通用InfiniBand 专用以太网Slingshot 专用
流量优化取决于算法理论上树状逐层缩减目标类似有类似思路
成熟度极成熟生产级,大规模部署标准制定中(截至2024)已部署(HPC 场景)
生态锁定低(通用)中高(需 InfiniBand 全栈)低(以太网通用)高(需 Slingsht 全栈)
GPU 供应商兼容通用主要优化 NVIDIA多供应商多供应商
适用规模中大规模有效万卡级优势明显目标万卡级万卡级 HPC

投资含义: SHARP 是 NVIDIA InfiniBand 对以太网的结构性差异化点。UEC 若成功标准化类似能力,将削弱此优势。


上下游

上游

环节要素代表
交换机 ASIC 设计归约引擎的晶体管资源、制程NVIDIA Mellanox(自研 ASIC,具体制程未充分披露)
SerDes / PHY高速串行收发器(每端口 400G+)Broadcom、Marvell、NVIDIA 自研
交换芯片制造晶圆代工台积电(高概率,NVIDIA 为主要客户)
光模块 / 铜缆InfiniBand 链路层物理连接中际旭创、Coherent 等

下游

环节要素代表
AI 训练集群万卡 GPU 集群的通信层xAI、Meta、字节跳动等
HPC 超算传统 HPC MPI 工作负载ORNL、LLNL 等国家实验室
集合通信库NCCL、OpenMPI(SHARP-aware)NVIDIA、开源社区
集群管理软件Sharp Daemon、UFM(Unified Fabric Manager)NVIDIA

产业链价值分配(定性)

SHARP 的"附加价值"主要体现在:
- 提升 InfiniBand 交换机的 ASP(交换机不只是转发设备)
- 增强 NVIDIA 网络 vs 以太网方案的 TCO 优势叙事
- 加深客户对 NVIDIA 全栈(GPU + NIC + Switch + Software)的锁定

整个价值量相对 GPU 本身较小,但战略杠杆效应大。

关键指标

指标说明评估
AllReduce 延迟降低SHARP vs 纯软件方案的端到端 AllReduce 延迟差NVIDIA 宣称显著降低,具体数字因集群规模/拓扑/数据量差异大,不做通用断言
网络流量缩减率归约操作中实际减少的跨链路数据量比例(注:传统 Tree AllReduce 每链路数据量已为 G,SHARP 未额外减少链路带宽消耗)SHARP 主要收益在延迟和端点卸载,而非流量缩减;理论上链路数据量无缩减
交换机功耗开销归约引擎增加的额外功耗未充分披露,定性为”小幅增加”
支持的最大集群规模SHARP Manager 可管理的节点/端点数随 Quantum-2/Quantum-X800 持续扩展,具体上限未充分披露
与 NCCL 集成深度NCCL 对 SHARP offload 的支持程度随 NCCL 版本持续优化,2024 年已是默认启用(在 InfiniBand 环境下)

供需与市场数据

直接市场:InfiniBand 交换机

维度数据来源
InfiniBand 交换机市场(2023)NVIDIA 占据 InfiniBand 交换机绝大部分份额[行业报告估算]
SHARP 作为交换机功能随 Quantum 系列交换机出货即包含,不单独定价[厂商公开信息]
AI 用网络设备市场增速2023-2025 年 CAGR 预计 > 50%[行业报告估算]

间接影响:对 NVIDIA 网络收入的支撑

  • NVIDIA 网络业务(含 InfiniBand + Spectrum 以太网)在数据中心收入中占比持续提升
  • SHARP 作为 InfiniBand 的”卖点功能”,间接支撑了交换机和整网方案的溢价能力
  • 在万卡集群项目中,网络方案选择(IB vs 以太网)直接影响数十亿美元级订单

⚠️ SHARP 不是一个独立的可售产品,而是嵌入 InfiniBand 交换机的功能模块,不存在单独的 SHARP 市场规模数据


代表公司与资本映射

直接相关

公司关联上市代码
NVIDIASHARP 开发方(通过收购 Mellanox),InfiniBand 全栈提供者NVDA
Intel间接竞争(通过 HPC Slingshot 方案及未来 UEC 标准化)INTC

间接受益 / 关联

公司关联上市代码
中际旭创InfiniBand 光模块供应(800G 光模块)300308.SZ
Coherent高速光模块(InfiniBand 生态供应商)COHR
Arista Networks以太网竞争方案(UEC 成员),UEC 若成功可削弱 SHARP 护城河ANET
Broadcom交换芯片竞争(以太网侧),Tomahawk/Jericho 系列AVGO

投资映射逻辑

SHARP 本身不可直接投资,但其影响路径:

1. 最直接:NVIDIA 网络业务收入和 ASP 提升
2. 间接受益:InfiniBand 生态供应商(光模块、连接器)
3. 竞争观察:UEC 进展对 SHARP 护城河的潜在削弱

投资逻辑

看多逻辑

  1. AI 训练集群规模持续膨胀 → 通信瓶颈加剧 → In-Network Computing 需求刚性上升
  2. NVIDIA 全栈锁定效应 — SHARP 是”GPU + NIC + Switch + NCCL + SHARP”五层协同中的关键一环,竞争对手需要同时复制五层才能匹敌
  3. 护城河持续加宽 — SHARP v2 已经是第二代,硬件归约引擎的 ASIC 设计经验壁垒高
  4. HPC + AI 双轮驱动 — 两个万亿级算力市场都对高效集合通信有刚需

看空 / 风险因素

  1. Ultra Ethernet Consortium (UEC) — 若以太网生态成功标准化类似 SHARP 的 In-Network Computing 能力(RDMA + 可编程交换芯片),InfiniBand 的差异化将被稀释
  2. Google TPU 互联架构 — 自研 ICI (Inter-Chip Interconnect) 不依赖 SHARP/InfiniBand,大客户可能自建通信栈
  3. AMD + Broadcom + UEC 联盟 — 以太网 + RoCE + UEC 的组合可能在 TCO 上挑战 IB 全栈
  4. 监管风险 — NVIDIA 网络+计算的垂直整合可能面临反垄断审查

关键验证信号

  • NVIDIA 财报中网络业务收入增速是否持续高于 GPU 业务
  • UEC 1.0 标准发布时间及首批产品的 In-Network Computing 实测性能
  • xAI、Meta 等超大集群客户最终选择 IB vs 以太网的决策趋势
  • 800G 及以上 InfiniBand 交换机中 SHARP 能力的具体升级点

常见误读纠偏

误读 1:“SHARP 可以完全替代 NCCL 的 AllReduce”

纠偏: SHARP 不是 NCCL 的替代品,而是协同加速层。NCCL 负责 GPU 到 NIC 的通信调度、拓扑感知、分块策略等,SHARP 负责交换机层面的归约卸载。两者是分层互补关系,不是替代关系。SHARP 只能在 InfiniBand 交换机覆盖的网络段内工作,端点侧仍需 NCCL(或其他通信库)配合。

误读 2:“SHARP 对所有通信操作都有加速效果”

纠偏: SHARP 的核心能力是归约操作(reduction:sum、max、min 等)。它对 AllReduce、Reduce 有直接加速。但对于 All-to-All(MoE 的 dispatch/combine 模式)、点对点 Send/Recv 等操作,SHARP 不适用。MoE 模型训练中 All-to-All 的通信瓶颈,需要其他方案(如 NCCL 优化、拓扑感知调度)来解决,不能指望 SHARP。

误读 3:“SHARP 的加速效果可以线性量化为 X 倍”

纠偏: SHARP 的实际收益高度依赖于:① 集群拓扑深度(树越深,中间归约的收益越大);② 数据块大小;③ 并发归约流数量;④ 交换机归约引擎的处理能力。不存在一个通用的”SHARP 加速 X 倍”数字。 NVIDIA 在特定基准测试中公布的结果不一定代表实际工作负载。任何看到”SHARP 加速 2x/5x”之类的断言,需追问其测试条件。

误读 4:“以太网方案完全无法实现类似 SHARP 的能力”

纠偏: 技术上,可编程以太网交换芯片(如 Barefoot Tofino / Intel)具备数据面编程能力,理论上可以实现归约卸载。UEC 标准化组织正在推动以太网侧的 In-Network Computing 标准化。当前差距主要在于:① InfiniBand 交换机有专用硬件归约引擎(性能更高),以太网方案多依赖可编程流水线(灵活性高但专用性能可能不及);② 生态成熟度(SHARP 已经是第二代且大规模部署)。但这个差距正在缩小,不是技术不可行。


学习路径

入门(30 分钟)

  1. 阅读 NVIDIA Mellanox 关于 SHARP 的官方概述页面(搜索 “NVIDIA SHARP In-Network Computing”)
  2. 理解 AllReduce 的基本原理(推荐:Liam Li et al., “Communication Optimizing AllReduce”)

进阶(2-3 小时)

  1. 阅读 NVIDIA SHARP 技术白皮书(官方 PDF,注意版本,搜索 “SHARP v2 whitepaper”)
  2. 了解 InfiniBand 拓扑(Fat-Tree / Dragonfly)与 SHARP 的树状归约映射关系
  3. 对比阅读:Ultra Ethernet Consortium 的愿景文档,理解竞争格局

专家级(持续跟踪)

  1. 关注 SC(Supercomputing)和 ISC HPC 会议中关于 In-Network Computing 的论文和 BoF
  2. 阅读 NCCL 的 GitHub 仓库中关于 SHARP offload 的代码路径和 issue 讨论
  3. 跟踪 NVIDIA GTC 网络专场演讲,获取最新 SHARP 能力更新
  4. 关注 UEC 标准进展(ultraethernet.org),评估以太网侧竞争能力成熟时间线

一句话总结

SHARP 是 NVIDIA InfiniBand 网络的”隐性加速器”——它把交换机从被动的搬运工变成主动的计算节点,在梯度同步的数据路径上就地完成归约,是万卡级 AI 训练集群通信效率的关键差异化技术,也是 NVIDIA 全栈锁定策略中网络层的核心锚点。


延伸阅读与来源

来源说明类型
NVIDIA/Mellanox “SHARP In-Network Computing” 官方技术页面协议概述和版本说明厂商白皮书
”In-Network Computing: Trends and Applications”(多篇 SC/ISC 论文)学术视角的 In-Network Computing 综述学术论文
NVIDIA GTC 演讲 “Accelerating AI with In-Network Computing”产品路线图和性能数据厂商演讲
Ultra Ethernet Consortium (ultraethernet.org)竞争标准跟踪行业联盟
NCCL GitHub 仓库(github.com/NVIDIA/nccl)SHARP offload 代码路径开源代码
TOP500 Supercomputer Sites 使用 InfiniBand + SHARP 的列表部署实例验证行业数据库
SemiAnalysis / The Next Platform 相关分析文章第三方技术分析行业分析

免责声明: 本文中未能通过本次检索获得精确规格参数的部分,已标注为 [未充分披露] 或 [行业估算],具体数字请以 NVIDIA 官方最新文档为准。本文不构成投资建议。

source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型