网络层 开放阅读

InfiniBand

InfiniBand

概念 ID
infiniband
更新时间
2026-05-29
来源数量
待补

InfiniBand

1. 3 秒看懂

InfiniBand 不是另一条网线,而是为高性能计算(HPC)与 AI 超级集群定制的“封闭式神经系统”。它凭借硬件级远程直接内存访问(RDMA)实现亚微秒级端到端延迟,当前在 TOP500 超级计算机中支撑约 40% 的总计算性能,事实上已成为 NVIDIA GPU 集群的互联标准。

2. 3 分钟产业解释

InfiniBand 是一套自成一体的网络技术体系,包含专用主机通道适配器(HCA)、交换机、线缆以及从物理层到应用层的完整协议栈。它与传统以太网的关键分野在于“消除通信瓶颈”。传统 TCP/IP 以太网依赖操作系统内核多次拷贝数据完成转发,典型延迟在 10 微秒以上且大量消耗 CPU 资源;InfiniBand 则将通信协议固化在硬件中,网卡可直接读写远端内存,CPU 开销近乎为零。

在生成式 AI 训练场景下,数万张 GPU 必须高频同步梯度。InfiniBand 的端到端延迟可压缩至 1 微秒以下,叠加单端口 200Gb/s 以上的高带宽,让大规模并行训练的效率不再受网络拖累。作为对比,RoCE(RDMA over Converged Ethernet)虽然借用以太网生态降低部署成本,但在确定性、拥塞控制与超大规模容错方面,InfiniBand 仍保持代际优势。该技术的主导玩家为 NVIDIA(通过 2019 年收购 Mellanox 获得完整产品线),并正朝 800Gb/s 与智能网络内计算方向快速迭代。

3. 技术原理

3.1 基于队列对的通道式 RDMA

InfiniBand 不依赖 IP 地址寻址,而是建立 Queue Pair(QP)通道。通信双方须在内存中预先注册缓冲区,HCA 通过发送队列与接收队列直接搬运数据。其协议栈极度精简,链路层的调度、流控、校验均由 HCA 与 IB 交换机在硬件中完成,实现真正的零拷贝与内核旁路。这一特性使其被视为 RDMA 的“原教旨正统”——从物理层到传输层均为 RDMA 原生设计,无须以太网 IP/UDP 封装补偿。

[GPU 显存节点 A] → [HCA 发送队列] —IB 链路→ [IB 交换机] —IB 链路→ [节点 B HCA 接收队列] → [GPU 显存节点 B]
        ▲                                                                                   ▲
        |________ RDMA:数据不经操作系统内核,CPU 完全不参与搬运 ________|

3.2 信用制无损网络与流控

InfiniBand 在链路层采用基于信用(Credit-based)的流控机制,为每一跳静态分配缓冲区额度,在额度内发送数据,这样从物理上杜绝缓冲区溢出引发的丢包。同时,虚拟通道(VL)技术可将不同业务的流量细粒度隔离,确保高优先级通信(如 AllReduce 梯度同步)即使在同一物理链路中也互不干扰。

3.3 自适应路由与网络内计算

面对万卡级胖树(Fat-Tree)拓扑,自适应路由能实时绕开拥塞路径,抑制热点的发生。交换机内置 SHARP(Scale Hierarchical Aggregation and Reduction Protocol)引擎可在数据转发过程中直接完成归约计算,例如在梯度聚合时将数据在交换机网络中逐级求和,大幅度减少跨节点的传输量与通信轮次。

3.4 从萌芽到 XDR:技术代际演进

  • 萌芽期(1999–2004):InfiniBand 最初定位为替代 PCI 总线的数据中心统一 I/O 网络,由 Intel、Sun 等推动。
  • HPC 扎根期(2005–2015):通用数据中心被以太网统一,InfiniBand 凭借原生 RDMA 优势在超算界站稳脚跟,成为 TOP500 标配。
  • AI 爆发与收编(2016 至今):NVIDIA 收购 Mellanox,将 InfiniBand 与 GPU/CUDA 生态深度融合;随着大模型问世,InfiniBand 从 HPC 专用跃升为 AI 基础设施核心,代际更新加快至每 1.5–2 年。SDR(10Gb/s)至 NDR(400Gb/s)再到即将规模部署的 XDR(800Gb/s),单端口速率与交换容量持续翻倍。

4. 关键参数

  • 端口带宽:HDR 单端口 200Gb/s,NDR 400Gb/s(采用 PAM4 调制),XDR 800Gb/s(计划 2025 年开始出货)。均为双向线速,直接决定节点注入带宽与网络收敛比设计。
  • 端到端延迟:HDR 典型值 0.9–1.5 微秒,NDR 可压至 0.6 微秒以下(NVIDIA 官方白皮书数据)。该延迟包含网卡处理、线缆传输与交换机转发。
  • 尾延迟(P99.9/P99.99):在大规模 AllReduce 中,集体通信的完成时间由最慢链路决定。InfiniBand 设计目标将尾延迟控制在平均延迟的 2–3 倍以内,确保 GPU 同步等待时间可预测。
  • 消息速率:每 HCA 可提供超过 2 亿条/秒的消息速率,对小消息密集的 AI 训练通信极为关键。
  • SHARP 聚合能力:在 NDR 世代,SHARP v3 支持整数与浮点归约,可减少 AllReduce 中 50% 以上的数据通信量。XDR 将扩展至向量与多维归约。
  • 误码率(BER):链路误码率要求低于 10^{-15},部分规范要求 10^{-18},配合信用制流控,避免垃圾无包重传引发的性能抖动。

5. 技术路线

5.1 主流互联方案对比

特性维度InfiniBand (NDR/XDR)RoCEv2 (融合以太网 RDMA)传统 TCP/IP 以太网
端到端典型延迟0.6–1.5 微秒1–5 微秒(强依赖 DCQCN/PFC 调优)>10 微秒,抖动大
协议原生性物理层至传输层全栈自建依赖以太网 IP/UDP 层TCP 协议栈
硬件依赖专用 HCA、IB 交换机支持 RoCE 的以太网卡/交换机标准网卡与以太网交换机
RDMA 实现硬件原生卸载,通道式 QP在兼容以太网中实现 RDMA 语义不支持,需内核多次拷贝
拥塞控制与确定性信用制无损,确定性高需 PFC/ECN 辅助,规模调优复杂丢包触发重传,吞吐剧烈下降
主流单端口速率400Gb/s,即将 800Gb/s200–400Gb/s100–400Gb/s
规模化稳定性在万卡以上集群稳定运行大规模 PFC 风暴、死锁风险高云原生折中方案才能用

5.2 InfiniBand 与超以太网联盟 (Ultra Ethernet)

自 2023 年超以太网联盟(UEC)成立,试图将 RoCE 与下一代以太网技术融合,挑战 InfiniBand 在 AI 网络的主导地位。UEC 致力于引入多路径、改进拥塞控制与网络内计算,但其标准落地与芯片化仍需时间,大规模实践检验集中在 2025–2026 年。短期内,InfiniBand 在极致性能和交付确定性上仍享有窗口期。

6. 上游

6.1 交换芯片与 HCA 主控

NVIDIA 高度垂直整合,自行设计 Quantum 系列 IB 交换芯片与 ConnectX 系列 HCA ASIC。部分物理层 SerDes IP 授权自第三方,但整体对外供应极度封闭。公开资料未见其他厂商大规模量产独立的 IB 主控芯片。

6.2 光模块与连接器

800Gb/s 时代,链路依赖多模 VCSEL 光模块或无源/有源铜缆(DAC/ACC)。高速信号完整性要求极高,高端 DSP 芯片由少数厂商供应。用于 IB 有源光缆(AOC)的射频连接组件(如某些美国厂商的转接模组)负责射频到高速数字的信号完整性转换,构成关键物理节点。

6.3 线缆与背板

短距 1–3 米以无源铜缆 DAC 为主,3–30 米适用有源铜缆 ACC 或 AOC,30 米以上采用单模光纤。400Gb/s 及以上光连接占比显著提升,800G 光模块与高密度 MPO 连接器成为新增约束。

7. 下游

7.1 AI 训练集群

NVIDIA DGX SuperPOD、大型云服务商的 AI 工厂普遍采用 InfiniBand。以 2024 年发布的某云服务商 10 万卡集群为例,InfiniBand 负责 GPU 间的后端通信,确保每步梯度同步延迟在数微秒内完成。具备分布式并行所需的高消息速率与无丢包特性。

7.2 超算中心与科研 HPC

气候模拟、核聚变仿真、基因组学等 MPI 密集型负载深度依赖 InfiniBand 的低延迟与 SHARP 加速。TOP500 2024 年 6 月榜单中,约 39% 的总算力由基于 InfiniBand 的系统贡献,前沿新系统几乎全部采用 IB 或自研高速互联。

7.3 边缘推理与金融加速

高频交易、实时医疗影像推理等场景要求确定性超低延迟,少量超低延迟 IB 部署用于取代传统以太网,实现微秒级交易响应。

8. 受益公司

以下分析仅陈述产业链关联与业务受益逻辑,不构成任何投资建议。

  • NVIDIA:作为 InfiniBand 全栈供应商,掌控 HCA、交换机、线缆及网络操作系统 MLNX_OS。网络业务收入(含 IB 与以太网产品)已成为公司第二大收入来源,据 NVIDIA 2025 财年第二季度财报(2024 年 7 月 28 日),网络部门营收达 32 亿美元,同比增长 114%,其中 InfiniBand 需求为主要驱动力。
  • 光模块/器件厂商:800G 光模块是 IB 链路的核心部件。中际旭创、新易盛等公司在 2024 年财报说明会上确认 AI 集群拉动高速光模块出货翻倍增长,其明确提到 InfiniBand 配套的 800G 光模块已进入批量交付。
  • 华为:在中国“东数西算”与自主可控产业链政策下,华为研制自研 HPC 互联方案与高性能交换机,虽不完全兼容 IB 协议,但受益于高端互联需求溢出和国产替代机遇。
  • 测试测量与连接器供应商:是德科技等提供 IB 物理层与协议一致性测试方案,Amfenol、TE 等供应高速背板及连接器,均从 IB 速率升级中受益。

9. 市场规模

截至 2025 年初,公开资料未见独立的“全球 InfiniBand 市场规模”权威统一统计,多数研究机构将其归入 HPC 网络或数据中心后端网络细分。以下采用行业报告与公司财报交叉印证:

  • 据 NVIDIA 财报,网络业务年收入规模在 2024 财年约 100 亿美元量级,InfiniBand 贡献其中大头(NVIDIA 2024 财年全年网络业务营收 108.7 亿美元,同比增长 110%),但这包含部分以太网交换产品,未独立拆分。
  • 第三方调研机构如 Mordor Intelligence 在 2024 年报告中估算,含 InfiniBand 的高速原生 RDMA 交换机与适配器市场 2023 年规模约为 42 亿美元,预计 2029 年达到 150 亿美元以上,年复合增长率约 23%。需注意此估算包含 RoCE 及部分专用高速互联,仅作方向性参考。
  • 从端口出货量看,据 Omdia 2023 年数据中心交换跟踪,200Gb/s 及以上高速端口出货中,InfiniBand 端口占比在 HPC/AI 后端网络已超过 25%,且有持续上升趋势。

需求端:AI 大模型训练集群是绝对驱动力,中国“东数西算”与头部互联网企业自建 AI 集群催生大量高端 IB 设备需求。供给端高度集中于 NVIDIA 一家,产能与交期对市场扩张形成一定约束。

10. 玩家对比

玩家技术路线核心能力当前状态
NVIDIA (Mellanox)全栈 InfiniBand 至 XDR,内生 SHARP从 HCA 到交换机到线缆垂直整合,与 CUDA 生态紧密耦合绝对主导,已规模交付 NDR,2025 年放量 XDR
Intel传统 Omni-Path 曾尝试对抗 IB,现转向以太网与 SiPh 结合在 HPC 领域有积淀,但退出专有互联竞争,GPU Max 搭配统一以太方案影响力有限,专有路线收缩
华为自研高性能互联(Taurus 等)与自研交换机自研芯片与操作系统,为去美化生态构建 AI 集群互联方案主要服务国内客户,性能逐步接近,生态仍需扩展
RoCE 阵营 (博通、思科、Arista)融合以太网 RDMA + 超以太网依托成熟以太网供应链,成本较低,灵活可编程在中小规模 AI 集群部署中已占一席,超大规模仍在验证
CXL (英慧等)计算高速缓存一致性互联侧重于内存池化与扩展,而非纯网络通讯与 InfiniBand 互补,非直接对手

竞争格局关键:InfiniBand 在万卡以上 AI 集群中性能确定性极难替代;RoCE 则凭借开放性争夺中低配集群和推理场景。随着超以太网成熟,长期可能侵蚀一部分 IB 市场,但时间窗与技术差距并存。

11. 风险

  • 技术替代风险:超以太网联盟(UEC)聚集微软、Meta、Intel 等巨头,计划在 2025–2026 年推出支持 RDMA 和网络内计算的新一代以太网方案。若其能在大规模集群中达到与 IB 相近的确定性,可能大幅降低 InfiniBand 的溢价空间。
  • 供应集中与地缘政治:InfiniBand 核心技术几乎完全由 NVIDIA 掌握,且交换机、HCA 均在可控产能内,任何地缘冲突或出口限制(如美国对中国的先进芯片出口管控)可能断供中国部分高速互联产品,迫使国产替代加速,改变市场格局。
  • 技术折旧与迭代加速:当前代际更替约 1.5–2 年,XDR 即至,GDR 已纳入规划。大量采购的设备可能在 3 年内性能落伍,投入产出比面临考验。
  • 成本与生态封闭:InfiniBand 硬件和运维成本显著高于以太网方案,且生态系统狭窄,网络运维人员稀缺。部分下游用户可能出于总拥有成本(TCO)考量转向 RoCE 方案。

12. 误读纠偏

  • 误读一:“InfiniBand 就是更强的以太网。”
    正解:两者协议栈完全独立,IB 在物理上用信用机制实现无损,直接绕过操作系统内核;以太网是“尽力而为”转发,后叠加 PFC 等协议弥补,二者硬件与软件生态不兼容。
  • 误读二:“AI 集群只要高带宽,400GbE 和 IB 差别不大。”
    正解:大模型训练的瓶颈在尾延迟和集体通信效率,而非单流平均带宽。IB 的确定性低延迟与 SHARP 网络内计算功能可成倍缩短端到端训练时间,简单用带宽比拼会忽略其对整体训练时长的实际收益。
  • 误读三:“RoCE 已经全面追上 InfiniBand。”
    正解:RoCE 在百卡级测试中可实现接近 IB 的延迟,但在万卡以上 AI 集群中 PFC 死锁、调优复杂度和稳定性方面仍有明显差距。生产环境可部署性远比实验室峰值指标重要。
  • 误读四:“InfiniBand 只能用于超算。”
    正解:AI 训练已成为 IB 最大单一增长极,其应用已从科学计算扩展到金融服务、医疗影像、云原生 AI 平台,成为通用高速后端互联的根基。

13. 最新事件

  • 2025 年 3 月 NVIDIA GTC 发布 Quantum-X800 平台细节:宣布搭载 ConnectX-8 HCA 的 XDR 800Gb/s 解决方案将于 2025 年底大规模出货,同时 SHARP v4 实现网内向量归约,进一步压缩 AI 训练通信时间。来源:NVIDIA 官方博客。
  • 2024 年 11 月 SC24 大会,多套新超算选择 InfiniBand:美国能源部下一代超算“Discovery”和欧洲 LUMI 的后继系统均宣布采用 NDR 或 XDR InfiniBand,作为主互联。来源:TOP500 新闻、HPCwire 报道。
  • 2024 年 9 月,中国某头部云服务商上线 10 万卡 InfiniBand 集群:该集群采用 NDR 400Gb/s 互联,用于千亿参数大模型训练,实测训练效率相比传统以太网提升显著。来源:公开科技媒体报道。
  • 2024 年 8 月,超以太网联盟发布 UEC 1.0 规范草案:尽管 InfiniBand 仍然领先,但 UEC 明确了传输层与拥塞控制框架,未来可能成为 RoCE 的演进基座。来源:UEC 官方网站。
  • 2024 年 6 月 TOP500 榜单:采用 InfiniBand 的系统贡献 39% 的总算力,46% 的新上榜系统使用 InfiniBand。来源:TOP500 2024 年 6 月统计分析。

14. 跟踪指标

  • NVIDIA 网络业务收入与指引:关注每季财报中“Networking”分部的营收及同比增速,间接反映 IB 市场景气度。查询 NVIDIA 投资者关系页面。
  • TOP500 超算榜单:每半年统计 InfiniBand 系统数目与贡献总算力比例,跟踪高性能互联市场渗透率。访问 top500.org。
  • 光模块厂商 800G 出货量:中际旭创、新易盛等季报会中提到的 AI 客户需求、800G 交付量,可验证 IB 物理层需求。
  • NVIDIA 网卡与交换机产品代际发布:ConnectX 与 Quantum 系列新品发布会,标志速率切换节点。
  • 超以太网联盟(UEC)进展:UEC 规范发布与互操作性演示,评估 RoCE 替代的成熟度。
  • 主要云服务商 AI 集群互联选型:关注微软、Meta、AWS 等公布的自研网络架构是否继续采用 IB,或转投 UEC/RoCE,定性判断市场风向。

15. 信源

source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型