网络层 开放阅读

IBTA

InfiniBand Trade Association

概念 ID
infiniband-trade-association
更新时间
2026-05-29
来源数量
待补

IBTA

3 秒看懂

IBTA(InfiniBand Trade Association)并非一家公司,而是一个制定和推广 InfiniBand 互联技术标准的非营利性行业联盟。InfiniBand 技术是当前 AI 大模型训练集群内部高速数据通信的“神经系统”。研究 IBTA,本质上是理解 AI 算力供应链中那条由标准定义、由头部厂商主导、连接万卡乃至十万卡集群的关键技术纽带。

3 分钟产业解释

在生成式 AI 时代,单台服务器远不足以训练万亿参数的大语言模型。数以万计的 GPU 或 AI 加速器必须组成集群协同工作,这些计算节点之间每秒有海量数据(模型参数、梯度、中间激活值)需要同步。数据交换的速度、延迟和可靠性,直接决定了训练一个 GPT-4 或同等规模模型所需的时间成本和经济成本。

InfiniBand 就是为解决这一核心瓶颈而生。它由 IBTA 负责维护和演进,是一套为高性能计算(HPC)和 AI 场景深度定制的高速互联标准,具备几项不可替代的核心能力:原生支持远程直接内存访问(RDMA)、极低的端到端延迟(微秒级)、极高的有效带宽(数百 GB/s 端口速率)、硬件级的流量控制和面向万级节点规模的扩展性。

IBTA 的角色可与 Wi-Fi 联盟或 PCI-SIG 类比:它自身不生产芯片、线缆或交换机,而是联合成员公司——包括英伟达、微软、英特尔、Meta、博通等——共同制定技术蓝图(即 InfiniBand 规范),定义物理层、链路层、网络层、传输层和管理层协议,组织互通性测试,并定期发布路线图。其生态中的产品由英伟达(通过 2019 年收购 Mellanox 获得)等厂商实现和销售。因此,在考察 AI 基础设施投资线索时,“IBTA 生态”的影子贯穿了从交换机芯片、网卡、光模块到整集群系统集成的一整条价值链,理解 IBTA 是理解 AI 硬件供应链壁垒的第一步。

技术原理

InfiniBand 的技术架构是为解决“多节点协同计算时的通信墙”而高度特化的。其核心设计哲学是将网络协议栈的繁重工作完全卸载到网卡硬件,让宝贵的 CPU 周期回归应用层计算。

分层架构

+---------------------------------------+
| 应用层 (MPI, NCCL, SHARP)             |
+---------------------------------------+
| 传输层 (可靠/不可靠数据报,基于队列对 QP) |
+---------------------------------------+
| 网络层 (子网路由,基于 LID/GID)        |
+---------------------------------------+
| 链路层 (虚拟通道 VL,基于信用的流控)     |
+---------------------------------------+
| 物理层 (PAM4/NRZ 编码,电口/光口 SerDes)|
+---------------------------------------+

关键机制

  1. RDMA(远程直接内存访问):InfiniBand 原生支持 RDMA,允许一台节点上的网卡直接读写另一台节点的应用层内存空间,完全旁路远程主机的操作系统内核。这一机制消除了传统 TCP/IP 网络中大量的 CPU 中断处理与内核级数据拷贝过程,是实现微秒级延迟和集合通信操作(如 AllReduce)高效执行的基础。

  2. 传输卸载(Transport Offload):与依赖主机 CPU 运行 TCP/IP 协议栈的普通网卡不同,InfiniBand 主机通道适配器(HCA,即网卡)在硬件中完成全部传输层逻辑处理,包括分段、重组、重传和拥塞控制。这使得 CPU 得以专注于模型计算,实现了计算与通信的有效重叠。

  3. 队列对(Queue Pair, QP)模型:每一次通信连接都以“队列对”为基本单位,包含发送队列和接收队列。应用通过向工作队列提交工作请求(Work Request)发起通信操作,HCA 异步完成处理并将完成事件写入完成队列(Completion Queue)。这种异步语义与 GPU 典型的异步计算模式高度契合。

  4. 基于信用的链路层流控:InfiniBand 在链路层采用基于信用(Credit-based)的流量控制机制,发送端只有在确认接收端有足够的缓冲区信用后才发送数据。该机制从协议层面杜绝了缓冲区溢出和丢包,提供了端到端的“无损网络”基础,这是 RoCEv2 等以太网方案需要通过 PFC(优先级流控)等手段尽力逼近的目标。

  5. 子网管理(Subnet Manager, SM):InfiniBand 子网采用集中式管理架构。子网管理器负责发现拓扑、分配 LID(本地标识符)、计算转发路径并向每个交换机下发线性转发表。这种集中式管理极大简化了路由计算和故障恢复逻辑,支持在一个子网内管理数万个端点。

  6. 网络内计算(SHARP/In-Network Computing):新一代 InfiniBand 交换机内置计算单元,能够在对数据进行转发的同时执行规约操作(如求和、求最大值)。这种“数据在移动中计算”的范式大幅度减少了聚合通信时的网络带宽压力,是 NDR/XDR 时代的核心差异化技术。

关键参数

以下参数体系用于衡量 InfiniBand 技术的代际性能及生态成熟度。涉及具体数字的,均已标注大致年份与来源口径,未标注则代表公开资料未见精确披露。

指标典型范围/阶段年份 / 来源
单端口标称速率HDR: 200 Gb/s;NDR: 400 Gb/s;XDR: 800 Gb/s英伟达产品披露;XDR 路线图见于 2023-2024 IBTA 技术路线讨论
端到端延迟(开关延迟)约 1.0–1.5 μs(HDR 交换机延迟,典型值)厂商白皮书(Mellanox/英伟达,2020 年前后)
最大子网节点数单个子网理论上支持超过 48,000 个端点IBTA 规范(Vol.1)
支持拓扑Fat-Tree、DragonFly+、Torus、3D-Torus 等行业实践与文献,可追溯至 TOP500 系统描述
集合通信优化SHARP 可降低 AllReduce 通信数据量约 2 倍(理论)英伟达技术文档 (2020-2023)
功耗敏感指标每 bit 能量消耗(pJ/bit):较高速率节点逐步优化公开资料未见统一的行业标准基准
生态互操作认证IBTA 定期组织拔插测试(Plugfest)IBTA 官方网站记录(2010 年代至今持续)
在 TOP500 中的网络份额超过 200 套系统采用 InfiniBand(2023 年 11 月榜单)TOP500.org 统计

技术路线

  • 1999 年:IBTA 成立,创始公司包括 Compaq、Dell、HP、IBM、Intel、Microsoft 和 Sun。InfiniBand 架构 1.0 规范发布,初始愿景为统一服务器 I/O 与存储网络。
  • 2000 年代初期:Intel 转向推动 PCI Express,InfiniBand 在通用服务器 I/O 领域的替代路线受挫。技术重心转向高性能计算(HPC)和后端存储集群。
  • 2000 年代中期到 2010 年代:InfiniBand 成为 TOP500 超级计算机的主流互联方案之一。SDR(10 Gb/s)、DDR(20 Gb/s)、QDR(40 Gb/s)速率持续迭代,Mellanox 逐步确立芯片与设备市场核心地位。
  • 2013–2015 年前后:FDR(56 Gb/s)、EDR(100 Gb/s)落地,RDMA 生态趋于成熟,Linux 内核和主流 MPI 实现全面支持 InfiniBand。
  • 2019 年:英伟达以 69 亿美元收购 Mellanox,交易于 2020 年完成。InfiniBand 自此与英伟达 AI 战略深度耦合,成为其后端网络(南北向和计算平面)的核心技术资产。
  • 2020–2021 年:HDR(200 Gb/s)大规模部署,英伟达将 InfiniBand 定义为其 DGX 系列 AI 平台的标准网络结构。
  • 2022–2023 年:NDR(400 Gb/s)量产并进入头部云厂商和 AI 实验室的万卡级训练集群。IBTA 公布 XDR 方向路线图,速率锚定 800 Gb/s。
  • 2024 年至今:IBTA 推动规范开放化与互操作性测试常态化,同时产业围绕“InfiniBand vs. Ultra Ethernet”的路线辩论升温。技术方向焦点包括超高带宽、网络内计算能力的扩展,以及管理平面的自动化。

上游

InfiniBand 设备制造的上游供应链涉及多层级供应商,关键节点如下:

  • 核心交换芯片:主力供应商为英伟达(Mellanox 自研芯片)。外界关注博通、英特尔等网络芯片巨头是否推出兼容或竞争性产品。截至 2025 年初,InfiniBand 交换芯片的公开替代供应商“公开资料未见”规模量产案例。
  • 智能网卡(HCA)主控芯片:同样由英伟达主导。
  • 光模块与 AOC/DAC 组件:光模块供应商包括 Coherent(2023 年收入约 51.6 亿美元,含网络与激光业务)、Lumentum、中际旭创等,参与提供 200G/400G/800G 的 InfiniBand 端口光互联。DAC(直连铜缆)和 AOC(有源光缆)供应商则分散在多个传统连接器与光通信厂商。
  • PCB、衬底与连接器:高速背板、高密连接器、低损耗 PCB 材料(如松下 Megtron、Isola 等)是硬件制造基础元件。公开订单指向行业常规供应商。
  • 芯片代工与封装:先进制程交换芯片与网卡芯片的晶圆代工高度依赖台积电(TSM)等厂家,具体工艺节点系厂商商业机密。先进封装(如 CoWoS)在某些 InfiniBand 芯片的封装中可能采用,但公开资料未见与特定 InfiniBand 芯片型号的精确绑定披露。

下游

下游用户以拥有或运营大规模 GPU/加速器集群的机构为主:

  • 超大规模云服务商:Amazon Web Services(AWS)、Microsoft Azure、Google Cloud 以及 Oracle Cloud Infrastructure(OCI)均在其 AI 训练集群中规模化部署 InfiniBand 网络。OCI 在 2023–2024 年强调其 AI 集群使用 InfiniBand 作为集群后端网络的情况在公开会议和博客中有相应描述。
  • 科技公司与 AI 实验室:Meta(2022 年 AI 研究超级集群其网络部分使用 InfiniBand)、字节跳动、腾讯、阿里巴巴等,均被公开报道过其部分大规模训练集群采用 InfiniBand 组网。
  • 国家级超算中心与科研机构:美国橡树岭、劳伦斯利弗莫尔等国家实验室;欧盟、日本(如理化学研究所)的超算中心历史上多期使用 InfiniBand。截至 2023 年 11 月 TOP500 榜单,InfiniBand 部署数量占相当比例。
  • 金融交易与量化机构:利用 InfiniBand 的低延迟特性进行高频交易和风险建模,该市场长期但不占用量主体。

受益公司

以下所列仅为与 IBTA/InfiniBand 生态具有直接产业关联的主体。所有表述均基于公开披露的产业定位,不构成任何买卖建议或投资推荐

  • 英伟达 (NVIDIA, NVDA):将 InfiniBand 作为其端到端 AI 数据中心解决方案的关键组件。根据英伟达 2025 财年(截至 2025 年 1 月)的投资者披露,网络业务(含 InfiniBand 与 Spectrum 以太网)已成为其数据中心部门的重要收入板块,具体 InfiniBand 与以太网拆分收入未单独列出。
  • 博通 (Broadcom, AVGO):在高性能以太网交换芯片和路由领域具有显著地位,同时也是 InfiniBand 生态的间接参与者与竞争者。博通的 Jericho 和 Ramon 系列芯片、PCIe 交换机等产品与 InfiniBand 在数据中心组网的多维度形成竞争或互补关系。
  • 英特尔 (Intel, INTC):历史上推动过 Omni-Path Fabric 作为 InfiniBand 的竞争方案。目前其主要通过至强处理器平台、以太网控制器和 IPU 参与 AI 网络市场。
  • Coherent (COHR)Lumentum (LITE):提供 InfiniBand 光互联所需的激光器、收发器模块等组件。具体 InfiniBand 相关营收占比未在财务报告中单列。
  • 思科 (Cisco, CSCO):提供端到端的以太网交换及 AI 网络方案,与 InfiniBand 在部分场景形成替代竞争。2024 年思科与英伟达合作推出面向企业的 AI 基础设施方案,体现了以太网与 InfiniBand 在整体市场上的动态博弈。
  • Arista Networks (ANET):核心产品集中于云级以太网交换机,积极布局 AI 网络,代表超以太网路线的重要参与者,竞争与共存并存。

市场规模

市场数据需注明具体年份、口径与出处,不确定项明确标注,避免以估算冒充确数。

  • 第三方研究机构对 InfiniBand 市场规模的估算:市场研究机构如 650 Group、Dell‘Oro Group 在 2023–2024 年间多次指出,AI/ML 后端网络市场正经历高速扩张,其中 InfiniBand 占据较高份额。公开资料引用 650 Group 在 2023 年的分析指出,AI 后端网络市场中 InfiniBand 占据超过 80% 的份额,但此数系机构估算,精确的全球营收数据未完全公开。
  • 英伟达网络业务收入参考:英伟达 2024 财年第三季度(2023 年 10 月披露)网络收入约 30 亿美元(年化运行率超过 100 亿美元),该数据含 InfiniBand 和以太网产品,官方未拆分。考虑到 InfiniBand 彼时是 AI 后端网络的主力,行业普遍推断其贡献了主要部分,但无法精确量化。
  • 出货量端参考:Crehan Research 等机构的长期跟踪显示,InfiniBand 适配器端口和交换机端口的出货量在 2022–2024 年间加速增长,年增速超过 40% 的报告出现在多家行业媒体引用中。
  • 竞争替代趋势影响规模预期:超以太网联盟(UEC)于 2023 年成立后,Dell’Oro Group 等机构预测到 2027–2028 年,AI 后端网络市场将以太网方案份额提升,但 InfiniBand 仍将在高性能和规模集中型训练中保持关键地位。公开预测来自 Dell’Oro 在 2024 年发布的网络市场报告摘要。

玩家对比

本部分聚焦技术路线之间的竞争与对比,不给予任何主体“优于”或“推荐”的定性。

维度InfiniBand (IBTA 生态)高速以太网 (RoCEv2/UEC)专有互联 (NVLink/NVSwitch)
标准化程度行业联盟(IBTA)行业联盟(IEEE、IETF、UEC)厂商私有,非开放标准
核心拥趸及产品实现方英伟达(主导)、部分 OEM博通、思科、Arista、英特尔等英伟达(机内/机架内互联)
典型使用域跨节点的 AI 训练/推理集群后端网络通用云、多租户数据中心、部分 AI 集群同一节点内 GPU-to-GPU;引入 NVSwitch 后可扩展至单机架级
2024/2025 年主力速率NDR (400 Gb/s),逐步向 XDR (800 Gb/s) 迁移400 GbE 已规模部署,800 GbE 2024 年进入早期商用NVLink 4 约 900 GB/s 双向;NVLink 5 进一步提升(专用基座),与网络速率非同类比较
生态系统开放性高:规范公开,多家参与互操作测试极高:多厂商多年以太网沉淀低:与英伟达系统深度绑定
技术独特性原生 RDMA、无损网络、SHARP 网络内计算依赖 RoCEv2/PFC 实现无损(UEC 正在改进),生态碎片化有待整合超大规模内存访问与一致性互连,不属于标准网络协议

风险

以下风险从产业演进与市场结构角度梳理,不表示必然发生,也不用于预测股价或给出操作建议:

  1. 技术替代风险:超以太网联盟(UEC)致力于构建面向 AI/HPC 的开放以太网标准,解决 RoCEv2 的痛点,吸引云厂商和运营商加入。若 UEC 在 2025–2027 年间如期推出成熟标准并获得大规模部署,可能对 InfiniBand 的增量市场份额形成长期压力。
  2. 单一供应商依赖风险:尽管 IBTA 是开放性组织,但目前 InfiniBand 芯片与设备市场的可采购来源高度集中于英伟达。如果在供应稳定性和供应链安全层面出现变数,大型用户将加速推动多元路线。
  3. 技术路线路径依赖:将 InfiniBand 作为核心后端网络最大的采用方,其资本开支节奏与技术迭代高度绑定。一旦英伟达自身或其主要客户的优先事项变化(如转向强化以太网方案 Spectrum-X),InfiniBand 的产业权重可能被内部分流。
  4. 地缘与供应链瓶颈:InfiniBand 的先进芯片及光模块制造集中在特定代工厂和少数地区。任何重大供应链中断或出口管制政策变化都可能影响设备交付与扩容速度。
  5. 总拥有成本(TCO)与客户偏好转移:InfiniBand 网络的价格与部署复杂度在部分媒体报道中高于同等标称速率的以太网方案。随着 AI 推理负载占比上升,用户对网络的极端延迟要求可能部分降低,从而更倾向于采用兼容性更高的以太网。

误读纠偏

  1. 误读:IBTA 是一家可以在二级市场投资的公司。
    纠偏:IBTA 是非营利行业协会,不发行股票。从事 InfiniBand 产品生产和销售的实体是其成员公司。

  2. 误读:InfiniBand 仅用于 AI 训练。
    纠偏:InfiniBand 在 AI 之外的 HPC 领域(气候模拟、计算化学、流体力学等)已有十余年大规模应用。目前 AI 训练是其最高增速的应用,而非唯一的应用。

  3. 误读:InfiniBand 和以太网是完全隔绝的不同世界。
    纠偏:二者长期并行演进,部分概念也在相互借鉴。用户侧存在采用 InfiniBand 作为计算网络、以太网作为存储/管理网络的分层混合组网实践。IBTA 近年加强与其他标准组织的技术讨论,产业边界并非绝对割裂。

  4. 误读:带宽速率是衡量 InfiniBand 好坏的唯一指标。
    纠偏:实际应用中的端到端延迟、消息速率(Message Rate)以及集合通信效率(例如 AllReduce 完成时间)同样关键。高带宽不解决延迟陷阱和拥塞控制缺陷时,对训练效率的实际增益可能大打折扣。

最新事件

截至 2024–2025 年,行业动态从多维度影响 IBTA 生态:

  • 英伟达 Blackwell 平台发布(2024 年 GTC):新一代 GPU 平台支持 XDR(800 Gb/s)InfiniBand 网络。配套的 Quantum-X800 交换机和 ConnectX-8 网卡公布技术参数,但 2024 年末至 2025 年的具体出货时间和规模仍待后续财报验证。
  • Spectrum-X 以太网平台的并行推进:英伟达于 2023–2024 年间大力推广 Spectrum-X 以太网方案,声称其专为 AI 优化。这引致投资者与产业分析师对英伟达内部网络路线的平衡展开广泛讨论。
  • 超以太网联盟(UEC)成员扩大:2024 年,UEC 成员数量显著增长,涵盖主要云商、芯片厂商和系统商。相关草案规范面向 AI/HPC 网络,目标 2025 年前后完成若干核心规范。
  • IBTA 技术活动:IBTA 在 2024 年举办了多次 Plugfest 和成员技术会议。其官方博客和路线图进一步提及聚焦下一代互联架构与光电共封装(CPO)等方向的前期探索。

跟踪指标

  1. 英伟达季度网络业务营收:从英伟达财报中追踪其网络业务(含 InfiniBand 和以太网)的同比和环比增速,与超大规模数据中心客户的资本开支趋势对比。
  2. IBTA 成员名录与主导权变化:观察是否有新的大型云商、芯片商加入 IBTA 或在标准制定过程担任编辑者席位,以判断生态的长期开放性。
  3. TOP500 和 Green500 榜单系统网络分布:每年与每半年考察 InfiniBand 在顶级超算和能效领先系统中的份额变化。
  4. UEC 规范发布进度与产品互操作演示:关注 UEC 的量产时间表和早期部署案例,以此评估 InfiniBand 面临的竞争节奏。
  5. InfiniBand 技术路线图更新:IBTA 每年公布或成员公司透露的速率、管理特性、前向纠错等升级细节。特别关注 XDR 后下一代的速率目标。
  6. 光模块及高速 SerDes 产业链数据:供应链的交付量和产能扩张信号(来自 Coherent、中际旭创等公司财报和指引)可以作为 InfiniBand 设备出货的前瞻参考。
  7. 大规模训练集群的公开案例:云厂商和前沿 AI 实验室在技术博客中披露的集群规模、通信结构和训练效率数据,反应 InfiniBand 在最大规模场景中的实际采用情况。

信源

  1. 官方机构与标准组织:IBTA 官方网站(www.infinibandta.org)发布的规范、技术白皮书与新闻公告。
  2. 上市公司公开披露:英伟达、博通、Coherent 等相关企业的季度和年度财报(10-K、10-Q)、业绩电话会议记录以及投资者相关演示材料。
  3. 第三方行业分析机构:650 Group、Dell’Oro Group、Crehan Research 和 LightCounting 的定期市场追踪报告(重点关注其摘要与公开引用,避免未经允许的内部分析)。
  4. 技术媒体与社群分析:The Next Platform、ServeTheHome、AnandTech 等对 InfiniBand 及 AI 网络议题的深度技术报道。
  5. 学术与产业会议:SC(国际超算大会)、SIGCOMM、OSDI 等会议中发表的网络架构论文与演示,可用于理解 InfiniBand 在尖端系统中的实际表现和优化实践。
  6. 超大规模用户的技术博客:Meta Engineering、Azure CTO 博客、Google Cloud Blog、字节跳动技术博客等,在公开时点提及网络选型与设计原则。

注:本文所有涉及市场规模、份额及预测的数字均已尽力标注年份、数据口径与来源。对于无法找到确切公开数据或官方披露的部分,已注明“公开资料未见”。本文不构成对任何产品或公司的推荐、评级或投资建议,最新信息以原始信源的实时更新为准。

source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型