网络层 开放阅读

Frontend Network

Frontend Network

概念 ID
frontend-network
更新时间
2026-05-29
来源数量
待补

Frontend Network(前端网络)

3 秒看懂

前端网络 = AI 数据中心里”管日常业务”的那张网——负责存储读写、用户访问、集群管理等通用流量;与之对应的 Backend Network(后端网络) 才是 GPU 集群之间高速训练/推理通信的专用通道。二者物理或逻辑分离,是现代 AI DC 架构的基本范式。

3 分钟产业解释

为什么一张网变成了两张网?

在传统数据中心里,所有流量跑在同一张以太网上就够了——Web 请求、数据库查询、虚拟机迁移、存储读写,都是相似量级的流量。

当 GPU 集群规模从几十卡膨胀到 万卡乃至十万卡 级别,AI 训练的通信需求产生了质变:

维度Frontend Network(前端)Backend Network(后端)
服务对象存储、管理、用户入口、监控GPU ↔ GPU、GPU ↔ 存储(训练侧)
流量模式南北向 + 通用东西向大规模集合通信(AllReduce / All-to-All / P2P)
核心协议TCP/IP、HTTP、NFS、iSCSIRDMA(RoCEv2 / InfiniBand)、NVLink
延迟敏感度中等极高(尾延迟直接影响训练吞吐)
带宽诉求每端口 25G–100G 量级每端口 400G–800G+,且要求高对分带宽
拓扑传统 Leaf-SpineRail-optimized、Fat-tree、多轨拓扑

结论:前端网络是 AI 数据中心的”基本盘”,但不是增量价值的核心。 真正改变产业链格局的是后端网络。

15 分钟专家深入

一、前端网络的架构定位

在典型 AI DC 的 Clos/Fat-tree 架构中,前端网络承担以下职责:

┌───────────────────────────────────────────────────────┐
│                   AI Data Center                       │
│                                                       │
│  ┌──────────────┐          ┌──────────────┐           │
│  │ Frontend Net │          │ Backend Net  │           │
│  │  (通用以太网) │          │ (IB/RoCE/    │           │
│  │              │          │  NVLink域)   │           │
│  │ · 存储(NAS/  │          │ · GPU↔GPU    │           │
│  │   对象存储)  │          │ · AllReduce  │           │
│  │ · K8s管控面  │          │ · All-to-All │           │
│  │ · 用户API入口│          │ · 训练checkpoint│         │
│  │ · 监控/日志  │          │   写入(存储侧)│           │
│  │ · 模型服务   │          │              │           │
│  │   (推理入口) │          │              │           │
│  └──────────────┘          └──────────────┘           │
│       ↑                          ↑                    │
│   传统以太网交换机            专用高速交换机             │
│   (Broadcom/Marvell         (NVIDIA Quantum /         │
│    通用ASIC)                 Spectrum-X /              │
│                              Arista 7800系列等)        │
└───────────────────────────────────────────────────────┘

前端网络在 AI DC 中不可替代,但其技术栈与传统 DC 基本同源。

二、前端网络的关键技术组件

组件说明
Leaf-Spine 拓扑标准二层 Clos 结构;Leaf 接入服务器,Spine 负责东西向转发
VXLAN / EVPN大二层叠加网络,支持多租户隔离与虚拟机热迁移
RDMA-less 以太网前端网络一般不要求 RDMA,以标准 TCP/IP 协议栈为主
负载均衡L4/L7 LB 用于推理服务入口(如 Kubernetes Ingress / Service Mesh)
存储网络NFS/SMB/对象存储访问;部分场景使用 NVMe-oF(但高性能训练 I/O 更多走后端)
带外管理IPMI/BMC 管理网络,独立于数据面

三、前端网络与后端网络的物理隔离 vs. 逻辑隔离

  • 物理隔离(主流):前端、后端使用独立交换机、独立线缆、独立端口。AI 训练服务器通常有两套网卡——一套接前端(标准 NIC),一套接后端(ConnectX-7/8 等 SmartNIC 或 HCA)。
  • 逻辑隔离(少数):同一物理 Fabric 通过 VLAN/VRF 分隔,但因 QoS 难度大、性能隔离不够可靠,在大规模训练中较少采用。

四、前端网络在 AI 工作流中的具体角色

  1. 训练前:数据集下载、预处理、缓存写入
  2. 训练中:日志采集、指标上报、K8s 调度;checkpoint 写入分布式存储(部分厂商将 checkpoint 存储流量导向后端网络以利用更高带宽)
  3. 推理阶段:用户请求入口、模型服务编排(Service Mesh)、结果返回
  4. 运维:GPU 健康监测、固件更新、故障隔离

技术原理(最深)

前端网络数据平面

前端网络通常基于 商用交换 ASIC(非 AI 专用),数据包处理流程:

[Server NIC] --ethernet frame--> [Leaf Switch ASIC]
                                      │
                          ┌───────────┼───────────┐
                          ▼           ▼           ▼
                    L2 Lookup    L3 Lookup    ACL/QoS
                    (MAC表)     (路由表/FIB)  (流分类)
                          │           │           │
                          └───────────┼───────────┘
                                      ▼
                              VXLAN Encap/Decap (如需)
                                      ▼
                              [Spine Switch]──> 目标Leaf

关键参数(定性描述,具体数字因平台而异):

  • 每端口带宽:当前主流 25G/100G;新建 AI DC 的前端逐步向 100G/400G 升级
  • 交换容量:单芯片数 Tbps 量级(具体取决于 ASIC 型号)
  • 转发延迟:微秒级(sub-µs ~ 数 µs),远高于后端 IB 网络的诉求但仍满足通用业务
  • 缓冲深度:标准商用芯片缓冲(数十 MB 量级),不追求 IB 级深度缓冲

前端网络控制平面

  • 路由协议:eBGP(现代 DC 标准做法)或 OSPF
  • overlay 控制:EVPN 作为 VXLAN 的控制平面,分发 MAC/IP 路由
  • 自动化:Ansible/Terraform + 网络遥测(gNMI/gRPC Streaming Telemetry)
  • 可观测性:sFlow / IPFIX 采样、Prometheus + Grafana 监控面板

与后端网络的关键差异(技术层面)

技术维度FrontendBackend
RDMA 支持通常不要求必须(RoCEv2 或 IB Verbs)
无损/有损有损即可(TCP 重传)需 PFC/ECN 实现无损或近无损
拥塞控制标准 TCP CCDCQCN / Swift / EQDS 等专用算法
拓扑优化通用 Leaf-SpineRail-optimized(减少跳数)
端口速率25G–100G 主流400G–800G,正向 1.6T 演进
交换 ASIC通用商用芯片部分定制或高端 ASIC(如 Spectrum-4, Memory-free 架构)

技术演进史

时期前端网络特征驱动力
2010s 前期三层架构(Access-Agg-Core),10G 为主云计算兴起
2015–2018Leaf-Spine 成为标配,25G 接入,100G 上行超大规模 DC 扩张
2018–2021VXLAN/EVPN 普及,网络自动化成熟容器化、微服务
2022–今前端网络本身技术变革放缓;核心创新转向后端网络AI 大模型训练的爆发
2024–未来前端逐步升级 100G/400G 接入;推理流量增长可能带动前端带宽需求推理规模化、AI Agent

核心趋势:前端网络的技术演进 远慢于 后端网络。后端网络正在经历从 400G→800G→1.6T 的快速代际跃迁,而前端网络更多是存量升级。


技术路线对比(量化表)

⚠️ 以下带宽数字为行业通用规格,不对应特定厂商产品型号,来源为行业公开标准(IEEE 802.3、InfiniBand Trade Association 路线图)。

方案前端接入带宽前端上行带宽后端互联带宽适用场景
传统 DC10G–25G40G–100GN/A(无独立后端)通用计算
小规模 AI DC25G–100G100G–400G400G IB/RoCE百卡训练
大规模 AI DC(当前主流)100G400G400G–800G IB千卡~万卡训练
下一代 AI DC100G–400G400G–800G800G–1.6T IB万卡+训练

上下游

上游(前端网络的供应链)

环节代表厂商/技术备注
交换 ASICBroadcom(Trident 系列)、Marvell(Teralynx 系列)通用 DC 交换芯片
光模块中际旭创、光迅科技、Coherent、Lumentum100G/400G 光模块
连接器/线缆Amphenol、MolexDAC/AOC/光纤跳线
网卡(标准NIC)Intel、Broadcom非 SmartNIC 的标准以太网卡

下游(前端网络的使用者)

使用场景说明
存储流量训练数据读取、checkpoint 落盘
推理服务模型服务 API 入口(Ingress)
管理编排K8s、Slurm 控制面通信
监控运维Prometheus、ELK、GPU DCGM 遥测

关键指标

指标说明典型量级
接入端口速率服务器到 Leaf 的带宽25G / 100G
上行端口速率Leaf 到 Spine100G / 400G
对分带宽网络两半之间的总带宽取决于 Spine 数量与端口密度
尾延迟(P99)99 分位转发延迟数 µs 级(远大于后端 IB)
丢包率有损网络可接受的丢包范围< 10⁻⁶ 级(TCP 可恢复)
端口密度单交换机可接入服务器数48 端口 Leaf 为典型
超售比下行/上行带宽比通常 3:1 ~ 7:1

供需与市场数据

⚠️ 搜索失败,无最新数据源。以下为定性趋势描述,非精确数字。

需求侧

  • 前端网络需求增长远慢于后端网络:AI DC 的增量资本开支主要流向 GPU、后端互联(IB/RoCE 交换机、高速光模块)和液冷系统,前端网络多为存量升级。
  • 推理规模化可能改变格局:当推理流量(用户请求 → 模型服务 → 返回结果)大规模增长时,前端网络的带宽需求将显著上升。
  • 存储带宽是前端网络的重要驱动力:大规模训练的 checkpoint 读写、数据集 ETL 流量持续增长。

供给侧

  • 前端网络交换机市场相对成熟,竞争格局稳定(Broadcom 芯片 + 白盒/OEM 交换机为主)。
  • 与后端网络(NVIDIA InfiniBand、Arista 高端系列)的高增长相比,前端网络厂商的增速相对温和。

代表公司与资本映射

公司角色前端网络关联
Arista Networks (ANET)网络设备商EOS 平台广泛用于 AI DC 前端;亦切入后端(7800 系列支持 RoCE)
NVIDIA (NVDA)全栈ConnectX NIC 同时服务前后端;Spectrum 系列用于前端/通用 DC
Broadcom (AVGO)交换芯片Trident 系列 ASIC 是前端交换机的核心供应商
Marvell (MRVL)交换芯片Teralynx 系列竞争前端市场
中际旭创 (300308)光模块100G/400G/800G 光模块,前端后端均使用
Celestica (CLS)白盒交换机为超大规模 DC 提供前端网络交换机

投资视角:前端网络的增量弹性 弱于 后端网络。后端网络受益于 AI 训练直接扩张,前端更多是”跟涨”逻辑。


投资逻辑

核心观点

  1. 前端网络是 AI DC 的”必要但不充分”基础设施——没有它不行,但它不是 AI DC 资本开支的主要流向。
  2. 后端网络才是 AI 网络投资的主战场:InfiniBand 400G→800G→1.6T 代际升级、rail-optimized 拓扑创新、无损网络技术,驱动更高的 ASP 和毛利率。
  3. 前端网络的增量看点在推理侧:当 AI 推理从”小批量”走向”大规模在线服务”,用户请求流量将推动前端网络带宽升级,但时间点和节奏取决于 AI 应用落地进度。
  4. 存储网络融合是潜在变量:部分厂商正在探索将高性能存储流量从前端迁移到后端网络(利用 RDMA),这可能改变前端网络的流量结构。

风险提示

  • 若推理规模化不及预期,前端网络需求增长将维持低速。
  • 白盒交换机趋势持续压缩设备商利润空间。

常见误读纠偏

误读 1:“前端网络 = 不重要的网络”

纠偏:前端网络承载存储、管理、推理入口等关键流量。一个设计不佳的前端网络会导致 checkpoint 写入瓶颈、推理服务延迟飙升。它不”性感”,但不可或缺。

误读 2:“前端网络和后端网络用的是同一种交换机”

纠偏:虽然物理上都是交换机,但技术要求差异巨大。后端网络需要支持 RDMA、无损传输(PFC/ECN)、极低延迟和高对分带宽;前端网络对这些指标的要求低得多。把前端交换机当后端用,会严重拖累训练效率。 实际部署中,绝大多数大规模 AI DC 前后端物理分离。

误读 3:“InfiniBand 只用于后端,前端只用以太网”

纠偏:在绝大多数场景下这基本正确。但需注意:① 少数 HPC 场景中 IB 也用于前端存储访问;② 后端网络也可以使用 RoCEv2(基于以太网的 RDMA) 而非 IB。技术路线的选择取决于具体厂商方案(如 NVIDIA 倾向 IB,部分超大规模用户倾向 RoCEv2 + 高速以太网)。


学习路径

Level 1  基础概念
  ├── 理解 Leaf-Spine 拓扑
  ├── 了解 TCP/IP 协议栈 vs. RDMA
  └── 分清"前端"与"后端"的流量类型

Level 2  架构理解
  ├── 学习 VXLAN / EVPN 原理
  ├── 了解 AI 训练的通信模式(AllReduce / All-to-All / P2P)
  └── 理解为什么 AI DC 需要独立后端网络

Level 3  深入技术
  ├── DCQCN / PFC 无损以太网机制
  ├── Rail-optimized 拓扑设计
  ├── Spectrum-X / Quantum 系列产品技术细节
  └── 存储网络架构(并行文件系统、对象存储)

Level 4  前沿跟踪
  ├── 800G / 1.6T 光模块与交换 ASIC 路线图
  ├── CPO(Co-Packaged Optics)对网络架构的影响
  ├── 前后端网络融合/分离趋势
  └── Ultra Ethernet Consortium (UEC) 标准进展

一句话总结

前端网络是 AI 数据中心的”毛细血管”——负责通用业务流量的接入与转发,技术成熟、增量有限;真正决定 AI 算力上限的”大动脉”是后端网络,但前端的存储、推理入口能力直接影响整体系统效率。


延伸阅读与来源

来源内容备注
Arista Networks 技术白皮书AI DC 网络架构(前后端分离设计)arista.com
NVIDIA Networking 文档InfiniBand vs. Ethernet for AInetworking.nvidia.com
Ultra Ethernet Consortium (UEC)下一代以太网 AI 互联标准ultraethernet.org
IEEE 802.3以太网速率演进标准standards.ieee.org
Broadcom / Marvell 产品页交换 ASIC 规格以厂商最新发布为准
[行业报告]AI DC 网络市场规模需查阅最新 Gartner/IDC/LightCounting 报告
[供应链估算]前端 vs. 后端 CapEx 占比超大规模厂商未充分披露,需跟踪财报电话会

⚠️ 本文中未标注具体数字的部分,均因搜索未返回有效证据而采取定性描述,建议读者以最新厂商文档和行业报告为准。

source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型