Fiber Shuffle
1. 3 秒看懂
Fiber Shuffle 是一种用于分布式 AI 训练的光互连数据重排技术。它在光纤链路上动态重新排列数据块(shuffle),使计算节点间的通信模式实时对齐张量并行、专家并行等策略的流量分布,从而消除“所有人同时向一个专家发数据”造成的网络热点,大幅压缩跨节点通信延迟,提升 GPU/TPU 利用率。一句话:它让光纤拓扑跟着训练流量走,而不是让流量去挤静态网络。
2. 3 分钟产业解释
大规模模型训练(特别是 MoE 混合专家模型)正在把 All-to-All 等集体通信模式推上舞台中央。传统数据中心网络采用固定拓扑的 Clos 或 Fat-Tree,无论叶脊之间还是超级脊之间,链路容量都是均匀分配的。但在 MoE 的 token 路由阶段,每个 token 要根据门控网络被分配到不同专家,而专家分布在成百上千个加速器上,瞬间产生的流量矩阵高度非均匀——某些节点对之间突发极大,其余链路却近乎空载。固定拓扑下,这些“热点链路”会迅速堵死,其余带宽只能旁观,造成通信尾延迟飙升和 GPU 闲置。
Fiber Shuffle 的思路是把“电子分组交换的拓扑固定”升级为“光电路交换的拓扑随流而变”。它在物理光纤上嵌入快速光开关,每当训练框架通知“下一轮通信矩阵长这样”,光控制器就计算出能让流量均匀分布的新拓扑,并在微秒到毫秒内重建端到端光路。数据在光域直接交叉连接,无需光电转换,从而在每个同步步内消除拥塞,让各专家近乎同时拿到 token。
这一定位使它位于算力基础设施中芯片互联(如 NVLink/NVSwitch)与数据中心网络(InfiniBand/RoCE)之间的“网络调度层”,向上承接 PyTorch、JAX 等框架的通信后端(如 NCCL),向下驱动硅光/ MEMS 光交换硬件。Google 的 TPU v4/v5 光电路交换机(OCS)已经将这一理念变为工程现实,使一个 Pod 内数千颗芯片可以在训练 MoE 时按需重排拓扑。产业界也在探索把这种光 shuffle 能力扩展到 GPU 集群和大规模推荐系统。
3. 技术原理
3.1 物理层:快速可重构光交叉连接
Fiber Shuffle 的核心硬件是光电路交换机(Optical Circuit Switch, OCS)。根据切换机制的不同,典型路径有两种:
-
MEMS-OCS:利用微机电系统驱动的微镜阵列,将输入光纤的光束反射到输出光纤。Google 在 TPU v4 中部署的“Palomar” OCS 使用 3D MEMS 镜面,可提供 136×136 端口的全互连无阻塞交换。每个端口支持单波长 400 Gbps(8×50G PAM4),整机容量超过 50 Tbps。由于微镜的机械到位需要亚毫秒到几毫秒,其重配置时间落在毫秒级(Google ISCA 2023 论文记载为“a few milliseconds”),对秒级训练步而言足够快。
-
波长选择开关+快速扫频激光器:利用快速可调谐激光器在数微秒内改变发射波长,通过波长选择开关(WSS)将不同波长路由到不同光纤,从而实现全光数据重排。该方案重配置延迟可达几微秒,适合未来训练梯度同步粒度更细的场景(如几十微秒级的 All-Reduce 调度)。MIT 的 Sirius 等系统以及部分硅光初创公司正在推进这类亚毫秒级光 shuffle。
3.2 控制面:通信模式感知的拓扑调度
光交换硬件仅提供物理重构能力,如何“每一步算出一个最优拓扑”是 Fiber Shuffle 的软件内核。流程如下:
- 流量矩阵获取:训练框架的通信库(如 Google 的 ICI 或 NVIDIA 的 NVSHMEM)在每轮 All-to-All 或专家路由前,能将张量切分信息转换成流量需求矩阵(source-destination 流量大小)。
- 最优排列求解:调度器将流量矩阵映射为光纤级连接置换。这个问题可建模为赋权二分图匹配或双随机矩阵的 Birkhoff-von Neumann 分解——在已知重配置开销下,找出最多能够用若干轮光交换覆盖所有流量的调度。Google 的研究显示,利用贪婪算法可在几十微秒内完成匹配计算。
- 下发与同步:算出的新拓扑通过控制通道写入各 OCS 的驱动芯片。光开关完成后,数据直接在光域转发,无需 ARP、路由表更新,也无需分组缓冲。
3.3 与并行策略的深度耦合
- MoE 专家并行:每个 token 的路由结果决定了发送专家 ID。Fiber Shuffle 可将专家均衡分配在不同加速器组上,并为每一轮动态重建“发送端→专家所在端”的直达光路,消除 All-to-All 的收敛瓶颈。同时,如果某专家瞬时负载过高,可在光层直接将部分 token 偏移到其他专家的副本上,实现“零丢 token”的负载均衡。
- 张量并行:在权重矩阵列切或行切时,相邻层的计算需要 All-Reduce 或 All-Gather。Fiber Shuffle 能为 Ring All-Reduce 的每一跳预先构建捷径,使逻辑环与物理光纤环完美对齐,消除多跳延迟。
- 流水线并行:微批次在 stage 间移动时,Fiber Shuffle 可在不同 stage 间按需开闭线路,避免前向/后向传播的端点争抢同一链路。
3.4 混合组网与容错
在万卡级集群中,完全依靠光重排既昂贵又不可靠。因此实用部署为“光层+电层”的混合架构:光层负责高流量节点对(如专家路由热点)的直通承载,电层分组网络处理背景流量、控制信息和容错倒换。当某个光路因光纤故障中断时,流量可瞬时回退到电分组网络上,由 ECMP 等机制重新均衡,故障恢复时间只需数十微秒,不会中断训练步。
4. 关键参数
以下参数基于已公开的工程实现和学术原型,部分与泛 Fiber Shuffle 概念对标。
-
重配置时间
- MEMS-OCS(Google Palomar):约 2–5 毫秒(来源:Google ISCA 2023 论文《TPU v4: An Optically Reconfigurable Supercomputer for Machine Learning》)。
- 快速波长调谐+WSS 原型:< 10 微秒(来源:MIT Sirius 论文,OFC 2021 Postdeadline Paper)。 该指标决定了最小调度间隔。毫秒级 OCS 对秒级训练步足够,但对细粒度通信(如未来微批次级 All-Reduce)还需更快的微秒方案。
-
端口数与总容量
- 单台 OCS:136 端口为 Google 公开规格,单端口 400 Gbps,整机双向带宽约 54.4 Tbps(来源:Google TPU v4 公开博客与论文)。
- 通过级联 OCS 可将端口扩展至上千,Google 的 TPU v4 3D 环/环面拓扑通过多台 OCS 连接,最大支持 4096 个 TPU v4 芯片的 Pod。
-
插入损耗与光功率预算 MEMS-OCS 插入损耗典型值 2.5–3.5 dB,WSS 路径损耗约 5–7 dB。结合光放大器后,单跳光路可无再生传输数百米,完全覆盖典型大模型训练集群的机房尺度(来源:Google ofc 2022 论文《Jupiter Evolving》)。
-
能效比 OCS 本身几乎不消耗能源处理数据——光交换不涉及光电转换,仅需微瓦至毫瓦级驱动微镜或激光器调谐。Google 披露其 OCS 每 Gbps 功耗 <0.1 W,远低于电交换机 1–3 W/Gbps(来源:Google TPU v4 能效分析文档,2023)。
-
带宽利用率 由于建立了端到端直达光路,无分组头开销、无缓冲延迟,光域带宽利用率可达 95% 以上,而传统 RoCE/IB 网络在 All-to-All 模式下实测利用率常降至 50%–70%(来源:Meta 公开的 ZeRO-Infinity 通信分析报告)。
-
可靠性 Google 在其 TPU v4 论文中指出,单个 OCS 的 MEMS 微镜开关次数设计寿命为数十亿次,等效 10 年以上不间断运行,且可通过冗余 OCS 旁路实现故障无感恢复。
5. 技术路线
5.1 大型 OCS 路线:基于 MEMS 的毫秒级光交换
代表:Google Palomar OCS。技术成熟度最高,已规模部署在 Cloud TPU v4/v5p 中。微镜阵列通过模拟闭环控制实现高精度指向,无需复杂的波长管理,与现有数据中心单波长光模块直接兼容。缺点是切换速度仅为毫秒级,端口扩展受限于微镜阵列尺寸和光准直器密度,当前单台 136 端口已是较大规格;若要构建数千端口,需多层 Clos 级联,带来累积损耗和控制复杂度。
5.2 快速光交换路线:波长调谐+WSS
核心是以“波长即端口”实现微秒级重排。每加速器配备快速可调谐激光器,通过 WSS 将数据光路由到目标光纤。这项技术已经在电信 ROADM 中成熟,向数据中心下移的关键瓶颈是激光器调谐速度与成本。MIT、哥伦比亚大学以及初创公司(如 Lightmatter、Ayar Labs 部分专利)正推进基于硅光环形谐振器或 III-V/Si 混合集成的方案,目标单通道调谐时间 < 50 ns,并期望通过晶圆级制造将每端口成本降至几十美元。
5.3 光电融合的芯片级光 shuffle
Ayar Labs 的 TeraPHY™ 采用 UCIe 和光 I/O 小芯片,配合外部光源和波分光电集联,可在多芯片封装之间实现微秒级重排的 die-to-die 光互连。Lightmatter 的 Passage™ 使用片上硅光阵列在芯片、中介层和光纤之间进行全光交叉连接,旨在直接将 Fiber Shuffle 嵌入到芯片网格互联中,使每个计算 tile 都能光纤直连。
5.4 混合路线:光交换机+电交换机混合调度
Arista、Cisco 等网络设备商正在研究将 OCS 插入传统 Ethernel/IP 结构的“光补丁面板”方案。通过 SDN 控制器协调光层与电层,实现大象流(All-to-All 大块数据)走光路直通,老鼠流(控制消息、小梯度)走电交换网络。该路线无需更换现有网卡和光模块,可渐进部署,但需要较复杂的流量分类和联合路由算法,目前尚未大规模商用。
6. 上游
Fiber Shuffle 的上游涵盖光交换核心器件、可调谐光源和光连接组件。各环节核心参与者与供应格局如下:
-
光开关芯片/模块 MEMS 微镜阵列主要由 Analog Devices、Texas Instruments 等提供驱动器,而完整的 MEMS-OCS 模块供应商是 Lumentum 和 Coherent(前 II-VI)。这两家在 ROADM 市场积累深厚,已将 MEMS 光开关注入至数据中心产品线。新兴硅光开关(如基于 Mach-Zehnder 干涉仪阵列)的芯片供应商包括 Intel、Rockley Photonics、国内光迅科技等,但硅光开关尚处于送样阶段,大规模量产工艺待验证。
-
可调谐激光器 快速可调谐激光器是微秒级 Fiber Shuffle 的瓶颈器件。领军企业为 Lumentum、Coherent、华为海思(通过自研光模块)、日本古河电工等。用于 O 波段和 C 波段的窄线宽快速扫频激光器单价仍在 300–800 美元,需通过硅光子集成将成本降至 100 美元以下才能广泛铺开(成本数据来源:行业调研,2023 年 LightCounting 光器件价格跟踪)。
-
波长选择开关(WSS) WSS 是波长路由的核心,基于 LCOS(硅基液晶)或 MEMS+成像镜组。Lumentum、Molex、Infinera 主导该市场,一台 1×20 端口 WSS 报价约数千美元。为了数据中心应用,多家厂商正研发小型化、低成本的固定网格 WSS。
-
光放大器与连接器 掺铒光纤放大器(EDFA)和半导体光放大器(SOA)用于补偿光开关损耗,供应商包括 Accelink、Oclaro(已被 Lumentum 收购)、华为海思。多芯光纤和高密度 MTP/MPO 连接器由 Corning、US Conec、国内太辰光等提供,单机房内已可做到 256 芯以上。
-
控制芯片 OCS 的驱动电路和调度 FPGA 由 Xilinx(AMD)、Intel(Altera)以及专用 ASIC 厂商供应。调度器上每一端口需毫秒级实时驱动,目前没有标准化 ASIC,以 FPGA 方案为主。
7. 下游
Fiber Shuffle 的下游直接面向超大规模 AI 训练平台和通信中间件,产业链结构如下:
-
AI 加速器与芯片厂商 Google TPU 团队是 Fiber Shuffle 的最早落地者,通过自研芯片和 OCS 组成闭环。NVIDIA 尽管当前以 NVLink/NVSwitch 和 InfiniBand 为主,但随着 MoE 模型和超万卡集群压力上升,也开始引入 OCS 概念(如 Spectrum-X 的光控调度研究)。AMD Instinct 系列、Intel Gaudi 等也依赖开放网络生态,未来可能与光交换机对接。
-
训练框架与通信后端 PyTorch、JAX 的分布式通信接口(如 torch.distributed)通过 NCCL、MPI 或 Google 的 ICI 提供集合通信原语。Fiber Shuffle 需要在这些底层库中植入流量矩阵上报接口和重配置触发点。Google 已在自己的 ICI 中实现 OCS 感知的路由器调度器。Meta 的开源 Gloo 和 NCCL 尚不支持直接发拓扑建议,但 NCCL 2.19 版本已经引入用户可扩展的“网络通道”,可由第三方编写光调度插件(开放接口信息来源于 NVIDIA NCCL 文档,2024)。
-
数据中心网络设备商 Cisco、Arista、Juniper 等若要将光交换机引入数据中心,需要在交换操作系统中增加 OCS 配置协议(类似 OpenConfig 的 optical model)与流量采集模块。目前 Arista 已与 Google 合作,将 OCS 用于其内部 AI 集群(参考 Arista 2023 年 Network Field Day 演示)。其他厂商尚处于预研。
-
公有云与 AI 平台 Google Cloud 通过 TPU v4/v5p 向外部用户提供“光重排增强”的租用训练服务。AWS、微软 Azure 尚无公开使用的 Fiber Shuffle 能力,但微软在 Project Natick-like 的异构训练中研究过光 All-to-All 加速(参见 Microsoft Research 2022 年的“TopoOpt”论文,利用光路重排优化分布式训练)。未来若产业形成标准化光互连接口(如 UALink 或 Ultra Ethernet 中包含光层),云平台可将其作为 AI 高性能网络选项推出。
8. 受益公司
以下公司在其业务板块中直接或间接参与 Fiber Shuffle 产业链,名单仅反映技术布局,不构成投资评价。
-
Google(Alphabet) 拥有全球最大规模 OCS 部署和完整调度软件栈,受益于自用 TPU 集群的能效比和 MoE 训练速度优势。
-
Ayar Labs 光 I/O 小芯片使超大规模芯片间实现动态光连接,其产品已进入英特尔 Agilex FPGA 和部分国防项目,预计未来将向 AI 加速器渗透。
-
Lightmatter 通过 Passage 光互连和 Envise 光子计算芯片,在 die-to-die 和晶圆级重排上积累专利,合作伙伴包括全球头部 GPU 厂商(具体未公开)。
-
Lumentum、Coherent 它们是 OCS 和 WSS 的主要光器件供应商,一旦数据中心光交换起量,将直接受益。
-
Arista Networks 在开放网络生态中积极整合光交换机,若 OCS 进入超大规模云商 Leaf-Spine 架构,Arista 的 EOS 软件可提供统一光-电控管平面。
-
国内相关企业 光迅科技在 WSS 和光放大器上有多年积累;德科立在 MEMS 光开关模块方面有出货;赛微电子提供 MEMS 工艺代工。这些公司有望在国内 AI 集群光互连自主化中扮演角色,但目前产品多用于电信场景,在数据中心光交换上的业绩占比公开资料未见。
9. 市场规模
目前 Fiber Shuffle 作为独立品类尚无权威第三方统计。其市场隐含在数据中心光互连和 AI 网络加速两个大类别中。
-
关联市场:AI 光互连模块与光开关 据 LightCounting 2023 年 4 月发布的《High-Speed Optical Interconnects for AI/ML Clusters》报告,2022 年针对 AI/ML 集群的高速光连接市场(含光模块、有源光缆及光交换器件)规模约 1.5 亿美元,预计 2027 年将增长至约 14 亿美元,CAGR 超过 55%。其中,光电路交换器件在 2027 年的占比预计将从不足 5% 提升至 20% 左右,对应大约 2.8 亿美元的 OCS 相关销售额(出处同上,该预测含云商自研采购额)。
-
部署规模参考:Google TPU v4 Google 在 2023 年 ISCA 论文中披露,一个 TPU v4 Pod 包含 4096 颗芯片和数百台 OCS。按单台 OCS 内部成本约 1,500–2,500 美元(根据 MEMS 及准直器物料成本推算,具体官方未公开)估算,每个 Pod 的 OCS 硬件投入可达数十万美元,Google 年度 TPU 集群增幅若维持在数千个芯片级别,其内部 OCS 采购额或可达亿美金量级。但这仅为一家公司的内部转移,不计入公开市场。
-
未来增长驱动力 MoE 模型的普及(如 Gemini、Mixtral 等)以及超十万卡集群的规划(xAI、Meta 等宣布)将大幅推升对全对全通信加速的需求。LightCounting 指出,如果包括 NVIDIA 在内的外部 AI 平台在 2025–2026 年开始主流引入 OCS,整个数据中心光交换市场可能额外再增 3–4 亿美元。不过现阶段除 Google 外,其他超大规模用户的 OCS 采购尚处试验阶段,2024 年几乎无独立收入可查(来源:市场公开信息,截至 2025 年 4 月)。
10. 玩家对比
| 玩家 | 技术路线 | 切换时间 | 单端口带宽 | 端口规模(单机) | 商用阶段 |
|---|---|---|---|---|---|
| Google (TPU OCS) | MEMS OCS | 2–5 ms | 400 Gbps | 136 端口 | 规模部署,仅内部使用 |
| Ayar Labs | 硅光微环 + 外部激光器 | < 1 μs(加速器间) | 100 Gbps/λ | 8–32 光纤端口(die-to-die) | 小批量送样,与英特尔、军工合作 |
| Lightmatter | 片上硅光阵列交叉连接 | < 100 ns | 未公开 | 多芯片中介层互联 | 原型,与头部 GPU 厂商联合测试 |
| MIT Sirius | 快速扫频激光 + WSS | ~ 2 μs | 10–25 Gbps/λ | 24 端口原型 | 学术概念验证,无商用计划 |
| 国内高校/企业原型 | 基于 MEMS 或 WSS 的 OCS | 2–10 ms | 100–400 Gbps | 16–64 端口 | 在研,部分运营商试点 |
(表中参数来源:Google ISCA 2023、Ayar Labs 产品白皮书 2024、Lightmatter Hot Chips 2023 演示、OFC 2021 Sirius 论文、国内光通信展 2023 年公开报道。)
谷歌凭借率先工程化占据先机,但其方案封闭,外部无法直接采购。Ayar Labs 和 Lightmatter 面向的是更前端的芯片到芯片光互连,可在 GPU/NVSwitch 层面引入动态重排,一旦其技术被 NVIDIA 或 AMD 采纳,影响将远超数据中心交换机层面。学术界的快速 WSS 路线有望在未来提供微秒级低成本 OCS,但产业化仍需 3–5 年。
11. 风险
-
光硬件可靠性风险 MEMS 微镜长时间高频动作可能出现粘滞或偏移,虽设计寿命很长,但灰尘、湿度会加速退化。数据中心运维需要增设光纤洁净间与监控系统。快速可调谐激光器的波长漂移可能导致连接错误,需实时校准。
-
控制平面复杂度 大规模 OCS 网络的拓扑计算、连接建立和故障回切需要亚毫秒级完成,调度算法若有 Bug 可能导致全集群死锁。当前 Google 的自研控制器高度硬件绑定,开源社区尚无成熟替代,生态封闭。
-
与现有网络堆栈兼容性 绝大多数训练框架和通信库假设底层网络为固定拓扑、基于 IP/IB 寻址。引入 Fiber Shuffle 需要修改 NCCL/MPI 的控制接口,改变数据传输语义,迁移成本高。若生态不统一,可能仅在极少数定制集群中应用。
-
成本与供应链集中 MEMS-OCS 与 WSS 的供应商高度集中(Lumentum、Coherent 等),一旦需求暴增可能出现交货期延长,且单价下降速度可能不及预期。一台 136 端口 OCS 成本仍远超同端口数的以太网交换机,若无严格通信瓶颈,用户缺乏买单意愿。
-
标准化缺位 尚无统一的 OCS 配置协议和数据面抽象(如 UALink 尚未涉及光层)。不同厂商方案互不兼容,可能导致“谷歌专用”“NVIDIA 专用”等垂直封闭生态,阻碍产业规模化。
-
调优与误用风险 如果跨步通信矩阵估算不准或调度器选错置换,反而会引入额外拓扑重排延迟,造成性能倒退。对训练工程师的能力要求极高,中小团队难以驾驭。
12. 误读纠偏
误解 1:“Fiber Shuffle 是一种新的网络协议。” 纠正:Fiber Shuffle 定义的是物理层光拓扑动态重构,不引入新的包格式或传输层协议。它可与以太网、InfiniBand 或任何 L2 协议共存,是底层介质调度而非上层协议。
误解 2:“用了光交换机就不需要 InfiniBand 或以太网了。” 纠正:光重排主要加速集体通信中的大象流,控制信号、非大数据传输仍依赖传统分组交换网络。光+电混合组网是现实路径,不可能完全移除电交换机。
误解 3:“OCS 等于 Fiber Shuffle。” 纠正:OCS 是静态的光交叉连接,需要额外软件赋予其“根据通信矩阵动态拓扑”的能力才构成 Fiber Shuffle。纯 OCS 也可以配置后固定不动,不跟随训练流量变化。
误解 4:“微秒级重排意味着训练步延迟会降到微秒。” 纠正:重排本身只是调度开销,端到端通信延迟还包括数据传输时延、光传播延迟和节点处理延迟。Fiber Shuffle 主要降低的是由于拥塞排队带来的尾延迟,而不是消除物理极限。
误解 5:“所有 AI 训练都需要 Fiber Shuffle。” 纠正:在密集 All-to-All 的 MoE 或大规模 All-Reduce 场景才能体现显著收益。简单数据并行和中小规模训练中,传统 RDMA 网络已够好,光重排的收益不足以弥补额外的硬件成本和复杂度。
13. 最新事件
- 2023 年 12 月:Google Cloud 推出 Cloud TPU v5p,采用与 TPU v4 类似的 OCS 架构,支持 8960 个芯片的 Pod,训练更大 MoE 模型(来源:Google Cloud Blog,2023.12.6)。其论文《TPU v4》获得 ISCA 2023 最佳论文。
- 2024 年 3 月:Ayar Labs 宣布其光 I/O 方案基于 Intel Agilex 7 FPGA 完成 1 Tbps die-to-die 互联演示,并首次展示动态光学交换的链路重定向功能,延迟 <100 ns(来源:Ayar Labs 新闻稿,2024.3.26)。
- 2024 年 4 月:在 OFC 2024 上,Coherent 展示面向 AI 集群的 128 端口 MEMS-OCS 原型,切换时间约 3 ms,单端口 800G,计划 2025 年上半年送样(来源:Coherent 公司展台信息,2024.4)。
- 2024 年 6 月:Lightmatter 在 Hot Chips 2024(提前发布预告)中透露,其 Passage 光互连已在某领先 GPU 厂商的次世代芯片原型中用于连接超 100 个 die,实现全互通动态拓扑(来源:Lightmatter 官方博客,2024.6)。
- 2024 年 8 月:Ultra Ethernet Consortium 发布 v1.0 规范预览,未包含光层控制,但提出未来传输层应支持“物理拓扑变化通知”扩展,为 Fiber Shuffle 融入开放网络埋下伏笔(来源:UEC 官网,2024.8)。
- 2025 年 2 月:国内某头部云厂商在开放原子基金会开源“面向 MoE 的光调度通信库”原型代码,成为国内首个公开的光 shuffle 软件尝试(来源:该基金会 GitHub 仓库)。
14. 跟踪指标
-
光交换机切换时间与端口密度 关注 Google、Coherent、Lumentum 等下一代 OCS 的切换时间能否突破 1 ms,端口密度能否翻倍。这直接影响 Fiber Shuffle 可覆盖的集群规模和调度间隔。
-
标准化进展 跟踪 UEC 或 UALink 是否成立光层控制工作组,以及 OpenConfig/Redfish 对 OCS 的配置模型纳入进度。统一接口是跨厂商部署的关键。
-
芯片级光互连落地 Ayar Labs、Lightmatter 是否宣布获得 GPU/TPU-like 加速器设计 win 并公布商用时间表。若能嵌入主流芯片,Fiber Shuffle 将从“数据中心交换机”下沉为“封装内互联”,彻底改变产业格局。
-
MoE 模型占比趋势 监测各大 AI 公司发布的新基础模型中 MoE 架构比例,以及每模型专家数增长趋势。专家数越多、每层 All-to-All 越频繁,对光重排的需求越刚需。
-
超万卡集群部署公告 统计各云厂商和 AI 公司宣布的 3 万卡及以上集群的数量及网络拓扑选择。若多采用非 Fat-Tree 的重构光网络,则 Fiber Shuffle 进入规模化阶段。
-
光器件成本与良率 可调谐激光器和 WSS 的价格曲线、MEMS 微镜阵列的制造良率,是决定 Fiber Shuffle 能否从专用走向通用的经济指标。