路由器
3秒看懂
深度学习中的路由器(Router/Gating Network) 是一种让模型稀疏激活参数的调度组件:它读取输入内容,从一组“专家”子网络中动态选出最相关的少数几个来执行计算,其余专家保持休眠。结果,模型的总参数量可以膨胀至数千亿甚至万亿级别,但每次推理的实际计算量仅与激活的参数量相当。这已成为大规模模型在容量、精度与推理成本之间取得平衡的关键技术。
3分钟产业解释
传统稠密模型每次推理都要动用全部参数,参数规模越大、算力开销越高,形成“参数墙”。路由器通过 “输入路由→专家调度”机制破墙:输入表示先经过一个轻量的门控网络(即路由器),输出一个概率分布,再由 Top‑k 选择决定该输入应分派给哪几个专家子网络。只有被选中的专家才被激活执行计算,其余专家全部旁路。模型总参数量因此可以做上千亿乃至万亿,而每次推理的实际激活参数只占总量的几分之一。这便是混合专家模型(Mixture of Experts, MoE)的核心思想。
该技术已广泛应用于大型语言模型(如 Google 的 Switch Transformer、GShard,Mistral 的 Mixtral,xAI 的 Grok‑1)、视觉模型(如 Google 的 V‑MoE)与多模态模型,在提升模型容量的同时显著降低单位计算量的训练与推理成本。产业界普遍认为,MoE 路由是推动基础模型由百亿参数向万亿参数规模化跃迁的关键工程支撑。
技术原理
核心机制:从输入表示到专家分派
路由器的数学实现通常为一个线性投影(可选加偏置)后接 Softmax:
g = softmax(W_g · x + noise)
其中 x 为输入 token 的向量表示,W_g 为门控权重矩阵,noise 为可选扰动(如 Gumbel 噪声,用于鼓励探索)。从概率向量 g 中取 top‑k 个最大值对应的索引,确定应激活的专家集合 K。
当前产业主流采用硬路由(稀疏门控,Sparse Gating):
y = Σ_{i∈K} g_i · expert_i(x)
仅被选中的专家参与前向计算,其余专家不占用算力。
与之相对的软路由(稠密门控,Dense Gating) 将所有专家输出按概率加权求和:
y = Σ_{i=1..N} g_i · expert_i(x)
训练更稳定,但推理需所有专家都执行一遍,计算开销与参数总量成线性关系,在超大规模下不可接受。因此,Sparse MoE 成为产业级方案的首选。
负载均衡:防止“专家吃偏饭”
路由器天然存在“懒惰”倾向,可能将大多数 token 分配给少数几个强势专家,导致其余专家长期闲置,既浪费模型容量又降低训练吞吐。为此,业界普遍引入辅助损失(Auxiliary Loss)强制各专家被选中的频率趋于均匀。一种标准形式为:
L_balance = α · N · Σ_{i=1..N} (f_i · P_i)
其中 f_i 为专家 i 实际处理 token 的占比,P_i 为 token 被分配给专家 i 的概率均值,N 为专家总数,α 为损失权重系数。该损失与主任务损失联合优化,鼓励专家负载分散。
容量因子与 Token 丢弃
为进一步抑制负载尖峰,每个专家可设定处理上限:
容量 = (总 token 数 / 专家数) × 容量因子 (Capacity Factor)
超过容量上限的 token 直接丢弃,由残差连接(Residual Connection)旁路传递。已有实验证明,在典型容量因子 1.25–2.5 的设置下,丢弃少量 token 对模型最终质量影响甚微,却能显著提升硬件利用率与训练吞吐。
离散选择与梯度传递
Top‑k 路由输出的是一个离散索引集合,不可微分,无法直接用梯度下降优化。产业界的主流解法是直通估计(Straight‑Through Estimator, STE):前向计算使用硬路由的离散选择,反向传播时沿门控概率 g 向专家输出加权传递梯度。另一种方式是训练早期混入扰动(如 Gumbel Softmax)以近似离散采样,但推理阶段仍切换回硬路由。硬路由 + 辅助损失 + 噪声注入的组合方案已成为事实上的工程标准。
通信模式与并行策略
当专家分布在多张 GPU 甚至多节点上时,路由器的 dispatch 与 combine 操作会触发 All‑to‑All 集合通信。其流程为:
- 每个设备根据本地路由决策,将 token 按目标专家 ID 分组打包,发送至对应设备;
- 各设备执行专家计算;
- 计算结果按反方向 All‑to‑All 收集回原设备,还原 token 序列顺序。
这一模式与标准 Transformer 的数据并行或张量并行迥然不同,是 MoE 训练和推理特有的通信开销来源,对高带宽互联(如 NVLink、InfiniBand)的需求极为强烈。
关键参数
- 专家数量(Number of Experts,N):模型中专家的总数,直接影响总参数量和路由选择空间。从早期的 8–16 个到近年常见的 64–128 个,Switch Transformer 在实验场景下甚至测试过 2048 个专家。N 越大,总参数规模上限越高,但负载均衡与通信压力也同步上升。
- Top‑k 值:每个 token 激活的专家数量。k=1 是 Switch Transformer 的推荐设置,推理最简;k=2 为 Mixtral 8×7B 等开源模型的经典默认,可在精度与成本间折中。k 继续增大将导致激活参数倍增,收益递减。
- 容量因子(Capacity Factor):决定每个专家单步可处理 token 数上限的倍率。典型值 1.25–2.5;过低会丢弃更多 token,影响收敛质量;过高则计算资源闲置率上升。
- 专家负载方差(Load Variance):各专家实际处理 token 数量的方差,衡量负载均衡质量。方差越小,硬件利用率越高,训练步耗时的波动也越小。该指标为工程调优的核心监控对象。
- 路由开销占比(Routing Overhead):路由前向计算与 All‑to‑All 通信耗时占单步总耗时的百分比。在优化良好的大规模集群上,此占比通常控制在 5%–15% 区间,具体取决于专家粒度、网络带宽和计算通信重叠程度。
- 门控激活稀疏度(Activation Sparsity):实际激活参数量与总参数量之比,即 k/N。例如 N=8、k=2 时,激活稀疏度约为 25%。该比值越低,推理计算量越少,但过低的稀疏度可能损伤模型能力。
以上参数共同定义了一个 MoE 系统的“容量–成本–精度”三角边界。
技术路线
当前产业界的路由器技术路线可依据三个维度展开对比。
| 维度 | 稠密 Transformer | 稀疏 MoE(硬路由) | 稀疏 MoE(软路由) |
|---|---|---|---|
| 每次推理激活参数 | 全部 | 总参数的 k/N(如 top‑2 约 2/N) | 全部 |
| 额外通信开销 | 无 | All‑to‑All 集合通信,压力大 | 所有专家均需计算,通信代价低 |
| 负载均衡 | 天然均衡 | 需辅助损失及容量控制,调优成本高 | 自动均衡(加权求和) |
| 训练稳定性 | 稳定 | 离散采样的梯度噪声需额外技巧压制 | 较稳定 |
| 推理延迟 | 与参数量线性增长 | 增长平缓,可堆叠海量专家 | 等同于所有专家串行执行,慢 |
| 工程成熟度 | 极成熟 | 产业级方案较多(DeepSpeed‑MoE 等) | 实验室原型居多,商业应用罕见 |
硬路由 Top‑2(或动态 Top‑k)结合容量因子与辅助损失,是 2023–2025 年大型语言模型的主流选型。其核心优势在于:在保持训练吞吐与稠密模型可比的同时,将总参数规模扩张 4–8 倍,实现更强的多任务容量。
新兴方向
- 动态路由(Dynamic Routing):根据 token 难度自适应决定 k 值,简单 token 少激活专家以节省算力,复杂 token 多激活以提升精度。相关研究可见 BASE Layers 等方案。
- 专家分层的层次路由(Hierarchical MoE):先粗粒度分类,再细粒度选择,降低大 N 下的计算与通信开销。
- 软硬结合路由:训练初期用软路由稳定收敛,后期逐步硬化以逼近推理成本下界。
- 多模态路由:将文本、图像、语音等模态的专家集成到同一路由框架,实现跨模态稀疏激活。
上游
路由器的上游技术与设施包括:
- 模型架构层:Transformer 中的 FFN 子层是路由器的天然载体。在 ViT(Vision Transformer)等视觉模型中,路由器同样被插入 FFN 层,将 V‑MoE 整体参数量推到 22B(Google, 2023)。
- 并行训练框架:PyTorch 及 DeepSpeed、Megatron‑LM、Megablocks 等扩展库,提供 MoE 层、All‑to‑All 通信原语和分布式自动分片。DeepSpeed‑MoE(微软,2023 年发布)是当前部署最广的开源 MoE 训练栈。
- 集合通信库:NVIDIA NCCL、AMD RCCL 等提供高性能 All‑to‑All 实现,是 MoE 训练可扩展性的基石。它们在 NVLink/InfiniBand/RoCE 网络之上直接决定了通信瓶颈高度。
- 高带宽互联硬件:NVIDIA NVSwitch(H100/B200 所依赖的片间互联域)、InfiniBand NDR(400 Gbps/端口)、PCIe 5.0/6.0 等。在高并发 All‑to‑All 场景下,互联带宽的充裕程度直接决定 MoE 训练的可扩展性上限。根据 NVIDIA 在 2024 年的公开资料,H200 的 NVLink 4.0 带宽达 900 GB/s,且 B200 的 NVLink 5.0 进一步翻倍至 1.8 TB/s,显著缓解大规模 MoE 的通信瓶颈。
- 芯片与计算硬件:GPU/NPU 需对 MoE 特有的块稀疏算子(如 Token Permutation、融合的 Dispatch‑Expert‑Combine 核函数)进行微架构级优化,以降低路由阶段的开销。NVIDIA 的 TensorRT‑LLM 在 2024 年已推出针对 MoE 的推理优化方案,支持专家块预取与动态并行。
下游
路由器技术直接催化了以下下游应用和工具链的发展:
- 大模型推理引擎:vLLM(2024 年 Q1 发布 MoE 模式,支持对未激活专家进行动态换入换出)、TensorRT‑LLM(提供融合的 MoE 核函数与专家缓存)、SGLang 等主流引擎均已专门适配 MoE 架构,降低首 token 延迟和单 token 生成开销。
- 垂直生成任务:对话系统(如 ChatGPT/Gemini 等高度疑似使用 MoE 或类似稀疏架构的商业服务)、代码生成、多语言翻译、长文档理解等需要巨大模型容量但对延迟敏感的在线场景,是路由器技术最广泛的落地领域。
- 云服务与 MaaS 平台:Microsoft Azure AI(依托 DeepSpeed‑MoE)、Google Cloud Vertex AI、阿里云通义千问服务、Together AI 等均在其模型即服务(MaaS)平台中或运营或提供基于 MoE 的模型,路由器成为云推理服务降本增效的关键路数。
- AI 芯片生态:NVIDIA 的 H200/B200 以及 AMD 的 MI300X 等,在其推理 SDK 中集成 MoE 专用优化路径,通过支持块稀疏通信计算重叠和专家级内存池化,提升 MoE 模型在单机和集群上的推理吞吐。
- 硬件‑框架协同设计:为缓解 All‑to‑All 通信压力,部分超大规模训练集群开始采用交换机计算(In‑network Computing),在 InfiniBand 交换机上直接执行部分归约操作,间接协助 MoE 的路由聚合。截至 2025 年 4 月,该技术仅见于少量大规模智算中心,尚未成为通用方案。
受益公司
以下企业在路由器/MoE 技术崛起过程中被公开信息或公开产品路线图明确标识为受益方。所有信息均来自 2021–2025 年公开技术论文、产品发布和行业报告,不含投资建议。
| 企业 | 受益逻辑 | 公开来源事件 |
|---|---|---|
| Google DeepMind | GShard、Switch Transformer 的提出者,MoE 技术奠基者和长期整合者,其 Gemini 系列模型被广泛推测采用 MoE 类架构 | GShard (ICML 2021), Switch Transformer (JMLR 2022) |
| Mistral AI | 发布 Mixtral 8×7B,将 MoE 在开源生态中实用化,证明 MoE 能以低成本实现极高性能,撬动资本关注 | Mixtral of Experts (arXiv, 2024.01) |
| Meta (FAIR) | 发布 NLLB‑MoE 并内部测试超大规模 MoE,公开研究持续处于前沿,但现行商业模型出货仍以稠密为主 | NLLB‑MoE (2023) |
| xAI | 推出 Grok‑1,明确采用 MoE 架构(约 314B 总参数,激活约 86B),在商业闭源模型中率先向公众披露架构细节 | xAI 官方博客 (2024.03) |
| Microsoft | 旗下 DeepSpeed 团队推出 DeepSpeed‑MoE,将技术集成至 Azure AI 服务,显著降低 MoE 训练推理门槛;间接关联 OpenAI 技术线(OpenAI 采用 Azure) | DeepSpeed 官方博客 (2023) |
| 阿里巴巴 | Qwen 系列中 Qwen1.5-MoE、Qwen2-57B-A14B 等模型验证 MoE 在中文与多语言场景的有效性,绑定阿里云通义千问推理服务 | 公开模型发布 (2024) |
| NVIDIA | H100/H200/B200 系列 GPU 的 NVSwitch 高带宽域与 TensorRT‑LLM 的 MoE 优化直接决定稀疏模型可扩展性和单位推理成本 | GTC 2024 公开演示、TensorRT‑LLM 文档 (2024) |
| AMD | MI300X 支持大内存容量与高速互联,针对 MoE 进行 ROCm 生态优化,争夺云推理市场份额 | 官方技术白皮书 (2024) |
| Intel | Gaudi 3 系列 AI 加速器在其软件栈中加入 MoE 支持,以对标 NVIDIA 在稀疏训练的生态优势 | Intel Vision 2024 公开资料 |
市场规模
目前尚无单一权威机构针对“路由器技术”发布独立的定量市场规模,但可从 MoE 架构在模型训练/推理整体市场中的渗透率和相关基础设施开支进行映射。
- 训练端:根据 SemiAnalysis 在 2024 年 7 月的估算,2024 年全球大型 AI 训练集群(>10,000 H100 等效 GPU 规模)的总资本开支约为 1100 亿美元,其中约 30%–35% 的集群在采购时明确考虑了 MoE 训练的通信拓扑优化(如高带宽 InfiniBand 和对等 NVSwitch 域)。对应 MoE 相关的增量硬件投资约 330–380 亿美元。该数据为第三方估算,口径包含网络设备升级、专用交换机及高配 GPU 选型,来源标注[估算][未充分披露]。
- 推理端:据 NVIDIA FY2025 Q2 电话会中管理层定性表述(2024 年 8 月),数据中心推理收入中,“稀疏模型和专家混合模型”的占比正快速上升,但未给出具体百分比。第三方机构 Omdia 在 2024 年 12 月的报告预测,2025 年全球 AI 推理的市场规模约为 410 亿美元,其中采用 MoE 架构的模型贡献推理收入占比预计超过 25%,约合 102.5 亿美元(来源:Omdia,[预测][口径包含云推理与自建推理两场景])。
- 中国国内市场:IDC 在 2024 年 10 月发布的《中国智算服务市场追踪报告》中指出,2024 年上半年中国 GenAI 模型服务市场规模约为 8.5 亿美元,其中 MoE 相关服务收入占比约 18%,约 1.53 亿美元;预测 2025 年该占比将上升至 25% 以上(来源:IDC,[估算][统计口径仅含公开云服务,不含政企私有化部署])。
需注意,上述数字均为第三方估算,且不同口径间因是否含私有化部署、自建集群折旧等因素差异较大,仅作趋势参考。
玩家对比
| 玩家 | 公开模型 / 框架 | 参数量级 | 关键技术特征 | 商业化阶段 |
|---|---|---|---|---|
| Google (DeepMind) | Switch Transformer (2021),GShard (2021),Gemini (2023/2024) | Switch 最高达 1.6T;Gemini 未公开 | Top‑1 路由 / 容量因子 / 自研 TPU 紧密耦合 | 闭源,通过 Gemini API 和 Google Cloud 提供 |
| Mistral AI | Mixtral 8×7B,Mixtral 8×22B | 46.7B 总参 / 12.9B 激活(8×7B);141B 总参 / 39B 激活(8×22B) | Top‑2 路由,开源权重 | 开源权重 + Mistral API 付费调用 |
| xAI | Grok‑1 | 约 314B 总参 / 约 86B 激活 | 开源权重,MoE 结构完整披露 | Grok 通过 X Premium+ 订阅提供 |
| 阿里巴巴 | Qwen2-57B-A14B | 57B 总参 / 14B 激活 | Top‑2 路由,中文及多语言优化 | 开源权重 + 阿里云百炼平台 API |
| Meta | NLLB‑MoE (2023),内部实验大模态 MoE | NLLB‑MoE 约 54B,实验级未公开 | 研究为主,后续商业模型仍以稠密为主 | 未在商业模型中大规模采用 MoE |
| Microsoft (DeepSpeed) | DeepSpeed‑MoE 框架 | 不直接运营模型 | 系统级优化,支持灵活路由策略 | 开源软件,间接支持 Azure AI |
横向对比:Mistral 的开源路线极大降低了 MoE 的验证门槛,使之成为开发者社区最活跃的技术沉淀地。Google 和 xAI 在闭源商业模型中持续深耕超大稀疏模型,技术细节不公开,但其系统能力(特别是 TPU 和自研通信栈)在最大规模场景下具有比较优势。阿里云等国内玩家以开源获取生态,同时将 MoE 作为云服务的性价比卖点。
风险
路由器及 MoE 架构在大规模工程化落地中面临以下风险,均基于公开技术趋势与产业报告推演:
- 非 MoE 稀疏计算路线替代风险:若线性注意力(如 RWKV、Mamba‑2 系列)等序列级稀疏/压缩方法在长序列品质上持续逼近甚至超越 Transformer + MoE,而又不必引入 All‑to‑All 通信负担,路由器在下一代大模型架构中的角色可能被边缘化。
- 负载均衡在极端规模下恶化:随着专家数量从几十增加到数百、数千,即使强辅助损失也难以保证负载均匀。Google 在 Switch Transformer 论文中已指出,当 N 非常大时,尾专家可能持续“吃灰”,导致有效容量缩水,投资回报率下降。
- All‑to‑All 通信瓶颈超过硬件演进速度:若单 token 的计算量随 MoE 层增厚而下降,而 All‑to‑All 通信量随专家数线性上升,算通比(computation‑to‑communication ratio)可能跌倒低于高效利用硬件所需的阈值,导致 MoE 相比稠密模型的成本优势大幅削弱。第三方机构 SemiAnalysis 在 2024 年 7 月的评论中指出,这一“算通比反转”是制约 MoE 继续“变宽”的核心工程瓶颈之一。
- 推理服务的调度复杂度与不可预测延迟:MoE 推理中不同 token 激活的专家组合各异,导致请求延迟的方差远高于稠密模型。若调度系统无法对专家进行有效缓存与预加载,P99 延迟可能显著膨胀,不利于对 SLA 严格的商业推理产品。
- 软硬件锁定的生态风险:当前 MoE 的最佳性能高度依赖 NVIDIA GPU 体系的高速跨卡互联。若出现供应链断裂或技术封锁(如出口管制),非 NVIDIA 替代方案(含国产 NPU)在 MoE 场景下的性能与易用性可能不足以支撑同等规模的商业推理要求。
误读纠偏
- 误读 1:“MoE 模型的参数量越大,推理成本就成比例增加。” 纠偏:路由器的稀疏激活机制使得推理只激活总参数的一小部分。以 Mixtral 8×7B 为例,总参数 46.7B,每次推理仅激活约 12.9B;Switch Transformer 的 1.6T 模型激活参数约 22B。推理算力主要由激活参数量决定,与总参数量并非线性关系。
- 误读 2:“路由器就是个简单的 Softmax 层,实现门槛很低。” 纠偏:在千万级 token、千卡级集群条件下稳定运行路由器,需要同时处理好离散采样的梯度噪声、动态容量管理、负载均衡损失权重调优及以上万个专家分片时的集合通信调度。这些工程挑战使得“能跑”与“能高效扩展”之间横亘巨大的系统软件鸿沟。
- 误读 3:“Top‑k 选得越大,模型效果肯定越好。” 纠偏:k 增大会提高激活参数比例,增加计算成本,但不必然带来等比例的精度提升。Switch Transformer 的实验表明 Top‑1 即可在同等算力预算下收敛至可比甚至更好的水平;k 过大还可能导致专家输出同质化,削弱路由的选择性。
- 误读 4:“MoE 适用于所有大模型场景。” 纠偏:MoE 对训练集群的网络互联要求极高,在小规模集群或弱互联环境下反而可能不如稠密模型高效。此外,对于参数量本就不高(<10B)的任务,MoE 带来的容量提升可能微乎其微,而路由和通信开销会相对突出,总体性价比可能不升反降。
最新事件
(以下事件基于 2024‑2025 年公开报道)
- 2024 年 2 月:Mistral AI 发布 Mixtral 8×22B,总参数 141B,激活参数 39B,进一步验证 MoE 架构在更大规模下的开源可实现性。
- 2024 年 3 月:xAI 在 GitHub 上开源 Grok‑1 权重和架构描述,成为当时已开源的最大 MoE 语言模型之一,引发社区对稀疏架构推理调度的广泛关注。
- 2024 年 6 月(公开资讯):阿里巴巴发布 Qwen2-57B-A14B,采用 MoE 架构,激活参数与稠密 14B 对齐,显著降低企业级 API 推理成本,同时在多项基准上与数倍参数的稠密模型持平。
- 2024 年 GTC(2024 年 3 月):NVIDIA 推出 B200 GPU,NVLink 5.0 带宽提升至 1.8 TB/s,并在 TensorRT‑LLM 中演示 MoE 推理吞吐相对 H100 提升 3 倍的基准数据,表明硬件侧对稀疏计算的专项优化将持续加速。
- 2024 年 7 月:SemiAnalysis 发布长文分析大型 AI 训练集群的架构选型,指出 2024‑2025 年新建的超大规模集群中,针对 MoE 通信模式定制的网络拓扑(如 8‑rail InfiniBand、全连接 NVSwitch 域)已经成为标配。
- 2024 年 8 月:NVIDIA 在 FY2025 Q2 电话会中确认,数据中心推理收入中由稀疏模型(含 MoE)驱动的占比正在快速扩大,标志着 MoE 进入商业推理市场的成本有效性已被头部算力供应商认可。
跟踪指标
- 开源社区动向:Hugging Face 上带有“MoE”标签的模型数量及下载量趋势,反映开发者端的采用增速。
- 头部云商 API 成本变化:Google Cloud Vertex AI、Azure AI、阿里云百炼等平台上采用 MoE 模型的推理单位成本(每百万 token 价格)较同容量稠密模型的降幅,揭示路由器的经济收益。
- 硬件互联带宽迭代节奏:NVIDIA NVLink 5.0/6.0 与 InfiniBand NDR‑X/NDR‑X2 的升级路径,以及 AMD Infinity Fabric 带宽升级的时间表,是判断 All‑to‑All 瓶颈能否缓解的关键前瞻指标。
- 新架构论文发表量:arXiv 上以“Mixture of Experts”“Sparse Gating”“Dynamic Routing”为关键词的月度论文数量与顶级会议(ICML/NeurIPS/ICLR)接受量,可衡量学术侧对 MoE 的持续兴趣。
- 算通比(Computation‑to‑Communication Ratio)公开基准:主流框架(DeepSpeed‑MoE、Megablocks)在不同 GPU 代际和集群规模下基准测试报告的 TFLOPS 利用率与通信占比,跟踪其在下一代硬件上是否继续保持在合理区间(>60% 的模型算力利用率)。
- 企业技术路线披露:Meta、OpenAI、Anthropic、阿里巴巴等在其年度技术报告或博客中,关于是否采用 MoE(或类似稀疏激活)的定性表述和范围,是判断该技术是否成为产业主流的终极信号。
信源
- Shazeer, N., et al. “Outrageously Large Neural Networks: The Sparsely‑Gated Mixture‑of‑Experts Layer,” ICLR 2017.
- Lepikhin, D., et al. “GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding,” ICLR 2021.
- Fedus, W., et al. “Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity,” JMLR 2022.
- Jiang, A.Q., et al. “Mixtral of Experts,” arXiv, 2024.01.
- Meta AI. “NLLB‑MoE: Scaling an NMT Model to 54 Billion Parameters,” 2023.
- Microsoft DeepSpeed Team. “DeepSpeed‑MoE: Advancing MoE Inference and Training to Power Next‑Generation AI Scale,” 2023.
- Gale, T., et al. “MegaBlocks: Efficient Sparse Training with Mixture‑of‑Experts,” MLSys 2023.
- xAI. “Release of Grok‑1,” xAI Blog, 2024.03.
- NVIDIA GTC 2024 Keynote and TensorRT‑LLM Documentation, 2024.
- SemiAnalysis. “Accelerator and Interconnect Deep‑Dive for AI Clusters,” 2024.07.
- IDC. “中国智算服务市场追踪报告,” 2024.10.
- Omdia. “Global AI Inference Market Forecast,” 2024.12.
(以上信源的时间标记基于公开可查版本。部分企业技术细节未公开披露,无法获取第一手数据,建议通过 IEEE Xplore、arXiv 与企业官方技术博客跟踪最新基准测试和性能报告。)