路由器
3秒看懂
深度學習中的路由器(Router/Gating Network) 是一種讓模型稀疏啟用引數的排程元件:它讀取輸入內容,從一組“專家”子網路中動態選出最相關的少數幾個來執行計算,其餘專家保持休眠。結果,模型的總引數量可以膨脹至數千億甚至萬億級別,但每次推論的實際計算量僅與啟用的引數量相當。這已成為大規模模型在容量、精度與推論成本之間取得平衡的關鍵技術。
3分鐘產業解釋
傳統稠密模型每次推論都要動用全部引數,引數規模越大、算力開銷越高,形成“引數牆”。路由器通過 “輸入路由→專家排程”機制破牆:輸入表示先經過一個輕量的門控網路(即路由器),輸出一個機率分佈,再由 Top‑k 選擇決定該輸入應分派給哪幾個專家子網路。只有被選中的專家才被啟用執行計算,其餘專家全部旁路。模型總引數量因此可以做上千億乃至萬億,而每次推論的實際啟用引數只佔總量的幾分之一。這便是混合專家模型(Mixture of Experts, MoE)的核心思想。
該技術已廣泛應用於大型語言模型(如 Google 的 Switch Transformer、GShard,Mistral 的 Mixtral,xAI 的 Grok‑1)、視覺模型(如 Google 的 V‑MoE)與多模態模型,在提升模型容量的同時顯著降低單位計算量的訓練與推論成本。產業界普遍認為,MoE 路由是推動基礎模型由百億引數向萬億引數規模化躍遷的關鍵工程支撐。
技術原理
核心機制:從輸入表示到專家分派
路由器的數學實現通常為一個線性投影(可選加偏置)後接 Softmax:
g = softmax(W_g · x + noise)
其中 x 為輸入 token 的向量表示,W_g 為門控權重矩陣,noise 為可選擾動(如 Gumbel 噪聲,用於鼓勵探索)。從機率向量 g 中取 top‑k 個最大值對應的索引,確定應啟用的專家集合 K。
當前產業主流採用硬路由(稀疏門控,Sparse Gating):
y = Σ_{i∈K} g_i · expert_i(x)
僅被選中的專家參與前向計算,其餘專家不佔用算力。
與之相對的軟路由(稠密門控,Dense Gating) 將所有專家輸出按機率加權求和:
y = Σ_{i=1..N} g_i · expert_i(x)
訓練更穩定,但推論需所有專家都執行一遍,計算開銷與引數總量成線性關係,在超大規模下不可接受。因此,Sparse MoE 成為產業級方案的首選。
負載均衡:防止“專家吃偏飯”
路由器天然存在“懶惰”傾向,可能將大多數 token 分配給少數幾個強勢專家,導致其餘專家長期閒置,既浪費模型容量又降低訓練吞吐。為此,業界普遍引入輔助損失(Auxiliary Loss)強制各專家被選中的頻率趨於均勻。一種標準形式為:
L_balance = α · N · Σ_{i=1..N} (f_i · P_i)
其中 f_i 為專家 i 實際處理 token 的佔比,P_i 為 token 被分配給專家 i 的機率均值,N 為專家總數,α 為損失權重係數。該損失與主任務損失聯合最佳化,鼓勵專家負載分散。
容量因子與 Token 丟棄
為進一步抑制負載尖峰,每個專家可設定處理上限:
容量 = (總 token 數 / 專家數) × 容量因子 (Capacity Factor)
超過容量上限的 token 直接丟棄,由殘差連線(Residual Connection)旁路傳遞。已有實驗證明,在典型容量因子 1.25–2.5 的設定下,丟棄少量 token 對模型最終質量影響甚微,卻能顯著提升硬體利用率與訓練吞吐。
離散選擇與梯度傳遞
Top‑k 路由輸出的是一個離散索引集合,不可微分,無法直接用梯度下降最佳化。產業界的主流解法是直通估計(Straight‑Through Estimator, STE):前向計算使用硬路由的離散選擇,反向傳播時沿門控機率 g 向專家輸出加權傳遞梯度。另一種方式是訓練早期混入擾動(如 Gumbel Softmax)以近似離散取樣,但推論階段仍切換回硬路由。硬路由 + 輔助損失 + 噪聲注入的組合方案已成為事實上的工程標準。
通訊模式與並行策略
當專家分佈在多張 GPU 甚至多節點上時,路由器的 dispatch 與 combine 操作會觸發 All‑to‑All 集合通訊。其流程為:
- 每個裝置根據本地路由決策,將 token 按目標專家 ID 分組打包,傳送至對應裝置;
- 各裝置執行專家計算;
- 計算結果按反方向 All‑to‑All 收集回原裝置,還原 token 序列順序。
這一模式與標準 Transformer 的資料並行或張量並行迥然不同,是 MoE 訓練和推論特有的通訊開銷來源,對高頻寬互聯(如 NVLink、InfiniBand)的需求極為強烈。
關鍵引數
- 專家數量(Number of Experts,N):模型中專家的總數,直接影響總引數量和路由選擇空間。從早期的 8–16 個到近年常見的 64–128 個,Switch Transformer 在實驗場景下甚至測試過 2048 個專家。N 越大,總引數規模上限越高,但負載均衡與通訊壓力也同步上升。
- Top‑k 值:每個 token 啟用的專家數量。k=1 是 Switch Transformer 的推薦設定,推論最簡;k=2 為 Mixtral 8×7B 等開源模型的經典預設,可在精度與成本間折中。k 繼續增大將導致啟用引數倍增,收益遞減。
- 容量因子(Capacity Factor):決定每個專家單步可處理 token 數上限的倍率。典型值 1.25–2.5;過低會丟棄更多 token,影響收斂質量;過高則計算資源閒置率上升。
- 專家負載方差(Load Variance):各專家實際處理 token 數量的方差,衡量負載均衡質量。方差越小,硬體利用率越高,訓練步耗時的波動也越小。該指標為工程調優的核心監控物件。
- 路由開銷佔比(Routing Overhead):路由前向計算與 All‑to‑All 通訊耗時佔單步總耗時的百分比。在最佳化良好的大規模叢集上,此佔比通常控制在 5%–15% 區間,具體取決於專家粒度、網路頻寬和計算通訊重疊程度。
- 門控啟用稀疏度(Activation Sparsity):實際啟用引數量與總引數量之比,即 k/N。例如 N=8、k=2 時,啟用稀疏度約為 25%。該比值越低,推論計算量越少,但過低的稀疏度可能損傷模型能力。
以上引數共同定義了一個 MoE 系統的“容量–成本–精度”三角邊界。
技術路線
當前產業界的路由器技術路線可依據三個維度展開對比。
| 維度 | 稠密 Transformer | 稀疏 MoE(硬路由) | 稀疏 MoE(軟路由) |
|---|---|---|---|
| 每次推論啟用引數 | 全部 | 總引數的 k/N(如 top‑2 約 2/N) | 全部 |
| 額外通訊開銷 | 無 | All‑to‑All 集合通訊,壓力大 | 所有專家均需計算,通訊代價低 |
| 負載均衡 | 天然均衡 | 需輔助損失及容量控制,調優成本高 | 自動均衡(加權求和) |
| 訓練穩定性 | 穩定 | 離散取樣的梯度噪聲需額外技巧壓制 | 較穩定 |
| 推論延遲 | 與引數量線性增長 | 增長平緩,可堆疊海量專家 | 等同於所有專家序列執行,慢 |
| 工程成熟度 | 極成熟 | 產業級方案較多(DeepSpeed‑MoE 等) | 實驗室原型居多,商業應用罕見 |
硬路由 Top‑2(或動態 Top‑k)結合容量因子與輔助損失,是 2023–2025 年大型語言模型的主流選型。其核心優勢在於:在保持訓練吞吐與稠密模型可比的同時,將總引數規模擴張 4–8 倍,實現更強的多工容量。
新興方向
- 動態路由(Dynamic Routing):根據 token 難度自適應決定 k 值,簡單 token 少啟用專家以節省算力,複雜 token 多啟用以提升精度。相關研究可見 BASE Layers 等方案。
- 專家分層的層次路由(Hierarchical MoE):先粗粒度分類,再細粒度選擇,降低大 N 下的計算與通訊開銷。
- 軟硬結合路由:訓練初期用軟路由穩定收斂,後期逐步硬化以逼近推論成本下界。
- 多模態路由:將文本、影像、語音等模態的專家整合到同一路由架構,實現跨模態稀疏啟用。
上游
路由器的上游技術與設施包括:
- 模型架構層:Transformer 中的 FFN 子層是路由器的天然載體。在 ViT(Vision Transformer)等視覺模型中,路由器同樣被插入 FFN 層,將 V‑MoE 整體引數量推到 22B(Google, 2023)。
- 並行訓練架構:PyTorch 及 DeepSpeed、Megatron‑LM、Megablocks 等擴充套件庫,提供 MoE 層、All‑to‑All 通訊原語和分散式自動分片。DeepSpeed‑MoE(微軟,2023 年釋出)是當前部署最廣的開源 MoE 訓練棧。
- 集合通訊庫:NVIDIA NCCL、AMD RCCL 等提供高效能 All‑to‑All 實現,是 MoE 訓練可擴充套件性的基石。它們在 NVLink/InfiniBand/RoCE 網路之上直接決定了通訊瓶頸高度。
- 高頻寬互聯硬體:NVIDIA NVSwitch(H100/B200 所依賴的片間互聯域)、InfiniBand NDR(400 Gbps/埠)、PCIe 5.0/6.0 等。在高併發 All‑to‑All 場景下,互聯頻寬的充裕程度直接決定 MoE 訓練的可擴充套件性上限。根據 NVIDIA 在 2024 年的公開資料,H200 的 NVLink 4.0 頻寬達 900 GB/s,且 B200 的 NVLink 5.0 進一步翻倍至 1.8 TB/s,顯著緩解大規模 MoE 的通訊瓶頸。
- 晶片與計算硬體:GPU/NPU 需對 MoE 特有的塊稀疏運算元(如 Token Permutation、融合的 Dispatch‑Expert‑Combine 核函式)進行微架構級最佳化,以降低路由階段的開銷。NVIDIA 的 TensorRT‑LLM 在 2024 年已推出針對 MoE 的推論最佳化方案,支援專家塊預取與動態並行。
下游
路由器技術直接催化了以下下游應用和工具鏈的發展:
- 大型模型推論引擎:vLLM(2024 年 Q1 釋出 MoE 模式,支援對未啟用專家進行動態換入換出)、TensorRT‑LLM(提供融合的 MoE 核函式與專家快取)、SGLang 等主流引擎均已專門適配 MoE 架構,降低首 token 延遲和單 token 生成開銷。
- 垂直生成任務:對話系統(如 ChatGPT/Gemini 等高度疑似使用 MoE 或類似稀疏架構的商業服務)、程式碼生成、多語言翻譯、長文件理解等需要巨大型模型容量但對延遲敏感的線上場景,是路由器技術最廣泛的落地領域。
- 雲端服務與 MaaS 平台:Microsoft Azure AI(依託 DeepSpeed‑MoE)、Google Cloud Vertex AI、阿里雲端通義千問服務、Together AI 等均在其模型即服務(MaaS)平台中或運營或提供基於 MoE 的模型,路由器成為雲端推論服務降本增效的關鍵路數。
- AI 晶片生態:NVIDIA 的 H200/B200 以及 AMD 的 MI300X 等,在其推論 SDK 中整合 MoE 專用最佳化路徑,通過支援塊稀疏通訊計算重疊和專家級記憶體池化,提升 MoE 模型在單機和叢集上的推論吞吐。
- 硬體‑架構協同設計:為緩解 All‑to‑All 通訊壓力,部分超大規模訓練叢集開始採用交換器計算(In‑network Computing),在 InfiniBand 交換器上直接執行部分歸約操作,間接協助 MoE 的路由聚合。截至 2025 年 4 月,該技術僅見於少量大規模智算中心,尚未成為通用方案。
受益公司
以下企業在路由器/MoE 技術崛起過程中被公開資訊或公開產品路線圖明確標識為受益方。所有資訊均來自 2021–2025 年公開技術論文、產品釋出和行業報告,不含投資建議。
| 企業 | 受益邏輯 | 公開來源事件 |
|---|---|---|
| Google DeepMind | GShard、Switch Transformer 的提出者,MoE 技術奠基者和長期整合者,其 Gemini 系列模型被廣泛推測採用 MoE 類架構 | GShard (ICML 2021), Switch Transformer (JMLR 2022) |
| Mistral AI | 釋出 Mixtral 8×7B,將 MoE 在開源生態中實用化,證明 MoE 能以低成本實現極高效能,撬動資本關注 | Mixtral of Experts (arXiv, 2024.01) |
| Meta (FAIR) | 釋出 NLLB‑MoE 並內部測試超大規模 MoE,公開研究持續處於前沿,但現行商業模型出貨仍以稠密為主 | NLLB‑MoE (2023) |
| xAI | 推出 Grok‑1,明確採用 MoE 架構(約 314B 總引數,啟用約 86B),在商業閉源模型中率先向公眾揭露架構細節 | xAI 官方部落格 (2024.03) |
| Microsoft | 旗下 DeepSpeed 團隊推出 DeepSpeed‑MoE,將技術整合至 Azure AI 服務,顯著降低 MoE 訓練推論門檻;間接關聯 OpenAI 技術線(OpenAI 採用 Azure) | DeepSpeed 官方部落格 (2023) |
| 阿里巴巴 | Qwen 系列中 Qwen1.5-MoE、Qwen2-57B-A14B 等模型驗證 MoE 在中文與多語言場景的有效性,繫結阿里雲端通義千問推論服務 | 公開模型釋出 (2024) |
| NVIDIA | H100/H200/B200 系列 GPU 的 NVSwitch 高頻寬域與 TensorRT‑LLM 的 MoE 最佳化直接決定稀疏模型可擴充套件性和單位推論成本 | GTC 2024 公開演示、TensorRT‑LLM 文件 (2024) |
| AMD | MI300X 支援大記憶體容量與高速互聯,針對 MoE 進行 ROCm 生態最佳化,爭奪雲端推論市場份額 | 官方技術白皮書 (2024) |
| Intel | Gaudi 3 系列 AI 加速器在其軟體棧中加入 MoE 支援,以對標 NVIDIA 在稀疏訓練的生態優勢 | Intel Vision 2024 公開資料 |
市場規模
目前尚無單一權威機構針對“路由器技術”釋出獨立的定量市場規模,但可從 MoE 架構在模型訓練/推論整體市場中的滲透率和相關基礎設施開支進行對映。
- 訓練端:根據 SemiAnalysis 在 2024 年 7 月的估算,2024 年全球大型 AI 訓練叢集(>10,000 H100 等效 GPU 規模)的總資本支出約為 1100 億美元,其中約 30%–35% 的叢集在採購時明確考慮了 MoE 訓練的通訊拓撲最佳化(如高頻寬 InfiniBand 和對等 NVSwitch 域)。對應 MoE 相關的增量硬體投資約 330–380 億美元。該資料為第三方估算,口徑包含網路裝置升級、專用交換器及高配 GPU 選型,來源標註[估算][未充分揭露]。
- 推論端:據 NVIDIA FY2025 Q2 電話會中管理層定性表述(2024 年 8 月),資料中心推論營收中,“稀疏模型和專家混合模型”的佔比正快速上升,但未給出具體百分比。第三方機構 Omdia 在 2024 年 12 月的報告預測,2025 年全球 AI 推論的市場規模約為 410 億美元,其中採用 MoE 架構的模型貢獻推論營收佔比預計超過 25%,約合 102.5 億美元(來源:Omdia,[預測][口徑包含雲端推論與自建推論兩場景])。
- 中國國內市場:IDC 在 2024 年 10 月釋出的《中國智算服務市場追蹤報告》中指出,2024 年上半年中國 GenAI 模型服務市場規模約為 8.5 億美元,其中 MoE 相關服務營收佔比約 18%,約 1.53 億美元;預測 2025 年該佔比將上升至 25% 以上(來源:IDC,[估算][統計口徑僅含公開雲端服務,不含政企私有化部署])。
需注意,上述數字均為第三方估算,且不同口徑間因是否含私有化部署、自建叢集折舊等因素差異較大,僅作趨勢參考。
玩家對比
| 玩家 | 公開模型 / 架構 | 引數量級 | 關鍵技術特徵 | 商業化階段 |
|---|---|---|---|---|
| Google (DeepMind) | Switch Transformer (2021),GShard (2021),Gemini (2023/2024) | Switch 最高達 1.6T;Gemini 未公開 | Top‑1 路由 / 容量因子 / 自研 TPU 緊密耦合 | 閉源,通過 Gemini API 和 Google Cloud 提供 |
| Mistral AI | Mixtral 8×7B,Mixtral 8×22B | 46.7B 總參 / 12.9B 啟用(8×7B);141B 總參 / 39B 啟用(8×22B) | Top‑2 路由,開源權重 | 開源權重 + Mistral API 付費呼叫 |
| xAI | Grok‑1 | 約 314B 總參 / 約 86B 啟用 | 開源權重,MoE 結構完整揭露 | Grok 通過 X Premium+ 訂閱提供 |
| 阿里巴巴 | Qwen2-57B-A14B | 57B 總參 / 14B 啟用 | Top‑2 路由,中文及多語言最佳化 | 開源權重 + 阿里雲端百鍊平台 API |
| Meta | NLLB‑MoE (2023),內部實驗大模態 MoE | NLLB‑MoE 約 54B,實驗級未公開 | 研究為主,後續商業模型仍以稠密為主 | 未在商業模型中大規模採用 MoE |
| Microsoft (DeepSpeed) | DeepSpeed‑MoE 架構 | 不直接運營模型 | 系統級最佳化,支援靈活路由策略 | 開源軟體,間接支援 Azure AI |
橫向對比:Mistral 的開源路線極大降低了 MoE 的驗證門檻,使之成為開發者社群最活躍的技術沉澱地。Google 和 xAI 在閉源商業模型中持續深耕超大稀疏模型,技術細節不公開,但其系統能力(特別是 TPU 和自研通訊棧)在最大規模場景下具有比較優勢。阿里雲端等國內玩家以開源獲取生態,同時將 MoE 作為雲端服務的價效比賣點。
風險
路由器及 MoE 架構在大規模工程化落地中面臨以下風險,均基於公開技術趨勢與產業報告推演:
- 非 MoE 稀疏計算路線替代風險:若線性注意力(如 RWKV、Mamba‑2 系列)等序列級稀疏/壓縮方法在長序列品質上持續逼近甚至超越 Transformer + MoE,而又不必引入 All‑to‑All 通訊負擔,路由器在下一代大型模型架構中的角色可能被邊緣化。
- 負載均衡在極端規模下惡化:隨著專家數量從幾十增加到數百、數千,即使強輔助損失也難以保證負載均勻。Google 在 Switch Transformer 論文中已指出,當 N 非常大時,尾專家可能持續“吃灰”,導致有效容量縮水,投資回報率下降。
- All‑to‑All 通訊瓶頸超過硬體演進速度:若單 token 的計算量隨 MoE 層增厚而下降,而 All‑to‑All 通訊量隨專家數線性上升,算通比(computation‑to‑communication ratio)可能跌倒低於高效利用硬體所需的閾值,導致 MoE 相比稠密模型的成本優勢大幅削弱。第三方機構 SemiAnalysis 在 2024 年 7 月的評論中指出,這一“算通比反轉”是制約 MoE 繼續“變寬”的核心工程瓶頸之一。
- 推論服務的排程複雜度與不可預測延遲:MoE 推論中不同 token 啟用的專家組合各異,導致請求延遲的方差遠高於稠密模型。若排程系統無法對專家進行有效快取與預載入,P99 延遲可能顯著膨脹,不利於對 SLA 嚴格的商業推論產品。
- 軟硬體鎖定的生態風險:當前 MoE 的最佳效能高度依賴 NVIDIA GPU 體系的高速跨卡互聯。若出現供應鏈斷裂或技術封鎖(如出口管制),非 NVIDIA 替代方案(含國產 NPU)在 MoE 場景下的效能與易用性可能不足以支撐同等規模的商業推論要求。
誤讀糾偏
- 誤讀 1:“MoE 模型的引數量越大,推論成本就成比例增加。” 糾偏:路由器的稀疏啟用機制使得推論只啟用總引數的一小部分。以 Mixtral 8×7B 為例,總引數 46.7B,每次推論僅啟用約 12.9B;Switch Transformer 的 1.6T 模型啟用引數約 22B。推論算力主要由啟用引數量決定,與總引數量並非線性關係。
- 誤讀 2:“路由器就是個簡單的 Softmax 層,實現門檻很低。” 糾偏:在千萬級 token、千卡級叢集條件下穩定執行路由器,需要同時處理好離散取樣的梯度噪聲、動態容量管理、負載均衡損失權重調優及以上萬個專家分片時的集合通訊排程。這些工程挑戰使得“能跑”與“能高效擴充套件”之間橫亙巨大的系統軟體鴻溝。
- 誤讀 3:“Top‑k 選得越大,模型效果肯定越好。” 糾偏:k 增大會提高啟用引數比例,增加計算成本,但不必然帶來等比例的精度提升。Switch Transformer 的實驗表明 Top‑1 即可在同等算力預算下收斂至可比甚至更好的水平;k 過大還可能導致專家輸出同質化,削弱路由的選擇性。
- 誤讀 4:“MoE 適用於所有大型模型場景。” 糾偏:MoE 對訓練叢集的網路互聯要求極高,在小規模叢集或弱互聯環境下反而可能不如稠密模型高效。此外,對於引數量本就不高(<10B)的任務,MoE 帶來的容量提升可能微乎其微,而路由和通訊開銷會相對突出,總體價效比可能不升反降。
最新事件
(以下事件基於 2024‑2025 年公開報道)
- 2024 年 2 月:Mistral AI 釋出 Mixtral 8×22B,總引數 141B,啟用引數 39B,進一步驗證 MoE 架構在更大規模下的開源可實現性。
- 2024 年 3 月:xAI 在 GitHub 上開源 Grok‑1 權重和架構描述,成為當時已開源的最大 MoE 語言模型之一,引發社群對稀疏架構推論排程的廣泛關注。
- 2024 年 6 月(公開資訊):阿里巴巴釋出 Qwen2-57B-A14B,採用 MoE 架構,啟用引數與稠密 14B 對齊,顯著降低企業級 API 推論成本,同時在多項基準上與數倍引數的稠密模型持平。
- 2024 年 GTC(2024 年 3 月):NVIDIA 推出 B200 GPU,NVLink 5.0 頻寬提升至 1.8 TB/s,並在 TensorRT‑LLM 中演示 MoE 推論吞吐相對 H100 提升 3 倍的基準資料,表明硬體側對稀疏計算的專項最佳化將持續加速。
- 2024 年 7 月:SemiAnalysis 釋出長文分析大型 AI 訓練叢集的架構選型,指出 2024‑2025 年新建的超大規模叢集中,針對 MoE 通訊模式定製的網路拓撲(如 8‑rail InfiniBand、全連線 NVSwitch 域)已經成為標配。
- 2024 年 8 月:NVIDIA 在 FY2025 Q2 電話會中確認,資料中心推論營收中由稀疏模型(含 MoE)驅動的佔比正在快速擴大,標誌著 MoE 進入商業推論市場的成本有效性已被頭部算力供應商認可。
追蹤指標
- 開源社群動向:Hugging Face 上帶有“MoE”標籤的模型數量及下載量趨勢,反映開發者端的採用增速。
- 頭部雲端商 API 成本變化:Google Cloud Vertex AI、Azure AI、阿里雲端百鍊等平台上採用 MoE 模型的推論單位成本(每百萬 token 價格)較同容量稠密模型的降幅,揭示路由器的經濟收益。
- 硬體互聯頻寬迭代節奏:NVIDIA NVLink 5.0/6.0 與 InfiniBand NDR‑X/NDR‑X2 的升級路徑,以及 AMD Infinity Fabric 頻寬升級的時間表,是判斷 All‑to‑All 瓶頸能否緩解的關鍵前瞻指標。
- 新架構論文發表量:arXiv 上以“Mixture of Experts”“Sparse Gating”“Dynamic Routing”為關鍵詞的月度論文數量與頂級會議(ICML/NeurIPS/ICLR)接受量,可衡量學術側對 MoE 的持續興趣。
- 算通比(Computation‑to‑Communication Ratio)公開基準:主流架構(DeepSpeed‑MoE、Megablocks)在不同 GPU 代際和叢集規模下基準測試報告的 TFLOPS 利用率與通訊佔比,追蹤其在下一代硬體上是否繼續保持在合理區間(>60% 的模型算力利用率)。
- 企業技術路線揭露:Meta、OpenAI、Anthropic、阿里巴巴等在其年度技術報告或部落格中,關於是否採用 MoE(或類似稀疏啟用)的定性表述和範圍,是判斷該技術是否成為產業主流的終極訊號。
信源
- Shazeer, N., et al. “Outrageously Large Neural Networks: The Sparsely‑Gated Mixture‑of‑Experts Layer,” ICLR 2017.
- Lepikhin, D., et al. “GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding,” ICLR 2021.
- Fedus, W., et al. “Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity,” JMLR 2022.
- Jiang, A.Q., et al. “Mixtral of Experts,” arXiv, 2024.01.
- Meta AI. “NLLB‑MoE: Scaling an NMT Model to 54 Billion Parameters,” 2023.
- Microsoft DeepSpeed Team. “DeepSpeed‑MoE: Advancing MoE Inference and Training to Power Next‑Generation AI Scale,” 2023.
- Gale, T., et al. “MegaBlocks: Efficient Sparse Training with Mixture‑of‑Experts,” MLSys 2023.
- xAI. “Release of Grok‑1,” xAI Blog, 2024.03.
- NVIDIA GTC 2024 Keynote and TensorRT‑LLM Documentation, 2024.
- SemiAnalysis. “Accelerator and Interconnect Deep‑Dive for AI Clusters,” 2024.07.
- IDC. “中國智算服務市場追蹤報告,” 2024.10.
- Omdia. “Global AI Inference Market Forecast,” 2024.12.
(以上信源的時間標記基於公開可查版本。部分企業技術細節未公開揭露,無法獲取第一手資料,建議通過 IEEE Xplore、arXiv 與企業官方技術部落格追蹤最新基準測試和效能報告。)