網路層 開放閱讀

籠子

Cage

概念 ID
cage
更新時間
2026-05-29
來源數量
待補

籠子

1 3 秒看懂

“籠子”(Cage)是一種在大規模稀疏啟用混合專家(MoE)模型訓練中,通過引入可學習或結構化的約束條件,來引導和限制專家路由器(Router)路由策略的系統性工程方案。其目標是提升模型訓練效率、穩定性與專家專用化程度,系統性防止“專家濫用”“路由坍塌”及負載失衡等工業級部署中的核心瓶頸。

2 3 分鐘產業解釋

隨著混合專家模型成為萬億引數級人工智慧模型的核心架構之一,一個關鍵工程挑戰日益突出:如何高效、穩定地訓練和執行這些擁有成百上千個“專家”子網路的超大規模模型。基礎 MoE 模型依賴一個路由器網路來決定將每個輸入 Token 分發給哪些專家處理。然而,這個路由器在訓練過程中可能變得“混亂”——它可能傾向於將大多數輸入只路由給少數幾個專家(專家濫用),或者讓所有專家都接收到高度相似的任務(專家同質化),導致計算資源浪費、All-to-All 通訊瓶頸和模型效能天花板。

“籠子”技術應運而生,它本質上是一套智慧交通排程與路網約束系統。它不是一個單一演算法,而是一類最佳化策略的集合。其核心思想是:不再完全放任路由器自由學習,而是為其活動範圍設定一個多維度的“籠子”(約束),引導其更合理地分配任務。這種約束可能體現在鼓勵路由器學習更清晰、更專用的路由規則,或者硬性限制每個專家被啟用的頻率與併發負載,確保計算負載和通訊開銷被分攤到所有專家上。對於致力於建置和部署數千億至萬億引數模型的廠商而言,掌握高效的“籠子”技術意味著能以更低的算力成本訓練更強大的模型,並在推論階段實現更高的吞吐量(Tokens/秒),直接關係到 AI 基礎設施數十億美元級投資的投入產出比。

3 技術原理

“籠子”技術從根源上是對 MoE 路由函式引入結構化的約束條件,將其從一個無約束最佳化問題轉化為帶約束最佳化問題。其核心機制通常圍繞三個層面展開:

1. 路由器輸出側的約束(分佈正則化) 對路由器輸出的 logits 或機率分佈施加額外的正則化項,限制其熵值範圍。例如,通過最大化路由機率分佈的熵來防止過早坍塌到少數專家;或通過新增噪聲並強制模型在噪聲下保持路由一致性,提升路由器的魯棒性。這一層面屬於軟性約束,通過損失函式間接引導。

2. 專家選擇空間的限制(候選池機制) 在決定啟用哪些專家時,不再從全量專家中完全自由選擇 Top-K,而是基於預設規則(如專家親和度矩陣、歷史負載狀態、Token 內容雜湊)建置一個有限的“候選專家池”,路由器僅在該池內進行排序與選擇。這相當於直接給路由器的決策空間畫了一個硬性“籠子”,從根本上限制了某些極端路由行為的發生可能。

3. 負載均衡的硬性排程(容量與溢位控制) 在損失函式中顯式加入負載均衡損失項是常見做法,但其調節存在滯後性與不徹底性。“籠子”技術進一步引入硬性約束,例如為每個專家設定容量因子(Capacity Factor),明確規定每個專家單步所能處理的最大 Token 數量。當某專家達到容量上限時,溢位的 Token 要麼被丟棄(需配合額外的輔助損失以保證訓練穩定),要麼通過確定性後備路由分發至其他專家,形成“安全籠”。

核心數學形式化 假設一個標準 MoE 層包含路由器網路 GE 個專家網路 {F_1, F_2, ..., F_E}。對於輸入 Token x,路由器產生分數向量 G(x),通常經 Top-K 操作選擇得分最高的 K 個專家。引入“籠子”後,路由決策 R 變為一個帶約束的最佳化問題:

R(x) = \arg\max_{S \subseteq text(Experts), |S|=K} \left[ text(Score)(S, G(x)) \right]
text(約束條件: ) \Phi(S, text(Historical\_Load), text(Expert\_Capacity)) \leq \Theta

其中 text(Score) 函式結合了路由器原始分數和潛在的親和度得分;約束 \Phi 涉及所選專家集合 S 的歷史負載方差、當前步已佔用容量等;\Theta 是可調閾值向量。

核心資料流

[輸入 Token 序列]


[路由器網路 G] ──► 原始路由分數


[帶約束的路由決策 R]  ◄── [負載監控] ◄── [專家容量狀態]
        │                        ▲
        ▼                        │
  ┌─────┼─────┐          [約束規則引擎]
  │     │     │                  ▲
  ▼     ▼     ▼                  │
[E₁]  [E₂] ... [Eₖ]     (僅K個被啟用)
  │     │     │
  └─────┼─────┘

[加權合併輸出] ──► [殘差連線] ──► 下一層

4 關鍵引數

“籠子”技術的效果高度依賴於以下關鍵引數的設定與聯合調優。因各廠商模型規模與架構設計差異巨大,以下為定性說明與典型參考範圍,無工業統一標準。

  • Top-K 值(K):每個 Token 啟用的專家數量,通常取 1 或 2。K=1 時計算量最小,路由策略的“籠子”設計對模型質量影響最大;K=2 時專家組合更靈活,但對負載均衡的約束要求更高。

  • 專家總數(E):模型的總專家數。規模可從 8(如 Mixtral 8×7B)到數千不等。E 越大,維持負載均衡與專家專用化的難度指數級上升,對“籠子”的依賴越深。

  • 容量因子(Capacity Factor, CF):定義每個專家單步最大處理 Token 數的緩衝區倍數。公式為:每專家容量 = (總 Token 數 / E) × K × CF。CF > 1.0 時提供餘量,降低 Token 丟棄率;CF 過低會觸發硬性溢位,過高則浪費計算與視訊記憶體。工業實踐中,CF 常設於 1.0–1.25 區間(資訊來源:[GShard 論文公開引數;行業公開工程實踐綜合])。

  • 負載均衡損失權重(λ):總損失函式中負載均衡損失項的係數,屬於軟性約束。λ 過大將干擾主任務損失最佳化,過小則約束失效。典型值常為極小量級(如 0.01),需根據專家數 E 與批次大小聯合搜尋。

  • 路由熵正則化係數:部分“籠子”實現中,會直接對路由器輸出分佈的熵施加正則化,鼓勵或限制其“專注度”。該項係數決定了約束強度。

  • 專家分組數(G):部分架構將專家劃分為若干組,Token 先在組間路由選擇一組,再在組內選擇具體專家,形成層級化“籠子”。分組數 G 直接決定路由的層級結構與計算模式。

注意:上述引數為面向訓練與推論成本最佳化的關鍵“旋鈕”,具體數值屬模型架構的核心調優成果,多數頭部廠商未完整公開,公開資料中未見全量揭露。

5 技術路線

“籠子”並非單一技術路徑,而是在 MoE 演進中分化為多條路線的約束方案體系。

路線一:損失函式驅動路線(Soft Constraint) 通過給訓練損失顯式增加輔助損失項,間接引導路由器的行為。代表方法包括:

  • 負載均衡損失(Load Balancing Loss):懲罰專家負載不均衡,最早見於 Sparsely-Gated MoE。
  • 路由器 Z-Loss:對路由器輸出的 logits 施加正則,防止數值溢位並提升訓練穩定性。
  • 熵正則化:直接控制路由機率分佈的熵值,鼓勵或抑制路由集中度。 此路線實現成本低,但約束效果存在滯後性,對極端路由坍塌的防範能力有限。

路線二:架構性硬約束路線(Hard Constraint) 直接在模型架構層面嵌入約束機制,由結構保證行為邊界。代表方法包括:

  • 容量因子與 Token 丟棄(GShard, 2020):硬性規定每個專家的處理上限,超出容量則丟棄 Token,通過輔助損失補償。
  • 專家分組與層級路由(DeepSpeed-MoE, Mixtral 部分實踐):將專家分組,先組間再組內路由,縮小單步決策空間。
  • 確定性雜湊路由(Hash Layers, 2021):基於 Token 的雜湊值直接將 Token 分配至固定專家,完全剔除可學習路由,屬於極端“籠子”形態。 此路線控制力強,訓練穩定性高,但可能損失模型靈活性與最終效能上限。

路線三:動態自適應路線(Adaptive Constraint) 在訓練過程中動態調整約束強度或策略,實現從“放任”到“收緊”的平滑過渡。代表方法包括:

  • 退火式負載均衡:訓練初期允許較自由的負載分佈,隨訓練程序逐步收緊約束。
  • 基於強化學習的路由排程:將路由決策建模為序列決策問題,通過反饋訊號動態調整排程策略。
  • 專家容量線上估計與重分配:即時監測專家負載,線上調整容量因子或專家親和度分組。 此路線靈活性最高,工程複雜度也最高,當前較多見於頭部 AI 實驗室的前沿研究階段。

路線對比總覽

維度損失函式驅動架構硬約束動態自適應
控制力度弱,間接引導強,剛性邊界可調,彈性邊界
實現複雜度
訓練穩定性貢獻理論上最高
對模型效能的潛在影響權衡困難可能限制湧現上限目標是在不損傷效能下的穩定
工業成熟度主流,廣泛應用成熟,工程標配前沿探索,部分工業試用
代表形態負載均衡損失,Z-Loss容量因子,專家分組退火排程,RL排程

未來演進趨勢:三條路線正走向融合。工業級方案普遍採用“軟硬結合”策略,即以架構硬約束為基礎保證下限,疊加軟性損失項進行微調,並在訓練不同階段動態調整約束強度。未來可能會進一步與 MoE 模型的自動化設計(Auto-MoE)結合,由演算法自動搜尋最優“籠子”形態與引數組合。

6 上游

“籠子”技術的研發與實施,高度依賴以下上游技術與元件生態的成熟度。

  • 基礎模型架構:基於 Transformer 的稀疏啟用架構設計,包括但不限於 Decoder-only、Encoder-Decoder 等範式。路由機制的設計空間直接受模型宏觀架構約束。

  • 大規模分散式訓練架構:支援專家並行(Expert Parallelism)、資料並行、張量並行、流水線並行多維混合並行的訓練架構。代表包括 Google 的 Pathways/PAX、Microsoft 的 DeepSpeed-MoE、NVIDIA 的 Megatron-LM 及 Megablocks 等。架構需要原生支援動態路由、容量管理、All-to-All 通訊運算元及 Token 丟棄後的梯度處理。

  • 高效能通訊庫:MoE 模型天然產生大量 All-to-All 集合通訊操作。“籠子”技術中的容量控制和負載均衡直接影響通訊模式。上游依賴 NCCL/RCCL 等 GPU 通訊庫、以及 InfiniBand/RoCE 等網路協議的通訊頻寬與延遲最佳化。

  • 硬體平台:高頻寬視訊記憶體(HBM)的大容量 GPU/加速器(如 NVIDIA A100/H100/B200 系列、AMD MI300X、Google TPUv5p 等),以及高頻寬低延遲的節點間互連(如 NVLink、NVSwitch、InfiniBand NDR/XDR)。硬體決定了容量因子的經濟設定區間。

  • 編譯器與運算元最佳化棧:針對動態稀疏計算圖進行運算元融合與執行排程的 AI 編譯器(如 XLA、TensorRT-LLM、Triton)。高效的稀疏計算 kernel 是實現硬性容量約束(如 Token 丟棄與重排)落地的關鍵使能技術。

7 下游

“籠子”賦能的直接產出是更穩定、更高效、更經濟的 MoE 模型,其下游應用領域覆蓋當前生成式 AI 產業的主要高價值場景。

  • 大語言模型服務(LLM API):訓練和部署數千億至萬億引數的高效語言模型,以更低成本提供商用 API 服務,直接改善按 Token 計價的單位經濟模型。代表:ChatGPT、Gemini API、Mistral Large 背後的推論基礎設施方案。

  • 多模態基礎模型:建置跨文本、影像、影片、音訊的統一混合專家基礎模型,使不同模態可共享部分專家並各自保留模態專用專家,通過“籠子”保證跨模態路由均衡。

  • AI 基礎設施與雲端服務:降低雲端廠商和 AI 平台公司提供大型模型訓練及推論服務的邊際成本。採用最佳化的路由約束方案可顯著提升 GPU 叢集的有效利用率,降低單次訓練任務的故障恢復時間。

  • 垂直領域模型定製:在金融分析、藥物研發、程式碼生成、材料科學等領域,MoE 架構的自然分工潛力與“籠子”引導的專用化能力結合,有助於以更低資料量和算力訓練出高效能的領域專家模型。

  • 端側部署:MoE 模型配合“籠子”約束,可設計出條件計算路徑高度可預測的稀疏模型變體,有利於模型量化、剪枝及端側推論部署,降低終端延遲與能耗。

8 受益公司

本部分列示因 MoE 路由約束技術成熟度整體提升而在產業鏈中受益的上市公司型別,不構成任何投資建議,僅供產業格局判斷參考。

雲端運算與 AI 平台廠商

  • Microsoft (MSFT):Azure AI 平台承載 OpenAI 模型服務,其 DeepSpeed-MoE 架構是 MoE 訓練最佳化的重要工具棧。公司在超大型模型訓練效率上的持續投入,直接受益於“籠子”類技術的進步。
  • Alphabet (GOOGL):Google 是 MoE 架構路由研究的核心推動者之一(GShard、Switch Transformer、Pathways),旗下 Gemini 系列模型及 Google Cloud 的 Vertex AI 平台高度相關。
  • Amazon (AMZN):AWS 通過 Bedrock 和 SageMaker 提供大型模型服務,自研 Trainium/Inferentia 晶片和 Neuron 編譯器棧的最佳化,與 MoE 稀疏計算的效率改進直接掛鉤。

AI 晶片與算力廠商

  • NVIDIA (NVDA):GPU 是 MoE 訓練與推論的絕對主力平台。Hopper (H100/H200) 及 Blackwell (B200) 架構引入對 FP8、Transformer Engine 及稀疏計算的原生最佳化,直接使硬性容量控制等“籠子”策略受益。NVLink 與 InfiniBand 生態是 MoE 通訊約束的關鍵承載。
  • AMD (AMD):Instinct MI300X 系列加速器進入大型模型訓練推論市場,ROCm 生態對 MoE 稀疏運算元和通訊庫的最佳化進展,決定了其能否受益於該趨勢。
  • Broadcom (AVGO) / Marvell (MRVL):為雲端運算廠商定製 AI ASIC 晶片,包括針對稀疏通訊模式的網路晶片和定製加速器,承接 MoE 基礎設施的部分硬體需求。

AI 模型及應用公司

  • Meta Platforms (META):開源 MoE 路由相關研究與工程成果(如與 Mixtral 有關的研究思路討論,以及自身模型訓練中的實踐),其 LLAMA 等模型的未來超大版本可能涉及 MoE 架構。
  • Mistral AI(非上市公司,2024 年 6 月融資估值約 €6B,來源:公司官方公告):Mixtral 8×7B/8×22B 是當前 MoE 工程化最成熟的開源代表之一,其路由策略設計屬“籠子”思想的有力實踐。
  • 國內廠商(百度/阿里/位元組/DeepSeek 等):據公開技術報告與社群資訊,多家中國頭部科技公司已在 MoE 模型訓練中大量採用負載均衡約束與容量管理策略,屬於此方向的直接參與者。

9 市場規模

需明確提示:目前沒有以“籠子”為獨立產品或服務的可統計市場。它是 MoE 模型訓練與推論效率最佳化的一個方法與工程實踐層。相關的市場規模可通過以下幾個間接維度進行感知:

一、MoE 模型訓練與推論的算力市場

  • 根據 NVIDIA FY2025 資料中心業務展望及多家雲端廠商資本支出計劃綜合推算(來源:[NVIDIA 營收資料、Microsoft/Meta/Amazon 財報資本支出展望,2024–2025 年]),全球 AI 訓練與推論算力市場在 2025 年可能達到 3000–5000 億美元量級。其中,萬億引數級稀疏模型佔算力總消耗的比例正快速提升,公開資料未見精確細分佔比。
  • 路由約束技術每將 MoE 訓練效率提升 1 個百分點,對應數千萬至上億美元級別的算力成本節約。這是“籠子”技術經濟價值的隱式體現。

二、大型模型 API 與模型即服務(MaaS)市場

  • 據多家市場機構(如 Grand View Research、MarketsandMarkets,2024 年報告)預測,全球大型模型 API 與 MaaS 市場在 2027–2030 年可能達到 500–1500 億美元規模。MoE 架構因其在推論成本上的天然優勢,被普遍視為該市場的主流技術路線之一。高效的路由約束直接幫助 API 提供商最佳化獲利率。

三、AI 訓練與推論最佳化軟體棧市場

  • 圍繞 MoE 分散式訓練、編譯器最佳化、容錯管理等工具鏈市場正在形成(包含開源生態與商業授權)。公開資料未見該細分市場的獨立第三方規模資料,但可作為“AI 基礎設施軟體”市場的子集追蹤。

總結:“籠子”類技術本身不構成獨立市場,但其對成本的改善幅度,與萬億級算力市場及千億級 API 市場的效率槓桿直接相乘,是評估其產業影響力的關鍵邏輯。

10 玩家對比

本節對比在 MoE 路由約束與稀疏訓練工程實踐方面具有顯著公開成果的主要公司或團隊,側重於技術路線、約束策略及公開性的比較。

玩家 / 代表性工作路由約束型別核心技術特徵開源程度典型規模主要部署硬體生態資訊來源
Google (GShard / Switch Transformer)硬性容量約束 + 輔助損失提出容量因子與Token丟棄,Switch層簡化路由部分開源(演算法)萬億引數(Switch-C)TPU 叢集Fedus et al., 2022
Google (Pathways / Gemini)軟硬結合,細節未公開基於Pathways系統的多維並行與動態排程未開源Gemini Ultra 規模未完全公開TPUv4/v5 叢集Google 官方技術部落格
Mistral AI (Mixtral 8×7B/8×22B)專家分組 + 負載均衡8位專家,每Token路由Top-2;公開權重,訓練細節較少揭露模型權重開源,Apache 2.046.7B總參,啟用約12.9BGPU 通用叢集Mistral AI 技術部落格(2024)
Meta (NLLB MoE / 內部工作)有公開研究,工業策略未完整公開NLLB 翻譯模型大規模使用 MoE,含路由正則化部分開源(模型/程式碼)數千億引數量級GPU 叢集NLLB 論文 (2022)
Microsoft (DeepSpeed-MoE)專家分組 + 層級路由 + 負載均衡金字塔型專家分組,Residual Random路由,訓練架構級約束訓練架構開源 (DeepSpeed)支援萬億引數訓練GPU 叢集 (配合 Azure)DeepSpeed 官方文件 (2023-2024)
DeepSeek (DeepSeek-V2/V3)細粒度專家 + 共享專家 + 負載均衡大量極細粒度專家(DeepSeek-V3 有 256 個路由專家+1共享專家),Top-8 路由,輔助損失 + 裝置級均衡模型權重開源,技術報告詳細671B總參,啟用37BGPU 叢集DeepSeek-V3 技術報告 (2024)
Snowflake (Arctic)稠密+MoE混合架構結合 Dense Transformer 與 MoE 層,特定的路由容量策略模型權重開源,Apache 2.0480B總參,啟用約17BGPU 叢集Snowflake 技術部落格 (2024)

競爭邏輯摘要: 當前呈現三種策略分化:(1)全棧封閉派(Google):軟硬一體,演算法與TPU深度繫結,約束策略高度機密;(2)權重開源派(Mistral、DeepSeek、Snowflake):以模型權重和推論程式碼開源建立生態,訓練細節部分保留,路由約束成為隱性護城河;(3)架構開源派(Microsoft):通過訓練架構(DeepSpeed)普及自身方法論,吸引使用者進入其雲端生態。未來“籠子”技術的護城河可能從演算法本身轉向演算法-編譯器-硬體的聯合最佳化能力。

11 風險

技術迭代風險 MoE 架構與路由約束技術均處於快速演進期。未來可能出現顛覆性的新架構(如完全不同的稀疏計算範式、可微分動態網路、液態神經網路等),使得當前一代基於 Transformer 的“籠子”技術體系被整體繞開。另外,更精簡的密集模型(Dense Model)在某些規模基準上的效能突破,也可能削弱 MoE 路線的緊迫性。

演算法失效風險 “籠子”技術中的容錯性假設,在極端規模(數萬專家、跨洲際叢集)下可能被打破。如果約束強度與模型最終效能之間的關係是非單調的,將出現“過度約束”與“約束不足”之間的極窄可行域,導致超參搜尋成本劇增,甚至無法找到有效配置。公開研究中對這一問題的分析尚不充分。

系統性衝擊風險 “籠子”的有效執行,深層依賴硬體層面的高頻寬互連和低延遲特性。如果未來針對稀疏通訊的硬體最佳化方向發生改變(例如,向近存計算/存內計算範式遷移),當前軟硬協同設計的“籠子”策略可能需要重新建置。

成本結構風險 實施複雜的動態約束策略,本身會引入可觀的計算與通訊開銷(例如,即時負載監控、線上專家容量再分配)。在中小規模模型或推論為主的場景中,這些額外開銷可能抵消約束帶來的收益,使得技術的適用經濟邊界收縮。

合規與透明度風險 部分高度動態的自適應“籠子”策略,使得模型的路由決策可解釋性進一步降低。在金融監管、醫療、司法等要求決策可審計的領域,這可能帶來額外的合規成本與採用阻力。

12 誤讀糾偏

誤讀一:“籠子”就是 MoE 裡的負載均衡損失(Load Balancing Loss)。 糾偏:負載均衡損失只是“籠子”工具箱裡的一種軟性間接工具,通過損失函式懲罰不均衡來事後引導。“籠子”是一個更系統的概念,還包括硬性架構約束(如容量因子與 Token 丟棄、專家分組)、資料流確定性保障(如雜湊路由)以及在訓練過程中動態調整的排程策略。將二者等同,是嚴重窄化了這一工程體系的內涵。

誤讀二:應用“籠子”技術會限制模型的最終效能上限,是一種無奈妥協。 糾偏:這是最大的認知偏差之一。無約束的自由路由在實際訓練中往往無法收斂到最優解,導致嚴重的專家利用不充分和訓練目標震盪。設計良好的“籠子”通過提供有益的歸納偏置(鼓勵專家分工專用化、平滑訓練動力學),往往能引導模型超越同等算力下無約束自由路由模型的最終效能,同步實現更低訓練成本。這類似於城市規劃中的分割槽與路網規則,看似限制,實則系統性提升全域性執行效率。

誤讀三:“籠子”是一種固定的技術方案,一旦設計好就可以一勞永逸。 糾偏:前沿實踐指向相反方向。最優約束的強度與形態往往需要在訓練的不同階段動態變化(例如,前期寬鬆鼓勵探索,後期收緊確保穩定),且與模型規模、資料分佈等強相關。因此工業級“籠子”是一套可自適應調節的排程系統,而非常數設定。

誤讀四:開源模型(如 Mixtral)中看到的負載均衡就是“籠子”的全部。 糾偏:開源模型通常只展示基本的軟性約束或簡單的硬性分組,完整的工業級“籠子”方案(包含動態排程、故障恢復、硬體拓撲感知的路由等)是頭部 AI 公司的核心工程機密,極少出現在公開開原始碼中。開源展示的是“基礎版駕駛輔助”,而非完整的“智慧交通管控體系”。

13 最新事件

2024 年 12 月 – 2025 年 2 月

  • DeepSeek-V3 釋出(2024.12.25):DeepSeek 釋出 671B 總引數的 MoE 模型 DeepSeek-V3,技術報告詳細揭露了其路由約束策略:採用 1 個共享專家 + 256 個路由專家的細粒度架構,每個 Token 啟用 8 個專家(Top-8),並實行嚴格的“輔助損失(auxiliary-loss-free)負載均衡策略 + 序列級別輔助損失 + 裝置級均衡”三層約束體系。這成為自 Mixtral 以來,對工業級“籠子”策略的又一次重大公開揭露。資訊來源:[DeepSeek-V3 Technical Report, 2024.12]。

  • MoE 推論效率成為產業焦點(2025.01–02):多家 AI 推論服務提供商推出基於 MoE 架構的推論最佳化方案,顯著降低高階 API 定價。如 DeepSeek 的推論定價顯著低於同儕、Google Gemini 系列推出多層級 MoE 推論配置。提升 MoE 推論吞吐的關鍵在於對路由模式進行離線最佳化與預編譯,這被視作“籠子”思想從訓練向推論延伸的標誌。

  • 硬體廠商加強稀疏計算支援(2024.12–2025.01):NVIDIA 在 CUDA 工具包的更新中加強了對塊稀疏矩陣(Block-Sparse)及動態路由 kernel 的最佳化支援;AMD 在 ROCm 6.2 版本中改進了對 MoE All-to-All 通訊運算元的支援。硬體層面對稀疏約束計算的最佳化,正在降低實現高階“籠子”策略的工程門檻。

14 追蹤指標

學術界觸達

  • 頂級會議論文關鍵詞:追蹤 NeurIPS/ICML/ICLR 中“Mixture-of-Experts”、“Load Balancing”、“Sparse Training”、“Conditional Computation”等關鍵詞的新發論文與 workshop。
  • arXiv 熱門提交:關注 cs.LG、cs.AI 分類下 MoE 架構與訓練穩定性的高引用新作。

工業界訊號

  • 頭部公司技術部落格與報告:Google Research、Meta AI、Microsoft DeepSpeed、Mistral AI、DeepSeek 等釋出的技術部落格與模型技術報告,關注其對“Training Stability”、“Routing Strategy”、“Expert Utilization”等章節的新措辭與新方法。
  • 大型模型 API 定價調整:頭部廠商 API 定價的顯著下調,一定程度上反映推論效率的進步,間接與 MoE 路由約束及編譯最佳化進步相關。

架構與工具鏈

  • DeepSpeed / Megatron-LM / Megablocks 等的原始碼更新日誌:關注與“capacity”、“load balance”、“auxiliary loss”、“expert parallelism”等相關的 commit。
  • AI 編譯器生態對稀疏運算元的支援:XLA、TensorRT-LLM、Triton 等對 MoE 相關運算元的覆蓋程度與效能資料。

硬體層

  • 新一代 GPU/TPU 的互聯頻寬和視訊記憶體容量引數:直接影響容量因子設定的可行區間與收益比。
  • MLPerf 大型模型訓練與推論排行榜中 MoE 架構的佔比與效能提升斜率:側面反映工程約束效率的整體進步速度。

15 信源

以下按論文/官方技術報告/行業資訊進行分類,僅收錄公開或可查證來源,覆蓋面力求支撐本文核心論點。本目錄不構成任何投資建議,僅供參考學習。

一、核心奠基論文

  • Shazeer, N., et al. “Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer.” ICLR, 2017.
  • Fedus, W., Zoph, B., & Shazeer, N. “Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity.” JMLR, 2022.
  • Lepikhin, D., et al. “GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding.” ICLR, 2021.

二、系統與工程論文

  • Gale, T., et al. “MegaBlocks: Efficient Sparse Training with Mixture-of-Experts.” NeurIPS, 2022.
  • Lewis, M., et al. “BASE Layers: Simplifying Training of Large, Sparse Models.” ICML, 2021.
  • Roller, S., et al. “Hash Layers For Large Sparse Models.” NeurIPS, 2021.

三、工業界開源與技術報告

  • Jiang, A. Q., et al. “Mixtral of Experts.” Mistral AI 技術部落格, 2024.
  • DeepSeek-AI. “DeepSeek-V3 Technical Report.” arXiv (2024.12).
  • Snowflake AI Research. “Snowflake Arctic: The Best Enterprise LLM — Efficiently Intelligent, Truly Open.” Snowflake 技術部落格, 2024.
  • Microsoft DeepSpeed 團隊. “DeepSpeed-MoE: Advancing Mixture-of-Experts Inference and Training to Power Next-Generation AI Scale.” Microsoft Research 技術部落格, 2022–2024 持續更新.

四、行業規模與市場參考

  • 全球大型模型 API/MaaS 市場預測:Grand View Research、MarketsandMarkets(2024 年報告摘要,具體資料口徑請查閱原報告)。
  • 算力市場規模參照:NVIDIA Corporation FY2025 季度財務報告;Microsoft、Meta、Amazon 等廠商 FY2024/2025 資本支出展望(資訊來源:[公司官方財報及電話會記錄])。

五、其他公開來源

  • 中國頭部 AI 公司技術報告與社群技術分享(如 DeepSeek、阿里通義、字節跳動等釋出的公開論文與部落格)。
  • MLPerf 訓練與推論基準測試公開結果(MLCommons 官方網站)。
  • AI 編譯器與架構原始碼倉庫:PyTorch、TensorFlow XLA、Triton、Megablocks、DeepSpeed 等 GitHub 倉庫的 Issues 及 Pull Requests 討論。

本檔案內容基於公開資訊與行業研究綜合撰寫,截至 2025 年 2 月。所述技術方案與公司實踐可能有未公開的最新進展。文中所有財務、規模及產能數字均標註了資訊來源與口徑,無法獲取的以“公開資料未見”註明,不存在主觀編造。

source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型