概念庫 開放閱讀

專家並行負載傾斜

概念庫 · 開放閱讀

概念 ID
expert-imbalance
更新時間
2026-06-03
來源數量
1

專家並行負載傾斜

1. 3秒看懂

一種用於超大Mixture-of-Experts(MoE)模型的系統級最佳化技術,通過動態感知不同“專家”子網路的計算負載,將不均等的任務量傾斜分配到不同GPU節點,使全系統在計算時間上趨於均衡,而非傳統意義上的任務量均分。它銜接演算法設計鏈與雲端運算基礎設施,直接決定萬億引數模型的訓練/推論成本和硬體利用率。

2. 3分鐘產業解釋

  • 問題根源:MoE模型由數十甚至上百個“專家”組成,但每個輸入Token僅啟用其中Top-2或Top-3個專家。在千卡/萬卡叢集中,啟用分佈天然高度不均,20%的熱門專家可能承擔80%的請求,而多數冷門專家處於飢餓狀態,造成計算單元大量空轉和通訊擁塞。
  • 核心思想:放棄讓每個專家處理相同數量Token的“負載均衡”思路,轉而追求計算時間均衡——讓所有專家的執行耗時趨近。通過預判或即時感知負載,將熱門專家複製到更多、更近的GPU,同時將冷門專家集中或遷移,以非對稱資源匹配非對稱流量。
  • 實現機制:依賴一個輕量化的動態門控網路(Gating Network)生成Token-專家匹配分數,排程器根據各專家佇列長度、計算耗時、通訊距離等指標,即時觸發專家副本動態增減、視訊記憶體狀態遷移或路由重定向,並由分散式排程系統將Token流與GPU物理資源動態最佳適配。
  • 產業定位:位於AI軟體棧的頂層,向下與高速網際網路絡、異構計算晶片和分散式儲存深度繫結;向上直接支撐所有基於MoE架構的大型模型訓練與推論服務,是衡量雲端廠商大規模AI服務競爭力的核心標尺之一。

3. 技術原理

3.1 負載傾斜的數學模型

設MoE模型共有E個專家,對輸入批次中的Token i,門控網路輸出Softmax分數g_i^e,根據Top-K選出得分最高的K個專家。負載傾斜的目標為最小化各專家有效計算時間的差距,即:

\min \; mathrm(Var)(T_e),\quad T_e = f(\sum_{i \in text( routed to ) e} c_i,\; text( ReplicaCount)_e, \; text(Bandwidth)_e)

其中c_i為Token i帶來的計算量,副本數和所在節點頻寬為排程變數。

3.2 門控與路由策略

門控網路通常為單層全連線層,與主模型聯合訓練。基礎路由採用Top-K選擇,先進的負載傾斜引入輔助負載均衡損失(如Switch Transformer的L_{text(aux)}),鼓勵專家利用率方差最小化。更進一步,排程器將物理拓撲資訊(節點剩餘算力、互聯頻寬、功耗限制)注入路由決策,形成通訊感知路由:一個Token在數微秒內被動態導向不僅分數高且物理可達的專家副本。

3.3 排程與副本管理

系統維護全域性負載地圖,通過監控核心執行時間、通訊佇列深度等即時指標,當某專家副本佇列超過閾值(如>50ms處理延遲)時,觸發三種動作:

  • 副本彈性擴充套件:在相鄰GPU或同NVLink域的節點上動態建立專家副本,並廣播更新路由表。
  • 專家狀態遷移:將冷門專家的引數和最佳化器狀態合併到熱節點,釋放計算單元。
  • 流水線打散:將Token分割為微批次,沿不同傳輸路徑非同步派發,利用通訊與計算的重疊隱藏傾斜帶來的延遲。

3.4 與經典負載均衡的根本區別

經典資料並行中的AllReduce追求各卡等量的樣本數;MoE的負載傾斜承認並接納不平衡為常態。它不再試圖消除輸入的不均勻,而是構造一個異構但互補的執行環境,使不同節點承擔的計算量可以差異顯著,但完成時間趨同。這使其更偏向非同步、事件驅動的架構。

4. 關鍵引數

引數定義典型範圍/取值(公開資料整理)
專家容量因子(Capacity Factor)每位專家處理的Token上限相對於均勻分配的倍數1.0–1.5(訓練);可提升至2.0以容納傾斜(來源:Google Switch Transformer論文, 2021)
負載均衡損失權重(\alpha輔助損失係數,防止專家飢餓或過載0.01–0.1,需與主損失聯合最佳化(來源:GShard, 2020)
專家副本數同一專家在叢集中部署的副本數量動態時可達2–8個,受限於視訊記憶體與通訊開銷
Token批次大小每次排程中門控網路處理的Token數叢集規模擴大時推薦>=4096以保證傾斜決策統計意義
物理拓撲維度節點間網路頻寬與延遲,NVLink域頻寬例如節點內NVLink 4.0雙向900 GB/s,跨節點InfiniBand NDR 400 Gb/s(來源:NVIDIA H100白皮書, 2022)
排程延遲閾值觸發副本遷移/路由切換的佇列延遲上限推論場景常設為10 ms,訓練場景視步長時間而定

(注:以上引數的具體最佳取值與模型規模、硬體配置高度相關,公開資料未見統一標準。)

5. 技術路線

5.1 基於輔助損失的靜態均衡(Google路線)

Google的GShard和Switch Transformer開創了通過輔助損失強行拉平專家利用率的方式,在訓練階段約束路由分佈。其實現與TPU的ICI互聯配合,利用靜態容量因子限制過載。優點是演算法簡單、不依賴即時排程,缺點是難以適應訓練過程中資料分佈的漂移,且容量因子固定可能導致Token丟棄。

5.2 系統級動態排程(Microsoft DeepSpeed路線)

微軟DeepSpeed-MoE提供了專家並行分層All-to-All通訊原語,並在其ZeRO-Infinity等架構中引入動態專家放置策略。它根據節點的儲存和計算能力,將熱門專家安置在高速NVMe快取與GPU視訊記憶體之間,結合彈性副本調整,實現訓練時負載的連續適應。2023年後,DeepSpeed進一步提出混合路由策略,融合通訊感知排程(來源:微軟DeepSpeed專案公開文件及論文)。

5.3 軟硬協同路線(NVIDIA與華為昇騰)

NVIDIA依託NVLink Switch和GPU間的直接記憶體訪問,支援專家引數的極速副本廣播,其Megatron-Core架構針對MoE實現了張量並行與專家並行的混合最佳化,能夠在數百個GPU間以微秒級同步路由表。華為昇騰的CANN異構計算架構與MindSpore架構在2023–2024年間強化了基於整圖代價模型的自動並行,將負載傾斜作為預設最佳化目標之一,利用器叢集引數的模擬優解實現負載感知分配(來源:華為MindSpore社群技術部落格)。

5.4 異構專家硬體路線(新興方向)

部分研究(如清華大學的“Expert on Device”)提出將冷門專家部署到低成本、低功耗的邊緣NPU或CPU,熱門專家留在高算力GPU。負載傾斜排程因此擴充套件為跨器件型別的協同機制,目前仍處於學術驗證階段。

6. 上游

6.1 高算力GPU/NPU

NVIDIA H100、B200等提供高頻寬記憶體和FP8浮點能力,是負載傾斜策略得以實施的直接算力底座。AMD MI300X憑藉統一記憶體架構和較大HBM容量,也可承載專家副本擴充套件。國產晶片如華為昇騰910B、寒武紀思元590等,逐步提升的互聯頻寬和算力,使其成為國內大型模型負載傾斜適配的關鍵上游。公開資料顯示,2024年上半年昇騰910B已在部分萬卡叢集中規模部署(來源:華為年度報告及產業研究報告)。

6.2 高速網際網路絡

節點間All-to-All通訊是負載傾斜的最大瓶頸。上游硬體包括InfiniBand NDR(400 Gb/s)、RoCE v2以及NVLink Switch。NVIDIA在2024年釋出的第五代NVLink將單GPU雙向頻寬提升至1.8 TB/s,並支援576 GPU全互聯,大大降低了專家副本同步延遲(來源:NVIDIA 2024 GTC keynote)。華為超融合資料中心網路CloudEngine也提供800GE介面,面向MoE訓練場景最佳化擁塞控制(來源:華為2023全聯接大會)。

6.3 異構計算管理軟體

包括NVIDIA Magnum IO、HPC-X通訊庫、華為CANN和SDK。這些軟體棧將負載傾斜策略對映到硬體原語,是連線硬體與MoE架構的中介軟體。

7. 下游

7.1 大型模型研發機構

OpenAI(GPT-4據信為MoE架構)、Google(Gemini 1.5 Pro使用MoE)、Meta(LLaMA-MoE探索)、Anthropic、Mistral AI等國際廠商,以及國內百度文心、阿里Qwen、訊飛星火等模型開發商,均是負載傾斜技術的直接應用方。它們要求架構提供穩定的細粒度排程,以在數千GPU上實現接近線性的加速比。

7.2 雲端運算與AI Platform

Azure AI Infrastructure結合DeepSpeed-MoE為客戶提供自適應的專家並行訓練服務;AWS Trainium/Inferentia的Neuron SDK內嵌MoE負載管理;阿里雲端PAI和百度百舸平台則通過整合自研架構的MoE最佳化,為使用者遮蔽底層傾斜排程細節。這些平台是負載傾斜技術轉化為商業服務的關鍵下游。

7.3 企業級私有化部署

金融、自動駕駛等領域的頭部企業開始嘗試搭建私有MoE叢集,需採購或定製帶負載傾斜排程的AI一體機。這催生了如浪潮資訊、新華三等伺服器廠商推出面向MoE最佳化的整合方案(來源:浪潮資訊2024年合作伙伴峰會)。

8. 受益公司

  • NVIDIA:從GPU、NVLink Switch到Megatron架構的全棧版面配置,使其成為MoE訓練效率提升的直接受益方,高價值產品的需求隨模型規模擴大而增長。
  • Microsoft:通過DeepSpeed在開源MoE訓練生態佔據重要話語權,其Azure雲端服務因可提供SOTA的負載傾斜最佳化而吸引頭部AI客戶。
  • Google:自研TPU及GShard/Switch Transformer技術降低內部大型模型成本,同時通過Google Cloud對外輸出算力與軟體能力。
  • 華為:昇騰晶片和CANN/MindSpore的組合在國產化替代中受益,2023–2024年國內多個政府及運營商大型模型專案部署於昇騰叢集,負載傾斜最佳化已成為其宣傳的關鍵能力之一(來源:華為常務董事公開發言)。
  • 百度/阿里雲端:自研架構與雲端平台互補,滿足國內對高效MoE訓練底座的需求,受惠於國產大型模型投資浪潮。
  • 其他:AMD憑藉MI300X獲得更多MoE推論場景的測試機會;Meta通過開放LLaMA-MoE模型和PyTorch生態強化該技術在大規模開源社群的影響力。

(以上均基於公開資訊分析產業受益關係,非投資建議。)

9. 市場規模

公開資料未見針對“專家並行負載傾斜”這一細分技術的獨立市場規模統計。其商業價值融於以MoE為代表的稀疏大型模型訓練與推論基礎設施市場。以下為相關市場參考資料:

  • 據 Fortune Business Insights 於2024年3月釋出的報告,2023年全球人工智慧基礎設施市場規模約為236.5億美元,預計2024–2032年間複合年增長率(CAGR)超過30%(來源:Fortune Business Insights, “AI Infrastructure Market Report”)。
  • 另據 Grand View Research 資料,2023年全球AI晶片市場規模約為536.5億美元,大型模型訓練需求是主要驅動力。
  • 高速網路市場方面,InfiniBand交換器在2023年全球營收達XXX(公開資料未見精確數字,但NVIDIA網路部門在2024財年營收顯著增長,其中InfiniBand相關營收佔據較大比重)。
  • 在國內,2024上半年用於大規模模型訓練的AI伺服器招標額持續增長,尤其萬卡級專案的網路裝置投入顯著增加,為負載傾斜技術提供了上游需求支撐。

10. 玩家對比

維度GoogleMicrosoft (DeepSpeed)NVIDIA (Megatron)華為 (MindSpore+Ascend)百度 (PaddlePaddle)
核心架構/系統TensorFlow/GShard, Switch TransformerDeepSpeed-MoE + ZeROMegatron-Core MoEMindSpore + CANNPaddlePaddle
負載傾斜實現輔助損失+容量因子,偏靜態動態專家放置+彈性副本+通訊感知路由硬體加速副本複製+拓撲感知All-to-All自動並行代價模型+負載感知重排程動態圖MoE支援,部分負載均衡損失
硬體繫結TPU v4/v5p,ICI互聯硬體無關,與NVIDIA/A100/H100等配合良好深度繫結GPU/NVLink Switch昇騰910B/叢集,CCIX/NVLink替代方案可適配多種GPU,部分適配崑崙芯
已公開訓練規模1.6T引數的Switch Transformer (2048專家)530B MT-NLG(非MoE),多個千億MoE模型未公開細節千億引數MoE模板,典型搭配H100萬卡叢集公開30B/100B級MoE模型,萬卡叢集驗證中千億文心大型模型(MoE變體)
社群/開源部分架構開源完全開源,GitHub活躍Megatron核心開源MindSpore開源,昇騰相關工具鏈有限開源PaddlePaddle完全開源
優劣勢總結演算法原創性強,TPU軟硬一體效率高,但生態封閉架構靈活通用,排程演算法先進,但無自有晶片硬體領先,全棧最優,但價格高昂且鎖定性強國產化生態主導,成本可控,系統最佳化進步快本土生態好,但大規模萬卡水平相較於前兩者有差距

(資訊截止2024年中,基於公開資料整理。)

11. 風險

  • 技術穩定性風險:動態排程在超大規模下可能因策略失誤引發“顛簸”效應,導致專家副本頻繁建立與銷燬,反而增加延遲和能耗。訓練過程中排程器本身的決策開銷若過大,可能抵消負載傾斜帶來的收益。
  • 通訊瓶頸惡化:不均等負載導致瞬時全網全對全突發通訊,要求網路具備極高的微突發吸收能力。在跨資料中心或混合雲端場景,時延抖動可能嚴重破壞系統吞吐。
  • 模型質量憂患:過度依賴歷史負載資料會形成正反饋,熱門專家持續強化而冷門專家得不到充分訓練,可能削弱模型的的泛化與多樣性,尤其不利於需要長尾知識覆蓋的任務。
  • 供應商鎖定成本:最先進的負載傾斜最佳化通常與特定硬體和私有通訊庫深度耦合(如NVIDIA NVLink+CUDA),更換晶片平台意味著重新開發排程演算法,形成巨大遷移門檻。
  • 資訊不透明與可復現性:該技術作為各巨頭的核心競爭力,細節極少公開。學術界和中小企業只能基於有限描述進行探索,導致產業整體進展難以衡量,存在“黑箱最佳化”風險。

12. 誤讀糾偏

  • 誤讀1:負載傾斜就是給熱門專家分配更多資源,冷門專家就不管了。 糾偏:負載傾斜的目標是計算時間均衡。冷門專家雖然請求少,但仍需得到必要的視訊記憶體和算力,排程器通過副本合併或分時複用避免資源浪費,嚴禁將其直接淘汰,以保證模型完整性。
  • 誤讀2:負載傾斜就是傳統的負載均衡。 糾偏:負載均衡要求所有裝置工作負載大致相等(如同等batch size),適合均勻同步模式。而負載傾斜承認MoE流量極度不均的事實,通過異構資源分配達成時間同步,是更高維度的系統排程範式。
  • 誤讀3:負載傾斜只在大規模訓練階段有用。 糾偏:推論場景中,使用者請求高度動態且突發,熱門專家同樣可能瞬間過載。負載傾斜在推論側通過智慧路由和副本預熱,可顯著降低首Token延遲和尾延遲,已在雲端服務中得到應用。
  • 誤讀4:使用MoE模型會自動實現負載傾斜。 糾偏:基礎的MoE路由只負責Token分配,並不感知系統負載。如果不主動引入負載傾斜機制,大量Token可能堆積在特定GPU佇列,導致利用率極低。負載傾斜是必須顯式新增的系統能力。

13. 最新事件

  • 2024年3月,NVIDIA在GTC 2024上推出Blackwell GPU架構,第五代NVLink提供1.8 TB/s雙向頻寬,全新NVLink Switch支援多達576 GPU的全互聯拓撲,官方稱可十倍減少大型MoE模型專家通訊瓶頸,為負載傾斜策略提供前所未有的硬體頻寬(來源:NVIDIA官網)。
  • 2024年5月,Google發表Gemini 1.5 Pro技術報告,揭露該模型採用MoE架構,並引入改進的“專家利用率均衡”輔助損失,在跨Cloud TPU v5p叢集上實現了高資源利用率(來源:arXiv論文, 2024)。
  • 2024年6月,微軟DeepSpeed團隊更新了DeepSpeed-MoE,增加專家副本的即時熱載入功能,併發布在NVIDIA H200叢集上針對多專家負載漂移的測試結果,訓練吞吐提升約18%(來源:微軟開發者部落格)。
  • 2024年上半年,國內華為在相關開發者大會上公佈,通過MindSpore的“自適應專家並行”特性,昇騰叢集在千億MoE模型訓練中實現專家負載自動感知和重對映,晶片利用率提升超過15%(來源:華為公開發布材料)。
  • 2024年北京智源大會上,多支國內團隊分享了在國產加速器上實現MoE專家負載感知的工作,但尚未揭露量產級萬卡及以上實測資料。

14. 追蹤指標

  • 架構版本更新:密切關注DeepSpeed、Megatron-Core、MindSpore、PaddlePaddle關於MoE最佳化的發版說明,特別是新增的專家放置、動態排程介面。
  • 硬體互聯引數:NVLink/Switch頻寬、InfiniBand埠速率、國產加速器的晶片間互聯協議升級等,直接影響負載傾斜的通訊效率。
  • 雲端平台MoE功能上線:Azure、阿里雲端PAI、華為雲端ModelArts等釋出的MoE訓練/推論最佳化服務及宣稱的加速比。
  • 頂會論文及技術報告:NeurIPS、MLSys、OSDI等會議中關於負載感知路由、異構專家分配的文章,以及主流大型模型技術報告中是否提及專家利用率、負載係數等關鍵指標。
  • 公開驗證規模:行業權威MLPerf等基準測試中,針對MoE模型的上報規模與效率對比;以及企業財報中提及的萬卡叢集部署進度。
  • 政策性指標:國家“東數西算”樞紐內用於大規模訓練的新建算力中心設計是否專門考慮了MoE負載傾斜的網路拓撲,可反映基礎設施層的採納程度。

15. 信源

  • Lepikhin, D., et al. (2020). GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding. ICLR 2021.
  • Fedus, W., et al. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. JMLR.
  • Microsoft DeepSpeed. (2023–2024). DeepSpeed-MoE documentation and GitHub releases. https://github.com/microsoft/DeepSpeed
  • NVIDIA. (2024). NVIDIA Blackwell Architecture Overview. https://nvidianews.nvidia.com/
  • Google DeepMind. (2024). Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context. arXiv.
  • Huawei MindSpore Team. (2024). MindSpore MoE Distributed Training User Guide. https://www.mindspore.cn/
  • Fortune Business Insights. (2024, March). Artificial Intelligence (AI) Infrastructure Market Report.
  • Grand View Research. (2024). AI Chips Market Size, Share & Trends Report.
  • 華為常務董事公開發言. (2023–2024). 華為全聯接大會、鯤鵬昇騰開發者大會公開資料。
  • 北京智源大會、各廠商雲端棲大會、GTC、I/O等公開技術分享與講座。 (以上信源均基於公開資料彙總,資料截止2024年中。部分數字為基於市場報告的概括描述,未直接引用的具體數字已作說明。)
source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型