模型路由
3秒看懂
模型路由是決定“由哪個模型/模組處理當前輸入”的智慧分發機制。它既存在於單一模型內部(混合專家模型MoE中,路由器將每個詞元分配到最合適的“專家”子網路),也貫穿於多模型服務系統(根據請求的難度、型別或成本,將其導向不同規格或不同領域的模型)。其核心目標是以更低的計算成本換來更大的模型容量或更好的服務質量。
3分鐘產業解釋
想像一個巨型圖書館:前臺會根據讀者的問題,自動將其引導到文學、科技或法律分館,而不是讓讀者在整棟樓裡亂找。模型路由就是AI世界裡的這位“前臺”——它快速閱讀你的輸入(一段文本、一張圖或一個任務描述),即時判斷該由龐大型模型中的哪幾個“專家”來處理,或在部署的眾多微調模型中選擇最合適的一個。
這一概念在產業中分為兩條並行的主線:
- 模型內部路由(MoE路由):大語言模型(如Mistral的Mixtral、Databricks的DBRX,以及據傳的GPT-4)內部不再是密不透風的單一網路,而是包含數十甚至數百個小“專家”網路。每次計算只啟用其中極小一部分,總引數量可達數萬億,但實際啟用引數只有數百億,極大節約了訓練和推論的算力。
- 模型服務路由(請求路由):當企業同時部署一個超大通用模型、一個擅長數學的模型、幾個專用於文本摘要或情感的輕量模型時,一個智慧路由器作為入口,根據查詢意圖和難度,自動選擇價效比最高的模型來處理,甚至可以在多個模型間級聯或投票,平衡延遲、成本和準確性。
產業界正快速擁抱這兩種路由技術:前者是攀登模型能力高峰的階梯,後者是讓大型模型落地的精算師。它們共同改寫了“大型模型越強越貴”的舊劇本。
15分鐘專家深入
概念的雙層核心
模型路由在技術上指代兩個截然不同卻可組合使用的機制:
A. 模型內路由:稀疏混合專家(MoE)的門控網路
在Transformer架構中,傳統的前饋網路(FFN)層被替換為一個專家集合 {E_1, E_2, ..., E_N} 和一個門控路由網路 G。對於輸入的每個詞元(token)表示 x,路由器計算選擇機率並激活最相關的Top-k個專家:
y = sum_{i=1}^{N} (G(x)_i * E_i(x)),其中 G(x)_i 不為0僅當i屬於Top-k
這門“路由”完全是離散的、動態的,每一個詞元、每一層都重新決策,實現了條件計算(conditional computation)。
B. 模型間路由:多模型請求排程器 在AI服務平台(如模型即服務MaaS)中,同一個API端點背後可能連線著不同尺寸的通用LLM、垂直領域精調模型、量化版本甚至快取。一個路由器(通常是一個小型快速的語言模型或嵌入匹配器)分析提示詞,並依據規則、成本預算或強化學習策略,將請求轉發到最合適的執行器。這可以是1:1的確定路由,也可以是多個模型競標結果(如獎勵模型打分),最終返回最佳答案。
為什麼需要路由?
稠密模型的引數量與計算量呈嚴格線性關係——要獲得更強能力,必須同步等比例增加每次推論的FLOPs。路由打破了這一剛性約束:在MoE中,每詞元啟用的引數量僅為總引數的1/5甚至1/10,這使萬億引數模型的理論推論成本與千億稠密模型相當。而在多模型服務中,相較於所有請求都衝向昂貴的大型模型,路由可以用不到十分之一的成本處理80%的簡單請求,將稀缺的高階GPU留給人機對話、複雜推論等硬核場景。
路由機制的分類學
- 按物件:詞元級路由(MoE的標準粒度,每個token獨立路由)、句子級/請求級路由(整個序列選擇同一個專家)、任務級路由(預先按任務分配模組)。
- 按決策方式:
- 基於規則:預定義關鍵詞對映(如“翻譯”請求傳送至翻譯模型),實現簡單,但泛化弱。
- 基於內容嵌入:將請求編碼為向量,與各候選模型的描述向量計算相似度,類似檢索。
- 基於學習的門控:MoE路由器本身就是一個可訓練的線性層加上Softmax,其引數與專家網路聯合最佳化,通過梯度下降學習如何分配。
- 基於強化學習:將路由決策視為一個動作,以最終答案的質量或推論效率作為獎勵,訓練一個策略網路在多個模型間動態選擇,常用於多模型路由,可面對未知分佈自適應調優。
- 按拓撲:樹形路由(多層路由器,逐級細化選擇)、扁平Top-k路由(所有專家平等競爭)、雜湊路由(通過固定的雜湊函式分配,避免通訊開銷但犧牲靈活性)。
技術原理
混合專家路由的數學與機制
標準門控路由
一個MoE層的核心計算如下(以Transformer FFN層為例):
- 輸入隱藏狀態
x ∈ ℝ^{d_model}對於每個token。 - 門控網路:
logits = W_g · x(W_g∈ℝ^{d_model×N}),產生N個專家的對數機率。 - 門控值:
g = Softmax(TopK(logits, k)),其中TopK操作將非Top-k的logits置為-∞,使得其softmax值為0。通常k=1或2,僅啟用極少數專家。 - 專家輸出:被啟用的專家
E_i接收x併產生輸出E_i(x)。 - 加權組合:
y = Σ g_i * E_i(x)。因為極少的g_i非零,計算量約為稠密FFN的k/N。
負載均衡:容量因子與輔助損失
直接訓練上述Top-k路由會導致“贏者通吃”——少數專家迅速變得擅長,路由器傾向於反覆選擇它們,而大部分專家閒置,利用率低下且容易過擬合。解決手段包括:
- 專家容量:為每個專家設定一個最大可處理token數上限:
capacity = (tokens_per_batch / N) × capacity_factor。若路由至某專家的token數超過容量,多餘token被丟棄(或在某些實現中跳過FFN,或通過殘差連線直接傳遞)。capacity_factor通常設為1.0~1.5,是防止溢位的超引數。溢位會損害模型質量,因此路由必須兼顧分散性。 - 輔助負載損失:在總訓練損失上新增一項,鼓勵token均勻分配。例如,Switch Transformer使用的損失:
loss_aux = N · Σ f_i · P_i,其中f_i是分配給專家i的token比例,P_i是門控分配給專家i的機率均值。當f_i和P_i相同時損失最小。 - 專家選擇路由(Expert Choice):不同於token選擇專家,BASE層中的思路是由每個專家主動選擇其容量內最匹配的Top-C token,通過計算匹配度矩陣並執行一個雙側匹配,天然保證負載均衡,在訓練穩定性和效能上有優勢,但實現更復雜。
分散式通訊:All-to-All 是心臟
在專家並行(Expert Parallelism)模式下,不同的專家被放置在不同的GPU/TPU上。路由過程引入所有裝置間的All-to-All通訊:
1. 裝置d收集本地的所有token,路由器計算出每個token的目標專家裝置t。
2. 執行一次All-to-All散射:根據target裝置,重新排列分發token,使每個裝置獲得所有向它專家路由來的token。
3. 本地執行專家計算。
4. 執行第二次All-to-All收集:將計算結果按原始token順序回到原裝置。
這完全不同於資料並行(AllReduce引數梯度)或張量並行(內部的AllReduce/ReduceScatter)。All-to-All是每個參與者向所有其他參與者傳送不同資料塊,通訊量正比於令牌數量×專家數量,極易成為瓶頸。因此,高頻寬、低延遲的互聯(如NVLink、InfiniBand)是MoE大規模訓練的基礎設施命門。
模型服務路由的技術架構
一個完整的智慧路由器可能包含:
- 意圖分類器:使用小型BERT或蒸餾模型將提示詞分類為“閒聊”“程式碼生成”“翻譯”“事實查詢”等標籤。
- 難度評估器:通過提示詞長度、複雜度指標、甚至調取輕量模型預生成並計算困惑度,判定是否需要大型模型。
- 成本-質量排程器:維護一個模型池的效能剖面(如平均延遲、價格、特定基準得分),根據使用者設定的延遲SLA或成本預算進行最佳化選擇。
- 快取層:語義快取能識別語義相同的問題,直接返回快取結果,如同“路由到快取”。
高階形態中,路由可以動態級聯:先用小模型生成,若不滿足置信度閾值再呼叫大型模型;或者並行呼叫多個模型,使用獎勵模型或一致性投票決定最終輸出,這種“路由即整合”的方式已在一些產品中可見雛形。
技術演進史
- 1990年代–2010年代初:混合專家思想的早期萌芽。Jacobs等人1991年提出“混合專家”作為多個神經網路的組合,但彼時各專家共享同一輸入,路由簡單,主要用於迴歸和分類,沒有實現深層條件計算。
- 2017年 決定性突破:Shazeer等發表《Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer》,首次在LSTM中引入稀疏門控路由器,Top-k選專家,並輔以負載均衡損失。驗證了數千專家規模的可行性,但未大規模落地。
- 2020年 GShard:Google將MoE擴充套件到Transformer,在機器翻譯中實現6000億引數,使用Top-2門控。提出專家並行與All-to-All的軟體工程實踐,為後續所有大規模MoE模型打下基礎。
- 2021年 Switch Transformer:將Top-2簡化為Top-1(每個token僅選一個專家),進一步降低計算量和通訊,簡化負載均衡,並訓練至萬億引數級別,展示了MoE的驚人伸縮性。
- 2022–2023年 穩定化與多樣路由:出現ST-MoE(通過router z-loss等方法提升訓練穩定性)、Expert Choice路由(BASE層)、Hash Layers(完全無需學習的固定路由)以及多種解決離散路由不可微問題的手段(如將路由輸出作為軟權重或通過強化學習)。MoE從研究走向工程成熟。
- 2023年底–2024年 開源大爆發:Mistral AI釋出Mixtral 8x7B(46.7B總參,12.9B啟用),以開源之姿達到可比肩更大稠密模型的效能,掀起MoE實用化浪潮;Databricks釋出DBRX;微軟/OpenAI據信GPT-4使用MoE(官方未明確說明);同時,模型服務路由成為LLMOps熱點,Cloudflare Workers AI、OpenRouter等平台提供通用模型路由API,學術論文如RouteLLM、HybridFlow等將請求路由作為獨立研究方向推進。
技術路線對比(量化表)
| 路線 | 代表方法/系統 | 路由粒度 | 負載均衡機制 | 訓練/推論開銷 | 優勢 | 劣勢 |
|---|---|---|---|---|---|---|
| Token級Top‑k門控 | GShard, Mixtral (k=2), DBRX (k=4) | Token級 | 輔助負載均衡損失 + 容量因子 | 中等(每token需路由計算,多專家輸出求和) | 精細條件計算,大容量 | 通訊All-to-All開銷大;負載仍可能不完美 |
| Token級Top-1門控 | Switch Transformer | Token級 | 輔助負載均衡損失 + 容量因子 | 較低(k=1簡化計算與通訊) | 極高效率,極致稀疏 | 一個專家可能不夠表達,需要更深或更多專家 |
| 專家選擇路由 | BASE Layers | Token級,但由專家選Token | 天然均衡(每個專家選固定Top-C token) | 略高於Top-k(需計算匹配矩陣) | 訓練極穩定,負載絕對均衡 | 實現複雜,可能引入額外的近似匹配損失 |
| 雜湊路由 | Hash Layers | Token級,基於雜湊 | 雜湊函式自然均勻分配 | 極低(無學習,無通訊直到專家計算) | 零路由開銷,確定性 | 語義無關,路由質量隨機,模型表達能力受限 |
| 模型服務路由 | RouteLLM, OpenRouter, Martian | 請求級(整個對話/查詢) | 權重式分配、級聯或預算約束 | 基於策略網路或嵌入匹配的額外推論延遲 | 可組合異構模型,降本增效 | 需要額外調優,路由錯誤會導致質量下降 |
| 強化學習路由 | 自定義RL策略 | 請求級 | 獎勵訊號包含成本/質量權衡 | 訓練RL策略有一定成本 | 可自動適配動態環境和多目標 | 訓練不穩定,可能需要大量探索 |
上述對比基於公開論文設計原理。具體數值表現視訓練資料、模型規模和硬體環境而定,不宜直接跨實現比較。
上下游
上游:基礎設施與工具鏈
- 計算硬體:GPU(如H100)和TPU v5等,需支援高速All-to-All集合通訊;NVSwitch、InfiniBand NDR400等提供節點內/間頻寬。
- 分散式訓練架構:Megatron-LM與DeepSpeed整合專家並行(DeepSpeed-MoE),配置容量因子、輔助損失,支援靈活路由函式;PyTorch FSDP/Fairscale提供基礎元件。
- 通訊庫:NCCL、RCCL針對All-to-All原語最佳化;自研硬體如Google的TPU ICI互聯專門加速。
- 編譯器與推論引擎:如TensorRT-LLM、vLLM、SGLang,為MoE開發專用的融合運算元,如grouped GEMM,最佳化稀疏啟用;同時支援多模型路由的排程器。
- 路由器邏輯庫:開源實現如huggingface transformers的Sparse MoE模組,以及fairscale的experts模組,簡化原型開發。
下游:應用場景
- 巨型語言模型服務:作為聊天API(ChatGPT、Claude等可能採用)的核心架構,支撐數十億日呼叫量。
- 多模態模型:將視覺/音訊/語言作為不同模態專家,路由選擇融合。
- 企業AI平台:在統一API下整合多個領域模型,路由使用者請求至最佳模型,兼顧成本與安全合規。
- 邊緣-雲端協同推論:路由器判斷任務複雜度,簡單任務留在端側裝置,複雜任務解除安裝到雲端。
- A/B測試和藍綠部署:路由百分比流量到不同模型版本。
關鍵指標
- 路由延遲:門控計算耗時或因路由策略引起的額外通訊時間,對整體推論延遲的佔比應控制在小個位數百分比內。
- 專家利用率:在一段時期內每個專家被啟用的頻次分佈,可通過基尼係數或變異係數衡量,理想值趨近均等分佈。
- 負載失衡率:被丟棄/溢位的token佔總token的比例(因超出專家容量),越低越好,通常應低於1-2%。
- 模型困惑度/下游任務得分:與同參數規模稠密模型的效能對比,衡量路由選擇的質量——路由越精準,同等啟用引數下效能越高。
- 成本加權效果:對於服務路由,通常以
(\alpha \cdot \text{Latency} + \beta \cdot \text{Cost})加權,考察端到端任務成功率與價效比。 - 吞吐量:每秒處理查詢數(QPS)或每秒生成token數,受All-to-All通訊頻寬和專家矩陣計算雙重約束。
供需與市場資料
由於本次研究無法獲取即時資料庫,以下僅為定性趨勢概述:
- 需求端:大型模型競賽正在由單純擴大稠密引數轉向混合專家架構。2024年以Mixtral、DBRX等開源MoE模型為標誌,產業界對MoE訓練和推論工具的需求井噴。雲端服務客戶越來越多要求提供“多模型路由”以降低推論總成本,尤其是面向海量簡單請求的聊天機器人、內容稽核等場景。
- 供給端:主流AI晶片和系統均加強All-to-All支援。NVIDIA H100的Transformer Engine使MoE推論加速,DGX SuperPOD叢集配合InfiniBand為MoE訓練提供高吞吐。軟體側,DeepSpeed、Megatron-Core等開源架構持續完善專家並行能力;推論引擎如vLLM已支援MoE模型的高效服務。
- 市場參與者:除頭部雲端廠自研外,獨立的模型路由API層嶄露頭角,如OpenRouter、Together AI的混合推論服務、Martian等,他們聚合不同廠商模型,通過路由演算法提供最優價效比選擇,催生一種新型MaaS中介經濟形態。
代表公司與資本對映
- Google/DeepMind:自研GShard、Switch Transformer、PaLM(部分版本可能用MoE)等,持有大量MoE訓練與路由核心專利,並以TPU及Pathways系統建置軟硬一體生態。
- Microsoft/OpenAI:據外媒報道與程式碼洩露分析,GPT-4內部採用MoE架構(8個專家);微軟的DeepSpeed-MoE架構成為開源社群基石,Azure雲端也推出基於MoE的模型服務。
- Meta:公開發表NLLB MoE模型(用於翻譯)及多項稀疏訓練研究,PyTorch生態對MoE支援力度大。
- Mistral AI:開源Mixtral 8x7B模型,以卓越的成本效率引爆商業關注,其估值在2024年迅速攀升,成為歐洲AI新星。
- Databricks:收購MosaicML後釋出DBRX,定位企業級MoE,展示全棧能力。
- 創業公司:
- 模型路由中介軟體:如OpenRouter提供統一API訪問50+模型並帶路由功能;Martian在此領域深耕,獲多輪融資。
- MoE最佳化軟體:CentML、Fireworks.ai等專注推論最佳化,利用路由思想混合小模型實現超低成本推論。
- TPU/IPU等替代硬體:Graphcore(雖然商業模式遇挑戰,但其IPU的設計天然適合細粒度稀疏通訊),體現了硬體對路由的計算圖最佳化。
資本邏輯:MoE雖然緩解了算力邊際成本,但也驅動模型總規模持續膨脹,因此長期看算力總需求依然激增,硬體和互聯供應商受益。同時,能掌握拓撲感知的路由排程演算法的團隊,既賦能自家模型也作為中介軟體服務變現,是風投青睞的新方向。
投資邏輯
- 架構換效率,算力需求仍結構性增長:MoE使模型規模輕鬆突破萬億,訓練所需演算法FLOPs雖然隨引數線性增長,但收斂所需step可能減少,且激進的大廠仍會追求更大的叢集,帶動高效能運算互聯(InfiniBand/乙太網路)和大型交換器晶片需求。然而,單位推論成本顯著下降,推論晶片的總需求增長可能由應用爆發量補足。
- 模型服務路由開啟降本空間:對於AI應用公司,推論成本佔據營收的50%以上。智慧路由能進一步大幅壓縮成本,邊際改善盈利能力,可能會加劇AI應用商業化,利好有豐富應用場景和資料積累的ISV。
- 路由技術成為雲端廠差異化競爭力:如果某雲端平台能提供自動路由、自適應質量的最優排程,其模型呼叫的價效比將明顯優於競爭對手,客戶粘性增強。關注各雲端廠開源或閉源的路由技術元件更新。
- 軟硬體協同創新:針對All-to-All通訊的硬體加速、Sparse MoE的圖編譯器最佳化、多模型池的異構排程器等,可能滋生一批中介軟體企業。圍繞NVLink/InfiniBand生態的產業鏈公司持續收益。
仍需注意風險:MoE訓練的不穩定性(離散路由)可能導致研發進度延遲;模型服務路由若匹配失準,會讓客戶體驗波動,影響商譽。此外,學術界正在探索無需離散路由的結構化稀疏方法,長期可能顛覆現有路線。
常見誤讀糾偏
誤讀1:“MoE路由就是雜湊對映,將token隨機分配給專家。” 糾正:目前最常用的門控路由是可學習引數的網路(一個全連線層),輸出的logits經過Softmax和Top-k選擇專家。雜湊路由只是探索的一個極端分支,僅用於研究負載均衡對路由學習的必要性,實際應用較少,因為完全隨機的分配無法利用語義進行有效計算。
誤讀2:“模型路由僅指混合專家模型內部的門控,多模型請求分發只是負載均衡。” 糾正:模型服務中的多模型路由(有時稱“推論路由”或“請求路由”)同樣是模型路由的重要組成。它涉及內容理解、成本規劃和質量評估的複雜策略,絕非簡單的輪詢或最少連線負載均衡。比如,它可以分析一個翻譯請求併發送到擅長目標語言的專業模型,而非通用模型,這是智慧決策而非流量分發。
誤讀3:“MoE中All-to-All通訊就是張量並行的AllReduce。” 糾正:兩者截然不同。張量並行使用AllReduce或ReduceScatter進行歸約操作(例如將每個裝置的部分和相加並廣播),通訊量與模型層大小、並行切片數強相關。而MoE專家並行中的All-to-All是置換重分佈(scatter/gather),每個裝置向所有其他裝置傳送可能不同的令牌資料,通訊量與令牌數量和專家拓撲直接關聯,延遲敏感且資料量可遠大於歸約操作。混淆會誤導硬體選型(All-to-All對網路非均勻接入更敏感)。
學習路徑
-
奠基論文:
- Shazeer et al. (2017) “Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer” (ICLR) – 現代稀疏MoE的原點。
- Lepikhin et al. (2020) “GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding” – 首個Transformer+MoE的成功大規模實現。
- Fedus et al. (2021) “Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity” – Top-1路由與負載均衡損失的經典闡述。
-
進階閱讀:
- Zoph et al. (2022) “ST-MoE: Designing Stable and Transferable Sparse Expert Models” – 深入分析路由穩定性和技巧。
- Lewis et al. (2021) “BASE Layers: Simplifying Training of Large, Sparse Models” – 對專家選擇路由的詳細介紹。
- Jiang et al. (2024) “Mixtral of Experts” – 當前最知名的開源MoE語言模型技術報告。
-
工程教程與程式碼:
- Hugging Face
transformers庫中Mixtral等MoE模型的原始碼(modeling_mixtral.py),可直觀看到門控函式的實現。 - DeepSpeed-MoE教程:瞭解專家並行的設定、容量因子調整。
- vLLM官方文件中關於MoE支援的章節(關注其融合的Grouped GEMM核心)。
- Hugging Face
-
模型服務路由相關:
- 論文“RouteLLM: Learning to Route LLMs with Preference Data” (2024) – 經典多模型路由方法。
- 部落格與開源專案:如LMSYS的Chatbot Arena中可能涉及的混合推論排程;OpenRouter的API文件;Lit-GPT中的“Router”概念驗證。
- 系統會議(MLSys, OSDI)中有關“Model Serving at Scale”的論文,常有請求排程與自適應路由的最新設計。
一句話總結
模型路由是讓AI系統在“龐大而稀疏”與“多樣而經濟”之間動態平衡的智慧中樞,它通過離散的條件計算將模型能力從單一巨型矩陣壓縮為按需啟用的專家聯盟,正在重塑大型模型的成本結構與部署哲學。
延伸閱讀與來源
本概念學習頁依據公開學術文獻和工業技術公告撰寫,未使用即時特定資料檢索,所有具體數值樣例均來自論文模型卡片(如Mixtral 8x7B引數由Mistral AI公佈)。因檢索服務暫時不可用,一些即時市場資料未列出,建議讀者通過以下渠道獲取最新資訊:
- 基礎文獻:Shazeer et al. (2017), GShard (2020), Switch Transformer (2021) - arXiv.org
- 模型與部落格:Mistral AI Blog for Mixtral; Databricks Blog for DBRX; Google AI Blog for Switch Transformer & BASE.
- 行業分析:SemiAnalysis有關MoE推論成本的深度文章;各大投資機構釋出的AI基礎設施報告。
- 社群資源:Hugging Face 模型卡片及討論區;r/MachineLearning關於MoE路由的討論帖。
- 會議追蹤:ICLR, NeurIPS, ICML每年關於稀疏模型和條件計算的最新論文;MLSys中涉及模型排程和路由的工業應用論文。
注意:本文中涉及對GPT-4等產品使用MoE的描述來自多方公開報道和分析師推演,未得到官方徹底證實,請謹慎參考。同時,任何具體路由器的效能資料因硬體環境差異巨大,需按官方基準為準。