啟用率(Activation Rate)
3 秒看懂
啟用率 = 每次推論實際呼叫的引數量 ÷ 模型總引數量。
在 MoE(混合專家)大型模型時代,一個 671B 總引數的模型,推論時每個 token 可能只啟用 37B 引數——啟用率約 5.5%。這意味著”大型模型不一定貴”,啟用率直接決定了推論成本、視訊記憶體頻寬需求和算力消耗。
3 分鐘產業解釋
為什麼啟用率突然重要?
2023—2025 年,行業密集轉向 MoE(Mixture of Experts)架構。Dense(稠密)模型的啟用率恆為 100%,但 MoE 模型通過路由機制,讓每個 token 只經過一小部分”專家”子網路。這帶來一個核心變數——啟用率。
| 模型型別 | 總引數 | 推論啟用引數 | 啟用率 | 代表模型 |
|---|---|---|---|---|
| Dense | 70B | 70B | 100% | Llama 2-70B |
| 小比例 MoE | ~46.7B | ~12.9B | ~27.6% | Mixtral 8×7B [Mistral 官方模型卡] |
| 大規模 MoE | ~671B | ~37B | ~5.5% | DeepSeek-V3 [DeepSeek-V3 技術報告] |
注:以上數字來自各模型釋出方的官方技術報告/模型卡。啟用引數 = 共享層引數 + 被路由選中的專家引數(不含未被選中的專家)。
產業影響鏈路
啟用率低 → 每 token 推論算力需求低 → 推論成本下降
→ 但總引數量大 → 訓練算力需求高、權重儲存視訊記憶體大
→ 推論時權重需駐留 HBM → 頻寬瓶頸仍在
核心張力:啟用率越低,推論越”便宜”(算力角度),但模型越大,儲存和頻寬越”貴”。這就是為什麼 HBM 容量/頻寬成為 MoE 推論的關鍵瓶頸——你不用計算所有引數,但你得把所有引數都”擺”在視訊記憶體裡(或用高效 offloading 方案)。
15 分鐘專家深入
一、啟用率的精確含義
在不同語境下,“啟用率”至少有三層含義:
- MoE 全域性啟用率(最常用):單次前向傳播中,被啟用的引數佔總引數的比例。
- 專家級啟用率:在 N 個專家中,每個 token 被路由到 K 個,啟用率 = K/N。
- 神經元啟用率(Neuron Activation Rate):某一層中,啟用函式輸出非零值的神經元比例。在 ReLU 網路中,這通常遠低於 100%(存在”死亡 ReLU”現象),影響稀疏計算最佳化。
當前產業討論中,含義 1 和 2 是主流,含義 3 更多見於學術研究和推論最佳化領域。
二、MoE 啟用率的計算
對於標準 MoE 層:
設:
N = 專家總數
K = 每 token 選中的專家數
D_shared = 共享層(attention、embedding 等)引數量
D_expert = 單個專家的引數量
D_total = D_shared + N × D_expert
D_active = D_shared + K × D_expert
啟用率 = D_active / D_total
= (D_shared + K × D_expert) / (D_shared + N × D_expert)
關鍵洞察:
- 當 D_shared 很小時,啟用率 ≈ K/N
- 當共享層引數佔比大時(如 attention 全共享),啟用率會顯著高於 K/N
- DeepSeek 系列引入了 共享專家(Shared Expert) 機制,無論路由結果如何,共享專家始終被啟用,這會提高啟用率但增強模型穩定性
三、啟用率與稀疏性的關係
啟用率 = 1 - 稀疏度(Sparsity)。業界有時用”稀疏比”來表達同一概念:
稀疏比(Sparsity Ratio)= 1 - 啟用率
= 未被啟用的引數 / 總引數
高稀疏比(低啟用率)意味著:
- ✅ 推論 FLOPs 低
- ✅ 推論延遲可接受(不比同規模 Dense 模型慢太多)
- ❌ 模型檔案大、權重載入時間長
- ❌ 推論時 HBM 佔用 = 全量引數,不因啟用率低而減少
- ❌ 訓練時需要 All-to-All 通訊分發 token 到不同專家,通訊開銷大
技術原理
MoE 路由機制與啟用率的底層關係
┌─────────────────────────────────────────────────┐
│ 輸入 Token x │
│ │ │
│ ┌───────▼────────┐ │
│ │ Gate Network │ ← 輕量線性層 │
│ │ (Router) │ 輸出 N 個分數 │
│ └───────┬────────┘ │
│ │ │
│ softmax(scores) │
│ │ │
│ Top-K 選擇 (K << N) │
│ │ │
│ ┌─────┬─────┬─────┼─────┬─────┬─────┐ │
│ ▼ ▼ ▼ ▼ ▼ ▼ ▼ │
│ [E0] [E1] [E2] [E3] [E4] ... [EN-1] │
│ ✅ ✅ ❌ ❌ ❌ ❌ │
│ │ │ │
│ ▼ ▼ │
│ y = Σ(gate_score_i × E_i(x)), i ∈ top-K │
│ │
│ 啟用的專家: K 個 │
│ 啟用的引數: K × D_expert + D_shared │
└─────────────────────────────────────────────────┘
關鍵引數與超參:
| 引數 | 說明 | 典型範圍 |
|---|---|---|
| N(專家總數) | MoE 層中的專家數量 | 8 ~ 256(趨勢增大) |
| K(啟用專家數) | 每 token 選中的專家 | 1 ~ 8 |
| K/N(專家啟用率) | 單層啟用比例 | ~1.6% ~ 50% |
| 全域性啟用率 | 含共享層的總引數啟用比 | 視架構差異大 |
| capacity factor | 控制專家可處理的 token 上限 | 1.0 ~ 2.0 |
負載均衡與啟用率的隱含成本
實際啟用率 ≠ 理想啟用率。路由可能出現負載不均衡(Load Imbalance):
- 少數”熱門”專家被大量 token 選中 → 該專家計算成為瓶頸
- 部分專家幾乎不被選中 → 引數浪費,等效啟用率更低
- 解決方案:輔助損失(Auxiliary Loss / Load Balancing Loss)、Expert Choice 路由
注意:Megatron-LM 架構中,MoE 的 token 分發使用 All-to-All 通訊原語(將 token 路由到不同 GPU 上的專家),這與 Dense 模型的張量並行(AllReduce/ReduceScatter)有本質區別。All-to-All 通訊的資料量主要由每 token 啟用的專家數 K 決定,與啟用率並無直接反比關係,但同步開銷不變。
神經元啟用率(學術補充)
在使用 ReLU 啟用函式的網路中,由於 ReLU 將負值截斷為零,前向傳播時同一層的輸出中往往有 30%—70% 的神經元輸出為零 [Glorot et al., 2011; Lu et al., 2019]。
這一”天然稀疏性”啟發了:
- 稀疏推論加速
- 動態稀疏計算(只計算非零神經元)
- ReLU → GELU/SiLU 的趨勢:現代 LLM 普遍使用 GELU/SiLU,這些啟用函式不嚴格截斷為零,神經元啟用率更高,稀疏最佳化空間更小
技術演進史
| 時間 | 里程碑 | 啟用率特徵 |
|---|---|---|
| 2017 | Shazeer et al. 提出 Sparsely-Gated MoE | K=4, N=可達上千,啟用率極低 |
| 2021 | Google Switch Transformer | N 達 2048,K=1,單層啟用率 < 0.1%,但共享層佔比小 |
| 2022 | Google GLaM (1.2T) | 64 專家,K=2,啟用引數 96.6B |
| 2023.12 | Mixtral 8×7B (Mistral AI) | N=8, K=2,總參 ~46.7B,啟用 ~12.9B,啟用率 ~27.6% |
| 2024.05 | DeepSeek-V2 | N=160 路由專家 + 2 共享專家,K=6,總參 236B,啟用 21B,啟用率 ~8.9% |
| 2024.12 | DeepSeek-V3 | N=256 路由專家 + 1 共享專家,K=8,總參 671B,啟用 37B,啟用率 ~5.5% |
| 2025+ | 行業趨勢 | 專家數繼續擴大(256~1024),啟用率進一步壓低;共享專家機制普及 |
趨勢總結:啟用率從早期的 ~25-50% 逐步壓低至 ~5%,以換取”用更大總引數量提升模型能力,同時控制推論成本”的紅利。
技術路線對比
| 維度 | Dense 模型(啟用率 100%) | MoE 模型(啟用率 5-30%) | 評論 |
|---|---|---|---|
| 推論算力/token | 高(全引數前向) | 低(僅啟用子集) | MoE 推論 FLOPs 優勢顯著 |
| 推論延遲 | 相對可預測 | 受路由開銷、負載均衡影響 | MoE 有額外 overhead |
| HBM 佔用 | = 總引數 × 精度 | = 總引數 × 精度(不因啟用率低而減少!) | MoE 的隱性成本 |
| 訓練通訊 | AllReduce/ReduceScatter | All-to-All + AllReduce | MoE 通訊更復雜 |
| 訓練穩定性 | 較好 | 需要輔助損失、路由策略調參 | MoE 除錯難度大 |
| Scaling 特性 | 引數↑→FLOPs 線性↑ | 引數↑→FLOPs 亞線性↑ | MoE 天然適合 scale |
| 量化友好度 | 成熟 | 專家間分佈差異大,量化挑戰更大 | 正在改進 |
上下游
上游(啟用率依賴什麼)
| 層級 | 關鍵依賴 | 說明 |
|---|---|---|
| 架構設計 | 專家數量 N、Top-K 策略、共享專家設計 | 直接決定啟用率 |
| 路由演算法 | Token Choice vs Expert Choice、雜湊路由 | 影響實際有效啟用率 |
| 負載均衡 | Auxiliary Loss 係數、Expert Balancing | 影響專家利用率 |
| 架構支援 | Megatron-LM、DeepSpeed-MoE、vLLM | MoE 並行與排程實現 |
| 硬體互聯 | NVLink/NVSwitch 頻寬 | All-to-All 通訊瓶頸 |
下游(啟用率影響什麼)
| 層級 | 影響 | 說明 |
|---|---|---|
| 推論成本 | 每 token 算力成本 | 啟用率越低,單位推論越便宜 |
| 推論吞吐 | tokens/s | 計算量降低,吞吐提升(前提:頻寬不是瓶頸) |
| 服務部署 | GPU 數量需求 | 啟用率低可減少計算 GPU,但儲存需求不變 |
| 模型能力 | 總引數量 vs 啟用率權衡 | 更多引數 + 低啟用率 = 更強能力 + 可控成本 |
| 邊緣部署 | 能否端側執行 | 超低啟用率 + 權重壓縮 → 端側 MoE 可能 |
關鍵指標
| 指標 | 定義 | 關注要點 |
|---|---|---|
| 全域性啟用率 | 啟用引數/總引數 | 最核心的綜合指標 |
| 專家啟用率 K/N | 被選中專家/總專家數 | MoE 層的稀疏程度 |
| 有效啟用率 | 考慮負載均衡後實際參與計算的引數比例 | 熱門專家可能導致實際算力 > 理論 |
| 路由熵(Router Entropy) | 專家被選中機率分佈的熵 | 熵高=均勻分配=啟用率穩定 |
| 啟用引數 FLOPs/token | 推論時每 token 的浮點運算量 | 直接影響推論延遲和算力成本 |
| 權重駐留量 | 推論時需駐留 HBM 的引數量 | ≈ 總引數量(MoE 的隱性瓶頸) |
供需與市場資料
推論成本經濟學
啟用率對推論成本的影響是行業關注焦點。以下為定性推算架構 [行業估算]:
Dense 70B 推論成本 ≈ 基準 C
MoE 671B (啟用 37B) 推論成本 ≈ 37/70 × C × Overhead_factor
- Overhead_factor 包含:路由計算開銷、All-to-All 通訊、
負載不均衡導致的計算浪費
- 實際 Overhead_factor 通常在 1.1x ~ 1.5x 之間 [行業估算]
- 淨效果:MoE 推論成本顯著低於同等能力的 Dense 模型
對硬體需求的影響
- HBM 需求不變:MoE 模型總引數量大,即使啟用率低,權重仍需全量駐留。671B 模型 FP16 需要約 1.34TB HBM,遠超單卡容量 → 需要多卡張量並行存權重。
- 計算需求降低:等效 FLOPs 與啟用引數量成正比,可使用更少的計算卡(或相同卡獲得更高吞吐)。
- 頻寬成為真正瓶頸:啟用率低意味著算力利用率先觸頂(roofline 模型中處於 memory-bound 區域),HBM 頻寬成為吞吐上限的關鍵制約。
這一分析架構基於 roofline 模型和公開的推論效能基準推導,具體數字因部署方案、量化精度、批處理大小而異,屬於 [行業估算] 範疇。
代表公司與資本對映
| 公司/團隊 | 啟用率相關策略 | 關注點 |
|---|---|---|
| DeepSeek(深度求索) | V2/V3 系列將啟用率壓至 ~5-9%,極致低啟用率路線 | 共享專家設計、輔助損失無損化(bias-free routing) |
| Mistral AI | Mixtral 系列,8 專家 Top-2,啟用率 ~27.6% | 較”保守”的 MoE 設計,工程成熟度高 |
| Google/DeepMind | Switch Transformer、GLaM 等開創性工作 | MoE 理論和系統最佳化的先驅 |
| NVIDIA | 通過 NVLink/NVSwitch 解決 MoE All-to-All 通訊瓶頸 | 啟用率低→通訊成為瓶頸→NVLink 頻寬價值凸顯 |
| Groq | 定製 LPU 架構,關注確定性排程 | 對 MoE 路由排程有潛在最佳化空間 |
| vLLM / SGLang 等推論架構 | MoE 推論最佳化,專家並行、KV Cache 管理 | 開源推論生態的關鍵 |
資本對映邏輯
啟用率持續走低
→ 推論算力需求增速放緩(同等能力模型推論更便宜)
→ 但總引數量繼續膨脹 → HBM 容量/頻寬需求持續增長
→ 瓶頸從"計算"轉向"儲存與通訊"
→ 需求側重點:HBM 供應商(SK 海力士、三星、美光)
→ 需求側重點:高頻寬互聯(NVLink、CXL)
→ 需求側重點:推論最佳化架構/晶片(關注儲存頻寬而非峰值算力)
→ 需重新審視:純算力堆疊邏輯
投資邏輯
核心觀點
-
啟用率是理解”推論經濟學”的核心變數。它解釋了為什麼 DeepSeek 能以遠低於同等能力 Dense 模型的成本提供服務。
-
啟用率走低 ≠ 算力需求走低。訓練時仍需全引數更新;推論時權重需全量駐留 HBM。真正的瓶頸從計算轉向儲存頻寬。
-
關注”有效啟用率”而非紙面啟用率。負載均衡差、路由坍縮等問題會導致實際算力消耗高於理論值。擁有高效路由和系統最佳化能力的團隊有工程壁壘。
-
MoE 是主流方向,但 Dense 未死。中小模型、邊緣部署、對推論延遲確定性要求極高的場景,Dense 模型仍有不可替代性。
-
硬體投資含義:峰值 FLOPs 的重要性相對下降,HBM 頻寬和容量、晶片間互聯頻寬的重要性上升。
常見誤讀糾偏
誤讀一:「啟用率低 = 推論視訊記憶體佔用低」
糾偏:完全錯誤。MoE 模型推論時,所有專家的權重都必須駐留在視訊記憶體中(因為每個 token 的路由結果不同,你無法預知下次會啟用哪些專家)。啟用率低只降低了計算量(FLOPs),不降低儲存量。這是最容易被忽視的 MoE 成本結構。
推論視訊記憶體 ≈ 全部引數 × 精度位元組數 + KV Cache + 啟用值
≈ 與 Dense 同等總參量的模型類似
推論計算量 ≈ 啟用引數 × 序列長度 × 常數
≈ 遠低於同等總參量的 Dense 模型
誤讀二:「K/N = 全域性啟用率」
糾偏:不一定。全域性啟用率 = (D_shared + K × D_expert) / (D_shared + N × D_expert)。當共享層(Attention、Embedding、LayerNorm 等)引數佔比較大時,全域性啟用率會顯著高於 K/N。例如 DeepSeek-V3 的 K/N = 8/256 = 3.125%,但其全域性啟用率約 5.5%,差異來自共享層和共享專家的引數貢獻。
誤讀三:「啟用率越低越好」
糾偏:存在邊際收益遞減和質量拐點。啟用率過低(如 K=1, N=極大)可能導致:
- 單個專家承載知識過少,出現”知識碎片化”
- 路由微小擾動導致輸出大幅變化,模型魯棒性下降
- 訓練過程中專家利用率不均,部分專家”休眠”
業界當前的”甜蜜區”在 5%—30% 之間,具體取決於模型規模、訓練資料量和下游任務。
誤讀四:「MoE 的 All-to-All 通訊和 Dense 模型的 AllReduce 差不多」
糾偏:通訊模式完全不同。
- Dense 張量並行:每個 GPU 計算完整層的一部分,通訊模式是 AllReduce/ReduceScatter,通訊量可預測。
- MoE 專家並行:token 需要路由到特定 GPU 上的特定專家,通訊模式是 All-to-All,通訊量取決於路由分佈,天然不均衡,對互聯拓撲和排程策略要求更高。
學習路徑
入門(建立直覺)
- 閱讀 Mistral AI 的 Mixtral 8×7B 公告部落格,理解 MoE 的基本結構
- 理解 Top-K 路由的基本概念:為什麼不是所有專家都啟用
進階(理解機制)
- 閱讀 Fedus et al., “Switch Transformers” (2021) — 理解極端稀疏 MoE
- 閱讀 DeepSeek-V2 技術報告 — 理解共享專家、MLA 等現代設計
- 學習 Megatron-LM 的 MoE 實現 — 理解 All-to-All 通訊和專家並行
深入(工程與經濟學)
- 用 roofline 模型分析 MoE 推論的算力 vs 頻寬瓶頸
- 對比 Dense vs MoE 在相同推論預算下的能力表現
- 研究 vLLM/SGLang 中 MoE 推論的實際最佳化策略
推薦論文/資源
- Shazeer et al., “Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer” (2017)
- Fedus et al., “Switch Transformers” (2021)
- DeepSeek-V2 Technical Report (2024)
- DeepSeek-V3 Technical Report (2024)
- Megatron-LM GitHub — MoE 分支
- NVIDIA “Scaling Expert Language Models” blog (如有)
一句話總結
啟用率是 MoE 大型模型時代的核心成本槓桿——它用”少算”換”多知”,讓萬億引數模型以百億引數的成本推論,但視訊記憶體和頻寬的全量負擔一分不少,真正的投資焦點應從峰值算力轉向儲存頻寬與互聯。
延伸閱讀與來源
| 來源型別 | 內容 | 來源標註 |
|---|---|---|
| 官方模型卡 | Mixtral 8×7B 引數與架構 | [Mistral AI 官方模型卡] |
| 官方技術報告 | DeepSeek-V2 架構與啟用引數 | [DeepSeek-V2 技術報告, 2024] |
| 官方技術報告 | DeepSeek-V3 架構與啟用引數 | [DeepSeek-V3 技術報告, 2024] |
| 學術論文 | Switch Transformer | [Fedus et al., JMLR 2022] |
| 學術論文 | 原始 Sparsely-Gated MoE | [Shazeer et al., ICLR 2017] |
| 架構文件 | Megatron-LM MoE 實現 | [NVIDIA Megatron-LM GitHub] |
| 行業分析 | 推論成本與啟用率關係 | [行業估算,非廠商官方揭露] |
| 神經元稀疏性 | ReLU 啟用稀疏度 | [Glorot et al., AISTATS 2011; Lu et al., NeurIPS 2019] |
⚠️ 宣告:本文中未標註具體來源的數字為基於公開資訊的定性推算或行業共識性表述。各模型的具體引數量/啟用引數量以官方技術報告為準。本文不構成投資建議。