MoE 混合專家
1. 3 秒看懂
MoE 用 37B 啟用引數撬動 671B 總引數,是雲端端推論成本下行、叢集通訊上行的結構性變數。1
2. 3 分鐘產業解釋
MoE(Mixture of Experts,混合專家)把 Transformer 的前饋層拆成多個專家網路,並由 router 在每個 token 上只選擇 1-8 個專家,因此總引數規模與單 token 計算量被解耦。23 Mixtral 8x7B 是早期商業化樣本,模型總引數 46.7B、每 token 啟用 12.9B,Mistral 把它定位為“47B 容量、13B 推論成本”的開源路線。3 DeepSeek-V3 把這個邏輯推到 671B 總引數、37B 啟用引數,並揭露 14.8T tokens 預訓練和 2.788M H800 GPU hours 全流程訓練口徑,使 MoE 從架構技巧變成雲端成本基準。1 GPT-4 官方技術報告沒有揭露引數、架構和訓練硬體,市場關於“GPT-4 是 MoE”的說法只能列為 C 級推測,不能作為關鍵數字支撐。424
3. 15 分鐘專家深入
MoE 的產業價值來自 3 個乘法項:第一,總引數決定知識容量,671B 級 DeepSeek-V3 或 675B 級 Mistral Large 3 能在推論時只啟用 37B/41B 引數,從而把“模型能力”與“單 token FLOPs”拆開。15 第二,router、expert parallelism 和 all-to-all 通訊把瓶頸從單卡矩陣乘遷移到跨 GPU 排程、HBM 容量、NVLink/InfiniBand/Ethernet 網路和 KV cache 管理,導致雲端平台的最佳化物件從“買更多 GPU”轉向“用更高利用率跑更多 token”。16 第三,開源 MoE 降低了模型 API 的邊際成本錨,DeepSeek-V3 揭露的 2.788M H800 GPU hours 與 5.576 百萬美元訓練測算不是完整研發成本,但足以壓低市場對閉源大型模型訓練成本的線性外推。1
技術上,MoE 並不等於“免費大型模型”。Mixtral 8x7B 每 token 啟用 2 個專家,DeepSeek-V3 在每層路由多個專家並使用 auxiliary-loss-free load balancing,路由不均衡會造成專家熱點、尾延遲和叢集碎片化。13 推論側還必須把全部或大部分專家權重駐留在視訊記憶體/HBM 中,因此 671B 總引數即使只啟用 37B,也不能按 37B dense 模型估算記憶體佔用。17 對雲端廠商而言,MoE 的獲利傳導不是單一 GPU 需求減少,而是“單位 token 成本下降 → 應用呼叫量上升 → 推論叢集利用率提高 → 網路與記憶體佔比提高”的再平衡。89
投資上,MoE 對 5 類公司影響相反:NVIDIA、AMD、Broadcom 和 Arista 受益於推論規模擴大、網路通訊上升和系統級最佳化;Microsoft、Amazon、Alphabet 受益於單位推論成本下降和 AI 雲端需求擴張,但短期受資本支出、折舊和電力約束壓制 FCF margin。81011 NVIDIA FY2027Q1 資料中心營收 75.2B 美元 [NVDA]、年增率增長 92%,說明 AI 訓練和推論需求仍在硬體側兌現;Microsoft FY2026Q3 AI 業務年化營收超過 37B 美元、年增率增長 123%,說明 MoE 這類效率路線更可能擴大可服務需求,而非立即削弱雲端 capex。810
4. 技術原理
MoE 層通常由 router、N 個 expert FFN、top-k 選擇、capacity factor、load balancing loss 或無輔助損失均衡機制組成,每個 token 只進入 1-8 個專家並把輸出加權彙總。123 Switch Transformer 使用 top-1 routing,把稀疏啟用模型擴充套件到萬億引數級,並報告相對 T5-XXL 約 4x 預訓練加速,這是 MoE 從論文走向大規模訓練的關鍵證據。2 Mixtral 8x7B 使用 8 個專家、每 token 選擇 2 個專家,因此 46.7B 總引數只啟用 12.9B 引數。3 DeepSeek-V3 使用 671B 總引數和 37B 啟用引數,並通過 Multi-head Latent Attention、DeepSeekMoE、FP8 mixed precision 和通訊計算重疊,把 14.8T tokens 預訓練壓到 2.664M H800 GPU hours。1
5. 上游依賴 / 下游影響
上游依賴
- GPU/HBM:MoE 降低單 token FLOPs,但 46.7B-671B 總引數仍要求更多權重常駐視訊記憶體,HBM 容量和頻寬比 dense 小模型更難被壓縮。13
- 網路互連:expert parallelism 會放大 all-to-all 通訊,DeepSeek-V3 揭露通過通訊計算重疊降低 H800 叢集互連約束,說明網路最佳化是 MoE 訓練與推論的硬門檻。1
- 編譯與排程軟體:router 熱點、專家負載均衡、batch packing 和 KV cache 管理決定實際 token/s,軟體棧差異會把同一模型的成本拉開 20% 以上。16
- 雲端電力與機房:MoE 降低單位 token 能耗方向明確,但 hyperscaler 仍把 2026 年 capex 展望維持在高位,說明需求擴張快於效率節約。91011
下游影響
- 模型 API:開源 MoE 把 671B 級能力壓到 37B 啟用成本,使企業推論預算更偏向高頻呼叫和長上下文應用。17
- 雲端 IaaS/PaaS:Azure、AWS、Google Cloud 的 AI 營收會從訓練叢集出租轉向推論託管、模型路由、專用晶片和平台服務。91011
- 應用軟體:單位 token 成本下降會提升 agent、程式碼、搜尋、客服和 BI 的呼叫密度,但毛利率改善取決於應用定價是否慢於推論成本下降。810
6. 技術路線對比表
| 路線 | 速率/啟用 | 功耗或成本方向 | 距離或維度 | 標準成熟度 | 2026 量產機率 | 反證指標 |
|---|---|---|---|---|---|---|
| Dense Transformer | 100% 引數啟用 | FLOPs 與引數近似線性上升 | 7B-405B 引數常見 | 訓練/推論生態最成熟 | 90% | 70B+ dense 單 token 成本高於 MoE 2x 以上且質量無優勢 |
| Switch top-1 MoE | 每 token 1 個專家 | 計算最低但路由誤差更敏感 | 萬億引數論文驗證 | 學術成熟、商業較少直接復刻 | 35% | top-1 路由質量低於 top-2/top-8 且尾延遲無優勢 |
| Mixtral top-2 MoE | 8 選 2,12.9B/46.7B 啟用 | 推論成本接近 13B dense | 32K context | 開源生態成熟 | 75% | 同等質量下 dense 14B 的吞吐或記憶體成本更優 |
| DeepSeekMoE | 37B/671B 啟用 | 訓練揭露 2.788M H800 GPU hours | 128K context | 開源權重和論文驗證 | 80% | 真實雲端部署成本無法複製論文 GPU-hour 口徑 |
| 閉源 GPT-4 類 MoE 推測 | 官方未揭露 | 無法量化 | 引數/專家數未揭露 | C 級傳聞,不作事實 | 50% 推測 | OpenAI 官方繼續不揭露或揭露為非 MoE 架構 |
| 專用推論 MoE 服務 | 動態路由 + speculative decoding | token 成本下降,網路佔比上升 | 多模型路由/API 層 | 雲端廠自研成熟度高 | 70% | API 毛利率不隨 token 成本下降改善 |
7. 關鍵指標
- 啟用引數/總引數:Mixtral 為 12.9B/46.7B,DeepSeek-V3 為 37B/671B,該比值低於 10% 時推論 FLOPs 彈性最明顯。13
- GPU-hour/token:DeepSeek-V3 揭露 14.8T tokens 預訓練用 2.664M H800 GPU hours,若同類模型高於 2x 則說明工程效率不足。1
- all-to-all 通訊佔比:DeepSeek-V3 通過通訊計算重疊緩解 H800 互連瓶頸,若通訊時間超過 step time 的 20%-30% 則 MoE 擴充套件效率會快速下降。1
- Expert load balance:單專家負載偏離均值超過 20% 會造成尾延遲和掉 token 風險,需追蹤 router entropy、capacity overflow 和 token drop rate。12
- 推論 token 毛利:雲端廠應追蹤
營收/token - GPU折舊/token - 電力/token - 網路/token,MoE 有效性最終落在單位 token 毛利而非引數規模。810 - 雲端 capex/AI 營收:Microsoft FY2026Q3 AI 年化營收 37B 美元、年增率 123%,若 capex 增速持續高於 AI 營收增速則估值會從成長邏輯切到折舊壓力。10
8. 可算傳導表
| 傳導變數 | NVIDIA | Microsoft Azure | Amazon AWS |
|---|---|---|---|
| TAM 起點 | FY2027Q1 資料中心營收 75.2B 美元 [NVDA],作為 AI 訓練+推論硬體需求代理 | FY2026Q3 AI 業務年化營收 37B 美元,作為 Azure AI 需求代理 | 2026Q1 AWS 營收 37.6B 美元 [AWS],作為雲端推論承載代理 |
| MoE 滲透假設 | MoE 推論佔 AI GPU 時長 25%/40%/55% | MoE API/託管模型佔 AI 營收 20%/35%/50% | MoE 託管與 Bedrock/Trainium 推論佔 AWS AI 負載 15%/30%/45% |
| 出貨/用量 | 資料中心營收 × 推論佔比 × MoE佔比 ÷ 單GPU年營收代理,單GPU年營收代理未揭露需情景化 | AI營收 × MoE佔比 ÷ 每百萬token營收,token 單價未揭露需情景化 | AWS營收 × AI負載佔比 × MoE佔比 ÷ 推論例項年營收,AI負載佔比未揭露需情景化 |
| ASP/單價 | Blackwell 系統 ASP 未揭露,使用資料中心營收代理而非寫單卡價格 | Azure OpenAI/API 單 token 定價公開但折扣未揭露,使用營收代理 | Bedrock/Trainium 折扣未揭露,使用 AWS 營收代理 |
| 份額 | NVIDIA 資料中心 GPU 份額未由公司揭露,行業常用 80%+ 為 C 級估算,關鍵模型標 [未核實 — 待補 A/B 源] | Azure 份額由雲端合同和 OpenAI 生態驅動,未揭露單 MoE 份額 | AWS 份額由 Bedrock、Trainium 和 Anthropic 生態驅動,未揭露單 MoE 份額 |
| 營收 | 中性情景:75.2B × 40% = 30.1B 美元 MoE相關季度硬體需求代理 | 中性情景:37B × 35% = 13.0B 美元 MoE相關年化AI營收代理 | 中性情景:37.6B × 20% AI負載 × 30% MoE = 2.26B 美元季度MoE承載營收代理 |
| 毛利 | 營收 × FY2027Q1 GAAP GM 74.9%,中性為 22.5B 美元毛利代理 | 營收 × Intelligent Cloud 毛利率,分部毛利率未單列則標 [未核實 — 待補 A/B 源] | 營收 × AWS operating margin 37.7%,中性為 0.85B 美元經營獲利代理 |
| PE | 2026-05-27 美股收盤 TTM PE 32.56x,美元,StockAnalysis C 級 | 2026-05-27 美股收盤口徑需行情站複核,C 級;示例使用 24.9x 附近不可作 A/B 數字 | 2026-05-27 美股收盤口徑需行情站複核,C 級;示例使用 30x-32x 區間不可作 A/B 數字 |
| 估值 | MoE相關稅後獲利 × PE,需剔除訓練/非MoE營收重疊 | MoE相關稅後獲利 × PE,需剔除 Copilot 與 Azure 基礎營收重疊 | MoE相關稅後獲利 × PE,需剔除非 AI AWS 營收重疊 |
9. 同業硬指標對比表
| 公司 | 營收 | 增速 | GM | 淨利 | FCF margin | 客戶集中度 | 技術代際 | PE TTM | 反證條件 |
|---|---|---|---|---|---|---|---|---|---|
| NVIDIA | FY2027Q1 營收 81.6B 美元 [NVDA];資料中心 75.2B 美元 | 總營收 +85%;資料中心 +92% | GAAP GM 74.9% | 淨利 58.3B 美元 | 季度 FCF margin 待 10-Q 複核 | 大客戶集中度 10-K 揭露為顯著風險 | Blackwell/GB300、CUDA、NVLink、推論軟體棧 | 32.56x [NVDA],2026-05-27 16:00 EDT,美元,C 級 | MoE 使 GPU-hour/token 下降但 token 需求未放大 |
| Microsoft | FY2026Q3 營收 82.9B 美元 [MSFT]10;Microsoft Cloud 54.5B 美元 [MSFT]10 | 營收 +18%;Azure +40% | 綜合 GM 待 10-Q 複核 | 淨利待 10-Q 複核 | FCF margin 待 10-Q 複核 | OpenAI 生態依賴高但未揭露單客戶營收 | Azure AI、OpenAI、Copilot、推論平台 | 約 24.9x [MSFT]18,2026-05-27 附近,C 級 | AI capex 增速高於 AI 營收且 Copilot ARPU 不上行 |
| Amazon | 2026Q1 營收 181.5B 美元;AWS 37.6B 美元 | 總營收 +17%;AWS +28% | 綜合 GM 待 10-Q 複核 | 淨利受 16.8B 美元非經營收益影響 | FCF margin 待 10-Q 複核 | AWS 客戶分散但 AI 晶片客戶未揭露 | Bedrock、Trainium、Inferentia、Anthropic | 32.51x [AMZN],2026-05-27 16:00 EDT,C 級 | Trainium 利用率不足或 Bedrock 毛利低於 EC2 |
| Alphabet | 2026Q1 營收 109.9B 美元;Google Cloud 20.0B 美元 | 總營收 +22%;Cloud +63% | 綜合 GM 待 10-Q 複核 | 淨利 62.6B 美元 | FCF margin 受 35.7B 美元 capex 壓制 | 廣告營收集中但雲端 AI 客戶未揭露 | TPU、Gemini、Vertex AI、Search AI | 約 29.3x,2026-05-27 附近,C 級 | TPU 成本優勢未轉化為 Cloud operating margin |
| AMD | 2025 全年資料中心營收需 10-K 複核;MI300/MI350 為 AI 代理 | 資料中心增速待 10-K 複核 | GM 待 10-K 複核 | 淨利待 10-K 複核 | FCF margin 待 10-K 複核 | 雲端 GPU 客戶集中度未揭露 | MI300/MI350、ROCm、推論 GPU | 行情站口徑待補 C 源 | ROCm 生態無法承接 MoE 推論生產負載 |
| Broadcom | FY2025 半導體和 AI 網路/ASIC 營收需 10-K 複核 | AI 半導體營收高增但單 MoE 未揭露 | GM 待 10-K 複核 | 淨利待 10-K 複核 | FCF margin 待 10-K 複核 | 大型定製晶片客戶集中 | Tomahawk、Jericho、定製 AI ASIC、CPO | 行情站口徑待補 C 源 | MoE 通訊強度不升或雲端廠轉回通用 GPU |
10. 投資邏輯 + 業績傳導
MoE 的投資邏輯不是“模型變便宜所以硬體需求下降”,而是“單 token 成本下降 1 個臺階後,推論需求和模型總容量同時上升”。18 DeepSeek-V3 以 37B 啟用引數承載 671B 總引數,證明雲端端模型能力可以在不線性放大 FLOPs 的情況下繼續擴張;但全部專家權重、KV cache、路由通訊和多租戶排程仍會消耗 HBM、網路和機房電力。16 因此,MoE 對 NVIDIA/Broadcom/Arista 是“訓練佔比下降、推論和網路佔比上升”的結構變化,對 Microsoft/Amazon/Alphabet 是“AI 營收彈性擴大、折舊和 capex 驗證壓力同步擴大”的獲利表變化。891011
MoE 總引數擴大 / 啟用引數下降
↓
單位 token FLOPs 下降 + 全量權重/HBM 仍高
↓
推論呼叫量上升 + all-to-all 通訊上升
↓
GPU/HBM/網路/雲端平台利用率重新定價
↓
AI 雲端營收 - 折舊/電力/網路成本
↓
FCF margin × PE = 情景市值架構
11. 常見誤讀糾偏
誤讀 1:MoE 只啟用 37B 引數,所以 671B 模型只需要 37B 模型的視訊記憶體。
實際:DeepSeek-V3 每 token 啟用 37B 引數,但推論服務仍要儲存 671B 主模型權重和 14B MTP 模組相關權重,視訊記憶體/HBM 需求更接近總引數而非啟用引數。17
誤讀 2:DeepSeek-V3 的 5.576 百萬美元訓練成本等於完整研發成本。
實際:DeepSeek-V3 揭露的是按 2.788M H800 GPU hours 和 2 美元/GPU-hour 假設計算的訓練執行成本,不包含長期研發、人力、失敗實驗、資料、叢集折舊和部署成本。1
誤讀 3:GPT-4 已被證實是 MoE,所以可以倒推出專家數和訓練成本。
實際:OpenAI GPT-4 Technical Report 明確未揭露模型規模、架構和訓練硬體,任何 GPT-4 MoE 專家數、引數量和訓練成本都只能作為 C 級市場推測,不能支撐關鍵數字。424
12. 最新事件
- [已發生] 2024-12:DeepSeek-V3 釋出技術報告,揭露 671B 總引數、37B 啟用引數、14.8T tokens 和 2.788M H800 GPU hours,MoE 成為成本敘事核心。1
- [已發生] 2025-01:DeepSeek-R1 釋出並開源 R1-Zero、R1 與 6 個蒸餾 dense 模型,強化“MoE 基座 + 推論時強化學習 + 蒸餾”的產業路線。12
- [已發生] 2025-12:Mistral 釋出 Mistral Large 3,揭露 675B 總引數、41B 啟用引數和 256K context,說明歐洲開源前沿模型也轉向大規模稀疏架構。5
- [已發生] 2026-04-29:Microsoft FY2026Q3 揭露 AI 業務年化營收超過 37B 美元、年增率增長 123%,Azure +40%,說明推論需求仍在雲端營收中兌現。10
- [已發生] 2026-05-20:NVIDIA FY2027Q1 揭露資料中心營收 75.2B 美元、年增率增長 92%,說明 MoE 效率提升尚未削弱 AI 硬體營收斜率。8
13. 來源 footnotes
1 DeepSeek-V3 Technical Report — DeepSeek-AI / arXiv — 2024-12 — https://arxiv.org/abs/2412.19437 (A)
2 Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity — Google Research / JMLR — 2022 — https://www.jmlr.org/papers/v23/21-0998.html (A)
3 Mixtral of Experts — Mistral AI / arXiv — 2024 — https://arxiv.org/abs/2401.04088 ; https://mistral.ai/news/mixtral-of-experts/ (A/B)
4 GPT-4 Technical Report — OpenAI / arXiv — 2023 — https://arxiv.org/abs/2303.08774 (A)
5 Introducing Mistral 3 — Mistral AI — 2025-12 — https://mistral.ai/news/mistral-3 (B)
6 DeepSeek-V3 GitHub model card and engineering notes — DeepSeek-AI — 2024-2026 — https://github.com/deepseek-ai/DeepSeek-V3 (B)
7 DeepSeek-V3 Hugging Face model card — DeepSeek-AI — 2024-2026 — https://huggingface.co/deepseek-ai/DeepSeek-V3 (B)
8 NVIDIA Announces Financial Results for First Quarter Fiscal 2027 — NVIDIA — 2026-05 — https://nvidianews.nvidia.com/news/nvidia-announces-financial-results-for-first-quarter-fiscal-2027 (B)
9 Alphabet Announces First Quarter 2026 Results — Alphabet Investor Relations — 2026-04 — https://s206.q4cdn.com/479360582/files/doc_financials/2026/q1/2026q1-alphabet-earnings-release.pdf (B)
10 Microsoft FY26 Q3 Earnings Release — Microsoft Investor Relations — 2026-04-29 — https://www.microsoft.com/en-us/investor/earnings/fy-2026-q3/press-release-webcast (B)
11 Amazon.com Announces First Quarter 2026 Results — Amazon Investor Relations — 2026-05 — https://s2.q4cdn.com/299287126/files/doc_earnings/2026/q1/earnings-result/AMZN-Q1-2026-Earnings-Release.pdf (B)
12 DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning — DeepSeek-AI / arXiv — 2025-01 — https://arxiv.org/abs/2501.12948 (A)
13 Amazon.com 2025 Annual Report / Form 10-K — Amazon / SEC — 2026 — https://s2.q4cdn.com/299287126/files/doc_financials/2026/ar/Amazon-2025-Annual-Report.pdf (A)
14 Alphabet 2025 Form 10-K — Alphabet / SEC — 2026 — https://www.sec.gov/Archives/edgar/data/1652044/000165204426000018/goog-20251231.htm (A)
15 NVIDIA FY2026 Form 10-K / Annual Report — NVIDIA / SEC — 2026 — https://investor.nvidia.com/financial-info/financial-reports/default.aspx (A)
16 Microsoft FY2025 Form 10-K / Annual Report — Microsoft / SEC — 2025 — https://www.microsoft.com/en-us/investor/annual-reports.aspx (A)
17 NVIDIA market cap and TTM PE snapshot, close 2026-05-27 16:00 EDT — StockAnalysis — 2026 — https://stockanalysis.com/stocks/nvda/financials/ratios/ (C)
18 Microsoft market cap and TTM PE snapshot, close near 2026-05-27 16:00 EDT — StockAnalysis / CompaniesMarketCap — 2026 — https://stockanalysis.com/stocks/msft/ ; https://companiesmarketcap.com/microsoft/pe-ratio/ (C)
19 Amazon market cap and TTM PE snapshot, close near 2026-05-27 16:00 EDT — StockAnalysis / FinanceCharts — 2026 — https://stockanalysis.com/stocks/amzn/market-cap/ ; https://www.financecharts.com/compare/AMZN/value/pe-ratio (C)
20 Alphabet market cap and TTM PE snapshot, close near 2026-05-27 16:00 EDT — StockAnalysis — 2026 — https://stockanalysis.com/stocks/goog/statistics/ (C)
21 AMD FY2025 Form 10-K / Annual Report — AMD / SEC — 2026 — https://ir.amd.com/financial-information/sec-filings (A)
22 Broadcom FY2025 Form 10-K / Annual Report — Broadcom / SEC — 2025 — https://investors.broadcom.com/financial-information/sec-filings (A)
23 OpenAI did not disclose GPT-4 model size, architecture or training compute in the GPT-4 Technical Report; market MoE claims remain unverified — OpenAI / arXiv + secondary market commentary — 2023-2026 — https://arxiv.org/abs/2303.08774 (A/C)
24 SemiAnalysis / market commentary on GPT-4 architecture, cited only as unverified C-level background — SemiAnalysis — 2023 — https://www.semianalysis.com/ (C)