模型層 含付費深讀

MoE 混合專家

Mixture of Experts

概念 ID
cloud-moe
更新時間
2026-05-28
來源數量
24

MoE 混合專家

1. 3 秒看懂

MoE 用 37B 啟用引數撬動 671B 總引數,是雲端端推論成本下行、叢集通訊上行的結構性變數。1

2. 3 分鐘產業解釋

MoE(Mixture of Experts,混合專家)把 Transformer 的前饋層拆成多個專家網路,並由 router 在每個 token 上只選擇 1-8 個專家,因此總引數規模與單 token 計算量被解耦。23 Mixtral 8x7B 是早期商業化樣本,模型總引數 46.7B、每 token 啟用 12.9B,Mistral 把它定位為“47B 容量、13B 推論成本”的開源路線。3 DeepSeek-V3 把這個邏輯推到 671B 總引數、37B 啟用引數,並揭露 14.8T tokens 預訓練和 2.788M H800 GPU hours 全流程訓練口徑,使 MoE 從架構技巧變成雲端成本基準。1 GPT-4 官方技術報告沒有揭露引數、架構和訓練硬體,市場關於“GPT-4 是 MoE”的說法只能列為 C 級推測,不能作為關鍵數字支撐。424

3. 15 分鐘專家深入

MoE 的產業價值來自 3 個乘法項:第一,總引數決定知識容量,671B 級 DeepSeek-V3 或 675B 級 Mistral Large 3 能在推論時只啟用 37B/41B 引數,從而把“模型能力”與“單 token FLOPs”拆開。15 第二,router、expert parallelism 和 all-to-all 通訊把瓶頸從單卡矩陣乘遷移到跨 GPU 排程、HBM 容量、NVLink/InfiniBand/Ethernet 網路和 KV cache 管理,導致雲端平台的最佳化物件從“買更多 GPU”轉向“用更高利用率跑更多 token”。16 第三,開源 MoE 降低了模型 API 的邊際成本錨,DeepSeek-V3 揭露的 2.788M H800 GPU hours 與 5.576 百萬美元訓練測算不是完整研發成本,但足以壓低市場對閉源大型模型訓練成本的線性外推。1

技術上,MoE 並不等於“免費大型模型”。Mixtral 8x7B 每 token 啟用 2 個專家,DeepSeek-V3 在每層路由多個專家並使用 auxiliary-loss-free load balancing,路由不均衡會造成專家熱點、尾延遲和叢集碎片化。13 推論側還必須把全部或大部分專家權重駐留在視訊記憶體/HBM 中,因此 671B 總引數即使只啟用 37B,也不能按 37B dense 模型估算記憶體佔用。17 對雲端廠商而言,MoE 的獲利傳導不是單一 GPU 需求減少,而是“單位 token 成本下降 → 應用呼叫量上升 → 推論叢集利用率提高 → 網路與記憶體佔比提高”的再平衡。89

投資上,MoE 對 5 類公司影響相反:NVIDIA、AMD、Broadcom 和 Arista 受益於推論規模擴大、網路通訊上升和系統級最佳化;Microsoft、Amazon、Alphabet 受益於單位推論成本下降和 AI 雲端需求擴張,但短期受資本支出、折舊和電力約束壓制 FCF margin。81011 NVIDIA FY2027Q1 資料中心營收 75.2B 美元 [NVDA]、年增率增長 92%,說明 AI 訓練和推論需求仍在硬體側兌現;Microsoft FY2026Q3 AI 業務年化營收超過 37B 美元、年增率增長 123%,說明 MoE 這類效率路線更可能擴大可服務需求,而非立即削弱雲端 capex。810

4. 技術原理

MoE 層通常由 router、N 個 expert FFN、top-k 選擇、capacity factor、load balancing loss 或無輔助損失均衡機制組成,每個 token 只進入 1-8 個專家並把輸出加權彙總。123 Switch Transformer 使用 top-1 routing,把稀疏啟用模型擴充套件到萬億引數級,並報告相對 T5-XXL 約 4x 預訓練加速,這是 MoE 從論文走向大規模訓練的關鍵證據。2 Mixtral 8x7B 使用 8 個專家、每 token 選擇 2 個專家,因此 46.7B 總引數只啟用 12.9B 引數。3 DeepSeek-V3 使用 671B 總引數和 37B 啟用引數,並通過 Multi-head Latent Attention、DeepSeekMoE、FP8 mixed precision 和通訊計算重疊,把 14.8T tokens 預訓練壓到 2.664M H800 GPU hours。1

5. 上游依賴 / 下游影響

上游依賴

  • GPU/HBM:MoE 降低單 token FLOPs,但 46.7B-671B 總引數仍要求更多權重常駐視訊記憶體,HBM 容量和頻寬比 dense 小模型更難被壓縮。13
  • 網路互連:expert parallelism 會放大 all-to-all 通訊,DeepSeek-V3 揭露通過通訊計算重疊降低 H800 叢集互連約束,說明網路最佳化是 MoE 訓練與推論的硬門檻。1
  • 編譯與排程軟體:router 熱點、專家負載均衡、batch packing 和 KV cache 管理決定實際 token/s,軟體棧差異會把同一模型的成本拉開 20% 以上。16
  • 雲端電力與機房:MoE 降低單位 token 能耗方向明確,但 hyperscaler 仍把 2026 年 capex 展望維持在高位,說明需求擴張快於效率節約。91011

下游影響

  • 模型 API:開源 MoE 把 671B 級能力壓到 37B 啟用成本,使企業推論預算更偏向高頻呼叫和長上下文應用。17
  • 雲端 IaaS/PaaS:Azure、AWS、Google Cloud 的 AI 營收會從訓練叢集出租轉向推論託管、模型路由、專用晶片和平台服務。91011
  • 應用軟體:單位 token 成本下降會提升 agent、程式碼、搜尋、客服和 BI 的呼叫密度,但毛利率改善取決於應用定價是否慢於推論成本下降。810

6. 技術路線對比表

路線速率/啟用功耗或成本方向距離或維度標準成熟度2026 量產機率反證指標
Dense Transformer100% 引數啟用FLOPs 與引數近似線性上升7B-405B 引數常見訓練/推論生態最成熟90%70B+ dense 單 token 成本高於 MoE 2x 以上且質量無優勢
Switch top-1 MoE每 token 1 個專家計算最低但路由誤差更敏感萬億引數論文驗證學術成熟、商業較少直接復刻35%top-1 路由質量低於 top-2/top-8 且尾延遲無優勢
Mixtral top-2 MoE8 選 2,12.9B/46.7B 啟用推論成本接近 13B dense32K context開源生態成熟75%同等質量下 dense 14B 的吞吐或記憶體成本更優
DeepSeekMoE37B/671B 啟用訓練揭露 2.788M H800 GPU hours128K context開源權重和論文驗證80%真實雲端部署成本無法複製論文 GPU-hour 口徑
閉源 GPT-4 類 MoE 推測官方未揭露無法量化引數/專家數未揭露C 級傳聞,不作事實50% 推測OpenAI 官方繼續不揭露或揭露為非 MoE 架構
專用推論 MoE 服務動態路由 + speculative decodingtoken 成本下降,網路佔比上升多模型路由/API 層雲端廠自研成熟度高70%API 毛利率不隨 token 成本下降改善

7. 關鍵指標

  • 啟用引數/總引數:Mixtral 為 12.9B/46.7B,DeepSeek-V3 為 37B/671B,該比值低於 10% 時推論 FLOPs 彈性最明顯。13
  • GPU-hour/token:DeepSeek-V3 揭露 14.8T tokens 預訓練用 2.664M H800 GPU hours,若同類模型高於 2x 則說明工程效率不足。1
  • all-to-all 通訊佔比:DeepSeek-V3 通過通訊計算重疊緩解 H800 互連瓶頸,若通訊時間超過 step time 的 20%-30% 則 MoE 擴充套件效率會快速下降。1
  • Expert load balance:單專家負載偏離均值超過 20% 會造成尾延遲和掉 token 風險,需追蹤 router entropy、capacity overflow 和 token drop rate。12
  • 推論 token 毛利:雲端廠應追蹤 營收/token - GPU折舊/token - 電力/token - 網路/token,MoE 有效性最終落在單位 token 毛利而非引數規模。810
  • 雲端 capex/AI 營收:Microsoft FY2026Q3 AI 年化營收 37B 美元、年增率 123%,若 capex 增速持續高於 AI 營收增速則估值會從成長邏輯切到折舊壓力。10

8. 可算傳導表

傳導變數NVIDIAMicrosoft AzureAmazon AWS
TAM 起點FY2027Q1 資料中心營收 75.2B 美元 [NVDA],作為 AI 訓練+推論硬體需求代理FY2026Q3 AI 業務年化營收 37B 美元,作為 Azure AI 需求代理2026Q1 AWS 營收 37.6B 美元 [AWS],作為雲端推論承載代理
MoE 滲透假設MoE 推論佔 AI GPU 時長 25%/40%/55%MoE API/託管模型佔 AI 營收 20%/35%/50%MoE 託管與 Bedrock/Trainium 推論佔 AWS AI 負載 15%/30%/45%
出貨/用量資料中心營收 × 推論佔比 × MoE佔比 ÷ 單GPU年營收代理,單GPU年營收代理未揭露需情景化AI營收 × MoE佔比 ÷ 每百萬token營收,token 單價未揭露需情景化AWS營收 × AI負載佔比 × MoE佔比 ÷ 推論例項年營收,AI負載佔比未揭露需情景化
ASP/單價Blackwell 系統 ASP 未揭露,使用資料中心營收代理而非寫單卡價格Azure OpenAI/API 單 token 定價公開但折扣未揭露,使用營收代理Bedrock/Trainium 折扣未揭露,使用 AWS 營收代理
份額NVIDIA 資料中心 GPU 份額未由公司揭露,行業常用 80%+ 為 C 級估算,關鍵模型標 [未核實 — 待補 A/B 源]Azure 份額由雲端合同和 OpenAI 生態驅動,未揭露單 MoE 份額AWS 份額由 Bedrock、Trainium 和 Anthropic 生態驅動,未揭露單 MoE 份額
營收中性情景:75.2B × 40% = 30.1B 美元 MoE相關季度硬體需求代理中性情景:37B × 35% = 13.0B 美元 MoE相關年化AI營收代理中性情景:37.6B × 20% AI負載 × 30% MoE = 2.26B 美元季度MoE承載營收代理
毛利營收 × FY2027Q1 GAAP GM 74.9%,中性為 22.5B 美元毛利代理營收 × Intelligent Cloud 毛利率,分部毛利率未單列則標 [未核實 — 待補 A/B 源]營收 × AWS operating margin 37.7%,中性為 0.85B 美元經營獲利代理
PE2026-05-27 美股收盤 TTM PE 32.56x,美元,StockAnalysis C 級2026-05-27 美股收盤口徑需行情站複核,C 級;示例使用 24.9x 附近不可作 A/B 數字2026-05-27 美股收盤口徑需行情站複核,C 級;示例使用 30x-32x 區間不可作 A/B 數字
估值MoE相關稅後獲利 × PE,需剔除訓練/非MoE營收重疊MoE相關稅後獲利 × PE,需剔除 Copilot 與 Azure 基礎營收重疊MoE相關稅後獲利 × PE,需剔除非 AI AWS 營收重疊

9. 同業硬指標對比表

公司營收增速GM淨利FCF margin客戶集中度技術代際PE TTM反證條件
NVIDIAFY2027Q1 營收 81.6B 美元 [NVDA];資料中心 75.2B 美元總營收 +85%;資料中心 +92%GAAP GM 74.9%淨利 58.3B 美元季度 FCF margin 待 10-Q 複核大客戶集中度 10-K 揭露為顯著風險Blackwell/GB300、CUDA、NVLink、推論軟體棧32.56x [NVDA],2026-05-27 16:00 EDT,美元,C 級MoE 使 GPU-hour/token 下降但 token 需求未放大
MicrosoftFY2026Q3 營收 82.9B 美元 [MSFT]10;Microsoft Cloud 54.5B 美元 [MSFT]10營收 +18%;Azure +40%綜合 GM 待 10-Q 複核淨利待 10-Q 複核FCF margin 待 10-Q 複核OpenAI 生態依賴高但未揭露單客戶營收Azure AI、OpenAI、Copilot、推論平台約 24.9x [MSFT]18,2026-05-27 附近,C 級AI capex 增速高於 AI 營收且 Copilot ARPU 不上行
Amazon2026Q1 營收 181.5B 美元;AWS 37.6B 美元總營收 +17%;AWS +28%綜合 GM 待 10-Q 複核淨利受 16.8B 美元非經營收益影響FCF margin 待 10-Q 複核AWS 客戶分散但 AI 晶片客戶未揭露Bedrock、Trainium、Inferentia、Anthropic32.51x [AMZN],2026-05-27 16:00 EDT,C 級Trainium 利用率不足或 Bedrock 毛利低於 EC2
Alphabet2026Q1 營收 109.9B 美元;Google Cloud 20.0B 美元總營收 +22%;Cloud +63%綜合 GM 待 10-Q 複核淨利 62.6B 美元FCF margin 受 35.7B 美元 capex 壓制廣告營收集中但雲端 AI 客戶未揭露TPU、Gemini、Vertex AI、Search AI約 29.3x,2026-05-27 附近,C 級TPU 成本優勢未轉化為 Cloud operating margin
AMD2025 全年資料中心營收需 10-K 複核;MI300/MI350 為 AI 代理資料中心增速待 10-K 複核GM 待 10-K 複核淨利待 10-K 複核FCF margin 待 10-K 複核雲端 GPU 客戶集中度未揭露MI300/MI350、ROCm、推論 GPU行情站口徑待補 C 源ROCm 生態無法承接 MoE 推論生產負載
BroadcomFY2025 半導體和 AI 網路/ASIC 營收需 10-K 複核AI 半導體營收高增但單 MoE 未揭露GM 待 10-K 複核淨利待 10-K 複核FCF margin 待 10-K 複核大型定製晶片客戶集中Tomahawk、Jericho、定製 AI ASIC、CPO行情站口徑待補 C 源MoE 通訊強度不升或雲端廠轉回通用 GPU

10. 投資邏輯 + 業績傳導

MoE 的投資邏輯不是“模型變便宜所以硬體需求下降”,而是“單 token 成本下降 1 個臺階後,推論需求和模型總容量同時上升”。18 DeepSeek-V3 以 37B 啟用引數承載 671B 總引數,證明雲端端模型能力可以在不線性放大 FLOPs 的情況下繼續擴張;但全部專家權重、KV cache、路由通訊和多租戶排程仍會消耗 HBM、網路和機房電力。16 因此,MoE 對 NVIDIA/Broadcom/Arista 是“訓練佔比下降、推論和網路佔比上升”的結構變化,對 Microsoft/Amazon/Alphabet 是“AI 營收彈性擴大、折舊和 capex 驗證壓力同步擴大”的獲利表變化。891011

MoE 總引數擴大 / 啟用引數下降

單位 token FLOPs 下降 + 全量權重/HBM 仍高

推論呼叫量上升 + all-to-all 通訊上升

GPU/HBM/網路/雲端平台利用率重新定價

AI 雲端營收 - 折舊/電力/網路成本

FCF margin × PE = 情景市值架構

11. 常見誤讀糾偏

誤讀 1:MoE 只啟用 37B 引數,所以 671B 模型只需要 37B 模型的視訊記憶體。

實際:DeepSeek-V3 每 token 啟用 37B 引數,但推論服務仍要儲存 671B 主模型權重和 14B MTP 模組相關權重,視訊記憶體/HBM 需求更接近總引數而非啟用引數。17

誤讀 2:DeepSeek-V3 的 5.576 百萬美元訓練成本等於完整研發成本。

實際:DeepSeek-V3 揭露的是按 2.788M H800 GPU hours 和 2 美元/GPU-hour 假設計算的訓練執行成本,不包含長期研發、人力、失敗實驗、資料、叢集折舊和部署成本。1

誤讀 3:GPT-4 已被證實是 MoE,所以可以倒推出專家數和訓練成本。

實際:OpenAI GPT-4 Technical Report 明確未揭露模型規模、架構和訓練硬體,任何 GPT-4 MoE 專家數、引數量和訓練成本都只能作為 C 級市場推測,不能支撐關鍵數字。424

12. 最新事件

  • [已發生] 2024-12:DeepSeek-V3 釋出技術報告,揭露 671B 總引數、37B 啟用引數、14.8T tokens 和 2.788M H800 GPU hours,MoE 成為成本敘事核心。1
  • [已發生] 2025-01:DeepSeek-R1 釋出並開源 R1-Zero、R1 與 6 個蒸餾 dense 模型,強化“MoE 基座 + 推論時強化學習 + 蒸餾”的產業路線。12
  • [已發生] 2025-12:Mistral 釋出 Mistral Large 3,揭露 675B 總引數、41B 啟用引數和 256K context,說明歐洲開源前沿模型也轉向大規模稀疏架構。5
  • [已發生] 2026-04-29:Microsoft FY2026Q3 揭露 AI 業務年化營收超過 37B 美元、年增率增長 123%,Azure +40%,說明推論需求仍在雲端營收中兌現。10
  • [已發生] 2026-05-20:NVIDIA FY2027Q1 揭露資料中心營收 75.2B 美元、年增率增長 92%,說明 MoE 效率提升尚未削弱 AI 硬體營收斜率。8

13. 來源 footnotes

1 DeepSeek-V3 Technical Report — DeepSeek-AI / arXiv — 2024-12 — https://arxiv.org/abs/2412.19437 (A)

2 Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity — Google Research / JMLR — 2022 — https://www.jmlr.org/papers/v23/21-0998.html (A)

3 Mixtral of Experts — Mistral AI / arXiv — 2024 — https://arxiv.org/abs/2401.04088 ; https://mistral.ai/news/mixtral-of-experts/ (A/B)

4 GPT-4 Technical Report — OpenAI / arXiv — 2023 — https://arxiv.org/abs/2303.08774 (A)

5 Introducing Mistral 3 — Mistral AI — 2025-12 — https://mistral.ai/news/mistral-3 (B)

6 DeepSeek-V3 GitHub model card and engineering notes — DeepSeek-AI — 2024-2026 — https://github.com/deepseek-ai/DeepSeek-V3 (B)

7 DeepSeek-V3 Hugging Face model card — DeepSeek-AI — 2024-2026 — https://huggingface.co/deepseek-ai/DeepSeek-V3 (B)

8 NVIDIA Announces Financial Results for First Quarter Fiscal 2027 — NVIDIA — 2026-05 — https://nvidianews.nvidia.com/news/nvidia-announces-financial-results-for-first-quarter-fiscal-2027 (B)

9 Alphabet Announces First Quarter 2026 Results — Alphabet Investor Relations — 2026-04 — https://s206.q4cdn.com/479360582/files/doc_financials/2026/q1/2026q1-alphabet-earnings-release.pdf (B)

10 Microsoft FY26 Q3 Earnings Release — Microsoft Investor Relations — 2026-04-29 — https://www.microsoft.com/en-us/investor/earnings/fy-2026-q3/press-release-webcast (B)

11 Amazon.com Announces First Quarter 2026 Results — Amazon Investor Relations — 2026-05 — https://s2.q4cdn.com/299287126/files/doc_earnings/2026/q1/earnings-result/AMZN-Q1-2026-Earnings-Release.pdf (B)

12 DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning — DeepSeek-AI / arXiv — 2025-01 — https://arxiv.org/abs/2501.12948 (A)

13 Amazon.com 2025 Annual Report / Form 10-K — Amazon / SEC — 2026 — https://s2.q4cdn.com/299287126/files/doc_financials/2026/ar/Amazon-2025-Annual-Report.pdf (A)

14 Alphabet 2025 Form 10-K — Alphabet / SEC — 2026 — https://www.sec.gov/Archives/edgar/data/1652044/000165204426000018/goog-20251231.htm (A)

15 NVIDIA FY2026 Form 10-K / Annual Report — NVIDIA / SEC — 2026 — https://investor.nvidia.com/financial-info/financial-reports/default.aspx (A)

16 Microsoft FY2025 Form 10-K / Annual Report — Microsoft / SEC — 2025 — https://www.microsoft.com/en-us/investor/annual-reports.aspx (A)

17 NVIDIA market cap and TTM PE snapshot, close 2026-05-27 16:00 EDT — StockAnalysis — 2026 — https://stockanalysis.com/stocks/nvda/financials/ratios/ (C)

18 Microsoft market cap and TTM PE snapshot, close near 2026-05-27 16:00 EDT — StockAnalysis / CompaniesMarketCap — 2026 — https://stockanalysis.com/stocks/msft/ ; https://companiesmarketcap.com/microsoft/pe-ratio/ (C)

19 Amazon market cap and TTM PE snapshot, close near 2026-05-27 16:00 EDT — StockAnalysis / FinanceCharts — 2026 — https://stockanalysis.com/stocks/amzn/market-cap/ ; https://www.financecharts.com/compare/AMZN/value/pe-ratio (C)

20 Alphabet market cap and TTM PE snapshot, close near 2026-05-27 16:00 EDT — StockAnalysis — 2026 — https://stockanalysis.com/stocks/goog/statistics/ (C)

21 AMD FY2025 Form 10-K / Annual Report — AMD / SEC — 2026 — https://ir.amd.com/financial-information/sec-filings (A)

22 Broadcom FY2025 Form 10-K / Annual Report — Broadcom / SEC — 2025 — https://investors.broadcom.com/financial-information/sec-filings (A)

23 OpenAI did not disclose GPT-4 model size, architecture or training compute in the GPT-4 Technical Report; market MoE claims remain unverified — OpenAI / arXiv + secondary market commentary — 2023-2026 — https://arxiv.org/abs/2303.08774 (A/C)

24 SemiAnalysis / market commentary on GPT-4 architecture, cited only as unverified C-level background — SemiAnalysis — 2023 — https://www.semianalysis.com/ (C)

source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型