模型层 含付费深读

MoE 混合专家

Mixture of Experts

概念 ID
cloud-moe
更新时间
2026-05-28
来源数量
24

MoE 混合专家

1. 3 秒看懂

MoE 用 37B 激活参数撬动 671B 总参数,是云端推理成本下行、集群通信上行的结构性变量。1

2. 3 分钟产业解释

MoE(Mixture of Experts,混合专家)把 Transformer 的前馈层拆成多个专家网络,并由 router 在每个 token 上只选择 1-8 个专家,因此总参数规模与单 token 计算量被解耦。23 Mixtral 8x7B 是早期商业化样本,模型总参数 46.7B、每 token 激活 12.9B,Mistral 把它定位为“47B 容量、13B 推理成本”的开源路线。3 DeepSeek-V3 把这个逻辑推到 671B 总参数、37B 激活参数,并披露 14.8T tokens 预训练和 2.788M H800 GPU hours 全流程训练口径,使 MoE 从架构技巧变成云成本基准。1 GPT-4 官方技术报告没有披露参数、架构和训练硬件,市场关于“GPT-4 是 MoE”的说法只能列为 C 级推测,不能作为关键数字支撑。424

3. 15 分钟专家深入

MoE 的产业价值来自 3 个乘法项:第一,总参数决定知识容量,671B 级 DeepSeek-V3 或 675B 级 Mistral Large 3 能在推理时只激活 37B/41B 参数,从而把“模型能力”与“单 token FLOPs”拆开。15 第二,router、expert parallelism 和 all-to-all 通信把瓶颈从单卡矩阵乘迁移到跨 GPU 调度、HBM 容量、NVLink/InfiniBand/Ethernet 网络和 KV cache 管理,导致云平台的优化对象从“买更多 GPU”转向“用更高利用率跑更多 token”。16 第三,开源 MoE 降低了模型 API 的边际成本锚,DeepSeek-V3 披露的 2.788M H800 GPU hours 与 5.576 百万美元训练测算不是完整研发成本,但足以压低市场对闭源大模型训练成本的线性外推。1

技术上,MoE 并不等于“免费大模型”。Mixtral 8x7B 每 token 激活 2 个专家,DeepSeek-V3 在每层路由多个专家并使用 auxiliary-loss-free load balancing,路由不均衡会造成专家热点、尾延迟和集群碎片化。13 推理侧还必须把全部或大部分专家权重驻留在显存/HBM 中,因此 671B 总参数即使只激活 37B,也不能按 37B dense 模型估算内存占用。17 对云厂商而言,MoE 的利润传导不是单一 GPU 需求减少,而是“单位 token 成本下降 → 应用调用量上升 → 推理集群利用率提高 → 网络与内存占比提高”的再平衡。89

投资上,MoE 对 5 类公司影响相反:NVIDIA、AMD、Broadcom 和 Arista 受益于推理规模扩大、网络通信上升和系统级优化;Microsoft、Amazon、Alphabet 受益于单位推理成本下降和 AI 云需求扩张,但短期受资本开支、折旧和电力约束压制 FCF margin。81011 NVIDIA FY2027Q1 数据中心收入 75.2B 美元 [NVDA]、同比增长 92%,说明 AI 训练和推理需求仍在硬件侧兑现;Microsoft FY2026Q3 AI 业务年化收入超过 37B 美元、同比增长 123%,说明 MoE 这类效率路线更可能扩大可服务需求,而非立即削弱云 capex。810

4. 技术原理

MoE 层通常由 router、N 个 expert FFN、top-k 选择、capacity factor、load balancing loss 或无辅助损失均衡机制组成,每个 token 只进入 1-8 个专家并把输出加权汇总。123 Switch Transformer 使用 top-1 routing,把稀疏激活模型扩展到万亿参数级,并报告相对 T5-XXL 约 4x 预训练加速,这是 MoE 从论文走向大规模训练的关键证据。2 Mixtral 8x7B 使用 8 个专家、每 token 选择 2 个专家,因此 46.7B 总参数只激活 12.9B 参数。3 DeepSeek-V3 使用 671B 总参数和 37B 激活参数,并通过 Multi-head Latent Attention、DeepSeekMoE、FP8 mixed precision 和通信计算重叠,把 14.8T tokens 预训练压到 2.664M H800 GPU hours。1

5. 上游依赖 / 下游影响

上游依赖

  • GPU/HBM:MoE 降低单 token FLOPs,但 46.7B-671B 总参数仍要求更多权重常驻显存,HBM 容量和带宽比 dense 小模型更难被压缩。13
  • 网络互连:expert parallelism 会放大 all-to-all 通信,DeepSeek-V3 披露通过通信计算重叠降低 H800 集群互连约束,说明网络优化是 MoE 训练与推理的硬门槛。1
  • 编译与调度软件:router 热点、专家负载均衡、batch packing 和 KV cache 管理决定实际 token/s,软件栈差异会把同一模型的成本拉开 20% 以上。16
  • 云电力与机房:MoE 降低单位 token 能耗方向明确,但 hyperscaler 仍把 2026 年 capex 指引维持在高位,说明需求扩张快于效率节约。91011

下游影响

  • 模型 API:开源 MoE 把 671B 级能力压到 37B 激活成本,使企业推理预算更偏向高频调用和长上下文应用。17
  • 云 IaaS/PaaS:Azure、AWS、Google Cloud 的 AI 收入会从训练集群出租转向推理托管、模型路由、专用芯片和平台服务。91011
  • 应用软件:单位 token 成本下降会提升 agent、代码、搜索、客服和 BI 的调用密度,但毛利率改善取决于应用定价是否慢于推理成本下降。810

6. 技术路线对比表

路线速率/激活功耗或成本方向距离或维度标准成熟度2026 量产概率反证指标
Dense Transformer100% 参数激活FLOPs 与参数近似线性上升7B-405B 参数常见训练/推理生态最成熟90%70B+ dense 单 token 成本高于 MoE 2x 以上且质量无优势
Switch top-1 MoE每 token 1 个专家计算最低但路由误差更敏感万亿参数论文验证学术成熟、商业较少直接复刻35%top-1 路由质量低于 top-2/top-8 且尾延迟无优势
Mixtral top-2 MoE8 选 2,12.9B/46.7B 激活推理成本接近 13B dense32K context开源生态成熟75%同等质量下 dense 14B 的吞吐或内存成本更优
DeepSeekMoE37B/671B 激活训练披露 2.788M H800 GPU hours128K context开源权重和论文验证80%真实云部署成本无法复制论文 GPU-hour 口径
闭源 GPT-4 类 MoE 推测官方未披露无法量化参数/专家数未披露C 级传闻,不作事实50% 推测OpenAI 官方继续不披露或披露为非 MoE 架构
专用推理 MoE 服务动态路由 + speculative decodingtoken 成本下降,网络占比上升多模型路由/API 层云厂自研成熟度高70%API 毛利率不随 token 成本下降改善

7. 关键指标

  • 激活参数/总参数:Mixtral 为 12.9B/46.7B,DeepSeek-V3 为 37B/671B,该比值低于 10% 时推理 FLOPs 弹性最明显。13
  • GPU-hour/token:DeepSeek-V3 披露 14.8T tokens 预训练用 2.664M H800 GPU hours,若同类模型高于 2x 则说明工程效率不足。1
  • all-to-all 通信占比:DeepSeek-V3 通过通信计算重叠缓解 H800 互连瓶颈,若通信时间超过 step time 的 20%-30% 则 MoE 扩展效率会快速下降。1
  • Expert load balance:单专家负载偏离均值超过 20% 会造成尾延迟和掉 token 风险,需跟踪 router entropy、capacity overflow 和 token drop rate。12
  • 推理 token 毛利:云厂应跟踪 收入/token - GPU折旧/token - 电力/token - 网络/token,MoE 有效性最终落在单位 token 毛利而非参数规模。810
  • 云 capex/AI 收入:Microsoft FY2026Q3 AI 年化收入 37B 美元、同比 123%,若 capex 增速持续高于 AI 收入增速则估值会从成长逻辑切到折旧压力。10

8. 可算传导表

传导变量NVIDIAMicrosoft AzureAmazon AWS
TAM 起点FY2027Q1 数据中心收入 75.2B 美元 [NVDA],作为 AI 训练+推理硬件需求代理FY2026Q3 AI 业务年化收入 37B 美元,作为 Azure AI 需求代理2026Q1 AWS 收入 37.6B 美元 [AWS],作为云推理承载代理
MoE 渗透假设MoE 推理占 AI GPU 时长 25%/40%/55%MoE API/托管模型占 AI 收入 20%/35%/50%MoE 托管与 Bedrock/Trainium 推理占 AWS AI 负载 15%/30%/45%
出货/用量数据中心收入 × 推理占比 × MoE占比 ÷ 单GPU年收入代理,单GPU年收入代理未披露需情景化AI收入 × MoE占比 ÷ 每百万token收入,token 单价未披露需情景化AWS收入 × AI负载占比 × MoE占比 ÷ 推理实例年收入,AI负载占比未披露需情景化
ASP/单价Blackwell 系统 ASP 未披露,使用数据中心收入代理而非写单卡价格Azure OpenAI/API 单 token 定价公开但折扣未披露,使用收入代理Bedrock/Trainium 折扣未披露,使用 AWS 收入代理
份额NVIDIA 数据中心 GPU 份额未由公司披露,行业常用 80%+ 为 C 级估算,关键模型标 [未核实 — 待补 A/B 源]Azure 份额由云合同和 OpenAI 生态驱动,未披露单 MoE 份额AWS 份额由 Bedrock、Trainium 和 Anthropic 生态驱动,未披露单 MoE 份额
收入中性情景:75.2B × 40% = 30.1B 美元 MoE相关季度硬件需求代理中性情景:37B × 35% = 13.0B 美元 MoE相关年化AI收入代理中性情景:37.6B × 20% AI负载 × 30% MoE = 2.26B 美元季度MoE承载收入代理
毛利收入 × FY2027Q1 GAAP GM 74.9%,中性为 22.5B 美元毛利代理收入 × Intelligent Cloud 毛利率,分部毛利率未单列则标 [未核实 — 待补 A/B 源]收入 × AWS operating margin 37.7%,中性为 0.85B 美元经营利润代理
PE2026-05-27 美股收盘 TTM PE 32.56x,美元,StockAnalysis C 级2026-05-27 美股收盘口径需行情站复核,C 级;示例使用 24.9x 附近不可作 A/B 数字2026-05-27 美股收盘口径需行情站复核,C 级;示例使用 30x-32x 区间不可作 A/B 数字
估值MoE相关税后利润 × PE,需剔除训练/非MoE收入重叠MoE相关税后利润 × PE,需剔除 Copilot 与 Azure 基础收入重叠MoE相关税后利润 × PE,需剔除非 AI AWS 收入重叠

9. 同业硬指标对比表

公司收入增速GM净利FCF margin客户集中度技术代际PE TTM反证条件
NVIDIAFY2027Q1 收入 81.6B 美元 [NVDA];数据中心 75.2B 美元总收入 +85%;数据中心 +92%GAAP GM 74.9%净利 58.3B 美元季度 FCF margin 待 10-Q 复核大客户集中度 10-K 披露为显著风险Blackwell/GB300、CUDA、NVLink、推理软件栈32.56x [NVDA],2026-05-27 16:00 EDT,美元,C 级MoE 使 GPU-hour/token 下降但 token 需求未放大
MicrosoftFY2026Q3 收入 82.9B 美元 [MSFT]10;Microsoft Cloud 54.5B 美元 [MSFT]10收入 +18%;Azure +40%综合 GM 待 10-Q 复核净利待 10-Q 复核FCF margin 待 10-Q 复核OpenAI 生态依赖高但未披露单客户收入Azure AI、OpenAI、Copilot、推理平台约 24.9x [MSFT]18,2026-05-27 附近,C 级AI capex 增速高于 AI 收入且 Copilot ARPU 不上行
Amazon2026Q1 收入 181.5B 美元;AWS 37.6B 美元总收入 +17%;AWS +28%综合 GM 待 10-Q 复核净利受 16.8B 美元非经营收益影响FCF margin 待 10-Q 复核AWS 客户分散但 AI 芯片客户未披露Bedrock、Trainium、Inferentia、Anthropic32.51x [AMZN],2026-05-27 16:00 EDT,C 级Trainium 利用率不足或 Bedrock 毛利低于 EC2
Alphabet2026Q1 收入 109.9B 美元;Google Cloud 20.0B 美元总收入 +22%;Cloud +63%综合 GM 待 10-Q 复核净利 62.6B 美元FCF margin 受 35.7B 美元 capex 压制广告收入集中但云 AI 客户未披露TPU、Gemini、Vertex AI、Search AI约 29.3x,2026-05-27 附近,C 级TPU 成本优势未转化为 Cloud operating margin
AMD2025 全年数据中心收入需 10-K 复核;MI300/MI350 为 AI 代理数据中心增速待 10-K 复核GM 待 10-K 复核净利待 10-K 复核FCF margin 待 10-K 复核云 GPU 客户集中度未披露MI300/MI350、ROCm、推理 GPU行情站口径待补 C 源ROCm 生态无法承接 MoE 推理生产负载
BroadcomFY2025 半导体和 AI 网络/ASIC 收入需 10-K 复核AI 半导体收入高增但单 MoE 未披露GM 待 10-K 复核净利待 10-K 复核FCF margin 待 10-K 复核大型定制芯片客户集中Tomahawk、Jericho、定制 AI ASIC、CPO行情站口径待补 C 源MoE 通信强度不升或云厂转回通用 GPU

10. 投资逻辑 + 业绩传导

MoE 的投资逻辑不是“模型变便宜所以硬件需求下降”,而是“单 token 成本下降 1 个台阶后,推理需求和模型总容量同时上升”。18 DeepSeek-V3 以 37B 激活参数承载 671B 总参数,证明云端模型能力可以在不线性放大 FLOPs 的情况下继续扩张;但全部专家权重、KV cache、路由通信和多租户调度仍会消耗 HBM、网络和机房电力。16 因此,MoE 对 NVIDIA/Broadcom/Arista 是“训练占比下降、推理和网络占比上升”的结构变化,对 Microsoft/Amazon/Alphabet 是“AI 收入弹性扩大、折旧和 capex 验证压力同步扩大”的利润表变化。891011

MoE 总参数扩大 / 激活参数下降
        ↓
单位 token FLOPs 下降 + 全量权重/HBM 仍高
        ↓
推理调用量上升 + all-to-all 通信上升
        ↓
GPU/HBM/网络/云平台利用率重新定价
        ↓
AI 云收入 - 折旧/电力/网络成本
        ↓
FCF margin × PE = 情景市值框架

11. 常见误读纠偏

误读 1:MoE 只激活 37B 参数,所以 671B 模型只需要 37B 模型的显存。

实际:DeepSeek-V3 每 token 激活 37B 参数,但推理服务仍要保存 671B 主模型权重和 14B MTP 模块相关权重,显存/HBM 需求更接近总参数而非激活参数。17

误读 2:DeepSeek-V3 的 5.576 百万美元训练成本等于完整研发成本。

实际:DeepSeek-V3 披露的是按 2.788M H800 GPU hours 和 2 美元/GPU-hour 假设计算的训练运行成本,不包含长期研发、人力、失败实验、数据、集群折旧和部署成本。1

误读 3:GPT-4 已被证实是 MoE,所以可以倒推出专家数和训练成本。

实际:OpenAI GPT-4 Technical Report 明确未披露模型规模、架构和训练硬件,任何 GPT-4 MoE 专家数、参数量和训练成本都只能作为 C 级市场推测,不能支撑关键数字。424

12. 最新事件

  • [已发生] 2024-12:DeepSeek-V3 发布技术报告,披露 671B 总参数、37B 激活参数、14.8T tokens 和 2.788M H800 GPU hours,MoE 成为成本叙事核心。1
  • [已发生] 2025-01:DeepSeek-R1 发布并开源 R1-Zero、R1 与 6 个蒸馏 dense 模型,强化“MoE 基座 + 推理时强化学习 + 蒸馏”的产业路线。12
  • [已发生] 2025-12:Mistral 发布 Mistral Large 3,披露 675B 总参数、41B 激活参数和 256K context,说明欧洲开源前沿模型也转向大规模稀疏架构。5
  • [已发生] 2026-04-29:Microsoft FY2026Q3 披露 AI 业务年化收入超过 37B 美元、同比增长 123%,Azure +40%,说明推理需求仍在云收入中兑现。10
  • [已发生] 2026-05-20:NVIDIA FY2027Q1 披露数据中心收入 75.2B 美元、同比增长 92%,说明 MoE 效率提升尚未削弱 AI 硬件收入斜率。8

13. 来源 footnotes

1 DeepSeek-V3 Technical Report — DeepSeek-AI / arXiv — 2024-12 — https://arxiv.org/abs/2412.19437 (A)

2 Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity — Google Research / JMLR — 2022 — https://www.jmlr.org/papers/v23/21-0998.html (A)

3 Mixtral of Experts — Mistral AI / arXiv — 2024 — https://arxiv.org/abs/2401.04088 ; https://mistral.ai/news/mixtral-of-experts/ (A/B)

4 GPT-4 Technical Report — OpenAI / arXiv — 2023 — https://arxiv.org/abs/2303.08774 (A)

5 Introducing Mistral 3 — Mistral AI — 2025-12 — https://mistral.ai/news/mistral-3 (B)

6 DeepSeek-V3 GitHub model card and engineering notes — DeepSeek-AI — 2024-2026 — https://github.com/deepseek-ai/DeepSeek-V3 (B)

7 DeepSeek-V3 Hugging Face model card — DeepSeek-AI — 2024-2026 — https://huggingface.co/deepseek-ai/DeepSeek-V3 (B)

8 NVIDIA Announces Financial Results for First Quarter Fiscal 2027 — NVIDIA — 2026-05 — https://nvidianews.nvidia.com/news/nvidia-announces-financial-results-for-first-quarter-fiscal-2027 (B)

9 Alphabet Announces First Quarter 2026 Results — Alphabet Investor Relations — 2026-04 — https://s206.q4cdn.com/479360582/files/doc_financials/2026/q1/2026q1-alphabet-earnings-release.pdf (B)

10 Microsoft FY26 Q3 Earnings Release — Microsoft Investor Relations — 2026-04-29 — https://www.microsoft.com/en-us/investor/earnings/fy-2026-q3/press-release-webcast (B)

11 Amazon.com Announces First Quarter 2026 Results — Amazon Investor Relations — 2026-05 — https://s2.q4cdn.com/299287126/files/doc_earnings/2026/q1/earnings-result/AMZN-Q1-2026-Earnings-Release.pdf (B)

12 DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning — DeepSeek-AI / arXiv — 2025-01 — https://arxiv.org/abs/2501.12948 (A)

13 Amazon.com 2025 Annual Report / Form 10-K — Amazon / SEC — 2026 — https://s2.q4cdn.com/299287126/files/doc_financials/2026/ar/Amazon-2025-Annual-Report.pdf (A)

14 Alphabet 2025 Form 10-K — Alphabet / SEC — 2026 — https://www.sec.gov/Archives/edgar/data/1652044/000165204426000018/goog-20251231.htm (A)

15 NVIDIA FY2026 Form 10-K / Annual Report — NVIDIA / SEC — 2026 — https://investor.nvidia.com/financial-info/financial-reports/default.aspx (A)

16 Microsoft FY2025 Form 10-K / Annual Report — Microsoft / SEC — 2025 — https://www.microsoft.com/en-us/investor/annual-reports.aspx (A)

17 NVIDIA market cap and TTM PE snapshot, close 2026-05-27 16:00 EDT — StockAnalysis — 2026 — https://stockanalysis.com/stocks/nvda/financials/ratios/ (C)

18 Microsoft market cap and TTM PE snapshot, close near 2026-05-27 16:00 EDT — StockAnalysis / CompaniesMarketCap — 2026 — https://stockanalysis.com/stocks/msft/ ; https://companiesmarketcap.com/microsoft/pe-ratio/ (C)

19 Amazon market cap and TTM PE snapshot, close near 2026-05-27 16:00 EDT — StockAnalysis / FinanceCharts — 2026 — https://stockanalysis.com/stocks/amzn/market-cap/ ; https://www.financecharts.com/compare/AMZN/value/pe-ratio (C)

20 Alphabet market cap and TTM PE snapshot, close near 2026-05-27 16:00 EDT — StockAnalysis — 2026 — https://stockanalysis.com/stocks/goog/statistics/ (C)

21 AMD FY2025 Form 10-K / Annual Report — AMD / SEC — 2026 — https://ir.amd.com/financial-information/sec-filings (A)

22 Broadcom FY2025 Form 10-K / Annual Report — Broadcom / SEC — 2025 — https://investors.broadcom.com/financial-information/sec-filings (A)

23 OpenAI did not disclose GPT-4 model size, architecture or training compute in the GPT-4 Technical Report; market MoE claims remain unverified — OpenAI / arXiv + secondary market commentary — 2023-2026 — https://arxiv.org/abs/2303.08774 (A/C)

24 SemiAnalysis / market commentary on GPT-4 architecture, cited only as unverified C-level background — SemiAnalysis — 2023 — https://www.semianalysis.com/ (C)

source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型