MoE 混合专家
1. 3 秒看懂
MoE 用 37B 激活参数撬动 671B 总参数,是云端推理成本下行、集群通信上行的结构性变量。1
2. 3 分钟产业解释
MoE(Mixture of Experts,混合专家)把 Transformer 的前馈层拆成多个专家网络,并由 router 在每个 token 上只选择 1-8 个专家,因此总参数规模与单 token 计算量被解耦。23 Mixtral 8x7B 是早期商业化样本,模型总参数 46.7B、每 token 激活 12.9B,Mistral 把它定位为“47B 容量、13B 推理成本”的开源路线。3 DeepSeek-V3 把这个逻辑推到 671B 总参数、37B 激活参数,并披露 14.8T tokens 预训练和 2.788M H800 GPU hours 全流程训练口径,使 MoE 从架构技巧变成云成本基准。1 GPT-4 官方技术报告没有披露参数、架构和训练硬件,市场关于“GPT-4 是 MoE”的说法只能列为 C 级推测,不能作为关键数字支撑。424
3. 15 分钟专家深入
MoE 的产业价值来自 3 个乘法项:第一,总参数决定知识容量,671B 级 DeepSeek-V3 或 675B 级 Mistral Large 3 能在推理时只激活 37B/41B 参数,从而把“模型能力”与“单 token FLOPs”拆开。15 第二,router、expert parallelism 和 all-to-all 通信把瓶颈从单卡矩阵乘迁移到跨 GPU 调度、HBM 容量、NVLink/InfiniBand/Ethernet 网络和 KV cache 管理,导致云平台的优化对象从“买更多 GPU”转向“用更高利用率跑更多 token”。16 第三,开源 MoE 降低了模型 API 的边际成本锚,DeepSeek-V3 披露的 2.788M H800 GPU hours 与 5.576 百万美元训练测算不是完整研发成本,但足以压低市场对闭源大模型训练成本的线性外推。1
技术上,MoE 并不等于“免费大模型”。Mixtral 8x7B 每 token 激活 2 个专家,DeepSeek-V3 在每层路由多个专家并使用 auxiliary-loss-free load balancing,路由不均衡会造成专家热点、尾延迟和集群碎片化。13 推理侧还必须把全部或大部分专家权重驻留在显存/HBM 中,因此 671B 总参数即使只激活 37B,也不能按 37B dense 模型估算内存占用。17 对云厂商而言,MoE 的利润传导不是单一 GPU 需求减少,而是“单位 token 成本下降 → 应用调用量上升 → 推理集群利用率提高 → 网络与内存占比提高”的再平衡。89
投资上,MoE 对 5 类公司影响相反:NVIDIA、AMD、Broadcom 和 Arista 受益于推理规模扩大、网络通信上升和系统级优化;Microsoft、Amazon、Alphabet 受益于单位推理成本下降和 AI 云需求扩张,但短期受资本开支、折旧和电力约束压制 FCF margin。81011 NVIDIA FY2027Q1 数据中心收入 75.2B 美元 [NVDA]、同比增长 92%,说明 AI 训练和推理需求仍在硬件侧兑现;Microsoft FY2026Q3 AI 业务年化收入超过 37B 美元、同比增长 123%,说明 MoE 这类效率路线更可能扩大可服务需求,而非立即削弱云 capex。810
4. 技术原理
MoE 层通常由 router、N 个 expert FFN、top-k 选择、capacity factor、load balancing loss 或无辅助损失均衡机制组成,每个 token 只进入 1-8 个专家并把输出加权汇总。123 Switch Transformer 使用 top-1 routing,把稀疏激活模型扩展到万亿参数级,并报告相对 T5-XXL 约 4x 预训练加速,这是 MoE 从论文走向大规模训练的关键证据。2 Mixtral 8x7B 使用 8 个专家、每 token 选择 2 个专家,因此 46.7B 总参数只激活 12.9B 参数。3 DeepSeek-V3 使用 671B 总参数和 37B 激活参数,并通过 Multi-head Latent Attention、DeepSeekMoE、FP8 mixed precision 和通信计算重叠,把 14.8T tokens 预训练压到 2.664M H800 GPU hours。1
5. 上游依赖 / 下游影响
上游依赖
- GPU/HBM:MoE 降低单 token FLOPs,但 46.7B-671B 总参数仍要求更多权重常驻显存,HBM 容量和带宽比 dense 小模型更难被压缩。13
- 网络互连:expert parallelism 会放大 all-to-all 通信,DeepSeek-V3 披露通过通信计算重叠降低 H800 集群互连约束,说明网络优化是 MoE 训练与推理的硬门槛。1
- 编译与调度软件:router 热点、专家负载均衡、batch packing 和 KV cache 管理决定实际 token/s,软件栈差异会把同一模型的成本拉开 20% 以上。16
- 云电力与机房:MoE 降低单位 token 能耗方向明确,但 hyperscaler 仍把 2026 年 capex 指引维持在高位,说明需求扩张快于效率节约。91011
下游影响
- 模型 API:开源 MoE 把 671B 级能力压到 37B 激活成本,使企业推理预算更偏向高频调用和长上下文应用。17
- 云 IaaS/PaaS:Azure、AWS、Google Cloud 的 AI 收入会从训练集群出租转向推理托管、模型路由、专用芯片和平台服务。91011
- 应用软件:单位 token 成本下降会提升 agent、代码、搜索、客服和 BI 的调用密度,但毛利率改善取决于应用定价是否慢于推理成本下降。810
6. 技术路线对比表
| 路线 | 速率/激活 | 功耗或成本方向 | 距离或维度 | 标准成熟度 | 2026 量产概率 | 反证指标 |
|---|---|---|---|---|---|---|
| Dense Transformer | 100% 参数激活 | FLOPs 与参数近似线性上升 | 7B-405B 参数常见 | 训练/推理生态最成熟 | 90% | 70B+ dense 单 token 成本高于 MoE 2x 以上且质量无优势 |
| Switch top-1 MoE | 每 token 1 个专家 | 计算最低但路由误差更敏感 | 万亿参数论文验证 | 学术成熟、商业较少直接复刻 | 35% | top-1 路由质量低于 top-2/top-8 且尾延迟无优势 |
| Mixtral top-2 MoE | 8 选 2,12.9B/46.7B 激活 | 推理成本接近 13B dense | 32K context | 开源生态成熟 | 75% | 同等质量下 dense 14B 的吞吐或内存成本更优 |
| DeepSeekMoE | 37B/671B 激活 | 训练披露 2.788M H800 GPU hours | 128K context | 开源权重和论文验证 | 80% | 真实云部署成本无法复制论文 GPU-hour 口径 |
| 闭源 GPT-4 类 MoE 推测 | 官方未披露 | 无法量化 | 参数/专家数未披露 | C 级传闻,不作事实 | 50% 推测 | OpenAI 官方继续不披露或披露为非 MoE 架构 |
| 专用推理 MoE 服务 | 动态路由 + speculative decoding | token 成本下降,网络占比上升 | 多模型路由/API 层 | 云厂自研成熟度高 | 70% | API 毛利率不随 token 成本下降改善 |
7. 关键指标
- 激活参数/总参数:Mixtral 为 12.9B/46.7B,DeepSeek-V3 为 37B/671B,该比值低于 10% 时推理 FLOPs 弹性最明显。13
- GPU-hour/token:DeepSeek-V3 披露 14.8T tokens 预训练用 2.664M H800 GPU hours,若同类模型高于 2x 则说明工程效率不足。1
- all-to-all 通信占比:DeepSeek-V3 通过通信计算重叠缓解 H800 互连瓶颈,若通信时间超过 step time 的 20%-30% 则 MoE 扩展效率会快速下降。1
- Expert load balance:单专家负载偏离均值超过 20% 会造成尾延迟和掉 token 风险,需跟踪 router entropy、capacity overflow 和 token drop rate。12
- 推理 token 毛利:云厂应跟踪
收入/token - GPU折旧/token - 电力/token - 网络/token,MoE 有效性最终落在单位 token 毛利而非参数规模。810 - 云 capex/AI 收入:Microsoft FY2026Q3 AI 年化收入 37B 美元、同比 123%,若 capex 增速持续高于 AI 收入增速则估值会从成长逻辑切到折旧压力。10
8. 可算传导表
| 传导变量 | NVIDIA | Microsoft Azure | Amazon AWS |
|---|---|---|---|
| TAM 起点 | FY2027Q1 数据中心收入 75.2B 美元 [NVDA],作为 AI 训练+推理硬件需求代理 | FY2026Q3 AI 业务年化收入 37B 美元,作为 Azure AI 需求代理 | 2026Q1 AWS 收入 37.6B 美元 [AWS],作为云推理承载代理 |
| MoE 渗透假设 | MoE 推理占 AI GPU 时长 25%/40%/55% | MoE API/托管模型占 AI 收入 20%/35%/50% | MoE 托管与 Bedrock/Trainium 推理占 AWS AI 负载 15%/30%/45% |
| 出货/用量 | 数据中心收入 × 推理占比 × MoE占比 ÷ 单GPU年收入代理,单GPU年收入代理未披露需情景化 | AI收入 × MoE占比 ÷ 每百万token收入,token 单价未披露需情景化 | AWS收入 × AI负载占比 × MoE占比 ÷ 推理实例年收入,AI负载占比未披露需情景化 |
| ASP/单价 | Blackwell 系统 ASP 未披露,使用数据中心收入代理而非写单卡价格 | Azure OpenAI/API 单 token 定价公开但折扣未披露,使用收入代理 | Bedrock/Trainium 折扣未披露,使用 AWS 收入代理 |
| 份额 | NVIDIA 数据中心 GPU 份额未由公司披露,行业常用 80%+ 为 C 级估算,关键模型标 [未核实 — 待补 A/B 源] | Azure 份额由云合同和 OpenAI 生态驱动,未披露单 MoE 份额 | AWS 份额由 Bedrock、Trainium 和 Anthropic 生态驱动,未披露单 MoE 份额 |
| 收入 | 中性情景:75.2B × 40% = 30.1B 美元 MoE相关季度硬件需求代理 | 中性情景:37B × 35% = 13.0B 美元 MoE相关年化AI收入代理 | 中性情景:37.6B × 20% AI负载 × 30% MoE = 2.26B 美元季度MoE承载收入代理 |
| 毛利 | 收入 × FY2027Q1 GAAP GM 74.9%,中性为 22.5B 美元毛利代理 | 收入 × Intelligent Cloud 毛利率,分部毛利率未单列则标 [未核实 — 待补 A/B 源] | 收入 × AWS operating margin 37.7%,中性为 0.85B 美元经营利润代理 |
| PE | 2026-05-27 美股收盘 TTM PE 32.56x,美元,StockAnalysis C 级 | 2026-05-27 美股收盘口径需行情站复核,C 级;示例使用 24.9x 附近不可作 A/B 数字 | 2026-05-27 美股收盘口径需行情站复核,C 级;示例使用 30x-32x 区间不可作 A/B 数字 |
| 估值 | MoE相关税后利润 × PE,需剔除训练/非MoE收入重叠 | MoE相关税后利润 × PE,需剔除 Copilot 与 Azure 基础收入重叠 | MoE相关税后利润 × PE,需剔除非 AI AWS 收入重叠 |
9. 同业硬指标对比表
| 公司 | 收入 | 增速 | GM | 净利 | FCF margin | 客户集中度 | 技术代际 | PE TTM | 反证条件 |
|---|---|---|---|---|---|---|---|---|---|
| NVIDIA | FY2027Q1 收入 81.6B 美元 [NVDA];数据中心 75.2B 美元 | 总收入 +85%;数据中心 +92% | GAAP GM 74.9% | 净利 58.3B 美元 | 季度 FCF margin 待 10-Q 复核 | 大客户集中度 10-K 披露为显著风险 | Blackwell/GB300、CUDA、NVLink、推理软件栈 | 32.56x [NVDA],2026-05-27 16:00 EDT,美元,C 级 | MoE 使 GPU-hour/token 下降但 token 需求未放大 |
| Microsoft | FY2026Q3 收入 82.9B 美元 [MSFT]10;Microsoft Cloud 54.5B 美元 [MSFT]10 | 收入 +18%;Azure +40% | 综合 GM 待 10-Q 复核 | 净利待 10-Q 复核 | FCF margin 待 10-Q 复核 | OpenAI 生态依赖高但未披露单客户收入 | Azure AI、OpenAI、Copilot、推理平台 | 约 24.9x [MSFT]18,2026-05-27 附近,C 级 | AI capex 增速高于 AI 收入且 Copilot ARPU 不上行 |
| Amazon | 2026Q1 收入 181.5B 美元;AWS 37.6B 美元 | 总收入 +17%;AWS +28% | 综合 GM 待 10-Q 复核 | 净利受 16.8B 美元非经营收益影响 | FCF margin 待 10-Q 复核 | AWS 客户分散但 AI 芯片客户未披露 | Bedrock、Trainium、Inferentia、Anthropic | 32.51x [AMZN],2026-05-27 16:00 EDT,C 级 | Trainium 利用率不足或 Bedrock 毛利低于 EC2 |
| Alphabet | 2026Q1 收入 109.9B 美元;Google Cloud 20.0B 美元 | 总收入 +22%;Cloud +63% | 综合 GM 待 10-Q 复核 | 净利 62.6B 美元 | FCF margin 受 35.7B 美元 capex 压制 | 广告收入集中但云 AI 客户未披露 | TPU、Gemini、Vertex AI、Search AI | 约 29.3x,2026-05-27 附近,C 级 | TPU 成本优势未转化为 Cloud operating margin |
| AMD | 2025 全年数据中心收入需 10-K 复核;MI300/MI350 为 AI 代理 | 数据中心增速待 10-K 复核 | GM 待 10-K 复核 | 净利待 10-K 复核 | FCF margin 待 10-K 复核 | 云 GPU 客户集中度未披露 | MI300/MI350、ROCm、推理 GPU | 行情站口径待补 C 源 | ROCm 生态无法承接 MoE 推理生产负载 |
| Broadcom | FY2025 半导体和 AI 网络/ASIC 收入需 10-K 复核 | AI 半导体收入高增但单 MoE 未披露 | GM 待 10-K 复核 | 净利待 10-K 复核 | FCF margin 待 10-K 复核 | 大型定制芯片客户集中 | Tomahawk、Jericho、定制 AI ASIC、CPO | 行情站口径待补 C 源 | MoE 通信强度不升或云厂转回通用 GPU |
10. 投资逻辑 + 业绩传导
MoE 的投资逻辑不是“模型变便宜所以硬件需求下降”,而是“单 token 成本下降 1 个台阶后,推理需求和模型总容量同时上升”。18 DeepSeek-V3 以 37B 激活参数承载 671B 总参数,证明云端模型能力可以在不线性放大 FLOPs 的情况下继续扩张;但全部专家权重、KV cache、路由通信和多租户调度仍会消耗 HBM、网络和机房电力。16 因此,MoE 对 NVIDIA/Broadcom/Arista 是“训练占比下降、推理和网络占比上升”的结构变化,对 Microsoft/Amazon/Alphabet 是“AI 收入弹性扩大、折旧和 capex 验证压力同步扩大”的利润表变化。891011
MoE 总参数扩大 / 激活参数下降
↓
单位 token FLOPs 下降 + 全量权重/HBM 仍高
↓
推理调用量上升 + all-to-all 通信上升
↓
GPU/HBM/网络/云平台利用率重新定价
↓
AI 云收入 - 折旧/电力/网络成本
↓
FCF margin × PE = 情景市值框架
11. 常见误读纠偏
误读 1:MoE 只激活 37B 参数,所以 671B 模型只需要 37B 模型的显存。
实际:DeepSeek-V3 每 token 激活 37B 参数,但推理服务仍要保存 671B 主模型权重和 14B MTP 模块相关权重,显存/HBM 需求更接近总参数而非激活参数。17
误读 2:DeepSeek-V3 的 5.576 百万美元训练成本等于完整研发成本。
实际:DeepSeek-V3 披露的是按 2.788M H800 GPU hours 和 2 美元/GPU-hour 假设计算的训练运行成本,不包含长期研发、人力、失败实验、数据、集群折旧和部署成本。1
误读 3:GPT-4 已被证实是 MoE,所以可以倒推出专家数和训练成本。
实际:OpenAI GPT-4 Technical Report 明确未披露模型规模、架构和训练硬件,任何 GPT-4 MoE 专家数、参数量和训练成本都只能作为 C 级市场推测,不能支撑关键数字。424
12. 最新事件
- [已发生] 2024-12:DeepSeek-V3 发布技术报告,披露 671B 总参数、37B 激活参数、14.8T tokens 和 2.788M H800 GPU hours,MoE 成为成本叙事核心。1
- [已发生] 2025-01:DeepSeek-R1 发布并开源 R1-Zero、R1 与 6 个蒸馏 dense 模型,强化“MoE 基座 + 推理时强化学习 + 蒸馏”的产业路线。12
- [已发生] 2025-12:Mistral 发布 Mistral Large 3,披露 675B 总参数、41B 激活参数和 256K context,说明欧洲开源前沿模型也转向大规模稀疏架构。5
- [已发生] 2026-04-29:Microsoft FY2026Q3 披露 AI 业务年化收入超过 37B 美元、同比增长 123%,Azure +40%,说明推理需求仍在云收入中兑现。10
- [已发生] 2026-05-20:NVIDIA FY2027Q1 披露数据中心收入 75.2B 美元、同比增长 92%,说明 MoE 效率提升尚未削弱 AI 硬件收入斜率。8
13. 来源 footnotes
1 DeepSeek-V3 Technical Report — DeepSeek-AI / arXiv — 2024-12 — https://arxiv.org/abs/2412.19437 (A)
2 Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity — Google Research / JMLR — 2022 — https://www.jmlr.org/papers/v23/21-0998.html (A)
3 Mixtral of Experts — Mistral AI / arXiv — 2024 — https://arxiv.org/abs/2401.04088 ; https://mistral.ai/news/mixtral-of-experts/ (A/B)
4 GPT-4 Technical Report — OpenAI / arXiv — 2023 — https://arxiv.org/abs/2303.08774 (A)
5 Introducing Mistral 3 — Mistral AI — 2025-12 — https://mistral.ai/news/mistral-3 (B)
6 DeepSeek-V3 GitHub model card and engineering notes — DeepSeek-AI — 2024-2026 — https://github.com/deepseek-ai/DeepSeek-V3 (B)
7 DeepSeek-V3 Hugging Face model card — DeepSeek-AI — 2024-2026 — https://huggingface.co/deepseek-ai/DeepSeek-V3 (B)
8 NVIDIA Announces Financial Results for First Quarter Fiscal 2027 — NVIDIA — 2026-05 — https://nvidianews.nvidia.com/news/nvidia-announces-financial-results-for-first-quarter-fiscal-2027 (B)
9 Alphabet Announces First Quarter 2026 Results — Alphabet Investor Relations — 2026-04 — https://s206.q4cdn.com/479360582/files/doc_financials/2026/q1/2026q1-alphabet-earnings-release.pdf (B)
10 Microsoft FY26 Q3 Earnings Release — Microsoft Investor Relations — 2026-04-29 — https://www.microsoft.com/en-us/investor/earnings/fy-2026-q3/press-release-webcast (B)
11 Amazon.com Announces First Quarter 2026 Results — Amazon Investor Relations — 2026-05 — https://s2.q4cdn.com/299287126/files/doc_earnings/2026/q1/earnings-result/AMZN-Q1-2026-Earnings-Release.pdf (B)
12 DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning — DeepSeek-AI / arXiv — 2025-01 — https://arxiv.org/abs/2501.12948 (A)
13 Amazon.com 2025 Annual Report / Form 10-K — Amazon / SEC — 2026 — https://s2.q4cdn.com/299287126/files/doc_financials/2026/ar/Amazon-2025-Annual-Report.pdf (A)
14 Alphabet 2025 Form 10-K — Alphabet / SEC — 2026 — https://www.sec.gov/Archives/edgar/data/1652044/000165204426000018/goog-20251231.htm (A)
15 NVIDIA FY2026 Form 10-K / Annual Report — NVIDIA / SEC — 2026 — https://investor.nvidia.com/financial-info/financial-reports/default.aspx (A)
16 Microsoft FY2025 Form 10-K / Annual Report — Microsoft / SEC — 2025 — https://www.microsoft.com/en-us/investor/annual-reports.aspx (A)
17 NVIDIA market cap and TTM PE snapshot, close 2026-05-27 16:00 EDT — StockAnalysis — 2026 — https://stockanalysis.com/stocks/nvda/financials/ratios/ (C)
18 Microsoft market cap and TTM PE snapshot, close near 2026-05-27 16:00 EDT — StockAnalysis / CompaniesMarketCap — 2026 — https://stockanalysis.com/stocks/msft/ ; https://companiesmarketcap.com/microsoft/pe-ratio/ (C)
19 Amazon market cap and TTM PE snapshot, close near 2026-05-27 16:00 EDT — StockAnalysis / FinanceCharts — 2026 — https://stockanalysis.com/stocks/amzn/market-cap/ ; https://www.financecharts.com/compare/AMZN/value/pe-ratio (C)
20 Alphabet market cap and TTM PE snapshot, close near 2026-05-27 16:00 EDT — StockAnalysis — 2026 — https://stockanalysis.com/stocks/goog/statistics/ (C)
21 AMD FY2025 Form 10-K / Annual Report — AMD / SEC — 2026 — https://ir.amd.com/financial-information/sec-filings (A)
22 Broadcom FY2025 Form 10-K / Annual Report — Broadcom / SEC — 2025 — https://investors.broadcom.com/financial-information/sec-filings (A)
23 OpenAI did not disclose GPT-4 model size, architecture or training compute in the GPT-4 Technical Report; market MoE claims remain unverified — OpenAI / arXiv + secondary market commentary — 2023-2026 — https://arxiv.org/abs/2303.08774 (A/C)
24 SemiAnalysis / market commentary on GPT-4 architecture, cited only as unverified C-level background — SemiAnalysis — 2023 — https://www.semianalysis.com/ (C)