激活率(Activation Rate)
3 秒看懂
激活率 = 每次推理实际调用的参数量 ÷ 模型总参数量。
在 MoE(混合专家)大模型时代,一个 671B 总参数的模型,推理时每个 token 可能只激活 37B 参数——激活率约 5.5%。这意味着”大模型不一定贵”,激活率直接决定了推理成本、显存带宽需求和算力消耗。
3 分钟产业解释
为什么激活率突然重要?
2023—2025 年,行业密集转向 MoE(Mixture of Experts)架构。Dense(稠密)模型的激活率恒为 100%,但 MoE 模型通过路由机制,让每个 token 只经过一小部分”专家”子网络。这带来一个核心变量——激活率。
| 模型类型 | 总参数 | 推理激活参数 | 激活率 | 代表模型 |
|---|---|---|---|---|
| Dense | 70B | 70B | 100% | Llama 2-70B |
| 小比例 MoE | ~46.7B | ~12.9B | ~27.6% | Mixtral 8×7B [Mistral 官方模型卡] |
| 大规模 MoE | ~671B | ~37B | ~5.5% | DeepSeek-V3 [DeepSeek-V3 技术报告] |
注:以上数字来自各模型发布方的官方技术报告/模型卡。激活参数 = 共享层参数 + 被路由选中的专家参数(不含未被选中的专家)。
产业影响链路
激活率低 → 每 token 推理算力需求低 → 推理成本下降
→ 但总参数量大 → 训练算力需求高、权重存储显存大
→ 推理时权重需驻留 HBM → 带宽瓶颈仍在
核心张力:激活率越低,推理越”便宜”(算力角度),但模型越大,存储和带宽越”贵”。这就是为什么 HBM 容量/带宽成为 MoE 推理的关键瓶颈——你不用计算所有参数,但你得把所有参数都”摆”在显存里(或用高效 offloading 方案)。
15 分钟专家深入
一、激活率的精确含义
在不同语境下,“激活率”至少有三层含义:
- MoE 全局激活率(最常用):单次前向传播中,被激活的参数占总参数的比例。
- 专家级激活率:在 N 个专家中,每个 token 被路由到 K 个,激活率 = K/N。
- 神经元激活率(Neuron Activation Rate):某一层中,激活函数输出非零值的神经元比例。在 ReLU 网络中,这通常远低于 100%(存在”死亡 ReLU”现象),影响稀疏计算优化。
当前产业讨论中,含义 1 和 2 是主流,含义 3 更多见于学术研究和推理优化领域。
二、MoE 激活率的计算
对于标准 MoE 层:
设:
N = 专家总数
K = 每 token 选中的专家数
D_shared = 共享层(attention、embedding 等)参数量
D_expert = 单个专家的参数量
D_total = D_shared + N × D_expert
D_active = D_shared + K × D_expert
激活率 = D_active / D_total
= (D_shared + K × D_expert) / (D_shared + N × D_expert)
关键洞察:
- 当 D_shared 很小时,激活率 ≈ K/N
- 当共享层参数占比大时(如 attention 全共享),激活率会显著高于 K/N
- DeepSeek 系列引入了 共享专家(Shared Expert) 机制,无论路由结果如何,共享专家始终被激活,这会提高激活率但增强模型稳定性
三、激活率与稀疏性的关系
激活率 = 1 - 稀疏度(Sparsity)。业界有时用”稀疏比”来表达同一概念:
稀疏比(Sparsity Ratio)= 1 - 激活率
= 未被激活的参数 / 总参数
高稀疏比(低激活率)意味着:
- ✅ 推理 FLOPs 低
- ✅ 推理延迟可接受(不比同规模 Dense 模型慢太多)
- ❌ 模型文件大、权重加载时间长
- ❌ 推理时 HBM 占用 = 全量参数,不因激活率低而减少
- ❌ 训练时需要 All-to-All 通信分发 token 到不同专家,通信开销大
技术原理
MoE 路由机制与激活率的底层关系
┌─────────────────────────────────────────────────┐
│ 输入 Token x │
│ │ │
│ ┌───────▼────────┐ │
│ │ Gate Network │ ← 轻量线性层 │
│ │ (Router) │ 输出 N 个分数 │
│ └───────┬────────┘ │
│ │ │
│ softmax(scores) │
│ │ │
│ Top-K 选择 (K << N) │
│ │ │
│ ┌─────┬─────┬─────┼─────┬─────┬─────┐ │
│ ▼ ▼ ▼ ▼ ▼ ▼ ▼ │
│ [E0] [E1] [E2] [E3] [E4] ... [EN-1] │
│ ✅ ✅ ❌ ❌ ❌ ❌ │
│ │ │ │
│ ▼ ▼ │
│ y = Σ(gate_score_i × E_i(x)), i ∈ top-K │
│ │
│ 激活的专家: K 个 │
│ 激活的参数: K × D_expert + D_shared │
└─────────────────────────────────────────────────┘
关键参数与超参:
| 参数 | 说明 | 典型范围 |
|---|---|---|
| N(专家总数) | MoE 层中的专家数量 | 8 ~ 256(趋势增大) |
| K(激活专家数) | 每 token 选中的专家 | 1 ~ 8 |
| K/N(专家激活率) | 单层激活比例 | ~1.6% ~ 50% |
| 全局激活率 | 含共享层的总参数激活比 | 视架构差异大 |
| capacity factor | 控制专家可处理的 token 上限 | 1.0 ~ 2.0 |
负载均衡与激活率的隐含成本
实际激活率 ≠ 理想激活率。路由可能出现负载不均衡(Load Imbalance):
- 少数”热门”专家被大量 token 选中 → 该专家计算成为瓶颈
- 部分专家几乎不被选中 → 参数浪费,等效激活率更低
- 解决方案:辅助损失(Auxiliary Loss / Load Balancing Loss)、Expert Choice 路由
注意:Megatron-LM 框架中,MoE 的 token 分发使用 All-to-All 通信原语(将 token 路由到不同 GPU 上的专家),这与 Dense 模型的张量并行(AllReduce/ReduceScatter)有本质区别。All-to-All 通信的数据量主要由每 token 激活的专家数 K 决定,与激活率并无直接反比关系,但同步开销不变。
神经元激活率(学术补充)
在使用 ReLU 激活函数的网络中,由于 ReLU 将负值截断为零,前向传播时同一层的输出中往往有 30%—70% 的神经元输出为零 [Glorot et al., 2011; Lu et al., 2019]。
这一”天然稀疏性”启发了:
- 稀疏推理加速
- 动态稀疏计算(只计算非零神经元)
- ReLU → GELU/SiLU 的趋势:现代 LLM 普遍使用 GELU/SiLU,这些激活函数不严格截断为零,神经元激活率更高,稀疏优化空间更小
技术演进史
| 时间 | 里程碑 | 激活率特征 |
|---|---|---|
| 2017 | Shazeer et al. 提出 Sparsely-Gated MoE | K=4, N=可达上千,激活率极低 |
| 2021 | Google Switch Transformer | N 达 2048,K=1,单层激活率 < 0.1%,但共享层占比小 |
| 2022 | Google GLaM (1.2T) | 64 专家,K=2,激活参数 96.6B |
| 2023.12 | Mixtral 8×7B (Mistral AI) | N=8, K=2,总参 ~46.7B,激活 ~12.9B,激活率 ~27.6% |
| 2024.05 | DeepSeek-V2 | N=160 路由专家 + 2 共享专家,K=6,总参 236B,激活 21B,激活率 ~8.9% |
| 2024.12 | DeepSeek-V3 | N=256 路由专家 + 1 共享专家,K=8,总参 671B,激活 37B,激活率 ~5.5% |
| 2025+ | 行业趋势 | 专家数继续扩大(256~1024),激活率进一步压低;共享专家机制普及 |
趋势总结:激活率从早期的 ~25-50% 逐步压低至 ~5%,以换取”用更大总参数量提升模型能力,同时控制推理成本”的红利。
技术路线对比
| 维度 | Dense 模型(激活率 100%) | MoE 模型(激活率 5-30%) | 评论 |
|---|---|---|---|
| 推理算力/token | 高(全参数前向) | 低(仅激活子集) | MoE 推理 FLOPs 优势显著 |
| 推理延迟 | 相对可预测 | 受路由开销、负载均衡影响 | MoE 有额外 overhead |
| HBM 占用 | = 总参数 × 精度 | = 总参数 × 精度(不因激活率低而减少!) | MoE 的隐性成本 |
| 训练通信 | AllReduce/ReduceScatter | All-to-All + AllReduce | MoE 通信更复杂 |
| 训练稳定性 | 较好 | 需要辅助损失、路由策略调参 | MoE 调试难度大 |
| Scaling 特性 | 参数↑→FLOPs 线性↑ | 参数↑→FLOPs 亚线性↑ | MoE 天然适合 scale |
| 量化友好度 | 成熟 | 专家间分布差异大,量化挑战更大 | 正在改进 |
上下游
上游(激活率依赖什么)
| 层级 | 关键依赖 | 说明 |
|---|---|---|
| 架构设计 | 专家数量 N、Top-K 策略、共享专家设计 | 直接决定激活率 |
| 路由算法 | Token Choice vs Expert Choice、哈希路由 | 影响实际有效激活率 |
| 负载均衡 | Auxiliary Loss 系数、Expert Balancing | 影响专家利用率 |
| 框架支持 | Megatron-LM、DeepSpeed-MoE、vLLM | MoE 并行与调度实现 |
| 硬件互联 | NVLink/NVSwitch 带宽 | All-to-All 通信瓶颈 |
下游(激活率影响什么)
| 层级 | 影响 | 说明 |
|---|---|---|
| 推理成本 | 每 token 算力成本 | 激活率越低,单位推理越便宜 |
| 推理吞吐 | tokens/s | 计算量降低,吞吐提升(前提:带宽不是瓶颈) |
| 服务部署 | GPU 数量需求 | 激活率低可减少计算 GPU,但存储需求不变 |
| 模型能力 | 总参数量 vs 激活率权衡 | 更多参数 + 低激活率 = 更强能力 + 可控成本 |
| 边缘部署 | 能否端侧运行 | 超低激活率 + 权重压缩 → 端侧 MoE 可能 |
关键指标
| 指标 | 定义 | 关注要点 |
|---|---|---|
| 全局激活率 | 激活参数/总参数 | 最核心的综合指标 |
| 专家激活率 K/N | 被选中专家/总专家数 | MoE 层的稀疏程度 |
| 有效激活率 | 考虑负载均衡后实际参与计算的参数比例 | 热门专家可能导致实际算力 > 理论 |
| 路由熵(Router Entropy) | 专家被选中概率分布的熵 | 熵高=均匀分配=激活率稳定 |
| 激活参数 FLOPs/token | 推理时每 token 的浮点运算量 | 直接影响推理延迟和算力成本 |
| 权重驻留量 | 推理时需驻留 HBM 的参数量 | ≈ 总参数量(MoE 的隐性瓶颈) |
供需与市场数据
推理成本经济学
激活率对推理成本的影响是行业关注焦点。以下为定性推算框架 [行业估算]:
Dense 70B 推理成本 ≈ 基准 C
MoE 671B (激活 37B) 推理成本 ≈ 37/70 × C × Overhead_factor
- Overhead_factor 包含:路由计算开销、All-to-All 通信、
负载不均衡导致的计算浪费
- 实际 Overhead_factor 通常在 1.1x ~ 1.5x 之间 [行业估算]
- 净效果:MoE 推理成本显著低于同等能力的 Dense 模型
对硬件需求的影响
- HBM 需求不变:MoE 模型总参数量大,即使激活率低,权重仍需全量驻留。671B 模型 FP16 需要约 1.34TB HBM,远超单卡容量 → 需要多卡张量并行存权重。
- 计算需求降低:等效 FLOPs 与激活参数量成正比,可使用更少的计算卡(或相同卡获得更高吞吐)。
- 带宽成为真正瓶颈:激活率低意味着算力利用率先触顶(roofline 模型中处于 memory-bound 区域),HBM 带宽成为吞吐上限的关键制约。
这一分析框架基于 roofline 模型和公开的推理性能基准推导,具体数字因部署方案、量化精度、批处理大小而异,属于 [行业估算] 范畴。
代表公司与资本映射
| 公司/团队 | 激活率相关策略 | 关注点 |
|---|---|---|
| DeepSeek(深度求索) | V2/V3 系列将激活率压至 ~5-9%,极致低激活率路线 | 共享专家设计、辅助损失无损化(bias-free routing) |
| Mistral AI | Mixtral 系列,8 专家 Top-2,激活率 ~27.6% | 较”保守”的 MoE 设计,工程成熟度高 |
| Google/DeepMind | Switch Transformer、GLaM 等开创性工作 | MoE 理论和系统优化的先驱 |
| NVIDIA | 通过 NVLink/NVSwitch 解决 MoE All-to-All 通信瓶颈 | 激活率低→通信成为瓶颈→NVLink 带宽价值凸显 |
| Groq | 定制 LPU 架构,关注确定性调度 | 对 MoE 路由调度有潜在优化空间 |
| vLLM / SGLang 等推理框架 | MoE 推理优化,专家并行、KV Cache 管理 | 开源推理生态的关键 |
资本映射逻辑
激活率持续走低
→ 推理算力需求增速放缓(同等能力模型推理更便宜)
→ 但总参数量继续膨胀 → HBM 容量/带宽需求持续增长
→ 瓶颈从"计算"转向"存储与通信"
→ 需求侧重点:HBM 供应商(SK 海力士、三星、美光)
→ 需求侧重点:高带宽互联(NVLink、CXL)
→ 需求侧重点:推理优化框架/芯片(关注存储带宽而非峰值算力)
→ 需重新审视:纯算力堆叠逻辑
投资逻辑
核心观点
-
激活率是理解”推理经济学”的核心变量。它解释了为什么 DeepSeek 能以远低于同等能力 Dense 模型的成本提供服务。
-
激活率走低 ≠ 算力需求走低。训练时仍需全参数更新;推理时权重需全量驻留 HBM。真正的瓶颈从计算转向存储带宽。
-
关注”有效激活率”而非纸面激活率。负载均衡差、路由坍缩等问题会导致实际算力消耗高于理论值。拥有高效路由和系统优化能力的团队有工程壁垒。
-
MoE 是主流方向,但 Dense 未死。中小模型、边缘部署、对推理延迟确定性要求极高的场景,Dense 模型仍有不可替代性。
-
硬件投资含义:峰值 FLOPs 的重要性相对下降,HBM 带宽和容量、芯片间互联带宽的重要性上升。
常见误读纠偏
误读一:「激活率低 = 推理显存占用低」
纠偏:完全错误。MoE 模型推理时,所有专家的权重都必须驻留在显存中(因为每个 token 的路由结果不同,你无法预知下次会激活哪些专家)。激活率低只降低了计算量(FLOPs),不降低存储量。这是最容易被忽视的 MoE 成本结构。
推理显存 ≈ 全部参数 × 精度字节数 + KV Cache + 激活值
≈ 与 Dense 同等总参量的模型类似
推理计算量 ≈ 激活参数 × 序列长度 × 常数
≈ 远低于同等总参量的 Dense 模型
误读二:「K/N = 全局激活率」
纠偏:不一定。全局激活率 = (D_shared + K × D_expert) / (D_shared + N × D_expert)。当共享层(Attention、Embedding、LayerNorm 等)参数占比较大时,全局激活率会显著高于 K/N。例如 DeepSeek-V3 的 K/N = 8/256 = 3.125%,但其全局激活率约 5.5%,差异来自共享层和共享专家的参数贡献。
误读三:「激活率越低越好」
纠偏:存在边际收益递减和质量拐点。激活率过低(如 K=1, N=极大)可能导致:
- 单个专家承载知识过少,出现”知识碎片化”
- 路由微小扰动导致输出大幅变化,模型鲁棒性下降
- 训练过程中专家利用率不均,部分专家”休眠”
业界当前的”甜蜜区”在 5%—30% 之间,具体取决于模型规模、训练数据量和下游任务。
误读四:「MoE 的 All-to-All 通信和 Dense 模型的 AllReduce 差不多」
纠偏:通信模式完全不同。
- Dense 张量并行:每个 GPU 计算完整层的一部分,通信模式是 AllReduce/ReduceScatter,通信量可预测。
- MoE 专家并行:token 需要路由到特定 GPU 上的特定专家,通信模式是 All-to-All,通信量取决于路由分布,天然不均衡,对互联拓扑和调度策略要求更高。
学习路径
入门(建立直觉)
- 阅读 Mistral AI 的 Mixtral 8×7B 公告博客,理解 MoE 的基本结构
- 理解 Top-K 路由的基本概念:为什么不是所有专家都激活
进阶(理解机制)
- 阅读 Fedus et al., “Switch Transformers” (2021) — 理解极端稀疏 MoE
- 阅读 DeepSeek-V2 技术报告 — 理解共享专家、MLA 等现代设计
- 学习 Megatron-LM 的 MoE 实现 — 理解 All-to-All 通信和专家并行
深入(工程与经济学)
- 用 roofline 模型分析 MoE 推理的算力 vs 带宽瓶颈
- 对比 Dense vs MoE 在相同推理预算下的能力表现
- 研究 vLLM/SGLang 中 MoE 推理的实际优化策略
推荐论文/资源
- Shazeer et al., “Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer” (2017)
- Fedus et al., “Switch Transformers” (2021)
- DeepSeek-V2 Technical Report (2024)
- DeepSeek-V3 Technical Report (2024)
- Megatron-LM GitHub — MoE 分支
- NVIDIA “Scaling Expert Language Models” blog (如有)
一句话总结
激活率是 MoE 大模型时代的核心成本杠杆——它用”少算”换”多知”,让万亿参数模型以百亿参数的成本推理,但显存和带宽的全量负担一分不少,真正的投资焦点应从峰值算力转向存储带宽与互联。
延伸阅读与来源
| 来源类型 | 内容 | 来源标注 |
|---|---|---|
| 官方模型卡 | Mixtral 8×7B 参数与架构 | [Mistral AI 官方模型卡] |
| 官方技术报告 | DeepSeek-V2 架构与激活参数 | [DeepSeek-V2 技术报告, 2024] |
| 官方技术报告 | DeepSeek-V3 架构与激活参数 | [DeepSeek-V3 技术报告, 2024] |
| 学术论文 | Switch Transformer | [Fedus et al., JMLR 2022] |
| 学术论文 | 原始 Sparsely-Gated MoE | [Shazeer et al., ICLR 2017] |
| 框架文档 | Megatron-LM MoE 实现 | [NVIDIA Megatron-LM GitHub] |
| 行业分析 | 推理成本与激活率关系 | [行业估算,非厂商官方披露] |
| 神经元稀疏性 | ReLU 激活稀疏度 | [Glorot et al., AISTATS 2011; Lu et al., NeurIPS 2019] |
⚠️ 声明:本文中未标注具体来源的数字为基于公开信息的定性推算或行业共识性表述。各模型的具体参数量/激活参数量以官方技术报告为准。本文不构成投资建议。