激活参数
3 秒看懂
激活参数(Active Parameters)指在稀疏混合专家(MoE)模型中,处理单次输入(一个 token)时实际参与计算的那一部分参数数量。它直接决定推理的计算量、显存带宽需求与延迟,因此比“总参数”更真实地反映模型的运行成本与部署门槛。一个典型例子:DeepSeek‑V2 总参数 236B,激活参数仅约 21B——单次推理仅约 9% 的权重被使用。
关键结论:激活参数是 MoE 时代评估大模型“实际大小”和推理效率的第一性指标。
3 分钟产业解释
在大语言模型(LLM)竞赛中,单纯增加稠密(Dense)模型的总参数量会带来平方级增长的算力和显存开销,难以持续。混合专家模型(MoE)通过“稀疏激活”突破这一瓶颈:它将前馈网络子层(FFN)复制为多份“专家”(Expert),每次推理仅激活其中少数几个。这样一来,总参数量可膨胀到数千亿甚至万亿,但每次推理实际使用的参数被控制在百亿甚至几十亿级别。
从产业视角看,激活参数的意义有两层:
- 推理成本锚点:部署一台模型所需的 GPU 数量、显存占用、批处理吞吐量主要取决于激活参数,而非总参数。
- 能力与效率的平衡点:更大的总参数带来更强的知识与推理能力,而较小的激活参数保证推理速度与成本可控。
因此,在模型选型、采购算力、评估推理服务定价时,激活参数已经成为比总参数更重要的技术经济指标。
技术原理
为什么需要激活参数
稠密 Transformer 中,每个 token 在每一层都会遍历全部参数,参数量与计算量严格正比。MoE 则将部分子层(通常是 FFN)替换为一组并行的“专家”模块,通过一个路由网络(Gating/Router)为每个 token 选择一个或几个专家。这使模型总容量急剧扩大,但单个 token 的路径只经过被选中的专家,出现了“总参数”与“实际使用参数”的分离,激活参数概念由此诞生。
激活参数的实际构成
以典型 MoE 层为例,一个 token 的激活参数包含:
- 共享部分:注意力层的 Q/K/V/O 投影、LayerNorm、嵌入查找(仅对应 token 的行向量,参数量
hidden_size)、路由网络本身(通常很小)。 - 被激活的专家参数:每个专家通常包含两个线性层(及门控线性单元变体所需的参数),只计算被路由器选中的 top‑k 个专家。
- 其他固定开销:如偏置项(如果存在)。
因此,激活参数 ≈ 非专家部分参数量 + top‑k ×(单个专家参数量)。在 top‑k 路由策略固定、共享专家与路由结构已确定的前提下,该数量可按照每个 token 的静态计算路径精确统计,通常可由模型的 config.json 中的字段推导得出。
激活参数的计算方法
稀疏 MoE 模型的激活参数可通过其配置文件推导。以公开模型为例,配置中会明确 hidden_size、intermediate_size、num_experts、num_experts_per_tok 等关键字段。激活参数构成包括:共享的注意力层参数、激活的专家 FFN 参数、嵌入查找的对应行(参数量 hidden_size)等。由于不同模型的 FFN 结构差异,精确计算需结合具体变体,但原理一致:激活参数 = 非专家部分参数量 + top_k × 单个专家参数量。
每层自注意力参数
- Q、K、V 投影:各有权重
[hidden_size, hidden_size],参数量hidden_size² - 输出投影:同样
hidden_size² - 总计注意力部分:
4 × hidden_size²
每层 MoE‑FFN 激活参数
- 若专家使用 SwiGLU 变体,其内部通常包含门控投影与两个线性变换,精确参数量取决于实现。
- 每 token 激活 top‑k 个专家,故每层激活的专家参数 ≈
top_k ×(单个专家实际参数量)。
嵌入层与最终层归一化
- 词嵌入查找:每个 token 只激活嵌入矩阵的一行,激活参数量为
hidden_size(非完整矩阵)。 - 输出头:若与嵌入层共享权重则不额外增加。
总激活参数估算
依据具体模型的 config 统计即可得到总参数与激活参数。以 DeepSeek‑V2 为例,总参数 236B,激活参数约 21B,占比约 9%(2024 年公开数据,来源:DeepSeek‑V2 技术报告与模型卡)。
激活参数与总参数的分离机制
路由网络的选择机制会影响不同专家的工作负载均衡,但与激活参数量本身无关。激活参数只关心“有多少个参数会被某次前向/反向传播触及”,而不管数据被分发到哪个专家。因此激活参数是架构级的刚性指标。
硬件负荷映射
一个 token 推理:
┌──────────────────────┐
│ 嵌入查找 (共享) │
├──────────────────────┤
│ 第1层: │
│ 注意力 QKV/O (共享)│
│ 路由选择 → 专家i,j │
│ 专家i FFN 计算 │
│ 专家j FFN 计算 │
├──────────────────────┤
│ ... 重复多层 ... │
├──────────────────────┤
│ 输出头 (共享) │
└──────────────────────┘
实际需要读取的总权重即模型的激活参数量。
计算量 FLOPs ≈ 2 × 激活参数量(前向),显存占用则由激活参数的半精度副本和 KV Cache 等决定。因此激活参数所对应的延迟和硬件需求与同等规模的稠密模型大致相当,但仍有路由、All‑to‑All 通信等额外开销。
关键参数
- 激活参数量(Active Parameters):单 token 前向所涉及的参数总数,以 B(十亿)为单位。
- 激活/总参之比(Activation Ratio):激活参数 ÷ 总参数,值越小代表“稀疏度”越高,通常 2%~20%。
- 专家利用率(Expert Utilization):实际训练/推理中各专家被选中的频率分布是否均衡,影响计算效率和模型质量。
- 每 token FLOPs:约 2 × 激活参数量(前向,忽略 softmax 等),用于预估硬件算力需求。
- 内存带宽需求:与激活参数正相关,实际还受 KV Cache 大小、批大小影响。
- 专家数量与 top‑k:
num_experts和num_experts_per_tok直接决定稀疏度与激活参数占比。 - 单专家参数量:取决于
hidden_size与intermediate_size,以及 FFN 变体结构。
技术路线
技术演进脉络
- 2017 – Transformer 诞生:所有参数对每个 token 全量激活,总参数即激活参数。
- 2020 – GShard:Google 将 MoE 引入大规模 Transformers,首次明确区分总参数与每次推理使用的参数。
- 2021 – Switch Transformer:提出 top‑1 路由,总参数可至万亿,激活参数被控制在百亿级别。
- 2021 – GLaM:Google 进一步平衡专家容量,激活参数约 97B,约为总参数(约 1.2T)的 8%(来源:GLaM 论文,2022 年发布)。
- 2023 – Mixtral 8×7B:Mistral AI 推出开源 MoE 模型,总参数 46.7B,激活参数约 12.9B,引发开发者社区对激活参数的广泛讨论(来源:Mistral AI 官方博客,2023 年 12 月)。
- 2024 – DeepSeek‑V2:公开标识“236B‑A21B”,使激活参数成为模型命名的标准字段(来源:DeepSeek‑V2 技术报告,2024 年)。
- 2024 末至今:业界普遍将激活参数列入模型卡核心信息,推理优化框架专门针对激活参数做算子融合与通信优化。
稠密模型与 MoE 模型对比
| 指标 | 稠密模型 (Dense) | 稀疏混合专家模型 (MoE) |
|---|---|---|
| 总参数量 | 数十亿~数百亿 | 数百亿~数万亿 |
| 激活参数 | 等于总参数 | 远小于总参数(通常 1%~20%) |
| 单 token 延迟 | 与总参数严格正比 | 主要由激活参数决定,额外有路由器开销与 All‑to‑All 通信 |
| 训练效率 | 较简单,标准数据并行/张量并行 | 专家负载不均衡、通信复杂,需专门优化 |
| 知识容量 | 受限于前馈层宽度 | 通过大量专家实现更高知识密度 |
| 显存占用 | 约等于总参数 × 精度 + 优化器状态 | 总参数需全部驻留,但只部分被激活;对显存要求高,但计算访存比更友好 |
| 推理成本 | 与总参数正相关 | 与激活参数大致正比,但需考虑路由与通信开销 |
| 代表案例 | GPT‑3 175B、LLaMA 65B(早期) | Mixtral、DeepSeek‑V2、GPT‑4(传闻) |
当前主流路线
- 细粒度专家路由:将单个 FFN 拆分为更多小专家,降低单个专家参数量,提升路由灵活性(如 DeepSeek‑V2 的 160 专家设计)。
- 共享专家机制:设置部分专家对所有 token 强制激活,减少路由负载不均衡风险。
- 推理端优化:vLLM、TensorRT‑LLM 等框架引入专家缓存、批量专家融合,降低因激活参数而产生的延迟抖动。
上游
- 模型架构设计:路由器算法(Top‑K、Expert Choice)、专家数量和容量、MoE 层在整个网络中的部署频率,这些设计决策直接决定激活参数的基础值。
- 训练框架与分布式系统:DeepSpeed‑MoE、Megatron‑LM、TorchMoE 等需高效支持稀疏计算与动态路由,提供专家并行(Expert Parallelism)能力,以容纳总参数并稳定训练。
- 数据集与令牌分配策略:训练语料的分布影响专家负载均衡。若语料分布偏斜,可能导致部分专家“饥饿”,降低激活参数的实际利用效率。
- 硬件设计与制造:HBM 容量、显存带宽、芯片间互联带宽构成物理约束。上游厂商(如 NVIDIA、AMD)的产品规划直接影响 MoE 总参数的上限与激活参数的吞吐能力。
下游
- 推理引擎与服务:vLLM、Text Generation Inference、TensorRT‑LLM 等通过动态批处理、专家缓存、算子融合与通信重叠等技术,降低激活参数带来的实际延迟。
- 硬件适配与部署:高带宽内存容量需容纳全部专家权重,而计算单元主要服务激活参数部分。HBM 带宽成为推理瓶颈,推动对 H200、B200 等新一代 GPU 的需求。
- 应用开发者与模型选型:应用方根据激活参数预估所需的 GPU 数量和成本,进行模型选型和服务定价。激活参数已成为 API 定价的重要参考依据(如 Together AI、Fireworks 的 MoE 模型计费方案)。
- 云服务商与算力市场:激活参数概念促使云计算厂商重新定义“模型大小”相关的计费单位,从按总参数规模转向按实际激活参数与计算量定价(2024 年起部分平台已实践)。
受益公司
| 公司 / 组织 | 相关模型/产品 | 激活参数的体现 |
|---|---|---|
| DeepSeek | DeepSeek‑V2 (236B‑A21B)、DeepSeek‑V3 | 率先在模型命名中标注总参数与激活参数,开创业界先河(来源:DeepSeek 技术报告,2024 年) |
| Mistral AI | Mixtral 8×7B、8×22B | 公开强调激活参数对推理性价比的影响(来源:Mistral AI 官方博客,2023‑2024 年) |
| OpenAI | GPT‑4(传闻为 MoE,总参数约 1.8T,激活参数约 280B) | 公开资料未见官方确认;相关数字为行业推算 |
| 阿里云 | Qwen 系列 MoE 版本 | 模型卡中包含总参数与激活参数说明(来源:Qwen 模型卡与官方文档,2024 年) |
| GLaM、Switch Transformer | 最早系统研究激活参数与效率关系,技术沉淀至 PaLM 后代(来源:GLaM 论文,2022 年) | |
| Meta | 传闻在训练 MoE LLaMA 变体 | 具体激活参数公开资料未见披露 |
| NVIDIA / AMD | 高端 GPU(H100、B200) | HBM 容量和带宽同时满足“全部权重常驻”与“激活参数高吞吐”需求,直接受益于 MoE 普及 |
| Together AI / Fireworks / OctoAI | 推理云服务 | 以激活参数为基准优化 GPU 实例利用率,提供差异化定价竞争力 |
说明:上述列举基于公开信息整理,不构成任何投资建议。部分公司的 MoE 模型细节未经官方完全披露,标注为“传闻”或“公开资料未见”的部分仅供产业趋势参考。
市场规模
(以下数据基于公开趋势的定性描述,部分精确口径的定量数据公开资料未见)
- 推理市场需求:自 2023 年底起,MoE 架构因其优越的推理成本‑能力曲线而迅速流行。推理 API 的价格常按每百万 token 计费,MoE 模型的价格显著低于同等总参数量稠密模型的估算水平。据多家云厂商公开定价页面的横向对比,同等性能等级下 MoE 模型的 token 单价约为稠密模型的 1/3 至 1/5(口径:公开 API 定价,2024 年下半年数据)。
- 硬件市场规模:MoE 对显存总容量的高需求推动高端 GPU 的部署密度。据 NVIDIA 2024 财年公开财报及多家第三方分析报告中的引用,H100 在 AI 云和数据中心的出货量持续攀升,其中 MoE 训练与推理场景成为重要增量需求来源。
- 行业渗透:头部 AI 实验室(OpenAI、DeepSeek、阿里 Qwen、Mistral 等)均推出标注激活参数的 MoE 模型。开源社区也将激活参数作为对比核心指标,Hugging Face 模型库中 MoE 架构模型数量自 2024 年以来显著增长(具体增长率公开资料未见精确统计)。
- 前瞻判断:预计未来 1–2 年,单模型激活参数将普遍突破 50B,而推理成本靠优化后仍可控制在较低水平。
玩家对比
已公开 MoE 模型关键参数对比(截至 2024 年底)
| 模型 | 总参数 | 激活参数 | 激活比 | 专家设计 | 数据来源 |
|---|---|---|---|---|---|
| Mixtral 8×7B | 46.7B | ~12.9B | ~27.6% | 8 专家,top‑2 | Mistral AI 官方技术博客,2023 年 12 月 |
| Mixtral 8×22B | ~141B | ~39B | ~27.7% | 8 专家,top‑2 | Mistral AI 官方技术博客,2024 年 4 月 |
| DeepSeek‑V2 | 236B | ~21B | ~8.9% | 160 专家,含共享专家 | DeepSeek 技术报告,2024 年 |
| Qwen2‑MoE | ~57B(公开资料未见完整验证) | 公开资料未见精确数值 | 公开资料未见 | 公布为 MoE 架构 | 阿里云 Qwen 团队官方资料,2024 年 |
| GPT‑4(传闻) | 约 1.8T | 约 280B | ~15.6% | 8‑16 专家(外界推测) | 公开资料未见官方确认,行业推算 |
对比分析:
- 稀疏度差异:DeepSeek‑V2 的激活比仅为约 9%,明显低于 Mixtral 系列的约 27%—28%,反映其更激进的稀疏设计。
- 设计哲学:Mistral 倾向于“较少但较大”的专家,DeepSeek 采用“较多但较小”的细粒度专家,路由灵活性更高。
- 行业现状:国内模型(如 DeepSeek、Qwen)在激活参数的公开透明度上表现突出,部分海外头部模型(如 GPT‑4)仍未官方披露细节。
说明:以上信息来源于各模型官方技术报告、公开博客及行业分析,不涉及对任何模型性能优劣的评价或投资建议。
风险
技术风险
- 专家负载不均衡:若路由器在训练中坍塌至少数几个专家,导致其余专家“闲置”,实际有效激活参数虚高,宣传的性价比无法兑现。部分早期 MoE 实验已在学术界报告此类问题。
- 通信瓶颈:MoE 推理引入的 All‑to‑All 通信在小 batch size 或低带宽互联场景下可能成为延迟的主要来源,削弱激活参数带来的理论优势。
- 总显存需求不降反升:激活参数低不代表总显存需求低。全部专家权重必须常驻显存,对 HBM 容量提出更高要求,可能限制边缘部署场景。
- 训练稳定性:稀疏路由带来梯度方差增大、负载均衡损失调参困难等问题,可能增加训练成本与失败风险。
市场与行业风险
- 架构同质化与创新停滞:若行业过度聚焦 MoE 稀疏化而忽视其他架构创新路径,可能造成技术路线单一化风险。
- “伪稀疏”营销:部分模型可能以低激活比为卖点,但实际有效参数因路由失效而远高于宣称值,导致开发者预期与实测表现出现偏差。
- 硬件供应依赖:MoE 对 HBM 的强依赖使产业受制于高端 GPU 供应链。若产能受限或地缘因素影响供应,推理基础设施建设将受冲击。
评估建议
- 关注第三方基准测试的实际推理吞吐与延迟数据,而非仅看激活参数绝对值。
- 注意评估模型的路由均衡性与专家利用率,可通过不同领域数据集的推理表现一致性做初步判断。
误读纠偏
❌ 误读 1:“激活参数就是模型推理时用到的全部参数,所以 MoE 推理就和同等激活参数的稠密模型一样快。”
✅ 正解:激活参数决定了主要计算量,但 MoE 推理还引入了路由器开销、专家权重动态加载,以及 token 分发/收集产生的 All‑to‑All 通信。这些额外因素使 MoE 的实际延迟通常高于同等激活参数的稠密模型,尤其在 batch size 较小或通信带宽受限时。但激活参数仍是最准确的一阶近似。
❌ 误读 2:“MoE 模型的 config.json 里写了 activation_function: silu,所以这个模型的激活参数就是使用 SiLU 的参数部分。”
✅ 正解:“激活参数”(Active Parameters)与“激活函数”(Activation Function)是完全不同的概念。config.json 中的 activation_function 字段仅指神经元非线性变换函数(如 GeLU、SwiGLU),与用于衡量计算规模的激活参数毫无关系。许多开发者因字段相似而产生混淆。
❌ 误读 3:“激活参数 = 总参数 ×(top_k / num_experts)”
✅ 正解:这个简便公式忽略了共享的注意力层、嵌入层和路由网络等非专家参数。实际上激活参数占比会高于简单的比例估算,尤其在总参数量较小、共享部分占比可观的时候。准确计算必须逐层统计。
❌ 误读 4:“激活参数越小越好,追求极低激活比就是终极目标。”
✅ 正解:激活比降低通常意味着总参数膨胀,虽然单 token 计算量降低,但总显存需求增加、通信开销增大。过度追求低激活比可能牺牲模型质量或带来部署上的隐性成本。最优激活比取决于具体应用场景的算力‑显存‑延迟综合约束。
最新事件
(截至 2025 年 3 月,基于公开信息整理)
- DeepSeek‑V3 发布(2024 年末):DeepSeek 发布新一代 MoE 模型,延续总参数/激活参数双标注惯例。具体参数规模公开资料未见完整验证,但行业普遍关注其激活比是否进一步优化。
- 阿里 Qwen 系列更新(2024‑2025 年交):Qwen 团队持续迭代 MoE 版本,模型卡明确标注总参数与激活参数,推动中文社区对激活参数概念的认知普及。
- Mistral 大型 MoE 模型传闻:行业传言 Mistral AI 正在训练参数规模更大的 MoE 模型,可能进一步挑战激活比的下限。公开资料未见官方确认。
- 推理框架竞争加剧:vLLM、SGLang、TensorRT‑LLM 在 2024 年下半年至 2025 年初密集更新,针对 MoE 推理的专家缓存与通信优化成为竞争焦点,激活参数导向的调度策略日趋成熟。
- 硬件路线回应:NVIDIA B200 与 AMD MI300 系列在发布资料中强调对大显存、高带宽场景的支持,被行业解读为对 MoE 普及趋势的硬件侧回应。
说明:以上事件描述基于公开技术博客、发布会信息及行业报道,部分细节可能存在信息滞后或未完全核实的情况。建议读者关注相关公司官方渠道获取最新进展。
跟踪指标
- 新模型激活比:关注新发布 MoE 模型的激活参数与总参数比值,判断行业稀疏度演进方向。源:各公司技术报告、模型卡。
- 推理延迟与吞吐:第三方基准测试(如 LMSYS Chatbot Arena 的推理性能评估、Artificial Analysis 的 LLM 推理速度榜单)可提供激活参数差异对应的实际部署表现。
- 专家利用率分布:开源模型的推理日志或技术报告中若披露各专家调用频率分布,可帮助判断路由机制是否健康。源:模型技术报告、开源社区分析。
- 硬件规格演进:HBM 容量、显存带宽、芯片间互联带宽的逐代提升速度,影响 MoE 部署的经济可行性。源:NVIDIA、AMD 官方产品规格书。
- 推理 API 定价变化:各云厂商 MoE 模型与稠密模型的 token 单价变化,反映激活参数概念对商业定价的实际渗透。源:Together AI、Fireworks、OpenAI、DeepSeek 等官方定价页面。
- 开源框架支持进展:vLLM、SGLang、llama.cpp 等对 MoE 模型的量化、专家缓存、通信优化等功能的迭代速度。源:GitHub Release Notes 与社区讨论。
信源
- DeepSeek‑V2 技术报告:DeepSeek‑AI, “DeepSeek‑V2: A Strong, Economical, and Efficient Mixture‑of‑Experts Language Model,” 2024。模型架构部分详述 236B‑A21B 参数体系与细粒度专家设计。
- Mistral AI 官方博客:Mixtral 8×7B(2023 年 12 月)与 Mixtral 8×22B(2024 年 4 月)发布公告,公开总参数与激活参数数据。
- GLaM 论文:Du et al., “GLaM: Efficient Scaling of Language Models with Mixture‑of‑Experts,” ICML 2022。最早系统研究激活参数与效率关系。
- Switch Transformer 论文:Fedus et al., “Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity,” JMLR 2022。提出 top‑1 路由,建立总参数与激活参数分离范式。
- 阿里云 Qwen 官方文档:Qwen 系列模型卡,包含 MoE 版本的总参数与激活参数说明(持续更新,截至 2024 年)。
- 知乎专栏“LLM 细节盘点”系列:咸鱼王,《LLM 细节盘点(1):激活函数》,列出主流 LLM 的激活函数与 DeepSeek‑V2 (236B‑A21B) 等模型的标注,辅助概念区分。
- CSDN 技术博客:《如何根据 config.json 核对 MoE 模型的激活参数》,详述从 config 字段推导总参数与激活参数的完整过程。
- vLLM 项目文档与源码:GitHub‑vllm‑project/vllm,包含 MoE 支持的设计文档与实现,展示推理框架如何以激活参数为导向优化调度。
- NVIDIA 官方产品资料:H100、B200 规格书与公开技术白皮书,涉及 HBM 容量/带宽与 MoE 部署场景的匹配。
- Artificial Analysis 推理速度榜单:独立第三方对公开 LLM API 的推理延迟与吞吐持续监控,可用于验证激活参数与实际性能的关系。
声明:本文所涉及的财务数据、市场价格、市场份额及产能数字,除明确标注年份、口径与来源者外,均采用定性描述。不确定之处已标注“公开资料未见”,未进行任何编造。本文不构成任何投资建议、买卖建议或涨跌预测,亦不出现“值得买”等推荐性措辞。