动态稀疏(Dynamic Sparsity)
文档性质:产业链科普页,信息仅供学习参考,不构成任何投资或技术决策建议。 数据口径:除特别标注年份/来源外,部分数据为公开资料整理,可能存在滞后。
一、30 秒速览
一句话定义:动态稀疏是一种”让 AI 芯片在运行时跳过无效计算”的优化技术——不像静态剪枝一刀切,它根据当前输入实时决定哪些神经元/注意力头/矩阵块可以”跳过”,从而降低算力消耗、提升吞吐。
链-芯-核映射:
| 层级 | 含义 | 动态稀疏的体现 |
|---|---|---|
| Chain(系统链) | 集群/框架层 | 训练框架中的稀疏调度器、MoE 路由 |
| Chip(芯片) | 架构层 | 支持 2:4 结构化稀疏的张量核、稀疏张量加速单元 |
| Core(计算核) | 微架构层 | 零值跳过、压缩索引解码、非零块收集引擎 |
一句话价值:理论上可将 Transformer 类模型推理吞吐提升 1.5×–2×(NVIDIA Ampere 白皮书,2020),同时将大模型训练通信量降低 40%+(Switch Transformer 论文,Google,2022)。
二、3 分钟深度
2.1 为什么需要”动态”稀疏?
| 对比维度 | 静态稀疏(Static) | 动态稀疏(Dynamic) |
|---|---|---|
| 稀疏模式 | 训练后固定,推理时不变 | 随输入激活值实时变化 |
| 典型技术 | 非结构化剪枝、结构化通道剪枝 | 激活稀疏(ReLU 天然零值)、Top-K 路由、MoE |
| 精度保持 | 需重训练/微调补偿 | 天然保持(不修改权重) |
| 硬件友好度 | 低(随机位置跳过) | 高(结构化块/2:4 模式) |
2.2 关键技术分支
动态稀疏
├── 激活稀疏 (Activation Sparsity)
│ ├── ReLU/SiLU 天然零激活
│ └── Top-K 稀疏激活(如 DeepSeek-V2 的 DeepSeekMoE)
├── 注意力稀疏 (Attention Sparsity)
│ ├── 固定模式:Longformer、BigBird
│ └── 动态模式:Routing Transformer、MoA
└── 权重-激活联合稀疏 (Joint Sparsity)
├── NVIDIA 2:4 结构化稀疏(硬件原生支持)
└── 块稀疏(Block Sparse)+ 压缩索引
2.3 产业链速览
[上游] [中游] [下游]
稀疏算法研究 芯片设计 大模型训练/推理
├─ 学术论文 ├─ NVIDIA (Ampere+) ├─ 云厂商 (推理加速)
├─ 稀疏训练框架 ├─ Google (TPU v4/v5) ├─ 端侧部署 (手机/IoT)
│ (DeepSpeed, FairScale) ├─ 国产芯片厂商 └─ 垂直应用
├─ 稀疏编译器/算子库 │ (华为、寒武纪等)
└─ 稀疏基准测试 └─ AI 芯片创业公司
三、15 分钟专家深入
3.1 技术原理详解
3.1.1 稀疏性的来源与分类
神经网络中的稀疏性有三种主要来源:
| 类型 | 产生机制 | 动态性 | 计算节省潜力 |
|---|---|---|---|
| 权重稀疏 | 训练时正则化/剪枝 | 低(推理时固定) | 中(需硬件支持非结构化跳过) |
| 激活稀疏 | ReLU 等激活函数输出零值 | 高(随输入变化) | 高(可直接跳过后续乘加) |
| 注意力稀疏 | Softmax 后部分注意力权重趋近零 | 中-高 | 中-高(尤其长序列场景) |
关键洞察:在典型 Transformer 模型中,ReLU 激活的零值比例可达 50%–90%(论文 Sparse is Enough,2021;具体比例因模型/层位置而异)。这意味着近一半的矩阵乘法理论上可以跳过。
3.1.2 动态稀疏的核心技术栈
(1)激活稀疏(Activation Sparsity)
- 原理:利用 ReLU/SiLU 激活函数的天然稀疏性,在推理时检测零值激活,跳过对应权重列/行的计算。
- 代表工作:
- ReLU 优化:NVIDIA Ampere 架构的 2:4 结构化稀疏(每 4 个元素中强制 2 个为零,硬件原生支持零值跳过,理论加速比 2×,实际约 1.5×–1.8×;NVIDIA GTC 2020 公布)
- Top-K 稀疏激活:DeepSeek-V2 的 DeepSeekMoE 架构(2024),每个 token 仅激活少量 expert,其余 expert 计算完全跳过
(2)注意力稀疏(Attention Sparsity)
- 问题:标准 Self-Attention 的计算复杂度为 O(n²),长序列场景成为瓶颈。
- 动态方案:
- Routing Transformer(2020):基于 k-means 聚类动态路由注意力
- Mixture of Attention (MoA)(2022):不同头使用不同稀疏模式,由路由器动态选择
- Flash Attention(Tri Dao,2022):虽非严格意义上的稀疏技术,但通过 IO-aware 计算优化,将注意力计算的 GPU HBM 访问大幅减少,与稀疏技术形成互补
(3)MoE(Mixture of Experts)路由稀疏
- 原理:将 FFN 层拆分为多个 expert,每个 token 由路由器动态选择 Top-K 个 expert 计算,其余 expert 静默。
- 代表模型:
- Switch Transformer(Google,2021):Top-1 路由,参数量 1.6T,激活参数仅约 1/64
- Mixtral 8×7B(Mistral AI,2024):Top-2 路由,总参数 46.7B,激活参数约 12.9B
- DeepSeek-V3(2024):671B 总参数,每 token 仅激活 37B
(4)硬件-软件协同设计
| 技术层 | 关键挑战 | 解决思路 |
|---|---|---|
| 算子层 | 非结构化稀疏的索引开销 | 结构化稀疏(2:4、Block Sparse)减少索引 |
| 编译器 | 动态稀疏模式的图优化 | XLA/TVM 中的稀疏图 pass、Triton 自定义 kernel |
| 硬件 | 不规则访存降低带宽利用率 | 专用收集/散射引擎(scatter-gather)、压缩格式支持 |
3.1.3 性能数据参考
| 指标 | 数值 | 来源/口径 |
|---|---|---|
| 2:4 稀疏张量核理论加速 | 2× | NVIDIA Ampere 白皮书,2020 |
| 2:4 稀疏实测加速(BERT-large 推理) | 1.5×–1.8× | NVIDIA MLPerf 结果,2021 |
| Switch Transformer 训练速度 vs. T5-XXL | 7×(同等算力下) | Google 论文,2021 |
| DeepSeek-V3 每 token 训练成本 | $0.0025(FP8,H800 集群) | DeepSeek 官方技术报告,2024.12 |
| 激活稀疏零值比例(典型 Transformer) | 50%–90% | 依模型/层而异,学术文献统计 |
3.2 产业链上下游详析
3.2.1 上游:算法与框架层
| 环节 | 代表项目/机构 | 作用 |
|---|---|---|
| 稀疏训练框架 | DeepSpeed (微软)、FairScale (Meta)、Megatron-LM (NVIDIA) | 提供 ZeRO、MoE 并行、稀疏化训练原语 |
| 稀疏推理引擎 | TensorRT (NVIDIA)、ONNX Runtime (微软)、TensorFlow Lite | 支持 2:4 稀疏权重的推理加速 |
| 稀疏编译器 | MLIR/XLA (Google)、Triton (OpenAI)、TVM (Apache) | 将稀疏计算图编译为高效硬件指令 |
| 学术研究 | MIT HAN Lab、斯坦福 HAI、清华计图团队、北大机器学习中心 | 稀疏训练算法、NAS 搜索稀疏架构 |
3.2.2 中游:芯片与硬件层
(1)国际厂商
| 厂商 | 产品/技术 | 稀疏支持情况 |
|---|---|---|
| NVIDIA | A100/H100/H200/B100/B200 | 2:4 结构化稀疏张量核(Ampere 起);Hopper 架构增加 FP8 稀疏支持 |
| TPU v4/v5e/v5p | SparseCore(2024 公布):专为稀疏特征/嵌入优化的硬件单元 | |
| Intel | Gaudi 2/3 | 公开资料未见明确的动态稀疏硬件原语,但支持混合精度 |
| AMD | MI300X/MI325X | 公开资料未见明确的结构化稀疏张量核 |
| Cerebras | WSE-2/WSE-3 | 稀疏计算是其核心卖点之一:900K 核心可独立跳过零值计算 |
(2)中国厂商
| 厂商 | 产品/进展 | 动态稀疏相关情况 |
|---|---|---|
| 华为海思 | 昇腾 910B/910C | 昇腾 CANN 框架支持部分稀疏算子;公开资料未见明确的 2:4 结构化稀疏硬件原语 |
| 寒武纪 | 思元 590 | 支持稀疏计算加速,具体动态稀疏能力的详细技术白皮书公开资料未见 |
| 壁仞科技 | BR100/BR104 | 公开资料未见明确的动态稀疏硬件支持细节 |
| 燧原科技 | 云燧 i20 | 公开资料未见明确的动态稀疏硬件支持细节 |
| 昆仑芯 | 昆仑芯 2 | 公开资料未见明确的动态稀疏硬件原语 |
| 沐曦 | 曦云 C500 | 公开资料未见明确的动态稀疏支持细节 |
⚠️ 注意:国产芯片厂商在公开技术文档中对”动态稀疏”硬件原语的描述较少,上述信息基于截至 2024 年底的公开资料整理,可能存在信息滞后或遗漏。
3.2.3 下游:应用层
| 应用场景 | 稀疏技术的作用 | 代表案例 |
|---|---|---|
| 云端大模型推理 | 降低单请求算力成本,提升吞吐 | Mixtral 8×7B 部署(MoE 稀疏路由) |
| 端侧推理 | 手机/IoT 设备上跑更大模型 | Qualcomm AI Engine 支持稀疏加速(2023+) |
| 长序列处理 | 注意力稀疏降低 O(n²) 瓶颈 | 长文档/视频理解、基因组序列 |
| 推荐系统 | 嵌入层稀疏化 | Google SparseCore 针对推荐特征优化(2024) |
| 训练效率 | MoE 减少每次激活参数量,降低通信 | Switch Transformer、DeepSeek-V3 |
3.3 代表公司深度分析
3.3.1 NVIDIA:硬件原生稀疏的推动者
- 关键举措:Ampere 架构(2020)首次引入 2:4 结构化稀疏张量核,要求每 4 个权重元素中恰好 2 个为零,硬件可直接跳过零值计算。
- 生态绑定:TensorRT 推理引擎原生支持 2:4 稀疏权重导入和加速。
- 实际效果:MLPerf Inference 2.1(2021)中,NVIDIA A100 使用 2:4 稀疏后,BERT-large 推理吞吐提升约 1.5×–1.8×。
- 局限:仅支持结构化 2:4 模式,非结构化稀疏仍需软件模拟,效果有限。
3.3.2 Google:系统级稀疏的先行者
- TPU SparseCore(2024 年公布):在 TPU v5p 中集成专用 SparseCore,针对推荐系统中的稀疏嵌入表(如用户 ID、物品 ID)进行硬件级优化,可将嵌入查找吞吐提升数倍。
- Switch Transformer(2021):首个突破 1T 参数的稀疏模型,证明 MoE 路由可大幅降低训练成本。
- GShard(2020):600B 参数 MoE 模型,跨 2048 TPU 训练,展示了稀疏模型的分布式训练范式。
3.3.3 DeepSeek:国产 MoE 稀疏的标杆
- DeepSeek-V2(2024.05):236B 总参数,每 token 激活 21B,采用 MLA(Multi-head Latent Attention)+ DeepSeekMoE 架构。
- DeepSeek-V3(2024.12):671B 总参数,每 token 激活 37B,训练成本约 $5.576M(H800 集群,FP8 混合精度),训练时长约 2 个月。
- 意义:证明国产团队在 MoE 稀疏架构设计上具有国际竞争力,且训练成本远低于同量级 Dense 模型。
3.3.4 Cerebras:纯稀疏硬件路线
- WSE-2(2021):850,000 个核心,每个核心可独立判断是否跳过计算,天然适合稀疏负载。
- WSE-3(2024):900,000 核心,44GB SRAM,支持动态稀疏无需额外索引开销(SRAM 直接寻址)。
- 定位:面向科研和超大模型训练的垂直场景,商业化规模有限。
3.4 中国进展综述
3.4.1 学术研究
| 机构 | 代表工作 | 时间 |
|---|---|---|
| 清华大学 | MoE 相关研究(如 Expert Choice Routing)、稀疏训练理论 | 2021+ |
| 北京大学 | 稀疏神经网络的泛化性分析 | 2022+ |
| 上海交通大学 | 结构化剪枝、稀疏卷积 | 2021+ |
| 中国科学院 | 稀疏注意力机制 | 2022+ |
| 香港大学 | Dynamic Token Pruning(动态 token 剪枝) | 2022 |
⚠️ 上述为部分代表性工作,完整列表公开资料未见系统性整理。
3.4.2 产业应用
| 公司 | 进展 | 备注 |
|---|---|---|
| DeepSeek | DeepSeek-V2/V3(MoE 架构,全球领先) | 2024 年开源,社区反响强烈 |
| 华为 | 昇腾 CANN 稀疏算子支持;盘古大模型采用 MoE 架构 | 具体稀疏硬件原语细节公开资料未见 |
| 阿里 | Qwen 系列模型暂未采用 MoE(截至 2024 底) | 但通义团队在研究中 |
| 字节跳动 | 内部大模型训练中探索 MoE(公开资料有限) | — |
| 智谱 AI | GLM 系列暂未采用 MoE(截至 2024 底) | — |
| 百川智能 | 公开资料未见明确的 MoE/动态稀疏路线 | — |
3.4.3 基础设施与工具
| 工具/平台 | 稀疏相关能力 |
|---|---|
| 华为 MindSpore | 支持稀疏算子和 MoE 并行训练(昇思套件) |
| 百度 PaddlePaddle | 支持部分稀疏训练,公开资料未见原生 MoE 路由器 |
| 阿里 PAI | 内部支持 MoE 训练调度(公开文档有限) |
| 国产编译器 | 公开资料未见成熟的端到端稀疏编译器(对标 TensorRT/Triton) |
3.5 风险与争议
3.5.1 技术风险
| 风险 | 说明 |
|---|---|
| 稀疏率-精度权衡 | 高稀疏率(>70%)通常带来精度下降;动态稀疏虽优于静态,但并非无限 |
| 硬件碎片化 | NVIDIA 2:4 稀疏是事实标准,但其他厂商(AMD、国产)支持不一致,生态割裂 |
| 实际加速不达预期 | 理论 2× 加速,实际受内存带宽、索引开销、批处理效率等影响,常降至 1.3×–1.5× |
| 动态性的调度开销 | 实时检测零值/路由选择本身消耗算力,需硬件-软件深度协同 |
3.5.2 产业争议
| 争议点 | 正方观点 | 反方观点 |
|---|---|---|
| MoE 是否是大模型的未来? | 降低训练/推理成本(如 DeepSeek-V3);Scaling Law 支持 | 模型体积膨胀、部署复杂度高;路由不稳定、专家坍缩问题 |
| 结构化稀疏 vs. 非结构化 | 结构化(2:4)硬件友好、实际加速明确 | 非结构化稀疏率更高、更灵活,但缺乏硬件支持 |
| 国产芯片的稀疏能力差距 | 华为昇腾在快速追赶 | 与 NVIDIA 2:4 原生支持相比,国产方案的成熟度和生态仍有差距 |
| 稀疏是否”免费午餐” | 无精度损失的加速 | 实际上需要大量工程调优,且对模型架构有约束 |
3.5.3 政策与地缘风险
- 出口管制影响:美国对华 AI 芯片出口管制(2022.10 起,2023.10 更新)限制了 NVIDIA H100/H800 等支持原生稀疏的高端芯片对华销售,国产芯片需自行开发稀疏硬件能力。
- 算力自主可控压力:动态稀疏作为”用更少算力做更多事”的技术路线,对降低对高端芯片依赖有一定战略意义,但短期内难以完全替代硬件升级。
3.5.4 伦理与社会风险
- 模型透明度下降:MoE 的路由机制使模型行为更难解释(“哪个 expert 处理了这个 token”不直观)。
- 资源分配不均:掌握稀疏训练技术和大算力的机构将进一步拉开与小团队的差距。
3.6 未来趋势展望
| 趋势 | 时间窗口 | 依据 |
|---|---|---|
| MoE 成为大模型主流架构之一 | 2024–2026 | DeepSeek-V3、Mixtral、GPT-4(传闻采用 MoE)的成功 |
| 2:4 稀疏成为推理标配 | 2024–2025 | NVIDIA Blackwell 架构继续强化;软件生态逐步成熟 |
| 国产芯片追赶稀疏硬件能力 | 2025–2027 | 华为、寒武纪等在研产品路线图(公开资料有限) |
| 稀疏 + 量化组合优化 | 2024–2026 | FP8/INT4 + 2:4 稀疏的叠加效果(理论 3×–4× 加速) |
| 端侧动态稀疏部署 | 2025+ | Qualcomm、联发科 NPU 开始支持轻量稀疏 |
附录:关键术语速查
| 术语 | 全称/含义 |
|---|---|
| 2:4 Sparsity | 每 4 个权重元素中恰好 2 个为零的结构化稀疏模式,NVIDIA Ampere+ 原生支持 |
| MoE | Mixture of Experts,混合专家模型,通过动态路由激活部分专家 |
| Top-K Routing | 每个 token 仅激活 K 个专家的路由策略 |
| Zero-Shot Sparsity | 不经过稀疏训练,直接利用激活函数的天然零值进行计算跳过 |
| Block Sparse | 按固定大小的块为单位进行稀疏化,减少索引开销 |
| SparseCore | Google TPU v5p 中的专用稀疏计算单元 |
免责声明:本文档所有信息均基于公开资料整理,仅供学习参考,不构成任何投资、技术选型或商业决策建议。部分数据可能存在时效性,建议读者结合最新官方文档和论文进行判断。
最后更新:基于截至 2024 年底的公开资料整理