概念库 开放阅读

动态稀疏(Dynamic Sparsity)

概念库 · 开放阅读

概念 ID
dynamic-sparsity
更新时间
2026-06-03
来源数量
1

动态稀疏(Dynamic Sparsity)

文档性质:产业链科普页,信息仅供学习参考,不构成任何投资或技术决策建议。 数据口径:除特别标注年份/来源外,部分数据为公开资料整理,可能存在滞后。

一、30 秒速览

一句话定义:动态稀疏是一种”让 AI 芯片在运行时跳过无效计算”的优化技术——不像静态剪枝一刀切,它根据当前输入实时决定哪些神经元/注意力头/矩阵块可以”跳过”,从而降低算力消耗、提升吞吐。

链-芯-核映射

层级含义动态稀疏的体现
Chain(系统链)集群/框架层训练框架中的稀疏调度器、MoE 路由
Chip(芯片)架构层支持 2:4 结构化稀疏的张量核、稀疏张量加速单元
Core(计算核)微架构层零值跳过、压缩索引解码、非零块收集引擎

一句话价值:理论上可将 Transformer 类模型推理吞吐提升 1.5×–2×(NVIDIA Ampere 白皮书,2020),同时将大模型训练通信量降低 40%+(Switch Transformer 论文,Google,2022)。

二、3 分钟深度

2.1 为什么需要”动态”稀疏?

对比维度静态稀疏(Static)动态稀疏(Dynamic)
稀疏模式训练后固定,推理时不变随输入激活值实时变化
典型技术非结构化剪枝、结构化通道剪枝激活稀疏(ReLU 天然零值)、Top-K 路由、MoE
精度保持需重训练/微调补偿天然保持(不修改权重)
硬件友好度低(随机位置跳过)高(结构化块/2:4 模式)

2.2 关键技术分支

动态稀疏
├── 激活稀疏 (Activation Sparsity)
│   ├── ReLU/SiLU 天然零激活
│   └── Top-K 稀疏激活(如 DeepSeek-V2 的 DeepSeekMoE)
├── 注意力稀疏 (Attention Sparsity)
│   ├── 固定模式:Longformer、BigBird
│   └── 动态模式:Routing Transformer、MoA
└── 权重-激活联合稀疏 (Joint Sparsity)
    ├── NVIDIA 2:4 结构化稀疏(硬件原生支持)
    └── 块稀疏(Block Sparse)+ 压缩索引

2.3 产业链速览

[上游]                    [中游]                    [下游]
稀疏算法研究              芯片设计                  大模型训练/推理
├─ 学术论文               ├─ NVIDIA (Ampere+)       ├─ 云厂商 (推理加速)
├─ 稀疏训练框架           ├─ Google (TPU v4/v5)     ├─ 端侧部署 (手机/IoT)
│  (DeepSpeed, FairScale) ├─ 国产芯片厂商           └─ 垂直应用
├─ 稀疏编译器/算子库      │  (华为、寒武纪等)
└─ 稀疏基准测试           └─ AI 芯片创业公司

三、15 分钟专家深入

3.1 技术原理详解

3.1.1 稀疏性的来源与分类

神经网络中的稀疏性有三种主要来源:

类型产生机制动态性计算节省潜力
权重稀疏训练时正则化/剪枝低(推理时固定)中(需硬件支持非结构化跳过)
激活稀疏ReLU 等激活函数输出零值(随输入变化)高(可直接跳过后续乘加)
注意力稀疏Softmax 后部分注意力权重趋近零中-高中-高(尤其长序列场景)

关键洞察:在典型 Transformer 模型中,ReLU 激活的零值比例可达 50%–90%(论文 Sparse is Enough,2021;具体比例因模型/层位置而异)。这意味着近一半的矩阵乘法理论上可以跳过。

3.1.2 动态稀疏的核心技术栈

(1)激活稀疏(Activation Sparsity)

  • 原理:利用 ReLU/SiLU 激活函数的天然稀疏性,在推理时检测零值激活,跳过对应权重列/行的计算。
  • 代表工作
    • ReLU 优化:NVIDIA Ampere 架构的 2:4 结构化稀疏(每 4 个元素中强制 2 个为零,硬件原生支持零值跳过,理论加速比 2×,实际约 1.5×–1.8×;NVIDIA GTC 2020 公布)
    • Top-K 稀疏激活:DeepSeek-V2 的 DeepSeekMoE 架构(2024),每个 token 仅激活少量 expert,其余 expert 计算完全跳过

(2)注意力稀疏(Attention Sparsity)

  • 问题:标准 Self-Attention 的计算复杂度为 O(n²),长序列场景成为瓶颈。
  • 动态方案
    • Routing Transformer(2020):基于 k-means 聚类动态路由注意力
    • Mixture of Attention (MoA)(2022):不同头使用不同稀疏模式,由路由器动态选择
    • Flash Attention(Tri Dao,2022):虽非严格意义上的稀疏技术,但通过 IO-aware 计算优化,将注意力计算的 GPU HBM 访问大幅减少,与稀疏技术形成互补

(3)MoE(Mixture of Experts)路由稀疏

  • 原理:将 FFN 层拆分为多个 expert,每个 token 由路由器动态选择 Top-K 个 expert 计算,其余 expert 静默。
  • 代表模型
    • Switch Transformer(Google,2021):Top-1 路由,参数量 1.6T,激活参数仅约 1/64
    • Mixtral 8×7B(Mistral AI,2024):Top-2 路由,总参数 46.7B,激活参数约 12.9B
    • DeepSeek-V3(2024):671B 总参数,每 token 仅激活 37B

(4)硬件-软件协同设计

技术层关键挑战解决思路
算子层非结构化稀疏的索引开销结构化稀疏(2:4、Block Sparse)减少索引
编译器动态稀疏模式的图优化XLA/TVM 中的稀疏图 pass、Triton 自定义 kernel
硬件不规则访存降低带宽利用率专用收集/散射引擎(scatter-gather)、压缩格式支持

3.1.3 性能数据参考

指标数值来源/口径
2:4 稀疏张量核理论加速NVIDIA Ampere 白皮书,2020
2:4 稀疏实测加速(BERT-large 推理)1.5×–1.8×NVIDIA MLPerf 结果,2021
Switch Transformer 训练速度 vs. T5-XXL7×(同等算力下)Google 论文,2021
DeepSeek-V3 每 token 训练成本$0.0025(FP8,H800 集群)DeepSeek 官方技术报告,2024.12
激活稀疏零值比例(典型 Transformer)50%–90%依模型/层而异,学术文献统计

3.2 产业链上下游详析

3.2.1 上游:算法与框架层

环节代表项目/机构作用
稀疏训练框架DeepSpeed (微软)、FairScale (Meta)、Megatron-LM (NVIDIA)提供 ZeRO、MoE 并行、稀疏化训练原语
稀疏推理引擎TensorRT (NVIDIA)、ONNX Runtime (微软)、TensorFlow Lite支持 2:4 稀疏权重的推理加速
稀疏编译器MLIR/XLA (Google)、Triton (OpenAI)、TVM (Apache)将稀疏计算图编译为高效硬件指令
学术研究MIT HAN Lab、斯坦福 HAI、清华计图团队、北大机器学习中心稀疏训练算法、NAS 搜索稀疏架构

3.2.2 中游:芯片与硬件层

(1)国际厂商

厂商产品/技术稀疏支持情况
NVIDIAA100/H100/H200/B100/B2002:4 结构化稀疏张量核(Ampere 起);Hopper 架构增加 FP8 稀疏支持
GoogleTPU v4/v5e/v5pSparseCore(2024 公布):专为稀疏特征/嵌入优化的硬件单元
IntelGaudi 2/3公开资料未见明确的动态稀疏硬件原语,但支持混合精度
AMDMI300X/MI325X公开资料未见明确的结构化稀疏张量核
CerebrasWSE-2/WSE-3稀疏计算是其核心卖点之一:900K 核心可独立跳过零值计算

(2)中国厂商

厂商产品/进展动态稀疏相关情况
华为海思昇腾 910B/910C昇腾 CANN 框架支持部分稀疏算子;公开资料未见明确的 2:4 结构化稀疏硬件原语
寒武纪思元 590支持稀疏计算加速,具体动态稀疏能力的详细技术白皮书公开资料未见
壁仞科技BR100/BR104公开资料未见明确的动态稀疏硬件支持细节
燧原科技云燧 i20公开资料未见明确的动态稀疏硬件支持细节
昆仑芯昆仑芯 2公开资料未见明确的动态稀疏硬件原语
沐曦曦云 C500公开资料未见明确的动态稀疏支持细节

⚠️ 注意:国产芯片厂商在公开技术文档中对”动态稀疏”硬件原语的描述较少,上述信息基于截至 2024 年底的公开资料整理,可能存在信息滞后或遗漏。

3.2.3 下游:应用层

应用场景稀疏技术的作用代表案例
云端大模型推理降低单请求算力成本,提升吞吐Mixtral 8×7B 部署(MoE 稀疏路由)
端侧推理手机/IoT 设备上跑更大模型Qualcomm AI Engine 支持稀疏加速(2023+)
长序列处理注意力稀疏降低 O(n²) 瓶颈长文档/视频理解、基因组序列
推荐系统嵌入层稀疏化Google SparseCore 针对推荐特征优化(2024)
训练效率MoE 减少每次激活参数量,降低通信Switch Transformer、DeepSeek-V3

3.3 代表公司深度分析

3.3.1 NVIDIA:硬件原生稀疏的推动者

  • 关键举措:Ampere 架构(2020)首次引入 2:4 结构化稀疏张量核,要求每 4 个权重元素中恰好 2 个为零,硬件可直接跳过零值计算。
  • 生态绑定:TensorRT 推理引擎原生支持 2:4 稀疏权重导入和加速。
  • 实际效果:MLPerf Inference 2.1(2021)中,NVIDIA A100 使用 2:4 稀疏后,BERT-large 推理吞吐提升约 1.5×–1.8×。
  • 局限:仅支持结构化 2:4 模式,非结构化稀疏仍需软件模拟,效果有限。

3.3.2 Google:系统级稀疏的先行者

  • TPU SparseCore(2024 年公布):在 TPU v5p 中集成专用 SparseCore,针对推荐系统中的稀疏嵌入表(如用户 ID、物品 ID)进行硬件级优化,可将嵌入查找吞吐提升数倍。
  • Switch Transformer(2021):首个突破 1T 参数的稀疏模型,证明 MoE 路由可大幅降低训练成本。
  • GShard(2020):600B 参数 MoE 模型,跨 2048 TPU 训练,展示了稀疏模型的分布式训练范式。

3.3.3 DeepSeek:国产 MoE 稀疏的标杆

  • DeepSeek-V2(2024.05):236B 总参数,每 token 激活 21B,采用 MLA(Multi-head Latent Attention)+ DeepSeekMoE 架构。
  • DeepSeek-V3(2024.12):671B 总参数,每 token 激活 37B,训练成本约 $5.576M(H800 集群,FP8 混合精度),训练时长约 2 个月。
  • 意义:证明国产团队在 MoE 稀疏架构设计上具有国际竞争力,且训练成本远低于同量级 Dense 模型。

3.3.4 Cerebras:纯稀疏硬件路线

  • WSE-2(2021):850,000 个核心,每个核心可独立判断是否跳过计算,天然适合稀疏负载。
  • WSE-3(2024):900,000 核心,44GB SRAM,支持动态稀疏无需额外索引开销(SRAM 直接寻址)。
  • 定位:面向科研和超大模型训练的垂直场景,商业化规模有限。

3.4 中国进展综述

3.4.1 学术研究

机构代表工作时间
清华大学MoE 相关研究(如 Expert Choice Routing)、稀疏训练理论2021+
北京大学稀疏神经网络的泛化性分析2022+
上海交通大学结构化剪枝、稀疏卷积2021+
中国科学院稀疏注意力机制2022+
香港大学Dynamic Token Pruning(动态 token 剪枝)2022

⚠️ 上述为部分代表性工作,完整列表公开资料未见系统性整理。

3.4.2 产业应用

公司进展备注
DeepSeekDeepSeek-V2/V3(MoE 架构,全球领先)2024 年开源,社区反响强烈
华为昇腾 CANN 稀疏算子支持;盘古大模型采用 MoE 架构具体稀疏硬件原语细节公开资料未见
阿里Qwen 系列模型暂未采用 MoE(截至 2024 底)但通义团队在研究中
字节跳动内部大模型训练中探索 MoE(公开资料有限)
智谱 AIGLM 系列暂未采用 MoE(截至 2024 底)
百川智能公开资料未见明确的 MoE/动态稀疏路线

3.4.3 基础设施与工具

工具/平台稀疏相关能力
华为 MindSpore支持稀疏算子和 MoE 并行训练(昇思套件)
百度 PaddlePaddle支持部分稀疏训练,公开资料未见原生 MoE 路由器
阿里 PAI内部支持 MoE 训练调度(公开文档有限)
国产编译器公开资料未见成熟的端到端稀疏编译器(对标 TensorRT/Triton)

3.5 风险与争议

3.5.1 技术风险

风险说明
稀疏率-精度权衡高稀疏率(>70%)通常带来精度下降;动态稀疏虽优于静态,但并非无限
硬件碎片化NVIDIA 2:4 稀疏是事实标准,但其他厂商(AMD、国产)支持不一致,生态割裂
实际加速不达预期理论 2× 加速,实际受内存带宽、索引开销、批处理效率等影响,常降至 1.3×–1.5×
动态性的调度开销实时检测零值/路由选择本身消耗算力,需硬件-软件深度协同

3.5.2 产业争议

争议点正方观点反方观点
MoE 是否是大模型的未来?降低训练/推理成本(如 DeepSeek-V3);Scaling Law 支持模型体积膨胀、部署复杂度高;路由不稳定、专家坍缩问题
结构化稀疏 vs. 非结构化结构化(2:4)硬件友好、实际加速明确非结构化稀疏率更高、更灵活,但缺乏硬件支持
国产芯片的稀疏能力差距华为昇腾在快速追赶与 NVIDIA 2:4 原生支持相比,国产方案的成熟度和生态仍有差距
稀疏是否”免费午餐”无精度损失的加速实际上需要大量工程调优,且对模型架构有约束

3.5.3 政策与地缘风险

  • 出口管制影响:美国对华 AI 芯片出口管制(2022.10 起,2023.10 更新)限制了 NVIDIA H100/H800 等支持原生稀疏的高端芯片对华销售,国产芯片需自行开发稀疏硬件能力。
  • 算力自主可控压力:动态稀疏作为”用更少算力做更多事”的技术路线,对降低对高端芯片依赖有一定战略意义,但短期内难以完全替代硬件升级。

3.5.4 伦理与社会风险

  • 模型透明度下降:MoE 的路由机制使模型行为更难解释(“哪个 expert 处理了这个 token”不直观)。
  • 资源分配不均:掌握稀疏训练技术和大算力的机构将进一步拉开与小团队的差距。

3.6 未来趋势展望

趋势时间窗口依据
MoE 成为大模型主流架构之一2024–2026DeepSeek-V3、Mixtral、GPT-4(传闻采用 MoE)的成功
2:4 稀疏成为推理标配2024–2025NVIDIA Blackwell 架构继续强化;软件生态逐步成熟
国产芯片追赶稀疏硬件能力2025–2027华为、寒武纪等在研产品路线图(公开资料有限)
稀疏 + 量化组合优化2024–2026FP8/INT4 + 2:4 稀疏的叠加效果(理论 3×–4× 加速)
端侧动态稀疏部署2025+Qualcomm、联发科 NPU 开始支持轻量稀疏

附录:关键术语速查

术语全称/含义
2:4 Sparsity每 4 个权重元素中恰好 2 个为零的结构化稀疏模式,NVIDIA Ampere+ 原生支持
MoEMixture of Experts,混合专家模型,通过动态路由激活部分专家
Top-K Routing每个 token 仅激活 K 个专家的路由策略
Zero-Shot Sparsity不经过稀疏训练,直接利用激活函数的天然零值进行计算跳过
Block Sparse按固定大小的块为单位进行稀疏化,减少索引开销
SparseCoreGoogle TPU v5p 中的专用稀疏计算单元

免责声明:本文档所有信息均基于公开资料整理,仅供学习参考,不构成任何投资、技术选型或商业决策建议。部分数据可能存在时效性,建议读者结合最新官方文档和论文进行判断。


最后更新:基于截至 2024 年底的公开资料整理

source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型