结构化稀疏(Structured Sparsity)
3 秒看懂
一句话:结构化稀疏不是”随机砍掉一半权重”,而是按照硬件友好的固定模式(如每 4 个连续权重保留 2 个)裁剪神经网络,让 GPU 的稀疏张量核心(Sparse Tensor Core)真正跑出近 2× 加速,而不仅仅是”存储压缩”。
核心关键词:2:4 半结构化稀疏 · NVIDIA Sparse Tensor Core · 推理加速 · 剪枝 · 硬件-算法协同设计
3 分钟产业解释
为什么投资人要关注这个概念?
大模型推理成本是当前 AI 产业的核心矛盾之一。GPT-4 级别的单次推理 token 成本仍然显著,而全球推理算力需求正以超摩尔定律的速度增长。结构化稀疏是少数能直接在现有硬件上将推理吞吐量翻倍的软件-硬件协同技术——不需要等新制程、不需要买更多卡,而是在相同 GPU 上”白捡”算力。
产业链角度:
- 供给侧(GPU 厂商):NVIDIA 自 Ampere 架构(A100)起在 Tensor Core 中内置了 2:4 稀疏加速单元,后续 Hopper(H100)延续并强化了该能力。这是 NVIDIA 的生态护城河之一——硬件能力摆在那里,但只有配合其软件栈(cuSPARSELt、TensorRT)才能充分释放。
- 需求侧(云厂商 / 大模型公司):推理成本占 AI 基础设施 OPEX 的比重持续上升。如果能在精度损失可控的前提下部署 2:4 稀疏模型,意味着同等延迟下吞吐翻倍、或同等吞吐下 GPU 使用量减半。
- 竞争格局:结构化稀疏正在从”论文技术”走向”生产可用”,但大规模落地仍面临精度-加速权衡的挑战。谁能在更多模型架构上实现低损稀疏,谁就拥有推理成本优势。
投资逻辑核心:结构化稀疏不改变硬件资本开支,而是提升存量 GPU 的推理效率——类似于”免费的算力倍增器”,直接影响推理业务的毛利率。
15 分钟专家深入
从”剪枝”到”结构化剪枝”的范式转移
神经网络剪枝(Pruning)的学术研究可追溯至 1989 年 Yann LeCun 的 Optimal Brain Damage,但真正引起产业关注是 2015 年 Song Han 等人的 Deep Compression 工作——通过权重剪枝 + 量化 + 霍夫曼编码,将 AlexNet 压缩 35× 而精度几乎无损。
然而,非结构化剪枝(Unstructured Sparsity)有一个致命问题:虽然存储量减少了,但零散分布的非零权重在通用硬件上几乎无法带来实际推理加速。GPU 的 SIMD/Tensor Core 执行单元需要连续的、规则的内存访问模式——随机跳过零值反而增加索引开销。
结构化稀疏正是为解决这一矛盾而生:它不是逐个决定哪些权重为零,而是以固定粒度的组为单位裁剪,使得非零权重的分布模式可以被硬件高效地”消费”。
2:4 半结构化稀疏:NVIDIA 的工业标准
NVIDIA 在 Ampere 架构中引入的 2:4 Fine-Grained Structured Sparsity 是当前最具工业影响力的结构化稀疏方案:
- 规则:将权重矩阵沿特定维度每 4 个连续元素分为一组,每组中恰好保留 2 个非零值、置零 2 个。
- 稀疏率:50%(2/4 = 50% 非零)
- 硬件支持:A100 及后续 GPU 的 Tensor Core 内置了专门的稀疏矩阵乘法单元,可以直接消费 2:4 格式的稀疏权重,理论峰值算力约为对应稠密 Tensor Core 的 2×。
- 元数据开销:NVIDIA 公开资料声称使用 2 bits 的元数据标记每组中非零权重的位置,但理论上 4 选 2 共有 6 种组合,需要至少 3 bits 才能完整表示所有可能模式;其实际编码机制与硬件配合细节尚未公开解释。额外存储开销极低。
精度端:NVIDIA 在其技术文档及公开演示中报告,在 ResNet-50 等视觉模型和 BERT 等 NLP 模型上,2:4 稀疏配合微调(fine-tuning)通常可将精度损失控制在 1% 以内(Top-1 准确率/F1 口径)。但这一结论高度依赖模型架构和任务,并非普遍成立——尤其在生成式大模型(LLM)上,50% 结构化稀疏的精度影响仍是活跃研究课题。
大模型时代的稀疏化挑战与进展
2023 年以来,多项工作探索了将结构化/半结构化稀疏应用于 LLM:
- SparseGPT(2023, ISTA):提出了一种基于逐层 Hessian 逆近似的 one-shot 剪枝方法,可在不重新训练的情况下对 GPT 级模型实现 50–60% 非结构化稀疏(精度损失较小),同时可适配 2:4 半结构化模式,但后者精度损失通常更大。
- Wanda(2023, Princeton):提出基于权重幅度×输入激活幅度的简单剪枝准则,无需二阶信息,计算开销更低。
- LLM-Pruner 等结构化通道/注意力头剪枝工作也在探索更粗粒度的结构化稀疏。
关键洞察:对于 LLM,2:4 半结构化稀疏的”即插即用”难度远高于 CNN/小型 Transformer。原因包括:① LLM 的注意力权重和 FFN 层对稀疏化的敏感度差异显著;② 50% 稀疏率对 LLM 的生成质量影响往往不可忽视;③ 不同层需要差异化稀疏率的”非均匀稀疏”方案正成为研究热点。
与其他压缩技术的协同
结构化稀疏并非孤立技术,它与量化(Quantization)、知识蒸馏(Distillation)形成互补的压缩技术栈:
| 组合方案 | 说明 |
|---|---|
| 2:4 稀疏 + INT8 量化 | 理论可达 ~4× 压缩(2× 稀疏 × 2× 量化),NVIDIA TensorRT 已部分支持 |
| 2:4 稀疏 + FP8 量化 | Hopper 架构(H100)引入 FP8 后,与稀疏的叠加成为活跃方向 |
| 稀疏 + 蒸馏 | 先蒸馏得到小模型,再做稀疏化;或用大模型蒸馏指导稀疏小模型的训练 |
技术原理
结构化稀疏的数学表述
给定权重矩阵 W \in \mathbb{R}^{m \times n},结构化稀疏引入一个结构化掩码 $M$,使得:
W_{\text{sparse}} = W \odot M
其中 \odot 为逐元素乘法。关键区别在于 $M$ 的结构约束:
| 稀疏类型 | 掩码 $M$ 的约束 | 硬件友好度 |
|---|---|---|
| 非结构化 | $M$ 中零值位置任意 | 低(需专用格式如 CSR/CSC) |
| 通道/滤波器级 | 整行或整列全零 | 高(可直接缩小矩阵维度) |
| 块稀疏(Block Sparsity) | 每个 b \times b 子块全零或全非零 | 高(可映射为密集子矩阵乘法) |
| N:M 半结构化 | 沿特定维度每 $M$ 个连续元素中恰好 $N$ 个非零 | 高(硬件直接支持,如 2:4) |
2:4 稀疏的 Tensor Core 执行流程
权重矩阵 W (m × n) 元数据索引 (m × n/4, 每组2bit)
┌─────────────────────────────┐ ┌──────────────────────┐
│ a 0 b 0 │ 0 c 0 d │...│ │ [01] [10] ... │
│ 0 e 0 f │ g 0 h 0 │...│ + │ [10] [01] ... │
│ ... │ ... │...│ │ ... │
└─────────────────────────────┘ └──────────────────────┘
│ │
│ 稀疏 Tensor Core 加载 │
│ (跳过零值,只计算非零位置) │
▼ ▼
┌──────────────────────────────────────────────────────┐
│ 稀疏矩阵乘法单元 (Sparse Tensor Core) │
│ 1. 根据索引从权重矩阵选取 2 个非零值 (每4个一组) │
│ 2. 与激活矩阵对应位置的值相乘 │
│ 3. 部分求和,累加至输出 │
└──────────────────────────────────────────────────────┘
│
▼
输出矩阵 Y (m × k)
训练时结构化稀疏的典型流程
┌──────────────┐ ┌───────────────┐ ┌──────────────────┐ ┌──────────────┐
│ Dense 预训练 │ ──▶ │ 结构化剪枝 │ ──▶ │ 稀疏感知微调 │ ──▶ │ 部署推理 │
│ (正常训练) │ │ (Magnitude等 │ │ (稀疏掩码冻结, │ │ (TensorRT/ │
│ │ │ 准则选N:M) │ │ 只更新非零权重) │ │ cuSPARSELt) │
└──────────────┘ └───────────────┘ └──────────────────┘ └──────────────┘
剪枝准则(Pruning Criterion):
- 权重幅度(Magnitude Pruning):每 4 个一组中,保留绝对值最大的 2 个,置零最小的 2 个。最常用、最简单。
- Movement Pruning:考虑权重在训练过程中的变化方向(向零移动 vs 远离零),优先剪掉趋向零的权重。
- 基于 Hessian 的准则(如 SparseGPT):利用二阶信息估计剪掉某权重对输出的影响,最小化剪枝误差。
元数据存储
2:4 稀疏每 4 个元素因存在 \binom{4}{2} = 6 种可能的非零位置组合,理论上需要 \lceil \log_2 6\rceil = 3 bits 才能完整索引所有模式。NVIDIA 的公开资料声称使用 2 bits 元数据,但缺少公开技术细节解释其如何覆盖全部 6 种组合,实际编码机制与硬件配合情况尚未充分披露。若按 2 bits 估算,额外存储开销约为权重存储的 1/32(2 bit / (4 × 16 bit),FP16 下约 3.125%);即使按 3 bits 计算,开销仍远低于非结构化稀疏所需的 CSR/CSC 格式索引。
技术演进史
| 时间 | 里程碑 | 意义 |
|---|---|---|
| 1989 | LeCun, Optimal Brain Damage | 剪枝概念的理论奠基,基于 Hessian 的二阶剪枝 |
| 2015 | Song Han, Deep Compression (ICLR 2016) | 剪枝+量化+编码,证明 CNN 可压缩数十倍;但为非结构化 |
| 2016–2017 | 结构化剪枝兴起:通道剪枝、滤波器剪枝 | Liu et al. (ICCV 2017) Network Slimming; Li et al. (ICLR 2017) 等,将剪枝粒度提升到通道/层级别 |
| 2017 | Wen et al. 提出结构化稀疏正则化 | LASSO/group LASSO 引入训练过程,推动结构化稀疏与训练融合 |
| 2019–2020 | NVIDIA Ampere 架构发布(A100) | 首次在商用 GPU Tensor Core 中硬件原生支持 2:4 半结构化稀疏,理论 Sparse Tensor Core 峰值为 Dense 的 ~2× |
| 2020 | NVIDIA cuSPARSELt 库发布 | 为 2:4 稀疏矩阵乘法提供优化的用户态库,降低部署门槛 |
| 2021–2022 | N:M 稀疏的泛化研究 | 不限于 2:4,探索 2:8、4:8 等模式;以及非均匀层间稀疏率分配 |
| 2022 | NVIDIA Hopper 架构发布(H100) | 延续 2:4 稀疏支持,结合 FP8 和 Transformer Engine |
| 2023 | SparseGPT、Wanda 等 LLM 剪枝工作 | 将 one-shot 剪枝(不重训练)扩展到 175B 级 LLM,引发大模型稀疏化热潮 |
| 2023–2024 | 稀疏 + 量化的复合压缩成为主流研究方向 | 2:4 稀疏 + INT4/FP8 量化的叠加方案持续被探索 |
技术路线对比
| 维度 | 非结构化稀疏 | 2:4 半结构化稀疏 | 块稀疏(Block Sparsity) | 通道/滤波器剪枝 |
|---|---|---|---|---|
| 稀疏粒度 | 单个元素 | 每 4 个元素保留 2 个 | 固定大小子块(如 4×4, 16×16) | 整个通道或注意力头 |
| 典型稀疏率 | 50–90% | 固定 50% | 50–90% | 取决于被移除通道数 |
| 实际推理加速 | 低(通用硬件几乎无加速) | 高(硬件原生支持,~2× on Tensor Cores) | 中-高(需专门 kernel 或硬件支持) | 高(直接缩小矩阵维度) |
| 精度损失(同稀疏率下) | 通常最小 | 中等(约束更强) | 中等 | 较大(粒度粗,灵活性低) |
| 硬件要求 | 需 CSR/CSC 格式解析 | NVIDIA A100+ Sparse Tensor Core | 通用或需专用 kernel | 通用硬件友好 |
| 部署复杂度 | 高(需专用推理引擎) | 中(cuSPARSELt / TensorRT 已支持) | 中 | 低(标准矩阵运算) |
| 与量化的兼容性 | 好 | 好(NVIDIA 支持叠加) | 好 | 好 |
| LLM 适用性 | 研究中(SparseGPT 等) | 活跃研究,精度挑战仍大 | 探索中 | 已有实践(注意力头剪枝) |
注:精度损失数据高度依赖模型、任务和稀疏化方法,上表为定性趋势描述,非绝对结论。[行业共识]
上下游
上游(使能技术与基础设施)
- GPU/加速器硬件:NVIDIA Tensor Core(A100, H100, 及后续架构)提供 2:4 稀疏的硬件执行单元。这是当前唯一的广泛商用稀疏张量加速硬件。[厂商公开规格]
- 稀疏计算库:cuSPARSELt(NVIDIA 官方库,专为半结构化稀疏矩阵乘法优化)、cuSPARSE(通用稀疏库)。
- 推理引擎:TensorRT(NVIDIA)支持在推理图中自动应用 2:4 稀疏优化。ONNX Runtime 也在逐步支持。
- 训练框架插件:NVIDIA 的 ASP(Automatic SParsity)工具集成于 PyTorch 生态,支持训练时自动结构化剪枝。
下游(应用场景)
- 云端推理服务:大模型推理(LLM serving)是当前最大的潜在需求方。若 2:4 稀疏可在 LLM 上以较小精度损失部署,可直接降低云厂商的每 token 推理成本。
- 边缘端推理:移动设备/嵌入式 AI 芯片上,结构化稀疏可降低计算量和内存带宽需求。
- 推荐系统:大规模 Embedding 表和 MLP 层的稀疏化在工业界已有较多实践。
- 自动驾驶:车载计算平台对延迟和功耗敏感,稀疏化模型有实际部署价值。
关键指标
| 指标 | 说明 | 典型值/范围 |
|---|---|---|
| 稀疏率(Sparsity Ratio) | 被置零的权重占比 | 2:4 模式下固定 50% |
| 实际加速比(Speedup) | 相比密集模型的真实推理加速 | 理论上限 ~2×(2:4 on Sparse Tensor Core),实际因内存带宽瓶颈等因素通常为 1.3–1.8× [估算/行业报告] |
| 精度损失 | 稀疏后模型在目标任务上的指标下降 | CNN/小型 Transformer: 通常 <1%;LLM: 任务和模型依赖,可能 2–5%+ [研究论文,范围较宽] |
| 元数据开销 | 存储稀疏索引的额外空间 | ~1.56%(2 bit / (4×32 bit) for FP32)或 ~3.125%(2 bit / (4×16 bit) for FP16);实际编码所需的比特数可能高于声称值(见技术原理中组合数说明) |
| 剪枝-微调成本 | 相比正常训练的额外计算开销 | 约为正常训练成本的 0.5–2×(取决于微调轮次)[估算] |
| 内存带宽节省 | 推理时权重传输量降低 | 理论 50%(零值不传输),实际取决于硬件实现 |
供需与市场数据
定性供需格局
- 需求侧驱动力:全球 AI 推理算力需求正在超过训练算力。据多家行业分析机构估计,推理占 AI 计算市场的比重已超过 50% 并持续上升。推理成本优化(inference cost optimization)是云厂商和 AI 公司的核心诉求之一。
- 供给侧约束:结构化稀疏的实际加速效果受限于——① 模型是否能承受 50% 稀疏率的精度下降;② 推理工作负载是否为计算密集型(计算密集型收益更大,内存密集型收益有限);③ 软件栈的成熟度。
量化数据(谨慎引用)
| 数据点 | 来源/口径 | 备注 |
|---|---|---|
| A100 Sparse FP16 Tensor Core 峰值 ~624 TFLOPS vs Dense ~312 TFLOPS | [NVIDIA 官方规格] | SXM 版本,理论峰值,实际工作负载的利用率因 kernel 和 batch size 而异 |
| H100 延续 2:4 稀疏支持,Sparse TFLOPS 约为 Dense 的 2× | [NVIDIA 官方规格] | 具体数值参见 NVIDIA H100 数据表 |
| 2:4 稀疏在特定 CV 模型上的端到端推理加速 | [NVIDIA 技术博客/演示] | ResNet-50 等模型在 A100 上报告过接近 2× 的推理加速,但取决于 batch size 和精度 |
| LLM 上 2:4 稀疏的实际部署案例 | [未充分披露] | 截至 2024 年,LLM 大规模生产部署 2:4 稀疏的公开案例仍有限,精度-加速权衡是主要障碍 |
注意:结构化稀疏带来的”免费加速”并非真正免费——需要投入训练/微调成本来恢复精度,且并非所有模型和任务都能从中获益。市场的”实际可用加速倍率”显著低于硬件的理论 2× 峰值。
代表公司与资本映射
| 公司 | 角色 | 结构化稀疏相关布局 | 上市/融资状态 |
|---|---|---|---|
| NVIDIA | 硬件+软件全栈主导者 | A100/H100 Sparse Tensor Core、cuSPARSELt、ASP(Automatic SParsity)、TensorRT 稀疏支持 | NVDA (NASDAQ) |
| Neural Magic | 推理优化创业公司 | DeepSparse 引擎支持多种稀疏格式(含结构化和非结构化)在 CPU 上的高效推理;与 GPU 稀疏方案形成差异化竞争 | 私有(已融资数千万美元级 [公开报道]) |
| Microsoft | 云+模型层应用者 | 在 Azure 推理基础设施中探索模型压缩技术组合;研究团队在 LLM 剪枝方面有持续产出 | MSFT (NASDAQ) |
| 云+硬件层 | TPU 本身对稀疏计算的支持模式与 GPU 不同(更依赖 XLA 编译器优化);研究团队在稀疏化和模型压缩方面有大量工作 | GOOGL (NASDAQ) | |
| Meta (FAIR) | 研究推动者 | 在 NLP/CV 模型压缩方面有持续研究投入,探索结构化稀疏与训练的结合 | META (NASDAQ) |
| Intel / Habana Labs | 竞争对手 | Gaudi 系列加速器对稀疏计算的支持方式与 NVIDIA 有差异 | INTC (NASDAQ) |
关键观察:NVIDIA 在结构化稀疏领域具有硬件标准制定者的垄断性优势——2:4 稀疏的硬件加速能力只存在于 NVIDIA GPU 上,这强化了其生态锁定效应。竞争对手需在软件层(如 Neural Magic 在 CPU 上的做法)或采用不同的稀疏策略来差异化竞争。
投资逻辑
看多逻辑
- 推理成本优化是刚需:随着 AI 应用规模化,推理成本成为最大 OPEX 项。结构化稀疏是少数能在不增加硬件投入的前提下直接降低单次推理成本的技术路径。
- NVIDIA 生态护城河:2:4 稀疏加速是 NVIDIA GPU 的独有硬件能力(A100+),配合 cuSPARSELt / TensorRT 形成完整的软件-硬件栈。这增强了客户对 NVIDIA 生态的粘性。
- 与量化的协同效应:结构化稀疏 + INT8/FP8 量化的叠加可实现更大的综合加速比,使得”推理成本每 1–2 年下降一半”的路径更加清晰。
- 大模型时代的边际收益放大:模型越大,推理成本越高,50% 稀疏带来的绝对成本节省越大。
看空/风险逻辑
- 精度瓶颈限制实际采用率:50% 结构化稀疏在 LLM 上的精度损失仍不够可控,可能导致实际部署率远低于理论预期。
- 内存带宽瓶颈:很多推理工作负载是内存带宽受限(memory-bound)而非计算受限(compute-bound),此时稀疏化带来的计算加速无法直接转化为端到端加速。
- 竞争技术:MoE(Mixture of Experts)架构本身就实现了”计算稀疏化”(只激活部分专家),可能在架构层面直接绕过权重级稀疏化的需求。
- 量化技术的进步可能挤压稀疏化的空间:FP4/INT4 等极致量化如果精度可控,其压缩效率可能超过结构化稀疏,且更通用。
常见误读纠偏
误读 1:“结构化稀疏能直接带来 2× 推理加速”
纠偏:2× 是 NVIDIA Sparse Tensor Core 的理论计算峰值比。实际推理加速取决于多个因素:
- 内存带宽瓶颈:许多 LLM 推理场景(尤其小 batch、长序列)是 memory-bound 的,此时瓶颈在权重搬运速度而非计算速度。虽然稀疏化可以减少需要搬运的权重(50%),但硬件的内存访问模式和缓存行为使得实际带宽节省不等于 50%。
- Kernel 利用率:实际的 CUDA kernel 利用率通常低于 100%,尤其在矩阵维度不规则时。
- 端到端延迟组成:推理还包括预处理、后处理、通信(分布式推理)等环节,Tensor Core 计算只是其中一部分。
- 实际报告的加速比范围:从 ~1.3× 到接近 2× 不等,取决于模型架构、batch size、精度格式和优化水平。[行业报告/厂商演示,范围较宽]
误读 2:“结构化稀疏和非结构化稀疏效果差不多,只是硬件更友好”
纠偏:这是一个重大误解。在相同稀疏率下,结构化稀疏的精度损失通常显著大于非结构化稀疏。
- 非结构化稀疏可以逐个选择”最不重要”的权重置零,灵活性极高。
- 2:4 结构化稀疏强制每 4 个一组中必须砍掉 2 个,即使某些组中 4 个权重都”重要”——这引入了更大的近似误差。
- 实际经验中,相同 50% 稀疏率下,2:4 结构化稀疏比非结构化稀疏的精度损失通常高 1–3 个百分点(视模型和任务而定)。[研究论文,具体差异因实验设置而异]
- 本质权衡:结构化稀疏是用精度换加速,非结构化稀疏是用压缩换加速(有压缩但无实际加速)。
误读 3:“50% 稀疏就意味着内存占用减半”
纠偏:2:4 稀疏在实际存储中需要额外存储索引元数据(每 4 个元素 2 bit),因此实际存储缩减并非精确的 50%。以 FP16 为例,权重数据本身压缩至 50%,但加上约 3.125% 的元数据开销,总存储约为原始大小的约 53.125%,而非简单的减半。此外,硬件可能仍需要以原始矩阵大小加载数据到特定存储区域以保持访问对齐,具体节省取决于硬件和软件的实现方式。
学习路径
入门(2–4 小时)
- 概念理解:阅读 NVIDIA Developer Blog 关于 Ampere 架构和 2:4 结构化稀疏的介绍文章(“Accelerating Inference with Sparsity”)。
- 直觉建立:理解”为什么非结构化稀疏在 GPU 上不加速”——回顾 GPU 的 SIMT 执行模型和 Tensor Core 的数据加载模式。
- 动手体验:使用 NVIDIA 的 ASP(Automatic SParsity)工具对一个简单模型(如 ResNet-18)应用 2:4 稀疏并观察精度变化。
进阶(1–2 周)
- 论文精读:
- Mishra et al., “Accelerating Sparse Deep Neural Networks” (2021) — NVIDIA 的 2:4 稀疏技术细节
- SparseGPT (Frantar & Alistarh, 2023) — LLM 时代的 one-shot 剪枝
- Wanda (Sun et al., 2023) — 简洁的 LLM 剪枝方法
- 实践:使用 cuSPARSELt 库编写自定义的稀疏矩阵乘法 benchmark,对比 Dense vs 2:4 Sparse 的实际 FLOPS。
- 系统思维:理解 roofline model,学会判断一个推理 workload 是 compute-bound 还是 memory-bound,从而评估稀疏化的实际收益。
专家(持续跟踪)
- 跟踪 NVIDIA GTC 和 NeurIPS/ICML/ICLR 中稀疏化相关论文。
- 关注稀疏+量化复合方案的实际部署案例。
- 关注竞争对手(AMD, Intel, 自研芯片)的稀疏计算支持情况。
一句话总结
结构化稀疏是一种硬件-算法协同设计的模型压缩技术,通过将神经网络权重裁剪为硬件友好的固定模式(如 NVIDIA 的 2:4),在不增加硬件成本的前提下直接提升推理吞吐量——它是当前推理成本优化工具箱中少数能实现”接近免费算力倍增”的技术路径之一,但实际收益取决于模型对稀疏化的容忍度和推理负载的计算特性。
延伸阅读与来源
核心论文
- Han, S. et al., “Deep Compression: Compressing Deep Neural Networks with Pruning, Trained Quantization and Huffman Coding” (ICLR 2016)
- Mishra, A. et al., “Accelerating Sparse Deep Neural Networks” (2021) [NVIDIA 技术报告]
- Frantar, E. & Alistarh, D., “SparseGPT: Massive Language Models Can Be Accurately Pruned in One-Shot” (2023)
- Sun, M. et al., “A Simple and Effective Pruning Approach for Large Language Models” (Wanda, 2023)
- Liu, Z. et al., “Learning Efficient Convolutional Networks through Network Slimming” (ICCV 2017)
厂商技术文档
- NVIDIA A100 Tensor Core GPU Architecture Whitepaper — 包含 2:4 稀疏的硬件架构说明和性能规格
- NVIDIA cuSPARSELt 官方文档
- NVIDIA TensorRT 开发者指南(稀疏支持部分)
行业分析
- 各大投行关于 AI 推理优化技术的研究报告(搜索 “AI inference optimization structured sparsity”)
社区资源
- NVIDIA Developer Forums 中的稀疏计算讨论区
- Hugging Face 关于模型压缩和优化的最佳实践文档
免责声明:本文为技术概念学习材料,不构成投资建议。文中标注 [估算] 的数据为基于公开信息的粗略估计,标注 [未充分披露] 的部分表示缺乏可靠数据源。市场和公司的实际表现受多种因素影响,请以官方披露和专业投资研究为准。