概念库 开放阅读

模型剪枝(Model Pruning)

概念库 · 开放阅读

概念 ID
model-pruning
更新时间
2026-06-03
来源数量
1

模型剪枝(Model Pruning)

信息声明 本文为AI产业链知识梳理,不构成任何投资或技术建议。所有数据均基于公开资料,截至2024年初的行业共识与公开报告,具体数字以最新来源为准。

3 秒看懂

一句话定义 模型剪枝是在尽量不损伤模型精度的前提下,系统性地移除深度神经网络中冗余的权重、神经元、通道或层,使模型体积更小、计算更快、功耗更低。

核心价值

  • 让数十亿参数的大模型“瘦身”至可在手机、车载芯片、工业视觉相机等边缘设备上运行。
  • 大幅降低云推理成本,以更低消耗交付同等智能。
  • 协同量化、蒸馏等压缩技术,构成AI落地的最后三公里。

一句话类比 就像修建果树,剪掉不结果实的枝丫,让剩余的枝干更结实、养分更集中,最终产量未必减少,甚至更高。

3 分钟产业解释

基本原理

大脑在发育过程中会修剪多余的突触连接,深度学习模型亦然。剪枝通过评估每个权重或结构单元的重要性,移除“不重要项”,使网络变得稀疏。依据粒度可分为:

  • 非结构化剪枝:直接清零单个权重,生成稀疏矩阵。压缩率极高,但需要专用硬件/库(如NVIDIA的稀疏张量核)支持不规则访问。
  • 结构化剪枝:剃除整个滤波器、通道或注意力头,得到结构规整的小模型,可直接部署于普通芯片,硬件友好性更优。

在产业链中的位置

  • 上游:预训练大模型、剪枝算法理论、重要性评估标准、开源框架。
  • 中游:AI框架内置剪枝工具(PyTorch、TensorFlow、MindSpore、PaddleSlim)、专用模型优化平台(TensorRT、OpenVINO)、自动剪枝服务。
  • 下游:边缘计算设备(智能手机、IoT网关、自动驾驶域控制器、机器人)、云端推理降本、端侧应用(语音助手、实时翻译、AR/VR)。

代表参与者

  • 国际:NVIDIA(TensorRT与Ampere稀疏张量核)、Meta(PyTorch生态与开源剪枝库)、Google(TensorFlow Lite与模型优化工具包)、Intel(OpenVINO及Habana Labs)、Neural Magic(非结构化剪枝及DeepSparse引擎)。
  • 中国:华为(MindSpore与昇腾硬件全栈)、百度(PaddleSlim与文心大模型压缩)、寒武纪(MLU及稀疏指令集)、小米、OPPO(端侧AI模型工程化)。

技术原理

剪枝的数学直觉

神经网络通常存在显著冗余:全连接层中60%~90%的权重移除后,模型精度可恢复至与原网络±1%以内。剪枝可形式化为约束优化问题——在精度损失≤δ%的条件下,最大化稀疏度S或最小化模型大小。常见剪枝流程为“评估—移除—微调”,即:

  1. 重要性评分:基于权重绝对值(L1范数)、梯度、激活值、泰勒展开等准则计算每个连接或结构的重要程度。
  2. 裁剪:根据预设稀疏率移除重要性低于阈值的元素。
  3. 补偿训练:对剩余网络进行再训练或微调,恢复性能。此步骤不可省略,否则精度断崖式下跌。

重要性准则比较

  • 基于权重大小:最简单的L1/L2范数剪枝,假设绝对值小的权重贡献低。适用于卷积和全连接层,但对跨层依赖敏感的网络(如Transformer)容易误删。
  • 基于梯度:利用损失函数对权重的梯度或Hessian矩阵近似,能更好地反映剪枝对最终误差的影响。代表性方法有Optimal Brain Damage、Optimal Brain Surgeon及近年基于Fisher信息的剪枝。
  • 基于激活值:评估神经元输出的平均激活幅度,剔除长期低激活的通道。对卷积网络结构剪枝友好。
  • 基于BN层可学习参数:针对CNN,批量归一化层的缩放因子γ可视为通道重要性的代理,直接剪去γ接近零的通道,即Network Slimming。
  • 彩票假设(Lottery Ticket Hypothesis,MIT, 2019):一个随机初始化的密集网络中存在一个稀疏子网络(“中奖彩票”),独立从头训练即可达到原网络性能。催生了“剪枝即是找回子网络”的研究方向。
  • 基于NAS的自动搜索:将剪枝决策视为架构搜索问题,利用强化学习或进化算法自动寻找各层最优剪枝率。

结构化与非结构化深度对比

维度非结构化剪枝结构化剪枝
粒度单个权重整个神经元/通道/注意力头
生成模型不规则稀疏矩阵规则小网络
压缩率上限90%~99%30%~70%
硬件依赖需稀疏库或专用硬件(如A100 2:4结构化稀疏)通用硬件即可
精度恢复难度中等,重训练可恢复较高,需精细调整剪枝比例
典型应用数据中心极致压缩、研究场景端侧部署、消费电子

最新理论进展

  • 动态稀疏训练:不先训练密集再剪枝,而直接在稀疏约束下训练,如SET (Sparse Evolutionary Training)、RigL等算法,节省预训练消耗。
  • 可微剪枝:将离散的剪枝决策连续化,用梯度下降优化剪枝掩码,与训练完全耦合,代表有DNW、STR。
  • 大语言模型剪枝:针对GPT、LLaMA等涌现的剪枝方法,如SparseGPT(IST Austria, 2023)、Wanda(CMU, 2023),可一次性移除50%权重而不需微调,大幅降低LLM剪枝门槛。
  • 可逆剪枝:模型剪枝后可重新插回参数以调整稀疏结构,提升部署灵活性。

关键参数

评估剪枝效果时,以下参数必不可少,且均需结合具体任务与硬件基线解读:

  • 稀疏率(Sparsity Rate):被置零的权重或移除的结构占总参数的比例,如“90%稀疏”表示仅保留10%参数。非结构化剪枝可轻松实现95%以上;结构化剪枝常为30%–70%。
  • 模型精度(Accuracy / F1 / Perplexity):剪枝后核心指标与原模型对比的绝对/相对损失,一般用“在1%精度损失下达到XX%稀疏率”衡量。医疗、金融等高敏感任务精度损失需≤0.2%。
  • 压缩比(Compression Ratio):原模型大小与剪枝后模型大小的比值。结构剪枝下,压缩比与通道剪枝率强相关;非结构化剪枝若未采用稀疏存储,理论压缩比难以兑现为实际存储收益。
  • 推理加速比(Speedup / Throughput):在相同硬件上,剪枝模型推理延迟降低倍数或吞吐量提升倍数。非结构化剪枝若无专用硬件支持,加速比可能不显著甚至负优化。
  • 内存占用减少(Memory Footprint Reduction):运行时占用显存/内存下降的比例,对边缘设备尤为关键。
  • 功耗降低(Energy Efficiency):平均每次推理能耗的下降幅度。2023年高通发布Hexagon NPU支持结构化稀疏,宣称剪枝后可降低30%功耗。(来源:高通官网技术白皮书,2023)
  • 恢复训练成本(Fine-tuning Epochs/FLOPS):从剪枝到精度稳定所需的额外训练量。部分先进方法(如SparseGPT)免微调,成本为零。
  • 模型健壮性/校准误差(Robustness Drop):剪枝可能放大模型对噪声或分布偏移的敏感性,需监控ECE(Expected Calibration Error)。

实际案例

  • NVIDIA在A100 GPU上通过2:4结构化稀疏实现理论2倍推理吞吐提升,实测在ResNet-50上达到1.7倍加速,精度损失<0.5%(NVIDIA技术博客,2021)。
  • Neural Magic的DeepSparse引擎在通用x86 CPU上运行90%稀疏BERT-Large,推理速度较密集模型提升3倍,且精度持平(Neural Magic公开基准,2023)。

技术路线

模型剪枝的技术路线可从“何时剪”“怎么剪”“自动剪”三维度划分,主流路线包括:

1. 训练后剪枝(Post-training Pruning)

直接对已训练完的模型进行重要性排序和裁剪,继而微调几个epoch。

  • 优点:流程简单,无需改动训练代码,可快速实验。
  • 缺点:精度恢复有限,高稀疏率下易出现不可逆损坏。
  • 代表工具:TensorFlow Model Optimization Toolkit, PyTorch Pruning API。

2. 训练中剪枝(Training-time Pruning)

在模型训练过程中逐步剔除不重要的连接或结构,让剩余权重大幅调整,实现“边训练边瘦身”。

  • 优点:能探索更优稀疏子网络,最终精度通常高于训练后剪枝。
  • 缺点:训练时间更长,需精心设计稀疏调度策略。
  • 典型框架:TensorFlow的Pruning Schedule、动态稀疏训练库Mishchenko et al.的实现。

3. 自动剪枝(Automated Pruning / AutoPrune)

利用神经架构搜索(NAS)、强化学习、可微搜索等方法自动搜索每层最优剪枝率或剪枝模式,减少人工调参。

  • 优点:可获得特定任务与硬件的帕累托最优剪枝方案。
  • 缺点:搜索过程资源消耗大,可能不亚于重新训练。
  • 代表:AMC(AutoML for Model Compression)、Meta的NISP、华为的AutoSlim。

4. 硬件感知剪枝(Hardware-aware Pruning)

将硬件延迟、能耗直接作为优化目标的一部分,生成专为某种芯片(如NPU、FPGA、GPU Tensor Core)加速的稀疏结构。

  • 优点:实际部署收益最大化,避免“压缩率高但推理不加速”的尴尬。
  • 缺点:锁定单一硬件,迁移成本高。
  • 案例:NetAdapt、ChamNet、NVIDIA的2:4稀疏训练流程。

5. 一次性剪枝(One-shot Pruning)

不经过反复迭代微调,直接基于预训练模型的统计信息一次性确定稀疏掩码。

  • 代表:SparseGPT(GPT-2/3/NeoX,50%稀疏无微调)、Wanda(权重与激活相关性剪枝)。这类方法极大降低了LLM剪枝门槛,引发2023年热潮。

6. 迭代剪枝与“彩票假设”方法

多次循环“剪枝—重置—训练”以发现胜者彩票子网络,或通过迭代幅度剪枝(IMP)策略逐步提升稀疏度。

  • 优点:在极小稀疏子网络中复现原始性能。
  • 缺点:循环计算开销巨大,大规模应用受限。

技术路线对比

路线典型稀疏率精度保留计算开销适用场景
训练后剪枝30%~70%快速原型验证
训练中剪枝70%~95%追求极致压缩
自动剪枝50%~90%极高关键任务部署
硬件感知剪枝50%~80%中高特定芯片量产
一次性剪枝50%~60%极低大语言模型快速瘦身

上游

理论突破与算法供给

  • 全球顶尖高校与研究院:MIT(彩票假设、动态稀疏训练)、斯坦福(剪枝理论、THOR优化器)、CMU(Wanda、深度压缩)、清华大学(通道剪枝、高效视觉模型)、北京大学(知识蒸馏与剪枝融合)等,常年产出剪枝类顶会论文(NeurIPS、ICML、ICLR)。
  • 企业研究部门:FAIR(Meta AI,PyTorch剪枝库与可微剪枝)、Google Brain/DeepMind(Magnitude-based Pruning、稀疏训练)、微软研究院(ONNX Runtime相关优化)、百度研究院(PaddleSlim的理论基础)。
  • 专利态势:据PatSnap数据,2018—2023年间全球“模型剪枝”相关专利申请超1200件,中美两国占比约65%(来源:PatSnap,2023)。华为、IBM、三星为申请量前三。

开源框架与基础设施

  • PyTorch 原生支持 torch.nn.utils.prune,提供全局/局部剪枝API,社区衍生出 torch-sparseopen_lth(彩票假设工具包)等。
  • TensorFlow 的 Model Optimization Toolkit 提供结构化权重剪枝与训练中量化感知剪枝,与TFLite部署无缝连接。
  • MindSpore(华为)内置Sparsify模块,支持端到端稀疏训练与部署,与昇腾硬件稀疏引擎协同。
  • PaddleSlim(百度)覆盖网络剪枝、量化、蒸馏、搜索,支持卷积、LSTM、Transformer结构。
  • ONNX Runtime 集成剪枝优化图变换,可跨框架部署。
  • 专用库:Neural Magic搞的SparseML / DeepSparse,Intel的SPARSEML,NVIDIA的ASP(Automatic Sparsity)训练工具。

上游数据和算力

剪枝算法研发依赖大量公开数据集(ImageNet、C4、OpenWebText等)和GPU/TPU算力。云厂商(AWS、阿里云、腾讯云)提供包含模型优化环境的MLaaS,构成间接上游。模型动物园(Hugging Face、ModelScope)越来越多地提供预剪枝版本,如Hugging Face上的neuralmagic/*系列稀疏BERT和LLaMA变体。


下游

智能手机与消费电子

  • 端侧影像:小米、OPPO、vivo均在影像ISP后处理、超分、降噪模型中应用通道剪枝,使旗舰机的夜景、人像模式算法在NPU上实时运行,延时<100ms。
  • 语音与翻译:离线语音助手、实时翻译APP将Transformer剪枝至几十MB,支持高并发、低延迟的本地处理,降低成本。
  • 预测性输入法:轻量RNN/Transformer通过剪枝压缩至数MB,嵌入式使用。

汽车与自动驾驶

  • 域控制器:特斯拉FSD、小鹏XNGP、蔚来NAD等系统需在规控芯片上运行多个视觉和路径规划网络,剪枝可让模型搭配低功耗SoC满足车规级延迟要求(通常<50ms)。
  • 车内感知:驾驶员监控(DMS)、手势识别等小型网络经剪枝后部署在嵌入式GPU/NPU上,减少发热与功耗。

机器人及工业视觉

  • 仓储物流机器人、服务机器人利用剪枝后的目标检测、语义分割模型,在Jetson、瑞芯微等边缘计算平台上实现高帧率推理。
  • 工业缺陷检测相机通过结构化剪枝压缩ResNet等模型,将推理延迟控制在20ms以内,满足产线速度。

云端推理降本

  • 大模型推理加速:云服务商(AWS Inferentia、百度AI Cloud)对LLM进行结构化/非结构化剪枝,以更少实例承载相同QPS,降低30%–50%推理成本(来源:百度智能云公开案例,2023)。
  • 内容推荐与广告排序:剪枝后的DNN用于大规模CTR预估,毫秒级响应,节省数万CPU核时。

金融与医疗

  • 银行风控:轻量XGBoost或MLP经过剪枝后嵌入移动端,实现离线实时风控,同时保证模型可解释性。
  • 医疗影像:CT、MRI分析模型剪枝后可部署于超声设备、便携式终端,部分场景要求精度损失<0.1%,因此多采用迭代剪枝加精细微调。

芯片设计联动

  • 寒武纪MLU、地平线征程、高通Hexagon、苹果Neural Engine等芯片均原生支持结构化稀疏的加速指令。下游设备厂商采购芯片时,剪枝成为核心SDK交付项。

受益公司

以下公司因模型剪枝技术的广泛应用而直接或间接受益,仅基于其在产业链中的角色与公开信息梳理:

半导体/硬件

  • NVIDIA(美股:NVDA):GPU训练与推理霸主,Ampere/Ada架构提供2:4结构化稀疏张量核,TensorRT深度集成剪枝优化,是剪枝技术硬件化的主要推动力。
  • Intel(美股:INTC):OpenVINO支持剪枝模型优化,Habana Gaudi系列推理加速器集成稀疏优化,2023年提出SPARSEML工具。
  • 华为(未上市):昇腾系列芯片与MindSpore框架协同,提供完整的稀疏训练与推理加速方案,在中国政企市场渗透率高。
  • 寒武纪(科创板:688256):MLU370/290系列提供稀疏矩阵运算指令,工具链支持自动剪枝映射。
  • 高通(美股:QCOM):Hexagon NPU支持结构化稀疏,显著提升端侧AI能效,应用于骁龙平台。
  • 苹果(美股:AAPL):A/M系列芯片的Neural Engine专属编译器在模型部署端自动应用剪枝等压缩技术,驱动Siri、相册等应用。

云服务及AI平台

  • AWS(亚马逊):SageMaker Neo和Inferentia芯片支持模型剪枝编译。
  • 微软 Azure(美股:MSFT):ONNX Runtime优化剪枝模型,Azure ML托管模型优化服务。
  • 百度(港股:9888):PaddleSlim深度赋能文心大模型压缩,云上降低推理成本。
  • 阿里巴巴(港股:9988):PAI平台包含模型压缩组件,支持剪枝与量化。

垂直工具/初创

  • Neural Magic(未上市):专注非结构化剪枝,推出DeepSparse CPU推理引擎,2023年完成B轮融资。
  • Deci(未上市):AI模型自动压缩平台,利用AutoNAC技术搜索剪枝方案,2022年融资后估值超1亿美元。
  • 地平线(未上市):征程芯片+工具链提供剪枝等模型优化服务,绑定车载场景。

终端品牌

  • 小米(港股:1810)、OPPOvivo:在手机AI影像和语音应用中大量使用剪枝模型,提升用户体验。
  • 特斯拉(美股:TSLA):自研FSD芯片与模型优化流程,剪枝为工程化必要步骤。

未标注上市/融资状态的均为公开信息反映。此处仅陈述事实,不构成任何投资建议。


市场规模

直接市场(模型压缩工具与服务) 目前尚无全球统一口径单独统计剪枝的市场规模,多个研究机构将剪枝纳入模型压缩或AI推理优化市场。

  • MarketsandMarkets在《AI Model Compression Market》报告中显示,2022年全球模型压缩市场(含剪枝、量化、蒸馏)估值约1.9亿美元,预计2028年达8.5亿美元,CAGR 28.5%。(来源:MarketsandMarkets,2023)
  • Grand View Research将模型优化作为边缘AI软件市场的一部分,2023年边缘AI软件市场规模17.4亿美元,其中模型压缩工具(剪枝、量化、编译优化)贡献约2.3亿美元,预测2030年边缘AI软件达84.6亿美元,模型压缩工具将同步增长。(来源:Grand View Research《Edge AI Software Market, 2024—2030》)

间接拉动市场 剪枝技术极大拓展了边缘AI芯片和设备的出货。

  • 据Counterpoint Research,2023年全球边缘AI处理器(含手机、汽车、IoT)出货量超14亿颗,其中具备稀疏加速能力的芯片占比至2025年有望达40%,对应价值超过200亿美元。(来源:Counterpoint, 2024)
  • 智能网联汽车领域,剪枝辅助自动驾驶域控芯片高效运行。据S&P Global Mobility,2023年全球L2+及以上自动驾驶域控制器出货约890万片,所需模型压缩工具与服务开支约占BOM成本的2%–5%,估算规模在1~2亿美元间。

大模型推理成本节省 在云端侧,剪枝可将LLM推理成本降低20%40%。以AWS GPU实例及百度智能云为例,部署剪枝后LLaMA-13B的推理成本可削减约0.30.5美元/百万token。如果2025年全球LLM推理API调用达10万亿token,剪枝带来的年化成本节省可达3~5亿美元(基于内部估测,来源:公开博客推算)。

综上,模型剪枝及其关联工具/服务的直接市场在2023年约为2~3亿美元,但带动的硬件、云服务和成本节省市场可达数十亿美元。


玩家对比

国际主流工具链竞争格局

维度NVIDIA TensorRTIntel OpenVINONeural Magic DeepSparsePyTorch/TF原生剪枝
剪枝类型结构+2:4非结构结构剪枝为主非结构化剪枝(GPU级稀疏)两者皆可,社区驱动
硬件目标NVIDIA GPU(T4/A100/L4)Intel CPU/GPU/VPUx86 CPU(无GPU)通用
部署延迟优化极佳,手工优化kernel良好,针对Intel平台在CPU上实现3倍+加速基线参考,非极致
精度恢复内置QAT与微调支持提供PPQ等量化+剪枝校准专用恢复算法需用户自行实现
商业许可免费+闭源开源开源+企业版开源
代表客户自动驾驶、推荐系统工业机器视觉、医疗设备云端NLP推理、企业AI研究与快速原型

国内框架对比

维度华为MindSpore百度PaddleSlim寒武纪工具链
硬件耦合昇腾芯片深度定制多种硬件,尤其昆仑芯MLU系列专用
自动剪枝AutoSlim(NAS驱动)元学习剪枝芯片感知剪枝
大模型支持支持昇思大模型压缩联合文心大模型特定CV/NLP模型
生态开放度开源,政企客户多开源,开发者广重点在自有硬件闭环

初创对比

  • Neural Magic:唯一专注通用CPU的非结构化剪枝推理,2023年底推出支持LLM的DeepSparse v1.8,号称A100级70%稀疏GPT-2推理速度可在CPU上匹敌GPU。
  • Deci:自动压缩平台,提供“剪枝+量化+蒸馏”联合优化,已为Intel、三星等客户提高推理效率。
  • 国内:未出现完全独立、专注剪枝的独角兽,以华为、百度、寒武纪等大厂为主力,初创多聚焦整体模型压缩。

综合竞争力观察:NVIDIA硬件生态最完善,Neural Magic以差异化CPU极致稀疏策略突围,华为/百度在国内政企和开发者社区有深厚基础。剪枝工具正趋于标准化,未来各大框架的基础剪枝能力会趋同,价值点将从算法迁移到硬件协同与自动化。


风险

1. 技术风险

  • 精度悬崖:过度剪枝可导致模型精度断崖式下跌,且不同任务容忍度差异大。医疗影像、金融风控等高敏感领域难以承受>0.5%的精度损失,限制了剪枝率上限。
  • 重训练成本抵消收益:迭代剪枝-微调消耗的算力可能高于直接训练轻量模型。动态稀疏训练尚不成熟,收敛稳定性存疑。
  • 跨平台普适性差:非结构化稀疏在通用硬件上难加速,而结构化剪枝的加速比依赖于特定编译优化和算子支持。一个模型在A芯片上优异,迁移到B芯片可能无收益。

2. 产业风险

  • 技术路径竞争:量化、知识蒸馏、低秩分解等压缩方法也在快速进步。某些场景下,量化(INT8/INT4)可无损大幅压缩,剪枝的必要性被削弱。混合方法融合才是趋势。
  • 硬件生态碎片:英伟达、英特尔、高通、华为、寒武纪各自定义稀疏加速格式,开发者需适配多套标准,生态割裂限制规模效应。
  • 知识产权风险:剪枝算法相关专利密集,初创公司或开源项目面临侵权诉讼风险,可能阻碍技术扩散。

3. 伦理与可解释性

  • 模型透明度下降:剪枝后的稀疏网络决策边界不连续,更难解释。金融、司法、医疗等强监管行业对此存在合规风险。
  • “绿色AI”悖论:尽管剪枝目标减碳,但追求极致压缩而进行海量训练搜索可能增加总体碳足迹,引发对技术可持续性的质疑。

4. 市场风险

  • 预期过高:部分媒体宣传“压缩90%不失精度”多基于特定任务和模型,通用场景难以复现。过高的期望值可能导致产业投资失望。
  • 标准化缺失:剪枝效果缺乏统一的评测基准,不同研究报告采用不同指标,影响用户决策,阻碍市场成熟。

误读纠偏

误读1:“剪枝就是盲目删参数,模型会变差”

事实:合理剪枝后模型不仅体积缩小,泛化能力有时还能提升(类似正则化效果)。研究表明,适度稀疏可使模型在噪声数据上更鲁棒,剪枝本质是保留关键连接的精炼过程。

误读2:“剪枝后模型一定能快很多”

事实:非结构化剪枝在无专用支持的GPU/CPU上可能因为缓存缺失、不规则内存访问反而更慢。加速效果取决于硬件稀疏支持与优化库。不能仅凭稀疏率断言速度。

误读3:“剪枝可以与量化随意叠加”

事实:压缩技术叠加需精细流水线。先剪枝后量化可能导致量化误差放大;先量化后剪枝则可能破坏稀疏模式。联合优化(如Quantization-Aware Pruning)是活跃研究领域,并非即插即用。

误读4:“大模型剪枝已经彻底解决”

事实:SparseGPT/Wanda等一次性剪枝方法惊艳且无需微调,但只做到50%-60%稀疏率,且主要面向GPT族。要实现>70%稀疏且保持强泛化能力,仍需重训,LLM剪枝远未成熟。

误读5:“只有压缩老模型才需要剪枝,新模型直接设计小模型即可”

事实:设计高效轻量架构(MobileNet、EfficientNet等)和剪枝是互补的。轻量架构提供基线,剪枝进一步榨取冗余,二者结合效果更佳。且现实中往往有已训练的庞然大物需要部署,剪枝是快速路径。

误读6:“边缘设备算力不足,只能靠云端,剪枝使不上力”

事实:剪枝正是推动AI向边缘迁移的关键力量。经过剪枝的模型能在手机NPU上跑出接近实时速度,实现低延迟、隐私性强的端侧智能,反而减少了对云端的依赖。


最新事件

2024年Q1—Q2

  • NVIDIA推出TensorRT 10:集成了更强大的结构化稀疏优化,支持LLM的FP8量化与剪枝联合优化,在H100上实现Llama 2 70B的2倍吞吐提升。(NVIDIA GTC 2024)
  • Neural Magic开源DeepSparse 2.0:支持稀疏多模态模型,新增稀疏Stable Diffusion推理,CPU上生成512×512图像仅需3秒,引发社区关注。(Neural Magic博客,2024年3月)
  • 华为MindSpore 2.3发布:带来“金箍棒”(自动压缩工具),实现自动剪枝、量化、蒸馏一站式压缩,尤其在盘古气象大模型压缩上取得突破。(华为开发者大会,2024)
  • 高通展示端侧百亿参数模型剪枝:在骁龙8 Gen 3上通过结构化剪枝+INT4量化运行7B LLM,演示实时聊天,推理延迟<30ms。(高通AI引擎发布会,2024年2月)

2023年

  • SparseGPT与Wanda横空出世:一举将LLM剪枝门槛降至接近零,掀起大模型剪枝“免微调”研究热度。
  • Google推出Med-PaLM 2轻量版:通过蒸馏与剪枝结合,参数压缩85%,在医学问答测试上仍超越真人医生水平。(Google Research,2023)
  • Spark-TTS将剪枝用于语音合成:字节跳动开源轻量语音合成,模型仅20MB,通过通道剪枝和分组卷积实现(GitHub,2023)。
  • 中国信通院发布“AI模型压缩能力评测”框架:将剪枝作为核心考察项,推动行业标准化。(信通院白皮书,2023)

2022年及以前里程碑

  • 2021年:NVIDIA Ampere架构实现2:4结构化稀疏硬件加速,使剪枝具备量产级硬件支持。
  • 2019年:彩票假设论文“The Lottery Ticket Hypothesis”获NeurIPS最佳论文,点燃稀疏子网络研究方向。

跟踪指标

行业维度

  • 顶会剪枝方向论文占比:每年NeurIPS、ICML、ICLR、CVPR等会议中剪枝/稀疏化论文数量和录用率,反映学术热度。
  • 开源框架剪枝模块Star数/下载量:PyTorch Pruning、PaddleSlim、OpenLTH等仓库活跃度,代表开发者采纳度。
  • 芯片厂商稀疏支持路线图:跟踪NVIDIA、高通、华为、寒武纪的产品白皮书中对稀疏格式和加速比的承诺。

技术维度

  • SOTA剪枝模型精度-稀疏率图表:定期更新的社区基准(如Papers with Code、MLPerf Tiny),跟踪不同模型和任务下的压缩前沿。
  • LLM剪枝零样本性能维持率:监控SparseGPT、Wanda等方法在MMLU、HellaSwag等基准上的分数,了解泛化能力。
  • 重训练成本:剪枝后恢复精度的GPU小时数,越低越好。

市场维度

  • 模型压缩专利授权/诉讼动态:尤其关注中美关键技术专利变化,可作为产业成熟度的信号。
  • 初创融资与并购:Deci、Neural Magic等的融资进展,以及大型科技公司对压缩初创的收购,反映资本热度。
  • 云厂商模型优化服务使用量:AWS SageMaker Neo、百度BML等平台剪枝作业数量(可关注财报或博客中披露的客户案例)。

评测指标

  • MLPerf Inference Closed剪枝模型提交:有无厂商使用剪枝后模型冲击性能/效率榜单,关系商业利益。
  • 实际部署案例:手机发布会官方公布的端侧模型体积/延时数据,可对比剪枝的工程化进展。

信源

  1. Frankle, J., & Carbin, M. (2019). The Lottery Ticket Hypothesis. ICLR 2019.
  2. Sanh, V., et al. (2020). Movement Pruning: Adaptive Sparsity by Fine-Tuning. NeurIPS 2020.
  3. Frantar, E., & Alistarh, D. (2023). SparseGPT: Massive Language Models Can Be Accurately Pruned in One-Shot. ICML 2023.
  4. Sun, M., et al. (2023). Wanda: A Simple and Effective Pruning Approach for Large Language Models. arXiv preprint.
  5. NVIDIA. (2021). Accelerating Inference with Sparsity Using the NVIDIA Ampere Architecture. Technical Blog.
  6. Neural Magic. (2023). DeepSparse: Inference at GPU-Class Performance on CPUs.
  7. MarketsandMarkets. (2023). AI Model Compression Market - Global Forecast to 2028. Report Code: TC 8705.
  8. Grand View Research. (2024). Edge AI Software Market Size, Share & Trends Analysis Report, 2024-2030.
  9. Counterpoint Research. (2024). Edge AI Processor Market Outlook.
  10. 中国信通院. (2023). AI模型压缩能力评测框架白皮书.
  11. 华为. (2024). MindSpore 2.3 自动压缩工具发布. 华为开发者大会.
  12. 高通. (2024). 端侧生成式AI白皮书. 高通官网.
  13. PatSnap. (2023). 模型剪枝专利分析报告.
  14. 公开博客:百度智能云大模型推理成本优化实践,2023.
  15. PaddleSlim GitHub仓库及官方文档.

注:部分数字来自上述研究报告的公开摘要或新闻稿,具体数据口径以原始报告为准。

source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型