概念庫 開放閱讀

模型剪枝(Model Pruning)

概念庫 · 開放閱讀

概念 ID
model-pruning
更新時間
2026-06-03
來源數量
1

模型剪枝(Model Pruning)

資訊宣告 本文為AI產業鏈知識梳理,不構成任何投資或技術建議。所有資料均基於公開資料,截至2024年初的行業共識與公開報告,具體數字以最新來源為準。

3 秒看懂

一句話定義 模型剪枝是在儘量不損傷模型精度的前提下,系統性地移除深度神經網路中冗餘的權重、神經元、通道或層,使模型體積更小、計算更快、功耗更低。

核心價值

  • 讓數十億引數的大型模型“瘦身”至可在手機、車載晶片、工業視覺相機等邊緣裝置上執行。
  • 大幅降低雲端推論成本,以更低消耗交付同等智慧。
  • 協同量化、蒸餾等壓縮技術,構成AI落地的最後三公里。

一句話類比 就像修建果樹,剪掉不結果實的枝丫,讓剩餘的枝幹更結實、養分更集中,最終產量未必減少,甚至更高。

3 分鐘產業解釋

基本原理

大腦在發育過程中會修剪多餘的突觸連線,深度學習模型亦然。剪枝通過評估每個權重或結構單元的重要性,移除“不重要項”,使網路變得稀疏。依據粒度可分為:

  • 非結構化剪枝:直接清零單個權重,生成稀疏矩陣。壓縮率極高,但需要專用硬體/庫(如NVIDIA的稀疏張量核)支援不規則訪問。
  • 結構化剪枝:剃除整個濾波器、通道或注意力頭,得到結構規整的小模型,可直接部署於普通晶片,硬體友好性更優。

在產業鏈中的位置

  • 上游:預訓練大型模型、剪枝算法理論、重要性評估標準、開源架構。
  • 中游:AI架構內建剪枝工具(PyTorch、TensorFlow、MindSpore、PaddleSlim)、專用模型最佳化平台(TensorRT、OpenVINO)、自動剪枝服務。
  • 下游:邊緣計算裝置(智慧手機、IoT閘道器、自動駕駛域控制器、機器人)、雲端端推論降本、端側應用(語音助手、即時翻譯、AR/VR)。

代表參與者

  • 國際:NVIDIA(TensorRT與Ampere稀疏張量核)、Meta(PyTorch生態與開源剪枝庫)、Google(TensorFlow Lite與模型最佳化工具包)、Intel(OpenVINO及Habana Labs)、Neural Magic(非結構化剪枝及DeepSparse引擎)。
  • 中國:華為(MindSpore與昇騰硬體全棧)、百度(PaddleSlim與文心大型模型壓縮)、寒武紀(MLU及稀疏指令集)、小米、OPPO(端側AI模型工程化)。

技術原理

剪枝的數學直覺

神經網路通常存在顯著冗餘:全連線層中60%~90%的權重移除後,模型精度可恢復至與原網路±1%以內。剪枝可形式化為約束最佳化問題——在精度損失≤δ%的條件下,最大化稀疏度S或最小化模型大小。常見剪枝流程為“評估—移除—微調”,即:

  1. 重要性評分:基於權重絕對值(L1範數)、梯度、啟用值、泰勒展開等準則計算每個連線或結構的重要程度。
  2. 裁剪:根據預設稀疏率移除重要性低於閾值的元素。
  3. 補償訓練:對剩餘網路進行再訓練或微調,恢復效能。此步驟不可省略,否則精度斷崖式下跌。

重要性準則比較

  • 基於權重大小:最簡單的L1/L2範數剪枝,假設絕對值小的權重貢獻低。適用於卷積和全連線層,但對跨層依賴敏感的網路(如Transformer)容易誤刪。
  • 基於梯度:利用損失函式對權重的梯度或Hessian矩陣近似,能更好地反映剪枝對最終誤差的影響。代表性方法有Optimal Brain Damage、Optimal Brain Surgeon及近年基於Fisher資訊的剪枝。
  • 基於啟用值:評估神經元輸出的平均啟用幅度,剔除長期低啟用的通道。對卷積網路結構剪枝友好。
  • 基於BN層可學習引數:針對CNN,批次歸一化層的縮放因子γ可視為通道重要性的代理,直接剪去γ接近零的通道,即Network Slimming。
  • 彩票假設(Lottery Ticket Hypothesis,MIT, 2019):一個隨機初始化的密集網路中存在一個稀疏子網路(“中獎彩票”),獨立從頭訓練即可達到原網路效能。催生了“剪枝即是找回子網路”的研究方向。
  • 基於NAS的自動搜尋:將剪枝決策視為架構搜尋問題,利用強化學習或進化演算法自動尋找各層最優剪枝率。

結構化與非結構化深度對比

維度非結構化剪枝結構化剪枝
粒度單個權重整個神經元/通道/注意力頭
生成模型不規則稀疏矩陣規則小網路
壓縮率上限90%~99%30%~70%
硬體依賴需稀疏庫或專用硬體(如A100 2:4結構化稀疏)通用硬體即可
精度恢復難度中等,重訓練可恢復較高,需精細調整剪枝比例
典型應用資料中心極致壓縮、研究場景端側部署、消費電子

最新理論進展

  • 動態稀疏訓練:不先訓練密集再剪枝,而直接在稀疏約束下訓練,如SET (Sparse Evolutionary Training)、RigL等演算法,節省預訓練消耗。
  • 可微剪枝:將離散的剪枝決策連續化,用梯度下降最佳化剪枝掩碼,與訓練完全耦合,代表有DNW、STR。
  • 大語言模型剪枝:針對GPT、LLaMA等湧現的剪枝方法,如SparseGPT(IST Austria, 2023)、Wanda(CMU, 2023),可一次性移除50%權重而不需微調,大幅降低LLM剪枝門檻。
  • 可逆剪枝:模型剪枝後可重新插回引數以調整稀疏結構,提升部署靈活性。

關鍵引數

評估剪枝效果時,以下引數必不可少,且均需結合具體任務與硬體基線解讀:

  • 稀疏率(Sparsity Rate):被置零的權重或移除的結構佔總引數的比例,如“90%稀疏”表示僅保留10%引數。非結構化剪枝可輕鬆實現95%以上;結構化剪枝常為30%–70%。
  • 模型精度(Accuracy / F1 / Perplexity):剪枝後核心指標與原模型對比的絕對/相對損失,一般用“在1%精度損失下達到XX%稀疏率”衡量。醫療、金融等高敏感任務精度損失需≤0.2%。
  • 壓縮比(Compression Ratio):原模型大小與剪枝後模型大小的比值。結構剪枝下,壓縮比與通道剪枝率強相關;非結構化剪枝若未採用稀疏儲存,理論壓縮比難以兌現為實際儲存收益。
  • 推論加速比(Speedup / Throughput):在相同硬體上,剪枝模型推論延遲降低倍數或吞吐量提升倍數。非結構化剪枝若無專用硬體支援,加速比可能不顯著甚至負最佳化。
  • 記憶體佔用減少(Memory Footprint Reduction):執行時佔用視訊記憶體/記憶體下降的比例,對邊緣裝置尤為關鍵。
  • 功耗降低(Energy Efficiency):平均每次推論能耗的下降幅度。2023年高通釋出Hexagon NPU支援結構化稀疏,宣稱剪枝後可降低30%功耗。(來源:高通官網技術白皮書,2023)
  • 恢復訓練成本(Fine-tuning Epochs/FLOPS):從剪枝到精度穩定所需的額外訓練量。部分先進方法(如SparseGPT)免微調,成本為零。
  • 模型健壯性/校準誤差(Robustness Drop):剪枝可能放大型模型對噪聲或分佈偏移的敏感性,需監控ECE(Expected Calibration Error)。

實際案例

  • NVIDIA在A100 GPU上通過2:4結構化稀疏實現理論2倍推論吞吐提升,實測在ResNet-50上達到1.7倍加速,精度損失<0.5%(NVIDIA技術部落格,2021)。
  • Neural Magic的DeepSparse引擎在通用x86 CPU上執行90%稀疏BERT-Large,推論速度較密集模型提升3倍,且精度持平(Neural Magic公開基準,2023)。

技術路線

模型剪枝的技術路線可從“何時剪”“怎麼剪”“自動剪”三維度劃分,主流路線包括:

1. 訓練後剪枝(Post-training Pruning)

直接對已訓練完的模型進行重要性排序和裁剪,繼而微調幾個epoch。

  • 優點:流程簡單,無需改動訓練程式碼,可快速實驗。
  • 缺點:精度恢復有限,高稀疏率下易出現不可逆損壞。
  • 代表工具:TensorFlow Model Optimization Toolkit, PyTorch Pruning API。

2. 訓練中剪枝(Training-time Pruning)

在模型訓練過程中逐步剔除不重要的連線或結構,讓剩餘權重大幅調整,實現“邊訓練邊瘦身”。

  • 優點:能探索更優稀疏子網路,最終精度通常高於訓練後剪枝。
  • 缺點:訓練時間更長,需精心設計稀疏排程策略。
  • 典型架構:TensorFlow的Pruning Schedule、動態稀疏訓練庫Mishchenko et al.的實現。

3. 自動剪枝(Automated Pruning / AutoPrune)

利用神經架構搜尋(NAS)、強化學習、可微搜尋等方法自動搜尋每層最優剪枝率或剪枝模式,減少人工調參。

  • 優點:可獲得特定任務與硬體的帕累托最優剪枝方案。
  • 缺點:搜尋過程資源消耗大,可能不亞於重新訓練。
  • 代表:AMC(AutoML for Model Compression)、Meta的NISP、華為的AutoSlim。

4. 硬體感知剪枝(Hardware-aware Pruning)

將硬體延遲、能耗直接作為最佳化目標的一部分,生成專為某種晶片(如NPU、FPGA、GPU Tensor Core)加速的稀疏結構。

  • 優點:實際部署收益最大化,避免“壓縮率高但推論不加速”的尷尬。
  • 缺點:鎖定單一硬體,遷移成本高。
  • 案例:NetAdapt、ChamNet、NVIDIA的2:4稀疏訓練流程。

5. 一次性剪枝(One-shot Pruning)

不經過反覆迭代微調,直接基於預訓練模型的統計資訊一次性確定稀疏掩碼。

  • 代表:SparseGPT(GPT-2/3/NeoX,50%稀疏無微調)、Wanda(權重與啟用相關性剪枝)。這類方法極大降低了LLM剪枝門檻,引發2023年熱潮。

6. 迭代剪枝與“彩票假設”方法

多次迴圈“剪枝—重置—訓練”以發現勝者彩票子網路,或通過迭代幅度剪枝(IMP)策略逐步提升稀疏度。

  • 優點:在極小稀疏子網路中復現原始效能。
  • 缺點:迴圈計算開銷巨大,大規模應用受限。

技術路線對比

路線典型稀疏率精度保留計算開銷適用場景
訓練後剪枝30%~70%快速原型驗證
訓練中剪枝70%~95%追求極致壓縮
自動剪枝50%~90%極高關鍵任務部署
硬體感知剪枝50%~80%中高特定晶片量產
一次性剪枝50%~60%極低大語言模型快速瘦身

上游

理論突破與演算法供給

  • 全球頂尖高校與研究院:MIT(彩票假設、動態稀疏訓練)、斯坦福(剪枝理論、THOR最佳化器)、CMU(Wanda、深度壓縮)、清華大學(通道剪枝、高效視覺模型)、北京大學(知識蒸餾與剪枝融合)等,常年產出剪枝類頂會論文(NeurIPS、ICML、ICLR)。
  • 企業研究部門:FAIR(Meta AI,PyTorch剪枝庫與可微剪枝)、Google Brain/DeepMind(Magnitude-based Pruning、稀疏訓練)、微軟研究院(ONNX Runtime相關最佳化)、百度研究院(PaddleSlim的理論基礎)。
  • 專利態勢:據PatSnap資料,2018—2023年間全球“模型剪枝”相關專利申請超1200件,中美兩國佔比約65%(來源:PatSnap,2023)。華為、IBM、三星為申請量前三。

開源架構與基礎設施

  • PyTorch 原生支援 torch.nn.utils.prune,提供全域性/區域性剪枝API,社群衍生出 torch-sparseopen_lth(彩票假設工具包)等。
  • TensorFlow 的 Model Optimization Toolkit 提供結構化權重剪枝與訓練中量化感知剪枝,與TFLite部署無縫連線。
  • MindSpore(華為)內建Sparsify模組,支援端到端稀疏訓練與部署,與昇騰硬體稀疏引擎協同。
  • PaddleSlim(百度)覆蓋網路剪枝、量化、蒸餾、搜尋,支援卷積、LSTM、Transformer結構。
  • ONNX Runtime 整合剪枝最佳化圖變換,可跨架構部署。
  • 專用庫:Neural Magic搞的SparseML / DeepSparse,Intel的SPARSEML,NVIDIA的ASP(Automatic Sparsity)訓練工具。

上游資料和算力

剪枝演算法研發依賴大量公開資料集(ImageNet、C4、OpenWebText等)和GPU/TPU算力。雲端廠商(AWS、阿里雲端、騰訊雲端)提供包含模型最佳化環境的MLaaS,構成間接上游。模型動物園(Hugging Face、ModelScope)越來越多地提供預剪枝版本,如Hugging Face上的neuralmagic/*系列稀疏BERT和LLaMA變體。


下游

智慧手機與消費電子

  • 端側影像:小米、OPPO、vivo均在影像ISP後處理、超分、降噪模型中應用通道剪枝,使旗艦機的夜景、人像模式演算法在NPU上即時執行,延時<100ms。
  • 語音與翻譯:離線語音助手、即時翻譯APP將Transformer剪枝至幾十MB,支援高併發、低延遲的本地處理,降低成本。
  • 預測性輸入法:輕量RNN/Transformer通過剪枝壓縮至數MB,嵌入式使用。

汽車與自動駕駛

  • 域控制器:特斯拉FSD、小鵬XNGP、蔚來NAD等系統需在規控晶片上執行多個視覺和路徑規劃網路,剪枝可讓模型搭配低功耗SoC滿足車規級延遲要求(通常<50ms)。
  • 車內感知:駕駛員監控(DMS)、手勢識別等小型網路經剪枝後部署在嵌入式GPU/NPU上,減少發熱與功耗。

機器人及工業視覺

  • 倉儲物流機器人、服務機器人利用剪枝後的目標檢測、語義分割模型,在Jetson、瑞芯微等邊緣計算平台上實現高幀率推論。
  • 工業缺陷檢測相機通過結構化剪枝壓縮ResNet等模型,將推論延遲控制在20ms以內,滿足產線速度。

雲端端推論降本

  • 大型模型推論加速:雲端服務商(AWS Inferentia、百度AI Cloud)對LLM進行結構化/非結構化剪枝,以更少例項承載相同QPS,降低30%–50%推論成本(來源:百度智慧雲端公開案例,2023)。
  • 內容推薦與廣告排序:剪枝後的DNN用於大規模CTR預估,毫秒級響應,節省數萬CPU核時。

金融與醫療

  • 銀行風控:輕量XGBoost或MLP經過剪枝後嵌入行動端,實現離線即時風控,同時保證模型可解釋性。
  • 醫療影像:CT、MRI分析模型剪枝後可部署於超聲裝置、行動式終端,部分場景要求精度損失<0.1%,因此多采用迭代剪枝加精細微調。

晶片設計聯動

  • 寒武紀MLU、地平線征程、高通Hexagon、AppleNeural Engine等晶片均原生支援結構化稀疏的加速指令。下游裝置廠商採購晶片時,剪枝成為核心SDK交付項。

受益公司

以下公司因模型剪枝技術的廣泛應用而直接或間接受益,僅基於其在產業鏈中的角色與公開資訊梳理:

半導體/硬體

  • NVIDIA(美股:NVDA):GPU訓練與推論霸主,Ampere/Ada架構提供2:4結構化稀疏張量核,TensorRT深度整合剪枝最佳化,是剪枝技術硬體化的主要推動力。
  • Intel(美股:INTC):OpenVINO支援剪枝模型最佳化,Habana Gaudi系列推論加速器整合稀疏最佳化,2023年提出SPARSEML工具。
  • 華為(未上市):昇騰系列晶片與MindSpore架構協同,提供完整的稀疏訓練與推論加速方案,在中國政企市場滲透率高。
  • 寒武紀(科創板:688256):MLU370/290系列提供稀疏矩陣運算指令,工具鏈支援自動剪枝對映。
  • 高通(美股:QCOM):Hexagon NPU支援結構化稀疏,顯著提升端側AI能效,應用於驍龍平台。
  • Apple(美股:AAPL):A/M系列晶片的Neural Engine專屬編譯器在模型部署端自動應用剪枝等壓縮技術,驅動Siri、相簿等應用。

雲端服務及AI平台

  • AWS(亞馬遜):SageMaker Neo和Inferentia晶片支援模型剪枝編譯。
  • 微軟 Azure(美股:MSFT):ONNX Runtime最佳化剪枝模型,Azure ML託管模型最佳化服務。
  • 百度(港股:9888):PaddleSlim深度賦能文心大型模型壓縮,雲端上降低推論成本。
  • 阿里巴巴(港股:9988):PAI平台包含模型壓縮元件,支援剪枝與量化。

垂直工具/初創

  • Neural Magic(未上市):專注非結構化剪枝,推出DeepSparse CPU推論引擎,2023年完成B輪融資。
  • Deci(未上市):AI模型自動壓縮平台,利用AutoNAC技術搜尋剪枝方案,2022年融資後估值超1億美元。
  • 地平線(未上市):征程晶片+工具鏈提供剪枝等模型最佳化服務,繫結車載場景。

終端品牌

  • 小米(港股:1810)、OPPOvivo:在手機AI影像和語音應用中大量使用剪枝模型,提升使用者體驗。
  • 特斯拉(美股:TSLA):自研FSD晶片與模型最佳化流程,剪枝為工程化必要步驟。

未標註上市/融資狀態的均為公開資訊反映。此處僅陳述事實,不構成任何投資建議。


市場規模

直接市場(模型壓縮工具與服務) 目前尚無全球統一口徑單獨統計剪枝的市場規模,多個研究機構將剪枝納入模型壓縮或AI推論最佳化市場。

  • MarketsandMarkets在《AI Model Compression Market》報告中顯示,2022年全球模型壓縮市場(含剪枝、量化、蒸餾)估值約1.9億美元,預計2028年達8.5億美元,CAGR 28.5%。(來源:MarketsandMarkets,2023)
  • Grand View Research將模型最佳化作為邊緣AI軟體市場的一部分,2023年邊緣AI軟體市場規模17.4億美元,其中模型壓縮工具(剪枝、量化、編譯最佳化)貢獻約2.3億美元,預測2030年邊緣AI軟體達84.6億美元,模型壓縮工具將同步增長。(來源:Grand View Research《Edge AI Software Market, 2024—2030》)

間接拉動市場 剪枝技術極大拓展了邊緣AI晶片和裝置的出貨。

  • 據Counterpoint Research,2023年全球邊緣AI處理器(含手機、汽車、IoT)出貨量超14億顆,其中具備稀疏加速能力的晶片佔比至2025年有望達40%,對應價值超過200億美元。(來源:Counterpoint, 2024)
  • 智慧網聯汽車領域,剪枝輔助自動駕駛域控晶片高效執行。據S&P Global Mobility,2023年全球L2+及以上自動駕駛域控制器出貨約890萬片,所需模型壓縮工具與服務開支約佔BOM成本的2%–5%,估算規模在1~2億美元間。

大型模型推論成本節省 在雲端端側,剪枝可將LLM推論成本降低20%40%。以AWS GPU例項及百度智慧雲端為例,部署剪枝後LLaMA-13B的推論成本可削減約0.30.5美元/百萬token。如果2025年全球LLM推論API呼叫達10萬億token,剪枝帶來的年化成本節省可達3~5億美元(基於內部估測,來源:公開部落格推算)。

綜上,模型剪枝及其關聯工具/服務的直接市場在2023年約為2~3億美元,但帶動的硬體、雲端服務和成本節省市場可達數十億美元。


玩家對比

國際主流工具鏈競爭格局

維度NVIDIA TensorRTIntel OpenVINONeural Magic DeepSparsePyTorch/TF原生剪枝
剪枝型別結構+2:4非結構結構剪枝為主非結構化剪枝(GPU級稀疏)兩者皆可,社群驅動
硬體目標NVIDIA GPU(T4/A100/L4)Intel CPU/GPU/VPUx86 CPU(無GPU)通用
部署延遲最佳化極佳,手工最佳化kernel良好,針對Intel平台在CPU上實現3倍+加速基線參考,非極致
精度恢復內建QAT與微調支援提供PPQ等量化+剪枝校準專用恢復演算法需使用者自行實現
商業許可免費+閉源開源開源+企業版開源
代表客戶自動駕駛、推薦系統工業機器視覺、醫療裝置雲端端NLP推論、企業AI研究與快速原型

國內架構對比

維度華為MindSpore百度PaddleSlim寒武紀工具鏈
硬體耦合昇騰晶片深度定製多種硬體,尤其崑崙芯MLU系列專用
自動剪枝AutoSlim(NAS驅動)元學習剪枝晶片感知剪枝
大型模型支援支援昇思大型模型壓縮聯合文心大型模型特定CV/NLP模型
生態開放度開源,政企客戶多開源,開發者廣重點在自有硬體閉環

初創對比

  • Neural Magic:唯一專注通用CPU的非結構化剪枝推論,2023年底推出支援LLM的DeepSparse v1.8,號稱A100級70%稀疏GPT-2推論速度可在CPU上匹敵GPU。
  • Deci:自動壓縮平台,提供“剪枝+量化+蒸餾”聯合最佳化,已為Intel、三星等客戶提高推論效率。
  • 國內:未出現完全獨立、專注剪枝的獨角獸,以華為、百度、寒武紀等大廠為主力,初創多聚焦整體模型壓縮。

綜合競爭力觀察:NVIDIA硬體生態最完善,Neural Magic以差異化CPU極致稀疏策略突圍,華為/百度在國內政企和開發者社群有深厚基礎。剪枝工具正趨於標準化,未來各大架構的基礎剪枝能力會趨同,價值點將從演算法遷移到硬體協同與自動化。


風險

1. 技術風險

  • 精度懸崖:過度剪枝可導致模型精度斷崖式下跌,且不同任務容忍度差異大。醫療影像、金融風控等高敏感領域難以承受>0.5%的精度損失,限制了剪枝率上限。
  • 重訓練成本抵消收益:迭代剪枝-微調消耗的算力可能高於直接訓練輕量模型。動態稀疏訓練尚不成熟,收斂穩定性存疑。
  • 跨平台普適性差:非結構化稀疏在通用硬體上難加速,而結構化剪枝的加速比依賴於特定編譯最佳化和運算元支援。一個模型在A晶片上優異,遷移到B晶片可能無收益。

2. 產業風險

  • 技術路徑競爭:量化、知識蒸餾、低秩分解等壓縮方法也在快速進步。某些場景下,量化(INT8/INT4)可無損大幅壓縮,剪枝的必要性被削弱。混合方法融合才是趨勢。
  • 硬體生態碎片:輝達、英特爾、高通、華為、寒武紀各自定義稀疏加速格式,開發者需適配多套標準,生態割裂限制規模效應。
  • 智慧財產權風險:剪枝演算法相關專利密集,初創公司或開源專案面臨侵權訴訟風險,可能阻礙技術擴散。

3. 倫理與可解釋性

  • 模型透明度下降:剪枝後的稀疏網路決策邊界不連續,更難解釋。金融、司法、醫療等強監管行業對此存在合規風險。
  • “綠色AI”悖論:儘管剪枝目標減碳,但追求極致壓縮而進行海量訓練搜尋可能增加總體碳足跡,引發對技術可持續性的質疑。

4. 市場風險

  • 預期過高:部分媒體宣傳“壓縮90%不失精度”多基於特定任務和模型,通用場景難以復現。過高的期望值可能導致產業投資失望。
  • 標準化缺失:剪枝效果缺乏統一的評測基準,不同研究報告採用不同指標,影響使用者決策,阻礙市場成熟。

誤讀糾偏

誤讀1:“剪枝就是盲目刪引數,模型會變差”

事實:合理剪枝後模型不僅體積縮小,泛化能力有時還能提升(類似正則化效果)。研究表明,適度稀疏可使模型在噪聲資料上更魯棒,剪枝本質是保留關鍵連線的精煉過程。

誤讀2:“剪枝後模型一定能快很多”

事實:非結構化剪枝在無專用支援的GPU/CPU上可能因為快取缺失、不規則記憶體訪問反而更慢。加速效果取決於硬體稀疏支援與最佳化庫。不能僅憑稀疏率斷言速度。

誤讀3:“剪枝可以與量化隨意疊加”

事實:壓縮技術疊加需精細流水線。先剪枝後量化可能導致量化誤差放大;先量化後剪枝則可能破壞稀疏模式。聯合最佳化(如Quantization-Aware Pruning)是活躍研究領域,並非即插即用。

誤讀4:“大型模型剪枝已經徹底解決”

事實:SparseGPT/Wanda等一次性剪枝方法驚豔且無需微調,但只做到50%-60%稀疏率,且主要面向GPT族。要實現>70%稀疏且保持強泛化能力,仍需重訓,LLM剪枝遠未成熟。

誤讀5:“只有壓縮老模型才需要剪枝,新模型直接設計小模型即可”

事實:設計高效輕量架構(MobileNet、EfficientNet等)和剪枝是互補的。輕量架構提供基線,剪枝進一步榨取冗餘,二者結合效果更佳。且現實中往往有已訓練的龐然大物需要部署,剪枝是快速路徑。

誤讀6:“邊緣裝置算力不足,只能靠雲端端,剪枝使不上力”

事實:剪枝正是推動AI向邊緣遷移的關鍵力量。經過剪枝的模型能在手機NPU上跑出接近即時速度,實現低延遲、隱私性強的端側智慧,反而減少了對雲端端的依賴。


最新事件

2024年Q1—Q2

  • NVIDIA推出TensorRT 10:集成了更強大的結構化稀疏最佳化,支援LLM的FP8量化與剪枝聯合最佳化,在H100上實現Llama 2 70B的2倍吞吐提升。(NVIDIA GTC 2024)
  • Neural Magic開源DeepSparse 2.0:支援稀疏多模態模型,新增稀疏Stable Diffusion推論,CPU上生成512×512影像僅需3秒,引發社群關注。(Neural Magic部落格,2024年3月)
  • 華為MindSpore 2.3釋出:帶來“金箍棒”(自動壓縮工具),實現自動剪枝、量化、蒸餾一站式壓縮,尤其在盤古氣象大型模型壓縮上取得突破。(華為開發者大會,2024)
  • 高通展示端側百億引數模型剪枝:在驍龍8 Gen 3上通過結構化剪枝+INT4量化執行7B LLM,演示即時聊天,推論延遲<30ms。(高通AI引擎釋出會,2024年2月)

2023年

  • SparseGPT與Wanda橫空出世:一舉將LLM剪枝門檻降至接近零,掀起大型模型剪枝“免微調”研究熱度。
  • Google推出Med-PaLM 2輕量版:通過蒸餾與剪枝結合,引數壓縮85%,在醫學問答測試上仍超越真人醫生水平。(Google Research,2023)
  • Spark-TTS將剪枝用於語音合成:字節跳動開源輕量語音合成,模型僅20MB,通過通道剪枝和分組卷積實現(GitHub,2023)。
  • 中國信通院釋出“AI模型壓縮能力評測”架構:將剪枝作為核心考察項,推動行業標準化。(信通院白皮書,2023)

2022年及以前里程碑

  • 2021年:NVIDIA Ampere架構實現2:4結構化稀疏硬體加速,使剪枝具備量產級硬體支援。
  • 2019年:彩票假設論文“The Lottery Ticket Hypothesis”獲NeurIPS最佳論文,點燃稀疏子網路研究方向。

追蹤指標

行業維度

  • 頂會剪枝方向論文佔比:每年NeurIPS、ICML、ICLR、CVPR等會議中剪枝/稀疏化論文數量和錄用率,反映學術熱度。
  • 開源架構剪枝模組Star數/下載量:PyTorch Pruning、PaddleSlim、OpenLTH等倉庫活躍度,代表開發者採納度。
  • 晶片廠商稀疏支援路線圖:追蹤NVIDIA、高通、華為、寒武紀的產品白皮書中對稀疏格式和加速比的承諾。

技術維度

  • SOTA剪枝模型精度-稀疏率圖表:定期更新的社群基準(如Papers with Code、MLPerf Tiny),追蹤不同模型和任務下的壓縮前沿。
  • LLM剪枝零樣本效能維持率:監控SparseGPT、Wanda等方法在MMLU、HellaSwag等基準上的分數,瞭解泛化能力。
  • 重訓練成本:剪枝後恢復精度的GPU小時數,越低越好。

市場維度

  • 模型壓縮專利授權/訴訟動態:尤其關注中美關鍵技術專利變化,可作為產業成熟度的訊號。
  • 初創融資與併購:Deci、Neural Magic等的融資進展,以及大型科技公司對壓縮初創的收購,反映資本熱度。
  • 雲端廠商模型最佳化服務使用量:AWS SageMaker Neo、百度BML等平台剪枝作業數量(可關注財報或部落格中揭露的客戶案例)。

評測指標

  • MLPerf Inference Closed剪枝模型提交:有無廠商使用剪枝後模型衝擊性能/效率排行榜,關係商業利益。
  • 實際部署案例:手機發佈會官方公佈的端側模型體積/延時資料,可對比剪枝的工程化進展。

信源

  1. Frankle, J., & Carbin, M. (2019). The Lottery Ticket Hypothesis. ICLR 2019.
  2. Sanh, V., et al. (2020). Movement Pruning: Adaptive Sparsity by Fine-Tuning. NeurIPS 2020.
  3. Frantar, E., & Alistarh, D. (2023). SparseGPT: Massive Language Models Can Be Accurately Pruned in One-Shot. ICML 2023.
  4. Sun, M., et al. (2023). Wanda: A Simple and Effective Pruning Approach for Large Language Models. arXiv preprint.
  5. NVIDIA. (2021). Accelerating Inference with Sparsity Using the NVIDIA Ampere Architecture. Technical Blog.
  6. Neural Magic. (2023). DeepSparse: Inference at GPU-Class Performance on CPUs.
  7. MarketsandMarkets. (2023). AI Model Compression Market - Global Forecast to 2028. Report Code: TC 8705.
  8. Grand View Research. (2024). Edge AI Software Market Size, Share & Trends Analysis Report, 2024-2030.
  9. Counterpoint Research. (2024). Edge AI Processor Market Outlook.
  10. 中國信通院. (2023). AI模型壓縮能力評測架構白皮書.
  11. 華為. (2024). MindSpore 2.3 自動壓縮工具釋出. 華為開發者大會.
  12. 高通. (2024). 端側生成式AI白皮書. 高通官網.
  13. PatSnap. (2023). 模型剪枝專利分析報告.
  14. 公開部落格:百度智慧雲端大型模型推論成本最佳化實踐,2023.
  15. PaddleSlim GitHub倉庫及官方文件.

注:部分數字來自上述研究報告的公開摘要或新聞稿,具體資料口徑以原始報告為準。

source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型