概念庫 開放閱讀

剪枝

概念庫 · 開放閱讀

概念 ID
pruning
更新時間
2026-06-03
來源數量
1

剪枝

1. 3 秒看懂

  • 一句話定義:AI模型的“精準瘦身術”——通過識別並移除神經網路中冗餘的權重、神經元或結構塊,在保持模型能力幾乎不受損的前提下,大幅壓縮模型體積、降低計算延遲與功耗。
  • 核心價值:讓原本需要昂貴叢集部署的大型模型,能夠以更低的成本在雲端端推論,或順利落地到手機、汽車、攝像頭等邊緣裝置上,實現輕量化推論。
  • 關鍵資料:在典型的視覺與語言任務中,先進的剪枝方法可將模型引數規模減少80‑95%,同時將推論吞吐提升2‑5倍,且精度下降通常控制在1個百分點以內(綜合 Han et al., 2015;Frankle & Carbin, 2019;SparseGPT 2023 等公開研究;實際結果因模型、任務和剪枝策略而異)。

2. 3 分鐘產業解釋

  • 技術背景:隨著大語言模型、多模態模型的急劇膨脹——引數從百億邁向萬億——其訓練和推論所需的算力、記憶體和電力已成為瓶頸。以 175B 引數的 GPT‑3 為例,單次推論需要約 350 GB 視訊記憶體;將此類模型部署於雲端端或終端,必須依賴模型壓縮技術。剪枝作為三大型模型壓縮技術(剪枝、量化、知識蒸餾)中最為直接的手段,通過削減冗餘引數,直接降低“矽”成本。
  • 鏈(Chain‑Cloud)視角:“鏈”指模型研發與工具鏈,“雲端”指大規模推論服務。在“端‑邊‑雲端”協同產業中,剪枝技術橫貫兩端:
    • 鏈端(模型研發/工具鏈):AI架構(如 PyTorch、TensorFlow、PaddlePaddle)內建剪枝 API,研究人員和工程師在開發階段即對模型進行剪枝與適配,形成輕量化版本。自動化剪枝架構、AutoML 工具和與晶片耦合的編譯最佳化也發生在此端。
    • 雲端端(大型模型推論服務):雲端服務商在推論叢集中大規模執行剪枝後的模型,降低 GPU/CPU 租用成本、降低響應時延、提高併發吞吐。同時,雲端端也成為剪枝模型的持續迭代和分發的樞紐,為下游裝置提供定製化的輕量化模型。
  • 產業意義:剪枝直接降低了 AI 規模化落地的總擁有成本(TCO)。在智慧駕駛中,車端模型必須滿足嚴格的即時性與功耗約束;在智慧手機的影像、語音、手寫識別中,剪枝使大型模型上端成為可能;在工業物聯網中,剪枝可以減少對通訊頻寬的依賴,推動本地智慧推論。
  • 市場分佈概況:全球範圍,剪枝技術的研發主力集中在北美科技巨頭的核心 AI 實驗室、中國頭部網際網路與 AI 企業,以及全球頂尖高校。商業層面,與 AI 推論加速器、邊緣 AI 晶片、模型即服務(MaaS)等賽道緊密關聯。

3. 技術原理

3.1 核心思想

神經網路中存在大量引數對最終輸出影響極小,剪枝的本質是建置一種“重要性評估函式”,對權重、神經元、通道或注意力頭等元件進行打分排序,移除低分部分,隨後通過微調(fine‑tuning)或重新訓練來恢復效能。其理論基礎可追溯到“奧卡姆剃刀”和泛化理論,以及近年來的“彩票假設”(Lottery Ticket Hypothesis):稠密大網路中往往存在一個能獨立復現效能的稀疏子網路。

3.2 重要性評估方法

  • 基於幅度(Magnitude‑based Pruning):假設絕對值越小的權重越不重要,直接刪除。實現簡單、計算開銷低,但對深度網路的敏感結構易造成精度崩塌。
  • 基於梯度(Gradient‑based Pruning):利用損失函式對引數的梯度資訊評判重要性,如 SNIP、GraSP。
  • 基於泰勒展開(Taylor‑based Pruning):通過估計移除引數引起的損失變化來指導剪枝,精度更高,但計算代價較大。
  • 基於輸出敏感度:衡量刪除某個通道後輸出啟用的擾動程度,代表工作有 ThiNet、Channel Pruning。
  • 可學習掩碼(Learned Mask):通過在訓練時學習二進位制掩碼實現動態剪枝,手法有變分推斷、Gumbel‑Softmax 等。

3.3 剪枝粒度

  • 權重級(Fine‑grained):移除單個權重連線。
  • 向量/核級:移除卷積核內的向量或引數組。
  • 通道/濾波器級(Structured):刪除整張輸出特徵圖的通道或卷積層中的濾波器。
  • 層/塊級(Coarse‑grained):整體跳過某個層或殘差塊。 粒度越粗,越能直接利用通用硬體加速,但壓縮空間越受限;粒度越細,壓縮率越高,但往往需專用稀疏硬體或軟體最佳化才能實現實際加速。

3.4 剪枝‑微調流程

典型流程:預訓練一個足夠大的模型 → 評估重要性並剪枝 → 用原始或部分訓練資料進行微調 → 反覆迭代逐步剪枝與恢復(迭代剪枝) → 獲得壓縮模型。一次性剪枝(one‑shot)省略反覆步驟,適合快速部署。

3.5 前沿研究方向

  • 超大規模剪枝:面向千億引數的 LLM,探索無需重新訓練或僅需小樣本校準的剪枝方法(如 SparseGPT、Wanda)。
  • 任務自適應剪枝:同一個模型針對不同下游任務保留不同子網路,實現“一軀多職”。
  • AutoML 剪枝:利用強化學習或進化演算法自動搜尋每層最優剪枝率(如 AMC、NetAdapt)。
  • 軟硬協同剪枝:晶片設計直接提供細粒度稀疏矩陣加速單元(如 NVIDIA Ampere 的稀疏 Tensor Core),編譯器將剪枝後的稀疏模式翻譯為高效指令。

4. 關鍵引數

在評估剪枝方案時,業界普遍關注的指標及其工程意義如下:

指標常見單位/描述重要性說明
稀疏度(Sparsity)百分比,如 90% 權重為零直接體現壓縮程度,非結構化稀疏度可達 95% 以上。
引數壓縮比倍數(原始引數 / 剪枝後引數)與儲存和頻寬強相關,結構化剪枝壓縮比常低於非結構化。
FLOPs 下降比百分比/倍數反映計算量節省,但 FLOPs 下降不一定等同於實際延遲下降(受硬體和 IO 限制)。
實際吞吐量提升推論樣本/秒、延遲 ms必須在目標硬體上實測。非結構化剪枝若無專用加速,可能吞吐幾乎無提升。
精度損失Top‑1/Top‑5 準確率下降百分點需權衡:一般要求損失 ≤ 0.5‑2 個百分點。部分安全關鍵場景(如自動駕駛)可能要求零損失。
記憶體佔用減少MB/GB模型權重、啟用快取和最佳化器狀態的總佔用。剪枝後模型更小,支援小視訊記憶體裝置。
功耗降低瓦特、焦耳/推論端側裝置特別關注,剪枝直接降低運算電路使用量。
重訓練代價GPU‑hours決定方案的經濟可行性。無需重訓練的零校準剪枝(如 SparseGPT)最具成本優勢。

“關鍵引數”資料來源於頂尖論文實測和廠商白皮書,無統一行業標準,不同基準下數值差異較大。真實部署時需以在目標硬體上的端到端測量為準。

5. 技術路線

剪枝技術流派可沿多個維度劃分,路線選擇直接影響硬體親和度、壓縮效果與部署可行性。

5.1 結構化 vs 非結構化

  • 非結構化剪枝:在任意位置刪除權重,產生細粒度稀疏矩陣。理論壓縮率最高,但需要專門的稀疏矩陣運算庫(如 cuSPARSE)或支援稀疏的硬體(如 NVIDIA A100 的 2:4 稀疏模式)才能加速。在通用 CPU/GPU 上反而可能因不規則訪存而變慢。
  • 結構化剪枝:強制以規則塊(通道、濾波器、層)為單位刪除,保持模型結構的規整。可直接利用現有稠密運算庫(cuBLAS、MKL)和 NPU 獲得近乎線性的加速,無需特殊硬體。當前工業部署的主流路線。

5.2 訓練後剪枝 vs 訓練中剪枝

  • 訓練後剪枝:在已訓練好的模型上操作,通常僅需少量校準資料(如幾百條樣本)進行權重調整,成本極低。代表方法:SparseGPT、Wanda、LLM‑Pruner。適合特大型模型。
  • 訓練中/訓練前剪枝:在訓練伊始或過程中動態剔除不重要的連線,並利用剩餘容量學習。代表性有“彩票假設”的迭代幅度剪枝(IMP)、隨機初始化下尋找子網路(Edge Popup)。壓縮率可達極高,但訓練成本大。

5.3 一次性 vs 迭代剪枝

  • 一次性剪枝:剪枝後微調一次即可,流程簡單,適合快速部署。
  • 迭代剪枝:剪 → 微調 → 再剪 → 再微調,迴圈多次,逐步逼近高壓縮率下的精度極限,但耗時長。

5.4 基於正則化/可微分剪枝

通過為網路新增稀疏性正則項(如 L1、Lasso),或利用可微分掩碼將剪枝融入梯度最佳化中,無需顯式重要性評估。這一路線在自動搜尋和端到端訓練中逐漸流行。

5.5 面向大型模型的新路線

對於 LLM,剪枝正從“剪完需微調”向“免訓練剪枝+小量校準”演進。SparseGPT 在 OPT‑175B 上實現了 50% 結構化稀疏度,僅需數小時校準,精度幾乎無損;Wanda 則完全基於權重與啟用值的乘積判據,無需反向傳播。此類新路線極大降低了大型模型壓縮門檻。

6. 上游

上游指為剪枝提供理論基礎、演算法架構、工具鏈和基礎硬體的供給方。

  • 學術研究與前沿演算法:全球頂尖高校和研究機構是剪枝演算法的策源地。麻省理工學院(MIT)的 ISL 實驗室、斯坦福大學、UC Berkeley 在彩票假設、稀疏訓練方面貢獻顯著;中國的清華大學、北京大學、上海交通大學等團隊在結構化剪枝、輕量化視覺模型方面持續產出 NeurlPS、ICML、CVPR 等頂會論文。
  • AI 架構與工具鏈
    • PyTorch:torch.nn.utils.prune 提供基礎的權重剪枝;社群專案如 Torch‑Pruning、MvP、structural‑pruning 提供了結構化剪枝庫。
    • TensorFlow:TensorFlow Model Optimization Toolkit 內嵌了訓練時剪枝 API,支援多種稀疏模式。
    • 華為 MindSpore、百度 PaddlePaddle:內建模型壓縮套件,提供一鍵剪枝能力,並與各自的昇騰/崑崙晶片工具鏈深度耦合。
    • 第三方工具:如 NVIDIA TensorRT 集成了推論時的層融合與結構化剪枝最佳化;Apache TVM 通過 BYOC 可引入自定義稀疏運算元。
  • 編譯器與中介軟體:TVM、MLIR 等編譯器基礎設施通過稀疏程式碼生成,讓剪枝後的模型在多樣後端上獲得實戰加速;XLA 也對稀疏操作有一定支援。
  • 專用硬體與 IP 提供商
    • NVIDIA:從 Ampere 架構起支援 2:4 結構化稀疏,Tensor Core 可加速細粒度剪枝。
    • 寒武紀:思元系列 NPU 的指令集對結構化剪枝模型友好,支援高效推論。
    • 地平線:征程系列車載 AI 晶片的工具鏈深度集成了結構化剪枝與量化協同最佳化流程。
    • 其他:Graphcore IPU、Groq 等新架構也聲稱能高效處理稀疏計算。

7. 下游

下游是將剪枝模型實際部署、運營並從中獲取商業價值的環節。

  • 雲端推論服務:AWS Inferentia、阿里雲端 PAI、騰訊雲端 TI、百度智慧雲端等均在模型服務中引入剪枝最佳化例項,以降低每萬 token 的服務成本。通過剪枝,雲端廠商可以在同規模叢集中承載更多併發推論請求,直接改善毛利。
  • 邊緣/端側裝置部署
    • 智慧手機:Apple Core ML、高通 SNPE、聯發科 NeuroPilot 等推論引擎均建議開發者提交剪枝後模型;小米、OPPO、vivo 在端側影像、語音助手中大量使用輕量化模型。
    • 智慧駕駛:車載域控制器(如 NVIDIA Orin、地平線征程 5)上執行的感知、規劃模型必須經過剪枝以滿足嚴格的幀率和功耗要求。特斯拉、小鵬、蔚來等整車廠的自研模型中均嵌入了剪枝流程。
    • 物聯網與可穿戴:Arm Ethos‑U 微 NPU、Silicon Labs 等 MCU 級 AI 加速器採用極度壓縮的剪枝模型,實現關鍵詞識別、振動異常檢測。
  • 垂直行業解決方案:金融風控的反欺詐模型、醫療影像的輔助診斷模型、工業視覺的缺陷檢測模型等,常需要在特定算力受限的工控機或邊緣盒子上執行,剪枝是必選項。華為、海康威視等整合商的方案中均內嵌剪枝版本模型。
  • 開發者生態與自動化平台:Hugging Face 上已出現大量剪枝後的社群模型;OctoML、Deci 等新創工具通過自動化流程,為使用者生成針對特定硬體的最優剪枝方案,降低使用門檻。

8. 受益公司

以下僅從產業鏈位置客觀分析剪枝技術普及可能帶來的成本結構改善或業務機會,不構成任何投資建議或推薦。

  • 雲端運算運營商:微軟 Azure、AWS、Google雲端、阿里雲端、騰訊雲端等。剪枝直接降低雲端端推論的 GPU/CPU 租賃成本,提升資源利用率,在大型模型服務規模化後正向效益顯著。
  • AI 晶片與推論加速器廠商:NVIDIA、AMD、Intel(Habana)、寒武紀、地平線、黑芝麻、Graphcore、Groq 等。剪枝帶來的稀疏計算需求促進其新一代架構的差異化賣點;同時工具鏈支援剪枝能幫助客戶更易遷移。
  • AI 開發架構及工具鏈企業:PyTorch(Meta)、TensorFlow(Google)、華為(MindSpore)、百度(PaddlePaddle)以及 Deci、OctoML 等 MLOps 創業公司。工具鏈的剪枝能力直接決定開發者粘性和平台生態。
  • 終端裝置與整車廠:Apple、高通(驍龍平台)、聯發科、特斯拉、蔚來、小鵬、理想、小米等。能夠將更大引數模型壓縮到手頭硬體中,提升產品 AI 功能競爭力,同時降低雲端端通訊的依賴。
  • 大型模型廠商:OpenAI、Anthropic、百度(文心)、阿里(通義)、商湯、科大訊飛等。通過剪枝可以推出更具價效比的 API,擴大開發者生態,佔據更多市場份額。
  • 安防與物聯網解決方案商:海康威視、大華、華為機器視覺等。端側推論能效提升直接拓寬產品在無雲端環境下的應用。

需要指出的是,剪枝只是眾多降本環節之一,任何公司需結合量化、蒸餾、底層硬體創新才能獲得全棧優勢。

9. 市場規模

直接獨立統計缺失說明:截至 2024 年底,主流市場研究機構(如 Gartner、IDC、Grand View Research、MarketsandMarkets)未釋出專門針對“剪枝技術”的獨立市場規模報告。所有相關數字均來自包含剪枝、量化、蒸餾等的寬泛市場,不能等同於剪枝自身的價值體量。因此,剪枝的獨立市場規模——公開資料未見。

可參考的關聯市場口徑(均來源於 2023‑2024 年公開發布的行業報告,口徑已註明):

  • 模型壓縮軟體市場:據 Grand View Research 2023 年底釋出的報告,2022 年全球模型壓縮軟體市場規模約 2.3 億美元,預計 2030 年將達到 9.8 億美元,年複合增長率約 17.5%。該統計口徑包含模型剪枝、量化、蒸餾等軟體工具與相關服務,未提供剪枝細分。
  • AI 推論最佳化市場:The Insight Partners 2023 年估計,全球 AI 推論最佳化(含模型壓縮、推論引擎、硬體加速)市場 2023 年約 12 億美元,2028 年有望超 30 億美元。剪枝作為核心技術元件,覆蓋部分份額。
  • 邊緣 AI 晶片及推論加速:據 ABI Research 及 Omdia 資料,2023 年全球邊緣 AI 晶片營收約 64 億美元,其中對剪枝等輕量化技術的需求滲透率持續提升。但同樣未單列剪枝貢獻。

雲端推論降本視角:大型模型雲端推論的年市場(以 API 呼叫計)2023‑2024 年處於高速增長期,僅 OpenAI 的推論營收即達數十億美元量級(公開媒體估算,未審計)。剪枝若能幫助雲端商降低 30% 推論 GPU 消耗,對產業鏈的價值將十分巨大。這也從側面說明,剪枝的隱性市場體量可能遠大於直接工具售賣營收。

10. 玩家對比

以下對比聚焦於主流的 AI 架構/工具鏈在剪枝方面的公開能力,均基於各專案 2024 年公開文件與社群生態評估,不構成傾向性推薦。

玩家/專案剪枝 API 成熟度結構化剪枝支援非結構化稀疏加速硬體/編譯器協同開源生態適用場景
PyTorch (Meta)基礎權重剪枝 (torch.nn.utils.prune);社群庫豐富 (Torch‑Pruning 等)社群庫完全支援,官方未直接提供依賴 NVIDIA 2:4 稀疏支援,社群有探索良好,通過 ONNX/TensorRT 匯出極佳,大量論文研究與模型學術研究、自定義部署、靈活實驗
TensorFlow (Google)TensorFlow Model Optimization Toolkit 較全面支援權值聚類驅近結構化,有初步通道剪枝 API部分支援,結合 XLA 稀疏運算元較好,與 TFLite/Edge TPU 聯動成熟,但新研究方向 PyTorch 優勢端側部署、Android/iOS 最佳化
PaddlePaddle (百度)PaddleSlim 提供裁剪、係數稀疏化等 API全面支援通道、Filter 剪枝,提供自動化搜尋工具通過軟硬體協同,結合崑崙芯支援稀疏與飛槳/崑崙芯深度繫結在中國發展迅速,生態豐富中國雲端/端業務,文心大型模型最佳化
MindSpore (華為)模型壓縮工具包整合剪枝支援通道、層剪枝,結合昇騰硬體親和依賴昇騰架構,有結構化稀疏支援極致軟硬體協同,自動調優開源,逐步擴充套件華為生態(Ascend、CANN)內最佳
TensorRT (NVIDIA)推論最佳化器,支援層剪枝、融合可實現通道剪枝,需配合量化從 Ampere 起支援 2:4 結構化稀疏加速NVIDIA GPU 專屬最佳化閉源,但社群廣泛使用雲端端/邊緣 NVIDIA GPU 推論
Apache TVM / MLIR自定義剪枝運算元支援,需手動整合高度可定製,需開發者自行實現剪枝演算法可引入稀疏後端,靈活但工作量較大支援多種後端,可對接專用硬體開源社群活躍研究機構、自定義硬體加速

以上對比基於 2024 年上半年各架構公開文件。架構快速迭代,具體能力請以官方最新版為準。許多企業採用自研剪枝工具,不在上述開源對比之列。

11. 風險

  1. 精度‑壓縮率失衡風險:過度剪枝可能引發災難性遺忘,尤其在多工、零樣本推論場景中,高稀疏度模型可能出現不可逆的效能斷崖。安全攸關領域(如自動駕駛感知)對剪枝後精度驗證要求極致,可能大幅抬高開發成本。
  2. 硬體生態碎片化:非結構化剪枝的加速極度依賴硬體和底層庫支援。目前除 NVIDIA 2:4 稀疏模式獲得一定生態外,其他硬體對細粒度稀疏的支援互不相容,導致模型難以跨平台遷移,形成事實上的“硬體鎖定”。
  3. 通用性折損:某種剪枝策略往往為特定架構/任務高度定製,遷移到新任務或新模型時需重新剪枝及驗證,增加了持續運維成本。追求高壓縮率的剪枝可能使模型喪失泛化能力。
  4. 工具鏈成熟度不足:開源架構的剪枝 API 更多是基礎功能,真正的自動化、無損剪枝仍然需要資深工程師深度介入,中小企業和初創公司面臨較高的人才壁壘。
  5. 智慧財產權與黑箱:頭部企業將部分剪枝技術作為核心 Know‑how 保護,開源工具難以復現其極致效果,導致整個行業評估基準不統一,技術透明度不足。
  6. 與量化的互動不確定性:剪枝後模型再進行量化,其敏感度和誤差傳播規律尚不完全明晰;二者如何無損耦合仍是開放問題,可能導致最終部署效果與預期存在偏差。

12. 誤讀糾偏

  • “剪枝就是直接削掉大型模型層數”→ 誤讀:剪枝不僅指去除層,更多在通道、權重級別做精細化操作,常常保留完整深度以維持表徵能力。層剪枝僅是極端情況。
  • “只要求高稀疏度就代表好”→ 片面:如果高稀疏度(如 99%)不能在實際硬體上轉化為延遲下降、反而因不規則訪存變慢,那麼非結構化稀疏度僅為“名義”指標。工程上更應關注吞吐量和功耗改善。
  • “剪枝後精度肯定下降”→ 不完全正確:合理的剪枝和微調不僅可能保持原精度,有時甚至能輕微提升泛化效能,因其相當於一種正則化。大型模型領域,SparseGPT、Wanda 等已實現 50% 稀疏且精度幾乎無損。
  • “剪枝可以獨立於量化、蒸餾單獨使用”→ 實踐中常混合:最佳壓縮收益往往來自剪枝+量化+蒸餾的組合拳,三者協同可達到單純剪枝難以企及的壓縮率和效能平衡。
  • “剪枝消滅了所有小權重”→ 誤解:剪枝是基於重要性判據,而非簡單刪除小權重。某些小權重在特定輸入下可能貢獻關鍵通路,因此幅值剪枝只是最粗糙的一種,先進方法會考慮梯度互動資訊。
  • “雲端端用大型模型不需要剪枝”→ 與現實相悖:即使雲端端擁有彈性資源,推論能耗、硬體採購與維護成本仍然巨大。剪枝可讓同規模算力服務於更多客戶,直接改善雲端商的單位經濟效益。
  • “中國在剪枝方面落後”→ 與事實不符:中國在剪枝演算法論文發表量、頂會接受量上位居世界前列,且百度、華為等已將剪枝深度整合到國產軟硬體生態中。只是在部分頂尖硬體生態和全球開源影響力上仍需加強。

13. 最新事件

  • 2023 年 6 月:Elias Frantar 等人釋出 SparseGPT 論文,首次
source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型