模型層 開放閱讀

權重量化

Weight Quantization

概念 ID
weight-quantization
更新時間
2026-05-29
來源數量
待補

權重量化

3 秒看懂

權重量化是將神經網路權重從高精度浮點數(如 FP32)對映到低精度表示(如 INT8、FP8)的技術。核心收益是模型大小成倍縮小、推論視訊記憶體佔用驟降、計算吞吐大幅提升,通常只需要付出可忽略的精度損失,是大型模型落地的關鍵使能技術。

3 分鐘產業解釋

深度學習模型的權重傳統上以 32 位浮點數(FP32)儲存,每個權重佔 4 位元組。一個千億引數的大語言模型僅權重就需 400 GB 以上視訊記憶體,遠超出單張 GPU 的容量。權重量化通過把每個權重對映到一個低位元的離散值(例如 8 位整數),並保留一個縮放因子,使模型體積壓縮為原來的 1/4,甚至壓縮到 4 位元、2 位元。這直接降低了對視訊記憶體、記憶體頻寬和計算資源的需求,使大型模型能在端側裝置上執行,或在資料中心用更低成本的 GPU 進行推論,同時還能利用專門的低精度運算單元(如 Tensor Core 的 INT8 指令)獲得數倍的吞吐量提升。
工程上分兩條路徑:訓練後量化(PTQ) 不修改訓練,只需要少量校準資料即可完成,簡單快速;量化感知訓練(QAT) 在訓練時模擬量化噪聲,精度保持更好,但成本高。目前工業界大規模部署的推論服務,如 LLaMA、GPT 等,幾乎都重度依賴權重量化,尤其採用分組量化、混合精度等策略。量化不僅改變儲存和計算形式,還引發出對硬體生態、數值穩定性、模型質量之間的複雜權衡。

15 分鐘專家深入

權重量化的本質是一個數值表示壓縮問題。給定一個原始權重張量,通過仿射變換對映到整數域:
q = round(W / s) + z
其中 s 為縮放因子(scale),z 為零點(zero‑point),q 為量化後的整數,W 為原始權重。反量化時近似恢復:W ≈ s × (q − z)。
核心挑戰是確定 s 和 z 的最小化資訊損失,同時使計算圖可以在整數域高效執行——大部分推論引擎會將卷積 / 矩陣乘轉換為整數運算,僅反量化當需要高精度累加時。

粒度與分組:張量級量化只用一個 scale,自適應弱,易造成大動態範圍值精度丟失。通道級量化(per‑channel)為每個輸出通道分配 scale,已在卷積和全連線層成為標準。更細粒度的分組量化(如 per‑group,每 128 個元素一組)大幅改善低位量化(4‑bit)精度,是 LLM 權重量化的主流方案,例如 GPTQ 和 AWQ 均基於分組量化。粒度越細,額外儲存的 scale 越多,需權衡壓縮率。

對稱與非對稱:對稱量化 (z=0) 簡化為 q = round(W / s),對齊零點,硬體實現更高效,但要求權重分佈對稱。非對稱量化可更好覆蓋偏移分佈,但需要額外處理零點偏置,增加推論開銷。

動態與靜態量化:動態量化每次推論時即時計算 scale / zero‑point,適用於啟用值難以預估的情形,但帶來額外開銷。靜態量化用校準資料預先確定,推論更快,是生產中的主流。

低位量化的編碼方式:INT8 已成熟,INT4 是當前 LLM 部署的熱點,且有 GPTQ、AWQ、QLoRA 等方法支撐。更極端的 2‑bit 通常需引入向量量化(如 QuIP、AQLM 等)或混合精度(對異常值保持高精度)。浮點格式 FP8(E4M3/E5M2)也在興起,其動態範圍更大,對異常值更魯棒,訓練和推論統一格式的趨勢在增強。

硬體協同:權重量化需要硬體提供對標量的低精度乘法累加指令。NVIDIA GPU 從 Turing 開始支援 INT8 Tensor Core,Ampere 引入稀疏結構化加速,Hopper 支援 FP8。端側則有 ARM NEON、NPU 的支援。不同硬體的量化方案必須匹配其記憶體版面配置(如 NHWC/channel‑last)和指令集,因此部署工具(如 TensorRT、OpenVINO、ONNX Runtime)會進行平台感知的量化最佳化。

挑戰:異常值(outlier)是低位量化的主要敵人——少數權重絕對值遠大於其他值,會導致 scale 過大,使大部分值量化後失準,通常需要特殊處理(如混合精度保留、SmoothQuant 等)。不同任務對量化敏感度不同:分類任務容忍度較高,生成任務和帶長尾分佈的任務更敏感。權重與啟用的聯合量化策略也需要慎重設計,如 LLM 推論通常對權重用 4‑bit 分組量化,對 KV cache 使用 8‑bit 或 FP8 量化,啟用保留 16‑bit 或動態量化。

技術原理

量化對映與反量化

以 8‑bit 對稱量化為例:
scale s = max(|W|) / 127
q = clamp(round(W / s), -128, 127)
反量化:Ŵ = s × q

實際計算中,為利用整數矩陣乘法器,會將權重 q 和輸入啟用均量化為整數,矩陣乘結果 dequantize 回浮點以便後續操作。關鍵因子 s 可能會被融合進後續的 BatchNorm 或啟用函式中,以減少轉換。

分組量化的矩陣計算

對於分組量化(group size = g),每 g 個元素使用獨立的 s,權重矩陣 W 被分割為多個組。計算時需對每組的啟用分組子塊乘以對應的 s₁, s₂…,這可通過 outer‑product scaling 實現:
啟用 X 保持統一量化,與量化權重 q 計算後,按組乘以不同的反量化因子,再累加。該模式被 Marlin (4‑bit 推論核)等實現高效處理。

量化模擬與梯度估算

在 QAT 中,前向傳播應用量化函式(含 round),但反向傳播時 round 梯度處處為 0。採用直通估計器(STE):對 round 的梯度硬設為 1,允許梯度穿過量化節點。因此權重仍能更新,同時使分佈適應量化網格。訓練中往往配合可學習的量化步長(LSQ)進一步提升精度。

異常值處理策略

  • 混合精度:憑幅度或熵判定少量異常通道/維度保留 FP16,其餘 INT4/INT8。LLM‑int8() 便是對異常列使用 FP16,其餘 INT8。
  • SmoothQuant:通過縮放因子平滑啟用和權重的異常值分佈。
  • 非均勻量化:如網格化對映、K‑means 聚類,但有硬體推論支援較弱的問題。

典型流程(ASCII)

原始 FP32 權重

    ├─ 校準資料 → 統計範圍 → 確定 scale / zero-point

    ├─ 權重量化:Q = round(W / s) + z

    ├─ (可選)插入 Quantize / Dequantize 節點到計算圖

    └─ 圖最佳化:融合 BN/啟用,替換為整數運算元

技術演進史

  • 2015 年前後:神經網路量化以二值網路(BinaryConnect)、三值網路等極低位元探索為主,多屬學術前瞻,缺少硬體生態。
  • 2018 年前後:Google 釋出 TensorFlow Lite 量化白皮書,提出訓練後量化方案;Jacob 等提出整數運算推論,正式將 INT8 引入行動端落地。TensorRT 推出 INT8 校準。標誌量化進入工業。
  • 2018‑2020:量化感知訓練(QAT)方法成熟(如 LSQ、LSQ+),通道級量化成為標配。端側和自動駕駛晶片(如高通 Hexagon、特斯拉 FSD)廣泛內建 INT8 加速單元。
  • 2020‑2022:異常值問題被關注,大型模型興起催生 LLM.int8(),首次證明千億模型可用 INT8 零精度損失推論。隨後 GPTQ 提出基於近似二階資訊的訓練後量化,將 4‑bit 分組量化推向商用。
  • 2022‑2023: AWQ、SqueezeLLM、SpQR 等方法深入最佳化權重重要性和異常值保護,4‑bit 成為 LLM 部署標準。同時 FP8 格式被提議並納入 Hopper 架構,訓練和推論企圖統一浮點量化。
  • 2024 至今:量化向全面的低位異構演進,混合精度自動搜尋實現,MoE 結構的量化策略(如 QMoE)、KV cache 量化、啟用量化等新發展。“2‑bit 時代”在特定任務出現,但普遍性仍欠佳。

技術路線對比

路線位寬典型值量化時機精度保持工程複雜度推論加速比*硬體需求典型方法/工具
訓練後量化 (PTQ)INT8/FP8訓練後好(INT8);中等(INT4)4×(INT8);理論 8×(INT4,實際受限)通用 GPU/NPUTensorRT, ONNX Runtime, openvino
量化感知訓練 (QAT)INT8/FP8訓練中很高,接近原模型高(需重新訓練或微調)同 PTQ訓練叢集LSQ, LSQ+, torch.quantization
分組權重量化 (GPTQ風格)4‑bit訓練後優秀,尤其 LLM中(需校準資料和近似 Hessian 逆)倍於記憶體頻寬節省,計算時鐘週期減半定製核 (如 Marlin) 或支援 groupwise 的 GPUGPTQ, AWQ
混合精度量化混合 INT4/INT8/FP16PTQ/QAT最佳,可接近無損較高類似分組量化,但需動態排程同分組量化LLM-int8(), SpQR, QLoRA
浮點量化 (FP8)E4M3/E5M2PTQ/QAT好,對異常值魯棒2×(僅格式轉換,頻寬× 2)Hopper GPU, 未來 NPUTransformer Engine, MS-AMP
  • 加速比受記憶體頻寬、計算單元限制,數值為理論估算,實際視模型和硬體而定,部分資料為業界共識範圍。

上下游

  • 上游-演算法與工具鏈:量化演算法研發(高校、研究組織)、神經網路編譯器與推論架構(TensorRT、ONNX Runtime、TVM、MLIR、IREE)、數學庫與 GPU 核心(cuDNN、CUTLASS、Marlin)。硬體指令集定義(如 arm-sve、NVIDIA PTX)。
  • 中游-模型與平台:大型模型訓練廠商(OpenAI、Meta、百度等)釋出模型時會提供量化版本或配置;雲端服務商(AWS、Azure、GCP)提供量化推論例項;MLOps 平台整合量化流水線。
  • 下游-應用與部署:端側推論(手機、汽車、IoT)、即時推論服務(聊天機器人、推薦系統)、邊緣雲端、專有推論晶片(Groq、Graphcore、寒武紀等)均直接依賴權重量化實現成本和延遲指標。

關鍵指標

  • 壓縮比:量化後模型體積 / 原模型體積,如 INT8 → 0.25,INT4 → 0.125(不計後設資料)。
  • 量化誤差:常用困惑度上升(語言模型)、準確率下降(分類)、PSNR/SSIM(影像)等衡量。以<0.5% 準確率損失或困惑度微增視為可接受。
  • 吞吐量:每秒生成的 token 數或推論的樣本數。量化對吞吐的提升上限受制於硬體低精度算力(TOPS)和記憶體頻寬。
  • 校準成本:所需校準樣本數(如 128 張圖片或數萬 token 文本)和校準時間。
  • 推論準備延遲:若量化步驟在載入模型時進行,則權重轉換時間需納入首幀延遲。

供需與市場資料

由於搜尋不可用,具體市場規模無法給出確切數字,但可從產業動態定性描述:

  • 大型模型爆發驅動權重量化需求呈指數增長。每個部署千億引數模型的推論服務都必須量化,雲端廠商採購大量支援 INT8/FP8 加速的 GPU,形成“量化—硬體升級”正反饋。
  • 端側晶片(如高通、Apple、聯發科的 NPU)對 INT8/INT4 算力的支援已成為旗艦 SOC 標配,推動量化技術從雲端向邊緣下沉。
  • 開源社群量化工具活躍,如 Hugging Face 上已提供大量 GPTQ/AWQ 量化模型,下載量數以百萬計,反映出旺盛的量化模型使用需求。
  • 新興推論晶片創業公司(如 d-Matrix、EnCharge AI)將超低位量化(4‑bit 乃至更低)的能效作為核心競爭點。
    (有關出貨量和市場規模的精確數字,可參考 Gartner 或 IDC 針對 AI 推論加速器的報告,但未在此列出具體數值。)

代表公司與資本對映

  • 輝達:從 Turing 到 Hopper 架構通過 Tensor Core 不斷強化低精度算力,提供 TensorRT 量化架構和 Triton Inference Server,主導雲端推論基礎設施。在資本市場,其硬體產品迭代直接繫結量化演算法演進進度。
  • 高通:行動端 AI 引擎 Hexagon 處理器支援 INT8/INT16,通過 AIMET 提供 QAT/PTQ 工具鏈,賦能端側大型模型(如手機終端執行 7B 模型),成為端側量化生態核心。
  • Meta/FAIR:開源 LLaMA 系列及提示工程,同時貢獻 LLM.int8() 等關鍵量化方法,影響學術與產業。
  • Hugging Face:直接向開發者提供 GPTQ 等量化模型的託管和推論介面,降低量化應用門檻,自身估值提升受益於社群龐大流量。
  • 初創企業:CentML、OctoML 等提供自動化模型壓縮和量化部署平台;MosaicML(已被收購)等將量化納入訓練棧。這些公司在融資中強調量化實現的成本優勢。

投資邏輯

  1. 推論成本革命:權重量化是目前降低大型模型推論 TCO(總擁有成本)最有效且確定性最強的技術路線。投資推論硬體、量化架構、壓縮工具鏈意味著分享大型模型商用落地的收益。
  2. 邊緣 AI 滲透:終端裝置算力受限,量化是端側部署大型模型的必要條件,推動 NPU、低功耗晶片及相關軟體棧的價值。
  3. 軟硬一體化紅利:擁有自己的量化-硬體閉環的廠商(如 NVIDIA)會在推論市場保持毛利率,而開源量化方法則會加速競爭,可能壓低純硬體獲利率。
  4. 技術路線的風險:極端低位量化硬體相容性和演算法通用性尚未統一;若新型稀疏化方法(如 MoE 路由剪枝)取得突破,可能分流部分量化投入,需追蹤。

常見誤讀糾偏

  1. “量化就是直接把權重砍掉幾位,精度自然就損失了。”
    實際上,現代量化會通過校準資料和細緻的縮放因子設計保留絕大部分有效資訊,並且配合重訓練(QAT)或高階誤差補償,INT8 量化在大多數模型上造成的精度下降微乎其微,甚至可通過量化帶來的回合噪聲提升泛化。將量化等同於精度大幅下降是一種過時印象。

  2. “4‑bit 量化是極限,再低就沒用了。”
    2‑bit 及更低位量化的研究取得進展,如 QuIP、AQLM 等方法藉助向量量化和熵編碼,可在極其有限的位元預算下保持可用的模型質量,尤其適用於快取和傳輸受限的場景。儘管硬體生態尚不完善,但技術前沿並未停步。

學習路徑

  • 基礎入門:閱讀 Jacob et al. 的《Quantization and Training of Neural Networks for Efficient Integer-Arithmetic-Only Inference》(2018),理解整數推論和量化對映。
  • 深入實踐:在 PyTorch 中嘗試 torch.quantization,完成一個 ResNet INT8 量化端到端示例;閱讀 NVIDIA TensorRT 的 INT8 校準文件,理解 calibration 流程。
  • 大型模型量化前沿:研讀 LLM.int8() 論文、GPTQ 論文(Frantar et al., 2023)、AWQ 論文(Lin et al., 2024),以及 SmoothQuant(用於啟用量化),理解異常值處理和分組量化核心。
  • 硬體友好實現:研究 CUTLASS 中 groupwise GEMM 示例,瞭解分組量化的底層 Kernel 設計;對比 Marlin 推論核效能。
  • 系統視角:閱讀 MLIR 量化 dialect 和 TVM 量化方案,理解編譯器層面的量化和圖最佳化;關注 FP8 標準(NVIDIA 的 Transformer Engine)的演進。

一句話總結

權重量化是用極小的精度代價換取儲存和算力需求數量級縮減的槓桿支點,是讓大型模型從實驗室走向億萬終端和高效雲端推論的根基技術。

延伸閱讀與來源

由於本次檢索未能返回即時結果,以下列出該領域的代表性文獻和業界資源(均為開源或公開出版物),供讀者深入查閱:

  • Jacob B, et al., “Quantization and Training of Neural Networks for Efficient Integer-Arithmetic-Only Inference”, CVPR 2018.
  • Dettmers T, et al., “LLM.int8(): 8-bit Matrix Multiplication for Transformers at Scale”, NeurIPS 2022.
  • Frantar E, et al., “GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers”, ICLR 2023.
  • Lin J, et al., “AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration”, MLSys 2024.
  • NVIDIA TensorRT 開發者指南(INT8 量化章節).
  • PyTorch 量化文件(https://pytorch.org/docs/stable/quantization.html).
  • 各開源量化工具庫:AutoGPTQ, BitBLAS, llm-awq 等 GitHub 倉庫.

注:本文技術闡述基於領域共識,未引用未公開資料,具體數值均標為普遍認知範圍或[未充分揭露],精確量化效能結果應參考實際測評。

source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型