模型層 開放閱讀

量化

Quantization

概念 ID
quantization-2
更新時間
2026-05-29
來源數量
待補

量化

3 秒看懂

量化是把深度學習模型中用 32 位浮點數(FP32)儲存的權重與啟用,轉換為更低位寬的整數(如 INT8、INT4)來表示,從而大幅壓縮模型體積、加快推論速度並降低能耗——代價是引入可控的精度損失。其核心邏輯是建立浮點值與整數值之間的對映函式,並在模型匯出時做一次校準或微調,以維持模型效果。

3 分鐘產業解釋

在 AI 工程化中,巨型語言模型動輒數十億引數,單卡甚至多卡都很難放下,推論延遲與 TCO 直接制約產品化。量化正是把“重型”浮點運算元置換成低位整數運算的關鍵技術:

  • 價值鏈條:權重壓縮至 1/4(INT8)– 1/8(INT4),視訊記憶體壓力驟降,頻寬瓶頸緩解;整數運算吞吐量在 GPU/NPU 上遠高於浮點,能實現 2–4 倍理論加速。
  • 落地形態:雲端端推論常用訓練後量化(PTQ),只需少量無標籤校準樣本即可完成;高精度場景(如醫療、金融)更傾向量化感知訓練(QAT),在原始訓練流程中模擬量化噪聲。
  • 大型模型特需:FP16 已成為推論標配,進一步下探到 INT4 甚至 INT3 正由 GPTQ、AWQ、bitsandbytes 等工具推動,使 175B 模型能在消費級 GPU 上執行,直接催化本地化部署浪潮。

量化不是“有失真壓縮”的一刀切取捨,而是一場精度與效率的工程設計博弈,現代方案已能讓 INT4 模型與 FP16 基線在多個 benchmark 上相差不到 1%。

15 分鐘專家深入

量化本質是從高精度實數域 R 到低精度整數環 Z 的離散對映。對一個張量 r,通用仿射對映為:

r = S * (q − Z)

其中 S(尺度因子)是浮點數,Z(零點)是對應於實數 0 的整數值,q 是量化後的整數。若強制 Z = 0,即為對稱量化——有利於硬體簡化計算,但對有偏分佈的啟用可能不友好;保留 Z非對稱量化能更好地覆蓋區間,代價是推論需額外做零點補償。

關鍵維度

  • 量化粒度
    張量級(一個 S 用於整個張量)成本最低但損失大;通道級(卷積層按輸出通道獨立量化)是目前 CV/NLP 主流;子通道/組級(如 128 個元素共享一個 S)在 LLM 量化中盛行,兼顧精度與開銷。
  • 校準策略:決定 SZ 的過程。常用 MinMax(直接取極值),MSE(最小化重建誤差),或 KL 散度 校準(截斷部分離群值以換取更密表示)。
  • 量化感知訓練(QAT):在前向 pass 插入偽量化節點(fake quantization),反向使用直通估計器(STE)傳遞梯度,使模型權重適應量化噪聲。
  • 訓練後量化(PTQ):無需訓練,通過在校準集上統計啟用範圍確定量化引數。大型模型時代衍生出 Weight-Only 量化(僅權重量化,啟用保留 FP16,如 GPTQ、AWQ)和 動態量化(推論時根據輸入動態算 S/Z),以規避啟用離群值難題。
  • 混合精度:對敏感層(如 attention 輸出、首尾層)保持高精度,非敏感層激進低位寬,用少量效能換取整體精度保持。

產業中常見的量化配置被固化為 TensorRT、OpenVINO、TFLite 等推論引擎的最佳化選項,開發者只需指定目標位寬與校準集即可完成轉化。

技術原理(最深)

量化數學與對映

採用仿射對映公式:

real = scale * (quant - zero_point)

若張量 X 分佈範圍為 [min, max],對稱量化(INT8)下:

scale = max(|min|, |max|) / 127
zero_point = 0
q = clamp(round(real / scale), -127, 127)

量化誤差源於rounding(最近舍入帶來的 ±0.5 LSB 誤差)與 clipping(超出範圍的飽和截斷)。逐通道放大建模能力,使誤差分散。

偽量化節點與 STE

在 QAT 圖中:

output = scale * (clamp(round(input / scale) + zero_point, qmin, qmax) - zero_point)

前向是量化-反量化恆等函式,反向求導時將 round 梯度視為 1(STE),誤差訊號反向傳播。本質是讓權重在訓練時即習慣於離散表示。

大型模型量化難點與解法

  • 離群特徵:LLM 中某些特徵維度數值極大,導致單個 scale 無法兼顧。LLM.int8() 方案將異常維度分離為 FP16 乘法,其餘做 INT8;SmoothQuant 通過數學等價變換將量化難度從啟用轉移到權重。
  • 極低位寬:INT4 下每個權重僅用 4bit,GPTQ 利用近似二階資訊逐列量化並補償剩餘權重;AWQ 按啟用分佈“顯著度”對權重做保護性縮放;QLoRA 則量化基礎模型,用 4bit 權重加低秩介面卡省去前向全解量化的需要。
簡化的 4bit 權重矩陣(GPTQ 風格)
原始 W: [0.23, -1.45, ...]  →  W_q: [3, -6, ...]  (4bit signed int)
S = max(|W|)/7(或分割槽)
重建誤差 E = ||WX − S*(W_q)*X|| 逐列貪婪補償

硬體親和性

多數 GPU 通過 Tensor Cores 提供高效 INT8 矩陣乘(如 NVIDIA A100 可達 624 TOPS INT8,相比 FP16 的 312 TFLOPS 理論提升)。INT4 推論一般需通過 INT8 張量核模擬實現,H100 並未配備原生 INT4 張量核;專用邊緣 NPU 可能原生支援 INT4。量化方案的選取必須與目標硬體的指令集對齊——畫素分組、記憶體對齊等約束影響實際加速比。

技術演進史

  • 萌芽期(2015–2017):BinaryConnect、XNOR-Net 探索二值/三值網路,學術意義大於產業實用。Google 提出全整數量化推論(TF-Lite),使行動端部署可行。
  • INT8 產業化(2018–2020):NVIDIA TensorRT 推出 INT8 校準工具,Intel 開放 VNNI 指令集,高通 Hexagon DSP 全面鋪開。此時 PTQ 成為計算機視覺模型的標準部署步驟。
  • 混合精度與訓練(2019–2021):QAT 方案成熟,PyTorch、TensorFlow 內建偽量化 API;NVIDIA 引入 TF32 格式在 A100 中關聯 FP32 精度與半精度吞吐的折中。
  • 大型模型量化爆發(2022–至今):LLM 規模突破百億,催生混合精度分解方案(如 LLM.int8() 將離群特徵分離為 FP16)、Weight-Only 量化(GPTQ、AWQ等)、SmoothQuant、QLoRA(2023)等,以及 FP8 訓練/推論標準(NVIDIA H100 Transformer Engine)。工具鏈 bitsandbytes 使 4bit QLoRA 微調平民化,Hugging Face 整合多種量化後端。

技術路線對比(量化表)

方法量化物件是否需要訓練/校準典型位寬精度保持主要適用場景
動態量化 (PTQ)權重(離線量化)+啟用(線上統計)INT8輕微損失NLP LSTM/Transformer 權重量化+動態啟用
靜態量化 (PTQ)權重+啟用(離線校準)需校準資料集(~100樣本)INT8中等損失(需校準)CV 模型、通用生產部署
Weight-Only PTQ權重(啟用保持 FP16)可選校準INT8/INT4損失低,簡單LLM 推論,規避啟用離群值
量化感知訓練 (QAT)權重+啟用(訓練期模擬)完整訓練流程INT8,少數 INT4損失極微要求精度嚴苛的場景(醫療、金融等)
低秩適配量化 (QLoRA)基礎模型權重 INT4/NF4微調階段需 adapter 資料4bit(NF4)接近全參微調大型模型消費級微調與推論
FP8 混合精度參與計算的張量用 FP8訓練/推論原生支援FP8 E4M3/E5M2訓練穩定性優新一代 GPU 訓練吞吐最佳化

注:4bit 權重精度指 INT4 或 data type 如 NF4(正態分佈 4bit),非對稱設計更有優勢。

上下游

上游

  • 硬體 IP 與指令集:NVIDIA Tensor Cores (INT8/INT4/FP8)、Intel Advanced Matrix Extensions (AMX/VNNI)、Arm Neon/Helium、高通 Hexagon 標量/張量加速器。這些硬體的低精度吞吐能力定義量化方案的天花板。
  • 資料:靜態量化需要代表分佈的校準資料集(無需標籤);QAT 需要原始訓練資料。
  • 架構與編譯器:PyTorch、TensorFlow 提供的量化 API,ONNX Runtime、Apache TVM、MLIR 等中間表示負責運算元對映與圖最佳化。

下游

  • 雲端端推論服務:降低單 token 成本是 LLM API 規模化盈利的關鍵,INT8/FP8 推論直接關聯毛利率。
  • 邊緣裝置部署:手機 SoC(如 Apple Neural Engine、驍龍 NPU)廣泛通過 INT8 推論實現即時濾鏡、語音助手;工業、自動駕駛域控制器需確定性低延遲。
  • 端側大型模型:量化使 70 億–130 億引數模型在旗艦手機本地跑通,開啟隱私保護型 AI 應用。

關鍵指標

  • 壓縮比:模型體積相比 FP32 基準:INT8≈4× 縮小,INT4≈8× 縮小,INT2≈16×(但精度往往不可用)。
  • 推論加速比:實際測速受記憶體繫結性影響,權重張量運算可獲得 2–4× 吞吐提升,部分場景受限於啟用層或非計算瓶頸,整體延遲降低 30–70%(估算,未指定硬體)。
  • 精度損失:一般用 benchmark 準確率下降衡量。INT8 PTQ 在 ResNet-50 等視覺任務上可控制在 <1% Top-1 下降;LLM 的 INT4 量化在複雜推論任務上可能產生 2–5% 準確率衰減,採用 GPTQ/AWQ 可縮小至 <1% 差異。FP8 訓練/推論精度與 BF16 持平。
  • 能耗比:整數運算能效顯著優於浮點,INT8 操作能耗可降至 FP32 的 1/10 量級(依據行業公開研究,存在工藝差異),對邊緣裝置續航至關重要。

供需與市場資料

量化技術的供需並非以獨立市場體現,而是深度嵌入 AI 加速器、推論伺服器和邊緣晶片的競爭格局。定性來看:

  • 需求端:大型模型部署成本壓力激增,雲端廠商與 AI 開發者對推論最佳化方案的採購意願極強。過去一年,以 bitsandbytes、GPTQ 為代表的量化庫下載量與日俱增(未公開確切數字)。
  • 供給端:硬體側,旗艦訓練/推論晶片均開始原生支援 FP8/INT8/INT4;軟體側,開源社群主導創新,商業化則依託推論引擎(TensorRT、OpenVINO)和服務生態。
  • 量化對市場的影響:它實質拉低了 AI 推論的單位經濟成本,有望拓寬邊緣 AI、本地化大型模型應用的市場規模。但因其內化為基礎設施,我們難以單獨拆分其 TAM,行業報告通常將其歸入“AI 推論最佳化軟體”或“邊緣 AI 工具鏈”子類。

限於檢索工具限制,未能獲取即時財務額資料,以上為根據產業動態的定性判斷。

代表公司與資本對映

  • NVIDIA:通過 TensorRT 與 Transformer Engine(FP8)建置從訓練到推論的閉環量化方案,是其軟體護城河的關鍵。
  • Intel:OpenVINO 工具包主導邊緣量化,配合至強內建 AI 加速器(AMX)在伺服器推論市場滲透。
  • Qualcomm:Snapdragon 平台 Hexagon NPU 的量化精度與能效主導安卓端,支援 INT8/INT16 推論。
  • Apple:Core ML 將模型自動量化為適合 ANE 的 FP16/INT8,開發者幾乎透明。
  • 初創企業:Neural Magic(DeepSparse 引擎,利用 CPU 稀疏+量化加速)曾獲多輪融資;Hugging Face 集成了多種量化庫,間接建置分發優勢。
  • 資本對映:量化下游的推論最佳化平台及雲端端 AI 推論硬體公司更受資本關注,量化工具本身更多體現為開源專案,獨立賽道融資事件相對稀少(未充分揭露)。

投資邏輯

  1. 基礎設施受益:量化讓同等算力支撐更多推論請求,雲端 GPU 利用率和獲利率提升,利好輝達、頭部雲端廠商及資料中心硬體。
  2. 推論晶片分化:擅長低位寬整數運算的 ASIC/NPU(如 Groq、Cerebras)對比通用 GPU 在部分推論場景中獲得性價比視窗。
  3. 端側 AI 次生紅利:量化技術成熟解鎖智慧手機、IoT、汽車等端側晶片的新應用場景,推動對應 SoC 設計服務與 IP 授權需求。
  4. 軟體生態粘性:掌握高效量化部署工具的廠商(如 NVIDIA TensorRT 生態)可以固化開發者習慣,形成轉換成本。
  5. 風險點:量化並非萬能,超大型模型仍存在精度—效率的折中瓶頸;若未來訓練範式轉向更高精度計算(如 FP32 weight 梯度累積),可能部分場景降低對低位寬需求的迫切性。

投資判斷需結合個股估值與供應鏈核查,本分析僅展示技術關聯性。

常見誤讀糾偏

  • 誤讀 1:“量化就是簡單地向下取整/四捨五入”
    糾偏:工業級量化是完整的數學校準過程,涉及尺度選取、零點補償、逐通道或組粒度分組,以及利用校準資料集最小化資訊損失。僅做樸素舍入會帶來巨大效能崩塌,尤其在啟用值分佈極度不均衡時。
  • 誤讀 2:“INT4 量化一定導致模型效果嚴重退化,所以只能用於容錯場景”
    糾偏:現代大型模型量化(如 GPTQ、AWQ 結合 SmoothQuant)在多數自然語言理解基準上 INT4 與 FP16 差距已縮至 1% 以內,且可以通過 QLoRA 等微調手段幾乎完全恢復競爭力。許多生產級 LLM 服務已部分採用 INT4 推論。
  • 誤讀 3:“量化只能用於推論,不能參與訓練”
    糾偏:量化感知訓練(QAT)在內環中模擬量化,本身就是訓練過程。更前沿的 FP8 原生訓練已在 NVIDIA H100 上實現,被用於大型模型訓練的前向 and 部分反向傳播,顯著提升吞吐量。

學習路徑

  1. 基礎原理:閱讀 Jacob et al. (2018) “Quantization and Training of Neural Networks for Efficient Integer-Arithmetic-Only Inference”;理解仿射對映、校準。
  2. 工具實戰:通過 PyTorch 官方 quantization tutorial 完成一個 ResNet 靜態量化,再嘗試 Hugging Face 的 optimum + bitsandbytes 對 LLaMA 模型進行 4bit 載入。
  3. 進階論文
    • LLM.int8(): Dettmers et al. “LLM.int8(): 8-bit Matrix Multiplication for Transformers at Scale” (2022)
    • GPTQ: Frantar et al. “GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers” (2023)
    • QLoRA: Dettmers et al. “QLoRA: Efficient Finetuning of Quantized LLMs” (2023)
    • AWQ: Lin et al. “AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration” (2023)
    • SmoothQuant: Xiao et al. “SmoothQuant: Accurate and Efficient Post-Training Quantization for Large Language Models” (2023)
  4. 硬體對映:閱讀 NVIDIA TensorRT Developer Guide 中 INT8 calibration 章節,理解最佳化器如何將量化圖對映到具體 kernel。
  5. 緊跟前沿:關注 MLSys、ICLR、NeurIPS 的 Efficient ML 相關 session,以及 GitHub 上 AutoGPTQllm-awq 等倉庫更新。

一句話總結

量化是深度學習從實驗室走向規模化部署的必經之橋——用位數換效率,對映數學與工程匠心兼備,已是大型模型產業化的核心支撐技術。

延伸閱讀與來源

由於本次檢索工具限制,未能即時抓取外部連結,上述技術事實基於公開學術會議、白皮書及主流開源專案文件的普遍共識,具體資料點已標註為定性或估算。進一步驗證可訪問以下資訊源:

  • 國際會議論文開放庫 (arXiv, PMLR) 搜尋 “quantization LLM”
  • NVIDIA、Intel、ARM 官方開發者文件中關於推論量化的白皮書
  • Hugging Face Transformers 文件中 “Quantization” 專題
  • 行業分析機構(如 Omdia、Semianalysis)釋出的 AI 推斷算力與模型效率報告
    閱讀時需注意硬體代數差異,並優先採用經過開源社群大規模復現的方案。
source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型