應用層 開放閱讀

模型量化

Model Quantization

概念 ID
model-quantization
更新時間
2026-05-29
來源數量
待補

模型量化(Model Quantization)

3 秒看懂

一句話定義: 模型量化是將神經網路的權重和/或啟用值從高精度浮點數(如 FP32/BF16)轉換為低位元整數或浮點格式(如 INT8、INT4、FP8)的技術,核心目的是降低記憶體佔用、提升推論吞吐、減少能耗,同時儘量保持模型精度。

類比: 把高畫質無損音訊轉成 MP3——位元速率大幅下降,多數人聽不出區別,但儲存和傳輸效率翻倍。

關鍵詞: INT8/INT4/FP8 · PTQ vs QAT · GPTQ/AWQ/SmoothQuant · 推論部署

3 分鐘產業解釋

為什麼量化突然火了?

大語言模型(LLM)從數十億到數千億引數,原始精度(FP16/BF16)下單卡視訊記憶體早已放不下:

  • 70B 引數模型 FP16 需要約 140 GB 視訊記憶體僅存放權重,遠超單張消費級 GPU 的 24 GB,也超出單張資料中心級 GPU 的視訊記憶體容量。
  • 即使用多卡部署,視訊記憶體成本和推論延遲仍然居高不下。

量化是成本最低、見效最快的”壓縮槓桿”:

  • INT8 量化:權重體積約為 FP16 的 1/2
  • INT4 量化:權重體積約為 FP16 的 1/4
  • 70B 模型 INT4 量化後約 35 GB,一張 48 GB 視訊記憶體的專業卡即可放下。

誰在用?

場景典型需求常用精度
雲端端推論服務(API)吞吐優先、多併發FP8/INT8(需 H100 等新硬體)
邊緣/端側部署視訊記憶體/記憶體極有限INT4/W4A16
本地開源模型跑通消費級 GPU 友好GGUF Q4_K_M 等
訓練階段保精度、省視訊記憶體BF16(通常不量化)

產業影響

量化直接降低了推論硬體門檻——一張消費級 GPU 就能跑 7B~13B 模型,這讓本地 AI、端側 AI、小團隊實驗成為可能,也推動了開源社群(llama.cpp、Ollama、vLLM 量化推論支援)的爆發。

15 分鐘專家深入

核心權衡:精度 vs 效率

量化本質是一個有失真壓縮問題:

精度損失 ←→ 視訊記憶體節省 / 吞吐提升

但”有損”的程度高度依賴於:

  1. 量化粒度:per-tensor(最粗)→ per-channel → per-group(最細,精度損失最小)。
  2. 量化方法:Round-to-Nearest(簡單但粗糙)→ 基於校準資料的最優量化(GPTQ/AWQ)→ 訓練中感知量化(QAT)。
  3. 量化物件:僅量化權重(W-only)對精度影響最小;同時量化權重和啟用(W+A)精度風險更高,但硬體加速收益更大。

兩大範式

1)訓練後量化(PTQ, Post-Training Quantization)

  • 模型訓練完成後,用少量校準資料(calibration data)確定量化引數(scale/zero-point)。
  • 優勢:無需重新訓練,成本極低,適合快速部署。
  • 代表方法
    • GPTQ:基於 OBQ(Optimal Brain Quantization)的逐層量化,用 Hessian 資訊最小化每層輸出誤差,支援 INT4 權重量化。
    • AWQ(Activation-Aware Weight Quantization):根據啟用值分佈識別”重要通道”,對重要權重保護性量化(混合精度),在 INT4 下精度保持通常優於 GPTQ。
    • SmoothQuant:將啟用中的 outlier(極端值)“平滑”轉移到權重側,使啟用變得容易量化,實現 W8A8(權重和啟用均為 INT8)推論。
    • GGUF / llama.cpp 系列量化:採用 block-wise 量化(如 Q4_K_M, Q5_K_S),K 代表使用 k-quant(對不同層應用不年增率特寬度),實測在消費硬體上效果好。
    • bitsandbytes / QLoRA:將基礎模型量化至 4-bit(NF4 格式),在此基礎上訓練 LoRA 介面卡,實現大型模型的低成本微調。

2)量化感知訓練(QAT, Quantization-Aware Training)

  • 在訓練過程中模擬量化效果(用偽量化節點 forward,反向傳播時用 Straight-Through Estimator 近似梯度)。
  • 優勢:精度通常優於 PTQ,尤其在低位元(INT4 及以下)場景。
  • 劣勢:需要訓練資源和原始訓練資料。
  • 典型場景:行動端部署(手機晶片 INT8 加速)、對精度要求極高的工業場景。

量化數學基礎(簡述)

對稱量化(Symmetric):

x_q = round(x / scale)
scale = max(|x|) / (2^(bits-1) - 1)

非對稱量化(Asymmetric):

x_q = round((x - zero_point) / scale)
scale = (max(x) - min(x)) / (2^bits - 1)
zero_point = round(-min(x) / scale)

反量化:x_hat = x_q * scale + zero_point(非對稱)或 x_hat = x_q * scale(對稱)。


技術原理

量化粒度示意

┌─────────────────────────────────────────────┐
│              權重矩陣 W (d_out × d_in)       │
├─────────────────────────────────────────────┤
│                                             │
│  per-tensor: 整個矩陣共享一組 (scale, zp)    │
│  ┌─────────────────────────────────────┐    │
│  │ s=0.023, zp=0                       │    │
│  └─────────────────────────────────────┘    │
│                                             │
│  per-channel: 每個輸出通道一組               │
│  ┌──────┬──────┬──────┬──────┐             │
│  │ s_0  │ s_1  │ s_2  │ ...  │             │
│  └──────┴──────┴──────┴──────┘             │
│                                             │
│  per-group: 每 g 個元素一組 (g=128 常見)     │
│  ┌────┬────┬────┬────┬────┬────┐            │
│  │g=0 │g=1 │g=2 │g=3 │g=4 │... │            │
│  └────┴────┴────┴────┴────┴────┘            │
│   s_0  s_1  s_2  s_3  s_4                   │
└─────────────────────────────────────────────┘

粒度越細 → scale/zero-point 儲存開銷越大,但量化誤差越小。

實踐中 INT4 per-group(group_size=128)是精度/開銷的良好平衡點。

W8A8 推論的計算流程

輸入啟用 (BF16/FP16)


  ┌──────────┐
  │ 啟用量化  │ ──→ A_q (INT8) × scale_a
  └──────────┘


  ┌───────────────────┐
  │ INT8 × INT8 矩陣乘 │ ── 通過硬體 INT8 Tensor Core 執行
  └───────────────────┘


  ┌──────────────┐
  │ 反量化 + 輸出 │ ──→ C = A_q × W_q * scale_a * scale_w
  └──────────────┘


  輸出啟用 (BF16/FP16)

硬體層面,NVIDIA 從 Turing 架構(如 Tesla T4)開始引入 INT8 Tensor Core 支援,後續的 Ampere(A100)、Hopper(H100)持續強化整數計算能力。Hopper 架構進一步引入了 FP8(E4M3 / E5M2 兩種格式)原生支援,在精度和效能之間提供了新的帕累托前沿。

W4A16 權重量化推論

對於僅權重量化(Weight-Only Quantization):

權重 W (BF16) ──量化──→ W_q (INT4, per-group)

                              ▼  儲存在視訊記憶體中,節省 ~75% 權重視訊記憶體

推論時: 輸入啟用 (BF16) ──────┤

                    反量化 W_q → W_d (BF16)

                    BF16 矩陣乘(正常精度)


                      輸出啟用 (BF16)

W4A16 的關鍵點:啟用不量化,因此對模型精度影響較小;瓶頸從計算轉為視訊記憶體頻寬(需要即時反量化權重),所以適合 memory-bandwidth-bound 的自迴歸生成場景。


技術演進史

時期里程碑關鍵特徵
~2016-2018早期量化研究(Binary/ternary networks, XNOR-Net)激進二值/三值量化,精度損失大,學術探索為主
2018-2019量化推論硬體成熟(NVIDIA Turing INT8 Tensor Core(如 Tesla T4),Google TPU INT8)INT8 量化成為部署標配,TensorRT 量化工具鏈成型
2020-2021訓練時混合精度(AMP)普及,BF16 標準化訓練側從 FP32 轉向 BF16/FP16,推論側 INT8 成熟
2022SmoothQuant 釋出(MIT & NVIDIA),實現 W8A8 大型模型推論將啟用中的 outlier 平滑轉移,突破”啟用難以量化”的瓶頸
2023GPTQ、AWQ、bitsandbytes/QLoRA 爆發INT4 權重量化成為 LLM 部署標配;QLoRA 讓單卡微調大型模型成為可能;GGUF 格式推動本地推論社群爆發
2023-2024FP8 生態成形(NVIDIA Hopper 原生支援 E4M3/E5M2)FP8 在訓練和推論中逐步替代 FP16 作為新的效率-精度平衡點;微軟 FP8-LM 等探索
2024-20252-bit/1-bit 量化探索(AQLM、QuIP#、BitNet b1.58)極低位元量化開始有可行性,BitNet 提出”1-bit LLM”概念(權重為 {-1, 0, 1}),挑戰傳統浮點矩陣乘範式

技術路線對比

維度FP16/BF16(基線)FP8INT8(W8A8)INT4(W4A16)INT4(W4A8)2-bit 及以下
權重位元1688442 或更低
啟用位元1688168因方案而異
視訊記憶體節省(vs FP16)基線~50%~50%~75%~75%~87.5%+
推論吞吐提升基線~1.5-2×[估算]~1.5-2×[估算]主要省頻寬,計算提升有限較大視硬體而定
精度保持100%接近無損(主流任務)良好(需校準)良好到較好(方法依賴)中等有損,需評估
硬體依賴通用需 Hopper+需 INT8 Tensor Core通用(CPU/GPU 均可反量化)需 INT8 核心需專用 kernel 或硬體
代表方法FP8-LM, TensorRT-LLM FP8SmoothQuant, TensorRTGPTQ, AWQ, GGUF混合方案AQLM, QuIP#, BitNet
適用場景訓練/小模型推論大規模雲端端推論高吞吐推論服務視訊記憶體受限部署追求極致效率研究前沿/極端受限

注: 吞吐提升倍數高度依賴具體硬體、模型規模、batch size 和序列長度,上表為數量級估算,不同工作負載下差異顯著。


上下游

上游(量化依賴什麼)

┌─────────────────────────────────────────────────────┐
│                    上 遊                              │
├──────────────┬──────────────────────────────────────┤
│ 原始訓練好的  │ FP16/BF16 權重 checkpoint             │
│ 浮點模型      │ (量化質量的上限由基模型決定)            │
├──────────────┼──────────────────────────────────────┤
│ 校準資料集    │ PTQ 需要少量代表性輸入分佈資料           │
│              │ (幾百~幾千條文本,量化後丟棄)           │
├──────────────┼──────────────────────────────────────┤
│ 量化演算法/工具 │ GPTQ (AutoGPTQ)、AWQ (AutoAWQ)、      │
│              │ bitsandbytes、GGUF(llama.cpp)、         │
│              │ TensorRT-LLM、ONNX Runtime 等           │
├──────────────┼──────────────────────────────────────┤
│ 硬體 INT/FP  │ GPU Tensor Core (INT8/FP8)、            │
│ 計算單元      │ CPU VNNI/AMX、NPU、行動端 DSP            │
└──────────────┴──────────────────────────────────────┘

下游(量化服務什麼)

┌─────────────────────────────────────────────────────┐
│                    下 遊                              │
├──────────────┬──────────────────────────────────────┤
│ 雲端端推論服務  │ vLLM、TensorRT-LLM、TGI 等架構         │
│              │ 使用量化模型提升吞吐、降低 TCO            │
├──────────────┼──────────────────────────────────────┤
│ 端側/邊緣 AI │ 手機(高通/聯發科 NPU)、PC(NPU)、     │
│              │ 嵌入式裝置上的模型部署                    │
├──────────────┼──────────────────────────────────────┤
│ 本地 AI 應用  │ Ollama、LM Studio、llama.cpp 等         │
│              │ 讓消費級 GPU/甚至 CPU 能跑 LLM           │
├──────────────┼──────────────────────────────────────┤
│ 微調/訓練     │ QLoRA:4-bit 量化基模型 + LoRA 訓練      │
│              │ 大幅降低微調視訊記憶體需求                      │
└──────────────┴──────────────────────────────────────┘

關鍵指標

指標定義量化關注點
Perplexity(PPL)語言模型在測試集上的困惑度,越低越好量化後 PPL 相對原始模型的”退化”是最核心的質量指標
視訊記憶體佔用(GB)模型推論時佔用的 GPU 視訊記憶體直接決定能否在給定硬體上執行
吞吐量(tokens/s)每秒生成的 token 數batch 推論場景下的核心效率指標
首 token 延遲(TTFT, ms)從請求到首個 token 輸出的時間互動式應用的體感指標;prefill 階段 compute-bound
精度恢復比例量化後任務精度 / 原始精度下游任務(MMLU、HumanEval 等 benchmark)評分保持度
量化時間/成本完成一次量化所需時間GPTQ 對 70B 模型量化可能需要數小時及數百 GB 記憶體[估算]
group_sizeper-group 量化的分組大小越小精度越好,但 scale 儲存開銷越大(128 為常見平衡)

供需與市場資料

需求側

  • 大型模型推論成本是 AI 產業最大的運營支出之一。據行業估算,推論算力消耗在 2024 年已超過訓練算力消耗,且比例仍在擴大。
  • 量化是降低推論成本最直接的手段——無需改變架構、無需重新訓練(PTQ),即可獲得顯著的視訊記憶體和吞吐改善。
  • 端側 AI(智慧手機、PC)對模型大小有嚴格限制(通常需在幾 GB 以內),量化是必經之路。

供給側

供給側要素現狀
GPU 硬體NVIDIA H100/H200 原生支援 FP8;B100/B200(Blackwell)繼續強化低精度計算能力;消費級 RTX 4090 有 INT8 支援
開源工具AutoGPTQ、AutoAWQ、bitsandbytes、llama.cpp/GGUF、ExLlamaV2 等成熟可用
商業工具NVIDIA TensorRT-LLM 整合 INT8/FP8/INT4 量化推論;Intel OpenVINO 支援 INT8/INT4;Qualcomm AI Engine 支援行動端量化
架構支援PyTorch 原生量化工具(torch.ao)、ONNX Runtime 量化、Hugging Face optimum 整合

市場規模(間接指標)

模型量化本身不構成獨立市場品類,而是嵌入在推論最佳化工具鏈中。其價值體現在推論成本節約上。據行業估算,有效的量化策略可使單次推論成本降低 50%-75%,這在大規模 API 服務中意味著數千萬到數億美元級別的年度成本節省[行業估算]。


代表公司與資本對映

公司/組織與量化的關係代表性貢獻
NVIDIA硬體 + 軟體全棧H100 FP8 Tensor Core、TensorRT-LLM 量化推論引擎、cuLASS 量化核心
Meta開源模型 + 工具bitsandbytes(8-bit 最佳化器、QLoRA 底層實現);Llama 系列模型是量化社群的首要靶標
Microsoft研究 + 產品SmoothQuant(與 MIT 合作)、OnnxRuntime 量化支援、探索 FP8 訓練
Google硬體 + 架構TPU 原生 INT8 支援、TensorFlow Lite 量化工具鏈、Gemma 模型量化部署方案
IntelCPU 推論最佳化AMX 指令集(INT8/BF16 加速)、OpenVINO 量化工具
Qualcomm / Apple / 聯發科端側 AI 晶片NPU/DSP 的 INT8/INT4 推論加速,驅動端側量化需求
開源社群工具創新llama.cpp(GGUF 格式)、AutoGPTQ、AutoAWQ、ExLlamaV2、vLLM 量化推論支援
IST(TinyCorp)/ 晶片創業公司極端低位元硬體探索 1-bit/2-bit 專用硬體加速器

資本對映邏輯

量化並非一個獨立可投資的賽道,而是一個使能技術層——其價值傳導到:

  • 推論晶片公司:低精度計算能力是晶片競爭力的核心賣點。
  • 推論平台/MaaS 公司:量化能力直接影響毛利率和定價競爭力。
  • 端側 AI:量化是端側部署大型模型的必要條件。

投資邏輯

量化技術的投資含義

  1. 降低推論門檻 → 擴大 AI 部署面

    • 量化讓更多硬體能跑模型 → 推論市場 TAM 擴大。
    • 產業鏈關聯:推論晶片(消費級 GPU、NPU)、邊緣計算。
  2. 降低模型使用成本 → 加速 AI 產品化

    • 更低的推論 TCO = 更多應用能算得過賬。
    • 產業鏈關聯:AI 應用層公司、MaaS 平台。
  3. 與 MoE/稀疏架構形成互補

    • MoE 架構通過減少啟用引數來降低計算量,量化通過降低數值精度來降低計算量和視訊記憶體。
    • 兩者可疊加使用,形成”架構級 + 數值級”的雙重壓縮。
  4. 關注技術演進對產業鏈的影響

    • 2-bit/1-bit 量化成熟,可能重塑推論硬體需求——從”需要大視訊記憶體”變為”需要高頻寬 + 專用整數運算”。
    • FP8 訓練成熟後,訓練視訊記憶體壓力減小,可能影響 GPU 租賃定價。

風險/侷限

  • 量化是有失真壓縮,不是萬能藥——任務越敏感、模型越小,量化越困難。
  • 工具鏈碎片化嚴重(GPTQ vs AWQ vs GGUF vs TensorRT),模型到部署的路徑仍有摩擦。
  • 啟用量化的精度瓶頸(outlier 問題)在部分模型上仍未完全解決。

常見誤讀糾偏

❌ 誤讀 1:“INT4 量化後的 70B 模型效果和 FP16 一樣好”

糾正: 不可能完全一樣。INT4 量化是有失真壓縮,精度會有不同程度的下降。下降幅度取決於量化方法、模型架構和下游任務。主流 PTQ 方法(GPTQ/AWQ)在常見 benchmark(MMLU、HellaSwag 等)上通常保留 95%-99% 的精度[以具體 benchmark 結果為準],但在數學推論、程式碼生成、長文本理解等對精度敏感的任務上,退化可能更明顯。需要針對具體場景做評估,不能籠統說”無損”。

❌ 誤讀 2:“量化只對推論有用,訓練階段不需要”

糾正: 訓練階段同樣受益——

  • 混合精度訓練(AMP) 本身就是一種訓練時的精度最佳化,BF16/FP16 forward + FP32 梯度累積。
  • QLoRA 將基模型量化至 4-bit(NF4)後再訓練 LoRA,大幅降低微調視訊記憶體需求——一張 24 GB GPU 就能微調 33B 甚至更大的模型。
  • FP8 訓練 正在逐步落地(NVIDIA Hopper 硬體支援 + 軟體棧成熟),有望進一步降低訓練成本。

❌ 誤讀 3:“GPTQ 和 AWQ 只是品牌不同,效果一樣”

糾正: 底層演算法邏輯不同——

  • GPTQ 基於二階 Hessian 資訊逐列量化,最小化層輸出的 L2 誤差。
  • AWQ 的核心思想是根據啟用分佈識別”重要權重通道”(weight saliency),對重要通道保持更高精度,其餘通道大膽量化。
  • 在實際對比中,AWQ 在多種模型和任務上精度略優於 GPTQ(尤其在 INT4 極低位元下),且推論時可融合 kernel,實際吞吐也往往更好。但具體哪個更好取決於模型和硬體,需要實測。

❌ 誤讀 4:“量化 = 模型剪枝,兩者是一回事”

糾正: 這是兩種完全不同的模型壓縮技術——

  • 量化:保持所有引數,但降低數值精度(從 FP16→INT4)。
  • 剪枝(Pruning):移除部分引數(置零或刪除整個結構),減少引數量/計算量。
  • 兩者可以正交組合:先剪枝再量化,或在稀疏化架構上做量化。

學習路徑

🟢 入門(1-2 天)

  1. 理解浮點數表示(FP32/FP16/BF16/FP8/INT8/INT4 的位寬和動態範圍)。
  2. 理解量化的數學基礎:scale、zero-point、對稱/非對稱量化。
  3. 實操:用 llama.cpp 下載一個 GGUF Q4 量化模型,體驗本地推論。

🟡 進階(1-2 周)

  1. 精讀 GPTQ 論文(Frantar et al., 2022)和 AWQ 論文(Lin et al., 2023)。
  2. 精讀 SmoothQuant 論文(Xiao et al., 2022)——理解啟用 outlier 問題及其解法。
  3. 實操:用 AutoGPTQ / AutoAWQ 量化一個 7B 模型,在多個 benchmark 上評估精度變化。
  4. 理解 QLoRA(Dettmers et al., 2023)——量化如何與微調結合。

🔴 專家(持續)

  1. 研讀 AQLM(Egiazarian et al., 2024)、QuIP#(Tseng et al., 2024)——極低位元量化前沿。
  2. 研讀 BitNet b1.58(Microsoft Research, 2024)——1-bit 權重的 LLM 可行性。
  3. 關注 TensorRT-LLM 和 vLLM 的量化推論核心實現——瞭解實際部署中的工程權衡。
  4. 追蹤 FP8 訓練和推論的最新進展。

一句話總結

模型量化是用”更少的位元數表示相同的模型”的有失真壓縮技術,它以最小的精度代價換取顯著的視訊記憶體節省和推論加速,是大型模型從實驗室走向大規模落地部署的關鍵使能技術。


延伸閱讀與來源

核心論文

  • GPTQ: Frantar et al., “GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers”, ICLR 2023
  • AWQ: Lin et al., “AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration”, MLSys 2024
  • SmoothQuant: Xiao et al., “SmoothQuant: Accurate and Efficient Post-Training Quantization for Large Language Models”, ICML 2023
  • QLoRA: Dettmers et al., “QLoRA: Efficient Finetuning of Quantized Language Models”, NeurIPS 2023
  • BitNet b1.58: Ma et al., “The Era of 1-bit LLMs: All Large Language Models are in 1.58 Bits”, Microsoft Research, 2024
  • AQLM: Egiazarian et al., “Extreme Compression of Large Language Models via Additive Quantization”, 2024
  • QuIP#: Tseng et al., “QuIP#: Even Better LLM Quantization with Hadamard Incoherence and Lattice Codebooks”, ICML 2024

工具與架構

來源標註說明

  • 本文中”FP8 E4M3/E5M2 格式”、“Hopper 架構原生 FP8 支援”、“H100 具備 INT8 Tensor Core”等硬體規格來自 NVIDIA 官方技術文件。
  • 論文結論以原始論文為準。
  • 標註為 [估算] 的數字為基於公開資訊的數量級推斷,非精確資料。
  • 標註為 [行業估算] 的資料為行業普遍認知範圍,非特定來源。

⚠️ 宣告: 本文技術規格基於截至知識截止日期的公開資訊撰寫。硬體型號的具體效能數字(如某 GPU 上的 tokens/s)受驅動版本、batch size、序列長度、架構版本等多因素

source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型