後訓練量化(PTQ, Post-Training Quantization)
3 秒看懂
PTQ = 模型訓練完之後,不重新訓練,只用少量校準資料把權重(有時也含啟用值)從高精度(FP16/BF16/FP32)壓到低位元(INT8/INT4/甚至更低),以換取更小的記憶體佔用和更快的推論速度,同時儘量不掉精度。
核心交易:用”一點點校準計算”替代”全量重新訓練”,在精度和部署效率之間做快速折中。
3 分鐘產業解釋
為什麼 PTQ 在 2023—2025 年成為關鍵話題?
大語言模型(LLM)的引數量從數十億飛漲到數千億,單次推論的視訊記憶體佔用和延遲成本巨大。一個 70B 引數模型以 FP16 儲存需要約 140GB 視訊記憶體,幾乎不可能在單卡上執行。PTQ 能將權重壓縮到 4-bit,使視訊記憶體需求降至約 35GB,單卡 24 GB 無法執行,多張消費級卡也難以可靠承載,需使用視訊記憶體≥48 GB 的專業 GPU 或支援高效互聯的多卡方案。
產業邏輯鏈:
模型越來越大 → 推論成本(視訊記憶體+頻寬+延遲)指數級上升
→ PTQ 是"不改模型架構、不重訓"就能降低推論成本的最低門檻手段
→ 降低推論成本 → 擴大可部署硬體範圍(雲端端→邊緣/消費級)
→ 推動 AI 應用普及化
關鍵區分:PTQ 與 QAT(Quantization-Aware Training,量化感知訓練)是兩種路徑。QAT 在訓練過程中引入模擬量化,效果通常更好,但需要完整訓練流程和算力;PTQ 只需要訓練好的模型 + 少量校準資料 + 數小時的計算,門檻遠低,因此在 LLM 時代成為主流方案。
15 分鐘專家深入
PTQ 在 LLM 生態中的技術分層
現代 LLM 的 PTQ 已不再是簡單的”四捨五入”,而是演化出多個層次的方法論:
第一層:權重量化(Weight-Only Quantization)
- 只壓縮權重,啟用值保持 FP16/BF16
- 代表:GPTQ、AWQ、bitsandbytes NF4、GGUF 各種方案
- 優勢:實現簡單,相容性好,精度損失相對可控
- 劣勢:實際計算仍需反量化到高精度做矩陣乘法,計算量不減少,但記憶體頻寬需求大幅降低
第二層:權重 + 啟用聯合量化(Weight-Activation Quantization)
- 權重和啟用值都量化到 INT8(W8A8)或更低
- 代表:SmoothQuant、LLM.int8()(混合精度方案)
- 優勢:可以利用硬體 INT8 Tensor Core 真正加速計算
- 劣勢:啟用值中的離群值(outlier)是主要難點
第三層:極低位元量化(Sub-4-bit)
- 3-bit、2-bit 甚至 1.5-bit 量化
- 代表:AQLM、QuIP#、HQQ 等
- 需要更復雜的量化方案(如向量量化、碼本學習)來維持可接受的精度
核心技術挑戰
1. 離群值問題(Outlier Features)
Tim Dettmers 等人在 LLM.int8() 論文中發現,LLM 的啟用值中存在幅度極大的離群特徵,這些離群特徵的幅度遠超普通特徵,可達數十倍差異,且集中在少數固定通道中 [Dettmers et al., 2022, “LLM.int8(): 8-bit Matrix Multiplication for Transformers at Scale”]。這一發現深刻影響了後續 PTQ 方法的設計方向。
2. 逐層誤差累積
LLM 有數十到上百層 Transformer block,每層的量化誤差會逐層累積放大。因此先進方法(如 GPTQ)採用逐層最佳化策略,在量化當前層時考慮補償效應。
3. 校準資料敏感性
PTQ 的精度高度依賴校準資料的質量和數量。校準資料需要能代表模型的實際使用分佈,數量通常在 128—512 條樣本即可 [行業共識,但最優數量因模型和方法而異]。
技術原理
基礎量化公式
**均勻量化(Uniform Quantization)**的基本對映:
量化值: q = round(x / s) + z
反量化: x_hat = s * (q - z)
其中:
s = (x_max - x_min) / (2^b - 1) # scale(縮放因子)
z = round(-x_min / s) # zero-point(零點,僅非對稱量化)
b = 目標位元數
對稱量化 vs 非對稱量化:
對稱量化(Symmetric):
z = 0
s = max(|x|) / (2^(b-1) - 1)
對映範圍:[-2^(b-1), 2^(b-1)-1] 的整數
適合:權重(通常近似零均值分佈)
非對稱量化(Asymmetric):
z ≠ 0
利用完整整數範圍 [0, 2^b - 1]
適合:啟用值(常常非零均值,如 ReLU 後的正值分佈)
量化粒度(Granularity)
量化粒度對精度和開銷的影響(示意):
粒度 | scale/zp 數量 | 精度 | 儲存開銷(scale/zp)
─────────────────┼──────────────────┼─────────┼───────────────────
Per-Tensor | 1 個/整個張量 | 最低 | 極小
Per-Channel | 1 個/輸出通道 | 中等 | 小
Per-Group | 1 個/g 個元素 | 較高 | 可控(g=64/128常見)
Per-Element | 每個元素一個 | 最高 | 與原值相當(無意義)
GPTQ/AWQ 常用:Per-Group,group_size=128
→ 每 128 個權重共享一組 scale + zero-point
→ 權重 4-bit + scale(FP16) ≈ 4.25 bit 有效位寬
主要 PTQ 方法的核心機制
1. GPTQ(Frantar et al., 2022)
核心思想:基於二階資訊的逐層最優量化
輸入:訓練好的模型 W,校準資料 X_cal
對每一層 l:
① 收集校準輸入 X_cal 的隱層輸出
② 計算 Hessian 矩陣 H = 2 * X_cal^T * X_cal(近似二階資訊)
③ 按行(逐輸出通道)量化:
- 選擇當前要量化的權重行
- 用 H 的逆矩陣計算最優量化誤差補償
- 將補償誤差分配到尚未量化的權重行
④ 批次更新(lazy batch)提高效率
關鍵特性:
- 需要 GPU 記憶體約等於單層模型大小(可以逐層處理)
- 校準過程對 175B 級模型可在數小時內完成 [原論文報告]
- 4-bit + group_size=128 配置下精度損失通常較小
2. AWQ(Lin et al., MIT Han Lab, 2023)
核心思想:保護"顯著權重"(salient weights)
關鍵觀察:
僅約 1% 的權重對模型輸出有決定性貢獻
這些權重可以通過啟用幅度間接識別
方法:
① 用校準資料前向傳播,統計每通道的啟用幅度 |X|
② 計算 per-channel 縮放因子 s,使得顯著權重通道被放大
③ 量化前對權重施加縮放:W' = W * diag(s)
④ 對 W' 執行標準量化(RTN 即可,無需二階資訊)
⑤ 推論時反向補償:Y = X * diag(s)^(-1) * quant(W')
優勢:
- 計算簡單(不需要 Hessian 逆)
- 與權重專用硬體加速器相容性好
- 在 W4A16 場景下精度表現優異
3. SmoothQuant(Xiao et al., MIT Han Lab, 2022)
核心思想:將啟用值中的量化難度"遷移"到權重上
關鍵數學變換(per-channel):
Y = X * W
= (X * diag(s)^(-1)) * (diag(s) * W)
= X_hat * W_hat
其中 s_j = max(|X_j|)^α / max(|W_j|)^(1-α)
α ∈ [0,1] 控制遷移程度(α=0.5 是常見預設值)
效果:
X_hat 的離群值幅度被壓縮(更容易量化)
W_hat 的幅度範圍擴大(但權重分佈本身更平滑,仍可量化)
→ 實現 W8A8 聯合量化,兩者都用 INT8
意義:
這是少數能真正實現"計算加速"(而非僅節省視訊記憶體)的 PTQ 方法
因為 INT8 Tensor Core 在現代 GPU 上確實比 FP16 更快
4. LLM.int8()(Dettmers et al., 2022)
核心思想:混合精度分解
方法:
① 識別啟用值中的離群特徵通道(magnitude > 閾值)
② 離群通道(通常 < 0.1% 的維度)→ FP16 計算
③ 非離群通道 → INT8 計算
④ 合併兩部分結果
意義:
首次系統揭示 LLM 啟用值的離群特徵現象
為後續 SmoothQuant 等方法提供了關鍵洞察
PTQ 方法對比示意(精度-速度-複雜度三維)
精度保持 ↑
│
│ SmoothQuant(W8A8) GPTQ(4bit) AWQ(4bit)
│ ○ ○ ○
│
│ GPTQ(3bit) LLM.int8()
│ ○ ○
│
│ RTN(4bit) AQLM(2bit)
│ ○ ○
│
└──────────────────────────────────────→ 計算加速程度
(weight-only 只省頻寬,
W8A8 真正省算力)
技術演進史
| 時期 | 里程碑 | 關鍵意義 |
|---|---|---|
| 2016—2017 | Google 提出量化推論架構(gemmlowp),XNOR-Net 等二值化網路研究 | 學術界開始系統研究神經網路量化 |
| 2018 | NVIDIA Turing 架構引入 INT8 Tensor Core | 硬體層面為 INT8 推論提供原生加速支援 |
| 2019—2020 | TensorRT 引入 PTQ 工作流;Qualcomm/QNN 支援 INT8 NPU 推論 | PTQ 在 CV 模型上走向工程化 |
| 2022 Q2 | LLM.int8() 釋出 [Dettmers et al.] | 揭示 LLM 啟用離群特徵,開啟 LLM 專用 PTQ 研究熱潮 |
| 2022 Q3 | GPTQ 釋出 [Frantar et al.] | 首次實現百B級模型的高效 3/4-bit PTQ |
| 2022 Q4 | SmoothQuant 釋出 [Xiao et al., MIT Han Lab] | 解決 W8A8 聯合量化的啟用離群值難題 |
| 2023 Q1 | AWQ 釋出 [Lin et al., MIT Han Lab] | 簡化且高效的 W4 方案,工程友好度高 |
| 2023 Q2 | bitsandbytes NF4 引入 Hugging Face 生態;GGUF 格式隨 llama.cpp 普及 | PTQ 進入主流開發者工具鏈 |
| 2023 Q3—Q4 | NVIDIA Hopper FP8(E4M3/E5M2)生態落地;AQLM、QuIP# 提出 sub-4-bit 方案 | 硬體原生低精度格式 + 極致壓縮探索 |
| 2024 | AWQ/GPTQ 整合進 vLLM、TensorRT-LLM 等主流推論架構;FP8 推論逐步實用化 | PTQ 從研究走向生產級部署基礎設施 |
技術路線對比
| 維度 | RTN(Round-to-Nearest) | GPTQ | AWQ | SmoothQuant | LLM.int8() | AQLM |
|---|---|---|---|---|---|---|
| 型別 | 權重量化 | 權重量化 | 權重量化 | 權重+啟用 | 混合精度 | 向量量化 |
| 典型 bit 寬 | 4/8 | 3/4 | 4 | W8A8 | 混合(INT8+FP16) | 2 |
| 核心機制 | 最近鄰取整 | Hessian 逐層最優 | 啟用感知縮放 | 難度遷移 | 離群值分離 | 學習碼本 |
| 校準資料量 | 不需要/極少量 | ~128—256 樣本 | ~128 樣本 | ~512 樣本 | ~128 樣本 | 需較多 |
| 校準耗時 | 極快 | 中等(數小時@大型模型) | 較快 | 較快 | 較快 | 較長 |
| 精度(4-bit) | 較差 | 良好 | 良好~優秀 | N/A(主攻 8-bit) | N/A | 可接受(2-bit) |
| 推論架構支援 | 廣泛 | AutoGPTQ, TRT-LLM, vLLM | AutoAWQ, TRT-LLM, vLLM | TRT-LLM, 各推論架構 | bitsandbytes | 社群支援 |
| 是否省計算 | 否(weight-only) | 否(weight-only) | 否(weight-only) | 是(INT8 TC) | 部分 | 否(需解碼) |
| 適用場景 | 快速原型/基線 | 生產級 4-bit 部署 | 生產級 4-bit 部署 | 需真正計算加速時 | FP16 視訊記憶體不足時 | 極致壓縮 |
注:精度表現因模型架構、校準資料、評測任務不同而差異顯著,上表為行業一般認知的定性判斷,非嚴格 benchmark 結論。
上下游
上游:PTQ 方法的”輸入端”
┌─────────────────────────────────────────────────┐
│ 上游依賴 │
├─────────────────────────────────────────────────┤
│ ① 訓練好的全精度模型(FP16/BF16/FP32) │
│ → 來源:OpenAI, Meta, Mistral, Google 等 │
│ → 開源權重(Hugging Face)直接可用 │
│ │
│ ② 校準資料集 │
│ → 通常取自訓練集的一個小子集 │
│ → 或用 WikiText、C4 等通用語料 │
│ │
│ ③ 量化演算法架構 │
│ → GPTQ (AutoGPTQ) │
│ → AWQ (AutoAWQ / llm-awq) │
│ → bitsandbytes (Tim Dettmers 維護) │
│ → TensorRT-LLM (NVIDIA) │
│ → llama.cpp (GGUF 格式支援多種量化) │
│ │
│ ④ 算力基礎設施 │
│ → 校準階段:單卡 GPU 即可(A100/H100 最優) │
│ → 推論階段:GPU / NPU / CPU 均可 │
└─────────────────────────────────────────────────┘
下游:PTQ 的”去向”
┌─────────────────────────────────────────────────┐
│ 下游應用 │
├─────────────────────────────────────────────────┤
│ ① 雲端端推論服務 │
│ → vLLM + AWQ/GPTQ → 高吞吐 LLM serving │
│ → 降低每 token 推論成本(視訊記憶體↓ → 批大小↑) │
│ │
│ ② 邊緣/終端裝置 │
│ → 手機(高通/聯發科 NPU, INT8/INT4) │
│ → 筆記本/桌上型電腦(CPU 推論, llama.cpp + GGUF) │
│ → 嵌入式/機器人 │
│ │
│ ③ 消費級 GPU 部署 │
│ → 70B 模型 4-bit 量化後約需 35 GB 視訊記憶體,單張 RTX 4090(24 GB)無法執行,需使用 48 GB 專業顯示卡(如 RTX A6000)或支援視訊記憶體池化的專業多卡方案(如通過 NVLink 互聯);消費級多卡方案(如 RTX 4090×2)缺乏 NVLink,僅靠 PCIe 進行模型並行頻寬低且額外視訊記憶體開銷大,實際難以可靠執行 35 GB 級模型│
│ │
│ ④ 多模態模型壓縮 │
│ → Vision-Language 模型的權重壓縮 │
│ → Diffusion 模型加速(如 SDXL INT8) │
└─────────────────────────────────────────────────┘
關鍵指標
PTQ 模型質量評估指標
| 指標 | 含義 | 說明 |
|---|---|---|
| WikiText-2 Perplexity | 困惑度 | LLM 量化後最常用的質量指標,越低越好 |
| 下游任務精度 | MMLU、HumanEval、GSM8K 等 | 評估量化對不同能力維度的影響 |
| Human Eval / 對話質量 | 主觀評估 | 量化模型在實際對話中的表現 |
| Perplexity Degradation | PPL 退化幅度 | 通常要求 < 0.5(8-bit)或 < 1.0(4-bit)為可接受 |
PTQ 工程效率指標
| 指標 | 含義 | 典型量級 |
|---|---|---|
| 校準耗時 | 完成量化所需時間 | 70B 模型 4-bit PTQ:數十分鐘到數小時(因方法而異)[估算] |
| 校準記憶體峰值 | 校準過程 GPU 視訊記憶體需求 | GPTQ 可逐層處理,峰值約等於單層大小 [行業共識] |
| 有效位寬 | 權重 + scale/zp 的平均位寬 | 4-bit + group=128 ≈ 4.06—4.25 bit(取決於實現) |
| 推論吞吐提升 | 吞吐量變化 | weight-only(省頻寬)vs W8A8(省計算),效果差異大,見下文 |
| 記憶體節省比例 | FP16 基線對比 | 4-bit ≈ 4× 壓縮(含 scale 開銷後約 3.5×)[估算] |
關鍵區分:Weight-Only ≠ 計算加速
Weight-Only 量化(GPTQ/AWQ/W4A16):
- 權重儲存為 4-bit → 推論時需反量化到 FP16 再做 matmul
- 節省的是:視訊記憶體佔用、權重載入頻寬(Memory-bound 場景有幫助)
- 不節省的是:浮點運算次數(Compute-bound 場景無明顯加速)
- 適用場景:batch_size=1 的互動式推論(Memory-bound)
W8A8 量化(SmoothQuant 等):
- 權重和啟用都是 INT8 → 直接用 INT8 Tensor Core 計算
- 理論計算吞吐:INT8 TC 是 FP16 TC 的 ~2×(在支援 INT8 TC 的硬體上)
- 適用場景:高吞吐服務(Compute-bound)
實際加速取決於:
① 硬體是否原生支援對應精度(INT8 TC / FP8 TC / INT4 支援)
② 當前 workload 是 memory-bound 還是 compute-bound
③ 運算元實現質量(kernel 調優程度)
供需與市場資料
需求側驅動力
推論成本 = f(模型大小, 硬體規格, 吞吐量)
PTQ 的經濟價值:
場景 A(雲端端推論):
FP16 70B → 需要 2×A100-80GB → $3—4/hr [估算,雲端例項成本]
4-bit 70B → 需要 1×A100-80GB → $1.5—2/hr [估算]
→ 單次推論成本下降約 40—60% [行業普遍認知]
場景 B(邊緣部署):
FP16 7B → 14GB 記憶體 → 無法在手機執行
4-bit 7B → ~4GB 記憶體 → 可在高階手機執行
→ 使能全新應用場景
供給側生態
| 角色 | 代表公司/專案 | 產品/方案 |
|---|---|---|
| 量化演算法 | MIT Han Lab、IST Austria(GPTQ 原作者)、Tim Dettmers | AWQ、SmoothQuant、GPTQ、bitsandbytes |
| 推論架構 | NVIDIA、vLLM 社群、llama.cpp 社群 | TensorRT-LLM、vLLM、llama.cpp |
| 硬體晶片 | NVIDIA、Qualcomm、MediaTek、Apple | 含 INT8/FP8 TC 的 GPU;含 INT8/INT4 NPU 的移動 SoC |
| 模型平台 | Hugging Face | 原生整合 bitsandbytes、GPTQ、AWQ 的模型載入 |
| 雲端服務商 | AWS、Azure、GCP | 提供量化模型最佳化的推論端點 |
市場資料說明
- LLM 推論市場規模在快速增長,PTQ 作為推論最佳化的關鍵環節,其價值隨推論需求增長而增長。具體市場規模數字因統計口徑不同而差異較大,不做具體數字聲稱,建議參考 Gartner / IDC 最新報告。
- 定性判斷:PTQ 已成為大型模型部署的標準配置而非可選項,幾乎所有生產級 LLM 推論都使用某種形式的量化。
代表公司與資本對映
直接關聯
| 公司/專案 | 與 PTQ 的關係 | 資本化路徑 |
|---|---|---|
| NVIDIA | TensorRT-LLM 內建 PTQ 支援;Hopper FP8/Ada FP8 硬體原生低精度;PTQ 降低推論成本→擴大 GPU 市場 | NVDA(GPU + 推論軟體棧) |
| Qualcomm | Hexagon NPU 支援 INT8/INT4 推論;PTQ 使 LLM 可在手機 SoC 執行 | QCOM(移動/邊緣 AI 晶片) |
| MediaTek | APU 支援 INT8 量化推論;天璣系列手機 SoC 的端側 AI | 2454.TW(聯發科) |
| Apple | Neural Engine 支援 INT8;Core ML 支援 PTQ | AAPL(端側 AI 生態) |
| AMD | ROCm 生態量化支援;Instinct 系列推論能力 | AMD(GPU + 推論) |
間接/生態層
| 專案/公司 | 關係 |
|---|---|
| Hugging Face | 量化模型分發平台;transformers 庫原生整合多種 PTQ 方法 |
| vLLM (UC Berkeley) | 開源 LLM 推論引擎,整合 AWQ/GPTQ |
| llama.cpp (Georgi Gerganov) | CPU/消費級 GPU 推論方案,GGUF 量化格式成為消費級標準 |
| Tim Dettmers(學術) | bitsandbytes 作者,8-bit/4-bit NF4 方案廣泛使用 |
| MIT Han Lab (Song Han) | AWQ、SmoothQuant、Elastic 等多個量化/壓縮工作的發源地 |
投資啟示
PTQ 本身不是一個"獨立市場",而是嵌入在推論基礎設施中的技術層。
誰受益?
├── 硬體側:PTQ 降低硬體門檻 → 擴大可服務市場(尤其邊緣/消費級)
│ → Qualcomm, MediaTek, Apple(端側推論);NVIDIA(雲端端推論效率提升→更多推論需求)
│
├── 推論服務側:PTQ 降低單次推論成本 → 擴大應用
│ → 雲端服務商(AWS Bedrock, Azure AI 等)
│
└── 模型側:PTQ 使開源模型可廣泛部署 → 增強開源生態價值
→ Meta (LLaMA), Mistral, 聚合平台 (Hugging Face)
投資邏輯
核心投資命題
命題 1:推論成本下降 → AI 應用滲透率提升 → 整體市場擴大
PTQ 是推論成本下降的多個槓桿之一(其他包括:硬體代際升級、推論架構最佳化、推測解碼、MoE 架構等),但它是唯一不需要改變模型架構、不需要重新訓練、門檻最低的方案。
命題 2:PTQ 使能”邊緣 AI”敘事
4-bit 量化是端側 LLM 的必要前提。沒有 PTQ,手機/筆記本無法執行有意義規模的語言模型。隨著端側 AI 成為各硬體廠商的核心戰略(Apple Intelligence、Qualcomm AI Hub 等),PTQ 的價值持續上升。
命題 3:開源模型 + PTQ → 民主化部署
PTQ 讓中小團隊和獨立開發者也能部署大型模型,強化了開源生態 vs 閉源 API 的競爭格局。
風險與約束
- 精度上限約束:PTQ 有理論精度下限,超低位元(< 3-bit)的質量損失可能不可接受,這限制了壓縮率的進一步提升
- FP8/FP4 硬體替代:隨著原生 FP8(Hopper)和未來 FP4 硬體的普及,某些 PTQ 場景可能被硬體原生低精度格式替代,但 PTQ 方法論(如校準、離群值處理)仍然適用
- QAT 競爭:部分場景下,QAT 或混合方案(如 LoRA + 量化微調)可能優於純 PTQ
常見誤讀糾偏
誤讀 1:“4-bit 量化後推論速度翻倍”
糾偏:4-bit 量化的核心收益是記憶體節省(約 4× 壓縮),而非計算加速。Weight-only PTQ(GPTQ/AWQ)在推論時需要將 4-bit 權重反量化為 FP16 後再做矩陣乘法,浮點運算次數不變。只有在 memory-bound 場景(如 batch_size=1 的自迴歸解碼)中,減少權重載入頻寬才能間接提速。而在 compute-bound 場景(大 batch 服務),提速主要靠 W8A8 或 FP8 等真正降低計算精度的方案。
誤讀 2:“PTQ 精度損失可以忽略不計”
糾偏:8-bit 量化確實通常精度損失極小(PPL 退化通常 < 0.5),但 4-bit 量化在某些任務上可能存在可感知的退化,尤其是推論密集型任務(如 GSM8K 數學推論)或長上下文任務。精度損失程度高度依賴於具體模型、量化方法和評估任務。應當針對目標場景做實測驗證,而非泛泛聲稱”無損”。
誤讀 3:“GPTQ 總是比 AWQ 好(或反之)”
糾偏:兩者在多數基準測試上表現接近,各有適用場景。AWQ 在工程實現上更簡潔,與 TensorRT-LLM 的整合更成熟;GPTQ 在某些模型架構上可能表現更好。實際選型應基於目標模型 + 目標硬體 + 推論架構的實測,而非一概而論。
誤讀 4:“量化只是壓縮,對模型能力沒有系統性影響”
糾偏:量化本質上是一種有損近似,不同能力維度受量化的影響不同。一般而言,知識密集型任務(如事實性問答)比模式識別任務(如情感分類)更耐量化;而複雜推論鏈和精確數值計算對量化更敏感。不能籠統地說”量化模型和原模型一樣好”。
誤讀 5:“PTQ 不需要任何計算資源”
糾偏:雖然 PTQ 遠輕於全量訓練或 QAT,但對大型模型(100B+)執行 GPTQ 校準仍需要數十 GB 視訊記憶體和數小時計算時間。零樣本 PTQ(如 bitsandbytes 的 load_in_4bit)雖幾乎不需要校準,但精度通常不如有校準資料的方案。
學習路徑
入門(1—2 天)
- 理解數值精度基礎:FP32/FP16/BF16/INT8/INT4 的表示範圍和精度差異
- 手寫一個簡單的 Per-Tensor 對稱量化函式(Python,無需 GPU)
- 閱讀:Hugging Face 文件 — Quantization
進階(1—2 周)
- 閱讀 GPTQ 原論文:Frantar et al., “GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers”,理解逐層量化和 Hessian 補償機制
- 閱讀 AWQ 原論文:Lin et al., “AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration”,理解顯著權重保護思想
- 使用 AutoGPTQ 或 AutoAWQ 對常見 LLM 執行量化,對比 PPL 和下游任務精度
- 理解 Group Quantization 的有效位寬計算:考慮 scale 和 zero-point 的開銷
深入(1—2 月)
- 閱讀 SmoothQuant 原論文:理解離群值遷移的數學原理與實現細節
- 閱讀 LLM.int8() 原論文:理解混合精度分解與離群特徵識別
- 研究 vLLM 或 TensorRT-LLM 的量化模型部署:關注 kernel 調優、記憶體管理和 batch 排程策略
- 嘗試量化調優:調整校準資料集、量化粒度、位元分配策略等,觀察精度變化
前沿方向(持續關注)
- Sub-4-bit 方法的精度邊界:AQLM、QuIP# 等能否突破 2-bit 實用化閾值?
- FP8 推論生態演進:Hopper FP8(E4M3/E5M2)與 PTQ INT8/INT4 的競爭與互補
- 量化與稀疏化的組合壓縮
- 量化模型的長上下文能力保持
- 量化對多模態模型(特別是 Diffusion 和 LLM-based Vision)的影響