模型層 開放閱讀

AWQ

Activation-aware Weight Quantization

概念 ID
activation-aware-weight-quantization
更新時間
2026-05-29
來源數量
待補

AWQ (Activation-aware Weight Quantization)

3 秒看懂

AWQ 是一種面向大語言模型 (LLM) 的僅權重量化 (Weight-Only Quantization, WOQ) 方法。其核心洞察:約 1% 的權重通道對應啟用值中幅度最大的分量,對模型輸出精度影響遠超其餘 99%。AWQ 不直接保留這些通道為高精度,而是通過逐通道縮放 (per-channel scaling) 在量化前”放大”關鍵通道的數值範圍,使其在均勻量化網格下獲得更細的量化解析度,從而在 W4A16(4-bit 權重、16-bit 啟用) 設定下實現近乎無損的推論質量。

一句話定位:不訓練、不微調,靠啟用統計資訊指導量化縮放,把 INT4 LLM 做到接近 FP16 精度。

3 分鐘產業解釋

為什麼 AWQ 重要?

LLM 引數量從數十億到數千億,FP16 儲存動輒數十到數百 GB。要在消費級 GPU、邊緣裝置或高吞吐推論叢集上部署,量化是最直接的壓縮槓桿。但傳統量化方法面臨兩難:

方案問題
混合精度 (mixed-precision)將少量重要權重保留 FP16,其餘 INT4 → 硬體執行不規則,核心效率低
樸素 INT4 均勻量化 (如 absmax)所有通道同等對待 → 重要通道被嚴重量化損失,模型質量退化
AWQ所有權重量化為 INT4(硬體友好),但通過縮放讓重要通道”變相獲得更高精度” → 規則資料版面配置 + 高推論質量

AWQ 的產業價值在於:它是一個 post-training quantization (PTQ) 方法——不需要反向傳播、不需要微調,只需少量校準資料(通常幾百條樣本,幾分鐘即可完成),即可將 FP16 模型壓縮到 INT4,視訊記憶體佔用約降至 1/4,同時在主流 benchmark 上精度損失極小。

產業影響鏈

訓練側 (FP16/BF16 大型模型)

    ▼ AWQ 量化 (PTQ, 分鐘級, 無需 GPU 訓練)

推論側 (INT4 權重 + FP16 啟用)

    ├── 消費級 GPU 部署 (24GB 視訊記憶體可執行約30B級量化模型)
    ├── 推論服務吞吐提升 (視訊記憶體頻寬瓶頸緩解,decode 階段加速)
    └── 邊緣/終端推論 (手機、車載 NPU 等)

15 分鐘專家深入

一、AWQ 的核心機制:啟用感知的逐通道縮放

傳統權重量化的思路是:給定權重矩陣 $W$,直接對其做均勻量化(如 absmax 或 MinMax)。AWQ 的關鍵發現在於——

不是所有權重列(通道)對輸出的影響是均等的。

通過對校準資料集上前向推論的啟用統計,研究者發現:

  • ~1% 的權重通道對應的輸入啟用幅度顯著高於其餘通道;
  • 這些”顯著通道 (salient channels)“如果被量化損失,模型輸出質量會急劇下降;
  • 直覺上:啟用值大的通道,權重的微小量化誤差會被放大。

但保留少量通道為 FP16 是硬體不友好的(不規則訪存、特殊 kernel)。AWQ 的方案是:

對權重矩陣的每個通道施加一個縮放因子 s_j,在數學上等價於將量化誤差的分佈重新調整,使重要通道的量化誤差在輸出空間中被壓縮。

具體來說,對於線性層 $Y = XW$:

原始:   Y = X · W

引入縮放:令 S = diag(s₁, s₂, ..., sₙ)

         Y = (X · S⁻¹) · (S · W)
              ~~~~~~~~    ~~~~~~~
              重新縮放     放大後量化
              輸入啟用      權重

數學上完全等價,但量化 S·W 時,重要通道因為被放大,
在量化網格中的相對誤差更小。

二、縮放因子的搜尋

AWQ 不需要窮舉所有可能的縮放向量。研究者發現一個有效的啟發式:

s_j = \left( \max(|X_j|) \right)^\alpha

其中 X_j 是校準資料上第 $j$ 個輸入通道的啟用值,\alpha \in [0, 1] 是一個待搜尋的超引數。

  • \alpha = 0:不做縮放,退化為普通均勻量化;
  • \alpha = 1:完全按啟用幅度縮放;
  • 最優 \alpha 通常在中間值,通過在驗證集上 grid search 找到。

搜尋空間極小(一維 grid),耗時幾乎可以忽略。

三、量化方案細節

引數典型設定
權重位寬4-bit (INT4) 為主,也支援 3-bit、2-bit 等
啟用精度FP16 / BF16(不量化啟用)
量化粒度per-group,group size 通常為 128
量化方式對稱 / 非對稱均可,實作中常用 absmax 對稱量化
校準資料通常 128512 條 樣本,無需標籤
校準耗時分鐘級(取決於模型大小和 GPU)
是否需要反向傳播(純 PTQ)

四、與混合精度的本質區別

AWQ 所有權重都以相年增率特寬度儲存(如 INT4),沒有”重要權重保留高精度”這種不規則儲存。它通過縮放間接實現了”重要通道獲得更高有效精度”的效果,但資料版面配置完全規則,硬體友好。


技術原理(最深)

量化數學基礎

對一組權重 $w$ 做 $b$-bit 均稱量化(以 per-group 為例,group size $g$):

給定一個 group 內的權重向量 w = [w₁, w₂, ..., w_g]

1. 計算縮放因子:
   s = max(|w|) / (2^(b-1) - 1)          # absmax 對稱量化

2. 量化:
   w_q = round(w / s)                     # 截斷到 [-2^(b-1)+1, 2^(b-1)-1]

3. 反量化(推論時):
   w_hat = w_q * s                        # 恢復為浮點近似值

量化誤差:ε = w - w_hat

AWQ 的縮放如何改變數化誤差

原始量化:  Y = X · W,   量化 W → Ŵ = W + ε_W
            輸出誤差:ΔY = X · ε_W

AWQ 縮放後:Y = (X · S⁻¹) · (S · W),  量化 S·W → ŜW = S·W + ε_{SW}
            輸出誤差:ΔY = X · S⁻¹ · ε_{SW}

關鍵:ε_{SW} 的分佈和 ε_W 不同。
      對於重要通道 j,s_j > 1(放大),量化步長相對變小,
      因此 |ε_{SW,j}| 的相對誤差降低。
      同時 S⁻¹ 中對應的 1/s_j 會縮放輸出端誤差。
      最終效果:重要通道的輸出貢獻被更精確保留。

重要通道識別的統計依據

在校準集上執行前向推論,統計每一層每個輸入通道的啟用幅度:

For layer l:
    X_calib: [N_samples × D_in]   # 校準資料經過前面層的啟用

    activation_scale[j] = mean(|X_calib[:, j]|)   # 或 max

    salient_channels = top-k(activation_scale, k=0.01*D_in)  # ~1%

觀察:這些通道對應的權重列對輸出的 L2 貢獻(靈敏度)遠超隨機通道。

縮放因子最佳化的完整流程

For each linear layer in the model:

    1. 在校準資料上跑前向,收集輸入啟用 X_calib

    2. 對每個輸入通道 j,計算 activation_scale[j]

    3. 定義候選縮放因子族:
       s_j(α) = activation_scale[j]^α,  α ∈ {0, 0.05, 0.1, ..., 1.0}

    4. 對每個 α 候選:
       a. 對權重施加縮放:W' = diag(s(α)) · W
       b. 對 W' 做 W4 per-group 量化,得到 Ŵ'
       c. 計算量化後輸出誤差:L(α) = ||X·S⁻¹·Ŵ' - X·W||²

    5. 選擇 α* = argmin L(α)

    6. 記錄最終縮放因子 s* = activation_scale^α*

(注:實際實現中可逐層處理,每層獨立搜尋 α,計算量很小)

推論時的等效實現

推論時不需要線上做縮放!可以離線預計算:

預處理(離線):
    W_quantized = Quantize(diag(s*) · W)     # 量化後的權重 (INT4)
    # s* 作為後設資料儲存,或直接融合進反量化公式

推論(線上):
    Y = (X · diag(1/s*)) · Dequant(W_quantized)
        ~~~~~~~~~~~~~~~~~
        只需對輸入啟用做逐通道縮放(逐元素乘法,開銷極小)

或者更高效地融合進量化 kernel 的反量化步驟中。

ASCII 架構圖

┌─────────────────────────────────────────────────────┐
│                    AWQ Pipeline                      │
│                                                     │
│  ┌──────────┐    ┌──────────────┐    ┌───────────┐  │
│  │ 校準資料  │───▶│ 前向推論統計  │───▶│ 啟用幅度   │  │
│  │(128~512條)│    │  每層輸入通道  │    │ per-channel│  │
│  └──────────┘    └──────────────┘    └─────┬─────┘  │
│                                            │        │
│                                            ▼        │
│                                    ┌──────────────┐ │
│                                    │ Grid Search   │ │
│                                    │  α ∈ [0, 1]  │ │
│                                    │ 最小化輸出MSE │ │
│                                    └──────┬───────┘ │
│                                           │         │
│                                           ▼         │
│                              ┌────────────────────┐ │
│                              │ 縮放權重 → INT4 量化│ │
│                              │ per-group, g=128   │ │
│                              └─────────┬──────────┘ │
│                                        │            │
│                        ┌───────────────┼────────┐   │
│                        ▼               ▼        │   │
│                   INT4 權重          縮放因子 s* │   │
│                   (儲存/傳輸)        (後設資料)     │   │
│                        │               │        │   │
│                        └───────┬───────┘        │   │
│                                ▼                │   │
│                    ┌──────────────────────┐     │   │
│                    │    推論引擎 Kernel    │     │   │
│                    │  Dequant + MatMul    │     │   │
│                    │  (融合 s* 縮放)      │     │   │
│                    └──────────────────────┘     │   │
└─────────────────────────────────────────────────────┘

技術演進史

時間里程碑說明
2022GPTQ 釋出基於 OBS/Hessian 的逐層 PTQ 方法,成為 LLM 量化的基線標杆
2022–2023SmoothQuant 釋出解決 W8A8 量化中啟用離群值問題(乘法等價遷移),面向低位元啟用場景
2023 年中AWQ 論文釋出MIT 韓松組 (Ji Lin, Jiaming Tang, Haotian Tang, Shang Yang, Wei-Ming Chen 等);發現啟用幅度指導的縮放策略
2023TinyChat 釋出AWQ 配套的高效推論架構,展示了在多種 GPU / 邊緣裝置上的 INT4 推論能力
2023–2024AutoAWQ 社群庫Casper Hansen 開發的開源 AWQ 實現,極大降低使用門檻,成為 HuggingFace 生態中主流量化方案之一
2023–2024主流推論引擎整合vLLM、TensorRT-LLM、TGI (HuggingFace)、llama.cpp(部分支援)等相繼整合 AWQ 量化權重格式
2024AWQ + 啟用量化探索社群開始探索 AWQ 思路向 W4A8 等更激進方案的延伸(如結合啟用量化)

技術路線對比

主流 LLM PTQ 方法橫向對比

維度AWQGPTQSmoothQuantQuIP#AQLM
型別僅權重 PTQ僅權重 PTQ權重+啟用 PTQ僅權重 PTQ僅權重 PTQ
目標位寬主力 W4A16主力 W4A16W8A8W2–W4W2–W4
核心方法啟用感知縮放+均勻量化Hessian/OBS 逐層近似啟用-權重乘法遷移格基量化+incoherence處理碼本加性量化
是否需要反向傳播✅(碼本訓練)
校準耗時分鐘級中等分鐘級較長小時級
W4 質量★★★★★★★★★N/A(主攻 W8)★★★★☆★★★★
超低位元(≤3-bit)可用但退化明顯較差N/A★★★★★★★★★★
硬體友好性★★★★★(規則INT4版面配置)★★★★★★★★★(需配合啟用量化)★★★(需特殊kernel)★★★(碼本查詢)
主流推論引擎支援廣泛廣泛較廣泛有限有限
開源實現AutoAWQ, llm-awqAutoGPTQsmoothquantquip-sharpaqlm

定位小結

精度要求:  W8A8 ◄──── SmoothQuant
           W4A16 ◄──── AWQ(最佳平衡點), GPTQ
           W2-W3 ◄──── QuIP#, AQLM(更激進壓縮)

易用性:    AWQ ≈ GPTQ > SmoothQuant > QuIP# > AQLM

推論引擎相容: AWQ ≈ GPTQ > SmoothQuant >> QuIP# ≈ AQLM

上下游

上游:量化工具鏈

環節關鍵要素
校準資料通用文本語料即可(如 C4、WikiText 子集),無需特定任務標註
基礎模型任何 Transformer-based LLM(LLaMA、Mistral、Qwen、Falcon 等)
量化算力單卡 GPU 即可完成(A100/H100 加速,但消費級 GPU 亦可)
依賴架構PyTorch、HuggingFace Transformers

下游:推論部署

環節關鍵要素
推論引擎vLLM、TensorRT-LLM、TGI、SGLang、ExLlamaV2、llama.cpp(部分)
目標硬體NVIDIA GPU(A100/H100/L40S/4090 等)、部分邊緣 NPU
核心實現INT4 Matrix Multiplication kernel(如 Marlin kernel、CUTLASS based)
應用場景雲端推論服務、本地私有化部署、端側/邊緣 LLM

產業鏈位置圖

模型訓練 (FP16/BF16)


AWQ 量化 (PTQ, 單卡分鐘級)


INT4 權重檔案 (.safetensors with AWQ config)

    ├──▶ vLLM / TGI / TensorRT-LLM (雲端端推論)
    ├──▶ ExLlamaV2 / llama.cpp (本地推論)
    └──▶ TinyChat / MLC-LLM (邊緣/終端推論)

關鍵指標

量化精度(典型 Benchmark 表現)

⚠️ 以下為 AWQ 論文及社群復現中常見的定性結論,具體數值因模型、資料集、評測設定而異。精確數字請參考原論文 Table 和對應 leaderboard。

模型量化方案WikiText-2 PPL 趨勢下游任務趨勢
LLaMA-2-7BFP16 (baseline)基準基準
LLaMA-2-7BAWQ W4G128↑ 很小(接近無損)接近 FP16
LLaMA-2-7BRTN W4G128 (樸素)↑↑ 明顯退化顯著下降
LLaMA-2-7BGPTQ W4G128↑ 略大於 AWQ略低於 AWQ

核心結論:W4 per-group (g=128) 設定下,AWQ 的精度通常優於或持平 GPTQ,顯著優於樸素均勻量化。

壓縮與效率

指標數值(定性/估算)說明
模型體積壓縮比~4× (FP16→INT4)權重從 16-bit 壓到 4-bit
視訊記憶體節省~60-75%取決於 KV cache 佔比等;權重部分精確 4×
量化耗時分鐘級 (7B~70B)單卡 A100 上,不含下載/載入模型時間
精度退化極小W4G128 下主流 benchmark 退化通常在 1% 以內
推論吞吐提升取決於 memory-bound 程度decode 階段多為 memory-bound,INT4 權重減少頻寬需求,理論加速顯著

供需與市場資料

需求側:為什麼需要 AWQ?

驅動力說明
模型規模增長主流開源模型從 7B → 70B → 405B,FP16 部署成本指數級增長
推論成本敏感雲端端 GPU 小時費是 LLM 應用的主要運營成本,4× 權重壓縮直接降本
邊緣/端側需求手機、車載、嵌入式場景視訊記憶體極其有限,INT4 是”夠用”的最低門檻
私有化部署企業不希望資料上雲端,需在有限硬體上本地跑大型模型

供給側:AWQ 生態成熟度

維度狀態
開源實現成熟(AutoAWQ 活躍維護,HuggingFace hub 上大量 AWQ 量化模型)
推論引擎支援廣泛(vLLM、TGI、TRT-LLM 均原生支援 AWQ 權重格式)
硬體適配主要覆蓋 NVIDIA GPU;AMD/Intel/NPU 生態支援尚在發展中
社群活躍度HuggingFace 上 AWQ 格式模型是下載量最大的量化格式之一

市場相關資料點

⚠️ 以下為公開可查資訊的定性總結,具體數字因統計口徑而異。

  • HuggingFace Hub 上採用 AWQ 量化的模型數量持續增長,與 GPTQ 並列為兩大主流量化格式;
  • vLLM(2024年使用最廣泛的開源 LLM 推論引擎之一)將 AWQ 列為推薦量化方案之一;
  • 多家雲端服務商在推論服務中預設提供 INT4 量化模型選項,AWQ 是常用方案。

代表公司與資本對映

核心研究團隊

機構角色說明
MIT (韓松組 / Song Han’s Group)AWQ 論文原始團隊長期深耕高效推論(AWQ、SmoothQuant、TinyChat、MCUNet 等),韓松為通訊作者/PI

受益方與版面配置方

公司/專案與 AWQ 的關係說明
NVIDIA硬體受益方INT4 量化讓視訊記憶體受限的 GPU(如 4090、L40S)也能跑更大型模型,擴大了 NVIDIA GPU 的可服務模型範圍
vLLM (UC Berkeley)推論引擎整合主流推論引擎中 AWQ 的關鍵支援方
HuggingFace生態整合TGI 推論服務 + Hub 上的 AWQ 模型生態
各開源模型廠商模型釋出方Meta (LLaMA)、阿里 (Qwen)、Mistral 等釋出的模型,社群或官方通常會提供 AWQ 量化版本
邊緣 AI 晶片公司潛在受益方高通、聯發科等,若 NPU 支援高效 INT4 矩陣乘法,AWQ 量化模型可直接部署

投資視角的資本對映

AWQ 技術成熟


降低 LLM 部署門檻 → 擴大 LLM 推論市場規模

    ├── 利好:GPU 推論需求(NVIDIA、AMD)
    ├── 利好:推論雲端服務(CoreWeave 等)
    ├── 利好:推論引擎(vLLM 背後的商業實體)
    └── 利好:端側 AI 晶片(若支援 INT4 效率)

投資邏輯

核心邏輯

AWQ 屬於”推論側降本增效”的技術基礎設施,不直接創造價值,但通過降低部署成本擴大 LLM 應用的可定址市場。

分層觀點

層次邏輯確定性
短期AWQ 已是生產環境主流量化方案之一,推論引擎廣泛支援★★★★★
中期隨著模型繼續變大(405B→MoE→更大),INT4 量化的需求只會增加;AWQ 思路可能被吸收進更先進的方案★★★★
長期純權重量化可能被更激進方案(W4A4/W2 等)或硬體原生低精度(FP4 Tensor Core)部分替代,但 AWQ 的”啟用感知”思想可能持續影響後續方法設計★★★

風險

風險說明
硬體原生低精度NVIDIA Blackwell 架構已引入 FP4/FP6 Tensor Core,若硬體原生支援低精度高效計算,軟體量化的相對價值可能降低
架構變革新模型架構可能降低量化敏感度(如某些稀疏/混合架構),AWQ 的具體技術細節可能過時
競爭方法GPTQ 持續迭代、QuIP#/AQLM 在超低位元更有優勢,AWQ 並非唯一解

不應高估的點

AWQ 是開源學術成果(MIT 許可),不直接構成任何公司的商業化壁壘。它的價值體現在生態位而非可投資標的本身。投資應關注使用 AWQ 的推論服務商AWQ 執行其上的硬體廠商


常見誤讀糾偏

誤讀 1:“AWQ 會用 FP16 保留重要權重,其他用 INT4”

錯。 這是混合精度方案的描述,不是 AWQ。AWQ 的所有權重都量化為相年增率特寬度(如 INT4)。它通過縮放讓重要通道在量化後獲得更高的有效精度,但儲存格式完全一致,硬體執行規則統一。

誤讀 2:“AWQ 需要微調或反向傳播”

錯。 AWQ 是純 PTQ(Post-Training Quantization)方法。它只需要在校準資料上做前向推論統計啟用幅度,然後通過一維 grid search 找最優縮放因子。整個過程無梯度計算、無權重更新。 這與 GPTQ(需要近似 Hessian)形成對比。

誤讀 3:“AWQ 只適用於特定模型架構”

基本錯。 AWQ 的原理(啟用幅度指導權重縮放)是通用的,適用於任何基於線性層的 Transformer 模型。在實踐中,LLaMA、Mistral、Qwen、Falcon、Phi、Gemma 等主流架構均有成熟的 AWQ 量化支援。但對極小模型或非 Transformer 架構,效果需另做評估。

誤讀 4:“AWQ W4 量化後模型質量無損”

⚠️ 過度簡化。 雖然 W4G128 下退化通常很小(主流 benchmark 上可能在 1% 級別),但”無損”是一個絕對詞。在某些對精度極度敏感的任務(如長上下文推論、數學推論鏈、程式碼生成的邊界情況)中,量化退化可能被放大。正確的表述是”退化極小,通常在實際應用中可接受”。

誤讀 5:“AWQ 和 GPTQ 是同一類方法,只是實現不同”

⚠️ 部分正確但忽略了核心差異。 兩者都是 WOQ PTQ 方法、都產出 INT4 權重,但技術路徑完全不同:GPTQ 基於二階資訊(Hessian/OBS)逐列量化並補償誤差,AWQ 基於啟用統計做縮放後均勻量化。AWQ 不需要近似 Hessian 計算,流程更簡潔,且在多個 benchmark 上精度略優或持平。


學習路徑

入門(30 分鐘)

  1. 閱讀本文件 “3 秒看懂” 和 “3 分鐘產業解釋” 部分
  2. 理解量化的基礎概念:absmax 量化、per-group 量化、量化誤差

進階(2-3 小時)

  1. 閱讀 AWQ 原論文(重點關注 Section 3: 方法動機與 Section 4: 實驗)
  2. 執行 AutoAWQ 對一個 7B 模型做 W4 量化,對比量化前後 PPL
  3. 用 vLLM 載入 AWQ 量化模型做推論,觀察視訊記憶體佔用變化

深入(1-2 天)

  1. 閱讀 GPTQ 論文,對比兩者方法論差異
  2. 閱讀 SmoothQuant 論文,理解 W8A8 與 W4A16 的不同問題域
  3. 閱讀 AWQ 程式碼(llm-awq 或 AutoAWQ),理解縮放因子搜尋的具體實現
  4. 在不同 group size(32/64/128/256)下對比量化質量,建立直覺

前沿追蹤

  1. 關注 QuIP#/AQLM 等超低位元方案,理解 AWQ 在該領域的侷限
  2. 關注 Blackwell/下一代 GPU 的 FP4 硬體支援,評估其對軟體量化的影響
  3. 關注 AWQ 思路在 MoE 模型、多模態模型上的適用性

一句話總結

AWQ 通過”啟用幅度指導的逐通道縮放”這一極簡但有效的機制,以純 PTQ 方式實現了 W4A16 下接近無損的 LLM 量化質量,成為當前推論側部署最廣泛使用的量化方案之一,其核心貢獻不在於演算法複雜度,而在於精準找到了權重重要性的代理訊號。


延伸閱讀與來源

資源連結/說明
AWQ 原論文Lin et al., “AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration”, arXiv 2023
AutoAWQ (社群實現)GitHub: casper-hansen/AutoAWQ
llm-awq (原始實現)GitHub: mit-han-lab/llm-awq
TinyChatGitHub: mit-han-lab/TinyChat (AWQ 配套推論架構)
GPTQ 論文Frantar et al., “GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers”, ICLR 2023
SmoothQuant 論文Xiao et al., “SmoothQuant: Accurate and Efficient Post-Training Quantization for La
source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型