AWQ (Activation-aware Weight Quantization)
3 秒看懂
AWQ 是一種面向大語言模型 (LLM) 的僅權重量化 (Weight-Only Quantization, WOQ) 方法。其核心洞察:約 1% 的權重通道對應啟用值中幅度最大的分量,對模型輸出精度影響遠超其餘 99%。AWQ 不直接保留這些通道為高精度,而是通過逐通道縮放 (per-channel scaling) 在量化前”放大”關鍵通道的數值範圍,使其在均勻量化網格下獲得更細的量化解析度,從而在 W4A16(4-bit 權重、16-bit 啟用) 設定下實現近乎無損的推論質量。
一句話定位:不訓練、不微調,靠啟用統計資訊指導量化縮放,把 INT4 LLM 做到接近 FP16 精度。
3 分鐘產業解釋
為什麼 AWQ 重要?
LLM 引數量從數十億到數千億,FP16 儲存動輒數十到數百 GB。要在消費級 GPU、邊緣裝置或高吞吐推論叢集上部署,量化是最直接的壓縮槓桿。但傳統量化方法面臨兩難:
| 方案 | 問題 |
|---|---|
| 混合精度 (mixed-precision) | 將少量重要權重保留 FP16,其餘 INT4 → 硬體執行不規則,核心效率低 |
| 樸素 INT4 均勻量化 (如 absmax) | 所有通道同等對待 → 重要通道被嚴重量化損失,模型質量退化 |
| AWQ | 所有權重量化為 INT4(硬體友好),但通過縮放讓重要通道”變相獲得更高精度” → 規則資料版面配置 + 高推論質量 |
AWQ 的產業價值在於:它是一個 post-training quantization (PTQ) 方法——不需要反向傳播、不需要微調,只需少量校準資料(通常幾百條樣本,幾分鐘即可完成),即可將 FP16 模型壓縮到 INT4,視訊記憶體佔用約降至 1/4,同時在主流 benchmark 上精度損失極小。
產業影響鏈
訓練側 (FP16/BF16 大型模型)
│
▼ AWQ 量化 (PTQ, 分鐘級, 無需 GPU 訓練)
│
推論側 (INT4 權重 + FP16 啟用)
│
├── 消費級 GPU 部署 (24GB 視訊記憶體可執行約30B級量化模型)
├── 推論服務吞吐提升 (視訊記憶體頻寬瓶頸緩解,decode 階段加速)
└── 邊緣/終端推論 (手機、車載 NPU 等)
15 分鐘專家深入
一、AWQ 的核心機制:啟用感知的逐通道縮放
傳統權重量化的思路是:給定權重矩陣 $W$,直接對其做均勻量化(如 absmax 或 MinMax)。AWQ 的關鍵發現在於——
不是所有權重列(通道)對輸出的影響是均等的。
通過對校準資料集上前向推論的啟用統計,研究者發現:
- 約 ~1% 的權重通道對應的輸入啟用幅度顯著高於其餘通道;
- 這些”顯著通道 (salient channels)“如果被量化損失,模型輸出質量會急劇下降;
- 直覺上:啟用值大的通道,權重的微小量化誤差會被放大。
但保留少量通道為 FP16 是硬體不友好的(不規則訪存、特殊 kernel)。AWQ 的方案是:
對權重矩陣的每個通道施加一個縮放因子
s_j,在數學上等價於將量化誤差的分佈重新調整,使重要通道的量化誤差在輸出空間中被壓縮。
具體來說,對於線性層 $Y = XW$:
原始: Y = X · W
引入縮放:令 S = diag(s₁, s₂, ..., sₙ)
Y = (X · S⁻¹) · (S · W)
~~~~~~~~ ~~~~~~~
重新縮放 放大後量化
輸入啟用 權重
數學上完全等價,但量化 S·W 時,重要通道因為被放大,
在量化網格中的相對誤差更小。
二、縮放因子的搜尋
AWQ 不需要窮舉所有可能的縮放向量。研究者發現一個有效的啟發式:
s_j = \left( \max(|X_j|) \right)^\alpha
其中 X_j 是校準資料上第 $j$ 個輸入通道的啟用值,\alpha \in [0, 1] 是一個待搜尋的超引數。
\alpha = 0:不做縮放,退化為普通均勻量化;\alpha = 1:完全按啟用幅度縮放;- 最優
\alpha通常在中間值,通過在驗證集上 grid search 找到。
搜尋空間極小(一維 grid),耗時幾乎可以忽略。
三、量化方案細節
| 引數 | 典型設定 |
|---|---|
| 權重位寬 | 4-bit (INT4) 為主,也支援 3-bit、2-bit 等 |
| 啟用精度 | FP16 / BF16(不量化啟用) |
| 量化粒度 | per-group,group size 通常為 128 |
| 量化方式 | 對稱 / 非對稱均可,實作中常用 absmax 對稱量化 |
| 校準資料 | 通常 |
| 校準耗時 | 分鐘級(取決於模型大小和 GPU) |
| 是否需要反向傳播 | 否(純 PTQ) |
四、與混合精度的本質區別
AWQ 所有權重都以相年增率特寬度儲存(如 INT4),沒有”重要權重保留高精度”這種不規則儲存。它通過縮放間接實現了”重要通道獲得更高有效精度”的效果,但資料版面配置完全規則,硬體友好。
技術原理(最深)
量化數學基礎
對一組權重 $w$ 做 $b$-bit 均稱量化(以 per-group 為例,group size $g$):
給定一個 group 內的權重向量 w = [w₁, w₂, ..., w_g]
1. 計算縮放因子:
s = max(|w|) / (2^(b-1) - 1) # absmax 對稱量化
2. 量化:
w_q = round(w / s) # 截斷到 [-2^(b-1)+1, 2^(b-1)-1]
3. 反量化(推論時):
w_hat = w_q * s # 恢復為浮點近似值
量化誤差:ε = w - w_hat
AWQ 的縮放如何改變數化誤差
原始量化: Y = X · W, 量化 W → Ŵ = W + ε_W
輸出誤差:ΔY = X · ε_W
AWQ 縮放後:Y = (X · S⁻¹) · (S · W), 量化 S·W → ŜW = S·W + ε_{SW}
輸出誤差:ΔY = X · S⁻¹ · ε_{SW}
關鍵:ε_{SW} 的分佈和 ε_W 不同。
對於重要通道 j,s_j > 1(放大),量化步長相對變小,
因此 |ε_{SW,j}| 的相對誤差降低。
同時 S⁻¹ 中對應的 1/s_j 會縮放輸出端誤差。
最終效果:重要通道的輸出貢獻被更精確保留。
重要通道識別的統計依據
在校準集上執行前向推論,統計每一層每個輸入通道的啟用幅度:
For layer l:
X_calib: [N_samples × D_in] # 校準資料經過前面層的啟用
activation_scale[j] = mean(|X_calib[:, j]|) # 或 max
salient_channels = top-k(activation_scale, k=0.01*D_in) # ~1%
觀察:這些通道對應的權重列對輸出的 L2 貢獻(靈敏度)遠超隨機通道。
縮放因子最佳化的完整流程
For each linear layer in the model:
1. 在校準資料上跑前向,收集輸入啟用 X_calib
2. 對每個輸入通道 j,計算 activation_scale[j]
3. 定義候選縮放因子族:
s_j(α) = activation_scale[j]^α, α ∈ {0, 0.05, 0.1, ..., 1.0}
4. 對每個 α 候選:
a. 對權重施加縮放:W' = diag(s(α)) · W
b. 對 W' 做 W4 per-group 量化,得到 Ŵ'
c. 計算量化後輸出誤差:L(α) = ||X·S⁻¹·Ŵ' - X·W||²
5. 選擇 α* = argmin L(α)
6. 記錄最終縮放因子 s* = activation_scale^α*
(注:實際實現中可逐層處理,每層獨立搜尋 α,計算量很小)
推論時的等效實現
推論時不需要線上做縮放!可以離線預計算:
預處理(離線):
W_quantized = Quantize(diag(s*) · W) # 量化後的權重 (INT4)
# s* 作為後設資料儲存,或直接融合進反量化公式
推論(線上):
Y = (X · diag(1/s*)) · Dequant(W_quantized)
~~~~~~~~~~~~~~~~~
只需對輸入啟用做逐通道縮放(逐元素乘法,開銷極小)
或者更高效地融合進量化 kernel 的反量化步驟中。
ASCII 架構圖
┌─────────────────────────────────────────────────────┐
│ AWQ Pipeline │
│ │
│ ┌──────────┐ ┌──────────────┐ ┌───────────┐ │
│ │ 校準資料 │───▶│ 前向推論統計 │───▶│ 啟用幅度 │ │
│ │(128~512條)│ │ 每層輸入通道 │ │ per-channel│ │
│ └──────────┘ └──────────────┘ └─────┬─────┘ │
│ │ │
│ ▼ │
│ ┌──────────────┐ │
│ │ Grid Search │ │
│ │ α ∈ [0, 1] │ │
│ │ 最小化輸出MSE │ │
│ └──────┬───────┘ │
│ │ │
│ ▼ │
│ ┌────────────────────┐ │
│ │ 縮放權重 → INT4 量化│ │
│ │ per-group, g=128 │ │
│ └─────────┬──────────┘ │
│ │ │
│ ┌───────────────┼────────┐ │
│ ▼ ▼ │ │
│ INT4 權重 縮放因子 s* │ │
│ (儲存/傳輸) (後設資料) │ │
│ │ │ │ │
│ └───────┬───────┘ │ │
│ ▼ │ │
│ ┌──────────────────────┐ │ │
│ │ 推論引擎 Kernel │ │ │
│ │ Dequant + MatMul │ │ │
│ │ (融合 s* 縮放) │ │ │
│ └──────────────────────┘ │ │
└─────────────────────────────────────────────────────┘
技術演進史
| 時間 | 里程碑 | 說明 |
|---|---|---|
| 2022 | GPTQ 釋出 | 基於 OBS/Hessian 的逐層 PTQ 方法,成為 LLM 量化的基線標杆 |
| 2022–2023 | SmoothQuant 釋出 | 解決 W8A8 量化中啟用離群值問題(乘法等價遷移),面向低位元啟用場景 |
| 2023 年中 | AWQ 論文釋出 | MIT 韓松組 (Ji Lin, Jiaming Tang, Haotian Tang, Shang Yang, Wei-Ming Chen 等);發現啟用幅度指導的縮放策略 |
| 2023 | TinyChat 釋出 | AWQ 配套的高效推論架構,展示了在多種 GPU / 邊緣裝置上的 INT4 推論能力 |
| 2023–2024 | AutoAWQ 社群庫 | Casper Hansen 開發的開源 AWQ 實現,極大降低使用門檻,成為 HuggingFace 生態中主流量化方案之一 |
| 2023–2024 | 主流推論引擎整合 | vLLM、TensorRT-LLM、TGI (HuggingFace)、llama.cpp(部分支援)等相繼整合 AWQ 量化權重格式 |
| 2024 | AWQ + 啟用量化探索 | 社群開始探索 AWQ 思路向 W4A8 等更激進方案的延伸(如結合啟用量化) |
技術路線對比
主流 LLM PTQ 方法橫向對比
| 維度 | AWQ | GPTQ | SmoothQuant | QuIP# | AQLM |
|---|---|---|---|---|---|
| 型別 | 僅權重 PTQ | 僅權重 PTQ | 權重+啟用 PTQ | 僅權重 PTQ | 僅權重 PTQ |
| 目標位寬 | 主力 W4A16 | 主力 W4A16 | W8A8 | W2–W4 | W2–W4 |
| 核心方法 | 啟用感知縮放+均勻量化 | Hessian/OBS 逐層近似 | 啟用-權重乘法遷移 | 格基量化+incoherence處理 | 碼本加性量化 |
| 是否需要反向傳播 | ❌ | ❌ | ❌ | ❌ | ✅(碼本訓練) |
| 校準耗時 | 分鐘級 | 中等 | 分鐘級 | 較長 | 小時級 |
| W4 質量 | ★★★★★ | ★★★★ | N/A(主攻 W8) | ★★★★☆ | ★★★★ |
| 超低位元(≤3-bit) | 可用但退化明顯 | 較差 | N/A | ★★★★★ | ★★★★★ |
| 硬體友好性 | ★★★★★(規則INT4版面配置) | ★★★★★ | ★★★★(需配合啟用量化) | ★★★(需特殊kernel) | ★★★(碼本查詢) |
| 主流推論引擎支援 | 廣泛 | 廣泛 | 較廣泛 | 有限 | 有限 |
| 開源實現 | AutoAWQ, llm-awq | AutoGPTQ | smoothquant | quip-sharp | aqlm |
定位小結
精度要求: W8A8 ◄──── SmoothQuant
W4A16 ◄──── AWQ(最佳平衡點), GPTQ
W2-W3 ◄──── QuIP#, AQLM(更激進壓縮)
易用性: AWQ ≈ GPTQ > SmoothQuant > QuIP# > AQLM
推論引擎相容: AWQ ≈ GPTQ > SmoothQuant >> QuIP# ≈ AQLM
上下游
上游:量化工具鏈
| 環節 | 關鍵要素 |
|---|---|
| 校準資料 | 通用文本語料即可(如 C4、WikiText 子集),無需特定任務標註 |
| 基礎模型 | 任何 Transformer-based LLM(LLaMA、Mistral、Qwen、Falcon 等) |
| 量化算力 | 單卡 GPU 即可完成(A100/H100 加速,但消費級 GPU 亦可) |
| 依賴架構 | PyTorch、HuggingFace Transformers |
下游:推論部署
| 環節 | 關鍵要素 |
|---|---|
| 推論引擎 | vLLM、TensorRT-LLM、TGI、SGLang、ExLlamaV2、llama.cpp(部分) |
| 目標硬體 | NVIDIA GPU(A100/H100/L40S/4090 等)、部分邊緣 NPU |
| 核心實現 | INT4 Matrix Multiplication kernel(如 Marlin kernel、CUTLASS based) |
| 應用場景 | 雲端推論服務、本地私有化部署、端側/邊緣 LLM |
產業鏈位置圖
模型訓練 (FP16/BF16)
│
▼
AWQ 量化 (PTQ, 單卡分鐘級)
│
▼
INT4 權重檔案 (.safetensors with AWQ config)
│
├──▶ vLLM / TGI / TensorRT-LLM (雲端端推論)
├──▶ ExLlamaV2 / llama.cpp (本地推論)
└──▶ TinyChat / MLC-LLM (邊緣/終端推論)
關鍵指標
量化精度(典型 Benchmark 表現)
⚠️ 以下為 AWQ 論文及社群復現中常見的定性結論,具體數值因模型、資料集、評測設定而異。精確數字請參考原論文 Table 和對應 leaderboard。
| 模型 | 量化方案 | WikiText-2 PPL 趨勢 | 下游任務趨勢 |
|---|---|---|---|
| LLaMA-2-7B | FP16 (baseline) | 基準 | 基準 |
| LLaMA-2-7B | AWQ W4G128 | ↑ 很小(接近無損) | 接近 FP16 |
| LLaMA-2-7B | RTN W4G128 (樸素) | ↑↑ 明顯退化 | 顯著下降 |
| LLaMA-2-7B | GPTQ W4G128 | ↑ 略大於 AWQ | 略低於 AWQ |
核心結論:W4 per-group (g=128) 設定下,AWQ 的精度通常優於或持平 GPTQ,顯著優於樸素均勻量化。
壓縮與效率
| 指標 | 數值(定性/估算) | 說明 |
|---|---|---|
| 模型體積壓縮比 | ~4× (FP16→INT4) | 權重從 16-bit 壓到 4-bit |
| 視訊記憶體節省 | ~60-75% | 取決於 KV cache 佔比等;權重部分精確 4× |
| 量化耗時 | 分鐘級 (7B~70B) | 單卡 A100 上,不含下載/載入模型時間 |
| 精度退化 | 極小 | W4G128 下主流 benchmark 退化通常在 1% 以內 |
| 推論吞吐提升 | 取決於 memory-bound 程度 | decode 階段多為 memory-bound,INT4 權重減少頻寬需求,理論加速顯著 |
供需與市場資料
需求側:為什麼需要 AWQ?
| 驅動力 | 說明 |
|---|---|
| 模型規模增長 | 主流開源模型從 7B → 70B → 405B,FP16 部署成本指數級增長 |
| 推論成本敏感 | 雲端端 GPU 小時費是 LLM 應用的主要運營成本,4× 權重壓縮直接降本 |
| 邊緣/端側需求 | 手機、車載、嵌入式場景視訊記憶體極其有限,INT4 是”夠用”的最低門檻 |
| 私有化部署 | 企業不希望資料上雲端,需在有限硬體上本地跑大型模型 |
供給側:AWQ 生態成熟度
| 維度 | 狀態 |
|---|---|
| 開源實現 | 成熟(AutoAWQ 活躍維護,HuggingFace hub 上大量 AWQ 量化模型) |
| 推論引擎支援 | 廣泛(vLLM、TGI、TRT-LLM 均原生支援 AWQ 權重格式) |
| 硬體適配 | 主要覆蓋 NVIDIA GPU;AMD/Intel/NPU 生態支援尚在發展中 |
| 社群活躍度 | HuggingFace 上 AWQ 格式模型是下載量最大的量化格式之一 |
市場相關資料點
⚠️ 以下為公開可查資訊的定性總結,具體數字因統計口徑而異。
- HuggingFace Hub 上採用 AWQ 量化的模型數量持續增長,與 GPTQ 並列為兩大主流量化格式;
- vLLM(2024年使用最廣泛的開源 LLM 推論引擎之一)將 AWQ 列為推薦量化方案之一;
- 多家雲端服務商在推論服務中預設提供 INT4 量化模型選項,AWQ 是常用方案。
代表公司與資本對映
核心研究團隊
| 機構 | 角色 | 說明 |
|---|---|---|
| MIT (韓松組 / Song Han’s Group) | AWQ 論文原始團隊 | 長期深耕高效推論(AWQ、SmoothQuant、TinyChat、MCUNet 等),韓松為通訊作者/PI |
受益方與版面配置方
| 公司/專案 | 與 AWQ 的關係 | 說明 |
|---|---|---|
| NVIDIA | 硬體受益方 | INT4 量化讓視訊記憶體受限的 GPU(如 4090、L40S)也能跑更大型模型,擴大了 NVIDIA GPU 的可服務模型範圍 |
| vLLM (UC Berkeley) | 推論引擎整合 | 主流推論引擎中 AWQ 的關鍵支援方 |
| HuggingFace | 生態整合 | TGI 推論服務 + Hub 上的 AWQ 模型生態 |
| 各開源模型廠商 | 模型釋出方 | Meta (LLaMA)、阿里 (Qwen)、Mistral 等釋出的模型,社群或官方通常會提供 AWQ 量化版本 |
| 邊緣 AI 晶片公司 | 潛在受益方 | 高通、聯發科等,若 NPU 支援高效 INT4 矩陣乘法,AWQ 量化模型可直接部署 |
投資視角的資本對映
AWQ 技術成熟
│
▼
降低 LLM 部署門檻 → 擴大 LLM 推論市場規模
│
├── 利好:GPU 推論需求(NVIDIA、AMD)
├── 利好:推論雲端服務(CoreWeave 等)
├── 利好:推論引擎(vLLM 背後的商業實體)
└── 利好:端側 AI 晶片(若支援 INT4 效率)
投資邏輯
核心邏輯
AWQ 屬於”推論側降本增效”的技術基礎設施,不直接創造價值,但通過降低部署成本擴大 LLM 應用的可定址市場。
分層觀點
| 層次 | 邏輯 | 確定性 |
|---|---|---|
| 短期 | AWQ 已是生產環境主流量化方案之一,推論引擎廣泛支援 | ★★★★★ |
| 中期 | 隨著模型繼續變大(405B→MoE→更大),INT4 量化的需求只會增加;AWQ 思路可能被吸收進更先進的方案 | ★★★★ |
| 長期 | 純權重量化可能被更激進方案(W4A4/W2 等)或硬體原生低精度(FP4 Tensor Core)部分替代,但 AWQ 的”啟用感知”思想可能持續影響後續方法設計 | ★★★ |
風險
| 風險 | 說明 |
|---|---|
| 硬體原生低精度 | NVIDIA Blackwell 架構已引入 FP4/FP6 Tensor Core,若硬體原生支援低精度高效計算,軟體量化的相對價值可能降低 |
| 架構變革 | 新模型架構可能降低量化敏感度(如某些稀疏/混合架構),AWQ 的具體技術細節可能過時 |
| 競爭方法 | GPTQ 持續迭代、QuIP#/AQLM 在超低位元更有優勢,AWQ 並非唯一解 |
不應高估的點
AWQ 是開源學術成果(MIT 許可),不直接構成任何公司的商業化壁壘。它的價值體現在生態位而非可投資標的本身。投資應關注使用 AWQ 的推論服務商和AWQ 執行其上的硬體廠商。
常見誤讀糾偏
誤讀 1:“AWQ 會用 FP16 保留重要權重,其他用 INT4”
❌ 錯。 這是混合精度方案的描述,不是 AWQ。AWQ 的所有權重都量化為相年增率特寬度(如 INT4)。它通過縮放讓重要通道在量化後獲得更高的有效精度,但儲存格式完全一致,硬體執行規則統一。
誤讀 2:“AWQ 需要微調或反向傳播”
❌ 錯。 AWQ 是純 PTQ(Post-Training Quantization)方法。它只需要在校準資料上做前向推論統計啟用幅度,然後通過一維 grid search 找最優縮放因子。整個過程無梯度計算、無權重更新。 這與 GPTQ(需要近似 Hessian)形成對比。
誤讀 3:“AWQ 只適用於特定模型架構”
❌ 基本錯。 AWQ 的原理(啟用幅度指導權重縮放)是通用的,適用於任何基於線性層的 Transformer 模型。在實踐中,LLaMA、Mistral、Qwen、Falcon、Phi、Gemma 等主流架構均有成熟的 AWQ 量化支援。但對極小模型或非 Transformer 架構,效果需另做評估。
誤讀 4:“AWQ W4 量化後模型質量無損”
⚠️ 過度簡化。 雖然 W4G128 下退化通常很小(主流 benchmark 上可能在 1% 級別),但”無損”是一個絕對詞。在某些對精度極度敏感的任務(如長上下文推論、數學推論鏈、程式碼生成的邊界情況)中,量化退化可能被放大。正確的表述是”退化極小,通常在實際應用中可接受”。
誤讀 5:“AWQ 和 GPTQ 是同一類方法,只是實現不同”
⚠️ 部分正確但忽略了核心差異。 兩者都是 WOQ PTQ 方法、都產出 INT4 權重,但技術路徑完全不同:GPTQ 基於二階資訊(Hessian/OBS)逐列量化並補償誤差,AWQ 基於啟用統計做縮放後均勻量化。AWQ 不需要近似 Hessian 計算,流程更簡潔,且在多個 benchmark 上精度略優或持平。
學習路徑
入門(30 分鐘)
- 閱讀本文件 “3 秒看懂” 和 “3 分鐘產業解釋” 部分
- 理解量化的基礎概念:absmax 量化、per-group 量化、量化誤差
進階(2-3 小時)
- 閱讀 AWQ 原論文(重點關注 Section 3: 方法動機與 Section 4: 實驗)
- 執行 AutoAWQ 對一個 7B 模型做 W4 量化,對比量化前後 PPL
- 用 vLLM 載入 AWQ 量化模型做推論,觀察視訊記憶體佔用變化
深入(1-2 天)
- 閱讀 GPTQ 論文,對比兩者方法論差異
- 閱讀 SmoothQuant 論文,理解 W8A8 與 W4A16 的不同問題域
- 閱讀 AWQ 程式碼(llm-awq 或 AutoAWQ),理解縮放因子搜尋的具體實現
- 在不同 group size(32/64/128/256)下對比量化質量,建立直覺
前沿追蹤
- 關注 QuIP#/AQLM 等超低位元方案,理解 AWQ 在該領域的侷限
- 關注 Blackwell/下一代 GPU 的 FP4 硬體支援,評估其對軟體量化的影響
- 關注 AWQ 思路在 MoE 模型、多模態模型上的適用性
一句話總結
AWQ 通過”啟用幅度指導的逐通道縮放”這一極簡但有效的機制,以純 PTQ 方式實現了 W4A16 下接近無損的 LLM 量化質量,成為當前推論側部署最廣泛使用的量化方案之一,其核心貢獻不在於演算法複雜度,而在於精準找到了權重重要性的代理訊號。
延伸閱讀與來源
| 資源 | 連結/說明 |
|---|---|
| AWQ 原論文 | Lin et al., “AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration”, arXiv 2023 |
| AutoAWQ (社群實現) | GitHub: casper-hansen/AutoAWQ |
| llm-awq (原始實現) | GitHub: mit-han-lab/llm-awq |
| TinyChat | GitHub: mit-han-lab/TinyChat (AWQ 配套推論架構) |
| GPTQ 論文 | Frantar et al., “GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers”, ICLR 2023 |
| SmoothQuant 論文 | Xiao et al., “SmoothQuant: Accurate and Efficient Post-Training Quantization for La |