晶片層 開放閱讀

後訓練量化

PTQ, Post-Training Quantization

概念 ID
ptq-post-training-quantization
更新時間
2026-05-29
來源數量
待補

後訓練量化(PTQ, Post-Training Quantization)

3 秒看懂

PTQ = 模型訓練完之後,不重新訓練,只用少量校準資料把權重(有時也含啟用值)從高精度(FP16/BF16/FP32)壓到低位元(INT8/INT4/甚至更低),以換取更小的記憶體佔用和更快的推論速度,同時儘量不掉精度。

核心交易:用”一點點校準計算”替代”全量重新訓練”,在精度和部署效率之間做快速折中。

3 分鐘產業解釋

為什麼 PTQ 在 2023—2025 年成為關鍵話題?

大語言模型(LLM)的引數量從數十億飛漲到數千億,單次推論的視訊記憶體佔用和延遲成本巨大。一個 70B 引數模型以 FP16 儲存需要約 140GB 視訊記憶體,幾乎不可能在單卡上執行。PTQ 能將權重壓縮到 4-bit,使視訊記憶體需求降至約 35GB,單卡 24 GB 無法執行,多張消費級卡也難以可靠承載,需使用視訊記憶體≥48 GB 的專業 GPU 或支援高效互聯的多卡方案。

產業邏輯鏈:

模型越來越大 → 推論成本(視訊記憶體+頻寬+延遲)指數級上升
    → PTQ 是"不改模型架構、不重訓"就能降低推論成本的最低門檻手段
    → 降低推論成本 → 擴大可部署硬體範圍(雲端端→邊緣/消費級)
    → 推動 AI 應用普及化

關鍵區分:PTQ 與 QAT(Quantization-Aware Training,量化感知訓練)是兩種路徑。QAT 在訓練過程中引入模擬量化,效果通常更好,但需要完整訓練流程和算力;PTQ 只需要訓練好的模型 + 少量校準資料 + 數小時的計算,門檻遠低,因此在 LLM 時代成為主流方案。

15 分鐘專家深入

PTQ 在 LLM 生態中的技術分層

現代 LLM 的 PTQ 已不再是簡單的”四捨五入”,而是演化出多個層次的方法論:

第一層:權重量化(Weight-Only Quantization)

  • 只壓縮權重,啟用值保持 FP16/BF16
  • 代表:GPTQ、AWQ、bitsandbytes NF4、GGUF 各種方案
  • 優勢:實現簡單,相容性好,精度損失相對可控
  • 劣勢:實際計算仍需反量化到高精度做矩陣乘法,計算量不減少,但記憶體頻寬需求大幅降低

第二層:權重 + 啟用聯合量化(Weight-Activation Quantization)

  • 權重和啟用值都量化到 INT8(W8A8)或更低
  • 代表:SmoothQuant、LLM.int8()(混合精度方案)
  • 優勢:可以利用硬體 INT8 Tensor Core 真正加速計算
  • 劣勢:啟用值中的離群值(outlier)是主要難點

第三層:極低位元量化(Sub-4-bit)

  • 3-bit、2-bit 甚至 1.5-bit 量化
  • 代表:AQLM、QuIP#、HQQ 等
  • 需要更復雜的量化方案(如向量量化、碼本學習)來維持可接受的精度

核心技術挑戰

1. 離群值問題(Outlier Features)

Tim Dettmers 等人在 LLM.int8() 論文中發現,LLM 的啟用值中存在幅度極大的離群特徵,這些離群特徵的幅度遠超普通特徵,可達數十倍差異,且集中在少數固定通道中 [Dettmers et al., 2022, “LLM.int8(): 8-bit Matrix Multiplication for Transformers at Scale”]。這一發現深刻影響了後續 PTQ 方法的設計方向。

2. 逐層誤差累積

LLM 有數十到上百層 Transformer block,每層的量化誤差會逐層累積放大。因此先進方法(如 GPTQ)採用逐層最佳化策略,在量化當前層時考慮補償效應。

3. 校準資料敏感性

PTQ 的精度高度依賴校準資料的質量和數量。校準資料需要能代表模型的實際使用分佈,數量通常在 128—512 條樣本即可 [行業共識,但最優數量因模型和方法而異]。


技術原理

基礎量化公式

**均勻量化(Uniform Quantization)**的基本對映:

量化值:    q = round(x / s) + z
反量化:    x_hat = s * (q - z)

其中:
  s = (x_max - x_min) / (2^b - 1)    # scale(縮放因子)
  z = round(-x_min / s)                # zero-point(零點,僅非對稱量化)
  b = 目標位元數

對稱量化 vs 非對稱量化

對稱量化(Symmetric):
  z = 0
  s = max(|x|) / (2^(b-1) - 1)
  對映範圍:[-2^(b-1), 2^(b-1)-1] 的整數
  適合:權重(通常近似零均值分佈)

非對稱量化(Asymmetric):
  z ≠ 0
  利用完整整數範圍 [0, 2^b - 1]
  適合:啟用值(常常非零均值,如 ReLU 後的正值分佈)

量化粒度(Granularity)

量化粒度對精度和開銷的影響(示意):

粒度             | scale/zp 數量    | 精度    | 儲存開銷(scale/zp)
─────────────────┼──────────────────┼─────────┼───────────────────
Per-Tensor       | 1 個/整個張量     | 最低    | 極小
Per-Channel      | 1 個/輸出通道     | 中等    | 小
Per-Group        | 1 個/g 個元素     | 較高    | 可控(g=64/128常見)
Per-Element      | 每個元素一個      | 最高    | 與原值相當(無意義)

GPTQ/AWQ 常用:Per-Group,group_size=128
→ 每 128 個權重共享一組 scale + zero-point
→ 權重 4-bit + scale(FP16) ≈ 4.25 bit 有效位寬

主要 PTQ 方法的核心機制

1. GPTQ(Frantar et al., 2022)

核心思想:基於二階資訊的逐層最優量化

輸入:訓練好的模型 W,校準資料 X_cal
對每一層 l:
  ① 收集校準輸入 X_cal 的隱層輸出
  ② 計算 Hessian 矩陣 H = 2 * X_cal^T * X_cal(近似二階資訊)
  ③ 按行(逐輸出通道)量化:
     - 選擇當前要量化的權重行
     - 用 H 的逆矩陣計算最優量化誤差補償
     - 將補償誤差分配到尚未量化的權重行
  ④ 批次更新(lazy batch)提高效率

關鍵特性:
- 需要 GPU 記憶體約等於單層模型大小(可以逐層處理)
- 校準過程對 175B 級模型可在數小時內完成 [原論文報告]
- 4-bit + group_size=128 配置下精度損失通常較小

2. AWQ(Lin et al., MIT Han Lab, 2023)

核心思想:保護"顯著權重"(salient weights)

關鍵觀察:
  僅約 1% 的權重對模型輸出有決定性貢獻
  這些權重可以通過啟用幅度間接識別

方法:
  ① 用校準資料前向傳播,統計每通道的啟用幅度 |X|
  ② 計算 per-channel 縮放因子 s,使得顯著權重通道被放大
  ③ 量化前對權重施加縮放:W' = W * diag(s)
  ④ 對 W' 執行標準量化(RTN 即可,無需二階資訊)
  ⑤ 推論時反向補償:Y = X * diag(s)^(-1) * quant(W')

優勢:
- 計算簡單(不需要 Hessian 逆)
- 與權重專用硬體加速器相容性好
- 在 W4A16 場景下精度表現優異

3. SmoothQuant(Xiao et al., MIT Han Lab, 2022)

核心思想:將啟用值中的量化難度"遷移"到權重上

關鍵數學變換(per-channel):
  Y = X * W
    = (X * diag(s)^(-1)) * (diag(s) * W)
    = X_hat * W_hat

  其中 s_j = max(|X_j|)^α / max(|W_j|)^(1-α)
  α ∈ [0,1] 控制遷移程度(α=0.5 是常見預設值)

效果:
  X_hat 的離群值幅度被壓縮(更容易量化)
  W_hat 的幅度範圍擴大(但權重分佈本身更平滑,仍可量化)
  → 實現 W8A8 聯合量化,兩者都用 INT8

意義:
  這是少數能真正實現"計算加速"(而非僅節省視訊記憶體)的 PTQ 方法
  因為 INT8 Tensor Core 在現代 GPU 上確實比 FP16 更快

4. LLM.int8()(Dettmers et al., 2022)

核心思想:混合精度分解

方法:
  ① 識別啟用值中的離群特徵通道(magnitude > 閾值)
  ② 離群通道(通常 < 0.1% 的維度)→ FP16 計算
  ③ 非離群通道 → INT8 計算
  ④ 合併兩部分結果

意義:
  首次系統揭示 LLM 啟用值的離群特徵現象
  為後續 SmoothQuant 等方法提供了關鍵洞察

PTQ 方法對比示意(精度-速度-複雜度三維)

精度保持 ↑

    │  SmoothQuant(W8A8)  GPTQ(4bit)  AWQ(4bit)
    │         ○              ○           ○

    │              GPTQ(3bit)  LLM.int8()
    │                 ○           ○

    │     RTN(4bit)            AQLM(2bit)
    │        ○                     ○

    └──────────────────────────────────────→ 計算加速程度
                                              (weight-only 只省頻寬,
                                               W8A8 真正省算力)

技術演進史

時期里程碑關鍵意義
2016—2017Google 提出量化推論架構(gemmlowp),XNOR-Net 等二值化網路研究學術界開始系統研究神經網路量化
2018NVIDIA Turing 架構引入 INT8 Tensor Core硬體層面為 INT8 推論提供原生加速支援
2019—2020TensorRT 引入 PTQ 工作流;Qualcomm/QNN 支援 INT8 NPU 推論PTQ 在 CV 模型上走向工程化
2022 Q2LLM.int8() 釋出 [Dettmers et al.]揭示 LLM 啟用離群特徵,開啟 LLM 專用 PTQ 研究熱潮
2022 Q3GPTQ 釋出 [Frantar et al.]首次實現百B級模型的高效 3/4-bit PTQ
2022 Q4SmoothQuant 釋出 [Xiao et al., MIT Han Lab]解決 W8A8 聯合量化的啟用離群值難題
2023 Q1AWQ 釋出 [Lin et al., MIT Han Lab]簡化且高效的 W4 方案,工程友好度高
2023 Q2bitsandbytes NF4 引入 Hugging Face 生態;GGUF 格式隨 llama.cpp 普及PTQ 進入主流開發者工具鏈
2023 Q3—Q4NVIDIA Hopper FP8(E4M3/E5M2)生態落地;AQLM、QuIP# 提出 sub-4-bit 方案硬體原生低精度格式 + 極致壓縮探索
2024AWQ/GPTQ 整合進 vLLM、TensorRT-LLM 等主流推論架構;FP8 推論逐步實用化PTQ 從研究走向生產級部署基礎設施

技術路線對比

維度RTN(Round-to-Nearest)GPTQAWQSmoothQuantLLM.int8()AQLM
型別權重量化權重量化權重量化權重+啟用混合精度向量量化
典型 bit 寬4/83/44W8A8混合(INT8+FP16)2
核心機制最近鄰取整Hessian 逐層最優啟用感知縮放難度遷移離群值分離學習碼本
校準資料量不需要/極少量~128—256 樣本~128 樣本~512 樣本~128 樣本需較多
校準耗時極快中等(數小時@大型模型)較快較快較快較長
精度(4-bit)較差良好良好~優秀N/A(主攻 8-bit)N/A可接受(2-bit)
推論架構支援廣泛AutoGPTQ, TRT-LLM, vLLMAutoAWQ, TRT-LLM, vLLMTRT-LLM, 各推論架構bitsandbytes社群支援
是否省計算否(weight-only)否(weight-only)否(weight-only)(INT8 TC)部分否(需解碼)
適用場景快速原型/基線生產級 4-bit 部署生產級 4-bit 部署需真正計算加速時FP16 視訊記憶體不足時極致壓縮

:精度表現因模型架構、校準資料、評測任務不同而差異顯著,上表為行業一般認知的定性判斷,非嚴格 benchmark 結論。


上下游

上游:PTQ 方法的”輸入端”

┌─────────────────────────────────────────────────┐
│                 上游依賴                          │
├─────────────────────────────────────────────────┤
│ ① 訓練好的全精度模型(FP16/BF16/FP32)            │
│    → 來源:OpenAI, Meta, Mistral, Google 等       │
│    → 開源權重(Hugging Face)直接可用               │
│                                                  │
│ ② 校準資料集                                      │
│    → 通常取自訓練集的一個小子集                     │
│    → 或用 WikiText、C4 等通用語料                  │
│                                                  │
│ ③ 量化演算法架構                                     │
│    → GPTQ (AutoGPTQ)                             │
│    → AWQ (AutoAWQ / llm-awq)                     │
│    → bitsandbytes (Tim Dettmers 維護)             │
│    → TensorRT-LLM (NVIDIA)                       │
│    → llama.cpp (GGUF 格式支援多種量化)             │
│                                                  │
│ ④ 算力基礎設施                                     │
│    → 校準階段:單卡 GPU 即可(A100/H100 最優)      │
│    → 推論階段:GPU / NPU / CPU 均可               │
└─────────────────────────────────────────────────┘

下游:PTQ 的”去向”

┌─────────────────────────────────────────────────┐
│                 下游應用                          │
├─────────────────────────────────────────────────┤
│ ① 雲端端推論服務                                     │
│    → vLLM + AWQ/GPTQ → 高吞吐 LLM serving        │
│    → 降低每 token 推論成本(視訊記憶體↓ → 批大小↑)       │
│                                                  │
│ ② 邊緣/終端裝置                                    │
│    → 手機(高通/聯發科 NPU, INT8/INT4)            │
│    → 筆記本/桌上型電腦(CPU 推論, llama.cpp + GGUF)   │
│    → 嵌入式/機器人                                 │
│                                                  │
│ ③ 消費級 GPU 部署                                  │
│    → 70B 模型 4-bit 量化後約需 35 GB 視訊記憶體,單張 RTX 4090(24 GB)無法執行,需使用 48 GB 專業顯示卡(如 RTX A6000)或支援視訊記憶體池化的專業多卡方案(如通過 NVLink 互聯);消費級多卡方案(如 RTX 4090×2)缺乏 NVLink,僅靠 PCIe 進行模型並行頻寬低且額外視訊記憶體開銷大,實際難以可靠執行 35 GB 級模型│
│                                                  │
│ ④ 多模態模型壓縮                                   │
│    → Vision-Language 模型的權重壓縮                │
│    → Diffusion 模型加速(如 SDXL INT8)            │
└─────────────────────────────────────────────────┘

關鍵指標

PTQ 模型質量評估指標

指標含義說明
WikiText-2 Perplexity困惑度LLM 量化後最常用的質量指標,越低越好
下游任務精度MMLU、HumanEval、GSM8K 等評估量化對不同能力維度的影響
Human Eval / 對話質量主觀評估量化模型在實際對話中的表現
Perplexity DegradationPPL 退化幅度通常要求 < 0.5(8-bit)或 < 1.0(4-bit)為可接受

PTQ 工程效率指標

指標含義典型量級
校準耗時完成量化所需時間70B 模型 4-bit PTQ:數十分鐘到數小時(因方法而異)[估算]
校準記憶體峰值校準過程 GPU 視訊記憶體需求GPTQ 可逐層處理,峰值約等於單層大小 [行業共識]
有效位寬權重 + scale/zp 的平均位寬4-bit + group=128 ≈ 4.06—4.25 bit(取決於實現)
推論吞吐提升吞吐量變化weight-only(省頻寬)vs W8A8(省計算),效果差異大,見下文
記憶體節省比例FP16 基線對比4-bit ≈ 4× 壓縮(含 scale 開銷後約 3.5×)[估算]

關鍵區分:Weight-Only ≠ 計算加速

Weight-Only 量化(GPTQ/AWQ/W4A16):
  - 權重儲存為 4-bit → 推論時需反量化到 FP16 再做 matmul
  - 節省的是:視訊記憶體佔用、權重載入頻寬(Memory-bound 場景有幫助)
  - 不節省的是:浮點運算次數(Compute-bound 場景無明顯加速)
  - 適用場景:batch_size=1 的互動式推論(Memory-bound)

W8A8 量化(SmoothQuant 等):
  - 權重和啟用都是 INT8 → 直接用 INT8 Tensor Core 計算
  - 理論計算吞吐:INT8 TC 是 FP16 TC 的 ~2×(在支援 INT8 TC 的硬體上)
  - 適用場景:高吞吐服務(Compute-bound)

實際加速取決於:
  ① 硬體是否原生支援對應精度(INT8 TC / FP8 TC / INT4 支援)
  ② 當前 workload 是 memory-bound 還是 compute-bound
  ③ 運算元實現質量(kernel 調優程度)

供需與市場資料

需求側驅動力

                    推論成本 = f(模型大小, 硬體規格, 吞吐量)

PTQ 的經濟價值:

場景 A(雲端端推論):
  FP16 70B → 需要 2×A100-80GB → $3—4/hr [估算,雲端例項成本]
  4-bit 70B → 需要 1×A100-80GB → $1.5—2/hr [估算]
  → 單次推論成本下降約 40—60% [行業普遍認知]

場景 B(邊緣部署):
  FP16 7B → 14GB 記憶體 → 無法在手機執行
  4-bit 7B → ~4GB 記憶體 → 可在高階手機執行
  → 使能全新應用場景

供給側生態

角色代表公司/專案產品/方案
量化演算法MIT Han Lab、IST Austria(GPTQ 原作者)、Tim DettmersAWQ、SmoothQuant、GPTQ、bitsandbytes
推論架構NVIDIA、vLLM 社群、llama.cpp 社群TensorRT-LLM、vLLM、llama.cpp
硬體晶片NVIDIA、Qualcomm、MediaTek、Apple含 INT8/FP8 TC 的 GPU;含 INT8/INT4 NPU 的移動 SoC
模型平台Hugging Face原生整合 bitsandbytes、GPTQ、AWQ 的模型載入
雲端服務商AWS、Azure、GCP提供量化模型最佳化的推論端點

市場資料說明

  • LLM 推論市場規模在快速增長,PTQ 作為推論最佳化的關鍵環節,其價值隨推論需求增長而增長。具體市場規模數字因統計口徑不同而差異較大,不做具體數字聲稱,建議參考 Gartner / IDC 最新報告。
  • 定性判斷:PTQ 已成為大型模型部署的標準配置而非可選項,幾乎所有生產級 LLM 推論都使用某種形式的量化。

代表公司與資本對映

直接關聯

公司/專案與 PTQ 的關係資本化路徑
NVIDIATensorRT-LLM 內建 PTQ 支援;Hopper FP8/Ada FP8 硬體原生低精度;PTQ 降低推論成本→擴大 GPU 市場NVDA(GPU + 推論軟體棧)
QualcommHexagon NPU 支援 INT8/INT4 推論;PTQ 使 LLM 可在手機 SoC 執行QCOM(移動/邊緣 AI 晶片)
MediaTekAPU 支援 INT8 量化推論;天璣系列手機 SoC 的端側 AI2454.TW(聯發科)
AppleNeural Engine 支援 INT8;Core ML 支援 PTQAAPL(端側 AI 生態)
AMDROCm 生態量化支援;Instinct 系列推論能力AMD(GPU + 推論)

間接/生態層

專案/公司關係
Hugging Face量化模型分發平台;transformers 庫原生整合多種 PTQ 方法
vLLM (UC Berkeley)開源 LLM 推論引擎,整合 AWQ/GPTQ
llama.cpp (Georgi Gerganov)CPU/消費級 GPU 推論方案,GGUF 量化格式成為消費級標準
Tim Dettmers(學術)bitsandbytes 作者,8-bit/4-bit NF4 方案廣泛使用
MIT Han Lab (Song Han)AWQ、SmoothQuant、Elastic 等多個量化/壓縮工作的發源地

投資啟示

PTQ 本身不是一個"獨立市場",而是嵌入在推論基礎設施中的技術層。

  誰受益?
  ├── 硬體側:PTQ 降低硬體門檻 → 擴大可服務市場(尤其邊緣/消費級)
  │   → Qualcomm, MediaTek, Apple(端側推論);NVIDIA(雲端端推論效率提升→更多推論需求)

  ├── 推論服務側:PTQ 降低單次推論成本 → 擴大應用
  │   → 雲端服務商(AWS Bedrock, Azure AI 等)

  └── 模型側:PTQ 使開源模型可廣泛部署 → 增強開源生態價值
      → Meta (LLaMA), Mistral, 聚合平台 (Hugging Face)

投資邏輯

核心投資命題

命題 1:推論成本下降 → AI 應用滲透率提升 → 整體市場擴大

PTQ 是推論成本下降的多個槓桿之一(其他包括:硬體代際升級、推論架構最佳化、推測解碼、MoE 架構等),但它是唯一不需要改變模型架構、不需要重新訓練、門檻最低的方案

命題 2:PTQ 使能”邊緣 AI”敘事

4-bit 量化是端側 LLM 的必要前提。沒有 PTQ,手機/筆記本無法執行有意義規模的語言模型。隨著端側 AI 成為各硬體廠商的核心戰略(Apple Intelligence、Qualcomm AI Hub 等),PTQ 的價值持續上升。

命題 3:開源模型 + PTQ → 民主化部署

PTQ 讓中小團隊和獨立開發者也能部署大型模型,強化了開源生態 vs 閉源 API 的競爭格局。

風險與約束

  • 精度上限約束:PTQ 有理論精度下限,超低位元(< 3-bit)的質量損失可能不可接受,這限制了壓縮率的進一步提升
  • FP8/FP4 硬體替代:隨著原生 FP8(Hopper)和未來 FP4 硬體的普及,某些 PTQ 場景可能被硬體原生低精度格式替代,但 PTQ 方法論(如校準、離群值處理)仍然適用
  • QAT 競爭:部分場景下,QAT 或混合方案(如 LoRA + 量化微調)可能優於純 PTQ

常見誤讀糾偏

誤讀 1:“4-bit 量化後推論速度翻倍”

糾偏:4-bit 量化的核心收益是記憶體節省(約 4× 壓縮),而非計算加速。Weight-only PTQ(GPTQ/AWQ)在推論時需要將 4-bit 權重反量化為 FP16 後再做矩陣乘法,浮點運算次數不變。只有在 memory-bound 場景(如 batch_size=1 的自迴歸解碼)中,減少權重載入頻寬才能間接提速。而在 compute-bound 場景(大 batch 服務),提速主要靠 W8A8 或 FP8 等真正降低計算精度的方案。

誤讀 2:“PTQ 精度損失可以忽略不計”

糾偏:8-bit 量化確實通常精度損失極小(PPL 退化通常 < 0.5),但 4-bit 量化在某些任務上可能存在可感知的退化,尤其是推論密集型任務(如 GSM8K 數學推論)或長上下文任務。精度損失程度高度依賴於具體模型、量化方法和評估任務。應當針對目標場景做實測驗證,而非泛泛聲稱”無損”。

誤讀 3:“GPTQ 總是比 AWQ 好(或反之)”

糾偏:兩者在多數基準測試上表現接近,各有適用場景。AWQ 在工程實現上更簡潔,與 TensorRT-LLM 的整合更成熟;GPTQ 在某些模型架構上可能表現更好。實際選型應基於目標模型 + 目標硬體 + 推論架構的實測,而非一概而論。

誤讀 4:“量化只是壓縮,對模型能力沒有系統性影響”

糾偏:量化本質上是一種有損近似,不同能力維度受量化的影響不同。一般而言,知識密集型任務(如事實性問答)比模式識別任務(如情感分類)更耐量化;而複雜推論鏈精確數值計算對量化更敏感。不能籠統地說”量化模型和原模型一樣好”。

誤讀 5:“PTQ 不需要任何計算資源”

糾偏:雖然 PTQ 遠輕於全量訓練或 QAT,但對大型模型(100B+)執行 GPTQ 校準仍需要數十 GB 視訊記憶體和數小時計算時間。零樣本 PTQ(如 bitsandbytes 的 load_in_4bit)雖幾乎不需要校準,但精度通常不如有校準資料的方案。


學習路徑

入門(1—2 天)

  1. 理解數值精度基礎:FP32/FP16/BF16/INT8/INT4 的表示範圍和精度差異
  2. 手寫一個簡單的 Per-Tensor 對稱量化函式(Python,無需 GPU)
  3. 閱讀:Hugging Face 文件 — Quantization

進階(1—2 周)

  1. 閱讀 GPTQ 原論文:Frantar et al., “GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers”,理解逐層量化和 Hessian 補償機制
  2. 閱讀 AWQ 原論文:Lin et al., “AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration”,理解顯著權重保護思想
  3. 使用 AutoGPTQ 或 AutoAWQ 對常見 LLM 執行量化,對比 PPL 和下游任務精度
  4. 理解 Group Quantization 的有效位寬計算:考慮 scale 和 zero-point 的開銷

深入(1—2 月)

  1. 閱讀 SmoothQuant 原論文:理解離群值遷移的數學原理與實現細節
  2. 閱讀 LLM.int8() 原論文:理解混合精度分解與離群特徵識別
  3. 研究 vLLM 或 TensorRT-LLM 的量化模型部署:關注 kernel 調優、記憶體管理和 batch 排程策略
  4. 嘗試量化調優:調整校準資料集、量化粒度、位元分配策略等,觀察精度變化

前沿方向(持續關注)

  • Sub-4-bit 方法的精度邊界:AQLM、QuIP# 等能否突破 2-bit 實用化閾值?
  • FP8 推論生態演進:Hopper FP8(E4M3/E5M2)與 PTQ INT8/INT4 的競爭與互補
  • 量化與稀疏化的組合壓縮
  • 量化模型的長上下文能力保持
  • 量化對多模態模型(特別是 Diffusion 和 LLM-based Vision)的影響
source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型