Quantization
3 秒看懂
- Quantization(量化) 是把神經網路中高精度的浮點引數和啟用值(如 32 位浮點 FP32)對映到低位寬的整數或定點表示(如 INT8、INT4)的技術。
- 目的是大幅壓縮模型體積、減少記憶體佔用、提升推論速度,同時儘量保持模型準確度不降。
- 已成為大型模型輕量化部署、端側 AI 和雲端端降本增效的核心手段,幾乎所有主流推論架構和 AI 晶片均提供硬體加速支援。
3 分鐘產業解釋
量化可類比為“給模型做有失真壓縮”:用更小的資料容器去近似原來的數值,儲存下來的不再是 32 位的精確浮點數,而是 8 位甚至 4 位的整數索引。因為神經網路的引數和特徵圖數值通常集中在一定範圍內,且對微小擾動具備一定魯棒性,所以這種壓縮造成的精度損失往往可控。
在產業實踐中,量化路線分為兩大類:
-
訓練後量化(Post‑Training Quantization, PTQ) 不修改訓練流程,直接對預訓練好的 FP32 模型進行校準和量綱轉換,快速得到 INT8/INT4 模型。代價是可能損失少量精度,特別是對於小模型或低位元量化。
-
量化感知訓練(Quantization‑Aware Training, QAT) 在訓練或微調時模擬量化誤差,讓模型學會適應低位寬表示。精度保留效果更好,但需要重新訓練或微調,計算成本更高。
產業界的需求驅動來自兩端:雲端端大型模型推論成本急劇上升,需要 INT8/FP8/INT4 降低單次推論的算力與視訊記憶體開銷;終端側(手機、汽車、IoT)算力與功耗嚴格受限,量化幾乎是模型落地的必選項。支援的精度等級已從傳統的 FP32→FP16/INT8 演進到 FP8(如 Nvidia H100 的 Transformer Engine)、INT4,甚至正在探索 INT3/INT2 與 1 位元二值網路。
產業鏈上的玩家:AI 晶片公司(輝達、高通、Intel 等)在硬體上提供專門的低精度張量計算單元;架構側(TensorRT、ONNX Runtime、OpenVINO、PyTorch 生態)提供一鍵量化工具;同時湧現了一批以演算法創新驅動的量化方案公司或開源專案(例如圍繞 GPTQ、AWQ、bitsandbytes 等技術形成生態)。量化已經成為大型模型 Scaling Law 下降低推論 TCO 的必選項,是“軟體定義硬體效率”的關鍵槓桿。
15 分鐘專家深入
量化的本質是數值對映與反量化:
- 設定量綱範圍(例如對啟用值統計出最小值/最大值,或使用學習得到的 scale 和 zero point)。
- 將連續數值離散化到 N 個整數臺階,儲存整數值。
- 推論時(或部分場景訓練時)將整數值反量化回浮點數,與後續運算元的高精度資料互動。
但產業界的實踐遠比這個複雜。實際部署中,量化精度損失的來源包括:
- 權重與啟用的分佈不匹配:權重分佈通常接近高斯或拉普拉斯,而啟用值分佈隨輸入變化劇烈,離線校準可能無法覆蓋長尾分佈。
- 層間誤差傳播與累積:低位寬(特別是 4 位元以下)時,淺層的微小誤差在深層被逐步放大,造成最終精度坍塌。
- 混合精度與運算元分工:某些敏感層(如注意力 softmax、層歸一化)對精度要求高,通常保留更高精度或單獨量化方案;而大型矩陣乘法則可以承受激進量化。因此工業界主流方案是“混合精度量化”:自動或手動地為不同層分配不同 bit-width。
進一步,近年來的關鍵進展在於 大語言模型(LLM)的權重量化,典型方案如:
- GPTQ:基於 Hessian 資訊逐層最佳化量化權重,在單 GPU 上將 175B 級別模型壓縮到 4‑bit 權重,推論時記憶體大幅減少。
- AWQ:通過分析“重要通道”的保護機制,在 INT4 甚至 INT4/INT8 混合配置下實現接近無損的 7B/13B 模型部署。
- bitsandbytes 的 4‑bit NormalFloat:採用非均勻量化的資訊論最優分佈,使得 4 位元載入 + 16 位元計算成為主流實踐,直接驅動了 HuggingFace 生態的 LLM 消費級部署。
在硬體支援層面,現代 AI 晶片的 Tensor Core / 神經處理單元 內部通常支援 INT8,甚至 INT4/FP8 的融合乘加,使得量化後的實際推論吞吐可達數倍於同代 FP16。例如,在 Nvidia H100 上,FP8 Tensor Core 的峰值算力是 FP16 的 2 倍,能夠直接加速 Transformer 模型。這類硬體與軟體演算法的協同進化,正在將量化推向 4‑bit 推論常態化和 2‑bit 探索階段。
需要注意,量化與稀疏化的結合(權重剪枝後進一步量化)以及條件計算(MoE 中只啟用部分專家,啟用引數遠小於總引數量後再量化)正在共同塑造“極致高效推論”的技術棧。
技術原理
量化計算的完整過程可抽象為:
-
統計引數的範圍或直接設定 scale/zero point。
對於對稱量化:quantized_value = round(clip(fp_value / scale, -128, 127))
對於非對稱量化,額外引入零點:quantized_value = round(fp_value / scale + zero_point) -
推論時的混合精度序列(典型路徑):
- 輸入的 INT8 啟用與 INT8 權重進行矩陣乘累加,結果存為 INT32(避免溢位)。
- 累加結果經過 Requantize(再次縮放)轉為 INT8,傳遞給下一層。
- 對高敏感運算元,如 LayerNorm、Softmax,仍以 FP16/FP32 執行,邊界處由量化/反量化節點連線。
下面是簡化的量化計算圖(以對稱 INT8 卷積為例):
FP32 權重 ──(calibration)──→ INT8 權重
FP32 輸入啟用 ──(calibration)──→ INT8 啟用
↓
INT8 矩陣乘累加 (INT32 累加)
↓
Requantize (縮放+截斷)
↓
輸出 INT8 啟用 → 下一層
(或用反量化轉 FP16 供 softmax 等)
量化面臨的關鍵取捨及引數:
-
Scale 粒度:
- Per‑tensor:整個張量共用一個 scale,開銷低但精度損失大。
- Per‑channel:每個輸出通道獨享 scale,對大型模型權重量化提升明顯。
- Per‑group(如 128 個元素一組):更細粒度,常用於 4‑bit 權重量化,需要額外儲存 scale 和 zero。
-
對稱 vs 非對稱:
對稱量化零點固定為 0,運算更簡單,硬體友好;非對稱可更好利用數值區間,但計算時需處理零點偏移,在部分 INT8 推論引擎中有開銷。 -
動態量化:啟用值在執行時統計最值並即時量化,無需離線校準,記憶體佔用和延遲均有一定代價,常用於 NLP 模型中。
-
模擬量化的 Straight‑Through Estimator (STE):QAT 時,前向通過量化函式,反向傳播時假設其梯度為 1(或 clip 內為 1,外為 0),讓模型能“穿透”不可微的量化步驟進行學習。
技術演進史
- 2010 年代前期:深度學習全精度為 FP32,CPU/GPU 均以浮點為主,量化僅限於訊號處理領域。
- 2017:TensorFlow Lite 等行動端架構推動 INT8 定量計算,Google 提出 Quantization Aware Training 並開源工具,同期輝達 TensorRT 加入 INT8 支援。
- 2018‑2019:混合精度訓練(FP16 + FP32 主副本)通過論文《Mixed Precision Training》和 Apex 等工具普及,訓練側開始接納半精度;推論側 INT8 成為標配。高通、Apple、華為等 SoC 中 NPU 均硬體加速 INT8。
- 2020‑2021:學術界開始探索 4‑bit 量化(如 LSQ、QAT4),PyTorch 生態推出 FX 量化工具鏈,ONNX Runtime 支援成熟的量化工作流。
- 2022‑2023:大型模型爆發,GPTQ(2022 末)和 AWQ(2023)等專為大語言模型設計的 4‑bit 權重量化方法問世,大幅降低多卡部署門檻。bitsandbytes 的 4‑bit 量化 + PEFT(引數高效微調)組合成為社群標準。
- 2024‑2025:Nvidia Blackwell 等新一代 GPU 推動 FP4 推論,硬體首次官方支援 4 位元浮點。量化進入“推論常態 4 位元,訓練低精度探索”階段,MoE 量化、量化+稀疏、KV‑Cache 量化等新方向活躍,量化方法與模型結構深度耦合。
技術路線對比
| 維度 | PTQ (訓練後量化) | QAT (量化感知訓練) | 權重量化 (Weight‑only) |
|---|---|---|---|
| 是否需要重訓 | 否 | 需要微調/訓練 | 否 (大多) |
| 精度損失 | 中~高(尤其 INT4/小模型) | 低~中 | 啟用仍高精度,精度損失可控 |
| 代表應用 | 快速壓縮已訓模型,端側推論 | 高精度要求場景,如視覺檢測 | LLM 部署,視訊記憶體壓縮(GPTQ/AWQ) |
| 計算加速 | 矩陣乘在低精度加速,整體加速顯著 | 同等加速 | 權重低精度節省視訊記憶體頻寬,但啟用仍高精度,加速主要來自降低視訊記憶體佔用和批處理變大 |
| 硬體依賴 | 須支援 INT8/INT4 計算單元 | 同 PTQ | 要求硬體能接收低精權重,但計算用高精度(如 FP16),通用性好 |
| 典型位元寬度 | INT8, INT4 | INT8, INT4 | INT4, INT8, 混合 FP16 |
注:傳統對稱量化 vs 非對稱量化的選擇通常嵌入在上述路線中,而非獨立路線。另外,除上述外還出現了僅啟用量化(保持權重高精度)和 FP8 訓練量化等新興範式。
上下游
上游:模型生產與訓練
- 訓練架構(PyTorch、JAX、TensorFlow)提供 QAT 模擬與高階 API。
- 預訓練模型廠商(Meta、Google、OpenAI 等)在釋出模型時可同步提供量化版本或校準所需資料,影響下游量化方案的選擇。
中游:量化工具鏈與編譯器
- 推論最佳化架構:NVIDIA TensorRT、Intel OpenVINO、ONNX Runtime、TFLite、Qualcomm SNPE、Apple Core ML 等,封裝了面向各自硬體的 PTQ/QAT 工具。
- 專用量化庫:bitsandbytes(CUDA 4‑bit 權重)、llama.cpp 的 GGUF(整數權重量化)、AutoGPTQ、AWQ 等。
- 模型格式與編譯層:MLIR、IREE 等編譯器在 IR 層插入量化/反量化節點,支援混合精度圖最佳化。
下游:硬體與部署場景
- 雲端端推論卡:資料中心 GPU(NVIDIA H100/B200 等)和 AI 加速器(Google TPU、AWS Inferentia),硬體 Tensor Core 支援 INT8/FP8;Blackwell 架構(B200 等)進一步引入原生 FP4/INT4 張量核。
- 邊緣與端側 SoC:手機 AP(驍龍、天機、A/M 系列)、汽車智駕晶片、IoT MCU/專用 NPU,大多兼用 INT8 加速。
- FPGA/ASIC 定製推論:如 Lattice、Xilinx 常用於超低延遲影片分析的 INT8 網路。
整條產業鏈以“訓練一次,量化多處部署”模式執行,量化成為模型從“研發”流向“生產”的標準工藝節點。
關鍵指標
衡量量化效果的主要指標包括:
- 模型準度:通常以全精度模型為基線,衡量量化後 Top‑1 準確率、困惑度(perplexity)或下游任務分數的下降幅度。理想情況是<0.5%損失。
- 壓縮比與速度比:模型體積壓縮比(如 FP32→INT8 理論 4×),實測推論速度加速比(受頻寬、計算利用率和運算元融合影響,並非總是線性提升)。
- 校準資料量:PTQ 需要的校準樣本數量,直接影響部署效率和魯棒性。
- Scale 與 zero point 儲存開銷:對於細粒度量化(如 group‑128 的 4‑bit 量化),額外後設資料可能佔用 ~0.5 bit/元素,需納入壓縮率計算。
- 推論記憶體峰值:量化可顯著降低權重的視訊記憶體佔用,但對啟用記憶體的回收依賴執行時記憶體管理,對大型模型影響巨大。
示例指標範圍(通用經驗,非特定產品):
- 視覺模型 ResNet‑50 在 INT8 量化後,Top‑1 準確率下降 <1%,吞吐提升 2‑4 倍(在最佳化硬體上)。
- LLM 7B 模型經 4‑bit 權重量化,推論視訊記憶體從 ~14 GB(FP16)降至 ~4‑5 GB,可在消費級 GPU 執行。
供需與市場資料
根據多家機構預測,AI 推論市場正在經歷從訓練成本主導向推論成本主導的轉換,推論算力需求年複合增長率超過 40%。在推論 TCO (總擁有成本)中,模型體積壓縮和加速技術是最直接的最佳化槓桿,量化在其中佔據核心地位。
- 端側 AI 推論:預計未來兩年內,出貨的智慧手機與 PC 中超過 50% 將具備本地執行 10 億+引數模型的能力,關鍵使能技術即 INT4/INT8 量化。(來源:綜合行業白皮書估算,非單一廠商揭露)
- 雲端端大型模型 API 服務:經過量化的模型可將每次推論的算力成本降低 30‑60%,這對於單次推論成本以美分計的超大規模 API 而言是巨大節約。([行業估算])
- 量化工具生態:Hugging Face 上超過 50% 的 Llama 系模型衍生版本採用 4‑bit 或 8‑bit 量化格式上傳,顯示社群對量化的強需求。([可觀測開源社群資料])
需求端,雲端服務商、企業私有化部署的模型越來越多地“預設”提供 INT8/FP8 量化版本;供給端,硬體廠商將低精度支援作為晶片競爭力的核心賣點,推動更低位寬(如 FP4)標準化。
代表公司與資本對映
- 輝達 (NVIDIA):其 TensorRT 和最新 Transformer Engine(FP8)是量化推論標杆;GPU 架構內建 INT8/FP8/FP4 張量核;CUDA 生態中的 bitsandbytes 等庫強化了其硬體對社群量化方案的支援。
- 高通 (Qualcomm):行動端 AI Engine 對 INT8 加速成熟,提供 AIMET 量化工具集,與智慧座艙和手機晶片繫結。
- Apple (Apple):Core ML 架構支援 INT8/FP16 量化,神經引擎硬體配合 M 系列晶片提供低功耗高效能。
- 英特爾 (Intel):OpenVINO 支援 INT8/INT4/FP16 量化,Xeon 處理器內建 VNNI 指令集加速 INT8 推論。
- AMD:ROCm 生態逐步補全對 INT8/INT4 的支援,尤其通過 MIGraphX 量化工具。
- 開源/初創生態:圍繞 GPTQ、AWQ 形成社群,一些初創公司(未上市)專注於自動混合精度與模型壓縮平台,直接服務於 MLOps 效率提升。
產業對映:大型模型推論效率提升直接影響雲端服務毛利率,因此推論最佳化工具鏈和硬體持續獲得產業投入。量化作為推論增效的核心技術,是 AI 基礎設施中的重要工程環節;具備自動量化、精度校準和部署監控能力的軟體公司更容易進入生產工作流。
產業觀察
- 推論降本需求明確:模型的規模化部署正在放大推論成本壓力。量化是常見的降本技術之一,但採用比例取決於模型結構、精度容忍度、硬體支援和上線風險控制。
- 硬體升級與量化深度繫結:每一代新 AI 晶片若沒有更好的低位寬支援將無法體現代際效能飛躍,這加強了晶片公司推動量化的商業動機,也使得量化生態硬體鎖定效應增強。
- 端側 AI 是增量爆發點:手機、PC、汽車等領域對功耗和記憶體敏感,量化能力直接決定模型的可用性,相關 IP 和工具提供商會受益。
- 風險:精度損失導致的商業事故:在金融、醫療等高風險場景,若過度量化導致模型出錯,可能引發業務風險,因此高可靠性部署仍需審慎選擇混合精度方案。
- 技術替代風險:非量化的壓縮技術(如蒸餾、剪枝、高效架構設計),或新計算範式(如模擬計算),可能會弱化量化的獨特價值。但短期看,量化仍是最具普適性的方法。
常見誤讀糾偏
-
“量化就是簡單地小數點右移”
現代神經網路量化遠不止整數化,涉及校準、混合精度、敏感層分析、融合圖最佳化等一系列工程。簡單的全域性截斷量化往往導致巨大精度下降,不可用於生產。 -
“量化後模型速度會提升 N 倍,其中 N = 原始位寬 / 量化位寬”
實際加速比受記憶體頻寬、計算瓶頸、運算元融合程度、量化/反量化開銷等多重因素影響,很少達到理論線形。尤其是 weight‑only 4‑bit 量化主要節省視訊記憶體,計算可能並未大幅提升吞吐,更大的意義在於可以用更少的卡執行更大的模型,或者提升單卡 batch 大小。 -
“QAT 總是比 PTQ 好”
如果校準資料充足且模型本身對噪聲魯棒,部分 PTQ 方案(尤其是針對 LLM 的 GPTQ、AWQ)精度損失可忽略,而 QAT 需要訓練資源,在無法獲取原始訓練資料的場合不可行。選擇取決於資源與精度要求。
學習路徑
- 基礎理論:理解整數量化與浮點格式(IEEE 754),學習線性量化原理(scale、zero point、對稱/非對稱)。
- 動手實驗:使用 PyTorch 的 FX 量化或 TensorFlow Lite Converter,對 MobileNet 或 BERT 模型進行 PTQ,觀察精度與速度變化。
- 深入理解:閱讀核心論文《Quantization and Training of Neural Networks for Efficient Integer-Arithmetic-Only Inference》《Learned Step Size Quantization (LSQ)》《GPTQ: Accurate Post‑Training Quantization for Generative Pre‑trained Transformers》《AWQ: Activation‑aware Weight Quantization》。
- 系統與硬體:學習 Nvidia TensorRT 量化文件、ONNX Runtime 量化工具鏈、以及 bitsandbytes 原始碼,瞭解 CUDA kernel 中如何高效執行 INT8/INT4 矩陣乘。
- 前沿追蹤:關注 2024‑2025 年的 MoE 量化、FP4 訓練/推論、量化與稀疏化的聯合設計等方向。
一句話總結
量化,是深度學習模型從實驗室走向規模化、即時化、低成本部署的必經壓縮工藝,也是當前 AI 效率革命中被硬體與演算法同時加速的核心槓桿。
延伸閱讀與來源
- 經典論文:B. Jacob et al., “Quantization and Training of Neural Networks for Efficient Integer-Arithmetic-Only Inference”, CVPR 2018.
- LLM 量化里程碑:E. Frantar et al., “GPTQ: Accurate Post‑Training Quantization for Generative Pre‑trained Transformers”, ICLR 2023.
J. Lin et al., “AWQ: Activation‑aware Weight Quantization for LLMs”, MLSys 2024. - 混合精度訓練:P. Micikevicius et al., “Mixed Precision Training”, ICLR 2018.
- 行業趨勢:輝達 GTC 技術部落格(Transformer Engine and FP8)、高通 AIMET 白皮書、Intel OpenVINO 量化技術文件。
(注:本頁未直接引用特定公司財報數字,具體產品效能引數請以各廠商最新發布為準。)