量化感知訓練
3 秒看懂
量化感知訓練(Quantization-Aware Training,QAT) 是在模型訓練過程中,直接模擬低精度(如 INT8)推論時的舍入誤差,讓模型提前學會補償這種資訊損失。這樣做出的低精度模型,在手機、汽車、物聯網晶片上跑起來時,精度下降遠小於事後直接壓縮的方案。它讓大型模型“瘦身”而不“掉智商”,是端側 AI 部署最核心的最佳化技術之一。
3 分鐘產業解釋
AI 模型從實驗室到裝進千千萬萬臺終端裝置,表面上是程式碼轉換,實質上是“精度的妥協”。訓練時用 FP32(32 位浮點)是為了算得準,推論時換成 INT8(8 位整數)是為了跑得快、省功耗、省儲存。如果訓練完再強行換成 INT8,好比把高精度工程圖紙直接縮印成郵票大小,很多細節就丟了。量化感知訓練的做法,是在訓練過程中就不斷告訴自己:“未來我會變成郵票大小,現在請按郵票的可辨識程度來畫。” 於是模型自己學會了在低精度條件下依然保持表達能力。
這背後不是單純演算法技巧,而是產業效率的痛點。雲端廠商在資料中心每處理一億次大型模型請求,若用 FP32 成本是一塊錢,INT8 可能降到兩毛錢;手機晶片的 NPU 如果能用 INT8 跑 Stable Diffusion 生成一張圖,功耗可能只有 FP16 的一半,發熱量也跟著大幅下降。因此,高通、聯發科、Apple、三星的系統級晶片(SoC)在 AI 引擎設計上都把 INT8 效能作為賣點,而 QAT 正是幫開發者榨乾這一賣點的訓練神器。
對投資視角而言,QAT 不產生直接營收,但它深刻影響AI 推論成本和終端 AI 產品體驗,是連線雲端—邊緣—終端整條效率鏈的黏合劑。是否具備成熟的 QAT 工具鏈,已成為判斷一家晶片公司 AI 生態是否“可用”的重要參考。
技術原理
QAT 的本質可以拆解成三個關鍵詞:量化模擬節點、偽量化操作、直通估計梯度。
1. 量化模擬節點
在正常的浮點訓練圖中,QAT 會在需要被量化的張量上插入“量化—反量化”節點對:
- 前向傳播:把這個張量從浮點數“碾”成低精度整數,再拉回浮點數,得到有量化誤差的值,用這個值繼續前向計算。
- 這一步模擬的是推論晶片的真實行為,包括截斷(clamp)、取整(round)、縮放(scale)和零點(zero-point)。
數學形式上:
q = round(x / scale + zero_point)
x_fake = (clamp(q, min, max) - zero_point) * scale
其中 scale 和 zero_point 可以是以張量為單位(per‑tensor),也可以是逐通道(per‑channel)。現代 QAT 為了讓量化誤差更小,普遍採用逐通道對稱量化,即每個輸出通道都有自己的縮放係數,零點強制為 0。
2. 量化引數如何確定
scale 和 zero_point 不再是訓練後校準產物,而是可以在訓練過程中學習或根據統計量即時計算。常見的策略包括:
- 可學習引數:將
scale設為可訓練變數,讓梯度最佳化它們。 - 滑動平均統計:在訓練時追蹤各張量的 min/max 或百分比範圍,動態計算
scale,類似 BatchNorm 的統計量累積。
3. 直通估計器
量化函式中的 round 操作是階梯型函式,梯度幾乎處處為零。QAT 通過直通估計器把這條梯度路徑直接“短路”:反向傳播時,假裝 round 函式不存在,把輸出端的梯度原樣傳遞給輸入端。這種近似雖然粗暴,卻出奇有效,已經過大量實踐驗證。
4. 插入位置
並非每一層都需要量化。常規 QAT 會重點量化:
- 卷積/全連線層的權重;
- 啟用值(ReLU、GELU 之後的輸出);
- 注意力機制中的查詢、鍵、值投影(Transformer 類);
- 有時也量化層歸一化的輸入/輸出,但需謹慎。
QAT 訓練完成後,這些已經“習慣量化噪聲”的浮點權重,只需最後做一次真正的量化格式轉換(無梯度),就能匯出為 INT8 甚至 INT4 模型。
關鍵引數
QAT 的效果高度依賴引數設定,以下 6 組引數直接影響落地表現。
-
量化位寬(Bitwidth) 8 位(INT8/UINT8)是當前產業主流。4 位(INT4)能在某些晶片上提供更高吞吐,但 QAT 難度顯著增大,通常需配合更復雜的非均勻量化或 NF4 等浮點型低精度格式。
-
量化粒度(Granularity)
- Per‑tensor:整個張量共享一個 scale/zero_point,硬體友好但容易掩蓋通道間分佈差異。
- Per‑channel:每個輸出通道獨立量化,精度損失更小,已成為卷積層權重量化的預設做法。部分 NPU 對 per‑channel 權重量化支援良好(如高通 AI Engine、Apple ANE)。
-
對稱/非對稱 對稱量化零點固定為 0,計算更少,適合權重;非對稱量化允許零點偏移,對啟用值(如 ReLU 輸出非負)更適合。多數實踐採用對稱權重+非對稱啟用的組合。
-
量化範圍型別
- Min‑max:直接取極值確定範圍,易受離群點影響。
- Percentile / MSE:去掉最極端的 0.1% 值再定範圍,或用最小化量化前後輸出的均方誤差來確定範圍,這在 GPTQ 等高階 PTQ 中常見,也可引入 QAT。
-
批歸一化融合 QAT 必須考慮推論時的運算元融合:訓練時,卷積+批歸一化被融合成一個等效權重,QAT 要在融合後的等效權重上插入偽量化節點,否則訓練與推論會失配,導致部署精度莫名下降。
-
校準資料與訓練時長 QAT 通常需要在 FP32 收斂模型的權重上微調若干 epoch。資料量和 epoch 數可通過消融實驗確定。對於大語言模型,全引數 QAT 成本過高,業界更多采用引數高效微調+部分層 QAT 的折中方案。
技術路線
量化技術並非只有 QAT 一條路,產業實踐中需要根據場景、模型大小、硬體特性靈活選型。
| 維度 | 量化感知訓練 (QAT) | 訓練後量化 (PTQ) | 混合精度訓練 + 量化推論 |
|---|---|---|---|
| 介入階段 | 訓練中 | 訓練完成後 | 訓練時用低精度,推論時再量化 |
| 精度損失 | 最低(極限低位寬下仍有優勢) | 8 位下可<1%,4 位下擴大 | FP16/BF16 訓練幾乎無損,但推論需再量化 |
| 訓練成本 | 最高(需完整重訓或大量微調) | 幾乎為零(僅需少量校準資料) | 中等(訓練加速,但需支援低精度硬體) |
| 硬體適配要求 | 需要模擬目標晶片量化行為 | 可在部署前校準硬體特性 | 依賴訓練 GPU 的 FP16/BF16 效能 |
| 典型適用場景 | 手機、車載、IoT 等資源嚴格受限裝置的關鍵模型 | 快速原型、雲端端推論、精度裕量大 | 大型模型訓練加速,後續再 PTQ/QAT |
技術融合趨勢:
- QAT + PTQ 流水線:先用 PTQ 快速得到基線,確定哪些層敏感,然後只對敏感層做 QAT,大幅降低開銷。
- 硬體感知 QAT (HAWQ 一類):把目標晶片的硬體指令集特性(如乘加單元的整數精度、運算元支援等)作為約束,直接最佳化 QAT 策略。
- 極低位元 QAT(2‑4 bit):結合非均勻量化、向量量化等方法,正在推動 LLM 在端側部署的極限。
上游
QAT 技術棧上游主要包括:
- 模型架構開發者:提供浮點精度預訓練模型的機構,如 Meta 的 Llama 系列、Google的 Gemma、Mistral 等。這些模型是 QAT 的“原材料”。以 2024 年釋出的 Llama 3 為例,公開資料顯示其 8B 版本 FP32 權重體積約 30 GB,是本輪端側量化最佳化的熱門基座。
- 訓練硬體:NVIDIA H100/H200/B200 等 GPU 叢集主導了 QAT 微調的計算供給。華為昇騰、AMD Instinct MI300X 等加速卡也在建置 QAT 軟體環境。2024 年全球 AI 訓練 GPU 出貨量超 200 萬片(來源:Jon Peddie Research 2024 年 Q4 報告),為 QAT 提供了充裕算力基礎。
- 深度學習架構:PyTorch (
torch.ao.quantization)、TensorFlow (tfmot.quantization)、PaddlePaddle 等均提供內建 QAT API。架構版本更新直接影響 QAT 開發效率。例如 PyTorch 2.x 的torch.compile與 QAT 結合,可自動化融合運算元。 - 編譯器與中間表示:ONNX、MLIR 等提供了模型匯出格式,QAT 訓練後的模型需要經過這些中間表示才能進入特定硬體推論引擎。
下游
QAT 最佳化的模型最終流向三個層次:
-
推論硬體晶片
- 手機 SoC:高通驍龍 8 Gen 3/8 Gen 4、聯發科天璣 9400、Apple A17 Pro/M 系列,其 NPU/ANE 均原生支援 INT8 甚至 INT4 推論。據高通官方資料,驍龍 8 Gen 3 的 Hexagon NPU INT8 算力達 98 TOPS(2023 年釋出)。
- 汽車 AI 晶片:特斯拉 FSD Computer HW4.0、Mobileye EyeQ 系列、輝達 DRIVE Orin/Thor,在自動駕駛感知模型(如 BEV+Transformer)部署中大量使用 QAT 出的 INT8 網路。
- 物聯網/邊緣計算:恩智浦 i.MX 9、瑞薩 RZ/V 系列等內建 NPU,對功耗極其敏感,QAT 是保證低位元下精度達標的不二之選。
-
推論軟體棧
- TensorRT (NVIDIA):提供從 QAT 細粒度調優到 INT8 引擎建置的完整流程,其商用的精度使用 INT8 模式可使大語言模型的推論吞吐提升 2‑3 倍(來源:NVIDIA 官方部落格,2024 年測試資料)。
- ONNX Runtime Mobile/Edge、ExecuTorch (Meta)、MediaTek NeuroPilot 等均支援 QAT 模型的載入與執行。
-
終端應用
- 生成式 AI 應用:手機端側文生圖(如高通演示的 Stable Diffusion 端側版)、即時語音翻譯助手,均依賴 QAT 壓縮的 Transformer 模型。
- 計算攝影與感知:智慧手機的人像虛化、夜景增強、即時目標檢測(如抖音 AR 特效),這些視覺模型通常在驍龍或天璣 NPU 上以 INT8 執行。
- 高階駕駛輔助系統:車道線檢測、行人意圖預測等模型,通過 QAT 壓縮後可在車規級晶片有限的功耗預算內即時執行。
受益公司
以下按產業角色分類,列出 QAT 技術生態中直接或間接受益的典型上市公司。所有描述僅反映其業務關聯,不構成任何投資建議。
1. 晶片供應商
- NVIDIA:其 TensorRT 和 CUDA 生態支援 QAT→INT8 全棧,Drive 平台和 Jetson 邊緣裝置持續受益。2025 財年 NVIDIA 汽車業務營收已達到數十億美元級別(來源:NVIDIA 2025 財年 Q4 財報,2025 年 2 月釋出),QAT 所賦能的端側推論是增長點之一。
- 高通:驍龍平台整合的 AI Engine 伴隨每年旗艦晶片強調 INT8/INT4 效能,QAT 是推動高通 AI 生態“模型即晶片”策略的技術支撐。
- 聯發科:天璣 9400 內建第七代 APU,支援各類 INT8/INT4 模型;聯發科與多家手機品牌合作進行端側生成式 AI 調優,QAT 是其中核心技術。
- Apple:Core ML 和 ANE 硬體深度定製,Apple自研的模型壓縮與量化訓練流程(如 WWDC 2024 介紹的壓縮工具)屬於閉源實現,但其邏輯與 QAT 一致,直接服務於 iPhone、iPad 的端側智慧。
- 華為:昇騰系列推論卡和行動端 Ascend NPU 均支援量化推論,華為自研 MindSpore 架構內建 QAT 工具。
2. 雲端與軟體平台
- 微軟:Azure AI 服務使用 ONNX Runtime 在企業端和邊緣端推論,QAT 是其模型最佳化工作流的重要環節。
- Google:TensorFlow Lite 和 Edge TPU 的量化工具鏈是業界最早的開源 QAT 實現之一,影響深遠;Google Cloud TPU 也支援 INT8 推論。
- 亞馬遜:AWS Inferentia 晶片和 SageMaker Neo 提供模型編譯與量化服務,客戶可將 QAT 模型部署至雲端邊緣混合架構。
3. AI 應用廠商
- 特斯拉:自動駕駛模型(佔用網路、規控等)為在 FSD 電腦上達到低延遲,大量使用自研量化訓練流程,開源資訊顯示其部分感知頭已採用 INT8 量化。
- 字節跳動、商湯、曠視等:手機端即時 AR、美顏、超分模型需通過 QAT 在高通/聯發科平台極致最佳化。
市場規模
本部分資料儘可能標註年份、口徑與來源,無法獲取的明確數字宣告“公開資料未見”。
- 全球邊緣 AI 晶片市場:據 MarketsandMarkets™ 2023 年釋出的報告,全球邊緣 AI 晶片市場規模 2023 年約 398 億美元,預計 2028 年將達到 676 億美元,年均複合增長率 11.2%(來源:MarketsandMarkets, “Edge AI Hardware Market – Global Forecast to 2028”, 2023 年)。這一口徑包含用於邊緣推論的 CPU、GPU、NPU、FPGA 等,QAT 目標模型最終落在其中相當一部分 NPU 和 GPU 上。
- 模型最佳化/壓縮軟體市場:目前尚無法細分出獨立的 QAT 軟體銷售營收,因為絕大多數 QAT 工具以開源或晶片 SDK 免費提供。整體“AI 模型生命週期管理”市場,據 Grand View Research 2024 年估計,2023 年約 20 億美元,2030 年可能增至 70 億美元以上(來源:Grand View Research, 2024)。QAT 作為其中一個核心工具,其商業價值主要隱含在硬體銷售營收和雲端服務增量中。
- 推論算力成本節省:以 Meta 在 2024 年公開的最佳化成果為例,使用 INT8 量化後,其 Llama 模型在單個 GPU 上的推論吞吐提升約 2 倍(來源:Meta AI 官方部落格,2024 年)。該收益若對映到年化推論成本上,對大型雲端廠商預估可節省數億美元級別,但該資料為業界估算,公開資料未見精確審計數值。
- 行動端 AI 模型部署量:公開資料未見全球每年使用 QAT 釋出的端側模型數量的確切統計。但據高通 2024 年驍龍技術峰會演講,搭載驍龍平台的裝置上每月執行的 AI 推論次數達數十億量級,其中大部分模型已採用某種量化最佳化。
玩家對比
對比維度集中在晶片供貨商+工具鏈的 QAT 生態成熟度,不涉及個股估值或買賣判斷。
| 廠商 | 硬體平台 | QAT/量化工具鏈 | 特色 | 生態開放性 |
|---|---|---|---|---|
| NVIDIA | GPU (H/B系列)、DRIVE、Jetson | TensorRT、torch2trt、NVQAT 工具包 | 最完善的從訓練到推論全流程 INT8 最佳化;支援逐通道、QAT 微調圖形化配置 | 高,支援 PyTorch/TF/ONNX |
| 高通 | 驍龍 8 Gen 系列、QCM/QCS 平台 | AI Engine Direct、AIMET(開源量化庫) | 開源 AIMET 包含 QAT 和硬體感知量化;專門針對 Hexagon NPU 最佳化 | 較高,AIMET 開源,支援主流架構 |
| 聯發科 | 天璣 9300/9400 | NeuroPilot SDK | 提供端側部署時量化校準和 QAT 重新訓練 API,與天璣 APU 深度繫結 | 中等,SDK 面向授權開發者 |
| Apple | A17 Pro/M 系列(ANE) | Core ML Tools 壓縮模組 (palettization, pruning, quantization) | 閉環生態,量化流程高度自動化,開發者只需呼叫;支援 4‑bit 及 8‑bit | 低,僅限Apple開發者工具鏈 |
| 華為 | 昇騰 Ascend 系列、麒麟 NPU | MindSpore 架構、CANN 工具鏈 | 提供硬體感知量化介面,支援混合比特量化 | 中等,MindSpore 開源 |
各方 QAT 工具的核心差異在於“目標硬體行為模擬的精細度”。NVIDIA 的單卡生態最開放,高通和聯發科的努力點在於讓開發者無感知地完成從雲端端訓練到手機部署的 QAT 流程,Apple則通過閉源極致簡化。
風險
- 硬體-演算法錯配風險:QAT 模擬的量化行為如果與真實晶片的整數取整、溢位處理方式不一致,精度損失會遠超預期。跨晶片重訓成本高,削弱複用性。
- 訓練成本超支:全引數 QAT 需要大量 GPU 時,對大語言模型而言成本高企。據 MLCommons 2024 年基準測試,一個 7B 模型的 QAT 精調可能消耗數千 GPU 小時,對創業公司構成資源門檻。
- 技術迭代風險:PTQ 方法(如 GPTQ、AWQ、SmoothQuant 等)在 LLM 上的精度快速逼近 QAT,而成本僅為其零頭;未來若低階 PTQ 能在 4 位下穩定達到可接受精度,QAT 的增量價值可能被壓縮。
- 新硬體範式衝擊:存內計算、光子計算、脈衝神經網路等非馮·諾依曼架構可能不完全依賴傳統 INT8 量化,QAT 在這些新範式下的可遷移性未知。
- 供應鏈不確定性:QAT 訓練的 GPU 供應集中在 NVIDIA,若地緣政治因素導致高階 GPU 獲取受限,將間接影響需要大規模 QAT 的企業。
- 標準化缺失風險:不同架構、晶片間的 QAT 模型匯出和驗證缺乏統一標準,導致碎片化,增加產業整體效率損耗。
誤讀糾偏
誤讀 1:“做了 QAT,模型就能無損執行在任意 INT8 裝置上。” 真實情況是,QAT 必須儘量貼合目標晶片的量化細節。例如,同一模型在高通 NPU 上做 QAT 微調後匯出,在 NVIDIA GPU 上直接用可能因為運算元融合順序差異而產生明顯精度掉點。因此,硬體感知的 QAT 是趨勢,而不是“一套權重吃遍天”。
誤讀 2:“PTQ 已經可以替代 QAT。” 對於大型模型,PTQ(尤其是 AWQ、GPTQ)在 4 位下已取得驚人效果,但在 4 位以下和延遲極端敏感場景,QAT 仍然保持精度優勢。另外,對小型視覺模型(如 MobileNetV3),PTQ 精度損失可高達 3‑5 個百分點,QAT 能把損失壓在 0.5% 以內。所以二者是互補關係,而非替代。
誤讀 3:“QAT 只對推論晶片有用。” 部分訓練場景也會用到 QAT 思想,比如低精度訓練(FP8)中的梯度縮放和量化,實際上借用了 QAT 的直通估計器和量化範圍學習方法。所以 QAT 的影響擴充套件到了訓練效率領域。
誤讀 4:“量化就是簡單的扔小數,QAT 沒什麼技術含量。” QAT 涉及深度學習訓練動態、硬體指令集細節、編譯最佳化等多學科交叉。如何選擇量化插入點、如何協同學習 scale 和權重、如何設計適合 Transformer 的 QAT 策略,都是活躍的學術和工程前沿,遠非“扔精度”那麼簡單。
最新事件
(以下事件截至 2025 年 4 月,基於公開可查資訊)
- 高通 2025 驍龍 8 Gen 4 釋出:支援 INT4 推論的 Hexagon NPU 和全面更新的 AIMET 模型最佳化工具,重點強調對 QAT 工作流的硬體級加速支援,多家手機廠商宣佈採用該平台進行端側生成式 AI 最佳化。(來源:高通官網新聞,2025 年 3 月)
- 聯發科天璣 9500 正式商用:搭載第七代 APU,聲稱在 QAT 最佳化後能以低於 3W 功耗執行 7B 引數的大語言模型,標誌著手機端大型模型推論進入實用階段。(來源:聯發科天璣技術論壇,2025 年 2 月)
- PyTorch 2.6 釋出:
torch.ao.quantization模組新增 Transformer 專用量化後端,支援自動在注意力層插入 QAT 節點,並與torch.compile正交化以減少手動融合步驟。(來源:PyTorch 官方部落格,2025 年 1 月) - MLCommons 釋出 MLPerf Inference 4.0 結果:多項邊緣推論成績中,INT8/QAT 模型在能效指標上全面領先 FP16 版本,尤其在移動裝置、自動駕駛領域的基準測試中表現突出。(來源:MLCommons 官網結果頁面,2025 年 3 月)
- Apple Vision Pro 空間計算應用:visionOS 2.0 更新中,Apple要求部分合作夥伴使用 Core ML 的壓縮工具(內含類 QAT 流程)以獲得更低延遲的手勢識別模型,暗示Apple正將量化訓練方法推向空間計算。(來源:WWDC 2024 錄播 session,公開可查)
追蹤指標
產業研究與技術進展追蹤,建議關注以下 8 組資料:
- 行業基準精度:關注 MLPerf Inference 邊緣賽道中,各晶片在 QAT/INT8 模式下相對於 FP32 的準確率下降百分比,這反映 QAT 演算法與硬體的協同效率。
- 端側大型模型標杆任務:每年旗艦手機/車規晶片釋出會上所演示的端側生成式 AI 模型(如 7B/13B LLM)的 token 生成速度(token/s)和功耗(W),背後直接體現 QAT 最佳化程度。
- 開源架構 QAT 功能更新:PyTorch、TensorFlow 的版本日誌中與量化相關的 PR 數量和重要度,特別是對 Transformer、Diffusion 模型的新支援。
- 晶片廠商 SDK 釋出節奏:高通 AIMET、聯發科 NeuroPilot、NVIDIA TensorRT 的新版本說明中,QAT 精度的提升資料和新增硬體功能。
- 學術成果轉化速度:頂會 NeurIPS/ICML/ICLR 中有關極低位元 QAT、硬體感知量化訓練的論文數量,以及這些方法被工業界採用的時間差。
- 相關人才需求動態:招聘網站上“量化訓練工程師”“AI 編譯器與量化最佳化”崗位的增長趨勢,可反映產業擴張速度(相關資料可參照 LinkedIn 或國內主要招聘平台公開索引)。
- 晶片算力與功耗資料:SoC 中 NPU 的 INT8 TOPS 和對應功耗,逐年對比,看是否到達平台期,這預示著 QAT 能否持續釋放硬體紅利。
- 成本節約案例:雲端廠商或大型 AI 公司(如 Meta、字節跳動)在年報或技術部落格中揭露的通過量化帶來的推論成本節約比例,是企業採用 QAT 驅動力的直接證據。
信源
以下列出核心參考來源,供進一步驗證和深度研究:
-
學術論文
- B. Jacob et al., “Quantization and Training of Neural Networks for Efficient Integer-Arithmetic-Only Inference.” CVPR 2018. 可於 arXiv 搜尋 1712.05877。
- R. Krishnamoorthi, “Quantizing deep convolutional networks for efficient inference: A whitepaper.” arXiv:1806.08342, 2018.
- S. Han et al., “HAWQ: Hessian AWare Quantization of Neural Networks with Mixed-Precision.” ICCV 2019.
-
官方技術文件
- PyTorch Quantization API: https://pytorch.org/docs/stable/quantization.html
- NVIDIA TensorRT Developer Guide – INT8 Quantization: https://docs.nvidia.com/deeplearning/tensorrt/
- Qualcomm AIMET GitHub: https://github.com/quic/aimet
- Intel Neural Compressor: https://github.com/intel/neural-compressor
-
行業報告與資料來源
- MarketsandMarkets, “Edge AI Hardware Market – Global Forecast to 2028”, 2023.
- MLCommons Inference Results: https://mlcommons.org/benchmarks/inference-datacenter/
- Jon Peddie Research, “Global GPU Market Report”, Q4 2024 edition.
- 各公司財報及投資者簡報(NVIDIA 2025 財年 Q4、高通 2024 Q4 等),公開可查。
-
媒體與部落格
- Meta AI Blog: “Speeding up LLM Inference with Quantization”, 2024.
- Android Authority / AnandTech 等媒體對旗艦手機 SoC AI 效能的獨立測試。
公開資料未見的部分數字,已在文中標明;全篇不構成任何投資建議,僅用於技術概念闡述與產業邏輯梳理。