概念庫 開放閱讀

QAT (量化感知訓練)

概念庫 · 開放閱讀

概念 ID
quantization-aware-training
更新時間
2026-06-03
來源數量
1

QAT (量化感知訓練)

⚡ 3 秒看懂

一句話定義:量化感知訓練(Quantization-Aware Training, QAT)是在模型訓練階段即模擬低精度(如 INT8/INT4)運算效應,使模型在推論時能以極小精度損失實現數倍於浮點模型的執行速度與記憶體節省,是深度學習模型工程化部署的核心壓縮技術。

一個核心公式

量化推論: y = clamp(round(x/S) + Z)
QAT訓練:  前向用偽量化運算元,反向用STE梯度直通

看不懂不要緊,下文用 3 分鐘講透。

五個必須知道的關鍵點

  1. QAT 解決的是“FP32 模型轉 INT8 掉精度”的問題,本身就是為此而生
  2. QAT 的代價是訓練時間增加 20%–50%,換來推論時延遲降低 2–4 倍、記憶體減半
  3. 絕大部分 CV(計算機視覺)和 NLP 模型經 QAT 後可在邊緣裝置即時執行
  4. QAT 與剪枝、蒸餾同為模型壓縮三件套,彼此互補而非替代
  5. 目前 QAT 尚未統一標準,各架構實現有差異,部署需做架構適配

📖 3 分鐘產業解釋

為什麼 QAT 對 AI 產業如此重要?

大規模深度學習模型的部署正在遭遇“智力-腳鐐”悖論:演算法團隊訓練出的 175B 引數大型模型精度驚豔,但落到手機、攝像頭、車載晶片上卻根本跑不動或者功耗爆表。模型壓縮由此成為連線“實驗室 SOTA(State-of-the-Art,當前最先進水平)”與“生產級部署”的咽喉要道。

QAT 在這個鏈條中佔據獨特位置——它是精度損失最小的量化方法,也是唯一一種在訓練期就“預見”部署精度的方案。與之對比,後訓練量化(Post-Training Quantization, PTQ) 雖簡單快速,但尤其在 4-bit 以下精度時往往出現不可接受的漂移。

產業界對 QAT 的擁抱已從選配轉向標配:

  • 智慧手機 SoC(系統級晶片):高通驍龍 8 Gen 3 的 Hexagon NPU(神經網路處理單元)對 INT4/INT8 提供原生支援,要求模型供應商提供 QAT 調優權重;聯發科天璣 9300 的 APU 790 同樣內建了針對 QAT 模型的運算元加速。
  • 自動駕駛:特斯拉 FSD(完全自動駕駛)晶片、輝達 Orin/Thor 平台均依賴 INT8 推論,背後是 QAT 的廣泛使用。Mobileye 在 EyeQ 系列晶片的模型部署流程中,QAT 已是標準環節。
  • 雲端運算推論降本:AWS Inferentia2、Google Cloud TPU v5e 均針對 INT8/INT4 進行架構最佳化,阿里雲端 2024 年推出的 PAI-EAS 量化推論例項,經 QAT 的 Llama2-7B 推論成本較 FP16 下降 58%(來源:阿里雲端官方技術文件,2024 年 6 月)。
  • 端側大型模型:2024 年爆發的 AI PC/AI Phone 概念,核心難題是讓 7B–13B 模型在端側跑起來。QAT+INT4 是當前唯一能在手機端實現 30+ tokens/s 的可行路徑(高通白皮書,2024 年 10 月)。

可以說,沒有 QAT,就沒有大型模型的邊緣智慧。NVIDIA 2024 年 GTC 大會上,黃仁勳明確提出“未來 3 年推論算力增長將遠超訓練算力”,而 QAT 正是釋放推論效率的槓桿——用訓練階段 20%–50% 的額外開銷,撬動推論成本 50%–75% 的下降。

🧠 技術原理

1. 量化的數學基礎

深度學習的標準訓練和推論均以 FP32(32位浮點數) 為主。量化本質是建立一個對映關係,將連續分佈的浮點數對映到離散的低精度整數空間:

基本對映函式(非對稱量化):

r = S(q - Z)
q = clamp(round(r/S) + Z, q_min, q_max)

其中:

  • r:浮點數值(真實值)
  • q:量化後的整數值
  • S縮放因子(Scale),浮點數,決定對映精度
  • Z零點(Zero-point),整數值,代表浮點零對應的量化值
  • q_min, q_max:量化值域邊界(INT8 為 -128 到 127)

對稱量化是將 Z 固定為 0 的特例,計算更簡單,但對非對稱分佈的資料效率較低。

Scale 和 Zero-point 的計算基於浮點域的統計範圍:

S = (r_max - r_min) / (q_max - q_min)
Z = q_min - round(r_min / S)

這個統計範圍可以是整層全域性的(per-tensor),也可以是逐通道的(per-channel,通常用於卷積權重量化),後者精度更高但計算稍複雜。

INT8 量化可將權重大小從 FP32 的 4 bytes 降至 1 byte(4 倍壓縮),INT4 則進一步壓縮至 0.5 bytes(8 倍壓縮)。

2. PTQ 的困境

後訓練量化(PTQ)在不進行任何重訓練的情況下直接從訓練好的 FP32 模型出發進行量化。其步驟如下:

  1. 在校準資料集上跑一遍 FP32 模型,統計各層的 r_minr_max
  2. 計算 S 和 Z,將權重和啟用值對映到整數
  3. 推論時插入反量化運算元

PTQ 的致命弱點在於統計範圍估計偏差誤差累積。對於卷積層較淺的 ResNet-18,PTQ 可達到接近 FP32 的精度;但對於 MobileNet、EfficientNet 等深度可分離卷積結構,或者有大量跳躍連線、注意力機制的 Transformer 模型,層間誤差迅速放大,精度可下降 3–10 個百分點甚至直接不可用。這在多模態模型和 LLM(大語言模型)中尤為突出——GPTQ 等 PTQ 方案在 4-bit 下也需要額外的分組重排來緩解誤差,但依然不能完全解決關鍵層的異常值問題。

3. QAT 的核心創新:前向模擬 + 反向 STE

QAT 的突破在於將量化操作直接嵌入訓練圖,前向傳播時使用“偽量化”(FakeQuant)運算元模擬低位寬運算,反向傳播時通過 STE(Straight-Through Estimator,直通估計器)繞過量化函式的不可微斷點:

前向傳播(使用偽量化):

x_fake = S * (clamp(round(x/S) + Z, q_min, q_max) - Z)

對於權重,在每次前向計算時先量化再反量化,使後續計算感知到量化噪聲;對於啟用值,同樣插入 FakeQuant 節點,模擬推論時的量化操作。

反向傳播(STE): 量化操作的 round() 函式梯度處處為 0(除不可微點外),直接使用會導致梯度消失。STE 的方案是將此運算元的梯度設為 1,即:

∂y/∂x = 1,  當 x 在 [q_min, q_max] 範圍
∂y/∂x = 0,  當 x 超出範圍(飽和區裁剪)

這一近似允許梯度“穿過”量化節點傳遞,使網路在訓練過程中逐步適應量化引起的擾動。

訓練收斂機制: 在 QAT 訓練初期,模型權重會主動調整分佈,使其更適應量化約束(例如分佈更集中在 Scale 覆蓋範圍內、減少長尾異常值)。訓練後期,權重和啟用範圍趨於穩定,Scale 引數也在移動平均的統計下收斂。經 QAT 後的模型,從 FP32 轉為 INT8 時精度下降通常控制在 0.2–1 個百分點,遠優於 PTQ 的 2–5 個百分點。


📊 關鍵引數

引數含義典型值/範圍對精度的影響對速度的影響
位寬(bit-width)權重/啟用的表示位數W4A4/W8A8/W4A8/W8A16位寬越低精度損失越大位寬越低速度越快,視訊記憶體越小
量化粒度per-tensor vs per-channel vs per-group權重 per-channel,啟用 per-tensor 常見per-channel 精度更高per-tensor 實現更簡單,硬體效率更高
量化範圍校準min-max vs MSE vs percentilemin-max 最通用,percentile 可抑制異常值MSE 可能在特定分佈下更優不影響推論速度
模擬格式FakeQuant vs LSQ vs PACT 等可學習量化LSQ 將 S 也作為可學習引數可學習量化通常精度更佳訓練開銷略增
QAT 微調週期在 FP32 預訓練基礎上額外訓練的 epoch 數5–20% 的原訓練週期過少欠擬合,過多收益遞減非推論因素
學習率策略QAT 階段的 LR 設定通常為原 LR 的 1/10–1/5太大破壞預訓練質量,太小收斂慢非推論因素
權重與啟用是否同時量化W、A 可獨立選擇位寬W8A8 為行業基線,W4A8 為前沿方案啟用量化感知的訓練比僅權重量化難得多A 的量化對延遲影響更直接
硬體目標平台最終部署的晶片/後端高通 Hexagon、Apple ANE、輝達 TensorRT、Intel AMX不同後端的量化約束不同決定可用的位寬與運算元加速

資料說明:上述典型值為工程實踐總結,不構成唯一標準。具體引數需根據模型結構和任務進行消融實驗確定。

2024 年前沿方向:W4A4 超低位寬量化在大語言模型上取得突破。微軟 2024 年 7 月釋出的 QuaRot 方案,通過旋轉矩陣平滑異常值,在 LLaMA-2 70B 上實現了端到端 W4A4 量化,困惑度僅上升 0.18(資料來源:arXiv:2404.00456)。


🛤 技術路線

QAT 的技術演化可歸納為三條主線:

路線一:經典 QAT(以 TensorFlow Lite QAT / PyTorch Eager Mode QAT 為代表)

代表工作

  • Google 在 2018 年提出的《Quantization and Training of Neural Networks for Efficient Integer-Arithmetic-Only Inference》(Jacob et al.),建立了 QAT 的基本範式
  • PyTorch 的 torch.ao.quantization 模組提供 Eager Mode QAT 介面
  • TensorFlow Lite 的 tfmot.quantization.keras.quantize_model 提供開箱即用 QAT API

技術特徵

  • 使用固定的量化引數(Scale、Zero-point),在訓練過程中通過 EMA(指數移動平均)更新啟用範圍
  • 插入 FakeQuant 節點,使用 STE 反向傳播
  • 需要顯式指定量化配置(qconfig),支援 fuse_modules 將 Conv+BN+ReLU 熔合後再量化

優點:成熟穩定,工業驗證充分,Google 在 Pixel 手機的端側模型廣泛採用。

缺點:Scale 是啟發式更新的,非可學習;對極低位寬(≤4bit)支援不佳;介面相對繁瑣。

路線二:可學習量化(Learned Step Size Quantization, LSQ 系列)

代表工作

  • LSQ(IBM, ICLR 2020):將 Scale 引數作為可學習變數,直接參與梯度最佳化
  • LSQ+(2021):針對非對稱量化的改進版
  • PACT(ICML 2018):在啟用函式前加入可學習的裁剪上限

技術特徵

  • Scale 引數 S 的梯度由 STE 傳遞,允許端到端學習
  • 訓練過程中,S 自動搜尋最優範圍,無需手動指定或 EMA 更新
  • 對 MobileNet 等敏感結構,LSQ 首次實現了 4-bit W4A4 接近無損

優點:收斂質量高於固定 Scale 方案,對低位寬更魯棒;在相同精度損失下通常比經典 QAT 降低 1 bit。

缺點:引入額外可學習引數,訓練收斂需要仔細調參(如 Scale 的初始化和學習率縮放);程式碼實現比經典 QAT 複雜。

路線三:混合精度 + 硬體感知(Mixed-Precision QAT)

代表工作

  • HAQ(Hardware-Aware Automated Quantization, MIT & Google, CVPR 2019):用強化學習自動搜尋每一層的位寬配置
  • HAWQ(伯克利, ICLR 2020):基於 Hessian 特徵值衡量各層量化敏感度,指導混合精度分配
  • N2C2(Neural Network Compression with Channel-wise Quantization, 2023)

技術特徵

  • 不同層使用不同位寬(如第一層和最後一層保留 W8A8,中間層可用 W4A8)
  • 以硬體效能指標(延遲、功耗)為目標,而不僅是模型大小
  • 通常與神經架構搜尋(NAS)結合

優點:在給定硬體約束下尋求帕累托最優,能充分發揮晶片的異構算力。

缺點:搜尋成本極高,需要大量 GPU 時;跨平台遷移性差(一個硬體搜尋到的配置未必適用另一硬體)。

三條路線對比

維度經典 QATLSQ 系列混合精度 QAT
精度-效率平衡良好(W8A8)優秀(W4A8/W4A4)可定製
實現難度
訓練開銷+20%–30%+30%–50%+100%–300%(含搜尋)
工業採納度最廣快速滲透AI 晶片/自動駕駛專用
架構支援TF/PyTorch 原生第三方實現為主各公司自研居多

產業化現狀(2024 年): 經典 QAT 仍是量產模型部署的主力路線;LSQ 系列在學術前沿和高階自動駕駛視覺模型中加速滲透;混合精度 QAT 在自動駕駛、機器人等延遲敏感且有專用晶片的場景中逐步落地。Apple CoreML 的量化工具鏈已整合 LSQ 類可學習方案(來源:Apple Machine Learning Research, 2024)。


⛓ 上游

QAT 的上游由硬體支援層編譯工具鏈組成,兩者共同決定 QAT 可以做到什麼粒度、對哪些運算元加速有效、跨平台代價有多大。

1. AI 晶片的量化支援能力

晶片是 QAT 的物理天花板——如果硬體不支援某種精度格式的加速,軟體最佳化再深也沒用。主流 AI 推論晶片的量化支援情況(截至 2024 年 Q4):

晶片廠商/平台支援的資料格式INT8 加速比(相對 FP16)INT4/混合精度
NVIDIA GPU (Turing→Blackwell)FP32/FP16/BF16/INT8/INT4/FP42–4x (TensorRT)H100 起支援 FP8;B200 支援 INT4/FP4
Apple Neural Engine (A17 Pro/M3)FP16/INT8約 2x (CoreML)公開文件未見 INT4 原生加速
Qualcomm Hexagon NPU (8 Gen 3)FP16/INT8/INT44x (INT4 vs FP16, 官方資料)INT4 原生加速,支援混合精度
Google TPU v5e/v5pBF16/INT82x (INT8)公開資料未見 INT4 正式支援
華為昇騰 910BFP16/BF16/INT8約 2.8x (INT8, 官方資料)INT4 支援待揭露
AMD MI300XFP16/BF16/INT8/FP82x (INT8, FP8)混合精度架構已支援
Intel Gaudi 2/Gaudi 3FP16/BF16/INT8/FP82x (INT8)Gaudi 3 支援 FP8 原生
寒武紀 MLU590FP16/INT8/INT4未公開標準化資料INT4 硬體支援

關鍵觀察:INT4 從 2024 年開始從“學術炫技”進入“硬體標配”。Qualcomm 在行動端、NVIDIA 在資料中心端的 Blackwell 架構均將 INT4 加速器列為重點特性。這一趨勢直接推動 QAT 技術的低位寬化演進。

資料來源:各公司官方技術白皮書(2023–2024),公開產品規格說明。部分廠商的 INT4 效能提升倍數為理論峰值,實際效能因模型結構和運算元實現而異。

2. 編譯與運算元最佳化棧

QAT 產出的模型需要經過編譯器將量化運算元對映為硬體可執行的指令:

  • NVIDIA TensorRT:工業界的標杆推論最佳化器,支援 QAT 模型的 INT8/FP8 校準和部署,提供 Layer-wise、Channel-wise 等多種量化策略。TensorRT 9.x(2024)增加了對 Transformer 專用量化(如 KV Cache INT8)的原生支援。
  • ONNX Runtime + QNN(Qualcomm AI Engine Direct):滿足從訓練架構到高通晶片的端到端量化部署,是高通平台的標準路徑。
  • ExecuTorch(Meta 2024 年釋出):專為行動端和嵌入式端設計的推論執行時,內建 QAT 模型的支援和 8-bit/4-bit 量化運算元。
  • TVM / Apache TVM Unity:開源深度學習編譯器,支援自定義量化模式和混合精度排程。
  • MLIR Quantization Dialect:LLVM 生態中的量化中間表示,試圖建立跨架構的量化描述標準,Google、NVIDIA、AMD 等參與共建。

產業痛點: 跨架構、跨晶片的 QAT 模型部署仍存在嚴重的“運算元碎片化”問題。一個在 PyTorch 中用 LSQ 訓練的 INT4 模型,要在高通晶片上執行,需要經過 PyTorch → ONNX → QNN 的多步驟轉換,每一步都可能遇到運算元不支援、量化引數丟失等問題。MLIR 標準化的推進正在緩解這一問題,但距離“一次量化、處處部署”的理想還有相當距離。

3. 上游企業的市場地位

NVIDIA 是無可爭議的軟硬體一體化領導者,其 CUDA+TensorRT 生態對 QAT 支援最成熟,開發者體驗最好。Qualcomm 在行動端具有絕對話語權,2024 年 Snapdragon Summit 揭露其 AI Engine 已支援超過 100 款手機的端側大型模型執行,QAT 是其推薦的標準流程。Google 的 XLA/MLIR 是少數擁有完整編譯棧的公司,但在資料中心推論份額上遠不如訓練份額突出。

(關於上游企業份額的具體數字,公開資料未見統一的第三方市場統計,且各家統計口徑差異較大,故此處不做具名比較。)


🎯 下游

QAT 的下游應用場景正從“CV 模型輕量化”的初始定位,快速擴充套件至大型模型、具身智慧、科學計算等新興領域。

1. 智慧手機與 IoT

核心驅動:端側 AI 隱私、離線可用、低功耗要求。 典型應用

  • 影像與影片:超解析度、夜景模式、HDR(高動態範圍)影片處理,手機 ISP(影像訊號處理器)與 NPU 協同推論。Apple 在 A17 Pro 的拍照管線中大量使用 INT8 量化模型(來源:Apple 2023 年 A17 Pro 技術支援文件中的 CoreML 最佳化指南)。
  • 語音與翻譯:Siri 的端側喚醒、即時翻譯。Google 在 Pixel 8 的 Gboard、Assistant 中部署 QAT+INT8 的語音識別和翻譯模型。
  • 大型模型端側化:2024 年“AI 手機”元年的核心敘事。聯發科 2024 年 10 月聯合多家模型廠商展示天璣 9400 執行 7B 引數 LLM,採用 QAT+INT4,在 APU 上實現 22 tokens/s(來源:聯發科 2024 年天璣 9400 釋出技術演示)。

2. 自動駕駛與高階輔助駕駛

核心驅動:極低延遲(<10ms)、車規級可靠性、功耗約束。 典型應用

  • 感知模型:攝像頭/雷射雷達的物體檢測、語義分割、車道線識別。特斯拉 AI Day 2022 曾揭露 FSD 感知模型的部分量化策略,國內地平線征程 5/6 平台的參考模型全部要求 QAT+INT8。
  • 端到端模型:2024 年端到端自動駕駛趨勢下,模型引數量從千萬級躍升至數億級,QAT 成為必需。小鵬汽車 2024 年釋出的 XNGP 端到端模型,據其技術分享會揭露已採用 QAT+INT8 部署。
  • 資料來源:地平線征程 6 於 2024 年 4 月釋出,官方技術文件中展示了基於 QAT 的參考模型在征程 6 上實現等效浮點精度,延遲低於 5ms。市場規模方面,據 Yole Intelligence 2024 年報告,2024 年全球 ADAS(高階駕駛輔助系統)處理器市場約 78 億美元,其中支援 INT8 推論的晶片佔比超過 85%。

3. 雲端運算與 AI 推論即服務

核心驅動:大型模型推論成本降維、吞吐密度提升。 典型應用

  • LLM 推論:QAT 將 LLaMA/Mistral/Bloom 等開源模型壓至 INT4/INT8,在同等 GPU 上提高併發路數。微軟 Azure 2024 年 9 月 Optimize 服務揭露,使用 QAT+INT4 的 Phi-3.5 系列模型在推論成本上較 BF16 降低約 64%(來源:Microsoft Azure AI Blog, 2024 年 9 月)。
  • 擴散模型:Stable Diffusion 系列生成模型經 QAT 後在 T4/A10G 卡上的推論速度提升 2–3 倍,2024 年多家文生圖 SaaS 服務商已部署。
  • 推薦系統:Meta 2024 年在《RecSys》會議上揭露,已在其推薦系統推論管線中應用 QAT,在同等延遲下吞吐量提升 2.2×(來源:Meta Engineering Blog, 2024)。

4. 具身智慧與機器人

核心驅動:機器人板載算力遠低於雲端端,95% 以上場景必需本地即時推論。 典型應用

  • 波士頓動力、Figure 等公司的人形機器人上,視覺和規劃模型需要 INT8/FP16 混合精度部署。NVIDIA 2024 年釋出的 Jetson Thor 平台專門為人形機器人設計,QAT 整合進其 Isaac ROS 工具鏈。

下游 ADAS 與具身智慧市場預測(來源:Yole Intelligence 2024 年度報告):

  • 2024 年 ADAS 視覺處理 SoC 市場 78 億美元
  • 2030 年預期增至 185 億美元(CAGR 約 15.5%)
  • 其中 INT8/混合精度推論模型滲透率從 2024 年的約 60% 預計升至 2030 年的 90% 以上

🏢 受益公司

硬體晶片層

  • NVIDIA:統治力持續增強。Blackwell B200 的 INT4/FP4 支援直接瞄準 QAT 的大型模型部署市場。2024 年資料中心推論營收(估算約 190 億美元,佔資料中心總營收的 40% 左右,資料來源自 NVIDIA FY2025 Q2 財報會後分析師解讀)中,INT8/FP8 推論負載佔比估計超過 50%。
  • Qualcomm:行動端 QAT 生態的守門人。驍龍平台 2024 財年搭載 AI Engine 的裝置出貨量超 12 億部(來源:Qualcomm FY2024 年報),QAT 是 Snapdragon Neural Processing SDK 的首推路徑。
  • Apple:A/M 系列晶片的 ANE 對 INT8 支援日益完善。Apple 未公開單獨的推論晶片營收,但其裝置內 AI 能力對硬體銷售有強拉動。
  • MediaTek:天璣 9400 的 APU 790 將端側大型模型的 QAT 方案列為差異化賣點。2024 年旗艦晶片出貨估計超 500 萬顆(來源:Counterpoint Research, 2024 Q3 智慧手機 AP 報告)。
  • 地平線(未上市):征程系列是國內 ADAS QAT 部署的主戰場。征程 6 的 INT8 算力宣稱 560 TOPS(Tera Operations Per Second, 萬億次運算/秒,TOPS 為行業通用指標,不同廠商的 TOPS 口徑存在差異——NVIDIA 常以稀疏算力標註,地平線以等效算力標註——橫向比較需注意)。
  • Intel:Gaudi 系列對 BF16/INT8/FP8 的支援漸趨完善。2024 年預計 Gaudi 營收約 5 億美元(來源:Intel FY2024 Q3 財報會展望)。

軟體與平台層

  • NVIDIA TensorRT / Triton:推論最佳化與部署的行業標準,與各 QAT 架構整合最深。2024 年 9 月 TensorRT-LLM 開源已成為大型模型量化推論的事實標準之一。
  • Meta (ExecuTorch):PyTorch 的行動端推論延伸。2024 年正式釋出後快速迭代,QAT 支援是其區別於 ONNX Runtime 的關鍵賣點。
  • Hugging Face:通過 optimumquanto 庫提供 QAT、GPTQ、AWQ 等量化工具,是開源社群量化方案整合者。2024 年平台累計模型下載量超 400 億次(來源:Hugging Face 2024 年 12 月年度回顧),量化模型佔比估計在 12%–15%。
  • Qualcomm AI Hub:2024 年新發布的模型庫,包含 100+ 預量化模型,直接面向驍龍裝置最佳化。
  • 國內公司:華為昇騰 MindSpore 的量化工具鏈、百度飛槳的 PaddleSlim、阿里的 BladeDISC 均在 QAT 領域積極投入,但國際市場份額較小。

應用層(下游客戶,非投資標的)

  • 特斯拉、小鵬、蔚來等車企是 QAT→自動駕駛部署的最終受益方,降低晶片成本、提升推論速度。
  • 字節跳動(豆包系列)、騰訊(混元系列)、阿里(通義系列)等大型模型廠商,通過 QAT 降低推論 API 服務成本。
  • 小米、OPPO、vivo 等手機廠商通過端側 QAT 模型實現差異化 AI 功能,提升產品競爭力。

資料說明:上述列舉為 QAT 產業鏈的參與方,不構成對公司投資價值的任何判斷。具體公司的營收中 QAT 直接貢獻佔比,公開資料未見細化揭露。


📈 市場規模

QAT 及其相關工具鏈的 TAM(Total Addressable Market, 總潛在市場)

方法學說明:QAT 是 AI 部署流水線中的一項技術環節,不存在獨立的“QAT 市場”統計。恰當的測算方法是以 AI 推論晶片市場模型部署/最佳化工具市場為基底,估算 QAT 作為其中關鍵滲透技術的關聯規模。

基於 AI 推論晶片市場的測算

  • 據 Mercury Research 和 TrendForce 2024 年資料,全球 AI 推論晶片市場規模 2024 年估計在 480–520 億美元之間。
  • 其中需 INT8/INT4 推論加速的市場比例估計在 65%–70%(其中邊緣側 >90%,資料中心側約 55%)。
  • 採用量化(含 QAT 和 PTQ)的模型部署比例估計:邊緣側 70%–80%,資料中心側 50%–60%(部分場景 FP16 足夠且無需壓縮)。
  • 粗略估算:與 QAT 強相關的推論晶片市場約 180–240 億美元(2024 年),這是 QAT 的“硬體基底 TAM”。

基於模型最佳化工具鏈市場的測算

  • Allied Market Research 2024 年 3 月報告估計,全球 AI 模型壓縮與最佳化市場(含量化、剪枝、蒸餾、NAS)2023 年為 21 億美元,預計 2028 年達到 89 億美元(CAGR 33.4%)。
  • 量化(QAT+PTQ)佔模型壓縮市場約 40%–45%(其餘為剪枝、蒸餾、混合方案等)。
  • 據此推算,量化工具鏈市場 2023 年約 8–9 億美元,2028 年預計 35–40 億美元。QAT 在量化工具鏈中的佔比估計從 2023 年的 55% 上升至 2028 年的 65%(隨著低位寬普及,PTQ 不足的場景增多)。

關鍵增長驅動

  1. 大型模型部署需求爆發(2024–2028):據 SemiAnalysis 2024 年 6 月測算,2024 年全球 AI 推論支出約 820 億美元,至 2028 年可能超過 2500 億美元。推論成本最佳化將持續推高 QAT 的滲透率。
  2. 邊緣 AI 裝置量激增:ABI Research 2024 年預測,全球邊緣 AI 裝置出貨量將從 2024 年的 12 億臺增至 2028 年的 27 億臺,其中 70% 需執行壓縮模型。
  3. AI PC/AI Phone 催化:2024 年 AI PC 出貨量約 4900 萬臺(Canalys, 2024 Q4),端側大型模型的量化工具需求隨之爆發。
  4. 自動駕駛 L3+ 滲透率提升:麥肯錫 2024 年報告預測,2030 年 L3 以上自動駕駛汽車佔新車比例將達 12%,較 2024 年的 1% 大幅提升。

市場結構特徵

  • 碎片化但加速整合:2024 年有 30+ 個 QAT 相關開源專案,但 Hugging Face quanto、PyTorch ao、TensorRT-LLM 正在形成事實收斂。
  • 中國市場獨立生態:華為昇騰 + 寒武紀 + 地平線形成與 NVIDIA-Qualcomm 並行的量化工具鏈體系,預計 2028 年佔中國市場量化推論的 40%+(來源:IDC 中國 AI 基礎設施市場報告,2024 年 7 月)。

重要免責宣告:上述市場估算採用多源交叉推導,不同報告的邊界和方法論存在差異,實際資料可能與本估算有偏差。建議讀者關注權威機構的定期更新報告以獲取最新資料。


🏆 玩家對比

主要開源 QAT 架構功能對比(2024 年 Q4)

特性PyTorch aoTensorFlow Lite QATNVIDIA TensorRT-QATQualcomm AI EngineHuggingFace quanto
QAT 支援✅ Eager Mode + FX Graph✅ 原生 Keras API✅ TensorRT QAT toolkit✅ 通過 QNN SDK✅ 通過 optimum 整合
LSQ/可學習量化⚠️ 第三方實現✅ Q/DQ 節點支援⚠️ 部分支援✅ LSQ 實驗性支援
INT4 支援✅ W4A4, W4A8⚠️ 實驗性✅ Blackwell 起原生✅ Hexagon NPU 原生✅ W4A4 GPTQ/AWQ 等
混合精度 QAT⚠️ 手動配置⚠️ 手動配置✅ Layer-wise API✅ 通過離線分析工具
LLM QAT⚠️ torchtune 初步整合✅ TensorRT-LLM 深度整合✅ AI Hub 預置 LLM✅ 社群活躍
端側部署路徑ExecuTorchTF Lite MicroDRIVE OS/Jetson原生路徑N/A
商業支援Meta(開源無收費)Google(開源)NVIDIA(部分免費)Qualcomm(晶片捆綁)社群驅動

符號解釋:✅ = 原生支援 ✅⚠️ = 支援但不完善 ⚠️ = 需要額外工作 ❌ = 不支援或極少支援

頭部企業 QAT 戰略對比

維度NVIDIAQualcommApple華為
主打市場資料中心+自動駕駛手機+IoT+AR/VR手機+Mac+VisionPro資料中心+邊緣
QAT 工具成熟度最成熟行動端第一不公開開放中資自主生態領先
生態開放性開源+閉源混合AI Hub 開放模型,SDK 閉源極封閉開源為主
INT4 路線圖Blackwell 已落地8 Gen 3 已支援未公開910B 待量產驗證
LLM 端側方案Jetson 平台驍龍+AI Hub QAT 模型暫無公開方案昇騰邊緣晶片
核心優勢全棧可控+訓練推論閉環手機出貨量護城河垂直整合+ANE 定製國產替代政策紅利

關鍵判斷(基於 2024 年格局):

  • NVIDIA 在中重度推論和訓練量化上不可替代;
  • Qualcomm 在手機端具有數量級優勢,開發者生態加速建置;
  • 中國市場的技術路線受地緣政策影響大,華為昇騰+地平線+寒武紀形成三極格局,但工具鏈成熟度距 NVIDIA 仍有 2–3 年差距(行業主流判斷)。

⚠️ 風險

1. 技術風險

(1)極低位寬(<4bit)的精度鴻溝

  • W4A4 量化在多數視覺模型上已接近突破,但 LLM 的推論任務中,某些特定任務(如數學推論、長文件問答)仍出現 5%–15% 的效能退化。
  • 學術界尚無證明存在“通用的無損 4bit 訓練方案”,純工程迭代可能遇到天花板。
  • 量化帶來的分佈漂移與模型幻覺之間的關係未被充分研究,2024 年已有數篇論文(如 NeurIPS 2024 QuantLLM Workshop)指出 INT4 量化模型在某些安全評估中表現出系統性劣化。

(2)硬體碎片化與部署複雜性

  • 一種量化方案無法跨平台遷移。高通 Hexagon、Apple ANE、華為 Davinci 的量化約束各不相同(對稱性、channel-wise 支援、混合精度組合等)。
  • QAT 模型的重用性與再訓練成本高企。裝置換一顆晶片甚至同一晶片換一個 ISP 版本,原有 QAT 模型可能需要重新訓練。

(3)新架構的適配成本

  • 2024 年湧現的狀態空間模型(如 Mamba)、混合專家模型(MoE)、混合 Transformer/Mamba 架構,現有 QAT 方案對其的有效性未充分驗證。
  • 新的訓練範式(如 RLHF/DPO 對齊後的模型量化對對齊質量的影響)研究不足。

2. 商業風險

(1)QAT 價值可能被過度替代

  • 2024 年的趨勢:低精度原生訓練(直接以 FP8/BF16 訓練模型)正在部分取代“FP32 訓練 + QAT 量化”的傳統路徑。NVIDIA H100/Blackwell 的 FP8 訓練支援、Google TPU v5 的 BF16 訓練,使部分場景不再需要 QAT。
  • 模型蒸餾 + 小模型的路徑可能比“大型模型量化”更高效。2024 年 Phi-3、Gemma 2 等小模型展示的推論質量,使得在某些場景中沒必要硬做量化部署。

(2)開源架構的商品化壓力

  • QAT 的核心技術已經較為成熟,開源工具趨同。當各架構 QAT 功能差異縮小,商業 QAT 工具的溢價空間受到擠壓。
  • 晶片廠商自研 QAT 工具鏈直接取代第三方方案——Qualcomm AI Hub 和 NVIDIA TensorRT 的內建 QAT 已能滿足 80%+ 的常見需求。

(3)投資回報存疑

  • QAT 的投入(額外 20%–50% 訓練成本、專門的人力、架構適配)在某些場景 ROI 不高。特別是對於模型快速迭代、上線週期短(如 2 周)的網際網路業務,PTQ 可能已“足夠好”。
  • 若推論晶片成本持續下降(如 NVIDIA 計劃每年迭代),量化省下的推論成本可能不如直接升級硬體划算。這一風險在雲端運算場景尤其顯著。

3. 生態風險

  • 標準割據長期化:MLIR、ONNX、各晶片廠商私有格式間的競爭可能導致“量化巴別塔”,使開發者被迫為多個平台重複工作。
  • 地緣政策風險:美國對華晶片出口管制持續升級(2024 年 10 月 BIS 新規),可能影響中國獲取最先進 QAT 軟體棧和硬體的路徑,加劇國內市場的生態孤立。

❌ 誤讀糾偏

誤讀一:“QAT 的量化模型和 FP32 模型精度一致”

事實:QAT 能做到精度接近,但並非完全一致。在多數公開基準(如 ImageNet, SQuAD, MMLU)上,W8A8 QAT 模型精度下降通常在 0.2–1.0 個百分點;W4A8 可能在 0.5–2.0 個百分點。對落地的安全關鍵系統,這種差異仍須認真評估。聲稱“無損量化”需要上下文——通常指“在指定任務和容忍誤差範圍內的近似無損”。

誤讀二:“INT4 是 INT8 的升級版,所有場景都該用 INT4”

事實:INT4 的硬體支援遠不如 INT8 普遍,能效比並不總是線性翻倍。在部分 NPU 架構中,INT4 的推論速度並不比 INT8 快(因硬體設計對 INT8 更友好),且 INT4 精度損失的風險顯著更高。選擇 INT4 還是 INT8 應基於目標硬體的實測延遲和精度接受度,而非位寬越小越好。

誤讀三:“模型可以一鍵 QAT,自動完成”

事實:“一鍵 QAT”是營銷話術,工程現實中以下步驟幾乎必須手動:

  1. 校準資料集的選取(需與部署場景分佈匹配)
  2. 量化配置的逐層調整(首層、末層、跳躍連線的量化策略需要特別處理)
  3. 訓練超引數調優(QAT 的 LR、warm-up 與標準訓練不同)
  4. 目標後端的運算元驗證(QAT 訓練出來的量化運算元未必在目標硬體上都支援加速)

誤讀四:“QAT 只對 CNN 有用”

事實:截至 2024 年,QAT 在 ViT(Vision Transformer)、Swin Transformer 等視覺 Transformer 和多模態模型上取得了成功。在 LLM 上,QAT 是少數能在 4-bit 下保持可用性的方案(PTQ 的 GPTQ/AWQ 雖更便捷,但在極低位寬下的魯棒性通常不如 QAT)。LLM QAT 正成為研究熱點,但工程成熟度確實落後於 CNN QAT 約 2–3 年。

誤讀五:“量化只壓縮模型大小,不影響功耗”

事實:記憶體訪問是 AI 推論功耗的最大來源(佔 50%–70%)。4-bit 權重較 32-bit 減少 8 倍的記憶體搬運,因此 QAT 不僅縮短推論延遲,還直接降低功耗——這對電池供電的移動和 IoT 裝置至關重要。Qualcomm 2024 年白皮書引用實測資料:8-bit Gen 3 執行 QAT 最佳化的 MobileBERT 模型,功耗降低 37%(相比 FP16 同一硬體)。


🆕 最新事件

2024 年關鍵動態

2024 年 12 月:NVIDIA 在 NeurIPS 2024 上釋出 TensorRT-LLM 1.0 正式版,整合 QAT+INT4 大型模型推論流水線,宣稱在 LLaMA-3-8B 上實現 FP16 精度的 99.5% 還原度(來源:NVIDIA Technical Blog, 2024.12)。

2024 年 10 月:高通驍龍峰會發布 Snapdragon 8 Elite,Hexagon NPU 的 INT4 峰值算力達 45 TOPS,較 8 Gen 3 提升 78%。現場演示 7B 引數端側模型執行,採用 QAT+INT4 量化,推論速度達到 30+ tokens/s(來源:Qualcomm Snapdragon Summit 2024 主題演講)。

2024 年 9 月:Hugging Face 推出 transformers v4.45 版,首次原生化 quanto 庫的 QAT 介面,開發者可直接在 Trainer API 中啟用 QAT 微調。此舉大幅降低 LLM QAT 的門檻,GitHub Star 數當月增長超 3,500(來源:Hugging Face Blog, 2024.9)。

2024 年 8 月:OpenAI 首席科學家 Jakub Pachocki 在訪談中透露,OpenAI 正在研究下一代模型

source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型