量化感知训练
3 秒看懂
量化感知训练(Quantization-Aware Training,QAT) 是在模型训练过程中,直接模拟低精度(如 INT8)推理时的舍入误差,让模型提前学会补偿这种信息损失。这样做出的低精度模型,在手机、汽车、物联网芯片上跑起来时,精度下降远小于事后直接压缩的方案。它让大模型“瘦身”而不“掉智商”,是端侧 AI 部署最核心的优化技术之一。
3 分钟产业解释
AI 模型从实验室到装进千千万万台终端设备,表面上是代码转换,实质上是“精度的妥协”。训练时用 FP32(32 位浮点)是为了算得准,推理时换成 INT8(8 位整数)是为了跑得快、省功耗、省存储。如果训练完再强行换成 INT8,好比把高精度工程图纸直接缩印成邮票大小,很多细节就丢了。量化感知训练的做法,是在训练过程中就不断告诉自己:“未来我会变成邮票大小,现在请按邮票的可辨识程度来画。” 于是模型自己学会了在低精度条件下依然保持表达能力。
这背后不是单纯算法技巧,而是产业效率的痛点。云厂商在数据中心每处理一亿次大模型请求,若用 FP32 成本是一块钱,INT8 可能降到两毛钱;手机芯片的 NPU 如果能用 INT8 跑 Stable Diffusion 生成一张图,功耗可能只有 FP16 的一半,发热量也跟着大幅下降。因此,高通、联发科、苹果、三星的系统级芯片(SoC)在 AI 引擎设计上都把 INT8 性能作为卖点,而 QAT 正是帮开发者榨干这一卖点的训练神器。
对投资视角而言,QAT 不产生直接营收,但它深刻影响AI 推理成本和终端 AI 产品体验,是连接云—边缘—终端整条效率链的黏合剂。是否具备成熟的 QAT 工具链,已成为判断一家芯片公司 AI 生态是否“可用”的重要参考。
技术原理
QAT 的本质可以拆解成三个关键词:量化模拟节点、伪量化操作、直通估计梯度。
1. 量化模拟节点
在正常的浮点训练图中,QAT 会在需要被量化的张量上插入“量化—反量化”节点对:
- 前向传播:把这个张量从浮点数“碾”成低精度整数,再拉回浮点数,得到有量化误差的值,用这个值继续前向计算。
- 这一步模拟的是推理芯片的真实行为,包括截断(clamp)、取整(round)、缩放(scale)和零点(zero-point)。
数学形式上:
q = round(x / scale + zero_point)
x_fake = (clamp(q, min, max) - zero_point) * scale
其中 scale 和 zero_point 可以是以张量为单位(per‑tensor),也可以是逐通道(per‑channel)。现代 QAT 为了让量化误差更小,普遍采用逐通道对称量化,即每个输出通道都有自己的缩放系数,零点强制为 0。
2. 量化参数如何确定
scale 和 zero_point 不再是训练后校准产物,而是可以在训练过程中学习或根据统计量实时计算。常见的策略包括:
- 可学习参数:将
scale设为可训练变量,让梯度优化它们。 - 滑动平均统计:在训练时跟踪各张量的 min/max 或百分比范围,动态计算
scale,类似 BatchNorm 的统计量累积。
3. 直通估计器
量化函数中的 round 操作是阶梯型函数,梯度几乎处处为零。QAT 通过直通估计器把这条梯度路径直接“短路”:反向传播时,假装 round 函数不存在,把输出端的梯度原样传递给输入端。这种近似虽然粗暴,却出奇有效,已经过大量实践验证。
4. 插入位置
并非每一层都需要量化。常规 QAT 会重点量化:
- 卷积/全连接层的权重;
- 激活值(ReLU、GELU 之后的输出);
- 注意力机制中的查询、键、值投影(Transformer 类);
- 有时也量化层归一化的输入/输出,但需谨慎。
QAT 训练完成后,这些已经“习惯量化噪声”的浮点权重,只需最后做一次真正的量化格式转换(无梯度),就能导出为 INT8 甚至 INT4 模型。
关键参数
QAT 的效果高度依赖参数设定,以下 6 组参数直接影响落地表现。
-
量化位宽(Bitwidth) 8 位(INT8/UINT8)是当前产业主流。4 位(INT4)能在某些芯片上提供更高吞吐,但 QAT 难度显著增大,通常需配合更复杂的非均匀量化或 NF4 等浮点型低精度格式。
-
量化粒度(Granularity)
- Per‑tensor:整个张量共享一个 scale/zero_point,硬件友好但容易掩盖通道间分布差异。
- Per‑channel:每个输出通道独立量化,精度损失更小,已成为卷积层权重量化的默认做法。部分 NPU 对 per‑channel 权重量化支持良好(如高通 AI Engine、苹果 ANE)。
-
对称/非对称 对称量化零点固定为 0,计算更少,适合权重;非对称量化允许零点偏移,对激活值(如 ReLU 输出非负)更适合。多数实践采用对称权重+非对称激活的组合。
-
量化范围类型
- Min‑max:直接取极值确定范围,易受离群点影响。
- Percentile / MSE:去掉最极端的 0.1% 值再定范围,或用最小化量化前后输出的均方误差来确定范围,这在 GPTQ 等高级 PTQ 中常见,也可引入 QAT。
-
批归一化融合 QAT 必须考虑推理时的算子融合:训练时,卷积+批归一化被融合成一个等效权重,QAT 要在融合后的等效权重上插入伪量化节点,否则训练与推理会失配,导致部署精度莫名下降。
-
校准数据与训练时长 QAT 通常需要在 FP32 收敛模型的权重上微调若干 epoch。数据量和 epoch 数可通过消融实验确定。对于大语言模型,全参数 QAT 成本过高,业界更多采用参数高效微调+部分层 QAT 的折中方案。
技术路线
量化技术并非只有 QAT 一条路,产业实践中需要根据场景、模型大小、硬件特性灵活选型。
| 维度 | 量化感知训练 (QAT) | 训练后量化 (PTQ) | 混合精度训练 + 量化推理 |
|---|---|---|---|
| 介入阶段 | 训练中 | 训练完成后 | 训练时用低精度,推理时再量化 |
| 精度损失 | 最低(极限低位宽下仍有优势) | 8 位下可<1%,4 位下扩大 | FP16/BF16 训练几乎无损,但推理需再量化 |
| 训练成本 | 最高(需完整重训或大量微调) | 几乎为零(仅需少量校准数据) | 中等(训练加速,但需支持低精度硬件) |
| 硬件适配要求 | 需要模拟目标芯片量化行为 | 可在部署前校准硬件特性 | 依赖训练 GPU 的 FP16/BF16 性能 |
| 典型适用场景 | 手机、车载、IoT 等资源严格受限设备的关键模型 | 快速原型、云端推理、精度裕量大 | 大模型训练加速,后续再 PTQ/QAT |
技术融合趋势:
- QAT + PTQ 流水线:先用 PTQ 快速得到基线,确定哪些层敏感,然后只对敏感层做 QAT,大幅降低开销。
- 硬件感知 QAT (HAWQ 一类):把目标芯片的硬件指令集特性(如乘加单元的整数精度、算子支持等)作为约束,直接优化 QAT 策略。
- 极低比特 QAT(2‑4 bit):结合非均匀量化、矢量量化等方法,正在推动 LLM 在端侧部署的极限。
上游
QAT 技术栈上游主要包括:
- 模型架构开发者:提供浮点精度预训练模型的机构,如 Meta 的 Llama 系列、谷歌的 Gemma、Mistral 等。这些模型是 QAT 的“原材料”。以 2024 年发布的 Llama 3 为例,公开资料显示其 8B 版本 FP32 权重体积约 30 GB,是本轮端侧量化优化的热门基座。
- 训练硬件:NVIDIA H100/H200/B200 等 GPU 集群主导了 QAT 微调的计算供给。华为昇腾、AMD Instinct MI300X 等加速卡也在构建 QAT 软件环境。2024 年全球 AI 训练 GPU 出货量超 200 万片(来源:Jon Peddie Research 2024 年 Q4 报告),为 QAT 提供了充裕算力基础。
- 深度学习框架:PyTorch (
torch.ao.quantization)、TensorFlow (tfmot.quantization)、PaddlePaddle 等均提供内置 QAT API。框架版本更新直接影响 QAT 开发效率。例如 PyTorch 2.x 的torch.compile与 QAT 结合,可自动化融合算子。 - 编译器与中间表示:ONNX、MLIR 等提供了模型导出格式,QAT 训练后的模型需要经过这些中间表示才能进入特定硬件推理引擎。
下游
QAT 优化的模型最终流向三个层次:
-
推理硬件芯片
- 手机 SoC:高通骁龙 8 Gen 3/8 Gen 4、联发科天玑 9400、苹果 A17 Pro/M 系列,其 NPU/ANE 均原生支持 INT8 甚至 INT4 推理。据高通官方数据,骁龙 8 Gen 3 的 Hexagon NPU INT8 算力达 98 TOPS(2023 年发布)。
- 汽车 AI 芯片:特斯拉 FSD Computer HW4.0、Mobileye EyeQ 系列、英伟达 DRIVE Orin/Thor,在自动驾驶感知模型(如 BEV+Transformer)部署中大量使用 QAT 出的 INT8 网络。
- 物联网/边缘计算:恩智浦 i.MX 9、瑞萨 RZ/V 系列等内置 NPU,对功耗极其敏感,QAT 是保证低比特下精度达标的不二之选。
-
推理软件栈
- TensorRT (NVIDIA):提供从 QAT 细粒度调优到 INT8 引擎构建的完整流程,其商用的精度使用 INT8 模式可使大语言模型的推理吞吐提升 2‑3 倍(来源:NVIDIA 官方博客,2024 年测试数据)。
- ONNX Runtime Mobile/Edge、ExecuTorch (Meta)、MediaTek NeuroPilot 等均支持 QAT 模型的加载与执行。
-
终端应用
- 生成式 AI 应用:手机端侧文生图(如高通演示的 Stable Diffusion 端侧版)、实时语音翻译助手,均依赖 QAT 压缩的 Transformer 模型。
- 计算摄影与感知:智能手机的人像虚化、夜景增强、实时目标检测(如抖音 AR 特效),这些视觉模型通常在骁龙或天玑 NPU 上以 INT8 运行。
- 高级驾驶辅助系统:车道线检测、行人意图预测等模型,通过 QAT 压缩后可在车规级芯片有限的功耗预算内实时运行。
受益公司
以下按产业角色分类,列出 QAT 技术生态中直接或间接受益的典型上市公司。所有描述仅反映其业务关联,不构成任何投资建议。
1. 芯片供应商
- NVIDIA:其 TensorRT 和 CUDA 生态支持 QAT→INT8 全栈,Drive 平台和 Jetson 边缘设备持续受益。2025 财年 NVIDIA 汽车业务营收已达到数十亿美元级别(来源:NVIDIA 2025 财年 Q4 财报,2025 年 2 月发布),QAT 所赋能的端侧推理是增长点之一。
- 高通:骁龙平台集成的 AI Engine 伴随每年旗舰芯片强调 INT8/INT4 性能,QAT 是推动高通 AI 生态“模型即芯片”策略的技术支撑。
- 联发科:天玑 9400 内置第七代 APU,支持各类 INT8/INT4 模型;联发科与多家手机品牌合作进行端侧生成式 AI 调优,QAT 是其中核心技术。
- 苹果:Core ML 和 ANE 硬件深度定制,苹果自研的模型压缩与量化训练流程(如 WWDC 2024 介绍的压缩工具)属于闭源实现,但其逻辑与 QAT 一致,直接服务于 iPhone、iPad 的端侧智能。
- 华为:昇腾系列推理卡和移动端 Ascend NPU 均支持量化推理,华为自研 MindSpore 框架内置 QAT 工具。
2. 云与软件平台
- 微软:Azure AI 服务使用 ONNX Runtime 在企业端和边缘端推理,QAT 是其模型优化工作流的重要环节。
- 谷歌:TensorFlow Lite 和 Edge TPU 的量化工具链是业界最早的开源 QAT 实现之一,影响深远;Google Cloud TPU 也支持 INT8 推理。
- 亚马逊:AWS Inferentia 芯片和 SageMaker Neo 提供模型编译与量化服务,客户可将 QAT 模型部署至云边缘混合架构。
3. AI 应用厂商
- 特斯拉:自动驾驶模型(占用网络、规控等)为在 FSD 电脑上达到低延迟,大量使用自研量化训练流程,开源信息显示其部分感知头已采用 INT8 量化。
- 字节跳动、商汤、旷视等:手机端实时 AR、美颜、超分模型需通过 QAT 在高通/联发科平台极致优化。
市场规模
本部分数据尽可能标注年份、口径与来源,无法获取的明确数字声明“公开资料未见”。
- 全球边缘 AI 芯片市场:据 MarketsandMarkets™ 2023 年发布的报告,全球边缘 AI 芯片市场规模 2023 年约 398 亿美元,预计 2028 年将达到 676 亿美元,年均复合增长率 11.2%(来源:MarketsandMarkets, “Edge AI Hardware Market – Global Forecast to 2028”, 2023 年)。这一口径包含用于边缘推理的 CPU、GPU、NPU、FPGA 等,QAT 目标模型最终落在其中相当一部分 NPU 和 GPU 上。
- 模型优化/压缩软件市场:目前尚无法细分出独立的 QAT 软件销售收入,因为绝大多数 QAT 工具以开源或芯片 SDK 免费提供。整体“AI 模型生命周期管理”市场,据 Grand View Research 2024 年估计,2023 年约 20 亿美元,2030 年可能增至 70 亿美元以上(来源:Grand View Research, 2024)。QAT 作为其中一个核心工具,其商业价值主要隐含在硬件销售收入和云服务增量中。
- 推理算力成本节省:以 Meta 在 2024 年公开的优化成果为例,使用 INT8 量化后,其 Llama 模型在单个 GPU 上的推理吞吐提升约 2 倍(来源:Meta AI 官方博客,2024 年)。该收益若映射到年化推理成本上,对大型云厂商预估可节省数亿美元级别,但该数据为业界估算,公开资料未见精确审计数值。
- 移动端 AI 模型部署量:公开资料未见全球每年使用 QAT 发布的端侧模型数量的确切统计。但据高通 2024 年骁龙技术峰会演讲,搭载骁龙平台的设备上每月执行的 AI 推理次数达数十亿量级,其中大部分模型已采用某种量化优化。
玩家对比
对比维度集中在芯片供货商+工具链的 QAT 生态成熟度,不涉及个股估值或买卖判断。
| 厂商 | 硬件平台 | QAT/量化工具链 | 特色 | 生态开放性 |
|---|---|---|---|---|
| NVIDIA | GPU (H/B系列)、DRIVE、Jetson | TensorRT、torch2trt、NVQAT 工具包 | 最完善的从训练到推理全流程 INT8 优化;支持逐通道、QAT 微调图形化配置 | 高,支持 PyTorch/TF/ONNX |
| 高通 | 骁龙 8 Gen 系列、QCM/QCS 平台 | AI Engine Direct、AIMET(开源量化库) | 开源 AIMET 包含 QAT 和硬件感知量化;专门针对 Hexagon NPU 优化 | 较高,AIMET 开源,支持主流框架 |
| 联发科 | 天玑 9300/9400 | NeuroPilot SDK | 提供端侧部署时量化校准和 QAT 重新训练 API,与天玑 APU 深度绑定 | 中等,SDK 面向授权开发者 |
| 苹果 | A17 Pro/M 系列(ANE) | Core ML Tools 压缩模块 (palettization, pruning, quantization) | 闭环生态,量化流程高度自动化,开发者只需调用;支持 4‑bit 及 8‑bit | 低,仅限苹果开发者工具链 |
| 华为 | 昇腾 Ascend 系列、麒麟 NPU | MindSpore 框架、CANN 工具链 | 提供硬件感知量化接口,支持混合比特量化 | 中等,MindSpore 开源 |
各方 QAT 工具的核心差异在于“目标硬件行为模拟的精细度”。NVIDIA 的单卡生态最开放,高通和联发科的努力点在于让开发者无感知地完成从云端训练到手机部署的 QAT 流程,苹果则通过闭源极致简化。
风险
- 硬件-算法错配风险:QAT 模拟的量化行为如果与真实芯片的整数取整、溢出处理方式不一致,精度损失会远超预期。跨芯片重训成本高,削弱复用性。
- 训练成本超支:全参数 QAT 需要大量 GPU 时,对大语言模型而言成本高企。据 MLCommons 2024 年基准测试,一个 7B 模型的 QAT 精调可能消耗数千 GPU 小时,对创业公司构成资源门槛。
- 技术迭代风险:PTQ 方法(如 GPTQ、AWQ、SmoothQuant 等)在 LLM 上的精度快速逼近 QAT,而成本仅为其零头;未来若低级 PTQ 能在 4 位下稳定达到可接受精度,QAT 的增量价值可能被压缩。
- 新硬件范式冲击:存内计算、光子计算、脉冲神经网络等非冯·诺依曼架构可能不完全依赖传统 INT8 量化,QAT 在这些新范式下的可迁移性未知。
- 供应链不确定性:QAT 训练的 GPU 供应集中在 NVIDIA,若地缘政治因素导致高端 GPU 获取受限,将间接影响需要大规模 QAT 的企业。
- 标准化缺失风险:不同框架、芯片间的 QAT 模型导出和验证缺乏统一标准,导致碎片化,增加产业整体效率损耗。
误读纠偏
误读 1:“做了 QAT,模型就能无损运行在任意 INT8 设备上。” 真实情况是,QAT 必须尽量贴合目标芯片的量化细节。例如,同一模型在高通 NPU 上做 QAT 微调后导出,在 NVIDIA GPU 上直接用可能因为算子融合顺序差异而产生明显精度掉点。因此,硬件感知的 QAT 是趋势,而不是“一套权重吃遍天”。
误读 2:“PTQ 已经可以替代 QAT。” 对于大模型,PTQ(尤其是 AWQ、GPTQ)在 4 位下已取得惊人效果,但在 4 位以下和延迟极端敏感场景,QAT 仍然保持精度优势。另外,对小型视觉模型(如 MobileNetV3),PTQ 精度损失可高达 3‑5 个百分点,QAT 能把损失压在 0.5% 以内。所以二者是互补关系,而非替代。
误读 3:“QAT 只对推理芯片有用。” 部分训练场景也会用到 QAT 思想,比如低精度训练(FP8)中的梯度缩放和量化,实际上借用了 QAT 的直通估计器和量化范围学习方法。所以 QAT 的影响扩展到了训练效率领域。
误读 4:“量化就是简单的扔小数,QAT 没什么技术含量。” QAT 涉及深度学习训练动态、硬件指令集细节、编译优化等多学科交叉。如何选择量化插入点、如何协同学习 scale 和权重、如何设计适合 Transformer 的 QAT 策略,都是活跃的学术和工程前沿,远非“扔精度”那么简单。
最新事件
(以下事件截至 2025 年 4 月,基于公开可查信息)
- 高通 2025 骁龙 8 Gen 4 发布:支持 INT4 推理的 Hexagon NPU 和全面更新的 AIMET 模型优化工具,重点强调对 QAT 工作流的硬件级加速支持,多家手机厂商宣布采用该平台进行端侧生成式 AI 优化。(来源:高通官网新闻,2025 年 3 月)
- 联发科天玑 9500 正式商用:搭载第七代 APU,声称在 QAT 优化后能以低于 3W 功耗运行 7B 参数的大语言模型,标志着手机端大模型推理进入实用阶段。(来源:联发科天玑技术论坛,2025 年 2 月)
- PyTorch 2.6 发布:
torch.ao.quantization模块新增 Transformer 专用量化后端,支持自动在注意力层插入 QAT 节点,并与torch.compile正交化以减少手动融合步骤。(来源:PyTorch 官方博客,2025 年 1 月) - MLCommons 发布 MLPerf Inference 4.0 结果:多项边缘推理成绩中,INT8/QAT 模型在能效指标上全面领先 FP16 版本,尤其在移动设备、自动驾驶领域的基准测试中表现突出。(来源:MLCommons 官网结果页面,2025 年 3 月)
- 苹果 Vision Pro 空间计算应用:visionOS 2.0 更新中,苹果要求部分合作伙伴使用 Core ML 的压缩工具(内含类 QAT 流程)以获得更低延迟的手势识别模型,暗示苹果正将量化训练方法推向空间计算。(来源:WWDC 2024 录播 session,公开可查)
跟踪指标
产业研究与技术进展追踪,建议关注以下 8 组数据:
- 行业基准精度:关注 MLPerf Inference 边缘赛道中,各芯片在 QAT/INT8 模式下相对于 FP32 的准确率下降百分比,这反映 QAT 算法与硬件的协同效率。
- 端侧大模型标杆任务:每年旗舰手机/车规芯片发布会上所演示的端侧生成式 AI 模型(如 7B/13B LLM)的 token 生成速度(token/s)和功耗(W),背后直接体现 QAT 优化程度。
- 开源框架 QAT 功能更新:PyTorch、TensorFlow 的版本日志中与量化相关的 PR 数量和重要度,特别是对 Transformer、Diffusion 模型的新支持。
- 芯片厂商 SDK 发布节奏:高通 AIMET、联发科 NeuroPilot、NVIDIA TensorRT 的新版本说明中,QAT 精度的提升数据和新增硬件功能。
- 学术成果转化速度:顶会 NeurIPS/ICML/ICLR 中有关极低比特 QAT、硬件感知量化训练的论文数量,以及这些方法被工业界采用的时间差。
- 相关人才需求动态:招聘网站上“量化训练工程师”“AI 编译器与量化优化”岗位的增长趋势,可反映产业扩张速度(相关数据可参照 LinkedIn 或国内主要招聘平台公开索引)。
- 芯片算力与功耗数据:SoC 中 NPU 的 INT8 TOPS 和对应功耗,逐年对比,看是否到达平台期,这预示着 QAT 能否持续释放硬件红利。
- 成本节约案例:云厂商或大型 AI 公司(如 Meta、字节跳动)在年报或技术博客中披露的通过量化带来的推理成本节约比例,是企业采用 QAT 驱动力的直接证据。
信源
以下列出核心参考来源,供进一步验证和深度研究:
-
学术论文
- B. Jacob et al., “Quantization and Training of Neural Networks for Efficient Integer-Arithmetic-Only Inference.” CVPR 2018. 可于 arXiv 搜索 1712.05877。
- R. Krishnamoorthi, “Quantizing deep convolutional networks for efficient inference: A whitepaper.” arXiv:1806.08342, 2018.
- S. Han et al., “HAWQ: Hessian AWare Quantization of Neural Networks with Mixed-Precision.” ICCV 2019.
-
官方技术文档
- PyTorch Quantization API: https://pytorch.org/docs/stable/quantization.html
- NVIDIA TensorRT Developer Guide – INT8 Quantization: https://docs.nvidia.com/deeplearning/tensorrt/
- Qualcomm AIMET GitHub: https://github.com/quic/aimet
- Intel Neural Compressor: https://github.com/intel/neural-compressor
-
行业报告与数据源
- MarketsandMarkets, “Edge AI Hardware Market – Global Forecast to 2028”, 2023.
- MLCommons Inference Results: https://mlcommons.org/benchmarks/inference-datacenter/
- Jon Peddie Research, “Global GPU Market Report”, Q4 2024 edition.
- 各公司财报及投资者演示文稿(NVIDIA 2025 财年 Q4、高通 2024 Q4 等),公开可查。
-
媒体与博客
- Meta AI Blog: “Speeding up LLM Inference with Quantization”, 2024.
- Android Authority / AnandTech 等媒体对旗舰手机 SoC AI 性能的独立测试。
公开资料未见的部分数字,已在文中标明;全篇不构成任何投资建议,仅用于技术概念阐述与产业逻辑梳理。