Quantization
3 秒看懂
- Quantization(量化) 是把神经网络中高精度的浮点参数和激活值(如 32 位浮点 FP32)映射到低位宽的整数或定点表示(如 INT8、INT4)的技术。
- 目的是大幅压缩模型体积、减少内存占用、提升推理速度,同时尽量保持模型准确度不降。
- 已成为大模型轻量化部署、端侧 AI 和云端降本增效的核心手段,几乎所有主流推理框架和 AI 芯片均提供硬件加速支持。
3 分钟产业解释
量化可类比为“给模型做有损压缩”:用更小的数据容器去近似原来的数值,保存下来的不再是 32 位的精确浮点数,而是 8 位甚至 4 位的整数索引。因为神经网络的参数和特征图数值通常集中在一定范围内,且对微小扰动具备一定鲁棒性,所以这种压缩造成的精度损失往往可控。
在产业实践中,量化路线分为两大类:
-
训练后量化(Post‑Training Quantization, PTQ) 不修改训练流程,直接对预训练好的 FP32 模型进行校准和量纲转换,快速得到 INT8/INT4 模型。代价是可能损失少量精度,特别是对于小模型或低比特量化。
-
量化感知训练(Quantization‑Aware Training, QAT) 在训练或微调时模拟量化误差,让模型学会适应低位宽表示。精度保留效果更好,但需要重新训练或微调,计算成本更高。
产业界的需求驱动来自两端:云端大模型推理成本急剧上升,需要 INT8/FP8/INT4 降低单次推理的算力与显存开销;终端侧(手机、汽车、IoT)算力与功耗严格受限,量化几乎是模型落地的必选项。支持的精度等级已从传统的 FP32→FP16/INT8 演进到 FP8(如 Nvidia H100 的 Transformer Engine)、INT4,甚至正在探索 INT3/INT2 与 1 比特二值网络。
产业链上的玩家:AI 芯片公司(英伟达、高通、Intel 等)在硬件上提供专门的低精度张量计算单元;框架侧(TensorRT、ONNX Runtime、OpenVINO、PyTorch 生态)提供一键量化工具;同时涌现了一批以算法创新驱动的量化方案公司或开源项目(例如围绕 GPTQ、AWQ、bitsandbytes 等技术形成生态)。量化已经成为大模型 Scaling Law 下降低推理 TCO 的必选项,是“软件定义硬件效率”的关键杠杆。
15 分钟专家深入
量化的本质是数值映射与反量化:
- 设定量纲范围(例如对激活值统计出最小值/最大值,或使用学习得到的 scale 和 zero point)。
- 将连续数值离散化到 N 个整数台阶,存储整数值。
- 推理时(或部分场景训练时)将整数值反量化回浮点数,与后续算子的高精度数据交互。
但产业界的实践远比这个复杂。实际部署中,量化精度损失的来源包括:
- 权重与激活的分布不匹配:权重分布通常接近高斯或拉普拉斯,而激活值分布随输入变化剧烈,离线校准可能无法覆盖长尾分布。
- 层间误差传播与累积:低位宽(特别是 4 比特以下)时,浅层的微小误差在深层被逐步放大,造成最终精度坍塌。
- 混合精度与算子分工:某些敏感层(如注意力 softmax、层归一化)对精度要求高,通常保留更高精度或单独量化方案;而大型矩阵乘法则可以承受激进量化。因此工业界主流方案是“混合精度量化”:自动或手动地为不同层分配不同 bit-width。
进一步,近年来的关键进展在于 大语言模型(LLM)的权重量化,典型方案如:
- GPTQ:基于 Hessian 信息逐层优化量化权重,在单 GPU 上将 175B 级别模型压缩到 4‑bit 权重,推理时内存大幅减少。
- AWQ:通过分析“重要通道”的保护机制,在 INT4 甚至 INT4/INT8 混合配置下实现接近无损的 7B/13B 模型部署。
- bitsandbytes 的 4‑bit NormalFloat:采用非均匀量化的信息论最优分布,使得 4 比特加载 + 16 比特计算成为主流实践,直接驱动了 HuggingFace 生态的 LLM 消费级部署。
在硬件支持层面,现代 AI 芯片的 Tensor Core / 神经处理单元 内部通常支持 INT8,甚至 INT4/FP8 的融合乘加,使得量化后的实际推理吞吐可达数倍于同代 FP16。例如,在 Nvidia H100 上,FP8 Tensor Core 的峰值算力是 FP16 的 2 倍,能够直接加速 Transformer 模型。这类硬件与软件算法的协同进化,正在将量化推向 4‑bit 推理常态化和 2‑bit 探索阶段。
需要注意,量化与稀疏化的结合(权重剪枝后进一步量化)以及条件计算(MoE 中只激活部分专家,激活参数远小于总参数量后再量化)正在共同塑造“极致高效推理”的技术栈。
技术原理
量化计算的完整过程可抽象为:
-
统计参数的范围或直接设定 scale/zero point。
对于对称量化:quantized_value = round(clip(fp_value / scale, -128, 127))
对于非对称量化,额外引入零点:quantized_value = round(fp_value / scale + zero_point) -
推理时的混合精度序列(典型路径):
- 输入的 INT8 激活与 INT8 权重进行矩阵乘累加,结果存为 INT32(避免溢出)。
- 累加结果经过 Requantize(再次缩放)转为 INT8,传递给下一层。
- 对高敏感算子,如 LayerNorm、Softmax,仍以 FP16/FP32 执行,边界处由量化/反量化节点连接。
下面是简化的量化计算图(以对称 INT8 卷积为例):
FP32 权重 ──(calibration)──→ INT8 权重
FP32 输入激活 ──(calibration)──→ INT8 激活
↓
INT8 矩阵乘累加 (INT32 累加)
↓
Requantize (缩放+截断)
↓
输出 INT8 激活 → 下一层
(或用反量化转 FP16 供 softmax 等)
量化面临的关键取舍及参数:
-
Scale 粒度:
- Per‑tensor:整个张量共用一个 scale,开销低但精度损失大。
- Per‑channel:每个输出通道独享 scale,对大模型权重量化提升明显。
- Per‑group(如 128 个元素一组):更细粒度,常用于 4‑bit 权重量化,需要额外存储 scale 和 zero。
-
对称 vs 非对称:
对称量化零点固定为 0,运算更简单,硬件友好;非对称可更好利用数值区间,但计算时需处理零点偏移,在部分 INT8 推理引擎中有开销。 -
动态量化:激活值在运行时统计最值并实时量化,无需离线校准,内存占用和延迟均有一定代价,常用于 NLP 模型中。
-
模拟量化的 Straight‑Through Estimator (STE):QAT 时,前向通过量化函数,反向传播时假设其梯度为 1(或 clip 内为 1,外为 0),让模型能“穿透”不可微的量化步骤进行学习。
技术演进史
- 2010 年代前期:深度学习全精度为 FP32,CPU/GPU 均以浮点为主,量化仅限于信号处理领域。
- 2017:TensorFlow Lite 等移动端框架推动 INT8 定量计算,Google 提出 Quantization Aware Training 并开源工具,同期英伟达 TensorRT 加入 INT8 支持。
- 2018‑2019:混合精度训练(FP16 + FP32 主副本)通过论文《Mixed Precision Training》和 Apex 等工具普及,训练侧开始接纳半精度;推理侧 INT8 成为标配。高通、苹果、华为等 SoC 中 NPU 均硬件加速 INT8。
- 2020‑2021:学术界开始探索 4‑bit 量化(如 LSQ、QAT4),PyTorch 生态推出 FX 量化工具链,ONNX Runtime 支持成熟的量化工作流。
- 2022‑2023:大模型爆发,GPTQ(2022 末)和 AWQ(2023)等专为大语言模型设计的 4‑bit 权重量化方法问世,大幅降低多卡部署门槛。bitsandbytes 的 4‑bit 量化 + PEFT(参数高效微调)组合成为社区标准。
- 2024‑2025:Nvidia Blackwell 等新一代 GPU 推动 FP4 推理,硬件首次官方支持 4 比特浮点。量化进入“推理常态 4 比特,训练低精度探索”阶段,MoE 量化、量化+稀疏、KV‑Cache 量化等新方向活跃,量化方法与模型结构深度耦合。
技术路线对比
| 维度 | PTQ (训练后量化) | QAT (量化感知训练) | 权重量化 (Weight‑only) |
|---|---|---|---|
| 是否需要重训 | 否 | 需要微调/训练 | 否 (大多) |
| 精度损失 | 中~高(尤其 INT4/小模型) | 低~中 | 激活仍高精度,精度损失可控 |
| 代表应用 | 快速压缩已训模型,端侧推理 | 高精度要求场景,如视觉检测 | LLM 部署,显存压缩(GPTQ/AWQ) |
| 计算加速 | 矩阵乘在低精度加速,整体加速显著 | 同等加速 | 权重低精度节省显存带宽,但激活仍高精度,加速主要来自降低显存占用和批处理变大 |
| 硬件依赖 | 须支持 INT8/INT4 计算单元 | 同 PTQ | 要求硬件能接收低精权重,但计算用高精度(如 FP16),通用性好 |
| 典型比特宽度 | INT8, INT4 | INT8, INT4 | INT4, INT8, 混合 FP16 |
注:传统对称量化 vs 非对称量化的选择通常嵌入在上述路线中,而非独立路线。另外,除上述外还出现了仅激活量化(保持权重高精度)和 FP8 训练量化等新兴范式。
上下游
上游:模型生产与训练
- 训练框架(PyTorch、JAX、TensorFlow)提供 QAT 模拟与高阶 API。
- 预训练模型厂商(Meta、Google、OpenAI 等)在发布模型时可同步提供量化版本或校准所需数据,影响下游量化方案的选择。
中游:量化工具链与编译器
- 推理优化框架:NVIDIA TensorRT、Intel OpenVINO、ONNX Runtime、TFLite、Qualcomm SNPE、Apple Core ML 等,封装了面向各自硬件的 PTQ/QAT 工具。
- 专用量化库:bitsandbytes(CUDA 4‑bit 权重)、llama.cpp 的 GGUF(整数权重量化)、AutoGPTQ、AWQ 等。
- 模型格式与编译层:MLIR、IREE 等编译器在 IR 层插入量化/反量化节点,支持混合精度图优化。
下游:硬件与部署场景
- 云端推理卡:数据中心 GPU(NVIDIA H100/B200 等)和 AI 加速器(Google TPU、AWS Inferentia),硬件 Tensor Core 支持 INT8/FP8;Blackwell 架构(B200 等)进一步引入原生 FP4/INT4 张量核。
- 边缘与端侧 SoC:手机 AP(骁龙、天机、A/M 系列)、汽车智驾芯片、IoT MCU/专用 NPU,大多兼用 INT8 加速。
- FPGA/ASIC 定制推理:如 Lattice、Xilinx 常用于超低延迟视频分析的 INT8 网络。
整条产业链以“训练一次,量化多处部署”模式运行,量化成为模型从“研发”流向“生产”的标准工艺节点。
关键指标
衡量量化效果的主要指标包括:
- 模型准度:通常以全精度模型为基线,衡量量化后 Top‑1 准确率、困惑度(perplexity)或下游任务分数的下降幅度。理想情况是<0.5%损失。
- 压缩比与速度比:模型体积压缩比(如 FP32→INT8 理论 4×),实测推理速度加速比(受带宽、计算利用率和算子融合影响,并非总是线性提升)。
- 校准数据量:PTQ 需要的校准样本数量,直接影响部署效率和鲁棒性。
- Scale 与 zero point 存储开销:对于细粒度量化(如 group‑128 的 4‑bit 量化),额外元数据可能占用 ~0.5 bit/元素,需纳入压缩率计算。
- 推理内存峰值:量化可显著降低权重的显存占用,但对激活内存的回收依赖运行时内存管理,对大型模型影响巨大。
示例指标范围(通用经验,非特定产品):
- 视觉模型 ResNet‑50 在 INT8 量化后,Top‑1 准确率下降 <1%,吞吐提升 2‑4 倍(在优化硬件上)。
- LLM 7B 模型经 4‑bit 权重量化,推理显存从 ~14 GB(FP16)降至 ~4‑5 GB,可在消费级 GPU 运行。
供需与市场数据
根据多家机构预测,AI 推理市场正在经历从训练成本主导向推理成本主导的转换,推理算力需求年复合增长率超过 40%。在推理 TCO (总拥有成本)中,模型体积压缩和加速技术是最直接的优化杠杆,量化在其中占据核心地位。
- 端侧 AI 推理:预计未来两年内,出货的智能手机与 PC 中超过 50% 将具备本地运行 10 亿+参数模型的能力,关键使能技术即 INT4/INT8 量化。(来源:综合行业白皮书估算,非单一厂商披露)
- 云端大模型 API 服务:经过量化的模型可将每次推理的算力成本降低 30‑60%,这对于单次推理成本以美分计的超大规模 API 而言是巨大节约。([行业估算])
- 量化工具生态:Hugging Face 上超过 50% 的 Llama 系模型衍生版本采用 4‑bit 或 8‑bit 量化格式上传,显示社区对量化的强需求。([可观测开源社区数据])
需求端,云服务商、企业私有化部署的模型越来越多地“默认”提供 INT8/FP8 量化版本;供给端,硬件厂商将低精度支持作为芯片竞争力的核心卖点,推动更低位宽(如 FP4)标准化。
代表公司与资本映射
- 英伟达 (NVIDIA):其 TensorRT 和最新 Transformer Engine(FP8)是量化推理标杆;GPU 架构内置 INT8/FP8/FP4 张量核;CUDA 生态中的 bitsandbytes 等库强化了其硬件对社区量化方案的支持。
- 高通 (Qualcomm):移动端 AI Engine 对 INT8 加速成熟,提供 AIMET 量化工具集,与智能座舱和手机芯片绑定。
- 苹果 (Apple):Core ML 框架支持 INT8/FP16 量化,神经引擎硬件配合 M 系列芯片提供低功耗高性能。
- 英特尔 (Intel):OpenVINO 支持 INT8/INT4/FP16 量化,Xeon 处理器内置 VNNI 指令集加速 INT8 推理。
- AMD:ROCm 生态逐步补全对 INT8/INT4 的支持,尤其通过 MIGraphX 量化工具。
- 开源/初创生态:围绕 GPTQ、AWQ 形成社区,一些初创公司(未上市)专注于自动混合精度与模型压缩平台,直接服务于 MLOps 效率提升。
产业映射:大模型推理效率提升直接影响云服务毛利率,因此推理优化工具链和硬件持续获得产业投入。量化作为推理增效的核心技术,是 AI 基础设施中的重要工程环节;具备自动量化、精度校准和部署监控能力的软件公司更容易进入生产工作流。
产业观察
- 推理降本需求明确:模型的规模化部署正在放大推理成本压力。量化是常见的降本技术之一,但采用比例取决于模型结构、精度容忍度、硬件支持和上线风险控制。
- 硬件升级与量化深度绑定:每一代新 AI 芯片若没有更好的低位宽支持将无法体现代际性能飞跃,这加强了芯片公司推动量化的商业动机,也使得量化生态硬件锁定效应增强。
- 端侧 AI 是增量爆发点:手机、PC、汽车等领域对功耗和内存敏感,量化能力直接决定模型的可用性,相关 IP 和工具提供商会受益。
- 风险:精度损失导致的商业事故:在金融、医疗等高风险场景,若过度量化导致模型出错,可能引发业务风险,因此高可靠性部署仍需审慎选择混合精度方案。
- 技术替代风险:非量化的压缩技术(如蒸馏、剪枝、高效架构设计),或新计算范式(如模拟计算),可能会弱化量化的独特价值。但短期看,量化仍是最具普适性的方法。
常见误读纠偏
-
“量化就是简单地小数点右移”
现代神经网络量化远不止整数化,涉及校准、混合精度、敏感层分析、融合图优化等一系列工程。简单的全局截断量化往往导致巨大精度下降,不可用于生产。 -
“量化后模型速度会提升 N 倍,其中 N = 原始位宽 / 量化位宽”
实际加速比受内存带宽、计算瓶颈、算子融合程度、量化/反量化开销等多重因素影响,很少达到理论线形。尤其是 weight‑only 4‑bit 量化主要节省显存,计算可能并未大幅提升吞吐,更大的意义在于可以用更少的卡运行更大的模型,或者提升单卡 batch 大小。 -
“QAT 总是比 PTQ 好”
如果校准数据充足且模型本身对噪声鲁棒,部分 PTQ 方案(尤其是针对 LLM 的 GPTQ、AWQ)精度损失可忽略,而 QAT 需要训练资源,在无法获取原始训练数据的场合不可行。选择取决于资源与精度要求。
学习路径
- 基础理论:理解整数量化与浮点格式(IEEE 754),学习线性量化原理(scale、zero point、对称/非对称)。
- 动手实验:使用 PyTorch 的 FX 量化或 TensorFlow Lite Converter,对 MobileNet 或 BERT 模型进行 PTQ,观察精度与速度变化。
- 深入理解:阅读核心论文《Quantization and Training of Neural Networks for Efficient Integer-Arithmetic-Only Inference》《Learned Step Size Quantization (LSQ)》《GPTQ: Accurate Post‑Training Quantization for Generative Pre‑trained Transformers》《AWQ: Activation‑aware Weight Quantization》。
- 系统与硬件:学习 Nvidia TensorRT 量化文档、ONNX Runtime 量化工具链、以及 bitsandbytes 源码,了解 CUDA kernel 中如何高效执行 INT8/INT4 矩阵乘。
- 前沿追踪:关注 2024‑2025 年的 MoE 量化、FP4 训练/推理、量化与稀疏化的联合设计等方向。
一句话总结
量化,是深度学习模型从实验室走向规模化、实时化、低成本部署的必经压缩工艺,也是当前 AI 效率革命中被硬件与算法同时加速的核心杠杆。
延伸阅读与来源
- 经典论文:B. Jacob et al., “Quantization and Training of Neural Networks for Efficient Integer-Arithmetic-Only Inference”, CVPR 2018.
- LLM 量化里程碑:E. Frantar et al., “GPTQ: Accurate Post‑Training Quantization for Generative Pre‑trained Transformers”, ICLR 2023.
J. Lin et al., “AWQ: Activation‑aware Weight Quantization for LLMs”, MLSys 2024. - 混合精度训练:P. Micikevicius et al., “Mixed Precision Training”, ICLR 2018.
- 行业趋势:英伟达 GTC 技术博客(Transformer Engine and FP8)、高通 AIMET 白皮书、Intel OpenVINO 量化技术文档。
(注:本页未直接引用特定公司财报数字,具体产品性能参数请以各厂商最新发布为准。)