模型层 开放阅读

量化

Quantization

概念 ID
quantization-2
更新时间
2026-05-29
来源数量
待补

量化

3 秒看懂

量化是把深度学习模型中用 32 位浮点数(FP32)存储的权重与激活,转换为更低位宽的整数(如 INT8、INT4)来表示,从而大幅压缩模型体积、加快推理速度并降低能耗——代价是引入可控的精度损失。其核心逻辑是建立浮点值与整数值之间的映射函数,并在模型导出时做一次校准或微调,以维持模型效果。

3 分钟产业解释

在 AI 工程化中,巨型语言模型动辄数十亿参数,单卡甚至多卡都很难放下,推理延迟与 TCO 直接制约产品化。量化正是把“重型”浮点算子置换成低位整数运算的关键技术:

  • 价值链条:权重压缩至 1/4(INT8)– 1/8(INT4),显存压力骤降,带宽瓶颈缓解;整数运算吞吐量在 GPU/NPU 上远高于浮点,能实现 2–4 倍理论加速。
  • 落地形态:云端推理常用训练后量化(PTQ),只需少量无标签校准样本即可完成;高精度场景(如医疗、金融)更倾向量化感知训练(QAT),在原始训练流程中模拟量化噪声。
  • 大模型特需:FP16 已成为推理标配,进一步下探到 INT4 甚至 INT3 正由 GPTQ、AWQ、bitsandbytes 等工具推动,使 175B 模型能在消费级 GPU 上运行,直接催化本地化部署浪潮。

量化不是“有损压缩”的一刀切取舍,而是一场精度与效率的工程设计博弈,现代方案已能让 INT4 模型与 FP16 基线在多个 benchmark 上相差不到 1%。

15 分钟专家深入

量化本质是从高精度实数域 R 到低精度整数环 Z 的离散映射。对一个张量 r,通用仿射映射为:

r = S * (q − Z)

其中 S(尺度因子)是浮点数,Z(零点)是对应于实数 0 的整数值,q 是量化后的整数。若强制 Z = 0,即为对称量化——有利于硬件简化计算,但对有偏分布的激活可能不友好;保留 Z非对称量化能更好地覆盖区间,代价是推理需额外做零点补偿。

关键维度

  • 量化粒度
    张量级(一个 S 用于整个张量)成本最低但损失大;通道级(卷积层按输出通道独立量化)是目前 CV/NLP 主流;子通道/组级(如 128 个元素共享一个 S)在 LLM 量化中盛行,兼顾精度与开销。
  • 校准策略:决定 SZ 的过程。常用 MinMax(直接取极值),MSE(最小化重建误差),或 KL 散度 校准(截断部分离群值以换取更密表示)。
  • 量化感知训练(QAT):在前向 pass 插入伪量化节点(fake quantization),反向使用直通估计器(STE)传递梯度,使模型权重适应量化噪声。
  • 训练后量化(PTQ):无需训练,通过在校准集上统计激活范围确定量化参数。大模型时代衍生出 Weight-Only 量化(仅权重量化,激活保留 FP16,如 GPTQ、AWQ)和 动态量化(推理时根据输入动态算 S/Z),以规避激活离群值难题。
  • 混合精度:对敏感层(如 attention 输出、首尾层)保持高精度,非敏感层激进低位宽,用少量性能换取整体精度保持。

产业中常见的量化配置被固化为 TensorRT、OpenVINO、TFLite 等推理引擎的优化选项,开发者只需指定目标位宽与校准集即可完成转化。

技术原理(最深)

量化数学与映射

采用仿射映射公式:

real = scale * (quant - zero_point)

若张量 X 分布范围为 [min, max],对称量化(INT8)下:

scale = max(|min|, |max|) / 127
zero_point = 0
q = clamp(round(real / scale), -127, 127)

量化误差源于rounding(最近舍入带来的 ±0.5 LSB 误差)与 clipping(超出范围的饱和截断)。逐通道放大建模能力,使误差分散。

伪量化节点与 STE

在 QAT 图中:

output = scale * (clamp(round(input / scale) + zero_point, qmin, qmax) - zero_point)

前向是量化-反量化恒等函数,反向求导时将 round 梯度视为 1(STE),误差信号反向传播。本质是让权重在训练时即习惯于离散表示。

大模型量化难点与解法

  • 离群特征:LLM 中某些特征维度数值极大,导致单个 scale 无法兼顾。LLM.int8() 方案将异常维度分离为 FP16 乘法,其余做 INT8;SmoothQuant 通过数学等价变换将量化难度从激活转移到权重。
  • 极低位宽:INT4 下每个权重仅用 4bit,GPTQ 利用近似二阶信息逐列量化并补偿剩余权重;AWQ 按激活分布“显著度”对权重做保护性缩放;QLoRA 则量化基础模型,用 4bit 权重加低秩适配器省去前向全解量化的需要。
简化的 4bit 权重矩阵(GPTQ 风格)
原始 W: [0.23, -1.45, ...]  →  W_q: [3, -6, ...]  (4bit signed int)
S = max(|W|)/7(或分区)
重建误差 E = ||WX − S*(W_q)*X|| 逐列贪婪补偿

硬件亲和性

多数 GPU 通过 Tensor Cores 提供高效 INT8 矩阵乘(如 NVIDIA A100 可达 624 TOPS INT8,相比 FP16 的 312 TFLOPS 理论提升)。INT4 推理一般需通过 INT8 张量核模拟实现,H100 并未配备原生 INT4 张量核;专用边缘 NPU 可能原生支持 INT4。量化方案的选取必须与目标硬件的指令集对齐——像素分组、内存对齐等约束影响实际加速比。

技术演进史

  • 萌芽期(2015–2017):BinaryConnect、XNOR-Net 探索二值/三值网络,学术意义大于产业实用。Google 提出全整数量化推理(TF-Lite),使移动端部署可行。
  • INT8 产业化(2018–2020):NVIDIA TensorRT 推出 INT8 校准工具,Intel 开放 VNNI 指令集,高通 Hexagon DSP 全面铺开。此时 PTQ 成为计算机视觉模型的标准部署步骤。
  • 混合精度与训练(2019–2021):QAT 方案成熟,PyTorch、TensorFlow 内置伪量化 API;NVIDIA 引入 TF32 格式在 A100 中关联 FP32 精度与半精度吞吐的折中。
  • 大模型量化爆发(2022–至今):LLM 规模突破百亿,催生混合精度分解方案(如 LLM.int8() 将离群特征分离为 FP16)、Weight-Only 量化(GPTQ、AWQ等)、SmoothQuant、QLoRA(2023)等,以及 FP8 训练/推理标准(NVIDIA H100 Transformer Engine)。工具链 bitsandbytes 使 4bit QLoRA 微调平民化,Hugging Face 集成多种量化后端。

技术路线对比(量化表)

方法量化对象是否需要训练/校准典型位宽精度保持主要适用场景
动态量化 (PTQ)权重(离线量化)+激活(在线统计)INT8轻微损失NLP LSTM/Transformer 权重量化+动态激活
静态量化 (PTQ)权重+激活(离线校准)需校准数据集(~100样本)INT8中等损失(需校准)CV 模型、通用生产部署
Weight-Only PTQ权重(激活保持 FP16)可选校准INT8/INT4损失低,简单LLM 推理,规避激活离群值
量化感知训练 (QAT)权重+激活(训练期仿真)完整训练流程INT8,少数 INT4损失极微要求精度严苛的场景(医疗、金融等)
低秩适配量化 (QLoRA)基础模型权重 INT4/NF4微调阶段需 adapter 数据4bit(NF4)接近全参微调大模型消费级微调与推理
FP8 混合精度参与计算的张量用 FP8训练/推理原生支持FP8 E4M3/E5M2训练稳定性优新一代 GPU 训练吞吐优化

注:4bit 权重精度指 INT4 或 data type 如 NF4(正态分布 4bit),非对称设计更有优势。

上下游

上游

  • 硬件 IP 与指令集:NVIDIA Tensor Cores (INT8/INT4/FP8)、Intel Advanced Matrix Extensions (AMX/VNNI)、Arm Neon/Helium、高通 Hexagon 标量/张量加速器。这些硬件的低精度吞吐能力定义量化方案的天花板。
  • 数据:静态量化需要代表分布的校准数据集(无需标签);QAT 需要原始训练数据。
  • 框架与编译器:PyTorch、TensorFlow 提供的量化 API,ONNX Runtime、Apache TVM、MLIR 等中间表示负责算子映射与图优化。

下游

  • 云端推理服务:降低单 token 成本是 LLM API 规模化盈利的关键,INT8/FP8 推理直接关联毛利率。
  • 边缘设备部署:手机 SoC(如 Apple Neural Engine、骁龙 NPU)广泛通过 INT8 推理实现实时滤镜、语音助手;工业、自动驾驶域控制器需确定性低延迟。
  • 端侧大模型:量化使 70 亿–130 亿参数模型在旗舰手机本地跑通,开启隐私保护型 AI 应用。

关键指标

  • 压缩比:模型体积相比 FP32 基准:INT8≈4× 缩小,INT4≈8× 缩小,INT2≈16×(但精度往往不可用)。
  • 推理加速比:实际测速受内存绑定性影响,权重张量运算可获得 2–4× 吞吐提升,部分场景受限于激活层或非计算瓶颈,整体延迟降低 30–70%(估算,未指定硬件)。
  • 精度损失:一般用 benchmark 准确率下降衡量。INT8 PTQ 在 ResNet-50 等视觉任务上可控制在 <1% Top-1 下降;LLM 的 INT4 量化在复杂推理任务上可能产生 2–5% 准确率衰减,采用 GPTQ/AWQ 可缩小至 <1% 差异。FP8 训练/推理精度与 BF16 持平。
  • 能耗比:整数运算能效显著优于浮点,INT8 操作能耗可降至 FP32 的 1/10 量级(依据行业公开研究,存在工艺差异),对边缘设备续航至关重要。

供需与市场数据

量化技术的供需并非以独立市场体现,而是深度嵌入 AI 加速器、推理服务器和边缘芯片的竞争格局。定性来看:

  • 需求端:大模型部署成本压力激增,云厂商与 AI 开发者对推理优化方案的采购意愿极强。过去一年,以 bitsandbytes、GPTQ 为代表的量化库下载量与日俱增(未公开确切数字)。
  • 供给端:硬件侧,旗舰训练/推理芯片均开始原生支持 FP8/INT8/INT4;软件侧,开源社区主导创新,商业化则依托推理引擎(TensorRT、OpenVINO)和服务生态。
  • 量化对市场的影响:它实质拉低了 AI 推理的单位经济成本,有望拓宽边缘 AI、本地化大模型应用的市场规模。但因其内化为基础设施,我们难以单独拆分其 TAM,行业报告通常将其归入“AI 推理优化软件”或“边缘 AI 工具链”子类。

限于检索工具限制,未能获取实时财务额数据,以上为根据产业动态的定性判断。

代表公司与资本映射

  • NVIDIA:通过 TensorRT 与 Transformer Engine(FP8)构建从训练到推理的闭环量化方案,是其软件护城河的关键。
  • Intel:OpenVINO 工具包主导边缘量化,配合至强内置 AI 加速器(AMX)在服务器推理市场渗透。
  • Qualcomm:Snapdragon 平台 Hexagon NPU 的量化精度与能效主导安卓端,支持 INT8/INT16 推理。
  • Apple:Core ML 将模型自动量化为适合 ANE 的 FP16/INT8,开发者几乎透明。
  • 初创企业:Neural Magic(DeepSparse 引擎,利用 CPU 稀疏+量化加速)曾获多轮融资;Hugging Face 集成了多种量化库,间接构建分发优势。
  • 资本映射:量化下游的推理优化平台及云端 AI 推理硬件公司更受资本关注,量化工具本身更多体现为开源项目,独立赛道融资事件相对稀少(未充分披露)。

投资逻辑

  1. 基础设施受益:量化让同等算力支撑更多推理请求,云 GPU 利用率和利润率提升,利好英伟达、头部云厂商及数据中心硬件。
  2. 推理芯片分化:擅长低位宽整数运算的 ASIC/NPU(如 Groq、Cerebras)对比通用 GPU 在部分推理场景中获得性价比窗口。
  3. 端侧 AI 次生红利:量化技术成熟解锁智能手机、IoT、汽车等端侧芯片的新应用场景,推动对应 SoC 设计服务与 IP 授权需求。
  4. 软件生态粘性:掌握高效量化部署工具的厂商(如 NVIDIA TensorRT 生态)可以固化开发者习惯,形成转换成本。
  5. 风险点:量化并非万能,超大模型仍存在精度—效率的折中瓶颈;若未来训练范式转向更高精度计算(如 FP32 weight 梯度累积),可能部分场景降低对低位宽需求的迫切性。

投资判断需结合个股估值与供应链核查,本分析仅展示技术关联性。

常见误读纠偏

  • 误读 1:“量化就是简单地向下取整/四舍五入”
    纠偏:工业级量化是完整的数学校准过程,涉及尺度选取、零点补偿、逐通道或组粒度分组,以及利用校准数据集最小化信息损失。仅做朴素舍入会带来巨大性能崩塌,尤其在激活值分布极度不均衡时。
  • 误读 2:“INT4 量化一定导致模型效果严重退化,所以只能用于容错场景”
    纠偏:现代大模型量化(如 GPTQ、AWQ 结合 SmoothQuant)在多数自然语言理解基准上 INT4 与 FP16 差距已缩至 1% 以内,且可以通过 QLoRA 等微调手段几乎完全恢复竞争力。许多生产级 LLM 服务已部分采用 INT4 推理。
  • 误读 3:“量化只能用于推理,不能参与训练”
    纠偏:量化感知训练(QAT)在内环中模拟量化,本身就是训练过程。更前沿的 FP8 原生训练已在 NVIDIA H100 上实现,被用于大模型训练的前向 and 部分反向传播,显著提升吞吐量。

学习路径

  1. 基础原理:阅读 Jacob et al. (2018) “Quantization and Training of Neural Networks for Efficient Integer-Arithmetic-Only Inference”;理解仿射映射、校准。
  2. 工具实战:通过 PyTorch 官方 quantization tutorial 完成一个 ResNet 静态量化,再尝试 Hugging Face 的 optimum + bitsandbytes 对 LLaMA 模型进行 4bit 加载。
  3. 进阶论文
    • LLM.int8(): Dettmers et al. “LLM.int8(): 8-bit Matrix Multiplication for Transformers at Scale” (2022)
    • GPTQ: Frantar et al. “GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers” (2023)
    • QLoRA: Dettmers et al. “QLoRA: Efficient Finetuning of Quantized LLMs” (2023)
    • AWQ: Lin et al. “AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration” (2023)
    • SmoothQuant: Xiao et al. “SmoothQuant: Accurate and Efficient Post-Training Quantization for Large Language Models” (2023)
  4. 硬件映射:阅读 NVIDIA TensorRT Developer Guide 中 INT8 calibration 章节,理解优化器如何将量化图映射到具体 kernel。
  5. 紧跟前沿:关注 MLSys、ICLR、NeurIPS 的 Efficient ML 相关 session,以及 GitHub 上 AutoGPTQllm-awq 等仓库更新。

一句话总结

量化是深度学习从实验室走向规模化部署的必经之桥——用位数换效率,映射数学与工程匠心兼备,已是大模型产业化的核心支撑技术。

延伸阅读与来源

由于本次检索工具限制,未能实时抓取外部链接,上述技术事实基于公开学术会议、白皮书及主流开源项目文档的普遍共识,具体数据点已标注为定性或估算。进一步验证可访问以下信息源:

  • 国际会议论文开放库 (arXiv, PMLR) 搜索 “quantization LLM”
  • NVIDIA、Intel、ARM 官方开发者文档中关于推理量化的白皮书
  • Hugging Face Transformers 文档中 “Quantization” 专题
  • 行业分析机构(如 Omdia、Semianalysis)发布的 AI 推断算力与模型效率报告
    阅读时需注意硬件代数差异,并优先采用经过开源社区大规模复现的方案。
source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型