后训练量化(PTQ, Post-Training Quantization)
3 秒看懂
PTQ = 模型训练完之后,不重新训练,只用少量校准数据把权重(有时也含激活值)从高精度(FP16/BF16/FP32)压到低比特(INT8/INT4/甚至更低),以换取更小的内存占用和更快的推理速度,同时尽量不掉精度。
核心交易:用”一点点校准计算”替代”全量重新训练”,在精度和部署效率之间做快速折中。
3 分钟产业解释
为什么 PTQ 在 2023—2025 年成为关键话题?
大语言模型(LLM)的参数量从数十亿飞涨到数千亿,单次推理的显存占用和延迟成本巨大。一个 70B 参数模型以 FP16 存储需要约 140GB 显存,几乎不可能在单卡上运行。PTQ 能将权重压缩到 4-bit,使显存需求降至约 35GB,单卡 24 GB 无法运行,多张消费级卡也难以可靠承载,需使用显存≥48 GB 的专业 GPU 或支持高效互联的多卡方案。
产业逻辑链:
模型越来越大 → 推理成本(显存+带宽+延迟)指数级上升
→ PTQ 是"不改模型架构、不重训"就能降低推理成本的最低门槛手段
→ 降低推理成本 → 扩大可部署硬件范围(云端→边缘/消费级)
→ 推动 AI 应用普及化
关键区分:PTQ 与 QAT(Quantization-Aware Training,量化感知训练)是两种路径。QAT 在训练过程中引入模拟量化,效果通常更好,但需要完整训练流程和算力;PTQ 只需要训练好的模型 + 少量校准数据 + 数小时的计算,门槛远低,因此在 LLM 时代成为主流方案。
15 分钟专家深入
PTQ 在 LLM 生态中的技术分层
现代 LLM 的 PTQ 已不再是简单的”四舍五入”,而是演化出多个层次的方法论:
第一层:权重量化(Weight-Only Quantization)
- 只压缩权重,激活值保持 FP16/BF16
- 代表:GPTQ、AWQ、bitsandbytes NF4、GGUF 各种方案
- 优势:实现简单,兼容性好,精度损失相对可控
- 劣势:实际计算仍需反量化到高精度做矩阵乘法,计算量不减少,但内存带宽需求大幅降低
第二层:权重 + 激活联合量化(Weight-Activation Quantization)
- 权重和激活值都量化到 INT8(W8A8)或更低
- 代表:SmoothQuant、LLM.int8()(混合精度方案)
- 优势:可以利用硬件 INT8 Tensor Core 真正加速计算
- 劣势:激活值中的离群值(outlier)是主要难点
第三层:极低比特量化(Sub-4-bit)
- 3-bit、2-bit 甚至 1.5-bit 量化
- 代表:AQLM、QuIP#、HQQ 等
- 需要更复杂的量化方案(如向量量化、码本学习)来维持可接受的精度
核心技术挑战
1. 离群值问题(Outlier Features)
Tim Dettmers 等人在 LLM.int8() 论文中发现,LLM 的激活值中存在幅度极大的离群特征,这些离群特征的幅度远超普通特征,可达数十倍差异,且集中在少数固定通道中 [Dettmers et al., 2022, “LLM.int8(): 8-bit Matrix Multiplication for Transformers at Scale”]。这一发现深刻影响了后续 PTQ 方法的设计方向。
2. 逐层误差累积
LLM 有数十到上百层 Transformer block,每层的量化误差会逐层累积放大。因此先进方法(如 GPTQ)采用逐层优化策略,在量化当前层时考虑补偿效应。
3. 校准数据敏感性
PTQ 的精度高度依赖校准数据的质量和数量。校准数据需要能代表模型的实际使用分布,数量通常在 128—512 条样本即可 [行业共识,但最优数量因模型和方法而异]。
技术原理
基础量化公式
**均匀量化(Uniform Quantization)**的基本映射:
量化值: q = round(x / s) + z
反量化: x_hat = s * (q - z)
其中:
s = (x_max - x_min) / (2^b - 1) # scale(缩放因子)
z = round(-x_min / s) # zero-point(零点,仅非对称量化)
b = 目标比特数
对称量化 vs 非对称量化:
对称量化(Symmetric):
z = 0
s = max(|x|) / (2^(b-1) - 1)
映射范围:[-2^(b-1), 2^(b-1)-1] 的整数
适合:权重(通常近似零均值分布)
非对称量化(Asymmetric):
z ≠ 0
利用完整整数范围 [0, 2^b - 1]
适合:激活值(常常非零均值,如 ReLU 后的正值分布)
量化粒度(Granularity)
量化粒度对精度和开销的影响(示意):
粒度 | scale/zp 数量 | 精度 | 存储开销(scale/zp)
─────────────────┼──────────────────┼─────────┼───────────────────
Per-Tensor | 1 个/整个张量 | 最低 | 极小
Per-Channel | 1 个/输出通道 | 中等 | 小
Per-Group | 1 个/g 个元素 | 较高 | 可控(g=64/128常见)
Per-Element | 每个元素一个 | 最高 | 与原值相当(无意义)
GPTQ/AWQ 常用:Per-Group,group_size=128
→ 每 128 个权重共享一组 scale + zero-point
→ 权重 4-bit + scale(FP16) ≈ 4.25 bit 有效位宽
主要 PTQ 方法的核心机制
1. GPTQ(Frantar et al., 2022)
核心思想:基于二阶信息的逐层最优量化
输入:训练好的模型 W,校准数据 X_cal
对每一层 l:
① 收集校准输入 X_cal 的隐层输出
② 计算 Hessian 矩阵 H = 2 * X_cal^T * X_cal(近似二阶信息)
③ 按行(逐输出通道)量化:
- 选择当前要量化的权重行
- 用 H 的逆矩阵计算最优量化误差补偿
- 将补偿误差分配到尚未量化的权重行
④ 批量更新(lazy batch)提高效率
关键特性:
- 需要 GPU 内存约等于单层模型大小(可以逐层处理)
- 校准过程对 175B 级模型可在数小时内完成 [原论文报告]
- 4-bit + group_size=128 配置下精度损失通常较小
2. AWQ(Lin et al., MIT Han Lab, 2023)
核心思想:保护"显著权重"(salient weights)
关键观察:
仅约 1% 的权重对模型输出有决定性贡献
这些权重可以通过激活幅度间接识别
方法:
① 用校准数据前向传播,统计每通道的激活幅度 |X|
② 计算 per-channel 缩放因子 s,使得显著权重通道被放大
③ 量化前对权重施加缩放:W' = W * diag(s)
④ 对 W' 执行标准量化(RTN 即可,无需二阶信息)
⑤ 推理时反向补偿:Y = X * diag(s)^(-1) * quant(W')
优势:
- 计算简单(不需要 Hessian 逆)
- 与权重专用硬件加速器兼容性好
- 在 W4A16 场景下精度表现优异
3. SmoothQuant(Xiao et al., MIT Han Lab, 2022)
核心思想:将激活值中的量化难度"迁移"到权重上
关键数学变换(per-channel):
Y = X * W
= (X * diag(s)^(-1)) * (diag(s) * W)
= X_hat * W_hat
其中 s_j = max(|X_j|)^α / max(|W_j|)^(1-α)
α ∈ [0,1] 控制迁移程度(α=0.5 是常见默认值)
效果:
X_hat 的离群值幅度被压缩(更容易量化)
W_hat 的幅度范围扩大(但权重分布本身更平滑,仍可量化)
→ 实现 W8A8 联合量化,两者都用 INT8
意义:
这是少数能真正实现"计算加速"(而非仅节省显存)的 PTQ 方法
因为 INT8 Tensor Core 在现代 GPU 上确实比 FP16 更快
4. LLM.int8()(Dettmers et al., 2022)
核心思想:混合精度分解
方法:
① 识别激活值中的离群特征通道(magnitude > 阈值)
② 离群通道(通常 < 0.1% 的维度)→ FP16 计算
③ 非离群通道 → INT8 计算
④ 合并两部分结果
意义:
首次系统揭示 LLM 激活值的离群特征现象
为后续 SmoothQuant 等方法提供了关键洞察
PTQ 方法对比示意(精度-速度-复杂度三维)
精度保持 ↑
│
│ SmoothQuant(W8A8) GPTQ(4bit) AWQ(4bit)
│ ○ ○ ○
│
│ GPTQ(3bit) LLM.int8()
│ ○ ○
│
│ RTN(4bit) AQLM(2bit)
│ ○ ○
│
└──────────────────────────────────────→ 计算加速程度
(weight-only 只省带宽,
W8A8 真正省算力)
技术演进史
| 时期 | 里程碑 | 关键意义 |
|---|---|---|
| 2016—2017 | Google 提出量化推理框架(gemmlowp),XNOR-Net 等二值化网络研究 | 学术界开始系统研究神经网络量化 |
| 2018 | NVIDIA Turing 架构引入 INT8 Tensor Core | 硬件层面为 INT8 推理提供原生加速支持 |
| 2019—2020 | TensorRT 引入 PTQ 工作流;Qualcomm/QNN 支持 INT8 NPU 推理 | PTQ 在 CV 模型上走向工程化 |
| 2022 Q2 | LLM.int8() 发布 [Dettmers et al.] | 揭示 LLM 激活离群特征,开启 LLM 专用 PTQ 研究热潮 |
| 2022 Q3 | GPTQ 发布 [Frantar et al.] | 首次实现百B级模型的高效 3/4-bit PTQ |
| 2022 Q4 | SmoothQuant 发布 [Xiao et al., MIT Han Lab] | 解决 W8A8 联合量化的激活离群值难题 |
| 2023 Q1 | AWQ 发布 [Lin et al., MIT Han Lab] | 简化且高效的 W4 方案,工程友好度高 |
| 2023 Q2 | bitsandbytes NF4 引入 Hugging Face 生态;GGUF 格式随 llama.cpp 普及 | PTQ 进入主流开发者工具链 |
| 2023 Q3—Q4 | NVIDIA Hopper FP8(E4M3/E5M2)生态落地;AQLM、QuIP# 提出 sub-4-bit 方案 | 硬件原生低精度格式 + 极致压缩探索 |
| 2024 | AWQ/GPTQ 集成进 vLLM、TensorRT-LLM 等主流推理框架;FP8 推理逐步实用化 | PTQ 从研究走向生产级部署基础设施 |
技术路线对比
| 维度 | RTN(Round-to-Nearest) | GPTQ | AWQ | SmoothQuant | LLM.int8() | AQLM |
|---|---|---|---|---|---|---|
| 类型 | 权重量化 | 权重量化 | 权重量化 | 权重+激活 | 混合精度 | 向量量化 |
| 典型 bit 宽 | 4/8 | 3/4 | 4 | W8A8 | 混合(INT8+FP16) | 2 |
| 核心机制 | 最近邻取整 | Hessian 逐层最优 | 激活感知缩放 | 难度迁移 | 离群值分离 | 学习码本 |
| 校准数据量 | 不需要/极少量 | ~128—256 样本 | ~128 样本 | ~512 样本 | ~128 样本 | 需较多 |
| 校准耗时 | 极快 | 中等(数小时@大模型) | 较快 | 较快 | 较快 | 较长 |
| 精度(4-bit) | 较差 | 良好 | 良好~优秀 | N/A(主攻 8-bit) | N/A | 可接受(2-bit) |
| 推理框架支持 | 广泛 | AutoGPTQ, TRT-LLM, vLLM | AutoAWQ, TRT-LLM, vLLM | TRT-LLM, 各推理框架 | bitsandbytes | 社区支持 |
| 是否省计算 | 否(weight-only) | 否(weight-only) | 否(weight-only) | 是(INT8 TC) | 部分 | 否(需解码) |
| 适用场景 | 快速原型/基线 | 生产级 4-bit 部署 | 生产级 4-bit 部署 | 需真正计算加速时 | FP16 显存不足时 | 极致压缩 |
注:精度表现因模型架构、校准数据、评测任务不同而差异显著,上表为行业一般认知的定性判断,非严格 benchmark 结论。
上下游
上游:PTQ 方法的”输入端”
┌─────────────────────────────────────────────────┐
│ 上游依赖 │
├─────────────────────────────────────────────────┤
│ ① 训练好的全精度模型(FP16/BF16/FP32) │
│ → 来源:OpenAI, Meta, Mistral, Google 等 │
│ → 开源权重(Hugging Face)直接可用 │
│ │
│ ② 校准数据集 │
│ → 通常取自训练集的一个小子集 │
│ → 或用 WikiText、C4 等通用语料 │
│ │
│ ③ 量化算法框架 │
│ → GPTQ (AutoGPTQ) │
│ → AWQ (AutoAWQ / llm-awq) │
│ → bitsandbytes (Tim Dettmers 维护) │
│ → TensorRT-LLM (NVIDIA) │
│ → llama.cpp (GGUF 格式支持多种量化) │
│ │
│ ④ 算力基础设施 │
│ → 校准阶段:单卡 GPU 即可(A100/H100 最优) │
│ → 推理阶段:GPU / NPU / CPU 均可 │
└─────────────────────────────────────────────────┘
下游:PTQ 的”去向”
┌─────────────────────────────────────────────────┐
│ 下游应用 │
├─────────────────────────────────────────────────┤
│ ① 云端推理服务 │
│ → vLLM + AWQ/GPTQ → 高吞吐 LLM serving │
│ → 降低每 token 推理成本(显存↓ → 批大小↑) │
│ │
│ ② 边缘/终端设备 │
│ → 手机(高通/联发科 NPU, INT8/INT4) │
│ → 笔记本/台式机(CPU 推理, llama.cpp + GGUF) │
│ → 嵌入式/机器人 │
│ │
│ ③ 消费级 GPU 部署 │
│ → 70B 模型 4-bit 量化后约需 35 GB 显存,单张 RTX 4090(24 GB)无法运行,需使用 48 GB 专业显卡(如 RTX A6000)或支持显存池化的专业多卡方案(如通过 NVLink 互联);消费级多卡方案(如 RTX 4090×2)缺乏 NVLink,仅靠 PCIe 进行模型并行带宽低且额外显存开销大,实际难以可靠运行 35 GB 级模型│
│ │
│ ④ 多模态模型压缩 │
│ → Vision-Language 模型的权重压缩 │
│ → Diffusion 模型加速(如 SDXL INT8) │
└─────────────────────────────────────────────────┘
关键指标
PTQ 模型质量评估指标
| 指标 | 含义 | 说明 |
|---|---|---|
| WikiText-2 Perplexity | 困惑度 | LLM 量化后最常用的质量指标,越低越好 |
| 下游任务精度 | MMLU、HumanEval、GSM8K 等 | 评估量化对不同能力维度的影响 |
| Human Eval / 对话质量 | 主观评估 | 量化模型在实际对话中的表现 |
| Perplexity Degradation | PPL 退化幅度 | 通常要求 < 0.5(8-bit)或 < 1.0(4-bit)为可接受 |
PTQ 工程效率指标
| 指标 | 含义 | 典型量级 |
|---|---|---|
| 校准耗时 | 完成量化所需时间 | 70B 模型 4-bit PTQ:数十分钟到数小时(因方法而异)[估算] |
| 校准内存峰值 | 校准过程 GPU 显存需求 | GPTQ 可逐层处理,峰值约等于单层大小 [行业共识] |
| 有效位宽 | 权重 + scale/zp 的平均位宽 | 4-bit + group=128 ≈ 4.06—4.25 bit(取决于实现) |
| 推理吞吐提升 | 吞吐量变化 | weight-only(省带宽)vs W8A8(省计算),效果差异大,见下文 |
| 内存节省比例 | FP16 基线对比 | 4-bit ≈ 4× 压缩(含 scale 开销后约 3.5×)[估算] |
关键区分:Weight-Only ≠ 计算加速
Weight-Only 量化(GPTQ/AWQ/W4A16):
- 权重存储为 4-bit → 推理时需反量化到 FP16 再做 matmul
- 节省的是:显存占用、权重加载带宽(Memory-bound 场景有帮助)
- 不节省的是:浮点运算次数(Compute-bound 场景无明显加速)
- 适用场景:batch_size=1 的交互式推理(Memory-bound)
W8A8 量化(SmoothQuant 等):
- 权重和激活都是 INT8 → 直接用 INT8 Tensor Core 计算
- 理论计算吞吐:INT8 TC 是 FP16 TC 的 ~2×(在支持 INT8 TC 的硬件上)
- 适用场景:高吞吐服务(Compute-bound)
实际加速取决于:
① 硬件是否原生支持对应精度(INT8 TC / FP8 TC / INT4 支持)
② 当前 workload 是 memory-bound 还是 compute-bound
③ 算子实现质量(kernel 调优程度)
供需与市场数据
需求侧驱动力
推理成本 = f(模型大小, 硬件规格, 吞吐量)
PTQ 的经济价值:
场景 A(云端推理):
FP16 70B → 需要 2×A100-80GB → $3—4/hr [估算,云实例成本]
4-bit 70B → 需要 1×A100-80GB → $1.5—2/hr [估算]
→ 单次推理成本下降约 40—60% [行业普遍认知]
场景 B(边缘部署):
FP16 7B → 14GB 内存 → 无法在手机运行
4-bit 7B → ~4GB 内存 → 可在高端手机运行
→ 使能全新应用场景
供给侧生态
| 角色 | 代表公司/项目 | 产品/方案 |
|---|---|---|
| 量化算法 | MIT Han Lab、IST Austria(GPTQ 原作者)、Tim Dettmers | AWQ、SmoothQuant、GPTQ、bitsandbytes |
| 推理框架 | NVIDIA、vLLM 社区、llama.cpp 社区 | TensorRT-LLM、vLLM、llama.cpp |
| 硬件芯片 | NVIDIA、Qualcomm、MediaTek、Apple | 含 INT8/FP8 TC 的 GPU;含 INT8/INT4 NPU 的移动 SoC |
| 模型平台 | Hugging Face | 原生集成 bitsandbytes、GPTQ、AWQ 的模型加载 |
| 云服务商 | AWS、Azure、GCP | 提供量化模型优化的推理端点 |
市场数据说明
- LLM 推理市场规模在快速增长,PTQ 作为推理优化的关键环节,其价值随推理需求增长而增长。具体市场规模数字因统计口径不同而差异较大,不做具体数字声称,建议参考 Gartner / IDC 最新报告。
- 定性判断:PTQ 已成为大模型部署的标准配置而非可选项,几乎所有生产级 LLM 推理都使用某种形式的量化。
代表公司与资本映射
直接关联
| 公司/项目 | 与 PTQ 的关系 | 资本化路径 |
|---|---|---|
| NVIDIA | TensorRT-LLM 内建 PTQ 支持;Hopper FP8/Ada FP8 硬件原生低精度;PTQ 降低推理成本→扩大 GPU 市场 | NVDA(GPU + 推理软件栈) |
| Qualcomm | Hexagon NPU 支持 INT8/INT4 推理;PTQ 使 LLM 可在手机 SoC 运行 | QCOM(移动/边缘 AI 芯片) |
| MediaTek | APU 支持 INT8 量化推理;天玑系列手机 SoC 的端侧 AI | 2454.TW(联发科) |
| Apple | Neural Engine 支持 INT8;Core ML 支持 PTQ | AAPL(端侧 AI 生态) |
| AMD | ROCm 生态量化支持;Instinct 系列推理能力 | AMD(GPU + 推理) |
间接/生态层
| 项目/公司 | 关系 |
|---|---|
| Hugging Face | 量化模型分发平台;transformers 库原生集成多种 PTQ 方法 |
| vLLM (UC Berkeley) | 开源 LLM 推理引擎,集成 AWQ/GPTQ |
| llama.cpp (Georgi Gerganov) | CPU/消费级 GPU 推理方案,GGUF 量化格式成为消费级标准 |
| Tim Dettmers(学术) | bitsandbytes 作者,8-bit/4-bit NF4 方案广泛使用 |
| MIT Han Lab (Song Han) | AWQ、SmoothQuant、Elastic 等多个量化/压缩工作的发源地 |
投资启示
PTQ 本身不是一个"独立市场",而是嵌入在推理基础设施中的技术层。
谁受益?
├── 硬件侧:PTQ 降低硬件门槛 → 扩大可服务市场(尤其边缘/消费级)
│ → Qualcomm, MediaTek, Apple(端侧推理);NVIDIA(云端推理效率提升→更多推理需求)
│
├── 推理服务侧:PTQ 降低单次推理成本 → 扩大应用
│ → 云服务商(AWS Bedrock, Azure AI 等)
│
└── 模型侧:PTQ 使开源模型可广泛部署 → 增强开源生态价值
→ Meta (LLaMA), Mistral, 聚合平台 (Hugging Face)
投资逻辑
核心投资命题
命题 1:推理成本下降 → AI 应用渗透率提升 → 整体市场扩大
PTQ 是推理成本下降的多个杠杆之一(其他包括:硬件代际升级、推理框架优化、推测解码、MoE 架构等),但它是唯一不需要改变模型架构、不需要重新训练、门槛最低的方案。
命题 2:PTQ 使能”边缘 AI”叙事
4-bit 量化是端侧 LLM 的必要前提。没有 PTQ,手机/笔记本无法运行有意义规模的语言模型。随着端侧 AI 成为各硬件厂商的核心战略(Apple Intelligence、Qualcomm AI Hub 等),PTQ 的价值持续上升。
命题 3:开源模型 + PTQ → 民主化部署
PTQ 让中小团队和独立开发者也能部署大模型,强化了开源生态 vs 闭源 API 的竞争格局。
风险与约束
- 精度上限约束:PTQ 有理论精度下限,超低比特(< 3-bit)的质量损失可能不可接受,这限制了压缩率的进一步提升
- FP8/FP4 硬件替代:随着原生 FP8(Hopper)和未来 FP4 硬件的普及,某些 PTQ 场景可能被硬件原生低精度格式替代,但 PTQ 方法论(如校准、离群值处理)仍然适用
- QAT 竞争:部分场景下,QAT 或混合方案(如 LoRA + 量化微调)可能优于纯 PTQ
常见误读纠偏
误读 1:“4-bit 量化后推理速度翻倍”
纠偏:4-bit 量化的核心收益是内存节省(约 4× 压缩),而非计算加速。Weight-only PTQ(GPTQ/AWQ)在推理时需要将 4-bit 权重反量化为 FP16 后再做矩阵乘法,浮点运算次数不变。只有在 memory-bound 场景(如 batch_size=1 的自回归解码)中,减少权重加载带宽才能间接提速。而在 compute-bound 场景(大 batch 服务),提速主要靠 W8A8 或 FP8 等真正降低计算精度的方案。
误读 2:“PTQ 精度损失可以忽略不计”
纠偏:8-bit 量化确实通常精度损失极小(PPL 退化通常 < 0.5),但 4-bit 量化在某些任务上可能存在可感知的退化,尤其是推理密集型任务(如 GSM8K 数学推理)或长上下文任务。精度损失程度高度依赖于具体模型、量化方法和评估任务。应当针对目标场景做实测验证,而非泛泛声称”无损”。
误读 3:“GPTQ 总是比 AWQ 好(或反之)”
纠偏:两者在多数基准测试上表现接近,各有适用场景。AWQ 在工程实现上更简洁,与 TensorRT-LLM 的集成更成熟;GPTQ 在某些模型架构上可能表现更好。实际选型应基于目标模型 + 目标硬件 + 推理框架的实测,而非一概而论。
误读 4:“量化只是压缩,对模型能力没有系统性影响”
纠偏:量化本质上是一种有损近似,不同能力维度受量化的影响不同。一般而言,知识密集型任务(如事实性问答)比模式识别任务(如情感分类)更耐量化;而复杂推理链和精确数值计算对量化更敏感。不能笼统地说”量化模型和原模型一样好”。
误读 5:“PTQ 不需要任何计算资源”
纠偏:虽然 PTQ 远轻于全量训练或 QAT,但对大模型(100B+)执行 GPTQ 校准仍需要数十 GB 显存和数小时计算时间。零样本 PTQ(如 bitsandbytes 的 load_in_4bit)虽几乎不需要校准,但精度通常不如有校准数据的方案。
学习路径
入门(1—2 天)
- 理解数值精度基础:FP32/FP16/BF16/INT8/INT4 的表示范围和精度差异
- 手写一个简单的 Per-Tensor 对称量化函数(Python,无需 GPU)
- 阅读:Hugging Face 文档 — Quantization
进阶(1—2 周)
- 阅读 GPTQ 原论文:Frantar et al., “GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers”,理解逐层量化和 Hessian 补偿机制
- 阅读 AWQ 原论文:Lin et al., “AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration”,理解显著权重保护思想
- 使用 AutoGPTQ 或 AutoAWQ 对常见 LLM 执行量化,对比 PPL 和下游任务精度
- 理解 Group Quantization 的有效位宽计算:考虑 scale 和 zero-point 的开销
深入(1—2 月)
- 阅读 SmoothQuant 原论文:理解离群值迁移的数学原理与实现细节
- 阅读 LLM.int8() 原论文:理解混合精度分解与离群特征识别
- 研究 vLLM 或 TensorRT-LLM 的量化模型部署:关注 kernel 调优、内存管理和 batch 调度策略
- 尝试量化调优:调整校准数据集、量化粒度、比特分配策略等,观察精度变化
前沿方向(持续关注)
- Sub-4-bit 方法的精度边界:AQLM、QuIP# 等能否突破 2-bit 实用化阈值?
- FP8 推理生态演进:Hopper FP8(E4M3/E5M2)与 PTQ INT8/INT4 的竞争与互补
- 量化与稀疏化的组合压缩
- 量化模型的长上下文能力保持
- 量化对多模态模型(特别是 Diffusion 和 LLM-based Vision)的影响