INT4
1. 3 秒看懂
一句话定义: INT4 是将神经网络权重/激活值从高精度浮点数压缩为 4 位整数的技术,每个参数仅用 4 bit 表示,理论上可将模型内存占用压至 FP16 的 1/4。
核心价值: 让 70B 级大语言模型在单张消费级显卡上跑推理成为可能。
关键数字: 4 bit → 16 个离散量化级别 → 量化误差可控但需精心设计。
2. 3 分钟产业解释
为什么需要 INT4?
大语言模型(LLM)的参数规模爆炸式增长:一个 70B 参数模型,若以 FP16 存储,仅权重就需要约 140GB 显存,远超任何单张消费级 GPU 的容量。
量化的本质是”用精度换资源”:
| 精度 | 每参数位数 | 70B 模型权重体积(估算) |
|---|---|---|
| FP32 | 32 bit | ~280 GB |
| FP16/BF16 | 16 bit | ~140 GB |
| INT8 | 8 bit | ~70 GB |
| INT4 | 4 bit | ~35 GB |
| INT2/NF4 | 2-4 bit | ~17.5-35 GB |
注:体积估算 = 参数量 × 位宽 / 8,不含推理时的 KV cache、激活值等开销。
INT4 的产业定位: 在”可用精度损失”与”资源节省”之间找到平衡点——目前主流观点认为 INT4 量化在多数任务上精度损失可控(具体视量化方案而定),但推理吞吐量和内存效率可获得显著提升。
谁在用?
- 消费级部署: 将 7B/13B 模型压缩到可在 8-16GB 显存的 GPU 上运行
- 边缘/端侧: 在手机 NPU、车载芯片上部署小型量化模型
- 数据中心推理优化: 降低推理服务的单请求成本(GPU 数量、能耗)
3. 15 分钟专家深入
INT4 量化的核心技术谱系
INT4 量化方法
├── 训练后量化(PTQ, Post-Training Quantization)
│ ├── 朴素 Round-to-Nearest(RTN)
│ ├── GPTQ(2022-2023, 基于 OBS 的逐层量化)
│ ├── AWQ(Activation-aware Weight Quantization)
│ ├── QuIP / QuIP#(基于旋转不变性)
│ └── SqueezeLLM(稀疏+量化混合)
│
├── 量化感知训练(QAT, Quantization-Aware Training)
│ ├── 在训练/微调中模拟量化噪声
│ └── 通常精度优于 PTQ,但训练成本高
│
└── 混合精度方案
├── 关键层保持高精度(如注意力层 FP16,FFN 层 INT4)
└── 根据激活值敏感度动态分配位宽
为什么 LLM 量化难?
传统 CNN 量化(INT8)已相对成熟,但 LLM 面临独特挑战:
-
激活值存在离群值(Outliers): 研究者发现 LLM 的某些通道激活值可能比其他通道大数十倍(有文献描述为 “emergent outliers”),这使得朴素均匀量化严重损失精度。
-
权重分布复杂: 不同层、不同头的权重分布差异大,统一的量化参数效果差。
-
精度敏感度不均: 部分层对量化极其敏感,部分层则较鲁棒。
关键设计选择:
| 设计维度 | 选项 | 权衡 |
|---|---|---|
| 量化粒度 | per-tensor / per-channel / per-group | 粒度越细精度越高,但校准参数存储开销增加 |
| 量化方式 | 对称 / 非对称 | 非对称多一个 zero-point 参数,精度通常更好 |
| 权重量化 vs 激活量化 | 仅权重量化(W4A16)/ 权重+激活均量化(W4A4) | 仅权重量化更成熟、硬件要求低;激活量化收益更大但技术难度高 |
| 分组大小(group size) | 128 / 64 / 32 | 越小精度越好,但辅助参数存储占比上升 |
当前主流方案对比(定性)
| 方案 | 核心思路 | INT4 下的精度表现 | 推理效率 |
|---|---|---|---|
| RTN(直接舍入) | 最近邻舍入 | 精度损失较大,尤其大模型 | 实现简单 |
| GPTQ | 基于二阶信息逐层最优量化 | 当前社区广泛使用,精度较好 | 需要 GPU kernel 支持 |
| AWQ | 保护重要权重通道(基于激活统计) | 精度与 GPTQ 相当或略优 | 设计上更利于硬件实现 |
| QuIP# | 旋转+向量量化 | 在极低位宽下表现突出 | 计算开销稍高 |
| GGUF/llama.cpp | 侧重 CPU/混合推理的量化格式 | 多种量化级别可选 | CPU 友好 |
精度表现为定性比较,基于公开基准测试报告的共识,具体效果因模型/任务/校准数据而异。
4. 技术原理(深度机制)
4.1 量化基础公式
均匀量化(Uniform Quantization) 是 INT4 最常用的形式:
量化: x_q = round(x / scale) + zero_point
反量化: x ≈ (x_q - zero_point) × scale
其中:
- scale = (x_max - x_min) / (2^b - 1) [非对称]
- scale = max(|x|) / (2^(b-1) - 1) [对称]
- b = 位宽(INT4 时 b=4)
- x_q ∈ [-7, 7](对称有符号)或 [0, 15](无符号)
INT4 只有 16 个离散级别,这意味着:
- 对称量化:{-7, -6, …, -1, 0, 1, …, 7}
- 每个量化级别的间隔 = scale
- scale 的选择直接决定量化误差大小
4.2 分组量化(Group Quantization)
为了解决整层权重共享同一 scale 导致的精度问题:
权重张量 W ∈ R^{m×n}
│
├── 按 group_size 切分为 g 组(如 group_size=128)
│ 每组有独立的 scale 和 zero_point
│
├── 辅助参数开销 = (m×n / group_size) × (32bit_scale + 32bit_zp)
│ 对于 group_size=128:每 128 个权重额外存储约 8 字节
│ 即每参数约 0.5 bit 额外开销
│
└── 有效位宽 ≈ 4 + 辅助开销 ≈ 4.5 bit(group_size=128 时)
4.3 GPTQ 的核心思想
GPTQ 源于经典的 Optimal Brain Surgeon(OBS)理论:
目标:最小化量化后的输出误差
min ||WX - Q(W)X||²
核心操作:
1. 逐列处理权重(而非逐行)
2. 利用 Hessian 矩阵 H = 2X·X^T 的逆来指导量化
3. 量化当前列后,对剩余列做补偿性调整
W_remaining += δ / H_diag
4. 逐列推进,每列量化后更新后续列
关键特点:
- 只需一次前向校准(calibration)获取 Hessian
- 计算复杂度主要在矩阵求逆(可分块处理)
- 对 batch size 不敏感
4.4 AWQ 的核心思想
观察:权重中对激活值"重要"的通道(占激活值方差大的通道)
更容易在量化中被"误伤"
方法:
1. 在校准数据上统计每个权重通道对应的激活值幅度
2. 对"重要通道"的权重进行缩放(up scaling)
3. 缩放后统一量化,推理时在激活端做对应 down scaling
W' = W × diag(s) [权重缩放]
Y = W' × Q^{-1}(x/s) [激活端补偿]
优势:不改变计算图,仅调整 scale,对硬件更友好
4.5 INT4 的硬件执行
关键事实:目前主流 GPU 对 INT4 GEMM 的原生硬件支持有限。
实际执行路径(以 NVIDIA GPU 为例):
方案A:反量化到 FP16 后用 Tensor Core
INT4 weight → 解包/反量化 → FP16 weight
→ FP16 GEMM(利用 Tensor Core)
→ 内存节省来自权重存储压缩,计算仍在 FP16
方案B:INT4 Tensor Core 原生执行 INT4 × INT4 → INT32(需要专门 kernel)
需要 Turing 或更新架构的 INT4 Tensor Core 或 IMMA 指令(如 Turing 架构已引入 INT4 Tensor Core,但该能力主要限于数据中心 GPU,消费级 GPU 多不具备;Ampere 及后续架构的数据中心 GPU 有增强),而非 DP4A(仅为 INT8 点积)。若激活为 INT8,通常需先将权重反量化为 INT8 再使用 INT8 指令,或通过软件模拟。
方案C:W4A16 混合精度(当前主流推理框架)
权重 INT4 存储,激活保持 FP16/BF16
计算时权重实时反量化
NVIDIA 各架构 INT4 支持(定性认知):
- Turing:Tensor Core 原生支持 INT4 和 INT1 精度(主要面向数据中心 GPU,如 T4;消费级 RTX 20 系列通常不具备原生 INT4 Tensor Core 指令)。
- Ampere:数据中心 GPU(如 A100)增强了对 INT4 Tensor Core 的支持,可高效执行 INT4 矩阵乘加;消费级 RTX 30 系列不具备原生 INT4 Tensor Core 指令,仍依赖反量化路径。
- Ada Lovelace:消费级 RTX 40 系列不支持原生 INT4 Tensor Core;数据中心 GPU(如 L40、L40S 等)对 INT4 的硬件支持需根据具体型号确认,总体仍以反量化与 INT8/FP16 Tensor Core 混合执行为主。
- Hopper(H100):重心在 FP8,但可通过原生指令支持 INT4(具体 kernel 实现需查阅文档)。
- Blackwell:引入 FP4(4-bit 浮点),与 INT4 定位相似但格式不同。
注:具体硬件指令支持需以 NVIDIA 官方文档为准,此处为定性描述。
4.6 量化感知训练(QAT)中的 INT4
训练时的伪量化(Fake Quantization):
前向传播:
W_fake = Quantize(W) + (W - Quantize(W)).detach()
= W + (Quantize(W) - W).detach()
// 直通估计器(STE):前向用量化值,反向梯度直通
反向传播:
∂L/∂W ≈ ∂L/∂W_fake // STE 近似
QAT 的优势:
- 训练过程"感知"到量化噪声,权重分布会自适应调整
- 通常精度优于 PTQ,但需要完整训练流程
QAT 的代价:
- 训练计算量与全精度相当甚至更高
- 需要训练数据
- 不适合直接量化已部署的闭源模型
5. 技术演进史
时间线(以学术/产业里程碑为主):
2016-2017 │ 基础量化理论(XNOR-Net, DoReFa-Net 等)
│ CNN 低比特量化开始受关注
│
2018-2019 │ INT8 量化成为推理标配(TensorRT 等)
│ 移动端 NPU 开始支持 INT8
│
2020 │ GPT-3 发布(175B),模型规模问题凸显
│
2021-2022 │ LLM 时代开启,内存瓶颈成为核心问题
│ ZeroQuant / LLM.int8() 等工作探索 LLM 量化
│ 离群值(outlier)问题被系统性研究
│
2022-2023 │ GPTQ 发布,INT4 PTQ 在 LLM 上变得实用
│ llama.cpp / GGUF 格式推动消费级量化普及
│ bitsandbytes 库简化量化操作
│
2023-2024 │ AWQ、QuIP#、SqueezeLLM 等方法涌现
│ 4-bit QAT(如 QLoRA 的 LoRA on INT4 基座)
│ 社区基准测试(如 Hugging Face Leaderboard)
│ NVIDIA Blackwell 架构引入 FP4
│
2024+ │ W4A4(权重和激活均 4-bit)成为研究热点
│ 与推测解码、稀疏化等技术融合
│ 端侧/边缘部署需求驱动硬件原生支持
6. 技术路线对比
INT4 vs 其他精度方案
| 维度 | FP16/BF16 | INT8 | INT4 | INT2/NF4 |
|---|---|---|---|---|
| 位宽 | 16 bit | 8 bit | 4 bit | 2-4 bit |
| 内存节省(vs FP16) | 1× | 2× | 4× | 4-8× |
| 计算精度 | 基准 | 极接近 FP16 | 任务相关,多数场景可用 | 显著精度损失 |
| 硬件支持成熟度 | 极高(Tensor Core) | 高(多数推理框架) | 中(需专用 kernel) | 低(多为软件模拟) |
| 主要用途 | 训练 + 推理 | 通用推理 | LLM 压缩部署 | 极端压缩场景 |
| 代表性框架 | PyTorch / vLLM | TensorRT / ONNX Runtime | GPTQ / llama.cpp | 研究阶段 |
INT4 量化方法路线对比
| 方法 | 需要校准数据 | 精度(定性) | 量化速度 | 推理兼容性 | 适用场景 |
|---|---|---|---|---|---|
| RTN | 否 | ★★☆ | 极快 | 好 | 精度不敏感场景 |
| GPTQ | 是(~128 样本) | ★★★★ | 中等 | 好(广泛 kernel 支持) | 通用 LLM 压缩 |
| AWQ | 是 | ★★★★ | 中等 | 好 | 通用 LLM 压缩 |
| QuIP# | 是 | ★★★★★ | 较慢 | 需专门实现 | 极低位宽追求最优精度 |
| QLoRA (QAT) | 是(训练数据) | ★★★★★ | 慢(需训练) | 好 | 微调+量化一体化 |
| GGUF 量化 | 部分方法需要 | ★★★☆ | 快 | CPU 友好 | 端侧/CPU 推理 |
7. 上下游
上游(INT4 依赖什么)
├── 量化算法研究(学术论文、开源实现)
│ ├── 数值分析理论(舍入误差、信息论)
│ └── 优化理论(二阶方法、信息保持)
│
├── 硬件基础设施
│ ├── GPU/加速器的低比特计算指令
│ ├── 高带宽内存(HBM/GDDR)→ 权重加载瓶颈
│ └── 端侧 NPU 架构
│
├── 软件栈
│ ├── 深度学习框架(PyTorch、TensorFlow)
│ ├── 量化工具库(bitsandbytes、AutoGPTQ、llama.cpp)
│ └── 推理引擎(vLLM、TGI、TensorRT-LLM)
│
└── 高精度训练基础设施
└── INT4 量化的"原材料"是 FP16/BF16 训练好的模型
下游(INT4 支撑什么)
├── LLM 推理服务
│ ├── 云端:降低单请求 GPU 成本
│ └── 端侧/边缘:手机、PC、IoT 设备部署
│
├── AI 消费级应用
│ ├── 本地化 AI 助手(如 llama.cpp 生态)
│ └── 隐私敏感场景(数据不出设备)
│
├── 模型压缩技术栈
│ ├── 与知识蒸馏结合(小模型+量化)
│ ├── 与剪枝/稀疏化结合
│ └── 与推测解码(Speculative Decoding)结合
│
└── 硬件设计驱动力
└── 推动 NPU/加速器原生支持 4-bit 计算
8. 关键指标
量化质量指标
| 指标 | 含义 | INT4 典型表现 |
|---|---|---|
| WikiText-2 PPL | 语言建模困惑度 | 量化后上升 0.1-1.0(视模型/方法) |
| 下游任务准确率 | MMLU、HellaSwag 等基准 | 多数任务下降 <2%(优质量化方案) |
| RTN vs 高级方法 PPL 差距 | 量化算法改进程度 | GPTQ/AWQ 比 RTN 可低 0.3-1.0+ PPL |
| 极低位宽鲁棒性 | INT3/INT2 下是否仍可用 | 高级方法在 INT3 下仍有合理表现 |
效率指标
| 指标 | 含义 | INT4 特征 |
|---|---|---|
| 权重内存占用 | 模型加载所需显存 | 约为 FP16 的 1/4(加上 group scale 开销略多) |
| 推理吞吐量(tokens/s) | 每秒生成 token 数 | 依赖 kernel 实现,理论上可提升 1.5-3× |
| 首 token 延迟(TTFT) | prompt 处理时间 | 与内存带宽高度相关,INT4 可显著改善 |
| 量化时间 | 模型量化所需时间 | PTQ:分钟级;QAT:小时-天级 |
关键配置参数
| 参数 | 典型值 | 影响 |
|---|---|---|
| group_size | 128 / 64 | 越小精度越好,辅助参数越多 |
| quant_method | gptq / awq / rten | 量化算法选择 |
| bits | 4(可为 3, 5, 8 混合) | 位宽配置 |
| sym / asym | 对称 / 非对称 | 非对称通常精度更好 |
9. 供需与市场数据
需求侧驱动
驱动因素:
├── LLM 参数规模持续增长(70B → 400B+ MoE)
├── 推理成本占 AI 支出比重上升
├── 端侧 AI 需求爆发(手机、PC、汽车)
└── 数据隐私法规推动本地化部署
量化需求规模(定性估算):
├── 全球 LLM 推理市场:年增速 >50% [行业共识]
├── 量化在推理中的渗透率:估算 >70% 新部署使用某种量化 [行业估算]
└── INT4 级别量化占比:快速上升,但 INT8 仍是基线 [定性判断]
供给侧格局
开源方案(主导地位):
├── GPTQ(AutoGPTQ 库)
├── AWQ(AutoAWQ 库)
├── llama.cpp / GGUF(CPU 推理事实标准)
├── bitsandbytes(HuggingFace 生态集成)
└── Intel Neural Compressor / Qualcomm AI Engine(厂商方案)
商业方案:
├── NVIDIA TensorRT-LLM(含量化支持)
├── AMD ROCm 生态(量化支持发展中)
├── 各云厂商推理优化内部工具
└── 专门的模型优化公司(如 Neural Magic 等方向)
10. 代表公司与资本映射
上游(量化技术/工具)
| 类型 | 代表 | 与 INT4 的关系 |
|---|---|---|
| GPU 厂商 | NVIDIA、AMD、Intel | 硬件指令支持;NVIDIA Blackwell 引入 FP4 |
| 端侧芯片 | Qualcomm、Apple、联发科、寒武纪 | NPU 原生支持低比特计算 |
| 开源社区 | Hugging Face、llama.cpp 社区 | 量化工具链和模型分发 |
中游(推理基础设施)
| 类型 | 代表 | 与 INT4 的关系 |
|---|---|---|
| 推理框架 | vLLM、TGI(Hugging Face)、TensorRT-LLM | 集成 INT4 量化模型运行 |
| 推理云服务 | Anyscale、Fireworks AI、Together AI | 提供量化模型的高效推理 API |
| 边缘部署 | Qualcomm AI Hub、MediaTek NeuroPilot | 端侧量化模型部署平台 |
下游(应用层)
| 类型 | 代表 | 与 INT4 的关系 |
|---|---|---|
| 本地 AI | Apple Intelligence、高通 AI Engine | 端侧 LLM 部署依赖 INT4/INT8 |
| AI PC | Intel、AMD、Qualcomm(Copilot+PC) | 本地模型运行需高效量化 |
| 开源模型生态 | Meta LLaMA、Mistral、Qwen | 社区大量 INT4 量化版本流通 |
资本映射逻辑
INT4 量化本身不是独立赛道,而是"AI 推理效率"大趋势的核心技术层。
投资逻辑节点:
├── 硬件层:押注原生支持低比特计算的芯片公司
├── 工具层:量化+推理优化的开源/商业化
├── 平台层:边缘推理平台和 AI PC 生态
└── 应用层:本地化 AI 产品(受量化技术成熟度驱动)
11. 投资逻辑
核心论点
1. 推理成本是 AI 规模化的关键瓶颈
- 训练是一次性的,推理是持续的
- INT4 量化可将推理成本降低 2-4×(内存 + 吞吐量)
2. 端侧 AI 是下一个增长极
- 手机/PC 本地运行 LLM 几乎必然依赖 4-bit 量化
- Apple/Qualcomm/Intel 均已布局
3. 开源量化技术民主化部署能力
- llama.cpp 等项目让消费级硬件跑 LLM 成为现实
- 打破"大模型=大算力"的垄断格局
4. 与硬件演进形成正循环
- 软件需求驱动硬件原生支持
- 硬件支持反过来降低量化部署门槛
风险与不确定性
├── 精度与效率的权衡可能随模型架构演进变化
├── 新架构(如 Mamba、RWKV)可能对量化更友好或更不友好
├── 原生低精度训练(如 FP4 训练)可能改变"训练后量化"范式
├── 硬件碎片化:不同厂商的 4-bit 格式不统一(INT4 vs FP4 vs NF4)
└── 极低位宽(<4 bit)技术突破可能改变格局
12. 常见误读纠偏
❌ 误读 1:“INT4 量化没有精度损失”
纠偏: INT4 量化必然引入精度损失,只是损失程度因方法、模型、任务而异。
- 粗糙的量化(如朴素 RTN)可能导致严重退化
- 优秀的量化方案(GPTQ/AWQ)在多数任务上损失可控(PPL 上升 0.1-1 量级,下游任务准确率下降通常 <2%)
- 但对精度极度敏感的任务(如数学推理、代码生成)可能更脆弱
- 结论:INT4 是”可接受的精度损失”而非”无损”
❌ 误读 2:“INT4 推理速度一定是 FP16 的 4 倍”
纠偏: 实际加速比远低于理论值,原因包括:
- 反量化开销: 多数 W4A16 方案需要在推理时将权重从 INT4 反量化为 FP16,这消耗计算和带宽
- kernel 效率: INT4 原生 GEMM kernel 的优化程度通常不如 FP16 Tensor Core kernel 成熟
- 瓶颈可能在内存带宽而非计算: 对于自回归生成(batch_size=1),瓶颈往往是显存带宽,INT4 确实有帮助但不是 4×
- 结论:典型加速比估算在 1.2-2.5× 之间,具体取决于硬件/kernel/批大小
❌ 误读 3:“所有模型都适合 INT4 量化”
纠偏: 不同模型架构对量化的鲁棒性差异显著。
- 较大的模型通常对量化更鲁棒(参数冗余度更高)
- 某些架构设计(如 SwiGLU 激活函数)可能产生更极端的激活值分布
- MoE 模型的量化策略与 dense 模型不同
- 视觉-语言多模态模型的各模态可能需要差异化量化
❌ 误读 4:“INT4 和 FP4 是一回事”
纠偏: INT4 是 4-bit 整数,FP4 是 4-bit 浮点数,两者格式不同。
- INT4:均匀间隔的整数级别,实现简单
- FP4:非均匀间隔(类似 E2M1、E3M0 等格式),对小值精度更好
- NVIDIA Blackwell 架构引入的是 FP4 而非 INT4
- 两者各有优劣,需根据数值分布选择
❌ 误读 5:“量化后的模型不能继续微调”
纠偏: QLoRA(Quantized LoRA)等工作证明了在 INT4 量化基座上进行有效的参数高效微调是可行的。
- 冻结 INT4 量化的基座权重
- 在 FP16/BF16 精度下训练额外的 LoRA adapter
- 这让 70B 模型在单张消费级 GPU 上的微调成为可能
13. 学习路径
入门级(理解概念)
Step 1: 理解量化的基础动机
→ 为什么大模型需要压缩?内存/计算瓶颈在哪?
Step 2: 掌握均匀量化的基本公式
→ scale/zero_point 的计算、反量化过程
Step 3: 实际动手体验
→ 使用 bitsandbytes 或 AutoGPTQ 对小模型(如 7B)做 INT4 量化
→ 在本地 llama.cpp 中跑 GGUF 量化模型
→ 对比量化前后的输出质量和资源占用
进阶级(理解算法)
Step 4: 深入学习 GPTQ 论文
→ 理解 OBS 理论基础、逐列量化补偿机制
Step 5: 对比 GPTQ vs AWQ 的设计哲学差异
→ AWQ 的激活感知思路、通道缩放方法
Step 6: 了解激活值离群值问题
→ 阅读 LLM.int8() 论文中的 outlier 分析
→ 理解为什么 LLM 量化比 CNN 量化更难
专家级(理解系统)
Step 7: 研究量化 kernel 实现
→ marlin kernel(GPTQ 高效推理)、exllama 等
Step 8: 探索与推理系统的集成
→ vLLM / TGI 如何调度量化模型
→ KV cache 量化(与权重量化的关系)
Step 9: 关注前沿方向
→ W4A4 全 4-bit 推理
→ FP4 vs INT4 的硬件趋势
→ 量化与推测解码、稀疏化的融合
推荐资源
论文:
- GPTQ: "GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers" (2022)
- AWQ: "AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration" (2023)
- LLM.int8(): "LLM.int8(): 8-bit Matrix Multiplication for Transformers at Scale" (2022)
- QuIP#: "QuIP#: Even Better LLM Quantization with Hadamard Incoherence and Lattice Codebooks" (2023)
工具:
- AutoGPTQ / AutoAWQ:主流量化工具
- llama.cpp:端侧推理事实标准
- bitsandbytes:HuggingFace 生态量化库
社区:
- Hugging Face 量化模型集合
- r/LocalLLaMA 社区(Reddit)
- llama.cpp GitHub Discussions
14. 一句话总结
INT4 量化是当前 LLM 部署降本增效的核心杠杆——它用精心设计的 16 个离散级别替换 65536 个浮点状态,在”可用精度”与”资源效率”的刀锋上找到平衡,正在重塑从云端推理到端侧 AI 的成本结构。
15. 延伸阅读与来源
学术文献
- Frantar, E., et al. “GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers.” ICLR 2023.
- Lin, J., et al. “AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration.” MLSys 2024.
- Dettmers, T., et al. “LLM.int8(): 8-bit Matrix Multiplication for Transformers at Scale.” NeurIPS 2022.
- Dettmers, T., et al. “QLoRA: Efficient Finetuning of Quantized LLMs.” NeurIPS 2023.
- Chee, J., et al. “QuIP#: Even Better LLM Quantization with Hadamard Incoherence and Lattice Codebooks.” arXiv 2023.
- Xiao, G., et al. “SmoothQuant: Accurate and Efficient Post-Training Quantization for Large Language Models.” ICML 2023.
工程文档与社区
- NVIDIA TensorRT-LLM 文档:[官方文档]
- llama.cpp 项目:[GitHub repository]
- AutoGPTQ 文档:[GitHub repository]
- Hugging Face Transformers 量化指南:[官方文档]
- bitsandbytes 库:[GitHub repository]
行业报告(参考方向)
- AI 推理优化技术趋势报告 [各研究机构年度报告]
- 边缘 AI 芯片市场分析 [半导体行业分析机构]
来源说明
声明: 本页技术描述基于公开学术论文、开源项目文档和行业共识。具体性能数据因硬件配置、模型架构、实现优化程度而异,建议在目标场景下实测验证。市场数据引用方向来自行业共识判断,未标注具体数字的规格描述均基于定性认知或估算。