芯片层 开放阅读

INT8

8-bit Integer

概念 ID
8-bit-integer
更新时间
2026-05-29
来源数量
待补

INT8

3 秒看懂

INT8 是把神经网络中的浮点权重与激活表示为 8 位整数,以在几乎不损失精度的情况下大幅降低内存占用、带宽需求与计算延迟。它是深度学习部署从“调参演示”迈向“端侧/数据中心大规模实时服务”的关键使能技术,核心在于用更小的比特数表达同一张计算图。

3 分钟产业解释

传统训练使用 FP32(32 位浮点),推理时若沿用 FP32,会在存储、访存、乘法累加等方面造成严重浪费。INT8 量化思路是将训练好的浮点张量映射到只有 256 个取值的离散整数空间,再在整数运算单元上完成卷积、矩阵乘等操作。这带来三重收益:模型尺寸压缩约 4 倍,内存带宽压力同比例下降;整数计算单元吞吐可达浮点单元的 2–4 倍(尤其在有专用 INT8 加速器的芯片上);能耗显著降低,适合手机、嵌入式、边缘服务器及云 GPU 的大规模并发推理。

产业中,INT8 几乎已成为部署标配。主流推理引擎(如 NVIDIA TensorRT、Intel OpenVINO、ONNX Runtime、ARM Compute Library)都提供自动或半自动的 INT8 校准工具,支持量化感知训练(QAT)与训练后量化(PTQ)。硬件层面,NVIDIA 从 Turing 架构起就在 Tensor Core 中支持 INT8 矩阵运算,Intel Xeon、Apple Neural Engine、Qualcomm Hexagon 等均内置高效 INT8 流水线。INT8 的竞争焦点正从“能否跑通”转向“量化精度保持技术”和“混合精度策略”——哪些层用 INT8、哪些保留 FP16 或 FP32,完全依赖于量化误差分析和硬件特性。

15 分钟专家深入

INT8 量化本质上是用有限离散值逼近连续值,其信息瓶颈迫使开发者权衡精度、延迟、功耗。实际落地时,最小的“原子”是张量(权重张量、激活张量),量化过程需为每个张量(或张量内的一个子块,如 per-channel)选择量化参数:尺度因子(scale,浮点)和零点(zero-point,整数,用于非对称量化)。假设待量化的浮点值范围为 [x_min, x_max],目标整数范围为 [q_min, q_max](INT8 为 [–128, 127][0,255])。对称量化(无零点)时,应先取阈值 T = max(|x_min|, |x_max|),再计算 scale = T / 127(采用对称整数范围 [-127,127]),量化过程为 q = round(x / scale),零点固定为0:

T = max(|x_min|, |x_max|)
scale = T / 127
q = clip(round(x / scale), -127, 127)

非对称量化附加零点:

zero_point = round(q_min - x_min / scale)
q = clip(round(x / scale) + zero_point, q_min, q_max)

反向的逆量化 x_approx = scale * (q - zero_point) 将整数恢复为近似浮点数。

这种简单线性映射对于训练良好、值分布相对集中的权重(如 BatchNorm 之后)效果较好;而激活值的动态范围随输入变化剧烈,便需要校准:用一小批真实数据统计激活值范围,确定每层的 x_minx_max(可以通过 min-max、Kullback-Leibler 散度最小化、均方误差最小化等方法)。实践中,激活的量化往往比权重量化更容易引入误差,因此常用**量化感知训练(QAT)**在前向传播中模拟量化效应,反向仍使用浮点梯度,让网络学会在量化误差下保持输出质量。训练后量化(PTQ)虽简便,但对敏感模型(如 MobileNet、EfficientNet 的深度可分离卷积)可能导致严重掉点,此时 QAT 或部分层保留高精度是必要手段。

现代推理引擎会对模型计算图进行等价变换以适配 INT8:融合 Conv+BN+ReLU;将量化与反量化节点插入合适位置;选择 per-tensor 还是 per-channel 量化(per-channel 对权重量化精度提升明显,但某些硬件不支持)。同时,运行时调度会选择将哪些操作卸载到专用整数加速单元。如 NVIDIA GPU 上,INT8 Tensor Core 处理矩阵乘累加的输出通常用 INT32 累加(防止溢出),最终再反量化回 FP16/FP32 或直接输出给下一层。整个过程需要精细的图优化与硬件适配。

技术原理(最深)

量化映射与反量化

设模型某层权重张量 W 为浮点,激活输入 x 为浮点,则浮点卷积/矩阵乘:

y = W * x   (浮点计算)

INT8 量化推理时,先对 Wx 分别量化,得到 W_int8, x_int8,以及各自的 scale 和 zero_point。其中对称量化的权重张量使用阈值 T = max(|W_min|, |W_max|)scale = T / 127,零点固定为0。那么整数矩阵乘结果 y_int32(通常为 32 位累加)可通过近似恢复为浮点 y_fp

y_int32 = W_int8 * x_int8   (整数矩阵乘)
y_fp = scale_W * scale_x * (y_int32 - ...)   涉及 zero_point 的补偿项

为减少运行时开销,许多加速器直接输出 INT8 或使用融合的整数计算并隐式完成 re-quantize。

量化误差最小化

量化引入的噪声可建模为 x_quantized = x + delta_x,其中 delta_x 是量化误差。对一个卷积层的输出:

y_quantized ≈ W*x + W*delta_x + delta_W*x + delta_W*delta_x

误差主要由权重误差和激活误差项构成。校准的目标是选择量化参数使输出的误差(如均方误差)最小。常用策略有:

  • Min-Max 标定:直接用最小值最大值,简单但对异常值敏感。
  • MSE 校准:在验证集上搜 scale 使量化前后输出误差最小。
  • KL 散度校准(TensorRT 采用):将激活值的直方图与量化后的离散分布进行 KL 散度最小化,选择截断阈值。
  • 自适应取整(AdaRound):对权重的数值进行自适应舍入,而非常规四舍五入,往往能大福提升后训练量化精度。

关键硬件并行模式

以 NVIDIA A100 为例,其第三代 Tensor Core 可在每个时钟周期完成较大规模的 INT8 矩阵乘(A_int8 * B_int8)并累加到 INT32。其底层计算模式为对更大的矩阵块(如16x8x16)进行操作。由于整数运算单元数量更多、每个操作消耗的能量远低于 FP16/FP32,吞吐量可达 FP16 的 2 倍(具体倍数因架构而异,此处定性描述)。在并行训练方面,INT8 推理并不涉及训练并行范式,但量化感知训练本身仍使用浮点梯度 AllReduce。

大规模模型如 GPT 系 MoE 架构若采用 INT8 推理,其专家路由部分(gating 网络)通常依旧保留高精度,而被路由到的专家 FFN 层可量化至 INT8,以降低生成延迟。

技术演进史

  • 2015 年前:神经网络多在 GPU 上用 FP32 训练、推理,少量工作探索二值网络(BinaryConnect 等),但 INT8 未成主流。
  • 2018:Google 在 TensorFlow Lite 中推进量化,发布《Quantization and Training of Neural Networks for Efficient Integer-Arithmetic-Only Inference》论文,定义了统一的量化方式,催化 INT8 的工业实践。
  • 2018:NVIDIA 在 Turing 架构(T4 等)首次引入 INT8 Tensor Core,标榜推理吞吐大幅提升;TensorRT 提供成熟的 PTQ 工具。同年,ARM NN、Qualcomm SNPE 均支持 INT8。
  • 2019–2020:QAT 成为敏感模型的闭环方案。PyTorch 正式加入量化 API(Eager Mode 与 FX Graph Mode Quantization)。华为昇腾、寒武纪等国产芯片也将 INT8 作为推理核心能力。
  • 2021 至今:大模型时代,INT8 扩展到 Transformer 的注意力层、大语言模型。LLM.int8() 将异常值特征维度保留为 FP16,其余用 INT8,几乎无损地降低内存;SmoothQuant 通过平滑激活和权重异常值实现 W8A8 量化。INT4 甚至二值化亦同步研究,但 INT8 仍是工业部署的“质量—效率”甜点。

技术路线对比(量化表)

因无检索数据,下表基于行业公开知识进行定性对比,具体数值未标注精确来源,仅供参考。

量化方案典型精度保持能力工程复杂度硬件支持成熟度适用场景
训练后量化(PTQ)中型模型(ResNet-50)Top-1 下降通常 ≤ 0.5%(经校准)低,仅需数千张校准集所有推理引擎均支持通用 CNN 推理,快速部署
量化感知训练(QAT)几乎无损,可匹配浮点精度高,需修改训练流程并重训练几轮主流框架支持高精度要求场景,如医疗影像、自动驾驶感知
部分层混合精度(INT8+FP16/FP32)较好,敏感层保留高精度中等,需分析各层敏感度多数引擎可手动配置复杂模型(Transformer、深度可分离卷积)
细粒度量化(LLM.int8())异常值处理得当可接近无损中等,需识别异常值维度受限于特定 kernel 实现大语言模型推理(>6B 参数)
激活平滑量化(SmoothQuant)W8A8 下较好保持准确度中等,需预处理权重逐步被集成LLM 推理,要求权重和激活均为 INT8

注:上述数值范围均为典型经验观察,实际因模型架构、数据集、校准策略而异,此处无精确搜寻证据,仅作定性示意。

上下游

上游

  • 深度学习训练框架(PyTorch、TensorFlow)提供的量化 API 和模拟训练基础设施。
  • 编译器与优化栈:TVM、MLIR、ONNX 等中间表示层的量化算子定义与变换。
  • 校准数据集与工具链:用于统计激活值范围、误差分析。
  • 硬件设计 IP:Arm Ethos、Imagination Series4、Ceva SensPro 等提供 INT8 计算的神经加速器 IP。

下游

  • 云端推理服务:搜索引擎、推荐系统、语音助手、内容审核等场景的高吞吐部署。
  • 边缘侧与端侧:手机拍照美化、语音唤醒、AR 滤镜、车载感知、工业缺陷检测。
  • 大模型推理:将百亿参数模型压缩至可单卡运行,实现低延迟对话、代码补全等。
  • 量化工具提供商:如 NVIDIA TensorRT、Qualcomm AI Engine、地平线征程芯片工具链。

关键指标

  • 吞吐量(TOPS):处理器在 INT8 下的理论最大操作数(1 TOPS = 10^12 操作/秒),直接反映峰值算力。不同芯片 INT8 TOPS 差异巨大(如某数据中心 GPU 可达数百 TOPS)。
  • 模型精度损失:通常用 ImageNet Top-1 准确率差(ΔAcc)或语言模型的困惑度下降来衡量。优质 PTQ/QAT 方案 ΔAcc < 0.3%,敏感模型可能 >1%。
  • 内存节省率:权重占用缩减至原始 FP32 的约 25%(非嵌入式表示下)。结合激活量化,整体推理内存可降低 30%–60%。
  • 延迟降低幅度:与 FP32 推理相比,延迟可缩短 30%–70%,具体取决于硬件对 INT8 的加速比及计算瓶颈类型。
  • 能效比(TOPS/W):INT8 运算每瓦可提供的 TOPS 通常为 FP16 的 2–3 倍。

由于缺乏检索数据,以上为通用定性描述,未注明具体产品数值。

供需与市场数据

由于检索受限,无法获取最新市场份额数据。依据行业共识:全球推理加速芯片市场中,支持高效 INT8 计算的 GPU(NVIDIA)、ASIC(含 Google TPU、AWS Inferentia 等)、FPGA 和移动 SoC 内置 NPU 是主要参与者。人工智能向边缘迁移的趋势持续推动 INT8 硬件 IP 的授权和芯片出货量增长。据估算(无精准报告支持),至 2025 年,绝大部分视觉和语音模型的线上推理服务均已采用 INT8(或 INT8/FP16 混合精度);大模型时代,INT8 成为 LLM 经济性部署的基本要求,模型服务商(如 OpenAI、Anthropic)或内部采用类似量化技术以降低推理成本。此处仅说明趋势,具体数字未充分披露。

代表公司与资本映射

  • NVIDIA:TensorRT、Triton 推理服务器深度集成 INT8 优化;GPU 的全栈生态使其在云端推理占据主导。
  • Intel:Xeon 处理器通过 DL Boost(VNNI 指令)支持 INT8 卷积加速;Habana Gaudi 推理卡提供高吞吐 INT8 算力。
  • Qualcomm:Snapdragon 移动平台 Hexagon NPU 针对 INT8 实现极低功耗推理,赋能手机 AI。
  • 苹果:A 系列和 M 系列芯片的 Neural Engine 主推 INT8 和 FP16,用于 Core ML 模型本地推理。
  • Google:Edge TPU(已停产)和 Cloud TPU v5p 推理侧重 INT8;TensorFlow Lite 奠定移动端量化范式。
  • 华为:昇腾 310/910 推理卡支持 INT8,配合 MindSpore 和 CANN 工具链。
  • 寒武纪/地平线/黑芝麻:自动驾驶和边缘端 AI 芯片,INT8 是主要算力标称方式。

投资逻辑

INT8 是连接模型能力与商业部署的“成本收敛器”,其重要性随着模型规模膨胀而持续放大。从投资视角:

  1. 推理经济性拐点:任何需要规模部署的 AI 功能(如语音助手、推荐、自动驾驶、对话 AI),INT8 是降低单位推理成本的必要手段。掌握高效 INT8 工具链的公司将加速模型产品化。
  2. 硬件差异化:是否具备高效 INT8 矩阵引擎、每瓦 TOPS 优势,直接影响推理芯片的竞争力。因此,追踪推理芯片公司的 INT8 峰值算力与实际利用率是关键。
  3. 软件护城河:量化是一件极度依赖校准算法和算子库的工作。NVIDIA 的 TensorRT 生态、Intel oneDNN 等积累了大量专有优化,形成隐性壁垒。初创公司若能在特定垂直领域(如大模型量化、视频流处理)提供“无痛”INT8 方案,可能获得溢价。
  4. 大模型市场:LLM 量化是当前资本热点,因为推理成本大约占到模型全生命周期成本的 70% 以上。能将 175B 模型压缩至消费级 GPU 上的高效 INT8 方案,可能直接决定开源模型的商业可行性。

风险点在于:若未来硬件朝 FP8 或更灵活的数据表示(如 MX 格式)演进,纯 INT8 生态可能被分流。但中期看,INT8 因其成熟度和普遍的硬件支持,仍将作为推理算力基座。

常见误读纠偏

误读1:“INT8 量化就是简单地用 8 位整数存储模型权重,精度损失不可避免且很大。”
纠正:INT8 不仅仅是存储,它改变了计算类型。经过校准的 PTQ 或 QAT,多数主流视觉模型精度下降不足 0.5 个百分点,甚至几乎无损。而针对 Transformer 模型的先进量化技术(如 LLM.int8()、SmoothQuant)使数十亿参数量化后性能与浮点几乎相同。损失大小取决于量化方案和模型自身的鲁棒性,并非“必定大量掉点”。

误读2:“使用 INT8 推理就一定会加速,延迟一定降低。”
纠正:只有在硬件提供专用 INT8 计算路径且其带宽、计算单元利用率高于浮点路径时,INT8 才能显着加速。某些老旧或低端处理器可能不支持高效的 8 位矩阵乘,此时 INT8 仅节省空间,延迟可能因额外的量化/反量化操作反而增加。此外,如果模型本身受限于内存带宽而非计算吞吐,量化的加速效果也会打折扣。加速效应的发挥依赖软硬件协同。

学习路径

  1. 入门:阅读 Jacob 等 (2018)《Quantization and Training of Neural Networks for Efficient Integer-Arithmetic-Only Inference》,掌握对称/非对称量化、量化感知训练基本概念。
  2. 实践:用 PyTorch 的 torch.quantization 或 TensorFlow Model Optimization Toolkit 分别对 MobileNet 进行 PTQ 和 QAT,观察延迟和精度变化。
  3. 深入:学习 NVIDIA TensorRT 的 INT8 校准流程(KL 散度、MinMax),理解 per-channel/per-tensor 选择对卷积的影响;阅读 LLM.int8() 论文(Dettmers et al., 2022)和 SmoothQuant(Xiao et al., 2023),探究大模型量化的异常值处理。
  4. 硬件关联:浏览目标硬件(如 GPU 白皮书、ARM 技术参考手册)中对 INT8 计算的实现细节,理解张量核心的 tile 大小与吞吐上限。
  5. 业界跟进:关注 MLPerf Inference 基准测试中各提交者的 INT8 成绩,分析精度-延迟权衡;跟踪 AWS Inferentia2、Google TPU v5 等推理芯片的 INT8 最新表现。

一句话总结

INT8 是通过将神经网络映射到 8 位整数空间实现的低精度推理技术,它是连接高性能 AI 模型与大规模低成本部署的桥梁,已在软硬件生态上高度成熟,并正向更复杂的混合精度和大模型量化拓进。

延伸阅读与来源

由于本次资料检索未成功,以下提供典型公开资源参考路径(非精确论文编号):

  • Jacob, B., et al. “Quantization and Training of Neural Networks for Efficient Integer-Arithmetic-Only Inference.” CVPR, 2018. (业界共识的量化范式奠基文献)
  • NVIDIA TensorRT Developer Guide – INT8 Calibration section. (在线文档)
  • Dettmers, T., et al. “LLM.int8(): 8-bit Matrix Multiplication for Transformers at Scale.” NeurIPS, 2022. (大模型异常值感知量化)
  • Xiao, G., et al. “SmoothQuant: Accurate and Efficient Post-Training Quantization for Large Language Models.” ICML, 2023. (W8A8 平滑量化)
  • MLPerf Inference results (www.mlcommons.org) – 提供各厂商 INT8 吞吐和延迟的工业级数据。
  • PyTorch Quantization documentation (pytorch.org/docs/stable/quantization.html)
  • Intel oneDNN documentation (oneapi-src.github.io/oneDNN) – 包含 INT8 内核优化细节。

【注】本页所有具体技术参数均未从检索资料中获得,数字与具体硬件规格采用行业常识定性描述,缺乏实证来源的部分已注明“未充分披露”或“估算”。精确投资和选型请以厂商最新白皮书和实测数据为准。

source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型