芯片层 开放阅读

后训练量化

PTQ, Post-Training Quantization

概念 ID
ptq-post-training-quantization
更新时间
2026-05-29
来源数量
待补

后训练量化(PTQ, Post-Training Quantization)

3 秒看懂

PTQ = 模型训练完之后,不重新训练,只用少量校准数据把权重(有时也含激活值)从高精度(FP16/BF16/FP32)压到低比特(INT8/INT4/甚至更低),以换取更小的内存占用和更快的推理速度,同时尽量不掉精度。

核心交易:用”一点点校准计算”替代”全量重新训练”,在精度和部署效率之间做快速折中。

3 分钟产业解释

为什么 PTQ 在 2023—2025 年成为关键话题?

大语言模型(LLM)的参数量从数十亿飞涨到数千亿,单次推理的显存占用和延迟成本巨大。一个 70B 参数模型以 FP16 存储需要约 140GB 显存,几乎不可能在单卡上运行。PTQ 能将权重压缩到 4-bit,使显存需求降至约 35GB,单卡 24 GB 无法运行,多张消费级卡也难以可靠承载,需使用显存≥48 GB 的专业 GPU 或支持高效互联的多卡方案。

产业逻辑链:

模型越来越大 → 推理成本(显存+带宽+延迟)指数级上升
    → PTQ 是"不改模型架构、不重训"就能降低推理成本的最低门槛手段
    → 降低推理成本 → 扩大可部署硬件范围(云端→边缘/消费级)
    → 推动 AI 应用普及化

关键区分:PTQ 与 QAT(Quantization-Aware Training,量化感知训练)是两种路径。QAT 在训练过程中引入模拟量化,效果通常更好,但需要完整训练流程和算力;PTQ 只需要训练好的模型 + 少量校准数据 + 数小时的计算,门槛远低,因此在 LLM 时代成为主流方案。

15 分钟专家深入

PTQ 在 LLM 生态中的技术分层

现代 LLM 的 PTQ 已不再是简单的”四舍五入”,而是演化出多个层次的方法论:

第一层:权重量化(Weight-Only Quantization)

  • 只压缩权重,激活值保持 FP16/BF16
  • 代表:GPTQ、AWQ、bitsandbytes NF4、GGUF 各种方案
  • 优势:实现简单,兼容性好,精度损失相对可控
  • 劣势:实际计算仍需反量化到高精度做矩阵乘法,计算量不减少,但内存带宽需求大幅降低

第二层:权重 + 激活联合量化(Weight-Activation Quantization)

  • 权重和激活值都量化到 INT8(W8A8)或更低
  • 代表:SmoothQuant、LLM.int8()(混合精度方案)
  • 优势:可以利用硬件 INT8 Tensor Core 真正加速计算
  • 劣势:激活值中的离群值(outlier)是主要难点

第三层:极低比特量化(Sub-4-bit)

  • 3-bit、2-bit 甚至 1.5-bit 量化
  • 代表:AQLM、QuIP#、HQQ 等
  • 需要更复杂的量化方案(如向量量化、码本学习)来维持可接受的精度

核心技术挑战

1. 离群值问题(Outlier Features)

Tim Dettmers 等人在 LLM.int8() 论文中发现,LLM 的激活值中存在幅度极大的离群特征,这些离群特征的幅度远超普通特征,可达数十倍差异,且集中在少数固定通道中 [Dettmers et al., 2022, “LLM.int8(): 8-bit Matrix Multiplication for Transformers at Scale”]。这一发现深刻影响了后续 PTQ 方法的设计方向。

2. 逐层误差累积

LLM 有数十到上百层 Transformer block,每层的量化误差会逐层累积放大。因此先进方法(如 GPTQ)采用逐层优化策略,在量化当前层时考虑补偿效应。

3. 校准数据敏感性

PTQ 的精度高度依赖校准数据的质量和数量。校准数据需要能代表模型的实际使用分布,数量通常在 128—512 条样本即可 [行业共识,但最优数量因模型和方法而异]。


技术原理

基础量化公式

**均匀量化(Uniform Quantization)**的基本映射:

量化值:    q = round(x / s) + z
反量化:    x_hat = s * (q - z)

其中:
  s = (x_max - x_min) / (2^b - 1)    # scale(缩放因子)
  z = round(-x_min / s)                # zero-point(零点,仅非对称量化)
  b = 目标比特数

对称量化 vs 非对称量化

对称量化(Symmetric):
  z = 0
  s = max(|x|) / (2^(b-1) - 1)
  映射范围:[-2^(b-1), 2^(b-1)-1] 的整数
  适合:权重(通常近似零均值分布)

非对称量化(Asymmetric):
  z ≠ 0
  利用完整整数范围 [0, 2^b - 1]
  适合:激活值(常常非零均值,如 ReLU 后的正值分布)

量化粒度(Granularity)

量化粒度对精度和开销的影响(示意):

粒度             | scale/zp 数量    | 精度    | 存储开销(scale/zp)
─────────────────┼──────────────────┼─────────┼───────────────────
Per-Tensor       | 1 个/整个张量     | 最低    | 极小
Per-Channel      | 1 个/输出通道     | 中等    | 小
Per-Group        | 1 个/g 个元素     | 较高    | 可控(g=64/128常见)
Per-Element      | 每个元素一个      | 最高    | 与原值相当(无意义)

GPTQ/AWQ 常用:Per-Group,group_size=128
→ 每 128 个权重共享一组 scale + zero-point
→ 权重 4-bit + scale(FP16) ≈ 4.25 bit 有效位宽

主要 PTQ 方法的核心机制

1. GPTQ(Frantar et al., 2022)

核心思想:基于二阶信息的逐层最优量化

输入:训练好的模型 W,校准数据 X_cal
对每一层 l:
  ① 收集校准输入 X_cal 的隐层输出
  ② 计算 Hessian 矩阵 H = 2 * X_cal^T * X_cal(近似二阶信息)
  ③ 按行(逐输出通道)量化:
     - 选择当前要量化的权重行
     - 用 H 的逆矩阵计算最优量化误差补偿
     - 将补偿误差分配到尚未量化的权重行
  ④ 批量更新(lazy batch)提高效率

关键特性:
- 需要 GPU 内存约等于单层模型大小(可以逐层处理)
- 校准过程对 175B 级模型可在数小时内完成 [原论文报告]
- 4-bit + group_size=128 配置下精度损失通常较小

2. AWQ(Lin et al., MIT Han Lab, 2023)

核心思想:保护"显著权重"(salient weights)

关键观察:
  仅约 1% 的权重对模型输出有决定性贡献
  这些权重可以通过激活幅度间接识别

方法:
  ① 用校准数据前向传播,统计每通道的激活幅度 |X|
  ② 计算 per-channel 缩放因子 s,使得显著权重通道被放大
  ③ 量化前对权重施加缩放:W' = W * diag(s)
  ④ 对 W' 执行标准量化(RTN 即可,无需二阶信息)
  ⑤ 推理时反向补偿:Y = X * diag(s)^(-1) * quant(W')

优势:
- 计算简单(不需要 Hessian 逆)
- 与权重专用硬件加速器兼容性好
- 在 W4A16 场景下精度表现优异

3. SmoothQuant(Xiao et al., MIT Han Lab, 2022)

核心思想:将激活值中的量化难度"迁移"到权重上

关键数学变换(per-channel):
  Y = X * W
    = (X * diag(s)^(-1)) * (diag(s) * W)
    = X_hat * W_hat

  其中 s_j = max(|X_j|)^α / max(|W_j|)^(1-α)
  α ∈ [0,1] 控制迁移程度(α=0.5 是常见默认值)

效果:
  X_hat 的离群值幅度被压缩(更容易量化)
  W_hat 的幅度范围扩大(但权重分布本身更平滑,仍可量化)
  → 实现 W8A8 联合量化,两者都用 INT8

意义:
  这是少数能真正实现"计算加速"(而非仅节省显存)的 PTQ 方法
  因为 INT8 Tensor Core 在现代 GPU 上确实比 FP16 更快

4. LLM.int8()(Dettmers et al., 2022)

核心思想:混合精度分解

方法:
  ① 识别激活值中的离群特征通道(magnitude > 阈值)
  ② 离群通道(通常 < 0.1% 的维度)→ FP16 计算
  ③ 非离群通道 → INT8 计算
  ④ 合并两部分结果

意义:
  首次系统揭示 LLM 激活值的离群特征现象
  为后续 SmoothQuant 等方法提供了关键洞察

PTQ 方法对比示意(精度-速度-复杂度三维)

精度保持 ↑
    │
    │  SmoothQuant(W8A8)  GPTQ(4bit)  AWQ(4bit)
    │         ○              ○           ○
    │
    │              GPTQ(3bit)  LLM.int8()
    │                 ○           ○
    │
    │     RTN(4bit)            AQLM(2bit)
    │        ○                     ○
    │
    └──────────────────────────────────────→ 计算加速程度
                                              (weight-only 只省带宽,
                                               W8A8 真正省算力)

技术演进史

时期里程碑关键意义
2016—2017Google 提出量化推理框架(gemmlowp),XNOR-Net 等二值化网络研究学术界开始系统研究神经网络量化
2018NVIDIA Turing 架构引入 INT8 Tensor Core硬件层面为 INT8 推理提供原生加速支持
2019—2020TensorRT 引入 PTQ 工作流;Qualcomm/QNN 支持 INT8 NPU 推理PTQ 在 CV 模型上走向工程化
2022 Q2LLM.int8() 发布 [Dettmers et al.]揭示 LLM 激活离群特征,开启 LLM 专用 PTQ 研究热潮
2022 Q3GPTQ 发布 [Frantar et al.]首次实现百B级模型的高效 3/4-bit PTQ
2022 Q4SmoothQuant 发布 [Xiao et al., MIT Han Lab]解决 W8A8 联合量化的激活离群值难题
2023 Q1AWQ 发布 [Lin et al., MIT Han Lab]简化且高效的 W4 方案,工程友好度高
2023 Q2bitsandbytes NF4 引入 Hugging Face 生态;GGUF 格式随 llama.cpp 普及PTQ 进入主流开发者工具链
2023 Q3—Q4NVIDIA Hopper FP8(E4M3/E5M2)生态落地;AQLM、QuIP# 提出 sub-4-bit 方案硬件原生低精度格式 + 极致压缩探索
2024AWQ/GPTQ 集成进 vLLM、TensorRT-LLM 等主流推理框架;FP8 推理逐步实用化PTQ 从研究走向生产级部署基础设施

技术路线对比

维度RTN(Round-to-Nearest)GPTQAWQSmoothQuantLLM.int8()AQLM
类型权重量化权重量化权重量化权重+激活混合精度向量量化
典型 bit 宽4/83/44W8A8混合(INT8+FP16)2
核心机制最近邻取整Hessian 逐层最优激活感知缩放难度迁移离群值分离学习码本
校准数据量不需要/极少量~128—256 样本~128 样本~512 样本~128 样本需较多
校准耗时极快中等(数小时@大模型)较快较快较快较长
精度(4-bit)较差良好良好~优秀N/A(主攻 8-bit)N/A可接受(2-bit)
推理框架支持广泛AutoGPTQ, TRT-LLM, vLLMAutoAWQ, TRT-LLM, vLLMTRT-LLM, 各推理框架bitsandbytes社区支持
是否省计算否(weight-only)否(weight-only)否(weight-only)(INT8 TC)部分否(需解码)
适用场景快速原型/基线生产级 4-bit 部署生产级 4-bit 部署需真正计算加速时FP16 显存不足时极致压缩

:精度表现因模型架构、校准数据、评测任务不同而差异显著,上表为行业一般认知的定性判断,非严格 benchmark 结论。


上下游

上游:PTQ 方法的”输入端”

┌─────────────────────────────────────────────────┐
│                 上游依赖                          │
├─────────────────────────────────────────────────┤
│ ① 训练好的全精度模型(FP16/BF16/FP32)            │
│    → 来源:OpenAI, Meta, Mistral, Google 等       │
│    → 开源权重(Hugging Face)直接可用               │
│                                                  │
│ ② 校准数据集                                      │
│    → 通常取自训练集的一个小子集                     │
│    → 或用 WikiText、C4 等通用语料                  │
│                                                  │
│ ③ 量化算法框架                                     │
│    → GPTQ (AutoGPTQ)                             │
│    → AWQ (AutoAWQ / llm-awq)                     │
│    → bitsandbytes (Tim Dettmers 维护)             │
│    → TensorRT-LLM (NVIDIA)                       │
│    → llama.cpp (GGUF 格式支持多种量化)             │
│                                                  │
│ ④ 算力基础设施                                     │
│    → 校准阶段:单卡 GPU 即可(A100/H100 最优)      │
│    → 推理阶段:GPU / NPU / CPU 均可               │
└─────────────────────────────────────────────────┘

下游:PTQ 的”去向”

┌─────────────────────────────────────────────────┐
│                 下游应用                          │
├─────────────────────────────────────────────────┤
│ ① 云端推理服务                                     │
│    → vLLM + AWQ/GPTQ → 高吞吐 LLM serving        │
│    → 降低每 token 推理成本(显存↓ → 批大小↑)       │
│                                                  │
│ ② 边缘/终端设备                                    │
│    → 手机(高通/联发科 NPU, INT8/INT4)            │
│    → 笔记本/台式机(CPU 推理, llama.cpp + GGUF)   │
│    → 嵌入式/机器人                                 │
│                                                  │
│ ③ 消费级 GPU 部署                                  │
│    → 70B 模型 4-bit 量化后约需 35 GB 显存,单张 RTX 4090(24 GB)无法运行,需使用 48 GB 专业显卡(如 RTX A6000)或支持显存池化的专业多卡方案(如通过 NVLink 互联);消费级多卡方案(如 RTX 4090×2)缺乏 NVLink,仅靠 PCIe 进行模型并行带宽低且额外显存开销大,实际难以可靠运行 35 GB 级模型│
│                                                  │
│ ④ 多模态模型压缩                                   │
│    → Vision-Language 模型的权重压缩                │
│    → Diffusion 模型加速(如 SDXL INT8)            │
└─────────────────────────────────────────────────┘

关键指标

PTQ 模型质量评估指标

指标含义说明
WikiText-2 Perplexity困惑度LLM 量化后最常用的质量指标,越低越好
下游任务精度MMLU、HumanEval、GSM8K 等评估量化对不同能力维度的影响
Human Eval / 对话质量主观评估量化模型在实际对话中的表现
Perplexity DegradationPPL 退化幅度通常要求 < 0.5(8-bit)或 < 1.0(4-bit)为可接受

PTQ 工程效率指标

指标含义典型量级
校准耗时完成量化所需时间70B 模型 4-bit PTQ:数十分钟到数小时(因方法而异)[估算]
校准内存峰值校准过程 GPU 显存需求GPTQ 可逐层处理,峰值约等于单层大小 [行业共识]
有效位宽权重 + scale/zp 的平均位宽4-bit + group=128 ≈ 4.06—4.25 bit(取决于实现)
推理吞吐提升吞吐量变化weight-only(省带宽)vs W8A8(省计算),效果差异大,见下文
内存节省比例FP16 基线对比4-bit ≈ 4× 压缩(含 scale 开销后约 3.5×)[估算]

关键区分:Weight-Only ≠ 计算加速

Weight-Only 量化(GPTQ/AWQ/W4A16):
  - 权重存储为 4-bit → 推理时需反量化到 FP16 再做 matmul
  - 节省的是:显存占用、权重加载带宽(Memory-bound 场景有帮助)
  - 不节省的是:浮点运算次数(Compute-bound 场景无明显加速)
  - 适用场景:batch_size=1 的交互式推理(Memory-bound)

W8A8 量化(SmoothQuant 等):
  - 权重和激活都是 INT8 → 直接用 INT8 Tensor Core 计算
  - 理论计算吞吐:INT8 TC 是 FP16 TC 的 ~2×(在支持 INT8 TC 的硬件上)
  - 适用场景:高吞吐服务(Compute-bound)

实际加速取决于:
  ① 硬件是否原生支持对应精度(INT8 TC / FP8 TC / INT4 支持)
  ② 当前 workload 是 memory-bound 还是 compute-bound
  ③ 算子实现质量(kernel 调优程度)

供需与市场数据

需求侧驱动力

                    推理成本 = f(模型大小, 硬件规格, 吞吐量)

PTQ 的经济价值:

场景 A(云端推理):
  FP16 70B → 需要 2×A100-80GB → $3—4/hr [估算,云实例成本]
  4-bit 70B → 需要 1×A100-80GB → $1.5—2/hr [估算]
  → 单次推理成本下降约 40—60% [行业普遍认知]

场景 B(边缘部署):
  FP16 7B → 14GB 内存 → 无法在手机运行
  4-bit 7B → ~4GB 内存 → 可在高端手机运行
  → 使能全新应用场景

供给侧生态

角色代表公司/项目产品/方案
量化算法MIT Han Lab、IST Austria(GPTQ 原作者)、Tim DettmersAWQ、SmoothQuant、GPTQ、bitsandbytes
推理框架NVIDIA、vLLM 社区、llama.cpp 社区TensorRT-LLM、vLLM、llama.cpp
硬件芯片NVIDIA、Qualcomm、MediaTek、Apple含 INT8/FP8 TC 的 GPU;含 INT8/INT4 NPU 的移动 SoC
模型平台Hugging Face原生集成 bitsandbytes、GPTQ、AWQ 的模型加载
云服务商AWS、Azure、GCP提供量化模型优化的推理端点

市场数据说明

  • LLM 推理市场规模在快速增长,PTQ 作为推理优化的关键环节,其价值随推理需求增长而增长。具体市场规模数字因统计口径不同而差异较大,不做具体数字声称,建议参考 Gartner / IDC 最新报告。
  • 定性判断:PTQ 已成为大模型部署的标准配置而非可选项,几乎所有生产级 LLM 推理都使用某种形式的量化。

代表公司与资本映射

直接关联

公司/项目与 PTQ 的关系资本化路径
NVIDIATensorRT-LLM 内建 PTQ 支持;Hopper FP8/Ada FP8 硬件原生低精度;PTQ 降低推理成本→扩大 GPU 市场NVDA(GPU + 推理软件栈)
QualcommHexagon NPU 支持 INT8/INT4 推理;PTQ 使 LLM 可在手机 SoC 运行QCOM(移动/边缘 AI 芯片)
MediaTekAPU 支持 INT8 量化推理;天玑系列手机 SoC 的端侧 AI2454.TW(联发科)
AppleNeural Engine 支持 INT8;Core ML 支持 PTQAAPL(端侧 AI 生态)
AMDROCm 生态量化支持;Instinct 系列推理能力AMD(GPU + 推理)

间接/生态层

项目/公司关系
Hugging Face量化模型分发平台;transformers 库原生集成多种 PTQ 方法
vLLM (UC Berkeley)开源 LLM 推理引擎,集成 AWQ/GPTQ
llama.cpp (Georgi Gerganov)CPU/消费级 GPU 推理方案,GGUF 量化格式成为消费级标准
Tim Dettmers(学术)bitsandbytes 作者,8-bit/4-bit NF4 方案广泛使用
MIT Han Lab (Song Han)AWQ、SmoothQuant、Elastic 等多个量化/压缩工作的发源地

投资启示

PTQ 本身不是一个"独立市场",而是嵌入在推理基础设施中的技术层。

  谁受益?
  ├── 硬件侧:PTQ 降低硬件门槛 → 扩大可服务市场(尤其边缘/消费级)
  │   → Qualcomm, MediaTek, Apple(端侧推理);NVIDIA(云端推理效率提升→更多推理需求)
  │
  ├── 推理服务侧:PTQ 降低单次推理成本 → 扩大应用
  │   → 云服务商(AWS Bedrock, Azure AI 等)
  │
  └── 模型侧:PTQ 使开源模型可广泛部署 → 增强开源生态价值
      → Meta (LLaMA), Mistral, 聚合平台 (Hugging Face)

投资逻辑

核心投资命题

命题 1:推理成本下降 → AI 应用渗透率提升 → 整体市场扩大

PTQ 是推理成本下降的多个杠杆之一(其他包括:硬件代际升级、推理框架优化、推测解码、MoE 架构等),但它是唯一不需要改变模型架构、不需要重新训练、门槛最低的方案

命题 2:PTQ 使能”边缘 AI”叙事

4-bit 量化是端侧 LLM 的必要前提。没有 PTQ,手机/笔记本无法运行有意义规模的语言模型。随着端侧 AI 成为各硬件厂商的核心战略(Apple Intelligence、Qualcomm AI Hub 等),PTQ 的价值持续上升。

命题 3:开源模型 + PTQ → 民主化部署

PTQ 让中小团队和独立开发者也能部署大模型,强化了开源生态 vs 闭源 API 的竞争格局。

风险与约束

  • 精度上限约束:PTQ 有理论精度下限,超低比特(< 3-bit)的质量损失可能不可接受,这限制了压缩率的进一步提升
  • FP8/FP4 硬件替代:随着原生 FP8(Hopper)和未来 FP4 硬件的普及,某些 PTQ 场景可能被硬件原生低精度格式替代,但 PTQ 方法论(如校准、离群值处理)仍然适用
  • QAT 竞争:部分场景下,QAT 或混合方案(如 LoRA + 量化微调)可能优于纯 PTQ

常见误读纠偏

误读 1:“4-bit 量化后推理速度翻倍”

纠偏:4-bit 量化的核心收益是内存节省(约 4× 压缩),而非计算加速。Weight-only PTQ(GPTQ/AWQ)在推理时需要将 4-bit 权重反量化为 FP16 后再做矩阵乘法,浮点运算次数不变。只有在 memory-bound 场景(如 batch_size=1 的自回归解码)中,减少权重加载带宽才能间接提速。而在 compute-bound 场景(大 batch 服务),提速主要靠 W8A8 或 FP8 等真正降低计算精度的方案。

误读 2:“PTQ 精度损失可以忽略不计”

纠偏:8-bit 量化确实通常精度损失极小(PPL 退化通常 < 0.5),但 4-bit 量化在某些任务上可能存在可感知的退化,尤其是推理密集型任务(如 GSM8K 数学推理)或长上下文任务。精度损失程度高度依赖于具体模型、量化方法和评估任务。应当针对目标场景做实测验证,而非泛泛声称”无损”。

误读 3:“GPTQ 总是比 AWQ 好(或反之)”

纠偏:两者在多数基准测试上表现接近,各有适用场景。AWQ 在工程实现上更简洁,与 TensorRT-LLM 的集成更成熟;GPTQ 在某些模型架构上可能表现更好。实际选型应基于目标模型 + 目标硬件 + 推理框架的实测,而非一概而论。

误读 4:“量化只是压缩,对模型能力没有系统性影响”

纠偏:量化本质上是一种有损近似,不同能力维度受量化的影响不同。一般而言,知识密集型任务(如事实性问答)比模式识别任务(如情感分类)更耐量化;而复杂推理链精确数值计算对量化更敏感。不能笼统地说”量化模型和原模型一样好”。

误读 5:“PTQ 不需要任何计算资源”

纠偏:虽然 PTQ 远轻于全量训练或 QAT,但对大模型(100B+)执行 GPTQ 校准仍需要数十 GB 显存和数小时计算时间。零样本 PTQ(如 bitsandbytes 的 load_in_4bit)虽几乎不需要校准,但精度通常不如有校准数据的方案。


学习路径

入门(1—2 天)

  1. 理解数值精度基础:FP32/FP16/BF16/INT8/INT4 的表示范围和精度差异
  2. 手写一个简单的 Per-Tensor 对称量化函数(Python,无需 GPU)
  3. 阅读:Hugging Face 文档 — Quantization

进阶(1—2 周)

  1. 阅读 GPTQ 原论文:Frantar et al., “GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers”,理解逐层量化和 Hessian 补偿机制
  2. 阅读 AWQ 原论文:Lin et al., “AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration”,理解显著权重保护思想
  3. 使用 AutoGPTQ 或 AutoAWQ 对常见 LLM 执行量化,对比 PPL 和下游任务精度
  4. 理解 Group Quantization 的有效位宽计算:考虑 scale 和 zero-point 的开销

深入(1—2 月)

  1. 阅读 SmoothQuant 原论文:理解离群值迁移的数学原理与实现细节
  2. 阅读 LLM.int8() 原论文:理解混合精度分解与离群特征识别
  3. 研究 vLLM 或 TensorRT-LLM 的量化模型部署:关注 kernel 调优、内存管理和 batch 调度策略
  4. 尝试量化调优:调整校准数据集、量化粒度、比特分配策略等,观察精度变化

前沿方向(持续关注)

  • Sub-4-bit 方法的精度边界:AQLM、QuIP# 等能否突破 2-bit 实用化阈值?
  • FP8 推理生态演进:Hopper FP8(E4M3/E5M2)与 PTQ INT8/INT4 的竞争与互补
  • 量化与稀疏化的组合压缩
  • 量化模型的长上下文能力保持
  • 量化对多模态模型(特别是 Diffusion 和 LLM-based Vision)的影响
source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型