模型层 开放阅读

QLoRA

Quantized LoRA

概念 ID
quantized-lora
更新时间
2026-05-29
来源数量
待补

QLoRA

3 秒看懂

一句话定义: QLoRA 将基座模型冻结并量化至 4-bit(NF4 格式),仅以全精度训练注入的低秩适配器(LoRA),使 65B 参数大模型微调所需显存从约数百 GB 压缩至单张 ~48 GB GPU 即可完成,且精度损失极小。

关键词: 4-bit NF4 量化 × 低秩适配 × 双重量化 × 分页优化器

核心数字: 论文称在单张 48 GB GPU 上微调 65B 模型,性能匹配全精度 16-bit 微调 [Dettmers et al., 2023]。

3 分钟产业解释

它解决了什么痛点?

大模型微调的最大瓶颈不是算法,而是显存。以 LLaMA-65B 为例:

微调方式典型显存需求(估算)所需硬件
全参数 FP16 微调~780 GB(含优化器状态)[Dettmers et al. 估算]多节点 8×A100 80G 集群
标准 LoRA(FP16 基座)~160 GB(估算,基座 FP16 + 适配器 + 优化器)2–4 张 A100 80G
QLoRA(NF4 基座)~48 GB [论文报告]单张 A100 40G/A6000 48G

以上数字为论文与社区估算口径,实际因序列长度、batch size、LoRA rank 等变量而异。

产业意义

  • 民主化微调: 一张消费级/工作站级 GPU 即可微调数十 B 参数模型,大幅降低个人研究者与中小企业的准入门槛。
  • 催生了开源微调生态: Guanaco(论文示例模型)、Alpaca-Lora 等众多社区项目依赖 QLoRA。
  • 成为主流微调基础设施: Hugging Face PEFT 库、Unsloth、LLaMA-Factory 等主流微调框架均原生支持 QLoRA。

15 分钟专家深入

论文溯源

QLoRA 由华盛顿大学 Tim Dettmers 等人于 2023 年 5 月 提出,后被 NeurIPS 2023 接收 [Dettmers et al., “QLoRA: Efficient Finetuning of Quantized Language Models”, arXiv:2305.14314]。

三大技术创新

① NF4(4-bit NormalFloat)量化

传统 4-bit 量化(如 INT4)假设权重均匀分布,对正态分布的权重并非信息论最优。NF4 的量化区间边界是根据标准正态分布的分位数设计的,使得在假设权重近似正态分布的条件下,量化误差在信息论意义上最小化。

② 双重量化(Double Quantization)

分块量化中,每个量化块(block,论文使用 blocksize=64)都需要一个 FP32 的缩放因子(scaling factor)。这些缩放因子本身也占用显存。双重量化将这些 FP32 缩放因子再次量化为 FP8(论文使用 FP32→FP8 的第二层量化,第二层 blocksize=256),进一步压缩显存开销。论文称此技术可节省约每个参数 ~0.37 bit 的存储 [Dettmers et al.]。

③ 分页优化器(Paged Optimizers)

利用 NVIDIA 统一内存(Unified Memory)特性,当优化器状态在前向/反向传播过程中出现显存峰值(如长序列梯度 checkpointing)时,自动将部分数据页迁移到 CPU 内存,避免 OOM,类似操作系统级的虚拟内存分页。

推理与训练的精度关系

┌─────────────────────────────────────────────┐
│              QLoRA 计算图                      │
│                                               │
│  基座权重 W (NF4, 冻结)                        │
│      │                                        │
│      ▼ dequantize (NF4 → BF16)               │
│  W_bf16 ◄──── 与 LoRA 适配器输出相加            │
│      │         ▲                              │
│      │         │                              │
│      │    ΔW = B·A  (BF16, 可训练)            │
│      │    B ∈ R^(d×r), A ∈ R^(r×k)           │
│      │                                        │
│  前向: Y = X·(W_bf16 + B·A)                   │
│  反向: 仅更新 B, A(梯度传过 W_bf16 但 W 冻结) │
│                                               │
│  优化器状态仅需为 B, A 维护                     │
│  (远小于全参数微调的优化器状态)                   │
└─────────────────────────────────────────────┘

关键点:

  • 基座权重以 NF4 格式存储,但计算时先反量化为 BF16,因此矩阵乘法本身仍在 BF16 精度下进行。
  • 只有 LoRA 适配器(A、B 矩阵)需要梯度和优化器状态,这是显存节省的主要来源。
  • 反向传播中,梯度需要穿过反量化后的 W_bf16,但由于 W 冻结不更新,不需要为 W 维护优化器状态(Adam 的 m 和 v)。

显存分解(以 65B 模型为例,定性估算)

组成部分全精度 FP16 微调QLoRA
基座权重存储~130 GB (FP16)~32.5 GB (NF4)
优化器状态(Adam)~520 GB (FP32 m + v)仅 LoRA 适配器 (数十 MB 级)
梯度~130 GB (FP16)仅 LoRA 适配器 (数十 MB 级)
激活值取决于序列长度与 batch相近,可通过 gradient checkpointing 优化
量化常数~数 GB(双重量化后进一步压缩)

以上为定性量级估算,参考论文叙述与社区复现,非精确测量值。实际开销因实现、框架、序列长度等因素而异。


技术原理

NF4 量化机制详解

标准正态分布 N(0,1) 的分位数 → 16 个量化区间
每个区间的概率质量 ≈ 1/16

量化步骤:
1. 将权重张量按 blocksize=64 分块
2. 每块独立计算 absmax 归一化 → 映射到 [-1, 1]
3. 将归一化值映射到最近的 NF4 离散级别
4. 存储: 每权重 4 bit + 每块一个 FP32 缩放因子
   (双重量化后缩放因子本身再量化为 FP8)

NF4 的 16 个离散值 (近似,非均匀间距):
对称分布在 0 附近,密集端 → 稀疏端 对应正态分布
高密度区域(接近 0)量化级别更密 → 更低量化误差

与原始 LoRA 的技术关系

原始 LoRA(Hu et al., 2021)的公式:

h = (W + ΔW)·x = (W + B·A)·x

其中:
- W ∈ R^(d×k): 原始预训练权重(LoRA 中全精度冻结)
- B ∈ R^(d×r): 低秩矩阵,初始化为 0 或随机
- A ∈ R^(r×k): 低秩矩阵,高斯初始化
- r <&lt; min(d,k): 秩,典型值 8, 16, 32, 64
- 可训练参数量: r×(d+k),远小于 d×k

QLoRA 的区别仅在于:W 从 FP16 变为 NF4 存储。 训练时仍反量化为 BF16 参与计算。LoRA 的数学框架完全不变。

LoRA 的注入位置(论文默认配置)

论文中对 LLaMA 架构将 LoRA 注入所有线性层(不仅限于原始 LoRA 论文的 Q、V 投影),包括:

Attention:
  - q_proj (Q 投影)
  - k_proj (K 投影)
  - v_proj (V 投影)
  - o_proj (输出投影)

FFN (SwiGLU):
  - gate_proj (门控投影)
  - up_proj (上投影)
  - down_proj (下投影)

总计每层 7 个 LoRA 模块

原始 LoRA 论文仅对 Q、V 投影施加 LoRA;QLoRA 论文发现对所有线性层施加 LoRA 且较低 rank(如 r=16)优于仅对 Q、V 施加但较高 rank(如 r=64)的配置 [Dettmers et al.]。


技术演进史

2021.06  LoRA 论文发布 (Hu et al., Microsoft)
         ▼ 低秩分解微调,FP16 基座
2022     8-bit 量化加载 (LLM.int8(), Dettmers et al.)
         ▼ 权重 8-bit + FP16 混合推理
2023.01  GPTQ (Frantar et al.)
         ▼ 4-bit 训练后量化用于推理,不涉及微调
2023.05  ★ QLoRA 发布 (Dettmers et al., UW) ★
         ▼ NF4 量化基座 + LoRA 微调
         ▼ 单卡微调 65B 模型
2023.06  Guanaco-65B 发布,号称接近 ChatGPT 性能
         (Vicuna 基准测试, 99.3% ChatGPT 质量 [论文自评])
2023     PEFT 库 (HuggingFace) 原生支持 QLoRA
2024     Unsloth、LLaMA-Factory 等进一步优化 QLoRA 效率
         ▼ 内核级优化,速度提升 2-5x [社区报告]
2024+    DoRA (Weight-Decomposed LoRA) 等改进方案出现
         ▼ 在 LoRA 基础上分解权重方向与幅度

技术路线对比

维度全参数微调标准 LoRA (FP16基座)QLoRA (NF4基座)Adapter TuningPrefix Tuning
可训练参数占总参比例100%~0.1%–1%~0.1%–1%~2%–5%~0.1%
基座权重精度FP16/BF16FP16/BF16(冻结)NF4 4-bit(冻结)FP16(冻结)FP16(冻结)
显存需求(65B 模型估算)~780 GB~160 GB~48 GB~180 GB~140 GB
训练速度基准较快中等(反量化开销)中等较快
下游任务性能最优接近最优接近全精度 LoRA接近较弱
部署灵活性需全参数适配器可热插拔需反量化基座适配器可热插拔可组合
支持 4-bit 量化推理需额外步骤需额外步骤基座已是 4-bit需额外步骤需额外步骤
首次提出2021202320192019

性能排名与显存数字为论文报告及社区复现的估算量级,不同任务/模型/配置下差异较大。


上下游

上游依赖

┌─────────────────────────────────────────────────────────┐
│  硬件层                                                  │
│  ├─ GPU: NVIDIA A100 40G/80G, RTX 3090/4090, A6000     │
│  │   (需支持 BF16 计算 + 统一内存)                        │
│  └─ 显存带宽: 反量化需带宽, 4-bit 加载更轻量               │
│                                                          │
│  软件框架层                                               │
│  ├─ bitsandbytes (Dettmers 团队): NF4 量化核心实现         │
│  ├─ Hugging Face Transformers + PEFT: 模型加载与 LoRA 注入 │
│  ├─ Accelerate: 分布式/分页内存管理                        │
│  ├─ CUDA / cuBLAS: 底层矩阵运算                           │
│  └─ PyTorch: 自动微分框架                                  │
│                                                          │
│  模型层                                                   │
│  ├─ 预训练基座: LLaMA, Mistral, Qwen, DeepSeek, ...      │
│  └─ 权重格式: HF safetensors / GGUF / GPTQ               │
└─────────────────────────────────────────────────────────┘

下游应用

┌─────────────────────────────────────────────────────────┐
│  微调产物                                                 │
│  ├─ 指令微调模型 (如 Guanaco, Alpaca 变体)                │
│  ├─ 领域适配模型 (法律/医疗/金融/代码)                     │
│  └─ 对齐微调 (DPO/RLHF 的策略模型)                       │
│                                                          │
│  适配器生态                                               │
│  ├─ LoRA 适配器可独立存储 (数十 MB)                       │
│  ├─ 多个适配器可热切换 (同一基座)                          │
│  ├─ 适配器可合并入基座权重 (推理时无额外开销)              │
│  └─ 适配器可叠加/混合 (Adapter Ensemble)                  │
│                                                          │
│  部署层                                                   │
│  ├─ vLLM / TGI: 推理服务 (支持加载合并后权重)              │
│  ├─ llama.cpp / GGUF: 量化推理 (与 NF4 不同格式)          │
│  └─ 边缘部署: 手机/嵌入式 (经进一步量化)                   │
└─────────────────────────────────────────────────────────┘

关键指标

指标典型值 / 范围说明
LoRA rank (r)8, 16, 32, 64论文发现 r=16 配合全层注入效果好于 r=64 仅注入 Q/V
LoRA alpha (α)通常等于 r 或 2r缩放因子,α/r 为实际缩放比
量化精度NF4 (4-bit)基座权重存储精度
反量化精度BF16计算时精度
训练精度BF16适配器权重与梯度精度
blocksize64 (量化) / 256 (双重量化)论文默认配置
可训练参数量(7B 模型)~数千万 (估算,取决于注入层数与 r)约为总参的 ~0.1%–0.5%
显存节省~60%–75% vs 全精度 LoRA因模型规模增大而更显著
训练吞吐约为全精度 LoRA 的 60%–80% [社区估算]反量化引入额外开销
下游任务精度接近全精度微调 (<1% 差距)论文在多个基准上验证

供需与市场数据

需求端

需求方场景痛点
中小企业 / 初创垂直领域大模型定制缺少多卡集群,预算有限
独立研究者学术实验、模型微调仅有一张消费级 GPU
大厂研发部门快速原型验证微调实验迭代速度受限于排队等集群资源
数据服务公司为客户批量微调行业模型降低推理/训练成本

供给端生态

环节代表产品/服务定位
核心库bitsandbytes (Tim Dettmers)NF4/双重量化底层实现
框架集成Hugging Face PEFTQLoRA 配置接口与训练流程封装
优化工具Unsloth内核级 QLoRA 优化,社区报告速度提升 2–5x
一站式平台LLaMA-Factory集成 QLoRA 的 GUI 微调平台
云服务AWS / GCP / Lambda Labs提供支持 QLoRA 的 GPU 实例
适配器市场Hugging Face Hub海量 LoRA/QLoRA 适配器共享

市场规模(估算)

QLoRA 本身为开源技术,不直接产生收入,但它是 LLM 微调市场 的关键基础设施组件。据 Grand View Research 等机构估算,全球 LLM 市场规模 2023 年约数十亿美元,微调服务是其中增长最快的细分。QLoRA 通过降低微调门槛,间接扩大了微调市场的可及规模。


代表公司与资本映射

公司/团队与 QLoRA 的关系资本关联
Hugging FacePEFT 库原生支持,Hub 上大量 QLoRA 适配器2023 年估值 ~$45 亿 [公开融资]
bitsandbytes / Tim DettmersQLoRA 论文一作团队,bitsandbytes 库维护者学术驱动,未独立商业化(截至目前公开信息)
UnslothQLoRA 加速优化,开源早期阶段,获 Y Combinator 支持 [公开信息]
Lambda Labs提供适配 QLoRA 的 GPU 云服务2024 年融资 $3.2 亿 [公开报道]
Meta (LLaMA)QLoRA 论文基于 LLaMA 验证,带动 LLaMA 生态股票代码 META
NVIDIAQLoRA 依赖 CUDA/统一内存生态股票代码 NVDA
Mistral / Qwen / DeepSeek 等社区广泛使用 QLoRA 微调这些开源基座各自有融资/上市路径

投资逻辑

核心投资论点

1. 降低大模型微调门槛 → 扩大 AI 应用层 TAM

QLoRA 使微调从”需要集群”降级为”需要一张卡”。这直接扩大了可以参与大模型定制化的人群和企业数量,从而扩大了 AI 应用层的总可及市场。

2. 开源微调基础设施 → 加速基座模型的生态锁定效应

QLoRA 让开源基座模型(LLaMA、Mistral、Qwen 等)的微调变得极其便捷,加速了开源模型的生态扩散。谁的基座模型被更多 QLoRA 适配器覆盖,谁的生态壁垒越深。

3. 推理端的延续价值

QLoRA 微调产出的适配器可以合并回基座后,再做 4-bit/8-bit 量化部署。这形成了”4-bit 微调 → 合并 → 4-bit 推理”的全链路低比特闭环,利好量化推理硬件和软件栈。

风险与局限

  • MoE 模型适配: QLoRA 对 MoE 架构的显存优势需要重新评估,MoE 本身参数量大但激活参数少,动态路由带来额外复杂性。
  • 精度天花板: 对于极复杂的任务(如多步推理、长文档理解),4-bit 基座的表示能力损失是否可忽略,尚存争议。
  • 替代方案竞争: 直接在更小模型上全参数微调、或使用更强的量化方法(如 AQLM、QuIP#),可能在部分场景下更优。

常见误读纠偏

❌ 误读 1:“QLoRA 把所有计算都在 4-bit 下完成”

✅ 纠正: QLoRA 将基座权重以 NF4 4-bit 存储,但在实际矩阵乘法前,会反量化(dequantize)为 BF16 再进行计算。因此前向/反向传播的计算精度仍是 BF16,不是 4-bit。显存节省来自存储层面,而非计算层面。这也是 QLoRA 训练速度比全精度 LoRA 略慢的原因之一——反量化有额外开销。

❌ 误读 2:“QLoRA 微调出来的模型精度比标准 LoRA 差很多”

✅ 纠正: 论文在多个基准(MMLU、HellaSwag、TruthfulQA 等)上报告,QLoRA 微调的性能与全精度 16-bit LoRA 微调高度接近(差距在噪声范围内)[Dettmers et al.]。这是因为 NF4 是信息论最优的 4-bit 量化格式,且适配器本身是全精度训练的。不过,这不意味着所有下游任务都能完全无损,极端场景下仍需验证。

❌ 误读 3:“QLoRA 和 GPTQ 是同一类技术”

✅ 纠正: GPTQ(Frantar et al., 2022)是训练后量化(Post-Training Quantization, PTQ),用于推理部署时压缩模型,不涉及训练/微调。QLoRA 是量化感知微调,在训练过程中使用 4-bit 存储的基座 + 全精度适配器。两者可组合:先用 QLoRA 微调,合并适配器后,再用 GPTQ 做推理量化。

❌ 误读 4:“QLoRA 论文声称 Guanaco-65B 达到 ChatGPT 99.3% 性能”

✅ 纠正: 论文使用的是Vicuna 基准测试(GPT-4 作为评判者的聊天机器人竞技场评估),该评估方法存在明显局限性(评判者偏差、评估维度有限、非标准化)。99.3% 这个数字是在特定基准上的自评结果,不应等同于通用能力的全面对标。这更多说明 QLoRA 微调在聊天对话质量这一维度上表现不错,而非全面超越或追平 ChatGPT。


学习路径

入门(1–2 小时)

  1. 阅读 Hugging Face PEFT 文档中 QLoRA 部分
  2. 跟随一个 Colab 教程,用 QLoRA 微调一个 7B 模型(如 Mistral-7B / LLaMA-3-8B)

进阶(1–2 天)

  1. 阅读原始 LoRA 论文 [Hu et al., 2021]
  2. 阅读 QLoRA 论文 [Dettmers et al., 2023],重点理解 NF4 的设计动机与双重量化
  3. 尝试不同 rank、不同注入层配置,观察效果差异

深入(1–2 周)

  1. 阅读 bitsandbytes 源码中 NF4 量化实现
  2. 阅读 Unsloth 的内核优化代码,理解计算瓶颈在哪里
  3. 对比 GPTQ、AQLM、QuIP# 等其他量化方案
  4. 研究 DoRA(Weight-Decomposed Low-Rank Adaptation)等后续改进

一句话总结

QLoRA 的本质是”用 4-bit 存储换显存、用低秩分解换可训练参数”,它不是一个新的微调范式,而是让已有微调范式(LoRA)在有限硬件资源下得以施展的工程优化——这个看似简单的组合,实质性地降低了大模型定制化的硬件门槛。


延伸阅读与来源

来源链接 / 引用
QLoRA 论文Dettmers et al., “QLoRA: Efficient Finetuning of Quantized Language Models”, NeurIPS 2023, arXiv:2305.14314
原始 LoRA 论文Hu et al., “LoRA: Low-Rank Adaptation of Large Language Models”, ICLR 2022, arXiv:2106.09685
bitsandbytes 库github.com/TimDettmers/bitsandbytes
HF PEFT 文档huggingface.co/docs/peft
GPTQFrantar et al., “GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers”, ICLR 2023
DoRALiu et al., “DoRA: Weight-Decomposed Low-Rank Adaptation”, arXiv:2402.09353, 2024
Unslothgithub.com/unslothai/unsloth
LLaMA-Factorygithub.com/hiyouga/LLaMA-Factory

本文技术事实基于论文原文与公开代码库。显存数字为论文报告或社区估算,实际值因模型规模、序列长度、batch size、框架版本等变量而异。市场与资本信息来源于公开报道,仅供参考。

source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型