模型層 開放閱讀

QLoRA

Quantized LoRA

概念 ID
quantized-lora
更新時間
2026-05-29
來源數量
待補

QLoRA

3 秒看懂

一句話定義: QLoRA 將基座模型凍結並量化至 4-bit(NF4 格式),僅以全精度訓練注入的低秩介面卡(LoRA),使 65B 引數大型模型微調所需視訊記憶體從約數百 GB 壓縮至單張 ~48 GB GPU 即可完成,且精度損失極小。

關鍵詞: 4-bit NF4 量化 × 低秩適配 × 雙重量化 × 分頁最佳化器

核心數字: 論文稱在單張 48 GB GPU 上微調 65B 模型,效能匹配全精度 16-bit 微調 [Dettmers et al., 2023]。

3 分鐘產業解釋

它解決了什麼痛點?

大型模型微調的最大瓶頸不是演算法,而是視訊記憶體。以 LLaMA-65B 為例:

微調方式典型視訊記憶體需求(估算)所需硬體
全引數 FP16 微調~780 GB(含最佳化器狀態)[Dettmers et al. 估算]多節點 8×A100 80G 叢集
標準 LoRA(FP16 基座)~160 GB(估算,基座 FP16 + 介面卡 + 最佳化器)2–4 張 A100 80G
QLoRA(NF4 基座)~48 GB [論文報告]單張 A100 40G/A6000 48G

以上數字為論文與社群估算口徑,實際因序列長度、batch size、LoRA rank 等變數而異。

產業意義

  • 民主化微調: 一張消費級/工作站級 GPU 即可微調數十 B 引數模型,大幅降低個人研究者與中小企業的准入門檻。
  • 催生了開源微調生態: Guanaco(論文示例模型)、Alpaca-Lora 等眾多社群專案依賴 QLoRA。
  • 成為主流微調基礎設施: Hugging Face PEFT 庫、Unsloth、LLaMA-Factory 等主流微調架構均原生支援 QLoRA。

15 分鐘專家深入

論文溯源

QLoRA 由華盛頓大學 Tim Dettmers 等人於 2023 年 5 月 提出,後被 NeurIPS 2023 接收 [Dettmers et al., “QLoRA: Efficient Finetuning of Quantized Language Models”, arXiv:2305.14314]。

三大技術創新

① NF4(4-bit NormalFloat)量化

傳統 4-bit 量化(如 INT4)假設權重均勻分佈,對正態分佈的權重並非資訊論最優。NF4 的量化區間邊界是根據標準正態分佈的分位數設計的,使得在假設權重近似正態分佈的條件下,量化誤差在資訊論意義上最小化。

② 雙重量化(Double Quantization)

分塊量化中,每個量化塊(block,論文使用 blocksize=64)都需要一個 FP32 的縮放因子(scaling factor)。這些縮放因子本身也佔用視訊記憶體。雙重量化將這些 FP32 縮放因子再次量化為 FP8(論文使用 FP32→FP8 的第二層量化,第二層 blocksize=256),進一步壓縮視訊記憶體開銷。論文稱此技術可節省約每個引數 ~0.37 bit 的儲存 [Dettmers et al.]。

③ 分頁最佳化器(Paged Optimizers)

利用 NVIDIA 統一記憶體(Unified Memory)特性,當最佳化器狀態在前向/反向傳播過程中出現視訊記憶體峰值(如長序列梯度 checkpointing)時,自動將部分資料頁遷移到 CPU 記憶體,避免 OOM,類似作業系統級的虛擬記憶體分頁。

推論與訓練的精度關係

┌─────────────────────────────────────────────┐
│              QLoRA 計算圖                      │
│                                               │
│  基座權重 W (NF4, 凍結)                        │
│      │                                        │
│      ▼ dequantize (NF4 → BF16)               │
│  W_bf16 ◄──── 與 LoRA 介面卡輸出相加            │
│      │         ▲                              │
│      │         │                              │
│      │    ΔW = B·A  (BF16, 可訓練)            │
│      │    B ∈ R^(d×r), A ∈ R^(r×k)           │
│      │                                        │
│  前向: Y = X·(W_bf16 + B·A)                   │
│  反向: 僅更新 B, A(梯度傳過 W_bf16 但 W 凍結) │
│                                               │
│  最佳化器狀態僅需為 B, A 維護                     │
│  (遠小於全引數微調的最佳化器狀態)                   │
└─────────────────────────────────────────────┘

關鍵點:

  • 基座權重以 NF4 格式儲存,但計算時先反量化為 BF16,因此矩陣乘法本身仍在 BF16 精度下進行。
  • 只有 LoRA 介面卡(A、B 矩陣)需要梯度和最佳化器狀態,這是視訊記憶體節省的主要來源。
  • 反向傳播中,梯度需要穿過反量化後的 W_bf16,但由於 W 凍結不更新,不需要為 W 維護最佳化器狀態(Adam 的 m 和 v)。

視訊記憶體分解(以 65B 模型為例,定性估算)

組成部分全精度 FP16 微調QLoRA
基座權重儲存~130 GB (FP16)~32.5 GB (NF4)
最佳化器狀態(Adam)~520 GB (FP32 m + v)僅 LoRA 介面卡 (數十 MB 級)
梯度~130 GB (FP16)僅 LoRA 介面卡 (數十 MB 級)
啟用值取決於序列長度與 batch相近,可通過 gradient checkpointing 最佳化
量化常數~數 GB(雙重量化後進一步壓縮)

以上為定性量級估算,參考論文敘述與社群復現,非精確測量值。實際開銷因實現、架構、序列長度等因素而異。


技術原理

NF4 量化機制詳解

標準正態分佈 N(0,1) 的分位數 → 16 個量化區間
每個區間的機率質量 ≈ 1/16

量化步驟:
1. 將權重張量按 blocksize=64 分塊
2. 每塊獨立計算 absmax 歸一化 → 對映到 [-1, 1]
3. 將歸一化值對映到最近的 NF4 離散級別
4. 儲存: 每權重 4 bit + 每塊一個 FP32 縮放因子
   (雙重量化後縮放因子本身再量化為 FP8)

NF4 的 16 個離散值 (近似,非均勻間距):
對稱分佈在 0 附近,密集端 → 稀疏端 對應正態分佈
高密度區域(接近 0)量化級別更密 → 更低量化誤差

與原始 LoRA 的技術關係

原始 LoRA(Hu et al., 2021)的公式:

h = (W + ΔW)·x = (W + B·A)·x

其中:
- W ∈ R^(d×k): 原始預訓練權重(LoRA 中全精度凍結)
- B ∈ R^(d×r): 低秩矩陣,初始化為 0 或隨機
- A ∈ R^(r×k): 低秩矩陣,高斯初始化
- r <&lt; min(d,k): 秩,典型值 8, 16, 32, 64
- 可訓練引數量: r×(d+k),遠小於 d×k

QLoRA 的區別僅在於:W 從 FP16 變為 NF4 儲存。 訓練時仍反量化為 BF16 參與計算。LoRA 的數學架構完全不變。

LoRA 的注入位置(論文預設配置)

論文中對 LLaMA 架構將 LoRA 注入所有線性層(不僅限於原始 LoRA 論文的 Q、V 投影),包括:

Attention:
  - q_proj (Q 投影)
  - k_proj (K 投影)
  - v_proj (V 投影)
  - o_proj (輸出投影)

FFN (SwiGLU):
  - gate_proj (門控投影)
  - up_proj (上投影)
  - down_proj (下投影)

總計每層 7 個 LoRA 模組

原始 LoRA 論文僅對 Q、V 投影施加 LoRA;QLoRA 論文發現對所有線性層施加 LoRA 且較低 rank(如 r=16)優於僅對 Q、V 施加但較高 rank(如 r=64)的配置 [Dettmers et al.]。


技術演進史

2021.06  LoRA 論文釋出 (Hu et al., Microsoft)
         ▼ 低秩分解微調,FP16 基座
2022     8-bit 量化載入 (LLM.int8(), Dettmers et al.)
         ▼ 權重 8-bit + FP16 混合推論
2023.01  GPTQ (Frantar et al.)
         ▼ 4-bit 訓練後量化用於推論,不涉及微調
2023.05  ★ QLoRA 釋出 (Dettmers et al., UW) ★
         ▼ NF4 量化基座 + LoRA 微調
         ▼ 單卡微調 65B 模型
2023.06  Guanaco-65B 釋出,號稱接近 ChatGPT 效能
         (Vicuna 基準測試, 99.3% ChatGPT 質量 [論文自評])
2023     PEFT 庫 (HuggingFace) 原生支援 QLoRA
2024     Unsloth、LLaMA-Factory 等進一步最佳化 QLoRA 效率
         ▼ 核心級最佳化,速度提升 2-5x [社群報告]
2024+    DoRA (Weight-Decomposed LoRA) 等改進方案出現
         ▼ 在 LoRA 基礎上分解權重方向與幅度

技術路線對比

維度全引數微調標準 LoRA (FP16基座)QLoRA (NF4基座)Adapter TuningPrefix Tuning
可訓練引數佔總參比例100%~0.1%–1%~0.1%–1%~2%–5%~0.1%
基座權重精度FP16/BF16FP16/BF16(凍結)NF4 4-bit(凍結)FP16(凍結)FP16(凍結)
視訊記憶體需求(65B 模型估算)~780 GB~160 GB~48 GB~180 GB~140 GB
訓練速度基準較快中等(反量化開銷)中等較快
下游任務效能最優接近最優接近全精度 LoRA接近較弱
部署靈活性需全引數介面卡可熱插拔需反量化基座介面卡可熱插拔可組合
支援 4-bit 量化推論需額外步驟需額外步驟基座已是 4-bit需額外步驟需額外步驟
首次提出2021202320192019

效能排名與視訊記憶體數字為論文報告及社群復現的估算量級,不同任務/模型/配置下差異較大。


上下游

上游依賴

┌─────────────────────────────────────────────────────────┐
│  硬體層                                                  │
│  ├─ GPU: NVIDIA A100 40G/80G, RTX 3090/4090, A6000     │
│  │   (需支援 BF16 計算 + 統一記憶體)                        │
│  └─ 視訊記憶體頻寬: 反量化需頻寬, 4-bit 載入更輕量               │
│                                                          │
│  軟體架構層                                               │
│  ├─ bitsandbytes (Dettmers 團隊): NF4 量化核心實現         │
│  ├─ Hugging Face Transformers + PEFT: 模型載入與 LoRA 注入 │
│  ├─ Accelerate: 分散式/分頁記憶體管理                        │
│  ├─ CUDA / cuBLAS: 底層矩陣運算                           │
│  └─ PyTorch: 自動微分架構                                  │
│                                                          │
│  模型層                                                   │
│  ├─ 預訓練基座: LLaMA, Mistral, Qwen, DeepSeek, ...      │
│  └─ 權重格式: HF safetensors / GGUF / GPTQ               │
└─────────────────────────────────────────────────────────┘

下游應用

┌─────────────────────────────────────────────────────────┐
│  微調產物                                                 │
│  ├─ 指令微調模型 (如 Guanaco, Alpaca 變體)                │
│  ├─ 領域適配模型 (法律/醫療/金融/程式碼)                     │
│  └─ 對齊微調 (DPO/RLHF 的策略模型)                       │
│                                                          │
│  介面卡生態                                               │
│  ├─ LoRA 介面卡可獨立儲存 (數十 MB)                       │
│  ├─ 多個介面卡可熱切換 (同一基座)                          │
│  ├─ 介面卡可合併入基座權重 (推論時無額外開銷)              │
│  └─ 介面卡可疊加/混合 (Adapter Ensemble)                  │
│                                                          │
│  部署層                                                   │
│  ├─ vLLM / TGI: 推論服務 (支援載入合併後權重)              │
│  ├─ llama.cpp / GGUF: 量化推論 (與 NF4 不同格式)          │
│  └─ 邊緣部署: 手機/嵌入式 (經進一步量化)                   │
└─────────────────────────────────────────────────────────┘

關鍵指標

指標典型值 / 範圍說明
LoRA rank (r)8, 16, 32, 64論文發現 r=16 配合全層注入效果好於 r=64 僅注入 Q/V
LoRA alpha (α)通常等於 r 或 2r縮放因子,α/r 為實際縮放比
量化精度NF4 (4-bit)基座權重儲存精度
反量化精度BF16計算時精度
訓練精度BF16介面卡權重與梯度精度
blocksize64 (量化) / 256 (雙重量化)論文預設配置
可訓練引數量(7B 模型)~數千萬 (估算,取決於注入層數與 r)約為總參的 ~0.1%–0.5%
視訊記憶體節省~60%–75% vs 全精度 LoRA因模型規模增大而更顯著
訓練吞吐約為全精度 LoRA 的 60%–80% [社群估算]反量化引入額外開銷
下游任務精度接近全精度微調 (<1% 差距)論文在多個基準上驗證

供需與市場資料

需求端

需求方場景痛點
中小企業 / 初創垂直領域大型模型定製缺少多卡叢集,預算有限
獨立研究者學術實驗、模型微調僅有一張消費級 GPU
大廠研發部門快速原型驗證微調實驗迭代速度受限於排隊等叢集資源
資料服務公司為客戶批次微調行業模型降低推論/訓練成本

供給端生態

環節代表產品/服務定位
核心庫bitsandbytes (Tim Dettmers)NF4/雙重量化底層實現
架構整合Hugging Face PEFTQLoRA 配置介面與訓練流程封裝
最佳化工具Unsloth核心級 QLoRA 最佳化,社群報告速度提升 2–5x
一站式平台LLaMA-Factory整合 QLoRA 的 GUI 微調平台
雲端服務AWS / GCP / Lambda Labs提供支援 QLoRA 的 GPU 例項
介面卡市場Hugging Face Hub海量 LoRA/QLoRA 介面卡共享

市場規模(估算)

QLoRA 本身為開源技術,不直接產生營收,但它是 LLM 微調市場 的關鍵基礎設施元件。據 Grand View Research 等機構估算,全球 LLM 市場規模 2023 年約數十億美元,微調服務是其中增長最快的細分。QLoRA 通過降低微調門檻,間接擴大了微調市場的可及規模。


代表公司與資本對映

公司/團隊與 QLoRA 的關係資本關聯
Hugging FacePEFT 庫原生支援,Hub 上大量 QLoRA 介面卡2023 年估值 ~$45 億 [公開融資]
bitsandbytes / Tim DettmersQLoRA 論文一作團隊,bitsandbytes 庫維護者學術驅動,未獨立商業化(截至目前公開資訊)
UnslothQLoRA 加速最佳化,開源早期階段,獲 Y Combinator 支援 [公開資訊]
Lambda Labs提供適配 QLoRA 的 GPU 雲端服務2024 年融資 $3.2 億 [公開報道]
Meta (LLaMA)QLoRA 論文基於 LLaMA 驗證,帶動 LLaMA 生態股票程式碼 META
NVIDIAQLoRA 依賴 CUDA/統一記憶體生態股票程式碼 NVDA
Mistral / Qwen / DeepSeek 等社群廣泛使用 QLoRA 微調這些開源基座各自有融資/上市路徑

投資邏輯

核心投資論點

1. 降低大型模型微調門檻 → 擴大 AI 應用層 TAM

QLoRA 使微調從”需要叢集”降級為”需要一張卡”。這直接擴大了可以參與大型模型定製化的人群和企業數量,從而擴大了 AI 應用層的總可及市場。

2. 開源微調基礎設施 → 加速基座模型的生態鎖定效應

QLoRA 讓開源基座模型(LLaMA、Mistral、Qwen 等)的微調變得極其便捷,加速了開源模型的生態擴散。誰的基座模型被更多 QLoRA 介面卡覆蓋,誰的生態壁壘越深。

3. 推論端的延續價值

QLoRA 微調產出的介面卡可以合併回基座後,再做 4-bit/8-bit 量化部署。這形成了”4-bit 微調 → 合併 → 4-bit 推論”的全鏈路低位元閉環,利好量化推論硬體和軟體棧。

風險與侷限

  • MoE 模型適配: QLoRA 對 MoE 架構的視訊記憶體優勢需要重新評估,MoE 本身引數量大但啟用引數少,動態路由帶來額外複雜性。
  • 精度天花板: 對於極複雜的任務(如多步推論、長文件理解),4-bit 基座的表示能力損失是否可忽略,尚存爭議。
  • 替代方案競爭: 直接在更小模型上全引數微調、或使用更強的量化方法(如 AQLM、QuIP#),可能在部分場景下更優。

常見誤讀糾偏

❌ 誤讀 1:“QLoRA 把所有計算都在 4-bit 下完成”

✅ 糾正: QLoRA 將基座權重以 NF4 4-bit 儲存,但在實際矩陣乘法前,會反量化(dequantize)為 BF16 再進行計算。因此前向/反向傳播的計算精度仍是 BF16,不是 4-bit。視訊記憶體節省來自儲存層面,而非計算層面。這也是 QLoRA 訓練速度比全精度 LoRA 略慢的原因之一——反量化有額外開銷。

❌ 誤讀 2:“QLoRA 微調出來的模型精度比標準 LoRA 差很多”

✅ 糾正: 論文在多個基準(MMLU、HellaSwag、TruthfulQA 等)上報告,QLoRA 微調的效能與全精度 16-bit LoRA 微調高度接近(差距在噪聲範圍內)[Dettmers et al.]。這是因為 NF4 是資訊論最優的 4-bit 量化格式,且介面卡本身是全精度訓練的。不過,這不意味著所有下游任務都能完全無損,極端場景下仍需驗證。

❌ 誤讀 3:“QLoRA 和 GPTQ 是同一類技術”

✅ 糾正: GPTQ(Frantar et al., 2022)是訓練後量化(Post-Training Quantization, PTQ),用於推論部署時壓縮模型,不涉及訓練/微調。QLoRA 是量化感知微調,在訓練過程中使用 4-bit 儲存的基座 + 全精度介面卡。兩者可組合:先用 QLoRA 微調,合併介面卡後,再用 GPTQ 做推論量化。

❌ 誤讀 4:“QLoRA 論文聲稱 Guanaco-65B 達到 ChatGPT 99.3% 效能”

✅ 糾正: 論文使用的是Vicuna 基準測試(GPT-4 作為評判者的聊天機器人競技場評估),該評估方法存在明顯侷限性(評判者偏差、評估維度有限、非標準化)。99.3% 這個數字是在特定基準上的自評結果,不應等同於通用能力的全面對標。這更多說明 QLoRA 微調在聊天對話質量這一維度上表現不錯,而非全面超越或追平 ChatGPT。


學習路徑

入門(1–2 小時)

  1. 閱讀 Hugging Face PEFT 文件中 QLoRA 部分
  2. 跟隨一個 Colab 教程,用 QLoRA 微調一個 7B 模型(如 Mistral-7B / LLaMA-3-8B)

進階(1–2 天)

  1. 閱讀原始 LoRA 論文 [Hu et al., 2021]
  2. 閱讀 QLoRA 論文 [Dettmers et al., 2023],重點理解 NF4 的設計動機與雙重量化
  3. 嘗試不同 rank、不同注入層配置,觀察效果差異

深入(1–2 周)

  1. 閱讀 bitsandbytes 原始碼中 NF4 量化實現
  2. 閱讀 Unsloth 的核心最佳化程式碼,理解計算瓶頸在哪裡
  3. 對比 GPTQ、AQLM、QuIP# 等其他量化方案
  4. 研究 DoRA(Weight-Decomposed Low-Rank Adaptation)等後續改進

一句話總結

QLoRA 的本質是”用 4-bit 儲存換視訊記憶體、用低秩分解換可訓練引數”,它不是一個新的微調範式,而是讓已有微調範式(LoRA)在有限硬體資源下得以施展的工程最佳化——這個看似簡單的組合,實質性地降低了大型模型定製化的硬體門檻。


延伸閱讀與來源

來源連結 / 引用
QLoRA 論文Dettmers et al., “QLoRA: Efficient Finetuning of Quantized Language Models”, NeurIPS 2023, arXiv:2305.14314
原始 LoRA 論文Hu et al., “LoRA: Low-Rank Adaptation of Large Language Models”, ICLR 2022, arXiv:2106.09685
bitsandbytes 庫github.com/TimDettmers/bitsandbytes
HF PEFT 文件huggingface.co/docs/peft
GPTQFrantar et al., “GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers”, ICLR 2023
DoRALiu et al., “DoRA: Weight-Decomposed Low-Rank Adaptation”, arXiv:2402.09353, 2024
Unslothgithub.com/unslothai/unsloth
LLaMA-Factorygithub.com/hiyouga/LLaMA-Factory

本文技術事實基於論文原文與公開程式碼庫。視訊記憶體數字為論文報告或社群估算,實際值因模型規模、序列長度、batch size、架構版本等變數而異。市場與資本資訊來源於公開報道,僅供參考。

source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型