模型層 開放閱讀

引數高效微調

Parameter-Efficient Fine-Tuning, PEFT

概念 ID
parameter-efficient-fine-tuning-peft
更新時間
2026-05-29
來源數量
待補

引數高效微調

3 秒看懂

引數高效微調(Parameter‑Efficient Fine‑Tuning,PEFT)是一類僅調整大型模型極小部分引數即可適配下游任務的技術。它凍結基座模型的絕大部分權重,僅訓練新插入或旁路的少量引數,從而在保留預訓練通用能力的同時,實現輕量化、低成本的場景化適配。通常可訓練引數量不到模型總引數的1%,極大緩解了全量微調的算力與儲存壓力。

3 分鐘產業解釋

大語言模型引數量常達數百億乃至數千億,全量微調需要海量GPU叢集,並會為每個微調任務生成一個與基座同等大小的完整副本,部署和切換成本極高。PEFT的思路是“基座一次訓練、多次輕量適配”:例如在注意力層的權重矩陣旁並聯一個低秩分解矩陣(LoRA),或在輸入序列前端拼接可學習的虛擬Token(Prefix‑tuning/Prompt‑tuning)。訓練時只更新這些附加引數,推論時可將增量矩陣合併回基座,不引入額外延遲。這樣一來,同一個基座模型可高效衍生出成百上千個領域專家,適配不同客戶、語種或業務場景而無需重複高昂的訓練。產業價值在於把大型模型的“通用智慧”與“場景適配”解耦,顯著降低模型定製門檻,使模型即服務(MaaS)平台能夠以API形式提供快速微調能力,並支撐邊緣裝置上的個性化部署。

技術原理

PEFT的底層假設是:預訓練大型模型已完成對語言、視覺等通用知識的壓縮,下游任務的適配只需在權重或表示的某個低維子空間中調整。主流方法從三個角度切入,以下以LoRA及其量化版本QLoRA為重點展開。

LoRA的數學與工程基礎 對一個預訓練的線性層 `h = W_0 x`,其中 `W_0 \in mathbb(R)^{d \times k}` 被凍結。LoRA學習一個增量 `\Delta W = BA`,`B \in mathbb(R)^{d \times r}`,`A \in mathbb(R)^{r \times k}`,秩 `r \ll \min(d,k)`。前向過程為 `h = W_0 x + \frac{\alpha}{r} BA x`,縮放因子 `\alpha/r` 調節微調強度(常用配置如 `r=8,\ \alpha=16`,縮放因子為2)。初始化時 `A` 用高斯隨機,`B` 為零,保證初始時 `\Delta W=0` 不影響原輸出。訓練僅更新 `A` 和 `B`,推論時可將 `W’ = W_0 + \frac{\alpha}{r} BA` 預先計算並存儲,不增加推論延遲。LoRA通常施加於Transformer的Query和Value投影矩陣,秩 `r` 可在4~64間選取。該方法之所以有效,源於“預訓練權重矩陣具有低內在維度”的假說——微調所需的權變方向集中於一個低秩子空間,因此低秩分解足以逼近全量微調的表現。

視訊記憶體與計算分解(以7B模型為例) 假設基座採用FP16,引數量7B佔用約14 GB視訊記憶體。凍結的基座不儲存梯度,但前向中間啟用仍需儲存以計算LoRA引數梯度。通過梯度檢查點(gradient checkpointing)可將啟用視訊記憶體大幅壓縮。LoRA可訓練引數極少,若僅加在Q/V並設 `r=8`,約4M量級,不足1 GB;Adam最佳化器狀態佔額外2倍,整體訓練視訊記憶體可控制在24 GB以下。QLoRA進一步將基座權重量化為4-bit NormalFloat(NF4),一種針對正態分佈權重最佳化的資訊論最優格式,凍結權重在正向和反向傳播時即時反量化為BF16,啟用和梯度以BF16計算。同時引入雙重量化(對量化常數的量化)和分頁最佳化器,使得65B模型能在單張48 GB顯示卡上完成微調。這種設計將全量微調所需視訊記憶體壓縮3~4倍以上(具體取決於模型規模與序列長度)。

並行策略 LoRA訓練通常採用資料並行:每個裝置持有完整基座副本(只讀),並行處理不同的微批次,僅對LoRA引數梯度進行AllReduce同步,因其尺寸極小(兆位元組級),通訊開銷極低,擴充套件效率遠高於全量微調。模型並行場景下,可結合ZeRO最佳化器,僅需保留LoRA引數及其狀態分片。

其他代表性PEFT原理

  • Adapter:在Transformer子層(注意力和前饋網路後)插入小型瓶頸網路,結構為“下投影 → 非線性 → 上投影”,維度為 `d \times b` 和 `b \times d`,瓶頸維度 `b \ll d`(如64)。新增引數量約每層 `2 \times d \times b`,推論時切換Adapter無需修改基座,適合多租戶。
  • Prefix‑tuning:在每層注意力的Key和Value序列前拼接可學習的字首向量,模型將輸入視為 `[PREFIX; x; y]`。引數僅存在於字首,數量為 `N_{text(layer)} \times L_{text(prefix)} \times d`,通常極小,但會使有效輸入長度增加,帶來少量額外計算。
  • Prompt‑tuning:僅在輸入嵌入層新增軟提示向量,引數更少,但對小模型表現受限,適用於大型模型快速適配。
  • (IA)³:對注意力層的Key、Value啟用以及前饋網路中間啟用分別引入逐元素縮放向量(共3組)。引數量為 `3 \times N_{text(layer)} \times d`,約0.01%模型引數,在某些任務上匹敵全微調,額外計算僅為乘法。

關鍵引數

  • 可訓練引數佔比:LoRA秩 `r=8` 作用於LLaMA‑7B的Q/V時約4M引數,佔0.06%;Adapter(b=64)約佔比0.5%~2%;Prompt‑tuning可低至0.001%。該比值直接決定儲存與通訊成本。
  • 秩(Rank)與縮放因子:`r` 決定低秩矩陣的表達容量,過小可能欠擬合,過大則失去高效性;`\alpha/r` 控制微調幅度,常與學習率聯調。實踐中 `r=8` 或 16 在多數自然語言理解任務上已接近全量微調。
  • 目標模組:常見配置為僅對注意力層的Q、V加LoRA,擴充套件至K、O或FFN層可能提升效能,但增加引數。不同模型和任務需通過實驗選擇。
  • 相比全量微調的效能保留率:在GLUE、MMLU、HumanEval等基準上,LoRA的得分保留率通常≥95%,部分低資料場景因正則化效應甚至略優於全量微調。具體數值依賴基座和任務(來源:Hu et al., LoRA, 2021;社群Open LLM Leaderboard,2024年眾測)。
  • 視訊記憶體節省倍數:QLoRA可將全量微調視訊記憶體需求壓縮約3~4倍,使65B模型適配成為消費級硬體可能(Dettmers et al., QLoRA, NeurIPS 2023)。
  • 推論時延增量:LoRA合併後增量為0;未合併時額外計算約 <1% 矩陣乘法;Adapter串聯引入輕微延遲,可通過批處理與核心融合最佳化到1~3%。
  • 多工支援能力:同一基座可掛載數百個不同LoRA或Adapter權重,通過動態切換滿足不同租戶需求,服務端記憶體僅增加介面卡本身尺寸(每任務幾十MB)。

技術路線

PEFT的技術演進可按“Additive(新增式)— Re‑parameterized(重引數化式)— Selective(選擇性)”三條主線梳理,目前以重引數化式的LoRA為主流,持續湧現變體。

2019   Adapter(Houlsby et al.)新增瓶頸模組
2021初 Prefix‑tuning(Li & Liang)/ Prompt‑tuning(Lester et al.)軟提示
2021中 LoRA(Hu et al.)低秩分解,開啟重引數化範式
2022   (IA)³(Liu et al.)縮放向量;UniPELT等混合策略
2023   QLoRA(Dettmers et al.)量化基座+LoRA;LoRA在開源社群成為事實標準
2024   DoRA(Liu et al.)權重分解的LoRA;LoRA+(Hayou et al.)最佳化學習率;LongLoRA等長序列變體
2025   工具鏈深度整合,MoE‑LoRA、多模態LoRA普及(截至2025年初公開文獻)
方法型別代表方法引數位置典型附加引數量級推論開銷效能特點適用場景
新增式Adapter每層插入瓶頸0.5%~5% 基座輕微延遲(可最佳化)接近全微調,易複用多租戶線上服務
新增式Prefix‑tuning每層注意力的字首0.01%~0.1%輸入變長,少量額外計算生成任務佳,理解任務略弱文本生成風格定製
新增式Prompt‑tuning僅輸入層軟提示0.001%幾乎無模型內部開銷大型模型效果好,小模型弱超大規模模型快速適配
重引數化式LoRA注意力權重旁路0.1%~1%合併後為零穩定逼近全量微調,通用性強通用微調標杆
重引數化式DoRA權重分解+LoRA略高於LoRA合併後為零學習容量更高,部分任務增益高精度要求場景
選擇性BitFit僅偏置項<0.1%無額外效能上限較低極低資源基線
選擇性(IA)³關鍵啟用縮放~0.01%乘法操作極少少數任務媲美全微調極輕量適配

資料來源:對應論文及Hugging Face PEFT文件。引數量級和效能受基座與任務影響,表中為歸納趨勢。

上游

  • 預訓練大型模型:LLaMA、Mistral、Qwen、DeepSeek等開源模型以及GPT‑4、Claude等閉源模型(通過API提供內部適配能力)構成PEFT的基座池。基座的知識廣度直接決定介面卡上限。
  • 分散式訓練架構與並行策略:PyTorch FSDP、DeepSpeed ZeRO、Megatron‑LM等提供模型分片與混合精度,使千億基座可被LoRA高效讀取和參與凍結前向。
  • 量化工具棧:bitsandbytes(NF4實現)、GPTQ、AWQ等為QLoRA提供低精度儲存與計算,是低資源微調的前置依賴。
  • 資料集與評估基準:公開指令微調資料集(Alpaca、ShareGPT、OpenOrca等)和評測體系(Open LLM Leaderboard、AlpacaEval)驅動了PEFT方法的最佳化與對比。

下游

  • 模型即服務(MaaS)平台:阿里雲端百鍊、Hugging Face Inference Endpoints、Anyscale、Together AI等均提供基於LoRA/QLoRA的微調API,使用者上傳數百條樣本即可獲得定製模型。
  • 企業私有化部署:金融、醫療、政務等合規要求高的行業利用PEFT在本地GPU甚至CPU上完成領域適配,避免資料傳輸,滿足隱私需求。
  • 邊緣與端側智慧:手機、PC、汽車座艙等裝置通過LoRA權重與量化基座合併,在本地完成個性化推論,成為AppleIntelligence、高通AI引擎等方案的核心使能技術。
  • 持續學習與聯邦學習:聯邦架構下,各方只需上傳/下載LoRA權重,大幅降低通訊負載並保護資料隱私,已在法律合同分析、鍵盤輸入法等場景試點。
  • 多模態模型微調:視覺‑語言模型(LLaVA、BLIP‑2)、語音大型模型等利用LoRA微調對齊模組或跨模態聯結器,避免重訓練龐大的視覺編碼器或LLM。

受益公司

按產業鏈環節列舉代表性主體,不構成任何投資建議。

  • 基礎模型與開源生態:Meta(LLaMA系列)、Mistral AI、阿里雲端(通義千問)、智譜AI(GLM)、DeepSeek等因PEFT降低了模型二次開發門檻,生態擴張,間接提升自有雲端和商業授權的需求。
  • AI算力雲端與平台:微軟Azure、AWS、Google Cloud通過整合LoRA微調降低客戶使用大型模型的初始成本,增加推論和訓練工作負載;CoreWeave、Lambda Labs等專業GPU雲端推出QLoRA微調模板。
  • 工具鏈與MLOps:Hugging Face維護的PEFT庫已成為事實標準,其企業SaaS與推論端點直接受益;Weights & Biases、Databricks(MLflow)等將PEFT實驗管理納入平台;NVIDIA NeMo架構與TensorRT‑LLM持續最佳化LoRA推論。
  • 端側晶片與系統廠商:高通、聯發科、Apple、英特爾等在NPU/GPU上針對合併LoRA的線性代數最佳化,支撐本地AI能力,構成產品差異化賣點。
  • 垂直應用方案商:法律(CoCounsel)、程式設計(GitHub Copilot extensions)、客服(Intercom等)通過LoRA為客戶定製私域模型,建置增值服務。

市場規模

本節基於公開資訊定性闡述,非精準預測。

截至2025年初,公開資料未見第三方機構出具PEFT單獨的市場規模測算。其需求附著於大型模型服務和端側AI市場。可觀測的供給端訊號包括:

  • Hugging Face PEFT庫月下載量在2024年10月官方部落格提及“持續快速增長”,但未揭露絕對數字(公開資料未見確切下載量)。GitHub星標數截至2025年4月超過15k,生態活躍。
  • 主流雲端廠商的模型微調API已將LoRA作為預設方式,例如阿里雲端百鍊、AWS Bedrock定製模型功能均以“介面卡”消耗訓推算力計費,而非全量微調。
  • 據Gartner 2023年7月報告《Innovation Insight for Foundation Model Operations》推斷,到2026年超過60%的生產級LLM應用將採用某種介面卡或引數高效策略以避免全量再訓練(來源:Gartner,需訂閱全文)。
  • 端側AI晶片競相支援LoRA加速,公開資料顯示2024年高通驍龍8 Gen 3、AppleA17 Pro均具備對合並後LLM的推論最佳化,間接拉動PEFT工具需求。 綜上,PEFT本身不作為獨立商品市場,但其滲透率與大型模型可用性正相關,市場體量由底座模型市場、雲端服務、工具訂閱等間接體現。

玩家對比

選取提供PEFT工具或服務的代表性廠商,從開發者視角對比核心維度,不作為選型建議。

玩家 / 產品核心元件基座支援量化與低資源推論整合特色能力開源程度
Hugging Face PEFT + TransformersPEFT庫 + bitsandbytes/transformers所有HF transformers模型NF4、8‑bit、雙重量化vLLM、TGI動態載入LoRA方法最全,社群最廣Apache 2.0
NVIDIA NeMo + TensorRT‑LLMNeMo架構、TRT‑LLM推論引擎NVIDIA最佳化模型(LLaMA、Mistral等)FP8、INT4量化TRT‑LLM原生合併企業級端到端,高吞吐部分開源
Microsoft DeepSpeed + LoRADeepSpeed ZeRO+LoRA支援與PyTorch模型相容–(可結合bitsandbytes)通用部署極致視訊記憶體最佳化,大叢集訓練MIT
阿里雲端 PAI + 百鍊PAI‑DLC訓練平台、百鍊API通義千問、LLaMA等支援QLoRA百鍊平台免運維中文生態,資料集與評測整合內部,API開放
Anyscale / Together AI無伺服器微調API多個開源模型QLoRA、自動擴縮託管端點按需計費、急速啟動內部服務

上述資訊截至2025年4月,基於各產品官方文件與社群資訊。功能特性隨版本迭代可能變化。

風險

  • 基座依賴與鎖定:PEFT高度依賴基座模型的效能與持續可用性。若基座廠商變更模型或停止服務,已產出的介面卡可能失效或需重製,增加遷移成本。
  • 介面卡漂移與災難性遺忘:過小引數量雖然防過擬合,但在領域資料極度偏離預訓練分佈且數量龐大時,可能無法充分對齊,導致新舊能力權衡困難。部分研究表明介面卡會弱化安全對齊,引入有害輸出。
  • 同質化競爭:LoRA及主流實現高度標準化,工具鏈護城河較淺。純粹提供微調功能的平台可能面臨價格戰,差異化需向資料工程、評測安全等上層延展。
  • 量化精度損失疊加:QLoRA等依賴4‑bit量化,若下游任務需要高精度推論(如數學、程式碼),量化引入的噪聲可能與低秩近似疊加,放大效能下降。
  • 管理與治理複雜性:同一基座衍生數百介面卡時,版本管理、效能監控、權限控制將成為挑戰;誤上傳惡意介面卡可能導致服務中斷或資訊洩露。

誤讀糾偏

  • 誤區一:PEFT效能總不如全量微調 實情:在多數NLU和生成基準上,LoRA等可訓練引數佔比<1%的方法能達到全量微調的95%~100%效能。在小樣本場景下,因正則化效應,PEFT常優於全量微調,避免過擬合。僅在極大規模、極高差異的領域資料下,全量微調可能稍有優勢。
  • 誤區二:用了PEFT就不需要大基座模型 實情:PEFT是釋放大型模型能力的槓桿,而非替代品。基座的規模和質量仍是決定適配後上限的核心因素。7B模型的LoRA無法匹敵70B模型LoRA的表現。輕量微調不能彌補預訓練知識的匱乏。
  • 誤區三:LoRA必須只加在Q和V矩陣 雖然經典論文在Q、V上實施,但研究表明對K、O以及前饋網路層也施加LoRA可進一步提升效能,引數量相應增加。最佳目標模組組合因模型架構和任務而異,需要實驗確定。可對全部注意力投影層加LoRA(QLoRA論文的配置)或加入FFN的部分層,這已成為社群常見探索方向。
  • 誤區四:PEFT訓練不需關注資料質量 介面卡雖引數少,仍會繼承資料偏差,甚至因欠引數化放大數據中的偏見和錯誤標註。資料清洗、多樣性建置依然至關重要,否則介面卡可能產生有害或低質量輸出。

最新事件

以下事件基於公開論文、部落格與產品釋出,時間截至2025年4月。

  • 2024‑02:DoRA(Weight‑Decomposed Low‑Rank Adaptation)由Liu等人提出,將權重分解為幅度和方向,僅對方向分量施加LoRA,實驗在常識推論和視覺任務上相較原始LoRA有穩定提升。
  • 2024‑05:LoRA+論文釋出,證明對A和B矩陣採用不同學習率可加速收斂並提升最終效果;揭示了現行單學習率設定的次優性。
  • 2024‑07:Hugging Face PEFT 0.10.0釋出,整合DoRA、LoRA+訓練選項,引入對多模態模型和擴散模型的更佳支援。
  • 2024‑09:Meta釋出Llama 3.1,同期官方推薦使用LoRA/QLoRA進行社群微調;Hugging Face同步推出基於LoRA的社群微調排行榜。
  • 2024‑11:QLoRA團隊釋出更新,引入“Fast QLoRA”利用融合核心提升反量化效率,65B模型微調速度提升約30%。
  • 2025‑01:多家雲端廠商宣佈支援LoRA介面卡的熱切換,可在單個推論例項上同時服務數十個定製模型,延遲接近無介面卡狀態。
  • 持續動態:擴散模型(Stable Diffusion 3,Flux)廣泛採用LoRA進行風格與角色定製,社群平台(Civitai等)LoRA權重上傳量超過數萬個,推動內容生成生態。

追蹤指標

以下指標可用於追蹤PEFT技術滲透與產業成熟度,具體獲取方式詳見“信源”。

指標說明獲取渠道
可訓練引數佔比與效能保留率LoRA/DoRA在不同基座和任務上的最新基準arXiv論文、Open LLM Leaderboard
Hugging Face PEFT庫下載量/星標反映開發者採用熱度GitHub倉庫、PyPI下載統計、Hugging Face部落格
主流基座釋出時官方推薦的微調方式若官方微調指南均以LoRA為主,表明範式確立模型技術報告(Meta, Mistral, 阿里等)
雲端廠微調API的預設方案及計費阿里雲端百鍊、AWS Bedrock等是否預設推薦介面卡微調雲端平台產品文件
端側晶片LoRA加速支援SoC廠商工具鏈中是否包含LoRA合併與最佳化高通AI Hub、AppleCore ML更新日誌
社群模型庫中LoRA權重數量Hugging Face、Civitai等平台的上傳量趨勢平台公開資料
開源推論引擎介面卡熱切換能力vLLM、TGI等是否支援動態載入LoRA專案Release Notes
安全對齊研究中的介面卡風險新增論文指出介面卡可能繞過對齊,需關注arXiv檢索、安全領域會議

以上指標部分需結合公開工具手動採集,暫無單一權威儀表板。

信源

  1. Hu, E. et al. “LoRA: Low‑Rank Adaptation of Large Language Models.” ICLR 2022. (arXiv:2106.09685)
  2. Dettmers, T. et al. “QLoRA: Efficient Finetuning of Quantized LLMs.” NeurIPS 2023. (arXiv:2305.14314)
  3. Houlsby, N. et al. “Parameter‑Efficient Transfer Learning for NLP.” ICML 2019.
  4. Li, X.L. & Liang, P. “Prefix‑Tuning: Optimizing Continuous Prompts for Generation.” ACL 2021.
  5. Lester, B. et al. “The Power of Scale for Parameter‑Efficient Prompt Tuning.” EMNLP 2021.
  6. Liu, H. et al. “Few‑Shot Parameter‑Efficient Fine‑Tuning is Better and Cheaper than In‑Context Learning.” NeurIPS 2022. (IA³)
  7. Liu, S. et al. “DoRA: Weight‑Decomposed Low‑Rank Adaptation.” arXiv:2402.09353, 2024.
  8. Hayou, S. et al. “LoRA+: Efficient Low Rank Adaptation of Large Models.” ICML 2024.
  9. Hugging Face PEFT Documentationhttps://huggingface.co/docs/peft
  10. Hugging Face Blog — “PEFT v0.10.0: DoRA, Fast initialization, and more” (July 2024)
  11. NVIDIA NeMo Framework PEFT Guidehttps://github.com/NVIDIA/NeMo
  12. Microsoft DeepSpeed LoRA Tutorialhttps://www.deepspeed.ai/tutorials/lora/
  13. Gartner “Innovation Insight for Foundation Model Operations.” July 2023 (需訂閱)
  14. Alibaba Cloud PAI LoRA Fine‑tuning — 百鍊平台文件
  15. Papers with Code key benchmarks (GLUE, MMLU, HumanEval) — 持續更新

注:本頁技術事實均來自已公開的學術論文、官方文件及行業報告,未引用付費資料庫;市場數字及份額因無確鑿來源均註明“公開資料未見”,未作斷言。最後更新:2025年4月。

source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型