模型層 開放閱讀

監督微調

Supervised Fine-Tuning, SFT

概念 ID
supervised-fine-tuning-sft
更新時間
2026-05-29
來源數量
待補

監督微調

1. 3 秒看懂

監督微調(Supervised Fine‑Tuning, SFT)是大型模型從“通用基座”邁向“可用助手”的核心一躍。它在預訓練模型之上,利用高質量“指令‑理想回復”樣本進行二次訓練,讓模型學會遵循指令、對齊人類偏好並保持輸出規範。SFT 不是從零煉製大腦,而是低成本、高效率地為模型注入行為模式,是所有對話模型、程式碼助手、AI Agent 的必要建置步驟。

2. 3 分鐘產業解釋

預訓練大型模型本質上是一臺“續寫機器”——給定字首,它按機率接續文本。這種原始能力無法穩定響應使用者的精確要求,例如“請用表格對比兩種方案”。SFT 通過在萬級至千萬級(指令,期望答案)樣本上調整模型引數,教會模型將“指令”對映到“規整、有用、無害”的回覆。訓練形式上,SFT 是標準的語言建模任務:輸入由指令模板、系統提示和上下文拼接而成,損失只在期望回答的 token 上計算。工程上,SFT 通常作為 RLHF(基於人類反饋的強化學習)的前置步驟,也是當前多數開源 Chat 模型的主要訓練方法。產業鏈中,基座模型廠商(負責預訓練)與下游應用廠商(負責 SFT 微調)的分工日趨清晰——SFT 的算力與資料門檻遠低於預訓練,千美元級預算即可將開源基座調教成垂直領域專家,這讓大量中小團隊和企業得以掌控自己的模型行為。

3. 技術原理

SFT 將指令微調形式化為條件生成任務。給定樣本 (X, Y),其中 X 是包含指令、系統提示與可能上下文的完整輸入序列,Y 是期望輸出序列。模型引數 \theta 的最佳化目標為最小化在 Y 部分的負對數似然:

mathcal(L)_{text(SFT)} = -\sum_{t=1}^{|Y|} \log P_\theta(y_t \mid X, y_{<t})

只在 Y 的 token 位置上計算損失並回傳梯度,X 部分通常用忽略標籤遮蔽。模型架構不限,Decoder‑only(GPT、Llama 等)、Encoder‑Decoder(T5、Flan‑T5)或混合專家模型(MoE)均可適用。對於 Decoder‑only 模型,訓練時整個序列被拼接為 [X] [分隔符] [Y] [EOS]

實際實施中,還會引入以下機制:

  • 序列打包:將多個短樣本拼接為長序列,藉助 attention mask 隔離樣本間干擾,提高 GPU 利用率。
  • 損失加權:為高質量樣本分配更高權重,或對長答案做歸一化,防止模型偏向短回覆。
  • LoRA/QLoRA:凍結原模型,僅訓練低秩適配矩陣,將視訊記憶體和計算需求降至全量微調的 1/10 以下;QLoRA 進一步將基座量化為 4 位。
  • 上下文長度擴充套件:通過 RoPE 位置編碼插值(如 NTK‑aware scaling)等方法,使模型在 SFT 階段適應更長指令,無需重訓基座。

訓練流程可簡化為: 原始預訓練模型 → 指令資料載入並填模板 → Tokenize → 前向計算(僅答案部分 loss)→ 反向傳播更新引數/低秩介面卡 → SFT 模型。 在並行通訊方面,SFT 通常採用資料並行+ZeRO 最佳化,涉及 All‑Gather 和 Reduce‑Scatter,極少出現 All‑to‑All 通訊,除非基座為 MoE 且啟用專家路由,這在小規模 SFT 中不常見。

4. 關鍵引數

SFT 的行為成敗高度依賴引數設定,以下為社群廣泛驗證的典型範圍(基於公開文件及開源工具預設值,不代表任何單一廠商):

  • 學習率 (Learning Rate):通常比預訓練低 1–2 個數量級,常見區間 1e-55e-5(使用 AdamW 最佳化器)。全量微調偏向較低值,LoRA 可適當提高。
  • 批次大小 (Batch Size):全域性批次規模常設為 128 或更高,受限於視訊記憶體時依賴梯度累積;小批次可能導致收斂不穩定。
  • 訓練輪數 (Epochs):一般 1–5 輪。資料量小時容易過擬合,資料量大且質量高可適當增加輪數。
  • 序列長度 (Max Length):需覆蓋絕大部分指令‑回答對,常見設為 2048、4096 或更長;過長且不打包會浪費計算。
  • 資料混合比例:若資料集包含多種任務(程式碼、數學、閒聊等),需按配比取樣,防止某些能力被稀釋。無通用標準,通常通過小規模消融實驗確定。
  • LoRA 超引數:秩 (rank) 常設為 8–64,alpha 為 16–128,作用於 query/value 注意力投影層;目標模組選擇影響適配能力與訓練代價。
  • Dropout/正則化:注意力 dropout 通常設為 0 或極小,過度正則化會損傷基座知識。
  • 最佳化器與排程:AdamW 配合餘弦退火或恆定學習率,預熱步數約佔總步數的 1–3%。

這些引數需結合模型規模、資料體量和任務目標聯合調整。實用中多采用 LLaMA‑Factory、Axolotl 等架構提供的預設配置檔案,大幅降低試錯成本。

5. 技術路線

根據微調投入和需求深度,可劃分三類主流技術路線:

維度全量 SFT引數高效 SFT (LoRA/QLoRA/Adapter)僅 Prompt 工程
可訓練引數量100%(數億至數千億)<1%(數百萬至數千萬)0
視訊記憶體需求極高,需多卡多節點低,單卡 24 GB 即可僅推論所需視訊記憶體
訓練資料量萬級~百萬級同左,也可適應更小高質量集零樣本 / 少量示例
指令跟隨穩定性與全量相當或略弱,介面卡可插拔弱,高度依賴基座對齊程度
災難性遺忘風險中,需精心設計資料與學習率低,原模型權重凍結
訓練成本(行業估算)數十至數千 GPU 時數百 GPU 時(單卡數小時至數天)0
適用場景基座廠商深度改造,追求極致效能下游應用方快速適配多場景、快速迭代原型驗證、簡單整合

全量 SFT 能最大限度釋放模型潛力,但算力門檻高。引數高效方法憑藉低成本和靈活性成為應用層主流,尤其適合企業圍繞多個開源基座建置領域模型矩陣。僅 Prompt 工程仍具價值,但面對複雜任務難以保證一致性。近年來還出現“多階段 SFT”實踐:先用大規模通用指令資料使模型學會基礎對話與遵循格式,再用高難度的程式碼、數學、多輪推論資料精細打磨。

6. 上游

  • 基座語言模型:完成大規模預訓練、具備基礎世界知識的模型。開放權重系列(Llama、Mistral、Qwen、DeepSeek 等)是 SFT 最常見的上游。基座模型的能力天花板直接決定 SFT 後可釋放的上限。
  • 指令資料集:是 SFT 的“教材”。來源包括人工眾包撰寫(質量高、成本貴)、強模型蒸餾(如 GPT‑4 生成回答)、合成增強(Self‑Instruct、進化演算法等)以及真實使用者互動脫敏日誌。資料標註平台(如 Scale AI、Surge AI)與開源資料集專案(OpenOrca、UltraChat、OpenHermes 等)構成核心供給。
  • 算力與訓練架構:GPU 雲端服務(Lambda Labs、CoreWeave 等)或自有叢集提供算力;開源架構(Axolotl、LLaMA‑Factory、Firefly、Hugging Face TRL)大幅簡化資料流、分散式訓練和評估,推動 SFT 平民化。

7. 下游

  • 對話助手/聊天機器人:直接部署 SFT 模型,提供客服、陪伴、知識問答等面向消費者的服務。
  • 垂直行業應用:金融分析、醫學諮詢、法律文書、教育輔導等場景,往往在通用 SFT 模型基礎上進行二次領域微調,注入專有資料和業務規則。
  • AI Agent 大腦:作為意圖路由、工具選擇與多步規劃的核心排程器,SFT 模型需學會輸出結構化動作(JSON 函式呼叫、API 引數)並遵循系統約束。
  • 對齊流水線元件:SFT 模型作為 RLHF 的初始策略,或直接與 DPO 等偏好對齊方法銜接,完成從“會做”到“做對”的過渡。

8. 受益公司

(依據公開資訊梳理產業鏈角色,無任何買賣或推薦意圖。)

  • 基座模型分發方:Meta(Llama 系列)、Mistral AI、阿里巴巴(Qwen)、DeepSeek 等通過開放權重擴大生態,其模型因易於 SFT 而獲得海量部署,間接鞏固其技術影響力。
  • 微調平台與工具鏈廠商:Together AI、Fireworks AI、Anyscale 提供模型微調與推論託管,降低企業 SFT 工程負擔;Hugging Face 以生態、資料集和 AutoTrain 等工具成為核心入口。這些平台通過算力和工作流服務獲得收益。
  • 資料服務商:Scale AI、Surge AI、Labelbox 等為企業生成或標註定製化 SFT 資料;合成數據技術公司(如 NVIDIA 的 Nemotron 合成管線)亦開始提供高質量的領域指令集。
  • 垂直應用先行者:金融、醫療、法律等領域企業將自由資料與開源基座結合建置私有模型,這類“行業+AI”的先行者有望通過模型壁壘提升服務單價與客戶粘性。
  • 開源社群與工具維護者:LLaMA‑Factory、Axolotl 等開源工具背後的團隊雖多為非盈利或半商業化,但其技術方案大幅降低產業門檻,間接催生培訓、諮詢等周邊服務。

9. 市場規模

截至 2025 年 4 月,公開市場研究報告尚未單獨拆分“監督微調工具與服務”作為獨立品類的規模統計。SFT 相關支出分散在 AI 訓練基礎設施、模型即服務 (MaaS) 和資料標註市場中。

從可見指標推斷:頭部微調平台月活微調任務數持續增長;OpenAI、Together AI 等按 token 或 GPU 時計算微調費用,單次微調成本從數十美元到數千美元不等。同時,企業出於資料隱私和合規考慮,傾向在自有環境完成 SFT,帶動本地化訓練工具和 GPU 伺服器的需求。整體而言,SFT 作為大型模型落地的必選環節,其關聯市場正隨模型應用擴大而同步膨脹,但準確的 TAM(可獲取市場規模)數字仍未公開揭露(公開資料未見)。

10. 玩家對比

(資訊來自各平台官網及文件,截至 2025 年 4 月。)

玩家型別支援的典型基座模型微調方式計費模式/特色來源
OpenAI閉源 APIGPT‑4o、GPT‑4o‑mini 等全量微調(黑盒)按訓練 token 收費,提供微調 UIplatform.openai.com
Together AI開源平台Llama、Mistral、Qwen 等LoRA、QLoRA、全量按 GPU 時或微調任務計費,支援推論部署together.ai
Fireworks AI開源平台Llama、Mixtral 等LoRA 微調按微調任務和推論 token 計費,強調低延遲fireworks.ai
Anyscale開源平台Llama 系列等LoRA、全量基於 Ray 架構,企業級微調管道anyscale.com
Hugging Face生態+託管所有主流開源模型AutoTrain(PEFT 全封裝)免費層與訂閱,社群資料集/模型整合huggingface.co
阿里雲端 PAI雲端平台Qwen、Llama 等全量、LoRA 等集成於機器學習平台,按資源使用計費阿里雲端官網
LLaMA‑Factory開源架構數十種 Decoder 模型LoRA、QLoRA、全量、部分凍結免費,需自備 GPU,提供 Web UI 與命令列GitHub 倉庫
Axolotl開源架構聚焦 Llama、Mistral 等LoRA、QLoRA、全量配置驅動,社群活躍,免費GitHub 倉庫

對比可見,雲端平台與開源架構分別滿足“極速上手”與“完全掌控/成本最佳化”的不同需求。企業選擇常取決於資料敏感度、定製深度和工程能力。

11. 風險

  • 資料隱私與合規:SFT 常需注入業務資料、使用者對話日誌或專有領域知識,若不經脫敏和權限管控,可能導致敏感資訊洩露;在金融、醫療等強監管行業,違規成本極高。
  • 能力漂移與災難性遺忘:資料配比不當、學習率過大或訓練輪數過多,易使模型原有知識被覆蓋,數學、推論或安全對齊能力顯著退化。
  • 合成數據放大風險:依賴強模型蒸餾生成 SFT 資料時,可能將教師模型的偏差、事實謬誤或風格偏好傳遞給學生模型,甚至導致模型學會“捏造”格式、產生幻覺模式。
  • 安全對齊退化:若 SFT 資料中未包含充分的拒絕示例和有害內容處理,可能洗掉原模型的安全護欄,增加越獄風險。
  • 供應商鎖定:過度依賴特定雲端平台的微調 API、資料格式和部署環境,未來遷移成本高,可能削弱談判能力。
  • 評估失效:常用基準(如 MT‑Bench、AlpacaEval)可能被社群過度擬合,或未能覆蓋業務真實長尾場景,導致“排行榜分高、實際應用差”的錯覺。

12. 誤讀糾偏

  • 誤讀:“SFT 只是讓模型學會說話格式,沒有實質智慧提升。” 事實:SFT 的作用是“激發”基座在預訓練中已習得但未對齊的能力。經典研究(如 LIMA 論文)表明,僅千條高質量示範資料就能使模型湧現強推論、遵循複雜約束和角色扮演能力,這是行為引導而非表面格式變化。
  • 誤讀:“SFT 使用多工資料,自然能處理所有任務,無需額外設計。” 事實:不同任務間存在負遷移和知識干擾。若資料配比失衡,新增能力可能以犧牲原有能力為代價。工業部署中仍需精心設計資料混合比例、監控基準衰退,並常採用多階段訓練緩解。
  • 誤讀:“SFT 需要類似 RLHF 的人類偏好比較資料,成本極高。” 事實:SFT 只需“示範答案”,即人類或強模型直接寫出理想回答,而 RLHF 需比較兩份回答的好壞。高質量示範資料的獲取成本顯著低於大規模偏好標註,且對標註員要求相對寬鬆,是低成本啟動對齊的首要選擇。
  • 誤讀:“全量 SFT 一定優於 LoRA。” 事實:在多工、多領域適配場景中,LoRA 在保持基座能力、避免遺忘方面有獨特優勢,且能實現介面卡的即插即用與快速迭代。全量 SFT 在追求極致任務效能時更具潛力,但面臨更高工程風險和資源消耗。
  • 誤讀:“SFT 可以完全替代 RLHF/DPO。” 事實:SFT 解決“怎麼做”的範例學習,RLHF/DPO 解決“哪種做法更好”的偏好對齊。兩者互補,SFT 提供良好初始策略,後續對齊則進一步約束行為邊界、最佳化風格和安全性。

13. 最新事件

(梳理截至 2025 年 4 月業界重要釋出與研究方向,涉及來源均為公開技術報告或官方宣告。)

  • 2024 年 6 月,NVIDIA 釋出 Nemotron‑4 340B 模型,重點揭露了高質量合成數據管線在 SFT 階段的應用,通過多步篩選和驗證生成大規模指令資料,顯著提升程式碼與推論能力(來源:NVIDIA 技術部落格)。
  • 2024 年 7 月,Meta 釋出 Llama 3.1 系列,技術報告詳細說明了多語言 SFT 的資料配方和人類偏好對齊過程,開源社群據此復現了多語言聊天的強基線(來源:Meta AI 論文)。
  • 2024 年 8 月,阿里巴巴 Qwen2.5 系列開源,同步公開了針對數學、程式碼的專項 SFT 方案和多階段訓練策略,成為許多中文應用微調的首選基座(來源:Qwen 官方部落格)。
  • 2024 年 12 月,DeepSeek‑V3 技術報告揭露其採用百萬級多領域 SFT 資料並結合強化學習最佳化,模型在推論和長上下文任務中表現突出(來源:DeepSeek 技術報告)。
  • 2025 年初,多模態 SFT 快速演進:LLaVA‑Next 等模型將影像、影片令牌作為指令輸入,擴充套件了純語言 SFT 的範式。同時 Salesforce 等提出 GLAN (Generalized Instruction Tuning),系統化生成覆蓋面極大的合成指令集,推動通用 SFT 資料規模化。
  • 2025 年 Q1,Hugging Face 社群湧現大量類 LLaMA‑Factory 的模組化微調工具,強調“配置驅動、一鍵復現”,反映 SFT 工程化正從實驗走向標準化。

14. 追蹤指標

要持續評估 SFT 模型質量和行業進展,可關注以下維度及其代表指標:

  • 指令跟隨勝率:AlpacaEval 2.0(以 GPT‑4 為裁判的對比勝率)、MT‑Bench(多輪對話評分)。留意所用評判模型版本及提示,避免時效偏差。
  • 專項能力基準:HumanEval/MBPP(程式碼生成 pass@k)、GSM8K/MATH(數學推論)、TruthfulQA(真實性)、IFEVAL(指令遵循嚴格度)等。關注各排行榜的防作弊更新。
  • 安全與拒答:有害查詢正確拒答率、非有害查詢誤拒率(如 XSTest)、攻擊越獄成功率變化。
  • 資料效率與泛化:單位微調樣本帶來的各基準得分提升幅度,以及模型對未見過指令模板、語言的組合泛化穩定性。
  • 行業供給指標:開源指令資料集釋出頻次、主流微調架構 Star/下載量趨勢、各大雲端平台微調 API 服務時段負載(如公開的狀態頁面),可間接感知行情熱度。

15. 信源

  • Chung, H.W. et al. “Scaling Instruction‑Finetuned Language Models.” arXiv 2210.11416. (FLAN)
  • Zhou, C. et al. “LIMA: Less Is More for Alignment.” arXiv 2305.11206.
  • Wang, Y. et al. “Self‑Instruct: Aligning Language Models with Self‑Generated Instructions.” ACL 2023.
  • Hu, E. et al. “LoRA: Low‑Rank Adaptation of Large Language Models.” ICLR 2022.
  • Dettmers, T. et al. “QLoRA: Efficient Finetuning of Quantized LLMs.” NeurIPS 2023.
  • Meta AI. “The Llama 3 Herd of Models.” 2024.
  • DeepSeek‑AI. “DeepSeek‑V3 Technical Report.” 2024.
  • NVIDIA. “Nemotron‑4 340B Technical Overview.” 2024.
  • Alibaba Cloud. “Qwen2.5 Technical Report.” 2024.
  • Together AI, Fireworks AI, Hugging Face, Anyscale 官方文件與定價頁。
  • LLaMA‑Factory, Axolotl, Hugging Face TRL 開源專案頁。
  • AlpacaEval, MT‑Bench, Open LLM Leaderboard 官方網站。

注:所有財務、市場份額或產能類數字均遵循“公開資料未見”原則,未編造具體數值。涉及價格和成本處採用各平台公開標價或行業經驗區間。

source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型