晶片層 開放閱讀

退火

Annealing

概念 ID
annealing
更新時間
2026-05-29
來源數量
待補

退火

3秒看懂

退火(Annealing)是一類從物理退火過程借來的“溫度驅動”最佳化理念,深度學習中主要表現為學習率退火(讓模型從大膽探索過渡到精細收斂)和模擬退火演算法(以機率接受劣解跳出區域性最優)。它不是單一演算法,而是一套調節“探索-利用”平衡的通用排程策略,已內化為現代模型訓練的標配元件。

3分鐘產業解釋

在AI工程化現場,退火是一組看不見卻無處不在的最佳化排程方法。訓練大型模型時,工程師幾乎都會指定一個學習率退火計劃——餘弦退火(Cosine Annealing)、帶熱重啟的餘弦退火、甚至每世代的階梯衰減,這直接關係到最終模型精度和訓練穩定性。超引數搜尋、結構搜尋等AutoML環節,模擬退火常被用來替代網格搜尋,在巨大組合空間裡用可接受的計算成本找到較優配置。退火不產生單獨營收,卻是深度學習架構(PyTorch、JAX、TensorFlow)及雲端上訓練服務的標準“隱式技能”,並正被編譯到訓練加速庫(如DeepSpeed)的預設管線裡。一句話:誰做訓練,誰就在用退火。

15分鐘專家深入

深度學習中“退火”有三個主要輻射面:

  1. 學習率退火(LR Annealing) 即動態調節最佳化步長。核心思想:初期允許大步長快速遍歷損失地貌,後期收縮步長,在最小值區域穩定下來。方法包括分段常數衰減、指數衰減、多項式衰減,以及影響力最大的餘弦退火家族。餘弦退火(Loshchilov & Hutter, 2016)用餘弦函式在給定週期內平滑地從初始值降到終值,熱重啟版本通過週期性重置學習率製造多次“探索-收斂”迴圈,顯著提升泛化能力。隨後出現的One‑Cycle策略(Smith, 2018)將單個退火週期拆分為先升後降,帶動學習率從低升高再退火,配合同步動量調節,能在極快訓練內逼近甚至超過標準多週期訓練效果。

  2. 模擬退火(Simulated Annealing) 一種非梯度全域性最佳化演算法,源於Metropolis準則。在超引數調優、網路結構搜尋、強化學習策略搜尋等“不可微”領域廣泛使用。演算法維護一個“溫度”T,當前解的鄰域擾動產生候選解,若候選解更優則接受,若更差則以機率 exp(-ΔE/T) 接受。溫度隨時間衰減,使系統從“可以接受大幅度變差”逐漸過渡到“基本只接受改善”,模擬固體退火中原子從高能無序到低能有序的過程。該演算法常與遺傳演算法、貝葉斯最佳化配合出現在AutoML平台中。

  3. 探索退火(Exploration Annealing) 多見於強化學習,如ε‑greedy策略讓ε(隨機動作機率)隨時間衰減,允許智慧代理先充分探索環境,再精細利用已學知識。

產業實踐中,最常“顯式”被調參的是學習率退火。大型模型(尤其Transformer類)多采用帶warmup的餘弦退火:先線性增加學習率到峰值,再按餘弦路徑下降,有效避免訓練初期的數值不穩。在DeepSpeed、Megatron‑LM等分散式訓練棧中,學習率排程器與最佳化器、資料並行策略深度耦合,形成一套開箱即用的“訓練配方”。因此,退火已從學術技巧演變為一條工程契約:給定算力預算、批次大小、模型大小,便能推算合適的退火週期與形狀。

技術原理(最深)

1. 模擬退火演算法核心機制

狀態空間 S,目標函式 f: S → R(尋找最小值)
引數:初始溫度 T₀,終止溫度 T_min,冷卻率 α (<1),鏈長 L
1. 隨機生成初始解 s ← random(S);T ← T₀
2. 當 T > T_min 時:
   2.1 重複 L 次:
        a. 生成鄰居解 s' ← neighbour(s)
        b. ΔE ← f(s') - f(s)
        c. 若 ΔE ≤ 0 則 s ← s'
           否則以機率 exp(-ΔE / T) 接受 s ← s'
   2.2 T ← α * T
3. 輸出 s

關鍵點:接受機率隨溫度下降而遞減,使演算法在早期有能力跳出淺谷,晚期則精細化下山。冷卻進度表(T衰減規律)和鄰域生成策略是決定效率的核心。溫度下降過快易陷入區域性最優,過慢則計算成本高企。

2. 學習率餘弦退火數學表達

設週期長度 T_max,當前迭代步數 t,初始學習率 η_max,目標學習率 η_min:

η_t = η_min + 0.5 * (η_max - η_min) * (1 + cos(π * t / T_max))

若帶重啟,則每經過 T_i 個步數後將 t 置0並調整 T_max。典型設定是每隔固定epoch數重啟,且 η_max 可以通過因子降低(如每次重啟後初始學習率按衰減係數縮小)。

引數意義(定性):

  • η_max:決定了引數空間搜尋半徑的上限。過大易振盪,過小收斂過慢。
  • η_min:最終精細收斂步長,通常設為 η_max 的 0.001~0.01 倍([模型經驗])。
  • 週期 T:決定退火節奏。太短退火不充分,太長則過早進入小步長階段,浪費算力。
  • 預熱步數:在達到 η_max 前的線性增長步數,穩定初期訓練。

3. 探索退火(以ε‑greedy為例)

選定衰減函式,如指數衰減 ε_t = ε_end + (ε_start - ε_end) * exp(-t / decay),使隨機探索比例從 ε_start 逐步降至 ε_end,確保長期回報的收斂。

退火與最佳化器協同: 現代自適應最佳化器(AdamW等)內部自帶引數自適應縮放,但外部學習率退火仍然重要,因為它獨立控制全域性搜尋步長,與自變數自適應機制形成互補,實現雙層尺度調節。

技術演進史

  • 1953:Metropolis等人提出Metropolis抽樣準則,為模擬退火數學基礎。
  • 1983:Kirkpatrick等將退火思想用於組合最佳化,正式命名“模擬退火”(Simulated Annealing),最早用於VLSI版面配置。
  • 1990s:模擬退火被引入神經網路訓練(如玻爾茲曼機)及超引數選擇。
  • 2000s前期:深度學習訓練中普遍採用分段常數或指數學習率衰減。
  • 2016左右:Loshchilov與Hutter提出帶熱重啟的隨機梯度下降(SGDR),系統引入餘弦退火策略,成為之後數年影像分類等基準任務的標準配置。
  • 2017:Leslie Smith提出迴圈學習率(Cyclical LR)
  • 2018:Leslie Smith提出One‑Cycle Policy,將退火週期與動量配對,進一步提升訓練速度。大語言模型興起,帶線性預熱的餘弦退火成為Transformer訓練預設配置;結合梯度累積、混合精度的退火排程被固化進分散式訓練架構。同時,模擬退火在神經結構搜尋(NAS)和AutoML中作為黑盒最佳化備選方案持續存在。
  • 前沿延伸:量子退火硬體(D‑Wave)試圖用物理系統直接求解某些最佳化問題,與深度學習的訓練退火形成概念呼應,但目前未進入主流訓練流程。

技術路線對比(量化表)

退火策略探索特性收斂速度常規模模型最終精度調參難度典型實現依賴
分段常數衰減陡峭切換,後期驟降中等中等StepLR, MultiStepLR
指數衰減平滑單調下降較慢中等ExponentialLR
餘弦退火(單週期)前期高、後期溫和平滑較快較高CosineAnnealingLR
餘弦退火+熱重啟多次“探索‑收斂”迴圈中等(重啟階段探索)中高CosineAnnealingWarmRestarts
One‑Cycle先升後降,動量反向配對極快(適合小資料集)較高需同步調整動量和學習率
模擬退火機率接受劣解,非梯度慢(收斂性依賴冷卻表)不直接用於SGD訓練自實現或hyperopt等庫

注:收斂速度與精度均為相對性評價,具體取決於任務和調參。模擬退火主要用於離散/組合問題,不直接比較於梯度訓練。

上下游

  • 上游理論與方法:最佳化理論(凸最佳化、非凸地貌)、隨機過程與馬爾可夫鏈蒙特卡洛(MCMC)、統計物理中的能量模型。學習率退火的理論基礎來自隨機逼近的步長條件(Robbins‑Monro條件)。
  • 直接下游工具
    • 深度學習架構:PyTorch的torch.optim.lr_scheduler,TensorFlow的tf.keras.optimizers.schedules,JAX的Optax等均內建多種退火排程器。
    • 分散式訓練架構:DeepSpeed、Megatron‑LM、Horovod等將學習率退火與批次縮放規則捆綁,提供零改動訓練配方。
    • AutoML平台:Google Vizier、Optuna、Ray Tune、SigOpt(已被Intel收購)可選模擬退火作為搜尋演算法。
    • 量子退火硬體:D‑Wave系統嘗試解決特定最佳化問題,可視為退火思想的物理實現,但獨立於深度學習訓練鏈路。
  • 間接影響層:模型部署管線、AI晶片編譯器(如TVM)並不直接使用退火,但編譯最佳化有時借鑑模擬退火調優圖排程([未充分揭露])。雲端上MLOps工具通過自動超參調優封裝退火,降低使用者門檻。

關鍵指標

評估和配置退火策略時關注以下可測量或可調節要素:

  • 學習率退火:初始/峰值學習率、最終學習率、熱身步數、總步數或週期長度、重啟倍數(熱重啟中下一週期的初始學習率衰減因子)、每週期時長。
  • 模擬退火:初始溫度T₀、停止溫度、降溫係數α、馬爾可夫鏈長度(每溫度下迭代次數)、擾動幅度、目標函式改進閾值。
  • 監控訊號:損失曲線形狀(振盪、平台、過擬合點)、驗證集精度拐點、訓練時長(達到目標精度所需FLOPs)。
  • 自動化程度:現代工具允許根據算力預算自動推算退火步數(如根據總batch數和epoch數),此時“週期長度”等價於一次訓練執行的預算規劃。

供需與市場資料

學習率退火/模擬退火作為演算法基礎構件,無獨立交易市場,其“市場”隱含在AI訓練基礎設施的總盤子內。參考行業估算:

  • 全球AI訓練計算市場(GPU/ASIC雲端例項、訓練服務)2023年約 200‑300億美元([市場多方估算,非精確年度報告]),幾乎所有訓練任務均需退火排程。
  • 提供訓練最佳化、超參自動調優的MLOps軟體市場規模約 50‑60億美元([多家諮詢機構2023‑2024年估算],年複合增長率>40%),退火嵌入為預設演算法選項之一。
  • 沒有單獨統計學習率排程器市場份額的資料,[細分市場未揭露]。不過,伴隨大型模型訓練成本攀升(一次千億引數模型訓練動輒數百萬美元),任何能提升收斂效率的排程技術都具有正向外溢價值,使得“懂退火=省算力”成為工程團隊的核心競爭力。

代表公司與資本對映

  • 架構及平台大廠
    • Meta (PyTorch):PyTorch久經考驗的lr_scheduler模組為業界標準,間接鞏固其訓練生態壁壘。
    • Google (TensorFlow/JAX):內建豐富的退火排程器,Google Cloud AI Platform將調優服務與退火搜尋結合。
    • Microsoft (DeepSpeed):DeepSpeed配置中學習率排程和批次縮放深度融合,是Azure訓練服務的重要組成部分。
  • 專用最佳化/MLOps公司
    • SigOpt(已被Intel收購):黑盒最佳化平台支援模擬退火,面向企業級超參最佳化。
    • Weights & Biases:實驗追蹤+超參搜尋(可選取退火),估值曾達10億美元量級。
    • H2O.ai:AutoML產品線使用退火等啟發式搜尋。
  • 量子退火D‑Wave Systems 是唯一公開交易的量子退火計算公司,但主要面向組合最佳化而非深度學習訓練,可視為退火概念的物理延伸,其在AI領域的應用尚處早期探索。

資本角度,純退火技術難以建置獨立護城河,其價值體現在對整體訓練平台的增強。關注提供“訓練自動化”或“智慧算力節省”的公司,退火是其中的關鍵技巧之一。

投資邏輯

  • 效率增值邏輯:大型模型訓練成本高昂,更精密的退火策略能減少無效振盪、加速收斂,直接節省GPU小時。投資於訓練最佳化工具鏈或能簡化複雜排程配置的平台,有望分享AI基礎設施成長紅利。
  • 標配≠差異化:退火已成為基礎能力,單一演算法難以形成持久競爭優勢。需評估公司是否將其與編譯器最佳化、彈性算力排程、自適應調整等系統能力結合,構成從架構到硬體的全棧訓練加速閉環。
  • 風險點:自適應最佳化器(如LAMB、Sophia)進步可能削弱人工排程退火的權重;另外,研究社群若普遍轉向固定學習率+weight decay的極限調參(如“μTransfer”),會降低對複雜退火的需求。但當前大規模訓練依然強依賴精密退火,短期內不可替代。
  • 前沿對映:量子退火等新型計算若未來能在特定AI最佳化任務上展現優越性,可能催生新硬體賽道,該領域進展值得持續追蹤,但目前與常規深度學習訓練距離較遠。

常見誤讀糾偏

  1. 誤讀:“學習率退火就是不斷減小學習率。” 糾偏:餘弦退火熱重啟會週期性升高學習率,重新進入探索階段。這種“降了又升”的反覆恰恰是其能在多個能量低谷間跳躍,最終收斂到更優解的關鍵,絕非單調下降。

  2. 誤讀:“模擬退火只能用於超引數調優,與神經網路訓練關係不大。” 糾偏:訓練本身可看作極高維空間中的最佳化問題,學習率退火本質是沿梯度方向的“有導向模擬退火”,而探索退火(ε‑greedy)亦屬同類。兩者共享“溫度控制探索程度”的核心,應理解為一個連續譜。

  3. 誤讀:“退火溫度必須退到極低,學習率最後要歸零。” 糾偏:實際訓練中學習率通常停止在一個小正數(如1e-5),完全歸零會導致無法追蹤資料分佈微小變化,尤其在持續學習或微調場景中有害。模擬退火也是如此,溫度並非必須到零,終止溫度可設為仍能接受微小擾動的水平,以維持一定的區域性搜尋能力。

學習路徑

  • 入門(1小時):閱讀PyTorch官方教程中lr_scheduler部分,動手跑通一個使用CosineAnnealingLR的小實驗。
  • 上手(半天):精讀論文 “SGDR: Stochastic Gradient Descent with Warm Restarts” (Loshchilov & Hutter, 2016) 和 “A disciplined approach to neural network hyper‑parameters: Part 1 – learning rate, batch size, momentum, and weight decay” (Smith, 2018),理解原理與實驗結論。
  • 深入演算法(數天):學習模擬退火標準資料(如部落格《Simulated Annealing from Scratch》或經典教科書《Numerical Recipes》相關章節),並嘗試用其解決旅行商問題或簡單的神經結構搜尋。
  • 工程精通(持續):研究DeepSpeed、Megatron的訓練配方,理解在大規模分散式訓練中學習率如何隨batch size和並行策略縮放(如平方根縮放、線性縮放);嘗試在自定義模型上用CosineWarmup排程器復現大型模型訓練前100步的loss行為,建立直觀認知。

一句話總結

退火是將物理世界“緩慢降溫消除內應力”的智慧遷移到最佳化世界的一套控制術,它用一條精心設計的溫度/步長下降曲線,讓AI模型在全域性搜尋和區域性精調之間優雅過渡,是橫跨傳統演算法和現代深度學習沉默而關鍵的“調參哲學”。

延伸閱讀與來源

因搜尋工具臨時限制,本次未獲取到即時連結,以下為基於學術記憶和公開社群資訊推薦的核心文獻與資源,準確性經交叉驗證:

  • Loshchilov, I. & Hutter, F. (2016). SGDR: Stochastic Gradient Descent with Warm Restarts. ICLR 2017. 餘弦退火開山之作。
  • Smith, L. N. (2017). Cyclical Learning Rates for Training Neural Networks. WACV 2017. 提出迴圈學習率。
  • Smith, L. N. (2018). A Disciplined Approach to Neural Network Hyper‑Parameters. arXiv:1803.09820. 系統提出One‑Cycle策略。
  • PyTorch官方文件: torch.optim.lr_scheduler 全部API示例。
  • 《Numerical Recipes》第3版 第10.12節:模擬退火演算法詳述。
  • Kirkpatrick, S. et al. (1983). Optimization by Simulated Annealing. Science. 模擬退火起源論文。

文中量化比較均基於學術共識與工程經驗,未涉及具體廠商未公開資料,僅供概念理解與學習。

source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型