Latent Diffusion
3秒看懂
- 是什麼:Latent Diffusion Model(LDM)是一種在壓縮後的感知隱空間裡執行擴散過程的生成模型,而非直接在畫素空間操作。它先用一個預訓練的自編碼器(通常是 VAE)把影像壓成低維潛變數,再在潛變數上逐步加噪、去噪,最後通過解碼器重建高解析度影像。
- 為什麼重要:解決了早期擴散模型(DDPM)計算量極大、訓練/推論慢、視訊記憶體開銷高的痛點——把擴散過程從畫素域搬到低維隱空間,大幅降低計算複雜度,讓高解析度影像生成在消費級 GPU 上也能高效執行。同時引入交叉注意力機制,天然支援文本、語義圖等多模態條件引導,催生了 Stable Diffusion 等爆款應用。
- 一句話定位:LDM 是擴散模型工程實用化的分水嶺,把“畫素級擴散”輕量化、多模態化,打開了 AIGC 大規模工業化的大門。
3分鐘產業解釋
為什麼需要 Latent Diffusion
最初的擴散模型(Denoising Diffusion Probabilistic Models, DDPM)直接在畫素影像上反覆新增噪聲並學習去噪。以 256×256 影像為例,單個樣本訓練時要維護全尺寸特徵圖,單步去噪網路(U-Net)的計算和視訊記憶體消耗非常恐怖,導致生成一張圖需要幾分鐘甚至更長,且很難擴充套件到更高解析度。這種“畫素級窮舉”在經濟上不可行,也更像學術玩具。
LDM 的核心思路
LDM 觀察到:影像的感知資訊高度冗餘,可以先用一個感知壓縮模型(比如 VAE)把影像壓縮到低維隱空間(Latent Space),該隱空間保留了足夠的語義和結構,但丟棄了不必要的高頻細節。擴散模型只需要在這個小得多的隱空間上學習“加噪-去噪”,最後再用解碼器升維輸出到畫素即可。
- 分階段拆解:
- 感知壓縮階段:訓練一個自編碼器(編碼器 E,解碼器 D),把影像
x對映到潛變數z = E(x),影像重建為D(z)。為了後續擴散訓練的穩定,通常加入 KL 正則或向量量化,使潛空間分佈接近標準高斯。 - 隱空間擴散階段:在潛變數
z上執行擴散過程(前向加噪,逆向去噪)。去噪網路是一個時間條件 U-Net,引數量遠小於畫素級 U-Net。 - 條件注入:通過交叉注意力層,將文本、語義版面配置等條件訊號引入 U-Net,實現 conditional generation。文本編碼器常用 CLIP 的文本 Transformer。
- 感知壓縮階段:訓練一個自編碼器(編碼器 E,解碼器 D),把影像
對產業的影響
- 計算效率飛躍:在 f=8 的下采樣因子下(256×256→32×32潛變數),計算量降低約 64 倍,使得在單張消費級 GPU(如 RTX 3090)上在幾秒內生成 512×512 影像成為可能。
- 可擴充套件性:輕鬆擴充套件到高畫質、超清影像,甚至影片、3D 等模態。
- 生態爆發:Stability AI 的 Stable Diffusion 就是 LDM 架構,開源後引爆生成式 AI 應用層,外掛、模型微調社群一日千里。
15分鐘專家深入
架構總覽(文字+程式碼塊圖)
LDM 的訓練和推論流程可概括為:
影像 x → Encoder(E) → 潛變數 z0 → 前向擴散(加噪聲) → z_t
↓ ↑
(文本條件 c) → Cross-Attention → Denoising U-Net (時間 t 條件)
↓ ↓
推論時:隨機噪聲 z_T → 逐步去噪生成 z0^ → Decoder(D) → 生成影像 x^
- 潛變數
z維度為h' \times w' \times c',其中h' = H/f, w' = W/f,f 是下采樣因子(常取 4 或 8)。比如輸入 256×256×3 影像,f=8 時潛變數尺寸 32×32×4。 - 前向擴散過程定義與 DDPM 相同:
z_t = \sqrt{\bar{\alpha}_t} z_0 + sqrt(1-\bar{\alpha)_t}\epsilon,\epsilon \sim mathcal(N)(0,I)。 - 訓練目標是最小化噪聲預測誤差:
mathbb(E)_{z_0,c,\epsilon,t} \left[ \|\epsilon - \epsilon_\theta(z_t,t,\tau_\theta(c))\|^2 \right],其中\tau_\theta(c)是條件編碼器(如 text encoder)。
關鍵模組深度解析
-
感知壓縮模型
- 通常採用 VAE 或 VQ-VAE。為了潛空間平滑,在訓練 VAE 時加入 KL 散度損失,使
q(z|x)接近mathcal(N)(0,I)或一個小權重的 KL 懲罰。 - 下采樣使用步長卷積或池化,解碼器用上取樣加捲積。注意:VAE 重建不是畫素級無損,會引入輕微模糊,但這對於擴散模型反而起到“隱式正則”效果,因為擴散過程只需建模語義版面配置和低頻結構,高頻紋理由解碼器補全。
- 隱空間通道數
c'對效能敏感:論文中證實過小的潛變數維度會遺漏重要細節,過大會浪費算力。Stable Diffusion 1.x 通常設c'=4, f=8。
- 通常採用 VAE 或 VQ-VAE。為了潛空間平滑,在訓練 VAE 時加入 KL 散度損失,使
-
隱空間去噪 U-Net
- 核心是一個時間條件 U-Net,網路結構類似畫素擴散模型,但輸入輸出維度大幅縮減。U-Net 的骨幹由殘差塊、下/上取樣層、空間自注意力層、交叉注意力層交錯堆疊。
- 時間條件注入:擴散時間步
t經正弦編碼後通過線性層調變殘差塊(類似 GroupNorm 後 scale & shift)。 - 交叉注意力機制:這是 LDM 實現多模態條件的關鍵。將條件編碼(如 CLIP 文本嵌入)作為 K、V,將 U-Net 中間特徵圖展平後作為 Q,計算公式為:
text(Attention)(Q,K,V) = text(softmax)\left(frac(QK^T){sqrt(d)}\right)V
再與原始特徵圖殘差連線。通過堆疊多個交叉注意力層,條件訊號可以從語義到紋理多層次引導生成。
- 自注意力:在特定解析度層級加入,捕獲全域性結構。
- 條件編碼器
- 文本條件:可使用 CLIP ViT-L/14 的文本 Transformer 輸出,或 T5-XXL 編碼器。不同模型的編碼器容量影響語義對齊和生成質量。Stable Diffusion v1.5 用 CLIP 文本編碼器(77 token 限制),v2 遷移到更大的 OpenCLIP 模型。
- 影像條件(如語義圖、素描):通過額外編碼器對映為與 U-Net 相容的特徵,可拼接或交叉注意力注入。
訓練技巧與細節
- 兩部分獨立訓練:通常感知壓縮模型(VAE)單獨訓練收斂後凍結,再訓練擴散模型。這樣避免端到端訓練的不穩定。部分工作嘗試聯合微調,可略微提高重建保真度,但會增加不穩定。
- 噪聲排程:沿用 DDPM 的線性方差排程或 cosine 排程,在潛空間上保持相同的噪聲分佈假設。
- CFG(Classifier-Free Guidance):訓練時隨機以空條件替換條件嵌入(如 10%),使網路同時學習有條件和無條件去噪。推論時通過縮放組合:
\tilde{\epsilon}_\theta(z_t,c) = \epsilon_\theta(z_t,\emptyset) + w (\epsilon_\theta(z_t,c) - \epsilon_\theta(z_t,\emptyset))。w(引導比例)越大,樣本與條件對齊越強,但多樣性下降。
技術原理(最深,機制+關鍵引數)
為什麼潛空間擴散有效
擴散模型的基本假設是資料分佈 p(x) 可通過逐漸加高斯噪聲變成先驗分佈(標準高斯),反向過程則從噪聲中恢復資料。在畫素空間,原始資料的維度極高,要去噪 H \times W \times 3 的高維流形非常低效。LDM 發現,如果能找到一個平滑的、維度更低的流形嵌入(隱空間),擴散過程在這個嵌入上進行,不僅計算量小,而且因為嵌入空間已經去除了感知上不重要的高頻變化,擴散模型可以專注於語義一致的結構生成。
- 率失真理論視角:感知壓縮相當於對影像進行有損編碼,將大部分位元率用於語義資訊,丟棄不易察覺的紋理細節。擴散模型的生成責任被拆分為:語義版面配置生成(潛空間擴散) + 高質量紋理解碼(解碼器)。這不失一般性,因為人類視覺對高頻細節的微小偏差容忍度高。
- 誘導的隱空間分佈:VAE 訓練時,潛變數的邊際分佈被強制接近標準高斯,為後續擴散模型提供了良好的先驗匹配,使得擴散的去噪軌跡更平滑。
關鍵引數及影響(基於 LDM 論文及主流實現定性描述)
- 下采樣因子 f:f 越大潛變數尺寸越小,計算量降級級數等於 f²× ,但過大的 f 會導致解碼器重建時丟失過多空間細節,影像可能出現模糊或扭曲。論文中實驗對比 f=4,8,16,發現 f=4 和 8 在 FID 和 IS 指標下效果相當,而 f=16 明顯退化。因此產業中穩定版本通常採用 f=8。
- 潛變數通道數 c’:影響隱空間表達力。過小會限制生成細節,過大會增加算力。常用 4 通道。一些工作探討可學習的通道維度分配。
- U-Net 的深度與注意力解析度:U-Net 通常在多個解析度級別引入自注意力和交叉注意力(例如在 32×32、16×16、8×8 特徵層),這決定了模型對全域性結構捕獲能力。更深、更寬的 U-Net 可提高質量,但引數量和訓練開銷增大。Stable Diffusion 2.0 的 U-Net 約有 865M 引數(論文估算,[未充分揭露]按照當時權重檔案估計)。
- 文本編碼器維度:CLIP ViT-L/14 輸出 768 維,SD v2 使用 1024 維嵌入(OpenCLIP)。更大的語義空間改善複雜場景的文本貼合度。
- 擴散總步數 T:訓練時典型設為 1000。推論時可通過 DDIM 等確定性取樣器減少步數至 20-50 步,極大加速生成,質量輕微下降。
數學形式化
- 感知壓縮的訓練損失(包含重建、KL 和可能對抗損失):
mathcal(L)_{Autoencoder} = mathcal(L)_{rec}(x, D(E(x))) + \beta \cdot D_{KL}(q(z|x) \| mathcal(N)(0,I)) + \lambda \cdot mathcal(L)_{GAN}(D(E(x)))
其中 \beta 控制潛空間正則化強度,GAN 損失可選,用於提升真實感。
- 隱擴散目標(簡化):
L_{LDM} := mathbb(E)_{z_0 \sim E(x), \epsilon \sim mathcal(N)(0,I), t, c} \left[ \| \epsilon - \epsilon_\theta (z_t, t, \tau_\theta(c)) \|^2 \right]
這裡 z_t 由前向過程得到:z_t = \sqrt{\bar{\alpha}_t} z_0 + sqrt(1-\bar{\alpha)_t} \epsilon。
生成過程(取樣)
- 通過訓練好的噪聲預測器
\epsilon_\theta,從隨機噪聲z_T \sim mathcal(N)(0,I)開始,迭代執行去噪步(如 DDIM 取樣):
z_{t-1} = \sqrt{\bar{\alpha}_{t-1}} \left( frac(z_t - sqrt(1-\bar{\alpha)_t} \epsilon_\theta(z_t, t, c)}{\sqrt{\bar{\alpha}_t}} \right) + sqrt(1-\bar{\alpha)_{t-1} - \sigma_t^2} \cdot \epsilon_\theta(z_t, t, c) + \sigma_t \epsilon
其中 \sigma_t 決定隨機性(0 為 DDIM 確定性路徑)。最終代入解碼器:hat(x) = D(z_0)。
技術演進史
- 2015-2019, 擴散模型萌芽:從 Sohl-Dickstein 的擴散機率模型到 DDPM (Ho et al. 2020),證明了擴散模型能生成高質量影像,但極度緩慢。
- 2021 年, 效率初探:DDIM 提出確定性取樣,將步數從 1000 步降至幾十步;同時 LDM 之前已有工作嘗試隱空間擴散(如 VDM 早期探索),但未形成標準架構。
- 2022 年初, LDM 正式提出:Rombach et al. (CVPR 2022) 的“High-Resolution Image Synthesis with Latent Diffusion Models”系統性地建置了 LDM 架構,整合感知壓縮、交叉注意力、條件機制,並展示了在文本到影像、語義圖到影像、超解析度等任務上的卓越效能。論文的關鍵貢獻在於分離壓縮和擴散但設計出連貫的端到端訓練方案。
- 2022 年 8 月, Stable Diffusion 釋出:Stability AI 基於 LDM 開源了 Stable Diffusion v1.4,訓練資料為 LAION-5B 子集,一舉引爆公眾對 AI 繪畫的關注。之後快速迭代至 v1.5、v2.0、v2.1,修改文本編碼器(OpenCLIP)和解析度訓練策略。
- 2023 年, SDXL 及精細化控制:Stable Diffusion XL 將 U-Net 引數擴大約 3 倍,引入多分塊/高低解析度條件,原生支援 1024×1024 生成。同時 ControlNet、T2I-Adapter 等介面卡湧現,通過附加空間條件(深度圖、邊緣圖、姿態)進一步增強 LDM 的可控性,充分展現 LDM 交叉注意力的靈活性。
- 2024 年以來:LDM 架構向影片生成、3D 生成擴散,如 SVD (Stable Video Diffusion) 將 LDM 時間軸擴充套件為 3D U-Net,並插入時序注意力;商用化平台大規模落地。
技術路線對比(量化表)
| 方法 | 擴散空間 | 推論步數 | 條件機制 | 生成速度(512×512) | 典型文本對齊 (CLIP score) | 計算資源 |
|---|---|---|---|---|---|---|
| DDPM (Ho 2020) | 畫素空間 | 1000 | 無內建條件 | 很慢(分鐘級) | 不適用 | 需多卡高階GPU |
| LDM (Rombach 2022) | 隱空間 | 50-200 (DDIM) | 交叉注意力,靈活支援文本、圖 | 數秒(單卡消費級GPU) | 高 (0.33 左右*) | 單卡 24GB 即可推論 |
| DiT (Peebles & Xie 2023) | 隱空間 | 250-1000 | Transformer 骨幹,交叉注意力 | 慢於 LDM U-Net,但可擴充套件 | 高 (依賴於縮放) | 視訊記憶體需求高 |
| GAN (e.g., StyleGAN2) | 潛在空間 (僅生成器) | 1 步前向 | 無靈活條件 | 極快(毫秒級) | 單一類別,文本需額外編碼器 | 低 |
| VQ-VAE + 自迴歸 (如 DALL·E 1) | 離散 token 序列 | 自迴歸逐步 | 通過序列拼接 | 較慢(序列長度大) | 較弱 | 巨大 |
*注:CLIP score 受文本編碼器版本和評測集影響,此處為定性對比,[基於公開論文報告資料]。
上下游
- 上游:
- 資料:大規模圖文對資料集(LAION、COYO、DataComp 等),需要資料清洗、去重、安全過濾。
- 算力:訓練 LDM 需要大量 GPU/TPU 叢集,典型的 SD v2 訓練使用了數千 A100 GPU 天 [據公開報道估算];推論側依賴消費級 GPU 或雲端推論卡。
- 基礎模型:CLIP 文本編碼器、VAE 編碼器-解碼器預訓練權重。
- 中游:
- 模型訓練平台:Hugging Face Diffusers、PyTorch Lightning 等架構封裝 LDM 元件。
- 模型微調與適配:LoRA、DreamBooth、Textual Inversion 等方法,允許使用者在小資料上定製概念。
- 控制網路:ControlNet、IP-Adapter 等用於新增空間/風格條件。
- 應用層工具:ComfyUI、Automatic1111 WebUI、Fooocus 等,圖形化鏈式搭建擴散流程。
- 下游:
- 創意內容:概念設計、營銷素材、遊戲角色/場景生成、出版插畫。
- 媒體與娛樂:影片生成、特效製作、動畫輔助。
- 工業設計:產品原型渲染、室內設計視覺化。
- 科學視覺化:分子結構、天文影像合成等。
關鍵指標
- FID (Fréchet Inception Distance):評估生成影像集的真實性和多樣性,數值越低越好。LDM 在 MS-COCO 256×256 上可達 10+ 的 FID [公開論文資料]。
- CLIP score / CLIP Directional Similarity:衡量生成影像與輸入文本的語義對齊程度。
- LPIPS / PSNR / SSIM:用於自編碼器重建質量評估,確保潛變數保留足夠資訊。
- 推論時間:生成單張 512×512 影像所需秒數(在 A100 或消費級 GPU),衡量部署即時性。
- 引數量:擴散 U-Net 引數規模(100M ~ 2.6B),影響質量和成本。
- 訓練收斂所需 GPU 時:決定訓練經濟性。
供需與市場資料
- 自 Stable Diffusion 開源以來,生成影像模型的市場需求急劇擴張。OpenAI 的 DALL·E 2/3、Midjourney、Stable Diffusion 等形成競爭,但 SD 以其開放生態和可定製性佔據特殊位置。
- 據第三方估計,2023 年 AIGC 影像市場(含 API 和服務)約為數億美元,年增長率極高 [未充分揭露]。
- 算力供給:SD 模型的一次完整訓練通常需要 150,000 到 300,000 A100 GPU 小時以上(根據模型版本和訓練資料量變動),這種訓練量集中在少數有大規模雲端平台的公司或資助專案,但社群微調使推論算力需求長尾分佈,帶動消費顯示卡需求。
代表公司與資本對映
- Stability AI:開源 SD 系列的發起方,獲得多輪融資,但也面臨商業化變現挑戰。與 Arm、AWS 等合作最佳化推論。
- Runway:推出影片生成模型 Gen-2/Gen-3,基於擴散和潛在空間架構,從 LDM 出發擴充套件到影片,估值飆升。
- Midjourney:未公開技術的封閉商業化擴散模型,被認為在某些 LDM 變體上建置,通過 Discord bot 服務,2023 年已實現數億美元營收。
- OpenAI:DALL·E 系列從自迴歸轉向潛在擴散(DALL·E 2 使用 unCLIP 類似思路),但不公開引數。
- 國內玩家:智源研究院釋出 AltDiffusion(多語言 LDM);百度文心一格、阿里通義萬相等採用自研擴散或結合 LDM 結構;創業公司如潞晨科技(Colossal-AI)最佳化擴散模型分散式訓練。
投資邏輯
- 平台價值:LDM 作為底層的通用生成架構,其“基礎模型+微調適配器”模式已確立,投資基礎模型企業或中介軟體工具(如 webUI、API 平台)具備先發優勢。
- 垂直應用:在產品設計、遊戲資產生成等垂直領域,LDM 定製化的 SaaS 或模型即服務(MaaS)能產生高粘性營收。
- 生態上下游:資料標註與版權合規、模型壓縮與端側推論晶片(將 LDM 搬到手機晶片)、安全檢測(AIGC 內容鑑偽)是藍海。
- 算力需求:訓練和推論催生對 GPU 叢集及雲端服務的持續需求,利好雲端運算廠商。
- 風險:同質化競爭、版權法律風險、開源模式盈利困難;技術迭代快(DiT、Masked Diffusion 等可能挑戰 U-Net LDM)。
常見誤讀糾偏
-
誤讀 1:“LDM 就是 Stable Diffusion,Stable Diffusion 就是整個擴散模型。” 糾正:LDM 是特定的一類架構架構(潛在空間擴散+交叉注意力),而 Stable Diffusion 是基於該架構的模型例項。擴散模型包含畫素空間擴散、隱空間擴散、在 score-based 模型上的發展等。同時還有 DALL·E 2、Midjourney 等各自的隱擴散實現,不都是 SD。
-
誤讀 2:“潛變數壓縮必然導致細節丟失,所以 LDM 永遠無法做到 GAN 式的逼真度。” 糾正:雖然 VAE 壓縮會丟失高頻資訊,但解碼器能從低頻潛變數重建出高度逼真的細節,且擴散模型在取樣過程中通過去噪補充了缺失的隨機高頻資訊。在實踐中,LDM 的 FID 和視覺真實感已經超過多數 GAN,並可以直逼甚至超越畫素擴散在固定解析度下的結果,且速度遠快。後續工作通過提供更好的自編碼器(如 VQGAN 替代 VAE)進一步提升了細節。
-
誤讀 3:“多一個步驟(壓縮)使得 LDM 不如端到端畫素擴散簡潔。” 糾正:端到端畫素擴散雖然概念更直接,但高維操作導致網路過重、收斂慢、對算力不友好。從系統工程和代價角度,LDM 兩步法反而極致高效;壓縮和解碼模組是獨立可複用的(同一個 VAE 可用於不同擴散模型),整體架構更清晰。
學習路徑
- 入門:理解擴散模型基礎——閱讀 DDPM 論文及部落格《What are Diffusion Models?》(Lilian Weng),掌握前向過程和 ELBO 推導。
- 核心:精讀 LDM 原文《High-Resolution Image Synthesis with Latent Diffusion Models》,重點弄懂感知壓縮、潛空間 U-Net、交叉注意力。
- 實踐:利用 Hugging Face Diffusers 庫執行 Stable Diffusion 管線,並嘗試微調(如使用 LoRA),觀察潛變數與生成結果。
- 進階:探索 LDM 後續改進(SDXL, ControlNet, Cascade Diffusion),瞭解如何設計條件控制、多階段擴散,並研究 DiT 等 Transformer 隱擴散模型。
- 前沿:閱讀關於即時擴散模型、一致性模型、潛空間一致性蒸餾的文獻,進入擴散模型加速和影片/3D 生成領域。
一句話總結
Latent Diffusion Model 通過將擴散過程放進壓縮感知隱空間,以極小計算代價實現了高解析度、多模態條件控制的高質量影像生成,成為當前 AIGC 產業的基礎性技術範式。
延伸閱讀與來源
- Rombach, R., Blattmann, A., Lorenz, D., Esser, P., & Ommer, B. (2022). High-Resolution Image Synthesis with Latent Diffusion Models. CVPR 2022. [論文連結: https://arxiv.org/abs/2112.10752]
- Stable Diffusion 開源實現: https://github.com/Stability-AI/stablediffusion
- Hugging Face Diffusers 文件: https://huggingface.co/docs/diffusers/index
- Leng, Y. (2023). “萬字長文讀懂潛在擴散模型(LDM)”, 知乎專欄(技術解析)[無直接連結,搜尋可得]
- 公開新聞:Stability AI 融資與商業進展,TechCrunch, 2022-2023.
- 算力消費估算參照:Stability AI CEO 公開訪談提及訓練 SD 的 GPU 時長;Runway 釋出的影片模型訓練細節。