擴散模型
3 秒看懂
- 擴散模型是一種生成式模型,其核心是通過逐步向資料新增噪聲,再學習逆轉這一噪聲過程來生成新樣本。
- 生成過程:前向過程將真實影像(或其他資料)轉化為純高斯噪聲;逆向過程從隨機噪聲出發,一步一步“去噪”,恢復出符合訓練資料分佈的新影像。
- 產業地位:擴散模型已是文本到影像(Stable Diffusion、DALL·E 3、FLUX)、影片生成(Sora、Runway Gen-3)、語音合成、分子構象生成等多模態任務的主流架構,在影像合成領域全面取代 GAN 成為 SOTA。
3 分鐘產業解釋
擴散模型的產業價值體現在生成質量高、訓練過程平穩、可控性強。與 GAN 相比,擴散模型無需對抗訓練,避免了模式坍塌;與自迴歸模型相比,其逆向過程可通過並行取樣加速(如 DDIM、DPM-Solver、一致性蒸餾),推論效率不斷提升。
產業落地方向主要包括:
- 文生圖/影片:Midjourney、Stable Diffusion、DALL·E、FLUX 等直接面向普通使用者與創意產業,已嵌入 Photoshop、Canva 等主流工具。
- 3D/分子生成:擴散思想被擴充套件至點雲端、蛋白質結構(如 RFdiffusion、AlphaFold 3 中的擴散模組),助力藥物發現與數字孿生。
- 音訊/語音合成:WaveGrad、DiffWave、Bark 等模型提供高保真音訊,部分已進入商業 TTS 服務。
算力需求依然是主要瓶頸:一次高解析度影像生成需多次 U‑Net 或 DiT 前向傳播(傳統 DDPM 需數百至上千步),持續拉動 GPU 及專用推論晶片的需求。產業界正通過**潛在空間擴散(LDM)、常微分方程取樣器(DPM-Solver)、一致性模型(Consistency Models)、流匹配(Flow Matching)**等手段將推論步數壓縮至 4~20 步,在保持質量的同時大幅降低部署成本,使即時生成和行動端推論成為可能。
技術原理
前向擴散過程(加噪)
給定真實資料 x_0 \sim q(x_0),每一步按預設的噪聲排程 \beta_t \in (0,1) 新增高斯噪聲:
q(x_t | x_{t-1}) = mathcal(N)(x_t ; sqrt(1 - \beta_t) \, x_{t-1}, \beta_t mathbf(I))
利用重引數化,可直接從 x_0 得到任意噪聲尺度下的分佈:
q(x_t | x_0) = mathcal(N)(x_t ; \sqrt{\bar{\alpha}_t} \, x_0, (1 - \bar{\alpha}_t) mathbf(I))
其中 \bar{\alpha}_t = \prod_{s=1}^{t} (1 - \beta_s)。當總步數 T 足夠大時 \sqrt{\bar{\alpha}_T} \approx 0,q(x_T) \approx mathcal(N)(0, mathbf(I)),即純高斯噪聲。
逆向去噪過程(生成)
訓練一個引數化高斯轉移來逼近真實的逆轉移:
p_{\theta}(x_{t-1} | x_t) = mathcal(N)(x_{t-1}; \mu_{\theta}(x_t, t), \Sigma_{\theta}(x_t, t))
DDPM 中將方差固定為 \sigma_t^2 mathbf(I),均值通過一個噪聲預測網路 \epsilon_{\theta} 重新引數化:
\mu_{\theta}(x_t, t) = frac(1){sqrt(1-\beta_t)} \left( x_t - \frac{\beta_t}{sqrt(1-\bar{\alpha)_t}} \epsilon_{\theta}(x_t, t) \right)
訓練目標是最小化簡單的均方誤差(\epsilon-prediction):
mathcal(L)_{text(simple)} = mathbb(E)_{t, x_0, \epsilon} \left[ \| \epsilon - \epsilon_{\theta}(\sqrt{\bar{\alpha}_t} x_0 + sqrt(1-\bar{\alpha)_t} \epsilon, t) \|^2 \right]
推論時從 x_T \sim mathcal(N)(0, mathbf(I)) 開始,迭代執行:
x_{t-1} = frac(1){sqrt(1-\beta_t)} \left( x_t - \frac{\beta_t}{sqrt(1-\bar{\alpha)_t}} \epsilon_{\theta}(x_t, t) \right) + \sigma_t \, mathbf(z),\quad mathbf(z) \sim mathcal(N)(0, mathbf(I))
直到 t=0 得到生成樣本 x_0。
條件生成與潛在擴散
條件資訊 y(如文本提示)通過嵌入後注入去噪網路的交叉注意力:
text(Attention)(Q, K_y, V_y) = text(softmax)\!\left(frac(Q K_y^{mathsf(T)}}{sqrt(d)}\right) V_y
基礎去噪網路通常採用 U‑Net 結構(包含編碼器、中間層、解碼器及跳躍連線),近期主流方案已逐步轉向 DiT(Diffusion Transformer) 或 MMDiT(多模態擴散 Transformer)。
潛在擴散(LDM) 的關鍵設計是先在感知壓縮空間(如 VAE 的潛變數空間)進行擴散:先編碼 z_0 = text(Enc)(x_0),整個擴散與去噪過程在低維潛在空間完成,最後 hat(x) = text(Dec)(z_0)。這種方案使擴散模型能夠在 4×4 到 64×64 的潛在空間上訓練和推論,大幅降低視訊記憶體佔用和計算量,是 Stable Diffusion 系列的基礎架構。
取樣加速機制概覽
- DDIM:藉助非馬爾可夫擴散,可跳躍取樣,在 50~100 步內得到與 DDPM 千步相當的質量,且支援確定性生成。
- DPM-Solver/DPM++:將反向擴散視為常微分方程(ODE),用高階求解器在 10~20 步內獲得高質量樣本,無需重新訓練網路。
- 一致性模型(Consistency Models):直接學習從任意噪聲狀態到乾淨資料的對映
f_{\theta}(x_t, t) \rightarrow x_0,支援 1~4 步推論,顯著降低延遲。 - 流匹配與整流(Flow Matching / Rectified Flow):建置直線或最優傳輸路徑,進一步最佳化取樣效率,已被 SD3 和 FLUX 等模型採用。
關鍵引數
本節列示評估與部署擴散模型時最受關注的引數。除非特別註明,數字均為 2023–2024 年公開基準,具體結果隨模型版本和評測協議變化。
| 指標 | 定義 / 意義 | 典型數值 / 範圍 | 來源 / 說明 |
|---|---|---|---|
| FID(Frechet Inception Distance) | 生成影像與真實影像特徵分佈的距離,值越低幀越好 | 最佳釋出模型的零樣本 COCO FID 可達 2.5~8.0(2024 年 SD3、FLUX 等報告值低於 3.0) | 各模型技術報告;公開排行榜 |
| CLIP Score | 文本-影像對齊程度,越高表示圖文一致性越好 | ViT‑g/14 尺度下約 0.30–0.35(SD3 等先進模型) | 論文、OpenCLIP 基準 |
| 推論步數 | 從噪聲到影像的取樣步驟,越少越快,但可能損失細節 | 2023 年主流:20 | 官方技術報告、diffusers 社群 |
| 單張影像推論時間 | 生成一張 1024×1024 影像的平均耗時 | A100 (40GB/80GB):約 2 | 公開基準(Replicate, Hugging Face Space 實測);各廠商部落格 |
| GPU 視訊記憶體佔用 | 推論和訓練時所需視訊記憶體,決定部署硬體成本 | SDXL 1024×1024 推論約需 8–14 GB;SD3‑Medium 約 12–20 GB(FP16);訓練大尺寸 DiT 模型需數百 GB 至 TB 級視訊記憶體(多卡) | 官方硬體建議;社群報告 |
| 模型引數量 | 去噪網路(U‑Net/DiT)+ 編碼器等總引數規模 | SDXL 約 3.5B(U‑Net 2.6B + 文本編碼器 0.8B);SD3‑Medium 約 2B;FLUX.1‑dev 約 12B(DiT);Midjourney V6 未公開,估計數十億量級 | Stability AI 技術報告;Black Forest Labs 部落格 |
| 訓練吞吐量 | 訓練每秒可處理的影像數(img/s/GPU) | 使用 A100 × 8,SDXL 訓練約 20–30 img/s(參考);DiT‑XL/2 約 15 img/s(Peebles & Xie, 2023) | 開原始碼庫及論文 |
| 無分類器引導強度(CFG scale) | 控制生成影像對文本的忠實度與多樣性,常用 3~9 | 多數文本到影像模型的預設值約為 7.0;過高導致色彩過飽和和偽影 | 業界通用實踐 |
注:以上數值可能因軟硬體環境、評測集(如 COCO 30K/40K)及提示詞工程有所不同。“公開資料未見”的特殊引數未在表中列示。
技術路線
當前主流擴散模型的技術路線可從網路架構、訓練目標、取樣策略三個維度進行對比。
| 路線 / 代表模型 | 網路主幹 | 訓練/引數化目標 | 典型取樣步數 | 潛空間 | 關鍵優勢與限制 |
|---|---|---|---|---|---|
| DDPM (Ho 2020) | U‑Net | ε‑prediction | 1000 步 | 畫素(或無) | 奠基架構,訓練穩定;推論極慢 |
| Score‑SDE (Song 2021) | U‑Net | 得分函式 ∇log p | 2000 步(SDE) | 畫素 | 連續時間檢視,理論優美;取樣昂貴 |
| DDIM (Song 2021) | 同 DDPM 網路 | ε‑prediction | 50–100 步 | 畫素 | 跳躍取樣,確定性;不改網路 |
| Latent Diffusion (LDM) / Stable Diffusion 1.x–2.x | U‑Net + 交叉注意力 | ε‑prediction | 30–100 步 | VAE 潛空間 | 大幅降視訊記憶體,支援高解析度;品質依賴 VAE |
| DPM-Solver / DPM++ (Lu 2022) | 同 DDPM 網路 | ε‑prediction | 10–20 步 | 均可 | ODE 加速,無需重訓;與現有模型直接相容 |
| DiT / MDT (Peebles & Xie 2023) | Transformer (DiT塊),替換 U‑Net | ε‑prediction / v‑prediction | 20–50 步 | VAE 潛空間 | 可擴充套件性極強,適配大規模訓練;Sora 影片基座 |
| 一致性模型 (Song 2023) | 二合一網路 fθ | 自定義蒸餾損失 | 1–4 步 | 畫素/潛空間 | 接近即時生成;單步質量略遜於多步 |
| 流匹配 / 整流 (Lipman 2023 / SD3) | MMDiT(多模態擴散 Transformer) | v‑prediction / 流速場 | 15–28 步(可進一步蒸餾) | VAE 潛空間 | 直線路徑,取樣穩定,圖文對齊優秀;模型較大 |
對比說明:截至 2025 年初,Transformer 主幹 + 流匹配/整流 已成為最前沿路線,代表模型包括 Stable Diffusion 3、FLUX.1 和 Sora。開源社群廣泛採用的依然是基於 U‑Net 的 LDM 系列,但因 DiT 和 MMDiT 展現出更強的擴充套件性和文本遵循能力,預計將逐步成為主流架構。
上游
擴散模型的上游由資料、基礎模型、算力硬體與軟體架構共同構成:
- 訓練資料:大規模圖文對資料集(LAION‑5B、COYO‑700M、WebLI 等),以及內部精細化標註的高質量資料。資料版權和過濾機制正成為上游核心壁壘。
- 預訓練編碼器:文本編碼器主要採用 CLIP(ViT‑L/14、ViT‑g/14、OpenCLIP)、T5‑XXL;潛在空間 VAE 編碼器/解碼器通常與去噪網路協同訓練或凍結。多模態模型(如 LLaVA、BLIP‑2)提供的特徵也可作為條件嵌入。
- 算力硬體:訓練端以 NVIDIA A100、H100 叢集為主,2024 年起逐步遷移至 H200/B200;推論端需要中高階 GPU(A10/A100/L40S 等),專用推論晶片(如 d-Matrix、Groq 的 LPU)開始進入市場。根據公開報告,訓練一個 SD3 級別模型可能需要數千 H100 GPU·日。
- 軟體架構:PyTorch、JAX 為主要訓練架構;Hugging Face Diffusers 是應用最廣的推論/微調庫;分散式訓練依賴 Megatron‑LM、DeepSpeed、FSDP;社群工具鏈如 ComfyUI、Automatic1111 WebUI 大幅降低使用門檻。
下游
擴散模型的下游覆蓋創作工具、垂直行業應用和內容治理三大領域:
- 創作與設計工具:Midjourney(通過 Discord/Web)、Stable Diffusion 生態(DreamStudio、ComfyUI、InvokeAI)、Adobe Firefly(嵌入 Photoshop)、Canva AI 影像生成、Leonardo.Ai 等。商業化 API 主要由 OpenAI(DALL·E 3)、Stability AI、Replicate 提供。
- 垂直行業應用:
- 媒體與廣告:自動化素材生成、虛擬場景、廣告創意設計;
- 電商/時尚:虛擬試穿、商品背景替換(ZMO.ai、Vue.ai);
- 建築與室內設計:草圖渲染、風格遷移(Veras、ArkDesign);
- 遊戲與影視:角色與場景資產生成(Scenario、Promethean AI)、影片特效(Runway Gen‑3)、動畫製作;
- 生命科學:蛋白質結構生成(RFdiffusion)、分子構象取樣(AlphaFold 最新版本)、材料逆向設計;
- 語音與音訊:文本轉語音(Bark、ElevenLabs 部分使用擴散)、音樂生成(Riffusion)。
- 內容稽核與版權保護:檢測擴散模型生成影像的數字水印(Stable Diffusion 內建水印、C2PA 標準),追溯模型輸出(如 Stable Signature),以及用於訓練資料版權訴訟的取證工具。
受益公司
以下公司按其在擴散模型產業鏈中的角色劃分,僅作產業圖譜參考,不構成任何投資評價。
- 算力基礎設施:NVIDIA(GPU 訓練與推論)、AMD(Instinct 系列)、雲端服務商(AWS、Microsoft Azure、Google Cloud)提供 GPU 例項和模型推論 API;AI 推論晶片初創(如 d-Matrix、Groq)亦可能受益於推論需求外溢。
- 基礎模型研發與分發:Stability AI(開源 Stable Diffusion 系列)、OpenAI(DALL·E 3 閉源 API)、Midjourney(產品化閉源模型)、Black Forest Labs(FLUX.1 開源/商業雙軌)、Google(Imagen 系列,未全面開放)、Meta(開源部分擴散研究)。
- 創意工具與 SaaS:Adobe(Firefly 產品線嵌入 Creative Cloud)、Canva、Runway(影片生成與編輯)、Getty Images(通過與 NVIDIA 合作推出合規生成工具)。
- 垂直應用整合者:百度(文心一格)、阿里巴巴(通義萬相)、字節跳動(即夢)、騰訊(混元影像生成)等國內廠商,以及眾多 AIGC 創業公司(ZMO.ai、右腦科技等)。
- 資料/版權服務:Shutterstock(授權資料訓練與生成)、內容認證技術商(如 Truepic、負責 C2PA 實施的組織)。
市場規模
擴散模型專有市場規模,截至目前(2025 年 2 月)公開資料未見第三方獨立核算。行業通常將其置於生成式 AI 整體市場中進行估算。
- 據 Grand View Research 於 2024 年 3 月釋出的《Generative AI Market Size, Share & Trends Analysis Report, 2024–2030》,全球生成式 AI 市場 2023 年規模約為 136.0 億美元,預計 2030 年將達到 1,290.3 億美元,年複合增長率(CAGR)約 36.8%。該統計口徑涵蓋軟體、雲端服務與專業服務,擴散模型被視作影像/影片/3D 等模態的核心生成技術。
- 從需求側看,根據 Bloomberg Intelligence 2023 年 6 月的分析,生成式 AI 市場到 2032 年有望達到 1.3 萬億美元,其中 AI 基礎設施層受益顯著。擴散模型驅動的推論算力(影像、影片生成等)是基礎設施消費的重要組成部分,但具體份額未拆分。
- 擴散模型相關的 API 呼叫量呈指數級增長:第三方監測(如 Replicate、Fal.ai 等平台的公開資料)表明,2024 年主流影像生成 API 的日均呼叫次數已超過數千萬次,但具體營收規模平台方未完全揭露。開源模型(如 Stable Diffusion)的下載量累計超過數億次(Hugging Face 及 GitHub 統計,2024 年),間接反映工具層的滲透廣度。
綜上,擴散模型直接帶動的模型服務、推論算力及創意工具營收在 2024 年估計已達數十億美元量級(口徑不一),但缺乏精確的第三方獨立資料,引用時建議標註“初步估計”。
玩家對比
以下對比聚焦文本到影像方向的主流產品與模型(截至 2025 年 2 月,來源為各平台官方文件、技術報告及公開新聞)。
| 模型/產品 | 架構 | 是否開源 | 最高輸出解析度 | 典型推論時間(單張) | 定價(2024–2025 口徑) | 核心特點 |
|---|---|---|---|---|---|---|
| Midjourney V6.x | 未公開(推測為改良 DiT) | 閉源 | ~2048×2048(放大) | 約 30–90 秒(含排隊) | 訂閱制:基礎 10 美元/月(約 200 張) | 極致美學、社群生態;需通過 Discord/網頁使用 |
| DALL·E 3 (OpenAI) | 未公開(潛在擴散 + 文本理解) | 閉源 | 1024×1024 / 1792×1024 | 10–30 秒(API) | API:0.016–0.080 美元/張;ChatGPT Plus 內嵌 | 強大提示詞遵循,天然整合 ChatGPT |
| Stable Diffusion 3 Medium (Stability AI) | MMDiT + 流匹配 | 開源(非商業需許可) | 1024×1024(原生) | 3–10 秒(A100/H100) | 模型權重免費;可自託管 | 開源可微調,社群生態極豐富 |
| FLUX.1 (Black Forest Labs) | DiT + 流匹配 | 部分開源(dev/schnell 開源) | 最高 2048×2048 | 2–6 秒(schnell 蒸餾版) | API 約 0.025 美元/張起;可自託管 | 文本遵循優秀,人體細節領先 |
| Imagen 3 (Google) | 未公開(潛在擴散 + T5) | 閉源 | 1024×1024 | 未公開(通過 Vertex AI 提供) | Vertex AI 按呼叫計費(約 0.02–0.04 美元/張) | 安全過濾嚴格,影像真實感強 |
| 文心一格 / 通義萬相 (百度/阿里) | 潛在擴散系列 | 閉源 / 模型僅限 API | 1024×1024 或更高 | 5–20 秒(國內雲端) | 按呼叫量計費,通常 0.01–0.10 元人民幣/張 | 中文理解優,合規體系完備 |
| Sora (OpenAI) | 影片擴散 DiT | 閉源 | 最長 60 秒 1080p 影片 | 數分鐘(內測期) | 未公開定價(2024 年 12 月少量開放) | 影片生成可物理一致性,暫時未全面開放 |
說明:推論時間受硬體、排隊及 API 負載影響,以上為公開渠道參考值。開源模型可自行部署,成本取決於 GPU 選型。 (注:本比較不構成任何“值得買”或服務推薦,僅客觀羅列已知屬性。)
風險
- 版權與法律風險:訓練資料是否獲得授權是全球爭議焦點。2023 年 Getty Images 對 Stability AI 提起訴訟,AI 生成物的版權歸屬在多個司法管轄區仍不明確。模型生成內容若模仿具名藝術家風格或包含未授權商標元素,可能導致侵權。
- 監管合規風險:歐盟《人工智慧法案》(2024 年通過)要求生成式 AI 揭露訓練資料摘要並標註 AI 內容;中國已施行深度合成服務管理規定,需要顯著標識。跨境服務面臨多法域合規成本。
- 技術快速迭代風險:擴散模型可能被下一代生成架構(如流匹配、新範式)替代,高階架構(DiT、MMDiT)需要從頭訓練,中小團隊資本壓力大。蒸餾與加速技術縮短推論步數,可能使前期高步數最佳化資產快速貶值。
- 模型安全與濫用:擴散模型可生成逼真假影像、深度偽造影片,帶來政治干擾、詐騙和聲譽風險。各大平台雖內建安全過濾,但開源模型難以完全防止惡意微調。
- 開源競爭與價格戰:開源模型(Stable Diffusion 系列、FLUX dev)壓低 API 定價,閉源玩家需維持差異化體驗與品牌溢價。價格戰可能導致部分商業模型提供商持續虧損(Stability AI 在 2024 年經歷財務和管理層動盪)。
- 環境與算力成本:訓練前沿擴散模型消耗巨大電力與算力,引發環保與可持續發展爭議;推論端雖不斷最佳化,但生成式 AI 的總能耗仍在快速攀升。
- 資料偏見與公平性:訓練資料中的社會偏見可能被模型放大,生成與種族、性別相關的刻板印象內容,需要持續的偏差檢測與緩解策略。
誤讀糾偏
-
誤讀:擴散模型是 GAN 的變種或改進版 糾偏:擴散模型與 GAN 基於完全不同的原理——依靠學習資料分佈的梯度而非對抗博弈,不使用判別器。兩者均屬於深度生成模型,但訓練過程更穩定,模式覆蓋更優。
-
誤讀:生成高質量影像必須使用上千步取樣 糾偏:通過 DDIM、DPM-Solver++、一致性蒸餾等技術,10~30 步即可獲得與千步 DDPM 相當的品質。2024 年的 FLUX schnell 和 SD3 Turbo 版本甚至可在 1–4 步內生成可用影像。步數“越多越好”僅適用於無加速的樸素 DDPM,不是普遍適用。
-
誤讀:潛在擴散(LDM)只是“壓縮圖片再放大”,必然損失細節 糾偏:經感知訓練的 VAE 可在 4–8 倍壓縮下保留豐富紋理;擴散在潛空間進行往往能聚焦語義內容,對抗畫素級噪聲。相比畫素空間擴散,LDM 在高解析度下細節損失極小,且推論資源大幅降低,是效率與質量的帕累托改善。
-
誤讀:擴散模型只能生成影像 糾偏:擴散架構已成功擴充套件至影片(Sora、Video Diffusion)、音訊(DiffWave)、3D 形狀(Point-E、DreamFusion)、蛋白質結構(RFdiffusion)等任意可嵌入空間的資料,本質是對複雜分佈的通用建模。
-
誤讀:Stable Diffusion 是唯一重要的開源擴散模型 糾偏:除 Stability AI 的 SD 系列外,還有 FLUX.1(Black Forest Labs)、PixArt‑α、Playground v2 等眾多開源模型,以及大量社群微調版本。不同模型在架構、許可、文本理解和畫面風格上各有取捨。
最新事件
(以下事件基於 2024–2025 年公開報道,時間截至 2025 年 2 月)
- 2024 年 2 月:OpenAI 釋出 Sora 影片生成模型,展示基於 DiT 的擴散架構在影片領域的驚人能力,引發影視行業震動。Sora 並未立即對公眾開放,僅供紅隊測試和部分藝術家使用。
- 2024 年 3–4 月:Stability AI 經歷管理層更迭,CEO Emad Mostaque 辭職,公司尋求外部融資以維持運營。後續釋出 SD3 技術論文並開源部分權重。
- **2024 年 6 月