模型層 開放閱讀

擴散模型

Diffusion Model

概念 ID
diffusion-model
更新時間
2026-05-29
來源數量
待補

擴散模型

3 秒看懂

  • 擴散模型是一種生成式模型,其核心是通過逐步向資料新增噪聲,再學習逆轉這一噪聲過程來生成新樣本。
  • 生成過程:前向過程將真實影像(或其他資料)轉化為純高斯噪聲;逆向過程從隨機噪聲出發,一步一步“去噪”,恢復出符合訓練資料分佈的新影像。
  • 產業地位:擴散模型已是文本到影像(Stable Diffusion、DALL·E 3、FLUX)、影片生成(Sora、Runway Gen-3)、語音合成、分子構象生成等多模態任務的主流架構,在影像合成領域全面取代 GAN 成為 SOTA。

3 分鐘產業解釋

擴散模型的產業價值體現在生成質量高、訓練過程平穩、可控性強。與 GAN 相比,擴散模型無需對抗訓練,避免了模式坍塌;與自迴歸模型相比,其逆向過程可通過並行取樣加速(如 DDIM、DPM-Solver、一致性蒸餾),推論效率不斷提升。

產業落地方向主要包括:

  • 文生圖/影片:Midjourney、Stable Diffusion、DALL·E、FLUX 等直接面向普通使用者與創意產業,已嵌入 Photoshop、Canva 等主流工具。
  • 3D/分子生成:擴散思想被擴充套件至點雲端、蛋白質結構(如 RFdiffusion、AlphaFold 3 中的擴散模組),助力藥物發現與數字孿生。
  • 音訊/語音合成:WaveGrad、DiffWave、Bark 等模型提供高保真音訊,部分已進入商業 TTS 服務。

算力需求依然是主要瓶頸:一次高解析度影像生成需多次 U‑Net 或 DiT 前向傳播(傳統 DDPM 需數百至上千步),持續拉動 GPU 及專用推論晶片的需求。產業界正通過**潛在空間擴散(LDM)、常微分方程取樣器(DPM-Solver)、一致性模型(Consistency Models)、流匹配(Flow Matching)**等手段將推論步數壓縮至 4~20 步,在保持質量的同時大幅降低部署成本,使即時生成和行動端推論成為可能。

技術原理

前向擴散過程(加噪)

給定真實資料 x_0 \sim q(x_0),每一步按預設的噪聲排程 \beta_t \in (0,1) 新增高斯噪聲:

q(x_t | x_{t-1}) = mathcal(N)(x_t ; sqrt(1 - \beta_t) \, x_{t-1}, \beta_t mathbf(I))

利用重引數化,可直接從 x_0 得到任意噪聲尺度下的分佈:

q(x_t | x_0) = mathcal(N)(x_t ; \sqrt{\bar{\alpha}_t} \, x_0, (1 - \bar{\alpha}_t) mathbf(I))

其中 \bar{\alpha}_t = \prod_{s=1}^{t} (1 - \beta_s)。當總步數 T 足夠大時 \sqrt{\bar{\alpha}_T} \approx 0q(x_T) \approx mathcal(N)(0, mathbf(I)),即純高斯噪聲。

逆向去噪過程(生成)

訓練一個引數化高斯轉移來逼近真實的逆轉移:

p_{\theta}(x_{t-1} | x_t) = mathcal(N)(x_{t-1}; \mu_{\theta}(x_t, t), \Sigma_{\theta}(x_t, t))

DDPM 中將方差固定為 \sigma_t^2 mathbf(I),均值通過一個噪聲預測網路 \epsilon_{\theta} 重新引數化:

\mu_{\theta}(x_t, t) = frac(1){sqrt(1-\beta_t)} \left( x_t - \frac{\beta_t}{sqrt(1-\bar{\alpha)_t}} \epsilon_{\theta}(x_t, t) \right)

訓練目標是最小化簡單的均方誤差(\epsilon-prediction):

mathcal(L)_{text(simple)} = mathbb(E)_{t, x_0, \epsilon} \left[ \| \epsilon - \epsilon_{\theta}(\sqrt{\bar{\alpha}_t} x_0 + sqrt(1-\bar{\alpha)_t} \epsilon, t) \|^2 \right]

推論時從 x_T \sim mathcal(N)(0, mathbf(I)) 開始,迭代執行:

x_{t-1} = frac(1){sqrt(1-\beta_t)} \left( x_t - \frac{\beta_t}{sqrt(1-\bar{\alpha)_t}} \epsilon_{\theta}(x_t, t) \right) + \sigma_t \, mathbf(z),\quad mathbf(z) \sim mathcal(N)(0, mathbf(I))

直到 t=0 得到生成樣本 x_0

條件生成與潛在擴散

條件資訊 y(如文本提示)通過嵌入後注入去噪網路的交叉注意力:

text(Attention)(Q, K_y, V_y) = text(softmax)\!\left(frac(Q K_y^{mathsf(T)}}{sqrt(d)}\right) V_y

基礎去噪網路通常採用 U‑Net 結構(包含編碼器、中間層、解碼器及跳躍連線),近期主流方案已逐步轉向 DiT(Diffusion Transformer)MMDiT(多模態擴散 Transformer)。

潛在擴散(LDM) 的關鍵設計是先在感知壓縮空間(如 VAE 的潛變數空間)進行擴散:先編碼 z_0 = text(Enc)(x_0),整個擴散與去噪過程在低維潛在空間完成,最後 hat(x) = text(Dec)(z_0)。這種方案使擴散模型能夠在 4×4 到 64×64 的潛在空間上訓練和推論,大幅降低視訊記憶體佔用和計算量,是 Stable Diffusion 系列的基礎架構。

取樣加速機制概覽

  • DDIM:藉助非馬爾可夫擴散,可跳躍取樣,在 50~100 步內得到與 DDPM 千步相當的質量,且支援確定性生成。
  • DPM-Solver/DPM++:將反向擴散視為常微分方程(ODE),用高階求解器在 10~20 步內獲得高質量樣本,無需重新訓練網路。
  • 一致性模型(Consistency Models):直接學習從任意噪聲狀態到乾淨資料的對映 f_{\theta}(x_t, t) \rightarrow x_0,支援 1~4 步推論,顯著降低延遲。
  • 流匹配與整流(Flow Matching / Rectified Flow):建置直線或最優傳輸路徑,進一步最佳化取樣效率,已被 SD3 和 FLUX 等模型採用。

關鍵引數

本節列示評估與部署擴散模型時最受關注的引數。除非特別註明,數字均為 2023–2024 年公開基準,具體結果隨模型版本和評測協議變化。

指標定義 / 意義典型數值 / 範圍來源 / 說明
FID(Frechet Inception Distance)生成影像與真實影像特徵分佈的距離,值越低幀越好最佳釋出模型的零樣本 COCO FID 可達 2.5~8.0(2024 年 SD3、FLUX 等報告值低於 3.0)各模型技術報告;公開排行榜
CLIP Score文本-影像對齊程度,越高表示圖文一致性越好ViT‑g/14 尺度下約 0.30–0.35(SD3 等先進模型)論文、OpenCLIP 基準
推論步數從噪聲到影像的取樣步驟,越少越快,但可能損失細節2023 年主流:2050 步(DPM++);2024 年極致:14 步(一致性模型);SOTA 平衡:12~28 步官方技術報告、diffusers 社群
單張影像推論時間生成一張 1024×1024 影像的平均耗時A100 (40GB/80GB):約 28 秒(取決於步數和模型大小);H100 可壓縮至 13 秒;行動端(SD‑Turbo)可<1 秒公開基準(Replicate, Hugging Face Space 實測);各廠商部落格
GPU 視訊記憶體佔用推論和訓練時所需視訊記憶體,決定部署硬體成本SDXL 1024×1024 推論約需 8–14 GB;SD3‑Medium 約 12–20 GB(FP16);訓練大尺寸 DiT 模型需數百 GB 至 TB 級視訊記憶體(多卡)官方硬體建議;社群報告
模型引數量去噪網路(U‑Net/DiT)+ 編碼器等總引數規模SDXL 約 3.5B(U‑Net 2.6B + 文本編碼器 0.8B);SD3‑Medium 約 2B;FLUX.1‑dev 約 12B(DiT);Midjourney V6 未公開,估計數十億量級Stability AI 技術報告;Black Forest Labs 部落格
訓練吞吐量訓練每秒可處理的影像數(img/s/GPU)使用 A100 × 8,SDXL 訓練約 20–30 img/s(參考);DiT‑XL/2 約 15 img/s(Peebles & Xie, 2023)開原始碼庫及論文
無分類器引導強度(CFG scale)控制生成影像對文本的忠實度與多樣性,常用 3~9多數文本到影像模型的預設值約為 7.0;過高導致色彩過飽和和偽影業界通用實踐

注:以上數值可能因軟硬體環境、評測集(如 COCO 30K/40K)及提示詞工程有所不同。“公開資料未見”的特殊引數未在表中列示。

技術路線

當前主流擴散模型的技術路線可從網路架構、訓練目標、取樣策略三個維度進行對比。

路線 / 代表模型網路主幹訓練/引數化目標典型取樣步數潛空間關鍵優勢與限制
DDPM (Ho 2020)U‑Netε‑prediction1000 步畫素(或無)奠基架構,訓練穩定;推論極慢
Score‑SDE (Song 2021)U‑Net得分函式 ∇log p2000 步(SDE)畫素連續時間檢視,理論優美;取樣昂貴
DDIM (Song 2021)同 DDPM 網路ε‑prediction50–100 步畫素跳躍取樣,確定性;不改網路
Latent Diffusion (LDM) / Stable Diffusion 1.x–2.xU‑Net + 交叉注意力ε‑prediction30–100 步VAE 潛空間大幅降視訊記憶體,支援高解析度;品質依賴 VAE
DPM-Solver / DPM++ (Lu 2022)同 DDPM 網路ε‑prediction10–20 步均可ODE 加速,無需重訓;與現有模型直接相容
DiT / MDT (Peebles & Xie 2023)Transformer (DiT塊),替換 U‑Netε‑prediction / v‑prediction20–50 步VAE 潛空間可擴充套件性極強,適配大規模訓練;Sora 影片基座
一致性模型 (Song 2023)二合一網路 fθ自定義蒸餾損失1–4 步畫素/潛空間接近即時生成;單步質量略遜於多步
流匹配 / 整流 (Lipman 2023 / SD3)MMDiT(多模態擴散 Transformer)v‑prediction / 流速場15–28 步(可進一步蒸餾)VAE 潛空間直線路徑,取樣穩定,圖文對齊優秀;模型較大

對比說明:截至 2025 年初,Transformer 主幹 + 流匹配/整流 已成為最前沿路線,代表模型包括 Stable Diffusion 3、FLUX.1 和 Sora。開源社群廣泛採用的依然是基於 U‑Net 的 LDM 系列,但因 DiT 和 MMDiT 展現出更強的擴充套件性和文本遵循能力,預計將逐步成為主流架構。

上游

擴散模型的上游由資料、基礎模型、算力硬體與軟體架構共同構成:

  • 訓練資料:大規模圖文對資料集(LAION‑5B、COYO‑700M、WebLI 等),以及內部精細化標註的高質量資料。資料版權和過濾機制正成為上游核心壁壘。
  • 預訓練編碼器:文本編碼器主要採用 CLIP(ViT‑L/14、ViT‑g/14、OpenCLIP)、T5‑XXL;潛在空間 VAE 編碼器/解碼器通常與去噪網路協同訓練或凍結。多模態模型(如 LLaVA、BLIP‑2)提供的特徵也可作為條件嵌入。
  • 算力硬體:訓練端以 NVIDIA A100、H100 叢集為主,2024 年起逐步遷移至 H200/B200;推論端需要中高階 GPU(A10/A100/L40S 等),專用推論晶片(如 d-Matrix、Groq 的 LPU)開始進入市場。根據公開報告,訓練一個 SD3 級別模型可能需要數千 H100 GPU·日。
  • 軟體架構:PyTorch、JAX 為主要訓練架構;Hugging Face Diffusers 是應用最廣的推論/微調庫;分散式訓練依賴 Megatron‑LM、DeepSpeed、FSDP;社群工具鏈如 ComfyUI、Automatic1111 WebUI 大幅降低使用門檻。

下游

擴散模型的下游覆蓋創作工具、垂直行業應用和內容治理三大領域:

  • 創作與設計工具:Midjourney(通過 Discord/Web)、Stable Diffusion 生態(DreamStudio、ComfyUI、InvokeAI)、Adobe Firefly(嵌入 Photoshop)、Canva AI 影像生成、Leonardo.Ai 等。商業化 API 主要由 OpenAI(DALL·E 3)、Stability AI、Replicate 提供。
  • 垂直行業應用
    • 媒體與廣告:自動化素材生成、虛擬場景、廣告創意設計;
    • 電商/時尚:虛擬試穿、商品背景替換(ZMO.ai、Vue.ai);
    • 建築與室內設計:草圖渲染、風格遷移(Veras、ArkDesign);
    • 遊戲與影視:角色與場景資產生成(Scenario、Promethean AI)、影片特效(Runway Gen‑3)、動畫製作;
    • 生命科學:蛋白質結構生成(RFdiffusion)、分子構象取樣(AlphaFold 最新版本)、材料逆向設計;
    • 語音與音訊:文本轉語音(Bark、ElevenLabs 部分使用擴散)、音樂生成(Riffusion)。
  • 內容稽核與版權保護:檢測擴散模型生成影像的數字水印(Stable Diffusion 內建水印、C2PA 標準),追溯模型輸出(如 Stable Signature),以及用於訓練資料版權訴訟的取證工具。

受益公司

以下公司按其在擴散模型產業鏈中的角色劃分,僅作產業圖譜參考,不構成任何投資評價。

  • 算力基礎設施:NVIDIA(GPU 訓練與推論)、AMD(Instinct 系列)、雲端服務商(AWS、Microsoft Azure、Google Cloud)提供 GPU 例項和模型推論 API;AI 推論晶片初創(如 d-Matrix、Groq)亦可能受益於推論需求外溢。
  • 基礎模型研發與分發:Stability AI(開源 Stable Diffusion 系列)、OpenAI(DALL·E 3 閉源 API)、Midjourney(產品化閉源模型)、Black Forest Labs(FLUX.1 開源/商業雙軌)、Google(Imagen 系列,未全面開放)、Meta(開源部分擴散研究)。
  • 創意工具與 SaaS:Adobe(Firefly 產品線嵌入 Creative Cloud)、Canva、Runway(影片生成與編輯)、Getty Images(通過與 NVIDIA 合作推出合規生成工具)。
  • 垂直應用整合者:百度(文心一格)、阿里巴巴(通義萬相)、字節跳動(即夢)、騰訊(混元影像生成)等國內廠商,以及眾多 AIGC 創業公司(ZMO.ai、右腦科技等)。
  • 資料/版權服務:Shutterstock(授權資料訓練與生成)、內容認證技術商(如 Truepic、負責 C2PA 實施的組織)。

市場規模

擴散模型專有市場規模,截至目前(2025 年 2 月)公開資料未見第三方獨立核算。行業通常將其置於生成式 AI 整體市場中進行估算。

  • Grand View Research 於 2024 年 3 月釋出的《Generative AI Market Size, Share & Trends Analysis Report, 2024–2030》,全球生成式 AI 市場 2023 年規模約為 136.0 億美元,預計 2030 年將達到 1,290.3 億美元,年複合增長率(CAGR)約 36.8%。該統計口徑涵蓋軟體、雲端服務與專業服務,擴散模型被視作影像/影片/3D 等模態的核心生成技術。
  • 從需求側看,根據 Bloomberg Intelligence 2023 年 6 月的分析,生成式 AI 市場到 2032 年有望達到 1.3 萬億美元,其中 AI 基礎設施層受益顯著。擴散模型驅動的推論算力(影像、影片生成等)是基礎設施消費的重要組成部分,但具體份額未拆分。
  • 擴散模型相關的 API 呼叫量呈指數級增長:第三方監測(如 Replicate、Fal.ai 等平台的公開資料)表明,2024 年主流影像生成 API 的日均呼叫次數已超過數千萬次,但具體營收規模平台方未完全揭露。開源模型(如 Stable Diffusion)的下載量累計超過數億次(Hugging Face 及 GitHub 統計,2024 年),間接反映工具層的滲透廣度。

綜上,擴散模型直接帶動的模型服務、推論算力及創意工具營收在 2024 年估計已達數十億美元量級(口徑不一),但缺乏精確的第三方獨立資料,引用時建議標註“初步估計”。

玩家對比

以下對比聚焦文本到影像方向的主流產品與模型(截至 2025 年 2 月,來源為各平台官方文件、技術報告及公開新聞)。

模型/產品架構是否開源最高輸出解析度典型推論時間(單張)定價(2024–2025 口徑)核心特點
Midjourney V6.x未公開(推測為改良 DiT)閉源~2048×2048(放大)約 30–90 秒(含排隊)訂閱制:基礎 10 美元/月(約 200 張)極致美學、社群生態;需通過 Discord/網頁使用
DALL·E 3 (OpenAI)未公開(潛在擴散 + 文本理解)閉源1024×1024 / 1792×102410–30 秒(API)API:0.016–0.080 美元/張;ChatGPT Plus 內嵌強大提示詞遵循,天然整合 ChatGPT
Stable Diffusion 3 Medium (Stability AI)MMDiT + 流匹配開源(非商業需許可)1024×1024(原生)3–10 秒(A100/H100)模型權重免費;可自託管開源可微調,社群生態極豐富
FLUX.1 (Black Forest Labs)DiT + 流匹配部分開源(dev/schnell 開源)最高 2048×20482–6 秒(schnell 蒸餾版)API 約 0.025 美元/張起;可自託管文本遵循優秀,人體細節領先
Imagen 3 (Google)未公開(潛在擴散 + T5)閉源1024×1024未公開(通過 Vertex AI 提供)Vertex AI 按呼叫計費(約 0.02–0.04 美元/張)安全過濾嚴格,影像真實感強
文心一格 / 通義萬相 (百度/阿里)潛在擴散系列閉源 / 模型僅限 API1024×1024 或更高5–20 秒(國內雲端)按呼叫量計費,通常 0.01–0.10 元人民幣/張中文理解優,合規體系完備
Sora (OpenAI)影片擴散 DiT閉源最長 60 秒 1080p 影片數分鐘(內測期)未公開定價(2024 年 12 月少量開放)影片生成可物理一致性,暫時未全面開放

說明:推論時間受硬體、排隊及 API 負載影響,以上為公開渠道參考值。開源模型可自行部署,成本取決於 GPU 選型。 (注:本比較不構成任何“值得買”或服務推薦,僅客觀羅列已知屬性。)

風險

  1. 版權與法律風險:訓練資料是否獲得授權是全球爭議焦點。2023 年 Getty Images 對 Stability AI 提起訴訟,AI 生成物的版權歸屬在多個司法管轄區仍不明確。模型生成內容若模仿具名藝術家風格或包含未授權商標元素,可能導致侵權。
  2. 監管合規風險:歐盟《人工智慧法案》(2024 年通過)要求生成式 AI 揭露訓練資料摘要並標註 AI 內容;中國已施行深度合成服務管理規定,需要顯著標識。跨境服務面臨多法域合規成本。
  3. 技術快速迭代風險:擴散模型可能被下一代生成架構(如流匹配、新範式)替代,高階架構(DiT、MMDiT)需要從頭訓練,中小團隊資本壓力大。蒸餾與加速技術縮短推論步數,可能使前期高步數最佳化資產快速貶值。
  4. 模型安全與濫用:擴散模型可生成逼真假影像、深度偽造影片,帶來政治干擾、詐騙和聲譽風險。各大平台雖內建安全過濾,但開源模型難以完全防止惡意微調。
  5. 開源競爭與價格戰:開源模型(Stable Diffusion 系列、FLUX dev)壓低 API 定價,閉源玩家需維持差異化體驗與品牌溢價。價格戰可能導致部分商業模型提供商持續虧損(Stability AI 在 2024 年經歷財務和管理層動盪)。
  6. 環境與算力成本:訓練前沿擴散模型消耗巨大電力與算力,引發環保與可持續發展爭議;推論端雖不斷最佳化,但生成式 AI 的總能耗仍在快速攀升。
  7. 資料偏見與公平性:訓練資料中的社會偏見可能被模型放大,生成與種族、性別相關的刻板印象內容,需要持續的偏差檢測與緩解策略。

誤讀糾偏

  1. 誤讀:擴散模型是 GAN 的變種或改進版 糾偏:擴散模型與 GAN 基於完全不同的原理——依靠學習資料分佈的梯度而非對抗博弈,不使用判別器。兩者均屬於深度生成模型,但訓練過程更穩定,模式覆蓋更優。

  2. 誤讀:生成高質量影像必須使用上千步取樣 糾偏:通過 DDIM、DPM-Solver++、一致性蒸餾等技術,10~30 步即可獲得與千步 DDPM 相當的品質。2024 年的 FLUX schnell 和 SD3 Turbo 版本甚至可在 1–4 步內生成可用影像。步數“越多越好”僅適用於無加速的樸素 DDPM,不是普遍適用。

  3. 誤讀:潛在擴散(LDM)只是“壓縮圖片再放大”,必然損失細節 糾偏:經感知訓練的 VAE 可在 4–8 倍壓縮下保留豐富紋理;擴散在潛空間進行往往能聚焦語義內容,對抗畫素級噪聲。相比畫素空間擴散,LDM 在高解析度下細節損失極小,且推論資源大幅降低,是效率與質量的帕累托改善。

  4. 誤讀:擴散模型只能生成影像 糾偏:擴散架構已成功擴充套件至影片(Sora、Video Diffusion)、音訊(DiffWave)、3D 形狀(Point-E、DreamFusion)、蛋白質結構(RFdiffusion)等任意可嵌入空間的資料,本質是對複雜分佈的通用建模。

  5. 誤讀:Stable Diffusion 是唯一重要的開源擴散模型 糾偏:除 Stability AI 的 SD 系列外,還有 FLUX.1(Black Forest Labs)、PixArt‑α、Playground v2 等眾多開源模型,以及大量社群微調版本。不同模型在架構、許可、文本理解和畫面風格上各有取捨。

最新事件

(以下事件基於 2024–2025 年公開報道,時間截至 2025 年 2 月)

  • 2024 年 2 月:OpenAI 釋出 Sora 影片生成模型,展示基於 DiT 的擴散架構在影片領域的驚人能力,引發影視行業震動。Sora 並未立即對公眾開放,僅供紅隊測試和部分藝術家使用。
  • 2024 年 3–4 月Stability AI 經歷管理層更迭,CEO Emad Mostaque 辭職,公司尋求外部融資以維持運營。後續釋出 SD3 技術論文並開源部分權重。
  • **2024 年 6 月
source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型