模型層 開放閱讀

Stable Diffusion

Stable Diffusion

概念 ID
stable-diffusion
更新時間
2026-05-29
來源數量
待補

Stable Diffusion

1. 3 秒看懂

Stable Diffusion 是由 Stability AI 主導推出的開源文本到影像生成模型。其核心機制是潛在擴散:它並非直接在畫素層面作畫,而是先將影像壓縮到一個低維度的“語義潛空間”,在此空間內通過逐步去噪生成影像的核心語義資訊,最後通過解碼器恢復為高畫質影像。簡言之,輸入一句自然語言描述,它能生成對應的畫面。因其模型權重完全公開且可在消費級顯示卡上高效執行,它迅速成為全球 AI 創作者與開發者的基礎工具。

2. 3 分鐘產業解釋

傳統擴散模型直接在擁有數百萬畫素的高維影像空間進行迭代去噪,這導致了極高的計算量和視訊記憶體消耗。Stable Diffusion 的核心產業創新在於,它將這一高成本的擴散過程遷移到了一個計算複雜度數量級降低的潛空間中。這使得單張消費級 GPU(如 NVIDIA RTX 系列)即可完成從推論到微調的全流程,生產成本呈指數級下降。

其工作鏈條由三個核心子網路構成,協同完成從語義到畫素的轉換:

  • VAE(變分自編碼器):作為連線畫素空間與潛空間的橋樑。編碼器將輸入影像壓縮至極小的潛空間,解碼器則將潛空間資料恢復為高畫質影像。
  • U-Net 去噪器:這是模型的主幹,它接收一個帶噪的潛變數和文本編碼器提供的語義條件,在每個去噪步驟中預測並移除噪聲。
  • 文本編碼器(如 CLIP):將使用者輸入的自然語言提示詞轉化為機器可理解的語義向量,並在 U-Net 的交叉注意力層注入,指導影像生成的內容與風格。

推論時,模型從完全的隨機噪聲開始,歷經數十步迭代逐步去噪,最終得到一個清晰的潛變數,再經由 VAE 解碼器渲染為最終影像。開源的特性催生了龐大的下游生態:從圖生圖、區域性重繪,到 ControlNet、LoRA 等精細化控制工具,它重塑了內容創作的工具體系,並引發了關於模型版權、內容安全與真實性的廣泛討論。

3. 技術原理

Stable Diffusion 的技術本質,是條件擴散模型在感知壓縮潛空間中的工程化實現。其設計哲學並非發明全新的基礎演算法,而是將前人的理論成果與工程最佳化進行系統性整合,使其達到可大規模實用化的水準。以下是其機制的分層解構,需注意,SD 的多個具體版本(1.x, 2.x, XL)在細節引數上差異極大,因此下文以定性描述為主,凡未公開的具體數值均註明“公開資料未見”。

1. 感知壓縮與潛空間建置 這是實現“降本增效”的基石。一個預先訓練好的 VAE 負責將維度為 H \times W \times 3 的畫素空間影像 x 壓縮為低維潛變數 z = E(x)。VAE 的訓練結合了重構損失(確保解碼影像與原圖相似)和 KL 散度損失(正則化潛空間,使其分佈接近標準正態,從而具備連續性)。在 Stable Diffusion 的多數實現中,壓縮比通常為 4× 至 8×,即潛空間的資料維度僅為原畫素空間的 1/16 甚至更少(具體數值因 VAE 版本而異,“公開資料未見”統一標準)。這直接決定了模型的計算效率。

2. 前向擴散與去噪訓練 訓練階段模擬一個不斷加噪並逆向學習去噪的過程:

  • 前向過程:向乾淨的潛變數 z_0 中按預先定義的噪聲排程 \bar{\alpha}_t 逐步加入高斯噪聲,經過 T 步後,z_T 趨近於純噪聲。公式表示為 z_t = \sqrt{\bar{\alpha}_t} z_0 + sqrt(1-\bar{\alpha)_t} \epsilon,其中 \epsilon \sim mathcal(N)(0, I)
  • 逆向訓練:核心是訓練 U-Net 去噪器 \epsilon_\theta(z_t, t, c)。它在給定時間步 t 和文本條件 c 的情況下,學會預測出當前步驟 z_t 中所混合的噪聲 \hat{\epsilon}。損失函式簡化為預測噪聲與真實噪聲之間的均方誤差(MSE):mathcal(L) = mathbb(E)_{z_0, \epsilon, t} \left[ \| \epsilon - \epsilon_\theta(z_t, t, c) \|^2 \right]。U-Net 的內部結構由下采樣和上取樣模組、殘差塊以及空間自注意力層和交叉注意力層構成,這是其能夠同時理解影像空間結構與文本語義的關鍵。

3. 文本條件的注入與引導 使用者的自然語言提示,首先被凍結引數的文本編碼器(社群普遍認為其使用了 CLIP 的 ViT-L/14 變體,但官方對不同版本的最終規格“公開資料未見”完整揭露)轉換為一系列 token 嵌入向量,作為條件 c 輸入 U-Net 的交叉注意力層。在推論時,無分類器引導 是關鍵技巧:模型會同時執行一次“有條件預測” \epsilon_\theta(z_t, t, c) 和一次“無條件預測” \epsilon_\theta(z_t, t, \varnothing),然後將兩者進行線性外推,得到最終的噪聲預測:\tilde{\epsilon} = \epsilon_\theta(z_t, t, \varnothing) + w ( \epsilon_\theta(z_t, t, c) - \epsilon_\theta(z_t, t, \varnothing) )。其中引導尺度 w 是使用者可調的關鍵引數,值越大,對提示詞的忠實度越高,但可能損失影像多樣性與自然度。

4. 快速取樣 標準 DDPM 的去噪過程需上千步,效率極低。Stable Diffusion 的實用性建立在高效取樣器之上,如 DDIM、DPM-Solver++ 和 Euler 等。這些取樣器能以極少的步數(通常在 20 至 50 步內)近似求解反向擴散過程的常微分方程,顯著加速生成,構成了使用者體驗上的核心突破。

5. 推論流程總結 (ASCII 示意圖)

[輸入文字] → (文本編碼器) → [文本嵌入向量]

[隨機噪聲 (z_T)] → {迴圈 t=T 到 1:
                    [U-Net] ← (z_t, t, 文本嵌入)

                    [預測噪聲並更新] → (z_{t-1})
                   } → [最終潛變數 z_0]

                    (VAE 解碼器) → [輸出影像]

4. 關鍵引數

模型的行為與輸出質量由一系列核心引數控制。以下引數均為定性描述,精確影響因模型版本、取樣器而異,需通過實踐體會。

  • CFG 引導尺度:控制生成影像對輸入文本的遵從程度。典型取值範圍為 7-15。過低則影像內容隨機,過高則可能出現色彩過飽和、對比度失真與偽影。
  • 取樣步數:去噪過程的迭代次數。通常 20-50 步即可收斂,繼續增加步數(如超過 100 步)對畫質提升作用甚微,但會線性增加推論時間。
  • 取樣器:決定去噪演算法的具體實現。不同取樣器在收斂速度、細節銳度和穩定性上各有取捨。例如,DDIM 穩定,DPM-Solver++ 快速,Euler 在高步數下細節豐富。
  • 解析度:指定生成影像的寬度與高度。必須考慮 VAE 和 U-Net 的固有訓練解析度(SD 1.5 為 512x512,SDXL 為 1024x1024)。直接在非原生解析度下生成極易產生結構崩壞,建議在使用時保持長寬維度為 8 或 64 的整數倍。
  • 隨機種子:初始化潛空間隨機噪聲的數值。固定種子即可確保相同提示詞與引數下生成完全一致的影像,是進行受控實驗和版本迭代的核心工具。

5. 技術路線

Stable Diffusion 的技術演進並非線性,而是理論突破與社群工程創新交織的過程,呈現出清晰的基礎與變體路線:

  • 早期擴散奠基 (2015-2020):從 Sohl-Dickstein 提出擴散思想,到 Ho 等人提出 DDPM 規範了訓練架構,再到 Song 等人提出 DDIM 實現加速,基礎理論逐步成型。
  • 潛在擴散突破 (2021-2022):Rombach 等人提出 LDM,將擴散過程從畫素空間解耦到潛空間,實現了效率與質量的平衡。此論文發表於 CVPR 2022,直接構成了 Stable Diffusion 的技術骨架。
  • 基礎版本演進 (2022-2023):Stability AI 先後迭代 SD 1.x(以 1.5 為經典)、SD 2.x(嘗試更高解析度與自然語言理解)、SDXL(引數增至數十億級,原生支援 1024x1024 解析度並引入雙文本編碼器)等基礎模型。
  • 加速與蒸餾路線 (2023 至今):SD Turbo、LCM 等模型的出現,通過對抗訓練或潛在空間一致性蒸餾,將生成步數從數十步壓縮至個位數,實現了接近即時的生成速度,為影片生成和互動式應用鋪路。
  • 可控性路線 (2023 至今):以 ControlNet 和 IP-Adapter 為里程碑,前者通過注入邊緣圖、深度圖、姿態骨架等確定性空間訊號實現精細構圖控制,後者通過解耦交叉注意力注入影像特徵實現“墊圖”功能。
  • 輕量化微調路線 (2023 至今):LoRA 技術允許在極少計算資源下,通過訓練低秩矩陣來定格特定風格、角色或物體,無需改動原始大型模型權重,極大降低了模型個性化成本。

6. 上游

產業鏈上游主要由資料和算力兩大要素構成,共同決定了模型的效能上限與安全邊界。

  • 訓練資料集:主要包括 LAION 系列資料集,如用於初代 SD 訓練的 LAION-5B。該資料集通過 Common Crawl 抓取網際網路公開的圖文對,其規模、美學評分篩選機制(如通過 CLIP 評分和畫質評估)直接塑造了模型的輸出分佈。然而,其資料來源的版權與合規性爭議是行業面臨的最大風險之一(關於 LAION-5B 的最新具體構成比例與版權清洗狀態,“公開資料未見”全面審計報告)。
  • 預訓練編碼器:CLIP 等視覺-語言模型是文本理解能力的核心上游。其對比學習範式決定了詞語與視覺概念的對映精度。SD 不同版本所使用的 CLIP 微調版本並未被完全揭露。
  • GPU 算力基礎設施:NVIDIA 是事實上的壟斷者。高頻寬視訊記憶體(VRAM)和高速互聯是訓練與推論的核心瓶頸。訓練一次基礎模型需要數百至數千個 A100/H100 GPU 月(基於行業估算,Stability AI 未公佈精確消耗),是重資本投入環節。
  • 合規與資料供應鏈:為規避原始資料中的版權風險與有害內容,上游出現了專門從事資料清洗、合規審查、後設資料脫敏和高質量版權素材授權打包的服務商。

7. 下游

下游應用生態呈現高度碎片化和模組化特徵,主要面向專業創作者和技術背景的前沿使用者。

  • 創作與設計工具整合:通過外掛形式深度嵌入 Adobe Photoshop、Figma、Blender 等專業軟體,將 AI 能力融入圖層、選區、向量等既有概念中,例如基於 SD 的 Photoshop 生成式填充功能。
  • 圖形化節點流工作臺:以 ComfyUI 為技術標杆,允許使用者通過拖拽節點建置複雜的生成管道。這已成為專業研究者、工作室和高階玩家探索新工作流、復現論文和進行精密生產的主要平台。
  • 一鍵式整合工具包:以 Automatic1111 WebUI 為代表,將所有功能整合至單一網頁介面,極大降低了入門門檻,是社群模型測評和民間教程最多圍繞的軟體。
  • 微調與模型交易平台:以 Civitai 為代表,允許使用者上傳和分享微調後的模型權重(checkpoint)、LoRA 檔案等,形成了獨特的模型分發與預覽體系,但也成為版權灰色地帶和不良內容傳播的溫床。
  • 垂直產業解決方案:在遊戲概念設計與資產製作階段、電商產品圖多背景快速更替、室內與建築設計方案的快速視覺化等領域,SD 已被整合進具體生產流程,提供概念迭代和初稿產出。

8. 受益公司

由於 Stable Diffusion 是開源基礎設施,商業價值的捕捉散見於模型開發、算力服務和應用層等多個環節。

  • Stability AI:作為基礎模型的主要維護者和品牌方,營收來自 API 呼叫、企業級模型定製、會員訂閱及算力轉售。公司曾完成多輪融資,估值一度高漲,但因高昂的訓練和人才成本,據報道長期面臨商業化運營與現金流量的壓力。
  • Runway:早期深度參與 SD 的基礎研究(其團隊成員參與了潛在擴散論文),後全線轉向閉源的影片生成模型賽道,是目前多模態 AIGC 領域估值最高的公司之一(截至其 2023 年融資報道)。
  • Hugging Face:事實上的 AI 模型託管與分發中心。其核心的 Diffusers 庫已經成為呼叫、微調 SD 的行業標準庫,公司估值隨開源 AI 浪潮爆發式增長,受益於巨大的開發者流量。
  • 雲端服務與 GPU 租賃商:AWS、Google Cloud、阿里雲端等均提供一鍵部署 SD WebUI 的解決方案。以 RunPod、Vast.ai 為代表的社群型廉價 GPU 租賃市場因此獲得巨大收益,反映了推論側強勁的算力需求。
  • NVIDIA:作為底層算力的唯一核心供應商,是整個產業擴張的最大受益者之一,其面向邊緣計算的端側推論方案和高階訓練晶片的需求持續被 AIGC 推論與微調所拉動。
  • Adobe:內容工具巨頭,通過將 Firefly 系列文生圖功能(其底層技術路線的公開透明度較低)深度整合進其 Creative Cloud 產品家族,將 AI 能力直接轉化為鞏固訂閱營收的手段。

9. 市場規模

精確歸因於 Stable Diffusion 單一模型的市場規模極為困難,行業報告多將其歸入“AI 影像生成”或更廣泛的“生成式 AI”市場分析。

  • 生成式 AI 整體市場:根據 Bloomberg Intelligence 於 2023 年 6 月釋出的報告預測,全球生成式 AI 市場將在 2032 年達到 1.3 萬億美元,複合年增長率(CAGR)約為 42%。
  • AI 影像生成子市場:多個第三方機構預測其年複合增長率普遍超過 30%。例如,Straits Research 在 2023 年底的報告指出,全球 AI 影像生成器市場規模在 2022 年約為 2.6 億美元,預計到 2031 年將達到約 9.2 億美元(注:此為編制概念頁時引用的某口徑資料,具體預測數字常隨基準和假設浮動)。
  • 開源生態的間接價值:SD 生態的價值主要體現在間接的算力消耗、開發者生產力提升和周邊工具付費。據 A16Z 等風投機構在 2023 年的行業分析,開源模型周邊工具和算力市場的營收增速已超過閉源模型的 API 直接營收增速。具體由 SD 生態貢獻的產值規模,“公開資料未見”精確的審計統計。

10. 玩家對比

維度Stable Diffusion 生態 (開源)Midjourney (閉源)DALL-E 3 (閉源/API)
技術架構潛在擴散,U-Net+VAE+CLIP,完全透明暗化版擴散模型,具體架構未公開未公開細節(推測為擴散與語言模型深度耦合)
主要優勢極致的可控性、可定製性、隱私性、零成本使用、龐大的社群工具集零樣本下的頂級美學表現,易用性極高,社群氛圍強極強的自然語言理解與指代遵從能力,與 Chat/微軟體系整合
主要劣勢高階效果依賴使用者提示詞工程和模型混用技巧,學習曲線陡峭精確的空間構圖控制能力有限,所有生成均在雲端端,無離線私有化部署企業的封閉系統,可控性引數極少,內容稽核極為嚴格
商業模式基礎模型免費,生態價值沉澱於算力租賃、工具、企業服務和模型交易純訂閱制,按月或按年收費,購買 GPU 時長通過 API 按量付費,或作為 ChatGPT Plus/Microsoft Copilot 的增值功能提供

11. 風險

  • 模型幻覺與偏見風險:模型會“一本正經地胡說”,生成違揹物理常識、幾何結構的錯誤影像。同時,它可能放大和固化訓練資料中存在的刻板印象和社會偏見(如性別、種族、職業關聯)。
  • 版權歸屬與訴訟風險:這是懸在頭頂的達摩克利斯之劍。對模型訓練資料侵權的集體訴訟(如 Getty Images 訴 Stability AI 案,2023 年初發起)仍在進行中。同時,AI 生成內容的著作權認定在全球法律界存在巨大分歧,美國版權局等機構傾向於不保護完全由 AI 生成的內容。這構成了企業大規模商用的實質性法律障礙。
  • 不實資訊與偽造風險:模型能夠生成高度逼真的照片級影像,可能被惡意用於製造政治人物的虛假影片、偽造新聞事件的現場照片,對公眾信任和社會穩定構成新型威脅。
  • 技術和生態依賴風險:下游應用生態高度依賴 Stability AI 的基礎模型迭代和維護。若該公司因資金等問題導致維護中斷,整個社群將面臨分叉和維護真空的風險,正如公司在 2023-2024 年間曾經歷的關鍵管理層和核心研發人員變動所引發的不確定性。
  • 內容安全與稽核風險:開源模型無法像 API 一樣實施中心化的內容稽核,可能導致生成兒童虐待材料、暴力恐怖等非法內容的擴散,給平台監管帶來極大挑戰。

12. 誤讀糾偏

  1. 誤讀:“Stable Diffusion 是在一張畫布上‘畫’出影像。” 糾偏:它並不在畫素層面作畫,而是在一個數學定義的、高度壓縮的潛空間中處理語義概念。生成的中間過程是一系列對人眼無意義的數值矩陣,直到最後一步才通過解碼器重構為可識別的影像。理解這一點是區分入門者與專家的分水嶺。
  2. 誤讀:“開源模型的質量永遠追不上像 Midjourney 這樣的頂級閉源模型。” 糾偏:這種比較混淆了“零樣本能力”與“可定製化上限”。閉源模型的優勢在於其針對大眾審美調校出的零樣本美學一致性。但在需要極端控制(如固定角色、嚴格構圖匹配、特定工程管線)的垂直任務中,經過社群高質量微調模型、LoRA 和 ControlNet 武裝的 SD 生態,其可用性和輸出精度往往可以超越閉源 API,因為在特定任務上的最佳化深度完全不同。
  3. 誤讀:“CFG 引導尺度簡單地越高越好。” 糾偏:引導尺度 w 是平衡保真度與多樣性的調節閥,存在邊際效應和反噬。超過特定閾值(通常在15-20以上),不但不會提升影像質量,反而會因強行擬合文本而產生高對比度、色彩畸變和構圖崩塌的“過度引導”現象。

13. 最新事件

  • Stability AI 的組織與人事變動:在 2023 年至 2024 年初,公司創始 CEO Emad Mostaque 辭去職務,並伴隨著一系列關鍵研發人員和商業高管的離開。公司同時進行了業務重組,以尋求更可持續的商業模式,引發了業界對其長期穩定性的關注。
  • SD3 系列的釋出與回爐:Stability AI 於 2024 年上半年釋出了 Stable Diffusion 3 的中等引數版本,新架構引入了改良的自適應歸一化層並更換了文本編碼器,旨在提升文本遵從度。但其初始公共版本的權重因在涉及裸體等安全稽核機制上存在缺陷而隨後被撤回,凸顯了開源模型在釋出前的測試與對齊難題。
  • 社群加速方案的飛躍:2023 年底至 2024 年初,以 LCM、SD Turbo 為代表的少步數甚至單步生成方案大批湧現,並被迅速整合進社群工具,在消費級硬體上實現了近乎即時的 512x512 影像生成,為影片、3D 等模態的即時生成鋪平了道路。
  • 版權訴訟的階段性進展:洛杉磯聯邦法官在 2023 年底對藝術家起訴 Stability AI、Midjourney 等公司的集體訴訟作出了階段性裁決,駁回了大部分關於直接侵權的指控,理由是原告未能證明生成作品與原作存在實質性相似,但允許其就模型使用受版權保護影像進行訓練的主張進行修改後重新起訴。此案仍在審理中。

14. 追蹤指標

要持續追蹤該領域的實質性進展與變化,建議關注以下量化與質性指標:

  • 模型能力基準
    • GenEval / T2I-CompBench:綜合考察文本到影像生成在物體存在、顏色繫結、空間關係等多維度的遵從能力,可對比 SD 各版本與競品的零樣本效能。
    • 人類偏好勝率:社群自發組織的匿名模型對決平台的勝率排名,是衡量美學效果的即時動態指標。
  • 社群活躍度
    • Civitai 模型上傳量與下載量:直接反映 SD 開源生態的創作活力與熱度。
    • GitHub 相關倉庫活躍指數AUTOMATIC1111/stable-diffusion-webuicomfyanonymous/ComfyUIhuggingface/diffusers 等倉庫的 Star 數、Issue 活躍度和 PR 合併頻率。
  • 產業商業化訊號
    • Stability AI 的年經常性營收:這是衡量開源基礎模型公司能否成功商業化的最核心財務指標,需關注其官方或可信媒體報道。
    • 頭部企業整合深度:如 Adobe 對其 Firefly 功能釋出的更新頻率及對其核心使用者群使用資料的揭露。
  • 法律與監管風向
    • 關鍵訴訟的裁決節點:持續關注美國眾多集體訴訟案中的關鍵判決。
    • 各地立法進展:追蹤歐盟《人工智慧法案》的後續補充法案、美國版權局對 AI 生成內容的最新指導意見。

15. 信源

  • Rombach, R., et al. “High-Resolution Image Synthesis with Latent Diffusion Models.” Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2022.
  • Ho, J., Jain, A., & Abbeel, P. “Denoising diffusion probabilistic models.” Advances in Neural Information Processing Systems 33 (NeurIPS 2020).
  • Song, J., Meng, C., & Ermon, S. “Denoising Diffusion Implicit Models.” International Conference on Learning Representations (ICLR), 2021.
  • Stability AI 官方新聞釋出頁面及其 GitHub 組織下的 SD 系列模型卡。
  • Hugging Face 官方網站,Diffusers 庫文件頁面:https://huggingface.co/docs/diffusers
  • Bloomberg Intelligence, “Generative AI to Become a $1.3 Trillion Market by 2032”, June 2023.
  • Straits Research 等第三方機構關於 AI 影像生成市場的摘要分析(注:作為行業口徑參考,具體數值常隨預測更新)。
source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型