文生圖
3 秒看懂
文生圖(Text-to-Image) 是利用深度學習模型,根據自然語言描述自動生成高質量影像的技術。輸入一句“一隻穿著宇航服的柴犬在月球上騎腳踏車”,模型能綜合理解語義、物體屬性、空間關係與視覺風格,輸出一張符合描述的、從未有過的影像。這項技術在創意設計、內容生產、視覺原型等領域正產生範式級影響。
3 分鐘產業解釋
文生圖背後的核心技術範式中,擴散模型(Diffusion Models) 已成為絕對主線,代表性系統包括 Stable Diffusion、DALL·E 系列(2/3)和 Midjourney。其基本思想是:先對真實影像逐步新增噪聲,直到完全變成高斯噪聲;再讓模型學習從噪聲中逐步去噪恢復出影像。推論時,模型接收一段文本提示,經過文本編碼器(如 CLIP 文本編碼器)轉換為條件向量,注入去噪網路(通常是 U‑Net 或 Transformer 架構),指導噪聲被有結構地移除,最終生成語義一致的影像。
產業層面,文生圖正從“玩具”走向生產力工具。其主要落地方向包括:廣告創意、遊戲資產生成、電商商品圖、建築概念視覺化、影視分鏡,以及個人創作輔助。各廠商正在解決生成速度(通過蒸餾、一步生成)、可控性(ControlNet 等空間條件控制)、多模態一致性(文字渲染、跨模態編輯)以及版權與安全等問題。生成影像的商業使用權、毒害輸出過濾、訓練資料授權,也成為貫穿技術落地的重要非技術議題。
15 分鐘專家深入
在專家視角,文生圖涉及多個子系統的精密整合:大規模多模態對比預訓練(CLIP, BLIP)、文本條件驅動的擴散生成主網路、噪聲排程策略、無分類器引導(CFG)以及高解析度級聯超分。訓練管線的每一步都有複雜的工程與演算法權衡。
文本理解與表示:早期採用 LSTM 等文本編碼器,現在主流採用基於對比學習的大規模圖文預訓練模型(如 CLIP、OpenCLIP 或 T5)。CLIP 的文本編碼器(通常是一個 Transformer)輸出的歸一化嵌入被饋入擴散模型的交叉注意力層,作為生成過程的語義錨點。優點是能夠理解開放域概念組合;缺點是對空間關係、計數、屬性繫結的精確度有限,因此後續又出現了引入大語言模型(如 T5‑XXL)或使用視覺語言模型重描述來提升語義精度的工作(DALL·E 3 流水線中的 caption upsampling)。
擴散與去噪骨幹:最初的 DDPM 採用 U‑Net 作為去噪網路,通過跳躍連線保留細節,同時嵌入時間步和文本條件。最新進展中,DiT(Diffusion Transformers,如 OpenAI Sora 的影像/影片模型)直接用 ViT‑style Transformer 替代卷積 U‑Net,以更好地適應大規模、多模態條件。擴散過程的噪聲排程(線性、餘弦、連續時間)直接影響取樣效率與影像質量;推論時使用 DDIM、DPM‑Solver 等確定性或高階取樣器,可將取樣步數從 1000 步壓縮至 20‑50 步,而質量損失可控。
規模化與生成速度:文生圖模型引數量通常從數億到數十億級。SDXL 約 2.6B 引數,U‑Net 部分佔主要比重;DALL·E 3 的總引數量[未充分揭露]。推論速度一直是部署瓶頸,為此業界探索稀疏/量化壓縮、潛空間擴散(Stable Diffusion 在壓縮的 VAE 潛空間做擴散,比畫素級快一個數量級以上),還有擴散蒸餾和一致性模型,能實現 1‑4 步生成,使即時互動成為可能。
評估與指標:區別於任務明確的分類,文生圖的評估複雜且尚在演進。常用指標包括 FID(較低更好)衡量生成影像分佈與真實影像分佈的距離;CLIP Score 衡量圖文對齊程度;PickScore、ImageReward 等利用人類偏好資料訓練的評分模型更接近人類審美;人工評測仍被頂級模型釋出所倚重。此外,精確的可控生成評測(如空間關係、計數、文本渲染)正成為新的研究基準(例如 GenAI‑Bench、T2I‑CompBench)。
技術原理(最深,講機制+關鍵引數)
1. 潛空間擴散機制(以 Stable Diffusion 為例)
文生圖常用 潛擴散模型(Latent Diffusion) 以降低計算需求:
- VAE 壓縮:先訓練一個 VAE(或 VQ‑GAN),將輸入的 RGB 影像
x壓縮到低維潛空間z = \mathcal{E}(x),壓縮比通常在4\times到8\times空間維度。 - 前向擴散:在潛空間對
z按照噪聲排程\beta_t逐步新增噪聲:
z_t = \sqrt{\bar\alpha_t} \, z_0 + \sqrt{1-\bar\alpha_t} \, \epsilon, \quad \epsilon \sim \mathcal{N}(0, I)
其中 \bar\alpha_t = \prod_{s=1}^{t} (1-\beta_s) 控制訊雜比。
- 去噪網路:訓練一個條件 U‑Net 或 Transformer
\epsilon_\theta(z_t, t, c)來預測所新增的噪聲\epsilon,其中c為文本條件嵌入。損失函式:
\mathcal{L} = \mathbb{E}_{z_0, \epsilon, t, c} \left[ \| \epsilon - \epsilon_\theta(z_t, t, c) \|_2^2 \right]
- 推論(取樣):從純噪聲
z_T \sim \mathcal{N}(0,I)出發,利用訓練好的\epsilon_\theta和如 DDIM 取樣器迭代去噪:
z_{t-1} = \sqrt{\bar\alpha_{t-1}} \left( \frac{z_t - \sqrt{1-\bar\alpha_t} \,\epsilon_\theta}{\sqrt{\bar\alpha_t}} \right) + \sigma_t \epsilon_t
最終通過 VAE 解碼器 \mathcal{D} 恢復影像 x_0' = \mathcal{D}(z_0)。
文本提示: “a cat wearing sunglasses”
│
CLIP 文本編碼器
│
┌────▼────┐ 噪聲 ε 去噪步驟 t=1000→0
│條件嵌入 c│─────────────┐ ┌────────────────┐
└─────────┘ ▼ ▼ ▼
┌──────────────────── U‑Net / DiT ────────────┐
│ 輸入: z_t, t, c → 預測 ε_θ │
│ 輸出: 去噪一步後的 z_{t-1} │
└──────────────────────┬───────────────────────┘
▼
VAE 解碼器 → 影像
2. 關鍵引數與結構(定性)
- 文本編碼器:CLIP ViT‑L/14 文本編碼器(如 SD 1.x/2.x)輸出 77×768 嵌入,經過交叉注意力注入 U‑Net。SDXL 使用雙 CLIP 文本編碼器(OpenCLIP ViT‑bigG + CLIP ViT‑L)以增強語義理解。DALL·E 3 則利用 T5‑XXL 等更大語言模型。
- 潛空間維度:例如 Stable Diffusion 1.x/2.x 潛通道數 4,下采樣 8×,對於 512×512 影像潛空間為 64×64×4;SDXL 使用類似的壓縮比。這樣的設計使 U‑Net 的計算量相比畫素級擴散降低約 64 倍。
- 無分類器引導(CFG):推論時,同時計算有條件預測
\epsilon_\theta(z_t, c)和無條件預測\epsilon_\theta(z_t, \varnothing),以插值結果生成:
\tilde\epsilon_\theta = (1 + w)\,\epsilon_\theta(z_t, c) - w\,\epsilon_\theta(z_t, \varnothing)
CFG 權重 w 通常取 5‑15,平衡保真度與多樣性。過高的 w 會引起過飽和和偽影。
3. 級聯超解析度
基礎擴散模型往往生成低解析度影像(如 128×128 或 512×512),後續通過一個或多個條件擴散超分模型逐步提升到 1024×1024 或更高。超分模型也以文本為條件,並結合低解析度影像作為輔助輸入,保持與原圖的語義一致性。
技術演進史
- 2015–2017,早期探索:GAN 條件影像生成(如 StackGAN、AttnGAN)可將文本描述轉為低解析度影像,但物體變形嚴重,組合泛化差。
- 2021,DALL·E 與 VQGAN+CLIP:OpenAI 的 DALL·E(1) 使用 VQ‑VAE 加自迴歸 Transformer 生成離散 tokens,展示出初步概念組合。同期 VQGAN+CLIP 開源方案使得引導式最佳化成為社群熱點。
- 2022,擴散模型爆發:GLIDE 驗證擴散模型文本條件生成的質量優勢;DALL·E 2 公開,使用 CLIP 潛空間和擴散先驗,將文本轉化為影像嵌入再生成畫素;Stable Diffusion 釋出開源潛擴散模型,迅速成為生態基石;Midjourney 基於擴散模型迭代美學品質。
- 2023,可控與規模化: ControlNet、T2I‑Adapter 等即插即用模組實現對姿態、深度、邊緣等的精確控制;SDXL 提升基礎解析度和概念組合能力;DALL·E 3 通過大規模重描述提升指令遵從度;LCM(潛在一致性模型)與 SD Turbo 實現少步生成。
- 2024–至今,架構融合與即時生成:DiT 架構擴散模型(如 SD3 使用 MMDiT)開始商用,結合 Flow Matching 技術;生成速度推向即時;多物件精確控制、文字渲染能力顯著增強;文生圖與影片生成的基礎設施逐漸統一。
技術路線對比(量化表)
| 維度 | 潛擴散 (Stable Diffusion/SDXL) | 畫素級擴散 (Imagen/DALL·E 2早期) | 自迴歸 Transformer (DALL·E 1, Parti) | 基於 DiT 的擴散 (SD3, Sora) |
|---|---|---|---|---|
| 生成空間 | VAE 潛空間(4×64×64 典型) | RGB 畫素空間 (512×512×3) | 離散影像 token 序列 | 潛空間 + Transformer |
| 文本編碼 | CLIP/T5 文本嵌入 | T5‑XXL 等 | 文本 token 序列 + 交叉注意力 | 凍結 LLM / CLIP 等 |
| 骨幹架構 | U‑Net | U‑Net 基礎 | 僅解碼器 Transformer | DiT(Transformer+調變) |
| 最大常見解析度(訓練) | 1024×1024(SDXL) | 1024×1024(Imagen) | 256×256 或 512×512 token 長度 | 1024×1024 以上 |
| 推論速度(相對) | 快(潛空間、少步取樣器) | 較慢(畫素級迭代) | 自迴歸很慢 | 快,可少步到1‑4步 |
| 可控性 | 通過 ControlNet/IP‑Adapter 等生態極強 | 較少開放生態 | 可控工具較少 | 發展初期,社群快速跟進 |
| 主要代表 | Stability AI、社群 | Google(Imagen) | Google(Parti) | Stability AI(SD3)、OpenAI(Sora) |
注:上述引數為基於公開模型的一般特徵,非精確硬體規格,未包含具體數字則因跨版本差異大或未充分揭露。
上下游
- 上游基礎資源:
- 訓練資料:億至十億級圖文對,來源於 LAION、公共網頁爬取、授權圖片庫等。資料質量、多樣性與隱私合規是關鍵瓶頸。
- 計算基礎設施:大規模 GPU/TPU 叢集訓練;推論端需要高效能 GPU(消費級或雲端端),以支援低延遲生成。
- 預訓練元件:CLIP、T5 等文本編碼器,VQ‑VAE/VAE 影像壓縮器,通常獨立預訓練後複用。
- 中游模型與工具:
- 基礎模型提供商:OpenAI, Stability AI, Midjourney, Google, Meta。
- 社群工具與微調架構:Hugging Face Diffusers, ComfyUI(視覺化工作流), Automatic1111(WebUI), LoRA/ControlNet 介面卡,模型量化與推論加速庫。
- 下游應用與平台:
- 內容生成與編輯工具:Adobe Firefly(整合文生圖), Canva, Figma 外掛。
- 垂直領域:遊戲資產生成(Promethean AI),建築視覺化,服裝圖案設計,電商產品圖生成。
- 服務化 API:OpenAI API(DALL·E), Stability AI API, Midjourney 訂閱制,各雲端廠商 MaaS 平台。
關鍵指標
- 影像質量:
- FID(Fréchet Inception Distance):衡量生成集與參考集在 Inception 特徵空間的分佈距離,越低越好。Stable Diffusion 2.1 在 COCO 上的 FID 約 8.59(SDXL 進一步最佳化),但該指標受參考集和預處理影響大。
- CLIP Score / CLIP Score‑VQA:生成影像與文本的配對 CLIP 相似度,數值越高語義對齊越強。
- 人類偏好評分:ImageReward、PickScore,反映美學、連貫性等更高階維度。
- 可控性與忠實度:
- T2I‑CompBench 評分:考察屬性繫結、空間關係、非空間關係、計數等組合能力的基準。
- 顏色/紋理一致性:顏色直方圖相似度、SSIM 等輔助指標。
- 生成效率:
- 單張生成延遲:在一張參考 GPU(如 A100 或消費級 4090)上的推論耗時,少步模型可 <1 秒。
- 吞吐量:批次生成時每秒可產出影像數。
- 引數量與模型大小:決定視訊記憶體佔用,影響部署成本。
供需與市場資料
(具體市場資料因無法聯網檢索,此處給出基於行業趨勢的定性描述,均屬估算。)
- 需求側:創意設計、廣告、遊戲、電商領域對影像內容的需求持續高速增長。個人使用者與中小團隊使用 Midjourney、Stable Diffusion 多出於成本與迭代速度優勢。專業領域(如品牌視覺)要求更高的可控性與版權安全。
- 供給側:基礎模型不再稀缺,開源生態(Stable Diffusion 家族、Flux 等)使廣大開發者可二次開發;閉源通過 API 提供服務。關鍵稀缺資源轉向高質量、清洗標註且合規的訓練圖文對,以及在特定垂直場景(如端側部署)的高效推論方案。
- 市場規模估算:綜合多家諮詢機構預測,AI 影像生成市場 2023 年約在數十億美元量級,年複合增長率約 30% 以上(依據多個行業報告預測,具體數值因口徑差異較大)。但其直接貨幣化路徑尚處早期,主要營收來自訂閱、API 呼叫費、算力租賃與增值服務。
代表公司與資本對映
| 公司/組織 | 關鍵產品/模型 | 核心能力 | 資本特點 |
|---|---|---|---|
| OpenAI | DALL·E 2/3,整合 ChatGPT | 語義理解最強,重描述提升指令遵從 | 頭部閉源,通過 API 和訂閱變現 |
| Stability AI | Stable Diffusion系列(SDXL,SD3) | 開源生態,社群龐大,介面卡豐富 | 獲得過億元融資,商業模式仍在探索 |
| Midjourney | Midjourney V6/V6.1 | 極致美學質量,自監督資料清洗 | 獨立盈利,訂閱制,未公開融資 |
| Google(DeepMind) | Imagen, Muse | 大規模擴散/自迴歸,集成於 Vertex AI | 科技巨頭,算力與資料資源充沛 |
| Adobe | Firefly 影像生成系列 | 與創意工具深度整合,商業版權清晰 | 上市公司,以訂閱制融入既有產品線 |
| Meta | Emu, Imagine | 社交媒體影像生成 | 大廠內部,賦能旗下產品(如Instagram) |
| [部分公司估值與融資資料未充分揭露或此處略去] |
投資邏輯
- 平台型工具機會:文生圖是通往通用影像/影片生成的基礎設施,能掌握從底模到可控生成全棧、並建立開發者生態的公司,具備長期平台價值。
- 垂直場景深耕:單一基礎模型難滿足特定領域(如電商、建築、醫學)對精確性、合規性的要求;針對垂直域微調並提供完整工作流的創業公司,可能捕獲高附加值獲利。
- 算力與資料提供商:文生圖訓練需要海量 GPU 算力和合規圖文對,算力雲端、高質量資料授權和清洗服務存在中期機遇。
- 風險點:
- 技術快速迭代可能使專用模型喪失差異化;
- 版權與監管不確定性(生成內容權屬、訓練資料來源);
- 開源模型壓低 API 定價天花板;
- 使用者留存和粘性考驗。
常見誤讀糾偏(≥2)
-
“文生圖就是拿拼接庫裡的圖片” 糾正:擴散模型並不是從資料庫中剪下和融合現有影像。它通過學習影像與噪聲之間的對映,在噪聲空間進行有條件的機率取樣,最終解碼出全新畫素構成。相同提示每次生成結果也不同,證明了其生成性。但模型確實會反映訓練資料分佈中的共現模式,可能產生與知名作品風格類似但非直接複製的影像。
-
“引數量越大越好,影像質量一定越高” 糾正:引數規模提升有助於捕獲更豐富的概念和細節,但架構設計、資料質量、噪聲排程和取樣器選擇同等重要。例如早期 Google Imagen 畫素級擴散引數巨大,而 Stable Diffusion 使用潛空間擴散,引數較小但效率極高。模型蒸餾、架構改進(如引入 Transformer)同樣可以在較少引數下達到 SOTA 效能。簡單追求引數量而忽略訓練資料和演算法創新,並非高質量生成的充分條件。
學習路徑
- 入門:
- 理解擴散模型直覺:閱讀“Diffusion Models: A Comprehensive Survey”或 Lilian Weng 部落格“What are Diffusion Models?”。
- 體驗工具:使用 Midjourney、Stable Diffusion WebUI 或 DALL·E 直觀理解輸入輸出關係。
- 動手實踐:
- 執行 Hugging Face Diffusers 示例 notebook,訓練一個簡單條件擴散模型(如 CIFAR‑10 文本到影像微縮版);嘗試用 LoRA 微調 SD 模型。
- 學習提示詞工程與 ControlNet,理解文本嵌入與空間條件注入。
- 深入理論:
- 研究 DDPM/DDIM/Score‑based SDE 理論、潛擴散論文(Latent Diffusion Models)、DiT 與一致性模型。
- 閱讀 CLIP、T5 等多模態表徵成果;掌握 VAE 變分推斷基礎。
- 系統與部署:
- 瞭解模型量化(GGML, ONNX)與推論加速(TensorRT, OneFlow),部署於雲端或邊緣裝置。
- 關注模型安全與過濾機制;學習法律和倫理問題(版權、偏見)。
一句話總結
文生圖以擴散模型為核心動力,通過對多模態語義的深層理解與隨機去噪過程的精巧控制,正在從創意輔助進化為數字內容生產的基礎能力。
延伸閱讀與來源
- 核心論文:
- Rombach et al. “High-Resolution Image Synthesis with Latent Diffusion Models” (Stable Diffusion 基礎)
- Ho et al. “Denoising Diffusion Probabilistic Models”
- Peebles & Xie “Scalable Diffusion Models with Transformers” (DiT)
- Saharia et al. “Imagen: Photorealistic Text-to-Image Diffusion Models”
- 經典部落格與綜述:
- Lilian Weng, “What are Diffusion Models?” (lilianweng.github.io)
- Hugging Face Diffusers 官方文件
- 基準與評測:
- T2I-CompBench, GenAI-Bench, PartiPrompts
- 行業報告:
- 各諮詢機構 AI 生成影像市場展望(資料口徑差異大,參考時需交叉驗證)
- 注:以上技術內容基於截至 2025 年初已公開的論文、模型釋出及社群知識,未包含未公開的企業內部細節。所有涉及的具體數量級均為基於公開資訊的估算或定性描述。