DiT
3 秒看懂
一句話定義:DiT(Diffusion Transformer)是一種用 Transformer 架構取代傳統 U-Net 作為擴散模型主幹網路的新型生成模型,是當前影像/影片生成大型模型的主流技術基座。
核心突破:解決了 U-Net 在規模化(scaling)上的瓶頸,通過引入 Transformer 的強大序列建模與擴充套件性,實現了生成質量與模型規模的同步提升,為 AI 生成內容(AIGC)的產業化落地奠定了模型基礎。
3 分鐘產業解釋
為什麼現在大型模型畫圖、做影片都愛用 DiT? 傳統擴散模型用的是類似 U-Net 的卷積網路。這就像一個“固定車道”的工廠,能力有上限,想生產更復雜、更精細的“產品”(高質量圖片/影片),光把工廠建大(堆疊卷積層)效率不高,而且很難與其他模態(如文字、聲音)“接駁”。
DiT 把主幹換成了 Transformer,就像把工廠升級成了“標準化智慧流水線”。Transformer 是當今大語言模型(如 GPT)的核心,它具有極佳的 可擴充套件性(Scaling Law)和 上下文理解能力。這意味著:
- 質量可控提升:只要增加 Transformer 的規模(引數、層數),生成效果就能可預測地變好。
- 統一架構:可以用同一個 Transformer 架構去理解和融合文本、影像、影片、3D 等多種資訊,是邁向 多模態統一生成 的關鍵一步。
- 工程優勢:Transformer 的平行計算更友好,在先進 AI 晶片(如 GPU/TPU)上訓練效率更高。
因此,Sora、Stable Diffusion 3、FLUX 等現象級文生圖/影片模型,其核心技術都基於 DiT 或其變體。這不僅是學術創新,更是驅動 AIGC 內容質量飛躍、成本下降,並最終影響影視、遊戲、廣告等產業的核心生產力引擎。
15 分鐘專家深入
DiT 的架構與影響力遠不止“換主幹”這麼簡單,其成功揭示了生成模型領域的深刻範式轉移。
1. 核心範式轉移:從“以卷積為中心”到“以序列建模為中心”
- 傳統擴散模型 (基於 U-Net):其核心是 卷積神經網路。它通過下采樣-上取樣和跳躍連線處理影像特徵圖。優勢是區域性特徵提取強、計算效率高,但全域性依賴關係建模能力弱,且難以處理非網格資料。
- DiT:將影像(或影片幀)劃分為一系列 patch,將其 序列化,然後輸入標準的 Transformer Encoder。這本質上將生成任務轉化為了一個 序列預測 任務,與語言模型的思路對齊。
2. 關鍵技術細節與機制
- 條件注入機制 (adaLN-Zero):擴散模型需要根據時間步
t和條件(如文本)調整行為。DiT 採用了 自適應層歸一化 的一種高效變體。它將時間步和條件資訊通過小型 MLP 對映為縮放(scale)和平移(shift)引數,對 Transformer 每一層的輸入進行調變。Zero指初始化時將這些調變引數置零,使模型初始化為恆等對映,有利於穩定訓練。 - 輸入/輸出流程:原始影像 -> Patch 化與位置嵌入 -> Transformer 處理 -> 解除 Patch 化得到空間特徵圖,經卷積/線性層對映為噪聲預測 ε。具體實現方式有多種,例如預測噪聲、預測 x0 或預測 v。
- 模型容量:DiT 的設計允許通過調整 Transformer 的深度(層數)、寬度(隱藏層維度)和注意力頭的數量 來輕鬆控制模型大小。論文中展示了 DiT-S (小)、DiT-B (基)、DiT-L (大)、DiT-XL (超大) 等不同規模的變體,驗證了其 Scaling 特性。
3. 與相關技術的協同
- 與潛在擴散模型 (LDM) 結合:為了降低計算成本,DiT 通常不會直接在畫素空間操作,而是與 VAE(變分自編碼器)結合。影像先被 VAE 編碼器壓縮到低維 潛在空間,DiT 在這個空間進行擴散和去噪,最後由 VAE 解碼器還原成影像。這是 Stable Diffusion 3 等模型的標準配置。
- 與文本編碼器的結合:條件輸入(文本)通常由一個強大的預訓練文本編碼器(如 CLIP、T5)處理成嵌入向量,然後通過交叉注意力機制或更簡單的調變方式注入 DiT。DiT 的架構天然適合融合這種序列化的文本嵌入。
技術原理
DiT 的核心是將擴散過程中的去噪網路 U-Net 替換為 Transformer。其機制可以拆解為以下步驟:
輸入:噪聲潛在表示 z_t (來自 VAE 編碼器,經 t 時刻加噪)
條件:文本描述 c (經文本編碼器編碼)
目標:預測 z_t 中包含的噪聲 ε
流程:
1. Patch 化:將 z_t (H' x W' x C) 分割成 N 個 patch,每個 patch 展平為向量。
序列長度 N = (H' / p) * (W' / p),其中 p 為 patch 大小。
2. 線性投影與位置編碼:每個 patch 通過線性層投影為 D 維向量,
並加上可學習的位置編碼(通常是一維或二維)。
得到輸入序列 x ∈ R^{N x D}。
3. 條件調變 (adaLN-Zero):
- 將時間步 t 和文本條件 c 整合後通過小型 MLP 輸出一個維度為 (6 × D) 的向量,
這對應於 6 組維度為 D 的向量,分別用作 Transformer 每層中兩個 LayerNorm 的 scale、shift 引數,
以及注意力子層和 MLP 子層的門控引數。
- 在 Transformer 每一層的 LayerNorm 之後,用這組引數對特徵進行仿射變換:
x' = scale * LayerNorm(x) + shift
- 在注意力/MLP 子層輸出後,用門控引數進行殘差縮放。
4. Transformer Encoder 處理:一系列標準的 Transformer 塊(自注意力、前饋網路)。
5. 輸出頭:將 Transformer 輸出序列映射回 patch 形狀,並通過卷積或其他方式重組為空間特徵圖。
6. 輸出頭直接預測噪聲 ε:解除 Patch 化後的特徵圖經卷積/線性層對映為與 z_t 同尺寸的噪聲預測 ε。
關鍵引數量級(以 DiT-XL/2 為例,基於公開論文估算):
- 模型引數:約 675M (6.75億)
- Patch 大小 p=2,潛在空間解析度 32x32 (對應原圖 256x256),序列長度 N=256。
- Transformer 層數:28層
- 隱藏層維度 D:1152
- 注意力頭數:16
可擴充套件性的根源:自注意力機制的計算複雜度是 O(N²),而 N 與輸入影像解析度相關。但通過將影像壓縮到潛在空間(LDM)和使用較大的 patch 大小,可以嚴格控制序列長度 N,使得在主流硬體上訓練超大解析度成為可能。模型的能力主要通過增加深度(層數)和寬度(維度)來擴充套件。
技術演進史
- 前擴散模型時代 (2015-2020):GAN 和 VAE 主導生成模型,但存在訓練不穩定、模式坍塌、多樣性-保真度權衡等問題。
- 擴散模型奠基 (2020-2021):Denoising Diffusion Probabilistic Models (DDPM) 提出,展示了擴散模型在影像生成上的卓越潛力,但模型仍是簡單的 U-Net 結構,計算成本高。
- 潛在擴散與規模化 (2022):Latent Diffusion Models (LDM) 提出,通過在潛在空間進行擴散大幅降低計算量,為後續大規模應用鋪路(如 Stable Diffusion v1)。
- Transformer 介入生成 (2022-2023):Google 提出 Imagen,首次將 Transformer(文本編碼器)與擴散模型深度結合,證明了 Transformer 在理解和引導生成上的強大能力,但其影像生成主幹仍是 U-Net。
- DiT 誕生與驗證 (2023):Facebook (Meta) 研究團隊發表論文 《Scalable Diffusion Models with Transformers》,首次提出並系統性驗證了用純 Transformer 替代 U-Net 的可行性,證明了 DiT 在生成質量上的 Scaling Law。這是架構上的關鍵一躍。
- 產業化與多模態融合 (2023-2024):Stable Diffusion 3 明確採用 DiT 架構(與多模態擴散 Transformer MMDiT 結合),標誌著 DiT 成為工業級標準。OpenAI 的 Sora 展示了基於類似架構的 DiT 在影片生成上的驚人能力,將影響擴大到整個 AIGC 行業。
技術路線對比
| 特性 | 傳統U-Net (LDM) | DiT | 自迴歸擴散模型 |
|---|---|---|---|
| 主幹網路 | 卷積神經網路 (下/上取樣、跳躍連線) | Transformer (序列化處理) | Transformer (逐點生成) |
| 核心優勢 | 區域性特徵高效、細節保留好 | 強可擴充套件性、全域性建模能力強、統一架構 | 理論上能實現任意解析度生成 |
| 核心劣勢 | 全域性依賴弱,擴充套件性受限 | 對超長序列(N大)計算開銷大,需潛在空間+Patch最佳化 | 自迴歸導致生成速度慢,序列依賴 |
| 條件注入 | 通常用交叉注意力 | adaLN-Zero等調變方式,更直接高效 | 類似語言模型的提示詞 |
| 可擴充套件性 | 較弱,收益遞減快 | 極強,遵循Scaling Law | 強,但受限於序列長度 |
| 典型代表 | SD 1.5, SD 2.1 | SD 3, FLUX, Sora (部分機制) | 尚未有主流模型大規模採用 |
| 訓練效率 | 高 (卷積高效) | 中 (自注意力計算量大,但架構更統一) | 低 (序列生成) |
結論:DiT 在質量上限和多模態擴充套件潛力上佔據明顯優勢,是當前頭部模型的首選。U-Net 方案在推論速度和特定任務調優上仍有市場。自迴歸路線在生成邏輯極強的序列化內容(如程式碼)上更有優勢。
上下游
上游(硬體與基礎設施):
- 算力:對高效能 AI 訓練與推論晶片(GPU/TPU)的需求巨大。DiT 的大規模訓練依賴高速互聯的算力叢集。
- 記憶體:Transformer 模型引數量大,且在訓練中需儲存大量中間啟用值,對 高頻寬記憶體 (HBM) 容量和頻寬要求極高。
- 儲存:海量的高質量訓練資料(影像-文本對、影片)需要分散式儲存系統。
- 網路:分散式訓練需要超高速、低延遲的資料中心內部網路。
中游(模型與平台):
- 基礎模型廠商:Stability AI (SD3), Black Forest Labs (FLUX), OpenAI (Sora/DALL·E 系列), Adobe, Runway 等。他們建置和訓練大型 DiT 基礎模型。
- 開源社群:Hugging Face, GitHub 上的開發者進行模型微調、工具開發和生態建設。
- 雲端服務商:AWS, Azure, GCP 提供算力、模型託管和API服務。
下游(應用與行業):
- 內容創作:廣告設計、概念藝術、遊戲資產生成、影視預視覺化。
- 電子商務:個性化商品圖、虛擬試穿。
- 社交與娛樂:個性化頭像、短影片特效、虛擬人內容生成。
- 工業設計:產品外觀快速原型設計。
- 教育:生成式教學材料。
關鍵指標
- 生成質量:通常用 FID (Fréchet Inception Distance) 衡量生成影像與真實影像的分佈差異,越低越好。DiT 在標準基準上達到了SOTA。
- 可控性:對文本提示的遵循度,常使用 CLIP Score 評估圖文匹配度。
- 多樣性:生成內容的豐富程度,避免模式坍塌。
- 可擴充套件性:模型引數、資料量和計算量(FLOPs)與生成質量之間的關係曲線。DiT 的核心論文證明了其具有優秀的 Scaling 特性。
- 推論效率:生成一張影像所需的時間(或迭代步數)、峰值視訊記憶體佔用。這是影響實際部署成本的關鍵。
- 解析度:能支援生成的最高影像/影片解析度。
供需與市場資料
供給側:
- 模型:開源模型(如 Stable Diffusion 系列)降低了技術門檻,但頂尖模型(如 Sora 級別)仍由頭部閉源公司掌握,形成技術壁壘。
- 算力:高階AI晶片(如NVIDIA H100/B200)供不應求,是制約模型迭代和部署的核心瓶頸。[據行業估算,訓練一個Sora級別的DiT模型,算力成本可達數千萬至數億美元量級]。
- 資料:高質量、版權清晰的多模態資料整合為稀缺資源。
需求側:
- 需求爆發:來自遊戲、影視、廣告、電商等行業對高效、高質量AIGC內容的需求正在指數級增長。
- 市場增長:[據多家行業分析機構報告,全球AIGC市場規模預計將在2025年達到數百億美元],其中基於DiT的影像/影片生成是最大細分領域之一。
供需矛盾:核心矛盾在於 高階算力供給不足 與 海量生成需求 之間的失衡,這推動了推論最佳化技術和更高效模型架構的持續創新。
代表公司與資本對映
| 公司 | 角色 | 與DiT關聯 | 資本對映邏輯 |
|---|---|---|---|
| NVIDIA | 算力基石 | DiT訓練和推論的核心硬體供應商。其GPU和CUDA生態是DiT模型的“土壤”。 | 最直接受益方。算力軍備競賽的“賣鏟人”。 |
| Meta (FAIR) | 技術開創者 | DiT原始論文來自Meta,其開源研究奠定了技術基礎。 | 掌握核心開源模型與技術人才,提升AI影響力,服務於其社交、VR/AR生態。 |
| Stability AI | 重要推動者 | 將DiT架構引入其王牌產品 Stable Diffusion 3,推動產業化。 | 將前沿研究快速產品化、開源化,建置開發者生態。 |
| OpenAI / Runway | 應用引領者 | 展示了基於類似架構的影片生成(Sora)和創意工具的驚人潛力。 | 開拓高階應用市場,驗證技術天花板,引領行業投資方向。 |
| Adobe / 其他垂直軟體商 | 應用整合方 | 將DiT能力整合到Photoshop、Premiere等工具中,賦能專業使用者。 | 提升現有產品附加值,鞏固行業地位,實現軟體服務營收增長。 |
投資邏輯
- 算力主線(最確定):無論哪個DiT模型勝出,對高效能AI晶片和算力的需求只增不減。關注 GPU、HBM、先進封裝、光互聯 等產業鏈。
- 模型與平台主線(高潛力):投資那些擁有頂尖模型研發能力、強大工程化團隊和清晰商業化路徑的公司。護城河在於 資料、人才和算力獲取能力。
- 應用與生態主線(想像空間大):關注率先將DiT能力垂直整合到工作流、創造新商業模式的公司。例如,在 影視製作、遊戲開發、電商營銷 領域出現的“殺手級應用”。
- 風險:技術迭代快(可能出現更優架構)、算力成本過高導致商業化困難、版權與倫理監管風險。
常見誤讀糾偏
誤讀1:DiT = 用Transformer做擴散模型,所以它和GPT-4是同類技術。 糾偏:這是嚴重的概念混淆。雖然都用了Transformer,但任務範式完全不同。
- GPT-4 是自迴歸語言模型:根據前文逐詞預測下一個詞。
- DiT 是擴散模型:學習從隨機噪聲中逐步去噪以恢復資料,其核心是迭代去噪,不是自迴歸生成。Transformer 在其中是作為去噪網路(噪聲預測器),而非直接生成序列。它們是處理不同模態、不同問題的不同架構路徑。
誤讀2:DiT 一齣,U-Net 就完全過時了。 糾偏:DiT 在質量上限和擴充套件性上優勢明顯,是前沿和工業級大規模應用的首選。但 U-Net 在 推論速度、計算效率以及對小資料集/特定任務的微調 上可能仍有優勢。許多輕量化、即時性要求高的應用(如行動端)可能仍會使用最佳化過的U-Net變體。兩者將在相當長時間內共存,服務於不同場景。
學習路徑
- 入門概念:先理解基礎的 擴散模型 (DDPM) 原理和 Transformer 架構。
- 核心論文:精讀開創性論文 《Scalable Diffusion Models with Transformers》 (Peebles & Xie, 2023)。
- 關鍵實踐:動手跑通一個基於DiT的開源專案(如 Stable Diffusion 3 的微調或推論程式碼),理解其輸入輸出、條件注入等細節。
- 前沿追蹤:關注頂會(CVPR, NeurIPS, ICLR)上關於DiT改進、高效計算、多模態擴充套件的最新論文。
- 產業觀察:追蹤頭部AI公司(如OpenAI, Stability AI)的技術部落格和產品釋出,理解技術如何轉化為產品。
一句話總結
DiT 通過將 Transformer 的 可擴充套件性與序列建模能力 植入擴散模型,突破了生成模型的規模瓶頸,成為推動 AIGC 從“可用”到“優質、可控、多模態”產業級應用的核心架構革命。
延伸閱讀與來源
- 原始論文:Peebles, W., & Xie, S. (2023). Scalable Diffusion Models with Transformers. arXiv:2212.09748.
- 產業分析:關注 Lillian Weng, Jim Fan 等AI研究者的部落格與社交動態,他們常對技術進行深入淺出的解讀。
- 技術實現:GitHub 上與
diffusers庫相關的DiT實現程式碼。 - 市場報告:查閱 IDC, Gartner, CB Insights 等機構關於 AIGC 和生成式 AI 的年度報告。[具體資料需查閱最新期報告]。
- 供應鏈資訊:TrendForce, Counterpoint Research 等對 AI 晶片、HBM 市場的分析報告。