DiT
3 秒看懂
一句话定义:DiT(Diffusion Transformer)是一种用 Transformer 架构取代传统 U-Net 作为扩散模型主干网络的新型生成模型,是当前图像/视频生成大模型的主流技术基座。
核心突破:解决了 U-Net 在规模化(scaling)上的瓶颈,通过引入 Transformer 的强大序列建模与扩展性,实现了生成质量与模型规模的同步提升,为 AI 生成内容(AIGC)的产业化落地奠定了模型基础。
3 分钟产业解释
为什么现在大模型画图、做视频都爱用 DiT? 传统扩散模型用的是类似 U-Net 的卷积网络。这就像一个“固定车道”的工厂,能力有上限,想生产更复杂、更精细的“产品”(高质量图片/视频),光把工厂建大(堆叠卷积层)效率不高,而且很难与其他模态(如文字、声音)“接驳”。
DiT 把主干换成了 Transformer,就像把工厂升级成了“标准化智能流水线”。Transformer 是当今大语言模型(如 GPT)的核心,它具有极佳的 可扩展性(Scaling Law)和 上下文理解能力。这意味着:
- 质量可控提升:只要增加 Transformer 的规模(参数、层数),生成效果就能可预测地变好。
- 统一架构:可以用同一个 Transformer 架构去理解和融合文本、图像、视频、3D 等多种信息,是迈向 多模态统一生成 的关键一步。
- 工程优势:Transformer 的并行计算更友好,在先进 AI 芯片(如 GPU/TPU)上训练效率更高。
因此,Sora、Stable Diffusion 3、FLUX 等现象级文生图/视频模型,其核心技术都基于 DiT 或其变体。这不仅是学术创新,更是驱动 AIGC 内容质量飞跃、成本下降,并最终影响影视、游戏、广告等产业的核心生产力引擎。
15 分钟专家深入
DiT 的架构与影响力远不止“换主干”这么简单,其成功揭示了生成模型领域的深刻范式转移。
1. 核心范式转移:从“以卷积为中心”到“以序列建模为中心”
- 传统扩散模型 (基于 U-Net):其核心是 卷积神经网络。它通过下采样-上采样和跳跃连接处理图像特征图。优势是局部特征提取强、计算效率高,但全局依赖关系建模能力弱,且难以处理非网格数据。
- DiT:将图像(或视频帧)划分为一系列 patch,将其 序列化,然后输入标准的 Transformer Encoder。这本质上将生成任务转化为了一个 序列预测 任务,与语言模型的思路对齐。
2. 关键技术细节与机制
- 条件注入机制 (adaLN-Zero):扩散模型需要根据时间步
t和条件(如文本)调整行为。DiT 采用了 自适应层归一化 的一种高效变体。它将时间步和条件信息通过小型 MLP 映射为缩放(scale)和平移(shift)参数,对 Transformer 每一层的输入进行调制。Zero指初始化时将这些调制参数置零,使模型初始化为恒等映射,有利于稳定训练。 - 输入/输出流程:原始图像 -> Patch 化与位置嵌入 -> Transformer 处理 -> 解除 Patch 化得到空间特征图,经卷积/线性层映射为噪声预测 ε。具体实现方式有多种,例如预测噪声、预测 x0 或预测 v。
- 模型容量:DiT 的设计允许通过调整 Transformer 的深度(层数)、宽度(隐藏层维度)和注意力头的数量 来轻松控制模型大小。论文中展示了 DiT-S (小)、DiT-B (基)、DiT-L (大)、DiT-XL (超大) 等不同规模的变体,验证了其 Scaling 特性。
3. 与相关技术的协同
- 与潜在扩散模型 (LDM) 结合:为了降低计算成本,DiT 通常不会直接在像素空间操作,而是与 VAE(变分自编码器)结合。图像先被 VAE 编码器压缩到低维 潜在空间,DiT 在这个空间进行扩散和去噪,最后由 VAE 解码器还原成图像。这是 Stable Diffusion 3 等模型的标准配置。
- 与文本编码器的结合:条件输入(文本)通常由一个强大的预训练文本编码器(如 CLIP、T5)处理成嵌入向量,然后通过交叉注意力机制或更简单的调制方式注入 DiT。DiT 的架构天然适合融合这种序列化的文本嵌入。
技术原理
DiT 的核心是将扩散过程中的去噪网络 U-Net 替换为 Transformer。其机制可以拆解为以下步骤:
输入:噪声潜在表示 z_t (来自 VAE 编码器,经 t 时刻加噪)
条件:文本描述 c (经文本编码器编码)
目标:预测 z_t 中包含的噪声 ε
流程:
1. Patch 化:将 z_t (H' x W' x C) 分割成 N 个 patch,每个 patch 展平为向量。
序列长度 N = (H' / p) * (W' / p),其中 p 为 patch 大小。
2. 线性投影与位置编码:每个 patch 通过线性层投影为 D 维向量,
并加上可学习的位置编码(通常是一维或二维)。
得到输入序列 x ∈ R^{N x D}。
3. 条件调制 (adaLN-Zero):
- 将时间步 t 和文本条件 c 整合后通过小型 MLP 输出一个维度为 (6 × D) 的向量,
这对应于 6 组维度为 D 的向量,分别用作 Transformer 每层中两个 LayerNorm 的 scale、shift 参数,
以及注意力子层和 MLP 子层的门控参数。
- 在 Transformer 每一层的 LayerNorm 之后,用这组参数对特征进行仿射变换:
x' = scale * LayerNorm(x) + shift
- 在注意力/MLP 子层输出后,用门控参数进行残差缩放。
4. Transformer Encoder 处理:一系列标准的 Transformer 块(自注意力、前馈网络)。
5. 输出头:将 Transformer 输出序列映射回 patch 形状,并通过卷积或其他方式重组为空间特征图。
6. 输出头直接预测噪声 ε:解除 Patch 化后的特征图经卷积/线性层映射为与 z_t 同尺寸的噪声预测 ε。
关键参数量级(以 DiT-XL/2 为例,基于公开论文估算):
- 模型参数:约 675M (6.75亿)
- Patch 大小 p=2,潜在空间分辨率 32x32 (对应原图 256x256),序列长度 N=256。
- Transformer 层数:28层
- 隐藏层维度 D:1152
- 注意力头数:16
可扩展性的根源:自注意力机制的计算复杂度是 O(N²),而 N 与输入图像分辨率相关。但通过将图像压缩到潜在空间(LDM)和使用较大的 patch 大小,可以严格控制序列长度 N,使得在主流硬件上训练超大分辨率成为可能。模型的能力主要通过增加深度(层数)和宽度(维度)来扩展。
技术演进史
- 前扩散模型时代 (2015-2020):GAN 和 VAE 主导生成模型,但存在训练不稳定、模式坍塌、多样性-保真度权衡等问题。
- 扩散模型奠基 (2020-2021):Denoising Diffusion Probabilistic Models (DDPM) 提出,展示了扩散模型在图像生成上的卓越潜力,但模型仍是简单的 U-Net 结构,计算成本高。
- 潜在扩散与规模化 (2022):Latent Diffusion Models (LDM) 提出,通过在潜在空间进行扩散大幅降低计算量,为后续大规模应用铺路(如 Stable Diffusion v1)。
- Transformer 介入生成 (2022-2023):Google 提出 Imagen,首次将 Transformer(文本编码器)与扩散模型深度结合,证明了 Transformer 在理解和引导生成上的强大能力,但其图像生成主干仍是 U-Net。
- DiT 诞生与验证 (2023):Facebook (Meta) 研究团队发表论文 《Scalable Diffusion Models with Transformers》,首次提出并系统性验证了用纯 Transformer 替代 U-Net 的可行性,证明了 DiT 在生成质量上的 Scaling Law。这是架构上的关键一跃。
- 产业化与多模态融合 (2023-2024):Stable Diffusion 3 明确采用 DiT 架构(与多模态扩散 Transformer MMDiT 结合),标志着 DiT 成为工业级标准。OpenAI 的 Sora 展示了基于类似架构的 DiT 在视频生成上的惊人能力,将影响扩大到整个 AIGC 行业。
技术路线对比
| 特性 | 传统U-Net (LDM) | DiT | 自回归扩散模型 |
|---|---|---|---|
| 主干网络 | 卷积神经网络 (下/上采样、跳跃连接) | Transformer (序列化处理) | Transformer (逐点生成) |
| 核心优势 | 局部特征高效、细节保留好 | 强可扩展性、全局建模能力强、统一架构 | 理论上能实现任意分辨率生成 |
| 核心劣势 | 全局依赖弱,扩展性受限 | 对超长序列(N大)计算开销大,需潜在空间+Patch优化 | 自回归导致生成速度慢,串行依赖 |
| 条件注入 | 通常用交叉注意力 | adaLN-Zero等调制方式,更直接高效 | 类似语言模型的提示词 |
| 可扩展性 | 较弱,收益递减快 | 极强,遵循Scaling Law | 强,但受限于序列长度 |
| 典型代表 | SD 1.5, SD 2.1 | SD 3, FLUX, Sora (部分机制) | 尚未有主流模型大规模采用 |
| 训练效率 | 高 (卷积高效) | 中 (自注意力计算量大,但架构更统一) | 低 (串行生成) |
结论:DiT 在质量上限和多模态扩展潜力上占据明显优势,是当前头部模型的首选。U-Net 方案在推理速度和特定任务调优上仍有市场。自回归路线在生成逻辑极强的序列化内容(如代码)上更有优势。
上下游
上游(硬件与基础设施):
- 算力:对高性能 AI 训练与推理芯片(GPU/TPU)的需求巨大。DiT 的大规模训练依赖高速互联的算力集群。
- 内存:Transformer 模型参数量大,且在训练中需存储大量中间激活值,对 高带宽内存 (HBM) 容量和带宽要求极高。
- 存储:海量的高质量训练数据(图像-文本对、视频)需要分布式存储系统。
- 网络:分布式训练需要超高速、低延迟的数据中心内部网络。
中游(模型与平台):
- 基础模型厂商:Stability AI (SD3), Black Forest Labs (FLUX), OpenAI (Sora/DALL·E 系列), Adobe, Runway 等。他们构建和训练大型 DiT 基础模型。
- 开源社区:Hugging Face, GitHub 上的开发者进行模型微调、工具开发和生态建设。
- 云服务商:AWS, Azure, GCP 提供算力、模型托管和API服务。
下游(应用与行业):
- 内容创作:广告设计、概念艺术、游戏资产生成、影视预可视化。
- 电子商务:个性化商品图、虚拟试穿。
- 社交与娱乐:个性化头像、短视频特效、虚拟人内容生成。
- 工业设计:产品外观快速原型设计。
- 教育:生成式教学材料。
关键指标
- 生成质量:通常用 FID (Fréchet Inception Distance) 衡量生成图像与真实图像的分布差异,越低越好。DiT 在标准基准上达到了SOTA。
- 可控性:对文本提示的遵循度,常使用 CLIP Score 评估图文匹配度。
- 多样性:生成内容的丰富程度,避免模式坍塌。
- 可扩展性:模型参数、数据量和计算量(FLOPs)与生成质量之间的关系曲线。DiT 的核心论文证明了其具有优秀的 Scaling 特性。
- 推理效率:生成一张图像所需的时间(或迭代步数)、峰值显存占用。这是影响实际部署成本的关键。
- 分辨率:能支持生成的最高图像/视频分辨率。
供需与市场数据
供给侧:
- 模型:开源模型(如 Stable Diffusion 系列)降低了技术门槛,但顶尖模型(如 Sora 级别)仍由头部闭源公司掌握,形成技术壁垒。
- 算力:高端AI芯片(如NVIDIA H100/B200)供不应求,是制约模型迭代和部署的核心瓶颈。[据行业估算,训练一个Sora级别的DiT模型,算力成本可达数千万至数亿美元量级]。
- 数据:高质量、版权清晰的多模态数据集成为稀缺资源。
需求侧:
- 需求爆发:来自游戏、影视、广告、电商等行业对高效、高质量AIGC内容的需求正在指数级增长。
- 市场增长:[据多家行业分析机构报告,全球AIGC市场规模预计将在2025年达到数百亿美元],其中基于DiT的图像/视频生成是最大细分领域之一。
供需矛盾:核心矛盾在于 高端算力供给不足 与 海量生成需求 之间的失衡,这推动了推理优化技术和更高效模型架构的持续创新。
代表公司与资本映射
| 公司 | 角色 | 与DiT关联 | 资本映射逻辑 |
|---|---|---|---|
| NVIDIA | 算力基石 | DiT训练和推理的核心硬件供应商。其GPU和CUDA生态是DiT模型的“土壤”。 | 最直接受益方。算力军备竞赛的“卖铲人”。 |
| Meta (FAIR) | 技术开创者 | DiT原始论文来自Meta,其开源研究奠定了技术基础。 | 掌握核心开源模型与技术人才,提升AI影响力,服务于其社交、VR/AR生态。 |
| Stability AI | 重要推动者 | 将DiT架构引入其王牌产品 Stable Diffusion 3,推动产业化。 | 将前沿研究快速产品化、开源化,构建开发者生态。 |
| OpenAI / Runway | 应用引领者 | 展示了基于类似架构的视频生成(Sora)和创意工具的惊人潜力。 | 开拓高端应用市场,验证技术天花板,引领行业投资方向。 |
| Adobe / 其他垂直软件商 | 应用集成方 | 将DiT能力集成到Photoshop、Premiere等工具中,赋能专业用户。 | 提升现有产品附加值,巩固行业地位,实现软件服务收入增长。 |
投资逻辑
- 算力主线(最确定):无论哪个DiT模型胜出,对高性能AI芯片和算力的需求只增不减。关注 GPU、HBM、先进封装、光互联 等产业链。
- 模型与平台主线(高潜力):投资那些拥有顶尖模型研发能力、强大工程化团队和清晰商业化路径的公司。护城河在于 数据、人才和算力获取能力。
- 应用与生态主线(想象空间大):关注率先将DiT能力垂直整合到工作流、创造新商业模式的公司。例如,在 影视制作、游戏开发、电商营销 领域出现的“杀手级应用”。
- 风险:技术迭代快(可能出现更优架构)、算力成本过高导致商业化困难、版权与伦理监管风险。
常见误读纠偏
误读1:DiT = 用Transformer做扩散模型,所以它和GPT-4是同类技术。 纠偏:这是严重的概念混淆。虽然都用了Transformer,但任务范式完全不同。
- GPT-4 是自回归语言模型:根据前文逐词预测下一个词。
- DiT 是扩散模型:学习从随机噪声中逐步去噪以恢复数据,其核心是迭代去噪,不是自回归生成。Transformer 在其中是作为去噪网络(噪声预测器),而非直接生成序列。它们是处理不同模态、不同问题的不同架构路径。
误读2:DiT 一出,U-Net 就完全过时了。 纠偏:DiT 在质量上限和扩展性上优势明显,是前沿和工业级大规模应用的首选。但 U-Net 在 推理速度、计算效率以及对小数据集/特定任务的微调 上可能仍有优势。许多轻量化、实时性要求高的应用(如移动端)可能仍会使用优化过的U-Net变体。两者将在相当长时间内共存,服务于不同场景。
学习路径
- 入门概念:先理解基础的 扩散模型 (DDPM) 原理和 Transformer 架构。
- 核心论文:精读开创性论文 《Scalable Diffusion Models with Transformers》 (Peebles & Xie, 2023)。
- 关键实践:动手跑通一个基于DiT的开源项目(如 Stable Diffusion 3 的微调或推理代码),理解其输入输出、条件注入等细节。
- 前沿追踪:关注顶会(CVPR, NeurIPS, ICLR)上关于DiT改进、高效计算、多模态扩展的最新论文。
- 产业观察:跟踪头部AI公司(如OpenAI, Stability AI)的技术博客和产品发布,理解技术如何转化为产品。
一句话总结
DiT 通过将 Transformer 的 可扩展性与序列建模能力 植入扩散模型,突破了生成模型的规模瓶颈,成为推动 AIGC 从“可用”到“优质、可控、多模态”产业级应用的核心架构革命。
延伸阅读与来源
- 原始论文:Peebles, W., & Xie, S. (2023). Scalable Diffusion Models with Transformers. arXiv:2212.09748.
- 产业分析:关注 Lillian Weng, Jim Fan 等AI研究者的博客与社交动态,他们常对技术进行深入浅出的解读。
- 技术实现:GitHub 上与
diffusers库相关的DiT实现代码。 - 市场报告:查阅 IDC, Gartner, CB Insights 等机构关于 AIGC 和生成式 AI 的年度报告。[具体数据需查阅最新期报告]。
- 供应链信息:TrendForce, Counterpoint Research 等对 AI 芯片、HBM 市场的分析报告。