模型层 开放阅读

DiT

Diffusion Transformer

概念 ID
diffusion-transformer
更新时间
2026-05-29
来源数量
待补

DiT

3 秒看懂

一句话定义:DiT(Diffusion Transformer)是一种用 Transformer 架构取代传统 U-Net 作为扩散模型主干网络的新型生成模型,是当前图像/视频生成大模型的主流技术基座。

核心突破:解决了 U-Net 在规模化(scaling)上的瓶颈,通过引入 Transformer 的强大序列建模与扩展性,实现了生成质量与模型规模的同步提升,为 AI 生成内容(AIGC)的产业化落地奠定了模型基础。

3 分钟产业解释

为什么现在大模型画图、做视频都爱用 DiT? 传统扩散模型用的是类似 U-Net 的卷积网络。这就像一个“固定车道”的工厂,能力有上限,想生产更复杂、更精细的“产品”(高质量图片/视频),光把工厂建大(堆叠卷积层)效率不高,而且很难与其他模态(如文字、声音)“接驳”。

DiT 把主干换成了 Transformer,就像把工厂升级成了“标准化智能流水线”。Transformer 是当今大语言模型(如 GPT)的核心,它具有极佳的 可扩展性(Scaling Law)和 上下文理解能力。这意味着:

  1. 质量可控提升:只要增加 Transformer 的规模(参数、层数),生成效果就能可预测地变好。
  2. 统一架构:可以用同一个 Transformer 架构去理解和融合文本、图像、视频、3D 等多种信息,是迈向 多模态统一生成 的关键一步。
  3. 工程优势:Transformer 的并行计算更友好,在先进 AI 芯片(如 GPU/TPU)上训练效率更高。

因此,Sora、Stable Diffusion 3、FLUX 等现象级文生图/视频模型,其核心技术都基于 DiT 或其变体。这不仅是学术创新,更是驱动 AIGC 内容质量飞跃、成本下降,并最终影响影视、游戏、广告等产业的核心生产力引擎。

15 分钟专家深入

DiT 的架构与影响力远不止“换主干”这么简单,其成功揭示了生成模型领域的深刻范式转移。

1. 核心范式转移:从“以卷积为中心”到“以序列建模为中心”

  • 传统扩散模型 (基于 U-Net):其核心是 卷积神经网络。它通过下采样-上采样和跳跃连接处理图像特征图。优势是局部特征提取强、计算效率高,但全局依赖关系建模能力弱,且难以处理非网格数据。
  • DiT:将图像(或视频帧)划分为一系列 patch,将其 序列化,然后输入标准的 Transformer Encoder。这本质上将生成任务转化为了一个 序列预测 任务,与语言模型的思路对齐。

2. 关键技术细节与机制

  • 条件注入机制 (adaLN-Zero):扩散模型需要根据时间步 t 和条件(如文本)调整行为。DiT 采用了 自适应层归一化 的一种高效变体。它将时间步和条件信息通过小型 MLP 映射为缩放(scale)和平移(shift)参数,对 Transformer 每一层的输入进行调制。Zero 指初始化时将这些调制参数置零,使模型初始化为恒等映射,有利于稳定训练。
  • 输入/输出流程:原始图像 -> Patch 化与位置嵌入 -> Transformer 处理 -> 解除 Patch 化得到空间特征图,经卷积/线性层映射为噪声预测 ε。具体实现方式有多种,例如预测噪声、预测 x0 或预测 v。
  • 模型容量:DiT 的设计允许通过调整 Transformer 的深度(层数)、宽度(隐藏层维度)和注意力头的数量 来轻松控制模型大小。论文中展示了 DiT-S (小)、DiT-B (基)、DiT-L (大)、DiT-XL (超大) 等不同规模的变体,验证了其 Scaling 特性。

3. 与相关技术的协同

  • 与潜在扩散模型 (LDM) 结合:为了降低计算成本,DiT 通常不会直接在像素空间操作,而是与 VAE(变分自编码器)结合。图像先被 VAE 编码器压缩到低维 潜在空间,DiT 在这个空间进行扩散和去噪,最后由 VAE 解码器还原成图像。这是 Stable Diffusion 3 等模型的标准配置。
  • 与文本编码器的结合:条件输入(文本)通常由一个强大的预训练文本编码器(如 CLIP、T5)处理成嵌入向量,然后通过交叉注意力机制或更简单的调制方式注入 DiT。DiT 的架构天然适合融合这种序列化的文本嵌入。

技术原理

DiT 的核心是将扩散过程中的去噪网络 U-Net 替换为 Transformer。其机制可以拆解为以下步骤:

输入:噪声潜在表示 z_t (来自 VAE 编码器,经 t 时刻加噪)
条件:文本描述 c (经文本编码器编码)
目标:预测 z_t 中包含的噪声 ε

流程:
1. Patch 化:将 z_t (H' x W' x C) 分割成 N 个 patch,每个 patch 展平为向量。
   序列长度 N = (H' / p) * (W' / p),其中 p 为 patch 大小。
2. 线性投影与位置编码:每个 patch 通过线性层投影为 D 维向量,
   并加上可学习的位置编码(通常是一维或二维)。
   得到输入序列 x ∈ R^{N x D}。
3. 条件调制 (adaLN-Zero):
   - 将时间步 t 和文本条件 c 整合后通过小型 MLP 输出一个维度为 (6 × D) 的向量,
     这对应于 6 组维度为 D 的向量,分别用作 Transformer 每层中两个 LayerNorm 的 scale、shift 参数,
     以及注意力子层和 MLP 子层的门控参数。
   - 在 Transformer 每一层的 LayerNorm 之后,用这组参数对特征进行仿射变换:
        x' = scale * LayerNorm(x) + shift
   - 在注意力/MLP 子层输出后,用门控参数进行残差缩放。
4. Transformer Encoder 处理:一系列标准的 Transformer 块(自注意力、前馈网络)。
5. 输出头:将 Transformer 输出序列映射回 patch 形状,并通过卷积或其他方式重组为空间特征图。
6. 输出头直接预测噪声 ε:解除 Patch 化后的特征图经卷积/线性层映射为与 z_t 同尺寸的噪声预测 ε。

关键参数量级(以 DiT-XL/2 为例,基于公开论文估算):
- 模型参数:约 675M (6.75亿)
- Patch 大小 p=2,潜在空间分辨率 32x32 (对应原图 256x256),序列长度 N=256。
- Transformer 层数:28层
- 隐藏层维度 D:1152
- 注意力头数:16

可扩展性的根源:自注意力机制的计算复杂度是 O(N²),而 N 与输入图像分辨率相关。但通过将图像压缩到潜在空间(LDM)和使用较大的 patch 大小,可以严格控制序列长度 N,使得在主流硬件上训练超大分辨率成为可能。模型的能力主要通过增加深度(层数)和宽度(维度)来扩展。

技术演进史

  1. 前扩散模型时代 (2015-2020):GAN 和 VAE 主导生成模型,但存在训练不稳定、模式坍塌、多样性-保真度权衡等问题。
  2. 扩散模型奠基 (2020-2021):Denoising Diffusion Probabilistic Models (DDPM) 提出,展示了扩散模型在图像生成上的卓越潜力,但模型仍是简单的 U-Net 结构,计算成本高。
  3. 潜在扩散与规模化 (2022):Latent Diffusion Models (LDM) 提出,通过在潜在空间进行扩散大幅降低计算量,为后续大规模应用铺路(如 Stable Diffusion v1)。
  4. Transformer 介入生成 (2022-2023):Google 提出 Imagen,首次将 Transformer(文本编码器)与扩散模型深度结合,证明了 Transformer 在理解和引导生成上的强大能力,但其图像生成主干仍是 U-Net。
  5. DiT 诞生与验证 (2023):Facebook (Meta) 研究团队发表论文 《Scalable Diffusion Models with Transformers》,首次提出并系统性验证了用纯 Transformer 替代 U-Net 的可行性,证明了 DiT 在生成质量上的 Scaling Law。这是架构上的关键一跃。
  6. 产业化与多模态融合 (2023-2024)Stable Diffusion 3 明确采用 DiT 架构(与多模态扩散 Transformer MMDiT 结合),标志着 DiT 成为工业级标准。OpenAI 的 Sora 展示了基于类似架构的 DiT 在视频生成上的惊人能力,将影响扩大到整个 AIGC 行业。

技术路线对比

特性传统U-Net (LDM)DiT自回归扩散模型
主干网络卷积神经网络 (下/上采样、跳跃连接)Transformer (序列化处理)Transformer (逐点生成)
核心优势局部特征高效、细节保留好强可扩展性、全局建模能力强、统一架构理论上能实现任意分辨率生成
核心劣势全局依赖弱,扩展性受限对超长序列(N大)计算开销大,需潜在空间+Patch优化自回归导致生成速度慢,串行依赖
条件注入通常用交叉注意力adaLN-Zero等调制方式,更直接高效类似语言模型的提示词
可扩展性较弱,收益递减快极强,遵循Scaling Law强,但受限于序列长度
典型代表SD 1.5, SD 2.1SD 3, FLUX, Sora (部分机制)尚未有主流模型大规模采用
训练效率高 (卷积高效)中 (自注意力计算量大,但架构更统一)低 (串行生成)

结论:DiT 在质量上限和多模态扩展潜力上占据明显优势,是当前头部模型的首选。U-Net 方案在推理速度和特定任务调优上仍有市场。自回归路线在生成逻辑极强的序列化内容(如代码)上更有优势。

上下游

上游(硬件与基础设施)

  • 算力:对高性能 AI 训练与推理芯片(GPU/TPU)的需求巨大。DiT 的大规模训练依赖高速互联的算力集群。
  • 内存:Transformer 模型参数量大,且在训练中需存储大量中间激活值,对 高带宽内存 (HBM) 容量和带宽要求极高。
  • 存储:海量的高质量训练数据(图像-文本对、视频)需要分布式存储系统。
  • 网络:分布式训练需要超高速、低延迟的数据中心内部网络。

中游(模型与平台)

  • 基础模型厂商:Stability AI (SD3), Black Forest Labs (FLUX), OpenAI (Sora/DALL·E 系列), Adobe, Runway 等。他们构建和训练大型 DiT 基础模型。
  • 开源社区:Hugging Face, GitHub 上的开发者进行模型微调、工具开发和生态建设。
  • 云服务商:AWS, Azure, GCP 提供算力、模型托管和API服务。

下游(应用与行业)

  • 内容创作:广告设计、概念艺术、游戏资产生成、影视预可视化。
  • 电子商务:个性化商品图、虚拟试穿。
  • 社交与娱乐:个性化头像、短视频特效、虚拟人内容生成。
  • 工业设计:产品外观快速原型设计。
  • 教育:生成式教学材料。

关键指标

  1. 生成质量:通常用 FID (Fréchet Inception Distance) 衡量生成图像与真实图像的分布差异,越低越好。DiT 在标准基准上达到了SOTA。
  2. 可控性:对文本提示的遵循度,常使用 CLIP Score 评估图文匹配度。
  3. 多样性:生成内容的丰富程度,避免模式坍塌。
  4. 可扩展性:模型参数、数据量和计算量(FLOPs)与生成质量之间的关系曲线。DiT 的核心论文证明了其具有优秀的 Scaling 特性。
  5. 推理效率:生成一张图像所需的时间(或迭代步数)、峰值显存占用。这是影响实际部署成本的关键。
  6. 分辨率:能支持生成的最高图像/视频分辨率。

供需与市场数据

供给侧

  • 模型:开源模型(如 Stable Diffusion 系列)降低了技术门槛,但顶尖模型(如 Sora 级别)仍由头部闭源公司掌握,形成技术壁垒。
  • 算力:高端AI芯片(如NVIDIA H100/B200)供不应求,是制约模型迭代和部署的核心瓶颈。[据行业估算,训练一个Sora级别的DiT模型,算力成本可达数千万至数亿美元量级]
  • 数据:高质量、版权清晰的多模态数据集成为稀缺资源。

需求侧

  • 需求爆发:来自游戏、影视、广告、电商等行业对高效、高质量AIGC内容的需求正在指数级增长。
  • 市场增长[据多家行业分析机构报告,全球AIGC市场规模预计将在2025年达到数百亿美元],其中基于DiT的图像/视频生成是最大细分领域之一。

供需矛盾:核心矛盾在于 高端算力供给不足海量生成需求 之间的失衡,这推动了推理优化技术和更高效模型架构的持续创新。

代表公司与资本映射

公司角色与DiT关联资本映射逻辑
NVIDIA算力基石DiT训练和推理的核心硬件供应商。其GPU和CUDA生态是DiT模型的“土壤”。最直接受益方。算力军备竞赛的“卖铲人”。
Meta (FAIR)技术开创者DiT原始论文来自Meta,其开源研究奠定了技术基础。掌握核心开源模型与技术人才,提升AI影响力,服务于其社交、VR/AR生态。
Stability AI重要推动者将DiT架构引入其王牌产品 Stable Diffusion 3,推动产业化。将前沿研究快速产品化、开源化,构建开发者生态。
OpenAI / Runway应用引领者展示了基于类似架构的视频生成(Sora)和创意工具的惊人潜力。开拓高端应用市场,验证技术天花板,引领行业投资方向。
Adobe / 其他垂直软件商应用集成方将DiT能力集成到Photoshop、Premiere等工具中,赋能专业用户。提升现有产品附加值,巩固行业地位,实现软件服务收入增长。

投资逻辑

  1. 算力主线(最确定):无论哪个DiT模型胜出,对高性能AI芯片和算力的需求只增不减。关注 GPU、HBM、先进封装、光互联 等产业链。
  2. 模型与平台主线(高潜力):投资那些拥有顶尖模型研发能力、强大工程化团队和清晰商业化路径的公司。护城河在于 数据、人才和算力获取能力
  3. 应用与生态主线(想象空间大):关注率先将DiT能力垂直整合到工作流、创造新商业模式的公司。例如,在 影视制作、游戏开发、电商营销 领域出现的“杀手级应用”。
  4. 风险:技术迭代快(可能出现更优架构)、算力成本过高导致商业化困难、版权与伦理监管风险。

常见误读纠偏

误读1:DiT = 用Transformer做扩散模型,所以它和GPT-4是同类技术。 纠偏:这是严重的概念混淆。虽然都用了Transformer,但任务范式完全不同

  • GPT-4 是自回归语言模型:根据前文逐词预测下一个词。
  • DiT 是扩散模型:学习从随机噪声中逐步去噪以恢复数据,其核心是迭代去噪,不是自回归生成。Transformer 在其中是作为去噪网络(噪声预测器),而非直接生成序列。它们是处理不同模态、不同问题的不同架构路径。

误读2:DiT 一出,U-Net 就完全过时了。 纠偏:DiT 在质量上限和扩展性上优势明显,是前沿和工业级大规模应用的首选。但 U-Net 在 推理速度、计算效率以及对小数据集/特定任务的微调 上可能仍有优势。许多轻量化、实时性要求高的应用(如移动端)可能仍会使用优化过的U-Net变体。两者将在相当长时间内共存,服务于不同场景。

学习路径

  1. 入门概念:先理解基础的 扩散模型 (DDPM) 原理和 Transformer 架构。
  2. 核心论文:精读开创性论文 《Scalable Diffusion Models with Transformers》 (Peebles & Xie, 2023)。
  3. 关键实践:动手跑通一个基于DiT的开源项目(如 Stable Diffusion 3 的微调或推理代码),理解其输入输出、条件注入等细节。
  4. 前沿追踪:关注顶会(CVPR, NeurIPS, ICLR)上关于DiT改进、高效计算、多模态扩展的最新论文。
  5. 产业观察:跟踪头部AI公司(如OpenAI, Stability AI)的技术博客和产品发布,理解技术如何转化为产品。

一句话总结

DiT 通过将 Transformer 的 可扩展性与序列建模能力 植入扩散模型,突破了生成模型的规模瓶颈,成为推动 AIGC 从“可用”到“优质、可控、多模态”产业级应用的核心架构革命。

延伸阅读与来源

  1. 原始论文:Peebles, W., & Xie, S. (2023). Scalable Diffusion Models with Transformers. arXiv:2212.09748.
  2. 产业分析:关注 Lillian Weng, Jim Fan 等AI研究者的博客与社交动态,他们常对技术进行深入浅出的解读。
  3. 技术实现:GitHub 上与 diffusers 库相关的DiT实现代码。
  4. 市场报告:查阅 IDC, Gartner, CB Insights 等机构关于 AIGC 和生成式 AI 的年度报告。[具体数据需查阅最新期报告]
  5. 供应链信息:TrendForce, Counterpoint Research 等对 AI 芯片、HBM 市场的分析报告。
source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型