模型层 开放阅读

DDPM

Denoising Diffusion Probabilistic Model

概念 ID
denoising-diffusion-probabilistic-model
更新时间
2026-05-29
来源数量
待补

DDPM

3 秒看懂

一句话: 先把图片逐步加噪声直到变成纯噪声,再训练一个神经网络学会逐步去噪声还原图片——这就是 DDPM。训练只做一件事:预测每一步加的噪声是什么。推理时从纯噪声出发,一步步”去噪”,就能生成全新的高质量图片。

3 分钟产业解释

为什么 DDPM 重要?

在 DDPM 之前(2020 年),图像生成的主流范式是 GAN(对抗生成网络)VAE(变分自编码器)。GAN 生成质量好但训练不稳定(模式坍塌)、VAE 稳定但生成图片模糊。DDPM 的出现(Ho et al., NeurIPS 2020)证明了基于扩散过程的生成模型可以同时做到高质量、训练稳定、多样性好,一举打破了 GAN 在图像生成质量上的长期垄断。

产业影响

维度影响
AI 绘画DDPM 是 Stable Diffusion、DALL·E 2、Imagen 等文生图大模型的数学基石
视频生成Sora、Runway Gen-2 等视频生成模型的骨干架构直接继承自扩散模型
3D/音频/分子设计扩散框架被泛化到 3D 点云生成、语音合成、蛋白质结构预测等领域
算力需求扩散模型推理需多步(通常 20-1000 步)去噪迭代,显著拉动推理算力需求
产业生态催生了 Denoising → Latent Diffusion → Consistency Model 等持续迭代的技术链

核心认知:DDPM 不是一个应用,而是一类生成模型的范式基石。理解 DDPM = 理解当前整个 AI 生成式产业的数学底座。

15 分钟专家深入

1. 核心思想:可逆的”破坏-重建”

DDPM 的灵感来自非平衡热力学(non-equilibrium thermodynamics)[Sohl-Dickstein et al., 2015]:

  • 前向过程(Forward/Diffusion): 逐步向数据添加微小的高斯噪声,经过足够多步后,任何数据分布都会变成各向同性高斯分布(纯噪声)。这个过程是预定义的、无需学习的
  • 反向过程(Reverse/Denoising): 训练一个神经网络,学习逆向的去噪操作。从纯噪声开始,一步步”逆扩散”,最终还原出一张清晰的图片。

2. 关键数学结构

前向过程定义了马尔可夫链:

q(x_t | x_{t-1}) = N(x_t; √(1-β_t) · x_{t-1},  β_t · I)

其中 {β_t} 是预设的方差调度表(variance schedule),通常 T=1000 步,β 从约 10⁻⁴ 线性增长到约 0.02(原始线性调度)。

关键加速公式——利用重参数化,可以直接从 x₀ 跳到任意 x_t:

x_t = √(ᾱ_t) · x₀  +  √(1 - ᾱ_t) · ε,    ε ~ N(0, I)

其中 α_t = 1 - β_tᾱ_t = ∏(s=1→t) α_s

含义:x_t 是原始信号 x₀ 的缩放版 + 噪声的加权叠加。当 t→T 时,ᾱ_T → 0,x_t ≈ 纯噪声。

3. 训练目标的简化

原始 DDPM 论文证明,变分下界(VLB)经过简化后,训练损失变成一个极其简洁的形式:

L_simple = E_{t, x₀, ε} [ || ε - ε_θ(x_t, t) ||² ]

即:网络 ε_θ 只需要预测在第 t 步被加上的噪声 ε

这是一个 MSE 回归任务——训练稳定、梯度良好,不需要对抗训练。

4. 网络架构

原版 DDPM 使用 U-Net 架构,包含:

  • 下采样/上采样路径 + 跳跃连接(skip connections)
  • 时间步嵌入(sinusoidal positional encoding 送入 MLP)注入到每一层
  • 自注意力层(self-attention)在低分辨率特征图上使用
  • Group Normalization + Swish 激活

注:这不是端到端一步出图。推理时需迭代 T 步(或经加速后约 20-50 步)。


技术原理(深度机制讲解)

前向扩散过程

x₀ (干净图片)
 │  +N(0, β₁I)
 ▼
x₁
 │  +N(0, β₂I)
 ▼
x₂
 ...
 │  +N(0, β_TI)
 ▼
x_T ≈ N(0, I)  (纯高斯噪声)

每一步 x_t 只依赖 x_{t-1},条件分布 q(x_t | x_{t-1}) 是高斯分布。

核心性质: 虽然逐步采样很慢,但利用重参数化技巧,我们可以一步到位:

q(x_t | x₀) = N(x_t; √ᾱ_t · x₀,  (1 - ᾱ_t) · I)

这意味着训练时不需要逐步加噪——直接采样 t,一次算出 x_t。

反向去噪过程

反向过程也是马尔可夫链,但条件分布 q(x_{t-1} | x_t) 无法直接计算(需要整个数据分布的积分),因此用神经网络近似:

p_θ(x_{t-1} | x_t) = N(x_{t-1}; μ_θ(x_t, t),  σ_t² · I)

其中:

  • μ_θ 是神经网络预测的均值(由 ε_θ 间接给出)
  • σ_t² 通常固定为 β_t 或 (1-ᾱ_{t-1})/(1-ᾱ_t) · β_t(DDPM 原文对比了两者,发现简化目标 + 固定方差效果接近最优)

均值与噪声预测的关系:

μ_θ(x_t, t) = (1/√α_t) · (x_t - (β_t / √(1-ᾱ_t)) · ε_θ(x_t, t))

采样流程(推理)

x_T ~ N(0, I)
for t = T, T-1, ..., 1:
    z ~ N(0, I)  if t > 1, else z = 0
    x_{t-1} = μ_θ(x_t, t) + σ_t · z
return x₀

训练流程

repeat:
    x₀ ~ q(x₀)           # 采样一个训练样本
    t ~ Uniform({1,...,T}) # 随机选时间步
    ε ~ N(0, I)            # 采样噪声
    x_t = √ᾱ_t · x₀ + √(1-ᾱ_t) · ε   # 一步加噪
    loss = ||ε - ε_θ(x_t, t)||²          # 预测噪声
    反向传播,更新 θ

训练效率关键: 每次训练只需一次前向+一次反向,不需要真正的逐步扩散。这个”一步加噪”的 trick 是 DDPM 训练可行性的关键。

与 Score Matching 的联系

DDPM 的噪声预测 ε_θ 与 分数函数(score function) ∇_x log p(x) 存在精确对应:

∇_{x_t} log q(x_t | x₀) = -(ε / √(1-ᾱ_t))

因此 DDPM 本质上是一种特殊的 去噪分数匹配(Denoising Score Matching, DSM) [Vincent, 2011],这直接连接到 Score-based Generative Models / NCSN [Song & Ermon, 2019] 的研究脉络,后来统一为 Score SDE 框架 [Song et al., 2021]。

关键超参数

参数典型值说明
T(总步数)1000原始 DDPM 默认
β schedule线性 10⁻⁴→0.02 或 cosineNichol & Dhariwal (2021) 提出 cosine schedule 改善小 T 时的表现
网络深度U-Net, ~35M-500M 参数视数据集规模而定
图像分辨率32×32 (CIFAR-10), 256×256 (LSUN/ImageNet)原文实验
训练步数约 800K iterations (CIFAR-10)[Ho et al., 2020]

技术演进史

2015  Sohl-Dickstein et al. 提出扩散概率模型的概念
      (Deep Unsupervised Learning using Nonequilibrium Thermodynamics)
      ↓
2019  Song & Ermon 提出 NCSN (Noise Conditional Score Networks)
      将 score matching 引入生成模型
      ↓
2020.06  Ho, Jain, Abbeel 发表 DDPM (NeurIPS 2020) ⭐ 关键节点
         简化训练目标 + 精确 U-Net 架构 + 实验性突破
         CIFAR-10 无条件 FID ≈ 3.17 [Ho et al., 2020]
         ↓
2021.01  Nichol & Dhariwal 改进 DDPM (Improved DDPM)
         cosine schedule + 学习方差 + 少步采样
         ↓
2021.02  Song et al. 提出 Score SDE 框架
         统一 DDPM / NCSN / SMLD 为连续时间随机微分方程
         ↓
2021.06  Dhariwal & Nichol (Diffusion Models Beat GANs)
         classifier guidance 使扩散模型首次在 ImageNet FID 上超越 BigGAN
         ↓
2021.10  Rombach et al. 提出 Latent Diffusion Model (LDM) ⭐
         在潜空间做扩散 → Stable Diffusion 的直接前身
         ↓
2022-23  Stable Diffusion / DALL·E 2 / Imagen / Midjourney
         大规模文生图应用爆发
         ↓
2023-24  Consistency Models / SDXL / DALL·E 3 / Sora
         加速采样 + 视频生成 + 更强的文本条件控制

技术路线对比

维度DDPMGANVAE自回归 (AR)Flow
训练稳定性★★★★★ 非常稳定★★☆ 模式坍塌风险★★★★ 稳定★★★★ 稳定★★★★ 稳定
生成质量 (FID)★★★★★★★★★★★★★★★★★★★
生成速度★★ 慢 (多步迭代)★★★★★ 快 (一步前向)★★★★★ 快★★★ 慢 (逐token)★★★★ 较快
多样性★★★★★★★★☆ 受限★★★★★★★★★★★★★
似然计算★★★ 近似✗ 无★★★★★★★★★ 精确★★★★★ 精确
数学基础变分推断/Score matching博弈论变分自编码序列概率可逆变换
可扩展性★★★★★★★★☆★★★★★★★★★★★★

注:以上评级为行业共识的定性判断,非严格量化打分。


上下游

上游(DDPM 依赖什么)

├── 算力基础设施
│   ├── 训练:GPU 集群(A100/H100),单模型训练需数十到数百 GPU·天
│   ├── 推理:单图生成需多次前向传播(T步或加速后 20-50 步)
│   └── 显存:高分辨率生成需较大显存(>16GB for 512×512)
│
├── 网络架构组件
│   ├── U-Net 架构(源自 Ronneberger et al., 2015 医学图像分割)
│   ├── Transformer/Self-Attention
│   └── Sinusoidal Positional Encoding(借鉴 Transformer)
│
├── 理论基础
│   ├── 高斯扩散过程(非平衡热力学)
│   ├── 变分推断 / Evidence Lower Bound (ELBO)
│   ├── 去噪分数匹配 (Denoising Score Matching)
│   └── 随机微分方程 (SDE) 理论
│
└── 数据
    ├── 大规模图像数据集(ImageNet、LAION-5B 等)
    └── 高质量标注(CLIP embeddings 等文本-图像对)

下游(DDPM 催生了什么)

├── 图像生成
│   ├── Stable Diffusion (LDM) → 最广泛使用的 AI 绘画引擎
│   ├── DALL·E 2/3 (OpenAI)
│   ├── Imagen / Parti (Google)
│   └── Midjourney
│
├── 视频生成
│   ├── Sora (OpenAI) — DiT (Diffusion Transformer) 架构
│   ├── Runway Gen-2 / Gen-3
│   └── Pika Labs / Kling (快手)
│
├── 3D 生成
│   ├── DreamFusion (Google) — 用扩散模型做 3D NeRF
│   └── Magic3D (NVIDIA)
│
├── 音频/语音
│   ├── DiffWave, WaveGrad — 语音合成
│   └── Riffusion — 音乐生成
│
├── 科学计算
│   ├── RFdiffusion — 蛋白质设计 (Baker Lab)
│   ├── DiffDock — 分子对接
│   └── 天气预报 / 材料设计
│
├── 加速采样技术(下游衍生方向)
│   ├── DDIM (Song et al., 2021) — 确定性加速采样
│   ├── DPM-Solver (Lu et al., 2022) — ODE 求解器加速
│   ├── Consistency Models (Song et al., 2023) — 一步生成
│   └── 蒸馏方法 (Progressive Distillation)
│
└── 条件生成技术
    ├── Classifier Guidance (Dhariwal & Nichol, 2021)
    ├── Classifier-Free Guidance (Ho & Salimans, 2022) ⭐
    └── ControlNet / IP-Adapter / T2I-Adapter

关键指标

指标说明DDPM 典型值
FID (Fréchet Inception Distance)越低越好,衡量生成分布与真实分布的距离CIFAR-10 无条件: ~3.17 [Ho et al., 2020]
IS (Inception Score)越高越好,衡量质量+多样性CIFAR-10 无条件: ~9.46 [Ho et al., 2020]
采样步数推理时去噪迭代次数,直接影响速度T=1000(原始);DDIM 可减至 50-100
每步推理时间单步去噪的前向传播时间取决于网络大小和分辨率
参数量U-Net 大小原始 DDPM 35M (32×32);现代 LDM 数百 M数 B
训练迭代数达到收敛所需训练步数CIFAR-10 约 800K iterations
NFE (Number of Function Evaluations)生成一张图的总前向传播次数DDPM: ~1000; DDIM-50: 50; 一致性模型: 1-2

注:具体 FID/IS 数值来源于 [Ho et al., NeurIPS 2020] 论文报告。不同实现、不同随机种子、不同评估协议下数值可能有差异。


供需与市场数据

直接市场影响

DDPM 及其衍生技术驱动的市场规模,主要体现在以下环节:

产业环节市场表现数据来源
AI 图像生成Midjourney 年营收超 2 亿美元(2023)[行业报道/估算,非官方财报]
推理算力需求Stable Diffusion 生成一张 512×512 图需约 20-50 步去噪,对应 ~2-5 秒(A100)[社区基准测试估算]
训练算力训练 Stable Diffusion 级别模型需 ~150K A100 GPU·小时 [Stability AI 披露口径][企业披露]
模型压缩需求ONNX / TensorRT 量化部署扩散模型成为热点[开源社区]

算力需求倍增效应

与 GAN(一步出图)相比,DDPM 推理需数十到数百倍的前向传播计算。这是扩散模型驱动算力需求增长的核心逻辑之一。虽然后续加速技术(DDIM、一致性模型、蒸馏)大幅降低了步数,但总体上扩散模型推理仍是计算密集型任务。


代表公司与资本映射

公司/机构DDPM 相关技术地位资本关联
OpenAIDALL·E 系列,Classifier-Free Guidance 共同提出者非上市,估值 >$800 亿 (2024 估算)
Stability AIStable Diffusion / SDXL 的主导开发方融资超 $1 亿,经历管理层动荡
Google DeepMindImagen、Imagen 2、DiffDock、RFdiffusionAlphabet (GOOGL) 子公司
Meta (FAIR)Make-A-Video、Llama 生态中扩散组件META 上市公司
NVIDIA硬件基础设施(GPU)+ Magic3D 等 3D 扩散研究NVDA 上市公司
RunwayGen-2/Gen-3 视频生成,基于扩散模型融资约 $1.4 亿
Midjourney最成功的 AI 图像生成产品之一独立运营,未融资,年营收估算 >$2 亿

资本映射为定性梳理,具体估值/营收数据来源于公开报道和估算,非精确财务数据。


投资逻辑

核心投资主线

主线一:算力基础设施(最确定)
  逻辑:扩散模型多步推理 → 推理算力需求远超一步生成模型
  标的:NVIDIA (GPU)、AMD、自研芯片公司、云厂商

主线二:AI 生成式应用平台(高增长)
  逻辑:Stable Diffusion / Midjourney 验证了商业模式
  标的:Adobe (Firefly)、Canva、独立创业公司

主线三:模型基础设施 / MLOps(衍生需求)
  逻辑:扩散模型部署需要推理优化、模型压缩、API 服务
  标的:Replicate、Hugging Face、Modal 等

主线四:下游垂直应用(长尾机会)
  逻辑:扩散模型外溢到视频/3D/生物医药/材料设计
  标的:Runway、Generate:Biomedicines 等

关键风险

  1. 加速技术削弱算力需求: 一致性模型、蒸馏技术可能将推理步数从 50 压缩到 1-2,显著降低推理算力倍增效应
  2. 范式替代风险: Flow Matching 等新范式可能在某些场景替代传统扩散模型
  3. 版权与合规风险: 训练数据版权争议影响商业落地
  4. 竞争格局: 开源模型(Stable Diffusion)可能压缩商业化空间

常见误读纠偏

误读 1:「DDPM 推理很慢所以不实用」

纠偏: 原始 DDPM 确实需要 ~1000 步,但这是 2020 年的方法。当前实际应用中:

  • DDIM [Song et al., 2021] 将步数降到 20-50 步且质量损失可控
  • DPM-Solver [Lu et al., 2022] 使用高阶 ODE 求解器,10-20 步即可获得高质量结果
  • 一致性模型 [Song et al., 2023] 理论上 1-2 步即可生成
  • Stable Diffusion 实际部署 通常 20-30 步,单张图在消费级 GPU 上 ~2-5 秒

“DDPM 很慢”是原始论文的技术事实,但说”扩散模型很慢”在 2024 年已不准确。

误读 2:「DDPM 的网络在”画图”」

纠偏: DDPM 的网络 ε_θ 不是在画图,而是在预测噪声。具体来说:

  • 输入:带噪图片 x_t + 时间步 t
  • 输出:预测的噪声 ε_θ(x_t, t)
  • 最终的清晰图片是通过迭代去噪的数学公式计算出来的,网络本身从未直接输出一张完整图片

这个区别很重要——它决定了 DDPM 的可控性:通过在每一步修改噪声预测(如 classifier guidance),可以精细控制生成结果。

误读 3:「DDPM 和 GAN 是同类竞争技术,选一个就行」

纠偏: 两者有本质区别:

  • GAN 是对抗训练:生成器和判别器博弈,训练不稳定但推理快(一步前向)
  • DDPM 是似然训练(简化形式为回归):训练稳定但推理慢(多步迭代)

2024 年的实际趋势是扩散模型在质量上全面胜出,而推理速度通过技术迭代持续改善。GAN 在实时性要求极高的场景(如超分辨率、实时视频处理)仍有优势,但新生成任务主流范式已转向扩散模型及其变体。

误读 4:「FID 越低图片看起来越好」

纠偏: FID 衡量的是生成分布与真实分布在 Inception-V3 特征空间中的 Fréchet 距离。它与人类感知的”好看程度”相关但不完全一致。FID 受样本数量、评估协议、预处理方式影响,不同论文的 FID 不能直接比较,除非使用相同的评估设置。


学习路径

入门(需要线性代数 + 概率论基础)

Step 1: 理解核心直觉
  → Lilian Weng 的博客 "What are Diffusion Models?"
     (https://lilianweng.github.io/posts/2021-07-11-diffusion-models/)
  → Jay Alammar 的可视化讲解

Step 2: 精读原论文
  → Ho et al., "Denoising Diffusion Probabilistic Models" (2020)
     重点理解:简化损失的推导、采样算法

Step 3: 动手实现
  → Phil Wang (lucidrains) 的 PyTorch 实现
  → Hugging Face Diffusers 库教程

进阶(需要随机过程 / SDE 基础)

Step 4: 统一框架
  → Song et al., "Score-Based Generative Modeling through SDEs" (2021)
     将 DDPM / NCSN / SMLD 统一为 SDE 框架

Step 5: 加速采样
  → Song et al., "DDIM" (2021)
  → Lu et al., "DPM-Solver" (2022)

Step 6: 条件生成与控制
  → Ho & Salimans, "Classifier-Free Diffusion Guidance" (2022)
  → Rombach et al., "Latent Diffusion Models" (2022)
  → Zhang & Agrawala, "Adding Conditional Control to LDMs" (ControlNet, 2023)

专家级

Step 7: 理论深化
  → De Bortoli et al., 连散时间扩散模型的收敛性分析
  → Flow Matching (Lipman et al., 2023) — 扩散模型的替代公式

Step 8: 前沿追踪
  → Consistency Models / Consistency Distillation
  → DiT (Diffusion Transformer) — Scalable Diffusion Models with Transformers
  → Rectified Flow / InstaFlow
  → 3D 扩散、视频扩散、分子扩散等垂直方向

一句话总结

DDPM 是一种通过”学习去噪”来生成数据的深度生成模型,以其训练稳定、生成质量高的优势取代 GAN 成为 AI 生成式范式的数学基石,直接催生了 Stable Diffusion、Sora 等现象级应用,并持续驱动推理算力需求增长。


延伸阅读与来源

核心论文

  1. Ho, J., Jain, A., & Abbeel, P. (2020). Denoising Diffusion Probabilistic Models. NeurIPS 2020. [DDPM 原始论文]
  2. Sohl-Dickstein, J., et al. (2015). Deep Unsupervised Learning using Nonequilibrium Thermodynamics. ICML 2015. [扩散模型概念起源]
  3. Song, Y., & Ermon, S. (2019). Generative Modeling by Estimating Gradients of the Data Distribution. NeurIPS 2019. [NCSN / Score Matching]
  4. Song, Y., et al. (2021). Score-Based Generative Modeling through Stochastic Differential Equations. ICLR 2021. [Score SDE 统一框架]
  5. Song, J., et al. (2021). Denoising Diffusion Implicit Models (DDIM). ICLR 2021. [加速采样]
  6. Nichol, A. & Dhariwal, P. (2021). Improved Denoising Diffusion Probabilistic Models. ICML 2021. [改进 DDPM]
  7. Dhariwal, P. & Nichol, A. (2021). Diffusion Models Beat GANs on Image Synthesis. NeurIPS 2021. [Classifier Guidance]
  8. Rombach, R., et al. (2022). High-Resolution Image Synthesis with Latent Diffusion Models. CVPR 2022. [LDM / Stable Diffusion 前身]
  9. Song, Y., et al. (2023). Consistency Models. ICML 2023. [一步生成]

高质量综述/教程

  1. Lilian Weng. What are Diffusion Models? Blog, 2021. [业界公认最佳入门教程]
  2. Luo, C. Understanding Diffusion Models: A Unified Perspective. arXiv:2208.11970, 2022. [数学推导详尽的综述]
  3. Hugging Face. The Annotated Diffusion Model. [代码级教学]

来源说明

  • 本文中的 FID/IS 数据来源于原始 DDPM 论文 [Ho et al., 2020] 表格报告
  • 产业链信息综合自公开报道、企业披露和行业估算,已标注口径
  • 未明确标注来源的定性描述为行业共识性判断
source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型