扩散模型
3 秒看懂
- 扩散模型是一种生成式模型,其核心是通过逐步向数据添加噪声,再学习逆转这一噪声过程来生成新样本。
- 生成过程:前向过程将真实图像(或其他数据)转化为纯高斯噪声;逆向过程从随机噪声出发,一步一步“去噪”,恢复出符合训练数据分布的新图像。
- 产业地位:扩散模型已是文本到图像(Stable Diffusion、DALL·E 3、FLUX)、视频生成(Sora、Runway Gen-3)、语音合成、分子构象生成等多模态任务的主流框架,在图像合成领域全面取代 GAN 成为 SOTA。
3 分钟产业解释
扩散模型的产业价值体现在生成质量高、训练过程平稳、可控性强。与 GAN 相比,扩散模型无需对抗训练,避免了模式坍塌;与自回归模型相比,其逆向过程可通过并行采样加速(如 DDIM、DPM-Solver、一致性蒸馏),推理效率不断提升。
产业落地方向主要包括:
- 文生图/视频:Midjourney、Stable Diffusion、DALL·E、FLUX 等直接面向普通用户与创意产业,已嵌入 Photoshop、Canva 等主流工具。
- 3D/分子生成:扩散思想被扩展至点云、蛋白质结构(如 RFdiffusion、AlphaFold 3 中的扩散模块),助力药物发现与数字孪生。
- 音频/语音合成:WaveGrad、DiffWave、Bark 等模型提供高保真音频,部分已进入商业 TTS 服务。
算力需求依然是主要瓶颈:一次高分辨率图像生成需多次 U‑Net 或 DiT 前向传播(传统 DDPM 需数百至上千步),持续拉动 GPU 及专用推理芯片的需求。产业界正通过**潜在空间扩散(LDM)、常微分方程采样器(DPM-Solver)、一致性模型(Consistency Models)、流匹配(Flow Matching)**等手段将推理步数压缩至 4~20 步,在保持质量的同时大幅降低部署成本,使实时生成和移动端推理成为可能。
技术原理
前向扩散过程(加噪)
给定真实数据 x_0 \sim q(x_0),每一步按预设的噪声调度 \beta_t \in (0,1) 添加高斯噪声:
q(x_t | x_{t-1}) = mathcal(N)(x_t ; sqrt(1 - \beta_t) \, x_{t-1}, \beta_t mathbf(I))
利用重参数化,可直接从 x_0 得到任意噪声尺度下的分布:
q(x_t | x_0) = mathcal(N)(x_t ; \sqrt{\bar{\alpha}_t} \, x_0, (1 - \bar{\alpha}_t) mathbf(I))
其中 \bar{\alpha}_t = \prod_{s=1}^{t} (1 - \beta_s)。当总步数 T 足够大时 \sqrt{\bar{\alpha}_T} \approx 0,q(x_T) \approx mathcal(N)(0, mathbf(I)),即纯高斯噪声。
逆向去噪过程(生成)
训练一个参数化高斯转移来逼近真实的逆转移:
p_{\theta}(x_{t-1} | x_t) = mathcal(N)(x_{t-1}; \mu_{\theta}(x_t, t), \Sigma_{\theta}(x_t, t))
DDPM 中将方差固定为 \sigma_t^2 mathbf(I),均值通过一个噪声预测网络 \epsilon_{\theta} 重新参数化:
\mu_{\theta}(x_t, t) = frac(1){sqrt(1-\beta_t)} \left( x_t - \frac{\beta_t}{sqrt(1-\bar{\alpha)_t}} \epsilon_{\theta}(x_t, t) \right)
训练目标是最小化简单的均方误差(\epsilon-prediction):
mathcal(L)_{text(simple)} = mathbb(E)_{t, x_0, \epsilon} \left[ \| \epsilon - \epsilon_{\theta}(\sqrt{\bar{\alpha}_t} x_0 + sqrt(1-\bar{\alpha)_t} \epsilon, t) \|^2 \right]
推理时从 x_T \sim mathcal(N)(0, mathbf(I)) 开始,迭代执行:
x_{t-1} = frac(1){sqrt(1-\beta_t)} \left( x_t - \frac{\beta_t}{sqrt(1-\bar{\alpha)_t}} \epsilon_{\theta}(x_t, t) \right) + \sigma_t \, mathbf(z),\quad mathbf(z) \sim mathcal(N)(0, mathbf(I))
直到 t=0 得到生成样本 x_0。
条件生成与潜在扩散
条件信息 y(如文本提示)通过嵌入后注入去噪网络的交叉注意力:
text(Attention)(Q, K_y, V_y) = text(softmax)\!\left(frac(Q K_y^{mathsf(T)}}{sqrt(d)}\right) V_y
基础去噪网络通常采用 U‑Net 结构(包含编码器、中间层、解码器及跳跃连接),近期主流方案已逐步转向 DiT(Diffusion Transformer) 或 MMDiT(多模态扩散 Transformer)。
潜在扩散(LDM) 的关键设计是先在感知压缩空间(如 VAE 的潜变量空间)进行扩散:先编码 z_0 = text(Enc)(x_0),整个扩散与去噪过程在低维潜在空间完成,最后 hat(x) = text(Dec)(z_0)。这种方案使扩散模型能够在 4×4 到 64×64 的潜在空间上训练和推理,大幅降低显存占用和计算量,是 Stable Diffusion 系列的基础架构。
采样加速机制概览
- DDIM:借助非马尔可夫扩散,可跳跃采样,在 50~100 步内得到与 DDPM 千步相当的质量,且支持确定性生成。
- DPM-Solver/DPM++:将反向扩散视为常微分方程(ODE),用高阶求解器在 10~20 步内获得高质量样本,无需重新训练网络。
- 一致性模型(Consistency Models):直接学习从任意噪声状态到干净数据的映射
f_{\theta}(x_t, t) \rightarrow x_0,支持 1~4 步推理,显著降低延迟。 - 流匹配与整流(Flow Matching / Rectified Flow):构建直线或最优传输路径,进一步优化采样效率,已被 SD3 和 FLUX 等模型采用。
关键参数
本节列示评估与部署扩散模型时最受关注的参数。除非特别注明,数字均为 2023–2024 年公开基准,具体结果随模型版本和评测协议变化。
| 指标 | 定义 / 意义 | 典型数值 / 范围 | 来源 / 说明 |
|---|---|---|---|
| FID(Frechet Inception Distance) | 生成图像与真实图像特征分布的距离,值越低帧越好 | 最佳发布模型的零样本 COCO FID 可达 2.5~8.0(2024 年 SD3、FLUX 等报告值低于 3.0) | 各模型技术报告;公开排行榜 |
| CLIP Score | 文本-图像对齐程度,越高表示图文一致性越好 | ViT‑g/14 尺度下约 0.30–0.35(SD3 等先进模型) | 论文、OpenCLIP 基准 |
| 推理步数 | 从噪声到图像的采样步骤,越少越快,但可能损失细节 | 2023 年主流:20 | 官方技术报告、diffusers 社区 |
| 单张图像推理时间 | 生成一张 1024×1024 图像的平均耗时 | A100 (40GB/80GB):约 2 | 公开基准(Replicate, Hugging Face Space 实测);各厂商博客 |
| GPU 显存占用 | 推理和训练时所需显存,决定部署硬件成本 | SDXL 1024×1024 推理约需 8–14 GB;SD3‑Medium 约 12–20 GB(FP16);训练大尺寸 DiT 模型需数百 GB 至 TB 级显存(多卡) | 官方硬件建议;社区报告 |
| 模型参数量 | 去噪网络(U‑Net/DiT)+ 编码器等总参数规模 | SDXL 约 3.5B(U‑Net 2.6B + 文本编码器 0.8B);SD3‑Medium 约 2B;FLUX.1‑dev 约 12B(DiT);Midjourney V6 未公开,估计数十亿量级 | Stability AI 技术报告;Black Forest Labs 博客 |
| 训练吞吐量 | 训练每秒可处理的图像数(img/s/GPU) | 使用 A100 × 8,SDXL 训练约 20–30 img/s(参考);DiT‑XL/2 约 15 img/s(Peebles & Xie, 2023) | 开源代码库及论文 |
| 无分类器引导强度(CFG scale) | 控制生成图像对文本的忠实度与多样性,常用 3~9 | 多数文本到图像模型的默认值约为 7.0;过高导致色彩过饱和和伪影 | 业界通用实践 |
注:以上数值可能因软硬件环境、评测集(如 COCO 30K/40K)及提示词工程有所不同。“公开资料未见”的特殊参数未在表中列示。
技术路线
当前主流扩散模型的技术路线可从网络架构、训练目标、采样策略三个维度进行对比。
| 路线 / 代表模型 | 网络主干 | 训练/参数化目标 | 典型采样步数 | 潜空间 | 关键优势与限制 |
|---|---|---|---|---|---|
| DDPM (Ho 2020) | U‑Net | ε‑prediction | 1000 步 | 像素(或无) | 奠基框架,训练稳定;推理极慢 |
| Score‑SDE (Song 2021) | U‑Net | 得分函数 ∇log p | 2000 步(SDE) | 像素 | 连续时间视图,理论优美;采样昂贵 |
| DDIM (Song 2021) | 同 DDPM 网络 | ε‑prediction | 50–100 步 | 像素 | 跳跃采样,确定性;不改网络 |
| Latent Diffusion (LDM) / Stable Diffusion 1.x–2.x | U‑Net + 交叉注意力 | ε‑prediction | 30–100 步 | VAE 潜空间 | 大幅降显存,支持高分辨率;品质依赖 VAE |
| DPM-Solver / DPM++ (Lu 2022) | 同 DDPM 网络 | ε‑prediction | 10–20 步 | 均可 | ODE 加速,无需重训;与现有模型直接兼容 |
| DiT / MDT (Peebles & Xie 2023) | Transformer (DiT块),替换 U‑Net | ε‑prediction / v‑prediction | 20–50 步 | VAE 潜空间 | 可扩展性极强,适配大规模训练;Sora 视频基座 |
| 一致性模型 (Song 2023) | 二合一网络 fθ | 自定义蒸馏损失 | 1–4 步 | 像素/潜空间 | 接近实时生成;单步质量略逊于多步 |
| 流匹配 / 整流 (Lipman 2023 / SD3) | MMDiT(多模态扩散 Transformer) | v‑prediction / 流速场 | 15–28 步(可进一步蒸馏) | VAE 潜空间 | 直线路径,采样稳定,图文对齐优秀;模型较大 |
对比说明:截至 2025 年初,Transformer 主干 + 流匹配/整流 已成为最前沿路线,代表模型包括 Stable Diffusion 3、FLUX.1 和 Sora。开源社区广泛采用的依然是基于 U‑Net 的 LDM 系列,但因 DiT 和 MMDiT 展现出更强的扩展性和文本遵循能力,预计将逐步成为主流架构。
上游
扩散模型的上游由数据、基础模型、算力硬件与软件框架共同构成:
- 训练数据:大规模图文对数据集(LAION‑5B、COYO‑700M、WebLI 等),以及内部精细化标注的高质量数据。数据版权和过滤机制正成为上游核心壁垒。
- 预训练编码器:文本编码器主要采用 CLIP(ViT‑L/14、ViT‑g/14、OpenCLIP)、T5‑XXL;潜在空间 VAE 编码器/解码器通常与去噪网络协同训练或冻结。多模态模型(如 LLaVA、BLIP‑2)提供的特征也可作为条件嵌入。
- 算力硬件:训练端以 NVIDIA A100、H100 集群为主,2024 年起逐步迁移至 H200/B200;推理端需要中高端 GPU(A10/A100/L40S 等),专用推理芯片(如 d-Matrix、Groq 的 LPU)开始进入市场。根据公开报告,训练一个 SD3 级别模型可能需要数千 H100 GPU·日。
- 软件框架:PyTorch、JAX 为主要训练框架;Hugging Face Diffusers 是应用最广的推理/微调库;分布式训练依赖 Megatron‑LM、DeepSpeed、FSDP;社区工具链如 ComfyUI、Automatic1111 WebUI 大幅降低使用门槛。
下游
扩散模型的下游覆盖创作工具、垂直行业应用和内容治理三大领域:
- 创作与设计工具:Midjourney(通过 Discord/Web)、Stable Diffusion 生态(DreamStudio、ComfyUI、InvokeAI)、Adobe Firefly(嵌入 Photoshop)、Canva AI 图像生成、Leonardo.Ai 等。商业化 API 主要由 OpenAI(DALL·E 3)、Stability AI、Replicate 提供。
- 垂直行业应用:
- 媒体与广告:自动化素材生成、虚拟场景、广告创意设计;
- 电商/时尚:虚拟试穿、商品背景替换(ZMO.ai、Vue.ai);
- 建筑与室内设计:草图渲染、风格迁移(Veras、ArkDesign);
- 游戏与影视:角色与场景资产生成(Scenario、Promethean AI)、视频特效(Runway Gen‑3)、动画制作;
- 生命科学:蛋白质结构生成(RFdiffusion)、分子构象采样(AlphaFold 最新版本)、材料逆向设计;
- 语音与音频:文本转语音(Bark、ElevenLabs 部分使用扩散)、音乐生成(Riffusion)。
- 内容审核与版权保护:检测扩散模型生成图像的数字水印(Stable Diffusion 内置水印、C2PA 标准),追溯模型输出(如 Stable Signature),以及用于训练数据版权诉讼的取证工具。
受益公司
以下公司按其在扩散模型产业链中的角色划分,仅作产业图谱参考,不构成任何投资评价。
- 算力基础设施:NVIDIA(GPU 训练与推理)、AMD(Instinct 系列)、云服务商(AWS、Microsoft Azure、Google Cloud)提供 GPU 实例和模型推理 API;AI 推理芯片初创(如 d-Matrix、Groq)亦可能受益于推理需求外溢。
- 基础模型研发与分发:Stability AI(开源 Stable Diffusion 系列)、OpenAI(DALL·E 3 闭源 API)、Midjourney(产品化闭源模型)、Black Forest Labs(FLUX.1 开源/商业双轨)、Google(Imagen 系列,未全面开放)、Meta(开源部分扩散研究)。
- 创意工具与 SaaS:Adobe(Firefly 产品线嵌入 Creative Cloud)、Canva、Runway(视频生成与编辑)、Getty Images(通过与 NVIDIA 合作推出合规生成工具)。
- 垂直应用集成者:百度(文心一格)、阿里巴巴(通义万相)、字节跳动(即梦)、腾讯(混元图像生成)等国内厂商,以及众多 AIGC 创业公司(ZMO.ai、右脑科技等)。
- 数据/版权服务:Shutterstock(授权数据训练与生成)、内容认证技术商(如 Truepic、负责 C2PA 实施的组织)。
市场规模
扩散模型专有市场规模,截至目前(2025 年 2 月)公开资料未见第三方独立核算。行业通常将其置于生成式 AI 整体市场中进行估算。
- 据 Grand View Research 于 2024 年 3 月发布的《Generative AI Market Size, Share & Trends Analysis Report, 2024–2030》,全球生成式 AI 市场 2023 年规模约为 136.0 亿美元,预计 2030 年将达到 1,290.3 亿美元,年复合增长率(CAGR)约 36.8%。该统计口径涵盖软件、云服务与专业服务,扩散模型被视作图像/视频/3D 等模态的核心生成技术。
- 从需求侧看,根据 Bloomberg Intelligence 2023 年 6 月的分析,生成式 AI 市场到 2032 年有望达到 1.3 万亿美元,其中 AI 基础设施层受益显著。扩散模型驱动的推理算力(图像、视频生成等)是基础设施消费的重要组成部分,但具体份额未拆分。
- 扩散模型相关的 API 调用量呈指数级增长:第三方监测(如 Replicate、Fal.ai 等平台的公开数据)表明,2024 年主流图像生成 API 的日均调用次数已超过数千万次,但具体营收规模平台方未完全披露。开源模型(如 Stable Diffusion)的下载量累计超过数亿次(Hugging Face 及 GitHub 统计,2024 年),间接反映工具层的渗透广度。
综上,扩散模型直接带动的模型服务、推理算力及创意工具营收在 2024 年估计已达数十亿美元量级(口径不一),但缺乏精确的第三方独立数据,引用时建议标注“初步估计”。
玩家对比
以下对比聚焦文本到图像方向的主流产品与模型(截至 2025 年 2 月,来源为各平台官方文档、技术报告及公开新闻)。
| 模型/产品 | 架构 | 是否开源 | 最高输出分辨率 | 典型推理时间(单张) | 定价(2024–2025 口径) | 核心特点 |
|---|---|---|---|---|---|---|
| Midjourney V6.x | 未公开(推测为改良 DiT) | 闭源 | ~2048×2048(放大) | 约 30–90 秒(含排队) | 订阅制:基础 10 美元/月(约 200 张) | 极致美学、社区生态;需通过 Discord/网页使用 |
| DALL·E 3 (OpenAI) | 未公开(潜在扩散 + 文本理解) | 闭源 | 1024×1024 / 1792×1024 | 10–30 秒(API) | API:0.016–0.080 美元/张;ChatGPT Plus 内嵌 | 强大提示词遵循,天然集成 ChatGPT |
| Stable Diffusion 3 Medium (Stability AI) | MMDiT + 流匹配 | 开源(非商业需许可) | 1024×1024(原生) | 3–10 秒(A100/H100) | 模型权重免费;可自托管 | 开源可微调,社区生态极丰富 |
| FLUX.1 (Black Forest Labs) | DiT + 流匹配 | 部分开源(dev/schnell 开源) | 最高 2048×2048 | 2–6 秒(schnell 蒸馏版) | API 约 0.025 美元/张起;可自托管 | 文本遵循优秀,人体细节领先 |
| Imagen 3 (Google) | 未公开(潜在扩散 + T5) | 闭源 | 1024×1024 | 未公开(通过 Vertex AI 提供) | Vertex AI 按调用计费(约 0.02–0.04 美元/张) | 安全过滤严格,图像真实感强 |
| 文心一格 / 通义万相 (百度/阿里) | 潜在扩散系列 | 闭源 / 模型仅限 API | 1024×1024 或更高 | 5–20 秒(国内云) | 按调用量计费,通常 0.01–0.10 元人民币/张 | 中文理解优,合规体系完备 |
| Sora (OpenAI) | 视频扩散 DiT | 闭源 | 最长 60 秒 1080p 视频 | 数分钟(内测期) | 未公开定价(2024 年 12 月少量开放) | 视频生成可物理一致性,暂时未全面开放 |
说明:推理时间受硬件、排队及 API 负载影响,以上为公开渠道参考值。开源模型可自行部署,成本取决于 GPU 选型。 (注:本比较不构成任何“值得买”或服务推荐,仅客观罗列已知属性。)
风险
- 版权与法律风险:训练数据是否获得授权是全球争议焦点。2023 年 Getty Images 对 Stability AI 提起诉讼,AI 生成物的版权归属在多个司法管辖区仍不明确。模型生成内容若模仿具名艺术家风格或包含未授权商标元素,可能导致侵权。
- 监管合规风险:欧盟《人工智能法案》(2024 年通过)要求生成式 AI 披露训练数据摘要并标注 AI 内容;中国已施行深度合成服务管理规定,需要显著标识。跨境服务面临多法域合规成本。
- 技术快速迭代风险:扩散模型可能被下一代生成框架(如流匹配、新范式)替代,高端架构(DiT、MMDiT)需要从头训练,中小团队资本压力大。蒸馏与加速技术缩短推理步数,可能使前期高步数优化资产快速贬值。
- 模型安全与滥用:扩散模型可生成逼真假图像、深度伪造视频,带来政治干扰、诈骗和声誉风险。各大平台虽内建安全过滤,但开源模型难以完全防止恶意微调。
- 开源竞争与价格战:开源模型(Stable Diffusion 系列、FLUX dev)压低 API 定价,闭源玩家需维持差异化体验与品牌溢价。价格战可能导致部分商业模型提供商持续亏损(Stability AI 在 2024 年经历财务和管理层动荡)。
- 环境与算力成本:训练前沿扩散模型消耗巨大电力与算力,引发环保与可持续发展争议;推理端虽不断优化,但生成式 AI 的总能耗仍在快速攀升。
- 数据偏见与公平性:训练数据中的社会偏见可能被模型放大,生成与种族、性别相关的刻板印象内容,需要持续的偏差检测与缓解策略。
误读纠偏
-
误读:扩散模型是 GAN 的变种或改进版 纠偏:扩散模型与 GAN 基于完全不同的原理——依靠学习数据分布的梯度而非对抗博弈,不使用判别器。两者均属于深度生成模型,但训练过程更稳定,模式覆盖更优。
-
误读:生成高质量图像必须使用上千步采样 纠偏:通过 DDIM、DPM-Solver++、一致性蒸馏等技术,10~30 步即可获得与千步 DDPM 相当的品质。2024 年的 FLUX schnell 和 SD3 Turbo 版本甚至可在 1–4 步内生成可用图像。步数“越多越好”仅适用于无加速的朴素 DDPM,不是普遍适用。
-
误读:潜在扩散(LDM)只是“压缩图片再放大”,必然损失细节 纠偏:经感知训练的 VAE 可在 4–8 倍压缩下保留丰富纹理;扩散在潜空间进行往往能聚焦语义内容,对抗像素级噪声。相比像素空间扩散,LDM 在高分辨率下细节损失极小,且推理资源大幅降低,是效率与质量的帕累托改善。
-
误读:扩散模型只能生成图像 纠偏:扩散框架已成功扩展至视频(Sora、Video Diffusion)、音频(DiffWave)、3D 形状(Point-E、DreamFusion)、蛋白质结构(RFdiffusion)等任意可嵌入空间的数据,本质是对复杂分布的通用建模。
-
误读:Stable Diffusion 是唯一重要的开源扩散模型 纠偏:除 Stability AI 的 SD 系列外,还有 FLUX.1(Black Forest Labs)、PixArt‑α、Playground v2 等众多开源模型,以及大量社区微调版本。不同模型在架构、许可、文本理解和画面风格上各有取舍。
最新事件
(以下事件基于 2024–2025 年公开报道,时间截至 2025 年 2 月)
- 2024 年 2 月:OpenAI 发布 Sora 视频生成模型,展示基于 DiT 的扩散架构在视频领域的惊人能力,引发影视行业震动。Sora 并未立即对公众开放,仅供红队测试和部分艺术家使用。
- 2024 年 3–4 月:Stability AI 经历管理层更迭,CEO Emad Mostaque 辞职,公司寻求外部融资以维持运营。后续发布 SD3 技术论文并开源部分权重。
- **2024 年 6 月