Latent Diffusion
3秒看懂
- 是什么:Latent Diffusion Model(LDM)是一种在压缩后的感知隐空间里执行扩散过程的生成模型,而非直接在像素空间操作。它先用一个预训练的自编码器(通常是 VAE)把图像压成低维潜变量,再在潜变量上逐步加噪、去噪,最后通过解码器重建高分辨率图像。
- 为什么重要:解决了早期扩散模型(DDPM)计算量极大、训练/推理慢、显存开销高的痛点——把扩散过程从像素域搬到低维隐空间,大幅降低计算复杂度,让高分辨率图像生成在消费级 GPU 上也能高效运行。同时引入交叉注意力机制,天然支持文本、语义图等多模态条件引导,催生了 Stable Diffusion 等爆款应用。
- 一句话定位:LDM 是扩散模型工程实用化的分水岭,把“像素级扩散”轻量化、多模态化,打开了 AIGC 大规模工业化的大门。
3分钟产业解释
为什么需要 Latent Diffusion
最初的扩散模型(Denoising Diffusion Probabilistic Models, DDPM)直接在像素图像上反复添加噪声并学习去噪。以 256×256 图像为例,单个样本训练时要维护全尺寸特征图,单步去噪网络(U-Net)的计算和显存消耗非常恐怖,导致生成一张图需要几分钟甚至更长,且很难扩展到更高分辨率。这种“像素级穷举”在经济上不可行,也更像学术玩具。
LDM 的核心思路
LDM 观察到:图像的感知信息高度冗余,可以先用一个感知压缩模型(比如 VAE)把图像压缩到低维隐空间(Latent Space),该隐空间保留了足够的语义和结构,但丢弃了不必要的高频细节。扩散模型只需要在这个小得多的隐空间上学习“加噪-去噪”,最后再用解码器升维输出到像素即可。
- 分阶段拆解:
- 感知压缩阶段:训练一个自编码器(编码器 E,解码器 D),把图像
x映射到潜变量z = E(x),图像重建为D(z)。为了后续扩散训练的稳定,通常加入 KL 正则或向量量化,使潜空间分布接近标准高斯。 - 隐空间扩散阶段:在潜变量
z上执行扩散过程(前向加噪,逆向去噪)。去噪网络是一个时间条件 U-Net,参数量远小于像素级 U-Net。 - 条件注入:通过交叉注意力层,将文本、语义布局等条件信号引入 U-Net,实现 conditional generation。文本编码器常用 CLIP 的文本 Transformer。
- 感知压缩阶段:训练一个自编码器(编码器 E,解码器 D),把图像
对产业的影响
- 计算效率飞跃:在 f=8 的下采样因子下(256×256→32×32潜变量),计算量降低约 64 倍,使得在单张消费级 GPU(如 RTX 3090)上在几秒内生成 512×512 图像成为可能。
- 可扩展性:轻松扩展到高清、超清图像,甚至视频、3D 等模态。
- 生态爆发:Stability AI 的 Stable Diffusion 就是 LDM 架构,开源后引爆生成式 AI 应用层,插件、模型微调社区一日千里。
15分钟专家深入
架构总览(文字+代码块图)
LDM 的训练和推理流程可概括为:
图像 x → Encoder(E) → 潜变量 z0 → 前向扩散(加噪声) → z_t
↓ ↑
(文本条件 c) → Cross-Attention → Denoising U-Net (时间 t 条件)
↓ ↓
推理时:随机噪声 z_T → 逐步去噪生成 z0^ → Decoder(D) → 生成图像 x^
- 潜变量
z维度为h' \times w' \times c',其中h' = H/f, w' = W/f,f 是下采样因子(常取 4 或 8)。比如输入 256×256×3 图像,f=8 时潜变量尺寸 32×32×4。 - 前向扩散过程定义与 DDPM 相同:
z_t = \sqrt{\bar{\alpha}_t} z_0 + sqrt(1-\bar{\alpha)_t}\epsilon,\epsilon \sim mathcal(N)(0,I)。 - 训练目标是最小化噪声预测误差:
mathbb(E)_{z_0,c,\epsilon,t} \left[ \|\epsilon - \epsilon_\theta(z_t,t,\tau_\theta(c))\|^2 \right],其中\tau_\theta(c)是条件编码器(如 text encoder)。
关键模块深度解析
-
感知压缩模型
- 通常采用 VAE 或 VQ-VAE。为了潜空间平滑,在训练 VAE 时加入 KL 散度损失,使
q(z|x)接近mathcal(N)(0,I)或一个小权重的 KL 惩罚。 - 下采样使用步长卷积或池化,解码器用上采样加卷积。注意:VAE 重建不是像素级无损,会引入轻微模糊,但这对于扩散模型反而起到“隐式正则”效果,因为扩散过程只需建模语义布局和低频结构,高频纹理由解码器补全。
- 隐空间通道数
c'对性能敏感:论文中证实过小的潜变量维度会遗漏重要细节,过大会浪费算力。Stable Diffusion 1.x 通常设c'=4, f=8。
- 通常采用 VAE 或 VQ-VAE。为了潜空间平滑,在训练 VAE 时加入 KL 散度损失,使
-
隐空间去噪 U-Net
- 核心是一个时间条件 U-Net,网络结构类似像素扩散模型,但输入输出维度大幅缩减。U-Net 的骨干由残差块、下/上采样层、空间自注意力层、交叉注意力层交错堆叠。
- 时间条件注入:扩散时间步
t经正弦编码后通过线性层调制残差块(类似 GroupNorm 后 scale & shift)。 - 交叉注意力机制:这是 LDM 实现多模态条件的关键。将条件编码(如 CLIP 文本嵌入)作为 K、V,将 U-Net 中间特征图展平后作为 Q,计算公式为:
text(Attention)(Q,K,V) = text(softmax)\left(frac(QK^T){sqrt(d)}\right)V
再与原始特征图残差连接。通过堆叠多个交叉注意力层,条件信号可以从语义到纹理多层次引导生成。
- 自注意力:在特定分辨率层级加入,捕获全局结构。
- 条件编码器
- 文本条件:可使用 CLIP ViT-L/14 的文本 Transformer 输出,或 T5-XXL 编码器。不同模型的编码器容量影响语义对齐和生成质量。Stable Diffusion v1.5 用 CLIP 文本编码器(77 token 限制),v2 迁移到更大的 OpenCLIP 模型。
- 图像条件(如语义图、素描):通过额外编码器映射为与 U-Net 兼容的特征,可拼接或交叉注意力注入。
训练技巧与细节
- 两部分独立训练:通常感知压缩模型(VAE)单独训练收敛后冻结,再训练扩散模型。这样避免端到端训练的不稳定。部分工作尝试联合微调,可略微提高重建保真度,但会增加不稳定。
- 噪声调度:沿用 DDPM 的线性方差调度或 cosine 调度,在潜空间上保持相同的噪声分布假设。
- CFG(Classifier-Free Guidance):训练时随机以空条件替换条件嵌入(如 10%),使网络同时学习有条件和无条件去噪。推理时通过缩放组合:
\tilde{\epsilon}_\theta(z_t,c) = \epsilon_\theta(z_t,\emptyset) + w (\epsilon_\theta(z_t,c) - \epsilon_\theta(z_t,\emptyset))。w(引导比例)越大,样本与条件对齐越强,但多样性下降。
技术原理(最深,机制+关键参数)
为什么潜空间扩散有效
扩散模型的基本假设是数据分布 p(x) 可通过逐渐加高斯噪声变成先验分布(标准高斯),反向过程则从噪声中恢复数据。在像素空间,原始数据的维度极高,要去噪 H \times W \times 3 的高维流形非常低效。LDM 发现,如果能找到一个平滑的、维度更低的流形嵌入(隐空间),扩散过程在这个嵌入上进行,不仅计算量小,而且因为嵌入空间已经去除了感知上不重要的高频变化,扩散模型可以专注于语义一致的结构生成。
- 率失真理论视角:感知压缩相当于对图像进行有损编码,将大部分比特率用于语义信息,丢弃不易察觉的纹理细节。扩散模型的生成责任被拆分为:语义布局生成(潜空间扩散) + 高质量纹理解码(解码器)。这不失一般性,因为人类视觉对高频细节的微小偏差容忍度高。
- 诱导的隐空间分布:VAE 训练时,潜变量的边际分布被强制接近标准高斯,为后续扩散模型提供了良好的先验匹配,使得扩散的去噪轨迹更平滑。
关键参数及影响(基于 LDM 论文及主流实现定性描述)
- 下采样因子 f:f 越大潜变量尺寸越小,计算量降级级数等于 f²× ,但过大的 f 会导致解码器重建时丢失过多空间细节,图像可能出现模糊或扭曲。论文中实验对比 f=4,8,16,发现 f=4 和 8 在 FID 和 IS 指标下效果相当,而 f=16 明显退化。因此产业中稳定版本通常采用 f=8。
- 潜变量通道数 c’:影响隐空间表达力。过小会限制生成细节,过大会增加算力。常用 4 通道。一些工作探讨可学习的通道维度分配。
- U-Net 的深度与注意力分辨率:U-Net 通常在多个分辨率级别引入自注意力和交叉注意力(例如在 32×32、16×16、8×8 特征层),这决定了模型对全局结构捕获能力。更深、更宽的 U-Net 可提高质量,但参数量和训练开销增大。Stable Diffusion 2.0 的 U-Net 约有 865M 参数(论文估算,[未充分披露]按照当时权重文件估计)。
- 文本编码器维度:CLIP ViT-L/14 输出 768 维,SD v2 使用 1024 维嵌入(OpenCLIP)。更大的语义空间改善复杂场景的文本贴合度。
- 扩散总步数 T:训练时典型设为 1000。推理时可通过 DDIM 等确定性采样器减少步数至 20-50 步,极大加速生成,质量轻微下降。
数学形式化
- 感知压缩的训练损失(包含重建、KL 和可能对抗损失):
mathcal(L)_{Autoencoder} = mathcal(L)_{rec}(x, D(E(x))) + \beta \cdot D_{KL}(q(z|x) \| mathcal(N)(0,I)) + \lambda \cdot mathcal(L)_{GAN}(D(E(x)))
其中 \beta 控制潜空间正则化强度,GAN 损失可选,用于提升真实感。
- 隐扩散目标(简化):
L_{LDM} := mathbb(E)_{z_0 \sim E(x), \epsilon \sim mathcal(N)(0,I), t, c} \left[ \| \epsilon - \epsilon_\theta (z_t, t, \tau_\theta(c)) \|^2 \right]
这里 z_t 由前向过程得到:z_t = \sqrt{\bar{\alpha}_t} z_0 + sqrt(1-\bar{\alpha)_t} \epsilon。
生成过程(采样)
- 通过训练好的噪声预测器
\epsilon_\theta,从随机噪声z_T \sim mathcal(N)(0,I)开始,迭代执行去噪步(如 DDIM 采样):
z_{t-1} = \sqrt{\bar{\alpha}_{t-1}} \left( frac(z_t - sqrt(1-\bar{\alpha)_t} \epsilon_\theta(z_t, t, c)}{\sqrt{\bar{\alpha}_t}} \right) + sqrt(1-\bar{\alpha)_{t-1} - \sigma_t^2} \cdot \epsilon_\theta(z_t, t, c) + \sigma_t \epsilon
其中 \sigma_t 决定随机性(0 为 DDIM 确定性路径)。最终代入解码器:hat(x) = D(z_0)。
技术演进史
- 2015-2019, 扩散模型萌芽:从 Sohl-Dickstein 的扩散概率模型到 DDPM (Ho et al. 2020),证明了扩散模型能生成高质量图像,但极度缓慢。
- 2021 年, 效率初探:DDIM 提出确定性采样,将步数从 1000 步降至几十步;同时 LDM 之前已有工作尝试隐空间扩散(如 VDM 早期探索),但未形成标准框架。
- 2022 年初, LDM 正式提出:Rombach et al. (CVPR 2022) 的“High-Resolution Image Synthesis with Latent Diffusion Models”系统性地构建了 LDM 架构,整合感知压缩、交叉注意力、条件机制,并展示了在文本到图像、语义图到图像、超分辨率等任务上的卓越性能。论文的关键贡献在于分离压缩和扩散但设计出连贯的端到端训练方案。
- 2022 年 8 月, Stable Diffusion 发布:Stability AI 基于 LDM 开源了 Stable Diffusion v1.4,训练数据为 LAION-5B 子集,一举引爆公众对 AI 绘画的关注。之后快速迭代至 v1.5、v2.0、v2.1,修改文本编码器(OpenCLIP)和分辨率训练策略。
- 2023 年, SDXL 及精细化控制:Stable Diffusion XL 将 U-Net 参数扩大约 3 倍,引入多分块/高低分辨率条件,原生支持 1024×1024 生成。同时 ControlNet、T2I-Adapter 等适配器涌现,通过附加空间条件(深度图、边缘图、姿态)进一步增强 LDM 的可控性,充分展现 LDM 交叉注意力的灵活性。
- 2024 年以来:LDM 架构向视频生成、3D 生成扩散,如 SVD (Stable Video Diffusion) 将 LDM 时间轴扩展为 3D U-Net,并插入时序注意力;商用化平台大规模落地。
技术路线对比(量化表)
| 方法 | 扩散空间 | 推理步数 | 条件机制 | 生成速度(512×512) | 典型文本对齐 (CLIP score) | 计算资源 |
|---|---|---|---|---|---|---|
| DDPM (Ho 2020) | 像素空间 | 1000 | 无内置条件 | 很慢(分钟级) | 不适用 | 需多卡高端GPU |
| LDM (Rombach 2022) | 隐空间 | 50-200 (DDIM) | 交叉注意力,灵活支持文本、图 | 数秒(单卡消费级GPU) | 高 (0.33 左右*) | 单卡 24GB 即可推理 |
| DiT (Peebles & Xie 2023) | 隐空间 | 250-1000 | Transformer 骨干,交叉注意力 | 慢于 LDM U-Net,但可扩展 | 高 (依赖于缩放) | 显存需求高 |
| GAN (e.g., StyleGAN2) | 潜在空间 (仅生成器) | 1 步前向 | 无灵活条件 | 极快(毫秒级) | 单一类别,文本需额外编码器 | 低 |
| VQ-VAE + 自回归 (如 DALL·E 1) | 离散 token 序列 | 自回归逐步 | 通过序列拼接 | 较慢(序列长度大) | 较弱 | 巨大 |
*注:CLIP score 受文本编码器版本和评测集影响,此处为定性对比,[基于公开论文报告数据]。
上下游
- 上游:
- 数据:大规模图文对数据集(LAION、COYO、DataComp 等),需要数据清洗、去重、安全过滤。
- 算力:训练 LDM 需要大量 GPU/TPU 集群,典型的 SD v2 训练使用了数千 A100 GPU 天 [据公开报道估算];推理侧依赖消费级 GPU 或云推理卡。
- 基础模型:CLIP 文本编码器、VAE 编码器-解码器预训练权重。
- 中游:
- 模型训练平台:Hugging Face Diffusers、PyTorch Lightning 等框架封装 LDM 组件。
- 模型微调与适配:LoRA、DreamBooth、Textual Inversion 等方法,允许用户在小数据上定制概念。
- 控制网络:ControlNet、IP-Adapter 等用于添加空间/风格条件。
- 应用层工具:ComfyUI、Automatic1111 WebUI、Fooocus 等,图形化链式搭建扩散流程。
- 下游:
- 创意内容:概念设计、营销素材、游戏角色/场景生成、出版插画。
- 媒体与娱乐:视频生成、特效制作、动画辅助。
- 工业设计:产品原型渲染、室内设计可视化。
- 科学可视化:分子结构、天文图像合成等。
关键指标
- FID (Fréchet Inception Distance):评估生成图像集的真实性和多样性,数值越低越好。LDM 在 MS-COCO 256×256 上可达 10+ 的 FID [公开论文数据]。
- CLIP score / CLIP Directional Similarity:衡量生成图像与输入文本的语义对齐程度。
- LPIPS / PSNR / SSIM:用于自编码器重建质量评估,确保潜变量保留足够信息。
- 推理时间:生成单张 512×512 图像所需秒数(在 A100 或消费级 GPU),衡量部署实时性。
- 参数量:扩散 U-Net 参数规模(100M ~ 2.6B),影响质量和成本。
- 训练收敛所需 GPU 时:决定训练经济性。
供需与市场数据
- 自 Stable Diffusion 开源以来,生成图像模型的市场需求急剧扩张。OpenAI 的 DALL·E 2/3、Midjourney、Stable Diffusion 等形成竞争,但 SD 以其开放生态和可定制性占据特殊位置。
- 据第三方估计,2023 年 AIGC 图像市场(含 API 和服务)约为数亿美元,年增长率极高 [未充分披露]。
- 算力供给:SD 模型的一次完整训练通常需要 150,000 到 300,000 A100 GPU 小时以上(根据模型版本和训练数据量变动),这种训练量集中在少数有大规模云平台的公司或资助项目,但社区微调使推理算力需求长尾分布,带动消费显卡需求。
代表公司与资本映射
- Stability AI:开源 SD 系列的发起方,获得多轮融资,但也面临商业化变现挑战。与 Arm、AWS 等合作优化推理。
- Runway:推出视频生成模型 Gen-2/Gen-3,基于扩散和潜在空间架构,从 LDM 出发扩展到视频,估值飙升。
- Midjourney:未公开技术的封闭商业化扩散模型,被认为在某些 LDM 变体上构建,通过 Discord bot 服务,2023 年已实现数亿美元收入。
- OpenAI:DALL·E 系列从自回归转向潜在扩散(DALL·E 2 使用 unCLIP 类似思路),但不公开参数。
- 国内玩家:智源研究院发布 AltDiffusion(多语言 LDM);百度文心一格、阿里通义万相等采用自研扩散或结合 LDM 结构;创业公司如潞晨科技(Colossal-AI)优化扩散模型分布式训练。
投资逻辑
- 平台价值:LDM 作为底层的通用生成架构,其“基础模型+微调适配器”模式已确立,投资基础模型企业或中间件工具(如 webUI、API 平台)具备先发优势。
- 垂直应用:在产品设计、游戏资产生成等垂直领域,LDM 定制化的 SaaS 或模型即服务(MaaS)能产生高粘性收入。
- 生态上下游:数据标注与版权合规、模型压缩与端侧推理芯片(将 LDM 搬到手机芯片)、安全检测(AIGC 内容鉴伪)是蓝海。
- 算力需求:训练和推理催生对 GPU 集群及云服务的持续需求,利好云计算厂商。
- 风险:同质化竞争、版权法律风险、开源模式盈利困难;技术迭代快(DiT、Masked Diffusion 等可能挑战 U-Net LDM)。
常见误读纠偏
-
误读 1:“LDM 就是 Stable Diffusion,Stable Diffusion 就是整个扩散模型。” 纠正:LDM 是特定的一类架构框架(潜在空间扩散+交叉注意力),而 Stable Diffusion 是基于该架构的模型实例。扩散模型包含像素空间扩散、隐空间扩散、在 score-based 模型上的发展等。同时还有 DALL·E 2、Midjourney 等各自的隐扩散实现,不都是 SD。
-
误读 2:“潜变量压缩必然导致细节丢失,所以 LDM 永远无法做到 GAN 式的逼真度。” 纠正:虽然 VAE 压缩会丢失高频信息,但解码器能从低频潜变量重建出高度逼真的细节,且扩散模型在采样过程中通过去噪补充了缺失的随机高频信息。在实践中,LDM 的 FID 和视觉真实感已经超过多数 GAN,并可以直逼甚至超越像素扩散在固定分辨率下的结果,且速度远快。后续工作通过提供更好的自编码器(如 VQGAN 替代 VAE)进一步提升了细节。
-
误读 3:“多一个步骤(压缩)使得 LDM 不如端到端像素扩散简洁。” 纠正:端到端像素扩散虽然概念更直接,但高维操作导致网络过重、收敛慢、对算力不友好。从系统工程和代价角度,LDM 两步法反而极致高效;压缩和解码模块是独立可复用的(同一个 VAE 可用于不同扩散模型),整体架构更清晰。
学习路径
- 入门:理解扩散模型基础——阅读 DDPM 论文及博客《What are Diffusion Models?》(Lilian Weng),掌握前向过程和 ELBO 推导。
- 核心:精读 LDM 原文《High-Resolution Image Synthesis with Latent Diffusion Models》,重点弄懂感知压缩、潜空间 U-Net、交叉注意力。
- 实践:利用 Hugging Face Diffusers 库运行 Stable Diffusion 管线,并尝试微调(如使用 LoRA),观察潜变量与生成结果。
- 进阶:探索 LDM 后续改进(SDXL, ControlNet, Cascade Diffusion),了解如何设计条件控制、多阶段扩散,并研究 DiT 等 Transformer 隐扩散模型。
- 前沿:阅读关于实时扩散模型、一致性模型、潜空间一致性蒸馏的文献,进入扩散模型加速和视频/3D 生成领域。
一句话总结
Latent Diffusion Model 通过将扩散过程放进压缩感知隐空间,以极小计算代价实现了高分辨率、多模态条件控制的高质量图像生成,成为当前 AIGC 产业的基础性技术范式。
延伸阅读与来源
- Rombach, R., Blattmann, A., Lorenz, D., Esser, P., & Ommer, B. (2022). High-Resolution Image Synthesis with Latent Diffusion Models. CVPR 2022. [论文链接: https://arxiv.org/abs/2112.10752]
- Stable Diffusion 开源实现: https://github.com/Stability-AI/stablediffusion
- Hugging Face Diffusers 文档: https://huggingface.co/docs/diffusers/index
- Leng, Y. (2023). “万字长文读懂潜在扩散模型(LDM)”, 知乎专栏(技术解析)[无直接链接,搜索可得]
- 公开新闻:Stability AI 融资与商业进展,TechCrunch, 2022-2023.
- 算力消费估算参照:Stability AI CEO 公开访谈提及训练 SD 的 GPU 时长;Runway 发布的视频模型训练细节。