Stable Diffusion
1. 3 秒看懂
Stable Diffusion 是由 Stability AI 主导推出的开源文本到图像生成模型。其核心机制是潜在扩散:它并非直接在像素层面作画,而是先将图像压缩到一个低维度的“语义潜空间”,在此空间内通过逐步去噪生成图像的核心语义信息,最后通过解码器恢复为高清图像。简言之,输入一句自然语言描述,它能生成对应的画面。因其模型权重完全公开且可在消费级显卡上高效运行,它迅速成为全球 AI 创作者与开发者的基础工具。
2. 3 分钟产业解释
传统扩散模型直接在拥有数百万像素的高维图像空间进行迭代去噪,这导致了极高的计算量和显存消耗。Stable Diffusion 的核心产业创新在于,它将这一高成本的扩散过程迁移到了一个计算复杂度数量级降低的潜空间中。这使得单张消费级 GPU(如 NVIDIA RTX 系列)即可完成从推理到微调的全流程,生产成本呈指数级下降。
其工作链条由三个核心子网络构成,协同完成从语义到像素的转换:
- VAE(变分自编码器):作为连接像素空间与潜空间的桥梁。编码器将输入图像压缩至极小的潜空间,解码器则将潜空间数据恢复为高清图像。
- U-Net 去噪器:这是模型的主干,它接收一个带噪的潜变量和文本编码器提供的语义条件,在每个去噪步骤中预测并移除噪声。
- 文本编码器(如 CLIP):将用户输入的自然语言提示词转化为机器可理解的语义向量,并在 U-Net 的交叉注意力层注入,指导图像生成的内容与风格。
推理时,模型从完全的随机噪声开始,历经数十步迭代逐步去噪,最终得到一个清晰的潜变量,再经由 VAE 解码器渲染为最终图像。开源的特性催生了庞大的下游生态:从图生图、局部重绘,到 ControlNet、LoRA 等精细化控制工具,它重塑了内容创作的工具体系,并引发了关于模型版权、内容安全与真实性的广泛讨论。
3. 技术原理
Stable Diffusion 的技术本质,是条件扩散模型在感知压缩潜空间中的工程化实现。其设计哲学并非发明全新的基础算法,而是将前人的理论成果与工程优化进行系统性整合,使其达到可大规模实用化的水准。以下是其机制的分层解构,需注意,SD 的多个具体版本(1.x, 2.x, XL)在细节参数上差异极大,因此下文以定性描述为主,凡未公开的具体数值均注明“公开资料未见”。
1. 感知压缩与潜空间构建
这是实现“降本增效”的基石。一个预先训练好的 VAE 负责将维度为 H \times W \times 3 的像素空间图像 x 压缩为低维潜变量 z = E(x)。VAE 的训练结合了重构损失(确保解码图像与原图相似)和 KL 散度损失(正则化潜空间,使其分布接近标准正态,从而具备连续性)。在 Stable Diffusion 的多数实现中,压缩比通常为 4× 至 8×,即潜空间的数据维度仅为原像素空间的 1/16 甚至更少(具体数值因 VAE 版本而异,“公开资料未见”统一标准)。这直接决定了模型的计算效率。
2. 前向扩散与去噪训练 训练阶段模拟一个不断加噪并逆向学习去噪的过程:
- 前向过程:向干净的潜变量
z_0中按预先定义的噪声调度\bar{\alpha}_t逐步加入高斯噪声,经过T步后,z_T趋近于纯噪声。公式表示为z_t = \sqrt{\bar{\alpha}_t} z_0 + sqrt(1-\bar{\alpha)_t} \epsilon,其中\epsilon \sim mathcal(N)(0, I)。 - 逆向训练:核心是训练 U-Net 去噪器
\epsilon_\theta(z_t, t, c)。它在给定时间步t和文本条件c的情况下,学会预测出当前步骤z_t中所混合的噪声\hat{\epsilon}。损失函数简化为预测噪声与真实噪声之间的均方误差(MSE):mathcal(L) = mathbb(E)_{z_0, \epsilon, t} \left[ \| \epsilon - \epsilon_\theta(z_t, t, c) \|^2 \right]。U-Net 的内部结构由下采样和上采样模块、残差块以及空间自注意力层和交叉注意力层构成,这是其能够同时理解图像空间结构与文本语义的关键。
3. 文本条件的注入与引导
用户的自然语言提示,首先被冻结参数的文本编码器(社区普遍认为其使用了 CLIP 的 ViT-L/14 变体,但官方对不同版本的最终规格“公开资料未见”完整披露)转换为一系列 token 嵌入向量,作为条件 c 输入 U-Net 的交叉注意力层。在推理时,无分类器引导 是关键技巧:模型会同时运行一次“有条件预测” \epsilon_\theta(z_t, t, c) 和一次“无条件预测” \epsilon_\theta(z_t, t, \varnothing),然后将两者进行线性外推,得到最终的噪声预测:\tilde{\epsilon} = \epsilon_\theta(z_t, t, \varnothing) + w ( \epsilon_\theta(z_t, t, c) - \epsilon_\theta(z_t, t, \varnothing) )。其中引导尺度 w 是用户可调的关键参数,值越大,对提示词的忠实度越高,但可能损失图像多样性与自然度。
4. 快速采样 标准 DDPM 的去噪过程需上千步,效率极低。Stable Diffusion 的实用性建立在高效采样器之上,如 DDIM、DPM-Solver++ 和 Euler 等。这些采样器能以极少的步数(通常在 20 至 50 步内)近似求解反向扩散过程的常微分方程,显著加速生成,构成了用户体验上的核心突破。
5. 推理流程总结 (ASCII 示意图)
[输入文字] → (文本编码器) → [文本嵌入向量]
↓
[随机噪声 (z_T)] → {循环 t=T 到 1:
[U-Net] ← (z_t, t, 文本嵌入)
↓
[预测噪声并更新] → (z_{t-1})
} → [最终潜变量 z_0]
↓
(VAE 解码器) → [输出图像]
4. 关键参数
模型的行为与输出质量由一系列核心参数控制。以下参数均为定性描述,精确影响因模型版本、采样器而异,需通过实践体会。
- CFG 引导尺度:控制生成图像对输入文本的遵从程度。典型取值范围为 7-15。过低则图像内容随机,过高则可能出现色彩过饱和、对比度失真与伪影。
- 采样步数:去噪过程的迭代次数。通常 20-50 步即可收敛,继续增加步数(如超过 100 步)对画质提升作用甚微,但会线性增加推理时间。
- 采样器:决定去噪算法的具体实现。不同采样器在收敛速度、细节锐度和稳定性上各有取舍。例如,DDIM 稳定,DPM-Solver++ 快速,Euler 在高步数下细节丰富。
- 分辨率:指定生成图像的宽度与高度。必须考虑 VAE 和 U-Net 的固有训练分辨率(SD 1.5 为 512x512,SDXL 为 1024x1024)。直接在非原生分辨率下生成极易产生结构崩坏,建议在使用时保持长宽维度为 8 或 64 的整数倍。
- 随机种子:初始化潜空间随机噪声的数值。固定种子即可确保相同提示词与参数下生成完全一致的图像,是进行受控实验和版本迭代的核心工具。
5. 技术路线
Stable Diffusion 的技术演进并非线性,而是理论突破与社区工程创新交织的过程,呈现出清晰的基础与变体路线:
- 早期扩散奠基 (2015-2020):从 Sohl-Dickstein 提出扩散思想,到 Ho 等人提出 DDPM 规范了训练框架,再到 Song 等人提出 DDIM 实现加速,基础理论逐步成型。
- 潜在扩散突破 (2021-2022):Rombach 等人提出 LDM,将扩散过程从像素空间解耦到潜空间,实现了效率与质量的平衡。此论文发表于 CVPR 2022,直接构成了 Stable Diffusion 的技术骨架。
- 基础版本演进 (2022-2023):Stability AI 先后迭代 SD 1.x(以 1.5 为经典)、SD 2.x(尝试更高分辨率与自然语言理解)、SDXL(参数增至数十亿级,原生支持 1024x1024 分辨率并引入双文本编码器)等基础模型。
- 加速与蒸馏路线 (2023 至今):SD Turbo、LCM 等模型的出现,通过对抗训练或潜在空间一致性蒸馏,将生成步数从数十步压缩至个位数,实现了接近实时的生成速度,为视频生成和交互式应用铺路。
- 可控性路线 (2023 至今):以 ControlNet 和 IP-Adapter 为里程碑,前者通过注入边缘图、深度图、姿态骨架等确定性空间信号实现精细构图控制,后者通过解耦交叉注意力注入图像特征实现“垫图”功能。
- 轻量化微调路线 (2023 至今):LoRA 技术允许在极少计算资源下,通过训练低秩矩阵来定格特定风格、角色或物体,无需改动原始大模型权重,极大降低了模型个性化成本。
6. 上游
产业链上游主要由数据和算力两大要素构成,共同决定了模型的性能上限与安全边界。
- 训练数据集:主要包括 LAION 系列数据集,如用于初代 SD 训练的 LAION-5B。该数据集通过 Common Crawl 抓取互联网公开的图文对,其规模、美学评分筛选机制(如通过 CLIP 评分和画质评估)直接塑造了模型的输出分布。然而,其数据来源的版权与合规性争议是行业面临的最大风险之一(关于 LAION-5B 的最新具体构成比例与版权清洗状态,“公开资料未见”全面审计报告)。
- 预训练编码器:CLIP 等视觉-语言模型是文本理解能力的核心上游。其对比学习范式决定了词语与视觉概念的映射精度。SD 不同版本所使用的 CLIP 微调版本并未被完全披露。
- GPU 算力基础设施:NVIDIA 是事实上的垄断者。高带宽显存(VRAM)和高速互联是训练与推理的核心瓶颈。训练一次基础模型需要数百至数千个 A100/H100 GPU 月(基于行业估算,Stability AI 未公布精确消耗),是重资本投入环节。
- 合规与数据供应链:为规避原始数据中的版权风险与有害内容,上游出现了专门从事数据清洗、合规审查、元数据脱敏和高质量版权素材授权打包的服务商。
7. 下游
下游应用生态呈现高度碎片化和模块化特征,主要面向专业创作者和技术背景的前沿用户。
- 创作与设计工具集成:通过插件形式深度嵌入 Adobe Photoshop、Figma、Blender 等专业软件,将 AI 能力融入图层、选区、矢量等既有概念中,例如基于 SD 的 Photoshop 生成式填充功能。
- 图形化节点流工作台:以 ComfyUI 为技术标杆,允许用户通过拖拽节点构建复杂的生成管道。这已成为专业研究者、工作室和高阶玩家探索新工作流、复现论文和进行精密生产的主要平台。
- 一键式集成工具包:以 Automatic1111 WebUI 为代表,将所有功能整合至单一网页界面,极大降低了入门门槛,是社区模型测评和民间教程最多围绕的软件。
- 微调与模型交易平台:以 Civitai 为代表,允许用户上传和分享微调后的模型权重(checkpoint)、LoRA 文件等,形成了独特的模型分发与预览体系,但也成为版权灰色地带和不良内容传播的温床。
- 垂直产业解决方案:在游戏概念设计与资产制作阶段、电商产品图多背景快速更替、室内与建筑设计方案的快速可视化等领域,SD 已被集成进具体生产流程,提供概念迭代和初稿产出。
8. 受益公司
由于 Stable Diffusion 是开源基础设施,商业价值的捕捉散见于模型开发、算力服务和应用层等多个环节。
- Stability AI:作为基础模型的主要维护者和品牌方,收入来自 API 调用、企业级模型定制、会员订阅及算力转售。公司曾完成多轮融资,估值一度高涨,但因高昂的训练和人才成本,据报道长期面临商业化运营与现金流的压力。
- Runway:早期深度参与 SD 的基础研究(其团队成员参与了潜在扩散论文),后全线转向闭源的视频生成模型赛道,是目前多模态 AIGC 领域估值最高的公司之一(截至其 2023 年融资报道)。
- Hugging Face:事实上的 AI 模型托管与分发中心。其核心的 Diffusers 库已经成为调用、微调 SD 的行业标准库,公司估值随开源 AI 浪潮爆发式增长,受益于巨大的开发者流量。
- 云服务与 GPU 租赁商:AWS、Google Cloud、阿里云等均提供一键部署 SD WebUI 的解决方案。以 RunPod、Vast.ai 为代表的社区型廉价 GPU 租赁市场因此获得巨大收益,反映了推理侧强劲的算力需求。
- NVIDIA:作为底层算力的唯一核心供应商,是整个产业扩张的最大受益者之一,其面向边缘计算的端侧推理方案和高端训练芯片的需求持续被 AIGC 推理与微调所拉动。
- Adobe:内容工具巨头,通过将 Firefly 系列文生图功能(其底层技术路线的公开透明度较低)深度集成进其 Creative Cloud 产品家族,将 AI 能力直接转化为巩固订阅收入的手段。
9. 市场规模
精确归因于 Stable Diffusion 单一模型的市场规模极为困难,行业报告多将其归入“AI 图像生成”或更广泛的“生成式 AI”市场分析。
- 生成式 AI 整体市场:根据 Bloomberg Intelligence 于 2023 年 6 月发布的报告预测,全球生成式 AI 市场将在 2032 年达到 1.3 万亿美元,复合年增长率(CAGR)约为 42%。
- AI 图像生成子市场:多个第三方机构预测其年复合增长率普遍超过 30%。例如,Straits Research 在 2023 年底的报告指出,全球 AI 图像生成器市场规模在 2022 年约为 2.6 亿美元,预计到 2031 年将达到约 9.2 亿美元(注:此为编制概念页时引用的某口径数据,具体预测数字常随基准和假设浮动)。
- 开源生态的间接价值:SD 生态的价值主要体现在间接的算力消耗、开发者生产力提升和周边工具付费。据 A16Z 等风投机构在 2023 年的行业分析,开源模型周边工具和算力市场的收入增速已超过闭源模型的 API 直接收入增速。具体由 SD 生态贡献的产值规模,“公开资料未见”精确的审计统计。
10. 玩家对比
| 维度 | Stable Diffusion 生态 (开源) | Midjourney (闭源) | DALL-E 3 (闭源/API) |
|---|---|---|---|
| 技术架构 | 潜在扩散,U-Net+VAE+CLIP,完全透明 | 暗化版扩散模型,具体架构未公开 | 未公开细节(推测为扩散与语言模型深度耦合) |
| 主要优势 | 极致的可控性、可定制性、隐私性、零成本使用、庞大的社区工具集 | 零样本下的顶级美学表现,易用性极高,社区氛围强 | 极强的自然语言理解与指代遵从能力,与 Chat/微软体系整合 |
| 主要劣势 | 高端效果依赖用户提示词工程和模型混用技巧,学习曲线陡峭 | 精确的空间构图控制能力有限,所有生成均在云端,无离线私有化部署 | 企业的封闭系统,可控性参数极少,内容审核极为严格 |
| 商业模式 | 基础模型免费,生态价值沉淀于算力租赁、工具、企业服务和模型交易 | 纯订阅制,按月或按年收费,购买 GPU 时长 | 通过 API 按量付费,或作为 ChatGPT Plus/Microsoft Copilot 的增值功能提供 |
11. 风险
- 模型幻觉与偏见风险:模型会“一本正经地胡说”,生成违背物理常识、几何结构的错误图像。同时,它可能放大和固化训练数据中存在的刻板印象和社会偏见(如性别、种族、职业关联)。
- 版权归属与诉讼风险:这是悬在头顶的达摩克利斯之剑。对模型训练数据侵权的集体诉讼(如 Getty Images 诉 Stability AI 案,2023 年初发起)仍在进行中。同时,AI 生成内容的著作权认定在全球法律界存在巨大分歧,美国版权局等机构倾向于不保护完全由 AI 生成的内容。这构成了企业大规模商用的实质性法律障碍。
- 不实信息与伪造风险:模型能够生成高度逼真的照片级图像,可能被恶意用于制造政治人物的虚假视频、伪造新闻事件的现场照片,对公众信任和社会稳定构成新型威胁。
- 技术和生态依赖风险:下游应用生态高度依赖 Stability AI 的基础模型迭代和维护。若该公司因资金等问题导致维护中断,整个社区将面临分叉和维护真空的风险,正如公司在 2023-2024 年间曾经历的关键管理层和核心研发人员变动所引发的不确定性。
- 内容安全与审核风险:开源模型无法像 API 一样实施中心化的内容审核,可能导致生成儿童虐待材料、暴力恐怖等非法内容的扩散,给平台监管带来极大挑战。
12. 误读纠偏
- 误读:“Stable Diffusion 是在一张画布上‘画’出图像。” 纠偏:它并不在像素层面作画,而是在一个数学定义的、高度压缩的潜空间中处理语义概念。生成的中间过程是一系列对人眼无意义的数值矩阵,直到最后一步才通过解码器重构为可识别的图像。理解这一点是区分入门者与专家的分水岭。
- 误读:“开源模型的质量永远追不上像 Midjourney 这样的顶级闭源模型。” 纠偏:这种比较混淆了“零样本能力”与“可定制化上限”。闭源模型的优势在于其针对大众审美调校出的零样本美学一致性。但在需要极端控制(如固定角色、严格构图匹配、特定工程管线)的垂直任务中,经过社区高质量微调模型、LoRA 和 ControlNet 武装的 SD 生态,其可用性和输出精度往往可以超越闭源 API,因为在特定任务上的优化深度完全不同。
- 误读:“CFG 引导尺度简单地越高越好。”
纠偏:引导尺度
w是平衡保真度与多样性的调节阀,存在边际效应和反噬。超过特定阈值(通常在15-20以上),不但不会提升图像质量,反而会因强行拟合文本而产生高对比度、色彩畸变和构图崩塌的“过度引导”现象。
13. 最新事件
- Stability AI 的组织与人事变动:在 2023 年至 2024 年初,公司创始 CEO Emad Mostaque 辞去职务,并伴随着一系列关键研发人员和商业高管的离开。公司同时进行了业务重组,以寻求更可持续的商业模式,引发了业界对其长期稳定性的关注。
- SD3 系列的发布与回炉:Stability AI 于 2024 年上半年发布了 Stable Diffusion 3 的中等参数版本,新架构引入了改良的自适应归一化层并更换了文本编码器,旨在提升文本遵从度。但其初始公共版本的权重因在涉及裸体等安全审核机制上存在缺陷而随后被撤回,凸显了开源模型在发布前的测试与对齐难题。
- 社区加速方案的飞跃:2023 年底至 2024 年初,以 LCM、SD Turbo 为代表的少步数甚至单步生成方案大批涌现,并被迅速整合进社区工具,在消费级硬件上实现了近乎实时的 512x512 图像生成,为视频、3D 等模态的实时生成铺平了道路。
- 版权诉讼的阶段性进展:洛杉矶联邦法官在 2023 年底对艺术家起诉 Stability AI、Midjourney 等公司的集体诉讼作出了阶段性裁决,驳回了大部分关于直接侵权的指控,理由是原告未能证明生成作品与原作存在实质性相似,但允许其就模型使用受版权保护图像进行训练的主张进行修改后重新起诉。此案仍在审理中。
14. 跟踪指标
要持续跟踪该领域的实质性进展与变化,建议关注以下量化与质性指标:
- 模型能力基准:
- GenEval / T2I-CompBench:综合考察文本到图像生成在物体存在、颜色绑定、空间关系等多维度的遵从能力,可对比 SD 各版本与竞品的零样本性能。
- 人类偏好胜率:社区自发组织的匿名模型对决平台的胜率排名,是衡量美学效果的实时动态指标。
- 社区活跃度:
- Civitai 模型上传量与下载量:直接反映 SD 开源生态的创作活力与热度。
- GitHub 相关仓库活跃指数:
AUTOMATIC1111/stable-diffusion-webui,comfyanonymous/ComfyUI,huggingface/diffusers等仓库的 Star 数、Issue 活跃度和 PR 合并频率。
- 产业商业化信号:
- Stability AI 的年经常性收入:这是衡量开源基础模型公司能否成功商业化的最核心财务指标,需关注其官方或可信媒体报道。
- 头部企业集成深度:如 Adobe 对其 Firefly 功能发布的更新频率及对其核心用户群使用数据的披露。
- 法律与监管风向:
- 关键诉讼的裁决节点:持续关注美国众多集体诉讼案中的关键判决。
- 各地立法进展:跟踪欧盟《人工智能法案》的后续补充法案、美国版权局对 AI 生成内容的最新指导意见。
15. 信源
- Rombach, R., et al. “High-Resolution Image Synthesis with Latent Diffusion Models.” Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2022.
- Ho, J., Jain, A., & Abbeel, P. “Denoising diffusion probabilistic models.” Advances in Neural Information Processing Systems 33 (NeurIPS 2020).
- Song, J., Meng, C., & Ermon, S. “Denoising Diffusion Implicit Models.” International Conference on Learning Representations (ICLR), 2021.
- Stability AI 官方新闻发布页面及其 GitHub 组织下的 SD 系列模型卡。
- Hugging Face 官方网站,Diffusers 库文档页面:https://huggingface.co/docs/diffusers
- Bloomberg Intelligence, “Generative AI to Become a $1.3 Trillion Market by 2032”, June 2023.
- Straits Research 等第三方机构关于 AI 图像生成市场的摘要分析(注:作为行业口径参考,具体数值常随预测更新)。