文生图
3 秒看懂
文生图(Text-to-Image) 是利用深度学习模型,根据自然语言描述自动生成高质量图像的技术。输入一句“一只穿着宇航服的柴犬在月球上骑自行车”,模型能综合理解语义、物体属性、空间关系与视觉风格,输出一张符合描述的、从未有过的图像。这项技术在创意设计、内容生产、视觉原型等领域正产生范式级影响。
3 分钟产业解释
文生图背后的核心技术范式中,扩散模型(Diffusion Models) 已成为绝对主线,代表性系统包括 Stable Diffusion、DALL·E 系列(2/3)和 Midjourney。其基本思想是:先对真实图像逐步添加噪声,直到完全变成高斯噪声;再让模型学习从噪声中逐步去噪恢复出图像。推理时,模型接收一段文本提示,经过文本编码器(如 CLIP 文本编码器)转换为条件向量,注入去噪网络(通常是 U‑Net 或 Transformer 架构),指导噪声被有结构地移除,最终生成语义一致的图像。
产业层面,文生图正从“玩具”走向生产力工具。其主要落地方向包括:广告创意、游戏资产生成、电商商品图、建筑概念可视化、影视分镜,以及个人创作辅助。各厂商正在解决生成速度(通过蒸馏、一步生成)、可控性(ControlNet 等空间条件控制)、多模态一致性(文字渲染、跨模态编辑)以及版权与安全等问题。生成图像的商业使用权、毒害输出过滤、训练数据授权,也成为贯穿技术落地的重要非技术议题。
15 分钟专家深入
在专家视角,文生图涉及多个子系统的精密整合:大规模多模态对比预训练(CLIP, BLIP)、文本条件驱动的扩散生成主网络、噪声调度策略、无分类器引导(CFG)以及高分辨率级联超分。训练管线的每一步都有复杂的工程与算法权衡。
文本理解与表示:早期采用 LSTM 等文本编码器,现在主流采用基于对比学习的大规模图文预训练模型(如 CLIP、OpenCLIP 或 T5)。CLIP 的文本编码器(通常是一个 Transformer)输出的归一化嵌入被馈入扩散模型的交叉注意力层,作为生成过程的语义锚点。优点是能够理解开放域概念组合;缺点是对空间关系、计数、属性绑定的精确度有限,因此后续又出现了引入大语言模型(如 T5‑XXL)或使用视觉语言模型重描述来提升语义精度的工作(DALL·E 3 流水线中的 caption upsampling)。
扩散与去噪骨干:最初的 DDPM 采用 U‑Net 作为去噪网络,通过跳跃连接保留细节,同时嵌入时间步和文本条件。最新进展中,DiT(Diffusion Transformers,如 OpenAI Sora 的图像/视频模型)直接用 ViT‑style Transformer 替代卷积 U‑Net,以更好地适应大规模、多模态条件。扩散过程的噪声调度(线性、余弦、连续时间)直接影响采样效率与图像质量;推理时使用 DDIM、DPM‑Solver 等确定性或高阶采样器,可将采样步数从 1000 步压缩至 20‑50 步,而质量损失可控。
规模化与生成速度:文生图模型参数量通常从数亿到数十亿级。SDXL 约 2.6B 参数,U‑Net 部分占主要比重;DALL·E 3 的总参数量[未充分披露]。推理速度一直是部署瓶颈,为此业界探索稀疏/量化压缩、潜空间扩散(Stable Diffusion 在压缩的 VAE 潜空间做扩散,比像素级快一个数量级以上),还有扩散蒸馏和一致性模型,能实现 1‑4 步生成,使实时交互成为可能。
评估与指标:区别于任务明确的分类,文生图的评估复杂且尚在演进。常用指标包括 FID(较低更好)衡量生成图像分布与真实图像分布的距离;CLIP Score 衡量图文对齐程度;PickScore、ImageReward 等利用人类偏好数据训练的评分模型更接近人类审美;人工评测仍被顶级模型发布所倚重。此外,精确的可控生成评测(如空间关系、计数、文本渲染)正成为新的研究基准(例如 GenAI‑Bench、T2I‑CompBench)。
技术原理(最深,讲机制+关键参数)
1. 潜空间扩散机制(以 Stable Diffusion 为例)
文生图常用 潜扩散模型(Latent Diffusion) 以降低计算需求:
- VAE 压缩:先训练一个 VAE(或 VQ‑GAN),将输入的 RGB 图像
x压缩到低维潜空间z = \mathcal{E}(x),压缩比通常在4\times到8\times空间维度。 - 前向扩散:在潜空间对
z按照噪声调度\beta_t逐步添加噪声:
z_t = \sqrt{\bar\alpha_t} \, z_0 + \sqrt{1-\bar\alpha_t} \, \epsilon, \quad \epsilon \sim \mathcal{N}(0, I)
其中 \bar\alpha_t = \prod_{s=1}^{t} (1-\beta_s) 控制信噪比。
- 去噪网络:训练一个条件 U‑Net 或 Transformer
\epsilon_\theta(z_t, t, c)来预测所添加的噪声\epsilon,其中c为文本条件嵌入。损失函数:
\mathcal{L} = \mathbb{E}_{z_0, \epsilon, t, c} \left[ \| \epsilon - \epsilon_\theta(z_t, t, c) \|_2^2 \right]
- 推理(采样):从纯噪声
z_T \sim \mathcal{N}(0,I)出发,利用训练好的\epsilon_\theta和如 DDIM 采样器迭代去噪:
z_{t-1} = \sqrt{\bar\alpha_{t-1}} \left( \frac{z_t - \sqrt{1-\bar\alpha_t} \,\epsilon_\theta}{\sqrt{\bar\alpha_t}} \right) + \sigma_t \epsilon_t
最终通过 VAE 解码器 \mathcal{D} 恢复图像 x_0' = \mathcal{D}(z_0)。
文本提示: “a cat wearing sunglasses”
│
CLIP 文本编码器
│
┌────▼────┐ 噪声 ε 去噪步骤 t=1000→0
│条件嵌入 c│─────────────┐ ┌────────────────┐
└─────────┘ ▼ ▼ ▼
┌──────────────────── U‑Net / DiT ────────────┐
│ 输入: z_t, t, c → 预测 ε_θ │
│ 输出: 去噪一步后的 z_{t-1} │
└──────────────────────┬───────────────────────┘
▼
VAE 解码器 → 图像
2. 关键参数与结构(定性)
- 文本编码器:CLIP ViT‑L/14 文本编码器(如 SD 1.x/2.x)输出 77×768 嵌入,经过交叉注意力注入 U‑Net。SDXL 使用双 CLIP 文本编码器(OpenCLIP ViT‑bigG + CLIP ViT‑L)以增强语义理解。DALL·E 3 则利用 T5‑XXL 等更大语言模型。
- 潜空间维度:例如 Stable Diffusion 1.x/2.x 潜通道数 4,下采样 8×,对于 512×512 图像潜空间为 64×64×4;SDXL 使用类似的压缩比。这样的设计使 U‑Net 的计算量相比像素级扩散降低约 64 倍。
- 无分类器引导(CFG):推理时,同时计算有条件预测
\epsilon_\theta(z_t, c)和无条件预测\epsilon_\theta(z_t, \varnothing),以插值结果生成:
\tilde\epsilon_\theta = (1 + w)\,\epsilon_\theta(z_t, c) - w\,\epsilon_\theta(z_t, \varnothing)
CFG 权重 w 通常取 5‑15,平衡保真度与多样性。过高的 w 会引起过饱和和伪影。
3. 级联超分辨率
基础扩散模型往往生成低分辨率图像(如 128×128 或 512×512),后续通过一个或多个条件扩散超分模型逐步提升到 1024×1024 或更高。超分模型也以文本为条件,并结合低分辨率图像作为辅助输入,保持与原图的语义一致性。
技术演进史
- 2015–2017,早期探索:GAN 条件图像生成(如 StackGAN、AttnGAN)可将文本描述转为低分辨率图像,但物体变形严重,组合泛化差。
- 2021,DALL·E 与 VQGAN+CLIP:OpenAI 的 DALL·E(1) 使用 VQ‑VAE 加自回归 Transformer 生成离散 tokens,展示出初步概念组合。同期 VQGAN+CLIP 开源方案使得引导式优化成为社区热点。
- 2022,扩散模型爆发:GLIDE 验证扩散模型文本条件生成的质量优势;DALL·E 2 公开,使用 CLIP 潜空间和扩散先验,将文本转化为图像嵌入再生成像素;Stable Diffusion 发布开源潜扩散模型,迅速成为生态基石;Midjourney 基于扩散模型迭代美学品质。
- 2023,可控与规模化: ControlNet、T2I‑Adapter 等即插即用模块实现对姿态、深度、边缘等的精确控制;SDXL 提升基础分辨率和概念组合能力;DALL·E 3 通过大规模重描述提升指令遵从度;LCM(潜在一致性模型)与 SD Turbo 实现少步生成。
- 2024–至今,架构融合与实时生成:DiT 架构扩散模型(如 SD3 使用 MMDiT)开始商用,结合 Flow Matching 技术;生成速度推向实时;多对象精确控制、文字渲染能力显著增强;文生图与视频生成的基础设施逐渐统一。
技术路线对比(量化表)
| 维度 | 潜扩散 (Stable Diffusion/SDXL) | 像素级扩散 (Imagen/DALL·E 2早期) | 自回归 Transformer (DALL·E 1, Parti) | 基于 DiT 的扩散 (SD3, Sora) |
|---|---|---|---|---|
| 生成空间 | VAE 潜空间(4×64×64 典型) | RGB 像素空间 (512×512×3) | 离散图像 token 序列 | 潜空间 + Transformer |
| 文本编码 | CLIP/T5 文本嵌入 | T5‑XXL 等 | 文本 token 序列 + 交叉注意力 | 冻结 LLM / CLIP 等 |
| 骨干架构 | U‑Net | U‑Net 基础 | 仅解码器 Transformer | DiT(Transformer+调制) |
| 最大常见分辨率(训练) | 1024×1024(SDXL) | 1024×1024(Imagen) | 256×256 或 512×512 token 长度 | 1024×1024 以上 |
| 推理速度(相对) | 快(潜空间、少步采样器) | 较慢(像素级迭代) | 自回归很慢 | 快,可少步到1‑4步 |
| 可控性 | 通过 ControlNet/IP‑Adapter 等生态极强 | 较少开放生态 | 可控工具较少 | 发展初期,社区快速跟进 |
| 主要代表 | Stability AI、社区 | Google(Imagen) | Google(Parti) | Stability AI(SD3)、OpenAI(Sora) |
注:上述参数为基于公开模型的一般特征,非精确硬件规格,未包含具体数字则因跨版本差异大或未充分披露。
上下游
- 上游基础资源:
- 训练数据:亿至十亿级图文对,来源于 LAION、公共网页爬取、授权图片库等。数据质量、多样性与隐私合规是关键瓶颈。
- 计算基础设施:大规模 GPU/TPU 集群训练;推理端需要高性能 GPU(消费级或云端),以支持低延迟生成。
- 预训练组件:CLIP、T5 等文本编码器,VQ‑VAE/VAE 图像压缩器,通常独立预训练后复用。
- 中游模型与工具:
- 基础模型提供商:OpenAI, Stability AI, Midjourney, Google, Meta。
- 社区工具与微调框架:Hugging Face Diffusers, ComfyUI(可视化工作流), Automatic1111(WebUI), LoRA/ControlNet 适配器,模型量化与推理加速库。
- 下游应用与平台:
- 内容生成与编辑工具:Adobe Firefly(集成文生图), Canva, Figma 插件。
- 垂直领域:游戏资产生成(Promethean AI),建筑可视化,服装图案设计,电商产品图生成。
- 服务化 API:OpenAI API(DALL·E), Stability AI API, Midjourney 订阅制,各云厂商 MaaS 平台。
关键指标
- 图像质量:
- FID(Fréchet Inception Distance):衡量生成集与参考集在 Inception 特征空间的分布距离,越低越好。Stable Diffusion 2.1 在 COCO 上的 FID 约 8.59(SDXL 进一步优化),但该指标受参考集和预处理影响大。
- CLIP Score / CLIP Score‑VQA:生成图像与文本的配对 CLIP 相似度,数值越高语义对齐越强。
- 人类偏好评分:ImageReward、PickScore,反映美学、连贯性等更高阶维度。
- 可控性与忠实度:
- T2I‑CompBench 评分:考察属性绑定、空间关系、非空间关系、计数等组合能力的基准。
- 颜色/纹理一致性:颜色直方图相似度、SSIM 等辅助指标。
- 生成效率:
- 单张生成延迟:在一张参考 GPU(如 A100 或消费级 4090)上的推理耗时,少步模型可 <1 秒。
- 吞吐量:批量生成时每秒可产出图像数。
- 参数量与模型大小:决定显存占用,影响部署成本。
供需与市场数据
(具体市场数据因无法联网检索,此处给出基于行业趋势的定性描述,均属估算。)
- 需求侧:创意设计、广告、游戏、电商领域对图像内容的需求持续高速增长。个人用户与中小团队使用 Midjourney、Stable Diffusion 多出于成本与迭代速度优势。专业领域(如品牌视觉)要求更高的可控性与版权安全。
- 供给侧:基础模型不再稀缺,开源生态(Stable Diffusion 家族、Flux 等)使广大开发者可二次开发;闭源通过 API 提供服务。关键稀缺资源转向高质量、清洗标注且合规的训练图文对,以及在特定垂直场景(如端侧部署)的高效推理方案。
- 市场规模估算:综合多家咨询机构预测,AI 图像生成市场 2023 年约在数十亿美元量级,年复合增长率约 30% 以上(依据多个行业报告预测,具体数值因口径差异较大)。但其直接货币化路径尚处早期,主要收入来自订阅、API 调用费、算力租赁与增值服务。
代表公司与资本映射
| 公司/组织 | 关键产品/模型 | 核心能力 | 资本特点 |
|---|---|---|---|
| OpenAI | DALL·E 2/3,集成 ChatGPT | 语义理解最强,重描述提升指令遵从 | 头部闭源,通过 API 和订阅变现 |
| Stability AI | Stable Diffusion系列(SDXL,SD3) | 开源生态,社区庞大,适配器丰富 | 获得过亿元融资,商业模式仍在探索 |
| Midjourney | Midjourney V6/V6.1 | 极致美学质量,自监督数据清洗 | 独立盈利,订阅制,未公开融资 |
| Google(DeepMind) | Imagen, Muse | 大规模扩散/自回归,集成于 Vertex AI | 科技巨头,算力与数据资源充沛 |
| Adobe | Firefly 图像生成系列 | 与创意工具深度整合,商业版权清晰 | 上市公司,以订阅制融入既有产品线 |
| Meta | Emu, Imagine | 社交媒体图像生成 | 大厂内部,赋能旗下产品(如Instagram) |
| [部分公司估值与融资数据未充分披露或此处略去] |
投资逻辑
- 平台型工具机会:文生图是通往通用图像/视频生成的基础设施,能掌握从底模到可控生成全栈、并建立开发者生态的公司,具备长期平台价值。
- 垂直场景深耕:单一基础模型难满足特定领域(如电商、建筑、医学)对精确性、合规性的要求;针对垂直域微调并提供完整工作流的创业公司,可能捕获高附加值利润。
- 算力与数据提供商:文生图训练需要海量 GPU 算力和合规图文对,算力云、高质量数据授权和清洗服务存在中期机遇。
- 风险点:
- 技术快速迭代可能使专用模型丧失差异化;
- 版权与监管不确定性(生成内容权属、训练数据来源);
- 开源模型压低 API 定价天花板;
- 用户留存和粘性考验。
常见误读纠偏(≥2)
-
“文生图就是拿拼接库里的图片” 纠正:扩散模型并不是从数据库中剪切和融合现有图像。它通过学习图像与噪声之间的映射,在噪声空间进行有条件的概率采样,最终解码出全新像素构成。相同提示每次生成结果也不同,证明了其生成性。但模型确实会反映训练数据分布中的共现模式,可能产生与知名作品风格类似但非直接拷贝的图像。
-
“参数量越大越好,图像质量一定越高” 纠正:参数规模提升有助于捕获更丰富的概念和细节,但架构设计、数据质量、噪声调度和采样器选择同等重要。例如早期 Google Imagen 像素级扩散参数巨大,而 Stable Diffusion 使用潜空间扩散,参数较小但效率极高。模型蒸馏、架构改进(如引入 Transformer)同样可以在较少参数下达到 SOTA 性能。简单追求参数量而忽略训练数据和算法创新,并非高质量生成的充分条件。
学习路径
- 入门:
- 理解扩散模型直觉:阅读“Diffusion Models: A Comprehensive Survey”或 Lilian Weng 博客“What are Diffusion Models?”。
- 体验工具:使用 Midjourney、Stable Diffusion WebUI 或 DALL·E 直观理解输入输出关系。
- 动手实践:
- 运行 Hugging Face Diffusers 示例 notebook,训练一个简单条件扩散模型(如 CIFAR‑10 文本到图像微缩版);尝试用 LoRA 微调 SD 模型。
- 学习提示词工程与 ControlNet,理解文本嵌入与空间条件注入。
- 深入理论:
- 研究 DDPM/DDIM/Score‑based SDE 理论、潜扩散论文(Latent Diffusion Models)、DiT 与一致性模型。
- 阅读 CLIP、T5 等多模态表征成果;掌握 VAE 变分推断基础。
- 系统与部署:
- 了解模型量化(GGML, ONNX)与推理加速(TensorRT, OneFlow),部署于云或边缘设备。
- 关注模型安全与过滤机制;学习法律和伦理问题(版权、偏见)。
一句话总结
文生图以扩散模型为核心动力,通过对多模态语义的深层理解与随机去噪过程的精巧控制,正在从创意辅助进化为数字内容生产的基础能力。
延伸阅读与来源
- 核心论文:
- Rombach et al. “High-Resolution Image Synthesis with Latent Diffusion Models” (Stable Diffusion 基础)
- Ho et al. “Denoising Diffusion Probabilistic Models”
- Peebles & Xie “Scalable Diffusion Models with Transformers” (DiT)
- Saharia et al. “Imagen: Photorealistic Text-to-Image Diffusion Models”
- 经典博客与综述:
- Lilian Weng, “What are Diffusion Models?” (lilianweng.github.io)
- Hugging Face Diffusers 官方文档
- 基准与评测:
- T2I-CompBench, GenAI-Bench, PartiPrompts
- 行业报告:
- 各咨询机构 AI 生成图像市场展望(数据口径差异大,参考时需交叉验证)
- 注:以上技术内容基于截至 2025 年初已公开的论文、模型发布及社区知识,未包含未公开的企业内部细节。所有涉及的具体数量级均为基于公开信息的估算或定性描述。