Outpainting
1. 3秒看懂
Outpainting是一种AI图像生成技术,根据图片已有边缘内容,向外智能预测并生成原本不存在的像素,实现画布的连续扩展与重构图。
2. 3分钟产业解释
技术基础:以扩散模型(如Stable Diffusion系列)为核心,结合语义理解、上下文一致性和可控引导,从图像边界向外推理补全。 产业链定位:
- 上游:算力芯片与云基础设施、基座模型研发、高质量合规训练数据集。
- 中游:图像扩展的专业软件插件、开源工作流工具、API与模型即服务(MaaS)平台。
- 下游:影视概念设计、电商营销素材、游戏场景扩展、广告创意、摄影后期等行业应用。 链cloud协同模式:指将一次Outpainting生成任务按计算复杂度拆分为链端(端侧/边缘/本地)执行与云端执行两部分。例如,链端运行轻量去噪前几步、提取边缘或控制信号,云端执行核心扩散步与高分辨率解码。这样既保护用户数据隐私、降低延迟,又集中利用云端大模型能力。
3. 技术原理
3.1 扩散模型基座
主流Outpainting基于潜空间扩散模型(Latent Diffusion Model)。图像先被编码成低维潜向量,再通过逐步去噪生成新的潜表示,最终解码为像素。训练时,模型会学习未遮盖区域与已扩展全图的映射规律,推理时以原始图像区域为已知条件,从纯噪声或部分噪声中重建全图的潜空间,实现向外扩展。
3.2 上下文一致性与无缝融合
单纯的模型容易产生边缘宽影、纹理错位或风格偏移。为此,算法层引入了:
- 掩码与羽化:对要生成的区域施加软边界掩码,重叠部分进行符合泊松混合的融合。
- ControlNet与边缘引导:利用原图边缘、深度图、法线图等作为附加条件,约束新增部分的结构连续性。尤其在建筑、室内场景中,线性结构的延长必须符合透视。
- 交叉注意力与提示词:通过文本提示描述期望的扩展内容,约束新增物体的语义。
3.3 链cloud切分原理
在链cloud模式下,生成管道可在UNet去噪网络的中间层实现分割。例如:
- 链端(本地PC/手机):运行前10%~20%的去噪步,完成初步的布局生成,并发送潜向量与部分中间激活到云端。
- 云端:加载完整的大参数扩散模型,继续执行后80%的去噪和高分辨率解码,并可叠加ControlNet等额外控制。
- 结果回传:云端将扩展后的图像或额外潜向量下发,链端再做局部后处理。这样只需传输少量潜向量,极大节约带宽,同时保留端侧的实时交互感。当前已有开源方案(如基于Stable Diffusion的串行切分)探索该流水线。
3.4 质量优化技术
- 逐步扩展(Outpainting mk2):避免一次扩展过大导致结构混乱,常采用小块逐步“滚动”向外,并融合接缝。
- 颜色与光线匹配:在潜空间引入频率感知损失,减少原图与生成区域的色温、对比度差异。
- 多模态条件:可提供参考风格图或语义分割图,约束扩展区域与主体风格统一。
4. 关键参数
Outpainting实现(如Stable Diffusion WebUI拓展、ComfyUI节点、Photoshop生成式扩展)中,影响结果的核心参数如下:
- 扩展像素量(Pixels to expand):单次在四周增加的像素数,用像素或百分比表示。过大会导致生成物逻辑崩坏,推荐每次扩展原图尺寸的25%~50%。
- 重绘去噪强度(Denoising strength):决定生成区域保留原图暗示的程度。0.6~0.8常用:过低产生模糊,过高导致脱离原图。
- 掩码模糊(Mask blur):控制原图与生成区域的过渡羽化,以像素为单位,通常设为扩展像素的5%~10%可减少硬边。
- 提示词引导系数(CFG scale):数值越高生成越严格遵循文字提示,但7~12范围内更易保持与原图的一致性。
- 采样步数:20~50步通常平衡质量与速度。特殊蒸馏模型可用4~8步。
- ControlNet控制强度:如果附加边缘/深度控制,强度一般设为0.8~1.0以保持结构延伸。
- 分辨率与长宽比约束:扩展后图的总分辨率不应超出模型训练常见范围(如1024×1024),否则需配合超分模型等处理。
- 链cloud本地运算比例(部分定制流程):可调节本地去噪步数以匹配设备算力,典型本地推理步数占总步数10%~20%。
5. 技术路线
业界Outpainting可分为以下技术路线,各自代表不同的演进方向:
- 基于扩散的掩码模型路线:以Stable Diffusion的Inpaint/Outpaint模式为代表,经典潜变量扩散,通过替换已知区域为原图噪声实现向外延伸。支持ControlNet、IP-Adapter等插件,生态最丰富。
- 原生多模态扩散路线:如DALL·E 2/3通过CLIP嵌入和级联扩散实现向外扩展,但OpenAI未单独开放Outpainting API,仅在ChatGPT的DALL·E 3界面提供有限扩展功能。
- 上下文感知自回归扩展:Google Parti等利用Transformer序列预测图像Token,实现逐步向外推进。扩展逻辑一致但推理开销大。
- GAN快速扩展:早期如DeepFill采用生成对抗网络,速度极快但语义约束弱,已逐渐被扩散法替代。
- 一致性模型加速路线:潜在一致性模型(LCM)可将扩散去噪步数压缩至4步以内,正被集成到ComfyUI等工具中,有望在链端侧实现秒级扩展。
- 无掩码整体生成:例如Midjourney的“Zoom Out”或“Pan”功能,不严格定义扩展边界,而是依靠内在语义向外重新绘制全景,更偏向创意扩展。
中国科技公司多选择基于开源扩散模型的微调路线,通过加入中文提示词理解、万物识别和电商专用模板来构建自有产品。
6. 上游
6.1 算力芯片与云基础设施
- GPU:NVIDIA处于绝对主导地位。据其FY2024年报(截至2024年1月),数据中心收入达到475亿美元,同比增长217%,主要受大规模生成式AI训练和推理驱动。A100、H100为训练主力,L40S等推理卡在Outpainting推理中逐步铺开。
- 云算力:AWS、Azure、Google Cloud均推出GPU实例服务扩散模型推理。国内阿里云、华为云、腾讯云提供类似GPU容器实例,支持一键部署ComfyUI等服务。
- 国产替代:华为昇腾910B等国产计算卡已适配扩散模型部分算子,但在生态兼容性和推理速度上仍有差距,处于追赶期。
6.2 基座模型
- Stability AI:开源SD 1.5/2.1/XL/3系列,构成最大开放模型基座,2023年7月发布的SDXL 1.0将原生分辨率提升至1024×1024,Outpainting效果显著改善。2024年发布Stable Diffusion 3,改进文本遵从度与手部结构。
- Midjourney:闭源模型,基于自研扩散架构,在美学风格上极强。V6版本增强了对画面延展和Zoom Out的连贯性。
- Adobe Firefly:闭源,强调训练数据全部来自Adobe Stock或已授权/公开许可内容,商业安全性高。Firefly Image 3模型(2024年4月发布)大幅提升生成扩展细节。
- 国内模型:阿里通义万相、百度文心一格、腾讯混元、字节Dreamina等均自研或基于开源模型二次开发,支持中文图像扩展。
6.3 训练数据集
- 数据规模:SD 1.5基于LAION-2B子集,数十亿图文对;SDXL使用的数据集包含更高分辨率;Midjourney数据来源未完全公开。
- 数据合规:建立无版权风险的数据集成为关键壁垒。Adobe用自有素材库;一些企业使用Shutterstock伙伴数据;国内厂商多自采并清洗。
7. 下游
Outpainting需求主要集中在内容生产工具的效率提升。
- 广告与电商:自动生成不同横竖比例的推广图。阿里妈妈在2023年双十一期间,AIGC辅助生成素材超过数亿张,特定场景下创意生成成本降低约70%(来源:阿里妈妈2023年公开数据)。
- 影视与概念设计:快速延展海报背景、科幻场景,缩短概念设计周期。部分剧组使用Midjourney+扩展生成气氛图,提升前期效率约30%–50%(行业从业者调研估算,公开资料未见系统量化报告)。
- 游戏开发:从一张小幅原画快速铺满大地图或UI背景,同时在保持风格前提下生成连续纹理。游戏外包与美术团队日常工具中已集成ComfyUI Outpainting节点。
- 摄影与建筑可视化:扩展画面纠正构图,或根据室内一角生成完整的房间布局。建筑软件(如SketchUp渲染插件)开始融合Outpainting加速方案图生成。
- 教育与科普内容:根据局部插图生成完整场景,减少从头绘制的时间成本。
8. 受益公司
以下公司、机构因技术需求或功能集成而更直接参与Outpainting价值链,仅作产业梳理,不构成任何买卖或投资建议。
- Adobe:在Photoshop(Beta)中深度集成“生成式扩展”,2024财年第一季度数字媒体部门年化经常性收入(ARR)达到约150亿美元(来源:Adobe 2024Q1财报)。利用Firefly合规数据训练,巩固专业用户市场。
- Stability AI:作为开源扩散核心贡献者,SD生态催生了无数Outpainting插件。商业模式为会员订阅API和模型授权,但2023–2024年面临营收压力。
- Midjourney:凭借强大的扩展和平移功能吸引创意人群,采取月费订阅制。公司2023年宣布达到数亿美元年收入(来源:公开访谈),用户基数庞大。
- NVIDIA:硬件直接受益于所有扩散模型推理和训练。除GPU硬件外,还推出Picasso云服务,提供预置扩展功能的API,面向企业。
- Canva:整合AI图像扩展,2023年推出Magic Expand,帮助用户适配设计排版。Canva月活用户超1.5亿(来源:Canva 2023年公告),扩展功能提升其排版的智能化。
- 中国公司:阿里巴巴(通义万相)、百度(文心一格)、腾讯(混元大模型相关工具)、字节跳动(Dreamina)均提供图像扩展能力;美图公司依托影像应用内AI拓展功能,提升用户粘性。智象未来、影眸科技等创业公司也提供垂直服务。各公司实际来自Outpainting的收入公开资料未见独立披露。
9. 市场规模
目前公开资料未见权威机构单独拆分Outpainting市场规模。可结合相关市场测度作为参考:
- 根据MarketsandMarkets 2023年7月发布的研究报告,全球AI图像生成市场2023年估值约为4.4亿美元,预计到2030年将增长至超过30亿美元,年复合增长率约31.2%。该报告将Outpainting与Inpainting归为同一功能类别计入内。
- 结构关联:IDC在2023年10月预测,2023年全球企业在生成式AI领域的支出约为194亿美元,2027年将达1511亿美元(来源:IDC全球生成式AI支出指南)。图像生成是其中子方向。
- 电商、广告素材是Outpainting最先落地的场景,仅中国电商经营年度营销素材生成量以百亿计。AIGC渗透率快速提升中,但由于无法拆分功能贡献,难以量化单一Outpainting市占率。
10. 玩家对比
(对比基于公开信息,截止2024年7月,定位功能侧重、商业模式与生态。)
- Adobe Firefly vs Photoshop 生成式扩展:
- 定位:高度专业的图像编辑集成,直接服务于摄影师、设计师。
- 优势:与PS工具无缝结合,可选扩展类型,支持生成式图层;训练数据合规,适合商用。
- 限制:需订阅Creative Cloud,按点数计生成量。生成的艺术性不如Midjourney。
- Stable Diffusion生态 (WebUI/ComfyUI):
- 定位:极客、开发者与工作室的自定义工作流。
- 优势:开源、完全可定制,搭配ControlNet等可实现精准控制;无内容限制(本地部署)。
- 限制:上手门槛较高,默认美学需人工调校;商用需自主确保模型许可合规。
- Midjourney:
- 定位:艺术创意与概念探索。
- 优势:独家美学,Zoom Out和Pan功能连贯性极佳,图片质量感知突出。
- 限制:只能通过Discord或Web Alpha使用,精细控制弱,不利于精确延伸特定结构。
- OpenAI DALL·E 3:
- 定位:ChatGPT内辅助理解并生成扩展,非独立Outpainting工具。
- 优势:强语义理解,适合复杂提示。
- 限制:扩展无法精细控制边界、无专用API。
- 中国厂商:
- 通义万相、文心一格、腾讯混元、Dreamina:普遍内嵌图像扩展功能,支持中文关键词,在中文电商素材场景中体验贴近本地需求。多数通过免费+部分额度变现,商业化仍在初期。
- 美图WHEE等:偏向移动端、轻量级扩展,适合快速社交媒体改图。
综合看,Outpainting的差异化壁垒在于:原生模型的风格一致性、可控性工具的成熟度,以及训练数据的合规性。
11. 风险
- 版权与训练数据合规性:大量模型使用网络图片训练,艺术家与版权方已提起诉讼。若未来判例强制删除“污染”模型,可能带来技术回溯与合规成本。
- 深度伪造与虚假信息:Outpainting可用于伪造历史照片全景、扩展犯罪现场图像,引发舆论风险和伦理问题。各国监管正向生成式内容标识、水印方向推进。
- 偏见与毒害内容放大:模型可能扩展出不适当或偏见的元素,甚至将原图中的人物、符号扭曲成敏感内容,造成传播风险。
- 职业替代与行业冲击:初级修图师、素材拼接岗位面临效率替代风险,部分平台摄影素材授权价值下降,引发从业者抵制。
- 链cloud协同的数据安全:如果链端将局部图像潜向量传输至云端,可能泄露用户隐私或商业素材。端到端加密与差分隐私技术尚未在Outpainting场景普及。
- 高能耗与碳排放:一次高分辨率扩展去噪几十步,单次推理耗能不可忽视,规模化应用对碳足迹有积压效应。
12. 误读纠偏
- 误读1:“Outpainting就是内容识别缩放或智能填充”:实际上,传统内容识别缩放基于局部像素复制和缝合,而Outpainting需要理解全局语义生成从未存在的新物体和背景,技术复杂度高出许多。
- 误读2:“端侧Outpainting总是又快又好”:纯本地运行大扩散模型依赖高性能GPU,轻量设备上仅能运行极小模型,扩展质量会明显下降,链cloud模式正为此折中。
- 误读3:“生成的扩展部分随意商用,不侵犯版权”:不同模型的许可条款不同。例如SD基础模型曾受版权争议;Midjourney付费会员可商用但模型数据来源仍受质疑;只有明确使用合规训练的模型(如Adobe Firefly)才可能提供较可靠的商业保护。
- 误读4:“Outpainting百分百保持原图不变”:为了让整体融合自然,算法可能微调原图边缘的像素,并非绝对无损。若原图区域完全冻结不可更改,有时会造成割裂感,需额外处理。
- 误读5:“Outpainting可以无限扩展,自动生成整个街景”:实际上迭代扩展容易积累误差、结构漂移,多次滚动后人物、建筑比例易失准,需要人工修正。
13. 最新事件
(事件选取截至2024年7月公开信息,仅反映技术产品发布与生态动向)
- 2023年7月:Stability AI发布SDXL 1.0,显著提升高分辨率下Outpainting质量。
- 2023年8月:阿里巴巴旗下阿里妈妈在年度大会公布AI创意生成成本降低70%,其中图像扩展为重点功能。
- 2023年11月:Meta发布Emu Edit模型,支持指令式图像编辑和扩展;加拿大Onto宣布可技术重现外部环境扩展。
- 2023年12月:欧盟就《人工智能法案》达成政治协议,对生成式AI提出透明度义务,包括标识AI生成内容,影响Outpainting应用合规。
- 2024年1月:Midjourney推出V6版本,进一步优化Pan和Zoom Out功能。
- 2024年2月:OpenAI在DALL·E 3中开放ChatGPT内的图像生成,部分扩展能力借助自然语言交互,但仍未开放专用API。
- 2024年4月:Adobe发布Firefly Image 3模型,全面集成到Photoshop;在心理与专业测试中,生成扩展的逼真度领先同类闭源产品。
- 2024年5月:百度文心一格升级,增强“画面延展”功能的控制力;Stability AI发布Stable Diffusion 3和Stable Assistant API,Outpainting成为标准输出能力。
- 2024年6月:ComfyUI社区出现大量链cloud工作流示例,将去噪过程拆分成本地和远程推理,并在消费级硬件上展示实时扩展预览。
14. 跟踪指标
跟踪Outpainting产业发展可关注以下可观测指标:
- 技术迭代指标:Stable Diffusion主要版本发布频次,开源社区(Hugging Face)中Inpaint/Outpaint相关模型上传量;arXiv每月新增扩散模型论文数。
- 产品与用户指标:Adobe Creative Cloud订阅用户数与数字媒体ARR季度增长;Midjourney官方订阅服务器成员数;ComfyUI GitHub标星数(2024年7月已超5万,代表工作流行度)。
- 行业渗透指标:国内主流电商平台“AIGC商品图”功能使用率披露;海内外相机/修图App(如美图秀秀、Lensa)新增“扩展”功能后的下载量变化;设计素材平台中AI生成图片上架比例。
- 算力与成本指标:云GPU渲染服务(如Lambda Labs、vast.ai)的价格波动;主流推理卡在Outpainting上的吞吐指标;SDXL or SD3在A100单卡每次扩展的成本。
- 法律与政策指标:主要司法辖区(美、欧、中)关于AI生成内容标识与训练数据版权判例;大型版权方与AI公司的诉讼进展。
- 资本市场指标(仅作产业景气参考,不构成投资建议):AIGC领域风险投资季度金额和笔数(来源:CB Insights或IT桔子),聚焦图像生成工具类的投融资事件。
15. 信源
- Stability AI官方技术报告(SDXL、SD3),https://stability.ai/research
- Adobe Firefly与Photoshop更新公告,https://blog.adobe.com
- Midjourney官方公告与Discord更新日志
- MarketsandMarkets, “AI Image Generator Market” report, July 2023
- IDC, Worldwide Generative AI Spending Guide, October 2023
- 英伟达FY2024年报,2024年2月发布
- 阿里巴巴集团2023年双十一AIGC材料公开报道,阿里妈妈官方
- 欧委会人工智能法案进程公告, December 2023
- ComfyUI GitHub repository,https://github.com/comfyanonymous/ComfyUI
- 各公司(百度、腾讯、字节、美图)产品官方说明与媒体采访