概念庫 開放閱讀

Outpainting

概念庫 · 開放閱讀

概念 ID
outpainting
更新時間
2026-06-03
來源數量
1

Outpainting

1. 3秒看懂

Outpainting是一種AI影像生成技術,根據圖片已有邊緣內容,向外智慧預測並生成原本不存在的畫素,實現畫布的連續擴充套件與重構圖。

2. 3分鐘產業解釋

技術基礎:以擴散模型(如Stable Diffusion系列)為核心,結合語義理解、上下文一致性和可控引導,從影像邊界向外推論補全。 產業鏈定位

  • 上游:算力晶片與雲端基礎設施、基座模型研發、高質量合規訓練資料集。
  • 中游:影像擴充套件的專業軟體外掛、開源工作流工具、API與模型即服務(MaaS)平台。
  • 下游:影視概念設計、電商營銷素材、遊戲場景擴充套件、廣告創意、攝影後期等行業應用。 鏈cloud協同模式:指將一次Outpainting生成任務按計算複雜度拆分為鏈端(端側/邊緣/本地)執行與雲端端執行兩部分。例如,鏈端執行輕量去噪前幾步、提取邊緣或控制訊號,雲端端執行核心擴散步與高解析度解碼。這樣既保護使用者資料隱私、降低延遲,又集中利用雲端端大型模型能力。

3. 技術原理

3.1 擴散模型基座

主流Outpainting基於潛空間擴散模型(Latent Diffusion Model)。影像先被編碼成低維潛向量,再通過逐步去噪生成新的潛表示,最終解碼為畫素。訓練時,模型會學習未遮蓋區域與已擴充套件全圖的對映規律,推論時以原始影像區域為已知條件,從純噪聲或部分噪聲中重建全圖的潛空間,實現向外擴充套件。

3.2 上下文一致性與無縫融合

單純的模型容易產生邊緣寬影、紋理錯位或風格偏移。為此,演算法層引入了:

  • 掩碼與羽化:對要生成的區域施加軟邊界掩碼,重疊部分進行符合泊松混合的融合。
  • ControlNet與邊緣引導:利用原圖邊緣、深度圖、法線圖等作為附加條件,約束新增部分的結構連續性。尤其在建築、室內場景中,線性結構的延長必須符合透視。
  • 交叉注意力與提示詞:通過文本提示描述期望的擴充套件內容,約束新增物體的語義。

3.3 鏈cloud切分原理

在鏈cloud模式下,生成管道可在UNet去噪網路的中間層實現分割。例如:

  • 鏈端(本地PC/手機):執行前10%~20%的去噪步,完成初步的版面配置生成,併發送潛向量與部分中間啟用到雲端端。
  • 雲端端:載入完整的大引數擴散模型,繼續執行後80%的去噪和高解析度解碼,並可疊加ControlNet等額外控制。
  • 結果回傳:雲端端將擴充套件後的影像或額外潛向量下發,鏈端再做區域性後處理。這樣只需傳輸少量潛向量,極大節約頻寬,同時保留端側的即時互動感。當前已有開源方案(如基於Stable Diffusion的序列切分)探索該流水線。

3.4 質量最佳化技術

  • 逐步擴充套件(Outpainting mk2):避免一次擴充套件過大導致結構混亂,常採用小塊逐步“滾動”向外,並融合接縫。
  • 顏色與光線匹配:在潛空間引入頻率感知損失,減少原圖與生成區域的色溫、對比度差異。
  • 多模態條件:可提供參考風格圖或語義分割圖,約束擴充套件區域與主體風格統一。

4. 關鍵引數

Outpainting實現(如Stable Diffusion WebUI拓展、ComfyUI節點、Photoshop生成式擴充套件)中,影響結果的核心引數如下:

  • 擴充套件畫素量(Pixels to expand):單次在四周增加的畫素數,用畫素或百分比表示。過大會導致生成物邏輯崩壞,推薦每次擴充套件原圖尺寸的25%~50%。
  • 重繪去噪強度(Denoising strength):決定生成區域保留原圖暗示的程度。0.6~0.8常用:過低產生模糊,過高導致脫離原圖。
  • 掩碼模糊(Mask blur):控制原圖與生成區域的過渡羽化,以畫素為單位,通常設為擴充套件畫素的5%~10%可減少硬邊。
  • 提示詞引導係數(CFG scale):數值越高生成越嚴格遵循文字提示,但7~12範圍內更易保持與原圖的一致性。
  • 取樣步數:20~50步通常平衡質量與速度。特殊蒸餾模型可用4~8步。
  • ControlNet控制強度:如果附加邊緣/深度控制,強度一般設為0.8~1.0以保持結構延伸。
  • 解析度與長寬比約束:擴充套件後圖的總解析度不應超出模型訓練常見範圍(如1024×1024),否則需配合超分模型等處理。
  • 鏈cloud本地運算比例(部分定製流程):可調節本地去噪步數以匹配裝置算力,典型本地推論步數佔總步數10%~20%。

5. 技術路線

業界Outpainting可分為以下技術路線,各自代表不同的演進方向:

  • 基於擴散的掩碼模型路線:以Stable Diffusion的Inpaint/Outpaint模式為代表,經典潛變數擴散,通過替換已知區域為原圖噪聲實現向外延伸。支援ControlNet、IP-Adapter等外掛,生態最豐富。
  • 原生多模態擴散路線:如DALL·E 2/3通過CLIP嵌入和級聯擴散實現向外擴充套件,但OpenAI未單獨開放Outpainting API,僅在ChatGPT的DALL·E 3介面提供有限擴充套件功能。
  • 上下文感知自迴歸擴充套件:Google Parti等利用Transformer序列預測影像Token,實現逐步向外推進。擴充套件邏輯一致但推論開銷大。
  • GAN快速擴充套件:早期如DeepFill採用生成對抗網路,速度極快但語義約束弱,已逐漸被擴散法替代。
  • 一致性模型加速路線:潛在一致性模型(LCM)可將擴散去噪步數壓縮至4步以內,正被整合到ComfyUI等工具中,有望在鏈端側實現秒級擴充套件。
  • 無掩碼整體生成:例如Midjourney的“Zoom Out”或“Pan”功能,不嚴格定義擴充套件邊界,而是依靠內在語義向外重新繪製全景,更偏向創意擴充套件。

中國科技公司多選擇基於開源擴散模型的微調路線,通過加入中文提示詞理解、萬物識別和電商專用模板來建置自有產品。

6. 上游

6.1 算力晶片與雲端基礎設施

  • GPU:NVIDIA處於絕對主導地位。據其FY2024年報(截至2024年1月),資料中心營收達到475億美元,年增率增長217%,主要受大規模生成式AI訓練和推論驅動。A100、H100為訓練主力,L40S等推論卡在Outpainting推論中逐步鋪開。
  • 雲端算力:AWS、Azure、Google Cloud均推出GPU例項服務擴散模型推論。國內阿里雲端、華為雲端、騰訊雲端提供類似GPU容器例項,支援一鍵部署ComfyUI等服務。
  • 國產替代:華為昇騰910B等國產計算卡已適配擴散模型部分運算元,但在生態相容性和推論速度上仍有差距,處於追趕期。

6.2 基座模型

  • Stability AI:開源SD 1.5/2.1/XL/3系列,構成最大開放模型基座,2023年7月釋出的SDXL 1.0將原生解析度提升至1024×1024,Outpainting效果顯著改善。2024年釋出Stable Diffusion 3,改進文本遵從度與手部結構。
  • Midjourney:閉源模型,基於自研擴散架構,在美學風格上極強。V6版本增強了對畫面延展和Zoom Out的連貫性。
  • Adobe Firefly:閉源,強調訓練資料全部來自Adobe Stock或已授權/公開許可內容,商業安全性高。Firefly Image 3模型(2024年4月釋出)大幅提升生成擴充套件細節。
  • 國內模型:阿里通義萬相、百度文心一格、騰訊混元、位元組Dreamina等均自研或基於開源模型二次開發,支援中文影像擴充套件。

6.3 訓練資料集

  • 資料規模:SD 1.5基於LAION-2B子集,數十億圖文對;SDXL使用的資料集包含更高解析度;Midjourney資料來源未完全公開。
  • 資料合規:建立無版權風險的資料整合為關鍵壁壘。Adobe用自有素材庫;一些企業使用Shutterstock夥伴資料;國內廠商多自採並清洗。

7. 下游

Outpainting需求主要集中在內容生產工具的效率提升。

  • 廣告與電商:自動生成不同橫豎比例的推廣圖。阿里媽媽在2023年雙十一期間,AIGC輔助生成素材超過數億張,特定場景下創意生成成本降低約70%(來源:阿里媽媽2023年公開資料)。
  • 影視與概念設計:快速延展海報背景、科幻場景,縮短概念設計週期。部分劇組使用Midjourney+擴充套件生成氣氛圖,提升前期效率約30%–50%(行業從業者調研估算,公開資料未見系統量化報告)。
  • 遊戲開發:從一張小幅原畫快速鋪滿大地圖或UI背景,同時在保持風格前提下生成連續紋理。遊戲外包與美術團隊日常工具中已整合ComfyUI Outpainting節點。
  • 攝影與建築視覺化:擴充套件畫面糾正構圖,或根據室內一角生成完整的房間版面配置。建築軟體(如SketchUp渲染外掛)開始融合Outpainting加速方案圖生成。
  • 教育與科普內容:根據區域性插圖生成完整場景,減少從頭繪製的時間成本。

8. 受益公司

以下公司、機構因技術需求或功能整合而更直接參與Outpainting價值鏈,僅作產業梳理,不構成任何買賣或投資建議

  • Adobe:在Photoshop(Beta)中深度整合“生成式擴充套件”,2024財年第一季度數字媒體部門年化經常性營收(ARR)達到約150億美元(來源:Adobe 2024Q1財報)。利用Firefly合規資料訓練,鞏固專業使用者市場。
  • Stability AI:作為開源擴散核心貢獻者,SD生態催生了無數Outpainting外掛。商業模式為會員訂閱API和模型授權,但2023–2024年面臨營收壓力。
  • Midjourney:憑藉強大的擴充套件和平移功能吸引創意人群,採取月費訂閱制。公司2023年宣佈達到數億美元年營收(來源:公開訪談),使用者基數龐大。
  • NVIDIA:硬體直接受益於所有擴散模型推論和訓練。除GPU硬體外,還推出Picasso雲端服務,提供預置擴充套件功能的API,面向企業。
  • Canva:整合AI影像擴充套件,2023年推出Magic Expand,幫助使用者適配設計排版。Canva月活使用者超1.5億(來源:Canva 2023年公告),擴充套件功能提升其排版的智慧化。
  • 中國公司:阿里巴巴(通義萬相)、百度(文心一格)、騰訊(混元大型模型相關工具)、字節跳動(Dreamina)均提供影像擴充套件能力;美圖公司依託影像應用內AI拓展功能,提升使用者粘性。智象未來、影眸科技等創業公司也提供垂直服務。各公司實際來自Outpainting的營收公開資料未見獨立揭露。

9. 市場規模

目前公開資料未見權威機構單獨拆分Outpainting市場規模。可結合相關市場測度作為參考:

  • 根據MarketsandMarkets 2023年7月釋出的研究報告,全球AI影像生成市場2023年估值約為4.4億美元,預計到2030年將增長至超過30億美元,年複合增長率約31.2%。該報告將Outpainting與Inpainting歸為同一功能類別計入內。
  • 結構關聯:IDC在2023年10月預測,2023年全球企業在生成式AI領域的支出約為194億美元,2027年將達1511億美元(來源:IDC全球生成式AI支出指南)。影像生成是其中子方向。
  • 電商、廣告素材是Outpainting最先落地的場景,僅中國電商經營年度營銷素材生成量以百億計。AIGC滲透率快速提升中,但由於無法拆分功能貢獻,難以量化單一Outpainting市佔率。

10. 玩家對比

(對比基於公開資訊,截止2024年7月,定位功能側重、商業模式與生態。)

  • Adobe Firefly vs Photoshop 生成式擴充套件
    • 定位:高度專業的影像編輯整合,直接服務於攝影師、設計師。
    • 優勢:與PS工具無縫結合,可選擴充套件型別,支援生成式圖層;訓練資料合規,適合商用。
    • 限制:需訂閱Creative Cloud,按點數計生成量。生成的藝術性不如Midjourney。
  • Stable Diffusion生態 (WebUI/ComfyUI)
    • 定位:極客、開發者與工作室的自定義工作流。
    • 優勢:開源、完全可定製,搭配ControlNet等可實現精準控制;無內容限制(本地部署)。
    • 限制:上手門檻較高,預設美學需人工調校;商用需自主確保模型許可合規。
  • Midjourney
    • 定位:藝術創意與概念探索。
    • 優勢:獨家美學,Zoom Out和Pan功能連貫性極佳,圖片質量感知突出。
    • 限制:只能通過Discord或Web Alpha使用,精細控制弱,不利於精確延伸特定結構。
  • OpenAI DALL·E 3
    • 定位:ChatGPT內輔助理解並生成擴充套件,非獨立Outpainting工具。
    • 優勢:強語義理解,適合複雜提示。
    • 限制:擴充套件無法精細控制邊界、無專用API。
  • 中國廠商
    • 通義萬相、文心一格、騰訊混元、Dreamina:普遍內嵌影像擴充套件功能,支援中文關鍵詞,在中文電商素材場景中體驗貼近本地需求。多數通過免費+部分額度變現,商業化仍在初期。
    • 美圖WHEE等:偏向行動端、輕量級擴充套件,適合快速社交媒體改圖。

綜合看,Outpainting的差異化壁壘在於:原生模型的風格一致性、可控性工具的成熟度,以及訓練資料的合規性。

11. 風險

  • 版權與訓練資料合規性:大量模型使用網路圖片訓練,藝術家與版權方已提起訴訟。若未來判例強制刪除“汙染”模型,可能帶來技術回溯與合規成本。
  • 深度偽造與虛假資訊:Outpainting可用於偽造歷史照片全景、擴充套件犯罪現場影像,引發輿論風險和倫理問題。各國監管正向生成式內容標識、水印方向推進。
  • 偏見與毒害內容放大:模型可能擴展出不適當或偏見的元素,甚至將原圖中的人物、符號扭曲成敏感內容,造成傳播風險。
  • 職業替代與行業衝擊:初級修圖師、素材拼接崗位面臨效率替代風險,部分平台攝影素材授權價值下降,引發從業者抵制。
  • 鏈cloud協同的資料安全:如果鏈端將區域性影像潛向量傳輸至雲端端,可能洩露使用者隱私或商業素材。端到端加密與差分隱私技術尚未在Outpainting場景普及。
  • 高能耗與碳排放:一次高解析度擴充套件去噪幾十步,單次推論耗能不可忽視,規模化應用對碳足跡有積壓效應。

12. 誤讀糾偏

  • 誤讀1:“Outpainting就是內容識別縮放或智慧填充”:實際上,傳統內容識別縮放基於區域性畫素複製和縫合,而Outpainting需要理解全域性語義生成從未存在的新物體和背景,技術複雜度高出許多。
  • 誤讀2:“端側Outpainting總是又快又好”:純本地執行大擴散模型依賴高效能GPU,輕量裝置上僅能執行極小模型,擴充套件質量會明顯下降,鏈cloud模式正為此折中。
  • 誤讀3:“生成的擴充套件部分隨意商用,不侵犯版權”:不同模型的許可條款不同。例如SD基礎模型曾受版權爭議;Midjourney付費會員可商用但模型資料來源仍受質疑;只有明確使用合規訓練的模型(如Adobe Firefly)才可能提供較可靠的商業保護。
  • 誤讀4:“Outpainting百分百保持原圖不變”:為了讓整體融合自然,演算法可能微調原圖邊緣的畫素,並非絕對無損。若原圖區域完全凍結不可更改,有時會造成割裂感,需額外處理。
  • 誤讀5:“Outpainting可以無限擴充套件,自動生成整個街景”:實際上迭代擴充套件容易積累誤差、結構漂移,多次滾動後人物、建築比例易失準,需要人工修正。

13. 最新事件

(事件選取截至2024年7月公開資訊,僅反映技術產品釋出與生態動向)

  • 2023年7月:Stability AI釋出SDXL 1.0,顯著提升高解析度下Outpainting質量。
  • 2023年8月:阿里巴巴旗下阿里媽媽在年度大會公佈AI創意生成成本降低70%,其中影像擴充套件為重點功能。
  • 2023年11月:Meta釋出Emu Edit模型,支援指令式影像編輯和擴充套件;加拿大Onto宣佈可技術重現外部環境擴充套件。
  • 2023年12月:歐盟就《人工智慧法案》達成政治協議,對生成式AI提出透明度義務,包括標識AI生成內容,影響Outpainting應用合規。
  • 2024年1月:Midjourney推出V6版本,進一步最佳化Pan和Zoom Out功能。
  • 2024年2月:OpenAI在DALL·E 3中開放ChatGPT內的影像生成,部分擴充套件能力藉助自然語言互動,但仍未開放專用API。
  • 2024年4月:Adobe釋出Firefly Image 3模型,全面整合到Photoshop;在心理與專業測試中,生成擴充套件的逼真度領先同類閉源產品。
  • 2024年5月:百度文心一格升級,增強“畫面延展”功能的控制力;Stability AI釋出Stable Diffusion 3和Stable Assistant API,Outpainting成為標準輸出能力。
  • 2024年6月:ComfyUI社群出現大量鏈cloud工作流示例,將去噪過程拆分成本地和遠端推論,並在消費級硬體上展示即時擴充套件預覽。

14. 追蹤指標

追蹤Outpainting產業發展可關注以下可觀測指標:

  • 技術迭代指標:Stable Diffusion主要版本釋出頻次,開源社群(Hugging Face)中Inpaint/Outpaint相關模型上傳量;arXiv每月新增擴散模型論文數。
  • 產品與使用者指標:Adobe Creative Cloud訂閱使用者數與數字媒體ARR季度增長;Midjourney官方訂閱伺服器成員數;ComfyUI GitHub標星數(2024年7月已超5萬,代表工作流行度)。
  • 行業滲透指標:國內主流電商平台“AIGC商品圖”功能使用率揭露;海內外相機/修圖App(如美圖秀秀、Lensa)新增“擴充套件”功能後的下載量變化;設計素材平台中AI生成圖片上架比例。
  • 算力與成本指標:雲端GPU渲染服務(如Lambda Labs、vast.ai)的價格波動;主流推論卡在Outpainting上的吞吐指標;SDXL or SD3在A100單卡每次擴充套件的成本。
  • 法律與政策指標:主要司法轄區(美、歐、中)關於AI生成內容標識與訓練資料版權判例;大型版權方與AI公司的訴訟進展。
  • 資本市場指標(僅作產業景氣參考,不構成投資建議):AIGC領域風險投資季度金額和筆數(來源:CB Insights或IT桔子),聚焦影像生成工具類的投融資事件。

15. 信源

  • Stability AI官方技術報告(SDXL、SD3),https://stability.ai/research
  • Adobe Firefly與Photoshop更新公告,https://blog.adobe.com
  • Midjourney官方公告與Discord更新日誌
  • MarketsandMarkets, “AI Image Generator Market” report, July 2023
  • IDC, Worldwide Generative AI Spending Guide, October 2023
  • 輝達FY2024年報,2024年2月釋出
  • 阿里巴巴集團2023年雙十一AIGC材料公開報道,阿里媽媽官方
  • 歐委會人工智慧法案程序公告, December 2023
  • ComfyUI GitHub repository,https://github.com/comfyanonymous/ComfyUI
  • 各公司(百度、騰訊、位元組、美圖)產品官方說明與媒體採訪
source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型