應用層 開放閱讀

圖生圖

Image-to-Image

概念 ID
image-to-image-2
更新時間
2026-05-29
來源數量
待補

圖生圖

3 秒看懂

圖生圖:輸入一張影像作為“底板”,通過AI模型的處理,輸出一張在風格、內容、結構或細節上發生定向變化的新影像。其核心機制並非簡單的畫素疊加,而是“以圖控圖”的條件生成——即利用輸入影像作為生成過程的強約束條件,同時結合文本提示或其他控制訊號,實現從“隨機生成”到“基於現有資產的精準再創作”的範式轉變。

3 分鐘產業解釋

圖生圖是AIGC(人工智慧生成內容)影像領域的核心生產範式之一。如果說“文生圖”解決了從0到1的創意發散問題,那麼圖生圖則解決了從1到N的可控迭代問題——它將AI生成從“靈感捕獲”工具升級為“精準生產”工具。

產業邏輯:其商業價值根植於對創意產業“修改-反饋-再修改”這一核心工作流的效率重構。在傳統流程中,設計師在收到需求後,往往需要數小時甚至數天來完成一輪修改;而圖生圖技術使得“提出修改意見→AI生成多個變體→人工篩選→微調定稿”的迴圈被壓縮至分鐘級。據Adobe在2023年MAX大會揭露的資料,整合Firefly後,Photoshop使用者的創意迭代速度平均提升40%以上(Adobe, 2023)。這種效率躍遷直接改變了創意產業的成本結構和交付週期。

技術演進:圖生圖經歷了三代技術跨越。2015-2017年的神經風格遷移僅能捕獲紋理、色彩等淺層統計資訊,保真度差。2017-2020年的條件生成對抗網路(cGAN) 實現了成對影像翻譯,但需要嚴格對齊的訓練資料,泛化能力有限。2020年之後,潛在擴散模型成為產業拐點。其革命性在於:通過將影像“壓縮”到低維潛在空間進行去噪生成,大幅降低了計算成本;同時,CLIP等多模態模型的成熟,使得文本語義能夠被有效注入影像生成過程。2023年起,以ControlNet為代表的顯式條件注入技術,讓使用者能通過邊緣圖、深度圖、骨骼姿態等結構化資訊,對生成結果進行畫素級控制,圖生圖由此從“風格濾鏡”進化為“精準編輯引擎”。

商業模式:目前形成三條清晰路徑。1) SaaS訂閱工具:以Midjourney、Leonardo.AI為代表,面向消費者和半專業創作者,通過月度/年度訂閱盈利。Midjourney在2023財年實現約2億美元營收,使用者數超1600萬(The Information, 2023年12月報道)。2) 專業軟體AI功能增值:以Adobe Firefly為代表,嵌入Photoshop、Illustrator等已有龐大使用者基礎的專業工具,通過提升訂閱價值、增強使用者粘性變現。Adobe 2024財年Q1數字媒體年化經常性營收達158.6億美元(Adobe, 2024年3月財報),AI功能是推動ARR增長的關鍵敘事。3) API與企業定製部署:以Stability AI的API服務和開源模型為基礎,為企業提供私有化部署、垂直領域微調服務,應用於遊戲資產生成、電商商品圖批次處理等場景。其營收模型為按呼叫量計費或專案制定價,客單價在數萬至數百萬美元/年不等。

技術原理

圖生圖的核心技術流程可概括為**“編碼→條件注入→去噪生成→解碼”**四階段。理解該流程的關鍵在於:AI並非在畫素空間直接修改影像,而是在“潛在空間”——一個對影像內容高度壓縮的低維表示空間——中進行操作。

編碼階段:輸入影像通過一個預訓練的變分自編碼器(VAE)的編碼器部分,被壓縮為一個潛在表示 z₀。該表示丟棄了高頻的畫素級細節,但保留了影像的結構、語義和主體資訊。典型的壓縮比例為8倍(如Stable Diffusion系列,將512×512影像編碼為64×64的潛在張量),對於Stable Diffusion 3等更先進的架構,壓縮策略進一步最佳化以支援多解析度。

條件注入階段:這是決定“編輯什麼”的核心環節。使用者指令通過兩類途徑注入:

  • 文本條件:提示詞(Prompt)通過CLIP等文本編碼器轉換為語義向量,在去噪的每一步通過交叉注意力機制與影像特徵互動。負面提示詞(Negative Prompt)則通過引導模型“遠離”特定概念,實現對生成內容的約束。
  • 結構條件(ControlNet等):當用戶需要精確控制構圖、輪廓、角色姿態時,文本條件精度不足。此時需引入顯式的空間條件。例如,將輸入影像的邊緣檢測結果或使用者提供的骨骼圖,通過一個可訓練的編碼網路(常為U-Net編碼器的複製品)生成多尺度特徵圖,再逐層注入到去噪U-Net的對應層中。注入方式包括特徵相加(適用於連續條件如深度)或通道拼接(適用於離散條件如邊緣)。

去噪生成階段:這是擴散模型的核心。過程分兩步:

  1. 前向擴散(僅在初始化時模擬):根據Denoising Strength引數,在潛在表示 z₀ 上疊加相應強度的隨機噪聲,得到 zₜ。強度越高(接近1),zₜ 越接近純噪聲,輸出創造性越強但偏離原圖;強度越低(接近0),zₜ 保留原圖資訊越多。
  2. 反向去噪(迭代去噪):將帶噪潛在表示 zₜ 和注入的條件向量 c 送入U-Net去噪網路。U-Net在每一步預測需要去除的噪聲,逐步從 zₜ 恢復到“清潔”的潛在表示。CFG Scale(分類器無關引導比例)控制模型遵循文本條件的嚴格程度——數值越高,影像越貼合提示詞描述,但可能損失自然度和多樣性;典型圖生圖場景設定在7-12之間。

解碼階段:清潔的潛在表示通過VAE的解碼器部分,被重建為畫素空間的輸出影像。對於需超解析度的場景,常串聯額外的超分模型(如LDSR、Real-ESRGAN)以提升細節。

graph TD
    A[輸入影像] --> B[VAE 編碼器];
    B --> C{潛在表示 z₀};

    D[文本提示] --> E[CLIP文本編碼器];
    D2[控制條件
邊緣/深度/姿態] --> E2[ControlNet編碼器];
    E --> F{條件向量 c};
    E2 --> F;

    C --> G[根據Denoising Strength
新增噪聲];
    G --> H[噪聲潛在表示 zₜ];

    H --> I[U-Net 去噪器
交叉注意力注入文本條件
ControlNet注入結構條件];
    F --> I;
    I --> J{迭代去噪 N 步};

    J --> K[清潔潛在表示];
    K --> L[VAE 解碼器];
    L --> M[輸出影像];

關鍵引數機制

  • Denoising Strength(去噪強度):範圍0-1。0.3-0.5適合細微風格調整;0.5-0.7適合顯著風格化;0.7-1.0適合基於原圖構圖的全新生成。此引數決定了原圖資訊保留量與創造性的平衡點。
  • CFG Scale(引導比例):範圍通常在1-20。過低(5)導致生成結果忽視提示詞;過高(15)導致過飽和、高對比度和偽影。圖生圖中需與去噪強度配合調優——高去噪強度配合中等CFG(7-9)可實現既遵循指令又自然的結果。
  • ControlNet控制權重:控制結構化條件的影響力度。權重1.0表示完全按控制圖約束生成;0.5表示部分約束,給予模型更多自由度。專業工作流中常組合多個ControlNet(如深度+邊緣)以實現更精細的複合控制。

關鍵引數

圖生圖的輸出質量與可控性高度依賴引數調優。以下為專業級使用中的核心引數體系(以Stable Diffusion生態為標準):

引數名稱功能描述典型取值範圍調優邏輯
Denoising Strength控制對原圖新增噪聲的強度,決定輸出與原圖的偏離程度0.10 – 0.95低值(0.1-0.3)用於顏色校正、輕微光照調整;中值(0.4-0.6)用於風格遷移、材質替換;高值(0.7-0.95)用於基於構圖的重新生成。超過0.95幾乎等同於文生圖,原圖僅作為隨機種子初始化。
CFG Scale控制模型遵循文本提示的嚴格程度5 – 15圖生圖場景通常低於文生圖。建議範圍7-9:既能有效執行編輯指令,又保留原圖自然特徵。當Denoising Strength較高時,可適度降低CFG以避免過度銳化。
ControlNet Mode定義控制條件與去噪網路的互動方式Balanced / My prompt is more important / ControlNet is more important在ComfyUI等高階工具中可精細調節。預設Balanced均衡文本與控制條件;ControlNet is more important適用於需嚴格保持輪廓/結構而犧牲文本靈活性的場景。
ControlNet Weight單個ControlNet模組的控制強度0.50 – 1.50起始1.0。若結構約束過強導致生成呆板,降至0.7-0.85;若需更嚴格遵循控制圖,升至1.2-1.3。多ControlNet組合時需分別調權。
Guidance Start / End控制條件注入的起止時間步(僅高階工具支援)Start: 0.0 – 0.5; End: 0.5 – 1.0在生成早期注入結構控制(Start=0.0, End=0.5)可確定構圖,後期(Start=0.6, End=1.0)僅注入紋理/細節控制。這是實現“構圖鎖定+風格自由”的關鍵技術。
取樣器(Sampler)控制去噪過程中的數值求解演算法Euler a / DPM++ 2M Karras / DDIM 等DPM++ 2M Karras在20-30步內可收斂至高質量結果,是效率與質量的平衡選擇;Euler a引入隨機性,適合創意探索。圖生圖中需注意部分取樣器(如Euler a)即使在相同引數下也不保證完全可復現。
Steps(取樣步數)去噪迭代的次數20 – 50過低(15)導致細節模糊;過高(50)收益遞減且增加推論時間。在DPM++系列取樣器下,25-30步通常已達到收益飽和點。

實踐中的引數協同:不存在獨立工作的引數。典型除錯網格(Grid Search)為:固定CFG=7.5,在0.35-0.75區間以0.05為步長測試Denoising Strength的變化。鎖定最佳強度後,再在6-12區間調整CFG Scale微調。對於結構敏感任務,優先調ControlNet引數而非全域性引數。

技術路線

根據條件控制方式與生成自由度,圖生圖技術可劃分為四代技術路線。當前產業界正從第三代向第四代遷移:

對比維度第一代:神經風格遷移第二代:cGAN影像翻譯第三代:擴散模型+隱式控制第四代:擴散模型+顯式條件網路
代表模型/論文Neural Style Transfer (Gatys et al., 2015)Pix2Pix (Isola et al., 2017)Stable Diffusion img2img (Rombach et al., 2022)ControlNet (Zhang et al., 2023) / IP-Adapter / InstantID
控制方式內容+風格影像畫素級對齊的成對訓練文本提示 + Denoising Strength文本 + 多模態條件(邊緣/深度/姿態/分割圖/參考圖)
訓練資料需求單對風格/內容影像嚴格對齊的影像對(昂貴)大規模圖文對(弱監督)圖文對 + 條件圖(可自動生成,成本低)
保真度低(結構易扭曲)中(依賴訓練域)中(由強度引數平衡)高(結構由條件網路硬約束)
泛化能力極弱弱(限於訓練域)強(開放域)極強(零樣本組合多種條件)
推論速度慢(迭代最佳化)快(單次前向)中等(多步去噪)中等(增加ControlNet帶來約30-50%額外計算)
當前產業定位已被淘汰,僅存於學術史醫學影像、衛星圖等特定領域入門級創意工具、快速原型專業級生產管線(遊戲/影視/電商/建築視覺化)
核心技術瓶頸無法控制內容,僅能遷移紋理泛化差,訓練成本高僅靠文本難以精確控制空間結構複雜場景下的物理一致性;多條件衝突時的調和策略

技術路線選擇建議

  • 對於消費級娛樂/社交場景,第三代路線(如Midjourney的Vary Region)因其簡單易用佔據主流。
  • 對於專業生產場景(如遊戲資產生成需嚴格保持角色設計),第四代路線不可替代。據調研,截至2024年Q2,超過70%的AIGC遊戲資產生成管線已引入ControlNet或類似技術(公開資料佚),具體滲透率資料未見權威統計)。
  • 新興技術分支:IP-Adapter(影像提示介面卡)允許用參考圖而非文本作為條件,實現角色一致性;InstantID在無需微調的情況下實現高保真人像生成。這些技術正與ControlNet融合,形成“多參考圖+結構控制+文本指令”的複合控制體系。

上游

圖生圖產業鏈上游由基礎模型、訓練資料、算力基礎設施三大要素構成,其競爭格局集中且資本密集。

一、基礎模型層 這是技術棧的最底層,決定了生成能力的上限。市場呈“開源vs閉源”雙極格局:

  • 開源陣營(以Stability AI為核心):Stable Diffusion系列是事實上的開源標準。SD 1.5(2022年10月釋出)因廣泛的社群微調生態仍為活躍使用者數最大的版本;SDXL(2023年7月釋出)提升了1024×1024原生解析度與構圖能力;Stable Diffusion 3(2024年2月釋出早期預覽版)引入MMDiT架構,增強文本理解與多解析度生成。開源生態的“基座升級阻力”值得關注:社群大量LoRA/ControlNet模型針對SD 1.5訓練,向新版本遷移存在沉沒成本。
  • 閉源陣營:Midjourney(基於自有模型,技術細節未公開)、Adobe Firefly(宣稱使用授權資料訓練以規避版權風險)、OpenAI DALL-E 3(集成於ChatGPT)。閉源模型的優勢在於產品化體驗與責任歸屬清晰,劣勢在於使用者缺乏定製自由。
  • 供給特點:開源模型降低了應用層進入門檻,但也導致同質化。模型層的營收集中在少數頭部廠商。Stability AI在2023-2024財年面臨商業化挑戰,年營收約5000-6000萬美元(Bloomberg, 2024年3月報道),遠低於其基礎設施成本。

二、訓練資料層 大規模圖文對資料集是模型訓練的燃料。核心資料集包括:

  • LAION-5B:包含58.5億圖文對,是SD系列的主要訓練來源。其爭議在於資料來源自Common Crawl網頁抓取,未獲原始版權人授權,引發了多起版權訴訟(如Getty Images訴Stability AI案,截至2024年6月尚在審理中)。
  • 內部/授權資料集:Adobe Firefly宣稱使用Adobe Stock圖片和公共領域內容訓練,試圖建立“商業安全”的品牌定位。
  • 合成數據:使用現有模型生成高質量圖文對以訓練下一代模型,成為規避版權和提升特定能力的新趨勢,但其潛在的“模型自噬”退化風險仍在研究中。

三、算力基礎設施層 擴散模型的訓練和推論高度依賴GPU平行計算。

  • 訓練算力:據報道,訓練Stable Diffusion 3 8B引數模型使用了數千塊H100 GPU,耗時數月(Stability AI技術報告,2024年3月)。這構成了極高的資本壁壘,單次訓練成本可達數千萬美元。
  • 推論算力:單張圖生圖推論(30步取樣)在消費級GPU(如RTX 4090, 24GB VRAM)上通常需2-5秒;在雲端端的A100/H100上可壓縮至1秒以內。推論成本是SaaS廠商的主要可變成本。據估算,每張圖生圖雲端推論成本約0.001-0.005美元(基於主流雲端GPU租用價格,具體取決於解析度和步數),對免費或低價訂閱模式的盈利構成持續壓力。
  • 晶片供應:NVIDIA是事實壟斷者,A100/H100晶片供給在2023年持續緊張,2024年隨H200/B200等新品推出有所緩解。頭部玩家(如Adobe、Midjourney)通過長期預留例項(Reserved Instances)鎖定成本和供給。

下游

圖生圖的下游應用正從“工具賦能”向“流程替代”演進,核心市場包括創意設計、遊戲與影視、電子商務三大板塊。不同板塊的滲透深度、付費意願與技術壁壘存在顯著差異。

一、創意與設計 這是圖生圖最成熟的商業化場景,覆蓋平面設計、UI/UX設計、品牌視覺、廣告素材生產等。

  • 典型應用:將品牌VI手冊中的板式、配色、元素通過圖生圖批次生成社交媒體素材變體;將線框圖/草圖轉為高保真UI Mockup。
  • 滲透率:Adobe在2024年Q1財報電話會中揭露,Firefly自2023年3月推出以來已生成超過65億張影像(Adobe, 2024年3月)。但需注意,生成量不等於專業採納率——大量生成用於探索性用途,最終商業化採用的比例未見公開資料。
  • 付費模式:Adobe將Firefly整合至Creative Cloud訂閱,通過提升整體訂閱價值變現(未單獨拆分Firefly營收)。獨立工具(如Clip Studio Paint的AI功能)採用月度積分制,典型價格為8-25美元/月。

二、遊戲與影視 這是對圖生圖技術精度要求最高、也是價值最高的下游市場。

  • 遊戲資產生成:角色概念圖、場景原畫、道具貼圖、UI元素等。核心需求是保持跨資產的角色/風格一致性——例如,同一角色的不同姿勢、表情、服裝變體必須可識別為同一主體。IP-Adapter、InstantID等參考圖控制技術在2024年快速成熟,推動了該場景的落地。據遊戲行業諮詢機構Newzoo的定性觀察,2023-2024年,已有超過50%的獨立遊戲工作室在概念階段使用AIGC影像工具,但3A工作室的管線整合仍處於早期(Newzoo, 2024年1月行業報告,公開資料未見精確量化資料)。
  • 影視預視覺化:故事板、調色參考、概念氛圍圖的快速生成。圖生圖可將速寫指令碼板轉為不同光照下的近似成片參考,幫助導演與攝影師對齊視覺意圖。
  • 市場規模訊號:遊戲與影視領域獨立AIGC工具的ARR(年化經常性營收)合計估計在3-5億美元量級(2023年資料,來源為多家VC行業調研彙總,非精確審計資料),且增速快於通用創意工具。

三、電子商務 需求明確但技術要求特殊,是正在爆發的細分市場。

  • 核心場景:商品白底圖生成場景搭配圖、模特虛擬換裝、商品圖風格化以適應不同平台調性。
  • 技術要求:需保持商品本體(形狀、紋理、Logo)的極高保真度,僅修改背景或模特。這對Inpainting(區域性重繪)、分割引導的ControlNet等精細控制技術提出高要求。
  • 市場訊號:AI電商影像生成賽道在2023年完成多輪融資,但整體市場尚處早期,多為中小型商戶採用。大型電商平台(如Shopify、Amazon)已開始內測整合AI影像工具,但暫未全量開放。據MarketResearch.biz研究報告(2024年1月),全球AI電商視覺市場2023年估計約1.5億美元,預計到2032年達9.8億美元,CAGR約23.2%。該預測包含文生圖與圖生圖,且需注意預測資料的不確定性。

受益公司

按產業鏈位置和商業模式,受益公司可劃分為三層。以下分析基於公開揭露,不構成任何投資建議。

一、模型與平台層

公司核心資產受益邏輯2023/2024關鍵資料
Stability AIStable Diffusion系列開源模型開源生態的“水電煤”。雖開源免費,但通過會員、API呼叫及企業定製服務變現。2023年營收預估5000-6000萬美元(Bloomberg, 2024.3)。2024年3月完成約8000萬美元新一輪融資,投後估值約3億美元,較峰值估值大幅縮水。CEO Emad Mostaque於2024年3月辭職。
Midjourney閉源影像生成模型 + 社群高付費率、高使用者粘性,已盈利。圖生圖功能是其訂閱價值的核心元件。2023財年營收約2億美元,使用者超1600萬(The Information, 2023.12)。未揭露毛利率與淨利。2024年持續迭代V6版本。
AdobeCreative Cloud + Firefly模型將圖生圖能力嵌入全球最大的創意軟體生態,提升訂閱ARPU和留存。其“商業安全”敘事對大企業客戶有獨特吸引力。FY2024 Q1數字媒體ARR 158.6億美元(Adobe, 2024.3)。Firefly已生成超65億資產。未單獨拆分AI對ARR的貢獻。
NVIDIAGPU + CUDA生態 + AI模型工具包全產業鏈的算力底座。無論誰做圖生圖應用,均需NVIDIA GPU作為訓練和推論基礎設施。FY2024(截至2024年1月)資料中心營收475億美元,年增率增長217%(NVIDIA財報, 2024.2)。AI推論貢獻資料中心營收的約40%,圖生圖是推論負載之一。

二、垂直應用層(公開資訊有限,以下為代表性公司)

公司核心場景受益邏輯關鍵資料
Leonardo.AI遊戲資產生成提供針對遊戲工作流的專用模型和工具,包括角色一致性功能。2023年完成3100萬美元融資(TechCrunch, 2023.12)。使用者數、ARR未公開揭露。
Clip Studio Paint (Celsys)漫畫/插畫專業繪製整合AI上色、自動描線等圖生圖功能,服務於其龐大的漫畫創作者使用者基礎。全球使用者超3000萬(Celsys官網, 2023)。AI功能對新增訂閱的拉動作用未見拆分資料。

三、基礎設施與工具層

公司核心資產受益邏輯
Hugging Face模型託管平台 + Diffusers架構是開源圖生圖模型、LoRA/ControlNet權重的核心分發與實驗平台。營收來自企業SaaS訂閱和算力售賣。
Civitai模型/提示詞分享社群草根創作者的聚集地,通過廣告和增值服務變現。雖規模有限,但反映了開源生態的活躍度與需求風向。

:部分公司和細分市場的財務資料未公開揭露,以上資訊基於可獲取的公開報道與財報。營收、獲利等資料的年份和口徑已標註。對於非上市公司,估值和營收資料來自媒體報道,可能存在偏差。

市場規模

由於圖生圖能力常作為功能模組嵌入大平台(如Adobe Firefly)或作為開源工具的一部分被使用,獨立統計其市場規模存在方法論挑戰。本節綜合多家第三方研究機構資料,提供AIGC影像生成市場的規模畫像,並標註資料口徑與來源年份。

全球AIGC影像生成市場(含文生圖、圖生圖、影像編輯)

  • Grand View Research (2024年2月釋出):2023年全球AIGC影像生成市場規模約2.5億美元,預計2030年達608億美元,CAGR約39.5%(2024-2030)。需注意該預測跨度大,遠期資料的置信度有限。
  • MarketsandMarkets (2023年Q4釋出):2023年全球AI影像生成市場規模約3億美元,預計2028年達26億美元,CAGR約54%。此為中期預測,預測期至2028年。
  • Precedence Research (2024年1月釋出):2022年全球AI影像生成市場規模約1.8億美元,預計2032年達91億美元,CAGR約48%(2023-2032)。

關鍵解讀

  1. 統計口徑差異:上述機構對“AI影像生成”的定義邊界不同——部分包含影像編輯和增強,部分僅統計生成工具。且所有預測均包含文生圖,圖生圖作為子集,暫無獨立拆分的第三方市場資料。
  2. 營收確認挑戰:大量圖生圖能力通過開源工具免費使用,或作為現有軟體的增量功能,其創造的商業價值並未完全進入統計。Adobe Firefly的營收貢獻就未從其172.2億美元FY2023總營收中單列。因此,現有市場規模資料可能低估了該技術實際滲透的價值。
  3. 增長驅動因素:短期看遊戲、廣告素材生成需求;中期看影視預視覺化和產品設計;長期看與3D/影片生成融合。電商和社交媒體內容生產是使用者量最大的驅動力。
  4. 地域分佈:北美目前是最大市場(佔約40-45%),亞太地區增速最快(Grand View Research, 2024.2)。中國的AIGC影像市場受國內模型(如通義萬相、文心一格)和開源生態雙重驅動,但面臨監管備案要求,商業化程序區別於海外市場。
  5. 資料使用提醒:上述預測資料均來自第三方,其假設和方法論有內在不確定性。2025年及以後的遠期資料應視為情景推演而非精確測算。

玩家對比

當前圖生圖賽道的玩家可分為四大陣營,其競爭壁壘和商業化路徑差異顯著。以下對比基於2024年Q1-Q2公開資訊。

維度開源生態 (以Stable Diffusion為代表)閉源產品派 (以Midjourney為代表)平台整合派 (以Adobe為代表)垂直場景派 (遊戲/電商等)
核心使用者技術愛好者、獨立開發者、中小工作室創意專業人士、藝術創作者企業級設計團隊、已有Adobe生態使用者遊戲美術、電商運營等特定職業
技術壁壘低(基於開源模型開發應用門檻低,但貢獻核心模型的能力壁壘高)高(自有模型架構、訓練資料和調優方法均為黑箱)中高(模型需與複雜軟體架構整合,對穩定性、合規性要求極高)中(需在特定領域資料上微調,建置工作流模板)
商業模式間接變現(API、企業支援、雲端服務抽成)直接訂閱(月/年費)捆綁至現有高ARPU訂閱,AI作為價值增量訂閱或按量計費,部分定製專案制
可控性極高(開放ControlNet、LoRA等全部微調工具)中等(提供Vary Region等有限編輯,但無底層控制介面)高(在Photoshop中提供生成式填充、參考影像等精細控制)高(針對特定任務深度最佳化控制引數)
版權與合規高風險(訓練資料版權訴訟懸而未決;生成的影像版權歸屬存在爭議)中等風險(自有資料訓練,但原始資料來源未完全揭露)低風險(宣稱使用授權資料訓練,併為商業使用者提供IP賠償保障)取決於基座模型,若使用SD則繼承其版權風險
社群與生態極強(Civitai/Hugging Face上數萬微調模型)強(Discord社群極活躍,但模型封閉)依託Adobe Stock和Behance生態相對弱,依賴垂直行業論壇
資本效率低(Stability AI營收難覆蓋基礎設施成本)極高(Midjourney僅約百人團隊即實現約2億美元年營收,已盈利)高(AI功能驅動存量使用者增購,邊際成本相對低)中(需在獲客和垂直化研發上持續投入)
代表玩家Stability AI, Automatic1111, ComfyOrgMidjourneyAdobe, CanvaLeonardo.AI, Clip Studio

競爭洞察

  • Midjourney模式的競爭優勢在於極致的產品美學調校和社群粘性,但不開放控制介面限制了其在專業管線中的深度整合。其在遊戲、影視等需要精確可控的領域滲透力弱於開源方案。
  • Adobe模式代表了最強的商業護城河——通過將AI功能嵌入工作流而非提供獨立工具,顯著提升了使用者的遷移成本。其“商業安全”定位使其成為受版權約束的大企業客戶的首選。
  • 開源生態的同質化競爭是企業級變現的主要障礙。Stability AI的組織動盪(CEO辭職、估值縮水)表明,開源模型層尚未找到穩定的盈利模式。但開源生態本身(底層模型+Diffusers架構+社群LoRA)仍在蓬勃發展,正在成為行業的“公共基礎設施”。
  • 垂直場景派的長期生存取決於能否在Adobe等巨頭覆蓋不到的縫隙市場中,建置深度工作流和資料飛輪。僅做Stable Diffusion的“套殼”UI,價值極薄。

風險

圖生圖技術的商業化面臨多重交叉風險,需分層次審視。

一、技術與產品風險(高機率、高影響)

  • 技術迭代導致的沉沒成本風險:當前基於擴散模型的架構可能被新範式取代。2024年深度學習領域對狀態空間模型(SSM,如Mamba)和JEPA(聯合嵌入預測架構)的研究若取得突破,可能導致現有擴散模型生態(微調模型、ControlNet、工作流模板)的快速貶值。對於深度繫結特定架構的創業公司,這一風險尤為突出。
  • 生成質量的不確定性:圖生圖輸出具有機率性,同一組引數多次生成結果可能有顯著差異。在要求嚴格一致性的商業場景(如品牌VI應用),這一特性構成落地障礙。人機協同的反覆除錯仍不可避免,部分客戶可能高估了“全自動生成”的成熟度。
  • 計算成本與延遲:高解析度、多ControlNet、高步數推論帶來顯著的計算消耗。在即時互動場景(如VR/AR設計工具),延遲超過2-3秒就會破壞體驗。推論成本在免費額度大的商業模式(如部分開源前端提供的免費雲端端推論)下會侵蝕獲利。

二、法律與合規風險(高機率、極高影響)

  • 訓練資料版權訴訟:這是整個行業的“達摩克利斯之劍”。截至2024年6月,多起集體訴訟(如藝術家Sarah Andersen等訴Stability AI;Getty Images訴Stability AI)正在進行中,核心爭議是“使用未經授權的版權作品訓練AI模型是否構成合理使用”。若法院判決對AI公司不利,可能導致:1)鉅額賠償;2)需重建合規的訓練資料集(成本極高);3)開源模型的合規使用邊界收縮。美國版權局在2023年的展望中表示,完全由AI生成的內容不受版權保護,但“包含人類創造性貢獻的AI輔助作品”可受保護。圖生圖中人類貢獻的邊界(引數調整、選擇控制圖是否足夠)仍在界定中。
  • 生成內容侵權風險:即使模型訓練合法,使用者生成的影像仍可能偶然復現訓練資料中的受版權保護元素(“記憶”問題)。對企業使用者而言,使用存在此類風險的模型可能引發連帶責任。
  • 深度偽造與濫用:圖生圖可用於生成虛假新聞圖片、名人偽造影像等。多國監管機構(歐盟AI法案、中國《生成式人工智慧服務管理暫行辦法》)已設定合規要求,包括新增隱式水印、建立內容追溯機制。不合規將面臨罰款和應用下架。

三、市場與競爭風險(中機率、中高影響)

  • 巨頭擠壓:Adobe、Canva、Microsoft Designer等擁有龐大使用者和渠道的平台,其整合AI功能的成本極低(使用者已付費)。獨立圖生圖工具若無法提供顯著差異化的價值,將面臨使用者流失。微軟將DALL-E 3整合至免費的必應影像建立器,即對低端市場構成價格擠壓。
  • 訂閱疲勞與付費意願波動:個人使用者對AI工具的新鮮感衰減和訂閱疲勞是C端市場的現實風險。Midjourney在2023年底已在部分地區出現使用者增速放緩(Similarweb流量資料,2024年1月)。在宏觀經濟壓力下,非專業的個人使用者對10-30美元/月的AI工具訂閱可能優先削減。

四、倫理與社會風險(中機率,長期影響)

  • 對創意行業的就業衝擊:圖生圖可能在初級設計、電商修圖等崗位上形成替代。但中長期更可能的是工作內容的轉型(從執行者到“AI導演”)。Adobe調研認為AI更多是“提升現有設計師生產力”而非替代(Adobe, 2023年9月使用者調研)。該風險的社會影響超過對單個公司的直接影響。
  • 審美同質化:大量使用基於相似訓練資料的模型,可能導致視覺風格的同質化。Midjourney的“Midjourney風格”已成為一個可識別的視覺標籤,既有追捧也有批評。對於追求品牌獨特性的企業,這可能是一個需要警惕的長期問題。

誤讀糾偏

圖生圖概念在傳播中產生了若干常見誤讀,以下逐條糾偏。

誤讀一:“圖生圖”就是“風格遷移”。 糾偏:將圖生圖等同於風格遷移是嚴重的範疇窄化。風格遷移——即改變影像的紋理筆觸而保留內容結構——僅為圖生圖能力的子集。基於擴散模型的圖生圖技術支援:內容編輯(增刪物體、替換背景)、結構重組(根據文本指令調整構圖)、細節增強(超解析度、去模糊)、跨模態驅動(用骨骼動畫驅動角色)、多參考圖合成(融合多張圖的元素)。例如,輸入一張建築草圖,圖生圖可輸出具有逼真光影、植被和天氣效果的渲染圖——這遠超出了“風格遷移”的語義範圍。產業語境下,“圖生圖”應理解為“基於影像的廣義條件生成”,而非特定的技術路線或效果。

誤讀二:“圖生圖”中AI完全自主創作,使用者只需提供圖片和描述。 糾偏:這種“全自動”想像與實際專業實踐差距顯著。高質量圖生圖是一個人機協同的迭代控制過程。這體現在:1)控制條件的建置:專業使用者常需手動繪製邊緣檢測圖、深度圖、分割蒙版等ControlNet輸入,這需要美術專業知識。2)引數的精細調優:Denoising Strength、CFG Scale、各ControlNet權重的平衡需要大量實驗和經驗判斷。3)分割槽與分層處理:對複雜影像,專業工作流會分割槽應用不同的控制引數,甚至在不同去噪階段介入不同條件。4)後期精修:AI輸出通常仍需在PS等工具中進行細節修正、色彩調整。因此,圖生圖工具更像是“智慧畫筆”而非“全自動畫師”。

誤讀三:開源圖生圖模型(如Stable Diffusion)可以隨意商用,無版權風險。 糾偏:這一認識存在法律風險。開源協議(Stable Diffusion系列採用OpenRAIL-M等變體許可)雖允許商用,但並不能免除使用者對生成內容是否侵犯第三方版權的責任。核心風險有兩層:1)模型本身的訓練資料侵權風險:使用者可能被視為侵權鏈條的一環,即使並非主動。2)生成內容的可版權性問題:在美國現行法律架構下,完全由AI生成(缺乏足夠人類創造性控制)的影像不享有版權保護,這會影響其在商業應用中的獨佔性價值。企業商用前需進行法律風險評估,尤其在廣告、消費品等高風險領域。

誤讀四:ControlNet解決了圖生圖的所有控制問題。 糾偏:ControlNet是重要的進步,但並非萬能。其侷限包括:1)物理邏輯不一致:ControlNet可能完美保持輪廓,但生成的光影、透視、遮擋關係可能在物理上不合理。2)控制條件的衝突:當同時使用多個ControlNet(如深度圖+邊緣圖)時,若兩者資訊不一致(如一張圖的深度資訊暗示了另一張邊緣圖不存在的結構),模型會在衝突中產生不可預測的偽影。3)對訓練分佈外輸入的脆弱性:若輸入的控制圖風格與訓練資料差異過大,輸出質量會急劇下降。ControlNet解決了“畫素級對齊”問題,但未解決“語義與物理合理性”問題。

誤讀五:圖生圖主要替代初級設計師的工作。 糾偏:實踐證據顯示,圖生圖更多是重塑工作流,而非簡單的崗位替代。在遊戲行業,它替代的是外包給美術供應商的“快速出概念圖”環節,而非內部核心設計;在電商領域,它讓運營人員能自制初版素材,減少與設計部門的往返溝通。它對初級崗位的影響是“提升產出能力”而非“消除崗位”——一個會用AI的初級設計師可能完成過去2-3人的工作量。但對高度模板化、低創意性的影像生產(如電商白底圖換背景),自動化替代確實在發生。

最新事件

以下為2024年Q1-Q2期間,圖生圖賽道的關鍵事件(截至2024年6月),反映技術、產業與監管的動態:

技術釋出與更新

  • Stable Diffusion 3釋出早期預覽(2024年2月22日):Stability AI釋出SD3,採用800M至8B引數的MMDiT架構,在多模態理解和文字渲染上有顯著提升。並同步釋出SD3 Turbo版本以降低推論延遲。該版本暫未全面開放權重下載,需申請訪問。
  • Midjourney V6全面開放(2024年1月):V6版本在影像真實感、文字生成能力和對複雜提示詞的遵循度上大幅提升。新增的--style raw引數降低Midjourney的預設“美學濾鏡”,輸出更接近原始照片質感,提升了圖生圖場景下對真實性的控制。
  • Adobe釋出Firefly Image 3模型基礎版(2024年4月):在影像質量、光影細節、多參考圖融合上相較Firefly Image 2有代際提升。並在Photoshop中推出“參考影像”功能,允許使用者上傳參考圖以指導影像生成的風格和構圖。
  • InstantID與IP-Adapter等身份保持技術的快速發展(2024年Q1-Q2):學術界和開源社群湧現多個人臉/角色身份保持方案。InstantID在零樣本條件下僅需單張參考圖即可生成高保真身份一致的影像,極大地推動了圖生圖在角色驅動場景的商業應用。
  • ComfyUI生態的成熟(2024年持續):ComfyUI憑藉其節點式工作流和極高的靈活性,逐漸成為專業/開發者使用者的標準介面。圍繞ComfyUI的外掛、工作流模板市場快速擴張,降低了複雜圖生圖管線的搭建門檻。

產業與商業動態

  • Stability AI CEO辭職與公司重組(2024年3月):Emad Mostaque辭去CEO職務,由COO Shan Shan Wong和CTO Christian Laforte擔任臨時聯席CEO。公司面臨商業化壓力,公開報道稱其正在尋求新一輪融資或戰略合作(Reuters, 2024年3月)。其商業模式的可持續性成為行業討論焦點。
  • 企業級AIGC影像工具融資加速:多家面向企業的AI視覺公司完成融資。例如Bria(面向企業的合規影像生成平台)在2024年2月完成2400萬美元A輪融資(VentureBeat, 2024.2)。其賣點為使用100%授權資料訓練,提供商業使用法律保障。
  • 手機端圖生圖應用滲透:三星Galaxy S24系列(2024年1月釋出)與Google Pixel 8系列持續推進終端側AI影像編輯。Apple在WWDC 2024上宣佈“Apple Intelligence”將包含影像生成與編輯功能。終端側推論的成熟將改變圖生圖的分發和成本結構。

監管與法律

  • 歐盟AI法案通過(2024年3月,歐洲議會正式投票通過):該法案對通用AI(GPAI)模型提供者設定了透明度義務,要求揭露訓練資料摘要,並遵守版權相關法律。對圖生圖而言,這增加了在歐洲市場運營的合規成本,尤其對開源模型釋出方產生影響。
  • 美國AI版權訴訟進展:Artist集體訴訟案進入證據開示階段,法院駁回了部分指控但保留了核心版權主張(2024年Q1)。此案的結果將成為全球AI訓練資料版權問題的風向標。

追蹤指標

為持續追蹤圖生圖產業的發展動態,建議關注以下指標與信源。指標覆蓋技術、商業、監管三個維度。

技術指標

  1. 生成質量基準排名:關注Hugging Face Text-to-Image Benchmark等開放評測平台上的模型排名變化,重點觀察圖生圖相關指標的波動(如影像到影像的CLIP分數、FID在保真度任務上的表現)。頻率:季度。
  2. 開源社群活躍度:追蹤GitHub上Stable Diffusion WebUI、ComfyUI的Star數和PR活躍度;Hugging Face Diffusers庫的下載量趨勢;Civitai上新模型上傳數和下載量。這可反映基層使用者和開發者的興趣熱度轉移。頻率:月度。
  3. 新架構論文發表:關注ArXiv上ICLR/ICML/CVPR等頂會接收的關於影像編輯、條件生成的新架構(如DiT系列、狀態空間模型)。出現
source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型