Inpainting
1. 3秒看懂
Inpainting(影像修復/影像補全)是指利用計算機視覺和生成式AI演算法,根據影像現有區域的紋理、結構與語義資訊,自動填充被遮擋、損壞或人為移除的區域,使修復結果在畫素級、語義級及風格上均與整體畫面自然融合。它從傳統的“畫素搬運”進化為“語義級內容創造”,是生成式AI在影像處理領域的核心基礎任務之一。
2. 3分鐘產業解釋
在AI產業鏈中,Inpainting位於生成式AI應用層的腰部位置——它既非獨立硬體,也非一款孤立App,而是作為一種標準能力被廣泛嵌入到影像編輯軟體、內容生成平台和行業解決方案中。從產業功能看,Inpainting是影像創作工作流中的“修復師”:攝影師用它去掉多餘物體,電商設計師用它高效換背景,影視後期團隊用它擦除威亞和穿幫鏡頭。
其產業價值可以從三個維度衡量:
- 效率替代:將過去需要專業美工數十分鐘的手工修補,壓縮到秒級生成,使人均產出成倍提升。Adobe 2023年的一項內部調查顯示,採用生成式填充的Photoshop使用者的設計修訂時間平均縮短了60%以上(來源:Adobe Blog, 2023)。
- 能力下沉:使不具備專業設計技能的普通使用者能夠完成複雜影像編輯,這在社交媒體內容創作、電商產品圖製作等場景中打開了全新增量市場。
- 使能新場景:在醫療影像(病灶區域智慧填充以輔助對比分析)、文化遺產數字化(壁畫缺損預測性補全)等專業領域,Inpainting正從輔助工具轉變為研究中不可或缺的分析手段。
整條價值鏈的上下游分工清晰:上游為核心生成模型(擴散模型、自迴歸模型等)和訓練資料、算力硬體;中游為模型服務商和API平台;下游為整合該能力的專業軟體、消費級應用及各垂直行業解決方案。理解這一結構是評估產業卡位與受益邏輯的前提。
3. 技術原理
Inpainting本質上是一個條件生成問題。給定原始影像 I 和一張待修復區域的二值掩碼 M(通常其中1代表待修復區域,0代表保留區域),模型需生成一個合理的內容 I_{text(out)},使得:
I_{text(out)} = text(Generate)(I \odot (1-M), \ M, \ text(可選條件)),
並且 I_{text(out)} 在保持 1-M 區域畫素不變的前提下,填充區域在區域性和全域性上與上下文高度一致。
現代主流方案以擴散模型為核心引擎,其工作機制可概括為一個迭代式的條件去噪過程:
- 前向擴散(訓練階段):在訓練時,對一張乾淨影像逐步新增高斯噪聲,直到變為純噪聲,網路學習在每個時刻預測所加的噪聲。對於Inpainting任務,輸入不僅包含當前帶噪影像,還會在通道維度拼接被掩碼「破壞」後的影像(即保留區域可見,待修復區域設為全灰色或隨機值)以及掩碼本身。因此,網路學會了“看見噪聲、已知可見部分和要求填充的區域”三個訊號,並推算出應去除的噪聲方向。
- 反向生成(推論階段):從一張純隨機噪聲圖開始,在每一步執行:將當前帶噪圖與掩碼破壞圖、掩碼拼接後送入U-Net(或Transformer)骨幹網路;網路預測該步噪聲;根據預測噪聲對帶噪圖進行一步去噪;最後一步輸出即為完整的、符合上下文語義的修復結果。為了增強可控性,可在U-Net中引入交叉注意力層,注入文本提示或參考影像特徵,實現文本引導或風格引導修復。
技術難點除了常見的生成質量外,Inpainting對邊界一致性(修復區域與保留部分的顏色、光照、紋理無縫銜接)、長程結構推論(當掩碼覆蓋大範圍時,模型必須推斷出透視、遮擋和完整物體形態)以及多樣性控制(生成內容既合理又不會出現不切實際的隨機紋理)提出了更高要求。為了解決這些問題,研究者通常在掩碼策略、微調技術和條件注入設計上長期迭代。
4. 關鍵引數
在實際部署與體驗中,理解以下引數有助於把握Inpainting能力邊界和調優方向:
- 掩碼策略與預處理
- 掩碼形狀生成:訓練時通常採用不規則矩形、筆刷塗抹區域或隨意物體輪廓,以模擬真實使用者操作。測試發現,掩碼邊緣的柔和度(feathering)對邊緣銜接效果影響顯著;邊緣過於銳利易產生可見接縫,通常在推論前對掩碼施加微小高斯模糊(
mask_blur引數)。 - 掩碼尺寸佔比:待修復區域佔全圖的比例決定了難度。小於10%為小面積補丁,模型主要依靠紋理延續;大於40%時進入大範圍語義推論,對模型的全域性結構理解提出極高要求。
- 掩碼形狀生成:訓練時通常採用不規則矩形、筆刷塗抹區域或隨意物體輪廓,以模擬真實使用者操作。測試發現,掩碼邊緣的柔和度(feathering)對邊緣銜接效果影響顯著;邊緣過於銳利易產生可見接縫,通常在推論前對掩碼施加微小高斯模糊(
- 引導尺度(CFG scale) 在基於文本提示的修復中,無分類器引導(Classifier-Free Guidance)權重控制了生成內容與提示詞的貼合程度。低CFG值(如1~3)讓模型更多遵循影像視覺上下文,適合無文本條件的自然補全;高CFG值(如7~15)強制生成內容向文本描述靠攏,但可能引起過飽和、偽影或偏離周圍光影。
- 去噪步數(Steps) 擴散模型的反向過程步數一般在20~50步之間即可獲得較優結果,過少導致欠去噪和模糊,過多則延長推論時間而邊際收益遞減。當前一些蒸餾擴散模型已可將步數降至1~4步,對即時互動至關重要。
- 修復區域強度(Denoising Strength) 在某些管線中,引數控制對掩碼區域加噪的強度。強度越高,模型對原始殘留資訊的破壞越大,生成自由度就越高,但也可能完全忽略該區域原本微弱的紋理線索。這是權衡“創造性”和“保真度”的關鍵旋鈕。
- 條件注入架構
- 通道拼接:直接拼接破壞圖與掩碼是最常見的條件注入,它保留了空間對齊關係,適合結構保持。
- 交叉注意力:將文本或語義特徵通過注意力機制注入U-Net的中間層,賦予高層語義控制。
- ControlNet/介面卡:可附加邊緣圖、深度圖等結構條件,實現高度可控的幾何級修復,例如在填充區域內強制生成預設輪廓。
衡量這些引數組合的綜合效果,常用指標在下文「追蹤指標」部分做系統說明,但直觀評估往往依賴使用者主觀研究。
5. 技術路線
Inpainting技術路線可依底層生成範式分為四代,當前處於擴散模型主導、自迴歸與GAN區域性共存的多元時期。
| 技術路線 | 核心機制 | 代表性方法 | 輸出特徵 | 典型侷限 | 當前應用地位 |
|---|---|---|---|---|---|
| 基於補丁/紋理合成 | 在相同影像的可見區域搜尋最佳匹配影像塊進行復制填充 | PatchMatch, Content-Aware Fill早期實現 | 紋理延續性好,區域性保持高畫質 | 完全無語義理解,無法處理複雜結構 | 僅用於細紋、劃痕等微修 |
| 基於GAN | 生成器與判別器對抗訓練;生成網路輸入被破壞影像,輸出修復影像 | Context Encoders, PartialConv, GatedConv, EdgeConnect | 語義填充能力出現,可生成較清晰紋理 | 訓練穩定性差,多樣性與真實感受限;對大面積掩碼常產生偽影 | 部分輕度修復場景,非前沿 |
| 基於擴散模型 | 從噪聲迭代去噪,並將可見區域和掩碼作為條件引導 | Stable Diffusion Inpainting, RePaint, DALLE·2編輯 | 生成質量頂尖、多樣性豐富、支援文本引導,訓練穩定 | 推論算力消耗大,低端裝置上延遲較高 | 當前工業與開源生態絕對主流 |
| 基於自迴歸Transformer | 將影像序列化為離散Token,逐塊預測掩碼區域 | VQGAN+Transformer, MAE衍生方法 | 理論長程語義捕獲能力 | 生成速度極慢,高解析度影像Token序列過長;並行性不足 | 學術探索,非應用核心 |
2023-2024年的趨勢是上述路線出現融合:擴散模型也可結合Transformer架構(如2024年Stable Diffusion 3採用MMDiT骨幹),並嵌入自迴歸元件處理區域性細節;而GAN訓練技巧被用於擴散模型蒸餾加速。但從交付質量與工程友好度看,條件擴散管道依然是首選基座。
6. 上游
Inpainting功能的實現與效能提升依賴以下上游要素:
- 基礎生成模型:擴散模型(DDPM、LDM)、U-Net架構、視覺Transformer(ViT)等。Stability AI的Stable Diffusion系列(尤其是專為Inpainting微調的版本)、OpenAI的DALL·E 2/3中的編輯模組、Midjourney的Vary Region均為產業基座。
- 訓練資料集:通用影像資料集LAION-5B、COCO、ImageNet提供了預訓練基礎;為提升修復效果,需在訓練時動態生成海量“影像-掩碼”對,掩碼生成策略(隨機矩形、筆刷、物體分割掩碼)對模型魯棒性至關重要。同時,部分專有領域依賴私有高質量資料(例如醫療影像需脫敏後的專業標註資料)。
- 算力硬體:模型訓練通常要求數百至數千張高效能GPU(如NVIDIA A100/H100)叢集。推論端雖逐步下放到消費級GPU(如RTX 4090),但高解析度、大批次場景仍依賴雲端端GPU例項。主要供應商包括NVIDIA、AMD,以及雲端端算力平台(AWS、GCP、Azure)。
- 工具與架構:PyTorch、JAX等深度學習架構;Hugging Face Diffusers庫為開發者封裝了標準Inpainting pipeline,大幅降低使用門檻。
上游的發展重心在於:降低訓練成本、縮小模型體積以適配端側、建置更豐富的條件注入方式(如結合3D幾何先驗)等。
7. 下游
下游按使用者型別和應用場景可分為四個主要層級:
- 專業創意工具 Adobe Photoshop的“生成式填充”、Affinity Photo的AI修復工具、DaVinci Resolve中的物體移除功能等。這些是營收規模最大、付費意願最強的市場,針對攝影師、設計師、影片剪輯師。
- 消費級影像編輯應用 包括Canva、Picsart、美圖秀秀、Snapseed等,將Inpainting簡化為“一鍵消除路人”“智慧去水印”等功能,面向海量創作者和普通使用者,通常以訂閱或廣告變現。
- 垂直行業解決方案
- 電商與廣告:自動去除背景雜亂元素,生成乾淨的白底圖或場景圖;利用修復填充產品缺失部分。
- 影視與遊戲:威亞擦除、穿幫鏡頭修復、遊戲資產生成(如自動補全破損貼圖)。
- 醫療影像:病灶虛擬填充以模擬正常組織外觀,輔助醫生對比;資料增強以生成更多的訓練樣本。
- 文化遺產與安防:壁畫、文物虛擬修復;監控影片中被遮擋目標的推測性復原。
- API與模型服務市場 開發者和創業公司按呼叫量付費使用Inpainting API(如OpenAI Images API、Hugging Face Serverless Inference、Replicate等平台),降低下游應用接入門檻,形成分層生態。
下游的擴散邏輯與AIGC整體趨勢一致:最先落地、用量最多的場景集中在降低人工成本與縮短製作週期明顯的領域。
8. 受益公司
以下上市公司或已在財報中證實相關業務受益於Inpainting等生成式AI需求,邏輯基於公開財務和業務進展,不構成任何投資建議:
- Adobe(ADBE):將Inpainting作為“生成式填充”整合至Photoshop、Lightroom等旗艦產品,極大提升了Creative Cloud的訂閱價值。2024財年第二季度(截至2024年5月31日)Creative Cloud營收年增率增長約11%,管理層在電話會上提到Firefly AI模型對使用者參與度和新訂閱的拉動作用(來源:Adobe FY2024 Q2財報)。
- NVIDIA(NVDA):作為上游算力核心供應商,Inpainting模型的訓練與推論均需大規模GPU。NVIDIA 2024財年(截至2024年1月28日)資料中心營收達到475億美元,年增率增長217%,其中生成式AI工作負載是主要驅動力(來源:NVIDIA 10-K年報)。H100、B200等晶片持續受益。
- Microsoft(MSFT):通過Azure AI服務提供DALL·E等模型API,並在Microsoft Designer產品中內建影像修復功能;同時作為OpenAI的雲端運算獨家合作伙伴,間接受益於模型推論用量激增。
- Meta Platforms(META):雖尚未直接以Inpainting產品變現,但其開源模型(如DINOv2、SAM分割模型)可作為掩碼生成工具,被廣大下游修復管線整合,強化其AI生態影響力。
- Getty Images / Shutterstock:前者與NVIDIA合作推出了基於授權資料的生成式AI工具,支援可靠的修復與編輯服務,並從API呼叫中獲得營收(來源:NVIDIA與Getty Images聯合新聞稿,2024年1月)。Shutterstock亦推出AI影像生成平台,與Inpainting能力結合,為公司貢獻訂閱升級營收。
- 部分國內軟體與內容公司:如萬興科技喵影工廠、美圖公司等,將Inpainting嵌入其影片和圖片編輯產品,並在公開資訊中提及AI功能對轉化率的正向影響,但具體數字公開資料未見詳述。
9. 市場規模
因Inpainting通常不單獨報價,而是作為影像編輯/生成軟體、API服務中的一項功能,其市場體量需通過相關市場進行合理估算。
- 生成式AI影像市場基準:根據Grand View Research於2024年2月釋出的報告《AI Image Generator Market Size, Share & Trends Analysis Report》,2023年全球AI影像生成器市場規模約為29.1億美元,預計2024-2030年將以32.0%的複合年增長率(CAGR)增長,2030年達到174.1億美元。Inpainting作為影像編輯與生成的重要子功能,貢獻其中相當體量。
- 創意軟體消費:Adobe的數字媒體年度經常性營收(ARR)在2024財年第二季度末已達154.1億美元(來源:Adobe 2024 Q2 Earnings),其生成式功能的滲透是ARR維持增長的關鍵因素之一。若將Inpainting等生成式編輯視為功能增量,其間接價值已在百億美元級別的創意軟體市場中體現。
- GPU算力市場對映:每增加一億次Inpainting推論呼叫,對應需消耗大量計算資源。NVIDIA估算AIGC模型訓練一次的成本可達數百萬美元(來源:NVIDIA GTC 2024演講)。隨著使用者量級增長,驅動AI算力市場持續擴容。據IDC 2024年度預測,全球AI基礎設施支出2024年將超過1000億美元,其中與生成式AI相關的計算與影像工作負載增長最快。
- 細分空缺:公開資料未見針對Inpainting單一功能的獨立市場規模資料,市場諮詢機構通常將其納入“AI影像編輯”或“智慧影像修復”功能項下統計,具體金額未有拆分。上述資料為理解其商業價值的近似。
10. 玩家對比
當前主要玩家在Inpainting能力的版面配置、優勢和策略差異化明顯:
| 維度 | Stability AI(SD Inpainting) | Adobe(Firefly生成式填充) | OpenAI(DALL·E系列) | Midjourney(Vary Region) |
|---|---|---|---|---|
| 模型開放度 | 完全開源,模型權重可下載,社群自定義微調 | 閉源,通過Creative Cloud服務交付 | 僅通過API提供,有限編輯端點 | 閉源,僅內置於Discord/Web介面 |
| 核心優勢 | 生態豐富,支援ControlNet等高度可控修復;算力可自建 | 與Photoshop無縫整合,理解圖層、蒙版,面向專業流程;商用版權保障 | 與ChatGPT等文本互動串聯,理解自然語言指令 | 生成結果藝術感和美學一致性極強,Vary Region修復自然度口碑佳 |
| 可控性 | 高,可精確控制掩碼、步數、CFG,配合OpenPose/Depth等條件 | 較高,通過選區、提示詞和引數控制;複雜選擇時細節偶有不可控 | 中等,通過API引數控制,但精細幾何控制弱 | 中等,主要通過區域選擇加提示詞,不可細調引數 |
| 推論成本 | 可在本地RTX 3060以上執行,成本可控 | 雲端端完成,包含在訂閱費用中 | 按Token或圖片呼叫計費,成本可變 | 包含在訂閱費用中(月度會員) |
| 版權與商用安全 | 開源模型訓練資料版權爭議較大,商用需自擔風險 | Firefly模型宣稱使用授權資料和公有領域內容訓練,提供IP indemnity | 資料來源未完全公開,部分版權訴訟仍在進行 | 未公開詳細訓練資料來源,無明確版權保護計劃 |
| 適用人群 | 技術開發者和願意動手調參的使用者,二次開發 | 專業設計師、攝影師、已有Adobe生態使用者 | 開發者和需整合API的企業使用者 | 追求頂級審美效果的創意工作者 |
| 2024年進展 | 釋出SD3模型,MMDiT架構在多主題修復上進步顯著(來源:Stability AI技術報告) | 推出Firefly Image 3模型,生成式填充細節更真實,已全面商用(來源:Adobe Blog) | 演示基於GPT-4o的多模態編輯,逐步擴充套件影像修復指令跟隨(來源:OpenAI釋出活動) | 推出Vary Region 2.0,支援更高解析度和複雜場景一致性修復(來源:Midjourney官方更新日誌) |
綜合來看,無一家佔據絕對主導,競爭走向“專業工具整合”與“開源靈活生態”兩線並行。
11. 風險
Inpainting商業化與技術演進需要正視以下風險因素:
- 版權與法律風險:多數生成模型基於網際網路公開圖片訓練,訓練資料是否包含未經授權的版權作品仍存法律爭議。2023年以來,Getty Images訴Stability AI、部分藝術家集體訴訟等案件仍在審理中,若判例要求模型訓練取得全部授權,可能大幅增加上游成本,影響模型可用性(來源:美國聯邦法院案卷,截至2024年中公開情況)。
- 內容安全與造假風險:Inpainting可用來移除水印、掩蓋關鍵物體,甚至用於偽造影像證據(如司法照片中被消除的人物或物品)。儘管主流產品添加了不可見水印和內容憑證(Content Credentials),但開源模型的監控工具極易被剝離,考驗平台治理能力。
- 技術可靠性風險:在關鍵場景(如醫療影像、取證)中,模型可能會“創造”出不存在的結構(幻覺),導致誤判。模型的修復結果對掩碼邊緣和提示詞高度敏感,輸出一致性有待提升。目前尚無行業公認的可靠度認證體系。
- 隱私風險:當用戶上傳含個人資訊的圖片至雲端端進行修復時,存在資料洩露或被用於模型後續訓練的可能。部分國家的監管(如歐盟AI法案)對生物識別資訊和敏感影像處理設有嚴格限制。
- 競爭與商業模式風險:開源模型的存在壓低了API呼叫的價格天花板,基於純API呼叫的商業模式可能面臨獲利薄、客戶遷移成本低的困境。同時,基礎模型的飛速迭代可能導致高度依賴特定模型的下游產品過時。
- 監管不確定風險:歐盟《人工智慧法案》將某些生成式AI應用劃入高風險範疇,要求供應商履行透明性、可解釋性義務。美國、中國等地也在加速立法。新監管要求可能導致合規成本上升,並對某些修復功能(如人臉修復)施加限制。
12. 誤讀糾偏
- 誤讀1:“Inpainting就是PS仿製圖章/修復畫筆的自動化版。” 糾偏:仿製圖章是畫素級手工取樣複製,完全不具備語義理解;而AI Inpainting理解場景,能推斷並“創造”全新畫素。如從半張臉上修復缺失的眼睛,傳統工具只能從別處複製貼上另一隻眼,而AI可在語義上生成與面部協調的全新眼睛。兩者在能力上有代際差異。
- 誤讀2:“用擴散模型直接生成區域性區域就行,專門的Inpainting模型沒太大必要。”
糾偏:通用文生圖模型未針對“保持已知區域不變”進行最佳化。若直接取區域性噪聲生成後再強行拼貼,必然在邊界產生不一致的接縫和光影跳變。專業Inpainting模型如
stable-diffusion-inpainting在數億個“影像-掩碼”對上微調,學會了邊界融合與上下文保持,效果大幅優於“通用模型+後處理”方案。 - 誤讀3:“Inpainting生成的內容不可控,基本靠運氣。” 糾偏:2024年的主流管線已高度可控。使用者可通過文本提示(“深棕色木質地板”)、邊緣圖、深度圖甚至參考圖實現強控制。通過設定CFG scale、掩碼模糊邊緣以及反覆抽樣,可穩定收斂至預期結果。可控性不足通常源於尚未掌握工具,而非能力缺失。
- 誤讀4:“市場已被Adobe等巨頭鎖定,新入局者無機會。” 糾偏:開源生態的繁榮(以Stable Diffusion及衍生模型為代表)使得中小企業甚至個人開發者都能以極低成本建置垂直場景的Inpainting工具,例如針對特定電商類目(鞋服修復)的微調模型。競爭格局尚未固化,尤其是輕量、私有化部署和特定行業解決方案領域仍存在空間。
13. 最新事件
(事件截至2024年7月公開報道,部分進展來自官方通告與技術社群)
- 2024年6月,Stability AI釋出Stable Diffusion 3 Medium:模型架構從傳統U-Net切換到MMDiT(多模態擴散Transformer),在複雜文本理解與高解析度修復任務上取得顯著提升,並開源部分模型權重。社群快速跟進Inpainting管線適配。
- 2024年4月,Adobe Firefly Image 3模型推出:重點提升了“生成式填充”功能,在保留區域光照匹配和複雜材質還原(如透明玻璃、毛髮)上迭代明顯,且全面開放商用。Adobe於2024年第二季度電話會中表示,Firefly系列功能的月使用者生成量已達數十億級(來源:Adobe官方公告)。
- 2024年5月,OpenAI春季釋出會演示GPT-4o影像編輯:在對話中可對圖片指定區域進行修復和修改,顯示將Inpainting整合進多模態互動成為重要方向。
- 2024年3月,Midjourney Vary Region(區域變化)功能增強:支援更大區域的高一致性修復,且對場景光線全域性調整能力提升。
- 2024年7月,Hugging Face Diffusers庫累計下載量超1億次:其中Inpainting相關的pipeline是最熱門的元件之一,反映出開發者對將修復能力嵌入自身產品的強烈需求(來源:Hugging Face公開統計)。
- 2024年歐盟AI法案進入實施階段:要求生成式AI系統提供透明度並標註AI生成內容,對具有“真實感影像修改”功能的Inpainting工具提出合規時間表,部分產品開始在輸出中嵌入C2PA標準後設資料。
- 行業應用爆發:國內多家AIGC初創公司(如LiblibAI、Tiamat)獲得新一輪融資,均將可控Inpainting作為核心亮點,用於遊戲美術和電商設計。
14. 追蹤指標
為持續觀察Inpainting產業發展與技術突破,建議追蹤以下可量化指標及事件:
- 模型評測與論文
- Papers With Code上“Image Inpainting”基準的SOTA更迭頻率。重點關注LPIPS、FID在CelebA-HQ和Places2標準測試集上的進步。
- 主流模型(SD3、Flux等)在社群定製Inpainting版本後的A/B使用者偏好投票結果。
- 開源生態活躍度
- Hugging Face上Inpainting相關模型的下載量、點贊數月度變化。
- GitHub關鍵專案(如Automatic1111、ComfyUI、stable-diffusion-inpainting)的Star數、Issue活躍度。
- 商業產品訊號
- Adobe季度財報中Creative Cloud ARR增長率、生成式功能驅動的付費轉化率揭露。
- 主要雲端廠商AI推論API呼叫量及價格變動趨勢。
- 硬體與算力
- NVIDIA資料中心營收的AI貢獻分類(財報); 主要雲端廠商GPU例項的可用區擴容節奏。
- 消費級GPU(RTX 40/50系)對擴散模型推論的支援效能和普及率。
- 使用者體驗與市場滲透
- App Store/Google Play圖形與設計類應用下載榜中,主打“消除”功能的AI工具數量及排行榜變化。
- 電商平台(如Shopify、淘寶)中內建AIInpainting功能的店鋪應用安裝量。
- 監管與標準化
- 各國AI法案針對影像編輯工具的最終條文實施日期;C2PA等後設資料標準在主流相機和軟體中的支援情況。
- 重大版權訴訟的判決結果或和解公告(如Andersen v. Stability AI案進展)。
15. 信源
本概念頁所引用或參考的主要資訊來源:
- 學術論文與技術報告
- Rombach et al., “High-Resolution Image Synthesis with Latent Diffusion Models”, CVPR 2022.
- Lugmayr et al., “RePaint: Inpainting using Denoising Diffusion Probabilistic Models”, 2022.
- Liu et al., “Image Inpainting for Irregular Holes Using Partial Convolutions”, ECCV 2018.
- Stability AI, “Stable Diffusion 3 Technical Report”, 2024.
- 財報與官方揭露
- Adobe Inc., FY2024 Q2 Earnings Release, June 2024.
- NVIDIA Corporation, Annual Report (10-K) for fiscal year 2024.
- 各公司官方部落格與新聞稿(Adobe, OpenAI, Midjourney, Stability AI, Getty Images等)。
- 市場研究資料
- Grand View Research, “AI Image Generator Market Size, Share & Trends Analysis Report, 2024-2030”, February 2024.
- IDC, “Worldwide AI Infrastructure Spending Forecast, 2024”.
- Bloomberg Intelligence, “Generative AI Software Market Sizing”, 2023.
- 行業與社群平台
- Hugging Face Diffusers文件與模型庫下載統計資料。
- Papers With Code “Image Inpainting” benchmark頁面。
- GitHub開源專案運作資料(Automatic1111/stable-diffusion-webui等)。
- 法規與法律檔案
- 歐盟《人工智慧法案》(AI Act)正式文本、相關審查更新。
- 美國相關版權訴訟案卷(公開記錄)。
註釋:所有財務、市場與份額資料均標註年份、口徑及來源。無法通過權威公開資料核實的數字,正文已註明“公開資料未見”;產業描述和競爭評價不構成任何形式的投資建議或個股推薦。