模型層 開放閱讀

圖生影片

Image-to-Video

概念 ID
image-to-video
更新時間
2026-05-29
來源數量
待補

圖生影片

3秒看懂

圖生影片(Image-to-Video,I2V)是一種生成式 AI 技術,輸入一張靜態影像,即可輸出一段包含合理運動與場景變化的連貫短影片。它是影片生成的核心分支,也是比文生影片(T2V)更早進入實用驗證的技術前置,核心價值在於大幅降低動態視覺內容的創作門檻。

3分鐘產業解釋

圖生影片不等於“讓照片動起來”。它的本質是 AI 在理解二維影像含義的基礎上,對缺失的時間維度進行合理重建,生成原圖中不曾出現的運動細節和背景變化,從而完成從靜態空間到動態時空的跨越。

當前產業鏈已經初步成型:

  • 上游:算力硬體(高效能 GPU)、大規模影片‑影像配對資料集、基礎模型架構(擴散模型、3D VAE 等)。
  • 中游:技術提供商與模型開發者,既包括 Runway、Pika Labs、Stability AI、Luma AI 等創業公司,也包括 Google、Meta、微軟等大型科技企業,以及國內的可靈(快手)、生數科技、智譜等。
  • 下游:應用場景廣泛覆蓋影視特效預演、廣告創意製作、遊戲動畫、電子商務商品展示、教育培訓、社交媒體特效與個人內容創作。

商業模式目前主要有三條路徑:

  1. 雲端服務 API 呼叫(按生成秒數或次數計費);
  2. 專業工具整合(嵌入 Adobe Premiere Pro、剪映等現有創作軟體);
  3. 自有應用訂閱(通過獨立 App 或網頁端提供面向消費者和創作者的付費會員服務)。

競爭焦點已從“能不能生成”轉向“生成的可控性、時長與一致性”。投資視角下,整個賽道仍處於早期爆發階段,技術迭代極快,尚未形成穩定的市場份額格局。

技術原理

圖生影片的技術核心可以概括為:在輸入影像提供的空間‑語義先驗約束下,對時間維度進行機率建模與生成。目前最成功的主流架構是基於擴散模型的條件影片生成,其工作原理按以下層次展開。

1. 潛在空間中的時空擴散

現代模型幾乎不再直接處理畫素。整個流程的關鍵是先將影片資料對映到低維的“時空潛在空間”:

  • 影片壓縮:通過一個預訓練的 3D VAE(三維變分自編碼器) 編碼器,將一段影片(例如 24 幀、解析度 768×768 的片段)壓縮成一個尺寸小得多的時空潛在張量。這步可將計算成本降低 1–2 個數量級。
  • 潛在空間擴散:在該低維空間中執行擴散過程。首先生成一個完全隨機的噪聲潛在序列,然後在輸入影像條件的引導下,使用去噪 U‑Net 迭代從噪聲中恢復出有意義的潛在序列。
  • 解碼回畫素影片:最終通過 3D VAE 解碼器將去噪後的潛在序列解壓成完整的彩色影片。

2. 輸入影像作為條件注入

為了讓模型“忠於”原始影像,需要將影像特徵持續作用於去噪過程。主要注入機制有三種,並且它們經常組合使用:

  • 通道拼接(Channel Concatenation):將輸入影像的潛在表示(經同一編碼器獲得)與待去噪的噪聲潛在序列在通道維度上直接拼接,作為 U‑Net 的輸入。
  • 交叉注意力(Cross‑Attention):利用 CLIP 等影像編碼器提取輸入影像的高層語義特徵,將其作為交叉注意力層的鍵(Key)與值(Value),與 U‑Net 中的噪聲特徵進行互動。這有助於理解物體類別、風格、場景語義,從而生成與影像內容一致的後續幀。
  • 自適應歸一化(AdaLN):用影像條件特徵調變 U‑Net 各層歸一化操作的縮放與偏置引數,以在不同層級控制風格和結構。

3. 時序一致性與運動建模

單幀逼真卻幀間閃爍的影片毫無價值,因此時序一致性是圖生影片的核心挑戰。關鍵技術手段包括:

  • 3D 時空注意力:在標準的二維空間注意力(Self‑Attention)之外,沿時間軸延伸注意力計算。一個令牌不僅可以關注同一幀中的其他空間位置,還能關注前後幀中的對應區域,從而有能力“追蹤”同一物體的外觀和運動。
  • 聯合擴散:將整個影片潛在序列作為一個整體樣本,在擴散過程中同時對所有幀進行加噪與去噪,避免逐幀生成造成的漂移。
  • 運動顯式引導:部分學術工作在實際網路中引入預訓練的光流預測器或運動向量模組,作為額外的運動先驗來約束生成結果,使其更符合真實的物體位移軌跡。

4. 典型推論流程與計算量級

輸入影像 I
   → [影像編碼器] → 條件特徵 c
   → [3D VAE 編碼器] → 影像潛在表示 z_i(可選用於拼接)
   → 建置初始噪聲潛在序列 z_T(完全隨機)
   → 迴圈 t = T 到 1:
        將 z_t 與條件 c 送入 U‑Net(含時空注意力等),預測施加的噪聲
        從 z_t 中去除該噪聲,得到 z_{t-1}
   → 得到乾淨潛在序列 z_0
   → [3D VAE 解碼器] → 輸出影片 V(如 3 秒、24fps、720p)

根據公開論文與開源模型推斷,一款主流圖生影片模型的引數量通常在 20 億至 200 億(2B–20B) 之間。在輝達 A100(80 GB)或 H100 級 GPU 上,生成 3 秒 24fps 的 720p 影片通常需要 30 秒到數分鐘 的推論時間,具體的延遲高度依賴於取樣步數、是否啟用蒸餾加速以及批次大小。這些數字基於 Stability AI 公開的 Stable Video Diffusion 系列及 Runway 技術演示估算,其訓練用到的影片幀數可達數十億幀量級(公開資料顯示 WebVid‑10M 資料集包含約 1000 萬個影片片段,各公司私有資料集規模為公開資料集的 10–100 倍)。

關鍵引數

在圖生影片的技術評估與產品選型中,以下引數決定了使用者體驗與商業可行性。所有效能數值均依據 2024–2025 年間行業公開產品文件與第三方評測整理,具體口徑差異標註於表內。

引數含義當前行業參考值(2024–2025)備註
最大輸出時長單次可穩定生成的影片秒數4–10 秒(主流產品 4–6 秒,Runway Gen‑3 Alpha、可靈等宣稱可至 10 秒)超過 10 秒後物體一致性急劇下降(來源:各產品官方說明)
輸出解析度影片的畫素尺寸普遍為 576p–1080p,部分支援 4K 輸出(通過超分後處理)原生生成解析度多在 768×768 至 1280×720 範圍(來源:Runway、Pika 幫助中心 2024)
幀率每秒幀數(fps)24 fps 或 30 fps(主流),個別允許 8–60 fps 自定義幀率與推論時間正相關(來源:Stable Video Diffusion 文件)
生成時間(延遲)提交任務到完成的時間高階雲端端 GPU 上 3 秒影片約 30 秒–2 分鐘(視模型與步數)各廠商已推出推論加速版,如 Runway Turbo 模式(來源:Runway Research Blog, 2024)
時序一致性畫面中物體身份、外觀與背景在幀間的穩定性人工評估 MOS 分數普遍在 3.0–4.5(5 分制)之間,閃爍與變形仍常見目前公開資料未見統一的 FVD 基準排行榜,各模型自報資料口徑不一(來源:各公司技術報告)
運動合理性生成的動態是否符合物理規律顯著提升但仍有“鬼畜”、穿模、反重力等現象人類評分顯示運動合理性仍是主要扣分項(來源:CVPR 2024 多篇影片生成評測論文)
可控性維度使用者可指定的生成約束運動幅度、攝像機平移/推拉、部分物體運動軌跡(Runway 的運動筆刷等)、風格遷移精確的物理軌跡控制多處在實驗室或內測階段(來源:Runway、Pika 官方公告)
API 呼叫成本按秒/次計費約 $0.03–0.10/秒(2024 年 Runway Gen‑2 / Gen‑3 Alpha 公開定價)價格呈快速下行趨勢(來源:Runway 官方網站定價頁,2024 年 12 月查詢)

說明:部分引數(如 FVD——影片 Frechet 距離)因缺乏跨模型的標準化評測且受訓練資料影響顯著,未直接作為通用對比指標。公開資料未見圖生影片領域公認的行業基準測試集(如 text‑to‑video 中的 MSR‑VTT 遷移版),各模型效能對比多基於自選測試影像和自定評測標準。

技術路線

圖生影片技術存在多條並行演化路線,目前以基於擴散的潛在影片模型為工程化主流,其他路線多處於研究探索階段。

技術路線核心原理典型代表/方向優勢侷限發展階段
基於擴散的潛在影片模型在壓縮的時空潛在空間對整段影片序列進行迭代去噪Stable Video Diffusion (Stability AI)、Runway Gen‑2/Gen‑3 Alpha、Pika 2.0、可靈基礎架構生成質量最高,訓練過程穩定,易於規模化推論計算量巨大,成本高,長影片(>10 s)一致性仍難保障主流工程化,產品落地核心
基於 Transformer 的自迴歸模型將影片幀離散化為視覺 token,逐幀或逐段自迴歸預測VideoPoet (Google)、部分開源研究模型架構統一,易於整合多模態,理論上支援任意長度生成計算複雜度隨長度指數增長,長影片質量易退化研究探索期,Google VideoPoet 2023 年底亮相
混合架構(擴散 + 自迴歸)使用擴散模型生成關鍵幀,自迴歸模型完成幀間插值部分學術論文(如 NUWA‑XL 等)結合擴散的高質量與自迴歸的長序列生成潛力架構複雜,流水線誤差累積,尚未看到領先產品前沿研究期
物理引擎引導生成將物理模擬器作為先驗約束或判別器,強制運動符合物理規律輝達相關研究(如 Phys‑Diffusion 等)運動與碰撞極為真實,適合特定場景(如剛體運動)依賴物理引擎建模的完整度,複雜軟體/流體泛化難,計算量更大早期實驗室階段

(來源:各公司官方部落格、學術論文預印本,時間截至 2025 年初)

上游

圖生影片的上游由算力硬體、訓練資料與基礎模型架構三部分構成,其中算力仍是當前的最大約束。

  1. 算力硬體

    • GPU:輝達 H100、H200、B200 是這個階段訓練影片生成模型的主力晶片。據輝達 2025 財年第二季度(2024 年 8 月)財報,資料中心營收達 263 億美元,年增率增長 154%,其中大規模叢集被用於訓練包含影片生成在內的多模態模型(來源:輝達財報 2024Q2)。AMD MI300X 等產品也開始進入部分雲端廠商的 AI 例項。
    • 雲端服務:亞馬遜 AWS(提供 P4d/P5 例項等)、微軟 Azure、Google雲端 GCP 是核心訓練託管平台。推論層面的 GPU 雲端服務(如 CoreWeave、Lambda Labs)也因圖生影片需求而獲得增長。
  2. 影片與影像資料

    • 公開資料集:WebVid‑10M(包含約 1000 萬個影片‑文本對)、LAION‑5B(影像‑文字對,部分用於預訓練影像編碼器)、HD‑VILA‑100M 等高解析度影片資料集構成行業公開資料基礎(來源:各自論文與官網)。
    • 專有資料:頭部公司普遍依賴內部採集與標註的十億級幀級別的影片‑影像對。根據 Runway 和 Stability AI 技術報告,其影片預訓練資料規模達到數億至數十億影片幀。
    • 資料清洗與標註:影片資料的質量篩選、場景切割、動作描述標註、美學評分等是重要但未標準化的上游環節,催生了專門的標註服務商與自動化標註工具。
  3. 基礎模型與架構

    • 影像編碼器:CLIP(OpenAI)、SigLIP 等負責理解輸入影像的語義,是條件生成的基礎。
    • 3D VAE:用於影片壓縮至潛在空間的模型,是降低擴散計算量的關鍵。例如 Stability AI 開源的 SVD 所附帶的 3D VAE(來源:Stability AI 官方 GitHub)。
    • 訓練架構:PyTorch 是絕對主流,DeepSpeed、Megatron‑LM 等分散式訓練庫支撐千卡以上的大規模訓練。

上游環節的產能與成本資料多不公開。以訓練一個百億引數級影片模型為例,據行業推測,需要數百至數千塊 H100 GPU 進行數週乃至數月訓練,對應訓練成本可高達數千萬美元(來源:多家財經媒體推斷,公開資料未見精確揭露)。

下游

下游應用正處於從“嚐鮮”到“工具化”的轉化期,具體滲透情況如下:

  1. 影視與專業內容預製

    • 功能:導演和視效團隊利用圖生影片快速生成分鏡預覽、場景動態模擬、特效原型,用於內部比稿與方案溝通,大幅縮短前期週期。
    • 進展:好萊塢多家主要工作室已開始內測相關工具(據《Variety》2024 年 3 月報道),但尚未有製片方公開揭露其預算中生成的影片佔比。
  2. 廣告與電商內容生產

    • 功能:商家上傳商品圖,自動生成動態展示影片,替代部分棚拍和三維渲染工作。例如展示鞋子 360 度旋轉、服飾飄動等。
    • 落地例項:電商平台如 Shopify 集成了 AI 影片生成應用,萬興科技旗下的喵影工廠(Filmora)內建了“圖生影片”功能,幫助商家生成營銷短片(來源:萬興科技 2023 年年報,其中提及影片創意產品 AI 功能整合,但未單獨揭露該模組營收佔比)。
  3. 社交媒體與 UGC 平台

    • 功能:短影片平台將圖生影片作為新型特效或模板,使用者上傳自己的照片生成創意短片。
    • 落地例項:快手“可靈”模型自 2024 年 6 月釋出後,已內嵌至快手 App 中,使用者可直接在釋出頁使用;抖音系的“即夢”AI 也提供了影像生成影片的入口。社交媒體的裂變效應對 AP 流量需求拉動明顯,但相關變現模式仍以廣告和打賞為主,與生成模型直接營收關聯度低(公開資料未見直接營收對映資料)。
  4. 遊戲與互動娛樂

    • 功能:生成 2D 或偽 3D 的動態背景、角色動畫等,用於遊戲原型和獨立遊戲開發。
    • 進展:Unity、Unreal Engine 的開發者社群已有眾多通過 API 接入生成動態資產的實驗性工具,但距離主流商業遊戲製作標準仍有差距。
  5. 教育與培訓

    • 功能:教師上傳示意圖、歷史照片等,生成動態教學短片,提升學習沉浸感。
    • 進展:仍處早期,多數為個別教師自發使用生成式工具,尚未形成獨立軟體品類或付費模式。

下游商業模式主流仍為按量計費的 API 或基於訂閱的 SaaS。以 Runway 為例,其訂閱計劃按月收取固定費用,區分生成影片的數量與解析度,反映了從早期免費探索向付費工具轉型的行業趨勢(來源:Runway 官網定價頁,2025 年 1 月訪問)。

受益公司

以下公司(含上市公司與非上市公司)因直接參與圖生影片產業鏈而受到市場關注。列出僅反映其在產業鏈中的角色,不構成任何買賣建議或投資推薦

算力基石 — 晶片與雲端

  • 輝達(NVIDIA, NASDAQ: NVDA):影片生成模型所需的大規模訓練與推論叢集幾乎全部基於其 GPU 建置。2025 財年第二季度財報顯示其資料中心營收達 263 億美元(來源:輝達 2024Q2 財報),生成式 AI 需求是核心驅動力,但公司未單獨拆分影片生成工作量。雲端廠商如 Amazon(NASDAQ: AMZN)、Microsoft(NASDAQ: MSFT)、Alphabet(NASDAQ: GOOGL) 因提供 GPU 例項與 AI 平台服務而間接受益。

垂直模型與工具 — 非上市公司

  • Runway:賽道開創者之一,2023 年 6 月完成 C 輪融資,估值約 15 億美元(來源:TechCrunch 2023 年 6 月報道)。推出 Gen‑2、Gen‑3 Alpha 等產品,已形成相對成熟的商用 API 與自有應用生態。
  • Pika Labs:由斯坦福博士生創立,2023 年 11 月獲得 5500 萬美元 A 輪融資(來源:Pika 官方部落格及 Forbes 報道)。產品迭代速度快,以簡潔的使用者介面和較快生成速度著稱,推出 Pika 2.0 後進一步提升了可控性。
  • Stability AI:開源路線的旗手,2022 年 10 月完成 1.01 億美元種子輪融資,估值曾達 10 億美元(來源:Bloomberg 2022 年 10 月報道)。其開源的 Stable Video Diffusion(SVD)為大量二次開發、微調提供了基礎模型,但商業模式和盈利能力公開資料未見明確好轉。
  • Luma AI:以影像到 3D 起步,2024 年 6 月釋出影片生成模型 Dream Machine,因快速生成流暢影片引發關注。已完成 B 輪融資(金額約 4300 萬美元,來源:Crunchbase),具體財務資料未公開。

生態嵌入與場景方 — 上市公司

  • 快手(快手‑W,01024.HK):擁有海量短影片使用者與內容,其“可靈”(Kling)影片生成模型自 2024 年 6 月釋出以來已整合至快手 App,並在海外推出獨立應用。2023 年全年總營收約 1135 億元人民幣(來源:快手 2023 年年報),目前 AI 生成影片的直接營收佔比未單獨揭露,主要視為增強內容生態的工具。
  • Adobe(NASDAQ: ADBE):積極將影片生成能力整合進 Premiere Pro、After Effects 等專業創作工具,並與第三方模型(如 Runway、Pika)合作提供外掛。2024 財年數字媒體部門年營收約 160 億美元(來源:Adobe 2024 財年財報),圖生影片作為新功能的附加價值尚未單獨量化。
  • 萬興科技(300624.SZ):旗下影片創意軟體 Filmora 集成了 AI 影片生成(含圖生影片)能力。2023 年年報中表示持續投入 AI 技術研發,但未單獨揭露 AI 影片生成功能帶來的增量營收(來源:萬興科技 2023 年年報)。
  • 其他版面配置者:字節跳動推出“即夢”AI,騰訊釋出混元影片生成大型模型,均已進入測試或應用階段,但因其均未獨立上市或業務佔比極小,財務影響尚不可見。

(注:以上公司與產品的關聯均基於公開新聞、公司公告與產品頁面,財務數字均標明年份與來源。未標註數字的段落表示公開資料未見精確資料。)

市場規模

圖生影片作為一個仍在成形的細分市場,獨立的市場規模資料極度匱乏。以下資料均來自第三方機構的整體影片生成 / 生成式 AI 媒體市場估算,且不同報告在定義、方法論與預測口徑上差異較大,僅供理解量級參考

  • 2023 年整體生成式 AI 在媒體與娛樂市場:Grand View Research 於 2023 年 9 月釋出的報告指出,2023 年全球生成式 AI 在媒體與娛樂領域的市場規模約為 12.4 億美元,預計 2024–2030 年複合年增長率超過 30%(來源:Grand View Research, Generative AI In Media And Entertainment Market Report,2023)。
  • AI 影片生成市場預測:根據 MarketsandMarkets 2024 年 1 月報告,2024 年全球 AI 影片生成市場交易規模約為 5.6 億美元,預計到 2030 年將達到 21.2 億美元,CAGR 約為 24.6%(來源:MarketsandMarkets, AI Video Generator Market 2024)。該研究覆蓋了包括圖生影片、文生影片在內的所有基於 AI 的影片合成工具。
  • 更激進的長期展望:ABI Research 在 2023 年 6 月預測,到 2030 年,生成式 AI 影片創作市場規模將超過 100 億美元(來源:ABI Research 新聞稿,2023 年 6 月)。但這一預測囊括了整個影片創作價值鏈中的 AI 貢獻,遠不止圖生影片的 API 或訂閱營收。

專門針對“圖生影片”的市場規模:截至 2025 年初,公開資料未見任何一家權威機構釋出僅聚焦“圖生影片”的獨立市場規模統計或預測。根據多家財報電話會與風投訪談的碎片資訊,2024 全年全球主要圖生影片 API 與訂閱營收合計估計在 1–2 億美元量級,且增速極快,但仍處於商業化早期。

與供給成本形成對比:2024 年生成 3 秒影片的單次推論硬體成本(在雲端端例項分攤後)估算仍有 0.01–0.03 美元(基於輝達 H100 租賃價格與公開模型效率推測,公開資料未見精確成本揭露)。高昂的成本是當前限制大規模產業化的關鍵經濟壁壘。

玩家對比

以下對比基於各公司截至 2025 年第一季度公開的產品頁面、技術報告與媒體報道。估值與融資資料標明年份與來源。

產品/模型最大時長典型解析度/幀率關鍵可控性計費模式開源情況主要優勢侷限最新融資/估值(來源)
Runway Gen‑3 Alpha10 秒720p–4K(超分), 24 fps運動筆刷、攝像機控制訂閱制($15–$95/月不等),也提供企業 API閉源綜合畫質高、具備業界領先的幀間一致性,生態整合深價格較高,對於軌跡精確控制仍較有限2023 年 6 月 C 輪估值 15 億美元(TechCrunch)
Pika 2.0約 6 秒1080p, 24 fps區域修改、表情控制,提供“Pikadditions”融合等創意功能免費 + 訂閱($10–$60/月)閉源生成速度快、使用者介面友好,社交媒體傳播效應強過 5–6 秒後複雜場景一致性略降2023 年 11 月 A 輪融資 5500 萬美元(Pika 官方)
Stable Video Diffusion 1.14–5 秒576×1024, 24 fps(多尺寸)運動幅度通過引數調節,缺乏使用者互動式控制開源免費(需遵守非商業部分條款)開源研究基準,社群微調版本多,可定製性強原生可控性差,部署門檻高,需額外工程能力母公司 Stability AI 2022 年 10 月種子輪融資 1.01 億美元(Bloomberg)
Luma Dream Machine5 秒最高 1360×752, 24 fps初版控制項少,後續引入關鍵幀擴充套件免費時限量,訂閱 $29.99/月起閉源最初發布以快速生成流暢影片引起轟動解析度偏低,高動態場景易出現細節崩潰B 輪約 4300 萬美元(Crunchbase,2024 年)
可靈 (快手)約 5–10 秒1080p, 30 fps初期相對基礎,後續增加運鏡控制和幅度調整國內版內置於快手 App,海外版提供訂閱閉源依託快手海量影片資料訓練,對複雜動作捕捉較好,與社交媒體場景天然融合國際市場知名度不及 Runway/Pika,獨立開發者 API 早期階段母公司快手公開上市(01024.HK);模型單獨融資資訊公開資料未見
Google VideoPoet / Lumiere展示 5 秒左右片段實驗性,論文中展現文本與影像條件生成尚未產品化未開源完整模型生成質量高,運動自然,技術報告引領方向僅限研究演示,無公開可用產品Google母公司 Alphabet(NASDAQ: GOOGL)內部專案
OpenAI Sora演示 60 秒1080p, 多種幀率文本驅動影像合成影片,具備影像輸入條件2024 年 12 月向 ChatGPT Plus/Pro 使用者開放閉源全影片生成能力極強,時長與一致性遠超同期產品高畫質推論資源消耗巨大,商業定價高,可控性仍以文本為主母公司 OpenAI 估值已超 800 億美元(2024 年,WSJ);Sora 未單獨融資

(注:產品引數會隨更新變化,以上為 2025 年初截面資料。Sora 雖以文生影片為主,但其圖生影片能力已通過官方演示證實,故一併列入對比。)

風險

圖生影片的商業化應用面臨技術、商業模式、合規和競爭四重典型風險。

1. 技術可靠性風險

  • 長影片崩潰:當前模型普遍難以在超過 10 秒的生成中保持人物身份、物體幾何與光照的一致性,突然的形變、變色、穿幫仍頻繁出現。
  • 物理真實性不足:模型常生成違反重力、碰撞、材質穿透等基本物理規律的畫面,這在影視、工業級應用中構成絕對瓶頸。
  • 算力與延遲:單次生成仍需要數十秒至數分鐘,難以支撐即時互動式創作,且影片畫質提高帶來的計算成本呈非線性增長。

2. 商業模式風險

  • 高推論成本:如前文所述,生成 3 秒影片的硬體成本可能超過 0.01 美元,使得低客單價場景難以盈利。
  • 定價壓力:開源模型(如 SVD)使得任何廠商都面臨被免費替代的威脅,
source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型