應用層 開放閱讀

AI 影片生成

AI Video Generation

AI 影片生成用擴散或 Transformer 架構從文本、影像或影片條件生成動態畫面,正在進入創意工具、廣告、遊戲和模擬場景。

概念 ID
ai-video-generation
更新時間
2026-05-29
來源數量
待補
Compassing AI 上下文 比較 Sora、Runway、Veo、可靈和開源影片模型。
4.3億美元
FBI 2023
Fortune Business Insights 2024-09 口徑
AI 影片生成 MDX · 2026-05-29
25.6億美元
FBI 2030E
同報告預測
AI 影片生成 MDX · 2026-05-29
29.1%
CAGR
2024-2030 複合增速
AI 影片生成 MDX · 2026-05-29
產業信號
  • 2024 年起頭部模型集中開放預覽或產品化,影片生成從演示走向 API 和創意工具。
  • 版權合作伙伴和內容標識要求成為模型商業化的重要配套。
口徑風險
  • 長影片仍有漂移、形變和物理邏輯錯誤,不能替代物理模擬。
  • 市場統計口徑差異大,軟體、平台、基礎設施是否納入會顯著影響規模數字。

AI 影片生成在產業鏈哪一環?

AI 影片生成 MDX · 2026-05-29
應用層 / 生成式媒體工具

MDX 將其下游定義為創意與生產力工具、遊戲、教育模擬、社交內容平台和 API 雲端服務。

上游依賴
  • GPU/HBM 和雲端訓練推論叢集
  • 授權影片資料與合成數據
  • PyTorch、JAX、DeepSpeed 等訓練架構
下游承接
  • 剪輯軟體、廣告和電影預演
  • 遊戲、教育和模擬
  • 社交內容平台和 API 服務

相關公司

MDX 提及的產業參與者
  • OpenAI Sora
  • Runway Gen 系列
  • Google DeepMind Veo
  • Kuaishou 可靈
  • MiniMax 海螺 AI
  • Adobe Firefly Video / Premiere Pro

產品/模型路線怎麼觀察?

AI 影片生成 MDX · 2026-05-29

閉源平台模型

Sora、Veo、Runway、可靈等通過 Web 或 API 開放能力。

高質量生成和商業 API

開源權重路線

SVD、Open-Sora、CogVideoX 等降低復現和微調門檻。

研究、私有化和垂直微調

創意軟體整合

Firefly、CapCut、Canva 等把影片生成嵌入既有創作工具。

工作流內採用和訂閱變現

相鄰概念鏈

便於橫向跳轉

來源台賬

數字與判斷口徑
來源類型截至
AI 影片生成 MDX mdx 2026-05-29
source: concept-rich schema · as_of 2026-05-29 富區塊僅用於產業鏈學習、信息檢索和研究輔助;不構成投資建議。

AI 影片生成

3 秒看懂

AI 影片生成讓計算機依據文本、圖片或現有影片自動建立連續、逼真的影片片段。其核心是從海量影片資料中學習物體的運動規律、場景變化與光影邏輯,生成連貫的時空影像。近兩年,基於擴散模型(Diffusion)與 Transformer 的架構推動生成影片的可控性、時長與一致性飛速提升,但距離工業化可靠的“全自動導演”仍有實質差距。

3 分鐘產業解釋

AI 影片生成正從實驗室走向影視、營銷、遊戲、教育等應用場景。產業邏輯類似文本到影像,但影片多了一個“時間維度”,模型必須理解幀與幀之間的動態關係。當前主流技術路線分為三類:

  • 擴散模型路線:將影像擴散生成推廣到時空,例如在潛空間對影片的時空 Patch 同時去噪。代表工作包括 Runway 的 Gen 系列、Pika、OpenAI Sora、Google Veo 和快手的可靈等。
  • 自迴歸 Transformer 路線:將影片視為時空 Token 序列,用類似語言模型的 Next-Token 預測方式逐幀或逐組生成,例如 VideoGPT 和 Phenaki 等早期探索。
  • 掩碼生成與混合路線:部分模型採用掩碼建模(Masked Video Modeling)或擴散與自迴歸結合的混合架構,意在兼顧長程一致性與生成效率。

產業關鍵瓶頸在於算力資料。影片生成的運算量比單張圖片高出數個數量級;高質量影片資料獲取難、標註成本高,且版權風險日益突出。頭部企業因此傾向於結合自有或授權資料進行訓練,同時推出可控生成工具(如相機運動、物體互動),讓使用者以提示詞或參考圖進行精調。商業落地最先發生在廣告素材、短影片輔助、影視預演、遊戲資產和教育演示等中低風險場景;高階影視製作仍需導演、剪輯、合成和人工審查的共同參與。

技術原理

基礎架構(擴散影片生成)
現代影片生成模型通常採用“時空壓縮 + 條件擴散”的架構。首先,3D 變分自編碼器(VAE)將原始影片畫素壓縮到低維潛空間,在空間和時間維度同時實現大幅度下采樣(如空間 8×8、時間 4×~8×)。然後,擴散模型在該潛空間上訓練,逐步去噪,並引入文本、影像等條件訊號。最後,潛空間解碼器將去噪後的潛變數逐幀或整段解碼回畫素影片。

輸入:文本提示 + 噪聲潛變數 z_t (shape: [B, C_lat, T_lat, H_lat, W_lat])
過程:逐步去噪,由擴散模型 ε_θ(z_t, t, c) 預測噪聲
輸出:去噪潛變數 z_0 -> 影片解碼 -> (B, T, H_pix, W_pix, C)

骨幹網路與注意力機制

  • 時空解耦注意力:先在各幀內部執行空間自注意力,再跨幀執行時間自注意力。計算效率較高,被多數產品級模型採用。
  • 全 3D 自注意力(DiT 類):直接對所有時空 Token 做全域性注意力,表達力最強,但視訊記憶體和計算量隨序列長度平方增長。Sora 等技術報告顯示其使用了 Diffusion Transformer(DiT)骨幹,並在大規模潛空間上進行訓練,能夠生成較長時間的影片。
  • 條件注入:文本條件通常經 T5 或 CLIP 文本編碼器得到向量或序列,通過交叉注意力層融入骨幹網路。可額外加入影像先驗(從首幀影像生成後續影片)、深度圖、關鍵點、光流等結構化條件,實現更精細的控制。

訓練與推論策略

  • 噪聲排程:與影像擴散類似,訓練時對潛變數新增不同程度的噪聲,要求模型恢復原始訊號。為處理長影片,常用漸進式訓練(從短片段逐步擴充套件到長片段)或分段訓練。
  • 推論加速:通常採用 DDIM 或 DPM-Solver 等快速取樣器,結合模型蒸餾、潛一致性模型(LCM)或一步生成技術大幅減少採樣步數。即使如此,在高階 GPU(如 A100/H100)上生成 10 秒級影片仍需要分鐘級時間(依據產業實測估算,具體硬體與最佳化狀態未完全揭露)。
  • 高解析度策略:級聯生成(先生成低解析度影片,再用空間超分模型放大)是平衡質量與成本的主流方式,部分模型通過潛空間直接生成高解析度。

評估方法
自動指標包括 FVD(Fréchet Video Distance)、IS(Inception Score)影片版、CLIP 幀間一致性打分,以及近期提出的 VideoScore 等。但尚無單一指標能完美反映人類觀感,因此仍高度依賴人工評估,重點關注單幀畫質、時間一致性、運動自然度和提示詞語義遵循度。

關鍵引數

以下引數基於 2024 年公開技術報告、產品文件和社群評測綜合梳理,部分數值因廠商未全量揭露而為估計範圍。

  • 生成時長:主流閉源產品可穩定生成 4–60 秒,Sora 展示最長約 1 分鐘,可靈等模型逐步開放至 2 分鐘;開源模型通常在 2–16 秒範圍內。
  • 解析度:多數已支援 1080p(1920×1080),部分通過級聯超分達到 4K;訓練時常在較低解析度(如 256×256)的潛空間上進行,輸出時上取樣。
  • 幀率:典型 24 fps 或 30 fps;訓練時為了節省算力常使用 8–12 fps,再通過幀插值網路提升至目標幀率。
  • 時間一致性:常用 FVD 衡量生成影片與真實影片分佈的距離,數值越低越好。2024 年頂級模型在 UCF-101、Kinetics-600 等基準上的 FVD 已降至 100–300 區間,但不同評估設定差異大,橫向比較需謹慎。
  • 推論延遲:生成 1 秒影片所需的時間高度依賴硬體與最佳化。在 A100/H100 上,5 秒 1080p 影片通常需要 1–5 分鐘;部分產品(如 MiniMax 海螺)通過工程最佳化可將 6 秒生成壓縮到 30 秒以內,但公開資料未見統一的標準化延遲指標。
  • 模型引數量與訓練算力:未充分揭露。據推算,產品級影片生成模型引數量在數十億至數百億量級,訓練所需 GPU 小時動輒數十萬至數百萬(A100 等效),單次訓練成本可能達數千萬美元。
  • 可控性精度:指令遵循度尚無通用標準化指標。通常以人工評分衡量對相機運動、物體互動和文本描述的執行準確率。
  • API 價格(2024 年末):Runway Gen-3 Alpha Turbo 約 0.5–1.0 美元/秒等效影片;可靈國際版提供包月套餐和按量計費,公開資料未見統一口徑;開源模型部署成本僅含推論算力,但自託管門檻高。

技術路線

下表基於業界公開資訊進行定性對比,避免硬規格臆測。

維度擴散模型為主(Sora/Veo/可靈)自迴歸 Transformer掩碼/混合模型基於 GAN 的方法
架構潛影片擴散 + DiT/時空 UNetVQ-VAE + 長程 Transformer掩碼時空建模 + 輕量解碼器3D 卷積生成器+判別器
影片時長可達數十秒至兩分鐘可達數十秒,長程漂移明顯數十秒,一致性優於自迴歸幾秒,運動簡單
畫質/一致性高畫質,時空一致性較好細節易模糊,長程漂移畫質良好,閃爍較少閃爍、偽影顯著
計算需求極大,萬卡級叢集訓練大,自迴歸解碼慢較擴散略低,解碼快較低,但效果差
可控性文本、影像、結構條件精細控制文本條件為主可加入條件,但方法不如擴散成熟難精細控制
發展階段主力路線,產品化迅速(2024)研究活躍,但產品化落後新興方向,學術探索中較少使用

此外,圍繞“世界模型”的思路逐漸興起,即在影片生成的同時學習物理狀態、動作後果的隱式表示,但尚處早期研究階段,未推出現實產品。

上游

  • 算力基礎設施
    • GPU/TPU 大規模叢集(萬卡級),高速互聯(InfiniBand/RoCE)。訓練和推論對視訊記憶體頻寬需求極大,直接拉動 HBM(高頻寬記憶體)和先進封裝(如 2.5D/3D 封裝)需求。
    • 伺服器、光模組、液冷系統等硬體,因影片生成對叢集穩定性、散熱效率要求極高而受益。
  • 資料供給
    • 高質量影片素材庫(影視作品、短影片平台內容、自採資料),需經剪輯、清洗、去重和版權稽核。
    • 合成數據逐步成為補充,通過 3D 引擎或遊戲引擎生成帶精確深度、光流和動作標註的影片。
    • 資料標註服務:動作描述、物體分割、深度估計、場景圖建置等。
  • 訓練架構與中介軟體
    • PyTorch、JAX、Megatron-LM、DeepSpeed 等分散式訓練架構;
    • 用於影片編解碼、幀提取和潛空間處理的專用庫。
  • 版權合規服務
    • 授權影片平台(如 Shutterstock、Getty Images 等)與模型商合作提供合規訓練資料;
    • 版權鏈追溯與內容識別技術,防止模型輸出侵權內容。

下游

  • 創意與生產力工具:影片生成嵌入剪輯軟體(Adobe Premiere Pro 整合 Runway、剪映/CapCut 上線 AI 影片功能),輔助短影片創作、廣告生成、電影預演(Previs)。
  • 遊戲與虛擬世界:自動生成過場動畫、NPC 對話背景、虛擬場景漫遊影片,加速關卡原型製作。
  • 教育與模擬:生成教學演示影片、醫學動畫、自動駕駛模擬場景合成;企業培訓中的角色演練。
  • 社交與內容平台:為創作者提供一鍵生成特效、動態桌布和二次創作工具,降低內容生產門檻。
  • API 與雲端服務:Runway、Pika、Google Vertex AI、快手等提供影片生成 API,允許第三方應用整合。

受益公司

以下僅基於公開資料客觀描述產業鏈參與者的業務關聯,不構成任何形式的投資建議或推薦。

  • 算力硬體供應商:NVIDIA(A100/H100/B200 等 GPU,資料中心業務顯著受益於生成式影片負載)、AMD、Intel,以及 HBM 供應商 SK 海力士、三星等。
  • 雲端基礎設施廠商:AWS、微軟 Azure、Google Cloud(提供 AI 訓練與推論例項,並託管影片生成 API);CoreWeave、Lambda Labs 等專業 GPU 雲端服務商。
  • 模型與平台公司:OpenAI(Sora)、Runway(Gen 系列)、Google DeepMind(Veo)、快手(可靈)、MiniMax(海螺 AI)、字節跳動(豆包影片模型)、Stability AI(Stable Video Diffusion)、智譜 AI(CogVideo)。
  • 創意軟體與工具:Adobe(Firefly 影片模型整合至 Premiere Pro)、剪映/CapCut(位元組系,內嵌影片生成)、Canva(整合 AI 影片)。
  • 資料與版權合作伙伴:Shutterstock(與 OpenAI 等簽署訓練資料授權)、Getty Images 等,因影片生成對合規資料需求大而拓展業務邊界。
  • 下游應用領域公司:影視製作方、遊戲開發商、廣告代理及社交媒體平台,雖不直接研發模型,但通過使用上述工具降低製作成本、提升效率,間接受益。

市場規模

受限於 AI 影片生成細分市場尚處萌芽期,不同機構的統計口徑與預測範圍差異較大。綜合多家第三方研究機構 2024 年釋出的資料,整理如下(均標註年份、口徑與來源):

  • Fortune Business Insights(2024 年 9 月報告):2023 年全球 AI 影片生成市場規模約 4.3 億美元,預計 2030 年將增至 25.6 億美元,2024–2030 年複合年增長率(CAGR)約 29.1%。口徑為 AI 影片生成軟體、平台與直接相關服務的總營收。
  • Market.us(2024 年 6 月報告):2023 年全球 AI 影片生成器市場約 5.4 億美元,預計 2033 年達 25.4 億美元,2024–2033 年 CAGR 約 16.7%。口徑聚焦於面向終端使用者的 AI 影片生成器產品與訂閱服務,不含底層基礎設施。
  • Grand View Research(2024 年生成式 AI 媒體與娛樂市場報告):未單獨拆出“影片生成”子類,但其統計的生成式 AI 在媒體與娛樂領域整體規模 2023 年約 14.9 億美元,影片生成為其中增速最快的應用之一。

總體來看,儘管具體數值存在差異,市場對 AI 影片生成的高增長預期較為一致,但真正兌現還需技術成熟與商業化落地共同推進。

玩家對比

下述比較基於截至 2025 年 4 月的公開產品狀態、技術報告與社群評測,未公開資訊標註“未揭露”。

產品/模型開發商核心架構最大生成時長最高解析度API/產品狀態特色功能/備註
SoraOpenAIDiT + 潛影片擴散最長 1 分鐘(演示)1080p2024 年末起對部分付費使用者開放;API 未完全開放多鏡頭切換、物理互動嘗試;公開發布進度緩慢
Gen-3 AlphaRunway擴散(未完全公開)10 秒+1080pWeb 應用及 API 已開放專業創作工具,支援相機運動、影像/影片引導
VeoGoogle DeepMind潛在擴散 Transformer超過 60 秒(展示)1080p2024 年 12 月起通過 Vertex AI 預覽強調長影片一致性與電影級運鏡
可靈 (Kling)快手類 DiT 架構逐步開放至約 2 分鐘1080p國際版應用與 API 已上線真實風格強,運動筆刷等互動控制
海螺 AI 影片MiniMax未公開6 秒1080p免費+付費產品,API 有限開放生成速度較快,社群活躍
SVD (Stable Video Diffusion)Stability AI潛擴散 + 時空 UNet4 秒(影像到影片)1024×576開源權重,可本地部署可微調,適合影像轉影片應用
Open-Sora開源社群類 Sora DiT最長 16 秒512×512(部分版本)完整開源訓練成本與門檻顯著降低,推動復現研究
CogVideoX智譜 AI / 清華擴散 Transformer6 秒720×480開源權重支援文本到影片,中英文提示詞

注:效能指標依賴提示詞質量與硬體,上表僅作定性參考,不構成優劣推薦。

風險

  • 技術風險:長時間影片生成仍存在物體漂移、形變和物理邏輯錯誤;模型對複雜因果關係理解有限,無法保證輸出內容的真實性。
  • 算力與成本風險:訓練與推論成本高企,API 定價在短期內難以覆蓋高階算力開銷,部分企業或面臨資金壓力;開源模型的興起可能進一步壓縮商業產品的溢價空間。
  • 版權與法律風險:訓練資料涉及大量受版權保護的影片,面臨類似影像生成領域的侵權訴訟(如《紐約時報》訴 OpenAI 案,影片模型可能成為下一個焦點)。生成內容若包含可識別的商標、人物或作品元素,可能引發糾紛。
  • 深度偽造與倫理風險:AI 影片生成極易被濫用製造虛假新聞、政治宣傳、色情等內容。各國監管趨勢收緊(例如歐盟 AI 法案、中國深度合成管理規定),可能帶來合規成本或強制技術限制。
  • 商業化不及預期風險:下游需求雖旺盛,但若生成質量長期無法突破“輔助工具”定位,難以開啟大型影視、廣告直接成片的預算,市場增速可能低於預期。
  • 競爭與路線收斂風險:主流技術路線集中在擴散模型,但若出現顛覆性架構(如高效非擴散時序模型),現有參與者積累的優勢可能被迅速削弱。

誤讀糾偏

  1. “Sora 能真正理解物理世界”:Sora 生成的影片看似符合物理規律,但時常出現物體穿透、方向突變、重力異常等錯誤。其本質是基於統計關聯的生成,並不具備物理定律理解和因果推論能力,不能替代物理模擬引擎。
  2. “AI 影片只是影像生成的簡單拼合”:僅逐幀生成影像會導致嚴重閃爍與不一致。影片生成需要顯式的時間建模和跨幀聯合最佳化,在架構、訓練和評估上覆雜度遠超影像生成。
  3. “引數越多,影片質量越高”:盲目堆引數而不改進時空注意力效率、壓縮策略和訓練資料質量,往往導致成本不可承受,而長程一致性未必線性提升。架構創新和資料處理同等重要。
  4. “AI 即將取代影視製作”:當前 AI 影片在精確可控性、角色一致性、複雜敘事和情感表達方面遠弱於成熟 CG 與實拍。中期內,AI 更可能是提高預演、素材和後期效率的輔助工具,非完整替代。
  5. “開源模型能完全平替商業產品”:開源影片模型雖然降低了使用門檻,但在訓練資料規模、工程最佳化、API 易用性和算力資源方面仍難比肩頭部閉源產品。高質量的定製與穩定 API 仍需商業支援。
  6. “AI 影片生成不涉及音訊”:目前主攻畫面,但不少產品開始整合音訊生成(如背景音、音效),未來影片+音訊聯合生成是趨勢,但當前音訊質量仍有限。
  7. “只要資料量夠大就能自動湧現出可控性”:可控性需要精心設計的條件注入機制(如 ControlNet 類網路)、結構化標註資料和針對性的微調策略,純無監督大數據訓練很難自然產生精準的鏡頭運動和物件互動控制。

最新事件

梳理自 2024 年起至 2025 年 4 月的關鍵進展(按時間倒序排列):

  • 2025 年 4 月:Runway 推出 Gen-4 系列模型(具體能力未完全公開),進一步強化時間一致性與互動控制。
  • 2025 年 2–3 月:OpenAI 向更多地區 ChatGPT Plus/Pro 使用者開放 Sora 有限訪問,但高併發導致排隊;同期快手可靈釋出 1.6 版本,支援最長 2 分鐘影片生成並強化畫質。
  • 2024 年 12 月:Google 通過 Vertex AI 開放 Veo 預覽;MiniMax 海螺 AI 影片全球使用者過億,成為消費側黑馬;Adobe Firefly 影片模型開始內測並整合至 Premiere Pro。
  • 2024 年 10 月:Adobe MAX 大會發布 Firefly Video Model 預覽,主打商用安全、版權友好影片生成。
  • 2024 年 7–9 月:Runway Gen-3 Alpha 上線,加入相機運動控制;可靈國際版上線,成為中國首款大規模海外開放的影片生成產品;Stability AI 釋出 SVD 1.1,提升影像到影片質量。
  • 2024 年 6 月:快手釋出可靈(Kling),率先支援最長 2 分鐘生成能力預告,引爆中文網際網路。
  • 2024 年 5 月:Google I/O 釋出 Veo,演示多段 60 秒+高質量影片;同期 MiniMax 推出海螺 AI 影片生成。
  • 2024 年 2 月:OpenAI 釋出 Sora 技術報告及演示影片,展示一分鐘級、多鏡頭切換能力,引發“世界模擬器”廣泛討論。
  • 2024 年 8 月:歐盟《人工智慧法案》(AI Act)正式生效,對生成式 AI 系統施加透明度和內容標識要求,AI 影片產品的合規成本上升。

追蹤指標

持續觀察以下維度,可幫助判斷 AI 影片生成的產業成熟度與競爭力走向。

  • 生成質量
    • FVD、幀間 CLIP 得分、VideoScore 等在公認基準(如 Kinetics-600、MSR-VTT)上的重新整理情況。
    • 主觀評審賽事(如 AI 影片競賽)中的排名與使用者偏好票數。
  • 能力邊界
    • 頭部模型公開的最大生成時長、原生解析度、幀率。
    • 對複雜提示詞(含多物體、精確動作、空間關係)的遵循率。
    • 角色與物體在長影片中的 ID 保持率。
  • 推論效率與成本
    • 主流 API 每生成 1 分鐘 1080p 影片的端到端成本(美元),及年增率降幅。
    • 從提交請求到返回結果的端到端延遲(秒),P50/P95 分位數。
    • 開源模型在消費級硬體(如 RTX 4090)上的單秒推論耗時。
  • 商業化指標
    • 頭部 API/SaaS 平台公佈的年化營收、付費客戶數、生成影片總秒數。
    • 廣告、影視、遊戲等垂直行業中 AI 影片生成滲透率調研。
  • 生態與合規
    • 訓練資料版權訴訟案件的判決或和解動態。
    • 各國針對深度偽造、AI 生成內容標識的新立法或標準。
    • 開放原始碼倉庫的 Star 數、貢獻者數量及模型下載量。
  • 基礎設施
    • GPU/TPU 最新代際對影片生成模型的推論加速比(如 H100 vs B200)。
    • 萬卡級別影片生成訓練叢集的公開部署情況與功耗資料。

信源

(以下信源覆蓋核心技術報告、市場研究及主要產品,部分為長期追蹤積累,具體資料請以原始出處為準)

  1. OpenAI, “Video generation models as world simulators,” Feb 2024.
  2. Runway, Gen-2/Gen-3 Alpha/Gen-4 官方部落格及產品文件.
  3. Google DeepMind, “Veo: a generative video model,” May 2024.
  4. 快手可靈 (Kling) 技術報告,2024 年.
  5. MiniMax,海螺 AI 影片產品公開材料.
  6. Stability AI, “Stable Video Diffusion,” Nov 2023.
  7. 開源專案:Open-Sora, CogVideoX, ModelScopeT2V.
  8. Fortune Business Insights, “AI Video Generator Market Size, Share & COVID-19 Impact Analysis…”, Sep 2024.
  9. Market.us, “AI Video Generator Market Report,” Jun 2024.
  10. Grand View Research, “Generative AI In Media & Entertainment Market Size Report,” 2024.
  11. 歐盟《人工智慧法案》(EU AI Act),2024 年 8 月生效.
  12. Adobe, “Firefly Video Model Preview,” Oct 2024.
  13. Papers with Code, “Video Generation” 任務及排行榜.
source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型