AI 影片生成
3 秒看懂
AI 影片生成讓計算機依據文本、圖片或現有影片自動建立連續、逼真的影片片段。其核心是從海量影片資料中學習物體的運動規律、場景變化與光影邏輯,生成連貫的時空影像。近兩年,基於擴散模型(Diffusion)與 Transformer 的架構推動生成影片的可控性、時長與一致性飛速提升,但距離工業化可靠的“全自動導演”仍有實質差距。
3 分鐘產業解釋
AI 影片生成正從實驗室走向影視、營銷、遊戲、教育等應用場景。產業邏輯類似文本到影像,但影片多了一個“時間維度”,模型必須理解幀與幀之間的動態關係。當前主流技術路線分為三類:
- 擴散模型路線:將影像擴散生成推廣到時空,例如在潛空間對影片的時空 Patch 同時去噪。代表工作包括 Runway 的 Gen 系列、Pika、OpenAI Sora、Google Veo 和快手的可靈等。
- 自迴歸 Transformer 路線:將影片視為時空 Token 序列,用類似語言模型的 Next-Token 預測方式逐幀或逐組生成,例如 VideoGPT 和 Phenaki 等早期探索。
- 掩碼生成與混合路線:部分模型採用掩碼建模(Masked Video Modeling)或擴散與自迴歸結合的混合架構,意在兼顧長程一致性與生成效率。
產業關鍵瓶頸在於算力與資料。影片生成的運算量比單張圖片高出數個數量級;高質量影片資料獲取難、標註成本高,且版權風險日益突出。頭部企業因此傾向於結合自有或授權資料進行訓練,同時推出可控生成工具(如相機運動、物體互動),讓使用者以提示詞或參考圖進行精調。商業落地最先發生在廣告素材、短影片輔助、影視預演、遊戲資產和教育演示等中低風險場景;高階影視製作仍需導演、剪輯、合成和人工審查的共同參與。
技術原理
基礎架構(擴散影片生成)
現代影片生成模型通常採用“時空壓縮 + 條件擴散”的架構。首先,3D 變分自編碼器(VAE)將原始影片畫素壓縮到低維潛空間,在空間和時間維度同時實現大幅度下采樣(如空間 8×8、時間 4×~8×)。然後,擴散模型在該潛空間上訓練,逐步去噪,並引入文本、影像等條件訊號。最後,潛空間解碼器將去噪後的潛變數逐幀或整段解碼回畫素影片。
輸入:文本提示 + 噪聲潛變數 z_t (shape: [B, C_lat, T_lat, H_lat, W_lat])
過程:逐步去噪,由擴散模型 ε_θ(z_t, t, c) 預測噪聲
輸出:去噪潛變數 z_0 -> 影片解碼 -> (B, T, H_pix, W_pix, C)
骨幹網路與注意力機制
- 時空解耦注意力:先在各幀內部執行空間自注意力,再跨幀執行時間自注意力。計算效率較高,被多數產品級模型採用。
- 全 3D 自注意力(DiT 類):直接對所有時空 Token 做全域性注意力,表達力最強,但視訊記憶體和計算量隨序列長度平方增長。Sora 等技術報告顯示其使用了 Diffusion Transformer(DiT)骨幹,並在大規模潛空間上進行訓練,能夠生成較長時間的影片。
- 條件注入:文本條件通常經 T5 或 CLIP 文本編碼器得到向量或序列,通過交叉注意力層融入骨幹網路。可額外加入影像先驗(從首幀影像生成後續影片)、深度圖、關鍵點、光流等結構化條件,實現更精細的控制。
訓練與推論策略
- 噪聲排程:與影像擴散類似,訓練時對潛變數新增不同程度的噪聲,要求模型恢復原始訊號。為處理長影片,常用漸進式訓練(從短片段逐步擴充套件到長片段)或分段訓練。
- 推論加速:通常採用 DDIM 或 DPM-Solver 等快速取樣器,結合模型蒸餾、潛一致性模型(LCM)或一步生成技術大幅減少採樣步數。即使如此,在高階 GPU(如 A100/H100)上生成 10 秒級影片仍需要分鐘級時間(依據產業實測估算,具體硬體與最佳化狀態未完全揭露)。
- 高解析度策略:級聯生成(先生成低解析度影片,再用空間超分模型放大)是平衡質量與成本的主流方式,部分模型通過潛空間直接生成高解析度。
評估方法
自動指標包括 FVD(Fréchet Video Distance)、IS(Inception Score)影片版、CLIP 幀間一致性打分,以及近期提出的 VideoScore 等。但尚無單一指標能完美反映人類觀感,因此仍高度依賴人工評估,重點關注單幀畫質、時間一致性、運動自然度和提示詞語義遵循度。
關鍵引數
以下引數基於 2024 年公開技術報告、產品文件和社群評測綜合梳理,部分數值因廠商未全量揭露而為估計範圍。
- 生成時長:主流閉源產品可穩定生成 4–60 秒,Sora 展示最長約 1 分鐘,可靈等模型逐步開放至 2 分鐘;開源模型通常在 2–16 秒範圍內。
- 解析度:多數已支援 1080p(1920×1080),部分通過級聯超分達到 4K;訓練時常在較低解析度(如 256×256)的潛空間上進行,輸出時上取樣。
- 幀率:典型 24 fps 或 30 fps;訓練時為了節省算力常使用 8–12 fps,再通過幀插值網路提升至目標幀率。
- 時間一致性:常用 FVD 衡量生成影片與真實影片分佈的距離,數值越低越好。2024 年頂級模型在 UCF-101、Kinetics-600 等基準上的 FVD 已降至 100–300 區間,但不同評估設定差異大,橫向比較需謹慎。
- 推論延遲:生成 1 秒影片所需的時間高度依賴硬體與最佳化。在 A100/H100 上,5 秒 1080p 影片通常需要 1–5 分鐘;部分產品(如 MiniMax 海螺)通過工程最佳化可將 6 秒生成壓縮到 30 秒以內,但公開資料未見統一的標準化延遲指標。
- 模型引數量與訓練算力:未充分揭露。據推算,產品級影片生成模型引數量在數十億至數百億量級,訓練所需 GPU 小時動輒數十萬至數百萬(A100 等效),單次訓練成本可能達數千萬美元。
- 可控性精度:指令遵循度尚無通用標準化指標。通常以人工評分衡量對相機運動、物體互動和文本描述的執行準確率。
- API 價格(2024 年末):Runway Gen-3 Alpha Turbo 約 0.5–1.0 美元/秒等效影片;可靈國際版提供包月套餐和按量計費,公開資料未見統一口徑;開源模型部署成本僅含推論算力,但自託管門檻高。
技術路線
下表基於業界公開資訊進行定性對比,避免硬規格臆測。
| 維度 | 擴散模型為主(Sora/Veo/可靈) | 自迴歸 Transformer | 掩碼/混合模型 | 基於 GAN 的方法 |
|---|
| 架構 | 潛影片擴散 + DiT/時空 UNet | VQ-VAE + 長程 Transformer | 掩碼時空建模 + 輕量解碼器 | 3D 卷積生成器+判別器 |
| 影片時長 | 可達數十秒至兩分鐘 | 可達數十秒,長程漂移明顯 | 數十秒,一致性優於自迴歸 | 幾秒,運動簡單 |
| 畫質/一致性 | 高畫質,時空一致性較好 | 細節易模糊,長程漂移 | 畫質良好,閃爍較少 | 閃爍、偽影顯著 |
| 計算需求 | 極大,萬卡級叢集訓練 | 大,自迴歸解碼慢 | 較擴散略低,解碼快 | 較低,但效果差 |
| 可控性 | 文本、影像、結構條件精細控制 | 文本條件為主 | 可加入條件,但方法不如擴散成熟 | 難精細控制 |
| 發展階段 | 主力路線,產品化迅速(2024) | 研究活躍,但產品化落後 | 新興方向,學術探索中 | 較少使用 |
此外,圍繞“世界模型”的思路逐漸興起,即在影片生成的同時學習物理狀態、動作後果的隱式表示,但尚處早期研究階段,未推出現實產品。
上游
- 算力基礎設施:
- GPU/TPU 大規模叢集(萬卡級),高速互聯(InfiniBand/RoCE)。訓練和推論對視訊記憶體頻寬需求極大,直接拉動 HBM(高頻寬記憶體)和先進封裝(如 2.5D/3D 封裝)需求。
- 伺服器、光模組、液冷系統等硬體,因影片生成對叢集穩定性、散熱效率要求極高而受益。
- 資料供給:
- 高質量影片素材庫(影視作品、短影片平台內容、自採資料),需經剪輯、清洗、去重和版權稽核。
- 合成數據逐步成為補充,通過 3D 引擎或遊戲引擎生成帶精確深度、光流和動作標註的影片。
- 資料標註服務:動作描述、物體分割、深度估計、場景圖建置等。
- 訓練架構與中介軟體:
- PyTorch、JAX、Megatron-LM、DeepSpeed 等分散式訓練架構;
- 用於影片編解碼、幀提取和潛空間處理的專用庫。
- 版權合規服務:
- 授權影片平台(如 Shutterstock、Getty Images 等)與模型商合作提供合規訓練資料;
- 版權鏈追溯與內容識別技術,防止模型輸出侵權內容。
下游
- 創意與生產力工具:影片生成嵌入剪輯軟體(Adobe Premiere Pro 整合 Runway、剪映/CapCut 上線 AI 影片功能),輔助短影片創作、廣告生成、電影預演(Previs)。
- 遊戲與虛擬世界:自動生成過場動畫、NPC 對話背景、虛擬場景漫遊影片,加速關卡原型製作。
- 教育與模擬:生成教學演示影片、醫學動畫、自動駕駛模擬場景合成;企業培訓中的角色演練。
- 社交與內容平台:為創作者提供一鍵生成特效、動態桌布和二次創作工具,降低內容生產門檻。
- API 與雲端服務:Runway、Pika、Google Vertex AI、快手等提供影片生成 API,允許第三方應用整合。
受益公司
以下僅基於公開資料客觀描述產業鏈參與者的業務關聯,不構成任何形式的投資建議或推薦。
- 算力硬體供應商:NVIDIA(A100/H100/B200 等 GPU,資料中心業務顯著受益於生成式影片負載)、AMD、Intel,以及 HBM 供應商 SK 海力士、三星等。
- 雲端基礎設施廠商:AWS、微軟 Azure、Google Cloud(提供 AI 訓練與推論例項,並託管影片生成 API);CoreWeave、Lambda Labs 等專業 GPU 雲端服務商。
- 模型與平台公司:OpenAI(Sora)、Runway(Gen 系列)、Google DeepMind(Veo)、快手(可靈)、MiniMax(海螺 AI)、字節跳動(豆包影片模型)、Stability AI(Stable Video Diffusion)、智譜 AI(CogVideo)。
- 創意軟體與工具:Adobe(Firefly 影片模型整合至 Premiere Pro)、剪映/CapCut(位元組系,內嵌影片生成)、Canva(整合 AI 影片)。
- 資料與版權合作伙伴:Shutterstock(與 OpenAI 等簽署訓練資料授權)、Getty Images 等,因影片生成對合規資料需求大而拓展業務邊界。
- 下游應用領域公司:影視製作方、遊戲開發商、廣告代理及社交媒體平台,雖不直接研發模型,但通過使用上述工具降低製作成本、提升效率,間接受益。
市場規模
受限於 AI 影片生成細分市場尚處萌芽期,不同機構的統計口徑與預測範圍差異較大。綜合多家第三方研究機構 2024 年釋出的資料,整理如下(均標註年份、口徑與來源):
- Fortune Business Insights(2024 年 9 月報告):2023 年全球 AI 影片生成市場規模約 4.3 億美元,預計 2030 年將增至 25.6 億美元,2024–2030 年複合年增長率(CAGR)約 29.1%。口徑為 AI 影片生成軟體、平台與直接相關服務的總營收。
- Market.us(2024 年 6 月報告):2023 年全球 AI 影片生成器市場約 5.4 億美元,預計 2033 年達 25.4 億美元,2024–2033 年 CAGR 約 16.7%。口徑聚焦於面向終端使用者的 AI 影片生成器產品與訂閱服務,不含底層基礎設施。
- Grand View Research(2024 年生成式 AI 媒體與娛樂市場報告):未單獨拆出“影片生成”子類,但其統計的生成式 AI 在媒體與娛樂領域整體規模 2023 年約 14.9 億美元,影片生成為其中增速最快的應用之一。
總體來看,儘管具體數值存在差異,市場對 AI 影片生成的高增長預期較為一致,但真正兌現還需技術成熟與商業化落地共同推進。
玩家對比
下述比較基於截至 2025 年 4 月的公開產品狀態、技術報告與社群評測,未公開資訊標註“未揭露”。
| 產品/模型 | 開發商 | 核心架構 | 最大生成時長 | 最高解析度 | API/產品狀態 | 特色功能/備註 |
|---|
| Sora | OpenAI | DiT + 潛影片擴散 | 最長 1 分鐘(演示) | 1080p | 2024 年末起對部分付費使用者開放;API 未完全開放 | 多鏡頭切換、物理互動嘗試;公開發布進度緩慢 |
| Gen-3 Alpha | Runway | 擴散(未完全公開) | 10 秒+ | 1080p | Web 應用及 API 已開放 | 專業創作工具,支援相機運動、影像/影片引導 |
| Veo | Google DeepMind | 潛在擴散 Transformer | 超過 60 秒(展示) | 1080p | 2024 年 12 月起通過 Vertex AI 預覽 | 強調長影片一致性與電影級運鏡 |
| 可靈 (Kling) | 快手 | 類 DiT 架構 | 逐步開放至約 2 分鐘 | 1080p | 國際版應用與 API 已上線 | 真實風格強,運動筆刷等互動控制 |
| 海螺 AI 影片 | MiniMax | 未公開 | 6 秒 | 1080p | 免費+付費產品,API 有限開放 | 生成速度較快,社群活躍 |
| SVD (Stable Video Diffusion) | Stability AI | 潛擴散 + 時空 UNet | 4 秒(影像到影片) | 1024×576 | 開源權重,可本地部署 | 可微調,適合影像轉影片應用 |
| Open-Sora | 開源社群 | 類 Sora DiT | 最長 16 秒 | 512×512(部分版本) | 完整開源 | 訓練成本與門檻顯著降低,推動復現研究 |
| CogVideoX | 智譜 AI / 清華 | 擴散 Transformer | 6 秒 | 720×480 | 開源權重 | 支援文本到影片,中英文提示詞 |
注:效能指標依賴提示詞質量與硬體,上表僅作定性參考,不構成優劣推薦。
風險
- 技術風險:長時間影片生成仍存在物體漂移、形變和物理邏輯錯誤;模型對複雜因果關係理解有限,無法保證輸出內容的真實性。
- 算力與成本風險:訓練與推論成本高企,API 定價在短期內難以覆蓋高階算力開銷,部分企業或面臨資金壓力;開源模型的興起可能進一步壓縮商業產品的溢價空間。
- 版權與法律風險:訓練資料涉及大量受版權保護的影片,面臨類似影像生成領域的侵權訴訟(如《紐約時報》訴 OpenAI 案,影片模型可能成為下一個焦點)。生成內容若包含可識別的商標、人物或作品元素,可能引發糾紛。
- 深度偽造與倫理風險:AI 影片生成極易被濫用製造虛假新聞、政治宣傳、色情等內容。各國監管趨勢收緊(例如歐盟 AI 法案、中國深度合成管理規定),可能帶來合規成本或強制技術限制。
- 商業化不及預期風險:下游需求雖旺盛,但若生成質量長期無法突破“輔助工具”定位,難以開啟大型影視、廣告直接成片的預算,市場增速可能低於預期。
- 競爭與路線收斂風險:主流技術路線集中在擴散模型,但若出現顛覆性架構(如高效非擴散時序模型),現有參與者積累的優勢可能被迅速削弱。
誤讀糾偏
- “Sora 能真正理解物理世界”:Sora 生成的影片看似符合物理規律,但時常出現物體穿透、方向突變、重力異常等錯誤。其本質是基於統計關聯的生成,並不具備物理定律理解和因果推論能力,不能替代物理模擬引擎。
- “AI 影片只是影像生成的簡單拼合”:僅逐幀生成影像會導致嚴重閃爍與不一致。影片生成需要顯式的時間建模和跨幀聯合最佳化,在架構、訓練和評估上覆雜度遠超影像生成。
- “引數越多,影片質量越高”:盲目堆引數而不改進時空注意力效率、壓縮策略和訓練資料質量,往往導致成本不可承受,而長程一致性未必線性提升。架構創新和資料處理同等重要。
- “AI 即將取代影視製作”:當前 AI 影片在精確可控性、角色一致性、複雜敘事和情感表達方面遠弱於成熟 CG 與實拍。中期內,AI 更可能是提高預演、素材和後期效率的輔助工具,非完整替代。
- “開源模型能完全平替商業產品”:開源影片模型雖然降低了使用門檻,但在訓練資料規模、工程最佳化、API 易用性和算力資源方面仍難比肩頭部閉源產品。高質量的定製與穩定 API 仍需商業支援。
- “AI 影片生成不涉及音訊”:目前主攻畫面,但不少產品開始整合音訊生成(如背景音、音效),未來影片+音訊聯合生成是趨勢,但當前音訊質量仍有限。
- “只要資料量夠大就能自動湧現出可控性”:可控性需要精心設計的條件注入機制(如 ControlNet 類網路)、結構化標註資料和針對性的微調策略,純無監督大數據訓練很難自然產生精準的鏡頭運動和物件互動控制。
最新事件
梳理自 2024 年起至 2025 年 4 月的關鍵進展(按時間倒序排列):
- 2025 年 4 月:Runway 推出 Gen-4 系列模型(具體能力未完全公開),進一步強化時間一致性與互動控制。
- 2025 年 2–3 月:OpenAI 向更多地區 ChatGPT Plus/Pro 使用者開放 Sora 有限訪問,但高併發導致排隊;同期快手可靈釋出 1.6 版本,支援最長 2 分鐘影片生成並強化畫質。
- 2024 年 12 月:Google 通過 Vertex AI 開放 Veo 預覽;MiniMax 海螺 AI 影片全球使用者過億,成為消費側黑馬;Adobe Firefly 影片模型開始內測並整合至 Premiere Pro。
- 2024 年 10 月:Adobe MAX 大會發布 Firefly Video Model 預覽,主打商用安全、版權友好影片生成。
- 2024 年 7–9 月:Runway Gen-3 Alpha 上線,加入相機運動控制;可靈國際版上線,成為中國首款大規模海外開放的影片生成產品;Stability AI 釋出 SVD 1.1,提升影像到影片質量。
- 2024 年 6 月:快手釋出可靈(Kling),率先支援最長 2 分鐘生成能力預告,引爆中文網際網路。
- 2024 年 5 月:Google I/O 釋出 Veo,演示多段 60 秒+高質量影片;同期 MiniMax 推出海螺 AI 影片生成。
- 2024 年 2 月:OpenAI 釋出 Sora 技術報告及演示影片,展示一分鐘級、多鏡頭切換能力,引發“世界模擬器”廣泛討論。
- 2024 年 8 月:歐盟《人工智慧法案》(AI Act)正式生效,對生成式 AI 系統施加透明度和內容標識要求,AI 影片產品的合規成本上升。
追蹤指標
持續觀察以下維度,可幫助判斷 AI 影片生成的產業成熟度與競爭力走向。
- 生成質量
- FVD、幀間 CLIP 得分、VideoScore 等在公認基準(如 Kinetics-600、MSR-VTT)上的重新整理情況。
- 主觀評審賽事(如 AI 影片競賽)中的排名與使用者偏好票數。
- 能力邊界
- 頭部模型公開的最大生成時長、原生解析度、幀率。
- 對複雜提示詞(含多物體、精確動作、空間關係)的遵循率。
- 角色與物體在長影片中的 ID 保持率。
- 推論效率與成本
- 主流 API 每生成 1 分鐘 1080p 影片的端到端成本(美元),及年增率降幅。
- 從提交請求到返回結果的端到端延遲(秒),P50/P95 分位數。
- 開源模型在消費級硬體(如 RTX 4090)上的單秒推論耗時。
- 商業化指標
- 頭部 API/SaaS 平台公佈的年化營收、付費客戶數、生成影片總秒數。
- 廣告、影視、遊戲等垂直行業中 AI 影片生成滲透率調研。
- 生態與合規
- 訓練資料版權訴訟案件的判決或和解動態。
- 各國針對深度偽造、AI 生成內容標識的新立法或標準。
- 開放原始碼倉庫的 Star 數、貢獻者數量及模型下載量。
- 基礎設施
- GPU/TPU 最新代際對影片生成模型的推論加速比(如 H100 vs B200)。
- 萬卡級別影片生成訓練叢集的公開部署情況與功耗資料。
信源
(以下信源覆蓋核心技術報告、市場研究及主要產品,部分為長期追蹤積累,具體資料請以原始出處為準)
- OpenAI, “Video generation models as world simulators,” Feb 2024.
- Runway, Gen-2/Gen-3 Alpha/Gen-4 官方部落格及產品文件.
- Google DeepMind, “Veo: a generative video model,” May 2024.
- 快手可靈 (Kling) 技術報告,2024 年.
- MiniMax,海螺 AI 影片產品公開材料.
- Stability AI, “Stable Video Diffusion,” Nov 2023.
- 開源專案:Open-Sora, CogVideoX, ModelScopeT2V.
- Fortune Business Insights, “AI Video Generator Market Size, Share & COVID-19 Impact Analysis…”, Sep 2024.
- Market.us, “AI Video Generator Market Report,” Jun 2024.
- Grand View Research, “Generative AI In Media & Entertainment Market Size Report,” 2024.
- 歐盟《人工智慧法案》(EU AI Act),2024 年 8 月生效.
- Adobe, “Firefly Video Model Preview,” Oct 2024.
- Papers with Code, “Video Generation” 任務及排行榜.