模型層 開放閱讀

文生影片

Text-to-Video

概念 ID
text-to-video
更新時間
2026-05-29
來源數量
待補

文生影片

3 秒看懂

文生影片(Text‑to‑Video)是指通過文本描述(Prompt)自動生成一組連貫、高畫質晰度、符合物理常識的動態影像。它是繼文生圖之後的生成式人工智慧下一個前沿高地——核心難題不在“畫一幀”,而在於同時處理好空間一致性(物體外觀、場景版面配置不變)與時間連貫性(運動軌跡、光影變化合理解)。

3 分鐘產業解釋

文生影片並非孤立的技術模組,而是生成式AI技術棧向長序列、多模態輸出的自然延伸。它正在把“用語言描述畫面”升級為“用語言描述時間”。產業價值至少體現在三個層面:

  1. 內容生產範式革命:影視預演、廣告分鏡、遊戲過場動畫、電商短影片和教育素材的創作流程被壓縮。創作者可以用自然語言生成高保真動態預覽,將試錯成本降低一個數量級。
  2. 合成數據引擎:對於自動駕駛、機器人等需要理解三維世界物理互動的領域,文生影片可以按需生成海量、帶標註、多角度、多天氣、多光照條件的影片資料,大幅緩解真實採集的成本與覆蓋率瓶頸。
  3. 人機互動新介面:未來AI助手、虛擬人不僅“說”,更會用動態畫面“展示”與“推演”,使資訊傳遞的維度從文字、語音直接躍遷到時空影像。

當前產業仍處在“能生成→可控生成→精準長敘事”的早期爬坡階段。頭部玩家包括OpenAI(Sora)、Runway(Gen系列)、Pika Labs、Stability AI(Stable Video Diffusion)以及Google、Meta、字節跳動、快手等公司。競爭焦點集中在模型架構、高質量影片‑文本資料、訓練算力以及產品化體驗。

技術原理

現階段文生影片的主流架構可歸結為 “條件化的時空擴散生成模型”,其生成過程可以拆成三段:

  1. 編碼壓縮

    • 文本:通過CLIP或T5‑XXL等大語言‑視覺對齊模型,將輸入Prompt對映為語義特徵向量,作為條件訊號注入後續去噪網路。
    • 影片:原始影片(T幀 × H高 × W寬 × C通道)經**3D VAE(三維變分自編碼器)**或類似時空編碼器,壓縮到低維潛在空間 (t, h, w, c),其中 t ≪ Th ≪ Hw ≪ W。這一步把畫素級冗餘剔除,讓擴散模型在緊湊的“概念空間”工作,極大降低視訊記憶體與算力佔用。
  2. 時空去噪(逆擴散)

    • 訓練時,向影片的潛在表示逐步新增高斯噪聲,直至完全變成隨機噪聲。
    • 模型學習的是逆過程:從一堆隨機噪聲出發,以文本特徵為條件,逐步去噪,還原出與描述一致的影片潛在序列。
    • 去噪網路通常是U‑Net或**DiT(Diffusion Transformer)**的時空變體,關鍵模組包括:
      • 空間注意力/卷積:處理單幀內部的紋理、形狀、空間關係(與文生圖類似)。
      • 時間注意力/時間卷積:跨幀串聯資訊,保證物體在外觀、位置、光影變化上不跳變、不撕裂。這是影片生成與影像生成的本質分界線。
    • 對於Transformer路線(如Sora),影片先被分割成一系列時空Patches,然後像處理文本Token一樣,由統一的Transformer自注意力層同時捕獲空間和時間依賴。
  3. 解碼回畫素

    • 去噪後的潛在影片通過3D VAE解碼器,上取樣回畫素空間,輸出連續的影片幀序列。部分模型還結合超分模組提升解析度。
graph LR
    A[文本提示] --> B[文本編碼器];
    B --> C[語義特徵];
    D[隨機噪聲] --> E[時空去噪網路
U-Net / DiT + Time Attention];
    C --> E;
    E --> F[去噪潛在影片];
    F --> G[3D影片解碼器];
    G --> H[最終影片];

上述流程高度依賴端到端聯合訓練。文本編碼器、時空VAE和去噪網路需協同最佳化,否則容易出現語義漂移或幀間崩壞。


關鍵引數

影片生成模型的能力由一系列相互制約的引數決定。以下引數並非某個商業產品的精確規格(多數廠商未完全公開),而是基於公開論文和業界討論的設計空間

  • 潛在空間維度與幀率 常見操作是將影片壓縮到 (t=8~40幀,h=40~128,w=40~128,c=4~16) 的潛在空間。潛在解析度不足會丟失紋理細節;過高則急劇推高訓練及推論成本。商業模型輸出多為24/30 fps,時長目前集中在2~5秒,部分旗艦模型(如Sora宣稱)可達60秒。

  • 時間注意力視窗 全域性時空注意力計算量是幀數的平方級,時長稍長即不可承受。工業界通常引入滑動視窗注意力(只在相鄰若干幀間互動)或因果注意力(當前幀只看見過去幀),視窗大小(例如16幀)直接影響長程一致性。視窗太小會表現為“角色走出畫面後,衣服顏色就變了”。

  • 擴散步數與噪聲排程 訓練時通常使用1000步左右的前向加噪與反向去噪;推論時可通過蒸餾/DDIM等方式縮減至20~50步。噪聲排程器如何分配不同時間步的噪聲比例,會影響運動的流暢度和突發動作的生成質量。

  • 模型引數量 公開資訊中,Sora基礎架構為Transformer,引數未揭露(業界估計在百億至數千億級別)。Stable Video Diffusion(SVD)引數量約15億。Runway Gen‑2/Gen‑3未公開具體引數。規模型號越大,物理合理性越強,但推論延遲和硬體門檻同步上升。

  • 訓練資料規模 頭部模型普遍使用數億至數十億量級的影片‑文本對。資料來源包括公開資料集(LAION‑VIDEO的百萬量級子集)、授權影視素材、網際網路平台自有資料、合成數據等。資料質量(文本描述是否精當、剪輯是否乾淨)對運動多樣性和語義對齊的貢獻往往比模型架構排名更重要。

以上引數在生產環境中會結合目標場景(即時互動vs離線渲染)做不同折中。當前業界趨勢是在可控成本下,優先提升時長與一致性


技術路線

文生影片模型大致可歸為三條路線,各自處於不同成熟階段:

路線代表架構優勢劣勢典型例項(截至2025年初)
時空改造的擴散模型在影像U‑Net中插入時間注意力層/時間卷積;有時輔以3D卷積。工程成熟,可直接繼承文生圖模型的權重與訓練技巧,訓練較穩定。長序列建模受限於區域性注意力視窗;擴充套件至極長影片的效率不如純Transformer架構。Stable Video Diffusion (Stability AI);Runway Gen‑2早期版;早期學術工作如Video Diffusion Models (Google)
統一時空Transformer將影片切分為時空Patches,直接用Transformer編碼為序列,類似語言模型的next‑token prediction。擴充套件性極強,易於通過堆疊層數和擴大序列長度遵循規模化定律;長程依賴捕捉更自然。算力需求巨大,訓練資料需求是前者的數倍;推論延遲較高,輕量化部署困難。OpenAI Sora;Google Veo;Meta Movie Gen(部分採用類似思路)
分層或混合架構先用自迴歸模型或低解析度擴散模型生成關鍵幀或運動骨架,再用擴散模型或光流網路填充細節。理論上擅生成超長影片(由粗到細),可將運動規劃與紋理生成解耦。多元件串聯使誤差容易被放大;聯合最佳化複雜,抖動和偽影風險高。部分學術原型及專利設計,成熟度較低

技術演進簡史:2022年Google Imagen Video與Meta Make‑A‑Video首次展示擴散模型生成影片的可行性;2023年Runway Gen‑2與Pika 1.0推動產品化;2023年底Stable Video Diffusion開源掀起社群熱潮;2024年Sora的釋出標誌著從專用U‑Net向通用Transformer的範式躍遷,把時長和物理模擬提升到新臺階;2024年下半年至2025年初,Google Veo、快手可靈、Meta Movie Gen等相繼面世,路線趨於多元化,競爭白熱化。


上游

文生影片產業鏈上游由算力、資料、基礎演算法和雲端基礎設施構成。

  • 算力晶片 NVIDIA H100/H200/B200 仍是訓練主力,2024年單卡H100 SXM版FP16算力約1979 TFLOPS(來源:NVIDIA 2024規格表)。為訓練千億引數級影片模型,單次訓練叢集常需要數千至數萬張加速卡。AMD MI300X和自研ASIC(如Google TPU v5,Meta MTIA)逐步進入部分訓練和推論環節,但截至2025年初暫未撼動NVIDIA主導地位。

  • 訓練資料 高質量影片‑文本對是稀缺資源。公開來源包括:LAION‑VIDEO(數百萬級)、WebVid‑2M/10MHD‑VILA‑100M等;大型科技公司還會使用內部平台影片庫(需經版權清洗)以及合成數據(用遊戲引擎或3D模擬器生成)。資料標註的精細化程度(如鏡頭描述、物理屬性標註)正變得越來越重要。

  • 演算法與基礎模型 核心架構(DiT、時空U‑Net)及訓練策略(級聯擴散、流匹配、蒸餾)多源於頂尖實驗室。開源模型(如SVD、CogVideoX等)降低了進入門檻,但前沿效能仍由閉源模型把持。

  • 雲端運算與基礎設施 AWS、Azure、GCP以及國內阿里雲端、火山引擎等提供GPU/TPU裸金屬與訓練平台,是多數創業公司賴以生存的算力來源。2024年頭部雲端商的AI訓練例項價格因需求旺盛居高不下,A100/H100例項長期供不應求。


下游

文生影片的下游正在從“嚐鮮”向“融入工作流”過渡,典型場景包括:

  • 影視與廣告:分鏡預覽、概念短片、補充素材合成。好萊塢部分視效工作室已將AI影片用於鏡頭版面配置驗證,但官方大片級成片仍需真人團隊精修。2024年廣告行業已出現AI生成配合人工剪輯的品牌廣告案例。
  • 遊戲與動漫:角色運動預演、背景動態化、過場動畫原型。節約了大量關鍵幀手繪和動作捕捉的前期投入。
  • 電商與營銷:自動生成商品演示短影片,支援多場景、多語種改編,降低拍攝與模特成本。
  • 教育與培訓:動態操作演示、歷史場景復原、語言學習情景對話等,提高內容沉浸感。
  • 社交媒體與UGC:快手可靈、抖音即夢等工具賦予普通使用者“一鍵短片”能力,驅動短影片平台內容供給。
  • 專業工具整合:Adobe Premiere Pro、DaVinci Resolve、CapCut等已內建或預告AI影片生成/擴充套件功能,將作為生產力外掛存在。

整體而言,當前深度應用仍集中在能容忍部分瑕疵、追求效率的環節;對精確幀控、長片敘事要求極高的院線製作,AI尚處於輔助地位。


受益公司

以下列出因文生影片產業擴張而業務出現實質性關聯的上市公司及主要未上市公司(僅描述業務關聯,不構成任何投資建議):

型別公司關聯點(截至2025年1月公開資訊)
模型/產品層OpenAI(未上市)Sora;開放給少數測試者,尚未全面商用。
Runway(未上市)Gen‑3 Alpha產品化,向創意專業人士提供訂閱收費。
Stability AI(未上市)SVD開源模型,提供API及會員計劃。
快 手(1024.HK)可靈大型模型,已整合至快手主APP,支援文/圖生影片,公開測試資料表現突出。
Meta(META)釋出Movie Gen基礎模型,未直接面客,服務於內部生態和學術研究。
字 節 跳 動(未上市)即夢、剪映整合AI影片能力,基於自研模型。
Google(GOOGL)Veo模型,通過VideoFX等平台向許可使用者開放。
算力/雲端層NVIDIA(NVDA)GPU主導供應商,直接受益於訓練和推論需求爆發。2024財年資料中心營收475.3億美元(來源:NVIDIA 2024年報),AI影片是增速來源之一。
AMD(AMD)Instinct系列加速卡逐步獲得部分AI推論與訓練訂單,資料未單獨拆分。
微 軟(MSFT)Azure提供GPU例項,與OpenAI深度合作,間接獲取模型呼叫收益。
Amazon(AMZN)AWS提供Trainium/Inferentia與GPU例項,服務於多家AI影片創業公司。
應用/工具層Adobe(ADBE)Firefly影片模型已整合至Premiere Pro,通過Creative Cloud訂閱間接變現。
Unity(U)提供引擎側的AI動畫生成工具Sentis等,賦能遊戲創作者。
美 圖(1357.HK)MiracleVision模型支援影片生成,與影像產品生態協作。

注:未上市公司估值及財務為公開報道估算值,應查閱最新融資新聞。


市場規模

全球文生影片市場仍處於形成階段,不同機構因囊括範圍(純文生影片 vs AI影片生成整體)及預測方法差異,資料出入明顯。以下引用近期代表性估算:

  • Grand View Research 2024年5月釋出的報告,2023年全球AI影片生成市場規模約 7.8億美元,預計到2030年增至 58.6億美元,複合年增長率約35.8%。該口徑包含文生影片、圖生影片、影片編輯等AI驅動功能。
  • Brandessence Market Research 2024年3月報告估計,2023年純文生影片生成市場為 5.4億美元,至2030年或達 26.1億美元,CAGR約25.1%。
  • Bloomberg Intelligence 2024年分析認為,生成式AI影片將在2032年以前貢獻整個生成式AI市場增量中可觀份額,但未給出單列數字。

上述數字均需以原始報告為準,且預測假設技術可用性大幅提升、合規問題妥善解決。增速最終取決於生成質量的突破節奏、成本下降斜率以及版權法律架構的明朗化。


玩家對比

截至2025年1月,主要文生影片模型產品能力對比如下(基於各公司官網、技術報告和公開體驗):

模型/產品開發方是否開放核心架構典型時長最高解析度運動一致性可控性特徵定價模式(公開)
SoraOpenAI未完全開放,紅隊測試Transformer(時空Patches)最長60秒(宣稱)1080p(內部)高,複雜物理模擬驚豔文本,未公開鏡頭控制未公佈
Gen‑3 AlphaRunway開放訂閱未公開(推測時空DiT)約10秒720p/1080p 24fps良好,短時長內較穩定文字、圖生影片、運動筆刷$12‑76/月起
Pika 2.0Pika Labs開放訂閱未公開約7秒約1080p中上,人物外觀有一定跳變文字、圖生影片、區域性重繪免費層+$16‑46/月
Stable Video DiffusionStability AI開源+API時空U‑Net4‑5秒(單次生成)576×1024(常見配置)中等,物體形變需後處理文字+圖,可控性有限按API呼叫或自託管
VeoGoogle有限開放(VideoFX)Transformer(推測)約60秒1080p高,公司演示中物理與面部表現優異文本、影像、部分風格控制未公開定價
可靈 (Kling)快手開放公測未公開(類似3D VAE+DiT)約5‑15秒1080p 30fps較高,尤其人物動作文字、圖生影片,支援幀擴充套件免費額度+會員
Movie GenMeta未開放,僅供研究Transformer(30B引數)最長16秒1080p高,聲稱生成真實音影片同步文字、圖生影片、音訊聯動不適用

注:部分引數來自第三方評測和公司部落格,未獨立驗證。普通使用者實際體驗可能因排隊、壓縮等與上述展示有差異。


風險

  1. 技術路線更迭風險 模型架構仍在快速演進,當前主流可能被新範式(如世界模型、即時神經渲染)替代。2024年Sora的出現已讓部分先前的專用U‑Net路線面臨重構壓力。過早鎖定單一技術棧的投入可能遭遇沉沒成本。

  2. 深度偽造與資訊安全 逼真影片生成大幅降低偽造內容的門檻,可能被濫用於政治造謠、金融欺詐、色情換臉。各國監管正處於收緊過程中(如歐盟AI法案2024年生效,中國《生成式人工智慧服務管理暫行辦法》2023年施行)。企業需承擔額外的鑑真與稽核成本。

  3. 版權與資料合規 訓練資料的來源合規性是懸在行業頭頂的達摩克利斯之劍。若模型“記憶”了受版權保護的影視作品片段,可能引發大規模集體訴訟。2023-2024年間,好萊塢編劇、演員罷工及多起藝術家聯合訴訟已凸顯利益衝突。下游商業使用者使用AI生成素材的版權歸屬也尚無全球共識。

  4. 商業化落地低於預期 當前多數使用者停留在“嚐鮮”層面。若生成影片的精確控制、畫面專業度長期無法滿足製片標準,付費轉化率可能不達投資模型公司的估值要求,引發估值中樞下移。

  5. 算力壟斷與地緣政治 高階GPU受出口管制(如美國對華晶片限制),可能導致不同區域的模型能力差距拉大,影響部分市場參與者的競爭力。


誤讀糾偏

  • 誤讀一:“文生影片就是把文生圖的邏輯直接套到幀序列上。” 糾偏:幀獨立生成然後拼接,會出現嚴重的閃爍和內容不一致。文生影片的核心在於時空聯合建模,要求模型在去噪過程的每一步同時感知時間和空間維度,光加個“拼幀”指令碼完全不可行。這需要專有的3D卷積、時間注意力或Transformer結構支撐。

  • 誤讀二:“Sora一出來,專業影視行業馬上就會被重構。” 糾偏:Sora等前沿模型展示了物理世界的模擬潛力,但距離專業級製片仍有明顯差距:精準控制鏡頭運動、人物微表情、長敘事節奏仍是弱項;對精細物理互動(布料撕裂、流體飛濺)的模擬時有出錯;後期難以對生成內容做細粒度編輯。當前定位更多是創意構思與預視覺化工具,而非“一鍵成片”的完整拍攝替代。

  • 誤讀三:“文生影片模型學會了物理定律。” 糾偏:模型並非執行公式解算力學方程,而是從海量影片的統計分佈中“記憶”物體通常如何運動。它生成的是“看上去合理”的物理過程。當遇到訓練資料稀疏的長尾場景(如非牛頓流體、罕見視角碰撞)時,容易崩壞成違反物理常識的怪異畫面。這仍是資料驅動的聯想起大型模型,並非真正的物理引擎。


最新事件

(截至2025年1月)

  • 2024年06月:Runway釋出Gen‑3 Alpha,宣稱運動保真度和一致性大幅提升,並提供運動筆刷等精細化控制功能,面向付費使用者。
  • 2024年06月:快手釋出可靈(Kling)大型模型,憑藉高質量人物動作與高解析度引發關注,其後開啟公測和快速迭代。
  • 2024年07月:Google在其VideoFX平台向部分篩選使用者推出Veo,強調長影片與畫面穩定性,並與音樂生成工具結合展示。
  • 2024年09月:Meta釋出Movie Gen基礎模型研究,展示30B引數Transformer影片生成效果及聯動音訊生成能力,暫未產品化。
  • 2024年10月:OpenAI在一次公開活動中展示Sora生成影片的全新案例,但正式釋出仍無時間表,持續紅隊測試。
  • 2024年11月:Adobe Premiere Pro公開測試Firefly影片生成外掛,支援文生影片、圖生影片快捷生成B‑roll素材。
  • 2024年12月:中國多家網際網路公司更新AI影片工具(如即夢、剪映),從短影片場景切入,使用者生成內容總量突破萬小時量級(公司公開新聞稿)。

產業層面,2024全年全球涉及AI影片的股權融資超過25億美元(據Crunchbase不完全統計,口徑含模型與工具層),為領域注入高額研發資金。


追蹤指標

持續理解文生影片產業可關注以下高頻或定期的指標與訊號:

  1. 產品迭代與開放度

    • 主要模型(Sora, Gen‑3, Veo, Kling等)公開發布時間、開放範圍、定價策略。
    • 重大版本更新日誌,尤其關注時長、解析度、一致性指標的變化。
  2. 使用者規模與創作量

    • Runway等訂閱制公司的付費使用者數、ARR(年化經常性營收);快手、抖音等平台AI生成影片的日上傳量與留存率(公司財報或公開活動揭露)。
  3. 算力與成本

    • NVIDIA GPU季度資料中心營收及下代產品路線圖;主流雲端例項價格變動。
    • 頭部公司揭露的模型訓練和推論成本結構(如Sora、Veo針對不同時長的推論秒級成本)。
  4. 版權與監管政策

    • 各國AI法案細則落地(如歐盟AI Act等級劃分,美國版權局對AI生成內容的版權指南)。
    • 行業標杆訴訟的裁決(如藝術家集體訴訟、媒體集團與AI公司的許可協議)。
  5. 關鍵人才與併購

    • 核心研發人員流向;大公司收編創業團隊或併購AI影片初創企業的公告。
  6. 基準評測與比賽

    • 學術界與社群公開的文本到影片生成質量基準(如VBench、EvalCrafter)中各家模型的最新排名,雖非完美,但可作為一致性、運動幅度等客觀維度的參照。

信源

  • 學術論文 Ho, J. et al. (2022). Video Diffusion Models. arXiv:2204.03458 Singer, U. et al. (2022). Make‑A‑Video: Text‑to‑Video Generation without Text‑Video Data. Meta AI. Blattmann, A. et al. (2023). Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets. Stability AI. Peebles, W. & Xie, S. (2023). Scalable Diffusion Models with Transformers (DiT). arXiv:2212.09748. Brooks, T. et al. (2024). Video generation models as world simulators. OpenAI Technical Report. Kondratyuk, D. et al. (2024). VideoPoet: A Large Language Model for Zero‑Shot Video Generation. Google.

  • 產品與技術部落格 Runway Research Blog — Gen‑2, Gen‑3 Alpha技術介紹 Meta AI Blog — Movie Gen: Advanced Video Generation (2024) 快手Y‑Tech / 快影技術公號 — 可靈大型模型技術解讀(2024) Google DeepMind Blog — Veo: our most capable video generation model (2024)

  • 資料集與開源專案 LAION‑VIDEO (LAION‑5B影片子集) Stable Video Diffusion GitHub (Stability‑AI/generative‑models) CogVideoX (智譜AI開源)

  • 市場與行業報告 Grand View Research. AI Video Generator Market Size, Share & Trends Report, 2024. Brandessence Market Research. Global Text‑to‑Video AI Market Report, 2024. Bloomberg Intelligence. Generative AI Video: The Next Frontier, 2024. a16z, Sequoia Capital, Lightspeed — 關於AIGC及影片基礎設施的公開分析文章。

  • 新聞與資料平台 Crunchbase — AI影片融資追蹤 The Verge, TechCrunch, 機器之心, 量子位 — 產業動態報道

所有數字、規格與事件細節請以各公司最新官方公告及原始報告為準。未標註出處的內容僅代表截至2025年1月的公開資訊定性歸納。

source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型