模型層 開放閱讀

影片生成

Video Generation

概念 ID
video-generation
更新時間
2026-05-29
來源數量
待補

影片生成 (Video Generation)

3 秒看懂

一句話定義:通過 AI 模型將文本/影像/音訊等輸入自動合成時間連貫的影片序列,是 AIGC 從”靜態”邁入”動態”的標誌性技術躍遷。

核心矛盾:在空間質量、時間一致性、時長可控性三個維度同時拉滿,所需的算力和資料遠超影像生成一個數量級。

產業位置:多模態大型模型的”皇冠”,決定 AI 能否真正理解並模擬物理世界的動態規律。

3 分鐘產業解釋

為什麼影片生成現在爆發?

影片生成並非新概念——GAN 時代就有基礎探索(如 VideoGPT、MoCoGAN),但畫質崩塌、時長僅幾秒、運動僵硬三大硬傷使其長期停留在學術論文階段。2023-2024 年的技術拐點來自三股力量的匯合:

  1. 擴散模型(Diffusion Models)在影像領域的成功——Stable Diffusion / DALL·E 3 / Midjourney 證明了擴散範式在視覺質量上的統治力,技術外溢至影片是自然延伸。
  2. DiT(Diffusion Transformer)架構取代 U-Net——Transformer 的可擴充套件性(scaling law)使模型容量和資料規模的投入產出比變得可預期,大廠敢於重注。
  3. 訓練資料與算力的工業化供給——網際網路積累了海量影片語料,GPU 叢集規模持續攀升(萬卡乃至數萬卡訓練成為常態),使”暴力美學”路線可行。

當前競爭格局速覽

陣營代表產品/模型定位
閉源旗艦OpenAI Sora、Google Veo(2 代)、Kling(快手可靈)端到端長影片、物理一致性
開源社群CogVideoX(智譜)、Wan(阿里永珍)、HunyuanVideo(騰訊)、Open-Sora 系列降低門檻、生態卡位
工具層創業Runway Gen-3/4、Pika Labs、Luma AI(Dream Machine)創作者工作流、短片/廣告場景
晶片/雲端NVIDIA、AMD、Google TPU、各大雲端廠商訓練與推論算力供應鏈

⚠️ 以上產品能力描述基於公開發佈會資訊,實際可用性隨版本迭代持續變化,不做具體時長/解析度的精確承諾。

15 分鐘專家深入

技術路線的三次範式躍遷

第一代(~2022 及以前):自迴歸 + 畫素空間

  • 代表:VideoGPT、TATS、Phenaki(Google,2022)
  • 思路:將影片視為 token 序列,用 VQ-VAE / VQGAN 在離散碼本上做自迴歸預測。
  • 瓶頸:畫素空間維度爆炸(T×H×W×C),解析度和時長嚴重受限;token 數隨幀數線性增長,長序列建模困難。

第二代(2023):影像擴散 + 時間層插值

  • 代表:Stable Video Diffusion(SVD)、Runway Gen-2、Make-A-Video(Meta)
  • 思路:在預訓練的影像擴散模型(通常是 U-Net)中插入時間注意力層(temporal attention),微調使靜態影像生成能力”泛化”到連續幀。
  • 瓶頸:時間層的能力天花板——本質上是在空間骨幹上”加裝”時間模組,建模深度有限;影片長度多侷限於 2-4 秒。

第三代(2024-至今):統一的時空 DiT

  • 代表:Sora(OpenAI)、Wan(阿里)、HunyuanVideo(騰訊)、Cosmos(NVIDIA)、Veo 2(Google)
  • 思路:不再區分”空間骨幹 + 時間附加”,而是將影片在潛空間(latent space)壓縮為時空 token 序列,統一用 Transformer 架建置模。影片 patch 化(spacetime patching)成為核心設計。
  • 優勢:架構簡潔、scaling 路徑清晰、長程依賴建模能力強。

核心技術棧拆解

┌──────────────────────────────────────────────────────┐
│                  影片生成系統全景                       │
│                                                      │
│  輸入層: 文本編碼器 (T5/CLIP/LLM) + 可選影像/音訊條件  │
│           ↓                                          │
│  影片壓縮: 3D VAE / 因果 VAE (時空降取樣)             │
│    原始影片 T×H×W×3  →  潛空間 t×h×w×c               │
│           ↓                                          │
│  去噪骨幹: DiT / U-Net+時間層 / 混合架構              │
│    輸入: 噪聲潛變數 + 時間步 + 條件訊號                │
│    輸出: 預測噪聲 / 預測乾淨潛變數                     │
│           ↓                                          │
│  取樣排程: DDPM / DDIM / Flow Matching / 蒸餾加速     │
│           ↓                                          │
│  解碼: 3D VAE 解碼器 → 畫素空間影片                   │
│           ↓                                          │
│  後處理: 超分(SR) / 幀插值(FI) / 音訊合成             │
└──────────────────────────────────────────────────────┘

各模組技術深度

1) 3D VAE —— 影片的”壓縮靈魂”

這是影片生成區別於影像生成的最關鍵基礎設施

  • 核心挑戰:原始影片資料量巨大(例如 1080p×24fps×5s ≈ 1.2 GB 未壓縮),直接在畫素空間做擴散不可行。
  • 方案:訓練 3D 卷積 VAE,同時在時間軸和空間軸做降取樣。典型設計是空間 8×8、時間 4× 的壓縮比,將數十幀影片壓縮到數百個潛變數 token。
  • 因果卷積(Causal Convolution):多數方案在時間維度採用因果結構(當前幀只看過去幀),以支援流式生成和首幀條件化。
  • 重建質量瓶頸:VAE 的重建能力直接決定生成上限——如果 VAE 解碼後模糊,後續去噪再好也無濟於事。3D VAE 訓練需要大量高質量影片資料,且解碼視訊記憶體佔用隨幀數增長顯著。

⚠️ 具體壓縮比因模型而異,各廠商未完全公開架構細節,上述為業界討論中常見的典型設計模式。

2) 時空注意力機制 —— 核心計算引擎

┌─ 全注意力 (Full Attention) ──────────────────────┐
│  所有 token (空間+時間) 之間互相注意              │
│  優點: 表達能力最強                               │
│  代價: 計算量 O(N²),N = t × h × w,極貴         │
│  代表: Sora 的原始設計推測方向                     │
└──────────────────────────────────────────────────┘

┌─ 分離注意力 (Factorized Attention) ──────────────┐
│  空間注意力 (幀內) → 時間注意力 (幀間) 交替堆疊   │
│  優點: 計算量大幅降低                             │
│  缺點: 時空耦合建模能力弱於全注意力               │
│  代表: SVD、多數 U-Net+時間層方案                 │
└──────────────────────────────────────────────────┘

┌─ 稀疏/滑窗注意力 (Sparse/Window Attention) ─────┐
│  在區域性時空視窗內做全注意力,跨視窗用稀疏連線     │
│  代表: LongViT 類設計,應對長影片的實用折中       │
└──────────────────────────────────────────────────┘

3) 條件控制與對齊

文本條件是主要驅動力:

  • 早期方案用 CLIP 文本編碼器(77 token 上限,語義粗粒度)
  • 新一代改用 T5-XXL 或自研 LLM 編碼器,支援長文本、細粒度描述
  • 部分方案將文本條件通過 cross-attention 注入,部分通過 adaptive layer norm(adaLN-Zero,DiT 的經典設計)

影像條件(圖生影片 / 首幀控制):

  • 通常將參考圖編碼後與噪聲潛變數拼接,或通過 IP-Adapter 類機制注入
  • 商業化落地的核心能力——創作者通常需要”從一張圖出發”

運動控制

  • Camera control(鏡頭運動指定)
  • Motion brush / trajectory(區域性運動軌跡控制)
  • ControlNet 類結構在影片場景的擴充套件

4) 訓練範式

三階段漸進訓練是當前主流共識:

階段解析度/時長目的
Stage 1低解析度、短片段(如 256×256, 數幀)學習基本運動動力學和語義對齊
Stage 2中解析度、中等長度提升畫質和時間一致性
Stage 3高解析度、長片段面向交付質量,通常需要海量算力
  • 文本-影片對齊依賴大規模高質量影片-文本對資料。影片字幕(video captioning)的質量直接影響生成的指令遵循能力。許多團隊會先用強力視覺語言模型對影片重新打標。
  • 資料規模:據業界討論,頭部專案的訓練資料量在數千萬至數億影片片段級別 [行業估算,無官方確認]。

5) 推論加速

影片生成推論的核心痛點:一次生成需要數十到數百步去噪迭代,每步都是完整的模型前向傳播

加速路線:

  • 蒸餾(Distillation):將多步擴散蒸餾為少步(如 50→4 步),代表:Consistency Models、SDXL Turbo 路線在影片上的延伸
  • 快取(Caching):複用相鄰時間步或層的中間特徵
  • 量化:FP16/BF16 → INT8/INT4 推論
  • Flow Matching:用 ODE 替代 SDE,取樣路徑更直,通常所需步數更少。被 Wan、HunyuanVideo 等廣泛採用
  • 硬體級最佳化:NVIDIA TensorRT、專用推論晶片

⚠️ 推論延遲和視訊記憶體需求的具體數字因模型大小、解析度、時長、硬體差異極大,不做統一量化。


技術原理(專家級)

擴散模型基礎回顧

前向過程(加噪)

q(x_t | x_0) = N(x_t; √ᾱ_t · x_0, (1-ᾱ_t)I)

將乾淨資料 x_0 逐步加入高斯噪聲,T 步後趨近純噪聲。

反向過程(去噪)

p_θ(x_{t-1} | x_t)  ——由神經網路引數化

從純噪聲出發,逐步去噪還原出乾淨樣本。

訓練目標:最常見為預測噪聲 ε(ε-prediction),損失函式:

L = E_{x_0, ε, t} [ ||ε - ε_θ(x_t, t, c)||² ]

其中 c 為條件訊號(文本編碼等)。

Flow Matching 範式(影片生成新趨勢)

與傳統 DDPM 不同,Flow Matching 定義從噪聲到資料的直線插值路徑

x_t = t·x_1 + (1-t)·x_0,  t ∈ [0, 1]

模型學習速度場 v_θ,使 ODE 積分沿路徑從噪聲走向資料。

優勢

  • 路徑更”直”→ 取樣步數更少
  • 訓練更穩定
  • 與 Transformer 架構配合更好

Wan、HunyuanVideo、CogVideoX 等開源/半開源模型均採用或支援 Flow Matching 訓練目標。

影片 Patch 化與位置編碼

原始影片: (T, H, W, 3)
         ↓ 3D VAE 編碼
潛空間:  (t, h, w, c)   例: (16, 30, 40, 16) for ~5s video
         ↓ Patch 化 (patch_size = pt × ph × pw)
Token序列: N = (t/pt) × (h/ph) × (w/pw) 個 patch token
         ↓ 位置編碼
         3D 正弦位置編碼 / 可學習位置編碼 / RoPE
         ↓ 送入 Transformer

位置編碼的設計對影片生成至關重要——它編碼了每個 token 的時間位置和空間位置,使模型能理解”這是第幾幀的哪個區域”。

3D VAE 架構細節

編碼器:
  輸入: (B, 3, T, H, W)
  → CausalConv3d (因果卷積: 時間方向只看過去)
  → ResBlock3d × N
  → 時間/空間下采樣 (stride)
  → 輸出: (B, c, t, h, w)

  典型壓縮比:
  空間: 8×8 (H/8, W/8)
  時間: 4× (T/4)

  含義: 一段 5 秒 480p (64×480×856) 影片
        → 潛空間約 (16×60×107) 個 c 維向量
        → patch化後約數千 ~ 一萬+ tokens

解碼器:
  編碼器映象 + 漸進式上取樣

上述數值為典型設計模式的估算示意,各模型具體配置不同。

訓練中的關鍵技術問題

1) 時間一致性(Temporal Consistency)

  • 核心難題:逐幀生成質量可能很高,但幀間出現閃爍、物體形變、顏色跳變
  • 緩解手段:時間層/統一時空注意力、光流約束、時序一致性損失、長影片分段生成+重疊平滑

2) 運動合理性(Physical Plausibility)

  • 當前模型本質上通過統計關聯學習運動模式,不具有物理引擎級別的因果推論能力
  • 表現為:物體穿透、重力違反、剛體變形等”物理 Bug”
  • 改進方向:物理先驗注入、世界模型(World Model)範式、強化學習對齊

3) 長影片生成

  • 直接生成長影片的視訊記憶體和計算量隨幀數超線性增長(全注意力下 O(T²·H²·W²))
  • 實用策略:自迴歸續寫(autoregressive extension)——生成 N 幀後以末幀為條件生成下一段
  • 挑戰:段間一致性退化,全域性劇情/場景保持困難

4) 文本遵循度(Text Alignment)

  • 當前影片模型對複雜指令的理解仍遠落後於語言模型
  • 長句、多主體、精確空間關係、數字/計數等是難點

技術演進史

時間里程碑核心突破
2016VGAN, S3D最早的影片生成 GAN 探索,解析度極低
2021VideoGPTVQ-VAE + 自迴歸 Transformer,離散化路線確立
2021.11NÜWA(微軟亞研)統一多工的視覺合成 Transformer
2022.09Make-A-Video(Meta)首個高質量文本→影片擴散模型(閉源)
2022.09Phenaki(Google)可變長影片生成,自迴歸+擴散混合
2022.10Imagen Video(Google)級聯擴散,高解析度文本→影片
2023.06Gen-2(Runway)首個廣泛可用的商業文本/圖→影片產品
2023.11Stable Video Diffusion首個高質量開源影片擴散模型(SVD)
2023.09Emu Video(Meta)影像先驗→影片的高效架構
2024.02Sora(OpenAI)時空 Patch + DiT,最長約1分鐘,物理感飛躍,引爆行業
2024.06Kling(快手)首個國產開放測試的長影片生成模型
2024.08CogVideoX(智譜)開源 DiT 影片模型
2024.08Stable Video 3D / 4D3D/4D 內容生成探索
2024.Q3-Q4Wan(阿里永珍)、HunyuanVideo(騰訊)、LTX Video 等開源影片生成模型密集釋出,DiT 架構成為主流
2024-2025Veo 2(Google)、Sora 正式上線、Kling 1.6/2.0產品化加速,可用性大幅提升
2025Cosmos(NVIDIA)、Wan2.1、HunyuanVideo 加速版世界模型方向探索、推論加速成焦點

時間線基於公開資訊整理,部分閉源模型的能力描述以官方釋出為準。


技術路線對比

維度U-Net + 時間層時空 DiT自迴歸 Token世界模型
代表SVD, Gen-2Sora, Wan, HunyuanVideoPhenaki, VideoPoetCosmos
骨幹架構2D U-Net 插入時間注意力3D TransformerTransformer / LLMDiT + 物理模擬
時長上限短(2-6秒為主)中長(數秒至1分鐘+)可變長(理論上無限)側重物理一致性
Scaling 可預測性中等高(Transformer scaling law)待驗證
訓練效率高(可複用影像預訓練)中等(需重新訓練)中等低(需物理標註/模擬資料)
推論成本較低高(Transformer 大型模型)高(逐 token 自迴歸)極高
時間一致性一般最佳(物理先驗)
當前成熟度★★★★★★★★★★★★★
趨勢判斷逐步被替代當前主流路線特定場景(互動式)長期方向

上下游

上游(供給端)

┌─ 資料層 ──────────────────────────────────┐
│  影片語料庫(公開/授權/爬取)              │
│  影片-文本對(人工標註 / VLM 自動打標)    │
│  合成數據(遊戲引擎渲染、模擬資料)        │
└──────────────────────────────────────────┘

┌─ 算力層 ──────────────────────────────────┐
│  GPU: NVIDIA H100/H200/B200 (訓練主力)     │
│       AMD MI300X (部分替代方案)             │
│  TPU: Google TPU v5p                       │
│  國產: 寒武紀、華為昇騰(生態待成熟)      │
│  互聯: NVLink/NVSwitch, InfiniBand         │
│  封裝: CoWoS (先進封裝產能制約)             │
└──────────────────────────────────────────┘

┌─ 架構/編譯層 ─────────────────────────────┐
│  PyTorch, JAX/XLA, Megatron-Core          │
│  分散式訓練: FSDP, DeepSpeed, 3D 並行     │
│  推論: TensorRT, vLLM 擴充套件, ONNX Runtime  │
└──────────────────────────────────────────┘

下游(需求端)

場景描述成熟度
短影片/廣告素材電商、營銷快速出片★★★★
影視預視覺化(Previz)分鏡、概念影片★★★
遊戲/虛擬人NPC 動作、虛擬主播★★★
教育/培訓教學影片自動生成★★
社交/UGC使用者自創內容★★★
專業影視製作長片、特效輔助★★(仍有質量/可控性瓶頸)
機器人/自動駕駛世界模型 → 規劃與模擬★(前沿探索階段)

關鍵指標

指標說明行業現狀(定性)
時長單次生成可持續秒數閉源旗艦可達數十秒至~1分鐘+;開源模型多在 5-16秒
解析度最高生成清晰度480p~1080p 為主流可用;4K 仍處於早期演示
幀率每秒幀數16~30fps,部分支援 24fps(電影標準)
FID/FVD分佈距離指標FVD 廣泛使用但與人類感知相關性有限
Text-Video 對齊文本指令遵循程度主要通過人類評測(CLIPSIM 等自動指標輔助)
時間一致性幀間連貫度、閃爍程度通過人類評測或光流一致性指標衡量
推論延遲生成一段影片所需時間秒級到數十分鐘不等(取決於模型規模、硬體、時長)
視訊記憶體佔用推論峰值 VRAM數十 GB 級(高解析度長影片推論需高階 GPU)

各家評測基準不統一,橫向對比需審慎。以上為行業通用描述。


供需與市場資料

需求側

  • 創作者經濟驅動:全球短影片平台(TikTok/抖音、YouTube Shorts、Reels)日均內容消費量巨大,AI 影片可降低製作成本一個數量級。
  • 企業級需求:廣告、電商(商品影片自動生成)、遊戲、教育等場景存在明確的降本增效訴求。
  • 開發者/研究需求:開源模型降低探索門檻,學術界和創業公司快速跟進。

供給側

  • 算力是硬約束:影片生成訓練和推論均屬算力密集型。據行業估算,一次前沿影片模型的完整訓練可能需要數千至上萬張高階 GPU 執行數週至數月 [行業估算,具體數字各廠商未公開]。
  • 資料壁壘:高質量、授權清晰的影片資料是稀缺資源。頭部公司(Google、字節跳動、快手等)擁有自有影片平台資料優勢。
  • API 定價趨勢:主流影片生成 API 按秒/按解析度計費,單次生成成本在數美分到數美元不等(具體因服務商、解析度、時長而異,快速變化中)。

市場規模

  • 影片生成市場處於早期高速增長階段,精確規模數字各研究報告口徑差異大。
  • 對比參考:影像生成市場(2024 年)據多家行業報告估算已進入數十億美元量級;影片生成被普遍認為潛在市場更大(影片內容的市場規模本身就遠大於影像),但當前滲透率極低。
  • 主要變現模式:API 服務、SaaS 訂閱(創作者工具)、嵌入式功能(影片平台內嵌 AI 生成)、企業定製。

不引用具體預測數字,因各機構估算差異極大且變動頻繁。


代表公司與資本對映

公司/團隊核心產品/模型技術特色融資/估值(公開可查)
OpenAISora時空 DiT,長影片先驅已上市級別估值($300B+,2025年市場預期)
Google DeepMindVeo 2, VideoPoet多模態統一生成,長上下文Alphabet 旗下
RunwayGen-3 Alpha, Gen-4專業創作者工具,較早商業化已融資至約 $4B 估值 [公開報道]
快手Kling(可靈)國內首個大規模可用影片生成港股上市 (1024.HK)
字節跳動PixelDance 等內部模型擁有海量影片資料(抖音/TikTok)未上市
智譜 AICogVideoX, CogVideoX-5B開源路線,DiT 架構國內頭部 AI 創業公司
阿里雲端Wan(永珍)開源,大引數量 DiT阿里巴巴旗下
騰訊HunyuanVideo開源,Flow Matching 路線騰訊旗下
Stability AIStable Video Diffusion開源先驅經歷融資困難後調整策略
Pika LabsPika 1.0/1.5/2.0簡潔易用的創作者工具早期融資,估值據報 ~$500M+
Luma AIDream Machine快速出片,3D/影片融合早期融資
NVIDIACosmos世界模型方向,物理模擬結合晶片+軟體平台雙輪
Kuaishou(同快手可靈)

估值/融資資料來自公開報道,可能已過時,僅供參考,非投資建議。


投資邏輯

核心敘事

影片生成是 AIGC 從”圖片”躍遷到”影片”的範式轉換,對應的是全球數千億美元規模的影片內容製作市場。技術成熟後,內容製作邊際成本趨近於零,將深刻改變影視、廣告、教育、遊戲等行業。

三條投資主線

1) 基礎設施層(“賣鏟子”)

  • GPU/AI 晶片:NVIDIA、AMD、Broadcom 等 → 影片生成是算力消耗”大戶”
  • 雲端服務:AWS/Azure/GCP/阿里雲端 → 模型即服務(MaaS)的重要品類
  • 先進封裝(CoWoS 等)→ 供給瓶頸決定算力天花板
  • 邏輯:無論哪家模型勝出,算力需求確定性最高

2) 模型/平台層

  • 擁有影片資料 + 模型能力的平台公司:字節跳動、快手、Google、Meta
  • 創意工具創業公司:Runway、Pika、Luma → 可能被收購或獨立上市
  • 開源模型公司:智譜、阿里 → 生態卡位
  • 邏輯:資料壁壘 + 模型迭代速度是核心競爭力,但護城河仍在建立中

3) 應用/場景層

  • 電商平台(商品影片自動生成)
  • 營銷/廣告 SaaS
  • 遊戲引擎(AI 動畫生成)
  • 教育內容
  • 邏輯:最終價值在於對傳統工作流的替代效率

風險提示

  • 技術迭代風險:路線仍在快速演進,今天的領先者未必是明天的贏家
  • 算力成本:訓練和推論成本仍高,商業模式盈利能力待驗證
  • 版權/合規風險:訓練資料的版權爭議是全球性問題
  • 評估困難:生成質量評估主觀性強,缺乏統一benchmark
  • 競爭激烈:中國和矽谷同時有大量團隊投入,競爭白熱化

常見誤讀糾偏

❌ 誤讀一:“Sora 是一個物理引擎 / 世界模擬器”

糾正:OpenAI 在 Sora 技術報告中將其定位為”世界模擬器”的長期願景,但當前版本的 Sora 本質上仍是一個統計學習模型,通過大規模影片資料中的模式關聯來生成影片。它並不內建物理定律、碰撞檢測或力學方程。表現出來的”物理感”來自訓練資料中物理規律的統計反映,而非顯式建模。因此會出現物體穿透、反重力等”物理 Bug”。這是一個願景與現實的差距,投資和產品決策不應混淆兩者。

❌ 誤讀二:“影片生成就是把影像生成模型加上時間維度”

糾正:這種簡化描述在 SVD 時代勉強成立(U-Net + temporal layers),但在當前 DiT 時代已不準確。核心區別在於:

  1. 3D VAE 的訓練本身就是一個獨立且困難的工程問題,影像 VAE 的經驗不能直接遷移
  2. 時空 Token 的互動模式(全注意力 vs 分離注意力 vs 稀疏注意力)帶來了全新的計算複雜度挑戰
  3. 時間一致性、運動物理性、長影片段間連貫是影片獨有的技術難點,影像生成不涉及
  4. 資料管線、評測體系、訓練策略都是獨立的技術棧

❌ 誤讀三:“開源模型很快就能追平閉源旗艦”

糾正:開源模型進步飛速,但與閉源旗艦仍存在差距,尤其在:

  • 長影片質量與時長:閉源模型通常支援更長的生成時長且質量衰減更小
  • 物理一致性:依賴更大規模訓練資料和更精細的調優
  • 產品化打磨:互動設計、API 穩定性、安全過濾等工程能力
  • 開源的價值在於加速研究、降低入門門檻、建立生態,而非短期內替代頂級閉源產品

❌ 誤讀四:“引數量越大,影片生成質量一定越好”

糾正:影片生成的質量瓶頸分佈廣泛——3D VAE 的重建能力、訓練資料的質量和多樣性、文本編碼器的理解力、取樣策略、後處理流水線,每一環都可能成為短板。大引數量只是必要條件之一,不是充分條件。小模型+高質量資料+精巧架構的設計,可能在特定場景下優於大型模型的粗糙訓練。


學習路徑

入門(建立直覺)

  1. 先熟悉影像擴散模型:DDPM 論文 → Stable Diffusion 原理 → DiT 論文
  2. 閱讀 Sora 技術報告(OpenAI 官方博文),理解時空 Patch 的核心思想
  3. 體驗 2-3 個產品(如 Kling、Runway Gen-3、Luma Dream Machine),建立”好不好”的直覺

進階(理解架構)

  1. 精讀 CogVideoXHunyuanVideo 的技術報告(開源,細節透明)
  2. 學習 3D VAE 的設計:因果卷積、時空下采樣
  3. 理解 Flow Matching vs DDPM 在影片場景的差異
  4. 閱讀 Wan(永珍)技術報告:大引數量 DiT 訓練經驗

高階(工程與研究)

  1. 跑通一個開源影片生成專案的訓練和推論流程(如 Open-Sora-Plan)
  2. 研究分散式訓練策略:序列並行、張量並行在影片場景的特殊處理
  3. 關注推論加速方向:蒸餾、快取、量化
  4. 追蹤最新論文:arXiv 的 cs.CV 每日更新

推薦資源

  • 論文:DDPM, DiT (Scalable Diffusion Models with Transformers), Sora Technical Report, CogVideoX, HunyuanVideo, Wan Technical Report
  • *部落格
source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型