影片生成 (Video Generation)
3 秒看懂
一句話定義:通過 AI 模型將文本/影像/音訊等輸入自動合成時間連貫的影片序列,是 AIGC 從”靜態”邁入”動態”的標誌性技術躍遷。
核心矛盾:在空間質量、時間一致性、時長可控性三個維度同時拉滿,所需的算力和資料遠超影像生成一個數量級。
產業位置:多模態大型模型的”皇冠”,決定 AI 能否真正理解並模擬物理世界的動態規律。
3 分鐘產業解釋
為什麼影片生成現在爆發?
影片生成並非新概念——GAN 時代就有基礎探索(如 VideoGPT、MoCoGAN),但畫質崩塌、時長僅幾秒、運動僵硬三大硬傷使其長期停留在學術論文階段。2023-2024 年的技術拐點來自三股力量的匯合:
- 擴散模型(Diffusion Models)在影像領域的成功——Stable Diffusion / DALL·E 3 / Midjourney 證明了擴散範式在視覺質量上的統治力,技術外溢至影片是自然延伸。
- DiT(Diffusion Transformer)架構取代 U-Net——Transformer 的可擴充套件性(scaling law)使模型容量和資料規模的投入產出比變得可預期,大廠敢於重注。
- 訓練資料與算力的工業化供給——網際網路積累了海量影片語料,GPU 叢集規模持續攀升(萬卡乃至數萬卡訓練成為常態),使”暴力美學”路線可行。
當前競爭格局速覽
| 陣營 | 代表產品/模型 | 定位 |
|---|---|---|
| 閉源旗艦 | OpenAI Sora、Google Veo(2 代)、Kling(快手可靈) | 端到端長影片、物理一致性 |
| 開源社群 | CogVideoX(智譜)、Wan(阿里永珍)、HunyuanVideo(騰訊)、Open-Sora 系列 | 降低門檻、生態卡位 |
| 工具層創業 | Runway Gen-3/4、Pika Labs、Luma AI(Dream Machine) | 創作者工作流、短片/廣告場景 |
| 晶片/雲端 | NVIDIA、AMD、Google TPU、各大雲端廠商 | 訓練與推論算力供應鏈 |
⚠️ 以上產品能力描述基於公開發佈會資訊,實際可用性隨版本迭代持續變化,不做具體時長/解析度的精確承諾。
15 分鐘專家深入
技術路線的三次範式躍遷
第一代(~2022 及以前):自迴歸 + 畫素空間
- 代表:VideoGPT、TATS、Phenaki(Google,2022)
- 思路:將影片視為 token 序列,用 VQ-VAE / VQGAN 在離散碼本上做自迴歸預測。
- 瓶頸:畫素空間維度爆炸(T×H×W×C),解析度和時長嚴重受限;token 數隨幀數線性增長,長序列建模困難。
第二代(2023):影像擴散 + 時間層插值
- 代表:Stable Video Diffusion(SVD)、Runway Gen-2、Make-A-Video(Meta)
- 思路:在預訓練的影像擴散模型(通常是 U-Net)中插入時間注意力層(temporal attention),微調使靜態影像生成能力”泛化”到連續幀。
- 瓶頸:時間層的能力天花板——本質上是在空間骨幹上”加裝”時間模組,建模深度有限;影片長度多侷限於 2-4 秒。
第三代(2024-至今):統一的時空 DiT
- 代表:Sora(OpenAI)、Wan(阿里)、HunyuanVideo(騰訊)、Cosmos(NVIDIA)、Veo 2(Google)
- 思路:不再區分”空間骨幹 + 時間附加”,而是將影片在潛空間(latent space)壓縮為時空 token 序列,統一用 Transformer 架建置模。影片 patch 化(spacetime patching)成為核心設計。
- 優勢:架構簡潔、scaling 路徑清晰、長程依賴建模能力強。
核心技術棧拆解
┌──────────────────────────────────────────────────────┐
│ 影片生成系統全景 │
│ │
│ 輸入層: 文本編碼器 (T5/CLIP/LLM) + 可選影像/音訊條件 │
│ ↓ │
│ 影片壓縮: 3D VAE / 因果 VAE (時空降取樣) │
│ 原始影片 T×H×W×3 → 潛空間 t×h×w×c │
│ ↓ │
│ 去噪骨幹: DiT / U-Net+時間層 / 混合架構 │
│ 輸入: 噪聲潛變數 + 時間步 + 條件訊號 │
│ 輸出: 預測噪聲 / 預測乾淨潛變數 │
│ ↓ │
│ 取樣排程: DDPM / DDIM / Flow Matching / 蒸餾加速 │
│ ↓ │
│ 解碼: 3D VAE 解碼器 → 畫素空間影片 │
│ ↓ │
│ 後處理: 超分(SR) / 幀插值(FI) / 音訊合成 │
└──────────────────────────────────────────────────────┘
各模組技術深度
1) 3D VAE —— 影片的”壓縮靈魂”
這是影片生成區別於影像生成的最關鍵基礎設施。
- 核心挑戰:原始影片資料量巨大(例如 1080p×24fps×5s ≈ 1.2 GB 未壓縮),直接在畫素空間做擴散不可行。
- 方案:訓練 3D 卷積 VAE,同時在時間軸和空間軸做降取樣。典型設計是空間 8×8、時間 4× 的壓縮比,將數十幀影片壓縮到數百個潛變數 token。
- 因果卷積(Causal Convolution):多數方案在時間維度採用因果結構(當前幀只看過去幀),以支援流式生成和首幀條件化。
- 重建質量瓶頸:VAE 的重建能力直接決定生成上限——如果 VAE 解碼後模糊,後續去噪再好也無濟於事。3D VAE 訓練需要大量高質量影片資料,且解碼視訊記憶體佔用隨幀數增長顯著。
⚠️ 具體壓縮比因模型而異,各廠商未完全公開架構細節,上述為業界討論中常見的典型設計模式。
2) 時空注意力機制 —— 核心計算引擎
┌─ 全注意力 (Full Attention) ──────────────────────┐
│ 所有 token (空間+時間) 之間互相注意 │
│ 優點: 表達能力最強 │
│ 代價: 計算量 O(N²),N = t × h × w,極貴 │
│ 代表: Sora 的原始設計推測方向 │
└──────────────────────────────────────────────────┘
┌─ 分離注意力 (Factorized Attention) ──────────────┐
│ 空間注意力 (幀內) → 時間注意力 (幀間) 交替堆疊 │
│ 優點: 計算量大幅降低 │
│ 缺點: 時空耦合建模能力弱於全注意力 │
│ 代表: SVD、多數 U-Net+時間層方案 │
└──────────────────────────────────────────────────┘
┌─ 稀疏/滑窗注意力 (Sparse/Window Attention) ─────┐
│ 在區域性時空視窗內做全注意力,跨視窗用稀疏連線 │
│ 代表: LongViT 類設計,應對長影片的實用折中 │
└──────────────────────────────────────────────────┘
3) 條件控制與對齊
文本條件是主要驅動力:
- 早期方案用 CLIP 文本編碼器(77 token 上限,語義粗粒度)
- 新一代改用 T5-XXL 或自研 LLM 編碼器,支援長文本、細粒度描述
- 部分方案將文本條件通過 cross-attention 注入,部分通過 adaptive layer norm(adaLN-Zero,DiT 的經典設計)
影像條件(圖生影片 / 首幀控制):
- 通常將參考圖編碼後與噪聲潛變數拼接,或通過 IP-Adapter 類機制注入
- 是商業化落地的核心能力——創作者通常需要”從一張圖出發”
運動控制:
- Camera control(鏡頭運動指定)
- Motion brush / trajectory(區域性運動軌跡控制)
- ControlNet 類結構在影片場景的擴充套件
4) 訓練範式
三階段漸進訓練是當前主流共識:
| 階段 | 解析度/時長 | 目的 |
|---|---|---|
| Stage 1 | 低解析度、短片段(如 256×256, 數幀) | 學習基本運動動力學和語義對齊 |
| Stage 2 | 中解析度、中等長度 | 提升畫質和時間一致性 |
| Stage 3 | 高解析度、長片段 | 面向交付質量,通常需要海量算力 |
- 文本-影片對齊依賴大規模高質量影片-文本對資料。影片字幕(video captioning)的質量直接影響生成的指令遵循能力。許多團隊會先用強力視覺語言模型對影片重新打標。
- 資料規模:據業界討論,頭部專案的訓練資料量在數千萬至數億影片片段級別 [行業估算,無官方確認]。
5) 推論加速
影片生成推論的核心痛點:一次生成需要數十到數百步去噪迭代,每步都是完整的模型前向傳播。
加速路線:
- 蒸餾(Distillation):將多步擴散蒸餾為少步(如 50→4 步),代表:Consistency Models、SDXL Turbo 路線在影片上的延伸
- 快取(Caching):複用相鄰時間步或層的中間特徵
- 量化:FP16/BF16 → INT8/INT4 推論
- Flow Matching:用 ODE 替代 SDE,取樣路徑更直,通常所需步數更少。被 Wan、HunyuanVideo 等廣泛採用
- 硬體級最佳化:NVIDIA TensorRT、專用推論晶片
⚠️ 推論延遲和視訊記憶體需求的具體數字因模型大小、解析度、時長、硬體差異極大,不做統一量化。
技術原理(專家級)
擴散模型基礎回顧
前向過程(加噪):
q(x_t | x_0) = N(x_t; √ᾱ_t · x_0, (1-ᾱ_t)I)
將乾淨資料 x_0 逐步加入高斯噪聲,T 步後趨近純噪聲。
反向過程(去噪):
p_θ(x_{t-1} | x_t) ——由神經網路引數化
從純噪聲出發,逐步去噪還原出乾淨樣本。
訓練目標:最常見為預測噪聲 ε(ε-prediction),損失函式:
L = E_{x_0, ε, t} [ ||ε - ε_θ(x_t, t, c)||² ]
其中 c 為條件訊號(文本編碼等)。
Flow Matching 範式(影片生成新趨勢)
與傳統 DDPM 不同,Flow Matching 定義從噪聲到資料的直線插值路徑:
x_t = t·x_1 + (1-t)·x_0, t ∈ [0, 1]
模型學習速度場 v_θ,使 ODE 積分沿路徑從噪聲走向資料。
優勢:
- 路徑更”直”→ 取樣步數更少
- 訓練更穩定
- 與 Transformer 架構配合更好
Wan、HunyuanVideo、CogVideoX 等開源/半開源模型均採用或支援 Flow Matching 訓練目標。
影片 Patch 化與位置編碼
原始影片: (T, H, W, 3)
↓ 3D VAE 編碼
潛空間: (t, h, w, c) 例: (16, 30, 40, 16) for ~5s video
↓ Patch 化 (patch_size = pt × ph × pw)
Token序列: N = (t/pt) × (h/ph) × (w/pw) 個 patch token
↓ 位置編碼
3D 正弦位置編碼 / 可學習位置編碼 / RoPE
↓ 送入 Transformer
位置編碼的設計對影片生成至關重要——它編碼了每個 token 的時間位置和空間位置,使模型能理解”這是第幾幀的哪個區域”。
3D VAE 架構細節
編碼器:
輸入: (B, 3, T, H, W)
→ CausalConv3d (因果卷積: 時間方向只看過去)
→ ResBlock3d × N
→ 時間/空間下采樣 (stride)
→ 輸出: (B, c, t, h, w)
典型壓縮比:
空間: 8×8 (H/8, W/8)
時間: 4× (T/4)
含義: 一段 5 秒 480p (64×480×856) 影片
→ 潛空間約 (16×60×107) 個 c 維向量
→ patch化後約數千 ~ 一萬+ tokens
解碼器:
編碼器映象 + 漸進式上取樣
上述數值為典型設計模式的估算示意,各模型具體配置不同。
訓練中的關鍵技術問題
1) 時間一致性(Temporal Consistency)
- 核心難題:逐幀生成質量可能很高,但幀間出現閃爍、物體形變、顏色跳變
- 緩解手段:時間層/統一時空注意力、光流約束、時序一致性損失、長影片分段生成+重疊平滑
2) 運動合理性(Physical Plausibility)
- 當前模型本質上通過統計關聯學習運動模式,不具有物理引擎級別的因果推論能力
- 表現為:物體穿透、重力違反、剛體變形等”物理 Bug”
- 改進方向:物理先驗注入、世界模型(World Model)範式、強化學習對齊
3) 長影片生成
- 直接生成長影片的視訊記憶體和計算量隨幀數超線性增長(全注意力下 O(T²·H²·W²))
- 實用策略:自迴歸續寫(autoregressive extension)——生成 N 幀後以末幀為條件生成下一段
- 挑戰:段間一致性退化,全域性劇情/場景保持困難
4) 文本遵循度(Text Alignment)
- 當前影片模型對複雜指令的理解仍遠落後於語言模型
- 長句、多主體、精確空間關係、數字/計數等是難點
技術演進史
| 時間 | 里程碑 | 核心突破 |
|---|---|---|
| 2016 | VGAN, S3D | 最早的影片生成 GAN 探索,解析度極低 |
| 2021 | VideoGPT | VQ-VAE + 自迴歸 Transformer,離散化路線確立 |
| 2021.11 | NÜWA(微軟亞研) | 統一多工的視覺合成 Transformer |
| 2022.09 | Make-A-Video(Meta) | 首個高質量文本→影片擴散模型(閉源) |
| 2022.09 | Phenaki(Google) | 可變長影片生成,自迴歸+擴散混合 |
| 2022.10 | Imagen Video(Google) | 級聯擴散,高解析度文本→影片 |
| 2023.06 | Gen-2(Runway) | 首個廣泛可用的商業文本/圖→影片產品 |
| 2023.11 | Stable Video Diffusion | 首個高質量開源影片擴散模型(SVD) |
| 2023.09 | Emu Video(Meta) | 影像先驗→影片的高效架構 |
| 2024.02 | Sora(OpenAI) | 時空 Patch + DiT,最長約1分鐘,物理感飛躍,引爆行業 |
| 2024.06 | Kling(快手) | 首個國產開放測試的長影片生成模型 |
| 2024.08 | CogVideoX(智譜) | 開源 DiT 影片模型 |
| 2024.08 | Stable Video 3D / 4D | 3D/4D 內容生成探索 |
| 2024.Q3-Q4 | Wan(阿里永珍)、HunyuanVideo(騰訊)、LTX Video 等 | 開源影片生成模型密集釋出,DiT 架構成為主流 |
| 2024-2025 | Veo 2(Google)、Sora 正式上線、Kling 1.6/2.0 | 產品化加速,可用性大幅提升 |
| 2025 | Cosmos(NVIDIA)、Wan2.1、HunyuanVideo 加速版 | 世界模型方向探索、推論加速成焦點 |
時間線基於公開資訊整理,部分閉源模型的能力描述以官方釋出為準。
技術路線對比
| 維度 | U-Net + 時間層 | 時空 DiT | 自迴歸 Token | 世界模型 |
|---|---|---|---|---|
| 代表 | SVD, Gen-2 | Sora, Wan, HunyuanVideo | Phenaki, VideoPoet | Cosmos |
| 骨幹架構 | 2D U-Net 插入時間注意力 | 3D Transformer | Transformer / LLM | DiT + 物理模擬 |
| 時長上限 | 短(2-6秒為主) | 中長(數秒至1分鐘+) | 可變長(理論上無限) | 側重物理一致性 |
| Scaling 可預測性 | 中等 | 高(Transformer scaling law) | 高 | 待驗證 |
| 訓練效率 | 高(可複用影像預訓練) | 中等(需重新訓練) | 中等 | 低(需物理標註/模擬資料) |
| 推論成本 | 較低 | 高(Transformer 大型模型) | 高(逐 token 自迴歸) | 極高 |
| 時間一致性 | 一般 | 好 | 好 | 最佳(物理先驗) |
| 當前成熟度 | ★★★★ | ★★★★ | ★★★ | ★★ |
| 趨勢判斷 | 逐步被替代 | 當前主流路線 | 特定場景(互動式) | 長期方向 |
上下游
上游(供給端)
┌─ 資料層 ──────────────────────────────────┐
│ 影片語料庫(公開/授權/爬取) │
│ 影片-文本對(人工標註 / VLM 自動打標) │
│ 合成數據(遊戲引擎渲染、模擬資料) │
└──────────────────────────────────────────┘
↓
┌─ 算力層 ──────────────────────────────────┐
│ GPU: NVIDIA H100/H200/B200 (訓練主力) │
│ AMD MI300X (部分替代方案) │
│ TPU: Google TPU v5p │
│ 國產: 寒武紀、華為昇騰(生態待成熟) │
│ 互聯: NVLink/NVSwitch, InfiniBand │
│ 封裝: CoWoS (先進封裝產能制約) │
└──────────────────────────────────────────┘
↓
┌─ 架構/編譯層 ─────────────────────────────┐
│ PyTorch, JAX/XLA, Megatron-Core │
│ 分散式訓練: FSDP, DeepSpeed, 3D 並行 │
│ 推論: TensorRT, vLLM 擴充套件, ONNX Runtime │
└──────────────────────────────────────────┘
下游(需求端)
| 場景 | 描述 | 成熟度 |
|---|---|---|
| 短影片/廣告素材 | 電商、營銷快速出片 | ★★★★ |
| 影視預視覺化(Previz) | 分鏡、概念影片 | ★★★ |
| 遊戲/虛擬人 | NPC 動作、虛擬主播 | ★★★ |
| 教育/培訓 | 教學影片自動生成 | ★★ |
| 社交/UGC | 使用者自創內容 | ★★★ |
| 專業影視製作 | 長片、特效輔助 | ★★(仍有質量/可控性瓶頸) |
| 機器人/自動駕駛 | 世界模型 → 規劃與模擬 | ★(前沿探索階段) |
關鍵指標
| 指標 | 說明 | 行業現狀(定性) |
|---|---|---|
| 時長 | 單次生成可持續秒數 | 閉源旗艦可達數十秒至~1分鐘+;開源模型多在 5-16秒 |
| 解析度 | 最高生成清晰度 | 480p~1080p 為主流可用;4K 仍處於早期演示 |
| 幀率 | 每秒幀數 | 16~30fps,部分支援 24fps(電影標準) |
| FID/FVD | 分佈距離指標 | FVD 廣泛使用但與人類感知相關性有限 |
| Text-Video 對齊 | 文本指令遵循程度 | 主要通過人類評測(CLIPSIM 等自動指標輔助) |
| 時間一致性 | 幀間連貫度、閃爍程度 | 通過人類評測或光流一致性指標衡量 |
| 推論延遲 | 生成一段影片所需時間 | 秒級到數十分鐘不等(取決於模型規模、硬體、時長) |
| 視訊記憶體佔用 | 推論峰值 VRAM | 數十 GB 級(高解析度長影片推論需高階 GPU) |
各家評測基準不統一,橫向對比需審慎。以上為行業通用描述。
供需與市場資料
需求側
- 創作者經濟驅動:全球短影片平台(TikTok/抖音、YouTube Shorts、Reels)日均內容消費量巨大,AI 影片可降低製作成本一個數量級。
- 企業級需求:廣告、電商(商品影片自動生成)、遊戲、教育等場景存在明確的降本增效訴求。
- 開發者/研究需求:開源模型降低探索門檻,學術界和創業公司快速跟進。
供給側
- 算力是硬約束:影片生成訓練和推論均屬算力密集型。據行業估算,一次前沿影片模型的完整訓練可能需要數千至上萬張高階 GPU 執行數週至數月 [行業估算,具體數字各廠商未公開]。
- 資料壁壘:高質量、授權清晰的影片資料是稀缺資源。頭部公司(Google、字節跳動、快手等)擁有自有影片平台資料優勢。
- API 定價趨勢:主流影片生成 API 按秒/按解析度計費,單次生成成本在數美分到數美元不等(具體因服務商、解析度、時長而異,快速變化中)。
市場規模
- 影片生成市場處於早期高速增長階段,精確規模數字各研究報告口徑差異大。
- 對比參考:影像生成市場(2024 年)據多家行業報告估算已進入數十億美元量級;影片生成被普遍認為潛在市場更大(影片內容的市場規模本身就遠大於影像),但當前滲透率極低。
- 主要變現模式:API 服務、SaaS 訂閱(創作者工具)、嵌入式功能(影片平台內嵌 AI 生成)、企業定製。
不引用具體預測數字,因各機構估算差異極大且變動頻繁。
代表公司與資本對映
| 公司/團隊 | 核心產品/模型 | 技術特色 | 融資/估值(公開可查) |
|---|---|---|---|
| OpenAI | Sora | 時空 DiT,長影片先驅 | 已上市級別估值($300B+,2025年市場預期) |
| Google DeepMind | Veo 2, VideoPoet | 多模態統一生成,長上下文 | Alphabet 旗下 |
| Runway | Gen-3 Alpha, Gen-4 | 專業創作者工具,較早商業化 | 已融資至約 $4B 估值 [公開報道] |
| 快手 | Kling(可靈) | 國內首個大規模可用影片生成 | 港股上市 (1024.HK) |
| 字節跳動 | PixelDance 等內部模型 | 擁有海量影片資料(抖音/TikTok) | 未上市 |
| 智譜 AI | CogVideoX, CogVideoX-5B | 開源路線,DiT 架構 | 國內頭部 AI 創業公司 |
| 阿里雲端 | Wan(永珍) | 開源,大引數量 DiT | 阿里巴巴旗下 |
| 騰訊 | HunyuanVideo | 開源,Flow Matching 路線 | 騰訊旗下 |
| Stability AI | Stable Video Diffusion | 開源先驅 | 經歷融資困難後調整策略 |
| Pika Labs | Pika 1.0/1.5/2.0 | 簡潔易用的創作者工具 | 早期融資,估值據報 ~$500M+ |
| Luma AI | Dream Machine | 快速出片,3D/影片融合 | 早期融資 |
| NVIDIA | Cosmos | 世界模型方向,物理模擬結合 | 晶片+軟體平台雙輪 |
| Kuaishou | (同快手可靈) | — | — |
估值/融資資料來自公開報道,可能已過時,僅供參考,非投資建議。
投資邏輯
核心敘事
影片生成是 AIGC 從”圖片”躍遷到”影片”的範式轉換,對應的是全球數千億美元規模的影片內容製作市場。技術成熟後,內容製作邊際成本趨近於零,將深刻改變影視、廣告、教育、遊戲等行業。
三條投資主線
1) 基礎設施層(“賣鏟子”)
- GPU/AI 晶片:NVIDIA、AMD、Broadcom 等 → 影片生成是算力消耗”大戶”
- 雲端服務:AWS/Azure/GCP/阿里雲端 → 模型即服務(MaaS)的重要品類
- 先進封裝(CoWoS 等)→ 供給瓶頸決定算力天花板
- 邏輯:無論哪家模型勝出,算力需求確定性最高
2) 模型/平台層
- 擁有影片資料 + 模型能力的平台公司:字節跳動、快手、Google、Meta
- 創意工具創業公司:Runway、Pika、Luma → 可能被收購或獨立上市
- 開源模型公司:智譜、阿里 → 生態卡位
- 邏輯:資料壁壘 + 模型迭代速度是核心競爭力,但護城河仍在建立中
3) 應用/場景層
- 電商平台(商品影片自動生成)
- 營銷/廣告 SaaS
- 遊戲引擎(AI 動畫生成)
- 教育內容
- 邏輯:最終價值在於對傳統工作流的替代效率
風險提示
- 技術迭代風險:路線仍在快速演進,今天的領先者未必是明天的贏家
- 算力成本:訓練和推論成本仍高,商業模式盈利能力待驗證
- 版權/合規風險:訓練資料的版權爭議是全球性問題
- 評估困難:生成質量評估主觀性強,缺乏統一benchmark
- 競爭激烈:中國和矽谷同時有大量團隊投入,競爭白熱化
常見誤讀糾偏
❌ 誤讀一:“Sora 是一個物理引擎 / 世界模擬器”
糾正:OpenAI 在 Sora 技術報告中將其定位為”世界模擬器”的長期願景,但當前版本的 Sora 本質上仍是一個統計學習模型,通過大規模影片資料中的模式關聯來生成影片。它並不內建物理定律、碰撞檢測或力學方程。表現出來的”物理感”來自訓練資料中物理規律的統計反映,而非顯式建模。因此會出現物體穿透、反重力等”物理 Bug”。這是一個願景與現實的差距,投資和產品決策不應混淆兩者。
❌ 誤讀二:“影片生成就是把影像生成模型加上時間維度”
糾正:這種簡化描述在 SVD 時代勉強成立(U-Net + temporal layers),但在當前 DiT 時代已不準確。核心區別在於:
- 3D VAE 的訓練本身就是一個獨立且困難的工程問題,影像 VAE 的經驗不能直接遷移
- 時空 Token 的互動模式(全注意力 vs 分離注意力 vs 稀疏注意力)帶來了全新的計算複雜度挑戰
- 時間一致性、運動物理性、長影片段間連貫是影片獨有的技術難點,影像生成不涉及
- 資料管線、評測體系、訓練策略都是獨立的技術棧
❌ 誤讀三:“開源模型很快就能追平閉源旗艦”
糾正:開源模型進步飛速,但與閉源旗艦仍存在差距,尤其在:
- 長影片質量與時長:閉源模型通常支援更長的生成時長且質量衰減更小
- 物理一致性:依賴更大規模訓練資料和更精細的調優
- 產品化打磨:互動設計、API 穩定性、安全過濾等工程能力
- 開源的價值在於加速研究、降低入門門檻、建立生態,而非短期內替代頂級閉源產品
❌ 誤讀四:“引數量越大,影片生成質量一定越好”
糾正:影片生成的質量瓶頸分佈廣泛——3D VAE 的重建能力、訓練資料的質量和多樣性、文本編碼器的理解力、取樣策略、後處理流水線,每一環都可能成為短板。大引數量只是必要條件之一,不是充分條件。小模型+高質量資料+精巧架構的設計,可能在特定場景下優於大型模型的粗糙訓練。
學習路徑
入門(建立直覺)
- 先熟悉影像擴散模型:DDPM 論文 → Stable Diffusion 原理 → DiT 論文
- 閱讀 Sora 技術報告(OpenAI 官方博文),理解時空 Patch 的核心思想
- 體驗 2-3 個產品(如 Kling、Runway Gen-3、Luma Dream Machine),建立”好不好”的直覺
進階(理解架構)
- 精讀 CogVideoX 或 HunyuanVideo 的技術報告(開源,細節透明)
- 學習 3D VAE 的設計:因果卷積、時空下采樣
- 理解 Flow Matching vs DDPM 在影片場景的差異
- 閱讀 Wan(永珍)技術報告:大引數量 DiT 訓練經驗
高階(工程與研究)
- 跑通一個開源影片生成專案的訓練和推論流程(如 Open-Sora-Plan)
- 研究分散式訓練策略:序列並行、張量並行在影片場景的特殊處理
- 關注推論加速方向:蒸餾、快取、量化
- 追蹤最新論文:arXiv 的 cs.CV 每日更新
推薦資源
- 論文:DDPM, DiT (Scalable Diffusion Models with Transformers), Sora Technical Report, CogVideoX, HunyuanVideo, Wan Technical Report
- *部落格