视频生成 (Video Generation)
3 秒看懂
一句话定义:通过 AI 模型将文本/图像/音频等输入自动合成时间连贯的视频序列,是 AIGC 从”静态”迈入”动态”的标志性技术跃迁。
核心矛盾:在空间质量、时间一致性、时长可控性三个维度同时拉满,所需的算力和数据远超图像生成一个数量级。
产业位置:多模态大模型的”皇冠”,决定 AI 能否真正理解并模拟物理世界的动态规律。
3 分钟产业解释
为什么视频生成现在爆发?
视频生成并非新概念——GAN 时代就有基础探索(如 VideoGPT、MoCoGAN),但画质崩塌、时长仅几秒、运动僵硬三大硬伤使其长期停留在学术论文阶段。2023-2024 年的技术拐点来自三股力量的汇合:
- 扩散模型(Diffusion Models)在图像领域的成功——Stable Diffusion / DALL·E 3 / Midjourney 证明了扩散范式在视觉质量上的统治力,技术外溢至视频是自然延伸。
- DiT(Diffusion Transformer)架构取代 U-Net——Transformer 的可扩展性(scaling law)使模型容量和数据规模的投入产出比变得可预期,大厂敢于重注。
- 训练数据与算力的工业化供给——互联网积累了海量视频语料,GPU 集群规模持续攀升(万卡乃至数万卡训练成为常态),使”暴力美学”路线可行。
当前竞争格局速览
| 阵营 | 代表产品/模型 | 定位 |
|---|---|---|
| 闭源旗舰 | OpenAI Sora、Google Veo(2 代)、Kling(快手可灵) | 端到端长视频、物理一致性 |
| 开源社区 | CogVideoX(智谱)、Wan(阿里万象)、HunyuanVideo(腾讯)、Open-Sora 系列 | 降低门槛、生态卡位 |
| 工具层创业 | Runway Gen-3/4、Pika Labs、Luma AI(Dream Machine) | 创作者工作流、短片/广告场景 |
| 芯片/云 | NVIDIA、AMD、Google TPU、各大云厂商 | 训练与推理算力供应链 |
⚠️ 以上产品能力描述基于公开发布会信息,实际可用性随版本迭代持续变化,不做具体时长/分辨率的精确承诺。
15 分钟专家深入
技术路线的三次范式跃迁
第一代(~2022 及以前):自回归 + 像素空间
- 代表:VideoGPT、TATS、Phenaki(Google,2022)
- 思路:将视频视为 token 序列,用 VQ-VAE / VQGAN 在离散码本上做自回归预测。
- 瓶颈:像素空间维度爆炸(T×H×W×C),分辨率和时长严重受限;token 数随帧数线性增长,长序列建模困难。
第二代(2023):图像扩散 + 时间层插值
- 代表:Stable Video Diffusion(SVD)、Runway Gen-2、Make-A-Video(Meta)
- 思路:在预训练的图像扩散模型(通常是 U-Net)中插入时间注意力层(temporal attention),微调使静态图像生成能力”泛化”到连续帧。
- 瓶颈:时间层的能力天花板——本质上是在空间骨干上”加装”时间模块,建模深度有限;视频长度多局限于 2-4 秒。
第三代(2024-至今):统一的时空 DiT
- 代表:Sora(OpenAI)、Wan(阿里)、HunyuanVideo(腾讯)、Cosmos(NVIDIA)、Veo 2(Google)
- 思路:不再区分”空间骨干 + 时间附加”,而是将视频在潜空间(latent space)压缩为时空 token 序列,统一用 Transformer 架构建模。视频 patch 化(spacetime patching)成为核心设计。
- 优势:架构简洁、scaling 路径清晰、长程依赖建模能力强。
核心技术栈拆解
┌──────────────────────────────────────────────────────┐
│ 视频生成系统全景 │
│ │
│ 输入层: 文本编码器 (T5/CLIP/LLM) + 可选图像/音频条件 │
│ ↓ │
│ 视频压缩: 3D VAE / 因果 VAE (时空降采样) │
│ 原始视频 T×H×W×3 → 潜空间 t×h×w×c │
│ ↓ │
│ 去噪骨干: DiT / U-Net+时间层 / 混合架构 │
│ 输入: 噪声潜变量 + 时间步 + 条件信号 │
│ 输出: 预测噪声 / 预测干净潜变量 │
│ ↓ │
│ 采样调度: DDPM / DDIM / Flow Matching / 蒸馏加速 │
│ ↓ │
│ 解码: 3D VAE 解码器 → 像素空间视频 │
│ ↓ │
│ 后处理: 超分(SR) / 帧插值(FI) / 音频合成 │
└──────────────────────────────────────────────────────┘
各模块技术深度
1) 3D VAE —— 视频的”压缩灵魂”
这是视频生成区别于图像生成的最关键基础设施。
- 核心挑战:原始视频数据量巨大(例如 1080p×24fps×5s ≈ 1.2 GB 未压缩),直接在像素空间做扩散不可行。
- 方案:训练 3D 卷积 VAE,同时在时间轴和空间轴做降采样。典型设计是空间 8×8、时间 4× 的压缩比,将数十帧视频压缩到数百个潜变量 token。
- 因果卷积(Causal Convolution):多数方案在时间维度采用因果结构(当前帧只看过去帧),以支持流式生成和首帧条件化。
- 重建质量瓶颈:VAE 的重建能力直接决定生成上限——如果 VAE 解码后模糊,后续去噪再好也无济于事。3D VAE 训练需要大量高质量视频数据,且解码显存占用随帧数增长显著。
⚠️ 具体压缩比因模型而异,各厂商未完全公开架构细节,上述为业界讨论中常见的典型设计模式。
2) 时空注意力机制 —— 核心计算引擎
┌─ 全注意力 (Full Attention) ──────────────────────┐
│ 所有 token (空间+时间) 之间互相注意 │
│ 优点: 表达能力最强 │
│ 代价: 计算量 O(N²),N = t × h × w,极贵 │
│ 代表: Sora 的原始设计推测方向 │
└──────────────────────────────────────────────────┘
┌─ 分离注意力 (Factorized Attention) ──────────────┐
│ 空间注意力 (帧内) → 时间注意力 (帧间) 交替堆叠 │
│ 优点: 计算量大幅降低 │
│ 缺点: 时空耦合建模能力弱于全注意力 │
│ 代表: SVD、多数 U-Net+时间层方案 │
└──────────────────────────────────────────────────┘
┌─ 稀疏/滑窗注意力 (Sparse/Window Attention) ─────┐
│ 在局部时空窗口内做全注意力,跨窗口用稀疏连接 │
│ 代表: LongViT 类设计,应对长视频的实用折中 │
└──────────────────────────────────────────────────┘
3) 条件控制与对齐
文本条件是主要驱动力:
- 早期方案用 CLIP 文本编码器(77 token 上限,语义粗粒度)
- 新一代改用 T5-XXL 或自研 LLM 编码器,支持长文本、细粒度描述
- 部分方案将文本条件通过 cross-attention 注入,部分通过 adaptive layer norm(adaLN-Zero,DiT 的经典设计)
图像条件(图生视频 / 首帧控制):
- 通常将参考图编码后与噪声潜变量拼接,或通过 IP-Adapter 类机制注入
- 是商业化落地的核心能力——创作者通常需要”从一张图出发”
运动控制:
- Camera control(镜头运动指定)
- Motion brush / trajectory(局部运动轨迹控制)
- ControlNet 类结构在视频场景的扩展
4) 训练范式
三阶段渐进训练是当前主流共识:
| 阶段 | 分辨率/时长 | 目的 |
|---|---|---|
| Stage 1 | 低分辨率、短片段(如 256×256, 数帧) | 学习基本运动动力学和语义对齐 |
| Stage 2 | 中分辨率、中等长度 | 提升画质和时间一致性 |
| Stage 3 | 高分辨率、长片段 | 面向交付质量,通常需要海量算力 |
- 文本-视频对齐依赖大规模高质量视频-文本对数据。视频字幕(video captioning)的质量直接影响生成的指令遵循能力。许多团队会先用强力视觉语言模型对视频重新打标。
- 数据规模:据业界讨论,头部项目的训练数据量在数千万至数亿视频片段级别 [行业估算,无官方确认]。
5) 推理加速
视频生成推理的核心痛点:一次生成需要数十到数百步去噪迭代,每步都是完整的模型前向传播。
加速路线:
- 蒸馏(Distillation):将多步扩散蒸馏为少步(如 50→4 步),代表:Consistency Models、SDXL Turbo 路线在视频上的延伸
- 缓存(Caching):复用相邻时间步或层的中间特征
- 量化:FP16/BF16 → INT8/INT4 推理
- Flow Matching:用 ODE 替代 SDE,采样路径更直,通常所需步数更少。被 Wan、HunyuanVideo 等广泛采用
- 硬件级优化:NVIDIA TensorRT、专用推理芯片
⚠️ 推理延迟和显存需求的具体数字因模型大小、分辨率、时长、硬件差异极大,不做统一量化。
技术原理(专家级)
扩散模型基础回顾
前向过程(加噪):
q(x_t | x_0) = N(x_t; √ᾱ_t · x_0, (1-ᾱ_t)I)
将干净数据 x_0 逐步加入高斯噪声,T 步后趋近纯噪声。
反向过程(去噪):
p_θ(x_{t-1} | x_t) ——由神经网络参数化
从纯噪声出发,逐步去噪还原出干净样本。
训练目标:最常见为预测噪声 ε(ε-prediction),损失函数:
L = E_{x_0, ε, t} [ ||ε - ε_θ(x_t, t, c)||² ]
其中 c 为条件信号(文本编码等)。
Flow Matching 范式(视频生成新趋势)
与传统 DDPM 不同,Flow Matching 定义从噪声到数据的直线插值路径:
x_t = t·x_1 + (1-t)·x_0, t ∈ [0, 1]
模型学习速度场 v_θ,使 ODE 积分沿路径从噪声走向数据。
优势:
- 路径更”直”→ 采样步数更少
- 训练更稳定
- 与 Transformer 架构配合更好
Wan、HunyuanVideo、CogVideoX 等开源/半开源模型均采用或支持 Flow Matching 训练目标。
视频 Patch 化与位置编码
原始视频: (T, H, W, 3)
↓ 3D VAE 编码
潜空间: (t, h, w, c) 例: (16, 30, 40, 16) for ~5s video
↓ Patch 化 (patch_size = pt × ph × pw)
Token序列: N = (t/pt) × (h/ph) × (w/pw) 个 patch token
↓ 位置编码
3D 正弦位置编码 / 可学习位置编码 / RoPE
↓ 送入 Transformer
位置编码的设计对视频生成至关重要——它编码了每个 token 的时间位置和空间位置,使模型能理解”这是第几帧的哪个区域”。
3D VAE 架构细节
编码器:
输入: (B, 3, T, H, W)
→ CausalConv3d (因果卷积: 时间方向只看过去)
→ ResBlock3d × N
→ 时间/空间下采样 (stride)
→ 输出: (B, c, t, h, w)
典型压缩比:
空间: 8×8 (H/8, W/8)
时间: 4× (T/4)
含义: 一段 5 秒 480p (64×480×856) 视频
→ 潜空间约 (16×60×107) 个 c 维向量
→ patch化后约数千 ~ 一万+ tokens
解码器:
编码器镜像 + 渐进式上采样
上述数值为典型设计模式的估算示意,各模型具体配置不同。
训练中的关键技术问题
1) 时间一致性(Temporal Consistency)
- 核心难题:逐帧生成质量可能很高,但帧间出现闪烁、物体形变、颜色跳变
- 缓解手段:时间层/统一时空注意力、光流约束、时序一致性损失、长视频分段生成+重叠平滑
2) 运动合理性(Physical Plausibility)
- 当前模型本质上通过统计关联学习运动模式,不具有物理引擎级别的因果推理能力
- 表现为:物体穿透、重力违反、刚体变形等”物理 Bug”
- 改进方向:物理先验注入、世界模型(World Model)范式、强化学习对齐
3) 长视频生成
- 直接生成长视频的显存和计算量随帧数超线性增长(全注意力下 O(T²·H²·W²))
- 实用策略:自回归续写(autoregressive extension)——生成 N 帧后以末帧为条件生成下一段
- 挑战:段间一致性退化,全局剧情/场景保持困难
4) 文本遵循度(Text Alignment)
- 当前视频模型对复杂指令的理解仍远落后于语言模型
- 长句、多主体、精确空间关系、数字/计数等是难点
技术演进史
| 时间 | 里程碑 | 核心突破 |
|---|---|---|
| 2016 | VGAN, S3D | 最早的视频生成 GAN 探索,分辨率极低 |
| 2021 | VideoGPT | VQ-VAE + 自回归 Transformer,离散化路线确立 |
| 2021.11 | NÜWA(微软亚研) | 统一多任务的视觉合成 Transformer |
| 2022.09 | Make-A-Video(Meta) | 首个高质量文本→视频扩散模型(闭源) |
| 2022.09 | Phenaki(Google) | 可变长视频生成,自回归+扩散混合 |
| 2022.10 | Imagen Video(Google) | 级联扩散,高分辨率文本→视频 |
| 2023.06 | Gen-2(Runway) | 首个广泛可用的商业文本/图→视频产品 |
| 2023.11 | Stable Video Diffusion | 首个高质量开源视频扩散模型(SVD) |
| 2023.09 | Emu Video(Meta) | 图像先验→视频的高效框架 |
| 2024.02 | Sora(OpenAI) | 时空 Patch + DiT,最长约1分钟,物理感飞跃,引爆行业 |
| 2024.06 | Kling(快手) | 首个国产开放测试的长视频生成模型 |
| 2024.08 | CogVideoX(智谱) | 开源 DiT 视频模型 |
| 2024.08 | Stable Video 3D / 4D | 3D/4D 内容生成探索 |
| 2024.Q3-Q4 | Wan(阿里万象)、HunyuanVideo(腾讯)、LTX Video 等 | 开源视频生成模型密集发布,DiT 架构成为主流 |
| 2024-2025 | Veo 2(Google)、Sora 正式上线、Kling 1.6/2.0 | 产品化加速,可用性大幅提升 |
| 2025 | Cosmos(NVIDIA)、Wan2.1、HunyuanVideo 加速版 | 世界模型方向探索、推理加速成焦点 |
时间线基于公开信息整理,部分闭源模型的能力描述以官方发布为准。
技术路线对比
| 维度 | U-Net + 时间层 | 时空 DiT | 自回归 Token | 世界模型 |
|---|---|---|---|---|
| 代表 | SVD, Gen-2 | Sora, Wan, HunyuanVideo | Phenaki, VideoPoet | Cosmos |
| 骨干架构 | 2D U-Net 插入时间注意力 | 3D Transformer | Transformer / LLM | DiT + 物理仿真 |
| 时长上限 | 短(2-6秒为主) | 中长(数秒至1分钟+) | 可变长(理论上无限) | 侧重物理一致性 |
| Scaling 可预测性 | 中等 | 高(Transformer scaling law) | 高 | 待验证 |
| 训练效率 | 高(可复用图像预训练) | 中等(需重新训练) | 中等 | 低(需物理标注/仿真数据) |
| 推理成本 | 较低 | 高(Transformer 大模型) | 高(逐 token 自回归) | 极高 |
| 时间一致性 | 一般 | 好 | 好 | 最佳(物理先验) |
| 当前成熟度 | ★★★★ | ★★★★ | ★★★ | ★★ |
| 趋势判断 | 逐步被替代 | 当前主流路线 | 特定场景(交互式) | 长期方向 |
上下游
上游(供给端)
┌─ 数据层 ──────────────────────────────────┐
│ 视频语料库(公开/授权/爬取) │
│ 视频-文本对(人工标注 / VLM 自动打标) │
│ 合成数据(游戏引擎渲染、仿真数据) │
└──────────────────────────────────────────┘
↓
┌─ 算力层 ──────────────────────────────────┐
│ GPU: NVIDIA H100/H200/B200 (训练主力) │
│ AMD MI300X (部分替代方案) │
│ TPU: Google TPU v5p │
│ 国产: 寒武纪、华为昇腾(生态待成熟) │
│ 互联: NVLink/NVSwitch, InfiniBand │
│ 封装: CoWoS (先进封装产能制约) │
└──────────────────────────────────────────┘
↓
┌─ 框架/编译层 ─────────────────────────────┐
│ PyTorch, JAX/XLA, Megatron-Core │
│ 分布式训练: FSDP, DeepSpeed, 3D 并行 │
│ 推理: TensorRT, vLLM 扩展, ONNX Runtime │
└──────────────────────────────────────────┘
下游(需求端)
| 场景 | 描述 | 成熟度 |
|---|---|---|
| 短视频/广告素材 | 电商、营销快速出片 | ★★★★ |
| 影视预可视化(Previz) | 分镜、概念视频 | ★★★ |
| 游戏/虚拟人 | NPC 动作、虚拟主播 | ★★★ |
| 教育/培训 | 教学视频自动生成 | ★★ |
| 社交/UGC | 用户自创内容 | ★★★ |
| 专业影视制作 | 长片、特效辅助 | ★★(仍有质量/可控性瓶颈) |
| 机器人/自动驾驶 | 世界模型 → 规划与仿真 | ★(前沿探索阶段) |
关键指标
| 指标 | 说明 | 行业现状(定性) |
|---|---|---|
| 时长 | 单次生成可持续秒数 | 闭源旗舰可达数十秒至~1分钟+;开源模型多在 5-16秒 |
| 分辨率 | 最高生成清晰度 | 480p~1080p 为主流可用;4K 仍处于早期演示 |
| 帧率 | 每秒帧数 | 16~30fps,部分支持 24fps(电影标准) |
| FID/FVD | 分布距离指标 | FVD 广泛使用但与人类感知相关性有限 |
| Text-Video 对齐 | 文本指令遵循程度 | 主要通过人类评测(CLIPSIM 等自动指标辅助) |
| 时间一致性 | 帧间连贯度、闪烁程度 | 通过人类评测或光流一致性指标衡量 |
| 推理延迟 | 生成一段视频所需时间 | 秒级到数十分钟不等(取决于模型规模、硬件、时长) |
| 显存占用 | 推理峰值 VRAM | 数十 GB 级(高分辨率长视频推理需高端 GPU) |
各家评测基准不统一,横向对比需审慎。以上为行业通用描述。
供需与市场数据
需求侧
- 创作者经济驱动:全球短视频平台(TikTok/抖音、YouTube Shorts、Reels)日均内容消费量巨大,AI 视频可降低制作成本一个数量级。
- 企业级需求:广告、电商(商品视频自动生成)、游戏、教育等场景存在明确的降本增效诉求。
- 开发者/研究需求:开源模型降低探索门槛,学术界和创业公司快速跟进。
供给侧
- 算力是硬约束:视频生成训练和推理均属算力密集型。据行业估算,一次前沿视频模型的完整训练可能需要数千至上万张高端 GPU 运行数周至数月 [行业估算,具体数字各厂商未公开]。
- 数据壁垒:高质量、授权清晰的视频数据是稀缺资源。头部公司(Google、字节跳动、快手等)拥有自有视频平台数据优势。
- API 定价趋势:主流视频生成 API 按秒/按分辨率计费,单次生成成本在数美分到数美元不等(具体因服务商、分辨率、时长而异,快速变化中)。
市场规模
- 视频生成市场处于早期高速增长阶段,精确规模数字各研报口径差异大。
- 对比参考:图像生成市场(2024 年)据多家行业报告估算已进入数十亿美元量级;视频生成被普遍认为潜在市场更大(视频内容的市场规模本身就远大于图像),但当前渗透率极低。
- 主要变现模式:API 服务、SaaS 订阅(创作者工具)、嵌入式功能(视频平台内嵌 AI 生成)、企业定制。
不引用具体预测数字,因各机构估算差异极大且变动频繁。
代表公司与资本映射
| 公司/团队 | 核心产品/模型 | 技术特色 | 融资/估值(公开可查) |
|---|---|---|---|
| OpenAI | Sora | 时空 DiT,长视频先驱 | 已上市级别估值($300B+,2025年市场预期) |
| Google DeepMind | Veo 2, VideoPoet | 多模态统一生成,长上下文 | Alphabet 旗下 |
| Runway | Gen-3 Alpha, Gen-4 | 专业创作者工具,较早商业化 | 已融资至约 $4B 估值 [公开报道] |
| 快手 | Kling(可灵) | 国内首个大规模可用视频生成 | 港股上市 (1024.HK) |
| 字节跳动 | PixelDance 等内部模型 | 拥有海量视频数据(抖音/TikTok) | 未上市 |
| 智谱 AI | CogVideoX, CogVideoX-5B | 开源路线,DiT 架构 | 国内头部 AI 创业公司 |
| 阿里云 | Wan(万象) | 开源,大参数量 DiT | 阿里巴巴旗下 |
| 腾讯 | HunyuanVideo | 开源,Flow Matching 路线 | 腾讯旗下 |
| Stability AI | Stable Video Diffusion | 开源先驱 | 经历融资困难后调整策略 |
| Pika Labs | Pika 1.0/1.5/2.0 | 简洁易用的创作者工具 | 早期融资,估值据报 ~$500M+ |
| Luma AI | Dream Machine | 快速出片,3D/视频融合 | 早期融资 |
| NVIDIA | Cosmos | 世界模型方向,物理仿真结合 | 芯片+软件平台双轮 |
| Kuaishou | (同快手可灵) | — | — |
估值/融资数据来自公开报道,可能已过时,仅供参考,非投资建议。
投资逻辑
核心叙事
视频生成是 AIGC 从”图片”跃迁到”视频”的范式转换,对应的是全球数千亿美元规模的视频内容制作市场。技术成熟后,内容制作边际成本趋近于零,将深刻改变影视、广告、教育、游戏等行业。
三条投资主线
1) 基础设施层(“卖铲子”)
- GPU/AI 芯片:NVIDIA、AMD、Broadcom 等 → 视频生成是算力消耗”大户”
- 云服务:AWS/Azure/GCP/阿里云 → 模型即服务(MaaS)的重要品类
- 先进封装(CoWoS 等)→ 供给瓶颈决定算力天花板
- 逻辑:无论哪家模型胜出,算力需求确定性最高
2) 模型/平台层
- 拥有视频数据 + 模型能力的平台公司:字节跳动、快手、Google、Meta
- 创意工具创业公司:Runway、Pika、Luma → 可能被收购或独立上市
- 开源模型公司:智谱、阿里 → 生态卡位
- 逻辑:数据壁垒 + 模型迭代速度是核心竞争力,但护城河仍在建立中
3) 应用/场景层
- 电商平台(商品视频自动生成)
- 营销/广告 SaaS
- 游戏引擎(AI 动画生成)
- 教育内容
- 逻辑:最终价值在于对传统工作流的替代效率
风险提示
- 技术迭代风险:路线仍在快速演进,今天的领先者未必是明天的赢家
- 算力成本:训练和推理成本仍高,商业模式盈利能力待验证
- 版权/合规风险:训练数据的版权争议是全球性问题
- 评估困难:生成质量评估主观性强,缺乏统一benchmark
- 竞争激烈:中国和硅谷同时有大量团队投入,竞争白热化
常见误读纠偏
❌ 误读一:“Sora 是一个物理引擎 / 世界模拟器”
纠正:OpenAI 在 Sora 技术报告中将其定位为”世界模拟器”的长期愿景,但当前版本的 Sora 本质上仍是一个统计学习模型,通过大规模视频数据中的模式关联来生成视频。它并不内置物理定律、碰撞检测或力学方程。表现出来的”物理感”来自训练数据中物理规律的统计反映,而非显式建模。因此会出现物体穿透、反重力等”物理 Bug”。这是一个愿景与现实的差距,投资和产品决策不应混淆两者。
❌ 误读二:“视频生成就是把图像生成模型加上时间维度”
纠正:这种简化描述在 SVD 时代勉强成立(U-Net + temporal layers),但在当前 DiT 时代已不准确。核心区别在于:
- 3D VAE 的训练本身就是一个独立且困难的工程问题,图像 VAE 的经验不能直接迁移
- 时空 Token 的交互模式(全注意力 vs 分离注意力 vs 稀疏注意力)带来了全新的计算复杂度挑战
- 时间一致性、运动物理性、长视频段间连贯是视频独有的技术难点,图像生成不涉及
- 数据管线、评测体系、训练策略都是独立的技术栈
❌ 误读三:“开源模型很快就能追平闭源旗舰”
纠正:开源模型进步飞速,但与闭源旗舰仍存在差距,尤其在:
- 长视频质量与时长:闭源模型通常支持更长的生成时长且质量衰减更小
- 物理一致性:依赖更大规模训练数据和更精细的调优
- 产品化打磨:交互设计、API 稳定性、安全过滤等工程能力
- 开源的价值在于加速研究、降低入门门槛、建立生态,而非短期内替代顶级闭源产品
❌ 误读四:“参数量越大,视频生成质量一定越好”
纠正:视频生成的质量瓶颈分布广泛——3D VAE 的重建能力、训练数据的质量和多样性、文本编码器的理解力、采样策略、后处理流水线,每一环都可能成为短板。大参数量只是必要条件之一,不是充分条件。小模型+高质量数据+精巧架构的设计,可能在特定场景下优于大模型的粗糙训练。
学习路径
入门(建立直觉)
- 先熟悉图像扩散模型:DDPM 论文 → Stable Diffusion 原理 → DiT 论文
- 阅读 Sora 技术报告(OpenAI 官方博文),理解时空 Patch 的核心思想
- 体验 2-3 个产品(如 Kling、Runway Gen-3、Luma Dream Machine),建立”好不好”的直觉
进阶(理解架构)
- 精读 CogVideoX 或 HunyuanVideo 的技术报告(开源,细节透明)
- 学习 3D VAE 的设计:因果卷积、时空下采样
- 理解 Flow Matching vs DDPM 在视频场景的差异
- 阅读 Wan(万象)技术报告:大参数量 DiT 训练经验
高级(工程与研究)
- 跑通一个开源视频生成项目的训练和推理流程(如 Open-Sora-Plan)
- 研究分布式训练策略:序列并行、张量并行在视频场景的特殊处理
- 关注推理加速方向:蒸馏、缓存、量化
- 跟踪最新论文:arXiv 的 cs.CV 每日更新
推荐资源
- 论文:DDPM, DiT (Scalable Diffusion Models with Transformers), Sora Technical Report, CogVideoX, HunyuanVideo, Wan Technical Report
- *博客