图生视频
3秒看懂
图生视频(Image-to-Video,I2V)是一种生成式 AI 技术,输入一张静态图像,即可输出一段包含合理运动与场景变化的连贯短视频。它是视频生成的核心分支,也是比文生视频(T2V)更早进入实用验证的技术前置,核心价值在于大幅降低动态视觉内容的创作门槛。
3分钟产业解释
图生视频不等于“让照片动起来”。它的本质是 AI 在理解二维图像含义的基础上,对缺失的时间维度进行合理重建,生成原图中不曾出现的运动细节和背景变化,从而完成从静态空间到动态时空的跨越。
当前产业链已经初步成型:
- 上游:算力硬件(高性能 GPU)、大规模视频‑图像配对数据集、基础模型框架(扩散模型、3D VAE 等)。
- 中游:技术提供商与模型开发者,既包括 Runway、Pika Labs、Stability AI、Luma AI 等创业公司,也包括 Google、Meta、微软等大型科技企业,以及国内的可灵(快手)、生数科技、智谱等。
- 下游:应用场景广泛覆盖影视特效预演、广告创意制作、游戏动画、电子商务商品展示、教育培训、社交媒体特效与个人内容创作。
商业模式目前主要有三条路径:
- 云服务 API 调用(按生成秒数或次数计费);
- 专业工具集成(嵌入 Adobe Premiere Pro、剪映等现有创作软件);
- 自有应用订阅(通过独立 App 或网页端提供面向消费者和创作者的付费会员服务)。
竞争焦点已从“能不能生成”转向“生成的可控性、时长与一致性”。投资视角下,整个赛道仍处于早期爆发阶段,技术迭代极快,尚未形成稳定的市场份额格局。
技术原理
图生视频的技术核心可以概括为:在输入图像提供的空间‑语义先验约束下,对时间维度进行概率建模与生成。目前最成功的主流框架是基于扩散模型的条件视频生成,其工作原理按以下层次展开。
1. 潜在空间中的时空扩散
现代模型几乎不再直接处理像素。整个流程的关键是先将视频数据映射到低维的“时空潜在空间”:
- 视频压缩:通过一个预训练的 3D VAE(三维变分自编码器) 编码器,将一段视频(例如 24 帧、分辨率 768×768 的片段)压缩成一个尺寸小得多的时空潜在张量。这步可将计算成本降低 1–2 个数量级。
- 潜在空间扩散:在该低维空间中执行扩散过程。首先生成一个完全随机的噪声潜在序列,然后在输入图像条件的引导下,使用去噪 U‑Net 迭代从噪声中恢复出有意义的潜在序列。
- 解码回像素视频:最终通过 3D VAE 解码器将去噪后的潜在序列解压成完整的彩色视频。
2. 输入图像作为条件注入
为了让模型“忠于”原始图像,需要将图像特征持续作用于去噪过程。主要注入机制有三种,并且它们经常组合使用:
- 通道拼接(Channel Concatenation):将输入图像的潜在表示(经同一编码器获得)与待去噪的噪声潜在序列在通道维度上直接拼接,作为 U‑Net 的输入。
- 交叉注意力(Cross‑Attention):利用 CLIP 等图像编码器提取输入图像的高层语义特征,将其作为交叉注意力层的键(Key)与值(Value),与 U‑Net 中的噪声特征进行交互。这有助于理解物体类别、风格、场景语义,从而生成与图像内容一致的后续帧。
- 自适应归一化(AdaLN):用图像条件特征调制 U‑Net 各层归一化操作的缩放与偏置参数,以在不同层级控制风格和结构。
3. 时序一致性与运动建模
单帧逼真却帧间闪烁的视频毫无价值,因此时序一致性是图生视频的核心挑战。关键技术手段包括:
- 3D 时空注意力:在标准的二维空间注意力(Self‑Attention)之外,沿时间轴延伸注意力计算。一个令牌不仅可以关注同一帧中的其他空间位置,还能关注前后帧中的对应区域,从而有能力“追踪”同一物体的外观和运动。
- 联合扩散:将整个视频潜在序列作为一个整体样本,在扩散过程中同时对所有帧进行加噪与去噪,避免逐帧生成造成的漂移。
- 运动显式引导:部分学术工作在实际网络中引入预训练的光流预测器或运动向量模块,作为额外的运动先验来约束生成结果,使其更符合真实的物体位移轨迹。
4. 典型推理流程与计算量级
输入图像 I
→ [图像编码器] → 条件特征 c
→ [3D VAE 编码器] → 图像潜在表示 z_i(可选用于拼接)
→ 构建初始噪声潜在序列 z_T(完全随机)
→ 循环 t = T 到 1:
将 z_t 与条件 c 送入 U‑Net(含时空注意力等),预测施加的噪声
从 z_t 中去除该噪声,得到 z_{t-1}
→ 得到干净潜在序列 z_0
→ [3D VAE 解码器] → 输出视频 V(如 3 秒、24fps、720p)
根据公开论文与开源模型推断,一款主流图生视频模型的参数量通常在 20 亿至 200 亿(2B–20B) 之间。在英伟达 A100(80 GB)或 H100 级 GPU 上,生成 3 秒 24fps 的 720p 视频通常需要 30 秒到数分钟 的推理时间,具体的延迟高度依赖于采样步数、是否启用蒸馏加速以及批次大小。这些数字基于 Stability AI 公开的 Stable Video Diffusion 系列及 Runway 技术演示估算,其训练用到的视频帧数可达数十亿帧量级(公开资料显示 WebVid‑10M 数据集包含约 1000 万个视频片段,各公司私有数据集规模为公开数据集的 10–100 倍)。
关键参数
在图生视频的技术评估与产品选型中,以下参数决定了用户体验与商业可行性。所有性能数值均依据 2024–2025 年间行业公开产品文档与第三方评测整理,具体口径差异标注于表内。
| 参数 | 含义 | 当前行业参考值(2024–2025) | 备注 |
|---|---|---|---|
| 最大输出时长 | 单次可稳定生成的视频秒数 | 4–10 秒(主流产品 4–6 秒,Runway Gen‑3 Alpha、可灵等宣称可至 10 秒) | 超过 10 秒后物体一致性急剧下降(来源:各产品官方说明) |
| 输出分辨率 | 视频的像素尺寸 | 普遍为 576p–1080p,部分支持 4K 输出(通过超分后处理) | 原生生成分辨率多在 768×768 至 1280×720 范围(来源:Runway、Pika 帮助中心 2024) |
| 帧率 | 每秒帧数(fps) | 24 fps 或 30 fps(主流),个别允许 8–60 fps 自定义 | 帧率与推理时间正相关(来源:Stable Video Diffusion 文档) |
| 生成时间(延迟) | 提交任务到完成的时间 | 高端云端 GPU 上 3 秒视频约 30 秒–2 分钟(视模型与步数) | 各厂商已推出推理加速版,如 Runway Turbo 模式(来源:Runway Research Blog, 2024) |
| 时序一致性 | 画面中物体身份、外观与背景在帧间的稳定性 | 人工评估 MOS 分数普遍在 3.0–4.5(5 分制)之间,闪烁与变形仍常见 | 目前公开资料未见统一的 FVD 基准排行榜,各模型自报数据口径不一(来源:各公司技术报告) |
| 运动合理性 | 生成的动态是否符合物理规律 | 显著提升但仍有“鬼畜”、穿模、反重力等现象 | 人类评分显示运动合理性仍是主要扣分项(来源:CVPR 2024 多篇视频生成评测论文) |
| 可控性维度 | 用户可指定的生成约束 | 运动幅度、摄像机平移/推拉、部分物体运动轨迹(Runway 的运动笔刷等)、风格迁移 | 精确的物理轨迹控制多处在实验室或内测阶段(来源:Runway、Pika 官方公告) |
| API 调用成本 | 按秒/次计费 | 约 $0.03–0.10/秒(2024 年 Runway Gen‑2 / Gen‑3 Alpha 公开定价) | 价格呈快速下行趋势(来源:Runway 官方网站定价页,2024 年 12 月查询) |
说明:部分参数(如 FVD——视频 Frechet 距离)因缺乏跨模型的标准化评测且受训练数据影响显著,未直接作为通用对比指标。公开资料未见图生视频领域公认的行业基准测试集(如 text‑to‑video 中的 MSR‑VTT 迁移版),各模型性能对比多基于自选测试图像和自定评测标准。
技术路线
图生视频技术存在多条并行演化路线,目前以基于扩散的潜在视频模型为工程化主流,其他路线多处于研究探索阶段。
| 技术路线 | 核心原理 | 典型代表/方向 | 优势 | 局限 | 发展阶段 |
|---|---|---|---|---|---|
| 基于扩散的潜在视频模型 | 在压缩的时空潜在空间对整段视频序列进行迭代去噪 | Stable Video Diffusion (Stability AI)、Runway Gen‑2/Gen‑3 Alpha、Pika 2.0、可灵基础架构 | 生成质量最高,训练过程稳定,易于规模化 | 推理计算量巨大,成本高,长视频(>10 s)一致性仍难保障 | 主流工程化,产品落地核心 |
| 基于 Transformer 的自回归模型 | 将视频帧离散化为视觉 token,逐帧或逐段自回归预测 | VideoPoet (Google)、部分开源研究模型 | 架构统一,易于集成多模态,理论上支持任意长度生成 | 计算复杂度随长度指数增长,长视频质量易退化 | 研究探索期,谷歌 VideoPoet 2023 年底亮相 |
| 混合架构(扩散 + 自回归) | 使用扩散模型生成关键帧,自回归模型完成帧间插值 | 部分学术论文(如 NUWA‑XL 等) | 结合扩散的高质量与自回归的长序列生成潜力 | 架构复杂,流水线误差累积,尚未看到领先产品 | 前沿研究期 |
| 物理引擎引导生成 | 将物理模拟器作为先验约束或判别器,强制运动符合物理规律 | 英伟达相关研究(如 Phys‑Diffusion 等) | 运动与碰撞极为真实,适合特定场景(如刚体运动) | 依赖物理引擎建模的完整度,复杂软体/流体泛化难,计算量更大 | 早期实验室阶段 |
(来源:各公司官方博客、学术论文预印本,时间截至 2025 年初)
上游
图生视频的上游由算力硬件、训练数据与基础模型框架三部分构成,其中算力仍是当前的最大约束。
-
算力硬件
- GPU:英伟达 H100、H200、B200 是这个阶段训练视频生成模型的主力芯片。据英伟达 2025 财年第二季度(2024 年 8 月)财报,数据中心收入达 263 亿美元,同比增长 154%,其中大规模集群被用于训练包含视频生成在内的多模态模型(来源:英伟达财报 2024Q2)。AMD MI300X 等产品也开始进入部分云厂商的 AI 实例。
- 云服务:亚马逊 AWS(提供 P4d/P5 实例等)、微软 Azure、谷歌云 GCP 是核心训练托管平台。推理层面的 GPU 云服务(如 CoreWeave、Lambda Labs)也因图生视频需求而获得增长。
-
视频与图像数据
- 公开数据集:WebVid‑10M(包含约 1000 万个视频‑文本对)、LAION‑5B(图像‑文字对,部分用于预训练图像编码器)、HD‑VILA‑100M 等高分辨率视频数据集构成行业公开数据基础(来源:各自论文与官网)。
- 专有数据:头部公司普遍依赖内部采集与标注的十亿级帧级别的视频‑图像对。根据 Runway 和 Stability AI 技术报告,其视频预训练数据规模达到数亿至数十亿视频帧。
- 数据清洗与标注:视频数据的质量筛选、场景切割、动作描述标注、美学评分等是重要但未标准化的上游环节,催生了专门的标注服务商与自动化标注工具。
-
基础模型与框架
- 图像编码器:CLIP(OpenAI)、SigLIP 等负责理解输入图像的语义,是条件生成的基础。
- 3D VAE:用于视频压缩至潜在空间的模型,是降低扩散计算量的关键。例如 Stability AI 开源的 SVD 所附带的 3D VAE(来源:Stability AI 官方 GitHub)。
- 训练框架:PyTorch 是绝对主流,DeepSpeed、Megatron‑LM 等分布式训练库支撑千卡以上的大规模训练。
上游环节的产能与成本数据多不公开。以训练一个百亿参数级视频模型为例,据行业推测,需要数百至数千块 H100 GPU 进行数周乃至数月训练,对应训练成本可高达数千万美元(来源:多家财经媒体推断,公开资料未见精确披露)。
下游
下游应用正处于从“尝鲜”到“工具化”的转化期,具体渗透情况如下:
-
影视与专业内容预制
- 功能:导演和视效团队利用图生视频快速生成分镜预览、场景动态模拟、特效原型,用于内部比稿与方案沟通,大幅缩短前期周期。
- 进展:好莱坞多家主要工作室已开始内测相关工具(据《Variety》2024 年 3 月报道),但尚未有制片方公开披露其预算中生成的视频占比。
-
广告与电商内容生产
- 功能:商家上传商品图,自动生成动态展示视频,替代部分棚拍和三维渲染工作。例如展示鞋子 360 度旋转、服饰飘动等。
- 落地实例:电商平台如 Shopify 集成了 AI 视频生成应用,万兴科技旗下的喵影工厂(Filmora)内置了“图生视频”功能,帮助商家生成营销短片(来源:万兴科技 2023 年年报,其中提及视频创意产品 AI 功能集成,但未单独披露该模块收入占比)。
-
社交媒体与 UGC 平台
- 功能:短视频平台将图生视频作为新型特效或模板,用户上传自己的照片生成创意短片。
- 落地实例:快手“可灵”模型自 2024 年 6 月发布后,已内嵌至快手 App 中,用户可直接在发布页使用;抖音系的“即梦”AI 也提供了图像生成视频的入口。社交媒体的裂变效应对 AP 流量需求拉动明显,但相关变现模式仍以广告和打赏为主,与生成模型直接收入关联度低(公开资料未见直接营收映射数据)。
-
游戏与交互娱乐
- 功能:生成 2D 或伪 3D 的动态背景、角色动画等,用于游戏原型和独立游戏开发。
- 进展:Unity、Unreal Engine 的开发者社区已有众多通过 API 接入生成动态资产的实验性工具,但距离主流商业游戏制作标准仍有差距。
-
教育与培训
- 功能:教师上传示意图、历史照片等,生成动态教学短片,提升学习沉浸感。
- 进展:仍处早期,多数为个别教师自发使用生成式工具,尚未形成独立软件品类或付费模式。
下游商业模式主流仍为按量计费的 API 或基于订阅的 SaaS。以 Runway 为例,其订阅计划按月收取固定费用,区分生成视频的数量与分辨率,反映了从早期免费探索向付费工具转型的行业趋势(来源:Runway 官网定价页,2025 年 1 月访问)。
受益公司
以下公司(含上市公司与非上市公司)因直接参与图生视频产业链而受到市场关注。列出仅反映其在产业链中的角色,不构成任何买卖建议或投资推荐。
算力基石 — 芯片与云
- 英伟达(NVIDIA, NASDAQ: NVDA):视频生成模型所需的大规模训练与推理集群几乎全部基于其 GPU 构建。2025 财年第二季度财报显示其数据中心收入达 263 亿美元(来源:英伟达 2024Q2 财报),生成式 AI 需求是核心驱动力,但公司未单独拆分视频生成工作量。云厂商如 Amazon(NASDAQ: AMZN)、Microsoft(NASDAQ: MSFT)、Alphabet(NASDAQ: GOOGL) 因提供 GPU 实例与 AI 平台服务而间接受益。
垂直模型与工具 — 非上市公司
- Runway:赛道开创者之一,2023 年 6 月完成 C 轮融资,估值约 15 亿美元(来源:TechCrunch 2023 年 6 月报道)。推出 Gen‑2、Gen‑3 Alpha 等产品,已形成相对成熟的商用 API 与自有应用生态。
- Pika Labs:由斯坦福博士生创立,2023 年 11 月获得 5500 万美元 A 轮融资(来源:Pika 官方博客及 Forbes 报道)。产品迭代速度快,以简洁的用户界面和较快生成速度著称,推出 Pika 2.0 后进一步提升了可控性。
- Stability AI:开源路线的旗手,2022 年 10 月完成 1.01 亿美元种子轮融资,估值曾达 10 亿美元(来源:Bloomberg 2022 年 10 月报道)。其开源的 Stable Video Diffusion(SVD)为大量二次开发、微调提供了基础模型,但商业模式和盈利能力公开资料未见明确好转。
- Luma AI:以图像到 3D 起步,2024 年 6 月发布视频生成模型 Dream Machine,因快速生成流畅视频引发关注。已完成 B 轮融资(金额约 4300 万美元,来源:Crunchbase),具体财务数据未公开。
生态嵌入与场景方 — 上市公司
- 快手(快手‑W,01024.HK):拥有海量短视频用户与内容,其“可灵”(Kling)视频生成模型自 2024 年 6 月发布以来已集成至快手 App,并在海外推出独立应用。2023 年全年总收入约 1135 亿元人民币(来源:快手 2023 年年报),目前 AI 生成视频的直接营收占比未单独披露,主要视为增强内容生态的工具。
- Adobe(NASDAQ: ADBE):积极将视频生成能力整合进 Premiere Pro、After Effects 等专业创作工具,并与第三方模型(如 Runway、Pika)合作提供插件。2024 财年数字媒体部门年收入约 160 亿美元(来源:Adobe 2024 财年财报),图生视频作为新功能的附加价值尚未单独量化。
- 万兴科技(300624.SZ):旗下视频创意软件 Filmora 集成了 AI 视频生成(含图生视频)能力。2023 年年报中表示持续投入 AI 技术研发,但未单独披露 AI 视频生成功能带来的增量收入(来源:万兴科技 2023 年年报)。
- 其他布局者:字节跳动推出“即梦”AI,腾讯发布混元视频生成大模型,均已进入测试或应用阶段,但因其均未独立上市或业务占比极小,财务影响尚不可见。
(注:以上公司与产品的关联均基于公开新闻、公司公告与产品页面,财务数字均标明年份与来源。未标注数字的段落表示公开资料未见精确数据。)
市场规模
图生视频作为一个仍在成形的细分市场,独立的市场规模数据极度匮乏。以下数据均来自第三方机构的整体视频生成 / 生成式 AI 媒体市场估算,且不同报告在定义、方法论与预测口径上差异较大,仅供理解量级参考。
- 2023 年整体生成式 AI 在媒体与娱乐市场:Grand View Research 于 2023 年 9 月发布的报告指出,2023 年全球生成式 AI 在媒体与娱乐领域的市场规模约为 12.4 亿美元,预计 2024–2030 年复合年增长率超过 30%(来源:Grand View Research, Generative AI In Media And Entertainment Market Report,2023)。
- AI 视频生成市场预测:根据 MarketsandMarkets 2024 年 1 月报告,2024 年全球 AI 视频生成市场交易规模约为 5.6 亿美元,预计到 2030 年将达到 21.2 亿美元,CAGR 约为 24.6%(来源:MarketsandMarkets, AI Video Generator Market 2024)。该研究覆盖了包括图生视频、文生视频在内的所有基于 AI 的视频合成工具。
- 更激进的长期展望:ABI Research 在 2023 年 6 月预测,到 2030 年,生成式 AI 视频创作市场规模将超过 100 亿美元(来源:ABI Research 新闻稿,2023 年 6 月)。但这一预测囊括了整个视频创作价值链中的 AI 贡献,远不止图生视频的 API 或订阅收入。
专门针对“图生视频”的市场规模:截至 2025 年初,公开资料未见任何一家权威机构发布仅聚焦“图生视频”的独立市场规模统计或预测。根据多家财报电话会与风投访谈的碎片信息,2024 全年全球主要图生视频 API 与订阅收入合计估计在 1–2 亿美元量级,且增速极快,但仍处于商业化早期。
与供给成本形成对比:2024 年生成 3 秒视频的单次推理硬件成本(在云端实例分摊后)估算仍有 0.01–0.03 美元(基于英伟达 H100 租赁价格与公开模型效率推测,公开资料未见精确成本披露)。高昂的成本是当前限制大规模产业化的关键经济壁垒。
玩家对比
以下对比基于各公司截至 2025 年第一季度公开的产品页面、技术报告与媒体报道。估值与融资数据标明年份与来源。
| 产品/模型 | 最大时长 | 典型分辨率/帧率 | 关键可控性 | 计费模式 | 开源情况 | 主要优势 | 局限 | 最新融资/估值(来源) |
|---|---|---|---|---|---|---|---|---|
| Runway Gen‑3 Alpha | 10 秒 | 720p–4K(超分), 24 fps | 运动笔刷、摄像机控制 | 订阅制($15–$95/月不等),也提供企业 API | 闭源 | 综合画质高、具备业界领先的帧间一致性,生态整合深 | 价格较高,对于轨迹精确控制仍较有限 | 2023 年 6 月 C 轮估值 15 亿美元(TechCrunch) |
| Pika 2.0 | 约 6 秒 | 1080p, 24 fps | 区域修改、表情控制,提供“Pikadditions”融合等创意功能 | 免费 + 订阅($10–$60/月) | 闭源 | 生成速度快、用户界面友好,社交媒体传播效应强 | 过 5–6 秒后复杂场景一致性略降 | 2023 年 11 月 A 轮融资 5500 万美元(Pika 官方) |
| Stable Video Diffusion 1.1 | 4–5 秒 | 576×1024, 24 fps(多尺寸) | 运动幅度通过参数调节,缺乏用户交互式控制 | 开源免费(需遵守非商业部分条款) | 开源 | 研究基准,社区微调版本多,可定制性强 | 原生可控性差,部署门槛高,需额外工程能力 | 母公司 Stability AI 2022 年 10 月种子轮融资 1.01 亿美元(Bloomberg) |
| Luma Dream Machine | 5 秒 | 最高 1360×752, 24 fps | 初版控制项少,后续引入关键帧扩展 | 免费时限量,订阅 $29.99/月起 | 闭源 | 最初发布以快速生成流畅视频引起轰动 | 分辨率偏低,高动态场景易出现细节崩溃 | B 轮约 4300 万美元(Crunchbase,2024 年) |
| 可灵 (快手) | 约 5–10 秒 | 1080p, 30 fps | 初期相对基础,后续增加运镜控制和幅度调整 | 国内版内置于快手 App,海外版提供订阅 | 闭源 | 依托快手海量视频数据训练,对复杂动作捕捉较好,与社交媒体场景天然融合 | 国际市场知名度不及 Runway/Pika,独立开发者 API 早期阶段 | 母公司快手公开上市(01024.HK);模型单独融资信息公开资料未见 |
| Google VideoPoet / Lumiere | – | 展示 5 秒左右片段 | 实验性,论文中展现文本与图像条件生成 | 尚未产品化 | 未开源完整模型 | 生成质量高,运动自然,技术报告引领方向 | 仅限研究演示,无公开可用产品 | 谷歌母公司 Alphabet(NASDAQ: GOOGL)内部项目 |
| OpenAI Sora | 演示 60 秒 | 1080p, 多种帧率 | 文本驱动图像合成视频,具备图像输入条件 | 2024 年 12 月向 ChatGPT Plus/Pro 用户开放 | 闭源 | 全视频生成能力极强,时长与一致性远超同期产品 | 高画质推理资源消耗巨大,商业定价高,可控性仍以文本为主 | 母公司 OpenAI 估值已超 800 亿美元(2024 年,WSJ);Sora 未单独融资 |
(注:产品参数会随更新变化,以上为 2025 年初截面数据。Sora 虽以文生视频为主,但其图生视频能力已通过官方演示证实,故一并列入对比。)
风险
图生视频的商业化应用面临技术、商业模式、合规和竞争四重典型风险。
1. 技术可靠性风险
- 长视频崩溃:当前模型普遍难以在超过 10 秒的生成中保持人物身份、物体几何与光照的一致性,突然的形变、变色、穿帮仍频繁出现。
- 物理真实性不足:模型常生成违反重力、碰撞、材质穿透等基本物理规律的画面,这在影视、工业级应用中构成绝对瓶颈。
- 算力与延迟:单次生成仍需要数十秒至数分钟,难以支撑实时互动式创作,且视频画质提高带来的计算成本呈非线性增长。
2. 商业模式风险
- 高推理成本:如前文所述,生成 3 秒视频的硬件成本可能超过 0.01 美元,使得低客单价场景难以盈利。
- 定价压力:开源模型(如 SVD)使得任何厂商都面临被免费替代的威胁,