AI 视频生成
3 秒看懂
AI 视频生成让计算机依据文本、图片或现有视频自动创建连续、逼真的视频片段。其核心是从海量视频数据中学习物体的运动规律、场景变化与光影逻辑,生成连贯的时空影像。近两年,基于扩散模型(Diffusion)与 Transformer 的架构推动生成视频的可控性、时长与一致性飞速提升,但距离工业化可靠的“全自动导演”仍有实质差距。
3 分钟产业解释
AI 视频生成正从实验室走向影视、营销、游戏、教育等应用场景。产业逻辑类似文本到图像,但视频多了一个“时间维度”,模型必须理解帧与帧之间的动态关系。当前主流技术路线分为三类:
扩散模型路线 :将图像扩散生成推广到时空,例如在潜空间对视频的时空 Patch 同时去噪。代表工作包括 Runway 的 Gen 系列、Pika、OpenAI Sora、Google Veo 和快手的可灵等。
自回归 Transformer 路线 :将视频视为时空 Token 序列,用类似语言模型的 Next-Token 预测方式逐帧或逐组生成,例如 VideoGPT 和 Phenaki 等早期探索。
掩码生成与混合路线 :部分模型采用掩码建模(Masked Video Modeling)或扩散与自回归结合的混合架构,意在兼顾长程一致性与生成效率。
产业关键瓶颈在于算力 与数据 。视频生成的运算量比单张图片高出数个数量级;高质量视频数据获取难、标注成本高,且版权风险日益突出。头部企业因此倾向于结合自有或授权数据进行训练,同时推出可控生成工具(如相机运动、物体交互),让用户以提示词或参考图进行精调。商业落地最先发生在广告素材、短视频辅助、影视预演、游戏资产和教育演示等中低风险场景;高端影视制作仍需导演、剪辑、合成和人工审查的共同参与。
技术原理
基础框架(扩散视频生成)
现代视频生成模型通常采用“时空压缩 + 条件扩散”的架构。首先,3D 变分自编码器(VAE)将原始视频像素压缩到低维潜空间,在空间和时间维度同时实现大幅度下采样(如空间 8×8、时间 4×~8×)。然后,扩散模型在该潜空间上训练,逐步去噪,并引入文本、图像等条件信号。最后,潜空间解码器将去噪后的潜变量逐帧或整段解码回像素视频。
输入:文本提示 + 噪声潜变量 z_t (shape: [B, C_lat, T_lat, H_lat, W_lat])
过程:逐步去噪,由扩散模型 ε_θ(z_t, t, c) 预测噪声
输出:去噪潜变量 z_0 -> 视频解码 -> (B, T, H_pix, W_pix, C)
骨干网络与注意力机制
时空解耦注意力 :先在各帧内部执行空间自注意力,再跨帧执行时间自注意力。计算效率较高,被多数产品级模型采用。
全 3D 自注意力(DiT 类) :直接对所有时空 Token 做全局注意力,表达力最强,但显存和计算量随序列长度平方增长。Sora 等技术报告显示其使用了 Diffusion Transformer(DiT)骨干,并在大规模潜空间上进行训练,能够生成较长时间的视频。
条件注入 :文本条件通常经 T5 或 CLIP 文本编码器得到向量或序列,通过交叉注意力层融入骨干网络。可额外加入图像先验(从首帧图像生成后续视频)、深度图、关键点、光流等结构化条件,实现更精细的控制。
训练与推理策略
噪声调度 :与图像扩散类似,训练时对潜变量添加不同程度的噪声,要求模型恢复原始信号。为处理长视频,常用渐进式训练(从短片段逐步扩展到长片段)或分段训练。
推理加速 :通常采用 DDIM 或 DPM-Solver 等快速采样器,结合模型蒸馏、潜一致性模型(LCM)或一步生成技术大幅减少采样步数。即使如此,在高端 GPU(如 A100/H100)上生成 10 秒级视频仍需要分钟级时间(依据产业实测估算,具体硬件与优化状态未完全披露)。
高分辨率策略 :级联生成(先生成低分辨率视频,再用空间超分模型放大)是平衡质量与成本的主流方式,部分模型通过潜空间直接生成高分辨率。
评估方法
自动指标包括 FVD(Fréchet Video Distance)、IS(Inception Score)视频版、CLIP 帧间一致性打分,以及近期提出的 VideoScore 等。但尚无单一指标能完美反映人类观感,因此仍高度依赖人工评估,重点关注单帧画质、时间一致性、运动自然度和提示词语义遵循度。
关键参数
以下参数基于 2024 年公开技术报告、产品文档和社区评测综合梳理,部分数值因厂商未全量披露而为估计范围。
生成时长 :主流闭源产品可稳定生成 4–60 秒,Sora 展示最长约 1 分钟,可灵等模型逐步开放至 2 分钟;开源模型通常在 2–16 秒范围内。
分辨率 :多数已支持 1080p(1920×1080),部分通过级联超分达到 4K;训练时常在较低分辨率(如 256×256)的潜空间上进行,输出时上采样。
帧率 :典型 24 fps 或 30 fps;训练时为了节省算力常使用 8–12 fps,再通过帧插值网络提升至目标帧率。
时间一致性 :常用 FVD 衡量生成视频与真实视频分布的距离,数值越低越好。2024 年顶级模型在 UCF-101、Kinetics-600 等基准上的 FVD 已降至 100–300 区间,但不同评估设置差异大,横向比较需谨慎。
推理延迟 :生成 1 秒视频所需的时间高度依赖硬件与优化。在 A100/H100 上,5 秒 1080p 视频通常需要 1–5 分钟;部分产品(如 MiniMax 海螺)通过工程优化可将 6 秒生成压缩到 30 秒以内,但公开资料未见统一的标准化延迟指标。
模型参数量与训练算力 :未充分披露。据推算,产品级视频生成模型参数量在数十亿至数百亿量级,训练所需 GPU 小时动辄数十万至数百万(A100 等效),单次训练成本可能达数千万美元。
可控性精度 :指令遵循度尚无通用标准化指标。通常以人工评分衡量对相机运动、物体交互和文本描述的执行准确率。
API 价格(2024 年末) :Runway Gen-3 Alpha Turbo 约 0.5–1.0 美元/秒等效视频;可灵国际版提供包月套餐和按量计费,公开资料未见统一口径;开源模型部署成本仅含推理算力,但自托管门槛高。
技术路线
下表基于业界公开信息进行定性对比,避免硬规格臆测。
维度 扩散模型为主(Sora/Veo/可灵) 自回归 Transformer 掩码/混合模型 基于 GAN 的方法 架构 潜视频扩散 + DiT/时空 UNet VQ-VAE + 长程 Transformer 掩码时空建模 + 轻量解码器 3D 卷积生成器+判别器 视频时长 可达数十秒至两分钟 可达数十秒,长程漂移明显 数十秒,一致性优于自回归 几秒,运动简单 画质/一致性 高画质,时空一致性较好 细节易模糊,长程漂移 画质良好,闪烁较少 闪烁、伪影显著 计算需求 极大,万卡级集群训练 大,自回归解码慢 较扩散略低,解码快 较低,但效果差 可控性 文本、图像、结构条件精细控制 文本条件为主 可加入条件,但方法不如扩散成熟 难精细控制 发展阶段 主力路线,产品化迅速(2024) 研究活跃,但产品化落后 新兴方向,学术探索中 较少使用
此外,围绕“世界模型”的思路逐渐兴起,即在视频生成的同时学习物理状态、动作后果的隐式表示,但尚处早期研究阶段,未推出现实产品。
上游
算力基础设施 :
GPU/TPU 大规模集群(万卡级),高速互联(InfiniBand/RoCE)。训练和推理对显存带宽需求极大,直接拉动 HBM(高带宽内存)和先进封装(如 2.5D/3D 封装)需求。
服务器、光模块、液冷系统等硬件,因视频生成对集群稳定性、散热效率要求极高而受益。
数据供给 :
高质量视频素材库(影视作品、短视频平台内容、自采数据),需经剪辑、清洗、去重和版权审核。
合成数据逐步成为补充,通过 3D 引擎或游戏引擎生成带精确深度、光流和动作标注的视频。
数据标注服务:动作描述、物体分割、深度估计、场景图构建等。
训练框架与中间件 :
PyTorch、JAX、Megatron-LM、DeepSpeed 等分布式训练框架;
用于视频编解码、帧提取和潜空间处理的专用库。
版权合规服务 :
授权视频平台(如 Shutterstock、Getty Images 等)与模型商合作提供合规训练数据;
版权链追溯与内容识别技术,防止模型输出侵权内容。
下游
创意与生产力工具 :视频生成嵌入剪辑软件(Adobe Premiere Pro 集成 Runway、剪映/CapCut 上线 AI 视频功能),辅助短视频创作、广告生成、电影预演(Previs)。
游戏与虚拟世界 :自动生成过场动画、NPC 对话背景、虚拟场景漫游视频,加速关卡原型制作。
教育与仿真 :生成教学演示视频、医学动画、自动驾驶仿真场景合成;企业培训中的角色演练。
社交与内容平台 :为创作者提供一键生成特效、动态壁纸和二次创作工具,降低内容生产门槛。
API 与云服务 :Runway、Pika、Google Vertex AI、快手等提供视频生成 API,允许第三方应用集成。
受益公司
以下仅基于公开资料客观描述产业链参与者的业务关联,不构成任何形式的投资建议或推荐。
算力硬件供应商 :NVIDIA(A100/H100/B200 等 GPU,数据中心业务显著受益于生成式视频负载)、AMD、Intel,以及 HBM 供应商 SK 海力士、三星等。
云基础设施厂商 :AWS、微软 Azure、Google Cloud(提供 AI 训练与推理实例,并托管视频生成 API);CoreWeave、Lambda Labs 等专业 GPU 云服务商。
模型与平台公司 :OpenAI(Sora)、Runway(Gen 系列)、Google DeepMind(Veo)、快手(可灵)、MiniMax(海螺 AI)、字节跳动(豆包视频模型)、Stability AI(Stable Video Diffusion)、智谱 AI(CogVideo)。
创意软件与工具 :Adobe(Firefly 视频模型集成至 Premiere Pro)、剪映/CapCut(字节系,内嵌视频生成)、Canva(集成 AI 视频)。
数据与版权合作伙伴 :Shutterstock(与 OpenAI 等签署训练数据授权)、Getty Images 等,因视频生成对合规数据需求大而拓展业务边界。
下游应用领域公司 :影视制作方、游戏开发商、广告代理及社交媒体平台,虽不直接研发模型,但通过使用上述工具降低制作成本、提升效率,间接受益。
市场规模
受限于 AI 视频生成细分市场尚处萌芽期,不同机构的统计口径与预测范围差异较大。综合多家第三方研究机构 2024 年发布的数据,整理如下(均标注年份、口径与来源):
Fortune Business Insights(2024 年 9 月报告) :2023 年全球 AI 视频生成市场规模约 4.3 亿美元,预计 2030 年将增至 25.6 亿美元,2024–2030 年复合年增长率(CAGR)约 29.1%。口径为 AI 视频生成软件、平台与直接相关服务的总营收。
Market.us(2024 年 6 月报告) :2023 年全球 AI 视频生成器市场约 5.4 亿美元,预计 2033 年达 25.4 亿美元,2024–2033 年 CAGR 约 16.7%。口径聚焦于面向终端用户的 AI 视频生成器产品与订阅服务,不含底层基础设施。
Grand View Research(2024 年生成式 AI 媒体与娱乐市场报告) :未单独拆出“视频生成”子类,但其统计的生成式 AI 在媒体与娱乐领域整体规模 2023 年约 14.9 亿美元,视频生成为其中增速最快的应用之一。
总体来看,尽管具体数值存在差异,市场对 AI 视频生成的高增长预期较为一致,但真正兑现还需技术成熟与商业化落地共同推进。
玩家对比
下述比较基于截至 2025 年 4 月的公开产品状态、技术报告与社区评测,未公开信息标注“未披露”。
产品/模型 开发商 核心架构 最大生成时长 最高分辨率 API/产品状态 特色功能/备注 Sora OpenAI DiT + 潜视频扩散 最长 1 分钟(演示) 1080p 2024 年末起对部分付费用户开放;API 未完全开放 多镜头切换、物理交互尝试;公开发布进度缓慢 Gen-3 Alpha Runway 扩散(未完全公开) 10 秒+ 1080p Web 应用及 API 已开放 专业创作工具,支持相机运动、图像/视频引导 Veo Google DeepMind 潜在扩散 Transformer 超过 60 秒(展示) 1080p 2024 年 12 月起通过 Vertex AI 预览 强调长视频一致性与电影级运镜 可灵 (Kling) 快手 类 DiT 架构 逐步开放至约 2 分钟 1080p 国际版应用与 API 已上线 真实风格强,运动笔刷等交互控制 海螺 AI 视频 MiniMax 未公开 6 秒 1080p 免费+付费产品,API 有限开放 生成速度较快,社区活跃 SVD (Stable Video Diffusion) Stability AI 潜扩散 + 时空 UNet 4 秒(图像到视频) 1024×576 开源权重,可本地部署 可微调,适合图像转视频应用 Open-Sora 开源社区 类 Sora DiT 最长 16 秒 512×512(部分版本) 完整开源 训练成本与门槛显著降低,推动复现研究 CogVideoX 智谱 AI / 清华 扩散 Transformer 6 秒 720×480 开源权重 支持文本到视频,中英文提示词
注:性能指标依赖提示词质量与硬件,上表仅作定性参考,不构成优劣推荐。
风险
技术风险 :长时间视频生成仍存在物体漂移、形变和物理逻辑错误;模型对复杂因果关系理解有限,无法保证输出内容的真实性。
算力与成本风险 :训练与推理成本高企,API 定价在短期内难以覆盖高端算力开销,部分企业或面临资金压力;开源模型的兴起可能进一步压缩商业产品的溢价空间。
版权与法律风险 :训练数据涉及大量受版权保护的视频,面临类似图像生成领域的侵权诉讼(如《纽约时报》诉 OpenAI 案,视频模型可能成为下一个焦点)。生成内容若包含可识别的商标、人物或作品元素,可能引发纠纷。
深度伪造与伦理风险 :AI 视频生成极易被滥用制造虚假新闻、政治宣传、色情等内容。各国监管趋势收紧(例如欧盟 AI 法案、中国深度合成管理规定),可能带来合规成本或强制技术限制。
商业化不及预期风险 :下游需求虽旺盛,但若生成质量长期无法突破“辅助工具”定位,难以打开大型影视、广告直接成片的预算,市场增速可能低于预期。
竞争与路线收敛风险 :主流技术路线集中在扩散模型,但若出现颠覆性架构(如高效非扩散时序模型),现有参与者积累的优势可能被迅速削弱。
误读纠偏
“Sora 能真正理解物理世界” :Sora 生成的视频看似符合物理规律,但时常出现物体穿透、方向突变、重力异常等错误。其本质是基于统计关联的生成,并不具备物理定律理解和因果推理能力,不能替代物理仿真引擎。
“AI 视频只是图像生成的简单拼合” :仅逐帧生成图像会导致严重闪烁与不一致。视频生成需要显式的时间建模和跨帧联合优化,在架构、训练和评估上复杂度远超图像生成。
“参数越多,视频质量越高” :盲目堆参数而不改进时空注意力效率、压缩策略和训练数据质量,往往导致成本不可承受,而长程一致性未必线性提升。架构创新和数据处理同等重要。
“AI 即将取代影视制作” :当前 AI 视频在精确可控性、角色一致性、复杂叙事和情感表达方面远弱于成熟 CG 与实拍。中期内,AI 更可能是提高预演、素材和后期效率的辅助工具,非完整替代。
“开源模型能完全平替商业产品” :开源视频模型虽然降低了使用门槛,但在训练数据规模、工程优化、API 易用性和算力资源方面仍难比肩头部闭源产品。高质量的定制与稳定 API 仍需商业支持。
“AI 视频生成不涉及音频” :目前主攻画面,但不少产品开始整合音频生成(如背景音、音效),未来视频+音频联合生成是趋势,但当前音频质量仍有限。
“只要数据量够大就能自动涌现出可控性” :可控性需要精心设计的条件注入机制(如 ControlNet 类网络)、结构化标注数据和针对性的微调策略,纯无监督大数据训练很难自然产生精准的镜头运动和对象交互控制。
最新事件
梳理自 2024 年起至 2025 年 4 月的关键进展(按时间倒序排列):
2025 年 4 月 :Runway 推出 Gen-4 系列模型(具体能力未完全公开),进一步强化时间一致性与交互控制。
2025 年 2–3 月 :OpenAI 向更多地区 ChatGPT Plus/Pro 用户开放 Sora 有限访问,但高并发导致排队;同期快手可灵发布 1.6 版本,支持最长 2 分钟视频生成并强化画质。
2024 年 12 月 :Google 通过 Vertex AI 开放 Veo 预览;MiniMax 海螺 AI 视频全球用户过亿,成为消费侧黑马;Adobe Firefly 视频模型开始内测并集成至 Premiere Pro。
2024 年 10 月 :Adobe MAX 大会发布 Firefly Video Model 预览,主打商用安全、版权友好视频生成。
2024 年 7–9 月 :Runway Gen-3 Alpha 上线,加入相机运动控制;可灵国际版上线,成为中国首款大规模海外开放的视频生成产品;Stability AI 发布 SVD 1.1,提升图像到视频质量。
2024 年 6 月 :快手发布可灵(Kling),率先支持最长 2 分钟生成能力预告,引爆中文互联网。
2024 年 5 月 :Google I/O 发布 Veo,演示多段 60 秒+高质量视频;同期 MiniMax 推出海螺 AI 视频生成。
2024 年 2 月 :OpenAI 发布 Sora 技术报告及演示视频,展示一分钟级、多镜头切换能力,引发“世界模拟器”广泛讨论。
2024 年 8 月 :欧盟《人工智能法案》(AI Act)正式生效,对生成式 AI 系统施加透明度和内容标识要求,AI 视频产品的合规成本上升。
跟踪指标
持续观察以下维度,可帮助判断 AI 视频生成的产业成熟度与竞争力走向。
生成质量
FVD、帧间 CLIP 得分、VideoScore 等在公认基准(如 Kinetics-600、MSR-VTT)上的刷新情况。
主观评审赛事(如 AI 视频竞赛)中的排名与用户偏好票数。
能力边界
头部模型公开的最大生成时长、原生分辨率、帧率。
对复杂提示词(含多物体、精确动作、空间关系)的遵循率。
角色与物体在长视频中的 ID 保持率。
推理效率与成本
主流 API 每生成 1 分钟 1080p 视频的端到端成本(美元),及同比降幅。
从提交请求到返回结果的端到端延迟(秒),P50/P95 分位数。
开源模型在消费级硬件(如 RTX 4090)上的单秒推理耗时。
商业化指标
头部 API/SaaS 平台公布的年化营收、付费客户数、生成视频总秒数。
广告、影视、游戏等垂直行业中 AI 视频生成渗透率调研。
生态与合规
训练数据版权诉讼案件的判决或和解动态。
各国针对深度伪造、AI 生成内容标识的新立法或标准。
开放源代码仓库的 Star 数、贡献者数量及模型下载量。
基础设施
GPU/TPU 最新代际对视频生成模型的推理加速比(如 H100 vs B200)。
万卡级别视频生成训练集群的公开部署情况与功耗数据。
信源
(以下信源覆盖核心技术报告、市场研究及主要产品,部分为长期跟踪积累,具体数据请以原始出处为准)
OpenAI, “Video generation models as world simulators,” Feb 2024.
Runway, Gen-2/Gen-3 Alpha/Gen-4 官方博客及产品文档.
Google DeepMind, “Veo: a generative video model,” May 2024.
快手可灵 (Kling) 技术报告,2024 年.
MiniMax,海螺 AI 视频产品公开材料.
Stability AI, “Stable Video Diffusion,” Nov 2023.
开源项目:Open-Sora, CogVideoX, ModelScopeT2V.
Fortune Business Insights, “AI Video Generator Market Size, Share & COVID-19 Impact Analysis…”, Sep 2024.
Market.us, “AI Video Generator Market Report,” Jun 2024.
Grand View Research, “Generative AI In Media & Entertainment Market Size Report,” 2024.
欧盟《人工智能法案》(EU AI Act),2024 年 8 月生效.
Adobe, “Firefly Video Model Preview,” Oct 2024.
Papers with Code, “Video Generation” 任务及排行榜.
source: 公开披露与公开资料整理
本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。