应用层 开放阅读

AI 视频生成

AI Video Generation

AI 视频生成用扩散或 Transformer 架构从文本、图像或视频条件生成动态画面,正在进入创意工具、广告、游戏和仿真场景。

概念 ID
ai-video-generation
更新时间
2026-05-29
来源数量
待补
Compassing AI 上下文 比较 Sora、Runway、Veo、可灵和开源视频模型。
4.3亿美元
FBI 2023
Fortune Business Insights 2024-09 口径
AI 视频生成 MDX · 2026-05-29
25.6亿美元
FBI 2030E
同报告预测
AI 视频生成 MDX · 2026-05-29
29.1%
CAGR
2024-2030 复合增速
AI 视频生成 MDX · 2026-05-29
产业信号
  • 2024 年起头部模型集中开放预览或产品化,视频生成从演示走向 API 和创意工具。
  • 版权合作伙伴和内容标识要求成为模型商业化的重要配套。
口径风险
  • 长视频仍有漂移、形变和物理逻辑错误,不能替代物理仿真。
  • 市场统计口径差异大,软件、平台、基础设施是否纳入会显著影响规模数字。

AI 视频生成在产业链哪一环?

AI 视频生成 MDX · 2026-05-29
应用层 / 生成式媒体工具

MDX 将其下游定义为创意与生产力工具、游戏、教育仿真、社交内容平台和 API 云服务。

上游依赖
  • GPU/HBM 和云训练推理集群
  • 授权视频数据与合成数据
  • PyTorch、JAX、DeepSpeed 等训练框架
下游承接
  • 剪辑软件、广告和电影预演
  • 游戏、教育和仿真
  • 社交内容平台和 API 服务

相关公司

MDX 提及的产业参与者
  • OpenAI Sora
  • Runway Gen 系列
  • Google DeepMind Veo
  • Kuaishou 可灵
  • MiniMax 海螺 AI
  • Adobe Firefly Video / Premiere Pro

产品/模型路线怎么观察?

AI 视频生成 MDX · 2026-05-29

闭源平台模型

Sora、Veo、Runway、可灵等通过 Web 或 API 开放能力。

高质量生成和商业 API

开源权重路线

SVD、Open-Sora、CogVideoX 等降低复现和微调门槛。

研究、私有化和垂直微调

创意软件集成

Firefly、CapCut、Canva 等把视频生成嵌入既有创作工具。

工作流内采用和订阅变现

相邻概念链

便于横向跳转

来源台账

数字与判断口径
来源类型截至
AI 视频生成 MDX mdx 2026-05-29
source: concept-rich schema · as_of 2026-05-29 富区块仅用于产业链学习、信息检索和研究辅助;不构成投资建议。

AI 视频生成

3 秒看懂

AI 视频生成让计算机依据文本、图片或现有视频自动创建连续、逼真的视频片段。其核心是从海量视频数据中学习物体的运动规律、场景变化与光影逻辑,生成连贯的时空影像。近两年,基于扩散模型(Diffusion)与 Transformer 的架构推动生成视频的可控性、时长与一致性飞速提升,但距离工业化可靠的“全自动导演”仍有实质差距。

3 分钟产业解释

AI 视频生成正从实验室走向影视、营销、游戏、教育等应用场景。产业逻辑类似文本到图像,但视频多了一个“时间维度”,模型必须理解帧与帧之间的动态关系。当前主流技术路线分为三类:

  • 扩散模型路线:将图像扩散生成推广到时空,例如在潜空间对视频的时空 Patch 同时去噪。代表工作包括 Runway 的 Gen 系列、Pika、OpenAI Sora、Google Veo 和快手的可灵等。
  • 自回归 Transformer 路线:将视频视为时空 Token 序列,用类似语言模型的 Next-Token 预测方式逐帧或逐组生成,例如 VideoGPT 和 Phenaki 等早期探索。
  • 掩码生成与混合路线:部分模型采用掩码建模(Masked Video Modeling)或扩散与自回归结合的混合架构,意在兼顾长程一致性与生成效率。

产业关键瓶颈在于算力数据。视频生成的运算量比单张图片高出数个数量级;高质量视频数据获取难、标注成本高,且版权风险日益突出。头部企业因此倾向于结合自有或授权数据进行训练,同时推出可控生成工具(如相机运动、物体交互),让用户以提示词或参考图进行精调。商业落地最先发生在广告素材、短视频辅助、影视预演、游戏资产和教育演示等中低风险场景;高端影视制作仍需导演、剪辑、合成和人工审查的共同参与。

技术原理

基础框架(扩散视频生成)
现代视频生成模型通常采用“时空压缩 + 条件扩散”的架构。首先,3D 变分自编码器(VAE)将原始视频像素压缩到低维潜空间,在空间和时间维度同时实现大幅度下采样(如空间 8×8、时间 4×~8×)。然后,扩散模型在该潜空间上训练,逐步去噪,并引入文本、图像等条件信号。最后,潜空间解码器将去噪后的潜变量逐帧或整段解码回像素视频。

输入:文本提示 + 噪声潜变量 z_t (shape: [B, C_lat, T_lat, H_lat, W_lat])
过程:逐步去噪,由扩散模型 ε_θ(z_t, t, c) 预测噪声
输出:去噪潜变量 z_0 -> 视频解码 -> (B, T, H_pix, W_pix, C)

骨干网络与注意力机制

  • 时空解耦注意力:先在各帧内部执行空间自注意力,再跨帧执行时间自注意力。计算效率较高,被多数产品级模型采用。
  • 全 3D 自注意力(DiT 类):直接对所有时空 Token 做全局注意力,表达力最强,但显存和计算量随序列长度平方增长。Sora 等技术报告显示其使用了 Diffusion Transformer(DiT)骨干,并在大规模潜空间上进行训练,能够生成较长时间的视频。
  • 条件注入:文本条件通常经 T5 或 CLIP 文本编码器得到向量或序列,通过交叉注意力层融入骨干网络。可额外加入图像先验(从首帧图像生成后续视频)、深度图、关键点、光流等结构化条件,实现更精细的控制。

训练与推理策略

  • 噪声调度:与图像扩散类似,训练时对潜变量添加不同程度的噪声,要求模型恢复原始信号。为处理长视频,常用渐进式训练(从短片段逐步扩展到长片段)或分段训练。
  • 推理加速:通常采用 DDIM 或 DPM-Solver 等快速采样器,结合模型蒸馏、潜一致性模型(LCM)或一步生成技术大幅减少采样步数。即使如此,在高端 GPU(如 A100/H100)上生成 10 秒级视频仍需要分钟级时间(依据产业实测估算,具体硬件与优化状态未完全披露)。
  • 高分辨率策略:级联生成(先生成低分辨率视频,再用空间超分模型放大)是平衡质量与成本的主流方式,部分模型通过潜空间直接生成高分辨率。

评估方法
自动指标包括 FVD(Fréchet Video Distance)、IS(Inception Score)视频版、CLIP 帧间一致性打分,以及近期提出的 VideoScore 等。但尚无单一指标能完美反映人类观感,因此仍高度依赖人工评估,重点关注单帧画质、时间一致性、运动自然度和提示词语义遵循度。

关键参数

以下参数基于 2024 年公开技术报告、产品文档和社区评测综合梳理,部分数值因厂商未全量披露而为估计范围。

  • 生成时长:主流闭源产品可稳定生成 4–60 秒,Sora 展示最长约 1 分钟,可灵等模型逐步开放至 2 分钟;开源模型通常在 2–16 秒范围内。
  • 分辨率:多数已支持 1080p(1920×1080),部分通过级联超分达到 4K;训练时常在较低分辨率(如 256×256)的潜空间上进行,输出时上采样。
  • 帧率:典型 24 fps 或 30 fps;训练时为了节省算力常使用 8–12 fps,再通过帧插值网络提升至目标帧率。
  • 时间一致性:常用 FVD 衡量生成视频与真实视频分布的距离,数值越低越好。2024 年顶级模型在 UCF-101、Kinetics-600 等基准上的 FVD 已降至 100–300 区间,但不同评估设置差异大,横向比较需谨慎。
  • 推理延迟:生成 1 秒视频所需的时间高度依赖硬件与优化。在 A100/H100 上,5 秒 1080p 视频通常需要 1–5 分钟;部分产品(如 MiniMax 海螺)通过工程优化可将 6 秒生成压缩到 30 秒以内,但公开资料未见统一的标准化延迟指标。
  • 模型参数量与训练算力:未充分披露。据推算,产品级视频生成模型参数量在数十亿至数百亿量级,训练所需 GPU 小时动辄数十万至数百万(A100 等效),单次训练成本可能达数千万美元。
  • 可控性精度:指令遵循度尚无通用标准化指标。通常以人工评分衡量对相机运动、物体交互和文本描述的执行准确率。
  • API 价格(2024 年末):Runway Gen-3 Alpha Turbo 约 0.5–1.0 美元/秒等效视频;可灵国际版提供包月套餐和按量计费,公开资料未见统一口径;开源模型部署成本仅含推理算力,但自托管门槛高。

技术路线

下表基于业界公开信息进行定性对比,避免硬规格臆测。

维度扩散模型为主(Sora/Veo/可灵)自回归 Transformer掩码/混合模型基于 GAN 的方法
架构潜视频扩散 + DiT/时空 UNetVQ-VAE + 长程 Transformer掩码时空建模 + 轻量解码器3D 卷积生成器+判别器
视频时长可达数十秒至两分钟可达数十秒,长程漂移明显数十秒,一致性优于自回归几秒,运动简单
画质/一致性高画质,时空一致性较好细节易模糊,长程漂移画质良好,闪烁较少闪烁、伪影显著
计算需求极大,万卡级集群训练大,自回归解码慢较扩散略低,解码快较低,但效果差
可控性文本、图像、结构条件精细控制文本条件为主可加入条件,但方法不如扩散成熟难精细控制
发展阶段主力路线,产品化迅速(2024)研究活跃,但产品化落后新兴方向,学术探索中较少使用

此外,围绕“世界模型”的思路逐渐兴起,即在视频生成的同时学习物理状态、动作后果的隐式表示,但尚处早期研究阶段,未推出现实产品。

上游

  • 算力基础设施
    • GPU/TPU 大规模集群(万卡级),高速互联(InfiniBand/RoCE)。训练和推理对显存带宽需求极大,直接拉动 HBM(高带宽内存)和先进封装(如 2.5D/3D 封装)需求。
    • 服务器、光模块、液冷系统等硬件,因视频生成对集群稳定性、散热效率要求极高而受益。
  • 数据供给
    • 高质量视频素材库(影视作品、短视频平台内容、自采数据),需经剪辑、清洗、去重和版权审核。
    • 合成数据逐步成为补充,通过 3D 引擎或游戏引擎生成带精确深度、光流和动作标注的视频。
    • 数据标注服务:动作描述、物体分割、深度估计、场景图构建等。
  • 训练框架与中间件
    • PyTorch、JAX、Megatron-LM、DeepSpeed 等分布式训练框架;
    • 用于视频编解码、帧提取和潜空间处理的专用库。
  • 版权合规服务
    • 授权视频平台(如 Shutterstock、Getty Images 等)与模型商合作提供合规训练数据;
    • 版权链追溯与内容识别技术,防止模型输出侵权内容。

下游

  • 创意与生产力工具:视频生成嵌入剪辑软件(Adobe Premiere Pro 集成 Runway、剪映/CapCut 上线 AI 视频功能),辅助短视频创作、广告生成、电影预演(Previs)。
  • 游戏与虚拟世界:自动生成过场动画、NPC 对话背景、虚拟场景漫游视频,加速关卡原型制作。
  • 教育与仿真:生成教学演示视频、医学动画、自动驾驶仿真场景合成;企业培训中的角色演练。
  • 社交与内容平台:为创作者提供一键生成特效、动态壁纸和二次创作工具,降低内容生产门槛。
  • API 与云服务:Runway、Pika、Google Vertex AI、快手等提供视频生成 API,允许第三方应用集成。

受益公司

以下仅基于公开资料客观描述产业链参与者的业务关联,不构成任何形式的投资建议或推荐。

  • 算力硬件供应商:NVIDIA(A100/H100/B200 等 GPU,数据中心业务显著受益于生成式视频负载)、AMD、Intel,以及 HBM 供应商 SK 海力士、三星等。
  • 云基础设施厂商:AWS、微软 Azure、Google Cloud(提供 AI 训练与推理实例,并托管视频生成 API);CoreWeave、Lambda Labs 等专业 GPU 云服务商。
  • 模型与平台公司:OpenAI(Sora)、Runway(Gen 系列)、Google DeepMind(Veo)、快手(可灵)、MiniMax(海螺 AI)、字节跳动(豆包视频模型)、Stability AI(Stable Video Diffusion)、智谱 AI(CogVideo)。
  • 创意软件与工具:Adobe(Firefly 视频模型集成至 Premiere Pro)、剪映/CapCut(字节系,内嵌视频生成)、Canva(集成 AI 视频)。
  • 数据与版权合作伙伴:Shutterstock(与 OpenAI 等签署训练数据授权)、Getty Images 等,因视频生成对合规数据需求大而拓展业务边界。
  • 下游应用领域公司:影视制作方、游戏开发商、广告代理及社交媒体平台,虽不直接研发模型,但通过使用上述工具降低制作成本、提升效率,间接受益。

市场规模

受限于 AI 视频生成细分市场尚处萌芽期,不同机构的统计口径与预测范围差异较大。综合多家第三方研究机构 2024 年发布的数据,整理如下(均标注年份、口径与来源):

  • Fortune Business Insights(2024 年 9 月报告):2023 年全球 AI 视频生成市场规模约 4.3 亿美元,预计 2030 年将增至 25.6 亿美元,2024–2030 年复合年增长率(CAGR)约 29.1%。口径为 AI 视频生成软件、平台与直接相关服务的总营收。
  • Market.us(2024 年 6 月报告):2023 年全球 AI 视频生成器市场约 5.4 亿美元,预计 2033 年达 25.4 亿美元,2024–2033 年 CAGR 约 16.7%。口径聚焦于面向终端用户的 AI 视频生成器产品与订阅服务,不含底层基础设施。
  • Grand View Research(2024 年生成式 AI 媒体与娱乐市场报告):未单独拆出“视频生成”子类,但其统计的生成式 AI 在媒体与娱乐领域整体规模 2023 年约 14.9 亿美元,视频生成为其中增速最快的应用之一。

总体来看,尽管具体数值存在差异,市场对 AI 视频生成的高增长预期较为一致,但真正兑现还需技术成熟与商业化落地共同推进。

玩家对比

下述比较基于截至 2025 年 4 月的公开产品状态、技术报告与社区评测,未公开信息标注“未披露”。

产品/模型开发商核心架构最大生成时长最高分辨率API/产品状态特色功能/备注
SoraOpenAIDiT + 潜视频扩散最长 1 分钟(演示)1080p2024 年末起对部分付费用户开放;API 未完全开放多镜头切换、物理交互尝试;公开发布进度缓慢
Gen-3 AlphaRunway扩散(未完全公开)10 秒+1080pWeb 应用及 API 已开放专业创作工具,支持相机运动、图像/视频引导
VeoGoogle DeepMind潜在扩散 Transformer超过 60 秒(展示)1080p2024 年 12 月起通过 Vertex AI 预览强调长视频一致性与电影级运镜
可灵 (Kling)快手类 DiT 架构逐步开放至约 2 分钟1080p国际版应用与 API 已上线真实风格强,运动笔刷等交互控制
海螺 AI 视频MiniMax未公开6 秒1080p免费+付费产品,API 有限开放生成速度较快,社区活跃
SVD (Stable Video Diffusion)Stability AI潜扩散 + 时空 UNet4 秒(图像到视频)1024×576开源权重,可本地部署可微调,适合图像转视频应用
Open-Sora开源社区类 Sora DiT最长 16 秒512×512(部分版本)完整开源训练成本与门槛显著降低,推动复现研究
CogVideoX智谱 AI / 清华扩散 Transformer6 秒720×480开源权重支持文本到视频,中英文提示词

注:性能指标依赖提示词质量与硬件,上表仅作定性参考,不构成优劣推荐。

风险

  • 技术风险:长时间视频生成仍存在物体漂移、形变和物理逻辑错误;模型对复杂因果关系理解有限,无法保证输出内容的真实性。
  • 算力与成本风险:训练与推理成本高企,API 定价在短期内难以覆盖高端算力开销,部分企业或面临资金压力;开源模型的兴起可能进一步压缩商业产品的溢价空间。
  • 版权与法律风险:训练数据涉及大量受版权保护的视频,面临类似图像生成领域的侵权诉讼(如《纽约时报》诉 OpenAI 案,视频模型可能成为下一个焦点)。生成内容若包含可识别的商标、人物或作品元素,可能引发纠纷。
  • 深度伪造与伦理风险:AI 视频生成极易被滥用制造虚假新闻、政治宣传、色情等内容。各国监管趋势收紧(例如欧盟 AI 法案、中国深度合成管理规定),可能带来合规成本或强制技术限制。
  • 商业化不及预期风险:下游需求虽旺盛,但若生成质量长期无法突破“辅助工具”定位,难以打开大型影视、广告直接成片的预算,市场增速可能低于预期。
  • 竞争与路线收敛风险:主流技术路线集中在扩散模型,但若出现颠覆性架构(如高效非扩散时序模型),现有参与者积累的优势可能被迅速削弱。

误读纠偏

  1. “Sora 能真正理解物理世界”:Sora 生成的视频看似符合物理规律,但时常出现物体穿透、方向突变、重力异常等错误。其本质是基于统计关联的生成,并不具备物理定律理解和因果推理能力,不能替代物理仿真引擎。
  2. “AI 视频只是图像生成的简单拼合”:仅逐帧生成图像会导致严重闪烁与不一致。视频生成需要显式的时间建模和跨帧联合优化,在架构、训练和评估上复杂度远超图像生成。
  3. “参数越多,视频质量越高”:盲目堆参数而不改进时空注意力效率、压缩策略和训练数据质量,往往导致成本不可承受,而长程一致性未必线性提升。架构创新和数据处理同等重要。
  4. “AI 即将取代影视制作”:当前 AI 视频在精确可控性、角色一致性、复杂叙事和情感表达方面远弱于成熟 CG 与实拍。中期内,AI 更可能是提高预演、素材和后期效率的辅助工具,非完整替代。
  5. “开源模型能完全平替商业产品”:开源视频模型虽然降低了使用门槛,但在训练数据规模、工程优化、API 易用性和算力资源方面仍难比肩头部闭源产品。高质量的定制与稳定 API 仍需商业支持。
  6. “AI 视频生成不涉及音频”:目前主攻画面,但不少产品开始整合音频生成(如背景音、音效),未来视频+音频联合生成是趋势,但当前音频质量仍有限。
  7. “只要数据量够大就能自动涌现出可控性”:可控性需要精心设计的条件注入机制(如 ControlNet 类网络)、结构化标注数据和针对性的微调策略,纯无监督大数据训练很难自然产生精准的镜头运动和对象交互控制。

最新事件

梳理自 2024 年起至 2025 年 4 月的关键进展(按时间倒序排列):

  • 2025 年 4 月:Runway 推出 Gen-4 系列模型(具体能力未完全公开),进一步强化时间一致性与交互控制。
  • 2025 年 2–3 月:OpenAI 向更多地区 ChatGPT Plus/Pro 用户开放 Sora 有限访问,但高并发导致排队;同期快手可灵发布 1.6 版本,支持最长 2 分钟视频生成并强化画质。
  • 2024 年 12 月:Google 通过 Vertex AI 开放 Veo 预览;MiniMax 海螺 AI 视频全球用户过亿,成为消费侧黑马;Adobe Firefly 视频模型开始内测并集成至 Premiere Pro。
  • 2024 年 10 月:Adobe MAX 大会发布 Firefly Video Model 预览,主打商用安全、版权友好视频生成。
  • 2024 年 7–9 月:Runway Gen-3 Alpha 上线,加入相机运动控制;可灵国际版上线,成为中国首款大规模海外开放的视频生成产品;Stability AI 发布 SVD 1.1,提升图像到视频质量。
  • 2024 年 6 月:快手发布可灵(Kling),率先支持最长 2 分钟生成能力预告,引爆中文互联网。
  • 2024 年 5 月:Google I/O 发布 Veo,演示多段 60 秒+高质量视频;同期 MiniMax 推出海螺 AI 视频生成。
  • 2024 年 2 月:OpenAI 发布 Sora 技术报告及演示视频,展示一分钟级、多镜头切换能力,引发“世界模拟器”广泛讨论。
  • 2024 年 8 月:欧盟《人工智能法案》(AI Act)正式生效,对生成式 AI 系统施加透明度和内容标识要求,AI 视频产品的合规成本上升。

跟踪指标

持续观察以下维度,可帮助判断 AI 视频生成的产业成熟度与竞争力走向。

  • 生成质量
    • FVD、帧间 CLIP 得分、VideoScore 等在公认基准(如 Kinetics-600、MSR-VTT)上的刷新情况。
    • 主观评审赛事(如 AI 视频竞赛)中的排名与用户偏好票数。
  • 能力边界
    • 头部模型公开的最大生成时长、原生分辨率、帧率。
    • 对复杂提示词(含多物体、精确动作、空间关系)的遵循率。
    • 角色与物体在长视频中的 ID 保持率。
  • 推理效率与成本
    • 主流 API 每生成 1 分钟 1080p 视频的端到端成本(美元),及同比降幅。
    • 从提交请求到返回结果的端到端延迟(秒),P50/P95 分位数。
    • 开源模型在消费级硬件(如 RTX 4090)上的单秒推理耗时。
  • 商业化指标
    • 头部 API/SaaS 平台公布的年化营收、付费客户数、生成视频总秒数。
    • 广告、影视、游戏等垂直行业中 AI 视频生成渗透率调研。
  • 生态与合规
    • 训练数据版权诉讼案件的判决或和解动态。
    • 各国针对深度伪造、AI 生成内容标识的新立法或标准。
    • 开放源代码仓库的 Star 数、贡献者数量及模型下载量。
  • 基础设施
    • GPU/TPU 最新代际对视频生成模型的推理加速比(如 H100 vs B200)。
    • 万卡级别视频生成训练集群的公开部署情况与功耗数据。

信源

(以下信源覆盖核心技术报告、市场研究及主要产品,部分为长期跟踪积累,具体数据请以原始出处为准)

  1. OpenAI, “Video generation models as world simulators,” Feb 2024.
  2. Runway, Gen-2/Gen-3 Alpha/Gen-4 官方博客及产品文档.
  3. Google DeepMind, “Veo: a generative video model,” May 2024.
  4. 快手可灵 (Kling) 技术报告,2024 年.
  5. MiniMax,海螺 AI 视频产品公开材料.
  6. Stability AI, “Stable Video Diffusion,” Nov 2023.
  7. 开源项目:Open-Sora, CogVideoX, ModelScopeT2V.
  8. Fortune Business Insights, “AI Video Generator Market Size, Share & COVID-19 Impact Analysis…”, Sep 2024.
  9. Market.us, “AI Video Generator Market Report,” Jun 2024.
  10. Grand View Research, “Generative AI In Media & Entertainment Market Size Report,” 2024.
  11. 欧盟《人工智能法案》(EU AI Act),2024 年 8 月生效.
  12. Adobe, “Firefly Video Model Preview,” Oct 2024.
  13. Papers with Code, “Video Generation” 任务及排行榜.
source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型