文生视频
3 秒看懂
文生视频(Text‑to‑Video)是指通过文本描述(Prompt)自动生成一组连贯、高清晰度、符合物理常识的动态影像。它是继文生图之后的生成式人工智能下一个前沿高地——核心难题不在“画一帧”,而在于同时处理好空间一致性(物体外观、场景布局不变)与时间连贯性(运动轨迹、光影变化合理解)。
3 分钟产业解释
文生视频并非孤立的技术模块,而是生成式AI技术栈向长序列、多模态输出的自然延伸。它正在把“用语言描述画面”升级为“用语言描述时间”。产业价值至少体现在三个层面:
- 内容生产范式革命:影视预演、广告分镜、游戏过场动画、电商短视频和教育素材的创作流程被压缩。创作者可以用自然语言生成高保真动态预览,将试错成本降低一个数量级。
- 合成数据引擎:对于自动驾驶、机器人等需要理解三维世界物理交互的领域,文生视频可以按需生成海量、带标注、多角度、多天气、多光照条件的视频数据,大幅缓解真实采集的成本与覆盖率瓶颈。
- 人机交互新界面:未来AI助手、虚拟人不仅“说”,更会用动态画面“展示”与“推演”,使信息传递的维度从文字、语音直接跃迁到时空影像。
当前产业仍处在“能生成→可控生成→精准长叙事”的早期爬坡阶段。头部玩家包括OpenAI(Sora)、Runway(Gen系列)、Pika Labs、Stability AI(Stable Video Diffusion)以及Google、Meta、字节跳动、快手等公司。竞争焦点集中在模型架构、高质量视频‑文本数据、训练算力以及产品化体验。
技术原理
现阶段文生视频的主流架构可归结为 “条件化的时空扩散生成模型”,其生成过程可以拆成三段:
-
编码压缩
- 文本:通过CLIP或T5‑XXL等大语言‑视觉对齐模型,将输入Prompt映射为语义特征向量,作为条件信号注入后续去噪网络。
- 视频:原始视频(T帧 × H高 × W宽 × C通道)经**3D VAE(三维变分自编码器)**或类似时空编码器,压缩到低维潜在空间
(t, h, w, c),其中t ≪ T、h ≪ H、w ≪ W。这一步把像素级冗余剔除,让扩散模型在紧凑的“概念空间”工作,极大降低显存与算力占用。
-
时空去噪(逆扩散)
- 训练时,向视频的潜在表示逐步添加高斯噪声,直至完全变成随机噪声。
- 模型学习的是逆过程:从一堆随机噪声出发,以文本特征为条件,逐步去噪,还原出与描述一致的视频潜在序列。
- 去噪网络通常是U‑Net或**DiT(Diffusion Transformer)**的时空变体,关键模块包括:
- 空间注意力/卷积:处理单帧内部的纹理、形状、空间关系(与文生图类似)。
- 时间注意力/时间卷积:跨帧串联信息,保证物体在外观、位置、光影变化上不跳变、不撕裂。这是视频生成与图像生成的本质分界线。
- 对于Transformer路线(如Sora),视频先被分割成一系列时空Patches,然后像处理文本Token一样,由统一的Transformer自注意力层同时捕获空间和时间依赖。
-
解码回像素
- 去噪后的潜在视频通过3D VAE解码器,上采样回像素空间,输出连续的视频帧序列。部分模型还结合超分模块提升分辨率。
graph LR
A[文本提示] --> B[文本编码器];
B --> C[语义特征];
D[随机噪声] --> E[时空去噪网络
U-Net / DiT + Time Attention];
C --> E;
E --> F[去噪潜在视频];
F --> G[3D视频解码器];
G --> H[最终视频];
上述流程高度依赖端到端联合训练。文本编码器、时空VAE和去噪网络需协同优化,否则容易出现语义漂移或帧间崩坏。
关键参数
视频生成模型的能力由一系列相互制约的参数决定。以下参数并非某个商业产品的精确规格(多数厂商未完全公开),而是基于公开论文和业界讨论的设计空间:
-
潜在空间维度与帧率 常见操作是将视频压缩到
(t=8~40帧,h=40~128,w=40~128,c=4~16)的潜在空间。潜在分辨率不足会丢失纹理细节;过高则急剧推高训练及推理成本。商业模型输出多为24/30 fps,时长目前集中在2~5秒,部分旗舰模型(如Sora宣称)可达60秒。 -
时间注意力窗口 全局时空注意力计算量是帧数的平方级,时长稍长即不可承受。工业界通常引入滑动窗口注意力(只在相邻若干帧间交互)或因果注意力(当前帧只看见过去帧),窗口大小(例如16帧)直接影响长程一致性。窗口太小会表现为“角色走出画面后,衣服颜色就变了”。
-
扩散步数与噪声调度 训练时通常使用1000步左右的前向加噪与反向去噪;推理时可通过蒸馏/DDIM等方式缩减至20~50步。噪声调度器如何分配不同时间步的噪声比例,会影响运动的流畅度和突发动作的生成质量。
-
模型参数量 公开信息中,Sora基础架构为Transformer,参数未披露(业界估计在百亿至数千亿级别)。Stable Video Diffusion(SVD)参数量约15亿。Runway Gen‑2/Gen‑3未公开具体参数。规模型号越大,物理合理性越强,但推理延迟和硬件门槛同步上升。
-
训练数据规模 头部模型普遍使用数亿至数十亿量级的视频‑文本对。数据来源包括公开数据集(LAION‑VIDEO的百万量级子集)、授权影视素材、互联网平台自有数据、合成数据等。数据质量(文本描述是否精当、剪辑是否干净)对运动多样性和语义对齐的贡献往往比模型架构排名更重要。
以上参数在生产环境中会结合目标场景(实时交互vs离线渲染)做不同折中。当前业界趋势是在可控成本下,优先提升时长与一致性。
技术路线
文生视频模型大致可归为三条路线,各自处于不同成熟阶段:
| 路线 | 代表架构 | 优势 | 劣势 | 典型实例(截至2025年初) |
|---|---|---|---|---|
| 时空改造的扩散模型 | 在图像U‑Net中插入时间注意力层/时间卷积;有时辅以3D卷积。 | 工程成熟,可直接继承文生图模型的权重与训练技巧,训练较稳定。 | 长序列建模受限于局部注意力窗口;扩展至极长视频的效率不如纯Transformer架构。 | Stable Video Diffusion (Stability AI);Runway Gen‑2早期版;早期学术工作如Video Diffusion Models (Google) |
| 统一时空Transformer | 将视频切分为时空Patches,直接用Transformer编码为序列,类似语言模型的next‑token prediction。 | 扩展性极强,易于通过堆叠层数和扩大序列长度遵循规模化定律;长程依赖捕捉更自然。 | 算力需求巨大,训练数据需求是前者的数倍;推理延迟较高,轻量化部署困难。 | OpenAI Sora;Google Veo;Meta Movie Gen(部分采用类似思路) |
| 分层或混合架构 | 先用自回归模型或低分辨率扩散模型生成关键帧或运动骨架,再用扩散模型或光流网络填充细节。 | 理论上擅生成超长视频(由粗到细),可将运动规划与纹理生成解耦。 | 多组件串联使误差容易被放大;联合优化复杂,抖动和伪影风险高。 | 部分学术原型及专利设计,成熟度较低 |
技术演进简史:2022年Google Imagen Video与Meta Make‑A‑Video首次展示扩散模型生成视频的可行性;2023年Runway Gen‑2与Pika 1.0推动产品化;2023年底Stable Video Diffusion开源掀起社区热潮;2024年Sora的发布标志着从专用U‑Net向通用Transformer的范式跃迁,把时长和物理模拟提升到新台阶;2024年下半年至2025年初,Google Veo、快手可灵、Meta Movie Gen等相继面世,路线趋于多元化,竞争白热化。
上游
文生视频产业链上游由算力、数据、基础算法和云基础设施构成。
-
算力芯片 NVIDIA H100/H200/B200 仍是训练主力,2024年单卡H100 SXM版FP16算力约1979 TFLOPS(来源:NVIDIA 2024规格表)。为训练千亿参数级视频模型,单次训练集群常需要数千至数万张加速卡。AMD MI300X和自研ASIC(如Google TPU v5,Meta MTIA)逐步进入部分训练和推理环节,但截至2025年初暂未撼动NVIDIA主导地位。
-
训练数据 高质量视频‑文本对是稀缺资源。公开来源包括:LAION‑VIDEO(数百万级)、WebVid‑2M/10M、HD‑VILA‑100M等;大型科技公司还会使用内部平台视频库(需经版权清洗)以及合成数据(用游戏引擎或3D模拟器生成)。数据标注的精细化程度(如镜头描述、物理属性标注)正变得越来越重要。
-
算法与基础模型 核心架构(DiT、时空U‑Net)及训练策略(级联扩散、流匹配、蒸馏)多源于顶尖实验室。开源模型(如SVD、CogVideoX等)降低了进入门槛,但前沿性能仍由闭源模型把持。
-
云计算与基础设施 AWS、Azure、GCP以及国内阿里云、火山引擎等提供GPU/TPU裸金属与训练平台,是多数创业公司赖以生存的算力来源。2024年头部云商的AI训练实例价格因需求旺盛居高不下,A100/H100实例长期供不应求。
下游
文生视频的下游正在从“尝鲜”向“融入工作流”过渡,典型场景包括:
- 影视与广告:分镜预览、概念短片、补充素材合成。好莱坞部分视效工作室已将AI视频用于镜头布局验证,但官方大片级成片仍需真人团队精修。2024年广告行业已出现AI生成配合人工剪辑的品牌广告案例。
- 游戏与动漫:角色运动预演、背景动态化、过场动画原型。节约了大量关键帧手绘和动作捕捉的前期投入。
- 电商与营销:自动生成商品演示短视频,支持多场景、多语种改编,降低拍摄与模特成本。
- 教育与培训:动态操作演示、历史场景复原、语言学习情景对话等,提高内容沉浸感。
- 社交媒体与UGC:快手可灵、抖音即梦等工具赋予普通用户“一键短片”能力,驱动短视频平台内容供给。
- 专业工具集成:Adobe Premiere Pro、DaVinci Resolve、CapCut等已内置或预告AI视频生成/扩展功能,将作为生产力插件存在。
整体而言,当前深度应用仍集中在能容忍部分瑕疵、追求效率的环节;对精确帧控、长片叙事要求极高的院线制作,AI尚处于辅助地位。
受益公司
以下列出因文生视频产业扩张而业务出现实质性关联的上市公司及主要未上市公司(仅描述业务关联,不构成任何投资建议):
| 类型 | 公司 | 关联点(截至2025年1月公开信息) |
|---|---|---|
| 模型/产品层 | OpenAI(未上市) | Sora;开放给少数测试者,尚未全面商用。 |
| Runway(未上市) | Gen‑3 Alpha产品化,向创意专业人士提供订阅收费。 | |
| Stability AI(未上市) | SVD开源模型,提供API及会员计划。 | |
| 快 手(1024.HK) | 可灵大模型,已集成至快手主APP,支持文/图生视频,公开测试数据表现突出。 | |
| Meta(META) | 发布Movie Gen基础模型,未直接面客,服务于内部生态和学术研究。 | |
| 字 节 跳 动(未上市) | 即梦、剪映集成AI视频能力,基于自研模型。 | |
| Google(GOOGL) | Veo模型,通过VideoFX等平台向许可用户开放。 | |
| 算力/云层 | NVIDIA(NVDA) | GPU主导供应商,直接受益于训练和推理需求爆发。2024财年数据中心营收475.3亿美元(来源:NVIDIA 2024年报),AI视频是增速来源之一。 |
| AMD(AMD) | Instinct系列加速卡逐步获得部分AI推理与训练订单,数据未单独拆分。 | |
| 微 软(MSFT) | Azure提供GPU实例,与OpenAI深度合作,间接获取模型调用收益。 | |
| Amazon(AMZN) | AWS提供Trainium/Inferentia与GPU实例,服务于多家AI视频创业公司。 | |
| 应用/工具层 | Adobe(ADBE) | Firefly视频模型已集成至Premiere Pro,通过Creative Cloud订阅间接变现。 |
| Unity(U) | 提供引擎侧的AI动画生成工具Sentis等,赋能游戏创作者。 | |
| 美 图(1357.HK) | MiracleVision模型支持视频生成,与影像产品生态协作。 |
注:未上市公司估值及财务为公开报道估算值,应查阅最新融资新闻。
市场规模
全球文生视频市场仍处于形成阶段,不同机构因囊括范围(纯文生视频 vs AI视频生成整体)及预测方法差异,数据出入明显。以下引用近期代表性估算:
- 据 Grand View Research 2024年5月发布的报告,2023年全球AI视频生成市场规模约 7.8亿美元,预计到2030年增至 58.6亿美元,复合年增长率约35.8%。该口径包含文生视频、图生视频、视频编辑等AI驱动功能。
- Brandessence Market Research 2024年3月报告估计,2023年纯文生视频生成市场为 5.4亿美元,至2030年或达 26.1亿美元,CAGR约25.1%。
- Bloomberg Intelligence 2024年分析认为,生成式AI视频将在2032年以前贡献整个生成式AI市场增量中可观份额,但未给出单列数字。
上述数字均需以原始报告为准,且预测假设技术可用性大幅提升、合规问题妥善解决。增速最终取决于生成质量的突破节奏、成本下降斜率以及版权法律框架的明朗化。
玩家对比
截至2025年1月,主要文生视频模型产品能力对比如下(基于各公司官网、技术报告和公开体验):
| 模型/产品 | 开发方 | 是否开放 | 核心架构 | 典型时长 | 最高分辨率 | 运动一致性 | 可控性特征 | 定价模式(公开) |
|---|---|---|---|---|---|---|---|---|
| Sora | OpenAI | 未完全开放,红队测试 | Transformer(时空Patches) | 最长60秒(宣称) | 1080p(内部) | 高,复杂物理模拟惊艳 | 文本,未公开镜头控制 | 未公布 |
| Gen‑3 Alpha | Runway | 开放订阅 | 未公开(推测时空DiT) | 约10秒 | 720p/1080p 24fps | 良好,短时长内较稳定 | 文字、图生视频、运动笔刷 | $12‑76/月起 |
| Pika 2.0 | Pika Labs | 开放订阅 | 未公开 | 约7秒 | 约1080p | 中上,人物外观有一定跳变 | 文字、图生视频、局部重绘 | 免费层+$16‑46/月 |
| Stable Video Diffusion | Stability AI | 开源+API | 时空U‑Net | 4‑5秒(单次生成) | 576×1024(常见配置) | 中等,物体形变需后处理 | 文字+图,可控性有限 | 按API调用或自托管 |
| Veo | 有限开放(VideoFX) | Transformer(推测) | 约60秒 | 1080p | 高,公司演示中物理与面部表现优异 | 文本、图像、部分风格控制 | 未公开定价 | |
| 可灵 (Kling) | 快手 | 开放公测 | 未公开(类似3D VAE+DiT) | 约5‑15秒 | 1080p 30fps | 较高,尤其人物动作 | 文字、图生视频,支持帧扩展 | 免费额度+会员 |
| Movie Gen | Meta | 未开放,仅供研究 | Transformer(30B参数) | 最长16秒 | 1080p | 高,声称生成真实音视频同步 | 文字、图生视频、音频联动 | 不适用 |
注:部分参数来自第三方评测和公司博客,未独立验证。普通用户实际体验可能因排队、压缩等与上述展示有差异。
风险
-
技术路线更迭风险 模型架构仍在快速演进,当前主流可能被新范式(如世界模型、实时神经渲染)替代。2024年Sora的出现已让部分先前的专用U‑Net路线面临重构压力。过早锁定单一技术栈的投入可能遭遇沉没成本。
-
深度伪造与信息安全 逼真视频生成大幅降低伪造内容的门槛,可能被滥用于政治造谣、金融欺诈、色情换脸。各国监管正处于收紧过程中(如欧盟AI法案2024年生效,中国《生成式人工智能服务管理暂行办法》2023年施行)。企业需承担额外的鉴真与审核成本。
-
版权与数据合规 训练数据的来源合规性是悬在行业头顶的达摩克利斯之剑。若模型“记忆”了受版权保护的影视作品片段,可能引发大规模集体诉讼。2023-2024年间,好莱坞编剧、演员罢工及多起艺术家联合诉讼已凸显利益冲突。下游商业用户使用AI生成素材的版权归属也尚无全球共识。
-
商业化落地低于预期 当前多数用户停留在“尝鲜”层面。若生成视频的精确控制、画面专业度长期无法满足制片标准,付费转化率可能不达投资模型公司的估值要求,引发估值中枢下移。
-
算力垄断与地缘政治 高端GPU受出口管制(如美国对华芯片限制),可能导致不同区域的模型能力差距拉大,影响部分市场参与者的竞争力。
误读纠偏
-
误读一:“文生视频就是把文生图的逻辑直接套到帧序列上。” 纠偏:帧独立生成然后拼接,会出现严重的闪烁和内容不一致。文生视频的核心在于时空联合建模,要求模型在去噪过程的每一步同时感知时间和空间维度,光加个“拼帧”脚本完全不可行。这需要专有的3D卷积、时间注意力或Transformer结构支撑。
-
误读二:“Sora一出来,专业影视行业马上就会被重构。” 纠偏:Sora等前沿模型展示了物理世界的模拟潜力,但距离专业级制片仍有明显差距:精准控制镜头运动、人物微表情、长叙事节奏仍是弱项;对精细物理交互(布料撕裂、流体飞溅)的模拟时有出错;后期难以对生成内容做细粒度编辑。当前定位更多是创意构思与预可视化工具,而非“一键成片”的完整拍摄替代。
-
误读三:“文生视频模型学会了物理定律。” 纠偏:模型并非运行公式解算力学方程,而是从海量视频的统计分布中“记忆”物体通常如何运动。它生成的是“看上去合理”的物理过程。当遇到训练数据稀疏的长尾场景(如非牛顿流体、罕见视角碰撞)时,容易崩坏成违反物理常识的怪异画面。这仍是数据驱动的联想起大模型,并非真正的物理引擎。
最新事件
(截至2025年1月)
- 2024年06月:Runway发布Gen‑3 Alpha,宣称运动保真度和一致性大幅提升,并提供运动笔刷等精细化控制功能,面向付费用户。
- 2024年06月:快手发布可灵(Kling)大模型,凭借高质量人物动作与高分辨率引发关注,其后开启公测和快速迭代。
- 2024年07月:Google在其VideoFX平台向部分筛选用户推出Veo,强调长视频与画面稳定性,并与音乐生成工具结合展示。
- 2024年09月:Meta发布Movie Gen基础模型研究,展示30B参数Transformer视频生成效果及联动音频生成能力,暂未产品化。
- 2024年10月:OpenAI在一次公开活动中展示Sora生成视频的全新案例,但正式发布仍无时间表,持续红队测试。
- 2024年11月:Adobe Premiere Pro公开测试Firefly视频生成插件,支持文生视频、图生视频快捷生成B‑roll素材。
- 2024年12月:中国多家互联网公司更新AI视频工具(如即梦、剪映),从短视频场景切入,用户生成内容总量突破万小时量级(公司公开新闻稿)。
产业层面,2024全年全球涉及AI视频的股权融资超过25亿美元(据Crunchbase不完全统计,口径含模型与工具层),为领域注入高额研发资金。
跟踪指标
持续理解文生视频产业可关注以下高频或定期的指标与信号:
-
产品迭代与开放度
- 主要模型(Sora, Gen‑3, Veo, Kling等)公开发布时间、开放范围、定价策略。
- 重大版本更新日志,尤其关注时长、分辨率、一致性指标的变化。
-
用户规模与创作量
- Runway等订阅制公司的付费用户数、ARR(年化经常性收入);快手、抖音等平台AI生成视频的日上传量与留存率(公司财报或公开活动披露)。
-
算力与成本
- NVIDIA GPU季度数据中心营收及下代产品路线图;主流云实例价格变动。
- 头部公司披露的模型训练和推理成本结构(如Sora、Veo针对不同时长的推理秒级成本)。
-
版权与监管政策
- 各国AI法案细则落地(如欧盟AI Act等级划分,美国版权局对AI生成内容的版权指南)。
- 行业标杆诉讼的裁决(如艺术家集体诉讼、媒体集团与AI公司的许可协议)。
-
关键人才与并购
- 核心研发人员流向;大公司收编创业团队或并购AI视频初创企业的公告。
-
基准评测与比赛
- 学术界与社区公开的文本到视频生成质量基准(如VBench、EvalCrafter)中各家模型的最新排名,虽非完美,但可作为一致性、运动幅度等客观维度的参照。
信源
-
学术论文 Ho, J. et al. (2022). Video Diffusion Models. arXiv:2204.03458 Singer, U. et al. (2022). Make‑A‑Video: Text‑to‑Video Generation without Text‑Video Data. Meta AI. Blattmann, A. et al. (2023). Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets. Stability AI. Peebles, W. & Xie, S. (2023). Scalable Diffusion Models with Transformers (DiT). arXiv:2212.09748. Brooks, T. et al. (2024). Video generation models as world simulators. OpenAI Technical Report. Kondratyuk, D. et al. (2024). VideoPoet: A Large Language Model for Zero‑Shot Video Generation. Google.
-
产品与技术博客 Runway Research Blog — Gen‑2, Gen‑3 Alpha技术介绍 Meta AI Blog — Movie Gen: Advanced Video Generation (2024) 快手Y‑Tech / 快影技术公号 — 可灵大模型技术解读(2024) Google DeepMind Blog — Veo: our most capable video generation model (2024)
-
数据集与开源项目 LAION‑VIDEO (LAION‑5B视频子集) Stable Video Diffusion GitHub (Stability‑AI/generative‑models) CogVideoX (智谱AI开源)
-
市场与行业报告 Grand View Research. AI Video Generator Market Size, Share & Trends Report, 2024. Brandessence Market Research. Global Text‑to‑Video AI Market Report, 2024. Bloomberg Intelligence. Generative AI Video: The Next Frontier, 2024. a16z, Sequoia Capital, Lightspeed — 关于AIGC及视频基础设施的公开分析文章。
-
新闻与数据平台 Crunchbase — AI视频融资追踪 The Verge, TechCrunch, 机器之心, 量子位 — 产业动态报道
所有数字、规格与事件细节请以各公司最新官方公告及原始报告为准。未标注出处的内容仅代表截至2025年1月的公开信息定性归纳。