模型层 开放阅读

视频生成

Video Generation

概念 ID
video-generation
更新时间
2026-05-29
来源数量
待补

视频生成 (Video Generation)

3 秒看懂

一句话定义:通过 AI 模型将文本/图像/音频等输入自动合成时间连贯的视频序列,是 AIGC 从”静态”迈入”动态”的标志性技术跃迁。

核心矛盾:在空间质量、时间一致性、时长可控性三个维度同时拉满,所需的算力和数据远超图像生成一个数量级。

产业位置:多模态大模型的”皇冠”,决定 AI 能否真正理解并模拟物理世界的动态规律。

3 分钟产业解释

为什么视频生成现在爆发?

视频生成并非新概念——GAN 时代就有基础探索(如 VideoGPT、MoCoGAN),但画质崩塌、时长仅几秒、运动僵硬三大硬伤使其长期停留在学术论文阶段。2023-2024 年的技术拐点来自三股力量的汇合:

  1. 扩散模型(Diffusion Models)在图像领域的成功——Stable Diffusion / DALL·E 3 / Midjourney 证明了扩散范式在视觉质量上的统治力,技术外溢至视频是自然延伸。
  2. DiT(Diffusion Transformer)架构取代 U-Net——Transformer 的可扩展性(scaling law)使模型容量和数据规模的投入产出比变得可预期,大厂敢于重注。
  3. 训练数据与算力的工业化供给——互联网积累了海量视频语料,GPU 集群规模持续攀升(万卡乃至数万卡训练成为常态),使”暴力美学”路线可行。

当前竞争格局速览

阵营代表产品/模型定位
闭源旗舰OpenAI Sora、Google Veo(2 代)、Kling(快手可灵)端到端长视频、物理一致性
开源社区CogVideoX(智谱)、Wan(阿里万象)、HunyuanVideo(腾讯)、Open-Sora 系列降低门槛、生态卡位
工具层创业Runway Gen-3/4、Pika Labs、Luma AI(Dream Machine)创作者工作流、短片/广告场景
芯片/云NVIDIA、AMD、Google TPU、各大云厂商训练与推理算力供应链

⚠️ 以上产品能力描述基于公开发布会信息,实际可用性随版本迭代持续变化,不做具体时长/分辨率的精确承诺。

15 分钟专家深入

技术路线的三次范式跃迁

第一代(~2022 及以前):自回归 + 像素空间

  • 代表:VideoGPT、TATS、Phenaki(Google,2022)
  • 思路:将视频视为 token 序列,用 VQ-VAE / VQGAN 在离散码本上做自回归预测。
  • 瓶颈:像素空间维度爆炸(T×H×W×C),分辨率和时长严重受限;token 数随帧数线性增长,长序列建模困难。

第二代(2023):图像扩散 + 时间层插值

  • 代表:Stable Video Diffusion(SVD)、Runway Gen-2、Make-A-Video(Meta)
  • 思路:在预训练的图像扩散模型(通常是 U-Net)中插入时间注意力层(temporal attention),微调使静态图像生成能力”泛化”到连续帧。
  • 瓶颈:时间层的能力天花板——本质上是在空间骨干上”加装”时间模块,建模深度有限;视频长度多局限于 2-4 秒。

第三代(2024-至今):统一的时空 DiT

  • 代表:Sora(OpenAI)、Wan(阿里)、HunyuanVideo(腾讯)、Cosmos(NVIDIA)、Veo 2(Google)
  • 思路:不再区分”空间骨干 + 时间附加”,而是将视频在潜空间(latent space)压缩为时空 token 序列,统一用 Transformer 架构建模。视频 patch 化(spacetime patching)成为核心设计。
  • 优势:架构简洁、scaling 路径清晰、长程依赖建模能力强。

核心技术栈拆解

┌──────────────────────────────────────────────────────┐
│                  视频生成系统全景                       │
│                                                      │
│  输入层: 文本编码器 (T5/CLIP/LLM) + 可选图像/音频条件  │
│           ↓                                          │
│  视频压缩: 3D VAE / 因果 VAE (时空降采样)             │
│    原始视频 T×H×W×3  →  潜空间 t×h×w×c               │
│           ↓                                          │
│  去噪骨干: DiT / U-Net+时间层 / 混合架构              │
│    输入: 噪声潜变量 + 时间步 + 条件信号                │
│    输出: 预测噪声 / 预测干净潜变量                     │
│           ↓                                          │
│  采样调度: DDPM / DDIM / Flow Matching / 蒸馏加速     │
│           ↓                                          │
│  解码: 3D VAE 解码器 → 像素空间视频                   │
│           ↓                                          │
│  后处理: 超分(SR) / 帧插值(FI) / 音频合成             │
└──────────────────────────────────────────────────────┘

各模块技术深度

1) 3D VAE —— 视频的”压缩灵魂”

这是视频生成区别于图像生成的最关键基础设施

  • 核心挑战:原始视频数据量巨大(例如 1080p×24fps×5s ≈ 1.2 GB 未压缩),直接在像素空间做扩散不可行。
  • 方案:训练 3D 卷积 VAE,同时在时间轴和空间轴做降采样。典型设计是空间 8×8、时间 4× 的压缩比,将数十帧视频压缩到数百个潜变量 token。
  • 因果卷积(Causal Convolution):多数方案在时间维度采用因果结构(当前帧只看过去帧),以支持流式生成和首帧条件化。
  • 重建质量瓶颈:VAE 的重建能力直接决定生成上限——如果 VAE 解码后模糊,后续去噪再好也无济于事。3D VAE 训练需要大量高质量视频数据,且解码显存占用随帧数增长显著。

⚠️ 具体压缩比因模型而异,各厂商未完全公开架构细节,上述为业界讨论中常见的典型设计模式。

2) 时空注意力机制 —— 核心计算引擎

┌─ 全注意力 (Full Attention) ──────────────────────┐
│  所有 token (空间+时间) 之间互相注意              │
│  优点: 表达能力最强                               │
│  代价: 计算量 O(N²),N = t × h × w,极贵         │
│  代表: Sora 的原始设计推测方向                     │
└──────────────────────────────────────────────────┘

┌─ 分离注意力 (Factorized Attention) ──────────────┐
│  空间注意力 (帧内) → 时间注意力 (帧间) 交替堆叠   │
│  优点: 计算量大幅降低                             │
│  缺点: 时空耦合建模能力弱于全注意力               │
│  代表: SVD、多数 U-Net+时间层方案                 │
└──────────────────────────────────────────────────┘

┌─ 稀疏/滑窗注意力 (Sparse/Window Attention) ─────┐
│  在局部时空窗口内做全注意力,跨窗口用稀疏连接     │
│  代表: LongViT 类设计,应对长视频的实用折中       │
└──────────────────────────────────────────────────┘

3) 条件控制与对齐

文本条件是主要驱动力:

  • 早期方案用 CLIP 文本编码器(77 token 上限,语义粗粒度)
  • 新一代改用 T5-XXL 或自研 LLM 编码器,支持长文本、细粒度描述
  • 部分方案将文本条件通过 cross-attention 注入,部分通过 adaptive layer norm(adaLN-Zero,DiT 的经典设计)

图像条件(图生视频 / 首帧控制):

  • 通常将参考图编码后与噪声潜变量拼接,或通过 IP-Adapter 类机制注入
  • 商业化落地的核心能力——创作者通常需要”从一张图出发”

运动控制

  • Camera control(镜头运动指定)
  • Motion brush / trajectory(局部运动轨迹控制)
  • ControlNet 类结构在视频场景的扩展

4) 训练范式

三阶段渐进训练是当前主流共识:

阶段分辨率/时长目的
Stage 1低分辨率、短片段(如 256×256, 数帧)学习基本运动动力学和语义对齐
Stage 2中分辨率、中等长度提升画质和时间一致性
Stage 3高分辨率、长片段面向交付质量,通常需要海量算力
  • 文本-视频对齐依赖大规模高质量视频-文本对数据。视频字幕(video captioning)的质量直接影响生成的指令遵循能力。许多团队会先用强力视觉语言模型对视频重新打标。
  • 数据规模:据业界讨论,头部项目的训练数据量在数千万至数亿视频片段级别 [行业估算,无官方确认]。

5) 推理加速

视频生成推理的核心痛点:一次生成需要数十到数百步去噪迭代,每步都是完整的模型前向传播

加速路线:

  • 蒸馏(Distillation):将多步扩散蒸馏为少步(如 50→4 步),代表:Consistency Models、SDXL Turbo 路线在视频上的延伸
  • 缓存(Caching):复用相邻时间步或层的中间特征
  • 量化:FP16/BF16 → INT8/INT4 推理
  • Flow Matching:用 ODE 替代 SDE,采样路径更直,通常所需步数更少。被 Wan、HunyuanVideo 等广泛采用
  • 硬件级优化:NVIDIA TensorRT、专用推理芯片

⚠️ 推理延迟和显存需求的具体数字因模型大小、分辨率、时长、硬件差异极大,不做统一量化。


技术原理(专家级)

扩散模型基础回顾

前向过程(加噪)

q(x_t | x_0) = N(x_t; √ᾱ_t · x_0, (1-ᾱ_t)I)

将干净数据 x_0 逐步加入高斯噪声,T 步后趋近纯噪声。

反向过程(去噪)

p_θ(x_{t-1} | x_t)  ——由神经网络参数化

从纯噪声出发,逐步去噪还原出干净样本。

训练目标:最常见为预测噪声 ε(ε-prediction),损失函数:

L = E_{x_0, ε, t} [ ||ε - ε_θ(x_t, t, c)||² ]

其中 c 为条件信号(文本编码等)。

Flow Matching 范式(视频生成新趋势)

与传统 DDPM 不同,Flow Matching 定义从噪声到数据的直线插值路径

x_t = t·x_1 + (1-t)·x_0,  t ∈ [0, 1]

模型学习速度场 v_θ,使 ODE 积分沿路径从噪声走向数据。

优势

  • 路径更”直”→ 采样步数更少
  • 训练更稳定
  • 与 Transformer 架构配合更好

Wan、HunyuanVideo、CogVideoX 等开源/半开源模型均采用或支持 Flow Matching 训练目标。

视频 Patch 化与位置编码

原始视频: (T, H, W, 3)
         ↓ 3D VAE 编码
潜空间:  (t, h, w, c)   例: (16, 30, 40, 16) for ~5s video
         ↓ Patch 化 (patch_size = pt × ph × pw)
Token序列: N = (t/pt) × (h/ph) × (w/pw) 个 patch token
         ↓ 位置编码
         3D 正弦位置编码 / 可学习位置编码 / RoPE
         ↓ 送入 Transformer

位置编码的设计对视频生成至关重要——它编码了每个 token 的时间位置和空间位置,使模型能理解”这是第几帧的哪个区域”。

3D VAE 架构细节

编码器:
  输入: (B, 3, T, H, W)
  → CausalConv3d (因果卷积: 时间方向只看过去)
  → ResBlock3d × N
  → 时间/空间下采样 (stride)
  → 输出: (B, c, t, h, w)

  典型压缩比:
  空间: 8×8 (H/8, W/8)
  时间: 4× (T/4)

  含义: 一段 5 秒 480p (64×480×856) 视频
        → 潜空间约 (16×60×107) 个 c 维向量
        → patch化后约数千 ~ 一万+ tokens

解码器:
  编码器镜像 + 渐进式上采样

上述数值为典型设计模式的估算示意,各模型具体配置不同。

训练中的关键技术问题

1) 时间一致性(Temporal Consistency)

  • 核心难题:逐帧生成质量可能很高,但帧间出现闪烁、物体形变、颜色跳变
  • 缓解手段:时间层/统一时空注意力、光流约束、时序一致性损失、长视频分段生成+重叠平滑

2) 运动合理性(Physical Plausibility)

  • 当前模型本质上通过统计关联学习运动模式,不具有物理引擎级别的因果推理能力
  • 表现为:物体穿透、重力违反、刚体变形等”物理 Bug”
  • 改进方向:物理先验注入、世界模型(World Model)范式、强化学习对齐

3) 长视频生成

  • 直接生成长视频的显存和计算量随帧数超线性增长(全注意力下 O(T²·H²·W²))
  • 实用策略:自回归续写(autoregressive extension)——生成 N 帧后以末帧为条件生成下一段
  • 挑战:段间一致性退化,全局剧情/场景保持困难

4) 文本遵循度(Text Alignment)

  • 当前视频模型对复杂指令的理解仍远落后于语言模型
  • 长句、多主体、精确空间关系、数字/计数等是难点

技术演进史

时间里程碑核心突破
2016VGAN, S3D最早的视频生成 GAN 探索,分辨率极低
2021VideoGPTVQ-VAE + 自回归 Transformer,离散化路线确立
2021.11NÜWA(微软亚研)统一多任务的视觉合成 Transformer
2022.09Make-A-Video(Meta)首个高质量文本→视频扩散模型(闭源)
2022.09Phenaki(Google)可变长视频生成,自回归+扩散混合
2022.10Imagen Video(Google)级联扩散,高分辨率文本→视频
2023.06Gen-2(Runway)首个广泛可用的商业文本/图→视频产品
2023.11Stable Video Diffusion首个高质量开源视频扩散模型(SVD)
2023.09Emu Video(Meta)图像先验→视频的高效框架
2024.02Sora(OpenAI)时空 Patch + DiT,最长约1分钟,物理感飞跃,引爆行业
2024.06Kling(快手)首个国产开放测试的长视频生成模型
2024.08CogVideoX(智谱)开源 DiT 视频模型
2024.08Stable Video 3D / 4D3D/4D 内容生成探索
2024.Q3-Q4Wan(阿里万象)、HunyuanVideo(腾讯)、LTX Video 等开源视频生成模型密集发布,DiT 架构成为主流
2024-2025Veo 2(Google)、Sora 正式上线、Kling 1.6/2.0产品化加速,可用性大幅提升
2025Cosmos(NVIDIA)、Wan2.1、HunyuanVideo 加速版世界模型方向探索、推理加速成焦点

时间线基于公开信息整理,部分闭源模型的能力描述以官方发布为准。


技术路线对比

维度U-Net + 时间层时空 DiT自回归 Token世界模型
代表SVD, Gen-2Sora, Wan, HunyuanVideoPhenaki, VideoPoetCosmos
骨干架构2D U-Net 插入时间注意力3D TransformerTransformer / LLMDiT + 物理仿真
时长上限短(2-6秒为主)中长(数秒至1分钟+)可变长(理论上无限)侧重物理一致性
Scaling 可预测性中等高(Transformer scaling law)待验证
训练效率高(可复用图像预训练)中等(需重新训练)中等低(需物理标注/仿真数据)
推理成本较低高(Transformer 大模型)高(逐 token 自回归)极高
时间一致性一般最佳(物理先验)
当前成熟度★★★★★★★★★★★★★
趋势判断逐步被替代当前主流路线特定场景(交互式)长期方向

上下游

上游(供给端)

┌─ 数据层 ──────────────────────────────────┐
│  视频语料库(公开/授权/爬取)              │
│  视频-文本对(人工标注 / VLM 自动打标)    │
│  合成数据(游戏引擎渲染、仿真数据)        │
└──────────────────────────────────────────┘
          ↓
┌─ 算力层 ──────────────────────────────────┐
│  GPU: NVIDIA H100/H200/B200 (训练主力)     │
│       AMD MI300X (部分替代方案)             │
│  TPU: Google TPU v5p                       │
│  国产: 寒武纪、华为昇腾(生态待成熟)      │
│  互联: NVLink/NVSwitch, InfiniBand         │
│  封装: CoWoS (先进封装产能制约)             │
└──────────────────────────────────────────┘
          ↓
┌─ 框架/编译层 ─────────────────────────────┐
│  PyTorch, JAX/XLA, Megatron-Core          │
│  分布式训练: FSDP, DeepSpeed, 3D 并行     │
│  推理: TensorRT, vLLM 扩展, ONNX Runtime  │
└──────────────────────────────────────────┘

下游(需求端)

场景描述成熟度
短视频/广告素材电商、营销快速出片★★★★
影视预可视化(Previz)分镜、概念视频★★★
游戏/虚拟人NPC 动作、虚拟主播★★★
教育/培训教学视频自动生成★★
社交/UGC用户自创内容★★★
专业影视制作长片、特效辅助★★(仍有质量/可控性瓶颈)
机器人/自动驾驶世界模型 → 规划与仿真★(前沿探索阶段)

关键指标

指标说明行业现状(定性)
时长单次生成可持续秒数闭源旗舰可达数十秒至~1分钟+;开源模型多在 5-16秒
分辨率最高生成清晰度480p~1080p 为主流可用;4K 仍处于早期演示
帧率每秒帧数16~30fps,部分支持 24fps(电影标准)
FID/FVD分布距离指标FVD 广泛使用但与人类感知相关性有限
Text-Video 对齐文本指令遵循程度主要通过人类评测(CLIPSIM 等自动指标辅助)
时间一致性帧间连贯度、闪烁程度通过人类评测或光流一致性指标衡量
推理延迟生成一段视频所需时间秒级到数十分钟不等(取决于模型规模、硬件、时长)
显存占用推理峰值 VRAM数十 GB 级(高分辨率长视频推理需高端 GPU)

各家评测基准不统一,横向对比需审慎。以上为行业通用描述。


供需与市场数据

需求侧

  • 创作者经济驱动:全球短视频平台(TikTok/抖音、YouTube Shorts、Reels)日均内容消费量巨大,AI 视频可降低制作成本一个数量级。
  • 企业级需求:广告、电商(商品视频自动生成)、游戏、教育等场景存在明确的降本增效诉求。
  • 开发者/研究需求:开源模型降低探索门槛,学术界和创业公司快速跟进。

供给侧

  • 算力是硬约束:视频生成训练和推理均属算力密集型。据行业估算,一次前沿视频模型的完整训练可能需要数千至上万张高端 GPU 运行数周至数月 [行业估算,具体数字各厂商未公开]。
  • 数据壁垒:高质量、授权清晰的视频数据是稀缺资源。头部公司(Google、字节跳动、快手等)拥有自有视频平台数据优势。
  • API 定价趋势:主流视频生成 API 按秒/按分辨率计费,单次生成成本在数美分到数美元不等(具体因服务商、分辨率、时长而异,快速变化中)。

市场规模

  • 视频生成市场处于早期高速增长阶段,精确规模数字各研报口径差异大。
  • 对比参考:图像生成市场(2024 年)据多家行业报告估算已进入数十亿美元量级;视频生成被普遍认为潜在市场更大(视频内容的市场规模本身就远大于图像),但当前渗透率极低。
  • 主要变现模式:API 服务、SaaS 订阅(创作者工具)、嵌入式功能(视频平台内嵌 AI 生成)、企业定制。

不引用具体预测数字,因各机构估算差异极大且变动频繁。


代表公司与资本映射

公司/团队核心产品/模型技术特色融资/估值(公开可查)
OpenAISora时空 DiT,长视频先驱已上市级别估值($300B+,2025年市场预期)
Google DeepMindVeo 2, VideoPoet多模态统一生成,长上下文Alphabet 旗下
RunwayGen-3 Alpha, Gen-4专业创作者工具,较早商业化已融资至约 $4B 估值 [公开报道]
快手Kling(可灵)国内首个大规模可用视频生成港股上市 (1024.HK)
字节跳动PixelDance 等内部模型拥有海量视频数据(抖音/TikTok)未上市
智谱 AICogVideoX, CogVideoX-5B开源路线,DiT 架构国内头部 AI 创业公司
阿里云Wan(万象)开源,大参数量 DiT阿里巴巴旗下
腾讯HunyuanVideo开源,Flow Matching 路线腾讯旗下
Stability AIStable Video Diffusion开源先驱经历融资困难后调整策略
Pika LabsPika 1.0/1.5/2.0简洁易用的创作者工具早期融资,估值据报 ~$500M+
Luma AIDream Machine快速出片,3D/视频融合早期融资
NVIDIACosmos世界模型方向,物理仿真结合芯片+软件平台双轮
Kuaishou(同快手可灵)

估值/融资数据来自公开报道,可能已过时,仅供参考,非投资建议。


投资逻辑

核心叙事

视频生成是 AIGC 从”图片”跃迁到”视频”的范式转换,对应的是全球数千亿美元规模的视频内容制作市场。技术成熟后,内容制作边际成本趋近于零,将深刻改变影视、广告、教育、游戏等行业。

三条投资主线

1) 基础设施层(“卖铲子”)

  • GPU/AI 芯片:NVIDIA、AMD、Broadcom 等 → 视频生成是算力消耗”大户”
  • 云服务:AWS/Azure/GCP/阿里云 → 模型即服务(MaaS)的重要品类
  • 先进封装(CoWoS 等)→ 供给瓶颈决定算力天花板
  • 逻辑:无论哪家模型胜出,算力需求确定性最高

2) 模型/平台层

  • 拥有视频数据 + 模型能力的平台公司:字节跳动、快手、Google、Meta
  • 创意工具创业公司:Runway、Pika、Luma → 可能被收购或独立上市
  • 开源模型公司:智谱、阿里 → 生态卡位
  • 逻辑:数据壁垒 + 模型迭代速度是核心竞争力,但护城河仍在建立中

3) 应用/场景层

  • 电商平台(商品视频自动生成)
  • 营销/广告 SaaS
  • 游戏引擎(AI 动画生成)
  • 教育内容
  • 逻辑:最终价值在于对传统工作流的替代效率

风险提示

  • 技术迭代风险:路线仍在快速演进,今天的领先者未必是明天的赢家
  • 算力成本:训练和推理成本仍高,商业模式盈利能力待验证
  • 版权/合规风险:训练数据的版权争议是全球性问题
  • 评估困难:生成质量评估主观性强,缺乏统一benchmark
  • 竞争激烈:中国和硅谷同时有大量团队投入,竞争白热化

常见误读纠偏

❌ 误读一:“Sora 是一个物理引擎 / 世界模拟器”

纠正:OpenAI 在 Sora 技术报告中将其定位为”世界模拟器”的长期愿景,但当前版本的 Sora 本质上仍是一个统计学习模型,通过大规模视频数据中的模式关联来生成视频。它并不内置物理定律、碰撞检测或力学方程。表现出来的”物理感”来自训练数据中物理规律的统计反映,而非显式建模。因此会出现物体穿透、反重力等”物理 Bug”。这是一个愿景与现实的差距,投资和产品决策不应混淆两者。

❌ 误读二:“视频生成就是把图像生成模型加上时间维度”

纠正:这种简化描述在 SVD 时代勉强成立(U-Net + temporal layers),但在当前 DiT 时代已不准确。核心区别在于:

  1. 3D VAE 的训练本身就是一个独立且困难的工程问题,图像 VAE 的经验不能直接迁移
  2. 时空 Token 的交互模式(全注意力 vs 分离注意力 vs 稀疏注意力)带来了全新的计算复杂度挑战
  3. 时间一致性、运动物理性、长视频段间连贯是视频独有的技术难点,图像生成不涉及
  4. 数据管线、评测体系、训练策略都是独立的技术栈

❌ 误读三:“开源模型很快就能追平闭源旗舰”

纠正:开源模型进步飞速,但与闭源旗舰仍存在差距,尤其在:

  • 长视频质量与时长:闭源模型通常支持更长的生成时长且质量衰减更小
  • 物理一致性:依赖更大规模训练数据和更精细的调优
  • 产品化打磨:交互设计、API 稳定性、安全过滤等工程能力
  • 开源的价值在于加速研究、降低入门门槛、建立生态,而非短期内替代顶级闭源产品

❌ 误读四:“参数量越大,视频生成质量一定越好”

纠正:视频生成的质量瓶颈分布广泛——3D VAE 的重建能力、训练数据的质量和多样性、文本编码器的理解力、采样策略、后处理流水线,每一环都可能成为短板。大参数量只是必要条件之一,不是充分条件。小模型+高质量数据+精巧架构的设计,可能在特定场景下优于大模型的粗糙训练。


学习路径

入门(建立直觉)

  1. 先熟悉图像扩散模型:DDPM 论文 → Stable Diffusion 原理 → DiT 论文
  2. 阅读 Sora 技术报告(OpenAI 官方博文),理解时空 Patch 的核心思想
  3. 体验 2-3 个产品(如 Kling、Runway Gen-3、Luma Dream Machine),建立”好不好”的直觉

进阶(理解架构)

  1. 精读 CogVideoXHunyuanVideo 的技术报告(开源,细节透明)
  2. 学习 3D VAE 的设计:因果卷积、时空下采样
  3. 理解 Flow Matching vs DDPM 在视频场景的差异
  4. 阅读 Wan(万象)技术报告:大参数量 DiT 训练经验

高级(工程与研究)

  1. 跑通一个开源视频生成项目的训练和推理流程(如 Open-Sora-Plan)
  2. 研究分布式训练策略:序列并行、张量并行在视频场景的特殊处理
  3. 关注推理加速方向:蒸馏、缓存、量化
  4. 跟踪最新论文:arXiv 的 cs.CV 每日更新

推荐资源

  • 论文:DDPM, DiT (Scalable Diffusion Models with Transformers), Sora Technical Report, CogVideoX, HunyuanVideo, Wan Technical Report
  • *博客
source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型