模型层 开放阅读

视频理解

Video Understanding

概念 ID
video-understanding
更新时间
2026-05-29
来源数量
待补

视频理解 (Video Understanding)

3 秒看懂

一句话定义:让 AI 像人一样”看懂”视频——不仅能识别每一帧里的物体,还能理解动作、因果、情节和时序关系。

核心公式直觉

Video Understanding ≈ Image Understanding + Temporal Reasoning + Long-range Context

类比:如果说图像识别是看”照片”,视频理解就是看”电影”——需要理解镜头之间的叙事逻辑,而非孤立画面。

3 分钟产业解释

这是什么?

视频理解是一类以视频流为输入、以语义理解为目标的 AI 任务总称。涵盖从低层(动作识别、时空定位)到高层(视频问答、因果推理)的完整任务谱系。

为什么重要?

维度说明
数据占比视频占互联网流量已超 80%(据行业统计,[估算]),是最大的非结构化数据源
应用落地安防监控、自动驾驶、短视频推荐、体育分析、医疗手术录像、工业质检
商业价值全球视频分析市场规模预计 2030 年达数百亿美元(各机构口径不一,[未充分披露])

和”视频生成”是什么关系?

视频理解视频生成
方向视频 → 结构化语义语义 → 视频
代表模型VideoMAE、InternVideo、GPT-4oSora、Kling、可灵
难度瓶颈长时序建模、计算效率时序一致性、物理规律

两者共同需要”时空表征学习”,但任务目标相反。当前多模态大模型(如 GPT-4o)正在将两者统一。

15 分钟专家深入

核心任务谱系

┌─────────────────────────────────────────────────────────────────┐
│                    Video Understanding 任务层级                   │
├─────────────────────────────────────────────────────────────────┤
│  L0 时空定位    │ 帧级动作检测、时序片段定位 (TAL)               │
│  L1 视频识别    │ 动作分类、场景分类、事件检测                    │
│  L2 视频描述    │ Video Captioning、密集描述 (Dense Captioning)  │
│  L3 视频推理    │ Video QA、因果推理、反事实推理                  │
│  L4 视频规划    │ 基于视频的具身智能决策、自动驾驶场景理解        │
└─────────────────────────────────────────────────────────────────┘

关键技术挑战

1. 时间维度的”诅咒”

  • 1秒 30fps 视频 = 30 帧图像,10分钟视频 = 18,000 帧
  • 暴力处理计算量是图像的 30×~18,000×
  • 必须依赖采样策略(均匀采样、关键帧检测)和时间建模(时序聚合、因果 Transformer)

2. 长程依赖问题

  • 理解”为什么他笑了”可能需要回忆视频开头 3 分钟前的一个眼神
  • 自注意力的二次复杂度 O(n²) 在长序列上成为瓶颈
  • 解决方案:稀疏注意力、时间分层、记忆网络

3. 多模态对齐

  • 视频 = 图像 + 音频 + 语音 + 字幕 + BGM
  • 如何将多种信号融合成统一表征,是当前多模态研究热点

主流技术范式

┌──────────────────────────────────────────────────────────────┐
│                   视频理解技术路线演化                          │
├──────────────────────────────────────────────────────────────┤
│                                                              │
│  CNN 时代                 Transformer 时代                    │
│  (2014-2020)              (2021-至今)                        │
│                                                              │
│  ┌─────────────┐          ┌─────────────────┐               │
│  │ 2D CNN+LSTM │          │ Vision Transformer│              │
│  │ 3D CNN      │ ──────> │  (ViT + 时间建模) │              │
│  │ (C3D, I3D)  │          │  VideoMAE       │               │
│  │ SlowFast    │          │  InternVideo    │               │
│  └─────────────┘          └─────────────────┘               │
│         │                          │                         │
│         ▼                          ▼                         │
│  手工设计时空结构           数据驱动的时空注意力               │
└──────────────────────────────────────────────────────────────┘

技术原理

1. 基础架构:从 2D 到时空建模

2D CNN + 时间聚合(早期方案)

输入: [B, T, C, H, W]  (T帧视频)
     │
     ├── 每帧独立提特征 (2D CNN) ──> [B, T, D]
     │
     └── 时间聚合 (LSTM/Transformer/平均池化) ──> [B, D]
            │
            └── 分类头 ──> 预测结果
  • 优点:复用图像预训练模型
  • 缺点:帧间交互弱,缺乏真正的时空耦合

3D CNN(时空卷积)

输入: [B, C, T, H, W]
     │
     └── 3D Conv (k_t × k_h × k_w) ──> 同时提取时空特征
            │
            └── [B, D, T', H', W'] ──> 全局池化 ──> [B, D]
  • 代表:C3D、I3D(Inception-3D)、SlowFast
  • 关键设计:SlowFast 双路径——Slow 路径低帧率抓语义,Fast 路径高帧率抓运动

2. 现代范式:Video Transformer

核心思路:将视频视为时空 patch 序列,用 Transformer 建模

视频帧序列 [B, T, H, W, 3]
        │
        ▼
时空 Patch Embedding: 
  将每帧切成 N 个 patch,T 帧共 T×N 个 token
  可选策略:
  ├── Tubelet Embedding: 时空 3D patch (如 2×16×16)
  └── 帧级 Patch + 时间位置编码
        │
        ▼
Transformer Encoder:
  输入: [B, T×N, D]
  注意力机制捕捉所有 token 间关系
        │
        ▼
任务头: 分类 / 定位 / 生成描述

VideoMAE(Masked Autoencoder for Video)- 自监督预训练

原理:
1. 随机遮盖视频中 90%+ 的时空 patch(比图像 MAE 的 75% 更激进)
2. 编码器处理可见 patch
3. 解码器重建被遮盖 patch
4. 预训练后的编码器具有强大时空表征能力

为何遮盖率更高?
- 视频相邻帧高度冗余,信息密度低于图像
- 更高遮盖率迫使模型学习更本质的时空结构

3. 多模态大模型范式(当前前沿)

┌─────────────────────────────────────────────────────┐
│           多模态视频理解大模型架构                      │
├─────────────────────────────────────────────────────┤
│                                                     │
│  视频输入    音频输入    文本输入                       │
│     │          │          │                         │
│     ▼          ▼          ▼                         │
│  视觉编码器  音频编码器  文本编码器                     │
│  (ViT)      (AST)     (BERT/LLM)                   │
│     │          │          │                         │
│     └──────────┼──────────┘                         │
│                ▼                                    │
│         多模态融合层                                  │
│   (Cross-Attention / Q-Former / MLP)                │
│                │                                    │
│                ▼                                    │
│            LLM 主干                                 │
│        (统一推理引擎)                                 │
│                │                                    │
│                ▼                                    │
│          任务输出头                                   │
│  (QA/描述/分类/检索...)                               │
└─────────────────────────────────────────────────────┘

关键设计选择

组件主流方案说明
视觉编码器ViT-L/14、InternViT、SigLIP预训练于大规模图像-文本对
帧采样均匀采样 8~32 帧更多帧 ≠ 更好,需平衡信息量与计算量
时序建模SlowFast 融合 / 时间注意力池化压缩时间维度至固定 token 数
LLM 骨干LLaMA、Qwen、InternLM接收视觉 token 序列 + 文本指令
训练策略冻结编码器 + 微调投影层多阶段:预训练 → 指令微调 → RLHF

4. 时序定位(Temporal Action Localization)机制

任务: 给定视频,定位"开门"动作的起止时间

输入: [0s ─────────────────────── 60s]
      |    动作A    |    动作B    |

技术流程:
1. 视频特征提取 ──> 帧级特征序列 [T, D]
2. 时序建模 (Transformer/卷积) ──> 捕捉动作边界
3. 生成候选片段 (anchors / proposals)
4. 分类 + 边界回归
5. NMS 后处理

输出: 动作B: [25.3s, 38.7s], 置信度 0.92

技术演进史

2014    2016    2018    2020    2022    2024    2025+
  │       │       │       │       │       │       │
  ▼       ▼       ▼       ▼       ▼       ▼       ▼
┌─────────┐ ┌─────┐ ┌─────┐ ┌─────┐ ┌─────┐ ┌─────┐ ┌─────┐
│Two-Stream│ │C3D  │ │I3D  │ │Slow-│ │TimeS│ │Video│ │多模态│
│(Simonyan)│ │     │ │     │ │Fast │ │former│ │MAE  │ │统一大│
│         │ │3D   │ │膨胀 │ │     │ │     │ │     │ │模型 │
│         │ │CNN  │ │3D   │ │     │ │     │ │     │ │     │
└─────────┘ └─────┘ └─────┘ └─────┘ └─────┘ └─────┘ └─────┘

里程碑:
• 2014 Two-Stream: 空间流+运动流,开创性
• 2017 I3D: 膨胀 Inception,ImageNet→Kinetics 迁移
• 2019 SlowFast: 双路径,精度/效率平衡
• 2021 TimeSformer: 纯 Transformer 视频理解
• 2022 VideoMAE: 自监督视频预训练突破
• 2023-24 InternVideo 系列: 视频理解基座模型
• 2024-25 GPT-4o/Qwen2-VL: 统一多模态,视频理解原生能力

关键转折点

时期范式转移驱动力
~2018手工设计 → 数据驱动 3D 卷积Kinetics 数据集 [DeepMind]
~2021CNN → TransformerViT 成功 + 可扩展性
~2023有监督 → 自监督 + 基座模型VideoMAE、数据规模
~2024独立模型 → 多模态大模型LLM 能力溢出、统一架构

技术路线对比

路线代表模型时间建模预训练方式优点缺点典型精度参考
3D CNNSlowFast, X3D3D 卷积核Kinetics 有监督成熟、推理快时间感受野受限Kinetics-400 Top-1 ~80%+ [估算]
Video TransformerTimeSformer, ViViT时空注意力ImageNet→Video 迁移全局时空建模计算量大、长视频困难Kinetics-400 Top-1 ~85%+ [估算]
自监督预训练VideoMAE, V-JEPATransformer遮盖重建标注高效、泛化强需大规模无标签视频Kinetics-400 微调 ~87%+ [估算]
多模态大模型GPT-4o, InternVLLLM 隐式建模视觉-语言对齐统一多种任务推理成本高、时序理解仍弱视频 QA 精度持续刷新 [未充分披露]
混合方案InternVideo2分层:帧内+帧间+全局多任务多数据兼顾效率与精度架构复杂SOTA 水平 [估算]

注:上述精度为 Kinetics-400 等标准 benchmark 的大致范围,不同论文设置有差异,[估算]。


上下游

┌─────────────────────────────────────────────────────────────────┐
│                         产业链全景                                │
├─────────────────────────────────────────────────────────────────┤
│                                                                 │
│  上游 (基础设施层)                                               │
│  ┌─────────────────────────────────────────────────────────┐   │
│  │  算力: NVIDIA GPU (H100/A100)、云服务 (AWS/Azure/阿里云) │   │
│  │  框架: PyTorch、JAX                                      │   │
│  │  数据: Kinetics (DeepMind)、ActivityNet、Ego4D           │   │
│  └─────────────────────────────────────────────────────────┘   │
│                            │                                    │
│                            ▼                                    │
│  中游 (模型层)                                                   │
│  ┌─────────────────────────────────────────────────────────┐   │
│  │  学术: VideoMAE (南京大学/上海人工智能实验室)、TimeSformer (Meta) │   │
│  │  开源: InternVideo (上海AI Lab)、Qwen2-VL (阿里)         │   │
│  │  商业: Google Gemini、OpenAI GPT-4o、字节跳动            │   │
│  └─────────────────────────────────────────────────────────┘   │
│                            │                                    │
│                            ▼                                    │
│  下游 (应用层)                                                   │
│  ┌─────────────────────────────────────────────────────────┐   │
│  │  安防监控: 海康威视、旷视、商汤                            │   │
│  │  自动驾驶: Waymo、Tesla、小鹏                             │   │
│  │  内容审核: 字节、Meta、YouTube                            │   │
│  │  短视频/推荐: 抖音、快手、TikTok                          │   │
│  │  体育/医疗: IBM Watson、各垂直创业公司                     │   │
│  └─────────────────────────────────────────────────────────┘   │
└─────────────────────────────────────────────────────────────────┘

关键指标

模型性能指标

指标定义说明
Top-1 Accuracy动作/场景分类准确率Kinetics-400/700 标准 benchmark
mAP (mean Average Precision)时序动作定位精度ActivityNet 挑战赛主指标
Video QA Accuracy视频问答正确率MSRVTT-QA、ActivityNet-QA 等
CIDEr / BLEU视频描述生成质量文本生成任务标准指标

工程效率指标

指标典型范围说明
帧采样数8~32 帧影响精度-效率平衡
FLOPs / 视频数十G ~ 数百G取决于帧数和模型大小
推理延迟数十ms ~ 数百ms / 视频实时应用需 <100ms
显存占用数 GB ~ 数十 GB长视频高分辨率场景剧增

评估维度

视频理解模型评估四象限:
                    高精度
                      │
          ┌───────────┼───────────┐
          │  学术SOTA │ 实用SOTA  │
          │ (VideoMAE │ (InternVideo│
          │  巨模型)  │  优化版)   │
  低效率──┼───────────┼───────────┤──高效率
          │  不可用   │  边缘部署  │
          │           │ (MobileViT) │
          └───────────┼───────────┘
                      │
                    低精度

供需与市场数据

⚠️ 以下数据来自行业报告和公开信息,各机构口径存在差异,部分为[估算]。

需求侧

应用场景市场驱动力规模估算
安防监控智慧城市、平安城市政策全球视频监控市场 2030 年预计超 800 亿美元 [估算]
自动驾驶L3+ 渗透率提升单车视频传感器成本数百美元 [估算]
内容审核监管合规、平台治理全球内容审核市场 2030 年预计超 100 亿美元 [估算]
短视频推荐用户时长竞争头部平台视频理解研发投入年均数亿美元 [估算]

供给侧

供给类型代表竞争格局
基础模型 APIOpenAI、Google、阿里云寡头格局,头部优势明显
开源模型HuggingFace、GitHub生态繁荣,学术驱动
垂直解决方案海康威视、旷视、商汤行业Know-How壁垒
芯片/硬件NVIDIA、地缘替代NVIDIA 生态锁定强

代表公司与资本映射

层级公司关键产品/技术资本市场映射
算力NVIDIAGPU (H100/B100)NVDA (NASDAQ)
云服务阿里云、AWS、Azure视频理解 APIBABA (NYSE)、AMZN、MSFT
模型层OpenAIGPT-4o 视频理解非上市
GoogleGemini 1.5 ProGOOGL (NASDAQ)
阿里Qwen2-VLBABA (NYSE)
字节跳动豆包、视频创作非上市
上海 AI LabInternVideo非营利研究机构
应用层海康威视安防视频分析002415.SZ
商汤科技SenseTime 视频分析0020.HK
旷视科技视频结构化未上市
大华股份安防视频分析002236.SZ

投资逻辑

核心逻辑

                    ┌─────────────────────┐
                    │   视频数据爆炸式增长  │
                    └──────────┬──────────┘
                               │
                    ┌──────────▼──────────┐
                    │ 理解能力成为"水和电" │
                    │  (基础设施化)        │
                    └──────────┬──────────┘
                               │
           ┌───────────────────┼───────────────────┐
           │                   │                   │
    ┌──────▼──────┐    ┌──────▼──────┐    ┌──────▼──────┐
    │  算力需求   │    │  模型层     │    │  应用层     │
    │  (GPU/TPU)  │    │  (大模型API)│    │  (垂直场景) │
    │  确定性最高  │    │  马太效应   │    │  分散竞争   │
    └─────────────┘    └─────────────┘    └─────────────┘

关键观点

  1. 算力确定性最高:视频理解是计算密集型任务,帧数 × 分辨率 × 模型规模 → 持续推高算力需求
  2. 多模态大模型是终局方向:独立的视频理解模型可能被统一多模态模型吸收
  3. 垂直场景仍有窗口期:安防、自动驾驶等场景需要行业Know-How,纯模型公司难以通吃
  4. 开源 vs 闭源博弈:开源社区(InternVideo、Qwen2-VL)正在快速追赶商业闭源模型

风险提示

  • 技术迭代快,模型能力可能快速商品化
  • 算力成本仍是主要瓶颈,影响落地速度
  • 多模态大模型统一趋势下,独立视频理解公司存在被整合风险

常见误读纠偏

误读 1:“视频理解 = 逐帧图像识别 + 简单聚合”

纠偏:早期确实如此(2D CNN + LSTM),但现代视频理解的核心价值在于时空耦合建模

  • 识别”开门”需要理解”手靠近门把手 → 转动 → 门开”的时间因果链
  • 识别”过马路”需要理解行人与车辆的时空交互关系
  • 这些无法通过逐帧识别捕获

结论:时间维度不是”加法”,而是带来质变的”乘法”。

误读 2:“视频理解模型越大越好,帧数越多越好”

纠偏

  • 模型大小:存在收益递减,且推理成本指数增长。工业落地更看重精度/成本比
  • 帧数:视频高度冗余,相邻帧差异极小。研究表明 8~16 帧均匀采样已能覆盖大部分语义信息
  • 关键:采样策略和时间建模能力 > 暴力堆叠帧数

误读 3:“视频理解已经成熟,可以大规模商用”

纠偏

  • 封闭场景(如动作识别、简单视频分类)确实已商用
  • 但在开放场景(长视频理解、因果推理、多轮视频对话)仍有明显不足
  • 主要瓶颈:长时序建模、计算效率、高质量标注数据稀缺

误读 4:“Transformer 已经完全取代 CNN”

纠偏

  • 在学术研究和大模型领域,Transformer 确实是主流
  • 但在边缘部署(安防摄像头、手机端)场景,轻量级 CNN(如 MobileNet 变体)仍占主导
  • 现实中常采用混合架构:CNN 提特征 + Transformer 建模

学习路径

入门(1~2 周)

资源说明
CS231n (Stanford)计算机视觉基础,含视频理解章节
《动手学深度学习》(d2l)PyTorch 实现,入门友好
Kinetics 数据集浏览建立对视频分类任务的直觉

进阶(1~2 月)

资源说明
SlowFast 论文 [FAIR]理解经典 3D CNN 设计
TimeSformer 论文 [FAIR]理解 Video Transformer
VideoMAE 论文 [Nanjing Univ / Shanghai AI Lab]自监督预训练范式

前沿(持续跟踪)

资源说明
InternVideo 系列论文 [上海AI Lab]多模态视频理解基座
GPT-4o / Gemini 技术报告商业多模态模型的能力边界
Ego4D 数据集 [Meta FAIR]第一人称视频理解前沿

实践项目

  1. 入门:用 PyTorch 复现 VideoMAE,微调 Kinetics-400
  2. 进阶:基于 InternVideo 做 Video QA 应用
  3. 挑战:长视频理解(HourVideo 级别),探索高效时序建模

一句话总结

**视频理解是让 AI 从”看帧”进化到”看片”的关键能力,当前正处于从专用模型向多模态大模型统一、从学术 benc

source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型