模型層 開放閱讀

影片理解

Video Understanding

概念 ID
video-understanding
更新時間
2026-05-29
來源數量
待補

影片理解 (Video Understanding)

3 秒看懂

一句話定義:讓 AI 像人一樣”看懂”影片——不僅能識別每一幀裡的物體,還能理解動作、因果、情節和時序關係。

核心公式直覺

Video Understanding ≈ Image Understanding + Temporal Reasoning + Long-range Context

類比:如果說影像識別是看”照片”,影片理解就是看”電影”——需要理解鏡頭之間的敘事邏輯,而非孤立畫面。

3 分鐘產業解釋

這是什麼?

影片理解是一類以影片流為輸入、以語義理解為目標的 AI 任務總稱。涵蓋從低層(動作識別、時空定位)到高層(影片問答、因果推論)的完整任務譜系。

為什麼重要?

維度說明
資料佔比影片佔網際網路流量已超 80%(據行業統計,[估算]),是最大的非結構化資料來源
應用落地安防監控、自動駕駛、短影片推薦、體育分析、醫療手術錄影、工業質檢
商業價值全球影片分析市場規模預計 2030 年達數百億美元(各機構口徑不一,[未充分揭露])

和”影片生成”是什麼關係?

影片理解影片生成
方向影片 → 結構化語義語義 → 影片
代表模型VideoMAE、InternVideo、GPT-4oSora、Kling、可靈
難度瓶頸長時序建模、計算效率時序一致性、物理規律

兩者共同需要”時空表徵學習”,但任務目標相反。當前多模態大型模型(如 GPT-4o)正在將兩者統一。

15 分鐘專家深入

核心任務譜系

┌─────────────────────────────────────────────────────────────────┐
│                    Video Understanding 任務層級                   │
├─────────────────────────────────────────────────────────────────┤
│  L0 時空定位    │ 幀級動作檢測、時序片段定位 (TAL)               │
│  L1 影片識別    │ 動作分類、場景分類、事件檢測                    │
│  L2 影片描述    │ Video Captioning、密集描述 (Dense Captioning)  │
│  L3 影片推論    │ Video QA、因果推論、反事實推論                  │
│  L4 影片規劃    │ 基於影片的具身智慧決策、自動駕駛場景理解        │
└─────────────────────────────────────────────────────────────────┘

關鍵技術挑戰

1. 時間維度的”詛咒”

  • 1秒 30fps 影片 = 30 幀影像,10分鐘影片 = 18,000 幀
  • 暴力處理計算量是影像的 30×~18,000×
  • 必須依賴取樣策略(均勻取樣、關鍵幀檢測)和時間建模(時序聚合、因果 Transformer)

2. 長程依賴問題

  • 理解”為什麼他笑了”可能需要回憶影片開頭 3 分鐘前的一個眼神
  • 自注意力的二次複雜度 O(n²) 在長序列上成為瓶頸
  • 解決方案:稀疏注意力、時間分層、記憶網路

3. 多模態對齊

  • 影片 = 影像 + 音訊 + 語音 + 字幕 + BGM
  • 如何將多種訊號融合成統一表徵,是當前多模態研究熱點

主流技術範式

┌──────────────────────────────────────────────────────────────┐
│                   影片理解技術路線演化                          │
├──────────────────────────────────────────────────────────────┤
│                                                              │
│  CNN 時代                 Transformer 時代                    │
│  (2014-2020)              (2021-至今)                        │
│                                                              │
│  ┌─────────────┐          ┌─────────────────┐               │
│  │ 2D CNN+LSTM │          │ Vision Transformer│              │
│  │ 3D CNN      │ ──────> │  (ViT + 時間建模) │              │
│  │ (C3D, I3D)  │          │  VideoMAE       │               │
│  │ SlowFast    │          │  InternVideo    │               │
│  └─────────────┘          └─────────────────┘               │
│         │                          │                         │
│         ▼                          ▼                         │
│  手工設計時空結構           資料驅動的時空注意力               │
└──────────────────────────────────────────────────────────────┘

技術原理

1. 基礎架構:從 2D 到時空建模

2D CNN + 時間聚合(早期方案)

輸入: [B, T, C, H, W]  (T幀影片)

     ├── 每幀獨立提特徵 (2D CNN) ──> [B, T, D]

     └── 時間聚合 (LSTM/Transformer/平均池化) ──> [B, D]

            └── 分類頭 ──> 預測結果
  • 優點:複用影像預訓練模型
  • 缺點:幀間互動弱,缺乏真正的時空耦合

3D CNN(時空卷積)

輸入: [B, C, T, H, W]

     └── 3D Conv (k_t × k_h × k_w) ──> 同時提取時空特徵

            └── [B, D, T', H', W'] ──> 全域性池化 ──> [B, D]
  • 代表:C3D、I3D(Inception-3D)、SlowFast
  • 關鍵設計:SlowFast 雙路徑——Slow 路徑低幀率抓語義,Fast 路徑高幀率抓運動

2. 現代範式:Video Transformer

核心思路:將影片視為時空 patch 序列,用 Transformer 建模

影片幀序列 [B, T, H, W, 3]


時空 Patch Embedding: 
  將每幀切成 N 個 patch,T 幀共 T×N 個 token
  可選策略:
  ├── Tubelet Embedding: 時空 3D patch (如 2×16×16)
  └── 幀級 Patch + 時間位置編碼


Transformer Encoder:
  輸入: [B, T×N, D]
  注意力機制捕捉所有 token 間關係


任務頭: 分類 / 定位 / 生成描述

VideoMAE(Masked Autoencoder for Video)- 自監督預訓練

原理:
1. 隨機遮蓋影片中 90%+ 的時空 patch(比影像 MAE 的 75% 更激進)
2. 編碼器處理可見 patch
3. 解碼器重建被遮蓋 patch
4. 預訓練後的編碼器具有強大時空表徵能力

為何遮蓋率更高?
- 影片相鄰幀高度冗餘,資訊密度低於影像
- 更高遮蓋率迫使模型學習更本質的時空結構

3. 多模態大型模型範式(當前前沿)

┌─────────────────────────────────────────────────────┐
│           多模態影片理解大型模型架構                      │
├─────────────────────────────────────────────────────┤
│                                                     │
│  影片輸入    音訊輸入    文本輸入                       │
│     │          │          │                         │
│     ▼          ▼          ▼                         │
│  視覺編碼器  音訊編碼器  文本編碼器                     │
│  (ViT)      (AST)     (BERT/LLM)                   │
│     │          │          │                         │
│     └──────────┼──────────┘                         │
│                ▼                                    │
│         多模態融合層                                  │
│   (Cross-Attention / Q-Former / MLP)                │
│                │                                    │
│                ▼                                    │
│            LLM 主幹                                 │
│        (統一推論引擎)                                 │
│                │                                    │
│                ▼                                    │
│          任務輸出頭                                   │
│  (QA/描述/分類/檢索...)                               │
└─────────────────────────────────────────────────────┘

關鍵設計選擇

元件主流方案說明
視覺編碼器ViT-L/14、InternViT、SigLIP預訓練於大規模影像-文本對
幀取樣均勻取樣 8~32 幀更多幀 ≠ 更好,需平衡資訊量與計算量
時序建模SlowFast 融合 / 時間注意力池化壓縮時間維度至固定 token 數
LLM 骨幹LLaMA、Qwen、InternLM接收視覺 token 序列 + 文本指令
訓練策略凍結編碼器 + 微調投影層多階段:預訓練 → 指令微調 → RLHF

4. 時序定位(Temporal Action Localization)機制

任務: 給定影片,定位"開門"動作的起止時間

輸入: [0s ─────────────────────── 60s]
      |    動作A    |    動作B    |

技術流程:
1. 影片特徵提取 ──> 幀級特徵序列 [T, D]
2. 時序建模 (Transformer/卷積) ──> 捕捉動作邊界
3. 生成候選片段 (anchors / proposals)
4. 分類 + 邊界迴歸
5. NMS 後處理

輸出: 動作B: [25.3s, 38.7s], 置信度 0.92

技術演進史

2014    2016    2018    2020    2022    2024    2025+
  │       │       │       │       │       │       │
  ▼       ▼       ▼       ▼       ▼       ▼       ▼
┌─────────┐ ┌─────┐ ┌─────┐ ┌─────┐ ┌─────┐ ┌─────┐ ┌─────┐
│Two-Stream│ │C3D  │ │I3D  │ │Slow-│ │TimeS│ │Video│ │多模態│
│(Simonyan)│ │     │ │     │ │Fast │ │former│ │MAE  │ │統一大│
│         │ │3D   │ │膨脹 │ │     │ │     │ │     │ │模型 │
│         │ │CNN  │ │3D   │ │     │ │     │ │     │ │     │
└─────────┘ └─────┘ └─────┘ └─────┘ └─────┘ └─────┘ └─────┘

里程碑:
• 2014 Two-Stream: 空間流+運動流,開創性
• 2017 I3D: 膨脹 Inception,ImageNet→Kinetics 遷移
• 2019 SlowFast: 雙路徑,精度/效率平衡
• 2021 TimeSformer: 純 Transformer 影片理解
• 2022 VideoMAE: 自監督影片預訓練突破
• 2023-24 InternVideo 系列: 影片理解基座模型
• 2024-25 GPT-4o/Qwen2-VL: 統一多模態,影片理解原生能力

關鍵轉折點

時期範式轉移驅動力
~2018手工設計 → 資料驅動 3D 卷積Kinetics 資料集 [DeepMind]
~2021CNN → TransformerViT 成功 + 可擴充套件性
~2023有監督 → 自監督 + 基座模型VideoMAE、資料規模
~2024獨立模型 → 多模態大型模型LLM 能力溢位、統一架構

技術路線對比

路線代表模型時間建模預訓練方式優點缺點典型精度參考
3D CNNSlowFast, X3D3D 卷積核Kinetics 有監督成熟、推論快時間感受野受限Kinetics-400 Top-1 ~80%+ [估算]
Video TransformerTimeSformer, ViViT時空注意力ImageNet→Video 遷移全域性時空建模計算量大、長影片困難Kinetics-400 Top-1 ~85%+ [估算]
自監督預訓練VideoMAE, V-JEPATransformer遮蓋重建標註高效、泛化強需大規模無標籤影片Kinetics-400 微調 ~87%+ [估算]
多模態大型模型GPT-4o, InternVLLLM 隱式建模視覺-語言對齊統一多種任務推論成本高、時序理解仍弱影片 QA 精度持續重新整理 [未充分揭露]
混合方案InternVideo2分層:幀內+幀間+全域性多工多資料兼顧效率與精度架構複雜SOTA 水平 [估算]

注:上述精度為 Kinetics-400 等標準 benchmark 的大致範圍,不同論文設定有差異,[估算]。


上下游

┌─────────────────────────────────────────────────────────────────┐
│                         產業鏈全景                                │
├─────────────────────────────────────────────────────────────────┤
│                                                                 │
│  上游 (基礎設施層)                                               │
│  ┌─────────────────────────────────────────────────────────┐   │
│  │  算力: NVIDIA GPU (H100/A100)、雲端服務 (AWS/Azure/阿里雲端) │   │
│  │  架構: PyTorch、JAX                                      │   │
│  │  資料: Kinetics (DeepMind)、ActivityNet、Ego4D           │   │
│  └─────────────────────────────────────────────────────────┘   │
│                            │                                    │
│                            ▼                                    │
│  中游 (模型層)                                                   │
│  ┌─────────────────────────────────────────────────────────┐   │
│  │  學術: VideoMAE (南京大學/上海人工智慧實驗室)、TimeSformer (Meta) │   │
│  │  開源: InternVideo (上海AI Lab)、Qwen2-VL (阿里)         │   │
│  │  商業: Google Gemini、OpenAI GPT-4o、字節跳動            │   │
│  └─────────────────────────────────────────────────────────┘   │
│                            │                                    │
│                            ▼                                    │
│  下游 (應用層)                                                   │
│  ┌─────────────────────────────────────────────────────────┐   │
│  │  安防監控: 海康威視、曠視、商湯                            │   │
│  │  自動駕駛: Waymo、Tesla、小鵬                             │   │
│  │  內容稽核: 位元組、Meta、YouTube                            │   │
│  │  短影片/推薦: 抖音、快手、TikTok                          │   │
│  │  體育/醫療: IBM Watson、各垂直創業公司                     │   │
│  └─────────────────────────────────────────────────────────┘   │
└─────────────────────────────────────────────────────────────────┘

關鍵指標

模型效能指標

指標定義說明
Top-1 Accuracy動作/場景分類準確率Kinetics-400/700 標準 benchmark
mAP (mean Average Precision)時序動作定位精度ActivityNet 挑戰賽主指標
Video QA Accuracy影片問答正確率MSRVTT-QA、ActivityNet-QA 等
CIDEr / BLEU影片描述生成質量文本生成任務標準指標

工程效率指標

指標典型範圍說明
幀取樣數8~32 幀影響精度-效率平衡
FLOPs / 影片數十G ~ 數百G取決於幀數和模型大小
推論延遲數十ms ~ 數百ms / 影片即時應用需 <100ms
視訊記憶體佔用數 GB ~ 數十 GB長影片高解析度場景劇增

評估維度

影片理解模型評估四象限:
                    高精度

          ┌───────────┼───────────┐
          │  學術SOTA │ 實用SOTA  │
          │ (VideoMAE │ (InternVideo│
          │  巨模型)  │  最佳化版)   │
  低效率──┼───────────┼───────────┤──高效率
          │  不可用   │  邊緣部署  │
          │           │ (MobileViT) │
          └───────────┼───────────┘

                    低精度

供需與市場資料

⚠️ 以下資料來自行業報告和公開資訊,各機構口徑存在差異,部分為[估算]。

需求側

應用場景市場驅動力規模估算
安防監控智慧城市、平安城市政策全球影片監控市場 2030 年預計超 800 億美元 [估算]
自動駕駛L3+ 滲透率提升單車影片感測器成本數百美元 [估算]
內容稽核監管合規、平台治理全球內容稽核市場 2030 年預計超 100 億美元 [估算]
短影片推薦使用者時長競爭頭部平台影片理解研發投入年均數億美元 [估算]

供給側

供給型別代表競爭格局
基礎模型 APIOpenAI、Google、阿里雲端寡頭格局,頭部優勢明顯
開源模型HuggingFace、GitHub生態繁榮,學術驅動
垂直解決方案海康威視、曠視、商湯行業Know-How壁壘
晶片/硬體NVIDIA、地緣替代NVIDIA 生態鎖定強

代表公司與資本對映

層級公司關鍵產品/技術資本市場對映
算力NVIDIAGPU (H100/B100)NVDA (NASDAQ)
雲端服務阿里雲端、AWS、Azure影片理解 APIBABA (NYSE)、AMZN、MSFT
模型層OpenAIGPT-4o 影片理解非上市
GoogleGemini 1.5 ProGOOGL (NASDAQ)
阿里Qwen2-VLBABA (NYSE)
字節跳動豆包、影片創作非上市
上海 AI LabInternVideo非營利研究機構
應用層海康威視安防影片分析002415.SZ
商湯科技SenseTime 影片分析0020.HK
曠視科技影片結構化未上市
大華股份安防影片分析002236.SZ

投資邏輯

核心邏輯

                    ┌─────────────────────┐
                    │   影片資料爆炸式增長  │
                    └──────────┬──────────┘

                    ┌──────────▼──────────┐
                    │ 理解能力成為"水和電" │
                    │  (基礎設施化)        │
                    └──────────┬──────────┘

           ┌───────────────────┼───────────────────┐
           │                   │                   │
    ┌──────▼──────┐    ┌──────▼──────┐    ┌──────▼──────┐
    │  算力需求   │    │  模型層     │    │  應用層     │
    │  (GPU/TPU)  │    │  (大型模型API)│    │  (垂直場景) │
    │  確定性最高  │    │  馬太效應   │    │  分散競爭   │
    └─────────────┘    └─────────────┘    └─────────────┘

關鍵觀點

  1. 算力確定性最高:影片理解是計算密集型任務,幀數 × 解析度 × 模型規模 → 持續推高算力需求
  2. 多模態大型模型是終局方向:獨立的影片理解模型可能被統一多模態模型吸收
  3. 垂直場景仍有視窗期:安防、自動駕駛等場景需要行業Know-How,純模型公司難以通吃
  4. 開源 vs 閉源博弈:開源社群(InternVideo、Qwen2-VL)正在快速追趕商業閉源模型

風險提示

  • 技術迭代快,模型能力可能快速商品化
  • 算力成本仍是主要瓶頸,影響落地速度
  • 多模態大型模型統一趨勢下,獨立影片理解公司存在被整合風險

常見誤讀糾偏

誤讀 1:“影片理解 = 逐幀影像識別 + 簡單聚合”

糾偏:早期確實如此(2D CNN + LSTM),但現代影片理解的核心價值在於時空耦合建模

  • 識別”開門”需要理解”手靠近門把手 → 轉動 → 門開”的時間因果鏈
  • 識別”過馬路”需要理解行人與車輛的時空互動關係
  • 這些無法通過逐幀識別捕獲

結論:時間維度不是”加法”,而是帶來質變的”乘法”。

誤讀 2:“影片理解模型越大越好,幀數越多越好”

糾偏

  • 模型大小:存在收益遞減,且推論成本指數增長。工業落地更看重精度/成本比
  • 幀數:影片高度冗餘,相鄰幀差異極小。研究表明 8~16 幀均勻取樣已能覆蓋大部分語義資訊
  • 關鍵:取樣策略和時間建模能力 > 暴力堆疊幀數

誤讀 3:“影片理解已經成熟,可以大規模商用”

糾偏

  • 封閉場景(如動作識別、簡單影片分類)確實已商用
  • 但在開放場景(長影片理解、因果推論、多輪影片對話)仍有明顯不足
  • 主要瓶頸:長時序建模、計算效率、高質量標註資料稀缺

誤讀 4:“Transformer 已經完全取代 CNN”

糾偏

  • 在學術研究和大型模型領域,Transformer 確實是主流
  • 但在邊緣部署(安防攝像頭、手機端)場景,輕量級 CNN(如 MobileNet 變體)仍佔主導
  • 現實中常採用混合架構:CNN 提特徵 + Transformer 建模

學習路徑

入門(1~2 周)

資源說明
CS231n (Stanford)計算機視覺基礎,含影片理解章節
《動手學深度學習》(d2l)PyTorch 實現,入門友好
Kinetics 資料集瀏覽建立對影片分類任務的直覺

進階(1~2 月)

資源說明
SlowFast 論文 [FAIR]理解經典 3D CNN 設計
TimeSformer 論文 [FAIR]理解 Video Transformer
VideoMAE 論文 [Nanjing Univ / Shanghai AI Lab]自監督預訓練範式

前沿(持續追蹤)

資源說明
InternVideo 系列論文 [上海AI Lab]多模態影片理解基座
GPT-4o / Gemini 技術報告商業多模態模型的能力邊界
Ego4D 資料集 [Meta FAIR]第一人稱影片理解前沿

實踐專案

  1. 入門:用 PyTorch 復現 VideoMAE,微調 Kinetics-400
  2. 進階:基於 InternVideo 做 Video QA 應用
  3. 挑戰:長影片理解(HourVideo 級別),探索高效時序建模

一句話總結

**影片理解是讓 AI 從”看幀”進化到”看片”的關鍵能力,當前正處於從專用模型向多模態大型模型統一、從學術 benc

source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型