影片理解 (Video Understanding)
3 秒看懂
一句話定義:讓 AI 像人一樣”看懂”影片——不僅能識別每一幀裡的物體,還能理解動作、因果、情節和時序關係。
核心公式直覺:
Video Understanding ≈ Image Understanding + Temporal Reasoning + Long-range Context
類比:如果說影像識別是看”照片”,影片理解就是看”電影”——需要理解鏡頭之間的敘事邏輯,而非孤立畫面。
3 分鐘產業解釋
這是什麼?
影片理解是一類以影片流為輸入、以語義理解為目標的 AI 任務總稱。涵蓋從低層(動作識別、時空定位)到高層(影片問答、因果推論)的完整任務譜系。
為什麼重要?
| 維度 | 說明 |
|---|---|
| 資料佔比 | 影片佔網際網路流量已超 80%(據行業統計,[估算]),是最大的非結構化資料來源 |
| 應用落地 | 安防監控、自動駕駛、短影片推薦、體育分析、醫療手術錄影、工業質檢 |
| 商業價值 | 全球影片分析市場規模預計 2030 年達數百億美元(各機構口徑不一,[未充分揭露]) |
和”影片生成”是什麼關係?
| 影片理解 | 影片生成 | |
|---|---|---|
| 方向 | 影片 → 結構化語義 | 語義 → 影片 |
| 代表模型 | VideoMAE、InternVideo、GPT-4o | Sora、Kling、可靈 |
| 難度瓶頸 | 長時序建模、計算效率 | 時序一致性、物理規律 |
兩者共同需要”時空表徵學習”,但任務目標相反。當前多模態大型模型(如 GPT-4o)正在將兩者統一。
15 分鐘專家深入
核心任務譜系
┌─────────────────────────────────────────────────────────────────┐
│ Video Understanding 任務層級 │
├─────────────────────────────────────────────────────────────────┤
│ L0 時空定位 │ 幀級動作檢測、時序片段定位 (TAL) │
│ L1 影片識別 │ 動作分類、場景分類、事件檢測 │
│ L2 影片描述 │ Video Captioning、密集描述 (Dense Captioning) │
│ L3 影片推論 │ Video QA、因果推論、反事實推論 │
│ L4 影片規劃 │ 基於影片的具身智慧決策、自動駕駛場景理解 │
└─────────────────────────────────────────────────────────────────┘
關鍵技術挑戰
1. 時間維度的”詛咒”
- 1秒 30fps 影片 = 30 幀影像,10分鐘影片 = 18,000 幀
- 暴力處理計算量是影像的 30×~18,000×
- 必須依賴取樣策略(均勻取樣、關鍵幀檢測)和時間建模(時序聚合、因果 Transformer)
2. 長程依賴問題
- 理解”為什麼他笑了”可能需要回憶影片開頭 3 分鐘前的一個眼神
- 自注意力的二次複雜度 O(n²) 在長序列上成為瓶頸
- 解決方案:稀疏注意力、時間分層、記憶網路
3. 多模態對齊
- 影片 = 影像 + 音訊 + 語音 + 字幕 + BGM
- 如何將多種訊號融合成統一表徵,是當前多模態研究熱點
主流技術範式
┌──────────────────────────────────────────────────────────────┐
│ 影片理解技術路線演化 │
├──────────────────────────────────────────────────────────────┤
│ │
│ CNN 時代 Transformer 時代 │
│ (2014-2020) (2021-至今) │
│ │
│ ┌─────────────┐ ┌─────────────────┐ │
│ │ 2D CNN+LSTM │ │ Vision Transformer│ │
│ │ 3D CNN │ ──────> │ (ViT + 時間建模) │ │
│ │ (C3D, I3D) │ │ VideoMAE │ │
│ │ SlowFast │ │ InternVideo │ │
│ └─────────────┘ └─────────────────┘ │
│ │ │ │
│ ▼ ▼ │
│ 手工設計時空結構 資料驅動的時空注意力 │
└──────────────────────────────────────────────────────────────┘
技術原理
1. 基礎架構:從 2D 到時空建模
2D CNN + 時間聚合(早期方案)
輸入: [B, T, C, H, W] (T幀影片)
│
├── 每幀獨立提特徵 (2D CNN) ──> [B, T, D]
│
└── 時間聚合 (LSTM/Transformer/平均池化) ──> [B, D]
│
└── 分類頭 ──> 預測結果
- 優點:複用影像預訓練模型
- 缺點:幀間互動弱,缺乏真正的時空耦合
3D CNN(時空卷積)
輸入: [B, C, T, H, W]
│
└── 3D Conv (k_t × k_h × k_w) ──> 同時提取時空特徵
│
└── [B, D, T', H', W'] ──> 全域性池化 ──> [B, D]
- 代表:C3D、I3D(Inception-3D)、SlowFast
- 關鍵設計:SlowFast 雙路徑——Slow 路徑低幀率抓語義,Fast 路徑高幀率抓運動
2. 現代範式:Video Transformer
核心思路:將影片視為時空 patch 序列,用 Transformer 建模
影片幀序列 [B, T, H, W, 3]
│
▼
時空 Patch Embedding:
將每幀切成 N 個 patch,T 幀共 T×N 個 token
可選策略:
├── Tubelet Embedding: 時空 3D patch (如 2×16×16)
└── 幀級 Patch + 時間位置編碼
│
▼
Transformer Encoder:
輸入: [B, T×N, D]
注意力機制捕捉所有 token 間關係
│
▼
任務頭: 分類 / 定位 / 生成描述
VideoMAE(Masked Autoencoder for Video)- 自監督預訓練
原理:
1. 隨機遮蓋影片中 90%+ 的時空 patch(比影像 MAE 的 75% 更激進)
2. 編碼器處理可見 patch
3. 解碼器重建被遮蓋 patch
4. 預訓練後的編碼器具有強大時空表徵能力
為何遮蓋率更高?
- 影片相鄰幀高度冗餘,資訊密度低於影像
- 更高遮蓋率迫使模型學習更本質的時空結構
3. 多模態大型模型範式(當前前沿)
┌─────────────────────────────────────────────────────┐
│ 多模態影片理解大型模型架構 │
├─────────────────────────────────────────────────────┤
│ │
│ 影片輸入 音訊輸入 文本輸入 │
│ │ │ │ │
│ ▼ ▼ ▼ │
│ 視覺編碼器 音訊編碼器 文本編碼器 │
│ (ViT) (AST) (BERT/LLM) │
│ │ │ │ │
│ └──────────┼──────────┘ │
│ ▼ │
│ 多模態融合層 │
│ (Cross-Attention / Q-Former / MLP) │
│ │ │
│ ▼ │
│ LLM 主幹 │
│ (統一推論引擎) │
│ │ │
│ ▼ │
│ 任務輸出頭 │
│ (QA/描述/分類/檢索...) │
└─────────────────────────────────────────────────────┘
關鍵設計選擇:
| 元件 | 主流方案 | 說明 |
|---|---|---|
| 視覺編碼器 | ViT-L/14、InternViT、SigLIP | 預訓練於大規模影像-文本對 |
| 幀取樣 | 均勻取樣 8~32 幀 | 更多幀 ≠ 更好,需平衡資訊量與計算量 |
| 時序建模 | SlowFast 融合 / 時間注意力池化 | 壓縮時間維度至固定 token 數 |
| LLM 骨幹 | LLaMA、Qwen、InternLM | 接收視覺 token 序列 + 文本指令 |
| 訓練策略 | 凍結編碼器 + 微調投影層 | 多階段:預訓練 → 指令微調 → RLHF |
4. 時序定位(Temporal Action Localization)機制
任務: 給定影片,定位"開門"動作的起止時間
輸入: [0s ─────────────────────── 60s]
| 動作A | 動作B |
技術流程:
1. 影片特徵提取 ──> 幀級特徵序列 [T, D]
2. 時序建模 (Transformer/卷積) ──> 捕捉動作邊界
3. 生成候選片段 (anchors / proposals)
4. 分類 + 邊界迴歸
5. NMS 後處理
輸出: 動作B: [25.3s, 38.7s], 置信度 0.92
技術演進史
2014 2016 2018 2020 2022 2024 2025+
│ │ │ │ │ │ │
▼ ▼ ▼ ▼ ▼ ▼ ▼
┌─────────┐ ┌─────┐ ┌─────┐ ┌─────┐ ┌─────┐ ┌─────┐ ┌─────┐
│Two-Stream│ │C3D │ │I3D │ │Slow-│ │TimeS│ │Video│ │多模態│
│(Simonyan)│ │ │ │ │ │Fast │ │former│ │MAE │ │統一大│
│ │ │3D │ │膨脹 │ │ │ │ │ │ │ │模型 │
│ │ │CNN │ │3D │ │ │ │ │ │ │ │ │
└─────────┘ └─────┘ └─────┘ └─────┘ └─────┘ └─────┘ └─────┘
里程碑:
• 2014 Two-Stream: 空間流+運動流,開創性
• 2017 I3D: 膨脹 Inception,ImageNet→Kinetics 遷移
• 2019 SlowFast: 雙路徑,精度/效率平衡
• 2021 TimeSformer: 純 Transformer 影片理解
• 2022 VideoMAE: 自監督影片預訓練突破
• 2023-24 InternVideo 系列: 影片理解基座模型
• 2024-25 GPT-4o/Qwen2-VL: 統一多模態,影片理解原生能力
關鍵轉折點
| 時期 | 範式轉移 | 驅動力 |
|---|---|---|
| ~2018 | 手工設計 → 資料驅動 3D 卷積 | Kinetics 資料集 [DeepMind] |
| ~2021 | CNN → Transformer | ViT 成功 + 可擴充套件性 |
| ~2023 | 有監督 → 自監督 + 基座模型 | VideoMAE、資料規模 |
| ~2024 | 獨立模型 → 多模態大型模型 | LLM 能力溢位、統一架構 |
技術路線對比
| 路線 | 代表模型 | 時間建模 | 預訓練方式 | 優點 | 缺點 | 典型精度參考 |
|---|---|---|---|---|---|---|
| 3D CNN | SlowFast, X3D | 3D 卷積核 | Kinetics 有監督 | 成熟、推論快 | 時間感受野受限 | Kinetics-400 Top-1 ~80%+ [估算] |
| Video Transformer | TimeSformer, ViViT | 時空注意力 | ImageNet→Video 遷移 | 全域性時空建模 | 計算量大、長影片困難 | Kinetics-400 Top-1 ~85%+ [估算] |
| 自監督預訓練 | VideoMAE, V-JEPA | Transformer | 遮蓋重建 | 標註高效、泛化強 | 需大規模無標籤影片 | Kinetics-400 微調 ~87%+ [估算] |
| 多模態大型模型 | GPT-4o, InternVL | LLM 隱式建模 | 視覺-語言對齊 | 統一多種任務 | 推論成本高、時序理解仍弱 | 影片 QA 精度持續重新整理 [未充分揭露] |
| 混合方案 | InternVideo2 | 分層:幀內+幀間+全域性 | 多工多資料 | 兼顧效率與精度 | 架構複雜 | SOTA 水平 [估算] |
注:上述精度為 Kinetics-400 等標準 benchmark 的大致範圍,不同論文設定有差異,[估算]。
上下游
┌─────────────────────────────────────────────────────────────────┐
│ 產業鏈全景 │
├─────────────────────────────────────────────────────────────────┤
│ │
│ 上游 (基礎設施層) │
│ ┌─────────────────────────────────────────────────────────┐ │
│ │ 算力: NVIDIA GPU (H100/A100)、雲端服務 (AWS/Azure/阿里雲端) │ │
│ │ 架構: PyTorch、JAX │ │
│ │ 資料: Kinetics (DeepMind)、ActivityNet、Ego4D │ │
│ └─────────────────────────────────────────────────────────┘ │
│ │ │
│ ▼ │
│ 中游 (模型層) │
│ ┌─────────────────────────────────────────────────────────┐ │
│ │ 學術: VideoMAE (南京大學/上海人工智慧實驗室)、TimeSformer (Meta) │ │
│ │ 開源: InternVideo (上海AI Lab)、Qwen2-VL (阿里) │ │
│ │ 商業: Google Gemini、OpenAI GPT-4o、字節跳動 │ │
│ └─────────────────────────────────────────────────────────┘ │
│ │ │
│ ▼ │
│ 下游 (應用層) │
│ ┌─────────────────────────────────────────────────────────┐ │
│ │ 安防監控: 海康威視、曠視、商湯 │ │
│ │ 自動駕駛: Waymo、Tesla、小鵬 │ │
│ │ 內容稽核: 位元組、Meta、YouTube │ │
│ │ 短影片/推薦: 抖音、快手、TikTok │ │
│ │ 體育/醫療: IBM Watson、各垂直創業公司 │ │
│ └─────────────────────────────────────────────────────────┘ │
└─────────────────────────────────────────────────────────────────┘
關鍵指標
模型效能指標
| 指標 | 定義 | 說明 |
|---|---|---|
| Top-1 Accuracy | 動作/場景分類準確率 | Kinetics-400/700 標準 benchmark |
| mAP (mean Average Precision) | 時序動作定位精度 | ActivityNet 挑戰賽主指標 |
| Video QA Accuracy | 影片問答正確率 | MSRVTT-QA、ActivityNet-QA 等 |
| CIDEr / BLEU | 影片描述生成質量 | 文本生成任務標準指標 |
工程效率指標
| 指標 | 典型範圍 | 說明 |
|---|---|---|
| 幀取樣數 | 8~32 幀 | 影響精度-效率平衡 |
| FLOPs / 影片 | 數十G ~ 數百G | 取決於幀數和模型大小 |
| 推論延遲 | 數十ms ~ 數百ms / 影片 | 即時應用需 <100ms |
| 視訊記憶體佔用 | 數 GB ~ 數十 GB | 長影片高解析度場景劇增 |
評估維度
影片理解模型評估四象限:
高精度
│
┌───────────┼───────────┐
│ 學術SOTA │ 實用SOTA │
│ (VideoMAE │ (InternVideo│
│ 巨模型) │ 最佳化版) │
低效率──┼───────────┼───────────┤──高效率
│ 不可用 │ 邊緣部署 │
│ │ (MobileViT) │
└───────────┼───────────┘
│
低精度
供需與市場資料
⚠️ 以下資料來自行業報告和公開資訊,各機構口徑存在差異,部分為[估算]。
需求側
| 應用場景 | 市場驅動力 | 規模估算 |
|---|---|---|
| 安防監控 | 智慧城市、平安城市政策 | 全球影片監控市場 2030 年預計超 800 億美元 [估算] |
| 自動駕駛 | L3+ 滲透率提升 | 單車影片感測器成本數百美元 [估算] |
| 內容稽核 | 監管合規、平台治理 | 全球內容稽核市場 2030 年預計超 100 億美元 [估算] |
| 短影片推薦 | 使用者時長競爭 | 頭部平台影片理解研發投入年均數億美元 [估算] |
供給側
| 供給型別 | 代表 | 競爭格局 |
|---|---|---|
| 基礎模型 API | OpenAI、Google、阿里雲端 | 寡頭格局,頭部優勢明顯 |
| 開源模型 | HuggingFace、GitHub | 生態繁榮,學術驅動 |
| 垂直解決方案 | 海康威視、曠視、商湯 | 行業Know-How壁壘 |
| 晶片/硬體 | NVIDIA、地緣替代 | NVIDIA 生態鎖定強 |
代表公司與資本對映
| 層級 | 公司 | 關鍵產品/技術 | 資本市場對映 |
|---|---|---|---|
| 算力 | NVIDIA | GPU (H100/B100) | NVDA (NASDAQ) |
| 雲端服務 | 阿里雲端、AWS、Azure | 影片理解 API | BABA (NYSE)、AMZN、MSFT |
| 模型層 | OpenAI | GPT-4o 影片理解 | 非上市 |
| Gemini 1.5 Pro | GOOGL (NASDAQ) | ||
| 阿里 | Qwen2-VL | BABA (NYSE) | |
| 字節跳動 | 豆包、影片創作 | 非上市 | |
| 上海 AI Lab | InternVideo | 非營利研究機構 | |
| 應用層 | 海康威視 | 安防影片分析 | 002415.SZ |
| 商湯科技 | SenseTime 影片分析 | 0020.HK | |
| 曠視科技 | 影片結構化 | 未上市 | |
| 大華股份 | 安防影片分析 | 002236.SZ |
投資邏輯
核心邏輯
┌─────────────────────┐
│ 影片資料爆炸式增長 │
└──────────┬──────────┘
│
┌──────────▼──────────┐
│ 理解能力成為"水和電" │
│ (基礎設施化) │
└──────────┬──────────┘
│
┌───────────────────┼───────────────────┐
│ │ │
┌──────▼──────┐ ┌──────▼──────┐ ┌──────▼──────┐
│ 算力需求 │ │ 模型層 │ │ 應用層 │
│ (GPU/TPU) │ │ (大型模型API)│ │ (垂直場景) │
│ 確定性最高 │ │ 馬太效應 │ │ 分散競爭 │
└─────────────┘ └─────────────┘ └─────────────┘
關鍵觀點
- 算力確定性最高:影片理解是計算密集型任務,幀數 × 解析度 × 模型規模 → 持續推高算力需求
- 多模態大型模型是終局方向:獨立的影片理解模型可能被統一多模態模型吸收
- 垂直場景仍有視窗期:安防、自動駕駛等場景需要行業Know-How,純模型公司難以通吃
- 開源 vs 閉源博弈:開源社群(InternVideo、Qwen2-VL)正在快速追趕商業閉源模型
風險提示
- 技術迭代快,模型能力可能快速商品化
- 算力成本仍是主要瓶頸,影響落地速度
- 多模態大型模型統一趨勢下,獨立影片理解公司存在被整合風險
常見誤讀糾偏
誤讀 1:“影片理解 = 逐幀影像識別 + 簡單聚合”
糾偏:早期確實如此(2D CNN + LSTM),但現代影片理解的核心價值在於時空耦合建模。
- 識別”開門”需要理解”手靠近門把手 → 轉動 → 門開”的時間因果鏈
- 識別”過馬路”需要理解行人與車輛的時空互動關係
- 這些無法通過逐幀識別捕獲
結論:時間維度不是”加法”,而是帶來質變的”乘法”。
誤讀 2:“影片理解模型越大越好,幀數越多越好”
糾偏:
- 模型大小:存在收益遞減,且推論成本指數增長。工業落地更看重精度/成本比
- 幀數:影片高度冗餘,相鄰幀差異極小。研究表明 8~16 幀均勻取樣已能覆蓋大部分語義資訊
- 關鍵:取樣策略和時間建模能力 > 暴力堆疊幀數
誤讀 3:“影片理解已經成熟,可以大規模商用”
糾偏:
- 在封閉場景(如動作識別、簡單影片分類)確實已商用
- 但在開放場景(長影片理解、因果推論、多輪影片對話)仍有明顯不足
- 主要瓶頸:長時序建模、計算效率、高質量標註資料稀缺
誤讀 4:“Transformer 已經完全取代 CNN”
糾偏:
- 在學術研究和大型模型領域,Transformer 確實是主流
- 但在邊緣部署(安防攝像頭、手機端)場景,輕量級 CNN(如 MobileNet 變體)仍佔主導
- 現實中常採用混合架構:CNN 提特徵 + Transformer 建模
學習路徑
入門(1~2 周)
| 資源 | 說明 |
|---|---|
| CS231n (Stanford) | 計算機視覺基礎,含影片理解章節 |
| 《動手學深度學習》(d2l) | PyTorch 實現,入門友好 |
| Kinetics 資料集瀏覽 | 建立對影片分類任務的直覺 |
進階(1~2 月)
| 資源 | 說明 |
|---|---|
| SlowFast 論文 [FAIR] | 理解經典 3D CNN 設計 |
| TimeSformer 論文 [FAIR] | 理解 Video Transformer |
| VideoMAE 論文 [Nanjing Univ / Shanghai AI Lab] | 自監督預訓練範式 |
前沿(持續追蹤)
| 資源 | 說明 |
|---|---|
| InternVideo 系列論文 [上海AI Lab] | 多模態影片理解基座 |
| GPT-4o / Gemini 技術報告 | 商業多模態模型的能力邊界 |
| Ego4D 資料集 [Meta FAIR] | 第一人稱影片理解前沿 |
實踐專案
- 入門:用 PyTorch 復現 VideoMAE,微調 Kinetics-400
- 進階:基於 InternVideo 做 Video QA 應用
- 挑戰:長影片理解(HourVideo 級別),探索高效時序建模
一句話總結
**影片理解是讓 AI 從”看幀”進化到”看片”的關鍵能力,當前正處於從專用模型向多模態大型模型統一、從學術 benc