模型層 開放閱讀

LLaVA

Large Language and Vision Assistant

概念 ID
large-language-and-vision-assistant
更新時間
2026-05-29
來源數量
待補

LLaVA (Large Language and Vision Assistant)

⚠️ 資料說明:本頁寫作時檢索資料獲取失敗(HTTP 403/429),以下內容基於公開學術文獻的一般性理解,具體技術規格、效能資料、商業融資等若無確切來源則標註為**[未充分檢索確認][定性估計]**。建議讀者交叉驗證關鍵資料點。

1. 3 秒看懂

LLaVA = 視覺編碼器 + 投影層 + 大語言模型
       圖片理解        連線橋樑      指令遵循

一句話:用"視覺指令微調"讓大語言模型能看圖、聊圖的開源多模態架構

2. 3 分鐘產業解釋

LLaVA 是什麼?

LLaVA(Large Language and Vision Assistant)是一個開源視覺語言模型(VLM),由威斯康辛大學麥迪遜分校 Haotian Liu 等人主導提出。其核心貢獻是提出了一種簡單但有效的**視覺指令微調(Visual Instruction Tuning)**方法,將預訓練的視覺編碼器與大語言模型通過輕量級連線層融合,使語言模型獲得”看圖說話”的能力。

產業定位

維度說明
技術路線屬於 LLM-based MLLM(基於大語言模型的多模態大型模型)範式
開源程度模型權重、訓練程式碼、資料建置流程均開源
主要競品Flamingo、BLIP-2、InstructBLIP、Qwen-VL、InternVL 等
典型應用圖文對話、視覺問答(VQA)、圖表理解、文件 OCR、多圖推論

為什麼重要?

LLaVA 的意義在於:

  1. 範式簡潔性:證明了用相對簡單的架構+高質量指令資料,可達到或接近複雜的模組化方案效能
  2. 開源生態貢獻:降低了多模態研究和應用的門檻
  3. 資料方法論:創造性地利用 GPT-4(文本能力)自動生成視覺指令資料,開闢了”LLM輔助資料生成”範式

3. 15 分鐘專家深入

3.1 核心架構思路

LLaVA 的設計哲學是**“嫁接”而非”從頭訓練”**:

┌─────────────┐      ┌──────────────┐      ┌─────────────┐
│  視覺編碼器  │─────▶│  投影層/介面卡 │─────▶│  大語言模型  │
│ (CLIP ViT)  │      │ (Linear/MLP) │      │  (LLaMA系)  │
└─────────────┘      └──────────────┘      └─────────────┘
     圖片 tokens          橋接              語言生成

關鍵設計選擇:

  • 視覺編碼器:採用 CLIP 訓練的 ViT(Vision Transformer),提取圖片的語義特徵
  • 連線層:從簡單線性層(LLaVA 1.0)演進到兩層 MLP(LLaVA 1.5),是引數高效的關鍵
  • 語言模型:基於 Meta LLaMA 系列的開源模型(早期用 Vicuna,後續版本用 LLaMA-2 等)

3.2 視覺指令微調方法論

LLaVA 的訓練創新主要在資料建置而非架構:

階段一:特徵對齊預訓練

  • 凍結視覺編碼器和語言模型,僅訓練連線層
  • 使用大規模圖文對資料(如 CC3M 的子集)[具體規模未充分檢索確認]
  • 目的:讓投影層學會將視覺特徵”翻譯”為語言模型可理解的嵌入空間

階段二:端到端視覺指令微調

  • 凍結視覺編碼器,聯合訓練連線層和語言模型
  • 使用 GPT-4 輔助生成的視覺指令資料(這是核心創新)
  • 資料形式:(圖片, 對話/推論/描述指令, 回答) 三元組

GPT-4 資料生成流程(LLaVA 的重要貢獻):

輸入:圖片的描述/標註/COCO caption

GPT-4 文本處理(利用其強大的指令遵循和推論能力)

輸出:多樣化的視覺問答、推論、對話資料

這種方法繞開了”GPT-4 無法直接看圖”的限制(早期版本),通過文本描述中轉。

3.3 版本演進概述

版本關鍵改進
LLaVA 1.0首次提出視覺指令微調架構,線性投影層
LLaVA 1.5投影層升級為 2 層 MLP,資料質量提升,效能顯著改進
LLaVA-NeXT支援更高解析度輸入、多圖理解、更強大語言模型骨幹
LLaVA-OneVision統一影像/影片/多圖理解的單一模型

⚠️ 以上版本資訊基於公開論文的一般性認知,具體釋出時間線、引數規模等細節未充分檢索確認,請以官方 GitHub 倉庫為準。


4. 技術原理(深入機制)

4.1 視覺編碼與 Token 化

輸入圖片 (H × W × 3)

CLIP ViT-L/14 (預訓練, 凍結)

Patch 特徵序列: [v₁, v₂, ..., vₙ]

[CLS] token + patch tokens → 視覺 token 序列

技術細節:

  • ViT 將圖片劃分為固定大小的 patch(通常 14×14 或 16×16 畫素)
  • 每個 patch 經過線性嵌入 + 位置編碼 + Transformer 編碼器
  • 輸出的 token 數量 = (H/patch_size) × (W/patch_size) + 1(CLS)
  • 例如:336×336 輸入,patch_size=14 → 24×24 = 576 個視覺 tokens + 1 CLS

4.2 投影層機制

# LLaVA 1.0: 線性投影
visual_embeds = Linear(vision_encoder_output)  # d_vit → d_llm

# LLaVA 1.5: 兩層 MLP + GELU
visual_embeds = Linear2(GELU(Linear1(vision_encoder_output)))
# d_vit → d_hidden → d_llm

關鍵點:

  • 投影層是唯一從頭訓練的元件(預訓練階段)
  • 維度對映:將視覺編碼器輸出維度對齊到語言模型的嵌入維度
  • 引數量相對語言模型極小(可能僅數千萬量級 [估算])

4.3 輸入序列拼接

實際輸入序列 = [系統提示 tokens] + [視覺 tokens] + [使用者文本 tokens]
                      ↓                  ↓                ↓
               LLM 嵌入空間中         投影後的視覺       原始文本嵌入

視覺 tokens 被插入到文本序列的指定位置(通常在系統提示之後、使用者問題之前),語言模型將其與文本 tokens 一同處理。

4.4 訓練損失

標準的自迴歸語言建模損失(Next Token Prediction),對整個序列(包括描述視覺內容的 token)計算。


5. 技術演進史

2021    CLIP (OpenAI) 奠定視覺-語言對齊基礎

2022    Flamingo (DeepMind) 首次展示大規模視覺語言模型能力
        BLIP (Salesforce) 模組化多模態架構

2023 Q1 BLIP-2 (Salesforce) — Q-Former 連線凍僵視覺與語言模型
        同年初,LLaVA 1.0 釋出 — 視覺指令微調範式

2023 Q3 LLaVA 1.5 — MLP 投影、資料最佳化
        在多個基準上與更大/更復雜的模型競爭

2023-2024 開源社群大量衍生:
        LLaVA-RLHF, LLaVA-Med, LLaVA-Plus 等

2024    LLaVA-NeXT, LLaVA-OneVision 等持續迭代
        向更高解析度、多圖、影片理解擴充套件

產業節點:

  • LLaVA 的釋出標誌著**“多模態民主化”**的開始——不再只有大公司能訓練有競爭力的 VLM
  • 催生了開源 MLLM 生態的繁榮:InternVL、Qwen-VL、DeepSeek-VL 等均受其影響

6. 技術路線對比

多模態連線方式對比

方案代表模型連線方式引數效率效能
輕量投影LLaVALinear/MLP極高中→高(靠資料質量)
交叉注意力FlamingoPerceiver Resampler + Cross-Attn
Q-FormerBLIP-2學習的 Query Token 交叉注意力
混合專家MoE-LLaVA 等路由機制視設計探索中

訓練範式對比

維度LLaVA 路線模組化路線(如 BLIP-2)
預訓練階段僅訓練投影層訓練 Q-Former 等連線模組
指令微調端到端微調 LLM + 投影可能凍結 LLM
資料依賴依賴 GPT-4 生成資料依賴大規模圖文對
架構複雜度簡單相對複雜
可復現性高(程式碼/資料開源)中(部分元件不開源)

7. 上下游

上游(LLaVA 依賴什麼)

環節關鍵依賴代表
視覺編碼器CLIP 預訓練的 ViTOpenAI CLIP ViT-L/14 等
語言模型開源 LLM 預訓練權重Meta LLaMA / Vicuna
訓練資料圖文對 + GPT-4 生成的指令資料COCO、CC3M 子集 + 合成數據
訓練算力GPU 叢集具體規模未充分檢索確認
GPT-4 API資料生成依賴OpenAI

下游(LLaVA 可用於什麼)

應用方向場景
通用圖文對話使用者上傳圖片進行多輪對話
視覺問答(VQA)圖片內容理解與問答
文件/圖表理解OCR、表格提取、圖表分析
醫學影像LLaVA-Med 等垂直領域適配
機器人視覺與具身智慧系統結合
多模態 Agent作為視覺理解骨幹

8. 關鍵指標

模型效能基準(定性參考)

LLaVA 在以下基準上進行評測(具體數值因版本和評測設定而異):

基準說明LLaVA 1.5 表現
VQAv2開放域視覺問答有競爭力 [具體分數未檢索確認]
GQA場景圖推論問答中上水平
TextVQA文字識別問答表現依賴 OCR 能力
MMBench綜合多模態基準較強 [具體分數未檢索確認]
MME多模態理解評測較強
ScienceQA科學推論突出

⚠️ 具體評測分數請參考官方論文 Table,本頁未檢索到確切資料。

效率指標

指標說明
訓練資源LLaVA 1.0 據報約 8×A100 訓練約數小時 [未充分檢索確認]
推論延遲取決於 LLM 骨幹大小和圖片解析度
引數量級視覺編碼器 ~304M + LLM 7B/13B 等 + 投影層數千萬 [估算]

9. 供需與市場資料

開源模型使用情況(定性)

維度說明
GitHub StarsLLaVA 官方倉庫在開源 VLM 中屬於高星專案 [具體數字未檢索確認]
論文引用截至知識截止日,被大量後續多模態研究引用
派生專案催生 LLaVA-Med、LLaVA-RLHF、BakLLaVA 等眾多衍生

產業影響(定性分析)

LLaVA 本身是學術開源專案,未直接商業化,但其影響體現在:

  1. 技術路線驗證:證明”簡單投影+高質量資料”是可行且高效的 MLLM 路線
  2. 降低進入門檻:中小團隊可基於 LLaVA 快速建置多模態應用
  3. 推動競爭:倒逼大廠開源更強的 VLM(如 Qwen-VL、InternVL 系列)
  4. 垂直領域適配:醫學、法律、教育等領域基於 LLaVA 微調的專業模型

10. 代表公司與資本對映

直接關聯

機構關係說明
威斯康辛大學麥迪遜分校核心研發Haotian Liu、Chunyuan Li 等(後有部分成員加入 NVIDIA/位元組等)
Microsoft Research合作部分作者有關聯,後續工作有微軟參與
OpenAI間接依賴GPT-4 用於資料生成

產業受益/對映

型別代表邏輯
開源 LLM 供應商Meta(LLaMA)、Mistral提供 LLM 基座
算力供應商NVIDIA、雲端廠商訓練/推論算力需求
多模態應用公司各類 AI 應用創業公司基於 LLaVA 生態建置產品
資料服務Scale AI 等資料標註和生成需求

注意:LLaVA 本身無直接融資,不存在”投資 LLaVA”的標的,對映主要通過生態關聯。


11. 投資邏輯

核心判斷

LLaVA 不是一個可直接投資的商業標的,但作為多模態 AI 領域的重要開源專案,其產業影響可通過以下邏輯對映:

看多邏輯

  1. 多模態是 AI 的下一個主戰場

    • 單純的語言能力已趨同質化,視覺理解成為差異化關鍵
    • LLaVA 驗證了開源 MLLM 的可行性,加速行業應用
  2. 開源生態的槓桿效應

    • LLaVA 降低了 VLM 開發門檻 → 更多應用 → 更多推論需求 → 算力/雲端廠商受益
    • 類似 LLaMA 對 LLM 生態的推動作用
  3. 垂直領域適配機會

    • 醫學(LLaVA-Med)、教育、工業質檢等領域微調需求

風險/看空邏輯

  1. 技術迭代風險:MLLM 架構仍在快速演進,LLaVA 的簡單投影路線可能被更強方案超越
  2. 開源競爭加劇:Qwen-VL、InternVL、DeepSeek-VL 等後來者可能蠶食生態位
  3. 商業價值鏈條長:從開源模型到商業回報的路徑不確定

對映標的思路

產業鏈環節思路
算力層GPU(NVIDIA)、AI 晶片(AMD、國產替代)
雲端平台提供 MLLM 訓練/推論的雲端服務
應用層文件理解、教育、醫療影像等垂直應用
資料層多模態資料標註/合成

12. 常見誤讀糾偏

❌ 誤讀 1:“LLaVA 是一個全新的大語言模型”

糾偏:LLaVA 不是一個獨立訓練的 LLM,而是一個多模態架構/方法。它複用了現有的視覺編碼器(CLIP)和語言模型(LLaMA 系列),核心貢獻是連線方式和訓練資料方法論。

❌ 誤讀 2:“LLaVA 的投影層是可忽略的簡單元件”

糾偏:投影層雖然引數量小,但承擔了視覺-語言語義空間對齊的關鍵任務。LLaVA 1.5 證明,將線性投影升級為 2 層 MLP 就能帶來顯著效能提升。這個”簡單”元件的設計和訓練質量直接影響整體效果。

❌ 誤讀 3:“LLaVA 完全開源了資料和方法,任何人都能復現”

糾偏:雖然 LLaVA 開源了程式碼和資料建置流程,但其資料生成依賴 GPT-4 API,這帶來兩個限制:

  1. GPT-4 的使用有成本和條款限制
  2. 資料質量依賴 GPT-4 的能力,存在模型依賴風險

❌ 誤讀 4:“LLaVA 效能全面超越了 BLIP-2/Flamingo 等”

糾偏:LLaVA 在特定基準上有競爭力,但”超越”的說法需看具體任務和評測設定。不同模型在不同維度各有優劣,簡單對比”全面超越”不準確。LLaVA 的真正優勢在於簡潔性和開源可復現性,而非絕對效能碾壓。


13. 學習路徑

入門階段(1-2 天)

  1. 理解 CLIP 的視覺-語言對齊原理
  2. 瞭解 LLaMA 系列開源 LLM 的基本架構
  3. 閱讀 LLaVA 1.0 論文的 Abstract 和 Introduction

進階階段(3-5 天)

  1. 通讀 LLaVA 1.0 和 1.5 論文全文
  2. 在 GitHub 上 clone LLaVA 程式碼,跑通推論 demo
  3. 理解視覺指令微調的資料建置流程(GPT-4 資料生成部分)

深入階段(1-2 周)

  1. 對比閱讀 BLIP-2、Flamingo 論文,理解不同連線方式的設計哲學
  2. 嘗試在自定義資料集上微調 LLaVA
  3. 閱讀後續改進工作:LLaVA-NeXT、LLaVA-OneVision
  4. 關注開源社群的衍生專案(LLaVA-Med 等)

推薦資源

  • 論文:《Visual Instruction Tuning》(NeurIPS 2023)
  • 程式碼https://github.com/haotian-liu/LLaVA (請自行確認最新地址)
  • 部落格:作者團隊的技術部落格和 HuggingFace 文件

14. 一句話總結

LLaVA 證明了”簡單架構 + 高質量視覺指令資料”是建置開源多模態大型模型的高效路徑,其視覺指令微調方法論已成為後續 MLLM 研究的重要基線。


15. 延伸閱讀與來源

核心論文

  1. Liu H, Li C, Wu Q, Lee YJ. Visual Instruction Tuning. NeurIPS 2023.
  2. Liu H, Li C, Li Y, Lee YJ. Improved Baselines with Visual Instruction Tuning. CVPR 2024.
  3. Liu H, Li C, Li Y, et al. LLaVA-NeXT: Improved Reasoning, OCR, and World Knowledge (技術部落格/報告) [具體出版資訊未檢索確認]

對比參考

  1. Li J, Li D, Savarese S, Hoi S. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models. ICML 2023.
  2. Alayrac JB, et al. Flamingo: a Visual Language Model for Few-Shot Learning. NeurIPS 2022.

產業分析

  1. 各大 AI 研究機構對多模態大型模型的技術白皮書 [具體名稱未檢索確認]
  2. GitHub 開源趨勢和社群討論

免責宣告:本頁由於檢索條件限制,部分技術規格、效能資料、市場資訊基於定性估計或公開文獻的一般性理解,可能存在不準確之處。讀者在做出投資或技術決策前,請以官方文件、原始論文和最新資料為準。

source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型