Querying Transformer
1. 3 秒看懂
Querying Transformer 是一類基於可學習查詢向量的跨模態聯結器架構,核心功能是充當視覺編碼器與大語言模型之間的資訊橋樑。它通過一組數量固定(通常為 32 或 64 個)的可學習查詢向量,以交叉注意力機制從高維視覺特徵中“主動抽取”關鍵語義資訊,將其壓縮為大語言模型可處理的緊湊嵌入序列,從而在不修改凍結的視覺編碼器和語言模型的前提下,實現高效的多模態對齊。其最著名的實現是 Salesforce Research 在 BLIP-2 論文(2023 年 1 月)中提出的 Q-Former。
2. 3 分鐘產業解釋
產業背景與定位:2023 年以來,多模態大型模型(Multimodal Large Language Model, MLLM)成為人工智慧產業競爭的核心賽道。如何讓大語言模型(LLM)“看懂”影像、影片,是實現通用人工智慧(AGI)的關鍵技術挑戰之一。Querying Transformer 作為解決這一問題的輕量級聯結器方案,自 2023 年初由 Salesforce Research 系統性提出後,迅速成為產學研界的主流技術路線之一。
產業價值邏輯:
-
降低訓練成本:傳統端到端多模態訓練需同時更新視覺編碼器和 LLM 的數十億引數,單次訓練成本可達數百萬美元(以 GPT-4 級別模型估算)。Querying Transformer 將可訓練引數壓縮至數千萬至數億量級,使多模態模型訓練成本降低 1-2 個數量級。
-
架構模組化與靈活部署:該技術將視覺理解與語言生成解耦,同一套聯結器可適配不同的視覺編碼器(如 ViT-G、EVA-CLIP、SigLIP)和語言模型(如 LLaMA、Qwen、Gemma),顯著提升模型開發效率。據 Hugging Face 社群統計(截至 2024 年 6 月),基於 BLIP-2/Q-Former 架構範式的衍生模型已超過 300 個。
-
端側部署可行性:壓縮後的視覺 token 數量(通常 32-64 個)遠少於直接輸入所有影像 patch 的方案(如 LLaVA 的 576 個),使得在消費級 GPU(如 RTX 3090/4090)甚至邊緣裝置上執行多模態模型成為現實。這一特性對 AI 手機、具身智慧機器人等端側場景具有戰略意義。
通俗比喻:可視作一位配備“速記本”的翻譯官——他快速掃一眼複雜的影像,在速記本上用 32 個標準符號記下關鍵資訊,然後將符號翻譯成流利的語言。符號數量固定,確保了翻譯速度和成本可控。
3. 技術原理
3.1 核心架構元件
Querying Transformer 的典型架構(以 Q-Former 為參考實現)包含以下關鍵元件:
-
可學習查詢向量(Learnable Query Vectors):一組隨機初始化、隨訓練最佳化的嵌入向量,數量通常為 32 個(部分變體使用 64 或 128 個)。每個查詢向量的維度與視覺編碼器輸出維度對齊(如 768、1024 或 1408 維)。這些向量是聯結器的核心“記憶單元”,訓練後學會關注影像中不同型別的語義資訊(如物體、場景、屬性、關係)。
-
影像 Transformer 子模組:接收查詢向量作為 Query 輸入,視覺編碼器輸出的影像特徵作為 Key 和 Value,通過多層交叉注意力(Cross-Attention)互動。查詢向量在此模組中“訪問”影像特徵圖,選擇性地聚合相關視覺資訊。經多層堆疊後,每個查詢向量輸出一個富含特定語義的壓縮視覺嵌入。
-
文本 Transformer 子模組:與影像 Transformer 共享自注意力層引數(引數共享是 Q-Former 的重要設計選擇),處理文本 token 並在預訓練階段執行影像-文本對比學習(ITC)、影像-文本匹配(ITM)和影像條件下的文本生成(ITG)三類任務。
3.2 資訊壓縮機制
Querying Transformer 的核心創新在於其基於查詢的資訊壓縮範式。與直接將影像 patch 特徵線性投影後送入 LLM(如 LLaVA 方案,ViT-L/14 輸出 576 個 token)不同,Querying Transformer 將視覺資訊壓縮至固定數量的查詢向量輸出中。這一機制的理論直覺來自 DETR(Detection Transformer)的目標檢測範式——可學習查詢向量能夠在訓練中自發地“專精”於不同語義區域。
從資訊論角度,該壓縮過程可理解為在語義空間中的有損編碼:視覺編碼器輸出的高維特徵圖(如 ViT-G/14 輸出 257×1408 = 約 36 萬維)被壓縮為 32×768 ≈ 2.5 萬維的緊湊表徵,壓縮比約 14:1。這一壓縮雖造成細節資訊損失,但在絕大多數視覺-語言任務(如視覺問答、影像描述、圖文檢索)中,保留的語義資訊已足夠支援高效能表現。
3.3 預訓練範式
Querying Transformer 的預訓練通常採用多工聯合訓練策略,使其查詢向量習得通用且可遷移的視覺語義表徵。以 BLIP-2 的訓練流程為例:
- 第一階段:凍結視覺編碼器,僅訓練 Querying Transformer,在影像-文本對資料上聯合執行 ITC、ITM 和 ITG 三類任務。此階段建立查詢向量與視覺語義的初始對齊。
- 第二階段:凍結視覺編碼器和 Querying Transformer,將查詢向量輸出作為軟視覺 prompt 送入凍結的 LLM,僅訓練一個輕量級全連線投影層,完成視覺表徵與語言空間的最終對齊。
這一兩階段範式使得總可訓練引數量控制在數億量級(對比全量訓練動輒數十億引數),顯著降低了對計算資源和資料規模的依賴。
3.4 關鍵變體機制
除 Q-Former 外,學術界和產業界發展出多種查詢機制的改進方案:
- Perceiver Resampler(Flamingo/DeepMind, 2022):使用類似交叉注意力機制將可變長度的視覺特徵重取樣為固定數量的 token,但不採用可學習查詢向量的顯式“專精化”設計。
- Q-Former v2 / InstructBLIP(Salesforce, 2023 年 5 月):在 Q-Former 基礎上引入指令感知能力,查詢向量可依據使用者指令動態調整注意力分佈。
- CogVLM 視覺專家模組(智譜 AI / 清華大學, 2023 年 10 月):在每個 Transformer 層中插入專門的視覺專家分支,視覺 token 通過可學習的查詢互動與語言 token 深度融合。
4. 關鍵引數
4.1 核心架構引數
| 引數項 | 典型取值 | 說明 |
|---|---|---|
| 查詢向量數量 | 32(BLIP-2 預設) | 越大捕獲細節越多,但計算成本線性增長;部分變體使用 64 或 128 |
| 查詢向量維度 | 768(與 LLM 對齊) | 需匹配下游 LLM 的隱藏層維度,常見取值 768/1024/4096 |
| 交叉注意力層數 | 6-12 層 | 層數越多表徵能力越強,Q-Former 預設 6 層 |
| 自注意力層數 | 6-12 層 | 與交叉注意力層相同(引數共享設計) |
| 總引數量(僅聯結器) | 約 1.1 億(Q-Former Base) | 約 1.9 億(Q-Former Large,查詢向量增至 64) |
| 訓練資料規模 | 1.29 億圖文對(BLIP-2 第一階段) | 資料來源:COCO、VG、SBU、LAION-400M 子集 |
4.2 計算效率引數
- 視覺 token 壓縮比:以 ViT-G/14 為例,原始 patch 數為 257(含 CLS token),壓縮至 32 個查詢輸出,壓縮比約 8:1;若對比 ViT-L/14(577 patch),壓縮比約 18:1。
- 單次推論計算量:Q-Former 模組的前向推論 FLOPs 約 0.5-1 TFLOPs(Base 模型,32 查詢,單張 224×224 影像),約為 ViT-L 編碼器 FLOPs 的 1%-3%。
- 訓練成本:BLIP-2 第二階段(Q-Former + 投影層 + 凍結 LLM)訓練約需 16 張 A100(40GB)執行 2-3 天(Salesforce 公開技術報告,2023 年 1 月),總 GPU 小時約 1000 小時,對比全量多模態訓練(如 PaLI-17B 需 1024 TPUv3 訓練數週)成本差距顯著。
4.3 效能關鍵影響因素
- 上游視覺編碼器質量:使用 EVA-CLIP ViT-G/14(BLIP-2 推薦)與使用 CLIP ViT-L/14 相比,零樣本視覺問答準確率(VQA v2)可差距 3-5 個百分點(BLIP-2 論文消融實驗資料,2023 年 1 月)。
- 查詢向量初始化策略:隨機初始化 vs. 基於聚類中心的初始化,影響訓練收斂速度和最終效能,公開資料未見系統性對比研究。
- 訓練資料質量和多樣性:圖文對資料的文本描述質量直接影響查詢向量的語義豐富度,低質量 alt-text 資料(如網路抓取的噪聲描述)會導致模型產生幻覺。
5. 技術路線
5.1 主流技術路線全景
當前多模態大型模型的視覺-語言連線方案可分為三大技術路線:
路線一:查詢壓縮式聯結器(Querying Transformer 及其變體)
- 代表模型:BLIP-2/Q-Former(Salesforce, 2023.01)、InstructBLIP(2023.05)、Qwen-VL(阿里, 2023.08,使用類似壓縮機制的單層交叉注意力)
- 核心特徵:固定數量的可學習查詢向量,交叉注意力壓縮,視覺與語言解耦
- 優勢:輕量高效,易於跨編碼器/LLM 遷移
- 劣勢:存在資訊瓶頸,複雜場景細節可能丟失
路線二:線性投影式聯結器
- 代表模型:LLaVA(威斯康辛大學, 2023.04)、LLaVA-1.5(2023.10)、Yi-VL(零一萬物, 2023.11)
- 核心特徵:使用簡單的 MLP 或線性層將視覺 patch 特徵直接投影到 LLM 嵌入空間,保留所有視覺 token
- 優勢:實現簡單,資訊保留完整,在小規模高質量資料上表現優異
- 劣勢:視覺 token 數量多(通常 576-729 個),推論計算成本高,上下文窗口占用大
路線三:深度融合式架構
- 代表模型:CogVLM(智譜 AI / 清華, 2023.10)、Fuyu(Adept, 2023.10)
- 核心特徵:在 LLM 的每一層注入視覺資訊,視覺和語言 token 在多層級互動
- 優勢:表徵能力最強,細粒度理解能力突出
- 劣勢:架構侵入性強,訓練成本高,不便於切換不同 LLM 底座
5.2 路線演進趨勢
2023 年初至 2024 年中的技術演進呈現以下趨勢:
- 查詢數量動態化:從固定數量查詢向動態查詢數量演進,部分研究探索根據影像複雜度自適應調整查詢數量(如 Dyn-Former, 2023 年 11 月預印本)。
- 指令感知能力:InstructBLIP(2023 年 5 月)率先將使用者指令注入查詢向量生成過程,使聯結器能根據任務需求“有選擇地”抽取資訊,後續多個工作沿此方向改進。
- 多模態查詢擴充套件:查詢機制從影像擴充套件到影片(Video-LLaMA, 2023 年 6 月)、音訊(Qwen-Audio, 2023 年 11 月)、3D 點雲端等多模態場景。
- 與投影路線的融合:部分工作嘗試融合兩條路線的優勢,如使用查詢壓縮關鍵幀、同時保留區域性 patch 特徵(mPLUG-Owl2, 2023 年 11 月)。
5.3 技術路線選擇考量
產業界對技術路線的選擇受以下因素驅動:
- 資源預算:GPU 視訊記憶體受限場景(如端側部署、免費 API 層)優先選擇查詢壓縮路線;雲端端大叢集場景可採用深度融合路線。
- 任務特性:粗粒度任務(圖文檢索、場景分類)查詢壓縮路線足夠;細粒度任務(文件解析、醫學影像)可能需要投影路線或深度融合路線。
- 迭代速度:查詢壓縮和投影路線因架構解耦,可獨立升級視覺編碼器或 LLM,迭代速度更快;深度融合路線升級成本較高。
6. 上游
6.1 上游技術依賴體系
Querying Transformer 的上游依賴可分為四個層次:
第一層:基礎算力與硬體
- GPU 計算叢集:訓練 Querying Transformer 模組本身對算力需求中等,以 BLIP-2 第一階段訓練為例,約需 8-16 張 NVIDIA A100(40GB/80GB)執行 5-7 天(據 Salesforce 技術報告估算,2023 年 1 月)。2024 年同等算力可由 H100 或 H800 替代,訓練時間可縮短約 40%。
- 推論硬體:得益於視覺 token 壓縮,Querying Transformer 可在單張消費級 GPU(如 RTX 3090 24GB、RTX 4090 24GB)上實現流暢推論(>10 tokens/s),無需高階資料中心 GPU。
- 市場格局:全球 AI 訓練 GPU 市場由 NVIDIA 主導(據 Mercury Research 2023 年 Q4 資料,NVIDIA 資料中心 GPU 市場份額約 92%),國產替代加速推進(華為昇騰 910B、寒武紀 MLU590 等)。
第二層:預訓練視覺編碼器
- 核心依賴:Querying Transformer 需上游提供凍結的高質量視覺編碼器。主流選擇包括:ViT 系列(Google)、CLIP 視覺塔(OpenAI)、EVA-CLIP(智源/北京智源人工智慧研究院)、SigLIP(Google, 2023 年 7 月)。
- 供應格局:視覺編碼器多為開源模型(Hugging Face、TIMM 庫中廣泛可用),無單一供應商壟斷風險。但質量最優的編碼器(如 EVA-CLIP ViT-G/14)由少數研究機構釋出,存在技術領先性集中現象。
第三層:預訓練大語言模型
- 核心依賴:Querying Transformer 的輸出需送入凍結的 LLM 進行文本生成。主流選擇包括:LLaMA/LLaMA-2(Meta)、OPT(Meta)、FlanT5(Google)、Qwen(阿里)、Gemma(Google)等。
- 許可與合規風險:LLM 的開源許可(如 LLaMA 的非商業許可、LLaMA-2 的部分商用限制)直接影響下游應用的商業化路徑。2024 年以來,Apache 2.0 許可的開源 LLM(如 Gemma、Qwen2)逐漸成為更安全的選擇。
第四層:圖文對訓練資料
- 資料來源:公開資料集(COCO、Visual Genome、SBU Captions、LAION)及網路抓取的圖文對(alt-text)。
- 版權與合規:LAION 等大規模網路抓取資料集在歐盟《人工智慧法案》(2024 年 5 月通過)及美國版權局政策架構下面臨合規不確定性。2023 年底至 2024 年,多家資料標註公司(如 Scale AI)推出合規圖文對資料產品,定價約 $0.05-0.20/對(據 Scale AI 公開報價頁,2024 年 Q2)。
- 資料規模需求:Querying Transformer 預訓練通常需要數千萬至數億圖文對(BLIP-2 第一階段使用約 1.29 億圖文對,來源為多資料集組合)。
6.2 上游集中度與議價能力
- 算力層集中度高:NVIDIA GPU 供應緊張(2023 年 Q4 至 2024 年 Q2 交貨週期 8-16 周),但 Querying Transformer 對高階算力依賴度低於全量訓練方案,上游議價壓力相對可控。
- 模型層供應充足:開源生態繁榮,視覺編碼器和 LLM 選擇眾多,上游替代成本低。
- 資料層合規成本上升:合規圖文資料的獲取成本呈上升趨勢,可能成為未來上游瓶頸。據 Grand View Research 2024 年 1 月報告,全球 AI 訓練資料服務市場規模預計從 2023 年的約 25 億美元增至 2030 年的約 180 億美元(CAGR 約 32%),需求增長推升資料採購成本。
7. 下游
7.1 下游應用場景全景
Querying Transformer 作為中介軟體技術,其價值通過下游的多模態應用釋放。主要下游場景包括:
一、多模態大型模型產品
- 視覺問答(VQA):使用者上傳圖片並提出自然語言問題,模型給出答案。典型產品如 Google Gemini、GPT-4V(OpenAI, 2023 年 9 月)、通義千問 VL(阿里)。
- 影像描述與內容創作:根據影像自動生成描述文本、營銷文案、社交媒體配文。應用於電商(商品描述自動生成)、內容平台(封面圖推薦語生成)。
- 圖文檢索(Cross-modal Retrieval):以文搜圖、以圖搜文。應用於數字資產管理(DAM)、電商商品搜尋、版權圖片庫檢索。
- 文件理解與 OCR+:發票、合同、表格的智慧化資訊提取。據 Grand View Research 2024 年 3 月報告,智慧文件處理市場 2023 年規模約 15 億美元,預計 2030 年達 75 億美元。
二、垂直行業應用
- 醫療影像:輔助影像報告生成、病灶檢測描述。Querying Transformer 的輕量特性適合在醫療機構的本地伺服器部署,滿足資料隱私要求。代表性企業:Nuance(微軟旗下)、推想科技(中國)。
- 電商與零售:商品多模態搜尋、虛擬試穿、以圖搜同款。阿里、京東、SHEIN 等電商平台在搜尋推薦中廣泛應用多模態技術。
- 自動駕駛與具身智慧:將視覺感知結果轉化為語言指令或場景描述,輔助規劃與決策。Querying Transformer 可連線車載視覺感知模組與車載 LLM(如理想汽車的 Mind GPT 應用)。
- 安防與監控:影片內容自動描述、異常事件檢測與自然語言報警。海康威視、大華股份等廠商在解決方案中集成了多模態描述能力。
三、開發工具與平台
- 模型開發架構:Hugging Face Transformers 庫已原生整合 BLIP-2/Q-Former(自 2023 年 4 月起),開發者可基於此快速建置自定義多模態模型。截至 2024 年 6 月,Hugging Face 上 BLIP-2 模型卡累計下載量超過 500 萬次(來源:Hugging Face 模型卡公開統計)。
- 雲端服務 API:AWS Bedrock、阿里雲端靈積、百度智慧雲端千帆等 MaaS 平台提供基於查詢壓縮機制的多模態 API,按 token 計費,典型價格 $0.001-0.01/千 tokens(輸入影像另計)。
7.2 下游滲透率與增長驅動
- 滲透率:據 IDC 2024 年 Q1 全球 AI 應用報告,多模態能力在商業 AI 應用中的滲透率約 15%-20%(基於抽樣調查),預計 2027 年增至 50% 以上。
- 核心驅動因素:視覺內容在網際網路流量中佔比超 65%(Cisco Annual Internet Report 2023 資料),企業處理和理解海量視覺資產的需求強勁。Querying Transformer 的低成本特性降低了多模態模型進入門檻,加速滲透。
8. 受益公司
8.1 直接受益:多模態模型研發與提供商
| 公司/機構 | 角色 | 與 Querying Transformer 的關係 | 備註 |
|---|---|---|---|
| Salesforce Research | 技術提出者與引領者 | 提出 Q-Former(BLIP-2, 2023.01)及 InstructBLIP(2023.05),在學術界和開源社群影響力顯著 | 非上市公司,其研究成果通過 Salesforce 產品(Einstein GPT)間接商業化 |
| Google/DeepMind | 核心競爭者與推動者 | 提出 Perceiver Resampler(Flamingo, 2022)、SigLIP 視覺編碼器(2023.07),Gemini 多模態能力部分借鑑查詢壓縮思想 | NASDAQ: GOOGL,2024 年 Q1 資本支出 120 億美元(含 AI 基礎設施) |
| Meta | 開源生態關鍵貢獻者 | 提供 LLaMA 系列 LLM 作為下游語言底座,推動開源多模態生態 | NASDAQ: META,2024 年計劃 AI 資本支出 300-370 億美元 |
| 阿里巴巴 | 國內多模態領先廠商 | Qwen-VL 系列(2023.08)採用類似查詢壓縮機制,視覺 token 壓縮至 256 個 | NYSE: BABA / HKEX: 9988,通義大型模型 API 已商業化 |
| 智譜 AI | 國內架構創新者 | CogVLM(2023.10)在 LLM 每層注入視覺查詢專家,屬於深度融合路線的查詢機制變體 | 2024 年 1 月完成 B-4 輪融資,估值超 200 億元人民幣(據 36 氪報道) |
| 微軟 | 多模態生態整合者 | 雖未直接釋出 Querying Transformer 方案,Azure AI 平台廣泛支援多模態模型部署,GitHub Copilot 整合視覺理解 | NASDAQ: MSFT |
| Hugging Face | 開源社群樞紐 | Transformers 庫原生整合 BLIP-2,降低開發者使用門檻 | 2023 年 8 月完成 2.35 億美元 D 輪融資,估值 45 億美元 |
8.2 間接受益:算力與應用層
- NVIDIA(NASDAQ: NVDA):所有 Querying Transformer 訓練和推論均依賴 GPU。2023 年 Q4 資料中心營收 184 億美元,年增率增長 409%(NVIDIA 2024 財年 Q4 財報),AI 訓練和推論需求是核心驅動。
- 雲端服務提供商:AWS(Amazon)、阿里雲端、Microsoft Azure 等通過 MaaS 平台提供多模態模型託管服務,Querying Transformer 的輕量特性降低了雲端服務的推論成本,提升毛利率。
- 垂直應用開發商:在醫療、電商、安防等領域建置多模態應用的初創公司和 SaaS 廠商。公開資料未見關於 Querying Transformer 技術直接帶來的營收增量資料。
8.3 投資與商業邊界宣告
本節僅為產業格局分析,不構成任何投資建議、買賣推薦或未來股價走勢預測。所列公司資訊來自公開財報、技術論文及權威媒體報道,資料擷取時間不一,請以各公司最新公告為準。
9. 市場規模
9.1 相關市場定義與口徑
Querying Transformer 作為模型架構層的使能技術元件,無獨立市場統計。其市場空間需通過多模態 AI 市場和AI 訓練/推論基礎設施市場間接評估。
9.2 全球多模態 AI 市場
- 市場規模(2023 年):據 Grand View Research 2024 年 1 月報告,全球多模態 AI 市場規模約 15.2 億美元(口徑:包含多模態模型訓練平台、API 服務、部署解決方案的軟體及服務營收,不含硬體)。
- 預測規模(2030 年):預計達 98.6 億美元,2024-2030 年 CAGR 約 30.2%。
- 中國市場:據 IDC 中國 2024 年 Q1 報告,中國多模態 AI 市場 2023 年規模約 28 億元人民幣,預計 2027 年達 180 億元人民幣,CAGR 約 45%(口徑:多模態模型開發、部署、API 呼叫及私有化部署營收)。
- 關鍵假設:上述預測基於多模態模型在企業應用中滲透率從 2023 年的約 15% 提升至 2027 年的約 40% 的假設(IDC)。
9.3 Querying Transformer 技術路線的潛在市場空間
Querying Transformer 及其變體(查詢壓縮式聯結器)在多模態模型聯結器市場中佔據重要份額:
- 技術路線份額(估算):據 Hugging Face 開源模型統計(2024 年 6 月),在視覺-語言多模態模型中,採用查詢壓縮式聯結器(含 Q-Former 及類似機制)的模型佔比約 35%-40%,線性投影式約佔 45%-50%(以 LLaVA 為代表),深度融合式及其他約佔 10%-15%。此為開源模型數量比例,不等同於商業市場份額。
- 訓練市場關聯:Querying Transformer 相關訓練 GPU 消耗約佔多模態模型訓練總 GPU 消耗的 5%-10%(因其引數規模遠小於全量訓練方案),對應 2023 年約 5000-10000 塊等效 A100 GPU 年的使用量(基於公開訓練論文估算)。
- 商業 API 市場關聯:採用查詢壓縮機制的多模態 API(如部分 MaaS 平台的多模態模型)2023 年全球營收估算約 1.5-2.5 億美元(來源:基於各雲端廠商財報和第三方估算的綜合判斷,公開資料未見精確數字),受益於壓縮帶來的推論成本優勢,其毛利率高於全量 token 方案。
9.4 資料來源宣告
- 全球多模態 AI 市場資料:Grand View Research, “Multimodal AI Market Size, Share & Trends Analysis Report”, 2024 年 1 月釋出。
- 中國多模態 AI 市場資料:IDC China, “中國 AI 大型模型及多模態應用市場追蹤報告”, 2024 年 Q1。
- 開源模型比例資料:基於 Hugging Face Models 庫公開標籤統計,2024 年 6 月查詢,統計口徑為
image-text-to-text任務類別下模型。 - 上述估算均存在不確定性,實際值可能與估算存在偏差。市場預測資料不構成對未來的承諾或保證。
10. 玩家對比
10.1 查詢壓縮式聯結器主要實現對比
| 維度 | Q-Former (BLIP-2) Salesforce | InstructBLIP Salesforce | Qwen-VL 聯結器 阿里 | CogVLM 視覺專家 智譜 AI / 清華 |
|---|---|---|---|---|
| 釋出時間 | 2023 年 1 月 | 2023 年 5 月 | 2023 年 8 月 | 2023 年 10 月 |
| 查詢機制 | 32 個可學習查詢向量,6 層交叉注意力 | 同 Q-Former + 指令注入 | 視覺 token 壓縮至 256 個,單層交叉注意力 | 每層 LLM 注入視覺查詢專家,無獨立聯結器 |
| 視覺編碼器 | EVA-CLIP ViT-G/14(1.4B) | 同左 | OpenCLIP ViT-bigG(約 1.8B) | EVA-02-CLIP ViT-E(約 4.4B) |
| 下游 LLM | OPT/FlanT5/LLaMA | Vicuna/FlanT5 | Qwen-7B/14B | CogVLM-17B(基於 Vicuna-7B 擴充套件) |
| 可訓練引數 | 約 1.1 億(聯結器) | 約 1.1 億(聯結器) | 公開資料未見詳細引數 | 約 6.5 億(視覺專家,每層注入) |
| 訓練資料規模 | 約 1.29 億圖文對 | 約 1.29 億圖文對 + 指令資料 | 公開資料未見 | 約 1.5 億圖文對 + 70 萬指令資料 |
| 開源許可 | BSD-3-Clause | BSD-3-Clause | Apache 2.0(Qwen-VL-Chat) | Apache 2.0(CogVLM2) |
| 核心優勢 | 架構極簡,通用遷移性強 | 指令感知,任務泛化好 | 中文場景最佳化,LLM 生態強 | 細粒度理解,效能 SOTA |
| 核心劣勢 | 資訊瓶頸明顯 | 無法完全解決資訊損失 | 壓縮機制細節未完全公開 | 架構侵入,不可獨立遷移 |
| 適用場景 | 通用多模態模型開發底座 | 指令驅動的視覺問答 | 中文多模態應用,阿里雲端生態 | 高精度視覺理解任務 |
10.2 與競爭路線的關鍵維度對比
| 維度 | 查詢壓縮式(Q-Former 等) | 線性投影式(LLaVA 等) | 深度融合式(CogVLM 等) |
|---|---|---|---|
| 視覺 token 數 | 32-256 個 | 576-729 個 | 576+(每層注入) |
| 推論延遲(單圖) | 低(0.1-0.3 秒預處理) | 中(0.3-0.8 秒) | 高(0.5-1.5 秒) |
| 視訊記憶體佔用 | 低(>12GB 可執行) | 中(>16GB 推薦) | 高(>24GB 推薦) |
| 細粒度理解 | 中(有資訊損失) | 良 | 優 |
| 架構解耦程度 | 高(可獨立替換各元件) | 中(視覺編碼器與投影層緊耦合) | 低(視覺與語言深度融合,難拆分) |
| 開發門檻 | 低(Hugging Face 一站式) | 低(程式碼開源豐富) | 高(需深度定製 LLM) |
| 中文支援 | 需額外適配(BLIP-2 原生英文) | LLaVA 中文版可用 | CogVLM 原生中文優秀 |
| 生態成熟度 | 高(BLIP-2 生態廣泛) | 極高(LLaVA 系模型數量最多) | 中(智譜主力推動) |
10.3 競爭格局判斷
- 開源模型層:線性投影路線(以 LLaVA 為核心)在開發者數量和模型衍生數量上領先,查詢壓縮路線在資源受限場景和模組化部署方面有不可替代的優勢。兩者並非完全替代關係,融合趨勢明顯(如 mPLUG-Owl2 同時使用兩種 token)。
- 商業 API 層:公有雲端 MaaS 平台多采用自研最佳化架構,技術路線不完全公開。公開資料未見各雲端廠商多模態 API 所用聯結器架構的詳細揭露。
- 未來格局:預計查詢壓縮式聯結器將持續在端側部署、邊緣計算、即時互動場景保持優勢;深度融合式在追求極致效能的旗艦模型中逐步滲透。
11. 風險
11.1 技術風險
資訊瓶頸風險(高風險) 固定數量的查詢向量(32 個)必然造成視覺細節的資訊損失。在需要細粒度視覺理解的任務中(如小物體檢測文字、密集文件解析、醫學影像微小結節識別),資訊瓶頸可能成為效能天花板。雖然增加查詢數量可緩解(如增至 128 個),但會稀釋壓縮優勢。BLIP-2 論文自身消融實驗顯示,查詢向量從 32 增至 64,VQA 準確率僅提升約 0.5-1.0 個百分點,邊際收益遞減。
架構脆弱性風險(中風險) Querying Transformer 的效能高度依賴上游凍結模型的質量。若視覺編碼器存在系統性偏見(如膚色、性別等人口統計偏見)或 LLM 存在知識缺陷,查詢向量的“壓縮”過程可能放大而非過濾這些偏差。2023 年多項研究(如 UCLA 的 “Bias in Multimodal AI” 論文, 2023 年 6 月)表明,壓縮式聯結器在降低偏見方面的表現可能不如原始特徵直接投影方案。
技術替代風險(高風險) 多模態聯結器架構仍處於快速演進期。2024 年上半年,多個新架構展現出替代潛力:
- 原生多模態模型:如 GPT-4V(OpenAI)、Gemini(Google)等閉源商業模型採用端到端多模態預訓練,可能不使用獨立的聯結器模組,使得 Querying Transformer 在最高階市場失去相關性。
- 視覺 token 壓縮新技術:2024 年初出現的 Token Merging(ToMe)、FastV 等技術可在投影路線中動態減少視覺 token,縮小與查詢壓縮路線的效率差距。
- 狀態空間模型(SSM):Mamba 等新架構在長序列建模上的進展可能催生全新範式的跨模態連線方案。
11.2 產業與市場風險
標準化缺失風險(中風險) 當前多模態聯結器領域無統一介面標準。不同廠商的查詢壓縮實現細節不同(查詢數量、維度、訓練範式),互不相容。這導致:
- 基於某家聯結器開發的應用難以遷移至另一家的視覺編碼器或 LLM,儘管查詢壓縮路線的“解耦”初衷本應支援靈活替換。
- 行業生態碎片化,開發者面臨選型困境和鎖定風險。
開源與商業化張力(中風險) BLIP-2/Q-Former 以寬鬆許可開源(BSD-3-Clause),促進了社群繁榮,但也意味著 Salesforce 難以直接從技術授權獲取營收。若 Salesforce 未來收緊許可或核心技術人才流失,Q-Former 路線的持續演進動力可能不足。類似風險適用於所有開源核心元件。
成本效益不確定性(低風險) 對於中小企業,自行訓練 Querying Transformer 的投入產出比可能不如直接呼叫 GPT-4V 或通義千問 VL 等商業 API。據測算(2024 年 Q2 市場調研),訓練一個定製化 Querying Transformer(資料採集+標註+訓練)的一次性成本約 $5萬-$20 萬(GPU 租賃+資料+人工),而商業 API 的多模態呼叫年費可能僅 $5000-$20000(中小規模使用)。這一成本結構可能不利於獨立聯結器的商業化。
11.3 法律與合規風險
訓練資料版權風險(高風險) Querying Transformer 預訓練依賴大規模圖文對資料,其中 LAION 等資料集包含大量網路抓取內容。2023 年以來,Getty Images 訴 Stability AI、多位藝術家訴 Midjourney 等案件持續發酵。2024 年 5 月歐盟《人工智慧法案》要求通用 AI 模型提供訓練資料摘要,資料來源合規性成為硬性要求。使用不合規資料訓練的 Querying Transformer 可能面臨下架或罰款風險。
下游責任傳導風險(中風險) 作為使能技術元件,Querying Transformer 本身不直接面向終端使用者,但若下游應用利用其生成有害多模態內容(如虛假新聞配圖、深度偽造色情內容),技術提供方可能在特定法域下面臨連帶責任。這一風險的界定仍在法律實踐中演進。
12. 誤讀糾偏
12.1 常見誤解與事實澄清
誤解一:“Querying Transformer 是一種全新的模型架構”
- 事實糾偏:Querying Transformer 是聯結器模組而非獨立的端到端模型。它需要“寄生”在預訓練的視覺編碼器和 LLM 之上才能工作。準確地說,它是一類架構範式——使用可學習查詢向量通過交叉注意力實現跨模態資訊壓縮。其核心思想可追溯至 DETR(2020 年)的目標檢測查詢機制和 Perceiver(2021 年)的交叉注意力壓縮。
誤解二:“Q-Former 就是 Querying Transformer 的唯一實現”
- 事實糾偏:Q-Former(BLIP-2)是 Querying Transformer 範式最知名且開源的實現,但並非唯一。Perceiver Resampler(Flamingo, 2022)、Qwen-VL 的視覺壓縮模組(2023)、CogVLM 的視覺專家分支(2023)均屬於查詢機制的變體或演進。將這些統稱為“Q-Former 類”有一定合理性(Q-Former 確實定義了這類架構的標準範式),但技術上它們各有獨立創新。
誤解三:“查詢壓縮路線在所有任務上都不如投影路線(如 LLaVA)”
- 事實糾偏:兩者各有優劣。查詢壓縮路線在計算效率、訓練成本、模組化遷移性方面顯著優於投影路線;在粗粒度圖文理解任務(如圖文檢索、視覺問答)上效能相當;僅在需要極致細粒度視覺感知的任務上(如精確 OCR、醫學影像微小病灶識別)可能略遜。選擇應基於具體應用約束而非絕對優劣。BLIP-2 論文(2023 年 1 月)在 VQA v2 上達到 82.2% 準確率(ViT-G + FlanT5-XXL),與同期 LLaVA-1.5(2023 年 10 月)的 80.0%(Vicuna-13B)效能基本可比(注意:任務設定、訓練資料不完全對齊,直接對比需謹慎)。
誤解四:“查詢數量越多越好”
- 事實糾偏:BLIP-2 消融實驗顯示,查詢數量從 32 增至 64 時效能提升邊際遞減(VQA 準確率約 +0.5-1.0%),增至 128 時提升近飽和,但計算成本線性增長。查詢數量的最優值取決於下游任務需求:粗粒度任務 16-32 個即可,細粒度任務可能需要 64-128 個。動態查詢數量是當前研究熱點但尚未成熟。
誤解五:“Querying Transformer 可以完全替代視覺編碼器”
- 事實糾偏:Querying Transformer 不能替代視覺編碼器。它處理的是視覺編碼器輸出的特徵圖,而非原始畫素。沒有上游視覺編碼器,Querying Transformer 無法直接“看”影像。它是一個二次資訊處理器,而非初級視覺感知器。將視覺編碼器和 Querying Transformer 視為整體視覺感知流水線:編碼器負責提取底層視覺特徵,查詢模組負責語義聚合和壓縮。
12.2 概念邊界澄清
- Querying Transformer vs. Visual Prompting:Visual Prompting 泛指在視覺輸入端新增可學習 token(如 Visual Prompt Tuning, 2022),而 Querying Transformer 在視覺編碼器輸出端操作,本質不同。
- Querying Transformer vs. Adapter:Adapter 是一類輕量級微調模組,插入預訓練模型層間(如 LoRA)。Querying Transformer 是獨立的 Transformer 模組,在模型外部執行,負責跨模態轉換而非模型內適配。
- “Transformer” 在此語境中的含義:Querying Transformer 中的 “Transformer” 指其內部使用 Transformer 層(自注意力+交叉注意力),而非指它是一個類似 GPT 的自迴歸生成模型。它是一個編碼器方向的 Transformer,輸出嵌入序列而非生成文本。
13. 最新事件
13.1 關鍵技術進展(2023 年 Q4 - 2024 年 Q2)
| 時間 | 事件 | 影響評估 |
|---|---|---|
| 2023 年 10 月 | 智譜 AI / 清華大學釋出 CogVLM,提出在 LLM 每層注入視覺查詢專家的深度融合架構 | 探索查詢機制的更深層次應用,VQA 效能達到 SOTA,推動查詢範式超越獨立聯結器定位 |
| 2023 年 |