CLIP
3 秒看懂
CLIP(Contrastive Language-Image Pre-training)是由 OpenAI 於 2021 年提出的圖文對比預訓練模型。其核心創新在於拋棄了傳統視覺模型依賴固定類別標籤的訓練範式,轉而利用網際網路上天然存在的 4 億對圖文配對資料進行學習。模型將影像和文本分別編碼至同一向量空間,通過對比學習迫使匹配的圖文對在該空間中距離拉近,而非匹配對相互遠離。這一設計賦予模型強大的零樣本(Zero-Shot)泛化能力——無需針對特定任務進行微調,僅憑一句自然語言描述(如“一隻戴墨鏡的柴犬”),即可在未見過的影像中識別對應概念。CLIP 的開放詞彙特性使其成為 Stable Diffusion、DALL·E 等主流 AI 生成模型的語義理解基石,也是多模態檢索、內容稽核等產業應用的基礎元件。
3 分鐘產業解釋
傳統計算機視覺開發遵循“標註-訓練-部署”的線性流程:開發者需預先定義類別(如 1000 類物體),聘請標註團隊逐一標記數萬至數百萬張影像,訓練專用分類器,若需新增類別則須重複全流程。這一範式在長尾場景與快速變化的業務需求面前成本高昂且響應遲緩。
CLIP 顛覆了上述範式,其產業邏輯可拆解為三個層次:
第一層:雙塔架構與弱監督學習 模型由兩個獨立編碼器構成——影像編碼器(早期採用 ResNet,後演化為 Vision Transformer/ViT)與文本編碼器(基於 GPT-2 風格的 12 層 Transformer)。兩者分別將影像和自然語言片段對映至同一高維向量空間(如 512 維或 768 維),並通過線性投影層與 L2 歸一化使所有向量位於單位超球面上。訓練資料來源於 OpenAI 私有的 WIT(WebImageText)資料集,包含從網際網路爬取的 4 億對圖文,覆蓋 50 萬+ 粗粒度概念,無需人工清洗與標註。據 CLIP 原論文(Radford et al., 2021)揭露,該資料集的規模與多樣性遠超 ImageNet(約 1400 萬張標註影像,1000 類)。
第二層:對比學習的規模化實現 訓練時,每個批次(batch size)包含 32,768 個圖文對。模型計算該批次內所有影像向量與所有文本向量間的餘弦相似度,形成一個 32,768×32,768 的相似度矩陣。損失函式為對稱 InfoNCE 損失:對於每一個影像,最大化其與正確配對的文本的相似度,同時最小化與其他 32,767 個錯誤文本的相似度;文本端同理。這一計算需要在 592 塊 NVIDIA V100 GPU 上進行大規模張量並行通訊,每塊 GPU 負責批次的一部分,並通過 all-gather 操作彙總全域性相似度矩陣。OpenAI 報告稱,ViT-L/14 版本的 CLIP 訓練耗時約 18 天(以 V100 為基準估算)。
第三層:零樣本推論與產業嵌入 訓練完成後,CLIP 在推論階段無需任何微調。以影像分類為例:使用者提供一張待分類影像,以及一組由自然語言構造的候選描述(如“一張貓的照片”“一張狗的照片”)。模型分別計算影像向量與每個文本向量的餘弦相似度,選擇相似度最高的文本作為分類結果。OpenAI 在論文中報告,CLIP ViT-L/14@336px 在 ImageNet 資料集上達到 76.2% 的零樣本 Top-1 準確率,與全監督訓練的 ResNet-50(76.2%)持平,且對自然分佈偏移(如從 ImageNet 遷移至 ImageNet-R 資料集)展現出遠超傳統模型的魯棒性(ImageNet-R 準確率達 87.9%)。
產業影響已滲透至以下領域:
- AI 生成模型(AIGC):Stable Diffusion 系列(1.x、2.x)的核心文本編碼器採用 OpenCLIP 的 ViT-L/14 或 ViT-H/14 版本,將自然語言提示轉化為視覺語義引導。DALL·E 2 使用 CLIP 嵌入進行影像生成的語義對齊。據 Stability AI 於 2024 年公開的資訊,Stable Diffusion 系列的全球下載量已超 5 億次(含 Web UI 分發),其配套 CLIP 權重的需求呈剛性。
- 多模態檢索與理解:文本搜圖(如“夕陽下的海灘”)、影片片段檢索、視覺問答(VQA)、影像描述生成等領域均以 CLIP 嵌入作為特徵提取基礎,繼而接入大語言模型(如 MiniGPT-4、LLaVA)進行推論。例如,LLaVA-1.5(Liu et al., 2024)使用 CLIP ViT-L/14 作為視覺編碼器,僅用線性投影層連線 LLaMA 語言模型,在多項多模態基準測試中達到領先水平。
- 內容安全與稽核:利用 CLIP 的零樣本能力,企業可快速建置違規內容識別系統(如暴力、色情),無需為每個敏感類別單獨收集標註資料。據公開資料,部分社交平台已在稽核管線中整合 CLIP 或同類模型。
- 機器人感知與具身智慧:CLIP 作為視覺-語言介面,連線自然語言指令與視覺場景理解。例如,Google DeepMind 於 2023 年釋出的 RT-2 模型使用 CLIP 編碼視覺輸入,實現機器人操作任務的泛化。
上述應用使其成為 AIGC 時代不可或缺的基礎設施。然而,CLIP 自身不生成內容,其角色是“語義對齊器”,這使得它常被下游模型作為模組化元件嵌入,而非作為獨立產品提供。
技術原理
CLIP 的技術本質是學習一個聯合的圖文嵌入空間,使得語義相近的圖文對在向量空間中位置接近。其架構可抽象為四個核心元件:
1. 影像編碼器
CLIP 論文實驗了兩種主幹網路:
- ResNet 系列:從 ResNet-50 到 ResNet-50x64(將標準 ResNet-50 寬度擴充套件 64 倍),後者的引數量達約 623M。ResNet 採用標準卷積架構,輸出最後一層池化前的特徵圖,經注意力池化層聚合成固定維度向量。
- Vision Transformer(ViT)系列:從 ViT-B/32 到 ViT-L/14@336px。影像被切割為固定尺寸的影像塊(patch),如 14×14 畫素,經線性投影後作為 Transformer 的輸入序列。模型在序列開頭新增一個可學習的
[CLS]token,其最終輸出經 LayerNorm 後作為影像特徵向量。論文最終驗證 ViT 在計算效率與下游效能上均優於同等計算量下的 ResNet。
影像編碼器輸出的特徵向量 I_i 維度為 d(如 ViT-L 的 768 維)。
2. 文本編碼器
採用 GPT-2 風格的 12 層 Transformer(63M 引數,隱藏維度 512,8 個注意力頭)。輸入文本經位元組對編碼(BPE)分詞後,截斷或填充至最大 76 個 token。序列以 [SOS] 開始,以 [EOS] 結束,[EOS] token 的輸出經 LayerNorm 後作為文本特徵向量 T_i,維度經線性投影至與影像特徵相同的 d 維。
3. 投影與歸一化
兩個編碼器的輸出 I_i 和 T_i 各自通過一個獨立的線性投影層對映到同一嵌入維度(如 512 或 768),隨後進行 L2 歸一化,使所有向量的模長為 1。這一步驟將特徵空間約束在單位超球面上,使餘弦相似度計算等價於向量內積。
4. 對稱 InfoNCE 損失
對於一個包含 N 個圖文對的批次(N=32,768),模型計算所有影像向量與所有文本向量之間的餘弦相似度,形成 N×N 的相似度矩陣。損失函式為:
mathcal(L) = frac(1){2N} \sum_{i=1}^{N} \left( -\log frac(e^{\tau \cdot text(sim)(I_i,T_i)}){\sum_{j=1}^{N} e^{\tau \cdot text(sim)(I_i,T_j)}} -\log frac(e^{\tau \cdot text(sim)(I_i,T_i)}){\sum_{j=1}^{N} e^{\tau \cdot text(sim)(I_j,T_i)}} \right)
其中,text(sim)(I,T) 為影像與文本向量的餘弦相似度,\tau 為可學習的溫度引數(temperature parameter),用於縮放 logits。該公式實為兩個方向交叉熵損失的均值:第一項為影像到文本的分類損失(給定影像 I_i,從 N 個文本中選出正確的 T_i),第二項為文本到影像的分類損失。溫度引數 \tau 在訓練中動態調節,避免梯度消失或爆炸。
分散式訓練細節(基於 OpenAI 與社群公開描述):每個 GPU 處理一個子批次,計算區域性相似度矩陣。跨 GPU 的全域性相似度計算需通過 all-gather 通信匯總所有影像和文本向量。OpenAI 在其部落格中透露,訓練使用 592 塊 V100 GPU,但未詳細說明視訊記憶體佔用與通訊拓撲。據 LAION 在 OpenCLIP 專案中的復現實踐(Schuhmann et al., 2022),訓練 ViT-L/14 規模模型需數百 GB 視訊記憶體與高速 InfiniBand 互聯。
架構示意
影像 x ──► 影像編碼器 (ViT/ResNet) ──► 影像特徵 I_i (dim=d)
│
▼
投影層 W_i ──► 嵌入向量 I_e
└── 餘弦相似度 ◄── 嵌入向量 T_e
▲
文本 t ──► 文本編碼器 (Transformer) ──► 文本特徵 T_i (dim=d) ─► 投影層 W_t
### 零樣本推論與提示工程
推論時,使用者提供候選標籤集合。但直接使用單詞標籤(如“cat”)在訓練資料中稀疏出現,會導致效能低於預期。CLIP 論文提出**提示模板整合**(Prompt Engineering and Ensembling):將標籤嵌入 80 個預設模板(如“a photo of a {label}”“a blurry photo of a {label}”),對每個模板的文本向量取均值,再與影像向量計算相似度。這一技巧在 ImageNet 上將零樣本準確率提升了約 5 個百分點。後續工作(如 TPT, Shu et al., 2022)進一步證明可學習提示可提升 CLIP 在特定任務上的表現。
關鍵引數
以下是 CLIP 論文、OpenCLIP 專案及主流變體的關鍵配置對比。資料來源已在表中標註。
| 模型 | 影像編碼器 | 影像引數量(估算) | 文本引數量 (固定) | 總引數量(估算) | 訓練資料 | 資料規模 | 輸入解析度 | 來源 |
|---|---|---|---|---|---|---|---|---|
| CLIP ViT-B/32 | ViT-B/32 | ~88M | ~63M | ~151M | WIT(私有) | 4 億圖文對 | 224×224 | CLIP 論文 (2021) |
| CLIP ViT-B/16 | ViT-B/16 | ~88M | ~63M | ~151M | WIT(私有) | 4 億圖文對 | 224×224 | CLIP 論文 (2021) |
| CLIP ViT-L/14 | ViT-L/14 | ~307M | ~63M | ~370M | WIT(私有) | 4 億圖文對 | 224×224 | CLIP 論文 (2021) |
| CLIP ViT-L/14@336px | ViT-L/14 | ~307M | ~63M | ~370M | WIT(私有) | 4 億圖文對 | 336×336 | CLIP 論文 (2021) |
| CLIP ResNet-50x64 | RN50x64 | ~560M | ~63M | ~623M | WIT(私有) | 4 億圖文對 | 224×224 | CLIP 論文 (2021) |
| OpenCLIP ViT-B/32 | ViT-B/32 | ~88M | ~63M | ~151M | LAION-400M(開源) | 4 億圖文對 | 224×224 | OpenCLIP (2022) |
| OpenCLIP ViT-H/14 | ViT-H/14 | ~632M | ~354M | ~986M | LAION-2B(開源) | 20 億圖文對 | 224×224 | OpenCLIP (2023) |
| OpenCLIP ViT-G/14 | ViT-G/14 | ~1012M | ~694M | ~1.7B | LAION-2B(開源) | 20 億圖文對 | 224×224 | OpenCLIP (2023) |
| SigLIP ViT-SO/14 | ViT-SO/14 | ~877M | — | — | WebLI(私有) | 約 100 億圖文對 | 224×224 | SigLIP 論文 (2023) |
| EVA-02-CLIP-E/14+ | EVA-02 ViT-E/14 | ~4.4B | — | — | 私有合併資料集 | 約 20 億 | 224×224 | EVA-02 論文 (2023) |
注:
- 引數量為社群估算或論文揭露。由於模型變體(如嵌入維度、投影層設計)差異,部分數字可能存在小幅浮動。
- 文本編碼器在 CLIP 原論文中固定約 63M(12 層,512 隱層,8 頭);OpenCLIP 後續版本擴充套件了文本編碼器規模。
- SigLIP 與 EVA-02 的具體引數拆分論文未完全揭露,表中標註“—”表示公開資料未見細分資料。
- LAION-2B 資料集包含 20 億圖文對,但實際訓練中常採用子集(如 LAION-2B-en 約 17 億對,英文子集)。
技術路線
CLIP 的技術演進可劃分為前 CLIP 時代、CLIP 誕生、開源擴充套件與變體爆發四個階段。本節側重對比 CLIP 及其主要後繼方案的技術路線分歧與效能差異。
前 CLIP 時代:有監督預訓練與純視覺對比學習
- 有監督預訓練:以在 ImageNet-1K(約 1400 萬張影像,1000 類)上訓練的分類模型為主導。典型代表為 ResNet-50(Top-1 準確率 76.2%)、EfficientNet。此類模型需針對每個下游任務微調,無零樣本能力。
- 純視覺對比學習:SimCLR(Chen et al., 2020)與 MoCo(He et al., 2020)在無文本監督下,通過影像增強對學習視覺表徵。SimCLR 使用同一影像的兩個增強檢視作為正例,批次內其他影像作為負例;MoCo 引入動量佇列儲存負樣本以緩解大批次需求。此類模型需在下游任務上通過線性評估或微調釋放效能,缺乏開放詞彙識別能力。據 SimCLR 論文,其在 ImageNet 線性評估上達到 76.5% Top-1 準確率(ResNet-50,4× 寬度)。
2021 年:CLIP 開創圖文對比預訓練
OpenAI 於 2021 年 1 月釋出 CLIP 論文(Radford et al.),將對比學習從純視覺領域擴充套件至圖文多模態。關鍵創新點包括:
- 使用 4 億規模的圖文對替代人工標註,訓練資料效率遠超 ImageNet。
- 對稱 InfoNCE 損失使影像與文本相互檢索,訓練目標與下游零樣本任務高度一致。
- 在 27 個數據集上評測零樣本遷移能力,涵蓋細粒度分類、動作識別、衛星影像等,大多數任務超越全監督 ResNet-50。
CLIP 原論文報告的 ImageNet 零樣本 Top-1 準確率為 76.2%(ViT-L/14@336px)。作為對比,ALIGN 模型(Google,Jia et al., 2021)使用 18 億粗粒度圖文對,在微調設定下達到 88.6% Top-1(EfficientNet-L2),但其零樣本設定與 CLIP 有差異(ALIGN 允許使用更多提示模板與更大解析度),直接比較需謹慎。
2022–2023 年:開源運動與規模化
- OpenCLIP 與 LAION:由於 OpenAI 未公開 CLIP 訓練程式碼與 WIT 資料集,德國非營利組織 LAION 於 2022 年釋出 LAION-400M 開源圖文資料集,並與社群合作開發 OpenCLIP 復現 CLIP 訓練流程。2023 年,LAION-5B(58.5 億圖文對)釋出,成為當時最大規模開源圖文資料集。OpenCLIP 在此基礎上訓練出 ViT-H/14 與 ViT-G/14 等更大規模模型,零樣本效能超越 OpenAI 原始 CLIP。據 OpenCLIP 專案公開的基準測試,ViT-G/14 在 ImageNet 零樣本上達到 84.4% Top-1 準確率。
- SigLIP(Google DeepMind,Zhai et al., 2023):提出將對比學習的 softmax 歸一化損失替換為成對的 sigmoid 損失。傳統 CLIP 損失需對批次內所有負例進行全域性歸一化,計算複雜度高且對批次大小敏感;SigLIP 對每個圖文對獨立計算 sigmoid 交叉熵,使訓練更穩定、更易於擴充套件到超大 batch。Google在約 100 億圖文對(WebLI 資料集)上訓練 SigLIP,效能顯著優於同規模 CLIP。該論文未公開全部模型引數,但報告在 10 億引數規模下,SigLIP 在多項基準上優於 CLIP。
2023–2024 年:融合掩碼建模與 LLM 的變體
- BLIP-2(Li et al., 2023):使用凍結的 CLIP 視覺編碼器與凍結的大語言模型,通過輕量的 Q-Former 模組連線兩者。Q-Former 通過對比學習與生成損失共同訓練,實現圖文理解與生成的統一。BLIP-2 在 VQA 與影像描述任務上達到當時最佳水平,且訓練效率遠高於端到端多模態訓練。
- EVA-CLIP 系列(Fang et al., 2023):將掩碼影像建模(Masked Image Modeling, MIM)與 CLIP 對比學習結合。通過首先在無標籤影像上使用 MIM 預訓練視覺編碼器,再遷移至 CLIP 對比訓練,EVA-CLIP 在同等資料量下獲得更高的訓練效率與最終效能。EVA-02-CLIP-E/14+ 使用約 4.4B 引數的視覺編碼器加對比微調,在多項基準上達到開源模型最佳水平。
- LLaVA 等視覺-語言模型(Liu et al., 2023–2024):將 CLIP 視覺編碼器作為前端,通過簡單線性投影或 MLP 連線語言模型(如 LLaMA、Vicuna),在指令微調資料上訓練。此類模型依賴 CLIP 提供的視覺語義先驗,將影像轉化為語言模型可理解的 token 串。LLaVA-1.5(2024)使用 CLIP ViT-L/14 時,在 ScienceQA 等多項基準上超越 GPT-4V 的早期版本。
技術路線對比
| 方法 | 監督訊號 | 視覺概念覆蓋 | 零樣本能力 | 典型 ImageNet 效能 | 訓練資料規模 | 訓練效率 |
|---|---|---|---|---|---|---|
| 傳統有監督預訓練 (ResNet-50) | 人工類別標籤 | ~1000 類 | 無 | 76.2% Top-1 (微調) | 1.4M 標註影像 | 高(僅需單機) |
| SimCLR (純視覺對比) | 影像增強對 | 無類別(無文本) | 無 | 76.5% Top-1 (線性評估) | 1.4M 影像 | 低(需大 batch) |
| CLIP ViT-L/14 (OpenAI) | 圖文對弱監督 | 開放詞彙 | 強 | 76.2% 零樣本 | 400M 圖文對 (WIT) | 低(592 GPU×18 天) |
| OpenCLIP ViT-G/14 | 圖文對弱監督(開源) | 開放詞彙 | 強 | 84.4% 零樣本 | 2B 圖文對 (LAION-2B) | 低(約 1024 GPU×數週) |
| SigLIP (Google) | 圖文對獨立損失 | 開放詞彙 | 強 | 未公開零樣本數值 | ~10B 圖文對 (WebLI) | 中(sigmoid 更高效) |
| BLIP-2 | 圖文對比 + 生成 | 開放詞彙 | 強 | 不適用(VQA 最佳化) | 129M 圖文對 + LLM | 高(凍結編碼器) |
| EVA-02-CLIP-E/14+ | 掩碼建模 + 對比 | 開放詞彙 | 強 | 82.0% 零樣本 (E/14+) | ~2B 圖文對 | 低(MIM 預訓練) |
表內資料來自對應論文。ImageNet 零樣本評測的提示模板與評測協議在不同論文間存在差異(如模板數量、整合方式),精確對比需統一測試條件。
上游
CLIP 的上游產業鏈由資料、算力、基礎研究三個核心要素構成,三者共同決定模型的效能上限與產業供給能力。
1. 資料:圖文對的獲取、清洗與去重
CLIP 的訓練資料依賴大規模、弱對齊的圖文對,來源為網際網路公開網頁。與精標註資料集不同,此類資料天然包含噪聲、錯誤對齊與社會偏見。上游資料處理的核心環節包括:
- 資料抓取:OpenAI 的 WIT 資料集未公開抓取細節。LAION 團隊利Common Crawl 公開的網頁存檔,通過篩選包含 “ 標籤且
alt屬性非空的 HTML 頁面提取圖文對。據 LAION-5B 論文(Schuhmann et al., 2022),原始資料池包含約 58.5 億圖文對,儲存規模達 12TB。 - 資料清洗:
- 語言過濾:僅保留英文描述,去除文本長度不足 2 個字元或超過 256 個 token 的樣本。
- 安全過濾:通過黑名單去除成人、暴力等敏感內容(使用影像分類器與文本關鍵詞)。
- 質量篩選:使用 CLIP 自身對圖文對齊度進行打分,過濾相似度低於閾值的對。根據 LAION 報告,OpenCLIP 訓練使用 LAION-2B-filtered,保留原始資料中約 49%(即約 10 億高質量對)。
- 去重與分佈平衡:使用 MinHash 等演算法對影像進行近似去重,防止訓練資料中的重複樣本導致過擬合與偏見放大。目前尚無公開研究系統性量化去重對 CLIP 效能的影響,但社群共識認為這是訓練穩定性的關鍵步驟。
供給端格局:開源生態圍繞 LAION 建置,已釋出的資料集按時間線包括:LAION-400M(2022 年,4 億)、LAION-5B(2023 年,58.5 億)、LAION-2B-multi(多語言,覆蓋 100+ 種語言)。閉源方面,Google的 WebLI(~10B)、阿里雲端的 M6 資料集、百度的文心資料集等均為企業內部資產,未經公開發布。據公開資訊,截至 2024 年,尚未出現專業的圖文資料商業化供應商,該環節仍以研究機構與企業內部團隊自建為主。
2. 算力:GPU 叢集與網際網路絡
CLIP 的訓練對算力需求集中於大規模分散式對比計算。OpenAI 原論文報告使用 592 塊 NVIDIA V100 GPU 訓練 18 天(ViT-L/14)。考慮到 V100 單精度浮點算力為 15.7 TFLOPS(FP32),估算總計算量約 15.3M GPU-hours(社群估算,論文未精確揭露)。OpenCLIP 訓練 ViT-G/14 使用約 1024 塊 A100 GPU(312 TFLOPS FP16 per GPU),耗時數週(具體週數未公開)。
算力瓶頸主要來自:
- 視訊記憶體需求:批次大小 32,768 意味著每步需在前向-反向過程中儲存數萬對圖文向量的中間啟用值,視訊記憶體佔用常超單卡容量(V100 為 16/32GB,A100 為 40/80GB),需藉助模型並行與梯度檢查點技術。
- 通訊需求:全域性相似度矩陣計算依賴 all-gather 操作,批次內
N×N矩陣規模為 32,768×32,768(約 10 億元素),對 GPU 間互聯頻寬提出高要求。實際訓練通常使用 InfiniBand HDR(200Gbps)或 NDR(400Gbps)網路。
核心供應商:
- 輝達(NVIDIA):GPU 市場的主導者,V100/A100/H100 系列為 CLIP 類訓練的標準配置。據輝達 FY2024 年報(截至 2024 年 1 月),資料中心業務營收 475 億美元,年增率增長 217%,生成式 AI 訓練需求為主要驅動力。公開資料未見輝達單獨揭露 CLIP 相關 GPU 銷售額。
- AMD:Instinct MI250X/MI300X 系列 GPU 為替代選項,但截至 2024 年上半年,CLIP 訓練使用 AMD GPU 的公開案例極少,生態系統適配尚需時間。據 AMD 2024 年 1 月財報會議,其將 AI GPU 業務 2024 年營收展望上調至 35 億美元。
3. 基礎研究
CLIP 的誕生直接受益於三項前置研究:
- Transformer 架構(Vaswani et al., 2017):為影像(ViT,Dosovitskiy et al., 2020)與文本的雙塔編碼器提供基礎架構。
- 對比學習:InfoNCE 損失(van den Oord et al., 2018)在表徵學習中的推廣,SimCLR 證明了純視覺對比學習的可行性。
- 大規模弱監督:JFT-300M(Sun et al., 2017)等專案驗證了使用含噪聲的網際網路規模資料預訓練視覺模型的可行性。
這部分上游以學術產出為主,無直接商業化實體,但持續為產業提供方法論文持。
下游
CLIP 的直接應用集中於需要連線視覺與語言模態的場景。下游生態可分為四大領域,各領域的商業化成熟度與市場集中度差異顯著。
1. AI 生成模型(AIGC)
這是 CLIP 當前最大的下游需求來源。Stable Diffusion 系列(Stability AI, 2022–2024)與 DALL·E 2/3(OpenAI, 2022–2023)均將預訓練的 CLIP 文本編碼器作為影像生成的第一步:使用者輸入的文本提示經 CLIP 編碼為語義向量,隨後由擴散模型逐步去噪生成影像。CLIP 在此扮演“語義翻譯器”角色,決定了生成影像與文本描述的對齊程度。
- Stable Diffusion:截至 2024 年,其生態(含 Automatic1111 WebUI、ComfyUI 等第三方工具)下載量超 5 億次(Stability AI 公開宣告,含間接分發估算)。Stable Diffusion 1.x 使用 OpenCLIP ViT-L/14,2.x 部分版本轉向 OpenCLIP ViT-H/14。Stability AI 在 2023 年釋出的 SDXL 中自研了雙文本編碼器(OpenCLIP ViT-G/14 + CLIP ViT-L),試圖對上游編碼器形成自主可控。
- DALL·E 3:據 OpenAI 部落格(2023 年 9 月),DALL·E 3 使用改進的 CLIP 變體進行圖文匹配度評估,並作為生成結果排序依據(類似於 CLIP 的判別式應用),但具體版本與引數未公開。
2. 多模態搜尋與檢索
企業級應用集中於電商、相簿、影片平台的跨模態搜尋。典型場景為“以文搜圖”:使用者上傳自然語言描述(如“深藍色牛仔褲 九分 破洞”),系統基於 CLIP 嵌入召回相關商品影像。據公開發布的工程部落格,Pinterest、Shutterstock 等平台已在搜尋管線中測試或部署 CLIP 類模型。
- 技術指標:多模態檢索常用 Recall@K 衡量。CLIP ViT-L/14 在 Flickr30k 測試集上的圖文檢索指標為:Text-to-Image Recall@1 68.7%(CLIP 論文資料,零樣本,30k 測試集),Image-to-Text Recall@1 88.0%。OpenCLIP 更大型模型可進一步超越此基準。
- 市場規模:多模態搜尋為視覺搜尋市場的子集。據 Grand View Research 於 2023 年釋出的估算(報告編號 GVR-4-68040-157-2),2023 年全球視覺搜尋市場規模約 147 億美元,預計 2023–2030 年複合年增長率(CAGR)為 17.2%。CLIP 相關方案佔比公開資料未見細分。
3. 內容安全與稽核
社交媒體平台與內容託管服務利用 CLIP 的零樣本能力,快速部署敏感內容過濾器。例如,可將 CLIP 作為第一級篩查,識別可疑影像,再由人工或專用模型複核。由於 CLIP 的開放詞彙特性,稽核策略可通過配置檔案更新,無需重新訓練。
據公開報道,Meta、字節跳動等公司在 2023 年分別公開了在其稽核系統中使用多模態模型的合作或自研進展,但未具體指出是否直接使用 CLIP。商業化的稽核 API 提供商(如 Hive Moderation、Sightengine)在 2024 年的產品文件中提及支援基於 CLIP 的自定義類別稽核,表明該技術已進入實際部署階段。市場份額資料未見系統性統計。
4. 機器人感知與具身智慧
CLIP 在此領域仍多處於研究階段,但已出現明確的產業轉化跡象。2023 年 7 月,Google DeepMind 釋出 RT-2(Robotics Transformer 2),使用 CLIP 編碼視覺輸入,與 LLM 共同輸出機器人動作指令。RT-2 在未見過的新任務上展現出顯著的泛化能力。同年,斯坦福大學的 VIMA 專案使用凍結的 CLIP 作為多模態輸入的編碼器。在國內,北京智源人工智慧研究院在 2024 年初發布的具身智慧研究路線圖中也將多模態對齊列為關鍵挑戰。
然而,具身智慧的商業化尚處早期,暫無依賴 CLIP 的成熟產品面世。據公開資料,截至 2024 年上半年,該領域投資以早期風險投資為主,產業鏈尚未形成規模。
受益公司
本節基於公開資訊列舉產業鏈中直接受益或積極版面配置 CLIP 變體及相關技術的企業與機構。不構成任何投資建議。
1. 模型與技術供給層
- OpenAI:CLIP 原創者,閉源主導。其最新版本 CLIP 未獨立釋出,而是深度集成於 DALL·E 3、GPT-4V(視覺理解元件)等產品中。公司於 2024 年 2 月完成新一輪融資,估值超 800 億美元(據《華爾街日報》報道,2024 年 2 月),公開資料來源顯示該估值較 2023 年初約 290 億美元大幅提升。CLIP 作為多模態基礎能力的技術壁壘之一,是支撐估值的重要組成部分,但難以獨立量化其財務貢獻。
- Stability AI:生成式 AI 公司,早期 Stable Diffusion 嚴重依賴 CLIP 文本編碼器。為降低對 OpenAI/OpenCLIP 上游依賴,已開始自研替代方案。2024 年釋出的 Stable Diffusion 3 採用全新的多模態擴散 Transformer 架構,公開資料未見其明確使用 CLIP。據公司 2023 年公開揭露,其年度經常性營收(ARR)在 2023 年底約為 5000 萬美元(口徑:包括 API 服務與授權許可)。盈利狀況未見公開資料,公開報道通常指向其持續虧損。
- LAION:德國非營利組織,通過釋出 LAION-400M/5B 資料集與 OpenCLIP 專案,為全球超過 100 個研究機構與企業提供訓練基礎。LAION 本身不從事商業運營,其間接賦能的創業公司覆蓋多模態搜尋、醫學影像、AI 生成等領域,具體數字無法統計。
2. 計算基礎設施層
- 輝達(NVIDIA, NASDAQ: NVDA):作為 GPU 市場的主導者,直接受益於 CLIP 類大規模圖文預訓練的算力需求。訓練一個類似 ViT-G/14 規模的 OpenCLIP 模型所需 GPU 數量通常在 512–1024 塊 A100/H100 級別,對應購買成本在 500 萬–1500 萬美元不等(以 H100 單卡 $25,000–$30,000 市價估算,2024 年 1 月口徑)。據輝達 FY2024 Q4 財報(截至 2024 年 1 月),資料中心業務營收 184 億美元(單季),年增率增長 409%,其中生成式 AI 訓練與推論需求被多次提及為核心驅動力。公開資料未見其單獨揭露 CLIP 相關產品銷售資料。
- 超大規模雲端廠商(微軟 Azure, Google GCP, 亞馬遜 AWS):通過提供 GPU 例項與 AI 平台服務間接受益。例如,微軟 Azure 在 2023 年獨家為 OpenAI 提供訓練基礎設施。據各公司季度財報(2024 Q1–Q2),AI 業務已成為核心增長引擎:微軟 Azure 在 FY2024 Q3 報告 AI 服務營收增長 6 個百分點貢獻(具體金額未單列),Google雲端在 2024 Q1 報告 AI 基礎設施與生成式 AI 解決方案“需求強勁”,AWS 在 2024 Q1 報告 AI 相關業務“數十億美元的年化營收執行率”。同樣,CLIP 類負載的額佔比未公開。
3. 國內企業
- 智源研究院:釋出“悟道·文瀾”系列多模態模型,是國內較早復現與擴充套件 CLIP 的研究機構,其開源模型在國內學術與產業界有一定影響力。
- 阿里巴巴、華為、百度:均有圖文預訓練研發。阿里達摩院 2022 年釋出 OFA(One For All)多模態模型;華為昇騰團隊釋出悟空 FILIP(2022);百度文心大型模型中包含多模態變體。這些模型均在 CLIP 範式基礎上進行改進,但目前尚未出現商業化規模超越 OpenAI 的明確訊號。
- AI 晶片廠商(華為昇騰、寒武紀等):若國產 CLIP 模型訓練轉向國產 GPU,將直接拉動晶片需求。但截至 2024 年,大規模圖文對比訓練的國產晶片替換案例極少在公開資料中被系統報道,產業成熟度仍待驗證。
市場規模
CLIP 作為基礎模型元件,本身不直接形成獨立市場。其市場規模需通過下游應用的放大效應進行間接估算。由於缺乏統一的產業分類與資料口徑,以下分析基於現有研究報告與公開資料的合理推斷,所有數字均標註來源與口徑。
全球多模態 AI 市場(CLIP 相關子集)
- 據 Grand View Research 於 2024 年 1 月釋出的報告(編號 GVR-4-68040-157-2),全球多模態 AI 市場規模在 2023 年約為 23 億美元。該市場的定義包含視覺-語言模型、多模態生成、多模態理解等,CLIP 類模型被視為核心使能技術之一。報告預測 2023–2030 年複合年增長率為 35.8%,主要驅動力為 AIGC 與自動化內容稽核需求。
- 另一研究機構 MarketsandMarkets 於 2023 年 10 月釋出的《AI 訓練資料集市場》報告(編號 M&M-AI-2023-10)中,全球 AI 訓練資料集市場在 2023 年約為 27 億美元,預計 2028 年達到 75–80 億美元(CAGR 約 22%)。其中,圖文對資料集(含開源與商用)為增長最快的細分之一。CLIP 訓練所需的弱圖文資料集與精標註影像資料集分屬不同子市場,財報資料未對“弱圖文資料”進行單獨追蹤。
AI 生成內容(AIGC)市場中的 CLIP 貢獻
- 據 Bloomberg Intelligence 於 2023 年 6 月的行業報告,全球生成式 AI 市場在 2023 年約為 400 億美元,包含了基礎設施(GPU、雲端)、模型訓練、應用服務等。該預測模型假設到 2032 年市場將增長至 1.3 萬億美元。
- 在 AIGC 影像與影片細分領域,Stable Diffusion、Midjourney、DALL·E 等頭部產品在 2023 年的總營收(含訂閱、API、許可)據估算合計在 5–8 億美元(來源:The Information 與各公司零星揭露的綜合推斷,2023 年 11 月報道)。CLIP 文本編碼器在這類產品中成本佔比通常較低(約為推論總成本的 5%–15%,根據 Hugging Face 社群估算),但作為核心語義理解元件,其技術替代成本高。
中國圖文預訓練模型相關市場
公開資料未見系統性追蹤中國 CLIP 或圖文預訓練模型市場的獨立研究。但中國 AIGC 市場的快速增長為下游需求提供了參照系。據艾瑞諮詢於 2023 年 12 月釋出的報告(《中國 AIGC 產業全景報告》),中國 AIGC 產業規模在 2023 年約為 170 億元人民幣(約 24 億美元,按 1 USD=7.1 CNY 換算),預計 2028 年達到約 7200 億元人民幣(約 1014 億美元),CAGR 超 100%。報告將“多模態大型模型”列為基礎層關鍵賽道,且國內主要廠商均已版面配置圖文預訓練模型。
資料口徑警示:上述所有市場資料均為研究機構或媒體的預測性估算,不同報告對“多模態 AI”“AIGC”的定義差異較大,不建議將數字直接加總比較。CLIP 作為技術元件的精確市場規模在公開資料中未見計算,上述數字僅作為理解產業規模的宏觀參照。
玩家對比
CLIP 相關玩家可依據訓練資料與模型權重的開放程度分為三大陣營。下表基於截至 2024 年上半年的公開資訊編制,涵蓋代表性模型及其關鍵指標。
| 模型/專案 | 開發方 | 是否開源權重 | 訓練資料規模 | 模型最大引數量(估算) | 零樣本 ImageNet Top-1 | 關鍵優勢 | 侷限性 |
|---|---|---|---|---|---|---|---|
| CLIP (原版) | OpenAI | 部分開源(ViT-B/32, ViT-L/14 等) | 4 億 (WIT) | ~623M (RN50x64) | 76.2% (ViT-L/14@336px) | 原創性、學術標準 | WIT 資料集未公開,大型模型閉源 |
| DALL·E 3 CLIP 變體 | OpenAI | 未開源 | 未公開 | 未公開 | 未獨立評測 | 與生成模型深度耦合 | 不獨立提供,無法復現 |
| OpenCLIP | LAION + 社群 | 完全開源 | 20 億 (LAION-2B) | ~1.7B (ViT-G/14) | 84.4% (ViT-G/14) | 完全開源,復現友好 | 資料質量依賴 LAION,去重開銷大 |
| ALIGN | 未開源 | 18 億 (私有) | — | 88.6% (微調) | 資料規模大,噪聲魯棒性強 | 零樣本設定不透明,不開源 | |
| SigLIP | Google DeepMind | 部分開源(ViT-SO/14 權重未公開) | ~100 億 (WebLI) | — | 未單獨公佈零樣本 | sigmoid 損失更高效 | 大型模型不開源,資料集未公開 |
| EVA-02-CLIP | 北京智源 + 多機構 | 完全開源 | ~20 億 (合併資料集) | ~4.4B (E/14+) | 82.0% (E/14+ 零樣本) | MIM+對比,訓練高效 | 計算資源需求極高 |
| BLIP-2 | Salesforce | 完全開源(含 Q-Former) | 129M 圖文對 | 凍結 CLIP + LLM | 不適用 (評測側重 VQA) | 連線 LLM,理解與生成統一 | 依賴凍結 CLIP,上限受限 |
| 文瀾 (WenLan) | 智源研究院 | 完全開源 | 7 億 圖文對 (私有) | — | 未公開 ImageNet 零樣本 | 國內首個大規模開源圖文模型 | 社群生態較小 |
| OFA | 阿里巴巴 | 完全開源 | 約 200M 圖文對 + 多工資料 | ~930M (OFA-Huge) | — | 統一跨模態架構 | ImageNet 零樣本非設計目標 |