CLIP
3 秒看懂
CLIP(Contrastive Language-Image Pre-training)是由 OpenAI 于 2021 年提出的图文对比预训练模型。其核心创新在于抛弃了传统视觉模型依赖固定类别标签的训练范式,转而利用互联网上天然存在的 4 亿对图文配对数据进行学习。模型将图像和文本分别编码至同一向量空间,通过对比学习迫使匹配的图文对在该空间中距离拉近,而非匹配对相互远离。这一设计赋予模型强大的零样本(Zero-Shot)泛化能力——无需针对特定任务进行微调,仅凭一句自然语言描述(如“一只戴墨镜的柴犬”),即可在未见过的图像中识别对应概念。CLIP 的开放词汇特性使其成为 Stable Diffusion、DALL·E 等主流 AI 生成模型的语义理解基石,也是多模态检索、内容审核等产业应用的基础组件。
3 分钟产业解释
传统计算机视觉开发遵循“标注-训练-部署”的线性流程:开发者需预先定义类别(如 1000 类物体),聘请标注团队逐一标记数万至数百万张图像,训练专用分类器,若需新增类别则须重复全流程。这一范式在长尾场景与快速变化的业务需求面前成本高昂且响应迟缓。
CLIP 颠覆了上述范式,其产业逻辑可拆解为三个层次:
第一层:双塔架构与弱监督学习 模型由两个独立编码器构成——图像编码器(早期采用 ResNet,后演化为 Vision Transformer/ViT)与文本编码器(基于 GPT-2 风格的 12 层 Transformer)。两者分别将图像和自然语言片段映射至同一高维向量空间(如 512 维或 768 维),并通过线性投影层与 L2 归一化使所有向量位于单位超球面上。训练数据来源于 OpenAI 私有的 WIT(WebImageText)数据集,包含从互联网爬取的 4 亿对图文,覆盖 50 万+ 粗粒度概念,无需人工清洗与标注。据 CLIP 原论文(Radford et al., 2021)披露,该数据集的规模与多样性远超 ImageNet(约 1400 万张标注图像,1000 类)。
第二层:对比学习的规模化实现 训练时,每个批次(batch size)包含 32,768 个图文对。模型计算该批次内所有图像向量与所有文本向量间的余弦相似度,形成一个 32,768×32,768 的相似度矩阵。损失函数为对称 InfoNCE 损失:对于每一个图像,最大化其与正确配对的文本的相似度,同时最小化与其他 32,767 个错误文本的相似度;文本端同理。这一计算需要在 592 块 NVIDIA V100 GPU 上进行大规模张量并行通信,每块 GPU 负责批次的一部分,并通过 all-gather 操作汇总全局相似度矩阵。OpenAI 报告称,ViT-L/14 版本的 CLIP 训练耗时约 18 天(以 V100 为基准估算)。
第三层:零样本推理与产业嵌入 训练完成后,CLIP 在推理阶段无需任何微调。以图像分类为例:用户提供一张待分类图像,以及一组由自然语言构造的候选描述(如“一张猫的照片”“一张狗的照片”)。模型分别计算图像向量与每个文本向量的余弦相似度,选择相似度最高的文本作为分类结果。OpenAI 在论文中报告,CLIP ViT-L/14@336px 在 ImageNet 数据集上达到 76.2% 的零样本 Top-1 准确率,与全监督训练的 ResNet-50(76.2%)持平,且对自然分布偏移(如从 ImageNet 迁移至 ImageNet-R 数据集)展现出远超传统模型的鲁棒性(ImageNet-R 准确率达 87.9%)。
产业影响已渗透至以下领域:
- AI 生成模型(AIGC):Stable Diffusion 系列(1.x、2.x)的核心文本编码器采用 OpenCLIP 的 ViT-L/14 或 ViT-H/14 版本,将自然语言提示转化为视觉语义引导。DALL·E 2 使用 CLIP 嵌入进行图像生成的语义对齐。据 Stability AI 于 2024 年公开的信息,Stable Diffusion 系列的全球下载量已超 5 亿次(含 Web UI 分发),其配套 CLIP 权重的需求呈刚性。
- 多模态检索与理解:文本搜图(如“夕阳下的海滩”)、视频片段检索、视觉问答(VQA)、图像描述生成等领域均以 CLIP 嵌入作为特征提取基础,继而接入大语言模型(如 MiniGPT-4、LLaVA)进行推理。例如,LLaVA-1.5(Liu et al., 2024)使用 CLIP ViT-L/14 作为视觉编码器,仅用线性投影层连接 LLaMA 语言模型,在多项多模态基准测试中达到领先水平。
- 内容安全与审核:利用 CLIP 的零样本能力,企业可快速构建违规内容识别系统(如暴力、色情),无需为每个敏感类别单独收集标注数据。据公开资料,部分社交平台已在审核管线中集成 CLIP 或同类模型。
- 机器人感知与具身智能:CLIP 作为视觉-语言接口,连接自然语言指令与视觉场景理解。例如,Google DeepMind 于 2023 年发布的 RT-2 模型使用 CLIP 编码视觉输入,实现机器人操作任务的泛化。
上述应用使其成为 AIGC 时代不可或缺的基础设施。然而,CLIP 自身不生成内容,其角色是“语义对齐器”,这使得它常被下游模型作为模块化组件嵌入,而非作为独立产品提供。
技术原理
CLIP 的技术本质是学习一个联合的图文嵌入空间,使得语义相近的图文对在向量空间中位置接近。其架构可抽象为四个核心组件:
1. 图像编码器
CLIP 论文实验了两种主干网络:
- ResNet 系列:从 ResNet-50 到 ResNet-50x64(将标准 ResNet-50 宽度扩展 64 倍),后者的参数量达约 623M。ResNet 采用标准卷积架构,输出最后一层池化前的特征图,经注意力池化层聚合成固定维度向量。
- Vision Transformer(ViT)系列:从 ViT-B/32 到 ViT-L/14@336px。图像被切割为固定尺寸的图像块(patch),如 14×14 像素,经线性投影后作为 Transformer 的输入序列。模型在序列开头添加一个可学习的
[CLS]token,其最终输出经 LayerNorm 后作为图像特征向量。论文最终验证 ViT 在计算效率与下游性能上均优于同等计算量下的 ResNet。
图像编码器输出的特征向量 I_i 维度为 d(如 ViT-L 的 768 维)。
2. 文本编码器
采用 GPT-2 风格的 12 层 Transformer(63M 参数,隐藏维度 512,8 个注意力头)。输入文本经字节对编码(BPE)分词后,截断或填充至最大 76 个 token。序列以 [SOS] 开始,以 [EOS] 结束,[EOS] token 的输出经 LayerNorm 后作为文本特征向量 T_i,维度经线性投影至与图像特征相同的 d 维。
3. 投影与归一化
两个编码器的输出 I_i 和 T_i 各自通过一个独立的线性投影层映射到同一嵌入维度(如 512 或 768),随后进行 L2 归一化,使所有向量的模长为 1。这一步骤将特征空间约束在单位超球面上,使余弦相似度计算等价于向量内积。
4. 对称 InfoNCE 损失
对于一个包含 N 个图文对的批次(N=32,768),模型计算所有图像向量与所有文本向量之间的余弦相似度,形成 N×N 的相似度矩阵。损失函数为:
mathcal(L) = frac(1){2N} \sum_{i=1}^{N} \left( -\log frac(e^{\tau \cdot text(sim)(I_i,T_i)}){\sum_{j=1}^{N} e^{\tau \cdot text(sim)(I_i,T_j)}} -\log frac(e^{\tau \cdot text(sim)(I_i,T_i)}){\sum_{j=1}^{N} e^{\tau \cdot text(sim)(I_j,T_i)}} \right)
其中,text(sim)(I,T) 为图像与文本向量的余弦相似度,\tau 为可学习的温度参数(temperature parameter),用于缩放 logits。该公式实为两个方向交叉熵损失的均值:第一项为图像到文本的分类损失(给定图像 I_i,从 N 个文本中选出正确的 T_i),第二项为文本到图像的分类损失。温度参数 \tau 在训练中动态调节,避免梯度消失或爆炸。
分布式训练细节(基于 OpenAI 与社区公开描述):每个 GPU 处理一个子批次,计算局部相似度矩阵。跨 GPU 的全局相似度计算需通过 all-gather 通信汇总所有图像和文本向量。OpenAI 在其博客中透露,训练使用 592 块 V100 GPU,但未详细说明显存占用与通信拓扑。据 LAION 在 OpenCLIP 项目中的复现实践(Schuhmann et al., 2022),训练 ViT-L/14 规模模型需数百 GB 显存与高速 InfiniBand 互联。
架构示意
图像 x ──► 图像编码器 (ViT/ResNet) ──► 图像特征 I_i (dim=d)
│
▼
投影层 W_i ──► 嵌入向量 I_e
└── 余弦相似度 ◄── 嵌入向量 T_e
▲
文本 t ──► 文本编码器 (Transformer) ──► 文本特征 T_i (dim=d) ─► 投影层 W_t
### 零样本推理与提示工程
推理时,用户提供候选标签集合。但直接使用单词标签(如“cat”)在训练数据中稀疏出现,会导致性能低于预期。CLIP 论文提出**提示模板集成**(Prompt Engineering and Ensembling):将标签嵌入 80 个预设模板(如“a photo of a {label}”“a blurry photo of a {label}”),对每个模板的文本向量取均值,再与图像向量计算相似度。这一技巧在 ImageNet 上将零样本准确率提升了约 5 个百分点。后续工作(如 TPT, Shu et al., 2022)进一步证明可学习提示可提升 CLIP 在特定任务上的表现。
## 关键参数
以下是 CLIP 论文、OpenCLIP 项目及主流变体的关键配置对比。数据来源已在表中标注。
| 模型 | 图像编码器 | 图像参数量(估算) | 文本参数量 (固定) | 总参数量(估算) | 训练数据 | 数据规模 | 输入分辨率 | 来源 |
|------|------------|-------------------|-------------------|------------------|----------|----------|------------|------|
| CLIP ViT-B/32 | ViT-B/32 | ~88M | ~63M | ~151M | WIT(私有) | 4 亿图文对 | 224×224 | CLIP 论文 (2021) |
| CLIP ViT-B/16 | ViT-B/16 | ~88M | ~63M | ~151M | WIT(私有) | 4 亿图文对 | 224×224 | CLIP 论文 (2021) |
| CLIP ViT-L/14 | ViT-L/14 | ~307M | ~63M | ~370M | WIT(私有) | 4 亿图文对 | 224×224 | CLIP 论文 (2021) |
| CLIP ViT-L/14@336px | ViT-L/14 | ~307M | ~63M | ~370M | WIT(私有) | 4 亿图文对 | 336×336 | CLIP 论文 (2021) |
| CLIP ResNet-50x64 | RN50x64 | ~560M | ~63M | ~623M | WIT(私有) | 4 亿图文对 | 224×224 | CLIP 论文 (2021) |
| OpenCLIP ViT-B/32 | ViT-B/32 | ~88M | ~63M | ~151M | LAION-400M(开源) | 4 亿图文对 | 224×224 | OpenCLIP (2022) |
| OpenCLIP ViT-H/14 | ViT-H/14 | ~632M | ~354M | ~986M | LAION-2B(开源) | 20 亿图文对 | 224×224 | OpenCLIP (2023) |
| OpenCLIP ViT-G/14 | ViT-G/14 | ~1012M | ~694M | ~1.7B | LAION-2B(开源) | 20 亿图文对 | 224×224 | OpenCLIP (2023) |
| SigLIP ViT-SO/14 | ViT-SO/14 | ~877M | — | — | WebLI(私有) | 约 100 亿图文对 | 224×224 | SigLIP 论文 (2023) |
| EVA-02-CLIP-E/14+ | EVA-02 ViT-E/14 | ~4.4B | — | — | 私有合并数据集 | 约 20 亿 | 224×224 | EVA-02 论文 (2023) |
注:
- 参数量为社区估算或论文披露。由于模型变体(如嵌入维度、投影层设计)差异,部分数字可能存在小幅浮动。
- 文本编码器在 CLIP 原论文中固定约 63M(12 层,512 隐层,8 头);OpenCLIP 后续版本扩展了文本编码器规模。
- SigLIP 与 EVA-02 的具体参数拆分论文未完全披露,表中标注“—”表示公开资料未见细分数据。
- LAION-2B 数据集包含 20 亿图文对,但实际训练中常采用子集(如 LAION-2B-en 约 17 亿对,英文子集)。
## 技术路线
CLIP 的技术演进可划分为前 CLIP 时代、CLIP 诞生、开源扩展与变体爆发四个阶段。本节侧重对比 CLIP 及其主要后继方案的技术路线分歧与性能差异。
### 前 CLIP 时代:有监督预训练与纯视觉对比学习
- **有监督预训练**:以在 ImageNet-1K(约 1400 万张图像,1000 类)上训练的分类模型为主导。典型代表为 ResNet-50(Top-1 准确率 76.2%)、EfficientNet。此类模型需针对每个下游任务微调,无零样本能力。
- **纯视觉对比学习**:SimCLR(Chen et al., 2020)与 MoCo(He et al., 2020)在无文本监督下,通过图像增强对学习视觉表征。SimCLR 使用同一图像的两个增强视图作为正例,批次内其他图像作为负例;MoCo 引入动量队列存储负样本以缓解大批次需求。此类模型需在下游任务上通过线性评估或微调释放性能,缺乏开放词汇识别能力。据 SimCLR 论文,其在 ImageNet 线性评估上达到 76.5% Top-1 准确率(ResNet-50,4× 宽度)。
### 2021 年:CLIP 开创图文对比预训练
OpenAI 于 2021 年 1 月发布 CLIP 论文(Radford et al.),将对比学习从纯视觉领域扩展至图文多模态。关键创新点包括:
- 使用 4 亿规模的图文对替代人工标注,训练数据效率远超 ImageNet。
- 对称 InfoNCE 损失使图像与文本相互检索,训练目标与下游零样本任务高度一致。
- 在 27 个数据集上评测零样本迁移能力,涵盖细粒度分类、动作识别、卫星图像等,大多数任务超越全监督 ResNet-50。
CLIP 原论文报告的 ImageNet 零样本 Top-1 准确率为 76.2%(ViT-L/14@336px)。作为对比,ALIGN 模型(谷歌,Jia et al., 2021)使用 18 亿粗粒度图文对,在微调设定下达到 88.6% Top-1(EfficientNet-L2),但其零样本设定与 CLIP 有差异(ALIGN 允许使用更多提示模板与更大分辨率),直接比较需谨慎。
### 2022–2023 年:开源运动与规模化
- **OpenCLIP 与 LAION**:由于 OpenAI 未公开 CLIP 训练代码与 WIT 数据集,德国非营利组织 LAION 于 2022 年发布 LAION-400M 开源图文数据集,并与社区合作开发 OpenCLIP 复现 CLIP 训练流程。2023 年,LAION-5B(58.5 亿图文对)发布,成为当时最大规模开源图文数据集。OpenCLIP 在此基础上训练出 ViT-H/14 与 ViT-G/14 等更大规模模型,零样本性能超越 OpenAI 原始 CLIP。据 OpenCLIP 项目公开的基准测试,ViT-G/14 在 ImageNet 零样本上达到 84.4% Top-1 准确率。
- **SigLIP**(谷歌 DeepMind,Zhai et al., 2023):提出将对比学习的 softmax 归一化损失替换为成对的 sigmoid 损失。传统 CLIP 损失需对批次内所有负例进行全局归一化,计算复杂度高且对批次大小敏感;SigLIP 对每个图文对独立计算 sigmoid 交叉熵,使训练更稳定、更易于扩展到超大 batch。谷歌在约 100 亿图文对(WebLI 数据集)上训练 SigLIP,性能显著优于同规模 CLIP。该论文未公开全部模型参数,但报告在 10 亿参数规模下,SigLIP 在多项基准上优于 CLIP。
### 2023–2024 年:融合掩码建模与 LLM 的变体
- **BLIP-2**(Li et al., 2023):使用冻结的 CLIP 视觉编码器与冻结的大语言模型,通过轻量的 Q-Former 模块连接两者。Q-Former 通过对比学习与生成损失共同训练,实现图文理解与生成的统一。BLIP-2 在 VQA 与图像描述任务上达到当时最佳水平,且训练效率远高于端到端多模态训练。
- **EVA-CLIP 系列**(Fang et al., 2023):将掩码图像建模(Masked Image Modeling, MIM)与 CLIP 对比学习结合。通过首先在无标签图像上使用 MIM 预训练视觉编码器,再迁移至 CLIP 对比训练,EVA-CLIP 在同等数据量下获得更高的训练效率与最终性能。EVA-02-CLIP-E/14+ 使用约 4.4B 参数的视觉编码器加对比微调,在多项基准上达到开源模型最佳水平。
- **LLaVA 等视觉-语言模型**(Liu et al., 2023–2024):将 CLIP 视觉编码器作为前端,通过简单线性投影或 MLP 连接语言模型(如 LLaMA、Vicuna),在指令微调数据上训练。此类模型依赖 CLIP 提供的视觉语义先验,将图像转化为语言模型可理解的 token 串。LLaVA-1.5(2024)使用 CLIP ViT-L/14 时,在 ScienceQA 等多项基准上超越 GPT-4V 的早期版本。
### 技术路线对比
| 方法 | 监督信号 | 视觉概念覆盖 | 零样本能力 | 典型 ImageNet 性能 | 训练数据规模 | 训练效率 |
|------|----------|-------------|-----------|---------------------|-------------|----------|
| 传统有监督预训练 (ResNet-50) | 人工类别标签 | ~1000 类 | 无 | 76.2% Top-1 (微调) | 1.4M 标注图像 | 高(仅需单机) |
| SimCLR (纯视觉对比) | 图像增强对 | 无类别(无文本) | 无 | 76.5% Top-1 (线性评估) | 1.4M 图像 | 低(需大 batch) |
| CLIP ViT-L/14 (OpenAI) | 图文对弱监督 | 开放词汇 | 强 | 76.2% 零样本 | 400M 图文对 (WIT) | 低(592 GPU×18 天) |
| OpenCLIP ViT-G/14 | 图文对弱监督(开源) | 开放词汇 | 强 | 84.4% 零样本 | 2B 图文对 (LAION-2B) | 低(约 1024 GPU×数周) |
| SigLIP (谷歌) | 图文对独立损失 | 开放词汇 | 强 | 未公开零样本数值 | ~10B 图文对 (WebLI) | 中(sigmoid 更高效) |
| BLIP-2 | 图文对比 + 生成 | 开放词汇 | 强 | 不适用(VQA 优化) | 129M 图文对 + LLM | 高(冻结编码器) |
| EVA-02-CLIP-E/14+ | 掩码建模 + 对比 | 开放词汇 | 强 | 82.0% 零样本 (E/14+) | ~2B 图文对 | 低(MIM 预训练) |
*表内数据来自对应论文。ImageNet 零样本评测的提示模板与评测协议在不同论文间存在差异(如模板数量、集成方式),精确对比需统一测试条件。*
## 上游
CLIP 的上游产业链由数据、算力、基础研究三个核心要素构成,三者共同决定模型的性能上限与产业供给能力。
### 1. 数据:图文对的获取、清洗与去重
CLIP 的训练数据依赖大规模、弱对齐的图文对,来源为互联网公开网页。与精标注数据集不同,此类数据天然包含噪声、错误对齐与社会偏见。上游数据处理的核心环节包括:
- **数据抓取**:OpenAI 的 WIT 数据集未公开抓取细节。LAION 团队利Common Crawl 公开的网页存档,通过筛选包含 `` 标签且 `alt` 属性非空的 HTML 页面提取图文对。据 LAION-5B 论文(Schuhmann et al., 2022),原始数据池包含约 58.5 亿图文对,存储规模达 12TB。
- **数据清洗**:
- 语言过滤:仅保留英文描述,去除文本长度不足 2 个字符或超过 256 个 token 的样本。
- 安全过滤:通过黑名单去除成人、暴力等敏感内容(使用图像分类器与文本关键词)。
- 质量筛选:使用 CLIP 自身对图文对齐度进行打分,过滤相似度低于阈值的对。根据 LAION 报告,OpenCLIP 训练使用 LAION-2B-filtered,保留原始数据中约 49%(即约 10 亿高质量对)。
- **去重与分布平衡**:使用 MinHash 等算法对图像进行近似去重,防止训练数据中的重复样本导致过拟合与偏见放大。目前尚无公开研究系统性量化去重对 CLIP 性能的影响,但社区共识认为这是训练稳定性的关键步骤。
**供给端格局**:开源生态围绕 LAION 构建,已发布的数据集按时间线包括:LAION-400M(2022 年,4 亿)、LAION-5B(2023 年,58.5 亿)、LAION-2B-multi(多语言,覆盖 100+ 种语言)。闭源方面,谷歌的 WebLI(~10B)、阿里云的 M6 数据集、百度的文心数据集等均为企业内部资产,未经公开发布。据公开信息,截至 2024 年,尚未出现专业的图文数据商业化供应商,该环节仍以研究机构与企业内部团队自建为主。
### 2. 算力:GPU 集群与互联网络
CLIP 的训练对算力需求集中于大规模分布式对比计算。OpenAI 原论文报告使用 592 块 NVIDIA V100 GPU 训练 18 天(ViT-L/14)。考虑到 V100 单精度浮点算力为 15.7 TFLOPS(FP32),估算总计算量约 15.3M GPU-hours(社区估算,论文未精确披露)。OpenCLIP 训练 ViT-G/14 使用约 1024 块 A100 GPU(312 TFLOPS FP16 per GPU),耗时数周(具体周数未公开)。
算力瓶颈主要来自:
- **显存需求**:批次大小 32,768 意味着每步需在前向-反向过程中存储数万对图文向量的中间激活值,显存占用常超单卡容量(V100 为 16/32GB,A100 为 40/80GB),需借助模型并行与梯度检查点技术。
- **通信需求**:全局相似度矩阵计算依赖 all-gather 操作,批次内 `N×N` 矩阵规模为 32,768×32,768(约 10 亿元素),对 GPU 间互联带宽提出高要求。实际训练通常使用 InfiniBand HDR(200Gbps)或 NDR(400Gbps)网络。
**核心供应商**:
- **英伟达(NVIDIA)**:GPU 市场的主导者,V100/A100/H100 系列为 CLIP 类训练的标准配置。据英伟达 FY2024 年报(截至 2024 年 1 月),数据中心业务收入 475 亿美元,同比增长 217%,生成式 AI 训练需求为主要驱动力。公开资料未见英伟达单独披露 CLIP 相关 GPU 销售额。
- **AMD**:Instinct MI250X/MI300X 系列 GPU 为替代选项,但截至 2024 年上半年,CLIP 训练使用 AMD GPU 的公开案例极少,生态系统适配尚需时间。据 AMD 2024 年 1 月财报会议,其将 AI GPU 业务 2024 年收入指引上调至 35 亿美元。
### 3. 基础研究
CLIP 的诞生直接受益于三项前置研究:
- **Transformer 架构**(Vaswani et al., 2017):为图像(ViT,Dosovitskiy et al., 2020)与文本的双塔编码器提供基础架构。
- **对比学习**:InfoNCE 损失(van den Oord et al., 2018)在表征学习中的推广,SimCLR 证明了纯视觉对比学习的可行性。
- **大规模弱监督**:JFT-300M(Sun et al., 2017)等项目验证了使用含噪声的互联网规模数据预训练视觉模型的可行性。
这部分上游以学术产出为主,无直接商业化实体,但持续为产业提供方法论文持。
## 下游
CLIP 的直接应用集中于需要连接视觉与语言模态的场景。下游生态可分为四大领域,各领域的商业化成熟度与市场集中度差异显著。
### 1. AI 生成模型(AIGC)
这是 CLIP 当前最大的下游需求来源。Stable Diffusion 系列(Stability AI, 2022–2024)与 DALL·E 2/3(OpenAI, 2022–2023)均将预训练的 CLIP 文本编码器作为图像生成的第一步:用户输入的文本提示经 CLIP 编码为语义向量,随后由扩散模型逐步去噪生成图像。CLIP 在此扮演“语义翻译器”角色,决定了生成图像与文本描述的对齐程度。
- **Stable Diffusion**:截至 2024 年,其生态(含 Automatic1111 WebUI、ComfyUI 等第三方工具)下载量超 5 亿次(Stability AI 公开声明,含间接分发估算)。Stable Diffusion 1.x 使用 OpenCLIP ViT-L/14,2.x 部分版本转向 OpenCLIP ViT-H/14。Stability AI 在 2023 年发布的 SDXL 中自研了双文本编码器(OpenCLIP ViT-G/14 + CLIP ViT-L),试图对上游编码器形成自主可控。
- **DALL·E 3**:据 OpenAI 博客(2023 年 9 月),DALL·E 3 使用改进的 CLIP 变体进行图文匹配度评估,并作为生成结果排序依据(类似于 CLIP 的判别式应用),但具体版本与参数未公开。
### 2. 多模态搜索与检索
企业级应用集中于电商、图库、视频平台的跨模态搜索。典型场景为“以文搜图”:用户上传自然语言描述(如“深蓝色牛仔裤 九分 破洞”),系统基于 CLIP 嵌入召回相关商品图像。据公开发布的工程博客,Pinterest、Shutterstock 等平台已在搜索管线中测试或部署 CLIP 类模型。
- **技术指标**:多模态检索常用 Recall@K 衡量。CLIP ViT-L/14 在 Flickr30k 测试集上的图文检索指标为:Text-to-Image Recall@1 68.7%(CLIP 论文数据,零样本,30k 测试集),Image-to-Text Recall@1 88.0%。OpenCLIP 更大模型可进一步超越此基准。
- **市场规模**:多模态搜索为视觉搜索市场的子集。据 Grand View Research 于 2023 年发布的估算(报告编号 GVR-4-68040-157-2),2023 年全球视觉搜索市场规模约 147 亿美元,预计 2023–2030 年复合年增长率(CAGR)为 17.2%。CLIP 相关方案占比公开资料未见细分。
### 3. 内容安全与审核
社交媒体平台与内容托管服务利用 CLIP 的零样本能力,快速部署敏感内容过滤器。例如,可将 CLIP 作为第一级筛查,识别可疑图像,再由人工或专用模型复核。由于 CLIP 的开放词汇特性,审核策略可通过配置文件更新,无需重新训练。
据公开报道,Meta、字节跳动等公司在 2023 年分别公开了在其审核系统中使用多模态模型的合作或自研进展,但未具体指出是否直接使用 CLIP。商业化的审核 API 提供商(如 Hive Moderation、Sightengine)在 2024 年的产品文档中提及支持基于 CLIP 的自定义类别审核,表明该技术已进入实际部署阶段。市场份额数据未见系统性统计。
### 4. 机器人感知与具身智能
CLIP 在此领域仍多处于研究阶段,但已出现明确的产业转化迹象。2023 年 7 月,Google DeepMind 发布 RT-2(Robotics Transformer 2),使用 CLIP 编码视觉输入,与 LLM 共同输出机器人动作指令。RT-2 在未见过的新任务上展现出显著的泛化能力。同年,斯坦福大学的 VIMA 项目使用冻结的 CLIP 作为多模态输入的编码器。在国内,北京智源人工智能研究院在 2024 年初发布的具身智能研究路线图中也将多模态对齐列为关键挑战。
然而,具身智能的商业化尚处早期,暂无依赖 CLIP 的成熟产品面世。据公开资料,截至 2024 年上半年,该领域投资以早期风险投资为主,产业链尚未形成规模。
## 受益公司
本节基于公开信息列举产业链中直接受益或积极布局 CLIP 变体及相关技术的企业与机构。不构成任何投资建议。
### 1. 模型与技术供给层
- **OpenAI**:CLIP 原创者,闭源主导。其最新版本 CLIP 未独立发布,而是深度集成于 DALL·E 3、GPT-4V(视觉理解组件)等产品中。公司于 2024 年 2 月完成新一轮融资,估值超 800 亿美元(据《华尔街日报》报道,2024 年 2 月),公开资料来源显示该估值较 2023 年初约 290 亿美元大幅提升。CLIP 作为多模态基础能力的技术壁垒之一,是支撑估值的重要组成部分,但难以独立量化其财务贡献。
- **Stability AI**:生成式 AI 公司,早期 Stable Diffusion 严重依赖 CLIP 文本编码器。为降低对 OpenAI/OpenCLIP 上游依赖,已开始自研替代方案。2024 年发布的 Stable Diffusion 3 采用全新的多模态扩散 Transformer 架构,公开资料未见其明确使用 CLIP。据公司 2023 年公开披露,其年度经常性收入(ARR)在 2023 年底约为 5000 万美元(口径:包括 API 服务与授权许可)。盈利状况未见公开数据,公开报道通常指向其持续亏损。
- **LAION**:德国非营利组织,通过发布 LAION-400M/5B 数据集与 OpenCLIP 项目,为全球超过 100 个研究机构与企业提供训练基础。LAION 本身不从事商业运营,其间接赋能的创业公司覆盖多模态搜索、医学影像、AI 生成等领域,具体数字无法统计。
### 2. 计算基础设施层
- **英伟达(NVIDIA, NASDAQ: NVDA)**:作为 GPU 市场的主导者,直接受益于 CLIP 类大规模图文预训练的算力需求。训练一个类似 ViT-G/14 规模的 OpenCLIP 模型所需 GPU 数量通常在 512–1024 块 A100/H100 级别,对应购买成本在 500 万–1500 万美元不等(以 H100 单卡 $25,000–$30,000 市价估算,2024 年 1 月口径)。据英伟达 FY2024 Q4 财报(截至 2024 年 1 月),数据中心业务收入 184 亿美元(单季),同比增长 409%,其中生成式 AI 训练与推理需求被多次提及为核心驱动力。公开资料未见其单独披露 CLIP 相关产品销售数据。
- **超大规模云厂商**(微软 Azure, 谷歌 GCP, 亚马逊 AWS):通过提供 GPU 实例与 AI 平台服务间接受益。例如,微软 Azure 在 2023 年独家为 OpenAI 提供训练基础设施。据各公司季度财报(2024 Q1–Q2),AI 业务已成为核心增长引擎:微软 Azure 在 FY2024 Q3 报告 AI 服务收入增长 6 个百分点贡献(具体金额未单列),谷歌云在 2024 Q1 报告 AI 基础设施与生成式 AI 解决方案“需求强劲”,AWS 在 2024 Q1 报告 AI 相关业务“数十亿美元的年化收入运行率”。同样,CLIP 类负载的额占比未公开。
### 3. 国内企业
- **智源研究院**:发布“悟道·文澜”系列多模态模型,是国内较早复现与扩展 CLIP 的研究机构,其开源模型在国内学术与产业界有一定影响力。
- **阿里巴巴、华为、百度**:均有图文预训练研发。阿里达摩院 2022 年发布 OFA(One For All)多模态模型;华为昇腾团队发布悟空 FILIP(2022);百度文心大模型中包含多模态变体。这些模型均在 CLIP 范式基础上进行改进,但目前尚未出现商业化规模超越 OpenAI 的明确信号。
- **AI 芯片厂商**(华为昇腾、寒武纪等):若国产 CLIP 模型训练转向国产 GPU,将直接拉动芯片需求。但截至 2024 年,大规模图文对比训练的国产芯片替换案例极少在公开资料中被系统报道,产业成熟度仍待验证。
## 市场规模
CLIP 作为基础模型组件,本身不直接形成独立市场。其市场规模需通过下游应用的放大效应进行间接估算。由于缺乏统一的产业分类与数据口径,以下分析基于现有研究报告与公开数据的合理推断,所有数字均标注来源与口径。
### 全球多模态 AI 市场(CLIP 相关子集)
- 据 Grand View Research 于 2024 年 1 月发布的报告(编号 GVR-4-68040-157-2),**全球多模态 AI 市场规模在 2023 年约为 23 亿美元**。该市场的定义包含视觉-语言模型、多模态生成、多模态理解等,CLIP 类模型被视为核心使能技术之一。报告预测 2023–2030 年复合年增长率为 35.8%,主要驱动力为 AIGC 与自动化内容审核需求。
- 另一研究机构 MarketsandMarkets 于 2023 年 10 月发布的《AI 训练数据集市场》报告(编号 M&M-AI-2023-10)中,**全球 AI 训练数据集市场在 2023 年约为 27 亿美元**,预计 2028 年达到 75–80 亿美元(CAGR 约 22%)。其中,图文对数据集(含开源与商用)为增长最快的细分之一。CLIP 训练所需的弱图文数据集与精标注图像数据集分属不同子市场,财报数据未对“弱图文数据”进行单独追踪。
### AI 生成内容(AIGC)市场中的 CLIP 贡献
- 据 Bloomberg Intelligence 于 2023 年 6 月的行业报告,**全球生成式 AI 市场在 2023 年约为 400 亿美元**,包含了基础设施(GPU、云)、模型训练、应用服务等。该预测模型假设到 2032 年市场将增长至 1.3 万亿美元。
- 在 AIGC 图像与视频细分领域,Stable Diffusion、Midjourney、DALL·E 等头部产品在 2023 年的总收入(含订阅、API、许可)据估算合计在 5–8 亿美元(来源:The Information 与各公司零星披露的综合推断,2023 年 11 月报道)。CLIP 文本编码器在这类产品中成本占比通常较低(约为推理总成本的 5%–15%,根据 Hugging Face 社区估算),但作为核心语义理解组件,其技术替代成本高。
### 中国图文预训练模型相关市场
公开资料未见系统性追踪中国 CLIP 或图文预训练模型市场的独立研究。但中国 AIGC 市场的快速增长为下游需求提供了参照系。据艾瑞咨询于 2023 年 12 月发布的报告(《中国 AIGC 产业全景报告》),**中国 AIGC 产业规模在 2023 年约为 170 亿元人民币**(约 24 亿美元,按 1 USD=7.1 CNY 换算),预计 2028 年达到约 7200 亿元人民币(约 1014 亿美元),CAGR 超 100%。报告将“多模态大模型”列为基础层关键赛道,且国内主要厂商均已布局图文预训练模型。
**数据口径警示**:上述所有市场数据均为研究机构或媒体的预测性估算,不同报告对“多模态 AI”“AIGC”的定义差异较大,不建议将数字直接加总比较。CLIP 作为技术组件的精确市场规模在公开资料中未见计算,上述数字仅作为理解产业规模的宏观参照。
## 玩家对比
CLIP 相关玩家可依据训练数据与模型权重的开放程度分为三大阵营。下表基于截至 2024 年上半年的公开信息编制,涵盖代表性模型及其关键指标。
| 模型/项目 | 开发方 | 是否开源权重 | 训练数据规模 | 模型最大参数量(估算) | 零样本 ImageNet Top-1 | 关键优势 | 局限性 |
|-----------|--------|-------------|-------------|----------------------|----------------------|----------|--------|
| CLIP (原版) | OpenAI | 部分开源(ViT-B/32, ViT-L/14 等) | 4 亿 (WIT) | ~623M (RN50x64) | 76.2% (ViT-L/14@336px) | 原创性、学术标准 | WIT 数据集未公开,大模型闭源 |
| DALL·E 3 CLIP 变体 | OpenAI | 未开源 | 未公开 | 未公开 | 未独立评测 | 与生成模型深度耦合 | 不独立提供,无法复现 |
| OpenCLIP | LAION + 社区 | 完全开源 | 20 亿 (LAION-2B) | ~1.7B (ViT-G/14) | 84.4% (ViT-G/14) | 完全开源,复现友好 | 数据质量依赖 LAION,去重开销大 |
| ALIGN | 谷歌 | 未开源 | 18 亿 (私有) | — | 88.6% (微调) | 数据规模大,噪声鲁棒性强 | 零样本设定不透明,不开源 |
| SigLIP | 谷歌 DeepMind | 部分开源(ViT-SO/14 权重未公开) | ~100 亿 (WebLI) | — | 未单独公布零样本 | sigmoid 损失更高效 | 大模型不开源,数据集未公开 |
| EVA-02-CLIP | 北京智源 + 多机构 | 完全开源 | ~20 亿 (合并数据集) | ~4.4B (E/14+) | 82.0% (E/14+ 零样本) | MIM+对比,训练高效 | 计算资源需求极高 |
| BLIP-2 | Salesforce | 完全开源(含 Q-Former) | 129M 图文对 | 冻结 CLIP + LLM | 不适用 (评测侧重 VQA) | 连接 LLM,理解与生成统一 | 依赖冻结 CLIP,上限受限 |
| 文澜 (WenLan) | 智源研究院 | 完全开源 | 7 亿 图文对 (私有) | — | 未公开 ImageNet 零样本 | 国内首个大规模开源图文模型 | 社区生态较小 |
| OFA | 阿里巴巴 | 完全开源 | 约 200M 图文对 + 多任务数据 | ~930M (OFA-Huge) | — | 统一跨模态架构 | ImageNet 零样本非设计目标 |
|