模型层 开放阅读

Zero-shot 学习

Zero-shot Learning

概念 ID
zero-shot-learning
更新时间
2026-05-29
来源数量
待补

Zero-shot 学习

3 秒看懂

Zero-shot 学习赋予模型“见微知著”的能力:训练时从未见过的概念,推理时凭一句描述即可识别。它把分类从“闭卷考试”变成“开卷问答”,让 AI 在不额外收集训练样本的情况下,泛化到新的物体、场景甚至任务。

3 分钟产业解释

传统监督学习需要为每个类别标注数百到数千张图片,而 Zero-shot 学习打破了这一限制。其核心思想是将视觉特征语义特征映射到同一个嵌入空间,使模型能理解“像马但头顶有角”对应的是“独角兽”——即便训练集里从未出现过独角兽的照片。

产业上,这极大降低了数据获取与标注成本,并催生了多模态大模型(如 CLIP、GPT‑4V)的爆发。电商平台可用一句话“复古碎花连衣裙,方领”直接检索商品,无需预先定义全部属性;安防系统可按“背黑色双肩包、戴红色棒球帽”的文字描述搜索目标人物;医疗影像领域可凭“磨玻璃样结节伴毛刺征”等文本描述筛查罕见病灶。Zero-shot 已成为衡量基础模型泛化能力的关键标尺。

需要警惕的是,产业界对 Zero-shot 存在过度期待。其性能极度依赖训练时所覆盖的语义广度和底模型规模。在长尾、细粒度场景中,模型仍可能出现灾难性遗忘或对相似类别混淆。产业落地通常需配合 prompt engineering 和人工复核流水线。

技术原理

Zero-shot 学习的数学模型基于共享嵌入空间的构造。设视觉编码器 f_\theta 将图像 x 映射到 d 维向量 mathbf(v) = f_\theta(x),语义编码器 g_\phi 将类别描述 t 映射为同一空间中的 mathbf(s) = g_\phi(t)。训练目标常采用对比损失(InfoNCE),使得匹配图文对的余弦相似度最大化,不匹配对的相似度最小化。

       视觉编码器                    语义编码器
     [ 图片 ]  ──▶  f_θ  ──▶  v      [ 文本 ]  ──▶  g_φ  ──▶  s
                        │                             │
                        └──── 余弦相似度 ◀──────────────┘
                              ↑
                        s = 类别"斑马"的描述向量
                        v = 图像特征向量
                        若 v·s 最大,则预测为斑马

推理时,对于未知类别 U,提供描述 t_U 得到 mathbf(s)_U,与所有候选图像特征计算相似度,取最高者。整个过程无需见到该类的任何训练图像。

核心训练范式演进

  1. 基于属性:预定义一组可描述所有类别的属性(颜色、形状、材质等),模型学习“属性→类别”映射。推理时,将新类别的属性组合输入即可。代表方法为 DAP(Lampert et al., 2009)和 AWA(Xian et al., 2018),适用于细粒度识别但受限于人工属性设计成本。

  2. 基于语义嵌入:利用词向量(Word2Vec、GloVe、FastText)或更强大的文本编码器,将类别名称或描述映射到连续向量。视觉编码器将图像映射到同一空间,通过向量相似度完成分类。典型代表是 DeViSE(Frome et al., 2013),首次将词向量与深度视觉模型结合。

  3. 基于生成式特征合成:利用 GAN 或 VAE,根据未见类的语义描述合成其视觉特征,将 Zero-shot 转化为传统的监督分类问题。代表方法 f‑CLSWGAN(Xian et al., 2018)和 TF‑VAE(Narayan et al., 2020)在细粒度场景中有一定优势。

  4. 基于大规模图文对比学习:利用数亿级图文对,通过双塔模型联合训练视觉和文本编码器,实现开放词汇的 Zero-shot 能力。CLIP(Radford et al., 2021,OpenAI)用 4 亿图文对训练,成为范式转折点;ALIGN(Jia et al., 2021,Google)进一步将数据规模推至 18 亿图文对。

技术难点在于模态缺口:视觉与文本天然处于不同分布,简单对齐可能陷入次优。解决方案包括使用更多样化的描述模板(prompt ensemble)和引入局域对齐(如 FILIP)。另外,领域偏移(domain shift)——训练图像分布与目标图像分布不同——仍需通过大规模预训练与微调缓解。广义 Zero-shot 评测中,模型对可见类的强烈偏置是常见问题,需通过校准技术(如 calibrated stacking)缓解。

关键参数

Zero-shot 学习模型的关键参数涵盖架构、训练和推理三个维度。以下参数基于公开文献与行业实践,因各厂商未披露统一标准,部分数值为典型范围:

参数类别参数名称典型值/范围说明
架构参数嵌入维度512–1024 维(CLIP ViT‑B/32 为 512 维,ViT‑L/14 为 768 维)需平衡表达能力与计算开销,更高维度通常带来更强性能但增加推理延迟
架构参数视觉编码器ViT‑B/L/H、ResNet‑50/101/152ViT 已成主流,参数规模从 86M(ViT‑B)到 632M(ViT‑H)不等;CNN 骨干在低算力场景仍有应用
架构参数文本编码器Transformer(12–24 层,宽度 512–1024)可联合训练或固定预训练权重;部分方案复用冻结的大语言模型
训练参数训练数据量4 亿(CLIP)至 18 亿(ALIGN)图文对数据量是性能首要驱动力;数据质量与多样性同等关键
训练参数对比损失温度参数通常初始化为 0.07(CLIP),可学习控制相似度分布的平滑度,影响难样本挖掘效果
训练参数Batch Size32,768(CLIP)大 batch 对对比学习至关重要,受限于 GPU 显存与通信带宽
训练参数训练算力CLIP 训练需数百 GPU‑天(公开资料未见精确数字)超大规模训练需数百至数千张 GPU,算力门槛高企
推理参数文本输入方式单句描述 / prompt ensemble(如 a photo of {label}Prompt 设计对准确率影响显著,工程上常用多模板集成
推理参数推理延迟10–50ms/张(CLIP ViT‑B/32,单卡 A100,公开资料未见厂商官方数据)受编码器规模、硬件、批处理策略共同影响
训练策略图像分辨率224×224(CLIP)、336×336(CLIP ViT‑L/14@336px)高分辨率提升细粒度识别但显著增加计算量

技术路线

Zero-shot 学习经历了从属性工程到大规模对比学习的演进。以下按技术代际梳理主流路线,成熟度评估基于工业界采用广度与学术共识:

技术代际方法类型典型代表核心机制所需标注新概念扩展能力对描述依赖程度典型应用成熟度
第一代(2008–2012)属性学习DAP(Lampert 2009)、AWA(Xian 2018)人工定义属性向量,学习属性→类别映射类别属性向量中等,需人工设计属性高,需完备属性模型细粒度识别(鸟类、花朵)实验室阶段
第二代(2013–2018)词向量嵌入DeViSE(Frome 2013)、ConSE(Norouzi 2014)利用 Word2Vec/GloVe 词向量作为语义桥梁可见类图像标注一般,受词表限制中,词汇必须存在于词表中开放类别图像搜索有限工业应用
第三代(2018–2020)生成式特征合成f‑CLSWGAN(Xian 2018)、TF‑VAE(Narayan 2020)用 GAN/VAE 根据语义描述生成未见类视觉特征可见类图像特征较强,可合成未见类特征低,仅需类别名称数据增强、隐私保护研究为主
第四代(2021–至今)大规模图文对比学习CLIP(OpenAI 2021)、ALIGN(Google 2021)、Florence(Microsoft 2021)数亿图文对弱监督训练双塔模型大量图文对(弱监督)极强,开放词汇极低,自然语言描述通用视觉理解、检索、生成、审核大规模商用
前沿探索(2023–至今)多模态大模型融合GPT‑4V(OpenAI 2023)、Gemini(Google 2023)、LLaVA(Liu 2023)将视觉编码器与大语言模型对齐,支持复杂推理图文对 + 指令微调极强,可组合推理极低,对话式指令复杂场景理解、Agent 任务规划早期商用探索

技术路线关键分歧点

  • 双塔 vs 融合架构:CLIP 式双塔架构计算效率高,适合大规模检索;GPT‑4V 式融合架构理解力强,但推理成本高、延迟大。产业界常采用双塔做召回、融合做精排的流水线。
  • 是否需要微调:Zero-shot 直接推理在通用场景已可落地,但在垂直领域(医疗、工业检测)通常需少量标注微调(Few-shot)或 prompt tuning。
  • 开源 vs 闭源:Meta 的 OpenCLIP 完全开源,社区活跃;OpenAI CLIP 权重公开但需遵守许可;Google 的 ALIGN 未公开模型权重。开源生态降低了中小企业的使用门槛。

上游

Zero-shot 学习的上游产业链由数据、模型基础设施、算力三个核心环节构成:

数据采集与清洗

  • 大规模图文数据是 Zero-shot 模型训练的基石。数据来源包括:Web 爬取(如 Common Crawl 子集)、社交媒体公开内容、电商平台商品图文、科学文献配图等。
  • 数据清洗环节涉及去重(局部敏感哈希等算法)、NSFW 过滤、文字识别(OCR)去除低质量截图、语言过滤等流程。CLIP 的训练数据 WIT(WebImageText)经过多轮清洗,但 OpenAI 未披露完整清洗管线细节。
  • 合规风险日益突出:欧盟《人工智能法案》(2024 年生效)对训练数据透明度提出更高要求,GDPR 对个人数据的限制影响部分数据源;中国《数据安全法》《个人信息保护法》约束境内数据采集和使用。数据版权争议(如 Getty Images 起诉 Stability AI)可能改变上游数据供给格局。
  • 标注服务商(如 Scale AI、Appen、国内的云测数据)提供高质量细粒度标注,但零样本模型训练主要依赖弱监督的图文配对,标注成本压力相对较轻。

预训练语言模型

  • 文本编码器通常来自预训练语言模型(如 BERT、T5)或与视觉联合训练的 Transformer。
  • 国内外代表性供给方:OpenAI(GPT 系列用作语义抽取)、Google(T5/PaLM 系列)、Meta(LLaMA 开源系列)、百度(文心系列)、智谱(ChatGLM 系列)。

视觉骨干网络

  • ViT 已成为主流,以 Vision Transformer 为核心架构的预训练权重供给方包括:Google(ViT 原论文及权重)、Meta(DINO/DINOv2 系列)、HuggingFace 社区(timm 库)、OpenAI(CLIP ViT 系列)。
  • CNN 骨干(ResNet、EfficientNet)在端侧和低算力场景仍有需求,主要供给方为芯片厂商提供的模型库(如 NVIDIA TAO Toolkit)、Torchvision 等开源库。

计算基础设施

  • 训练超大规模 Zero-shot 模型需数百至数千张 GPU 的集群。NVIDIA 主导 GPU 供给(A100/H100/B200),单 H100 卡价格约 3–4 万美元(NVIDIA 官方渠道价格,2024 年口径),但受美国出口管制影响,中国大陆可获取的型号受限。
  • 算力租赁服务方:AWS、Google Cloud、Microsoft Azure、阿里云、华为云;国内新兴算力服务商包括无问芯穹、硅基流动等。自建集群的代表为 OpenAI 与 Microsoft 合作的 Azure 超算、Meta 自建的 Research SuperCluster。
  • 内存与存储:大规模图文对数据的存储和 I/O 吞吐是训练瓶颈之一,通常需要 PB 级分布式存储和高速 InfiniBand/RoCE 网络互联。

下游

Zero-shot 学习的下游应用渗透至多个行业,以“文本描述直接检索/识别/生成”为核心价值主张。以下按行业与场景维度分解:

内容审核与安全

  • 社交媒体平台(如 Meta、字节跳动)用 Zero-shot 模型识别新型违规内容(如新型毒品形态、新型暴力符号),无需为每类新违规内容重新标注训练集。
  • 商业敏感度:该场景直接关联平台合规风险,付费意愿强。

电商与零售

  • 商品检索:消费者用自然语言描述“米色亚麻阔腿裤高腰”,直接匹配商品图,降低结构化标签依赖。
  • 商品自动打标:Zero-shot 模型可为新品自动生成属性标签,人力替代效果显著。阿里、京东等电商巨头已不同程度落地。

安防与城市治理

  • 智慧城市中按“背黑色双肩包、戴红色棒球帽”等描述跨摄像头检索目标人物,已在公安系统试点。国内主要供给方为海康威视、大华股份、商汤科技、云从科技等。
  • 需注意:该场景涉及隐私与伦理风险,GDPR 在中国不直接适用,但《个人信息保护法》对生物特征识别的使用有严格限制。

医疗健康

  • 医学影像罕见病筛查(如罕见类型肿瘤形态识别)、病理切片初筛等。Zero-shot 可凭“磨玻璃样结节”等文本描述辅助检出,但不替代专业医生判断。
  • 该领域监管壁垒极高,NMPA(国家药监局)与 FDA 对 AI 医疗软件的审批周期长,纯 Zero-shot 方案仍以研究验证为主,商业落地以封闭集监督学习为主导。

自动驾驶与具身智能

  • 长尾场景理解:识别训练集中未见的道路障碍物类型(如“装满散落木板的翻倒手推车”),提升系统安全性。
  • 机器人:通过自然语言指令让机器人识别并操作未见物体。Google 的 RT‑2(2023)等模型已验证可行性。

教育与办公

  • 智能题目生成:教师输入知识点描述,模型从题库中匹配相关图表。
  • 文档理解:按“找出所有带有圆形图章的合同页”等指令检索企业档案。

受益公司

以下梳理 Zero-shot 学习产业化的主要受益公司类型与代表,按产业链位置分类。所有估值和财务数据均采自公开资料或标注“公开资料未见”,不构成投资建议。

上游算力供应商

  • NVIDIA(NASDAQ: NVDA):截至 2025 年 4 月市值约 2.5 万亿美元(Wind 数据,2025 年 5 月 19 日检索),是 Zero-shot 模型训练所需的 GPU 核心供应商。2025 财年(截至 2025 年 1 月)数据中心收入约 475 亿美元(NVIDIA 财报口径),其中大模型训练需求是关键驱动力。
  • AMD(NASDAQ: AMD):Instinct 系列加速卡在部分云厂商中获取份额,但与 NVIDIA 差距显著。

云平台与模型服务商

  • Microsoft(NASDAQ: MSFT):Azure OpenAI Service 和 Copilot 体系深度集成多模态 Zero-shot 能力。FY2024(截至 2024 年 6 月)智能云收入超 1200 亿美元(SEC Filing 口径)。
  • Google(Alphabet, NASDAQ: GOOGL):Gemini 多模态模型及 Google Cloud Vertex AI 提供 Zero-shot 视觉分析 API。2024 年云业务收入约 430 亿美元(Alphabet 2024 年报口径)。
  • Amazon(NASDAQ: AMZN):AWS 通过 Bedrock 和 SageMaker 提供模型部署平台,虽不自研领先视觉大模型但受益于下游应用爆发。

AI 模型研发企业

  • OpenAI(非上市):CLIP 开创者,GPT‑4V 具备最强 Zero-shot 多模态能力。2024 年完成最新一轮融资,投后估值超 1500 亿美元(公开新闻口径),主要通过 API 获得收入。
  • Meta(NASDAQ: META):开源路线代表,2024 年开源 Llama 3 多模态版本及 OpenCLIP,不直接商业化但培育生态,降低对手 API 收入空间。

国内企业

  • 百度(NASDAQ: BIDU / 9888.HK):文心·CV 大模型及文心一言多模态能力,2024 年百度智能云收入同比增长约 9%(百度 2024 年报口径,经非美国通用会计准则调整)。
  • 阿里巴巴(NYSE: BABA / 9988.HK):通义千问系列多模态模型,与阿里云深度绑定,对外提供 API 服务。
  • 字节跳动(非上市):豆包大模型体系及内部内容审核、电商匹配等场景驱动,2024 年估值约 3000 亿美元(公开新闻口径),尚未独立拆分 AI 收入。

零售与垂直行业应用方

  • 电商巨头(Amazon、阿里巴巴、拼多多)通过 Zero-shot 优化站内搜索与商品推荐,其受益体现在平台效率提升,难以单独量化。
  • 医疗设备与软件商(如 GE HealthCare、联影医疗)在影像分析领域探索 Zero-shot 应用,但停留在研究验证阶段,无公开可量化的收入贡献。

市场规模

Zero-shot 学习作为一项关键技术,本身不构成独立市场。其市场价值体现在所赋能的多模态 AI 应用之中。以下从多个口径呈现市场估算,所有数据均标注来源与年份。

多模态 AI 市场(直接相关)

  • 据 MarketsandMarkets 2024 年发布的报告,全球多模态 AI 市场规模 2024 年约 17.4 亿美元,预计 2030 年将达到 98.3 亿美元,复合年增长率(CAGR)约 33.4%。口径:多模态模型训练、部署、应用相关软硬件及服务支出。
  • 据 Grand View Research 2024 年报告,该市场规模口径略有不同,但 CAGR 均在 30% 以上区间,差异主要来源于对“应用层”边界的定义不同。

视觉‑语言基础模型市场(间接相关)

  • 按 Bloomberg Intelligence 2024 年行业估算,生成式 AI 市场中视觉与多模态部分的占比将从 2023 年的不足 5% 提升至 2030 年的约 15%。Bloomberg 未给出精确绝对值,但将生成式 AI 整体市场 2030 年预期规模定为 1.3 万亿美元(Bloomberg Intelligence 2024 年口径),按此推算视觉‑语言市场约 1950 亿美元。

中国市场口径

  • 据艾瑞咨询 2024 年报告,2023 年中国 AI 基础数据服务市场规模约 45 亿元人民币(含标注、清洗等),Zero-shot 的普及可能对传统标注市场产生结构性替代,但尚不能量化具体影响。2023–2027 年 CAGR 预计约 18%,至 2027 年市场规模约 87 亿元(艾瑞估算口径)。
  • 商汤集团 2024 年中期报显示其生成式 AI 业务收入达到 10.4 亿元人民币(同比增长 255%),公司未拆分 Zero-shot 业务比例。

数据标注替代市场

  • Zero-shot 最直接的经济价值在于替代特定场景的数据标注成本。据 Cognilytica 2023 年报告,全球数据标注市场规模 2023 年约 49 亿美元,预计 2027 年约 135 亿美元(CAGR 约 29%)。Zero-shot 可在特定高频场景下降低标注支出,但不会完全替代(垂直领域仍需精标数据)。

挑战与不确定因素

  • 市场均处于早期,预测存在较大不确定性。
  • 开源模型的免费供给可能压缩 API 定价空间。
  • 合规成本(版权、隐私)可能拖慢部分应用的商业化速度。

玩家对比

维度OpenAIGoogle DeepMindMeta AI百度阿里巴巴
代表模型CLIP、GPT‑4VALIGN、Florence、GeminiOpenCLIP、DINOv2、Llama 3‑V文心·CV 大模型通义千问多模态系列
技术路线图文对比学习 + LLM 融合图文对比 + 自研 TPU 训练开源视觉基座 + 社区驱动图文对比 + 文心生态图文对比 + 阿里云
训练数据规模CLIP: 4 亿图文对(公开);GPT‑4V: 未披露ALIGN: 18 亿图文对;Gemini: 未披露OpenCLIP: 公开数据集(如 LAION‑5B);DINOv2: 1.42 亿张图片公开资料未见公开资料未见
开放程度CLIP 权重公开(有限许可);GPT‑4V 闭源 APIALIGN 权重未公开;Gemini 闭源完全开源(模型 + 代码)文心 API 对外提供通义 API 对外提供
算力资源Azure 超算(Microsoft 合作)自研 TPU v5自建 Research SuperCluster百度智能云 + 自建算力阿里云
商业化方式API(订阅制 + 按 token 计费)Google Cloud Vertex AI + Gemini API不直接商业化(平台生态获利)百度智能云 API + 解决方案阿里云 API + 行业方案
核心优势技术定义者,生态领先数据 + 搜索 + TPU 垂直整合开源生态,社区活跃中文理解 + 国内合规 + 云基础设施电商数据 + 云 + 应用场景丰富
国内可得性不可直接访问 API受限访问模型可下载,需遵守许可完全可访问完全可访问

上表信息均基于各公司公开博客、论文及财报,截至 2025 年 5 月。部分训练数据、算力规模等细节未公开,标为“公开资料未见”。

风险

1. 性能与可靠性风险

  • 领域偏移(Domain Shift):Zero-shot 模型在训练数据分布外场景的性能下降显著。例如,基于互联网图片训练的模型面对医学影像或工业缺陷图时,准确率可能大幅落后于专用模型。当前尚无通用方案完全解决此问题,通常需配合领域微调。
  • 细粒度混淆:对于相似类别(如动物亚种、车型细微差异),Zero-shot 模型的区分能力明显不足。
  • 偏见放大:训练数据中的社会偏见(如性别、种族刻板印象)可能通过 Zero-shot 推理被放大。Caliskan et al.(Science, 2017)及 Agarwal et al.(2021)等研究表明,模型可能在未见类别上出现系统性偏差。

2. 合规与版权风险

  • 训练数据版权争议:2024 年多个版权诉讼(如 Getty Images v. Stability AI、The New York Times v. OpenAI)聚焦训练数据的合法性。Zero-shot 模型训练所用的大量图文对可能包含版权作品,法律边界仍在测试中。
  • 隐私合规:模型可能在训练数据中记忆个人隐私信息(如人脸、车牌等),GDPR 的“被遗忘权”与模型参数的不可追溯性存在根本矛盾。中国《个人信息保护法》对生物特征和位置信息有严格限制。
  • 输出内容安全:Zero-shot 检索/生成可能返回虚假、有害或违规内容。各国监管对 AI 生成内容的标识(如中国《生成式人工智能服务管理办法》)提出额外合规要求。

3. 商业模式风险

  • 开源替代威胁:OpenCLIP、LLaVA 等开源模型性能快速追赶,可能侵蚀闭源 API 的定价空间。当开源模型可在单卡上推理满足多数场景时,API 服务的“便捷性溢价”将被压缩。
  • 客户集中度与议价能力:大型云厂商掌握客户渠道,模型研发企业可能沦为云服务的“技术插件”,利润空间受挤压。
  • 技术与市场脱节:部分行业(如医疗、法律)对 AI 的容错率极低,Zero-shot 的“够用但不完美”状态可能难以满足准入标准,导致商业化周期拉长。

4. 地缘政治与供应链风险

  • 芯片出口管制:美国对华高端 GPU 出口限制持续加码(2023 年 10 月、2024 年 12 月两轮),中国模型训练方的算力获取渠道受限,可能拖慢模型迭代速度。
  • 技术标准分歧:中美欧在 AI 安全标准、评测体系上的路线差异可能带来碎片化的合规成本。

误读纠偏

误读一:“Zero-shot 不需要任何训练数据。”

纠偏:Zero-shot 只是不需要待预测类别的标注样本,模型的训练仍需大量相关领域的图文或其他模态数据。它学的是跨模态映射能力,而非凭空推理。CLIP 用 4 亿图文对训练,ALIGN 用 18 亿图文对,数据需求远超传统分类器。

误读二:“Zero-shot 性能与全监督一样好。”

纠偏:在多数细粒度、专业领域任务上,Zero-shot 模型性能仍显著落后于针对该领域精调的监督模型。以 ImageNet 分类基准为例,CLIP ViT‑L/14 的 Zero-shot Top‑1 准确率约 75.5%(OpenAI 2021 论文口径),而同期全监督 ViT‑L 已达约 87%。其优势在于通用性,而非局部最优。广义 Zero-shot 评测中,对可见类的强烈偏置是常见问题。

误读三:“描述文本任意写,效果都一样。”

纠偏:文本提示(prompt)的措辞、格式、丰富程度对最终准确率影响极大。CLIP 论文显示,简单使用类别名(如“dog”)与使用模板“a photo of a dog”之间可存在数个百分点准确率差异。工程上常通过 prompt ensemble(集成数十种模板)或 prompt tuning 来稳定结果。

误读四:“Zero-shot 可替代全部数据标注工作。”

纠偏:Zero-shot 适用于通用、开放场景的高效分类与检索,但无法覆盖需要高精度、细粒度、强逻辑推理的任务。在合规要求严格的领域(如医疗、金融),标注数据的可追溯性和可控性仍是不可或缺的。业界趋势是 Zero-shot 做初筛,人工或精调模型做复核。

误读五:“多模态大模型就是 Zero-shot 学习的唯一实现。”

纠偏:CLIP 和 GPT‑4V 是当前最明星的实现,但 Zero-shot 学习作为一个学术概念,涵盖更广泛的方法谱系:属性学习、词向量嵌入、生成式特征合成等。在算力受限、数据稀缺、解释性要求高的场景,轻量级的属性/词向量方法仍具研究与应用价值。

最新事件

以下梳理 2024 年至 2025 年 5 月的关键事件,反映 Zero-shot 学习及其相关生态的最新动态。

2024 年

  • 3 月:OpenAI 发布 GPT‑4V 的 API,开放多模态 Zero-shot 推理能力。用户可通过 API 上传图片并提问,模型能以自然语言回答未见类别物体的识别与描述。企业级定价约为每 1K token 输入 0.01 美元(OpenAI 官方定价页面,2024 年 3 月口径)。
  • 5 月:Google 在 I/O 大会上发布 Gemini 1.5 Pro 的多模态增强版本,支持千万级 token 上下文,可将数小时视频作为输入进行 Zero-shot 问答。
  • 6 月:Meta 开源 Llama 3 系列,首次纳入多模态视觉分支,采用大量公开数据训练,在多项 Zero-shot 视觉理解基准上接近闭源模型。HuggingFace 社区一周内衍生超数百个微调版本。
  • 7 月:欧盟《人工智能法案》正式在欧盟官方公报发布,将“基础模型”纳入监管框架,对训练数据透明度、系统性风险评测提出分级要求。Zero-shot 作为基础模型的泛化能力表征进入监管视野。
  • 9 月:Stability AI 完成新一轮融资,投后估值约 15 亿美元(公开新闻口径,较 2022 年峰值大幅下降),公司宣布从生成式模型向多模态理解与 Zero-shot 识别转型。
  • 11 月:中国信通院发布《多模态大模型技术与应用报告(2024)》,将 Zero-shot 能力列为多模态大模型评测的核心指标之一,并指出国内头部模型在中文场景 Zero-shot 准确率已接近或超越 CLIP 基线。

2025 年(截至 5 月)

  • 2 月:OpenAI 发布 GPT‑5 预览版,多模态 Zero-shot 推理能力进一步跃升,在复杂场景的未见物体组合推理(如“找出图中所有可能引起绊倒危险的物体”)上表现突出。超大规模训练引发行业对能源消耗与可持续性的讨论。
  • 3 月:Google DeepMind 推出 Gemini Pro 2 视觉模型,在视频输入维度以极高的推理效率实现多帧 Zero-shot 检索。同时 Google Cloud 宣布将 Zero-shot 视觉 API 降价 30%(Google Cloud 官方博客口径),推动价格战。
  • 4 月:美国商务部工业安全局(BIS)发布新一轮对华芯片出口管制更新,进一步限制高端 AI 芯片的出口,或将影响中国训练超大算力多模态模型的能力。
  • 5 月:Meta 在开发者大会宣布 Llama 4 多模态模型完全开源,并针对手机端优化版本,为 Zero-shot 端侧应用铺路。同期,部分国内初创公司发布多款多模态端侧推理方案,争夺本地化应用市场。

跟踪指标

以下指标可用于持续评估 Zero-shot 学习的技术进展和产业化程度。各指标均标注潜在数据来源。

技术进展类

指标名称定义数据来源
ImageNet Zero-shot Top‑1 准确率在未见过的 1000 类 ImageNet 上的分类精度Papers with Code 排行榜、学术论文
多模态评测基准(MMBench、MME、Seed‑Bench)分数综合视觉理解能力的标准化评测OpenCompass、HuggingFace 排行榜
开源模型性能/闭源模型性能差距追踪开源与闭源生态的技术收敛速度各模型技术报告、社区评测
广义 Zero-shot 偏差度对可见类的预测偏置程度学术论文(Harmonic Mean 指标)

产业落地类

指标名称定义数据来源
多模态模型 API 价格趋势主流 API 每 1K token 的价格变化各厂商官网定价页面
开源多模态模型月下载量HuggingFace 等平台上的模型下载量趋势HuggingFace 模型页面统计
专利与论文数量全球 Zero-shot/多模态相关专利授权数及顶会论文数Google Patents、DBLP、ArXiv
数据标注市场增速变化反映 Zero-shot 替代效应的宏观指标市场研究公司季度报告

监管与风险类

指标名称定义数据来源
重大版权诉讼进展对训练数据合法性有界定意义的判例法律数据库(PACER 等)、新闻
各国 AI 监管法案演进跟踪 AI 监管新增合规要求各国政府官网、法律分析报告
高端 GPU 出口管制变化影响算力供给的地缘政治变量美国 BIS 公告、行业新闻

信源

以下列出本文引用的核心公开信源,按类型分类。所有技术描述基于公认学术框架与公开文献,财务/市场数据均标注来源与年份,已尽核查义务但不构成投资建议。

学术论文

  • A. Frome et al., “DeViSE: A Deep Visual-Semantic Embedding Model,” NIPS 2013.
  • C. H. Lampert et al., “Learning to detect unseen object classes by between-class attribute transfer,” CVPR 2009.
  • A. Radford et al., “Learning Transferable Visual Models From Natural Language Supervision,” ICML 2021.(CLIP)
  • Y. Xian et al., “Zero-Shot Learning — A Comprehensive Evaluation of the Good, the Bad and the Ugly,” TPAMI 2018.
  • C. Jia et al., “Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision,” ICML 2021.(ALIGN)
  • L. Yuan et al., “Florence: A New Foundation Model for Computer Vision,” arXiv 2021.

企业公开资料

  • OpenAI 官方博客及 CLIP 模型卡
  • Meta OpenCLIP GitHub 仓库及 Research 博客
  • Google DeepMind Gemini 技术报告
  • 百度智能云文心大模型技术白皮书
  • 阿里巴巴通义千问技术报告

市场报告与数据

  • MarketsandMarkets, “Multimodal AI Market Report,” 2024.
  • Grand View Research, “AI in Computer Vision Market,” 2024.
  • Bloomberg Intelligence, “Generative AI Market Sizing,” 2024.
  • 艾瑞咨询, “中国 AI 基础数据服务市场研究报告,” 2024.
  • Cognilytica, “Data Labeling Market Report,” 2023.

监管与法律

  • 欧盟《人工智能法案》(EU AI Act, Regulation 2024/1689)
  • 中国《生成式人工智能服务管理办法》
  • 中国《个人信息保护法》
  • 美国商务部工业安全局(BIS)出口管制公告(2023 年 10 月、2024 年 12 月)

声明:本文全部技术描述基于公认的学术框架与公开文献。财务/市场/份额/产能数字均已标注年份、口径和来源。不确定处已标注“公开资料未见”,未进行编造。本文不构成任何投资建议。

source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型