模型层 开放阅读

视觉语言模型

Vision-Language Model, VLM

概念 ID
vision-language-model-vlm
更新时间
2026-05-29
来源数量
待补

视觉语言模型

3 秒看懂

视觉语言模型(Vision-Language Model, VLM)是让机器同时“看图”与“读字”并建立两者关联的核心技术。它把图像和文本映射到同一个语义空间,使模型能根据图片回答问题、用自然语言描述图像内容,并按文本指令对视觉信息进行推理。VLM 是多模态大模型(如 GPT-4V、Gemini、Qwen-VL)的基石,被视为通向通用视觉智能的关键拼图。

3 分钟产业解释

VLM 不是简单的“图像识别 + 语言模型”拼装,而是一套多模态对齐系统,产业落地的完整流程通常包含三条主线:

  • 输入层:任意图像(照片、截图、扫描件、视频帧)配上任意文本(问题、指令、对话上下文)。
  • 处理层:视觉编码器(通常为 Vision Transformer, ViT)将图像切分为固定尺寸的 Patch(图块),经线性嵌入和位置编码后转化成视觉令牌序列;文本侧由分词器将文字转化为文本令牌序列。核心难题在于两种令牌的语义鸿沟——视觉特征是连续空间中的像素统计模式,文本特征则是离散符号的语言结构。解决这一鸿沟的对齐模块有三种主流形态:线性投影 / Q-Former / 交叉注意力融合层,它们负责把视觉令牌映射到大语言模型(LLM)能“读懂”的语义空间。
  • 输出层:LLM 以自回归方式生成文本输出——可以是图像描述、视觉问答的答案、按指令提取的结构化信息,也可以是对图中异常的判断和推理链条。

产业价值的核心在于将海量视觉传感器数据转化为可交互、可查询、可编程的结构化知识。已在 AIGC(AI 生成内容)、机器人环境理解、医学影像辅助诊断、自动驾驶情景分析、工业质检、文档智能解析等领域形成落地能力。在 2024-2025 年,VLM 正被集成进企业自动化流程(RPA + 多模态)、智能手机相册搜索、电商商品描述生成等高频场景。当前主流技术路线分为两大阵营:对比学习派(以 CLIP、SigLIP 为代表,主攻通用视觉表征)和生成式派(以 LLaVA、BLIP-2、Qwen-VL 为代表,直接对接 LLM 产生可读输出),两者正快速融合为混合范式。

技术原理

1. 视觉编码:从像素到令牌

当前主流 VLM 几乎都采用 ViT(Vision Transformer)作为视觉前端。其核心机制如下:

  • 将输入图像调整至固定尺寸(常见的工程选择为 224×224、336×336 或更高分辨率),切分为固定大小 Patch(常见 14×14 或 16×16 像素),对每个 Patch 进行线性投影,得到一个向量表示。
  • 叠加位置编码(绝对位置嵌入或可学习的相对位置偏置),使模型感知图像的空间结构。
  • 经 Transformer 编码器(层数 N_v 在 ViT-L 中通常为 24 层,ViT-H 可达 32 层,具体数值因厂商定制而异)处理,输出特征图,通常取最终层输出的令牌序列,或融合多层特征以保留细节。

多数现代 VLM 冻结视觉编码器,大幅降低计算开销,同时保留预训练获得的丰富视觉特征。冻结策略是当前性价比最高的工程选择,避免了视觉-语言联合训练时对视觉能力的灾难性遗忘。

2. 模态对齐与桥接机制

这是 VLM 区别于纯视觉模型和纯语言模型的本质所在。三种主流方案如下:

  • 线性/MLP 投影(如 LLaVA 系列):直接用一层或多层 MLP 将视觉令牌投影到 LLM 的嵌入维度。架构极简,能有效对齐的前提是视觉编码器和 LLM 分别已在各自任务上充分预训练。优点是指令跟随能力强,缺点是跨模态交互深度有限。
  • Q-Former 桥接(BLIP-2, InstructBLIP):引入一组可学习的查询向量(learned queries,数量通常为 32-96 个),通过交叉注意力仅从冻结的视觉编码器输出中抽取与文本最相关特征,输出固定数量令牌。查询向量充当“信息瓶颈”,在压缩视觉冗余的同时保留语义信号。该方案训练效率高,多轮对话稍显僵硬。
  • 交叉注意力融合(部分 Flamingo 设计及当前混合架构):在 LLM 的特定层插入交叉注意力子层,让文本在生成每一步时直接关注所有视觉令牌。图文交互最精细,但随序列长度增加,计算开销显著。

3. 语言模型解码

对齐后的视觉令牌序列作为“软提示”(soft prefix)传入 LLM,文本令牌紧随其后。LLM 以自回归方式逐令牌生成回答序列。当前主流 LLM 的参数规模跨度大(数十亿到数千亿),架构以密集 Transformer 和混合专家(MoE)为主。生成时仅对文本输出部分计算损失。

4. 训练范式与损失函数

  • 预训练阶段:在海量图文对(通常为互联网爬取,量级在数亿到数十亿之间,具体数字未充分披露)上训练。核心损失包括对比损失(InfoNCE,使匹配图文对表征在高维空间靠近)和生成损失(交叉熵,最大化以图生文的似然)。两者常混合使用。
  • 指令微调阶段:用高质量多模态指令-回答数据(人工标注或由强 LLM 合成)进行监督微调,使模型具备对话、推理和指令遵循能力。微调通常只更新对齐层和少量 LLM 参数(低秩适配 LoRA)。

5. 高分辨率策略(2024 年后趋势)

为处理文档、图表、遥感影像等高分辨率场景,最新 VLM 引入动态分块策略:对任意分辨率图像切分为多个子图分别编码,或采用自适应 Patch 切分,最终保持视觉令牌总数可控。这一方向已成为工程竞争焦点。

架构示意(ASCII)

图像输入 ──► ViT视觉编码器 ──► 视觉令牌序列(256/576/更高)
                │                      │
        [Patch切分+位置编码]   [投影/Q-Former/交叉注意力]
                │                      │
文本输入 ──► 文本分词 ──► 文本令牌 ──┴──► LLM(自回归)──► 输出文本

关键参数

以下为评估 VLM 能力的主要维度与常见参数体系。具体数值因模型版本而异,且多数商业模型未充分披露完整规格。

模型架构参数

  • 视觉编码器规格:ViT 变体规模(如 ViT-L 约 3.07 亿参数,ViT-H 约 6.32 亿参数)、输入分辨率、Patch 尺寸(14×14 或 16×16 像素较为常见)、输出令牌数量(由分辨率/ Patch 尺寸决定,256/576 个属常见工程选择)。各厂商选择因视觉任务和计算预算而定,非固定标准。
  • LLM 规格:参数量(数十亿至上千亿,开源模型以 7B/13B 为主流,商业闭源模型可达数百亿到上千亿)、上下文窗口长度(影响支持的最大图文联合序列)、是否采用 MoE(混合专家)架构。
  • 对齐层规格:投影层维度、Q-Former 查询向量数量(32-96 个)、交叉注意力插入层数。上述参数均属工程决策,无统一标准。

能力评估指标

  • 视觉问答准确率:在 VQA v2、GQA、TextVQA、DocVQA 等基准上的得分,评估通用场景、文本阅读和文档理解能力。(具体分数因模型和测试集版本不同,此处不列硬数字。)
  • 图像描述质量:CIDEr、SPICE 等指标衡量描述的丰富性、准确性和逻辑性。
  • 零样本 / 少样本分类准确率:在 ImageNet 及其变体上评估视觉表征对齐质量。
  • 幻觉率(Hallucination):模型是否编造图像中不存在的物体、事件或关系。常用 POPE、CHAIR 等基准衡量,是当前商用化的核心挑战之一。
  • 指令遵循度:复杂多轮指令下的逻辑连贯性和任务完成度,通常依赖人工评测或 GPT-as-judge。
  • 推理耗时与显存占用:直接影响部署成本的关键工程参数。量化、KV Cache 优化等技术可显著降低推理资源需求。

训练规模参数(基于公开论文的估计量级,具体数字未充分披露)

  • 预训练数据量:互联网图文对,公开论文中常见规模为数亿至数十亿对,视频帧数据量级另有增量。
  • 指令微调数据量:开源模型通常为数万至数百万条高质量多模态指令数据,合成数据占比逐渐上升。
  • 算力投入:预训练通常需要数百至数千 GPU·天(A100/H100 等),指令微调开销显著更低。

以上参数体系可作为跟踪 VLM 进展的观察框架,各模型的具体硬件规格和训练细节多数未充分披露,建议查阅对应技术报告获取最新信息。

技术路线

以下为当前主流路线的对比。表格中训练数据规模和参数量为基于公开论文的估计量级,具体数字存在不确定性,标注“未充分披露”表示未经厂商确认的精确数值。

路线对齐方式语言模型接入典型训练数据规模(估计)优势短板代表模型
纯对比图文对比损失通常不接 LLM数亿 – 数十亿图文对通用视觉表征强,检索/分类领先无法直接生成文本CLIP, SigLIP, EVA-CLIP
查询桥接Q-Former / 重采样器冻结 LLM,软提示接入预训练十亿级,指令数据数百万训练效率高,LLM 兼容性好多轮交互有时僵硬BLIP-2, InstructBLIP
投影直连线性/MLP 投影冻结或 LoRA 微调 LLM预训练数亿 – 数十亿,指令数据数十万 – 数百万架构简洁,指令跟随好,复现容易对齐精度依赖投影层LLaVA 系列(1.5, 1.6, NeXT)、MiniGPT-4
原生多模态端到端联合训练自研 LLM + 视觉编码器未充分披露图文融合深度最高,性能天花板高训练成本极高,闭源居多GPT-4V, GPT-4o, Gemini 系列
深度融合交叉交叉注意力层原生加载视觉令牌未充分披露精细图文交互,细粒度推理计算开销大,工程复杂度高Flamingo(部分设计)、CogVLM

路线演进趋势(2024-2025)

  • 高分辨率策略成为竞争焦点:任意比例动态切分、自适应视觉令牌压缩,兼顾细节感知与计算效率。
  • MoE(混合专家)视觉-语言架构开始引入,分流不同领域的视觉能力(自然场景、文档、医学影像等)到不同专家模块。
  • 指令微调数据的合成与筛选体系日趋成熟,开源模型指令跟随能力快速逼近闭源旗舰。
  • 多模态思维链(Chain-of-Thought)和工具调用能力逐步增强,VLM 开始能调用外部视觉工具(如分割、检测)进行协同推理。

上游

1. 数据供应

  • 图文对来源:互联网爬取(Common Crawl 子集、LAION 系列)、社交媒体平台内容、电子商务商品图-描述对、新闻通稿配图、开源数据集(COCO、Visual Genome、CC3M/CC12M 等)。2024 年起视频帧数据日益重要,数据量进一步放大。
  • 指令微调数据:由强 LLM(GPT-4 等)生成的图像描述和问答对,逐步替代纯人工标注,使数据成本显著降低。但合成数据带来的分布偏置(过度流畅、缺乏真实噪声)成为新的质量瓶颈。
  • 垂直领域数据:医学影像报告、工业质检缺陷标注图、法律卷宗扫描件等,标注成本高、合规要求严,属稀缺资源。

2. 算力基础设施

  • 训练端:大容量 GPU 集群(NVIDIA A100/H100/B200 等),数千卡规模并行训练。高带宽内存(HBM)和高速互联(NVLink、InfiniBand)为训练效率的关键瓶颈。
  • 推理端:低延迟推理需要高显存带宽和 KV Cache 优化。边缘端部署 VLM 则依赖量化(INT4/INT8)、剪枝等技术,手机 SoC 厂商(高通、联发科)和 NPU 加速方案逐步进入视域,但当前能力仍有限。

3. 标注与合成工具

  • 多模态数据标注平台(Scale AI、云厂商内部标注工具)提供人力标注服务,成本高企。
  • 合成数据管线(利用 GPT-4V/Gemini 等进行图到文描述、多轮对话生成)快速崛起,成为指令数据的核心来源。
  • 数据治理与版权监测工具开始受到重视,特别是针对网络爬取数据的合规性校验。

下游

1. 内容生成与创意工具

  • AI 绘画辅助(Midjourney、DALL·E 的文本理解依赖 VLM 对标)、自动文案撰写、电商商品描述、海报布局理解与设计推荐。

2. 人机交互与无障碍

  • 智能客服看图回答(包裹损坏拍照直接判断理赔)、辅助视觉障碍人士理解环境(拍照获取场景描述)、智能硬件(AI 眼镜、手机相册 AI 搜索)的信息提取。
  • 新一代智能手机和 PC 操作系统正将 VLM 整合为核心功能,实现跨应用的视觉内容理解。

3. 垂直行业应用

  • 医学影像:辅助报告生成、病灶初筛、影像文本对齐。但可靠性门槛高,当前多为辅助角色。
  • 工业质检:产品表面缺陷检测与描述、产线异常分类。对实时性和准确率要求严苛。
  • 自动驾驶 / 具身智能:驾驶情景理解、复杂路口场景分析、机器人视觉语言指令执行。VLM 与 3D 感知模块的结合是前沿方向,当前停留在特定场景验证。
  • 文档智能与法律科技:合同关键信息提取、财报表格解析、票据识别、卷宗字图分析,DocVLM/图表理解专用能力正在提升。

4. 企业自动化与 RPA

  • 将 VLM 与传统的机器人流程自动化(RPA)工具结合,处理图片、扫描件等非结构化文档。在银行、保险和政府服务中已出现初步部署案例,2024-2025 年进入早期放量阶段。

受益公司

以下列示按产业链环节和公开信息梳理的相关公司,仅作产业链分析用途,不构成任何投资建议

  • OpenAI:GPT-4V/GPT-4o 引领闭源多模态标准,API 商业化领先。CLIP 奠定对比学习基础。
  • Google DeepMind:Gemini 系列,原生多模态能力,与搜索和安卓生态深度融合。
  • Meta:推出 DINOv2、I-JEPA 等视觉表征工作,参与开源多模态社区生态推动。
  • 微软:与 OpenAI 合作部署多模态能力至 Azure 云服务,同时投入 Kosmos 系列研究。
  • 阿里巴巴:Qwen-VL 系列覆盖多语言多尺寸,已在云服务和电商场景落地。
  • 百度:文心多模态模型赋能搜索、自动驾驶等自有生态。
  • 字节跳动:多模态模型应用于内容理解与创作工具(豆包等),但具体技术路线公开信息较少。
  • 智谱 AI:CogVLM 系列,强调视觉-语言深度融合,面向企业落地。
  • Salesforce:BLIP 家族多次刷新开源性能,重点服务企业智能化和客户管理。
  • 商汤科技:大装置 + 多模态模型服务,布局自动驾驶和医疗影像。
  • 华为:盘古多模态大模型赋能工业、矿山等垂直场景。昇腾计算生态提供国产化算力底座。
  • 英伟达:作为底层硬件核心供应商,VLM 训练和推理的算力需求对其 GPU/ HBM 和数据中心业务形成持续驱动。

(注:上述公司对应的具体 VLM 产品的参数规模、训练数据量等硬件规格多数未充分披露,公开资料未见精确数据。)

市场规模

本次检索未获取到一致性的权威第三方市场数据。 基于行业普遍认知,多模态 AI 市场(包含 VLM、多模态生成、图文理解等)处于快速扩张通道。各研究机构(如 IDC、Gartner、Grand View Research、MarketsandMarkets 等)对全球多模态 AI 市场的年复合增长率(CAGR)估算多集中在 30%-40% 区间(2024-2030 年预测范围),但口径(是否包含硬件、云服务、垂直解决方案)不一。具体到 VLM 的细分市场体量,公开资料未见细化预测。以下为行业共识性趋势:

  • 需求侧:从互联网、移动终端延伸至医疗、制造、汽车、金融服务,企业对于图像-文本理解产品的采购需求在 2024-2025 年加速释放。
  • 供给侧:开源模型(LLaVA、Qwen-VL 等)降低使用门槛,闭源 API(GPT-4V、Gemini)主导高价值商业场景,生态持续丰富。
  • 约束因素:算力供应仍为瓶颈,模型推理成本制约大规模部署,数据合规成本上升。
  • 建议查阅专业行研报告获取近期估算,需注意不同机构的口径差异。

玩家对比

以下为主流 VLM 模型在公开可得维度的横向定性对比。由于各厂商披露深度不一,具体参数(训练数据量、模型参数量、预训练算力)多数未充分披露,本对比聚焦能力维度与开源情况。

维度GPT-4V / GPT-4oGemini 系列Qwen-VL 系列LLaVA 系列CogVLM 系列BLIP-2 / InstructBLIP
开放程度闭源 API闭源 API开源权重开源权重开源权重开源
视觉分辨率未充分披露(支持高分辨率)未充分披露支持动态分辨率固定/动态分块可配支持动态高分辨率固定分辨率
多语言支持支持深度优化中英依赖 LLM 基座深度优化中英依赖 LLM 基座
文档/图表中强一般(早期版本)一般
幻觉控制未充分披露未充分披露有公开改进报告开放社区推进特定版本改进基础版较弱
训练数据量未披露未披露数万亿 tokens(含文本,来源:技术报告)数百万图文对 + 指令数据未充分披露数十亿图文对(公开论文)
生态集成ChatGPT / AzureGoogle Cloud / 安卓阿里云 / 手机端社区 / 学术智谱开放平台Salesforce 企业
2024-2025 进展代表性o 系列全模态2.0 Flash 推理优化VL2 支持更长文本NeXT 高分辨率深度多模态推理BLIP-3 (xGen-MM)

(注:表中“强/中强/一般”等定性描述基于多份公开评测报告的综合印象,不同榜单结果存在波动,非量化定论。各厂商模型能力持续迭代,以上特征截止 2025 年初的公开信息。)

风险

1. 技术风险

  • 幻觉难以根除:VLM 在生成描述时可能编造图像中不存在的物体、文字或事件。在医疗、自动驾驶等高风险场景下,幻觉可能导致严重后果。当前通过合成数据、RLHF 对齐、检索增强等方式缓解,但彻底消除仍无路线图。
  • 空间推理与计算能力薄弱:多数 VLM 在处理需要精确空间关系、多步骤数值计算或逻辑推理的任务时错误率高,“看图”不等于“看懂”。
  • 训练与推理成本高企:高分辨率、长上下文 VLM 的训练和推理需要大量显存和带宽,部署成本制约规模化落地。边缘端量化部署的精度损失仍需工程权衡。

2. 数据与合规风险

  • 版权与隐私争议:网络爬取图文对作为训练数据,涉及版权侵权和隐私泄露问题,已在多个司法辖区引发监管关注和诉讼。欧盟《人工智能法案》等监管框架对训练数据透明度提出更严格要求。
  • 数据偏见放大:预训练图文对中的社会偏见(性别、种族等)可能被 VLM 继承甚至放大,在敏感场景(招聘、信贷评估)使用时需审慎。
  • 垂直领域数据稀缺与合规:医疗、法律等专业领域高质量标注数据稀少,且受隐私保护法规严格约束,限制了 VLM 在高价值场景的深度应用。

3. 市场与商业化风险

  • 闭源 API 依赖与供应商锁定:高价值场景目前主要由闭源旗舰模型(GPT-4V、Gemini)占据,企业使用面临供应商锁定、价格波动和服务条款变更风险。
  • 开源与闭源路线拉锯:开源 VLM 能力追赶快,可能削弱闭源 API 的溢价能力。但开源模型的幻觉控制、安全对齐和持续更新仍依赖社区或大型机构投入,可持续性存疑。
  • 投入产出比不确定性:垂直场景的 VLM 改造仍需大量定制开发,初期 ROI(投资回报率)难以精确量化,可能拖慢企业采购决策。

4. 安全与对齐风险

  • 对抗攻击:攻击者可通过精心构造的视觉对抗样本诱导 VLM 输出错误或有害内容。
  • 越狱风险:通过图文联动的提示注入绕过安全机制,使模型生成违规信息。多模态场景下的安全对齐是持续攻防战场。

误读纠偏

1. “VLM 就是把图像识别和文本模型拼起来”

  • 事实:简单拼接无法实现对齐。视觉特征和文本特征在向量空间中的分布模式殊异,若仅做形式拼接,模型会将“马”与“海水”的蓝色错误关联,无法建立语义级别的对应。需要精心设计的对比损失、生成目标或多模态对齐模块来共同构建共享语义空间。

2. “任何 VLM 都能看懂图片细节”

  • 事实:多数当前 VLM 在精细空间关系(左/右、上/下、距离远近)、数学图表推理、多步骤逻辑链上的错误率仍高。“看图”是特征提取和关联统计,“看懂”则需要因果推理和常识,后者仍处于研究前沿。思维链(CoT)、工具调用和合成数据是缓解手段。

3. “冻结视觉编码器意味着视觉能力差”

  • 事实:冻结视觉编码器反而是高效训练的首选。大规模预训练视觉模型的特征已足够丰富,训练连接器和 LLM 即可获得强大视觉对话能力,同时避免对视觉能力的灾难性遗忘。当前开源 VLM 主流实践支持该结论。

4. “VLM 参数量越大,效果就一定越好”

  • 事实:数据质量、对齐设计和指令微调往往比纯参数规模更重要。LLaVA 系列以 7B/13B 模型即取得与更大规模模型可比的效果,说明对齐方案和数据质量是关键杠杆。参数竞赛正在让位于数据工程和对齐策略竞争。

5. “VLM 可以替代专用视觉模型”

  • 事实:VLM 在开放域对话和通用描述上表现出众,但在需要高精度定位、分割、定量测量等专业视觉任务上,仍无法替代专用检测/分割模型。二者正走向协同——VLM 作为“语言接口”调度专用视觉工具,而非完全替代。

最新事件

以下为 2024 年-2025 年初的重要行业事件摘要,反映技术演进和产业格局变化:

  • GPT-4o 发布(2024 年 5 月):OpenAI 推出全模态(omni)模型,整合文本、视觉和音频输入输出,响应速度与性价比相比 GPT-4V 显著优化。进一步拉高闭源多模态旗舰的能力基线。
  • Gemini 2.0 系列推出(2024 年底-2025 年初):Google DeepMind 发布 Gemini 2.0 Flash 及后续变体,强调高效推理与多模态 Agent 能力,深度整合搜索与工具调用。
  • LLaVA 持续演进(2024 年全年):LLaVA-1.6(NeXT)引入动态高分辨率分块策略,显著提升文档和图表理解能力。社区围绕 LLaVA 的扩展生态(医疗、视频)持续丰富。
  • Qwen-VL 2 系列发布(2024 年底):阿里云推出第二代 Qwen-VL,支持动态分辨率、更长文本输入,并在多模态基准上接近或超越同等规模竞品。开源力度加大,覆盖多尺寸。
  • BLIP-3 (xGen-MM) 发布(2024 年):Salesforce 发布新一代多模态模型,扩展至多图像、视频理解,延续 BLIP 家族开源传统。
  • 智谱发布 AutoGLM 等多模态 Agent 能力(2024-2025):将 VLM 与桌面/手机操作能力结合,实现通过视觉理解驱动 UI 自动化,推动 Agent 化落地。
  • 多模态思维链和工具调用成为标配:多个开源和闭源 VLM 开始内建思维链生成、外部视觉工具调度(检测、分割、OCR 引擎)能力,“看图-推理-调用工具”成为新范式。
  • 欧盟 AI 法案生效(2024 年):对基础模型训练数据透明度提出要求,影响多模态模型的预训练数据合规路径。
  • AI 眼镜等边缘视觉设备密集发布:Meta、百度等推出集成 VLM 的智能眼镜,端侧多模态理解从概念走向有限落地,但算力和体验限制仍显著。

(以上事件基于公开报道和技术报告,具体参数和性能数字请查阅对应原始信源。)

跟踪指标

以下为持续跟踪 VLM 产业进展的重点观察指标:

技术能力指标

  • 主流多模态基准榜单(MMBench、MME、MMMU、DocVQA、MathVista 等)上的开源与闭源模型得分变化,特别关注幻觉率指标(POPE、CHAIR)。
  • 新一代评测维度:空间推理、图表理解、长文档多模态问答、跨模态思维链鲁棒性。
  • 新模型的高分辨率策略刷新情况(令牌数量、分辨率上限、动态切分配置)。

生态与开放度指标

  • 开源 VLM 社区活跃度(GitHub Stars、模型下载量、衍生项目数量)、权重发布的时效性和覆盖规模。
  • LLM 基座和视觉编码器的组合迭代情况(哪些 LLM 被视为最佳底座,视觉编码器选择的趋同性)。
  • 第三方开发者工具的成熟度(多模态 LangChain、LlamaIndex 等框架对 VLM 的支持)。

商业化指标

  • 云厂商多模态 API 的定价趋势(每百万视觉令牌的价格走势)、调用量增长和行业渗透案例披露。
  • 垂直场景的标杆落地案例(医疗、制造、法律领域的具体量产合同和效果报告)。
  • 企业采购意愿调研(是否已从“评估测试”进入“采购部署”阶段)和 RPA+ 多模态的集成情况。

政策与合规指标

  • 主要经济体对多模态训练数据的版权 / 隐私监管动态(欧盟 AI 法案实施细则、中美相关政策变化)。
  • 数据标注与合成数据产业的投融资规模和头部公司发展节奏。

硬件与成本指标

  • 推理芯片(GPU、边缘 NPU、手机 SoC 多模态加速单元)的性能和价格变化。
  • HBM(高带宽内存)供应情况和价格趋势,作为训练成本的重要联动物。

信源

以下为本次概述引用的核心技术和产业信息来源,供交叉验证和深度阅读参考。鉴于资料主要在 2025 年初的公开信息基础上整理而成,建议读者检索最新版本文献。

核心学术论文

  1. Radford, A. et al. “Learning Transferable Visual Models From Natural Language Supervision.” (CLIP, 2021)
  2. Li, J. et al. “BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models.” (2023)
  3. Liu, H. et al. “Visual Instruction Tuning.” (LLaVA, 2023)
  4. Alayrac, J.-B. et al. “Flamingo: a Visual Language Model for Few-Shot Learning.” (2022)
  5. Dai, W. et al. “InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning.” (2023)
  6. Liu, H. et al. “LLaVA-NeXT: Improved reasoning, OCR, and world knowledge.” (2024)
  7. Bai, J. et al. “Qwen-VL: A Versatile Vision-Language Model.” (2023); “Qwen2-VL.” (2024)
  8. Wang, W. et al. “CogVLM: Visual Expert for Pretrained Language Models.” (2023)
  9. Xue, L. et al. “xGen-MM (BLIP-3): A Family of Open Large Multimodal Models.” (2024)

技术报告与官方文档 10. OpenAI. “GPT-4 Technical Report.” (2023); “GPT-4o System Card.” (2024) 11. Google DeepMind. “Gemini: A Family of Highly Capable Multimodal Models.” (2023); Gemini 2.0 系列技术披露(2024-2025) 12. 阿里云. “Qwen-VL 技术报告”及 Qwen-VL 2 系列官方文档 13. Meta. “DINOv2: Learning Robust Visual Features without Supervision.” (2023)

行业与市场参考 14. 行业调研:多模态 AI 市场趋势报告(CB Insights、Gartner、MarketsandMarkets 等,建议自行检索最新版本,注意口径差异) 15. 各大云厂商(AWS、Azure、Google Cloud、阿里云)多模态 API 产品文档和定价页 16. 主要开源社区(Hugging Face、GitHub)多模态模型排行榜及相关项目的 README 与使用文档 17. 欧盟《人工智能法案》(EU AI Act)正文及相关实施细则,2024

声明 本文中涉及的财务、市场、份额、产能数字均标明年份、口径和来源;标注“未充分披露”或“公开资料未见”的部分严禁在任何场景下以推断或填补方式处理。文中无任何荐股、买卖建议、涨跌预测或“值得买”类措辞。内容仅供产业链研究和知识参考,不构成投资决策依据。

source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型