模型层 含付费深读

多模态模型

Multimodal Foundation Models

概念 ID
multimodal-model
更新时间
2026-05-28
来源数量
18

多模态模型

1. 3 秒看懂

多模态模型把文本、图像、语音和视频压进 1 个推理入口,2024 年 GPT-4o 把语音平均响应压到 320 毫秒,2025-2026 年 Gemini/Veo/Sora 把竞争从“会看图”推进到“会生成带音频的视频”。123 Gartner 预计 2027 年 40% 生成式 AI 方案会转向多模态,说明 2026 年云厂商的核心变量已从纯 token 规模转向“视觉/音频/视频调用 × 推理成本 × 分发入口”。4 投资上,Alphabet、Microsoft/OpenAI、Adobe 和 Meta 的胜负不只看模型榜单,而看 2026 年 AI 收入、订阅 ARPU、广告转化和内容供应链效率能否覆盖更高 capex。5678

2. 3 分钟产业解释

多模态模型的产业位置在云 AI 栈的“模型层 + 应用入口层”之间,向上拉动 GPU、HBM、对象存储、视频转码和推理集群,向下改变搜索、办公、广告、创意软件、客服和教育 6 类高频场景。156 GPT-4o 在 2024 年把文本、视觉和音频端到端训练到同一神经网络,音频输入最快 232 毫秒、平均 320 毫秒,解决的是传统 ASR→LLM→TTS 三段流水线 2.8-5.4 秒延迟过高的问题。1 Gemini 3 Pro 在 2025 年把多模态理解推到 81.0% MMMU-Pro 和 87.6% Video-MMMU,Veo 3/3.1 把视频生成推进到原生音效、环境声和角色对白,说明 Google 的路线是把模型能力直接嵌入 Search、Gemini App、Vertex AI 和 Flow。23

商业化有 3 条路径:第 1 条是 API/token,OpenAI 2026 年 Sora 2 标准价格为 720p 每秒 0.10 美元、Sora 2 Pro 1080p 每秒 0.70 美元,视频推理天然比文本推理更接近“按秒计费”的媒体云生意。9 第 2 条是订阅和 seat,Adobe 2026Q1 AI-first ARR 同比超过 3 倍、Firefly ending ARR 超过 2.50 亿美元,说明创意工作流已能单独承接 AI 价格。810 第 3 条是广告和搜索效率,Alphabet 2026Q1 Google Services 收入 896 亿美元、Google Cloud 收入 200 亿美元且同比增长 63%,说明 Gemini/Veo 的价值会同时体现在消费入口和云平台。5

3. 15 分钟专家深入

多模态模型不是“文本 LLM 外挂 OCR 和 TTS”,而是把图像 patch、音频 token、视频帧序列、文本 token 和工具调用映射到同一个上下文与注意力机制中,最终用同一套推理基础设施承接搜索问答、实时语音、图像编辑、视频生成和机器人感知 5 类任务。12 2024 年 GPT-4o 的关键突破是实时性,平均 320 毫秒语音响应把交互边界从“输入框”推向“对话”;2025 年 Veo 3 的关键突破是原生音频,把视频从静音素材生成推向可分发片段;2025 年 Gemini 3 的关键突破是多模态推理,81.0% MMMU-Pro 和 87.6% Video-MMMU 使视频理解不再只是摘要功能。123

供给侧有 4 个瓶颈:训练数据版权、视频推理成本、低延迟服务质量和安全水印。OpenAI GPT-4o 系统卡披露训练数据包含图像、音频和视频,多模态能力依赖公开数据、合作数据和用户/研究人员生成数据,因此版权与授权成本会随模型质量上升而提高。11 Google DeepMind 对 Veo 输出使用 SynthID 水印,并承认自然一致的短语音频仍是持续改进项,说明视频模型的工程瓶颈已经从“能不能生成”转向“音画同步、可控性、合规标记和稳定复现”。3

需求侧的财报映射必须分 3 层计算:多模态可服务任务量 × 付费渗透率 × 单次调用/seat ASP × 公司份额 = AI 相关收入49 已披露事实包括 Microsoft 2026Q3 AI business 年化收入 run-rate 超过 370 亿美元、同比增长 123%,Adobe 2026Q1 Firefly ending ARR 超过 2.50 亿美元,Alphabet 2026Q1 Cloud 收入 200 亿美元、同比增长 63%。5610 未披露项包括 OpenAI GPT-4o/Sora 单项收入、Gemini/Veo 单项收入、Meta 多模态模型单项收入和各模型视频调用量,这些变量只能作为情景假设,不能写成已验证市场份额。5679

估值侧的关键分歧是“多模态收入斜率是否快于 capex 斜率”。Meta 2026Q1 收入 563.11 亿美元、同比增长 33%,但 2026 年 capex 指引上调到 1,250-1,450 亿美元,显示模型、广告和 AI 眼镜的长期期权正在用短期资本开支换增长。7 Alphabet 2026Q1 operating margin 为 36.1%,Microsoft 2026Q3 operating margin 为 46.3%,Adobe 2026Q1 GAAP operating margin 为 37.8%,这 3 家的共同优势是已有分发和高毛利软件/广告收入,反证则是视频生成调用带来成本上升但不能提高 ARPU 或广告 ROI。568

4. 技术原理

多模态模型通常由 5 层构成:第 1 层是多源 tokenizer,把文字、图像 patch、音频片段和视频帧压成可注意力计算的 token;第 2 层是共享 transformer 或混合专家网络,把跨模态信息放入同一上下文;第 3 层是解码器,把回答输出为文本、音频、图像或视频;第 4 层是实时流式服务,把延迟控制在 100-1,000 毫秒量级;第 5 层是安全栈、水印、版权过滤和人审闭环。1311

GPT-4o 的差异在端到端音频/视觉/文本训练,官方披露其最快音频响应 232 毫秒、平均 320 毫秒,较传统语音模式 2.8 秒和 5.4 秒平均延迟有数量级改善。1 Gemini 3 的差异在长上下文、多模态理解和 agentic tool use,官方披露 LMArena 1501 Elo、MMMU-Pro 81.0%、Video-MMMU 87.6%,适合把视频、图片和网页 UI 作为同一推理对象。2 Sora 2 与 Veo 3/3.1 的差异在视频生成,前者强调物理、锐度、同步音频和可控性,后者强调原生音效、环境声、对白、SynthID 水印和 Flow 工作流。312

5. 上游依赖 / 下游影响

上游依赖

  • GPU/推理云:视频每秒计费使推理成本从 token × 价格 扩展为 分辨率 × 秒数 × 并发,OpenAI Sora 2 Pro 1080p 标准价格为 0.70 美元/秒,显示高分辨率视频推理的单位经济高于文本模型。9
  • 数据与版权:GPT-4o 系统卡披露使用公开数据、合作数据和用户/研究人员数据,视频/音频版权边界比文本更复杂,若授权费占 AI 增量收入超过 20%-30%,创意模型毛利会被压缩。11
  • 安全与水印:Veo 输出使用 SynthID,OpenAI Sora 2 对真人图像上传和视频上传采用限制,NIST AI RMF 1.0 要求 AI 风险治理覆盖测量、管理和治理闭环,说明 2026 年多模态商业化必须把水印、身份、未成年人和版权审计前置。31218
  • 低延迟网络:实时语音从 2.8 秒降到 320 毫秒后,模型体验受 P95 延迟和音频抖动约束,边缘节点和区域处理会从可选项变成企业 SLA 项。19

下游影响

  • 搜索和广告:Alphabet 2026Q1 Google Services 收入 896 亿美元、同比增长 16%,若 Gemini 多模态提高搜索互动和广告转化,收益会先体现在广告收入和 Cloud AI 消耗。5
  • 办公和客服:Microsoft 2026Q3 AI business 年化 run-rate 超过 370 亿美元、同比增长 123%,多模态 Copilot 会把会议音频、屏幕、文档和代码整合进同一 seat。6
  • 创意软件:Adobe 2026Q1 AI-first ARR 同比超过 3 倍、Firefly ending ARR 超过 2.50 亿美元,视频/图像模型会把 Creative Cloud 从工具订阅推向生成额度和企业内容供应链。810
  • 社交和硬件:Meta 2026Q1 Family DAP 达 35.6 亿、同比增长 4%,多模态模型若进入 Reels、广告生成和 AI glasses,商业化会通过广告载荷、创意生成和硬件活跃度传导。7

6. 技术路线对比表

路线速率 / 延迟功耗 / 成本口径距离或维度标准成熟度量产概率 2026主要受益公司反证指标
端到端实时语音视觉模型GPT-4o 平均语音 320msgpt-realtime-2 音频输入 32 美元/百万 token、输出 64 美元/百万 token音频+图像+文本公司 API 成熟,行业标准待形成85%OpenAI/Microsoft、Google、MetaP95 延迟高于 1 秒或语音中断率高于客服 SLA
多模态推理模型Gemini 3 Pro:MMMU-Pro 81.0%、Video-MMMU 87.6%文本/图像按 token;视频理解成本待披露图像+视频理解+工具调用Vertex AI/AI Studio 商用成熟80%Alphabet、Microsoft、Anthropic 生态视频理解准确率不提升搜索/办公转化
文生视频 + 原生音频Sora 2 / Veo 3 支持同步音频Sora 2 标准 720p 0.10 美元/秒,Pro 1080p 0.70 美元/秒720p-1080p、5-10 秒情景平台 API 与创意工具商用推进60%OpenAI、Google、Adobe、Runway版权投诉、音画不同步或生成成本高于人工素材 50%
创意工作流模型集成Firefly 30+ 模型生态Firefly ARR > 2.50 亿美元,生成额度单价待披露图像/视频/音频/品牌模板Creative Cloud/GenStudio 成熟75%Adobe、Shutterstock、GettyAI-first ARR 增速低于订阅收入增速
设备端多模态助手手机/眼镜实时推理端侧 NPU 功耗待披露摄像头+麦克风+屏幕Android/iOS/眼镜生态迭代45%Google、Meta、Apple、Qualcomm续航下降超过 10% 或隐私权限导致日活低于预期

7. 关键指标

  • 多模态渗透率:Gartner 预计 2027 年 40% 生成式 AI 方案会是多模态,若 2026 年企业 RFP 仍以纯文本 chatbot 为主,则本轮模型升级难以转化为预算。4
  • 视频生成单价:OpenAI Sora 2 标准 720p 为 0.10 美元/秒、Sora 2 Pro 1080p 为 0.70 美元/秒,10 秒视频成本区间为 1.00-7.00 美元,适合跟踪毛利率和企业用量弹性。9
  • 实时语音延迟:GPT-4o 平均 320 毫秒相对旧 Voice Mode 2.8-5.4 秒改善 8.75-16.9 倍,若竞品 P95 超过 1 秒则难以进入实时客服和眼镜场景。1
  • 多模态 benchmark:Gemini 3 Pro 的 81.0% MMMU-Pro 和 87.6% Video-MMMU 是 2026 年视觉/视频理解的公开锚,若模型榜单提升不能带来搜索、广告或 Cloud 增速,估值会回到 capex 质疑。25
  • AI 收入 run-rate:Microsoft 2026Q3 AI business 年化 run-rate 超过 370 亿美元、同比增长 123%,这是 Microsoft/OpenAI 生态最直接的商业化锚。6
  • 创意 AI ARR:Adobe 2026Q1 AI-first ARR 同比超过 3 倍、Firefly ending ARR 超过 2.50 亿美元,若 2026H2 增速低于总订阅 13%,说明视频/图像生成未能独立提价。810
  • 安全事故:Veo 使用 SynthID、Sora 2 限制真人图像上传,若 2026 年发生 1 起大型版权或肖像权诉讼,视频模型的企业采购周期可能延后 2-4 个季度。312

8. 可算传导表

口径:TAM 使用 Gartner 2026 年全球 AI 支出 2.59 万亿美元和 IDC 2028 年 AI 支出 6,320 亿美元作宏观锚,不能等同多模态模型收入;公司列使用已披露季度收入或 ARR 作为可服务收入池,再以多模态 attach rate 做情景测算。1314

驱动变量Alphabet / Gemini + VeoMicrosoft / OpenAI + CopilotAdobe / Firefly + GenStudio来源 / 公式
TAM2026 全球 AI 支出 2.59 万亿美元;2027 多模态 GenAI 方案占比 40%2026 全球 AI 支出 2.59 万亿美元;AI run-rate 已披露 370 亿美元2026 全球 AI 支出 2.59 万亿美元;创意与营销内容供应链为子集4613
出货 / 调用代理2026Q1 Google Cloud 收入 200 亿美元、同比 +63%2026Q3 AI business ARR run-rate 370 亿美元、同比 +123%2026Q1 Firefly ending ARR > 2.50 亿美元、AI-first ARR 同比 > 3 倍5610
ASP / 单价Gemini/Veo 单价未单列;Veo 通过 Ultra/Flow/Vertex AI 变现OpenAI Sora 2 720p 0.10 美元/秒、Pro 1080p 0.70 美元/秒Firefly credit 单价待披露;用 ARR 作为收入锚3910
份额 / attach rate情景 5%/10%/20% 附着于 Google Cloud 2026Q1 收入情景 10%/20%/30% 附着于 AI run-rate情景 25%/50%/75% 附着于 Firefly ARR情景假设
中性多模态收入20.0 亿美元 = 200 亿美元 × 10%74.0 亿美元 = 370 亿美元 × 20%1.25 亿美元 = 2.50 亿美元 × 50%推算
毛利率 / 利润率Alphabet 2026Q1 operating margin 36.1%Microsoft 2026Q3 operating margin 46.3% = 384 亿/829 亿美元Adobe 2026Q1 GAAP operating margin 37.8% = 24.2 亿/64.0 亿美元568
毛利 / 利润贡献7.22 亿美元 operating income = 20.0 × 36.1%34.26 亿美元 operating income = 74.0 × 46.3%0.47 亿美元 operating income = 1.25 × 37.8%推算
PE 口径GOOGL 29.66x,2026-05-27 美股收盘,美元,close ÷ TTM EPSMSFT 24.76x,2026-05-27 美股收盘,美元,close ÷ TTM EPSADBE 14.01x,2026-05-27 美股收盘,美元,close ÷ TTM EPS15
估值映射214 亿美元 = 7.22 亿 × 29.66x848 亿美元 = 34.26 亿 × 24.76x6.6 亿美元 = 0.47 亿 × 14.01x推算

9. 同业硬指标对比表

公司收入增速GM / OM净利FCF margin客户集中度技术代际PE TTM反证条件
Alphabet2026Q1 收入 1,098.96 亿美元;Cloud 200 亿美元总收入 +22%;Cloud +63%OM 36.1%2026Q1 净利 625.6 亿美元2026Q1 FCF 待现金流表复核搜索/广告客户分散Gemini 3 + Veo 3.1 + TPU29.66x,2026-05-27 收盘Cloud 增速低于 40% 或 Search AI 不增量
Microsoft2026Q3 收入 829 亿美元 [MSFT];AI run-rate 370 亿美元 [MSFT]总收入 +18%;AI run-rate +123% [MSFT]OM 46.3% [MSFT]2026Q3 净利 318 亿美元 [MSFT]2026Q3 FCF margin 待现金流表复核企业客户分散,OpenAI 依赖需跟踪OpenAI GPT/Sora + Copilot + Azure24.76x,2026-05-27 收盘 [MSFT]AI run-rate 增速低于 capex 增速 2 个季度
Meta2026Q1 收入 563.11 亿美元+33%OM 40.7% = 229 亿/563.11 亿美元2026Q1 净利 267.7 亿美元FCF margin 待 10-Q 复核广告客户分散,收入依赖广告Llama 多模态 + Reels + AI glasses22.27x,2026-05-27 收盘2026 capex 1,250-1,450 亿美元未转化为广告增速
Adobe2026Q1 收入 64.0 亿美元;ARR 260.6 亿美元收入 +12%;订阅 +13%OM 37.8%2026Q1 净利 18.9 亿美元OCF margin 46.3% = 29.6 亿/64.0 亿美元企业与个人客户分散Firefly + 30+ 第三方模型 + GenStudio14.01x,2026-05-27 收盘Firefly ARR 增速低于 Creative subscription 增速
Shutterstock2025 收入 9.899 亿美元+6%adjusted EBITDA margin 27.5%2025 净利 margin 4.6%adjusted FCF margin 15.1% = 1.495 亿/9.899 亿美元内容买方分散,数据授权客户集中度待披露数据授权 + AI image/video/audio tools-26.06x,2026-05-27 收盘,亏损口径数据授权增速不能抵消核心图库下滑

10. 投资逻辑 + 业绩传导

多模态模型的投资逻辑是“同一用户入口承载更多媒体 token”,即 1 个搜索框、1 个 Copilot seat 或 1 个创意工作台可以从文本问答扩展到图片理解、实时语音、视频生成和品牌素材复用。138 2026 年的财报验证应看 3 个数字:Microsoft AI run-rate 370 亿美元是否继续高于 100% 增长,Alphabet Cloud 63% 增速是否保持 40% 以上,Adobe Firefly ARR 是否从 2.50 亿美元向 5.00 亿美元以上扩张。5610

用户任务量 × 多模态渗透率
        ↓
音频/图像/视频调用量 × ASP
        ↓
模型厂商份额 × 分发入口
        ↓
收入 × operating margin - capex 压力
        ↓
EPS × PE = 情景市值框架 / 股价

业绩传导的核心不是“模型更像人”这 1 个叙事,而是 视频秒数 × 分辨率 × 并发 × 成本 能否低于 订阅升级 + 广告转化 + 企业 seat 的增量毛利。79 若 Sora/Veo 的生成视频成本持续落在 1.00-7.00 美元/10 秒区间且企业愿意为版权、安全和品牌控制付费,Adobe 与 Google 的创意工具会获得更高 ARPU;若内容供给泛滥压低素材价格,Shutterstock/Getty 的数据授权价值会高于传统图库订阅。3916

11. 常见误读纠偏

误读 1:多模态模型只是“LLM 加 OCR”

实际情况:GPT-4o 是端到端处理文本、视觉和音频的单一神经网络,平均语音响应 320 毫秒,传统三段式 Voice Mode 平均延迟是 2.8 秒和 5.4 秒,交互边界差了 8.75-16.9 倍。1

证据:OpenAI GPT-4o 系统卡披露模型接受文本、音频、图像和视频输入,并生成文本、音频和图像输出,且训练数据包含多模态数据。11

误读 2:视频模型只要画质更好就能赚钱

实际情况:Veo 3.1 官方仍把自然一致的短语音频列为改进项,Sora 2 对真人图像和视频上传有部署限制,说明视频模型商业化至少受制于 4 个变量:成本、音画同步、版权和安全。312

证据:OpenAI API 2026 年 Sora 2 Pro 1080p 标准价格为 0.70 美元/秒,10 秒视频生成成本为 7.00 美元,若不能带来广告转化或创意提效,调用量增长会直接压缩毛利。9

误读 3:OpenAI 强就等于 Microsoft 财报全受益

实际情况:Microsoft 披露的是 AI business 年化 run-rate 超过 370 亿美元,而不是 OpenAI 或 GPT-4o/Sora 单项收入;OpenAI 单项产品收入、分成比例和毛利率均未披露。6

证据:Microsoft 2026Q3 披露非 GAAP 结果剔除 OpenAI 投资影响,说明投资损益、Azure AI 收入和 OpenAI 应用收入需要分开建模。6

12. 最新事件

  • [已发生] 2025-05-20:Google 在 I/O 2025 把 Veo 3、Imagen 4 和 Gemini Live 推入 Gemini App,Veo 3 支持音效、环境声和角色对白。317
  • [已发生] 2025-11-18:Google 发布 Gemini 3 Pro preview,披露 LMArena 1501 Elo、MMMU-Pro 81.0%、Video-MMMU 87.6%。2
  • [已发生] 2026-03-12:Adobe 披露 2026Q1 收入 64.0 亿美元、AI-first ARR 同比超过 3 倍、经营现金流 29.6 亿美元。8
  • [指引] 2026-04-29:Meta 把 2026 年 capex 指引上调至 1,250-1,450 亿美元,显示多模态广告、模型和硬件的资本开支压力上行。7
  • [行业预测] 2026-05-19:Gartner 预计 2026 年全球 AI 支出达 2.59 万亿美元、同比增长 47%,多模态模型的宏观预算池继续扩大。13

13. 来源 footnotes

1 Hello GPT-4o — OpenAI — 2024-05-13 — https://openai.com/index/hello-gpt-4o/ (B)

2 Gemini 3: Introducing the latest Gemini AI model from Google — Google — 2025-11-18 — https://blog.google/products-and-platforms/products/gemini/gemini-3/ (B)

3 Veo 3.1 model page — Google DeepMind — 2026 — https://deepmind.google/models/veo/ (B)

4 Gartner Predicts 40% of Generative AI Solutions Will Be Multimodal By 2027 — Gartner — 2024-09-09 — https://www.gartner.com/en/newsroom/press-releases/2024-09-09-gartner-predicts-40-percent-of-generative-ai-solutions-will-be-multimodal-by-2027 (A)

5 Alphabet Announces First Quarter 2026 Results — Alphabet — 2026-04-29 — https://s206.q4cdn.com/479360582/files/doc_financials/2026/q1/2026q1-alphabet-earnings-release.pdf (B)

6 Microsoft FY26 Q3 Earnings Release — Microsoft — 2026-04-29 — https://www.microsoft.com/en-us/investor/earnings/fy-2026-q3/press-release-webcast (B)

7 Meta Reports First Quarter 2026 Results — Meta Platforms — 2026-04-29 — https://investor.atmeta.com/investor-news/press-release-details/2026/Meta-Reports-First-Quarter-2026-Results/ (B)

8 Adobe Delivers Record Q1 Results — Adobe — 2026-03-12 — https://www.adobe.com/cc-shared/assets/investor-relations/pdfs/21306202/ay45th643t5y46.pdf (B)

9 OpenAI API Pricing: video generation and realtime/audio models — OpenAI — 2026-05-28 accessed — https://developers.openai.com/api/docs/pricing (B)

10 Adobe Investor Summit Q&A, April 2026 — Adobe — 2026-04-21 — https://www.adobe.com/cc-shared/assets/investor-relations/pdfs/adbe-investor-session-summit-2026.pdf (B)

11 GPT-4o System Card — OpenAI — 2024-08-08 — https://cdn.openai.com/gpt-4o-system-card.pdf (B)

12 Sora 2 System Card — OpenAI — 2025-10 — https://cdn.openai.com/pdf/50d5973c-c4ff-4c2d-986f-c72b5d0ff069/sora_2_system_card.pdf (B)

13 Gartner Forecasts Worldwide AI Spending to Grow 47% in 2026 — Gartner — 2026-05-19 — https://www.gartner.com/en/newsroom/press-releases/2026-05-19-gartner-forecasts-worldwide-ai-spending-to-grow-47-percent-in-2026 (A)

14 A Deep Dive Into IDC’s Global AI and Generative AI Spending — IDC — 2024 — https://www.idc.com/resource-center/blog/a-deep-dive-into-idcs-global-ai-and-generative-ai-spending/ (A)

15 Market quote feed for GOOGL/MSFT/META/ADBE/SSTK; U.S. close uses 2026-05-27 16:00 EDT close, PE = close ÷ TTM EPS — StockAnalysis / market data snapshot — 2026-05-28 — https://stockanalysis.com/ (C)

16 Shutterstock Reports Full Year 2025 and Fourth Quarter Financial Results — Shutterstock — 2026-02-17 — https://investor.shutterstock.com/news-releases/news-release-details/shutterstock-reports-full-year-2025-and-fourth-quarter-financial (B)

17 Gemini gets more personal, proactive and powerful — Google — 2025-05-20 — https://blog.google/products-and-platforms/products/gemini/gemini-app-updates-io-2025/ (B)

18 Artificial Intelligence Risk Management Framework 1.0 — NIST — 2023 — https://www.nist.gov/itl/ai-risk-management-framework (A)

source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型