多模态模型
1. 3 秒看懂
多模态模型把文本、图像、语音和视频压进 1 个推理入口,2024 年 GPT-4o 把语音平均响应压到 320 毫秒,2025-2026 年 Gemini/Veo/Sora 把竞争从“会看图”推进到“会生成带音频的视频”。123 Gartner 预计 2027 年 40% 生成式 AI 方案会转向多模态,说明 2026 年云厂商的核心变量已从纯 token 规模转向“视觉/音频/视频调用 × 推理成本 × 分发入口”。4 投资上,Alphabet、Microsoft/OpenAI、Adobe 和 Meta 的胜负不只看模型榜单,而看 2026 年 AI 收入、订阅 ARPU、广告转化和内容供应链效率能否覆盖更高 capex。5678
2. 3 分钟产业解释
多模态模型的产业位置在云 AI 栈的“模型层 + 应用入口层”之间,向上拉动 GPU、HBM、对象存储、视频转码和推理集群,向下改变搜索、办公、广告、创意软件、客服和教育 6 类高频场景。156 GPT-4o 在 2024 年把文本、视觉和音频端到端训练到同一神经网络,音频输入最快 232 毫秒、平均 320 毫秒,解决的是传统 ASR→LLM→TTS 三段流水线 2.8-5.4 秒延迟过高的问题。1 Gemini 3 Pro 在 2025 年把多模态理解推到 81.0% MMMU-Pro 和 87.6% Video-MMMU,Veo 3/3.1 把视频生成推进到原生音效、环境声和角色对白,说明 Google 的路线是把模型能力直接嵌入 Search、Gemini App、Vertex AI 和 Flow。23
商业化有 3 条路径:第 1 条是 API/token,OpenAI 2026 年 Sora 2 标准价格为 720p 每秒 0.10 美元、Sora 2 Pro 1080p 每秒 0.70 美元,视频推理天然比文本推理更接近“按秒计费”的媒体云生意。9 第 2 条是订阅和 seat,Adobe 2026Q1 AI-first ARR 同比超过 3 倍、Firefly ending ARR 超过 2.50 亿美元,说明创意工作流已能单独承接 AI 价格。810 第 3 条是广告和搜索效率,Alphabet 2026Q1 Google Services 收入 896 亿美元、Google Cloud 收入 200 亿美元且同比增长 63%,说明 Gemini/Veo 的价值会同时体现在消费入口和云平台。5
3. 15 分钟专家深入
多模态模型不是“文本 LLM 外挂 OCR 和 TTS”,而是把图像 patch、音频 token、视频帧序列、文本 token 和工具调用映射到同一个上下文与注意力机制中,最终用同一套推理基础设施承接搜索问答、实时语音、图像编辑、视频生成和机器人感知 5 类任务。12 2024 年 GPT-4o 的关键突破是实时性,平均 320 毫秒语音响应把交互边界从“输入框”推向“对话”;2025 年 Veo 3 的关键突破是原生音频,把视频从静音素材生成推向可分发片段;2025 年 Gemini 3 的关键突破是多模态推理,81.0% MMMU-Pro 和 87.6% Video-MMMU 使视频理解不再只是摘要功能。123
供给侧有 4 个瓶颈:训练数据版权、视频推理成本、低延迟服务质量和安全水印。OpenAI GPT-4o 系统卡披露训练数据包含图像、音频和视频,多模态能力依赖公开数据、合作数据和用户/研究人员生成数据,因此版权与授权成本会随模型质量上升而提高。11 Google DeepMind 对 Veo 输出使用 SynthID 水印,并承认自然一致的短语音频仍是持续改进项,说明视频模型的工程瓶颈已经从“能不能生成”转向“音画同步、可控性、合规标记和稳定复现”。3
需求侧的财报映射必须分 3 层计算:多模态可服务任务量 × 付费渗透率 × 单次调用/seat ASP × 公司份额 = AI 相关收入。49 已披露事实包括 Microsoft 2026Q3 AI business 年化收入 run-rate 超过 370 亿美元、同比增长 123%,Adobe 2026Q1 Firefly ending ARR 超过 2.50 亿美元,Alphabet 2026Q1 Cloud 收入 200 亿美元、同比增长 63%。5610 未披露项包括 OpenAI GPT-4o/Sora 单项收入、Gemini/Veo 单项收入、Meta 多模态模型单项收入和各模型视频调用量,这些变量只能作为情景假设,不能写成已验证市场份额。5679
估值侧的关键分歧是“多模态收入斜率是否快于 capex 斜率”。Meta 2026Q1 收入 563.11 亿美元、同比增长 33%,但 2026 年 capex 指引上调到 1,250-1,450 亿美元,显示模型、广告和 AI 眼镜的长期期权正在用短期资本开支换增长。7 Alphabet 2026Q1 operating margin 为 36.1%,Microsoft 2026Q3 operating margin 为 46.3%,Adobe 2026Q1 GAAP operating margin 为 37.8%,这 3 家的共同优势是已有分发和高毛利软件/广告收入,反证则是视频生成调用带来成本上升但不能提高 ARPU 或广告 ROI。568
4. 技术原理
多模态模型通常由 5 层构成:第 1 层是多源 tokenizer,把文字、图像 patch、音频片段和视频帧压成可注意力计算的 token;第 2 层是共享 transformer 或混合专家网络,把跨模态信息放入同一上下文;第 3 层是解码器,把回答输出为文本、音频、图像或视频;第 4 层是实时流式服务,把延迟控制在 100-1,000 毫秒量级;第 5 层是安全栈、水印、版权过滤和人审闭环。1311
GPT-4o 的差异在端到端音频/视觉/文本训练,官方披露其最快音频响应 232 毫秒、平均 320 毫秒,较传统语音模式 2.8 秒和 5.4 秒平均延迟有数量级改善。1 Gemini 3 的差异在长上下文、多模态理解和 agentic tool use,官方披露 LMArena 1501 Elo、MMMU-Pro 81.0%、Video-MMMU 87.6%,适合把视频、图片和网页 UI 作为同一推理对象。2 Sora 2 与 Veo 3/3.1 的差异在视频生成,前者强调物理、锐度、同步音频和可控性,后者强调原生音效、环境声、对白、SynthID 水印和 Flow 工作流。312
5. 上游依赖 / 下游影响
上游依赖
- GPU/推理云:视频每秒计费使推理成本从
token × 价格扩展为分辨率 × 秒数 × 并发,OpenAI Sora 2 Pro 1080p 标准价格为 0.70 美元/秒,显示高分辨率视频推理的单位经济高于文本模型。9 - 数据与版权:GPT-4o 系统卡披露使用公开数据、合作数据和用户/研究人员数据,视频/音频版权边界比文本更复杂,若授权费占 AI 增量收入超过 20%-30%,创意模型毛利会被压缩。11
- 安全与水印:Veo 输出使用 SynthID,OpenAI Sora 2 对真人图像上传和视频上传采用限制,NIST AI RMF 1.0 要求 AI 风险治理覆盖测量、管理和治理闭环,说明 2026 年多模态商业化必须把水印、身份、未成年人和版权审计前置。31218
- 低延迟网络:实时语音从 2.8 秒降到 320 毫秒后,模型体验受 P95 延迟和音频抖动约束,边缘节点和区域处理会从可选项变成企业 SLA 项。19
下游影响
- 搜索和广告:Alphabet 2026Q1 Google Services 收入 896 亿美元、同比增长 16%,若 Gemini 多模态提高搜索互动和广告转化,收益会先体现在广告收入和 Cloud AI 消耗。5
- 办公和客服:Microsoft 2026Q3 AI business 年化 run-rate 超过 370 亿美元、同比增长 123%,多模态 Copilot 会把会议音频、屏幕、文档和代码整合进同一 seat。6
- 创意软件:Adobe 2026Q1 AI-first ARR 同比超过 3 倍、Firefly ending ARR 超过 2.50 亿美元,视频/图像模型会把 Creative Cloud 从工具订阅推向生成额度和企业内容供应链。810
- 社交和硬件:Meta 2026Q1 Family DAP 达 35.6 亿、同比增长 4%,多模态模型若进入 Reels、广告生成和 AI glasses,商业化会通过广告载荷、创意生成和硬件活跃度传导。7
6. 技术路线对比表
| 路线 | 速率 / 延迟 | 功耗 / 成本口径 | 距离或维度 | 标准成熟度 | 量产概率 2026 | 主要受益公司 | 反证指标 |
|---|---|---|---|---|---|---|---|
| 端到端实时语音视觉模型 | GPT-4o 平均语音 320ms | gpt-realtime-2 音频输入 32 美元/百万 token、输出 64 美元/百万 token | 音频+图像+文本 | 公司 API 成熟,行业标准待形成 | 85% | OpenAI/Microsoft、Google、Meta | P95 延迟高于 1 秒或语音中断率高于客服 SLA |
| 多模态推理模型 | Gemini 3 Pro:MMMU-Pro 81.0%、Video-MMMU 87.6% | 文本/图像按 token;视频理解成本待披露 | 图像+视频理解+工具调用 | Vertex AI/AI Studio 商用成熟 | 80% | Alphabet、Microsoft、Anthropic 生态 | 视频理解准确率不提升搜索/办公转化 |
| 文生视频 + 原生音频 | Sora 2 / Veo 3 支持同步音频 | Sora 2 标准 720p 0.10 美元/秒,Pro 1080p 0.70 美元/秒 | 720p-1080p、5-10 秒情景 | 平台 API 与创意工具商用推进 | 60% | OpenAI、Google、Adobe、Runway | 版权投诉、音画不同步或生成成本高于人工素材 50% |
| 创意工作流模型集成 | Firefly 30+ 模型生态 | Firefly ARR > 2.50 亿美元,生成额度单价待披露 | 图像/视频/音频/品牌模板 | Creative Cloud/GenStudio 成熟 | 75% | Adobe、Shutterstock、Getty | AI-first ARR 增速低于订阅收入增速 |
| 设备端多模态助手 | 手机/眼镜实时推理 | 端侧 NPU 功耗待披露 | 摄像头+麦克风+屏幕 | Android/iOS/眼镜生态迭代 | 45% | Google、Meta、Apple、Qualcomm | 续航下降超过 10% 或隐私权限导致日活低于预期 |
7. 关键指标
- 多模态渗透率:Gartner 预计 2027 年 40% 生成式 AI 方案会是多模态,若 2026 年企业 RFP 仍以纯文本 chatbot 为主,则本轮模型升级难以转化为预算。4
- 视频生成单价:OpenAI Sora 2 标准 720p 为 0.10 美元/秒、Sora 2 Pro 1080p 为 0.70 美元/秒,10 秒视频成本区间为 1.00-7.00 美元,适合跟踪毛利率和企业用量弹性。9
- 实时语音延迟:GPT-4o 平均 320 毫秒相对旧 Voice Mode 2.8-5.4 秒改善 8.75-16.9 倍,若竞品 P95 超过 1 秒则难以进入实时客服和眼镜场景。1
- 多模态 benchmark:Gemini 3 Pro 的 81.0% MMMU-Pro 和 87.6% Video-MMMU 是 2026 年视觉/视频理解的公开锚,若模型榜单提升不能带来搜索、广告或 Cloud 增速,估值会回到 capex 质疑。25
- AI 收入 run-rate:Microsoft 2026Q3 AI business 年化 run-rate 超过 370 亿美元、同比增长 123%,这是 Microsoft/OpenAI 生态最直接的商业化锚。6
- 创意 AI ARR:Adobe 2026Q1 AI-first ARR 同比超过 3 倍、Firefly ending ARR 超过 2.50 亿美元,若 2026H2 增速低于总订阅 13%,说明视频/图像生成未能独立提价。810
- 安全事故:Veo 使用 SynthID、Sora 2 限制真人图像上传,若 2026 年发生 1 起大型版权或肖像权诉讼,视频模型的企业采购周期可能延后 2-4 个季度。312
8. 可算传导表
口径:TAM 使用 Gartner 2026 年全球 AI 支出 2.59 万亿美元和 IDC 2028 年 AI 支出 6,320 亿美元作宏观锚,不能等同多模态模型收入;公司列使用已披露季度收入或 ARR 作为可服务收入池,再以多模态 attach rate 做情景测算。1314
| 驱动变量 | Alphabet / Gemini + Veo | Microsoft / OpenAI + Copilot | Adobe / Firefly + GenStudio | 来源 / 公式 |
|---|---|---|---|---|
| TAM | 2026 全球 AI 支出 2.59 万亿美元;2027 多模态 GenAI 方案占比 40% | 2026 全球 AI 支出 2.59 万亿美元;AI run-rate 已披露 370 亿美元 | 2026 全球 AI 支出 2.59 万亿美元;创意与营销内容供应链为子集 | 4613 |
| 出货 / 调用代理 | 2026Q1 Google Cloud 收入 200 亿美元、同比 +63% | 2026Q3 AI business ARR run-rate 370 亿美元、同比 +123% | 2026Q1 Firefly ending ARR > 2.50 亿美元、AI-first ARR 同比 > 3 倍 | 5610 |
| ASP / 单价 | Gemini/Veo 单价未单列;Veo 通过 Ultra/Flow/Vertex AI 变现 | OpenAI Sora 2 720p 0.10 美元/秒、Pro 1080p 0.70 美元/秒 | Firefly credit 单价待披露;用 ARR 作为收入锚 | 3910 |
| 份额 / attach rate | 情景 5%/10%/20% 附着于 Google Cloud 2026Q1 收入 | 情景 10%/20%/30% 附着于 AI run-rate | 情景 25%/50%/75% 附着于 Firefly ARR | 情景假设 |
| 中性多模态收入 | 20.0 亿美元 = 200 亿美元 × 10% | 74.0 亿美元 = 370 亿美元 × 20% | 1.25 亿美元 = 2.50 亿美元 × 50% | 推算 |
| 毛利率 / 利润率 | Alphabet 2026Q1 operating margin 36.1% | Microsoft 2026Q3 operating margin 46.3% = 384 亿/829 亿美元 | Adobe 2026Q1 GAAP operating margin 37.8% = 24.2 亿/64.0 亿美元 | 568 |
| 毛利 / 利润贡献 | 7.22 亿美元 operating income = 20.0 × 36.1% | 34.26 亿美元 operating income = 74.0 × 46.3% | 0.47 亿美元 operating income = 1.25 × 37.8% | 推算 |
| PE 口径 | GOOGL 29.66x,2026-05-27 美股收盘,美元,close ÷ TTM EPS | MSFT 24.76x,2026-05-27 美股收盘,美元,close ÷ TTM EPS | ADBE 14.01x,2026-05-27 美股收盘,美元,close ÷ TTM EPS | 15 |
| 估值映射 | 214 亿美元 = 7.22 亿 × 29.66x | 848 亿美元 = 34.26 亿 × 24.76x | 6.6 亿美元 = 0.47 亿 × 14.01x | 推算 |
9. 同业硬指标对比表
| 公司 | 收入 | 增速 | GM / OM | 净利 | FCF margin | 客户集中度 | 技术代际 | PE TTM | 反证条件 |
|---|---|---|---|---|---|---|---|---|---|
| Alphabet | 2026Q1 收入 1,098.96 亿美元;Cloud 200 亿美元 | 总收入 +22%;Cloud +63% | OM 36.1% | 2026Q1 净利 625.6 亿美元 | 2026Q1 FCF 待现金流表复核 | 搜索/广告客户分散 | Gemini 3 + Veo 3.1 + TPU | 29.66x,2026-05-27 收盘 | Cloud 增速低于 40% 或 Search AI 不增量 |
| Microsoft | 2026Q3 收入 829 亿美元 [MSFT];AI run-rate 370 亿美元 [MSFT] | 总收入 +18%;AI run-rate +123% [MSFT] | OM 46.3% [MSFT] | 2026Q3 净利 318 亿美元 [MSFT] | 2026Q3 FCF margin 待现金流表复核 | 企业客户分散,OpenAI 依赖需跟踪 | OpenAI GPT/Sora + Copilot + Azure | 24.76x,2026-05-27 收盘 [MSFT] | AI run-rate 增速低于 capex 增速 2 个季度 |
| Meta | 2026Q1 收入 563.11 亿美元 | +33% | OM 40.7% = 229 亿/563.11 亿美元 | 2026Q1 净利 267.7 亿美元 | FCF margin 待 10-Q 复核 | 广告客户分散,收入依赖广告 | Llama 多模态 + Reels + AI glasses | 22.27x,2026-05-27 收盘 | 2026 capex 1,250-1,450 亿美元未转化为广告增速 |
| Adobe | 2026Q1 收入 64.0 亿美元;ARR 260.6 亿美元 | 收入 +12%;订阅 +13% | OM 37.8% | 2026Q1 净利 18.9 亿美元 | OCF margin 46.3% = 29.6 亿/64.0 亿美元 | 企业与个人客户分散 | Firefly + 30+ 第三方模型 + GenStudio | 14.01x,2026-05-27 收盘 | Firefly ARR 增速低于 Creative subscription 增速 |
| Shutterstock | 2025 收入 9.899 亿美元 | +6% | adjusted EBITDA margin 27.5% | 2025 净利 margin 4.6% | adjusted FCF margin 15.1% = 1.495 亿/9.899 亿美元 | 内容买方分散,数据授权客户集中度待披露 | 数据授权 + AI image/video/audio tools | -26.06x,2026-05-27 收盘,亏损口径 | 数据授权增速不能抵消核心图库下滑 |
10. 投资逻辑 + 业绩传导
多模态模型的投资逻辑是“同一用户入口承载更多媒体 token”,即 1 个搜索框、1 个 Copilot seat 或 1 个创意工作台可以从文本问答扩展到图片理解、实时语音、视频生成和品牌素材复用。138 2026 年的财报验证应看 3 个数字:Microsoft AI run-rate 370 亿美元是否继续高于 100% 增长,Alphabet Cloud 63% 增速是否保持 40% 以上,Adobe Firefly ARR 是否从 2.50 亿美元向 5.00 亿美元以上扩张。5610
用户任务量 × 多模态渗透率
↓
音频/图像/视频调用量 × ASP
↓
模型厂商份额 × 分发入口
↓
收入 × operating margin - capex 压力
↓
EPS × PE = 情景市值框架 / 股价
业绩传导的核心不是“模型更像人”这 1 个叙事,而是 视频秒数 × 分辨率 × 并发 × 成本 能否低于 订阅升级 + 广告转化 + 企业 seat 的增量毛利。79 若 Sora/Veo 的生成视频成本持续落在 1.00-7.00 美元/10 秒区间且企业愿意为版权、安全和品牌控制付费,Adobe 与 Google 的创意工具会获得更高 ARPU;若内容供给泛滥压低素材价格,Shutterstock/Getty 的数据授权价值会高于传统图库订阅。3916
11. 常见误读纠偏
误读 1:多模态模型只是“LLM 加 OCR”
实际情况:GPT-4o 是端到端处理文本、视觉和音频的单一神经网络,平均语音响应 320 毫秒,传统三段式 Voice Mode 平均延迟是 2.8 秒和 5.4 秒,交互边界差了 8.75-16.9 倍。1
证据:OpenAI GPT-4o 系统卡披露模型接受文本、音频、图像和视频输入,并生成文本、音频和图像输出,且训练数据包含多模态数据。11
误读 2:视频模型只要画质更好就能赚钱
实际情况:Veo 3.1 官方仍把自然一致的短语音频列为改进项,Sora 2 对真人图像和视频上传有部署限制,说明视频模型商业化至少受制于 4 个变量:成本、音画同步、版权和安全。312
证据:OpenAI API 2026 年 Sora 2 Pro 1080p 标准价格为 0.70 美元/秒,10 秒视频生成成本为 7.00 美元,若不能带来广告转化或创意提效,调用量增长会直接压缩毛利。9
误读 3:OpenAI 强就等于 Microsoft 财报全受益
实际情况:Microsoft 披露的是 AI business 年化 run-rate 超过 370 亿美元,而不是 OpenAI 或 GPT-4o/Sora 单项收入;OpenAI 单项产品收入、分成比例和毛利率均未披露。6
证据:Microsoft 2026Q3 披露非 GAAP 结果剔除 OpenAI 投资影响,说明投资损益、Azure AI 收入和 OpenAI 应用收入需要分开建模。6
12. 最新事件
- [已发生] 2025-05-20:Google 在 I/O 2025 把 Veo 3、Imagen 4 和 Gemini Live 推入 Gemini App,Veo 3 支持音效、环境声和角色对白。317
- [已发生] 2025-11-18:Google 发布 Gemini 3 Pro preview,披露 LMArena 1501 Elo、MMMU-Pro 81.0%、Video-MMMU 87.6%。2
- [已发生] 2026-03-12:Adobe 披露 2026Q1 收入 64.0 亿美元、AI-first ARR 同比超过 3 倍、经营现金流 29.6 亿美元。8
- [指引] 2026-04-29:Meta 把 2026 年 capex 指引上调至 1,250-1,450 亿美元,显示多模态广告、模型和硬件的资本开支压力上行。7
- [行业预测] 2026-05-19:Gartner 预计 2026 年全球 AI 支出达 2.59 万亿美元、同比增长 47%,多模态模型的宏观预算池继续扩大。13
13. 来源 footnotes
1 Hello GPT-4o — OpenAI — 2024-05-13 — https://openai.com/index/hello-gpt-4o/ (B)
2 Gemini 3: Introducing the latest Gemini AI model from Google — Google — 2025-11-18 — https://blog.google/products-and-platforms/products/gemini/gemini-3/ (B)
3 Veo 3.1 model page — Google DeepMind — 2026 — https://deepmind.google/models/veo/ (B)
4 Gartner Predicts 40% of Generative AI Solutions Will Be Multimodal By 2027 — Gartner — 2024-09-09 — https://www.gartner.com/en/newsroom/press-releases/2024-09-09-gartner-predicts-40-percent-of-generative-ai-solutions-will-be-multimodal-by-2027 (A)
5 Alphabet Announces First Quarter 2026 Results — Alphabet — 2026-04-29 — https://s206.q4cdn.com/479360582/files/doc_financials/2026/q1/2026q1-alphabet-earnings-release.pdf (B)
6 Microsoft FY26 Q3 Earnings Release — Microsoft — 2026-04-29 — https://www.microsoft.com/en-us/investor/earnings/fy-2026-q3/press-release-webcast (B)
7 Meta Reports First Quarter 2026 Results — Meta Platforms — 2026-04-29 — https://investor.atmeta.com/investor-news/press-release-details/2026/Meta-Reports-First-Quarter-2026-Results/ (B)
8 Adobe Delivers Record Q1 Results — Adobe — 2026-03-12 — https://www.adobe.com/cc-shared/assets/investor-relations/pdfs/21306202/ay45th643t5y46.pdf (B)
9 OpenAI API Pricing: video generation and realtime/audio models — OpenAI — 2026-05-28 accessed — https://developers.openai.com/api/docs/pricing (B)
10 Adobe Investor Summit Q&A, April 2026 — Adobe — 2026-04-21 — https://www.adobe.com/cc-shared/assets/investor-relations/pdfs/adbe-investor-session-summit-2026.pdf (B)
11 GPT-4o System Card — OpenAI — 2024-08-08 — https://cdn.openai.com/gpt-4o-system-card.pdf (B)
12 Sora 2 System Card — OpenAI — 2025-10 — https://cdn.openai.com/pdf/50d5973c-c4ff-4c2d-986f-c72b5d0ff069/sora_2_system_card.pdf (B)
13 Gartner Forecasts Worldwide AI Spending to Grow 47% in 2026 — Gartner — 2026-05-19 — https://www.gartner.com/en/newsroom/press-releases/2026-05-19-gartner-forecasts-worldwide-ai-spending-to-grow-47-percent-in-2026 (A)
14 A Deep Dive Into IDC’s Global AI and Generative AI Spending — IDC — 2024 — https://www.idc.com/resource-center/blog/a-deep-dive-into-idcs-global-ai-and-generative-ai-spending/ (A)
15 Market quote feed for GOOGL/MSFT/META/ADBE/SSTK; U.S. close uses 2026-05-27 16:00 EDT close, PE = close ÷ TTM EPS — StockAnalysis / market data snapshot — 2026-05-28 — https://stockanalysis.com/ (C)
16 Shutterstock Reports Full Year 2025 and Fourth Quarter Financial Results — Shutterstock — 2026-02-17 — https://investor.shutterstock.com/news-releases/news-release-details/shutterstock-reports-full-year-2025-and-fourth-quarter-financial (B)
17 Gemini gets more personal, proactive and powerful — Google — 2025-05-20 — https://blog.google/products-and-platforms/products/gemini/gemini-app-updates-io-2025/ (B)
18 Artificial Intelligence Risk Management Framework 1.0 — NIST — 2023 — https://www.nist.gov/itl/ai-risk-management-framework (A)