模型蒸馏
1. 3 秒看懂
模型蒸馏把 GPT-4o、Claude Sonnet、Gemini Pro 这类大模型的输出迁移到 GPT-4o-mini、Claude Haiku、Gemini Flash 或企业自有小模型,投资含义是 2024-2026 年 API 单价从“能力溢价”转向“单位 token 成本 + 延迟 + 缓存命中率”的三变量竞争。1234
2. 3 分钟产业解释
蒸馏的产业定义是“教师模型生成 soft target、reasoning trace 或合成样本,学生模型用更少参数、更低推理成本复现可接受任务表现”,Hinton 等人在 2015 年论文中把该方法表述为把大模型或 ensemble 的知识压缩到单模型,Google 2024 年也明确称 Gemini 1.5 Flash 由 1.5 Pro 通过 distillation 训练为更快、更高效版本。15
云侧商业化在 2024 年后进入两条路线:第一条是 OpenAI 4o-mini/4.1-mini 这类平台内小模型,GPT-4o-mini 发布价为每 100 万输入 token 0.15 美元、输出 token 0.60 美元,GPT-4.1-mini 最新公开价为输入 0.40 美元、输出 1.60 美元;第二条是 Anthropic Claude Haiku 路线,Claude 3.5 Haiku 官方起价为输入 0.80 美元、输出 4.00 美元,并通过 prompt caching 最高降低 90% 重复上下文成本、Message Batches 再降低 50% 批处理成本。2346
财务传导不是“训练成本立刻消失”,而是“同一应用调用量 × 单 token 价格 × 缓存/批处理折扣 × GPU 利用率”重定价,2025 年 Microsoft Cloud 收入已达 1,689 亿美元、Alphabet Google Cloud 收入达 546 亿美元、AWS 收入达 1,287 亿美元,说明蒸馏的边际收益会优先体现在云 API 与企业 Copilot 的毛利率防守,而不是单独披露为“蒸馏收入”。789
3. 15 分钟专家深入
蒸馏的技术核心是把教师模型的分布信息、链式推理、工具调用轨迹或人工偏好评估转成学生模型的训练信号;与简单 fine-tuning 相比,蒸馏的目标不是记住 1 个垂直数据集,而是在 10 万到数千万级样本上压缩“答案分布 + 风格 + 拒答边界 + 工具选择”,因此它同时影响训练数据、API 产品、推理芯片和云毛利率。110
OpenAI 的路线更像平台化闭环,2024-10 发布的 API Model Distillation 把 Stored Completions、Evals、Fine-tuning 串成 3 步流程,企业可以先用大模型生成高质量输出,再用 Evals 衡量小模型差距,最后把较低成本模型微调到生产阈值;这使 GPT-4o-mini 与 GPT-4.1-mini 不只是“低价 API”,而是企业把高频、低风险任务从旗舰模型迁移到学生模型的默认承接层。410
Anthropic 的 Haiku 路线更强调延迟与工作负载切分,Claude 3.5 Haiku 定位为最快模型层,输入/输出价格低于 Sonnet 但高于 GPT-4o-mini,实际竞争力需要把 prompt caching、batch discount 与质量差异一起算;如果客户上下文重复率达到 70%、缓存读成本下降 90%,则长上下文客服、代码库问答、内部知识库检索的有效输入成本会低于名义价 70% 以上,但输出 token 与质量回退仍会限制复杂 agent 的迁移比例。36
可计算口径应拆成 6 个变量:AI 应用请求量 × 平均输入 token × 输入单价 × (1 - 缓存折扣) + AI 应用请求量 × 平均输出 token × 输出单价 = 推理收入,再用 推理收入 × 模型毛利率 - 增量训练/评测成本 = 毛利贡献 映射到云厂利润;由于 OpenAI、Anthropic、Google DeepMind 与 Meta 均未披露 GPT-4o-mini、Haiku、Flash、Llama 蒸馏专项收入,所有份额、毛利率与学生模型迁移率只能作为情景假设,不能写成已披露事实。2345
4. 技术原理
经典蒸馏使用教师模型 logits 的温度缩放,把 hard label 之外的类别间相似度传给学生模型;LLM 场景把这一逻辑扩展为 4 类数据:教师答案、教师推理步骤、教师偏好排序、教师生成的合成训练集,每 1 类都可能降低学生模型在特定任务上的样本需求,但也会放大教师偏见、幻觉和许可证风险。111
GPT-4o-mini/Claude Haiku 路线的工程瓶颈不在“能否压缩”,而在“压缩后是否低于 SLA 阈值”。企业上线通常要求 3 个量化门槛:质量分数相对教师下降不超过 3-5pct、P95 延迟下降 30% 以上、有效 token 成本下降 50% 以上;若任一门槛不达标,路由器会把任务回退到教师模型,蒸馏收益只会停留在离线实验。2310
5. 上游依赖 / 下游影响
上游依赖
- 教师模型能力决定学生上限,OpenAI GPT-4o-mini 发布时披露 MMLU 82.0%、HumanEval 87.2%,因此其 2024 年定位已从“便宜聊天”升级为“多数轻中任务默认模型”。2
- 评测与数据闭环决定迁移率,OpenAI Model Distillation 把 Stored Completions、Evals、Fine-tuning 组合成平台能力,说明蒸馏的商业化至少需要 3 个系统而非 1 个小模型。10
- GPU 与推理编译栈决定单位成本,学生模型参数更少通常降低显存与延迟,但 KV cache、长上下文、工具调用和批处理利用率仍会影响实际毛利率。1112
下游影响
- 云 API:2025 年 AWS、Google Cloud、Microsoft Cloud 收入分别达到 1,287 亿美元、546 亿美元、1,689 亿美元,任何 10% 级别推理成本下降都会优先反映在云毛利率与价格竞争,而非单独产品线披露。789
- 企业 SaaS:客服、搜索、代码助手、BI 摘要等高频低风险场景会先从旗舰模型迁到 mini/Haiku/Flash,复杂规划和高价值决策仍保留教师模型兜底。235
- 开源生态:Meta Llama 3.1 把 405B 模型作为合成数据生成与模型蒸馏基础,说明开源小模型的成本压力会倒逼闭源 API 降价或增加企业级工具链粘性。12
6. 技术路线对比表
| 路线 | 速率 | 典型功耗 / 成本 | 距离或维度 | 标准成熟度 | 量产概率 2026 | 主要受益公司 | 反证指标 |
|---|---|---|---|---|---|---|---|
| 平台 mini 模型 | GPT-4o-mini 输入 $0.15/MTok、输出 $0.60/MTok | 相对 GPT-4o API 名义价下降约 90%+ | 云 API 低延迟任务 | OpenAI API 已商业化 | 90% | OpenAI、Microsoft | 企业 Evals 相对教师下降超过 5pct,或 P95 延迟未降 30% |
| Haiku / Flash 快速层 | Claude 3.5 Haiku 输入 $0.80/MTok、输出 $4.00/MTok | prompt caching 最高 90% 成本节省、batch 50% 节省 | 长上下文、批处理、客服 | Anthropic / Google API 已商业化 | 85% | Anthropic、Amazon、Google | 缓存命中率低于 40%,有效成本高于 GPT-4o-mini 2 倍 |
| 企业私有学生模型 | 7B-70B 参数区间为主 | GPU 租赁 + 微调成本待披露 | 私有数据、合规场景 | MLOps 方案成熟,质量分散 | 60% | Microsoft、Amazon、Databricks、Snowflake | 质量低于闭源小模型 5pct 以上或运维成本高于 API |
| 开源大教师蒸馏 | Llama 405B 生成合成数据 | 训练成本高、边际推理成本可控 | 开源权重、行业模型 | Meta 405B/70B/8B 已发布 | 55% | Meta、云 GPU、开源平台 | 数据许可证或 benchmark 污染导致企业采购受阻 |
| 端侧小模型压缩 | Phi-3 mini 3.8B 参数、3.3T token 训练 | 低功耗终端推理,云收入替代风险 | PC/手机/边缘设备 | Microsoft Phi 系列已开源 | 40% | Microsoft、Apple、Qualcomm | 端侧 NPU 可用率低于 30% 或隐私收益不足以抵消质量差距 |
7. 关键指标(5-7 项 + 怎么追)
- 有效 token 成本:按
输入价 × (1 - 缓存折扣) + 输出价月度跟踪,若 GPT-4o-mini 与 Haiku 有效成本差距连续 2 个季度大于 2 倍,价格弹性会压制高价小模型份额。236 - 质量保真度:按企业 Evals 分数追踪,若学生模型相对教师低 3pct 以内,客服/摘要/检索任务可迁移率上升;若低 5pct 以上,回退率会侵蚀节省。10
- P95 延迟:按 API dashboard 或云监控追踪,若 P95 延迟下降 30% 以上,交互式 agent 与客服场景迁移率提高;若仅下降 10% 以内,蒸馏无法支撑价格溢价。34
- 缓存命中率:按系统日志追踪,Anthropic prompt caching 最高 90% 节省只有在重复上下文足够高时兑现,低于 40% 命中率会把 Haiku 重新暴露在名义价竞争中。6
- 教师调用占比:按
教师 token / 总 token追踪,若从 60% 降到 30%,云客户 COGS 下降方向明确;若长期高于 50%,说明任务复杂度仍压制学生模型替代。10 - GPU 利用率:按 batch size、KV cache 命中和 tokens/s 追踪,若 tokens/s 提升 2 倍但价格下降 4 倍,云厂毛利率会被价格竞争部分转移给客户。411
- 合规与数据授权:按训练数据来源和客户合同追踪,若教师输出不能用于训练学生,企业私有蒸馏 TAM 会低于平台内闭环。1012
8. 可算传导表
口径:下表为 2026E 情景模型,TAM 指三家公司云平台内可服务 AI 推理 token 消费额,不代表公司披露的蒸馏专项收入;美股估值使用 2026-05-27 16:00 EDT 已结算收盘价,市值按行情源 shares × close 近似,PE 使用 quote-feed TTM EPS 口径。20
| 驱动变量 | Microsoft | Alphabet | Amazon | 公式 / 口径 |
|---|---|---|---|---|
| 2025 云收入基数 | Microsoft Cloud 1,689 亿美元 | Google Cloud 546 亿美元 | AWS 1,287 亿美元 | 公司披露云收入基数789 |
| 2026E AI 推理 TAM | 84.5 亿美元 = 1,689 × 5.0% | 27.3 亿美元 = 546 × 5.0% | 64.4 亿美元 = 1,287 × 5.0% | 情景假设:云收入 5% 与 AI 推理/API/Copilot 相关 |
| 学生模型出货 / 调用量 | 11.8 万亿 token = 84.5 × 35% ÷ $2.5/MTok | 4.4 万亿 token = 27.3 × 40% ÷ $2.5/MTok | 7.7 万亿 token = 64.4 × 30% ÷ $2.5/MTok | TAM × 迁移率 ÷ ASP,ASP 为情景假设 |
| ASP | $2.5/MTok 混合价 | $2.5/MTok 混合价 | $2.5/MTok 混合价 | 情景假设:输入/输出、缓存、batch 后的 blended ASP |
| 份额 / 迁移率 | 35% | 40% | 30% | 情景假设:mini/Flash/Haiku/私有小模型迁移率 |
| → 学生模型收入 | 29.6 亿美元 = 11.8T token × $2.5/MTok | 10.9 亿美元 = 4.4T token × $2.5/MTok | 19.3 亿美元 = 7.7T token × $2.5/MTok | 出货 token × ASP |
| 毛利率桥 | FY2025 gross margin 68.8% | FY2025 consolidated gross margin 58.8% | FY2025 AWS operating margin 35.5% | 公司口径;模型专项 GM 待披露789 |
| → 毛利贡献 | 20.4 亿美元 = 29.6 × 68.8% | 6.4 亿美元 = 10.9 × 58.8% | 6.9 亿美元 = 19.3 × 35.5% | 学生模型收入 × 可用毛利/经营利润率口径 |
| PE TTM | 24.8x | 29.7x | 31.7x | 2026-05-27 16:00 EDT close,USD,TTM EPS20 |
| → 估值敏感度 | 357 亿美元 = 20.4 × 75%税后 × 24.8 | 142 亿美元 = 6.4 × 75%税后 × 29.7 | 164 亿美元 = 6.9 × 75%税后 × 31.7 | 毛利贡献 × 75%税后留存 × PE |
9. 同业硬指标对比表
| 公司 | 收入 | 增速 | GM | 净利 | FCF margin | 客户集中度 | 技术代际 | PE TTM | 反证条件 |
|---|---|---|---|---|---|---|---|---|---|
| Microsoft | FY2025 2,817 亿美元 [MSFT] | +15% | 68.8% | 1,018 亿美元 | 25.4% | 企业/政府分散,单一客户未披露为 10%+ | GPT-4o-mini、4.1-mini、Phi、Azure AI | 24.8x(2026-05-27,USD,close/EPS) | Azure AI 增速低于 Azure 总增速 2 个季度 |
| Alphabet | FY2025 4,028 亿美元 [GOOGL] | +15% | 58.8% | 1,306 亿美元 [GOOGL] | 18.2% | 广告客户高度分散,云大客户未披露为 10%+ | Gemini Flash/Pro、TPU、Vertex AI | 29.7x(2026-05-27,USD,close/EPS) | Gemini Flash 价格下降但 Google Cloud margin 不升 |
| Amazon | FY2025 7,169 亿美元 [AMZN] | +12% | 公司 GM 约 51%;AWS OM 35.5% | 777 亿美元 [AMZN] | 2.5% | 零售/云客户分散,AWS 大客户未披露为 10%+ | Bedrock、Trainium、Claude Haiku 托管 | 31.7x(2026-05-27,USD,close/EPS) | Bedrock 模型选择增加但 AWS AI attach 率不升 |
| Meta | FY2025 2,010 亿美元 [META] | +22% | 81.8% | 605 亿美元 [META] | 22.9% | 广告主分散,Reality Labs 持续亏损 | Llama 3.1 405B/70B/8B、合成数据蒸馏 | 22.3x(2026-05-27,USD,close/EPS) | Llama 开源扩散未降低广告推理成本 |
| NVIDIA | FY2026 2,159 亿美元 [NVDA] | +65% | 71.0% | 1,049 亿美元 [NVDA] | 55.0% | direct customer concentration 高,Q2 FY2026 两大客户 23%/16% | Blackwell/Rubin 推理 GPU、TensorRT-LLM | 32.7x(2026-05-27,USD,close/EPS) | 小模型效率提升导致推理 GPU 需求弹性低于训练 GPU |
10. 投资逻辑 + 业绩传导
模型蒸馏的投资主线是“旗舰模型建立能力上限,小模型承接高频流量,云厂用工具链锁定企业工作负载”。2024-2026 年 GPT-4o-mini、Claude Haiku、Gemini Flash 的价格与延迟竞争会把 AI 应用从 demo 阶段推向百万级日调用,受益顺序通常是平台 API、云推理、企业 SaaS,再传导到 GPU 与端侧 NPU;若学生模型质量回撤超过 5pct 或教师回退率长期高于 50%,蒸馏对毛利率的改善会被路由成本抵消。23510
教师模型能力提升 + 企业调用量增长
↓
Stored Completions / synthetic data / Evals
↓
GPT-4o-mini / Claude Haiku / Gemini Flash / 私有学生模型
↓
有效 token 成本下降 40%-70% + P95 延迟下降 30%+
↓
云 AI 收入池 × 学生迁移率 × 毛利率
↓
税后利润 × PE = 蒸馏主题估值敏感度
11. 常见误读纠偏
误读 1:蒸馏等于把大模型复制成小模型,成本必然下降 90%
实际情况:GPT-4o-mini 名义输入价较旗舰模型显著更低,但企业实际成本还取决于输出长度、缓存命中率、教师回退率和 Evals 维护成本,若 50% 请求仍回退教师模型,则系统级节省通常低于单模型价格降幅。2410
证据:OpenAI 把 distillation 产品设计为 Stored Completions、Evals、Fine-tuning 三件套,说明上线成本至少包含数据生成、质量评测和微调迭代 3 个环节。10
误读 2:Haiku/mini 只会替代旗舰模型,对 GPU 需求单边利空
实际情况:小模型会降低单次请求成本,但更低价格通常扩大调用量和上下文长度,若 token 需求弹性大于 1,云推理 GPU 总需求仍可能上升。2311
证据:Google 对 Gemini 1.5 Flash 的定位是更快、更高效地规模化服务,而不是停止使用 Pro;Meta 也把 405B 模型定位为生成合成数据和蒸馏小模型的上游能力。512
误读 3:开源蒸馏会让闭源 API 失去议价能力
实际情况:开源权重能降低模型选择门槛,但企业仍需要 SLA、合规、评测、缓存、路由和托管安全,云厂的议价点会从“模型本体”迁移到“平台工具链 + 数据闭环”。1012
证据:OpenAI 的平台内蒸馏与 Anthropic 的 prompt caching/batch discount 都把成本优化绑定到 API 工作流,说明闭源厂商仍可通过平台粘性防守价格下行。610
12. 最新事件
- [已发生] 2024-05-14:Google 发布 Gemini 1.5 Flash,并明确称其由 1.5 Pro 通过 distillation 训练而来,目标是更快、更高效地规模化服务。5
- [已发生] 2024-07-18:OpenAI 发布 GPT-4o-mini,披露输入 $0.15/MTok、输出 $0.60/MTok、MMLU 82.0%,并把其定位为低延迟和高频调用场景。2
- [已发生] 2024-10-01:OpenAI 发布 API Model Distillation,把 Stored Completions、Evals、Fine-tuning 组合成企业蒸馏流程。10
- [已发生] 2024-10-22:Anthropic 发布 Claude 3.5 Haiku,披露输入 $0.80/MTok、输出 $4.00/MTok,并强调 prompt caching 与 Message Batches 的成本节省。36
- [指引] 2025-2026:OpenAI API pricing 页面显示 GPT-4.1-mini 输入 $0.40/MTok、输出 $1.60/MTok,说明 mini 层已从单一 GPT-4o-mini 扩展到多代低成本产品线。4
13. 来源 footnotes
1 Distilling the Knowledge in a Neural Network — Hinton, Vinyals, Dean / arXiv — 2015-03-09 — https://arxiv.org/abs/1503.02531 (A)
2 GPT-4o mini: advancing cost-efficient intelligence — OpenAI — 2024-07-18 — https://openai.com/index/gpt-4o-mini-advancing-cost-efficient-intelligence/ (B)
3 Claude 3.5 Haiku — Anthropic — 2024-10 — https://www.anthropic.com/claude/haiku (B)
4 GPT-4.1 mini model and pricing — OpenAI Developers — 2026 crawled — https://developers.openai.com/api/docs/models/gpt-4.1-mini (B)
5 Gemini updates: Flash 1.5, Gemma 2 and Project Astra — Google — 2024-05-14 — https://blog.google/technology/ai/google-gemini-update-flash-ai-assistant-io-2024/ (B)
6 Prompt caching with Claude — Anthropic — 2024-08, GA update 2024-12-17 — https://www.anthropic.com/news/prompt-caching (B)
7 Microsoft FY2025 Form 10-K — Microsoft / SEC — 2025-07 — https://www.sec.gov/Archives/edgar/data/789019/000095017025100235/msft-20250630.htm (A)
8 Alphabet FY2025 Form 10-K — Alphabet / SEC — 2026-02 — https://www.sec.gov/Archives/edgar/data/1652044/000165204426000018/goog-20251231.htm (A)
9 Amazon FY2025 Form 10-K — Amazon / SEC — 2026-02 — https://www.sec.gov/Archives/edgar/data/1018724/000101872426000004/amzn-20251231.htm (A)
10 Model Distillation in the API — OpenAI — 2024-10-01 — https://openai.com/index/api-model-distillation/ (B)
11 Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone — Microsoft Research — 2024 — https://www.microsoft.com/en-us/research/publication/phi-3-technical-report-a-highly-capable-language-model-locally-on-your-phone/ (A)
12 Introducing Llama 3.1: Our most capable models to date — Meta AI — 2024-07-23 — https://ai.meta.com/blog/meta-llama-3-1/ (B)
13 Meta FY2025 Form 10-K — Meta Platforms / SEC — 2026-01 — https://www.sec.gov/Archives/edgar/data/1326801/000162828026003942/meta-20251231.htm (A)
14 NVIDIA Announces Financial Results for Fourth Quarter and Fiscal 2026 — NVIDIA Investor Relations — 2026-02 — https://investor.nvidia.com/news/press-release-details/2026/NVIDIA-Announces-Financial-Results-for-Fourth-Quarter-and-Fiscal-2026/ (B)
15 OpenAI API Pricing — OpenAI — 2026 crawled — https://openai.com/api/pricing/ (B)
16 Claude pricing documentation — Anthropic Docs — 2026 crawled — https://docs.claude.com/en/docs/about-claude/pricing (B)
17 Google Cloud annual revenue disclosure in Alphabet FY2025 10-K — Alphabet / SEC — 2026-02 — https://www.sec.gov/Archives/edgar/data/1652044/000165204426000018/goog-20251231.htm (A)
18 AWS segment disclosure in Amazon FY2025 10-K — Amazon / SEC — 2026-02 — https://www.sec.gov/Archives/edgar/data/1018724/000101872426000004/amzn-20251231.htm (A)
19 Microsoft Cloud revenue disclosure in Microsoft FY2025 10-K — Microsoft / SEC — 2025-07 — https://www.sec.gov/Archives/edgar/data/789019/000095017025100235/msft-20250630.htm (A)
20 Market quote feed for MSFT/GOOGL/AMZN/META/NVDA, close derived from latest quote minus daily change where needed; market cap = shares × 2026-05-27 16:00 EDT close, PE = close / TTM EPS. Classification: 行情数据 (C)