模型蒸餾
1. 3 秒看懂
模型蒸餾把 GPT-4o、Claude Sonnet、Gemini Pro 這類大型模型的輸出遷移到 GPT-4o-mini、Claude Haiku、Gemini Flash 或企業自有小模型,投資含義是 2024-2026 年 API 單價從“能力溢價”轉向“單位 token 成本 + 延遲 + 快取命中率”的三變數競爭。1234
2. 3 分鐘產業解釋
蒸餾的產業定義是“教師模型生成 soft target、reasoning trace 或合成樣本,學生模型用更少引數、更低推論成本復現可接受任務表現”,Hinton 等人在 2015 年論文中把該方法表述為把大型模型或 ensemble 的知識壓縮到單模型,Google 2024 年也明確稱 Gemini 1.5 Flash 由 1.5 Pro 通過 distillation 訓練為更快、更高效版本。15
雲端側商業化在 2024 年後進入兩條路線:第一條是 OpenAI 4o-mini/4.1-mini 這類平台內小模型,GPT-4o-mini 釋出價為每 100 萬輸入 token 0.15 美元、輸出 token 0.60 美元,GPT-4.1-mini 最新公開價為輸入 0.40 美元、輸出 1.60 美元;第二條是 Anthropic Claude Haiku 路線,Claude 3.5 Haiku 官方起價為輸入 0.80 美元、輸出 4.00 美元,並通過 prompt caching 最高降低 90% 重複上下文成本、Message Batches 再降低 50% 批處理成本。2346
財務傳導不是“訓練成本立刻消失”,而是“同一應用呼叫量 × 單 token 價格 × 快取/批處理折扣 × GPU 利用率”重定價,2025 年 Microsoft Cloud 營收已達 1,689 億美元、Alphabet Google Cloud 營收達 546 億美元、AWS 營收達 1,287 億美元,說明蒸餾的邊際收益會優先體現在雲端 API 與企業 Copilot 的毛利率防守,而不是單獨揭露為“蒸餾營收”。789
3. 15 分鐘專家深入
蒸餾的技術核心是把教師模型的分佈資訊、鏈式推論、工具呼叫軌跡或人工偏好評估轉成學生模型的訓練訊號;與簡單 fine-tuning 相比,蒸餾的目標不是記住 1 個垂直資料集,而是在 10 萬到數千萬級樣本上壓縮“答案分佈 + 風格 + 拒答邊界 + 工具選擇”,因此它同時影響訓練資料、API 產品、推論晶片和雲端毛利率。110
OpenAI 的路線更像平台化閉環,2024-10 釋出的 API Model Distillation 把 Stored Completions、Evals、Fine-tuning 串成 3 步流程,企業可以先用大型模型生成高質量輸出,再用 Evals 衡量小模型差距,最後把較低成本模型微調到生產閾值;這使 GPT-4o-mini 與 GPT-4.1-mini 不只是“低價 API”,而是企業把高頻、低風險任務從旗艦模型遷移到學生模型的預設承接層。410
Anthropic 的 Haiku 路線更強調延遲與工作負載切分,Claude 3.5 Haiku 定位為最快模型層,輸入/輸出價格低於 Sonnet 但高於 GPT-4o-mini,實際競爭力需要把 prompt caching、batch discount 與質量差異一起算;如果客戶上下文重複率達到 70%、快取讀成本下降 90%,則長上下文客服、程式碼庫問答、內部知識庫檢索的有效輸入成本會低於名義價 70% 以上,但輸出 token 與質量回退仍會限制複雜 agent 的遷移比例。36
可計算口徑應拆成 6 個變數:AI 應用請求量 × 平均輸入 token × 輸入單價 × (1 - 緩存摺扣) + AI 應用請求量 × 平均輸出 token × 輸出單價 = 推論營收,再用 推論營收 × 模型毛利率 - 增量訓練/評測成本 = 毛利貢獻 對映到雲端廠獲利;由於 OpenAI、Anthropic、Google DeepMind 與 Meta 均未揭露 GPT-4o-mini、Haiku、Flash、Llama 蒸餾專項營收,所有份額、毛利率與學生模型遷移率只能作為情景假設,不能寫成已揭露事實。2345
4. 技術原理
經典蒸餾使用教師模型 logits 的溫度縮放,把 hard label 之外的類別間相似度傳給學生模型;LLM 場景把這一邏輯擴充套件為 4 類資料:教師答案、教師推論步驟、教師偏好排序、教師生成的合成訓練集,每 1 類都可能降低學生模型在特定任務上的樣本需求,但也會放大教師偏見、幻覺和許可證風險。111
GPT-4o-mini/Claude Haiku 路線的工程瓶頸不在“能否壓縮”,而在“壓縮後是否低於 SLA 閾值”。企業上線通常要求 3 個量化門檻:質量分數相對教師下降不超過 3-5pct、P95 延遲下降 30% 以上、有效 token 成本下降 50% 以上;若任一門檻不達標,路由器會把任務回退到教師模型,蒸餾收益只會停留在離線實驗。2310
5. 上游依賴 / 下游影響
上游依賴
- 教師模型能力決定學生上限,OpenAI GPT-4o-mini 釋出時揭露 MMLU 82.0%、HumanEval 87.2%,因此其 2024 年定位已從“便宜聊天”升級為“多數輕中任務預設模型”。2
- 評測與資料閉環決定遷移率,OpenAI Model Distillation 把 Stored Completions、Evals、Fine-tuning 組合成平台能力,說明蒸餾的商業化至少需要 3 個系統而非 1 個小模型。10
- GPU 與推論編譯棧決定單位成本,學生模型引數更少通常降低視訊記憶體與延遲,但 KV cache、長上下文、工具呼叫和批處理利用率仍會影響實際毛利率。1112
下游影響
- 雲端 API:2025 年 AWS、Google Cloud、Microsoft Cloud 營收分別達到 1,287 億美元、546 億美元、1,689 億美元,任何 10% 級別推論成本下降都會優先反映在雲端毛利率與價格競爭,而非單獨產品線揭露。789
- 企業 SaaS:客服、搜尋、程式碼助手、BI 摘要等高頻低風險場景會先從旗艦模型遷到 mini/Haiku/Flash,複雜規劃和高價值決策仍保留教師模型兜底。235
- 開源生態:Meta Llama 3.1 把 405B 模型作為合成數據生成與模型蒸餾基礎,說明開源小模型的成本壓力會倒逼閉源 API 降價或增加企業級工具鏈粘性。12
6. 技術路線對比表
| 路線 | 速率 | 典型功耗 / 成本 | 距離或維度 | 標準成熟度 | 量產機率 2026 | 主要受益公司 | 反證指標 |
|---|---|---|---|---|---|---|---|
| 平台 mini 模型 | GPT-4o-mini 輸入 $0.15/MTok、輸出 $0.60/MTok | 相對 GPT-4o API 名義價下降約 90%+ | 雲端 API 低延遲任務 | OpenAI API 已商業化 | 90% | OpenAI、Microsoft | 企業 Evals 相對教師下降超過 5pct,或 P95 延遲未降 30% |
| Haiku / Flash 快速層 | Claude 3.5 Haiku 輸入 $0.80/MTok、輸出 $4.00/MTok | prompt caching 最高 90% 成本節省、batch 50% 節省 | 長上下文、批處理、客服 | Anthropic / Google API 已商業化 | 85% | Anthropic、Amazon、Google | 快取命中率低於 40%,有效成本高於 GPT-4o-mini 2 倍 |
| 企業私有學生模型 | 7B-70B 引數區間為主 | GPU 租賃 + 微調成本待揭露 | 私有資料、合規場景 | MLOps 方案成熟,質量分散 | 60% | Microsoft、Amazon、Databricks、Snowflake | 質量低於閉源小模型 5pct 以上或運維成本高於 API |
| 開源大教師蒸餾 | Llama 405B 生成合成資料 | 訓練成本高、邊際推論成本可控 | 開源權重、行業模型 | Meta 405B/70B/8B 已釋出 | 55% | Meta、雲端 GPU、開源平台 | 資料許可證或 benchmark 汙染導致企業採購受阻 |
| 端側小模型壓縮 | Phi-3 mini 3.8B 引數、3.3T token 訓練 | 低功耗終端推論,雲端營收替代風險 | PC/手機/邊緣裝置 | Microsoft Phi 系列已開源 | 40% | Microsoft、Apple、Qualcomm | 端側 NPU 可用率低於 30% 或隱私收益不足以抵消質量差距 |
7. 關鍵指標(5-7 項 + 怎麼追)
- 有效 token 成本:按
輸入價 × (1 - 緩存摺扣) + 輸出價月度追蹤,若 GPT-4o-mini 與 Haiku 有效成本差距連續 2 個季度大於 2 倍,價格彈性會壓制高價小模型份額。236 - 質量保真度:按企業 Evals 分數追蹤,若學生模型相對教師低 3pct 以內,客服/摘要/檢索任務可遷移率上升;若低 5pct 以上,回退率會侵蝕節省。10
- P95 延遲:按 API dashboard 或雲端監控追蹤,若 P95 延遲下降 30% 以上,互動式 agent 與客服場景遷移率提高;若僅下降 10% 以內,蒸餾無法支撐價格溢價。34
- 快取命中率:按系統日誌追蹤,Anthropic prompt caching 最高 90% 節省只有在重複上下文足夠高時兌現,低於 40% 命中率會把 Haiku 重新暴露在名義價競爭中。6
- 教師呼叫佔比:按
教師 token / 總 token追蹤,若從 60% 降到 30%,雲端客戶 COGS 下降方向明確;若長期高於 50%,說明任務複雜度仍壓制學生模型替代。10 - GPU 利用率:按 batch size、KV cache 命中和 tokens/s 追蹤,若 tokens/s 提升 2 倍但價格下降 4 倍,雲端廠毛利率會被價格競爭部分轉移給客戶。411
- 合規與資料授權:按訓練資料來源和客戶合同追蹤,若教師輸出不能用於訓練學生,企業私有蒸餾 TAM 會低於平台內閉環。1012
8. 可算傳導表
口徑:下表為 2026E 情景模型,TAM 指三家公司雲端平台內可服務 AI 推論 token 消費額,不代表公司揭露的蒸餾專項營收;美股估值使用 2026-05-27 16:00 EDT 已結算收盤價,市值按行情源 shares × close 近似,PE 使用 quote-feed TTM EPS 口徑。20
| 驅動變數 | Microsoft | Alphabet | Amazon | 公式 / 口徑 |
|---|---|---|---|---|
| 2025 雲端營收基數 | Microsoft Cloud 1,689 億美元 | Google Cloud 546 億美元 | AWS 1,287 億美元 | 公司揭露雲端營收基數789 |
| 2026E AI 推論 TAM | 84.5 億美元 = 1,689 × 5.0% | 27.3 億美元 = 546 × 5.0% | 64.4 億美元 = 1,287 × 5.0% | 情景假設:雲端營收 5% 與 AI 推論/API/Copilot 相關 |
| 學生模型出貨 / 呼叫量 | 11.8 萬億 token = 84.5 × 35% ÷ $2.5/MTok | 4.4 萬億 token = 27.3 × 40% ÷ $2.5/MTok | 7.7 萬億 token = 64.4 × 30% ÷ $2.5/MTok | TAM × 遷移率 ÷ ASP,ASP 為情景假設 |
| ASP | $2.5/MTok 混合價 | $2.5/MTok 混合價 | $2.5/MTok 混合價 | 情景假設:輸入/輸出、快取、batch 後的 blended ASP |
| 份額 / 遷移率 | 35% | 40% | 30% | 情景假設:mini/Flash/Haiku/私有小模型遷移率 |
| → 學生模型營收 | 29.6 億美元 = 11.8T token × $2.5/MTok | 10.9 億美元 = 4.4T token × $2.5/MTok | 19.3 億美元 = 7.7T token × $2.5/MTok | 出貨 token × ASP |
| 毛利率橋 | FY2025 gross margin 68.8% | FY2025 consolidated gross margin 58.8% | FY2025 AWS operating margin 35.5% | 公司口徑;模型專項 GM 待揭露789 |
| → 毛利貢獻 | 20.4 億美元 = 29.6 × 68.8% | 6.4 億美元 = 10.9 × 58.8% | 6.9 億美元 = 19.3 × 35.5% | 學生模型營收 × 可用毛利/經營獲利率口徑 |
| PE TTM | 24.8x | 29.7x | 31.7x | 2026-05-27 16:00 EDT close,USD,TTM EPS20 |
| → 估值敏感度 | 357 億美元 = 20.4 × 75%稅後 × 24.8 | 142 億美元 = 6.4 × 75%稅後 × 29.7 | 164 億美元 = 6.9 × 75%稅後 × 31.7 | 毛利貢獻 × 75%稅後留存 × PE |
9. 同業硬指標對比表
| 公司 | 營收 | 增速 | GM | 淨利 | FCF margin | 客戶集中度 | 技術代際 | PE TTM | 反證條件 |
|---|---|---|---|---|---|---|---|---|---|
| Microsoft | FY2025 2,817 億美元 [MSFT] | +15% | 68.8% | 1,018 億美元 | 25.4% | 企業/政府分散,單一客戶未揭露為 10%+ | GPT-4o-mini、4.1-mini、Phi、Azure AI | 24.8x(2026-05-27,USD,close/EPS) | Azure AI 增速低於 Azure 總增速 2 個季度 |
| Alphabet | FY2025 4,028 億美元 [GOOGL] | +15% | 58.8% | 1,306 億美元 [GOOGL] | 18.2% | 廣告客戶高度分散,雲端大客戶未揭露為 10%+ | Gemini Flash/Pro、TPU、Vertex AI | 29.7x(2026-05-27,USD,close/EPS) | Gemini Flash 價格下降但 Google Cloud margin 不升 |
| Amazon | FY2025 7,169 億美元 [AMZN] | +12% | 公司 GM 約 51%;AWS OM 35.5% | 777 億美元 [AMZN] | 2.5% | 零售/雲端客戶分散,AWS 大客戶未揭露為 10%+ | Bedrock、Trainium、Claude Haiku 託管 | 31.7x(2026-05-27,USD,close/EPS) | Bedrock 模型選擇增加但 AWS AI attach 率不升 |
| Meta | FY2025 2,010 億美元 [META] | +22% | 81.8% | 605 億美元 [META] | 22.9% | 廣告主分散,Reality Labs 持續虧損 | Llama 3.1 405B/70B/8B、合成數據蒸餾 | 22.3x(2026-05-27,USD,close/EPS) | Llama 開源擴散未降低廣告推論成本 |
| NVIDIA | FY2026 2,159 億美元 [NVDA] | +65% | 71.0% | 1,049 億美元 [NVDA] | 55.0% | direct customer concentration 高,Q2 FY2026 兩大客戶 23%/16% | Blackwell/Rubin 推論 GPU、TensorRT-LLM | 32.7x(2026-05-27,USD,close/EPS) | 小模型效率提升導致推論 GPU 需求彈性低於訓練 GPU |
10. 投資邏輯 + 業績傳導
模型蒸餾的投資主線是“旗艦模型建立能力上限,小模型承接高頻流量,雲端廠用工具鏈鎖定企業工作負載”。2024-2026 年 GPT-4o-mini、Claude Haiku、Gemini Flash 的價格與延遲競爭會把 AI 應用從 demo 階段推向百萬級日呼叫,受益順序通常是平台 API、雲端推論、企業 SaaS,再傳導到 GPU 與端側 NPU;若學生模型質量回撤超過 5pct 或教師回退率長期高於 50%,蒸餾對毛利率的改善會被路由成本抵消。23510
教師模型能力提升 + 企業呼叫量增長
↓
Stored Completions / synthetic data / Evals
↓
GPT-4o-mini / Claude Haiku / Gemini Flash / 私有學生模型
↓
有效 token 成本下降 40%-70% + P95 延遲下降 30%+
↓
雲端 AI 營收池 × 學生遷移率 × 毛利率
↓
稅後獲利 × PE = 蒸餾主題估值敏感度
11. 常見誤讀糾偏
誤讀 1:蒸餾等於把大型模型複製成小模型,成本必然下降 90%
實際情況:GPT-4o-mini 名義輸入價較旗艦模型顯著更低,但企業實際成本還取決於輸出長度、快取命中率、教師回退率和 Evals 維護成本,若 50% 請求仍回退教師模型,則系統級節省通常低於單模型價格降幅。2410
證據:OpenAI 把 distillation 產品設計為 Stored Completions、Evals、Fine-tuning 三件套,說明上線成本至少包含資料生成、質量評測和微調迭代 3 個環節。10
誤讀 2:Haiku/mini 只會替代旗艦模型,對 GPU 需求單邊利空
實際情況:小模型會降低單次請求成本,但更低價格通常擴大呼叫量和上下文長度,若 token 需求彈性大於 1,雲端推論 GPU 總需求仍可能上升。2311
證據:Google 對 Gemini 1.5 Flash 的定位是更快、更高效地規模化服務,而不是停止使用 Pro;Meta 也把 405B 模型定位為生成合成資料和蒸餾小模型的上游能力。512
誤讀 3:開源蒸餾會讓閉源 API 失去議價能力
實際情況:開源權重能降低模型選擇門檻,但企業仍需要 SLA、合規、評測、快取、路由和託管安全,雲端廠的議價點會從“模型本體”遷移到“平台工具鏈 + 資料閉環”。1012
證據:OpenAI 的平台內蒸餾與 Anthropic 的 prompt caching/batch discount 都把成本最佳化繫結到 API 工作流,說明閉源廠商仍可通過平台粘性防守價格下行。610
12. 最新事件
- [已發生] 2024-05-14:Google 釋出 Gemini 1.5 Flash,並明確稱其由 1.5 Pro 通過 distillation 訓練而來,目標是更快、更高效地規模化服務。5
- [已發生] 2024-07-18:OpenAI 釋出 GPT-4o-mini,揭露輸入 $0.15/MTok、輸出 $0.60/MTok、MMLU 82.0%,並把其定位為低延遲和高頻呼叫場景。2
- [已發生] 2024-10-01:OpenAI 釋出 API Model Distillation,把 Stored Completions、Evals、Fine-tuning 組合成企業蒸餾流程。10
- [已發生] 2024-10-22:Anthropic 釋出 Claude 3.5 Haiku,揭露輸入 $0.80/MTok、輸出 $4.00/MTok,並強調 prompt caching 與 Message Batches 的成本節省。36
- [展望] 2025-2026:OpenAI API pricing 頁面顯示 GPT-4.1-mini 輸入 $0.40/MTok、輸出 $1.60/MTok,說明 mini 層已從單一 GPT-4o-mini 擴充套件到多代低成本產品線。4
13. 來源 footnotes
1 Distilling the Knowledge in a Neural Network — Hinton, Vinyals, Dean / arXiv — 2015-03-09 — https://arxiv.org/abs/1503.02531 (A)
2 GPT-4o mini: advancing cost-efficient intelligence — OpenAI — 2024-07-18 — https://openai.com/index/gpt-4o-mini-advancing-cost-efficient-intelligence/ (B)
3 Claude 3.5 Haiku — Anthropic — 2024-10 — https://www.anthropic.com/claude/haiku (B)
4 GPT-4.1 mini model and pricing — OpenAI Developers — 2026 crawled — https://developers.openai.com/api/docs/models/gpt-4.1-mini (B)
5 Gemini updates: Flash 1.5, Gemma 2 and Project Astra — Google — 2024-05-14 — https://blog.google/technology/ai/google-gemini-update-flash-ai-assistant-io-2024/ (B)
6 Prompt caching with Claude — Anthropic — 2024-08, GA update 2024-12-17 — https://www.anthropic.com/news/prompt-caching (B)
7 Microsoft FY2025 Form 10-K — Microsoft / SEC — 2025-07 — https://www.sec.gov/Archives/edgar/data/789019/000095017025100235/msft-20250630.htm (A)
8 Alphabet FY2025 Form 10-K — Alphabet / SEC — 2026-02 — https://www.sec.gov/Archives/edgar/data/1652044/000165204426000018/goog-20251231.htm (A)
9 Amazon FY2025 Form 10-K — Amazon / SEC — 2026-02 — https://www.sec.gov/Archives/edgar/data/1018724/000101872426000004/amzn-20251231.htm (A)
10 Model Distillation in the API — OpenAI — 2024-10-01 — https://openai.com/index/api-model-distillation/ (B)
11 Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone — Microsoft Research — 2024 — https://www.microsoft.com/en-us/research/publication/phi-3-technical-report-a-highly-capable-language-model-locally-on-your-phone/ (A)
12 Introducing Llama 3.1: Our most capable models to date — Meta AI — 2024-07-23 — https://ai.meta.com/blog/meta-llama-3-1/ (B)
13 Meta FY2025 Form 10-K — Meta Platforms / SEC — 2026-01 — https://www.sec.gov/Archives/edgar/data/1326801/000162828026003942/meta-20251231.htm (A)
14 NVIDIA Announces Financial Results for Fourth Quarter and Fiscal 2026 — NVIDIA Investor Relations — 2026-02 — https://investor.nvidia.com/news/press-release-details/2026/NVIDIA-Announces-Financial-Results-for-Fourth-Quarter-and-Fiscal-2026/ (B)
15 OpenAI API Pricing — OpenAI — 2026 crawled — https://openai.com/api/pricing/ (B)
16 Claude pricing documentation — Anthropic Docs — 2026 crawled — https://docs.claude.com/en/docs/about-claude/pricing (B)
17 Google Cloud annual revenue disclosure in Alphabet FY2025 10-K — Alphabet / SEC — 2026-02 — https://www.sec.gov/Archives/edgar/data/1652044/000165204426000018/goog-20251231.htm (A)
18 AWS segment disclosure in Amazon FY2025 10-K — Amazon / SEC — 2026-02 — https://www.sec.gov/Archives/edgar/data/1018724/000101872426000004/amzn-20251231.htm (A)
19 Microsoft Cloud revenue disclosure in Microsoft FY2025 10-K — Microsoft / SEC — 2025-07 — https://www.sec.gov/Archives/edgar/data/789019/000095017025100235/msft-20250630.htm (A)
20 Market quote feed for MSFT/GOOGL/AMZN/META/NVDA, close derived from latest quote minus daily change where needed; market cap = shares × 2026-05-27 16:00 EDT close, PE = close / TTM EPS. Classification: 行情資料 (C)