模型層 含付費深讀

模型蒸餾

Model Distillation

概念 ID
distillation
更新時間
2026-05-28
來源數量
20

模型蒸餾

1. 3 秒看懂

模型蒸餾把 GPT-4o、Claude Sonnet、Gemini Pro 這類大型模型的輸出遷移到 GPT-4o-mini、Claude Haiku、Gemini Flash 或企業自有小模型,投資含義是 2024-2026 年 API 單價從“能力溢價”轉向“單位 token 成本 + 延遲 + 快取命中率”的三變數競爭。1234

2. 3 分鐘產業解釋

蒸餾的產業定義是“教師模型生成 soft target、reasoning trace 或合成樣本,學生模型用更少引數、更低推論成本復現可接受任務表現”,Hinton 等人在 2015 年論文中把該方法表述為把大型模型或 ensemble 的知識壓縮到單模型,Google 2024 年也明確稱 Gemini 1.5 Flash 由 1.5 Pro 通過 distillation 訓練為更快、更高效版本。15

雲端側商業化在 2024 年後進入兩條路線:第一條是 OpenAI 4o-mini/4.1-mini 這類平台內小模型,GPT-4o-mini 釋出價為每 100 萬輸入 token 0.15 美元、輸出 token 0.60 美元,GPT-4.1-mini 最新公開價為輸入 0.40 美元、輸出 1.60 美元;第二條是 Anthropic Claude Haiku 路線,Claude 3.5 Haiku 官方起價為輸入 0.80 美元、輸出 4.00 美元,並通過 prompt caching 最高降低 90% 重複上下文成本、Message Batches 再降低 50% 批處理成本。2346

財務傳導不是“訓練成本立刻消失”,而是“同一應用呼叫量 × 單 token 價格 × 快取/批處理折扣 × GPU 利用率”重定價,2025 年 Microsoft Cloud 營收已達 1,689 億美元、Alphabet Google Cloud 營收達 546 億美元、AWS 營收達 1,287 億美元,說明蒸餾的邊際收益會優先體現在雲端 API 與企業 Copilot 的毛利率防守,而不是單獨揭露為“蒸餾營收”。789

3. 15 分鐘專家深入

蒸餾的技術核心是把教師模型的分佈資訊、鏈式推論、工具呼叫軌跡或人工偏好評估轉成學生模型的訓練訊號;與簡單 fine-tuning 相比,蒸餾的目標不是記住 1 個垂直資料集,而是在 10 萬到數千萬級樣本上壓縮“答案分佈 + 風格 + 拒答邊界 + 工具選擇”,因此它同時影響訓練資料、API 產品、推論晶片和雲端毛利率。110

OpenAI 的路線更像平台化閉環,2024-10 釋出的 API Model Distillation 把 Stored Completions、Evals、Fine-tuning 串成 3 步流程,企業可以先用大型模型生成高質量輸出,再用 Evals 衡量小模型差距,最後把較低成本模型微調到生產閾值;這使 GPT-4o-mini 與 GPT-4.1-mini 不只是“低價 API”,而是企業把高頻、低風險任務從旗艦模型遷移到學生模型的預設承接層。410

Anthropic 的 Haiku 路線更強調延遲與工作負載切分,Claude 3.5 Haiku 定位為最快模型層,輸入/輸出價格低於 Sonnet 但高於 GPT-4o-mini,實際競爭力需要把 prompt caching、batch discount 與質量差異一起算;如果客戶上下文重複率達到 70%、快取讀成本下降 90%,則長上下文客服、程式碼庫問答、內部知識庫檢索的有效輸入成本會低於名義價 70% 以上,但輸出 token 與質量回退仍會限制複雜 agent 的遷移比例。36

可計算口徑應拆成 6 個變數:AI 應用請求量 × 平均輸入 token × 輸入單價 × (1 - 緩存摺扣) + AI 應用請求量 × 平均輸出 token × 輸出單價 = 推論營收,再用 推論營收 × 模型毛利率 - 增量訓練/評測成本 = 毛利貢獻 對映到雲端廠獲利;由於 OpenAI、Anthropic、Google DeepMind 與 Meta 均未揭露 GPT-4o-mini、Haiku、Flash、Llama 蒸餾專項營收,所有份額、毛利率與學生模型遷移率只能作為情景假設,不能寫成已揭露事實。2345

4. 技術原理

經典蒸餾使用教師模型 logits 的溫度縮放,把 hard label 之外的類別間相似度傳給學生模型;LLM 場景把這一邏輯擴充套件為 4 類資料:教師答案、教師推論步驟、教師偏好排序、教師生成的合成訓練集,每 1 類都可能降低學生模型在特定任務上的樣本需求,但也會放大教師偏見、幻覺和許可證風險。111

GPT-4o-mini/Claude Haiku 路線的工程瓶頸不在“能否壓縮”,而在“壓縮後是否低於 SLA 閾值”。企業上線通常要求 3 個量化門檻:質量分數相對教師下降不超過 3-5pct、P95 延遲下降 30% 以上、有效 token 成本下降 50% 以上;若任一門檻不達標,路由器會把任務回退到教師模型,蒸餾收益只會停留在離線實驗。2310

5. 上游依賴 / 下游影響

上游依賴

  • 教師模型能力決定學生上限,OpenAI GPT-4o-mini 釋出時揭露 MMLU 82.0%、HumanEval 87.2%,因此其 2024 年定位已從“便宜聊天”升級為“多數輕中任務預設模型”。2
  • 評測與資料閉環決定遷移率,OpenAI Model Distillation 把 Stored Completions、Evals、Fine-tuning 組合成平台能力,說明蒸餾的商業化至少需要 3 個系統而非 1 個小模型。10
  • GPU 與推論編譯棧決定單位成本,學生模型引數更少通常降低視訊記憶體與延遲,但 KV cache、長上下文、工具呼叫和批處理利用率仍會影響實際毛利率。1112

下游影響

  • 雲端 API:2025 年 AWS、Google Cloud、Microsoft Cloud 營收分別達到 1,287 億美元、546 億美元、1,689 億美元,任何 10% 級別推論成本下降都會優先反映在雲端毛利率與價格競爭,而非單獨產品線揭露。789
  • 企業 SaaS:客服、搜尋、程式碼助手、BI 摘要等高頻低風險場景會先從旗艦模型遷到 mini/Haiku/Flash,複雜規劃和高價值決策仍保留教師模型兜底。235
  • 開源生態:Meta Llama 3.1 把 405B 模型作為合成數據生成與模型蒸餾基礎,說明開源小模型的成本壓力會倒逼閉源 API 降價或增加企業級工具鏈粘性。12

6. 技術路線對比表

路線速率典型功耗 / 成本距離或維度標準成熟度量產機率 2026主要受益公司反證指標
平台 mini 模型GPT-4o-mini 輸入 $0.15/MTok、輸出 $0.60/MTok相對 GPT-4o API 名義價下降約 90%+雲端 API 低延遲任務OpenAI API 已商業化90%OpenAI、Microsoft企業 Evals 相對教師下降超過 5pct,或 P95 延遲未降 30%
Haiku / Flash 快速層Claude 3.5 Haiku 輸入 $0.80/MTok、輸出 $4.00/MTokprompt caching 最高 90% 成本節省、batch 50% 節省長上下文、批處理、客服Anthropic / Google API 已商業化85%Anthropic、Amazon、Google快取命中率低於 40%,有效成本高於 GPT-4o-mini 2 倍
企業私有學生模型7B-70B 引數區間為主GPU 租賃 + 微調成本待揭露私有資料、合規場景MLOps 方案成熟,質量分散60%Microsoft、Amazon、Databricks、Snowflake質量低於閉源小模型 5pct 以上或運維成本高於 API
開源大教師蒸餾Llama 405B 生成合成資料訓練成本高、邊際推論成本可控開源權重、行業模型Meta 405B/70B/8B 已釋出55%Meta、雲端 GPU、開源平台資料許可證或 benchmark 汙染導致企業採購受阻
端側小模型壓縮Phi-3 mini 3.8B 引數、3.3T token 訓練低功耗終端推論,雲端營收替代風險PC/手機/邊緣裝置Microsoft Phi 系列已開源40%Microsoft、Apple、Qualcomm端側 NPU 可用率低於 30% 或隱私收益不足以抵消質量差距

7. 關鍵指標(5-7 項 + 怎麼追)

  • 有效 token 成本:按 輸入價 × (1 - 緩存摺扣) + 輸出價 月度追蹤,若 GPT-4o-mini 與 Haiku 有效成本差距連續 2 個季度大於 2 倍,價格彈性會壓制高價小模型份額。236
  • 質量保真度:按企業 Evals 分數追蹤,若學生模型相對教師低 3pct 以內,客服/摘要/檢索任務可遷移率上升;若低 5pct 以上,回退率會侵蝕節省。10
  • P95 延遲:按 API dashboard 或雲端監控追蹤,若 P95 延遲下降 30% 以上,互動式 agent 與客服場景遷移率提高;若僅下降 10% 以內,蒸餾無法支撐價格溢價。34
  • 快取命中率:按系統日誌追蹤,Anthropic prompt caching 最高 90% 節省只有在重複上下文足夠高時兌現,低於 40% 命中率會把 Haiku 重新暴露在名義價競爭中。6
  • 教師呼叫佔比:按 教師 token / 總 token 追蹤,若從 60% 降到 30%,雲端客戶 COGS 下降方向明確;若長期高於 50%,說明任務複雜度仍壓制學生模型替代。10
  • GPU 利用率:按 batch size、KV cache 命中和 tokens/s 追蹤,若 tokens/s 提升 2 倍但價格下降 4 倍,雲端廠毛利率會被價格競爭部分轉移給客戶。411
  • 合規與資料授權:按訓練資料來源和客戶合同追蹤,若教師輸出不能用於訓練學生,企業私有蒸餾 TAM 會低於平台內閉環。1012

8. 可算傳導表

口徑:下表為 2026E 情景模型,TAM 指三家公司雲端平台內可服務 AI 推論 token 消費額,不代表公司揭露的蒸餾專項營收;美股估值使用 2026-05-27 16:00 EDT 已結算收盤價,市值按行情源 shares × close 近似,PE 使用 quote-feed TTM EPS 口徑。20

驅動變數MicrosoftAlphabetAmazon公式 / 口徑
2025 雲端營收基數Microsoft Cloud 1,689 億美元Google Cloud 546 億美元AWS 1,287 億美元公司揭露雲端營收基數789
2026E AI 推論 TAM84.5 億美元 = 1,689 × 5.0%27.3 億美元 = 546 × 5.0%64.4 億美元 = 1,287 × 5.0%情景假設:雲端營收 5% 與 AI 推論/API/Copilot 相關
學生模型出貨 / 呼叫量11.8 萬億 token = 84.5 × 35% ÷ $2.5/MTok4.4 萬億 token = 27.3 × 40% ÷ $2.5/MTok7.7 萬億 token = 64.4 × 30% ÷ $2.5/MTokTAM × 遷移率 ÷ ASP,ASP 為情景假設
ASP$2.5/MTok 混合價$2.5/MTok 混合價$2.5/MTok 混合價情景假設:輸入/輸出、快取、batch 後的 blended ASP
份額 / 遷移率35%40%30%情景假設:mini/Flash/Haiku/私有小模型遷移率
→ 學生模型營收29.6 億美元 = 11.8T token × $2.5/MTok10.9 億美元 = 4.4T token × $2.5/MTok19.3 億美元 = 7.7T token × $2.5/MTok出貨 token × ASP
毛利率橋FY2025 gross margin 68.8%FY2025 consolidated gross margin 58.8%FY2025 AWS operating margin 35.5%公司口徑;模型專項 GM 待揭露789
→ 毛利貢獻20.4 億美元 = 29.6 × 68.8%6.4 億美元 = 10.9 × 58.8%6.9 億美元 = 19.3 × 35.5%學生模型營收 × 可用毛利/經營獲利率口徑
PE TTM24.8x29.7x31.7x2026-05-27 16:00 EDT close,USD,TTM EPS20
→ 估值敏感度357 億美元 = 20.4 × 75%稅後 × 24.8142 億美元 = 6.4 × 75%稅後 × 29.7164 億美元 = 6.9 × 75%稅後 × 31.7毛利貢獻 × 75%稅後留存 × PE

9. 同業硬指標對比表

公司營收增速GM淨利FCF margin客戶集中度技術代際PE TTM反證條件
MicrosoftFY2025 2,817 億美元 [MSFT]+15%68.8%1,018 億美元25.4%企業/政府分散,單一客戶未揭露為 10%+GPT-4o-mini、4.1-mini、Phi、Azure AI24.8x(2026-05-27,USD,close/EPS)Azure AI 增速低於 Azure 總增速 2 個季度
AlphabetFY2025 4,028 億美元 [GOOGL]+15%58.8%1,306 億美元 [GOOGL]18.2%廣告客戶高度分散,雲端大客戶未揭露為 10%+Gemini Flash/Pro、TPU、Vertex AI29.7x(2026-05-27,USD,close/EPS)Gemini Flash 價格下降但 Google Cloud margin 不升
AmazonFY2025 7,169 億美元 [AMZN]+12%公司 GM 約 51%;AWS OM 35.5%777 億美元 [AMZN]2.5%零售/雲端客戶分散,AWS 大客戶未揭露為 10%+Bedrock、Trainium、Claude Haiku 託管31.7x(2026-05-27,USD,close/EPS)Bedrock 模型選擇增加但 AWS AI attach 率不升
MetaFY2025 2,010 億美元 [META]+22%81.8%605 億美元 [META]22.9%廣告主分散,Reality Labs 持續虧損Llama 3.1 405B/70B/8B、合成數據蒸餾22.3x(2026-05-27,USD,close/EPS)Llama 開源擴散未降低廣告推論成本
NVIDIAFY2026 2,159 億美元 [NVDA]+65%71.0%1,049 億美元 [NVDA]55.0%direct customer concentration 高,Q2 FY2026 兩大客戶 23%/16%Blackwell/Rubin 推論 GPU、TensorRT-LLM32.7x(2026-05-27,USD,close/EPS)小模型效率提升導致推論 GPU 需求彈性低於訓練 GPU

10. 投資邏輯 + 業績傳導

模型蒸餾的投資主線是“旗艦模型建立能力上限,小模型承接高頻流量,雲端廠用工具鏈鎖定企業工作負載”。2024-2026 年 GPT-4o-mini、Claude Haiku、Gemini Flash 的價格與延遲競爭會把 AI 應用從 demo 階段推向百萬級日呼叫,受益順序通常是平台 API、雲端推論、企業 SaaS,再傳導到 GPU 與端側 NPU;若學生模型質量回撤超過 5pct 或教師回退率長期高於 50%,蒸餾對毛利率的改善會被路由成本抵消。23510

教師模型能力提升 + 企業呼叫量增長

Stored Completions / synthetic data / Evals

GPT-4o-mini / Claude Haiku / Gemini Flash / 私有學生模型

有效 token 成本下降 40%-70% + P95 延遲下降 30%+

雲端 AI 營收池 × 學生遷移率 × 毛利率

稅後獲利 × PE = 蒸餾主題估值敏感度

11. 常見誤讀糾偏

誤讀 1:蒸餾等於把大型模型複製成小模型,成本必然下降 90%

實際情況:GPT-4o-mini 名義輸入價較旗艦模型顯著更低,但企業實際成本還取決於輸出長度、快取命中率、教師回退率和 Evals 維護成本,若 50% 請求仍回退教師模型,則系統級節省通常低於單模型價格降幅。2410

證據:OpenAI 把 distillation 產品設計為 Stored Completions、Evals、Fine-tuning 三件套,說明上線成本至少包含資料生成、質量評測和微調迭代 3 個環節。10

誤讀 2:Haiku/mini 只會替代旗艦模型,對 GPU 需求單邊利空

實際情況:小模型會降低單次請求成本,但更低價格通常擴大呼叫量和上下文長度,若 token 需求彈性大於 1,雲端推論 GPU 總需求仍可能上升。2311

證據:Google 對 Gemini 1.5 Flash 的定位是更快、更高效地規模化服務,而不是停止使用 Pro;Meta 也把 405B 模型定位為生成合成資料和蒸餾小模型的上游能力。512

誤讀 3:開源蒸餾會讓閉源 API 失去議價能力

實際情況:開源權重能降低模型選擇門檻,但企業仍需要 SLA、合規、評測、快取、路由和託管安全,雲端廠的議價點會從“模型本體”遷移到“平台工具鏈 + 資料閉環”。1012

證據:OpenAI 的平台內蒸餾與 Anthropic 的 prompt caching/batch discount 都把成本最佳化繫結到 API 工作流,說明閉源廠商仍可通過平台粘性防守價格下行。610

12. 最新事件

  • [已發生] 2024-05-14:Google 釋出 Gemini 1.5 Flash,並明確稱其由 1.5 Pro 通過 distillation 訓練而來,目標是更快、更高效地規模化服務。5
  • [已發生] 2024-07-18:OpenAI 釋出 GPT-4o-mini,揭露輸入 $0.15/MTok、輸出 $0.60/MTok、MMLU 82.0%,並把其定位為低延遲和高頻呼叫場景。2
  • [已發生] 2024-10-01:OpenAI 釋出 API Model Distillation,把 Stored Completions、Evals、Fine-tuning 組合成企業蒸餾流程。10
  • [已發生] 2024-10-22:Anthropic 釋出 Claude 3.5 Haiku,揭露輸入 $0.80/MTok、輸出 $4.00/MTok,並強調 prompt caching 與 Message Batches 的成本節省。36
  • [展望] 2025-2026:OpenAI API pricing 頁面顯示 GPT-4.1-mini 輸入 $0.40/MTok、輸出 $1.60/MTok,說明 mini 層已從單一 GPT-4o-mini 擴充套件到多代低成本產品線。4

13. 來源 footnotes

1 Distilling the Knowledge in a Neural Network — Hinton, Vinyals, Dean / arXiv — 2015-03-09 — https://arxiv.org/abs/1503.02531 (A)

2 GPT-4o mini: advancing cost-efficient intelligence — OpenAI — 2024-07-18 — https://openai.com/index/gpt-4o-mini-advancing-cost-efficient-intelligence/ (B)

3 Claude 3.5 Haiku — Anthropic — 2024-10 — https://www.anthropic.com/claude/haiku (B)

4 GPT-4.1 mini model and pricing — OpenAI Developers — 2026 crawled — https://developers.openai.com/api/docs/models/gpt-4.1-mini (B)

5 Gemini updates: Flash 1.5, Gemma 2 and Project Astra — Google — 2024-05-14 — https://blog.google/technology/ai/google-gemini-update-flash-ai-assistant-io-2024/ (B)

6 Prompt caching with Claude — Anthropic — 2024-08, GA update 2024-12-17 — https://www.anthropic.com/news/prompt-caching (B)

7 Microsoft FY2025 Form 10-K — Microsoft / SEC — 2025-07 — https://www.sec.gov/Archives/edgar/data/789019/000095017025100235/msft-20250630.htm (A)

8 Alphabet FY2025 Form 10-K — Alphabet / SEC — 2026-02 — https://www.sec.gov/Archives/edgar/data/1652044/000165204426000018/goog-20251231.htm (A)

9 Amazon FY2025 Form 10-K — Amazon / SEC — 2026-02 — https://www.sec.gov/Archives/edgar/data/1018724/000101872426000004/amzn-20251231.htm (A)

10 Model Distillation in the API — OpenAI — 2024-10-01 — https://openai.com/index/api-model-distillation/ (B)

11 Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone — Microsoft Research — 2024 — https://www.microsoft.com/en-us/research/publication/phi-3-technical-report-a-highly-capable-language-model-locally-on-your-phone/ (A)

12 Introducing Llama 3.1: Our most capable models to date — Meta AI — 2024-07-23 — https://ai.meta.com/blog/meta-llama-3-1/ (B)

13 Meta FY2025 Form 10-K — Meta Platforms / SEC — 2026-01 — https://www.sec.gov/Archives/edgar/data/1326801/000162828026003942/meta-20251231.htm (A)

14 NVIDIA Announces Financial Results for Fourth Quarter and Fiscal 2026 — NVIDIA Investor Relations — 2026-02 — https://investor.nvidia.com/news/press-release-details/2026/NVIDIA-Announces-Financial-Results-for-Fourth-Quarter-and-Fiscal-2026/ (B)

15 OpenAI API Pricing — OpenAI — 2026 crawled — https://openai.com/api/pricing/ (B)

16 Claude pricing documentation — Anthropic Docs — 2026 crawled — https://docs.claude.com/en/docs/about-claude/pricing (B)

17 Google Cloud annual revenue disclosure in Alphabet FY2025 10-K — Alphabet / SEC — 2026-02 — https://www.sec.gov/Archives/edgar/data/1652044/000165204426000018/goog-20251231.htm (A)

18 AWS segment disclosure in Amazon FY2025 10-K — Amazon / SEC — 2026-02 — https://www.sec.gov/Archives/edgar/data/1018724/000101872426000004/amzn-20251231.htm (A)

19 Microsoft Cloud revenue disclosure in Microsoft FY2025 10-K — Microsoft / SEC — 2025-07 — https://www.sec.gov/Archives/edgar/data/789019/000095017025100235/msft-20250630.htm (A)

20 Market quote feed for MSFT/GOOGL/AMZN/META/NVDA, close derived from latest quote minus daily change where needed; market cap = shares × 2026-05-27 16:00 EDT close, PE = close / TTM EPS. Classification: 行情資料 (C)

source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型