模型層 開放閱讀

計算最優模型

Compute-Optimal Model

概念 ID
compute-optimal-model
更新時間
2026-05-29
來源數量
待補

計算最優模型 (Compute-Optimal Model)

3 秒看懂

給定固定的算力預算,模型引數量和訓練資料量之間存在一個最優配比。 不是越大越好,也不是資料越多越好——而是二者要”年增率例長大”。DeepMind 2022 年的 Chinchilla 論文用實驗證明:一個 700 億引數模型(Chinchilla)用更多資料訓練,全面碾壓了 2800 億引數但資料不足的 Gopher,而兩者消耗的算力基本相同。

3 分鐘產業解釋

在 2020–2021 年的大型模型軍備競賽中,行業預設邏輯是”引數量就是戰鬥力”:GPT-3(175B)、PaLM(540B)、Gopher(280B)一路堆引數。但 DeepMind 在 2022 年 3 月發表的 Training Compute-Optimal Large Language Models(通稱 Chinchilla 論文)打破了這一認知:

核心結論: 在固定的計算預算 $C$(單位:FLOPs)下,模型引數數量 $N$ 和訓練資料的 token 數量 $D$ 應當近似等比例擴充套件。傳統做法是把 $N$ 推到極大、但 $D$ 遠遠不夠,導致模型嚴重”欠訓練”(undertrained)。

產業含義:

維度舊範式(大引數少資料)計算最優範式
模型大小越大越好與資料同步增長
訓練資料通常 300B tokens 量級需要 1T+ tokens 量級
推論成本極高(大型模型部署貴)更小模型、推論更便宜
資料價值被低估成為核心資產

這意味著:與其訓練一個”吃不飽”的萬億引數模型,不如用同等算力訓練一個更小但”吃飽”的模型。後者不僅效果更好,推論成本還更低。這一發現直接推動了行業對高質量訓練資料的爭奪,也解釋了為何 Meta 的 Llama 系列(中等引數 + 海量資料)在開源界大獲成功。

15 分鐘專家深入

論文溯源:兩篇奠基性工作

計算最優模型的理論基礎來源於兩篇關鍵論文:

  1. Kaplan et al. (2020), Scaling Laws for Neural Language Models, OpenAI

    • 首次系統性地量化了語言模型效能(以交叉熵損失 $L$ 衡量)與模型引數 $N$、資料量 $D$、計算量 $C$ 之間的冪律關係
    • 核心發現:$L$ 與 $N$、$D$、$C$ 均呈冪律衰減,且在固定 $C$ 下,應優先擴大 $N$(即更大型模型 + 相對少資料)
    • 這一結論直接催生了 GPT-3(175B 引數、300B tokens)的訓練策略
  2. Hoffmann et al. (2022), Training Compute-Optimal Large Language Models, DeepMind(即 Chinchilla 論文)

    • 修正了 Kaplan 的結論:$N$ 和 $D$ 應近似等比例擴充套件
    • 訓練了 Chinchilla(70B 引數,1.4T tokens),在相同計算預算下全面優於 Gopher(280B 引數,~300B tokens)
    • 關鍵修正原因:Kaplan 實驗中學習率排程方案未隨模型大小充分調整,導致小模型被低估

三條獨立驗證路徑

Chinchilla 論文通過三種獨立方法交叉驗證了最優配比:

  • 方法一 (固定模型,變化資料): 對不同大小的模型分別訓練多種資料量,尋找每個模型的損失拐點
  • 方法二 (IsoFLOP curves): 固定計算預算(FLOPs),變化模型大小,找到該預算下的最優 $N$
  • 方法三 (引數化損失擬合): 將損失建模為 L(N, D) = E + \frac{A}{N^\alpha} + \frac{B}{D^\beta},擬合引數後解析求最優解

三條路徑均指向一致結論:最優配比下 N \propto C^{a}, D \propto C^{b},且 a \approx b

關鍵數字(來自 Chinchilla 論文原文)

模型引數量訓練 tokens訓練 FLOPs(估算)效能表現
Gopher~280B~300B~5 \times 10^{23} [DeepMind 官方]基線
Chinchilla~70B~1.4T~5 \times 10^{23} [DeepMind 官方]全面優於 Gopher

⚠️ 以上 FLOPs 數字來自 Chinchilla 論文正文表格,兩者聲稱消耗的訓練計算量基本持平。

關於最優 token/引數比率

Chinchilla 論文的核心實踐建議可簡化為:

D_{\text{opt}} \approx 20 \times N

即:每個模型引數大約需要 20 個訓練 token(資料來源:Chinchilla 論文 Figure 4 及附錄擬合結果)。

這意味著:

  • 7B 模型 → 需要 ~140B tokens(約 1400 億)
  • 70B 模型 → 需要 ~1.4T tokens(約 1.4 萬億)
  • 175B 模型 → 需要 ~3.5T tokens(約 3.5 萬億)

⚠️ 注意:後續研究(如 Meta 在 Llama 系列的技術報告)發現,實際訓練中可以顯著超過這個比率而繼續獲得收益,即”過訓練”(overtraining)在推論成本敏感的場景下也是合理的。20:1 是計算最優的理論點,不是訓練收益的硬上限。


技術原理

核心數學架構

目標: 在總計算量 $C$ 約束下,最小化模型在測試集上的期望損失 $L$。

引數化損失函式(Hoffmann et al.):

L(N, D) = E + A / N^α + B / D^β

其中:

  • E —— 不可約損失(irreducible loss),即資料本身的熵下界
  • A / N^α —— 模型容量不足導致的損失(引數不足項)
  • B / D^β —— 訓練資料不足導致的損失(資料不足項)
  • α ≈ 0.34, β ≈ 0.28(Chinchilla 論文擬合值 [Hoffmann et al., Table A1])
  • A, B, E 為擬合常數

計算約束:

C ≈ 6 × N × D     (單位:FLOPs)

這是近似公式:每個 token 的前向+反向傳播約消耗 6N FLOPs(來源:常見估算,見 Kaplan et al. 2020 Appendix F)。嚴格值取決於架構細節和是否包含注意力 FLOPs 的完整計算。

求解過程(簡化版):

在 $C = 6ND$ 約束下,用拉格朗日乘子法對 $L(N, D)$ 求極值:

∂L/∂N + λ · ∂(C - 6ND)/∂N = 0
∂L/∂D + λ · ∂(C - 6ND)/∂D = 0

求解可得最優 N_{\text{opt}}D_{\text{opt}} 與 $C$ 的關係為冪律:

N_opt(C) ∝ C^a       其中 a = β / (α + β) ≈ 0.46
D_opt(C) ∝ C^b       其中 b = α / (α + β) ≈ 0.54

由於 \alpha \approx \beta(兩者差異不大),所以 a \approx b \approx 0.5,即 $N$ 和 $D$ 近似等比例擴充套件

直覺理解

  損失 L

    │╲
    │ ╲  ← 僅增加引數(資料不足時收益遞減快)
    │  ╲
    │   ╲───────── 實際達到的損失
    │    ╲
    │     ╲─────────── 計算最優路徑(N和D同步增長)
    │      ╲
    │       ╲
    │        ╲────── 僅增加資料(引數不足時收益遞減快)
    └─────────────────── 計算量 C →
  • 如果只增 $N$ 不增 $D$:引數越來越多但”吃不飽”,每個引數沒有足夠的資料來充分學習
  • 如果只增 $D$ 不增 $N$:資料多但模型容量不足,無法吸收資訊
  • 最優路徑:兩者同步擴充套件,讓每個引數都”吃得剛剛好”

與 Kaplan et al. 的關鍵分歧

維度Kaplan et al. (2020)Hoffmann et al. (2022)
最優 $N$ 擴充套件N \propto C^{0.73}(偏重大引數)N \propto C^{0.50}(等比例)
最優 $D$ 擴充套件D \propto C^{0.27}(資料增長慢)D \propto C^{0.50}(等比例)
10× 計算增長時引數約 5.4×, 資料約 1.9×引數約 3.2×, 資料約 3.2×
分歧原因學習率排程方案固定,小模型未充分調參更充分的超參搜尋,尤其對小模型

⚠️ Kaplan 論文中指數的具體數值來自原文擬合結果,具體小數位可能因擬合方式略有差異。Hoffmann 論文的修正結論對實踐影響更大。


技術演進史

時間事件意義
2017Vaswani et al. 提出 Transformer奠定大型模型基礎架構
2020.01Kaplan et al. (OpenAI) 釋出 Scaling Laws 論文首次系統量化 N、D、C 的冪律關係;結論偏向優先擴大 N
2020.06GPT-3 (175B) 釋出,訓練資料 ~300B tokens體現了 Kaplan 範式:超大引數 + 相對少資料
2021.12Gopher (280B, ~300B tokens) 釋出DeepMind 繼續走大引數路線
2022.03Chinchilla 論文發表 (Hoffmann et al.)提出計算最優配比,修正 Kaplan 結論
2022.03Chinchilla (70B, 1.4T tokens) 效果超越 Gopher實驗驗證計算最優範式
2022訓練資料集開始急速擴張行業轉向追求更多高質量資料
2023.02LLaMA (7B–65B) 釋出,資料 1T–1.4T tokensMeta 大規模應用”過訓練”策略,小模型 + 海量資料
2023.07Llama 2 釋出,資料量進一步擴大進一步證明中等模型 + 大量資料的可行性
2024Llama 3 (8B / 70B) 訓練資料超 15T tokens過訓練程度遠超 Chinchilla 最優點,但推論收益顯著
2024–2025資料牆問題凸顯:高質量文本資料趨於枯竭行業開始探索合成資料、多模態資料等新資料來源

技術路線對比(量化表)

“計算最優”vs”過訓練”vs”欠訓練”三種策略對比

維度欠訓練 (Under-trained)計算最優 (Compute-Optimal)過訓練 (Overtrained)
代表案例Gopher (280B, ~300B tokens)Chinchilla (70B, 1.4T tokens)Llama 3 8B (~15T tokens) [Meta 技術報告]
Token/引數比~1:1~20:1~1875:1(極度過訓練)
訓練目標最大化模型容量訓練 FLOPs 利用率最優最小化推論成本
訓練 FLOPs基線低(小模型)
推論成本極高(部署大型模型)中等極低(小模型高效)
適用場景早期探索,引數即實力學術基準,FLOPs 受限產品部署,推論量大
核心權衡浪費算力在未充分利用的引數上訓練成本最優用更多訓練資料換取更低推論成本

不同規模下的 Chinchilla 最優配比估算

模型引數 $N$最優 $D$(~20N)訓練 FLOPs($6ND$)等效 GPU 訓練時長估算
1B~20B tokens~1.2 \times 10^{20}數小時(數百 A100)[估算]
7B~140B tokens~5.9 \times 10^{21}數天(千卡級)[估算]
70B~1.4T tokens~5.9 \times 10^{23}數週(萬卡級)[估算]
175B~3.5T tokens~3.7 \times 10^{24}數月(萬卡級+)[估算]
500B~10T tokens~3.0 \times 10^{25}需要超大規模叢集 [估算]

⚠️ GPU 訓練時長為粗略量級估算,取決於叢集規模、硬體型號、MFU(模型 FLOPs 利用率)等因素。實際訓練中 MFU 通常在 30%–55% 範圍 [公開技術報告估算]。


上下游

上游:計算最優模型的”原材料”

┌──────────────────────────────────────────────────┐
│                   上 遊 供 應 鏈                    │
├──────────┬──────────┬──────────┬─────────────────┤
│  算力硬體  │  訓練資料  │  演算法架構  │   人才 / 組織    │
│          │          │          │                 │
│ NVIDIA   │ 網際網路文本 │ PyTorch  │ DeepMind        │
│  H100/   │ (Common  │ JAX      │ OpenAI          │
│  H200    │  Crawl等) │ Megatron │ Meta FAIR       │
│          │          │ -LM      │                 │
│ AMD      │ 書籍/論文 │ DeepSpeed│ 各大實驗室       │
│  MI300   │ 程式碼資料  │          │                 │
│          │          │ FSDP     │                 │
│ TPU      │ 合成數據  │          │                 │
│ (Google) │          │          │                 │
└──────────┴──────────┴──────────┴─────────────────┘

下游:計算最優理論影響的決策

┌───────────────────────────────────────────────────────┐
│                    下 遊 影 響 鏈                        │
├────────────┬──────────────┬───────────────────────────┤
│  模型訓練策略 │  推論部署決策  │  資料產業                 │
│            │              │                           │
│ 選擇多大的   │ 部署小模型    │ 高質量資料集價值飆升        │
│ 模型?訓練   │ 還是大型模型?  │ 資料採集/清洗/合成成為      │
│ 多少資料?   │              │ 核心競爭力                │
│            │ 過訓練小模型   │                           │
│ 預算怎麼分配 │ 獲得最優      │ 合成數據生成(如用大型模型    │
│ 給 N 和 D? │ 推論價效比    │ 生成訓練資料)             │
└────────────┴──────────────┴───────────────────────────┘

關鍵指標

指標含義計算最優視角
$N$ (引數量)模型可學習引數總數不是越大越好,需與 $D$ 匹配
$D$ (訓練 tokens)訓練使用的總 token 數通常被低估,計算最優要求 D \approx 20N
$C$ (訓練 FLOPs)訓練消耗的總浮點運算量C \approx 6ND
$L$ (損失)測試集交叉熵損失衡量”吃飽了沒有”
N_{\text{opt}}, D_{\text{opt}}給定 $C$ 下的最優引數和資料量論文核心產出
Token-to-Parameter Ratio$D/N$,訓練 token 與引數之比計算最優點約 20;實際產品常遠超此值
MFU (Model FLOPs Utilization)實際 FLOPs / 硬體峰值 FLOPs影響 $C$ 的實際成本,通常 30%–55%
推論 FLOPs / token每生成一個 token 的計算量約 $2N$(前向傳播),直接決定部署成本

供需與市場資料

訓練資料需求激增

計算最優理論最直接的市場影響是:訓練資料需求爆發式增長

指標資料 / 估算來源
Llama 1 訓練資料1T–1.4T tokens(不同尺寸)Meta 公開技術報告
Llama 2 訓練資料約 2T tokensMeta 公開技術報告
Llama 3 訓練資料超過 15T tokensMeta 公開技術報告
全球公開可用文本資料(估算)約 10T–30T tokens [行業估算]多個學術/行業估算,差異較大
合成數據市場規模預測快速增長,但精確預測 [未充分揭露]

算力需求

  • Chinchilla 範式下,訓練一個”剛好吃飽”的 175B 模型約需 3.7 \times 10^{24} FLOPs
  • 以 H100(~3 \times 10^{15} FP16 FLOPS 峰值)估算,MFU 按 40% 計算:
    • 需約 \frac{3.7 \times 10^{24}}{3 \times 10^{15} \times 0.4} \approx 3.1 \times 10^{9} GPU-seconds ≈ 約 98 GPU-years [粗略估算]
    • 萬卡叢集約需 ~36 天 [粗略估算]
  • 實際行業趨勢: 主要實驗室的訓練計算量已遠超計算最優要求,因為推論成本最佳化驅動了”過訓練”

資料牆問題

  訓練資料需求
  (tokens)
      │          ╱ Llama 3 15T+
      │        ╱
      │      ╱     ← 需求增長曲線
      │    ╱
      │  ╱
      │╱─────────────── 可用高質量文本上限 [行業估算: ~10-30T tokens]

      └──────────────────────→ 時間 (2022 → 2025+)

高質量文本資料面臨”天花板”。行業應對策略包括:

  • 合成數據: 用已訓練的大型模型生成訓練資料(自我改進、蒸餾)
  • 多模態資料: 引入影像、影片、音訊等非文本資料
  • 資料質量最佳化: 資料篩選、去重、質量過濾技術
  • 資料重複訓練: 部分資料重複使用(但存在退化風險)

代表公司與資本對映

公司 / 組織與計算最優的關係資本對映邏輯
DeepMind (Google)Chinchilla 論文原創方;Gemini 系列應用了相關理論Alphabet (GOOGL):算力 + 資料 + 演算法全棧
Meta (FAIR)Llama 系列是”過訓練”策略的標杆實踐META:開源生態 + 海量使用者資料
OpenAIKaplan et al. 原始 Scaling Laws 來源;GPT 系列訓練策略持續迭代非上市,通過微軟 (MSFT) 間接受益
NVIDIA計算最優理論意味著”需要更多高效 GPU 做訓練和推論”NVDA:算力軍火商,無論最優還是過訓練都需要 GPU
資料公司(如 Common Crawl, Scale AI 等)訓練資料價值因計算最優理論被重新評估資料標註、清洗、合成成為關鍵環節
雲端廠商(AWS, Azure, GCP)訓練和推論算力平台雲端運算營收增長

投資啟示矩陣

                    訓練階段受益        推論階段受益
                   ┌─────────────┬─────────────────┐
  計算最優(等比)    │  資料供應商   │   推論晶片(中等)  │
                   │  算力供應商   │                 │
                   ├─────────────┼─────────────────┤
  過訓練(小模型    │  資料供應商   │   推論晶片(最大)  │
  +海量資料)       │  算力(訓練)   │   邊緣部署       │
                   └─────────────┴─────────────────┘

過訓練趨勢意味著:前期訓練投入更大(利好訓練算力/資料),但部署時模型更小(利好推論晶片和邊緣部署)。


投資邏輯

核心邏輯鏈條

  1. 計算最優理論 → 資料價值重估

    • 訓練資料從”成本項”變為”核心競爭力”
    • 高質量資料集的擁有者/生產者獲得結構性優勢
    • 合成數據技術成為重要補充
  2. 過訓練趨勢 → 推論成本下降 → 應用爆發

    • 行業實踐中已普遍採用遠超 20:1 的 token/引數比
    • 更小的模型意味著更便宜的推論,推動 AI 應用普及
    • 邊緣部署(手機、PC 端 AI)成為可能
  3. 資料牆 → 新資料範式 → 技術投資機會

    • 真實文本資料趨於枯竭,合成數據 / 多模態資料需求上升
    • 資料質量篩選工具、資料管理平台價值提升
    • 具備獨家資料來源的公司(如擁有使用者互動資料的平台)具有壁壘

風險因素

  • Scaling Laws 是否持續有效? 在更長序列、推論(test-time compute)場景下,傳統 scaling law 可能需要修正
  • 合成數據質量天花板: 模型生成的資料可能導致”模型坍縮”(model collapse),限制合成數據的擴充套件能力
  • 演算法突破可能改變範式: 如 Mixture-of-Experts (MoE)、推論時計算(test-time compute)等新範式可能重新定義”計算最優”的含義

常見誤讀糾偏

❌ 誤讀一:“Chinchilla 法則意味著模型不能超過 70B 引數”

糾偏: Chinchilla 法則說的是給定算力預算下的最優配比,而非模型大小的上限。如果你的算力預算足夠大(如 10 倍於 Chinchilla),最優模型可以是數百 B 引數。法則限制的是引數與資料的比例關係,不是引數本身。此外,如果目標是最小化推論成本(而非訓練成本),過訓練策略下模型可以遠小於 Chinchilla 最優點。

❌ 誤讀二:“D_opt ≈ 20N 是一個硬性定律”

糾偏: 20:1 是 Chinchilla 論文在特定條件下擬合的經驗比率,不是物理定律。後續多個研究(包括 Meta 的 Llama 系列實踐)表明:

  • 更大比率(過訓練)仍然帶來持續收益,只是邊際收益遞減
  • 資料質量、資料多樣性等因素會影響最優比率
  • 不同架構(如 MoE vs Dense)可能有不同的最優比率
  • 推論密集型應用場景下,最優訓練點會偏向過訓練方向

❌ 誤讀三:“計算最優 = 訓練最省錢”

糾偏: 計算最優指的是固定算力下獲得最低訓練損失,但實際工程決策需要考慮全生命週期成本,包括:

  • 推論成本(通常遠大於訓練成本,因為推論持續執行)
  • 迭代成本(模型需要反覆訓練多個版本)
  • 延遲要求(小模型推論更快) 因此,實際生產中幾乎沒有人嚴格按 20:1 訓練,而是根據部署需求選擇過訓練策略。

❌ 誤讀四:“Scaling Laws 是精確的物理定律”

糾偏: Scaling Laws 是在特定資料分佈、架構、超參搜尋策略下的經驗擬合結果,其冪律指數和最優配比會隨:

  • 模型架構變化(Transformer 變體、MoE 等)
  • 資料分佈變化
  • 超參搜尋的充分程度
  • 評估指標的選擇 而發生變化。它提供的是量級參考和趨勢判斷,不是精確預測工具。

學習路徑

入門級(1–2 小時)

  1. 閱讀本文,理解基本概念
  2. 閱讀 Lilian Weng 的部落格文章 Large Transformer Model Inference Optimization(搜尋 “lilianweng scaling laws”),對 Scaling Laws 有直觀瞭解

進階級(1 天)

  1. 閱讀 Hoffmann et al. (2022) 原文,重點關注 Section 1-3(三種驗證方法)
  2. 對比閱讀 Kaplan et al. (2020),理解兩次結論的差異及原因
  3. 閱讀 Meta LLaMA (2023) 技術報告,理解實際工業界如何偏離 Chinchilla 最優點

專家級(持續追蹤)

  1. 關注 Chinchilla’s Hungry 相關後續研究(關於資料重複訓練的影響)
  2. 追蹤 test-time compute scaling(如 OpenAI o1 系列的推論時計算擴充套件)
  3. 關注 MoE 架構下的 scaling law 修正
  4. 閱讀 Epoch AI 等機構對 scaling law 持續性的分析報告

一句話總結

計算最優模型揭示了一個樸素但深刻的道理:在固定算力下,模型引數和訓練資料應當年增率例增長——但實踐中行業已從”訓練最優”轉向”推論最優”,用更多資料訓練更小的模型以降低部署成本。


延伸閱讀與來源

  1. Hoffmann, J. et al. (2022). Training Compute-Optimal Large Language Models. arXiv:2203.15556 — 核心論文,必讀
  2. Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models. arXiv:2001.08361 — 原始 Scaling Laws 論文
  3. Touvron, H. et al. (2023). LLaMA: Open and Efficient Foundation Language Models. arXiv:2302.13971 — 過訓練策略的工業實踐
  4. Meta AI (2024). The Llama 3 Herd of Models. arXiv:2407.21783 — 進一步擴大訓練資料的實踐
  5. Muennighoff, N. et al. (2023). Scaling Data-Constrained Language Models. arXiv:2305.16264 — 資料受限下的 scaling law 修正
  6. Epoch AI (持續更新). Scaling Laws Literature Review. epochai.org — 對 scaling law 相關文獻的持續追蹤
  7. Lilian Weng. How to Train Really Large Models on Many GPUs? lilianweng.github.io — 分散式訓練與計算分配的工程視角

本文基於公開論文與技術報告撰寫,具體數字以原始論文為準。市場資料與估算均已標註口徑,投資決策請結合最新資訊獨立判斷。

source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型