計算最優模型 (Compute-Optimal Model)
3 秒看懂
給定固定的算力預算,模型引數量和訓練資料量之間存在一個最優配比。 不是越大越好,也不是資料越多越好——而是二者要”年增率例長大”。DeepMind 2022 年的 Chinchilla 論文用實驗證明:一個 700 億引數模型(Chinchilla)用更多資料訓練,全面碾壓了 2800 億引數但資料不足的 Gopher,而兩者消耗的算力基本相同。
3 分鐘產業解釋
在 2020–2021 年的大型模型軍備競賽中,行業預設邏輯是”引數量就是戰鬥力”:GPT-3(175B)、PaLM(540B)、Gopher(280B)一路堆引數。但 DeepMind 在 2022 年 3 月發表的 Training Compute-Optimal Large Language Models(通稱 Chinchilla 論文)打破了這一認知:
核心結論: 在固定的計算預算 $C$(單位:FLOPs)下,模型引數數量 $N$ 和訓練資料的 token 數量 $D$ 應當近似等比例擴充套件。傳統做法是把 $N$ 推到極大、但 $D$ 遠遠不夠,導致模型嚴重”欠訓練”(undertrained)。
產業含義:
| 維度 | 舊範式(大引數少資料) | 計算最優範式 |
|---|---|---|
| 模型大小 | 越大越好 | 與資料同步增長 |
| 訓練資料 | 通常 300B tokens 量級 | 需要 1T+ tokens 量級 |
| 推論成本 | 極高(大型模型部署貴) | 更小模型、推論更便宜 |
| 資料價值 | 被低估 | 成為核心資產 |
這意味著:與其訓練一個”吃不飽”的萬億引數模型,不如用同等算力訓練一個更小但”吃飽”的模型。後者不僅效果更好,推論成本還更低。這一發現直接推動了行業對高質量訓練資料的爭奪,也解釋了為何 Meta 的 Llama 系列(中等引數 + 海量資料)在開源界大獲成功。
15 分鐘專家深入
論文溯源:兩篇奠基性工作
計算最優模型的理論基礎來源於兩篇關鍵論文:
-
Kaplan et al. (2020), Scaling Laws for Neural Language Models, OpenAI
- 首次系統性地量化了語言模型效能(以交叉熵損失 $L$ 衡量)與模型引數 $N$、資料量 $D$、計算量 $C$ 之間的冪律關係
- 核心發現:$L$ 與 $N$、$D$、$C$ 均呈冪律衰減,且在固定 $C$ 下,應優先擴大 $N$(即更大型模型 + 相對少資料)
- 這一結論直接催生了 GPT-3(175B 引數、300B tokens)的訓練策略
-
Hoffmann et al. (2022), Training Compute-Optimal Large Language Models, DeepMind(即 Chinchilla 論文)
- 修正了 Kaplan 的結論:$N$ 和 $D$ 應近似等比例擴充套件
- 訓練了 Chinchilla(70B 引數,1.4T tokens),在相同計算預算下全面優於 Gopher(280B 引數,~300B tokens)
- 關鍵修正原因:Kaplan 實驗中學習率排程方案未隨模型大小充分調整,導致小模型被低估
三條獨立驗證路徑
Chinchilla 論文通過三種獨立方法交叉驗證了最優配比:
- 方法一 (固定模型,變化資料): 對不同大小的模型分別訓練多種資料量,尋找每個模型的損失拐點
- 方法二 (IsoFLOP curves): 固定計算預算(FLOPs),變化模型大小,找到該預算下的最優 $N$
- 方法三 (引數化損失擬合): 將損失建模為
L(N, D) = E + \frac{A}{N^\alpha} + \frac{B}{D^\beta},擬合引數後解析求最優解
三條路徑均指向一致結論:最優配比下 N \propto C^{a}, D \propto C^{b},且 a \approx b。
關鍵數字(來自 Chinchilla 論文原文)
| 模型 | 引數量 | 訓練 tokens | 訓練 FLOPs(估算) | 效能表現 |
|---|---|---|---|---|
| Gopher | ~280B | ~300B | ~5 \times 10^{23} [DeepMind 官方] | 基線 |
| Chinchilla | ~70B | ~1.4T | ~5 \times 10^{23} [DeepMind 官方] | 全面優於 Gopher |
⚠️ 以上 FLOPs 數字來自 Chinchilla 論文正文表格,兩者聲稱消耗的訓練計算量基本持平。
關於最優 token/引數比率
Chinchilla 論文的核心實踐建議可簡化為:
D_{\text{opt}} \approx 20 \times N
即:每個模型引數大約需要 20 個訓練 token(資料來源:Chinchilla 論文 Figure 4 及附錄擬合結果)。
這意味著:
- 7B 模型 → 需要 ~140B tokens(約 1400 億)
- 70B 模型 → 需要 ~1.4T tokens(約 1.4 萬億)
- 175B 模型 → 需要 ~3.5T tokens(約 3.5 萬億)
⚠️ 注意:後續研究(如 Meta 在 Llama 系列的技術報告)發現,實際訓練中可以顯著超過這個比率而繼續獲得收益,即”過訓練”(overtraining)在推論成本敏感的場景下也是合理的。20:1 是計算最優的理論點,不是訓練收益的硬上限。
技術原理
核心數學架構
目標: 在總計算量 $C$ 約束下,最小化模型在測試集上的期望損失 $L$。
引數化損失函式(Hoffmann et al.):
L(N, D) = E + A / N^α + B / D^β
其中:
E—— 不可約損失(irreducible loss),即資料本身的熵下界A / N^α—— 模型容量不足導致的損失(引數不足項)B / D^β—— 訓練資料不足導致的損失(資料不足項)α ≈ 0.34,β ≈ 0.28(Chinchilla 論文擬合值 [Hoffmann et al., Table A1])A,B,E為擬合常數
計算約束:
C ≈ 6 × N × D (單位:FLOPs)
這是近似公式:每個 token 的前向+反向傳播約消耗
6NFLOPs(來源:常見估算,見 Kaplan et al. 2020 Appendix F)。嚴格值取決於架構細節和是否包含注意力 FLOPs 的完整計算。
求解過程(簡化版):
在 $C = 6ND$ 約束下,用拉格朗日乘子法對 $L(N, D)$ 求極值:
∂L/∂N + λ · ∂(C - 6ND)/∂N = 0
∂L/∂D + λ · ∂(C - 6ND)/∂D = 0
求解可得最優 N_{\text{opt}} 和 D_{\text{opt}} 與 $C$ 的關係為冪律:
N_opt(C) ∝ C^a 其中 a = β / (α + β) ≈ 0.46
D_opt(C) ∝ C^b 其中 b = α / (α + β) ≈ 0.54
由於 \alpha \approx \beta(兩者差異不大),所以 a \approx b \approx 0.5,即 $N$ 和 $D$ 近似等比例擴充套件。
直覺理解
損失 L
│
│╲
│ ╲ ← 僅增加引數(資料不足時收益遞減快)
│ ╲
│ ╲───────── 實際達到的損失
│ ╲
│ ╲─────────── 計算最優路徑(N和D同步增長)
│ ╲
│ ╲
│ ╲────── 僅增加資料(引數不足時收益遞減快)
└─────────────────── 計算量 C →
- 如果只增 $N$ 不增 $D$:引數越來越多但”吃不飽”,每個引數沒有足夠的資料來充分學習
- 如果只增 $D$ 不增 $N$:資料多但模型容量不足,無法吸收資訊
- 最優路徑:兩者同步擴充套件,讓每個引數都”吃得剛剛好”
與 Kaplan et al. 的關鍵分歧
| 維度 | Kaplan et al. (2020) | Hoffmann et al. (2022) |
|---|---|---|
| 最優 $N$ 擴充套件 | N \propto C^{0.73}(偏重大引數) | N \propto C^{0.50}(等比例) |
| 最優 $D$ 擴充套件 | D \propto C^{0.27}(資料增長慢) | D \propto C^{0.50}(等比例) |
| 10× 計算增長時 | 引數約 5.4×, 資料約 1.9× | 引數約 3.2×, 資料約 3.2× |
| 分歧原因 | 學習率排程方案固定,小模型未充分調參 | 更充分的超參搜尋,尤其對小模型 |
⚠️ Kaplan 論文中指數的具體數值來自原文擬合結果,具體小數位可能因擬合方式略有差異。Hoffmann 論文的修正結論對實踐影響更大。
技術演進史
| 時間 | 事件 | 意義 |
|---|---|---|
| 2017 | Vaswani et al. 提出 Transformer | 奠定大型模型基礎架構 |
| 2020.01 | Kaplan et al. (OpenAI) 釋出 Scaling Laws 論文 | 首次系統量化 N、D、C 的冪律關係;結論偏向優先擴大 N |
| 2020.06 | GPT-3 (175B) 釋出,訓練資料 ~300B tokens | 體現了 Kaplan 範式:超大引數 + 相對少資料 |
| 2021.12 | Gopher (280B, ~300B tokens) 釋出 | DeepMind 繼續走大引數路線 |
| 2022.03 | Chinchilla 論文發表 (Hoffmann et al.) | 提出計算最優配比,修正 Kaplan 結論 |
| 2022.03 | Chinchilla (70B, 1.4T tokens) 效果超越 Gopher | 實驗驗證計算最優範式 |
| 2022 | 訓練資料集開始急速擴張 | 行業轉向追求更多高質量資料 |
| 2023.02 | LLaMA (7B–65B) 釋出,資料 1T–1.4T tokens | Meta 大規模應用”過訓練”策略,小模型 + 海量資料 |
| 2023.07 | Llama 2 釋出,資料量進一步擴大 | 進一步證明中等模型 + 大量資料的可行性 |
| 2024 | Llama 3 (8B / 70B) 訓練資料超 15T tokens | 過訓練程度遠超 Chinchilla 最優點,但推論收益顯著 |
| 2024–2025 | 資料牆問題凸顯:高質量文本資料趨於枯竭 | 行業開始探索合成資料、多模態資料等新資料來源 |
技術路線對比(量化表)
“計算最優”vs”過訓練”vs”欠訓練”三種策略對比
| 維度 | 欠訓練 (Under-trained) | 計算最優 (Compute-Optimal) | 過訓練 (Overtrained) |
|---|---|---|---|
| 代表案例 | Gopher (280B, ~300B tokens) | Chinchilla (70B, 1.4T tokens) | Llama 3 8B (~15T tokens) [Meta 技術報告] |
| Token/引數比 | ~1:1 | ~20:1 | ~1875:1(極度過訓練) |
| 訓練目標 | 最大化模型容量 | 訓練 FLOPs 利用率最優 | 最小化推論成本 |
| 訓練 FLOPs | 高 | 基線 | 低(小模型) |
| 推論成本 | 極高(部署大型模型) | 中等 | 極低(小模型高效) |
| 適用場景 | 早期探索,引數即實力 | 學術基準,FLOPs 受限 | 產品部署,推論量大 |
| 核心權衡 | 浪費算力在未充分利用的引數上 | 訓練成本最優 | 用更多訓練資料換取更低推論成本 |
不同規模下的 Chinchilla 最優配比估算
| 模型引數 $N$ | 最優 $D$(~20N) | 訓練 FLOPs($6ND$) | 等效 GPU 訓練時長估算 |
|---|---|---|---|
| 1B | ~20B tokens | ~1.2 \times 10^{20} | 數小時(數百 A100)[估算] |
| 7B | ~140B tokens | ~5.9 \times 10^{21} | 數天(千卡級)[估算] |
| 70B | ~1.4T tokens | ~5.9 \times 10^{23} | 數週(萬卡級)[估算] |
| 175B | ~3.5T tokens | ~3.7 \times 10^{24} | 數月(萬卡級+)[估算] |
| 500B | ~10T tokens | ~3.0 \times 10^{25} | 需要超大規模叢集 [估算] |
⚠️ GPU 訓練時長為粗略量級估算,取決於叢集規模、硬體型號、MFU(模型 FLOPs 利用率)等因素。實際訓練中 MFU 通常在 30%–55% 範圍 [公開技術報告估算]。
上下游
上游:計算最優模型的”原材料”
┌──────────────────────────────────────────────────┐
│ 上 遊 供 應 鏈 │
├──────────┬──────────┬──────────┬─────────────────┤
│ 算力硬體 │ 訓練資料 │ 演算法架構 │ 人才 / 組織 │
│ │ │ │ │
│ NVIDIA │ 網際網路文本 │ PyTorch │ DeepMind │
│ H100/ │ (Common │ JAX │ OpenAI │
│ H200 │ Crawl等) │ Megatron │ Meta FAIR │
│ │ │ -LM │ │
│ AMD │ 書籍/論文 │ DeepSpeed│ 各大實驗室 │
│ MI300 │ 程式碼資料 │ │ │
│ │ │ FSDP │ │
│ TPU │ 合成數據 │ │ │
│ (Google) │ │ │ │
└──────────┴──────────┴──────────┴─────────────────┘
下游:計算最優理論影響的決策
┌───────────────────────────────────────────────────────┐
│ 下 遊 影 響 鏈 │
├────────────┬──────────────┬───────────────────────────┤
│ 模型訓練策略 │ 推論部署決策 │ 資料產業 │
│ │ │ │
│ 選擇多大的 │ 部署小模型 │ 高質量資料集價值飆升 │
│ 模型?訓練 │ 還是大型模型? │ 資料採集/清洗/合成成為 │
│ 多少資料? │ │ 核心競爭力 │
│ │ 過訓練小模型 │ │
│ 預算怎麼分配 │ 獲得最優 │ 合成數據生成(如用大型模型 │
│ 給 N 和 D? │ 推論價效比 │ 生成訓練資料) │
└────────────┴──────────────┴───────────────────────────┘
關鍵指標
| 指標 | 含義 | 計算最優視角 |
|---|---|---|
| $N$ (引數量) | 模型可學習引數總數 | 不是越大越好,需與 $D$ 匹配 |
| $D$ (訓練 tokens) | 訓練使用的總 token 數 | 通常被低估,計算最優要求 D \approx 20N |
| $C$ (訓練 FLOPs) | 訓練消耗的總浮點運算量 | C \approx 6ND |
| $L$ (損失) | 測試集交叉熵損失 | 衡量”吃飽了沒有” |
N_{\text{opt}}, D_{\text{opt}} | 給定 $C$ 下的最優引數和資料量 | 論文核心產出 |
| Token-to-Parameter Ratio | $D/N$,訓練 token 與引數之比 | 計算最優點約 20;實際產品常遠超此值 |
| MFU (Model FLOPs Utilization) | 實際 FLOPs / 硬體峰值 FLOPs | 影響 $C$ 的實際成本,通常 30%–55% |
| 推論 FLOPs / token | 每生成一個 token 的計算量 | 約 $2N$(前向傳播),直接決定部署成本 |
供需與市場資料
訓練資料需求激增
計算最優理論最直接的市場影響是:訓練資料需求爆發式增長。
| 指標 | 資料 / 估算 | 來源 |
|---|---|---|
| Llama 1 訓練資料 | 1T–1.4T tokens(不同尺寸) | Meta 公開技術報告 |
| Llama 2 訓練資料 | 約 2T tokens | Meta 公開技術報告 |
| Llama 3 訓練資料 | 超過 15T tokens | Meta 公開技術報告 |
| 全球公開可用文本資料(估算) | 約 10T–30T tokens [行業估算] | 多個學術/行業估算,差異較大 |
| 合成數據市場規模預測 | 快速增長,但精確預測 [未充分揭露] | — |
算力需求
- Chinchilla 範式下,訓練一個”剛好吃飽”的 175B 模型約需
3.7 \times 10^{24}FLOPs - 以 H100(~
3 \times 10^{15}FP16 FLOPS 峰值)估算,MFU 按 40% 計算:- 需約
\frac{3.7 \times 10^{24}}{3 \times 10^{15} \times 0.4} \approx 3.1 \times 10^{9}GPU-seconds ≈ 約 98 GPU-years [粗略估算] - 萬卡叢集約需 ~36 天 [粗略估算]
- 需約
- 實際行業趨勢: 主要實驗室的訓練計算量已遠超計算最優要求,因為推論成本最佳化驅動了”過訓練”
資料牆問題
訓練資料需求
(tokens)
│ ╱ Llama 3 15T+
│ ╱
│ ╱ ← 需求增長曲線
│ ╱
│ ╱
│╱─────────────── 可用高質量文本上限 [行業估算: ~10-30T tokens]
│
└──────────────────────→ 時間 (2022 → 2025+)
高質量文本資料面臨”天花板”。行業應對策略包括:
- 合成數據: 用已訓練的大型模型生成訓練資料(自我改進、蒸餾)
- 多模態資料: 引入影像、影片、音訊等非文本資料
- 資料質量最佳化: 資料篩選、去重、質量過濾技術
- 資料重複訓練: 部分資料重複使用(但存在退化風險)
代表公司與資本對映
| 公司 / 組織 | 與計算最優的關係 | 資本對映邏輯 |
|---|---|---|
| DeepMind (Google) | Chinchilla 論文原創方;Gemini 系列應用了相關理論 | Alphabet (GOOGL):算力 + 資料 + 演算法全棧 |
| Meta (FAIR) | Llama 系列是”過訓練”策略的標杆實踐 | META:開源生態 + 海量使用者資料 |
| OpenAI | Kaplan et al. 原始 Scaling Laws 來源;GPT 系列訓練策略持續迭代 | 非上市,通過微軟 (MSFT) 間接受益 |
| NVIDIA | 計算最優理論意味著”需要更多高效 GPU 做訓練和推論” | NVDA:算力軍火商,無論最優還是過訓練都需要 GPU |
| 資料公司(如 Common Crawl, Scale AI 等) | 訓練資料價值因計算最優理論被重新評估 | 資料標註、清洗、合成成為關鍵環節 |
| 雲端廠商(AWS, Azure, GCP) | 訓練和推論算力平台 | 雲端運算營收增長 |
投資啟示矩陣
訓練階段受益 推論階段受益
┌─────────────┬─────────────────┐
計算最優(等比) │ 資料供應商 │ 推論晶片(中等) │
│ 算力供應商 │ │
├─────────────┼─────────────────┤
過訓練(小模型 │ 資料供應商 │ 推論晶片(最大) │
+海量資料) │ 算力(訓練) │ 邊緣部署 │
└─────────────┴─────────────────┘
過訓練趨勢意味著:前期訓練投入更大(利好訓練算力/資料),但部署時模型更小(利好推論晶片和邊緣部署)。
投資邏輯
核心邏輯鏈條
-
計算最優理論 → 資料價值重估
- 訓練資料從”成本項”變為”核心競爭力”
- 高質量資料集的擁有者/生產者獲得結構性優勢
- 合成數據技術成為重要補充
-
過訓練趨勢 → 推論成本下降 → 應用爆發
- 行業實踐中已普遍採用遠超 20:1 的 token/引數比
- 更小的模型意味著更便宜的推論,推動 AI 應用普及
- 邊緣部署(手機、PC 端 AI)成為可能
-
資料牆 → 新資料範式 → 技術投資機會
- 真實文本資料趨於枯竭,合成數據 / 多模態資料需求上升
- 資料質量篩選工具、資料管理平台價值提升
- 具備獨家資料來源的公司(如擁有使用者互動資料的平台)具有壁壘
風險因素
- Scaling Laws 是否持續有效? 在更長序列、推論(test-time compute)場景下,傳統 scaling law 可能需要修正
- 合成數據質量天花板: 模型生成的資料可能導致”模型坍縮”(model collapse),限制合成數據的擴充套件能力
- 演算法突破可能改變範式: 如 Mixture-of-Experts (MoE)、推論時計算(test-time compute)等新範式可能重新定義”計算最優”的含義
常見誤讀糾偏
❌ 誤讀一:“Chinchilla 法則意味著模型不能超過 70B 引數”
糾偏: Chinchilla 法則說的是給定算力預算下的最優配比,而非模型大小的上限。如果你的算力預算足夠大(如 10 倍於 Chinchilla),最優模型可以是數百 B 引數。法則限制的是引數與資料的比例關係,不是引數本身。此外,如果目標是最小化推論成本(而非訓練成本),過訓練策略下模型可以遠小於 Chinchilla 最優點。
❌ 誤讀二:“D_opt ≈ 20N 是一個硬性定律”
糾偏: 20:1 是 Chinchilla 論文在特定條件下擬合的經驗比率,不是物理定律。後續多個研究(包括 Meta 的 Llama 系列實踐)表明:
- 更大比率(過訓練)仍然帶來持續收益,只是邊際收益遞減
- 資料質量、資料多樣性等因素會影響最優比率
- 不同架構(如 MoE vs Dense)可能有不同的最優比率
- 推論密集型應用場景下,最優訓練點會偏向過訓練方向
❌ 誤讀三:“計算最優 = 訓練最省錢”
糾偏: 計算最優指的是固定算力下獲得最低訓練損失,但實際工程決策需要考慮全生命週期成本,包括:
- 推論成本(通常遠大於訓練成本,因為推論持續執行)
- 迭代成本(模型需要反覆訓練多個版本)
- 延遲要求(小模型推論更快) 因此,實際生產中幾乎沒有人嚴格按 20:1 訓練,而是根據部署需求選擇過訓練策略。
❌ 誤讀四:“Scaling Laws 是精確的物理定律”
糾偏: Scaling Laws 是在特定資料分佈、架構、超參搜尋策略下的經驗擬合結果,其冪律指數和最優配比會隨:
- 模型架構變化(Transformer 變體、MoE 等)
- 資料分佈變化
- 超參搜尋的充分程度
- 評估指標的選擇 而發生變化。它提供的是量級參考和趨勢判斷,不是精確預測工具。
學習路徑
入門級(1–2 小時)
- 閱讀本文,理解基本概念
- 閱讀 Lilian Weng 的部落格文章 Large Transformer Model Inference Optimization(搜尋 “lilianweng scaling laws”),對 Scaling Laws 有直觀瞭解
進階級(1 天)
- 閱讀 Hoffmann et al. (2022) 原文,重點關注 Section 1-3(三種驗證方法)
- 對比閱讀 Kaplan et al. (2020),理解兩次結論的差異及原因
- 閱讀 Meta LLaMA (2023) 技術報告,理解實際工業界如何偏離 Chinchilla 最優點
專家級(持續追蹤)
- 關注 Chinchilla’s Hungry 相關後續研究(關於資料重複訓練的影響)
- 追蹤 test-time compute scaling(如 OpenAI o1 系列的推論時計算擴充套件)
- 關注 MoE 架構下的 scaling law 修正
- 閱讀 Epoch AI 等機構對 scaling law 持續性的分析報告
一句話總結
計算最優模型揭示了一個樸素但深刻的道理:在固定算力下,模型引數和訓練資料應當年增率例增長——但實踐中行業已從”訓練最優”轉向”推論最優”,用更多資料訓練更小的模型以降低部署成本。
延伸閱讀與來源
- Hoffmann, J. et al. (2022). Training Compute-Optimal Large Language Models. arXiv:2203.15556 — 核心論文,必讀
- Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models. arXiv:2001.08361 — 原始 Scaling Laws 論文
- Touvron, H. et al. (2023). LLaMA: Open and Efficient Foundation Language Models. arXiv:2302.13971 — 過訓練策略的工業實踐
- Meta AI (2024). The Llama 3 Herd of Models. arXiv:2407.21783 — 進一步擴大訓練資料的實踐
- Muennighoff, N. et al. (2023). Scaling Data-Constrained Language Models. arXiv:2305.16264 — 資料受限下的 scaling law 修正
- Epoch AI (持續更新). Scaling Laws Literature Review. epochai.org — 對 scaling law 相關文獻的持續追蹤
- Lilian Weng. How to Train Really Large Models on Many GPUs? lilianweng.github.io — 分散式訓練與計算分配的工程視角
本文基於公開論文與技術報告撰寫,具體數字以原始論文為準。市場資料與估算均已標註口徑,投資決策請結合最新資訊獨立判斷。