计算最优模型 (Compute-Optimal Model)
3 秒看懂
给定固定的算力预算,模型参数量和训练数据量之间存在一个最优配比。 不是越大越好,也不是数据越多越好——而是二者要”同比例长大”。DeepMind 2022 年的 Chinchilla 论文用实验证明:一个 700 亿参数模型(Chinchilla)用更多数据训练,全面碾压了 2800 亿参数但数据不足的 Gopher,而两者消耗的算力基本相同。
3 分钟产业解释
在 2020–2021 年的大模型军备竞赛中,行业默认逻辑是”参数量就是战斗力”:GPT-3(175B)、PaLM(540B)、Gopher(280B)一路堆参数。但 DeepMind 在 2022 年 3 月发表的 Training Compute-Optimal Large Language Models(通称 Chinchilla 论文)打破了这一认知:
核心结论: 在固定的计算预算 $C$(单位:FLOPs)下,模型参数数量 $N$ 和训练数据的 token 数量 $D$ 应当近似等比例扩展。传统做法是把 $N$ 推到极大、但 $D$ 远远不够,导致模型严重”欠训练”(undertrained)。
产业含义:
| 维度 | 旧范式(大参数少数据) | 计算最优范式 |
|---|---|---|
| 模型大小 | 越大越好 | 与数据同步增长 |
| 训练数据 | 通常 300B tokens 量级 | 需要 1T+ tokens 量级 |
| 推理成本 | 极高(大模型部署贵) | 更小模型、推理更便宜 |
| 数据价值 | 被低估 | 成为核心资产 |
这意味着:与其训练一个”吃不饱”的万亿参数模型,不如用同等算力训练一个更小但”吃饱”的模型。后者不仅效果更好,推理成本还更低。这一发现直接推动了行业对高质量训练数据的争夺,也解释了为何 Meta 的 Llama 系列(中等参数 + 海量数据)在开源界大获成功。
15 分钟专家深入
论文溯源:两篇奠基性工作
计算最优模型的理论基础来源于两篇关键论文:
-
Kaplan et al. (2020), Scaling Laws for Neural Language Models, OpenAI
- 首次系统性地量化了语言模型性能(以交叉熵损失 $L$ 衡量)与模型参数 $N$、数据量 $D$、计算量 $C$ 之间的幂律关系
- 核心发现:$L$ 与 $N$、$D$、$C$ 均呈幂律衰减,且在固定 $C$ 下,应优先扩大 $N$(即更大模型 + 相对少数据)
- 这一结论直接催生了 GPT-3(175B 参数、300B tokens)的训练策略
-
Hoffmann et al. (2022), Training Compute-Optimal Large Language Models, DeepMind(即 Chinchilla 论文)
- 修正了 Kaplan 的结论:$N$ 和 $D$ 应近似等比例扩展
- 训练了 Chinchilla(70B 参数,1.4T tokens),在相同计算预算下全面优于 Gopher(280B 参数,~300B tokens)
- 关键修正原因:Kaplan 实验中学习率调度方案未随模型大小充分调整,导致小模型被低估
三条独立验证路径
Chinchilla 论文通过三种独立方法交叉验证了最优配比:
- 方法一 (固定模型,变化数据): 对不同大小的模型分别训练多种数据量,寻找每个模型的损失拐点
- 方法二 (IsoFLOP curves): 固定计算预算(FLOPs),变化模型大小,找到该预算下的最优 $N$
- 方法三 (参数化损失拟合): 将损失建模为
L(N, D) = E + \frac{A}{N^\alpha} + \frac{B}{D^\beta},拟合参数后解析求最优解
三条路径均指向一致结论:最优配比下 N \propto C^{a}, D \propto C^{b},且 a \approx b。
关键数字(来自 Chinchilla 论文原文)
| 模型 | 参数量 | 训练 tokens | 训练 FLOPs(估算) | 性能表现 |
|---|---|---|---|---|
| Gopher | ~280B | ~300B | ~5 \times 10^{23} [DeepMind 官方] | 基线 |
| Chinchilla | ~70B | ~1.4T | ~5 \times 10^{23} [DeepMind 官方] | 全面优于 Gopher |
⚠️ 以上 FLOPs 数字来自 Chinchilla 论文正文表格,两者声称消耗的训练计算量基本持平。
关于最优 token/参数比率
Chinchilla 论文的核心实践建议可简化为:
D_{\text{opt}} \approx 20 \times N
即:每个模型参数大约需要 20 个训练 token(数据来源:Chinchilla 论文 Figure 4 及附录拟合结果)。
这意味着:
- 7B 模型 → 需要 ~140B tokens(约 1400 亿)
- 70B 模型 → 需要 ~1.4T tokens(约 1.4 万亿)
- 175B 模型 → 需要 ~3.5T tokens(约 3.5 万亿)
⚠️ 注意:后续研究(如 Meta 在 Llama 系列的技术报告)发现,实际训练中可以显著超过这个比率而继续获得收益,即”过训练”(overtraining)在推理成本敏感的场景下也是合理的。20:1 是计算最优的理论点,不是训练收益的硬上限。
技术原理
核心数学框架
目标: 在总计算量 $C$ 约束下,最小化模型在测试集上的期望损失 $L$。
参数化损失函数(Hoffmann et al.):
L(N, D) = E + A / N^α + B / D^β
其中:
E—— 不可约损失(irreducible loss),即数据本身的熵下界A / N^α—— 模型容量不足导致的损失(参数不足项)B / D^β—— 训练数据不足导致的损失(数据不足项)α ≈ 0.34,β ≈ 0.28(Chinchilla 论文拟合值 [Hoffmann et al., Table A1])A,B,E为拟合常数
计算约束:
C ≈ 6 × N × D (单位:FLOPs)
这是近似公式:每个 token 的前向+反向传播约消耗
6NFLOPs(来源:常见估算,见 Kaplan et al. 2020 Appendix F)。严格值取决于架构细节和是否包含注意力 FLOPs 的完整计算。
求解过程(简化版):
在 $C = 6ND$ 约束下,用拉格朗日乘子法对 $L(N, D)$ 求极值:
∂L/∂N + λ · ∂(C - 6ND)/∂N = 0
∂L/∂D + λ · ∂(C - 6ND)/∂D = 0
求解可得最优 N_{\text{opt}} 和 D_{\text{opt}} 与 $C$ 的关系为幂律:
N_opt(C) ∝ C^a 其中 a = β / (α + β) ≈ 0.46
D_opt(C) ∝ C^b 其中 b = α / (α + β) ≈ 0.54
由于 \alpha \approx \beta(两者差异不大),所以 a \approx b \approx 0.5,即 $N$ 和 $D$ 近似等比例扩展。
直觉理解
损失 L
│
│╲
│ ╲ ← 仅增加参数(数据不足时收益递减快)
│ ╲
│ ╲───────── 实际达到的损失
│ ╲
│ ╲─────────── 计算最优路径(N和D同步增长)
│ ╲
│ ╲
│ ╲────── 仅增加数据(参数不足时收益递减快)
└─────────────────── 计算量 C →
- 如果只增 $N$ 不增 $D$:参数越来越多但”吃不饱”,每个参数没有足够的数据来充分学习
- 如果只增 $D$ 不增 $N$:数据多但模型容量不足,无法吸收信息
- 最优路径:两者同步扩展,让每个参数都”吃得刚刚好”
与 Kaplan et al. 的关键分歧
| 维度 | Kaplan et al. (2020) | Hoffmann et al. (2022) |
|---|---|---|
| 最优 $N$ 扩展 | N \propto C^{0.73}(偏重大参数) | N \propto C^{0.50}(等比例) |
| 最优 $D$ 扩展 | D \propto C^{0.27}(数据增长慢) | D \propto C^{0.50}(等比例) |
| 10× 计算增长时 | 参数约 5.4×, 数据约 1.9× | 参数约 3.2×, 数据约 3.2× |
| 分歧原因 | 学习率调度方案固定,小模型未充分调参 | 更充分的超参搜索,尤其对小模型 |
⚠️ Kaplan 论文中指数的具体数值来自原文拟合结果,具体小数位可能因拟合方式略有差异。Hoffmann 论文的修正结论对实践影响更大。
技术演进史
| 时间 | 事件 | 意义 |
|---|---|---|
| 2017 | Vaswani et al. 提出 Transformer | 奠定大模型基础架构 |
| 2020.01 | Kaplan et al. (OpenAI) 发布 Scaling Laws 论文 | 首次系统量化 N、D、C 的幂律关系;结论偏向优先扩大 N |
| 2020.06 | GPT-3 (175B) 发布,训练数据 ~300B tokens | 体现了 Kaplan 范式:超大参数 + 相对少数据 |
| 2021.12 | Gopher (280B, ~300B tokens) 发布 | DeepMind 继续走大参数路线 |
| 2022.03 | Chinchilla 论文发表 (Hoffmann et al.) | 提出计算最优配比,修正 Kaplan 结论 |
| 2022.03 | Chinchilla (70B, 1.4T tokens) 效果超越 Gopher | 实验验证计算最优范式 |
| 2022 | 训练数据集开始急速扩张 | 行业转向追求更多高质量数据 |
| 2023.02 | LLaMA (7B–65B) 发布,数据 1T–1.4T tokens | Meta 大规模应用”过训练”策略,小模型 + 海量数据 |
| 2023.07 | Llama 2 发布,数据量进一步扩大 | 进一步证明中等模型 + 大量数据的可行性 |
| 2024 | Llama 3 (8B / 70B) 训练数据超 15T tokens | 过训练程度远超 Chinchilla 最优点,但推理收益显著 |
| 2024–2025 | 数据墙问题凸显:高质量文本数据趋于枯竭 | 行业开始探索合成数据、多模态数据等新数据源 |
技术路线对比(量化表)
“计算最优”vs”过训练”vs”欠训练”三种策略对比
| 维度 | 欠训练 (Under-trained) | 计算最优 (Compute-Optimal) | 过训练 (Overtrained) |
|---|---|---|---|
| 代表案例 | Gopher (280B, ~300B tokens) | Chinchilla (70B, 1.4T tokens) | Llama 3 8B (~15T tokens) [Meta 技术报告] |
| Token/参数比 | ~1:1 | ~20:1 | ~1875:1(极度过训练) |
| 训练目标 | 最大化模型容量 | 训练 FLOPs 利用率最优 | 最小化推理成本 |
| 训练 FLOPs | 高 | 基线 | 低(小模型) |
| 推理成本 | 极高(部署大模型) | 中等 | 极低(小模型高效) |
| 适用场景 | 早期探索,参数即实力 | 学术基准,FLOPs 受限 | 产品部署,推理量大 |
| 核心权衡 | 浪费算力在未充分利用的参数上 | 训练成本最优 | 用更多训练数据换取更低推理成本 |
不同规模下的 Chinchilla 最优配比估算
| 模型参数 $N$ | 最优 $D$(~20N) | 训练 FLOPs($6ND$) | 等效 GPU 训练时长估算 |
|---|---|---|---|
| 1B | ~20B tokens | ~1.2 \times 10^{20} | 数小时(数百 A100)[估算] |
| 7B | ~140B tokens | ~5.9 \times 10^{21} | 数天(千卡级)[估算] |
| 70B | ~1.4T tokens | ~5.9 \times 10^{23} | 数周(万卡级)[估算] |
| 175B | ~3.5T tokens | ~3.7 \times 10^{24} | 数月(万卡级+)[估算] |
| 500B | ~10T tokens | ~3.0 \times 10^{25} | 需要超大规模集群 [估算] |
⚠️ GPU 训练时长为粗略量级估算,取决于集群规模、硬件型号、MFU(模型 FLOPs 利用率)等因素。实际训练中 MFU 通常在 30%–55% 范围 [公开技术报告估算]。
上下游
上游:计算最优模型的”原材料”
┌──────────────────────────────────────────────────┐
│ 上 游 供 应 链 │
├──────────┬──────────┬──────────┬─────────────────┤
│ 算力硬件 │ 训练数据 │ 算法框架 │ 人才 / 组织 │
│ │ │ │ │
│ NVIDIA │ 互联网文本 │ PyTorch │ DeepMind │
│ H100/ │ (Common │ JAX │ OpenAI │
│ H200 │ Crawl等) │ Megatron │ Meta FAIR │
│ │ │ -LM │ │
│ AMD │ 书籍/论文 │ DeepSpeed│ 各大实验室 │
│ MI300 │ 代码数据 │ │ │
│ │ │ FSDP │ │
│ TPU │ 合成数据 │ │ │
│ (Google) │ │ │ │
└──────────┴──────────┴──────────┴─────────────────┘
下游:计算最优理论影响的决策
┌───────────────────────────────────────────────────────┐
│ 下 游 影 响 链 │
├────────────┬──────────────┬───────────────────────────┤
│ 模型训练策略 │ 推理部署决策 │ 数据产业 │
│ │ │ │
│ 选择多大的 │ 部署小模型 │ 高质量数据集价值飙升 │
│ 模型?训练 │ 还是大模型? │ 数据采集/清洗/合成成为 │
│ 多少数据? │ │ 核心竞争力 │
│ │ 过训练小模型 │ │
│ 预算怎么分配 │ 获得最优 │ 合成数据生成(如用大模型 │
│ 给 N 和 D? │ 推理性价比 │ 生成训练数据) │
└────────────┴──────────────┴───────────────────────────┘
关键指标
| 指标 | 含义 | 计算最优视角 |
|---|---|---|
| $N$ (参数量) | 模型可学习参数总数 | 不是越大越好,需与 $D$ 匹配 |
| $D$ (训练 tokens) | 训练使用的总 token 数 | 通常被低估,计算最优要求 D \approx 20N |
| $C$ (训练 FLOPs) | 训练消耗的总浮点运算量 | C \approx 6ND |
| $L$ (损失) | 测试集交叉熵损失 | 衡量”吃饱了没有” |
N_{\text{opt}}, D_{\text{opt}} | 给定 $C$ 下的最优参数和数据量 | 论文核心产出 |
| Token-to-Parameter Ratio | $D/N$,训练 token 与参数之比 | 计算最优点约 20;实际产品常远超此值 |
| MFU (Model FLOPs Utilization) | 实际 FLOPs / 硬件峰值 FLOPs | 影响 $C$ 的实际成本,通常 30%–55% |
| 推理 FLOPs / token | 每生成一个 token 的计算量 | 约 $2N$(前向传播),直接决定部署成本 |
供需与市场数据
训练数据需求激增
计算最优理论最直接的市场影响是:训练数据需求爆发式增长。
| 指标 | 数据 / 估算 | 来源 |
|---|---|---|
| Llama 1 训练数据 | 1T–1.4T tokens(不同尺寸) | Meta 公开技术报告 |
| Llama 2 训练数据 | 约 2T tokens | Meta 公开技术报告 |
| Llama 3 训练数据 | 超过 15T tokens | Meta 公开技术报告 |
| 全球公开可用文本数据(估算) | 约 10T–30T tokens [行业估算] | 多个学术/行业估算,差异较大 |
| 合成数据市场规模预测 | 快速增长,但精确预测 [未充分披露] | — |
算力需求
- Chinchilla 范式下,训练一个”刚好吃饱”的 175B 模型约需
3.7 \times 10^{24}FLOPs - 以 H100(~
3 \times 10^{15}FP16 FLOPS 峰值)估算,MFU 按 40% 计算:- 需约
\frac{3.7 \times 10^{24}}{3 \times 10^{15} \times 0.4} \approx 3.1 \times 10^{9}GPU-seconds ≈ 约 98 GPU-years [粗略估算] - 万卡集群约需 ~36 天 [粗略估算]
- 需约
- 实际行业趋势: 主要实验室的训练计算量已远超计算最优要求,因为推理成本优化驱动了”过训练”
数据墙问题
训练数据需求
(tokens)
│ ╱ Llama 3 15T+
│ ╱
│ ╱ ← 需求增长曲线
│ ╱
│ ╱
│╱─────────────── 可用高质量文本上限 [行业估算: ~10-30T tokens]
│
└──────────────────────→ 时间 (2022 → 2025+)
高质量文本数据面临”天花板”。行业应对策略包括:
- 合成数据: 用已训练的大模型生成训练数据(自我改进、蒸馏)
- 多模态数据: 引入图像、视频、音频等非文本数据
- 数据质量优化: 数据筛选、去重、质量过滤技术
- 数据重复训练: 部分数据重复使用(但存在退化风险)
代表公司与资本映射
| 公司 / 组织 | 与计算最优的关系 | 资本映射逻辑 |
|---|---|---|
| DeepMind (Google) | Chinchilla 论文原创方;Gemini 系列应用了相关理论 | Alphabet (GOOGL):算力 + 数据 + 算法全栈 |
| Meta (FAIR) | Llama 系列是”过训练”策略的标杆实践 | META:开源生态 + 海量用户数据 |
| OpenAI | Kaplan et al. 原始 Scaling Laws 来源;GPT 系列训练策略持续迭代 | 非上市,通过微软 (MSFT) 间接受益 |
| NVIDIA | 计算最优理论意味着”需要更多高效 GPU 做训练和推理” | NVDA:算力军火商,无论最优还是过训练都需要 GPU |
| 数据公司(如 Common Crawl, Scale AI 等) | 训练数据价值因计算最优理论被重新评估 | 数据标注、清洗、合成成为关键环节 |
| 云厂商(AWS, Azure, GCP) | 训练和推理算力平台 | 云计算收入增长 |
投资启示矩阵
训练阶段受益 推理阶段受益
┌─────────────┬─────────────────┐
计算最优(等比) │ 数据供应商 │ 推理芯片(中等) │
│ 算力供应商 │ │
├─────────────┼─────────────────┤
过训练(小模型 │ 数据供应商 │ 推理芯片(最大) │
+海量数据) │ 算力(训练) │ 边缘部署 │
└─────────────┴─────────────────┘
过训练趋势意味着:前期训练投入更大(利好训练算力/数据),但部署时模型更小(利好推理芯片和边缘部署)。
投资逻辑
核心逻辑链条
-
计算最优理论 → 数据价值重估
- 训练数据从”成本项”变为”核心竞争力”
- 高质量数据集的拥有者/生产者获得结构性优势
- 合成数据技术成为重要补充
-
过训练趋势 → 推理成本下降 → 应用爆发
- 行业实践中已普遍采用远超 20:1 的 token/参数比
- 更小的模型意味着更便宜的推理,推动 AI 应用普及
- 边缘部署(手机、PC 端 AI)成为可能
-
数据墙 → 新数据范式 → 技术投资机会
- 真实文本数据趋于枯竭,合成数据 / 多模态数据需求上升
- 数据质量筛选工具、数据管理平台价值提升
- 具备独家数据源的公司(如拥有用户交互数据的平台)具有壁垒
风险因素
- Scaling Laws 是否持续有效? 在更长序列、推理(test-time compute)场景下,传统 scaling law 可能需要修正
- 合成数据质量天花板: 模型生成的数据可能导致”模型坍缩”(model collapse),限制合成数据的扩展能力
- 算法突破可能改变范式: 如 Mixture-of-Experts (MoE)、推理时计算(test-time compute)等新范式可能重新定义”计算最优”的含义
常见误读纠偏
❌ 误读一:“Chinchilla 法则意味着模型不能超过 70B 参数”
纠偏: Chinchilla 法则说的是给定算力预算下的最优配比,而非模型大小的上限。如果你的算力预算足够大(如 10 倍于 Chinchilla),最优模型可以是数百 B 参数。法则限制的是参数与数据的比例关系,不是参数本身。此外,如果目标是最小化推理成本(而非训练成本),过训练策略下模型可以远小于 Chinchilla 最优点。
❌ 误读二:“D_opt ≈ 20N 是一个硬性定律”
纠偏: 20:1 是 Chinchilla 论文在特定条件下拟合的经验比率,不是物理定律。后续多个研究(包括 Meta 的 Llama 系列实践)表明:
- 更大比率(过训练)仍然带来持续收益,只是边际收益递减
- 数据质量、数据多样性等因素会影响最优比率
- 不同架构(如 MoE vs Dense)可能有不同的最优比率
- 推理密集型应用场景下,最优训练点会偏向过训练方向
❌ 误读三:“计算最优 = 训练最省钱”
纠偏: 计算最优指的是固定算力下获得最低训练损失,但实际工程决策需要考虑全生命周期成本,包括:
- 推理成本(通常远大于训练成本,因为推理持续运行)
- 迭代成本(模型需要反复训练多个版本)
- 延迟要求(小模型推理更快) 因此,实际生产中几乎没有人严格按 20:1 训练,而是根据部署需求选择过训练策略。
❌ 误读四:“Scaling Laws 是精确的物理定律”
纠偏: Scaling Laws 是在特定数据分布、架构、超参搜索策略下的经验拟合结果,其幂律指数和最优配比会随:
- 模型架构变化(Transformer 变体、MoE 等)
- 数据分布变化
- 超参搜索的充分程度
- 评估指标的选择 而发生变化。它提供的是量级参考和趋势判断,不是精确预测工具。
学习路径
入门级(1–2 小时)
- 阅读本文,理解基本概念
- 阅读 Lilian Weng 的博客文章 Large Transformer Model Inference Optimization(搜索 “lilianweng scaling laws”),对 Scaling Laws 有直观了解
进阶级(1 天)
- 阅读 Hoffmann et al. (2022) 原文,重点关注 Section 1-3(三种验证方法)
- 对比阅读 Kaplan et al. (2020),理解两次结论的差异及原因
- 阅读 Meta LLaMA (2023) 技术报告,理解实际工业界如何偏离 Chinchilla 最优点
专家级(持续跟踪)
- 关注 Chinchilla’s Hungry 相关后续研究(关于数据重复训练的影响)
- 跟踪 test-time compute scaling(如 OpenAI o1 系列的推理时计算扩展)
- 关注 MoE 架构下的 scaling law 修正
- 阅读 Epoch AI 等机构对 scaling law 持续性的分析报告
一句话总结
计算最优模型揭示了一个朴素但深刻的道理:在固定算力下,模型参数和训练数据应当同比例增长——但实践中行业已从”训练最优”转向”推理最优”,用更多数据训练更小的模型以降低部署成本。
延伸阅读与来源
- Hoffmann, J. et al. (2022). Training Compute-Optimal Large Language Models. arXiv:2203.15556 — 核心论文,必读
- Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models. arXiv:2001.08361 — 原始 Scaling Laws 论文
- Touvron, H. et al. (2023). LLaMA: Open and Efficient Foundation Language Models. arXiv:2302.13971 — 过训练策略的工业实践
- Meta AI (2024). The Llama 3 Herd of Models. arXiv:2407.21783 — 进一步扩大训练数据的实践
- Muennighoff, N. et al. (2023). Scaling Data-Constrained Language Models. arXiv:2305.16264 — 数据受限下的 scaling law 修正
- Epoch AI (持续更新). Scaling Laws Literature Review. epochai.org — 对 scaling law 相关文献的持续追踪
- Lilian Weng. How to Train Really Large Models on Many GPUs? lilianweng.github.io — 分布式训练与计算分配的工程视角
本文基于公开论文与技术报告撰写,具体数字以原始论文为准。市场数据与估算均已标注口径,投资决策请结合最新信息独立判断。