模型层 开放阅读

计算最优模型

Compute-Optimal Model

概念 ID
compute-optimal-model
更新时间
2026-05-29
来源数量
待补

计算最优模型 (Compute-Optimal Model)

3 秒看懂

给定固定的算力预算,模型参数量和训练数据量之间存在一个最优配比。 不是越大越好,也不是数据越多越好——而是二者要”同比例长大”。DeepMind 2022 年的 Chinchilla 论文用实验证明:一个 700 亿参数模型(Chinchilla)用更多数据训练,全面碾压了 2800 亿参数但数据不足的 Gopher,而两者消耗的算力基本相同。

3 分钟产业解释

在 2020–2021 年的大模型军备竞赛中,行业默认逻辑是”参数量就是战斗力”:GPT-3(175B)、PaLM(540B)、Gopher(280B)一路堆参数。但 DeepMind 在 2022 年 3 月发表的 Training Compute-Optimal Large Language Models(通称 Chinchilla 论文)打破了这一认知:

核心结论: 在固定的计算预算 $C$(单位:FLOPs)下,模型参数数量 $N$ 和训练数据的 token 数量 $D$ 应当近似等比例扩展。传统做法是把 $N$ 推到极大、但 $D$ 远远不够,导致模型严重”欠训练”(undertrained)。

产业含义:

维度旧范式(大参数少数据)计算最优范式
模型大小越大越好与数据同步增长
训练数据通常 300B tokens 量级需要 1T+ tokens 量级
推理成本极高(大模型部署贵)更小模型、推理更便宜
数据价值被低估成为核心资产

这意味着:与其训练一个”吃不饱”的万亿参数模型,不如用同等算力训练一个更小但”吃饱”的模型。后者不仅效果更好,推理成本还更低。这一发现直接推动了行业对高质量训练数据的争夺,也解释了为何 Meta 的 Llama 系列(中等参数 + 海量数据)在开源界大获成功。

15 分钟专家深入

论文溯源:两篇奠基性工作

计算最优模型的理论基础来源于两篇关键论文:

  1. Kaplan et al. (2020), Scaling Laws for Neural Language Models, OpenAI

    • 首次系统性地量化了语言模型性能(以交叉熵损失 $L$ 衡量)与模型参数 $N$、数据量 $D$、计算量 $C$ 之间的幂律关系
    • 核心发现:$L$ 与 $N$、$D$、$C$ 均呈幂律衰减,且在固定 $C$ 下,应优先扩大 $N$(即更大模型 + 相对少数据)
    • 这一结论直接催生了 GPT-3(175B 参数、300B tokens)的训练策略
  2. Hoffmann et al. (2022), Training Compute-Optimal Large Language Models, DeepMind(即 Chinchilla 论文)

    • 修正了 Kaplan 的结论:$N$ 和 $D$ 应近似等比例扩展
    • 训练了 Chinchilla(70B 参数,1.4T tokens),在相同计算预算下全面优于 Gopher(280B 参数,~300B tokens)
    • 关键修正原因:Kaplan 实验中学习率调度方案未随模型大小充分调整,导致小模型被低估

三条独立验证路径

Chinchilla 论文通过三种独立方法交叉验证了最优配比:

  • 方法一 (固定模型,变化数据): 对不同大小的模型分别训练多种数据量,寻找每个模型的损失拐点
  • 方法二 (IsoFLOP curves): 固定计算预算(FLOPs),变化模型大小,找到该预算下的最优 $N$
  • 方法三 (参数化损失拟合): 将损失建模为 L(N, D) = E + \frac{A}{N^\alpha} + \frac{B}{D^\beta},拟合参数后解析求最优解

三条路径均指向一致结论:最优配比下 N \propto C^{a}, D \propto C^{b},且 a \approx b

关键数字(来自 Chinchilla 论文原文)

模型参数量训练 tokens训练 FLOPs(估算)性能表现
Gopher~280B~300B~5 \times 10^{23} [DeepMind 官方]基线
Chinchilla~70B~1.4T~5 \times 10^{23} [DeepMind 官方]全面优于 Gopher

⚠️ 以上 FLOPs 数字来自 Chinchilla 论文正文表格,两者声称消耗的训练计算量基本持平。

关于最优 token/参数比率

Chinchilla 论文的核心实践建议可简化为:

D_{\text{opt}} \approx 20 \times N

即:每个模型参数大约需要 20 个训练 token(数据来源:Chinchilla 论文 Figure 4 及附录拟合结果)。

这意味着:

  • 7B 模型 → 需要 ~140B tokens(约 1400 亿)
  • 70B 模型 → 需要 ~1.4T tokens(约 1.4 万亿)
  • 175B 模型 → 需要 ~3.5T tokens(约 3.5 万亿)

⚠️ 注意:后续研究(如 Meta 在 Llama 系列的技术报告)发现,实际训练中可以显著超过这个比率而继续获得收益,即”过训练”(overtraining)在推理成本敏感的场景下也是合理的。20:1 是计算最优的理论点,不是训练收益的硬上限。


技术原理

核心数学框架

目标: 在总计算量 $C$ 约束下,最小化模型在测试集上的期望损失 $L$。

参数化损失函数(Hoffmann et al.):

L(N, D) = E + A / N^α + B / D^β

其中:

  • E —— 不可约损失(irreducible loss),即数据本身的熵下界
  • A / N^α —— 模型容量不足导致的损失(参数不足项)
  • B / D^β —— 训练数据不足导致的损失(数据不足项)
  • α ≈ 0.34, β ≈ 0.28(Chinchilla 论文拟合值 [Hoffmann et al., Table A1])
  • A, B, E 为拟合常数

计算约束:

C ≈ 6 × N × D     (单位:FLOPs)

这是近似公式:每个 token 的前向+反向传播约消耗 6N FLOPs(来源:常见估算,见 Kaplan et al. 2020 Appendix F)。严格值取决于架构细节和是否包含注意力 FLOPs 的完整计算。

求解过程(简化版):

在 $C = 6ND$ 约束下,用拉格朗日乘子法对 $L(N, D)$ 求极值:

∂L/∂N + λ · ∂(C - 6ND)/∂N = 0
∂L/∂D + λ · ∂(C - 6ND)/∂D = 0

求解可得最优 N_{\text{opt}}D_{\text{opt}} 与 $C$ 的关系为幂律:

N_opt(C) ∝ C^a       其中 a = β / (α + β) ≈ 0.46
D_opt(C) ∝ C^b       其中 b = α / (α + β) ≈ 0.54

由于 \alpha \approx \beta(两者差异不大),所以 a \approx b \approx 0.5,即 $N$ 和 $D$ 近似等比例扩展

直觉理解

  损失 L
    │
    │╲
    │ ╲  ← 仅增加参数(数据不足时收益递减快)
    │  ╲
    │   ╲───────── 实际达到的损失
    │    ╲
    │     ╲─────────── 计算最优路径(N和D同步增长)
    │      ╲
    │       ╲
    │        ╲────── 仅增加数据(参数不足时收益递减快)
    └─────────────────── 计算量 C →
  • 如果只增 $N$ 不增 $D$:参数越来越多但”吃不饱”,每个参数没有足够的数据来充分学习
  • 如果只增 $D$ 不增 $N$:数据多但模型容量不足,无法吸收信息
  • 最优路径:两者同步扩展,让每个参数都”吃得刚刚好”

与 Kaplan et al. 的关键分歧

维度Kaplan et al. (2020)Hoffmann et al. (2022)
最优 $N$ 扩展N \propto C^{0.73}(偏重大参数)N \propto C^{0.50}(等比例)
最优 $D$ 扩展D \propto C^{0.27}(数据增长慢)D \propto C^{0.50}(等比例)
10× 计算增长时参数约 5.4×, 数据约 1.9×参数约 3.2×, 数据约 3.2×
分歧原因学习率调度方案固定,小模型未充分调参更充分的超参搜索,尤其对小模型

⚠️ Kaplan 论文中指数的具体数值来自原文拟合结果,具体小数位可能因拟合方式略有差异。Hoffmann 论文的修正结论对实践影响更大。


技术演进史

时间事件意义
2017Vaswani et al. 提出 Transformer奠定大模型基础架构
2020.01Kaplan et al. (OpenAI) 发布 Scaling Laws 论文首次系统量化 N、D、C 的幂律关系;结论偏向优先扩大 N
2020.06GPT-3 (175B) 发布,训练数据 ~300B tokens体现了 Kaplan 范式:超大参数 + 相对少数据
2021.12Gopher (280B, ~300B tokens) 发布DeepMind 继续走大参数路线
2022.03Chinchilla 论文发表 (Hoffmann et al.)提出计算最优配比,修正 Kaplan 结论
2022.03Chinchilla (70B, 1.4T tokens) 效果超越 Gopher实验验证计算最优范式
2022训练数据集开始急速扩张行业转向追求更多高质量数据
2023.02LLaMA (7B–65B) 发布,数据 1T–1.4T tokensMeta 大规模应用”过训练”策略,小模型 + 海量数据
2023.07Llama 2 发布,数据量进一步扩大进一步证明中等模型 + 大量数据的可行性
2024Llama 3 (8B / 70B) 训练数据超 15T tokens过训练程度远超 Chinchilla 最优点,但推理收益显著
2024–2025数据墙问题凸显:高质量文本数据趋于枯竭行业开始探索合成数据、多模态数据等新数据源

技术路线对比(量化表)

“计算最优”vs”过训练”vs”欠训练”三种策略对比

维度欠训练 (Under-trained)计算最优 (Compute-Optimal)过训练 (Overtrained)
代表案例Gopher (280B, ~300B tokens)Chinchilla (70B, 1.4T tokens)Llama 3 8B (~15T tokens) [Meta 技术报告]
Token/参数比~1:1~20:1~1875:1(极度过训练)
训练目标最大化模型容量训练 FLOPs 利用率最优最小化推理成本
训练 FLOPs基线低(小模型)
推理成本极高(部署大模型)中等极低(小模型高效)
适用场景早期探索,参数即实力学术基准,FLOPs 受限产品部署,推理量大
核心权衡浪费算力在未充分利用的参数上训练成本最优用更多训练数据换取更低推理成本

不同规模下的 Chinchilla 最优配比估算

模型参数 $N$最优 $D$(~20N)训练 FLOPs($6ND$)等效 GPU 训练时长估算
1B~20B tokens~1.2 \times 10^{20}数小时(数百 A100)[估算]
7B~140B tokens~5.9 \times 10^{21}数天(千卡级)[估算]
70B~1.4T tokens~5.9 \times 10^{23}数周(万卡级)[估算]
175B~3.5T tokens~3.7 \times 10^{24}数月(万卡级+)[估算]
500B~10T tokens~3.0 \times 10^{25}需要超大规模集群 [估算]

⚠️ GPU 训练时长为粗略量级估算,取决于集群规模、硬件型号、MFU(模型 FLOPs 利用率)等因素。实际训练中 MFU 通常在 30%–55% 范围 [公开技术报告估算]。


上下游

上游:计算最优模型的”原材料”

┌──────────────────────────────────────────────────┐
│                   上 游 供 应 链                    │
├──────────┬──────────┬──────────┬─────────────────┤
│  算力硬件  │  训练数据  │  算法框架  │   人才 / 组织    │
│          │          │          │                 │
│ NVIDIA   │ 互联网文本 │ PyTorch  │ DeepMind        │
│  H100/   │ (Common  │ JAX      │ OpenAI          │
│  H200    │  Crawl等) │ Megatron │ Meta FAIR       │
│          │          │ -LM      │                 │
│ AMD      │ 书籍/论文 │ DeepSpeed│ 各大实验室       │
│  MI300   │ 代码数据  │          │                 │
│          │          │ FSDP     │                 │
│ TPU      │ 合成数据  │          │                 │
│ (Google) │          │          │                 │
└──────────┴──────────┴──────────┴─────────────────┘

下游:计算最优理论影响的决策

┌───────────────────────────────────────────────────────┐
│                    下 游 影 响 链                        │
├────────────┬──────────────┬───────────────────────────┤
│  模型训练策略 │  推理部署决策  │  数据产业                 │
│            │              │                           │
│ 选择多大的   │ 部署小模型    │ 高质量数据集价值飙升        │
│ 模型?训练   │ 还是大模型?  │ 数据采集/清洗/合成成为      │
│ 多少数据?   │              │ 核心竞争力                │
│            │ 过训练小模型   │                           │
│ 预算怎么分配 │ 获得最优      │ 合成数据生成(如用大模型    │
│ 给 N 和 D? │ 推理性价比    │ 生成训练数据)             │
└────────────┴──────────────┴───────────────────────────┘

关键指标

指标含义计算最优视角
$N$ (参数量)模型可学习参数总数不是越大越好,需与 $D$ 匹配
$D$ (训练 tokens)训练使用的总 token 数通常被低估,计算最优要求 D \approx 20N
$C$ (训练 FLOPs)训练消耗的总浮点运算量C \approx 6ND
$L$ (损失)测试集交叉熵损失衡量”吃饱了没有”
N_{\text{opt}}, D_{\text{opt}}给定 $C$ 下的最优参数和数据量论文核心产出
Token-to-Parameter Ratio$D/N$,训练 token 与参数之比计算最优点约 20;实际产品常远超此值
MFU (Model FLOPs Utilization)实际 FLOPs / 硬件峰值 FLOPs影响 $C$ 的实际成本,通常 30%–55%
推理 FLOPs / token每生成一个 token 的计算量约 $2N$(前向传播),直接决定部署成本

供需与市场数据

训练数据需求激增

计算最优理论最直接的市场影响是:训练数据需求爆发式增长

指标数据 / 估算来源
Llama 1 训练数据1T–1.4T tokens(不同尺寸)Meta 公开技术报告
Llama 2 训练数据约 2T tokensMeta 公开技术报告
Llama 3 训练数据超过 15T tokensMeta 公开技术报告
全球公开可用文本数据(估算)约 10T–30T tokens [行业估算]多个学术/行业估算,差异较大
合成数据市场规模预测快速增长,但精确预测 [未充分披露]

算力需求

  • Chinchilla 范式下,训练一个”刚好吃饱”的 175B 模型约需 3.7 \times 10^{24} FLOPs
  • 以 H100(~3 \times 10^{15} FP16 FLOPS 峰值)估算,MFU 按 40% 计算:
    • 需约 \frac{3.7 \times 10^{24}}{3 \times 10^{15} \times 0.4} \approx 3.1 \times 10^{9} GPU-seconds ≈ 约 98 GPU-years [粗略估算]
    • 万卡集群约需 ~36 天 [粗略估算]
  • 实际行业趋势: 主要实验室的训练计算量已远超计算最优要求,因为推理成本优化驱动了”过训练”

数据墙问题

  训练数据需求
  (tokens)
      │          ╱ Llama 3 15T+
      │        ╱
      │      ╱     ← 需求增长曲线
      │    ╱
      │  ╱
      │╱─────────────── 可用高质量文本上限 [行业估算: ~10-30T tokens]
      │
      └──────────────────────→ 时间 (2022 → 2025+)

高质量文本数据面临”天花板”。行业应对策略包括:

  • 合成数据: 用已训练的大模型生成训练数据(自我改进、蒸馏)
  • 多模态数据: 引入图像、视频、音频等非文本数据
  • 数据质量优化: 数据筛选、去重、质量过滤技术
  • 数据重复训练: 部分数据重复使用(但存在退化风险)

代表公司与资本映射

公司 / 组织与计算最优的关系资本映射逻辑
DeepMind (Google)Chinchilla 论文原创方;Gemini 系列应用了相关理论Alphabet (GOOGL):算力 + 数据 + 算法全栈
Meta (FAIR)Llama 系列是”过训练”策略的标杆实践META:开源生态 + 海量用户数据
OpenAIKaplan et al. 原始 Scaling Laws 来源;GPT 系列训练策略持续迭代非上市,通过微软 (MSFT) 间接受益
NVIDIA计算最优理论意味着”需要更多高效 GPU 做训练和推理”NVDA:算力军火商,无论最优还是过训练都需要 GPU
数据公司(如 Common Crawl, Scale AI 等)训练数据价值因计算最优理论被重新评估数据标注、清洗、合成成为关键环节
云厂商(AWS, Azure, GCP)训练和推理算力平台云计算收入增长

投资启示矩阵

                    训练阶段受益        推理阶段受益
                   ┌─────────────┬─────────────────┐
  计算最优(等比)    │  数据供应商   │   推理芯片(中等)  │
                   │  算力供应商   │                 │
                   ├─────────────┼─────────────────┤
  过训练(小模型    │  数据供应商   │   推理芯片(最大)  │
  +海量数据)       │  算力(训练)   │   边缘部署       │
                   └─────────────┴─────────────────┘

过训练趋势意味着:前期训练投入更大(利好训练算力/数据),但部署时模型更小(利好推理芯片和边缘部署)。


投资逻辑

核心逻辑链条

  1. 计算最优理论 → 数据价值重估

    • 训练数据从”成本项”变为”核心竞争力”
    • 高质量数据集的拥有者/生产者获得结构性优势
    • 合成数据技术成为重要补充
  2. 过训练趋势 → 推理成本下降 → 应用爆发

    • 行业实践中已普遍采用远超 20:1 的 token/参数比
    • 更小的模型意味着更便宜的推理,推动 AI 应用普及
    • 边缘部署(手机、PC 端 AI)成为可能
  3. 数据墙 → 新数据范式 → 技术投资机会

    • 真实文本数据趋于枯竭,合成数据 / 多模态数据需求上升
    • 数据质量筛选工具、数据管理平台价值提升
    • 具备独家数据源的公司(如拥有用户交互数据的平台)具有壁垒

风险因素

  • Scaling Laws 是否持续有效? 在更长序列、推理(test-time compute)场景下,传统 scaling law 可能需要修正
  • 合成数据质量天花板: 模型生成的数据可能导致”模型坍缩”(model collapse),限制合成数据的扩展能力
  • 算法突破可能改变范式: 如 Mixture-of-Experts (MoE)、推理时计算(test-time compute)等新范式可能重新定义”计算最优”的含义

常见误读纠偏

❌ 误读一:“Chinchilla 法则意味着模型不能超过 70B 参数”

纠偏: Chinchilla 法则说的是给定算力预算下的最优配比,而非模型大小的上限。如果你的算力预算足够大(如 10 倍于 Chinchilla),最优模型可以是数百 B 参数。法则限制的是参数与数据的比例关系,不是参数本身。此外,如果目标是最小化推理成本(而非训练成本),过训练策略下模型可以远小于 Chinchilla 最优点。

❌ 误读二:“D_opt ≈ 20N 是一个硬性定律”

纠偏: 20:1 是 Chinchilla 论文在特定条件下拟合的经验比率,不是物理定律。后续多个研究(包括 Meta 的 Llama 系列实践)表明:

  • 更大比率(过训练)仍然带来持续收益,只是边际收益递减
  • 数据质量、数据多样性等因素会影响最优比率
  • 不同架构(如 MoE vs Dense)可能有不同的最优比率
  • 推理密集型应用场景下,最优训练点会偏向过训练方向

❌ 误读三:“计算最优 = 训练最省钱”

纠偏: 计算最优指的是固定算力下获得最低训练损失,但实际工程决策需要考虑全生命周期成本,包括:

  • 推理成本(通常远大于训练成本,因为推理持续运行)
  • 迭代成本(模型需要反复训练多个版本)
  • 延迟要求(小模型推理更快) 因此,实际生产中几乎没有人严格按 20:1 训练,而是根据部署需求选择过训练策略。

❌ 误读四:“Scaling Laws 是精确的物理定律”

纠偏: Scaling Laws 是在特定数据分布、架构、超参搜索策略下的经验拟合结果,其幂律指数和最优配比会随:

  • 模型架构变化(Transformer 变体、MoE 等)
  • 数据分布变化
  • 超参搜索的充分程度
  • 评估指标的选择 而发生变化。它提供的是量级参考和趋势判断,不是精确预测工具。

学习路径

入门级(1–2 小时)

  1. 阅读本文,理解基本概念
  2. 阅读 Lilian Weng 的博客文章 Large Transformer Model Inference Optimization(搜索 “lilianweng scaling laws”),对 Scaling Laws 有直观了解

进阶级(1 天)

  1. 阅读 Hoffmann et al. (2022) 原文,重点关注 Section 1-3(三种验证方法)
  2. 对比阅读 Kaplan et al. (2020),理解两次结论的差异及原因
  3. 阅读 Meta LLaMA (2023) 技术报告,理解实际工业界如何偏离 Chinchilla 最优点

专家级(持续跟踪)

  1. 关注 Chinchilla’s Hungry 相关后续研究(关于数据重复训练的影响)
  2. 跟踪 test-time compute scaling(如 OpenAI o1 系列的推理时计算扩展)
  3. 关注 MoE 架构下的 scaling law 修正
  4. 阅读 Epoch AI 等机构对 scaling law 持续性的分析报告

一句话总结

计算最优模型揭示了一个朴素但深刻的道理:在固定算力下,模型参数和训练数据应当同比例增长——但实践中行业已从”训练最优”转向”推理最优”,用更多数据训练更小的模型以降低部署成本。


延伸阅读与来源

  1. Hoffmann, J. et al. (2022). Training Compute-Optimal Large Language Models. arXiv:2203.15556 — 核心论文,必读
  2. Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models. arXiv:2001.08361 — 原始 Scaling Laws 论文
  3. Touvron, H. et al. (2023). LLaMA: Open and Efficient Foundation Language Models. arXiv:2302.13971 — 过训练策略的工业实践
  4. Meta AI (2024). The Llama 3 Herd of Models. arXiv:2407.21783 — 进一步扩大训练数据的实践
  5. Muennighoff, N. et al. (2023). Scaling Data-Constrained Language Models. arXiv:2305.16264 — 数据受限下的 scaling law 修正
  6. Epoch AI (持续更新). Scaling Laws Literature Review. epochai.org — 对 scaling law 相关文献的持续追踪
  7. Lilian Weng. How to Train Really Large Models on Many GPUs? lilianweng.github.io — 分布式训练与计算分配的工程视角

本文基于公开论文与技术报告撰写,具体数字以原始论文为准。市场数据与估算均已标注口径,投资决策请结合最新信息独立判断。

source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型