训练 token 数
3 秒看懂
“训练 token 数”是衡量大语言模型“阅读量”的核心指标。一个 token 约等于 0.75 个英文单词或 1–2 个汉字。它直接决定模型的知识储备、推理强度与训练成本。同等架构下,训练 token 越多,模型能力越强,但边际收益服从 Chinchilla 缩放定律——无限堆 token 并不经济。当前前沿模型已从千亿级 token(GPT‑3 约 300B)迈入十万亿级时代(LLaMA 3 超 15T,部分多模态模型超 50T)。该指标把数据规模、算力开销、训练时长捆在一起,是衡量大模型“起跑线”的第一把尺子。
3 分钟产业解释
训练 token 数指模型完整训练周期内实际参与正向与反向传播的 token 总个数,通常以 B(10⁹)或 T(10¹²)为单位。它不等于磁盘上的原始数据集大小——原始语料经过去重、过滤、分词后,实际可用的 token 数通常只有原始数据的 30%–60%(行业经验,2023 年 Common Crawl 到可用训练语料的转化率约 40%–50%,RedPajama‑v2 公开流水线观察也佐证类似比例的损耗)。
在产业实践中,训练 token 数与参数量共同决定总算力预算。根据 2022 年 Hoffmann 等提出的 Chinchilla 定律,在固定计算量 C 下,每一个参数最优配比约 20 个训练 token。然而 2023–2025 年产业明显偏向“过度训练”(overtraining),即在较小模型上喂入远超 20:1 的 token,追求更优推理成本和部署灵活性。例如 Meta 在 2024 年公开的 LLaMA 3 系列 8B 和 70B 模型均使用超 15T token 进行训练,D/N 比达数百比一(来源:Meta 2024 技术报告《The Llama 3 Herd of Models》)。这意味着训练 token 数的竞争已不只是算力竞赛,更是数据工程与合成数据能力的角力。
训练 token 数还直接换算成 GPU‑时。以 Chinchilla 公式近似,1T token 在训练一个 70B 密集模型时约需 6×10²³ FLOPs 量级(正向 2N + 反向 4N = 6N per token),实际集群利用率假设 50%(包含通信、故障恢复),需要数千张 H100 GPU 连续运行数周乃至数月,成本可达数千万美元(2024 年云计算租用价格估算;SemiAnalysis 等对 10T+ 训练集群成本拆分,推算约 0.5 亿–1.5 亿美元量级)。因此训练 token 数的扩大不仅压迫数据供应链,更直接推高硬件采购、能源消耗与数据中心投资。
技术原理
1. Tokenization 流水线 文本 token 化通过字节对编码(BPE)或 SentencePiece 等分词器,将自然语言切分为子词序列。词表大小直接决定相同语义内容对应的 token 数量:GPT‑4 所用 tiktoken 词表约 100k,LLaMA 系列早期 32k、LLaMA 3 升至 128k(来源:公开技术报告),同一段中文语料,LLaMA 3 的 token 数可能比 GPT‑4 少 10–20%。跨模型对比训练 token 数时必须注意词表偏差。
图像、音频等多模态数据则通过独立编码器(如 ViT 的 patch embedding、VQ‑VAE 的离散编码)转换为视觉 token 或音频 token,这些 token 的信息密度与文本 token 根本不同,但当前业界常将二者简单加总为“总训练 token 数”,标准化折算方法尚属空白。
2. 数据飞轮与 token 形成 原始数据(PB 级)进入训练前必经多道工序:文档级/段落级去重(MinHash、SimHash)、质量过滤(困惑度评分、语言识别、有害内容筛除)、分词、序列打包(packing,将短序列拼接至最大上下文长度以提高 GPU 利用率),最后按知识、代码、数学、多语言等比例混配成批次。这几步造成的 token 损耗在开源项目 Dolma、RedPajama‑v2 中有公开日志:从 Common Crawl 原始 WARC 文件到最终训练 token,缩减比例约 50%–70%。
3. 训练中的 token 消费 在训练循环中,每个 token 依次经历前向与反向传播,消耗固定的 FLOPs(参数量决定)。现代训练系统通过流水线并行、张量并行、数据并行将 token 批次拆分到数千 GPU 上;梯度累积步数允许在保持有效批大小不变的情况下降低显存开销。对于 MoE 模型,每 token 仅激活部分专家,有效计算量低于等效密集模型,但 token 路由与跨节点 All‑to‑All 通信会带来额外的延迟和带宽消耗。这意味着 MoE 模型在相同硬件环境下可处理更多训练 token,但真实吞吐增益需扣除通信开销。
4. 退火与重复 token 的价值 训练后期,研究团队常引入极少量(几亿到几百亿)极高品质 token 进行退火(annealing),并以衰减的学习率反复训练(通常 1–3 个 epoch)。DeepSeek‑V2 技术报告(2024 年 arXiv:2405.04434)就提到在退火阶段引入高质量对话与推理数据,虽 token 数占比极小,却对指令跟随、安全性和事实准确度提升显著。这种“质量杠杆”效应说明 token 数指标需要与 token 质量联合评估。
5. 合成 token 的进入 从 2023 年起,合成数据被大规模用于弥补自然数据枯竭。合成 token 由另一 AI 模型生成(如使用 GPT‑4 生成推理链、数学题解),经清洗后混入训练语料。其生成成本远低于人工标注,但可能引入模型崩溃(model collapse)风险——反复在合成数据上训练会导致分布塌缩(Nature 2024 年相关论文警示)。目前行业尚无公认标准来计量合成 token 的“有效当量”。
关键参数
- 训练总 Token 数(D):最常用的公开指标,以 T 为单位。未标注清洗损失时,通常指数据加权后的有效 token 总数。
- Token‑参数比(D/N):衡量过度训练程度。Chinchilla 最优线约 20:1,2024–2025 年多数前沿模型 D/N 超 100:1,部分小模型达到 1000:1 以上。
- 数据重复度(epochs):同一数据被重复训练的平均次数。理想状态下 epochs < 1,表示数据量充足。LLaMA 3 15T 的训练据称所有数据 epoch 数小于 1(Meta 2024 报告暗示)。
- 有效 token 率:原始数据转化为训练 token 的比例,反映数据工程效率,常见值 0.3–0.7。
- Token 质量评分:基于数据源的教育价值、事实密度、多样性等进行加权评分。例如教科书、维基百科、ArXiv 论文的评分通常数倍于普通网页。行业内无统一标尺,各实验室自建评估器。
- 长上下文 token 占比:使用 32k、128k 乃至 1M 上下文训练时,长序列 token 占整体 token 的比例。长上下文利用不足则浪费算力。
- 多模态 token 当量系数:试图换算视觉/音频 token 对文本能力的贡献,目前尚无公认标准,各厂商研究阶段(公开资料未见统一值)。
技术路线
大模型训练 token 数与架构的选择形成几条鲜明路线:
| 路线 | 代表案例 | D/N 比 | 优势 | 挑战 | 技术特征 |
|---|---|---|---|---|---|
| 密集小参数量 + 海量 token | LLaMA 3 8B (15T);Mistral 7B v0.3(推测约 6–8T) | 数百至上千 | 推理成本极低,部署灵活 | 数据需求极大,过拟合风险}需合成数据补充 | 极致优化推理,适合端侧与边缘 |
| 密集大参数量 + 适中 token | Chinchilla‑70B (1.4T);早期 GPT‑4 推测 | 20:1 附近 | 参数利用率理论最优 | 推理昂贵,部署成本高 | 遵循缩放定律,研究基准 |
| MoE 稀疏 + 高 token | DeepSeek‑V2/V3;Mixtral 8x22B;Qwen2.5‑MoE 系 | 相对激活参数 40:1–100:1 | 总参数量大,训练效率高 | 专家负载均衡困难,通信开销大 | 每 token 仅激活部分参数,等效参数量大 |
| 多模态混合 token | Gemini 系列;GPT‑4o;视频生成模型 Sora 类 | 文本与视觉 token 混计,D/N 难统一 | 多模态原生能力 | token 信息密度不一,效用难横向对比 | 将图像、视频像素转化为离散 token,与文本混合训练 |
2024 年以来,“过度训练 + 多阶段退火”成为主流策略,且多模态模型普遍将视觉 token 直接纳入训练总 token 中。例如,某多模态模型可能宣称训练 token 数达 50T,但其中 70% 是视觉 token(公开资料未见精确比例,系行业合理推测)。这导致定义出现泛化,投资分析和研究对比时须拆分文本与多模态 token。
上游
训练 token 数的膨胀直接拉动上游产业链:
- 数据获取:Common Crawl 等网络爬虫每月采集数量 PB 级原始网页。此外书籍、新闻媒体、学术论文、代码仓库(GitHub)及合成数据平台构成主要语料来源。版权法规(如欧盟 DSM 指令、美国生成式 AI 版权白皮书)正日益收紧,合规获取成本上升。
- 清洗与标注:数据清洗服务商(Scale AI、Appen、Surge AI 等)按 token 或按时计费,提供去重、过滤、事实性验证等。2024 年数据加工市场规模约 35 亿–50 亿美元(Grand View Research 2024 年针对 AI 数据服务报告),预计 2025–2026 年以 25%–35% CAGR 增长。合成数据生成平台(如 Gretel、Hazy)提供低成本 token 补充。
- 分词工具:tiktoken、HuggingFace tokenizers、SentencePiece 等词表构建与 token 化工具是数据流水线的枢纽,性能直接影响数据吞吐。
- 存储与网络:PB 级数据湖与高速分布式文件系统(如 Weka、NetApp)加 InfiniBand / RoCE 网络是训练集群的标配。每增加 10T token 意味着训练前需要约 5–20 PB 的原始数据暂存,数据加载 I/O 瓶颈愈发突出。
- 算力硬件:NVIDIA H100/H200/B200 系列 GPU、AMD MI300X 等加速芯片是 token 消费的引擎。2024 年单张 H100 在密集模型训练中典型吞吐约为每秒数万 token(与模型大小、序列长度相关;SemiAnalysis 测试 70B 模型在 256 H100 集群上每秒约 100 万–200 万 token 量级)。训练 10T token 所需 GPU‑天与 GPU 成本直接推动 NVIDIA 数据中心业务收入 2025 财年(截至 2024 年 7 月)已同比翻倍至超 400 亿美元(NVIDIA 财报)。
下游
- 模型能力提升:MMLU、HumanEval、MATH、长文理解等评测分数与训练 token 数呈对数线性关系。Google DeepMind 在其 2023 年论文中展示,同样参数量下,训练 token 每增加 10 倍,MMLU 得分提升约 3–5 个百分点(模型与数据配比相关,非绝对)。
- 微调生态:基模型训练 token 越充分,下游微调所需 token 越少。例如 2024 年 Qwen2.5‑7B 仅需千条指令即达到优秀对齐水平(阿里云公开技术博客),显示预训练 token 的规模红利。
- 合成数据生成闭环:强基模型被用于生成新训练 token(推理链、代码解释、学科问答),再喂养给次代模型或小模型蒸馏,形成数据飞轮。该模式由 OpenAI、Google 等大厂主导,2024 年已出现专门售卖 AI 生成训练 token 的初创企业(如 Unsloth 等)。
- 推理降本:充足训练 token 使较小模型能达到此前只有大模型才有的能力,降低推理成本。例如 7B 模型在 15T token 训练后在部分任务上性能媲美 70B 旧模型,极大推动端侧 AI 和消费电子本地模型部署。
- 算力与能源消耗:每额外 10T token 训练(密集模型)带来约数千万至上亿美元增量硬件投资,拉动数据中心建设、电力、冷却需求。2024 年全球数据中心用电量中 AI 相关占比估计约 5%–8%(IEA 2024 电力报告),且快速上升。
受益公司
| 类别 | 代表企业 | 受益逻辑 | 公开数字/口径(2024 年) |
|---|---|---|---|
| 大模型开发商 | OpenAI、Google、Anthropic、Meta、阿里、字节跳动 | 直接扩大训练 token 数提升模型竞争力 | Meta LLaMA 3 公开训练 token 15T+;Qwen 2.5 文档显示多阶段 18T(2024 年博客);OpenAI、Google 未公开具体 token 数 |
| GPU 及加速芯片 | NVIDIA、AMD | 训练 token 增长推动 GPU 出货量 | NVIDIA 数据中心收入 FY25 Q2 $26.3B,同比 +154%(NVIDIA 2024 年 8 月财报) |
| 云基础设施 | AWS、Azure、GCP、CoreWeave | 大模型训练/推理云服务收入爆发 | 三大云厂商 2024 年 Q2 合计 AI 相关收入增长显著,Azure AI 服务同比增长 ~30%(微软 2024 年 Q4 FY24 财报口径) |
| 存储与网络 | 博通、Marvell、Arista | GPU 集群对高速互联和存力需求剧增 | 博通 2024 财年 AI 网络收入超 $10B(博通 2024 年 12 月财报) |
| 数据工程 | Scale AI、Appen、Labelbox | 数据清洗与合成 token 服务需求上升 | Scale AI 2024 年估值 $13.8B(二级市场数据 2024 年 5 月),年合同收入同比大幅增长 |
| 能源与基建 | 施耐德、Vertiv、NextEra Energy | 训练中心电力与冷却需求猛增 | 相关公司企业价值与数据中心签约容量增长,施耐德 2024 年有机增长超 10%(公司指引) |
部分未上市公司(如 OpenAI、Anthropic)未披露财务细节,市场份额和 token 相关营收仅是机构估算,实际数据待核实。
市场规模
训练 token 对应的直接市场包括数据采购清洗、算力租赁及相关基础设施,目前缺乏专门针对“训练 token”的独立市场统计,但可以从算力与数据市场拆分估算。
- 数据服务市场:据 Grand View Research 报告(2024 年 3 月),全球 AI 数据服务市场规模 2023 年约 28 亿美元,预计 2024 年约 35 亿–40 亿美元,2025 年将超 50 亿美元,2023–2030 年复合增长率约 26%。其中涉及训练 token 准备(清洗、标注、合成)的份额约占六成。
- 训练算力市场:训练 token 消耗的 GPU‑时。2024 年全球 AI 训练芯片市场约 500 亿–600 亿美元(包含 NVIDIA、AMD 产品及云训练服务折算,主要依据 NVIDIA 2024 年数据中心收入减去一定比例推理折算;SemiAnalysis 测算推理占比约 50%–60%,训练占 40%–50%),按此推算训练侧规模约 250 亿–300 亿美元。训练 token 每增长一个数量级,该细分市场同步扩展。
- 多模态 token 增量:视频生成模型(如 Runway、Pika、Sora)对视觉 token 的消耗是文本模型的几个数量级。据 Epoch AI 2024 年估算,视频模型单次训练 token 可轻松达到百万亿量级(如果视频帧被离散化),其市场初具雏形,相关算力需求将成为未来 3–5 年重要增长极。
注:以上市场规模为多方数据交叉估算所得,并非精确统计。具体口径已标注,市场界定因人而异。
玩家对比
基于公开信息,对比 2024 年底各代表性模型的训练 token 数及相关参数:
| 模型 | 参数量 | 公开训练 token 数 | D/N 比(文本) | 多模态 token? | 来源 |
|---|---|---|---|---|---|
| LLaMA 3.1 (8B) | 8B dense | 15T+ | ~1875:1 | 纯文本 | Meta 2024 技术报告 |
| LLaMA 3.1 (70B) | 70B dense | 15T+ | ~214:1 | 纯文本 | 同上 |
| Qwen2.5‑7B | 7B dense | 18T(多阶段) | ~2570:1 | 纯文本 | 阿里云 2024 年 9 月技术博客 |
| DeepSeek‑V2 | 236B(激活 21B) | 8.1T(文本) | 相对激活参数 ~386:1 | 否 | DeepSeek 2024 年 arXiv:2405.04434 |
| Mistral Large 2 | 123B | 未公开 | 推测数十 T | 否 | 公开资料未见确切数据 |
| GPT‑4 Turbo | 未公开 | 未公开,推测数十 T | 无数据 | 多模态 | 未公开 |
| Gemini 1.5 Pro | 未公开 | 未公开(包含大量多模态数据) | 无数据 | 多模态原生 | Google 博客 2024 年披露架构但未公布 token 量 |
| Claude 3.5 Sonnet | 未公开 | 未公开 | 无数据 | 多模态 | Anthropic 未公开训练细节 |
横评可见:开源社区倾向公开 token 数以展示透明度;闭源大厂对 token 数秘而不宣,但一般认为整体 token 量级已达数十万亿。多模态玩家因引入视觉 token,总 token 数往往畸高但难以对比。投资者跟踪模型能力提升时,应结合 token 质量与评测成绩,而不仅看绝对 token 数量。
风险
- 数据枯竭与质量瓶颈:Epoch AI 在 2024 年预测,高质量文本数据可能在 2026–2028 年消耗殆尽,届时训练 token 的增长将更多依赖合成数据或多模态 token,可能带来模型能力强均衡但事实准确度下降的困扰。
- 合成数据退化风险:基于合成 token 反复训练可能导致模型分布塌缩,准确性降低。Nature 2024 年相关研究已引发警觉,监管机构可能对合成数据比例设置上限。
- 版权与合规成本:全球数据版权诉讼频发(如纽约时报诉 OpenAI 案 2023 年年底提起),可能导致部分高质量 token(受版权保护的书籍、新闻)被剔除,抬高合法数据获取成本,减慢 token 累积速度。
- 算力投资回报不确定性:训练 token 数继续指数增长可能面临边际能力提升趋近饱和,巨额算力投入可能难以转化为对应的模型能力跃升,影响资本回报预期。
- 多模态 token 的泡沫:大量视觉 token 可能掩盖文本能力的真实进展。如果把影像 token 简单计入总 token 数,投资者可能高估模型的语言理解能力,导致资源错配。
- 地缘政治与出口管制:高端 GPU 对中国企业的出口限制(如 2023 年 10 月美国 BIS 规则)直接钳制部分厂商扩大训练 token 的能力,造成国内外 token 能力差距可能拉大。
误读纠偏
-
误读:“训练 token 越多,模型必定越强” 纠正:质量比数量更重要。1T 高质量、高多样性 token 的综合效果远超 10T 低质重复数据。后期退火加入的高质量 token 虽仅占总量千分之几,却可能显著提升指令跟随和安全性。重复过多还会导致模型过拟合,泛化能力下降(DeepSeek 技术报告中均强调数据重复对性能的伤害)。
-
误读:“MoE 模型的 token 数等效于密集模型” 纠正:MoE 模型每次仅激活部分专家,同等训练 token 数下,每个 token 的有效计算量较低。对比时应以“激活参数每 token 计算量”作为公平标尺,或直接参照最终能力与成本比。否则会严重低估密集模型的 token 实效。
-
误读:“总训练 token 数可以跨模型横向直接比较” 纠正:分词器、数据管道、多模态 token 占比、重复率等因素各不相同,简单的总数对比可能误导。行业惯例是区分文本 token 与多模态 token,并注明数据重复度。
-
误读:“合成 token 等同于真实 token” 纠正:合成 token 在事实密度、多样性和分布完整性上有缺陷,不宜完全等同于源自真实人类生成的 token。当前业界对合成数据的有效当量尚无统一折算系数。
最新事件
- 2024 年 7 月:Meta 发布 LLaMA 3.1 405B,虽未增加训练 token(15T 同 LLaMA 3),但通过更优数据混合与后训练提升性能,显示 token 数不是唯一变量。
- 2024 年 9 月:阿里云 Qwen2.5 系列发布,训练 token 达 18T(多阶段),在与相同参数量的 LLaMA 3 对比中部分任务胜出,高质量 token 的选择和配比被强调为核心优势。
- 2024 年 10 月:Epoch AI 发布更新的数据预测,指出现有互联网高质量文本数据将在 2027 年左右进入存量消耗阶段,合成数据占比快速上升,并呼吁出台 token 质量披露标准。
- 2024 年 12 月:NVIDIA 发布 B200 及 GB200 平台,宣称在大模型训练任务上 token 处理吞吐较 H100 提升 4 倍,这将显著降低训练超大规模 token 数的成本,可能催生新一轮 token 竞赛。
- 2025 年 1 月:中国某大模型开发商据外媒报道(未经官方确认)正训练超 100T token 的多模态模型,若属实将创公开记录,但官方未回应(公开资料未见官方确认)。
- 2023–2024 年多起版权诉讼:以《纽约时报》诉 OpenAI 为代表,对使用版权材料训练 token 的合法性提出挑战。2024 年部分数据经销商已开始提供经版权授权的 token 数据产品,定价高于普通清洗数据数倍至数十倍。
跟踪指标
- 新发布模型的公开训练 token 数:持续关注 Meta、阿里、Mistral、DeepSeek 等开源/半开源玩家的技术报告,获取真实 D 值。
- D/N 比变化趋势:每月汇总典型模型的 D/N 比,判断行业对过度训练的偏好演进。
- 优质文本数据余量预估:追踪 Epoch AI、Allen AI 等机构的数据存量报告,评估数据枯竭时间线。
- 合成数据占比与模型退化案例:监控学术界关于模型崩溃的研究论文及实际模型失败案例。
- 训练芯片出货量与云训练收入:NVIDIA 季度数据中心收入、AMD 数据中心 GPU 销售、三大云厂商 AI 训练营收增速,验证 token 增长转化为硬需求。
- 多模态 token 标准化进展:关注 ISO/IEC 等机构对 AI 数据度量标准的制定,或行业联盟(如 Frontier Model Forum)的披露指南。
- 版权法案动态:欧美及中国对于 AI 训练使用受版权保护数据的立法进展,直接决定可用的高质量 token 池大小。
- 单 token 训练成本:由 GPU 小时价格和训练吞吐估算,近似 = (集群摊销成本 + 电力成本) / (有效 token 吞吐 * 训练时间),作为衡量数据工程效率的衍出指标。
信源
- Hoffmann, J. et al. (2022). Training Compute‑Optimal Large Language Models. arXiv:2203.15556。— Chinchilla 缩放定律核心文献。
- Touvron, H. et al. (2023). LLaMA 2: Open Foundation and Fine‑Tuned Chat Models. arXiv:2307.09288;Meta (2024). The Llama 3 Herd of Models. — 展示高 D/N 比实践。
- DeepSeek‑AI (2024). DeepSeek‑V2: A Strong, Economical, and Efficient Mixture‑of‑Experts Language Model. arXiv:2405.04434。— MoE + 高 token 训练例证。
- Alibaba Cloud (2024). Qwen2.5 Technical Blog & Report — 18T token 多阶段训练公开说明。
- Epoch AI (2023–2025). Data & Compute Trends in Large‑Scale AI. epochai.org — 数据存量与短缺预测。
- Common Crawl (2024). Crawl Statistics;RedPajama‑v2、Dolma 数据工程日志 — 提供真实 token 转化率参考。
- SemiAnalysis (2024). AI Cluster & Cost Model — 训练 token 成本估算依据。
- Grand View Research (2024). AI Data Services Market Analysis Report — 数据服务市场规模。
- NVIDIA Corporation (2024). FY25 Quarter 2 Financial Results — GPU 数据中心收入数据。
- IEA (2024). Electricity 2024 — 全球数据中心电力消费与 AI 占比估算。
声明:本文所含市场数据、财务数字及公司估值均来自公开财报、行业报告及专业媒体估算,已尽力标明年份、口径与来源。部分数字因企业未完整披露,仍属于行业合理推算,仅供参考,不可直接作为投资依据。不构成任何买卖建议或涨跌预测。