模型层 开放阅读

训练 token 数

Training Tokens

概念 ID
training-tokens
更新时间
2026-05-29
来源数量
待补

训练 token 数

3 秒看懂

“训练 token 数”是衡量大语言模型“阅读量”的核心指标。一个 token 约等于 0.75 个英文单词或 1–2 个汉字。它直接决定模型的知识储备、推理强度与训练成本。同等架构下,训练 token 越多,模型能力越强,但边际收益服从 Chinchilla 缩放定律——无限堆 token 并不经济。当前前沿模型已从千亿级 token(GPT‑3 约 300B)迈入十万亿级时代(LLaMA 3 超 15T,部分多模态模型超 50T)。该指标把数据规模、算力开销、训练时长捆在一起,是衡量大模型“起跑线”的第一把尺子。

3 分钟产业解释

训练 token 数指模型完整训练周期内实际参与正向与反向传播的 token 总个数,通常以 B(10⁹)或 T(10¹²)为单位。它不等于磁盘上的原始数据集大小——原始语料经过去重、过滤、分词后,实际可用的 token 数通常只有原始数据的 30%–60%(行业经验,2023 年 Common Crawl 到可用训练语料的转化率约 40%–50%,RedPajama‑v2 公开流水线观察也佐证类似比例的损耗)。

在产业实践中,训练 token 数与参数量共同决定总算力预算。根据 2022 年 Hoffmann 等提出的 Chinchilla 定律,在固定计算量 C 下,每一个参数最优配比约 20 个训练 token。然而 2023–2025 年产业明显偏向“过度训练”(overtraining),即在较小模型上喂入远超 20:1 的 token,追求更优推理成本和部署灵活性。例如 Meta 在 2024 年公开的 LLaMA 3 系列 8B 和 70B 模型均使用超 15T token 进行训练,D/N 比达数百比一(来源:Meta 2024 技术报告《The Llama 3 Herd of Models》)。这意味着训练 token 数的竞争已不只是算力竞赛,更是数据工程与合成数据能力的角力。

训练 token 数还直接换算成 GPU‑时。以 Chinchilla 公式近似,1T token 在训练一个 70B 密集模型时约需 6×10²³ FLOPs 量级(正向 2N + 反向 4N = 6N per token),实际集群利用率假设 50%(包含通信、故障恢复),需要数千张 H100 GPU 连续运行数周乃至数月,成本可达数千万美元(2024 年云计算租用价格估算;SemiAnalysis 等对 10T+ 训练集群成本拆分,推算约 0.5 亿–1.5 亿美元量级)。因此训练 token 数的扩大不仅压迫数据供应链,更直接推高硬件采购、能源消耗与数据中心投资。

技术原理

1. Tokenization 流水线 文本 token 化通过字节对编码(BPE)或 SentencePiece 等分词器,将自然语言切分为子词序列。词表大小直接决定相同语义内容对应的 token 数量:GPT‑4 所用 tiktoken 词表约 100k,LLaMA 系列早期 32k、LLaMA 3 升至 128k(来源:公开技术报告),同一段中文语料,LLaMA 3 的 token 数可能比 GPT‑4 少 10–20%。跨模型对比训练 token 数时必须注意词表偏差。

图像、音频等多模态数据则通过独立编码器(如 ViT 的 patch embedding、VQ‑VAE 的离散编码)转换为视觉 token 或音频 token,这些 token 的信息密度与文本 token 根本不同,但当前业界常将二者简单加总为“总训练 token 数”,标准化折算方法尚属空白。

2. 数据飞轮与 token 形成 原始数据(PB 级)进入训练前必经多道工序:文档级/段落级去重(MinHash、SimHash)、质量过滤(困惑度评分、语言识别、有害内容筛除)、分词、序列打包(packing,将短序列拼接至最大上下文长度以提高 GPU 利用率),最后按知识、代码、数学、多语言等比例混配成批次。这几步造成的 token 损耗在开源项目 Dolma、RedPajama‑v2 中有公开日志:从 Common Crawl 原始 WARC 文件到最终训练 token,缩减比例约 50%–70%。

3. 训练中的 token 消费 在训练循环中,每个 token 依次经历前向与反向传播,消耗固定的 FLOPs(参数量决定)。现代训练系统通过流水线并行、张量并行、数据并行将 token 批次拆分到数千 GPU 上;梯度累积步数允许在保持有效批大小不变的情况下降低显存开销。对于 MoE 模型,每 token 仅激活部分专家,有效计算量低于等效密集模型,但 token 路由与跨节点 All‑to‑All 通信会带来额外的延迟和带宽消耗。这意味着 MoE 模型在相同硬件环境下可处理更多训练 token,但真实吞吐增益需扣除通信开销。

4. 退火与重复 token 的价值 训练后期,研究团队常引入极少量(几亿到几百亿)极高品质 token 进行退火(annealing),并以衰减的学习率反复训练(通常 1–3 个 epoch)。DeepSeek‑V2 技术报告(2024 年 arXiv:2405.04434)就提到在退火阶段引入高质量对话与推理数据,虽 token 数占比极小,却对指令跟随、安全性和事实准确度提升显著。这种“质量杠杆”效应说明 token 数指标需要与 token 质量联合评估。

5. 合成 token 的进入 从 2023 年起,合成数据被大规模用于弥补自然数据枯竭。合成 token 由另一 AI 模型生成(如使用 GPT‑4 生成推理链、数学题解),经清洗后混入训练语料。其生成成本远低于人工标注,但可能引入模型崩溃(model collapse)风险——反复在合成数据上训练会导致分布塌缩(Nature 2024 年相关论文警示)。目前行业尚无公认标准来计量合成 token 的“有效当量”。

关键参数

  1. 训练总 Token 数(D):最常用的公开指标,以 T 为单位。未标注清洗损失时,通常指数据加权后的有效 token 总数。
  2. Token‑参数比(D/N):衡量过度训练程度。Chinchilla 最优线约 20:1,2024–2025 年多数前沿模型 D/N 超 100:1,部分小模型达到 1000:1 以上。
  3. 数据重复度(epochs):同一数据被重复训练的平均次数。理想状态下 epochs < 1,表示数据量充足。LLaMA 3 15T 的训练据称所有数据 epoch 数小于 1(Meta 2024 报告暗示)。
  4. 有效 token 率:原始数据转化为训练 token 的比例,反映数据工程效率,常见值 0.3–0.7。
  5. Token 质量评分:基于数据源的教育价值、事实密度、多样性等进行加权评分。例如教科书、维基百科、ArXiv 论文的评分通常数倍于普通网页。行业内无统一标尺,各实验室自建评估器。
  6. 长上下文 token 占比:使用 32k、128k 乃至 1M 上下文训练时,长序列 token 占整体 token 的比例。长上下文利用不足则浪费算力。
  7. 多模态 token 当量系数:试图换算视觉/音频 token 对文本能力的贡献,目前尚无公认标准,各厂商研究阶段(公开资料未见统一值)。

技术路线

大模型训练 token 数与架构的选择形成几条鲜明路线:

路线代表案例D/N 比优势挑战技术特征
密集小参数量 + 海量 tokenLLaMA 3 8B (15T);Mistral 7B v0.3(推测约 6–8T)数百至上千推理成本极低,部署灵活数据需求极大,过拟合风险}需合成数据补充极致优化推理,适合端侧与边缘
密集大参数量 + 适中 tokenChinchilla‑70B (1.4T);早期 GPT‑4 推测20:1 附近参数利用率理论最优推理昂贵,部署成本高遵循缩放定律,研究基准
MoE 稀疏 + 高 tokenDeepSeek‑V2/V3;Mixtral 8x22B;Qwen2.5‑MoE 系相对激活参数 40:1–100:1总参数量大,训练效率高专家负载均衡困难,通信开销大每 token 仅激活部分参数,等效参数量大
多模态混合 tokenGemini 系列;GPT‑4o;视频生成模型 Sora 类文本与视觉 token 混计,D/N 难统一多模态原生能力token 信息密度不一,效用难横向对比将图像、视频像素转化为离散 token,与文本混合训练

2024 年以来,“过度训练 + 多阶段退火”成为主流策略,且多模态模型普遍将视觉 token 直接纳入训练总 token 中。例如,某多模态模型可能宣称训练 token 数达 50T,但其中 70% 是视觉 token(公开资料未见精确比例,系行业合理推测)。这导致定义出现泛化,投资分析和研究对比时须拆分文本与多模态 token。

上游

训练 token 数的膨胀直接拉动上游产业链:

  • 数据获取:Common Crawl 等网络爬虫每月采集数量 PB 级原始网页。此外书籍、新闻媒体、学术论文、代码仓库(GitHub)及合成数据平台构成主要语料来源。版权法规(如欧盟 DSM 指令、美国生成式 AI 版权白皮书)正日益收紧,合规获取成本上升。
  • 清洗与标注:数据清洗服务商(Scale AI、Appen、Surge AI 等)按 token 或按时计费,提供去重、过滤、事实性验证等。2024 年数据加工市场规模约 35 亿–50 亿美元(Grand View Research 2024 年针对 AI 数据服务报告),预计 2025–2026 年以 25%–35% CAGR 增长。合成数据生成平台(如 Gretel、Hazy)提供低成本 token 补充。
  • 分词工具:tiktoken、HuggingFace tokenizers、SentencePiece 等词表构建与 token 化工具是数据流水线的枢纽,性能直接影响数据吞吐。
  • 存储与网络:PB 级数据湖与高速分布式文件系统(如 Weka、NetApp)加 InfiniBand / RoCE 网络是训练集群的标配。每增加 10T token 意味着训练前需要约 5–20 PB 的原始数据暂存,数据加载 I/O 瓶颈愈发突出。
  • 算力硬件:NVIDIA H100/H200/B200 系列 GPU、AMD MI300X 等加速芯片是 token 消费的引擎。2024 年单张 H100 在密集模型训练中典型吞吐约为每秒数万 token(与模型大小、序列长度相关;SemiAnalysis 测试 70B 模型在 256 H100 集群上每秒约 100 万–200 万 token 量级)。训练 10T token 所需 GPU‑天与 GPU 成本直接推动 NVIDIA 数据中心业务收入 2025 财年(截至 2024 年 7 月)已同比翻倍至超 400 亿美元(NVIDIA 财报)。

下游

  • 模型能力提升:MMLU、HumanEval、MATH、长文理解等评测分数与训练 token 数呈对数线性关系。Google DeepMind 在其 2023 年论文中展示,同样参数量下,训练 token 每增加 10 倍,MMLU 得分提升约 3–5 个百分点(模型与数据配比相关,非绝对)。
  • 微调生态:基模型训练 token 越充分,下游微调所需 token 越少。例如 2024 年 Qwen2.5‑7B 仅需千条指令即达到优秀对齐水平(阿里云公开技术博客),显示预训练 token 的规模红利。
  • 合成数据生成闭环:强基模型被用于生成新训练 token(推理链、代码解释、学科问答),再喂养给次代模型或小模型蒸馏,形成数据飞轮。该模式由 OpenAI、Google 等大厂主导,2024 年已出现专门售卖 AI 生成训练 token 的初创企业(如 Unsloth 等)。
  • 推理降本:充足训练 token 使较小模型能达到此前只有大模型才有的能力,降低推理成本。例如 7B 模型在 15T token 训练后在部分任务上性能媲美 70B 旧模型,极大推动端侧 AI 和消费电子本地模型部署。
  • 算力与能源消耗:每额外 10T token 训练(密集模型)带来约数千万至上亿美元增量硬件投资,拉动数据中心建设、电力、冷却需求。2024 年全球数据中心用电量中 AI 相关占比估计约 5%–8%(IEA 2024 电力报告),且快速上升。

受益公司

类别代表企业受益逻辑公开数字/口径(2024 年)
大模型开发商OpenAI、Google、Anthropic、Meta、阿里、字节跳动直接扩大训练 token 数提升模型竞争力Meta LLaMA 3 公开训练 token 15T+;Qwen 2.5 文档显示多阶段 18T(2024 年博客);OpenAI、Google 未公开具体 token 数
GPU 及加速芯片NVIDIA、AMD训练 token 增长推动 GPU 出货量NVIDIA 数据中心收入 FY25 Q2 $26.3B,同比 +154%(NVIDIA 2024 年 8 月财报)
云基础设施AWS、Azure、GCP、CoreWeave大模型训练/推理云服务收入爆发三大云厂商 2024 年 Q2 合计 AI 相关收入增长显著,Azure AI 服务同比增长 ~30%(微软 2024 年 Q4 FY24 财报口径)
存储与网络博通、Marvell、AristaGPU 集群对高速互联和存力需求剧增博通 2024 财年 AI 网络收入超 $10B(博通 2024 年 12 月财报)
数据工程Scale AI、Appen、Labelbox数据清洗与合成 token 服务需求上升Scale AI 2024 年估值 $13.8B(二级市场数据 2024 年 5 月),年合同收入同比大幅增长
能源与基建施耐德、Vertiv、NextEra Energy训练中心电力与冷却需求猛增相关公司企业价值与数据中心签约容量增长,施耐德 2024 年有机增长超 10%(公司指引)

部分未上市公司(如 OpenAI、Anthropic)未披露财务细节,市场份额和 token 相关营收仅是机构估算,实际数据待核实。

市场规模

训练 token 对应的直接市场包括数据采购清洗、算力租赁及相关基础设施,目前缺乏专门针对“训练 token”的独立市场统计,但可以从算力与数据市场拆分估算。

  • 数据服务市场:据 Grand View Research 报告(2024 年 3 月),全球 AI 数据服务市场规模 2023 年约 28 亿美元,预计 2024 年约 35 亿–40 亿美元,2025 年将超 50 亿美元,2023–2030 年复合增长率约 26%。其中涉及训练 token 准备(清洗、标注、合成)的份额约占六成。
  • 训练算力市场:训练 token 消耗的 GPU‑时。2024 年全球 AI 训练芯片市场约 500 亿–600 亿美元(包含 NVIDIA、AMD 产品及云训练服务折算,主要依据 NVIDIA 2024 年数据中心收入减去一定比例推理折算;SemiAnalysis 测算推理占比约 50%–60%,训练占 40%–50%),按此推算训练侧规模约 250 亿–300 亿美元。训练 token 每增长一个数量级,该细分市场同步扩展。
  • 多模态 token 增量:视频生成模型(如 Runway、Pika、Sora)对视觉 token 的消耗是文本模型的几个数量级。据 Epoch AI 2024 年估算,视频模型单次训练 token 可轻松达到百万亿量级(如果视频帧被离散化),其市场初具雏形,相关算力需求将成为未来 3–5 年重要增长极。

注:以上市场规模为多方数据交叉估算所得,并非精确统计。具体口径已标注,市场界定因人而异。

玩家对比

基于公开信息,对比 2024 年底各代表性模型的训练 token 数及相关参数:

模型参数量公开训练 token 数D/N 比(文本)多模态 token?来源
LLaMA 3.1 (8B)8B dense15T+~1875:1纯文本Meta 2024 技术报告
LLaMA 3.1 (70B)70B dense15T+~214:1纯文本同上
Qwen2.5‑7B7B dense18T(多阶段)~2570:1纯文本阿里云 2024 年 9 月技术博客
DeepSeek‑V2236B(激活 21B)8.1T(文本)相对激活参数 ~386:1DeepSeek 2024 年 arXiv:2405.04434
Mistral Large 2123B未公开推测数十 T公开资料未见确切数据
GPT‑4 Turbo未公开未公开,推测数十 T无数据多模态未公开
Gemini 1.5 Pro未公开未公开(包含大量多模态数据)无数据多模态原生Google 博客 2024 年披露架构但未公布 token 量
Claude 3.5 Sonnet未公开未公开无数据多模态Anthropic 未公开训练细节

横评可见:开源社区倾向公开 token 数以展示透明度;闭源大厂对 token 数秘而不宣,但一般认为整体 token 量级已达数十万亿。多模态玩家因引入视觉 token,总 token 数往往畸高但难以对比。投资者跟踪模型能力提升时,应结合 token 质量与评测成绩,而不仅看绝对 token 数量。

风险

  1. 数据枯竭与质量瓶颈:Epoch AI 在 2024 年预测,高质量文本数据可能在 2026–2028 年消耗殆尽,届时训练 token 的增长将更多依赖合成数据或多模态 token,可能带来模型能力强均衡但事实准确度下降的困扰。
  2. 合成数据退化风险:基于合成 token 反复训练可能导致模型分布塌缩,准确性降低。Nature 2024 年相关研究已引发警觉,监管机构可能对合成数据比例设置上限。
  3. 版权与合规成本:全球数据版权诉讼频发(如纽约时报诉 OpenAI 案 2023 年年底提起),可能导致部分高质量 token(受版权保护的书籍、新闻)被剔除,抬高合法数据获取成本,减慢 token 累积速度。
  4. 算力投资回报不确定性:训练 token 数继续指数增长可能面临边际能力提升趋近饱和,巨额算力投入可能难以转化为对应的模型能力跃升,影响资本回报预期。
  5. 多模态 token 的泡沫:大量视觉 token 可能掩盖文本能力的真实进展。如果把影像 token 简单计入总 token 数,投资者可能高估模型的语言理解能力,导致资源错配。
  6. 地缘政治与出口管制:高端 GPU 对中国企业的出口限制(如 2023 年 10 月美国 BIS 规则)直接钳制部分厂商扩大训练 token 的能力,造成国内外 token 能力差距可能拉大。

误读纠偏

  • 误读:“训练 token 越多,模型必定越强” 纠正:质量比数量更重要。1T 高质量、高多样性 token 的综合效果远超 10T 低质重复数据。后期退火加入的高质量 token 虽仅占总量千分之几,却可能显著提升指令跟随和安全性。重复过多还会导致模型过拟合,泛化能力下降(DeepSeek 技术报告中均强调数据重复对性能的伤害)。

  • 误读:“MoE 模型的 token 数等效于密集模型” 纠正:MoE 模型每次仅激活部分专家,同等训练 token 数下,每个 token 的有效计算量较低。对比时应以“激活参数每 token 计算量”作为公平标尺,或直接参照最终能力与成本比。否则会严重低估密集模型的 token 实效。

  • 误读:“总训练 token 数可以跨模型横向直接比较” 纠正:分词器、数据管道、多模态 token 占比、重复率等因素各不相同,简单的总数对比可能误导。行业惯例是区分文本 token 与多模态 token,并注明数据重复度。

  • 误读:“合成 token 等同于真实 token” 纠正:合成 token 在事实密度、多样性和分布完整性上有缺陷,不宜完全等同于源自真实人类生成的 token。当前业界对合成数据的有效当量尚无统一折算系数。

最新事件

  • 2024 年 7 月:Meta 发布 LLaMA 3.1 405B,虽未增加训练 token(15T 同 LLaMA 3),但通过更优数据混合与后训练提升性能,显示 token 数不是唯一变量。
  • 2024 年 9 月:阿里云 Qwen2.5 系列发布,训练 token 达 18T(多阶段),在与相同参数量的 LLaMA 3 对比中部分任务胜出,高质量 token 的选择和配比被强调为核心优势。
  • 2024 年 10 月:Epoch AI 发布更新的数据预测,指出现有互联网高质量文本数据将在 2027 年左右进入存量消耗阶段,合成数据占比快速上升,并呼吁出台 token 质量披露标准。
  • 2024 年 12 月:NVIDIA 发布 B200 及 GB200 平台,宣称在大模型训练任务上 token 处理吞吐较 H100 提升 4 倍,这将显著降低训练超大规模 token 数的成本,可能催生新一轮 token 竞赛。
  • 2025 年 1 月:中国某大模型开发商据外媒报道(未经官方确认)正训练超 100T token 的多模态模型,若属实将创公开记录,但官方未回应(公开资料未见官方确认)。
  • 2023–2024 年多起版权诉讼:以《纽约时报》诉 OpenAI 为代表,对使用版权材料训练 token 的合法性提出挑战。2024 年部分数据经销商已开始提供经版权授权的 token 数据产品,定价高于普通清洗数据数倍至数十倍。

跟踪指标

  1. 新发布模型的公开训练 token 数:持续关注 Meta、阿里、Mistral、DeepSeek 等开源/半开源玩家的技术报告,获取真实 D 值。
  2. D/N 比变化趋势:每月汇总典型模型的 D/N 比,判断行业对过度训练的偏好演进。
  3. 优质文本数据余量预估:追踪 Epoch AI、Allen AI 等机构的数据存量报告,评估数据枯竭时间线。
  4. 合成数据占比与模型退化案例:监控学术界关于模型崩溃的研究论文及实际模型失败案例。
  5. 训练芯片出货量与云训练收入:NVIDIA 季度数据中心收入、AMD 数据中心 GPU 销售、三大云厂商 AI 训练营收增速,验证 token 增长转化为硬需求。
  6. 多模态 token 标准化进展:关注 ISO/IEC 等机构对 AI 数据度量标准的制定,或行业联盟(如 Frontier Model Forum)的披露指南。
  7. 版权法案动态:欧美及中国对于 AI 训练使用受版权保护数据的立法进展,直接决定可用的高质量 token 池大小。
  8. 单 token 训练成本:由 GPU 小时价格和训练吞吐估算,近似 = (集群摊销成本 + 电力成本) / (有效 token 吞吐 * 训练时间),作为衡量数据工程效率的衍出指标。

信源

  1. Hoffmann, J. et al. (2022). Training Compute‑Optimal Large Language Models. arXiv:2203.15556。— Chinchilla 缩放定律核心文献。
  2. Touvron, H. et al. (2023). LLaMA 2: Open Foundation and Fine‑Tuned Chat Models. arXiv:2307.09288;Meta (2024). The Llama 3 Herd of Models. — 展示高 D/N 比实践。
  3. DeepSeek‑AI (2024). DeepSeek‑V2: A Strong, Economical, and Efficient Mixture‑of‑Experts Language Model. arXiv:2405.04434。— MoE + 高 token 训练例证。
  4. Alibaba Cloud (2024). Qwen2.5 Technical Blog & Report — 18T token 多阶段训练公开说明。
  5. Epoch AI (2023–2025). Data & Compute Trends in Large‑Scale AI. epochai.org — 数据存量与短缺预测。
  6. Common Crawl (2024). Crawl Statistics;RedPajama‑v2、Dolma 数据工程日志 — 提供真实 token 转化率参考。
  7. SemiAnalysis (2024). AI Cluster & Cost Model — 训练 token 成本估算依据。
  8. Grand View Research (2024). AI Data Services Market Analysis Report — 数据服务市场规模。
  9. NVIDIA Corporation (2024). FY25 Quarter 2 Financial Results — GPU 数据中心收入数据。
  10. IEA (2024). Electricity 2024 — 全球数据中心电力消费与 AI 占比估算。

声明:本文所含市场数据、财务数字及公司估值均来自公开财报、行业报告及专业媒体估算,已尽力标明年份、口径与来源。部分数字因企业未完整披露,仍属于行业合理推算,仅供参考,不可直接作为投资依据。不构成任何买卖建议或涨跌预测。

source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型