模型层 开放阅读

下一个 token 预测

Next Token Prediction

概念 ID
next-token-prediction
更新时间
2026-05-29
来源数量
待补

下一个 token 预测

3秒看懂

下一个 token 预测,即让模型根据已有的文本序列,去猜测紧接着的最合理的一个词(token)。这是当前大语言模型(LLM)最核心的训练范式。你见到的生成式对话、代码补全、文档续写,其根本机制都是反复执行“给定上文,预测下一个词”这一简单任务。模型的规模、涌现能力,均建立在这一朴素目标之上。

3分钟产业解释

“下一个 token 预测”本质上是一项自监督学习任务:将一段原始文本分割成由 token 组成的序列,然后以“前 n−1 个 token 预测第 n 个 token”的形式,从海量无标注数据中构造训练样本。模型只需不断缩小预测概率分布与真实 token 之间的差距(通常用交叉熵损失),就能逐渐学会语法、事实、推理链条,甚至隐含的价值观。

产业价值在于:

  • 不需要人工标注:互联网上的文本本身即包含输入与标签,使模型能够吞噬数万亿 token 的数据。
  • 规模化定律(Scaling Law)基础:模型损失随计算量、参数、数据量的幂律下降,正是建立在此任务可无限扩展数据的特性之上。
  • 通用任务接口:训练完成后,通过将不同任务统一为“给定上文,输出下文”的形式(如指令微调),一个仅会预测下一个 token 的模型就可以回答问题、翻译、编程。

几乎所有大型基础模型(GPT 系列、PaLM、LLaMA 等)的预训练阶段,都以此任务为唯一目标。它是当前生成式 AI 热潮的根本动力。

15分钟专家深入

下一个 token 预测的形式化极为简洁。设序列为 x = (x_1, x_2, ..., x_T),模型对每个位置 t,基于历史 x_{<t} 输出下一个 token 的条件概率分布 p_\theta(x_t | x_{<t})。训练目标是最小化整个序列的负对数似然(即交叉熵):

mathcal(L)(\theta) = -frac(1){T} \sum_{t=1}^{T} \log p_\theta(x_t | x_{<t})

表面简单,但要实现高性能预测,模型必须内化:

  • 长程依赖:正确预测一段话的最后一个词,可能需要理解开头的人名、指代关系,甚至跨段落的状态。
  • 世界知识:如“巴黎是__的首都”,模型必须记忆事实。
  • 推理与多步演绎:数学推导、逻辑谜题的预测,要求模型在上下文窗口内执行隐式计算。
  • 对齐人类意图:即便是无标注文本中,下一个 token 的分布也已编码了社会规范、有用性与无害性倾向(如礼貌回复的统计优势)。后续的 RLHF 等只是强化这些特性。

在工程上,下一个 token 预测训练通常伴随如下关键技术:

  • 教师强制(Teacher Forcing):训练时总是将真实的历史 token 作为输入,而非模型自己生成的 token,保证并行计算和稳定收敛。
  • 因果注意力掩码:Transformer 解码器通过上三角掩码确保每个位置只能看到之前 token,防止信息泄露。
  • 词表与分词:token 的定义(BPE、SentencePiece)直接影响模型需要预测的空间大小,以及是否能够高效处理 multilingual、代码等场景。
  • 采样策略:训练时使用真实分布计算损失,而推理时可用贪心解码、Top‑k/Top‑p 采样、温度调节等,以平衡多样性与确定性。

最关键的量级感知:当前主流 LLM 的训练数据往往在数万亿 token 级别,单次训练可能执行 10²³ 次以上的浮点运算。所有的算力、显存、互联技术(HBM、NVLink、InfiniBand)都在服务于这个“猜词”游戏的极致优化。

技术原理

核心机制:从序列到预测

我们可以将自回归语言模型视为一个函数 f_\theta,它接受一段 token 序列 x_{<t},输出一个词语表大小的向量(logits),经过 softmax 转为概率分布 hat(y)_t。真实标签是 one‑hot 向量 y_t(对应真实下一个 token 的 id)。

输入序列:"人工智能 的 未来 是"
           ↓
       Tokenizer → [101, 202, 303, 404]   # 假设的id
           ↓
     Embedding层 + Transformer解码器(带因果掩码)
           ↓
       最后一层在位置t=4输出隐向量 h₄
           ↓
      Linear + Softmax → 词表大小维度的概率向量 ŷ₄
           ↓
       真实token“光明”对应id=505 → 交叉熵损失

因果自注意力机制原理

解码器的核心在于确保预测 x_t 时不能看到 x_t 及之后的任何信息。设输入序列的嵌入为 H \in mathbb(R)^{T \times d},注意力计算为:

text(Attention)(Q, K, V) = text(softmax)\left( frac(QK^T){sqrt(d_k)} + M \right) V

其中 M 为因果掩码,是一个上三角部分填充 -\infty 的矩阵(或将对应位置置为极大的负值),使得 softmax 后的权重在非法位置上为 0。例如 T=4 时掩码形状:

Mask = [[  0, -∞, -∞, -∞],
        [  0,  0, -∞, -∞],
        [  0,  0,  0, -∞],
        [  0,  0,  0,  0 ]]

训练时整个序列的预测并行进行:输入完整序列,通过掩码一次得到每个位置的预测输出,然后与真值比较。推理时则必须串行逐 token 生成,每一步都用之前生成的 token 作为历史。

关键参数与规模定性

  • 词表大小(V):通常 32k~256k token。Softmax 计算和词嵌入矩阵尺寸与 V 成正比,是新近 MoE 模型或小模型优化的重点。
  • 上下文长度(L):预训练时常见 2k~32k token,近来扩展到 128k 甚至 1M token。注意力复杂度为 O(L^2),长上下文依赖位置编码改进(RoPE、ALiBi)和稀疏注意力。
  • 模型参数总量:从数十亿到超千亿,其中前馈网络(FFN)占主要部分。下一个 token 预测任务对模型容量要求极高,参数低下会导致欠拟合,过高则需更多数据以避免记忆化。
  • 训练数据量(tokens):普遍遵从 Chinchilla 定律(约 20 倍 tokens/参数量 为计算最优),但实践中常采用过度训练以获取更强能力(如 LLaMA 系列数据比例更高)。具体数字因厂商未披露,需标示 [未充分披露]。

训练目标的变化:从下一 token 到多任务

尽管核心仍是下一个 token 预测,现代 LLM 训练常引入微小变形:

  • Span corruption / 填空:如 T5 的掩码语言模型,但主流自回归模型仍保持单纯的从左到右预测。
  • 多文档分界与特殊 token:在预训练中加入 <|endoftext|> 等分隔符,教会模型“开始新上下文”的概念,防止不同文档内容混淆。
  • 指令微调继续用相同目标:指令格式“用户:… 助手:…”只是将多轮对话包装为单一序列,模型仍然在预测助手回复部分的 token,目标函数不变。

技术演进史

  • N‑gram 语言模型(20世纪80‑90年代):统计每个单词基于前 n−1 个词出现的概率。受数据稀疏与维度灾难限制,无法捕捉长程语义。
  • 前神经网络时代(2000年代初):前馈神经网络语言模型(Bengio et al., 2003)将词映射为连续向量,使用固定长度上下文预测下一个词,首次实现语言模型的稠密表示。
  • 循环神经网络(RNN/LSTM, 2010年代初):RNN 天然适合序列建模,理论上可处理任意长历史,但梯度消失/爆炸、训练低效等问题突出。LSTM 的改进使其在语音识别、机器翻译中得到应用,但长文本生成质量仍有限。
  • Transformer 与自回归范式(2017‑2018):Vaswani 等提出 Transformer,解码器架构的自回归特性与下一个 token 预测完美契合。GPT 系列 (2018) 采用单向 Transformer 解码器,以大规模无监督预测任务进行预训练,然后针对下游任务微调,开启“预训练‑微调”纪元。
  • 规模化阶段(2019‑2022):GPT‑2 展示了仅靠下一个 token 预测即可造就的多任务能力,GPT‑3 进一步证明大规模自回归模型的零样本/少样本能力。Scaling Law 被实证,推动模型参数向千亿级跃进。同时,PaLM、Chinchilla 等研究优化了算力分配策略。
  • 对齐与产品化(2022至今):InstructGPT/ChatGPT 表明,在预训练文本预测的基础上,配合指令模板(依然是下一个 token 预测)和人类反馈强化学习,可将基础模型转化为安全、有用的助手。多模态模型(如 GPT‑4V)把图像编码成连续的视觉嵌入,但仍基于自回归范式仅预测下一个文本 token;即便某些原生多模态模型可能扩展预测目标,其核心自回归框架未变。
  • 前沿探索(当前):业界开始探讨非自回归生成、扩散语言模型等替代方案,但在大规模应用中,下一个 token 预测因其易扩展、高度成熟的基础设施生态,仍占据绝对主导。

技术路线对比

维度下一个 token 预测(自回归)掩码语言模型(MLM,如BERT)编码器‑解码器(如T5)
预测目标序列中每个后续 token随机掩码的 token缺损 span 的 token
方向性单向(从左到右)双向(可观察左右上下文)双向编码 + 单向解码
生成能力天然支持逐 token 生成不可直接用于自回归生成训练后需在解码器端自回归生成
训练效率(计算/样本)每个 token 均参与一次正向损失计算仅掩码位置的 token 计算损失,利用率约15%兼具两者,比较平衡
下游灵活性通过提示统一任务,零样本强微调表现优秀,但生成任务需额外适配适合生成与理解综合任务,但规模扩大有限
主流规模超大规模(≥100B)主流选择多在 数百M~数B 参数量,更大规模少见数十B参数量,近年多被自回归取代
典型代表GPT‑3/4, LLaMA, PaLMBERT, RoBERTaT5, BART

在产业实践中,因为生成式 AI 爆发,下一个 token 预测的简洁生成接口具有压倒性优势。MLM 类模型主要用于理解类任务(如检索、分类),但在基座模型领域正逐渐被强大的自回归模型通过 prompt 替代。

上下游

上游:

  • 数据生成与清洗:网页文本、书籍、代码库需经过滤、去重、质量分类,并分词成 token 序列。数据质量直接影响预测的准确性和模型安全性。
  • 算力基础设施:GPU/TPU 集群,高带宽内存、高速互联(InfiniBand/RoCE),分布式训练框架(Megatron‑LM, DeepSpeed)。并行策略(数据并行、张量并行、流水线并行、序列并行)均围绕下一个 token 预测的大规模计算图设计。
  • 分词算法与词表构建:BPE 或 SentencePiece 的分词器决定了预测的基本单元,其对多语言、代码紧凑度的影响直接关乎训练与推理成本。

下游:

  • 推理服务化:部署自回归模型,需要优化 KV 缓存内存、显存管理(vLLM、StreamingLLM)、连续批处理,以支撑高并发的逐 token 生成。
  • 微调与适配:在预训练好的下一个 token 预测模型基础上,进行监督微调(SFT)、强化学习(RLHF/DPO),将基本能力引导到特定业务场景。
  • 应用集成:聊天机器人、写作助手、代码生成工具、搜索引擎等,都直接消费模型输出的 token 流,并通过安全过滤器、内容审核模块二次处理。

关键指标

  • 困惑度(Perplexity, PPL):测试集上交叉熵损失的指数形式,直观表示模型对 token 序列的“平均分支因子”。PPL 越低,模型对数据压缩得越好,通常能力越强。是评估底层预测能力的核心指标。
  • 下游任务基准得分:MMLU(多任务准确率)、HellaSwag(常识推理)、HumanEval(代码生成)等,虽非直接衡量下一个 token 预测,却是实用能力的间接度量。
  • 训练吞吐量、数据 token 数、模型 FLOPS 利用率(MFU):工程关键指标,反映在给定算力下完成预训练的速度和效率。
  • 推理延迟与成本:首 token 延迟、每 token 生成时间,决定了用户体验和规模化运营的可行性。

供需与市场数据

下一个 token 预测作为训练范式本身不是一个可交易的商品,但其催生的模型训练与推理市场极为庞大。根据行业报告,全球大模型训练算力需求仍在以每年数倍的速度增长,训练集群规模从千卡级向万卡级跃迁。由于具体市场份额缺乏本次检索证据,此处不做硬数字引用。定性来看:

  • 对高性能 GPU(如 A100、H100、未来 B100)的需求几乎完全由自回归大模型训练和推理驱动。
  • 训练数据供给方(如 Common Crawl、书籍语料库、代码仓库)价值凸显,数据管线已成为模型差异化的关键来源。
  • 推理服务供应商(微软 Azure、 CoreWeave、各开源平台)都在针对自回归生成的计算模式进行架构优化。

代表公司与资本映射

  • OpenAI (GPT系列):下一个 token 预测产品化的最高标杆,GPT‑4 将自回归预测拓展到多模态,引领了此范式的主流化。估值和营收潜力巨大,但未上市。
  • Google DeepMind (Gemini/PaLM):探索下一个 token 预测与检索、工具使用的结合,将自回归能力整合进搜索和云计算生态。上市公司 Alphabet 的重要成长预期部分。
  • Meta (LLaMA):力推开源自回归模型,建立围绕此预测范式的开放生态,有望通过间接方式构建平台优势。盈利仍需观察。
  • Anthropic (Claude):专注对齐和安全的自回归模型,采用与 OpenAI 类似的技术范式,资金来源包括 Google、Salesforce 等,是下一代预测技术资本关注的明星初创。
  • 基础设施提供商(NVIDIA, AMD, 云厂商):资金流和业绩高度绑定大语言模型的训练与推理规模化需求,本质上是“下一个 token 预测”浪潮的运营商。

投资逻辑

投资与下一个 token 预测相关的标的,需理解该范式的两大特性:

  1. 顺规模化定律:只要有更多高质量数据和算力,模型能力就会持续提升。因此早期投入基础设施(GPU、数据中心、高速互联)、数据资产的企业具有先发优势。
  2. 赢家通吃与生态分化:模型层可能形成头部闭源(OpenAI、Google)与主流开源的二元结构。应用层则利用模型输出的 token 构建产品,关注用户留存和垂直壁垒。

风险点:

  • 下一个 token 预测的技术天花板(是否会遇到推理能力上限)仍存争议,一旦新范式确立,现有模型资产可能面临贬值。
  • 算力成本与推理经济性,可能会压缩纯模型提供商的利润率。
  • 监管及版权问题:训练数据所使用的文本来源、预测结果的安全性,可能引致合规风险。

常见误读纠偏

误读1:下一个 token 预测就是“鹦鹉学舌”,只是统计式记忆,没有真正的理解。 纠偏: 从信息论角度看,要达到极低的交叉熵,模型必须从数据中提取高度压缩的表示,这隐含了语法、语义、世界模型和推理算法。大量实验表明,模型能执行未经专门训练的多步数学推理、代码生成,这必须基于某种形式的内部算法学习,而非简单的模板匹配。当然,“是否真正理解”是哲学问题,但工程上其压缩表征足以泛化出复杂智能行为。

误读2:训练下一个 token 预测就是简单的“输入上文,输出下文”,与人类学习方式完全不同。 纠偏: 人类大量的学习也以预测未来、完成模式为基础(如语流接续、动作序列预测)。虽然不能完全等同,但“预测下一个”是许多自然智能系统的基础信号。现代训练加入了指令模板、工具使用轨迹等结构化数据,使得下一个 token 预测远超简单的“文本接龙”,融入了类似任务目标的信息。

学习路径

  1. 基础概念:阅读 Bengio 等人 2003 年的神经语言模型论文,理解下一个词预测的概率框架。
  2. 核心架构:学习 Transformer 原论文中解码器部分,并动手实现一个带有因果掩码的小语言模型,用于字符级或单词级预测。
  3. 动手微调:使用 HuggingFace 的 transformers 库,加载一个小型 GPT‑2 模型,用自己的文档进行微调,感受下一个 token 预测的数据格式、训练循环。
  4. 规模化实践:了解 DeepSpeed、Megatron‑LM 的并行策略,理解如何将损失函数分发到数千个 GPU 上计算。
  5. 前沿阅读:跟踪“Scaling Laws for Neural Language Models”(Kaplan et al., 2020)、“Training Compute‑Optimal Large Language Models”(Hoffmann et al., 2022),理解算力与数据配比。
  6. 反思与探索:阅读关于自回归极限的论文(如扩散模型在文本生成的应用),对比非自回归生成的可能性。

一句话总结

下一个 token 预测,是将世界知识压缩进参数、让模型学会思考和生成的通用引擎,驱动了现代人工智能从感知到认知的跨越。

延伸阅读与来源

  • A. Vaswani et al. “Attention is All You Need”, NeurIPS 2017. [arXiv:1706.03762]
  • A. Radford et al. “Improving Language Understanding by Generative Pre‑Training”, OpenAI 2018.
  • J. Kaplan et al. “Scaling Laws for Neural Language Models”, arXiv 2020. [arXiv:2001.08361]
  • J. Hoffmann et al. “Training Compute‑Optimal Large Language Models”, NeurIPS 2022. [arXiv:2203.15556]
  • L. Ouyang et al. “Training language models to follow instructions with human feedback”, NeurIPS 2022. [arXiv:2203.02155]
  • HuggingFace NLP Course (Chapter on causal language modeling) [https://huggingface.co/learn/nlp-course]
  • 各大模型技术报告:GPT‑4 Technical Report, PaLM 2 Technical Report, LLaMA 2: Open Foundation and Fine‑Tuned Chat Models.
  • 因本次检索未成功,所有技术描述来自已发表文献,具体量级标注均为通用知识或 [未充分披露]。
source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型