模型层 开放阅读

Token 预算

Token Budget

概念 ID
token-budget
更新时间
2026-05-29
来源数量
待补

Token 预算

3 秒看懂

Token 预算是对单次前向传播或生成任务中模型所能处理的最大 token 数量的硬约束。它直接决定模型能“看到”多少上下文、能输出多长的内容,并从根本上制约推理成本、显存占用和可以完成的任务类型。如果说参数规模是模型的“脑容量”,Token 预算就是模型的“工作记忆容量”与单次计算账单的上限。

3 分钟产业解释

在大语言模型(LLM)的工程体系中,Token 预算并非一个孤立的技术参数,而是一条贯穿训练、微调、推理、定价与产品设计的业务红线。训练阶段的 Token 预算体现为“训练总 token 数”(通常以万亿 token 为度量单位),它直接影响模型的知识密度与涌现能力;推理阶段的 Token 预算则由上下文窗口(输入上限)和最大生成长度(输出上限)共同定义,直接塑造产品的使用体验——例如代码助手能否理解整个代码仓库、智能体能否在一次会话中完成多步推理而不丢失记忆。

产业上,Token 预算已成为云计算成本核算的原子单元。各大模型服务商(如 OpenAI、Anthropic、Google、阿里云等)的 API 定价绝大部分以“每百万 tokens”计价,企业和开发者必须像管控财务预算那样规划 Token 使用,以防止单次调用成本失控。同时,Token 预算的膨胀(从早期的 2K 到如今的 128K、1M 甚至无限上下文的实验)推动了对更高效注意力机制、状态空间模型等基础架构的激进探索,因为原生 Transformer 的自注意力复杂度与序列长度呈二次方关系,直接限制 Token 预算的经济可行性。

15 分钟专家深入

Token 预算的概念根植于 Transformer 序列建模的本质。要深入理解其影响,需要同时审视三个维度:计算复杂度、访存瓶颈和对齐与任务设计

计算上,在标准的缩放点积注意力中,QK^T 矩阵的尺寸为 [batch, heads, seq_len, seq_len],计算量与 seq_len 的平方成正比。这意味着将 Token 预算从 4K 提升到 128K,在理论计算量上会带来约 1024 倍的膨胀。实践中,业界通过 FlashAttention 等 IO-aware 算子将序列维度的访存优化至极致,但并未改变 O(n²) 的复杂度本质,只是将瓶颈从显存带宽推向计算单元。当 Token 预算突破百万级别时,即使经过稀疏注意力、分块化处理(如 Ring Attention)或对硬件拓扑量身定制的序列并行策略,单次前向的硬件成本与延迟仍会急剧攀升,这使得百万 Token 预算至今仍主要为具备大规模集群的头部实验室所驾驭。

在训练侧,Token 预算呈现为“训练 token 总量”,是数据工程的顶层设计指标。Chinchilla 缩放定律给出指引:在给定计算量下,最优的模型参数规模与训练 token 数应同步放大,即每个参数大约对应 20 个训练 token(具体系数因模型架构而异,此处为方向性叙述)。因此,训练 Token 预算直接与训练总成本挂钩——训练一个 100B 参数的模型,若采用 2T token 的训练预算,仅数据预处理和工程调度就构成数千 GPU·年的投入。更深的隐含影响在于知识容量:训练 Token 预算不足会导致模型欠拟合,表现为知识覆盖狭窄、幻觉率升高;而过高的 Token 预算在边际收益递减的规律下会大幅浪费资本,因此如何依据“重复率”与“数据质量”精准制定训练 Token 预算是大模型训练工程的核心博弈点。

产品与安全方面,Token 预算常被简化为“上下文窗口大小”,但实则包含输入预算、输出预算与系统提示预算的细致切分。在实际部署中,开发者必须将指令(system prompt)、检索增强生成(RAG)的召回文档、多轮对话历史以及用户输入统合在一个 Token 预算内,任何超出上限的部分不得不被截断或压缩。这种截断行为可能致命地截断关键安全指令或任务上下文,从而引发“中间迷失”(lost in the middle)现象。因此,Token 预算的设计是产品体验与安全对齐的隐性结构工程师。

技术原理

Token 预算的技术本质可归结为对序列建模中“可用位置索引数量的限制”。其影响链条可以从下至上逐层拆解。

1. 位置编码的预算约束

在 Transformer 中,每个 token 被赋予一个位置编码向量,并与语义嵌入相加。位置编码方案(如可学习绝对位置编码、RoPE、ALiBi 等)对 Token 预算提供了根本性限制。对于训练时采用绝对位置编码的模型,其最大位置索引 max_position 一经训练便固化,推理时无法超越——这曾是早期 GPT-2(1024)、GPT-3(2048)的硬约束。相对的,旋转位置编码(RoPE)具有一定的外推能力,可以通过频率缩放(如 NTK-aware 缩放)将 Token 预算在原有基础上扩展 2~4 倍且不损失过多性能,这一技术被用于将 Llama 系列模型的 context window 从 2K 扩展到 32K 甚至更高。但外推并非无限:随着预算急速扩大,位置编码的分辨率下降低频信息丢失,最终仍需后训练阶段的续训(如针对长文本的微调)来真正“消化”扩展的 Token 预算。

2. 注意力机制的计算图与二次瓶颈

输入序列: x_1, x_2, ..., x_n          (n = Token 预算上限)
嵌入投影: Q = X·W_Q, K = X·W_K, V = X·W_V
注意力分数: S = Q·K^T            → 矩阵大小 [n, n] ,计算量 O(n²·d)
注意力权重: A = softmax(S / √d)
输出:      O = A·V               → 计算量 O(n²·d)

在标准的全自注意力(full self-attention)下,每一步生成都要基于所有历史 token 计算注意力分布。对于 Token 预算 n,注意力分数矩阵的内存占用为 2·n² 字节(假设 bfloat16),当 n=128K 时,该矩阵高达 32GB,已经接近或约占单张高端 GPU(如 H100 拥有 80GB HBM)的容量的一半,仅这一项就迫使序列必须跨卡分片或使用分块重计算。各种高效注意力变体通过稀疏注意力模式(局部窗口、长程步幅、基于哈希或基于低秩分解)打破 n×n 的全连接,但以牺牲信息流的完整性为代价,属于在 Token 预算与计算可行性之间的人为折衷。

3. KV Cache 的显存预算

自回归生成期间,每个历史 token 的 K 和 V 向量都被缓存,以避免重复计算。KV 缓存的显存占用公式为:

KV_cache_size = 2 × batch_size × layers × n × d_head × num_heads × bytes_per_param

对一个 7B 规模的模型(典型层数 32,头数 32,d_head=128),以 1 个 batch、1M Token 预算、FP16 存储估算,KV 缓存独占大约 512GB 显存。因此,Token 预算直接转化为显存预算,成为推理芯片(GPU 或定制 ASIC)的硬容量指标。这也是为何 HBM 容量与带宽成为大推理集群部署的核心约束,以及为何多查询注意力(MQA)和分组查询注意力(GQA)被广泛采用——它们通过共享 KV 头大幅压缩该缓存,等效提升可支持的 Token 预算。

4. 训练预算与计算量关系

训练 Token 预算(总训练 token 数 D)结合模型参数量 N,通过缩放定律估算总计算量 C ≈ 6 N D(前向+反向的大致系数)。这意味着训练预算每翻一倍,所需浮点运算量至少翻倍。优化的训练策略会监控评价损失(eval loss)随训练预算增长的变化曲线,当损失下降趋于平缓时,继续追加 Token 预算的效率递减,引导商业决策中的“停止点”。

技术演进史

  • 2017-2018:固定预算时代
    Transformer 原论文和 GPT-1 使用数百到 512 token 的预算,受限于训练数据和计算资源。BERT 的 512 token 长度成为分类任务的标配,非生成式架构的自然语言理解工作受该预算约束,长文档需粗暴截断。
  • 2019-2020:千级到万级探索
    GPT-2 提升至 1024,GPT-3 设定为 2048。随着内存优化技术(梯度检查点、混合精度)的出现,长序列训练成为可能。Reformer、Longformer 等提出稀疏注意力机制,试图以线性或 nlogn 复杂度扩展 Token 预算到数万,但通用性受限。
  • 2021-2022:RoPE 与高效长文本微调
    旋转位置编码被广泛采纳,结合线性偏置方法(ALiBi),模型在训练后通过微调可外推到 8K-32K。这一时期,32K 成为开源社区的高端配置,研究工作转向如何在不完全重训的前提下“解锁”训练时未见的 Token 预算。
  • 2023:商业化百 K 级窗口
    Anthropic 的 Claude 宣布 100K token 上下文,OpenAI 发布 GPT-4 Turbo 128K,Google Gemini 1.5 Pro 通过模型架构(如混合专家与高效注意力)直接支持百万 token 输入长度,展示了强大的长上下文建模能力。产业界将 Token 预算直接作为产品差异化卖点,并掀起“长上下文”评测竞赛。
  • 2024-至今:架构变革与准无限预算
    新兴的状态空间模型(如 Mamba、RWKV)将序列建模的复杂度降至线性,理论上 Token 预算仅受显存容量限制,不再直接关联计算量的平方增长。Transformer 方面,微软、Meta 等推出分块化的并行长序列方案(如 Ring Attention 配合序列并行),在数百个 GPU 上实现百万级 token 预算的完整注意力训练。Token 预算的军备竞赛已从“多长”转向“多深的理解和多高的信噪比”。

技术路线对比

由于本条目缺乏检索到的精确参数,以下对比以定性方式呈现,数值为一般性估算,不绑定特定厂商。

技术路线原生 Token 预算上限计算复杂度 vs. n长程依赖质量训练/扩展难度典型应用场景
全自注意力(基准)受显存限制,典型 2K~128KO(n²)高(理论上全局)中等到高(需并行策略)通用生成、通用对话
稀疏注意力(窗口+全局)可达 1M+(工程可实现)O(n·k) 或 O(n·log n)中等(依赖模式设计)中(需定制 mask)长文档摘要、代码库分析
线性化注意力理论上可接近显存极限O(n)较低(模型容量受限)低到中需要超高吞吐的流式处理
状态空间模型(SSM)未充分披露,可支持 1M+O(n)上下文检索强,推理弱?仍在快速演进长序列分类、DNA/时序、探索性生成
混合模型(注意力+SSM)方向性试验,可期百万级O(n·log n) ~ O(n)力求接近全注意力下一代通用基座模型

注:上述“Token 预算上限”为工程实现与精度可接受范围内的估算值,实际产品表现受训练策略、微调数据和量化水平影响巨大。

上下游

  • 上游硬件与基础设施:Token 预算直接拉动对高带宽内存(HBM)容量的需求,因为大 Token 预算的推理要求 KV 缓存能完全放在片上或近存。同时,多节点互联带宽(如 NVLink、InfiniBand、PCIe 5.0/6.0)决定序列并行效率,从而影响系统可实现的整体 Token 预算极限。上游受益方包括 GPU 制造商、HBM 颗粒厂商、高速互联芯片(Switch、Retimer)以及服务器组装商。
  • 下游应用与生态
    • 长上下文理解类产品(法律合同审查、医疗记录分析、企业知识库问答)将 Token 预算视为准入证——低于 100K token 则几乎无法完整处理单份文档。
    • 智能体与多步推理框架需要大 Token 预算来容纳规划、观察、反思的完整历史,Token 预算不足会直接导致任务失败。
    • API 经济:模型服务商的计费模式完全锚定 Token 使用量,因此开发者工具链中出现大量“Token 预算优化器”——通过缓存、提示词压缩、动态剪枝历史等手段降低 Token 消耗,直接形成 TO B 效率工具市场。

关键指标

  1. 最大上下文窗口(输入 Token 预算):产品宣传的核心数字,但并非越大越好,需配合有效利用率(如 RULER、Needle in a Haystack 得分)评估真实信息提取能力。
  2. 有效生成长度(输出 Token 预算):实际推理中模型的输出令牌上限,受到推理框架和 KV 缓存预分配影响。长输出场景(如生成一部小说)对预算要求不亚于输入。
  3. 总训练 Token 数(训练预算):反映模型“读了”多少数据,直接联系训练成本和知识广度。
  4. KV 缓存每 token 字节数2 × num_layers × num_key_value_heads × d_head × precision_bytes,此值决定特定硬件下 Token 预算的硬物理上限。
  5. 每百万 token 推理成本:综合反映硬件效率、模型压缩和 Token 预算策略的商业化指标。
  6. Token 截断率与信息丢失率:在实际部署中,由于输入超过预算而被丢弃的文本比例,是产品健康度的重要监控项。

供需与市场数据

由于搜索工具未能返回实时市场报告,本节仅提供方向性趋势描述,不作为投资建议。

  • 供给端,头部基础模型提供商正加速开放更大的上下文窗口,将其作为差异化战略。2024 年,多家主流 API 将默认 Token 预算提升至 128K 或更高,同时开始试点百万级窗口。供给侧的扩大直接挤压了早前专攻“长文本向量数据库”的中间件企业。
  • 需求端,根据企业调研的定性反馈,多数知识密集型应用(如客服、法务、研报分析)能接受的“实用” Token 预算下限约为 32K,当预算超过 128K 后,任务成功率提升的边际效应开始递减,但极个别场景(全代码库理解、长视频转录)仍渴求百万级预算。市场整体呈现两极分化:中小开发者追求费效比,在 4K~16K 区间通过 RAG 策略分解任务;大型企业与科研机构作为高 Token 预算的早期采纳者,直接推动高端推理集群的订单。
  • 成本结构上,据估算([未充分披露]),当前主流 GPU 云上每百万 token 推理成本中,计算与显存电力消耗占比超过 60%,且 Token 预算增大时,显存成本占比因 KV 缓存快速膨胀而显著上升,促使推理硬件向大容量定制化方向演进。随着 Token 预算的继续膨胀,推理成本曲线将由当前的近似线性转向非线性陡增。

代表公司与资本映射

  • OpenAI / Anthropic / Google / Meta:定义了 Token 预算的产品化标准,控制了最前沿的百万级上下文能力,其资本开支高度集中于训练更大 Token 预算所需的超算集群。
  • NVIDIA / AMD:作为推理硬件寡头,其 H100、MI300X 等 GPU 的 HBM 容量直接决定了单卡可支撑的 Token 预算上限,推动向更高 HBM 容量的迭代。下一代产品路标中,HBM 容量翻倍(如从 80GB 到 192GB)意味着 Token 预算的等效倍增,构成商业催化剂。
  • 云服务商(Azure、AWS、GCP、阿里云):大 Token 预算推理成为 GPU 实例高端规格的核心卖点,吸引高价值企业客户。
  • 初创与工具(Anthropic 虽大但算此列;上下文压缩/缓存类工具商):如 LangChain、MemGPT、形态各异的 prompt compressor,其价值建立在对 Token 预算的优化与虚拟化上,帮助用户在有限预算内实现更长逻辑链。
  • 开源生态(Meta Llama、Mistral、Qwen):通过发布可扩展上下文窗口的开源模型,让中小企业得以低成本享受高 Token 预算红利,加快商业落地。

投资逻辑

  1. 显存容量至上:Token 预算提升路径高度依赖单卡 HBM 容量与互联带宽。投资逻辑上,HBM 供应链(颗粒、封装、衬底)以及高带宽互联芯片会因大 Token 预算需求的普遍化而持续获得订单增量。
  2. 产品粘性与转换成本:企业用户一旦将工作流建立在某个高 Token 预算模型(例如将内部知识库的完整上下文交由特定模型处理),切换成本极高。因此,率先提供稳定高 Token 预算服务的厂商有望构筑 moat(护城河)。
  3. 降本工具链的价值:在 Token 成本尚未大幅下降的阶段,专注于“Token 预算优化”的软件层(缓存命中、提示压缩、动态路由小模型)具有短期爆发性需求。但随硬件效率改进和长窗口成为标配,该细分可能被侵蚀。
  4. 警惕“预算通胀”的资本浪费:无止境攀爬 Token 预算会迫使云厂商和 AI 实验室不断升级集群,带来重资产折旧风险。应关注模型在实际长上下文任务中的准确率/召回率曲线,寻找“有效预算”大于“纸面预算”的标的,即结构效率创新的公司。
  5. 训练 Token 预算的规模化转折:当训练数据 Token 预算接近高质量互联网文本文档的总体量时,合成数据与多模态数据将成为新的训练预算来源,带来数据工程工具链的投资机会。

常见误读纠偏

误读1:Token 预算就是上下文窗口长度,越长一定越好。
纠偏:上下文窗口长度只是硬上限,实际有效预算受位置编码外推质量、注意力信噪比及模型“记忆”容量影响。长窗口但准确率(如在多针大海捞针测试中)低的模型,其有效 Token 预算反而低,强制使用反而引入噪声,降低整体性能。另外,极长的 Token 预算可能导致延迟呈二次增长,影响交互体验,产品设计须在长与快之间取得平衡。

误读2:训练 Token 预算等同于数据量的简单相加,重复数据也能累积。
纠偏:训练 Token 预算的质量维度不可忽视。重复无信息密度的 token(如模板、低质网络爬虫内容)不仅浪费预算,还会导致模型过拟合噪音。实证研究发现,在总训练 token 数固定的情况下,高度去重与高质量筛选的数据集,其下游性能显著优于数量膨胀但质量参差的数据。因此,Token 预算的管理本质上是信息预算的有效分配,而非机械堆积。

学习路径

  • 入门:阅读 Jay Alammar 的《The Illustrated Transformer》可视化注意力机制,直观理解 token 如何在序列中交互。然后使用 OpenAI 的 Tokenizer 工具分析文本的 token 划分,建立对预算计量的体感。
  • 进阶:精读 FlashAttention 论文和 Tri Dao 的相关博客,学习如何通过算子融合和分块来突破 Token 预算的显存墙。同时,研读 Chinchilla 缩放定律论文,掌握训练 token 预算的经济学原理。
  • 深入:研究 Ring Attention、DeepSpeed Ulysses 及其序列并行实现,理解大规模 Token 预算在分布式系统上的工程实践。探索状态空间模型(如 Mamba)的线性复杂度原理,刷新对 Token 预算限制的认知框架。
  • 实践:在真实场景中设计一个需要大 Token 预算的应用(如多轮对话的客服 Agent),通过逐步放大上下文窗口,观察推理成本、延迟与任务成功率的变化,绘制出属于你自己的“有效 Token 预算曲线”。

一句话总结

Token 预算是大模型工作记忆的物理上限,定义了智能边界的经济学方程,而其膨胀史则映射了整个 AI 产业从架构创新到硬件竞赛的每一次脉搏。

延伸阅读与来源

source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型