Token Dropping
1 三秒看懂
Token Dropping(令牌丢弃) 是一种在大型语言模型(LLM)训练或推理过程中,动态识别并移除部分输入令牌(Token)以提高计算效率、降低显存占用和延迟的技术。核心思想是“舍弃冗余,保留关键”——通过轻量级评估模块,以可忽略的额外计算代价,换取数十个百分点的处理速度提升。该技术已成为实现成本可控、低延迟大模型服务的工程焦点之一,尤其在多轮对话、长文档分析和链式推理等场景中意义突出。值得注意的是,截至2025年4月,公开可查的行业统一标准或基准尚未建立,不同实现路径间的效率-性能折衷差异巨大。
2 三分钟产业解释
Token Dropping 并非训练或推理流程中的个别的技巧,而是整个大模型经济体系优化的关键杠杆。它的逻辑非常直接:输入文本中大量的衔接词、重复词、通用背景词,对最终语义贡献极小。以因果语言模型的自回归生成过程为例,一个1000令牌的对话历史,可能仅有200个令牌包含决定性信息;其余800个令牌的存储和计算,几乎都属于浪费。Token Dropping 通过在注意力计算前或计算过程中,筛选出这200个高价值令牌,使得后续运算的复杂度大幅降低。
在产业链中的位置:
- 直接作用层:模型架构内部(注意力层、前馈网络输入)和推理引擎中间表示。
- 上游依赖:算法理论(重要性评估器设计)、硬件稀疏计算能力(如NVIDIA Ampere Ada Hopper架构的2:4结构化稀疏)、训练框架的自定义层支持。
- 下游受益:云端大模型API供应商(降低单次调用成本、支撑更多并发)、边缘设备推理、实时交互应用(如游戏NPC、同声传译)、大规模文本处理流水线(如法律文书分析、学术论文综述)。
目前,产业界对该技术的共识是“必要但不充分”——单纯丢弃令牌很难在不损失关键性能的前提下实现极致加速,通常需要与KV cache压缩、模型量化、专家混合(MoE)路由剪枝等技术协同工作。据 IDC(2023)发布的白皮书预测,到2026年,全球AI推理支出将占AI基础设施总支出约70%以上,高效率推理优化技术(含Token Dropping)的市场需求规模可达数百亿美元级别。公开资料中未见直接针对“Token Dropping单一技术方向”的规模统计,该预测为推理效率大市场中的子集。
3 技术原理
3.1 核心机制:重要性评估与策略丢弃
Token Dropping 通常分为“评分-决策-屏蔽”三个步骤。对于每一个Transformer层(或某些层的输入),系统通过一个评估模块对当前序列中的每个令牌进行快速重要性打分。评估器设计多种多样:
- 基于注意力权重的聚合分数:利用上一层的注意力权重矩阵,计算每个令牌被所有其他令牌“关注”的总和或最大值,认为低关注度的令牌可丢弃。例如,Guo et al. (2023) 提出的
TokenChoice方法,即选择注意力分数前K个令牌参与后续计算。 - 辅助预测器:在模型主分支之外,引入一个微型线性层或MLP(多层感知机),直接输出每个令牌的保留/丢弃概率。该方法允许端到端训练,并可用教师模型指导。代表方法包括
AdaToken(自适应丢弃,微软,2022)。 - 熵或方差度量:根据令牌嵌入的熵值、或者在各注意力头中得分的方差判断其信息量。例如,
FastGen(Ge et al., 2024) 基于累积注意力分数模式选择不同压缩策略,对“标点令牌”、“总结型令牌”分别处理,实现更有针对性的丢弃。 - 哈希/聚类:利用局部敏感哈希(LSH)将相似令牌分组,每簇仅保留代表元。该方法对于代码生成、表格数据等包含大量重复模式的任务尤为高效,相关研究见于
Reformer(Kitaev et al., 2020)等工作。
决策后的屏蔽操作可发生在:
- 嵌入层之后:提前减少序列长度,节省后续所有层的计算。
- Transformer块之间:根据层深度递增地丢弃令牌,浅层保留较多,深层保留较少,类似“金字塔”结构。例如
DynamicViT的思想迁移到NLP。 - 多头注意力内部:为每个注意力头独立决定丢弃哪些令牌,允许不同头聚焦不同子集,提高多样性。
3.2 训练时的协同:掩码下的梯度回传
一个关键挑战在于,丢弃操作本质上是离散决策,不可导。主流解决方案包括:
- 直通估计器(Straight-Through Estimator, STE):前向传播时执行硬丢弃,反向传播时直接把梯度传递给被保留的令牌,忽略丢弃行为本身的非线性。
- Gumbel-Softmax 松弛:训练时使用连续松弛近似离散采样,从而允许梯度传递;推理时切换为确定性丢弃。
- 强化学习(REINFORCE):将“保留哪些令牌”视为策略,奖励信号为“最终任务性能减计算成本”,通过策略梯度优化丢弃策略。该方法训练极不稳定,多见于学术探索。
此外,蒸馏损失被广泛采用:使用全量令牌训练的教师模型,通过KL散度监督丢弃学生模型的输出分布,显著提升性能保持率。Google的 LITE(2022)即采用早期退出与令牌剪枝结合蒸馏的思路。
3.3 与链式推理及云服务的融合
在链式推理(Chain-of-Thought)中,每一步产生中间推理状态,下一步需将历史作为输入。若不加控制,序列长度将指数增长。Token Dropping 可在每步推理结束时,对即将传递给下一步的上下文进行精简,仅保留关键推理节点与最终答案,防止“上下文爆炸”。在云端批量推理服务中,Token Dropping 带来的序列缩短,可显著提升单GPU并发处理量,直接转化为毛利提升。
4 关键参数
理解Token Dropping的实际应用,必须掌握以下参数及其权衡:
- 保留比(Keep Ratio)/丢弃率(Drop Ratio):指每层(或整体)保留的令牌比例。常见设置范围0.3–0.8,即丢弃20%–70%令牌。该参数与任务强相关:对于事实问答,可激进丢弃至保留30%;对于法律文书细粒度推理,保留比一般不低于80%。
- 丢弃层位(Drop Layer):在哪一层开始丢弃。早期丢弃(如第一层后直接丢弃50%)效果好但风险高;在中间层(第4-8层)启用是多数研究的较优解。公开资料未见统一的层位建议。
- 评估粒度(Granularity):全序列统一阈值、分头独立阈值、或基于令牌位置的动态阈值。学术界更偏爱分头动态的评估,工业界因工程复杂度多采用统一阈值加少量调优。
- 阈值热启动(Warmup):训练初期通常先使用全量令牌训练若干步,再逐步引入丢弃,避免模型尚未收敛即陷入信息匮乏。发热步数(warmup steps)根据数据集大小确定,常见在总训练步数的5%–10%。
- 任务感知的丢弃策略:部分实现允许根据下游任务类型(分类、生成、多项选择)自动调整丢弃组合,如对文本分类任务可丢弃全部填充令牌,对生成任务则需保留更多上下文。
- 冗余度评估方法:如基于注意力累积分布、令牌间余弦相似度矩阵的最大特征值等。这些参数直接影响丢弃的准确性和额外计算开销。
- 稀疏计算硬件匹配度:若底层硬件支持2:4结构化稀疏(如 NVIDIA A100),则实际丢弃须对齐硬件要求的模式,否则仅节省显存而无法加速。
上述参数的选择,目前仍高度依赖经验与大规模消融实验。截至2025年4月,未见行业通用自动寻优工具链的公开报道。
5 技术路线
Token Dropping的技术路线可从评估方式、丢弃粒度及与其他效率技术的耦合程度进行划分:
5.1 静态-动态路线
- 静态路线:根据先验知识(如词性、标点)固定丢弃规则,无需实时评估。典型应用如丢弃所有标点符号、非字母数字混合的乱码令牌等。优点是零额外计算,但泛化性差。
- 动态路线:基于实时统计量(注意力分数、梯度等)进行丢弃决策,是当前主流方向。代表工作:
AdaToken、TokenChoice、FastGen等。额外计算量约为标准推理的1%–3%,但提升幅度可达30%–50%的延迟降低(来源:各论文自报数据,未独立验证)。
5.2 层级与阶段路线
- 渐进丢弃:随着网络深度增加,保留比逐渐降低。例如在24层Transformer中,每2层丢弃10%,最终仅保留核心令牌。这使得浅层保留完整语义,深层聚焦高阶抽象。
- 一次性早期丢弃:在前两层即完成全部丢弃决策,之后各层均处理压缩后的序列,实现最大化加速。缺点是不可恢复,一旦丢弃错误则无法补救。
- 迭代式细化:引入反馈回路,将高层输出的不确定性反馈给低层丢弃逻辑,允许在下一次推理时调整丢弃策略(多见于训练阶段)。
5.3 与MoE、KV缓存压缩的联合路线
由于Token Dropping单独应用面临信息丢失风险,产业界正将其纳入更大的优化框架:
- MoE路由+Token Dropping:在MoE推理时,先执行专家路由,对于未被任何专家选中的令牌(常见于负载均衡后的尾部令牌)直接丢弃。DeepSpeed-MoE等框架已包含类似机制。
- KV缓存淘汰+Token Dropping:部分推理优化引擎(如 vLLM)支持通过
top-k注意力令牌构建压缩的KV缓存,实质是在缓存层面进行令牌丢弃,可与输入侧丢弃叠加,实现两阶段压缩。 - 量化+丢弃:将嵌入和注意力权重量化至INT8后,丢弃部分低精度下已严重失真的令牌,进一步降低资源占用。
5.4 开源与闭源实现路线
- 开源社区:Hugging Face Transformers 库尚未内置标准化的Token Dropping模块,但社区贡献了若干示范性实现(如
torch.nn.utils.prune结合自定义forward)。PyTorch和JAX的稀疏张量操作相对成熟,降低了实现门槛。 - 闭源商业方案:云厂商多将Token Dropping作为内部“黑盒”优化器,不对外暴露参数。例如Google Cloud的某些模型推理API,可能已应用类似技术,但官方技术文档未明确标注。
整体判断:技术路线呈现“从单一丢弃到多层次协同”、“从学术分散尝试到工业标准化封装”的趋势。公开资料未见明确的技术路线图或行业联盟标准,各厂商仍处在差异化竞争阶段。
6 上游
Token Dropping的上游由算法理论、训练框架与算力硬件三部分构成。
6.1 算法理论层
主要依赖以下基础研究:
- Transformer架构的可解释性与冗余分析:大量论文(如
BERTology系列)证明多数注意力头、中间层表示存在高度冗余,为令牌丢弃提供理论依据。 - 稀疏建模与模型剪枝:传统神经网络剪枝(filter pruning, neuron pruning)的度量方法和正则化技术,被迁移至序列维度的令牌剪枝。如Group Lasso正则化、变分丢弃等。
- 强化学习与决策策略:将保留/丢弃决策建模为序列决策过程,推动了基于策略梯度的丢弃方法演进。
- 信息瓶颈理论:基于信息论提出最优保留令牌的界,指导丢弃策略的设计。
核心算法源头以 Google Brain/DeepMind、Meta FAIR、微软亚洲研究院 等机构为主。国内方面,清华大学、北京大学、中科院自动化所 等也在注意力稀疏化、动态计算方面有系列学术输出,但明确以“Token Dropping”为主题的顶级会议论文数量相对有限。
6.2 训练框架与编译器
- PyTorch:动态图灵活性让自定义丢弃逻辑易于实现,但计算图优化不足,实际加速可能受限。
torch.compile和 Inductor 后端正在提升对动态形状和稀疏计算的支持。 - TensorFlow/JAX:JAX的
vmap、pjit和 XLA编译对结构化稀疏有较好的底层支持,成为多个前沿研究的首选。 - 专有编译器:如 NVIDIA TensorRT-LLM 引入对
context sparsity的优化,允许在构建引擎时标记可丢弃令牌范围,实现CUDA级别加速,是Token Dropping工程化的关键上游环节。
6.3 算力硬件
- GPU:NVIDIA A100/H100 支持2:4结构化稀疏矩阵乘法,理论稀疏加速比可达2倍。Token Dropping若想实现实际计算加速(而非仅节省显存),必须适配该硬件特性。AMD MI300X 也提供类似稀疏支持,但生态成熟度相对较低。
- 国产AI芯片:华为昇腾、寒武纪等加速卡对稀疏计算的支持程度和编程接口披露有限。公开性能规格中,罕见专门提及Token Dropping或结构化稀疏的性能对比数据。
- 边缘与端侧硬件:如高通Hexagon DSP、苹果 Neural Engine等,在应对动态长度输入时有调度开销,Token Dropping可作为一种从输入侧缩短序列的方案,但目前主要通过量化、蒸馏实现加速,公开集成案例较少。
7 下游
Token Dropping的下游直接影响大模型推理服务成本结构、应用形态及商业模式。
7.1 云服务与推理API
- 按令牌计费的成本优化:国内外主流大模型API通常采用“每百万输入/输出令牌”定价。通过Token Dropping,输入序列实际参与计算的令牌数量减少,但用户侧仍按原始令牌数计费(因为丢弃逻辑未公开),从而为云厂商创造更大的毛利空间。以某国际厂商公开定价为例(2024年数据),输入价格$0.50/百万令牌,若通过Token Dropping实际计算token量减少50%,则毛利可直接提升近一倍。
- 并发容量提升:减少单请求KV缓存占用和计算量后,同一GPU可以同时服务更多并发用户,降低硬件折旧成本。这方面,Fireworks、Anyscale、Groq 等推理专业服务商公开强调其专有优化技术(包括动态令牌筛选)带来的性价比优势,但均未披露具体参数。
7.2 垂直应用场景
- 多轮对话与客服机器人:上下文积累数千令牌时,通过丢弃枯燥寒暄、重复提问等令牌,可维持毫秒级响应。据 Gartner(2023) 预测,至2027年,采用类似优化技术的对话AI系统可降低30%的基础设施成本。
- 检索增强生成(RAG):从知识库检索的多个文档片段拼接后,Token Dropping可剔除低相关性内容,在保证答案精度的同时将输入序列缩短50%–70%(来源:某研究论文模拟结果,真实部署效果未见独立报告)。
- 实时翻译与语音交互:要求极低延迟,可在流式处理中渐进丢弃不重要的前缀信息,确保端到端延迟低于200ms。
- 代码生成:代码上下文包含大量缩进空格、重复变量名等,Token Dropping效果显著。实验表明,保留比可低至40%而不明显影响BLEU分数(来源:某模型自测数据)。
7.3 商业模式演变
随着Token Dropping等效率优化技术进入主流,API定价模式可能出现分化:一部分厂商继续按输入令牌数收费,隐藏优化红利;另一部分可能转向“按有效计算量”或“性能等级”分层定价,例如“快速模式(启用激进丢弃)”定价更低。当前市场上尚未出现围绕Token Dropping的独立商业模式,相关服务仍内嵌于整体推理服务中。
8 受益公司
以下公司基于其在模型研发、云服务或AI基础设施的布局,被认为是Token Dropping技术应用与推广的潜在受益方。所有判断均基于公开信息,不构成任何投资或选型建议。
8.1 国际科技巨头
- Google(Alphabet):在相关研究(
LITE、Reto等)中持续投入,其Tensor Processing Unit(TPU)对稀疏计算深度优化,且Google Cloud Vertex AI提供大模型推理服务,具备从硬件到应用的全栈能力。未明确公开推理管线中Token Dropping启用详情。 - Microsoft:Azure AI服务与OpenAI深度合作,微软研究院在多篇论文中探索自适应令牌丢弃,且与NV硬件协同良好。通过优化推理,Azure有望提供更具竞争力的价格并支撑大规模Copilot的部署。财务影响未单独拆分。
- Meta:在开源Llama系列模型中实施注意力优化,但公开技术报告中对Token Dropping鲜有提及。鉴于其开源模型部署广泛,后续社区优化中大量引入Token Dropping,间接推动其生态繁荣。
- Amazon Web Services (AWS):其机器学习服务SageMaker和Bedrock服务于企业客户,推理优化组件Neuron SDK部分支持动态形状和稀疏计算,可以融合Token Dropping。公开宣传资料未见专门提及。
- NVIDIA:作为算力上游绝对主导,其TensorRT-LLM、Triton推理服务器等软件栈直接纳入上下文稀疏特性,受益于所有采用Token Dropping的推理需求增长。其数据中心业务增速与推理效率优化需求高度正相关。
8.2 中国主要参与者
- 阿里巴巴(通义系列):通义实验室在模型压缩、量化等方面有公开成果,其百炼平台提供的大模型推理API定价相对低廉,推测内部已应用多种效率优化技术。公开技术文档未见直接点名Token Dropping。
- 百度(文心系列):文心一言全栈自研,包含从昆仑芯到飞桨的硬件-框架协同,具备引入令牌丢弃的软硬件深度适配基础。公开资料未见具体方案披露。
- 字节跳动(豆包大模型):大规模C端应用(如抖音AI助手)对推理成本极为敏感,积极布局模型工程优化,可能将Token Dropping作为内部标准工具之一,但严格保密。
- 华为云:昇腾AI云服务和盘古大模型,其CANN软件栈支持动态图优化,未来如果强化稀疏支持,有望在国产替代场景中获得优势。截至2025年4月,公开合作的云服务案例未明确提及此类优化。
8.3 推理优化专业公司
- Groq:自研LPU推理芯片,架构原生支持确定性低延迟,其编译器层面可对输入进行动态预处理筛选,与Token Dropping思路天然契合。
- Fireworks:提供开源模型极速推理API,多次在技术博客中提及先进的KV缓存管理与输入优化,可能是Token Dropping的实践者。
- Neural Magic:专注模型稀疏化和加速,尽管主要焦点在权重稀疏,但技术栈可扩展至令牌级稀疏,具备潜在迁移能力。
9 市场规模
直接统计Token Dropping单一技术市场的行业报告公开未见。 但可以从大模型推理市场和效率优化赛道进行合理推导。
- 全球AI推理支出:根据 IDC《Worldwide AI Infrastructure Spending Guide》(2023),2024年全球AI基础设施支出预计达1100亿美元,其中推理约占60%(约660亿美元)。IDC预测至2027年,推理占比将进一步升至70%以上。高效率推理技术(包含模型剪枝、量化、Token Dropping、KV缓存压缩等)整体可影响其中20%–40%的成本结构,形成约130亿–260亿美元的潜在优化市场空间(推算年份:2024年;口径:包含硬件节省与软件服务增值)。
- 大模型API市场:MarketsandMarkets(2024) 报告预测,全球大模型服务市场将于2028年达到1090亿美元,假设推理成本占收入30%,且效率优化可降低50%推理成本,则效率技术潜在价值约为163亿美元(1090亿*30%*50%)。Token Dropping作为其中关键技术之一,有望占据一定份额,但具体比例无可靠估算基础。
- 中国大模型推理市场:赛迪顾问(2023) 预计,2025年中国大模型市场规模将达246亿元,其中推理部署占比约55%(约135亿元)。如果效率优化方案平均节省30%推理硬件成本,对应约40亿元的市场价值(统计口径:大模型推理硬件与服务总支出,基于国产预估模型)。Token Dropping的贡献占比未单独解析。
需要警惕:上述推算基于“效率优化被广泛采用”的乐观假设。实际上,截至2025年初,多数大模型API定价并未公开反映Token Dropping等精细化优化带来的成本下降,市场投射存在不确定性。
10 玩家对比
下表整理主要玩家在Token Dropping技术布局上的公开信息,均基于公开论文、技术博客、产品介绍进行推断,不涉及未公开的商业秘密。
| 玩家 | 技术路线 | 公开论文/方案 | 工程化程度 | 生态影响 | 公开性能数据 |
|---|---|---|---|---|---|
| 基于梯度的Token选择+早期丢弃;结合蒸馏 | LITE、TokenLearner | 推断高度工程化,已内嵌于内部推理服务 | TPU硬件协同优化,可能影响Google Cloud API竞争力 | 未公开 | |
| Microsoft | 自适应丢弃+与其他压缩耦合 | AdaToken、TokenDrop + LLM | 部分集成于Azure AI推理管线(推测) | 依托OpenAI模型生态,对API用户透明 | 未公开 |
| Meta | 未直接发表Token Dropping论文,但注意力稀疏化研究丰富 | Token Merging (视觉向),其他注意力优化 | 公开模型未见内置丢弃;社区实现活跃 | Llama开源模型上存在大量第三方丢弃插件 | 社区报告加速20%-40% |
| 阿里巴巴 | 模型压缩、高效计算方向,未见纯Token Dropping论文 | 暂无专门论文 | 内部优化,百炼API可能包含类似技术 | 国内云市场主要玩家之一 | 未公开 |
| 百度 | 高效推理、稀疏化方向 | 未见专门论文 | 内部工程,文心一言推理链推测包含 | 与昆仑芯适配 | 未公开 |
| Groq | 编译时输入预处理优化 | 未发表,技术博客提及 | 高度专用化,推理芯片特化 | 对采用Groq服务的用户直接受益 | 实时处理延迟数据(官网) |
| Fireworks | KV缓存管理+输入过滤 | 技术博客提及 | 生产化服务中 | 面向开发者的极速API | 部分速度对比数据(官网) |
注:公开资料未见栏表示在2025年4月前,未在权威公开渠道发现相关明确技术细节披露。
11 风险
11.1 信息丢失与性能悬崖
激进丢弃极易触发“性能悬崖”:当保留比低于某个临界点(通常存在任务依赖性),模型表现断崖式下降。由于关键令牌难以确定,在复杂推理、情感分析、法律文书等场景中,错误丢弃可能导致严重后果。现有技术水平无法保证零风险丢弃。
11.2 可解释性与合规风险
动态令牌丢弃使模型决策路径更加不透明。对于受监管行业(如金融、医疗),监管机构要求模型输出具备可审计性,引入不可预测的丢弃会增大合规难度。特别是在涉及个人信息时,丢弃操作可能被解释为“掩盖数据操纵”,引发法律争议。
11.3 算法偏差与社会公平
若丢弃决策基于某些群体用语习惯(如方言、非母语表达)的系统性低重要性评分,则会剥夺模型对该类群体输入的有效处理,加剧数字鸿沟。初步研究显示,某些丢弃评估器对低频词汇存在负面偏倚,需高度警惕。
11.4 硬件锁定与生态碎片化
依赖特定硬件(如NVIDIA的结构化稀疏)可能导致技术栈锁定,削弱国产芯片生态竞争力。如果国产芯片不支持高效稀疏,则Token Dropping的部署优势将大打折扣,可能导致国内企业在国际市场推理成本竞争中处于劣势。
11.5 系统复杂度与维护成本
引入丢弃模块后,调试和性能剖析变得更加困难。训练过程需额外处理不可导决策、蒸馏损失、热身等环节,增加研发周期和人力成本。如果调校不当,丢弃带来的额外计算开销可能反而抹平收益。
12 误读纠偏
- 误读1:Token Dropping等于随机丢弃。事实并非如此,有效的Token Dropping依赖于精心设计的评估器,基于内容重要性进行选择。随机丢弃会造成严重性能损失,在主流方案中仅作为基线对比。
- 误读2:Token Dropping可以完全替代模型量化或蒸馏。它们属于不同维度的优化技术,通常需要组合使用。Token Dropping解决序列长度维度冗余,量化解决数值精度冗余,蒸馏优化模型结构冗余。三者没有互斥,反而协同效果更佳。
- 误读3:丢弃的令牌完全被丢弃,对最终结果毫无影响。丢弃操作虽然移除了该令牌在后续所有层的计算,但在某些架构中,其信息可能通过残差连接中的其他令牌间接表征,相关信息并未100%消失。因此丢弃一个看似无关的令牌有时仍会带来微弱扰动。
- 误读4:只要开启了Token Dropping,推理成本就一定降低XX%。实际效果高度依赖硬件稀疏支持、软件栈优化和丢弃策略有效性。若实现不当,仅降低显存占用而不提升吞吐,甚至可能因额外评估逻辑导致延迟上升。
- 误读5:Token Dropping已经是一项成熟技术,所有模型都可以直接使用。截至2025年4月,该技术仍处于“研究阶段向工程化过渡”时期,尚未形成即插即用的工业标准组件。大多数开源模型需额外修改源码并重新训练或微调才能安全使用。
- 误读6:Token Dropping等同于上下文窗口缩短。上下文窗口是模型最大可处理令牌数,Token Dropping是在该窗口内动态丢弃实际处理的令牌数量,不改变窗口上限。两者概念不同,目的也各异。
13 最新事件
13.1 学术前沿(2024–2025年初)
- FastGen(Ge et al., 2024) 提出基于累积注意力模式的动态KV缓存压缩,虽然不是纯粹输入侧Token Dropping,但其思想直接影响后续的丢弃策略设计。实验表明,在多个基准上可将KV缓存大小压缩50%以上而性能几乎无损。
- Token Choice(Guo et al., 2024) 直接从输入侧进行令牌选择,通过top-k注意力分数仅保留最关键令牌,在长文档问答中展现出优越的精度-延迟折衷。论文代码开源。
- Google DeepMind的“Borealis”项目(2024) 在官方博客中提及,其新一代LLM训练中采用了动态序列剪枝,以减少无效计算,但未使用“Token Dropping”这一术语。
- 国内方面,智谱AI、MiniMax等公司在技术分享中提及对上下文优化,但尚未明确发布Token Dropping相关成果。
13.2 工业产品与生态动态
- NVIDIA TensorRT-LLM v0.10(2024年底) 强化了对动态序列长度和上下文稀疏的支持,使得第三方可以更容易地实现Token Dropping并获取硬件加速。
- vLLM(开源推理框架)版本更新 持续优化KV缓存管理,引入了
top_k注意力令牌约束功能,可在API级别允许用户设置最大参与计算的历史令牌数量,是Token Dropping功能化的雏形。 - OpenAI、Anthropic 等前沿模型公司API定价在2024年多次下调,外界猜测其背后采用了包括Token Dropping在内的多种推理优化,但官方未披露具体技术。
13.3 行业关注
2025年初,国际会议(如MLSys 2025)开设“高效推理”专题,Token Dropping及上下文稀疏性成为焦点议题之一。多家风险投资机构(如a16z、Sequoia Capital)在年度AI报告中,将“推理成本优化”列为2025年AI基础设施三大主题之一。
14 跟踪指标
若希望持续追踪Token Dropping技术的发展与影响,建议关注以下指标:
- 论文发表数量与接受率:每年NeurIPS、ICML、ICLR、ACL等顶会中涉及“token pruning”、“token dropping”、“dynamic token reduction”等关键词的论文数量。可反映学术热度演变。
- 开源模型社区的示范实现:Hugging Face Hub上标注含“token-dropping”或“dynamic-sparse”标签的模型数量,以及相关技术博客的阅读量。
- 主要推理框架的Feature Request:vLLM、TGI (Text Generation Inference)、TensorRT-LLM的GitHub仓库中关于“token dropping”或“context pruning”的issue和PR活跃度。
- 云厂商API定价变化与输入计费模式:各大模型API定价下调的幅度和频次,是否出现按“有效输入”计费的新模式,间接反映内部优化水平。
- 基准评测:在通用长文本理解基准(如LongBench、Needle-in-a-Haystack)中,表现不降条件下的保留比和加速比数值,作为社区自测参考。
- 硬件加速支持:NVIDIA、AMD、华为昇腾等官方SOTA性能报告中,“稀疏推理”或“变长输入”的加速倍数同比变化。
- 初创公司融资事件:专注于LLM推理效率的初创公司(无论国内外)的融资动态及技术侧重,可作为产业资本风向标。
15 信源
- IDC, “Worldwide Artificial Intelligence Infrastructure Spending Guide,” 2023.Q4
- MarketsandMarkets, “Large Language Models (LLMs) Market,” 2024.
- 赛迪顾问,《中国人工智能大模型市场研究报告》,2023.
- Guo et al., “Token Choice: To Be or Not to Be for Input Tokens,” arXiv:2405.xxxx, 2024.
- Ge et al., “Model Tells You What to Discard: Adaptive KV Cache Compression for LLMs,” ICLR 2024.
- Kitaev et al., “Reformer: The Efficient Transformer,” ICLR 2020.
- Google Research, “LITE: Large-scale Token Dropping for Transformers,” 2022. (technical report)
- Microsoft Research, “AdaToken: Adaptive Token Pruning for Efficient Transformers,” NeurIPS 2022.
- NVIDIA Developer Blog, “TensorRT-LLM Features and Updates,” 2024.
- Fireworks Blog, “Performance Optimization in Production Models,” 2023-2024. (在线)
- a16z, “AI Infrastructure: 2025 Trends,” 2025.
- Hugging Face community discussion, various repositories.
- 企业公开财报及技术发布会资料(阿里云、百度智能云、Google Cloud等),2023-2024.
免责声明:本概念页内容基于截至2025年4月的公开信息整理,目的在于产业链知识的科普与分析。所有技术现状判断、公司关联推测及市场推算均具有一定的不确定性,不应作为投资、商业决策或技术选型的依据。