概念庫 開放閱讀

Token Dropping

概念庫 · 開放閱讀

概念 ID
token-dropping
更新時間
2026-06-03
來源數量
1

Token Dropping

1 三秒看懂

Token Dropping(令牌丟棄) 是一種在大型語言模型(LLM)訓練或推論過程中,動態識別並移除部分輸入令牌(Token)以提高計算效率、降低視訊記憶體佔用和延遲的技術。核心思想是“捨棄冗餘,保留關鍵”——通過輕量級評估模組,以可忽略的額外計算代價,換取數十個百分點的處理速度提升。該技術已成為實現成本可控、低延遲大型模型服務的工程焦點之一,尤其在多輪對話、長文件分析和鏈式推論等場景中意義突出。值得注意的是,截至2025年4月,公開可查的行業統一標準或基準尚未建立,不同實現路徑間的效率-效能折衷差異巨大。

2 三分鐘產業解釋

Token Dropping 並非訓練或推論流程中的個別的技巧,而是整個大型模型經濟體系最佳化的關鍵槓桿。它的邏輯非常直接:輸入文本中大量的銜接詞、重複詞、通用背景詞,對最終語義貢獻極小。以因果語言模型的自迴歸生成過程為例,一個1000令牌的對話歷史,可能僅有200個令牌包含決定性資訊;其餘800個令牌的儲存和計算,幾乎都屬於浪費。Token Dropping 通過在注意力計算前或計算過程中,篩選出這200個高價值令牌,使得後續運算的複雜度大幅降低。

在產業鏈中的位置:

  • 直接作用層:模型架構內部(注意力層、前饋網路輸入)和推論引擎中間表示。
  • 上游依賴:算法理論(重要性評估器設計)、硬體稀疏計算能力(如NVIDIA Ampere Ada Hopper架構的2:4結構化稀疏)、訓練架構的自定義層支援。
  • 下游受益:雲端端大型模型API供應商(降低單次呼叫成本、支撐更多併發)、邊緣裝置推論、即時互動應用(如遊戲NPC、同聲傳譯)、大規模文本處理流水線(如法律文書分析、學術論文綜述)。

目前,產業界對該技術的共識是“必要但不充分”——單純丟棄令牌很難在不損失關鍵效能的前提下實現極致加速,通常需要與KV cache壓縮、模型量化、專家混合(MoE)路由剪枝等技術協同工作。據 IDC(2023)釋出的白皮書預測,到2026年,全球AI推論支出將佔AI基礎設施總支出約70%以上,高效率推論最佳化技術(含Token Dropping)的市場需求規模可達數百億美元級別。公開資料中未見直接針對“Token Dropping單一技術方向”的規模統計,該預測為推論效率大市場中的子集。

3 技術原理

3.1 核心機制:重要性評估與策略丟棄

Token Dropping 通常分為“評分-決策-遮蔽”三個步驟。對於每一個Transformer層(或某些層的輸入),系統通過一個評估模組對當前序列中的每個令牌進行快速重要性打分。評估器設計多種多樣:

  • 基於注意力權重的聚合分數:利用上一層的注意力權重矩陣,計算每個令牌被所有其他令牌“關注”的總和或最大值,認為低關注度的令牌可丟棄。例如,Guo et al. (2023) 提出的 TokenChoice 方法,即選擇注意力分數前K個令牌參與後續計算。
  • 輔助預測器:在模型主分支之外,引入一個微型線性層或MLP(多層感知機),直接輸出每個令牌的保留/丟棄機率。該方法允許端到端訓練,並可用教師模型指導。代表方法包括 AdaToken(自適應丟棄,微軟,2022)。
  • 熵或方差度量:根據令牌嵌入的熵值、或者在各注意力頭中得分的方差判斷其資訊量。例如,FastGen(Ge et al., 2024) 基於累積注意力分數模式選擇不同壓縮策略,對“標點令牌”、“總結型令牌”分別處理,實現更有針對性的丟棄。
  • 雜湊/聚類:利用區域性敏感雜湊(LSH)將相似令牌分組,每簇僅保留代表元。該方法對於程式碼生成、表格資料等包含大量重複模式的任務尤為高效,相關研究見於 Reformer(Kitaev et al., 2020)等工作。

決策後的遮蔽操作可發生在:

  • 嵌入層之後:提前減少序列長度,節省後續所有層的計算。
  • Transformer塊之間:根據層深度遞增地丟棄令牌,淺層保留較多,深層保留較少,類似“金字塔”結構。例如 DynamicViT 的思想遷移到NLP。
  • 多頭注意力內部:為每個注意力頭獨立決定丟棄哪些令牌,允許不同頭聚焦不同子集,提高多樣性。

3.2 訓練時的協同:掩碼下的梯度回傳

一個關鍵挑戰在於,丟棄操作本質上是離散決策,不可導。主流解決方案包括:

  • 直通估計器(Straight-Through Estimator, STE):前向傳播時執行硬丟棄,反向傳播時直接把梯度傳遞給被保留的令牌,忽略丟棄行為本身的非線性。
  • Gumbel-Softmax 鬆弛:訓練時使用連續鬆弛近似離散取樣,從而允許梯度傳遞;推論時切換為確定性丟棄。
  • 強化學習(REINFORCE):將“保留哪些令牌”視為策略,獎勵訊號為“最終任務效能減計算成本”,通過策略梯度最佳化丟棄策略。該方法訓練極不穩定,多見於學術探索。

此外,蒸餾損失被廣泛採用:使用全量令牌訓練的教師模型,通過KL散度監督丟棄學生模型的輸出分佈,顯著提升效能保持率。Google的 LITE(2022)即採用早期退出與令牌剪枝結合蒸餾的思路。

3.3 與鏈式推論及雲端服務的融合

在鏈式推論(Chain-of-Thought)中,每一步產生中間推論狀態,下一步需將歷史作為輸入。若不加控制,序列長度將指數增長。Token Dropping 可在每步推論結束時,對即將傳遞給下一步的上下文進行精簡,僅保留關鍵推論節點與最終答案,防止“上下文爆炸”。在雲端端批次推論服務中,Token Dropping 帶來的序列縮短,可顯著提升單GPU併發處理量,直接轉化為毛利提升。

4 關鍵引數

理解Token Dropping的實際應用,必須掌握以下引數及其權衡:

  • 保留比(Keep Ratio)/丟棄率(Drop Ratio):指每層(或整體)保留的令牌比例。常見設定範圍0.3–0.8,即丟棄20%–70%令牌。該引數與任務強相關:對於事實問答,可激進丟棄至保留30%;對於法律文書細粒度推論,保留比一般不低於80%。
  • 丟棄層位(Drop Layer):在哪一層開始丟棄。早期丟棄(如第一層後直接丟棄50%)效果好但風險高;在中間層(第4-8層)啟用是多數研究的較優解。公開資料未見統一的層位建議。
  • 評估粒度(Granularity):全序列統一閾值、分頭獨立閾值、或基於令牌位置的動態閾值。學術界更偏愛分頭動態的評估,工業界因工程複雜度多采用統一閾值加少量調優。
  • 閾值熱啟動(Warmup):訓練初期通常先使用全量令牌訓練若干步,再逐步引入丟棄,避免模型尚未收斂即陷入資訊匱乏。發熱步數(warmup steps)根據資料集大小確定,常見在總訓練步數的5%–10%。
  • 任務感知的丟棄策略:部分實現允許根據下游任務型別(分類、生成、多項選擇)自動調整丟棄組合,如對文本分類任務可丟棄全部填充令牌,對生成任務則需保留更多上下文。
  • 冗餘度評估方法:如基於注意力累積分佈、令牌間餘弦相似度矩陣的最大特徵值等。這些引數直接影響丟棄的準確性和額外計算開銷。
  • 稀疏計算硬體匹配度:若底層硬體支援2:4結構化稀疏(如 NVIDIA A100),則實際丟棄須對齊硬體要求的模式,否則僅節省視訊記憶體而無法加速。

上述引數的選擇,目前仍高度依賴經驗與大規模消融實驗。截至2025年4月,未見行業通用自動尋優工具鏈的公開報道。

5 技術路線

Token Dropping的技術路線可從評估方式、丟棄粒度及與其他效率技術的耦合程度進行劃分:

5.1 靜態-動態路線

  • 靜態路線:根據先驗知識(如詞性、標點)固定丟棄規則,無需即時評估。典型應用如丟棄所有標點符號、非字母數字混合的亂碼令牌等。優點是零額外計算,但泛化性差。
  • 動態路線:基於即時統計量(注意力分數、梯度等)進行丟棄決策,是當前主流方向。代表工作:AdaTokenTokenChoiceFastGen等。額外計算量約為標準推論的1%–3%,但提升幅度可達30%–50%的延遲降低(來源:各論文自報資料,未獨立驗證)。

5.2 層級與階段路線

  • 漸進丟棄:隨著網路深度增加,保留比逐漸降低。例如在24層Transformer中,每2層丟棄10%,最終僅保留核心令牌。這使得淺層保留完整語義,深層聚焦高階抽象。
  • 一次性早期丟棄:在前兩層即完成全部丟棄決策,之後各層均處理壓縮後的序列,實現最大化加速。缺點是不可恢復,一旦丟棄錯誤則無法補救。
  • 迭代式細化:引入反饋迴路,將高層輸出的不確定性反饋給低層丟棄邏輯,允許在下一次推論時調整丟棄策略(多見於訓練階段)。

5.3 與MoE、KV快取壓縮的聯合路線

由於Token Dropping單獨應用面臨資訊丟失風險,產業界正將其納入更大的最佳化架構:

  • MoE路由+Token Dropping:在MoE推論時,先執行專家路由,對於未被任何專家選中的令牌(常見於負載均衡後的尾部令牌)直接丟棄。DeepSpeed-MoE等架構已包含類似機制。
  • KV快取淘汰+Token Dropping:部分推論最佳化引擎(如 vLLM)支援通過 top-k 注意力令牌建置壓縮的KV快取,實質是在快取層面進行令牌丟棄,可與輸入側丟棄疊加,實現兩階段壓縮。
  • 量化+丟棄:將嵌入和注意力權重量化至INT8後,丟棄部分低精度下已嚴重失真的令牌,進一步降低資源佔用。

5.4 開源與閉源實現路線

  • 開源社群:Hugging Face Transformers 庫尚未內建標準化的Token Dropping模組,但社群貢獻了若干示範性實現(如 torch.nn.utils.prune 結合自定義forward)。PyTorch和JAX的稀疏張量操作相對成熟,降低了實現門檻。
  • 閉源商業方案:雲端廠商多將Token Dropping作為內部“黑盒”最佳化器,不對外暴露引數。例如Google Cloud的某些模型推論API,可能已應用類似技術,但官方技術文件未明確標註

整體判斷:技術路線呈現“從單一丟棄到多層次協同”、“從學術分散嘗試到工業標準化封裝”的趨勢。公開資料未見明確的技術路線圖或行業聯盟標準,各廠商仍處在差異化競爭階段。

6 上游

Token Dropping的上游由算法理論、訓練架構與算力硬體三部分構成。

6.1 算法理論層

主要依賴以下基礎研究:

  • Transformer架構的可解釋性與冗餘分析:大量論文(如 BERTology 系列)證明多數注意力頭、中間層表示存在高度冗餘,為令牌丟棄提供理論依據。
  • 稀疏建模與模型剪枝:傳統神經網路剪枝(filter pruning, neuron pruning)的度量方法和正則化技術,被遷移至序列維度的令牌剪枝。如Group Lasso正則化、變分丟棄等。
  • 強化學習與決策策略:將保留/丟棄決策建模為序列決策過程,推動了基於策略梯度的丟棄方法演進。
  • 資訊瓶頸理論:基於資訊論提出最優保留令牌的界,指導丟棄策略的設計。

核心演算法源頭以 Google Brain/DeepMindMeta FAIR微軟亞洲研究院 等機構為主。國內方面,清華大學、北京大學、中科院自動化所 等也在注意力稀疏化、動態計算方面有系列學術輸出,但明確以“Token Dropping”為主題的頂級會議論文數量相對有限。

6.2 訓練架構與編譯器

  • PyTorch:動態圖靈活性讓自定義丟棄邏輯易於實現,但計算圖最佳化不足,實際加速可能受限。torch.compile 和 Inductor 後端正在提升對動態形狀和稀疏計算的支援。
  • TensorFlow/JAX:JAX的 vmappjit 和 XLA編譯對結構化稀疏有較好的底層支援,成為多個前沿研究的首選。
  • 專有編譯器:如 NVIDIA TensorRT-LLM 引入對 context sparsity 的最佳化,允許在建置引擎時標記可丟棄令牌範圍,實現CUDA級別加速,是Token Dropping工程化的關鍵上游環節。

6.3 算力硬體

  • GPU:NVIDIA A100/H100 支援2:4結構化稀疏矩陣乘法,理論稀疏加速比可達2倍。Token Dropping若想實現實際計算加速(而非僅節省視訊記憶體),必須適配該硬體特性。AMD MI300X 也提供類似稀疏支援,但生態成熟度相對較低。
  • 國產AI晶片:華為昇騰、寒武紀等加速卡對稀疏計算的支援程度和程式設計介面揭露有限。公開效能規格中,罕見專門提及Token Dropping或結構化稀疏的效能對比資料。
  • 邊緣與端側硬體:如高通Hexagon DSP、Apple Neural Engine等,在應對動態長度輸入時有排程開銷,Token Dropping可作為一種從輸入側縮短序列的方案,但目前主要通過量化、蒸餾實現加速,公開整合案例較少。

7 下游

Token Dropping的下游直接影響大型模型推論服務成本結構、應用形態及商業模式。

7.1 雲端服務與推論API

  • 按令牌計費的成本最佳化:國內外主流大型模型API通常採用“每百萬輸入/輸出令牌”定價。通過Token Dropping,輸入序列實際參與計算的令牌數量減少,但使用者側仍按原始令牌數計費(因為丟棄邏輯未公開),從而為雲端廠商創造更大的毛利空間。以某國際廠商公開定價為例(2024年資料),輸入價格$0.50/百萬令牌,若通過Token Dropping實際計算token量減少50%,則毛利可直接提升近一倍。
  • 併發容量提升:減少單請求KV快取佔用和計算量後,同一GPU可以同時服務更多併發使用者,降低硬體折舊成本。這方面,Fireworks、Anyscale、Groq 等推論專業服務商公開強調其專有最佳化技術(包括動態令牌篩選)帶來的價效比優勢,但均未揭露具體引數。

7.2 垂直應用場景

  • 多輪對話與客服機器人:上下文積累數千令牌時,通過丟棄枯燥寒暄、重複提問等令牌,可維持毫秒級響應。據 Gartner(2023) 預測,至2027年,採用類似最佳化技術的對話AI系統可降低30%的基礎設施成本。
  • 檢索增強生成(RAG):從知識庫檢索的多個文件片段拼接後,Token Dropping可剔除低相關性內容,在保證答案精度的同時將輸入序列縮短50%–70%(來源:某研究論文模擬結果,真實部署效果未見獨立報告)。
  • 即時翻譯與語音互動:要求極低延遲,可在流式處理中漸進丟棄不重要的字首資訊,確保端到端延遲低於200ms。
  • 程式碼生成:程式碼上下文包含大量縮排空格、重複變數名等,Token Dropping效果顯著。實驗表明,保留比可低至40%而不明顯影響BLEU分數(來源:某模型自測資料)。

7.3 商業模式演變

隨著Token Dropping等效率最佳化技術進入主流,API定價模式可能出現分化:一部分廠商繼續按輸入令牌數收費,隱藏最佳化紅利;另一部分可能轉向“按有效計算量”或“效能等級”分層定價,例如“快速模式(啟用激進丟棄)”定價更低。當前市場上尚未出現圍繞Token Dropping的獨立商業模式,相關服務仍內嵌於整體推論服務中。

8 受益公司

以下公司基於其在模型研發、雲端服務或AI基礎設施的版面配置,被認為是Token Dropping技術應用與推廣的潛在受益方。所有判斷均基於公開資訊,不構成任何投資或選型建議。

8.1 國際科技巨頭

  • Google(Alphabet):在相關研究(LITEReto 等)中持續投入,其Tensor Processing Unit(TPU)對稀疏計算深度最佳化,且Google Cloud Vertex AI提供大型模型推論服務,具備從硬體到應用的全棧能力。未明確公開推論管線中Token Dropping啟用詳情。
  • Microsoft:Azure AI服務與OpenAI深度合作,微軟研究院在多篇論文中探索自適應令牌丟棄,且與NV硬體協同良好。通過最佳化推論,Azure有望提供更具競爭力的價格並支撐大規模Copilot的部署。財務影響未單獨拆分。
  • Meta:在開源Llama系列模型中實施注意力最佳化,但公開技術報告中對Token Dropping鮮有提及。鑑於其開源模型部署廣泛,後續社群最佳化中大量引入Token Dropping,間接推動其生態繁榮。
  • Amazon Web Services (AWS):其機器學習服務SageMaker和Bedrock服務於企業客戶,推論最佳化元件Neuron SDK部分支援動態形狀和稀疏計算,可以融合Token Dropping。公開宣傳資料未見專門提及。
  • NVIDIA:作為算力上游絕對主導,其TensorRT-LLM、Triton推論伺服器等軟體棧直接納入上下文稀疏特性,受益於所有采用Token Dropping的推論需求增長。其資料中心業務增速與推論效率最佳化需求高度正相關。

8.2 中國主要參與者

  • 阿里巴巴(通義系列):通義實驗室在模型壓縮、量化等方面有公開成果,其百鍊平台提供的大型模型推論API定價相對低廉,推測內部已應用多種效率最佳化技術。公開技術文件未見直接點名Token Dropping。
  • 百度(文心繫列):文心一言全棧自研,包含從崑崙芯到飛槳的硬體-架構協同,具備引入令牌丟棄的軟硬體深度適配基礎。公開資料未見具體方案揭露。
  • 字節跳動(豆包大型模型):大規模C端應用(如抖音AI助手)對推論成本極為敏感,積極版面配置模型工程最佳化,可能將Token Dropping作為內部標準工具之一,但嚴格保密。
  • 華為雲端:昇騰AI雲端服務和盤古大型模型,其CANN軟體棧支援動態圖最佳化,未來如果強化稀疏支援,有望在國產替代場景中獲得優勢。截至2025年4月,公開合作的雲端服務案例未明確提及此類最佳化。

8.3 推論最佳化專業公司

  • Groq:自研LPU推論晶片,架構原生支援確定性低延遲,其編譯器層面可對輸入進行動態預處理篩選,與Token Dropping思路天然契合。
  • Fireworks:提供開源模型極速推論API,多次在技術部落格中提及先進的KV快取管理與輸入最佳化,可能是Token Dropping的實踐者。
  • Neural Magic:專注模型稀疏化和加速,儘管主要焦點在權重稀疏,但技術棧可擴充套件至令牌級稀疏,具備潛在遷移能力。

9 市場規模

直接統計Token Dropping單一技術市場的行業報告公開未見。 但可以從大型模型推論市場和效率最佳化賽道進行合理推導。

  • 全球AI推論支出:根據 IDC《Worldwide AI Infrastructure Spending Guide》(2023),2024年全球AI基礎設施支出預計達1100億美元,其中推論約佔60%(約660億美元)。IDC預測至2027年,推論佔比將進一步升至70%以上。高效率推論技術(包含模型剪枝、量化、Token Dropping、KV快取壓縮等)整體可影響其中20%–40%的成本結構,形成約130億–260億美元的潛在最佳化市場空間(推算年份:2024年;口徑:包含硬體節省與軟體服務增值)。
  • 大型模型API市場MarketsandMarkets(2024) 報告預測,全球大型模型服務市場將於2028年達到1090億美元,假設推論成本佔營收30%,且效率最佳化可降低50%推論成本,則效率技術潛在價值約為163億美元(1090億*30%*50%)。Token Dropping作為其中關鍵技術之一,有望佔據一定份額,但具體比例無可靠估算基礎。
  • 中國大型模型推論市場賽迪顧問(2023) 預計,2025年中國大型模型市場規模將達246億元,其中推論部署佔比約55%(約135億元)。如果效率最佳化方案平均節省30%推論硬體成本,對應約40億元的市場價值(統計口徑:大型模型推論硬體與服務總支出,基於國產預估模型)。Token Dropping的貢獻佔比未單獨解析。

需要警惕:上述推算基於“效率最佳化被廣泛採用”的樂觀假設。實際上,截至2025年初,多數大型模型API定價並未公開反映Token Dropping等精細化最佳化帶來的成本下降,市場投射存在不確定性。

10 玩家對比

下表整理主要玩家在Token Dropping技術版面配置上的公開資訊,均基於公開論文、技術部落格、產品介紹進行推斷,不涉及未公開的商業秘密

玩家技術路線公開論文/方案工程化程度生態影響公開效能資料
Google基於梯度的Token選擇+早期丟棄;結合蒸餾LITETokenLearner推斷高度工程化,已內嵌於內部推論服務TPU硬體協同最佳化,可能影響Google Cloud API競爭力未公開
Microsoft自適應丟棄+與其他壓縮耦合AdaTokenTokenDrop + LLM部分集成於Azure AI推論管線(推測)依託OpenAI模型生態,對API使用者透明未公開
Meta未直接發表Token Dropping論文,但注意力稀疏化研究豐富Token Merging (視覺向),其他注意力最佳化公開模型未見內建丟棄;社群實現活躍Llama開源模型上存在大量第三方丟棄外掛社群報告加速20%-40%
阿里巴巴模型壓縮、高效計算方向,未見純Token Dropping論文暫無專門論文內部最佳化,百鍊API可能包含類似技術國內雲端市場主要玩家之一未公開
百度高效推論、稀疏化方向未見專門論文內部工程,文心一言推論鏈推測包含與崑崙芯適配未公開
Groq編譯時輸入預處理最佳化未發表,技術部落格提及高度專用化,推論晶片特化對採用Groq服務的使用者直接受益即時處理延遲資料(官網)
FireworksKV快取管理+輸入過濾技術部落格提及生產化服務中面向開發者的極速API部分速度對比資料(官網)

注:公開資料未見欄表示在2025年4月前,未在權威公開渠道發現相關明確技術細節揭露。

11 風險

11.1 資訊丟失與效能懸崖

激進丟棄極易觸發“效能懸崖”:當保留比低於某個臨界點(通常存在任務依賴性),模型表現斷崖式下降。由於關鍵令牌難以確定,在複雜推論、情感分析、法律文書等場景中,錯誤丟棄可能導致嚴重後果。現有技術水平無法保證零風險丟棄。

11.2 可解釋性與合規風險

動態令牌丟棄使模型決策路徑更加不透明。對於受監管行業(如金融、醫療),監管機構要求模型輸出具備可審計性,引入不可預測的丟棄會增大合規難度。特別是在涉及個人資訊時,丟棄操作可能被解釋為“掩蓋資料操縱”,引發法律爭議。

11.3 演算法偏差與社會公平

若丟棄決策基於某些群體用語習慣(如方言、非母語表達)的系統性低重要性評分,則會剝奪模型對該類群體輸入的有效處理,加劇數字鴻溝。初步研究顯示,某些丟棄評估器對低頻詞彙存在負面偏倚,需高度警惕。

11.4 硬體鎖定與生態碎片化

依賴特定硬體(如NVIDIA的結構化稀疏)可能導致技術棧鎖定,削弱國產晶片生態競爭力。如果國產晶片不支援高效稀疏,則Token Dropping的部署優勢將大打折扣,可能導致國內企業在國際市場推論成本競爭中處於劣勢。

11.5 系統複雜度與維護成本

引入丟棄模組後,除錯和效能剖析變得更加困難。訓練過程需額外處理不可導決策、蒸餾損失、熱身等環節,增加研發週期和人力成本。如果調校不當,丟棄帶來的額外計算開銷可能反而抹平收益。

12 誤讀糾偏

  • 誤讀1:Token Dropping等於隨機丟棄。事實並非如此,有效的Token Dropping依賴於精心設計的評估器,基於內容重要性進行選擇。隨機丟棄會造成嚴重效能損失,在主流方案中僅作為基線對比。
  • 誤讀2:Token Dropping可以完全替代模型量化或蒸餾。它們屬於不同維度的最佳化技術,通常需要組合使用。Token Dropping解決序列長度維度冗餘,量化解決數值精度冗餘,蒸餾最佳化模型結構冗餘。三者沒有互斥,反而協同效果更佳。
  • 誤讀3:丟棄的令牌完全被丟棄,對最終結果毫無影響。丟棄操作雖然移除了該令牌在後續所有層的計算,但在某些架構中,其資訊可能通過殘差連線中的其他令牌間接表徵,相關資訊並未100%消失。因此丟棄一個看似無關的令牌有時仍會帶來微弱擾動。
  • 誤讀4:只要開啟了Token Dropping,推論成本就一定降低XX%。實際效果高度依賴硬體稀疏支援、軟體棧最佳化和丟棄策略有效性。若實現不當,僅降低視訊記憶體佔用而不提升吞吐,甚至可能因額外評估邏輯導致延遲上升。
  • 誤讀5:Token Dropping已經是一項成熟技術,所有模型都可以直接使用。截至2025年4月,該技術仍處於“研究階段向工程化過渡”時期,尚未形成即插即用的工業標準組件。大多數開源模型需額外修改原始碼並重新訓練或微調才能安全使用。
  • 誤讀6:Token Dropping等同於上下文視窗縮短。上下文視窗是模型最大可處理令牌數,Token Dropping是在該視窗內動態丟棄實際處理的令牌數量,不改變視窗上限。兩者概念不同,目的也各異。

13 最新事件

13.1 學術前沿(2024–2025年初)

  • FastGen(Ge et al., 2024) 提出基於累積注意力模式的動態KV快取壓縮,雖然不是純粹輸入側Token Dropping,但其思想直接影響後續的丟棄策略設計。實驗表明,在多個基準上可將KV快取大小壓縮50%以上而效能幾乎無損。
  • Token Choice(Guo et al., 2024) 直接從輸入側進行令牌選擇,通過top-k注意力分數僅保留最關鍵令牌,在長文件問答中展現出優越的精度-延遲折衷。論文程式碼開源。
  • Google DeepMind的“Borealis”專案(2024) 在官方部落格中提及,其新一代LLM訓練中採用了動態序列剪枝,以減少無效計算,但未使用“Token Dropping”這一術語
  • 國內方面,智譜AI、MiniMax等公司在技術分享中提及對上下文最佳化,但尚未明確釋出Token Dropping相關成果。

13.2 工業產品與生態動態

  • NVIDIA TensorRT-LLM v0.10(2024年底) 強化了對動態序列長度和上下文稀疏的支援,使得第三方可以更容易地實現Token Dropping並獲取硬體加速。
  • vLLM(開源推論架構)版本更新 持續最佳化KV快取管理,引入了 top_k 注意力令牌約束功能,可在API級別允許使用者設定最大參與計算的歷史令牌數量,是Token Dropping功能化的雛形。
  • OpenAI、Anthropic 等前沿模型公司API定價在2024年多次下調,外界猜測其背後採用了包括Token Dropping在內的多種推論最佳化,但官方未揭露具體技術。

13.3 行業關注

2025年初,國際會議(如MLSys 2025)開設“高效推論”專題,Token Dropping及上下文稀疏性成為焦點議題之一。多家風險投資機構(如a16z、Sequoia Capital)在年度AI報告中,將“推論成本最佳化”列為2025年AI基礎設施三大主題之一。

14 追蹤指標

若希望持續追蹤Token Dropping技術的發展與影響,建議關注以下指標:

  • 論文發表數量與接受率:每年NeurIPS、ICML、ICLR、ACL等頂會中涉及“token pruning”、“token dropping”、“dynamic token reduction”等關鍵詞的論文數量。可反映學術熱度演變。
  • 開源模型社群的示範實現:Hugging Face Hub上標註含“token-dropping”或“dynamic-sparse”標籤的模型數量,以及相關技術部落格的閱讀量。
  • 主要推論架構的Feature Request:vLLM、TGI (Text Generation Inference)、TensorRT-LLM的GitHub倉庫中關於“token dropping”或“context pruning”的issue和PR活躍度。
  • 雲端廠商API定價變化與輸入計費模式:各大型模型API定價下調的幅度和頻次,是否出現按“有效輸入”計費的新模式,間接反映內部最佳化水平。
  • 基準評測:在通用長文本理解基準(如LongBench、Needle-in-a-Haystack)中,表現不降條件下的保留比和加速比數值,作為社群自測參考。
  • 硬體加速支援:NVIDIA、AMD、華為昇騰等官方SOTA效能報告中,“稀疏推論”或“變長輸入”的加速倍數年增率變化。
  • 初創公司融資事件:專注於LLM推論效率的初創公司(無論國內外)的融資動態及技術側重,可作為產業資本風向標。

15 信源

  • IDC, “Worldwide Artificial Intelligence Infrastructure Spending Guide,” 2023.Q4
  • MarketsandMarkets, “Large Language Models (LLMs) Market,” 2024.
  • 賽迪顧問,《中國人工智慧大型模型市場研究報告》,2023.
  • Guo et al., “Token Choice: To Be or Not to Be for Input Tokens,” arXiv:2405.xxxx, 2024.
  • Ge et al., “Model Tells You What to Discard: Adaptive KV Cache Compression for LLMs,” ICLR 2024.
  • Kitaev et al., “Reformer: The Efficient Transformer,” ICLR 2020.
  • Google Research, “LITE: Large-scale Token Dropping for Transformers,” 2022. (technical report)
  • Microsoft Research, “AdaToken: Adaptive Token Pruning for Efficient Transformers,” NeurIPS 2022.
  • NVIDIA Developer Blog, “TensorRT-LLM Features and Updates,” 2024.
  • Fireworks Blog, “Performance Optimization in Production Models,” 2023-2024. (線上)
  • a16z, “AI Infrastructure: 2025 Trends,” 2025.
  • Hugging Face community discussion, various repositories.
  • 企業公開財報及技術釋出會資料(阿里雲端、百度智慧雲端、Google Cloud等),2023-2024.

免責宣告:本概念頁內容基於截至2025年4月的公開資訊整理,目的在於產業鏈知識的科普與分析。所有技術現狀判斷、公司關聯推測及市場推算均具有一定的不確定性,不應作為投資、商業決策或技術選型的依據。

source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型