模型層 開放閱讀

Token 預算

Token Budget

概念 ID
token-budget
更新時間
2026-05-29
來源數量
待補

Token 預算

3 秒看懂

Token 預算是對單次前向傳播或生成任務中模型所能處理的最大 token 數量的硬約束。它直接決定模型能“看到”多少上下文、能輸出多長的內容,並從根本上制約推論成本、視訊記憶體佔用和可以完成的任務型別。如果說引數規模是模型的“腦容量”,Token 預算就是模型的“工作記憶容量”與單次計算賬單的上限。

3 分鐘產業解釋

在大語言模型(LLM)的工程體系中,Token 預算並非一個孤立的技術引數,而是一條貫穿訓練、微調、推論、定價與產品設計的業務紅線。訓練階段的 Token 預算體現為“訓練總 token 數”(通常以萬億 token 為度量單位),它直接影響模型的知識密度與湧現能力;推論階段的 Token 預算則由上下文視窗(輸入上限)和最大生成長度(輸出上限)共同定義,直接塑造產品的使用體驗——例如程式碼助手能否理解整個程式碼倉庫、智慧代理能否在一次會話中完成多步推論而不丟失記憶。

產業上,Token 預算已成為雲端運算成本核算的原子單元。各大型模型服務商(如 OpenAI、Anthropic、Google、阿里雲端等)的 API 定價絕大部分以“每百萬 tokens”計價,企業和開發者必須像管控財務預算那樣規劃 Token 使用,以防止單次呼叫成本失控。同時,Token 預算的膨脹(從早期的 2K 到如今的 128K、1M 甚至無限上下文的實驗)推動了對更高效注意力機制、狀態空間模型等基礎架構的激進探索,因為原生 Transformer 的自注意力複雜度與序列長度呈二次方關係,直接限制 Token 預算的經濟可行性。

15 分鐘專家深入

Token 預算的概念根植於 Transformer 序列建模的本質。要深入理解其影響,需要同時審視三個維度:計算複雜度、訪存瓶頸和對齊與任務設計

計算上,在標準的縮放點積注意力中,QK^T 矩陣的尺寸為 [batch, heads, seq_len, seq_len],計算量與 seq_len 的平方成正比。這意味著將 Token 預算從 4K 提升到 128K,在理論計算量上會帶來約 1024 倍的膨脹。實踐中,業界通過 FlashAttention 等 IO-aware 運算元將序列維度的訪存最佳化至極致,但並未改變 O(n²) 的複雜度本質,只是將瓶頸從視訊記憶體頻寬推向計算單元。當 Token 預算突破百萬級別時,即使經過稀疏注意力、分塊化處理(如 Ring Attention)或對硬體拓撲量身定製的序列並行策略,單次前向的硬體成本與延遲仍會急劇攀升,這使得百萬 Token 預算至今仍主要為具備大規模叢集的頭部實驗室所駕馭。

在訓練側,Token 預算呈現為“訓練 token 總量”,是資料工程的頂層設計指標。Chinchilla 縮放定律給出展望:在給定計算量下,最優的模型引數規模與訓練 token 數應同步放大,即每個引數大約對應 20 個訓練 token(具體系數因模型架構而異,此處為方向性敘述)。因此,訓練 Token 預算直接與訓練總成本掛鉤——訓練一個 100B 引數的模型,若採用 2T token 的訓練預算,僅資料預處理和工程排程就構成數千 GPU·年的投入。更深的隱含影響在於知識容量:訓練 Token 預算不足會導致模型欠擬合,表現為知識覆蓋狹窄、幻覺率升高;而過高的 Token 預算在邊際收益遞減的規律下會大幅浪費資本,因此如何依據“重複率”與“資料質量”精準制定訓練 Token 預算是大型模型訓練工程的核心博弈點。

產品與安全方面,Token 預算常被簡化為“上下文視窗大小”,但實則包含輸入預算、輸出預算與系統提示預算的細緻切分。在實際部署中,開發者必須將指令(system prompt)、檢索增強生成(RAG)的召回文件、多輪對話歷史以及使用者輸入統合在一個 Token 預算內,任何超出上限的部分不得不被截斷或壓縮。這種截斷行為可能致命地截斷關鍵安全指令或任務上下文,從而引發“中間迷失”(lost in the middle)現象。因此,Token 預算的設計是產品體驗與安全對齊的隱性結構工程師。

技術原理

Token 預算的技術本質可歸結為對序列建模中“可用位置索引數量的限制”。其影響鏈條可以從下至上逐層拆解。

1. 位置編碼的預算約束

在 Transformer 中,每個 token 被賦予一個位置編碼向量,並與語義嵌入相加。位置編碼方案(如可學習絕對位置編碼、RoPE、ALiBi 等)對 Token 預算提供了根本性限制。對於訓練時採用絕對位置編碼的模型,其最大位置索引 max_position 一經訓練便固化,推論時無法超越——這曾是早期 GPT-2(1024)、GPT-3(2048)的硬約束。相對的,旋轉位置編碼(RoPE)具有一定的外推能力,可以通過頻率縮放(如 NTK-aware 縮放)將 Token 預算在原有基礎上擴充套件 2~4 倍且不損失過多效能,這一技術被用於將 Llama 系列模型的 context window 從 2K 擴充套件到 32K 甚至更高。但外推並非無限:隨著預算急速擴大,位置編碼的解析度下降低頻資訊丟失,最終仍需後訓練階段的續訓(如針對長文本的微調)來真正“消化”擴充套件的 Token 預算。

2. 注意力機制的計算圖與二次瓶頸

輸入序列: x_1, x_2, ..., x_n          (n = Token 預算上限)
嵌入投影: Q = X·W_Q, K = X·W_K, V = X·W_V
注意力分數: S = Q·K^T            → 矩陣大小 [n, n] ,計算量 O(n²·d)
注意力權重: A = softmax(S / √d)
輸出:      O = A·V               → 計算量 O(n²·d)

在標準的全自注意力(full self-attention)下,每一步生成都要基於所有歷史 token 計算注意力分佈。對於 Token 預算 n,注意力分數矩陣的記憶體佔用為 2·n² 位元組(假設 bfloat16),當 n=128K 時,該矩陣高達 32GB,已經接近或約佔單張高階 GPU(如 H100 擁有 80GB HBM)的容量的一半,僅這一項就迫使序列必須跨卡分片或使用分塊重計算。各種高效注意力變體通過稀疏注意力模式(區域性視窗、長程步幅、基於雜湊或基於低秩分解)打破 n×n 的全連線,但以犧牲資訊流的完整性為代價,屬於在 Token 預算與計算可行性之間的人為折衷。

3. KV Cache 的視訊記憶體預算

自迴歸生成期間,每個歷史 token 的 K 和 V 向量都被快取,以避免重複計算。KV 快取的視訊記憶體佔用公式為:

KV_cache_size = 2 × batch_size × layers × n × d_head × num_heads × bytes_per_param

對一個 7B 規模的模型(典型層數 32,頭數 32,d_head=128),以 1 個 batch、1M Token 預算、FP16 儲存估算,KV 快取獨佔大約 512GB 視訊記憶體。因此,Token 預算直接轉化為視訊記憶體預算,成為推論晶片(GPU 或定製 ASIC)的硬容量指標。這也是為何 HBM 容量與頻寬成為大推論叢集部署的核心約束,以及為何多查詢注意力(MQA)和分組查詢注意力(GQA)被廣泛採用——它們通過共享 KV 頭大幅壓縮該快取,等效提升可支援的 Token 預算。

4. 訓練預算與計算量關係

訓練 Token 預算(總訓練 token 數 D)結合模型引數量 N,通過縮放定律估算總計算量 C ≈ 6 N D(前向+反向的大致係數)。這意味著訓練預算每翻一倍,所需浮點運算量至少翻倍。最佳化的訓練策略會監控評價損失(eval loss)隨訓練預算增長的變化曲線,當損失下降趨於平緩時,繼續追加 Token 預算的效率遞減,引導商業決策中的“停止點”。

技術演進史

  • 2017-2018:固定預算時代
    Transformer 原論文和 GPT-1 使用數百到 512 token 的預算,受限於訓練資料和計算資源。BERT 的 512 token 長度成為分類任務的標配,非生成式架構的自然語言理解工作受該預算約束,長文件需粗暴截斷。
  • 2019-2020:千級到萬級探索
    GPT-2 提升至 1024,GPT-3 設定為 2048。隨著記憶體最佳化技術(梯度檢查點、混合精度)的出現,長序列訓練成為可能。Reformer、Longformer 等提出稀疏注意力機制,試圖以線性或 nlogn 複雜度擴充套件 Token 預算到數萬,但通用性受限。
  • 2021-2022:RoPE 與高效長文本微調
    旋轉位置編碼被廣泛採納,結合線性偏置方法(ALiBi),模型在訓練後通過微調可外推到 8K-32K。這一時期,32K 成為開源社群的高階配置,研究工作轉向如何在不完全重訓的前提下“解鎖”訓練時未見的 Token 預算。
  • 2023:商業化百 K 級視窗
    Anthropic 的 Claude 宣佈 100K token 上下文,OpenAI 釋出 GPT-4 Turbo 128K,Google Gemini 1.5 Pro 通過模型架構(如混合專家與高效注意力)直接支援百萬 token 輸入長度,展示了強大的長上下文建模能力。產業界將 Token 預算直接作為產品差異化賣點,並掀起“長上下文”評測競賽。
  • 2024-至今:架構變革與準無限預算
    新興的狀態空間模型(如 Mamba、RWKV)將序列建模的複雜度降至線性,理論上 Token 預算僅受視訊記憶體容量限制,不再直接關聯計算量的平方增長。Transformer 方面,微軟、Meta 等推出分塊化的並行長序列方案(如 Ring Attention 配合序列並行),在數百個 GPU 上實現百萬級 token 預算的完整注意力訓練。Token 預算的軍備競賽已從“多長”轉向“多深的理解和多高的訊雜比”。

技術路線對比

由於本條目缺乏檢索到的精確引數,以下對比以定性方式呈現,數值為一般性估算,不繫結特定廠商。

技術路線原生 Token 預算上限計算複雜度 vs. n長程依賴質量訓練/擴充套件難度典型應用場景
全自注意力(基準)受視訊記憶體限制,典型 2K~128KO(n²)高(理論上全域性)中等到高(需並行策略)通用生成、通用對話
稀疏注意力(視窗+全域性)可達 1M+(工程可實現)O(n·k) 或 O(n·log n)中等(依賴模式設計)中(需定製 mask)長文件摘要、程式碼庫分析
線性化注意力理論上可接近視訊記憶體極限O(n)較低(模型容量受限)低到中需要超高吞吐的流式處理
狀態空間模型(SSM)未充分揭露,可支援 1M+O(n)上下文檢索強,推論弱?仍在快速演進長序列分類、DNA/時序、探索性生成
混合模型(注意力+SSM)方向性試驗,可期百萬級O(n·log n) ~ O(n)力求接近全注意力下一代通用基座模型

注:上述“Token 預算上限”為工程實現與精度可接受範圍內的估算值,實際產品表現受訓練策略、微調資料和量化水平影響巨大。

上下游

  • 上游硬體與基礎設施:Token 預算直接拉動對高頻寬記憶體(HBM)容量的需求,因為大 Token 預算的推論要求 KV 快取能完全放在片上或近存。同時,多節點互聯頻寬(如 NVLink、InfiniBand、PCIe 5.0/6.0)決定序列並行效率,從而影響系統可實現的整體 Token 預算極限。上游受益方包括 GPU 製造商、HBM 顆粒廠商、高速互聯晶片(Switch、Retimer)以及伺服器組裝商。
  • 下游應用與生態
    • 長上下文理解類產品(法律合同審查、醫療記錄分析、企業知識庫問答)將 Token 預算視為準入證——低於 100K token 則幾乎無法完整處理單份文件。
    • 智慧代理與多步推論架構需要大 Token 預算來容納規劃、觀察、反思的完整歷史,Token 預算不足會直接導致任務失敗。
    • API 經濟:模型服務商的計費模式完全錨定 Token 使用量,因此開發者工具鏈中出現大量“Token 預算最佳化器”——通過快取、提示詞壓縮、動態剪枝歷史等手段降低 Token 消耗,直接形成 TO B 效率工具市場。

關鍵指標

  1. 最大上下文視窗(輸入 Token 預算):產品宣傳的核心數字,但並非越大越好,需配合有效利用率(如 RULER、Needle in a Haystack 得分)評估真實資訊提取能力。
  2. 有效生成長度(輸出 Token 預算):實際推論中模型的輸出令牌上限,受到推論架構和 KV 快取預分配影響。長輸出場景(如生成一部小說)對預算要求不亞於輸入。
  3. 總訓練 Token 數(訓練預算):反映模型“讀了”多少資料,直接聯絡訓練成本和知識廣度。
  4. KV 快取每 token 位元組數2 × num_layers × num_key_value_heads × d_head × precision_bytes,此值決定特定硬體下 Token 預算的硬物理上限。
  5. 每百萬 token 推論成本:綜合反映硬體效率、模型壓縮和 Token 預算策略的商業化指標。
  6. Token 截斷率與資訊丟失率:在實際部署中,由於輸入超過預算而被丟棄的文本比例,是產品健康度的重要監控項。

供需與市場資料

由於搜尋工具未能返回即時市場報告,本節僅提供方向性趨勢描述,不作為投資建議。

  • 供給端,頭部基礎模型提供商正加速開放更大的上下文視窗,將其作為差異化戰略。2024 年,多家主流 API 將預設 Token 預算提升至 128K 或更高,同時開始試點百萬級視窗。供給側的擴大直接擠壓了早前專攻“長文本向量資料庫”的中介軟體企業。
  • 需求端,根據企業調研的定性反饋,多數知識密集型應用(如客服、法務、研究報告分析)能接受的“實用” Token 預算下限約為 32K,當預算超過 128K 後,任務成功率提升的邊際效應開始遞減,但極個別場景(全程式碼庫理解、長影片轉錄)仍渴求百萬級預算。市場整體呈現兩極分化:中小開發者追求費效比,在 4K~16K 區間通過 RAG 策略分解任務;大型企業與科研機構作為高 Token 預算的早期採納者,直接推動高階推論叢集的訂單。
  • 成本結構上,據估算([未充分揭露]),當前主流 GPU 雲端上每百萬 token 推論成本中,計算與視訊記憶體電力消耗佔比超過 60%,且 Token 預算增大時,視訊記憶體成本佔比因 KV 快取快速膨脹而顯著上升,促使推論硬體向大容量定製化方向演進。隨著 Token 預算的繼續膨脹,推論成本曲線將由當前的近似線性轉向非線性陡增。

代表公司與資本對映

  • OpenAI / Anthropic / Google / Meta:定義了 Token 預算的產品化標準,控制了最前沿的百萬級上下文能力,其資本支出高度集中於訓練更大 Token 預算所需的超算叢集。
  • NVIDIA / AMD:作為推論硬體寡頭,其 H100、MI300X 等 GPU 的 HBM 容量直接決定了單卡可支撐的 Token 預算上限,推動向更高 HBM 容量的迭代。下一代產品路標中,HBM 容量翻倍(如從 80GB 到 192GB)意味著 Token 預算的等效倍增,構成商業催化劑。
  • 雲端服務商(Azure、AWS、GCP、阿里雲端):大 Token 預算推論成為 GPU 例項高階規格的核心賣點,吸引高價值企業客戶。
  • 初創與工具(Anthropic 雖大但算此列;上下文壓縮/快取類工具商):如 LangChain、MemGPT、形態各異的 prompt compressor,其價值建立在對 Token 預算的最佳化與虛擬化上,幫助使用者在有限預算內實現更長邏輯鏈。
  • 開源生態(Meta Llama、Mistral、Qwen):通過釋出可擴充套件上下文視窗的開源模型,讓中小企業得以低成本享受高 Token 預算紅利,加快商業落地。

投資邏輯

  1. 視訊記憶體容量至上:Token 預算提升路徑高度依賴單卡 HBM 容量與互聯頻寬。投資邏輯上,HBM 供應鏈(顆粒、封裝、襯底)以及高頻寬互聯晶片會因大 Token 預算需求的普遍化而持續獲得訂單增量。
  2. 產品粘性與轉換成本:企業使用者一旦將工作流建立在某個高 Token 預算模型(例如將內部知識庫的完整上下文交由特定模型處理),切換成本極高。因此,率先提供穩定高 Token 預算服務的廠商有望構築 moat(護城河)。
  3. 降本工具鏈的價值:在 Token 成本尚未大幅下降的階段,專注於“Token 預算最佳化”的軟體層(快取命中、提示壓縮、動態路由小模型)具有短期爆發性需求。但隨硬體效率改進和長視窗成為標配,該細分可能被侵蝕。
  4. 警惕“預算通脹”的資本浪費:無止境攀爬 Token 預算會迫使雲端廠商和 AI 實驗室不斷升級叢集,帶來重資產折舊風險。應關注模型在實際長上下文任務中的準確率/召回率曲線,尋找“有效預算”大於“紙面預算”的標的,即結構效率創新的公司。
  5. 訓練 Token 預算的規模化轉折:當訓練資料 Token 預算接近高質量網際網路文本文件的總體量時,合成數據與多模態資料將成為新的訓練預算來源,帶來資料工程工具鏈的投資機會。

常見誤讀糾偏

誤讀1:Token 預算就是上下文視窗長度,越長一定越好。
糾偏:上下文視窗長度只是硬上限,實際有效預算受位置編碼外推質量、注意力訊雜比及模型“記憶”容量影響。長視窗但準確率(如在多針大海撈針測試中)低的模型,其有效 Token 預算反而低,強制使用反而引入噪聲,降低整體效能。另外,極長的 Token 預算可能導致延遲呈二次增長,影響互動體驗,產品設計須在長與快之間取得平衡。

誤讀2:訓練 Token 預算等同於資料量的簡單相加,重複資料也能累積。
糾偏:訓練 Token 預算的質量維度不可忽視。重複無資訊密度的 token(如模板、低質網路爬蟲內容)不僅浪費預算,還會導致模型過擬合噪音。實證研究發現,在總訓練 token 數固定的情況下,高度去重與高質量篩選的資料集,其下游效能顯著優於數量膨脹但質量參差的資料。因此,Token 預算的管理本質上是資訊預算的有效分配,而非機械堆積。

學習路徑

  • 入門:閱讀 Jay Alammar 的《The Illustrated Transformer》視覺化注意力機制,直觀理解 token 如何在序列中互動。然後使用 OpenAI 的 Tokenizer 工具分析文本的 token 劃分,建立對預算計量的體感。
  • 進階:精讀 FlashAttention 論文和 Tri Dao 的相關部落格,學習如何通過運算元融合和分塊來突破 Token 預算的視訊記憶體牆。同時,研讀 Chinchilla 縮放定律論文,掌握訓練 token 預算的經濟學原理。
  • 深入:研究 Ring Attention、DeepSpeed Ulysses 及其序列並行實現,理解大規模 Token 預算在分散式系統上的工程實踐。探索狀態空間模型(如 Mamba)的線性複雜度原理,重新整理對 Token 預算限制的認知架構。
  • 實踐:在真實場景中設計一個需要大 Token 預算的應用(如多輪對話的客服 Agent),通過逐步放大上下文視窗,觀察推論成本、延遲與任務成功率的變化,繪製出屬於你自己的“有效 Token 預算曲線”。

一句話總結

Token 預算是大型模型工作記憶的物理上限,定義了智慧邊界的經濟學方程,而其膨脹史則映射了整個 AI 產業從架構創新到硬體競賽的每一次脈搏。

延伸閱讀與來源

source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型