模型層 開放閱讀

Tokens per Second

Tokens/s

概念 ID
tokens-s
更新時間
2026-05-29
來源數量
待補

Tokens per Second

3 秒看懂

Tokens per Second(每秒生成的 Token 數,簡稱 Tokens/s)是衡量大語言模型推論速度的黃金指標,直接對應終端使用者從輸入 Prompt 到獲得完整回答的“體感快慢”。它不是唯一與原始算力掛鉤,還受模型引數量、序列長度、視訊記憶體頻寬、批處理策略和推論最佳化技術的綜合影響。簡言之:Tokens/s 越高,相同時間內模型能閱讀或生成的文本越長,服務成本越低,使用者體驗越絲滑。

3 分鐘產業解釋

在 AI 產業語境下,Tokens/s 通常指大型模型單次前向傳播(自迴歸解碼)階段,從產生第一個新 Token 開始,單位時間內連續生成 Token 的平均速率(或穩態速率)。它深刻繫結硬體層、系統層和模型層的協同設計:

  • 硬體層:GPU 的視訊記憶體頻寬(HBM 頻寬)往往是推論吞吐的瓶頸,因為每個 Token 生成都需要訪存整個模型的權重;算力(FLOPS)則決定計算密集部分的快慢。
  • 系統層:推論架構通過張量並行、流水線並行、KV 快取管理、連續批處理(Continuous Batching)等技術,提升單 GPU 或叢集的 Token 吞吐。
  • 模型層:模型架構(Dense 還是 MoE)、引數量、量化精度(FP16/INT8/INT4)、注意力機制(FlashAttention、vLLM 的 PagedAttention)都會大幅改變 Tokens/s。

產業關注兩類 Tokens/s:單使用者互動速率(Inter-token Latency 的倒數)和系統總吞吐(Total Tokens/s,通常用 TPS 表示)。雲端服務商以總 TPS 定價,終端使用者則以單個請求的 Token 生成速率感知延遲。平衡二者是推論最佳化的核心。

15 分鐘專家深入

將 Tokens/s 拆解為三個層次理解:

  1. 模型理論計算量:每個 Token 生成所需的最小浮點運算元。
  2. 硬體可實現峰值:GPU 在受限於計算頻寬或記憶體頻寬時的理論上限。
  3. 軟體棧的實際效率:從架構排程、運算元融合到記憶體複製的工程損耗。

理論計算邊界: 自迴歸解碼的本質是序列——必須先生成當前 Token,才能將其作為下一步的輸入。因此單個請求的 Token 生成延遲(毫秒/Token) 與硬體延遲直接關聯,而其倒數就是單使用者速率。 若忽略批次效應,生成一個 Token 的計算量約為 2 × 引數量(僅前向傳播)FLOPs。對於一個 70B 引數的模型,約需 140G FLOPs 的算力。若 GPU 的推論算力為 200 TFLOPS(FP16),理論上限約為 200T / 140G ≈ 1428 Tokens/s,但這要求記憶體頻寬能將權重和 KV 快取及時餵給計算單元,實際遠達不到此值。

記憶體頻寬瓶頸現實: 權重駐留在視訊記憶體,每生成一個 Token 需要完整讀取一遍權重矩陣。權重的存取量 = 引數量 × 頻寬效率因子。以 70B 模型、FP16(140GB)為例,若 GPU 視訊記憶體頻寬為 2 TB/s,則理論訪存上限為 2TB / 140GB ≈ 14.6 次/秒,即僅約 14.6 Tokens/s。這遠低於計算上限,因此絕大部分大型模型推論是視訊記憶體頻寬受限。這就是為何 HBM 頻寬成為 GPU 廠商軍備競賽焦點,FlashAttention 類演算法通過減少 HBM 讀寫來逼近頻寬上限,而批處理(Batching)能複用權重讀取,將總吞吐推高至數千 Tokens/s。

批處理與併發的影響: 當多使用者請求合併成批次(Batch),GPU 可一次讀取權重,同時服務多個請求,總 Tokens/s ≈ 單請求速率 × 批大小(忽略額外開銷)。例如,若單請求速率 50 Tokens/s,批大小 64,總 TPS 理論上可達 3200。但批大小受限於視訊記憶體容量(需儲存所有請求的 KV 快取)。K-V 快取規模 = 批大小 × 序列長度 × 隱層維度 × 層數 × 精度,因此長序列場景下批大小被迫壓縮,總吞吐驟降。

系統並行拆解: 要超線性擴充套件吞吐,需張量並行(Tensor Parallelism)將權重切分到多 GPU,每次生成 Token 時多卡通過通訊原語(如 AllReduce)聚合中間結果。通訊延遲會侵蝕 Tokens/s,因此需高速互聯(NVLink/InfiniBand)。未獲得具體通訊時延數字,但產業公認:單卡推論延遲最低,多卡並行能提升總吞吐但不一定降低單 Token 延遲,甚或增加延遲。

技術原理

大型模型推論的自迴歸 Token 生成流程

輸入 Prompt "今天天氣怎麼樣" → Tokenize → [t1,t2,t3,t4]

Prefill 階段:平行計算所有輸入 Token 的 K,V 快取

Decode 階段:迴圈生成新 Token
    t5 = 模型(輸入序列 + 隱藏狀態,K,V快取)
    輸出 "很",拼接序列 → 再輸入模型
    t6 = 模型(序列+ "很") → "不錯"
    ...
直到輸出 EOS。
  • Prefill 是一次計算密集型步驟,將 Prompt 的 Key-Value 向量儲存為快取,此階段吞吐高但對首 Token 延遲影響大。
  • Decode 是記憶體頻寬密集型的迴圈,每個新 Token 只做一次全模型前向傳播,每次讀取全部權重並更新 K-V 快取。

核心公式

生成每個 Token 的延遲 ≈ max( 記憶體流轉時間 , 計算時間 ) + 通訊開銷 (若多卡並行)

  • 記憶體流轉時間(秒/Token)= 模型總位元組量 / 有效視訊記憶體頻寬
    其中模型總位元組量 = 引數量 × 精度(如 FP16 為 2 位元組),有效頻寬因非連續訪問、運算元效率而打折。
  • 計算時間(秒/Token)= 2 × 引數量 × FLOPs 利用率倒數 / GPU 有效算力
    2N 為每個 Token 前向傳播約需的浮點運算元(矩陣乘法為主)。FLOPs 利用率在頻寬密集場景極低(<10%)。
  • 系統總 Tokens/s = 批大小 × 每 Token 延遲的倒數。

硬體/軟體協同的典型最佳化機制

  • KV 快取管理:PagedAttention(vLLM)將快取分成 Block,允許非連續儲存,避免視訊記憶體碎片,提升批大小上限。
  • 運算元融合:將 Attention 中的 Softmax、Masking、MatMul 融合成一個 CUDA kernel,減少視訊記憶體讀寫。
  • FlashAttention:通過分塊計算和重計算策略,大幅減少了 Attention 模組的 HBM 讀寫量(但訪問複雜度仍為 O(N²),僅常數因子顯著降低),契合記憶體頻寬瓶頸。
  • 量化:將權重和啟用從 FP16 壓至 INT8 甚至 INT4,直接縮小模型位元組量,線性提升 Tokens/s,代價是精度輕微損失。
  • 投機解碼(Speculative Decoding):用小模型快速生成多個候選 Token,再由大型模型並行驗證,單個驗證批次可接受多個 Token,顯著提升單請求感知速率。

由於無法獲取具體 GPU 頻寬、算力實測資料,本節定量分析僅使用產業通用原理,未引用廠商標稱值。

技術演進史

  • 2020 年之前:BERT 等微調模型的時代,推論速度不突出,評價多用樣本/秒,Tokens/s 概念尚未普及。
  • GPT-3(2020)釋出:175B 引數的龐大型模型讓推論延遲成為顯著痛點,產業開始系統研究生成吞吐。NVIDIA Triton 推論伺服器等引入動態批處理。
  • 2022 年下半年:ChatGPT 引爆大型模型應用,使用者體感延遲成產品競爭關鍵,FlashAttention 論文(Dao et al., 2022)提出減少 HBM 讀寫,大幅提升長序列 Tokens/s。
  • 2023 年:PagedAttention 和 vLLM 演算法將吞吐推至新高度,常用說法的“數十倍提升”反映了從樸素實現到工程最佳化後的代差。投機解碼成為服務端標配。
  • 2024 年至今:HBM3e 頻寬突破 8 TB/s 以上,推論卡(如 NVIDIA GB200)專設大容量 HBM、Transformer Engine 支援 FP8/FP4,持續拉高 Tokens/s 天花板。開源架構(SGLang、LMDeploy)通過並行策略和約束解碼進一步壓榨硬體上限。

具體各代硬體 Tokens/s 實測資料因模型與配置差異懸殊,未獲取精確代際對比,故不列出數字。

技術路線對比(量化表)

以下對比基於定性分析,因缺少檢索證據,數值為近似關係抽象:

維度自迴歸標準解碼連續批處理投機解碼多模型整合
單請求 Tokens/s低(受限於頻寬)中(通過排程隱藏延遲)高(小模型快跑+大型模型驗證)不直接提升,但可用更小專業模型換速
系統總 TPS低(無法並行)高(視訊記憶體允許下極大化批)中(存在小模型開銷)視負載可分流
實現複雜度中等(需動態排程)高(需訓練或對齊小模型)高(路由策略)
模型精度損失理論無,數學等價可能因分工有損

量化資料因缺乏檢索支撐,故僅保留關係對比。

上下游

  • 上游:GPU/ASIC 晶片商(提供高頻寬 HBM 和算力)、伺服器代工、高速互聯方案(NVLink、InfiniBand、PCIe)、記憶體廠商(HBM3/3e 供應商)。
  • 中游:基礎模型研發商(推出架構和權重)、推論最佳化架構(vLLM、TensorRT-LLM、SGLang)、雲端服務商(提供模型推論 API)。
  • 下游:各類 AI 原生應用(對話助手、程式碼生成、文生文服務)、企業內部部署(知識庫、自動化流程),對 Tokens/s 敏感決定了產品能否即時互動。

關鍵指標

  1. Tok/s 單使用者:直接影響聊天機器人的打字機效果,要求通常 >20 Tokens/s 以求流暢。
  2. TPS(Total Tokens per Second):雲端服務計費基礎,體現叢集總吞吐。
  3. TTFT(Time To First Token):Prefill 產生的首 Token 延遲,與 Tokens/s 區分但共同決定體驗。
  4. Inter-token Latency:連續 Token 間隔,數值 = 1 / Tokens/s(穩態時)。
  5. 批次利用率:實際吞吐 / 理論最大吞吐,反映軟體棧和硬體利用效率。

供需與市場資料

由於本次檢索失敗,無法獲取精確的市場調研資料。依據行業一般認知:隨著 AI 應用滲透,推論側算力需求已超過訓練端,Tokens/s 直接轉化為雲端服務商的營收能力(每秒可計費 Token 量)。高效能推論 GPU 供不應求,導致雲端端 API 價格顯著高於硬體成本,促使許多企業自建推論叢集最佳化 Tokens/s 以降低成本。具體增長率和市場份額請參考權威分析機構(如 Gartner、IDC)報告,此處不作估計。

代表公司與資本對映

  • NVIDIA:其 GPU 為推論部署絕對主流,TensorRT-LLM、Triton 推論伺服器等軟體棧強力繫結,通過提升 Tokens/s 護城河。
  • 雲端廠商(AWS、Azure、GCP):售賣基於 GPU 的推論例項,Tok/s 能力決定 SKU 定價。
  • 推論最佳化獨角獸/專案:如 vLLM(社群)、SGLang、Fireworks、Anyscale 等,通過軟體革新使同樣硬體產出成倍 Tokens/s,形成資本吸引力。
  • 超大規模模型公司(OpenAI、Anthropic、Google Deepmind):其內部推論基建極致最佳化 Tokens/s 以支撐數以億計的使用者併發,相關指標直接影響單位經濟模型。
  • 國產替代:華為昇騰、寒武紀等,在受限環境下適配主流推論架構,追趕 Tokens/s 的表現是佔領市場的關鍵。

投資邏輯

  • 硬體迭代:每一次 HBM 代際頻寬翻倍(大致每兩年),同等成本下 Tokens/s 有望大幅躍升,驅動換上代需求。
  • 軟體棧壁壘:能顯著放大同樣 GPU 的 Tokens/s 的推論架構公司,其技術授權或開源商業化模式蘊藏溢價。
  • 服務效率套利:當推論 API 定價錨定在主流產品 Tokens/s 水平時,自建極致最佳化叢集可獲超額獲利。
  • 端側推論:若小模型的 Tokens/s 在手機/PC NPU 上達到實用閾值,將催生新生態,特定 SoC 廠商受益。
  • 警惕瓶頸轉移:當記憶體頻寬瓶頸接近極限,邊際 Tokens/s 提升可能驟降,因此對比先進封裝/存內計算技術是前瞻指標。

常見誤讀糾偏

  1. “70B 模型推論就是 7B 模型的 1/10 速度”
    實際中,受記憶體頻寬和 KV 快取影響,大型模型批處理能力和 Tokens/s 下降遠非線性。例如 70B 權重讀取量是 7B 的 10 倍,但若頻寬充足且批處理得當,差距可能縮小;若視訊記憶體吃緊,單卡的 Tokens/s 可能暴跌至遠低於簡單比例。需要實測。
  2. “總 Tokens/s 高意味著單使用者快”
    總 TPS 高常常是批處理堆出來的,單使用者請求若與其他請求合併為大批次,可能因硬體計算/頻寬資源的競爭導致單步推論延遲略增,從而輕微加大 Inter-token Latency,而非排隊直接所致。服務級的首 Token 延遲和 Token 生成速率才是使用者感受。
  3. “量化模型一定大幅提升 Tokens/s”
    量化減少權重位元組數,理論上線性提升 Tokens/s,但實際受限於解量化開銷、運算元不支援低精度等因素,增益可能小於比例,且某些架構(如 FP8 Transformer Engine)已有專用硬體最佳化,直接切換 INT4 未必更優。

學習路徑

  1. 基礎知識:搞懂 Transformer 自迴歸解碼過程,理解矩陣乘、Softmax、注意力機制的計算量。
  2. 推論引擎:閱讀 vLLM 論文(PagedAttention)和 FlashAttention 論文,掌握記憶體最佳化原理。
  3. 系統實踐:使用 HuggingFace Transformers 做一次 GPT2/Llama 的推論,觀察改動批大小、量化、序列長度與 Tokens/s 的關係。
  4. 硬體底層:學習 GPU 的流式多處理器架構、HBM 頻寬測試、NVIDIA Nsight Systems 效能分析。
  5. 前沿追蹤:關注各開源架構的吞吐 benchmark 部落格,理解版本迭代間的技術決策。

一句話總結

Tokens per Second 是連線模型硬實力、硬體極限與使用者指尖觸感的最終分數,其提升本質是打破記憶體頻寬之壁、排程併發之美的系統工程。

延伸閱讀與來源

由於本頁面撰寫時檢索工具無法獲取最新資料(HTTP 403),以下推薦獲取權威資訊的途徑,代替具體文獻條目:

  • 學術論文:《FlashAttention: Fast and Memory-Efficient Exact Attention》《Efficient Memory Management for Large Language Model Serving with PagedAttention》(vLLM)。
  • 官方文件:NVIDIA TensorRT-LLM 文件、vLLM 官方部落格。
  • 實測資料:關注 Artificial Analysis 等獨立機構的模型推論速度對比,檢視不同硬體下 Tokens/s 及定價。
  • 行業分析:Gartner、IDC 關於 AI 推論晶片市場報告,各大投行對 NVIDIA、AMD 推論卡的分析報告。
  • 社群:YC 孵化的開源專案、Hugging Face 的 LLM-perf 排行榜等持續更新 Tokens/s 基準。

注:以上全部技術引數和數字均未引用特定廠商標稱,均為產業通用定性描述。實際部署時應以具體硬體、模型、架構組合的實測資料為唯一依據。

source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型