Tokens per Second
3 秒看懂
Tokens per Second(每秒生成的 Token 数,简称 Tokens/s)是衡量大语言模型推理速度的黄金指标,直接对应终端用户从输入 Prompt 到获得完整回答的“体感快慢”。它不是唯一与原始算力挂钩,还受模型参数量、序列长度、显存带宽、批处理策略和推理优化技术的综合影响。简言之:Tokens/s 越高,相同时间内模型能阅读或生成的文本越长,服务成本越低,用户体验越丝滑。
3 分钟产业解释
在 AI 产业语境下,Tokens/s 通常指大模型单次前向传播(自回归解码)阶段,从产生第一个新 Token 开始,单位时间内连续生成 Token 的平均速率(或稳态速率)。它深刻绑定硬件层、系统层和模型层的协同设计:
- 硬件层:GPU 的显存带宽(HBM 带宽)往往是推理吞吐的瓶颈,因为每个 Token 生成都需要访存整个模型的权重;算力(FLOPS)则决定计算密集部分的快慢。
- 系统层:推理框架通过张量并行、流水线并行、KV 缓存管理、连续批处理(Continuous Batching)等技术,提升单 GPU 或集群的 Token 吞吐。
- 模型层:模型架构(Dense 还是 MoE)、参数量、量化精度(FP16/INT8/INT4)、注意力机制(FlashAttention、vLLM 的 PagedAttention)都会大幅改变 Tokens/s。
产业关注两类 Tokens/s:单用户交互速率(Inter-token Latency 的倒数)和系统总吞吐(Total Tokens/s,通常用 TPS 表示)。云服务商以总 TPS 定价,终端用户则以单个请求的 Token 生成速率感知延迟。平衡二者是推理优化的核心。
15 分钟专家深入
将 Tokens/s 拆解为三个层次理解:
- 模型理论计算量:每个 Token 生成所需的最小浮点操作数。
- 硬件可实现峰值:GPU 在受限于计算带宽或内存带宽时的理论上限。
- 软件栈的实际效率:从框架调度、算子融合到内存拷贝的工程损耗。
理论计算边界: 自回归解码的本质是串行——必须先生成当前 Token,才能将其作为下一步的输入。因此单个请求的 Token 生成延迟(毫秒/Token) 与硬件延迟直接关联,而其倒数就是单用户速率。 若忽略批量效应,生成一个 Token 的计算量约为 2 × 参数量(仅前向传播)FLOPs。对于一个 70B 参数的模型,约需 140G FLOPs 的算力。若 GPU 的推理算力为 200 TFLOPS(FP16),理论上限约为 200T / 140G ≈ 1428 Tokens/s,但这要求内存带宽能将权重和 KV 缓存及时喂给计算单元,实际远达不到此值。
内存带宽瓶颈现实: 权重驻留在显存,每生成一个 Token 需要完整读取一遍权重矩阵。权重的存取量 = 参数量 × 带宽效率因子。以 70B 模型、FP16(140GB)为例,若 GPU 显存带宽为 2 TB/s,则理论访存上限为 2TB / 140GB ≈ 14.6 次/秒,即仅约 14.6 Tokens/s。这远低于计算上限,因此绝大部分大模型推理是显存带宽受限。这就是为何 HBM 带宽成为 GPU 厂商军备竞赛焦点,FlashAttention 类算法通过减少 HBM 读写来逼近带宽上限,而批处理(Batching)能复用权重读取,将总吞吐推高至数千 Tokens/s。
批处理与并发的影响: 当多用户请求合并成批量(Batch),GPU 可一次读取权重,同时服务多个请求,总 Tokens/s ≈ 单请求速率 × 批大小(忽略额外开销)。例如,若单请求速率 50 Tokens/s,批大小 64,总 TPS 理论上可达 3200。但批大小受限于显存容量(需存储所有请求的 KV 缓存)。K-V 缓存规模 = 批大小 × 序列长度 × 隐层维度 × 层数 × 精度,因此长序列场景下批大小被迫压缩,总吞吐骤降。
系统并行拆解: 要超线性扩展吞吐,需张量并行(Tensor Parallelism)将权重切分到多 GPU,每次生成 Token 时多卡通过通信原语(如 AllReduce)聚合中间结果。通信延迟会侵蚀 Tokens/s,因此需高速互联(NVLink/InfiniBand)。未获得具体通信时延数字,但产业公认:单卡推理延迟最低,多卡并行能提升总吞吐但不一定降低单 Token 延迟,甚或增加延迟。
技术原理
大模型推理的自回归 Token 生成流程
输入 Prompt "今天天气怎么样" → Tokenize → [t1,t2,t3,t4]
↓
Prefill 阶段:并行计算所有输入 Token 的 K,V 缓存
↓
Decode 阶段:循环生成新 Token
t5 = 模型(输入序列 + 隐藏状态,K,V缓存)
输出 "很",拼接序列 → 再输入模型
t6 = 模型(序列+ "很") → "不错"
...
直到输出 EOS。
- Prefill 是一次计算密集型步骤,将 Prompt 的 Key-Value 向量存储为缓存,此阶段吞吐高但对首 Token 延迟影响大。
- Decode 是内存带宽密集型的循环,每个新 Token 只做一次全模型前向传播,每次读取全部权重并更新 K-V 缓存。
核心公式
生成每个 Token 的延迟 ≈ max( 内存流转时间 , 计算时间 ) + 通信开销 (若多卡并行)
- 内存流转时间(秒/Token)= 模型总字节量 / 有效显存带宽
其中模型总字节量 = 参数量 × 精度(如 FP16 为 2 字节),有效带宽因非连续访问、算子效率而打折。 - 计算时间(秒/Token)= 2 × 参数量 × FLOPs 利用率倒数 / GPU 有效算力
2N 为每个 Token 前向传播约需的浮点操作数(矩阵乘法为主)。FLOPs 利用率在带宽密集场景极低(<10%)。 - 系统总 Tokens/s = 批大小 × 每 Token 延迟的倒数。
硬件/软件协同的典型优化机制
- KV 缓存管理:PagedAttention(vLLM)将缓存分成 Block,允许非连续存储,避免显存碎片,提升批大小上限。
- 算子融合:将 Attention 中的 Softmax、Masking、MatMul 融合成一个 CUDA kernel,减少显存读写。
- FlashAttention:通过分块计算和重计算策略,大幅减少了 Attention 模块的 HBM 读写量(但访问复杂度仍为 O(N²),仅常数因子显著降低),契合内存带宽瓶颈。
- 量化:将权重和激活从 FP16 压至 INT8 甚至 INT4,直接缩小模型字节量,线性提升 Tokens/s,代价是精度轻微损失。
- 投机解码(Speculative Decoding):用小模型快速生成多个候选 Token,再由大模型并行验证,单个验证批次可接受多个 Token,显着提升单请求感知速率。
由于无法获取具体 GPU 带宽、算力实测数据,本节定量分析仅使用产业通用原理,未引用厂商标称值。
技术演进史
- 2020 年之前:BERT 等微调模型的时代,推理速度不突出,评价多用样本/秒,Tokens/s 概念尚未普及。
- GPT-3(2020)发布:175B 参数的庞大模型让推理延迟成为显著痛点,产业开始系统研究生成吞吐。NVIDIA Triton 推理服务器等引入动态批处理。
- 2022 年下半年:ChatGPT 引爆大模型应用,用户体感延迟成产品竞争关键,FlashAttention 论文(Dao et al., 2022)提出减少 HBM 读写,大幅提升长序列 Tokens/s。
- 2023 年:PagedAttention 和 vLLM 算法将吞吐推至新高度,常用说法的“数十倍提升”反映了从朴素实现到工程优化后的代差。投机解码成为服务端标配。
- 2024 年至今:HBM3e 带宽突破 8 TB/s 以上,推理卡(如 NVIDIA GB200)专设大容量 HBM、Transformer Engine 支持 FP8/FP4,持续拉高 Tokens/s 天花板。开源框架(SGLang、LMDeploy)通过并行策略和约束解码进一步压榨硬件上限。
具体各代硬件 Tokens/s 实测数据因模型与配置差异悬殊,未获取精确代际对比,故不列出数字。
技术路线对比(量化表)
以下对比基于定性分析,因缺少检索证据,数值为近似关系抽象:
| 维度 | 自回归标准解码 | 连续批处理 | 投机解码 | 多模型集成 |
|---|---|---|---|---|
| 单请求 Tokens/s | 低(受限于带宽) | 中(通过调度隐藏延迟) | 高(小模型快跑+大模型验证) | 不直接提升,但可用更小专业模型换速 |
| 系统总 TPS | 低(无法并行) | 高(显存允许下极大化批) | 中(存在小模型开销) | 视负载可分流 |
| 实现复杂度 | 低 | 中等(需动态调度) | 高(需训练或对齐小模型) | 高(路由策略) |
| 模型精度损失 | 无 | 无 | 理论无,数学等价 | 可能因分工有损 |
量化数据因缺乏检索支撑,故仅保留关系对比。
上下游
- 上游:GPU/ASIC 芯片商(提供高带宽 HBM 和算力)、服务器代工、高速互联方案(NVLink、InfiniBand、PCIe)、内存厂商(HBM3/3e 供应商)。
- 中游:基础模型研发商(推出架构和权重)、推理优化框架(vLLM、TensorRT-LLM、SGLang)、云服务商(提供模型推理 API)。
- 下游:各类 AI 原生应用(对话助手、代码生成、文生文服务)、企业内部部署(知识库、自动化流程),对 Tokens/s 敏感决定了产品能否实时交互。
关键指标
- Tok/s 单用户:直接影响聊天机器人的打字机效果,要求通常 >20 Tokens/s 以求流畅。
- TPS(Total Tokens per Second):云服务计费基础,体现集群总吞吐。
- TTFT(Time To First Token):Prefill 产生的首 Token 延迟,与 Tokens/s 区分但共同决定体验。
- Inter-token Latency:连续 Token 间隔,数值 = 1 / Tokens/s(稳态时)。
- 批量利用率:实际吞吐 / 理论最大吞吐,反映软件栈和硬件利用效率。
供需与市场数据
由于本次检索失败,无法获取精确的市场调研数据。依据行业一般认知:随着 AI 应用渗透,推理侧算力需求已超过训练端,Tokens/s 直接转化为云服务商的营收能力(每秒可计费 Token 量)。高性能推理 GPU 供不应求,导致云端 API 价格显著高于硬件成本,促使许多企业自建推理集群优化 Tokens/s 以降低成本。具体增长率和市场份额请参考权威分析机构(如 Gartner、IDC)报告,此处不作估计。
代表公司与资本映射
- NVIDIA:其 GPU 为推理部署绝对主流,TensorRT-LLM、Triton 推理服务器等软件栈强力绑定,通过提升 Tokens/s 护城河。
- 云厂商(AWS、Azure、GCP):售卖基于 GPU 的推理实例,Tok/s 能力决定 SKU 定价。
- 推理优化独角兽/项目:如 vLLM(社区)、SGLang、Fireworks、Anyscale 等,通过软件革新使同样硬件产出成倍 Tokens/s,形成资本吸引力。
- 超大规模模型公司(OpenAI、Anthropic、Google Deepmind):其内部推理基建极致优化 Tokens/s 以支撑数以亿计的用户并发,相关指标直接影响单位经济模型。
- 国产替代:华为昇腾、寒武纪等,在受限环境下适配主流推理框架,追赶 Tokens/s 的表现是占领市场的关键。
投资逻辑
- 硬件迭代:每一次 HBM 代际带宽翻倍(大致每两年),同等成本下 Tokens/s 有望大幅跃升,驱动换上代需求。
- 软件栈壁垒:能显著放大同样 GPU 的 Tokens/s 的推理框架公司,其技术授权或开源商业化模式蕴藏溢价。
- 服务效率套利:当推理 API 定价锚定在主流产品 Tokens/s 水平时,自建极致优化集群可获超额利润。
- 端侧推理:若小模型的 Tokens/s 在手机/PC NPU 上达到实用阈值,将催生新生态,特定 SoC 厂商受益。
- 警惕瓶颈转移:当内存带宽瓶颈接近极限,边际 Tokens/s 提升可能骤降,因此对比先进封装/存内计算技术是前瞻指标。
常见误读纠偏
- “70B 模型推理就是 7B 模型的 1/10 速度”
实际中,受内存带宽和 KV 缓存影响,大模型批处理能力和 Tokens/s 下降远非线性。例如 70B 权重读取量是 7B 的 10 倍,但若带宽充足且批处理得当,差距可能缩小;若显存吃紧,单卡的 Tokens/s 可能暴跌至远低于简单比例。需要实测。 - “总 Tokens/s 高意味着单用户快”
总 TPS 高常常是批处理堆出来的,单用户请求若与其他请求合并为大批次,可能因硬件计算/带宽资源的竞争导致单步推理延迟略增,从而轻微加大 Inter-token Latency,而非排队直接所致。服务级的首 Token 延迟和 Token 生成速率才是用户感受。 - “量化模型一定大幅提升 Tokens/s”
量化减少权重字节数,理论上线性提升 Tokens/s,但实际受限于解量化开销、算子不支持低精度等因素,增益可能小于比例,且某些架构(如 FP8 Transformer Engine)已有专用硬件优化,直接切换 INT4 未必更优。
学习路径
- 基础知识:搞懂 Transformer 自回归解码过程,理解矩阵乘、Softmax、注意力机制的计算量。
- 推理引擎:阅读 vLLM 论文(PagedAttention)和 FlashAttention 论文,掌握内存优化原理。
- 系统实践:使用 HuggingFace Transformers 做一次 GPT2/Llama 的推理,观察改动批大小、量化、序列长度与 Tokens/s 的关系。
- 硬件底层:学习 GPU 的流式多处理器架构、HBM 带宽测试、NVIDIA Nsight Systems 性能分析。
- 前沿跟踪:关注各开源框架的吞吐 benchmark 博客,理解版本迭代间的技术决策。
一句话总结
Tokens per Second 是连接模型硬实力、硬件极限与用户指尖触感的最终分数,其提升本质是打破内存带宽之壁、调度并发之美的系统工程。
延伸阅读与来源
由于本页面撰写时检索工具无法获取最新资料(HTTP 403),以下推荐获取权威信息的途径,代替具体文献条目:
- 学术论文:《FlashAttention: Fast and Memory-Efficient Exact Attention》《Efficient Memory Management for Large Language Model Serving with PagedAttention》(vLLM)。
- 官方文档:NVIDIA TensorRT-LLM 文档、vLLM 官方博客。
- 实测数据:关注 Artificial Analysis 等独立机构的模型推理速度对比,查看不同硬件下 Tokens/s 及定价。
- 行业分析:Gartner、IDC 关于 AI 推理芯片市场报告,各大投行对 NVIDIA、AMD 推理卡的分析报告。
- 社区:YC 孵化的开源项目、Hugging Face 的 LLM-perf 排行榜等持续更新 Tokens/s 基准。
注:以上全部技术参数和数字均未引用特定厂商标称,均为产业通用定性描述。实际部署时应以具体硬件、模型、框架组合的实测数据为唯一依据。