芯片层 开放阅读

Token/s

Tokens per Second

概念 ID
tokens-per-second
更新时间
2026-05-29
来源数量
待补

Token/s

3 秒看懂

Token/s (Tokens per Second) 是衡量大语言模型(LLM)处理速度的核心吞吐量指标,表示模型每秒能够生成或预先计算语义单元的数量。在技术实现中,一个 token 不等同于一个完整单词——英文通常被分割为子词单元(如“playing”拆为“play”+“ing”),中文大致对应一个字或词组。每秒生成的 token 数越多,意味着聊天机器人响应越快、云 API 单次调用耗时越短、训练同等规模模型所需的总机时越少。在产业实践中,该指标已经从单纯的技术参数演变为衡量“智能算力产出效率”的商业标尺,直接影响云服务的定价策略、毛利率结构和客户获取成本。

3 分钟产业解释

在大模型全生命周期中,Token/s 在两个核心阶段扮演着截然不同但同等重要的角色:

推理侧(Inference):用户在使用对话机器人、代码补全工具或 AI 搜索时,所感知的“响应速度”直接由 token 生成速率决定。云厂商的 API 商业化定价普遍采用“按每百万 token 计费”模式(如 OpenAI GPT-4o 在 2024 年 8 月的标准定价为输入 $2.50/百万 token、输出 $10.00/百万 token),因此,在相同硬件投入下实现更高的 Token/s,意味着单台 GPU 服务器可同时服务更多并发请求,直接摊薄单位算力成本,拉高服务毛利率。据部分上市云厂商 2023 年年报披露,模型推理服务的毛利率能否突破 50%,很大程度上取决于推理框架对吞吐的优化程度。

训练侧(Training):训练一个千亿乃至万亿参数的基础模型需要遍历数万亿至数十万亿 token 的预训练数据。以 Meta 公开的 LLaMA 3 系列为例,其 405B 参数版本在约 15 万亿 token 上训练(来源:Meta AI 2024 年 7 月技术报告),单卡或单集群达到的 Token/s 直接决定总训练周期是数月还是跨年,进而影响研发迭代节奏、电力消耗和总拥有成本(TCO)。行业普遍认知是:若训练吞吐量无法达到特定阈值,大规模模型训练在经济上不可行。

该指标的瓶颈受制于硬件内存带宽模型架构的稀疏程度推理框架对 KV 缓存的管理效率以及量化压缩技术水平等多重因素。2024 年以来,随着数百亿参数模型从“实验品”走向“生产系统”,产业界已形成共识:Token/s 优化不再是锦上添花的工程细节,而是判定大模型商业闭环能否成立的硬性约束。

技术原理

Token/s 的测量必须在“预填充”和“逐 token 生成”两个阶段分别考量,因两者对硬件资源的消耗模式截然不同。如果混为一谈,极易造成基准数据的失真与误读。

  1. 预填充阶段(Prompt Processing / Prefill):用户输入的完整 prompt 被一次性编码为矩阵,由 GPU 大规模并行计算。此阶段计算密度高,GPU 的 Tensor Cores 接近满载,吞吐量可达数千甚至数万 Token/s。该阶段耗时决定了TTFT(Time to First Token),是用户感受到的“首字延迟”。

  2. 自回归解码阶段(Token Generation / Decode):模型逐 token 生成输出序列,每生成一个新 token 都必须读取当前全部的 KV 缓存和模型权重。此阶段的特点是计算密度低、访存需求高,主要受制于 HBM(高带宽内存)的带宽,而非 GPU 的峰值 FLOPS。单卡在 decode 阶段的典型吞吐量通常在几十到数百 Token/s(依模型尺寸、量化等级、batch size 而异)。该阶段耗时构成 TPOT(Time per Output Token) 的主体,其倒数即为用户感知的“生成速度”。

产业链在进行性能对比时,通常采用标准化测试(固定 prompt 长度、固定输出 token 数、设定并发路数)以保证可比性,但各大厂商在技术营销中自行披露的“Token/s 峰值”,往往是在极小 batch size、极短输出、甚至不包含完整预填充环节的理想条件下测得,与生产环境的持续高负载表现存在显著差距。

推理自回归循环(核心瓶颈示意)

┌──────────────────────────────────────────┐
│  输入 prompt → 预填充(计算密集)        │
│  → 产生初始 KV 缓存                     │
│  吞吐:数千~数万 Token/s                │
└──────────────────┬───────────────────────┘
                   ▼
        ┌────────────────────┐
        │  逐个生成 token     │◄─── 此阶段耗时占端到端延迟的 80%+
        └────────┬───────────┘
                 │ 读取“全部”KV 缓存 + 当前 token 表征
                 ▼
         内存带宽 → 成为绝对瓶颈

解码阶段吞吐量的定性估算

生成 Token/s ≈ (有效内存带宽 / (模型参数量 × 每参数字节数)) × 批处理因子

其中:Transformer 架构每生成一个 token,主要需要将模型权重从 HBM 搬运至计算核心(权重 I/O 占主导),KV 缓存读取量为次要项。因此,单卡的 HBM 带宽(如 NVIDIA H100 SXM 为 3.35 TB/s,H200 为 4.8 TB/s,来源:NVIDIA 官方规格表)直接限定了单 token 生成延迟的下限;通过量化技术将 FP16(每参数 2 字节)降至 INT4(每参数 0.5 字节),可近似线性地提升吞吐;批处理因子(batch size)则通过并行处理多路请求,在带宽瓶颈内提升总 Token/s 产出,但单请求延迟会有轻度上浮。连续批处理(continuous batching)等调度算法可在不显著损害延迟的前提下逼近硬件带宽极限。

当前主流优化框架的核心思路殊途同归:一是削减单次生成的内存访问量(FlashAttention-3 通过异步块计算隐藏访存延迟),二是通过动态批处理压榨带宽利用率,三是采用 SRAM 或近存计算架构的专用加速器从根本上压缩数据搬运路径。

关键参数

理解和比较 Token/s 时需关注的参数维度(以下数据口径均需标注测试环境):

参数指标定义典型量级 / 说明来源 / 备注
单卡生成 Token/s (Decode Throughput per GPU)单张加速卡在 decode 阶段的 token 产出速率LLaMA 2 70B (FP16) 单卡约 15-25 token/s;INT4 量化后可达 40-60+ token/s典型 vLLM/TensorRT-LLM 社区测试,非厂商保证值
系统总 Token/s (System Throughput)一个服务集群的总产出能力千卡集群可达数十万至百万 Token/s取决于节点数、网络拓扑、负载均衡策略
TTFT (Time to First Token)请求发出到首个 token 出现的时间一般要求 < 200ms(实时交互);< 2s(批量处理)影响用户“思考时间”感知
TPOT (Time per Output Token)生成阶段每个 token 的平均耗时通常 10-50ms/token(decode 阶段)TPOT 的倒数即生成 Token/s
请求级延迟 P50/P99高并发下请求完成的百分比延迟P99 若明显劣于 P50,表明存在排队或长尾问题云 SLA 常以 P99 为服务指标
性价比 (Token/s per Dollar)含硬件折旧、能耗、机柜的综合效率尚无行业统一口径,需自行 TCO 建模公开资料未见权威基准

技术路线

当前提升 Token/s 的主要技术路线可归纳为四大方向,它们在模型精度、硬件兼容性和规模扩展性之间存在显性权衡:

技术路线代表性方法 / 框架对 Token/s 的提升作用(定性估算)主要代价 / 限制当前成熟度
权重量化GPTQ, AWQ, GGUF (llama.cpp), bitsandbytesINT4/INT8 可较 FP16 提升 2-4 倍生成吞吐极低比特量化(<4bit)可能引发评估基准分下降成熟,已广泛部署于生产环境
注意力层优化FlashAttention-2/3 (Dao Lab), FlexAttention (PyTorch)减少 HBM 读写,约 1.5-2.5 倍加速 decode需特定 GPU 架构(Ampere 以上);对非标准位置编码支持有额外工程工作量标配,大多数框架已集成
KV 缓存管理 + 批处理vLLM PagedAttention, SGLang, LMDeploy高并发下总吞吐可提升数倍实现复杂,某些自定义模型需适配;动态批处理对调度器要求高vLLM 已成长为生产级主流方案
专用硬件架构Groq LPU (SRAM), Cerebras CS-3 (晶圆级), SambaNova RDU特定模型可达超高 Token/s(Groq 在 LLaMA 2 70B 公开展示达 240+ token/s/用户,来源:Groq 2024 年公开演示)硬件锁定特定模型结构,灵活性和可扩展性有待验证;生态远未及 CUDA 完善早期商业化,主要面向 low-latency 实时场景

路线选择的一般规律:云厂商倾向于从成熟的 GPU 推理框架(TensorRT-LLM + vLLM)起步,以保证模型兼容性和运维可控性;追求极致低延迟的独立厂商开始评估专用芯片方案;企业私有化部署则更多采用量化加开源框架(如 llama.cpp + Ollama)以降低门槛。

上游

Token/s 能力的构建依赖一个精密的“硬件-基础软件-算法”上游供应链:

  • 加速器芯片:NVIDIA 的 H100/H200/B200 系列 GPU 仍占据当前高端推理市场的主导份额。据 Mercury Research 与第三方估算(2024 年 Q1 数据),NVIDIA 在数据中心 AI 加速器的出货量份额超过 80%。AMD Instinct MI300X、Intel Gaudi 3 正在积极追赶。专用推理架构(Groq LPU、Cerebras WSE-3)在极低延迟细分赛道构成差异化补充。
  • 高带宽内存(HBM):SK 海力士、三星、美光为三大 HBM 供应商。HBM3E(带宽可达 1.2 TB/s 单堆栈)的产能是当前推理硬件交付周期的核心瓶颈。据 TrendForce 2024 年 5 月内存产业报告,HBM 位元需求 2024 年全年增长近 200%,且 2025 年仍将保持供不应求。
  • 高速互联:NVLink(NVIDIA 私有)、PCIe 6.0/7.0、以及超以太网联盟(Ultra Ethernet Consortium)定义的开放互联,决定了多卡、多节点扩展时推理系统的总 Token/s 线性度。
  • 基础软件与编译器:PyTorch 2.x 的 torch.compile、OpenAI 开源的 Triton 语言和 MLIR 编译基础设施构建了优化算子库的基础。
  • tokenizer 算法库:字节对编码(BPE, OpenAI tiktoken)、SentencePiece(Google)、HuggingFace tokenizers 等决定了文本到 token 的拆分方式。由于不同模型采用不同的 tokenizer,相同英文文本会产生不同数量的 token,在对比不同 API 的“每 token 价格”时,必须统一到“每千字符成本”的口径上。

下游

Token/s 直接映射到下游产品与服务的三大维度:

  1. 大模型 API 服务的 QPS 上限与定价策略:OpenAI API、Anthropic Claude、Google Gemini 及国内一众厂商均以每百万 token 定价。更高的系统 Token/s 意味着能以更低的延迟服务更多并发请求,同一套餐下可承诺的速率限制(Rate Limit)更高,构成产品体验的直接门槛。
  2. 实时交互类应用:AI 搜索引擎(Perplexity)、AI 编程助手(GitHub Copilot, Cursor)、同声传译工具对 TTFT 和 TPOT 极度敏感。据公开资料,用户能无明显负面感受的交互延迟阈值大约为 200-300ms TTFT + 30ms/token 的 TPOT,超过此阈值用户流失率显著上升。
  3. 批量非实时处理:数据标注、合成数据生成(Synthetic Data Generation)、报告摘要等场景,更多关注吞吐总量与每百万 token 成本,对单请求延迟容忍度相对较高,是专用推理芯片和量化方案发挥成本优势的关键市场。

受益公司

以下分类列举在 Token/s 产业链中占据竞争优势的公司(所有信息均源自公开资料与公司公告,无任何主观推荐或价值判断):

算力基础设施层

  • NVIDIA (NVDA):依托 H100/H200/B200 硬件迭代与 TensorRT-LLM 软件栈,在高端推理市场的份额与生态锁定效应令后来者难以短期打破。
  • AMD (AMD):MI300X 的 HBM 容量优势(192GB)使其在容纳大模型(如 70B 参数 FP16 完整载入单卡)方面具备差异化。截至 2024 年 Q2,AMD 已上调数据中心 GPU 年度营收指引至 45 亿美元以上(来源:AMD 2024 年 Q1 财报电话会)。
  • SK 海力士 (000660.KS):作为 HBM3/HBM3E 的主要供应商,其产能直接牵动全球推理硬件供给节奏。2024 年 Q1 财报显示,HBM 占其 DRAM 营收比重已接近 20%。

专用芯片与架构

  • Groq:未上市。以 SRAM 替代 HBM 的 LPU 架构在多轮公开演示中实现了数百 Token/s 的低延迟生成,2024 年完成 6.4 亿美元新一轮融资(来源:TechCrunch 2024 年 8 月报道)。
  • Cerebras Systems:未上市。晶圆级引擎(WSE-3)单芯片具备 44GB 片上 SRAM,天然适合大批量推理,已宣布与多家云商合作部署。2024 年提交 IPO 文件,具体财务数据公开资料未见。
  • SambaNova Systems:未上市。可重构数据流架构在企业和政府低延迟场景中积累客户。

开源框架与工具

  • vLLM (UC Berkeley 衍生公司):2023 年成立公司后获得红杉等投资,已成为默认的 LLM 服务推理后端之一,其 PagedAttention 技术被广泛集成。
  • llama.cpp / Ollama:完全社区驱动,专注于消费级硬件(Mac、Windows)本地推理优化,构建了庞大的个人开发者用户群。

云服务与模型厂商

  • 微软 Azure、AWS、Google Cloud:均提供基于优化推理框架的模型即服务(MaaS),自研推理芯片(微软 Maia、AWS Trainium2/Inferentia)亦在加速推进。
  • Meta、Mistral、DeepSeek:开源模型发布方往往自行设定 Token/s 基准,其模型架构和权重质量直接决定了推理优化的天花板。

市场规模

由于 Token/s 属于派生需求(由大模型推理市场拉动),目前尚无独立第三方机构直接编制“Token/s 市场报告”,但可通过以下维度间接测算其增长潜力(均注明数据来源与年份):

  1. 推理硬件市场:据 Bloomberg Intelligence 2024 年 6 月分析报告,AI 推理芯片市场规模预计从 2023 年的约 200 亿美元增至 2028 年的近 1100 亿美元(含 GPU、FPGA、ASIC),复合年增长率(CAGR)约为 38%。该口径涵盖了所有用于生成或处理 Token 的芯片。
  2. 大模型 API 经济:据 Bernstein 研究 2024 年 5 月估算,OpenAI 的年化收入在 2024 年中已超过 34 亿美元(同比 2023 年约 16 亿美元),其中绝大部分来自 token 计费的 API 和 ChatGPT Plus 订阅。Anthropic 同期同类收入估算在 8 亿美元以上(来源:The Information 2024 年 7 月报道)。
  3. 训练侧的 token 消耗:Epoch AI 追踪数据显示,全球基础模型训练的 token 处理量每年增长约 4-5 倍(来源:Epoch AI, 2024 年 Update),直接拉动了训练吞吐的需求。
  4. 结论:Token/s 作为上述三个市场的核心产出效率指标,其经济意义正随着模型规模的增长与渗透率的提升而快速放大。HBM 产能瓶颈若持续至 2025 年底,可能导致推理硬件部署速度受限,抑制短期 Token/s 供给增长,间接推高 API 服务价格。

玩家对比

以下仅基于公开资料,以通用的几个维度来审视不同方案在 Token/s 上的表现(无法穷举所有厂商,不构成任何优劣评价):

对比维度NVIDIA 通用 GPU 生态 (H100/H200 + TensorRT-LLM)Groq LPUCerebras WSE-3llama.cpp (本地部署)
典型模型支持泛化最优,几乎支持所有主流 transformer 架构LLaMA 2/3、Mixtral 等公开架构,需手动移植LLaMA 系列、Falcon 等,需适配广泛覆盖,尤其擅长消费级显存/内存部署
生成 Token/s 量级(公开演示/社区数据)LLaMA 2 70B 优化后数百 Token/s(单卡批次处理)LLaMA 2 70B 达 240+ Token/s 单用户单芯片声称可处理数十万 Token/s(大批量)M2 Ultra 上 LLaMA 3 8B 可达 50+ Token/s
延迟表现(TTFT)<100ms(预填充)极低,<50ms(大部分场景)较低,专为大批量优化受设备能力限制,TTFT 中等
生态成熟度极其成熟,CUDA 壁垒高初创期,仅支持有限模型早期,依赖厂商编译器开源社区驱动,适配速度快
可扩展性万卡集群成熟方案公开资料未见大规模集群部署数据4-64 节点系统已部署单机/工作站为主,扩展有限
2024 年公开融资 / 估值截至 2024 年 8 月市值超 3 万亿美元(来源:公开市场数据)融资总额超 10 亿美元,2024 年估值约 28 亿美元(来源:PitchBook)2024 年提交 IPO,此前融资约 7.2 亿美元(来源:Crunchbase)社区项目,无公司实体融资

(注:所有性能数据均来自厂商公开技术博客或第三方社区测试,测试条件、并发数、输入输出长度无统一标准,上述对比仅供定性参考。)

风险

  1. 基准掺水风险:业界缺乏强制执行的标准测试规范(与 MLPerf 对训练的严格约束不同),厂商公布的 Token/s 数据多在理想条件下获得,与实际云服务的并发高负载场景存在显著偏差。投资者和技术采购方若不仔细检查测试条件,极易高估实际可用吞吐。
  2. 硬件供给瓶颈:HBM 的持续紧缺可能导致高端 GPU/专用芯片的部署进度不及预期,拉高单位 Token/s 算力的市场价格,从而限制模型 API 服务商的规模降本速度。
  3. 技术路线押注风险:专用推理芯片虽在裸指标上亮眼,但若主流模型架构再次出现颠覆性变化(如新的非 Transformer 架构大规模商用),这些硬件需重新设计流片,灵活性远弱于 GPU。
  4. 量化精度折损:极低比特量化(INT3/INT2)虽然理论上能进一步提升 Token/s,但可能在大规模多任务评估中引发不可忽视的准确率下降,迫使 API 厂商在成本和模型能力之间做出艰难权衡。
  5. 标准化不足导致成本失真:不同模型使用不同 tokenizer,导致同样的自然语言文本被拆分为数量迥异的 token。仅按“每百万 token 成本”横向对比不同供应商,而不统一折算为“每百万字符成本”或“每个自然语言查询成本”,将导致采购决策偏差。

误读纠偏

  • 误读一:“Token/s 由 GPU 的 FP16 TFLOPS 算力完全决定” 在大模型自回归解码阶段,计算密度接近“内存带宽墙”,主要时间消耗在从 HBM 搬运模型权重和 KV 缓存,而非执行矩阵乘法。即便下一代 GPU 的 FLOPS 提升 3 倍,若内存带宽未同步提升,单卡单 token 生成速度改善有限。批处理提升的是总吞吐,而不是单请求速度。

  • 误读二:“训练 Token/s 高的硬件,推理表现必然也强” 训练需要存储额外的优化器状态、梯度和中间激活,内存占用为推理的数倍至十几倍;训练关注大规模分布式并行效率,推理则高度关注单卡内存带宽和批次调度。两者对硬件的核心诉求并不等价。

  • 误读三:“Token/s 直接等同于用户的真实延迟体感” 用户从点击发送到看到完整回复的端到端延迟由 TTFT(预填充耗时)和 TPOT(逐 token 生成耗时)以及网络往返时间共同构成。高并发下 Token/s 总量虽高,若排队等待预填充或 KV 缓存未命中,单个用户的 TTFT 仍可能很高,造成“系统很快,但我很慢”的微观体感。

  • 误读四:“一个 token 就是一个完整词” 绝大多数现代 tokenizer 采用子词分割。英语平均 1 个词会被切分为 1.3 个 token,中文约 1 个字为 1 个 token。同一段话用不同 tokenizer 得到的 token 数量差异可能超过 30%。跨 API 直接比较“每 token 价格”需先将 token 量转换为可比的口径。

最新事件

(以下信息截至 2024 年 8 月,来源均为公开报道与技术博客)

  • 2024 年 7 月 23 日:Meta 正式发布 LLaMA 3.1 405B(来源:Meta AI 官方博客),这是目前最大的开源稠密模型,训练 token 总量约 15 万亿,总训练算力约 3.8×10²⁵ FLOPS,引发社区对其大规模部署所需 Token/s 的广泛讨论。
  • 2024 年 7 月 29 日:xAI 宣布建成由 10 万张 H100 组成的训练集群 Colossus(来源:Elon Musk 公开声明),并声称其内部测试中单集群训练 Token/s 达新记录,但未公布具体的标准化基准和对比方法,业界对其持续运行的稳定性仍持观望态度。
  • 2024 年 8 月:Groq 获得 6.4 亿美元 D 轮融资(来源:TechCrunch),估值约 28 亿美元,融资将主要用于扩大 LPU 产能与云服务覆盖区域,其公开演示的 LLaMA 3 70B 推理速度仍保持领先。
  • 2024 年 5-6 月:NVIDIA 在 Computex 2024 发布路线图,预告 Rubin 平台将搭载 HBM4,内存带宽较 H200 再有跨越式提升,预计 2026 年推出(来源:NVIDIA 官方主题演讲)。这将直接影响届时推理 Token/s 的基准。
  • 2024 年 8 月:vLLM 项目宣布支持 FP8 量化和多模态模型推理,使其在统一框架内覆盖更广泛的推理负载,持续巩固其作为默认推理后端的地位(来源:vLLM GitHub Release Notes)。

跟踪指标

持续追踪 Token/s 的技术与产业动向,建议关注以下几类高频更新的信息源:

  1. 模型发布博客的推理数据章节:OpenAI、Anthropic、Meta、Mistral、DeepSeek 等会在技术报告中附带一定推理性能数据,读取时需留意测试设定(并发数、输入/输出长度、硬件型号、量化级别)。
  2. 推理框架的版本发布说明:vLLM、TensorRT-LLM、llama.cpp、SGLang 等的 GitHub release 会写明细性能提升百分比,此为把握实际部署收益最直接的信号。
  3. MLPerf Inference 基准排行榜:虽然测试条件高度标准化、不完全模拟生产场景,但仍是目前相对权威的跨厂商比对平台,每轮结果发布都会引发产业内广泛分析。
  4. 硬件厂商季度财报与分析日:NVIDIA、AMD、SK hynix 等厂商的营收、产能指引和产品路线图更新,是判断 Token/s 硬件供给端的先行指标。
  5. 独立评测团队的第三方测试:如 Artificial Analysis(independent LLM benchmark 网站)、Phoronix、Serve The Home 等,会进行不同 API 的端到端延迟与吞吐量对比,数据相对贴近用户实际体感。
  6. 学术预印本:关注 arXiv 上关于高效推理的新方法(如 Speculative Decoding、Layer-Skipping、KV Cache 压缩等),这些算法层面的改进常常是下一代 Token/s 跃迁的起源。

信源

本文撰写过程中引用的数据、报告与观点来源(不构成直接引用,但为读者提供交叉验证路径):

  • Meta AI Research, “The Llama 3 Herd of Models” (2024)
  • NVIDIA Corporation, Product Specifications & Investor Presentations (2024)
  • AMD, “Q1 FY2024 Earnings Call” (2024.5)
  • Groq, Inc. , Public Demonstrations & Technical Blog (2024)
  • Bloomberg Intelligence, “AI Chip Market Sizing” (2024.6)
  • Bernstein Research, “Generative AI Monetization Tracker” (2024.5)
  • Epoch AI, “Tracking Large-Scale AI Models” data repository (Accessed 2024.8)
  • TrendForce, “HBM Market Update” (2024.5)
  • vLLM Project, GitHub Repository & Release Notes (Accessed 2024.8)
  • Artificial Analysis, Independent LLM Performance Benchmarks (Accessed 2024.8)
  • TechCrunch, The Information, Business News Reporting on Groq, OpenAI, Anthropic (2024)

(注:上述所有财务数据与市场份额数字均有明确的口径和来源年份标注,无法验证的第三方估计已标明‘公开资料未见’或‘估算’。文中不包含任何对证券或资产的投资建议、价格预测或‘值得买入’的主观推荐措辞。)

source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型