模型层 开放阅读

输出 token

Output Tokens

概念 ID
output-tokens
更新时间
2026-05-29
来源数量
待补

输出 token

3 秒看懂

  • 定义:输出 token(Output Token)是语言模型在生成文本时,自回归产生的每个最小语义单元。它可以是一个完整的单词、一个标点符号,或一个子词片段。
  • 核心意义:用户看到的所有模型回复,本质上都是一串输出 token 的序列。它是云厂商和模型公司计费的基准单位,也是衡量推理延迟和算力消耗的核心标尺。
  • 关键机制:模型采用“逐个预测”的方式生成输出 token,每生成一个新 token,都需依赖之前所有 token 的历史信息(通过 KV 缓存实现)。因此,输出 token 的数量直接决定了单次推理的总计算成本和显存占用。

3 分钟产业解释

在生成式 AI 的商业化版图中,输出 token 是模型“写作”行为的原子化度量。用户一个 100 字的回答,根据语言和分词器的不同,可能对应 130 至 200 个输出 token。对于产业而言,这个概念的商业价值体现在三个层面:

首先,它是云服务计费的基石。主流模型 API(如 OpenAI 的 GPT-4o、Anthropic 的 Claude 3.5 Sonnet)均采用按每百万输出 token 定价的模式,这是模型公司实现营收的最直接路径。其次,它定义了硬件成本的边界。推理芯片每秒能生成多少输出 token(即吞吐量,Output Tokens Per Second,OTPS),直接决定了支撑同等用户规模所需的 GPU 集群大小和电力成本。最后,它是用户体验的锚点。从用户发出请求到看到第一个输出 token 的时间(首 token 延迟),以及后续 token 的生成速度,共同构成了用户对模型“快”或“慢”的直观感知。因此,整个产业链——从底层芯片设计到上层推理框架——都围绕“如何更便宜、更快地产生高质量输出 token”这一目标展开优化。理解了输出 token 的成本曲线,就等于抓住了生成式 AI 商业化的脉搏。

技术原理

自回归生成机制

当前主流的 GPT 类大语言模型,其生成输出 token 的过程遵循标准的自回归(Autoregressive)范式。整个流程可以简化为一个循环迭代:

  1. 输入处理:用户的提示信息(Prompt)首先被分词器转换为一系列输入 token 序列 [t1, t2, ..., tn]
  2. 首次前向传播:模型对整个输入序列进行一次性的前向计算,并生成第一个输出 token t_{n+1},同时缓存每一步的 Key 和 Value 向量,形成 KV 缓存。
  3. 循环生成:将 t_{n+1} 拼接到序列末尾,形成新序列 [t1, ..., t_{n+1}]。模型仅对最新的 token 计算 Query,并与缓存的 K、V 向量进行注意力计算,生成下一个输出 token t_{n+2}
  4. 终止条件:重复步骤 3,直到模型生成特殊的结束符(EOS,End of Sequence)或达到预设的最大长度。

KV 缓存:推理成本的隐性推手

KV 缓存(Key-Value Cache)是理解输出 token 成本的关键技术。在标准的 Transformer 自注意力机制中,每个 token 都会生成 Query (Q)、Key (K) 和 Value (V) 向量。为了避免为历史上文重复计算,推理引擎会将每个已生成 token 的 K 和 V 向量存储在显存中。

  • 显存占用:每生成一个输出 token,系统就需要为所有 Transformer 层缓存一组新的 K 和 V 向量。对于一个 70B 参数的模型,每生成一个新 token,新增的 KV 缓存量约为 2 × 层数 × 隐藏维度 × 精度字节数。具体数值与模型架构相关,但规模通常在 MB 级别。这是长文本生成场景下显存膨胀的主要原因。
  • 计算复杂度:生成第 M 个输出 token 时,该 token 的 Q 向量需要与序列中所有 N+M-1 个 K 向量进行计算。因此,注意力计算的复杂度为 O(N),这里的 N 是输入和已生成输出 token 的总数。这意味着,在生成一个 1000 个 token 的长回答时,最后一步的注意力计算量远大于第一步。

采样策略的双面性

在生成下一个 token 的概率分布后,模型需要通过采样策略来挑选最终输出的 token。这一过程直接影响生成质量和成本。

  • 温度(Temperature):降低温度(如 0.1)会使概率分布更尖锐,模型倾向于选择概率最高的“安全” token,生成结果更确定但可能缺乏创造性。升高温度(如 1.0)则使得分布更平滑,低概率 token 被选中的几率增加,可能带来创造性,也增加了内容重复或逻辑混乱的风险。
  • Top-k/Top-p 采样:Top-k 限制模型仅在概率最高的 k 个候选 token 中采样;Top-p(核采样)则从概率累加和达到阈值 p 的最小候选集合中采样。二者都能有效避免生成低质量的尾部 token,但若设置不当(如 p 值过低),可能导致模型在狭窄的候选词中循环,生成无意义的重复片段,浪费算力。

关键参数

评估一个系统或模型的输出 token 生成能力,需关注以下核心参数,其数值均为公开资料或行业基准的典型范围:

  • 输出 token 单价(Price per 1M Output Tokens):这是最直接的成本指标。截至 2024 年,主流闭源模型如 GPT-4o 约为 10 美元/百万输出 token,Claude 3.5 Sonnet 为 15 美元/百万输出 token(来源:各公司官网 API 定价页)。开源模型的自部署成本则包含硬件折旧与电费,成本结构完全不同。
  • 输出吞吐量(Output Tokens Per Second, OTPS):衡量系统在单位时间内可生成的输出 token 总数。通常指在特定并发数下系统的整体吞吐。单请求的生成速度则被称为“生成速率”(Tokens/s)。高吞吐对优化批处理(Batching)和硬件带宽提出了极高要求。
  • 首 token 延迟(Time To First Token, TTFT):从用户请求发出,到服务端返回第一个输出 token 的时间。这是用户感知响应速度的关键指标,通常要求在毫秒级(理想值为 <100ms)。
  • Token-to-Token 延迟(Inter-Token Latency, ITL):两个连续输出 token 之间的生成间隔。它决定了文本是像人类打字一样逐字出现,还是瞬间整块出现,通常以毫秒为单位。
  • 显存带宽(Memory Bandwidth):在推理阶段,生成每个输出 token 都需要将整个模型的权重从显存(HBM)加载到计算单元一次。对于大参数规模模型(>100B),这一过程是典型的“内存带宽瓶颈”。因此,HBM(如 HBM3e)的带宽(单位 TB/s)直接决定了单卡的理论最高生成速度。

技术路线

针对如何降低输出 token 的成本和延迟,业界发展出多种技术路线,其对比分析如下:

维度标准自回归推测解码非自回归生成多查询/分组查询注意力
原理逐个串行生成 token,每步都经过完整模型。用小模型快速生成草稿 token 序列,再由大模型一次性并行验证。通过设计打破自回归依赖,尝试并行生成部分或全部序列。多个注意力头共享 K、V 向量,以减少 KV 缓存的大小和读写开销。
关键优势生成质量最高,是事实上的标准。无质量损失,可降低 2-3 倍延迟,对批处理友好。延迟极低,理论上可接近一次性生成。大幅减少显存占用和内存带宽需求,已成为模型架构标配。
主要代价延迟与输出长度线性相关,显存占用高。需部署两个模型,系统复杂度增加,内存占用更高。生成质量(尤其是文本连贯性)仍有显著差距。对模型容量有微小损失,但可通过增加其他维度补偿。
成熟度所有主流模型和框架均支持。已集成于 vLLM、TensorRT-LLM 等主流推理框架。学术研究活跃,工业界大范围应用有限。已被 GPT-3、Llama 2/3、Mistral 等广泛采用。

注:上述路线并不互斥。一个现代推理引擎可同时应用推测解码和分组查询注意力技术。

上游

输出 token 的成本和效率,由上游技术栈的进步直接决定。

  • 算力硬件
    • 大算力逻辑芯片(GPU/TPU/LPU):是生成 token 的执行者。英伟达 H100/H200/B200、AMD MI300X 等是 2024-2025 年的主力。其核心影响参数为 显存带宽(如 H200 的 4.8 TB/s)和 显存容量(如 H200 的 141GB HBM3e),容量决定了可容纳的最大模型规模和 KV 缓存长度(来源:NVIDIA、AMD 官网产品规格)。
    • 先进封装与互联:CoWoS(Chip-on-Wafer-on-Substrate)封装技术决定了 HBM 的集成度和良率,直接影响 AI 芯片的产能。NVLink 和 PCIe 等互联技术则是构建多卡推理集群的基础,决定了张量并行的效率。
  • 模型架构设计
    • 分词器:其词汇表大小和切分规则直接决定了同样语义信息对应多少输出 token。例如,中文专用分词器可比通用分词器节省 20%-30% 的 token 消耗(行业经验数据,非固定值)。
    • 注意力机制:从标准的多头注意力(MHA)演进出多查询注意力(MQA)和分组查询注意力(GQA),大幅缩减了 KV 缓存的尺寸。
  • 底层推理软件/框架
    • 编译器与内核库(如 vLLM、TensorRT-LLM、SGLang):通过算子融合、量化部署和 FlashAttention 算法,实现了对硬件算力的极度压榨。
    • KV 缓存管理:通过页面注意力(PagedAttention)等技术,精细化管理 KV 缓存的分配和回收,使有效吞吐量成倍提升。

下游

输出 token 是连接模型能力与最终用户的商业界面,其下游是庞大的应用生态。

  • 大模型 API 服务:云服务商(如微软 Azure、AWS Bedrock)和模型公司(OpenAI、Anthropic)将输出 token 的生成能力封装为 API 服务,并按用量计费。这是当前最主流的商业模式。
  • 终端 AI 应用
    • 对话助手(ChatGPT、Kimi、豆包):输出 token 质量(准确性、逻辑性)和成本(决定免费额度上限)是核心竞争力。
    • 代码生成(GitHub Copilot、Cursor):在代码场景中,用户通过 Tab 键接受的一段代码即为一组输出 token。其商业模式常为按月订阅,而非直接按 token 计费。
    • 内容创作/润色:文字、图片、视频生成工具的后端均依赖自回归或扩散模型的多步生成,其“步数”与 token 概念类似。
  • AI 原生工作流
    • AI 智能体(Agent):一个任务可能涉及数百次模型调用(思考、工具调用、总结),每次调用都产生输出 token。这使得单任务的总 token 消耗比单轮对话高出数个量级。
    • 检索增强生成(RAG):系统先检索外部文档,再将其作为上文交由模型生成输出 token。这种模式下,输出 token 的质量和事实性得到提升,但输入 token 的量级也会激增。

受益公司

输出 token 需求的指数级增长,清晰勾勒出一条受益产业链,涉及多个环节的上市公司(截至 2024 年公开财报年份)。以下分析不构成任何投资建议。

  • 模型与应用层
    • 微软 (FY2024):Azure AI 服务的增长主要由 GPT 系列模型的推理 token 消费驱动,是 OpenAI 输出 token 商业化的最大受益方和主要渠道。
    • Meta (2024 FY):虽不以 API 直接变现,但其开源 Llama 系列模型催生了庞大的第三方推理生态,由此间接拉动底层算力需求,巩固其 AI 基础设施战略。
  • 算力硬件层
    • 英伟达 (FY2025, 截至 2024 年 7 月):数据中心业务超 80% 的收入与大规模推理集群相关,H100/H200 GPU 是生成输出 token 的事实标准硬件。
    • AMD (2024 FY):MI300X 加速卡凭借更高的 HBM 容量和性价比,开始进入推理市场,直接与英伟达争夺云大厂和 AI SaaS 公司的订单。
    • 博通 (FY2024):为谷歌等超大规模客户定制 AI 推理 ASIC(如 TPU),其定制化芯片业务营收因推理需求的扩张而高速增长。
  • 推理服务层
    • Cloudflare / Fastly:边缘推理服务商,通过在靠近用户的边缘节点部署模型,可显著降低首 token 延迟,适用于对实时性要求极高的应用场景。

市场规模

关于输出 token 的直接市场规模,公开数据相对有限,通常隐含在更大的云服务或 AI 软件市场预测中。以下为基于第三方机构(如 Gartner、IDC)2024 年公开发布报告的趋势性分析和估算,口径为全球市场。

  • 云 AI 推理市场:作为云基础设施即服务(IaaS)和平台即服务(PaaS)的一部分,2024 年全球市场规模预计达到 350 亿至 450 亿美元(来源:IDC, Worldwide AI Infrastructure Tracker, 2024 H1)。其中,生成式 AI 的推理(即输出 token 的生成服务)所占份额正快速扩张,预计在 2025 年将超过训练市场。
  • AI 芯片:英伟达 2024 财年数据中心营收为 475 亿美元(来源:NVIDIA FY2024 10-K),其中推理相关(含推荐系统和 AI 生成)占比约 40%。这一数字直接反映了为输出 token 而采购的硬件支出规模。
  • 价格趋势:从 2023 年初至今,头部闭源模型的输出 token 单价已下降超 80%(来源:各公司 API 定价公告)。然而,总支出并未下降,反而随着多模态、长上下文和 Agent 等新应用的出现而爆发式增长,呈现出典型的“杰文斯悖论”特征。

玩家对比

主流模型的输出 token 成本与能力定位存在显著差异(数据来源:各公司官网 2024 年公开 API 定价,开源模型为自部署估算成本,仅作示例):

  • OpenAI (GPT-4o):全球最高吞吐量之一,多模态原生。输出价格:$10.00/1M tokens(128K 上下文)。定位:全能型高端标杆。
  • Anthropic (Claude 3.5 Sonnet):在复杂推理与长文本连贯性上领先。输出价格:$15.00/1M tokens(200K 上下文)。定位:安全可信的高端选择。
  • Google (Gemini 1.5 Pro):依托 TPU v5p 成本优势,原生多模态与超长上下文(2M)。输出价格:$10.50/1M tokens(<128K 上下文)。定位:高性价比、长文本专家。
  • Meta (Llama 3.1 70B/405B):完全开源,无 API 收费。自部署输出 token 成本主要取决于硬件利用率,如在 4 张 H100 上估计为 $2.00-$3.00/1M tokens(Semianalysis, 2024 年报告估算)。
  • DeepSeek (V2):采用 MoE 架构,在模型层实现极致降本。API 输出价格:¥1.00/1M tokens(约 $0.14/1M tokens)。定位:市场价格颠覆者。

风险

  1. 同质化与价格战:各家基础模型在输出质量上的差距正在缩小,导致 API 定价成为主要竞争手段。截至 2024 年底,中国市场已出现低于成本的输出 token 价格竞标,可能影响行业创新与长期盈利能力。
  2. “幻觉”带来的消耗风险:有缺陷的或恶意的用户提示可能导致模型进入循环(Loop)状态,重复生成毫无意义的输出 token。在 Agent 链式调用中,这类无效 token 消耗会被急剧放大,徒增成本。
  3. 单位经济模型的不确定性:输出 token 的硬件基础设施投入巨大,但 token 价格快速下降。行业普遍面临从“以 token 数量为营收”向“以 token 创造的价值为营收”的模式转型,初期探索面临较大不确定性。
  4. 数据隐私与安全合规:在生成输出 token 的过程中,严格的审查机制可能导致额外延迟。金融、医疗等垂直行业的监管条例会对输出 token 的用途和存储提出具体规定,成为商用化落地的主要屏障之一。

误读纠偏

  1. “输出 token 的计算成本与输入 token 相同”:这是极其普遍的误解。输入 token 在预填充阶段可利用并行计算,单个 token 的平均算力消耗较低。而输出 token 必须串行生成,且每一步都需访问完整的模型权重和不断增长的 KV 缓存,其单 token 算力开销和显存瓶颈远大于输入 token。在推理经济学中,输出 token 是成本的主体。
  2. “一个输出 token 就是一个单词”:错误。token 是由字节对编码或多语言分词器处理后的最小单元。对英文而言,平均 1 个 token 约等于 0.75 个单词;对中文,1 个 token 约为 1.5-2 个汉字。当用户按“字数”估算成本时,与实际 token 数会计费会有显著偏差。
  3. “模型输出越长,代表越聪明”:存在偏差。增加输出 token 数量并不等同于提供更准确或智能的答案。许多任务要求模型在极短的 token 长度内给出高精度的答案(如代码补全、简短翻译)。冗长的回复不仅增加延迟和成本,还可能引入更多“幻觉”。
  4. “MoE 模型的每个输出 token 都需 All-to-All 通信”:不完全准确。MoE(混合专家)模型中,每个输出 token 仅由路由网络分配的少数几个专家处理,并非所有专家都参与单 token 计算。All-to-All 通信主要发生在路由分配阶段,而非每个 token 本身的加解密计算过程中。

最新事件

  • OpenAI 历史性融资及推理需求(2024 年 10 月):OpenAI 完成 66 亿美元融资,估值达 1570 亿美元。公司声明资金将用于加速包括推理在内的前沿计算能力建设。其 CFO 公开表示,即使模型不断降价,客户总推理消费仍在快速攀升(来源:彭博社)。
  • NVIDIA Blackwell (B200) 架构发布(2024 年 3 月):号称在大模型推理性能上可达 H100 的 30 倍,支持 FP4 精度,旨在极大降低生成每个输出 token 的能源成本和总拥有成本。云大厂大规模部署后,预计将在 2025 年进一步拉低高端模型推理价格(来源:NVIDIA 新闻稿)。
  • 中国大模型 API 价格战(2024 年 5 月后):字节跳动、阿里巴巴、百度、腾讯等先后大幅下调旗下大模型 API 的输出 token 价格,部分轻量级模型甚至宣布免费。DeepSeek V2 的发布点燃战火,将百万 token 价格拉至人民币个位数,市场进入“厘时代”。

跟踪指标

要持续追踪输出 token 的产业动向,可关注以下量化指标和公开信息源:

  • API 定价公告:密切关注 OpenAI、Anthropic、Google Cloud、国内各云厂商官网的 API 定价变更,这是行业成本走向最直接的信号。
  • 硬件评测(MLPerf Inference):MLCommons 组织的机器学习推理基准测试,会公布不同硬件在不同模型下的离线吞吐量和服务器场景延迟得分,是衡量输出 token 硬件性能的权威对比(来源:mlcommons.org)。
  • 云厂商财报电话会:Microsoft(Azure AI 增速)、Google(GCP 的 AI 贡献)、Amazon(AWS Bedrock 客户采用率)的季度财报,可提炼出推理业务的宏观增长指标。
  • 技术前沿论文:关注 arXiv 上关于高效推理的论文(如新的量化、推测解码、KV 缓存压缩方法),这是判断成本下降曲线未来斜率的关键研发风向标。
  • 开源框架的社区采纳:vLLM、SGLang 等推理框架的 GitHub Stars 和贡献者增长曲线,可反映开发者对输出 token 性能优化和成本控制的集体关注度。

信源

  • Vaswani, A., et al. (2017). “Attention Is All You Need.” arXiv preprint. —— Transformer 与自注意力理论基础。
  • Leviathan, Y., et al. (2023). “Fast Inference from Transformers via Speculative Decoding.” ICML 2023. —— 推测解码原理与性能分析。
  • Kwon, W., et al. (2023). “Efficient Memory Management for Large Language Model Serving with PagedAttention.” arXiv preprint. —— vLLM 框架的核心机制。
  • OpenAI API Pricing. (2024). https://openai.com/api/pricing/.
  • Anthropic API Pricing. (2024). https://www.anthropic.com/pricing.
  • NVIDIA H200 Tensor Core GPU Datasheet. (2024). —— 显存带宽与容量规格。
  • AMD Instinct MI300X Accelerator Product Brief. (2024). —— 推理硬件规格。
  • Gomez, A. (2024). “NVIDIA Blackwell Platform Arrives to Accelerate AI.” NVIDIA Blog.
  • MLCommons Inference Results. (2024). https://mlcommons.org/benchmarks/inference-datacenter/.
  • Bass, D. & Love, J. (2024). “OpenAI Closes Historic $6.6 Billion Funding Round.” Bloomberg.
source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型