每 token 成本
1. 3 秒看懂
每 Token 成本 (Cost per Token) 是大语言模型生成一个最小编码单位(token)的综合费用。它由推理算力消耗、硬件折旧、电力冷却与模型训练摊销四部分构成,直接决定对话应用、代码助手、检索增强生成等产品的毛利率和可持续性。业界通过量化、混合专家(MoE)架构、专用推理芯片和规模效应持续压低这一成本,推动生成式 AI 从“按次付费实验”走向“大规模生产部署”,并加速 AI 商业模式从订阅制向按量计费、利润共享演变。
2. 3 分钟产业解释
每 Token 成本是整个 AI 产业的价值枢纽,类似云计算中的“每 vCPU·小时”或芯片制造中的“每平方毫米晶圆成本”。对模型供应商(OpenAI、Anthropic、Google 等),它将万亿级参数的智力劳动转化为可度量、可交易的基础商品;对应用开发者,它划定了客服机器人、代码生成、营销文案等场景的利润底线;对终端企业,它左右着“自建开源模型”与“调用商业 API”的采购决策。
降本动力来自三个核心环节:
- 推理硬件单位时间成本:GPU/TPU/ASIC 的租用、折旧、功耗费用,受半导体制程、高带宽内存(HBM)带宽和集群利用率制约。
- 单 Token 所需计算量:由模型架构(参数总量、激活参数比例、层数与隐藏维度)以及注意力机制的序列长度决定。算法创新(稀疏注意力、高效解码)可大幅压缩该值。
- 训练成本的合理摊销:一次千亿参数模型的预训练可能花费数千万至数亿美元(如 Meta 披露 Llama 3 405B 训练硬件投入逾 5000 万美元)。若模型在生命周期内服务数万亿 token,则每 token 训练摊销低于 0.01 美分;反之,用户不足则成本陡增,迫使厂商追求超高并发或转向开源社区分担。
从实际定价曲线观察,GPT‑3 级别模型 2021 年每百万 token 价格约 20–60 美元,到 2024 年已降至 0.5–2 美元(OpenAI 官方定价);2025 年初部分开源或小型模型(如 DeepSeek‑V2、Llama 3 8B 托管服务)已下探至 0.05–0.10 美元/百万 token(数据来源:各厂商官方定价页面及公开博客,2025 年 4 月整理)。年化降幅超过 70% 的价格压缩,正在将 AI 推理从“高端定制”推向“全民化基础设施”,同时重塑上游芯片、数据中心和能源市场的投资逻辑。
3. 技术原理
每 Token 成本的形成需从半导体的浮点运算和显存带宽微观层面理解,而不仅仅看 API 账单。
Token 的定义与计算负载
一个 token 可视为经过嵌入的数值向量所表达的最小语义单元(约合 0.75 个英文单词或 1.5 个中文字符)。大模型推理的本质是对输入 token 序列执行层叠的矩阵乘法和自注意力运算,逐个 token 输出概率分布。以主流稠密 Transformer 为例,生成单个 token 的近似浮点操作数(FLOPs)可表示为:
FLOPs_per_token ≈ 2 × N + 4 × n_layer × n_ctx × d_model
其中 N 为模型参数总量,第二项为注意力机制开销(n_ctx 为上下文长度,d_model 为模型维度)。对于 MoE(混合专家) 架构,实际计算量应替换为每次路由激活的参数量与共享层参数之和,从而使得每 Token 计算量较同等总参数量稠密模型降低 4–10 倍。
从 FLOPs 到时间与成本
若推理硬件的有效算力利用率(MFU) 为 U(通常 30%–50%,受显存带宽和计算图优化程度影响),标称峰值算力为 P (FLOPS),则处理单个 token 的最小耗时 t ≈ FLOPs_per_token / (P × U)。裸硬件成本近似为:
Cost_per_token ≈ C_hourly × t = C_hourly / (P × U / FLOPs_per_token)
其中 C_hourly 为硬件单位时间总拥有成本(含折旧、电力、空间)。引入批处理(batch size B)后,吞吐量 = B / t,实际每 token 成本可分摊至 C_hourly / throughput。但大 batch 会加剧 KV 缓存对显存的占用,迫使系统在计算效率与内存带宽之间权衡。此时成本瓶颈可能从计算转向数据搬运,即 “内存墙”。
量化技术(FP8、INT8、INT4)通过减少模型权重和激活的位宽,直接降低数据搬运量和乘法器压力,可在同等硬件上将每秒生成 token 数提升 2–4 倍,等效压缩每 Token 硬件占用时间,成为成本优化的第一性原理。同时,投机解码(结合小型草稿模型)可进一步减少大模型的调用次数(2–3 倍加速),在不损失精度的前提下降低昂贵计算量。
下图呈现推理管线的关键瓶颈:
┌───────────────┐
│ 模型权重 (FLOPs 主要消耗) │
└───────┬───────┘
│ 矩阵乘/注意力
┌──────────┐ ▼ ┌──────────┐
│ 输入 Tokens │──►前向计算(层叠)──►│ 输出 Token │
└──────────┘ │ └──────────┘
│ 中间激活 + KV Cache
┌───────▼────────┐
│ HBM/显存 (带宽限速) │
└────────────────┘
4. 关键参数
衡量每 Token 成本需跟踪以下参数体系:
- 每百万 token 价格($/M tokens):输入与输出价格分开统计,输出通常贵 2–5 倍(因需要顺序生成且易受内存墙限制)。该参数是市场定价的直接反映。
- 每 token 延迟(ms/token):影响用户体验的行为经济学指标,低延迟通常要求更高性能的硬件,从而推高成本;部分场景(如离线批处理)可放宽延迟以换取更低单价。
- 吞吐密度(tokens/秒/卡):衡量单张 GPU/TPU 的产出效率,反映软硬件协同优化水平。高吞吐意味着固定成本被更高商品量摊薄。
- 模型效率比(FLOPs/token):理论计算量,指导硬件选型,并用于对比不同架构固有的单位成本优势。
- 能量强度(tokens/kWh):关联电力成本和碳排放,在大规模部署中影响总运营费用。先进推理芯片可在相同能耗下输出数倍 token。
- 边际成本 vs. 全分摊成本:边际成本仅为单 token 的增量电力+计算损耗,可能低至全分摊成本的 30%;全分摊成本需包括研发摊销、网络、闲置率和软件许可。
- 推理 TCO(总拥有成本)溢价幅度:第三方研究机构 SemiAnalysis 在 2024 年多篇分析中指出,头部 API 提供商的推理 TCO 仅为公开定价的 40%–60%,溢价部分为毛利与研发回收;开源自行部署可将溢价降至零,但需承担运维与工程人力成本(来源:SemiAnalysis 2024 年公开文章)。
5. 技术路线
演进脉络
- 2020–2022 年:GPT‑3 引爆“token 经济”。175B 参数稠密推理需多卡联动,单 token 成本约 0.0001 美元量级,倒逼 FasterTransformer、分片推理等系统优化。
- 2022–2023 年:量化与高效推理引擎。社区围绕 Llama、OPT 等验证了 INT8/INT4 量化可将成本压降 60%–80%;vLLM 等框架通过 PagedAttention 将吞吐提升 3–5 倍;MoE 模型(如 Mixtral 8×7B)展示在保持性能下,激活参数降低 4–5 倍,单位成本断崖式下降。
- 2024 年至今:专用芯片与端侧下沉。云厂商推出自研推理芯片(Google TPU v5p、Amazon Trainium/Inferentia2、微软 Maia),通过片上网络和低精度计算,将每 token 功耗降至通用 GPU 的 1/3–1/5。苹果、高通等端侧芯片运行 1–3B 压缩模型,实现零边际成本推理,每 token 成本仅对应电池消耗的微小分值,已有部分消费级设备支持离线大语言模型交互。
主流技术路线对比
| 技术路线 | 每 Token 计算量削减程度 | 硬件利用率影响 | 适用场景 | 每 Token 成本降低潜力 | 技术风险与局限 |
|---|---|---|---|---|---|
| 稠密超大模型 (70B–405B) | 基准 | 需高带宽集群 | 最高智能需求 | 基线 | 推理昂贵,不适合突发流量 |
| MoE 稀疏化 | 降低 2–10 倍(激活参数量) | 引入专家路由通信开销 | 云推理、多租户 | 显著(可降至稠密模型的 1/5 以下) | 负载不均、专家过拟合、通信延迟 |
| INT8/FP8 量化 | 计算量减半,带宽压力下降 | 吞吐提升 2–3 倍 | 几乎所有场景 | 中等(30%–60% 降幅) | 需校准,极个别任务有精度损失 |
| INT4 量化 | 带宽压力降至 1/4,计算密集度下降 | 进一步提升吞吐 | 边缘、低成本 API | 高(60%–80% 降幅) | 精度下降明显,需模型特化训练支撑 |
| 专用推理芯片 | 架构级优化(如脉动阵列、存内计算) | 专用设计使利用率达 60%+ | 超大规模生产环境 | 极高(5–10 倍) | 软件栈成熟度不足,迁移成本高 |
| 投机解码/预测加速 | 降低大模型调用次数 2–3 倍 | 无明显额外开销 | 延迟敏感在线服务 | 中等(2–3 倍有效加速) | 需训练或维护对齐小模型,增加系统复杂度 |
注:降幅倍数为公开技术报告和第三方评测的综合定性区间,不指向单一产品精准值。
6. 上游
上游由算力硅基与能源基础设施组成,其产能、价格和技术迭代框定了每 Token 成本的硬下限。
- AI 芯片:NVIDIA 主导数据中心推理,Hopper 架构(H100/H200)凭借高 HBM 带宽和 Tensor Core 占领约 80%+ 市场份额(据 Mercury Research 及多家券商估算,2024 年)。AMD MI300X 以更高显存容量和性价比争夺份额。定制 ASIC 崛起:Google 的 TPU v5p、Amazon 的 Trainium2、微软的 Maia 100 均采用台积电先进制程与 CoWoS 封装,削减成本。博通、Marvell 作为 ASIC 设计服务商,承接超大规模客户自研芯片需求。
- 存储与封装:HBM(高带宽内存)由 SK 海力士、三星、美光供应,其位宽和容量直接决定 KV 缓存扩展的上限。台积电 CoWoS 封装产能长期紧缺,2024 年该公司法说会透露年产能约 30 万片,并计划 2025 年扩至 50 万片以上,直接影响 AI 芯片交付周期和成本(来源:台积电 2024Q2 法说会公开陈述)。此外,传输中介层的良率和基板供应是短期瓶颈。
- 电力与散热:单张 H100 热设计功耗达 700W,推理集群的总功耗动辄兆瓦级。数据中心 PUE(电能利用效率)、当地电价和冷却方案(气冷→液冷→浸没式)成为成本模型的隐性核心。根据 Uptime Institute 2024 年报告,超大规模数据中心的 PUE 已普遍低于 1.2,但电力成本地域差异巨大,驱动企业将推理负载向电力廉价地区(如北欧、中东)迁移。
7. 下游
下游应用方对每 Token 成本的敏感度与消耗量成正比,许多商业模式仅在成本低于某个阈值时才成立。
- 独立软件开发商(ISV)与 SaaS:如 Jasper、Copy.ai 等早期基于 GPT‑3 的文案工具,在 API 降价后毛利改善显著。代码助手(GitHub Copilot、Cursor)因交互频繁且上下文较长,token 消耗大,是降本主要受益者。
- 企业内部服务:客服对话、合同审查、知识库问答(RAG)等场景,日均 token 可达千万级。许多大型制造、金融企业正从调用高价商业 API,转向微调并自托管 7B–13B 开源模型,以将每百万 token 成本压至 0.05 美元以下。以沃尔玛、丰田等公开披露的试点项目为例,自托管后推理单价可降 70% 以上(来源:公司技术博客及行业会议分享,2024 年)。
- 终端消费与端侧:苹果 Intelligence、三星 Galaxy AI 部分任务在设备端运行小型模型,边际成本近乎为零,但受限于模型能力。云边协同成为趋势,简单意图端侧完成,复杂查询回传云端,优化整体 token 消耗组合。
8. 受益公司
以下公司因每 Token 成本下行的产业链逻辑而在营收、市场份额或战略布局上获益,不构成任何投资建议。
- 模型厂商:OpenAI、Anthropic 通过压低模型推理成本(如 GPT‑4o mini、Claude 系列降价)扩大 API 调用量,以量补价,并利用高性能模型收取溢价。Google 依托 TPU 内供将 Gemini 成本压至竞品之下,换取云市场份额。Meta 通过开源 Llama 系列,虽不直接销售 token,却借社区优化摊薄自身研发成本,同时削弱竞品的 API 定价权。
- AI 芯片商:NVIDIA 在推理优化(TensorRT‑LLM)和下一代架构(Blackwell)持续提升每瓦 token 产出,稳定高附加值芯片需求。AMD MI300 系列以竞争性定价吸引微软、Oracle 等云客户,扩大推理市场存在。博通、Marvell 等定制 ASIC 服务商从超大规模客户的专用芯片浪潮中受益。
- 云服务商:AWS(Inferentia/Trainium)、微软 Azure(Maia)、Google Cloud(TPU)通过自研或定制芯片提供低价推理实例,吸引高消耗负载,带动周边存储、数据、安全等服务捆绑收入。
- 推理优化工具与开源平台:vLLM、Together AI、Fireworks 等以极致的模型服务优化,使用户能用更少 GPU 支撑同等吞吐,从而获得定价优势和开发者黏性。Neural Magic 等公司推出专用稀疏推理引擎,进一步压缩通用 CPU 推理成本,为边缘部署提供新选择。
9. 市场规模
全球生成式 AI 推理产生的 token 消耗总量尚无统一权威统计,但可从交叉指标侧面度量。
- API 收入指向:根据公开财报及相关分析,微软 Azure AI 服务季度收入(截至 CY2024Q4)中相当比重源自 API 推理,其 run rate 已突破 60 亿美元/年(微软 FY25Q2 财报音频评论)。OpenAI 年度经常性收入在 2024 年末达到约 40 亿美元(The Information 等媒体报道)。综合估算,全球商业 API 推理市场在 2024 年规模约 100–150 亿美元,且年增速超过 100%。
- 推理硬件市场:据 Mercury Research 及券商报告,2024 年数据中心 AI 推理加速器(GPU+ASIC)出货额约 400 亿美元,其中推理负载占比持续提升。SemiAnalysis 预测到 2027 年,推理将成为 AI 计算需求的最大细分,占总算力的 60% 以上(来源:SemiAnalysis 2024 年度报告)。
- Token 消耗量:公开资料未见精确总量,但可以从头部应用的流量推算。Character.AI 在 2024 年已实现日均数十亿 token 的处理量;GitHub Copilot 日生成 token 量亦在 10 亿级。业界估算 2024 年全球生成式 AI 日均 token 消耗已跨越 10 万亿 token 大关,且每 6 个月翻一番(综合多家 VC 投资人公开演讲数据,2024 年)。
长期看,单位成本每下降 10 倍,催生约 100 倍的需求增长(杰文斯悖论式效应),因此每 Token 成本下降本身会放大 token 经济总规模,形成正向飞轮。
10. 玩家对比
不同模型供应商在成本结构、定价策略和技术优化深度上差异显著,直接影响其生态位。
| 厂商/模型 | 典型模型 | 输入价格 ($/M tokens) | 输出价格 ($/M tokens) | 成本优势来源 | 备注 |
|---|---|---|---|---|---|
| OpenAI | GPT‑4o | 5.00 | 15.00 | 自研推理栈、MoE 架构(推测)、批量折扣 | 价格包含高利润,2025 年初发布 mini 版降至 0.15/0.60 |
| Anthropic | Claude 3.5 Sonnet | 3.00 | 15.00 | 自研推理优化,侧重安全对齐,MoE 疑似 | 价格略低于 GPT‑4o 输入,输出持平 |
| Gemini 1.5 Pro | 3.50 | 10.50 | TPU v5p 内供,MoE 架构,内部资源调度 | 利用 YouTube 等自有数据提升模型效率 | |
| Mistral AI | Mistral Large | 4.00 | 16.00 | MoE,欧洲优化,追求少样本推理效率 | 开源部分模型,兼顾第三方托管 |
| DeepSeek | DeepSeek‑V2 | 0.27 | 1.10 | 极深 MoE 与多头潜在注意力(MLA),极低激活参数 | 2024 年 5 月发布后引发价格战,展示极低成本路线 |
| Meta (Llama) | Llama 3 70B (社区托管) | 约 0.10–0.30 | 约 0.20–0.60 | 开源优化(vLLM、TensorRT),零许可费 | 部署成本由第三方承担,灵活性极高 |
定价数据取自各厂商官网 2025 年 4 月快照,部分模型价格含 Fine‑tuned 收费,实际以官网为准。
运营层面的成本对比更凸显差距:据 SemiAnalysis 2024 年对特定开源模型推理 TCO 的拆解,使用 H100 集群运行 Llama 3 70B 量化版本,在较高利用率下,供应商真实推理 TCO 可低至 0.05 美元/百万 token 以下;而商业 API 价格通常为该值的 10–60 倍,差价用于覆盖研发、风险准备金和获客成本。拥有自研芯片或极低电力成本(如谷歌、微软部分区域)的厂商,其 TCO 优势将进一步拉大。
11. 风险
- 价格战与利润侵蚀:开源模型与激进定价(如 DeepSeek)迫使商业 API 持续降价,可能导致行业毛利空间收窄,部分中小模型厂商出清。
- 技术瓶颈与量化损失:过度压缩可能在某些严谨场景(法律、医学)引发语义丢失,限制降本边界;MoE 的负载均衡和通信开销若不能妥善解决,单位成本改善可能不及预期。
- 能源与供应链约束:全球数据中心电力需求激增,部分地区电网瓶颈和 HBM 产能不足或阶段性推高硬件成本,使成本下降曲线暂时放缓。
- 监管与合规成本:AI 内容标识、数据隐私法(如 EU AI Act)可能增加额外的审查和处理环节,提升每 token 的合规开销。
- 过度依赖少数供应商:NVIDIA 的统治地位和台积电先进封装产能集中,使成本受制于单一环节的供应波动或定价权。
- 用户黏性陷阱:应用在极低成本下可能产生大量低价值调用,导致收入无法覆盖基础设施扩展,出现“量增利不增”的困局。
12. 误读纠偏
-
误读 1:“API 报价等于每 token 成本”
纠正:API 报价包含毛利、研发摊销、获客成本和竞争溢价;供应商内部 TCO 往往远低于此。企业自行部署开源模型时,成本仅含硬件折旧、电力和运维,与托管价可差数十倍。分析师需拆解“开价”与“TCO”,并区分边际与全分摊成本。 -
误读 2:“模型越大,每 token 成本就越高”
纠正:MoE 架构下,虽然总参数可达数千亿,但每个 token 仅激活一小部分参数,实际计算量可能低于同性能稠密模型的 1/5。同时,大模型对量化和压缩的容忍度更高,可通过极低位宽部署进一步降低成本。评价成本必须关注激活计算量和内存带宽需求,而非总参数量。 -
误读 3:“量化一定会严重损伤智能”
纠正:GPTQ、AWQ 等训练后量化配合校准数据集,可使 INT4 模型在 90% 以上的自然语言任务上精度损失小于 1%。MoE 和大规模模型对此尤为鲁棒,量化已成为行业降本的标准操作。但未经校准的粗暴量化确实存在风险,需验证。 -
误读 4:“降本只靠硬件进步”
纠正:算法创新(FlashAttention、vLLM 的 PagedAttention、投机解码)带来的效率提升经常超过单代硬件迭代。同等硬件上,最新的推理框架比 2022 年的 naive 部署可提升 5–10 倍吞吐,算法是成本下降的“隐形杠杆”。 -
误读 5:“每 token 价格越低越好,用户永远受益”
纠正:极端低价可能导致服务质量滑坡(如降低精度、缩短上下文、增加延迟),或引发供应商降低安全与内容审核投入,形成隐性成本。健康市场应在合理成本下维持可持续生态。
13. 最新事件
- 2024 年 5 月 DeepSeek‑V2 开源发布:该模型采用 MLA(多头潜在注意力)与极致 MoE,宣称推理成本仅为每百万 token 0.001 美元(输入),引发中国及全球 API 价格战。此后字节跳动、阿里云、百度等中国厂商纷纷大幅下调模型 API 价格,部分降至免费或接近免费。
- OpenAI 推出 GPT‑4o mini(2024 年 7 月):将高性能模型的价格压至每百万 token 0.15 美元(输入)和 0.60 美元(输出),同时推出批处理 API 给予 50% 折扣,显著降低开发者成本,并支持多模态。
- Google Gemini 1.5 Flash 发布(2024 年 5 月):专为低成本推理设计,每百万 token 输入价格仅 0.075 美元,输出 0.30 美元,通过蒸馏和轻量架构提供接近更大模型的性能,服务于大规模低延迟任务。
- Meta Llama 3 开源(2024 年 4–7 月):从 8B 到 405B 的多尺寸模型开源,加上社区量化及优化,使企业自托管推理成本降至每百万 token 0.02–0.10 美元区间,成为闭源 API 的强大替代。
- AMD MI300X 推理性能凸显:2024 年 Q3 多家云商及独立评测显示 MI300X 在运行 Llama 等模型时,得益于更高显存带宽,每 token 成本较 H100 在某些 batch size 下可低 20%–30%,打破 NVIDIA 独大局面。
- 苹果全设备端模型:2024 年 WWDC 宣布 Apple Intelligence,使用约 3B 参数的设备端基础模型,完全本地推理,将消费级 AI 成本推向零边际,引发对云推理需求结构的长远重估。
- NVIDIA 发布 Blackwell GPU(2024 年 GTC):针对推理专门强化第二代 Transformer 引擎,支持 FP4 精度,宣称可将大模型推理吞吐提升至 Hopper 的 2–4 倍,进一步压低每 token 硬件成本,预计 2025 年规模出货。
14. 跟踪指标
持续跟踪每 Token 成本演变,建议监测以下高频数据与领先指标:
- 主要 API 定价变化:OpenAI、Anthropic、Google、Microsoft、Mistral、DeepSeek 等官网定价页的每月或每季快照,特别关注廉价版(Flash、Mini)与旗舰版价差。
- MLPerf Inference 基准结果:每轮成绩发布中单卡 token 生成吞吐(tokens/s)、延迟和能耗,反映硬件与推理框架的实际进步。
- AI 芯片均价(ASP)与 HBM 合约价:通过金融分析师报告,监测 H100/H200/Blackwell 等卡的市场租金(如 $/GPU·小时)和 HBM 供应价,这些决定硬件成本基线。
- 云厂商 AI 收入与毛利率:微软 Azure AI、谷歌云 AI、AWS 的机器学习和推理收入的季度增长,以及管理层对推理成本下降幅度的评论(如“我们降低推理成本 x%,实现用量的 x 倍增长”)。
- 数据中心电力 PPA 价格与液冷渗透率:电力成本在北美、欧洲等地的远期协议价格,以及液冷服务器出货占比,可预测运营费用走向。
- 开源推理框架吞吐量里程碑:vLLM、TensorRT‑LLM、DeepSpeed-MII 等社区发布的最新优化性能数据,如“单 H100 运行 Llama 3 8B 达 xxx tokens/s”,直接体现算法降本速率。
- 上市公司相关资本开支指引:Meta、微软、Google、Amazon 的 AI 基础设施 capex 计划以及自研芯片的部署比例,预示中长期供给能力。
15. 信源
- 厂商官方信息:OpenAI API 定价与博客,Anthropic 官方定价页与模型报告,Google Cloud Vertex AI 定价,Microsoft Azure OpenAI 服务定价,Meta AI 公开博客与模型卡,Mistral AI 官方网站,DeepSeek 公开技术报告。
- 第三方产业分析:SemiAnalysis 推理 TCO 拆解报告及周报,ARK Invest 年度 Big Ideas 中 AI 成本曲线专题,a16z 基础设施报告相关章节,McKinsey QuantumBlack 关于生成式 AI 成本的经济性分析。
- 技术论文与框架文档:FlashAttention 系列论文,vLLM PagedAttention 论文,GQA/MQA 注意力优化论文,GPTQ/AWQ 量化论文,NVIDIA TensorRT‑LLM 白皮书,MLPerf Inference 基准规则。
- 财务与市场数据:超大规模云商(微软、谷歌、亚马逊)季度财报与电话会转录,台积电季度法说会,SK 海力士、三星内存业务新闻稿,Mercury Research GPU 市场份额报告。
- 行业会议公开资料:GTC、Hot Chips、NeurIPS 效率专题、AI Hardware Summit 中关于推理成本突破的演讲与演示公开幻灯片。
一句话总结
每 Token 成本是 AI 智力供给的原子价格,其下降斜率决定了生成式 AI 是持续烧钱的实验品还是普惠全社会的基础设施,而算法、芯片与能源三轴联动正在将这一价格推向极限。