每百万 token 价格
3 秒看懂
每百万 token 价格是大模型 API 调用成本的标准化计量单位。它就像大模型世界的“电价”——你按消耗的“每 100 万个分词单元”付费。几乎所有模型服务商都会将输入(你发给模型的提示词、文档、历史记录)与输出(模型逐字生成的内容)分开计价,输出价格通常为输入的 3–10 倍,因为“写出一个字”所需算力远超“读懂一个字”。这一指标直接定义了 AI 应用的经济可行性,是观察模型推理降本趋势的最核心窗口(来源:Artificial Analysis 方法论,2025 年 1 月更新)。
3 分钟产业解释
调用商业闭源或托管开源大模型时,账单不是按“次”或“对话轮数”算,而是按 token 的消耗量。Token 是模型处理文本时的最小语义单元:在英文中,一个 token 大约对应 0.75 个单词(即 100 个 token ≈ 75 个单词);在中英文混合场景下,由于中文分词算法的差异,一个汉字通常消耗 1.5–2.5 个 token。因此,100 万个 token 大约相当于:75 万英文单词,或约 50 万–70 万汉字(来源:OpenAI Tokenizer 文档与 Google AI 官方说明,2024 年版)。
定价模型的三个核心维度
- 输入价格:处理提示词、上传的 PDF、对话历史、检索增强生成(RAG)的上下文片段。此阶段主要消耗 GPU 的显存带宽和注意力矩阵的计算资源,且可以高度并行批处理,成本相对低。
- 输出价格:模型逐 token 顺序生成回复。每生成一个新 token,都必须完成一次完整的模型前向计算,并受自回归解码机制的串行限制,无法有效并行。这是输出单价常为输入 3–5 倍(部分模型差距达 10 倍以上)的技术根源。
- 批处理与折扣:延迟容忍度决定成本天花板。实时同步调用的价格最高(延迟要求 < 200 ms);异步批处理(Batch API)通常可获 50% 折扣;预留吞吐量合约(Provisioned Throughput)能进一步压低单价 20%–30%;长周期(如年度承诺消费)还能叠加折扣(来源:OpenAI、Azure、Anthropic 定价页细则,截至 2025 年 Q1)。
产业界的核心变化在于,从 2023 年初到 2025 年一季度,同等智能水平的百万 token 单价已下降超过 85%–95%。这背后是推理框架优化、模型蒸馏、MoE 架构稀疏激活、以及供应端 20 余家服务商的激烈价格战共同作用的结果(来源:SemiAnalysis《The Inference Cost Collapse》,2024 年 12 月)。
技术原理
Token 的生成与计量
语言模型无法直接处理原始字符串,必须通过分词器将文本转化为词表中对应的 ID 序列。主流分词算法包括字节对编码和 SentencePiece。分词粒度直接决定账单金额。
原始文本:"每百万 token 价格的全景分析"
假设分词器输出:
["每", "百万", " token", "价格", "的", "全", "景", "分析"]
共计 8 个 token(实际分词因模型而异,此处仅作示意)
API 返回的 response 对象中,usage.prompt_tokens 和 usage.completion_tokens 字段会精确给出本次调用消耗的输入与输出 token 数,开发者可据此核算成本。需要特别注意的是,部分模型的思考 token(如 o1 系列的内部推理链)虽不直接展示给用户,但仍计入输出 token 并收费,其消耗量往往是可见输出 token 的 3–10 倍(来源:OpenAI o1 系统卡与官方文档,2024 年 9 月)。
为什么输入和输出存在巨大价差
大模型推理分为两个技术阶段,算力效率截然不同。
- 预填充阶段:一次性将整个输入序列(可能含数千或数十万 token)送入模型。此阶段可充分利用 GPU 的并行计算能力,将数十甚至上百个请求合并成一个大批次处理,前向计算的矩阵乘法效率极高。
- 自回归解码阶段:逐 token 串行生成。每生成一个新 token,都必须重新加载所有历史 token 的键-值缓存(KV 缓存),并完成一次完整的前向传播。该阶段的算力瓶颈不在浮点运算,而在高带宽内存(HBM)的读写带宽——KV 缓存的存取速度决定了生成速率上限。现代高端 GPU(如 H100 SXM)的显存带宽约为 3.35 TB/s,但面对长上下文的大容量 KV 缓存时,内存墙问题依然突出,这部分硬件成本最终被映射到更高的输出价格上(来源:《Efficient Memory Management for Large Language Model Serving with PagedAttention》,SOSP 2023;NVIDIA H100 白皮书,2023)。
推理成本的数学分解
一颗 GPU 提供一次推理服务的成本可简化为:
请求成本 = (模型前向计算量 + KV 缓存读写量) × GPU 租用单价($/小时)
- 稠密模型每 token 的前向浮点运算次数约为 `2 × 参数量`。一个 700 亿参数的稠密模型,每个 token 需要约 1400 亿次浮点运算。
- MoE 模型每 token 的前向运算量约为 `2 × (共享参数 + 激活专家参数)`。若一个 8×7B 的 MoE 模型每次只激活 2 个专家,其实际激活参数量为“共享层 + 2×7B”,远小于等效稠密模型的 47B 全量激活,这就是 MoE 架构能大幅降低每 token 计算成本的核心技术逻辑(来源:DeepSeek-V2/V3 技术报告,2024;Mistral 8×7B 论文,2023 年 12 月)。
## 关键参数
衡量“每百万 token 价格”的经济性,不能孤立看单价,必须结合以下 5 个参数综合判断。
### 1. 单位智能成本
以公认基准测试(如 MMLU-Pro、HumanEval+、GPQA Diamond)的得分作为模型能力代理变量,计算**每获得 1 个能力分数所需支付的 API 费用**。例如,模型 A 的语料理解能力得分 80 分,输出价格 $2/百万 token;模型 B 得分 60 分,价格 $1/百万 token。表面上模型 B 便宜一半,但若前者能一次完成任务而后者需 2–3 次纠错,模型 A 的有效成本反而更低(来源:Artificial Analysis 的“Quality-Adjusted Price”指标,2025 年 1 月)。
### 2. 吞吐量
吞吐量以每秒生成 token 数衡量,直接决定用户体验和应用的可扩展性。高吞吐但价格稍高的模型,可能因用户流失率低、任务完成速度快而带来更高的净收益。2024 年 Q4 数据显示:闭源高端模型(如 GPT-4o)在实时场景下的中位吞吐量约为 80–120 TPS;经极致优化的推理服务商(如 Groq)在 Llama 3.1 70B 上可达 300–500 TPS,且价格仅为闭源模型的 1/5–1/10(来源:Artificial Analysis 实时基准测试平台,2025 年 2 月)。
### 3. 首 token 延迟
从发送请求到屏幕上出现第一个生成字符的时间间隔。面向终端用户的对话产品和语音助手要求 TTFT 低于 300 ms;后台批处理任务则可容忍数秒或数分钟的延迟。通常,TTFT 越短,服务溢价越高。
### 4. 上下文长度天花板与阶梯价
多数模型设置了上下文长度上限(如 4K、128K、1M token),超出某个阈值后会触发更高单价或自动滑动窗口遗忘机制。长上下文的注意力计算复杂度为 O(n²),因此超长上下文的服务成本极高。例如,2025 年 Q1 部分模型对 128K 以上窗口的输入单价上浮 50%–100%(来源:Google Gemini 1.5 与 OpenAI GPT-4-128K 定价页,2025 年 2 月适用)。
### 5. 批处理饱和度
API 的批次大小(同时处理的请求数)越大,单位成本越低,但延迟相应增加。许多推理服务商为能够调度高批处理利用率的客户提供长尾折扣,是衡量大客户实际采购价格的核心变量。
## 技术路线
目前大模型推理服务的定价形态,可由三条主要技术路线的竞争来诠释。
### 路线一:闭源巨头的全栈自营生态
代表厂商:OpenAI(Azure)、Google Cloud(Vertex AI)、Anthropic(AWS Bedrock)。
- **定价特征**:多层梯度定价,按模型代际(如 GPT-4o、GPT-4o-mini)、上下文长度(4K / 128K)、调用模式(实时 / 批处理 / 缓存命中)给出复杂的价格矩阵。缓存命中(将重复提示词的 KV 缓存复用)可给予输入价格 50%–90% 的折扣,这是其生态粘性的关键一招。
- **成本结构**:大规模 GPU 采购(数十万卡级别)摊薄硬件资本开支,但维持 60%–80% 的推理毛利率以回收模型训练成本与研发费用(来源:The Information 对 OpenAI 财务数据的报道,2024 年 10 月;Google Cloud Q4 2024 财报分析师会议)。
### 路线二:独立推理服务商的极致优化
代表厂商:Together AI、Fireworks AI、Groq、DeepInfra。
- **定价特征**:定价极简,往往只区分输入/输出,部分厂商甚至统一价格。以开源或开放权重模型(Llama、Mistral、DeepSeek)为主打,百万 token 价格压至极低(输出 $0.2–$2)。
- **成本结构**:不负担模型训练成本,毛利率极薄(估算 20%–30%),依赖私募资本输血。护城河在于工程能力——如 Groq 自研的 LPU 芯片去除了传统 GPU 的通用计算模块,专精线性算子加速,在特定架构上实现数量级的时延优势(来源:Groq 官方技术博客,2024 年;Together AI 融资公告,2024 年 3 月)。
### 路线三:开源自部署
代表方案:企业基于 vLLM、SGLang、TensorRT-LLM 等开源框架,在自有或租用裸金属 GPU 上部署模型。
- **定价特征**:不存在“API 单价”概念,只有硬件租赁/折旧和运维成本。有效推理成本通常为同等能力 API 价格的 20%–40%(取决于 GPU 利用率)。
- **成本结构**:牺牲弹性和免运维体验,换取数据私有化和长期总成本控制。需要自行承担 GPU 闲置损失和工程人力成本。公开资料未见全行业自部署平均成本的确切统算,以上为产业调研估计。
## 上游
每百万 token 价格的地板由三重上游硬成本决定。
### 1. 算力芯片
英伟达 H100/H200/B200、AMD MI300X 等数据中心 GPU 的购置价格或云上租赁价格,是推理成本的绝对硬底。以 2025 年 Q1 北美市场行情为例:一张 80GB H100 SXM 裸金属服务器的市场月租金约为 $2.5–$3.8 万(按 3 年合同折算)(来源:云市场经纪商公开报价,如 Vultr、Lambda Labs 挂牌价,2025 年 2 月)。单位 token 成本与 GPU 的显存带宽(HBM 代际)和浮点算力密度呈非线性关系。B200(搭载 HBM3e,192GB)的单卡吞吐量约为 H100 的 2–3 倍,预计量产后可推动百万 token 物理成本再降 40%–60%(来源:英伟达 B200 技术规格书,2024 年 GTC)。
### 2. 电力与数据中心
GPU 集群的电力成本占总拥有成本的 15%–25%。一块 H100 的热设计功耗为 700W(SXM 版),全年满负荷运行的电费约 $600–$900(按工业电价 $0.1/kWh 估算)。冷却系统是隐形成本大头:传统风冷 PUE(电能使用效率)约 1.3–1.5,液冷可将 PUE 压至 1.05–1.1,显著降低长周期电费。大规模推理服务商的电力合约价格通常是市价的 50%–70%(来源:Digital Realty、Equinix 等数据中心运营商 Q4 2024 投资者报告)。
### 3. 模型训练方的摊销
基础模型训练是一笔前置沉没成本。模型所有者(如 OpenAI、Meta、DeepSeek)会通过推理 API 收入或在开源许可证上附加商业限制,回收部分训练投入。当开源模型(如 Llama 3.1 405B)直接开放权重后,推理服务商不再需向模型方支付许可费,训练摊销为零,从而能将 API 价格压至接近硬件成本(来源:Meta 官方博客,2024 年 7 月)。
## 下游
### AI 应用开发者
这是直接对百万 token 价格最敏感的人群。token 定价决定了创业公司能否构建可持续的商业模式。以一个消费级 AI 心理陪伴应用为例:若每次对话平均消耗 500 输入 token + 200 输出 token,使用某主流模型(输出 $15/百万 token),单次对话成本约 $0.0035;若日活用户每人平均对话 20 轮,拥有 10 万 DAU 的应用单日推理成本即达 $7,000,年化成本超过 $250 万。若应用采取广告或订阅变现,这一成本结构直接决定其毛利率和盈亏平衡点。因此,大量 C 端轻量应用已转向使用 Mini/Small 类低价模型,或将流量切至开源推理服务商(来源:公开资料未见全行业平均统计,案例数据来自多家 AI 应用创始人的公开访谈,2024 年)。
### 企业客户
大型企业采购大模型 API 时,百万 token 价格是内部成本分摊和部门预算核算的基础。企业通常会与云厂商或模型厂商签订年框承诺消费协议,实际单价可比官网标价低 30%–60%。金融、法律、医疗等合规要求高的行业,更倾向于为私有部署或专属实例支付溢价(来源:微软智能云与 AWS 大型客户案例研究,2024 年)。
### 最终用户
终端消费者不直接面对“每百万 token”概念,token 价格通过订阅费(如 ChatGPT Plus $20/月)、按次计费(如 AI 翻译按字数)或广告间接收取。但当 token 价格足够低时,以前因成本问题不可行的应用(如实时 AI 视频解说、全量会议纪要智能总结)会具备商业可行性,最终推动市场总量放大。
## 受益公司
### 1. 低成本模型厂商与推理务提供商
DeepSeek 是 2024–2025 年价格通缩风暴的中心之一。其 V2 模型在 2024 年 5 月发布时,将百万 token 输出价格定为仅 2 元人民币(当时约 $0.28),仅为 GPT-4o 的约 1/50,触发全行业跟进降价(来源:DeepSeek 官方定价公告,2024 年 5 月)。独立推理服务商(如 Groq、Together AI)则通过对开源模型进行极致工程优化,以硬件成本加微利的定价策略,快速吸纳价格敏感型客户。
### 2. 算力硬件与基础架构层
英伟达、AMD、以及 HBM(高带宽内存)制造商(SK 海力士、三星)是 token 降本趋势中最确定的基本面受益者。推理价格每下降一个数量级,就会催生数倍乃至十倍的 token 消耗总量,即“杰文斯悖论”在 AI 算力市场的重演。英伟达 H100/H200/B200 的订单能见度已延伸至 2025 年下半年(来源:英伟达 FY2025 Q4 财报及电话会议,2025 年 2 月)。云服务商(AWS、Azure、GCP)同时售卖模型 API 和底层 GPU 实例,无论价格战如何演进均能获利。
### 3. AI 应用层
SaaS 公司、AI Agent 平台、代码助手、内容生成工具等是长期受益方。推理成本的持续下探直接扩大其可服务市场并改善毛利率。GitHub Copilot 类代码助手,因其每次代码生成所需的 token 量大且用户调用频次高,是推理降本的最大弹性受益者之一。公开资料未见其具体单位推理成本的确切披露。
## 市场规模
公开资料未见“全球大模型 token 消费总量”的权威精确统计。但基于多家研究机构的估算,可勾勒出量级轮廓:
- **全球 AI 推理芯片市场**(含 GPU、TPU、LPU 等):据 SemiAnalysis 估算,2024 年推理芯片市场规模约为 800–1000 亿美元(含云租赁口径和自建),预计 2025 年将突破 1400 亿美元。这是 token 经济物理底座的切面数据(来源:SemiAnalysis《AI Data Center TAM Model》,2024 年 11 月)。
- **模型 API 收入**:公开分析估计,OpenAI 在 2024 年的年化 API 收入(含 ChatGPT 订阅)已超过 20 亿美元,Google、Anthropic 紧随其后(来源:The Information、Bloomberg 引用知情人士的报道,2024 年 9 月–12 月)。这部分收入可直接换算为万亿级别的 token 调用量。
- **企业支出中 token 成本的渗透率**:据 Menlo Ventures《2024 年企业 AI 支出报告》,2024 年美国企业用于生成式 AI 的支出中,模型调用成本(包括 API 和自托管推理)占从 2023 年的 30% 降至 2024 年的约 18%,反映出基础设施(数据管道、RAG 框架、监控)支出占比上升。这一结构性变化暗示,即便 token 价格大幅下降,企业总体的 AI 预算仍在向更广泛的生态链环节扩散。
## 玩家对比
下表基于 2025 年 Q1 的公开定价数据与基准评测,对市场主要推理服务的价格与能力进行定性对比。所有价格均为官网即时调用模式下的标价,不含批处理或预承诺折扣。
| 维度 | OpenAI (GPT-4o) | Anthropic (Claude 3.5 Sonnet) | Google (Gemini 1.5 Pro) | DeepSeek (V3) | 推理服务商 (Llama 3.1 70B 托管均价) |
|---|---|---|---|---|---|
| **输入单价 ($/M tokens)** | 2.50 | 3.00 | 1.25 (长上下文另计) | 0.27 | 0.35–0.60 |
| **输出单价 ($/M tokens)** | 10.00 | 15.00 | 5.00 (长上下文另计) | 1.10 | 1.00–2.00 |
| **输出/输入价格比** | 4.0x | 5.0x | 4.0x | 4.0x | 2.5x–3.5x |
| **MMLU-Pro 基准得分** | ~86 | ~85 | ~82 | ~85 | ~80(模型原生分) |
| **单位智能成本 (得分/输出$)** | 8.6 | 5.7 | 16.4 | 77.3 | 40–80 |
| **主要优势场景** | 最广泛的工具调用与生态 | 长上下文精度、代码 | 与谷歌云及 TPU 生态绑定 | 中文、极致性价比 | 极高吞吐、低时延 |
| **数据来源年份** | 2025 年 1 月定价页 | 2025 年 1 月定价页 | 2025 年 2 月定价页 | 2024 年 12 月 API 发布公告 | Artificial Analysis,2025 年 2 月快照 |
*注:DeepSeek V3 在 MMLU-Pro 的得分 85 来自其技术报告,后续独立复现结果在 82–85 之间。单位智能成本仅作简单除法示意,不构成模型推荐。*
## 风险
### 1. 价格战侵蚀行业长期创新利润
当每百万 token 的输出价格压至接近硬件电费成本时,模型训练方的巨额研发和训练投入将难以通过推理收入回收。这可能迫使资金实力不足的中小模型厂商退出基础模型竞赛,导致行业创新集中在少数几个资金充沛的巨头手中,降低长期生态多样性(来源:公开资料未见确定性结论,此为多家券商 AI 行业分析报告中的共同风险提示,2024 年 Q4)。
### 2. 硬件供应瓶颈与功耗天花板
推理 token 总量的指数增长,正遭遇数据中心电力供应和高端芯片封装(CoWoS)产能的双重物理约束。美国、欧洲一线数据中心的电力接入审批周期长达 18–36 个月,可能导致 2026–2027 年的推理算力增长不及价格下降预期,进而延缓 token 成本进一步下探的速度(来源:McKinsey《Global Data Center Power Outlook》,2024 年 7 月)。
### 3. 长期合同锁定与供应商依赖
企业客户若为追求当前低价,将核心业务深度集成到某单一推理服务商的 API 格式、调度逻辑和提示词模板中,可能在未来面临切换成本和供应商议价权上升的风险。历史数据表明,IaaS 云市场的多厂商比价与锁定的博弈经验将持续在模型 API 市场重演。
## 误读纠偏
**误读 1:“每百万 token 价格越低,模型的总使用成本就越低。”**
纠偏:必须结合模型的一次性任务成功率来看。假设一个编程任务,模型 A 的价格仅为模型 B 的 1/10,但代码首次通过率也仅为 B 的 1/3。那么为了生成可运行的代码,A 需要重试与调试三轮,消耗的 token 总量和开发者时间成本加起来很可能超过 B 的一次调用。行业最佳实践正从“只看单价”转向“完成质量调整标准任务的总成本”评估法。
**误读 2:“输入 token 便宜,所以可以无限堆文档和上下文。”**
纠偏:长上下文不仅线性增加输入成本(以百万 token 为单位倍增),更关键的是存在“注意力稀释”效应。实验表明,当输入上下文超过 20K–32K token 后,多数模型对长文本中段信息的回忆精确度会显著下降(即“迷失在中间”现象),可能导致需要额外的提示工程技术或多次检索,抵销了输入价格低的表面优势(来源:《Lost in the Middle: How Language Models Use Long Contexts》,ACL 2024)。
**误读 3:“开源模型比闭源模型便宜得多,所以最终会完全替代闭源。”**
纠偏:开源模型的 API 定价确实更低,但需将其与闭源模型部署在同等运维条件下比较。一个 700 亿参数的开源模型,在企业自托管时需要占用约 140GB 显存(2 张 H100),其有效推理成本高度依赖于 GPU 利用率。在利用率低于 30% 的低频场景下,自部署的单位 token 成本可能高于直接调用闭源 API。开源与闭源的最终均衡点,取决于企业调用频次与数据敏感性的权衡。
## 最新事件
### 1. DeepSeek V3 的“极致低价”冲击波(2024 年 12 月–2025 年 1 月)
DeepSeek 于 2024 年 12 月底发布 V3 模型,其 API 价格定为:输入每百万 token 0.27 美元,输出每百万 token 1.10 美元。这一输出价格仅为当时 GPT-4o 的约 1/10,且模型能力在多项中文和数学基准测试中与头部闭源模型看齐。消息发布后,中国国内多家云厂商在一周内宣布对旗下主力模型大幅降价或免费开放额度(来源:DeepSeek 官方微信公众号与 API 文档,2024 年 12 月 26 日;阿里云、腾讯云官方公告,2025 年 1 月上旬)。此次事件被视为“AI 模型价格通缩”的标志性加速节点。
### 2. OpenAI 引入预测输出与提示缓存折扣(2024 年 11 月)
OpenAI 为 GPT-4o 系列新增“预测输出”功能,当模型生成的输出文本中包含大部分预先传入的已知内容时,输出 token 按输入价格计费,降幅高达 80%。同时,针对超过 1024 token 的重复提示词自动启用磁盘缓存,缓存命中的输入 token 享受 50% 折扣。这两个机制为 Agent、文档结构化改写等常见场景带来了不成比例的降本效果(来源:OpenAI 官方博客,2024 年 11 月 15 日)。
### 3. 谷歌 Gemini 针对超长上下文的分层计价落地(2025 年 1 月)
Gemini 1.5 Pro 正式实施详细的上下文长度梯度定价。当输入超过 128K token 后,输入和输出单价均上浮 50%;超过 512K 后上浮 100%。这为市场中其他服务商的长上下文定价提供了基准模板,标志着“长上下文免费午餐”时代走向终结(来源:Google AI Studio 定价页,2025 年 1 月更新)。
## 跟踪指标
1. **主流模型输出价格指数**:追踪 GPT-4o、Claude 3.5 Sonnet、DeepSeek V