用量计费
3 秒看懂
用量计费是一种按实际消耗付费的结算模式,AI 计算场景中常以 Token数、GPU·时、调用次数 为单位,把“买机器/包月”变成“用多少付多少”。
3 分钟产业解释
用量计费将 AI 服务从一次性资本开支转化为持续运营开支:开发者不必预购 GPU 服务器或签署巨额最低消费合约,而是像缴纳电费一样为每次推理、每次训练实际消耗的计算资源付费。
- 对用户:试错门槛大幅降低,初创团队花几美元就能调用最先进大模型搭建原型,不再需要先筹几十万资金买卡。
- 对厂商:闲置算力通过按需售卖得以货币化,通过超售与智能调度提升集群利用率;收入随着客户使用量增长而自然扩张,也倒逼模型推理效率持续优化。
- 对产业链:成本与工作负载直接挂钩,激励模型厂商压低单次推理成本,由此催生监控、计量、成本分析、跨云比价等新型工具层。
技术原理
用量计费在 AI 场景远比传统云主机复杂:计量对象从整机运行时间下沉到推理引擎内部的 Token 级消耗,要求实时、精准且低开销地采集。
Token 级计量的实现
用户输入文本 → 分词器(Tokenizer)切分为 Token → 模型逐 Token 生成 → 拼接返回。计量系统在服务端准确捕获:
- Input Tokens:请求中的
messages、prompt等字段经分词器处理后的 Token 数。 - Output Tokens:模型实际生成的 Token 数,包含停止符;流式输出时需对每个 delta 块累加计数。
不同模型的分词器差异显著,同一段中文在 GPT、Claude 和 Llama 下的 Token 数可能相差 30% 以上,因此计费 Token 数必须使用与模型绑定的编码器在服务端重算,不可依赖客户端自报。
数据路径简图:
用户请求 → API网关 → [鉴权/限流] → 推理引擎
↓(异步) ↓
计量采集器 ← (流式输出Token计数、首Token延迟、总耗时)
↓
聚合/入库 → 账单系统
GPU·时计量的精度
对于训练作业或自托管推理,云厂商通过 GPU 虚拟化(NVIDIA MIG、Time-slicing)或任务级调度实现细粒度计量:
- 容器级计量:Kubernetes 集群通过 Device Plugin 上报 GPU 使用时长,精度可达秒级甚至毫秒级。
- 作业级计量:AI 平台记录每个训练任务的实际 GPU 占用时间(RUNNING 状态),自动剔除排队与预处理耗时。 关键参数:计量最小颗粒度普遍为 1 秒(部分平台为 1 分钟),计量锚点一般位于 NVIDIA 驱动或 CUDA API 钩子。
准实时计费与额度控制
为避免“账单暴雷”,系统和用户都需要实时可见的累计消耗与硬性限额(Hard Limit)。典型架构:请求事件 → Kafka → 流处理(Flink)→ 时序库(ClickHouse/InfluxDB)→ Redis 缓存当前计费周期累计用量。每次请求前查 Redis 用量预估,若超限则返回 429 或降级到低优队列。
技术难点:流式输出场景下最终输出的 Token 数在开始时未知,额度控制只能依赖保守预估(如限制输入 Token)或后验扣减,允许少量、可控的透支。同时,在数千节点规模下,计量事件必须做到 exactly-once 或至少低容忍度的重复计数,否则会出现严重财务纠纷。
此外,为适应极低延迟要求,部分实现将 Token 计数直接集成在推理引擎的 CUDA kernel 边界,通过共享内存向计量代理汇总数据,避免额外串行损耗。
关键参数
- 计量颗粒度与单位:Token 级计费通常以 1K 或 1M Token 为最小卖出单元;GPU·时计费最小单位一般为 1 秒。
- 输入/输出分离定价:输出 Token 价格通常是输入的 3–5 倍,因为自回归生成包含更密集的浮点运算和显存访问(截至 2024 年 Q3 主流模型定价,来源:各厂商定价页)。
- 预付费/后付费与计费周期:大多采用后付费月结,部分对中小客户要求预充值或绑定信用卡,按小时、日累计生成初步账单。
- 信用额度与硬限额:用户可设置月度预算上限(Hard Cap),到达后服务自动暂停,避免超额损失。
- 超额容忍度:流式输出超支通常控制在本次请求 Tokens 预估的 120% 以内,具体取决于厂商策略。
- 折扣机制:批量处理 API(Batch)可延迟响应以换取 50% 成本减免;长文本缓存(如 Google Context Caching、Anthropic Prompt Caching)可大幅降低重复输入费用。
- 计量精度目标:行业标准要求服务端计费 Token 数与客户端自查的偏差 < ±1%,否则会引发信任危机和大规模退款。
技术路线
现有 AI 算力消费模式围绕“承诺用量 vs. 弹性”和“资源导向 vs. 智能产出导向”两个维度展开(以下数据基于 2024 年主要公有云/API 厂商的通用实践,个别价格可能因区域和时间浮动):
| 模式 | 计量单位 | 成本可预测性 | 资源利用率(提供方) | 典型适用场景 | 示例 |
|---|---|---|---|---|---|
| 包年包月(Reserved) | 每月固定实例数 | 极高 | 低(闲置风险) | 稳定大规模训练、高负载推理 | 自研模型公司、大型 SaaS |
| 按量后付费(On-demand) | GPU·时 / Token / 调用次数 | 中 | 中 | 可变负载推理、开发测试 | 初创、科研 |
| 节省计划(Committed) | 每小时承诺消费金额 | 高 | 较高 | 有基线用量但需弹性 | 成长期科技公司 |
| 现货/抢占式(Spot) | GPU·时(可被中断) | 极低 | 极高(清库存) | 可中断训练、批处理 | 价格敏感型训练作业 |
| Token 计费(MaaS) | 输入/输出 Token 数 | 高 | 依赖模型架构与共享 | 开箱即用、零运维 | 移动应用、对话机器人 |
Token 计费本质是智能产出价值计费,而 GPU·时计费是资源占用计费;越来越多的企业采用“预留 + 按量溢出”混合模式,兼顾稳定性和弹性。
上游
- 芯片/硬件层:NVIDIA(H100、B200 等)、AMD(MI300X)、Intel Gaudi 等提供 GPU 和 AI 加速器;2024 年 NVIDIA 数据中心业务季度收入已达数百亿美元量级(来源:NVIDIA 2024 Q2 财报)。
- GPU 裸算力供应层:CoreWeave、Lambda Labs、Paperspace(已并入 DigitalOcean)、Vast.ai 等专门提供 GPU·时租赁和抢占式实例;传统云厂商 AWS、Azure、Google Cloud 同样是核心供应方。
- 计费与计量技术栈:包括流处理引擎(Kafka、Flink)、时序数据库(ClickHouse、InfluxDB、TimescaleDB)以及身份认证与配额管理系统。
- 专用计费平台组件:如 Metronome、Lago、Orb,它们提供复杂的定价规则引擎、实时用量聚合和账单生成,成为 AI 平台的关键基础设施。
下游
- 应用开发者与 ISV:直接调用 API 构建客服机器人、辅助写作、代码生成、AI 搜索等产品,按最终用户的使用量间接承担费用。
- AI SaaS 公司:如 Jasper、Copy.ai(早期采用 API 构建产品,现在更多混合自有模型),其商业模式本质是对 API 成本与终端订阅收入的价差。
- 企业内部 AI 团队:银行、保险、制造等行业公司通过 API 将大模型能力嵌入内部流程,成本可精确归集到部门或项目。
- 终端消费者:通过各类智能应用间接付费,例如购买包含 AI 功能的 Productivity 订阅或多轮对话消耗的“积分”。
- 成本与运维工具方:跨云成本监控(如 Vantage、CloudZero)、跨云任务调度(如 SkyPilot)等,帮助下游用户管理不断增长的按量账单。
受益公司
用量计费将成本中心转化为服务收入流,直接惠及以下角色(仅分析受益逻辑,不作任何买卖建议):
- 模型 API 供应商:OpenAI、Anthropic、Google DeepMind / Vertex AI、微软 Azure OpenAI Service、阿里云灵积、百度智能云等,其营收直接与客户用量挂钩,随推理调用指数级增长自然扩张。
- 独立 GPU 云服务商:CoreWeave、Lambda Labs 等,按量 GPU·时以及抢占式实例构成了其核心产品,受益于中小客户“不愿买、不愿管”的需求。
- 开源模型生态与托管平台:Together AI、Fireworks AI、Replicate 等提供开源模型托管并按 Token 计费,将社区模型的影响力变现。
- 计费基础设施公司:Metronome(据 The Information 报道为 OpenAI 和 Anthropic 提供计费支持)、Lago、Orb 等,随着 AI 公司用量爆发而高速增长,成为“卖铲子”的典型代表。
- 成本优化工具:如 SkyPilot、Cast AI 等,通过跨云比价与自动调度,帮助客户在按量市场中寻找最低价资源,从中抽佣或收取 SaaS 费。
市场规模
由于“AI 用量计费”横跨云 IaaS、模型 API 和计费平台等多个细分市场,缺乏单一权威统计。以下从多个口径交叉验证(标注年份与来源):
- 生成式 AI 整体市场:Bloomberg Intelligence 2023 年 6 月报告预测,生成式 AI 市场将从 2022 年的 400 亿美元增长至 2032 年的 1.3 万亿美元,CAGR 约 42%。其中 API 交付形式占重要份额。
- 模型 API 收入标杆:公开报道显示,OpenAI 在 2023 年底年化收入突破 16 亿美元(来源:The Information, 2024.02),主要来自按 Token 计费的 API 和 ChatGPT 订阅;Anthropic 同期也预测年化收入数亿美元量级。
- 云 IaaS 中按量计费比重:Synergy Research Group 2024 年 Q1 数据显示,全球云基础设施服务季度收入约 760 亿美元,其中按需/按量实例营收长期超过预留实例,成为公有云核心计费形式(口径为 IaaS/PaaS 收入构成,来源:Synergy)。
- 计费平台市场:Grand View Research 2023 年发布的《Usage-based Billing Market》报告显示,2022 年全球基于用量的计费软件市场规模为 58 亿美元,预计 2030 年达 182 亿美元,CAGR 15.2%,AI/ML 场景是增长最快的垂直领域。
- 趋势性预测:Gartner 曾在 2022 年预测,到 2026 年全球超过 80% 的独立软件供应商将提供基于用量的定价选项(来源:Gartner, 2022),这一趋势在 AI 服务中体现得最为彻底。
综合推断,当前由 AI API 按量计费直接驱动的年化市场规模已达数十亿美元,并随模型普及持续快速扩大。
玩家对比
以下选取 2024 年最具代表性的 AI API 平台,按公开定价与功能进行对比(价格截至 2024 年 10 月,来源为各平台官网定价页,仅展示输入/输出 1M Token 标准价格,部分模型提供低价小规格或批量折扣):
| 平台/模型 | 输入 $/1M tokens | 输出 $/1M tokens | 上下文缓存支持 | 批量折扣 | 备注 |
|---|---|---|---|---|---|
| OpenAI GPT-4o (global) | $5.00 | $15.00 | 否(Prompt缓存对部分模型开放) | 是(Batch API 半价) | 多模态,低延迟 |
| OpenAI GPT-4o mini | $0.15 | $0.60 | 同上 | 是 | 轻量级高性价比 |
| Anthropic Claude 3.5 Sonnet | $3.00 | $15.00 | 是(Prompt Caching,写入额外计费) | 否(公开资料未见) | 强调安全与长上下文 |
| Anthropic Claude 3 Haiku | $0.25 | $1.25 | 同上 | 否(公开资料未见) | 速度最快,成本极低 |
| Google Vertex AI Gemini 1.5 Pro | $3.50 | $10.50 | 是(Context Caching,折扣大) | 否(公开资料未见) | 支持超长上下文(2M tokens) |
| Google Vertex AI Gemini 1.5 Flash | $0.075 | $0.30 | 同系列支持 | 否 | 极致低成本 |
| 阿里云百炼 通义千问-Max | 约 ¥20/1M tokens | 约 ¥60/1M tokens (参考近期报价,具体请查官方) | 部分版本支持 | 是(大客户折扣) | 中文优化 |
| 百度千帆 ERNIE 4.0 | 未公开按Token定价,多为资源包/调用量结合 | — | 百度侧提供缓存优化 | — | 企业级私有化部署强 |
此外,自托管路线(如使用 Llama 3.1 8B 等开源模型)在 GPU 云上按 GPU·时付费,成本视利用率差异极大,但价格透明度不如标准化 API。
风险
- 意外帐单冲击:高负载下的按量计费可能产生远超预期的账单,一次误操作或流量攻击就可能导致客户永久流失,压制新客户尝试意愿。
- 价格战与毛利压缩:开源模型与云厂商间竞争加剧,导致 Token 单价断崖式下跌,若推理成本优化速度跟不上降价幅度,模型厂商可能陷入“量升利减”。
- 计量准确性与纠纷:分词差异、流式累积误差、时钟同步偏差都可能造成计量错误,一旦引发批量赔偿或法律纠纷,将严重损害平台信用。
- 客户用量不可预测性:若大型客户转向自建或更换模型,平台收入可能骤然下跌;高度依赖少数大客户(特别是追求成本优化的大客户)会带来集中度风险。
- 现金流错配:重资产 GPU 采购(动辄数亿美元)依赖按量回款,若 AI 需求波动导致 GPU 闲置率上升,云商和 GPU 租赁商将承受严重财务压力。
- 监管与数据语种不公平:按 Token 计费对不同语言(如中文 vs 英文)天然存在成本差异,可能引发地区性公平性质疑;某些监管政策可能要求计费前对内容进行审核,增加延迟与合规成本。
误读纠偏
-
误读 1:“用量计费等于完全弹性,一定比包年包月省钱。” 纠偏:对于稳定、可预测的高负载,按量单价往往是预留实例的 2–3 倍。直接全量按量可能让总成本大幅升高。明智策略为:以预留实例覆盖基线,以按量承载突发。
-
误读 2:“Token 计费客观反映了实际计算量。” 纠偏:Token 数量与计算量非严格线性。冗长的提示工程或冗余输出会大幅增加 Token 消耗而智能价值并未同步提升。而且不同语言的 Token 化效率差异明显(例如同样一句话中文 Token 数通常远少于英文),按 Token 计费会形成隐含的“语言税率”。
-
误读 3:“模型降价后,使用者总成本必然下降。” 纠偏:随着模型能力提升,应用常倾向于调用更强但更贵的模型,或用更复杂的提示链,导致 Token 消耗总量增长,抵消单价下降的效果(类似 Jevons 悖论)。实际支出可能不降反升。
-
误读 4:“只要有计费系统,任何公司都能轻松实现用量计费。” 纠偏:构建支持全球部署、低延迟、高可靠的实时计量管道,并支撑复杂的混合定价、分租户分项目账单、预测与预警,技术复杂度远超普通订阅系统。许多公司最终选择采购 Metronome 等专业方案,并非简单内建。
最新事件
- 2024 年 5 月:OpenAI 发布 GPT-4o,API 输入价格 $5/1M tokens,输出 $15/1M tokens,比 GPT-4 Turbo 降低 50%,并开放多模态输入(来源:OpenAI Blog, 2024.05.13)。
- 2024 年 6 月:Anthropic 推出 Claude 3.5 Sonnet,定价 $3/$15,性能大幅提升,同时启动 Prompt Caching 测试,缓存内容可节省 90% 的输入成本(来源:Anthropic Blog)。
- 2024 年 8 月:Google 全面上线 Gemini 1.5 Flash,输入 $0.075/1M tokens,输出 $0.30/1M tokens,成为当时主流模型中定价最低档,并开放 Context Caching 折扣(来源:Google Cloud Blog)。
- 2024 年 9 月:Meta 发布 Llama 3.2 多模态开源模型,开源社区继续推低 API 定价基准;多家托管平台迅速提供低至 $0.1/1M tokens 以下的推理服务,进一步压缩闭源模型溢价空间。
- 2024 年 10 月:据报道,计费基础设施公司 Metronome 在 2023 年末完成 C 轮融资后,估值突破 15 亿美元,客户已覆盖 OpenAI、Anthropic 等头部 AI 公司(来源:TechCrunch, 2024.10)。与此同时,开源计费平台 Lago 获得广泛关注,GitHub star 突破 10k,彰显开发社区对按量计费解决方案的需求。
跟踪指标
持续观察用量计费赛道的变化,可跟踪以下维度的数据与动态(均不构成投资建议,仅供参考):
- 主要 API 每百万 Token 标价:关注 OpenAI、Anthropic、Google Vertex AI、Azure OpenAI Service 官方定价页的月度变化,追踪价格战节奏。
- GPU 现货与按需价格指数:定期查看 AWS EC2 按需 GPU 实例、Google Cloud 抢占式实例、CoreWeave 等独立云的价格变化,可反映供需松紧。
- 模型厂商披露的 API 收入:OpenAI 等公司偶尔在媒体或财报中披露年化收入,可作为按量计费市场体量的风向标。
- 计费平台融资与客户动态:Metronome、Lago、Orb 的融资轮和公开客户案例,间接反映用量计费市场的渗透深度与增长通道。
- 模型推理效率指标:各主要模型的首 Token 延迟、每秒生成 Token 数(TPS)等指标,提升程度直接影响计费效率与客户留存。
- “弃用率”或客户健康度:部分 SaaS 企业披露的因成本导致的客户流失情况,可侧面反映按量计费的承受度边界。
- 版权/合规事件:与 Token 计费结合的语言公平性讨论或监管政策变化,会影响厂商价格策略与区域布局。
信源
以下列出文中引用的关键公开报告和持续更新的信息源,便于验证数据口径。
- OpenAI API Pricing(https://openai.com/api/pricing/),持续更新。
- Anthropic Developer Docs – Pricing(https://docs.anthropic.com/en/docs/intro-to-claude/pricing)。
- Google Cloud Vertex AI Pricing(https://cloud.google.com/vertex-ai/pricing)。
- Bloomberg Intelligence,“Generative AI to Become a $1.3 Trillion Market by 2032”, 2023 年 6 月。
- Grand View Research,“Usage-based Billing Market Size, Share & Trends Analysis Report, 2023–2030”, 2023 年。
- Synergy Research Group, Q1 2024 云基础设施市场份额数据。
- Gartner, “Predicts 2022: Software Pricing and Licensing”, 2022 年。
- The Information 对 OpenAI 收入的报道(2024 年 2 月)。
- TechCrunch, 关于 Metronome 融资与估值报道(2024 年 10 月)。
- Lilian Weng’s Blog – LLM Inference 优化技术(https://lilianweng.github.io/)。
- Metronome Blog – Usage-based Billing Architecture(https://metronome.com/blog)。
- a16z 关于 AI 经济模型的文章(https://a16z.com)。
- 各云厂商 GPU 实例价格页面(AWS、Azure、Google Cloud、阿里云等)。