AI 用量包(AI Usage Credits)
3 秒看懂
一句话定义:AI 用量包是 AI 服务提供商将模型推理/训练算力打包为可预付费额度单元的商业化计费模式,本质是AI 服务的”流量套餐”。
关键词:预付额度 · Token/请求/算时计量 · 弹性消耗 · 锁定客户LTV
3 分钟产业解释
这东西为什么出现?
大模型服务的成本结构与传统 SaaS 截然不同——每一次 API 调用背后都有真实的 GPU 算力消耗。对服务商而言,收入与成本强相关,不能简单包月;对用户而言,按次付费的单价往往偏高且不可预测。
AI 用量包的诞生填补了双方需求的中间地带:
| 角色 | 痛点 | 用量包如何解决 |
|---|---|---|
| 服务商 | GPU 利用率波动大,现金流不稳定 | 预付款锁定收入,平滑现金流 |
| 企业用户 | 调用量波动,成本难预测 | 批量折扣 + 额度弹性消耗,预算可控 |
| 开发者/个人 | 零散调用单价高 | 阶梯定价降低边际成本 |
商业本质
传统云服务: 按 IaaS/PaaS 资源计费(vCPU·h / GB·h)
AI 用量包: 按应用层产出计费(Token / 请求 / 生成次数)
↑
更靠近终端价值,定价权更强
这不是技术概念,而是一个商业模式/计费框架创新,位于 AI 产业链的价值变现层。
15 分钟专家深入
一、计量维度拆解
AI 用量包的核心在于”用什么单位计量”,目前业界主要有三条路线:
① Token 计量(主流)
- 以输入+输出 Token 数为消耗单位
- 典型场景:文本生成、对话、代码补全
- 代表:OpenAI API、Anthropic Claude API、Google Vertex AI
② 请求次数计量
- 单次 API 调用 = 1 个额度单位,不区分长短
- 适合固定长度输出场景(分类、嵌入等)
- 代表:部分图像识别、嵌入(Embedding)服务
③ 算力时长计量
- 以 GPU 秒/分钟为单位,底层追踪实际计算资源消耗
- 适合自定义模型部署、微调场景
- 代表:云厂商的 GPU 实例计费(Azure ML、AWS SageMaker 等)
二、定价机制经济学
单价 ($/1K tokens)
↑
按次付费 ████████████████ ← 最高,无承诺
小额包 ████████████ ← 中等,轻度折扣
大额包 ████████ ← 较低,批量折扣
企业合约 ██████ ← 最低,承诺消费额
└──────→ 购买量/承诺额
经济学本质:
- 价格歧视工具:不同消费能力的用户支付不同边际成本
- 需求预测机制:预付额=用户对未来用量的”投票”
- 转换成本构建:额度未用完→用户粘性,平台锁定效应
三、供给端成本结构
AI 用量包的定价底线取决于底层算力成本:
| 成本项 | 占比(定性) | 说明 |
|---|---|---|
| GPU/加速器算力 | 主体 | 单次推理的硬件折旧+电费 |
| 内存/存储 | 中等 | 模型加载、KV Cache 等 |
| 网络/带宽 | 较低 | API 数据传输 |
| 研发摊销 | 前期高 | 模型训练成本分摊 |
| 运维/调度 | 较低 | 推理集群管理 |
⚠️ 具体毛利率数据各厂商未充分披露,行业普遍估计推理服务毛利率在 40-60% 区间(定性估算,非精确披露数据)。
四、额度管理的隐性复杂度
- Token 不等价:1000 Token 英文 ≠ 1000 Token 中文 ≠ 1000 Token 代码,不同语言/任务的计算消耗差异显著
- 输入输出不对称:多数平台对输入 Token 和输出 Token 分别定价,输出通常更贵(自回归生成的计算开销)
- 模型差异化定价:同一平台不同模型的 Token 单价可能差数倍(如基础模型 vs 推理增强模型)
- 额度时效性:部分用量包设有效期(月度/年度清零),形成”不用即废”的消费压力
技术原理
AI 用量包本身是商业层概念,但其计量基础依赖底层技术追踪机制:
┌─────────────────────────────────────────────────────┐
│ 用户 API 请求 │
└─────────────────────┬───────────────────────────────┘
▼
┌─────────────────────────────────────────────────────┐
│ API Gateway / 负载均衡 │
│ ┌───────────────────────────┐ │
│ │ 认证 → 配额查询 → 扣减 │ │
│ └───────────────────────────┘ │
└─────────────────────┬───────────────────────────────┘
▼
┌─────────────────────────────────────────────────────┐
│ 推理引擎层 │
│ ┌─────────┐ ┌─────────┐ ┌─────────┐ │
│ │ Tokenizer│ │ Prefill │ │ Decode │ │
│ │ (计数) │ │ 阶段 │ │ 阶段 │ │
│ └────┬────┘ └────┬────┘ └────┬────┘ │
│ │ │ │ │
│ └────────────┴────────────┘ │
│ ▼ │
│ Token 计数上报(输入/输出分离) │
└─────────────────────┬───────────────────────────────┘
▼
┌─────────────────────────────────────────────────────┐
│ 计费系统 │
│ ┌──────────┐ ┌──────────┐ ┌──────────┐ │
│ │ 用量聚合 │→│ 额度扣减 │→│ 账单生成 │ │
│ └──────────┘ └──────────┘ └──────────┘ │
└─────────────────────────────────────────────────────┘
关键技术点:
- Tokenizer 层计数:在请求进入模型前完成 Token 化并统计数量,这是计量的源头
- 实时额度校验:API Gateway 层需在毫秒级完成额度充足性检查,避免超发
- 异步扣减与最终一致性:高并发场景下额度扣减可能采用异步机制,需处理并发冲突
技术演进史
| 阶段 | 时间区间(大致) | 特征 | 代表事件 |
|---|---|---|---|
| 前AI时代 | 2020年前 | 云服务按资源计费,无AI专项 | AWS/Azure 按 GPU 实例计时 |
| API 萌芽期 | 2020-2022 | 模型即服务(MaaS)兴起,按次调用 | OpenAI API 上线,按 Token 计费 |
| 额度包成型期 | 2023 | 预付额度包成为主流定价模式 | OpenAI 推出预付 credits,各厂商跟进 |
| 差异化竞争期 | 2024至今 | 多维计量、分层模型、企业定制合约 | 额度可跨模型使用、企业年框协议普及 |
注:时间线为定性梳理,非精确日期标注。
技术路线对比
| 对比维度 | Token 计量 | 请求次数计量 | 算力时长计量 |
|---|---|---|---|
| 计量精度 | 高(反映实际计算量) | 低(忽略内容复杂度) | 中(反映资源占用) |
| 用户可理解性 | 中(需理解 Token 概念) | 高(直观) | 低(需技术背景) |
| 适用场景 | 文本生成、对话 | 固定输出任务 | 自定义部署、训练 |
| 定价灵活性 | 高(可分输入/输出、模型) | 低 | 中 |
| 成本对齐度 | 高 | 低(长文本亏、短文本赚) | 高 |
| 主流采用度 | ★★★★★ | ★★★ | ★★★★(云厂商) |
上下游
上游(供给端) 中游(平台层) 下游(需求端)
┌─────────────┐ ┌─────────────────┐ ┌───────────────┐
│ GPU/加速器 │ │ AI 服务商 │ │ 企业客户 │
│ (NVIDIA/AMD/ │──供应──→ │ - OpenAI │──售卖──→ │ (API集成) │
│ 国产替代) │ │ - Anthropic │ │ │
└─────────────┘ │ - Google │ ├───────────────┤
│ - 字节/阿里/百度│ │ 开发者 │
┌─────────────┐ │ │ │ (个人/初创) │
│ 模型研发 │ ├─────────────────┤ ├───────────────┤
│ (预训练/微调)│──模型──→ │ 云厂商 │ │ C端用户 │
│ │ │ - Azure/AWS/GCP│ │ (间接) │
└─────────────┘ │ - 阿里云/腾讯云 │ └───────────────┘
└─────────────────┘
关键指标
| 指标 | 说明 | 观测意义 |
|---|---|---|
| $/1K Tokens | 每千 Token 单价 | 直接反映定价竞争力 |
| 额度消耗率 | 已购额度/已用额度 | 用户活跃度 & 平台收入确认节奏 |
| 额度续费率 | 到期后复购比例 | 客户粘性 & LTV |
| Token 毛利 | (收入-推理成本)/收入 | 平台盈利健康度 |
| 输入/输出价格比 | 输出单价 ÷ 输入单价 | 反映自回归生成的溢价程度 |
| 跨模型额度通用性 | 是否可跨模型池消耗 | 用户锁定程度 |
供需与市场数据
需求侧
- 企业 AI 支出增长:企业级 AI API 调用预算近年快速增长,但具体增幅各来源口径不一,普遍趋势为 [定性:显著增长,未有统一权威数据]
- 开发者数量:全球接入 AI API 的开发者规模持续扩大,具体数字各平台披露口径不同
供给侧
- 推理成本下降趋势:随着模型架构优化(MoE 等)和硬件迭代,单位 Token 推理成本呈下降趋势,但具体降幅缺乏统一口径
- 算力供给:全球 AI 加速器供给仍处于紧平衡状态,产能瓶颈主要在先进制程与 HBM 供应端
定价参考(定性)
⚠️ 具体价格随模型、平台、时间频繁变动,此处仅给出量级感知:
- 主流大语言模型 API:输入价格约在 $0.1-10 / 1M tokens 量级,输出价格通常为输入的 2-5 倍(不同模型、不同厂商差异极大)
- 图像生成:单次约 $0.01-0.1 量级
- 嵌入(Embedding):约 $0.01-0.1 / 1M tokens 量级
以上为行业观测量级,非精确定价,实际请以各平台官网为准。
代表公司与资本映射
| 公司/平台 | 用量包模式 | 资本关联 |
|---|---|---|
| OpenAI | 预付 credits + 按量扣减,分层模型定价 | 非上市,微软深度绑定 |
| Anthropic | API credits,Claude 系列分层 | 非上市,Google/Amazon 投资 |
| Google Cloud | Vertex AI 额度,与云账单整合 | GOOGL |
| Microsoft Azure | Azure OpenAI credits,与企业 EA 合约整合 | MSFT |
| AWS | Bedrock 按量计费 + 预留定价 | AMZN |
| 阿里云 | 通义千问 API 用量包 | 9988.HK / BABA |
| 百度智能云 | 文心一言 API 计费 | 9888.HK / BIDU |
| 字节跳动 | 火山引擎模型服务(豆包) | 非上市 |
投资逻辑
核心看点
- AI 服务货币化的确定性路径:用量包是当前最成熟的 AI 商业化手段,验证了”用多少付多少”的可行性
- 平台飞轮效应:用量包 → 用户粘性(转换成本与未用完额度形成的锁定效应) → 更多用量 → 更多预付,形成平台锁定飞轮
- 收入可预测性:预付款模式改善了 AI 服务商的现金流可见性
风险与争议
- 价格战压力:开源模型崛起 + 竞争加剧可能压缩单 Token 利润
- 成本下降传导:推理成本下降是否被传导给用户还是被平台截留,影响定价权
- 额度作废收入确认:未消耗额度的收入确认方式可能存在争议(GAAP 处理)
- 技术替代风险:端侧推理、本地部署可能分流云端 API 需求
投资标的视角
- 纯正标的稀缺:多数 AI 用量包售卖方为非上市或大型科技集团的业务线
- 间接受益链:GPU 供应商(NVIDIA)、云基础设施、AI 应用集成商
常见误读纠偏
❌ 误读一:「AI 用量包 = SaaS 订阅」
纠偏:SaaS 订阅是固定月费、功能解锁;AI 用量包是消耗制,用完即止。前者卖功能,后者卖算力/产出。商业模式本质不同——SaaS 毛利高且可预测,用量包毛利与使用行为强相关。
❌ 误读二:「Token 数可以直接换算成算力成本」
纠偏:Token 数仅是计量单位,不同任务(长文本 vs 短文本、简单问答 vs 复杂推理链)的单 Token 算力消耗差异显著。服务商的定价中包含了利润、研发摊销、供需策略等多重因素,不能简单反推成本。
❌ 误读三:「额度包越多越便宜,批量采购一定划算」
纠偏:需要关注消耗速度 vs 有效期。如果采购量远超实际需求且额度有过期机制,“便宜”可能变成”浪费”。同时,AI 推理成本持续下降,今天的大额预付可能锁定在更高的单价上。
❌ 误读四:「所有 AI 服务都在向用量包模式转型」
纠偏:用量包主要是 API 调用层的计费模式。AI 产业链中仍有大量环节采用传统计费(如 GPU 实例按时计费、模型训练按项目计费、AI 软件按 seat 订阅等)。用量包不是唯一模式,而是针对标准化推理服务的优选模式。
学习路径
Level 1 入门
├── 亲自试用一个 AI API(OpenAI / 阿里通义等)
├── 观察 Token 计数和费用变化
└── 理解"输入 Token"和"输出 Token"的区别
Level 2 进阶
├── 阅读 OpenAI / Anthropic 官方定价页
├── 对比不同模型、不同任务的 Token 单价
├── 了解 Prompt 工程如何影响 Token 消耗
└── 学习云服务计费模型基础(AWS/Azure/GCP 定价文档)
Level 3 专家
├── 分析 AI 服务商的成本结构与利润空间
├── 研究推理优化技术(量化、蒸馏、KV Cache)如何影响成本
├── 追踪 AI 产业链供给瓶颈(GPU/HBM/先进封装)
└── 建立 AI 商业化模型:单位经济学、LTV、CAC
一句话总结
AI 用量包是大模型时代”卖水”的核心商业模式,将不可预测的算力消耗转化为可管理的预算单元,其定价权取决于模型能力壁垒与算力成本曲线的博弈。
延伸阅读与来源
| 来源类型 | 推荐内容 | 说明 |
|---|---|---|
| 官方定价页 | OpenAI Pricing、Anthropic Pricing、Google Vertex AI Pricing | 第一手定价信息,定期更新 |
| 云厂商文档 | AWS Bedrock、Azure OpenAI、阿里云模型服务 | 企业级用量包方案细节 |
| 行业研报 | 各券商 AI 商业化专题(如有公开版本) | 市场规模估算参考(注意口径差异) |
| 技术博客 | 各厂商关于推理成本优化的技术文章 | 理解成本下降的底层驱动 |
| 社区讨论 | Hacker News、Reddit r/MachineLearning 关于 API 定价的讨论 | 用户视角的真实反馈 |
数据与规格声明:本文中涉及的具体定价数字、市场份额、毛利率等数据,凡未标注精确来源的,均为行业观测量级或定性估计,不构成精确引用。实际数据请以各厂商官方披露为准。