应用层 开放阅读

AI 用量包

AI Usage Credits

概念 ID
ai-usage-credits
更新时间
2026-05-29
来源数量
待补

AI 用量包(AI Usage Credits)

3 秒看懂

一句话定义:AI 用量包是 AI 服务提供商将模型推理/训练算力打包为可预付费额度单元的商业化计费模式,本质是AI 服务的”流量套餐”

关键词:预付额度 · Token/请求/算时计量 · 弹性消耗 · 锁定客户LTV

3 分钟产业解释

这东西为什么出现?

大模型服务的成本结构与传统 SaaS 截然不同——每一次 API 调用背后都有真实的 GPU 算力消耗。对服务商而言,收入与成本强相关,不能简单包月;对用户而言,按次付费的单价往往偏高且不可预测。

AI 用量包的诞生填补了双方需求的中间地带:

角色痛点用量包如何解决
服务商GPU 利用率波动大,现金流不稳定预付款锁定收入,平滑现金流
企业用户调用量波动,成本难预测批量折扣 + 额度弹性消耗,预算可控
开发者/个人零散调用单价高阶梯定价降低边际成本

商业本质

传统云服务:  按 IaaS/PaaS 资源计费(vCPU·h / GB·h)
AI 用量包:  按应用层产出计费(Token / 请求 / 生成次数)
               ↑
         更靠近终端价值,定价权更强

这不是技术概念,而是一个商业模式/计费框架创新,位于 AI 产业链的价值变现层。

15 分钟专家深入

一、计量维度拆解

AI 用量包的核心在于”用什么单位计量”,目前业界主要有三条路线:

① Token 计量(主流)

  • 以输入+输出 Token 数为消耗单位
  • 典型场景:文本生成、对话、代码补全
  • 代表:OpenAI API、Anthropic Claude API、Google Vertex AI

② 请求次数计量

  • 单次 API 调用 = 1 个额度单位,不区分长短
  • 适合固定长度输出场景(分类、嵌入等)
  • 代表:部分图像识别、嵌入(Embedding)服务

③ 算力时长计量

  • 以 GPU 秒/分钟为单位,底层追踪实际计算资源消耗
  • 适合自定义模型部署、微调场景
  • 代表:云厂商的 GPU 实例计费(Azure ML、AWS SageMaker 等)

二、定价机制经济学

              单价 ($/1K tokens)
                   ↑
    按次付费 ████████████████  ← 最高,无承诺
    小额包   ████████████      ← 中等,轻度折扣
    大额包   ████████          ← 较低,批量折扣
    企业合约 ██████            ← 最低,承诺消费额
                   └──────→ 购买量/承诺额

经济学本质

  • 价格歧视工具:不同消费能力的用户支付不同边际成本
  • 需求预测机制:预付额=用户对未来用量的”投票”
  • 转换成本构建:额度未用完→用户粘性,平台锁定效应

三、供给端成本结构

AI 用量包的定价底线取决于底层算力成本:

成本项占比(定性)说明
GPU/加速器算力主体单次推理的硬件折旧+电费
内存/存储中等模型加载、KV Cache 等
网络/带宽较低API 数据传输
研发摊销前期高模型训练成本分摊
运维/调度较低推理集群管理

⚠️ 具体毛利率数据各厂商未充分披露,行业普遍估计推理服务毛利率在 40-60% 区间(定性估算,非精确披露数据)。

四、额度管理的隐性复杂度

  1. Token 不等价:1000 Token 英文 ≠ 1000 Token 中文 ≠ 1000 Token 代码,不同语言/任务的计算消耗差异显著
  2. 输入输出不对称:多数平台对输入 Token 和输出 Token 分别定价,输出通常更贵(自回归生成的计算开销)
  3. 模型差异化定价:同一平台不同模型的 Token 单价可能差数倍(如基础模型 vs 推理增强模型)
  4. 额度时效性:部分用量包设有效期(月度/年度清零),形成”不用即废”的消费压力

技术原理

AI 用量包本身是商业层概念,但其计量基础依赖底层技术追踪机制:

┌─────────────────────────────────────────────────────┐
│                    用户 API 请求                      │
└─────────────────────┬───────────────────────────────┘
                      ▼
┌─────────────────────────────────────────────────────┐
│              API Gateway / 负载均衡                   │
│         ┌───────────────────────────┐                │
│         │   认证 → 配额查询 → 扣减   │                │
│         └───────────────────────────┘                │
└─────────────────────┬───────────────────────────────┘
                      ▼
┌─────────────────────────────────────────────────────┐
│                推理引擎层                              │
│  ┌─────────┐  ┌─────────┐  ┌─────────┐              │
│  │ Tokenizer│  │ Prefill │  │ Decode  │              │
│  │ (计数)   │  │ 阶段    │  │ 阶段    │              │
│  └────┬────┘  └────┬────┘  └────┬────┘              │
│       │            │            │                    │
│       └────────────┴────────────┘                    │
│                  ▼                                    │
│         Token 计数上报(输入/输出分离)                 │
└─────────────────────┬───────────────────────────────┘
                      ▼
┌─────────────────────────────────────────────────────┐
│              计费系统                                  │
│  ┌──────────┐  ┌──────────┐  ┌──────────┐           │
│  │ 用量聚合  │→│ 额度扣减  │→│ 账单生成  │           │
│  └──────────┘  └──────────┘  └──────────┘           │
└─────────────────────────────────────────────────────┘

关键技术点

  • Tokenizer 层计数:在请求进入模型前完成 Token 化并统计数量,这是计量的源头
  • 实时额度校验:API Gateway 层需在毫秒级完成额度充足性检查,避免超发
  • 异步扣减与最终一致性:高并发场景下额度扣减可能采用异步机制,需处理并发冲突

技术演进史

阶段时间区间(大致)特征代表事件
前AI时代2020年前云服务按资源计费,无AI专项AWS/Azure 按 GPU 实例计时
API 萌芽期2020-2022模型即服务(MaaS)兴起,按次调用OpenAI API 上线,按 Token 计费
额度包成型期2023预付额度包成为主流定价模式OpenAI 推出预付 credits,各厂商跟进
差异化竞争期2024至今多维计量、分层模型、企业定制合约额度可跨模型使用、企业年框协议普及

注:时间线为定性梳理,非精确日期标注。


技术路线对比

对比维度Token 计量请求次数计量算力时长计量
计量精度高(反映实际计算量)低(忽略内容复杂度)中(反映资源占用)
用户可理解性中(需理解 Token 概念)高(直观)低(需技术背景)
适用场景文本生成、对话固定输出任务自定义部署、训练
定价灵活性高(可分输入/输出、模型)
成本对齐度低(长文本亏、短文本赚)
主流采用度★★★★★★★★★★★★(云厂商)

上下游

上游(供给端)                     中游(平台层)                   下游(需求端)
┌─────────────┐              ┌─────────────────┐           ┌───────────────┐
│ GPU/加速器   │              │  AI 服务商       │           │ 企业客户       │
│ (NVIDIA/AMD/ │──供应──→    │  - OpenAI       │──售卖──→  │ (API集成)      │
│  国产替代)   │              │  - Anthropic    │           │               │
└─────────────┘              │  - Google       │           ├───────────────┤
                             │  - 字节/阿里/百度│           │ 开发者        │
┌─────────────┐              │                 │           │ (个人/初创)    │
│ 模型研发     │              ├─────────────────┤           ├───────────────┤
│ (预训练/微调)│──模型──→    │  云厂商          │           │ C端用户       │
│             │              │  - Azure/AWS/GCP│           │ (间接)        │
└─────────────┘              │  - 阿里云/腾讯云 │           └───────────────┘
                             └─────────────────┘

关键指标

指标说明观测意义
$/1K Tokens每千 Token 单价直接反映定价竞争力
额度消耗率已购额度/已用额度用户活跃度 & 平台收入确认节奏
额度续费率到期后复购比例客户粘性 & LTV
Token 毛利(收入-推理成本)/收入平台盈利健康度
输入/输出价格比输出单价 ÷ 输入单价反映自回归生成的溢价程度
跨模型额度通用性是否可跨模型池消耗用户锁定程度

供需与市场数据

需求侧

  • 企业 AI 支出增长:企业级 AI API 调用预算近年快速增长,但具体增幅各来源口径不一,普遍趋势为 [定性:显著增长,未有统一权威数据]
  • 开发者数量:全球接入 AI API 的开发者规模持续扩大,具体数字各平台披露口径不同

供给侧

  • 推理成本下降趋势:随着模型架构优化(MoE 等)和硬件迭代,单位 Token 推理成本呈下降趋势,但具体降幅缺乏统一口径
  • 算力供给:全球 AI 加速器供给仍处于紧平衡状态,产能瓶颈主要在先进制程与 HBM 供应端

定价参考(定性)

⚠️ 具体价格随模型、平台、时间频繁变动,此处仅给出量级感知:

  • 主流大语言模型 API:输入价格约在 $0.1-10 / 1M tokens 量级,输出价格通常为输入的 2-5 倍(不同模型、不同厂商差异极大)
  • 图像生成:单次约 $0.01-0.1 量级
  • 嵌入(Embedding):约 $0.01-0.1 / 1M tokens 量级

以上为行业观测量级,非精确定价,实际请以各平台官网为准。


代表公司与资本映射

公司/平台用量包模式资本关联
OpenAI预付 credits + 按量扣减,分层模型定价非上市,微软深度绑定
AnthropicAPI credits,Claude 系列分层非上市,Google/Amazon 投资
Google CloudVertex AI 额度,与云账单整合GOOGL
Microsoft AzureAzure OpenAI credits,与企业 EA 合约整合MSFT
AWSBedrock 按量计费 + 预留定价AMZN
阿里云通义千问 API 用量包9988.HK / BABA
百度智能云文心一言 API 计费9888.HK / BIDU
字节跳动火山引擎模型服务(豆包)非上市

投资逻辑

核心看点

  1. AI 服务货币化的确定性路径:用量包是当前最成熟的 AI 商业化手段,验证了”用多少付多少”的可行性
  2. 平台飞轮效应:用量包 → 用户粘性(转换成本与未用完额度形成的锁定效应) → 更多用量 → 更多预付,形成平台锁定飞轮
  3. 收入可预测性:预付款模式改善了 AI 服务商的现金流可见性

风险与争议

  1. 价格战压力:开源模型崛起 + 竞争加剧可能压缩单 Token 利润
  2. 成本下降传导:推理成本下降是否被传导给用户还是被平台截留,影响定价权
  3. 额度作废收入确认:未消耗额度的收入确认方式可能存在争议(GAAP 处理)
  4. 技术替代风险:端侧推理、本地部署可能分流云端 API 需求

投资标的视角

  • 纯正标的稀缺:多数 AI 用量包售卖方为非上市或大型科技集团的业务线
  • 间接受益链:GPU 供应商(NVIDIA)、云基础设施、AI 应用集成商

常见误读纠偏

❌ 误读一:「AI 用量包 = SaaS 订阅」

纠偏:SaaS 订阅是固定月费、功能解锁;AI 用量包是消耗制,用完即止。前者卖功能,后者卖算力/产出。商业模式本质不同——SaaS 毛利高且可预测,用量包毛利与使用行为强相关。

❌ 误读二:「Token 数可以直接换算成算力成本」

纠偏:Token 数仅是计量单位,不同任务(长文本 vs 短文本、简单问答 vs 复杂推理链)的单 Token 算力消耗差异显著。服务商的定价中包含了利润、研发摊销、供需策略等多重因素,不能简单反推成本。

❌ 误读三:「额度包越多越便宜,批量采购一定划算」

纠偏:需要关注消耗速度 vs 有效期。如果采购量远超实际需求且额度有过期机制,“便宜”可能变成”浪费”。同时,AI 推理成本持续下降,今天的大额预付可能锁定在更高的单价上。

❌ 误读四:「所有 AI 服务都在向用量包模式转型」

纠偏:用量包主要是 API 调用层的计费模式。AI 产业链中仍有大量环节采用传统计费(如 GPU 实例按时计费、模型训练按项目计费、AI 软件按 seat 订阅等)。用量包不是唯一模式,而是针对标准化推理服务的优选模式


学习路径

Level 1  入门
├── 亲自试用一个 AI API(OpenAI / 阿里通义等)
├── 观察 Token 计数和费用变化
└── 理解"输入 Token"和"输出 Token"的区别

Level 2  进阶
├── 阅读 OpenAI / Anthropic 官方定价页
├── 对比不同模型、不同任务的 Token 单价
├── 了解 Prompt 工程如何影响 Token 消耗
└── 学习云服务计费模型基础(AWS/Azure/GCP 定价文档)

Level 3  专家
├── 分析 AI 服务商的成本结构与利润空间
├── 研究推理优化技术(量化、蒸馏、KV Cache)如何影响成本
├── 追踪 AI 产业链供给瓶颈(GPU/HBM/先进封装)
└── 建立 AI 商业化模型:单位经济学、LTV、CAC

一句话总结

AI 用量包是大模型时代”卖水”的核心商业模式,将不可预测的算力消耗转化为可管理的预算单元,其定价权取决于模型能力壁垒与算力成本曲线的博弈。


延伸阅读与来源

来源类型推荐内容说明
官方定价页OpenAI Pricing、Anthropic Pricing、Google Vertex AI Pricing第一手定价信息,定期更新
云厂商文档AWS Bedrock、Azure OpenAI、阿里云模型服务企业级用量包方案细节
行业研报各券商 AI 商业化专题(如有公开版本)市场规模估算参考(注意口径差异)
技术博客各厂商关于推理成本优化的技术文章理解成本下降的底层驱动
社区讨论Hacker News、Reddit r/MachineLearning 关于 API 定价的讨论用户视角的真实反馈

数据与规格声明:本文中涉及的具体定价数字、市场份额、毛利率等数据,凡未标注精确来源的,均为行业观测量级或定性估计,不构成精确引用。实际数据请以各厂商官方披露为准。

source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型