AI 用量包(AI Usage Credits)
3 秒看懂
一句話定義:AI 用量包是 AI 服務提供商將模型推論/訓練算力打包為可預付費額度單元的商業化計費模式,本質是AI 服務的”流量套餐”。
關鍵詞:預付額度 · Token/請求/算時計量 · 彈性消耗 · 鎖定客戶LTV
3 分鐘產業解釋
這東西為什麼出現?
大型模型服務的成本結構與傳統 SaaS 截然不同——每一次 API 呼叫背後都有真實的 GPU 算力消耗。對服務商而言,營收與成本強相關,不能簡單包月;對使用者而言,按次付費的單價往往偏高且不可預測。
AI 用量包的誕生填補了雙方需求的中間地帶:
| 角色 | 痛點 | 用量包如何解決 |
|---|---|---|
| 服務商 | GPU 利用率波動大,現金流量不穩定 | 預付款鎖定營收,平滑現金流量 |
| 企業使用者 | 呼叫量波動,成本難預測 | 批次折扣 + 額度彈性消耗,預算可控 |
| 開發者/個人 | 零散呼叫單價高 | 階梯定價降低邊際成本 |
商業本質
傳統雲端服務: 按 IaaS/PaaS 資源計費(vCPU·h / GB·h)
AI 用量包: 按應用層產出計費(Token / 請求 / 生成次數)
↑
更靠近終端價值,定價權更強
這不是技術概念,而是一個商業模式/計費架構創新,位於 AI 產業鏈的價值變現層。
15 分鐘專家深入
一、計量維度拆解
AI 用量包的核心在於”用什麼單位計量”,目前業界主要有三條路線:
① Token 計量(主流)
- 以輸入+輸出 Token 數為消耗單位
- 典型場景:文本生成、對話、程式碼補全
- 代表:OpenAI API、Anthropic Claude API、Google Vertex AI
② 請求次數計量
- 單次 API 呼叫 = 1 個額度單位,不區分長短
- 適合固定長度輸出場景(分類、嵌入等)
- 代表:部分影像識別、嵌入(Embedding)服務
③ 算力時長計量
- 以 GPU 秒/分鐘為單位,底層追蹤實際計算資源消耗
- 適合自定義模型部署、微調場景
- 代表:雲端廠商的 GPU 例項計費(Azure ML、AWS SageMaker 等)
二、定價機制經濟學
單價 ($/1K tokens)
↑
按次付費 ████████████████ ← 最高,無承諾
小額包 ████████████ ← 中等,輕度折扣
大額包 ████████ ← 較低,批次折扣
企業合約 ██████ ← 最低,承諾消費額
└──────→ 購買量/承諾額
經濟學本質:
- 價格歧視工具:不同消費能力的使用者支付不同邊際成本
- 需求預測機制:預付額=使用者對未來用量的”投票”
- 轉換成本建置:額度未用完→使用者粘性,平台鎖定效應
三、供給端成本結構
AI 用量包的定價底線取決於底層算力成本:
| 成本項 | 佔比(定性) | 說明 |
|---|---|---|
| GPU/加速器算力 | 主體 | 單次推論的硬體折舊+電費 |
| 記憶體/儲存 | 中等 | 模型載入、KV Cache 等 |
| 網路/頻寬 | 較低 | API 資料傳輸 |
| 研發攤銷 | 前期高 | 模型訓練成本分攤 |
| 運維/排程 | 較低 | 推論叢集管理 |
⚠️ 具體毛利率資料各廠商未充分揭露,行業普遍估計推論服務毛利率在 40-60% 區間(定性估算,非精確揭露資料)。
四、額度管理的隱性複雜度
- Token 不等價:1000 Token 英文 ≠ 1000 Token 中文 ≠ 1000 Token 程式碼,不同語言/任務的計算消耗差異顯著
- 輸入輸出不對稱:多數平台對輸入 Token 和輸出 Token 分別定價,輸出通常更貴(自迴歸生成的計算開銷)
- 模型差異化定價:同一平台不同模型的 Token 單價可能差數倍(如基礎模型 vs 推論增強模型)
- 額度時效性:部分用量包設有效期(月度/年度清零),形成”不用即廢”的消費壓力
技術原理
AI 用量包本身是商業層概念,但其計量基礎依賴底層技術追蹤機制:
┌─────────────────────────────────────────────────────┐
│ 使用者 API 請求 │
└─────────────────────┬───────────────────────────────┘
▼
┌─────────────────────────────────────────────────────┐
│ API Gateway / 負載均衡 │
│ ┌───────────────────────────┐ │
│ │ 認證 → 配額查詢 → 扣減 │ │
│ └───────────────────────────┘ │
└─────────────────────┬───────────────────────────────┘
▼
┌─────────────────────────────────────────────────────┐
│ 推論引擎層 │
│ ┌─────────┐ ┌─────────┐ ┌─────────┐ │
│ │ Tokenizer│ │ Prefill │ │ Decode │ │
│ │ (計數) │ │ 階段 │ │ 階段 │ │
│ └────┬────┘ └────┬────┘ └────┬────┘ │
│ │ │ │ │
│ └────────────┴────────────┘ │
│ ▼ │
│ Token 計數上報(輸入/輸出分離) │
└─────────────────────┬───────────────────────────────┘
▼
┌─────────────────────────────────────────────────────┐
│ 計費系統 │
│ ┌──────────┐ ┌──────────┐ ┌──────────┐ │
│ │ 用量聚合 │→│ 額度扣減 │→│ 賬單生成 │ │
│ └──────────┘ └──────────┘ └──────────┘ │
└─────────────────────────────────────────────────────┘
關鍵技術點:
- Tokenizer 層計數:在請求進入模型前完成 Token 化並統計數量,這是計量的源頭
- 即時額度校驗:API Gateway 層需在毫秒級完成額度充足性檢查,避免超發
- 非同步扣減與最終一致性:高併發場景下額度扣減可能採用非同步機制,需處理併發衝突
技術演進史
| 階段 | 時間區間(大致) | 特徵 | 代表事件 |
|---|---|---|---|
| 前AI時代 | 2020年前 | 雲端服務按資源計費,無AI專項 | AWS/Azure 按 GPU 例項計時 |
| API 萌芽期 | 2020-2022 | 模型即服務(MaaS)興起,按次呼叫 | OpenAI API 上線,按 Token 計費 |
| 額度包成型期 | 2023 | 預付額度包成為主流定價模式 | OpenAI 推出預付 credits,各廠商跟進 |
| 差異化競爭期 | 2024至今 | 多維計量、分層模型、企業定製合約 | 額度可跨模型使用、企業年框協議普及 |
注:時間線為定性梳理,非精確日期標註。
技術路線對比
| 對比維度 | Token 計量 | 請求次數計量 | 算力時長計量 |
|---|---|---|---|
| 計量精度 | 高(反映實際計算量) | 低(忽略內容複雜度) | 中(反映資源佔用) |
| 使用者可理解性 | 中(需理解 Token 概念) | 高(直觀) | 低(需技術背景) |
| 適用場景 | 文本生成、對話 | 固定輸出任務 | 自定義部署、訓練 |
| 定價靈活性 | 高(可分輸入/輸出、模型) | 低 | 中 |
| 成本對齊度 | 高 | 低(長文本虧、短文本賺) | 高 |
| 主流採用度 | ★★★★★ | ★★★ | ★★★★(雲端廠商) |
上下游
上游(供給端) 中游(平台層) 下游(需求端)
┌─────────────┐ ┌─────────────────┐ ┌───────────────┐
│ GPU/加速器 │ │ AI 服務商 │ │ 企業客戶 │
│ (NVIDIA/AMD/ │──供應──→ │ - OpenAI │──售賣──→ │ (API整合) │
│ 國產替代) │ │ - Anthropic │ │ │
└─────────────┘ │ - Google │ ├───────────────┤
│ - 位元組/阿里/百度│ │ 開發者 │
┌─────────────┐ │ │ │ (個人/初創) │
│ 模型研發 │ ├─────────────────┤ ├───────────────┤
│ (預訓練/微調)│──模型──→ │ 雲端廠商 │ │ C端使用者 │
│ │ │ - Azure/AWS/GCP│ │ (間接) │
└─────────────┘ │ - 阿里雲端/騰訊雲端 │ └───────────────┘
└─────────────────┘
關鍵指標
| 指標 | 說明 | 觀測意義 |
|---|---|---|
| $/1K Tokens | 每千 Token 單價 | 直接反映定價競爭力 |
| 額度消耗率 | 已購額度/已用額度 | 使用者活躍度 & 平台營收確認節奏 |
| 額度續費率 | 到期後復購比例 | 客戶粘性 & LTV |
| Token 毛利 | (營收-推論成本)/營收 | 平台盈利健康度 |
| 輸入/輸出價格比 | 輸出單價 ÷ 輸入單價 | 反映自迴歸生成的溢價程度 |
| 跨模型額度通用性 | 是否可跨模型池消耗 | 使用者鎖定程度 |
供需與市場資料
需求側
- 企業 AI 支出增長:企業級 AI API 呼叫預算近年快速增長,但具體增幅各來源口徑不一,普遍趨勢為 [定性:顯著增長,未有統一權威資料]
- 開發者數量:全球接入 AI API 的開發者規模持續擴大,具體數字各平台揭露口徑不同
供給側
- 推論成本下降趨勢:隨著模型架構最佳化(MoE 等)和硬體迭代,單位 Token 推論成本呈下降趨勢,但具體降幅缺乏統一口徑
- 算力供給:全球 AI 加速器供給仍處於緊平衡狀態,產能瓶頸主要在先進製程與 HBM 供應端
定價參考(定性)
⚠️ 具體價格隨模型、平台、時間頻繁變動,此處僅給出量級感知:
- 主流大語言模型 API:輸入價格約在 $0.1-10 / 1M tokens 量級,輸出價格通常為輸入的 2-5 倍(不同模型、不同廠商差異極大)
- 影像生成:單次約 $0.01-0.1 量級
- 嵌入(Embedding):約 $0.01-0.1 / 1M tokens 量級
以上為行業觀測量級,非精確定價,實際請以各平台官網為準。
代表公司與資本對映
| 公司/平台 | 用量包模式 | 資本關聯 |
|---|---|---|
| OpenAI | 預付 credits + 按量扣減,分層模型定價 | 非上市,微軟深度繫結 |
| Anthropic | API credits,Claude 系列分層 | 非上市,Google/Amazon 投資 |
| Google Cloud | Vertex AI 額度,與雲端賬單整合 | GOOGL |
| Microsoft Azure | Azure OpenAI credits,與企業 EA 合約整合 | MSFT |
| AWS | Bedrock 按量計費 + 預留定價 | AMZN |
| 阿里雲端 | 通義千問 API 用量包 | 9988.HK / BABA |
| 百度智慧雲端 | 文心一言 API 計費 | 9888.HK / BIDU |
| 字節跳動 | 火山引擎模型服務(豆包) | 非上市 |
投資邏輯
核心看點
- AI 服務貨幣化的確定性路徑:用量包是當前最成熟的 AI 商業化手段,驗證了”用多少付多少”的可行性
- 平台飛輪效應:用量包 → 使用者粘性(轉換成本與未用完額度形成的鎖定效應) → 更多用量 → 更多預付,形成平台鎖定飛輪
- 營收可預測性:預付款模式改善了 AI 服務商的現金流量可見性
風險與爭議
- 價格戰壓力:開源模型崛起 + 競爭加劇可能壓縮單 Token 獲利
- 成本下降傳導:推論成本下降是否被傳導給使用者還是被平台截留,影響定價權
- 額度作廢營收確認:未消耗額度的營收確認方式可能存在爭議(GAAP 處理)
- 技術替代風險:端側推論、本地部署可能分流雲端端 API 需求
投資標的視角
- 純正標的稀缺:多數 AI 用量包售賣方為非上市或大型科技集團的業務線
- 間接受益鏈:GPU 供應商(NVIDIA)、雲端基礎設施、AI 應用整合商
常見誤讀糾偏
❌ 誤讀一:「AI 用量包 = SaaS 訂閱」
糾偏:SaaS 訂閱是固定月費、功能解鎖;AI 用量包是消耗制,用完即止。前者賣功能,後者賣算力/產出。商業模式本質不同——SaaS 毛利高且可預測,用量包毛利與使用行為強相關。
❌ 誤讀二:「Token 數可以直接換算成算力成本」
糾偏:Token 數僅是計量單位,不同任務(長文本 vs 短文本、簡單問答 vs 複雜推論鏈)的單 Token 算力消耗差異顯著。服務商的定價中包含了獲利、研發攤銷、供需策略等多重因素,不能簡單反推成本。
❌ 誤讀三:「額度包越多越便宜,批次採購一定划算」
糾偏:需要關注消耗速度 vs 有效期。如果採購量遠超實際需求且額度有過期機制,“便宜”可能變成”浪費”。同時,AI 推論成本持續下降,今天的大額預付可能鎖定在更高的單價上。
❌ 誤讀四:「所有 AI 服務都在向用量包模式轉型」
糾偏:用量包主要是 API 呼叫層的計費模式。AI 產業鏈中仍有大量環節採用傳統計費(如 GPU 例項按時計費、模型訓練按專案計費、AI 軟體按 seat 訂閱等)。用量包不是唯一模式,而是針對標準化推論服務的優選模式。
學習路徑
Level 1 入門
├── 親自試用一個 AI API(OpenAI / 阿里通義等)
├── 觀察 Token 計數和費用變化
└── 理解"輸入 Token"和"輸出 Token"的區別
Level 2 進階
├── 閱讀 OpenAI / Anthropic 官方定價頁
├── 對比不同模型、不同任務的 Token 單價
├── 瞭解 Prompt 工程如何影響 Token 消耗
└── 學習雲端服務計費模型基礎(AWS/Azure/GCP 定價文件)
Level 3 專家
├── 分析 AI 服務商的成本結構與獲利空間
├── 研究推論最佳化技術(量化、蒸餾、KV Cache)如何影響成本
├── 追蹤 AI 產業鏈供給瓶頸(GPU/HBM/先進封裝)
└── 建立 AI 商業化模型:單位經濟學、LTV、CAC
一句話總結
AI 用量包是大型模型時代”賣水”的核心商業模式,將不可預測的算力消耗轉化為可管理的預算單元,其定價權取決於模型能力壁壘與算力成本曲線的博弈。
延伸閱讀與來源
| 來源型別 | 推薦內容 | 說明 |
|---|---|---|
| 官方定價頁 | OpenAI Pricing、Anthropic Pricing、Google Vertex AI Pricing | 第一手定價資訊,定期更新 |
| 雲端廠商文件 | AWS Bedrock、Azure OpenAI、阿里雲端模型服務 | 企業級用量包方案細節 |
| 行業研究報告 | 各券商 AI 商業化專題(如有公開版本) | 市場規模估算參考(注意口徑差異) |
| 技術部落格 | 各廠商關於推論成本最佳化的技術文章 | 理解成本下降的底層驅動 |
| 社群討論 | Hacker News、Reddit r/MachineLearning 關於 API 定價的討論 | 使用者視角的真實反饋 |
資料與規格宣告:本文中涉及的具體定價數字、市場份額、毛利率等資料,凡未標註精確來源的,均為行業觀測量級或定性估計,不構成精確引用。實際資料請以各廠商官方揭露為準。