應用層 開放閱讀

AI 用量包

AI Usage Credits

概念 ID
ai-usage-credits
更新時間
2026-05-29
來源數量
待補

AI 用量包(AI Usage Credits)

3 秒看懂

一句話定義:AI 用量包是 AI 服務提供商將模型推論/訓練算力打包為可預付費額度單元的商業化計費模式,本質是AI 服務的”流量套餐”

關鍵詞:預付額度 · Token/請求/算時計量 · 彈性消耗 · 鎖定客戶LTV

3 分鐘產業解釋

這東西為什麼出現?

大型模型服務的成本結構與傳統 SaaS 截然不同——每一次 API 呼叫背後都有真實的 GPU 算力消耗。對服務商而言,營收與成本強相關,不能簡單包月;對使用者而言,按次付費的單價往往偏高且不可預測。

AI 用量包的誕生填補了雙方需求的中間地帶:

角色痛點用量包如何解決
服務商GPU 利用率波動大,現金流量不穩定預付款鎖定營收,平滑現金流量
企業使用者呼叫量波動,成本難預測批次折扣 + 額度彈性消耗,預算可控
開發者/個人零散呼叫單價高階梯定價降低邊際成本

商業本質

傳統雲端服務:  按 IaaS/PaaS 資源計費(vCPU·h / GB·h)
AI 用量包:  按應用層產出計費(Token / 請求 / 生成次數)

         更靠近終端價值,定價權更強

這不是技術概念,而是一個商業模式/計費架構創新,位於 AI 產業鏈的價值變現層。

15 分鐘專家深入

一、計量維度拆解

AI 用量包的核心在於”用什麼單位計量”,目前業界主要有三條路線:

① Token 計量(主流)

  • 以輸入+輸出 Token 數為消耗單位
  • 典型場景:文本生成、對話、程式碼補全
  • 代表:OpenAI API、Anthropic Claude API、Google Vertex AI

② 請求次數計量

  • 單次 API 呼叫 = 1 個額度單位,不區分長短
  • 適合固定長度輸出場景(分類、嵌入等)
  • 代表:部分影像識別、嵌入(Embedding)服務

③ 算力時長計量

  • 以 GPU 秒/分鐘為單位,底層追蹤實際計算資源消耗
  • 適合自定義模型部署、微調場景
  • 代表:雲端廠商的 GPU 例項計費(Azure ML、AWS SageMaker 等)

二、定價機制經濟學

              單價 ($/1K tokens)

    按次付費 ████████████████  ← 最高,無承諾
    小額包   ████████████      ← 中等,輕度折扣
    大額包   ████████          ← 較低,批次折扣
    企業合約 ██████            ← 最低,承諾消費額
                   └──────→ 購買量/承諾額

經濟學本質

  • 價格歧視工具:不同消費能力的使用者支付不同邊際成本
  • 需求預測機制:預付額=使用者對未來用量的”投票”
  • 轉換成本建置:額度未用完→使用者粘性,平台鎖定效應

三、供給端成本結構

AI 用量包的定價底線取決於底層算力成本:

成本項佔比(定性)說明
GPU/加速器算力主體單次推論的硬體折舊+電費
記憶體/儲存中等模型載入、KV Cache 等
網路/頻寬較低API 資料傳輸
研發攤銷前期高模型訓練成本分攤
運維/排程較低推論叢集管理

⚠️ 具體毛利率資料各廠商未充分揭露,行業普遍估計推論服務毛利率在 40-60% 區間(定性估算,非精確揭露資料)。

四、額度管理的隱性複雜度

  1. Token 不等價:1000 Token 英文 ≠ 1000 Token 中文 ≠ 1000 Token 程式碼,不同語言/任務的計算消耗差異顯著
  2. 輸入輸出不對稱:多數平台對輸入 Token 和輸出 Token 分別定價,輸出通常更貴(自迴歸生成的計算開銷)
  3. 模型差異化定價:同一平台不同模型的 Token 單價可能差數倍(如基礎模型 vs 推論增強模型)
  4. 額度時效性:部分用量包設有效期(月度/年度清零),形成”不用即廢”的消費壓力

技術原理

AI 用量包本身是商業層概念,但其計量基礎依賴底層技術追蹤機制:

┌─────────────────────────────────────────────────────┐
│                    使用者 API 請求                      │
└─────────────────────┬───────────────────────────────┘

┌─────────────────────────────────────────────────────┐
│              API Gateway / 負載均衡                   │
│         ┌───────────────────────────┐                │
│         │   認證 → 配額查詢 → 扣減   │                │
│         └───────────────────────────┘                │
└─────────────────────┬───────────────────────────────┘

┌─────────────────────────────────────────────────────┐
│                推論引擎層                              │
│  ┌─────────┐  ┌─────────┐  ┌─────────┐              │
│  │ Tokenizer│  │ Prefill │  │ Decode  │              │
│  │ (計數)   │  │ 階段    │  │ 階段    │              │
│  └────┬────┘  └────┬────┘  └────┬────┘              │
│       │            │            │                    │
│       └────────────┴────────────┘                    │
│                  ▼                                    │
│         Token 計數上報(輸入/輸出分離)                 │
└─────────────────────┬───────────────────────────────┘

┌─────────────────────────────────────────────────────┐
│              計費系統                                  │
│  ┌──────────┐  ┌──────────┐  ┌──────────┐           │
│  │ 用量聚合  │→│ 額度扣減  │→│ 賬單生成  │           │
│  └──────────┘  └──────────┘  └──────────┘           │
└─────────────────────────────────────────────────────┘

關鍵技術點

  • Tokenizer 層計數:在請求進入模型前完成 Token 化並統計數量,這是計量的源頭
  • 即時額度校驗:API Gateway 層需在毫秒級完成額度充足性檢查,避免超發
  • 非同步扣減與最終一致性:高併發場景下額度扣減可能採用非同步機制,需處理併發衝突

技術演進史

階段時間區間(大致)特徵代表事件
前AI時代2020年前雲端服務按資源計費,無AI專項AWS/Azure 按 GPU 例項計時
API 萌芽期2020-2022模型即服務(MaaS)興起,按次呼叫OpenAI API 上線,按 Token 計費
額度包成型期2023預付額度包成為主流定價模式OpenAI 推出預付 credits,各廠商跟進
差異化競爭期2024至今多維計量、分層模型、企業定製合約額度可跨模型使用、企業年框協議普及

注:時間線為定性梳理,非精確日期標註。


技術路線對比

對比維度Token 計量請求次數計量算力時長計量
計量精度高(反映實際計算量)低(忽略內容複雜度)中(反映資源佔用)
使用者可理解性中(需理解 Token 概念)高(直觀)低(需技術背景)
適用場景文本生成、對話固定輸出任務自定義部署、訓練
定價靈活性高(可分輸入/輸出、模型)
成本對齊度低(長文本虧、短文本賺)
主流採用度★★★★★★★★★★★★(雲端廠商)

上下游

上游(供給端)                     中游(平台層)                   下游(需求端)
┌─────────────┐              ┌─────────────────┐           ┌───────────────┐
│ GPU/加速器   │              │  AI 服務商       │           │ 企業客戶       │
│ (NVIDIA/AMD/ │──供應──→    │  - OpenAI       │──售賣──→  │ (API整合)      │
│  國產替代)   │              │  - Anthropic    │           │               │
└─────────────┘              │  - Google       │           ├───────────────┤
                             │  - 位元組/阿里/百度│           │ 開發者        │
┌─────────────┐              │                 │           │ (個人/初創)    │
│ 模型研發     │              ├─────────────────┤           ├───────────────┤
│ (預訓練/微調)│──模型──→    │  雲端廠商          │           │ C端使用者       │
│             │              │  - Azure/AWS/GCP│           │ (間接)        │
└─────────────┘              │  - 阿里雲端/騰訊雲端 │           └───────────────┘
                             └─────────────────┘

關鍵指標

指標說明觀測意義
$/1K Tokens每千 Token 單價直接反映定價競爭力
額度消耗率已購額度/已用額度使用者活躍度 & 平台營收確認節奏
額度續費率到期後復購比例客戶粘性 & LTV
Token 毛利(營收-推論成本)/營收平台盈利健康度
輸入/輸出價格比輸出單價 ÷ 輸入單價反映自迴歸生成的溢價程度
跨模型額度通用性是否可跨模型池消耗使用者鎖定程度

供需與市場資料

需求側

  • 企業 AI 支出增長:企業級 AI API 呼叫預算近年快速增長,但具體增幅各來源口徑不一,普遍趨勢為 [定性:顯著增長,未有統一權威資料]
  • 開發者數量:全球接入 AI API 的開發者規模持續擴大,具體數字各平台揭露口徑不同

供給側

  • 推論成本下降趨勢:隨著模型架構最佳化(MoE 等)和硬體迭代,單位 Token 推論成本呈下降趨勢,但具體降幅缺乏統一口徑
  • 算力供給:全球 AI 加速器供給仍處於緊平衡狀態,產能瓶頸主要在先進製程與 HBM 供應端

定價參考(定性)

⚠️ 具體價格隨模型、平台、時間頻繁變動,此處僅給出量級感知:

  • 主流大語言模型 API:輸入價格約在 $0.1-10 / 1M tokens 量級,輸出價格通常為輸入的 2-5 倍(不同模型、不同廠商差異極大)
  • 影像生成:單次約 $0.01-0.1 量級
  • 嵌入(Embedding):約 $0.01-0.1 / 1M tokens 量級

以上為行業觀測量級,非精確定價,實際請以各平台官網為準。


代表公司與資本對映

公司/平台用量包模式資本關聯
OpenAI預付 credits + 按量扣減,分層模型定價非上市,微軟深度繫結
AnthropicAPI credits,Claude 系列分層非上市,Google/Amazon 投資
Google CloudVertex AI 額度,與雲端賬單整合GOOGL
Microsoft AzureAzure OpenAI credits,與企業 EA 合約整合MSFT
AWSBedrock 按量計費 + 預留定價AMZN
阿里雲端通義千問 API 用量包9988.HK / BABA
百度智慧雲端文心一言 API 計費9888.HK / BIDU
字節跳動火山引擎模型服務(豆包)非上市

投資邏輯

核心看點

  1. AI 服務貨幣化的確定性路徑:用量包是當前最成熟的 AI 商業化手段,驗證了”用多少付多少”的可行性
  2. 平台飛輪效應:用量包 → 使用者粘性(轉換成本與未用完額度形成的鎖定效應) → 更多用量 → 更多預付,形成平台鎖定飛輪
  3. 營收可預測性:預付款模式改善了 AI 服務商的現金流量可見性

風險與爭議

  1. 價格戰壓力:開源模型崛起 + 競爭加劇可能壓縮單 Token 獲利
  2. 成本下降傳導:推論成本下降是否被傳導給使用者還是被平台截留,影響定價權
  3. 額度作廢營收確認:未消耗額度的營收確認方式可能存在爭議(GAAP 處理)
  4. 技術替代風險:端側推論、本地部署可能分流雲端端 API 需求

投資標的視角

  • 純正標的稀缺:多數 AI 用量包售賣方為非上市或大型科技集團的業務線
  • 間接受益鏈:GPU 供應商(NVIDIA)、雲端基礎設施、AI 應用整合商

常見誤讀糾偏

❌ 誤讀一:「AI 用量包 = SaaS 訂閱」

糾偏:SaaS 訂閱是固定月費、功能解鎖;AI 用量包是消耗制,用完即止。前者賣功能,後者賣算力/產出。商業模式本質不同——SaaS 毛利高且可預測,用量包毛利與使用行為強相關。

❌ 誤讀二:「Token 數可以直接換算成算力成本」

糾偏:Token 數僅是計量單位,不同任務(長文本 vs 短文本、簡單問答 vs 複雜推論鏈)的單 Token 算力消耗差異顯著。服務商的定價中包含了獲利、研發攤銷、供需策略等多重因素,不能簡單反推成本。

❌ 誤讀三:「額度包越多越便宜,批次採購一定划算」

糾偏:需要關注消耗速度 vs 有效期。如果採購量遠超實際需求且額度有過期機制,“便宜”可能變成”浪費”。同時,AI 推論成本持續下降,今天的大額預付可能鎖定在更高的單價上。

❌ 誤讀四:「所有 AI 服務都在向用量包模式轉型」

糾偏:用量包主要是 API 呼叫層的計費模式。AI 產業鏈中仍有大量環節採用傳統計費(如 GPU 例項按時計費、模型訓練按專案計費、AI 軟體按 seat 訂閱等)。用量包不是唯一模式,而是針對標準化推論服務的優選模式


學習路徑

Level 1  入門
├── 親自試用一個 AI API(OpenAI / 阿里通義等)
├── 觀察 Token 計數和費用變化
└── 理解"輸入 Token"和"輸出 Token"的區別

Level 2  進階
├── 閱讀 OpenAI / Anthropic 官方定價頁
├── 對比不同模型、不同任務的 Token 單價
├── 瞭解 Prompt 工程如何影響 Token 消耗
└── 學習雲端服務計費模型基礎(AWS/Azure/GCP 定價文件)

Level 3  專家
├── 分析 AI 服務商的成本結構與獲利空間
├── 研究推論最佳化技術(量化、蒸餾、KV Cache)如何影響成本
├── 追蹤 AI 產業鏈供給瓶頸(GPU/HBM/先進封裝)
└── 建立 AI 商業化模型:單位經濟學、LTV、CAC

一句話總結

AI 用量包是大型模型時代”賣水”的核心商業模式,將不可預測的算力消耗轉化為可管理的預算單元,其定價權取決於模型能力壁壘與算力成本曲線的博弈。


延伸閱讀與來源

來源型別推薦內容說明
官方定價頁OpenAI Pricing、Anthropic Pricing、Google Vertex AI Pricing第一手定價資訊,定期更新
雲端廠商文件AWS Bedrock、Azure OpenAI、阿里雲端模型服務企業級用量包方案細節
行業研究報告各券商 AI 商業化專題(如有公開版本)市場規模估算參考(注意口徑差異)
技術部落格各廠商關於推論成本最佳化的技術文章理解成本下降的底層驅動
社群討論Hacker News、Reddit r/MachineLearning 關於 API 定價的討論使用者視角的真實反饋

資料與規格宣告:本文中涉及的具體定價數字、市場份額、毛利率等資料,凡未標註精確來源的,均為行業觀測量級或定性估計,不構成精確引用。實際資料請以各廠商官方揭露為準。

source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型