模型層 開放閱讀

用量計費

Usage-based Pricing

概念 ID
usage-based-pricing
更新時間
2026-05-29
來源數量
待補

用量計費

3 秒看懂

用量計費是一種按實際消耗付費的結算模式,AI 計算場景中常以 Token數、GPU·時、呼叫次數 為單位,把“買機器/包月”變成“用多少付多少”。

3 分鐘產業解釋

用量計費將 AI 服務從一次性資本支出轉化為持續運營開支:開發者不必預購 GPU 伺服器或簽署鉅額最低消費合約,而是像繳納電費一樣為每次推論、每次訓練實際消耗的計算資源付費。

  • 對使用者:試錯門檻大幅降低,初創團隊花幾美元就能呼叫最先進大型模型搭建原型,不再需要先籌幾十萬資金買卡。
  • 對廠商:閒置算力通過按需售賣得以貨幣化,通過超售與智慧排程提升叢集利用率;營收隨著客戶使用量增長而自然擴張,也倒逼模型推論效率持續最佳化。
  • 對產業鏈:成本與工作負載直接掛鉤,激勵模型廠商壓低單次推論成本,由此催生監控、計量、成本分析、跨雲端比價等新型工具層。

技術原理

用量計費在 AI 場景遠比傳統雲端主機複雜:計量物件從整機執行時間下沉到推論引擎內部的 Token 級消耗,要求即時、精準且低開銷地採集。

Token 級計量的實現

使用者輸入文本 → 分詞器(Tokenizer)切分為 Token → 模型逐 Token 生成 → 拼接返回。計量系統在服務端準確捕獲:

  • Input Tokens:請求中的 messagesprompt 等欄位經分詞器處理後的 Token 數。
  • Output Tokens:模型實際生成的 Token 數,包含停止符;流式輸出時需對每個 delta 塊累加計數。

不同模型的分詞器差異顯著,同一段中文在 GPT、Claude 和 Llama 下的 Token 數可能相差 30% 以上,因此計費 Token 數必須使用與模型繫結的編碼器在服務端重算,不可依賴客戶端自報。

資料路徑簡圖:

使用者請求 → API閘道器 → [鑑權/限流] → 推論引擎
                 ↓(非同步)              ↓
              計量採集器 ← (流式輸出Token計數、首Token延遲、總耗時)

          聚合/入庫 → 賬單系統

GPU·時計量的精度

對於訓練作業或自託管推論,雲端廠商通過 GPU 虛擬化(NVIDIA MIG、Time-slicing)或任務級排程實現細粒度計量:

  • 容器級計量:Kubernetes 叢集通過 Device Plugin 上報 GPU 使用時長,精度可達秒級甚至毫秒級。
  • 作業級計量:AI 平台記錄每個訓練任務的實際 GPU 佔用時間(RUNNING 狀態),自動剔除排隊與預處理耗時。 關鍵引數:計量最小顆粒度普遍為 1 秒(部分平台為 1 分鐘),計量錨點一般位於 NVIDIA 驅動或 CUDA API 鉤子。

準即時計費與額度控制

為避免“賬單暴雷”,系統和使用者都需要即時可見的累計消耗與硬性限額(Hard Limit)。典型架構:請求事件 → Kafka → 流處理(Flink)→ 時序庫(ClickHouse/InfluxDB)→ Redis 快取當前計費週期累計用量。每次請求前查 Redis 用量預估,若超限則返回 429 或降級到低優佇列。

技術難點:流式輸出場景下最終輸出的 Token 數在開始時未知,額度控制只能依賴保守預估(如限制輸入 Token)或後驗扣減,允許少量、可控的透支。同時,在數千節點規模下,計量事件必須做到 exactly-once 或至少低容忍度的重複計數,否則會出現嚴重財務糾紛。

此外,為適應極低延遲要求,部分實現將 Token 計數直接整合在推論引擎的 CUDA kernel 邊界,通過共享記憶體向計量代理彙總資料,避免額外序列損耗。

關鍵引數

  • 計量顆粒度與單位:Token 級計費通常以 1K 或 1M Token 為最小賣出單元;GPU·時計費最小單位一般為 1 秒。
  • 輸入/輸出分離定價:輸出 Token 價格通常是輸入的 3–5 倍,因為自迴歸生成包含更密集的浮點運算和視訊記憶體訪問(截至 2024 年 Q3 主流模型定價,來源:各廠商定價頁)。
  • 預付費/後付費與計費週期:大多采用後付費月結,部分對中小客戶要求預充值或繫結信用卡,按小時、日累計生成初步賬單。
  • 信用額度與硬限額:使用者可設定月度預算上限(Hard Cap),到達後服務自動暫停,避免超額損失。
  • 超額容忍度:流式輸出超支通常控制在本次請求 Tokens 預估的 120% 以內,具體取決於廠商策略。
  • 折扣機制:批次處理 API(Batch)可延遲響應以換取 50% 成本減免;長文本快取(如 Google Context Caching、Anthropic Prompt Caching)可大幅降低重複輸入費用。
  • 計量精度目標:行業標準要求服務端計費 Token 數與客戶端自查的偏差 < ±1%,否則會引發信任危機和大規模退款。

技術路線

現有 AI 算力消費模式圍繞“承諾用量 vs. 彈性”和“資源導向 vs. 智慧產出導向”兩個維度展開(以下資料基於 2024 年主要公有雲端/API 廠商的通用實踐,個別價格可能因區域和時間浮動):

模式計量單位成本可預測性資源利用率(提供方)典型適用場景示例
包年包月(Reserved)每月固定例項數極高低(閒置風險)穩定大規模訓練、高負載推論自研模型公司、大型 SaaS
按量後付費(On-demand)GPU·時 / Token / 呼叫次數可變負載推論、開發測試初創、科研
節省計劃(Committed)每小時承諾消費金額較高有基線用量但需彈性成長期科技公司
現貨/搶佔式(Spot)GPU·時(可被中斷)極低極高(清庫存)可中斷訓練、批處理價格敏感型訓練作業
Token 計費(MaaS)輸入/輸出 Token 數依賴模型架構與共享開箱即用、零運維移動應用、對話機器人

Token 計費本質是智慧產出價值計費,而 GPU·時計費是資源佔用計費;越來越多的企業採用“預留 + 按量溢位”混合模式,兼顧穩定性和彈性。

上游

  • 晶片/硬體層:NVIDIA(H100、B200 等)、AMD(MI300X)、Intel Gaudi 等提供 GPU 和 AI 加速器;2024 年 NVIDIA 資料中心業務季度營收已達數百億美元量級(來源:NVIDIA 2024 Q2 財報)。
  • GPU 裸算力供應層:CoreWeave、Lambda Labs、Paperspace(已併入 DigitalOcean)、Vast.ai 等專門提供 GPU·時租賃和搶佔式例項;傳統雲端廠商 AWS、Azure、Google Cloud 同樣是核心供應方。
  • 計費與計量技術棧:包括流處理引擎(Kafka、Flink)、時序資料庫(ClickHouse、InfluxDB、TimescaleDB)以及身份認證與配額管理系統。
  • 專用計費平台元件:如 Metronome、Lago、Orb,它們提供複雜的定價規則引擎、即時用量聚合和賬單生成,成為 AI 平台的關鍵基礎設施。

下游

  • 應用開發者與 ISV:直接呼叫 API 建置客服機器人、輔助寫作、程式碼生成、AI 搜尋等產品,按終端使用者的使用量間接承擔費用。
  • AI SaaS 公司:如 Jasper、Copy.ai(早期採用 API 建置產品,現在更多混合自有模型),其商業模式本質是對 API 成本與終端訂閱營收的價差。
  • 企業內部 AI 團隊:銀行、保險、製造等行業公司通過 API 將大型模型能力嵌入內部流程,成本可精確歸集到部門或專案。
  • 終端消費者:通過各類智慧應用間接付費,例如購買包含 AI 功能的 Productivity 訂閱或多輪對話消耗的“積分”。
  • 成本與運維工具方:跨雲端成本監控(如 Vantage、CloudZero)、跨雲端任務排程(如 SkyPilot)等,幫助下游使用者管理不斷增長的按量賬單。

受益公司

用量計費將成本中心轉化為服務營收流,直接惠及以下角色(僅分析受益邏輯,不作任何買賣建議):

  • 模型 API 供應商:OpenAI、Anthropic、Google DeepMind / Vertex AI、微軟 Azure OpenAI Service、阿里雲端靈積、百度智慧雲端等,其營收直接與客戶用量掛鉤,隨推論呼叫指數級增長自然擴張。
  • 獨立 GPU 雲端服務商:CoreWeave、Lambda Labs 等,按量 GPU·時以及搶佔式例項構成了其核心產品,受益於中小客戶“不願買、不願管”的需求。
  • 開源模型生態與託管平台:Together AI、Fireworks AI、Replicate 等提供開源模型託管並按 Token 計費,將社群模型的影響力變現。
  • 計費基礎設施公司:Metronome(據 The Information 報道為 OpenAI 和 Anthropic 提供計費支援)、Lago、Orb 等,隨著 AI 公司用量爆發而高速增長,成為“賣鏟子”的典型代表。
  • 成本最佳化工具:如 SkyPilot、Cast AI 等,通過跨雲端比價與自動排程,幫助客戶在按量市場中尋找最低價資源,從中抽傭或收取 SaaS 費。

市場規模

由於“AI 用量計費”橫跨雲端 IaaS、模型 API 和計費平台等多個細分市場,缺乏單一權威統計。以下從多個口徑交叉驗證(標註年份與來源):

  • 生成式 AI 整體市場:Bloomberg Intelligence 2023 年 6 月報告預測,生成式 AI 市場將從 2022 年的 400 億美元增長至 2032 年的 1.3 萬億美元,CAGR 約 42%。其中 API 交付形式佔重要份額。
  • 模型 API 營收標杆:公開報道顯示,OpenAI 在 2023 年底年化營收突破 16 億美元(來源:The Information, 2024.02),主要來自按 Token 計費的 API 和 ChatGPT 訂閱;Anthropic 同期也預測年化營收數億美元量級。
  • 雲端 IaaS 中按量計費比重:Synergy Research Group 2024 年 Q1 資料顯示,全球雲端基礎設施服務季度營收約 760 億美元,其中按需/按量例項營收長期超過預留例項,成為公有雲端核心計費形式(口徑為 IaaS/PaaS 營收構成,來源:Synergy)。
  • 計費平台市場:Grand View Research 2023 年釋出的《Usage-based Billing Market》報告顯示,2022 年全球基於用量的計費軟體市場規模為 58 億美元,預計 2030 年達 182 億美元,CAGR 15.2%,AI/ML 場景是增長最快的垂直領域。
  • 趨勢性預測:Gartner 曾在 2022 年預測,到 2026 年全球超過 80% 的獨立軟體供應商將提供基於用量的定價選項(來源:Gartner, 2022),這一趨勢在 AI 服務中體現得最為徹底。

綜合推斷,當前由 AI API 按量計費直接驅動的年化市場規模已達數十億美元,並隨模型普及持續快速擴大。

玩家對比

以下選取 2024 年最具代表性的 AI API 平台,按公開定價與功能進行對比(價格截至 2024 年 10 月,來源為各平台官網定價頁,僅展示輸入/輸出 1M Token 標準價格,部分模型提供低價小規格或批次折扣):

平台/模型輸入 $/1M tokens輸出 $/1M tokens上下文快取支援批次折扣備註
OpenAI GPT-4o (global)$5.00$15.00否(Prompt快取對部分模型開放)是(Batch API 半價)多模態,低延遲
OpenAI GPT-4o mini$0.15$0.60同上輕量級高性價比
Anthropic Claude 3.5 Sonnet$3.00$15.00是(Prompt Caching,寫入額外計費)否(公開資料未見)強調安全與長上下文
Anthropic Claude 3 Haiku$0.25$1.25同上否(公開資料未見)速度最快,成本極低
Google Vertex AI Gemini 1.5 Pro$3.50$10.50是(Context Caching,折扣大)否(公開資料未見)支援超長上下文(2M tokens)
Google Vertex AI Gemini 1.5 Flash$0.075$0.30同系列支援極致低成本
阿里雲端百鍊 通義千問-Max約 ¥20/1M tokens約 ¥60/1M tokens (參考近期報價,具體請查官方)部分版本支援是(大客戶折扣)中文最佳化
百度千帆 ERNIE 4.0未公開按Token定價,多為資源包/呼叫量結合百度側提供快取最佳化企業級私有化部署強

此外,自託管路線(如使用 Llama 3.1 8B 等開源模型)在 GPU 雲端上按 GPU·時付費,成本視利用率差異極大,但價格透明度不如標準化 API。

風險

  • 意外帳單衝擊:高負載下的按量計費可能產生遠超預期的賬單,一次誤操作或流量攻擊就可能導致客戶永久流失,壓制新客戶嘗試意願。
  • 價格戰與毛利壓縮:開源模型與雲端廠商間競爭加劇,導致 Token 單價斷崖式下跌,若推論成本最佳化速度跟不上降價幅度,模型廠商可能陷入“量升利減”。
  • 計量準確性與糾紛:分詞差異、流式累積誤差、時鐘同步偏差都可能造成計量錯誤,一旦引發批次賠償或法律糾紛,將嚴重損害平台信用。
  • 客戶用量不可預測性:若大型客戶轉向自建或更換模型,平台營收可能驟然下跌;高度依賴少數大客戶(特別是追求成本最佳化的大客戶)會帶來集中度風險。
  • 現金流量錯配:重資產 GPU 採購(動輒數億美元)依賴按量回款,若 AI 需求波動導致 GPU 閒置率上升,雲端商和 GPU 租賃商將承受嚴重財務壓力。
  • 監管與資料語種不公平:按 Token 計費對不同語言(如中文 vs 英文)天然存在成本差異,可能引發地區性公平性質疑;某些監管政策可能要求計費前對內容進行稽核,增加延遲與合規成本。

誤讀糾偏

  • 誤讀 1:“用量計費等於完全彈性,一定比包年包月省錢。” 糾偏:對於穩定、可預測的高負載,按量單價往往是預留例項的 2–3 倍。直接全量按量可能讓總成本大幅升高。明智策略為:以預留例項覆蓋基線,以按量承載突發。

  • 誤讀 2:“Token 計費客觀反映了實際計算量。” 糾偏:Token 數量與計算量非嚴格線性。冗長的提示工程或冗餘輸出會大幅增加 Token 消耗而智慧價值並未同步提升。而且不同語言的 Token 化效率差異明顯(例如同樣一句話中文 Token 數通常遠少於英文),按 Token 計費會形成隱含的“語言稅率”。

  • 誤讀 3:“模型降價後,使用者總成本必然下降。” 糾偏:隨著模型能力提升,應用常傾向於呼叫更強但更貴的模型,或用更復雜的提示鏈,導致 Token 消耗總量增長,抵消單價下降的效果(類似 Jevons 悖論)。實際支出可能不降反升。

  • 誤讀 4:“只要有計費系統,任何公司都能輕鬆實現用量計費。” 糾偏:建置支援全球部署、低延遲、高可靠的即時計量管道,並支撐複雜的混合定價、分租戶分專案賬單、預測與預警,技術複雜度遠超普通訂閱系統。許多公司最終選擇採購 Metronome 等專業方案,並非簡單內建。

最新事件

  • 2024 年 5 月:OpenAI 釋出 GPT-4o,API 輸入價格 $5/1M tokens,輸出 $15/1M tokens,比 GPT-4 Turbo 降低 50%,並開放多模態輸入(來源:OpenAI Blog, 2024.05.13)。
  • 2024 年 6 月:Anthropic 推出 Claude 3.5 Sonnet,定價 $3/$15,效能大幅提升,同時啟動 Prompt Caching 測試,快取內容可節省 90% 的輸入成本(來源:Anthropic Blog)。
  • 2024 年 8 月:Google 全面上線 Gemini 1.5 Flash,輸入 $0.075/1M tokens,輸出 $0.30/1M tokens,成為當時主流模型中定價最低檔,並開放 Context Caching 折扣(來源:Google Cloud Blog)。
  • 2024 年 9 月:Meta 釋出 Llama 3.2 多模態開源模型,開源社群繼續推低 API 定價基準;多家託管平台迅速提供低至 $0.1/1M tokens 以下的推論服務,進一步壓縮閉源模型溢價空間。
  • 2024 年 10 月:據報道,計費基礎設施公司 Metronome 在 2023 年末完成 C 輪融資後,估值突破 15 億美元,客戶已覆蓋 OpenAI、Anthropic 等頭部 AI 公司(來源:TechCrunch, 2024.10)。與此同時,開源計費平台 Lago 獲得廣泛關注,GitHub star 突破 10k,彰顯開發社群對按量計費解決方案的需求。

追蹤指標

持續觀察用量計費賽道的變化,可追蹤以下維度的資料與動態(均不構成投資建議,僅供參考):

  • 主要 API 每百萬 Token 標價:關注 OpenAI、Anthropic、Google Vertex AI、Azure OpenAI Service 官方定價頁的月度變化,追蹤價格戰節奏。
  • GPU 現貨與按需價格指數:定期檢視 AWS EC2 按需 GPU 例項、Google Cloud 搶佔式例項、CoreWeave 等獨立雲端的價格變化,可反映供需鬆緊。
  • 模型廠商揭露的 API 營收:OpenAI 等公司偶爾在媒體或財報中揭露年化營收,可作為按量計費市場體量的風向標。
  • 計費平台融資與客戶動態:Metronome、Lago、Orb 的融資輪和公開客戶案例,間接反映用量計費市場的滲透深度與增長通道。
  • 模型推論效率指標:各主要模型的首 Token 延遲、每秒生成 Token 數(TPS)等指標,提升程度直接影響計費效率與客戶留存。
  • “棄用率”或客戶健康度:部分 SaaS 企業揭露的因成本導致的客戶流失情況,可側面反映按量計費的承受度邊界。
  • 版權/合規事件:與 Token 計費結合的語言公平性討論或監管政策變化,會影響廠商價格策略與區域版面配置。

信源

以下列出文中引用的關鍵公開報告和持續更新的資訊源,便於驗證資料口徑。

source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型