用量計費
3 秒看懂
用量計費是一種按實際消耗付費的結算模式,AI 計算場景中常以 Token數、GPU·時、呼叫次數 為單位,把“買機器/包月”變成“用多少付多少”。
3 分鐘產業解釋
用量計費將 AI 服務從一次性資本支出轉化為持續運營開支:開發者不必預購 GPU 伺服器或簽署鉅額最低消費合約,而是像繳納電費一樣為每次推論、每次訓練實際消耗的計算資源付費。
- 對使用者:試錯門檻大幅降低,初創團隊花幾美元就能呼叫最先進大型模型搭建原型,不再需要先籌幾十萬資金買卡。
- 對廠商:閒置算力通過按需售賣得以貨幣化,通過超售與智慧排程提升叢集利用率;營收隨著客戶使用量增長而自然擴張,也倒逼模型推論效率持續最佳化。
- 對產業鏈:成本與工作負載直接掛鉤,激勵模型廠商壓低單次推論成本,由此催生監控、計量、成本分析、跨雲端比價等新型工具層。
技術原理
用量計費在 AI 場景遠比傳統雲端主機複雜:計量物件從整機執行時間下沉到推論引擎內部的 Token 級消耗,要求即時、精準且低開銷地採集。
Token 級計量的實現
使用者輸入文本 → 分詞器(Tokenizer)切分為 Token → 模型逐 Token 生成 → 拼接返回。計量系統在服務端準確捕獲:
- Input Tokens:請求中的
messages、prompt等欄位經分詞器處理後的 Token 數。 - Output Tokens:模型實際生成的 Token 數,包含停止符;流式輸出時需對每個 delta 塊累加計數。
不同模型的分詞器差異顯著,同一段中文在 GPT、Claude 和 Llama 下的 Token 數可能相差 30% 以上,因此計費 Token 數必須使用與模型繫結的編碼器在服務端重算,不可依賴客戶端自報。
資料路徑簡圖:
使用者請求 → API閘道器 → [鑑權/限流] → 推論引擎
↓(非同步) ↓
計量採集器 ← (流式輸出Token計數、首Token延遲、總耗時)
↓
聚合/入庫 → 賬單系統
GPU·時計量的精度
對於訓練作業或自託管推論,雲端廠商通過 GPU 虛擬化(NVIDIA MIG、Time-slicing)或任務級排程實現細粒度計量:
- 容器級計量:Kubernetes 叢集通過 Device Plugin 上報 GPU 使用時長,精度可達秒級甚至毫秒級。
- 作業級計量:AI 平台記錄每個訓練任務的實際 GPU 佔用時間(RUNNING 狀態),自動剔除排隊與預處理耗時。 關鍵引數:計量最小顆粒度普遍為 1 秒(部分平台為 1 分鐘),計量錨點一般位於 NVIDIA 驅動或 CUDA API 鉤子。
準即時計費與額度控制
為避免“賬單暴雷”,系統和使用者都需要即時可見的累計消耗與硬性限額(Hard Limit)。典型架構:請求事件 → Kafka → 流處理(Flink)→ 時序庫(ClickHouse/InfluxDB)→ Redis 快取當前計費週期累計用量。每次請求前查 Redis 用量預估,若超限則返回 429 或降級到低優佇列。
技術難點:流式輸出場景下最終輸出的 Token 數在開始時未知,額度控制只能依賴保守預估(如限制輸入 Token)或後驗扣減,允許少量、可控的透支。同時,在數千節點規模下,計量事件必須做到 exactly-once 或至少低容忍度的重複計數,否則會出現嚴重財務糾紛。
此外,為適應極低延遲要求,部分實現將 Token 計數直接整合在推論引擎的 CUDA kernel 邊界,通過共享記憶體向計量代理彙總資料,避免額外序列損耗。
關鍵引數
- 計量顆粒度與單位:Token 級計費通常以 1K 或 1M Token 為最小賣出單元;GPU·時計費最小單位一般為 1 秒。
- 輸入/輸出分離定價:輸出 Token 價格通常是輸入的 3–5 倍,因為自迴歸生成包含更密集的浮點運算和視訊記憶體訪問(截至 2024 年 Q3 主流模型定價,來源:各廠商定價頁)。
- 預付費/後付費與計費週期:大多采用後付費月結,部分對中小客戶要求預充值或繫結信用卡,按小時、日累計生成初步賬單。
- 信用額度與硬限額:使用者可設定月度預算上限(Hard Cap),到達後服務自動暫停,避免超額損失。
- 超額容忍度:流式輸出超支通常控制在本次請求 Tokens 預估的 120% 以內,具體取決於廠商策略。
- 折扣機制:批次處理 API(Batch)可延遲響應以換取 50% 成本減免;長文本快取(如 Google Context Caching、Anthropic Prompt Caching)可大幅降低重複輸入費用。
- 計量精度目標:行業標準要求服務端計費 Token 數與客戶端自查的偏差 < ±1%,否則會引發信任危機和大規模退款。
技術路線
現有 AI 算力消費模式圍繞“承諾用量 vs. 彈性”和“資源導向 vs. 智慧產出導向”兩個維度展開(以下資料基於 2024 年主要公有雲端/API 廠商的通用實踐,個別價格可能因區域和時間浮動):
| 模式 | 計量單位 | 成本可預測性 | 資源利用率(提供方) | 典型適用場景 | 示例 |
|---|---|---|---|---|---|
| 包年包月(Reserved) | 每月固定例項數 | 極高 | 低(閒置風險) | 穩定大規模訓練、高負載推論 | 自研模型公司、大型 SaaS |
| 按量後付費(On-demand) | GPU·時 / Token / 呼叫次數 | 中 | 中 | 可變負載推論、開發測試 | 初創、科研 |
| 節省計劃(Committed) | 每小時承諾消費金額 | 高 | 較高 | 有基線用量但需彈性 | 成長期科技公司 |
| 現貨/搶佔式(Spot) | GPU·時(可被中斷) | 極低 | 極高(清庫存) | 可中斷訓練、批處理 | 價格敏感型訓練作業 |
| Token 計費(MaaS) | 輸入/輸出 Token 數 | 高 | 依賴模型架構與共享 | 開箱即用、零運維 | 移動應用、對話機器人 |
Token 計費本質是智慧產出價值計費,而 GPU·時計費是資源佔用計費;越來越多的企業採用“預留 + 按量溢位”混合模式,兼顧穩定性和彈性。
上游
- 晶片/硬體層:NVIDIA(H100、B200 等)、AMD(MI300X)、Intel Gaudi 等提供 GPU 和 AI 加速器;2024 年 NVIDIA 資料中心業務季度營收已達數百億美元量級(來源:NVIDIA 2024 Q2 財報)。
- GPU 裸算力供應層:CoreWeave、Lambda Labs、Paperspace(已併入 DigitalOcean)、Vast.ai 等專門提供 GPU·時租賃和搶佔式例項;傳統雲端廠商 AWS、Azure、Google Cloud 同樣是核心供應方。
- 計費與計量技術棧:包括流處理引擎(Kafka、Flink)、時序資料庫(ClickHouse、InfluxDB、TimescaleDB)以及身份認證與配額管理系統。
- 專用計費平台元件:如 Metronome、Lago、Orb,它們提供複雜的定價規則引擎、即時用量聚合和賬單生成,成為 AI 平台的關鍵基礎設施。
下游
- 應用開發者與 ISV:直接呼叫 API 建置客服機器人、輔助寫作、程式碼生成、AI 搜尋等產品,按終端使用者的使用量間接承擔費用。
- AI SaaS 公司:如 Jasper、Copy.ai(早期採用 API 建置產品,現在更多混合自有模型),其商業模式本質是對 API 成本與終端訂閱營收的價差。
- 企業內部 AI 團隊:銀行、保險、製造等行業公司通過 API 將大型模型能力嵌入內部流程,成本可精確歸集到部門或專案。
- 終端消費者:通過各類智慧應用間接付費,例如購買包含 AI 功能的 Productivity 訂閱或多輪對話消耗的“積分”。
- 成本與運維工具方:跨雲端成本監控(如 Vantage、CloudZero)、跨雲端任務排程(如 SkyPilot)等,幫助下游使用者管理不斷增長的按量賬單。
受益公司
用量計費將成本中心轉化為服務營收流,直接惠及以下角色(僅分析受益邏輯,不作任何買賣建議):
- 模型 API 供應商:OpenAI、Anthropic、Google DeepMind / Vertex AI、微軟 Azure OpenAI Service、阿里雲端靈積、百度智慧雲端等,其營收直接與客戶用量掛鉤,隨推論呼叫指數級增長自然擴張。
- 獨立 GPU 雲端服務商:CoreWeave、Lambda Labs 等,按量 GPU·時以及搶佔式例項構成了其核心產品,受益於中小客戶“不願買、不願管”的需求。
- 開源模型生態與託管平台:Together AI、Fireworks AI、Replicate 等提供開源模型託管並按 Token 計費,將社群模型的影響力變現。
- 計費基礎設施公司:Metronome(據 The Information 報道為 OpenAI 和 Anthropic 提供計費支援)、Lago、Orb 等,隨著 AI 公司用量爆發而高速增長,成為“賣鏟子”的典型代表。
- 成本最佳化工具:如 SkyPilot、Cast AI 等,通過跨雲端比價與自動排程,幫助客戶在按量市場中尋找最低價資源,從中抽傭或收取 SaaS 費。
市場規模
由於“AI 用量計費”橫跨雲端 IaaS、模型 API 和計費平台等多個細分市場,缺乏單一權威統計。以下從多個口徑交叉驗證(標註年份與來源):
- 生成式 AI 整體市場:Bloomberg Intelligence 2023 年 6 月報告預測,生成式 AI 市場將從 2022 年的 400 億美元增長至 2032 年的 1.3 萬億美元,CAGR 約 42%。其中 API 交付形式佔重要份額。
- 模型 API 營收標杆:公開報道顯示,OpenAI 在 2023 年底年化營收突破 16 億美元(來源:The Information, 2024.02),主要來自按 Token 計費的 API 和 ChatGPT 訂閱;Anthropic 同期也預測年化營收數億美元量級。
- 雲端 IaaS 中按量計費比重:Synergy Research Group 2024 年 Q1 資料顯示,全球雲端基礎設施服務季度營收約 760 億美元,其中按需/按量例項營收長期超過預留例項,成為公有雲端核心計費形式(口徑為 IaaS/PaaS 營收構成,來源:Synergy)。
- 計費平台市場:Grand View Research 2023 年釋出的《Usage-based Billing Market》報告顯示,2022 年全球基於用量的計費軟體市場規模為 58 億美元,預計 2030 年達 182 億美元,CAGR 15.2%,AI/ML 場景是增長最快的垂直領域。
- 趨勢性預測:Gartner 曾在 2022 年預測,到 2026 年全球超過 80% 的獨立軟體供應商將提供基於用量的定價選項(來源:Gartner, 2022),這一趨勢在 AI 服務中體現得最為徹底。
綜合推斷,當前由 AI API 按量計費直接驅動的年化市場規模已達數十億美元,並隨模型普及持續快速擴大。
玩家對比
以下選取 2024 年最具代表性的 AI API 平台,按公開定價與功能進行對比(價格截至 2024 年 10 月,來源為各平台官網定價頁,僅展示輸入/輸出 1M Token 標準價格,部分模型提供低價小規格或批次折扣):
| 平台/模型 | 輸入 $/1M tokens | 輸出 $/1M tokens | 上下文快取支援 | 批次折扣 | 備註 |
|---|---|---|---|---|---|
| OpenAI GPT-4o (global) | $5.00 | $15.00 | 否(Prompt快取對部分模型開放) | 是(Batch API 半價) | 多模態,低延遲 |
| OpenAI GPT-4o mini | $0.15 | $0.60 | 同上 | 是 | 輕量級高性價比 |
| Anthropic Claude 3.5 Sonnet | $3.00 | $15.00 | 是(Prompt Caching,寫入額外計費) | 否(公開資料未見) | 強調安全與長上下文 |
| Anthropic Claude 3 Haiku | $0.25 | $1.25 | 同上 | 否(公開資料未見) | 速度最快,成本極低 |
| Google Vertex AI Gemini 1.5 Pro | $3.50 | $10.50 | 是(Context Caching,折扣大) | 否(公開資料未見) | 支援超長上下文(2M tokens) |
| Google Vertex AI Gemini 1.5 Flash | $0.075 | $0.30 | 同系列支援 | 否 | 極致低成本 |
| 阿里雲端百鍊 通義千問-Max | 約 ¥20/1M tokens | 約 ¥60/1M tokens (參考近期報價,具體請查官方) | 部分版本支援 | 是(大客戶折扣) | 中文最佳化 |
| 百度千帆 ERNIE 4.0 | 未公開按Token定價,多為資源包/呼叫量結合 | — | 百度側提供快取最佳化 | — | 企業級私有化部署強 |
此外,自託管路線(如使用 Llama 3.1 8B 等開源模型)在 GPU 雲端上按 GPU·時付費,成本視利用率差異極大,但價格透明度不如標準化 API。
風險
- 意外帳單衝擊:高負載下的按量計費可能產生遠超預期的賬單,一次誤操作或流量攻擊就可能導致客戶永久流失,壓制新客戶嘗試意願。
- 價格戰與毛利壓縮:開源模型與雲端廠商間競爭加劇,導致 Token 單價斷崖式下跌,若推論成本最佳化速度跟不上降價幅度,模型廠商可能陷入“量升利減”。
- 計量準確性與糾紛:分詞差異、流式累積誤差、時鐘同步偏差都可能造成計量錯誤,一旦引發批次賠償或法律糾紛,將嚴重損害平台信用。
- 客戶用量不可預測性:若大型客戶轉向自建或更換模型,平台營收可能驟然下跌;高度依賴少數大客戶(特別是追求成本最佳化的大客戶)會帶來集中度風險。
- 現金流量錯配:重資產 GPU 採購(動輒數億美元)依賴按量回款,若 AI 需求波動導致 GPU 閒置率上升,雲端商和 GPU 租賃商將承受嚴重財務壓力。
- 監管與資料語種不公平:按 Token 計費對不同語言(如中文 vs 英文)天然存在成本差異,可能引發地區性公平性質疑;某些監管政策可能要求計費前對內容進行稽核,增加延遲與合規成本。
誤讀糾偏
-
誤讀 1:“用量計費等於完全彈性,一定比包年包月省錢。” 糾偏:對於穩定、可預測的高負載,按量單價往往是預留例項的 2–3 倍。直接全量按量可能讓總成本大幅升高。明智策略為:以預留例項覆蓋基線,以按量承載突發。
-
誤讀 2:“Token 計費客觀反映了實際計算量。” 糾偏:Token 數量與計算量非嚴格線性。冗長的提示工程或冗餘輸出會大幅增加 Token 消耗而智慧價值並未同步提升。而且不同語言的 Token 化效率差異明顯(例如同樣一句話中文 Token 數通常遠少於英文),按 Token 計費會形成隱含的“語言稅率”。
-
誤讀 3:“模型降價後,使用者總成本必然下降。” 糾偏:隨著模型能力提升,應用常傾向於呼叫更強但更貴的模型,或用更復雜的提示鏈,導致 Token 消耗總量增長,抵消單價下降的效果(類似 Jevons 悖論)。實際支出可能不降反升。
-
誤讀 4:“只要有計費系統,任何公司都能輕鬆實現用量計費。” 糾偏:建置支援全球部署、低延遲、高可靠的即時計量管道,並支撐複雜的混合定價、分租戶分專案賬單、預測與預警,技術複雜度遠超普通訂閱系統。許多公司最終選擇採購 Metronome 等專業方案,並非簡單內建。
最新事件
- 2024 年 5 月:OpenAI 釋出 GPT-4o,API 輸入價格 $5/1M tokens,輸出 $15/1M tokens,比 GPT-4 Turbo 降低 50%,並開放多模態輸入(來源:OpenAI Blog, 2024.05.13)。
- 2024 年 6 月:Anthropic 推出 Claude 3.5 Sonnet,定價 $3/$15,效能大幅提升,同時啟動 Prompt Caching 測試,快取內容可節省 90% 的輸入成本(來源:Anthropic Blog)。
- 2024 年 8 月:Google 全面上線 Gemini 1.5 Flash,輸入 $0.075/1M tokens,輸出 $0.30/1M tokens,成為當時主流模型中定價最低檔,並開放 Context Caching 折扣(來源:Google Cloud Blog)。
- 2024 年 9 月:Meta 釋出 Llama 3.2 多模態開源模型,開源社群繼續推低 API 定價基準;多家託管平台迅速提供低至 $0.1/1M tokens 以下的推論服務,進一步壓縮閉源模型溢價空間。
- 2024 年 10 月:據報道,計費基礎設施公司 Metronome 在 2023 年末完成 C 輪融資後,估值突破 15 億美元,客戶已覆蓋 OpenAI、Anthropic 等頭部 AI 公司(來源:TechCrunch, 2024.10)。與此同時,開源計費平台 Lago 獲得廣泛關注,GitHub star 突破 10k,彰顯開發社群對按量計費解決方案的需求。
追蹤指標
持續觀察用量計費賽道的變化,可追蹤以下維度的資料與動態(均不構成投資建議,僅供參考):
- 主要 API 每百萬 Token 標價:關注 OpenAI、Anthropic、Google Vertex AI、Azure OpenAI Service 官方定價頁的月度變化,追蹤價格戰節奏。
- GPU 現貨與按需價格指數:定期檢視 AWS EC2 按需 GPU 例項、Google Cloud 搶佔式例項、CoreWeave 等獨立雲端的價格變化,可反映供需鬆緊。
- 模型廠商揭露的 API 營收:OpenAI 等公司偶爾在媒體或財報中揭露年化營收,可作為按量計費市場體量的風向標。
- 計費平台融資與客戶動態:Metronome、Lago、Orb 的融資輪和公開客戶案例,間接反映用量計費市場的滲透深度與增長通道。
- 模型推論效率指標:各主要模型的首 Token 延遲、每秒生成 Token 數(TPS)等指標,提升程度直接影響計費效率與客戶留存。
- “棄用率”或客戶健康度:部分 SaaS 企業揭露的因成本導致的客戶流失情況,可側面反映按量計費的承受度邊界。
- 版權/合規事件:與 Token 計費結合的語言公平性討論或監管政策變化,會影響廠商價格策略與區域版面配置。
信源
以下列出文中引用的關鍵公開報告和持續更新的資訊源,便於驗證資料口徑。
- OpenAI API Pricing(https://openai.com/api/pricing/),持續更新。
- Anthropic Developer Docs – Pricing(https://docs.anthropic.com/en/docs/intro-to-claude/pricing)。
- Google Cloud Vertex AI Pricing(https://cloud.google.com/vertex-ai/pricing)。
- Bloomberg Intelligence,“Generative AI to Become a $1.3 Trillion Market by 2032”, 2023 年 6 月。
- Grand View Research,“Usage-based Billing Market Size, Share & Trends Analysis Report, 2023–2030”, 2023 年。
- Synergy Research Group, Q1 2024 雲端基礎設施市場份額資料。
- Gartner, “Predicts 2022: Software Pricing and Licensing”, 2022 年。
- The Information 對 OpenAI 營收的報道(2024 年 2 月)。
- TechCrunch, 關於 Metronome 融資與估值報道(2024 年 10 月)。
- Lilian Weng’s Blog – LLM Inference 最佳化技術(https://lilianweng.github.io/)。
- Metronome Blog – Usage-based Billing Architecture(https://metronome.com/blog)。
- a16z 關於 AI 經濟模型的文章(https://a16z.com)。
- 各雲端廠商 GPU 例項價格頁面(AWS、Azure、Google Cloud、阿里雲端等)。