模型層 開放閱讀

每百萬 token 價格

Price per Million Tokens

概念 ID
price-per-million-tokens
更新時間
2026-05-29
來源數量
待補

每百萬 token 價格

3 秒看懂

每百萬 token 價格是大型模型 API 呼叫成本的標準化計量單位。它就像大型模型世界的“電價”——你按消耗的“每 100 萬個分詞單元”付費。幾乎所有模型服務商都會將輸入(你發給模型的提示詞、文件、歷史記錄)與輸出(模型逐字生成的內容)分開計價,輸出價格通常為輸入的 3–10 倍,因為“寫出一個字”所需算力遠超“讀懂一個字”。這一指標直接定義了 AI 應用的經濟可行性,是觀察模型推論降本趨勢的最核心視窗(來源:Artificial Analysis 方法論,2025 年 1 月更新)。

3 分鐘產業解釋

呼叫商業閉源或託管開源大型模型時,賬單不是按“次”或“對話輪數”算,而是按 token 的消耗量。Token 是模型處理文本時的最小語義單元:在英文中,一個 token 大約對應 0.75 個單詞(即 100 個 token ≈ 75 個單詞);在中英文混合場景下,由於中文分詞演算法的差異,一個漢字通常消耗 1.5–2.5 個 token。因此,100 萬個 token 大約相當於:75 萬英文單詞,或約 50 萬–70 萬漢字(來源:OpenAI Tokenizer 文件與 Google AI 官方說明,2024 年版)。

定價模型的三個核心維度

  • 輸入價格:處理提示詞、上傳的 PDF、對話歷史、檢索增強生成(RAG)的上下文片段。此階段主要消耗 GPU 的視訊記憶體頻寬和注意力矩陣的計算資源,且可以高度並行批處理,成本相對低。
  • 輸出價格:模型逐 token 順序生成回覆。每生成一個新 token,都必須完成一次完整的模型前向計算,並受自迴歸解碼機制的序列限制,無法有效並行。這是輸出單價常為輸入 3–5 倍(部分模型差距達 10 倍以上)的技術根源。
  • 批處理與折扣:延遲容忍度決定成本天花板。即時同步呼叫的價格最高(延遲要求 < 200 ms);非同步批處理(Batch API)通常可獲 50% 折扣;預留吞吐量合約(Provisioned Throughput)能進一步壓低單價 20%–30%;長週期(如年度承諾消費)還能疊加折扣(來源:OpenAI、Azure、Anthropic 定價頁細則,截至 2025 年 Q1)。

產業界的核心變化在於,從 2023 年初到 2025 年一季度,同等智慧水平的百萬 token 單價已下降超過 85%–95%。這背後是推論架構最佳化、模型蒸餾、MoE 架構稀疏啟用、以及供應端 20 餘家服務商的激烈價格戰共同作用的結果(來源:SemiAnalysis《The Inference Cost Collapse》,2024 年 12 月)。

技術原理

Token 的生成與計量

語言模型無法直接處理原始字串,必須通過分詞器將文本轉化為詞表中對應的 ID 序列。主流分詞演算法包括位元組對編碼和 SentencePiece。分詞粒度直接決定賬單金額。

原始文本:"每百萬 token 價格的全景分析"
假設分詞器輸出:
["每", "百萬", " token", "價格", "的", "全", "景", "分析"]
共計 8 個 token(實際分詞因模型而異,此處僅作示意)

API 返回的 response 物件中,usage.prompt_tokensusage.completion_tokens 欄位會精確給出本次呼叫消耗的輸入與輸出 token 數,開發者可據此核算成本。需要特別注意的是,部分模型的思考 token(如 o1 系列的內部推論鏈)雖不直接展示給使用者,但仍計入輸出 token 並收費,其消耗量往往是可見輸出 token 的 3–10 倍(來源:OpenAI o1 系統卡與官方文件,2024 年 9 月)。

為什麼輸入和輸出存在巨大價差

大型模型推論分為兩個技術階段,算力效率截然不同。

  • 預填充階段:一次性將整個輸入序列(可能含數千或數十萬 token)送入模型。此階段可充分利用 GPU 的平行計算能力,將數十甚至上百個請求合併成一個大批次處理,前向計算的矩陣乘法效率極高。
  • 自迴歸解碼階段:逐 token 序列生成。每生成一個新 token,都必須重新載入所有歷史 token 的鍵-值快取(KV 快取),並完成一次完整的前向傳播。該階段的算力瓶頸不在浮點運算,而在高頻寬記憶體(HBM)的讀寫頻寬——KV 快取的存取速度決定了生成速率上限。現代高階 GPU(如 H100 SXM)的視訊記憶體頻寬約為 3.35 TB/s,但面對長上下文的大容量 KV 快取時,記憶體牆問題依然突出,這部分硬體成本最終被對映到更高的輸出價格上(來源:《Efficient Memory Management for Large Language Model Serving with PagedAttention》,SOSP 2023;NVIDIA H100 白皮書,2023)。

推論成本的數學分解

一顆 GPU 提供一次推論服務的成本可簡化為:

請求成本 = (模型前向計算量 + KV 快取讀寫量) × GPU 租用單價($/小時)
- 稠密模型每 token 的前向浮點運算次數約為 `2 × 引數量`。一個 700 億引數的稠密模型,每個 token 需要約 1400 億次浮點運算。
- MoE 模型每 token 的前向運算量約為 `2 × (共享引數 + 啟用專家引數)`。若一個 8×7B 的 MoE 模型每次只啟用 2 個專家,其實際啟用引數量為“共享層 + 2×7B”,遠小於等效稠密模型的 47B 全量啟用,這就是 MoE 架構能大幅降低每 token 計算成本的核心技術邏輯(來源:DeepSeek-V2/V3 技術報告,2024;Mistral 8×7B 論文,2023 年 12 月)。

關鍵引數

衡量“每百萬 token 價格”的經濟性,不能孤立看單價,必須結合以下 5 個引數綜合判斷。

1. 單位智慧成本

以公認基準測試(如 MMLU-Pro、HumanEval+、GPQA Diamond)的得分作為模型能力代理變數,計算每獲得 1 個能力分數所需支付的 API 費用。例如,模型 A 的語料理解能力得分 80 分,輸出價格 $2/百萬 token;模型 B 得分 60 分,價格 $1/百萬 token。表面上模型 B 便宜一半,但若前者能一次完成任務而後者需 2–3 次糾錯,模型 A 的有效成本反而更低(來源:Artificial Analysis 的“Quality-Adjusted Price”指標,2025 年 1 月)。

2. 吞吐量

吞吐量以每秒生成 token 數衡量,直接決定使用者體驗和應用的可擴充套件性。高吞吐但價格稍高的模型,可能因使用者流失率低、任務完成速度快而帶來更高的淨收益。2024 年 Q4 資料顯示:閉源高階模型(如 GPT-4o)在即時場景下的中位吞吐量約為 80–120 TPS;經極致最佳化的推論服務商(如 Groq)在 Llama 3.1 70B 上可達 300–500 TPS,且價格僅為閉源模型的 1/5–1/10(來源:Artificial Analysis 即時基準測試平台,2025 年 2 月)。

3. 首 token 延遲

從傳送請求到螢幕上出現第一個生成字元的時間間隔。面向終端使用者的對話產品和語音助手要求 TTFT 低於 300 ms;後臺批處理任務則可容忍數秒或數分鐘的延遲。通常,TTFT 越短,服務溢價越高。

4. 上下文長度天花板與階梯價

多數模型設定了上下文長度上限(如 4K、128K、1M token),超出某個閾值後會觸發更高單價或自動滑動視窗遺忘機制。長上下文的注意力計算複雜度為 O(n²),因此超長上下文的服務成本極高。例如,2025 年 Q1 部分模型對 128K 以上視窗的輸入單價上浮 50%–100%(來源:Google Gemini 1.5 與 OpenAI GPT-4-128K 定價頁,2025 年 2 月適用)。

5. 批處理飽和度

API 的批次大小(同時處理的請求數)越大,單位成本越低,但延遲相應增加。許多推論服務商為能夠排程高批處理利用率的客戶提供長尾折扣,是衡量大客戶實際採購價格的核心變數。

技術路線

目前大型模型推論服務的定價形態,可由三條主要技術路線的競爭來詮釋。

路線一:閉源巨頭的全棧自營生態

代表廠商:OpenAI(Azure)、Google Cloud(Vertex AI)、Anthropic(AWS Bedrock)。

  • 定價特徵:多層梯度定價,按模型代際(如 GPT-4o、GPT-4o-mini)、上下文長度(4K / 128K)、呼叫模式(即時 / 批處理 / 快取命中)給出複雜的價格矩陣。快取命中(將重複提示詞的 KV 快取複用)可給予輸入價格 50%–90% 的折扣,這是其生態粘性的關鍵一招。
  • 成本結構:大規模 GPU 採購(數十萬卡級別)攤薄硬體資本支出,但維持 60%–80% 的推論毛利率以回收模型訓練成本與研發費用(來源:The Information 對 OpenAI 財務資料的報道,2024 年 10 月;Google Cloud Q4 2024 財報分析師會議)。

路線二:獨立推論服務商的極致最佳化

代表廠商:Together AI、Fireworks AI、Groq、DeepInfra。

  • 定價特徵:定價極簡,往往只區分輸入/輸出,部分廠商甚至統一價格。以開源或開放權重模型(Llama、Mistral、DeepSeek)為主打,百萬 token 價格壓至極低(輸出 $0.2–$2)。
  • 成本結構:不負擔模型訓練成本,毛利率極薄(估算 20%–30%),依賴私募資本輸血。護城河在於工程能力——如 Groq 自研的 LPU 晶片去除了傳統 GPU 的通用計算模組,專精線性運算元加速,在特定架構上實現數量級的時延優勢(來源:Groq 官方技術部落格,2024 年;Together AI 融資公告,2024 年 3 月)。

路線三:開源自部署

代表方案:企業基於 vLLM、SGLang、TensorRT-LLM 等開源架構,在自有或租用裸金屬 GPU 上部署模型。

  • 定價特徵:不存在“API 單價”概念,只有硬體租賃/折舊和運維成本。有效推論成本通常為同等能力 API 價格的 20%–40%(取決於 GPU 利用率)。
  • 成本結構:犧牲彈性和免運維體驗,換取資料私有化和長期總成本控制。需要自行承擔 GPU 閒置損失和工程人力成本。公開資料未見全行業自部署平均成本的確切統算,以上為產業調研估計。

上游

每百萬 token 價格的地板由三重上游硬成本決定。

1. 算力晶片

輝達 H100/H200/B200、AMD MI300X 等資料中心 GPU 的購置價格或雲端上租賃價格,是推論成本的絕對硬底。以 2025 年 Q1 北美市場行情為例:一張 80GB H100 SXM 裸金屬伺服器的市場月租金約為 $2.5–$3.8 萬(按 3 年合同折算)(來源:雲端市場經紀商公開報價,如 Vultr、Lambda Labs 掛牌價,2025 年 2 月)。單位 token 成本與 GPU 的視訊記憶體頻寬(HBM 代際)和浮點算力密度呈非線性關係。B200(搭載 HBM3e,192GB)的單卡吞吐量約為 H100 的 2–3 倍,預計量產後可推動百萬 token 物理成本再降 40%–60%(來源:輝達 B200 技術規格書,2024 年 GTC)。

2. 電力與資料中心

GPU 叢集的電力成本佔總擁有成本的 15%–25%。一塊 H100 的熱設計功耗為 700W(SXM 版),全年滿負荷執行的電費約 $600–$900(按工業電價 $0.1/kWh 估算)。冷卻系統是隱形成本大頭:傳統風冷 PUE(電能使用效率)約 1.3–1.5,液冷可將 PUE 壓至 1.05–1.1,顯著降低長週期電費。大規模推論服務商的電力合約價格通常是市價的 50%–70%(來源:Digital Realty、Equinix 等資料中心運營商 Q4 2024 投資者報告)。

3. 模型訓練方的攤銷

基礎模型訓練是一筆前置沉沒成本。模型所有者(如 OpenAI、Meta、DeepSeek)會通過推論 API 營收或在開源許可證上附加商業限制,回收部分訓練投入。當開源模型(如 Llama 3.1 405B)直接開放權重後,推論服務商不再需向模型方支付許可費,訓練攤銷為零,從而能將 API 價格壓至接近硬體成本(來源:Meta 官方部落格,2024 年 7 月)。

下游

AI 應用開發者

這是直接對百萬 token 價格最敏感的人群。token 定價決定了創業公司能否建置可持續的商業模式。以一個消費級 AI 心理陪伴應用為例:若每次對話平均消耗 500 輸入 token + 200 輸出 token,使用某主流模型(輸出 $15/百萬 token),單次對話成本約 $0.0035;若日活使用者每人平均對話 20 輪,擁有 10 萬 DAU 的應用單日推論成本即達 $7,000,年化成本超過 $250 萬。若應用採取廣告或訂閱變現,這一成本結構直接決定其毛利率和盈虧平衡點。因此,大量 C 端輕量應用已轉向使用 Mini/Small 類低價模型,或將流量切至開源推論服務商(來源:公開資料未見全行業平均統計,案例資料來自多家 AI 應用創始人的公開訪談,2024 年)。

企業客戶

大型企業採購大型模型 API 時,百萬 token 價格是內部成本分攤和部門預算核算的基礎。企業通常會與雲端廠商或模型廠商簽訂年框承諾消費協議,實際單價可比官網標價低 30%–60%。金融、法律、醫療等合規要求高的行業,更傾向於為私有部署或專屬例項支付溢價(來源:微軟智慧雲端與 AWS 大型客戶案例研究,2024 年)。

終端使用者

終端消費者不直接面對“每百萬 token”概念,token 價格通過訂閱費(如 ChatGPT Plus $20/月)、按次計費(如 AI 翻譯按字數)或廣告間接收取。但當 token 價格足夠低時,以前因成本問題不可行的應用(如即時 AI 影片解說、全量會議紀要智慧總結)會具備商業可行性,最終推動市場總量放大。

受益公司

1. 低成本模型廠商與推論務提供商

DeepSeek 是 2024–2025 年價格通縮風暴的中心之一。其 V2 模型在 2024 年 5 月釋出時,將百萬 token 輸出價格定為僅 2 元人民幣(當時約 $0.28),僅為 GPT-4o 的約 1/50,觸發全行業跟進降價(來源:DeepSeek 官方定價公告,2024 年 5 月)。獨立推論服務商(如 Groq、Together AI)則通過對開源模型進行極致工程最佳化,以硬體成本加微利的定價策略,快速吸納價格敏感型客戶。

2. 算力硬體與基礎架構層

輝達、AMD、以及 HBM(高頻寬記憶體)製造商(SK 海力士、三星)是 token 降本趨勢中最確定的基本面受益者。推論價格每下降一個數量級,就會催生數倍乃至十倍的 token 消耗總量,即“傑文斯悖論”在 AI 算力市場的重演。輝達 H100/H200/B200 的訂單能見度已延伸至 2025 年下半年(來源:輝達 FY2025 Q4 財報及電話會議,2025 年 2 月)。雲端服務商(AWS、Azure、GCP)同時售賣模型 API 和底層 GPU 例項,無論價格戰如何演進均能獲利。

3. AI 應用層

SaaS 公司、AI Agent 平台、程式碼助手、內容生成工具等是長期受益方。推論成本的持續下探直接擴大其可服務市場並改善毛利率。GitHub Copilot 類程式碼助手,因其每次程式碼生成所需的 token 量大且使用者呼叫頻次高,是推論降本的最大彈性受益者之一。公開資料未見其具體單位推論成本的確切揭露。

市場規模

公開資料未見“全球大型模型 token 消費總量”的權威精確統計。但基於多家研究機構的估算,可勾勒出量級輪廓:

  • 全球 AI 推論晶片市場(含 GPU、TPU、LPU 等):據 SemiAnalysis 估算,2024 年推論晶片市場規模約為 800–1000 億美元(含雲端租賃口徑和自建),預計 2025 年將突破 1400 億美元。這是 token 經濟物理底座的切面資料(來源:SemiAnalysis《AI Data Center TAM Model》,2024 年 11 月)。
  • 模型 API 營收:公開分析估計,OpenAI 在 2024 年的年化 API 營收(含 ChatGPT 訂閱)已超過 20 億美元,Google、Anthropic 緊隨其後(來源:The Information、Bloomberg 引用知情人士的報道,2024 年 9 月–12 月)。這部分營收可直接換算為萬億級別的 token 呼叫量。
  • 企業支出中 token 成本的滲透率:據 Menlo Ventures《2024 年企業 AI 支出報告》,2024 年美國企業用於生成式 AI 的支出中,模型呼叫成本(包括 API 和自託管推論)佔從 2023 年的 30% 降至 2024 年的約 18%,反映出基礎設施(資料管道、RAG 架構、監控)支出佔比上升。這一結構性變化暗示,即便 token 價格大幅下降,企業總體的 AI 預算仍在向更廣泛的生態鏈環節擴散。

玩家對比

下表基於 2025 年 Q1 的公開定價資料與基準評測,對市場主要推論服務的價格與能力進行定性對比。所有價格均為官網即時呼叫模式下的標價,不含批處理或預承諾折扣。

維度OpenAI (GPT-4o)Anthropic (Claude 3.5 Sonnet)Google (Gemini 1.5 Pro)DeepSeek (V3)推論服務商 (Llama 3.1 70B 託管均價)
輸入單價 ($/M tokens)2.503.001.25 (長上下文另計)0.270.35–0.60
輸出單價 ($/M tokens)10.0015.005.00 (長上下文另計)1.101.00–2.00
輸出/輸入價格比4.0x5.0x4.0x4.0x2.5x–3.5x
MMLU-Pro 基準得分~86~85~82~85~80(模型原生分)
單位智慧成本 (得分/輸出$)8.65.716.477.340–80
主要優勢場景最廣泛的工具呼叫與生態長上下文精度、程式碼與Google雲端及 TPU 生態繫結中文、極致價效比極高吞吐、低時延
資料來源年份2025 年 1 月定價頁2025 年 1 月定價頁2025 年 2 月定價頁2024 年 12 月 API 釋出公告Artificial Analysis,2025 年 2 月快照

注:DeepSeek V3 在 MMLU-Pro 的得分 85 來自其技術報告,後續獨立復現結果在 82–85 之間。單位智慧成本僅作簡單除法示意,不構成模型推薦。

風險

1. 價格戰侵蝕行業長期創新獲利

當每百萬 token 的輸出價格壓至接近硬體電費成本時,模型訓練方的鉅額研發和訓練投入將難以通過推論營收回收。這可能迫使資金實力不足的中小模型廠商退出基礎模型競賽,導致行業創新集中在少數幾個資金充沛的巨頭手中,降低長期生態多樣性(來源:公開資料未見確定性結論,此為多家券商 AI 行業分析報告中的共同風險提示,2024 年 Q4)。

2. 硬體供應瓶頸與功耗天花板

推論 token 總量的指數增長,正遭遇資料中心電力供應和高階晶片封裝(CoWoS)產能的雙重物理約束。美國、歐洲一線資料中心的電力接入審批週期長達 18–36 個月,可能導致 2026–2027 年的推論算力增長不及價格下降預期,進而延緩 token 成本進一步下探的速度(來源:McKinsey《Global Data Center Power Outlook》,2024 年 7 月)。

3. 長期合同鎖定與供應商依賴

企業客戶若為追求當前低價,將核心業務深度整合到某單一推論服務商的 API 格式、排程邏輯和提示詞模板中,可能在未來面臨切換成本和供應商議價權上升的風險。歷史資料表明,IaaS 雲端市場的多廠商比價與鎖定的博弈經驗將持續在模型 API 市場重演。

誤讀糾偏

誤讀 1:“每百萬 token 價格越低,模型的總使用成本就越低。” 糾偏:必須結合模型的一次性任務成功率來看。假設一個程式設計任務,模型 A 的價格僅為模型 B 的 1/10,但程式碼首次通過率也僅為 B 的 1/3。那麼為了生成可執行的程式碼,A 需要重試與除錯三輪,消耗的 token 總量和開發者時間成本加起來很可能超過 B 的一次呼叫。行業最佳實踐正從“只看單價”轉向“完成質量調整標準任務的總成本”評估法。

誤讀 2:“輸入 token 便宜,所以可以無限堆文件和上下文。” 糾偏:長上下文不僅線性增加輸入成本(以百萬 token 為單位倍增),更關鍵的是存在“注意力稀釋”效應。實驗表明,當輸入上下文超過 20K–32K token 後,多數模型對長文本中段資訊的回憶精確度會顯著下降(即“迷失在中間”現象),可能導致需要額外的提示工程技術或多次檢索,抵銷了輸入價格低的表面優勢(來源:《Lost in the Middle: How Language Models Use Long Contexts》,ACL 2024)。

誤讀 3:“開源模型比閉源模型便宜得多,所以最終會完全替代閉源。” 糾偏:開源模型的 API 定價確實更低,但需將其與閉源模型部署在同等運維條件下比較。一個 700 億引數的開源模型,在企業自託管時需要佔用約 140GB 視訊記憶體(2 張 H100),其有效推論成本高度依賴於 GPU 利用率。在利用率低於 30% 的低頻場景下,自部署的單位 token 成本可能高於直接呼叫閉源 API。開源與閉源的最終均衡點,取決於企業呼叫頻次與資料敏感性的權衡。

最新事件

1. DeepSeek V3 的“極致低價”衝擊波(2024 年 12 月–2025 年 1 月)

DeepSeek 於 2024 年 12 月底釋出 V3 模型,其 API 價格定為:輸入每百萬 token 0.27 美元,輸出每百萬 token 1.10 美元。這一輸出價格僅為當時 GPT-4o 的約 1/10,且模型能力在多項中文和數學基準測試中與頭部閉源模型看齊。訊息釋出後,中國國內多家雲端廠商在一週內宣佈對旗下主力模型大幅降價或免費開放額度(來源:DeepSeek 官方微信公眾號與 API 文件,2024 年 12 月 26 日;阿里雲端、騰訊雲端官方公告,2025 年 1 月上旬)。此次事件被視為“AI 模型價格通縮”的標誌性加速節點。

2. OpenAI 引入預測輸出與提示緩存摺扣(2024 年 11 月)

OpenAI 為 GPT-4o 系列新增“預測輸出”功能,當模型生成的輸出文本中包含大部分預先傳入的已知內容時,輸出 token 按輸入價格計費,降幅高達 80%。同時,針對超過 1024 token 的重複提示詞自動啟用磁碟快取,快取命中的輸入 token 享受 50% 折扣。這兩個機制為 Agent、文件結構化改寫等常見場景帶來了不成比例的降本效果(來源:OpenAI 官方部落格,2024 年 11 月 15 日)。

3. Google Gemini 針對超長上下文的分層計價落地(2025 年 1 月)

Gemini 1.5 Pro 正式實施詳細的上下文長度梯度定價。當輸入超過 128K token 後,輸入和輸出單價均上浮 50%;超過 512K 後上浮 100%。這為市場中其他服務商的長上下文定價提供了基準模板,標誌著“長上下文免費午餐”時代走向終結(來源:Google AI Studio 定價頁,2025 年 1 月更新)。

追蹤指標

  1. 主流模型輸出價格指數:追蹤 GPT-4o、Claude 3.5 Sonnet、DeepSeek V
source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型