每 token 成本
1. 3 秒看懂
每 Token 成本 (Cost per Token) 是大語言模型生成一個最小編碼單位(token)的綜合費用。它由推論算力消耗、硬體折舊、電力冷卻與模型訓練攤銷四部分構成,直接決定對話應用、程式碼助手、檢索增強生成等產品的毛利率和可持續性。業界通過量化、混合專家(MoE)架構、專用推論晶片和規模效應持續壓低這一成本,推動生成式 AI 從“按次付費實驗”走向“大規模生產部署”,並加速 AI 商業模式從訂閱制向按量計費、獲利共享演變。
2. 3 分鐘產業解釋
每 Token 成本是整個 AI 產業的價值樞紐,類似雲端運算中的“每 vCPU·小時”或晶片製造中的“每平方毫米晶圓成本”。對模型供應商(OpenAI、Anthropic、Google 等),它將萬億級引數的智力勞動轉化為可度量、可交易的基礎商品;對應用開發者,它劃定了客服機器人、程式碼生成、營銷文案等場景的獲利底線;對終端企業,它左右著“自建開源模型”與“呼叫商業 API”的採購決策。
降本動力來自三個核心環節:
- 推論硬體單位時間成本:GPU/TPU/ASIC 的租用、折舊、功耗費用,受半導體制程、高頻寬記憶體(HBM)頻寬和叢集利用率制約。
- 單 Token 所需計算量:由模型架構(引數總量、啟用引數比例、層數與隱藏維度)以及注意力機制的序列長度決定。演算法創新(稀疏注意力、高效解碼)可大幅壓縮該值。
- 訓練成本的合理攤銷:一次千億引數模型的預訓練可能花費數千萬至數億美元(如 Meta 揭露 Llama 3 405B 訓練硬體投入逾 5000 萬美元)。若模型在生命週期內服務數萬億 token,則每 token 訓練攤銷低於 0.01 美分;反之,使用者不足則成本陡增,迫使廠商追求超高併發或轉向開源社群分擔。
從實際定價曲線觀察,GPT‑3 級別模型 2021 年每百萬 token 價格約 20–60 美元,到 2024 年已降至 0.5–2 美元(OpenAI 官方定價);2025 年初部分開源或小型模型(如 DeepSeek‑V2、Llama 3 8B 託管服務)已下探至 0.05–0.10 美元/百萬 token(資料來源:各廠商官方定價頁面及公開部落格,2025 年 4 月整理)。年化降幅超過 70% 的價格壓縮,正在將 AI 推論從“高階定製”推向“全民化基礎設施”,同時重塑上游晶片、資料中心和能源市場的投資邏輯。
3. 技術原理
每 Token 成本的形成需從半導體的浮點運算和視訊記憶體頻寬微觀層面理解,而不僅僅看 API 賬單。
Token 的定義與計算負載
一個 token 可視為經過嵌入的數值向量所表達的最小語義單元(約合 0.75 個英文單詞或 1.5 箇中文字元)。大型模型推論的本質是對輸入 token 序列執行層疊的矩陣乘法和自注意力運算,逐個 token 輸出機率分佈。以主流稠密 Transformer 為例,生成單個 token 的近似浮點運算元(FLOPs)可表示為:
FLOPs_per_token ≈ 2 × N + 4 × n_layer × n_ctx × d_model
其中 N 為模型引數總量,第二項為注意力機制開銷(n_ctx 為上下文長度,d_model 為模型維度)。對於 MoE(混合專家) 架構,實際計算量應替換為每次路由啟用的引數量與共享層引數之和,從而使得每 Token 計算量較同等總引數量稠密模型降低 4–10 倍。
從 FLOPs 到時間與成本
若推論硬體的有效算力利用率(MFU) 為 U(通常 30%–50%,受視訊記憶體頻寬和計算圖最佳化程度影響),標稱峰值算力為 P (FLOPS),則處理單個 token 的最小耗時 t ≈ FLOPs_per_token / (P × U)。裸硬體成本近似為:
Cost_per_token ≈ C_hourly × t = C_hourly / (P × U / FLOPs_per_token)
其中 C_hourly 為硬體單位時間總擁有成本(含折舊、電力、空間)。引入批處理(batch size B)後,吞吐量 = B / t,實際每 token 成本可分攤至 C_hourly / throughput。但大 batch 會加劇 KV 快取對視訊記憶體的佔用,迫使系統在計算效率與記憶體頻寬之間權衡。此時成本瓶頸可能從計算轉向資料搬運,即 “記憶體牆”。
量化技術(FP8、INT8、INT4)通過減少模型權重和啟用的位寬,直接降低資料搬運量和乘法器壓力,可在同等硬體上將每秒生成 token 數提升 2–4 倍,等效壓縮每 Token 硬體佔用時間,成為成本最佳化的第一性原理。同時,投機解碼(結合小型草稿模型)可進一步減少大型模型的呼叫次數(2–3 倍加速),在不損失精度的前提下降低昂貴計算量。
下圖呈現推論管線的關鍵瓶頸:
┌───────────────┐
│ 模型權重 (FLOPs 主要消耗) │
└───────┬───────┘
│ 矩陣乘/注意力
┌──────────┐ ▼ ┌──────────┐
│ 輸入 Tokens │──►前向計算(層疊)──►│ 輸出 Token │
└──────────┘ │ └──────────┘
│ 中間啟用 + KV Cache
┌───────▼────────┐
│ HBM/視訊記憶體 (頻寬限速) │
└────────────────┘
4. 關鍵引數
衡量每 Token 成本需追蹤以下引數體系:
- 每百萬 token 價格($/M tokens):輸入與輸出價格分開統計,輸出通常貴 2–5 倍(因需要順序生成且易受記憶體牆限制)。該引數是市場定價的直接反映。
- 每 token 延遲(ms/token):影響使用者體驗的行為經濟學指標,低延遲通常要求更高效能的硬體,從而推高成本;部分場景(如離線批處理)可放寬延遲以換取更低單價。
- 吞吐密度(tokens/秒/卡):衡量單張 GPU/TPU 的產出效率,反映軟硬體協同最佳化水平。高吞吐意味著固定成本被更高商品量攤薄。
- 模型效率比(FLOPs/token):理論計算量,指導硬體選型,並用於對比不同架構固有的單位成本優勢。
- 能量強度(tokens/kWh):關聯電力成本和碳排放,在大規模部署中影響總運營費用。先進推論晶片可在相同能耗下輸出數倍 token。
- 邊際成本 vs. 全分攤成本:邊際成本僅為單 token 的增量電力+計算損耗,可能低至全分攤成本的 30%;全分攤成本需包括研發攤銷、網路、閒置率和軟體許可。
- 推論 TCO(總擁有成本)溢價幅度:第三方研究機構 SemiAnalysis 在 2024 年多篇分析中指出,頭部 API 提供商的推論 TCO 僅為公開定價的 40%–60%,溢價部分為毛利與研發回收;開源自行部署可將溢價降至零,但需承擔運維與工程人力成本(來源:SemiAnalysis 2024 年公開文章)。
5. 技術路線
演進脈絡
- 2020–2022 年:GPT‑3 引爆“token 經濟”。175B 引數稠密推論需多卡聯動,單 token 成本約 0.0001 美元量級,倒逼 FasterTransformer、分片推論等系統最佳化。
- 2022–2023 年:量化與高效推論引擎。社群圍繞 Llama、OPT 等驗證了 INT8/INT4 量化可將成本壓降 60%–80%;vLLM 等架構通過 PagedAttention 將吞吐提升 3–5 倍;MoE 模型(如 Mixtral 8×7B)展示在保持效能下,啟用引數降低 4–5 倍,單位成本斷崖式下降。
- 2024 年至今:專用晶片與端側下沉。雲端廠商推出自研推論晶片(Google TPU v5p、Amazon Trainium/Inferentia2、微軟 Maia),通過片上網路和低精度計算,將每 token 功耗降至通用 GPU 的 1/3–1/5。Apple、高通等端側晶片執行 1–3B 壓縮模型,實現零邊際成本推論,每 token 成本僅對應電池消耗的微小分值,已有部分消費級裝置支援離線大語言模型互動。
主流技術路線對比
| 技術路線 | 每 Token 計算量削減程度 | 硬體利用率影響 | 適用場景 | 每 Token 成本降低潛力 | 技術風險與侷限 |
|---|---|---|---|---|---|
| 稠密超大型模型 (70B–405B) | 基準 | 需高頻寬叢集 | 最高智慧需求 | 基線 | 推論昂貴,不適合突發流量 |
| MoE 稀疏化 | 降低 2–10 倍(啟用引數量) | 引入專家路由通訊開銷 | 雲端推論、多租戶 | 顯著(可降至稠密模型的 1/5 以下) | 負載不均、專家過擬合、通訊延遲 |
| INT8/FP8 量化 | 計算量減半,頻寬壓力下降 | 吞吐提升 2–3 倍 | 幾乎所有場景 | 中等(30%–60% 降幅) | 需校準,極個別任務有精度損失 |
| INT4 量化 | 頻寬壓力降至 1/4,計算密集度下降 | 進一步提升吞吐 | 邊緣、低成本 API | 高(60%–80% 降幅) | 精度下降明顯,需模型特化訓練支撐 |
| 專用推論晶片 | 架構級最佳化(如脈動陣列、存內計算) | 專用設計使利用率達 60%+ | 超大規模生產環境 | 極高(5–10 倍) | 軟體棧成熟度不足,遷移成本高 |
| 投機解碼/預測加速 | 降低大型模型呼叫次數 2–3 倍 | 無明顯額外開銷 | 延遲敏感線上服務 | 中等(2–3 倍有效加速) | 需訓練或維護對齊小模型,增加系統複雜度 |
注:降幅倍數為公開技術報告和第三方評測的綜合定性區間,不指向單一產品精準值。
6. 上游
上游由算力矽基與能源基礎設施組成,其產能、價格和技術迭代框定了每 Token 成本的硬下限。
- AI 晶片:NVIDIA 主導資料中心推論,Hopper 架構(H100/H200)憑藉高 HBM 頻寬和 Tensor Core 佔領約 80%+ 市場份額(據 Mercury Research 及多家券商估算,2024 年)。AMD MI300X 以更高視訊記憶體容量和價效比爭奪份額。定製 ASIC 崛起:Google 的 TPU v5p、Amazon 的 Trainium2、微軟的 Maia 100 均採用台積電先進製程與 CoWoS 封裝,削減成本。博通、Marvell 作為 ASIC 設計服務商,承接超大規模客戶自研晶片需求。
- 儲存與封裝:HBM(高頻寬記憶體)由 SK 海力士、三星、美光供應,其位寬和容量直接決定 KV 快取擴充套件的上限。台積電 CoWoS 封裝產能長期緊缺,2024 年該公司法說會透露年產能約 30 萬片,並計劃 2025 年擴至 50 萬片以上,直接影響 AI 晶片交付週期和成本(來源:台積電 2024Q2 法說會公開陳述)。此外,傳輸中介層的良率和基板供應是短期瓶頸。
- 電力與散熱:單張 H100 熱設計功耗達 700W,推論叢集的總功耗動輒兆瓦級。資料中心 PUE(電能利用效率)、當地電價和冷卻方案(氣冷→液冷→浸沒式)成為成本模型的隱性核心。根據 Uptime Institute 2024 年報告,超大規模資料中心的 PUE 已普遍低於 1.2,但電力成本地域差異巨大,驅動企業將推論負載向電力廉價地區(如北歐、中東)遷移。
7. 下游
下游應用方對每 Token 成本的敏感度與消耗量成正比,許多商業模式僅在成本低於某個閾值時才成立。
- 獨立軟體開發商(ISV)與 SaaS:如 Jasper、Copy.ai 等早期基於 GPT‑3 的文案工具,在 API 降價後毛利改善顯著。程式碼助手(GitHub Copilot、Cursor)因互動頻繁且上下文較長,token 消耗大,是降本主要受益者。
- 企業內部服務:客服對話、合同審查、知識庫問答(RAG)等場景,日均 token 可達千萬級。許多大型製造、金融企業正從呼叫高價商業 API,轉向微調並自託管 7B–13B 開源模型,以將每百萬 token 成本壓至 0.05 美元以下。以沃爾瑪、豐田等公開揭露的試點專案為例,自託管後推論單價可降 70% 以上(來源:公司技術部落格及行業會議分享,2024 年)。
- 終端消費與端側:Apple Intelligence、三星 Galaxy AI 部分任務在裝置端執行小型模型,邊際成本近乎為零,但受限於模型能力。雲端邊協同成為趨勢,簡單意圖端側完成,複雜查詢回傳雲端端,最佳化整體 token 消耗組合。
8. 受益公司
以下公司因每 Token 成本下行的產業鏈邏輯而在營收、市場份額或戰略版面配置上獲益,不構成任何投資建議。
- 模型廠商:OpenAI、Anthropic 通過壓低模型推論成本(如 GPT‑4o mini、Claude 系列降價)擴大 API 呼叫量,以量補價,並利用高效能模型收取溢價。Google 依託 TPU 內供將 Gemini 成本壓至競品之下,換取雲端市場份額。Meta 通過開源 Llama 系列,雖不直接銷售 token,卻借社群最佳化攤薄自身研發成本,同時削弱競品的 API 定價權。
- AI 晶片商:NVIDIA 在推論最佳化(TensorRT‑LLM)和下一代架構(Blackwell)持續提升每瓦 token 產出,穩定高附加值晶片需求。AMD MI300 系列以競爭性定價吸引微軟、Oracle 等雲端客戶,擴大推論市場存在。博通、Marvell 等定製 ASIC 服務商從超大規模客戶的專用晶片浪潮中受益。
- 雲端服務商:AWS(Inferentia/Trainium)、微軟 Azure(Maia)、Google Cloud(TPU)通過自研或定製晶片提供低價推論例項,吸引高消耗負載,帶動周邊儲存、資料、安全等服務捆綁營收。
- 推論最佳化工具與開源平台:vLLM、Together AI、Fireworks 等以極致的模型服務最佳化,使使用者能用更少 GPU 支撐同等吞吐,從而獲得定價優勢和開發者黏性。Neural Magic 等公司推出專用稀疏推論引擎,進一步壓縮通用 CPU 推論成本,為邊緣部署提供新選擇。
9. 市場規模
全球生成式 AI 推論產生的 token 消耗總量尚無統一權威統計,但可從交叉指標側面度量。
- API 營收指向:根據公開財報及相關分析,微軟 Azure AI 服務季度營收(截至 CY2024Q4)中相當比重源自 API 推論,其 run rate 已突破 60 億美元/年(微軟 FY25Q2 財報音訊評論)。OpenAI 年度經常性營收在 2024 年末達到約 40 億美元(The Information 等媒體報道)。綜合估算,全球商業 API 推論市場在 2024 年規模約 100–150 億美元,且年增速超過 100%。
- 推論硬體市場:據 Mercury Research 及券商報告,2024 年資料中心 AI 推論加速器(GPU+ASIC)出貨額約 400 億美元,其中推論負載佔比持續提升。SemiAnalysis 預測到 2027 年,推論將成為 AI 計算需求的最大細分,佔總算力的 60% 以上(來源:SemiAnalysis 2024 年度報告)。
- Token 消耗量:公開資料未見精確總量,但可以從頭部應用的流量推算。Character.AI 在 2024 年已實現日均數十億 token 的處理量;GitHub Copilot 日生成 token 量亦在 10 億級。業界估算 2024 年全球生成式 AI 日均 token 消耗已跨越 10 萬億 token 大關,且每 6 個月翻一番(綜合多家 VC 投資人公開演講資料,2024 年)。
長期看,單位成本每下降 10 倍,催生約 100 倍的需求增長(傑文斯悖論式效應),因此每 Token 成本下降本身會放大 token 經濟總規模,形成正向飛輪。
10. 玩家對比
不同模型供應商在成本結構、定價策略和技術最佳化深度上差異顯著,直接影響其生態位。
| 廠商/模型 | 典型模型 | 輸入價格 ($/M tokens) | 輸出價格 ($/M tokens) | 成本優勢來源 | 備註 |
|---|---|---|---|---|---|
| OpenAI | GPT‑4o | 5.00 | 15.00 | 自研推論棧、MoE 架構(推測)、批次折扣 | 價格包含高獲利,2025 年初發布 mini 版降至 0.15/0.60 |
| Anthropic | Claude 3.5 Sonnet | 3.00 | 15.00 | 自研推論最佳化,側重安全對齊,MoE 疑似 | 價格略低於 GPT‑4o 輸入,輸出持平 |
| Gemini 1.5 Pro | 3.50 | 10.50 | TPU v5p 內供,MoE 架構,內部資源排程 | 利用 YouTube 等自有資料提升模型效率 | |
| Mistral AI | Mistral Large | 4.00 | 16.00 | MoE,歐洲最佳化,追求少樣本推論效率 | 開源部分模型,兼顧第三方託管 |
| DeepSeek | DeepSeek‑V2 | 0.27 | 1.10 | 極深 MoE 與多頭潛在注意力(MLA),極低啟用引數 | 2024 年 5 月釋出後引發價格戰,展示極低成本路線 |
| Meta (Llama) | Llama 3 70B (社群託管) | 約 0.10–0.30 | 約 0.20–0.60 | 開源最佳化(vLLM、TensorRT),零許可費 | 部署成本由第三方承擔,靈活性極高 |
定價資料取自各廠商官網 2025 年 4 月快照,部分模型價格含 Fine‑tuned 收費,實際以官網為準。
運營層面的成本對比更凸顯差距:據 SemiAnalysis 2024 年對特定開源模型推論 TCO 的拆解,使用 H100 叢集執行 Llama 3 70B 量化版本,在較高利用率下,供應商真實推論 TCO 可低至 0.05 美元/百萬 token 以下;而商業 API 價格通常為該值的 10–60 倍,差價用於覆蓋研發、風險準備金和獲客成本。擁有自研晶片或極低電力成本(如Google、微軟部分割槽域)的廠商,其 TCO 優勢將進一步拉大。
11. 風險
- 價格戰與獲利侵蝕:開源模型與激進定價(如 DeepSeek)迫使商業 API 持續降價,可能導致行業毛利空間收窄,部分中小模型廠商出清。
- 技術瓶頸與量化損失:過度壓縮可能在某些嚴謹場景(法律、醫學)引發語義丟失,限制降本邊界;MoE 的負載均衡和通訊開銷若不能妥善解決,單位成本改善可能不及預期。
- 能源與供應鏈約束:全球資料中心電力需求激增,部分地區電網瓶頸和 HBM 產能不足或階段性推高硬體成本,使成本下降曲線暫時放緩。
- 監管與合規成本:AI 內容標識、資料隱私法(如 EU AI Act)可能增加額外的審查和處理環節,提升每 token 的合規開銷。
- 過度依賴少數供應商:NVIDIA 的統治地位和台積電先進封裝產能集中,使成本受制於單一環節的供應波動或定價權。
- 使用者黏性陷阱:應用在極低成本下可能產生大量低價值呼叫,導致營收無法覆蓋基礎設施擴充套件,出現“量增利不增”的困局。
12. 誤讀糾偏
-
誤讀 1:“API 報價等於每 token 成本”
糾正:API 報價包含毛利、研發攤銷、獲客成本和競爭溢價;供應商內部 TCO 往往遠低於此。企業自行部署開源模型時,成本僅含硬體折舊、電力和運維,與託管價可差數十倍。分析師需拆解“開價”與“TCO”,並區分邊際與全分攤成本。 -
誤讀 2:“模型越大,每 token 成本就越高”
糾正:MoE 架構下,雖然總引數可達數千億,但每個 token 僅啟用一小部分引數,實際計算量可能低於同性能稠密模型的 1/5。同時,大型模型對量化和壓縮的容忍度更高,可通過極低位寬部署進一步降低成本。評價成本必須關注啟用計算量和記憶體頻寬需求,而非總引數量。 -
誤讀 3:“量化一定會嚴重損傷智慧”
糾正:GPTQ、AWQ 等訓練後量化配合校準資料集,可使 INT4 模型在 90% 以上的自然語言任務上精度損失小於 1%。MoE 和大規模模型對此尤為魯棒,量化已成為行業降本的標準操作。但未經校準的粗暴量化確實存在風險,需驗證。 -
誤讀 4:“降本只靠硬體進步”
糾正:演算法創新(FlashAttention、vLLM 的 PagedAttention、投機解碼)帶來的效率提升經常超過單代硬體迭代。同等硬體上,最新的推論架構比 2022 年的 naive 部署可提升 5–10 倍吞吐,演算法是成本下降的“隱形槓桿”。 -
誤讀 5:“每 token 價格越低越好,使用者永遠受益”
糾正:極端低價可能導致服務質量滑坡(如降低精度、縮短上下文、增加延遲),或引發供應商降低安全與內容稽核投入,形成隱性成本。健康市場應在合理成本下維持可持續生態。
13. 最新事件
- 2024 年 5 月 DeepSeek‑V2 開源釋出:該模型採用 MLA(多頭潛在注意力)與極致 MoE,宣稱推論成本僅為每百萬 token 0.001 美元(輸入),引發中國及全球 API 價格戰。此後字節跳動、阿里雲端、百度等中國廠商紛紛大幅下調模型 API 價格,部分降至免費或接近免費。
- OpenAI 推出 GPT‑4o mini(2024 年 7 月):將高效能模型的價格壓至每百萬 token 0.15 美元(輸入)和 0.60 美元(輸出),同時推出批處理 API 給予 50% 折扣,顯著降低開發者成本,並支援多模態。
- Google Gemini 1.5 Flash 釋出(2024 年 5 月):專為低成本推論設計,每百萬 token 輸入價格僅 0.075 美元,輸出 0.30 美元,通過蒸餾和輕量架構提供接近更大型模型的效能,服務於大規模低延遲任務。
- Meta Llama 3 開源(2024 年 4–7 月):從 8B 到 405B 的多尺寸模型開源,加上社群量化及最佳化,使企業自託管推論成本降至每百萬 token 0.02–0.10 美元區間,成為閉源 API 的強大替代。
- AMD MI300X 推論效能凸顯:2024 年 Q3 多家雲端商及獨立評測顯示 MI300X 在執行 Llama 等模型時,得益於更高視訊記憶體頻寬,每 token 成本較 H100 在某些 batch size 下可低 20%–30%,打破 NVIDIA 獨大局面。
- Apple全裝置端模型:2024 年 WWDC 宣佈 Apple Intelligence,使用約 3B 引數的裝置端基礎模型,完全本地推論,將消費級 AI 成本推向零邊際,引發對雲端推論需求結構的長遠重估。
- NVIDIA 釋出 Blackwell GPU(2024 年 GTC):針對推論專門強化第二代 Transformer 引擎,支援 FP4 精度,宣稱可將大型模型推論吞吐提升至 Hopper 的 2–4 倍,進一步壓低每 token 硬體成本,預計 2025 年規模出貨。
14. 追蹤指標
持續追蹤每 Token 成本演變,建議監測以下高頻資料與領先指標:
- 主要 API 定價變化:OpenAI、Anthropic、Google、Microsoft、Mistral、DeepSeek 等官網定價頁的每月或每季快照,特別關注廉價版(Flash、Mini)與旗艦版價差。
- MLPerf Inference 基準結果:每輪成績釋出中單卡 token 生成吞吐(tokens/s)、延遲和能耗,反映硬體與推論架構的實際進步。
- AI 晶片均價(ASP)與 HBM 合約價:通過金融分析師報告,監測 H100/H200/Blackwell 等卡的市場租金(如 $/GPU·小時)和 HBM 供應價,這些決定硬體成本基線。
- 雲端廠商 AI 營收與毛利率:微軟 Azure AI、Google雲端 AI、AWS 的機器學習和推論營收的季度增長,以及管理層對推論成本下降幅度的評論(如“我們降低推論成本 x%,實現用量的 x 倍增長”)。
- 資料中心電力 PPA 價格與液冷滲透率:電力成本在北美、歐洲等地的遠期協議價格,以及液冷伺服器出貨佔比,可預測運營費用走向。
- 開源推論架構吞吐量里程碑:vLLM、TensorRT‑LLM、DeepSpeed-MII 等社群釋出的最新最佳化效能資料,如“單 H100 執行 Llama 3 8B 達 xxx tokens/s”,直接體現演算法降本速率。
- 上市公司相關資本支出展望:Meta、微軟、Google、Amazon 的 AI 基礎設施 capex 計劃以及自研晶片的部署比例,預示中長期供給能力。
15. 信源
- 廠商官方資訊:OpenAI API 定價與部落格,Anthropic 官方定價頁與模型報告,Google Cloud Vertex AI 定價,Microsoft Azure OpenAI 服務定價,Meta AI 公開部落格與模型卡,Mistral AI 官方網站,DeepSeek 公開技術報告。
- 第三方產業分析:SemiAnalysis 推論 TCO 拆解報告及週報,ARK Invest 年度 Big Ideas 中 AI 成本曲線專題,a16z 基礎設施報告相關章節,McKinsey QuantumBlack 關於生成式 AI 成本的經濟性分析。
- 技術論文與架構文件:FlashAttention 系列論文,vLLM PagedAttention 論文,GQA/MQA 注意力最佳化論文,GPTQ/AWQ 量化論文,NVIDIA TensorRT‑LLM 白皮書,MLPerf Inference 基準規則。
- 財務與市場資料:超大規模雲端商(微軟、Google、亞馬遜)季度財報與電話會轉錄,台積電季度法說會,SK 海力士、三星記憶體業務新聞稿,Mercury Research GPU 市場份額報告。
- 行業會議公開資料:GTC、Hot Chips、NeurIPS 效率專題、AI Hardware Summit 中關於推論成本突破的演講與演示公開幻燈片。
一句話總結
每 Token 成本是 AI 智力供給的原子價格,其下降斜率決定了生成式 AI 是持續燒錢的實驗品還是普惠全社會的基礎設施,而演算法、晶片與能源三軸聯動正在將這一價格推向極限。