晶片層 開放閱讀

每 token 成本

Cost per Token

概念 ID
cost-per-token
更新時間
2026-05-29
來源數量
待補

每 token 成本

1. 3 秒看懂

每 Token 成本 (Cost per Token) 是大語言模型生成一個最小編碼單位(token)的綜合費用。它由推論算力消耗硬體折舊電力冷卻模型訓練攤銷四部分構成,直接決定對話應用、程式碼助手、檢索增強生成等產品的毛利率和可持續性。業界通過量化、混合專家(MoE)架構、專用推論晶片和規模效應持續壓低這一成本,推動生成式 AI 從“按次付費實驗”走向“大規模生產部署”,並加速 AI 商業模式從訂閱制向按量計費、獲利共享演變。

2. 3 分鐘產業解釋

每 Token 成本是整個 AI 產業的價值樞紐,類似雲端運算中的“每 vCPU·小時”或晶片製造中的“每平方毫米晶圓成本”。對模型供應商(OpenAI、Anthropic、Google 等),它將萬億級引數的智力勞動轉化為可度量、可交易的基礎商品;對應用開發者,它劃定了客服機器人、程式碼生成、營銷文案等場景的獲利底線;對終端企業,它左右著“自建開源模型”與“呼叫商業 API”的採購決策。

降本動力來自三個核心環節:

  • 推論硬體單位時間成本:GPU/TPU/ASIC 的租用、折舊、功耗費用,受半導體制程、高頻寬記憶體(HBM)頻寬和叢集利用率制約。
  • 單 Token 所需計算量:由模型架構(引數總量、啟用引數比例、層數與隱藏維度)以及注意力機制的序列長度決定。演算法創新(稀疏注意力、高效解碼)可大幅壓縮該值。
  • 訓練成本的合理攤銷:一次千億引數模型的預訓練可能花費數千萬至數億美元(如 Meta 揭露 Llama 3 405B 訓練硬體投入逾 5000 萬美元)。若模型在生命週期內服務數萬億 token,則每 token 訓練攤銷低於 0.01 美分;反之,使用者不足則成本陡增,迫使廠商追求超高併發或轉向開源社群分擔。

從實際定價曲線觀察,GPT‑3 級別模型 2021 年每百萬 token 價格約 20–60 美元,到 2024 年已降至 0.5–2 美元(OpenAI 官方定價);2025 年初部分開源或小型模型(如 DeepSeek‑V2、Llama 3 8B 託管服務)已下探至 0.05–0.10 美元/百萬 token(資料來源:各廠商官方定價頁面及公開部落格,2025 年 4 月整理)。年化降幅超過 70% 的價格壓縮,正在將 AI 推論從“高階定製”推向“全民化基礎設施”,同時重塑上游晶片、資料中心和能源市場的投資邏輯。

3. 技術原理

每 Token 成本的形成需從半導體的浮點運算和視訊記憶體頻寬微觀層面理解,而不僅僅看 API 賬單。

Token 的定義與計算負載
一個 token 可視為經過嵌入的數值向量所表達的最小語義單元(約合 0.75 個英文單詞或 1.5 箇中文字元)。大型模型推論的本質是對輸入 token 序列執行層疊的矩陣乘法和自注意力運算,逐個 token 輸出機率分佈。以主流稠密 Transformer 為例,生成單個 token 的近似浮點運算元(FLOPs)可表示為:

FLOPs_per_token ≈ 2 × N + 4 × n_layer × n_ctx × d_model

其中 N 為模型引數總量,第二項為注意力機制開銷(n_ctx 為上下文長度,d_model 為模型維度)。對於 MoE(混合專家) 架構,實際計算量應替換為每次路由啟用的引數量與共享層引數之和,從而使得每 Token 計算量較同等總引數量稠密模型降低 4–10 倍。

從 FLOPs 到時間與成本
若推論硬體的有效算力利用率(MFU) 為 U(通常 30%–50%,受視訊記憶體頻寬和計算圖最佳化程度影響),標稱峰值算力為 P (FLOPS),則處理單個 token 的最小耗時 t ≈ FLOPs_per_token / (P × U)。裸硬體成本近似為:

Cost_per_token ≈ C_hourly × t = C_hourly / (P × U / FLOPs_per_token)

其中 C_hourly 為硬體單位時間總擁有成本(含折舊、電力、空間)。引入批處理(batch size B)後,吞吐量 = B / t,實際每 token 成本可分攤至 C_hourly / throughput。但大 batch 會加劇 KV 快取對視訊記憶體的佔用,迫使系統在計算效率與記憶體頻寬之間權衡。此時成本瓶頸可能從計算轉向資料搬運,即 “記憶體牆”

量化技術(FP8、INT8、INT4)通過減少模型權重和啟用的位寬,直接降低資料搬運量和乘法器壓力,可在同等硬體上將每秒生成 token 數提升 2–4 倍,等效壓縮每 Token 硬體佔用時間,成為成本最佳化的第一性原理。同時,投機解碼(結合小型草稿模型)可進一步減少大型模型的呼叫次數(2–3 倍加速),在不損失精度的前提下降低昂貴計算量。

下圖呈現推論管線的關鍵瓶頸:

           ┌───────────────┐
           │  模型權重 (FLOPs 主要消耗)  │
           └───────┬───────┘
                   │ 矩陣乘/注意力
 ┌──────────┐      ▼      ┌──────────┐
 │ 輸入 Tokens │──►前向計算(層疊)──►│ 輸出 Token │
 └──────────┘      │      └──────────┘
                   │ 中間啟用 + KV Cache
           ┌───────▼────────┐
           │  HBM/視訊記憶體 (頻寬限速)  │
           └────────────────┘

4. 關鍵引數

衡量每 Token 成本需追蹤以下引數體系:

  • 每百萬 token 價格($/M tokens):輸入與輸出價格分開統計,輸出通常貴 2–5 倍(因需要順序生成且易受記憶體牆限制)。該引數是市場定價的直接反映。
  • 每 token 延遲(ms/token):影響使用者體驗的行為經濟學指標,低延遲通常要求更高效能的硬體,從而推高成本;部分場景(如離線批處理)可放寬延遲以換取更低單價。
  • 吞吐密度(tokens/秒/卡):衡量單張 GPU/TPU 的產出效率,反映軟硬體協同最佳化水平。高吞吐意味著固定成本被更高商品量攤薄。
  • 模型效率比(FLOPs/token):理論計算量,指導硬體選型,並用於對比不同架構固有的單位成本優勢。
  • 能量強度(tokens/kWh):關聯電力成本和碳排放,在大規模部署中影響總運營費用。先進推論晶片可在相同能耗下輸出數倍 token。
  • 邊際成本 vs. 全分攤成本:邊際成本僅為單 token 的增量電力+計算損耗,可能低至全分攤成本的 30%;全分攤成本需包括研發攤銷、網路、閒置率和軟體許可。
  • 推論 TCO(總擁有成本)溢價幅度:第三方研究機構 SemiAnalysis 在 2024 年多篇分析中指出,頭部 API 提供商的推論 TCO 僅為公開定價的 40%–60%,溢價部分為毛利與研發回收;開源自行部署可將溢價降至零,但需承擔運維與工程人力成本(來源:SemiAnalysis 2024 年公開文章)。

5. 技術路線

演進脈絡

  • 2020–2022 年:GPT‑3 引爆“token 經濟”。175B 引數稠密推論需多卡聯動,單 token 成本約 0.0001 美元量級,倒逼 FasterTransformer、分片推論等系統最佳化。
  • 2022–2023 年:量化與高效推論引擎。社群圍繞 Llama、OPT 等驗證了 INT8/INT4 量化可將成本壓降 60%–80%;vLLM 等架構通過 PagedAttention 將吞吐提升 3–5 倍;MoE 模型(如 Mixtral 8×7B)展示在保持效能下,啟用引數降低 4–5 倍,單位成本斷崖式下降。
  • 2024 年至今:專用晶片與端側下沉。雲端廠商推出自研推論晶片(Google TPU v5p、Amazon Trainium/Inferentia2、微軟 Maia),通過片上網路和低精度計算,將每 token 功耗降至通用 GPU 的 1/3–1/5。Apple、高通等端側晶片執行 1–3B 壓縮模型,實現零邊際成本推論,每 token 成本僅對應電池消耗的微小分值,已有部分消費級裝置支援離線大語言模型互動。

主流技術路線對比

技術路線每 Token 計算量削減程度硬體利用率影響適用場景每 Token 成本降低潛力技術風險與侷限
稠密超大型模型 (70B–405B)基準需高頻寬叢集最高智慧需求基線推論昂貴,不適合突發流量
MoE 稀疏化降低 2–10 倍(啟用引數量)引入專家路由通訊開銷雲端推論、多租戶顯著(可降至稠密模型的 1/5 以下)負載不均、專家過擬合、通訊延遲
INT8/FP8 量化計算量減半,頻寬壓力下降吞吐提升 2–3 倍幾乎所有場景中等(30%–60% 降幅)需校準,極個別任務有精度損失
INT4 量化頻寬壓力降至 1/4,計算密集度下降進一步提升吞吐邊緣、低成本 API高(60%–80% 降幅)精度下降明顯,需模型特化訓練支撐
專用推論晶片架構級最佳化(如脈動陣列、存內計算)專用設計使利用率達 60%+超大規模生產環境極高(5–10 倍)軟體棧成熟度不足,遷移成本高
投機解碼/預測加速降低大型模型呼叫次數 2–3 倍無明顯額外開銷延遲敏感線上服務中等(2–3 倍有效加速)需訓練或維護對齊小模型,增加系統複雜度

注:降幅倍數為公開技術報告和第三方評測的綜合定性區間,不指向單一產品精準值。

6. 上游

上游由算力矽基與能源基礎設施組成,其產能、價格和技術迭代框定了每 Token 成本的硬下限。

  • AI 晶片:NVIDIA 主導資料中心推論,Hopper 架構(H100/H200)憑藉高 HBM 頻寬和 Tensor Core 佔領約 80%+ 市場份額(據 Mercury Research 及多家券商估算,2024 年)。AMD MI300X 以更高視訊記憶體容量和價效比爭奪份額。定製 ASIC 崛起:Google 的 TPU v5p、Amazon 的 Trainium2、微軟的 Maia 100 均採用台積電先進製程與 CoWoS 封裝,削減成本。博通、Marvell 作為 ASIC 設計服務商,承接超大規模客戶自研晶片需求。
  • 儲存與封裝:HBM(高頻寬記憶體)由 SK 海力士、三星、美光供應,其位寬和容量直接決定 KV 快取擴充套件的上限。台積電 CoWoS 封裝產能長期緊缺,2024 年該公司法說會透露年產能約 30 萬片,並計劃 2025 年擴至 50 萬片以上,直接影響 AI 晶片交付週期和成本(來源:台積電 2024Q2 法說會公開陳述)。此外,傳輸中介層的良率和基板供應是短期瓶頸。
  • 電力與散熱:單張 H100 熱設計功耗達 700W,推論叢集的總功耗動輒兆瓦級。資料中心 PUE(電能利用效率)、當地電價和冷卻方案(氣冷→液冷→浸沒式)成為成本模型的隱性核心。根據 Uptime Institute 2024 年報告,超大規模資料中心的 PUE 已普遍低於 1.2,但電力成本地域差異巨大,驅動企業將推論負載向電力廉價地區(如北歐、中東)遷移。

7. 下游

下游應用方對每 Token 成本的敏感度與消耗量成正比,許多商業模式僅在成本低於某個閾值時才成立。

  • 獨立軟體開發商(ISV)與 SaaS:如 Jasper、Copy.ai 等早期基於 GPT‑3 的文案工具,在 API 降價後毛利改善顯著。程式碼助手(GitHub Copilot、Cursor)因互動頻繁且上下文較長,token 消耗大,是降本主要受益者。
  • 企業內部服務:客服對話、合同審查、知識庫問答(RAG)等場景,日均 token 可達千萬級。許多大型製造、金融企業正從呼叫高價商業 API,轉向微調並自託管 7B–13B 開源模型,以將每百萬 token 成本壓至 0.05 美元以下。以沃爾瑪、豐田等公開揭露的試點專案為例,自託管後推論單價可降 70% 以上(來源:公司技術部落格及行業會議分享,2024 年)。
  • 終端消費與端側:Apple Intelligence、三星 Galaxy AI 部分任務在裝置端執行小型模型,邊際成本近乎為零,但受限於模型能力。雲端邊協同成為趨勢,簡單意圖端側完成,複雜查詢回傳雲端端,最佳化整體 token 消耗組合。

8. 受益公司

以下公司因每 Token 成本下行的產業鏈邏輯而在營收、市場份額或戰略版面配置上獲益,不構成任何投資建議

  • 模型廠商:OpenAI、Anthropic 通過壓低模型推論成本(如 GPT‑4o mini、Claude 系列降價)擴大 API 呼叫量,以量補價,並利用高效能模型收取溢價。Google 依託 TPU 內供將 Gemini 成本壓至競品之下,換取雲端市場份額。Meta 通過開源 Llama 系列,雖不直接銷售 token,卻借社群最佳化攤薄自身研發成本,同時削弱競品的 API 定價權。
  • AI 晶片商:NVIDIA 在推論最佳化(TensorRT‑LLM)和下一代架構(Blackwell)持續提升每瓦 token 產出,穩定高附加值晶片需求。AMD MI300 系列以競爭性定價吸引微軟、Oracle 等雲端客戶,擴大推論市場存在。博通、Marvell 等定製 ASIC 服務商從超大規模客戶的專用晶片浪潮中受益。
  • 雲端服務商:AWS(Inferentia/Trainium)、微軟 Azure(Maia)、Google Cloud(TPU)通過自研或定製晶片提供低價推論例項,吸引高消耗負載,帶動周邊儲存、資料、安全等服務捆綁營收。
  • 推論最佳化工具與開源平台:vLLM、Together AI、Fireworks 等以極致的模型服務最佳化,使使用者能用更少 GPU 支撐同等吞吐,從而獲得定價優勢和開發者黏性。Neural Magic 等公司推出專用稀疏推論引擎,進一步壓縮通用 CPU 推論成本,為邊緣部署提供新選擇。

9. 市場規模

全球生成式 AI 推論產生的 token 消耗總量尚無統一權威統計,但可從交叉指標側面度量。

  • API 營收指向:根據公開財報及相關分析,微軟 Azure AI 服務季度營收(截至 CY2024Q4)中相當比重源自 API 推論,其 run rate 已突破 60 億美元/年(微軟 FY25Q2 財報音訊評論)。OpenAI 年度經常性營收在 2024 年末達到約 40 億美元(The Information 等媒體報道)。綜合估算,全球商業 API 推論市場在 2024 年規模約 100–150 億美元,且年增速超過 100%。
  • 推論硬體市場:據 Mercury Research 及券商報告,2024 年資料中心 AI 推論加速器(GPU+ASIC)出貨額約 400 億美元,其中推論負載佔比持續提升。SemiAnalysis 預測到 2027 年,推論將成為 AI 計算需求的最大細分,佔總算力的 60% 以上(來源:SemiAnalysis 2024 年度報告)。
  • Token 消耗量:公開資料未見精確總量,但可以從頭部應用的流量推算。Character.AI 在 2024 年已實現日均數十億 token 的處理量;GitHub Copilot 日生成 token 量亦在 10 億級。業界估算 2024 年全球生成式 AI 日均 token 消耗已跨越 10 萬億 token 大關,且每 6 個月翻一番(綜合多家 VC 投資人公開演講資料,2024 年)。

長期看,單位成本每下降 10 倍,催生約 100 倍的需求增長(傑文斯悖論式效應),因此每 Token 成本下降本身會放大 token 經濟總規模,形成正向飛輪。

10. 玩家對比

不同模型供應商在成本結構、定價策略和技術最佳化深度上差異顯著,直接影響其生態位。

廠商/模型典型模型輸入價格 ($/M tokens)輸出價格 ($/M tokens)成本優勢來源備註
OpenAIGPT‑4o5.0015.00自研推論棧、MoE 架構(推測)、批次折扣價格包含高獲利,2025 年初發布 mini 版降至 0.15/0.60
AnthropicClaude 3.5 Sonnet3.0015.00自研推論最佳化,側重安全對齊,MoE 疑似價格略低於 GPT‑4o 輸入,輸出持平
GoogleGemini 1.5 Pro3.5010.50TPU v5p 內供,MoE 架構,內部資源排程利用 YouTube 等自有資料提升模型效率
Mistral AIMistral Large4.0016.00MoE,歐洲最佳化,追求少樣本推論效率開源部分模型,兼顧第三方託管
DeepSeekDeepSeek‑V20.271.10極深 MoE 與多頭潛在注意力(MLA),極低啟用引數2024 年 5 月釋出後引發價格戰,展示極低成本路線
Meta (Llama)Llama 3 70B (社群託管)約 0.10–0.30約 0.20–0.60開源最佳化(vLLM、TensorRT),零許可費部署成本由第三方承擔,靈活性極高

定價資料取自各廠商官網 2025 年 4 月快照,部分模型價格含 Fine‑tuned 收費,實際以官網為準。

運營層面的成本對比更凸顯差距:據 SemiAnalysis 2024 年對特定開源模型推論 TCO 的拆解,使用 H100 叢集執行 Llama 3 70B 量化版本,在較高利用率下,供應商真實推論 TCO 可低至 0.05 美元/百萬 token 以下;而商業 API 價格通常為該值的 10–60 倍,差價用於覆蓋研發、風險準備金和獲客成本。擁有自研晶片或極低電力成本(如Google、微軟部分割槽域)的廠商,其 TCO 優勢將進一步拉大。

11. 風險

  • 價格戰與獲利侵蝕:開源模型與激進定價(如 DeepSeek)迫使商業 API 持續降價,可能導致行業毛利空間收窄,部分中小模型廠商出清。
  • 技術瓶頸與量化損失:過度壓縮可能在某些嚴謹場景(法律、醫學)引發語義丟失,限制降本邊界;MoE 的負載均衡和通訊開銷若不能妥善解決,單位成本改善可能不及預期。
  • 能源與供應鏈約束:全球資料中心電力需求激增,部分地區電網瓶頸和 HBM 產能不足或階段性推高硬體成本,使成本下降曲線暫時放緩。
  • 監管與合規成本:AI 內容標識、資料隱私法(如 EU AI Act)可能增加額外的審查和處理環節,提升每 token 的合規開銷。
  • 過度依賴少數供應商:NVIDIA 的統治地位和台積電先進封裝產能集中,使成本受制於單一環節的供應波動或定價權。
  • 使用者黏性陷阱:應用在極低成本下可能產生大量低價值呼叫,導致營收無法覆蓋基礎設施擴充套件,出現“量增利不增”的困局。

12. 誤讀糾偏

  • 誤讀 1:“API 報價等於每 token 成本”
    糾正:API 報價包含毛利、研發攤銷、獲客成本和競爭溢價;供應商內部 TCO 往往遠低於此。企業自行部署開源模型時,成本僅含硬體折舊、電力和運維,與託管價可差數十倍。分析師需拆解“開價”與“TCO”,並區分邊際與全分攤成本。

  • 誤讀 2:“模型越大,每 token 成本就越高”
    糾正:MoE 架構下,雖然總引數可達數千億,但每個 token 僅啟用一小部分引數,實際計算量可能低於同性能稠密模型的 1/5。同時,大型模型對量化和壓縮的容忍度更高,可通過極低位寬部署進一步降低成本。評價成本必須關注啟用計算量記憶體頻寬需求,而非總引數量。

  • 誤讀 3:“量化一定會嚴重損傷智慧”
    糾正:GPTQ、AWQ 等訓練後量化配合校準資料集,可使 INT4 模型在 90% 以上的自然語言任務上精度損失小於 1%。MoE 和大規模模型對此尤為魯棒,量化已成為行業降本的標準操作。但未經校準的粗暴量化確實存在風險,需驗證。

  • 誤讀 4:“降本只靠硬體進步”
    糾正:演算法創新(FlashAttention、vLLM 的 PagedAttention、投機解碼)帶來的效率提升經常超過單代硬體迭代。同等硬體上,最新的推論架構比 2022 年的 naive 部署可提升 5–10 倍吞吐,演算法是成本下降的“隱形槓桿”。

  • 誤讀 5:“每 token 價格越低越好,使用者永遠受益”
    糾正:極端低價可能導致服務質量滑坡(如降低精度、縮短上下文、增加延遲),或引發供應商降低安全與內容稽核投入,形成隱性成本。健康市場應在合理成本下維持可持續生態。

13. 最新事件

  • 2024 年 5 月 DeepSeek‑V2 開源釋出:該模型採用 MLA(多頭潛在注意力)與極致 MoE,宣稱推論成本僅為每百萬 token 0.001 美元(輸入),引發中國及全球 API 價格戰。此後字節跳動、阿里雲端、百度等中國廠商紛紛大幅下調模型 API 價格,部分降至免費或接近免費。
  • OpenAI 推出 GPT‑4o mini(2024 年 7 月):將高效能模型的價格壓至每百萬 token 0.15 美元(輸入)和 0.60 美元(輸出),同時推出批處理 API 給予 50% 折扣,顯著降低開發者成本,並支援多模態。
  • Google Gemini 1.5 Flash 釋出(2024 年 5 月):專為低成本推論設計,每百萬 token 輸入價格僅 0.075 美元,輸出 0.30 美元,通過蒸餾和輕量架構提供接近更大型模型的效能,服務於大規模低延遲任務。
  • Meta Llama 3 開源(2024 年 4–7 月):從 8B 到 405B 的多尺寸模型開源,加上社群量化及最佳化,使企業自託管推論成本降至每百萬 token 0.02–0.10 美元區間,成為閉源 API 的強大替代。
  • AMD MI300X 推論效能凸顯:2024 年 Q3 多家雲端商及獨立評測顯示 MI300X 在執行 Llama 等模型時,得益於更高視訊記憶體頻寬,每 token 成本較 H100 在某些 batch size 下可低 20%–30%,打破 NVIDIA 獨大局面。
  • Apple全裝置端模型:2024 年 WWDC 宣佈 Apple Intelligence,使用約 3B 引數的裝置端基礎模型,完全本地推論,將消費級 AI 成本推向零邊際,引發對雲端推論需求結構的長遠重估。
  • NVIDIA 釋出 Blackwell GPU(2024 年 GTC):針對推論專門強化第二代 Transformer 引擎,支援 FP4 精度,宣稱可將大型模型推論吞吐提升至 Hopper 的 2–4 倍,進一步壓低每 token 硬體成本,預計 2025 年規模出貨。

14. 追蹤指標

持續追蹤每 Token 成本演變,建議監測以下高頻資料與領先指標:

  • 主要 API 定價變化:OpenAI、Anthropic、Google、Microsoft、Mistral、DeepSeek 等官網定價頁的每月或每季快照,特別關注廉價版(Flash、Mini)與旗艦版價差。
  • MLPerf Inference 基準結果:每輪成績釋出中單卡 token 生成吞吐(tokens/s)、延遲和能耗,反映硬體與推論架構的實際進步。
  • AI 晶片均價(ASP)與 HBM 合約價:通過金融分析師報告,監測 H100/H200/Blackwell 等卡的市場租金(如 $/GPU·小時)和 HBM 供應價,這些決定硬體成本基線。
  • 雲端廠商 AI 營收與毛利率:微軟 Azure AI、Google雲端 AI、AWS 的機器學習和推論營收的季度增長,以及管理層對推論成本下降幅度的評論(如“我們降低推論成本 x%,實現用量的 x 倍增長”)。
  • 資料中心電力 PPA 價格與液冷滲透率:電力成本在北美、歐洲等地的遠期協議價格,以及液冷伺服器出貨佔比,可預測運營費用走向。
  • 開源推論架構吞吐量里程碑:vLLM、TensorRT‑LLM、DeepSpeed-MII 等社群釋出的最新最佳化效能資料,如“單 H100 執行 Llama 3 8B 達 xxx tokens/s”,直接體現演算法降本速率。
  • 上市公司相關資本支出展望:Meta、微軟、Google、Amazon 的 AI 基礎設施 capex 計劃以及自研晶片的部署比例,預示中長期供給能力。

15. 信源

  • 廠商官方資訊:OpenAI API 定價與部落格,Anthropic 官方定價頁與模型報告,Google Cloud Vertex AI 定價,Microsoft Azure OpenAI 服務定價,Meta AI 公開部落格與模型卡,Mistral AI 官方網站,DeepSeek 公開技術報告。
  • 第三方產業分析:SemiAnalysis 推論 TCO 拆解報告及週報,ARK Invest 年度 Big Ideas 中 AI 成本曲線專題,a16z 基礎設施報告相關章節,McKinsey QuantumBlack 關於生成式 AI 成本的經濟性分析。
  • 技術論文與架構文件:FlashAttention 系列論文,vLLM PagedAttention 論文,GQA/MQA 注意力最佳化論文,GPTQ/AWQ 量化論文,NVIDIA TensorRT‑LLM 白皮書,MLPerf Inference 基準規則。
  • 財務與市場資料:超大規模雲端商(微軟、Google、亞馬遜)季度財報與電話會轉錄,台積電季度法說會,SK 海力士、三星記憶體業務新聞稿,Mercury Research GPU 市場份額報告。
  • 行業會議公開資料:GTC、Hot Chips、NeurIPS 效率專題、AI Hardware Summit 中關於推論成本突破的演講與演示公開幻燈片。

一句話總結

每 Token 成本是 AI 智力供給的原子價格,其下降斜率決定了生成式 AI 是持續燒錢的實驗品還是普惠全社會的基礎設施,而演算法、晶片與能源三軸聯動正在將這一價格推向極限。

source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型