Tokens per Dollar
3 秒看懂
核心公式:
Tokens per Dollar (T/$) = 推論吞吐量 (Tokens/s) / 推論成本 ($/s)
等價於:生成的 Token 總數 / 為此支付的總費用
一句話定義:
它是衡量大語言模型(LLM)服務價效比的終極指標,直接回答“花一塊錢,AI 能幫我生成多少有用的文字、程式碼或資料”。在 AI 應用從 demo 走向大規模落地的階段,T/$ 已取代純模型能力指標,成為判斷一項 AI 服務是否具備商業可持續性的第一性原理指標。
3 分鐘產業解釋
Tokens per Dollar 突然成為產業焦點,標誌著 AI 產業從“技術軍備競賽期”正式進入“成本與效率競賽期”,核心邏輯正在發生底層切換。
- 過去(2023 年以前): 產業的北極星指標是“模型能力”——誰能重新整理 MMLU、HumanEval 等排行榜,誰就掌握話語權。推論成本雖然高昂,但開發者與投資人的容忍度較高,大家爭奪的是“誰更聰明”。
- 現在(2024 年起): 隨著 Agent、檢索增強生成(RAG)、長文本總結、程式碼助手等複雜任務大規模上線,“有智慧”已不夠用,“用得起智慧”成為硬約束。一個模型如果在處理百萬文件時需要花費數萬美元,其實際價值將歸零。T/$ 被推至前臺,成為連線 AI 技術能力與商業可行性的橋樑。
- 產業邏輯: 更高的 T/$ 對產業鏈各環節意味著完全不同的槓桿:
- 對模型服務商: 在相似質量下,T/$ 更高的 API 能迅速侵蝕競爭對手的市場份額;也可以選擇維持較高毛利,同時用低價策略擠壓中小對手。
- 對應用開發者/企業: 單位功能(如單次客服對話、單次程式碼補全、單次合同審查)的 Token 成本更低,使得產品化、C 端放量和複雜業務場景(如全庫語義檢索)具備財務上的可行性。
- 對技術與硬體: 它倒逼整個產業棧——從晶片架構、模型設計、推論引擎到資料中心基礎設施——進行極致的最佳化。產業的最終願景是實現 “智慧的商品化”,讓 AI 像水電一樣按需、彈性、低成本呼叫。
技術原理
T/$ 表面上是一個除法,但其背後是模型能力、系統效率和硬體成本三股力量在特定排程策略下的綜合博弈。理解其本質,需要將分子(推論吞吐量)和分母(推論成本)拆解至工程細節。
1. 提升分子:推論吞吐量(Tokens/s)
推論吞吐量衡量的是系統在單位時間內能穩定輸出的總 Token 數量,它不是首 Token 延遲(TTFT),而是與併發請求數量、批處理效率、單請求生成長度密切相關的高負載指標。提升吞吐量的關鍵技術包括:
(a)記憶體頻寬與注意力機制突破
自迴歸模型推論是“記憶體牆”受限的計算模式。注意力矩陣的記憶體佔用、Key-Value 歷史向量的反覆讀寫,導致大量時間消耗在資料搬運而非計算上。
- FlashAttention 系列(v1/v2/v3): 通過分塊(tiling)和重計算(recomputation),將注意力計算對 GPU 高頻寬視訊記憶體(HBM)的訪問量從 O(N²) 降至 O(N),使長序列任務的批處理規模(batch size)能數倍增長,直接拉抬吞吐。
- KV Cache 最佳化: 對歷史 Token 的 Key-Value 向量進行量化壓縮(如 INT8/INT4 KV Cache)、跨請求共享或基於滑動視窗的淘汰,減少視訊記憶體佔用和重複計算,在請求併發量和生成長度之間取得更大自由度。
(b)計算效率提升
在有限的視訊記憶體與算力預算下,提高每個位元產出的 Token 數量:
- 模型量化: 將權重、啟用、甚至 KV Cache 從 FP16 進一步壓縮至 FP8、INT8、INT4。如採用 AWQ、GPTQ 等精度感知量化方案,常可在無明顯基準評測下降的情況下,將視訊記憶體佔用減半,允許同卡容納更大的 batch size,從而提升吞吐 1.5–2 倍。
- 投機取樣: 使用輕量級“草稿模型”快速預測數步 Token 序列,再由大型模型一次性驗證。在生成任務中,可將多次序列解碼壓縮為一次並行驗證,在保證輸出質量的前提下,將生成階段的吞吐提升 1.5–3 倍(效果取決於草稿模型與主模型匹配度以及任務結構)。
(c)系統級排程與並行策略
- 持續批處理: 傳統批次推論需等待一批請求全部生成結束才能釋放資源。持續批處理可動態地在已有批次中插入新請求的 Token,使得 GPU 計算單元利用率接近 100%,相比靜態批處理,吞吐量可提升 10–20 倍(據 vLLM 團隊公開基準)。
- 模型並行: 對於無法放入單卡的超大型模型,通過張量並行、流水線並行或專家並行(MoE 天然優勢),將計算分佈在多卡上。雖然引入通訊開銷,但可通過高速互聯(NVLink、InfiniBand)控制,從而擴充套件總吞吐上限。
2. 最佳化分母:推論成本($/s)
成本是硬約束,它由硬體採購/租賃、軟體棧、電力與運維等剛性支出構成。一個典型雲端端推論例項的成本結構大致為(公開資料綜合估算,口徑為 2024 年主流雲端廠商 Nvidia H100 例項場景):
- GPU/加速卡成本:約 60–75%
受晶片型號、採購方式(自持折舊 vs 雲端按需/預留例項)、租賃時長影響。 - 配套系統及軟體:約 10–20%
包括高效能儲存、網路互聯、推論架構許可或內部開發分攤、系統運維人員成本。 - 資料中心與能源:約 10–20%
場地租金、電力消耗(GPU 滿載時功耗極大)、冷卻與保障。
因此,提升 T/$ 的本質 是:用更高效的軟體棧(最大化吞吐量),在價效比最優的硬體平台上(控制單位算力成本),藉助智慧併發排程策略(讓分母投入發揮最大效益),服務更多的併發請求,從而壓低單位 Token 平均成本。
關鍵引數
除了核心指標 Tokens per Dollar,評價一個推論系統或 API 的整體表現還需要關注以下維度,它們共同決定 T/$ 的適用場景與使用者體驗。
- 首 Token 延遲:從請求發出到收到第一個生成 Token 的時間。決定了互動式應用(如對話 AI)的“響應感”。低延遲可能以犧牲部分吞吐為代價。
- Token 間延遲:流式輸出中,相鄰 Token 之間的平均時間間隔。影響使用者的閱讀體驗和感知速度。
- 最大併發請求數(併發容量):系統在維持既定延遲 SLO(服務水平目標)下能同時處理的請求上限。高併發對應高吞吐潛力。
- 模型質量校準: T/$ 絕非純粹的速度競賽。必須結合模型在某項任務上的質量指標(如 MMLU、HumanEval、MT-Bench、Chatbot Arena ELO 分數)來建置“有效 T/$”,否則會被低質模型刷高指標。
- 總擁有成本(TCO): 針對自建推論叢集的企業,TCO 覆蓋 GPU 伺服器折舊、電力、製冷、運維、網路、軟體許可等全生命週期成本。它是自建方案與呼叫 API 之間做決策的真實分母。
- 每瓦特 Tokens: 在資料中心整體功耗約束越來越嚴的背景下,能效比直接影響長期運營成本和碳排邊界,也是專用推論晶片的價值主張。
技術路線
當前產業在提升 T/$ 上已形成多條並行技術路線,不同路線之間存在取捨,且往往組合使用才能取得指數級效果。下表以 2024–2025 年行業公開資訊為基礎,梳理主要路線及其對 T/$ 的數量級影響。
| 最佳化方向 | 典型技術 / 方案 | 對 T/$ 的影響(量級估算) | 主要權衡與約束 | 參考來源 |
|---|---|---|---|---|
| 模型架構 | Dense 模型 → MoE 稀疏模型 | 同等質量下 T/$ 可提升 3–5 倍 | 需要更復雜的路由機制、跨專家通訊開銷;推廣尚受工程與硬體生態限制 | 行業估算,綜合 Mistral Mixtral 8x7B、DeepSeek-V2 等公開技術報告 |
| 推論精度 | FP16 → FP8 → INT4/INT8 量化 | 吞吐提升約 1.5–2.5 倍,成本下降年增率例 | 需要量化感知訓練或校準;超低精度可能影響某些任務的準確率;依賴硬體對目標格式的原生支援 | NVIDIA H100 FP8、開源 AWQ/GPTQ 專案實測 |
| 批處理與排程 | 持續批處理;分頁注意力 | 吞吐量對比靜態批處理可提升 10–20 倍 | 大幅增加排程複雜度,需要精密的視訊記憶體管理;延遲可能小幅波動 | vLLM 等開源架構在 A100/H100 上的官方基準 |
| 注意力最佳化 | FlashAttention-2/3 | 長序列場景下記憶體效率提升、允許更大 batch,T/$ 有階躍提升 | 需要針對特定 GPU 架構進行運算元融合適配;並非所有架構均已整合 | FlashAttention 團隊論文及輝達技術部落格 |
| 投機解碼 | 投機取樣(Speculative Decoding) | 生成階段吞吐提升 1.5–3 倍 | 需要額外的草稿模型;提升上限取決於任務本身的熵與可預測性 | Google、META 等團隊研究論文及 Together AI 實踐 |
| 硬體定製 | 通用 GPU(A100/H100)vs 推論專用晶片(如 Groq LPU、d-Matrix) | 專用晶片在延遲與每瓦特效能上優勢顯著,總吞吐 / 成本比需具體場景驗證 | 存在生態鎖定風險;軟體棧成熟度、模型遷移成本是推廣瓶頸 | Groq LPU 公開 demo 與第三方評測 |
注:表中倍數均為典型場景下的估算範圍,實際效果高度依賴具體模型結構、任務型別、硬體平台和工程實現水平。
上游
T/$ 的“上游”是指為模型的訓練與推論提供基礎算力、互連、儲存和能源供給的產業環節。這些環節的成本和效率,最終構成了 T/$ 分母的基礎。
-
晶片設計與製造
- 通用 GPU/AI 加速器: 輝達(H100、B200 等)、AMD(Instinct MI300X 系列)、Intel(Gaudi 3)構成 2024–2025 年推論市場的主力供給。其中輝達憑藉 CUDA 生態與高浮點效能佔據主導,其供給節奏與定價直接左右全球 T/$ 基線。
- 專用推論晶片: Groq(LPU 架構)、d-Matrix、Cerebras(晶圓級引擎)、SambaNova 等初創公司,圍繞降低延遲、提升能效和簡化 KV Cache 處理等路徑設計晶片,試圖在特定場景替代通用 GPU。
- “造芯”消費端: Google(TPU v5p/v5e)、AWS(Trainium/Inferentia)、微軟(Maia)等雲端巨頭自研加速器,優先用於內部推論服務,以降低對外部供應鏈的依賴並最佳化 T/$。
-
先進封裝與儲存
高頻寬記憶體(HBM)是當前大型模型推論的關鍵瓶頸。HBM3e 等的供應能力、價格,以及 CoWoS 先進封裝產能,直接影響 GPU 的出貨量和成本曲線。 -
網路與互連
NVIDIA NVLink、InfiniBand,以及博通等相關晶片供應商,決定了多 GPU 分散式推論的通訊頻寬與延遲。這部分成本在大型自建叢集中不可忽視。 -
雲端基礎設施
以 AWS、Azure、GCP 為代表的超大規模雲端服務商,通過規模化採購電力、資料中心與網路,設定著 API 呼叫和裸金屬例項的租用價格,是整個產業鏈的定價錨點。
下游
“下游”是 T/$ 紅利的直接獲取方和應用落地方,他們對 T/$ 的敏感度與需求強度決定了產業鏈的放量速度。
- AI 應用開發者與 ISV:包括 SaaS 廠商、企業 IT 部門、獨立開發者。他們使用模型 API 建置面向終端的功能——如程式碼助手(GitHub Copilot)、文件總結、客服機器人、營銷文案生成等。T/$ 每翻一番,其產品毛利和可擴充套件市場空間就可能翻倍。
- 企業級部署: 金融、法律、醫療等講究資料合規的大型組織,傾向自建推論叢集。他們追求的是自建算力 T/$ 與商業 API T/$ 的交叉點,當自建 T/$ 高於市場 API 時,內部部署更具經濟理性。
- 終端使用者: C 端消費者和企業員工,是 AI 能力的最終消費者。他們不直接感知 T/$,但感知響應速度、使用成本和功能豐富度——所有這些都是由 T/$ 支撐的。
- 模型評估與中介平台: 諸如 Artificial Analysis、OpenRouter 等聚合和測評平台,將不同模型的 T/$ 進行透明化對比,幫助下游買方做出最優選型,加速高 T/$ 服務的採納。
受益公司
以下分類梳理在 T/$ 持續提升趨勢中,產業鏈各環節主要受益邏輯的公司與專案(僅作產業邏輯梳理,不構成任何投資建議)。
(1)高 T/$ 模型 API 供應商
- DeepSeek: 憑藉 DeepSeek-V2 等 MoE 模型,以顯著低於同行的 API 定價(如 2024 年中釋出的百萬 Token 輸入/輸出價格降至 1 元人民幣級別),迅速開啟市場,成為高 T/$ 現象級代表。
- Together AI、Fireworks AI、Anyscale: 專注於高效推論引擎和開源模型託管,通過軟體最佳化壓低價格,提供極具競爭力的 T/$。
- OpenAI、Anthropic、Google: 儘管絕對價格常高於上述參與者,但在前沿模型質量領先的前提下,持續推進降價(如 GPT-4o 多次降價、Gemini Flash 的低價方案),維持“有效 T/$”的吸引力。
(2)推論引擎與系統軟體
- vLLM(社群開源,Anyscale 背後支援): 以持續批處理和 PagedAttention 等技術,成為開源文本生成推論的事實標準之一,是許多高 T/$ 服務的技術底座。
- NVIDIA TensorRT-LLM: 深度整合硬體優勢,為 H100/B200 等提供最佳推論效率,是企業方案和閉源服務的重要選擇。
- SGLang、llama.cpp 等社群專案: 分別在結構化生成和消費級硬體推論上提供差異化 T/$ 最佳化。
(3)推論硬體與晶片平台
- Groq: 以 LPU 架構實現極低延遲的即時推論,其公開演示的高速 Token 輸出重新整理了業界對 T/$ 即時感知的認知。
- Cerebras、d-Matrix: 藉助晶圓級整合或存內計算等新型架構,瞄準高吞吐、低功耗推論市場。
- 輝達、AMD: 作為通用算力底座,幾乎每一次硬體代際更新(H100→B200)都會為整個市場帶來一次 T/$ 的跨越。
(4)基礎設施與運維
- 雲端廠商(AWS、Azure、GCP)和裸金屬提供商(CoreWeave 等),通過最佳化資源池和採用最新 GPU,持續降低單位 Token 的硬體攤銷成本,是隱性的 T/$ 受益者。
市場規模
關於 AI 推論市場及 T/$ 提升帶來的經濟影響,目前缺乏單一權威統計,但可以從多個口徑拼湊出增長潛力(資料主要引用 2024 年市場報告與行業分析)。
- 大型模型推論市場: 據 Fortune Business Insights 2024 年 Q2 報告,全球生成式 AI 市場(含訓練和推論)預計將從 2024 年的約 672 億美元增長至 2032 年的約 1.3 萬億美元。其中,推論在進入規模化部署階段後佔比將顯著增加。另一份來自 SemiAnalysis 的分析指出,到 2025 年,大型模型推論將佔據 AI 算力消耗約 60% 以上份額,成為主要成本項。
- API 經濟規模: 以 OpenAI 為例,媒體估算其 2024 年化營收中 API 部分佔比持續上升;而像 Groq、Together AI 等初創企業也在 2024 年獲得數億美元融資,間接反映了市場對未來推論服務體量的預期。
- “降本換量”效應: 根據部分 LLM 服務商公開發布,2023 年至 2024 年間,同等能力的模型 API 價格下降了 50%–90%,同時呼叫量增長了 5–20 倍不等,顯現出強價格彈性。T/$ 每大幅提升,通常會推動下游對 Token 消耗量出現指數級增長(來源:各公司官方部落格公開的降價公告與使用量統計)。
- 中國市場規模: 公開資料中缺少對中國獨立推論市場規模的權威統計,但從各雲端廠商(阿里雲端、華為雲端、騰訊雲端)密集下調模型 API 價格以及百模大戰的態勢來看,2024 年中國市場的推論 Token 消耗量年增率增長很可能超過一個數量級(公開報道綜合判斷)。
注:上述數字中,全球市場預測引用自立信會計師事務所、Fortune Business Insights 等商業機構報告,請以原報告為準;基於價格下降推測的市場增長為定性判斷,並非精確營收模型。
玩家對比
以下基於公開的 API 定價、社群基準與行業測評,對比 2024 年底至 2025 年初主要模型提供商的 T/$ 特徵(價格以每百萬 Token 為單位,擷取自各公司官網定價頁及 Artificial Analysis 2024 年 12 月快照)。
| 提供商 / 模型 | 輸入價格 | 輸出價格 | T/$ 典型範圍(輸出)* | 模型質量參考 | 關鍵特徵 |
|---|---|---|---|---|---|
| DeepSeek (V2/V3) | ¥1.00 | ¥2.00 | 極高(同價格下輸出 Token 數量約為 GPT-4o 的 5–10 倍) | 中文知識、數學、程式碼接近 GPT-4 級別 | MoE 架構 + 極致工程最佳化,國內定價顛覆者 |
| OpenAI GPT-4o | $2.50 / 百萬輸入 | $10.00 / 百萬輸出 | 中等偏高 | 多模態、多語言綜合能力領先 | 價格較 2023 年已降低 90%,生態最成熟 |
| Anthropic Claude 3.5 Sonnet | $3.00 / 百萬輸入 | $15.00 / 百萬輸出 | 中等 | 長上下文、安全性、寫作風格突出 | 企業級功能(合規、審計)加持 |
| Google Gemini 1.5 Flash | $0.075 / 百萬輸入 | $0.30 / 百萬輸出 | 極高 | 在低算力成本下提供接近前沿的質量 | 超低價 + 長上下文視窗(1M Token),極致 T/$ |
| Mistral Large 2 | $2.00 / 百萬輸入 | $6.00 / 百萬輸出 | 中高 | 多語言、英文優異 | 歐洲旗艦,通過 Azure 等平台分發 |
| Groq LPU 上的 Llama 3.1 70B/405B | 按請求速率計費 | 取決於併發 | 極高(吞吐為主) | 開源模型標準質量 | 延遲極低(數百 Token/s),適合即時互動 |
注:T/$ 為“輸出 Token 數/費用”,考慮模型質量後的“有效 T/$”排名會進一步變化;價格資料來自各官網 2024 年末公佈,可能存在區域差異;表格僅為說明性對比,不構成任何服務推薦。
對比顯示,產業格局正在分化為兩條路徑:
- 前沿智慧溢價路線: OpenAI、Anthropic 靠最強模型質量和工具鏈維持較高價格,但因持續降價和模型蒸餾,其 T/$ 也在快速改善。
- 極致價效比路線: DeepSeek、Gemini Flash、以及基於開源模型的低價託管服務(Together、Fireworks 等),通過低價或開源將 T/$ 作為主要競爭武器,迅速獲取大批價格敏感型使用者。
風險
Tokens per Dollar 作為產業指揮棒的同時,也潛藏著多層面風險,需在產業分析中予以警惕。
- 質量稀釋風險: 一味追求高 T/$ 可能催生“低價低智”模型。部分服務商用量化或蒸餾大幅壓成本,但模型在某些複雜任務上的準確率、穩定性大幅下降。若產業缺乏統一的質量加權標準,劣幣可能驅逐良幣。
- 供應鏈與地緣政治風險: 輝達 GPU 在推論市場近乎壟斷的份額,使全球 T/$ 受制於其產能分配、出口管制政策。2023–2024 年美國對華出口限制已迫使中國部分廠商轉向降級版本(如 H20),導致其 T/$ 提升路徑額外受限。
- 技術迭代過快的沉沒成本: 今天看似先進的最佳化方案(如某款量化演算法、某一代專用晶片)可能在 6–12 個月內被新架構替代。自建叢集若不能快速折舊與更新,可能面臨 T/$ 遠落後於 API 服務的困境。
- 營收與獲利脫節: 頭部企業為搶佔市場份額進行補貼式定價,導致部分高 T/$ 服務的長期盈利能力存疑。當資本退潮或企業迴歸獲利本位時,可能面臨漲價或服務質量下降,影響下游應用穩定性。
- 安全與合規風險: 極高的 T/$(尤其推論速度)可能被惡意用於大規模生成虛假資訊、詐騙內容或自動漏洞挖掘。監管趨嚴將增加模型合規成本,反過來推高分母,降低有效 T/$。
- 指標單一化誤區: 僅以 T/$ 衡量服務價值,可能忽略 SLA 保障、資料隱私、微調能力、外掛生態等企業級要素。過度關注 T/$ 可能導致產業忽視長尾的企業需求。
誤讀糾偏
產業中最常見的三個認知誤區,需反覆澄清。
誤讀 1:“模型引數越小,T/$ 就越高。”
糾偏: 完全錯誤。MoE 模型總引數量可以極大(甚至萬億級),但處理每個 Token 時僅啟用一小部分引數,由此在保持高質量的同時,T/$ 顯著優於採用 Dense 結構的中等引數模型。T/$ 的核心是**“有效算力的價效比”**,而非“引數量”的價效比。軟體與演算法最佳化(量化、投機取樣、KV Cache 壓縮)對 T/$ 的提升往往遠大於簡單地切換更小的模型。
誤讀 2:“T/$ 就是 API 的公開標價(每千 Token 多少錢)。”
糾偏: 不完全等同。API 標價是商業決策的結果,包含了品牌、服務水平協議(SLA)、獲利和生態投入等非技術因素。而 T/$ 側重於技術層面的效率評估。一個極便宜的 API,若智力水平只有同行的 1/3,花同樣錢獲得的“有效智慧”可能反而更低。必須將模型質量(通過權威基準或實際任務評測)引入,建置質量加權的有效 T/$,才能真正指導採購決策。
誤讀 3:“提升 T/$ 只是演算法工程師的事。”
糾偏: 提升 T/$ 是一項橫跨演算法、系統、硬體、網路、資料中心的全棧系統工程。量化演算法需要工程團隊無縫整合到推論架構;晶片架構直接決定最佳化的理論天花板;網路團隊決定了分散式推論的通訊效率;甚至資料中心選址(電力成本與冷卻方案)也會影響自建叢集的 T/$。試圖把責任歸為單一職能,註定無法獲得最優解。
最新事件
T/$ 領域的演進速度極快,以下擷取 2024–2025 年初對產業格局產生顯著影響的事件。
- 中國市場的“價格血戰”(2024 年 5 月起): DeepSeek-V2 開源並公佈極低 API 價格後,字節跳動、阿里巴巴、百度、騰訊等中國雲端廠商紛紛宣佈大幅下調大型模型服務價格,部分模型降至百萬 Token 輸入價格幾毛錢至 1 元的水平,T/$ 在中文市場出現跳躍式提升。
- OpenAI 持續降價與效率提升(2024 全年): GPT-4o 釋出後歷經多次降價,到 2024 年底輸出價格相較於 2023 年的 GPT-4 降低了約 90%。Sam Altman 等人在公開採訪中多次強調“降低 Token 成本是公司的最高優先順序之一”。
- Google Gemini Flash 的 T/$ 破局(2024 年 12 月): Gemini 1.5 Flash 以每百萬輸出詞元不到 0.3 美元的價格,且支援 100 萬 Token 上下文視窗,被社群視為“高 T/$ 基準線”的定義者之一,迫使競品進一步下調價格。
- Groq 商用服務上線與即時 T/$ 演示(2024 年 Q3): Groq 通過 LPU 推論引擎向開發者提供 API 訪問,極低的延遲與高吞吐的演示在社交媒體掀起“極速 Token 生成”熱潮,使得市場開始區分“批次處理 T/$”與“即時互動 T/$”兩種需求。
- 輝達 Blackwell 釋出與推論效能飛躍(2024 年 GTC): B200 GPU 首次將 FP4 精度引入資料中心推論,宣稱相比 H100 在 LLM 推論上可實現 2–3 倍的每美元效能提升,為下一階段 T/$ 的基數躍升埋下硬體伏筆。
追蹤指標
要持續監測 T/$ 的產業動態,建議關注以下公開指標與資訊源:
- 各廠商 API 定價頁與更新公告 – 觀察輸入/輸出單價、快取、批處理折扣等變化,可最直接地感知 T/$ 走勢。
- Artificial Analysis 基準平台 – 提供跨模型、跨服務商的延遲、吞吐和價格/效能的綜合對比,包含基於價格的標準化指標。
- LLM 排行榜與 Elo 分數 – Chatbot Arena、Open LLM Leaderboard 等,用於判斷“有效 T/$”變化是否伴隨質量折損。
- 硬體與雲端服務 SKU 變化 – 關注雲端廠商 GPU 例項(如 AWS p5、GCP Cloud TPU v5e、Azure ND MI300X v5)的可用性和定價,這是自建叢集 T/$ 的底層變數。
- 科技巨頭財報電話會與 Capital Markets Day – 可瞭解推論業務在營收結構中的佔比、毛利率趨勢、資本支出方向(如自研晶片進展)。
- 開源社群與新研究 – 追蹤 vLLM、SGLang、llama.cpp 的 Star 數與 Release Notes,以及 FlashAttention、投機解碼等論文的後續進展,是判斷下一輪 T/$ 躍升的前兆。
信源
本文參考和推薦的可信信源如下(按型別和名稱排序):
行業基準與資料分析
- Artificial Analysis(https://artificialanalysis.ai/) – 模型效能與價格即時對比
- OpenRouter(https://openrouter.ai/) – 跨模型 API 聚合與成本對比
技術論文與官方技術部落格
- FlashAttention 系列(Tri Dao et al.)
- vLLM: Easy, Fast, and Cheap LLM Serving with PagedAttention(Kwon et al.)
- 投機解碼原始論文(Leviathan et al.,Google;Chen et al.,Meta)
- NVIDIA Developer Blog、Anyscale Blog、Together AI Blog
公司定價頁與官方訊息
- OpenAI、Anthropic、Google Gemini、DeepSeek、Mistral AI、Groq、Together AI 等官方網站
市場研究報告
- Fortune Business Insights,Generative AI Market Report(2024)
- SemiAnalysis、Omdia 等半導體與基礎設施研究機構報告
開源專案與社群
- GitHub: vllm-project/vllm, NVIDIA/TensorRT-LLM, huggingface/text-generation-inference, sgl-project/sglang
所有價格、效能資料均來自上述公開信源在 2024–2025 年初某個時點的快照,後續更新請以各來源最新發布為準。