輸出 token
3 秒看懂
- 定義:輸出 token(Output Token)是語言模型在生成文本時,自迴歸產生的每個最小語義單元。它可以是一個完整的單詞、一個標點符號,或一個子詞片段。
- 核心意義:使用者看到的所有模型回覆,本質上都是一串輸出 token 的序列。它是雲端廠商和模型公司計費的基準單位,也是衡量推論延遲和算力消耗的核心標尺。
- 關鍵機制:模型採用“逐個預測”的方式生成輸出 token,每生成一個新 token,都需依賴之前所有 token 的歷史資訊(通過 KV 快取實現)。因此,輸出 token 的數量直接決定了單次推論的總計算成本和視訊記憶體佔用。
3 分鐘產業解釋
在生成式 AI 的商業化版圖中,輸出 token 是模型“寫作”行為的原子化度量。使用者一個 100 字的回答,根據語言和分詞器的不同,可能對應 130 至 200 個輸出 token。對於產業而言,這個概念的商業價值體現在三個層面:
首先,它是雲端服務計費的基石。主流模型 API(如 OpenAI 的 GPT-4o、Anthropic 的 Claude 3.5 Sonnet)均採用按每百萬輸出 token 定價的模式,這是模型公司實現營收的最直接路徑。其次,它定義了硬體成本的邊界。推論晶片每秒能生成多少輸出 token(即吞吐量,Output Tokens Per Second,OTPS),直接決定了支撐同等使用者規模所需的 GPU 叢集大小和電力成本。最後,它是使用者體驗的錨點。從使用者發出請求到看到第一個輸出 token 的時間(首 token 延遲),以及後續 token 的生成速度,共同構成了使用者對模型“快”或“慢”的直觀感知。因此,整個產業鏈——從底層晶片設計到上層推論架構——都圍繞“如何更便宜、更快地產生高質量輸出 token”這一目標展開最佳化。理解了輸出 token 的成本曲線,就等於抓住了生成式 AI 商業化的脈搏。
技術原理
自迴歸生成機制
當前主流的 GPT 類大語言模型,其生成輸出 token 的過程遵循標準的自迴歸(Autoregressive)範式。整個流程可以簡化為一個迴圈迭代:
- 輸入處理:使用者的提示資訊(Prompt)首先被分詞器轉換為一系列輸入 token 序列
[t1, t2, ..., tn]。 - 首次前向傳播:模型對整個輸入序列進行一次性的前向計算,並生成第一個輸出 token
t_{n+1},同時快取每一步的 Key 和 Value 向量,形成 KV 快取。 - 迴圈生成:將
t_{n+1}拼接到序列末尾,形成新序列[t1, ..., t_{n+1}]。模型僅對最新的 token 計算 Query,並與快取的 K、V 向量進行注意力計算,生成下一個輸出 tokent_{n+2}。 - 終止條件:重複步驟 3,直到模型生成特殊的結束符(EOS,End of Sequence)或達到預設的最大長度。
KV 快取:推論成本的隱性推手
KV 快取(Key-Value Cache)是理解輸出 token 成本的關鍵技術。在標準的 Transformer 自注意力機制中,每個 token 都會生成 Query (Q)、Key (K) 和 Value (V) 向量。為了避免為歷史上文重複計算,推論引擎會將每個已生成 token 的 K 和 V 向量儲存在視訊記憶體中。
- 視訊記憶體佔用:每生成一個輸出 token,系統就需要為所有 Transformer 層快取一組新的 K 和 V 向量。對於一個 70B 引數的模型,每生成一個新 token,新增的 KV 快取量約為
2 × 層數 × 隱藏維度 × 精度位元組數。具體數值與模型架構相關,但規模通常在 MB 級別。這是長文本生成場景下視訊記憶體膨脹的主要原因。 - 計算複雜度:生成第
M個輸出 token 時,該 token 的 Q 向量需要與序列中所有N+M-1個 K 向量進行計算。因此,注意力計算的複雜度為 O(N),這裡的 N 是輸入和已生成輸出 token 的總數。這意味著,在生成一個 1000 個 token 的長回答時,最後一步的注意力計算量遠大於第一步。
取樣策略的雙面性
在生成下一個 token 的機率分佈後,模型需要通過取樣策略來挑選最終輸出的 token。這一過程直接影響生成質量和成本。
- 溫度(Temperature):降低溫度(如 0.1)會使機率分佈更尖銳,模型傾向於選擇機率最高的“安全” token,生成結果更確定但可能缺乏創造性。升高溫度(如 1.0)則使得分佈更平滑,低機率 token 被選中的機率增加,可能帶來創造性,也增加了內容重複或邏輯混亂的風險。
- Top-k/Top-p 取樣:Top-k 限制模型僅在機率最高的 k 個候選 token 中取樣;Top-p(核取樣)則從機率累加和達到閾值 p 的最小候選集合中取樣。二者都能有效避免生成低質量的尾部 token,但若設定不當(如 p 值過低),可能導致模型在狹窄的候選詞中迴圈,生成無意義的重複片段,浪費算力。
關鍵引數
評估一個系統或模型的輸出 token 生成能力,需關注以下核心引數,其數值均為公開資料或行業基準的典型範圍:
- 輸出 token 單價(Price per 1M Output Tokens):這是最直接的成本指標。截至 2024 年,主流閉源模型如 GPT-4o 約為 10 美元/百萬輸出 token,Claude 3.5 Sonnet 為 15 美元/百萬輸出 token(來源:各公司官網 API 定價頁)。開源模型的自部署成本則包含硬體折舊與電費,成本結構完全不同。
- 輸出吞吐量(Output Tokens Per Second, OTPS):衡量系統在單位時間內可生成的輸出 token 總數。通常指在特定併發數下系統的整體吞吐。單請求的生成速度則被稱為“生成速率”(Tokens/s)。高吞吐對最佳化批處理(Batching)和硬體頻寬提出了極高要求。
- 首 token 延遲(Time To First Token, TTFT):從使用者請求發出,到服務端返回第一個輸出 token 的時間。這是使用者感知響應速度的關鍵指標,通常要求在毫秒級(理想值為 <100ms)。
- Token-to-Token 延遲(Inter-Token Latency, ITL):兩個連續輸出 token 之間的生成間隔。它決定了文本是像人類打字一樣逐字出現,還是瞬間整塊出現,通常以毫秒為單位。
- 視訊記憶體頻寬(Memory Bandwidth):在推論階段,生成每個輸出 token 都需要將整個模型的權重從視訊記憶體(HBM)載入到計算單元一次。對於大引數規模模型(>100B),這一過程是典型的“記憶體頻寬瓶頸”。因此,HBM(如 HBM3e)的頻寬(單位 TB/s)直接決定了單卡的理論最高生成速度。
技術路線
針對如何降低輸出 token 的成本和延遲,業界發展出多種技術路線,其對比分析如下:
| 維度 | 標準自迴歸 | 推測解碼 | 非自迴歸生成 | 多查詢/分組查詢注意力 |
|---|---|---|---|---|
| 原理 | 逐個序列生成 token,每步都經過完整模型。 | 用小模型快速生成草稿 token 序列,再由大型模型一次性並行驗證。 | 通過設計打破自迴歸依賴,嘗試並行生成部分或全部序列。 | 多個注意力頭共享 K、V 向量,以減少 KV 快取的大小和讀寫開銷。 |
| 關鍵優勢 | 生成質量最高,是事實上的標準。 | 無質量損失,可降低 2-3 倍延遲,對批處理友好。 | 延遲極低,理論上可接近一次性生成。 | 大幅減少視訊記憶體佔用和記憶體頻寬需求,已成為模型架構標配。 |
| 主要代價 | 延遲與輸出長度線性相關,視訊記憶體佔用高。 | 需部署兩個模型,系統複雜度增加,記憶體佔用更高。 | 生成質量(尤其是文本連貫性)仍有顯著差距。 | 對模型容量有微小損失,但可通過增加其他維度補償。 |
| 成熟度 | 所有主流模型和架構均支援。 | 已集成於 vLLM、TensorRT-LLM 等主流推論架構。 | 學術研究活躍,工業界大範圍應用有限。 | 已被 GPT-3、Llama 2/3、Mistral 等廣泛採用。 |
注:上述路線並不互斥。一個現代推論引擎可同時應用推測解碼和分組查詢注意力技術。
上游
輸出 token 的成本和效率,由上游技術棧的進步直接決定。
- 算力硬體:
- 大算力邏輯晶片(GPU/TPU/LPU):是生成 token 的執行者。輝達 H100/H200/B200、AMD MI300X 等是 2024-2025 年的主力。其核心影響引數為 視訊記憶體頻寬(如 H200 的 4.8 TB/s)和 視訊記憶體容量(如 H200 的 141GB HBM3e),容量決定了可容納的最大型模型規模和 KV 快取長度(來源:NVIDIA、AMD 官網產品規格)。
- 先進封裝與互聯:CoWoS(Chip-on-Wafer-on-Substrate)封裝技術決定了 HBM 的整合度和良率,直接影響 AI 晶片的產能。NVLink 和 PCIe 等互聯技術則是建置多卡推論叢集的基礎,決定了張量並行的效率。
- 模型架構設計:
- 分詞器:其詞彙表大小和切分規則直接決定了同樣語義資訊對應多少輸出 token。例如,中文專用分詞器可比通用分詞器節省 20%-30% 的 token 消耗(行業經驗資料,非固定值)。
- 注意力機制:從標準的多頭注意力(MHA)演進出多查詢注意力(MQA)和分組查詢注意力(GQA),大幅縮減了 KV 快取的尺寸。
- 底層推論軟體/架構:
- 編譯器與核心庫(如 vLLM、TensorRT-LLM、SGLang):通過運算元融合、量化部署和 FlashAttention 演算法,實現了對硬體算力的極度壓榨。
- KV 快取管理:通過頁面注意力(PagedAttention)等技術,精細化管理 KV 快取的分配和回收,使有效吞吐量成倍提升。
下游
輸出 token 是連線模型能力與終端使用者的商業介面,其下游是龐大的應用生態。
- 大型模型 API 服務:雲端服務商(如微軟 Azure、AWS Bedrock)和模型公司(OpenAI、Anthropic)將輸出 token 的生成能力封裝為 API 服務,並按用量計費。這是當前最主流的商業模式。
- 終端 AI 應用:
- 對話助手(ChatGPT、Kimi、豆包):輸出 token 質量(準確性、邏輯性)和成本(決定免費額度上限)是核心競爭力。
- 程式碼生成(GitHub Copilot、Cursor):在程式碼場景中,使用者通過 Tab 鍵接受的一段程式碼即為一組輸出 token。其商業模式常為按月訂閱,而非直接按 token 計費。
- 內容創作/潤色:文字、圖片、影片生成工具的後端均依賴自迴歸或擴散模型的多步生成,其“步數”與 token 概念類似。
- AI 原生工作流:
- AI 智慧代理(Agent):一個任務可能涉及數百次模型呼叫(思考、工具呼叫、總結),每次呼叫都產生輸出 token。這使得單任務的總 token 消耗比單輪對話高出數個量級。
- 檢索增強生成(RAG):系統先檢索外部文件,再將其作為上文交由模型生成輸出 token。這種模式下,輸出 token 的質量和事實性得到提升,但輸入 token 的量級也會激增。
受益公司
輸出 token 需求的指數級增長,清晰勾勒出一條受益產業鏈,涉及多個環節的上市公司(截至 2024 年公開財報年份)。以下分析不構成任何投資建議。
- 模型與應用層:
- 微軟 (FY2024):Azure AI 服務的增長主要由 GPT 系列模型的推論 token 消費驅動,是 OpenAI 輸出 token 商業化的最大受益方和主要渠道。
- Meta (2024 FY):雖不以 API 直接變現,但其開源 Llama 系列模型催生了龐大的第三方推論生態,由此間接拉動底層算力需求,鞏固其 AI 基礎設施戰略。
- 算力硬體層:
- 輝達 (FY2025, 截至 2024 年 7 月):資料中心業務超 80% 的營收與大規模推論叢集相關,H100/H200 GPU 是生成輸出 token 的事實標準硬體。
- AMD (2024 FY):MI300X 加速卡憑藉更高的 HBM 容量和價效比,開始進入推論市場,直接與輝達爭奪雲端大廠和 AI SaaS 公司的訂單。
- 博通 (FY2024):為Google等超大規模客戶定製 AI 推論 ASIC(如 TPU),其定製化晶片業務營收因推論需求的擴張而高速增長。
- 推論服務層:
- Cloudflare / Fastly:邊緣推論服務商,通過在靠近使用者的邊緣節點部署模型,可顯著降低首 token 延遲,適用於對即時性要求極高的應用場景。
市場規模
關於輸出 token 的直接市場規模,公開資料相對有限,通常隱含在更大的雲端服務或 AI 軟體市場預測中。以下為基於第三方機構(如 Gartner、IDC)2024 年公開發布報告的趨勢性分析和估算,口徑為全球市場。
- 雲端 AI 推論市場:作為雲端基礎設施即服務(IaaS)和平台即服務(PaaS)的一部分,2024 年全球市場規模預計達到 350 億至 450 億美元(來源:IDC, Worldwide AI Infrastructure Tracker, 2024 H1)。其中,生成式 AI 的推論(即輸出 token 的生成服務)所佔份額正快速擴張,預計在 2025 年將超過訓練市場。
- AI 晶片:輝達 2024 財年資料中心營收為 475 億美元(來源:NVIDIA FY2024 10-K),其中推論相關(含推薦系統和 AI 生成)佔比約 40%。這一數字直接反映了為輸出 token 而採購的硬體支出規模。
- 價格趨勢:從 2023 年初至今,頭部閉源模型的輸出 token 單價已下降超 80%(來源:各公司 API 定價公告)。然而,總支出並未下降,反而隨著多模態、長上下文和 Agent 等新應用的出現而爆發式增長,呈現出典型的“傑文斯悖論”特徵。
玩家對比
主流模型的輸出 token 成本與能力定位存在顯著差異(資料來源:各公司官網 2024 年公開 API 定價,開源模型為自部署估算成本,僅作示例):
- OpenAI (GPT-4o):全球最高吞吐量之一,多模態原生。輸出價格:$10.00/1M tokens(128K 上下文)。定位:全能型高階標杆。
- Anthropic (Claude 3.5 Sonnet):在複雜推論與長文本連貫性上領先。輸出價格:$15.00/1M tokens(200K 上下文)。定位:安全可信的高階選擇。
- Google (Gemini 1.5 Pro):依託 TPU v5p 成本優勢,原生多模態與超長上下文(2M)。輸出價格:$10.50/1M tokens(<128K 上下文)。定位:高性價比、長文本專家。
- Meta (Llama 3.1 70B/405B):完全開源,無 API 收費。自部署輸出 token 成本主要取決於硬體利用率,如在 4 張 H100 上估計為 $2.00-$3.00/1M tokens(Semianalysis, 2024 年報告估算)。
- DeepSeek (V2):採用 MoE 架構,在模型層實現極致降本。API 輸出價格:¥1.00/1M tokens(約 $0.14/1M tokens)。定位:市場價格顛覆者。
風險
- 同質化與價格戰:各家基礎模型在輸出質量上的差距正在縮小,導致 API 定價成為主要競爭手段。截至 2024 年底,中國市場已出現低於成本的輸出 token 價格競標,可能影響行業創新與長期盈利能力。
- “幻覺”帶來的消耗風險:有缺陷的或惡意的使用者提示可能導致模型進入迴圈(Loop)狀態,重複生成毫無意義的輸出 token。在 Agent 鏈式呼叫中,這類無效 token 消耗會被急劇放大,徒增成本。
- 單位經濟模型的不確定性:輸出 token 的硬體基礎設施投入巨大,但 token 價格快速下降。行業普遍面臨從“以 token 數量為營收”向“以 token 創造的價值為營收”的模式轉型,初期探索面臨較大不確定性。
- 資料隱私與安全合規:在生成輸出 token 的過程中,嚴格的審查機制可能導致額外延遲。金融、醫療等垂直行業的監管條例會對輸出 token 的用途和儲存提出具體規定,成為商用化落地的主要屏障之一。
誤讀糾偏
- “輸出 token 的計算成本與輸入 token 相同”:這是極其普遍的誤解。輸入 token 在預填充階段可利用平行計算,單個 token 的平均算力消耗較低。而輸出 token 必須序列生成,且每一步都需訪問完整的模型權重和不斷增長的 KV 快取,其單 token 算力開銷和視訊記憶體瓶頸遠大於輸入 token。在推論經濟學中,輸出 token 是成本的主體。
- “一個輸出 token 就是一個單詞”:錯誤。token 是由位元組對編碼或多語言分詞器處理後的最小單元。對英文而言,平均 1 個 token 約等於 0.75 個單詞;對中文,1 個 token 約為 1.5-2 個漢字。當用戶按“字數”估算成本時,與實際 token 數會計費會有顯著偏差。
- “模型輸出越長,代表越聰明”:存在偏差。增加輸出 token 數量並不等同於提供更準確或智慧的答案。許多工要求模型在極短的 token 長度內給出高精度的答案(如程式碼補全、簡短翻譯)。冗長的回覆不僅增加延遲和成本,還可能引入更多“幻覺”。
- “MoE 模型的每個輸出 token 都需 All-to-All 通訊”:不完全準確。MoE(混合專家)模型中,每個輸出 token 僅由路由網路分配的少數幾個專家處理,並非所有專家都參與單 token 計算。All-to-All 通訊主要發生在路由分配階段,而非每個 token 本身的加解密計算過程中。
最新事件
- OpenAI 歷史性融資及推論需求(2024 年 10 月):OpenAI 完成 66 億美元融資,估值達 1570 億美元。公司宣告資金將用於加速包括推論在內的前沿計算能力建設。其 CFO 公開表示,即使模型不斷降價,客戶總推論消費仍在快速攀升(來源:彭博社)。
- NVIDIA Blackwell (B200) 架構釋出(2024 年 3 月):號稱在大型模型推論效能上可達 H100 的 30 倍,支援 FP4 精度,旨在極大降低生成每個輸出 token 的能源成本和總擁有成本。雲端大廠大規模部署後,預計將在 2025 年進一步拉低高階模型推論價格(來源:NVIDIA 新聞稿)。
- 中國大型模型 API 價格戰(2024 年 5 月後):字節跳動、阿里巴巴、百度、騰訊等先後大幅下調旗下大型模型 API 的輸出 token 價格,部分輕量級模型甚至宣佈免費。DeepSeek V2 的釋出點燃戰火,將百萬 token 價格拉至人民幣個位數,市場進入“釐時代”。
追蹤指標
要持續追蹤輸出 token 的產業動向,可關注以下量化指標和公開資訊源:
- API 定價公告:密切關注 OpenAI、Anthropic、Google Cloud、國內各雲端廠商官網的 API 定價變更,這是行業成本走向最直接的訊號。
- 硬體評測(MLPerf Inference):MLCommons 組織的機器學習推論基準測試,會公佈不同硬體在不同模型下的離線吞吐量和伺服器場景延遲得分,是衡量輸出 token 硬體效能的權威對比(來源:mlcommons.org)。
- 雲端廠商財報電話會:Microsoft(Azure AI 增速)、Google(GCP 的 AI 貢獻)、Amazon(AWS Bedrock 客戶採用率)的季度財報,可提煉出推論業務的宏觀增長指標。
- 技術前沿論文:關注 arXiv 上關於高效推論的論文(如新的量化、推測解碼、KV 快取壓縮方法),這是判斷成本下降曲線未來斜率的關鍵研發風向標。
- 開源架構的社群採納:vLLM、SGLang 等推論架構的 GitHub Stars 和貢獻者增長曲線,可反映開發者對輸出 token 效能最佳化和成本控制的集體關注度。
信源
- Vaswani, A., et al. (2017). “Attention Is All You Need.” arXiv preprint. —— Transformer 與自注意力理論基礎。
- Leviathan, Y., et al. (2023). “Fast Inference from Transformers via Speculative Decoding.” ICML 2023. —— 推測解碼原理與效能分析。
- Kwon, W., et al. (2023). “Efficient Memory Management for Large Language Model Serving with PagedAttention.” arXiv preprint. —— vLLM 架構的核心機制。
- OpenAI API Pricing. (2024). https://openai.com/api/pricing/.
- Anthropic API Pricing. (2024). https://www.anthropic.com/pricing.
- NVIDIA H200 Tensor Core GPU Datasheet. (2024). —— 視訊記憶體頻寬與容量規格。
- AMD Instinct MI300X Accelerator Product Brief. (2024). —— 推論硬體規格。
- Gomez, A. (2024). “NVIDIA Blackwell Platform Arrives to Accelerate AI.” NVIDIA Blog.
- MLCommons Inference Results. (2024). https://mlcommons.org/benchmarks/inference-datacenter/.
- Bass, D. & Love, J. (2024). “OpenAI Closes Historic $6.6 Billion Funding Round.” Bloomberg.