訓練 token 數
3 秒看懂
“訓練 token 數”是衡量大語言模型“閱讀量”的核心指標。一個 token 約等於 0.75 個英文單詞或 1–2 個漢字。它直接決定模型的知識儲備、推論強度與訓練成本。同等架構下,訓練 token 越多,模型能力越強,但邊際收益服從 Chinchilla 縮放定律——無限堆 token 並不經濟。當前前沿模型已從千億級 token(GPT‑3 約 300B)邁入十萬億級時代(LLaMA 3 超 15T,部分多模態模型超 50T)。該指標把資料規模、算力開銷、訓練時長捆在一起,是衡量大型模型“起跑線”的第一把尺子。
3 分鐘產業解釋
訓練 token 數指模型完整訓練週期內實際參與正向與反向傳播的 token 總個數,通常以 B(10⁹)或 T(10¹²)為單位。它不等於磁碟上的原始資料集大小——原始語料經過去重、過濾、分詞後,實際可用的 token 數通常只有原始資料的 30%–60%(行業經驗,2023 年 Common Crawl 到可用訓練語料的轉化率約 40%–50%,RedPajama‑v2 公開流水線觀察也佐證類似比例的損耗)。
在產業實踐中,訓練 token 數與引數量共同決定總算力預算。根據 2022 年 Hoffmann 等提出的 Chinchilla 定律,在固定計算量 C 下,每一個引數最優配比約 20 個訓練 token。然而 2023–2025 年產業明顯偏向“過度訓練”(overtraining),即在較小模型上喂入遠超 20:1 的 token,追求更優推論成本和部署靈活性。例如 Meta 在 2024 年公開的 LLaMA 3 系列 8B 和 70B 模型均使用超 15T token 進行訓練,D/N 比達數百比一(來源:Meta 2024 技術報告《The Llama 3 Herd of Models》)。這意味著訓練 token 數的競爭已不只是算力競賽,更是資料工程與合成數據能力的角力。
訓練 token 數還直接換算成 GPU‑時。以 Chinchilla 公式近似,1T token 在訓練一個 70B 密集模型時約需 6×10²³ FLOPs 量級(正向 2N + 反向 4N = 6N per token),實際叢集利用率假設 50%(包含通訊、故障恢復),需要數千張 H100 GPU 連續執行數週乃至數月,成本可達數千萬美元(2024 年雲端運算租用價格估算;SemiAnalysis 等對 10T+ 訓練叢集成本拆分,推算約 0.5 億–1.5 億美元量級)。因此訓練 token 數的擴大不僅壓迫資料供應鏈,更直接推高硬體採購、能源消耗與資料中心投資。
技術原理
1. Tokenization 流水線 文本 token 化通過位元組對編碼(BPE)或 SentencePiece 等分詞器,將自然語言切分為子詞序列。詞表大小直接決定相同語義內容對應的 token 數量:GPT‑4 所用 tiktoken 詞表約 100k,LLaMA 系列早期 32k、LLaMA 3 升至 128k(來源:公開技術報告),同一段中文語料,LLaMA 3 的 token 數可能比 GPT‑4 少 10–20%。跨模型對比訓練 token 數時必須注意詞表偏差。
影像、音訊等多模態資料則通過獨立編碼器(如 ViT 的 patch embedding、VQ‑VAE 的離散編碼)轉換為視覺 token 或音訊 token,這些 token 的資訊密度與文本 token 根本不同,但當前業界常將二者簡單加總為“總訓練 token 數”,標準化折算方法尚屬空白。
2. 資料飛輪與 token 形成 原始資料(PB 級)進入訓練前必經多道工序:文件級/段落級去重(MinHash、SimHash)、質量過濾(困惑度評分、語言識別、有害內容篩除)、分詞、序列打包(packing,將短序列拼接至最大上下文長度以提高 GPU 利用率),最後按知識、程式碼、數學、多語言等比例混配成批次。這幾步造成的 token 損耗在開源專案 Dolma、RedPajama‑v2 中有公開日誌:從 Common Crawl 原始 WARC 檔案到最終訓練 token,縮減比例約 50%–70%。
3. 訓練中的 token 消費 在訓練迴圈中,每個 token 依次經歷前向與反向傳播,消耗固定的 FLOPs(引數量決定)。現代訓練系統通過流水線並行、張量並行、資料並行將 token 批次拆分到數千 GPU 上;梯度累積步數允許在保持有效批大小不變的情況下降低視訊記憶體開銷。對於 MoE 模型,每 token 僅啟用部分專家,有效計算量低於等效密集模型,但 token 路由與跨節點 All‑to‑All 通訊會帶來額外的延遲和頻寬消耗。這意味著 MoE 模型在相同硬體環境下可處理更多訓練 token,但真實吞吐增益需扣除通訊開銷。
4. 退火與重複 token 的價值 訓練後期,研究團隊常引入極少量(幾億到幾百億)極高品質 token 進行退火(annealing),並以衰減的學習率反覆訓練(通常 1–3 個 epoch)。DeepSeek‑V2 技術報告(2024 年 arXiv:2405.04434)就提到在退火階段引入高質量對話與推論資料,雖 token 數佔比極小,卻對指令跟隨、安全性和事實準確度提升顯著。這種“質量槓桿”效應說明 token 數指標需要與 token 質量聯合評估。
5. 合成 token 的進入 從 2023 年起,合成數據被大規模用於彌補自然資料枯竭。合成 token 由另一 AI 模型生成(如使用 GPT‑4 生成推論鏈、數學題解),經清洗後混入訓練語料。其生成成本遠低於人工標註,但可能引入模型崩潰(model collapse)風險——反覆在合成數據上訓練會導致分佈塌縮(Nature 2024 年相關論文警示)。目前行業尚無公認標準來計量合成 token 的“有效當量”。
關鍵引數
- 訓練總 Token 數(D):最常用的公開指標,以 T 為單位。未標註清洗損失時,通常指資料加權後的有效 token 總數。
- Token‑引數比(D/N):衡量過度訓練程度。Chinchilla 最優線約 20:1,2024–2025 年多數前沿模型 D/N 超 100:1,部分小模型達到 1000:1 以上。
- 資料重複度(epochs):同一資料被重複訓練的平均次數。理想狀態下 epochs < 1,表示資料量充足。LLaMA 3 15T 的訓練據稱所有資料 epoch 數小於 1(Meta 2024 報告暗示)。
- 有效 token 率:原始資料轉化為訓練 token 的比例,反映資料工程效率,常見值 0.3–0.7。
- Token 質量評分:基於資料來源的教育價值、事實密度、多樣性等進行加權評分。例如教科書、維基百科、ArXiv 論文的評分通常數倍於普通網頁。行業內無統一標尺,各實驗室自建評估器。
- 長上下文 token 佔比:使用 32k、128k 乃至 1M 上下文訓練時,長序列 token 佔整體 token 的比例。長上下文利用不足則浪費算力。
- 多模態 token 當量係數:試圖換算視覺/音訊 token 對文本能力的貢獻,目前尚無公認標準,各廠商研究階段(公開資料未見統一值)。
技術路線
大型模型訓練 token 數與架構的選擇形成幾條鮮明路線:
| 路線 | 代表案例 | D/N 比 | 優勢 | 挑戰 | 技術特徵 |
|---|---|---|---|---|---|
| 密集小引數量 + 海量 token | LLaMA 3 8B (15T);Mistral 7B v0.3(推測約 6–8T) | 數百至上千 | 推論成本極低,部署靈活 | 資料需求極大,過擬合風險}需合成數據補充 | 極致最佳化推論,適合端側與邊緣 |
| 密集大引數量 + 適中 token | Chinchilla‑70B (1.4T);早期 GPT‑4 推測 | 20:1 附近 | 引數利用率理論最優 | 推論昂貴,部署成本高 | 遵循縮放定律,研究基準 |
| MoE 稀疏 + 高 token | DeepSeek‑V2/V3;Mixtral 8x22B;Qwen2.5‑MoE 系 | 相對啟用引數 40:1–100:1 | 總引數量大,訓練效率高 | 專家負載均衡困難,通訊開銷大 | 每 token 僅啟用部分引數,等效引數量大 |
| 多模態混合 token | Gemini 系列;GPT‑4o;影片生成模型 Sora 類 | 文本與視覺 token 混計,D/N 難統一 | 多模態原生能力 | token 資訊密度不一,效用難橫向對比 | 將影像、影片畫素轉化為離散 token,與文本混合訓練 |
2024 年以來,“過度訓練 + 多階段退火”成為主流策略,且多模態模型普遍將視覺 token 直接納入訓練總 token 中。例如,某多模態模型可能宣稱訓練 token 數達 50T,但其中 70% 是視覺 token(公開資料未見精確比例,系行業合理推測)。這導致定義出現泛化,投資分析和研究對比時須拆分文本與多模態 token。
上游
訓練 token 數的膨脹直接拉動上游產業鏈:
- 資料獲取:Common Crawl 等網路爬蟲每月採集數量 PB 級原始網頁。此外書籍、新聞媒體、學術論文、程式碼倉庫(GitHub)及合成數據平台構成主要語料來源。版權法規(如歐盟 DSM 指令、美國生成式 AI 版權白皮書)正日益收緊,合規獲取成本上升。
- 清洗與標註:資料清洗服務商(Scale AI、Appen、Surge AI 等)按 token 或按時計費,提供去重、過濾、事實性驗證等。2024 年資料加工市場規模約 35 億–50 億美元(Grand View Research 2024 年針對 AI 資料服務報告),預計 2025–2026 年以 25%–35% CAGR 增長。合成數據生成平台(如 Gretel、Hazy)提供低成本 token 補充。
- 分詞工具:tiktoken、HuggingFace tokenizers、SentencePiece 等詞表建置與 token 化工具是資料流水線的樞紐,效能直接影響資料吞吐。
- 儲存與網路:PB 級資料湖與高速分散式檔案系統(如 Weka、NetApp)加 InfiniBand / RoCE 網路是訓練叢集的標配。每增加 10T token 意味著訓練前需要約 5–20 PB 的原始資料暫存,資料載入 I/O 瓶頸愈發突出。
- 算力硬體:NVIDIA H100/H200/B200 系列 GPU、AMD MI300X 等加速晶片是 token 消費的引擎。2024 年單張 H100 在密集模型訓練中典型吞吐約為每秒數萬 token(與模型大小、序列長度相關;SemiAnalysis 測試 70B 模型在 256 H100 叢集上每秒約 100 萬–200 萬 token 量級)。訓練 10T token 所需 GPU‑天與 GPU 成本直接推動 NVIDIA 資料中心業務營收 2025 財年(截至 2024 年 7 月)已年增率翻倍至超 400 億美元(NVIDIA 財報)。
下游
- 模型能力提升:MMLU、HumanEval、MATH、長文理解等評測分數與訓練 token 數呈對數線性關係。Google DeepMind 在其 2023 年論文中展示,同樣引數量下,訓練 token 每增加 10 倍,MMLU 得分提升約 3–5 個百分點(模型與資料配比相關,非絕對)。
- 微調生態:基模型訓練 token 越充分,下游微調所需 token 越少。例如 2024 年 Qwen2.5‑7B 僅需千條指令即達到優秀對齊水平(阿里雲端公開技術部落格),顯示預訓練 token 的規模紅利。
- 合成數據生成閉環:強基模型被用於生成新訓練 token(推論鏈、程式碼解釋、學科問答),再餵養給次代模型或小模型蒸餾,形成資料飛輪。該模式由 OpenAI、Google 等大廠主導,2024 年已出現專門售賣 AI 生成訓練 token 的初創企業(如 Unsloth 等)。
- 推論降本:充足訓練 token 使較小模型能達到此前只有大型模型才有的能力,降低推論成本。例如 7B 模型在 15T token 訓練後在部分任務上效能媲美 70B 舊模型,極大推動端側 AI 和消費電子本地模型部署。
- 算力與能源消耗:每額外 10T token 訓練(密集模型)帶來約數千萬至上億美元增量硬體投資,拉動資料中心建設、電力、冷卻需求。2024 年全球資料中心用電量中 AI 相關佔比估計約 5%–8%(IEA 2024 電力報告),且快速上升。
受益公司
| 類別 | 代表企業 | 受益邏輯 | 公開數字/口徑(2024 年) |
|---|---|---|---|
| 大型模型開發商 | OpenAI、Google、Anthropic、Meta、阿里、字節跳動 | 直接擴大訓練 token 數提升模型競爭力 | Meta LLaMA 3 公開訓練 token 15T+;Qwen 2.5 文件顯示多階段 18T(2024 年部落格);OpenAI、Google 未公開具體 token 數 |
| GPU 及加速晶片 | NVIDIA、AMD | 訓練 token 增長推動 GPU 出貨量 | NVIDIA 資料中心營收 FY25 Q2 $26.3B,年增率 +154%(NVIDIA 2024 年 8 月財報) |
| 雲端基礎設施 | AWS、Azure、GCP、CoreWeave | 大型模型訓練/推論雲端服務營收爆發 | 三大雲端廠商 2024 年 Q2 合計 AI 相關營收增長顯著,Azure AI 服務年增率增長 ~30%(微軟 2024 年 Q4 FY24 財報口徑) |
| 儲存與網路 | 博通、Marvell、Arista | GPU 叢集對高速互聯和存力需求劇增 | 博通 2024 財年 AI 網路營收超 $10B(博通 2024 年 12 月財報) |
| 資料工程 | Scale AI、Appen、Labelbox | 資料清洗與合成 token 服務需求上升 | Scale AI 2024 年估值 $13.8B(二級市場資料 2024 年 5 月),年合同營收年增率大幅增長 |
| 能源與基建 | 施耐德、Vertiv、NextEra Energy | 訓練中心電力與冷卻需求猛增 | 相關公司企業價值與資料中心簽約容量增長,施耐德 2024 年有機增長超 10%(公司展望) |
部分未上市公司(如 OpenAI、Anthropic)未揭露財務細節,市場份額和 token 相關營收僅是機構估算,實際資料待核實。
市場規模
訓練 token 對應的直接市場包括資料採購清洗、算力租賃及相關基礎設施,目前缺乏專門針對“訓練 token”的獨立市場統計,但可以從算力與資料市場拆分估算。
- 資料服務市場:據 Grand View Research 報告(2024 年 3 月),全球 AI 資料服務市場規模 2023 年約 28 億美元,預計 2024 年約 35 億–40 億美元,2025 年將超 50 億美元,2023–2030 年複合增長率約 26%。其中涉及訓練 token 準備(清洗、標註、合成)的份額約佔六成。
- 訓練算力市場:訓練 token 消耗的 GPU‑時。2024 年全球 AI 訓練晶片市場約 500 億–600 億美元(包含 NVIDIA、AMD 產品及雲端訓練服務折算,主要依據 NVIDIA 2024 年資料中心營收減去一定比例推論折算;SemiAnalysis 測算推論佔比約 50%–60%,訓練佔 40%–50%),按此推算訓練側規模約 250 億–300 億美元。訓練 token 每增長一個數量級,該細分市場同步擴充套件。
- 多模態 token 增量:影片生成模型(如 Runway、Pika、Sora)對視覺 token 的消耗是文本模型的幾個數量級。據 Epoch AI 2024 年估算,影片模型單次訓練 token 可輕鬆達到百萬億量級(如果影片幀被離散化),其市場初具雛形,相關算力需求將成為未來 3–5 年重要增長極。
注:以上市場規模為多方資料交叉估算所得,並非精確統計。具體口徑已標註,市場界定因人而異。
玩家對比
基於公開資訊,對比 2024 年底各代表性模型的訓練 token 數及相關引數:
| 模型 | 引數量 | 公開訓練 token 數 | D/N 比(文本) | 多模態 token? | 來源 |
|---|---|---|---|---|---|
| LLaMA 3.1 (8B) | 8B dense | 15T+ | ~1875:1 | 純文本 | Meta 2024 技術報告 |
| LLaMA 3.1 (70B) | 70B dense | 15T+ | ~214:1 | 純文本 | 同上 |
| Qwen2.5‑7B | 7B dense | 18T(多階段) | ~2570:1 | 純文本 | 阿里雲端 2024 年 9 月技術部落格 |
| DeepSeek‑V2 | 236B(啟用 21B) | 8.1T(文本) | 相對啟用引數 ~386:1 | 否 | DeepSeek 2024 年 arXiv:2405.04434 |
| Mistral Large 2 | 123B | 未公開 | 推測數十 T | 否 | 公開資料未見確切資料 |
| GPT‑4 Turbo | 未公開 | 未公開,推測數十 T | 無資料 | 多模態 | 未公開 |
| Gemini 1.5 Pro | 未公開 | 未公開(包含大量多模態資料) | 無資料 | 多模態原生 | Google 部落格 2024 年揭露架構但未公佈 token 量 |
| Claude 3.5 Sonnet | 未公開 | 未公開 | 無資料 | 多模態 | Anthropic 未公開訓練細節 |
橫評可見:開源社群傾向公開 token 數以展示透明度;閉源大廠對 token 數秘而不宣,但一般認為整體 token 量級已達數十萬億。多模態玩家因引入視覺 token,總 token 數往往畸高但難以對比。投資者追蹤模型能力提升時,應結合 token 質量與評測成績,而不僅看絕對 token 數量。
風險
- 資料枯竭與質量瓶頸:Epoch AI 在 2024 年預測,高質量文本資料可能在 2026–2028 年消耗殆盡,屆時訓練 token 的增長將更多依賴合成數據或多模態 token,可能帶來模型能力強均衡但事實準確度下降的困擾。
- 合成數據退化風險:基於合成 token 反覆訓練可能導致模型分佈塌縮,準確性降低。Nature 2024 年相關研究已引發警覺,監管機構可能對合成資料比例設定上限。
- 版權與合規成本:全球資料版權訴訟頻發(如紐約時報訴 OpenAI 案 2023 年年底提起),可能導致部分高質量 token(受版權保護的書籍、新聞)被剔除,抬高合法資料獲取成本,減慢 token 累積速度。
- 算力投資回報不確定性:訓練 token 數繼續指數增長可能面臨邊際能力提升趨近飽和,鉅額算力投入可能難以轉化為對應的模型能力躍升,影響資本回報預期。
- 多模態 token 的泡沫:大量視覺 token 可能掩蓋文本能力的真實進展。如果把影像 token 簡單計入總 token 數,投資者可能高估模型的語言理解能力,導致資源錯配。
- 地緣政治與出口管制:高階 GPU 對中國企業的出口限制(如 2023 年 10 月美國 BIS 規則)直接鉗制部分廠商擴大訓練 token 的能力,造成國內外 token 能力差距可能拉大。
誤讀糾偏
-
誤讀:“訓練 token 越多,模型必定越強” 糾正:質量比數量更重要。1T 高質量、高多樣性 token 的綜合效果遠超 10T 低質重複資料。後期退火加入的高質量 token 雖僅佔總量千分之幾,卻可能顯著提升指令跟隨和安全性。重複過多還會導致模型過擬合,泛化能力下降(DeepSeek 技術報告中均強調資料重複對效能的傷害)。
-
誤讀:“MoE 模型的 token 數等效於密集模型” 糾正:MoE 模型每次僅啟用部分專家,同等訓練 token 數下,每個 token 的有效計算量較低。對比時應以“啟用引數每 token 計算量”作為公平標尺,或直接參照最終能力與成本比。否則會嚴重低估密集模型的 token 實效。
-
誤讀:“總訓練 token 數可以跨模型橫向直接比較” 糾正:分詞器、資料管道、多模態 token 佔比、重複率等因素各不相同,簡單的總數對比可能誤導。行業慣例是區分文本 token 與多模態 token,並註明資料重複度。
-
誤讀:“合成 token 等同於真實 token” 糾正:合成 token 在事實密度、多樣性和分佈完整性上有缺陷,不宜完全等同於源自真實人類生成的 token。當前業界對合成資料的有效當量尚無統一折算係數。
最新事件
- 2024 年 7 月:Meta 釋出 LLaMA 3.1 405B,雖未增加訓練 token(15T 同 LLaMA 3),但通過更優資料混合與後訓練提升效能,顯示 token 數不是唯一變數。
- 2024 年 9 月:阿里雲端 Qwen2.5 系列釋出,訓練 token 達 18T(多階段),在與相同引數量的 LLaMA 3 對比中部分任務勝出,高質量 token 的選擇和配比被強調為核心優勢。
- 2024 年 10 月:Epoch AI 釋出更新的資料預測,指出現有網際網路高質量文本資料將在 2027 年左右進入存量消耗階段,合成數據佔比快速上升,並呼籲出臺 token 質量揭露標準。
- 2024 年 12 月:NVIDIA 釋出 B200 及 GB200 平台,宣稱在大型模型訓練任務上 token 處理吞吐較 H100 提升 4 倍,這將顯著降低訓練超大規模 token 數的成本,可能催生新一輪 token 競賽。
- 2025 年 1 月:中國某大型模型開發商據外媒報道(未經官方確認)正訓練超 100T token 的多模態模型,若屬實將創公開記錄,但官方未回應(公開資料未見官方確認)。
- 2023–2024 年多起版權訴訟:以《紐約時報》訴 OpenAI 為代表,對使用版權材料訓練 token 的合法性提出挑戰。2024 年部分資料經銷商已開始提供經版權授權的 token 資料產品,定價高於普通清洗資料數倍至數十倍。
追蹤指標
- 新發布模型的公開訓練 token 數:持續關注 Meta、阿里、Mistral、DeepSeek 等開源/半開源玩家的技術報告,獲取真實 D 值。
- D/N 比變化趨勢:每月彙總典型模型的 D/N 比,判斷行業對過度訓練的偏好演進。
- 優質文本資料餘量預估:追蹤 Epoch AI、Allen AI 等機構的資料存量報告,評估資料枯竭時間線。
- 合成數據佔比與模型退化案例:監控學術界關於模型崩潰的研究論文及實際模型失敗案例。
- 訓練晶片出貨量與雲端訓練營收:NVIDIA 季度資料中心營收、AMD 資料中心 GPU 銷售、三大雲端廠商 AI 訓練營收增速,驗證 token 增長轉化為硬需求。
- 多模態 token 標準化進展:關注 ISO/IEC 等機構對 AI 資料度量標準的制定,或行業聯盟(如 Frontier Model Forum)的揭露指南。
- 版權法案動態:歐美及中國對於 AI 訓練使用受版權保護資料的立法進展,直接決定可用的高質量 token 池大小。
- 單 token 訓練成本:由 GPU 小時價格和訓練吞吐估算,近似 = (叢集攤銷成本 + 電力成本) / (有效 token 吞吐 * 訓練時間),作為衡量資料工程效率的衍出指標。
信源
- Hoffmann, J. et al. (2022). Training Compute‑Optimal Large Language Models. arXiv:2203.15556。— Chinchilla 縮放定律核心文獻。
- Touvron, H. et al. (2023). LLaMA 2: Open Foundation and Fine‑Tuned Chat Models. arXiv:2307.09288;Meta (2024). The Llama 3 Herd of Models. — 展示高 D/N 比實踐。
- DeepSeek‑AI (2024). DeepSeek‑V2: A Strong, Economical, and Efficient Mixture‑of‑Experts Language Model. arXiv:2405.04434。— MoE + 高 token 訓練例證。
- Alibaba Cloud (2024). Qwen2.5 Technical Blog & Report — 18T token 多階段訓練公開說明。
- Epoch AI (2023–2025). Data & Compute Trends in Large‑Scale AI. epochai.org — 資料存量與短缺預測。
- Common Crawl (2024). Crawl Statistics;RedPajama‑v2、Dolma 資料工程日誌 — 提供真實 token 轉化率參考。
- SemiAnalysis (2024). AI Cluster & Cost Model — 訓練 token 成本估算依據。
- Grand View Research (2024). AI Data Services Market Analysis Report — 資料服務市場規模。
- NVIDIA Corporation (2024). FY25 Quarter 2 Financial Results — GPU 資料中心營收資料。
- IEA (2024). Electricity 2024 — 全球資料中心電力消費與 AI 佔比估算。
宣告:本文所含市場資料、財務數字及公司估值均來自公開財報、行業報告及專業媒體估算,已盡力標明年份、口徑與來源。部分數字因企業未完整揭露,仍屬於行業合理推算,僅供參考,不可直接作為投資依據。不構成任何買賣建議或漲跌預測。