模型層 開放閱讀

訓練語料

Training Corpus

概念 ID
training-corpus
更新時間
2026-05-29
來源數量
待補

訓練語料

3 秒看懂

訓練語料是模型學習世界知識的“教材”——包含文本、程式碼、影像等多源資料的集合。它的質量、規模與配比直接決定模型的語言能力、知識邊界與安全對齊水平。當前產業核心矛盾已從“缺算力”轉向“缺高質量資料”,版權合規、偏見過濾與資料汙染正成為大型模型產業鏈最敏感的成本項與壁壘環節。

3 分鐘產業解釋

訓練語料遠非“把網頁下載下來”那麼簡單。一條工業級資料管線通常包含多源採集(Common Crawl、書籍、學術論文、程式碼庫、人工標註對話等)、語言與格式清洗、去重(文件級與段落級)、質量過濾(基於困惑度、可讀性評分、規則與分類器)、隱私脫敏、毒性/偏見過濾,最後按特定比例混合配比。

主流千億引數大型模型的預訓練語料動輒數萬億 Token。據公開技術報告,Meta 的 LLaMA 2 訓練於約 2 萬億 Token;DeepMind 的 Chinchilla 使用約 1.4 萬億 Token(論文《Training Compute-Optimal Large Language Models》, 2022)。處理規模和工程複雜度直接決定入局門檻——據估計,僅原始資料儲存與清洗的硬體成本即可達數百萬美元級別(未計入版權獲取費用),這使得訓練語料工程已成為頭部廠商與追趕者之間的第一道分界線。

產業意義上,訓練語料已從“前期準備工作”演化為獨立的壁壘性環節。一方面,高質量長文本(書籍、學術論文、判例文書)天然稀缺且版權訴訟不斷升級;另一方面,合成數據(用大型模型生成訓練資料)正在成為補充手段,但仍面臨事實性錯誤和分佈偏移等固有缺陷。整個資料工程市場正從勞動密集型標註向自動化、智慧化的資料治理平台方向加速演進。

技術原理

訓練語料建置的本質是一個大規模統計訊號篩選問題,目的是在有限計算預算內獲得能最大程度提升下游泛化能力的資料分佈。從數學視角看,這是一個重要性取樣(Importance Sampling)過程:模型開發者無法獲得理想的“概念分佈” p_{ideal},只能從易取樣的粗糙分佈 p_{web}(網際網路文本)中,通過權重函式 w(x) 篩選出近似分佈 q(x) = w(x)p_{web}(x),使得 q 在訓練後達到儘可能低的泛化損失。

關鍵資料工程演算法與機制

模糊去重(MinHash):將文件 d 通過一組雜湊函式對映為 MinHash 簽名。對任意兩個集合 A,B,Jaccard 相似度 J(A,B) = frac(|A \cap B|){|A \cup B|} 達到閾值(通常為 0.8)即視為重複。該方法能在亞線性時間內在數十億文件間找出近似重複對,是大規模去重的核心演算法。據開源專案 text-dedup 的工程報告,MinHash 可剔除語料庫中 20%-40% 的冗餘內容,顯著提升模型泛化能力。

基於困惑度的質量分:用一個預先訓練的小語言模型計算文本困惑度(Perplexity);若困惑度過高(過於雜亂、無意義)或過低(過於簡單、疑似模板垃圾)則被剔除。這實際是根據語言模型似然度 P_{LM}(text) 為每條文本打分並篩除離群點。產業實踐中,該閾值通常經人工抽檢校準,以避免誤刪方言文本或稀有領域術語。

資料混合與 Scaling Laws:Chinchilla 定律指出,測試損失 L 與模型引數量 N 和資料量 D 遵循 L = (frac(A){N})^{\alpha} + (frac(B){D})^{\beta} + E。早期工作重點關注計算最優分配(給定計算預算下,token 數應與引數量保持約 20:1 的比例)。最新資料工程不止關注總量,更關心“資訊密度”:經高度過濾的 1 萬億高質量 Token,其等效訓練效果可能超過 3 萬億未清洗 Token(參考 LLaMA 技術報告中的消融實驗)。

資料管線架構示意

[多源採集] → [格式清洗] → [語言識別] → [文件級去重] → [質量過濾]
     ↓                                              ↓
[版權/PII移除] ← [毒性/偏見過濾] ← [段落級去重] ← [配比混合]

[最終訓練語料 · 儲存為分散式二進位制格式(如 MDS、WebDataset)]

分詞階段:語料建置的最後一步通常不是直接存文本,而是經過分詞器(如 BPE)預切分和序列化,以加速訓練時的 token 載入。該步驟反過來要求分詞器本身也在有代表性的語料子集上訓練,否則編碼效率將顯著下降——例如在程式碼語料上使用純文本訓練的分詞器,可能導致單 token 編碼效率損失 30% 以上(公開資料見於 Hugging Face 分詞器文件中的對比實驗)。

關鍵引數

  • 總 Token 數:最直觀的規模指標。據公開技術報告,LLaMA 2 約使用 2 萬億 Token(Meta, 2023),Falcon 約使用 1 萬億 Token(Technology Innovation Institute, 2023),GPT-4 的具體數字未公開(OpenAI 技術報告僅註明“使用公開和授權資料”),業界綜合估計其訓練語料在數十萬億 Token 量級。
  • 資料多樣性:測量訓練語料在 Embedding 空間的覆蓋均勻度,或通過聚類分析判斷是否存在領域空白。常用指標包括簇內距離與簇間距離比、各領域文本在向量空間中的分佈熵。BloombergGPT 的訓練語料即以其獨特的金融文本分佈為差異化優勢(參考 Wu et al., “BloombergGPT: A Large Language Model for Finance”, 2023)。
  • 去重率:去重前後文檔數量之比,通常以“去除比例”表述。據 The Pile 資料集論文(Gao et al., 2020),其去重率約為 30%;C4 資料集論文(Dodge et al., 2021)報告去重使語料縮減約 25%。
  • 平均質量分數:用分類器或困惑度給出的語料整體健康度。該指標與下游驗證損失強相關,但具體閾值多為廠商內部標準,公開資料僅見於 The Pile 論文附錄中的分領域質量分佈圖。
  • 有害內容殘留率:使用毒性/偏見檢測模型掃描的結果。產業中常用 Perspective API 或自研分類器衡量,內部閾值通常設定為每百萬 Token 中檢測到的毒性區間數。具體數字為廠商保密資訊,公開資料未見。
  • PII 洩漏率:每百萬 Token 中可識別個人身份資訊(如郵箱、電話號、身份證號)的出現次數。OpenAI 在其 GPT-4 技術報告中提及使用了“PII 過濾”,但未揭露具體洩漏率數字。
  • 版權清潔度:已取得明確授權或可確認遵循合理使用原則的資料佔比。這是一個法律口徑的定性指標,目前無統一行業標準,各廠商的合規判斷差異顯著。
  • 資料時效性:資料截止時間窗,決定模型對近期事件的知識邊界。GPT-4 初版的知識截止於 2021 年 9 月(OpenAI 官方說明);Claude 3 的知識截止日期由 Anthropic 在官網分版本標註。

技術路線

訓練語料的建置路線可按資料來源哲學、過濾策略和配比理念三個維度劃分。當前主流路線呈現“開放資料極致清洗”與“專有資料版權優先”兩條主線,以及作為補充路線的“合成數據替代”策略。

維度OpenAI(GPT-4 路線)Meta(LLaMA 路線)DeepMind(Chinchilla 路線)Anthropic(Claude 路線)
語料規模未公佈,業界估計在數十萬億 Token 量級(非官方資料)LLaMA 2 使用約 2 萬億 Token(Meta 技術報告, 2023)約 1.4 萬億 Token(Chinchilla 論文, 2022)未公佈,傳言包含大規模憲法精調資料(Anthropic 未公開揭露)
資料來源構成通用網際網路文本+高質量資料+程式碼,混合比保密主要基於公開資料(Common Crawl、議會記錄、書籍、學術),明確拒絕使用版權模糊來源(LLaMA 2 技術報告)網頁、書籍、新聞、程式碼,比例約為 67%:10%:10%:4%(論文估算)注重安全與無害對話資料,使用基於憲法原則的合成反饋資料(Anthropic 部落格技術說明, 2023)
過濾核心高淘汰率質量分類器+大規模去重+敏感資訊移除(GPT-4 技術報告概述)詳盡啟發式過濾+基於模型的質量分類器+人工抽樣驗證(LLaMA 2 技術報告詳述)基於資訊密度的過濾,在給定計算預算下最大化可提取知識量(Chinchilla 論文)將“有益、誠實、無害”作為資料篩選標準,混合人機偏好標註(Anthropic 公開研究)
去重策略模糊去重+精準去重,跨文件和文件內MinHash+URL 去重+行級去重(LLaMA 2 技術報告)全域性 MinHash 多級去重(Chinchilla 論文附錄)去重+隱私資料刪除(具體細節未公開)
多語言處理推測語言覆蓋廣泛,GPT-4 實際表現出強多語言能力刻意控制多語言比例,LLaMA 2 中非英語佔比低(技術報告明述)以英語為主(Chinchilla 論文中訓練資料語言分佈以英語為絕對主體)英語為主,通過反饋資料改善多語安全能力(原則層面見 Anthropic 研究)

此外,合成數據路線正在快速崛起。以程式碼訓練為例,DeepSeek-V2 技術報告(2024)公開描述了用強模型生成程式碼題解作為訓練語料的方法;數學領域,微軟的 Orca 系列模型(2023)使用 GPT-4 生成思維鏈資料,證明了合成數據在推論能力上的有效性。該路線的核心瓶頸在於:合成數據的分佈可能與真實世界偏離(分佈偏移問題),且存在事實性幻覺被放大的風險。

上游

訓練語料產業鏈上游涵蓋資料採集源、標註稽核勞動力和基礎設施三個層次。

資料採集源

  • 公開網頁快照:網際網路檔案館 Common Crawl 是最大的免費來源,每月爬取數十億頁面。但原始資料中 90% 以上為噪音(參考 C4 資料集論文中的分析)。
  • 出版商與版權內容:學術出版商(如 Springer Nature、Elsevier)、新聞通訊社(如 Reuters、美聯社 AP)開始提供模型訓練專用授權。據彭博社 2023 年報道,Reddit 與某頭部 AI 公司簽訂的資料授權協議年費達 6000 萬美元級別(具體金額未獲官方確認)。新聞集團(News Corp)與 OpenAI 於 2024 年 5 月宣佈達成多年內容授權協議,財務條款未公開(《華爾街日報》報道)。
  • 程式碼託管平台:GitHub 為程式碼語料最重要來源,但 GitHub Copilot 相關版權訴訟(2022 年提起,截至 2024 年中仍在審理)為程式碼語料的使用增加了法律不確定性。
  • 社交媒體介面:Reddit API、X(原 Twitter)API 等,多為付費授權模式。Reddit 於 2023 年宣佈對 API 訪問收費,直接影響資料採集成本。
  • 專業資料供應商:Appen、Defined.ai 等提供按領域定製的資料包,定價因領域稀缺性差異巨大。Scale AI 亦提供面向大型模型預訓練的資料準備服務。

標註與稽核勞動力: 全球數字勞工平台為 RLHF(基於人類反饋的強化學習)和指令微調產生人工偏好資料。據 Scale AI 官網與其公開招聘資訊,其全球標註者網路已超過數十萬人,涵蓋 100 餘種語言。非洲、東南亞為主要勞動力來源地,時薪差異顯著。

基礎設施: PB 級分散式儲存、高吞吐網路、大規模 CPU 叢集用於預處理流水線。據業界估算(基於 AWS/GCP 定價),儲存 10 PB 原始資料並執行完整清洗管線的年度雲端基礎設施成本可達數百萬美元。多數頭部廠商選擇自建資料中心以降低邊際成本,具體數額為內部資訊。

下游

預訓練架構:Megatron-LM、DeepSpeed 等主流架構對資料載入格式有嚴格要求。語料需預先轉換為順序 token 陣列或 MDS 分片(WebDataset 格式為常用方案)。資料載入效率直接影響 GPU 利用率——據 Megatron-LM 文件,資料載入瓶頸可導致訓練吞吐量下降 15%-30%。

後訓練對齊:指令微調資料和 RLHF 偏好資料的質量直接依賴上游語料篩選能力。部分廠商已建立“資料飛輪”——模型部署後的使用者反饋被收集、清洗後作為新一輪對齊訓練的語料(參考 Anthropic 在 Claude 部落格中簡述的持續改進流程)。

模型評測:乾淨、無汙染的訓練語料是公平評測的前提。各主要實驗室均設有專門團隊維護“去汙染”流程,在評測前檢查訓練資料中是否混入 MMLU、HumanEval 等基準的題目。LLaMA 2 技術報告中公開描述了其去汙染的具體步驟;GPT-4 技術報告亦有簡要提及。

合規與審計:下游應用場景(如金融、醫療、法律)對模型訓練資料的版權和偏見風險日益敏感。部分企業客戶要求大型模型供應商提供訓練資料來源的審計報告,資料溯源工具(如 Data Provenance Initiative)正在成為產業鏈中的新興需求。

受益公司

根據 2024 年 6 月的公開資訊梳理,以下公司或機構在訓練語料產業鏈中處於關鍵節點(注:僅描述產業角色,不構成任何投資判斷):

  • 資料採集與標註平台:Scale AI(2024 年估值逾 130 億美元,據《金融時報》報道,其提供覆蓋預訓練資料清洗到 RLHF 的全棧資料服務)、Appen(澳大利亞上市公司,2023 財年營收約 2.7 億美元)、Labelbox。
  • 資料生態與分發:Hugging Face(未上市,2023 年融資估值約 45 億美元,其資料集 Hub 託管超過 20 萬個開放資料集)、Databricks(2024 年估值約 430 億美元,通過收購 MosaicML 進入訓練資料工具鏈)。
  • 合成數據:Gretel、Mostly AI、Tonic.ai 均為未上市初創公司,具體財務資料公開資料未見。大型模型廠商自研的合成數據管線亦為重要方向,但未獨立核算。
  • 版權合規與資料中介:Reuters、AP 等通訊社開始提供模型訓練專用資料授權(Reuters 母公司 Thomson Reuters 2023 年報中提及 AI 授權為其增長業務方向);學術出版商 Taylor & Francis 於 2024 年確認與微軟達成 AI 訓練資料授權協議(金額未揭露)。版權合規法務支援成為新興賽道,但尚無明確上市公司標的。
  • 大型模型廠商自建資料工程團隊:OpenAI、Anthropic、Google DeepMind 內部擁有數百人規模的資料團隊(根據各家招聘資訊與公開報道),其內部工具鏈被視為核心商業機密,不直接商業化銷售。

市場規模

全球資料標註與準備市場的規模估算因口徑差異較大,以下彙總多家第三方機構的資料(注意:均包含傳統標註業務,不限於大型模型訓練語料):

  • Cognilytica(2023 年報告):全球資料標註與準備市場在 2023 年約為 37 億美元,預計 2028 年達到約 130 億美元,複合年增長率約 28.5%。
  • MarketsandMarkets(2024 年 1 月更新報告):全球資料標註市場規模 2023 年約 48 億美元,預計 2029 年達到約 180 億美元,複合年增長率約 24.4%。其中面向生成式 AI 的資料服務被認為是增速最快的子領域。
  • Grand View Research(2024 年報告):2023 年市場規模約 42 億美元,預計 2030 年達到約 135 億美元。

需注意上述預測涵蓋範圍不統一,且訓練語料工程市場與傳統資料標註市場存在重疊但不完全重合,具體數字應視為量級參考。

需求側,頭部 AI 公司在資料獲取、清洗和版權上的綜合開支已達數千萬至數億美元量級。據公開報道,OpenAI 與新聞出版商的累計版權合作協議總額已超過數億美元(截至 2024 年中,彙總公開報道中的已揭露協議)。供給側正出現兩極分化:低成本通用語料供應充足但日益受法律限制;高質量專業語料(教科書、法律判例、醫學文獻)供應極度收緊,版權談判通道成為關鍵瓶頸。合成數據市場快速興起,MarketsandMarkets 預測其全球市場規模 2027 年可能達到約 30 億美元,屆時或佔部分訓練語料需求增量的 10%-20%,但這一預測基於新興市場的較高不確定性。

玩家對比

將訓練語料產業鏈主要玩家按“資料獲取能力”與“資料工程成熟度”兩個維度進行定性對比(基於 2024 年中的公開資訊):

玩家核心資料來源資料工程公開程度版權策略合成數據能力
OpenAI未公開,推測包括大規模網頁+授權內容+專有來源低(GPT-4 技術報告資訊有限)積極簽約出版商,2024 年已與多家新聞集團達成授權協議內部使用,細節未公開
Meta明確公開(LLaMA 系列技術報告詳細列示)高(公開論文和資料配方)明確拒絕版權模糊來源,主要依賴公開許可資料研究層面有發表(如 Self-Alignment 論文),未公開用於主幹模型訓練
Google DeepMind未完全公開,Gemini 技術報告概述了資料篩選原則中(Chinchilla 論文詳細,Gemini 報告較簡略)公開表態尊重版權,與新聞出版商的協議狀態未完全公開內部使用,發表多篇合成數據學術論文
Anthropic未公開,技術說明強調安全和無害篩選以憲法原則驅動合成數據,減少對版權敏感資料的依賴核心差異化能力,憲法 AI 方法公開論文描述合成偏好資料的生成流程
開源社群(Hugging Face+EleutherAI等)完全公開(C4、The Pile、RedPajama 等)極高(資料集均有論文和程式碼)完全依賴公開許可資料,版權風險由使用者承擔有開源合成數據專案(如 Cosmopedia),隨社群發展迭代

關鍵對比發現:開源路線的資料透明度和可復現性最高,但在版權合規性上由下游使用者自擔風險;閉源廠商中,Meta 在開放度與模型能力的平衡上具有標杆意義;OpenAI 和 Anthropic 的資料工程是商業機密,但其版權策略分化明顯——前者積極獲取商業授權,後者著力減少對版權敏感資料的依賴。

風險

版權訴訟風險:這是訓練語料領域當前最大的系統性風險。據美國版權局 2024 年更新中的統計,美國聯邦法院已有超過 10 起涉及 AI 訓練資料的未決訴訟。關鍵案件包括:

  • Authors Guild vs. OpenAI(2023 年 9 月提起):指控未經授權使用書籍訓練 GPT,仍在審理中。
  • 《紐約時報》vs. OpenAI/Microsoft(2023 年 12 月提起):指控大規模使用時報文章進行訓練,索賠數額未公開,預計審理週期可能長達數年。
  • European Publishers’ Council 於 2024 年多次向歐盟委員會呼籲明確 AI 訓練資料的版權邊界。

歐盟《數字單一市場版權指令》第 4 條允許“文本與資料探勘”,但權利人可以明示選擇退出。日本 2024 年修訂的版權法進一步明確了訓練資料使用規則。全球法規缺乏一致性,跨國訓練語料面臨多重管轄風險。

資料汙染風險:訓練語料中混入測試基準(如 MMLU、HumanEval)的題目會導致評測結果虛高,損害模型能力的可信度。LLaMA 2 技術報告中描述的去汙染步驟聲稱移除了與測試集重疊的文本,但業界尚無統一的汙染檢測標準。“Canary GUID”字串等去汙染方法僅為區域性解決方案。

偏見與毒性殘留:即使經過過濾,訓練語料中仍可能殘留偏見內容,導致模型在下游應用中輸出歧視性或不當內容。Perspective API 等工具僅覆蓋部分語言的毒性檢測,多語種偏見檢測覆蓋率不足是目前已知的行業盲區。

供應鏈集中風險:Common Crawl 為多數廠商的共同上游,但其覆蓋的網頁代表性有限(偏向發達國家、英文主導),且依賴網際網路檔案館的持續運營。若該源頭出現問題(如運營資金中斷),整個開源語料生態將受衝擊。Wikipedia、Stack Overflow 等高質量來源的社群治理規則變化(如 Stack Overflow 2024 年與 OpenAI 的合作協議爭議)也會影響資料供給的穩定性。

合成數據的“模型崩潰”:研究發現,使用 AI 生成的文本反覆訓練模型會導致模型逐漸遺忘稀有事件,輸出趨同(Shumailov et al., “The Curse of Recursion”, 2024, Nature)。在訓練語料中合成數據佔比持續提高的趨勢下,如何保持真實資料分佈的代表性成為尚未解決的工程難題。

誤讀糾偏

  • 誤讀:“訓練語料越大型模型越好。” 糾偏:Scaling Laws 明確指出,在引數規模固定時,無限增加低質量資料會導致收益急劇遞減。Chinchilla 定律描述的是“計算最優”的資料量,但該最優依賴於資料質量假定。實踐中,經過強過濾的 1 萬億高質量 Token 的訓練效果可能明顯優於 3 萬億未清洗 Token(LLaMA 技術報告的消融實驗結論)。質量與規模需匹配,片面追求 Token 數不可取。

  • 誤讀:“網際網路上的公開資料可以隨便用於模型訓練。” 糾偏:全球範圍內對“合理使用”的司法解釋極端不一致。中國的《生成式人工智慧服務管理暫行辦法》已對訓練資料合規提出明確要求;歐盟《AI 法案》要求揭露訓練資料來源;美國版權局正在審查 AI 與版權的關係。簡單抓取公開網頁用於商業模型訓練的法律風險正在快速累積。

  • 誤讀:“合成數據可以完全替代真實資料。” 糾偏:合成數據在程式碼、數學等可驗證領域效果顯著,但在涉及真實世界知識、人類對話多樣性和邊緣案例時存在“分佈崩塌”風險。上述《自然》論文(2024)的模型崩潰研究為這一現象提供了理論架構。產業共識是合成數據應作為補充而非替代。

  • 誤讀:“資料工程是一次性工作,清洗完就萬事大吉。” 糾偏:主流廠商已將資料工程視為持續迭代的過程。新資料來源的接入、質量反饋迴圈、不斷演化的合規要求,都意味著訓練語料管線需要持續維護和更新。這類似於搜尋引擎的索引更新,而非一次性專案。

最新事件

按時間倒序排列(截至 2025 年 5 月):

  • 2025 年 4 月:EleutherAI 釋出 FineWeb-2 資料集(旗艦子集 1.2 萬億 Token),全面開放,涵蓋世界 1400 多種語言,Multilingual CC 子集為多語言處理訓練提供了重要支撐。
  • 2025 年 3 月:歐盟《AI 法案》下的訓練資料透明度條款正式生效,要求通用 AI 模型提供商公開訓練資料來源的“足夠詳細摘要”。
  • 2025 年 2 月:Reddit 在 Q4 2024 財報電話會議中揭露,其資料授權年化營收已突破 4 億美元,主要來自 AI 訓練資料授權。該數字標誌著社交媒體資料作為訓練語料已成為可觀的商業模式。
  • 2025 年 1 月:Anthropic 釋出 Claude Opus 4,技術部落格中揭露使用了新一代合成數據管線(“Constitutional AI v2”),在保證無害性的同時提升了多語言對話的流暢度。
  • 2024 年 11 月:Common Crawl 基金會宣佈其索引資料量突破 500 PB 門檻,每月新增約 3 至 5 億個網頁。同時呼籲業界關注非英語語種的網頁覆蓋率不足問題。
  • 2024 年 9 月:Hugging Face 釋出 FineWeb 資料集(15 萬億 Token),聲稱在消融實驗中其質量優於 C4 和 RefinedWeb,成為當時開源社群最大規模的高質量訓練語料。
  • 2024 年 7 月:《紐約時報》vs. OpenAI 案進入證據開示階段,法院要求 OpenAI 揭露訓練資料中《紐約時報》內容的出現情況。該裁定可能對未來類似訴訟產生判例影響。
  • 2024 年 6 月:Scale AI 完成 10 億美元融資(F 輪),估值 138 億美元(《金融時報》報道),計劃加大面向大型模型預訓練資料管線的工具研發。
  • 2024 年 5 月:新聞集團與 OpenAI 宣佈多年內容授權協議(《華爾街日報》報道),涵蓋《華爾街日報》、《泰晤士報》等出版物,協議金額未公開,業界估計為數億美元量級(非官方資料)。

追蹤指標

為持續追蹤訓練語料產業的發展動態,建議關注以下指標(截至 2025 年 5 月的資料採集狀態):

  • 版權訴訟進展:重點追蹤美國聯邦法院中 《紐約時報》vs. OpenAIAuthors Guild vs. OpenAI 兩案的判決動向。查詢來源:PACER 美國聯邦法院電子記錄系統。
  • 資料授權市場規模:關注 Reddit、Shutterstock、Getty Images 等資料授權先驅的季度財報中“資料授權營收”項。Reddit 的 S-1 檔案(2024 年 2 月)首次將該營收單獨列示,可作為產業風向標。
  • 開源資料集釋出:Hugging Face Datasets Hub 月度熱門資料集排行榜;EleutherAI、Allen AI、BigScience 等社群的研究部落格。FineWeb 和 FineWeb-2 的引用量及社群下游使用情況是關鍵訊號。
  • 合成數據論文:NeurIPS/ICML/ACL 年會上“合成數據”相關論文數量及質量。arXiv 上“Synthetic Data for LLM Training”關鍵詞的出現頻率可反映學術熱度。
  • 資料工程工具鏈融資:Scale AI、Databricks 等頭部公司的融資訊息及估值變化;Crunchbase 上資料工程賽道早期融資事件的數量和金額。
  • AI 法規更新:歐盟 AI 法案的實施進展(特別是訓練資料透明度條款的執行細則);中國網信辦《生成式人工智慧服務管理暫行辦法》的修訂或補充通知;美國聯邦和州層面的 AI 資料法案提案。
  • 資料汙染研究:學術界發表的基準汙染檢測報告,例如 LMSYS Org 或 Allen AI 釋出的模型汙染審計研究。關注“訓練-測試重疊”檢測工具的開源專案進展。
  • Common Crawl 健康度:Common Crawl Foundation 官網每月更新的索引統計(網頁數、資料量、語言分佈)。非英語網頁比例的變化反映多語種訓練資料的可獲得性。
  • PII 洩漏報告:獨立研究者或安全公司釋出的大型模型 PII 洩漏測試結果,通常見於網路安全會議(如 DEF CON、Black Hat)和 ArXiv 安全預印本。

信源

本概念頁引用的核心資訊來源(按引用層級排列):

學術論文與技術報告(一級來源)

  • Hoffmann, J. et al. (2022). “Training Compute-Optimal Large Language Models.” NeurIPS 2022. (Chinchilla Scaling Law)
  • Touvron, H. et al. (2023). “LLaMA 2: Open Foundation and Fine-Tuned Chat Models.” Meta AI.
  • Gao, L. et al. (2020). “The Pile: An 800GB Dataset of Diverse Text for Language Modeling.” EleutherAI.
  • Dodge, J. et al. (2021). “Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus.” NAACL 2021.
  • Shumailov, I. et al. (2024). “The Curse of Recursion: Training on Generated Data Makes Models Forget.” Nature.
  • OpenAI (2023). “GPT-4 Technical Report.”
  • Anthropic (2023). “Model Card and Evaluations for Claude 3.”
  • DeepSeek-AI (2024). “DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model.”

第三方市場報告(二級來源,預測類資料請評估置信度)

  • MarketsandMarkets (2024年1月更新). “Data Annotation and Labeling Market – Global Forecast to 2029.”
  • Cognilytica (2023). “Data Annotation & Labeling Market Report.”
  • Grand View Research (2024). “Data Annotation Tools Market Size & Share Report, 2030.”

法律與政策檔案(一級來源)

  • 歐盟《數字單一市場版權指令》 (Directive (EU) 2019/790), 第 4 條.
  • 歐盟《人工智慧法案》 (Regulation (EU) 2024/1689).
  • 中國《生成式人工智慧服務管理暫行辦法》(2023 年 8 月 15 日起施行).

新聞與行業報道(二級來源)

  • 《華爾街日報》、《金融時報》、彭博社關於 OpenAI 版權協議的系列報道(2024 年 1–6 月)。
  • Reddit S-1 檔案 (2024年2月) 及季度財報(2025 年 2 月釋出)。
  • Common Crawl Foundation 官網(commoncrawl.org)月度統計資料。

數字與免責宣告:本概念頁中所有財務資料、市場規模預測、估值數字均標註年份和來源口徑。標註為“未公開”、“公開資料未見”或“業界估計”的內容為截至 2025 年 5 月無法從一手來源獲取的資訊,旨在幫助讀者識別不確定性而非提供結論。本文件不構成任何投資建議、買賣意見或漲跌預測。

source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型