模型層 開放閱讀

資料混合

Data Mixture

概念 ID
data-mixture
更新時間
2026-05-29
來源數量
待補

資料混合

3 秒看懂

資料混合(Data Mixture)決定大型模型“吃什麼,吃多少”:把網頁、書籍、程式碼、論文等異質資料按特定比例揉成一鍋,再餵給模型訓練。它不是簡單地把檔案堆在一起,而是通過質量篩選、去重、權重設計和動態調節,讓模型既學會常識又掌握專業知識,同時避免學偏或浪費算力。

3 分鐘產業解釋

想像你在訓練一個實習生:只讓他讀八卦論壇,他會變成段子手;只給他看學術論文,他會缺乏通識和共情。資料混合就是為模型搭一張覆蓋多個領域的“知識食譜”——社交媒體文本帶來對話感,百科培養事實性,程式碼倉庫教會邏輯,書籍注入長文本理解。產業上,這一工作動輒涉及TB~PB級的資料管道,通常在模型預訓練前幾個月就啟動,是決定模型表現天花板的“髒活累活”。

技術內涵

  • 源頭治理:從Common Crawl這類快照海量爬取,然後經歷語言檢測、內容過濾、質量打分、個人身份資訊去除、去重等步驟,只保留高質量子集。
  • 比例設計與驗證:用少量實驗跑下游任務,觀察不同混合比例對困惑度、事實性、有害內容生成的影響,再放大到全量訓練。
  • 動態排程:有些團隊採用“資料課程”,先喂簡單資料(如維基百科),再逐漸加入複雜長文、多輪對話或專業程式碼,加速收斂並提升上限。
  • 算力與經濟賬:資料過多浪費算力,過少則欠擬合;資料重複太多,收益遞減,甚至放大器偏見。混合策略直接影響GPU叢集的使用效率和訓練時長。

產業錨點:如今,OpenAI、Meta等頭部機構將資料混合視為和模型架構同等重要的“核心競爭力”,但配方高度保密,公開論文只給出模糊範圍,真正比率只有少數內部團隊掌握。

15 分鐘專家深入

1. 資料混合的戰略決策樹

建置一個數據混合物通常經歷五個決策層:
① 資料來源選擇 → ② 過濾與清洗 → ③ 去重粒度 → ④ 混合比例定義 → ⑤ 訓練期動態調整

  • 資料來源選擇:從公開快照(Common Crawl)、書籍、論文集、程式碼倉庫、維基、社交媒體、多模態對齊文本等中選取,須平衡多樣性內容可控性
  • 過濾與清洗:基於規則(長度、亂碼)、分類器(毒性/色情/個人資訊)、質量模型(如預訓練好的分類器)剔除低質樣本。此處的取捨會將“自然分佈”修改為“工程分佈”,引入人工偏差。
  • 去重:文件級、段落級甚至句子級去重,降低記憶化和冗餘。去重程度直接影響訓練效率與模型泛化。
  • 比例定義:可以按token數示例數指定權重。常見形式如:weights = [0.5 web, 0.15 books, 0.1 code, 0.05 wiki, …],再由資料載入器控制不同桶的取樣機率。
  • 動態調整:在訓練過程中改變混合比例,或根據損失降低、下游任務表現進行自適應重取樣(如DoReMi策略,見技術演進史)。

2. 效果評估架構

  • 困惑度(Perplexity):在混合資料各領域的驗證集上的下降曲線。
  • 下游任務零樣本/少樣本表現:如MMLU、HellaSwag、HumanEval(程式碼)等基準。良好混合應使各能力全面增長,而非犧牲某一類。
  • 魯棒性與偏見過濾:真實世界毒性檢測、事實性幻覺評估、隱私記憶測試。
  • 訓練效率:固定算力預算下的下游效能提升,或達到目標效能所需的總訓練步數。

3. 工程實現的隱形挑戰

  • 資料格式與序列化:不同來源可能需要不同的tokenizer預處理,統一後混在一起的難度(例如程式碼中的換行符、圖書排版符號)。
  • 分散式載入:多資料集混在一起時,全域性打亂(shuffle)需要跨節點同步索引,易造成資料管道瓶頸。典型方案是各節點本地快取不同分片,並採用多級隨機種子保證不重複。
  • 版權與合規:某些書籍或程式碼存在許可證限制;歐盟《人工智慧法案》等要求揭露訓練資料內容。混合過程中的來源追蹤與合規標註正成為必選項。

技術原理(最深)

資料混合的數學本質:定義訓練分佈

設總訓練token數為 T,來自K個數據源 D_1, D_2, …, D_K。資料混合即為定義一個取樣分佈 P,使得token x 被取樣的機率為:

 P(x) = \sum_{k=1}^{K} w_k \cdot P_k(x) 

其中 w_k 是第k個源的權重(滿足 \sum w_k = 1),P_k(x) 是該源內部的經驗分佈(一般是均勻抽樣,或按稀有度進一步加權)。

訓練時的目標函式等價於最小化交叉熵:

 \mathcal{L}(\theta) = -\mathbb{E}_{x\sim P}[\log p_\theta(x)] 

因此,權重的選擇直接改變了模型最佳化的梯度方向。重取樣一個領域等價於加大該領域對損失的貢獻,促使分配更多模型容量。

混合策略的關鍵引數

  • 逐Token vs 逐示例混合:按token混合時,長文件會貢獻更多梯度更新,可能造成注意力偏向長上下文;按示例混合則更“公平”但浪費短樣本計算。實踐中多用token級,並通過填充/截斷/打包技術平衡。
  • 權重溫度縮放與重複:若某領域資料有限,可通過複製(重複多個epoch)提高有效權重。但過度重複導致死記死記,收益符合Chinchilla論文提出的“重複冪律遞減”[Chinchilla論文]。權重溫度縮放(Weight temperature scaling)對權重進行指數化平滑:w_k' = w_k^{1/T},T>1可拉高低頻源的取樣率。
  • 打亂與去重:全域性文件級去重可減少訓練集資訊冗餘,把重複節省的算力用於引入新資料,等效增加有效資料量。常用MinHash、SimHash等演算法近似去重。

資料混合流水線示意

[Common Crawl] → 語言檢測 → 質量過濾 → 粗略去重 ─┐
[Wikipedia]   → 解析排版 → 按主題分割槽 ──────┤
[Books]       → 版權清洗 → 按流派抽檢 ──────┤
[GitHub]      → 敏感資訊去除 → 語言過濾 ───┤

                          全域性混合 & 權重排程

                       分片 → 分散式dataloader

                         [GPU 訓練叢集]

混合對模型能力的分化影響

實驗現象(多項開源研究歸納,僅作定性總結)表明:

  • 常識推論對百科、書籍、QA類資料敏感,提升權重見效快,但過量會導致模型長於背誦短於推論。
  • 程式碼能力需要較高比例的程式碼資料才能從零突破(存在相變現象),且對混合中的英文文本比例有依賴,因程式語言以英文為基底。
  • 多語言能力依賴於相應語言的佔比,且需防止dominant語言(英語)淹沒低頻語言。通常採用過取樣或權重溫度縮放提升小語種權重。
  • 長文本連貫性需要書籍、長對話等自然長序列,若被短文本淹沒,模型易丟失長距離依賴。

技術演進史

  • 2018之前:影像領域以ImageNet等固定資料集為主;NLP以特定任務訓練集微調,無需大規模預訓練混合。
  • 2018-2019 (BERT/GPT時代):BERT用英文維基+BooksCorpus(約16GB文本)完成預訓練,資料量小但混合比例已成關鍵(論文提及兩者組合優於單一源)。
  • 2020 (GPT-3):擴大至CommonCrawl、WebText2、Books1/2、Wikipedia共約570GB過濾文本。首次系統論述“質量過濾”和“按token取樣權重”(但具體比例未公開,僅使用部分描述統計)。自此資料配比成為商業機密。
  • 2021 (The Pile):EleutherAI釋出公開800GB資料集,包含22個子集,並給出“最佳比例”的社群實驗參考,引發混合的公開研究。
  • 2022 (Chinchilla):DeepMind提出算力最優的資料量縮放定律,揭示資料重複只能在資料量不足時提供有限收益,直接推動了“投更多新鮮資料而非更多輪次”的共識。資料混合從此與資料稀缺緊密掛鉤。
  • 2023 (LLaMA系列):Meta在LLaMA 1&2中強調資料混合以“公開可獲取”為導向,採用大量CommonCrawl(預過濾),加入GitHub程式碼、圖書、學術論文等。LLaMA 3進一步揭露混合細節部分,展示了對程式碼和推論資料的高度重視。
  • 2023 (DoReMi / Data Curriculum):DoReMi(Datasets Over Models for ReMix)利用較小的代理模型自動學習最優領域權重,未暴露下游任務資料,推起動態度量混合;資料課程策略逐漸系統化,先易後難的順序被證明可提升收斂速度和最終效能。
  • 2024及以後:合成數據(Self-Instruct, 數學證明生成)與人類編寫的“特製資料”被納入混合物,以填補小眾或高風險領域(如數學推論、工具使用、安全對齊)。資料混合的下一代挑戰是“動態線上混合”,即在訓練中根據模型當前弱點不停調整取樣。

技術路線對比(量化表)

維度靜態固定比例混合動態資料課程自適應權重學習(DoReMi)
權重決定機制人工預設,依賴專家經驗按階段切換比例,簡單→複雜利用小代理模型自動搜尋,最佳化下游損失分佈
訓練階段全程一致離散/連續變化訓練前用代理模型確定權重,主訓練沿用
對下游先驗的依賴高(需大量消融實驗)中(依賴課程設計)極低(無需定義下游任務,僅需劃分資料域)
算力額外開銷輕微(調整取樣邏輯)中等(訓練代理模型)
學術界可復現性高(若配方公開)高(給出權重後)
產業典型應用GPT-3、LLaMA系列PaLM、部分內部實踐學術驗證,產業探索中
主要風險配比不佳導致領域塌縮或容量傾斜課程設計不當收斂不穩定代理模型與主模型分佈不匹配

上下游

上游:原始資料生產與採集

  • 公共網頁爬取(Common Crawl)、垂直領域爬取(學術論文、專利、法律文書)
  • 資料眾包和標註平台(Scale AI、Appen等提供質量評等、內容分類)
  • 合成數據生成(使用LLM自生成,或模擬器、規則系統)

中游:資料工程與混合管線

  • 資料處理架構(HuggingFace Datasets, Spark/Apache Beam, 自研流水線)
  • 去重、染色、毒性檢測、質量分類模型
  • 混合比例實驗平台(內部A/B測試不同配方的小模型)

下游:模型訓練與應用

  • 百億/千億引數語言模型預訓練、多模態模型對齊
  • 微調階段的資料混合(指令微調中的多種任務混合)
  • 基於人類反饋的強化學習(RLHF)中,偏好資料的混合比例同樣影響對齊質量

關鍵指標

  • 領域覆蓋度:各下游任務所需知識在新混合中的出現率,可通過關鍵詞或嵌入相似度估算。
  • 訊雜比:經人工稽核或分類器評分的“高質量”樣本佔比。
  • 去重率:重複文件比例,理想值趨向0。
  • 多樣性指數:詞彙量、主題分佈熵、N-gram獨特性等。
  • 訓練損耗曲線:各資料來源驗證集的loss下降斜率,若某領域loss先降後升,可能表示被其他資料干擾,需調整權重。
  • 毒性/偏見得分:使用Perspective API或安全分類器掃描生成物,評估混合物安全性。
  • 實驗收斂速度:達到同等下游效能所需訓練步數,反映混合物的“營養價值”。

供需與市場資料

(由於即時市場資料檢索失敗,以下為基於行業趨勢的定性分析)

  • 高質量文本資料正變得稀缺:公開的乾淨文本、長篇幅書籍、經過驗證的知識庫已近被“採盡”。合成數據和預訓練模型互動生成資料成為增量來源。
  • 程式碼與多語言資料成為壁壘:GitHub中不涉及隱私且許可證合規的高質量程式碼有限;低資源語言資料嚴重不足,推動專門的資料採集和許可交易。
  • 資料版權與合規催生新市場:出版商同AI公司簽署資料授權協議(如某些新聞機構與OpenAI/Google的合作);資料標註公司擴充套件至版權審計服務,資料溯源技術需求上升。
  • 企業內部資料混合:金融、醫療、法律等行業因其高度專業性,傾向利用自有文本建置領域增強的混合物,催生隱私計算和聯邦混合技術。

代表公司與資本對映

(公司名稱為客觀舉例,不構成任何投資建議;具體融資額等資料因檢索失敗未列出)

  • 資料標註與質量服務商:Scale AI、Appen、Labelbox、Defined.ai —— 為大型模型團隊提供資料清洗、分類、毒性標記等,建置混合前的分揀工序。
  • 資料集建置與聚合:Hugging Face(開源資料集平台,降低混合實驗門檻)、EleutherAI(釋出The Pile等開放混合物)、Common Crawl(底層免費快照)。
  • 合成數據創業公司:Tonic.ai、Gretel.ai、Mostly AI —— 面向企業生成保護隱私的合成訓練資料,也涉及混合時的稀缺資料填充。
  • 雲端廠商的資料管線:AWS Data Exchange、Google Cloud Dataproc/Dataflow —— 提供大規模資料處理託管服務,被許多AI實驗室用於搭建資料混合流水線。
  • 大型模型廠商自有資料團隊:OpenAI、Anthropic、Meta、DeepMind等均設有巨大數據工程部門,其核心競爭力之一即為專有資料混合策略,基本不對外提供服務。

投資邏輯

  1. 資料即護城河:隨著模型架構逐漸收斂(Transformer主導),混合資料的獨特性成為區分模型能力的關鍵。擁有稀缺文本版權、獨家資料採集能力的公司可能享有長期壁壘。
  2. 資料工程自動化:手工配比消耗大量人力,能夠自動化資料清洗、質量評估、最佳權重搜尋的工具或平台,有望降低百億引數級訓練的門檻。
  3. 合成數據的工業化:高質量合成數據引擎若能做到保真度和安全性,將解決真實資料枯竭問題,成為下一代模型訓練的“汽油”。
  4. 合規與確權服務:版權糾紛促使資料來源標註、權利清理、資料確權技術成為基礎需求,有可能催生服務與SaaS。

(以上邏輯僅為產業趨勢描述,不構成任何具體投資推薦。)

常見誤讀糾偏

① “資料混合就是隨便抓點資料混在一起,比例差不多就行”
糾偏:現代大型模型的數百項能力強烈依賴精細配比。比例偏差幾個百分點,就可導致長尾語言消失或程式碼能力崩潰。多數頭部機構使用數千次小規模實驗鎖定最終權重,這是耗時耗算力的系統工程。

② “只要資料質量高,重複訓練幾次沒關係”
糾偏:Chinchilla縮放定律已表明,過量重複(超過約4個epoch)的收益衰減遠超增加新鮮資料。多次重複甚至引發記憶化,導致模型在隱私和安全基準上劣化。高質量資料若數量不足,應當優先外部擴充套件或使用合成數據,而非簡單迴圈。

③ “資料混合是一錘子買賣,訓練開始後就無法更改”
糾偏:資料課程和線上自適應混合技術允許訓練中途調整比重,甚至根據模型即時弱點重新取樣。這種做法可針對性地攻克知識盲區,提升最終效能,曾在PaLM等訓練中使用。

學習路徑

  1. 基礎認知:閱讀《Scaling Data-Constrained Language Models》(即Chinchilla論文)、《Training Compute-Optimal Large Language Models》,理解資料量、計算量與模型規模的關係。
  2. 經典實踐:研究The Pile論文(The Pile: An 800GB Dataset of Diverse Text for Language Modeling),檢查其22個子集配比及社群實驗。
  3. 前沿方法:閱讀DoReMi論文(DoReMi: Optimizing Data Mixtures Speeds Up Language Model Pretraining),瞭解自動權重學習。
  4. 動手實踐:使用Hugging Face Datasets庫載入多個源,實現加權取樣、打亂、去重流水線;在小型模型上嘗試不年增率例並觀察GLUE等benchmark變化。
  5. 工程深化:瞭解Megatron-LM或DeepSpeed的資料載入器,如何配置多資料集混合作業,學習在分散式環境下實現全域性精確混洗與暫停/恢復。

一句話總結

資料混合是以統計學為核心、工程為骨架,將原始資訊轉化為模型世界知識的精煉配方,決定了大型模型能力的廣度、深度與安全性邊界。

延伸閱讀與來源

  • Hoffmann, J., et al. “Training Compute-Optimal Large Language Models.” (常稱Chinchilla論文)
  • Brown, T., et al. “Language Models are Few-Shot Learners.” (GPT-3論文)
  • Touvron, H., et al. “LLaMA: Open and Efficient Foundation Language Models.”
  • Gao, L., et al. “The Pile: An 800GB Dataset of Diverse Text for Language Modeling.”
  • Xie, S. M., et al. “DoReMi: Optimizing Data Mixtures Speeds Up Language Model Pretraining.”
  • Cassano, F., et al. “MultiPL-E: A Scalable and Extensible Approach to Benchmarking Neural Code Generation.” (含程式碼資料混合的討論)

(注:因檢索服務臨時不可用,以上文獻均為公開學術資源,可作為基礎學習入口。最新產業動態可查閱各公司官方技術部落格和頂級會議論文。)

source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型