合成數據
1 3 秒看懂
合成數據是由演算法生成的“人造資料”,而非從現實世界直接採集。它學習真實資料的統計特徵、結構和關係,卻能創造出全新的、不包含任何原始個人資訊的虛擬樣本。其核心價值在於,當真實資料因隱私合規、獲取成本高昂或長尾場景稀缺而無法滿足AI訓練需求時,提供一種可程式設計、可擴充套件、且隱私安全的替代方案。
2 3 分鐘產業解釋
合成數據並非簡單的“資料造假”或脫敏處理,而是一項嚴肅的模型驅動的資料工程。其底層邏輯是:利用生成式模型(如GAN、擴散模型、Transformer)或物理模擬引擎,從真實資料中學習其高維聯合機率分佈,然後從這個習得的分佈中隨機取樣,生成全新的、統計上同分布的虛擬樣本。關鍵在於,如果生成模型能夠足夠逼真地復現真實資料的分佈,那麼這些新樣本便能像真實資料一樣用於訓練下游AI模型,而不會洩露原始個體的隱私資訊。
當前,合成數據已深度嵌入多個核心賽道。在自動駕駛領域,基於NVIDIA Omniverse等平台的模擬引擎可生成極端天氣、罕見事故等長尾場景,彌補路測資料的不足。在醫療健康領域,合成醫學影像和電子健康記錄能在不暴露患者隱私的前提下,加速診斷模型和藥物發現研究。在金融風控中,合成交易記錄用於訓練欺詐檢測模型,繞開了直接使用客戶敏感資料的合規枷鎖。進入大型模型時代,合成數據的角色更進一步,從“真實資料的替代品”進化為“模型自我進化的養料”。諸如Self-Instruct、Evol-Instruct等範式,利用強大的LLM批次生成高質量的指令微調資料,以“模型教模型”的方式,撬動小模型的複雜推論能力,同時應對網際網路高質量文本資料即將耗盡的挑戰。產業已形成清晰的垂直分工:上游提供算力與基礎演算法,中游是合成數據平台與引擎,下游則是千行百業的AI模型訓練與測試場景。
3 技術原理
合成數據生成的數學本質,是學習一個從已知真實資料分佈 P_{real}(x, y) 到一個生成分佈 P_{syn}(x, y) 的對映,並確保兩者在統計上儘可能接近,同時滿足特定的應用約束(如差分隱私預算)。其核心機制與範式如下:
1. 主流生成範式
- 生成對抗網路:生成器 $G$ 與判別器 $D$ 進行二元極小極大博弈。$G$ 學習將隨機噪聲 $z$ 對映為逼真樣本以欺騙 $D$,而 $D$ 則努力分辨輸入來自真實資料還是 $G$。當雙方達到納什均衡時,$G$ 的輸出即為合成數據。GAN在影像、影片、時序資料等連續高維資料的生成上表現卓越,但訓練不穩定和模式坍塌是其經典挑戰。
- 變分自編碼器:VAE由編碼器和解碼器構成。編碼器將真實資料 $x$ 對映到隱空間的一個分佈 $q(z|x)$ ,解碼器則從隱變數 $z$ 重建資料。通過在規整化的隱空間中進行平滑取樣並解碼,VAE能生成具有良好多樣性和連續性的樣本,尤其適合表格資料和序列資料的生成。
- 擴散模型:此類模型包含正向和反向兩個過程。正向過程逐步向資料新增高斯噪聲,直至其變為純噪聲;反向過程則學習從噪聲中一步步“去噪”,恢復出清晰的樣本。推論時,從純噪聲出發,通過迭代去噪即可生成極高保真度的新樣本。在影像、影片、3D、分子結構等對細節要求苛刻的領域,擴散模型已成為主流。
- 大語言模型:利用預訓練LLM強大的上下文學習和指令遵循能力,通過精心構造的提示詞,可以直接生成高質量的文本、對話、程式碼和思維鏈。代表技術如Self-Instruct、Evol-Instruct,可實現訓練指令與回覆對的批次化、自動化合成,是當前擴充套件大型模型能力的核心手段。
2. 通用合成管道
一個典型的、負責任的合成數據生成流程包含多個步驟,以確保最終產物的質量和合規性。
+----------------+ +-----------------------+ +-------------------+
| 1. 真實資料種子 |----->| 2. 生成模型訓練 |----->| 3. 隱私與質量審計 |
| (結構/影像/文本)| | (GAN/VAE/Diffusion/LLM)| | (分佈相似度, DP) |
+----------------+ +-----------+-----------+ +--------+----------+
| |
v v
+------+------+ +---------+--------+
| 4. 合成數據生成| | 5. 通過審計的 |
| (取樣/推論) |--------> | 合成數據集 |
+-------------+ | (可用於下游任務) |
+------------------+
3. 核心機制拆解
- 分佈學習與匹配:模型不僅要學習單個特徵的邊緣分佈,更要捕獲特徵之間的複雜依賴關係,即聯合分佈。例如,對一個貸款資料集,模型必須學到“高營收”與“低違約率”的相關性,而非孤立地生成高營收或低違約的人。
- 隱私保護機制嵌入:嚴格隱私保護的合成(如基於差分隱私的合成)會在訓練過程中向梯度或目標函式注入精心校準的噪聲,使得任何單個樣本對最終模型的影響變得有限且不可區分。這為抵禦成員推斷攻擊和模型逆向攻擊提供了可量化的理論保證。
- 可控生成:為滿足特定場景(如生成更多罕見病影像),研究人員會引入條件生成機制,通過引導模型按給定屬性(如類別標籤、文本描述)生成對應樣本。
4 關鍵引數
評估一個合成數據方案,需從效用、隱私、成本和覆蓋度等維度綜合考量,其中存在難以調和的“不可能三角”。
- 下游任務保留率:這是衡量合成數據實用價值的核心指標。具體計算為:
TSTR = (在合成數據上訓練的模型在真實測試集上的效能) / (在真實資料上訓練的模型在真實測試集上的效能)。業界通常認為,$TSTR > 0.9$ 表明合成數據質量很高。此指標高度依賴於下游任務的選取。 - 隱私預算
\epsilon:這是差分隱私架構下的核心引數,量化了隱私保護的嚴格程度。\epsilon值越小,意味著加入的噪聲越大,隱私保護越強,但資料效用通常也越差。實踐中,對於表格資料合成,\epsilon取值常在1到10之間進行權衡,沒有普適最優解,取決於具體的風險容忍度與應用要求。 - 分佈覆蓋率:衡量合成數據對真實資料中所有模式,特別是罕見但關鍵的邊緣案例和少數群體的覆蓋程度。一個失敗的模式是合成數據僅完美復現了主流群體的特徵,卻忽略或扭曲了尾部資訊,這會加劇AI模型對弱勢群體的偏見。評估方式包括比較真實與合成數據中各子群的KL散度,或計算合成數據中每個真實樣本最近鄰的距離分佈。
- 合成/真實資料獲取成本比:這是一個關鍵的經濟指標。在自動駕駛領域,為生成一個極端交通場景,合成數據的成本可能僅為真實路測與資料採集成本的十分之一[行業估算,未精確揭露具體來源和年份]。然而,上游的高質量真實資料種子成本和GPU算力投入構成了主要的固定成本。
- 隱私洩露風險分數:通過實施成員推斷攻擊、屬性推斷攻擊和模型逆向攻擊來量化評估。常用指標包括攻擊的ROC曲線下面積,或合成樣本到其最近真實鄰居的平均距離。一個穩健的合成方案應使這些攻擊的成功率接近隨機猜測的水平。
5 技術路線
合成數據並非單一技術,而是多種方法的統稱,其選擇需要與具體場景、資料型別和核心需求對齊。
| 維度 | 規則/物理模擬引擎 | 傳統統計生成 | GAN/VAE | 擴散模型 | 大語言模型合成 |
|---|---|---|---|---|---|
| 核心機制 | 基於物理定律、3D建模與規則系統 | 插值(SMOTE)、自助法、貝葉斯網路 | 對抗博弈 / 變分推斷 | 正向加噪與逆向去噪的馬爾可夫鏈 | 大規模預訓練Transformer的自迴歸生成 |
| 適用場景 | 自動駕駛、機器人、工業數字孿生 | 小規模表格資料的類別平衡 | 表格、時序、影像、影片 | 高保真影像、3D資產、分子結構、影片 | 文本、對話、程式碼、指令遵循、思維鏈 |
| 保真度 | 物理邏輯上逼真,但視覺紋理與真實世界有差距 | 低,無法建模高維複雜依賴關係 | 中-高,但GAN易模式坍塌,VAE生成結果可能模糊 | 極高,尤其在細節和多樣性上表現卓越 | 中-高,高度依賴提示詞質量和基座模型能力 |
| 隱私保護強度 | 天然無真實資料洩露風險(若不匯入真實場景重建) | 弱,易過擬合,幾乎無隱私保護 | 弱,GAN可能記憶訓練樣本,VAE同樣存在洩露風險 | 弱-中,可與差分隱私結合,但成本高昂 | 弱,LLM可能逐字複述訓練資料中的罕見文本 |
| 生成多樣性 | 由預設的規則和引數空間覆蓋決定 | 低 | 中-高 | 高,能從噪聲空間中產生新穎組合 | 高,可通過溫度係數、核取樣等解碼策略調控 |
| 生成速度 | 極慢,受制於複雜的物理渲染管線 | 極快 | 快 | 慢,因需多步迭代取樣,但蒸餾技術正在加速 | 快(單次推論),但處理超長序列時變慢 |
| 計算成本 | 極高,需大規模GPU/CPU渲染農場 | 低 | 中 | 高,訓練和推論均消耗大量算力 | 高,推論需要高效能大記憶體叢集 |
注:本表為定性相對比較,實際表現在極大程度上取決於具體任務的資料複雜度、模型設計細節及訓練投入的計算資源。
6 上游
合成數據產業的源頭,是為生成過程提供核心要素的環節。
- 高質量真實資料:這是所有資料驅動生成的“種子集”與“校準源”。其質量決定了合成數據質量的理論上限。來源包括企業內部沉澱的業務資料、專業資料標註商提供的精細化標註資料集,以及合規資料交易市場流通的脫敏資料。在“合成數據餵養下一輪模型,模型再去生成合成資料”的迴圈中,初始真實資料的覆蓋度和無偏性至關重要,否則“垃圾進,垃圾出”的風險將在迴圈中被指數級放大。
- 算力與基礎設施:生成模型(尤其是擴散模型和LLM)的訓練與推論,以及物理模擬渲染,對GPU/TPU等異構計算資源有剛性且巨大的需求。這直接拉動了以NVIDIA、AMD為代表的晶片廠商,以及AWS、Azure、GCP等雲端服務提供商的業務增長。專門為合成數據任務最佳化的渲染農場和AI推論叢集是關鍵基礎設施。
- 基礎演算法與開源架構:學術界和開源社群是整個產業技術創新的基石。從GAN、VAE、擴散模型的原創論文,到StyleGAN、Stable Diffusion、LLaMA等開源基礎模型,再到MIT的Synthetic Data Vault等專用工具包,它們降低了合成數據的技術門檻,並使眾多垂直領域公司能在此基礎上進行場景適配和微調。
7 下游
合成數據作為新型生產資料,其應用正在滲透進AI開發與部署的全生命週期。
- AI模型訓練與增強:這是最直接的下游。合成數據可作為訓練集的補充,特別是在真實樣本稀缺的長尾場景(如罕見故障檢測),或人工標註成本極高的任務(如影像語義分割)中,大幅度提升模型表現與魯棒性。
- 系統模擬與演算法驗證:在自動駕駛、具身智慧、航天航空、工業製造等領域,合成數據驅動的模擬環境是核心的研發工具。演算法可在低成本、零風險的虛擬世界中完成數百萬公里的駕駛測試或數萬小時的機器人操作訓練,並對各種極端工況進行安全驗證。
- 隱私安全的資料流通市場:合成數據提供了一種“資料可用而不可見”的合規流通範式。銀行、醫療機構可將客戶的合成數據出售或共享給第三方進行聯合建模、市場分析,從而啟用被隱私法規禁錮的資料要素價值,催生出新的資料資產類別和交易模式。
- 模型評估與紅隊測試:通過有針對性地合成對抗樣本、邊緣案例或包含特定偏見的樣本,可以對模型的魯棒性、公平性和安全性進行壓力測試和“紅隊”攻擊演練,暴露其在真實世界應用中可能出現的脆弱性。
8 受益公司
合成數據價值鏈上的主要參與者可以分為平台型巨頭、垂直領域專精者和開源生態。
-
平台型雲端廠商:
- NVIDIA:通過Omniverse Replicator、DRIVE Sim和Isaac Sim,建置了從合成數據生成到模擬驗證的完整軟硬體棧,是物理模擬路線的事實標準制定者。
- Google:體系化版面配置,包括為AI生成內容新增水印的SynthID、在Vertex AI平台集成合成資料能力、以及DeepMind使用合成環境訓練具身智慧模型。
- Amazon:在SageMaker Ground Truth中提供合成數據增強功能,並利用合成對話資料提升其語音助手Alexa在罕見和複雜指令下的魯棒性。
- Microsoft:其Azure平台和AI服務同樣集成了合成數據能力,並在研究層面,例如通過Project Florence等模型,探索文本到影像和影片的生成,可用於合成視覺資料。
-
垂直領域專精廠商:
- Gretel.ai:建置面向開發者的隱私工程合成數據平台,產品線覆蓋表格、文本、時序資料,強調易用性和與現有MLOps流程的整合。
- Mostly AI:專注結構化資料合成,在金融、保險等受嚴格監管的行業擁有廣泛客戶群,以其對錶格資料高保真度的合成能力著稱。
- Datagen:聚焦計算機視覺,專門合成高質量、高可控性的3D人臉、人體動作和室內環境資料,服務於AR/VR、安防、運動分析等領域。
- Parallel Domain:為自動駕駛和無人機研發提供“世界生成”能力,其API允許開發者程式化地生成和操控無限多樣的3D虛擬世界和場景。
-
開源生態與模型提供商:提供Stable Diffusion等基礎模型的Stability AI,以及Hugging Face、各大高校和開源社群,它們促進了合成數據技術的民主化擴散,使得小型團隊也能以較低成本獲取先進的生成能力。
9 市場規模
合成數據市場正處於從早期採用階段向主流應用跨越的快速增長期,儘管量化分析受限於口徑不一和商業化早期的透明度限制。
- 需求端驅動力:全球資料隱私法規(如GDPR、中國的《個人資訊保護法》)日趨嚴格,合規成本急劇上升。同時,大型模型訓練導致的對多樣化、高質量資料的需求呈指數級增長,而網際網路上可用的高質量真實資料積累速度已顯瓶頸,供需缺口巨大。
- 增長估計:多份市場研究報告對合成資料市場給出了高度樂觀的預測,普遍認為其年複合增長率將超過30%。例如,Gartner曾預測,到2024年,用於訓練AI模型的資料中有60%將是合成數據[Gartner, “Maverick Research: Build a Data-Centric Culture with Synthetic Data”, 2022, 此為趨勢預測而非市場規模],到2030年,合成數據在AI模型訓練中的使用量將完全超越真實資料。在市場規模上,不同機構的估算差異較大,有報告認為該市場將在2027-2028年增長至數十億美元量級[行業研究報告彙總,如Cognilytica, Grand View Research等,此處為口徑彙總,未單列具體來源]。需要指出的是,這些預測的假設和方法論不同,數字應被視為遠景展望而非精確度量。
- 市場結構:當前市場高度碎片化。一方面,開源工具包(如SDV)降低了入門門檻,使得部分需求在內部被消化;另一方面,商業平台正在各自的垂直領域建立壁壘,但缺乏公認的行業評估標準和定價體系,買方市場存在嚴重的資訊不對稱。
10 玩家對比
將不同型別的玩家進行橫向對比,有助於釐清競爭格局和各自的價值主張。
| 對比維度 | 綜合性雲端平台 | 垂直專精創企 | 開源社群/工具 |
|---|---|---|---|
| 典型代表 | NVIDIA, Google, AWS, Microsoft | Gretel.ai, Mostly AI, Datagen | MIT-SDV, StyleGAN, Stable Diffusion |
| 核心優勢 | 擁有從算力基礎設施、平台服務到生態的完整閉環;客戶關係深厚;技術棧全面。 | 在特定領域(表格/3D視覺)或特定場景(隱私合規)的演算法上更專注、更深入;產品體驗更敏捷。 | 技術最前沿,迭代速度極快,完全免費,可定製化程度高,社群驅動。 |
| 核心劣勢 | 產品可能更偏向通用化,對特定垂直領域的極端需求響應較慢;整體方案成本可能較高。 | 客戶獲取成本高,品牌信任度建立週期長;生存和規模化擴充套件受融資環境波動影響大。 | 缺乏企業級的技術支援和SLA保障;使用門檻較高,需要較強的AI工程能力;隱私審計等高階功能需自行整合。 |
| 商業模式 | 作為整體雲端和硬體解決方案的一部分,通過算力、平台服務費和軟體許可實現價值。 | 提供SaaS訂閱、私有化部署或API呼叫,直接通過解決特定痛點實現價值變現。 | 主要由基金會、企業贊助和社群捐贈支援,商業模式不直接,通過諮詢、託管服務或開源核心的商業版本間接觸及。 |
11 風險
投資與採用合成數據技術面臨多層次的現實風險。
- “模型自噬”與分佈偏移風險:若不加控制地用前一輪模型生成的合成數據來訓練下一輪模型,會形成“資料近親繁殖”。這個過程會持續放大初始資料中的微小偏差,遺忘長尾資訊,最終導致分佈坍縮和模型效能的不可逆退化。這是合成數據廣泛應用後面臨的核心技術風險。
- 評估體系與標準缺位:行業至今缺乏一套公認、通用、可量化的合成數據質量標準。使用者常依賴定性檢查或下游任務的A/B測試,但這不僅成本高、週期長,而且結果難以在不同專案間遷移。這使得劣質合成數據“劣幣驅逐良幣”成為可能,使用者在採購和採用時認知模糊,容易引發生產事故。
- 隱私幻覺風險:許多從業者存在普遍誤解,認為只要資料是“生成”的就天然保護隱私。但大量研究表明,不加約束的生成模型極易記憶並復現訓練樣本,導致嚴重的資料洩露。當前多數商業產品並無法提供強健的、經過嚴格審計的差分隱私保證,其宣稱的“匿名化”在新型攻擊面前可能形同虛設。
- 監管不確定性與合規風險:金融、醫療等強監管行業對合成資料的態度仍處於探索階段。合成數據能否在監管審計中被等同於真實資料使用,其生成過程如何被有效稽核,尚無明確的法律定論。這可能使先行者面臨合規風險。
- 高企的初始成本與專業技能屏障:建置高質量的合成數據管線,尤其是基於物理模擬或大型模型的路線的,需要高昂的算力投入和稀缺的複合型人才(同時精通AI和領域知識)。對多數中小企業而言,這構成了難以逾越的門檻。
12 誤讀糾偏
- 誤讀 1:“合成數據可以完全取代真實資料。” 事實是:合成數據是真實資料的增強與補充,而非替代。它的知識上限完全由作為“種子”的真實資料所限定。對於探索未知物理規律、發現全新市場趨勢或理解前所未有的社會現象等任務,合成數據無法憑空創造知識。在金融模型校準、藥物臨床試驗等關鍵任務中,真實資料仍然是對模型進行最終驗證的黃金標準。
- 誤讀 2:“只要用生成模型生成的資料就是絕對隱私安全的。” 事實是:這是一個極為危險的誤解。標準的GAN、擴散模型或LLM在訓練後,完全可能將其見過的罕見訓練樣本“記”在模型引數裡,並在生成時近乎原樣複述出來。使用此類合成數據釋出,與直接釋出部分真實資料無異。只有在生成過程中嵌入了差分隱私等具有理論保證的隱私保護架構,並經過嚴格的攻擊實驗審計,才能對隱私保護水平提供可信的量化承諾。當前的多數方案遠不能提供此項保證。
- 誤讀 3:“合成數據是用來造假的,是一種技術不道德的行為。” 事實是:合成數據的目的是解決真實、有益的AI訓練需求,其應用場景是資料增強、隱私保護、模擬測試,而非用於製造和傳播虛假資訊。技術本身是中性的。其倫理邊界由應用者界定,而用於訓練AI模型的合成數據,本身就是提升AI可靠性和安全性的一種正向工程技術。
13 最新事件
- 合成數據在旗艦大型模型訓練中走向中心舞臺:2024-2025年間,多家頂級AI實驗室揭露了其最新模型訓練中大規模使用合成數據的情況。例如,有報告指出Anthropic的Claude 3系列模型在訓練中使用了合成數據進行無害性訓練;Meta的Llama 3模型在開發中也探索了合成數據用於提升長文本和程式碼能力[公開報告揭露]。這標誌著合成數據從“幕後增強”走向“核心訓練元件”。
- DeepMind釋出Genie 2,展示互動式世界模型:Google DeepMind在2024年底釋出的Genie 2模型,雖然核心是基礎世界模型,但其顯著展示了從一張圖片生成可互動的、多樣化3D環境的強大能力。這在本質上為具身智慧和通用AI訓練提供了一種全新的、可無限擴充套件的“合成環境資料”生成範式。
- NVIDIA持續加碼Omniverse生態:在GTC 2024及後續活動中,NVIDIA宣佈了與多家主流汽車製造商和機器人公司的合作,將Omniverse與生成式AI模型結合,用於生成更加逼真、符合物理規律的合成訓練資料,特別是用於模擬複雜和危險的多智慧代理互動場景。
- 歐盟《人工智慧法案》生效,對資料治理提出新要求:2024年生效的歐盟AI法案,對高風險AI系統的訓練資料治理提出了嚴格要求。合成數據因有助於實現資料質量、可追溯性、代表性、偏見緩解和隱私保護,被業界視為滿足該法案合規性要求的潛在關鍵工具,但也將面臨更嚴格的生成過程審計。
- 學術前沿持續關注“模型自噬模型障礙”:多個頂級研究機構在NeurIPS、ICML等頂會上發表論文,系統性地研究和量化了在多代合成數據上迴圈訓練導致模型效能崩潰的條件和機制。這些研究正在為安全、可持續地使用合成數據設定邊界與指導原則。
14 追蹤指標
為持續追蹤合成數據產業的演進,建議關注以下訊號和指標:
-
技術與學術指標:
- 追蹤頂級會議(NeurIPS, ICML, CVPR)中關於生成模型、合成數據評估和模型自噬的最新論文,這是技術前沿的風向標。
- 關注旗艦模型(如GPT系列、Gemini系列、Claude系列、Llama系列)技術報告中關於合成數據使用方法的揭露章節,這是產業應用的最高水平體現。
- 監控MIT-SDV等主流開源專案的Star數和社群活躍度,反映技術民主化和採納程度。
-
產業與市場指標:
- 追蹤主要垂直廠商(Gretel, Mostly AI, Datagen等)的融資輪次、金額和估值變化,這是市場資本的直接態度。
- 關注NVIDIA、Google Cloud、AWS等平台廠商在財報或年度大會上對合成資料相關產品和服務的營收展望與客戶案例揭露。
- 監測在金融、醫療、自動駕駛等行業標準或監管檔案中,對合成資料使用的表述變化,這是制度化採納的關鍵訊號。
-
風險與監管指標:
- 關注全球主要經濟體資料保護機構(如EDPB、FTC)釋出的關於合成數據與匿名化關係的指導意見或執法案例。
- 追蹤CVEs或安全社群針對合成數據生成庫和服務的漏洞報告,特別是針對模型逆向和成員推斷攻擊的實際威脅情報。
15 信源
以下資料為建置和理解合成數據概念提供了堅實的基礎,讀者可藉此進行深度研究。
- 綜述書籍:Nikolenko, S. I. (2021). Synthetic Data for Deep Learning. Springer. (全面系統地介紹了合成數據的概念、方法與應用。)
- 綜述論文:Figueira, A., & Vaz, B. (2022). A Survey on Synthetic Data Generation for Deep Learning. WIREs Data Mining and Knowledge Discovery. (回顧了面向深度學習的多種合成數據生成技術。)
- 基礎理論文獻:Goodfellow, I., et al. (2014). Generative Adversarial Nets. Advances in Neural Information Processing Systems (NeurIPS). (奠定了生成對抗網路的基礎。)
- 隱私合成關鍵論文:Abadi, M., et al. (2016). Deep Learning with Differential Privacy. Proceedings of the 2016 ACM SIGSAC Conference on Computer and Communications Security. (提出了將差分隱私融入深度學習訓練的DP-SGD架構。)
- 特定領域生成模型:Xu, L., et al. (2019). Modeling Tabular Data using Conditional GAN. Advances in Neural Information Processing Systems (NeurIPS). (提出了專用於合成表格資料的CTGAN模型。)
- 業界趨勢報告:Gartner. (2022). Maverick Research: Build a Data-Centric Culture with Synthetic Data. (Gartner對合成資料在AI訓練中應用比例的戰略預測。)
- 開源工具:Synthetic Data Vault (SDV). Massachusetts Institute of Technology. https://sdv.dev. (MIT開發的一套用於表格、關係型及時序資料合成的開源生態系統。)
- 大型模型合成範式:Wang, Y., et al. (2023). Self-Instruct: Aligning Language Models with Self-Generated Instructions. Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics (ACL). (展示了利用LLM自身生成指令資料的範式。)