資料許可
3 秒看懂
資料許可 (Data Licensing) 資料許可不是“出售資料”,而是通過法律與技術協議,授予他人在限定時間、地域、用途範圍內使用特定資料集的權利。這種權利的核心是使用權而非所有權的讓渡。它是 AI 時代資料要素化和商品化的核心法律-商業架構。
3 分鐘產業解釋
在生成式 AI 爆發之前,資料更多被視為一種“消耗品”或“產品載體”——例如使用者上傳到社交平台的照片,其價值依附於平台產品本身。然而,大型模型訓練將資料提升到了與算力、演算法並列的核心生產資料地位。這帶來一個根本性問題:當資料成為燃料,誰擁有“加油站”的定價權和准入許可?
核心轉變:資料從“附著於產品”變為“獨立生產要素”。其價值不再僅取決於直接使用(如商業資料分析),更在於作為 AI 模型訓練的“養料”。高質量、有標籤、可溯源的資料是決定模型能力上限的關鍵變數。這就催生了清晰界定“誰的資料、能做什麼、用多久、付多少錢”的龐大市場需求,即資料許可產業。
關鍵驅動:
- 法律合規剛性需求:全球資料隱私法規(如 GDPR、CCPA)和版權法對資料使用的限制日益嚴格。大型模型在網際網路公開資料上“自由爬取”訓練的模式面臨巨大的法律訴訟風險(如《紐約時報》訴 OpenAI 案)。許可是規避風險的唯一合法路徑。
- 資料價值重估與資產化:資料所有者(媒體集團、專業出版商、大型平台)開始意識到其持有資料是 AI 訓練的“稀缺原料”,有強烈的變現動力。許可是將其資料資產轉化為可持續營收的商業模式。
- 模型可信與可靠性需求:企業級 AI 模型需要可溯源、高質量、無爭議的資料進行訓練和微調。經過清晰許可的專業資料(如醫學文獻、金融資料、權威知識庫)是建置可靠 AI、避免法律風險和聲譽損害的基石。
技術原理
資料許可的技術支撐體系圍繞 “確權-溯源-計量-執行” 四大支柱建置,旨在以技術手段為法律合約提供可驗證的證據和執行保障。
1. 確權(Attestation of Rights)
- 區塊鏈存證:將資料集的雜湊值、權利宣告、許可條款摘要和授權歷史記錄上鍊,生成不可篡改的時間戳證據。
- 後設資料標準:採用標準化的資料描述架構(如 Data Nutrition Label、Datasheets for Datasets),清晰記錄資料的來源、採集方式、權屬鏈條和許可範圍。
- 數字證書:由可信第三方頒發資料資產證書,鏈上可驗證,為資料提供方和需求方建立信任。
2. 溯源(Provenance Tracking)
- 數字水印:在資料(影像、文本、音訊)中嵌入難以察覺且魯棒性強的標識資訊,即使資料經過部分裁剪或處理,仍可識別。
- 資料指紋:提取資料特徵生成唯一雜湊值。當疑似侵權模型產出時,通過比對產出物特徵與指紋資料庫,反向推斷模型是否使用了特定資料集。
- 訓練日誌分析:記錄模型訓練全流程中每個批次所用資料的來源和版本,實現全鏈路追溯。
3. 計量(Usage Metering)
- 模型使用量分成:基於 API 呼叫次數、模型推論次數,結合合同約定的分成比例,計算資料許可方的應得版稅。
- 訓練貢獻度評估:利用資料估值技術(如 Data Shapley)本身估算單個數據集對最終模型效能的貢獻,據此計算許可費分配權重。此技術目前處於前沿研究階段,大規模商用公開資料未見。
4. 執行(Policy Enforcement)
- 隱私計算環境:在聯邦學習、可信執行環境(TEE)中完成訓練,確保原始資料“不出域”,僅輸出模型梯度或最終模型。實現了“使用權許可”而非“資料轉移許可”。
- 智慧合約:在滿足預設條件(如鏈上監測到 API 呼叫量達到某閾值)時,自動觸發分成支付,無需人工干預。
graph TD
subgraph “許可流程”
A[資料來源持有方] --> B(資料預處理/標準化)
B --> C{許可平台}
C --> D[可證確權: 區塊鏈+後設資料]
D --> E[合規資料使用環境: TEE/聯邦學習]
E --> F[AI模型訓練]
F --> G[模型服務/API]
G --> H[計量與溯源: 水印+日誌分析]
H --> I[自動結算: 智慧合約付款]
I --> A
end
subgraph “關鍵技術元件”
T1[區塊鏈/數字證書]
T2[資料營養標籤]
T3[數字水印/資料指紋]
T4[聯邦學習/TEE]
T5[鏈上自動支付]
end
D -.-> T1
D -.-> T2
E -.-> T4
H -.-> T3
I -.-> T5
關鍵引數
評估資料許可業務和技術的成熟度,需關注以下量化指標。所有數字為示意或基於公開資料的估算,不代表任何投資或經營建議。
業務健康度
- 許可協議總額 (TCV):已簽署的長期許可合同未來能產生的總營收。反映商業模式的可見度和可持續性。例如,Reddit 在 2024 年 1 月揭露,其與某 AI 公司的資料許可合同總價值為 6640 萬美元,為期 2 年(來源:Reddit S-1 檔案,2024 年 2 月)。
- 年均許可營收 (ARR):每年度可重複獲取的許可營收。衡量市場需求的即時規模。
- 平均許可單價 (ASP):每單位資料(如每百萬詞元、每千張圖片)的許可費用。反映資料稀缺性和議價能力的核心指標。目前市場價格差異極大,公開資料未見標準化行情。
運營效率
- 許可覆蓋率:一個數據集中,已完成合規確權且明確可用於商業 AI 訓練的資料所佔的比例。這是衡量資料集“合規即用性”的關鍵。
- 確權週期:從資料盤點、確權申請到獲得清晰法律權屬證明的平均耗時。越短越有利於資產流動。
- 溯源準確率:在模擬攻擊(如模型蒸餾、資料混合)下,通過技術手段成功追蹤到特定資料集使用的比率。這是技術可靠性的硬指標,目前行業尚在早期基準測試階段。
市場滲透
- 已許可資料在頭部模型訓練資料中的佔比:估算 OpenAI、Google 等巨頭用於訓練模型的資料中,通過商業許可獲取的比例。2023 年之前極低,之後快速上升,但具體數字公開資料未見。
- 垂直行業滲透率:在高價值領域(如醫療、金融、法律),已採用標準化資料許可模式的專業資料供應商佔比。
技術路線
資料許可的落地依賴多種技術路線的競爭與融合。不同路線在安全性、成本、效率之間存在權衡。
| 技術形態 | 核心機制 | 優勢 | 劣勢 | 代表案例/技術 |
|---|---|---|---|---|
| 合同+事後審計 | 簽署傳統法律合同,保留定期審計權。資料直接交付。 | 部署簡單,無額外技術成本。 | 信任成本高,資料易洩露和二次傳播,審計困難。 | 早期資料集 API 模式。 |
| 集中式安全沙箱 | 資料使用方在資料提供方或可信第三方的隔離環境中進行訓練,不可下載資料,僅可取出模型。 | 安全性顯著提升,防止原始資料流失。 | 計算資源受限於沙箱提供方,成本可能較高,跨平台難。 | 雲端服務商提供的資料潔淨室 (Data Clean Room)。 |
| 數字水印+存證 | 資料內嵌水印,權屬和使用行為上鍊存證,用於事後追責和版權主張。 | 不改變資料本身,對訓練流程侵入性小。 | 防禦性手段,無法事前阻止侵權;水印可能被破壞。 | Steg.AI, IMATAG 提供的解決方案。 |
| 聯邦學習 | 模型在資料提供方本地訓練,僅互動加密的梯度資訊,中心伺服器聚合更新。 | 原始資料不出域,安全等級最高。 | 通訊開銷大,訓練效率低;對非獨立同分布資料敏感;存在梯度洩露風險。 | Google Gboard 輸入法訓練,醫療影像分析。 |
| 同態加密 | 直接在密文上進行計算和模型訓練,得出加密結果,唯有持有金鑰方可解密。 | 理論上提供最強的隱私保護。 | 計算開銷極大,目前難以支撐大型模型訓練的海量計算。 | IBM Research 的前沿研究。 |
目前,行業主流是結合合同條款的“安全沙箱” 模式,並輔以數字水印和區塊鏈存證作為審計和維權證據。聯邦學習等隱私計算技術在高安全場景(如金融、醫療)中逐漸落地,但距成為大型模型訓練的通用方案尚有距離。
上游
資料許可的上游是資料權利的持有方,它們是 AI 產業的“原料”供應者,其議價能力和供給意願決定了產業成本。
- 專業內容商:擁有原創、結構化、高質量內容的機構。
- 新聞與出版:如新聞集團 (News Corp)、美聯社 (AP)、《紐約時報》(NYT)。其內容具備強時效性和事實核查價值。
- 學術與教育:如學術期刊出版商(Elsevier, Springer Nature),擁有同行評審的高密度知識。
- 影像與音樂:如 Getty Images、Shutterstock、環球音樂集團。視覺和音訊資料的版權壁壘極高。
- 平台與社群:擁有海量使用者生成內容 (UGC) 聚合權利的主體。
- 社交媒體:如 Reddit、X (Twitter)、Meta。其平台協議通常約定使用者授予平台廣泛的內容使用權,平台可以此為基礎進行二次許可。
- 專業社群:如 Stack Overflow、GitHub。聚集了高質量的程式程式碼和技術知識。
- 專業資料商:以生產和銷售資料為核心業務的公司。
- 金融資料:如彭博 (Bloomberg)、標準普爾 (S&P Global)。時間序列金融資料是量化模型的核心原料。
- 醫療與科學資料:如醫院集團、醫學影像中心、基因測序公司。資料高度敏感,許可流程最為嚴格。
- 政府與公共機構:持有大量公共資料資源。其開放政策(如開放政府資料計劃)和特定許可條款(如非商業使用限制)對產業發展有重要影響。
下游
資料許可的下游是資料的使用方和被許可方,它們是 AI 產品和服務的直接建置者,其需求定義了市場的規模。
- 基礎模型開發商:需求驅動者。
- 全球巨頭:OpenAI、Google DeepMind、Anthropic、Meta AI。需要海量多模態資料用於預訓練,從文本、程式碼到影像、影片。
- 中國廠商:百度、阿里、騰訊、字節跳動、MiniMax 等。同樣面臨高質量中文和多語言資料的許可需求。
- 垂直模型與應用公司:在特定行業建置專用模型的企業。
- 金融科技:需要高頻交易資料、另類資料、合規知識庫的許可。
- 醫療 AI:需要醫學影像、電子病歷(脫敏後)、藥物研發資料的許可。
- 法律科技:需要判例法、法規條文、合同範本資料的許可。
- 雲端服務商與 AI 平台:扮演渠道角色。
- AWS, Azure, GCP:在其平台上提供資料市場,連線資料提供方和模型訓練方。其 SageMaker、Vertex AI 等產品集成了資料許可和合規功能。
- 資料平台:如 Databricks,Snowflake,通過其資料共享和 marketplace 能力,成為資料許可交易的中間層基礎設施。
受益公司
基於公開資訊梳理在資料許可產業價值鏈上已形成明確業務或定位的代表性公司。以下內容為客觀事實陳述,不代表任何買賣建議。
資料方(許可方)
- Reddit (RDDT):在 2024 年 IPO 中明確揭露,其資料許可業務是重要增長引擎。與 Google 等公司簽署了總額約 2 億美元(多年)的許可協議,允許其使用 Reddit 帖子訓練 AI 模型。(來源:Reddit S-1 及財報檔案,2024 年)
- 新聞集團 (NWSA):與 OpenAI 在 2024 年 5 月達成多年全球合作伙伴關係,許可其旗下《華爾街日報》《泰晤士報》等媒體的內容用於 ChatGPT 訓練和展示。協議價值五年超過 2.5 億美元。(來源:新聞集團官方新聞稿,2024 年 5 月)
- Shutterstock (SSTK):作為視覺內容巨頭,與 OpenAI、Meta、Google 等均簽署了多年資料許可協議,為其影像生成模型提供訓練資料。該業務已成為其企業服務的核心增長點。
- 湯森路透 (TRI):旗下擁有 Westlaw 等海量專業法律和稅務資料庫。其資料許可是訓練金融和法律專業模型的關鍵來源。公司明確表示已與多家 AI 公司就內容訪問進行談判。
平台與市場方
- Snowflake (SNOW):其資料市場 (Snowflake Marketplace) 允許使用者發現、獲取和許可第三方資料,直接在平台內使用。截至 2024 年 4 月,平台上有超過 2,500 個數據產品。(來源:Snowflake 2024 年度財報)
- Databricks:通過其資料共享平台 (Delta Sharing) 和 Marketplace,提供開放、跨雲端的資料交換和許可能力,是其湖倉一體 AI 平台戰略的關鍵。
技術方
- 一級市場技術公司:多家風投支援的初創公司專注於 AI 資料溯源、數字水印和隱私計算,旨在為資料許可提供技術支撐。但由於其業務主要在 B 端且多數未上市,公開財務資料有限。例如Steg.AI(數字水印)、Oasis Labs(隱私計算)等。
市場規模
量化全球 AI 訓練資料許可的直接市場規模極為困難,因為它尚處於形成期,且常被納入更廣義的市場統計中。以下為基於公開資料的核心估算與參照系。
-
直接市場(形成中):目前無權威機構的統一市場規模統計。其規模可從頭部公司的公開協議窺見一斑。
- 新聞集團與 OpenAI 五年協議價值超 2.5 億美元。
- Reddit 預期其 2024 年資料許可營收約為 6640 萬美元(來源:Reddit S-1, 2024 年 2 月)。
- 整體市場仍處於“點狀爆發”階段,由少數巨頭之間的高價協議驅動,而非標準化、廣泛覆蓋的交易市場。根據 2024 年多份行業報告的非共識估算,該直接市場在 2024 年的規模可能在數億至十數億美元區間,但口徑差異巨大。
-
間接與參照市場:
- AI 訓練整體服務市場:這通常包括了資料採集、標註、合成數據等多個環節。Cognilytica 在 2024 年初預測,全球 AI 訓練資料集服務市場將從 2023 年的約 25 億美元增長到 2030 年的超 100 億美元(來源:Cognilytica, 2024)。許可是其中一個正在被單獨拆分的子項。
- 泛資料市場:IDC 全球 DataSphere 預測,到 2027 年,全球產生的資料總量將超過 291 ZB。其中可用於分析和 AI 訓練的結構化、可合規化資料比例在提升。
-
增長潛力:隨著 AI 模型訓練從“公域資料時代”進入“私域與高質量資料時代”,且法律訴訟風險日益明確,商業資料許可的支出將確定性增長,成為模型開發 COGS(營業成本)中繼算力之後的新核心項。
玩家對比
當前資料許可市場的競爭格局尚在建置中,玩家型別差異巨大,尚未出現絕對主導者。
| 玩家型別 | 核心優勢 | 商業模式 | 短板與風險 | 代表玩家 |
|---|---|---|---|---|
| 內容巨頭(許可方) | 擁有獨家、高質量、版權清晰的資料資產,內容品牌對模型有背書價值。 | 直接與AI公司進行一對一大額談判,追求高總價、多年期協議。 | 資產分佈不均,聯盟鬆散,議價策略可能不統一;可能高估自身資料的不可替代性。 | 新聞集團、索尼音樂、Getty Images |
| 平台型(UGC聚合方) | 擁有海量、多樣化的即時資料流,能反映人類文化和語言的最新動態。 | 利用平台協議對UGC的廣泛使用權進行二次許可,追求規模化變現。 | 面臨使用者隱私和權益訴訟風險。例如,Reddit 部分子版塊抵制 API 政策變化即為訊號。 | Reddit、X (Twitter)、Stack Overflow |
| 雲端/資料平台(市場方) | 控制資料儲存和計算的管道,有海量現有客戶,技術能力使“即採即用”成為可能。 | 提供資料市場,收取手續費或佣金,促進生態內交易。 | 自身不擁有內容資產,需吸引足夠多的優質資料商入駐。資料網路效應是關鍵。 | Snowflake、Databricks、AWS |
| 技術方案商(賦能方) | 獨家的隱私計算、水印、溯源技術。 | 向資料方或使用方銷售技術軟體或提供 SaaS 服務,保障許可的執行。 | 技術成熟度和標準化程度低,市場認知不足。作為純技術商,較難介入核心商務協議。 | Steg.AI、Tonic.ai、TripleBlind |
風險
資料許可產業面臨多維度的系統性風險與技術不確定性。
1. 法律與監管風險:極高
- “合理使用”邊界的司法裁決:全球多個司法管轄區(美國、歐盟、英國等)正在審理的版權案件(如《紐約時報》訴 OpenAI)將成為決定產業走向的里程碑。若法院廣泛支援“合理使用”或引入強制許可,將從根本上削弱資料持有方的議價能力和市場價值。
- 隱私法規的衝突:即便有商業許可,用個人資料訓練模型仍必須符合 GDPR、CCPA 等隱私法規定的“知情同意”、“資料最小化”、“刪除權”等原則。這為大規模商業許可帶來了極高的合規復雜性。例如,歐洲資料保護委員會 (EDPB) 對於 AI 訓練中的“合法利益”基礎尚無最終指南。
2. 技術風險:高
- 溯源技術失效:當前的水印和指紋技術可能被對抗性攻擊、模型蒸餾、資料混合清洗等方式規避或破壞。一旦技術防線被攻破,基於使用量的分成模式將失去審計基礎。
- 隱私計算瓶頸:聯邦學習和同態加密的算力開銷、通訊延遲仍是大規模應用的核心障礙,限制了“資料不轉移”許可模式的經濟性。
3. 商業與市場風險:中高
- 合成數據替代:如果合成數據生成技術在質量和效率上取得突破,能以極低成本替代真實資料用於多數訓練場景,將從根本上顛覆整個資料許可的價值主張。
- 買方壟斷與價格戰:少數資本充足的頭部 AI 公司作為主要買家,在面對分散的資料供應商時擁有極強的議價優勢,可能形成買方壟斷,壓低許可費。
誤讀糾偏
誤讀一:資料許可就是“賣資料”,和賣軟體許可一樣。 糾偏:這是根本性誤解。軟體許可是對軟體版權的授權使用。資料許可的標的則複雜得多,它可能涉及版權、商業秘密、資料庫權、隱私權、公開權的複合體。其更關鍵的衍生維度是,資料許可協議常需界定使用資料訓練出的模型的權屬和商業化權利,這在軟體許可中完全不成立。
誤讀二:用公開資料(如 Common Crawl)訓練模型就不需要許可。 糾偏:資料的“公開可訪問性”不等於法律意義上的“免許可可用於商業 AI 訓練”。Common Crawl 在 robots.txt 協議的展望下抓取資料,但 robots.txt 只是網路禮儀,沒有法律強制力。版權法下的“合理使用”原則在 AI 大型模型訓練場景下存在巨大法律爭議,全球未有定論。使用任何公開資料集,必須逐一審查其釋出的特定許可證條款(如各種 CC 協議對各商業用途的限制)。
誤讀三:只要匿名化和脫敏,個人資料就可以自由許可。 糾偏:有效的匿名化在法律和技術上都是極高門檻。技術上,再識別攻擊不斷進化;法律上,GDPR 等法規對匿名化後的資料在重新識別風險存在時仍適用。且公開資訊爬取仍可能侵犯使用者的“合理隱私期望”。資料許可方必須有嚴密的技術和法律證明其有效匿名化。
最新事件
反映 2023-2024 年間資料許可領域的標誌性進展(截至 2024 年 7 月):
- 2024 年 6 月:唱片業巨頭起訴 AI 音樂生成公司。索尼音樂、華納音樂和環球音樂對音樂生成 AI 公司 Suno 和 Udio 提起大規模版權侵權訴訟,指控其在“規模龐大的版權曲庫”上訓練模型。這標誌著音樂產業正式就 AI 訓練許可開戰。(來源:RIAA 官方公告及法院檔案)
- 2024 年 5 月:新聞集團與 OpenAI 簽署歷史性協議。價值超 2.5 億美元的多年全球許可協議,包括將新聞集團的內容用於訓練和展示。這是迄今為止金額最高的公開資料許可協議之一。(來源:新聞集團官方新聞稿)
- 2024 年 2 月:Reddit 公開上市並揭露資料許可業務。其在 S-1 招股書中詳細揭露了資料許可業務,顯示其 2024 年預計營收為 6640 萬美元,並已與 Google 簽約,使資料許可成為 AI 公司變現的標杆模式。
- 2023 年 12 月:《紐約時報》起訴微軟和 OpenAI。這起里程碑式的訴訟指控其非法使用數百萬篇文章訓練 ChatGPT,構成版權侵權。該案的進展被視為決定美國 AI 資料許可法律架構的核心事件。(來源:《紐約時報》官方宣告及法院檔案)
追蹤指標
用於持續觀察資料許可產業發展的關鍵訊號:
- 領先指標(司法與政策):
- 里程碑案件裁決:關注《紐約時報》訴 OpenAI 案、Getty Images 訴 Stability AI 案,以及歐盟、英國、日本相關案例的裁決結果。任何傾向性判決將立即重塑行業格局。
- 法規更新:密切追蹤歐盟《人工智慧法案》實施性細則中關於訓練資料透明度的要求,以及中國資料智慧財產權的試點推廣進度。
- 同步指標(商業與市場):
- 新增公開許可協議:大型媒體集團、UGC 平台與 AI 公司新達成協議的數量和總價值。Reddit、Shutterstock 等上市公司的資料許可季度營收。
- AI 公司的資料採購支出:頭部和腰部的 AI 模型公司在財報電話會和揭露檔案中透露的資料及 IP 獲取成本的變化。
- 滯後指標(產業成熟度):
- AI 資料交易市場的標準合同條款:行業是否出現類似“知識共享許可協議 (Creative Commons)”的標準化的 AI 訓練資料許可模板。
- “資料成本佔模型訓練總成本比例”這一指標的出現和追蹤。一旦這成為行業標準揭露,標誌著該產業完全成熟。
信源
本詞條內容基於截至 2024 年 7 月的公開資訊綜合編寫,力求客觀、準確。
- 公司官方與監管檔案:
- Reddit, Inc. Form S-1 Registration Statement (2024 年 2 月).
- OpenAI 與《紐約時報》訴訟相關法庭檔案 (Case 1:23-cv-11195).
- News Corp 官網公告 (2024 年 5 月).
- Recording Industry Association of America (RIAA) 對 Suno/Udio 提起訴訟的官方新聞稿 (2024 年 6 月).
- Adobe, Getty Images 關於 AI 與資料的官方政策頁面.
- 行業分析與資料:
- Cognilytica, “Global AI Training Datasets Market Report”, 2024 年初版.
- IDC, “Worldwide Global DataSphere Forecast, 2023–2027”.
- Gartner, “Predicts 2024: AI’s Impact on Data Management and Governance”.
- 政策法規文本:
- 歐盟《人工智慧法案》 (EU AI Act).
- 中國《關於建置資料基礎制度更好發揮資料要素作用的意見》(簡稱“資料二十條”).