模型层 开放阅读

数据许可

Data Licensing

概念 ID
data-licensing
更新时间
2026-05-29
来源数量
待补

数据许可

3 秒看懂

数据许可 (Data Licensing) 数据许可不是“出售数据”,而是通过法律与技术协议,授予他人在限定时间、地域、用途范围内使用特定数据集的权利。这种权利的核心是使用权而非所有权的让渡。它是 AI 时代数据要素化和商品化的核心法律-商业框架。

3 分钟产业解释

在生成式 AI 爆发之前,数据更多被视为一种“消耗品”或“产品载体”——例如用户上传到社交平台的照片,其价值依附于平台产品本身。然而,大模型训练将数据提升到了与算力、算法并列的核心生产资料地位。这带来一个根本性问题:当数据成为燃料,谁拥有“加油站”的定价权和准入许可?

核心转变:数据从“附着于产品”变为“独立生产要素”。其价值不再仅取决于直接使用(如商业数据分析),更在于作为 AI 模型训练的“养料”。高质量、有标签、可溯源的数据是决定模型能力上限的关键变量。这就催生了清晰界定“谁的数据、能做什么、用多久、付多少钱”的庞大市场需求,即数据许可产业

关键驱动

  1. 法律合规刚性需求:全球数据隐私法规(如 GDPR、CCPA)和版权法对数据使用的限制日益严格。大模型在互联网公开数据上“自由爬取”训练的模式面临巨大的法律诉讼风险(如《纽约时报》诉 OpenAI 案)。许可是规避风险的唯一合法路径
  2. 数据价值重估与资产化:数据所有者(媒体集团、专业出版商、大型平台)开始意识到其持有数据是 AI 训练的“稀缺原料”,有强烈的变现动力。许可是将其数据资产转化为可持续收入的商业模式。
  3. 模型可信与可靠性需求:企业级 AI 模型需要可溯源、高质量、无争议的数据进行训练和微调。经过清晰许可的专业数据(如医学文献、金融数据、权威知识库)是构建可靠 AI、避免法律风险和声誉损害的基石。

技术原理

数据许可的技术支撑体系围绕 “确权-溯源-计量-执行” 四大支柱构建,旨在以技术手段为法律合约提供可验证的证据和执行保障。

1. 确权(Attestation of Rights)

  • 区块链存证:将数据集的哈希值、权利声明、许可条款摘要和授权历史记录上链,生成不可篡改的时间戳证据。
  • 元数据标准:采用标准化的数据描述框架(如 Data Nutrition Label、Datasheets for Datasets),清晰记录数据的来源、采集方式、权属链条和许可范围。
  • 数字证书:由可信第三方颁发数据资产证书,链上可验证,为数据提供方和需求方建立信任。

2. 溯源(Provenance Tracking)

  • 数字水印:在数据(图像、文本、音频)中嵌入难以察觉且鲁棒性强的标识信息,即使数据经过部分裁剪或处理,仍可识别。
  • 数据指纹:提取数据特征生成唯一哈希值。当疑似侵权模型产出时,通过比对产出物特征与指纹数据库,反向推断模型是否使用了特定数据集。
  • 训练日志分析:记录模型训练全流程中每个批次所用数据的来源和版本,实现全链路追溯。

3. 计量(Usage Metering)

  • 模型使用量分成:基于 API 调用次数、模型推理次数,结合合同约定的分成比例,计算数据许可方的应得版税。
  • 训练贡献度评估:利用数据估值技术(如 Data Shapley)本身估算单个数据集对最终模型性能的贡献,据此计算许可费分配权重。此技术目前处于前沿研究阶段,大规模商用公开资料未见。

4. 执行(Policy Enforcement)

  • 隐私计算环境:在联邦学习、可信执行环境(TEE)中完成训练,确保原始数据“不出域”,仅输出模型梯度或最终模型。实现了“使用权许可”而非“数据转移许可”。
  • 智能合约:在满足预设条件(如链上监测到 API 调用量达到某阈值)时,自动触发分成支付,无需人工干预。
graph TD
    subgraph “许可流程”
        A[数据源持有方] --> B(数据预处理/标准化)
        B --> C{许可平台}
        C --> D[可证确权: 区块链+元数据]
        D --> E[合规数据使用环境: TEE/联邦学习]
        E --> F[AI模型训练]
        F --> G[模型服务/API]
        G --> H[计量与溯源: 水印+日志分析]
        H --> I[自动结算: 智能合约付款]
        I --> A
    end

    subgraph “关键技术组件”
        T1[区块链/数字证书]
        T2[数据营养标签]
        T3[数字水印/数据指纹]
        T4[联邦学习/TEE]
        T5[链上自动支付]
    end

    D -.-> T1
    D -.-> T2
    E -.-> T4
    H -.-> T3
    I -.-> T5

关键参数

评估数据许可业务和技术的成熟度,需关注以下量化指标。所有数字为示意或基于公开资料的估算,不代表任何投资或经营建议。

业务健康度

  • 许可协议总额 (TCV):已签署的长期许可合同未来能产生的总收入。反映商业模式的可见度和可持续性。例如,Reddit 在 2024 年 1 月披露,其与某 AI 公司的数据许可合同总价值为 6640 万美元,为期 2 年(来源:Reddit S-1 文件,2024 年 2 月)。
  • 年均许可收入 (ARR):每年度可重复获取的许可收入。衡量市场需求的即时规模。
  • 平均许可单价 (ASP):每单位数据(如每百万词元、每千张图片)的许可费用。反映数据稀缺性和议价能力的核心指标。目前市场价格差异极大,公开资料未见标准化行情。

运营效率

  • 许可覆盖率:一个数据集中,已完成合规确权且明确可用于商业 AI 训练的数据所占的比例。这是衡量数据集“合规即用性”的关键。
  • 确权周期:从数据盘点、确权申请到获得清晰法律权属证明的平均耗时。越短越有利于资产流动。
  • 溯源准确率:在模拟攻击(如模型蒸馏、数据混合)下,通过技术手段成功追踪到特定数据集使用的比率。这是技术可靠性的硬指标,目前行业尚在早期基准测试阶段。

市场渗透

  • 已许可数据在头部模型训练数据中的占比:估算 OpenAI、Google 等巨头用于训练模型的数据中,通过商业许可获取的比例。2023 年之前极低,之后快速上升,但具体数字公开资料未见。
  • 垂直行业渗透率:在高价值领域(如医疗、金融、法律),已采用标准化数据许可模式的专业数据供应商占比。

技术路线

数据许可的落地依赖多种技术路线的竞争与融合。不同路线在安全性、成本、效率之间存在权衡。

技术形态核心机制优势劣势代表案例/技术
合同+事后审计签署传统法律合同,保留定期审计权。数据直接交付。部署简单,无额外技术成本。信任成本高,数据易泄露和二次传播,审计困难。早期数据集 API 模式。
集中式安全沙箱数据使用方在数据提供方或可信第三方的隔离环境中进行训练,不可下载数据,仅可取出模型。安全性显著提升,防止原始数据流失。计算资源受限于沙箱提供方,成本可能较高,跨平台难。云服务商提供的数据洁净室 (Data Clean Room)。
数字水印+存证数据内嵌水印,权属和使用行为上链存证,用于事后追责和版权主张。不改变数据本身,对训练流程侵入性小。防御性手段,无法事前阻止侵权;水印可能被破坏。Steg.AI, IMATAG 提供的解决方案。
联邦学习模型在数据提供方本地训练,仅交互加密的梯度信息,中心服务器聚合更新。原始数据不出域,安全等级最高。通信开销大,训练效率低;对非独立同分布数据敏感;存在梯度泄露风险。Google Gboard 输入法训练,医疗影像分析。
同态加密直接在密文上进行计算和模型训练,得出加密结果,唯有持有密钥方可解密。理论上提供最强的隐私保护。计算开销极大,目前难以支撑大模型训练的海量计算。IBM Research 的前沿研究。

目前,行业主流是结合合同条款的“安全沙箱” 模式,并辅以数字水印和区块链存证作为审计和维权证据。联邦学习等隐私计算技术在高安全场景(如金融、医疗)中逐渐落地,但距成为大模型训练的通用方案尚有距离。

上游

数据许可的上游是数据权利的持有方,它们是 AI 产业的“原料”供应者,其议价能力和供给意愿决定了产业成本。

  • 专业内容商:拥有原创、结构化、高质量内容的机构。
    • 新闻与出版:如新闻集团 (News Corp)、美联社 (AP)、《纽约时报》(NYT)。其内容具备强时效性和事实核查价值。
    • 学术与教育:如学术期刊出版商(Elsevier, Springer Nature),拥有同行评审的高密度知识。
    • 影像与音乐:如 Getty Images、Shutterstock、环球音乐集团。视觉和音频数据的版权壁垒极高。
  • 平台与社区:拥有海量用户生成内容 (UGC) 聚合权利的主体。
    • 社交媒体:如 Reddit、X (Twitter)、Meta。其平台协议通常约定用户授予平台广泛的内容使用权,平台可以此为基础进行二次许可。
    • 专业社区:如 Stack Overflow、GitHub。聚集了高质量的程序代码和技术知识。
  • 专业数据商:以生产和销售数据为核心业务的公司。
    • 金融数据:如彭博 (Bloomberg)、标准普尔 (S&P Global)。时间序列金融数据是量化模型的核心原料。
    • 医疗与科学数据:如医院集团、医学影像中心、基因测序公司。数据高度敏感,许可流程最为严格。
  • 政府与公共机构:持有大量公共数据资源。其开放政策(如开放政府数据计划)和特定许可条款(如非商业使用限制)对产业发展有重要影响。

下游

数据许可的下游是数据的使用方和被许可方,它们是 AI 产品和服务的直接构建者,其需求定义了市场的规模。

  • 基础模型开发商:需求驱动者。
    • 全球巨头:OpenAI、Google DeepMind、Anthropic、Meta AI。需要海量多模态数据用于预训练,从文本、代码到图像、视频。
    • 中国厂商:百度、阿里、腾讯、字节跳动、MiniMax 等。同样面临高质量中文和多语言数据的许可需求。
  • 垂直模型与应用公司:在特定行业构建专用模型的企业。
    • 金融科技:需要高频交易数据、另类数据、合规知识库的许可。
    • 医疗 AI:需要医学影像、电子病历(脱敏后)、药物研发数据的许可。
    • 法律科技:需要判例法、法规条文、合同范本数据的许可。
  • 云服务商与 AI 平台:扮演渠道角色。
    • AWS, Azure, GCP:在其平台上提供数据市场,连接数据提供方和模型训练方。其 SageMaker、Vertex AI 等产品集成了数据许可和合规功能。
    • 数据平台:如 Databricks,Snowflake,通过其数据共享和 marketplace 能力,成为数据许可交易的中间层基础设施。

受益公司

基于公开信息梳理在数据许可产业价值链上已形成明确业务或定位的代表性公司。以下内容为客观事实陈述,不代表任何买卖建议。

数据方(许可方)

  • Reddit (RDDT):在 2024 年 IPO 中明确披露,其数据许可业务是重要增长引擎。与 Google 等公司签署了总额约 2 亿美元(多年)的许可协议,允许其使用 Reddit 帖子训练 AI 模型。(来源:Reddit S-1 及财报文件,2024 年)
  • 新闻集团 (NWSA):与 OpenAI 在 2024 年 5 月达成多年全球合作伙伴关系,许可其旗下《华尔街日报》《泰晤士报》等媒体的内容用于 ChatGPT 训练和展示。协议价值五年超过 2.5 亿美元。(来源:新闻集团官方新闻稿,2024 年 5 月)
  • Shutterstock (SSTK):作为视觉内容巨头,与 OpenAI、Meta、Google 等均签署了多年数据许可协议,为其图像生成模型提供训练数据。该业务已成为其企业服务的核心增长点。
  • 汤森路透 (TRI):旗下拥有 Westlaw 等海量专业法律和税务数据库。其数据许可是训练金融和法律专业模型的关键来源。公司明确表示已与多家 AI 公司就内容访问进行谈判。

平台与市场方

  • Snowflake (SNOW):其数据市场 (Snowflake Marketplace) 允许用户发现、获取和许可第三方数据,直接在平台内使用。截至 2024 年 4 月,平台上有超过 2,500 个数据产品。(来源:Snowflake 2024 年度财报)
  • Databricks:通过其数据共享平台 (Delta Sharing) 和 Marketplace,提供开放、跨云的数据交换和许可能力,是其湖仓一体 AI 平台战略的关键。

技术方

  • 一级市场技术公司:多家风投支持的初创公司专注于 AI 数据溯源、数字水印和隐私计算,旨在为数据许可提供技术支撑。但由于其业务主要在 B 端且多数未上市,公开财务数据有限。例如Steg.AI(数字水印)、Oasis Labs(隐私计算)等。

市场规模

量化全球 AI 训练数据许可的直接市场规模极为困难,因为它尚处于形成期,且常被纳入更广义的市场统计中。以下为基于公开资料的核心估算与参照系。

  • 直接市场(形成中):目前无权威机构的统一市场规模统计。其规模可从头部公司的公开协议窥见一斑。

    • 新闻集团与 OpenAI 五年协议价值超 2.5 亿美元。
    • Reddit 预期其 2024 年数据许可营收约为 6640 万美元(来源:Reddit S-1, 2024 年 2 月)。
    • 整体市场仍处于“点状爆发”阶段,由少数巨头之间的高价协议驱动,而非标准化、广泛覆盖的交易市场。根据 2024 年多份行业报告的非共识估算,该直接市场在 2024 年的规模可能在数亿至十数亿美元区间,但口径差异巨大。
  • 间接与参照市场

    • AI 训练整体服务市场:这通常包括了数据采集、标注、合成数据等多个环节。Cognilytica 在 2024 年初预测,全球 AI 训练数据集服务市场将从 2023 年的约 25 亿美元增长到 2030 年的超 100 亿美元(来源:Cognilytica, 2024)。许可是其中一个正在被单独拆分的子项。
    • 泛数据市场:IDC 全球 DataSphere 预测,到 2027 年,全球产生的数据总量将超过 291 ZB。其中可用于分析和 AI 训练的结构化、可合规化数据比例在提升。
  • 增长潜力:随着 AI 模型训练从“公域数据时代”进入“私域与高质量数据时代”,且法律诉讼风险日益明确,商业数据许可的支出将确定性增长,成为模型开发 COGS(营业成本)中继算力之后的新核心项。

玩家对比

当前数据许可市场的竞争格局尚在构建中,玩家类型差异巨大,尚未出现绝对主导者。

玩家类型核心优势商业模式短板与风险代表玩家
内容巨头(许可方)拥有独家、高质量、版权清晰的数据资产,内容品牌对模型有背书价值。直接与AI公司进行一对一大额谈判,追求高总价、多年期协议。资产分布不均,联盟松散,议价策略可能不统一;可能高估自身数据的不可替代性。新闻集团、索尼音乐、Getty Images
平台型(UGC聚合方)拥有海量、多样化的实时数据流,能反映人类文化和语言的最新动态。利用平台协议对UGC的广泛使用权进行二次许可,追求规模化变现。面临用户隐私和权益诉讼风险。例如,Reddit 部分子版块抵制 API 政策变化即为信号。Reddit、X (Twitter)、Stack Overflow
云/数据平台(市场方)控制数据存储和计算的管道,有海量现有客户,技术能力使“即采即用”成为可能。提供数据市场,收取手续费或佣金,促进生态内交易。自身不拥有内容资产,需吸引足够多的优质数据商入驻。数据网络效应是关键。Snowflake、Databricks、AWS
技术方案商(赋能方)独家的隐私计算、水印、溯源技术。向数据方或使用方销售技术软件或提供 SaaS 服务,保障许可的执行。技术成熟度和标准化程度低,市场认知不足。作为纯技术商,较难介入核心商务协议。Steg.AI、Tonic.ai、TripleBlind

风险

数据许可产业面临多维度的系统性风险与技术不确定性。

1. 法律与监管风险:极高

  • “合理使用”边界的司法裁决:全球多个司法管辖区(美国、欧盟、英国等)正在审理的版权案件(如《纽约时报》诉 OpenAI)将成为决定产业走向的里程碑。若法院广泛支持“合理使用”或引入强制许可,将从根本上削弱数据持有方的议价能力和市场价值。
  • 隐私法规的冲突:即便有商业许可,用个人数据训练模型仍必须符合 GDPR、CCPA 等隐私法规定的“知情同意”、“数据最小化”、“删除权”等原则。这为大规模商业许可带来了极高的合规复杂性。例如,欧洲数据保护委员会 (EDPB) 对于 AI 训练中的“合法利益”基础尚无最终指南。

2. 技术风险:高

  • 溯源技术失效:当前的水印和指纹技术可能被对抗性攻击、模型蒸馏、数据混合清洗等方式规避或破坏。一旦技术防线被攻破,基于使用量的分成模式将失去审计基础。
  • 隐私计算瓶颈:联邦学习和同态加密的算力开销、通信延迟仍是大规模应用的核心障碍,限制了“数据不转移”许可模式的经济性。

3. 商业与市场风险:中高

  • 合成数据替代:如果合成数据生成技术在质量和效率上取得突破,能以极低成本替代真实数据用于多数训练场景,将从根本上颠覆整个数据许可的价值主张。
  • 买方垄断与价格战:少数资本充足的头部 AI 公司作为主要买家,在面对分散的数据供应商时拥有极强的议价优势,可能形成买方垄断,压低许可费。

误读纠偏

误读一:数据许可就是“卖数据”,和卖软件许可一样。 纠偏:这是根本性误解。软件许可是对软件版权的授权使用。数据许可的标的则复杂得多,它可能涉及版权、商业秘密、数据库权、隐私权、公开权的复合体。其更关键的衍生维度是,数据许可协议常需界定使用数据训练出的模型的权属和商业化权利,这在软件许可中完全不成立。

误读二:用公开数据(如 Common Crawl)训练模型就不需要许可。 纠偏:数据的“公开可访问性”不等于法律意义上的“免许可可用于商业 AI 训练”。Common Crawl 在 robots.txt 协议的指引下抓取数据,但 robots.txt 只是网络礼仪,没有法律强制力。版权法下的“合理使用”原则在 AI 大模型训练场景下存在巨大法律争议,全球未有定论。使用任何公开数据集,必须逐一审查其发布的特定许可证条款(如各种 CC 协议对各商业用途的限制)。

误读三:只要匿名化和脱敏,个人数据就可以自由许可。 纠偏:有效的匿名化在法律和技术上都是极高门槛。技术上,再识别攻击不断进化;法律上,GDPR 等法规对匿名化后的数据在重新识别风险存在时仍适用。且公开信息爬取仍可能侵犯用户的“合理隐私期望”。数据许可方必须有严密的技术和法律证明其有效匿名化。

最新事件

反映 2023-2024 年间数据许可领域的标志性进展(截至 2024 年 7 月):

  • 2024 年 6 月:唱片业巨头起诉 AI 音乐生成公司。索尼音乐、华纳音乐和环球音乐对音乐生成 AI 公司 Suno 和 Udio 提起大规模版权侵权诉讼,指控其在“规模庞大的版权曲库”上训练模型。这标志着音乐产业正式就 AI 训练许可开战。(来源:RIAA 官方公告及法院文件)
  • 2024 年 5 月:新闻集团与 OpenAI 签署历史性协议。价值超 2.5 亿美元的多年全球许可协议,包括将新闻集团的内容用于训练和展示。这是迄今为止金额最高的公开数据许可协议之一。(来源:新闻集团官方新闻稿)
  • 2024 年 2 月:Reddit 公开上市并披露数据许可业务。其在 S-1 招股书中详细披露了数据许可业务,显示其 2024 年预计收入为 6640 万美元,并已与 Google 签约,使数据许可成为 AI 公司变现的标杆模式。
  • 2023 年 12 月:《纽约时报》起诉微软和 OpenAI。这起里程碑式的诉讼指控其非法使用数百万篇文章训练 ChatGPT,构成版权侵权。该案的进展被视为决定美国 AI 数据许可法律框架的核心事件。(来源:《纽约时报》官方声明及法院文件)

跟踪指标

用于持续观察数据许可产业发展的关键信号:

  • 领先指标(司法与政策):
    • 里程碑案件裁决:关注《纽约时报》诉 OpenAI 案、Getty Images 诉 Stability AI 案,以及欧盟、英国、日本相关案例的裁决结果。任何倾向性判决将立即重塑行业格局。
    • 法规更新:密切跟踪欧盟《人工智能法案》实施性细则中关于训练数据透明度的要求,以及中国数据知识产权的试点推广进度。
  • 同步指标(商业与市场):
    • 新增公开许可协议:大型媒体集团、UGC 平台与 AI 公司新达成协议的数量和总价值。Reddit、Shutterstock 等上市公司的数据许可季度营收。
    • AI 公司的数据采购支出:头部和腰部的 AI 模型公司在财报电话会和披露文件中透露的数据及 IP 获取成本的变化。
  • 滞后指标(产业成熟度):
    • AI 数据交易市场的标准合同条款:行业是否出现类似“知识共享许可协议 (Creative Commons)”的标准化的 AI 训练数据许可模板。
    • “数据成本占模型训练总成本比例”这一指标的出现和追踪。一旦这成为行业标准披露,标志着该产业完全成熟。

信源

本词条内容基于截至 2024 年 7 月的公开信息综合编写,力求客观、准确。

  • 公司官方与监管文件
    • Reddit, Inc. Form S-1 Registration Statement (2024 年 2 月).
    • OpenAI 与《纽约时报》诉讼相关法庭文件 (Case 1:23-cv-11195).
    • News Corp 官网公告 (2024 年 5 月).
    • Recording Industry Association of America (RIAA) 对 Suno/Udio 提起诉讼的官方新闻稿 (2024 年 6 月).
    • Adobe, Getty Images 关于 AI 与数据的官方政策页面.
  • 行业分析与数据
    • Cognilytica, “Global AI Training Datasets Market Report”, 2024 年初版.
    • IDC, “Worldwide Global DataSphere Forecast, 2023–2027”.
    • Gartner, “Predicts 2024: AI’s Impact on Data Management and Governance”.
  • 政策法规文本
    • 欧盟《人工智能法案》 (EU AI Act).
    • 中国《关于构建数据基础制度更好发挥数据要素作用的意见》(简称“数据二十条”).
source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型