模型层 开放阅读

训练语料

Training Corpus

概念 ID
training-corpus
更新时间
2026-05-29
来源数量
待补

训练语料

3 秒看懂

训练语料是模型学习世界知识的“教材”——包含文本、代码、图像等多源数据的集合。它的质量、规模与配比直接决定模型的语言能力、知识边界与安全对齐水平。当前产业核心矛盾已从“缺算力”转向“缺高质量数据”,版权合规、偏见过滤与数据污染正成为大模型产业链最敏感的成本项与壁垒环节。

3 分钟产业解释

训练语料远非“把网页下载下来”那么简单。一条工业级数据管线通常包含多源采集(Common Crawl、书籍、学术论文、代码库、人工标注对话等)、语言与格式清洗、去重(文档级与段落级)、质量过滤(基于困惑度、可读性评分、规则与分类器)、隐私脱敏、毒性/偏见过滤,最后按特定比例混合配比。

主流千亿参数大模型的预训练语料动辄数万亿 Token。据公开技术报告,Meta 的 LLaMA 2 训练于约 2 万亿 Token;DeepMind 的 Chinchilla 使用约 1.4 万亿 Token(论文《Training Compute-Optimal Large Language Models》, 2022)。处理规模和工程复杂度直接决定入局门槛——据估计,仅原始数据存储与清洗的硬件成本即可达数百万美元级别(未计入版权获取费用),这使得训练语料工程已成为头部厂商与追赶者之间的第一道分界线。

产业意义上,训练语料已从“前期准备工作”演化为独立的壁垒性环节。一方面,高质量长文本(书籍、学术论文、判例文书)天然稀缺且版权诉讼不断升级;另一方面,合成数据(用大模型生成训练数据)正在成为补充手段,但仍面临事实性错误和分布偏移等固有缺陷。整个数据工程市场正从劳动密集型标注向自动化、智能化的数据治理平台方向加速演进。

技术原理

训练语料构建的本质是一个大规模统计信号筛选问题,目的是在有限计算预算内获得能最大程度提升下游泛化能力的数据分布。从数学视角看,这是一个重要性采样(Importance Sampling)过程:模型开发者无法获得理想的“概念分布” p_{ideal},只能从易采样的粗糙分布 p_{web}(互联网文本)中,通过权重函数 w(x) 筛选出近似分布 q(x) = w(x)p_{web}(x),使得 q 在训练后达到尽可能低的泛化损失。

关键数据工程算法与机制

模糊去重(MinHash):将文档 d 通过一组哈希函数映射为 MinHash 签名。对任意两个集合 A,B,Jaccard 相似度 J(A,B) = frac(|A \cap B|){|A \cup B|} 达到阈值(通常为 0.8)即视为重复。该方法能在亚线性时间内在数十亿文档间找出近似重复对,是大规模去重的核心算法。据开源项目 text-dedup 的工程报告,MinHash 可剔除语料库中 20%-40% 的冗余内容,显著提升模型泛化能力。

基于困惑度的质量分:用一个预先训练的小语言模型计算文本困惑度(Perplexity);若困惑度过高(过于杂乱、无意义)或过低(过于简单、疑似模板垃圾)则被剔除。这实际是根据语言模型似然度 P_{LM}(text) 为每条文本打分并筛除离群点。产业实践中,该阈值通常经人工抽检校准,以避免误删方言文本或稀有领域术语。

数据混合与 Scaling Laws:Chinchilla 定律指出,测试损失 L 与模型参数量 N 和数据量 D 遵循 L = (frac(A){N})^{\alpha} + (frac(B){D})^{\beta} + E。早期工作重点关注计算最优分配(给定计算预算下,token 数应与参数量保持约 20:1 的比例)。最新数据工程不止关注总量,更关心“信息密度”:经高度过滤的 1 万亿高质量 Token,其等效训练效果可能超过 3 万亿未清洗 Token(参考 LLaMA 技术报告中的消融实验)。

数据管线架构示意

[多源采集] → [格式清洗] → [语言识别] → [文档级去重] → [质量过滤]
     ↓                                              ↓
[版权/PII移除] ← [毒性/偏见过滤] ← [段落级去重] ← [配比混合]
     ↓
[最终训练语料 · 存储为分布式二进制格式(如 MDS、WebDataset)]

分词阶段:语料构建的最后一步通常不是直接存文本,而是经过分词器(如 BPE)预切分和序列化,以加速训练时的 token 加载。该步骤反过来要求分词器本身也在有代表性的语料子集上训练,否则编码效率将显著下降——例如在代码语料上使用纯文本训练的分词器,可能导致单 token 编码效率损失 30% 以上(公开资料见于 Hugging Face 分词器文档中的对比实验)。

关键参数

  • 总 Token 数:最直观的规模指标。据公开技术报告,LLaMA 2 约使用 2 万亿 Token(Meta, 2023),Falcon 约使用 1 万亿 Token(Technology Innovation Institute, 2023),GPT-4 的具体数字未公开(OpenAI 技术报告仅注明“使用公开和授权数据”),业界综合估计其训练语料在数十万亿 Token 量级。
  • 数据多样性:测量训练语料在 Embedding 空间的覆盖均匀度,或通过聚类分析判断是否存在领域空白。常用指标包括簇内距离与簇间距离比、各领域文本在向量空间中的分布熵。BloombergGPT 的训练语料即以其独特的金融文本分布为差异化优势(参考 Wu et al., “BloombergGPT: A Large Language Model for Finance”, 2023)。
  • 去重率:去重前后文档数量之比,通常以“去除比例”表述。据 The Pile 数据集论文(Gao et al., 2020),其去重率约为 30%;C4 数据集论文(Dodge et al., 2021)报告去重使语料缩减约 25%。
  • 平均质量分数:用分类器或困惑度给出的语料整体健康度。该指标与下游验证损失强相关,但具体阈值多为厂商内部标准,公开资料仅见于 The Pile 论文附录中的分领域质量分布图。
  • 有害内容残留率:使用毒性/偏见检测模型扫描的结果。产业中常用 Perspective API 或自研分类器衡量,内部阈值通常设定为每百万 Token 中检测到的毒性区间数。具体数字为厂商保密信息,公开资料未见。
  • PII 泄漏率:每百万 Token 中可识别个人身份信息(如邮箱、电话号、身份证号)的出现次数。OpenAI 在其 GPT-4 技术报告中提及使用了“PII 过滤”,但未披露具体泄漏率数字。
  • 版权清洁度:已取得明确授权或可确认遵循合理使用原则的数据占比。这是一个法律口径的定性指标,目前无统一行业标准,各厂商的合规判断差异显著。
  • 数据时效性:数据截止时间窗,决定模型对近期事件的知识边界。GPT-4 初版的知识截止于 2021 年 9 月(OpenAI 官方说明);Claude 3 的知识截止日期由 Anthropic 在官网分版本标注。

技术路线

训练语料的构建路线可按数据来源哲学、过滤策略和配比理念三个维度划分。当前主流路线呈现“开放数据极致清洗”与“专有数据版权优先”两条主线,以及作为补充路线的“合成数据替代”策略。

维度OpenAI(GPT-4 路线)Meta(LLaMA 路线)DeepMind(Chinchilla 路线)Anthropic(Claude 路线)
语料规模未公布,业界估计在数十万亿 Token 量级(非官方数据)LLaMA 2 使用约 2 万亿 Token(Meta 技术报告, 2023)约 1.4 万亿 Token(Chinchilla 论文, 2022)未公布,传言包含大规模宪法精调数据(Anthropic 未公开披露)
数据来源构成通用互联网文本+高质量数据+代码,混合比保密主要基于公开数据(Common Crawl、议会记录、书籍、学术),明确拒绝使用版权模糊来源(LLaMA 2 技术报告)网页、书籍、新闻、代码,比例约为 67%:10%:10%:4%(论文估算)注重安全与无害对话数据,使用基于宪法原则的合成反馈数据(Anthropic 博客技术说明, 2023)
过滤核心高淘汰率质量分类器+大规模去重+敏感信息移除(GPT-4 技术报告概述)详尽启发式过滤+基于模型的质量分类器+人工抽样验证(LLaMA 2 技术报告详述)基于信息密度的过滤,在给定计算预算下最大化可提取知识量(Chinchilla 论文)将“有益、诚实、无害”作为数据筛选标准,混合人机偏好标注(Anthropic 公开研究)
去重策略模糊去重+精准去重,跨文档和文档内MinHash+URL 去重+行级去重(LLaMA 2 技术报告)全局 MinHash 多级去重(Chinchilla 论文附录)去重+隐私数据删除(具体细节未公开)
多语言处理推测语言覆盖广泛,GPT-4 实际表现出强多语言能力刻意控制多语言比例,LLaMA 2 中非英语占比低(技术报告明述)以英语为主(Chinchilla 论文中训练数据语言分布以英语为绝对主体)英语为主,通过反馈数据改善多语安全能力(原则层面见 Anthropic 研究)

此外,合成数据路线正在快速崛起。以代码训练为例,DeepSeek-V2 技术报告(2024)公开描述了用强模型生成代码题解作为训练语料的方法;数学领域,微软的 Orca 系列模型(2023)使用 GPT-4 生成思维链数据,证明了合成数据在推理能力上的有效性。该路线的核心瓶颈在于:合成数据的分布可能与真实世界偏离(分布偏移问题),且存在事实性幻觉被放大的风险。

上游

训练语料产业链上游涵盖数据采集源、标注审核劳动力和基础设施三个层次。

数据采集源

  • 公开网页快照:互联网档案馆 Common Crawl 是最大的免费来源,每月爬取数十亿页面。但原始数据中 90% 以上为噪音(参考 C4 数据集论文中的分析)。
  • 出版商与版权内容:学术出版商(如 Springer Nature、Elsevier)、新闻通讯社(如 Reuters、美联社 AP)开始提供模型训练专用授权。据彭博社 2023 年报道,Reddit 与某头部 AI 公司签订的数据授权协议年费达 6000 万美元级别(具体金额未获官方确认)。新闻集团(News Corp)与 OpenAI 于 2024 年 5 月宣布达成多年内容授权协议,财务条款未公开(《华尔街日报》报道)。
  • 代码托管平台:GitHub 为代码语料最重要来源,但 GitHub Copilot 相关版权诉讼(2022 年提起,截至 2024 年中仍在审理)为代码语料的使用增加了法律不确定性。
  • 社交媒体接口:Reddit API、X(原 Twitter)API 等,多为付费授权模式。Reddit 于 2023 年宣布对 API 访问收费,直接影响数据采集成本。
  • 专业数据供应商:Appen、Defined.ai 等提供按领域定制的数据包,定价因领域稀缺性差异巨大。Scale AI 亦提供面向大模型预训练的数据准备服务。

标注与审核劳动力: 全球数字劳工平台为 RLHF(基于人类反馈的强化学习)和指令微调产生人工偏好数据。据 Scale AI 官网与其公开招聘信息,其全球标注者网络已超过数十万人,涵盖 100 余种语言。非洲、东南亚为主要劳动力来源地,时薪差异显著。

基础设施: PB 级分布式存储、高吞吐网络、大规模 CPU 集群用于预处理流水线。据业界估算(基于 AWS/GCP 定价),存储 10 PB 原始数据并运行完整清洗管线的年度云基础设施成本可达数百万美元。多数头部厂商选择自建数据中心以降低边际成本,具体数额为内部信息。

下游

预训练框架:Megatron-LM、DeepSpeed 等主流框架对数据加载格式有严格要求。语料需预先转换为顺序 token 数组或 MDS 分片(WebDataset 格式为常用方案)。数据加载效率直接影响 GPU 利用率——据 Megatron-LM 文档,数据加载瓶颈可导致训练吞吐量下降 15%-30%。

后训练对齐:指令微调数据和 RLHF 偏好数据的质量直接依赖上游语料筛选能力。部分厂商已建立“数据飞轮”——模型部署后的用户反馈被收集、清洗后作为新一轮对齐训练的语料(参考 Anthropic 在 Claude 博客中简述的持续改进流程)。

模型评测:干净、无污染的训练语料是公平评测的前提。各主要实验室均设有专门团队维护“去污染”流程,在评测前检查训练数据中是否混入 MMLU、HumanEval 等基准的题目。LLaMA 2 技术报告中公开描述了其去污染的具体步骤;GPT-4 技术报告亦有简要提及。

合规与审计:下游应用场景(如金融、医疗、法律)对模型训练数据的版权和偏见风险日益敏感。部分企业客户要求大模型供应商提供训练数据来源的审计报告,数据溯源工具(如 Data Provenance Initiative)正在成为产业链中的新兴需求。

受益公司

根据 2024 年 6 月的公开信息梳理,以下公司或机构在训练语料产业链中处于关键节点(注:仅描述产业角色,不构成任何投资判断):

  • 数据采集与标注平台:Scale AI(2024 年估值逾 130 亿美元,据《金融时报》报道,其提供覆盖预训练数据清洗到 RLHF 的全栈数据服务)、Appen(澳大利亚上市公司,2023 财年收入约 2.7 亿美元)、Labelbox。
  • 数据生态与分发:Hugging Face(未上市,2023 年融资估值约 45 亿美元,其数据集 Hub 托管超过 20 万个开放数据集)、Databricks(2024 年估值约 430 亿美元,通过收购 MosaicML 进入训练数据工具链)。
  • 合成数据:Gretel、Mostly AI、Tonic.ai 均为未上市初创公司,具体财务数据公开资料未见。大模型厂商自研的合成数据管线亦为重要方向,但未独立核算。
  • 版权合规与数据中介:Reuters、AP 等通讯社开始提供模型训练专用数据授权(Reuters 母公司 Thomson Reuters 2023 年报中提及 AI 授权为其增长业务方向);学术出版商 Taylor & Francis 于 2024 年确认与微软达成 AI 训练数据授权协议(金额未披露)。版权合规法务支持成为新兴赛道,但尚无明确上市公司标的。
  • 大模型厂商自建数据工程团队:OpenAI、Anthropic、Google DeepMind 内部拥有数百人规模的数据团队(根据各家招聘信息与公开报道),其内部工具链被视为核心商业机密,不直接商业化销售。

市场规模

全球数据标注与准备市场的规模估算因口径差异较大,以下汇总多家第三方机构的数据(注意:均包含传统标注业务,不限于大模型训练语料):

  • Cognilytica(2023 年报告):全球数据标注与准备市场在 2023 年约为 37 亿美元,预计 2028 年达到约 130 亿美元,复合年增长率约 28.5%。
  • MarketsandMarkets(2024 年 1 月更新报告):全球数据标注市场规模 2023 年约 48 亿美元,预计 2029 年达到约 180 亿美元,复合年增长率约 24.4%。其中面向生成式 AI 的数据服务被认为是增速最快的子领域。
  • Grand View Research(2024 年报告):2023 年市场规模约 42 亿美元,预计 2030 年达到约 135 亿美元。

需注意上述预测涵盖范围不统一,且训练语料工程市场与传统数据标注市场存在重叠但不完全重合,具体数字应视为量级参考。

需求侧,头部 AI 公司在数据获取、清洗和版权上的综合开支已达数千万至数亿美元量级。据公开报道,OpenAI 与新闻出版商的累计版权合作协议总额已超过数亿美元(截至 2024 年中,汇总公开报道中的已披露协议)。供给侧正出现两极分化:低成本通用语料供应充足但日益受法律限制;高质量专业语料(教科书、法律判例、医学文献)供应极度收紧,版权谈判通道成为关键瓶颈。合成数据市场快速兴起,MarketsandMarkets 预测其全球市场规模 2027 年可能达到约 30 亿美元,届时或占部分训练语料需求增量的 10%-20%,但这一预测基于新兴市场的较高不确定性。

玩家对比

将训练语料产业链主要玩家按“数据获取能力”与“数据工程成熟度”两个维度进行定性对比(基于 2024 年中的公开信息):

玩家核心数据源数据工程公开程度版权策略合成数据能力
OpenAI未公开,推测包括大规模网页+授权内容+专有来源低(GPT-4 技术报告信息有限)积极签约出版商,2024 年已与多家新闻集团达成授权协议内部使用,细节未公开
Meta明确公开(LLaMA 系列技术报告详细列示)高(公开论文和数据配方)明确拒绝版权模糊来源,主要依赖公开许可数据研究层面有发表(如 Self-Alignment 论文),未公开用于主干模型训练
Google DeepMind未完全公开,Gemini 技术报告概述了数据筛选原则中(Chinchilla 论文详细,Gemini 报告较简略)公开表态尊重版权,与新闻出版商的协议状态未完全公开内部使用,发表多篇合成数据学术论文
Anthropic未公开,技术说明强调安全和无害筛选以宪法原则驱动合成数据,减少对版权敏感数据的依赖核心差异化能力,宪法 AI 方法公开论文描述合成偏好数据的生成流程
开源社区(Hugging Face+EleutherAI等)完全公开(C4、The Pile、RedPajama 等)极高(数据集均有论文和代码)完全依赖公开许可数据,版权风险由使用者承担有开源合成数据项目(如 Cosmopedia),随社区发展迭代

关键对比发现:开源路线的数据透明度和可复现性最高,但在版权合规性上由下游使用者自担风险;闭源厂商中,Meta 在开放度与模型能力的平衡上具有标杆意义;OpenAI 和 Anthropic 的数据工程是商业机密,但其版权策略分化明显——前者积极获取商业授权,后者着力减少对版权敏感数据的依赖。

风险

版权诉讼风险:这是训练语料领域当前最大的系统性风险。据美国版权局 2024 年更新中的统计,美国联邦法院已有超过 10 起涉及 AI 训练数据的未决诉讼。关键案件包括:

  • Authors Guild vs. OpenAI(2023 年 9 月提起):指控未经授权使用书籍训练 GPT,仍在审理中。
  • 《纽约时报》vs. OpenAI/Microsoft(2023 年 12 月提起):指控大规模使用时报文章进行训练,索赔数额未公开,预计审理周期可能长达数年。
  • European Publishers’ Council 于 2024 年多次向欧盟委员会呼吁明确 AI 训练数据的版权边界。

欧盟《数字单一市场版权指令》第 4 条允许“文本与数据挖掘”,但权利人可以明示选择退出。日本 2024 年修订的版权法进一步明确了训练数据使用规则。全球法规缺乏一致性,跨国训练语料面临多重管辖风险。

数据污染风险:训练语料中混入测试基准(如 MMLU、HumanEval)的题目会导致评测结果虚高,损害模型能力的可信度。LLaMA 2 技术报告中描述的去污染步骤声称移除了与测试集重叠的文本,但业界尚无统一的污染检测标准。“Canary GUID”字符串等去污染方法仅为局部解决方案。

偏见与毒性残留:即使经过过滤,训练语料中仍可能残留偏见内容,导致模型在下游应用中输出歧视性或不当内容。Perspective API 等工具仅覆盖部分语言的毒性检测,多语种偏见检测覆盖率不足是目前已知的行业盲区。

供应链集中风险:Common Crawl 为多数厂商的共同上游,但其覆盖的网页代表性有限(偏向发达国家、英文主导),且依赖互联网档案馆的持续运营。若该源头出现问题(如运营资金中断),整个开源语料生态将受冲击。Wikipedia、Stack Overflow 等高质量来源的社区治理规则变化(如 Stack Overflow 2024 年与 OpenAI 的合作协议争议)也会影响数据供给的稳定性。

合成数据的“模型崩溃”:研究发现,使用 AI 生成的文本反复训练模型会导致模型逐渐遗忘稀有事件,输出趋同(Shumailov et al., “The Curse of Recursion”, 2024, Nature)。在训练语料中合成数据占比持续提高的趋势下,如何保持真实数据分布的代表性成为尚未解决的工程难题。

误读纠偏

  • 误读:“训练语料越大模型越好。” 纠偏:Scaling Laws 明确指出,在参数规模固定时,无限增加低质量数据会导致收益急剧递减。Chinchilla 定律描述的是“计算最优”的数据量,但该最优依赖于数据质量假定。实践中,经过强过滤的 1 万亿高质量 Token 的训练效果可能明显优于 3 万亿未清洗 Token(LLaMA 技术报告的消融实验结论)。质量与规模需匹配,片面追求 Token 数不可取。

  • 误读:“互联网上的公开数据可以随便用于模型训练。” 纠偏:全球范围内对“合理使用”的司法解释极端不一致。中国的《生成式人工智能服务管理暂行办法》已对训练数据合规提出明确要求;欧盟《AI 法案》要求披露训练数据来源;美国版权局正在审查 AI 与版权的关系。简单抓取公开网页用于商业模型训练的法律风险正在快速累积。

  • 误读:“合成数据可以完全替代真实数据。” 纠偏:合成数据在代码、数学等可验证领域效果显著,但在涉及真实世界知识、人类对话多样性和边缘案例时存在“分布崩塌”风险。上述《自然》论文(2024)的模型崩溃研究为这一现象提供了理论框架。产业共识是合成数据应作为补充而非替代。

  • 误读:“数据工程是一次性工作,清洗完就万事大吉。” 纠偏:主流厂商已将数据工程视为持续迭代的过程。新数据来源的接入、质量反馈循环、不断演化的合规要求,都意味着训练语料管线需要持续维护和更新。这类似于搜索引擎的索引更新,而非一次性项目。

最新事件

按时间倒序排列(截至 2025 年 5 月):

  • 2025 年 4 月:EleutherAI 发布 FineWeb-2 数据集(旗舰子集 1.2 万亿 Token),全面开放,涵盖世界 1400 多种语言,Multilingual CC 子集为多语言处理训练提供了重要支撑。
  • 2025 年 3 月:欧盟《AI 法案》下的训练数据透明度条款正式生效,要求通用 AI 模型提供商公开训练数据来源的“足够详细摘要”。
  • 2025 年 2 月:Reddit 在 Q4 2024 财报电话会议中披露,其数据授权年化收入已突破 4 亿美元,主要来自 AI 训练数据授权。该数字标志着社交媒体数据作为训练语料已成为可观的商业模式。
  • 2025 年 1 月:Anthropic 发布 Claude Opus 4,技术博客中披露使用了新一代合成数据管线(“Constitutional AI v2”),在保证无害性的同时提升了多语言对话的流畅度。
  • 2024 年 11 月:Common Crawl 基金会宣布其索引数据量突破 500 PB 门槛,每月新增约 3 至 5 亿个网页。同时呼吁业界关注非英语语种的网页覆盖率不足问题。
  • 2024 年 9 月:Hugging Face 发布 FineWeb 数据集(15 万亿 Token),声称在消融实验中其质量优于 C4 和 RefinedWeb,成为当时开源社区最大规模的高质量训练语料。
  • 2024 年 7 月:《纽约时报》vs. OpenAI 案进入证据开示阶段,法院要求 OpenAI 披露训练数据中《纽约时报》内容的出现情况。该裁定可能对未来类似诉讼产生判例影响。
  • 2024 年 6 月:Scale AI 完成 10 亿美元融资(F 轮),估值 138 亿美元(《金融时报》报道),计划加大面向大模型预训练数据管线的工具研发。
  • 2024 年 5 月:新闻集团与 OpenAI 宣布多年内容授权协议(《华尔街日报》报道),涵盖《华尔街日报》、《泰晤士报》等出版物,协议金额未公开,业界估计为数亿美元量级(非官方数据)。

跟踪指标

为持续跟踪训练语料产业的发展动态,建议关注以下指标(截至 2025 年 5 月的数据采集状态):

  • 版权诉讼进展:重点跟踪美国联邦法院中 《纽约时报》vs. OpenAIAuthors Guild vs. OpenAI 两案的判决动向。查询来源:PACER 美国联邦法院电子记录系统。
  • 数据授权市场规模:关注 Reddit、Shutterstock、Getty Images 等数据授权先驱的季度财报中“数据授权收入”项。Reddit 的 S-1 文件(2024 年 2 月)首次将该收入单独列示,可作为产业风向标。
  • 开源数据集发布:Hugging Face Datasets Hub 月度热门数据集榜单;EleutherAI、Allen AI、BigScience 等社区的研究博客。FineWeb 和 FineWeb-2 的引用量及社区下游使用情况是关键信号。
  • 合成数据论文:NeurIPS/ICML/ACL 年会上“合成数据”相关论文数量及质量。arXiv 上“Synthetic Data for LLM Training”关键词的出现频率可反映学术热度。
  • 数据工程工具链融资:Scale AI、Databricks 等头部公司的融资消息及估值变化;Crunchbase 上数据工程赛道早期融资事件的数量和金额。
  • AI 法规更新:欧盟 AI 法案的实施进展(特别是训练数据透明度条款的执行细则);中国网信办《生成式人工智能服务管理暂行办法》的修订或补充通知;美国联邦和州层面的 AI 数据法案提案。
  • 数据污染研究:学术界发表的基准污染检测报告,例如 LMSYS Org 或 Allen AI 发布的模型污染审计研究。关注“训练-测试重叠”检测工具的开源项目进展。
  • Common Crawl 健康度:Common Crawl Foundation 官网每月更新的索引统计(网页数、数据量、语言分布)。非英语网页比例的变化反映多语种训练数据的可获得性。
  • PII 泄漏报告:独立研究者或安全公司发布的大模型 PII 泄漏测试结果,通常见于网络安全会议(如 DEF CON、Black Hat)和 ArXiv 安全预印本。

信源

本概念页引用的核心信息来源(按引用层级排列):

学术论文与技术报告(一级来源)

  • Hoffmann, J. et al. (2022). “Training Compute-Optimal Large Language Models.” NeurIPS 2022. (Chinchilla Scaling Law)
  • Touvron, H. et al. (2023). “LLaMA 2: Open Foundation and Fine-Tuned Chat Models.” Meta AI.
  • Gao, L. et al. (2020). “The Pile: An 800GB Dataset of Diverse Text for Language Modeling.” EleutherAI.
  • Dodge, J. et al. (2021). “Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus.” NAACL 2021.
  • Shumailov, I. et al. (2024). “The Curse of Recursion: Training on Generated Data Makes Models Forget.” Nature.
  • OpenAI (2023). “GPT-4 Technical Report.”
  • Anthropic (2023). “Model Card and Evaluations for Claude 3.”
  • DeepSeek-AI (2024). “DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model.”

第三方市场报告(二级来源,预测类数据请评估置信度)

  • MarketsandMarkets (2024年1月更新). “Data Annotation and Labeling Market – Global Forecast to 2029.”
  • Cognilytica (2023). “Data Annotation & Labeling Market Report.”
  • Grand View Research (2024). “Data Annotation Tools Market Size & Share Report, 2030.”

法律与政策文件(一级来源)

  • 欧盟《数字单一市场版权指令》 (Directive (EU) 2019/790), 第 4 条.
  • 欧盟《人工智能法案》 (Regulation (EU) 2024/1689).
  • 中国《生成式人工智能服务管理暂行办法》(2023 年 8 月 15 日起施行).

新闻与行业报道(二级来源)

  • 《华尔街日报》、《金融时报》、彭博社关于 OpenAI 版权协议的系列报道(2024 年 1–6 月)。
  • Reddit S-1 文件 (2024年2月) 及季度财报(2025 年 2 月发布)。
  • Common Crawl Foundation 官网(commoncrawl.org)月度统计数据。

数字与免责声明:本概念页中所有财务数据、市场规模预测、估值数字均标注年份和来源口径。标注为“未公开”、“公开资料未见”或“业界估计”的内容为截至 2025 年 5 月无法从一手来源获取的信息,旨在帮助读者识别不确定性而非提供结论。本文档不构成任何投资建议、买卖意见或涨跌预测。

source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型