PII 过滤
1. 3秒看懂
PII 过滤(PII Filtering)是大模型训练数据预处理中的“隐私筛”,专门自动定位并移除文本中可识别到具体个人的信息——如姓名、身份证号、电话号码、住址、邮箱、车牌等,防止模型在训练中机械记忆个人隐私,降低生成输出泄露真实个人信息的风险,同时满足全球日益严格的数据保护法规要求。它并非简单的关键词匹配,而是融合了命名实体识别、上下文理解和策略化脱敏的多层技术体系。
2. 3分钟产业解释
在AI产业链中,数据常被比作“新石油”,然而未处理的原始数据含有大量“有害杂质”,其中最棘手的就是个人身份信息(PII)。PII过滤就是数据精炼厂中的核心净化装置之一,其产业刚需源于两大支柱。
法规驱动:全球数据隐私法规不断加码。欧盟《通用数据保护条例》(GDPR)对未经授权的个人数据处理设定了最高可处以全球年营收4%的罚款;中国《个人信息保护法》自2021年实施以来,明确要求处理个人信息须取得同意并履行保护义务;美国加州《消费者隐私法案》(CCPA)及各州类似立法接连落地。在大模型训练场景中,若爬取的网页文本、社交帖子或业务数据中包含未经清洗的PII,即构成违规。模型开发方和使用方都将面临严厉的行政处罚、民事赔偿乃至刑事责任。因此,PII过滤已从“应该做”的选项变为“必须做”的合规底线。
技术特性:大语言模型具有强大的“记忆”能力。研究(如Carlini等人在2021年发表的“Extracting Training Data from Large Language Models”)表明,模型可以逐字还原训练数据中的个人姓名、联系方式甚至身份证号。若不实施PII过滤,模型可能在与用户的平凡对话中不经意复现训练语料中的真实隐私,引发安全事故和严重的信任危机。例如,一名健康医疗聊天机器人若泄露了训练数据中的真实患者姓名与诊断结果,后果不堪设想。
因此,PII过滤已演变为大模型开发的刚性成本和必要基础设施。它直接影响数据获取的可行性、模型合规性以及最终产品的市场准入,也决定了数据飞轮能转得多快、多稳。
3. 技术原理
PII过滤并非单一的文本处理技巧,而是自然语言处理(NLP)、信息检索与机器学习分类的深度融合体。工业级系统通常构建为多层流水线,兼顾速度、召回率与准确率。
命名实体识别(NER):这是核心引擎。基于预训练语言模型(如BERT、RoBERTa、DeBERTa等)微调的NER模型能够识别文本中具有特定语义的实体,并加以分类。针对PII任务,主要关注人物(PER)、地点(LOC)、机构(ORG,若与个人关联)、电话号码、身份证号、邮箱地址等类别。模型必须能利用上下文区分“苹果很好吃”中的“苹果”是水果,而“苹果公司”中的“苹果”是组织,同理还需要在众多实体中识别出指向现实自然人的那部分。
规则与模式匹配:对高度结构化的PII,正则表达式等确定性规则仍然不可替代。例如,中国公民身份证号码为18位数字(末位可为X),银行卡号符合Luhn校验,邮箱遵循“local-part@domain”格式。规则引擎能极快地精确匹配标准格式,成本几乎为零,但对刻意变体(如“壹叁捌零零零零壹贰叁肆”)或非标准表达无效。
上下文理解与消歧:这是技术深水区。模型必须判断某个人名或地址在当前语境下是否真正指向一个需要被保护的自然人。例如,“爱因斯坦提出了相对论”中的“爱因斯坦”是已故的公共人物,通常不需作为PII屏蔽;但“我的邻居爱因斯坦住在伯尔尼钟楼街49号”则可能涉及隐私。同样,地名“北京”在“北京市海淀区XX小区”中为高敏感地址,而在“北京是中国的首都”中则为一般性陈述。现代系统通常增加一层上下文分类器,利用更丰富的上下文特征或轻量级LLM进行二次判断,以降低误报。
脱敏策略与数据维护:识别后并非简单删除。原始做法是直接移除或用固定符号如“[REDACTED]”替代,但这会破坏文本连贯性,影响模型训练质量。更优策略包括:泛化——将“张三”替换为“[人名]”,将“上海市浦东新区陆家嘴环路1000号”替换为“[地址]”;扰动——对数值进行随机微扰(如年龄加一);或合成数据生成——用生成模型产生一个语义等效但不含真实PII的替代句。策略引擎需根据不同下游任务(预训练、微调、推理安全防护)动态配置,以在隐私保护与数据效用之间取得精确平衡。
下图展示了一个理想化的多层PII过滤流水线:
graph TD
A[原始文本流] --> B{规则引擎
结构化PII(身份证、卡号)};
B -- 匹配 --> D[标记/脱敏];
B -- 未匹配 --> C{NER模型
人名、地址、电话等};
C -- 识别出实体 --> E{上下文分类模型
判断是否为自然人的真实PII};
E -- 是 --> D;
E -- 否/不确定 --> F[保留或人工复核];
D --> G[策略应用
替换/泛化/扰动/合成];
G --> H[清洁后数据];
4. 关键参数
评估PII过滤系统需综合安全、质量与效率三个维度,常用指标包括:
- 召回率(Recall):所有真实PII中被成功过滤出的比例。这是最核心的安全指标,一旦遗漏,即意味着隐私泄露风险。在合规要求极高的场景(如医疗、金融),召回率通常需达到99%以上;通用大模型预训练数据的过滤召回率目标一般不低于95%。
- 精确率(Precision):所有被系统判定为PII的片段中真正属于PII的比例。精确率直接影响训练数据的损耗度;精确率较低表示“误杀”过多正常文本,可能削弱模型的知识密度与语言流畅度。工业实践常追求F1分数的综合平衡,但对安全敏感领域,召回率权重更大。
- F1分数:精确率与召回率的调和平均,用于综合排序。
- 误报分布分析:不仅看总数,还需分析误报中误判了哪些实体类别。将公共人名误判为隐私人物的代价通常低于将普通名词误判为人名而导致知识缺失。因此,误报权重需按实体类别区分。
- 支持的PII类型覆盖度:能否识别姓名、身份证号、护照号、电话号码、邮箱、家庭住址、地理位置坐标、车牌号、生物特征标识(如基因序列中的个人标识)、医疗记录号、IP地址等。覆盖度越高,安全盲区越少。
- 多语言与多模态支持:处理中文、英文、混合代码、社交媒体文本、PDF元数据、图片中嵌入的文字等能力。
- 吞吐量:单位时间可处理的文本量(如GB/小时或tokens/秒)。大规模预训练语料常以TB计,系统必须满足吞吐要求,否则成为数据处理瓶颈。
- 延迟:单条数据处理耗时,影响实时交互场景(如在线聊天防护)。
- 更新成本:新PII模式(如新型支付标识)出现后,规则和模型更新的时间和人力成本。
5. 技术路线
PII过滤技术经历了从纯规则到多模型级联的演进,各路线在精度、召回、成本、灵活性上有明显差异。
纯规则/正则表达式(约2018年以前主流):基于模式匹配,擅长处理格式固定的PII(身份证号、信用卡号)。速度极快、无训练成本、可解释性强,但召回率低,对自然语言描述的地址、非标准电话格式等束手无策。目前仍作为大多数流水线的第一道快速筛网。
传统机器学习NER(2018—2020年):使用条件随机场(CRF)、隐马尔可夫模型(HMM)加手工特征工程进行实体识别。相比规则,能处理简单的上下文实体,计算资源要求较低,适合领域固定、变异较小的内部数据。缺陷是泛化能力差,特征工程耗费大量人力,面对开放域、多语言文本时性能骤降。
预训练语言模型微调(2021年至今,业界主流):在BERT、RoBERTa、DeBERTa等大规模预训练模型基础上,用人工标注的PII数据集进行命名实体识别微调。此路线召回率大幅提升,能较好理解上下文,适应多样文本风格。同时可通过多任务学习同时识别多种实体。缺点是需要高质量标注数据,训练和推理计算成本高,仍有误报风险。目前主流做法是采用此路线构建核心层,并在之上叠加后处理规则或上下文分类器。
多模型级联系统(工业最佳实践):融合“规则引擎 + 预训练NER + 上下文分类器/LLM裁决”的多层架构。规则处理高确定性结构化PII,NER模型覆盖上下文敏感的实体,再由轻量级分类器或LLM判断实体是否为当前语境下的自然人敏感信息。此方案能精细控制召回率与精确率的平衡,是目前大型AI实验室(OpenAI、Google DeepMind、Meta等)的实际落地架构,但系统复杂、维护成本高、单次处理延迟上升。
LLM直接过滤(探索阶段):利用大语言模型本身理解上下文,通过提示词要求其识别并匿名化PII。优点极其灵活,无需额外标注训练,能够应对复杂语用场景。缺点是推理成本极高、速度慢、输出稳定性不可控,可能因幻觉或指令跟随偏差导致漏报或误报。目前仅适用于离线极低吞吐场景或作为其他方法的补充裁决者。
技术路线对比表:
| 技术路线 | 核心方法 | 优势 | 劣势 | 当前应用地位 |
|---|---|---|---|---|
| 纯规则/正则 | 模式匹配 | 极快,零训练,可解释 | 召回率极低,无上下文 | 基础前置过滤器 |
| 传统NER | CRF+HMM+特征工程 | 资源要求低,领域可定制 | 泛化弱,工程量大 | 遗留系统或窄域场景 |
| 预训练NER微调 | BERT类微调 | 高召回,强泛化,上下文 | 需标注,计算成本高 | 当前主流核心引擎 |
| 多模型级联 | 规则+NER+分类器 | 安全与数据质量最佳平衡 | 复杂,维护成本高 | 大模型预训练数据管线标配 |
| LLM提示过滤 | 提示工程+LLM | 极灵活,零标注 | 成本极高,不可控 | 探索性研究,辅助裁决 |
6. 上游
PII过滤技术及其所需资源的上游主要包括:
- 原始数据供应商:互联网爬虫公司、数据交易市场(如部分第三方数据聚合商)、合作机构(如出版社、媒体)提供的未经清洗的文本、图像和视频等原始数据。这些数据源往往包含大量个人网页遗落的姓名、地址、手机号等。上游数据的质量与合规程度决定了PII过滤系统的起点压力。
- 标注服务与数据众包:微调NER模型需要大量人工标注的PII样本。Scale AI、Appen(澳鹏)、Amazon Mechanical Turk等平台提供可控质量的实体级标注,标注员需精确标出文本中每一段PII的起止位置和类别。标注成本以每千字符或小时计,中文、医疗等专业领域单价显著高于通用英文。
- 算力与基础模型提供方:云厂商(AWS、Azure、Google Cloud、阿里云)提供GPU/TPU集群用于NER模型训练和推理;开源模型社区(如Hugging Face)提供预训练权重(如bert-base-chinese、roberta-large等),为下游开发者降低进入门槛。
- 隐私法规与标准制定机构:上游的另一维度是由ISO、NIST、全国信息安全标准化技术委员会等制定数据脱敏与PII分类标准。这些标准定义了哪些信息属于PII的范畴,为过滤技术划定明确的目标边界。
7. 下游
PII过滤后的清洁数据进入大模型全生命周期,并衍生出合规与安全增值服务。
- 大模型预训练与微调:清洁数据直接注入预训练数据管道,用于基础大模型(如GPT系列、LLaMA系列、Baichuan等)和行业垂直模型的训练。有效的PII过滤能显著降低模型在各类隐私攻击(如成员推理攻击)下的脆弱性。
- 合规审计与数据治理:PII过滤日志、脱敏报告和统计数据成为企业向监管机构、客户证明数据合规性的关键证据。部分企业将PII过滤环节与数据血缘追踪、数据目录系统集成,实现全链条数据合规管理。
- 模型安全评估与红队测试:在模型安全对齐之前,安全团队常利用未过滤版本训练“影子模型”或对比过滤前后的模型行为,评估模型记忆隐私的程度,制定加固策略。
- 推理侧安全防护:PII过滤系统演化出实时API版本,用于对模型输出进行二次检测和脱敏,确保即使用户上传了含隐私的提示,模型返回中也不会泄露更多个人信息。
- 垂直行业解决方案:医疗、金融、法律等行业将PII过滤与专属脱敏规则结合,形成数据去标识化(De-identification)服务,满足HIPAA(美国健康保险携带和责任法案)、PCI DSS(支付卡行业数据安全标准)等强制规范。例如,医疗文本需要同时移除患者姓名、住院号、检查日期等直接标识,以及通过组合仍能定位到个人的准标识符。
8. 受益公司
PII过滤作为大模型数据准备的核心环节,使以下产业链节点直接获益或获得结构性需求拉动:
- 基础大模型开发商:OpenAI、Google DeepMind、Anthropic、Meta AI、百度、阿里巴巴、腾讯、字节跳动、科大讯飞等。它们自研大规模PII过滤管道,将合规能力内化为市场准入优势和商业信任资产。同时,其自身也受益于数据质量提升带来的模型能力增强。
- 数据标注与准备服务商:Scale AI、Appen、Sama、iSoftStone等。随着大模型军备竞赛加剧,对PII标注和过滤集成服务的需求水涨船高,这些公司将其作为数据预处理套餐的重要组成部分,拉动收入增长。
- 云平台与安全厂商:亚马逊AWS(Macie)、微软Azure(Purview)、Google Cloud(DLP API)、阿里云、腾讯云等将PII检测和脱敏能力打包为安全合规产品,服务于广大中大型企业客户,尤其是金融、医疗行业的上云需求,形成持续订阅收入。
- 隐私计算与数据安全初创公司:如Privacera、Immuta、OneTrust等,提供细粒度的数据访问控制和脱敏方案,部分将PII过滤作为其数据安全产品矩阵中的关键模块,服务于企业数据治理市场。
- 受监管行业(采用方):银行、保险公司、医院、政府机构等。它们并非PII过滤技术的开发者,但通过购买或使用相关产品降低自身大模型应用的法律风险,是终端受益者。能够提供成熟PII过滤方案的公司,对这类客户具备更强的获客能力。
注:以上仅为产业链环节分析,不构成对具体公司证券的投资建议。
9. 市场规模
PII过滤属于数据隐私、数据准备与数据治理市场的交叉地带,尚无独立公开的细分市场规模统计。其市场规模通常被纳入更宽泛的数据隐私管理软件、数据脱敏与掩码工具市场。
根据Fortune Business Insights的报告(2021年发布),2020年全球数据隐私管理软件市场规模约为18.2亿美元,预计到2028年将增长至59.5亿美元,2020-2028年年均复合增长率(CAGR)约为15.8%。该市场覆盖数据发现、合规管理、数据脱敏等模块,PII过滤是中必不可少的功能组件。MarketsandMarkets在2022年的一项研究指出,全球数据脱敏与掩码市场规模预计从2022年的约6.8亿美元增长到2027年的15亿美元以上,CAGR约17%。其中,AI/ML训练数据脱敏是增长最快的子驱动之一。
此外,Precedence Research在2023年发布的报告显示,全球生成式AI市场所带动的数据准备与标注服务将在2030年前保持超过20%的复合增长。由于PII过滤已成为大模型数据准备的必选项,其隐含市场体量与AI数据预处理开支高度正相关。以公开信息看,2023年头部AI实验室在数据工程(含采集、过滤、去重等)上的年支出已达数亿美元量级,PII过滤作为其中重要组成部分,投入占比据信在5%—15%区间(公开资料未见更精确拆分)。
中国市场方面,根据赛迪顾问(2022年)对数据安全市场的分析,2021年中国数据安全市场规模约为72.4亿元人民币,数据脱敏、数据识别等领域增速超过30%。随着《个人信息保护法》执行力度加强以及大模型企业百花齐放,国内PII过滤的需求和商业规模正在快速膨胀,但具体数值公开资料未见专项统计。
10. 玩家对比
当前PII过滤领域的参与者可归为四类,其能力与战略定位差异明显。
| 玩家类型 | 代表公司/组织 | 核心能力 | 优势 | 短板 | 典型服务方式 |
|---|---|---|---|---|---|
| 自研大模型厂商 | OpenAI, Google DeepMind, Meta AI, 百度, 阿里等 | 深度定制PII过滤管线,与内部数据飞轮紧密集成 | 海量真实数据打磨,极致优化成本与吞吐,最懂自身数据分布 | 技术对外输出意愿低,外部客户无法直接复用 | 自用,不单独销售 |
| 云与安全平台厂商 | AWS (Macie), Microsoft Azure (Purview), Google Cloud (DLP API), 阿里云, 腾讯云 | 将PII检测/脱敏封装为标准化API或安全管理套件 | 集成云生态,开箱即用,合规认证齐全,计费灵活 | 通用方案对特定LLM训练语料的细粒度调控力不足 | API订阅、安全产品许可 |
| 数据服务与标注公司 | Scale AI, Appen, Sama | 提供“标注+过滤一体化”的数据准备服务 | 大规模人力标注资源,可针对客户需求量身微调NER模型 | 技术研发深度逊于大厂,持续服务成本较高 | 项目制数据交付 |
| 隐私科技与NLP初创 | Presidio (微软开源), Privacera, OneTrust, 部分国内NLP创业公司 | 专注隐私识别算法或微分段脱敏策略 | 算法创新灵活,部分开源工具社区活跃,轻量化部署 | 资金与算力资源有限,缺乏大规模语料检验 | 开源工具、商业许可或SaaS |
综合而言,对极致成本与效果平衡的追求,使得大型模型厂商的自研系统往往处于技术前沿;云厂商以生态和合规配套取胜;数据服务商靠“人工+智能”的灵活性占据一席之地;而初创公司与开源项目则持续在特定场景(如医疗去标识化)推动技术边界。产业整体呈现出“自研为核、外包为壳、开源为网”的协作格局。
11. 风险
技术风险:PII过滤的漏报(即隐私泄露)和误报(即有用数据丢失)始终存在不可消除的残余风险。尤其在多语言、代码混合、OCR文本、非正式社交媒体语言等复杂场景下,已有系统仍频发漏判。此外,对抗样本与刻意规避格式(如用全角或数字谐音)会绕过规则引擎,增加漏报几率。从已发表的研究看,即使业界领先的大模型过滤管线,也无法保证100%清洗干净。
合规与法律风险:全球隐私法律体系碎片化。GDPR的“被遗忘权”、中国《个保法》的单独同意要求、美国各州的异质规定,使得一套统一的PII过滤策略难以同时满足所有法域要求。一旦处理的数据触达受管辖的数据主体,可能引发跨境合规纠纷。若PII过滤失误导致大规模泄露,模型开发商可能面临集体诉讼和监管重罚。
商业模式与成本风险:严格PII过滤可能过滤掉大量看似可疑实则无害的文本,数据利用率下降,直接增加预训练成本。对于数据量并不充裕的中型模型团队,过度保守的过滤可能导致模型知识覆盖度不足、性能下降。同时,持续更新规则和模型、应对新PII类型的运营成本可能高于初始建设管线,形成长期财务负担。
虚假安全感风险:PII过滤若被过分宣传为“绝对隐私”,可能导致下游应用场景中对剩余风险的忽视。决策者可能因预期过高而省略额外的安全测试(如成员推理攻击评估),埋下隐患。
12. 误读纠偏
误读1:PII过滤只是简单的“查找替换”或者正则表达式。 纠偏:这是十年前的技术想象。现代PII过滤必须以自然语言理解为基础,处理自然语言文本中的非结构化PII(如“我叫李明,就住在朝阳大悦城后面那栋楼”),还得识别伪名、缩写、跨行分割的身份证号等复杂情况。纯粹依赖规则会得到极低的召回率与极高的数据损耗,无法满足预训练对质量和安全的要求。
误读2:PII过滤可以做到100%自动化且万无一失。 纠偏:任何基于统计学习的系统都存在误差。在医疗、金融等高风险场景,行业实践是“模型过滤 + 人工抽样复核”,并辅以严格的安全测试。新的PII类型不断出现(如社交媒体中的用户名、数字钱包地址),系统和规则必须不断迭代。它是一项持续运营的服务,而非一次性工程。
误读3:只要过滤了姓名和身份证号就算完成了PII过滤。 纠偏:许多用户数据在去除直接标识后仍可通过准标识符(准标识符指自身虽不唯一,但组合后可重新识别的属性,如出生日期、性别、邮编)进行重识别攻击。真正的PII过滤需评估重识别风险,必要时进行泛化(k-匿名)或数据扰动。
误读4:PII过滤会严重损害模型性能,故可牺牲过滤以减少数据损失。 纠偏:良好的过滤并非简单删除,而是通过泛化、合成等策略在保留语言结构的前提下移除隐私。业内已证明在精心设计下,过滤后数据的训练损失可控,模型性能几乎不受影响,且安全性显著提升。盲目减损过滤可能带来合规灾难。
13. 最新事件
- 2023年,多家大模型厂商公开其数据过滤实践:OpenAI在GPT-4技术报告中披露,其数据预处理管线包含基于规则和机器学习的PII过滤步骤,并专门针对常见的姓名、电子邮件、电话号码等进行了识别和匿名化。Meta在发布Llama 2时,也说明其预训练数据使用了PII清洗流程。
- 《生成式人工智能服务管理暂行办法》实施(2023年8月):中国网信办等七部门发布的该办法明确要求训练数据使用应尊重他人知识产权与隐私,数据处理活动须遵守法律。PII过滤成为服务提供者证明数据来源合法、隐私保护的必要措施之一。
- 欧盟AI法案推进:2024年初欧盟AI法案进入最终版本,高风险AI系统须适用严格的数据治理要求,数据去标识化和PII最小化是其核心之一。该法案将直接影响向欧盟市场提供大模型产品的公司,加速对PII过滤的需求。
- 训练数据提取研究持续验证风险:2023年底至2024年初,多篇学术论文进一步证明可从大型语言模型中提取训练数据中的个人信息,甚至通过特定提示触发。这再次警示产业界,PII过滤的技术水位必须不断提高。
- 开源PII过滤工具更新:微软开源Presidio在2024年持续迭代,增加对中文等更多语言的支持,并改善了上下文分类器。社区通过Hugging Face Hub发布多个面向特定领域的PII检测模型,降低了中小团队的实施门槛。
14. 跟踪指标
投资者和产业观察者可通过以下指标跟踪PII过滤领域的发展动态:
- 模型发布透明度:查阅主要大模型的技术报告或系统卡(System Card),是否明确披露了PII过滤方法、覆盖类型、召回率/精确率估计值。透明度越高,合规准备越充分。
- 隐私攻击研究与泄露案例:学术会议(如IEEE S&P, USENIX Security, NeurIPS)上关于训练数据提取、成员推理攻击的论文数量及披露的泄露率,反映当前过滤技术的实效和漏洞。同时关注是否有公开报道的大模型PII泄露事件。
- 开源工具与模型更新频率:GitHub上Presidio、Hugging Face上token-classification模型等星标数、下载量与版本发布节奏,可感知社区活跃度和技术进步。
- 法规动态与执法案例:GDPR、中国《个保法》等的重要判例,特别是针对AI训练数据违规的处罚金额与整改要求,将直接改变行业的PII过滤投入强度。
- 数据安全与隐私软件市场报告:Gartner、Forrester、IDC等机构的季度/年度市场追踪中关于数据脱敏、数据隐私管理品类收入的增长数据,可作为PII过滤市场规模的间接替代指标。
- 招标与项目信息:观察政企大模型采购中对数据安全、PII过滤的要求条款,以及中标方技术方案中PII过滤的权重。
- 人才培养与职位动态:LinkedIn等技术平台上“隐私工程师”“数据脱敏工程师”“AI合规专家”等职位需求的增长态势,预示产业实际投入的扩张。
15. 信源
- 学术论文与会议:ACL, EMNLP, NAACL, NeurIPS, ICLR中搜索 “PII Detection”, “De-identification”, “Training Data Extraction”, “Membership Inference Attack”获取前沿研究。代表论文如Carlini等 (2021) “Extracting Training Data from Large Language Models”。
- 大模型系统卡与技术报告:OpenAI GPT-4 System Card, GPT-3 Technical Report;Meta Llama 2 Research Paper;Google PaLM 2 Technical Report。这些文档均包含数据预处理中PII过滤的章节。
- 开源项目:Microsoft Presidio (https://github.com/microsoft/presidio),spaCy的NER管线,Hugging Face的transformers库 token-classification 相关模型。
- 市场研究报告:Fortune Business Insights “Data Privacy Management Software Market, 2021–2028”;MarketsandMarkets “Data Masking Market – Global Forecast to 2027”;Gartner “Market Guide for Data Masking”等。注意,上述报告中PII过滤仅为子模块,需结合上下文解读。
- 法规文件:欧盟GDPR,中国《个人信息保护法》,美国加州CCPA/CPRA,HIPAA(健康保险携带和责任法案),PCI DSS(支付卡行业数据安全标准)等。
- 安全研究组织:OWASP发布的LLM应用安全指南中关于训练数据投毒与隐私的内容;NIST AI Risk Management Framework。