模型層 開放閱讀

PII 過濾

PII Filtering

概念 ID
pii-filtering
更新時間
2026-05-29
來源數量
待補

PII 過濾

1. 3秒看懂

PII 過濾(PII Filtering)是大型模型訓練資料預處理中的“隱私篩”,專門自動定位並移除文本中可識別到具體個人的資訊——如姓名、身份證號、電話號碼、住址、郵箱、車牌等,防止模型在訓練中機械記憶個人隱私,降低生成輸出洩露真實個人資訊的風險,同時滿足全球日益嚴格的資料保護法規要求。它並非簡單的關鍵詞匹配,而是融合了命名實體識別、上下文理解和策略化脫敏的多層技術體系。

2. 3分鐘產業解釋

在AI產業鏈中,資料常被比作“新石油”,然而未處理的原始資料含有大量“有害雜質”,其中最棘手的就是個人身份資訊(PII)。PII過濾就是資料精煉廠中的核心淨化裝置之一,其產業剛需源於兩大支柱。

法規驅動:全球資料隱私法規不斷加碼。歐盟《通用資料保護條例》(GDPR)對未經授權的個人資料處理設定了最高可處以全球年營收4%的罰款;中國《個人資訊保護法》自2021年實施以來,明確要求處理個人資訊須取得同意並履行保護義務;美國加州《消費者隱私法案》(CCPA)及各州類似立法接連落地。在大型模型訓練場景中,若爬取的網頁文本、社交帖子或業務資料中包含未經清洗的PII,即構成違規。模型開發方和使用方都將面臨嚴厲的行政處罰、民事賠償乃至刑事責任。因此,PII過濾已從“應該做”的選項變為“必須做”的合規底線。

技術特性:大語言模型具有強大的“記憶”能力。研究(如Carlini等人在2021年發表的“Extracting Training Data from Large Language Models”)表明,模型可以逐字還原訓練資料中的個人姓名、聯絡方式甚至身份證號。若不實施PII過濾,模型可能在與使用者的平凡對話中不經意復現訓練語料中的真實隱私,引發安全事故和嚴重的信任危機。例如,一名健康醫療聊天機器人若洩露了訓練資料中的真實患者姓名與診斷結果,後果不堪設想。

因此,PII過濾已演變為大型模型開發的剛性成本必要基礎設施。它直接影響資料獲取的可行性、模型合規性以及最終產品的市場準入,也決定了資料飛輪能轉得多快、多穩。

3. 技術原理

PII過濾並非單一的文本處理技巧,而是自然語言處理(NLP)、資訊檢索與機器學習分類的深度融合體。工業級系統通常建置為多層流水線,兼顧速度、召回率與準確率。

命名實體識別(NER):這是核心引擎。基於預訓練語言模型(如BERT、RoBERTa、DeBERTa等)微調的NER模型能夠識別文本中具有特定語義的實體,並加以分類。針對PII任務,主要關注人物(PER)、地點(LOC)、機構(ORG,若與個人關聯)、電話號碼、身份證號、郵箱地址等類別。模型必須能利用上下文區分“Apple很好吃”中的“Apple”是水果,而“Apple公司”中的“Apple”是組織,同理還需要在眾多實體中識別出指向現實自然人的那部分。

規則與模式匹配:對高度結構化的PII,正規表示式等確定性規則仍然不可替代。例如,中國公民身份證號碼為18位數字(末位可為X),銀行卡號符合Luhn校驗,郵箱遵循“local-part@domain”格式。規則引擎能極快地精確匹配標準格式,成本幾乎為零,但對刻意變體(如“壹叄捌零零零零壹貳叄肆”)或非標準表達無效。

上下文理解與消歧:這是技術深水區。模型必須判斷某個人名或地址在當前語境下是否真正指向一個需要被保護的自然人。例如,“愛因斯坦提出了相對論”中的“愛因斯坦”是已故的公共人物,通常不需作為PII遮蔽;但“我的鄰居愛因斯坦住在伯爾尼鐘樓街49號”則可能涉及隱私。同樣,地名“北京”在“北京市海淀區XX小區”中為高敏感地址,而在“北京是中國的首都”中則為一般性陳述。現代系統通常增加一層上下文分類器,利用更豐富的上下文特徵或輕量級LLM進行二次判斷,以降低誤報。

脫敏策略與資料維護:識別後並非簡單刪除。原始做法是直接移除或用固定符號如“[REDACTED]”替代,但這會破壞文本連貫性,影響模型訓練質量。更優策略包括:泛化——將“張三”替換為“[人名]”,將“上海市浦東新區陸家嘴環路1000號”替換為“[地址]”;擾動——對數值進行隨機微擾(如年齡加一);或合成數據生成——用生成模型產生一個語義等效但不含真實PII的替代句。策略引擎需根據不同下游任務(預訓練、微調、推論安全防護)動態配置,以在隱私保護與資料效用之間取得精確平衡。

下圖展示了一個理想化的多層PII過濾流水線:

graph TD
    A[原始文本流] --> B{規則引擎
結構化PII(身份證、卡號)};
    B -- 匹配 --> D[標記/脫敏];
    B -- 未匹配 --> C{NER模型
人名、地址、電話等};
    C -- 識別出實體 --> E{上下文分類模型
判斷是否為自然人的真實PII};
    E -- 是 --> D;
    E -- 否/不確定 --> F[保留或人工複核];
    D --> G[策略應用
替換/泛化/擾動/合成];
    G --> H[清潔後資料];

4. 關鍵引數

評估PII過濾系統需綜合安全、質量與效率三個維度,常用指標包括:

  • 召回率(Recall):所有真實PII中被成功過濾出的比例。這是最核心的安全指標,一旦遺漏,即意味著隱私洩露風險。在合規要求極高的場景(如醫療、金融),召回率通常需達到99%以上;通用大型模型預訓練資料的過濾召回率目標一般不低於95%。
  • 精確率(Precision):所有被系統判定為PII的片段中真正屬於PII的比例。精確率直接影響訓練資料的損耗度;精確率較低表示“誤殺”過多正常文本,可能削弱模型的知識密度與語言流暢度。工業實踐常追求F1分數的綜合平衡,但對安全敏感領域,召回率權重更大。
  • F1分數:精確率與召回率的調和平均,用於綜合排序。
  • 誤報分佈分析:不僅看總數,還需分析誤報中誤判了哪些實體類別。將公共人名誤判為隱私人物的代價通常低於將普通名詞誤判為人名而導致知識缺失。因此,誤報權重需按實體類別區分。
  • 支援的PII型別覆蓋度:能否識別姓名、身份證號、護照號、電話號碼、郵箱、家庭住址、地理位置座標、車牌號、生物特徵標識(如基因序列中的個人標識)、醫療記錄號、IP地址等。覆蓋度越高,安全盲區越少。
  • 多語言與多模態支援:處理中文、英文、混合程式碼、社交媒體文本、PDF後設資料、圖片中嵌入的文字等能力。
  • 吞吐量:單位時間可處理的文本量(如GB/小時或tokens/秒)。大規模預訓練語料常以TB計,系統必須滿足吞吐要求,否則成為資料處理瓶頸。
  • 延遲:單條資料處理耗時,影響即時互動場景(如線上聊天防護)。
  • 更新成本:新PII模式(如新型支付標識)出現後,規則和模型更新的時間和人力成本。

5. 技術路線

PII過濾技術經歷了從純規則到多模型級聯的演進,各路線在精度、召回、成本、靈活性上有明顯差異。

純規則/正規表示式(約2018年以前主流):基於模式匹配,擅長處理格式固定的PII(身份證號、信用卡號)。速度極快、無訓練成本、可解釋性強,但召回率低,對自然語言描述的地址、非標準電話格式等束手無策。目前仍作為大多數流水線的第一道快速篩網。

傳統機器學習NER(2018—2020年):使用條件隨機場(CRF)、隱馬爾可夫模型(HMM)加手工特徵工程進行實體識別。相比規則,能處理簡單的上下文實體,計算資源要求較低,適合領域固定、變異較小的內部資料。缺陷是泛化能力差,特徵工程耗費大量人力,面對開放域、多語言文本時效能驟降。

預訓練語言模型微調(2021年至今,業界主流):在BERT、RoBERTa、DeBERTa等大規模預訓練模型基礎上,用人工標註的PII資料集進行命名實體識別微調。此路線召回率大幅提升,能較好理解上下文,適應多樣文本風格。同時可通過多工學習同時識別多種實體。缺點是需要高質量標註資料,訓練和推論計算成本高,仍有誤報風險。目前主流做法是採用此路線建置核心層,並在之上疊加後處理規則或上下文分類器。

多模型級聯絡統(工業最佳實踐):融合“規則引擎 + 預訓練NER + 上下文分類器/LLM裁決”的多層架構。規則處理高確定性結構化PII,NER模型覆蓋上下文敏感的實體,再由輕量級分類器或LLM判斷實體是否為當前語境下的自然人敏感資訊。此方案能精細控制召回率與精確率的平衡,是目前大型AI實驗室(OpenAI、Google DeepMind、Meta等)的實際落地架構,但系統複雜、維護成本高、單次處理延遲上升。

LLM直接過濾(探索階段):利用大語言模型本身理解上下文,通過提示詞要求其識別並匿名化PII。優點極其靈活,無需額外標註訓練,能夠應對複雜語用場景。缺點是推論成本極高、速度慢、輸出穩定性不可控,可能因幻覺或指令跟隨偏差導致漏報或誤報。目前僅適用於離線極低吞吐場景或作為其他方法的補充裁決者。

技術路線對比表

技術路線核心方法優勢劣勢當前應用地位
純規則/正則模式匹配極快,零訓練,可解釋召回率極低,無上下文基礎前置過濾器
傳統NERCRF+HMM+特徵工程資源要求低,領域可定製泛化弱,工程量大遺留系統或窄域場景
預訓練NER微調BERT類微調高召回,強泛化,上下文需標註,計算成本高當前主流核心引擎
多模型級聯規則+NER+分類器安全與資料質量最佳平衡複雜,維護成本高大型模型預訓練資料管線標配
LLM提示過濾提示工程+LLM極靈活,零標註成本極高,不可控探索性研究,輔助裁決

6. 上游

PII過濾技術及其所需資源的上游主要包括:

  • 原始資料供應商:網際網路爬蟲公司、資料交易市場(如部分第三方資料聚合商)、合作機構(如出版社、媒體)提供的未經清洗的文本、影像和影片等原始資料。這些資料來源往往包含大量個人網頁遺落的姓名、地址、手機號等。上游資料的質量與合規程度決定了PII過濾系統的起點壓力。
  • 標註服務與資料眾包:微調NER模型需要大量人工標註的PII樣本。Scale AI、Appen(澳鵬)、Amazon Mechanical Turk等平台提供可控質量的實體級標註,標註員需精確標出文本中每一段PII的起止位置和類別。標註成本以每千字元或小時計,中文、醫療等專業領域單價顯著高於通用英文。
  • 算力與基礎模型提供方:雲端廠商(AWS、Azure、Google Cloud、阿里雲端)提供GPU/TPU叢集用於NER模型訓練和推論;開源模型社群(如Hugging Face)提供預訓練權重(如bert-base-chinese、roberta-large等),為下游開發者降低進入門檻。
  • 隱私法規與標準制定機構:上游的另一維度是由ISO、NIST、全國資訊安全標準化技術委員會等制定資料脫敏與PII分類標準。這些標準定義了哪些資訊屬於PII的範疇,為過濾技術劃定明確的目標邊界。

7. 下游

PII過濾後的清潔資料進入大型模型全生命週期,並衍生出合規與安全增值服務。

  • 大型模型預訓練與微調:清潔資料直接注入預訓練資料管道,用於基礎大型模型(如GPT系列、LLaMA系列、Baichuan等)和行業垂直模型的訓練。有效的PII過濾能顯著降低模型在各類隱私攻擊(如成員推論攻擊)下的脆弱性。
  • 合規審計與資料治理:PII過濾日誌、脫敏報告和統計資料成為企業向監管機構、客戶證明資料合規性的關鍵證據。部分企業將PII過濾環節與資料血緣追蹤、資料目錄系統整合,實現全鏈條資料合規管理。
  • 模型安全評估與紅隊測試:在模型安全對齊之前,安全團隊常利用未過濾版本訓練“影子模型”或對比過濾前後的模型行為,評估模型記憶隱私的程度,制定加固策略。
  • 推論側安全防護:PII過濾系統演化出即時API版本,用於對模型輸出進行二次檢測和脫敏,確保即使使用者上傳了含隱私的提示,模型返回中也不會洩露更多個人資訊。
  • 垂直行業解決方案:醫療、金融、法律等行業將PII過濾與專屬脫敏規則結合,形成資料去標識化(De-identification)服務,滿足HIPAA(美國健康保險攜帶和責任法案)、PCI DSS(支付卡行業資料安全標準)等強制規範。例如,醫療文本需要同時移除患者姓名、住院號、檢查日期等直接標識,以及通過組合仍能定位到個人的準識別符號。

8. 受益公司

PII過濾作為大型模型資料準備的核心環節,使以下產業鏈節點直接獲益或獲得結構性需求拉動:

  • 基礎大型模型開發商:OpenAI、Google DeepMind、Anthropic、Meta AI、百度、阿里巴巴、騰訊、字節跳動、科大訊飛等。它們自研大規模PII過濾管道,將合規能力內化為市場準入優勢和商業信任資產。同時,其自身也受益於資料質量提升帶來的模型能力增強。
  • 資料標註與準備服務商:Scale AI、Appen、Sama、iSoftStone等。隨著大型模型軍備競賽加劇,對PII標註和過濾整合服務的需求水漲船高,這些公司將其作為資料預處理套餐的重要組成部分,拉動營收增長。
  • 雲端平台與安全廠商:亞馬遜AWS(Macie)、微軟Azure(Purview)、Google Cloud(DLP API)、阿里雲端、騰訊雲端等將PII檢測和脫敏能力打包為安全合規產品,服務於廣大中大型企業客戶,尤其是金融、醫療行業的上雲端需求,形成持續訂閱營收。
  • 隱私計算與資料安全初創公司:如Privacera、Immuta、OneTrust等,提供細粒度的資料訪問控制和脫敏方案,部分將PII過濾作為其資料安全產品矩陣中的關鍵模組,服務於企業資料治理市場。
  • 受監管行業(採用方):銀行、保險公司、醫院、政府機構等。它們並非PII過濾技術的開發者,但通過購買或使用相關產品降低自身大型模型應用的法律風險,是終端受益者。能夠提供成熟PII過濾方案的公司,對這類客戶具備更強的獲客能力。

注:以上僅為產業鏈環節分析,不構成對具體公司證券的投資建議。

9. 市場規模

PII過濾屬於資料隱私、資料準備與資料治理市場的交叉地帶,尚無獨立公開的細分市場規模統計。其市場規模通常被納入更寬泛的資料隱私管理軟體、資料脫敏與掩碼工具市場。

根據Fortune Business Insights的報告(2021年釋出),2020年全球資料隱私管理軟體市場規模約為18.2億美元,預計到2028年將增長至59.5億美元,2020-2028年年均複合增長率(CAGR)約為15.8%。該市場覆蓋資料發現、合規管理、資料脫敏等模組,PII過濾是中必不可少的功能元件。MarketsandMarkets在2022年的一項研究指出,全球資料脫敏與掩碼市場規模預計從2022年的約6.8億美元增長到2027年的15億美元以上,CAGR約17%。其中,AI/ML訓練資料脫敏是增長最快的子驅動之一。

此外,Precedence Research在2023年釋出的報告顯示,全球生成式AI市場所帶動的資料準備與標註服務將在2030年前保持超過20%的複合增長。由於PII過濾已成為大型模型資料準備的必選項,其隱含市場體量與AI資料預處理開支高度正相關。以公開資訊看,2023年頭部AI實驗室在資料工程(含採集、過濾、去重等)上的年支出已達數億美元量級,PII過濾作為其中重要組成部分,投入佔比據信在5%—15%區間(公開資料未見更精確拆分)。

中國市場方面,根據賽迪顧問(2022年)對資料安全市場的分析,2021年中國資料安全市場規模約為72.4億元人民幣,資料脫敏、資料識別等領域增速超過30%。隨著《個人資訊保護法》執行力度加強以及大型模型企業百花齊放,國內PII過濾的需求和商業規模正在快速膨脹,但具體數值公開資料未見專項統計。

10. 玩家對比

當前PII過濾領域的參與者可歸為四類,其能力與戰略定位差異明顯。

玩家型別代表公司/組織核心能力優勢短板典型服務方式
自研大型模型廠商OpenAI, Google DeepMind, Meta AI, 百度, 阿里等深度定製PII過濾管線,與內部資料飛輪緊密整合海量真實資料打磨,極致最佳化成本與吞吐,最懂自身資料分佈技術對外輸出意願低,外部客戶無法直接複用自用,不單獨銷售
雲端與安全平台廠商AWS (Macie), Microsoft Azure (Purview), Google Cloud (DLP API), 阿里雲端, 騰訊雲端將PII檢測/脫敏封裝為標準化API或安全管理套件整合雲端生態,開箱即用,合規認證齊全,計費靈活通用方案對特定LLM訓練語料的細粒度調控力不足API訂閱、安全產品許可
資料服務與標註公司Scale AI, Appen, Sama提供“標註+過濾一體化”的資料準備服務大規模人力標註資源,可針對客戶需求量身微調NER模型技術研發深度遜於大廠,持續服務成本較高專案制資料交付
隱私科技與NLP初創Presidio (微軟開源), Privacera, OneTrust, 部分國內NLP創業公司專注隱私識別演算法或微分段脫敏策略演算法創新靈活,部分開源工具社群活躍,輕量化部署資金與算力資源有限,缺乏大規模語料檢驗開源工具、商業許可或SaaS

綜合而言,對極致成本與效果平衡的追求,使得大型模型廠商的自研系統往往處於技術前沿;雲端廠商以生態和合規配套取勝;資料服務商靠“人工+智慧”的靈活性佔據一席之地;而初創公司與開源專案則持續在特定場景(如醫療去標識化)推動技術邊界。產業整體呈現出“自研為核、外包為殼、開源為網”的協作格局。

11. 風險

技術風險:PII過濾的漏報(即隱私洩露)和誤報(即有用資料丟失)始終存在不可消除的殘餘風險。尤其在多語言、程式碼混合、OCR文本、非正式社交媒體語言等複雜場景下,已有系統仍頻發漏判。此外,對抗樣本與刻意規避格式(如用全形或數字諧音)會繞過規則引擎,增加漏報機率。從已發表的研究看,即使業界領先的大型模型過濾管線,也無法保證100%清洗乾淨。

合規與法律風險:全球隱私法律體系碎片化。GDPR的“被遺忘權”、中國《個保法》的單獨同意要求、美國各州的異質規定,使得一套統一的PII過濾策略難以同時滿足所有法域要求。一旦處理的資料觸達受管轄的資料主體,可能引發跨境合規糾紛。若PII過濾失誤導致大規模洩露,模型開發商可能面臨集體訴訟和監管重罰。

商業模式與成本風險:嚴格PII過濾可能過濾掉大量看似可疑實則無害的文本,資料利用率下降,直接增加預訓練成本。對於資料量並不充裕的中型模型團隊,過度保守的過濾可能導致模型知識覆蓋度不足、效能下降。同時,持續更新規則和模型、應對新PII型別的運營成本可能高於初始建設管線,形成長期財務負擔。

虛假安全感風險:PII過濾若被過分宣傳為“絕對隱私”,可能導致下游應用場景中對剩餘風險的忽視。決策者可能因預期過高而省略額外的安全測試(如成員推論攻擊評估),埋下隱患。

12. 誤讀糾偏

誤讀1:PII過濾只是簡單的“查詢替換”或者正規表示式。 糾偏:這是十年前的技術想像。現代PII過濾必須以自然語言理解為基礎,處理自然語言文本中的非結構化PII(如“我叫李明,就住在朝陽大悅城後面那棟樓”),還得識別偽名、縮寫、跨行分割的身份證號等複雜情況。純粹依賴規則會得到極低的召回率與極高的資料損耗,無法滿足預訓練對質量和安全的要求。

誤讀2:PII過濾可以做到100%自動化且萬無一失。 糾偏:任何基於統計學習的系統都存在誤差。在醫療、金融等高風險場景,行業實踐是“模型過濾 + 人工抽樣複核”,並輔以嚴格的安全測試。新的PII型別不斷出現(如社交媒體中的使用者名稱、數字錢包地址),系統和規則必須不斷迭代。它是一項持續運營的服務,而非一次性工程。

誤讀3:只要過濾了姓名和身份證號就算完成了PII過濾。 糾偏:許多使用者資料在去除直接標識後仍可通過準識別符號(準識別符號指自身雖不唯一,但組合後可重新識別的屬性,如出生日期、性別、郵編)進行重識別攻擊。真正的PII過濾需評估重識別風險,必要時進行泛化(k-匿名)或資料擾動。

誤讀4:PII過濾會嚴重損害模型效能,故可犧牲過濾以減少資料損失。 糾偏:良好的過濾並非簡單刪除,而是通過泛化、合成等策略在保留語言結構的前提下移除隱私。業內已證明在精心設計下,過濾後資料的訓練損失可控,模型效能幾乎不受影響,且安全性顯著提升。盲目減損過濾可能帶來合規災難。

13. 最新事件

  • 2023年,多家大型模型廠商公開其資料過濾實踐:OpenAI在GPT-4技術報告中揭露,其資料預處理管線包含基於規則和機器學習的PII過濾步驟,並專門針對常見的姓名、電子郵件、電話號碼等進行了識別和匿名化。Meta在釋出Llama 2時,也說明其預訓練資料使用了PII清洗流程。
  • 《生成式人工智慧服務管理暫行辦法》實施(2023年8月):中國網信辦等七部門釋出的該辦法明確要求訓練資料使用應尊重他人智慧財產權與隱私,資料處理活動須遵守法律。PII過濾成為服務提供者證明資料來源合法、隱私保護的必要措施之一。
  • 歐盟AI法案推進:2024年初歐盟AI法案進入最終版本,高風險AI系統須適用嚴格的資料治理要求,資料去標識化和PII最小化是其核心之一。該法案將直接影響向歐盟市場提供大型模型產品的公司,加速對PII過濾的需求。
  • 訓練資料提取研究持續驗證風險:2023年底至2024年初,多篇學術論文進一步證明可從大型語言模型中提取訓練資料中的個人資訊,甚至通過特定提示觸發。這再次警示產業界,PII過濾的技術水位必須不斷提高。
  • 開源PII過濾工具更新:微軟開源Presidio在2024年持續迭代,增加對中文等更多語言的支援,並改善了上下文分類器。社群通過Hugging Face Hub釋出多個面向特定領域的PII檢測模型,降低了中小團隊的實施門檻。

14. 追蹤指標

投資者和產業觀察者可通過以下指標追蹤PII過濾領域的發展動態:

  • 模型釋出透明度:查閱主要大型模型的技術報告或系統卡(System Card),是否明確揭露了PII過濾方法、覆蓋型別、召回率/精確率估計值。透明度越高,合規準備越充分。
  • 隱私攻擊研究與洩露案例:學術會議(如IEEE S&P, USENIX Security, NeurIPS)上關於訓練資料提取、成員推論攻擊的論文數量及揭露的洩露率,反映當前過濾技術的實效和漏洞。同時關注是否有公開報道的大型模型PII洩露事件。
  • 開源工具與模型更新頻率:GitHub上Presidio、Hugging Face上token-classification模型等星標數、下載量與版本釋出節奏,可感知社群活躍度和技術進步。
  • 法規動態與執法案例:GDPR、中國《個保法》等的重要判例,特別是針對AI訓練資料違規的處罰金額與整改要求,將直接改變行業的PII過濾投入強度。
  • 資料安全與隱私軟體市場報告:Gartner、Forrester、IDC等機構的季度/年度市場追蹤中關於資料脫敏、資料隱私管理品類營收的增長資料,可作為PII過濾市場規模的間接替代指標。
  • 招標與專案資訊:觀察政企大型模型採購中對資料安全、PII過濾的要求條款,以及中標方技術方案中PII過濾的權重。
  • 人才培養與職位動態:LinkedIn等技術平台上“隱私工程師”“資料脫敏工程師”“AI合規專家”等職位需求的增長態勢,預示產業實際投入的擴張。

15. 信源

  • 學術論文與會議:ACL, EMNLP, NAACL, NeurIPS, ICLR中搜索 “PII Detection”, “De-identification”, “Training Data Extraction”, “Membership Inference Attack”獲取前沿研究。代表論文如Carlini等 (2021) “Extracting Training Data from Large Language Models”。
  • 大型模型系統卡與技術報告:OpenAI GPT-4 System Card, GPT-3 Technical Report;Meta Llama 2 Research Paper;Google PaLM 2 Technical Report。這些文件均包含資料預處理中PII過濾的章節。
  • 開源專案:Microsoft Presidio (https://github.com/microsoft/presidio),spaCy的NER管線,Hugging Face的transformers庫 token-classification 相關模型。
  • 市場研究報告:Fortune Business Insights “Data Privacy Management Software Market, 2021–2028”;MarketsandMarkets “Data Masking Market – Global Forecast to 2027”;Gartner “Market Guide for Data Masking”等。注意,上述報告中PII過濾僅為子模組,需結合上下文解讀。
  • 法規檔案:歐盟GDPR,中國《個人資訊保護法》,美國加州CCPA/CPRA,HIPAA(健康保險攜帶和責任法案),PCI DSS(支付卡行業資料安全標準)等。
  • 安全研究組織:OWASP釋出的LLM應用安全指南中關於訓練資料投毒與隱私的內容;NIST AI Risk Management Framework。
source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型