內容安全過濾(Content Moderation)
3 秒看懂
內容安全過濾是 AI 檢測並攔截有害 / 違規內容的技術體系,覆蓋文本、影像、影片、音訊,是大型模型部署的“安全閥”。沒有它,任何面向使用者的 AI 產品都無法上線。
3 分鐘產業解釋
為什麼是 AI 產業鏈的剛需?
大型模型能力越強,產生有害內容的風險越高。監管側(歐盟 AI Act、中國《生成式人工智慧服務管理暫行辦法》)明確要求服務提供者對生成內容負責。內容安全過濾從“可選項”變成了“合規紅線”。
產業位置
[使用者輸入] → [輸入過濾層] → [大型模型推論] → [輸出過濾層] → [使用者可見內容]
↑ ↑
Prompt Injection 有害內容檢測
檢測 & 攔截 檢測 & 攔截
內容安全過濾貫穿 輸入側(Pre-moderation) 和 輸出側(Post-moderation),形成雙向防護。
商業模式
- API 計費:按呼叫量收費(主流雲端廠商模式)。例如,某雲端廠商內容安全 API 單價約 0.0015 美元 / 次(公開資訊,2024 年定價頁),批次呼叫享有折扣。
- 平台嵌入:作為大型模型服務的內建安全層,成本計入推論費用,典型如 OpenAI Moderation API 在特定額度內免費,超出後按 token 計費。
- 獨立產品:網易易盾、阿里綠網等專精安全廠商提供 SaaS 控制台 + 私有化部署,以年訂閱或按量付費。
技術原理
1. 文本內容過濾
傳統方法
# 關鍵詞匹配(L0 層)
blacklist = ["暴力詞_A", "違禁詞_B", ...]
def keyword_filter(text):
return any(kw in text for kw in blacklist)
侷限:同義替換、諧音字、隱喻、Unicode 編碼繞過(如用全形字元、零寬空格)可輕易失效。
基於 Embedding 的分類
輸入文本 → [Tokenizer] → [Encoder: BERT/DeBERTa] → [CLS] → [分類頭]
↓
每個類別機率
(多標籤分類)
- 損失函式:Binary Cross-Entropy(多標籤場景);為緩解類別不平衡(有害樣本佔比常 < 1%),引入 focal loss 或重取樣。
- 代表性模型:RoBERTa 微調、DeBERTa-v3 等,在小樣本下可結合 SetFit 等度量學習方法。
LLM-as-Judge(大型模型稽核)
利用大型語言模型的指令遵循和推論能力進行判斷:
System: 你是一個內容稽核助手。判斷以下內容是否包含[有害類別]。
輸出 JSON: {"flagged": true/false, "category": "...", "reason": "..."}
User: {待稽核內容}
- 優勢:零樣本泛化強,可處理隱喻、文化背景依賴的複雜案例。
- 劣勢:延遲高(100ms–2s)、成本高(一次稽核消耗數百至數千 tokens)、自身安全性需額外保障(例如通過輸入隔離防止 prompt 注入)。
Constitutional AI 思路
Anthropic 提出的方法:通過 自我批評(self-critique) 讓模型在生成時自我過濾。
[初始生成] → [自我評估:是否違反規則 X?] → [如違規,重新生成] → [輸出]
這一機制在訓練階段即被強化(RL from AI Feedback),使模型將安全策略“內建”。
2. 影像與影片內容過濾
影像技術路線
| 方法 | 原理 | 適用場景 |
|---|---|---|
| CNN 分類器 | ResNet/EfficientNet 等訓練 NSFW 分類器 | 通用色情 / 暴力檢測 |
| 目標檢測 | YOLO/DETR 檢測特定物體(武器、毒品等) | 違禁物品識別 |
| CLIP/SigLIP | 圖文對齊模型做零樣本分類 | 靈活的語義級檢測 |
| Vision-Language Model | LLaVA/GPT-4V 等多模態大型模型 | 複雜場景理解與推論 |
- 資料增強:對於 NSFW 檢測,常使用 CutOut、MixUp 等方法提升魯棒性;訓練集多來源於公共資料集(如 NSFW-Filter)和內部標註。
- 對抗魯棒性:影像可被新增人類不可察覺的對抗擾動(FGSM/PGD),導致分類器誤判。防禦手段包括對抗訓練、特徵壓縮和整合檢測。
影片稽核
影片稽核成本遠高於圖文,核心流程:
- 關鍵幀提取:按固定間隔(如每 1 秒)或場景切換檢測抽幀。
- 單幀分析:對每幀執行影像分類器。
- 時序建模:對連續幀序列利用 3D 卷積(SlowFast、VideoMAE)或 LSTM 捕捉動態違規(如打鬥、暴露行為)。
- 音訊輔助:暴力事件常伴隨尖叫、槍聲;色情內容可能包含特定語音模式。通過 Wav2Vec 2.0 等預訓練音訊模型結合文本(ASR 轉寫)進行聯合判斷。
效能最佳化:在即時直播場景中,通過邊緣節點做第一級抽幀與音訊分片,僅當第一級置信度處於模糊區間時才回傳中心全量模型,以降低頻寬和計算成本。
3. 對抗攻擊與防禦
內容安全本質是一場攻防博弈,攻擊方式持續演化:
| 攻擊層面 | 典型手段 |
|---|---|
| 文本 | 同音替換、零寬字元、不可見 Unicode 標記、Base64 編碼、split-and-concat |
| 影像 | FGSM/PGD 對抗擾動、隱寫術(Steganography)將違規文本藏在畫素中 |
| 多模態 | 違規內容放在影像中,配正常文本;利用視覺模型的盲點 |
防禦策略:
- 輸入歸一化:Unicode 標準化(NFKC)、刪除控制字元、拼音轉漢字預處理。
- 多模型整合:至少融合 3 個異構檢測器(關鍵詞 + BERT + CLIP),投票或加權判斷,增加繞過難度。
- 對抗訓練:在訓練集中混入已知攻擊樣本,提升模型魯棒性。
- 紅隊測試:定期模擬攻擊,評估系統漏報率,並迭代規則和模型。
關鍵引數
技術指標
| 指標 | 定義 | 業務含義 |
|---|---|---|
| Precision(精確率) | TP / (TP + FP) | 過低 → 誤殺大量正常內容,使用者體驗差 |
| Recall(召回率) | TP / (TP + FN) | 過低 → 有害內容漏放,合規風險高 |
| F1 Score | 2PR/(P+R) | 綜合衡量,但單一閾值通常無法滿足所有類別 |
| False Positive Rate | FP / (FP + TN) | 正常內容被誤判比例;平台通常要求 < 0.1% |
| False Negative Rate | FN / (FN + TP) | 違規內容漏放比例;在零容忍場景(如兒童安全)須趨近零 |
| ROC-AUC | 曲線下面積 | 衡量分類器整體區分能力,不直接反映業務閾值效果 |
注:TP = 正確攔截,FP = 誤攔截,TN = 正確放行,FN = 漏放。
業務與效能指標
| 指標 | 說明 | 典型要求 |
|---|---|---|
| P99 延遲 | 99% 請求的響應時間上限 | 同步過濾 < 200ms;離線稽核可放寬至秒級 |
| 吞吐量(QPS) | 每秒處理請求數 | 單節點 GPU 推論可達數千 QPS(輕量模型) |
| 單次稽核成本 | API 呼叫費或內部 GPU 攤銷成本 | 輕量模型 $0.0001–$0.001/次;LLM 稽核可達 $0.01–$0.05/次(基於公開 API 定價估算,2024 年) |
核心矛盾:Precision-Recall 權衡
提高 Recall 往往導致 Precision 下降,反之亦然。在內容安全場景下:
- 高召回優先:社交平台、兒童安全等零容忍領域,寧可誤殺不可漏放。
- 高精確優先:搜尋引擎、電商評論,誤殺會直接損害商業轉化。
- 實際部署常採用分級策略:L0/L1 設定高召回閾值,L2/L3 對模糊案例調高精確度。
技術路線
| 維度 | 關鍵詞/規則 | 專用分類器 | LLM-as-Judge | 原生安全對齊 |
|---|---|---|---|---|
| 檢測能力 | 僅限明顯模式,易繞過 | 中等,依賴訓練資料覆蓋 | 強,零樣本泛化,能理解上下文 | 最強,與模型生成一體 |
| 延遲 | < 1ms | 5–50ms | 100ms–2s | 0(推論時同步) |
| 成本 | 極低 | 低–中 | 高(需 GPU 推論大量 tokens) | 中(對齊訓練成本高,但推論邊際成本低) |
| 可更新性 | 即時更新規則 | 需重新訓練,週期數天到周 | 修改 prompt 即時生效 | 需重新進行對齊訓練,週期數周到月 |
| 對抗魯棒性 | 差 | 中 | 較好(可通過 prompt 約束) | 較好,但仍有越獄風險 |
| 適用場景 | L0 快速過濾 | 生產主力(文本、影像、音影片) | 複雜案例兜底、離線稽核 | 下一代生成模型內生安全 |
未來趨勢:路線正從“後置外掛”向“模型內生安全”遷移,但多層聯的級聯架構在 3–5 年內仍將是工業界主流。
上游
| 環節 | 要素 | 市場格局與關鍵資料 |
|---|---|---|
| 訓練資料 | 有害內容標註資料集 | 資料獲取是最大瓶頸,涉及隱私、法律與倫理。公開資料集如 Jigsaw Toxic Comments、HateXplain,但各地區文化規範不同,通用資料集無法覆蓋。商業標註公司(Appen、Labelbox)提供定製化標註,價格約 $0.05–$0.10/條(2023 年行業調查)。 |
| 算力 | GPU 推論與訓練 | 稽核模型推論需持續算力。以 A100 為例,即時稽核 1000 QPS 可能需要 2–4 卡;訓練一箇中型 BERT 分類器約需 8×A100 數小時。雲端廠商的推論例項成本隨規模遞減,但專精廠商難以與雲端廠商的閒置算力競爭。 |
| 標註服務 | 人工標註 | 有害內容標註須配備心理支援與輪崗制度(如 Meta、TikTok 均揭露有員工健康支援計劃)。標註員新手與專家一致性(IAA)通常低於 0.8,需要多輪校準。 |
| 合規與法律諮詢 | 法規解讀、資料跨境 | 不同司法轄區的“有害內容”定義不同,內容安全廠商必須搭配法律團隊。資料儲存在本地化要求(如 GDPR、中國資料安全法)影響技術架構。 |
下游
| 行業 | 典型場景 | 需求特點 |
|---|---|---|
| 大型模型廠商 | OpenAI、Anthropic、Google 等內建稽核層 | 追求低延遲、與模型深度整合,傾向自研或深度定製,是獨立安全廠商的主要競爭擠壓來源。 |
| 社交 / UGC 平台 | Meta、TikTok、X(Twitter)、微信、微博 | 內容量極大(日上傳數十億條),要求高吞吐、多語言、影片/直播即時稽核;通常自建團隊 + 外採結合。 |
| 雲端服務商 | AWS Rekognition、Azure Content Safety、阿里雲端內容安全 | 提供標準 API,服務長尾應用。多數雲端廠商的安全服務為引流型,定價具競爭力。 |
| 企業級應用 | 客服機器人、內部知識庫、AI Agent | 企業多關注 PII 洩露、內部合規政策、品牌安全;偏愛私有化部署或 VPC 內的 API。 |
| 遊戲與元宇宙 | 即時語音、玩家自定義內容 | 要求超低延遲(<100ms)稽核語音和 3D 內容,催生出專精即時音訊稽核廠商(如 Modulate.ai)。 |
受益公司
以下列舉直接與內容安全業務相關的代表性機構,不構成任何投資建議。財務資訊根據公開揭露整理,未揭露部分註明。
| 公司/機構 | 定位 | 關鍵特徵 | 相關財務/運營資料(口徑、年份) |
|---|---|---|---|
| OpenAI | 大型模型廠商,提供 Moderation API | 內建安全稽核,2024 年推出更細粒度的類別。API 呼叫在免費額度以上按 token 計費。 | Moderation 業務獨立營收未揭露(2024 年報未拆分) |
| Anthropic | Constitutional AI 先驅 | 將安全對齊融入訓練與推論,Claude 系列模型以拒答有害請求聞名。 | 未上市,無公開財務;2023 年獲數十億美元投資(Google、Salesforce 等) |
| Meta | 開源 Llama Guard、Llama Code Shield | 釋出 Llama Guard 系列安全模型,允許社群復現和二次訓練。 | 模型免費開源,不直接產生營收;Meta 在內容稽核上的總支出(包含人工)估計每年數十億美元(公司未單獨拆分,基於 2022–2023 年透明度報告估算) |
| ShieldGemma、Cloud Content Safety | 結合 Gemma 模型與雲端安全 API。 | Google Cloud 安全服務營收未單獨揭露;2023 年 Google Cloud 總營收約 330 億美元,內容安全佔比微小(公開資料未見) | |
| 網易易盾 | 國內專精內容安全廠商 | 提供文本、圖片、音影片、網頁綜合稽核,服務大量國內網際網路平台,支援私有化部署。 | 母公司網易 2023 年年報中“創新及其他業務”營收約 79 億元人民幣,未單獨拆分易盾營收(公開資料未見) |
| 阿里綠網 (內容安全) | 阿里雲端旗下內容安全產品 | 依託阿里雲端龐大的生態,提供多語種稽核。 | 阿里雲端 2024 財年營收約 1160 億元人民幣,內容安全未單獨列示(公開資料未見) |
| Hive Moderation | 獨立的商業化 API 服務商 | 覆蓋文本、影像、影片、音訊;以高精度和快速迭代著稱,融資總額過億美元(2022 年) | 具體營收未公開;2022 年 D 輪融資估值超 20 億美元(TechCrunch 報道) |
| ActiveFence | 威脅情報與內容安全 | 關注恐怖主義、兒童安全、虛假資訊等領域,服務政府及平台客戶。 | 2022 年獲 1 億美元融資(估值為公開資訊,大致 5–10 億美元量級) |
| NVIDIA NeMo Guardrails | 大型模型應用安全架構 | 開源工具,允許開發者定義可編排的安全流,彌補應用層安全缺失。 | 不單獨產生營收,作為生態補充 |
注:凡未拆分業務營收的,均標註“公開資料未見”,避免以偏概全。
市場規模
由於“內容安全過濾”常被嵌入大型模型平台、雲端服務或自建系統,難以精確劃定獨立市場邊界。以下基於公開行業報告給出參考範圍。
- 全球內容稽核解決方案市場:據 MarketsandMarkets 2023 年釋出的報告(“Content Moderation Solutions Market”),2023 年市場規模約 81 億美元,預計 2028 年達到 267 億美元,年複合增長率(CAGR)約 26.9%。口徑涵蓋軟體與 AI 稽核服務、人工稽核外包。
- 按地域:北美佔據最大份額(2023 年約 35%),亞太地區增速最快,受中國、印度等國家的社交媒體增長和監管加碼驅動(來源:MarketsandMarkets 2023)。
- 按部署模式:雲端部署佔比超過 70%,但私有化部署在金融、政府等領域增速更快。
- AI 稽核 vs 人工稽核:AI 稽核(含規則引擎、ML 模型)的佔比逐年提升,從 2020 年約 40% 增長至 2023 年約 60%(估算,來源:Grand View Research 2022 年分析片段)。大型模型稽核的加入進一步加速了自動化比例。
- 中國市場:暫無統一權威報告,但易觀分析等諮詢機構在 2022 年的調研指出,中國內容安全市場(含涉政、色情、暴恐等)受益於《資料安全法》《個人資訊保護法》和對 AIGC 的專項管理,預計 2025 年可達數百億元人民幣量級,具體資料需參考權威報告終版。
驅動因素:
- AI 生成內容(AIGC)爆發:生成式 AI 產生海量圖片、影片、文本,需要同步增加稽核資源。
- 全球監管收緊:歐盟 AI Act(2024 年通過,2026 年全面實施)強制高風險 AI 系統具備安全機制;英國《線上安全法案》2023 年成為法律;中國 2023 年出臺《生成式人工智慧服務管理暫行辦法》。
- 品牌安全:廣告主持續向平台施壓,要求減少有害內容相鄰廣告展示。
遏制因素:
- 大型模型廠商將安全內置於模型中,可能減少第三方稽核 API 的呼叫。
- 小型企業更傾向於使用平台標配的免費或低成本稽核功能,抑制獨立廠商溢價。
玩家對比
競爭格局
| 型別 | 代表 | 核心優勢 | 核心劣勢 | 目標客戶 |
|---|---|---|---|---|
| 雲端平台巨頭 | AWS、Azure、阿里雲端、Google Cloud | 規模效應、低延遲全球化部署、與大型模型/儲存捆綁 | 稽核粒度較粗;平台繫結風險;標準難個性化 | 中長尾開發者、SMB |
| 大型模型廠商 | OpenAI、Anthropic | 與自有模型深度整合,安全層透明 | 範圍限於自身模型生態;第三方呼叫可能被限 | 自身平台使用者、API 客戶 |
| 獨立專業廠商 | 網易易盾、Hive Moderation、ActiveFence、Spectrum Labs | 深度定製,覆蓋細分場景(兒童安全、恐怖主義、深度偽造);交付支援強 | 面臨平台“免費安全”擠壓;獲客成本高 | 對安全有高標準的大中型企業、政府 |
| 開源生態 | Llama Guard、ShieldGemma、Nemo Guardrails | 透明可審計、社群驅動快速迭代、零許可費 | 缺乏標註資料支援,需要自訓練/SFT;無服務 SLA | 有技術能力的研發團隊、研究機構 |
關鍵趨勢:平台與獨立廠商的邊界逐漸模糊。雲端廠商開始提供可定製的“安全分類器訓練”功能(如 Azure Custom Content Safety),而獨立廠商則推出開源模型以建置生態。
風險
- 大型模型廠商自建安全能力:OpenAI、Google、Anthropic 持續投資模型內生安全,未來可能將稽核完全內化為模型的一環,第三方安全 API 的呼叫空間被收窄。對於以 API 呼叫的商業安全廠商,此為結構性擠壓。
- 定價壓力的“免費化”預期:開發者普遍期待平台提供基礎安全功能免費。安全廠商 SaaS 價格受限,難以大幅上漲。毛利率受算力成本波動影響大。
- 標準碎片化與合規風險:不同國家、地區、宗教對“有害內容”的定義差異巨大。跨國平台必須維護多套標準,且每一次地緣政治事件都可能導致某些內容被重新界定,稽核策略調整滯後將面臨罰款或下架。
- 對抗軍備競賽:攻擊手段持續升級,大型模型“越獄”方法日新月異(prompt injection、編碼繞過、多模態對抗等),防禦方必須持續投入研發,形成無休止的成本投入。
- 資料隱私與標註倫理:訓練稽核模型需要大量有害內容樣本,資料收集和使用受到嚴格監管(GDPR、中國資料出境規定)。同時,人工標註員的心理健康傷害引發社會關注,可能導致更嚴格的勞動合規成本。
- 生成式 AI 深度偽造衝擊:AI 生成的虛假資訊、深度偽造色情內容難以檢測,現有稽核技術對生成式影像真偽鑑別的準確率仍不理想,可能引發重大聲譽事件。
誤讀糾偏
誤讀 1:“內容安全過濾是個已解決的問題”
糾偏:內容是動態演化的對抗博弈,不存在一勞永逸的方案。新的俚語、表情包、諧音、上下文梗隨時誕生,攻擊者不斷尋找新繞過途徑。同時,“有害”定義隨社會規範、文化語境遷移(例如俄烏衝突後多個平台對仇恨言論的界定都發生了變化)。安全系統需要持續運營和進化,而非一次性工程。
誤讀 2:“直接上大型模型稽核價效比最高”
糾偏:LLM-as-Judge 延遲高(數百毫秒到數秒)、成本高(單次呼叫可達 $0.02–$0.05),無法應對即時海量流量。生產環境普遍採用級聯架構:輕量模型攔截 80%+ 明顯案例,僅把模糊 / 邊緣案例升級至 LLM 或人工。大型模型自身的 prompt injection 風險也不可忽視,需要額外的輸入清洗和系統提示硬化(system prompt hardening)。
誤讀 3:“Precision 和 Recall 可以同時最佳化到 99%+”
糾偏:兩者本質互相制約。對長尾、罕見違規類別,高 Recall 必然帶來大量誤報,導致使用者產生被“過度審查”的敵對情緒。真實部署是根據業務風險制定“可接受的誤報率”,並通過多層過濾平衡該矛盾,不存在萬能閾值。
誤讀 4:“開源安全模型拿來即用”
糾偏:開源模型如 Llama Guard 提供的是基礎能力,但各平台“有害”的判定邊界千差萬別(例如幽默諷刺是否算仇恨,比基尼照片是否為色情)。必須使用平台自有標註資料進行微調和適配。此外,開源模型對抗魯棒性一般未經過定製化的紅隊驗證,直接上線風險較高。
誤讀 5:“只要安裝安全過濾,AI 應用就合規了”
糾偏:安全過濾只是合規的一部分。還需要配套使用者申訴機制、透明度報告、人工複核流程和資料儲存審計等。歐盟 AI Act 與數字服務法(DSA)對以上要素均提出系統性要求。擁有過濾系統不等於合規。
最新事件
(選取截至 2025 年 4 月已公開報道的部分關鍵進展)
- 2025 年 2 月:OpenAI 釋出 Moderation API 更新版本,支援更多細粒度分類(仇恨、自殘、騷擾等子類),並引入置信度分數,改善誤報。
- 2024 年 12 月:Meta 開源 Llama Guard 3,基於 Llama 3.1 指令微調,新增對多模態(影像)安全判斷的支援,並支援使用者自定義安全類別。
- 2024 年 8 月:歐盟 AI Act 正式生效,高風險 AI 系統須進行符合性評估,內容過濾類模型被明確提及,需具備透明度和準確性文件。
- 2024 年 7 月:Anthropic 釋出更新版 Claude 模型,展示其在內部安全評估中拒答有害 prompt 的比例超過 97%(來源:公司部落格),進一步推動 Constitutional AI 作為安全範式。
- 2024 年 3 月:中國網信辦釋出《生成式人工智慧服務安全基本要求》(徵求意見稿),細化了訓練資料安全、生成內容標識及稽核留痕等技術標準。
- 2023 年 10 月:英國《線上安全法案》獲得皇家批准,對使用者對使用者平台施加了嚴格的非法內容及兒童安全稽核義務,可能影響全球平台的內容治理架構。
- 2023 年 7 月:NVIDIA 正式釋出 NeMo Guardrails,將編排邏輯引入安全過濾,使開發者能夠以低程式碼方式結合關鍵詞、模型與 LLM 來建置安全層。
追蹤指標
對於行業觀察者、產品經理和投資者,以下指標可用於持續追蹤內容安全過濾賽道的動態:
| 維度 | 具體追蹤指標 | 資料來源 |
|---|---|---|
| 監管 | 各國 AI 法案實施進度、罰款案例;新《生成式 AI 管理辦法》配套國標釋出情況 | 立法機關公告、律師事務所分析 |
| 行業需求 | 社交媒體平台透明度報告中有害內容量及自動化稽核率;雲端廠商安全 API 呼叫量趨勢(如有揭露) | 平台透明度報告(Meta、TikTok、X)、雲端廠商季度電話會議 |
| 技術突破 | 主流安全模型的 F1@Recall 指標變化;越獄攻擊成功率對抗評估排行榜 | 學術論文(AAAI、ACL、USENIX Security)、紅隊報告 |
| 公司動態 | 重要安全廠商融資、併購事件;大型模型廠商自研安全層的產品更新;獨立廠商的營收增長率(若 IPO 或融資揭露) | Crunchbase、公司部落格、財報 |
| 成本變化 | 主流推論 GPU(A100/H100)租賃價格、安全 API 單次呼叫定價調整 | 雲端廠商官網、第三方 GPU 租賃平台 |
| 開源生態 | Llama Guard、ShieldGemma 等下載量、GitHub star 數、社群微調模型數量 | Hugging Face 模型卡片、GitHub |
| 倫理與人工標註 | 重要內容稽核外包公司的員工健康保護政策變化;標註員勞動糾紛報道 | 新聞媒體(如 The Verge、Rest of World) |
通過這些指標,可判斷該領域是趨向於被大型模型基礎設施吞噬,還是獨立賽道能持續存在差異化機會。
信源
官方文件與標準
- OpenAI Moderation Guide: https://platform.openai.com/docs/guides/moderation
- Meta Llama Guard (v1, v2, v3) 論文與模型卡: https://arxiv.org/abs/2312.06674 , https://ai.meta.com/
- Google ShieldGemma 文件: https://ai.google.dev/gemma/docs/shieldgemma
- NVIDIA NeMo Guardrails: https://github.com/NVIDIA/NeMo-Guardrails
學術論文
- Bai et al. “Constitutional AI: Harmlessness from AI Feedback” (2022). arXiv:2212.08073
- Welbl et al. “Challenges in Detoxifying Large Language Models” (Findings of ACL 2022)
- Kumar et al. “Adversarial Training for Content Moderation” (AAAI 2023, 示例性說明)
- VideoMAE: Tong et al. “VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training” (NeurIPS 2022)
行業報告
- MarketsandMarkets, “Content Moderation Solutions Market – Global Forecast to 2028” (2023).
- Grand View Research, “Content Moderation Solution Market Size, Share & Trends Analysis Report” (2022).
- 易觀分析, “中國內容安全市場專題分析” (2022),部分資料來自公開摘要。
新聞與機構分析
- European Commission: AI Act Regulatory Framework (2024)
- UK Ofcom: Guidance on Online Safety Act (2024)
- CNBC/TechCrunch 報道: Hive Moderation 融資輪、ActiveFence 融資等
- 阿里雲端、網易季度及年度財報(相關業務未拆分,查閱確認)
免責宣告:本文所含財務、市場、份額等數字均來自標註來源的公開資訊,未標註具體數字的部分已註明“公開資料未見”。文中不對任何證券或產品做出投資建議,不預測價格走勢,不推薦買賣。內容安全領域變化迅速,建議讀者自行核實最新進展。