概念庫 開放閱讀

Normalized Discounted Cumulative Gain

概念庫 · 開放閱讀

概念 ID
normalized-discounted-cumulative-gain
更新時間
2026-06-03
來源數量
1

nDCG

1 3秒看懂

nDCG(Normalized Discounted Cumulative Gain,歸一化折損累積增益)是衡量搜尋引擎、推薦系統排序質量的核心指標,取值0-1,越接近1表示排序越理想。

“鏈雲端 nDCG”指在區塊鏈上記錄評估基準與結果的雜湊指紋以防止篡改,同時在雲端運算環境執行大規模分散式排序評估與 nDCG 計算的技術組合。其核心產出是一份可驗證、可審計的排序質量證明。

一句話記憶:把搜尋排序質量的“體檢報告”放在不能改的鏈上,把“拍片子、跑化驗”放在雲端上,讓 AI 模型的排序能力評估變得更可信。

2 3分鐘產業解釋

2.1 核心定義與拆分

  • nDCG 本身:給定一組搜尋關鍵詞(Query)、每個關鍵詞下文件的“真實相關度”標註,以及模型給出的排序列表,計算一個0到1的分數。分數越高,模型越能把“高相關度內容”排到前面。
  • “鏈”部分:將測試集雜湊、評估引數雜湊、nDCG 結果雜湊存入區塊鏈。區塊鏈提供時間戳、不可篡改、可追溯的特性,使任何第三方可以驗證“評估報告未被事後修改”。
  • “雲端”部分:當評估規模達到數億條 Query-文件對時,單機計算往往需要數天。雲端運算將任務切分到數百至數千個容器或例項上並行打分,將評估週期壓縮到小時甚至分鐘級別。

2.2 為什麼需要這個組合

在 AI 大型模型與推薦演算法快速迭代的背景下,排序模型的評估面臨兩個矛盾:

  1. 規模爆炸:電商、短影片、搜尋場景下,每天模型需要評估億級 Query-文件/商品組合,單機處理已不可行。
  2. 信任缺失:模型團隊自評自報的 nDCG 分數,缺乏第三方可驗證性,尤其在商業合作、招投標、合規審計場景中,利益相關方需要“可信評估”。

鏈雲端方案試圖用一個技術架構同時回應這兩個難題:用雲端運算解決算力規模化問題,用區塊鏈解決過程可信化問題。

2.3 產業定位

在 AI 價值鏈中,鏈雲端 nDCG 處於模型評估與治理環節,屬於 AI 基礎設施的細分子領域。其定位類似第三方軟體測試服務,但聚焦於排序模型的效能評測,併疊加了區塊鏈存證帶來的可信背書能力。

據公開資訊梳理,截至2025年末,該領域尚無統一的產業分類程式碼,行業實踐中常將其歸入“AI 審計平台”或“MLOps 可信評估”子市場。

3 技術原理

3.1 傳統 nDCG 的技術骨架

理解鏈雲端方案前,須先釐清 nDCG 的計算邏輯:

步驟一:計算 DCG(折損累積增益)

對於單個 Query,模型給出一個排序列表,排名位置為 i 的文件相關度記為 rel_i,則:

DCG@k = rel_1 + Σ_{i=2}^{k} (rel_i / log₂(i))

其中 k 表示只看前 k 個結果。對數折損項 log₂(i) 的效果是:排名越靠後,增益貢獻被削弱得越多。

步驟二:計算 IDCG(理想 DCG)

將同一 Query 下的文件按真實相關度從高到低排列,計算理想排序下的 DCG,記為 IDCG@k。

步驟三:歸一化

nDCG@k = DCG@k / IDCG@k

nDCG 解決了不同 Query 之間文件數量、相關度分佈差異導致的“原始 DCG 不可比”問題,使跨 Query 的平均成為可能。

3.2 區塊鏈層:可信存證與自動化審計

鏈雲端方案在區塊鏈層做三件事:

(1)評估基準上鍊

  • 測試集包括 Query 列表、文件/商品集合、每個 Query 下文件的相關度標註(可以是人工標註,也可以是從使用者行為中提取的良好排序)。
  • 將測試集的完整資料或結構化後設資料(如欄位定義、樣本統計、標註時間戳)生成 Merkle 樹根雜湊,存入區塊鏈。
  • 後續任何修改都會改變根雜湊,使得“是否換過測試集”可以被鏈上記錄檢驗。

(2)評估引數上鍊

  • 評估引數包括:DCG 折損函式選型(log 折損還是其他變體)、截斷位置 k 的取值集合、是否使用指數增益(即使用 2^rel_i - 1 替代 rel_i)等。
  • 引數雜湊上鍊後,評估過程所採用的“評分標準手則”具有不可事後調整的特性。

(3)結果存證與審計追蹤

  • 對每次評估任務,生成結構化評估報告(包含模型標識、評估時間窗、各 Query 的 nDCG@k、宏觀平均等),將其雜湊及後設資料寫入鏈上。
  • 每次評估執行觸發時,智慧合約記錄事件日誌(任務發起方、執行節點、完成時間、結果雜湊),形成可追溯的操作鏈條。
  • 第三方審計者將鏈上雜湊與鏈下儲存的完整報告比對,即可驗證“報告自評估完成後未被改動”。

3.3 雲端運算層:分散式大規模評估引擎

當 Query 數量達到百萬級以上時,評估計算必須分散式化。典型架構如下:

任務分片

  • 將 Query 列表按雜湊分割槽或範圍分割槽,切分為多個子任務。每個子任務包含若干 Query 及其對應的文件池與標註。
  • 子任務被封裝為容器映象任務,提交至雲端原生批次計算服務(如 Kubernetes Job、雲端函式批次排程)。

並行打分

  • 每個計算節點載入待評估模型(或其 API 端點),對分配給它的 Query 獲取模型排序結果,按統一公式計算每條 Query 的 DCG 和 nDCG。
  • 節點完成計算後,將本分片的結果序列化,上傳至物件儲存,並返回完成訊號。

結果聚合

  • 聚合節點收集所有分片結果,計算全域性平均 nDCG@k、分位數分佈、按 Query 型別維度(如頭部/長尾 Query)的細分指標。
  • 聚合完成後觸發存證合約,將最終結果的雜湊寫入區塊鏈。

3.4 可信執行環境與隱私保護

部分場景下的評估涉及隱私資料(如使用者點選日誌、對話內容)。鏈雲端架構可選以下隱私保護策略:

  • TEE(可信執行環境):在雲端節點使用 Intel SGX、AMD SEV 或國產 TEE 方案,使評估計算在加密記憶體中完成,外部無法獲取明文資料。計算完成後僅輸出結果證明。
  • 聯邦評估架構:在各方資料不離開本地的前提下,通過多方安全計算或聯邦學習聚合協議,完成跨資料來源的 nDCG 評估。
  • 資料最小化上鍊:鏈上僅存雜湊和結果摘要,原始資料保留在授權訪問的鏈下儲存中,避免大量隱私資料寫入區塊鏈。

3.5 智慧合約驅動的自動化閉環

智慧合約在鏈雲端架構中扮演流程協調者角色,典型工作流:

  1. 新模型版本註冊事件觸發合約;
  2. 合約驗證模型提交方身份及質押(如有);
  3. 合約呼叫雲端評估服務的鏈外介面(通過預言機或事件訂閱機制);
  4. 雲端服務完成評估後,將結果雜湊及簡短摘要通過交易提交回合約;
  5. 合約更新鏈上模型登錄檔中該版本的“認證狀態”及對應 nDCG 值;
  6. 如結果低於預設閾值,合約可自動阻止模型上線或向治理方發出預警。

整個流程中,人工干預最小化,評估結果的客觀性由程式碼邏輯保證(前提是合約程式碼本身經過審計且無漏洞)。


4 關鍵引數

4.1 nDCG 計算引數

引數說明典型值/範圍對結果的影響
k截斷位置,只看前k個結果5、10、20、100k越小,對“頭部排序質量”越敏感
增益函式rel 轉 gain 的對映rel(線性)或 2^rel-1(指數)指數增益更強調高相關文件排到頂部的價值
折損函式排名位置折損方式1/log₂(i+1) 或其變體決定排名懲罰的陡峭程度
平均方式跨 Query 聚合方法宏觀平均(先算總DCG/總IDCG)或微觀平均(每個Query的nDCG取均值)宏觀平均受查詢長度影響,微觀平均每條Query等權

4.2 鏈雲端整合引數

引數說明典型選擇權衡
上鍊粒度何種資料上鍊僅結果雜湊 / 分片雜湊+後設資料 / 全量結果粒度越細,可審計性越強,成本越高
區塊鏈選型底層鏈型別聯盟鏈(FISCO BCOS、Hyperledger Fabric)/ 公鏈(Ethereum L2)聯盟鏈成本低、效能高;公鏈透明度更高
存證頻率評估寫入鏈的頻率每次評估 / 每N次評估批次 / 定時彙總頻率越高,即時性越強,累計Gas成本越高
計算資源策略雲端上評估節點規格與彈性策略按需例項 / 競價例項 / 預留例項成本與完成時間的平衡
隱私方案等級資料處理安全級別無保護 / 靜態加密 / TEE / 全同態加密安全等級越高,計算效率和成本代價越大

4.3 關鍵效能指標

  • 評估吞吐量(Queries/秒):衡量雲端運算層並行處理能力。頭部雲端廠商在萬核級別並行下,可達每秒百萬 Query 以上的評估吞吐。
  • 上鍊延遲(秒/分鐘):從評估完成到結果雜湊寫入鏈並確認的時間。聯盟鏈通常秒級,公鏈可能需數十秒至數分鐘。
  • 存證成本(元/次評估):單次完整評估的鏈上存證費用。公鏈按Gas費計,以太坊L1在2024-2025年Gas費區間為10-100 Gwei,單條存證交易費摺合人民幣數元至百元不等;聯盟鏈運維成本按節點數均攤,邊際成本趨近於零。
  • 總擁有成本(TCO):含雲端算力費、鏈存證費、儲存費、運維人力。據雲端廠商公開的批次計算服務定價,萬核·小時級別的評估任務,算力成本在數千至數萬元量級(以2025年阿里雲端、AWS 競價例項約0.1-0.3元/vCPU·小時的公開目錄價估算)。

5 技術路線

當前鏈雲端nDCG的實現路徑大致可分三條技術路線,產業界尚未形成統一標準。

5.1 路線一:純區塊鏈方案(輕量級)

思路:評估計算仍由模型方本地執行,僅將測試集雜湊、引數雜湊、最終nDCG結果的數字簽名上鍊。利用區塊鏈的時間戳和存證功能做“事後審計”,不做雲端上的分散式加速。

代表實踐:部分金融科技公司將風控模型評估指標的關鍵引數、評估日期、測試集版本雜湊存入聯盟鏈,用於滿足內控和監管留痕要求。

優勢:架構簡單,上鍊資料量小,存證成本極低。

劣勢:區塊鏈不能改變評估計算本身的速度與規模,對於大規模評估沒有加速作用;且鏈下計算過程仍不透明,僅能做到“結果不可篡改”,不能驗證“計算過程是否誠實”。

5.2 路線二:純雲端運算方案(可擴充套件評估,不含鏈)

思路:在雲端端搭建大規模分散式 nDCG 評估流水線,實現評估的彈性伸縮和快速完成,但不接入區塊鏈。評價結果的公信力由雲端服務商信譽或第三方評測機構的品牌背書。

代表實踐:MLflow + Spark on Kubernetes 進行大規模排序評估;部分網際網路公司內部效率平台即採用此路線。

優勢:運維複雜度低,評估效率高,無需應付鏈的開發運維成本。

劣勢:缺少不可篡改的記錄層。對於外部監管、商業爭議場景,結果公信力依賴中心化背書,難以實現自動化、程式碼化的可信驗證。

5.3 路線三:聯邦混合鏈雲端架構(深度整合)

思路:評估計算全流程在雲端端完成,區塊鏈作為流程排程和可信存證的“信任層”。智慧合約管理任務觸發、執行和結果提交。同時可整合 TEE 或聯邦學習實現隱私保護評估。

代表實踐:螞蟻鏈與阿里雲端 PAI 平台的協同方案(2024年雲端棲大會公開提及“可信AI評估”相關技術探索)、華為雲端基於區塊鏈引擎與 ModelArts 的組合方案均在向此方向演進。

優勢:理論上可以實現“評估計算可驗證+彈性規模+隱私保護”三者兼得。

劣勢:技術棧複雜,需要區塊鏈、雲端運算、AI 三支團隊的跨領域能力。開發調試周期長,生產環境穩定性需長期磨合。

5.4 路線對比總覽

維度純區塊鏈方案純雲端運算方案聯邦混合鏈雲端
評估規模受限於單叢集彈性伸縮,可達千萬級Query彈性伸縮,可達千萬級Query
過程可信度中(僅結果存證)低(依賴中心背書)高(存證+流程可審計)
技術複雜度
綜合成本
適用場景內部合規留痕內部效率提升跨機構對比、第三方審計、監管沙盒
成熟度已有落地案例成熟探索/試點階段

公開資料顯示,截至2025年末,“聯邦混合鏈雲端”路線在工業界的完整商用化案例仍然有限,多數專案處於PoC(概念驗證)或內部試點階段。信通院2024年釋出的《可信人工智慧評估體系建設指南》對此方向有所關注,但未提出具體的評測認證標準。


6 上游

鏈雲端nDCG方案的上游包括三組關鍵資源與能力供應商。

6.1 測試集與標註能力

公開基準資料集

  • MS MARCO(微軟,釋出於2016年,持續更新):包含百萬級真實搜尋Query與網頁段落相關性標註,是大規模排序評估的常用基準。
  • TREC(美國國家標準與技術研究所NIST主辦的文本檢索會議):每年釋出不同主題的測試集,涵蓋網頁、新聞、生物醫學等領域。
  • CLUE/ C-MRC 等中文基準(多家中國研究機構聯合釋出):為中文搜尋和閱讀理解提供標註。
  • 上述資料集均以研究使用為主,在商業評估場景中,使用方法上的關注點在於:測試集能否真實反映目標業務的 Query 分佈和使用者意圖。

商業標註服務

  • 部分企業需要定製化測試集,即根據自身業務場景(如電商商品搜尋、短影片推薦)搭建專屬的 Query-文件-相關度三元組。
  • 標註能力上游供應商包括:海天瑞聲(科創板688787,2024年年度報告揭露營收約X億元,主要面向AI資料服務)、Scale AI(美國,2024年完成F輪融資時估值約138億美元,據媒體公開報道)、Appen(澳大利亞,2024年財報營收約2.7億美元)等。
  • 標註質量直接影響nDCG基準IDCG的可信度,標註不一致會系統性地抬高或壓低nDCG結果,是鏈雲端方案“垃圾進垃圾出”風險的來源之一。

6.2 區塊鏈基礎設施

聯盟鏈平台

  • FISCO BCOS(微眾銀行牽頭開源,國內金融行業應用廣泛)
  • Hyperledger Fabric(Linux基金會主導,IBM貢獻核心程式碼)
  • 螞蟻鏈(螞蟻集團,提供BaaS平台)
  • 騰訊雲端TBaaS(騰訊雲端區塊鏈即服務)
  • 華為雲端區塊鏈引擎(基於Kubernetes架構,2024年已推出2.0版本)

公鏈及二層網路(用於高透明度場景)

  • Ethereum + L2(Arbitrum、Optimism):具備最高程度的去中心化信任,但存證成本波動較大。
  • 國產開放許可鏈(如長安鏈ChainMaker,由北京微芯研究院等發起)提供許可式公鏈選項,兼顧一定程度的開放可驗證性和成本可控。

BaaS(Blockchain as a Service)

將區塊鏈節點部署、運維外包給雲端廠商,降低了鏈雲端方案的基礎設施門檻。據IDC《中國BaaS市場份額報告》(2024年資料),中國BaaS市場前五廠商為螞蟻鏈(市場份額領先)、騰訊雲端、華為雲端、浪潮、趣鏈科技,合計佔據約70%左右的市場份額(具體份額以IDC報告原文數字為準,此處為區間表述)。

6.3 雲端運算與算力

  • IaaS 層:阿里雲端(中國市場佔有率第一,Canalys 2024年報告約為36%)、華為雲端(約19%)、騰訊雲端(約16%)、AWS(全球第一,2024年全球份額約31%,Synergy Research資料)。
  • 批次計算與容器服務:各雲端廠商均提供Kubernetes(K8s)叢集、Serverless容器例項、批次計算專用服務,支援大規模並行任務排程,是分散式評估的計算底座。
  • GPU/ NPU 算力:若需在評估中對模型推論加速(如 LLM 排序場景需GPU推論),上游還可延伸至輝達(NVIDIA)、華為昇騰等AI晶片/加速卡供應商。輝達H100/H200 GPU在2024-2025年供應趨緊,對雲端上GPU例項價格產生影響。

6.4 評估工具與中介軟體

  • 開源架構:TREC_eval(NIST官方評估工具)、RankLib(排序學習演算法)、Pytorch/TensorFlow生態中的nDCG計算模組。
  • MLOps平台:MLflow(LF AI & Data基金會開源專案)、Kubeflow、阿里雲端PAI、AWS SageMaker均包含模型評估流水線編排能力。
  • 中介軟體層:目前缺乏成熟的“區塊鏈-評估橋接”標準化中介軟體。多數實踐需要自研適配,即開發監聽評估完成事件、生成存證交易、審閱鏈上記錄的元件。這一缺失是鏈雲端方案門檻較高的重要原因。

7 下游

7.1 網際網路與科技平台

搜尋引擎

  • Google、百度(BIDU,NASDAQ/港交所)、Bing(微軟)對搜尋排序質量有持續評估需求。
  • nDCG 是衡量搜尋演算法迭代效果的核心指標之一。在大型模型(如Google SGE、百度文心一言搜尋增強)進入搜尋引擎後,傳統排序與生成式結果的混合評估需要更高頻、更大規模的評估流程,為鏈雲端方案提供了潛在應用空間。

推薦系統

  • 抖音/ TikTok(字節跳動)、快手(港交所:1024)、淘寶/天貓(阿里巴巴,NYSE:BABA/港交所:9988)、拼多多(NASDAQ:PDD)、美團(港交所:3690)均依賴推薦演算法驅動內容/商品分發。
  • 內容平台和電商平台對推薦模型進行迭代時,需要進行離線和線上評估。離線評估中的 nDCG 可衡量模型排序與使用者真實互動排序的一致性。當平台需向品牌商或監管方證明“推薦系統公平性”時,可信評估需求上升。

對話式AI / 大型模型應用

  • ChatGPT(OpenAI)、文心一言(百度)、通義千問(阿里)、Kimi(月之暗面)、豆包(字節跳動)等在RAG(檢索增強生成)場景下,檢索模組的排序質量直接影響最終回答的準確率。
  • 評估檢索模組的 nDCG 是大型模型應用評測的重要子項。在金融、法律、醫療等嚴肅場景,應用方需要可信的檢索質量報告。

7.2 金融與保險

  • 金融風控模型(信用評分排序、反欺詐規則優先順序排序)的評估結果直接影響資產質量和合規審查。部分銀行和保險公司已將模型的效能指標納入內部審計範圍。
  • 在“模型風險管理(Model Risk Management)”架構下(如美聯儲SR 11-7展望、中國銀保監會《商業銀行模型風險管理展望》),模型驗證的獨立性和可追溯性要求較高,鏈上存證可提供一條低成本的“審計軌跡”維護路徑。
  • 公開資料顯示,截至2025年末,已公開宣稱將nDCG評估結果上鍊進行合規管理的金融機構數量極少,但部分頭部銀行在金融科技沙盒中有相關探索(信源:中國金融科技年度報告2024,公開表述未揭露具體機構名)。

7.3 第三方審計與監管機構

  • 隨著AI治理成為全球政策焦點,對AI模型效能進行獨立審計的需求正在上升。
  • 歐盟AI法案(EU AI Act,2024年正式通過,部分條款於2025-2026年分階段實施)對高風險AI系統提出了透明度、可追溯性和效能評估要求。
  • 中國《生成式人工智慧服務管理辦法》(2023年8月15日施行)要求提供安全評估和演算法備案,未來對模型效能的獨立第三方評估存在政策延伸空間。
  • 鏈雲端nDCG作為“可驗證的模型效能報告”工具,或可服務於上述監管需求,但前提是形成標準化的評估流程與審計準則,而截至2025年末,該類標準公開資料未見有釋出或徵求意見稿。

7.4 AI模型交易與採購

  • 當企業採購第三方AI排序模型或SaaS服務時,需要獨立的效能基準測試來驗證供應商宣稱的指標。
  • 鏈雲端方案可以提供“不可篡改的效能測試成績單”,作為採購決策和合同履約驗證的依據。
  • 目前,模型交易的獨立評估仍以人工專家評審和有限基準測試為主,鏈上存證在此領域的商業化應用尚處於早期探索。

8 受益公司

以下基於產業定位推測可能受益於鏈雲端nDCG方向發展的公司/機構型別。以下所有公司僅做產業分析使用,不構成任何投資建議、不代表對其股價或經營狀況的判斷。

8.1 雲端+區塊鏈雙能力的頭部雲端廠商

全球

  • Amazon(AWS):擁有Amazon Managed Blockchain(支援Hyperledger Fabric)與SageMaker機器學習平台。AWS在2024年re:Invent大會上提升了AI評估與管理工具的產品線,但未單獨釋出鏈雲端nDCG產品。若AI可信評估需求增長,AWS具備整合的底層能力。
  • Microsoft(Azure):Azure Confidential Ledger基於區塊鏈提供防篡改儲存,與Azure Machine Learning結合可建置可信評估管線。微軟在2025年Build大會上釋出了AI模型評估相關更新,但以安全評測為主,未特別提及nDCG排序指標。
  • Google Cloud:在區塊鏈方面版面配置相對保守,主要通過合作伙伴提供。但其Vertex AI在模型評估方面工具較全,2025年公開資料未揭露其區塊鏈與AI評估結合的明確計劃。

中國

  • 阿里巴巴(阿里雲端+螞蟻鏈):阿里雲端PAI平台是國內市場份額領先的AI平台,螞蟻鏈是國內BaaS市場份額領先的區塊鏈服務商(據IDC 2024年報告)。同一集團內具備完整的雲端+鏈技術能力。2024年雲端棲大會展示過“可信AI”概念架構,但公開資料未見以“nDCG鏈雲端”命名的成熟商業產品或營收佔比資料。
  • 騰訊(騰訊雲端):TBaaS區塊鏈服務與TI-ONE機器學習平台存在整合基礎。騰訊雲端在金融、政務領域的客戶群對可信評估有潛在需求。2024年公開揭露的技術白皮書中提及“模型治理”但不特指排序評估。
  • 華為雲端:區塊鏈引擎BCS與ModelArts結合,政企市場的國產化、可信化要求可能推動該方案在政府AI專案中的應用。2025年3月華為雲端官網釋出的行業解決方案中,提及“可信AI評估架構”概念,未有具體nDCG產品的定價或銷售資料

8.2 區塊鏈技術與BaaS專業服務商

  • 趣鏈科技(未上市):聚焦聯盟鏈底層平台,在金融、政務、司法存證領域有大量落地案例。2024年公開揭露獲新一輪戰略融資,估值未公開。若可信AI評估需求增加,趣鏈作為底層技術服務商有望參與。
  • 零數科技(原能鏈科技)數秦科技等國內區塊鏈服務商:均以存證、資料確權為主要業務方向,AI評估上鍊可納入其產品拓展路徑,但公開資料未見相關案例。

8.3 AI資料與標註服務商

  • 海天瑞聲(688787):國內AI訓練資料頭部供應商,2024年年度報告揭露開拓了“AI評測資料”業務方向。若鏈雲端nDCG測試集需要商業化高質量標註,海天瑞聲可提供上游資料服務。
  • Scale AI(美國,未上市):據公開報道其2024年營收規模超數億美元,客戶包含OpenAI、Meta等。其評測服務若疊加區塊鏈存證能力,可能成為差異化優勢。但截至2025年末公開資料未見該公司區塊鏈相關產品。

8.4 潛在的垂直領域方案整合商

  • 專注於MLOps(機器學習運維)和AI治理的創業公司,如國內部分AI中臺服務商,可能將鏈雲端nDCG作為差異化功能嵌入產品。但截至2025年12月,公開資料未見任何公司將“鏈雲端nDCG”作為獨立產品線對外銷售或揭露客戶數量。

免責宣告:以上為產業邏輯分析,所列公司並未正式背書或確認此類業務的存在與規模。具體業務進展以各公司官方公告及監管揭露檔案為準。


9 市場規模

9.1 方法說明

鏈雲端nDCG作為一個高度細分的交叉領域,目前無獨立的第三方市場規模統計資料。以下采用分層估算方法:

  • 第一層:AI基礎資料服務市場(測試集標註)
  • 第二層:MLOps/模型評估與管理市場
  • 第三層:BaaS/區塊鏈存證市場中與AI評估相關的增量
  • 鏈雲端nDCG潛在市場:以上三層交叉部分

9.2 關聯市場規模

AI基礎資料服務

據IDC《中國AI基礎資料服務市場報告》,2024年中國AI基礎資料服務市場規模約XX億元人民幣(具體數值以IDC授權公開版本為準),年均增速約20%-25%。其中評測/測試資料集服務約佔整體市場的5%-10%(行業經驗估計,非IDC官方口徑)。

MLOps與模型管理

MarketsandMarkets 2024年報告估算,全球MLOps市場規模2024年約51億美元,預計2029年達到約212億美元(CAGR約32.9%)。該市場包含模型訓練、部署、監控、評估等環節,nDCG評估是模型評估的子模組。 中國MLOps市場據艾瑞諮詢2024年估算約XX億元(具體以報告原文為準),仍處於高速增長期。

區塊鏈BaaS

據IDC《中國BaaS市場份額報告》(2024年釋出,統計2023年資料),中國BaaS市場規模約XX億元人民幣。其中“存證/溯源”是最成熟的應用方向,AI評估上鍊屬於該方向的細分延伸,目前佔比很小,具體數字公開資料未見

9.3 鏈雲端nDCG的潛在市場推演(保守/樂觀情景)

保守情景(僅考慮高合規需求行業)

  • 金融(銀行、保險、證券)、政務AI專案、大型網際網路平台的AI合規審計為其提供需求來源。
  • 假設中國受監管行業的AI模型評估審計的10%-20%採用鏈上存證,評估服務的客單價按每年10萬-50萬元/個模型計,中國金融業大型模型數量在數百個量級(據銀保監會公開資料,全國性銀行平均模型數量約在數十到百個量級之間),潛在年市場規模在億元量級。

樂觀情景(拓展至AI模型交易與跨國合規)

  • 若歐盟AI法案、中國AI監管政策推動獨立審計成為強制性要求,企業間AI模型採購廣泛採用鏈上存證作為效能憑證,全球市場可能達到數億至十億美元量級。
  • 上述推演存在大量假設,不代表任何未來市場規模的預測或保證。實際市場發展取決於政策落地力度、技術成本下降速度、行業標準化進展等多種不確定因素。

年份宣告:本章節中所涉市調資料均基於2024年公開報告及2025年12月可獲取的最新資訊整理,具體年份已在文中標註。未標註數字為推演估計,僅供參考。


10 玩家對比

由於鏈雲端nDCG尚未成為一個獨立的商用產品品類,以下對比主要從技術能力與潛在產品化方向展開。

10.1 綜合雲端巨頭對比

維度阿里雲端+螞蟻鏈騰訊雲端+TBaaS華為雲端+BCSAWSAzure
AI平台PAI(國內市場領先)TI-ONEModelArtsSageMakerAzure ML
區塊鏈服務螞蟻鏈BaaS(國內市場份額領先)TBaaSBCS 2.0Managed BlockchainConfidential Ledger
隱私計算能力TEE+聯邦學習(摩斯)聯邦學習(Angel PowerFL)TEE+聯邦學習Nitro Enclaves機密計算
鏈雲端整合度技術展示級技術展示級技術展示級未單獨揭露未單獨揭露
目標行業金融、政務、電商金融、政務、遊戲政企、製造、礦山全球企業全球企業為主
公開的鏈雲端AI評估案例2024年雲端棲大會概念展示未揭露2025年白皮書概念未揭露未揭露

關鍵發現:五家頭部雲端廠商均具備鏈和雲端的基礎能力,但沒有一家將“nDCG鏈雲端評估”作為獨立SKU產品化。目前均為技術元件儲備和概念階段。

10.2 專業區塊鏈服務商對比

維度趣鏈科技零數科技數秦科技Consensys(全球)
核心產品聯盟鏈平台資料共享/存證司法存證/資料確權Ethereum生態工具
存證領域經驗豐富(司法、金融、政務)中等豐富(司法為主)豐富
AI結合探索2024年釋出“AI+區塊鏈”白皮書未單獨揭露未單獨揭露通過零知識證明探索
鏈雲端AI評估能力無公開產品

10.3 MLOps與AI治理工具對比

暫以nDCG排序評估為功能的MLOps平台進行對比:

工具/平台nDCG原生支援大規模分散式區塊鏈存證適用場景
MLflow(開源)需自定義可擴充套件(Spark整合)不支援內部實驗
Kubeflow需自定義原生K8s不支援內部流水線
阿里雲端PAI支援雲端原生分散式概念階段企業級內部
AWS SageMaker支援(自定義指標)雲端原生不支援企業級
Domino Data Lab支援可擴充套件不支援金融/製藥

結論:當前MLOps工具鏈普遍缺少區塊鏈存證功能。鏈雲端nDCG如果要實現廣泛商用,需要在現有MLOps平台上做功能擴充套件,或由獨立的評估即服務(EaaS)平台承載。


11 風險

11.1 技術風險

智慧合約漏洞風險

鏈雲端流程依賴智慧合約定義評估觸發、執行和驗收邏輯。合約程式碼中的缺陷(如重入攻擊、整數溢位、訪問控制缺失)可能導致評估流程被繞過或偽造。對智慧合約的第三方安全審計增加了專案成本和時間。

“預言機問題”

區塊鏈本身無法直接感知鏈外的“評估是否真實完成”。需要預言機(Oracle)將雲端上評估完成訊號傳遞至鏈上。如果預言機被攻破或作惡,可以偽造“已完成評估”的交易而實際評估並未發生或結果已被篡改。去中心化預言機網路(如Chainlink)可在一定程度上緩解,但會增加架構複雜度和成本。

大規模上鍊的效能瓶頸

公鏈TPS(交易每秒)有限。以太坊主網TPS約15-30,L2網路數百至數千TPS。如果需高頻評估(如每日數百次)並在公鏈存證,可能遇到網路擁堵和高Gas費。聯盟鏈TPS可達數千至上萬,仍須考慮評估任務數量高於鏈承載能力的風險。

11.2 經濟風險

成本收益比不理想

鏈雲端方案增加的成本包括:鏈存證Gas費/運維費、額外中介軟體開發費、TEE/隱私計算算力溢價、雲端上額外編排層開銷。如果評估信任度的提升不能帶來對應的商業價值(如更高的AI模型溢價、更多的訂單、更低的合規處罰風險),則難以形成可持續的商業模式。

存證成本隨規模線性增長

若每次評估都上鍊存證,存證成本將隨評估次數和模型版本數量線性增長。在大型模型頻繁迭代(日更甚至小時更)的場景下,存證成本可能超過評估計算本身的花費。這要求實際部署中必須取捨上鍊頻率與粒度,可能削弱“全程可審計”的核心價值主張。

11.3 合規與法律風險

與“被遺忘權”的衝突

中國《個人資訊保護法》(2021年11月施行)第47條規定個人在特定情形下有權請求刪除個人資訊。歐盟GDPR第17條規定了“擦除權”(Right to erasure)。區塊鏈的不可篡改特性與刪除權存在結構性的矛盾。若評估資料中包含可關聯到個人的資訊(即便是雜湊,在某些法律解釋下也可能被視為個人資訊),其永久儲存可能引發合規爭議。

資料跨境問題

若採用公鏈(節點分佈於全球),評估相關雜湊資料可能會同步至境外節點,在中國法律架構下可能觸發《資料出境安全評估辦法》的監管要求(若評估資料被認定為“重要資料”)。採用純國內聯盟鏈可規避此問題,但會犧牲公鏈的全球可驗證性。

缺乏行業標準與法律認可

截至2025年末,鏈上存證的評估報告在司法和監管程式中是否具有等同於傳統公證或第三方檢驗報告的證據效力,尚缺乏明確的法律定性和判例支撐。這削弱了“上鍊即可信”的商業說服力。

11.4 業務風險

“垃圾進、垃圾出”問題——區塊鏈不能解決資料來源頭可信度

這是鏈雲端nDCG最核心的爭議點。區塊鏈保證了存入的內容不可篡改,但無法保證存入內容的“真實性”和“質量”。如果測試集存在標註偏差,或人為構造了“對自家模型有利的測試Query”,那麼上鍊的高nDCG值只是“不可篡改的虛假滿分”。這類行為的檢測仍需要傳統的社會工程審計、標註質量抽檢等手段,區塊鏈並未從根本上解決“評估作弊”問題。

供應商鎖定風險

若採用某家雲端廠商的“鏈雲端一體化”方案,測試集格式、合約介面、評估流水線均可能與該廠商的專有技術棧深度繫結。後續遷移到其他方案將產生較高的轉換成本。


12 誤讀糾偏

12.1 “區塊鏈讓nDCG評估完全可信”

糾偏:這是一個常見的過度宣傳話術。區塊鏈只能保證存證後資料不被篡改這一狹義的“可信”。評估的可信度還依賴於以下前提,而這些前提並未由區塊鏈自動解決:

  • 測試集是否真實代表業務場景?
  • 標註質量是否足夠高?標註一致性(Inter-annotator agreement)是否達標?
  • 評估計算程式碼是否存在錯誤或後門?
  • 上鍊的主體是否就是原評估發起方(身份認證問題)?

鏈雲端nDCG的“可信”是分層且受條件約束的,不應被描述為“絕對可信”。

12.2 “上鍊後評估結果無法刪除,因此絕對可靠”

糾偏:不可刪除≠真實可靠。不可刪除僅意味著該條記錄本身是完整歷史的組成部分,但如果它是一條“誠實記錄的虛假結果”,其不可刪除性反而成為問題——一個錯誤的評估結果會永久留存在鏈上。需要區分“資料完整性”和“資料真實性”兩個完全不同的概念。

12.3 “nDCG是萬能的排序評估指標”

糾偏:nDCG聚焦於排序質量,但無法衡量的重要維度包括但不限於:

  • 新穎性與多樣性:排序是否過度重複同類內容?
  • 公平性:排序是否對不同群體或內容創作者形成了系統性的偏見?
  • 使用者滿意度與商業轉化:離線nDCG與線上商業指標(點選率、成交率、留存)的相關性並非總是強相關,存在“離線指標提升,線上指標持平甚至下降”的可能。
  • 延遲與效能:高nDCG可能以模型推論延遲增加為代價,在實際線上系統中會損害使用者體驗。

因此,nDCG應作為多維度評估體系中的一個組成部分,而非獨立決策標準。

12.4 “鏈雲端nDCG已是一項成熟技術、可立即部署”

糾偏:如前所述,截至目前該方案仍在概念驗證和試點階段。公開資料未見有企業以商業產品形式規模化提供鏈雲端nDCG服務。將其描述為“即插即用”或“生產已驗證”的產品,是偏離產業實際的。

12.5 “用了鏈雲端nDCG就是合規的”

糾偏:目前沒有任何司法管轄區的法律法規明確將“區塊鏈存證的nDCG評估”作為AI模型合規的滿足條件。合規需要滿足完整的法律法規條文,通常涵蓋資料安全、模型安全、倫理審查等多個維度,鏈雲端nDCG最多僅能服務於其中的“可追溯效能記錄”環節,遠非合規的全部。


13 最新事件

13.1 2025年內重要進展(截至12月)

中國信通院啟動“可信AI評估體系2.0”

  • 2025年9月,中國信通院在“2025可信AI大會”上釋出《可信人工智慧評估體系建設指南(2.0版)》,在模型評估基礎上增加了對評估過程可追溯性的討論段落,提及區塊鏈作為一種“可選技術手段”。這標誌著政策研究層面對“評估過程可信化”的關注上升。
  • 但該指南仍處於研究建議層級,未形成強制標準或認證細則

華為雲端BCS 2.0釋出

  • 2025年3月,華為雲端釋出區塊鏈引擎BCS 2.0版本,新增對TEE環境下的資料存證支援,並在行業方案白皮書中提及“AI模型評估與存證”的潛在場景。尚未釋出客單價或客戶數

EU AI Act部分條款生效進入倒計時

  • 2025年2月起,歐盟AI法案的“不可接受風險”條款已正式適用,高風險AI系統的相關要求將於2026年8月起實施。屆時,在歐盟市場部署的高風險AI系統需要具備技術檔案留檔、效能評估可追溯等能力。該法案是否會成為鏈雲端nDCG需求的結構性驅動力,目前在產業分析中仍存分歧。

AI評測成為獨立賽道

  • 2025年內,國內多家創業公司獲得融資以發展“AI模型評測”業務(例如某評測平台於2025年6月宣佈完成新一輪融資,投資方含頭部風投機構,融資金額未公開揭露)。該賽道目前以LLM安全和對齊評測為主,排序質量的獨立評測關注度相對較低,但產業基礎設施在快速建置中。

13.2 2024年相關事件的回顧性影響

  • 2024年11月雲端棲大會:螞蟻鏈+阿里雲端PAI聯合展示了“資料可信流通與模型可信評估”的技術架構,提及排序指標上鍊的理念,引發行業對鏈雲端AI評估的關注。會議公開資料顯示為概念驗證(PoC)階段。
  • 2024年7月世界人工智慧大會(WAIC):多家區塊鏈和AI企業以“AI審計”為主題進行討論,但無具體nDCG上鍊產品的釋出或演示

14 追蹤指標

要持續追蹤“鏈雲端nDCG”這一產業概念的落地程序,建議關注以下可觀測訊號:

14.1 政策與標準維度

  • 信通院“可信AI”認證體系中是否新增“評估過程可追溯”考核項:若有,則表明標準層面開始要求評估過程存證。
  • 金融監管機構模型風險管理展望的修訂:會否明確提及區塊鏈存證或其他不可篡改記錄技術作為模型驗證的推薦做法。
  • EU AI Act實施進展:2026年8月高風險AI系統條款的執法細則如何定義“技術檔案留檔”的形式要求,是否接受鏈上存證。

14.2 技術與產品維度

  • 頭部雲端廠商的AI平台產品更新:阿里雲端PAI、華為雲端ModelArts、AWS SageMaker是否推出與區塊鏈服務聯動的“可信評估”功能模組。
  • MLOps社群/開源專案:MLflow、Kubeflow等專案是否出現區塊鏈存證外掛或整合方案的成熟版本。
  • 存證成本趨勢:以太坊L2 Gas費、聯盟鏈運維成本的變化,將直接影響鏈雲端nDCG的經濟可行性。

14.3 商業落地維度

  • “評估即服務”初創公司
source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型