概念库 开放阅读

Normalized Discounted Cumulative Gain

概念库 · 开放阅读

概念 ID
normalized-discounted-cumulative-gain
更新时间
2026-06-03
来源数量
1

nDCG

1 3秒看懂

nDCG(Normalized Discounted Cumulative Gain,归一化折损累积增益)是衡量搜索引擎、推荐系统排序质量的核心指标,取值0-1,越接近1表示排序越理想。

“链云 nDCG”指在区块链上记录评估基准与结果的哈希指纹以防止篡改,同时在云计算环境执行大规模分布式排序评估与 nDCG 计算的技术组合。其核心产出是一份可验证、可审计的排序质量证明。

一句话记忆:把搜索排序质量的“体检报告”放在不能改的链上,把“拍片子、跑化验”放在云上,让 AI 模型的排序能力评估变得更可信。

2 3分钟产业解释

2.1 核心定义与拆分

  • nDCG 本身:给定一组搜索关键词(Query)、每个关键词下文档的“真实相关度”标注,以及模型给出的排序列表,计算一个0到1的分数。分数越高,模型越能把“高相关度内容”排到前面。
  • “链”部分:将测试集哈希、评估参数哈希、nDCG 结果哈希存入区块链。区块链提供时间戳、不可篡改、可追溯的特性,使任何第三方可以验证“评估报告未被事后修改”。
  • “云”部分:当评估规模达到数亿条 Query-文档对时,单机计算往往需要数天。云计算将任务切分到数百至数千个容器或实例上并行打分,将评估周期压缩到小时甚至分钟级别。

2.2 为什么需要这个组合

在 AI 大模型与推荐算法快速迭代的背景下,排序模型的评估面临两个矛盾:

  1. 规模爆炸:电商、短视频、搜索场景下,每天模型需要评估亿级 Query-文档/商品组合,单机处理已不可行。
  2. 信任缺失:模型团队自评自报的 nDCG 分数,缺乏第三方可验证性,尤其在商业合作、招投标、合规审计场景中,利益相关方需要“可信评估”。

链云方案试图用一个技术架构同时回应这两个难题:用云计算解决算力规模化问题,用区块链解决过程可信化问题。

2.3 产业定位

在 AI 价值链中,链云 nDCG 处于模型评估与治理环节,属于 AI 基础设施的细分子领域。其定位类似第三方软件测试服务,但聚焦于排序模型的性能评测,并叠加了区块链存证带来的可信背书能力。

据公开信息梳理,截至2025年末,该领域尚无统一的产业分类代码,行业实践中常将其归入“AI 审计平台”或“MLOps 可信评估”子市场。

3 技术原理

3.1 传统 nDCG 的技术骨架

理解链云方案前,须先厘清 nDCG 的计算逻辑:

步骤一:计算 DCG(折损累积增益)

对于单个 Query,模型给出一个排序列表,排名位置为 i 的文档相关度记为 rel_i,则:

DCG@k = rel_1 + Σ_{i=2}^{k} (rel_i / log₂(i))

其中 k 表示只看前 k 个结果。对数折损项 log₂(i) 的效果是:排名越靠后,增益贡献被削弱得越多。

步骤二:计算 IDCG(理想 DCG)

将同一 Query 下的文档按真实相关度从高到低排列,计算理想排序下的 DCG,记为 IDCG@k。

步骤三:归一化

nDCG@k = DCG@k / IDCG@k

nDCG 解决了不同 Query 之间文档数量、相关度分布差异导致的“原始 DCG 不可比”问题,使跨 Query 的平均成为可能。

3.2 区块链层:可信存证与自动化审计

链云方案在区块链层做三件事:

(1)评估基准上链

  • 测试集包括 Query 列表、文档/商品集合、每个 Query 下文档的相关度标注(可以是人工标注,也可以是从用户行为中提取的良好排序)。
  • 将测试集的完整数据或结构化元数据(如字段定义、样本统计、标注时间戳)生成 Merkle 树根哈希,存入区块链。
  • 后续任何修改都会改变根哈希,使得“是否换过测试集”可以被链上记录检验。

(2)评估参数上链

  • 评估参数包括:DCG 折损函数选型(log 折损还是其他变体)、截断位置 k 的取值集合、是否使用指数增益(即使用 2^rel_i - 1 替代 rel_i)等。
  • 参数哈希上链后,评估过程所采用的“评分标准手则”具有不可事后调整的特性。

(3)结果存证与审计追踪

  • 对每次评估任务,生成结构化评估报告(包含模型标识、评估时间窗、各 Query 的 nDCG@k、宏观平均等),将其哈希及元数据写入链上。
  • 每次评估执行触发时,智能合约记录事件日志(任务发起方、执行节点、完成时间、结果哈希),形成可追溯的操作链条。
  • 第三方审计者将链上哈希与链下存储的完整报告比对,即可验证“报告自评估完成后未被改动”。

3.3 云计算层:分布式大规模评估引擎

当 Query 数量达到百万级以上时,评估计算必须分布式化。典型架构如下:

任务分片

  • 将 Query 列表按哈希分区或范围分区,切分为多个子任务。每个子任务包含若干 Query 及其对应的文档池与标注。
  • 子任务被封装为容器镜像任务,提交至云原生批量计算服务(如 Kubernetes Job、云函数批量调度)。

并行打分

  • 每个计算节点加载待评估模型(或其 API 端点),对分配给它的 Query 获取模型排序结果,按统一公式计算每条 Query 的 DCG 和 nDCG。
  • 节点完成计算后,将本分片的结果序列化,上传至对象存储,并返回完成信号。

结果聚合

  • 聚合节点收集所有分片结果,计算全局平均 nDCG@k、分位数分布、按 Query 类型维度(如头部/长尾 Query)的细分指标。
  • 聚合完成后触发存证合约,将最终结果的哈希写入区块链。

3.4 可信执行环境与隐私保护

部分场景下的评估涉及隐私数据(如用户点击日志、对话内容)。链云架构可选以下隐私保护策略:

  • TEE(可信执行环境):在云节点使用 Intel SGX、AMD SEV 或国产 TEE 方案,使评估计算在加密内存中完成,外部无法获取明文数据。计算完成后仅输出结果证明。
  • 联邦评估框架:在各方数据不离开本地的前提下,通过多方安全计算或联邦学习聚合协议,完成跨数据源的 nDCG 评估。
  • 数据最小化上链:链上仅存哈希和结果摘要,原始数据保留在授权访问的链下存储中,避免大量隐私数据写入区块链。

3.5 智能合约驱动的自动化闭环

智能合约在链云架构中扮演流程协调者角色,典型工作流:

  1. 新模型版本注册事件触发合约;
  2. 合约验证模型提交方身份及质押(如有);
  3. 合约调用云评估服务的链外接口(通过预言机或事件订阅机制);
  4. 云服务完成评估后,将结果哈希及简短摘要通过交易提交回合约;
  5. 合约更新链上模型注册表中该版本的“认证状态”及对应 nDCG 值;
  6. 如结果低于预设阈值,合约可自动阻止模型上线或向治理方发出预警。

整个流程中,人工干预最小化,评估结果的客观性由代码逻辑保证(前提是合约代码本身经过审计且无漏洞)。


4 关键参数

4.1 nDCG 计算参数

参数说明典型值/范围对结果的影响
k截断位置,只看前k个结果5、10、20、100k越小,对“头部排序质量”越敏感
增益函数rel 转 gain 的映射rel(线性)或 2^rel-1(指数)指数增益更强调高相关文档排到顶部的价值
折损函数排名位置折损方式1/log₂(i+1) 或其变体决定排名惩罚的陡峭程度
平均方式跨 Query 聚合方法宏观平均(先算总DCG/总IDCG)或微观平均(每个Query的nDCG取均值)宏观平均受查询长度影响,微观平均每条Query等权

4.2 链云集成参数

参数说明典型选择权衡
上链粒度何种数据上链仅结果哈希 / 分片哈希+元数据 / 全量结果粒度越细,可审计性越强,成本越高
区块链选型底层链类型联盟链(FISCO BCOS、Hyperledger Fabric)/ 公链(Ethereum L2)联盟链成本低、性能高;公链透明度更高
存证频率评估写入链的频率每次评估 / 每N次评估批量 / 定时汇总频率越高,实时性越强,累计Gas成本越高
计算资源策略云上评估节点规格与弹性策略按需实例 / 竞价实例 / 预留实例成本与完成时间的平衡
隐私方案等级数据处理安全级别无保护 / 静态加密 / TEE / 全同态加密安全等级越高,计算效率和成本代价越大

4.3 关键性能指标

  • 评估吞吐量(Queries/秒):衡量云计算层并行处理能力。头部云厂商在万核级别并行下,可达每秒百万 Query 以上的评估吞吐。
  • 上链延迟(秒/分钟):从评估完成到结果哈希写入链并确认的时间。联盟链通常秒级,公链可能需数十秒至数分钟。
  • 存证成本(元/次评估):单次完整评估的链上存证费用。公链按Gas费计,以太坊L1在2024-2025年Gas费区间为10-100 Gwei,单条存证交易费折合人民币数元至百元不等;联盟链运维成本按节点数均摊,边际成本趋近于零。
  • 总拥有成本(TCO):含云算力费、链存证费、存储费、运维人力。据云厂商公开的批量计算服务定价,万核·小时级别的评估任务,算力成本在数千至数万元量级(以2025年阿里云、AWS 竞价实例约0.1-0.3元/vCPU·小时的公开目录价估算)。

5 技术路线

当前链云nDCG的实现路径大致可分三条技术路线,产业界尚未形成统一标准。

5.1 路线一:纯区块链方案(轻量级)

思路:评估计算仍由模型方本地执行,仅将测试集哈希、参数哈希、最终nDCG结果的数字签名上链。利用区块链的时间戳和存证功能做“事后审计”,不做云上的分布式加速。

代表实践:部分金融科技公司将风控模型评估指标的关键参数、评估日期、测试集版本哈希存入联盟链,用于满足内控和监管留痕要求。

优势:架构简单,上链数据量小,存证成本极低。

劣势:区块链不能改变评估计算本身的速度与规模,对于大规模评估没有加速作用;且链下计算过程仍不透明,仅能做到“结果不可篡改”,不能验证“计算过程是否诚实”。

5.2 路线二:纯云计算方案(可扩展评估,不含链)

思路:在云端搭建大规模分布式 nDCG 评估流水线,实现评估的弹性伸缩和快速完成,但不接入区块链。评价结果的公信力由云服务商信誉或第三方评测机构的品牌背书。

代表实践:MLflow + Spark on Kubernetes 进行大规模排序评估;部分互联网公司内部效率平台即采用此路线。

优势:运维复杂度低,评估效率高,无需应付链的开发运维成本。

劣势:缺少不可篡改的记录层。对于外部监管、商业争议场景,结果公信力依赖中心化背书,难以实现自动化、代码化的可信验证。

5.3 路线三:联邦混合链云架构(深度集成)

思路:评估计算全流程在云端完成,区块链作为流程调度和可信存证的“信任层”。智能合约管理任务触发、执行和结果提交。同时可集成 TEE 或联邦学习实现隐私保护评估。

代表实践:蚂蚁链与阿里云 PAI 平台的协同方案(2024年云栖大会公开提及“可信AI评估”相关技术探索)、华为云基于区块链引擎与 ModelArts 的组合方案均在向此方向演进。

优势:理论上可以实现“评估计算可验证+弹性规模+隐私保护”三者兼得。

劣势:技术栈复杂,需要区块链、云计算、AI 三支团队的跨领域能力。开发调试周期长,生产环境稳定性需长期磨合。

5.4 路线对比总览

维度纯区块链方案纯云计算方案联邦混合链云
评估规模受限于单集群弹性伸缩,可达千万级Query弹性伸缩,可达千万级Query
过程可信度中(仅结果存证)低(依赖中心背书)高(存证+流程可审计)
技术复杂度
综合成本
适用场景内部合规留痕内部效率提升跨机构对比、第三方审计、监管沙盒
成熟度已有落地案例成熟探索/试点阶段

公开资料显示,截至2025年末,“联邦混合链云”路线在工业界的完整商用化案例仍然有限,多数项目处于PoC(概念验证)或内部试点阶段。信通院2024年发布的《可信人工智能评估体系建设指南》对此方向有所关注,但未提出具体的评测认证标准。


6 上游

链云nDCG方案的上游包括三组关键资源与能力供应商。

6.1 测试集与标注能力

公开基准数据集

  • MS MARCO(微软,发布于2016年,持续更新):包含百万级真实搜索Query与网页段落相关性标注,是大规模排序评估的常用基准。
  • TREC(美国国家标准与技术研究所NIST主办的文本检索会议):每年发布不同主题的测试集,涵盖网页、新闻、生物医学等领域。
  • CLUE/ C-MRC 等中文基准(多家中国研究机构联合发布):为中文搜索和阅读理解提供标注。
  • 上述数据集均以研究使用为主,在商业评估场景中,使用方法上的关注点在于:测试集能否真实反映目标业务的 Query 分布和用户意图。

商业标注服务

  • 部分企业需要定制化测试集,即根据自身业务场景(如电商商品搜索、短视频推荐)搭建专属的 Query-文档-相关度三元组。
  • 标注能力上游供应商包括:海天瑞声(科创板688787,2024年年度报告披露营收约X亿元,主要面向AI数据服务)、Scale AI(美国,2024年完成F轮融资时估值约138亿美元,据媒体公开报道)、Appen(澳大利亚,2024年财报收入约2.7亿美元)等。
  • 标注质量直接影响nDCG基准IDCG的可信度,标注不一致会系统性地抬高或压低nDCG结果,是链云方案“垃圾进垃圾出”风险的来源之一。

6.2 区块链基础设施

联盟链平台

  • FISCO BCOS(微众银行牵头开源,国内金融行业应用广泛)
  • Hyperledger Fabric(Linux基金会主导,IBM贡献核心代码)
  • 蚂蚁链(蚂蚁集团,提供BaaS平台)
  • 腾讯云TBaaS(腾讯云区块链即服务)
  • 华为云区块链引擎(基于Kubernetes架构,2024年已推出2.0版本)

公链及二层网络(用于高透明度场景)

  • Ethereum + L2(Arbitrum、Optimism):具备最高程度的去中心化信任,但存证成本波动较大。
  • 国产开放许可链(如长安链ChainMaker,由北京微芯研究院等发起)提供许可式公链选项,兼顾一定程度的开放可验证性和成本可控。

BaaS(Blockchain as a Service)

将区块链节点部署、运维外包给云厂商,降低了链云方案的基础设施门槛。据IDC《中国BaaS市场份额报告》(2024年数据),中国BaaS市场前五厂商为蚂蚁链(市场份额领先)、腾讯云、华为云、浪潮、趣链科技,合计占据约70%左右的市场份额(具体份额以IDC报告原文数字为准,此处为区间表述)。

6.3 云计算与算力

  • IaaS 层:阿里云(中国市场占有率第一,Canalys 2024年报告约为36%)、华为云(约19%)、腾讯云(约16%)、AWS(全球第一,2024年全球份额约31%,Synergy Research数据)。
  • 批量计算与容器服务:各云厂商均提供Kubernetes(K8s)集群、Serverless容器实例、批量计算专用服务,支持大规模并行任务调度,是分布式评估的计算底座。
  • GPU/ NPU 算力:若需在评估中对模型推理加速(如 LLM 排序场景需GPU推理),上游还可延伸至英伟达(NVIDIA)、华为昇腾等AI芯片/加速卡供应商。英伟达H100/H200 GPU在2024-2025年供应趋紧,对云上GPU实例价格产生影响。

6.4 评估工具与中间件

  • 开源框架:TREC_eval(NIST官方评估工具)、RankLib(排序学习算法)、Pytorch/TensorFlow生态中的nDCG计算模块。
  • MLOps平台:MLflow(LF AI & Data基金会开源项目)、Kubeflow、阿里云PAI、AWS SageMaker均包含模型评估流水线编排能力。
  • 中间件层:目前缺乏成熟的“区块链-评估桥接”标准化中间件。多数实践需要自研适配,即开发监听评估完成事件、生成存证交易、审阅链上记录的组件。这一缺失是链云方案门槛较高的重要原因。

7 下游

7.1 互联网与科技平台

搜索引擎

  • Google、百度(BIDU,NASDAQ/港交所)、Bing(微软)对搜索排序质量有持续评估需求。
  • nDCG 是衡量搜索算法迭代效果的核心指标之一。在大模型(如Google SGE、百度文心一言搜索增强)进入搜索引擎后,传统排序与生成式结果的混合评估需要更高频、更大规模的评估流程,为链云方案提供了潜在应用空间。

推荐系统

  • 抖音/ TikTok(字节跳动)、快手(港交所:1024)、淘宝/天猫(阿里巴巴,NYSE:BABA/港交所:9988)、拼多多(NASDAQ:PDD)、美团(港交所:3690)均依赖推荐算法驱动内容/商品分发。
  • 内容平台和电商平台对推荐模型进行迭代时,需要进行离线和在线评估。离线评估中的 nDCG 可衡量模型排序与用户真实交互排序的一致性。当平台需向品牌商或监管方证明“推荐系统公平性”时,可信评估需求上升。

对话式AI / 大模型应用

  • ChatGPT(OpenAI)、文心一言(百度)、通义千问(阿里)、Kimi(月之暗面)、豆包(字节跳动)等在RAG(检索增强生成)场景下,检索模块的排序质量直接影响最终回答的准确率。
  • 评估检索模块的 nDCG 是大模型应用评测的重要子项。在金融、法律、医疗等严肃场景,应用方需要可信的检索质量报告。

7.2 金融与保险

  • 金融风控模型(信用评分排序、反欺诈规则优先级排序)的评估结果直接影响资产质量和合规审查。部分银行和保险公司已将模型的性能指标纳入内部审计范围。
  • 在“模型风险管理(Model Risk Management)”框架下(如美联储SR 11-7指引、中国银保监会《商业银行模型风险管理指引》),模型验证的独立性和可追溯性要求较高,链上存证可提供一条低成本的“审计轨迹”维护路径。
  • 公开资料显示,截至2025年末,已公开宣称将nDCG评估结果上链进行合规管理的金融机构数量极少,但部分头部银行在金融科技沙盒中有相关探索(信源:中国金融科技年度报告2024,公开表述未披露具体机构名)。

7.3 第三方审计与监管机构

  • 随着AI治理成为全球政策焦点,对AI模型性能进行独立审计的需求正在上升。
  • 欧盟AI法案(EU AI Act,2024年正式通过,部分条款于2025-2026年分阶段实施)对高风险AI系统提出了透明度、可追溯性和性能评估要求。
  • 中国《生成式人工智能服务管理办法》(2023年8月15日施行)要求提供安全评估和算法备案,未来对模型性能的独立第三方评估存在政策延伸空间。
  • 链云nDCG作为“可验证的模型性能报告”工具,或可服务于上述监管需求,但前提是形成标准化的评估流程与审计准则,而截至2025年末,该类标准公开资料未见有发布或征求意见稿。

7.4 AI模型交易与采购

  • 当企业采购第三方AI排序模型或SaaS服务时,需要独立的性能基准测试来验证供应商宣称的指标。
  • 链云方案可以提供“不可篡改的性能测试成绩单”,作为采购决策和合同履约验证的依据。
  • 目前,模型交易的独立评估仍以人工专家评审和有限基准测试为主,链上存证在此领域的商业化应用尚处于早期探索。

8 受益公司

以下基于产业定位推测可能受益于链云nDCG方向发展的公司/机构类型。以下所有公司仅做产业分析使用,不构成任何投资建议、不代表对其股价或经营状况的判断。

8.1 云+区块链双能力的头部云厂商

全球

  • Amazon(AWS):拥有Amazon Managed Blockchain(支持Hyperledger Fabric)与SageMaker机器学习平台。AWS在2024年re:Invent大会上提升了AI评估与管理工具的产品线,但未单独发布链云nDCG产品。若AI可信评估需求增长,AWS具备整合的底层能力。
  • Microsoft(Azure):Azure Confidential Ledger基于区块链提供防篡改存储,与Azure Machine Learning结合可构建可信评估管线。微软在2025年Build大会上发布了AI模型评估相关更新,但以安全评测为主,未特别提及nDCG排序指标。
  • Google Cloud:在区块链方面布局相对保守,主要通过合作伙伴提供。但其Vertex AI在模型评估方面工具较全,2025年公开资料未披露其区块链与AI评估结合的明确计划。

中国

  • 阿里巴巴(阿里云+蚂蚁链):阿里云PAI平台是国内市场份额领先的AI平台,蚂蚁链是国内BaaS市场份额领先的区块链服务商(据IDC 2024年报告)。同一集团内具备完整的云+链技术能力。2024年云栖大会展示过“可信AI”概念架构,但公开资料未见以“nDCG链云”命名的成熟商业产品或收入占比数据。
  • 腾讯(腾讯云):TBaaS区块链服务与TI-ONE机器学习平台存在整合基础。腾讯云在金融、政务领域的客户群对可信评估有潜在需求。2024年公开披露的技术白皮书中提及“模型治理”但不特指排序评估。
  • 华为云:区块链引擎BCS与ModelArts结合,政企市场的国产化、可信化要求可能推动该方案在政府AI项目中的应用。2025年3月华为云官网发布的行业解决方案中,提及“可信AI评估框架”概念,未有具体nDCG产品的定价或销售数据

8.2 区块链技术与BaaS专业服务商

  • 趣链科技(未上市):聚焦联盟链底层平台,在金融、政务、司法存证领域有大量落地案例。2024年公开披露获新一轮战略融资,估值未公开。若可信AI评估需求增加,趣链作为底层技术服务商有望参与。
  • 零数科技(原能链科技)数秦科技等国内区块链服务商:均以存证、数据确权为主要业务方向,AI评估上链可纳入其产品拓展路径,但公开资料未见相关案例。

8.3 AI数据与标注服务商

  • 海天瑞声(688787):国内AI训练数据头部供应商,2024年年度报告披露开拓了“AI评测数据”业务方向。若链云nDCG测试集需要商业化高质量标注,海天瑞声可提供上游数据服务。
  • Scale AI(美国,未上市):据公开报道其2024年收入规模超数亿美元,客户包含OpenAI、Meta等。其评测服务若叠加区块链存证能力,可能成为差异化优势。但截至2025年末公开资料未见该公司区块链相关产品。

8.4 潜在的垂直领域方案整合商

  • 专注于MLOps(机器学习运维)和AI治理的创业公司,如国内部分AI中台服务商,可能将链云nDCG作为差异化功能嵌入产品。但截至2025年12月,公开资料未见任何公司将“链云nDCG”作为独立产品线对外销售或披露客户数量。

免责声明:以上为产业逻辑分析,所列公司并未正式背书或确认此类业务的存在与规模。具体业务进展以各公司官方公告及监管披露文件为准。


9 市场规模

9.1 方法说明

链云nDCG作为一个高度细分的交叉领域,目前无独立的第三方市场规模统计数据。以下采用分层估算方法:

  • 第一层:AI基础数据服务市场(测试集标注)
  • 第二层:MLOps/模型评估与管理市场
  • 第三层:BaaS/区块链存证市场中与AI评估相关的增量
  • 链云nDCG潜在市场:以上三层交叉部分

9.2 关联市场规模

AI基础数据服务

据IDC《中国AI基础数据服务市场报告》,2024年中国AI基础数据服务市场规模约XX亿元人民币(具体数值以IDC授权公开版本为准),年均增速约20%-25%。其中评测/测试数据集服务约占整体市场的5%-10%(行业经验估计,非IDC官方口径)。

MLOps与模型管理

MarketsandMarkets 2024年报告估算,全球MLOps市场规模2024年约51亿美元,预计2029年达到约212亿美元(CAGR约32.9%)。该市场包含模型训练、部署、监控、评估等环节,nDCG评估是模型评估的子模块。 中国MLOps市场据艾瑞咨询2024年估算约XX亿元(具体以报告原文为准),仍处于高速增长期。

区块链BaaS

据IDC《中国BaaS市场份额报告》(2024年发布,统计2023年数据),中国BaaS市场规模约XX亿元人民币。其中“存证/溯源”是最成熟的应用方向,AI评估上链属于该方向的细分延伸,目前占比很小,具体数字公开资料未见

9.3 链云nDCG的潜在市场推演(保守/乐观情景)

保守情景(仅考虑高合规需求行业)

  • 金融(银行、保险、证券)、政务AI项目、大型互联网平台的AI合规审计为其提供需求来源。
  • 假设中国受监管行业的AI模型评估审计的10%-20%采用链上存证,评估服务的客单价按每年10万-50万元/个模型计,中国金融业大型模型数量在数百个量级(据银保监会公开数据,全国性银行平均模型数量约在数十到百个量级之间),潜在年市场规模在亿元量级。

乐观情景(拓展至AI模型交易与跨国合规)

  • 若欧盟AI法案、中国AI监管政策推动独立审计成为强制性要求,企业间AI模型采购广泛采用链上存证作为性能凭证,全球市场可能达到数亿至十亿美元量级。
  • 上述推演存在大量假设,不代表任何未来市场规模的预测或保证。实际市场发展取决于政策落地力度、技术成本下降速度、行业标准化进展等多种不确定因素。

年份声明:本章节中所涉市调数据均基于2024年公开报告及2025年12月可获取的最新信息整理,具体年份已在文中标注。未标注数字为推演估计,仅供参考。


10 玩家对比

由于链云nDCG尚未成为一个独立的商用产品品类,以下对比主要从技术能力与潜在产品化方向展开。

10.1 综合云巨头对比

维度阿里云+蚂蚁链腾讯云+TBaaS华为云+BCSAWSAzure
AI平台PAI(国内市场领先)TI-ONEModelArtsSageMakerAzure ML
区块链服务蚂蚁链BaaS(国内市场份额领先)TBaaSBCS 2.0Managed BlockchainConfidential Ledger
隐私计算能力TEE+联邦学习(摩斯)联邦学习(Angel PowerFL)TEE+联邦学习Nitro Enclaves机密计算
链云集成度技术展示级技术展示级技术展示级未单独披露未单独披露
目标行业金融、政务、电商金融、政务、游戏政企、制造、矿山全球企业全球企业为主
公开的链云AI评估案例2024年云栖大会概念展示未披露2025年白皮书概念未披露未披露

关键发现:五家头部云厂商均具备链和云的基础能力,但没有一家将“nDCG链云评估”作为独立SKU产品化。目前均为技术组件储备和概念阶段。

10.2 专业区块链服务商对比

维度趣链科技零数科技数秦科技Consensys(全球)
核心产品联盟链平台数据共享/存证司法存证/数据确权Ethereum生态工具
存证领域经验丰富(司法、金融、政务)中等丰富(司法为主)丰富
AI结合探索2024年发布“AI+区块链”白皮书未单独披露未单独披露通过零知识证明探索
链云AI评估能力无公开产品

10.3 MLOps与AI治理工具对比

暂以nDCG排序评估为功能的MLOps平台进行对比:

工具/平台nDCG原生支持大规模分布式区块链存证适用场景
MLflow(开源)需自定义可扩展(Spark集成)不支持内部实验
Kubeflow需自定义原生K8s不支持内部流水线
阿里云PAI支持云原生分布式概念阶段企业级内部
AWS SageMaker支持(自定义指标)云原生不支持企业级
Domino Data Lab支持可扩展不支持金融/制药

结论:当前MLOps工具链普遍缺少区块链存证功能。链云nDCG如果要实现广泛商用,需要在现有MLOps平台上做功能扩展,或由独立的评估即服务(EaaS)平台承载。


11 风险

11.1 技术风险

智能合约漏洞风险

链云流程依赖智能合约定义评估触发、执行和验收逻辑。合约代码中的缺陷(如重入攻击、整数溢出、访问控制缺失)可能导致评估流程被绕过或伪造。对智能合约的第三方安全审计增加了项目成本和时间。

“预言机问题”

区块链本身无法直接感知链外的“评估是否真实完成”。需要预言机(Oracle)将云上评估完成信号传递至链上。如果预言机被攻破或作恶,可以伪造“已完成评估”的交易而实际评估并未发生或结果已被篡改。去中心化预言机网络(如Chainlink)可在一定程度上缓解,但会增加架构复杂度和成本。

大规模上链的性能瓶颈

公链TPS(交易每秒)有限。以太坊主网TPS约15-30,L2网络数百至数千TPS。如果需高频评估(如每日数百次)并在公链存证,可能遇到网络拥堵和高Gas费。联盟链TPS可达数千至上万,仍须考虑评估任务数量高于链承载能力的风险。

11.2 经济风险

成本收益比不理想

链云方案增加的成本包括:链存证Gas费/运维费、额外中间件开发费、TEE/隐私计算算力溢价、云上额外编排层开销。如果评估信任度的提升不能带来对应的商业价值(如更高的AI模型溢价、更多的订单、更低的合规处罚风险),则难以形成可持续的商业模式。

存证成本随规模线性增长

若每次评估都上链存证,存证成本将随评估次数和模型版本数量线性增长。在大模型频繁迭代(日更甚至小时更)的场景下,存证成本可能超过评估计算本身的花费。这要求实际部署中必须取舍上链频率与粒度,可能削弱“全程可审计”的核心价值主张。

11.3 合规与法律风险

与“被遗忘权”的冲突

中国《个人信息保护法》(2021年11月施行)第47条规定个人在特定情形下有权请求删除个人信息。欧盟GDPR第17条规定了“擦除权”(Right to erasure)。区块链的不可篡改特性与删除权存在结构性的矛盾。若评估数据中包含可关联到个人的信息(即便是哈希,在某些法律解释下也可能被视为个人信息),其永久存储可能引发合规争议。

数据跨境问题

若采用公链(节点分布于全球),评估相关哈希数据可能会同步至境外节点,在中国法律框架下可能触发《数据出境安全评估办法》的监管要求(若评估数据被认定为“重要数据”)。采用纯国内联盟链可规避此问题,但会牺牲公链的全球可验证性。

缺乏行业标准与法律认可

截至2025年末,链上存证的评估报告在司法和监管程序中是否具有等同于传统公证或第三方检验报告的证据效力,尚缺乏明确的法律定性和判例支撑。这削弱了“上链即可信”的商业说服力。

11.4 业务风险

“垃圾进、垃圾出”问题——区块链不能解决数据源头可信度

这是链云nDCG最核心的争议点。区块链保证了存入的内容不可篡改,但无法保证存入内容的“真实性”和“质量”。如果测试集存在标注偏差,或人为构造了“对自家模型有利的测试Query”,那么上链的高nDCG值只是“不可篡改的虚假满分”。这类行为的检测仍需要传统的社会工程审计、标注质量抽检等手段,区块链并未从根本上解决“评估作弊”问题。

供应商锁定风险

若采用某家云厂商的“链云一体化”方案,测试集格式、合约接口、评估流水线均可能与该厂商的专有技术栈深度绑定。后续迁移到其他方案将产生较高的转换成本。


12 误读纠偏

12.1 “区块链让nDCG评估完全可信”

纠偏:这是一个常见的过度宣传话术。区块链只能保证存证后数据不被篡改这一狭义的“可信”。评估的可信度还依赖于以下前提,而这些前提并未由区块链自动解决:

  • 测试集是否真实代表业务场景?
  • 标注质量是否足够高?标注一致性(Inter-annotator agreement)是否达标?
  • 评估计算代码是否存在错误或后门?
  • 上链的主体是否就是原评估发起方(身份认证问题)?

链云nDCG的“可信”是分层且受条件约束的,不应被描述为“绝对可信”。

12.2 “上链后评估结果无法删除,因此绝对可靠”

纠偏:不可删除≠真实可靠。不可删除仅意味着该条记录本身是完整历史的组成部分,但如果它是一条“诚实记录的虚假结果”,其不可删除性反而成为问题——一个错误的评估结果会永久留存在链上。需要区分“数据完整性”和“数据真实性”两个完全不同的概念。

12.3 “nDCG是万能的排序评估指标”

纠偏:nDCG聚焦于排序质量,但无法衡量的重要维度包括但不限于:

  • 新颖性与多样性:排序是否过度重复同类内容?
  • 公平性:排序是否对不同群体或内容创作者形成了系统性的偏见?
  • 用户满意度与商业转化:离线nDCG与在线商业指标(点击率、成交率、留存)的相关性并非总是强相关,存在“离线指标提升,在线指标持平甚至下降”的可能。
  • 延迟与性能:高nDCG可能以模型推理延迟增加为代价,在实际线上系统中会损害用户体验。

因此,nDCG应作为多维度评估体系中的一个组成部分,而非独立决策标准。

12.4 “链云nDCG已是一项成熟技术、可立即部署”

纠偏:如前所述,截至目前该方案仍在概念验证和试点阶段。公开资料未见有企业以商业产品形式规模化提供链云nDCG服务。将其描述为“即插即用”或“生产已验证”的产品,是偏离产业实际的。

12.5 “用了链云nDCG就是合规的”

纠偏:目前没有任何司法管辖区的法律法规明确将“区块链存证的nDCG评估”作为AI模型合规的满足条件。合规需要满足完整的法律法规条文,通常涵盖数据安全、模型安全、伦理审查等多个维度,链云nDCG最多仅能服务于其中的“可追溯性能记录”环节,远非合规的全部。


13 最新事件

13.1 2025年内重要进展(截至12月)

中国信通院启动“可信AI评估体系2.0”

  • 2025年9月,中国信通院在“2025可信AI大会”上发布《可信人工智能评估体系建设指南(2.0版)》,在模型评估基础上增加了对评估过程可追溯性的讨论段落,提及区块链作为一种“可选技术手段”。这标志着政策研究层面对“评估过程可信化”的关注上升。
  • 但该指南仍处于研究建议层级,未形成强制标准或认证细则

华为云BCS 2.0发布

  • 2025年3月,华为云发布区块链引擎BCS 2.0版本,新增对TEE环境下的数据存证支持,并在行业方案白皮书中提及“AI模型评估与存证”的潜在场景。尚未发布客单价或客户数

EU AI Act部分条款生效进入倒计时

  • 2025年2月起,欧盟AI法案的“不可接受风险”条款已正式适用,高风险AI系统的相关要求将于2026年8月起实施。届时,在欧盟市场部署的高风险AI系统需要具备技术文件留档、性能评估可追溯等能力。该法案是否会成为链云nDCG需求的结构性驱动力,目前在产业分析中仍存分歧。

AI评测成为独立赛道

  • 2025年内,国内多家创业公司获得融资以发展“AI模型评测”业务(例如某评测平台于2025年6月宣布完成新一轮融资,投资方含头部风投机构,融资金额未公开披露)。该赛道目前以LLM安全和对齐评测为主,排序质量的独立评测关注度相对较低,但产业基础设施在快速构建中。

13.2 2024年相关事件的回顾性影响

  • 2024年11月云栖大会:蚂蚁链+阿里云PAI联合展示了“数据可信流通与模型可信评估”的技术架构,提及排序指标上链的理念,引发行业对链云AI评估的关注。会议公开资料显示为概念验证(PoC)阶段。
  • 2024年7月世界人工智能大会(WAIC):多家区块链和AI企业以“AI审计”为主题进行讨论,但无具体nDCG上链产品的发布或演示

14 跟踪指标

要持续跟踪“链云nDCG”这一产业概念的落地进程,建议关注以下可观测信号:

14.1 政策与标准维度

  • 信通院“可信AI”认证体系中是否新增“评估过程可追溯”考核项:若有,则表明标准层面开始要求评估过程存证。
  • 金融监管机构模型风险管理指引的修订:会否明确提及区块链存证或其他不可篡改记录技术作为模型验证的推荐做法。
  • EU AI Act实施进展:2026年8月高风险AI系统条款的执法细则如何定义“技术文件留档”的形式要求,是否接受链上存证。

14.2 技术与产品维度

  • 头部云厂商的AI平台产品更新:阿里云PAI、华为云ModelArts、AWS SageMaker是否推出与区块链服务联动的“可信评估”功能模块。
  • MLOps社区/开源项目:MLflow、Kubeflow等项目是否出现区块链存证插件或集成方案的成熟版本。
  • 存证成本趋势:以太坊L2 Gas费、联盟链运维成本的变化,将直接影响链云nDCG的经济可行性。

14.3 商业落地维度

  • “评估即服务”初创公司
source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型