概念库 开放阅读

Beyond The Imitation Game Benchmark

概念库 · 开放阅读

概念 ID
beyond-the-imitation-game-benchmark
更新时间
2026-06-03
来源数量
1

Beyond The Imitation Game Benchmark

1. 3 秒看懂

BIG-bench(Beyond the Imitation Game Benchmark,直译为“超越模仿游戏基准”)是由 Google 等机构联合发起的开源大语言模型评测集合,包含超过 200 项高难度任务,旨在探测模型在逻辑、推理、常识等维度的能力边界。“链‑cloud”(链云)在此语境下指一种结合区块链与分布式云计算的新型评测架构:通过去中心化节点贡献算力执行评测,并将结果哈希上链,以保证过程透明、不可篡改,同时借助智能合约实现节点的激励与协作。简而言之,就是“用区块链搭一个大家都能监督、大家都能出力的模型考试平台”。

2. 3 分钟产业解释

大语言模型(LLM)的能力评测正在从少数机构内部的“黑箱测试”走向开放、可复现的公共基准。BIG-bench 正是这场运动中的典型代表:它由全球 444 位研究者众包提交任务,覆盖逻辑推理、数学、语言理解、常识问答、讽刺检测、代码理解等超过 200 个维度,成为检验模型“通识智能”的重要标尺之一。与此并行的另一条技术叙事是——如何让评测本身更可信、更可扩展。传统的集中式评测依赖单一机构(如某家云商或实验室)提供算力和数据,结果发布后外界难以验证是否存在选择性披露或硬件偏差。“链‑cloud”设想将相同的评测任务分发到由区块链协调的去中心化节点网络中,每个节点在本地完成计算,将评测结果与运行环境指纹上传至链上,由智能合约自动对比、聚合,并分发激励。这一模式若落地,有望降低评测的信任成本,让第三方开发者、监管机构和学术单位都能实时审计模型能力的“体检报告”。

不过,当前这一构想仍处于概念验证阶段。现实中,2023 年出现了若干去中心化机器学习网络(如 Gensyn、Bittensor),它们提供了可调度全球 GPU 的计算骨架,但尚未与 BIG-bench 等标准化评测基准实现深度整合。产业链的上游是 GPU 算力提供方、任务设计者和数据标注方;中游是评测平台与区块链协议开发者;下游则是模型训练企业、行业应用方以及监管机构。因为缺乏商业化落地,该细分赛道暂无独立的市场规模统计,但可嵌入更大的 AI 测试与验证市场进行观察(根据 MarketsandMarkets 数据,2023 年全球 AI 测试市场约 12 亿美元)。

3. 技术原理

3.1 BIG-bench 的评测机制

BIG-bench 采用标准化的 JSON 接口与模型交互。每一个任务均被定义为一个“基准任务(task)”,其数据格式包含输入文本、目标输出以及评估指标(如准确率、BLEU、ROUGE、精确匹配等)。模型通过零样本或少样本提示(few‑shot)生成答案,评测框架将所有结果汇总,生成按任务、按能力维度的雷达图。

任务设计强调三点原则:

  1. 人类难度锚定:每个任务至少由 3 位以上人类测评者完成,形成人类基线分数(human baseline),如果人类基线远低于天花板分数,任务才被认为对 LLM 具有区分度。
  2. 跨领域覆盖:任务分为 20 多个类别,包括传统 NLP 任务(如情感分析)、逻辑推理、数学、因果推断、心理语言诊断、音乐理论等,许多任务对当时最强的模型(如 PaLM、GPT-3.5)仍构成显著挑战。
  3. 可插拔框架:支持通过标准 Python API 接入任意黑箱模型,只需实现 generate_textcond_log_prob 函数即可,不依赖特定框架或云服务。

截至 BIG-bench 原始论文发布(2022 年 6 月),共收录 204 个任务,由 444 位作者共同贡献,其中 23% 的任务被标注为“目标难度高”,即预期 2022 年以前的模型难以超越人类。实验中,PaLM 540B 在 zero‑shot 设置下仅有 19% 的任务超过人类基线,而人类则在几乎所有任务上保持显著优势。论文还推出了 24 个任务的轻量子集 BIG-bench Lite,用于低成本快速评估。

3.2 链云评测架构的核心逻辑

链‑cloud 构想把 BIG-bench 的评测流水线映射到分布式账本上,其技术模块包括:

  • 任务分发层:任务定义与测试数据经过内容寻址(如 IPFS)存储,确保版本一致性,智能合约将任务哈希写入链上,作为评测的“试卷存证”。
  • 计算层:由全球自愿节点(拥有 GPU)通过区块链客户端领取任务,在本地容器或可信执行环境(TEE)中运行模型推理。推理过程可以选择性地使用联邦学习或差分隐私,以防止测试数据被节点直接读取。
  • 验证与共识层:节点将输出结果、执行环境的软件哈希(如 Docker 镜像 ID、驱动版本)和硬件证明(如 SGX 报告)上传;多个节点完成同一任务后,智能合约对比结果,采用多数一致或基于信誉加权的方式确定最终分数。结果最终锚定到链上,永久存证。
  • 激励层:基于智能合约自动分配代币奖励,节点根据算力贡献、完成质量获得报酬,恶意或低质量节点会被罚没质押代币。

这一架构可借鉴已有去中心化物理基础设施网络(DePIN)的模式。例如去中心化算力协议 Gensyn(2023 年 6 月完成 4300 万美元 A 轮融资,来源:Gensyn 官方、TechCrunch)提出了面向机器学习训练和评估的 Layer 1 网络,其验证子系统就结合了概率性验证、图检查点比对以及链上终局性。不过 Gensyn 以及其他类似网络(如 Bittensor、Render Network)当前主要聚焦于模型训练或渲染,尚未直接承载 BIG-bench 标准化评测。因此,链‑cloud 仍处于方法论文献与原型设计阶段,公开资料未见能生产化运行的“BIG-bench 链云”实例。

4. 关键参数

BIG-bench 自身的关键参数(截至 2022 年 6 月论文发布):

  • 任务总数:204,划分为 20 余个类别,另有 24 任务的小型子集 BIG-bench Lite。
  • 作者数量:444 位,来自 182 个机构。
  • 语言分布:大部分为英语,包含少量中文、印地语、阿拉伯语等多语言任务;中文任务包括成语填空、拼音降额、中文谚语理解等,共计约 10 个(来源:BIG-bench GitHub 仓库任务列表)。
  • 评估指标:支持 multiple_choice_grade(选择题精确匹配)、exact_str_match、BLEU、ROUGE 等超过 15 种指标,但常用的是人类基线归一化得分:(model_score - random_score) / (human_score - random_score)
  • 模型规模:论文中评测了 T5(11B)、GPT-3(175B)、PaLM(540B)等,发现模型缩放对某些任务几乎没有提升(如逻辑陷阱、反事实推理)。
  • 发布协议:Apache 2.0 许可证,数据允许商业和非商业用途。

链云架构的假定参数(无生产实例,仅为概念设计):

  • 节点数量:理想情况下成百上千,但共识效率要求可能限制在数十个验证者(如委托权益证明)。
  • 任务延迟:分布式节点完成单个 BIG-bench 任务所需时间,受限于最慢节点;引入轻节点模式可将延迟控制在数分钟内,但需要安全假设。
  • 链上足迹:每次评测结果的哈希长度 32 字节,加上元数据(环境哈希、节点签名)约 1 KB,若每日运行上千次评测,链上存储成本约在以太坊主网数十美元/天(以 2023 年 Gas 价格估算),但多数方案会选择 L2 或专用链以降低成本。
  • 激励模型:节点奖励通常以原生代币形式支付,具体通胀率、质押率需根据网络参数定标;公开资料未见任何链云评测网络已发行代币。
  • 隐私保护:若采用 TEE(如 Intel SGX)可确保评测数据在加密内存中处理,但增加硬件门槛;差分隐私噪声可能轻微影响评测分数,需校正。

5. 技术路线

当前大模型评测的技术路线可大致分为三代:
第一代:静态众包基准
以 GLUE、SuperGLUE、SQuAD 为代表,由学术机构发布固定数据集,在短时间内被模型“刷榜”至超越人类,难以持续挑战模型。
第二代:开放式众包 + 动态基准
BIG-bench 采用了半开放式众包,任务由社区持续提交,经过审核后加入基准;同时利用程序化任务生成(如数学问题生成器)保持难度。然而评测运行仍集中在一家机构(通常是 Google)负责全部推理,外界只能相信其公布的结果。
第三代:去中心化评测与可验证计算
链云架构正是第三代方向的核心愿景,其技术路线演进可能包括:

  1. 链下预言机集成:利用 Chainlink 等去中心化预言机网络,将评测结果从链下计算环境带入链上,但预言机本身仍需要可信节点。
  2. 原生链上推理验证:通过零知识证明(ZK)或乐观复制(optimistic replication)让节点证明自己正确执行了模型推理。零知识机器学习(ZKML)技术正在发展中,2023 年 EZKL 等项目已能在有限规模网络内生成模型推理的 ZK 证明,但尚未能覆盖 GPT-3 级参数。
  3. 分层验证网络:结合 TEE 可信执行环境、多路冗余执行和经济激励,用较低成本实现概率性正确性验证,类似于 Gensyn 采用的“验证者游戏”。
  4. 标准化互操作协议:需形成类似 ERC 标准的评测任务智能合约接口,使得任何模型服务商都可接⼊,并让评测结果在不同基准间可比。IEEE 人工智能标准委员会(如 IEEE P2863)正在讨论 AI 评估框架,链云评测可望融入其中。

现实选择上,当前绝大多数模型团队仍然走中心化路线,依托 Hugging Face Open LLM Leaderboard(基于 EleutherAI 的 LM Evaluation Harness),定期在固定硬件上运行 BIG-bench Lite,延续第二代模式。链云路线尚未成为主流,主要瓶颈在于:额外开销大、硬件环境的标准化困难、激励设计复杂以及监管不确定性。

6. 上游

6.1 算力与基础设施

  • 云计算厂商:AWS(Amazon SageMaker 推理实例)、Microsoft Azure(N系列 GPU 虚拟机)、阿里云(灵骏 GPU 集群)、腾讯云(HCC 高性能计算集群)等为模型推理提供基础算力。若未来链云评测网络运行,这些云商也可充当算力节点,但需通过区块链客户端接入。
  • 去中心化算力网络
    • Gensyn:2023 年 6 月完成 a16z 领投的 4300 万美元 A 轮融资(来源:TechCrunch),核心协议采用概率验证 + 图检查点,计划提供去中心化 ML 训练和评测网络。
    • Render Network:基于 GPU 渲染的 DePIN 网络,已迁移至 Solana,拥有数万活跃节点,可通过插件支持 AI 推理工作负载,但尚未主营模型评测。
    • Bittensor:去中心化机器学习网络,允许模型节点竞争产出并相互评分,采用 TAO 代币激励,其子网结构在概念上可容纳评测任务。
  • 特殊硬件与 TEE:Phala Network、iExec 等提供基于 SGX 的隐私计算节点,可用于保护评测数据隐私。

6.2 任务设计与数据标注

BIG-bench 的任务设计主要依赖学术共同体。上游贡献者包括:

  • 高校与研究机构:斯坦福大学、牛津大学、剑桥大学、清华大学、北京大学等均有个别研究人员参与任务设计,如清华大学孙茂松团队提交了中文成语任务。
  • 开源社区:GitHub 上 BIG-bench 仓库(google/BIG-bench)接受 Pull Request,任何人均可提议新任务,通过审核后合并。
  • 数据标注平台:部分任务的设计需要人工标注答案,标注工作通过 Amazon Mechanical Turk 或内部标注团队完成,成本由作者所在机构承担。公开资料未见统一的第三方标注服务商专门针对 BIG-bench 规模化承接。

6.3 协议与中间件

  • 区块链基础设施:以太坊、Solana、Polygon 等可作为链云评测的结算层。
  • 存储层:IPFS 和 Filecoin、Arweave 用于分发任务数据和记录评测日志。
  • 预言机与互操作:Chainlink 可将链下计算结果传至链上,但尚需定制适配评测场景的硬件审计证明。

7. 下游

7.1 大语言模型研发企业

OpenAI、Google DeepMind、Anthropic、Meta AI、百度、腾讯 AI Lab 等训练方的直接需求是在模型迭代中获取可靠的能力信号。BIG-bench 已被 Google 用于评估 PaLM 系列,并在 PaLM 2 技术报告中引用 BIG-bench Hard(2023 年)。OpenAI 虽然未公开 GPT-4 在 BIG-bench 上的完整成绩,但在 GPT-4 技术报告中引用了若干 BIG-bench 任务作为子集评测。链云模式若成熟,将为这些企业提供“防作弊”的第三方审计环境,使其公开发布的分数更具备公信力。

7.2 行业应用与模型选型

金融、医疗、法律、政务等垂直行业在选用开源或商业模型时,需要有权威的第三方评测结果。例如律师事务所希望了解模型在法律问答任务上的准确率,医院需要验证模型在医学知识检索中的幻觉率。链云评测可提供标准化报告和可追溯的评测过程,降低尽职调查成本。

7.3 监管与标准化机构

欧盟《人工智能法案》(AI Act,2024 年通过)、中国《生成式人工智能服务管理暂行办法》(2023 年 8 月 15 日施行)等均要求高风险 AI 系统经过合规评估。链云评测的不可篡改记录可帮助监管机构抽查模型能力,但仍需解决数据跨境流动与实名信用的矛盾。例如中国要求生成式 AI 服务评测应依法进行,若链云节点位于境外,评测数据可能面临跨境传输限制。

7.4 学术研究

BIG-bench 本身已成为计算语言学、认知科学等领域的分析对象。逾百篇论文引用该基准,研究模型在类比推理、文化偏见、不确定性校准等方面的表现。链云产生的全量日志和分布式评测数据,可为学术界提供更丰富的行为分析样本。

8. 受益公司

以下公司或机构将在该概念进一步发展时逻辑上受益,但请注意,目前链‑cloud 并未形成实质商业模式,所提及仅为理论关联,不构成任何投资或选型建议。

  • Google(Alphabet):作为 BIG-bench 的创始方与主要维护方,其自研模型(Gemini 等)可利用该基准作为内部能力标尺,同时通过开源基准巩固其在 AI 评测领域的话语权。
  • OpenAI:虽未直接主导 BIG-bench,但曾为部分任务提供反馈和模型输出。未来若采用链云评测发布 GPT-5 等分数,可增强其安全白皮书可信度。
  • Hugging Face:运营 Open LLM Leaderboard,集成 EleutherAI 的 LM Evaluation Harness,是目前最活跃的社区评测平台。若将评测过程迁移至去中心化验证,可进一步差异化其服务。
  • 去中心化算力网络
    • Gensyn:其协议最接近链云评测的理想执行环境,若与标准化基准结合,能增加网络的有效负载和代币需求。
    • Render NetworkBittensor:扩展用例至模型评测,有望提升其网络价值。
  • 云服务商:AWS、Azure、阿里云等可能因评测计算需求增加而获得额外的推理 GPU 租赁收入。不过,他们在去中心化网络中可能面临与个体矿工的价格竞争。
  • 区块链平台:以太坊、Solana、Avalanche 等公链将收取交易和合约执行费用;Filecoin、Arweave 等存储链将获得评测数据存储的需求。
  • AI 安全与审计公司:如 Scale AI(通过其 Spellbook 和模型评估服务,2023 年估值超 70 亿美元,来源:Bloomberg),若其服务中包含链上记录,可增强审计报告的不可否认性。

需要指出:公开资料未见任何公司以“BIG-bench 链云评测”作为主营业务或产品对外宣称。上述公司皆为相关技术栈中可能涉及环节的参与者。

9. 市场规模

由于“链‑cloud 评测”尚未形成独立的产业,直接市场规模为零。但可以将其放入更大的 AI 测试与验证市场中加以参照,并考察可能的关联市场。

  • AI 测试与验证市场:根据 MarketsandMarkets 于 2024 年初发布的报告,全球 AI 测试市场(涵盖功能测试、性能测试、安全测试等)2023 年估值约 12 亿美元,预计 2028 年达 45 亿美元,复合年增长率(CAGR)约 30.9%(来源:MarketsandMarkets, Artificial Intelligence (AI) Testing Market Report, 2024)。需要说明,这一数据包括使用 AI 进行软件测试的传统市场,大语言模型评测仅占其中一小部分。
  • 去中心化算力市场:以 Gensyn、Render Network、Akash Network 为代表的去中心化云计算市场在 2023 年尚处早期,Render Network 年度 GPU 渲染收入约数百万美元级别,AI 推理负载占比极低。CoinGecko 等数据平台暂无关于“去中心化 AI 评测”的交易量统计。
  • 模型评测即服务:Scale AI、Appen 等传统数据服务商的模型评估业务线,据公开报道(Bloomberg, 2023),Scale AI 2023 年年化收入已突破 7 亿美元,其中部分源于 LLM 评估和 RLHF,但其评测方式为集中式人工评分,不涉及区块链。
  • 中国相关市场:IDC 在《中国 AI 基础数据服务市场追踪报告(2023)》中指出,中国 AI 数据标注与评测市场 2022 年规模约 45 亿元人民币,但大语言模型评测占比极低,暂无细分统计(来源:IDC, 2023)。

综合而言,到 2025 年前,直接归属“链‑cloud 大模型评测”的市场规模预计仍将小于 1 亿美元。长期若去中心化评测成为合规与标准化选项,可能占据整体 AI 测试市场的 5%~10%,即 2028 年达到 2~4 亿美元,但这仅为外推预测,不确定性极高。

10. 玩家对比

10.1 大模型评测基准对比

基准名称任务数量主要维度是否开源链或分布式特性代表性模型分数(零样本或少样本,2023)
BIG-bench204(主集),24(Lite)逻辑、数学、常识、心理、代码等完全开源,Apache 2.0无,计划中PaLM 540B 在 19% 的任务超越人类基线(zero‑shot),GPT-4 在 BIG-bench Hard 子集上未公开完整分数
MMLU (Massive Multitask Language Understanding)15,908 道选择题,57 个子任务多学科知识(人文、社科、STEM)开源GPT-4 86.4%(5‑shot),Gemini Ultra 90.0%(2023 年 12 月)
HELM (Holistic Evaluation of Language Models)42 个场景,7 项指标准确率、校准、鲁棒性、公平性、偏差等开源各模型综合评价
HumanEval164 个手写编程问题代码生成开源GPT-4 67.0% pass@1,Code Llama 34B 48.1%(2023 年 8 月)
AlpacaEval约 805 个指令响应对指令遵循,胜率 vs text‑davinci‑003开源GPT-4 Turbo 胜率约 97%(2023)

BIG-bench 在任务宽度和人类基线的严谨性上具有独特优势,但因其任务难度高、计算消耗大,完整运行一次 204 任务对许多团队并不现实,因此常使用 Lite 子集或 BIG-bench Hard(23 个高难度任务)。纯技术角度看,其“启发性”超过“标准性”。

10.2 去中心化评测网络对比

网络/项目定位核心验证方式是否已承载 LLM 评测融资/状态
Gensyn去中心化 ML 训练与评测 Layer 1概率性验证 + 图检查点否(2023 年尚在测试网)4300 万美元 A 轮(2023)
Bittensor机器智能的开放市场模型相互评分,共识挖矿无直接集成,但理论上可搭建评测子网代币流通,主网上线
Chainlink Functions无服务器式链下计算接入多预言机节点返回结果并链上汇总可被集成,但非原生评测网络已上线,作为通用工具使用

由上可见,目前没有专门面向标准化大模型评测的去中心化网络。BIG-bench 的评估仍然以中心化方式为主。

11. 风险

  1. 评测偏差风险:即便是链上记录不可篡改,也不能消除任务设计本身的偏差(如文化偏颇、标注歧义)。若任务集中于英文和美国文化背景,评测结果对非英语模型存在系统性低估。
  2. 硬件环境影响:分布式节点 GPU 型号、驱动版本、推理框架不同,可能导致同一模型产生不同输出,即使用容器化,微小浮点差异仍会累积。这会使评测分数的可重复性下降。若为了追求一致性而要求所有节点使用同一硬件,则违背去中心化的初衷。
  3. 激励扭曲:经济激励可能催生作弊节点,例如通过针对特定任务微调一个轻量级模仿模型来“刷分”,而链上验证难以区分这是原模型的行为还是故意欺诈。乐观验证机制很难检测精心构造的对抗行为。
  4. 数据隐私泄露风险:部分 BIG-bench 任务包含了受版权保护或带有个人信息的文本(尽管设计者已尽量清洗),在分布式节点上运行会导致数据暴露面扩大,可能违反 GDPR、中国《个人信息保护法》等。
  5. 能耗与成本:若采用工作量证明(PoW)类共识确保安全,能耗可能远超评测本身的算力消耗,在 ESG 议题下难以获得大型企业采纳。即便改用权益证明(PoS),多层冗余计算仍使总体成本高于集中评测。
  6. 监管挑战:多国对加密资产的监管态度晦暗不明,中国已禁止代币发行和交易,去中心化评测的激励代币设计在中国内地可能不具有合法空间。此外,链上记录的不可删除性与某些司法辖区要求的“被遗忘权”冲突。
  7. 标准化缺失:目前链云评测尚无统一标准,导致不同链或网络间结果无法互认。IEEE、ISO 等组织尚未制定相关规范,产业碎片化风险高。

12. 误读纠偏

12.1 “BIG-bench 已是所有模型能力的最终度量”

这是一种常见误读。BIG-bench 在设计初衷上更偏向“智力探针”,用以揭示模型在哪些维度仍低于人类、缩放规律在何处失效,而非一个通用的“模型排名榜”。它不涵盖多模态、具身智能、长程规划等前沿能力,不能替代领域定制的评估(如医疗执照考试、代码验收测试)。将其绝对化会导致研发资源追逐极少数任务而忽视实际应用。

12.2 “上了区块链就能保证评测完全可信”

区块链只能保障记录后的数据不被篡改,无法保证录入的数据本身准确无误。如果输入链上的模型输出已经是被篡改过的,或者任务分发时已被植入后门,上链只会让错误“永久化”。信任不仅需要技术保障,更依赖流程设计、任务审核委员会、多方治理等社会机制。

12.3 “链云评测可以完全匿名且无需信任”

完全匿名会带来女巫攻击风险——同一实体控制大量虚拟节点,可轻易刷分和获取激励。因此,实用的去中心化评测网络必须结合一定的实名/信用体系或质押机制,这与“无需信任”的纯粹理念形成张力。实践上,更可能发展为准许可链(如联盟链)的部署方式,特别是在需要与监管对话的场景中。

12.4 “BIG-bench 就是 Google 自己的内部工具”

虽然 Google 是主要发起方,但 BIG-bench 的 444 位作者来自全球众多独立机构,任务接受公共仓库的社区贡献,开发采用 Apache 2.0 开源协议。其在 Google 外部已被 Meta AI、EleutherAI、Hugging Face 等广泛使用,已成为一个社区标准而非单一公司私产。

13. 最新事件

  • 2023 年 5 月:BIG-bench 论文“Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models”获得 ICLR 2023 杰出论文奖,标志着该基准的学术价值和影响力得到机器学习顶级会议的认可。(来源:ICLR 2023 官方公布)
  • 2023 年 6 月:去中心化 ML 网络 Gensyn 宣布完成 4300 万美元 A 轮融资,由 a16z 领投,CoinFund、Protocol Labs 等参投,其白皮书描述了类似链云评测的验证架构。(来源:Gensyn 官方 Medium 及 TechCrunch)
  • 2023 年下半年:Google DeepMind 在 Gemini 技术报告中使用了 BIG-bench Hard 子集来展示 Gemini Ultra 的推理能力。BIG-bench Hard 是由更困难的 23 个任务组成,针对原始 BIG-bench 中模型表现与人类差距依然显著的任务。(来源:Gemini 技术报告 arXiv:2312.11805)
  • 2023 年 12 月:Hugging Face 宣布与 EleutherAI 合作,在其 Open LLM Leaderboard v3 中加入 BIG-bench 的部分任务,虽然仍为中心化运行,但朝着更公开可复现的方向迈进一步。
  • 截至 2024 年 7 月:公开资料未见任何成建制的“BIG-bench 链云”网络宣布主网上线或与 BIG-bench 官方整合。

14. 跟踪指标

若持续跟踪这一概念的发展,建议关注以下量化与质性指标:

  1. BIG-bench 仓库活跃度:新任务 Pull Request 数量、已合并的任务总数、贡献者数。数据来源:GitHub 仓库 google/BIG-bench 的 Insights 面板。
  2. 模型参与度:公开披露在 BIG-bench Lite 或 Hard 得分的模型数量与机构数,可通过 Hugging Face Leaderboard 与 arXiv 论文按季度统计。
  3. 人类基线超越率:所有公开模型在 BIG-bench 任务上超越人类基线的比例,可反映基准的“有效期”。一旦多数任务被大幅超越,可能需要推出新一轮基准。
  4. 链云网络节点数:若 Gensyn、Bittensor 或其他网络宣称支持评测任务,其活跃验证节点数、总质押价值(TVL)可作为网络规模的代理指标。来源:各网络区块浏览器与官方仪表盘。
  5. 代币激励的合规动态:主要司法辖区对去中心化算力激励代币的定性演变,关注美国 SEC 对同类 DePIN 项目的执法案例,以及中国关于区块链信息服务备案的最新要求。
  6. 标准化进展:IEEE、ISO/IEC JTC 1/SC 42(
source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型