Beyond The Imitation Game Benchmark
1. 3 秒看懂
BIG-bench(Beyond the Imitation Game Benchmark,直譯為“超越模仿遊戲基準”)是由 Google 等機構聯合發起的開源大語言模型評測集合,包含超過 200 項高難度任務,旨在探測模型在邏輯、推論、常識等維度的能力邊界。“鏈‑cloud”(鏈雲端)在此語境下指一種結合區塊鏈與分散式雲端運算的新型評測架構:通過去中心化節點貢獻算力執行評測,並將結果雜湊上鍊,以保證過程透明、不可篡改,同時藉助智慧合約實現節點的激勵與協作。簡而言之,就是“用區塊鏈搭一個大家都能監督、大家都能出力的模型考試平台”。
2. 3 分鐘產業解釋
大語言模型(LLM)的能力評測正在從少數機構內部的“黑箱測試”走向開放、可復現的公共基準。BIG-bench 正是這場運動中的典型代表:它由全球 444 位研究者眾包提交任務,覆蓋邏輯推論、數學、語言理解、常識問答、諷刺檢測、程式碼理解等超過 200 個維度,成為檢驗模型“通識智慧”的重要標尺之一。與此並行的另一條技術敘事是——如何讓評測本身更可信、更可擴充套件。傳統的集中式評測依賴單一機構(如某家雲端商或實驗室)提供算力和資料,結果釋出後外界難以驗證是否存在選擇性揭露或硬體偏差。“鏈‑cloud”設想將相同的評測任務分發到由區塊鏈協調的去中心化節點網路中,每個節點在本地完成計算,將評測結果與執行環境指紋上傳至鏈上,由智慧合約自動對比、聚合,並分發激勵。這一模式若落地,有望降低評測的信任成本,讓第三方開發者、監管機構和學術單位都能即時審計模型能力的“體檢報告”。
不過,當前這一構想仍處於概念驗證階段。現實中,2023 年出現了若干去中心化機器學習網路(如 Gensyn、Bittensor),它們提供了可排程全球 GPU 的計算骨架,但尚未與 BIG-bench 等標準化評測基準實現深度整合。產業鏈的上游是 GPU 算力提供方、任務設計者和資料標註方;中游是評測平台與區塊鏈協議開發者;下游則是模型訓練企業、行業應用方以及監管機構。因為缺乏商業化落地,該細分賽道暫無獨立的市場規模統計,但可嵌入更大的 AI 測試與驗證市場進行觀察(根據 MarketsandMarkets 資料,2023 年全球 AI 測試市場約 12 億美元)。
3. 技術原理
3.1 BIG-bench 的評測機制
BIG-bench 採用標準化的 JSON 介面與模型互動。每一個任務均被定義為一個“基準任務(task)”,其資料格式包含輸入文本、目標輸出以及評估指標(如準確率、BLEU、ROUGE、精確匹配等)。模型通過零樣本或少樣本提示(few‑shot)生成答案,評測架構將所有結果彙總,生成按任務、按能力維度的雷達圖。
任務設計強調三點原則:
- 人類難度錨定:每個任務至少由 3 位以上人類測評者完成,形成人類基線分數(human baseline),如果人類基線遠低於天花板分數,任務才被認為對 LLM 具有區分度。
- 跨領域覆蓋:任務分為 20 多個類別,包括傳統 NLP 任務(如情感分析)、邏輯推論、數學、因果推斷、心理語言診斷、音樂理論等,許多工對當時最強的模型(如 PaLM、GPT-3.5)仍構成顯著挑戰。
- 可插拔架構:支援通過標準 Python API 接入任意黑箱模型,只需實現
generate_text或cond_log_prob函式即可,不依賴特定架構或雲端服務。
截至 BIG-bench 原始論文釋出(2022 年 6 月),共收錄 204 個任務,由 444 位作者共同貢獻,其中 23% 的任務被標註為“目標難度高”,即預期 2022 年以前的模型難以超越人類。實驗中,PaLM 540B 在 zero‑shot 設定下僅有 19% 的任務超過人類基線,而人類則在幾乎所有任務上保持顯著優勢。論文還推出了 24 個任務的輕量子集 BIG-bench Lite,用於低成本快速評估。
3.2 鏈雲端評測架構的核心邏輯
鏈‑cloud 構想把 BIG-bench 的評測流水線對映到分散式賬本上,其技術模組包括:
- 任務分發層:任務定義與測試資料經過內容定址(如 IPFS)儲存,確保版本一致性,智慧合約將任務雜湊寫入鏈上,作為評測的“試卷存證”。
- 計算層:由全球自願節點(擁有 GPU)通過區塊鏈客戶端領取任務,在本地容器或可信執行環境(TEE)中執行模型推論。推論過程可以選擇性地使用聯邦學習或差分隱私,以防止測試資料被節點直接讀取。
- 驗證與共識層:節點將輸出結果、執行環境的軟體雜湊(如 Docker 映象 ID、驅動版本)和硬體證明(如 SGX 報告)上傳;多個節點完成同一任務後,智慧合約對比結果,採用多數一致或基於信譽加權的方式確定最終分數。結果最終錨定到鏈上,永久存證。
- 激勵層:基於智慧合約自動分配代幣獎勵,節點根據算力貢獻、完成質量獲得報酬,惡意或低質量節點會被罰沒質押代幣。
這一架構可借鑑已有去中心化物理基礎設施網路(DePIN)的模式。例如去中心化算力協議 Gensyn(2023 年 6 月完成 4300 萬美元 A 輪融資,來源:Gensyn 官方、TechCrunch)提出了面向機器學習訓練和評估的 Layer 1 網路,其驗證子系統就結合了機率性驗證、圖檢查點比對以及鏈上終局性。不過 Gensyn 以及其他類似網路(如 Bittensor、Render Network)當前主要聚焦於模型訓練或渲染,尚未直接承載 BIG-bench 標準化評測。因此,鏈‑cloud 仍處於方法論文獻與原型設計階段,公開資料未見能生產化執行的“BIG-bench 鏈雲端”例項。
4. 關鍵引數
BIG-bench 自身的關鍵引數(截至 2022 年 6 月論文釋出):
- 任務總數:204,劃分為 20 餘個類別,另有 24 任務的小型子集 BIG-bench Lite。
- 作者數量:444 位,來自 182 個機構。
- 語言分佈:大部分為英語,包含少量中文、印地語、阿拉伯語等多語言任務;中文任務包括成語填空、拼音降額、中文諺語理解等,共計約 10 個(來源:BIG-bench GitHub 倉庫任務列表)。
- 評估指標:支援 multiple_choice_grade(選擇題精確匹配)、exact_str_match、BLEU、ROUGE 等超過 15 種指標,但常用的是人類基線歸一化得分:
(model_score - random_score) / (human_score - random_score)。 - 模型規模:論文中評測了 T5(11B)、GPT-3(175B)、PaLM(540B)等,發現模型縮放對某些任務幾乎沒有提升(如邏輯陷阱、反事實推論)。
- 釋出協議:Apache 2.0 許可證,資料允許商業和非商業用途。
鏈雲端架構的假定引數(無生產例項,僅為概念設計):
- 節點數量:理想情況下成百上千,但共識效率要求可能限制在數十個驗證者(如委託權益證明)。
- 任務延遲:分散式節點完成單個 BIG-bench 任務所需時間,受限於最慢節點;引入輕節點模式可將延遲控制在數分鐘內,但需要安全假設。
- 鏈上足跡:每次評測結果的雜湊長度 32 位元組,加上後設資料(環境雜湊、節點簽名)約 1 KB,若每日執行上千次評測,鏈上儲存成本約在以太坊主網數十美元/天(以 2023 年 Gas 價格估算),但多數方案會選擇 L2 或專用鏈以降低成本。
- 激勵模型:節點獎勵通常以原生代幣形式支付,具體通脹率、質押率需根據網路引數定標;公開資料未見任何鏈雲端評測網路已發行代幣。
- 隱私保護:若採用 TEE(如 Intel SGX)可確保評測資料在加密記憶體中處理,但增加硬體門檻;差分隱私噪聲可能輕微影響評測分數,需校正。
5. 技術路線
當前大型模型評測的技術路線可大致分為三代:
第一代:靜態眾包基準
以 GLUE、SuperGLUE、SQuAD 為代表,由學術機構釋出固定資料集,在短時間內被模型“刷榜”至超越人類,難以持續挑戰模型。
第二代:開放式眾包 + 動態基準
BIG-bench 採用了半開放式眾包,任務由社群持續提交,經過稽核後加入基準;同時利用程式化任務生成(如數學問題生成器)保持難度。然而評測執行仍集中在一家機構(通常是 Google)負責全部推論,外界只能相信其公佈的結果。
第三代:去中心化評測與可驗證計算
鏈雲端架構正是第三代方向的核心願景,其技術路線演進可能包括:
- 鏈下預言機整合:利用 Chainlink 等去中心化預言機網路,將評測結果從鏈下計算環境帶入鏈上,但預言機本身仍需要可信節點。
- 原生鏈上推論驗證:通過零知識證明(ZK)或樂觀複製(optimistic replication)讓節點證明自己正確執行了模型推論。零知識機器學習(ZKML)技術正在發展中,2023 年 EZKL 等專案已能在有限規模網路內生成模型推論的 ZK 證明,但尚未能覆蓋 GPT-3 級引數。
- 分層驗證網路:結合 TEE 可信執行環境、多路冗餘執行和經濟激勵,用較低成本實現機率性正確性驗證,類似於 Gensyn 採用的“驗證者遊戲”。
- 標準化互操作協議:需形成類似 ERC 標準的評測任務智慧合約介面,使得任何模型服務商都可接⼊,並讓評測結果在不同基準間可比。IEEE 人工智慧標準委員會(如 IEEE P2863)正在討論 AI 評估架構,鏈雲端評測可望融入其中。
現實選擇上,當前絕大多數模型團隊仍然走中心化路線,依託 Hugging Face Open LLM Leaderboard(基於 EleutherAI 的 LM Evaluation Harness),定期在固定硬體上執行 BIG-bench Lite,延續第二代模式。鏈雲端路線尚未成為主流,主要瓶頸在於:額外開銷大、硬體環境的標準化困難、激勵設計複雜以及監管不確定性。
6. 上游
6.1 算力與基礎設施
- 雲端運算廠商:AWS(Amazon SageMaker 推論例項)、Microsoft Azure(N系列 GPU 虛擬機器)、阿里雲端(靈駿 GPU 叢集)、騰訊雲端(HCC 高效能運算叢集)等為模型推論提供基礎算力。若未來鏈雲端評測網路執行,這些雲端商也可充當算力節點,但需通過區塊鏈客戶端接入。
- 去中心化算力網路:
- Gensyn:2023 年 6 月完成 a16z 領投的 4300 萬美元 A 輪融資(來源:TechCrunch),核心協議採用機率驗證 + 圖檢查點,計劃提供去中心化 ML 訓練和評測網路。
- Render Network:基於 GPU 渲染的 DePIN 網路,已遷移至 Solana,擁有數萬活躍節點,可通過外掛支援 AI 推論工作負載,但尚未主營模型評測。
- Bittensor:去中心化機器學習網路,允許模型節點競爭產出並相互評分,採用 TAO 代幣激勵,其子網結構在概念上可容納評測任務。
- 特殊硬體與 TEE:Phala Network、iExec 等提供基於 SGX 的隱私計算節點,可用於保護評測資料隱私。
6.2 任務設計與資料標註
BIG-bench 的任務設計主要依賴學術共同體。上游貢獻者包括:
- 高校與研究機構:斯坦福大學、牛津大學、劍橋大學、清華大學、北京大學等均有個別研究人員參與任務設計,如清華大學孫茂松團隊提交了中文成語任務。
- 開源社群:GitHub 上 BIG-bench 倉庫(google/BIG-bench)接受 Pull Request,任何人均可提議新任務,通過稽核後合併。
- 資料標註平台:部分任務的設計需要人工標註答案,標註工作通過 Amazon Mechanical Turk 或內部標註團隊完成,成本由作者所在機構承擔。公開資料未見統一的第三方標註服務商專門針對 BIG-bench 規模化承接。
6.3 協議與中介軟體
- 區塊鏈基礎設施:以太坊、Solana、Polygon 等可作為鏈雲端評測的結算層。
- 儲存層:IPFS 和 Filecoin、Arweave 用於分發任務資料和記錄評測日誌。
- 預言機與互操作:Chainlink 可將鏈下計算結果傳至鏈上,但尚需定製適配評測場景的硬體審計證明。
7. 下游
7.1 大語言模型研發企業
OpenAI、Google DeepMind、Anthropic、Meta AI、百度、騰訊 AI Lab 等訓練方的直接需求是在模型迭代中獲取可靠的能力訊號。BIG-bench 已被 Google 用於評估 PaLM 系列,並在 PaLM 2 技術報告中引用 BIG-bench Hard(2023 年)。OpenAI 雖然未公開 GPT-4 在 BIG-bench 上的完整成績,但在 GPT-4 技術報告中引用了若干 BIG-bench 任務作為子集評測。鏈雲端模式若成熟,將為這些企業提供“防作弊”的第三方審計環境,使其公開發布的分數更具備公信力。
7.2 行業應用與模型選型
金融、醫療、法律、政務等垂直行業在選用開源或商業模型時,需要有權威的第三方評測結果。例如律師事務所希望瞭解模型在法律問答任務上的準確率,醫院需要驗證模型在醫學知識檢索中的幻覺率。鏈雲端評測可提供標準化報告和可追溯的評測過程,降低盡職調查成本。
7.3 監管與標準化機構
歐盟《人工智慧法案》(AI Act,2024 年通過)、中國《生成式人工智慧服務管理暫行辦法》(2023 年 8 月 15 日施行)等均要求高風險 AI 系統經過合規評估。鏈雲端評測的不可篡改記錄可幫助監管機構抽查模型能力,但仍需解決資料跨境流動與實名信用的矛盾。例如中國要求生成式 AI 服務評測應依法進行,若鏈雲端節點位於境外,評測資料可能面臨跨境傳輸限制。
7.4 學術研究
BIG-bench 本身已成為計算語言學、認知科學等領域的分析物件。逾百篇論文引用該基準,研究模型在類比推論、文化偏見、不確定性校準等方面的表現。鏈雲端產生的全量日誌和分散式評測資料,可為學術界提供更豐富的行為分析樣本。
8. 受益公司
以下公司或機構將在該概念進一步發展時邏輯上受益,但請注意,目前鏈‑cloud 並未形成實質商業模式,所提及僅為理論關聯,不構成任何投資或選型建議。
- Google(Alphabet):作為 BIG-bench 的創始方與主要維護方,其自研模型(Gemini 等)可利用該基準作為內部能力標尺,同時通過開源基準鞏固其在 AI 評測領域的話語權。
- OpenAI:雖未直接主導 BIG-bench,但曾為部分任務提供反饋和模型輸出。未來若採用鏈雲端評測釋出 GPT-5 等分數,可增強其安全白皮書可信度。
- Hugging Face:運營 Open LLM Leaderboard,整合 EleutherAI 的 LM Evaluation Harness,是目前最活躍的社群評測平台。若將評測過程遷移至去中心化驗證,可進一步差異化其服務。
- 去中心化算力網路:
- Gensyn:其協議最接近鏈雲端評測的理想執行環境,若與標準化基準結合,能增加網路的有效負載和代幣需求。
- Render Network、Bittensor:擴充套件用例至模型評測,有望提升其網路價值。
- 雲端服務商:AWS、Azure、阿里雲端等可能因評測計算需求增加而獲得額外的推論 GPU 租賃營收。不過,他們在去中心化網路中可能面臨與個體礦工的價格競爭。
- 區塊鏈平台:以太坊、Solana、Avalanche 等公鏈將收取交易和合約執行費用;Filecoin、Arweave 等儲存鏈將獲得評測資料儲存的需求。
- AI 安全與審計公司:如 Scale AI(通過其 Spellbook 和模型評估服務,2023 年估值超 70 億美元,來源:Bloomberg),若其服務中包含鏈上記錄,可增強審計報告的不可否認性。
需要指出:公開資料未見任何公司以“BIG-bench 鏈雲端評測”作為主營業務或產品對外宣稱。上述公司皆為相關技術棧中可能涉及環節的參與者。
9. 市場規模
由於“鏈‑cloud 評測”尚未形成獨立的產業,直接市場規模為零。但可以將其放入更大的 AI 測試與驗證市場中加以參照,並考察可能的關聯市場。
- AI 測試與驗證市場:根據 MarketsandMarkets 於 2024 年初發布的報告,全球 AI 測試市場(涵蓋功能測試、效能測試、安全測試等)2023 年估值約 12 億美元,預計 2028 年達 45 億美元,複合年增長率(CAGR)約 30.9%(來源:MarketsandMarkets, Artificial Intelligence (AI) Testing Market Report, 2024)。需要說明,這一資料包括使用 AI 進行軟體測試的傳統市場,大語言模型評測僅佔其中一小部分。
- 去中心化算力市場:以 Gensyn、Render Network、Akash Network 為代表的去中心化雲端運算市場在 2023 年尚處早期,Render Network 年度 GPU 渲染營收約數百萬美元級別,AI 推論負載佔比極低。CoinGecko 等資料平台暫無關於“去中心化 AI 評測”的交易量統計。
- 模型評測即服務:Scale AI、Appen 等傳統資料服務商的模型評估業務線,據公開報道(Bloomberg, 2023),Scale AI 2023 年年化營收已突破 7 億美元,其中部分源於 LLM 評估和 RLHF,但其評測方式為集中式人工評分,不涉及區塊鏈。
- 中國相關市場:IDC 在《中國 AI 基礎資料服務市場追蹤報告(2023)》中指出,中國 AI 資料標註與評測市場 2022 年規模約 45 億元人民幣,但大語言模型評測佔比極低,暫無細分統計(來源:IDC, 2023)。
綜合而言,到 2025 年前,直接歸屬“鏈‑cloud 大型模型評測”的市場規模預計仍將小於 1 億美元。長期若去中心化評測成為合規與標準化選項,可能佔據整體 AI 測試市場的 5%~10%,即 2028 年達到 2~4 億美元,但這僅為外推預測,不確定性極高。
10. 玩家對比
10.1 大型模型評測基準對比
| 基準名稱 | 任務數量 | 主要維度 | 是否開源 | 鏈或分散式特性 | 代表性模型分數(零樣本或少樣本,2023) |
|---|---|---|---|---|---|
| BIG-bench | 204(主集),24(Lite) | 邏輯、數學、常識、心理、程式碼等 | 完全開源,Apache 2.0 | 無,計劃中 | PaLM 540B 在 19% 的任務超越人類基線(zero‑shot),GPT-4 在 BIG-bench Hard 子集上未公開完整分數 |
| MMLU (Massive Multitask Language Understanding) | 15,908 道選擇題,57 個子任務 | 多學科知識(人文、社科、STEM) | 開源 | 無 | GPT-4 86.4%(5‑shot),Gemini Ultra 90.0%(2023 年 12 月) |
| HELM (Holistic Evaluation of Language Models) | 42 個場景,7 項指標 | 準確率、校準、魯棒性、公平性、偏差等 | 開源 | 無 | 各模型綜合評價 |
| HumanEval | 164 個手寫程式設計問題 | 程式碼生成 | 開源 | 無 | GPT-4 67.0% pass@1,Code Llama 34B 48.1%(2023 年 8 月) |
| AlpacaEval | 約 805 個指令響應對 | 指令遵循,勝率 vs text‑davinci‑003 | 開源 | 無 | GPT-4 Turbo 勝率約 97%(2023) |
BIG-bench 在任務寬度和人類基線的嚴謹性上具有獨特優勢,但因其任務難度高、計算消耗大,完整執行一次 204 任務對許多團隊並不現實,因此常使用 Lite 子集或 BIG-bench Hard(23 個高難度任務)。純技術角度看,其“啟發性”超過“標準性”。
10.2 去中心化評測網路對比
| 網路/專案 | 定位 | 核心驗證方式 | 是否已承載 LLM 評測 | 融資/狀態 |
|---|---|---|---|---|
| Gensyn | 去中心化 ML 訓練與評測 Layer 1 | 機率性驗證 + 圖檢查點 | 否(2023 年尚在測試網) | 4300 萬美元 A 輪(2023) |
| Bittensor | 機器智慧的開放市場 | 模型相互評分,共識挖礦 | 無直接整合,但理論上可搭建評測子網 | 代幣流通,主網上線 |
| Chainlink Functions | 無伺服器式鏈下計算接入 | 多預言機節點返回結果並鏈上彙總 | 可被整合,但非原生評測網路 | 已上線,作為通用工具使用 |
由上可見,目前沒有專門面向標準化大型模型評測的去中心化網路。BIG-bench 的評估仍然以中心化方式為主。
11. 風險
- 評測偏差風險:即便是鏈上記錄不可篡改,也不能消除任務設計本身的偏差(如文化偏頗、標註歧義)。若任務集中於英文和美國文化背景,評測結果對非英語模型存在系統性低估。
- 硬體環境影響:分散式節點 GPU 型號、驅動版本、推論架構不同,可能導致同一模型產生不同輸出,即使用容器化,微小浮點差異仍會累積。這會使評測分數的可重複性下降。若為了追求一致性而要求所有節點使用同一硬體,則違背去中心化的初衷。
- 激勵扭曲:經濟激勵可能催生作弊節點,例如通過針對特定任務微調一個輕量級模仿模型來“刷分”,而鏈上驗證難以區分這是原模型的行為還是故意欺詐。樂觀驗證機制很難檢測精心構造的對抗行為。
- 資料隱私洩露風險:部分 BIG-bench 任務包含了受版權保護或帶有個人資訊的文本(儘管設計者已儘量清洗),在分散式節點上執行會導致資料暴露面擴大,可能違反 GDPR、中國《個人資訊保護法》等。
- 能耗與成本:若採用工作量證明(PoW)類共識確保安全,能耗可能遠超評測本身的算力消耗,在 ESG 議題下難以獲得大型企業採納。即便改用權益證明(PoS),多層冗餘計算仍使總體成本高於集中評測。
- 監管挑戰:多國對加密資產的監管態度晦暗不明,中國已禁止代幣發行和交易,去中心化評測的激勵代幣設計在中國內地可能不具有合法空間。此外,鏈上記錄的不可刪除性與某些司法轄區要求的“被遺忘權”衝突。
- 標準化缺失:目前鏈雲端評測尚無統一標準,導致不同鏈或網路間結果無法互認。IEEE、ISO 等組織尚未制定相關規範,產業碎片化風險高。
12. 誤讀糾偏
12.1 “BIG-bench 已是所有模型能力的最終度量”
這是一種常見誤讀。BIG-bench 在設計初衷上更偏向“智力探針”,用以揭示模型在哪些維度仍低於人類、縮放規律在何處失效,而非一個通用的“模型排名榜”。它不涵蓋多模態、具身智慧、長程規劃等前沿能力,不能替代領域定製的評估(如醫療執照考試、程式碼驗收測試)。將其絕對化會導致研發資源追逐極少數任務而忽視實際應用。
12.2 “上了區塊鏈就能保證評測完全可信”
區塊鏈只能保障記錄後的資料不被篡改,無法保證錄入的資料本身準確無誤。如果輸入鏈上的模型輸出已經是被篡改過的,或者任務分發時已被植入後門,上鍊只會讓錯誤“永久化”。信任不僅需要技術保障,更依賴流程設計、任務稽核委員會、多方治理等社會機制。
12.3 “鏈雲端評測可以完全匿名且無需信任”
完全匿名會帶來女巫攻擊風險——同一實體控制大量虛擬節點,可輕易刷分和獲取激勵。因此,實用的去中心化評測網路必須結合一定的實名/信用體系或質押機制,這與“無需信任”的純粹理念形成張力。實踐上,更可能發展為准許可鏈(如聯盟鏈)的部署方式,特別是在需要與監管對話的場景中。
12.4 “BIG-bench 就是 Google 自己的內部工具”
雖然 Google 是主要發起方,但 BIG-bench 的 444 位作者來自全球眾多獨立機構,任務接受公共倉庫的社群貢獻,開發採用 Apache 2.0 開源協議。其在 Google 外部已被 Meta AI、EleutherAI、Hugging Face 等廣泛使用,已成為一個社群標準而非單一公司私產。
13. 最新事件
- 2023 年 5 月:BIG-bench 論文“Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models”獲得 ICLR 2023 傑出論文獎,標誌著該基準的學術價值和影響力得到機器學習頂級會議的認可。(來源:ICLR 2023 官方公佈)
- 2023 年 6 月:去中心化 ML 網路 Gensyn 宣佈完成 4300 萬美元 A 輪融資,由 a16z 領投,CoinFund、Protocol Labs 等參投,其白皮書描述了類似鏈雲端評測的驗證架構。(來源:Gensyn 官方 Medium 及 TechCrunch)
- 2023 年下半年:Google DeepMind 在 Gemini 技術報告中使用了 BIG-bench Hard 子集來展示 Gemini Ultra 的推論能力。BIG-bench Hard 是由更困難的 23 個任務組成,針對原始 BIG-bench 中模型表現與人類差距依然顯著的任務。(來源:Gemini 技術報告 arXiv:2312.11805)
- 2023 年 12 月:Hugging Face 宣佈與 EleutherAI 合作,在其 Open LLM Leaderboard v3 中加入 BIG-bench 的部分任務,雖然仍為中心化執行,但朝著更公開可復現的方向邁進一步。
- 截至 2024 年 7 月:公開資料未見任何成建制的“BIG-bench 鏈雲端”網路宣佈主網上線或與 BIG-bench 官方整合。
14. 追蹤指標
若持續追蹤這一概念的發展,建議關注以下量化與質性指標:
- BIG-bench 倉庫活躍度:新任務 Pull Request 數量、已合併的任務總數、貢獻者數。資料來源:GitHub 倉庫 google/BIG-bench 的 Insights 面板。
- 模型參與度:公開揭露在 BIG-bench Lite 或 Hard 得分的模型數量與機構數,可通過 Hugging Face Leaderboard 與 arXiv 論文按季度統計。
- 人類基線超越率:所有公開模型在 BIG-bench 任務上超越人類基線的比例,可反映基準的“有效期”。一旦多數任務被大幅超越,可能需要推出新一輪基準。
- 鏈雲端網路節點數:若 Gensyn、Bittensor 或其他網路宣稱支援評測任務,其活躍驗證節點數、總質押價值(TVL)可作為網路規模的代理指標。來源:各網路區塊瀏覽器與官方儀表盤。
- 代幣激勵的合規動態:主要司法轄區對去中心化算力激勵代幣的定性演變,關注美國 SEC 對同類 DePIN 專案的執法案例,以及中國關於區塊鏈資訊服務備案的最新要求。
- 標準化進展:IEEE、ISO/IEC JTC 1/SC 42(