模型層 開放閱讀

檢索評測

Retrieval Evaluation

概念 ID
retrieval-evaluation
更新時間
2026-05-29
來源數量
待補

檢索評測(Retrieval Evaluation)

3 秒看懂

檢索評測 = 給檢索系統”打分”的標準化方法。核心問題:當用戶發出一條查詢(query),系統返回的文件列表有多”好”?衡量的是”找得準不準、排得對不對”。

一句話場景:搜尋引擎給你10條結果,第1條就是你要的 vs 翻到第5頁才找到——檢索評測就是量化這種體驗差異。

3 分鐘產業解釋

為什麼突然火了?

RAG(檢索增強生成)時代的核心瓶頸轉移:大型模型能力天花板不在生成,在檢索質量。

階段瓶頸檢索評測地位
傳統搜尋時代(2010s)排序演算法學術/工業標配,但關注度有限
向量檢索興起(2018-2022)嵌入模型選擇評測基準成為模型選型依據
RAG 時代(2023-)檢索質量決定生成質量成為核心基礎設施級能力

產業位置

使用者 Query → 檢索系統 → 文件列表 → LLM 生成回答

                【檢索評測】在這裡介入
                - 離線:評估模型/系統質量
                - 線上:A/B 測試、質量監控

核心價值:沒有評測,你不知道你的 RAG 系統是在”增強”還是在”投毒”。

15 分鐘專家深入

檢索評測的分層架構

┌─────────────────────────────────────────────────────────┐
│                    檢索評測體系                          │
├─────────────────────────────────────────────────────────┤
│  Level 3: 端到端 RAG 評測                               │
│  └─ Answer Relevance / Faithfulness / Correctness      │
├─────────────────────────────────────────────────────────┤
│  Level 2: 檢索質量指標                                  │
│  └─ NDCG@K / MAP / MRR / Recall@K / Precision@K       │
├─────────────────────────────────────────────────────────┤
│  Level 1: 表徵質量指標                                  │
│  └─ Hit Rate / MRR@K(向量檢索場景)                   │
├─────────────────────────────────────────────────────────┤
│  Level 0: 嵌入質量指標                                  │
│  └─ 語義相似度相關性 / 聚類質量                        │
└─────────────────────────────────────────────────────────┘

關鍵維度拆解

評測維度關注點典型場景
相關性(Relevance)返回文件與查詢的語義匹配度通用搜索
排序質量(Ranking)相關文件是否排在靠前位置推薦系統
覆蓋率(Coverage)返回結果是否涵蓋所有相關文件法律/學術檢索
多樣性(Diversity)結果是否避免冗餘商品搜尋
延遲-質量權衡損失多少質量換多少速度工業級部署

技術原理

核心指標詳解(機制 + 公式)

1. Precision@K 與 Recall@K

# 假設檢索結果列表長度 = K,相關文件總數 = R

Precision@K = (前K個結果中相關文件數) / K
# 衡量:返回結果的"純度"

Recall@K = (前K個結果中相關文件數) / R  
# 衡量:相關文件的"召回率"

# 典型取值:K = 1, 5, 10, 100

直覺:Precision 關注”準”,Recall 關注”全”,兩者通常此消彼長。

2. Average Precision (AP) 與 MAP

# AP = 對單條查詢,每個相關文件位置的 Precision 求平均

def AP(retrieved, relevant):
    precisions = []
    num_relevant = 0
    for i, doc in enumerate(retrieved):
        if doc in relevant:
            num_relevant += 1
            precisions.append(num_relevant / (i + 1))
    return sum(precisions) / len(relevant)

# MAP = 所有查詢的 AP 求平均
MAP = sum(AP_q for q in queries) / len(queries)

特點:同時考慮相關性和排序位置,對排序敏感。

3. Mean Reciprocal Rank (MRR)

# 只關心第一個相關結果的位置

def RR(retrieved, relevant):
    for i, doc in enumerate(retrieved):
        if doc in relevant:
            return 1 / (i + 1)
    return 0

# MRR = 所有查詢的 RR 求平均
MRR = sum(RR_q for q in queries) / len(queries)

適用場景:問答系統——使用者只需要一個正確答案。

4. NDCG@K(業界最常用)

# Normalized Discounted Cumulative Gain

def DCG(relevances, k):
    """relevances 是按排序位置的關聯度分級(如0,1,2,3)"""
    return sum(rel / log2(i + 2) for i, rel in enumerate(relevances[:k]))

def NDCG(retrieved_rels, ideal_rels, k):
    dcg = DCG(retrieved_rels, k)
    idcg = DCG(sorted(ideal_rels, reverse=True), k)
    return dcg / idcg if idcg > 0 else 0

為什麼流行

  • 支援分級關聯度(不是簡單的 0/1)
  • 對數折扣使 Top 位置權重更高
  • 歸一化到 [0,1],可跨查詢比較

評測流程架構

┌──────────────────────────────────────────────────────────────┐
│                      檢索評測 Pipeline                       │
├──────────────────────────────────────────────────────────────┤
│                                                              │
│   ┌─────────┐    ┌─────────┐    ┌─────────┐    ┌─────────┐  │
│   │ Queries │    │ 檢索系統 │    │ 結果列表 │    │ 指標計算 │  │
│   │   &     │───→│   或    │───→│   &     │───→│   &     │  │
│   │ Corpus  │    │ 模型    │    │ Ground  │    │ 統計    │  │
│   │         │    │         │    │ Truth   │    │         │  │
│   └─────────┘    └─────────┘    └─────────┘    └─────────┘  │
│                                          │                   │
│                                          ▼                   │
│                                   ┌─────────────┐            │
│                                   │   評測報告   │            │
│                                   │  + 分析洞察  │            │
│                                   └─────────────┘            │
└──────────────────────────────────────────────────────────────┘

Ground Truth 建置方法

方法成本質量規模典型應用
人工標註學術基準
Click-through 資料工業評測
LLM 輔助標註中高新興方法
合成數據預實驗

技術演進史

1960s-1990s: 經典 IR 時代
├─ Cranfield 範式確立:query + corpus + relevance judgments
├─ TREC 會議成立(1992),標準化評測推動領域發展
└─ 指標:Precision, Recall, MAP

2000s: 機器學習排序(Learning to Rank)
├─ LambdaMART 等排序學習方法興起
├─ NDCG 成為主流指標(支援分級相關性)
└─ TREC 擴充套件到多工:QA、法律、醫學...

2013-2018: 詞向量與深度學習
├─ Word2Vec → Doc2Vec → Sentence Embeddings
├─ 向量檢索興起,ANN 演算法發展(HNSW, IVF)
└─ 評測開始關注 embedding 質量

2018-2022: 預訓練模型革命
├─ BERT → Sentence-BERT → 開源 embedding 模型湧現
├─ MTEB(Massive Text Embedding Benchmark)建立(2022)
├─ BEIR:異構檢索基準(2021)
└─ MS MARCO 成為工業級標準資料集

2023-: RAG 時代
├─ 檢索質量 = RAG 質量的上限
├─ 評測從"文件級"擴充套件到"答案級"
├─ Context Relevance / Faithfulness 評測架構
└─ 評測與可觀測性結合:生產環境即時監控

技術路線對比

主流評測基準對比

基準全稱任務型別資料集數量評測維度更新頻率業界認可度
MTEBMassive Text Embedding Benchmark檢索+分類+聚類+STS+…50+ 資料集8 大任務活躍更新★★★★★
BEIRBenchmark for IR異構檢索18 資料集檢索專用較穩定★★★★☆
MS MARCOMicrosoft MAchine Reading COmprehension段落/文件排序大規模排序質量較穩定★★★★★
TRECText REtrieval Conference多工年度更新多維度年度★★★★★(學術)
Natural QuestionsNatural Questions開放域 QA中等QA 場景較穩定★★★★☆

評測工具對比

工具型別主要語言特點適用場景
BEIR / MTEB基準+程式碼Python標準化、可復現模型選型
RAGASRAG 評測架構PythonContext/Answer 聯合評測RAG 系統
TruLens可觀測性Python生產環境監控線上評測
Phoenix (Arize)可觀測性PythonTrace 級分析除錯診斷
DeepEval評測架構Python多維度 + CI 整合開發流程

上下游

上游依賴

┌────────────────────────────────────────────────────────────┐
│                        上游要素                            │
├────────────────────────────────────────────────────────────┤
│  資料層                                                    │
│  ├─ 評測資料集:queries, corpus, relevance judgments      │
│  ├─ 標註成本:人工標註通常 [$估算]/每條 query             │
│  └─ 資料質量:標註一致性直接影響評測可信度                │
├────────────────────────────────────────────────────────────┤
│  模型層                                                    │
│  ├─ Embedding 模型:被評測物件                            │
│  ├─ Reranker 模型:精排階段                              │
│  └─ LLM:用於 RAG 評測或輔助標註                         │
├────────────────────────────────────────────────────────────┤
│  基礎設施                                                  │
│  ├─ 向量資料庫:Milvus, Weaviate, Pinecone 等            │
│  ├─ ANN 引擎:FAISS, ScaNN, HNSW                         │
│  └─ 計算資源:大規模評測需要 GPU 叢集                     │
└────────────────────────────────────────────────────────────┘

下游應用

┌────────────────────────────────────────────────────────────┐
│                        下游價值                            │
├────────────────────────────────────────────────────────────┤
│  模型選型                                                  │
│  ├─ Embedding 模型對比排名                                │
│  └─ Reranker 效果評估                                    │
├────────────────────────────────────────────────────────────┤
│  系統最佳化                                                  │
│  ├─ 檢索策略調參(top-k, 閾值, 混合檢索權重)            │
│  ├─ Chunking 策略最佳化                                    │
│  └─ RAG Pipeline 端到端最佳化                               │
├────────────────────────────────────────────────────────────┤
│  質量監控                                                  │
│  ├─ 生產環境檢索質量追蹤                                  │
│  ├─ 迴歸檢測:模型更新後質量是否下降                      │
│  └─ 異常告警                                              │
├────────────────────────────────────────────────────────────┤
│  商業決策                                                  │
│  ├─ 採購決策:哪個向量資料庫/模型適合我?                 │
│  └─ 投資決策:哪些模型廠商技術領先?                      │
└────────────────────────────────────────────────────────────┘

關鍵指標

檢索質量指標體系

指標全稱取值範圍關注點計算複雜度適用場景
Precision@K-[0,1]前 K 個結果的準確率O(K)通用
Recall@K-[0,1]前 K 個結果的覆蓋率O(K)高召回場景
MAPMean Average Precision[0,1]排序質量綜合O(N)學術評測
MRRMean Reciprocal Rank[0,1]第一個正確結果的位置O(N)QA 場景
NDCG@KNormalized DCG[0,1]分級相關性 + 位置權重O(K log K)業界首選
Hit Rate@K-[0,1]前 K 個是否有正確結果O(K)向量檢索

RAG 評測擴充套件指標

指標衡量內容評測方法
Context Relevance檢索內容與問題的相關性LLM 評估 / 規則
Faithfulness生成答案是否忠實於檢索內容LLM 評估
Answer Relevance生成答案與問題的相關性LLM 評估 / 人工
Context Recall是否檢索到足夠資訊需要 ground truth

工業級評測考量

評測質量 ≠ 評測可信度

可信度受以下因素影響:
├─ Ground Truth 質量:標註一致性、標註者偏差
├─ 資料集覆蓋度:是否覆蓋目標場景
├─ 統計顯著性:查詢數量是否足夠
├─ 場景匹配度:基準資料集 ≠ 你的業務資料
└─ 多維度綜合:單一指標可能誤導

供需與市場資料

市場定位

檢索評測處於 AI 基礎設施棧的”工具層”,市場體量難以單獨估算,但與以下市場高度相關:

關聯市場估算規模檢索評測的角色
向量資料庫市場[行業報告估算: 2025年$1-2B]核心配套工具
RAG 工具鏈市場[快速增長,規模待定義]質量保障環節
MLOps/LLMOps 市場[行業報告估算: 2025年$5-10B]評測子模組
AI 模型評估市場[新興,規模待定義]檢索維度評測

供給方分類

型別代表商業模式
開源基準MTEB, BEIR, TREC學術驅動,免費
評測 SaaSArize, WhyLabs訂閱制
模型廠商自建OpenAI, Cohere, Jina用於自身模型評測
諮詢/整合各類 AI 諮詢公司專案制

需求方畫像

需求方痛點評測需求
RAG 應用開發者不知道檢索質量如何快速評測 + 持續監控
模型廠商需要證明模型效果標準基準 + 排行榜
企業採購方選型困難對比評測 + 場景驗證
投資機構技術盡調能力評估架構

代表公司與資本對映

評測工具/平台廠商

公司/專案產品融資狀態特點
Arize AIPhoenix, Arize Platform[估算] 已融資數輪可觀測性 + 評測一體化
WhyLabswhylogs, LangKit[估算] 已融資資料/模型監控
RAGAS開源架構開源專案RAG 專用評測
Confident AIDeepEval[估算] 早期CI/CD 整合評測
Humanloop評測平台[估算] 已融資Prompt 管理 + 評測

評測基準/學術機構

組織貢獻影響力
MicrosoftMS MARCO, BEIR工業級標準
MTEB 團隊 (HuggingFace 生態)MTEB Leaderboard模型選型標準
NISTTREC 系列學術權威
各大學 IR 實驗室演算法 + 理論基礎研究

模型廠商的評測生態

廠商評測相關投入意圖
OpenAI內部評測體系模型質量保障
CohereEmbedding 排行榜證明模型能力
Jina AIMTEB 參與 + 自有基準開源影響力
Voyage AI學術合作評測技術可信度
BAAI (智源)C-MTEB (中文)中文生態建設

投資邏輯

核心投資主題

主題一:RAG 質量保障 = 剛需基礎設施

邏輯鏈:
RAG 應用爆發 → 檢索質量決定應用質量 → 評測成為必需品

                               評測工具/平台市場形成

主題二:可觀測性從 MLOps 延伸到 LLMOps

傳統 APM(應用效能監控)→ MLOps 監控 → LLM/RAG 可觀測性 檢索評測是 RAG 可觀測性的核心子模組。

主題三:評測即壁壘

誰掌握了評測標準和資料,誰就有話語權(類似 MLPerf 在硬體領域的地位)。

投資機會分層

層級機會型別風險代表標的
L1 基準/標準掌控評測話語權難商業化學術主導
L2 工具/平台評測 SaaS競爭激烈Arize, WhyLabs
L3 嵌入模型評測驅動選型技術迭代快Cohere, Voyage, Jina
L4 應用層垂直場景 RAG場景依賴各類 AI 應用公司

關鍵觀察點

  • MTEB 排行榜排名:已成為模型選型的事實標準,關注排名變化
  • RAG 工具鏈整合:評測是否被 LangChain/LlamaIndex 等架構原生整合
  • 企業採購行為:評測是否進入 RFP(招標書)標準條款

常見誤讀糾偏

誤讀一:MTEB 排名高 = 模型適合我的場景

糾偏

因素MTEB 排行榜你的業務場景
資料分佈通用基準資料特定領域資料
語言英文為主可能是中文/多語言
查詢型別標準化真實使用者查詢(口語化、拼寫錯誤…)
評測指標綜合平均你關心的特定指標

正確做法

  1. MTEB 作為初篩(Top-N 候選)
  2. 在自己業務資料上做領域評測
  3. 關注與場景匹配的子任務指標,而非總分

誤讀二:檢索評測只看 Recall,夠召回就行

糾偏

高 Recall + 低 Precision = 大量噪音進入 LLM

後果:
├─ 上下文視窗被無關內容佔用 → 有用資訊被擠出
├─ LLM 被噪音干擾 → 生成質量下降
├─ Token 成本上升 → 經濟性惡化
└─ 延遲增加 → 使用者體驗下降

正確思路:Precision 和 Recall 的權衡取決於場景
├─ 醫療/法律:寧可多召回,不能漏(高 Recall 優先)
├─ 客服/FAQ:精準比全面重要(高 Precision 優先)
└─ 通用搜索:NDCG 等綜合指標

誤讀三:離線評測好 = 線上效果好

糾偏

維度離線評測線上效果
資料基準資料集真實使用者行為
反饋標註的 relevance點選、停留、轉化
覆蓋固定查詢集長尾查詢分佈
變化靜態使用者行為漂移

實踐建議

  • 離線評測用於模型選型和版本回歸
  • 線上評測用於實際效果驗證
  • 兩者互補,不可替代

誤讀四:評測一次就夠了

糾偏

需要持續評測的場景:

  • 模型版本更新(embedding 模型、reranker)
  • 檢索策略變更(chunk 策略、混合檢索權重)
  • 資料分佈變化(新增文件、使用者查詢模式變化)
  • 基礎設施變更(向量資料庫升級、索引重建)

最佳實踐:建立 CI/CD 級別的自動化評測流水線。


學習路徑

入門階段(1-2 周)

目標:理解基本概念和指標

學習內容:
├─ 1. 資訊檢索基礎概念
│   └─ 推薦:MIT 6.207/14.15 網路科學 or Stanford CS276
├─ 2. 經典指標理解
│   └─ Precision, Recall, MAP, MRR, NDCG 手動計算
├─ 3. 動手實踐
│   └─ 用 MTEB 評測一個開源 embedding 模型
└─ 閱讀:
    ├─ MTEB 論文(2022)
    └─ BEIR 論文(2021)

進階階段(2-4 周)

目標:掌握 RAG 評測和工具鏈

學習內容:
├─ 1. RAG 評測架構
│   └─ RAGAS / DeepEval / TruLens 官方教程
├─ 2. 評測 Pipeline 搭建
│   └─ 自動化評測 + 報告生成
├─ 3. 場景化評測設計
│   └─ 如何建置自己的評測資料集
└─ 實踐:
    ├─ 搭建一個完整的 RAG 評測 Pipeline
    └─ 對比 3+ 個 embedding 模型在特定場景的表現

專家階段(持續)

目標:評測體系設計 + 前沿追蹤

學習內容:
├─ 1. 評測方法論
│   ├─ 統計顯著性檢驗
│   ├─ 標註質量控制
│   └─ 多評測者一致性
├─ 2. 前沿方向
│   ├─ LLM-as-Judge(用 LLM 做評測)
│   ├─ 合成評測資料
│   └─ 自適應評測
└─ 參與:
    ├─ TREC 評測任務
    └─ 開源評測架構貢獻

推薦資源清單

型別資源說明
論文MTEB (2022)必讀,理解評測體系設計
論文BEIR (2021)異構檢索基準
論文MS MARCO (2016/2018)工業級資料集設計
程式碼MTEB GitHub動手實踐
程式碼RAGAS GitHubRAG 評測架構
課程Stanford CS276資訊檢索經典課程
部落格各模型廠商技術部落格最新評測實踐

一句話總結

檢索評測是 RAG 時代的”質檢員”——它不生產價值,但決定了你能否信任你的系統產出的價值。在”檢索質量 = 生成質量上限”的範式下,評測從可選項變成了必選項。


延伸閱讀與來源

核心論文

| 論文 | 年份 | 貢獻

source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型