模型层 开放阅读

检索评测

Retrieval Evaluation

概念 ID
retrieval-evaluation
更新时间
2026-05-29
来源数量
待补

检索评测(Retrieval Evaluation)

3 秒看懂

检索评测 = 给检索系统”打分”的标准化方法。核心问题:当用户发出一条查询(query),系统返回的文档列表有多”好”?衡量的是”找得准不准、排得对不对”。

一句话场景:搜索引擎给你10条结果,第1条就是你要的 vs 翻到第5页才找到——检索评测就是量化这种体验差异。

3 分钟产业解释

为什么突然火了?

RAG(检索增强生成)时代的核心瓶颈转移:大模型能力天花板不在生成,在检索质量。

阶段瓶颈检索评测地位
传统搜索时代(2010s)排序算法学术/工业标配,但关注度有限
向量检索兴起(2018-2022)嵌入模型选择评测基准成为模型选型依据
RAG 时代(2023-)检索质量决定生成质量成为核心基础设施级能力

产业位置

用户 Query → 检索系统 → 文档列表 → LLM 生成回答
                      ↑
                【检索评测】在这里介入
                - 离线:评估模型/系统质量
                - 在线:A/B 测试、质量监控

核心价值:没有评测,你不知道你的 RAG 系统是在”增强”还是在”投毒”。

15 分钟专家深入

检索评测的分层框架

┌─────────────────────────────────────────────────────────┐
│                    检索评测体系                          │
├─────────────────────────────────────────────────────────┤
│  Level 3: 端到端 RAG 评测                               │
│  └─ Answer Relevance / Faithfulness / Correctness      │
├─────────────────────────────────────────────────────────┤
│  Level 2: 检索质量指标                                  │
│  └─ NDCG@K / MAP / MRR / Recall@K / Precision@K       │
├─────────────────────────────────────────────────────────┤
│  Level 1: 表征质量指标                                  │
│  └─ Hit Rate / MRR@K(向量检索场景)                   │
├─────────────────────────────────────────────────────────┤
│  Level 0: 嵌入质量指标                                  │
│  └─ 语义相似度相关性 / 聚类质量                        │
└─────────────────────────────────────────────────────────┘

关键维度拆解

评测维度关注点典型场景
相关性(Relevance)返回文档与查询的语义匹配度通用搜索
排序质量(Ranking)相关文档是否排在靠前位置推荐系统
覆盖率(Coverage)返回结果是否涵盖所有相关文档法律/学术检索
多样性(Diversity)结果是否避免冗余商品搜索
延迟-质量权衡损失多少质量换多少速度工业级部署

技术原理

核心指标详解(机制 + 公式)

1. Precision@K 与 Recall@K

# 假设检索结果列表长度 = K,相关文档总数 = R

Precision@K = (前K个结果中相关文档数) / K
# 衡量:返回结果的"纯度"

Recall@K = (前K个结果中相关文档数) / R  
# 衡量:相关文档的"召回率"

# 典型取值:K = 1, 5, 10, 100

直觉:Precision 关注”准”,Recall 关注”全”,两者通常此消彼长。

2. Average Precision (AP) 与 MAP

# AP = 对单条查询,每个相关文档位置的 Precision 求平均

def AP(retrieved, relevant):
    precisions = []
    num_relevant = 0
    for i, doc in enumerate(retrieved):
        if doc in relevant:
            num_relevant += 1
            precisions.append(num_relevant / (i + 1))
    return sum(precisions) / len(relevant)

# MAP = 所有查询的 AP 求平均
MAP = sum(AP_q for q in queries) / len(queries)

特点:同时考虑相关性和排序位置,对排序敏感。

3. Mean Reciprocal Rank (MRR)

# 只关心第一个相关结果的位置

def RR(retrieved, relevant):
    for i, doc in enumerate(retrieved):
        if doc in relevant:
            return 1 / (i + 1)
    return 0

# MRR = 所有查询的 RR 求平均
MRR = sum(RR_q for q in queries) / len(queries)

适用场景:问答系统——用户只需要一个正确答案。

4. NDCG@K(业界最常用)

# Normalized Discounted Cumulative Gain

def DCG(relevances, k):
    """relevances 是按排序位置的关联度分级(如0,1,2,3)"""
    return sum(rel / log2(i + 2) for i, rel in enumerate(relevances[:k]))

def NDCG(retrieved_rels, ideal_rels, k):
    dcg = DCG(retrieved_rels, k)
    idcg = DCG(sorted(ideal_rels, reverse=True), k)
    return dcg / idcg if idcg > 0 else 0

为什么流行

  • 支持分级关联度(不是简单的 0/1)
  • 对数折扣使 Top 位置权重更高
  • 归一化到 [0,1],可跨查询比较

评测流程架构

┌──────────────────────────────────────────────────────────────┐
│                      检索评测 Pipeline                       │
├──────────────────────────────────────────────────────────────┤
│                                                              │
│   ┌─────────┐    ┌─────────┐    ┌─────────┐    ┌─────────┐  │
│   │ Queries │    │ 检索系统 │    │ 结果列表 │    │ 指标计算 │  │
│   │   &     │───→│   或    │───→│   &     │───→│   &     │  │
│   │ Corpus  │    │ 模型    │    │ Ground  │    │ 统计    │  │
│   │         │    │         │    │ Truth   │    │         │  │
│   └─────────┘    └─────────┘    └─────────┘    └─────────┘  │
│                                          │                   │
│                                          ▼                   │
│                                   ┌─────────────┐            │
│                                   │   评测报告   │            │
│                                   │  + 分析洞察  │            │
│                                   └─────────────┘            │
└──────────────────────────────────────────────────────────────┘

Ground Truth 构建方法

方法成本质量规模典型应用
人工标注学术基准
Click-through 数据工业评测
LLM 辅助标注中高新兴方法
合成数据预实验

技术演进史

1960s-1990s: 经典 IR 时代
├─ Cranfield 范式确立:query + corpus + relevance judgments
├─ TREC 会议成立(1992),标准化评测推动领域发展
└─ 指标:Precision, Recall, MAP

2000s: 机器学习排序(Learning to Rank)
├─ LambdaMART 等排序学习方法兴起
├─ NDCG 成为主流指标(支持分级相关性)
└─ TREC 扩展到多任务:QA、法律、医学...

2013-2018: 词向量与深度学习
├─ Word2Vec → Doc2Vec → Sentence Embeddings
├─ 向量检索兴起,ANN 算法发展(HNSW, IVF)
└─ 评测开始关注 embedding 质量

2018-2022: 预训练模型革命
├─ BERT → Sentence-BERT → 开源 embedding 模型涌现
├─ MTEB(Massive Text Embedding Benchmark)建立(2022)
├─ BEIR:异构检索基准(2021)
└─ MS MARCO 成为工业级标准数据集

2023-: RAG 时代
├─ 检索质量 = RAG 质量的上限
├─ 评测从"文档级"扩展到"答案级"
├─ Context Relevance / Faithfulness 评测框架
└─ 评测与可观测性结合:生产环境实时监控

技术路线对比

主流评测基准对比

基准全称任务类型数据集数量评测维度更新频率业界认可度
MTEBMassive Text Embedding Benchmark检索+分类+聚类+STS+…50+ 数据集8 大任务活跃更新★★★★★
BEIRBenchmark for IR异构检索18 数据集检索专用较稳定★★★★☆
MS MARCOMicrosoft MAchine Reading COmprehension段落/文档排序大规模排序质量较稳定★★★★★
TRECText REtrieval Conference多任务年度更新多维度年度★★★★★(学术)
Natural QuestionsNatural Questions开放域 QA中等QA 场景较稳定★★★★☆

评测工具对比

工具类型主要语言特点适用场景
BEIR / MTEB基准+代码Python标准化、可复现模型选型
RAGASRAG 评测框架PythonContext/Answer 联合评测RAG 系统
TruLens可观测性Python生产环境监控在线评测
Phoenix (Arize)可观测性PythonTrace 级分析调试诊断
DeepEval评测框架Python多维度 + CI 集成开发流程

上下游

上游依赖

┌────────────────────────────────────────────────────────────┐
│                        上游要素                            │
├────────────────────────────────────────────────────────────┤
│  数据层                                                    │
│  ├─ 评测数据集:queries, corpus, relevance judgments      │
│  ├─ 标注成本:人工标注通常 [$估算]/每条 query             │
│  └─ 数据质量:标注一致性直接影响评测可信度                │
├────────────────────────────────────────────────────────────┤
│  模型层                                                    │
│  ├─ Embedding 模型:被评测对象                            │
│  ├─ Reranker 模型:精排阶段                              │
│  └─ LLM:用于 RAG 评测或辅助标注                         │
├────────────────────────────────────────────────────────────┤
│  基础设施                                                  │
│  ├─ 向量数据库:Milvus, Weaviate, Pinecone 等            │
│  ├─ ANN 引擎:FAISS, ScaNN, HNSW                         │
│  └─ 计算资源:大规模评测需要 GPU 集群                     │
└────────────────────────────────────────────────────────────┘

下游应用

┌────────────────────────────────────────────────────────────┐
│                        下游价值                            │
├────────────────────────────────────────────────────────────┤
│  模型选型                                                  │
│  ├─ Embedding 模型对比排名                                │
│  └─ Reranker 效果评估                                    │
├────────────────────────────────────────────────────────────┤
│  系统优化                                                  │
│  ├─ 检索策略调参(top-k, 阈值, 混合检索权重)            │
│  ├─ Chunking 策略优化                                    │
│  └─ RAG Pipeline 端到端优化                               │
├────────────────────────────────────────────────────────────┤
│  质量监控                                                  │
│  ├─ 生产环境检索质量追踪                                  │
│  ├─ 回归检测:模型更新后质量是否下降                      │
│  └─ 异常告警                                              │
├────────────────────────────────────────────────────────────┤
│  商业决策                                                  │
│  ├─ 采购决策:哪个向量数据库/模型适合我?                 │
│  └─ 投资决策:哪些模型厂商技术领先?                      │
└────────────────────────────────────────────────────────────┘

关键指标

检索质量指标体系

指标全称取值范围关注点计算复杂度适用场景
Precision@K-[0,1]前 K 个结果的准确率O(K)通用
Recall@K-[0,1]前 K 个结果的覆盖率O(K)高召回场景
MAPMean Average Precision[0,1]排序质量综合O(N)学术评测
MRRMean Reciprocal Rank[0,1]第一个正确结果的位置O(N)QA 场景
NDCG@KNormalized DCG[0,1]分级相关性 + 位置权重O(K log K)业界首选
Hit Rate@K-[0,1]前 K 个是否有正确结果O(K)向量检索

RAG 评测扩展指标

指标衡量内容评测方法
Context Relevance检索内容与问题的相关性LLM 评估 / 规则
Faithfulness生成答案是否忠实于检索内容LLM 评估
Answer Relevance生成答案与问题的相关性LLM 评估 / 人工
Context Recall是否检索到足够信息需要 ground truth

工业级评测考量

评测质量 ≠ 评测可信度

可信度受以下因素影响:
├─ Ground Truth 质量:标注一致性、标注者偏差
├─ 数据集覆盖度:是否覆盖目标场景
├─ 统计显著性:查询数量是否足够
├─ 场景匹配度:基准数据集 ≠ 你的业务数据
└─ 多维度综合:单一指标可能误导

供需与市场数据

市场定位

检索评测处于 AI 基础设施栈的”工具层”,市场体量难以单独估算,但与以下市场高度相关:

关联市场估算规模检索评测的角色
向量数据库市场[行业报告估算: 2025年$1-2B]核心配套工具
RAG 工具链市场[快速增长,规模待定义]质量保障环节
MLOps/LLMOps 市场[行业报告估算: 2025年$5-10B]评测子模块
AI 模型评估市场[新兴,规模待定义]检索维度评测

供给方分类

类型代表商业模式
开源基准MTEB, BEIR, TREC学术驱动,免费
评测 SaaSArize, WhyLabs订阅制
模型厂商自建OpenAI, Cohere, Jina用于自身模型评测
咨询/集成各类 AI 咨询公司项目制

需求方画像

需求方痛点评测需求
RAG 应用开发者不知道检索质量如何快速评测 + 持续监控
模型厂商需要证明模型效果标准基准 + 排行榜
企业采购方选型困难对比评测 + 场景验证
投资机构技术尽调能力评估框架

代表公司与资本映射

评测工具/平台厂商

公司/项目产品融资状态特点
Arize AIPhoenix, Arize Platform[估算] 已融资数轮可观测性 + 评测一体化
WhyLabswhylogs, LangKit[估算] 已融资数据/模型监控
RAGAS开源框架开源项目RAG 专用评测
Confident AIDeepEval[估算] 早期CI/CD 集成评测
Humanloop评测平台[估算] 已融资Prompt 管理 + 评测

评测基准/学术机构

组织贡献影响力
MicrosoftMS MARCO, BEIR工业级标准
MTEB 团队 (HuggingFace 生态)MTEB Leaderboard模型选型标准
NISTTREC 系列学术权威
各大学 IR 实验室算法 + 理论基础研究

模型厂商的评测生态

厂商评测相关投入意图
OpenAI内部评测体系模型质量保障
CohereEmbedding 榜单证明模型能力
Jina AIMTEB 参与 + 自有基准开源影响力
Voyage AI学术合作评测技术可信度
BAAI (智源)C-MTEB (中文)中文生态建设

投资逻辑

核心投资主题

主题一:RAG 质量保障 = 刚需基础设施

逻辑链:
RAG 应用爆发 → 检索质量决定应用质量 → 评测成为必需品
                                         ↓
                               评测工具/平台市场形成

主题二:可观测性从 MLOps 延伸到 LLMOps

传统 APM(应用性能监控)→ MLOps 监控 → LLM/RAG 可观测性 检索评测是 RAG 可观测性的核心子模块。

主题三:评测即壁垒

谁掌握了评测标准和数据,谁就有话语权(类似 MLPerf 在硬件领域的地位)。

投资机会分层

层级机会类型风险代表标的
L1 基准/标准掌控评测话语权难商业化学术主导
L2 工具/平台评测 SaaS竞争激烈Arize, WhyLabs
L3 嵌入模型评测驱动选型技术迭代快Cohere, Voyage, Jina
L4 应用层垂直场景 RAG场景依赖各类 AI 应用公司

关键观察点

  • MTEB 榜单排名:已成为模型选型的事实标准,关注排名变化
  • RAG 工具链整合:评测是否被 LangChain/LlamaIndex 等框架原生集成
  • 企业采购行为:评测是否进入 RFP(招标书)标准条款

常见误读纠偏

误读一:MTEB 排名高 = 模型适合我的场景

纠偏

因素MTEB 榜单你的业务场景
数据分布通用基准数据特定领域数据
语言英文为主可能是中文/多语言
查询类型标准化真实用户查询(口语化、拼写错误…)
评测指标综合平均你关心的特定指标

正确做法

  1. MTEB 作为初筛(Top-N 候选)
  2. 在自己业务数据上做领域评测
  3. 关注与场景匹配的子任务指标,而非总分

误读二:检索评测只看 Recall,够召回就行

纠偏

高 Recall + 低 Precision = 大量噪音进入 LLM

后果:
├─ 上下文窗口被无关内容占用 → 有用信息被挤出
├─ LLM 被噪音干扰 → 生成质量下降
├─ Token 成本上升 → 经济性恶化
└─ 延迟增加 → 用户体验下降

正确思路:Precision 和 Recall 的权衡取决于场景
├─ 医疗/法律:宁可多召回,不能漏(高 Recall 优先)
├─ 客服/FAQ:精准比全面重要(高 Precision 优先)
└─ 通用搜索:NDCG 等综合指标

误读三:离线评测好 = 在线效果好

纠偏

维度离线评测在线效果
数据基准数据集真实用户行为
反馈标注的 relevance点击、停留、转化
覆盖固定查询集长尾查询分布
变化静态用户行为漂移

实践建议

  • 离线评测用于模型选型和版本回归
  • 在线评测用于实际效果验证
  • 两者互补,不可替代

误读四:评测一次就够了

纠偏

需要持续评测的场景:

  • 模型版本更新(embedding 模型、reranker)
  • 检索策略变更(chunk 策略、混合检索权重)
  • 数据分布变化(新增文档、用户查询模式变化)
  • 基础设施变更(向量数据库升级、索引重建)

最佳实践:建立 CI/CD 级别的自动化评测流水线。


学习路径

入门阶段(1-2 周)

目标:理解基本概念和指标

学习内容:
├─ 1. 信息检索基础概念
│   └─ 推荐:MIT 6.207/14.15 网络科学 or Stanford CS276
├─ 2. 经典指标理解
│   └─ Precision, Recall, MAP, MRR, NDCG 手动计算
├─ 3. 动手实践
│   └─ 用 MTEB 评测一个开源 embedding 模型
└─ 阅读:
    ├─ MTEB 论文(2022)
    └─ BEIR 论文(2021)

进阶阶段(2-4 周)

目标:掌握 RAG 评测和工具链

学习内容:
├─ 1. RAG 评测框架
│   └─ RAGAS / DeepEval / TruLens 官方教程
├─ 2. 评测 Pipeline 搭建
│   └─ 自动化评测 + 报告生成
├─ 3. 场景化评测设计
│   └─ 如何构建自己的评测数据集
└─ 实践:
    ├─ 搭建一个完整的 RAG 评测 Pipeline
    └─ 对比 3+ 个 embedding 模型在特定场景的表现

专家阶段(持续)

目标:评测体系设计 + 前沿追踪

学习内容:
├─ 1. 评测方法论
│   ├─ 统计显著性检验
│   ├─ 标注质量控制
│   └─ 多评测者一致性
├─ 2. 前沿方向
│   ├─ LLM-as-Judge(用 LLM 做评测)
│   ├─ 合成评测数据
│   └─ 自适应评测
└─ 参与:
    ├─ TREC 评测任务
    └─ 开源评测框架贡献

推荐资源清单

类型资源说明
论文MTEB (2022)必读,理解评测体系设计
论文BEIR (2021)异构检索基准
论文MS MARCO (2016/2018)工业级数据集设计
代码MTEB GitHub动手实践
代码RAGAS GitHubRAG 评测框架
课程Stanford CS276信息检索经典课程
博客各模型厂商技术博客最新评测实践

一句话总结

检索评测是 RAG 时代的”质检员”——它不生产价值,但决定了你能否信任你的系统产出的价值。在”检索质量 = 生成质量上限”的范式下,评测从可选项变成了必选项。


延伸阅读与来源

核心论文

| 论文 | 年份 | 贡献

source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型