记忆检索 (Memory Retrieval)
3 秒看懂
一句话定义: 记忆检索是 AI 系统从存储的知识(参数内化知识、外部文档库、对话历史等)中定位并提取与当前查询相关信息的机制——它是大模型”知道什么”和”用什么回答”之间的桥梁。
类比: 模型的参数是图书馆的书架,注意力机制是图书管理员,RAG 是馆际互借系统——记忆检索解决的正是”如何从海量存储中快速、准确地找到此刻最需要的那几本书”。
投资关键词: 向量数据库、Embedding 模型、RAG 基础设施、长上下文推理、KV-Cache 管理、AI 搜索。
3 分钟产业解释
为什么”记忆检索”突然成了核心赛道?
大语言模型(LLM)本质上是一个压缩了训练语料统计规律的参数矩阵。当用户提问时,模型需要从这个巨大的参数空间中”检索”出与问题相关的知识片段,并生成连贯的回答。这个过程在不同层次上展开:
| 层次 | 记忆类型 | 检索机制 | 典型产品/场景 |
|---|---|---|---|
| 参数记忆 | 训练时内化到权重中的知识 | 前向传播中的注意力计算 | 所有 LLM 的通用推理 |
| 上下文记忆 | 当前对话/文档窗口中的信息 | 注意力机制对 KV-Cache 的检索 | 长文档问答、多轮对话 |
| 外部记忆 | 参数和上下文之外的知识库 | RAG(检索增强生成) | 企业知识库问答、AI 搜索 |
产业的核心矛盾在于:参数记忆有上限(模型参数量有限、知识截止日期),而企业级应用对实时性、准确性和可追溯性的要求没有上限。 这催生了从向量数据库到 RAG pipeline 再到长上下文模型的一整条产业链。
市场信号
- 2023—2024 年,向量数据库赛道(Pinecone、Weaviate、Milvus/Zilliz、Qdrant、Chroma)密集融资,总融资额达数亿美元量级 [行业估算]。
- 主流云厂商(AWS、Azure、GCP)均在数据库服务中集成向量检索能力。
- NVIDIA 将 RAG pipeline 纳入其 AI Enterprise 软件栈,将其定位为推理侧基础设施。
- Anthropic(Claude)、Google(Gemini)、OpenAI(GPT)均在模型层面支持超长上下文窗口(128K—1M+ tokens),这本质上是将”外部记忆检索”部分内化为”上下文记忆检索”。
15 分钟专家深入
从 Attention 到 RAG:记忆检索的全景图
1. 注意力机制——最基础的记忆检索原语
Transformer 的自注意力(Self-Attention)本质上是一个可微的、基于内容的软检索操作:
Query(当前 token 的需求)与所有 Key(已知信息的索引)计算相似度
→ Softmax 归一化为检索权重
→ 加权聚合 Value(信息内容)得到输出
这意味着每一个 token 的生成都是一次记忆检索。整个 Transformer 可以被理解为一个层级化的记忆检索系统:
- 每层的注意力头负责检索不同粒度/类型的信息(语法、语义、世界知识等);
- FFN 层则可以被理解为”记忆存储”,有研究表明 FFN 的 key-value 对应关系类似于一个可查询的记忆库(Geva et al., 2021)。
2. KV-Cache——推理侧的记忆管理挑战
在自回归生成中,已计算的 Key 和 Value 向量会被缓存(KV-Cache),避免重复计算。对于长上下文场景,KV-Cache 的显存占用是核心瓶颈:
- 一个粗略的估算公式:
KV-Cache 显存 ≈ 2 × 层数 × 注意力头数 × 头维度 × 序列长度 × batch_size × 精度字节数 - 以 70B 参数模型、128K 上下文长度为例,单请求的 KV-Cache 可达数十 GB 量级 [估算,取决于具体架构]。
这催生了一系列KV-Cache 压缩与检索优化技术:
- 稀疏注意力(Sparse Attention):只对部分 token 计算注意力,减少检索范围
- KV-Cache 量化:将 FP16 的 KV 向量压缩为 INT8/INT4
- PagedAttention(vLLM):将 KV-Cache 分页管理,提高 GPU 显存利用率
- 滑动窗口注意力(Sliding Window Attention):限制注意力范围,如 Mistral 系列模型的做法
- StreamingLLM:保留初始 token + 滑动窗口,实现理论上无限长度的流式推理
3. RAG——外部记忆检索的标准范式
RAG(Retrieval-Augmented Generation) 是当前产业界最主流的外部记忆检索架构:
┌─────────────┐ ┌──────────────┐ ┌──────────────┐
│ 用户查询 │───▶│ 检索模块 │───▶│ 生成模块 │
│ (Query) │ │ (Retriever) │ │ (Generator) │
└─────────────┘ └──────┬───────┘ └──────────────┘
│
┌──────▼───────┐
│ 知识库 │
│ (Knowledge │
│ Store) │
└──────────────┘
关键技术链路:
(a) 文档处理与切分(Chunking)
- 将文档切分为适当大小的片段(chunk),常见策略包括固定长度切分、语义切分、递归切分等
- chunk 大小是关键超参:太小丢失上下文,太大引入噪声
(b) Embedding(向量化)
- 使用 Embedding 模型(如 OpenAI text-embedding-3、BGE、E5、GTE 等)将文本映射为稠密向量
- Embedding 模型的检索质量直接决定 RAG 上限
- 主流维度:768—3072 维 [取决于模型]
(c) 向量检索
- 使用 ANN(近似最近邻)算法在向量库中高效检索 Top-K 最相关片段
- 主流算法:HNSW(Hierarchical Navigable Small World)、IVF(Inverted File Index)、PQ(Product Quantization)
- 核心指标:召回率(Recall@K)、查询延迟(QPS / p99 latency)
(d) 重排序(Reranking)
- 初步检索后,使用 Cross-Encoder 模型对候选片段重新打分排序
- 精度高于双塔模型,但计算成本更高,通常只对 Top-K 候选做
(e) 上下文拼接与生成
- 将检索到的片段与原始查询拼接,送入 LLM 生成最终回答
- 拼接策略、prompt 模板设计直接影响生成质量
4. 超越 RAG:更前沿的记忆检索范式
| 范式 | 核心思路 | 代表工作 |
|---|---|---|
| Long-Context 直接塞入 | 通过长上下文窗口将全部文档塞入 prompt,省去显式检索 | Gemini 1.5 Pro(1M tokens)、Claude 3(200K tokens) |
| Memory-Augmented Agent | Agent 自主管理长期记忆的读写,动态决定何时检索 | MemGPT/Letta、LangMem |
| GraphRAG | 用知识图谱替代纯向量检索,保留实体关系结构 | Microsoft GraphRAG |
| 自适应检索 | 模型自己判断”是否需要检索”以及”检索什么” | Self-RAG、CRAG |
| 参数化知识编辑 | 不走检索,直接修改模型参数中的知识 | ROME、MEMIT、T-Patcher |
| 稀疏检索+稠密检索混合 | 结合 BM25 等词法检索与向量语义检索 | Hybrid RAG(HyDE + BM25) |
技术原理
自注意力作为可微检索:数学视角
给定输入序列 X ∈ ℝ^(n×d):
Q = X W_Q (查询矩阵)
K = X W_K (键矩阵)
V = X W_V (值矩阵)
注意力计算:
Attention(Q, K, V) = softmax(Q K^T / √d_k) V
其中:
- S = Q K^T ∈ ℝ^(n×n) 是"检索评分矩阵"
- softmax(S / √d_k) 是"检索权重分布"
- 加权求和 V 是"检索结果"
关键洞察:
Q K^T计算的是查询与所有键的点积相似度——这与向量数据库中的内积检索本质相同√d_k是温度缩放因子,控制检索的”集中度”:值越小,检索越聚焦于少数最相关的 tokensoftmax将评分归一化为概率分布——等价于一个软检索,不硬性截断,而是加权聚合所有记忆
Multi-Head Attention:并行多路检索
MultiHead(Q, K, V) = Concat(head_1, ..., head_h) W_O
其中 head_i = Attention(Q W_Q_i, K W_K_i, V W_V_i)
- 每个注意力头可以理解为一个独立的检索通道,关注不同类型的相似性(如语法距离、语义相似、位置相邻等)
- 不同头学到的注意力模式差异显著(有大量可视化研究支撑),这赋予模型在单层内并行执行多种记忆检索策略的能力
FFN 作为键值记忆存储
研究(Geva et al., 2021, “Transformer Feed-Forward Layers Are Key-Value Memories”)指出:
- FFN 第一层权重 W₁ 的每一行可视为一个”键”(key pattern)
- FFN 第二层权重 W₂ 的对应列可视为一个”值”(memory value)
- 前向传播过程等价于:输入与所有 key 计算匹配度 → 按匹配度加权聚合 value
FFN(x) = W₂ · σ(W₁ x + b₁) + b₂
其中:
- W₁ 的第 i 行 = key_i(第 i 个记忆的索引模式)
- W₂ 的第 i 列 = value_i(第 i 个记忆的内容)
- σ(W₁ x)_i = key_i 与输入 x 的匹配强度
- 输出 = Σ_i [σ(key_i · x + b₁_i) · value_i] = 按匹配度加权的记忆检索
向量检索的 ANN 算法原理
大规模向量检索不能做暴力全量扫描(O(n) 复杂度,n 为向量总数),需要 ANN(近似最近邻)算法:
HNSW 核心思路(示意):
┌─────────────────────────────────────────────┐
│ Layer 2: o ──────────── o │ ← 粗粒度导航(跨度大)
│ │ │ │
│ Layer 1: o ── o ── o ── o ── o │ ← 中粒度
│ │ │ │ │ │ │
│ Layer 0: o─o─o─o─o─o─o─o─o─o─o─o─o─o─o │ ← 精细搜索
└─────────────────────────────────────────────┘
查询过程:从最高层开始贪心搜索,逐层下降并精细化
时间复杂度:O(log n)(理想情况下)
核心权衡:
- 召回率 vs. 速度:更高的 ef_search 参数 → 更高召回率但更慢
- 内存 vs. 精度:PQ 量化压缩减少内存但损失精度
- 构建时间 vs. 查询质量:更密的图连接 → 更好查询质量但更长的索引构建时间
技术演进史
| 时间 | 里程碑 | 意义 |
|---|---|---|
| 2014 | Neural Turing Machine (Graves et al.) | 首次在神经网络中引入可微读写的外部记忆 |
| 2015 | Memory Networks (Weston et al.) / End-to-End Memory Networks | 显式记忆模块+注意力检索的原型 |
| 2017 | Transformer (Vaswani et al.) | 注意力机制作为统一的记忆检索原语 |
| 2018 | ELMo / BERT | 预训练模型内化大量知识,隐式记忆检索范式确立 |
| 2019 | REALM (Guu et al.) | 首次将检索引入预训练阶段 |
| 2020 | DPR + RAG (Lewis et al.) | RAG 范式正式确立:稠密检索+生成式模型 |
| 2020 | GPT-3 | 175B 参数展示了”参数记忆”的惊人规模(In-Context Learning 本质上是一种隐式检索) |
| 2022 | ChatGPT / InstructGPT | RLHF 赋予模型更好的指令跟随能力,RAG 开始大规模商用化 |
| 2023 | vLLM / PagedAttention | KV-Cache 管理的工程突破,大幅降低推理成本 |
| 2023 | 向量数据库融资潮 | Pinecone、Weaviate、Zilliz 等密集融资,基础设施成熟 |
| 2023 | MemGPT | Agent 自主管理记忆的范式探索 |
| 2023 | Self-RAG | 自适应检索——模型学会”何时该检索” |
| 2024 | CRAG (Corrective RAG) | 纠正性检索增强,进一步优化检索质量 |
| 2024 | Gemini 1.5 Pro (1M tokens) / Claude 3 (200K tokens) | 超长上下文挑战传统 RAG,“直接塞入”成为可能 |
| 2024 | GraphRAG (Microsoft) | 结构化知识图谱+社区摘要增强检索 |
| 2024-2025 | 长上下文+RAG 混合方案成为工程主流 | 不再是”二选一”,而是协同优化 |
技术路线对比
| 维度 | 纯参数记忆 | RAG | 长上下文直塞 | Agent 记忆管理 |
|---|---|---|---|---|
| 知识容量 | 受限于参数量 | 理论无限(外部库) | 受限于上下文窗口 | 可分层管理 |
| 知识时效 | 冻结于训练截止 | 实时更新(换文档即可) | 取决于输入时效 | 可动态更新 |
| 检索精度 | 模糊(幻觉风险高) | 高(可追溯来源) | 中(依赖模型注意力) | 取决于检索策略 |
| 推理成本 | 固定(一次前向) | 增加检索延迟 | 超长上下文推理昂贵 | 多轮调用,成本不定 |
| 工程复杂度 | 低 | 中—高(需维护 pipeline) | 低(但需长上下文模型) | 高(需记忆调度逻辑) |
| 可解释性 | 低 | 高(可展示引用来源) | 中 | 中—高 |
| 典型场景 | 通用问答、创意生成 | 企业知识库、客服、法律/医疗 | 长文档分析、代码理解 | 复杂任务编排、个人助理 |
| 当前成熟度 | 高 | 高 | 中—高(仍在快速演进) | 早期探索 |
关键判断: 短期内 RAG 仍是企业级应用的主流方案;中长期,随着上下文窗口持续扩大+推理成本下降,长上下文与 RAG 将走向融合——模型根据任务复杂度自适应选择检索策略。
上下游
上游:记忆检索的基础设施层
┌─────────────────────────────────────────────────────────┐
│ 硬件层 │
│ GPU (NVIDIA H100/B200) ← 推理算力 │
│ 高带宽内存 (HBM) ← KV-Cache / 向量检索加速 │
│ SSD/NVMe 存储 ← 大规模向量库冷存储 │
├─────────────────────────────────────────────────────────┤
│ 软件基础设施层 │
│ 向量数据库: Milvus/Zilliz · Pinecone · Weaviate · Qdrant │
│ 搜索引擎: Elasticsearch (支持向量检索) · OpenSearch │
│ Embedding 服务: OpenAI · Cohere · Jina · BAAI (BGE) │
│ 推理框架: vLLM · TensorRT-LLM · TGI (含 KV-Cache 优化) │
├─────────────────────────────────────────────────────────┤
│ 模型层 │
│ Embedding 模型: text-embedding-3 · BGE · E5 · GTE │
│ Reranker 模型: Cohere Rerank · BGE-Reranker · cross-encoder │
│ 生成模型: GPT-4o · Claude · Gemini · 开源 LLaMA/Mistral │
└─────────────────────────────────────────────────────────┘
中游:记忆检索的编排层
- RAG 框架:LangChain、LlamaIndex、Haystack、Semantic Kernel
- Agent 框架:AutoGen、CrewAI、LangGraph(含记忆管理模块)
- 评估工具:RAGAS、DeepEval、TruLens
下游:应用层
| 应用方向 | 记忆检索的角色 | 代表产品/公司 |
|---|---|---|
| 企业知识库问答 | RAG 检索企业内部文档 | Glean、Moveworks、Dify |
| AI 搜索 | 检索+生成替代传统搜索 | Perplexity、Arc Search |
| 客服/销售助手 | 检索产品手册/FAQ | Sierra、Forethought |
| 法律/医疗/金融 | 检索专业文献+合规文档 | Harvey、Abridge、Bloomberg GPT |
| 代码助手 | 检索代码库/文档 | Cursor、GitHub Copilot |
| 个人助理 | 跨会话记忆管理 | ChatGPT Memory、Rewind |
关键指标
衡量记忆检索质量的核心指标
| 指标 | 定义 | 行业基准参考 |
|---|---|---|
| Recall@K | Top-K 检索结果中包含正确答案的比例 | 优秀 RAG 系统 Recall@5 > 0.85 [行业估算] |
| NDCG@10 | 考虑排序位置的检索质量 | 越接近 1 越好 |
| 检索延迟(p50/p99) | 单次检索请求的响应时间 | 通常要求 < 100ms (p99) |
| QPS | 每秒查询数,衡量吞吐 | 取决于向量库规模与硬件 |
| 向量维度 | Embedding 向量的维度数 | 768—3072 维 [取决于模型] |
| 向量库规模 | 支持存储的向量总数 | 主流系统支持 10 亿+ 量级 |
| 端到端准确率 | RAG 最终回答的正确率 | 高度依赖具体任务,难以统一基准 |
| 引用忠实度 | 生成回答是否忠实于检索到的上下文 | Faithfulness,RAGAS 框架常用 |
KV-Cache 效率指标
| 指标 | 说明 |
|---|---|
| KV-Cache 显存占用 | 单请求占用的 GPU 显存 |
| KV-Cache 命中率 | 在有 KV-Cache 复用的场景中(如前缀缓存),缓存的有效命中比例 |
| 首 token 延迟(TTFT) | 受检索和预填充影响的主要指标 |
| 每 token 生成延迟(TPOT) | 受 KV-Cache 大小影响 |
供需与市场数据
需求侧驱动力
- 企业 AI 落地的核心瓶颈:大多数企业无法(也不应该)用自有数据微调通用 LLM,RAG 是最务实的”让 LLM 了解企业知识”的方案
- 合规与可追溯需求:医疗、法律、金融等领域需要”引用原文”,纯参数记忆无法满足
- 知识更新频率:产品文档、政策法规、市场数据等频繁变化,需要动态更新的记忆
- 成本效率:相比全量微调,RAG 的边际成本更低、迭代更快
供给侧格局
| 细分市场 | 玩家 | 竞争态势 |
|---|---|---|
| 向量数据库 | Pinecone(闭源SaaS)、Zilliz/Milvus(开源+云)、Weaviate(开源+云)、Qdrant(开源+云)、Chroma(开源轻量)、Elastic(传统搜索+向量) | 竞争激烈,Pinecone 和 Zilliz 在商业市场领先,开源阵营分化 |
| 云厂商内置向量能力 | AWS(OpenSearch + Bedrock Knowledge Bases)、Azure(AI Search)、GCP(Vertex AI Search) | 大厂通过捆绑效应抢占市场 |
| Embedding 模型 | OpenAI、Cohere、Jina、BAAI(开源)、Nomic | 开源 Embedding 模型质量追赶闭源,价格战趋势明显 |
| RAG 框架/平台 | LangChain、LlamaIndex、Dify、Ragas 等 | 框架层竞争白热化,差异化靠生态和易用性 |
| KV-Cache 优化 | vLLM(开源)、TensorRT-LLM(NVIDIA)、SGLang(开源) | 推理框架层的关键技术壁垒 |
市场规模估算
- 向量数据库市场:2024 年约 15—25 亿美元 [多家机构估算,口径差异较大],预计 2028 年达 100 亿+ 美元
- RAG 相关工具与服务:尚无独立市场统计,通常计入”企业 AI 应用”或”AI 基础设施”大类
- 向量检索作为推理基础设施的组成部分,其价值更多体现在降低幻觉率、提升用户体验从而推动 LLM 商业化,而非作为独立收入来源
代表公司与资本映射
| 公司/项目 | 角色 | 关键能力 | 资本/融资状态 |
|---|---|---|---|
| Pinecone | 向量数据库(SaaS) | 全托管、Serverless 向量检索 | 2023 年 B 轮 $100M,估值 $750M [公开报道] |
| Zilliz | 向量数据库(Milvus 背后的公司) | 开源 Milvus + 云服务 Zilliz Cloud | 2022 年 B+ 轮 $60M [公开报道] |
| Weaviate | 向量数据库 | 开源、多模态支持 | 2023 年 B 轮 $50M [公开报道] |
| Qdrant | 向量数据库 | Rust 实现,高性能 | 2024 年 A 轮 $28M [公开报道] |
| LlamaIndex | RAG 框架 | 数据连接器+索引+检索+生成 pipeline | 2024 年融资,具体金额未充分披露 |
| LangChain | AI 应用框架(含 RAG) | 链式编排、生态丰富 | 2024 年融资约 $25M [公开报道] |
| Dify | 开源 LLMOps/RAG 平台 | 低代码 RAG 应用搭建 | 2024 年 A 轮 $23M [公开报道] |
| Perplexity | AI 搜索 | 检索+生成的搜索体验 | 2024 年估值超 $1B [公开报道] |
| Glean | 企业搜索/AI 助手 | 企业知识检索+生成 | 2024 年 D 轮 $200M+ [公开报道] |
| Microsoft | GraphRAG + Azure AI Search | 图增强检索、云原生向量检索 | 上市公司 |
| NVIDIA | 推理基础设施 | TensorRT-LLM(KV-Cache 优化)、NeMo Retriever | 上市公司 |
A 股 / 港股映射
| 标的方向 | 代表公司 | 映射逻辑 |
|---|---|---|
| 向量数据库 / AI 数据库 | 星环科技(688031) | 自研向量数据库 Hippo,企业级知识库方案 |
| 搜索引擎 / 信息检索 | 科大讯飞(002230) | 星火认知大模型配套的知识检索能力 |
| AI 应用平台 | 金山办公(688111) | WPS AI 中的文档问答(RAG 范式) |
| 算力基础设施 | 中科曙光(603019) | 推理算力需求随 RAG 部署增加而增长 |
| 数据标注/数据服务 | 海天瑞声(688787) | Embedding 模型训练需要高质量标注数据 |
注意: A 股”记忆检索”概念的映射较为间接,多数公司涉及的是 RAG 能力的一个环节而非专注向量检索基础设施。投资时需区分”有相关技术能力”和”有独立收入来源”。
投资逻辑
核心判断
记忆检索是 AI 商业化落地的关键使能层(Enabler)。
三条投资主线
主线 1:向量数据库/检索基础设施(“卖铲子”)
- 逻辑:无论上层应用如何变化,向量检索都是刚需基础设施
- 风险:传统数据库厂商(PostgreSQL + pgvector、Elasticsearch)蚕食独立向量数据库的市场;云厂商内置能力挤压第三方空间
- 判断:独立向量数据库公司需要在性能或生态上建立足够深的护城河,否则面临被”功能化”的风险
主线 2:Embedding / Reranker 模型(“检索质量的天花板”)
- 逻辑:RAG 系统的上限由检索质量决定,Embedding 模型是核心
- 风险:开源模型(BGE、E5、GTE 系列)质量快速追赶,商业闭源模型的溢价空间被压缩
- 判断:Embedding 模型的价值可能更多体现在”捆绑在平台中”而非独立销售
主线 3:AI 应用层(“记忆检索创造的价值”)
- 逻辑:记忆检索能力使 LLM 从”通用助手”变成”行业专家”,解锁高价值垂直场景
- 风险:应用层护城河取决于数据飞轮和行业 know-how,而非纯技术
- 判断:拥有行业数据壁垒的应用公司最具长期价值
风险因素
- 长上下文模型可能颠覆传统 RAG:如果 10M+ tokens 上下文的推理成本降到足够低,部分 RAG 场景会被”直接塞入”替代。但企业级场景对实时性、合规追溯的需求意味着 RAG 不会完全被替代。
- 开源竞争激烈:记忆检索的多数环节(向量数据库、RAG 框架、Embedding 模型)都有高质量开源替代,商业化溢价能力存疑。
- 技术迭代快:2023 年的技术栈在 2025 年可能已显著过时,需持续跟踪技术演进。
常见误读纠偏
❌ 误读 1:「RAG 就是记忆检索的全部」
纠偏: RAG 是外部记忆检索的一种实现,但记忆检索的范畴远大于 RAG。Transformer 的注意力机制本身就是最基础的记忆检索操作;In-Context Learning 可以被视为一种隐式的上下文记忆检索;模型参数中内化的世界知识是”参数记忆”。RAG 是当前最成熟、最可工程化的外部记忆检索方案,但它只是记忆检索全景图中的一部分。
❌ 误读 2:「向量检索 = 语义检索,关键词检索已经过时」
纠偏: 向量检索擅长捕捉语义相似性,但在精确匹配场景(如产品编号、法律条文编号、人名/地名等专有名词)上,传统的关键词检索(如 BM25)往往更准确。成熟的生产级 RAG 系统通常采用混合检索(Hybrid Search)——同时使用向量检索和关键词检索,然后合并排序。这已被多个实际部署案例验证为最优实践。
❌ 误读 3:「上下文窗口越长,RAG 就不需要了」
纠偏: 超长上下文在技术上可行,但面临三个现实约束:① 成本——1M tokens 上下文的推理成本远高于 RAG 检索 Top-K 片段后推理;② 注意力退化——“Lost in the Middle”现象表明模型对长上下文中间部分的信息关注度显著下降(Liu et al., 2023);③ 实时性——外部知识库持续更新,RAG 可以在每次查询时获取最新信息,而长上下文需要重新加载。长期来看,两者互补而非替代。
❌ 误读 4:「Embedding 模型越大,检索效果越好」
纠偏: Embedding 模型的检索效果取决于训练数据质量、训练目标(对比学习策略)和领域适配性,而非单纯的模型参数量。小但针对特定领域微调的 Embedding 模型,在该领域上往往优于通用大模型。此外,Embedding 模型还需要考虑推理延迟——它在 RAG pipeline 中处于查询的热路径上,延迟敏感。
学习路径
入门(理解概念)
- 阅读 Jay Alammar 的图解 Transformer 系列,理解注意力机制的本质
- 阅读 Lilian Weng 的博客文章 “Prompt Engineering” 和 “Retrieval-Augmented Generation”
- 使用 LangChain 或 LlamaIndex 搭建一个简单的 RAG demo
进阶(理解工程)
- 学习向量数据库的原理——阅读 HNSW 论文(Malkov & Yashunin, 2016)
- 了解 vLLM 的 PagedAttention 设计(Kwon et al., 2023)
- 实现一个完整的 RAG pipeline——包含文档解析、chunking、embedding、向量检索、reranking、生成
- 使用 RAGAS 等工具对 RAG 系统进行系统性评估
高级(理解前沿)
- 精读论文:REALM (Guu et al., 2020)、DPR (Karpukhin et al., 2020)、RAG (Lewis et al., 2020)
- 研究 CRAG (Corrective RAG) 和 Self-RAG 的自适应检索机制
- 探索 GraphRAG 和 Agent 记忆管理的架构设计
- 实验混合检索、重排序和分块策略的组合优化
本章节内容基于截至 2025 年 4 月的公开信息与行业实践,具体技术细节和公司数据请以最新公开文档为准。