記憶檢索 (Memory Retrieval)
3 秒看懂
一句話定義: 記憶檢索是 AI 系統從儲存的知識(引數內化知識、外部文件庫、對話歷史等)中定位並提取與當前查詢相關資訊的機制——它是大型模型”知道什麼”和”用什麼回答”之間的橋樑。
類比: 模型的引數是圖書館的書架,注意力機制是圖書管理員,RAG 是館際互借系統——記憶檢索解決的正是”如何從海量儲存中快速、準確地找到此刻最需要的那幾本書”。
投資關鍵詞: 向量資料庫、Embedding 模型、RAG 基礎設施、長上下文推論、KV-Cache 管理、AI 搜尋。
3 分鐘產業解釋
為什麼”記憶檢索”突然成了核心賽道?
大語言模型(LLM)本質上是一個壓縮了訓練語料統計規律的引數矩陣。當用戶提問時,模型需要從這個巨大的引數空間中”檢索”出與問題相關的知識片段,並生成連貫的回答。這個過程在不同層次上展開:
| 層次 | 記憶型別 | 檢索機制 | 典型產品/場景 |
|---|---|---|---|
| 引數記憶 | 訓練時內化到權重中的知識 | 前向傳播中的注意力計算 | 所有 LLM 的通用推論 |
| 上下文記憶 | 當前對話/文件視窗中的資訊 | 注意力機制對 KV-Cache 的檢索 | 長文件問答、多輪對話 |
| 外部記憶 | 引數和上下文之外的知識庫 | RAG(檢索增強生成) | 企業知識庫問答、AI 搜尋 |
產業的核心矛盾在於:引數記憶有上限(模型引數量有限、知識截止日期),而企業級應用對即時性、準確性和可追溯性的要求沒有上限。 這催生了從向量資料庫到 RAG pipeline 再到長上下文模型的一整條產業鏈。
市場訊號
- 2023—2024 年,向量資料庫賽道(Pinecone、Weaviate、Milvus/Zilliz、Qdrant、Chroma)密集融資,總融資額達數億美元量級 [行業估算]。
- 主流雲端廠商(AWS、Azure、GCP)均在資料庫服務中整合向量檢索能力。
- NVIDIA 將 RAG pipeline 納入其 AI Enterprise 軟體棧,將其定位為推論側基礎設施。
- Anthropic(Claude)、Google(Gemini)、OpenAI(GPT)均在模型層面支援超長上下文視窗(128K—1M+ tokens),這本質上是將”外部記憶檢索”部分內化為”上下文記憶檢索”。
15 分鐘專家深入
從 Attention 到 RAG:記憶檢索的全景圖
1. 注意力機制——最基礎的記憶檢索原語
Transformer 的自注意力(Self-Attention)本質上是一個可微的、基於內容的軟檢索操作:
Query(當前 token 的需求)與所有 Key(已知資訊的索引)計算相似度
→ Softmax 歸一化為檢索權重
→ 加權聚合 Value(資訊內容)得到輸出
這意味著每一個 token 的生成都是一次記憶檢索。整個 Transformer 可以被理解為一個層級化的記憶檢索系統:
- 每層的注意力頭負責檢索不同粒度/型別的資訊(語法、語義、世界知識等);
- FFN 層則可以被理解為”記憶儲存”,有研究表明 FFN 的 key-value 對應關係類似於一個可查詢的記憶庫(Geva et al., 2021)。
2. KV-Cache——推論側的記憶管理挑戰
在自迴歸生成中,已計算的 Key 和 Value 向量會被快取(KV-Cache),避免重複計算。對於長上下文場景,KV-Cache 的視訊記憶體佔用是核心瓶頸:
- 一個粗略的估算公式:
KV-Cache 視訊記憶體 ≈ 2 × 層數 × 注意力頭數 × 頭維度 × 序列長度 × batch_size × 精度位元組數 - 以 70B 引數模型、128K 上下文長度為例,單請求的 KV-Cache 可達數十 GB 量級 [估算,取決於具體架構]。
這催生了一系列KV-Cache 壓縮與檢索最佳化技術:
- 稀疏注意力(Sparse Attention):只對部分 token 計算注意力,減少檢索範圍
- KV-Cache 量化:將 FP16 的 KV 向量壓縮為 INT8/INT4
- PagedAttention(vLLM):將 KV-Cache 分頁管理,提高 GPU 視訊記憶體利用率
- 滑動視窗注意力(Sliding Window Attention):限制注意力範圍,如 Mistral 系列模型的做法
- StreamingLLM:保留初始 token + 滑動視窗,實現理論上無限長度的流式推論
3. RAG——外部記憶檢索的標準範式
RAG(Retrieval-Augmented Generation) 是當前產業界最主流的外部記憶檢索架構:
┌─────────────┐ ┌──────────────┐ ┌──────────────┐
│ 使用者查詢 │───▶│ 檢索模組 │───▶│ 生成模組 │
│ (Query) │ │ (Retriever) │ │ (Generator) │
└─────────────┘ └──────┬───────┘ └──────────────┘
│
┌──────▼───────┐
│ 知識庫 │
│ (Knowledge │
│ Store) │
└──────────────┘
關鍵技術鏈路:
(a) 文件處理與切分(Chunking)
- 將文件切分為適當大小的片段(chunk),常見策略包括固定長度切分、語義切分、遞迴切分等
- chunk 大小是關鍵超參:太小丟失上下文,太大引入噪聲
(b) Embedding(向量化)
- 使用 Embedding 模型(如 OpenAI text-embedding-3、BGE、E5、GTE 等)將文本對映為稠密向量
- Embedding 模型的檢索質量直接決定 RAG 上限
- 主流維度:768—3072 維 [取決於模型]
(c) 向量檢索
- 使用 ANN(近似最近鄰)演算法在向量庫中高效檢索 Top-K 最相關片段
- 主流演算法:HNSW(Hierarchical Navigable Small World)、IVF(Inverted File Index)、PQ(Product Quantization)
- 核心指標:召回率(Recall@K)、查詢延遲(QPS / p99 latency)
(d) 重排序(Reranking)
- 初步檢索後,使用 Cross-Encoder 模型對候選片段重新打分排序
- 精度高於雙塔模型,但計算成本更高,通常只對 Top-K 候選做
(e) 上下文拼接與生成
- 將檢索到的片段與原始查詢拼接,送入 LLM 生成最終回答
- 拼接策略、prompt 模板設計直接影響生成質量
4. 超越 RAG:更前沿的記憶檢索範式
| 範式 | 核心思路 | 代表工作 |
|---|---|---|
| Long-Context 直接塞入 | 通過長上下文視窗將全部文件塞入 prompt,省去顯式檢索 | Gemini 1.5 Pro(1M tokens)、Claude 3(200K tokens) |
| Memory-Augmented Agent | Agent 自主管理長期記憶的讀寫,動態決定何時檢索 | MemGPT/Letta、LangMem |
| GraphRAG | 用知識圖譜替代純向量檢索,保留實體關係結構 | Microsoft GraphRAG |
| 自適應檢索 | 模型自己判斷”是否需要檢索”以及”檢索什麼” | Self-RAG、CRAG |
| 引數化知識編輯 | 不走檢索,直接修改模型引數中的知識 | ROME、MEMIT、T-Patcher |
| 稀疏檢索+稠密檢索混合 | 結合 BM25 等詞法檢索與向量語義檢索 | Hybrid RAG(HyDE + BM25) |
技術原理
自注意力作為可微檢索:數學視角
給定輸入序列 X ∈ ℝ^(n×d):
Q = X W_Q (查詢矩陣)
K = X W_K (鍵矩陣)
V = X W_V (值矩陣)
注意力計算:
Attention(Q, K, V) = softmax(Q K^T / √d_k) V
其中:
- S = Q K^T ∈ ℝ^(n×n) 是"檢索評分矩陣"
- softmax(S / √d_k) 是"檢索權重分佈"
- 加權求和 V 是"檢索結果"
關鍵洞察:
Q K^T計算的是查詢與所有鍵的點積相似度——這與向量資料庫中的內積檢索本質相同√d_k是溫度縮放因子,控制檢索的”集中度”:值越小,檢索越聚焦於少數最相關的 tokensoftmax將評分歸一化為機率分佈——等價於一個軟檢索,不硬性截斷,而是加權聚合所有記憶
Multi-Head Attention:並行多路檢索
MultiHead(Q, K, V) = Concat(head_1, ..., head_h) W_O
其中 head_i = Attention(Q W_Q_i, K W_K_i, V W_V_i)
- 每個注意力頭可以理解為一個獨立的檢索通道,關注不同型別的相似性(如語法距離、語義相似、位置相鄰等)
- 不同頭學到的注意力模式差異顯著(有大量視覺化研究支撐),這賦予模型在單層內並行執行多種記憶檢索策略的能力
FFN 作為鍵值記憶儲存
研究(Geva et al., 2021, “Transformer Feed-Forward Layers Are Key-Value Memories”)指出:
- FFN 第一層權重 W₁ 的每一行可視為一個”鍵”(key pattern)
- FFN 第二層權重 W₂ 的對應列可視為一個”值”(memory value)
- 前向傳播過程等價於:輸入與所有 key 計算匹配度 → 按匹配度加權聚合 value
FFN(x) = W₂ · σ(W₁ x + b₁) + b₂
其中:
- W₁ 的第 i 行 = key_i(第 i 個記憶的索引模式)
- W₂ 的第 i 列 = value_i(第 i 個記憶的內容)
- σ(W₁ x)_i = key_i 與輸入 x 的匹配強度
- 輸出 = Σ_i [σ(key_i · x + b₁_i) · value_i] = 按匹配度加權的記憶檢索
向量檢索的 ANN 演算法原理
大規模向量檢索不能做暴力全量掃描(O(n) 複雜度,n 為向量總數),需要 ANN(近似最近鄰)演算法:
HNSW 核心思路(示意):
┌─────────────────────────────────────────────┐
│ Layer 2: o ──────────── o │ ← 粗粒度導航(跨度大)
│ │ │ │
│ Layer 1: o ── o ── o ── o ── o │ ← 中粒度
│ │ │ │ │ │ │
│ Layer 0: o─o─o─o─o─o─o─o─o─o─o─o─o─o─o │ ← 精細搜尋
└─────────────────────────────────────────────┘
查詢過程:從最高層開始貪心搜尋,逐層下降並精細化
時間複雜度:O(log n)(理想情況下)
核心權衡:
- 召回率 vs. 速度:更高的 ef_search 引數 → 更高召回率但更慢
- 記憶體 vs. 精度:PQ 量化壓縮減少記憶體但損失精度
- 建置時間 vs. 查詢質量:更密的圖連線 → 更好查詢質量但更長的索引建置時間
技術演進史
| 時間 | 里程碑 | 意義 |
|---|---|---|
| 2014 | Neural Turing Machine (Graves et al.) | 首次在神經網路中引入可微讀寫的外部記憶 |
| 2015 | Memory Networks (Weston et al.) / End-to-End Memory Networks | 顯式記憶模組+注意力檢索的原型 |
| 2017 | Transformer (Vaswani et al.) | 注意力機制作為統一的記憶檢索原語 |
| 2018 | ELMo / BERT | 預訓練模型內化大量知識,隱式記憶檢索範式確立 |
| 2019 | REALM (Guu et al.) | 首次將檢索引入預訓練階段 |
| 2020 | DPR + RAG (Lewis et al.) | RAG 範式正式確立:稠密檢索+生成式模型 |
| 2020 | GPT-3 | 175B 引數展示了”引數記憶”的驚人規模(In-Context Learning 本質上是一種隱式檢索) |
| 2022 | ChatGPT / InstructGPT | RLHF 賦予模型更好的指令跟隨能力,RAG 開始大規模商用化 |
| 2023 | vLLM / PagedAttention | KV-Cache 管理的工程突破,大幅降低推論成本 |
| 2023 | 向量資料庫融資潮 | Pinecone、Weaviate、Zilliz 等密集融資,基礎設施成熟 |
| 2023 | MemGPT | Agent 自主管理記憶的範式探索 |
| 2023 | Self-RAG | 自適應檢索——模型學會”何時該檢索” |
| 2024 | CRAG (Corrective RAG) | 糾正性檢索增強,進一步最佳化檢索質量 |
| 2024 | Gemini 1.5 Pro (1M tokens) / Claude 3 (200K tokens) | 超長上下文挑戰傳統 RAG,“直接塞入”成為可能 |
| 2024 | GraphRAG (Microsoft) | 結構化知識圖譜+社群摘要增強檢索 |
| 2024-2025 | 長上下文+RAG 混合方案成為工程主流 | 不再是”二選一”,而是協同最佳化 |
技術路線對比
| 維度 | 純引數記憶 | RAG | 長上下文直塞 | Agent 記憶管理 |
|---|---|---|---|---|
| 知識容量 | 受限於引數量 | 理論無限(外部庫) | 受限於上下文視窗 | 可分層管理 |
| 知識時效 | 凍結於訓練截止 | 即時更新(換文件即可) | 取決於輸入時效 | 可動態更新 |
| 檢索精度 | 模糊(幻覺風險高) | 高(可追溯來源) | 中(依賴模型注意力) | 取決於檢索策略 |
| 推論成本 | 固定(一次前向) | 增加檢索延遲 | 超長上下文推論昂貴 | 多輪呼叫,成本不定 |
| 工程複雜度 | 低 | 中—高(需維護 pipeline) | 低(但需長上下文模型) | 高(需記憶排程邏輯) |
| 可解釋性 | 低 | 高(可展示引用來源) | 中 | 中—高 |
| 典型場景 | 通用問答、創意生成 | 企業知識庫、客服、法律/醫療 | 長文件分析、程式碼理解 | 複雜任務編排、個人助理 |
| 當前成熟度 | 高 | 高 | 中—高(仍在快速演進) | 早期探索 |
關鍵判斷: 短期內 RAG 仍是企業級應用的主流方案;中長期,隨著上下文視窗持續擴大+推論成本下降,長上下文與 RAG 將走向融合——模型根據任務複雜度自適應選擇檢索策略。
上下游
上游:記憶檢索的基礎設施層
┌─────────────────────────────────────────────────────────┐
│ 硬體層 │
│ GPU (NVIDIA H100/B200) ← 推論算力 │
│ 高頻寬記憶體 (HBM) ← KV-Cache / 向量檢索加速 │
│ SSD/NVMe 儲存 ← 大規模向量庫冷儲存 │
├─────────────────────────────────────────────────────────┤
│ 軟體基礎設施層 │
│ 向量資料庫: Milvus/Zilliz · Pinecone · Weaviate · Qdrant │
│ 搜尋引擎: Elasticsearch (支援向量檢索) · OpenSearch │
│ Embedding 服務: OpenAI · Cohere · Jina · BAAI (BGE) │
│ 推論架構: vLLM · TensorRT-LLM · TGI (含 KV-Cache 最佳化) │
├─────────────────────────────────────────────────────────┤
│ 模型層 │
│ Embedding 模型: text-embedding-3 · BGE · E5 · GTE │
│ Reranker 模型: Cohere Rerank · BGE-Reranker · cross-encoder │
│ 生成模型: GPT-4o · Claude · Gemini · 開源 LLaMA/Mistral │
└─────────────────────────────────────────────────────────┘
中游:記憶檢索的編排層
- RAG 架構:LangChain、LlamaIndex、Haystack、Semantic Kernel
- Agent 架構:AutoGen、CrewAI、LangGraph(含記憶管理模組)
- 評估工具:RAGAS、DeepEval、TruLens
下游:應用層
| 應用方向 | 記憶檢索的角色 | 代表產品/公司 |
|---|---|---|
| 企業知識庫問答 | RAG 檢索企業內部文件 | Glean、Moveworks、Dify |
| AI 搜尋 | 檢索+生成替代傳統搜尋 | Perplexity、Arc Search |
| 客服/銷售助手 | 檢索產品手冊/FAQ | Sierra、Forethought |
| 法律/醫療/金融 | 檢索專業文獻+合規文件 | Harvey、Abridge、Bloomberg GPT |
| 程式碼助手 | 檢索程式碼庫/文件 | Cursor、GitHub Copilot |
| 個人助理 | 跨會話記憶管理 | ChatGPT Memory、Rewind |
關鍵指標
衡量記憶檢索質量的核心指標
| 指標 | 定義 | 行業基準參考 |
|---|---|---|
| Recall@K | Top-K 檢索結果中包含正確答案的比例 | 優秀 RAG 系統 Recall@5 > 0.85 [行業估算] |
| NDCG@10 | 考慮排序位置的檢索質量 | 越接近 1 越好 |
| 檢索延遲(p50/p99) | 單次檢索請求的響應時間 | 通常要求 < 100ms (p99) |
| QPS | 每秒查詢數,衡量吞吐 | 取決於向量庫規模與硬體 |
| 向量維度 | Embedding 向量的維度數 | 768—3072 維 [取決於模型] |
| 向量庫規模 | 支援儲存的向量總數 | 主流系統支援 10 億+ 量級 |
| 端到端準確率 | RAG 最終回答的正確率 | 高度依賴具體任務,難以統一基準 |
| 引用忠實度 | 生成回答是否忠實於檢索到的上下文 | Faithfulness,RAGAS 架構常用 |
KV-Cache 效率指標
| 指標 | 說明 |
|---|---|
| KV-Cache 視訊記憶體佔用 | 單請求佔用的 GPU 視訊記憶體 |
| KV-Cache 命中率 | 在有 KV-Cache 複用的場景中(如字首快取),快取的有效命中比例 |
| 首 token 延遲(TTFT) | 受檢索和預填充影響的主要指標 |
| 每 token 生成延遲(TPOT) | 受 KV-Cache 大小影響 |
供需與市場資料
需求側驅動力
- 企業 AI 落地的核心瓶頸:大多數企業無法(也不應該)用自有資料微調通用 LLM,RAG 是最務實的”讓 LLM 瞭解企業知識”的方案
- 合規與可追溯需求:醫療、法律、金融等領域需要”引用原文”,純引數記憶無法滿足
- 知識更新頻率:產品文件、政策法規、市場資料等頻繁變化,需要動態更新的記憶
- 成本效率:相比全量微調,RAG 的邊際成本更低、迭代更快
供給側格局
| 細分市場 | 玩家 | 競爭態勢 |
|---|---|---|
| 向量資料庫 | Pinecone(閉源SaaS)、Zilliz/Milvus(開源+雲端)、Weaviate(開源+雲端)、Qdrant(開源+雲端)、Chroma(開源輕量)、Elastic(傳統搜尋+向量) | 競爭激烈,Pinecone 和 Zilliz 在商業市場領先,開源陣營分化 |
| 雲端廠商內建向量能力 | AWS(OpenSearch + Bedrock Knowledge Bases)、Azure(AI Search)、GCP(Vertex AI Search) | 大廠通過捆綁效應搶佔市場 |
| Embedding 模型 | OpenAI、Cohere、Jina、BAAI(開源)、Nomic | 開源 Embedding 模型質量追趕閉源,價格戰趨勢明顯 |
| RAG 架構/平台 | LangChain、LlamaIndex、Dify、Ragas 等 | 架構層競爭白熱化,差異化靠生態和易用性 |
| KV-Cache 最佳化 | vLLM(開源)、TensorRT-LLM(NVIDIA)、SGLang(開源) | 推論架構層的關鍵技術壁壘 |
市場規模估算
- 向量資料庫市場:2024 年約 15—25 億美元 [多家機構估算,口徑差異較大],預計 2028 年達 100 億+ 美元
- RAG 相關工具與服務:尚無獨立市場統計,通常計入”企業 AI 應用”或”AI 基礎設施”大類
- 向量檢索作為推論基礎設施的組成部分,其價值更多體現在降低幻覺率、提升使用者體驗從而推動 LLM 商業化,而非作為獨立營收來源
代表公司與資本對映
| 公司/專案 | 角色 | 關鍵能力 | 資本/融資狀態 |
|---|---|---|---|
| Pinecone | 向量資料庫(SaaS) | 全託管、Serverless 向量檢索 | 2023 年 B 輪 $100M,估值 $750M [公開報道] |
| Zilliz | 向量資料庫(Milvus 背後的公司) | 開源 Milvus + 雲端服務 Zilliz Cloud | 2022 年 B+ 輪 $60M [公開報道] |
| Weaviate | 向量資料庫 | 開源、多模態支援 | 2023 年 B 輪 $50M [公開報道] |
| Qdrant | 向量資料庫 | Rust 實現,高效能 | 2024 年 A 輪 $28M [公開報道] |
| LlamaIndex | RAG 架構 | 資料聯結器+索引+檢索+生成 pipeline | 2024 年融資,具體金額未充分揭露 |
| LangChain | AI 應用架構(含 RAG) | 鏈式編排、生態豐富 | 2024 年融資約 $25M [公開報道] |
| Dify | 開源 LLMOps/RAG 平台 | 低程式碼 RAG 應用搭建 | 2024 年 A 輪 $23M [公開報道] |
| Perplexity | AI 搜尋 | 檢索+生成的搜尋體驗 | 2024 年估值超 $1B [公開報道] |
| Glean | 企業搜尋/AI 助手 | 企業知識檢索+生成 | 2024 年 D 輪 $200M+ [公開報道] |
| Microsoft | GraphRAG + Azure AI Search | 圖增強檢索、雲端原生向量檢索 | 上市公司 |
| NVIDIA | 推論基礎設施 | TensorRT-LLM(KV-Cache 最佳化)、NeMo Retriever | 上市公司 |
A 股 / 港股對映
| 標的方向 | 代表公司 | 對映邏輯 |
|---|---|---|
| 向量資料庫 / AI 資料庫 | 星環科技(688031) | 自研向量資料庫 Hippo,企業級知識庫方案 |
| 搜尋引擎 / 資訊檢索 | 科大訊飛(002230) | 星火認知大型模型配套的知識檢索能力 |
| AI 應用平台 | 金山辦公(688111) | WPS AI 中的文件問答(RAG 範式) |
| 算力基礎設施 | 中科曙光(603019) | 推論算力需求隨 RAG 部署增加而增長 |
| 資料標註/資料服務 | 海天瑞聲(688787) | Embedding 模型訓練需要高質量標註資料 |
注意: A 股”記憶檢索”概念的對映較為間接,多數公司涉及的是 RAG 能力的一個環節而非專注向量檢索基礎設施。投資時需區分”有相關技術能力”和”有獨立營收來源”。
投資邏輯
核心判斷
記憶檢索是 AI 商業化落地的關鍵使能層(Enabler)。
三條投資主線
主線 1:向量資料庫/檢索基礎設施(“賣鏟子”)
- 邏輯:無論上層應用如何變化,向量檢索都是剛需基礎設施
- 風險:傳統資料庫廠商(PostgreSQL + pgvector、Elasticsearch)蠶食獨立向量資料庫的市場;雲端廠商內建能力擠壓第三方空間
- 判斷:獨立向量資料庫公司需要在效能或生態上建立足夠深的護城河,否則面臨被”功能化”的風險
主線 2:Embedding / Reranker 模型(“檢索質量的天花板”)
- 邏輯:RAG 系統的上限由檢索質量決定,Embedding 模型是核心
- 風險:開源模型(BGE、E5、GTE 系列)質量快速追趕,商業閉源模型的溢價空間被壓縮
- 判斷:Embedding 模型的價值可能更多體現在”捆綁在平台中”而非獨立銷售
主線 3:AI 應用層(“記憶檢索創造的價值”)
- 邏輯:記憶檢索能力使 LLM 從”通用助手”變成”行業專家”,解鎖高價值垂直場景
- 風險:應用層護城河取決於資料飛輪和行業 know-how,而非純技術
- 判斷:擁有行業資料壁壘的應用公司最具長期價值
風險因素
- 長上下文模型可能顛覆傳統 RAG:如果 10M+ tokens 上下文的推論成本降到足夠低,部分 RAG 場景會被”直接塞入”替代。但企業級場景對即時性、合規追溯的需求意味著 RAG 不會完全被替代。
- 開源競爭激烈:記憶檢索的多數環節(向量資料庫、RAG 架構、Embedding 模型)都有高質量開源替代,商業化溢價能力存疑。
- 技術迭代快:2023 年的技術棧在 2025 年可能已顯著過時,需持續追蹤技術演進。
常見誤讀糾偏
❌ 誤讀 1:「RAG 就是記憶檢索的全部」
糾偏: RAG 是外部記憶檢索的一種實現,但記憶檢索的範疇遠大於 RAG。Transformer 的注意力機制本身就是最基礎的記憶檢索操作;In-Context Learning 可以被視為一種隱式的上下文記憶檢索;模型引數中內化的世界知識是”引數記憶”。RAG 是當前最成熟、最可工程化的外部記憶檢索方案,但它只是記憶檢索全景圖中的一部分。
❌ 誤讀 2:「向量檢索 = 語義檢索,關鍵詞檢索已經過時」
糾偏: 向量檢索擅長捕捉語義相似性,但在精確匹配場景(如產品編號、法律條文編號、人名/地名等專有名詞)上,傳統的關鍵詞檢索(如 BM25)往往更準確。成熟的生產級 RAG 系統通常採用混合檢索(Hybrid Search)——同時使用向量檢索和關鍵詞檢索,然後合併排序。這已被多個實際部署案例驗證為最優實踐。
❌ 誤讀 3:「上下文視窗越長,RAG 就不需要了」
糾偏: 超長上下文在技術上可行,但面臨三個現實約束:① 成本——1M tokens 上下文的推論成本遠高於 RAG 檢索 Top-K 片段後推論;② 注意力退化——“Lost in the Middle”現象表明模型對長上下文中間部分的資訊關注度顯著下降(Liu et al., 2023);③ 即時性——外部知識庫持續更新,RAG 可以在每次查詢時獲取最新資訊,而長上下文需要重新載入。長期來看,兩者互補而非替代。
❌ 誤讀 4:「Embedding 模型越大,檢索效果越好」
糾偏: Embedding 模型的檢索效果取決於訓練資料質量、訓練目標(對比學習策略)和領域適配性,而非單純的模型引數量。小但針對特定領域微調的 Embedding 模型,在該領域上往往優於通用大型模型。此外,Embedding 模型還需要考慮推論延遲——它在 RAG pipeline 中處於查詢的熱路徑上,延遲敏感。
學習路徑
入門(理解概念)
- 閱讀 Jay Alammar 的圖解 Transformer 系列,理解注意力機制的本質
- 閱讀 Lilian Weng 的部落格文章 “Prompt Engineering” 和 “Retrieval-Augmented Generation”
- 使用 LangChain 或 LlamaIndex 搭建一個簡單的 RAG demo
進階(理解工程)
- 學習向量資料庫的原理——閱讀 HNSW 論文(Malkov & Yashunin, 2016)
- 瞭解 vLLM 的 PagedAttention 設計(Kwon et al., 2023)
- 實現一個完整的 RAG pipeline——包含文件解析、chunking、embedding、向量檢索、reranking、生成
- 使用 RAGAS 等工具對 RAG 系統進行系統性評估
高階(理解前沿)
- 精讀論文:REALM (Guu et al., 2020)、DPR (Karpukhin et al., 2020)、RAG (Lewis et al., 2020)
- 研究 CRAG (Corrective RAG) 和 Self-RAG 的自適應檢索機制
- 探索 GraphRAG 和 Agent 記憶管理的架構設計
- 實驗混合檢索、重排序和分塊策略的組合最佳化
本章節內容基於截至 2025 年 4 月的公開資訊與行業實踐,具體技術細節和公司資料請以最新公開文件為準。