模型層 開放閱讀

記憶檢索

Memory Retrieval

概念 ID
memory-retrieval
更新時間
2026-05-29
來源數量
待補

記憶檢索 (Memory Retrieval)

3 秒看懂

一句話定義: 記憶檢索是 AI 系統從儲存的知識(引數內化知識、外部文件庫、對話歷史等)中定位並提取與當前查詢相關資訊的機制——它是大型模型”知道什麼”和”用什麼回答”之間的橋樑。

類比: 模型的引數是圖書館的書架,注意力機制是圖書管理員,RAG 是館際互借系統——記憶檢索解決的正是”如何從海量儲存中快速、準確地找到此刻最需要的那幾本書”。

投資關鍵詞: 向量資料庫、Embedding 模型、RAG 基礎設施、長上下文推論、KV-Cache 管理、AI 搜尋。

3 分鐘產業解釋

為什麼”記憶檢索”突然成了核心賽道?

大語言模型(LLM)本質上是一個壓縮了訓練語料統計規律的引數矩陣。當用戶提問時,模型需要從這個巨大的引數空間中”檢索”出與問題相關的知識片段,並生成連貫的回答。這個過程在不同層次上展開:

層次記憶型別檢索機制典型產品/場景
引數記憶訓練時內化到權重中的知識前向傳播中的注意力計算所有 LLM 的通用推論
上下文記憶當前對話/文件視窗中的資訊注意力機制對 KV-Cache 的檢索長文件問答、多輪對話
外部記憶引數和上下文之外的知識庫RAG(檢索增強生成)企業知識庫問答、AI 搜尋

產業的核心矛盾在於:引數記憶有上限(模型引數量有限、知識截止日期),而企業級應用對即時性、準確性和可追溯性的要求沒有上限。 這催生了從向量資料庫到 RAG pipeline 再到長上下文模型的一整條產業鏈。

市場訊號

  • 2023—2024 年,向量資料庫賽道(Pinecone、Weaviate、Milvus/Zilliz、Qdrant、Chroma)密集融資,總融資額達數億美元量級 [行業估算]。
  • 主流雲端廠商(AWS、Azure、GCP)均在資料庫服務中整合向量檢索能力。
  • NVIDIA 將 RAG pipeline 納入其 AI Enterprise 軟體棧,將其定位為推論側基礎設施。
  • Anthropic(Claude)、Google(Gemini)、OpenAI(GPT)均在模型層面支援超長上下文視窗(128K—1M+ tokens),這本質上是將”外部記憶檢索”部分內化為”上下文記憶檢索”。

15 分鐘專家深入

從 Attention 到 RAG:記憶檢索的全景圖

1. 注意力機制——最基礎的記憶檢索原語

Transformer 的自注意力(Self-Attention)本質上是一個可微的、基於內容的軟檢索操作

Query(當前 token 的需求)與所有 Key(已知資訊的索引)計算相似度
→ Softmax 歸一化為檢索權重
→ 加權聚合 Value(資訊內容)得到輸出

這意味著每一個 token 的生成都是一次記憶檢索。整個 Transformer 可以被理解為一個層級化的記憶檢索系統:

  • 每層的注意力頭負責檢索不同粒度/型別的資訊(語法、語義、世界知識等);
  • FFN 層則可以被理解為”記憶儲存”,有研究表明 FFN 的 key-value 對應關係類似於一個可查詢的記憶庫(Geva et al., 2021)。

2. KV-Cache——推論側的記憶管理挑戰

在自迴歸生成中,已計算的 Key 和 Value 向量會被快取(KV-Cache),避免重複計算。對於長上下文場景,KV-Cache 的視訊記憶體佔用是核心瓶頸:

  • 一個粗略的估算公式:KV-Cache 視訊記憶體 ≈ 2 × 層數 × 注意力頭數 × 頭維度 × 序列長度 × batch_size × 精度位元組數
  • 以 70B 引數模型、128K 上下文長度為例,單請求的 KV-Cache 可達數十 GB 量級 [估算,取決於具體架構]。

這催生了一系列KV-Cache 壓縮與檢索最佳化技術:

  • 稀疏注意力(Sparse Attention):只對部分 token 計算注意力,減少檢索範圍
  • KV-Cache 量化:將 FP16 的 KV 向量壓縮為 INT8/INT4
  • PagedAttention(vLLM):將 KV-Cache 分頁管理,提高 GPU 視訊記憶體利用率
  • 滑動視窗注意力(Sliding Window Attention):限制注意力範圍,如 Mistral 系列模型的做法
  • StreamingLLM:保留初始 token + 滑動視窗,實現理論上無限長度的流式推論

3. RAG——外部記憶檢索的標準範式

RAG(Retrieval-Augmented Generation) 是當前產業界最主流的外部記憶檢索架構:

┌─────────────┐    ┌──────────────┐    ┌──────────────┐
│  使用者查詢    │───▶│  檢索模組     │───▶│  生成模組     │
│  (Query)     │    │  (Retriever) │    │  (Generator) │
└─────────────┘    └──────┬───────┘    └──────────────┘

                   ┌──────▼───────┐
                   │  知識庫       │
                   │  (Knowledge  │
                   │   Store)     │
                   └──────────────┘

關鍵技術鏈路:

(a) 文件處理與切分(Chunking)

  • 將文件切分為適當大小的片段(chunk),常見策略包括固定長度切分、語義切分、遞迴切分等
  • chunk 大小是關鍵超參:太小丟失上下文,太大引入噪聲

(b) Embedding(向量化)

  • 使用 Embedding 模型(如 OpenAI text-embedding-3、BGE、E5、GTE 等)將文本對映為稠密向量
  • Embedding 模型的檢索質量直接決定 RAG 上限
  • 主流維度:768—3072 維 [取決於模型]

(c) 向量檢索

  • 使用 ANN(近似最近鄰)演算法在向量庫中高效檢索 Top-K 最相關片段
  • 主流演算法:HNSW(Hierarchical Navigable Small World)、IVF(Inverted File Index)、PQ(Product Quantization)
  • 核心指標:召回率(Recall@K)、查詢延遲(QPS / p99 latency)

(d) 重排序(Reranking)

  • 初步檢索後,使用 Cross-Encoder 模型對候選片段重新打分排序
  • 精度高於雙塔模型,但計算成本更高,通常只對 Top-K 候選做

(e) 上下文拼接與生成

  • 將檢索到的片段與原始查詢拼接,送入 LLM 生成最終回答
  • 拼接策略、prompt 模板設計直接影響生成質量

4. 超越 RAG:更前沿的記憶檢索範式

範式核心思路代表工作
Long-Context 直接塞入通過長上下文視窗將全部文件塞入 prompt,省去顯式檢索Gemini 1.5 Pro(1M tokens)、Claude 3(200K tokens)
Memory-Augmented AgentAgent 自主管理長期記憶的讀寫,動態決定何時檢索MemGPT/Letta、LangMem
GraphRAG用知識圖譜替代純向量檢索,保留實體關係結構Microsoft GraphRAG
自適應檢索模型自己判斷”是否需要檢索”以及”檢索什麼”Self-RAG、CRAG
引數化知識編輯不走檢索,直接修改模型引數中的知識ROME、MEMIT、T-Patcher
稀疏檢索+稠密檢索混合結合 BM25 等詞法檢索與向量語義檢索Hybrid RAG(HyDE + BM25)

技術原理

自注意力作為可微檢索:數學視角

給定輸入序列 X ∈ ℝ^(n×d):
  Q = X W_Q    (查詢矩陣)
  K = X W_K    (鍵矩陣)
  V = X W_V    (值矩陣)

注意力計算:
  Attention(Q, K, V) = softmax(Q K^T / √d_k) V

其中:
  - S = Q K^T ∈ ℝ^(n×n)  是"檢索評分矩陣"
  - softmax(S / √d_k)     是"檢索權重分佈"
  - 加權求和 V             是"檢索結果"

關鍵洞察:

  • Q K^T 計算的是查詢與所有鍵的點積相似度——這與向量資料庫中的內積檢索本質相同
  • √d_k 是溫度縮放因子,控制檢索的”集中度”:值越小,檢索越聚焦於少數最相關的 token
  • softmax 將評分歸一化為機率分佈——等價於一個軟檢索,不硬性截斷,而是加權聚合所有記憶

Multi-Head Attention:並行多路檢索

MultiHead(Q, K, V) = Concat(head_1, ..., head_h) W_O
其中 head_i = Attention(Q W_Q_i, K W_K_i, V W_V_i)
  • 每個注意力頭可以理解為一個獨立的檢索通道,關注不同型別的相似性(如語法距離、語義相似、位置相鄰等)
  • 不同頭學到的注意力模式差異顯著(有大量視覺化研究支撐),這賦予模型在單層內並行執行多種記憶檢索策略的能力

FFN 作為鍵值記憶儲存

研究(Geva et al., 2021, “Transformer Feed-Forward Layers Are Key-Value Memories”)指出:

  • FFN 第一層權重 W₁ 的每一行可視為一個”鍵”(key pattern)
  • FFN 第二層權重 W₂ 的對應列可視為一個”值”(memory value)
  • 前向傳播過程等價於:輸入與所有 key 計算匹配度 → 按匹配度加權聚合 value
FFN(x) = W₂ · σ(W₁ x + b₁) + b₂

其中:
  - W₁ 的第 i 行 = key_i(第 i 個記憶的索引模式)
  - W₂ 的第 i 列 = value_i(第 i 個記憶的內容)
  - σ(W₁ x)_i = key_i 與輸入 x 的匹配強度
  - 輸出 = Σ_i [σ(key_i · x + b₁_i) · value_i] = 按匹配度加權的記憶檢索

向量檢索的 ANN 演算法原理

大規模向量檢索不能做暴力全量掃描(O(n) 複雜度,n 為向量總數),需要 ANN(近似最近鄰)演算法:

HNSW 核心思路(示意):
┌─────────────────────────────────────────────┐
│  Layer 2:  o ──────────── o                 │  ← 粗粒度導航(跨度大)
│            │               │                │
│  Layer 1:  o ── o ── o ── o ── o            │  ← 中粒度
│            │    │    │    │    │             │
│  Layer 0:  o─o─o─o─o─o─o─o─o─o─o─o─o─o─o  │  ← 精細搜尋
└─────────────────────────────────────────────┘

查詢過程:從最高層開始貪心搜尋,逐層下降並精細化
時間複雜度:O(log n)(理想情況下)

核心權衡:

  • 召回率 vs. 速度:更高的 ef_search 引數 → 更高召回率但更慢
  • 記憶體 vs. 精度:PQ 量化壓縮減少記憶體但損失精度
  • 建置時間 vs. 查詢質量:更密的圖連線 → 更好查詢質量但更長的索引建置時間

技術演進史

時間里程碑意義
2014Neural Turing Machine (Graves et al.)首次在神經網路中引入可微讀寫的外部記憶
2015Memory Networks (Weston et al.) / End-to-End Memory Networks顯式記憶模組+注意力檢索的原型
2017Transformer (Vaswani et al.)注意力機制作為統一的記憶檢索原語
2018ELMo / BERT預訓練模型內化大量知識,隱式記憶檢索範式確立
2019REALM (Guu et al.)首次將檢索引入預訓練階段
2020DPR + RAG (Lewis et al.)RAG 範式正式確立:稠密檢索+生成式模型
2020GPT-3175B 引數展示了”引數記憶”的驚人規模(In-Context Learning 本質上是一種隱式檢索)
2022ChatGPT / InstructGPTRLHF 賦予模型更好的指令跟隨能力,RAG 開始大規模商用化
2023vLLM / PagedAttentionKV-Cache 管理的工程突破,大幅降低推論成本
2023向量資料庫融資潮Pinecone、Weaviate、Zilliz 等密集融資,基礎設施成熟
2023MemGPTAgent 自主管理記憶的範式探索
2023Self-RAG自適應檢索——模型學會”何時該檢索”
2024CRAG (Corrective RAG)糾正性檢索增強,進一步最佳化檢索質量
2024Gemini 1.5 Pro (1M tokens) / Claude 3 (200K tokens)超長上下文挑戰傳統 RAG,“直接塞入”成為可能
2024GraphRAG (Microsoft)結構化知識圖譜+社群摘要增強檢索
2024-2025長上下文+RAG 混合方案成為工程主流不再是”二選一”,而是協同最佳化

技術路線對比

維度純引數記憶RAG長上下文直塞Agent 記憶管理
知識容量受限於引數量理論無限(外部庫)受限於上下文視窗可分層管理
知識時效凍結於訓練截止即時更新(換文件即可)取決於輸入時效可動態更新
檢索精度模糊(幻覺風險高)高(可追溯來源)中(依賴模型注意力)取決於檢索策略
推論成本固定(一次前向)增加檢索延遲超長上下文推論昂貴多輪呼叫,成本不定
工程複雜度中—高(需維護 pipeline)低(但需長上下文模型)高(需記憶排程邏輯)
可解釋性高(可展示引用來源)中—高
典型場景通用問答、創意生成企業知識庫、客服、法律/醫療長文件分析、程式碼理解複雜任務編排、個人助理
當前成熟度中—高(仍在快速演進)早期探索

關鍵判斷: 短期內 RAG 仍是企業級應用的主流方案;中長期,隨著上下文視窗持續擴大+推論成本下降,長上下文與 RAG 將走向融合——模型根據任務複雜度自適應選擇檢索策略。


上下游

上游:記憶檢索的基礎設施層

┌─────────────────────────────────────────────────────────┐
│                     硬體層                                │
│  GPU (NVIDIA H100/B200)  ← 推論算力                      │
│  高頻寬記憶體 (HBM)         ← KV-Cache / 向量檢索加速        │
│  SSD/NVMe 儲存            ← 大規模向量庫冷儲存              │
├─────────────────────────────────────────────────────────┤
│                     軟體基礎設施層                         │
│  向量資料庫: Milvus/Zilliz · Pinecone · Weaviate · Qdrant │
│  搜尋引擎:   Elasticsearch (支援向量檢索) · OpenSearch      │
│  Embedding 服務: OpenAI · Cohere · Jina · BAAI (BGE)      │
│  推論架構:   vLLM · TensorRT-LLM · TGI (含 KV-Cache 最佳化) │
├─────────────────────────────────────────────────────────┤
│                     模型層                                │
│  Embedding 模型: text-embedding-3 · BGE · E5 · GTE        │
│  Reranker 模型: Cohere Rerank · BGE-Reranker · cross-encoder │
│  生成模型:   GPT-4o · Claude · Gemini · 開源 LLaMA/Mistral │
└─────────────────────────────────────────────────────────┘

中游:記憶檢索的編排層

  • RAG 架構:LangChain、LlamaIndex、Haystack、Semantic Kernel
  • Agent 架構:AutoGen、CrewAI、LangGraph(含記憶管理模組)
  • 評估工具:RAGAS、DeepEval、TruLens

下游:應用層

應用方向記憶檢索的角色代表產品/公司
企業知識庫問答RAG 檢索企業內部文件Glean、Moveworks、Dify
AI 搜尋檢索+生成替代傳統搜尋Perplexity、Arc Search
客服/銷售助手檢索產品手冊/FAQSierra、Forethought
法律/醫療/金融檢索專業文獻+合規文件Harvey、Abridge、Bloomberg GPT
程式碼助手檢索程式碼庫/文件Cursor、GitHub Copilot
個人助理跨會話記憶管理ChatGPT Memory、Rewind

關鍵指標

衡量記憶檢索質量的核心指標

指標定義行業基準參考
Recall@KTop-K 檢索結果中包含正確答案的比例優秀 RAG 系統 Recall@5 > 0.85 [行業估算]
NDCG@10考慮排序位置的檢索質量越接近 1 越好
檢索延遲(p50/p99)單次檢索請求的響應時間通常要求 < 100ms (p99)
QPS每秒查詢數,衡量吞吐取決於向量庫規模與硬體
向量維度Embedding 向量的維度數768—3072 維 [取決於模型]
向量庫規模支援儲存的向量總數主流系統支援 10 億+ 量級
端到端準確率RAG 最終回答的正確率高度依賴具體任務,難以統一基準
引用忠實度生成回答是否忠實於檢索到的上下文Faithfulness,RAGAS 架構常用

KV-Cache 效率指標

指標說明
KV-Cache 視訊記憶體佔用單請求佔用的 GPU 視訊記憶體
KV-Cache 命中率在有 KV-Cache 複用的場景中(如字首快取),快取的有效命中比例
首 token 延遲(TTFT)受檢索和預填充影響的主要指標
每 token 生成延遲(TPOT)受 KV-Cache 大小影響

供需與市場資料

需求側驅動力

  1. 企業 AI 落地的核心瓶頸:大多數企業無法(也不應該)用自有資料微調通用 LLM,RAG 是最務實的”讓 LLM 瞭解企業知識”的方案
  2. 合規與可追溯需求:醫療、法律、金融等領域需要”引用原文”,純引數記憶無法滿足
  3. 知識更新頻率:產品文件、政策法規、市場資料等頻繁變化,需要動態更新的記憶
  4. 成本效率:相比全量微調,RAG 的邊際成本更低、迭代更快

供給側格局

細分市場玩家競爭態勢
向量資料庫Pinecone(閉源SaaS)、Zilliz/Milvus(開源+雲端)、Weaviate(開源+雲端)、Qdrant(開源+雲端)、Chroma(開源輕量)、Elastic(傳統搜尋+向量)競爭激烈,Pinecone 和 Zilliz 在商業市場領先,開源陣營分化
雲端廠商內建向量能力AWS(OpenSearch + Bedrock Knowledge Bases)、Azure(AI Search)、GCP(Vertex AI Search)大廠通過捆綁效應搶佔市場
Embedding 模型OpenAI、Cohere、Jina、BAAI(開源)、Nomic開源 Embedding 模型質量追趕閉源,價格戰趨勢明顯
RAG 架構/平台LangChain、LlamaIndex、Dify、Ragas 等架構層競爭白熱化,差異化靠生態和易用性
KV-Cache 最佳化vLLM(開源)、TensorRT-LLM(NVIDIA)、SGLang(開源)推論架構層的關鍵技術壁壘

市場規模估算

  • 向量資料庫市場:2024 年約 15—25 億美元 [多家機構估算,口徑差異較大],預計 2028 年達 100 億+ 美元
  • RAG 相關工具與服務:尚無獨立市場統計,通常計入”企業 AI 應用”或”AI 基礎設施”大類
  • 向量檢索作為推論基礎設施的組成部分,其價值更多體現在降低幻覺率、提升使用者體驗從而推動 LLM 商業化,而非作為獨立營收來源

代表公司與資本對映

公司/專案角色關鍵能力資本/融資狀態
Pinecone向量資料庫(SaaS)全託管、Serverless 向量檢索2023 年 B 輪 $100M,估值 $750M [公開報道]
Zilliz向量資料庫(Milvus 背後的公司)開源 Milvus + 雲端服務 Zilliz Cloud2022 年 B+ 輪 $60M [公開報道]
Weaviate向量資料庫開源、多模態支援2023 年 B 輪 $50M [公開報道]
Qdrant向量資料庫Rust 實現,高效能2024 年 A 輪 $28M [公開報道]
LlamaIndexRAG 架構資料聯結器+索引+檢索+生成 pipeline2024 年融資,具體金額未充分揭露
LangChainAI 應用架構(含 RAG)鏈式編排、生態豐富2024 年融資約 $25M [公開報道]
Dify開源 LLMOps/RAG 平台低程式碼 RAG 應用搭建2024 年 A 輪 $23M [公開報道]
PerplexityAI 搜尋檢索+生成的搜尋體驗2024 年估值超 $1B [公開報道]
Glean企業搜尋/AI 助手企業知識檢索+生成2024 年 D 輪 $200M+ [公開報道]
MicrosoftGraphRAG + Azure AI Search圖增強檢索、雲端原生向量檢索上市公司
NVIDIA推論基礎設施TensorRT-LLM(KV-Cache 最佳化)、NeMo Retriever上市公司

A 股 / 港股對映

標的方向代表公司對映邏輯
向量資料庫 / AI 資料庫星環科技(688031)自研向量資料庫 Hippo,企業級知識庫方案
搜尋引擎 / 資訊檢索科大訊飛(002230)星火認知大型模型配套的知識檢索能力
AI 應用平台金山辦公(688111)WPS AI 中的文件問答(RAG 範式)
算力基礎設施中科曙光(603019)推論算力需求隨 RAG 部署增加而增長
資料標註/資料服務海天瑞聲(688787)Embedding 模型訓練需要高質量標註資料

注意: A 股”記憶檢索”概念的對映較為間接,多數公司涉及的是 RAG 能力的一個環節而非專注向量檢索基礎設施。投資時需區分”有相關技術能力”和”有獨立營收來源”。


投資邏輯

核心判斷

記憶檢索是 AI 商業化落地的關鍵使能層(Enabler)。

三條投資主線

主線 1:向量資料庫/檢索基礎設施(“賣鏟子”)

  • 邏輯:無論上層應用如何變化,向量檢索都是剛需基礎設施
  • 風險:傳統資料庫廠商(PostgreSQL + pgvector、Elasticsearch)蠶食獨立向量資料庫的市場;雲端廠商內建能力擠壓第三方空間
  • 判斷:獨立向量資料庫公司需要在效能或生態上建立足夠深的護城河,否則面臨被”功能化”的風險

主線 2:Embedding / Reranker 模型(“檢索質量的天花板”)

  • 邏輯:RAG 系統的上限由檢索質量決定,Embedding 模型是核心
  • 風險:開源模型(BGE、E5、GTE 系列)質量快速追趕,商業閉源模型的溢價空間被壓縮
  • 判斷:Embedding 模型的價值可能更多體現在”捆綁在平台中”而非獨立銷售

主線 3:AI 應用層(“記憶檢索創造的價值”)

  • 邏輯:記憶檢索能力使 LLM 從”通用助手”變成”行業專家”,解鎖高價值垂直場景
  • 風險:應用層護城河取決於資料飛輪和行業 know-how,而非純技術
  • 判斷:擁有行業資料壁壘的應用公司最具長期價值

風險因素

  1. 長上下文模型可能顛覆傳統 RAG:如果 10M+ tokens 上下文的推論成本降到足夠低,部分 RAG 場景會被”直接塞入”替代。但企業級場景對即時性、合規追溯的需求意味著 RAG 不會完全被替代。
  2. 開源競爭激烈:記憶檢索的多數環節(向量資料庫、RAG 架構、Embedding 模型)都有高質量開源替代,商業化溢價能力存疑。
  3. 技術迭代快:2023 年的技術棧在 2025 年可能已顯著過時,需持續追蹤技術演進。

常見誤讀糾偏

❌ 誤讀 1:「RAG 就是記憶檢索的全部」

糾偏: RAG 是外部記憶檢索的一種實現,但記憶檢索的範疇遠大於 RAG。Transformer 的注意力機制本身就是最基礎的記憶檢索操作;In-Context Learning 可以被視為一種隱式的上下文記憶檢索;模型引數中內化的世界知識是”引數記憶”。RAG 是當前最成熟、最可工程化的外部記憶檢索方案,但它只是記憶檢索全景圖中的一部分。

❌ 誤讀 2:「向量檢索 = 語義檢索,關鍵詞檢索已經過時」

糾偏: 向量檢索擅長捕捉語義相似性,但在精確匹配場景(如產品編號、法律條文編號、人名/地名等專有名詞)上,傳統的關鍵詞檢索(如 BM25)往往更準確。成熟的生產級 RAG 系統通常採用混合檢索(Hybrid Search)——同時使用向量檢索和關鍵詞檢索,然後合併排序。這已被多個實際部署案例驗證為最優實踐。

❌ 誤讀 3:「上下文視窗越長,RAG 就不需要了」

糾偏: 超長上下文在技術上可行,但面臨三個現實約束:① 成本——1M tokens 上下文的推論成本遠高於 RAG 檢索 Top-K 片段後推論;② 注意力退化——“Lost in the Middle”現象表明模型對長上下文中間部分的資訊關注度顯著下降(Liu et al., 2023);③ 即時性——外部知識庫持續更新,RAG 可以在每次查詢時獲取最新資訊,而長上下文需要重新載入。長期來看,兩者互補而非替代。

❌ 誤讀 4:「Embedding 模型越大,檢索效果越好」

糾偏: Embedding 模型的檢索效果取決於訓練資料質量、訓練目標(對比學習策略)和領域適配性,而非單純的模型引數量。小但針對特定領域微調的 Embedding 模型,在該領域上往往優於通用大型模型。此外,Embedding 模型還需要考慮推論延遲——它在 RAG pipeline 中處於查詢的熱路徑上,延遲敏感。


學習路徑

入門(理解概念)

  1. 閱讀 Jay Alammar 的圖解 Transformer 系列,理解注意力機制的本質
  2. 閱讀 Lilian Weng 的部落格文章 “Prompt Engineering”“Retrieval-Augmented Generation”
  3. 使用 LangChain 或 LlamaIndex 搭建一個簡單的 RAG demo

進階(理解工程)

  1. 學習向量資料庫的原理——閱讀 HNSW 論文(Malkov & Yashunin, 2016)
  2. 瞭解 vLLM 的 PagedAttention 設計(Kwon et al., 2023)
  3. 實現一個完整的 RAG pipeline——包含文件解析、chunking、embedding、向量檢索、reranking、生成
  4. 使用 RAGAS 等工具對 RAG 系統進行系統性評估

高階(理解前沿)

  1. 精讀論文:REALM (Guu et al., 2020)、DPR (Karpukhin et al., 2020)、RAG (Lewis et al., 2020)
  2. 研究 CRAG (Corrective RAG) 和 Self-RAG 的自適應檢索機制
  3. 探索 GraphRAG 和 Agent 記憶管理的架構設計
  4. 實驗混合檢索、重排序和分塊策略的組合最佳化

本章節內容基於截至 2025 年 4 月的公開資訊與行業實踐,具體技術細節和公司資料請以最新公開文件為準。

source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型