模型層 開放閱讀

長期記憶

Long-Term Memory

概念 ID
long-term-memory
更新時間
2026-05-29
來源數量
待補

長期記憶(Long-Term Memory, LTM)

1. 3 秒看懂

長期記憶 = 讓 AI 突破”金魚記憶”的技術棧。大語言模型的上下文視窗(Context Window)就像工作臺——放下新資訊就必須丟掉舊資訊。長期記憶通過外部儲存、檢索增強、壓縮摘要等機制,讓 AI 能跨越數月甚至永久地保留和呼叫資訊,是從”一次性對話工具”進化為”持續陪伴智慧代理”的核心基建。

2. 3 分鐘產業解釋

為什麼現在所有人都在談長期記憶?

2024-2025 年,AI 產業的核心敘事從”更大的模型”轉向”更有用的 Agent”。Agent 的區別性特徵不是引數量,而是能否積累經驗、記住使用者偏好、在多輪任務中保持連貫——這一切都指向長期記憶。

產業推力:

  • 使用者體驗瓶頸:使用者每次重啟對話都要重新自我介紹,體驗斷裂。
  • Agent 經濟性:沒有記憶的 Agent 無法進行復雜多步任務規劃,每次從零推論浪費大量算力。
  • 商業模式需要:個性化服務(醫療、教育、金融顧問)的核心資產就是使用者畫像——本質上是長期記憶。
  • 競品差異化:當基座模型能力趨於收斂,記憶系統成為 To-C 產品的關鍵護城河。

產業鏈關鍵環節:

環節代表技術/方案價值量
儲存層向量資料庫(Milvus、Pinecone、Weaviate)、圖資料庫(Neo4j)、KV 儲存
編碼層Embedding 模型(text-embedding 系列)、多模態編碼器
檢索層ANN 搜尋(HNSW、IVF)、重排序(Reranker)
管理層記憶排程器、摘要壓縮器、遺忘機制高(差異化關鍵)
應用層Agent 架構(LangChain、MemGPT/Letta、AutoGen)

3. 15 分鐘專家深入

3.1 記憶的定義:AI 語境下的”長期”是什麼?

在人類認知科學中,長期記憶(LTM)指不受即時複述維持、可長期保留的資訊系統,與工作記憶(Working Memory,容量有限、持續數秒到數分鐘)相對。

對映到 AI 系統:

類比維度人類認知AI 系統
工作記憶前額葉皮層,容量 ~7±2 項Transformer 的 KV Cache / 上下文視窗
短期記憶海馬體暫存,數小時至數天單次會話的對話歷史快取
長期記憶皮層分散式儲存,永久性向量資料庫 + 檢索 + 注入上下文
情景記憶具體事件的時空印記事件日誌(帶時間戳的對話/互動記錄)
語義記憶抽象知識、概念關係知識圖譜 / 結構化摘要

核心矛盾: Transformer 架構的注意力機制複雜度為 O(n²)(相對於序列長度),這意味著上下文視窗有理論上的效率天花板。即便通過工程最佳化將上下文擴充套件到百萬 token 級別,“全量放在上下文裡”既不經濟也不精確——這就是為什麼需要外部長期記憶系統

3.2 長期記憶的技術圖譜

當前業界實現長期記憶的主流路徑可歸納為 四大範式

範式一:檢索增強記憶(RAG-based Memory) 將歷史資訊編碼為向量,存入外部資料庫;查詢時通過語義檢索召回相關片段,注入到 prompt 中。

  • 優點:實現簡單、可擴充套件、與現有 LLM 解耦
  • 缺點:檢索質量是瓶頸;“不知道自己記住了什麼”(缺乏主動回憶能力)

範式二:長上下文視窗(Extended Context) 直接擴充套件模型的上下文視窗,將更多歷史資訊”原封不動”放入工作記憶。

  • 代表:UC Berkeley 等機構提出的 Ring Attention、Google 的 Infini-Attention 等架構探索
  • 優點:資訊保真度高、無需額外檢索系統
  • 缺點:計算成本隨視窗長度增長(即便線性化最佳化也代價不菲);存在”Lost in the Middle”現象——模型對中間位置資訊的注意力衰減

範式三:壓縮式記憶(Compressed/Abstracted Memory) 對歷史互動進行摘要、蒸餾,只保留核心資訊的壓縮表示。

  • 代表:MemGPT/Letta 的分層記憶架構(recall memory → archival memory → core memory)
  • 優點:儲存效率高、可維護
  • 缺點:壓縮過程不可避免地丟失細節;摘要質量依賴生成模型能力

範式四:引數化記憶(Parametric Memory) 將知識直接編碼進模型引數,通過微調(Fine-tuning)或持續學習(Continual Learning)實現。

  • 優點:推論時無需外部檢索、延遲低
  • 缺點:災難性遺忘(Catastrophic Forgetting)風險;更新成本高;難以解釋和編輯

實踐中的最優解往往是混合方案: RAG 處理事實性知識 + 壓縮摘要管理對話歷史 + 引數化記憶固化高頻使用的使用者偏好。


4. 技術原理(最深)

4.1 Transformer 的”記憶困境”

┌──────────────────────────────────────────────────┐
│              Transformer 上下文視窗                │
│                                                    │
│  [token_1] [token_2] ... [token_n]                │
│       ↓         ↓            ↓                     │
│  ┌─────────────────────────────────┐              │
│  │   Self-Attention: Q·K^T / √d_k  │              │
│  │   複雜度 O(n²)  空間 O(n²)       │              │
│  └─────────────────────────────────┘              │
│                                                    │
│  視窗滿了 → 最早的 token 被擠出 → 資訊永久丟失     │
└──────────────────────────────────────────────────┘

KV Cache 本質是”工作記憶”:推論時,每個已生成 token 的 Key 和 Value 向量被快取,供後續 token 的注意力計算使用。KV Cache 的大小 = 2 × n_layers × n_heads × d_head × seq_len × dtype_bytes。對於大型模型,單個請求的 KV Cache 可達數 GB 量級 [估算]。這部分是易失性儲存,會話結束即銷燬。

4.2 RAG 長期記憶管線的完整流程

┌─────────────────────────────────────────────────────────┐
│                    寫入路徑(記憶編碼)                    │
│                                                          │
│  使用者互動/Agent觀察                                       │
│       ↓                                                  │
│  ┌──────────────┐   ┌──────────────┐                    │
│  │ 資訊提取器    │   │ 重要性評分器  │ ← 判斷是否值得記住  │
│  │ (NER/LLM)   │   │ (啟發式/LLM) │                    │
│  └──────┬───────┘   └──────┬───────┘                    │
│         ↓                   ↓                            │
│  ┌──────────────────────────────┐                       │
│  │  Embedding 模型              │                       │
│  │  (e.g., text-embedding-3-*)  │                       │
│  └──────────────┬───────────────┘                       │
│                 ↓                                        │
│  ┌──────────────────────────────┐  ┌───────────────┐   │
│  │  向量資料庫                   │  │  後設資料儲存    │   │
│  │  (embedding + chunk_id)      │  │ (時間/來源/   │   │
│  │                              │  │  使用者/型別)   │   │
│  └──────────────────────────────┘  └───────────────┘   │
└─────────────────────────────────────────────────────────┘

┌─────────────────────────────────────────────────────────┐
│                    讀取路徑(記憶檢索)                    │
│                                                          │
│  新查詢 Q                                                │
│    ↓                                                     │
│  ┌──────────────┐                                       │
│  │ Embedding(Q) │                                       │
│  └──────┬───────┘                                       │
│         ↓                                                │
│  ┌──────────────────────────────┐                       │
│  │  ANN 近似最近鄰搜尋           │                       │
│  │  (HNSW / IVF-PQ / ScaNN)    │                       │
│  │  Top-K 候選                   │                       │
│  └──────────────┬───────────────┘                       │
│                 ↓                                        │
│  ┌──────────────────────────────┐                       │
│  │  重排序 (Cross-Encoder)      │                       │
│  │  + 後設資料過濾                  │                       │
│  └──────────────┬───────────────┘                       │
│                 ↓                                        │
│  ┌──────────────────────────────┐                       │
│  │  注入 Prompt / 上下文組裝      │                       │
│  │  [System] + [檢索到的記憶]    │                       │
│  │  + [當前對話]                  │                       │
│  └──────────────────────────────┘                       │
└─────────────────────────────────────────────────────────┘

關鍵引數與權衡:

  • Chunk Size:文本分塊大小。過小丟失上下文語義,過大降低檢索精度。實踐中常見 256-1024 token 範圍 [行業通用實踐]。
  • Top-K:檢索召回數量。K 越大資訊越全但上下文佔用越多。典型值 3-10 [行業通用實踐]。
  • Embedding 維度:直接影響儲存成本和檢索精度。常見 768-3072 維 [估算,取決於具體 embedding 模型]。
  • ANN 索引型別:HNSW(記憶體佔用高但查詢快)、IVF-PQ(壓縮儲存適合大規模)、ScaNN(Google 提出,查詢效率優)。

4.3 MemGPT/Letta 的分層記憶架構

┌──────────────────────────────────────────────────┐
│              MemGPT 虛擬記憶體管理                   │
│                                                    │
│  ┌─────────────────────────────────────┐          │
│  │  Core Memory (系統提示區)             │          │
│  │  - 人格設定、使用者畫像、當前目標        │          │
│  │  - 始終在上下文中,可被 Agent 主動編輯 │          │
│  │  - 類比:人類的"自我意識"和"身份"      │          │
│  └─────────────────────────────────────┘          │
│                                                    │
│  ┌─────────────────────────────────────┐          │
│  │  Recall Memory (對話歷史)             │          │
│  │  - 全量對話記錄,存於外部資料庫        │          │
│  │  - Agent 可通過函式呼叫檢索歷史片段    │          │
│  │  - 類比:人類的"情景記憶"             │          │
│  └─────────────────────────────────────┘          │
│                                                    │
│  ┌─────────────────────────────────────┐          │
│  │  Archival Memory (長期知識庫)         │          │
│  │  - 事實、偏好、文件、學習筆記          │          │
│  │  - 向量檢索訪問                       │          │
│  │  - 類比:人類的"語義記憶"             │          │
│  └─────────────────────────────────────┘          │
│                                                    │
│  核心創新:Agent 自主決定                             │
│  ① 什麼時候寫入記憶                                 │
│  ② 什麼時候檢索記憶                                 │
│  ③ 什麼時候更新核心記憶                             │
│  → 用 function calling 實現 "虛擬分頁"              │
└──────────────────────────────────────────────────┘

MemGPT 的關鍵洞察: 作業系統用虛擬記憶體讓程式”以為”自己擁有無限 RAM,MemGPT 用 function calling 讓 LLM”以為”自己擁有無限上下文。Agent 學習何時 page-in(檢索歷史)和 page-out(摘要儲存),本質是對人類記憶管理策略的形式化。

4.4 Infini-Attention 與線性化長期記憶

Google Research 提出的 Infini-attention [Google Research, 2024] 嘗試在注意力層內部實現長期記憶:

  • 在標準 causal attention 之上增加一個**壓縮記憶(compressive memory)**模組
  • 用線性注意力機制將過去的 KV 對壓縮為固定大小的 M 矩陣
  • 檢索時通過使用 sigmoid 啟用後的查詢與記憶矩陣運算:A_mem = σ(Q) · M
  • 結合門控機制(gating)平衡”當前上下文注意力”和”長期記憶檢索”
┌─────────────────────────────────────────────────┐
│  Infini-Attention (單層示意)                      │
│                                                   │
│  當前段 Q, K, V ──→ 標準 Attention ──→ A_local   │
│       │                                          │
│       ↓                                          │
│  壓縮記憶 M (固定大小)                             │
│  M += σ(K)^T · V    ← 更新記憶                   │
│  A_mem = σ(Q) · M   ← 檢索記憶                   │
│       │                                          │
│       ↓                                          │
│  A_out = gate · A_mem + (1-gate) · A_local       │
└─────────────────────────────────────────────────┘

技術意義: 將長期記憶內化到 Transformer 層中,理論上可處理無限長序列,且每個 segment 的計算保持標準注意力效率。

侷限: 壓縮記憶本質上是有失真壓縮,資訊檢索精度不如精確的外部向量檢索。

4.5 記憶的”遺忘”機制

好的長期記憶系統必須解決遺忘問題——不是 bug,而是 feature:

  • 時間衰減(Recency Bias):越久遠的記憶權重越低,模擬人類的 Ebbinghaus 遺忘曲線
  • 重要性加權(Importance Weighting):用 LLM 或啟發式規則評估資訊重要性,重要記憶持久儲存
  • 衝突覆蓋(Conflict Resolution):新資訊與舊記憶矛盾時,更新或標記舊記憶為”過時”
  • 主動遺忘(Active Forgetting):定期清理低價值記憶,控制儲存成本

5. 技術演進史

時間里程碑核心貢獻
~2014Neural Turing Machines (NTM)首次將可微分外部記憶引入神經網路,用讀寫頭操作記憶矩陣
~2015Memory Networks / End-to-End Memory NetworksFacebook AI 提出,多跳推論 + 外部記憶,奠定 QA 場景基礎
~2016-2017Key-Value Memory Networks區分記憶的 key 和 value,提升檢索靈活性
~2018-2019Transformer 長上下文探索Transformer-XL(段級遞迴)、Compressive Transformer(壓縮舊段)
~2020RAG (Retrieval-Augmented Generation)Facebook/Meta 提出,將檢索與生成正式結合,成為 LLM 外部記憶的標準範式
~2022-2023長上下文視窗競賽各廠商將上下文從 4K → 32K → 128K → 更長擴充套件
~2023.10MemGPT首個明確以”作業系統虛擬記憶體”類比建置 LLM 記憶管理系統的架構
~2024Infini-attentionGoogle 提出將長期記憶內化到注意力層中
~2024-2025Agent 記憶產品化OpenAI 為 ChatGPT 增加使用者記憶功能;各類 Agent 架構整合記憶模組
2025+記憶標準化、多模態記憶記憶介面標準化趨勢;影像/影片/音訊的長期記憶融合

6. 技術路線對比

維度擴充套件上下文視窗RAG 外部檢索壓縮式記憶引數化記憶(微調)
記憶容量理論上隨視窗大小線性增長理論上無限(取決於儲存)有限(取決於壓縮比)有限(取決於引數量)
檢索精度高(原始資訊)中-高(依賴 embedding 質量)中(壓縮損失)不可檢索(黑箱)
更新延遲即時(加入上下文)低(寫入向量庫)中(需重新摘要)高(需重新微調)
推論成本高(注意力 O(n²),需最佳化)低(只檢索少量片段)低(推論時無額外開銷)
可解釋性高(可展示來源)
代表方案100K+ context models, Ring AttentionLangChain RAG, LlamaIndexMemGPT core/summary memoryLoRA 微調、知識蒸餾
適用場景文件分析、程式碼理解知識庫 QA、企業搜尋個人助手、長期陪伴領域適配、個性化

7. 上下游

上游(供給端)

  • 向量資料庫:Pinecone(雲端原生)、Milvus/Zilliz(開源)、Weaviate、Qdrant、ChromaDB
  • Embedding 模型供應商:OpenAI(text-embedding 系列)、Cohere(embed-v3)、開源(BGE、E5、GTE 系列)
  • 儲存基礎設施:雲端物件儲存(S3/GCS/Azure Blob)、SSD/NVMe(用於熱記憶)
  • GPU/算力:Embedding 計算、Reranker 推論均需算力
  • 知識圖譜:Neo4j、Nebula Graph(用於結構化語義記憶)

下游(需求端)

  • AI 助手/聊天機器人:ChatGPT Memory、Claude 專案記憶
  • 企業知識管理:內部文件檢索、客服知識庫
  • AI Agent 平台:自主任務執行 Agent 需要任務狀態持久化
  • 垂直場景:醫療(患者長期記錄)、教育(學習進度追蹤)、金融(客戶畫像)
  • 遊戲/虛擬世界:NPC 長期記憶、開放世界角色一致性
  • 具身智慧:機器人需要記住環境版面配置和操作經驗

8. 關鍵指標

指標含義當前業界水平(估算)
記憶容量可儲存的資訊條目數向量庫:十億級向量可行
檢索延遲(P99)從查詢到返回相關記憶的時間熱路徑:<50ms;冷路徑:數百 ms [估算]
檢索召回率@KTop-K 結果中包含正確記憶的比例依賴 embedding 質量和 chunk 策略,業界差異大
記憶保真度儲存和檢索過程中資訊損失程度原文儲存 > 摘要儲存 > 引數化
寫入吞吐單位時間可寫入的記憶條目數受 embedding 計算和資料庫寫入制約
遺忘準確性能否正確丟棄低價值記憶而保留高價值記憶當前主要靠啟發式規則,LLM 評估成本高
跨會話一致性多次會話間記憶是否衝突知識圖譜 > 向量庫(向量庫缺乏衝突檢測)

9. 供需與市場資料

⚠️ 以下市場資料均為 [行業估算 / 第三方報告],不同口徑差異較大,請注意交叉驗證。

市場規模:

  • 向量資料庫市場:2024 年規模約數億美元量級 [行業估算],年增長率被多個分析機構預測為 20-30% CAGR 級別
  • 整個 AI 記憶/檢索基礎設施市場尚處早期,尚無權威的獨立市場規模統計

供需特徵:

  • 需求側爆發:Agent 部署量增長驅動記憶系統需求。每一個長週期執行的 Agent 例項都需要持久化記憶。
  • 供給側競爭:向量資料庫賽道競爭激烈(Pinecone、Milvus、Weaviate、Qdrant、Chroma 等),開源 vs 雲端原生格局分化。
  • 關鍵瓶頸轉移:從”存不存得了”(儲存容量)轉向”找不找得到”(檢索質量)和”管不管得好”(記憶生命週期管理)。
  • 成本結構:Embedding 計算(GPU)+ 向量儲存(記憶體/SSD)+ 檢索計算。大規模部署下,embedding 計算和向量儲存的基礎設施成本佔比高 [估算]。

10. 代表公司與資本對映

類別代表公司/專案核心定位資本狀態
向量資料庫Pinecone雲端原生向量資料庫已獲大額融資,估值未充分揭露
向量資料庫Zilliz (Milvus)開源向量資料庫已獲多輪融資 [公開報道]
向量資料庫Weaviate開源向量資料庫,多模態支援已獲多輪融資 [公開報道]
向量資料庫Qdrant高效能開源向量檢索已獲融資 [公開報道]
Agent 記憶架構Letta (原 MemGPT)分層記憶管理已獲融資 [公開報道]
檢索架構LlamaIndex資料連線與檢索架構已獲融資 [公開報道]
檢索架構LangChainAgent/鏈編排架構(含 RAG)已獲融資 [公開報道]
EmbeddingCohereEmbedding + Reranker API已獲大額融資 [公開報道]
平台廠商OpenAIChatGPT Memory(內建長期記憶)核心產品功能
平台廠商GoogleGemini 長上下文 + Infini-attention 研究核心技術儲備
雲端廠商AWS / Azure / GCP向量搜尋服務(Bedrock Knowledge Base / Azure AI Search / Vertex AI)平台能力

A 股/港股對映線索(需自行驗證最新股價和業務純度):

  • 向量資料庫概念:關注資料庫/大數據基礎設施類公司
  • RAG 概念:關注搜尋、NLP、知識圖譜相關標的
  • Agent 概念:關注 AI 應用層公司中版面配置記憶/個性化能力的標的

11. 投資邏輯

核心邏輯鏈

Agent 從 Demo → 生產級部署

需要跨會話持久化的記憶能力

記憶基礎設施(向量庫 + 檢索 + 管理)成為剛需

記憶系統的差異化 → 產品體驗的差異化 → 付費意願的差異化

投資維度拆解

① 基礎設施層:向量資料庫 / 記憶儲存

  • 邏輯:記憶必須有個地方存。向量資料庫是長期記憶的”硬碟”。
  • 風險:資料庫賽道競爭激烈,護城河可能不夠深;大廠(AWS/Azure/Google)自建服務擠壓獨立廠商空間。
  • 關注:技術性能(檢索速度、可擴充套件性)、生態整合度、開源社群活躍度。

② 中介軟體層:檢索編排 / 記憶管理架構

  • 邏輯:誰能讓記憶系統”好用”誰就有價值。記憶的寫入策略、檢索質量、遺忘機制是真正的差異化。
  • 風險:中介軟體可能被平台廠商內化(如 OpenAI 直接內建 Memory)。
  • 關注:開發者採用率、與主流 LLM 的整合度。

③ 應用層:具備長期記憶能力的 C 端/B 端產品

  • 邏輯:記憶是 AI 產品從”工具”變為”助手”的關鍵躍遷點。有記憶的 AI 助手使用者粘性顯著更高。
  • 風險:使用者隱私和資料安全的合規壓力;記憶”失準”導致的信任危機。
  • 關注:使用者留存率、付費轉化率、記憶功能使用深度。

催化劑與風險

催化劑風險
Agent 大規模商用模型上下文視窗持續擴充套件可能壓縮 RAG 需求
記憶標準協議出現(類似 MCP)大廠免費提供記憶功能擠壓創業公司
多模態記憶突破隱私法規收緊限制記憶資料收集
個性化 AI 付費意願驗證記憶幻覺/汙染問題損害使用者信任

12. 常見誤讀糾偏

❌ 誤讀一:“上下文視窗越長就不需要長期記憶了”

糾偏: 上下文視窗是工作記憶,不是長期記憶。即使上下文達到 100 萬 token,以下問題仍然

source: 公開揭露與公開資料整理 本頁僅用於產業鏈學習、資訊檢索和研究輔助;不構成投資建議,不預測漲跌,不提供買賣、部位或目標價建議。
完整概念頁 複盤 13 節結構 公司投研頁 沿產業鏈找到受益公司 投資課 把概念轉成可跟蹤模型