長期記憶(Long-Term Memory, LTM)
1. 3 秒看懂
長期記憶 = 讓 AI 突破”金魚記憶”的技術棧。大語言模型的上下文視窗(Context Window)就像工作臺——放下新資訊就必須丟掉舊資訊。長期記憶通過外部儲存、檢索增強、壓縮摘要等機制,讓 AI 能跨越數月甚至永久地保留和呼叫資訊,是從”一次性對話工具”進化為”持續陪伴智慧代理”的核心基建。
2. 3 分鐘產業解釋
為什麼現在所有人都在談長期記憶?
2024-2025 年,AI 產業的核心敘事從”更大的模型”轉向”更有用的 Agent”。Agent 的區別性特徵不是引數量,而是能否積累經驗、記住使用者偏好、在多輪任務中保持連貫——這一切都指向長期記憶。
產業推力:
- 使用者體驗瓶頸:使用者每次重啟對話都要重新自我介紹,體驗斷裂。
- Agent 經濟性:沒有記憶的 Agent 無法進行復雜多步任務規劃,每次從零推論浪費大量算力。
- 商業模式需要:個性化服務(醫療、教育、金融顧問)的核心資產就是使用者畫像——本質上是長期記憶。
- 競品差異化:當基座模型能力趨於收斂,記憶系統成為 To-C 產品的關鍵護城河。
產業鏈關鍵環節:
| 環節 | 代表技術/方案 | 價值量 |
|---|---|---|
| 儲存層 | 向量資料庫(Milvus、Pinecone、Weaviate)、圖資料庫(Neo4j)、KV 儲存 | 中 |
| 編碼層 | Embedding 模型(text-embedding 系列)、多模態編碼器 | 中 |
| 檢索層 | ANN 搜尋(HNSW、IVF)、重排序(Reranker) | 中 |
| 管理層 | 記憶排程器、摘要壓縮器、遺忘機制 | 高(差異化關鍵) |
| 應用層 | Agent 架構(LangChain、MemGPT/Letta、AutoGen) | 高 |
3. 15 分鐘專家深入
3.1 記憶的定義:AI 語境下的”長期”是什麼?
在人類認知科學中,長期記憶(LTM)指不受即時複述維持、可長期保留的資訊系統,與工作記憶(Working Memory,容量有限、持續數秒到數分鐘)相對。
對映到 AI 系統:
| 類比維度 | 人類認知 | AI 系統 |
|---|---|---|
| 工作記憶 | 前額葉皮層,容量 ~7±2 項 | Transformer 的 KV Cache / 上下文視窗 |
| 短期記憶 | 海馬體暫存,數小時至數天 | 單次會話的對話歷史快取 |
| 長期記憶 | 皮層分散式儲存,永久性 | 向量資料庫 + 檢索 + 注入上下文 |
| 情景記憶 | 具體事件的時空印記 | 事件日誌(帶時間戳的對話/互動記錄) |
| 語義記憶 | 抽象知識、概念關係 | 知識圖譜 / 結構化摘要 |
核心矛盾: Transformer 架構的注意力機制複雜度為 O(n²)(相對於序列長度),這意味著上下文視窗有理論上的效率天花板。即便通過工程最佳化將上下文擴充套件到百萬 token 級別,“全量放在上下文裡”既不經濟也不精確——這就是為什麼需要外部長期記憶系統。
3.2 長期記憶的技術圖譜
當前業界實現長期記憶的主流路徑可歸納為 四大範式:
範式一:檢索增強記憶(RAG-based Memory) 將歷史資訊編碼為向量,存入外部資料庫;查詢時通過語義檢索召回相關片段,注入到 prompt 中。
- 優點:實現簡單、可擴充套件、與現有 LLM 解耦
- 缺點:檢索質量是瓶頸;“不知道自己記住了什麼”(缺乏主動回憶能力)
範式二:長上下文視窗(Extended Context) 直接擴充套件模型的上下文視窗,將更多歷史資訊”原封不動”放入工作記憶。
- 代表:UC Berkeley 等機構提出的 Ring Attention、Google 的 Infini-Attention 等架構探索
- 優點:資訊保真度高、無需額外檢索系統
- 缺點:計算成本隨視窗長度增長(即便線性化最佳化也代價不菲);存在”Lost in the Middle”現象——模型對中間位置資訊的注意力衰減
範式三:壓縮式記憶(Compressed/Abstracted Memory) 對歷史互動進行摘要、蒸餾,只保留核心資訊的壓縮表示。
- 代表:MemGPT/Letta 的分層記憶架構(recall memory → archival memory → core memory)
- 優點:儲存效率高、可維護
- 缺點:壓縮過程不可避免地丟失細節;摘要質量依賴生成模型能力
範式四:引數化記憶(Parametric Memory) 將知識直接編碼進模型引數,通過微調(Fine-tuning)或持續學習(Continual Learning)實現。
- 優點:推論時無需外部檢索、延遲低
- 缺點:災難性遺忘(Catastrophic Forgetting)風險;更新成本高;難以解釋和編輯
實踐中的最優解往往是混合方案: RAG 處理事實性知識 + 壓縮摘要管理對話歷史 + 引數化記憶固化高頻使用的使用者偏好。
4. 技術原理(最深)
4.1 Transformer 的”記憶困境”
┌──────────────────────────────────────────────────┐
│ Transformer 上下文視窗 │
│ │
│ [token_1] [token_2] ... [token_n] │
│ ↓ ↓ ↓ │
│ ┌─────────────────────────────────┐ │
│ │ Self-Attention: Q·K^T / √d_k │ │
│ │ 複雜度 O(n²) 空間 O(n²) │ │
│ └─────────────────────────────────┘ │
│ │
│ 視窗滿了 → 最早的 token 被擠出 → 資訊永久丟失 │
└──────────────────────────────────────────────────┘
KV Cache 本質是”工作記憶”:推論時,每個已生成 token 的 Key 和 Value 向量被快取,供後續 token 的注意力計算使用。KV Cache 的大小 = 2 × n_layers × n_heads × d_head × seq_len × dtype_bytes。對於大型模型,單個請求的 KV Cache 可達數 GB 量級 [估算]。這部分是易失性儲存,會話結束即銷燬。
4.2 RAG 長期記憶管線的完整流程
┌─────────────────────────────────────────────────────────┐
│ 寫入路徑(記憶編碼) │
│ │
│ 使用者互動/Agent觀察 │
│ ↓ │
│ ┌──────────────┐ ┌──────────────┐ │
│ │ 資訊提取器 │ │ 重要性評分器 │ ← 判斷是否值得記住 │
│ │ (NER/LLM) │ │ (啟發式/LLM) │ │
│ └──────┬───────┘ └──────┬───────┘ │
│ ↓ ↓ │
│ ┌──────────────────────────────┐ │
│ │ Embedding 模型 │ │
│ │ (e.g., text-embedding-3-*) │ │
│ └──────────────┬───────────────┘ │
│ ↓ │
│ ┌──────────────────────────────┐ ┌───────────────┐ │
│ │ 向量資料庫 │ │ 後設資料儲存 │ │
│ │ (embedding + chunk_id) │ │ (時間/來源/ │ │
│ │ │ │ 使用者/型別) │ │
│ └──────────────────────────────┘ └───────────────┘ │
└─────────────────────────────────────────────────────────┘
┌─────────────────────────────────────────────────────────┐
│ 讀取路徑(記憶檢索) │
│ │
│ 新查詢 Q │
│ ↓ │
│ ┌──────────────┐ │
│ │ Embedding(Q) │ │
│ └──────┬───────┘ │
│ ↓ │
│ ┌──────────────────────────────┐ │
│ │ ANN 近似最近鄰搜尋 │ │
│ │ (HNSW / IVF-PQ / ScaNN) │ │
│ │ Top-K 候選 │ │
│ └──────────────┬───────────────┘ │
│ ↓ │
│ ┌──────────────────────────────┐ │
│ │ 重排序 (Cross-Encoder) │ │
│ │ + 後設資料過濾 │ │
│ └──────────────┬───────────────┘ │
│ ↓ │
│ ┌──────────────────────────────┐ │
│ │ 注入 Prompt / 上下文組裝 │ │
│ │ [System] + [檢索到的記憶] │ │
│ │ + [當前對話] │ │
│ └──────────────────────────────┘ │
└─────────────────────────────────────────────────────────┘
關鍵引數與權衡:
- Chunk Size:文本分塊大小。過小丟失上下文語義,過大降低檢索精度。實踐中常見 256-1024 token 範圍 [行業通用實踐]。
- Top-K:檢索召回數量。K 越大資訊越全但上下文佔用越多。典型值 3-10 [行業通用實踐]。
- Embedding 維度:直接影響儲存成本和檢索精度。常見 768-3072 維 [估算,取決於具體 embedding 模型]。
- ANN 索引型別:HNSW(記憶體佔用高但查詢快)、IVF-PQ(壓縮儲存適合大規模)、ScaNN(Google 提出,查詢效率優)。
4.3 MemGPT/Letta 的分層記憶架構
┌──────────────────────────────────────────────────┐
│ MemGPT 虛擬記憶體管理 │
│ │
│ ┌─────────────────────────────────────┐ │
│ │ Core Memory (系統提示區) │ │
│ │ - 人格設定、使用者畫像、當前目標 │ │
│ │ - 始終在上下文中,可被 Agent 主動編輯 │ │
│ │ - 類比:人類的"自我意識"和"身份" │ │
│ └─────────────────────────────────────┘ │
│ │
│ ┌─────────────────────────────────────┐ │
│ │ Recall Memory (對話歷史) │ │
│ │ - 全量對話記錄,存於外部資料庫 │ │
│ │ - Agent 可通過函式呼叫檢索歷史片段 │ │
│ │ - 類比:人類的"情景記憶" │ │
│ └─────────────────────────────────────┘ │
│ │
│ ┌─────────────────────────────────────┐ │
│ │ Archival Memory (長期知識庫) │ │
│ │ - 事實、偏好、文件、學習筆記 │ │
│ │ - 向量檢索訪問 │ │
│ │ - 類比:人類的"語義記憶" │ │
│ └─────────────────────────────────────┘ │
│ │
│ 核心創新:Agent 自主決定 │
│ ① 什麼時候寫入記憶 │
│ ② 什麼時候檢索記憶 │
│ ③ 什麼時候更新核心記憶 │
│ → 用 function calling 實現 "虛擬分頁" │
└──────────────────────────────────────────────────┘
MemGPT 的關鍵洞察: 作業系統用虛擬記憶體讓程式”以為”自己擁有無限 RAM,MemGPT 用 function calling 讓 LLM”以為”自己擁有無限上下文。Agent 學習何時 page-in(檢索歷史)和 page-out(摘要儲存),本質是對人類記憶管理策略的形式化。
4.4 Infini-Attention 與線性化長期記憶
Google Research 提出的 Infini-attention [Google Research, 2024] 嘗試在注意力層內部實現長期記憶:
- 在標準 causal attention 之上增加一個**壓縮記憶(compressive memory)**模組
- 用線性注意力機制將過去的 KV 對壓縮為固定大小的 M 矩陣
- 檢索時通過使用 sigmoid 啟用後的查詢與記憶矩陣運算:
A_mem = σ(Q) · M - 結合門控機制(gating)平衡”當前上下文注意力”和”長期記憶檢索”
┌─────────────────────────────────────────────────┐
│ Infini-Attention (單層示意) │
│ │
│ 當前段 Q, K, V ──→ 標準 Attention ──→ A_local │
│ │ │
│ ↓ │
│ 壓縮記憶 M (固定大小) │
│ M += σ(K)^T · V ← 更新記憶 │
│ A_mem = σ(Q) · M ← 檢索記憶 │
│ │ │
│ ↓ │
│ A_out = gate · A_mem + (1-gate) · A_local │
└─────────────────────────────────────────────────┘
技術意義: 將長期記憶內化到 Transformer 層中,理論上可處理無限長序列,且每個 segment 的計算保持標準注意力效率。
侷限: 壓縮記憶本質上是有失真壓縮,資訊檢索精度不如精確的外部向量檢索。
4.5 記憶的”遺忘”機制
好的長期記憶系統必須解決遺忘問題——不是 bug,而是 feature:
- 時間衰減(Recency Bias):越久遠的記憶權重越低,模擬人類的 Ebbinghaus 遺忘曲線
- 重要性加權(Importance Weighting):用 LLM 或啟發式規則評估資訊重要性,重要記憶持久儲存
- 衝突覆蓋(Conflict Resolution):新資訊與舊記憶矛盾時,更新或標記舊記憶為”過時”
- 主動遺忘(Active Forgetting):定期清理低價值記憶,控制儲存成本
5. 技術演進史
| 時間 | 里程碑 | 核心貢獻 |
|---|---|---|
| ~2014 | Neural Turing Machines (NTM) | 首次將可微分外部記憶引入神經網路,用讀寫頭操作記憶矩陣 |
| ~2015 | Memory Networks / End-to-End Memory Networks | Facebook AI 提出,多跳推論 + 外部記憶,奠定 QA 場景基礎 |
| ~2016-2017 | Key-Value Memory Networks | 區分記憶的 key 和 value,提升檢索靈活性 |
| ~2018-2019 | Transformer 長上下文探索 | Transformer-XL(段級遞迴)、Compressive Transformer(壓縮舊段) |
| ~2020 | RAG (Retrieval-Augmented Generation) | Facebook/Meta 提出,將檢索與生成正式結合,成為 LLM 外部記憶的標準範式 |
| ~2022-2023 | 長上下文視窗競賽 | 各廠商將上下文從 4K → 32K → 128K → 更長擴充套件 |
| ~2023.10 | MemGPT | 首個明確以”作業系統虛擬記憶體”類比建置 LLM 記憶管理系統的架構 |
| ~2024 | Infini-attention | Google 提出將長期記憶內化到注意力層中 |
| ~2024-2025 | Agent 記憶產品化 | OpenAI 為 ChatGPT 增加使用者記憶功能;各類 Agent 架構整合記憶模組 |
| 2025+ | 記憶標準化、多模態記憶 | 記憶介面標準化趨勢;影像/影片/音訊的長期記憶融合 |
6. 技術路線對比
| 維度 | 擴充套件上下文視窗 | RAG 外部檢索 | 壓縮式記憶 | 引數化記憶(微調) |
|---|---|---|---|---|
| 記憶容量 | 理論上隨視窗大小線性增長 | 理論上無限(取決於儲存) | 有限(取決於壓縮比) | 有限(取決於引數量) |
| 檢索精度 | 高(原始資訊) | 中-高(依賴 embedding 質量) | 中(壓縮損失) | 不可檢索(黑箱) |
| 更新延遲 | 即時(加入上下文) | 低(寫入向量庫) | 中(需重新摘要) | 高(需重新微調) |
| 推論成本 | 高(注意力 O(n²),需最佳化) | 低(只檢索少量片段) | 低 | 低(推論時無額外開銷) |
| 可解釋性 | 高 | 高(可展示來源) | 中 | 低 |
| 代表方案 | 100K+ context models, Ring Attention | LangChain RAG, LlamaIndex | MemGPT core/summary memory | LoRA 微調、知識蒸餾 |
| 適用場景 | 文件分析、程式碼理解 | 知識庫 QA、企業搜尋 | 個人助手、長期陪伴 | 領域適配、個性化 |
7. 上下游
上游(供給端)
- 向量資料庫:Pinecone(雲端原生)、Milvus/Zilliz(開源)、Weaviate、Qdrant、ChromaDB
- Embedding 模型供應商:OpenAI(text-embedding 系列)、Cohere(embed-v3)、開源(BGE、E5、GTE 系列)
- 儲存基礎設施:雲端物件儲存(S3/GCS/Azure Blob)、SSD/NVMe(用於熱記憶)
- GPU/算力:Embedding 計算、Reranker 推論均需算力
- 知識圖譜:Neo4j、Nebula Graph(用於結構化語義記憶)
下游(需求端)
- AI 助手/聊天機器人:ChatGPT Memory、Claude 專案記憶
- 企業知識管理:內部文件檢索、客服知識庫
- AI Agent 平台:自主任務執行 Agent 需要任務狀態持久化
- 垂直場景:醫療(患者長期記錄)、教育(學習進度追蹤)、金融(客戶畫像)
- 遊戲/虛擬世界:NPC 長期記憶、開放世界角色一致性
- 具身智慧:機器人需要記住環境版面配置和操作經驗
8. 關鍵指標
| 指標 | 含義 | 當前業界水平(估算) |
|---|---|---|
| 記憶容量 | 可儲存的資訊條目數 | 向量庫:十億級向量可行 |
| 檢索延遲(P99) | 從查詢到返回相關記憶的時間 | 熱路徑:<50ms;冷路徑:數百 ms [估算] |
| 檢索召回率@K | Top-K 結果中包含正確記憶的比例 | 依賴 embedding 質量和 chunk 策略,業界差異大 |
| 記憶保真度 | 儲存和檢索過程中資訊損失程度 | 原文儲存 > 摘要儲存 > 引數化 |
| 寫入吞吐 | 單位時間可寫入的記憶條目數 | 受 embedding 計算和資料庫寫入制約 |
| 遺忘準確性 | 能否正確丟棄低價值記憶而保留高價值記憶 | 當前主要靠啟發式規則,LLM 評估成本高 |
| 跨會話一致性 | 多次會話間記憶是否衝突 | 知識圖譜 > 向量庫(向量庫缺乏衝突檢測) |
9. 供需與市場資料
⚠️ 以下市場資料均為 [行業估算 / 第三方報告],不同口徑差異較大,請注意交叉驗證。
市場規模:
- 向量資料庫市場:2024 年規模約數億美元量級 [行業估算],年增長率被多個分析機構預測為 20-30% CAGR 級別
- 整個 AI 記憶/檢索基礎設施市場尚處早期,尚無權威的獨立市場規模統計
供需特徵:
- 需求側爆發:Agent 部署量增長驅動記憶系統需求。每一個長週期執行的 Agent 例項都需要持久化記憶。
- 供給側競爭:向量資料庫賽道競爭激烈(Pinecone、Milvus、Weaviate、Qdrant、Chroma 等),開源 vs 雲端原生格局分化。
- 關鍵瓶頸轉移:從”存不存得了”(儲存容量)轉向”找不找得到”(檢索質量)和”管不管得好”(記憶生命週期管理)。
- 成本結構:Embedding 計算(GPU)+ 向量儲存(記憶體/SSD)+ 檢索計算。大規模部署下,embedding 計算和向量儲存的基礎設施成本佔比高 [估算]。
10. 代表公司與資本對映
| 類別 | 代表公司/專案 | 核心定位 | 資本狀態 |
|---|---|---|---|
| 向量資料庫 | Pinecone | 雲端原生向量資料庫 | 已獲大額融資,估值未充分揭露 |
| 向量資料庫 | Zilliz (Milvus) | 開源向量資料庫 | 已獲多輪融資 [公開報道] |
| 向量資料庫 | Weaviate | 開源向量資料庫,多模態支援 | 已獲多輪融資 [公開報道] |
| 向量資料庫 | Qdrant | 高效能開源向量檢索 | 已獲融資 [公開報道] |
| Agent 記憶架構 | Letta (原 MemGPT) | 分層記憶管理 | 已獲融資 [公開報道] |
| 檢索架構 | LlamaIndex | 資料連線與檢索架構 | 已獲融資 [公開報道] |
| 檢索架構 | LangChain | Agent/鏈編排架構(含 RAG) | 已獲融資 [公開報道] |
| Embedding | Cohere | Embedding + Reranker API | 已獲大額融資 [公開報道] |
| 平台廠商 | OpenAI | ChatGPT Memory(內建長期記憶) | 核心產品功能 |
| 平台廠商 | Gemini 長上下文 + Infini-attention 研究 | 核心技術儲備 | |
| 雲端廠商 | AWS / Azure / GCP | 向量搜尋服務(Bedrock Knowledge Base / Azure AI Search / Vertex AI) | 平台能力 |
A 股/港股對映線索(需自行驗證最新股價和業務純度):
- 向量資料庫概念:關注資料庫/大數據基礎設施類公司
- RAG 概念:關注搜尋、NLP、知識圖譜相關標的
- Agent 概念:關注 AI 應用層公司中版面配置記憶/個性化能力的標的
11. 投資邏輯
核心邏輯鏈
Agent 從 Demo → 生產級部署
↓
需要跨會話持久化的記憶能力
↓
記憶基礎設施(向量庫 + 檢索 + 管理)成為剛需
↓
記憶系統的差異化 → 產品體驗的差異化 → 付費意願的差異化
投資維度拆解
① 基礎設施層:向量資料庫 / 記憶儲存
- 邏輯:記憶必須有個地方存。向量資料庫是長期記憶的”硬碟”。
- 風險:資料庫賽道競爭激烈,護城河可能不夠深;大廠(AWS/Azure/Google)自建服務擠壓獨立廠商空間。
- 關注:技術性能(檢索速度、可擴充套件性)、生態整合度、開源社群活躍度。
② 中介軟體層:檢索編排 / 記憶管理架構
- 邏輯:誰能讓記憶系統”好用”誰就有價值。記憶的寫入策略、檢索質量、遺忘機制是真正的差異化。
- 風險:中介軟體可能被平台廠商內化(如 OpenAI 直接內建 Memory)。
- 關注:開發者採用率、與主流 LLM 的整合度。
③ 應用層:具備長期記憶能力的 C 端/B 端產品
- 邏輯:記憶是 AI 產品從”工具”變為”助手”的關鍵躍遷點。有記憶的 AI 助手使用者粘性顯著更高。
- 風險:使用者隱私和資料安全的合規壓力;記憶”失準”導致的信任危機。
- 關注:使用者留存率、付費轉化率、記憶功能使用深度。
催化劑與風險
| 催化劑 | 風險 |
|---|---|
| Agent 大規模商用 | 模型上下文視窗持續擴充套件可能壓縮 RAG 需求 |
| 記憶標準協議出現(類似 MCP) | 大廠免費提供記憶功能擠壓創業公司 |
| 多模態記憶突破 | 隱私法規收緊限制記憶資料收集 |
| 個性化 AI 付費意願驗證 | 記憶幻覺/汙染問題損害使用者信任 |
12. 常見誤讀糾偏
❌ 誤讀一:“上下文視窗越長就不需要長期記憶了”
糾偏: 上下文視窗是工作記憶,不是長期記憶。即使上下文達到 100 萬 token,以下問題仍然