模型层 开放阅读

长期记忆

Long-Term Memory

概念 ID
long-term-memory
更新时间
2026-05-29
来源数量
待补

长期记忆(Long-Term Memory, LTM)

1. 3 秒看懂

长期记忆 = 让 AI 突破”金鱼记忆”的技术栈。大语言模型的上下文窗口(Context Window)就像工作台——放下新信息就必须丢掉旧信息。长期记忆通过外部存储、检索增强、压缩摘要等机制,让 AI 能跨越数月甚至永久地保留和调用信息,是从”一次性对话工具”进化为”持续陪伴智能体”的核心基建。

2. 3 分钟产业解释

为什么现在所有人都在谈长期记忆?

2024-2025 年,AI 产业的核心叙事从”更大的模型”转向”更有用的 Agent”。Agent 的区别性特征不是参数量,而是能否积累经验、记住用户偏好、在多轮任务中保持连贯——这一切都指向长期记忆。

产业推力:

  • 用户体验瓶颈:用户每次重启对话都要重新自我介绍,体验断裂。
  • Agent 经济性:没有记忆的 Agent 无法进行复杂多步任务规划,每次从零推理浪费大量算力。
  • 商业模式需要:个性化服务(医疗、教育、金融顾问)的核心资产就是用户画像——本质上是长期记忆。
  • 竞品差异化:当基座模型能力趋于收敛,记忆系统成为 To-C 产品的关键护城河。

产业链关键环节:

环节代表技术/方案价值量
存储层向量数据库(Milvus、Pinecone、Weaviate)、图数据库(Neo4j)、KV 存储
编码层Embedding 模型(text-embedding 系列)、多模态编码器
检索层ANN 搜索(HNSW、IVF)、重排序(Reranker)
管理层记忆调度器、摘要压缩器、遗忘机制高(差异化关键)
应用层Agent 框架(LangChain、MemGPT/Letta、AutoGen)

3. 15 分钟专家深入

3.1 记忆的定义:AI 语境下的”长期”是什么?

在人类认知科学中,长期记忆(LTM)指不受即时复述维持、可长期保留的信息系统,与工作记忆(Working Memory,容量有限、持续数秒到数分钟)相对。

映射到 AI 系统:

类比维度人类认知AI 系统
工作记忆前额叶皮层,容量 ~7±2 项Transformer 的 KV Cache / 上下文窗口
短期记忆海马体暂存,数小时至数天单次会话的对话历史缓存
长期记忆皮层分布式存储,永久性向量数据库 + 检索 + 注入上下文
情景记忆具体事件的时空印记事件日志(带时间戳的对话/交互记录)
语义记忆抽象知识、概念关系知识图谱 / 结构化摘要

核心矛盾: Transformer 架构的注意力机制复杂度为 O(n²)(相对于序列长度),这意味着上下文窗口有理论上的效率天花板。即便通过工程优化将上下文扩展到百万 token 级别,“全量放在上下文里”既不经济也不精确——这就是为什么需要外部长期记忆系统

3.2 长期记忆的技术图谱

当前业界实现长期记忆的主流路径可归纳为 四大范式

范式一:检索增强记忆(RAG-based Memory) 将历史信息编码为向量,存入外部数据库;查询时通过语义检索召回相关片段,注入到 prompt 中。

  • 优点:实现简单、可扩展、与现有 LLM 解耦
  • 缺点:检索质量是瓶颈;“不知道自己记住了什么”(缺乏主动回忆能力)

范式二:长上下文窗口(Extended Context) 直接扩展模型的上下文窗口,将更多历史信息”原封不动”放入工作记忆。

  • 代表:UC Berkeley 等机构提出的 Ring Attention、Google 的 Infini-Attention 等架构探索
  • 优点:信息保真度高、无需额外检索系统
  • 缺点:计算成本随窗口长度增长(即便线性化优化也代价不菲);存在”Lost in the Middle”现象——模型对中间位置信息的注意力衰减

范式三:压缩式记忆(Compressed/Abstracted Memory) 对历史交互进行摘要、蒸馏,只保留核心信息的压缩表示。

  • 代表:MemGPT/Letta 的分层记忆架构(recall memory → archival memory → core memory)
  • 优点:存储效率高、可维护
  • 缺点:压缩过程不可避免地丢失细节;摘要质量依赖生成模型能力

范式四:参数化记忆(Parametric Memory) 将知识直接编码进模型参数,通过微调(Fine-tuning)或持续学习(Continual Learning)实现。

  • 优点:推理时无需外部检索、延迟低
  • 缺点:灾难性遗忘(Catastrophic Forgetting)风险;更新成本高;难以解释和编辑

实践中的最优解往往是混合方案: RAG 处理事实性知识 + 压缩摘要管理对话历史 + 参数化记忆固化高频使用的用户偏好。


4. 技术原理(最深)

4.1 Transformer 的”记忆困境”

┌──────────────────────────────────────────────────┐
│              Transformer 上下文窗口                │
│                                                    │
│  [token_1] [token_2] ... [token_n]                │
│       ↓         ↓            ↓                     │
│  ┌─────────────────────────────────┐              │
│  │   Self-Attention: Q·K^T / √d_k  │              │
│  │   复杂度 O(n²)  空间 O(n²)       │              │
│  └─────────────────────────────────┘              │
│                                                    │
│  窗口满了 → 最早的 token 被挤出 → 信息永久丢失     │
└──────────────────────────────────────────────────┘

KV Cache 本质是”工作记忆”:推理时,每个已生成 token 的 Key 和 Value 向量被缓存,供后续 token 的注意力计算使用。KV Cache 的大小 = 2 × n_layers × n_heads × d_head × seq_len × dtype_bytes。对于大型模型,单个请求的 KV Cache 可达数 GB 量级 [估算]。这部分是易失性存储,会话结束即销毁。

4.2 RAG 长期记忆管线的完整流程

┌─────────────────────────────────────────────────────────┐
│                    写入路径(记忆编码)                    │
│                                                          │
│  用户交互/Agent观察                                       │
│       ↓                                                  │
│  ┌──────────────┐   ┌──────────────┐                    │
│  │ 信息提取器    │   │ 重要性评分器  │ ← 判断是否值得记住  │
│  │ (NER/LLM)   │   │ (启发式/LLM) │                    │
│  └──────┬───────┘   └──────┬───────┘                    │
│         ↓                   ↓                            │
│  ┌──────────────────────────────┐                       │
│  │  Embedding 模型              │                       │
│  │  (e.g., text-embedding-3-*)  │                       │
│  └──────────────┬───────────────┘                       │
│                 ↓                                        │
│  ┌──────────────────────────────┐  ┌───────────────┐   │
│  │  向量数据库                   │  │  元数据存储    │   │
│  │  (embedding + chunk_id)      │  │ (时间/来源/   │   │
│  │                              │  │  用户/类型)   │   │
│  └──────────────────────────────┘  └───────────────┘   │
└─────────────────────────────────────────────────────────┘

┌─────────────────────────────────────────────────────────┐
│                    读取路径(记忆检索)                    │
│                                                          │
│  新查询 Q                                                │
│    ↓                                                     │
│  ┌──────────────┐                                       │
│  │ Embedding(Q) │                                       │
│  └──────┬───────┘                                       │
│         ↓                                                │
│  ┌──────────────────────────────┐                       │
│  │  ANN 近似最近邻搜索           │                       │
│  │  (HNSW / IVF-PQ / ScaNN)    │                       │
│  │  Top-K 候选                   │                       │
│  └──────────────┬───────────────┘                       │
│                 ↓                                        │
│  ┌──────────────────────────────┐                       │
│  │  重排序 (Cross-Encoder)      │                       │
│  │  + 元数据过滤                  │                       │
│  └──────────────┬───────────────┘                       │
│                 ↓                                        │
│  ┌──────────────────────────────┐                       │
│  │  注入 Prompt / 上下文组装      │                       │
│  │  [System] + [检索到的记忆]    │                       │
│  │  + [当前对话]                  │                       │
│  └──────────────────────────────┘                       │
└─────────────────────────────────────────────────────────┘

关键参数与权衡:

  • Chunk Size:文本分块大小。过小丢失上下文语义,过大降低检索精度。实践中常见 256-1024 token 范围 [行业通用实践]。
  • Top-K:检索召回数量。K 越大信息越全但上下文占用越多。典型值 3-10 [行业通用实践]。
  • Embedding 维度:直接影响存储成本和检索精度。常见 768-3072 维 [估算,取决于具体 embedding 模型]。
  • ANN 索引类型:HNSW(内存占用高但查询快)、IVF-PQ(压缩存储适合大规模)、ScaNN(Google 提出,查询效率优)。

4.3 MemGPT/Letta 的分层记忆架构

┌──────────────────────────────────────────────────┐
│              MemGPT 虚拟内存管理                   │
│                                                    │
│  ┌─────────────────────────────────────┐          │
│  │  Core Memory (系统提示区)             │          │
│  │  - 人格设定、用户画像、当前目标        │          │
│  │  - 始终在上下文中,可被 Agent 主动编辑 │          │
│  │  - 类比:人类的"自我意识"和"身份"      │          │
│  └─────────────────────────────────────┘          │
│                                                    │
│  ┌─────────────────────────────────────┐          │
│  │  Recall Memory (对话历史)             │          │
│  │  - 全量对话记录,存于外部数据库        │          │
│  │  - Agent 可通过函数调用检索历史片段    │          │
│  │  - 类比:人类的"情景记忆"             │          │
│  └─────────────────────────────────────┘          │
│                                                    │
│  ┌─────────────────────────────────────┐          │
│  │  Archival Memory (长期知识库)         │          │
│  │  - 事实、偏好、文档、学习笔记          │          │
│  │  - 向量检索访问                       │          │
│  │  - 类比:人类的"语义记忆"             │          │
│  └─────────────────────────────────────┘          │
│                                                    │
│  核心创新:Agent 自主决定                             │
│  ① 什么时候写入记忆                                 │
│  ② 什么时候检索记忆                                 │
│  ③ 什么时候更新核心记忆                             │
│  → 用 function calling 实现 "虚拟分页"              │
└──────────────────────────────────────────────────┘

MemGPT 的关键洞察: 操作系统用虚拟内存让程序”以为”自己拥有无限 RAM,MemGPT 用 function calling 让 LLM”以为”自己拥有无限上下文。Agent 学习何时 page-in(检索历史)和 page-out(摘要存储),本质是对人类记忆管理策略的形式化。

4.4 Infini-Attention 与线性化长期记忆

Google Research 提出的 Infini-attention [Google Research, 2024] 尝试在注意力层内部实现长期记忆:

  • 在标准 causal attention 之上增加一个**压缩记忆(compressive memory)**模块
  • 用线性注意力机制将过去的 KV 对压缩为固定大小的 M 矩阵
  • 检索时通过使用 sigmoid 激活后的查询与记忆矩阵运算:A_mem = σ(Q) · M
  • 结合门控机制(gating)平衡”当前上下文注意力”和”长期记忆检索”
┌─────────────────────────────────────────────────┐
│  Infini-Attention (单层示意)                      │
│                                                   │
│  当前段 Q, K, V ──→ 标准 Attention ──→ A_local   │
│       │                                          │
│       ↓                                          │
│  压缩记忆 M (固定大小)                             │
│  M += σ(K)^T · V    ← 更新记忆                   │
│  A_mem = σ(Q) · M   ← 检索记忆                   │
│       │                                          │
│       ↓                                          │
│  A_out = gate · A_mem + (1-gate) · A_local       │
└─────────────────────────────────────────────────┘

技术意义: 将长期记忆内化到 Transformer 层中,理论上可处理无限长序列,且每个 segment 的计算保持标准注意力效率。

局限: 压缩记忆本质上是有损压缩,信息检索精度不如精确的外部向量检索。

4.5 记忆的”遗忘”机制

好的长期记忆系统必须解决遗忘问题——不是 bug,而是 feature:

  • 时间衰减(Recency Bias):越久远的记忆权重越低,模拟人类的 Ebbinghaus 遗忘曲线
  • 重要性加权(Importance Weighting):用 LLM 或启发式规则评估信息重要性,重要记忆持久保存
  • 冲突覆盖(Conflict Resolution):新信息与旧记忆矛盾时,更新或标记旧记忆为”过时”
  • 主动遗忘(Active Forgetting):定期清理低价值记忆,控制存储成本

5. 技术演进史

时间里程碑核心贡献
~2014Neural Turing Machines (NTM)首次将可微分外部记忆引入神经网络,用读写头操作记忆矩阵
~2015Memory Networks / End-to-End Memory NetworksFacebook AI 提出,多跳推理 + 外部记忆,奠定 QA 场景基础
~2016-2017Key-Value Memory Networks区分记忆的 key 和 value,提升检索灵活性
~2018-2019Transformer 长上下文探索Transformer-XL(段级递归)、Compressive Transformer(压缩旧段)
~2020RAG (Retrieval-Augmented Generation)Facebook/Meta 提出,将检索与生成正式结合,成为 LLM 外部记忆的标准范式
~2022-2023长上下文窗口竞赛各厂商将上下文从 4K → 32K → 128K → 更长扩展
~2023.10MemGPT首个明确以”操作系统虚拟内存”类比构建 LLM 记忆管理系统的框架
~2024Infini-attentionGoogle 提出将长期记忆内化到注意力层中
~2024-2025Agent 记忆产品化OpenAI 为 ChatGPT 增加用户记忆功能;各类 Agent 框架集成记忆模块
2025+记忆标准化、多模态记忆记忆接口标准化趋势;图像/视频/音频的长期记忆融合

6. 技术路线对比

维度扩展上下文窗口RAG 外部检索压缩式记忆参数化记忆(微调)
记忆容量理论上随窗口大小线性增长理论上无限(取决于存储)有限(取决于压缩比)有限(取决于参数量)
检索精度高(原始信息)中-高(依赖 embedding 质量)中(压缩损失)不可检索(黑箱)
更新延迟即时(加入上下文)低(写入向量库)中(需重新摘要)高(需重新微调)
推理成本高(注意力 O(n²),需优化)低(只检索少量片段)低(推理时无额外开销)
可解释性高(可展示来源)
代表方案100K+ context models, Ring AttentionLangChain RAG, LlamaIndexMemGPT core/summary memoryLoRA 微调、知识蒸馏
适用场景文档分析、代码理解知识库 QA、企业搜索个人助手、长期陪伴领域适配、个性化

7. 上下游

上游(供给端)

  • 向量数据库:Pinecone(云原生)、Milvus/Zilliz(开源)、Weaviate、Qdrant、ChromaDB
  • Embedding 模型供应商:OpenAI(text-embedding 系列)、Cohere(embed-v3)、开源(BGE、E5、GTE 系列)
  • 存储基础设施:云对象存储(S3/GCS/Azure Blob)、SSD/NVMe(用于热记忆)
  • GPU/算力:Embedding 计算、Reranker 推理均需算力
  • 知识图谱:Neo4j、Nebula Graph(用于结构化语义记忆)

下游(需求端)

  • AI 助手/聊天机器人:ChatGPT Memory、Claude 项目记忆
  • 企业知识管理:内部文档检索、客服知识库
  • AI Agent 平台:自主任务执行 Agent 需要任务状态持久化
  • 垂直场景:医疗(患者长期记录)、教育(学习进度追踪)、金融(客户画像)
  • 游戏/虚拟世界:NPC 长期记忆、开放世界角色一致性
  • 具身智能:机器人需要记住环境布局和操作经验

8. 关键指标

指标含义当前业界水平(估算)
记忆容量可存储的信息条目数向量库:十亿级向量可行
检索延迟(P99)从查询到返回相关记忆的时间热路径:<50ms;冷路径:数百 ms [估算]
检索召回率@KTop-K 结果中包含正确记忆的比例依赖 embedding 质量和 chunk 策略,业界差异大
记忆保真度存储和检索过程中信息损失程度原文存储 > 摘要存储 > 参数化
写入吞吐单位时间可写入的记忆条目数受 embedding 计算和数据库写入制约
遗忘准确性能否正确丢弃低价值记忆而保留高价值记忆当前主要靠启发式规则,LLM 评估成本高
跨会话一致性多次会话间记忆是否冲突知识图谱 > 向量库(向量库缺乏冲突检测)

9. 供需与市场数据

⚠️ 以下市场数据均为 [行业估算 / 第三方报告],不同口径差异较大,请注意交叉验证。

市场规模:

  • 向量数据库市场:2024 年规模约数亿美元量级 [行业估算],年增长率被多个分析机构预测为 20-30% CAGR 级别
  • 整个 AI 记忆/检索基础设施市场尚处早期,尚无权威的独立市场规模统计

供需特征:

  • 需求侧爆发:Agent 部署量增长驱动记忆系统需求。每一个长周期运行的 Agent 实例都需要持久化记忆。
  • 供给侧竞争:向量数据库赛道竞争激烈(Pinecone、Milvus、Weaviate、Qdrant、Chroma 等),开源 vs 云原生格局分化。
  • 关键瓶颈转移:从”存不存得了”(存储容量)转向”找不找得到”(检索质量)和”管不管得好”(记忆生命周期管理)。
  • 成本结构:Embedding 计算(GPU)+ 向量存储(内存/SSD)+ 检索计算。大规模部署下,embedding 计算和向量存储的基础设施成本占比高 [估算]。

10. 代表公司与资本映射

类别代表公司/项目核心定位资本状态
向量数据库Pinecone云原生向量数据库已获大额融资,估值未充分披露
向量数据库Zilliz (Milvus)开源向量数据库已获多轮融资 [公开报道]
向量数据库Weaviate开源向量数据库,多模态支持已获多轮融资 [公开报道]
向量数据库Qdrant高性能开源向量检索已获融资 [公开报道]
Agent 记忆框架Letta (原 MemGPT)分层记忆管理已获融资 [公开报道]
检索框架LlamaIndex数据连接与检索框架已获融资 [公开报道]
检索框架LangChainAgent/链编排框架(含 RAG)已获融资 [公开报道]
EmbeddingCohereEmbedding + Reranker API已获大额融资 [公开报道]
平台厂商OpenAIChatGPT Memory(内置长期记忆)核心产品功能
平台厂商GoogleGemini 长上下文 + Infini-attention 研究核心技术储备
云厂商AWS / Azure / GCP向量搜索服务(Bedrock Knowledge Base / Azure AI Search / Vertex AI)平台能力

A 股/港股映射线索(需自行验证最新股价和业务纯度):

  • 向量数据库概念:关注数据库/大数据基础设施类公司
  • RAG 概念:关注搜索、NLP、知识图谱相关标的
  • Agent 概念:关注 AI 应用层公司中布局记忆/个性化能力的标的

11. 投资逻辑

核心逻辑链

Agent 从 Demo → 生产级部署
        ↓
需要跨会话持久化的记忆能力
        ↓
记忆基础设施(向量库 + 检索 + 管理)成为刚需
        ↓
记忆系统的差异化 → 产品体验的差异化 → 付费意愿的差异化

投资维度拆解

① 基础设施层:向量数据库 / 记忆存储

  • 逻辑:记忆必须有个地方存。向量数据库是长期记忆的”硬盘”。
  • 风险:数据库赛道竞争激烈,护城河可能不够深;大厂(AWS/Azure/Google)自建服务挤压独立厂商空间。
  • 关注:技术性能(检索速度、可扩展性)、生态集成度、开源社区活跃度。

② 中间件层:检索编排 / 记忆管理框架

  • 逻辑:谁能让记忆系统”好用”谁就有价值。记忆的写入策略、检索质量、遗忘机制是真正的差异化。
  • 风险:中间件可能被平台厂商内化(如 OpenAI 直接内置 Memory)。
  • 关注:开发者采用率、与主流 LLM 的集成度。

③ 应用层:具备长期记忆能力的 C 端/B 端产品

  • 逻辑:记忆是 AI 产品从”工具”变为”助手”的关键跃迁点。有记忆的 AI 助手用户粘性显著更高。
  • 风险:用户隐私和数据安全的合规压力;记忆”失准”导致的信任危机。
  • 关注:用户留存率、付费转化率、记忆功能使用深度。

催化剂与风险

催化剂风险
Agent 大规模商用模型上下文窗口持续扩展可能压缩 RAG 需求
记忆标准协议出现(类似 MCP)大厂免费提供记忆功能挤压创业公司
多模态记忆突破隐私法规收紧限制记忆数据收集
个性化 AI 付费意愿验证记忆幻觉/污染问题损害用户信任

12. 常见误读纠偏

❌ 误读一:“上下文窗口越长就不需要长期记忆了”

纠偏: 上下文窗口是工作记忆,不是长期记忆。即使上下文达到 100 万 token,以下问题仍然

source: 公开披露与公开资料整理 本页仅用于产业链学习、信息检索和研究辅助;不构成投资建议,不预测涨跌,不提供买卖、仓位或目标价建议。
完整概念页 复盘 13 节结构 公司投研页 沿产业链找到受益公司 投资课 把概念转成可跟踪模型