Agent记忆系统六大流派:从“失忆症患者“到真正懂你
说起来,最近在使用Agent的时候,遇到了一个挺尴尬的问题。
我让Agent帮我追踪一个技术话题,前两天聊得挺嗨,第三天它突然问我:“你之前说关注的是哪个方向来着?”
那一刻我突然意识到:现在的LLM,本质上是个"失忆症患者"。
不管上下文窗口多大——200K也好,1M也好——它只能记住"这次对话"里发生的事。关掉窗口,一切归零。下次再聊,它不记得你是谁,不记得你们讨论过什么,不记得你的偏好和习惯。
直到最近我集中看了一批2025-2026年的论文,才发现这个问题已经有这么多人在研究了。
今天这篇文章,我想梳理一下Agent记忆系统的全景:为什么需要记忆、记忆到底是什么、现在有哪些解决方案、各自的优缺点。这是系列第一篇,先把整体框架搭起来。
———
先说问题:为什么Agent需要记忆?
你有没有想过,当你在用一个AI助手的时候,你真正期待的是什么?
不只是"回答问题",而是它真的懂你。
你告诉它你是Python开发者,它应该记住这件事,下次给你推荐方案的时候默认用Python而不是Java。你告诉它你的项目部署在AWS,它不应该每次都要重新问一遍。
但现在的LLM做不到。
从技术角度看,原因很简单:LLM的参数是固定的,训练完就不再更新。你告诉它的新信息,不会改变它的权重。这些信息只能放在上下文窗口里,窗口一关,信息就没了。
这就像一个人,每次见面都要重新自我介绍一遍。不管你们之前聊得多深入,下次见面他还是问:“你好,请问您是?”
这不是智能,这是"无状态"。
▼ 有无记忆系统的对比

2025年12月的一篇综述论文《Memory in the Age of AI Agents》(arXiv:2512.13564)里有一段话很精准:
“在这些智能体能力中,记忆作为基石脱颖而出,使得静态的LLM(参数无法快速更新)能够转变为通过环境交互持续适应的自适应智能体。”
翻译一下:没有记忆的Agent,本质上只是一个函数。输入进去,输出出来,没有状态,没有积累,没有成长。
那记忆应该解决什么问题?
我想至少有三个层面:
第一,跨会话的一致性。你今天告诉Agent你喜欢用TypeScript,明天它给你写代码的时候应该默认TypeScript。不需要你再说一遍。
第二,个性化。Agent应该根据你的使用习惯调整行为。如果你是新手,它给的解释详细一点;如果你是老手,它直接给方案不废话。
第三,持续学习。Agent应该能从过去的交互中积累经验。哪些方案有效,哪些踩了坑,下次遇到类似问题可以参考。
这三个层面,对应的其实是记忆系统的不同能力:存储、检索、更新、遗忘。
———
学术定义:Agent Memory到底是什么?
在展开讲各种方案之前,我想先厘清一个概念:Agent Memory和RAG有什么区别?

[ Agent Memory vs RAG vs Context Engineering 对比图 ]
很多人觉得,RAG不就是一种记忆吗?把文档存起来,需要的时候检索出来,不就是让模型"记住"了外部知识?
其实不一样。
2026年2月的另一篇论文《Rethinking Memory Mechanisms of Foundation Agents》(arXiv:2602.06052)里做了一个很好的区分:
RAG关注的是从相对静态的知识库中检索,主要挑战是索引和检索质量。知识库通常是预先构建的,不会在每次交互中动态更新。
Agent Memory关注的是跨交互积累的持久状态,涉及动态写入、修订、个性化。记忆是在交互过程中不断积累的,会根据新信息更新旧记忆。
举个例子:
- 你问Agent"Python的GIL是什么",它从知识库检索到答案给你——这是RAG。
- 你告诉Agent"我是Python开发者",它把这个信息存下来,下次给你写代码时默认用Python——这是Memory。
RAG是"查字典",Memory是"记笔记"。
再来看另一个容易混淆的概念:Context Engineering(上下文工程) 也可以理解为LLM Memory。
上下文工程是指精心构造prompt,让LLM收到任务相关的信息。Agent Memory可以支持上下文工程,但它不只是prompt组装。Memory需要显式的机制来写入、更新、组织、选择哪些信息应该进入未来的prompt。
2026年3月的论文《Memory for Autonomous LLM Agents》(arXiv:2603.07670)把Agent Memory定义为一个write-manage-read循环:
- Write(写入):什么信息值得记住?
- Manage(管理):如何存储、更新、合并、淘汰?
- Read(读取):当前任务需要哪些记忆?
这三个环节,每一个都有大量的设计决策。
那什么样的记忆系统是好的?2025年底的几篇综述论文总结了5个核心需求:
| 维度 | 说明 |
|---|---|
| 准确性 | 检索到的记忆和当前任务高度相关,没有无关信息干扰 |
| 召回率 | 所有相关记忆都能被召回,不会遗漏重要信息 |
| 时效性 | 优先召回最新的记忆,淘汰过期的无效信息 |
| 效率 | 检索速度快,token占用低,不增加太多额外成本 |
| 可解释性 | 能清晰看到召回了哪些记忆,为什么召回这些 |
这5个维度,其实也是后续评价各种方案的标尺。
———
认知科学视角:人类记忆给Agent的启示
在讲具体方案之前,我想先聊一个有意思的话题:人类是怎么记忆的?
这不是闲扯。Agent记忆系统的设计,很大程度上是在模仿人类认知科学的成果。理解人脑的记忆机制,能帮我们理解Agent记忆系统为什么要这么设计。
认知心理学从时间维度把记忆分为感知记忆、工作记忆和长期记忆;从内容维度把长期记忆分为情景记忆、语义记忆和程序记忆。
感知记忆(Sensory Memory):你看到的东西,在眼前停留不到1秒钟就消失——视觉感知记忆实际只持续约250-500ms。比如眼前闪过一个画面,你来不及细看就没了。
工作记忆(Working Memory):你正在思考的事情,容量有限,持续时间也有限。比如你在心算一道题,脑子里同时保持的数字不超过7个。
注:Miller 的 7±2 是 1956 年的经典数字,针对的是短期记忆的"组块"(chunks)。Cowan (2001) 对工作记忆的修正估计是 4±1 项。总之,人脑能同时保持的数字不多。
情景记忆(Episodic Memory):你经历过的具体事件。“上周三下午在星巴克和朋友聊AI”——这是情景记忆,有具体的时间、地点、人物。
语义记忆(Semantic Memory):你学到的知识和事实。“Python是一种编程语言”、“北京是中国的首都”——这些是抽象的、脱离具体情境的知识。
程序记忆(Procedural Memory):你学会的技能。骑自行车、打字、游泳——这些是"肌肉记忆",你很难用语言描述,但身体就是会。
对应到Agent记忆系统:
- 感知记忆 → 当前上下文窗口里的内容
- 工作记忆 → 当前任务相关的临时信息
- 情景记忆 → 历史交互事件,“用户说过什么”
- 语义记忆 → 从交互中提取的知识和规则
- 程序记忆 → Agent学会的操作策略(这个方向还比较早期)
针对Agent失忆症,最朴素的做法:把所有历史对话原文存下来,下次全部塞进 context window。
这显然不行——太长、太贵、太慢、太多噪音。
所以必须做取舍。Agent记忆系统的设计,其实就是在解决这个问题,取舍方式的不同,就产生了不同的解决方案。
2026年2月的论文《Anatomy of Agentic Memory》(arXiv:2602.19320)把Agent记忆系统分成了四类:
① Lightweight Semantic Memory
最基础、也最常用的一种形式,其思想是"管他什么结构,把有用的句子存下来,下次按相似度捞就行",实际是一种信息压缩形式。记忆被拆解成独立文本单元并转化为向量,使用时通过 Top-k 相似度搜索来检索。
缺点:条目之间没有显式的结构关联,通常只支持追加写入。
② Entity-Centric and Personalized Memory
围绕明确的实体(用户、任务或偏好)来组织信息,使用"属性-值"对存储,受预定义 Schema 约束。通俗理解:我不记散装句子,我记实体——这个用户喜欢什么、这个项目的状态是什么。
缺点:只记静态属性,不管先来后到、前因后果。
③ Episodic and Reflective Memory
把日常交互整理成"事件片段(Episodes)"或更高层级的总结,引入时间维度的抽象。系统会定期对过往经验进行提炼或反思,把重要事件浓缩成精简的记忆表示。
④ Structured and Hierarchical Memory
对存储信息施加明确的组织规则。"层次化设计"将记忆划分成多个层级(短期记忆和长期记忆);"结构化方法"则通过图(Graphs)等关系表示法来编码记忆元素之间的关联。
这四类方案的具体实现,又有不同的路径,如下图所示:

[ 记忆系统四大分类与实现路径 ]
注意:这4个分类不是"阶段",是可组合的模块——一个成熟系统(如 Zep、MemGPT)往往同时用了其中2-3种。
对Agent机器系统的整体印象有了,工程上怎么实现呢?这就是接下来要讲的六大流派。
———
六大架构流派
2025-2026年,Agent记忆领域涌现了大量方案。我把它们归纳为六大流派,每个流派解决的核心问题不同,适用场景也不同。
流派一:自动记忆抽取层(代表:Mem0)
核心思想:在对话流上插一个"自动抽取层",用LLM实时判断"什么值得记",把事实条目抽出来存进向量库+图数据库,下次需要时按语义相似度检索回来。
Mem0是这个方向的代表,2025年ECAI会议发了论文(arXiv:2504.19413)。

工作流程:
- 对话流经Mem0层,LLM自动抽取事实("用户偏好Python"等)
- 事实去重、合并冲突后存入向量库+图数据库
- 下次对话时,按当前上下文语义检索相关记忆,注入prompt
优势:
- 即插即用,集成成本最低(几行代码)
- 开源社区最活跃
- 支持user/agent/session三级记忆隔离
- 已有云服务,开箱即用
劣势:
- 抽取质量依赖LLM能力(小模型效果打折)
- 向量检索丢失时序和因果关系
- 记忆冲突消解相对简单(覆盖为主)
- 不适合"事实随时间演变"的强时序场景
适用场景:通用对话记忆、客服机器人、个人助手、快速POC验证。
这个方向的优势是生态完善、易于上手。如果你是第一次给Agent加记忆,Mem0是最简单的起点。
流派二:OS式虚拟内存(代表:Letta/MemGPT)
核心思想:借鉴操作系统的虚拟内存管理——把LLM当CPU,上下文窗口当RAM,外部存储当硬盘。Agent自己负责在"主存"和"外存"之间做分页调度。
MemGPT是2023年的经典论文(arXiv:2310.08560),后来团队成立了Letta继续做。

[ Letta/MemGPT 架构图 ]
核心概念是Memory Blocks:
-
Core Blocks
:始终在上下文窗口里的结构化记忆(人设、用户画像、核心规则),Agent可直接编辑
-
Recall Memory
:完整对话历史,存在窗口外,Agent可用search工具按需检索
-
Archival Memory
:无限容量的外部知识库,Agent主动写入和检索,类似"长期笔记本"
关键创新在于:记忆的管理权交给了Agent自己。不是开发者写死"什么该存什么该取",而是给Agent一组memory editing tools,让它自己决定何时读写。
优势:
- 思想深度最强("LLM as OS"理论源头)
- Agent自主管理记忆,无需开发者手写规则
- 完全可控、可审计(所有操作是显式tool call)
- 支持自托管,数据不出域
劣势:
- 自编辑记忆的可靠性依赖模型能力(小模型易出错)
- 每次"分页"都是额外LLM调用,延迟和成本不低
- 框架较重,简单场景overkill
- 记忆质量波动——Agent可能"记错笔记"
适用场景:需要完全可控的自托管Agent状态管理、研究型长对话、对记忆操作透明性要求高的企业场景。
Letta的思想很优雅,但工程复杂度比较高。适合有经验的团队做深度定制。
流派三:时序知识图谱(代表:Zep/Graphiti)
核心思想:用知识图谱(而非向量库)作为记忆底座。每条事实是一个"节点",实体之间是"边",关键创新是给每条事实加上"有效时间区间"(valid_at / invalid_at),让记忆能表达"事实会随时间变化"。
Graphiti核心机制:
-
实体节点
:对话中出现的每个实体(人、公司、产品、概念)自动提取为图谱节点
-
关系边
:实体之间的关系(“用户-喜欢-Python”、“项目-部署在-AWS”)
-
时间区间
:每条关系都有有效期(“2024年1月-2024年6月期间,用户偏好Python”)
优势:
- 支持事实随时间变化,关系推理强
- 可解释性好,可以可视化记忆结构
- 多跳推理能力强
劣势:
- 构建成本高,需要Neo4j等图数据库
- 语义相似度搜索弱于向量方案
- 查询性能受图规模影响
- 需要专业知识建模
适用场景:知识密集型场景、需要强一致性和关系推理的场景。
如果你需要处理事实会变化的场景(比如"用户的地址从A变成B"),Graphiti的时序能力就很有价值。
流派四:自组织记忆(代表:A-MEM)
核心思想:让记忆系统像人脑一样"自组织"——不只是被动存取,而是会主动索引(Indexing)、巩固(Consolidation)、演化(Evolution)。
A-MEM是NeurIPS 2025的论文(arXiv:2502.12110),是目前学术界最前沿的Agent Memory架构之一。
三大核心机制:
-
索引
:基于Zettelkasten笔记法,每条记忆自动建立"链接"指向相关记忆,形成动态网络而非平坦列表
-
巩固
:类似人类睡眠时的记忆巩固——周期性合并相关记忆、提炼出更高层的洞察、淘汰冗余
-
演化
:记忆结构随新信息动态重组——旧记忆被新证据更新,关联关系自动调整
优势:
- 最接近人类记忆机制的设计
- 记忆质量随时间提升(巩固效应)
- 自动发现记忆间的隐含关联
- 在token效率上表现优异(85-93%效率)
劣势:
- 仍处学术阶段,产品化程度低
- 巩固过程需要额外LLM调用,成本较高
- 过度巩固可能丢失有价值的细节
- 实现复杂度高,调参门槛高
适用场景:需要长期积累和知识演化的场景——研究助手、知识管理、组织级知识沉淀。
A-MEM的思想很超前,但离生产还有距离。如果你在做研究或者不急着上线,可以关注这个方向。
流派五:LangChain生态(代表:LangMem)
核心思想:与LangChain深度集成,提供记忆能力的标准化接口。
LangMem是LangChain团队做的记忆方案,和LangGraph配合使用。
优势:
- 生态完善,文档丰富
- 易用性高,和LangChain无缝集成
- 社区活跃
劣势:
- 深度绑定LangChain生态
- 定制化能力相对有限
适用场景:已经在用LangChain的项目。
如果你已经在用LangChain/LangGraph,LangMem是最自然的选择。但如果你没有用LangChain,没必要为了记忆专门引入它。
流派六:企业级混合架构(代表:Tablestore/阿里云PolarDB)
核心思想:向量数据库 + 知识图谱 + 结构化存储,分层组合。
2026年的最佳实践是混合架构。阿里云PolarDB做了双模存储的实践:
- 向量检索准确率:92%
- 关系查询响应:< 50ms
- 存储成本降低:40%
腾讯云也推出了Agent Memory方案,四层渐进式架构:L0原始对话→L1原子记忆→L2场景分块→L3用户画像。
优势:
- 综合能力最强
- 可以针对不同场景选择不同存储
- 生产就绪
劣势:
- 实现复杂
- 需要维护多套存储系统
- 运维成本高
适用场景:企业级生产环境、大规模Agent平台。
混合架构是企业级的选择。如果你有工程团队、有运维能力、需要处理海量数据,这是最稳妥的方案。
———
技术现状:2026年的成熟度评估
看完六大流派,你可能想知道:哪些能用,哪些还在实验室?
我根据论文和开源项目的状态,做了一个粗略的评估:
| 方案 | 成熟度 | 生产就绪 | 适用阶段 |
|---|---|---|---|
| Mem0 | ⭐⭐⭐⭐⭐ | ✅ | 快速验证、中小规模生产 |
| LangMem | ⭐⭐⭐⭐ | ✅ | LangChain生态用户 |
| Letta/MemGPT | ⭐⭐⭐ | ⚠️ | 研究型、深度定制 |
| Graphiti/Zep | ⭐⭐⭐ | ⚠️ | 知识密集型场景 |
| 混合架构 | ⭐⭐⭐⭐ | ✅ | 企业级大规模 |
| A-MEM | ⭐⭐ | ❌ | 学术研究 |
几个关键发现:
第一,Mem0是当前生态之王。GitHub 60K+ stars,ECAI 2025论文,云服务开箱即用。如果你要快速给Agent加记忆,这是最简单的起点。
第二,混合架构是企业级的选择。阿里云、腾讯云都在推这个方向。但实现复杂度高,不是小团队能轻易搞定的。
第三,学术前沿和生产落地有差距。A-MEM的思想很超前(NeurIPS 2025),但产品化程度低。从论文到生产,还有很长的路。
第四,关键挑战还没解决。2026年2月的综述论文《Anatomy of Agentic Memory》指出了几个核心问题:
- 基准测试饱和:现有benchmark规模不足,复杂记忆系统常常不如简单baseline
- 指标有效性:F1分数和语义正确性之间存在错位
- 模型依赖性:性能随底层模型变化显著,换个模型效果可能天差地别
- 系统成本:记忆维护的延迟和吞吐量开销经常被忽视
这些问题说明,Agent记忆还没有"被解决"。我们在一个快速发展的阶段,但离成熟还有距离。
———
选型决策树:你的场景该选哪个?
看完这些方案,怎么选?
我画了一个简单的决策树:
🌳 你需要给Agent加记忆
├─ 你已经在用LangChain/LangGraph? → LangMem
├─ 你需要快速验证,不想折腾? → Mem0
├─ 你是企业级场景,有工程团队? → 混合架构
├─ 你需要处理事实随时间变化的场景? → Graphiti/Zep
├─ 你需要完全可控、可审计的记忆操作? → Letta/MemGPT
└─ 你在做学术研究,探索前沿? → A-MEM
几个具体建议:
如果你是个人开发者,想给自己的Agent加记忆:用Mem0。几行代码就能集成,文档丰富,社区活跃。
如果你在做企业级Agent平台:考虑混合架构。阿里云PolarDB或腾讯云Agent Memory都是不错的选择。
如果你在研究记忆机制本身:关注Letta和A-MEM。它们的思想很有启发性。
如果你在做一个知识密集型的应用(比如法律、医疗):Graphiti的时序知识图谱可能更合适。
———
未来展望:开放问题与研究方向
最后,聊聊Agent记忆的未来。
2026年的几篇综述论文都提到了一些开放问题:
1. 持续巩固(Continual Consolidation)
人类在睡眠时会巩固记忆,把短期记忆转化为长期记忆。Agent能不能也这样?不是实时处理所有信息,而是在"空闲"时整理记忆。(跟这篇文章不谋而合——Language Models Need Sleep)
2. 因果检索(Causally Grounded Retrieval)
现在的检索主要基于语义相似度。但有时候我们需要的是因果关系——“因为A发生了,所以B才会发生”。这种因果检索还很不成熟。
3. 可信反思(Trustworthy Reflection)
Agent应该能从过去的错误中学习。但怎么保证反思的质量?怎么避免"学错"?
4. 学习遗忘(Learned Forgetting)
人脑会主动遗忘不重要的信息。Agent也应该学会优雅地淘汰过时记忆,而不是无限堆积。
5. 多模态记忆(Multimodal Memory)
现在的记忆主要是文本。但Agent处理的可能是图片、音频、视频。怎么统一表示多模态记忆?
6. 隐私与合规(Privacy and Compliance)
记忆可能包含敏感信息。怎么处理数据隐私?怎么实现"机器遗忘"——当用户要求删除数据时,怎么确保真的从模型记忆里清除了?
这些问题,每一个都值得深入研究。
———
写在最后
回到开头的问题:为什么Agent需要记忆?
因为没有记忆的Agent,本质上只是一个函数。输入进去,输出出来,没有状态,没有积累,没有成长。
2025-2026年,Agent记忆领域发展很快。从Mem0的自动抽取,到Letta的虚拟内存,到A-MEM的自组织,我们看到了很多有创意的方案。
但说实话,这个领域还没有"被解决"。基准测试饱和、指标有效性、系统成本、隐私合规——这些问题都还在探索中。
我的判断是:Agent记忆会是接下来1-2年的重要研究方向。随着Agent从"工具"变成"助手"再到"伙伴",记忆会变得越来越重要。
学AI大模型的正确顺序,千万不要搞错了
🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!
有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!
就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋

📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇
学习路线:
✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经
以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!
我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~
这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

更多推荐
所有评论(0)