说起来,最近在使用Agent的时候,遇到了一个挺尴尬的问题。

我让Agent帮我追踪一个技术话题,前两天聊得挺嗨,第三天它突然问我:“你之前说关注的是哪个方向来着?”

那一刻我突然意识到:现在的LLM,本质上是个"失忆症患者"

不管上下文窗口多大——200K也好,1M也好——它只能记住"这次对话"里发生的事。关掉窗口,一切归零。下次再聊,它不记得你是谁,不记得你们讨论过什么,不记得你的偏好和习惯。

直到最近我集中看了一批2025-2026年的论文,才发现这个问题已经有这么多人在研究了。

今天这篇文章,我想梳理一下Agent记忆系统的全景:为什么需要记忆、记忆到底是什么、现在有哪些解决方案、各自的优缺点。这是系列第一篇,先把整体框架搭起来。

———

先说问题:为什么Agent需要记忆?

你有没有想过,当你在用一个AI助手的时候,你真正期待的是什么?

不只是"回答问题",而是它真的懂你

你告诉它你是Python开发者,它应该记住这件事,下次给你推荐方案的时候默认用Python而不是Java。你告诉它你的项目部署在AWS,它不应该每次都要重新问一遍。

但现在的LLM做不到。

从技术角度看,原因很简单:LLM的参数是固定的,训练完就不再更新。你告诉它的新信息,不会改变它的权重。这些信息只能放在上下文窗口里,窗口一关,信息就没了。

这就像一个人,每次见面都要重新自我介绍一遍。不管你们之前聊得多深入,下次见面他还是问:“你好,请问您是?”

这不是智能,这是"无状态"。

▼ 有无记忆系统的对比

2025年12月的一篇综述论文《Memory in the Age of AI Agents》(arXiv:2512.13564)里有一段话很精准:

“在这些智能体能力中,记忆作为基石脱颖而出,使得静态的LLM(参数无法快速更新)能够转变为通过环境交互持续适应的自适应智能体。”

翻译一下:没有记忆的Agent,本质上只是一个函数。输入进去,输出出来,没有状态,没有积累,没有成长。

那记忆应该解决什么问题?

我想至少有三个层面:

第一,跨会话的一致性。你今天告诉Agent你喜欢用TypeScript,明天它给你写代码的时候应该默认TypeScript。不需要你再说一遍。

第二,个性化。Agent应该根据你的使用习惯调整行为。如果你是新手,它给的解释详细一点;如果你是老手,它直接给方案不废话。

第三,持续学习。Agent应该能从过去的交互中积累经验。哪些方案有效,哪些踩了坑,下次遇到类似问题可以参考。

这三个层面,对应的其实是记忆系统的不同能力:存储、检索、更新、遗忘。

———

学术定义:Agent Memory到底是什么?

在展开讲各种方案之前,我想先厘清一个概念:Agent Memory和RAG有什么区别?

[ Agent Memory vs RAG vs Context Engineering 对比图 ]

很多人觉得,RAG不就是一种记忆吗?把文档存起来,需要的时候检索出来,不就是让模型"记住"了外部知识?

其实不一样。

2026年2月的另一篇论文《Rethinking Memory Mechanisms of Foundation Agents》(arXiv:2602.06052)里做了一个很好的区分:

RAG关注的是从相对静态的知识库中检索,主要挑战是索引和检索质量。知识库通常是预先构建的,不会在每次交互中动态更新。

Agent Memory关注的是跨交互积累的持久状态,涉及动态写入、修订、个性化。记忆是在交互过程中不断积累的,会根据新信息更新旧记忆。

举个例子:

  • 你问Agent"Python的GIL是什么",它从知识库检索到答案给你——这是RAG。
  • 你告诉Agent"我是Python开发者",它把这个信息存下来,下次给你写代码时默认用Python——这是Memory。

RAG是"查字典",Memory是"记笔记"。

再来看另一个容易混淆的概念:Context Engineering(上下文工程) 也可以理解为LLM Memory。

上下文工程是指精心构造prompt,让LLM收到任务相关的信息。Agent Memory可以支持上下文工程,但它不只是prompt组装。Memory需要显式的机制来写入、更新、组织、选择哪些信息应该进入未来的prompt。

2026年3月的论文《Memory for Autonomous LLM Agents》(arXiv:2603.07670)把Agent Memory定义为一个write-manage-read循环

  • Write(写入):什么信息值得记住?
  • Manage(管理):如何存储、更新、合并、淘汰?
  • Read(读取):当前任务需要哪些记忆?

这三个环节,每一个都有大量的设计决策。

那什么样的记忆系统是好的?2025年底的几篇综述论文总结了5个核心需求:

维度 说明
准确性 检索到的记忆和当前任务高度相关,没有无关信息干扰
召回率 所有相关记忆都能被召回,不会遗漏重要信息
时效性 优先召回最新的记忆,淘汰过期的无效信息
效率 检索速度快,token占用低,不增加太多额外成本
可解释性 能清晰看到召回了哪些记忆,为什么召回这些

这5个维度,其实也是后续评价各种方案的标尺。

———

认知科学视角:人类记忆给Agent的启示

在讲具体方案之前,我想先聊一个有意思的话题:人类是怎么记忆的?

这不是闲扯。Agent记忆系统的设计,很大程度上是在模仿人类认知科学的成果。理解人脑的记忆机制,能帮我们理解Agent记忆系统为什么要这么设计。

认知心理学从时间维度把记忆分为感知记忆、工作记忆和长期记忆;从内容维度把长期记忆分为情景记忆、语义记忆和程序记忆。

感知记忆(Sensory Memory):你看到的东西,在眼前停留不到1秒钟就消失——视觉感知记忆实际只持续约250-500ms。比如眼前闪过一个画面,你来不及细看就没了。

工作记忆(Working Memory):你正在思考的事情,容量有限,持续时间也有限。比如你在心算一道题,脑子里同时保持的数字不超过7个。

注:Miller 的 7±2 是 1956 年的经典数字,针对的是短期记忆的"组块"(chunks)。Cowan (2001) 对工作记忆的修正估计是 4±1 项。总之,人脑能同时保持的数字不多。

情景记忆(Episodic Memory):你经历过的具体事件。“上周三下午在星巴克和朋友聊AI”——这是情景记忆,有具体的时间、地点、人物。

语义记忆(Semantic Memory):你学到的知识和事实。“Python是一种编程语言”、“北京是中国的首都”——这些是抽象的、脱离具体情境的知识。

程序记忆(Procedural Memory):你学会的技能。骑自行车、打字、游泳——这些是"肌肉记忆",你很难用语言描述,但身体就是会。

对应到Agent记忆系统:

  • 感知记忆 → 当前上下文窗口里的内容
  • 工作记忆 → 当前任务相关的临时信息
  • 情景记忆 → 历史交互事件,“用户说过什么”
  • 语义记忆 → 从交互中提取的知识和规则
  • 程序记忆 → Agent学会的操作策略(这个方向还比较早期)

针对Agent失忆症,最朴素的做法:把所有历史对话原文存下来,下次全部塞进 context window。

这显然不行——太长、太贵、太慢、太多噪音。

所以必须做取舍。Agent记忆系统的设计,其实就是在解决这个问题,取舍方式的不同,就产生了不同的解决方案。

2026年2月的论文《Anatomy of Agentic Memory》(arXiv:2602.19320)把Agent记忆系统分成了四类:

① Lightweight Semantic Memory

最基础、也最常用的一种形式,其思想是"管他什么结构,把有用的句子存下来,下次按相似度捞就行",实际是一种信息压缩形式。记忆被拆解成独立文本单元并转化为向量,使用时通过 Top-k 相似度搜索来检索。
缺点:条目之间没有显式的结构关联,通常只支持追加写入。

② Entity-Centric and Personalized Memory

围绕明确的实体(用户、任务或偏好)来组织信息,使用"属性-值"对存储,受预定义 Schema 约束。通俗理解:我不记散装句子,我记实体——这个用户喜欢什么、这个项目的状态是什么。
缺点:只记静态属性,不管先来后到、前因后果。

③ Episodic and Reflective Memory

把日常交互整理成"事件片段(Episodes)"或更高层级的总结,引入时间维度的抽象。系统会定期对过往经验进行提炼或反思,把重要事件浓缩成精简的记忆表示。

④ Structured and Hierarchical Memory

对存储信息施加明确的组织规则。"层次化设计"将记忆划分成多个层级(短期记忆和长期记忆);"结构化方法"则通过图(Graphs)等关系表示法来编码记忆元素之间的关联。

这四类方案的具体实现,又有不同的路径,如下图所示:

[ 记忆系统四大分类与实现路径 ]

注意:这4个分类不是"阶段",是可组合的模块——一个成熟系统(如 Zep、MemGPT)往往同时用了其中2-3种。

对Agent机器系统的整体印象有了,工程上怎么实现呢?这就是接下来要讲的六大流派。

———

六大架构流派

2025-2026年,Agent记忆领域涌现了大量方案。我把它们归纳为六大流派,每个流派解决的核心问题不同,适用场景也不同。

流派一:自动记忆抽取层(代表:Mem0)

核心思想:在对话流上插一个"自动抽取层",用LLM实时判断"什么值得记",把事实条目抽出来存进向量库+图数据库,下次需要时按语义相似度检索回来。

Mem0是这个方向的代表,2025年ECAI会议发了论文(arXiv:2504.19413)。

工作流程:

  1. 对话流经Mem0层,LLM自动抽取事实("用户偏好Python"等)
  2. 事实去重、合并冲突后存入向量库+图数据库
  3. 下次对话时,按当前上下文语义检索相关记忆,注入prompt

优势:

  • 即插即用,集成成本最低(几行代码)
  • 开源社区最活跃
  • 支持user/agent/session三级记忆隔离
  • 已有云服务,开箱即用

劣势:

  • 抽取质量依赖LLM能力(小模型效果打折)
  • 向量检索丢失时序和因果关系
  • 记忆冲突消解相对简单(覆盖为主)
  • 不适合"事实随时间演变"的强时序场景

适用场景:通用对话记忆、客服机器人、个人助手、快速POC验证。

这个方向的优势是生态完善、易于上手。如果你是第一次给Agent加记忆,Mem0是最简单的起点。


流派二:OS式虚拟内存(代表:Letta/MemGPT)

核心思想:借鉴操作系统的虚拟内存管理——把LLM当CPU,上下文窗口当RAM,外部存储当硬盘。Agent自己负责在"主存"和"外存"之间做分页调度。

MemGPT是2023年的经典论文(arXiv:2310.08560),后来团队成立了Letta继续做。

[ Letta/MemGPT 架构图 ]

核心概念是Memory Blocks

  • Core Blocks

    :始终在上下文窗口里的结构化记忆(人设、用户画像、核心规则),Agent可直接编辑

  • Recall Memory

    :完整对话历史,存在窗口外,Agent可用search工具按需检索

  • Archival Memory

    :无限容量的外部知识库,Agent主动写入和检索,类似"长期笔记本"

关键创新在于:记忆的管理权交给了Agent自己。不是开发者写死"什么该存什么该取",而是给Agent一组memory editing tools,让它自己决定何时读写。

优势:

  • 思想深度最强("LLM as OS"理论源头)
  • Agent自主管理记忆,无需开发者手写规则
  • 完全可控、可审计(所有操作是显式tool call)
  • 支持自托管,数据不出域

劣势:

  • 自编辑记忆的可靠性依赖模型能力(小模型易出错)
  • 每次"分页"都是额外LLM调用,延迟和成本不低
  • 框架较重,简单场景overkill
  • 记忆质量波动——Agent可能"记错笔记"

适用场景:需要完全可控的自托管Agent状态管理、研究型长对话、对记忆操作透明性要求高的企业场景。

Letta的思想很优雅,但工程复杂度比较高。适合有经验的团队做深度定制。


流派三:时序知识图谱(代表:Zep/Graphiti)

核心思想:用知识图谱(而非向量库)作为记忆底座。每条事实是一个"节点",实体之间是"边",关键创新是给每条事实加上"有效时间区间"(valid_at / invalid_at),让记忆能表达"事实会随时间变化"。

Graphiti核心机制:

  • 实体节点

    :对话中出现的每个实体(人、公司、产品、概念)自动提取为图谱节点

  • 关系边

    :实体之间的关系(“用户-喜欢-Python”、“项目-部署在-AWS”)

  • 时间区间

    :每条关系都有有效期(“2024年1月-2024年6月期间,用户偏好Python”)

优势:

  • 支持事实随时间变化,关系推理强
  • 可解释性好,可以可视化记忆结构
  • 多跳推理能力强

劣势:

  • 构建成本高,需要Neo4j等图数据库
  • 语义相似度搜索弱于向量方案
  • 查询性能受图规模影响
  • 需要专业知识建模

适用场景:知识密集型场景、需要强一致性和关系推理的场景。

如果你需要处理事实会变化的场景(比如"用户的地址从A变成B"),Graphiti的时序能力就很有价值。


流派四:自组织记忆(代表:A-MEM)

核心思想:让记忆系统像人脑一样"自组织"——不只是被动存取,而是会主动索引(Indexing)、巩固(Consolidation)、演化(Evolution)。

A-MEM是NeurIPS 2025的论文(arXiv:2502.12110),是目前学术界最前沿的Agent Memory架构之一。

三大核心机制:

  • 索引

    :基于Zettelkasten笔记法,每条记忆自动建立"链接"指向相关记忆,形成动态网络而非平坦列表

  • 巩固

    :类似人类睡眠时的记忆巩固——周期性合并相关记忆、提炼出更高层的洞察、淘汰冗余

  • 演化

    :记忆结构随新信息动态重组——旧记忆被新证据更新,关联关系自动调整

优势:

  • 最接近人类记忆机制的设计
  • 记忆质量随时间提升(巩固效应)
  • 自动发现记忆间的隐含关联
  • 在token效率上表现优异(85-93%效率)

劣势:

  • 仍处学术阶段,产品化程度低
  • 巩固过程需要额外LLM调用,成本较高
  • 过度巩固可能丢失有价值的细节
  • 实现复杂度高,调参门槛高

适用场景:需要长期积累和知识演化的场景——研究助手、知识管理、组织级知识沉淀。

A-MEM的思想很超前,但离生产还有距离。如果你在做研究或者不急着上线,可以关注这个方向。


流派五:LangChain生态(代表:LangMem)

核心思想:与LangChain深度集成,提供记忆能力的标准化接口。

LangMem是LangChain团队做的记忆方案,和LangGraph配合使用。

优势:

  • 生态完善,文档丰富
  • 易用性高,和LangChain无缝集成
  • 社区活跃

劣势:

  • 深度绑定LangChain生态
  • 定制化能力相对有限

适用场景:已经在用LangChain的项目。

如果你已经在用LangChain/LangGraph,LangMem是最自然的选择。但如果你没有用LangChain,没必要为了记忆专门引入它。


流派六:企业级混合架构(代表:Tablestore/阿里云PolarDB)

核心思想:向量数据库 + 知识图谱 + 结构化存储,分层组合。

2026年的最佳实践是混合架构。阿里云PolarDB做了双模存储的实践:

  • 向量检索准确率:92%
  • 关系查询响应:< 50ms
  • 存储成本降低:40%

腾讯云也推出了Agent Memory方案,四层渐进式架构:L0原始对话→L1原子记忆→L2场景分块→L3用户画像。

优势:

  • 综合能力最强
  • 可以针对不同场景选择不同存储
  • 生产就绪

劣势:

  • 实现复杂
  • 需要维护多套存储系统
  • 运维成本高

适用场景:企业级生产环境、大规模Agent平台。

混合架构是企业级的选择。如果你有工程团队、有运维能力、需要处理海量数据,这是最稳妥的方案。

———

技术现状:2026年的成熟度评估

看完六大流派,你可能想知道:哪些能用,哪些还在实验室?

我根据论文和开源项目的状态,做了一个粗略的评估:

方案 成熟度 生产就绪 适用阶段
Mem0 ⭐⭐⭐⭐⭐ 快速验证、中小规模生产
LangMem ⭐⭐⭐⭐ LangChain生态用户
Letta/MemGPT ⭐⭐⭐ ⚠️ 研究型、深度定制
Graphiti/Zep ⭐⭐⭐ ⚠️ 知识密集型场景
混合架构 ⭐⭐⭐⭐ 企业级大规模
A-MEM ⭐⭐ 学术研究

几个关键发现:

第一,Mem0是当前生态之王。GitHub 60K+ stars,ECAI 2025论文,云服务开箱即用。如果你要快速给Agent加记忆,这是最简单的起点。

第二,混合架构是企业级的选择。阿里云、腾讯云都在推这个方向。但实现复杂度高,不是小团队能轻易搞定的。

第三,学术前沿和生产落地有差距。A-MEM的思想很超前(NeurIPS 2025),但产品化程度低。从论文到生产,还有很长的路。

第四,关键挑战还没解决。2026年2月的综述论文《Anatomy of Agentic Memory》指出了几个核心问题:

  • 基准测试饱和:现有benchmark规模不足,复杂记忆系统常常不如简单baseline
  • 指标有效性:F1分数和语义正确性之间存在错位
  • 模型依赖性:性能随底层模型变化显著,换个模型效果可能天差地别
  • 系统成本:记忆维护的延迟和吞吐量开销经常被忽视

这些问题说明,Agent记忆还没有"被解决"。我们在一个快速发展的阶段,但离成熟还有距离。

———

选型决策树:你的场景该选哪个?

看完这些方案,怎么选?

我画了一个简单的决策树:

🌳 你需要给Agent加记忆

├─ 你已经在用LangChain/LangGraph? → LangMem

├─ 你需要快速验证,不想折腾? → Mem0

├─ 你是企业级场景,有工程团队? → 混合架构

├─ 你需要处理事实随时间变化的场景? → Graphiti/Zep

├─ 你需要完全可控、可审计的记忆操作? → Letta/MemGPT

└─ 你在做学术研究,探索前沿? → A-MEM

几个具体建议:

如果你是个人开发者,想给自己的Agent加记忆:用Mem0。几行代码就能集成,文档丰富,社区活跃。

如果你在做企业级Agent平台:考虑混合架构。阿里云PolarDB或腾讯云Agent Memory都是不错的选择。

如果你在研究记忆机制本身:关注Letta和A-MEM。它们的思想很有启发性。

如果你在做一个知识密集型的应用(比如法律、医疗):Graphiti的时序知识图谱可能更合适。

———

未来展望:开放问题与研究方向

最后,聊聊Agent记忆的未来。

2026年的几篇综述论文都提到了一些开放问题:

1. 持续巩固(Continual Consolidation)

人类在睡眠时会巩固记忆,把短期记忆转化为长期记忆。Agent能不能也这样?不是实时处理所有信息,而是在"空闲"时整理记忆。(跟这篇文章不谋而合——Language Models Need Sleep)

2. 因果检索(Causally Grounded Retrieval)

现在的检索主要基于语义相似度。但有时候我们需要的是因果关系——“因为A发生了,所以B才会发生”。这种因果检索还很不成熟。

3. 可信反思(Trustworthy Reflection)

Agent应该能从过去的错误中学习。但怎么保证反思的质量?怎么避免"学错"?

4. 学习遗忘(Learned Forgetting)

人脑会主动遗忘不重要的信息。Agent也应该学会优雅地淘汰过时记忆,而不是无限堆积。

5. 多模态记忆(Multimodal Memory)

现在的记忆主要是文本。但Agent处理的可能是图片、音频、视频。怎么统一表示多模态记忆?

6. 隐私与合规(Privacy and Compliance)

记忆可能包含敏感信息。怎么处理数据隐私?怎么实现"机器遗忘"——当用户要求删除数据时,怎么确保真的从模型记忆里清除了?

这些问题,每一个都值得深入研究。

———

写在最后

回到开头的问题:为什么Agent需要记忆?

因为没有记忆的Agent,本质上只是一个函数。输入进去,输出出来,没有状态,没有积累,没有成长。

2025-2026年,Agent记忆领域发展很快。从Mem0的自动抽取,到Letta的虚拟内存,到A-MEM的自组织,我们看到了很多有创意的方案。

但说实话,这个领域还没有"被解决"。基准测试饱和、指标有效性、系统成本、隐私合规——这些问题都还在探索中。

我的判断是:Agent记忆会是接下来1-2年的重要研究方向。随着Agent从"工具"变成"助手"再到"伙伴",记忆会变得越来越重要。

学AI大模型的正确顺序,千万不要搞错了

🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!

有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!

就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋

在这里插入图片描述

📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇

学习路线:

✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经

以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!

我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~

这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费

在这里插入图片描述

更多推荐