← 资料站  /  Continuous Learning  /  Agent 记忆系统
论文 Agent 记忆系统

A Survey on the Memory Mechanism of Large Language Model based Agents

LLM 智能体记忆机制综述:What / Why / How 的经典框架
一句话人大高瓴 2024 年 4 月发布的 agent 记忆机制综述(TOIS 2025 正式发表,S2 引用 736),用『来源 × 形式 × 操作』三维框架系统梳理了 MemGPT、Generative Agents、Voyager 等 28 个早期记忆系统,是该领域被引最多的总纲式参考;但止步于 2024 年初的文献,Mem0/A-MEM/HippoRAG 之后的工作全部不在图内。

这是什么

这篇综述回答三个问题:agent 的记忆是什么(What)、为什么需要(Why)、怎么设计和评估(How)。作者先给出形式化定义:把一次任务内的交互信息(inside-trial)、跨任务的历史经验(cross-trial)和外部知识(external knowledge)统一进 memory 的范畴,并用 a_{t+1} = LLM{R(P(M, W({a,o})), c)} 这样的算子式把 Writing / Reading / Management(reflection、merging、forgetting)三类操作显式建模,这是它区别于泛泛而谈的地方。

Why 部分从认知心理学、self-evolution、应用需求三个视角论证记忆的必要性——其中 self-evolution 视角(经验积累、环境探索、知识抽象)和课题组的 continual learning 方向直接对口。How 部分是主体:按来源、形式(textual vs parametric)、操作三个维度,用对照表逐一标注 MemoryBank、MemGPT、Voyager、Reflexion、ExpeL、Generative Agents、GITM 等系统的设计选择,然后讨论评估(直接评估 vs 通过下游任务间接评估)和应用场景(role-playing、personal assistant、游戏、代码、推荐等)。

背景上要注意时间点:成文于 2024 年 4 月,正好在 MemGPT/Generative Agents 掀起第一波 agent memory 热潮之后、Mem0/A-MEM/图结构记忆等第二波之前。它捕捉的是『第一代』agent 记忆系统的设计空间,2025 年 7 月被 ACM TOIS 接收,是这个领域最早也是被引最多的系统性综述。

全文核心框架一图流:左边用 Alice 旅行规划/电影推荐两个任务示例区分记忆三来源(cross-trial / inside-trial / external knowledge),右上是记忆两形式(textual 的 complete/recent/retrieved/external 四种粒度 vs parametric 的 fine-tuning/knowledge editing),右下是三操作(Writing / Reading / Management,其中 management 含 merging、reflection、forgetting)。整篇综述的分类学都在这张图里。
全文核心框架一图流:左边用 Alice 旅行规划/电影推荐两个任务示例区分记忆三来源(cross-trial / inside-trial / external knowledge),右上是记忆两形式(textual 的 complete/recent/retrieved/external 四种粒度 vs parametric 的 fine-tuning/knowledge editing),右下是三操作(Writing / Reading / Management,其中 management 含 merging、reflection、forgetting)。整篇综述的分类学都在这张图里。

机制与做法

三维分类:来源 × 形式 × 操作

来源(sources)分三类:inside-trial(当前任务内的交互轨迹)、cross-trial(跨任务累积的经验,如 Reflexion 的失败反思、ExpeL 的成功轨迹)、external knowledge(RAG 式外部知识)。论文用一张 28 行的对照表标注每个系统用了哪些来源,一眼能看出 2024 年初的现状:几乎所有系统都用 inside-trial,只有 Retroformer/ExpeL/Reflexion/GITM/Synapse/MetaGPT 六个真正做了 cross-trial——也就是说『从经验中持续学习』在当时还是少数派,这正是后来 experience-learning 一支(站内 ExpeL、AWM、Dynamic Cheatsheet、Memento)爆发的空间。

形式(forms)分 textual(complete / recent / retrieved / external 四种粒度)和 parametric(fine-tuning、knowledge editing)。对照表显示当时 parametric 记忆极少(只有 Character-LLM、Huatuo、Retroformer、MAC、InvestLM 沾边),主流全是 textual + 检索。作者在 Limitations 里明确把 parametric memory 列为最重要的未来方向,理由是信息密度更高、可用优化方法隐式学会 merging/reflection 而不必手写规则——这个预判后来被 SEAL、Titans、test-time learning 一线验证。

记忆评估的二分法:直接评估(主观的 coherence/rationality,客观的 result correctness、reference accuracy、时间与硬件开销)vs 间接评估(通过对话、multi-source QA、长上下文应用等下游任务反推记忆模块有效性)。当时领域缺统一 benchmark,这张图解释了为什么后来 LoCoMo/LongMemEval 出现前 memory 系统的评测各说各话。
记忆评估的二分法:直接评估(主观的 coherence/rationality,客观的 result correctness、reference accuracy、时间与硬件开销)vs 间接评估(通过对话、multi-source QA、长上下文应用等下游任务反推记忆模块有效性)。当时领域缺统一 benchmark,这张图解释了为什么后来 LoCoMo/LongMemEval 出现前 memory 系统的评测各说各话。

操作层:Writing / Management / Reading

Writing 关心存什么:存原始信息还是摘要(MemoChat 按话题摘要建索引、TiM 抽取实体关系存结构化库、MemGPT 让 agent 自主决定写入)。Management 对应人脑的记忆加工:reflection 生成高层记忆(Generative Agents 的事件积累触发反思)、merging 合并冗余、forgetting 遗忘旧信息(MemoryBank 的遗忘曲线)。Reading 关心怎么取:文本记忆靠相似度检索(ExpeL 用 Faiss 取 top-K 相似成功轨迹),ChatDB 用 LLM 生成 SQL 做 Chain-of-Memory 查询。

这套 write/manage/read 的操作词汇后来成了领域通用语言——Mem0 的 ADD/UPDATE/DELETE/NOOP、Memory-R1 的记忆管理 RL、A-MEM 的动态链接,都能映射回这个框架。读站内这些条目前先过一遍这一章,能省很多对齐概念的功夫。

评估:直接 vs 间接

作者把记忆评估分成两条路:直接评估记忆本身(主观的 coherence/rationality 人评,客观的 result correctness、reference accuracy、时间/存储开销)和间接评估(把记忆模块放进对话、multi-source QA、长上下文应用里看下游任务分数)。论文坦承当时缺乏统一 benchmark——这个空缺后来才由 LoCoMo、LongMemEval 等填上,也是为什么站内 Mem0 vs Zep 会在 LoCoMo 上打起口水仗。这一节可以当『为什么 memory 评估如此混乱』的历史注脚读。

关键结果

实证核查

扎实综述本身诚实扎实:分类有形式化支撑、对照表可核对、未来方向预判基本命中,且经 TOIS 同行评审;水分在配套 repo——摘要承诺用它『keep up with the latest advances』,实际从未维护成 paper list。当『2024 年初的经典地图』用没问题,当『最新图景』用会严重过时。
摘要声称『To keep up with the latest advances in this field, we create a repository at github.com/nuster1128/LLM_Agent_Memory_Survey』。
该 repo(507 star)共 15 个 commit:除 2025-07-28 一次 README 更新(加 TOIS 接收公告)外,全部集中在 2024 年 4 月。README 内容只是论文摘要 + 论文里的图表截图,没有可维护的论文列表,『追踪最新进展』的承诺没有兑现。arXiv 也停留在 v1(2024-04-21),从未随 TOIS 版本更新。
自称 comprehensive survey,系统覆盖 agent 记忆机制的设计模式。
对 2024 年 4 月前属实,之后为空白:grep paper.bbl(174 条参考文献),HippoRAG(2024-05)、Mem0、A-MEM、Agent Workflow Memory、Memp、Memory-R1、Memento、Dynamic Cheatsheet 等站内同方向关键条目均 0 次出现;parametric/test-time 一线的 Titans、SEAL 也不在。这是时间性缺失而非学术疏漏,但意味着它不能当现状综述读——最新图景要靠站内 memory-in-the-age-of-ai-agents-a-survey(2512)补。
框架被领域接受、可作总纲。
S2 引用 736,TOIS 2025 正式发表;抽查 S2 citation contexts(PolyMemDB、HERO、RippleMem、多篇后续 survey 等),它被普遍作为 agent 记忆的标准背景引用,write/read/management 操作词汇被沿用;但也有后续综述改用『extraction–representation–retrieval–maintenance』等新生命周期框架,说明其分类学是起点而非终点。
(文本质量)TOIS 级别的严谨写作。
repo issue #1 指出预印本 5.2.1 节(P14)有语义重复的句子,核对本地 tex 源码确认该重复至今存在于 arXiv v1('In the former three methods...' 与 'In the former three types...' 两句连续重复);小瑕疵,不影响内容,但佐证 arXiv 版确实无人再修订。

与我们方向的关系

对课题组这是 agent-memory-systems 子方向的『第一张地图』,建议的用法:入门第一篇读它的 Section 3-5(定义 + 三维分类 + 操作),建立 sources/forms/operations 的坐标系,然后带着这个坐标系去读站内具体系统——MemGPT/Generative Agents/Voyager 是它表格里的一手对象,Mem0/A-MEM/Memory-R1/Memp 则是表格之后的新格局,读的时候可以自己给新系统在它的表格里补行,很快能看出演化方向(cross-trial 和 memory management 从少数派变成主战场)。

与站内另一篇 2512 记忆综述(Memory in the Age of AI Agents)是明确的互补关系:这篇给经典框架和形式化定义,2512 给 2025 年的最新版图;查『某个记忆设计有没有前人做过』先翻这篇的对照表,查『现在 SOTA 是什么』翻 2512。它的 Limitations 章(parametric memory、lifelong learning)还可以当选题清单用——parametric memory 一节几乎就是 test-time-learning 子方向(Titans/SEAL)的问题陈述,memory-based lifelong learning 一节直接对应课题组 continual learning 主线。

阅读笔记

读的时候可跳过 Section 6 应用部分(role-playing/推荐/游戏等的罗列,信息密度低)。注意区分版本:TOIS 2025 正式版(DOI 10.1145/3748302)与 arXiv v1 内容基本同源,arXiv 未更新。repo 只是论文镜像,不用 star 追踪。

材料清单

TeX 源码
已存档:Raw/llm-agent-memory-mechanism-survey/source/
代码仓库github.com/nuster1128/LLM_Agent_Memory_Survey
507★ · 最近推送 2025-07-28
TOIS 正式版dl.acm.org/doi/10.1145/3748302
2025-07 被 ACM Transactions on Information Systems 接收发表

相关条目

同子模块 · Agent 记忆系统
跨方向 · 同标签