← 返回资料站  /  Continuous Learning
论文 综述

Memory in the Age of AI Agents: A Survey

AI Agent 时代的记忆:一篇统一分类的综述
一句话复旦、人大、Oxford 等 47 位作者的 agent memory 综述(2025-12),用形态(token/参数/隐状态)× 功能(事实/经验/工作记忆)× 动态(形成/演化/检索)三个正交视角统一了碎片化的记忆研究,梳理 400+ 论文、30+ benchmark 和约 20 个开源框架;8 个月内 S2 引用 250,配套 paper list 2.3k stars。

这是什么

2023 年以来 agent 记忆的论文爆发式增长,但术语混乱:同样叫 "memory" 的工作,动机、实现、评测协议可能完全不同,传统的 long-term/short-term 二分已经装不下这些系统。这篇综述做的第一件事就是划清边界——用一张 Venn 图区分 Agent Memory 与 LLM Memory、RAG、Context Engineering 四个概念:agent memory 的独特之处是维护一个跨任务持久、自演化的认知状态;RAG 查的是外部静态知识库,context engineering 是把上下文窗口当稀缺资源做调度,而 KV cache 管理、长上下文架构(Mamba 等)属于 LLM 内部记忆,不在 agent memory 范围内。

主体是三个正交的分类轴。形态轴(什么载体承载记忆):token-level(显式文本/结构,可读可编辑)、parametric(写进权重,泛化好但更新慢、易灾难性遗忘)、latent(隐状态/KV,机器原生、token 高效但人不可读)。功能轴(为什么需要记忆):factual(用户画像与环境知识)、experiential(案例/策略/技能三类经验)、working(单轮压缩与多轮状态整合)。动态轴(记忆如何运转):formation(从原始交互提取记忆单元)、evolution(consolidate/update/forget)、retrieval(何时、检索什么、如何用)。每个格子里都挂了代表工作,例如 factual+token 有 Mem0/Zep/A-MEM,experiential+token 有 Reflexion/ExpeL/AWM/ReasoningBank,working+latent 有 MEM1/SnapKV。

除了分类,Section 6 汇总了评测资源(LoCoMo、LongMemEval、MemoryAgentBench、LifelongAgentBench 等 30+ benchmark,按记忆型/终身学习型/自演化型分层)和 MemGPT、Mem0、Zep、MemOS、Letta 等约 20 个开源框架的对照表;Section 7 给出 7 个前沿判断,其中最有信息量的是 memory retrieval → memory generation、手工规则 → RL 驱动记忆管理这两条趋势线。

四概念 Venn 图:Agent Memory 与 LLM Memory、RAG、Context Engineering 的交叠与分界。看各交集区的例子最有用——比如 memory graph(Zep/AriGraph)落在 Agent Memory 与 RAG 之间,KV 压缩落在与 LLM Memory 之间;而 self-evolving memory、parametric memory、RL-enabled memory 是 Agent Memory 独有的部分。这张图是全文划定研究范围的依据。
四概念 Venn 图:Agent Memory 与 LLM Memory、RAG、Context Engineering 的交叠与分界。看各交集区的例子最有用——比如 memory graph(Zep/AriGraph)落在 Agent Memory 与 RAG 之间,KV 压缩落在与 LLM Memory 之间;而 self-evolving memory、parametric memory、RL-enabled memory 是 Agent Memory 独有的部分。这张图是全文划定研究范围的依据。

机制与做法

三形态的取舍:一张实用的选型表

综述对三种记忆形态给了工程上可操作的对比:token-level 符号化、可寻址、透明,增删改快,适合多轮 chatbot、个性化 agent 和法律/金融/医疗等需要可审计的高风险场景;parametric 隐式、抽象、可泛化,(通常)性能增益更大,但更新慢且灾难性遗忘更严重,适合角色扮演和需要习得全新能力的任务;latent 记忆(hidden states / 连续向量)人不可读,但天然适合多模态融合、端侧部署和低资源场景。这个 forms 视角的价值在于把 "用什么存" 和 "存来干什么" 解耦——同一个 experiential memory 既可以存成文本 insight(ReasoningBank),也可以蒸馏进 LoRA(Retroformer),还可以生成 latent token(MemGen)。

记忆动态的全景图(Section 5):agent backbone 与环境交互产生 raw information,经 Memory Formation(摘要/结构化/蒸馏/参数内化)变成 memory unit,由 Memory Evolution(consolidate/update/forget)整合进自演化的 Memory Base,再经 Memory Retrieval(when&where / what / how to retrieve / how to consolidate 四个决策)返回 agent。看懂这个闭环,Section 5 里的几十篇论文就都能对号入座。
记忆动态的全景图(Section 5):agent backbone 与环境交互产生 raw information,经 Memory Formation(摘要/结构化/蒸馏/参数内化)变成 memory unit,由 Memory Evolution(consolidate/update/forget)整合进自演化的 Memory Base,再经 Memory Retrieval(when&where / what / how to retrieve / how to consolidate 四个决策)返回 agent。看懂这个闭环,Section 5 里的几十篇论文就都能对号入座。

动态轴:formation-evolution-retrieval 的闭环

Section 5 把记忆生命周期画成一个闭环(见图):agent 与环境交互产生 raw information → memory formation(语义摘要、结构化构建、知识蒸馏、参数内化等手段把原始数据变成 memory unit)→ memory evolution(新记忆与旧库整合,包含 consolidate/update/forget 三种操作)→ memory retrieval(决定 when&where、what、how to retrieve 以及检索后如何 consolidate 进上下文)。这个框架的好处是能把看起来不相干的工作放到同一坐标系里:比如 MemoryBank 的遗忘曲线是 evolution 里的 forget 策略,HippoRAG 的图遍历是 retrieval 策略,Mem-α 用 RL 学的是 formation。

前沿判断:RL 正在接管记忆管理

Section 7 里最值得读的是 RL × memory 那节,给出三阶段演化图:RL-free(Mem0、MemOS、ExpeL 这类 prompt 驱动的启发式管道,目前仍是主流)→ RL-assisted(RL 只管一部分记忆操作:RMM 用 policy gradient 做检索重排,Mem-α/Memory-R1 用 RL 学记忆构建,Context Folding/MemSearcher/IterResearch 用 RL 学工作记忆的折叠压缩)→ 完全 RL-driven(记忆架构和控制策略端到端学出来,尚未实现)。作者的立场是:模仿人类认知的先验(海马体类比、episodic/semantic 分类)未必是人工 agent 的最优结构,应该让 RL 优化过程自己长出记忆组织方式。另一个平行趋势是从 memory retrieval 转向 memory generation——不再假设记忆库已经存好、只管查准,而是按需合成面向当前任务的记忆表示(ComoRAG 的 retrieve-then-generate,MemGen/VisMem 的直接生成 latent 记忆)。

关键结果

实证核查

扎实综述型工作,声称与实际交付一致:论文正文、benchmark/框架对照表、配套 paper list 都真实存在且结构对应。主要折扣是 "持续维护的论文列表" 已停更约半年,且 README 只搬了 paper list、没有搬 benchmark/框架表。
摘要声称 "compile a comprehensive summary of memory benchmarks and open-source frameworks"。
属实但只在论文里:main.tex Section 6(712-916 行)确有 tab:benchmark 和 tab:open_source_framework 两张对照表,覆盖 LoCoMo/LongMemEval/MemoryAgentBench 等 30+ benchmark 和 MemGPT/Mem0/Zep/MemOS 等约 20 个框架;但 GitHub repo README 只有按分类组织的 paper list,benchmark 和框架表没有同步过去,想用表格还得回论文查。
收录理由称其为 "配套持续维护的论文列表",README 也写 "More papers are coming soon"。
维护已停滞:repo(Shichun-Liu/Agent-Memory-Paper-List)最后 push 是 2026-03-04,距今(2026-08)近 6 个月无更新;2026 年上半年社区提的加论文 issue(#22 SimpleMem、#25 AMA-Bench、#29-#31、#33 参考文献错误等)多数 open 无回应,#32 指出的图 4 typo 也未修。作为 2025-12 时点的快照索引仍然可用,但不能指望它追踪 2026 年 3 月以后的新工作。
README 声称 2025-12-16 登上 Huggingface Daily Paper #1、2026-01 破 1k stars。
与 meta 数据一致:HF paper 页存在(huggingface.co/papers/2512.13564),repo 现有 2354 stars(created 2025-12-13),S2 引用 250,量级与 "领域头部综述" 的自我定位相符。综述本身无实验声称,不存在复现问题。

与我们方向的关系

对做 continual learning / self-evolving agent 的同学,这篇的实用价值是当索引和坐标系用:任何新出的 memory 工作都可以先问三个问题——存在哪(token/参数/latent)、存什么(事实/经验/工作状态)、怎么演化(formation/evolution/retrieval 哪一环有创新),快速定位它相对已有工作的增量。Experiential memory 一节(Reflexion→ExpeL→AWM→ReasoningBank→Memp 这条线)与本组 "agent 从经验中持续学习" 方向直接对口。

两个可跟进的研究缺口:一是 RL × memory 三阶段图里 "fully RL-driven" 一格目前是空的,现有工作(Mem-α、MemSearcher)都只覆盖记忆生命周期的一段,端到端学整个 formation-evolution-retrieval 闭环还没人做;二是 parametric experiential memory(把经验写进权重而非文本库)条目明显稀疏,只有 Retroformer、Early Experience 等寥寥几篇,与 token-level 的 40+ 篇形成对比,这正是 continual learning 技术可以切入的位置。注意 repo 已停更,追 2026-03 之后的新论文需要自己补。

阅读笔记

读法建议:正文 60+ 页不必通读,Section 2.3(概念辨析)+ Section 6 两张表 + Section 7(frontiers)约 15 页是信息密度最高的部分,Section 3-5 当字典按需查。注意 README 的 paper list 分类是 功能×形态 二维网格,与论文章节结构(形态、功能分开两章)不完全一致。论文 2026-01-13 更新过一版,引用时用 v2。

材料清单

TeX 源码
已存档:Raw/memory-in-the-age-of-ai-agents-a-survey/source/
代码仓库github.com/Shichun-Liu/Agent-Memory-Paper-List
2354★ · 最近推送 2026-03-04
arXiv HTMLarxiv.org/html/2512.13564
在线阅读全文(含 benchmark 与开源框架两张对照表)

同类条目