论文
综述
Lifelong Learning of Large Language Model based Agents: A Roadmap
LLM Agent 终身学习路线图(TPAMI 综述)
Junhao Zheng, Chengming Shi, Xidi Cai, et al. (South China University of Technology, Tencent AI Lab) · South China University of Technology · arXiv · 2025-01 · 被引 86
一句话 华南理工 + 腾讯 AI Lab 的综述,第一篇系统梳理"LLM agent 终身学习"的 roadmap:把 agent 拆成 perception / memory / action 三个模块组织已有工作,给出评测指标和 benchmark 清单;2025-01 挂 arXiv,2026 年被 TPAMI 接收,S2 引用 86 次。
这是什么 传统 LLM 的 continual learning 研究(continual pre-training、continual instruction tuning 等)把模型当成静态黑盒,只处理数据分布随时间变化的问题,没有环境交互。这篇综述提出的问题设定不同:LLM agent 在动态环境里连续接任务(游戏、web 浏览、购物、操作系统等),要通过交互不断积累经验、避免 catastrophic forgetting,同时保持 plasticity——也就是把经典 stability-plasticity dilemma 搬到 agent 场景。
文章自称是这个交叉方向的第一篇系统综述,核心贡献是一个三模块分类法:perception module(单模态/多模态输入的持续接入)、memory module(working / episodic / semantic / parametric 四类记忆)、action module(grounding / retrieval / reasoning 三类动作),用 7 个研究问题(RQ1-RQ7)串起全文。配套 GitHub 仓库是一个 awesome list,按同样的分类法整理论文,327 stars,2026 年 2 月仍在更新。
全文核心分类法:agent 被拆成 memory(semantic/parametric/episodic/working 四类,分别沿 外部-内部、显式-隐式、长期-短期、静态-动态 几条轴排布)、perception(单模态/多模态)、action(grounding/retrieval/reasoning)三个模块,每块标注了各自的 focus。读这篇综述基本就是按这张图逐格展开。 机制与做法 三模块分类法
Memory 是全文最细的部分,按四个维度切:working memory 管当前 prompt/上下文(prompt 优化、上下文压缩),episodic memory 存过去的交互轨迹(经验回放、案例检索),semantic memory 存外部结构化知识(knowledge graph、RAG、持续更新的文档库),parametric memory 直接改模型权重(lifelong model editing,如 GRACE、WISE、MoE-LoRA 类方法)。四类记忆分别对应 短期-长期、显式-隐式、外部-内部 几条轴。
Action 按动作类型分三层:grounding actions 是对环境的实际操作(tool/API 调用、web 操作、游戏动作),retrieval actions 是从 semantic/episodic memory 里取知识,reasoning actions 是 episode 内(ReAct、Reflexion、ToT)和跨 episode(Voyager 式技能库积累)的推理与自我改进。Perception 相对薄,分单模态(主要是 web 页面转文本)和多模态(模态持续扩展)两节。
本文的问题设定:LLM agent 沿时间轴依次面对 Task A/B/C 等不同环境,通过 actions-observations 闭环持续交互。与之对照的传统 LLM continual learning 只是输入输出数据分布随时间变化、没有环境反馈——这是全文用来划定范围的关键区分。 评测指标与 benchmark
指标沿用经典 continual learning 那套并形式化到 agent 上:整体性能用 AP(average performance)和 AIP(average incremental performance),stability 用 FGT(forgetting)和 BWT(backward transfer),plasticity 用 FWT(forward transfer)。前提是 agent 在每个任务上的表现能压成一个标量。
Benchmark 分两组:一组是"孤立技能"的传统 CL 数据集(CITB、SuperNI、zsRE、CounterFact 等),另一组是"综合场景"的 agent benchmark(ToolBench、WebArena、AgentBench 等)。作者也承认后者并非为终身学习设计——这个空缺由他们自己 2025-06 发布的 LifelongAgentBench 补上。
开放问题
Future directions 一节按模块给了清单:perception 侧是模态自动接入和 domain-agnostic 编码器;memory 侧是层级化记忆、检索优化、过期知识的主动裁剪(pruning/summarization)、类脑 consolidation;action 侧是层级化动作空间、RL 驱动的自我进化、human-in-the-loop 修正;最后强调 perception-memory-action 的跨模块反馈回路和 continual curriculum。这些条目偏 wishlist,没有给出具体技术路径,但可以当选题清单用。
关键结果 分类法把 agent 终身学习拆成 3 大模块、9 个子方向(单/多模态 perception;working/episodic/semantic/parametric memory;grounding/retrieval/reasoning action),每个子方向配论文表格,覆盖约 2017-2024 的文献。 给出了 agent 场景下的 5 个形式化指标:AP、AIP、FGT、BWT、FWT,直接沿用 CL 社区定义,任务表现假设可标量化。 指出现有 agent benchmark(WebArena、ToolBench、AgentBench 等)都不是按任务序列的终身学习协议设计的;同组随后发布 LifelongAgentBench(2025-06)作为第一个专门 benchmark。 arXiv 版是纯综述,没有实验;README 称 TPAMI 正式版将补充实验结果,截至 2026-02 更新版尚未放出。 S2 引用 86 次,GitHub 327 stars,是这个细分方向目前引用最高的 roadmap 类综述之一。 实证核查
扎实 作为综述,声称与实际内容一致:分类法、论文表格、指标定义都能在 tex 源码和仓库里对上,且被 TPAMI 接收、引用 86 次;但要清楚它是文献组织 + roadmap,arXiv 版没有任何实验,部分收录论文与"终身学习"的关联比较松。
自称"first survey to systematically summarize potential techniques for incorporating lifelong learning into LLM-based agents",并提供 roadmap。
内容与声称相符:tex 源码(source/sections/ 共 11 个 section)完整覆盖三模块 + 评测 + 应用 + 未来方向;2026-01 被 IEEE TPAMI 接收(README News 栏、S2 venue 字段一致),S2 引用 86 次。"第一篇"的限定词是 agent+lifelong 交叉——同组此前的 Towards Lifelong Learning of LLMs 综述只覆盖 LLM 本身,不含环境交互,所以这个声称成立。
GitHub 仓库提供"relevant literature and resources"。
仓库(qianlima-lab/awesome-lifelong-llm-agent,327 stars)只是按分类法整理的论文链接表,无任何代码或数据;全部 5 个 issue 都是请求收录新论文(#1-#5,均 open),没有质疑内容的 issue。作为 awesome list 它是活的(pushed 2026-02),但"resources"不要期待成工具库。
三模块分类法能把已有工作干净地组织起来。
对照 README 论文表可见边界并不干净:Voyager、See and Think、ART、Large Language Models as Tool Makers 等同一篇论文在 3-4 个类目下重复出现;且相当多收录论文(ReAct、Tree of Thoughts、Toolformer 等)本身与 continual/lifelong learning 无关,是被"追认"进框架的通用 agent 技术。用它找文献没问题,但别把类目当成严格的方法学区分。
README 宣称 2025-06 发布了第一个 LLM agent 终身学习 benchmark LifelongAgentBench,论文/代码/数据齐全。
该 benchmark 是同组后续工作(arXiv 2505.11942,有独立项目页和代码仓库),不在本综述 arXiv 版正文内;综述本身零实验。README 承诺的"含实验结果的 TPAMI 更新版"截至本地快照(2026-02)未上传 arXiv。
与我们方向的关系 这是和课题组"agent 持续学习"设定最对口的一篇地图型文献,价值主要在两处:一是四类 memory(working/episodic/semantic/parametric)的划分可以直接拿来给自己的方法定位——目前大多数 agent 记忆工作停留在 episodic(存轨迹)+ semantic(RAG),parametric(lifelong model editing 与 agent 结合)基本是空白,这正是选题机会;二是评测协议,AP/AIP/FGT/BWT/FWT 五个指标加上"现有 agent benchmark 都不是序列化协议"的判断,可以作为实验设计的起点,配合同组的 LifelongAgentBench 用。
读法建议:不必通读,按需查表。正文各 section 的写作偏罗列,信息密度低于 README 的论文表格;future directions 一节可以当选题 checklist 扫一遍,但每条都只有一段话,具体可行性要自己评估。
阅读笔记 meta.json 里 S2 venue 已显示 TPAMI,和 README 的 2026-01 接收消息互相印证。同组还有一个姊妹仓库 zzz47zzz/awesome-lifelong-learning-methods-for-llm 覆盖 LLM(非 agent)的 continual learning,查方法时两个仓库配合用。
材料清单 TeX 源码 已存档:Raw/lifelong-learning-of-large-language-model-a/source/
同类条目