← 返回资料站  /  Continuous Learning
论文 综述

Lifelong Learning of Large Language Model based Agents: A Roadmap

LLM Agent 终身学习路线图(TPAMI 综述)
一句话华南理工 + 腾讯 AI Lab 的综述,第一篇系统梳理"LLM agent 终身学习"的 roadmap:把 agent 拆成 perception / memory / action 三个模块组织已有工作,给出评测指标和 benchmark 清单;2025-01 挂 arXiv,2026 年被 TPAMI 接收,S2 引用 86 次。

这是什么

传统 LLM 的 continual learning 研究(continual pre-training、continual instruction tuning 等)把模型当成静态黑盒,只处理数据分布随时间变化的问题,没有环境交互。这篇综述提出的问题设定不同:LLM agent 在动态环境里连续接任务(游戏、web 浏览、购物、操作系统等),要通过交互不断积累经验、避免 catastrophic forgetting,同时保持 plasticity——也就是把经典 stability-plasticity dilemma 搬到 agent 场景。

文章自称是这个交叉方向的第一篇系统综述,核心贡献是一个三模块分类法:perception module(单模态/多模态输入的持续接入)、memory module(working / episodic / semantic / parametric 四类记忆)、action module(grounding / retrieval / reasoning 三类动作),用 7 个研究问题(RQ1-RQ7)串起全文。配套 GitHub 仓库是一个 awesome list,按同样的分类法整理论文,327 stars,2026 年 2 月仍在更新。

全文核心分类法:agent 被拆成 memory(semantic/parametric/episodic/working 四类,分别沿 外部-内部、显式-隐式、长期-短期、静态-动态 几条轴排布)、perception(单模态/多模态)、action(grounding/retrieval/reasoning)三个模块,每块标注了各自的 focus。读这篇综述基本就是按这张图逐格展开。
全文核心分类法:agent 被拆成 memory(semantic/parametric/episodic/working 四类,分别沿 外部-内部、显式-隐式、长期-短期、静态-动态 几条轴排布)、perception(单模态/多模态)、action(grounding/retrieval/reasoning)三个模块,每块标注了各自的 focus。读这篇综述基本就是按这张图逐格展开。

机制与做法

三模块分类法

Memory 是全文最细的部分,按四个维度切:working memory 管当前 prompt/上下文(prompt 优化、上下文压缩),episodic memory 存过去的交互轨迹(经验回放、案例检索),semantic memory 存外部结构化知识(knowledge graph、RAG、持续更新的文档库),parametric memory 直接改模型权重(lifelong model editing,如 GRACE、WISE、MoE-LoRA 类方法)。四类记忆分别对应 短期-长期、显式-隐式、外部-内部 几条轴。

Action 按动作类型分三层:grounding actions 是对环境的实际操作(tool/API 调用、web 操作、游戏动作),retrieval actions 是从 semantic/episodic memory 里取知识,reasoning actions 是 episode 内(ReAct、Reflexion、ToT)和跨 episode(Voyager 式技能库积累)的推理与自我改进。Perception 相对薄,分单模态(主要是 web 页面转文本)和多模态(模态持续扩展)两节。

本文的问题设定:LLM agent 沿时间轴依次面对 Task A/B/C 等不同环境,通过 actions-observations 闭环持续交互。与之对照的传统 LLM continual learning 只是输入输出数据分布随时间变化、没有环境反馈——这是全文用来划定范围的关键区分。
本文的问题设定:LLM agent 沿时间轴依次面对 Task A/B/C 等不同环境,通过 actions-observations 闭环持续交互。与之对照的传统 LLM continual learning 只是输入输出数据分布随时间变化、没有环境反馈——这是全文用来划定范围的关键区分。

评测指标与 benchmark

指标沿用经典 continual learning 那套并形式化到 agent 上:整体性能用 AP(average performance)和 AIP(average incremental performance),stability 用 FGT(forgetting)和 BWT(backward transfer),plasticity 用 FWT(forward transfer)。前提是 agent 在每个任务上的表现能压成一个标量。

Benchmark 分两组:一组是"孤立技能"的传统 CL 数据集(CITB、SuperNI、zsRE、CounterFact 等),另一组是"综合场景"的 agent benchmark(ToolBench、WebArena、AgentBench 等)。作者也承认后者并非为终身学习设计——这个空缺由他们自己 2025-06 发布的 LifelongAgentBench 补上。

开放问题

Future directions 一节按模块给了清单:perception 侧是模态自动接入和 domain-agnostic 编码器;memory 侧是层级化记忆、检索优化、过期知识的主动裁剪(pruning/summarization)、类脑 consolidation;action 侧是层级化动作空间、RL 驱动的自我进化、human-in-the-loop 修正;最后强调 perception-memory-action 的跨模块反馈回路和 continual curriculum。这些条目偏 wishlist,没有给出具体技术路径,但可以当选题清单用。

关键结果

实证核查

扎实作为综述,声称与实际内容一致:分类法、论文表格、指标定义都能在 tex 源码和仓库里对上,且被 TPAMI 接收、引用 86 次;但要清楚它是文献组织 + roadmap,arXiv 版没有任何实验,部分收录论文与"终身学习"的关联比较松。
自称"first survey to systematically summarize potential techniques for incorporating lifelong learning into LLM-based agents",并提供 roadmap。
内容与声称相符:tex 源码(source/sections/ 共 11 个 section)完整覆盖三模块 + 评测 + 应用 + 未来方向;2026-01 被 IEEE TPAMI 接收(README News 栏、S2 venue 字段一致),S2 引用 86 次。"第一篇"的限定词是 agent+lifelong 交叉——同组此前的 Towards Lifelong Learning of LLMs 综述只覆盖 LLM 本身,不含环境交互,所以这个声称成立。
GitHub 仓库提供"relevant literature and resources"。
仓库(qianlima-lab/awesome-lifelong-llm-agent,327 stars)只是按分类法整理的论文链接表,无任何代码或数据;全部 5 个 issue 都是请求收录新论文(#1-#5,均 open),没有质疑内容的 issue。作为 awesome list 它是活的(pushed 2026-02),但"resources"不要期待成工具库。
三模块分类法能把已有工作干净地组织起来。
对照 README 论文表可见边界并不干净:Voyager、See and Think、ART、Large Language Models as Tool Makers 等同一篇论文在 3-4 个类目下重复出现;且相当多收录论文(ReAct、Tree of Thoughts、Toolformer 等)本身与 continual/lifelong learning 无关,是被"追认"进框架的通用 agent 技术。用它找文献没问题,但别把类目当成严格的方法学区分。
README 宣称 2025-06 发布了第一个 LLM agent 终身学习 benchmark LifelongAgentBench,论文/代码/数据齐全。
该 benchmark 是同组后续工作(arXiv 2505.11942,有独立项目页和代码仓库),不在本综述 arXiv 版正文内;综述本身零实验。README 承诺的"含实验结果的 TPAMI 更新版"截至本地快照(2026-02)未上传 arXiv。

与我们方向的关系

这是和课题组"agent 持续学习"设定最对口的一篇地图型文献,价值主要在两处:一是四类 memory(working/episodic/semantic/parametric)的划分可以直接拿来给自己的方法定位——目前大多数 agent 记忆工作停留在 episodic(存轨迹)+ semantic(RAG),parametric(lifelong model editing 与 agent 结合)基本是空白,这正是选题机会;二是评测协议,AP/AIP/FGT/BWT/FWT 五个指标加上"现有 agent benchmark 都不是序列化协议"的判断,可以作为实验设计的起点,配合同组的 LifelongAgentBench 用。

读法建议:不必通读,按需查表。正文各 section 的写作偏罗列,信息密度低于 README 的论文表格;future directions 一节可以当选题 checklist 扫一遍,但每条都只有一段话,具体可行性要自己评估。

阅读笔记

meta.json 里 S2 venue 已显示 TPAMI,和 README 的 2026-01 接收消息互相印证。同组还有一个姊妹仓库 zzz47zzz/awesome-lifelong-learning-methods-for-llm 覆盖 LLM(非 agent)的 continual learning,查方法时两个仓库配合用。

材料清单

TeX 源码
已存档:Raw/lifelong-learning-of-large-language-model-a/source/
代码仓库github.com/qianlima-lab/awesome-lifelong-llm-agent
327★ · 最近推送 2026-02-05
LifelongAgentBenchcaixd-220529.github.io/LifelongAgentBench/
同组 2025-06 发布的第一个 LLM agent 终身学习 benchmark,论文/代码/数据齐全,做实验优先看这个
姊妹仓库github.com/zzz47zzz/awesome-lifelong-learning-methods-for-llm
同组维护的 LLM(非 agent)lifelong learning 方法列表
中文解读zhuanlan.zhihu.com/p/20703148682
作者在知乎发的官方中文解读

同类条目