A Comprehensive Survey of Continual Learning: Theory, Method and Application
持续学习领域引用最高的系统综述,把正则化、回放、架构扩展等方法谱系和稳定性-可塑性权衡讲得最全,是进入该方向的标准起点。
让模型与 agent 在部署后持续积累能力:记忆系统、经验库、技能库、测试时训练与持续预训练。
回答"神经网络顺序学习为何遗忘、如何缓解":正则化/回放/架构扩展等传统持续学习奠基方法与全景综述。
持续学习领域引用最高的系统综述,把正则化、回放、架构扩展等方法谱系和稳定性-可塑性权衡讲得最全,是进入该方向的标准起点。
提出 Elastic Weight Consolidation,用 Fisher 信息约束重要权重来对抗灾难性遗忘,是持续学习领域被引最高的奠基论文;目录里的正则化/回放/架构三大方法谱系都从它讲起,课题组书单不能缺这块基石。
专讲大模型持续学习的最全综述(334 引,CSUR),按继续预训练/领域适应/持续微调分层;站内经典 CL 综述(2302.00487)不覆盖 LLM,正好补位。
让模型在推理阶段用梯度或自生成数据把新知识写进权重与架构内记忆,是权重级持续学习的前沿路线。
Titans 团队的后续:把模型统一看成多个不同更新频率的嵌套优化问题,提出 HOPE 架构和连续记忆系统来对抗灾难性遗忘,是 Google 给持续学习开的新范式,2025 底以来讨论度极高。
让 LLM 自己生成微调数据和更新指令、通过 RL 学会怎样最有效地更新自身权重,是把"模型自己教自己"落到权重层面的代表作,直接连通持续学习与递归自我改进两条线。
提出神经长期记忆模块,以"惊讶度"驱动在测试时在线更新权重记忆,把长期记忆做进架构而非外挂数据库,是架构级持续学习的代表作(无官方开源代码)。
把 RNN 隐状态本身做成一个在推理时持续做自监督梯度更新的小模型(TTT 层),为"学习发生在测试时"提供了干净的架构化表述,是 Titans 等后续工作的直接前驱。
回答"agent 的长期记忆怎么存、怎么组织、怎么检索与增删改":外部记忆架构、管理机制及其综述。
把操作系统虚拟内存的分层换页思想用于管理 LLM 上下文与外部记忆,开创了 agent 记忆管理这一工程方向,现已演化为 Letta(2.4 万星)。
2025 年 12 月的 agent 记忆最新综述,按形态-功能-动态统一分类了 token 级/参数级/隐状态级记忆及其读写演化操作,配套持续维护的论文列表,适合作课题组追踪该方向的索引。
LLM 智能体记忆机制的奠基性综述(736 引,TOIS),系统梳理记忆的定义、写入/读取/反思操作与评估,是站内 MemGPT/Mem0/A-MEM 等条目的总纲;与站内 2512 记忆综述互补(经典框架 vs 最新图景)。
不再手工设计记忆管线,而是用 RL 训练专门的记忆管理器学会增删改记忆条目,代表 2025 下半年"用 RL 学记忆策略"的新趋势。
最流行的开源 agent 长期记忆层(6 万+ 星),通过抽取-更新记忆条目和图记忆在 LOCOMO 上验证效果,代表记忆系统工程化落地的现状基线。
借鉴卡片盒笔记法让记忆条目自组织:新记忆写入时自动建立链接并触发旧记忆演化,探索了记忆库本身随经验动态重构的机制。
模仿海马体索引理论,用知识图谱加个性化 PageRank 做单步多跳记忆检索,展示了非参数持续知识整合可以比标准 RAG 强得多。
agent 从成败轨迹中提炼语言化经验、教训或案例并在后续推理中复用,不动权重实现持续改进。
用语言化的自我反思写入情景记忆来替代梯度更新,让 agent 在多次尝试中改进,是测试时经验学习范式的奠基工作。
专门梳理 LLM agent 终身学习的综述,按感知-记忆-行动三个模块组织已有工作并给出路线图,和课题组"agent 持续学习"的问题设定最对口。
把 agent 持续适应形式化为基于记忆的 MDP:经验存进 case bank、用类案例推理在线改进策略而不动模型权重,在 GAIA/DeepResearcher 上拿到强结果,是无梯度在线学习 agent 的代表。
给黑盒 LLM 挂一个跨查询持续读写的"小抄"记忆,推理中积累可复用的策略与代码片段,用极简机制展示了无梯度测试时学习的收益(如 GPT-4o 在 AIME 上大幅提升)。
让 agent 从历史轨迹中自动提炼自然语言经验规则并在推理时复用,不动权重实现跨任务经验迁移,是"经验即记忆"路线的早期代表。
把经验固化为可复用的代码技能或子任务工作流,研究程序性记忆的构建、检索与更新维护。
在 Minecraft 里用可执行代码构建不断增长的技能库,首次演示了 LLM agent 无梯度的终身技能积累,后续几乎所有 skill library 工作都以它为原型。
系统研究 agent 程序性记忆的构建、检索与更新策略(含记忆淘汰和从失败中修订),并展示记忆可从强模型迁移给弱模型,把"经验库如何维护"当成一等研究问题。
从成功轨迹中归纳可复用的工作流并注入记忆,在 Mind2Web/WebArena 上显著提升 web agent 表现,把"经验积累"具体化为工作流级别的程序性记忆。
主属其他方向、但与本方向直接相关的条目;彩点与角标标注其主方向。
系统梳理'自进化 agent'的统一框架(优化什么、何时优化、如何优化),把 prompt/工作流/记忆/权重各层次的自改进工作串成一张图,正好桥接课题组 RSI 与持续学习两条线;rsi 类目此前没有综述,新人入门缺地图。配套 awesome 列表持续维护(2.4k stars,仓库已迁移至 ANative-Lab)。
推理时按任务动态缩放权重矩阵的奇异值分量实现自适应,是 Text-to-LoRA 的前奏,也连接课题组的持续学习方向(模型自己调整自己的权重)。