← 返回资料站  /  Continuous Learning
论文 综述 ★ 必读

A Comprehensive Survey of Continual Learning: Theory, Method and Application

持续学习全景综述:理论、方法与应用
一句话清华朱军组 2023 年写的持续学习系统综述(TPAMI 2024 正式发表),把方法谱系整理成 regularization / replay / optimization / representation / architecture 五大家族及十几个子方向,统一了 8 种问题设定和 6 个评价指标;Google Scholar 引用约 2600 次,是目前该领域被引最高、最常被当作入门起点的综述。

这是什么

持续学习(continual learning,文献里与 incremental learning、lifelong learning 混用)研究的是:模型按顺序学一串任务,学新任务时对旧任务性能大幅下降,即 catastrophic forgetting。朴素解法是把所有旧数据留着一起重训,但存储、计算和隐私成本都不可接受,所以这个领域的真正目标是在资源开销接近'只学新数据'的前提下逼近联合训练的效果。

这篇综述把领域目标提炼成一句话:在资源效率约束下,做好 stability(不忘旧)与 plasticity(学得动新)的权衡,同时保证任务内/任务间的 generalizability。相比早期综述(如 De Lange et al. TPAMI 2021 的 replay/regularization/parameter-isolation 三分法),它把方法谱系扩展成五大家族,并系统补上了理论分析(loss landscape、泛化界)和应用侧(检测、分割、生成、RL、NLP)的内容。

作者是清华 Liyuan Wang、Xingxing Zhang、Hang Su、Jun Zhu,一作 Wang Liyuan 本人就是 AFEC、CoSCL、HiDe-Prompt 等多篇持续学习论文的作者,所以方法部分写得相当内行。arXiv 首发于 2023 年 1 月,后更新至 v3,2024 年正式发表于 IEEE TPAMI(vol 46, no 8, pp 5362-5383)。

全文总框架:a) 持续学习 = 有限资源下按时间顺序学任务序列;b) 理论目标是 stability(红)-plasticity(绿)权衡加上任务内/间 generalizability(蓝/橙);c) 五大方法家族分别作用在机器学习流水线的不同位置——replay 作用于数据、architecture 作用于模型、representation 作用于表征、regularization 作用于预测/损失、optimization 作用于优化;d) 应用侧拆成 task specificity 和 scenario complexity 两轴。这张图就是全文目录,建议先看懂它再读正文。
全文总框架:a) 持续学习 = 有限资源下按时间顺序学任务序列;b) 理论目标是 stability(红)-plasticity(绿)权衡加上任务内/间 generalizability(蓝/橙);c) 五大方法家族分别作用在机器学习流水线的不同位置——replay 作用于数据、architecture 作用于模型、representation 作用于表征、regularization 作用于预测/损失、optimization 作用于优化;d) 应用侧拆成 task specificity 和 scenario complexity 两轴。这张图就是全文目录,建议先看懂它再读正文。

机制与做法

问题设定与评价指标:先把'黑话'统一

Sec 2 用一张表统一了 8 种场景的形式化定义:IIL(同一任务分批来)、DIL(标签空间相同、输入分布变)、TIL(任务不相交、测试时给 task id)、CIL(测试时不给 task id,最难也最常用)、TFCL(训练时也没有任务边界)、OCL(数据单遍流过)、BBCL(任务边界模糊、类别有重叠)、CPT(持续预训练)。区分维度就两个:数据怎么分批到来、task identity 在训练/测试时是否可得。

指标分三组:整体性能用 AA(average accuracy)和 AIA(平均增量精度);稳定性用 FM(forgetting measure,历史最高减当前)和 BWT(backward transfer);可塑性用 IM(intransience,联合训练精度减持续学习精度)和 FWT。读该方向论文时对表格里这几列的含义可以直接对照这一节。

方法分类树:五大家族及其子方向(weight/function regularization;experience/generative/feature replay;gradient projection/loss landscape/meta-learning;SSL/预训练下游/持续预训练;parameter allocation/model decomposition/modular network)。读单篇 CL 方法论文时先在这棵树里定位,再决定和谁比较。
方法分类树:五大家族及其子方向(weight/function regularization;experience/generative/feature replay;gradient projection/loss landscape/meta-learning;SSL/预训练下游/持续预训练;parameter allocation/model decomposition/modular network)。读单篇 CL 方法论文时先在这棵树里定位,再决定和谁比较。

理论视角:一切归结为 loss landscape 上的权衡

Sec 3 从 Bayesian 视角(顺序更新后验 p(θ|D_1:k))和 loss landscape 视角统一解释各类方法:遗忘 = 新任务解离开了旧任务的低 loss 区域;好的持续学习解需要同时落在新旧任务 loss 盆地的交集里。由此引出四个可操作的因子:可塑性程度、稳定性程度、loss landscape 的平坦度、任务分布差异(见 fig02)。

这个视角的直接推论在后文反复出现:flat minima 更抗遗忘(Stable-SGD 只调 dropout/lr decay/batch size 就有明显提升)、多任务解和持续学习解之间存在低误差线性路径(MC-SGD)、self-supervised 和大规模预训练的表征天然更抗遗忘(表征更正交/分散、loss 盆地更宽)。

理论视角的核心图:用新旧任务两个 loss 盆地解释一切——a/b) 解偏向新任务=可塑性强、偏向旧任务=稳定性强;c) 盆地越平坦,两任务低 loss 区域交集越大(flat minima 为何抗遗忘);d) 任务分布差异越大,交集越小;e) 参数空间视角:任务增多时可行解区域(黄色)不断收缩,这是持续学习随任务数变难的几何解释。
理论视角的核心图:用新旧任务两个 loss 盆地解释一切——a/b) 解偏向新任务=可塑性强、偏向旧任务=稳定性强;c) 盆地越平坦,两任务低 loss 区域交集越大(flat minima 为何抗遗忘);d) 任务分布差异越大,交集越小;e) 参数空间视角:任务增多时可行解区域(黄色)不断收缩,这是持续学习随任务数变难的几何解释。

五大方法家族:比传统三分法细一层

Regularization-based:分 weight regularization(EWC/SI/MAS 按参数重要性加二次罚项;Benzing 2022 证明这几种重要性度量殊途同归,都是在近似 Fisher 信息矩阵)和 function regularization(LwF/iCaRL 一系,用旧模型当 teacher 做知识蒸馏)。Replay-based:experience replay(小 buffer 存真样本,难点在选样和防过拟合;DER++、GDumb 这类极简 baseline 意外地强,常被用作卷新方法的照妖镜)、generative replay(训生成模型造旧数据,但生成模型自己也会遗忘,基本只在简单数据集上可行)、feature replay(存特征原型/统计量,省资源但要处理 representation shift)。

Optimization-based:直接改优化过程,如梯度投影到旧任务梯度/输入空间的正交方向(OWM/OGD/GPM/Adam-NSCL)和 meta-learning(OML/La-MAML)。Representation-based:利用 SSL 和大规模预训练的表征优势,包括 2022 年后爆发的 prompt-based 路线(L2P、DualPrompt、CODA-Prompt、S-Prompts:冻结预训练 ViT,只学一小撮 prompt 参数)。Architecture-based:给每个任务分配专属参数,分 parameter allocation(掩码选子网,HAT/PackNet)、model decomposition(共享+专属分解)、modular network(Progressive Networks、专家混合);几乎能消除遗忘,但推理时往往需要 task id,扩展性也受限。

综述反复强调这五类不是并列孤岛:regularization 和 replay 最终都等价于修正梯度方向(和 optimization 一路殊途同归),replay 配蒸馏、正则配扩展都是常见组合拳。这个'联系与协同'的观点比分类本身更有价值。

Replay 家族的机制示意:学任务 A 时把少量真样本存进 memory buffer(experience replay)或训一个生成模型(generative replay),学任务 B 时把旧数据/生成数据混进来一起训,让新模型同时罩住新旧分布;feature replay 则把回放对象从原始数据换成特征。三条子路线的取舍是存储成本、隐私与保真度。
Replay 家族的机制示意:学任务 A 时把少量真样本存进 memory buffer(experience replay)或训一个生成模型(generative replay),学任务 B 时把旧数据/生成数据混进来一起训,让新模型同时罩住新旧分布;feature replay 则把回放对象从原始数据换成特征。三条子路线的取舍是存储成本、隐私与保真度。

应用两轴与趋势判断

应用挑战被拆成两轴:scenario complexity(没有 task id、few-shot/半监督/无监督、单遍数据流等)和 task specificity(检测、分割、条件生成、RL、NLP 各自的坑,比如增量检测里旧类目标会以'背景'身份出现在新数据里造成标注冲突)。每小节都是'该任务特有挑战 + 现有方法怎么适配'的结构,适合按需查阅。

Discussion 里的趋势判断现在回头看相当准:(1) 领域重心从'防遗忘'转向可塑性与泛化;(2) 预训练 + 表征路线会成为主流(2023 后 prompt-based 和 PEFT 系方法确实统治了 CIL 榜单);(3) 点名 foundation model 微调遗忘预训练知识将是核心挑战——这正是现在 LLM 持续学习的主战场。另附神经科学对照:CLS 理论(海马快速记具体经验、新皮层慢速学结构化知识)对应 replay + 慢速表征学习,海马回放本身是时间压缩的(约 6 秒经验压到 0.2 秒),对应压缩回放/特征回放。

关键结果

实证核查

扎实综述类条目,没有实验可复现,核查点在于覆盖是否属实、是否被社区接受。结论:内容与文献相符、被后续工作广泛采纳为标准引用,但要注意它的知识截止在 2023 年中,且配套 paper list 已停更。
论文自称'first survey that systematically summarizes the latest advances in continual learning',提供最全面的谱系。
社区接受度支持这一定位:TPAMI 2024 正式发表(vol 46, no 8, pp 5362-5383),arXiv 页面显示 Google Scholar 引用约 2614 次(Semantic Scholar 口径 1563 次、influential 96 次,2026-08 查);xialeiliu/Awesome-Incremental-Learning、EnnengYang/Awesome-Forgetting-in-Deep-Learning、LucyDYu/Awesome-Multimodal-Continual-Learning 等主流 paper list 都把它列为首选综述,后续的 LLM 持续学习综述(Wang-ML-Lab/llm-continual-learning-survey)和生成模型持续学习综述(arXiv 2506.13045)均以它为基础谱系再扩展。
配套 GitHub paper list 声称 'We will continue to add useful resources to this repo'。
lywang3081/Awesome-Continual-Learning 仅 107 stars / 11 forks,最后一次 push 是 2024-02-21(gh api 查证),即 TPAMI 接收后就停止维护了。想追 2024 年之后的文献,得换 xialeiliu/Awesome-Incremental-Learning 等仍在更新的列表。
综述对各方法的性能描述(如 DER++/GDumb 等 simple baseline 表现可观、prompt-based 方法效果好)。
这些结论均转引自被引论文,综述本身没有做任何统一 benchmark 复测(全文无实验章节,code_url 为空)。这点不算硬伤但要心里有数:同期 De Lange et al. 2021 和 Masana et al. 2022 的综述带统一实验,数字对比要去那两篇找;本篇的价值在谱系和理论串联,不在实证横评。
覆盖'latest advances'。
文献覆盖截止于 2023 年中(v3 更新到 HiDe-Prompt、SLCA 等 2023 工作)。LLM 时代的持续学习(continual instruction tuning、模型合并防遗忘、RLHF 后遗忘等)完全不在射程内——后续综述如 'Continual Learning of Large Language Models'(ACM Computing Surveys 2025)在引言里明确以本篇为'传统 CL'的代表并声明补其空白。把它当地图用没问题,当前沿追踪用会过时。

与我们方向的关系

作为 continual-learning 方向的 core 综述,这篇是组内新人的标准入门件:Sec 2 的场景表和指标定义建议精读并背下来(读任何 CL 论文都要先判断它是 TIL 还是 CIL,坑常出在这里);Sec 4 按五大家族建立索引,之后读单篇方法论文时先在 fig03 的树里定位它属于哪个子方向、和谁比较才公平。

对我们更有现实意义的是它点出的两条线:(1) representation-based 一支(预训练 + prompt/PEFT)是 2023 后的主流,也是与 LLM 持续学习衔接最自然的入口;(2) Discussion 里'foundation model 微调会遗忘预训练知识'的预判正是当下 continual pre-training / continual instruction tuning 的问题起点。读完本篇后应接着读 LLM 持续学习的后续综述,把五分法映射到 LLM 场景(replay 对应数据混合回放、regularization 对应 KL 约束、architecture 对应 LoRA/expert 扩展)。

阅读笔记

读法建议:不必线性通读。第一遍读 Sec 1-3 + fig01/fig03 建框架(约 1 小时);Sec 4 当字典用,读到对应方法论文再回来查;Sec 5-6 按自己任务(分割/NLP/RL)挑一小节看;Sec 7 的趋势和神经科学部分适合组会闲聊素材。注意引用数口径差异很大:Google Scholar ~2600 vs Semantic Scholar ~1560,对外引用时说明出处。

材料清单

TeX 源码
已存档:Raw/a-comprehensive-survey-of-continual-learning/source/
配套 paper listgithub.com/lywang3081/Awesome-Continual-Learning
作者维护的文献列表,已于 2024-02 停更;追新文献建议改用 xialeiliu/Awesome-Incremental-Learning
TPAMI 正式版doi.org/10.1109/TPAMI.2024.3367329
IEEE TPAMI 2024, vol 46, no 8, pp 5362-5383
后续衔接综述github.com/Wang-ML-Lab/llm-continual-learning-survey
Continual Learning of Large Language Models(ACM Computing Surveys 2025),覆盖本篇未涉及的 LLM 时代内容

同类条目