Continual Learning of Large Language Models: A Comprehensive Survey
大语言模型持续学习综述:纵向/横向连续性框架
Haizhou Shi, Zihao Xu, Hengyi Wang, et al. (Rutgers, Wang-ML-Lab) · Rutgers University (Wang-ML-Lab) · ACM Computing Surveys · 2024-04 · 被引 334
一句话 Rutgers Wang-ML-Lab 的 LLM 持续学习综述(CSUR 2025,334 引):提出 vertical(通用→专用)/ horizontal(跨时间跨域)两个连续性维度,把训练流程切成 CPT / DAP / CFT 三层,是目前 LLM 参数级持续学习最常被引用的分类地图。
这是什么 传统 continual learning 综述(如站内的 2302.00487)讲的是小模型在任务序列上的 forgetting,而 LLM 时代的持续学习长什么样、旧方法还适不适用,2024 年初还没有系统梳理。这篇综述填的就是这个空:以 LLM 的实际生产管线(供应商预训练 → 下游机构领域适应 → 最终微调部署)为骨架,重新组织 catastrophic forgetting 问题。
核心贡献是一个二维框架:Vertical Continuity 指从通用能力到专用能力的逐层适配(数据量、算力、团队规模逐层递减),对应的失败模式叫 vertical forgetting(专用化后丢通用知识);Horizontal Continuity 指同一层内跨时间、跨领域的滚动更新,对应 horizontal forgetting(长任务序列 + 突变分布漂移)。在这个框架下,LLM 训练被分成三个阶段:Continual Pre-Training (CPT)、Domain-Adaptive Pre-training (DAP,按 legal/medical/financial/scientific/code 等领域细分)、Continual Fine-Tuning (CFT,含 continual instruction tuning、model refinement、alignment、多模态四条线)。
2024-04 v1 上 arXiv,2024-11 v3 定稿,2025-05 被 ACM Computing Surveys 接收。配套 GitHub repo(559 stars)是同名 awesome list,按论文的分类学组织文献。
全文总览图:纵轴是 vertical continuity(CPT → DAP → CFT 三层,颜色区分),横轴是 horizontal continuity(同一层的模型随时间滚动更新 M_t → M_t+1 → M_t+2)。DAP 层列出 legal/scientific/medical/financial/code 五个领域及 DAP→SFT/IT 等组合路径,CFT 层列出 CIT/CMR/CMA/CMLLMs 四条子线。整篇综述的文献都按这张图的格子归档,可当目录用。 机制与做法 Vertical:从通用到专用,难在拿不到上游数据
Vertical continual learning 的典型三段:pre-training → DAP → fine-tuning。上游数据分布部分覆盖下游,所以模型起点不差,但要防 vertical forgetting 有两个结构性困难:一是 task heterogeneity(上下游任务形式不同,常用冻结共享参数或把下游任务改写成预训练形式来缓解);二是 inaccessible upstream data——下游机构根本拿不到上游预训练语料,连传统 CL 里最弱的 memory 约束都满足不了,只能用公开数据集或让模型自己生成 pseudo-examples 当替代 replay。这一点是 LLM 场景区别于经典 CL 的关键设定。
两种连续性的直觉对比:(a) vertical——预训练、DAP、微调的数据分布逐层嵌套收窄,上游部分覆盖下游,起点不差但会 vertical forgetting;(b) horizontal——跨领域滚动适配,分布可能渐变(gradual shift)也可能突变(abrupt shift),后者是遗忘的重灾区。 Horizontal:滚动更新,复杂 CL 算法是否必要是开放问题
Horizontal 方向是经典 CL 的主场,但综述指出一个诚实的争议:大机构做 CPT 时通常存得起全部历史数据,memory 约束形同虚设,多项研究表明简单的 sparse replay(控制新旧数据混合比)就能有效抑制 forgetting;但也有相当多工作展示了 CL 技术优于 naive 方案。综述没有强行下结论,把它列为开放问题。两个真实挑战是 long task sequences(更新步数越多遗忘越不可避免)和 abrupt distributional shift(与 vertical 不同,horizontal 对任务性质没有任何约束)。
Discussion:memory 角色的重估与几个前瞻方向
Discussion 一节对课题组最有信息量:(1) 经典 CL 关心存储效率,而 LLM 场景下约束从 storage 转向 compute——该用 FLOPs/更新步数而不是 buffer 大小来约束算法;(2) CIL(类增量)在 LLM 时代退潮,TIL/DIL 上位,instruction 本身就是自然语言编码的 task index,TIL 与 DIL 边界在 continual instruction tuning 里变模糊;(3) 提到 anticipatory recovering 现象——循环序列训练时 LLM 会在再次见到文档之前'提前恢复'遗忘的信息,暗示参数里存在某种序列记忆;(4) 前瞻方向点了理论保证缺失、efficient replay(如 KPIG 的动态选样)、外置可控 memory(Larimar 的 episodic memory 支持 sequential writing/forgetting)。
关键结果 提出 vertical/horizontal continuity 二维框架 + CPT/DAP/CFT 三阶段分类,是本综述区别于同期竞品(2402.01364 等)的核心卖点。 反复引证的一个经验结论:模型越大、预训练越充分,对 catastrophic forgetting 越鲁棒,但在 temporal/domain shift 下泛化到未来数据仍然很差。 DAP 是文献量最大的一层,按 legal/medical/financial/scientific/code 五个领域整理(另附 language、e-commerce 等其他领域),大多数领域模型走 DAP → SFT/IT 两段式。 对 CL 算法必要性持保留态度:全量历史数据可得时,sparse replay 这种 naive 方案经常够用;复杂 CL 技术的优势主要出现在数据不可得(vertical)或隐私受限(online CL)场景。 补充材料里单独整理了 CL 评测协议(BWT/FWT 等指标如何迁移到 LLM)和可用数据源,做 CL 实验选 benchmark 可以直接查。 S2 引用 334 次,后续论文已在用它的术语造句(如 'vertical continual learning failure'),分类学被实际采纳。 实证核查
扎实 综述本身的分类学被后续工作真实采纳,repo 维护到 2025 年中且响应 issue;主要折扣是'持续更新'已停摆——文献覆盖截止 2025-03,此后 17 个月的 CL-LLM 进展(尤其 self-adapting / test-time 路线)全部缺席。
README 自称 'an updating survey ... constantly updated and extended'。
更新已停摆:repo 的 paper 列表最后一次实质增补是 2025-04-08(收 03/2025 论文),之后仅有 2025-05-16 的 CSUR 接收公告和 2025-12-23 的一次 README 编辑(gh api commits 可查);arXiv 停在 v3(2024-11-25)。2025-04 之后的重要工作(如站内的 SEAL 2506.10943、Memp 2508.06433 这类 self-adapting / 经验记忆路线)均不在列表中,当'活地图'用要自己补最近一年半。
提出的 vertical/horizontal continuity 分类学是对领域的有效组织方式。
被第三方实际采用,不只是自引:S2 citation contexts 里多篇后续论文直接用该术语做论证,如 'The guard model safety collapse we observe is an instance of vertical continual learning failure [Shi et al. 2024]'、'vertical continuity (general to specific) differs from horizontal';S2 计 334 引,并以正式版发表于 ACM Computing Surveys(DOI 10.1145/3735633)。
标题声称 'Comprehensive'——对 LLM 持续学习的全面覆盖。
'全面'限于参数训练层面(CPT/DAP/CFT)。站内 continual-learning 方向的大半条目——MemGPT、Voyager、ExpeL、Mem0、A-MEM 这条 agent 记忆/经验持续学习线——不在其分类学内,只在 Discussion 'Roles of Memory' 一小节以 Larimar 等 model editing 工作带过。这是范围选择而非疏漏,但读者需知道它只覆盖'改参数'这半边,'不改参数'那半边要看站内 lifelong-agents roadmap(2501.07278)和 memory 综述(2512.13564)。
论文中给出的代码链接可用。
issue #1(2024-11-21)反馈 v2 论文内 code 链接大量失效,作者随后发布 v3 修复,README 更新记录写明 'concise and free of broken links',issue 已关闭且有 3 条往来——维护响应正常,该 repo 唯一一个 issue 就是这个。
与我们方向的关系 课题组用法:这是 continual-learning 方向'改参数'半边的地图,和经典 CL 综述(2302.00487,讲方法论谱系)、lifelong agents roadmap(2501.07278,讲'不改参数'的 agent 半边)构成三张互补的图。读的顺序建议:先用本篇的 Fig.1 建立 vertical/horizontal + CPT/DAP/CFT 坐标系,再把站内条目往里放——EWC 属于 horizontal 的 regularization 老方法,SEAL/TTT/Titans 是本篇没覆盖的 self-adapting 新线,MemGPT/Mem0 一族则整体落在它 Discussion 里'外置可控 memory'那个前瞻方向上。
两个可直接借鉴的判断:(1) LLM 场景下 CL 的真实约束是 compute 而非 storage,评估自己方法时应汇报 FLOPs/更新步数而不是 buffer 大小;(2) sparse replay 这种 naive baseline 在数据可得时很强,做 CL 实验必须把它跑出来当对照,否则结论没有说服力。另外它对'复杂 CL 算法是否必要'的开放态度,恰好是 RSI / self-improving 方向要回答的问题之一。
阅读笔记 文献覆盖截止 2025-03,查 2025-04 之后的工作要换 lifelong-learning-methods-for-llm(qianlima-lab)等仍在更新的竞品列表或直接搜。正文较长,精读性价比最高的是 Section 3(框架定义)和 Section 6(Discussion),中间 Section 4 的三大阶段当索引用即可。
材料清单 TeX 源码 已存档:Raw/continual-learning-of-llms-survey/source/
相关条目 同子模块 · 灾难性遗忘与经典方法
跨方向 · 同标签