← 返回资料站  /  Continuous Learning
论文 测试时学习 ★ 必读

Nested Learning: The Illusion of Deep Learning Architectures

嵌套学习:把模型与优化器统一成多频率的嵌套优化问题
一句话Titans 团队(Google Research)提出 Nested Learning 范式:把架构和优化器统一看成一组各自有 context flow、按不同频率更新的嵌套联想记忆,据此设计出自修改序列模型 + 连续记忆系统(CMS)组成的 Hope 架构,1.3B/100B tokens 规模上平均分 58.04 超过 Titans(56.82)和 Transformer++(53.38),BABILong 撑到 10M 上下文;但至今无官方代码,所有数字都无法被第三方验证。

这是什么

这是 Titans(2024)、Miras、ATLAS 一路下来 Ali Behrouz 系列工作的"理论收官":与其继续一个个发新架构,这篇直接提出一个统一框架 Nested Learning(NL),声称深度学习里的几乎所有东西——MLP、attention、线性 RNN、甚至 SGD/Adam/Muon 这些优化器——本质上都是同一种东西:压缩自己 context flow 的 associative memory(联想记忆),区别只在于各自的更新频率(level)、内部目标函数和学习规则。比如 Transformer 是两个极端频率的组合:attention 每个 token 都"更新"(频率无穷大),MLP 预训练后冻结(频率 0);momentum 是一个用梯度当 context 的记忆模块;Adam 则是对 element-wise L2 目标最优的联想记忆。所谓"深度架构的异质性"只是没看到内部梯度流的错觉——这就是标题 The Illusion of Deep Learning Architectures 的含义。

论文用这个视角重新解释了 in-context learning(多 level 的直接结果而非涌现)、pre-training(context 为全部训练数据的 ICL)、meta-learning/hypernetwork/learned optimizer(不同的层间知识传递方式),然后给出三件"证据式"的新设计:(1)更有表达力的优化器(Delta Gradient Descent、深度 momentum、多尺度 momentum 的 M3 优化器);(2)自修改的 Self-Referential Titans——让 k/v/学习率/遗忘门的投影本身也在 context 内被更新,模型自己生成自己的训练信号;(3)Continuum Memory System(CMS)——把 Transformer 的单个 MLP 换成一串按不同 chunk 频率更新的 MLP 链,取代传统"长/短期记忆"二分。三者拼起来就是 Hope 架构。动机上大量借用神经科学叙事(脑电波多时间尺度、突触巩固、顺行性遗忘症类比),NeurIPS 2025 接收,Google Research 博客 2025 年 11 月发文宣传后讨论度非常高(S2 引用已 87+)。

NL 范式总览:左边是传统深度学习视角下的混合架构(RNN+Attention 平铺一排,内部梯度流不可见);右边是 NL 视角——同一个模型被展开成 3 个 level 的嵌套优化问题,每个 level 有自己的 gradient flow 和记忆更新式 M_{t+1}=M_t−∇L(M_t;K,V),level 越低更新频率越高。这张图是全文核心主张的可视化:"架构 vs 优化器"的区分是扁平化投影造成的错觉。
NL 范式总览:左边是传统深度学习视角下的混合架构(RNN+Attention 平铺一排,内部梯度流不可见);右边是 NL 视角——同一个模型被展开成 3 个 level 的嵌套优化问题,每个 level 有自己的 gradient flow 和记忆更新式 M_{t+1}=M_t−∇L(M_t;K,V),level 越低更新频率越高。这张图是全文核心主张的可视化:"架构 vs 优化器"的区分是扁平化投影造成的错觉。

机制与做法

核心形式化:一切都是不同频率的联想记忆

定义很简单:associative memory 是把 keys 映到 values 的算子 M,通过最小化 L~(M(K); V) 得到。论文先用两个例子建立直觉:(a)用 GD 训练一层线性层,等价于一个记忆模块在学习"输入 x_t → 该样本引起的局部误差信号(local surprise)"的映射,所以 backprop 本身就是压缩;而且 value(梯度)是由记忆自身当前状态生成的,所以它是 self-referential 的,并不等价于对梯度做 linear attention。(b)带 momentum 的 GD 是两层嵌套:内层 momentum 作为记忆压缩历史梯度,外层用它更新慢权重。同理 linear attention 的递归 M_t = M_{t-1} + v_t k_t^T 正是对 dot-product 目标做一步 GD,DeltaNet/RWKV-7 对应 L2 目标,softmax attention 是同一回归目标的非参数解(Nadaraya-Watson 估计)。于是"训练某架构 + 某优化器"整体就是一个多 level 的嵌套优化系统,按更新频率排序:预训练参数在最低频 level,attention 在最高频。

Hope 与 Transformer 在两种视角下的对照。左:Hope = q/k/v 投影 + Self-Modifying Titans + 一串不同频率的 FFN(CMS,高频→低频,chunk 长度 16 到 16M);右:Transformer 在 NL 视角下只有两个极端频率——attention 频率无穷大、FFN 预训练后频率为 0。看懂这张图就看懂了 CMS 想填补的"中间频率"空档。
Hope 与 Transformer 在两种视角下的对照。左:Hope = q/k/v 投影 + Self-Modifying Titans + 一串不同频率的 FFN(CMS,高频→低频,chunk 长度 16 到 16M);右:Transformer 在 NL 视角下只有两个极端频率——attention 频率无穷大、FFN 预训练后频率为 0。看懂这张图就看懂了 CMS 想填补的"中间频率"空档。

由此推出的优化器改造(DGD、M3)

既然 momentum 是记忆,那记忆的所有增强手段都能搬过来:把 dot-product 目标换成 L2 回归得到 Delta Momentum(更新依赖当前权重状态,等价于对样本相关性建模,不再假设 i.i.d.);把线性记忆换成 MLP 得到 Deep Momentum;Muon 的 Newton-Schulz 正交化被解释成"内部再嵌套一层把梯度映到正交空间的优化"。作用在权重更新上则得到 Delta Gradient Descent(DGD):W_{t+1} = W_t(I − η′x_t x_t^T) − η′∇L,自带随输入自适应的 decay。最后给出 M3(Multi-scale Momentum Muon):Adam + Muon + 两个不同频率的 momentum(慢 momentum 每 C 步聚合一次),对应 CMS 思想在优化器里的版本。作者自己承认 M3 有计算开销问题(比 Muon 慢,与 AdaMuon 相当),定位是 proof-of-concept。

类增量学习结果(CLINC 数据集,150 类意图分类):在 Llama-3B 和 Llama3-8B 两个 backbone 上,Hope(改造 MLP 为 CMS 后续训)准确率约 69%/93%,高于外部学习器方案 InCA、EWC 和纯 in-context learning。注意这是把预训练模型改造后的结果,不是从零训练;基线取各方法已报告最好值。
类增量学习结果(CLINC 数据集,150 类意图分类):在 Llama-3B 和 Llama3-8B 两个 backbone 上,Hope(改造 MLP 为 CMS 后续训)准确率约 69%/93%,高于外部学习器方案 InCA、EWC 和纯 in-context learning。注意这是把预训练模型改造后的结果,不是从零训练;基线取各方法已报告最好值。

CMS + 自修改 Titans = Hope

CMS 把 Transformer 里的 FFN 换成 MLP 链 MLP^(f1)→...→MLP^(fk),第 l 个块每 C^(l) 个 token 才用累积梯度更新一次(对任务目标,如 NTP),频率越低越持久。这样"遗忘"不再是灾难性的:某一频率的块忘掉的知识仍存在更高频/更低频的邻居里,还能通过初始状态的 meta-learning 循环回来。效率上靠 chunk 内并行,每步平均只更新一小部分参数。

Self-Modifying Titans 则把 Titans 的测试时记忆推进一步:不只 memory 本身,连生成 k、v、学习率 η、遗忘门 α 的投影都变成 in-context 可更新的 2 层 MLP 记忆(query 投影保持固定),且 value 由模型自己生成(hat-v = M(v)),内部用 DGD + weight decay 更新,chunk-wise 并行训练。Hope = 自修改 Titans(高频、小容量、复杂学习规则)接 CMS(低频、大容量、简单规则)。另有 Hope-Attention 变体:把自修改 Titans 换回 softmax attention,只保留 CMS,用来单独检验 CMS 的贡献,也用于把预训练 Llama 的 MLP 直接初始化成 CMS 块做持续学习。

记忆 level 数量消融(RULER MK-NIAH):x 轴是 CMS 记忆层数(1→4),三条红线对应最低频率 512/2K/8K token。level 越多、最低频越高(更新越勤)准确率越高,4 层 + 最低频 512 时达 100%,均高于 ICL 基线(~88%)和 DuoAttention(~47%)。这是论文对"多 level 设计有效"最直接的证据,也显示收益随 level 数递增但幅度不大(~10 个点)。
记忆 level 数量消融(RULER MK-NIAH):x 轴是 CMS 记忆层数(1→4),三条红线对应最低频率 512/2K/8K token。level 越多、最低频越高(更新越勤)准确率越高,4 层 + 最低频 512 时达 100%,均高于 ICL 基线(~88%)和 DuoAttention(~47%)。这是论文对"多 level 设计有效"最直接的证据,也显示收益随 level 数递增但幅度不大(~10 个点)。

实验设置值得注意的地方

语言建模从零训练 760M/30B 和 1.3B/100B tokens(FineWeb-Edu 混合),优化器统一 AdamW 且"默认配置沿用 Titans 论文";持续学习实验(CLINC/Banking/DBpedia 类增量)不是从零训 Hope,而是把 Llama-3B/Llama3-8B 的 MLP 块改造成 CMS 再续训 15B tokens;NIAH/LongHealth/QASPER 的 level 消融同理基于改造后的模型。论文明确写了对比基线"使用各 benchmark 上已报告的最好结果"而非全部复跑,与 Cartridges 的对比被以计算成本不可比为由排除。所有实验最大只到 1.3B 参数、8B backbone 改造,没有更大规模的证据。

关键结果

实证核查

有水分理论框架自洽且被 NeurIPS 2025 接收,统一视角确实有启发性;但作为一篇实验声称很强的论文,至今零官方代码、零权重,所有数字无人复现,社区复现连"训练过程到底是什么"都无法达成一致,宣传(Google 博客、"新范式")明显跑在证据前面。
论文展示 Hope 在语言建模、持续学习、10M 长上下文等任务上全面超过 Titans/Transformer/RWKV-7 等基线。
Google 没有发布任何官方代码或权重(catalog 中 code_url 为空;Google Research 博客 2025-11-07 只有文章无仓库;Reddit r/singularity 复现帖原话"They published the research but no code (like always)")。目前所有数字均来自论文自报,且论文自己写明持续学习基线"use the best reported results on the benchmark"(source/MainText/Experiments.tex L30),并非同条件复跑。
NL/Hope 的机制描述足够清晰,社区可以据此复现。
最大的第三方复现 kmccleary3301/nested_learning(712 stars,2025-11 创建,持续维护至 2026-02)只做到"mechanism-level"复现:作者在 issue #12 中承认"I have not run this repo at the original paper's largest training scale",pilot 规模也没有对齐论文数字;更关键的是 issue #9([Faithfulness] Major fault in gradient propagation)指控该复现根本没有实现真正的 meta-learning 内环、跨频率的反传方式与论文不符,并推荐另一个实现——复现者之间对论文算法本体都没有共识,说明论文对训练细节(BPTT 长度、跨 level 梯度流)的描述严重欠规格。
Google 博客宣传这是"a new ML paradigm for continual learning",能缓解灾难性遗忘、迈向自我改进。
HN 主帖(news.ycombinator.com/item?id=46182031,152 分)和 r/learnmachinelearning 热帖("Nested Learning is getting way too much hype")的主要质疑成立:NL 对已有概念(meta-learning、fast weight programmers、hypernetworks、TTT)更多是重新命名和统一表述——论文附录和正文自己也承认这些等价性;"仍然全是 SGD 权重更新,只是把遗忘挪了位置"的批评没有被论文的实验直接回应。持续学习实验只有类增量文本分类和双语翻译两个小任务,没有标准 CL 基准套件(如 split-CIFAR、CORe50)或长期部署式评测。
Hope 是能落地的新架构。
实验最大规模 1.3B 参数/100B tokens,与同期开源架构对比(RWKV-7、Comba)使用作者自训版本;短上下文 recall 任务上论文自己的数据显示 Transformer 仍全面领先(SWDE 71.4 vs 65.9,FDA 67.3 vs 41.9)。发表 8 个月后(2026-08)没有任何后续模型或产品采用 Hope 的公开证据,Google 自己的 Gemini 线也没有相关信号;引用(S2 87)多为讨论/综述式引用。同团队后续在 OpenReview 提交的 'Language Models Need Sleep' 延续该思路,说明这条线还在推进,但 Hope 本身仍停留在论文里。
M3 优化器验证了 CMS 思想在优化器上同样有效。
论文自己承认 M3"might suffer from computational overhead and so face challenges when scaling to larger networks"(Methods.tex),效率图显示慢于 Muon;ImageNet-21K 实验只有 24M/86M 的 ViT,没有 LLM 预训练的端到端对比,也没有与同类多尺度 momentum 工作(如 AdEMAMix)的正面比较,只在文中一句带过。

与我们方向的关系

对做 continual learning / test-time learning 的同学,这篇是必须建立的"坐标系":它把 Titans/TTT/DeltaNet/RWKV-7 这一整条 test-time regression 路线和优化器研究(Muon、momentum 设计)放进同一个词汇表,读完之后再看任何新的线性注意力或记忆架构论文,基本都能立刻定位到"哪个 level、什么内部目标、什么学习规则"。CMS 的"按频率分层更新 MLP、用更新频率换遗忘鲁棒性"是里面最可操作的想法——把预训练模型的 MLP 改造成不同频率可更新块再续训,这个 recipe(§7.3 Ad-hoc Level Stacking)不依赖 Hope 全家桶,值得在我们自己的持续学习实验里单独验证。

但要把它当理论透镜用,不要当可复现的 SOTA 用:引用它的统一视角没问题,复现 Hope 数字目前不现实(无官方代码,社区复现内讧,见 reality)。如果想动手,kmccleary3301/nested_learning 是最完整的起点(含 CI、单测、消融报告),但先读它的 issue #9 了解争议;更稳妥的做法是只实现 CMS(机制简单、争议最小)做对照实验。

阅读笔记

读原文建议:正文 60+ 页、符号密度大,性价比最高的是 §2(两个例子建立 NL 直觉)、§7 CMS 和 §8 Hope;§4-5 优化器部分可以只记结论(Adam=element-wise L2 最优记忆、Muon 的 NS 迭代=内层正交化优化)。注意 arXiv 版(2512.24695,2025-12-31 挂出)比 NeurIPS camera-ready 和 11 月的博客晚,博客宣传口径比论文本身激进。另外别把这篇的 'HOPE' 和社区自己扩写的 'Hierarchical Optimizing Processing Ensemble' 之类全称混为一谈——论文里 Hope 没有官方全称。

材料清单

TeX 源码
已存档:Raw/nested-learning/source/
第三方复现(最完整)github.com/kmccleary3301/nested_learning
712 stars,mechanism-level 复现 HOPE/CMS/Self-Modifying Titans,未跑到论文规模;先看 issue #9 的 faithfulness 争论
OpenReview(NeurIPS 2025)openreview.net/forum?id=nbMeRvNb7A
官方评审与作者 rebuttal;社区流传该文属 borderline accept
Hacker News 讨论news.ycombinator.com/item?id=46182031
152 分主帖,含'换皮 SGD/只是挪动遗忘位置'的代表性质疑与复现线索
作者 NeurIPS 海报讲解视频www.youtube.com/watch?v=uX12aCdni9Q
Ali Behrouz 本人 10 分钟讲解,比读 60 页正文快得多的入门方式

同类条目