← 返回资料站  /  AI for AI
论文 权重生成与自适应

Transformer^2: Self-adaptive LLMs

Transformer²:推理时缩放奇异值的自适应 LLM
一句话Sakana AI 提出 SVF(只训练每个权重矩阵奇异值上的缩放向量 z,参数量不到 LoRA 的 10%)+ 推理时两遍机制(第一遍识别任务、第二遍加载/混合 expert 向量)实现 LLM 自适应;SVF 在训练任务上稳定超过 LoRA,但在 unseen 任务上的自适应增益普遍只有 1-4%。

这是什么

传统微调(包括 LoRA)是静态的:训练完一个 adapter 就固定了,面对没见过的任务只能重训。这篇 ICLR 2025 论文提出 Transformer²,目标是让模型在推理时'自己调整自己的权重'来适应新任务——所谓 self-adaptive LLM。

核心构件是 Singular Value Fine-tuning (SVF):把每个权重矩阵 W 做 SVD 分解成 UΣVᵀ,冻结 U、Σ、V,只学一个 r 维向量 z 去逐分量缩放奇异值(Σ' = Σ ⊗ diag(z))。每个矩阵只需 min(m,n) 个参数,比 LoRA 的 (m+n)×r' 少一个数量级以上,而且因为只改已有奇异分量的幅度、不注入新方向,天然带正则,几百条数据就能用 RL 训练不崩。

在此之上,推理分两遍(two-pass):第一遍观察输入,判断这是数学/代码/推理还是别的任务;第二遍把对应的 SVF expert 向量(或它们的线性组合)乘进权重再作答。论文在 Llama3-8B、Mistral-7B、Llama3-70B 以及 VLM(Llama3-LLaVA-Next-8B)上验证。

整体框架:权重矩阵按 SVD 分解为 UΣVᵀ,底部是一组自适应向量(dispatch、math、coding、VLM 等)。第一遍推理(黑线)用 dispatch 判断'这是数学题',第二遍(红线)把对应 expert 向量逐元素乘到 Σ 上再生成答案。
整体框架:权重矩阵按 SVD 分解为 UΣVᵀ,底部是一组自适应向量(dispatch、math、coding、VLM 等)。第一遍推理(黑线)用 dispatch 判断'这是数学题',第二遍(红线)把对应 expert 向量逐元素乘到 Σ 上再生成答案。

机制与做法

SVF:用 RL 训练奇异值缩放向量

对每个要微调的权重矩阵学一个向量 z,新权重 W' = U(Σ⊗diag(z))Vᵀ。作者论证三点好处:参数极少;各奇异分量正交、z 向量之间可以线性插值组合(LoRA 的 A、B 矩阵因参数置换等价性做不到);只缩放幅度不加新方向,是一种有原则的正则化。

训练直接用 REINFORCE 优化任务正确率(reward ∈ {-1, 1})加 KL 惩罚,不需要带推理过程的标注文本——这点和 LoRA 的 next-token prediction 形成对比:消融(trial 2 vs 4)显示同样数据上 next-token 目标反而伤性能,而 LoRA 用 RL 训练又很不稳定(trial 5)。

训练与推理两阶段:左边训练时冻结 U/Σ/V,只用 RL 学缩放向量 z;右边推理时三种策略——A) prompt 分类选一个 z,B) 分类 expert 选 z,C) few-shot 场景用 CEM 搜出多个 z 的混合系数 α。
训练与推理两阶段:左边训练时冻结 U/Σ/V,只用 RL 学缩放向量 z;右边推理时三种策略——A) prompt 分类选一个 z,B) 分类 expert 选 z,C) few-shot 场景用 CEM 搜出多个 z 的混合系数 α。

推理时三种自适应策略

A) Prompt adaptation:用一个分类 prompt 直接问模型'这题属于哪类'(带'others'兜底选项),按分类结果加载对应 expert 向量;B) Cls-expert:再用 SVF 专门训一个任务分类 expert 提升第一遍的分类准确率;C) Few-shot adaptation:假设能拿到该任务的少量 held-out 样本,用 CEM(交叉熵方法)搜索 K 个 expert 向量的插值系数 α,产出针对该任务的混合向量 z'。每个任务只需搜一次,之后的 prompt 不用再加 few-shot 上下文。

三种策略信息量递增、效果也基本递增:few-shot 版本几乎总是最好。两遍推理的额外开销取决于任务:第一遍占第二遍时间的 13%(MATH)到 47%(ARC-Challenge,因为答案只有一个选项、第二遍本身很短)。

跨模型迁移的意外发现

把 Llama3-8B 上训好的 SVF 向量直接搬到 Mistral-7B,3 个任务里 2 个有正迁移;把向量随机打乱后再搬则一致掉分,说明增益确实来自奇异分量的有序结构而非噪声。作者也承认这可能依赖两个模型架构相似,不同规模间能否迁移仍是开放问题。

关键结果

实证核查

有水分SVF 本身是干净、可复现的贡献(代码真实、方法简单),但官方宣传的 'self-adaptive、significant leap' 大于实际:unseen 任务上的增益只有 1-4%,最强的 few-shot 变体还需要按任务做一次 CEM 搜索,和'实时自适应'的叙事有距离。
官方博客/摘要称 Transformer² 是 'significant leap forward',让 LLM '实时适应 unseen 任务'。
论文自己的 Table 2(source/tables/svf_ada_tasks.tex)显示 unseen 任务增益很小:Llama3-8B 三个任务归一化分数 1.02-1.04,Mistral-7B 的 prompt 和 cls-expert 两种策略在 MATH 上还倒退(0.91/0.89)。效果最好的 few-shot 策略需要每个任务先拿 held-out 样本跑一轮 CEM 搜索,并非逐 prompt 的实时自适应;真正逐 prompt 的 prompt-based 策略增益最弱。
代码开源,方法可复现。
GitHub SakanaAI/self-adaptive-llms(1225 stars,Apache-2.0)提供了 SVF 训练和三种评估脚本,与论文描述一致。但仓库自 2025-01-30 后无更新;issue #9 讨论显示默认脚本要 2 张 GPU(一张跑 vLLM 推理一张算梯度),issue #16/#23 请求小硬件支持无回应。issue #17 声称 policy gradient 用错了模型参数,被作者以'像是 LLM 生成的'为由关闭、未给出代码层面的反驳——该 issue 本身质量存疑,但作者也没有正面核查。未找到独立的第三方系统性复现报告。
SVF 'consistently outperforms' LoRA。
在他们的设置下基本成立,但 LoRA 基线数字在版本间被修订过:tex 源码 svf_train_tasks.tex 里注释掉的旧表中 Llama3-8B+LoRA GSM8K 为 70.58(0.93),正式版改为 77.18(1.02)——基线调优对结论敏感。且 LoRA 用的是 next-token prediction 目标而 SVF 用 RL,作者在附录做了 LoRA+RL 消融(不稳定),但'参数化优势'和'训练目标优势'仍不易完全解耦。
ICLR 2025 接收,社区反响。
确为 ICLR 2025 论文(OpenReview dh4t9qmcvK);Semantic Scholar 引用 21 次(2026-08 查),对一篇发布时营销声量很大的工作来说偏低。后续同组工作 Text-to-LoRA(2025)沿用了'为任务生成权重修改'的思路,可视为该方向的延续。

与我们方向的关系

对课题组'权重生成与自适应'线:这是 Text-to-LoRA 的直接前奏——先证明'任务级 expert 向量 + 推理时选择/混合'可行,T2L 再把'选择'升级为'从任务描述直接生成'。SVF 的 z 向量参数极少且可线性插值组合,是很好的'权重修改的紧凑表示',做权重生成的 hypernetwork 输出空间时值得优先考虑(比直接生成 LoRA 的 A/B 矩阵更规整)。

对持续学习方向:两遍推理 + expert 池的框架天然支持增量加 expert 而不动基座权重,论文里跨模型迁移(Llama 的 z 向量能用在 Mistral 上)也暗示这类表示有一定架构无关性。但要清醒:目前 unseen 任务增益只有 1-4%,expert 池也只有 3 个任务,离'lifelong 自组织'还很远,更适合当机制原型而非性能标杆来引用。

阅读笔记

复现要点:训练用 REINFORCE + KL,reward 是 {-1,1} 的对错信号,几百条样本即可;默认脚本要 2 GPU(vLLM 生成 + HF 梯度分开放)。Llama3-70B 因显存只调了一半层数,MATH 上 few-shot 反而没用。读 tex 源码比读 arXiv PDF 多一个收获:注释里留着旧版 LoRA 基线数字。

材料清单

TeX 源码
已存档:Raw/transformer-2/source/
代码仓库github.com/SakanaAI/self-adaptive-llms
1225★ · 最近推送 2025-01-30
项目主页 / 报告sakana.ai/transformer-squared/
OpenReviewopenreview.net/forum?id=dh4t9qmcvK
ICLR 2025 评审页
解读gonzoml.substack.com/p/transformer2-self-adaptive-llms
Gonzo ML 的第三方精读(英文)

同类条目