← 资料站  /  Recursive Self-Improvement  /  RSI 综述与全景地图
论文 RSI 综述与全景地图

Recursive Self-Improvement in AI: From Bounded Self-Refinement to Autonomous Research Loops

AI 递归自我改进综述:从有界自我修正到自主研究闭环
一句话首个以 RSI 本身为对象的系统综述:沿『改什么』×『谁验证』两轴梳理 1,250 篇 arXiv 论文(2024-2026),核心论点是『自我改进的真实程度等于其验证信号的强度』,并给出 formal verifier → execution feedback → learned judge → intrinsic signal 的验证层级;结论是有界自我修正已是工业实践,开放式 RSI 在 grounding、collapse、算力三个方向上处处受限。

这是什么

『self-refine / self-reward / self-play / self-evolve』这套词汇把野心完全不同的工作混在一起:模型重读草稿改个错,和 agent 重写自己的代码库,都叫 self-improvement。这篇综述(UC Riverside / IIT,2026-07,arXiv 2607.07663)的第一个贡献就是把这团词汇拆成一个 4×3 网格:横轴是系统改进什么——deployment-time 行为(393 篇)、training-time 权重(340 篇)、evaluator 本身(318 篇)、研究过程本身即 Auto Research(139 篇),外加 foundations/safety(60 篇);纵轴是谁验证改进——human-in-the-loop、human-on-the-loop、完全闭环。

网格立刻显出两个结构性事实:文献的质量集中在中间行(自动信号 + 人类审计结果),完全闭环那一行处处稀疏、越靠右越薄;最要命的格子是 self-evaluation × closed loop——一个能改写自己『什么算更好』定义的系统——这正是有界自我修正滑向开放式 RSI 的边界。综述最独特的设计是给 self-evaluation 单开一章:每个自我改进循环本质上都是一个声明,声称某个信号可以替代人类判断,所以 evaluator 才是承重柱而不是管线细节。

结论部分把 takeoff 之争转成可测量问题:观察的不该是 benchmark 分数,而是系统在验证层级上爬到了哪一级——尤其是它能否成为 open-ended research judgment 的可靠评估者。在此之前,human-in-the-loop 不是情怀,是领域最后一层验证。

全书骨架:4×3 taxonomy 网格。横轴四列是系统改进什么(deployment 行为 393 篇 / training 权重 340 篇 / evaluator 318 篇 / 研究本身 139 篇),纵轴三行是谁验证改进(human-in-the-loop / human-on-the-loop / 完全闭环)。看点:文献质量集中在中间行;右下角 closed-loop Auto Research 最稀疏、安全风险最集中;DGM、STaR、Absolute Zero、FunSearch 等站内条目都能在格子里找到位置。
全书骨架:4×3 taxonomy 网格。横轴四列是系统改进什么(deployment 行为 393 篇 / training 权重 340 篇 / evaluator 318 篇 / 研究本身 139 篇),纵轴三行是谁验证改进(human-in-the-loop / human-on-the-loop / 完全闭环)。看点:文献质量集中在中间行;右下角 closed-loop Auto Research 最稀疏、安全风险最集中;DGM、STaR、Absolute Zero、FunSearch 等站内条目都能在格子里找到位置。

机制与做法

语料与方法:样本而非普查

语料分两步:先按七条线索(self-refinement、self-rewarding、automated AI research、self-modifying agents、代码/算法发现、RSI 理论与安全、自生成数据循环)从 arXiv 2024-2026 收 871 篇 seed,再针对 taxonomy 需要但 seed 查询覆盖不足的三个方向(self-evaluation、test-time training、zero-data self-play)定向补 379 篇。§2.3 自曝得很诚实:分类由单人标注(规则分类改了 89 篇、人工 override 3 篇);补充集约 54/379 篇是查询串味的边缘论文,留在计数里但不作为论据引用;74% 的论文发表于 2026,中位论文只有几个月大,引用数不能当影响力读。作者的应对是让论证骨架压在经过验证的 anchor 工作(STaR、SPIN、FunSearch、AI Scientist)和诊断/批判文献上,2026 年的大盘只当活动地图用。

验证层级:formal verifiers(构造上 sound)→ execution feedback(可靠但不完备)→ learned judges(judge 本身是优化目标)→ intrinsic signals(最便宜最好骗)。信号可靠性向上递增、任务覆盖面向下递宽;三大失败模式(self-confirming loop、model collapse、diversity collapse)集中在底部两级;顶端虚线框 human research judgment 是自我改进尚爬不上去的一级——这张图是全书论点的一页版。
验证层级:formal verifiers(构造上 sound)→ execution feedback(可靠但不完备)→ learned judges(judge 本身是优化目标)→ intrinsic signals(最便宜最好骗)。信号可靠性向上递增、任务覆盖面向下递宽;三大失败模式(self-confirming loop、model collapse、diversity collapse)集中在底部两级;顶端虚线框 human research judgment 是自我改进尚爬不上去的一级——这张图是全书论点的一页版。

验证层级:全书的单一论点

§5.2 把改进信号排成四级:formal verifiers(证明检查器、类型系统,构造上 sound,可无限迭代不接受假改进)→ execution feedback(测试、编译器、benchmark,可靠但不完备,固定 benchmark 终会被 game)→ learned judges(reward model、LLM-as-judge,受 judge 自身能力限制且本身就是被优化的目标)→ intrinsic signals(confidence、self-consistency,最便宜也最好骗)。综述观察到的经验规律(作者自己强调是定性模式不是测出来的定律):已展示的自我改进强度沿这个层级递减——FunSearch/AlphaEvolve 活在顶部两级,2024 年负面结果后幸存的 self-refinement 方法都是爬了层级的,AI scientist 的差距本质是拿第三级工具做第四级问题。

层级的地板已被直接测量:Mirror Loop 研究让三家模型做十轮无 grounding 自我批评,信息变化量衰减 55%——纯自评是 reformulation 而非 progress——而在第三轮插入一次外部验证就恢复前进。三大失败模式都能从层级违规推出:self-confirming loop(生成器和评估器共享权重时,confidence-coupled reward 系统性地强化高置信错误)、model collapse(Shumailov 的 Nature 结果 + Zenil 的定理化版本:外生信号占比趋零则退化必然)、diversity collapse(co-evolution 中 proposer 收敛到满足 reward 的窄带任务,novelty 是闭环会耗尽的消耗品)。

与 takeoff 讨论的对接

§7 把技术文献接回 Anthropic『closing the loop』essay 和 takeoff 争论:研究执行(代码跑、benchmark 打分)可验证、正在被自动化;研究方向设定是不可验证任务的典型,也正是人类留在环里的位置——综述的判断是 direction-setting 瓶颈和 verification 瓶颈是同一个瓶颈。§8 指出 2026 年领域在五个互不相通的主题里独立发明了同一个动作:evaluator co-evolution(verifier 跟着 policy 一起进化),这是对『静态 verifier 管不住进化中系统』的集体回应,但它究竟逃出了 self-confirming loop 还是给循环加了一层,是未来两年最关键的经验问题。五个 open problems 里作者认为最空的一格是 governance-grade measurement:可信减速方案需要的可审计证据基础设施,技术文献几乎为零(foundations 只占 60/1,250)。

关键结果

实证核查

有水分正文质量高于预期:方法自曝诚实、论点(验证层级)有内在一致性、大量引用诊断/批判文献而非只堆方法。但 Data availability 声称的 GitHub 仓库当前 404,可复现性承诺落空;且在其自设的 2024-2026 窗口内漏掉了数个站内已收的重要工作。
Data availability 一节声称完整 1,250 篇语料、分类赋值、查询脚本、图表源码都发布在 github.com/bamboodrift/recursive_self_improvement。
该仓库 404(gh api repos/bamboodrift/recursive_self_improvement 返回 Not Found,2026-08-31 验证);bamboodrift 账号唯一公开仓库是 coding-interview-university 的 fork。『分类可审计而非隐藏』的承诺目前无法兑现,§2.3 的语料统计只能信论文自述。
综述系统覆盖 self-modifying agents、self-play、诊断性文献等七条线索(2024-2026)。
对照站内 rsi 方向条目,在其自设窗口内缺失:Huxley-Gödel Machine(2025-10,DGM 的直接后续,grep main.tex/references.bib 零命中)、Mind the Gap(2024-12,恰是它最倚重的『诊断性』文献类型)、SPIRAL(2025-06,zero-sum self-play)。作者自称『样本而非普查』可部分开脱,但引了 DGM 却漏其后续 HGM,说明 agent 自改这条线的追踪不完整。STOP、STaR、DGM、SICA、Gödel Agent、Absolute Zero、R-Zero、Self-Rewarding LMs、AlphaEvolve 均有覆盖。
1,250 篇的分类学是对领域的系统梳理。
§2.3 自曝(值得表扬但读者须注意):单人标注、补充集约 54/379 篇是边缘串味论文仍留在计数内、74% 论文来自 2026 年、增长统计只用 seed 语料。各类别篇数(393/340/318/139/60)部分反映作者的采样设计而非领域真实构成——作者自己也这么说,§8 的四假说讨论即由此而来。用这些数字时要带上这个脚注。
分类结构(两轴 + 验证层级)比论文清单更持久,已吸收两次范式到来(OPSD、zero-data self-play)。
外部采纳的早期信号存在但薄弱:S2 显示 7 次引用(发布约两个月),其中 HELIX(Model-Harness Co-evolution for Recursive Self-Improvement)、RecurSE(Bounded Recursive Self-Evaluation for LLM Rubric Judges)等标题直接沿用了 bounded/recursive 二分和 self-evaluation 框架。但 arXiv 至今仍是 v1(2026-07-08),对一个自称『领域加速快于综述追踪』的综述,尚无持续更新的迹象。

与我们方向的关系

这是站内 rsi 方向目前唯一的『地图』条目,建议的用法:新同学进入 RSI 方向时第一篇读它的 §2(taxonomy)+ §5(verification hierarchy)+ §8(open problems),然后拿 Figure 1 的 4×3 网格给站内其余条目定位——STOP/DGM/SICA/Gödel Agent 落在 deployment×closed 格,STaR/Absolute Zero/R-Zero 落在 training×closed 格,Self-Rewarding LMs 横跨 training 与 self-evaluation。它与站内另一篇综述 a-comprehensive-survey-of-self-evolving-ai-agents 分工明确:那篇是 agent 进化的方法目录,这篇是 RSI 问题本身的概念地图,两者只在 §3.5-3.6 重叠。

对课题组最有直接价值的是两处:一是 verification hierarchy 可以当选题过滤器用——任何自我改进方案先问『信号在第几级、爬层级的成本是什么』,这和 when-ai-reviews-its-own-code(collapse 实证)、mind-the-gap(自评能力诊断)构成一组;二是它把 when-ai-builds-itself-anthropic 那篇 essay 的 stage 3-5 语言接进了技术文献,§7.3 + §8 的 governance-grade measurement 空档是它明示的低竞争高杠杆选题方向。注意它漏了 Huxley-Gödel Machine 和 SPIRAL——用它当地图时,agent 自改和 self-play 两条线要用站内条目补全。

阅读笔记

配套仓库 404 是最大的坑:如果后续要用它的语料做元分析,先去联系作者或等 v2。arXiv 摘要页 meta 里的 updated=2026-08-31 是 feed 时间戳,不是论文更新——Submission history 只有 v1(2026-07-08)。综述正文写作水平明显在平均 arXiv 综述之上(『Novelty is a consumable resource that closed loops deplete』这类总结句信息密度很高),但所有 1,250/393/340 之类的计数都是作者自采样的产物,引用时须注明。

材料清单

TeX 源码
已存档:Raw/recursive-self-improvement-in-ai/source/
配套仓库(失效)github.com/bamboodrift/recursive_self_improvement
论文 Data availability 声称的语料+脚本仓库,2026-08-31 验证为 404

相关条目

同子模块 · RSI 综述与全景地图
跨方向 · 同标签