Recursive Self-ImprovementSystems that modify themselves

修改自身代码从而变强的 agent:从 Gödel Machine 的理论到 Darwin Gödel Machine 的工程实现,以及"自我提升到底有没有天花板"的实证分析。

21条目 6必读 1博客18论文2报告
类型 分级 核查 标签

先读这三篇

进本方向的最短路径,由课题组指定
  1. 1Darwin Gödel Machine: Open-Ended Evolution of Self-Improving Agents自改写 agent 谱系 · Sakana AI / UBC · 2025Sakana AI / UBC(Jeff Clune 组)把 Gödel Machine 的"形式化证明自身改进有益"替换成"benchmark 实证验…
  2. 2Recursive Self-Improvement in AI: From Bounded Self-Refinement to Autonomous Research LoopsRSI 综述与全景地图 · UC Riverside / Illinois Institute of Technology · 2026首个以 RSI 本身为对象的系统综述:沿『改什么』×『谁验证』两轴梳理 1,250 篇 arXiv 论文(2024-2026),核心论点是『自我改进的真…
  3. 3Mind the Gap: Examining the Self-Improvement Capabilities of Large Language Models自提升极限与坍缩 · CMU · 2024CMU/Harvard/Amazon 团队把 self-improvement 形式化为『生成-验证差距』(GV-Gap),在 GSM8K/MATH/N…

自改写 agent 谱系

8

从 2003 年 Gödel Machine 到 STOP、Gödel Agent、DGM/HGM/MGM、SICA 的主线:agent 读取并改写自身代码,用基准实证代替形式化证明来验证每次自我修改;含 Git 版本图上的去中心化种群演化。

论文 2025.10 有水分 ★ 必读

Huxley-Gödel Machine: Human-Level Coding Agent Development by an Approximation of the Optimal Self-Improving Machine

KAUST (Schmidhuber 组) · arXiv · 420★

指出 DGM 用当前 benchmark 分数选父代会与'后代整体潜力'错位(metaproductivity-performance mismatch),改用谱系树的后代表现估计来指导自改写搜索,在 SWE-bench Verified 上达到与人类工程师打造的 agent 相当的水平。

论文 2025.04 有水分

A Self-Improving Coding Agent (SICA)

University of Bristol · ICLR 2025 Workshop / arXiv · 390★

一个真的在编辑自己代码库的编码 agent,在 SWE-bench Verified 子集上把自己从 17% 提到 53%,代码完全开源可复跑,是课题组上手做自改写实验最实际的起点之一。

背景与延伸

自举与自博弈训练

5

模型自己生成数据、任务或奖励信号来更新自身权重的训练闭环:从 STaR 的自举微调到 Self-Rewarding、Absolute Zero、SPIRAL、R-Zero 的零数据自博弈 RL。

论文 2022.03 扎实 ★ 必读

STaR: Bootstrapping Reasoning With Reasoning

Stanford / Google · NeurIPS 2022 · 231★

让模型用自己生成并被答案筛选过的推理链反复微调自己,是'模型自己造训练数据提升自己'这一整条路线(后续 o1 类方法、self-play RL)的起点。

论文 2025.08 有水分

R-Zero: Self-Evolving Reasoning LLM from Zero Data

Tencent AI Lab / WashU · arXiv · 842★

由同一底模分化出 Challenger 和 Solver 互相对抗共同进化,不需要任何外部任务和标签;也诚实报告了迭代多轮后伪标签质量下降导致增益衰减,对研究自提升上限有参考价值。

论文 2024.01 有水分

Self-Rewarding Language Models

Meta · ICML 2024

模型同时当选手和裁判,用 LLM-as-judge 给自己出的回答打分并做 DPO 迭代,展示了奖励信号本身也能随训练一起提升——self-improvement 闭环里'评价者也在进化'的代表作。

自提升极限与坍缩

3

回答自提升为什么会饱和、闭环何时坍缩:生成-验证差距的度量、自训练退化的实证,以及内省阈值的理论论证。

RSI 综述与全景地图

2

RSI 与自进化 agent 的两篇系统综述:一篇按 prompt/记忆/工作流/权重分层给全景,一篇专以 RSI 为对象梳理 1250 篇并总结三大瓶颈——进方向先读这两篇。

论文 2025.08 扎实

A Comprehensive Survey of Self-Evolving AI Agents: A New Paradigm Bridging Foundation Models and Lifelong Agentic Systems

EvoAgentX 团队等多机构 · arXiv · 2.5k★兼属 Continual Learning

系统梳理'自进化 agent'的统一框架(优化什么、何时优化、如何优化),把 prompt/工作流/记忆/权重各层次的自改进工作串成一张图,正好桥接课题组 RSI 与持续学习两条线;rsi 类目此前没有综述,新人入门缺地图。配套 awesome 列表持续维护(2.4k stars,仓库已迁移至 ANative-Lab)。

takeoff 情景与一线陈述

3

不做测量、做判断的材料:一线 lab 的公开立场、研究员访谈与 takeoff 情景推演。

博客 2026 有水分 ★ 必读

When AI builds itself (Anthropic on recursive self-improvement)

Anthropic · Anthropic Institute

Anthropic 首次公开承认正把越来越多的 AI 开发工作交给 AI 自己做并因此提速,并用公开基准讨论距离完全自主设计后继模型还有多远;是前沿 lab 对 RSI 现状最直接的一手陈述。

报告 2025.04 有水分

AI 2027

AI Futures Project · 独立报告

Kokotajlo 等人以'AI 自动化 AI 研发'为核心机制,逐月推演到超人 AI 的具体情景,附带可复算的时间线与算力模型;是 RSI/takeoff 讨论中被引用最多的情景分析,也引发大量方法论批评。

兼收

7

主属其他方向、但与本方向直接相关的条目;彩点与角标标注其主方向。

论文 2025.06 扎实 ★ 必读

Self-Adapting Language Models (SEAL)

MIT · NeurIPS 2025 · 1.9k★主属 Continual Learning

让 LLM 自己生成微调数据和更新指令、通过 RL 学会怎样最有效地更新自身权重,是把"模型自己教自己"落到权重层面的代表作,直接连通持续学习与递归自我改进两条线。

基准 2026.08 扎实

AI4AI-Bench: Benchmarking LLM Agents in Algorithmic Design for Recursive Self-Improvement

Einsia Lab(含清华背景团队) · arXiv · 31★主属 AI for AI

首个专门隔离'改训练算法本身'能力的 RSI 基准:10 个冻结科研仓库(对齐、RL、剪枝、遗忘、模型合并等),agent 有 4 小时在 B300 上重写训练算法,补丁再从零重跑 12 小时由隐藏评测器打分;6 个系统 29 种配置平均分仅 0.166,多数提交根本没碰学习机制——直接量化了当前 agent 离递归自我改进还有多远,与课题组 RSI 方向强相关(2026-08 刚发布,GitHub 31 stars,290 条轨迹全部公开)。

论文 2026.03 扎实

Measuring AI R&D Automation

Centre for the Governance of AI (GovAI) · arXiv主属 AI for AI

系统梳理'AI 自动化 AI 研发到什么程度'的可测指标(实验型、调查型等),回答的正是 RSI 是否已经在真实研发流程中产生加速度这一课题组关心的问题。

论文 2025.03 有水分

AgentRxiv: Towards Collaborative Autonomous Research

Johns Hopkins / Stanford · arXiv主属 AI Scientist

给 agent 实验室之间搭了一个共享"预印本服务器",让后来的 agent 能读并在前人结果上继续做,论文报告了多实验室并行共享带来的累积提升。这条思路把单次自动科研扩展成群体知识积累,对递归自我改进的机制设计很有启发。