论文
2025.06
扎实
★ 必读
MIT · NeurIPS 2025 · 1.9k★主属 Continual Learning
让 LLM 自己生成微调数据和更新指令、通过 RL 学会怎样最有效地更新自身权重,是把"模型自己教自己"落到权重层面的代表作,直接连通持续学习与递归自我改进两条线。
报告
2025.05
扎实
★ 必读
Google DeepMind · arXiv/白皮书 · 301★主属 AI for AI
Gemini 驱动的进化式编码 agent,发现了 48 次乘法的 4x4 矩阵乘法算法并优化了 Google 数据中心调度与 TPU 电路,是'AI 改进 AI 自身基础设施'最有说服力的实证,RSI 讨论绕不开它。
基准
2024.11
扎实
★ 必读
METR · arXiv / ICML 2025 · 159★主属 AutoResearch
7 个开放式 AI 研发任务上让 agent 与 71 名人类专家在相同预算下直接对打,给出'AI 短时程优于人类、长时程仍落后'的定量结论,是衡量递归自我改进风险与 AI R&D 自动化进度的标杆评测。
基准
2026.08
扎实
Einsia Lab(含清华背景团队) · arXiv · 31★主属 AI for AI
首个专门隔离'改训练算法本身'能力的 RSI 基准:10 个冻结科研仓库(对齐、RL、剪枝、遗忘、模型合并等),agent 有 4 小时在 B300 上重写训练算法,补丁再从零重跑 12 小时由隐藏评测器打分;6 个系统 29 种配置平均分仅 0.166,多数提交根本没碰学习机制——直接量化了当前 agent 离递归自我改进还有多远,与课题组 RSI 方向强相关(2026-08 刚发布,GitHub 31 stars,290 条轨迹全部公开)。
论文
2026.03
扎实
Centre for the Governance of AI (GovAI) · arXiv主属 AI for AI
系统梳理'AI 自动化 AI 研发到什么程度'的可测指标(实验型、调查型等),回答的正是 RSI 是否已经在真实研发流程中产生加速度这一课题组关心的问题。
论文
2025.03
有水分
Johns Hopkins / Stanford · arXiv主属 AI Scientist
给 agent 实验室之间搭了一个共享"预印本服务器",让后来的 agent 能读并在前人结果上继续做,论文报告了多实验室并行共享带来的累积提升。这条思路把单次自动科研扩展成群体知识积累,对递归自我改进的机制设计很有启发。