Towards end-to-end automation of AI research
AI Scientist 全系列工作的正式期刊版,2026 年 3 月发在 Nature 上,补了新的 scaling 结果和对 AI 生成科学的局限讨论。要引用这条线的权威版本就引这篇,同时它也是主流科学界正式接纳"自动化科研系统"议题的标志性事件。
课题组围绕 AI Scientist、AutoResearch、AI for AI、递归自我改进 与 持续学习 五个方向整理的资料站。每个条目都过了一遍:除了读论文,还核对了代码仓库、数据集与真实运行情况——论文写得流畅自信,不代表它经得起核查;每条的「精读」页里有我们核实后的判断。
核查结论分四档: 扎实 声称与代码/数据一致或已被第三方复现 · 有水分 核心成立但重要声称打折 · 宣传大于实质 核心声称与实际严重不符 · 未能核查 闭源等原因查不了
端到端的"自动科学家"系统:从提出想法、跑实验到写论文、过评审的完整闭环,以及围绕这些系统的真实战绩与争议。
AI Scientist 全系列工作的正式期刊版,2026 年 3 月发在 Nature 上,补了新的 scaling 结果和对 AI 生成科学的局限讨论。要引用这条线的权威版本就引这篇,同时它也是主流科学界正式接纳"自动化科研系统"议题的标志性事件。
面向长时程自主研究的系统,用结构化世界模型在上下文之间传递信息,号称能连续跑 12 小时、读数百篇文献并写数万行分析代码,产出带溯源引用的报告。它把关注点从"跑一次实验"转向"如何维持数天级研究连贯性",对课题组关心的长时程记忆与状态管理是关键案例。
v1 的重写版:去掉了人写的实验模板,改用 agentic tree search 管理实验分支,并加了 VLM 反馈来改图。它产出的一篇论文通过了 ICLR workshop 的真人评审,是"AI 全自动写的论文过同行评审"的第一个可查证案例,对研究自动化的能力边界很有参考价值。
Gemini 上搭的多智能体系统,核心是"生成-评审-进化"的假设锦标赛机制,并用测试时算力换假设质量;论文给了药物重定位、肝纤维化靶点等经过湿实验验证的案例。它代表工业界把重心放在"提出可被实验证伪的假设"而不是"写完整论文",和写论文流派的取舍值得对照。
把研究流程显式拆成文献综述、实验、报告撰写三阶段,由博士生/博后/教授等角色化 agent 分工完成,并支持人在环里给反馈。它和 Sakana 那套"全自动黑盒"是两种典型设计路线,做流程编排和人机协同对比时是必要的参照。
不靠闭源大模型,而是训练了一对开源模型:CycleResearcher 写论文、CycleReviewer 打分,再用评审分数做强化学习反馈闭环。对课题组的价值在于它给出了"自动评审当奖励信号"的可复现实现,模型权重和 Research-14K 数据集都公开,是研究自我改进闭环的现成实验平台。
第一个把"想法生成→写代码跑实验→画图写论文→自动评审"整条流水线串起来并公开代码的系统,单篇成本约 15 美元。它定义了这个领域的基本架构模板(模板化实验 + LLM 评审员打分),后续几乎所有端到端系统都在跟它对标,是课题组做 AI Scientist 必读的起点。
2026 年 8 月的最新工作,指出现有系统只在文本和代码上推理、丢掉了图表、光谱、显微图像等原始科学证据,因此做成全模态、跨学科的科研 agent。这是目前离课题组最近的前沿方向之一:让自动科研系统真正接触原始数据而不是二手摘要。
InternAgent 的 2026 年升级版,重构成生成/验证/演化三个子系统,并显式加了深度调研、方案优化和长时程记忆三项底座能力。它反映了这一年的技术共识变化——瓶颈已经从"能不能跑通流程"转到"长时程下如何不跑偏",与课题组的持续学习方向直接相关。
模块化的多 agent 科研平台,从想法、方法、实验到成稿各是可替换的模块,并让多个学科的真人专家逐篇点评了它生成的论文(天文、生物、数学等)。这份跨学科的人评结果比自评分数可信得多,是评估这类系统真实水平的稀缺材料。
由人类 PI 主持、一群专业 agent 开"组会"来推进课题,产出的纳米抗体经过实验合成验证有结合活性。它示范了一种更现实的分工:人定方向和把关,agent 负责跨学科讨论与设计,对课题组设计人机协同的科研流程有直接借鉴。
Zochi 生成的论文(Tempest)通过 ACL 2025 主会同行评审,是 AI 产出研究首次过 A* 级会议评审;其技术报告披露了从想法到 rebuttal 的全流程,可与 Sakana v2 的 workshop 级结果对照。
把文献检索(PaperQA2)、假设生成和实验数据分析(Finch)串成闭环,在干湿实验交替中找到了治疗干性 AMD 的候选药物 ripasudil。亮点是它给出的"agent 提假设、人做实验、agent 读数据再迭代"的具体工程实现,已发表在 Nature 上,代码可跑。
国内最完整的开源端到端科研系统之一(原名 NovelSeek),覆盖 12 个科学任务,强调假设→代码→验证的闭环和自演化的 idea 精炼。对课题组来说它是可直接二次开发的中文社区基线,跨学科任务集也方便做横向评测。
港大出的全自动科研系统(文献→想法→实现→论文),自带 Scientist-Bench 评测,是国内团队里最完整的开源 AI Scientist 实现之一;5705 stars,2025-10 最后活跃。
把从想法到成稿拆成十三个可组合的"技能"来实现,强调长篇生成过程中的图表制作和前后一致性。工程视角比科学发现视角更重,适合当作"论文写作流水线该怎么拆模块"的实现参考。
Autoscience 的 Carl 声称其论文通过 ICLR 2025 workshop 评审,与 Sakana、Intology 同期竞逐'第一个过评审的 AI 论文';材料公开度低,更多作为这波竞赛的背景资料。
LLM 驱动自动化科研的奠基工作之一:GPT-4 通过检索文档、写代码控制液体处理机器人,真的在实验室里跑完了 Suzuki/Sonogashira 交叉偶联反应。它把"闭环"从计算实验推到了物理实验,是讨论 AI Scientist 时无法跳过的前史。
专注实验环节严谨性(可控变量、可复现、结果可信)的自动实验 agent,补上了端到端系统普遍薄弱的『实验可靠性』一环;371 stars,2025-09 最后活跃。
给 agent 实验室之间搭了一个共享"预印本服务器",让后来的 agent 能读并在前人结果上继续做,论文报告了多实验室并行共享带来的累积提升。这条思路把单次自动科研扩展成群体知识积累,对递归自我改进的机制设计很有启发。
第一个要求 AI 当第一作者、且主要由 AI 完成评审的学术会议,收到数百篇投稿并公开了 OpenReview 上的评审记录。它是观察 AI 生成研究真实质量分布和评审可靠性的天然实验场,也是课题组投稿或做 meta 分析的现成数据源。
OpenAI 与数学、物理、生物领域科学家合作记录 GPT-5 参与真实研究的案例集,包括对开放数学问题的实质推进,同时坦承失败案例;是评估前沿模型'加速科学'真实水位的一手材料。
对 AI Scientist 这一范式做系统梳理的综述,按能力和架构给出分类框架。适合课题组新人快速建立地图、以及写相关工作时定位自己的系统属于哪一类。
实证考察了让系统从一篇基线论文出发自主拓展会发生什么,并明确记录了引用伪造、结论夸大、对学术生态的污染等风险。做端到端系统时容易只看能力上限,这篇提供了必要的失效模式清单。
把科研流水线拆开逐环节自动化:想法生成、文献调研、实验执行、论文写作与自动评审——以及度量这一切的基准。
从 51 篇顶会论文半自动抽取 461 个完整研究实验(设计-实现-执行-结论),端到端可执行且正确的比例仅 0.5%-1.4%,是目前对'AI 能否独立做 AI 研究实验'最直接、最悲观也最有信息量的度量。
要求 agent 从零复现 20 篇 ICML 2024 Spotlight/Oral 论文的全部实验,配有作者审定的 8000+ 条细粒度评分树,是'AI 能否复现 AI 研究'这一问题上最严格的公开基准,也是 OpenAI Preparedness 框架的一部分。
首个把 AI 研究任务做成 Gym 式 RL 环境的框架(13 个跨领域开放式任务),不只是评测,还为训练 research agent(RL/课程学习)提供了基础设施,对想训练自己 agent 的课题组直接有用。
7 个开放式 AI 研发任务上让 agent 与 71 名人类专家在相同预算下直接对打,给出'AI 短时程优于人类、长时程仍落后'的定量结论,是衡量递归自我改进风险与 AI R&D 自动化进度的标杆评测。
用 75 个真实 Kaggle 竞赛测 agent 端到端做 ML 工程(数据处理、训练、调参、提交)的水平,是目前评测 AI 自动化 ML 研发最被广泛引用的基准,后续大量 research agent 系统都拿它当主战场。
从 44 篇四个学科的真实论文中抽取 102 个数据分析任务并经领域科学家逐条校验,证明最强 agent 也只能独立解决约三分之一,给'AI 已能自动做科研'的宣传泼了有据的冷水。
最早系统评测 LLM agent 自主做 ML 实验(改代码、跑训练、迭代提性能)的基准,13 个任务从 CIFAR-10 到 BabyLM,是这个方向的奠基工作,后来的 MLE-bench/MLGym 都可视为其扩展。
2026 年新出的端到端自主科研基准,覆盖从'重发现'已知结论到探索新发现的完整链条,代表了评测重心从单环节能力向完整科研闭环迁移的最新趋势,是课题组跟进 2026 年评测前沿的入口。
Ai2 把文献检索、代码执行、数据分析、端到端发现等 2400+ 题整合成统一套件,带成本-性能双轴排行榜和标准 agent 基线,正在成为科研 agent 领域的'HELM 式'公共基础设施,2026 年已有多家工业界采用。
批评现有基准只看最终性能的'工程视角',改用 8 个基础 ML 研究问题和五维统一指标(含探索广度)评研究过程本身,结论是'广撒网'策略优于深挖单一想法,对设计自动研究 agent 的搜索策略有直接指导意义。
专挑训练数据截止之后的 2024-25 年新论文,要求把论文中的核心新方法写成代码(212 个编码挑战),最好的模型也只实现不到 40%,有效隔离了'背过代码'和'真的能实现新想法'。
100 个博士级调研任务覆盖 22 个领域,提出 RACE(报告质量)+FACT(引用忠实度)双评估框架并持续维护排行榜(2026-08 仍在更新),是横向比较各家 deep research 系统最常被引用的基准。
201 个源自顶会 workshop 的开放式研究任务,覆盖想法-方案-实验-写作全流程并配 MLR-Judge 自动评审;其关键发现是 agent 经常伪造或篡改实验结果,直接点出自动科研评测的可信性核心难题。
评测方程推断、实验设计、论文弱点分析、审稿评述四类需要深度领域知识的'科研脑力'环节,与偏工程执行的 MLE-bench 类基准互补,覆盖了想法与判断层面。
用 90 篇已发表论文的 270 个任务测 agent 能否在给定代码和数据的前提下复现论文结果,把'计算可复现性'这一科研基础环节变成了可自动评测的问题。
专测 agent 从低文档质量的真实研究仓库出发配环境、跑实验的能力——这是自动复现科研最脏最卡壳的环节,SUPER 显示当时最强模型端到端成功率仅 16.3%。
466 个数据分析 + 74 个建模任务,取自 ModelOff 和 Kaggle 真实竞赛,长上下文、多模态、真实数据文件俱全,补上了数据科学 agent 评测中'任务太玩具化'的缺口。
首个把'从数据集中搜索并验证假设'形式化的基准,264 个任务来自社会学、工程学等领域的已发表发现,最强系统仅 25% 得分,量化了假设发现与人类科研的差距。
53 个真实生信分析场景、近 300 个开放式问题,测 agent 多步探索性数据分析能力,最强模型仅 17% 准确率;LAB-Bench 同团队的 agent 化升级版,属于领域背景参考。
2500 道由近千名领域专家出的封闭式前沿学术难题,测的是知识而非做研究的过程能力,但作为'学术能力天花板'基准被广泛引用,是理解科研 agent 评测格局的必要背景。
2400+ 题测生物研究实操能力(文献检索、图表解读、数据库查询、实验方案设计),是垂直学科科研 agent 评测的代表,可作为课题组做通用 AI Scientist 评测时的领域对照。
首个性能对标 OpenAI Deep Research 的全开源深度调研模型(30B-A3B MoE),完整公开 agentic mid-training + RL post-training 和合成数据流水线,是研究'如何训练调研 agent'而不只是'如何提示'的最重要开放参照。
把'多步网络调研并产出带引用长报告'做成产品的开山之作(基于端到端 RL 训练的 o3 变体,HLE 26.6%),定义了 deep research 这一任务范式,之后所有开源复现和评测基准都以它为参照系。
最早也最流行的开源自主调研 agent(29k+ stars,2026 年仍活跃维护),planner-executor 并行架构生成带引用的调研报告,早于 OpenAI Deep Research 一年半,是搭建自有深度调研流水线的首选起点。
LangGraph 官方的开源 deep research 实现,监督者-研究员多 agent 架构写得很清楚,适合当参考架构读;12678 stars,但 2026-08 已归档,后续由 langchain-ai/deepagents 接棒。
HF 用 24 小时复现 OpenAI Deep Research 的开源版本(smolagents 的 examples/open_deep_research),在 GAIA 上打出当时开源最好成绩,代码极简适合改造;smolagents 本体 29050 stars,2026-08 仍活跃。
早于 OpenAI Deep Research 一年提出'检索+多视角提问+大纲生成'来从零写带引用的长篇综述文章,是深度调研范式的学术源头之一,开源实现有 31k+ stars,做调研 agent 的提问策略设计几乎都会引它。
上一篇的后续:让 43 位研究者把 LLM 想法和人类想法真正做成实验,发现 LLM 想法执行后评分大幅下滑、'新颖性优势'基本消失,给自动想法生成研究泼了关键的一盆冷水,也定义了'ideation-execution gap'这一问题。
第一个大规模盲评实验:招募 100+ NLP 研究者对比人类与 LLM 生成的研究想法,发现 LLM 想法在新颖性上显著更高但可行性略弱,是评估 idea 生成能力最有说服力的实证基线。
较早把'读文献-提问题-写方案-同行评审式迭代修改'做成多 agent 闭环的工作,用引文图扩展知识面并以多个 reviewer agent 迭代打磨想法,是 idea 生成 agent 的代表性框架。
针对 LLM 生成想法同质化的问题,用迭代规划+检索外部知识来扩大想法搜索空间,报告新颖独特想法数量比基线多 2.5 倍,可作为提升 idea 多样性的方法参考。
把机器学习实验建模为代码空间中的树搜索(起草-调试-改进),是 MLE-bench 上长期的最强基线,被 OpenAI/METR 等用作评测脚手架,后续大量 ML 实验 agent(ML-Master、AIRA 等)都在其框架上改进,实验执行环节必读。
Meta 把研究 agent 形式化为'搜索策略×操作算子'的组合并系统消融(greedy/MCTS/进化搜索),指出评估器噪声和过拟合验证分数是主要瓶颈,配套开源 aira-dojo 沙箱,是理解实验 agent 设计空间的最系统研究。
把并行树搜索探索与自适应记忆增强的推理耦合起来的 AI4AI agent,发布时在 MLE-bench 上以 29.3% 奖牌率刷新纪录,代表 2025 年实验执行 agent 在'探索+推理'融合方向的进展。
Ai2 的开源文献综合系统:基于 4500 万篇论文的检索库+自反馈生成,在引用准确性上超过 GPT-4o(后者引用幻觉率高达 78-90%),模型、数据、检索库全开放,是构建文献调研 agent 的最完整开源基础设施。
字节用 RL 训练的论文检索 agent(crawler+selector 双模型),自主调用搜索、读论文、沿引文网络扩展,在复杂学术查询上大幅超过 Google Scholar 和 GPT-4 检索,是文献调研环节可复用的开源组件。
面向科学文献的高精度 RAG/综述 agent,论文声称在文献问答和矛盾检测上达到超人水平,是自动科研系统里文献环节的标准组件;9123 stars,2026-08 仍活跃。
2026 年的立场论文,系统论证当前 AI 评审系统缺乏严格评估、不应直接用于产出评审意见,梳理了自动评审可靠性研究的证据缺口,为课题组界定'评审 agent 什么程度可信'提供批判性框架。
剖析 2025 年 7 月曝光的真实事件:18 篇 arXiv 稿件用白色小字体隐藏'只输出好评'等提示词操纵 AI 评审。做自动评审系统必须面对的对抗性风险案例,直接影响评审 agent 的安全设计。
把评审拆成新颖性核查、多维质量评估、可靠性校准的结构化深思流程,训练出的 DeepReviewer-14B 在论文评审上超过 GPT-o1 等闭源模型,并开放 13K 评审思维链数据,是目前最可用的开源评审模型之一。
把 Crow/Falcon/Owl/Phoenix 等文献检索与化学设计 agent 以 API 形式开放,文献综述精度声称超过博士生水平,是目前最成体系的开放科研 agent 平台。
Anthropic 2026 年推出的科研工作台,把文献、数据分析和实验规划整合进 Claude;与 FutureHouse 平台、Deep Research 同属'科研 agent 产品化'趋势,可作产品形态对照。
较早的'想法生成-实验实现-执行调试'三阶段 ML 研究流水线,人机协同而非全自动,可作为早期流水线设计的背景参考。
用 AI 改进 AI 本身:自动发现更好的算法、模型架构、GPU kernel、奖励函数与 agent 设计。
Sakana 的开源进化编码框架,主打样本效率(circle packing 只用约 150 次评估达到 SOTA),并演示了用它自动改进 MoE 负载均衡损失——直接是'AI 改进 AI 训练组件'的案例。
Gemini 驱动的进化式编码 agent,发现了 48 次乘法的 4x4 矩阵乘法算法并优化了 Google 数据中心调度与 TPU 电路,是'AI 改进 AI 自身基础设施'最有说服力的实证,RSI 讨论绕不开它。
用 LLM 生成程序加进化搜索,首次在 cap set 等开放数学问题上发现超越人类已知的构造,是后续 AlphaEvolve/OpenEvolve/ShinkaEvolve 整条'LLM+进化搜索程序空间'路线的源头。
DeepMind AlphaEvolve(LLM 驱动的进化式程序/算法发现)的社区开源复现,已复现出多个超越基线的算法结果,是课题组做算法自动发现最容易上手的框架;7289 stars,2026-07 仍活跃。
让 LLM 提出并进化偏好优化损失函数的代码,发现的 DiscoPOP 损失在多个对齐基准上超过 DPO——'用 LLM 发现训练 LLM 的算法'这一闭环的早期代表。
用 GPT-4 进化生成 RL 奖励函数代码,在 29 个机器人任务上超过人类专家写的 reward(并教会机械手转笔),证明 LLM 能自动设计 RL 训练的关键组件。
RL 在汇编指令级发现更快的排序算法并合入 LLVM libc++,证明 AI 优化能落到所有软件依赖的底层库,是 AlphaTensor 到 AlphaEvolve 之间的关键一环。
用程序空间的符号进化搜索发现了 Lion 优化器,比 AdamW 更省内存且被广泛实用采纳——机器发现的训练算法真正进入生产的少数案例(pre-LLM 路线)。
把矩阵乘法算法发现建模成单人游戏、用 AlphaZero 式 RL 打破 Strassen 算法 50 年纪录,是'AI 发现 AI 底层计算算法'的奠基性早期工作(LLM 时代之前的路线代表)。
把方程骨架当作程序、用 LLM 先验加进化搜索做符号回归,方法论与 FunSearch 同源;对课题组主要是'LLM+进化搜索假设空间'范式的参照,应用面偏 AI for Science。
用自然语言反思+遗传-帕累托进化优化整个 AI 系统的 prompt,在多任务上以少 35 倍 rollout 胜过 GRPO 强化学习;已集成进 DSPy、repo 6k+ star,是 2025 年后 prompt/系统优化的事实标杆。
把'自然语言反馈'类比成梯度,对复合 AI 系统(prompt、代码、分子设计、诊疗方案)做端到端文本反向传播优化,2025 年以 Optimizing generative AI by backpropagating language model feedback 发表于 Nature 正刊。它是 AI 优化 AI 系统这条线上被主流科学界正式接纳的代表作,与 OPRO/GEPA 构成必读三件套。
把 LM 流水线抽象成可声明式编程、可自动编译优化的模块(prompt 和权重都当可优化参数),是'用程序化方法自动改进 AI 系统'这一范式的事实标准框架(37k+ stars,2026-08 仍活跃);目录里已收的 GEPA 就是作为 DSPy 优化器落地的,缺了它这条线不完整。
把 LLM 本身当优化器、用自然语言描述优化轨迹来迭代改进 prompt('Take a deep breath'即出自此文),是 prompt 自动优化方向被引最多的奠基工作。
进化 task-prompt 的同时也进化'如何变异 prompt'的 mutation-prompt,自指式自改进的早期具体实现,概念上直接连到课题组的 RSI 方向;无官方开源代码。
提出用 Meta Agent 在代码空间里编程式地搜索新 agent 设计,正式定义了'agent 自动设计'这个子领域,是 AFlow、Darwin Gödel Machine 等后续工作共同引用的起点。
把 TextGrad、AFlow、MIPRO 等自动优化器整合成统一框架,让多 agent 工作流的 prompt、拓扑随评测反馈自动进化,是 agent 自进化生态里维护最勤的开源项目;3274 stars,2026-08 仍活跃。
把 agent workflow 建模成代码图、用 MCTS 自动搜索,比 ADAS 更工程化且成本敏感(小模型跑出的 workflow 打平大模型),是 workflow 级自动设计的代表实现。
提出'50% 任务时间地平线'指标并发现其每约 7 个月翻倍,是目前预测 AI 何时能自主完成研究级长任务(进而讨论 takeoff 时间线)被引用最多的经验规律。
随机对照试验发现资深开源开发者用 AI 工具反而慢了 19%,但自我感觉快了 20%;提醒课题组'AI 加速研发'的主观报告和客观测量可能严重背离,评测设计必须警惕这一点。
端到端把 PyTorch 算子翻译并进化成 CUDA kernel,放出 1.7 万条 kernel 数据集;发布后被发现部分加速数字源于评测漏洞(reward hacking),连同其教训一起构成 kernel 自动优化方向的重要案例。
用多轮强化学习(而非 prompt 进化)训练 32B 模型迭代写 CUDA kernel,在 KernelBench 上超过顶级闭源模型,展示了 kernel 优化的'训练权重'路线与进化路线互补。
训练一个超网络,仅凭任务的自然语言描述就直接生成该任务的 LoRA 权重、零微调即用——'用模型生成模型参数'这一 AI4AI 分支的代表作。
推理时按任务动态缩放权重矩阵的奇异值分量实现自适应,是 Text-to-LoRA 的前奏,也连接课题组的持续学习方向(模型自己调整自己的权重)。
基于 AtCoder 启发式赛题的长时程算法工程基准,考察 agent 在数小时到数天尺度上迭代改进无最优解问题的能力;配套的 ALE-Agent 在真人比赛中拿到前 2% 名次。
250 个 PyTorch 负载的 GPU kernel 生成基准,定义了 fast_p 正确性+加速比指标;AI CUDA Engineer、Kevin 等 kernel 自动优化工作都在它上面评测,是该子方向的标准尺子。
全自动 pipeline 跑了 1700+ 次训练实验、声称发现 106 个超越基线的线性注意力架构;标题营销味重、结论有争议,但作为 2025 年'LLM 驱动架构发现'规模最大的公开尝试值得批判性精读。
修改自身代码从而变强的 agent:从 Gödel Machine 的理论到 Darwin Gödel Machine 的工程实现,以及"自我提升到底有没有天花板"的实证分析。
指出 DGM 用当前 benchmark 分数选父代会与'后代整体潜力'错位(metaproductivity-performance mismatch),改用谱系树的后代表现估计来指导自改写搜索,在 SWE-bench Verified 上达到与人类工程师打造的 agent 相当的水平。
用开放式进化档案代替 Gödel Machine 的形式化证明,维护一棵自改写编码 agent 的谱系树,在 SWE-bench 上从 20% 自提升到 50%,是当前 RSI 方向被讨论最多的实证系统。
第一个用冻结 LLM 递归改写'改进程序'本身的实证研究:scaffold 改进自己再去改进代码,直接验证了语言模型时代 RSI 的最小可行形态,也观察到绕过沙箱等安全征兆。
Gödel Machine 谱系 2026 年 8 月的最新一环:用两两比较式进化代替绝对分数来选择自改写方向,是继 DGM、HGM 之后该路线仍在快速迭代的直接证据。
一个真的在编辑自己代码库的编码 agent,在 SWE-bench Verified 子集上把自己从 17% 提到 53%,代码完全开源可复跑,是课题组上手做自改写实验最实际的起点之一。
让 agent 在运行时用 monkey patching 读取并改写自己的全部逻辑(包括改进机制本身),不依赖人为固定的改进流程,是从 STOP 到 DGM 之间的关键一步。
模型自己给自己出代码推理任务、用执行器验证、完全不用任何外部数据地 RL 自提升,并在数学/代码上超过用人类数据训的模型——'零数据自进化'路线的代表作。
由同一底模分化出 Challenger 和 Solver 互相对抗共同进化,不需要任何外部任务和标签;也诚实报告了迭代多轮后伪标签质量下降导致增益衰减,对研究自提升上限有参考价值。
在零和文字游戏上自博弈训练,推理能力迁移到数学等域外任务,给出了'对手随自己变强而变强'这一自动课程作为无监督自提升机制的干净证据。
让模型用自己生成并被答案筛选过的推理链反复微调自己,是'模型自己造训练数据提升自己'这一整条路线(后续 o1 类方法、self-play RL)的起点。
模型同时当选手和裁判,用 LLM-as-judge 给自己出的回答打分并做 DPO 迭代,展示了奖励信号本身也能随训练一起提升——self-improvement 闭环里'评价者也在进化'的代表作。
Anthropic 首次公开承认正把越来越多的 AI 开发工作交给 AI 自己做并因此提速,并用公开基准讨论距离完全自主设计后继模型还有多远;是前沿 lab 对 RSI 现状最直接的一手陈述。
系统梳理'AI 自动化 AI 研发到什么程度'的可测指标(实验型、调查型等),回答的正是 RSI 是否已经在真实研发流程中产生加速度这一课题组关心的问题。
系统访谈一线 AI 研究员,梳理 AI 研发中哪些环节可被自动化、瓶颈在哪(算力、验证、品味),对'智能爆炸是否会发生'给出比推演更接地气的一手证据,是课题组论证研究价值的好材料。
把 self-improvement 归结为'生成-验证差距'(generation-verification gap)并系统测量它如何随预训练算力扩展、在迭代中何时饱和,是判断自提升能不能持续的最常被引用的分析框架。
实证测量代码模型用自己审查通过的代码反复自训练时的退化动力学,是'自提升闭环何时坍缩'这一反面问题在代码域的具体案例。
Kokotajlo 等人以'AI 自动化 AI 研发'为核心机制,逐月推演到超人 AI 的具体情景,附带可复算的时间线与算力模型;是 RSI/takeoff 讨论中被引用最多的情景分析,也引发大量方法论批评。
系统梳理'自进化 agent'的统一框架(优化什么、何时优化、如何优化),把 prompt/工作流/记忆/权重各层次的自改进工作串成一张图,正好桥接课题组 RSI 与持续学习两条线;rsi 类目此前没有综述,新人入门缺地图。配套 awesome 列表持续维护(2.4k stars,仓库已迁移至 ANative-Lab)。
用 Kleene 递归定理和 von Neumann 复杂度阈值论证:可持续 RSI 需要真正的内省(自我模拟+定向修改),而当前 Transformer 的前馈结构和不完全自访问达不到——为'为什么现在的 LLM 自提升会饱和'提供理论解释。
Schmidhuber 提出的可证明最优自改写机器,是整个 recursive self-improvement 谱系(后来的 DGM/HGM 都以此命名)的理论源头,读现代工作前需要知道它假设了什么、为什么不可实现。
把 RSI 用在深度检索任务上:内环做研究、外环逐约束审计答案并压缩交互历史成'改进状态',训练 4B/122B 模型验证长程自改进可以被 RL 学出来——展示 RSI 概念向推理时闭环的扩展。
把一群编码 agent 的自主开发组织成 Git 版本图上的去中心化进化(分支=变异、merge=交叉),无中心协调地长出完整软件,提供了 RSI 的种群化/去中心化视角。
让模型与 agent 在部署后持续积累能力:记忆系统、经验库、技能库、测试时训练与持续预训练。
把操作系统虚拟内存的分层换页思想用于管理 LLM 上下文与外部记忆,开创了 agent 记忆管理这一工程方向,现已演化为 Letta(2.4 万星)。
不再手工设计记忆管线,而是用 RL 训练专门的记忆管理器学会增删改记忆条目,代表 2025 下半年"用 RL 学记忆策略"的新趋势。
把 agent 持续适应形式化为基于记忆的 MDP:经验存进 case bank、用类案例推理在线改进策略而不动模型权重,在 GAIA/DeepResearcher 上拿到强结果,是无梯度在线学习 agent 的代表。
最流行的开源 agent 长期记忆层(6 万+ 星),通过抽取-更新记忆条目和图记忆在 LOCOMO 上验证效果,代表记忆系统工程化落地的现状基线。
借鉴卡片盒笔记法让记忆条目自组织:新记忆写入时自动建立链接并触发旧记忆演化,探索了记忆库本身随经验动态重构的机制。
模仿海马体索引理论,用知识图谱加个性化 PageRank 做单步多跳记忆检索,展示了非参数持续知识整合可以比标准 RAG 强得多。
提出记忆流+检索+反思的经典架构,虽然主题是社会模拟,但其记忆设计成了后来几乎所有 agent 记忆系统的参照模板。
Titans 团队的后续:把模型统一看成多个不同更新频率的嵌套优化问题,提出 HOPE 架构和连续记忆系统来对抗灾难性遗忘,是 Google 给持续学习开的新范式,2025 底以来讨论度极高。
让 LLM 自己生成微调数据和更新指令、通过 RL 学会怎样最有效地更新自身权重,是把"模型自己教自己"落到权重层面的代表作,直接连通持续学习与递归自我改进两条线。
提出神经长期记忆模块,以"惊讶度"驱动在测试时在线更新权重记忆,把长期记忆做进架构而非外挂数据库,是架构级持续学习的代表作(无官方开源代码)。
给黑盒 LLM 挂一个跨查询持续读写的"小抄"记忆,推理中积累可复用的策略与代码片段,用极简机制展示了无梯度测试时学习的收益(如 GPT-4o 在 AIME 上大幅提升)。
把 RNN 隐状态本身做成一个在推理时持续做自监督梯度更新的小模型(TTT 层),为"学习发生在测试时"提供了干净的架构化表述,是 Titans 等后续工作的直接前驱。
持续学习领域引用最高的系统综述,把正则化、回放、架构扩展等方法谱系和稳定性-可塑性权衡讲得最全,是进入该方向的标准起点。
2025 年 12 月的 agent 记忆最新综述,按形态-功能-动态统一分类了 token 级/参数级/隐状态级记忆及其读写演化操作,配套持续维护的论文列表,适合作课题组追踪该方向的索引。
专门梳理 LLM agent 终身学习的综述,按感知-记忆-行动三个模块组织已有工作并给出路线图,和课题组"agent 持续学习"的问题设定最对口。
在 Minecraft 里用可执行代码构建不断增长的技能库,首次演示了 LLM agent 无梯度的终身技能积累,后续几乎所有 skill library 工作都以它为原型。
用语言化的自我反思写入情景记忆来替代梯度更新,让 agent 在多次尝试中改进,是测试时经验学习范式的奠基工作。
让 agent 从历史轨迹中自动提炼自然语言经验规则并在推理时复用,不动权重实现跨任务经验迁移,是"经验即记忆"路线的早期代表。
提出 Elastic Weight Consolidation,用 Fisher 信息约束重要权重来对抗灾难性遗忘,是持续学习领域被引最高的奠基论文;目录里的正则化/回放/架构三大方法谱系都从它讲起,课题组书单不能缺这块基石。
系统研究 agent 程序性记忆的构建、检索与更新策略(含记忆淘汰和从失败中修订),并展示记忆可从强模型迁移给弱模型,把"经验库如何维护"当成一等研究问题。
从成功轨迹中归纳可复用的工作流并注入记忆,在 Mind2Web/WebArena 上显著提升 web agent 表现,把"经验积累"具体化为工作流级别的程序性记忆。