让 AI 做研究、改进 AI 自身

课题组围绕 AI ScientistAutoResearchAI for AI递归自我改进持续学习 五个方向整理的资料站。每个条目都过了一遍:除了读论文,还核对了代码仓库、数据集与真实运行情况——论文写得流畅自信,不代表它经得起核查;每条的「精读」页里有我们核实后的判断。

137条目 95论文 23基准 14报告与博客 5开源项目 0已精读核查 更新 2026-08-30

核查结论分四档: 扎实 声称与代码/数据一致或已被第三方复现 · 有水分 核心成立但重要声称打折 · 宣传大于实质 核心声称与实际严重不符 · 未能核查 闭源等原因查不了

类型 分级

AI Scientist

Automated end-to-end science24 条

端到端的"自动科学家"系统:从提出想法、跑实验到写论文、过评审的完整闭环,以及围绕这些系统的真实战绩与争议。

端到端系统

17
论文 2026.03 ★ 必读

Towards end-to-end automation of AI research

Sakana AI / UBC / Vector Institute / Oxford · Nature · 7.1k★

AI Scientist 全系列工作的正式期刊版,2026 年 3 月发在 Nature 上,补了新的 scaling 结果和对 AI 生成科学的局限讨论。要引用这条线的权威版本就引这篇,同时它也是主流科学界正式接纳"自动化科研系统"议题的标志性事件。

论文 2025.11 ★ 必读

Kosmos: An AI Scientist for Autonomous Discovery

Edison Scientific / FutureHouse · arXiv

面向长时程自主研究的系统,用结构化世界模型在上下文之间传递信息,号称能连续跑 12 小时、读数百篇文献并写数万行分析代码,产出带溯源引用的报告。它把关注点从"跑一次实验"转向"如何维持数天级研究连贯性",对课题组关心的长时程记忆与状态管理是关键案例。

论文 2025.04 ★ 必读

The AI Scientist-v2: Workshop-Level Automated Scientific Discovery via Agentic Tree Search

Sakana AI / UBC / Vector Institute · arXiv · 7.1k★

v1 的重写版:去掉了人写的实验模板,改用 agentic tree search 管理实验分支,并加了 VLM 反馈来改图。它产出的一篇论文通过了 ICLR workshop 的真人评审,是"AI 全自动写的论文过同行评审"的第一个可查证案例,对研究自动化的能力边界很有参考价值。

论文 2025.02 ★ 必读

Towards an AI co-scientist

Google / Google DeepMind · arXiv

Gemini 上搭的多智能体系统,核心是"生成-评审-进化"的假设锦标赛机制,并用测试时算力换假设质量;论文给了药物重定位、肝纤维化靶点等经过湿实验验证的案例。它代表工业界把重心放在"提出可被实验证伪的假设"而不是"写完整论文",和写论文流派的取舍值得对照。

论文 2025.01 ★ 必读

Agent Laboratory: Using LLM Agents as Research Assistants

AMD / Johns Hopkins · arXiv · 5.8k★

把研究流程显式拆成文献综述、实验、报告撰写三阶段,由博士生/博后/教授等角色化 agent 分工完成,并支持人在环里给反馈。它和 Sakana 那套"全自动黑盒"是两种典型设计路线,做流程编排和人机协同对比时是必要的参照。

论文 2024.11 ★ 必读

CycleResearcher: Improving Automated Research via Automated Review

Westlake University NLP Lab · ICLR 2025 · 401★

不靠闭源大模型,而是训练了一对开源模型:CycleResearcher 写论文、CycleReviewer 打分,再用评审分数做强化学习反馈闭环。对课题组的价值在于它给出了"自动评审当奖励信号"的可复现实现,模型权重和 Research-14K 数据集都公开,是研究自我改进闭环的现成实验平台。

论文 2024.08 ★ 必读

The AI Scientist: Towards Fully Automated Open-Ended Scientific Discovery

Sakana AI / UBC / Oxford · arXiv · 14.5k★

第一个把"想法生成→写代码跑实验→画图写论文→自动评审"整条流水线串起来并公开代码的系统,单篇成本约 15 美元。它定义了这个领域的基本架构模板(模板化实验 + LLM 评审员打分),后续几乎所有端到端系统都在跟它对标,是课题组做 AI Scientist 必读的起点。

论文 2026.08

OmniScientist: An Omni-Modal Omni-Discipline AI Scientist

National University of Singapore 等 · arXiv · 139★

2026 年 8 月的最新工作,指出现有系统只在文本和代码上推理、丢掉了图表、光谱、显微图像等原始科学证据,因此做成全模态、跨学科的科研 agent。这是目前离课题组最近的前沿方向之一:让自动科研系统真正接触原始数据而不是二手摘要。

论文 2026.02

InternAgent-1.5: A Unified Agentic Framework for Long-Horizon Autonomous Scientific Discovery

Shanghai AI Laboratory · arXiv · 1.4k★

InternAgent 的 2026 年升级版,重构成生成/验证/演化三个子系统,并显式加了深度调研、方案优化和长时程记忆三项底座能力。它反映了这一年的技术共识变化——瓶颈已经从"能不能跑通流程"转到"长时程下如何不跑偏",与课题组的持续学习方向直接相关。

论文 2025.10

The Denario project: Deep knowledge AI agents for scientific discovery

Flatiron Institute / Astropilot AI 等多机构合作 · arXiv · 590★

模块化的多 agent 科研平台,从想法、方法、实验到成稿各是可替换的模块,并让多个学科的真人专家逐篇点评了它生成的论文(天文、生物、数学等)。这份跨学科的人评结果比自评分数可信得多,是评估这类系统真实水平的稀缺材料。

论文 2025.07

The Virtual Lab of AI agents designs new SARS-CoV-2 nanobodies

Stanford University (Zou Group) / Chan Zuckerberg Biohub · Nature · 728★

由人类 PI 主持、一群专业 agent 开"组会"来推进课题,产出的纳米抗体经过实验合成验证有结合活性。它示范了一种更现实的分工:人定方向和把关,agent 负责跨学科讨论与设计,对课题组设计人机协同的科研流程有直接借鉴。

论文 2025.05

Robin: A multi-agent system for automating scientific discovery

FutureHouse · Nature (2026) / arXiv · 691★

把文献检索(PaperQA2)、假设生成和实验数据分析(Finch)串成闭环,在干湿实验交替中找到了治疗干性 AMD 的候选药物 ripasudil。亮点是它给出的"agent 提假设、人做实验、agent 读数据再迭代"的具体工程实现,已发表在 Nature 上,代码可跑。

实验自动化

2
论文 2023.12 ★ 必读

Autonomous chemical research with large language models (Coscientist)

Carnegie Mellon University (Gomes Group) · Nature · 209★

LLM 驱动自动化科研的奠基工作之一:GPT-4 通过检索文档、写代码控制液体处理机器人,真的在实验室里跑完了 Suzuki/Sonogashira 交叉偶联反应。它把"闭环"从计算实验推到了物理实验,是讨论 AI Scientist 时无法跳过的前史。

多智能体协作

1
论文 2025.03

AgentRxiv: Towards Collaborative Autonomous Research

Johns Hopkins / Stanford · arXiv

给 agent 实验室之间搭了一个共享"预印本服务器",让后来的 agent 能读并在前人结果上继续做,论文报告了多实验室并行共享带来的累积提升。这条思路把单次自动科研扩展成群体知识积累,对递归自我改进的机制设计很有启发。

社区/会议

1
项目 2025.10

Agents4Science 2025: Open Conference of AI Agents for Science

Stanford University · Conference

第一个要求 AI 当第一作者、且主要由 AI 完成评审的学术会议,收到数百篇投稿并公开了 OpenReview 上的评审记录。它是观察 AI 生成研究真实质量分布和评审可靠性的天然实验场,也是课题组投稿或做 meta 分析的现成数据源。

能力实证

1

综述

1
论文 2025.10 背景

A Survey of AI Scientists

多机构合作 · arXiv

对 AI Scientist 这一范式做系统梳理的综述,按能力和架构给出分类框架。适合课题组新人快速建立地图、以及写相关工作时定位自己的系统属于哪一类。

风险与评估

1

AutoResearch

Automating the research pipeline43 条

把科研流水线拆开逐环节自动化:想法生成、文献调研、实验执行、论文写作与自动评审——以及度量这一切的基准。

评测基准

21
基准 2025.05 ★ 必读

EXP-Bench: Can AI Conduct AI Research Experiments?

University of Michigan · NeurIPS 2025 D&B · 371★

从 51 篇顶会论文半自动抽取 461 个完整研究实验(设计-实现-执行-结论),端到端可执行且正确的比例仅 0.5%-1.4%,是目前对'AI 能否独立做 AI 研究实验'最直接、最悲观也最有信息量的度量。

基准 2025.01 背景

Humanity's Last Exam

CAIS / Scale AI · arXiv · 1.7k★

2500 道由近千名领域专家出的封闭式前沿学术难题,测的是知识而非做研究的过程能力,但作为'学术能力天花板'基准被广泛引用,是理解科研 agent 评测格局的必要背景。

深度调研

6
报告 2025.10 ★ 必读

Tongyi DeepResearch Technical Report

Alibaba (通义) · arXiv · 19.9k★

首个性能对标 OpenAI Deep Research 的全开源深度调研模型(30B-A3B MoE),完整公开 agentic mid-training + RL post-training 和合成数据流水线,是研究'如何训练调研 agent'而不只是'如何提示'的最重要开放参照。

博客 2025.02 ★ 必读

Introducing Deep Research (OpenAI)

OpenAI · OpenAI blog

把'多步网络调研并产出带引用长报告'做成产品的开山之作(基于端到端 RL 训练的 o3 变体,HLE 26.6%),定义了 deep research 这一任务范式,之后所有开源复现和评测基准都以它为参照系。

项目 2023.07 ★ 必读

GPT Researcher

开源社区 (Assaf Elovic) · GitHub · 29.2k★

最早也最流行的开源自主调研 agent(29k+ stars,2026 年仍活跃维护),planner-executor 并行架构生成带引用的调研报告,早于 OpenAI Deep Research 一年半,是搭建自有深度调研流水线的首选起点。

项目 2025.02

LangChain Open Deep Research

LangChain · GitHub · 12.7k★

LangGraph 官方的开源 deep research 实现,监督者-研究员多 agent 架构写得很清楚,适合当参考架构读;12678 stars,但 2026-08 已归档,后续由 langchain-ai/deepagents 接棒。

项目 2025.02

smolagents Open Deep Research

Hugging Face · GitHub · 29.1k★

HF 用 24 小时复现 OpenAI Deep Research 的开源版本(smolagents 的 examples/open_deep_research),在 GAIA 上打出当时开源最好成绩,代码极简适合改造;smolagents 本体 29050 stars,2026-08 仍活跃。

想法生成

4

实验执行

3
论文 2025.02 ★ 必读

AIDE: AI-Driven Exploration in the Space of Code

Weco AI · arXiv · 1.5k★

把机器学习实验建模为代码空间中的树搜索(起草-调试-改进),是 MLE-bench 上长期的最强基线,被 OpenAI/METR 等用作评测脚手架,后续大量 ML 实验 agent(ML-Master、AIRA 等)都在其框架上改进,实验执行环节必读。

文献调研

3

自动评审

3
论文 2026.05

Stop Automating Peer Review Without Rigorous Evaluation

University of Zurich 等 · arXiv (position paper)

2026 年的立场论文,系统论证当前 AI 评审系统缺乏严格评估、不应直接用于产出评审意见,梳理了自动评审可靠性研究的证据缺口,为课题组界定'评审 agent 什么程度可信'提供批判性框架。

平台/工具链

2
博客 2026 背景

Claude Science: an AI workbench for scientists

Anthropic · Anthropic Blog

Anthropic 2026 年推出的科研工作台,把文献、数据分析和实验规划整合进 Claude;与 FutureHouse 平台、Deep Research 同属'科研 agent 产品化'趋势,可作产品形态对照。

端到端流水线

1

AI for AI

AI discovering better AI27 条

用 AI 改进 AI 本身:自动发现更好的算法、模型架构、GPU kernel、奖励函数与 agent 设计。

算法发现

10
项目 2025.05

OpenEvolve: Open-source implementation of AlphaEvolve

codelion(社区) · GitHub · 7.3k★

DeepMind AlphaEvolve(LLM 驱动的进化式程序/算法发现)的社区开源复现,已复现出多个超越基线的算法结果,是课题组做算法自动发现最容易上手的框架;7289 stars,2026-07 仍活跃。

Prompt 优化

5
论文 2024.06 ★ 必读

TextGrad: Automatic "Differentiation" via Text

Stanford (Zou Group) · Nature (2025) / arXiv · 3.7k★

把'自然语言反馈'类比成梯度,对复合 AI 系统(prompt、代码、分子设计、诊疗方案)做端到端文本反向传播优化,2025 年以 Optimizing generative AI by backpropagating language model feedback 发表于 Nature 正刊。它是 AI 优化 AI 系统这条线上被主流科学界正式接纳的代表作,与 OPRO/GEPA 构成必读三件套。

Agent 自动设计

3
论文 2024.10

AFlow: Automating Agentic Workflow Generation

DeepWisdom / MetaGPT 团队 · ICLR 2025 (Oral) · 582★

把 agent workflow 建模成代码图、用 MCTS 自动搜索,比 ADAS 更工程化且成本敏感(小模型跑出的 workflow 打平大模型),是 workflow 级自动设计的代表实现。

实证度量

2

Kernel 自动优化

2

权重生成与自适应

2

评测基准

2

架构搜索

1

Recursive Self-Improvement

Systems that modify themselves22 条

修改自身代码从而变强的 agent:从 Gödel Machine 的理论到 Darwin Gödel Machine 的工程实现,以及"自我提升到底有没有天花板"的实证分析。

自我修改代码

6
论文 2025.04

A Self-Improving Coding Agent (SICA)

University of Bristol · ICLR 2025 Workshop / arXiv · 390★

一个真的在编辑自己代码库的编码 agent,在 SWE-bench Verified 子集上把自己从 17% 提到 53%,代码完全开源可复跑,是课题组上手做自改写实验最实际的起点之一。

自博弈训练

3

自举训练

2
论文 2022.03 ★ 必读

STaR: Bootstrapping Reasoning With Reasoning

Stanford / Google · NeurIPS 2022 · 231★

让模型用自己生成并被答案筛选过的推理链反复微调自己,是'模型自己造训练数据提升自己'这一整条路线(后续 o1 类方法、self-play RL)的起点。

论文 2024.01

Self-Rewarding Language Models

Meta · ICML 2024

模型同时当选手和裁判,用 LLM-as-judge 给自己出的回答打分并做 DPO 迭代,展示了奖励信号本身也能随训练一起提升——self-improvement 闭环里'评价者也在进化'的代表作。

一线 lab 立场

1

研发自动化度量

2
论文 2026.03

Measuring AI R&D Automation

Centre for the Governance of AI (GovAI) · arXiv

系统梳理'AI 自动化 AI 研发到什么程度'的可测指标(实验型、调查型等),回答的正是 RSI 是否已经在真实研发流程中产生加速度这一课题组关心的问题。

自提升极限分析

2

takeoff 情景推演

1
报告 2025.04

AI 2027

AI Futures Project · 独立报告

Kokotajlo 等人以'AI 自动化 AI 研发'为核心机制,逐月推演到超人 AI 的具体情景,附带可复算的时间线与算力模型;是 RSI/takeoff 讨论中被引用最多的情景分析,也引发大量方法论批评。

综述

1
论文 2025.08

A Comprehensive Survey of Self-Evolving AI Agents: A New Paradigm Bridging Foundation Models and Lifelong Agentic Systems

EvoAgentX 团队等多机构 · arXiv · 2.5k★

系统梳理'自进化 agent'的统一框架(优化什么、何时优化、如何优化),把 prompt/工作流/记忆/权重各层次的自改进工作串成一张图,正好桥接课题组 RSI 与持续学习两条线;rsi 类目此前没有综述,新人入门缺地图。配套 awesome 列表持续维护(2.4k stars,仓库已迁移至 ANative-Lab)。

理论分析

2

推理时自提升

1

进化式代码演化

1

Continuous Learning

Learning that never stops21 条

让模型与 agent 在部署后持续积累能力:记忆系统、经验库、技能库、测试时训练与持续预训练。

记忆机制

7
论文 2025.02

A-MEM: Agentic Memory for LLM Agents

Rutgers University · NeurIPS 2025 · 1.2k★

借鉴卡片盒笔记法让记忆条目自组织:新记忆写入时自动建立链接并触发旧记忆演化,探索了记忆库本身随经验动态重构的机制。

测试时学习

5
论文 2025.06 ★ 必读

Self-Adapting Language Models (SEAL)

MIT · NeurIPS 2025 · 1.9k★

让 LLM 自己生成微调数据和更新指令、通过 RL 学会怎样最有效地更新自身权重,是把"模型自己教自己"落到权重层面的代表作,直接连通持续学习与递归自我改进两条线。

论文 2025.01 ★ 必读

Titans: Learning to Memorize at Test Time

Google Research · arXiv

提出神经长期记忆模块,以"惊讶度"驱动在测试时在线更新权重记忆,把长期记忆做进架构而非外挂数据库,是架构级持续学习的代表作(无官方开源代码)。

综述

3
论文 2025.12

Memory in the Age of AI Agents: A Survey

Fudan University 等 · arXiv · 2.4k★

2025 年 12 月的 agent 记忆最新综述,按形态-功能-动态统一分类了 token 级/参数级/隐状态级记忆及其读写演化操作,配套持续维护的论文列表,适合作课题组追踪该方向的索引。

经验积累

3

经典方法

1
论文 2016.12 ★ 必读

Overcoming catastrophic forgetting in neural networks (EWC)

DeepMind · PNAS 2017

提出 Elastic Weight Consolidation,用 Fisher 信息约束重要权重来对抗灾难性遗忘,是持续学习领域被引最高的奠基论文;目录里的正则化/回放/架构三大方法谱系都从它讲起,课题组书单不能缺这块基石。

程序性记忆

2
论文 2025.08

Memp: Exploring Agent Procedural Memory

Zhejiang University / Alibaba · arXiv · 35★

系统研究 agent 程序性记忆的构建、检索与更新策略(含记忆淘汰和从失败中修订),并展示记忆可从强模型迁移给弱模型,把"经验库如何维护"当成一等研究问题。

论文 2024.09

Agent Workflow Memory

CMU · arXiv · 463★

从成功轨迹中归纳可复用的工作流并注入记忆,在 Mind2Web/WebArena 上显著提升 web agent 表现,把"经验积累"具体化为工作流级别的程序性记忆。