Towards end-to-end automation of AI research
AI Scientist 全系列工作的正式期刊版,2026 年 3 月发在 Nature 上,补了新的 scaling 结果和对 AI 生成科学的局限讨论。要引用这条线的权威版本就引这篇,同时它也是主流科学界正式接纳"自动化科研系统"议题的标志性事件。
端到端的"自动科学家"系统:从提出想法、跑实验到写论文、过评审的完整闭环,以及围绕这些系统的真实战绩与争议。
定义并演进了「想法生成→写码跑实验→成稿→自审」这条基本流水线的开创性系统,以及围绕「AI 论文能否过同行评审」的公开竞逐。
AI Scientist 全系列工作的正式期刊版,2026 年 3 月发在 Nature 上,补了新的 scaling 结果和对 AI 生成科学的局限讨论。要引用这条线的权威版本就引这篇,同时它也是主流科学界正式接纳"自动化科研系统"议题的标志性事件。
v1 的重写版:去掉了人写的实验模板,改用 agentic tree search 管理实验分支,并加了 VLM 反馈来改图。它产出的一篇论文通过了 ICLR workshop 的真人评审,是"AI 全自动写的论文过同行评审"的第一个可查证案例,对研究自动化的能力边界很有参考价值。
把研究流程显式拆成文献综述、实验、报告撰写三阶段,由博士生/博后/教授等角色化 agent 分工完成,并支持人在环里给反馈。它和 Sakana 那套"全自动黑盒"是两种典型设计路线,做流程编排和人机协同对比时是必要的参照。
第一个把"想法生成→写代码跑实验→画图写论文→自动评审"整条流水线串起来并公开代码的系统,单篇成本约 15 美元。它定义了这个领域的基本架构模板(模板化实验 + LLM 评审员打分),后续几乎所有端到端系统都在跟它对标,是课题组做 AI Scientist 必读的起点。
Zochi 生成的论文(Tempest)通过 ACL 2025 主会同行评审,是 AI 产出研究首次过 A* 级会议评审;其技术报告披露了从想法到 rebuttal 的全流程,可与 Sakana v2 的 workshop 级结果对照。
先读这一组建立地图:按科研流水线环节、按自主性层级、按跨学科覆盖三种切法梳理整个 AI Scientist 范式的系统性综述。
提出 LLM 在科学发现中 Tool→Analyst→Scientist 三级自主性框架(101 引,EMNLP 2025),是理解『自动化到自主科学家』演进路线的核心综述。
站内综述里唯一按 agent 内部机制拆解的一篇(Planner / Memory / Action Space / Verifier 四件套),与其他按流水线阶段或自主性分级组织的综述正交;这套四件套已被后续工作及地球科学、化学期刊沿用。伦理与治理章节也是站内最系统的。
首篇按科研流水线四环节(假设发现、实验规划与执行、写作、评审)系统梳理 LLM 方法与基准的综述(101 引);两个方向的 agent 同时推荐了它,是按流水线环节反查方法与基准的索引入口。
以提出可被实验证伪的假设为目标、并把干实验与真实湿实验/机器人平台接成闭环的系统,回答自动科研能否产出被实验验证的科学结论。
Gemini 上搭的多智能体系统,核心是"生成-评审-进化"的假设锦标赛机制,并用测试时算力换假设质量;论文给了药物重定位、肝纤维化靶点等经过湿实验验证的案例。它代表工业界把重心放在"提出可被实验证伪的假设"而不是"写完整论文",和写论文流派的取舍值得对照。
LLM 驱动自动化科研的奠基工作之一:GPT-4 通过检索文档、写代码控制液体处理机器人,真的在实验室里跑完了 Suzuki/Sonogashira 交叉偶联反应。它把"闭环"从计算实验推到了物理实验,是讨论 AI Scientist 时无法跳过的前史。
由人类 PI 主持、一群专业 agent 开"组会"来推进课题,产出的纳米抗体经过实验合成验证有结合活性。它示范了一种更现实的分工:人定方向和把关,agent 负责跨学科讨论与设计,对课题组设计人机协同的科研流程有直接借鉴。
把文献检索(PaperQA2)、假设生成和实验数据分析(Finch)串成闭环,在干湿实验交替中找到了治疗干性 AMD 的候选药物 ripasudil。亮点是它给出的"agent 提假设、人做实验、agent 读数据再迭代"的具体工程实现,已发表在 Nature 上,代码可跑。
把科研流程拆成可替换模块、面向多任务多学科二次开发的开源框架与平台,关注工程可用性、成本与跨领域迁移。
2026 年 8 月的最新工作,指出现有系统只在文本和代码上推理、丢掉了图表、光谱、显微图像等原始科学证据,因此做成全模态、跨学科的科研 agent。这是目前离课题组最近的前沿方向之一:让自动科研系统真正接触原始数据而不是二手摘要。
模块化的多 agent 科研平台,从想法、方法、实验到成稿各是可替换的模块,并让多个学科的真人专家逐篇点评了它生成的论文(天文、生物、数学等)。这份跨学科的人评结果比自评分数可信得多,是评估这类系统真实水平的稀缺材料。
国内最完整的开源端到端科研系统之一(原名 NovelSeek),覆盖 12 个科学任务,强调假设→代码→验证的闭环和自演化的 idea 精炼。对课题组来说它是可直接二次开发的中文社区基线,跨学科任务集也方便做横向评测。
港大出的全自动科研系统(文献→想法→实现→论文),自带 Scientist-Bench 评测,是国内团队里最完整的开源 AI Scientist 实现之一;5705 stars,2025-10 最后活跃。
超越单次运行的机制:跨小时到跨周期的记忆、状态管理与自演化,以及多个 agent 实验室之间共享结果、累积知识。
面向长时程自主研究的系统,用结构化世界模型在上下文之间传递信息,号称能连续跑 12 小时、读数百篇文献并写数万行分析代码,产出带溯源引用的报告。它把关注点从"跑一次实验"转向"如何维持数天级研究连贯性",对课题组关心的长时程记忆与状态管理是关键案例。
InternAgent 的 2026 年升级版,重构成生成/验证/演化三个子系统,并显式加了深度调研、方案优化和长时程记忆三项底座能力。它反映了这一年的技术共识变化——瓶颈已经从"能不能跑通流程"转到"长时程下如何不跑偏",与课题组的持续学习方向直接相关。
给 agent 实验室之间搭了一个共享"预印本服务器",让后来的 agent 能读并在前人结果上继续做,论文报告了多实验室并行共享带来的累积提升。这条思路把单次自动科研扩展成群体知识积累,对递归自我改进的机制设计很有启发。
用真实评审、真实课题和失效清单来测量这类系统的实际水平,回答它们现在能做到什么、会以什么方式出错、对科研生态有什么风险。
OpenAI 与数学、物理、生物领域科学家合作记录 GPT-5 参与真实研究的案例集,包括对开放数学问题的实质推进,同时坦承失败案例;是评估前沿模型'加速科学'真实水位的一手材料。
第一个要求 AI 当第一作者、且主要由 AI 完成评审的学术会议,收到数百篇投稿并公开了 OpenReview 上的评审记录。它是观察 AI 生成研究真实质量分布和评审可靠性的天然实验场,也是课题组投稿或做 meta 分析的现成数据源。
主属其他方向、但与本方向直接相关的条目;彩点与角标标注其主方向。
不靠闭源大模型,而是训练了一对开源模型:CycleResearcher 写论文、CycleReviewer 打分,再用评审分数做强化学习反馈闭环。对课题组的价值在于它给出了"自动评审当奖励信号"的可复现实现,模型权重和 Research-14K 数据集都公开,是研究自我改进闭环的现成实验平台。
从 44 篇四个学科的真实论文中抽取 102 个数据分析任务并经领域科学家逐条校验,证明最强 agent 也只能独立解决约三分之一,给'AI 已能自动做科研'的宣传泼了有据的冷水。
审计型综述:144 篇初检筛到 26 篇全文,按七个维度逐系统编码成表,量化出「83% 放代码但只有 38% 放 seed 与 trace、只有 38% 说明新颖性怎么验证、9 个号称全自主的系统里 7 个只是机械闭环」。站内首个把「AI Scientist 到底披露了什么」做成可复核表格的条目,而不是叙述式盘点。
2026 年新出的端到端自主科研基准,覆盖从'重发现'已知结论到探索新发现的完整链条,代表了评测重心从单环节能力向完整科研闭环迁移的最新趋势,是课题组跟进 2026 年评测前沿的入口。
专注实验环节严谨性(可控变量、可复现、结果可信)的自动实验 agent,补上了端到端系统普遍薄弱的『实验可靠性』一环;371 stars,2025-09 最后活跃。