AI ScientistAutomated end-to-end science

端到端的"自动科学家"系统:从提出想法、跑实验到写论文、过评审的完整闭环,以及围绕这些系统的真实战绩与争议。

27条目 7必读 23论文1项目2报告1博客
类型 分级 核查 标签

先读这三篇

进本方向的最短路径,由课题组指定
  1. 1The AI Scientist: Towards Fully Automated Open-Ended Scientific Discovery端到端流水线奠基 · Sakana AI / UBC / Oxford · 2024Sakana AI 把"生成想法→写代码跑实验→写论文→LLM 自动评审"整条流水线首次串通并开源,每篇论文成本约 10-15 美元
  2. 2Towards end-to-end automation of AI research端到端流水线奠基 · Sakana AI / UBC / Vector Institute / Oxford · 2026Sakana AI 等把 AI Scientist v1+v2 整合成期刊版发在 Nature 651(2026-03):系统全自动完成选题、写码、实验…
  3. 3Towards an AI co-scientist假设生成与干湿闭环 · Google / Google DeepMind · 2025Google 在 Gemini 2.0 上搭的六智能体系统,核心是「生成-评审-进化」+ Elo 锦标赛,让假设在自我博弈中被反复评审和改写

端到端流水线奠基

7

定义并演进了「想法生成→写码跑实验→成稿→自审」这条基本流水线的开创性系统,以及围绕「AI 论文能否过同行评审」的公开竞逐。

论文 2026.03 有水分 ★ 必读

Towards end-to-end automation of AI research

Sakana AI / UBC / Vector Institute / Oxford · Nature · 7.1k★

AI Scientist 全系列工作的正式期刊版,2026 年 3 月发在 Nature 上,补了新的 scaling 结果和对 AI 生成科学的局限讨论。要引用这条线的权威版本就引这篇,同时它也是主流科学界正式接纳"自动化科研系统"议题的标志性事件。

论文 2025.04 有水分 ★ 必读

The AI Scientist-v2: Workshop-Level Automated Scientific Discovery via Agentic Tree Search

Sakana AI / UBC / Vector Institute · arXiv · 7.1k★

v1 的重写版:去掉了人写的实验模板,改用 agentic tree search 管理实验分支,并加了 VLM 反馈来改图。它产出的一篇论文通过了 ICLR workshop 的真人评审,是"AI 全自动写的论文过同行评审"的第一个可查证案例,对研究自动化的能力边界很有参考价值。

论文 2025.01 有水分 ★ 必读

Agent Laboratory: Using LLM Agents as Research Assistants

AMD / Johns Hopkins · arXiv · 5.8k★

把研究流程显式拆成文献综述、实验、报告撰写三阶段,由博士生/博后/教授等角色化 agent 分工完成,并支持人在环里给反馈。它和 Sakana 那套"全自动黑盒"是两种典型设计路线,做流程编排和人机协同对比时是必要的参照。

论文 2024.08 有水分 ★ 必读

The AI Scientist: Towards Fully Automated Open-Ended Scientific Discovery

Sakana AI / UBC / Oxford · arXiv · 14.5k★

第一个把"想法生成→写代码跑实验→画图写论文→自动评审"整条流水线串起来并公开代码的系统,单篇成本约 15 美元。它定义了这个领域的基本架构模板(模板化实验 + LLM 评审员打分),后续几乎所有端到端系统都在跟它对标,是课题组做 AI Scientist 必读的起点。

背景与延伸

全景综述与路线梳理

6

先读这一组建立地图:按科研流水线环节、按自主性层级、按跨学科覆盖三种切法梳理整个 AI Scientist 范式的系统性综述。

论文 2025.03 扎实

Towards Scientific Intelligence: A Survey of LLM-based Scientific Agents

中科院自动化所

站内综述里唯一按 agent 内部机制拆解的一篇(Planner / Memory / Action Space / Verifier 四件套),与其他按流水线阶段或自主性分级组织的综述正交;这套四件套已被后续工作及地球科学、化学期刊沿用。伦理与治理章节也是站内最系统的。

背景与延伸

假设生成与干湿闭环

4

以提出可被实验证伪的假设为目标、并把干实验与真实湿实验/机器人平台接成闭环的系统,回答自动科研能否产出被实验验证的科学结论。

论文 2025.02 有水分 ★ 必读

Towards an AI co-scientist

Google / Google DeepMind · arXiv

Gemini 上搭的多智能体系统,核心是"生成-评审-进化"的假设锦标赛机制,并用测试时算力换假设质量;论文给了药物重定位、肝纤维化靶点等经过湿实验验证的案例。它代表工业界把重心放在"提出可被实验证伪的假设"而不是"写完整论文",和写论文流派的取舍值得对照。

论文 2023.12 有水分 ★ 必读

Autonomous chemical research with large language models (Coscientist)

Carnegie Mellon University (Gomes Group) · Nature · 209★

LLM 驱动自动化科研的奠基工作之一:GPT-4 通过检索文档、写代码控制液体处理机器人,真的在实验室里跑完了 Suzuki/Sonogashira 交叉偶联反应。它把"闭环"从计算实验推到了物理实验,是讨论 AI Scientist 时无法跳过的前史。

论文 2025.07 未能核查

The Virtual Lab of AI agents designs new SARS-CoV-2 nanobodies

Stanford University (Zou Group) / Chan Zuckerberg Biohub · Nature · 728★

由人类 PI 主持、一群专业 agent 开"组会"来推进课题,产出的纳米抗体经过实验合成验证有结合活性。它示范了一种更现实的分工:人定方向和把关,agent 负责跨学科讨论与设计,对课题组设计人机协同的科研流程有直接借鉴。

论文 2025.05 有水分

Robin: A multi-agent system for automating scientific discovery

FutureHouse · Nature (2026) / arXiv · 691★

把文献检索(PaperQA2)、假设生成和实验数据分析(Finch)串成闭环,在干湿实验交替中找到了治疗干性 AMD 的候选药物 ripasudil。亮点是它给出的"agent 提假设、人做实验、agent 读数据再迭代"的具体工程实现,已发表在 Nature 上,代码可跑。

模块化开源框架

4

把科研流程拆成可替换模块、面向多任务多学科二次开发的开源框架与平台,关注工程可用性、成本与跨领域迁移。

论文 2026.08 有水分

OmniScientist: An Omni-Modal Omni-Discipline AI Scientist

National University of Singapore 等 · arXiv · 139★

2026 年 8 月的最新工作,指出现有系统只在文本和代码上推理、丢掉了图表、光谱、显微图像等原始科学证据,因此做成全模态、跨学科的科研 agent。这是目前离课题组最近的前沿方向之一:让自动科研系统真正接触原始数据而不是二手摘要。

论文 2025.10 扎实

The Denario project: Deep knowledge AI agents for scientific discovery

Flatiron Institute / Astropilot AI 等多机构合作 · arXiv · 590★

模块化的多 agent 科研平台,从想法、方法、实验到成稿各是可替换的模块,并让多个学科的真人专家逐篇点评了它生成的论文(天文、生物、数学等)。这份跨学科的人评结果比自评分数可信得多,是评估这类系统真实水平的稀缺材料。

论文 2025.05 有水分

InternAgent (NovelSeek): When Agent Becomes the Scientist -- Building Closed-Loop System from Hypothesis to Verification

Shanghai AI Laboratory · arXiv · 1.4k★

国内最完整的开源端到端科研系统之一(原名 NovelSeek),覆盖 12 个科学任务,强调假设→代码→验证的闭环和自演化的 idea 精炼。对课题组来说它是可直接二次开发的中文社区基线,跨学科任务集也方便做横向评测。

论文 2025.05 有水分

AI-Researcher: Autonomous Scientific Innovation

HKU (HKUDS) · NeurIPS 2025 · 5.7k★

港大出的全自动科研系统(文献→想法→实现→论文),自带 Scientist-Bench 评测,是国内团队里最完整的开源 AI Scientist 实现之一;5705 stars,2025-10 最后活跃。

长时程与群体积累

3

超越单次运行的机制:跨小时到跨周期的记忆、状态管理与自演化,以及多个 agent 实验室之间共享结果、累积知识。

论文 2025.11 有水分 ★ 必读

Kosmos: An AI Scientist for Autonomous Discovery

Edison Scientific / FutureHouse · arXiv

面向长时程自主研究的系统,用结构化世界模型在上下文之间传递信息,号称能连续跑 12 小时、读数百篇文献并写数万行分析代码,产出带溯源引用的报告。它把关注点从"跑一次实验"转向"如何维持数天级研究连贯性",对课题组关心的长时程记忆与状态管理是关键案例。

论文 2026.02 有水分

InternAgent-1.5: A Unified Agentic Framework for Long-Horizon Autonomous Scientific Discovery

Shanghai AI Laboratory · arXiv · 1.4k★

InternAgent 的 2026 年升级版,重构成生成/验证/演化三个子系统,并显式加了深度调研、方案优化和长时程记忆三项底座能力。它反映了这一年的技术共识变化——瓶颈已经从"能不能跑通流程"转到"长时程下如何不跑偏",与课题组的持续学习方向直接相关。

论文 2025.03 有水分

AgentRxiv: Towards Collaborative Autonomous Research

Johns Hopkins / Stanford · arXiv兼属 RSI

给 agent 实验室之间搭了一个共享"预印本服务器",让后来的 agent 能读并在前人结果上继续做,论文报告了多实验室并行共享带来的累积提升。这条思路把单次自动科研扩展成群体知识积累,对递归自我改进的机制设计很有启发。

能力水位与风险

3

用真实评审、真实课题和失效清单来测量这类系统的实际水平,回答它们现在能做到什么、会以什么方式出错、对科研生态有什么风险。

报告 2025.11 有水分

Early science acceleration experiments with GPT-5

OpenAI · arXiv

OpenAI 与数学、物理、生物领域科学家合作记录 GPT-5 参与真实研究的案例集,包括对开放数学问题的实质推进,同时坦承失败案例;是评估前沿模型'加速科学'真实水位的一手材料。

项目 2025.10 扎实

Agents4Science 2025: Open Conference of AI Agents for Science

Stanford University · Conference

第一个要求 AI 当第一作者、且主要由 AI 完成评审的学术会议,收到数百篇投稿并公开了 OpenReview 上的评审记录。它是观察 AI 生成研究真实质量分布和评审可靠性的天然实验场,也是课题组投稿或做 meta 分析的现成数据源。

背景与延伸

兼收

5

主属其他方向、但与本方向直接相关的条目;彩点与角标标注其主方向。

论文 2024.11 有水分 ★ 必读

CycleResearcher: Improving Automated Research via Automated Review

Westlake University NLP Lab · ICLR 2025 · 401★主属 AutoResearch

不靠闭源大模型,而是训练了一对开源模型:CycleResearcher 写论文、CycleReviewer 打分,再用评审分数做强化学习反馈闭环。对课题组的价值在于它给出了"自动评审当奖励信号"的可复现实现,模型权重和 Research-14K 数据集都公开,是研究自我改进闭环的现成实验平台。

论文 2026.06 扎实

Autonomous Research Agents: A Survey of AI Scientists and the Verification Gap

主属 AutoResearch

审计型综述:144 篇初检筛到 26 篇全文,按七个维度逐系统编码成表,量化出「83% 放代码但只有 38% 放 seed 与 trace、只有 38% 说明新颖性怎么验证、9 个号称全自主的系统里 7 个只是机械闭环」。站内首个把「AI Scientist 到底披露了什么」做成可复核表格的条目,而不是叙述式盘点。