← 返回资料站  /  AI Scientist
论文 端到端系统 ★ 必读

Towards end-to-end automation of AI research

迈向 AI 研究的端到端自动化(AI Scientist 的 Nature 正式版)
一句话Sakana AI 等把 AI Scientist v1+v2 整合成期刊版发在 Nature 651(2026-03):系统全自动完成选题、写码、实验、画图、写稿、自审,3 篇全 AI 生成论文投 ICLR 2025 ICBINB workshop,1 篇拿到 6/7/6(均分 6.33)过线后按协议撤稿——是首篇通过正规同行评审的全 AI 论文,但 venue 是接收率约 65-70% 的 workshop,且每个环节靠人工择优(如 136 个 idea 挑 1 个)。

这是什么

这是 AI Scientist 系列(v1 2024-08、v2 2025-04 两篇 arXiv 预印本)的正式期刊版本,2026 年 3 月发表于 Nature 651: 914-919,是主流科学期刊第一次以研究论文形式接纳'端到端自动化科研系统'这个议题。注意一个常见误读:Nature 上这篇论文本身是人写的、描述系统的论文,不是 AI 写的论文——AI 写的那篇 workshop 论文按预定协议撤稿了,从未正式发表。

系统覆盖机器学习研究的完整生命周期:idea 生成与查新、实验规划与代码实现、结果分析与画图、LaTeX 成稿、自动评审。论文评估了两种模式:Template-Based(给人写的代码模板,沿线性计划跑实验,即 v1)和 Template-Free(从零写码,用 agentic tree search 消耗更多 test-time compute 换取开放式探索,即 v2)。相比预印本,期刊版补了两条 scaling 结果:生成论文质量随底层模型发布日期单调上升(R²=0.517, p<0.001),随 tree search 节点数增加而上升(4→32 个节点,自动评审分 3.3→3.9)。

最受关注的实证是'AI Scientist 图灵测试':经 ICLR 2025 领导层、ICBINB workshop 组织者同意并拿到 UBC IRB 批文(H24-02652)后,把 3 篇全 AI 生成论文混入该 workshop 的 43 篇投稿盲审。其中一篇报告负结果的论文(Compositional Regularization)拿到 6/7/6,超过平均接收线、位列全部投稿前 45%;另外两篇没过线。所有 AI 投稿无论结果一律撤稿,以避免在学界建立披露规范之前开创发表先例。

系统总览。A:四阶段工作流(ideation → 四段式 tree search 实验 → 写稿 → AI 评审),每个实验 stage 选最优 checkpoint 作为下一 stage 的种子。B:期刊版的核心新结果——生成论文的自动评审分随底层模型发布日期(2023-07 到 2025-07)持续上升,R²=0.517。C:Automated Reviewer 对 ICLR 接收决定的 balanced accuracy(约 0.66-0.69)与人类评审一致性(虚线)相当,cutoff 前后差距很小。
系统总览。A:四阶段工作流(ideation → 四段式 tree search 实验 → 写稿 → AI 评审),每个实验 stage 选最优 checkpoint 作为下一 stage 的种子。B:期刊版的核心新结果——生成论文的自动评审分随底层模型发布日期(2023-07 到 2025-07)持续上升,R²=0.517。C:Automated Reviewer 对 ICLR 接收决定的 balanced accuracy(约 0.66-0.69)与人类评审一致性(虚线)相当,cutoff 前后差距很小。

机制与做法

四阶段流水线

Phase 1 ideation:LLM 在用户指定的子领域内迭代生长一个 idea 档案库(借鉴 open-endedness 算法的 archive 思路),每个 idea 含标题、动机、实验计划和自评分(interestingness/novelty/feasibility 各 1-10);接 Semantic Scholar API 查新,与已有文献语义相似度过高的 idea 直接丢弃。Phase 2 实验执行(下节详述)。Phase 3 写稿:v1 用 Aider 逐节填充会议 LaTeX 模板;v2 改为 reasoning 模型(o1)直接生成 LaTeX 加多轮 reflection,引用部分查 Semantic Scholar 最多 20 轮。Phase 4 自动评审。

Agentic tree search 细节。A:四个 stage 各自长树,节点分 buggy/非 buggy,另有 hyperparameter、ablation、replication、aggregation 特化节点。B:一次真实 run 的树(题目:抑制快学习特征以避免 shortcut 依赖),黑线是各 stage 最优路径,注释显示节点在干什么(修训练崩溃、引入 Waterbirds 数据集等)。C:test-time compute scaling——实验节点从 4 个加到 32 个,自动评审分从 3.30 升到 3.93。
Agentic tree search 细节。A:四个 stage 各自长树,节点分 buggy/非 buggy,另有 hyperparameter、ablation、replication、aggregation 特化节点。B:一次真实 run 的树(题目:抑制快学习特征以避免 shortcut 依赖),黑线是各 stage 最优路径,注释显示节点在干什么(修训练崩溃、引入 Waterbirds 数据集等)。C:test-time compute scaling——实验节点从 4 个加到 32 个,自动评审分从 3.30 升到 3.93。

Template-Free 的 agentic tree search(v2 核心)

实验阶段由一个 experiment progress manager 划成四个 stage:Preliminary Investigation(跑通原型即止)→ Hyperparameter Tuning(训练曲线收敛且在至少 2 个数据集上跑通即止)→ Research Agenda Execution → Ablation Studies(后两者花完预算即止)。每个 stage 内部跑并行 tree search:Claude Sonnet 4 生成计划和代码,立即执行,报错标记 buggy;成功则画图,图交给 VLM(GPT-4o)批评,图有问题也标 buggy。扩展节点时按预设概率优先修 buggy 节点,否则用 GPT-4o 做 best-first 选择去精化非 buggy 节点;o3 负责代码 critique。另有四类特化节点:hyperparameter、ablation、replication(换种子重跑算均值方差)、aggregation(汇总画图)。每节点实验限时 1 小时,stage 间由 LLM evaluator 选最优叶子作下一 stage 根节点。整条 pipeline 跑数小时到 15+ 小时,README 报的成本约 $15-20(实验)+ $5(写稿)每次。tree search 实现基于 WecoAI 的 AIDE。

被接收的那篇全 AI 论文(Compositional Regularization,6/7/6 分)选页:标题摘要、方法(LSTM + 隐状态平滑正则项)、结果图和参考文献全部由系统生成。注意它报告的是负结果——正则项没有带来预期的组合泛化提升——恰好切中该 workshop 征集负结果的主题。
被接收的那篇全 AI 论文(Compositional Regularization,6/7/6 分)选页:标题摘要、方法(LSTM + 隐状态平滑正则项)、结果图和参考文献全部由系统生成。注意它报告的是负结果——正则项没有带来预期的组合泛化提升——恰好切中该 workshop 征集负结果的主题。

Automated Reviewer 及其校验

评审器用 o4-mini,按 NeurIPS 官方 reviewer guidelines 出结构化评审(soundness/presentation/contribution/overall/confidence + 优缺点列表 + accept/reject),5 份独立评审再由 LLM 扮演 Area Chair 出 meta-review。校验用 OpenReview 公开的 ICLR 接收决定:balanced accuracy 0.69(2017-2024 论文)/0.66(2025 cutoff 之后的'干净'数据),与 NeurIPS 2021 人类评审一致性实验的 0.66 相当,F1 0.62 高于人类组间的 0.49。他们专门做了数据污染检查(cutoff 前后只差 3 个点)——这个检查设计值得抄。但注意 FPR 0.45-0.52,远高于人类的 0.17:它显著偏松,把该拒的论文放行的概率约是人类的 3 倍。

典型失败模式实录:(a) citation key 错配导致正文出现 (?) 占位;(b) 图路径引用错误,图框里只剩文件名;(c) 页数不符合 workshop 4 页限制;(d) 正文与附录重复贴同一张图。这些废稿在人工筛选阶段被过滤——理解'3 篇投稿'背后的分母时该看这张图。
典型失败模式实录:(a) citation key 错配导致正文出现 (?) 占位;(b) 图路径引用错误,图框里只剩文件名;(c) 页数不符合 workshop 4 页限制;(d) 正文与附录重复贴同一张图。这些废稿在人工筛选阶段被过滤——理解'3 篇投稿'背后的分母时该看这张图。

Workshop 实验的筛选流程(理解'战绩'的关键)

最终 3 篇投稿是人工三关筛出来的:Idea Alignment(是否切题且当前 LLM 能力可实现)、Experimental Execution(代码报错、实验设计不忠实于假设、stage 1/2 没有成功节点的全过滤)、Paper Polish(查 [?] 引用占位符、图路径裸露、超页、正文附录重复图)。附录 Table 给了漏斗数字:Compositional Regularization 一篇从 25 个 idea、8 次实验尝试、24 份 write-up 里各选 1;Label Noise 是 25/6/7 选 1;Pest Detection 从 136 个 applied idea、16 次实验、6 份 write-up 选 1。论文的辩护是:即使不筛,这几篇也会以完全相同的形式被生成出来,只是混在更多废稿里;每篇论文本身从 idea 到 PDF 无人改动。

关键结果

实证核查

有水分核心事实成立且论文对局限披露得异常坦诚(70% 接收率、人工筛选漏斗、撤稿协议全写在正文/附录里),但'端到端自动化'的战绩离开人工择优和低门槛 venue 就不成立,且开源代码的工程可靠性被独立评测打了折扣。作为这条线的权威引用版本没问题,复述其结论时要带上限定语。
'首篇通过同行评审的全 AI 生成论文'(abstract:manuscript passes the first round of peer review at a major ML conference workshop)
事件属实但语境要全:venue 是接收率约 70% 的 ICBINB workshop(论文 Limitations 自己承认,workshop 官网 sites.google.com/view/icbinb-2025/papers 列出 28 篇接收/43 篇评审≈65%;第三方 Pebblous fact-check 报的 32.6% 是拿 PMLR v296 的 14 篇 opt-in proceedings 误算的),3 篇只中 1 篇,且按预定协议撤稿、从未正式发表。同一篇 fact-check 判定媒体流传的'AI 在 Nature 发论文'为 FALSE——Nature 这篇是人写的系统论文。
端到端全自动,'entire scientific workflow ... performed without any human modification'
单篇论文的生成链路确实无人改动,但选优全靠人:附录 app:filtering 的 Table 显示三篇投稿分别是从 25/25/136 个 idea、8/6/16 次实验尝试、24/7/6 份 write-up 中人工各挑 1 篇,筛选标准包括'代码是否忠实实现了 idea'这种实质性科学判断。论文诚实披露并辩称不筛也会生成同样的稿子,这站得住,但'自动化'指的是流水线每步自动,不含质量把关。
Automated Reviewer 达到人类评审水平(balanced accuracy 0.69 vs 0.66)
数字属实(正文 Table 1),但同表 FPR 0.45-0.52 vs 人类 0.17:它接收烂论文的概率约为人类 3 倍,当质量守门员会系统性放水;且对照组是 NeurIPS 2021 一致性实验、测试集是 ICLR 论文,分布不一致(论文自己注明 'this comparison is not exact')。用它来支撑'论文质量随模型进步'的趋势没问题,绝对分数别当真。
代码开源可复现(Code Availability:v1 和 v2 仓库,Apache 2.0)
仓库真实且活跃(SakanaAI/AI-Scientist-v2,7061 stars,2025-12 仍有 push),但 issue 区显示工程质量毛糙:#133 是一个预注册(OSF: aqchj)的独立评测,在 24/24 次 write-up 尝试中复现两个 bug——VLM 图审白名单把配置的模型也拒了导致图审被静默跳过、final review 阶段 UnboundLocalError 直接崩(同类报告还有 #125/#108/#130);#110/#67 报 perform_writeup() 缺参数 TypeError;#123 报收尾清理会按 'python/torch' 子串误杀整台机器的无关进程。另外 README 声明的 license 是 The AI Scientist Source Code License(带强制披露条款),与论文写的 Apache 2.0 不一致。
系统产出'sufficient quality'的科研(整体叙事)
对 v1 的独立评测(Beel et al., SIGIR Forum 2025, arXiv:2502.14297,被引 34)结论严厉:12 个提议实验 5 个因代码错误失败,生成论文中位数只有 5 条引用且多数过时,7 份稿件全被系统自带 reviewer 建议拒收,质量评为'赶 deadline 的没动力本科生';查新把 SGD micro-batching 这种老概念判为 novel。Nature 版的 workshop 战绩靠的是 v2 + tree search + 人工筛选,v1 部分的能力上限应以该独立评测为准。

与我们方向的关系

对 ai-scientist 方向,这篇就是'官方基准线':引用这条线(idea 生成、自动实验、自动写稿、自动评审的完整闭环)一律引这个 Nature 版而非两篇预印本。它也定义了这个领域的评估范式——把 AI 论文匿名混入真实评审池的'AI Scientist 图灵测试',以及用 OpenReview 历史决定 + cutoff 前后对照来校验 LLM reviewer(这个污染检查设计可以直接搬去校验我们自己的 LLM-as-judge)。

可借鉴的工程件:experiment progress manager 的四阶段划分 + 每阶段独立 tree search + stage 间 LLM 选根,是比固定 workflow 图更松、比完全自由更稳的中间结构;buggy/非 buggy 节点二分加 debug 概率、replication/aggregation 节点强制算均值方差,都是能直接移植的做法。同时它的 reality check 也提醒我们:报告这类系统战绩时,把筛选漏斗数字(N 个 idea → 1 篇)放进正文而不是藏起来,是这篇论文比多数同行做得好的地方,值得学。

阅读笔记

读 v2 仓库代码前先看 issue #133/#125/#110,writeup 和 review 阶段有几个未修的崩溃点;默认 bfts_config.yaml 里实验模型还是 claude-3-5-sonnet,复现论文结果要按附录 app:v2_hyperparams 换成 o3 + Claude Sonnet 4 组合。arXiv 版 ID 是 2606.15497(2026-03-31 挂出),Nature DOI 10.1038/s41586-026-10265-5。

材料清单

TeX 源码
已存档:Raw/towards-end-to-end-automation-of-ai-research/source/
代码仓库github.com/SakanaAI/AI-Scientist-v2
7061★ · 最近推送 2025-12-19
项目主页 / 报告sakana.ai/ai-scientist-nature/
Nature 正式版www.nature.com/articles/s41586-026-10265-5
Nature 651: 914-919 (2026),CC BY 4.0,与 arXiv:2606.15497 同内容
独立评测(v1)arxiv.org/abs/2502.14297
Beel, Kan & Baumgart, SIGIR Forum 2025:5/12 实验失败、中位 5 条引用、7 篇全被自审拒收
第三方 fact-checkblog.pebblous.ai/report/ai-science-new-era/en/
Pebblous 2026-04:逐条核查媒体声称,'AI 在 Nature 发论文'判 FALSE;但其 32.6% 接收率系误算
ICBINB 2025 workshopsites.google.com/view/icbinb-2025/papers
接收论文列表(28 篇)与 PMLR v296 proceedings(14 篇 opt-in)
v1 代码仓库github.com/SakanaAI/AI-Scientist
Template-Based 版本 + Automated Reviewer 代码
ICLR2025 workshop 实验材料github.com/SakanaAI/AI-Scientist-ICLR2025-Workshop-Experiment
三篇投稿的原始 PDF、评审意见等

同类条目