AI for Auto-Research: Roadmap & User Guide
AI 自动科研:全生命周期路线图
Lingdong Kong, Xian Sun, Wei Chow, et al. (20 位作者,Awesome AI Auto-Research Team) · NUS / NTU · 2026-05 · 被引 6
一句话把自动科研切成四阶段八环节(Creation / Writing / Validation / Dissemination),用 12 张横向对比表铺出 308 条工具清单和 52 个 benchmark,核心判断是「产出快于验证」、全自动尚未稳定达到主会接收线;但发布版把四张量化综合图全撤了,清单对 2024-2025 的执行类 benchmark 有系统性漏项。
这是什么
这是 NUS/NTU 一批人(第一作者 Lingdong Kong)做的自动科研综述,arXiv 2605.18661,5 月首发、7 月出 v2,配一个 awesome list 仓库 worldbench/awesome-ai-auto-research(500 star)。它的定位不是讲某个技术路线,而是把「一篇论文从想法到传播」的完整链条拆成八个环节,逐环节盘点方法族、系统、benchmark 和成熟度。
八环节是:S1 Idea Generation、S2 Literature Review、S3 Coding & Experiments、S4 Tables & Figures、S5 Paper Writing、S6 Peer Review、S7 Rebuttal & Revision、S8 Paper2X(海报/slides/视频/项目页/社媒)。四阶段是按「认识论功能」分的:造证据(Creation)、组织成稿(Writing)、被外部审查(Validation)、对外传播(Dissemination)。S4、S7、S8 是它相对同类综述新加的三格。
全文的骨架其实是表:正文 Table 1(方法族 × 8 环节 + 成熟度打星)、Table 2(52 个 benchmark)、附录九张逐环节工具清单(S1 30 / S2 41 / S3 45 / S4 31 / S5 29 / S6 41 / S7 15 / S8 31 行,加跨阶段 E2E 45 行,合计 308 条),以及附录 Table 12——把 LLM4SR、AI4Research、Automated Scholarly Paper Review、From Automation to Autonomy、AI Scientist Survey 五篇同类综述逐环节打勾(它自己 8/8,五家分别 4/1/5/5/4)。
正文 Table 1:八个环节 × 五个方法族(prompt / RAG / agentic / training / hybrid)的主次标记,右侧是作者给的成熟度打星。看两件事:agentic 一列几乎全是主要方法(说明整条链已被 agent 化),以及 S4 图表、S7 rebuttal、S8 传播三格只有一星——这三格既是他们新加的,也是目前最空的。星级是作者主观判断,没有量化依据,别直接引用。机制与做法
分类学:为什么按「认识论功能」而不是自治度切
作者明确把自己的轴和 From Automation to Autonomy 的自治度轴区分开:自治度描述「自动到什么程度」,他们的轴描述「在生命周期的哪一格」,两者正交。Writing 被从 Creation 里单拎出来,理由是写稿不是排版,而是把证据重新组织成论证;Peer Review 和 Rebuttal 被合成 Validation,因为它们共同构成「被挑战—回应—改稿」的社群机制。
他们反复强调这条链不是线性的:S6 的审稿意见会打回 S3 补实验、S4 改图、S5 重构;S8 做海报时暴露的表述含糊会倒逼改稿。这个「阶段边界」概念是全文最有用的抽象——它把大量失效模式重新定位成 handoff 失败:idea 看着新但实现后变弱、代码能跑但实现的是错算法、实验日志被总结成过强的 claim、rebuttal 承诺的修改没落地。
附录 Table 12:把五篇同类综述(LLM4SR 2501、Automated Scholarly Paper Review 2501、From Automation to Autonomy 2505、AI4Research 2507、AI Scientist Survey 2510)按它的八环节逐格打勾。本文 8/8,五家 4/1/5/5/4;S7 Rebuttal 与 S8 Dissemination 两行五家全空,标了 ★new。这张表是判断「该读哪篇综述」的最快依据:只关心 idea 和实验就读 LLM4SR/AI4Research,要 rebuttal 和传播才需要这篇。证据组织:横向表 + 逐环节利弊卡
每个环节结尾有一张 stageanalysis 卡片,左边正面标签、右边负面标签,各配三条一句话结论(例如 E2E 那张:正面是 pipelines / search / skills / multi-agent,负面是 propagation / self-critique / validation gap / state loss / overclaiming)。这个格式适合快速抽结论,但也意味着大量判断只有一句话,没有支撑数据。
E2E 那张附录表把 45 个系统分成「全自动研究系统(21 个)/ 领域专用 / 演化自改进 / 平台基建 / 生命周期 benchmark」五组,每行给 venue、GitHub、一句话评测战绩。这是全文最实用的一页,但表头自带脚注 "Evaluation information might be uncertain",可信度分层要自己判断。
跨阶段结论:五条 insight + 六大开放问题
五条 insight:①产出跑在验证前面;②人类治理下的协作比全自动更可信;③能力边界出现在开放式任务(新颖性判断、真实研究代码、长时程);④有效系统收敛到 exploration / execution / verification 三层架构,agent 数量不是关键;⑤AI 使用已经是治理问题(披露、归属、责任)而不是检测问题。
评测部分把方法分成五族(专家评、LLM/Agent-as-Judge、自动指标、执行接地、过程/轨迹),并点出五个缺口:新颖性难定义、benchmark 污染与时效、跨系统不可比(base model / 预算 / human-in-the-loop 各异)、跨领域欠测、成本本身应算评测维度;最后一条是「没有任何 benchmark 以人类等价的严格度评测完整生命周期」——这正好是站内 ResearchClawBench、AstaBench 那一批在啃的口子。
关键结果
- 成本与产量的引用数字:AI Scientist 约 $15/篇;Agent Laboratory $2–13/篇;AI Scientist v2 $25/篇、ICLR 尺度 6.33(唯一越过接收线的);FARS 连跑 228 小时、消耗 11.4B token、产出 100 篇(约 2.3 小时一篇),均分 5.05;ARIS 一夜跑 20+ GPU 实验,把稿件分从 5.0 提到 7.5。
- 研究级代码是最硬的墙:在 ResearchCodeBench、SciReplicate-Bench 这类专门 benchmark 上,前沿系统的天花板只有 37–39%,而同样的模型在 SWE-bench 类熟悉软件任务上表现好得多。
- 自动审稿的水位:Stanford Agentic Reviewer 与人类打分相关性 ρ=0.42,人类之间也只有 ρ=0.41;CycleReviewer 报告 Proxy MAE 相对单个人类审稿人降低 26.89%。作者的读法是「能给出有用的 review 式信号,但仍是不可靠代理」。
- 最强的落地形态不是 AI 独立审稿,而是 AI 给人类审稿意见做反馈:作者引 ICLR 2025 的随机对照实验,称 89% 的评审在收到 AI 反馈后被改善,且不影响接收率。注意这是它的转述口径(原实验统计的是反馈被采纳、评审被修改的比例),引用这个数字前回查原文。
- 治理侧的量级:语料级研究估计 CS 摘要中最多 17.5%、生物医学摘要 13.5% 可检出 AI 修改痕迹;作者由此主张从检测转向披露与追责。
- 覆盖体量:附录九张逐环节清单共 308 条工具/系统/benchmark,benchmark 表 52 项,E2E 表 45 个系统(其中 21 个归为「全自动」)。
- 元综述对比(附录 Table 12):在它自己的八环节格子里,LLM4SR 覆盖 4、Automated Scholarly Paper Review 覆盖 1、From Automation to Autonomy 5、AI4Research 5、AI Scientist Survey 4;S7 Rebuttal 与 S8 Dissemination 五家全空。这两格是本文相对同类综述真正的增量。
实证核查
有水分分类学骨架和 308 条清单是真材实料,当地图用没问题;但发布版把四张量化综合图连同其结论证据一起撤掉了(作者自己在注释里承认数据未核实),清单对 2024-2025 执行类 benchmark 有系统性漏项,摘要里最亮的战绩多来自博客与 GitHub repo。
论文以「跨阶段的量化综合」为卖点:成本-质量权衡、自动化悖论(直接自动化 vs 人机协作)、三层架构覆盖度等图表。
arXiv v2 的 tex 源里这四张图全被注释掉了(source/sections/6_challenges.tex:311-370),而且注释里作者自己列了 TODO:成本-质量图要「Remove unverified data points: Kosmos ($200, 4.8), CycleResearcher ($30), AI-Researcher ($50, 5.2)」、接收线画错要「5.39 → 5.69」、自动化悖论图 panel (b) 的 88%/77%/68% 「are from consulting tasks, not research」。发布版实际只有 1 张卡通 teaser 加表格,亦即那些跨系统横比数字目前没有经核对的图支撑;附录 E2E 表也自带脚注 "Evaluation information might be uncertain"。
声称通过 Google Scholar / Semantic Scholar / arXiv / DBLP 系统检索 + 滚雪球 + 社区监控,给出全生命周期的完整清单。
拿站内同方向条目抽查:MLE-Dojo、DSBench、CORE-Bench、RExBench、AAAR-1.0、BixBench、ML-Master 在 readme.md 和 source/tables/ 全部 0 命中(grep -ci 逐个验证);MLS-Bench、InnovatorBench、FML-bench 同样缺(这三条较新,可归因 6 月截止)。S3 的 benchmark 表只有 16 项左右(MLE-Bench、MLAgentBench、EXP-Bench、PaperBench、ResearchCodeBench、SciReplicate-Bench、KernelBench、TritonBench 等),数据科学类与「已发表研究可复现性」类被整片漏掉。清单明显偏向 2026 年新预印本:E2E 表 45 行里 arXiv'26 占 17 行、arXiv'25 占 12 行。
「resources maintained at our project page」,配套 awesome list 持续更新。
仓库确实活着:2026-03-29 建库,到 2026-08-27 仍有提交(按月 1/7/21/6/4/2),PR #13 一次并入「92 verified Jul-Aug 2026 works」。但同步做得糙:README 页脚仍写 "Last updated: 2026-06-21",为此挂着未合的 PR #15 "Refresh stale footer date";而且清单已经比论文新——论文摘要写「through June 2026」,正文却已引 2607.* 的 7 月预印本(NVAITC 2607.11084、Self-Driving Lab 2607.04508),两边口径不一致。要最新条目就直接看仓库,别指望 PDF。
把四阶段八环节的分类学作为领域的统一词汇提出。
Semantic Scholar 目前 6 次引用,逐条看语境没有一篇沿用这套阶段划分:ARAC 只是把它和 ARIS、Dr.Claw 并列当背景,另几篇是 "automated research [5]" 式泛引,还有 MARS(外卖推荐)和 MedSynapse-V 这类明显蹭引;DanceOPD 甚至拿它支撑 "rollout position affects OPD stability",属于错引。分类学有没有被采纳,现在的证据是「还没有」。
E2E 表里的 21 个「全自动研究系统」及其战绩(如 FARS 100 篇、EvoScientist「6 papers accepted at ICAIS'25」、UniScientist「30B 开源、beats Claude Opus 4.5」)。
按 venue 字段统计,这张表里有 3 行 Web'26、3 行 GitHub'26、1 行 GitHub'25,即摘要级卖点里有一批出处是公司博客或仓库:FARS 指向 analemma.ai/blog、ARIS 指向一个个人 repo、UniScientist 指向 unipat.ai 的博客文章。这些数字既无同行评议也无可复现细节,论文却与 ICLR/ACL 论文的结果并列陈列,读的时候必须自己降权。
与我们方向的关系
当地图用,不当结论用。最合适的两个用法:①开新题时先按环节定位——想做审稿/复现/实验编排,直接翻对应附录表看已有系统和 benchmark,省掉一轮检索;②写 related work 时用它的八环节做章节骨架,再回站内条目补细节。要注意它的清单在执行类 benchmark 上有漏项(MLE-Dojo、DSBench、CORE-Bench、RExBench、AAAR-1.0 等),所以「查漏」这一步不能只靠它,得对着站内 ai-rd-eval / replication-eval 两个子类再过一遍。
配读组合:S1 配 the-ideation-execution-gap 和 can-llms-generate-novel-research-ideas-a-100(它引的「idea 实现后变弱」就出自这条线);S3 配 researchcodebench、paperbench、mls-bench、exp-bench 看 37–39% 天花板到底怎么测出来的;S6/S7 配 cycleresearcher、stop-automating-peer-review-without-rigorous、hidden-prompts-in-manuscripts-exploit-ai(它对自动审稿的乐观陈述需要这几条来对冲);跨阶段判断配 autonomous-research-agents-verification-gap 和 researchclawbench——后者正是它自己点出的「生命周期级评测缺口」的直接回应。S7 rebuttal 与 S8 Paper2X 目前站内没有别的条目覆盖,想开这两个方向的同学从它的附录 Table 10/11(15 行 / 31 行)起步。
阅读笔记
两个坑:①一定要看 tex 源(source/sections/6_challenges.tex 末尾)才知道有四张量化图被撤,PDF 上看不出来,而作者的 TODO 注释本身就是对若干流传数字的自我否证,引用 Kosmos/CycleResearcher/AI-Researcher 的成本数字前先查原文;②论文与 awesome list 版本不同步,README 页脚日期(2026-06-21)不可信,以 commit 时间为准。arXiv 已到 v2(2026-07-20 版),抓过的 PDF 若是 v1 会缺一批 2606-2607 的条目。
材料清单
TeX 源码已存档:Raw/ai-for-auto-research-roadmap/source/
相关条目
同子模块 · 全景综述与路线图
跨方向 · 同标签