← 资料站  /  AutoResearch  /  全景综述与路线图
论文 全景综述与路线图 背景

AutoResearch AI: Towards AI-Powered Research Automation for Scientific Discovery

AutoResearch AI:用 L0-L4 自主性谱系重画科研自动化地图
一句话22 位作者的领域综述,把科研自动化按「谁掌舵、谁执行、谁有验收权」分成 L0-L4 五级(L1-L2 叫 Vibe Research,L3 才算 AutoResearch,L4 明确说是尚未存在的上界),再用 novelty/validity/impact/reliability/provenance 五维评估把 23 个评测工具按「证据角色」分类。框架自洽且克制,但作为索引漏收整条 ML 工程基准线(bib 269 条里 MLE-bench、MLGym、MLR-Bench、RE-Bench 一条都没有),配套 awesome list 三个多月没动。

这是什么

这是一篇立场偏「概念澄清」的综述:作者认为当前把系统按模型家族、agent 架构或 benchmark 分数归类是错的,应该按控制权、证据、执行、验收责任在科研闭环里怎么分配来归类。核心产出是 L0-L4 自主性谱系:L0 纯人工;L1 人主导、AI 做搜索/写作/写码等局部增强;L2 AI 能执行成块任务并产出制品,但人仍须设定目标、检查、批准;L3 AI 开始主导工作流大段落,人退到干预与例外处理;L4 是「AI 常态化独立闭环」的愿景。论文把 L1-L2 这一段单独命名为 Vibe Research(人来掌舵的氛围科研),L3 起才叫 AutoResearch 本体。

值得注意的是它的判定纪律:「pipeline 宽度不等于科研自主性」——系统按其已被证实的工作流角色取最低档归类,只要常规人工验证在结构上仍然必需,再长的端到端流水线也只算 L2(见 sections/02-overview.tex,L2 还进一步细分为 L2-S 单步执行 / L2-I 交互式 / L2-P 人工验证下的流水线)。按这个尺子,The AI Scientist、AI Scientist-v2、Agent Laboratory、AI-Researcher 这些常被当作「AI 科学家」的系统都落在 L2,封面图(Fig0)的 L3 行里一个具体系统名都没有,L4 行只写着「robust concrete systems have not yet emerged」。这个保守立场是全文最有用的部分,也是它跟站内其他几篇综述的主要区别。

全文骨架图:纵轴 L0-L4 五级自主性,横轴是科研五阶段(读文献/生成想法/跑实验/验证修订/写论文)再细分为 15 个步骤,格子颜色从红(人)渐变到蓝(AI)。看两点:L1-L2 两行框在 Vibe Research 里且填了具体工具名(ChatGPT、NotebookLM、Claude Code、Codex、OpenClaw 等),而 L3 行一个系统名都没有、L4 行直接写着「尚无稳健的具体系统」——这就是作者的核心判断:现有系统基本压在 L2。
全文骨架图:纵轴 L0-L4 五级自主性,横轴是科研五阶段(读文献/生成想法/跑实验/验证修订/写论文)再细分为 15 个步骤,格子颜色从红(人)渐变到蓝(AI)。看两点:L1-L2 两行框在 Vibe Research 里且填了具体工具名(ChatGPT、NotebookLM、Claude Code、Codex、OpenClaw 等),而 L3 行一个系统名都没有、L4 行直接写着「尚无稳健的具体系统」——这就是作者的核心判断:现有系统基本压在 L2。

机制与做法

五阶段 × 五维度:把「判断目标」和「证据工具」分开

技术章节按五个工作流条件组织:literature grounding、hypothesis formation & planning、experimentation & tool use、feedback/validation/review、reporting & communication(sections/03-tech.tex 的 Stage I-V)。评估章节提出五个判断维度:novelty、validity、impact、reliability、provenance,并明确区分「判断目标」(这五维)与「证据工具」(benchmark、专家评审、重跑、制品溯源、纵向跟踪)。作者点出的核心方法论错误叫 authority borrowing——用某一维度上的强表现暗示其余维度也强,例如拿 benchmark 分数当科学判断本身。

provenance 是站内其他综述都没单列的一维:声称/数据使用/中间制品/评审/修订/部署期干预在工作流结束后是否还可追溯。它引 CiteME 说明引用归因不能简化成引用格式正确,引 LitSearch 说明检索质量会向下传导成可信度问题。除科学质量外还并列了一套 autonomy assessment 变量:task substitution、decision authority、workflow closure、responsibility retention,用来判断「这套证据支撑得起多强的自主性声称」。

按证据角色而非主题给 benchmark 分类,并给出领域自主性天花板

评估章的主表(tab:benchmark_taxonomy_autoresearch)收 23 个工具,分四类角色:discovery(Auto-Bench、DiscoveryBench、ResearchBench、ResearcherBench、AIRS-Bench)、experimentation & verification(MLAgentBench、EXP-Bench、PaperBench、CORE-Bench、ScienceAgentBench、SciReplicate-Bench、SPOT、FIRE-Bench)、deep research & synthesis(BioDSA-1K、DeepScholar-Bench、LiveResearchBench、Deep Research Bench、DeepResearch Arena、DRBench)、review & provenance(CiteME、LitSearch、LLM-REVal、AI Agent Index),每行标注它主要/间接支撑哪几维。表格明确不给 benchmark 打自主性等级。

领域章(sections/05-domain.tex)按 8 个领域族分别给「自主性天花板」:计算与形式科学、物理科学与工程、具身智能、化学与材料、生物与生物医学、医学与临床、经济与社会科学、地球与环境科学。结论是天花板由领域条件决定——制品结构化、可执行、能快速验证的地方自主性可信度高;依赖实体实验、延迟验证、异质证据、伦理约束或机构问责的地方就低。

关键结果

实证核查

有水分框架部分扎实且自我克制(保守归档规则、authority borrowing 的批评都站得住),但作为「领域地图」覆盖不全:整条 ML 工程/AI-for-AI 基准线在 269 条参考文献里完全缺席,而且早期版本表里有的领域基准在终稿里被删掉了;配套 awesome list 停更三个多月,分类学也还没被后续工作真正采用。
综述声称在统一分析框架下综合了「benchmark 生态」,主表覆盖「主要贡献是可直接使用的评估工具」的资源。
在 source/main.tex + sections/*.tex + main.bib(269 条)里 grep,MLE-bench、MLGym、MLR-Bench、MLE-Dojo、RE-Bench、ML-Master、ResearchCodeBench、InnovatorBench、RExBench、FML-bench、MLS-Bench 全部 0 命中,连 "Kaggle" 一词都不出现。也就是说 AI-for-AI / ML 工程这条最成熟、最可执行的评测线(正好是它自己说的「可执行可快速验证 → 自主性天花板最高」的领域)整体缺席。这些系统站内多数是 core 级条目;它的 23 行主表里只收了 MLAgentBench,MLE-bench 连 bib 都没有。
「Table 组织了当前 landscape」,给出的是一个经筛选的完整工具栈。
sections/04-evaluation.tex 第 160-243 行注释掉了这张表的早期版本,共 43 行,其中 AAAR-1.0、AstaBench、DSBench、BixBench、LAB-Bench、PostTrainBench、SciCode、BLADE、ControlA、EAIRA、BioPlanner、BioKGBench、AtmosSci-Bench、FinResearchBench、DAComp 等在终稿 23 行表里被删除。这些恰好是领域特定与 ML 工程类基准,删掉后表的覆盖面是收窄而非扩大——以 AstaBench 为例,它在全文只出现在这段被注释的旧表里,终稿正文一次都没提。
论文把 provenance(声称/数据/制品/评审可追溯)提为五维之一,并批评「引用归因不能简化为引用格式」。
论文自身的引用溯源就有瑕疵:sections/02-overview.tex 把 "AI co-scientists for statistical genetics" 这个具体工作挂在 gottweis2025towards(即 Towards an AI co-scientist, arXiv:2502.18864)名下,并在同一段把 Nature 2026 的 gottweis2026coscientist(Accelerating scientific discovery with Co-Scientist)当作另一个独立系统并列——实际是同一团队同一系统的期刊版。加上 28 条 Undermind 自动生成的 bib key,说明文献层是工具批量收集后未逐条核对。
配套项目页 github.com/Mr-Tieguigui/Survey-of-AutoResearch 提供 awesome list 作为持续维护的索引。
gh api 查:仓库 2026-04-20 建,最后一次 push 2026-05-25(距今三个多月),6 stars,README 393 行、约 124 个链接,不到 bib 269 条的一半;awesome list 里同样搜不到 MLE-bench / MLGym / MLR-Bench。而且摘要里的这个链接在 main.tex 中是被注释状态(% Project GitHub:),v1 PDF 读者根本看不到。arXiv 也仍停在 v1。
L0-L4 谱系与五维评估提供了领域「共同词汇」。
S2 显示 7 篇引用,拉取 contexts 看:多数只是当泛用的背景句引("a shift from task-level assistance towards workflow-level research automation"、"recent surveys emphasize that reliability, provenance, and reproducibility remain bottlenecks");只有 BrainPilot 真正复用了它的 benchmark 角色划分("distinguishes discovery, execution and verification, synthesis, and provenance-oriented instruments");没有一篇用 L0-L4 去给具体系统定级。分类学被采纳目前还只是苗头。

与我们方向的关系

当【地图】和【论证工具】用,不当【索引】用。两个具体用法:一是给自己的系统定级时套它的保守归档规则——只要常规人工验证在结构上还必需就只能写 L2,这个尺子能挡住组内 paper 里「端到端自主科研」这类容易被审稿人打的措辞;二是写 related work 或做评估设计时,拿 novelty/validity/impact/reliability/provenance 五维 + authority borrowing 的说法做自查:我们的 benchmark 分数究竟支撑了哪一维,有没有拿它冒充其余四维。provenance 这一维是站内其他综述缺的角度,做实验记录、制品追溯、评审留痕相关工作时值得直接引。

配合读的顺序:先用本篇的 L0-L4 + 五维搭骨架,索引和覆盖度交给 ai4research-survey、a-survey-of-ai-scientists、agentic-science-survey;ML 工程这条它漏掉的线,直接看站内 mle-bench、mlagentbench、mlgym、mle-dojo、mlr-bench、re-bench、exp-bench、paperbench 原条目;它反复强调的「验证与拒绝比生成难」这一判断,跟站内 autonomous-research-agents-verification-gap 和 the-ideation-execution-gap 是同一件事的两个证据,后两者的数字更硬,引用时优先引它们而不是本篇。

阅读笔记

tex 源码里注释掉的内容比正文更有信息量:标题曾是 "Vibe Research: A Survey of Concepts, Technologies, Evaluation, and Applications…",作者名单和单位改过多轮,benchmark 表被砍掉 20 行——想知道这篇的定位怎么摇摆的,直接读 source/main.tex 与 sections/04-evaluation.tex 的注释块。另:Vibe Research 这个词只在 L1-L2 区间使用,别当成全文的同义词。

材料清单

TeX 源码
已存档:Raw/autoresearch-ai-survey/source/
配套 awesome listgithub.com/Mr-Tieguigui/Survey-of-AutoResearch
README 393 行约 124 链接,最后 push 2026-05-25,6 stars;摘要里的这个链接在 tex 中被注释,PDF 里看不到

相关条目

同子模块 · 全景综述与路线图
跨方向 · 同标签