← 返回资料站  /  AI Scientist
论文 综述 背景

A Survey of AI Scientists

AI Scientist 综述:六阶段方法学框架
一句话把 AI Scientist 的端到端流程拆成六个方法学阶段(文献调研、想法生成、实验准备、实验执行、科学写作、成稿),并用一张覆盖矩阵把 2022-2025 年 23 个代表性系统按阶段对齐,梳理出'模块化→闭环→规模化与人机协作'三个发展阶段。

这是什么

这是一篇 2025 年 10 月挂 arXiv 的 AI Scientist 综述,作者来自 HUST 和 Lehigh(Guiyao Tie, Pan Zhou, Lichao Sun)。核心贡献是一个统一的六阶段分类框架:Literature Review → Idea Generation → Experimental Preparation → Experimental Execution → Scientific Writing → Paper Generation,并把每个已有系统标注到它实际覆盖的阶段上,做成一张覆盖矩阵(比如 DS-1000 只覆盖实验准备+执行,AI Scientist v1/v2、AI-Researcher、DeepScientist 六阶段全覆盖)。

除了按阶段横切,它还按时间纵切出三个发展阶段:Phase I 基础模块期(2022-2023,DS-1000、BioPlanner、Coscientist、MLAgentBench 这类单点工具和 benchmark)、Phase II 闭环集成期(2024,以 AI Scientist v1 首次打通全流程为标志)、Phase III 规模化/影响力/人机协作期(2025 至今,AI Scientist v2 的 agentic tree search、DeepScientist 的目标导向长程研究、freephdlabor 和 AI co-scientist 的人机协作框架)。适合当地图用:写相关工作时可以直接引用它的阶段划分来定位自己的系统。

全文总览图:横轴是六个方法学阶段(Literature Review 到 Paper Generation),纵向四层分别是模型能力、系统阶段与方法、科学任务与产物、应用领域;底部虚线框给出三个发展阶段(Phase I 基础模块 / Phase II 闭环集成 / Phase III 规模化与协作)各自的代表系统。一张图基本涵盖了整篇综述的分类体系。
全文总览图:横轴是六个方法学阶段(Literature Review 到 Paper Generation),纵向四层分别是模型能力、系统阶段与方法、科学任务与产物、应用领域;底部虚线框给出三个发展阶段(Phase I 基础模块 / Phase II 闭环集成 / Phase III 规模化与协作)各自的代表系统。一张图基本涵盖了整篇综述的分类体系。

机制与做法

六阶段框架与覆盖矩阵

六个阶段各对应一类任务产物:Literature Review 产出文献综述和 gap 分析,Idea Generation 产出假设和问题形式化,Experimental Preparation 产出实验计划和代码,Experimental Execution 产出数据和实时分析,Scientific Writing 产出结果小结和图表,Paper Generation 产出完整可验证的手稿。第 3 章按这六个阶段各写一小节,逐一介绍代表性系统的机制(如文献阶段的 RAG + graph reasoning,执行阶段的机器人控制与 adaptive feedback)。

覆盖矩阵(Table 1)是全文信息密度最高的部分:23 个系统 × 6 个阶段,标出每个工作显式覆盖了哪些阶段,并附年月。应用章节再按领域(通用 / 化学材料 / 生物医学 / 物理工程 / meta-science)横扫一遍。

三阶段历史叙事

作者的判断是:领域从孤立模块(2022-2023)走向闭环(2024,AI Scientist v1 是分水岭),当前前沿(2025-)在三条线上推进——用 RL 和 tree search 提升规模与鲁棒性(AI Scientist v2、DeepResearcher)、追求真实科学影响力(DeepScientist、ResearchBench)、以及人机协作范式(freephdlabor、AI co-scientist)。这个叙事和课题组自己的观察基本一致,可直接借用。

关键结果

实证核查

有水分六阶段框架和三阶段叙事清晰可用,但'systematic and comprehensive'的自我定位打折:体量小、覆盖窄,且自称'经过严格核实'的矩阵里能查出日期错误。作为地图够用,作为权威文献普查不够。
摘要称这是对该领域的 'systematic and comprehensive synthesis'。
本地 tex 源码(source/section/)统计:正文五个 section 合计约 5491 词,main.bib 仅 131 条 bib 条目,核心矩阵只收录 23 个系统。同期同主题综述(如 AI4Research、LLM4SD 系综述)普遍收录数百篇文献,这篇的覆盖面明显偏窄,'comprehensive' 名不副实,更接近一篇框架短文。
Table 1 标题声称矩阵 'rebuilt and expanded based on a rigorous, verifiable review of each paper'(对每篇论文做过严格、可核实的审读)。
抽查即发现日期不准:矩阵把 Coscientist 标为 2023.06,但其 main.bib 里自己的条目就是 Nature 2023 年 12 月刊(vol 624, pp 570-578),早期 preprint 是 2023 年 4 月(arXiv:2304.05332),两头都对不上 06 月;DS-1000 标为 2023.04,实际 arXiv 首发是 2022 年 11 月(2211.11501)、正式发表在 ICML 2023(7 月);AI Scientist v2 标为 2025.02,实际 arXiv 首发是 2025 年 4 月(2504.08066)。属于小错,但与'严格核实'的自我声明相抵触。
定位为指导下一代系统的 'critical roadmap'。
无代码/数据可查(综述类正常);S2 显示发布约 10 个月后引用 8 次(截至 2026-08),在同主题综述里传播度一般。挑战与治理部分(robustness、governance)停留在定性罗列,没有给出可操作的评测协议。

与我们方向的关系

对课题组最直接的用处有两个:一是写相关工作时,用它的六阶段框架给自己的系统定位(覆盖哪几个阶段、缺哪几个),Table 1 的 23 系统矩阵可以直接当 related work 的骨架;二是给新人当入门地图,三个 Phase 的叙事把 DS-1000 → AI Scientist v1 → DeepScientist/freephdlabor 这条主线讲得很清楚。

使用时注意:引用它的矩阵前最好自己复核关键系统的日期和阶段标注(已发现日期错误),且它截稿于 2025 年 10 月,之后的系统需要自己补。

阅读笔记

只有 3 位作者、无代码仓库。tex 源码里没有 04 号 section(章节编号从 03-method 直接跳到 05-application),疑似有一章被删或合并,成文可能较仓促。

材料清单

TeX 源码
已存档:Raw/a-survey-of-ai-scientists/source/