UT Dallas du-nlp-lab 与 NTU 合作的综述,2025 年 1 月挂出。核心贡献是一个组织框架:把 LLM 辅助科研拆成 hypothesis discovery、experiment planning & implementation、paper writing、peer reviewing 四个环节,每个环节分别梳理 task-specific 方法、benchmark、评测方式和挑战。这与只看单一环节的综述(如只讲 related work generation 或只讲 peer review 的)形成互补,论文自己也在 intro 里明确以此与 zhang2024comprehensive(偏模型架构/数据集)等先行综述划界。
五位作者里第二作者 Zonglin Yang 是 MOOSE / MOOSE-Chem 的一作,通讯作者 Xinya Du 也长期做 hypothesis generation,所以全文写得最深的是第 2 章 hypothesis discovery:从 literature-based discovery(Swanson 1986 的 ABC 模型)和 inductive reasoning 两条学术史讲起,再把现有方法拆成 8 个 key components 逐一对比。相比之下 writing 和 reviewing 两章更接近带注释的文献列表。
需要明确的时效边界:文献收录截止约 2024 年 11-12 月,arXiv 从未更新过版本。2025 年之后爆发的整批端到端 AI Scientist 系统(Agent Laboratory、AI co-scientist、AI Scientist-v2、InternAgent 等)全部不在其中——它是 pre-2025 领域的快照,不是活地图。

四环节流水线框架
组织逻辑跟着一篇论文的生命周期走:§2 假设发现;§3 实验规划与执行(再分 optimizing experiment design 和 automating research process,后者细分 data preparation / experiment execution / data analysis);§4 论文写作(citation text generation → related work generation → drafting & writing);§5 同行评审(automated review generation / LLM-assisted workflows / benchmarks)。每个环节以'方法 + benchmark + 挑战与 future work'收尾,方法和 benchmark 分开列表,便于当索引用。
Hypothesis discovery 章:8 个 key components(全文精华)
作者从现有方法里提炼出一条'主干发展轨迹',用一张组件对照表刻画每个方法装了哪些零件:inspiration retrieval strategy(SciMON 的语义/知识图/引文邻居检索 vs MOOSE 系的 LLM 直接选 inspiration)、novelty / validity / clarity 三个 checker、evolutionary algorithm(FunSearch 的 island-based EA、MOOSE-Chem 的 evolutionary unit)、多 inspiration 串联(MOOSE-Chem 把 P(hypothesis|background) 分解成多步小问题)、hypothesis ranking(多数用 LLM 打分,IGA/CoI/Nova 转向 pairwise 比较,因为 LLM 直接打分校准差)、自动构造 research question(copilot vs 'full-self-driving' 之分)。
值得记的两个诚实判断:validity checker 目前几乎全靠 LLM 启发式自评,真正有外部验证信号的只有 FunSearch(编译器+验证代码)、HypoGeniC/LLM-SR(数据一致性)、SGA(物理仿真)四个例外;评测上,化学等硬学科连专家直评都不够可靠(领域太细分),终极验证只能靠 wet-lab 实验,这直接引出'自动化实验执行是最大瓶颈'的结论。
Benchmark 索引与各环节挑战
discovery benchmark 分成 literature-based(以 research question + background survey + inspiration + hypothesis 四元组标注,如 MOOSE-Chem 的 51 篇 2024 化学论文标注集,强调用论文发表日期规避 data contamination)和 data-driven(DiscoveryBench 264 真实+903 合成任务、DiscoveryWorld 虚拟环境 120 任务)两类。实验执行环节收了 MLE-bench、ScienceAgentBench、MLAgentBench、CORE-Bench、SUPER 等十余个;评审环节收了 PeerRead、NLPeer、ASAP-Review、Reviewer2 等。对想找 benchmark 的同学,这几张表是本文最实用的部分。
对课题组的正确用法:把它当【2024 年底的领域底图 + benchmark 索引】,用在进入 ai-scientist 方向的第一步——先用它的四环节框架建立'一篇论文如何被自动化'的全局坐标,再顺着各环节的 benchmark 表(MLE-bench、ScienceAgentBench、DiscoveryBench、PeerRead 系列)找评测基准。hypothesis discovery 章的 8 组件对照表在设计自己的 idea-generation pipeline 时可直接当 checklist:你的系统有没有 novelty/validity checker、inspiration 怎么检索、ranking 用打分还是 pairwise。
配合站内条目读:2025 年后的端到端系统它完全没覆盖,需接着读站内 agent-laboratory、the-ai-scientist-v2、towards-an-ai-co-scientist、internagent-novelseek 补全时间线;更新的领域全景可对照 a-survey-of-ai-scientists(2025-10)和 agentic-science-survey(2025-08),这两篇覆盖了从'环节自动化'到'agentic 端到端'的范式迁移,恰好是本篇结束的地方。它反复强调的'validity 验证靠 LLM 自评不可靠、终极验证只能靠自动化实验'这一判断,与课题组 AutoResearch 方向关心的实验闭环问题直接相关。