← 资料站  /  AI Scientist  /  全景综述与路线梳理
论文 全景综述与路线梳理 兼属 AutoResearch

From Automation to Autonomy: A Survey on Large Language Models in Scientific Discovery

从自动化到自主性:LLM 科学发现综述(Tool→Analyst→Scientist 三级框架)
一句话HKUST KnowComp 的 EMNLP 2025 综述,提出 LLM 参与科学发现的三级自主性分类(Tool / Analyst / Scientist),沿科学方法六阶段梳理约 200 篇工作;引用 101 次,三级框架已被 2026 年的社区路线图和后续 benchmark 采用,配套 awesome list 持续更新到 2026-07。

这是什么

这是 ai-scientist 方向最常被引的『地图型』综述之一。它回答的问题不是『LLM 能做哪些科学任务』,而是『LLM 在科研流程里的角色如何从工具演化为自主研究者』。切入点有两个轴:纵轴是三级自主性——Level 1 LLM as Tool(人直接监督下执行单一明确任务)、Level 2 LLM as Analyst(人定目标、LLM 半自主完成数据建模与分析)、Level 3 LLM as Scientist(以最少人工干预跑通多个研究阶段);横轴是经典科学方法六阶段(观察与问题定义、假设发展、实验与数据收集、数据分析、得出结论、迭代精炼)。

组织方式随层级变化:Level 1 按六阶段分节(文献综述、想法生成、实验规划、图表/表格推理、评审与验证、迭代精炼);Level 2 按学科分(ML research、数据建模、function discovery/符号回归、自然科学、通用研究);Level 3 则按 idea development 与 iterative refinement 两种系统策略讨论 AI Scientist、Agent Laboratory、Zochi、Carl 等端到端系统。作者明确排除了通用科学 LLM(如 domain-specific foundation model)——这是它与『AI for Science』类综述的分界。

论文本身停在 arXiv v3(2025-09,EMNLP camera-ready),但配套的 Awesome-LLM-Scientific-Discovery 仓库是活的:2026-07 大更新加入了 2025-2026 的新系统和一个 frontier industry-lab 专节(DeepMind / OpenAI / FutureHouse / Sakana 等),事实上成为这篇综述的持续更新版。

科学方法六阶段轮盘(观察与问题定义 → 假设发展 → 实验与数据收集 → 数据分析 → 得出结论 → 迭代精炼),每个阶段标注对应的 LLM 应用和热点子课题。这是全文的横轴:Level 1 一章就按这六格组织,想找某个阶段的 benchmark 可以从这张图索引。
科学方法六阶段轮盘(观察与问题定义 → 假设发展 → 实验与数据收集 → 数据分析 → 得出结论 → 迭代精炼),每个阶段标注对应的 LLM 应用和热点子课题。这是全文的横轴:Level 1 一章就按这六格组织,想找某个阶段的 benchmark 可以从这张图索引。

机制与做法

三级自主性:用什么维度划分

Table 1 用四个维度区分三级:LLM 的角色(任务自动化工具 → 数据建模与分析 agent → 开放探索与发现 agent)、人的角色(分配任务 → 定义问题并验证输出 → 最小干预)、任务范围(显式定义 → 目标导向 → 开放式)、agentic workflow 复杂度(简单静态 → 高级 → 策略性迭代)。这个划分的实际用处是给任何一个『AI 科学家』系统快速定位:比如 MLAgentBench/DS-Agent 是 L2,AI Scientist/Agent Laboratory 是 L3,而大量 benchmark 类工作其实都在 L1-L2。

注意 L2 的定义是『passive agent』——人划边界、LLM 在边界内自主跑任务序列;L3 是『active agent』——能自己提假设、规划实验、下结论并提出下一个研究问题。这个 passive/active 的区分比很多综述里模糊的 'autonomous' 用词更可操作。

全文主分类图:金字塔从下到上是 Level 1(Tool,按六阶段分格)、Level 2(Analyst,按 ML/数据建模/function discovery/自然科学/通用分格)、Level 3(Scientist,仅 6 个系统且全在 ML research)、顶端 FUTURE(robotic automation、self-improvement、ethics 等)。每个条目带六边形色标(所属科学方法阶段)和形状标记(methodology/benchmark/agentic workflow)。L3 那层的稀疏本身就是 2025 年中领域格局的写照。
全文主分类图:金字塔从下到上是 Level 1(Tool,按六阶段分格)、Level 2(Analyst,按 ML/数据建模/function discovery/自然科学/通用分格)、Level 3(Scientist,仅 6 个系统且全在 ML research)、顶端 FUTURE(robotic automation、self-improvement、ethics 等)。每个条目带六边形色标(所属科学方法阶段)和形状标记(methodology/benchmark/agentic workflow)。L3 那层的稀疏本身就是 2025 年中领域格局的写照。

六阶段 × 三层级的矩阵式梳理

Level 1 一章基本是六阶段任务清单:文献检索与综合(SCIMON、PaperQA)、想法生成(Si et al. 的百人研究、Nova、MOOSE-Chem)、实验规划与代码(SciCode、DS-1000、AIDE)、图表/表格推理(ChartQA、Chain-of-Table)、结论验证与评审(ReviewerGPT、CycleResearcher、SciReplicate-Bench)、迭代精炼(Chain-of-Ideas、MC-NEST)。对课题组来说这章的价值是 benchmark 索引——每个阶段配了 methodology/benchmark/agentic workflow 三类标记。

Level 2 按领域切:ML research(MLAgentBench、MLE-Bench、RE-Bench)、数据建模(DiscoveryBench、BLADE)、function discovery(LLM-SR 系列)、自然科学(Coscientist、AI co-scientist、FutureHouse 系)。Level 3 当时(2025-05)只收了 6 个系统:AI Scientist v1/v2、Agent Laboratory、AI-Researcher、Zochi、Carl——全部集中在 ML research 领域,这本身就是一个有信息量的观察:真正的 L3 系统当时只在『用 AI 研究 AI』这个闭环里跑通。

挑战一节与课题组方向的重合

第 7 节列了五个未来方向:fully-autonomous research cycle(跨研究实例的持续探究,而非单次任务)、robotic automation(物理实验室接入)、transparency/interpretability、continuous self-improvement、ethics。其中 continuous self-improvement 一段直接引 continual learning 文献(CLIN、online RL),主张科学 agent 应在运行生命周期内从连续发现中自我增强——这正好落在课题组 RSI 和 Continual Learning 两个方向的交叉点上,可以当作『综述作者也认为这是缺口』的引用依据。

关键结果

实证核查

扎实作为综述,声称与实际相符:分类学有真实的后续采纳,配套仓库由社区 PR 持续维护;缺点是论文本体冻结在 2025-09,覆盖时效靠 README 续命,且 README 也漏了个别 2025 下半年的重要工作。
『systematically charts this burgeoning field』——系统性覆盖 LLM 科学发现领域。
论文 v3(2025-09-17 camera-ready)覆盖到 2025 年 5 月;仓库 README 在 2026-07 大更新后补齐了大部分 2025-2026 系统(Kosmos、AlphaEvolve、DeepScientist、Denario、freephdlabor 等,均可在 readme.md 中核到)。但对照本站 ai-scientist 目录,README 截至 2026-07 仍漏掉两个早于该次更新的重要工作:OpenAI 的 Early science acceleration experiments with GPT-5(arXiv 2511.16072,2025-11)和 Stanford 的 Agents4Science 2025 会议(2025-10);OmniScientist、InternAgent-1.5、Towards end-to-end automation of AI research(2026 年发布)则属时间差,不算漏。用它当地图时要意识到 frontier-lab 报告类工作收得偏慢。
三级 taxonomy 提供『conceptual architecture』供领域导航——即声称分类学有公共品价值。
有实证支持但程度有限:S2 引用 101 次,抽查前 60 条引用语境,明确采用 Tool/Analyst/Scientist 三级框架展开论述的有 2 篇(Toward Trustworthy Autonomous Science: A Two-Year Community Roadmap, 2026;SciIntegrity-Bench, 2026),其余多为背景性引用。框架被采纳是真的,但『多数引用只是列在 related work』这一点符合综述引用的常态。
GitHub 仓库作为配套资源持续维护。
属实且是社区型维护:435 stars,最近 push 2026-07-03;issues/PRs 列表显示 2026 年持续有外部贡献者提交并被合并(PR #16 AutoZyme、#17 CASSIA、#8 ChatSpatial 等),README 顶部明确标注『Last major update: 2026.07』。但此后到 2026-08-31 已近两个月无 commit,且有 3 个 open issue(CAJAL 提案)无人处理;论文本身自 v3 后未再更新版本。
发表于 EMNLP 2025。
S2 venue 字段确认为 Conference on Empirical Methods in Natural Language Processing;GitHub repo 描述带 [EMNLP2025] 标记;致谢节含审稿人致谢,与 camera-ready(v3, 2025-09)时间线一致。

与我们方向的关系

对课题组的正确用法是【入门地图 + 定位坐标系】:新同学进 ai-scientist 方向,先读这篇的正文(短,主文仅约 9 页)建立 L1/L2/L3 坐标,再按需深入站内条目——L3 对应 the-ai-scientist / the-ai-scientist-v2 / agent-laboratory / ai-researcher / zochi / meet-carl,L2 对应 curie / autonomous-chemical-research-with-large(Coscientist)/ towards-an-ai-co-scientist,生态层(它当时未覆盖)对应 agentrxiv / agents4science-2025 / omniscientist。读站内任何一个新系统时,先问『它在这个框架里是 L2 还是 L3、卡在哪个科学方法阶段』,比泛泛读摘要有效。

与站内另外两篇综述的分工:llm4sr 按研究流程四任务(假设/写作/实验/评审)切,偏任务粒度;agentic-science-survey 偏 agentic 系统架构;本篇的独特价值是自主性演进这条纵线和『L3 系统当时全部困在 ML research 领域』这类结构性观察。另外它的 Challenges 一节把 continuous self-improvement(引 continual learning 与 online RL 文献)列为五大方向之一,可作为课题组 RSI × Continual Learning 交叉选题的动机引用。日常追新建议直接盯它的 awesome list(比论文新一年),但注意其对 frontier-lab 技术报告收录偏慢,需与本站 catalog 互补。

阅读笔记

arXiv v3(2025-09-17)为最终版,之后更新全在 GitHub README,读的时候别只看 arXiv PDF。README 的分类比论文细:Level 3 拆成了 General-Purpose Agents / Discovery-Oriented Systems / Ecosystems and Infrastructure 三小节,并新增 Frontier Labs 和 Survey Generation 节——引用它的分类时注意区分论文版和 README 版。

材料清单

TeX 源码
已存档:Raw/from-automation-to-autonomy/source/
代码仓库github.com/HKUST-KnowComp/Awesome-LLM-Scientific-Discovery
435★ · 最近推送 2026-07-03
arXiv v3arxiv.org/abs/2505.13259v3
EMNLP 2025 camera-ready(2025-09-17),论文最终版

相关条目

同子模块 · 全景综述与路线梳理
跨方向 · 同标签