← 资料站  /  AI Scientist  /  全景综述与路线梳理
论文 全景综述与路线梳理

Towards Scientific Intelligence: A Survey of LLM-based Scientific Agents

走向科学智能:LLM 科学 agent 的机制视角综述
一句话中科院自动化所的 LLM 科学 agent 综述,不按研究流水线阶段、也不按自主性等级组织,而是把 agent 拆成 Planner / Memory / Action Space / Verifier 四个机制模块,每个模块再细分子类型(planner 8 类、memory 3 类、action 4 类、verifier 4 类),附录把 114 篇工作按这套机制标签逐一归类;v3(2026-02)已把 2025 下半年的 benchmark 与安全工作补进来,四件套拆法被 GRL、JACS Au 等领域期刊直接沿用。

这是什么

站内已收的科学 agent 综述大多按两条轴组织:一条是研究流水线(LLM4SR 的 idea→实验→写作→评审),一条是自主性等级(From Automation to Autonomy、Agentic Science 的 L1-L5、Assistant/Partner/Avatar)。这篇的轴是第三条——agent 内部有哪些零件、每个零件有哪些做法。作者在 v3 的 intro 里明确把自己和 Hitchhiker's Guide(生命周期+能力分级)、Agentic Science(按学科)对立起来,说自己是 mechanism-centric。

四个模块的划分见架构图:用户 query 进来后 Planner 做任务分解,子任务交给 Action Space(API、代码、仪器、模拟器、搜索、子 LLM)执行,中间结果送 Verifier 检查后回流给 Planner 反思重规划,Memory 在旁边负责存取历史与外部知识。这套抽象本身不新鲜(通用 agent 综述都这么画),这篇的价值在于把每个格子填满:planner 分 prompt-native(P1 指令/模板、P2 上下文增强、P3 反思、P4 搜索、P5 多角色、P6 生成可执行 DAG/DSL)与 learned(L1 SFT、L2 RL/偏好优化)共 8 类;memory 分 M1 历史上下文、M2 外部知识库、M3 内化知识;action 分 T1 工具/环境控制、T2 检索、T3 代码生成执行、T4 LLM 推理动作;verifier 分 V1 自我修正、V2 多 agent 批评、V3 human-in-the-loop、V4 工具/计算验证。

除机制章节外还有三块:benchmark 章按「通用推理能力」(K-12/本科/研究生-专家三级:Geometry3K、SciBench、GPQA、HLE、FrontierMath 等)与「科研导向能力」(图表理解、假设发现、实验设计与自动化:ScienceAgentBench、DiscoveryBench、MLE-bench、LAB-Bench、AstaBench、Core-bench 等)两支归类;应用章按化学材料、生命医药、物理工程、天文、地球气候、ML/数据科学、文献与元研究七个领域铺开;伦理章分 7 小节(自主性、透明性、幻觉、安全、偏见、问责治理、知识产权),每节都挂具体系统与 benchmark(SafeScientist + SciSafetyBench、RAS-Eval、ScienceBoard 的全程可回放日志、知识图谱投毒),不是泛泛而谈。

全篇的骨架图:Planner 接到 task request 后做任务分解,子任务下派到 Action Space(APIs、子 LLM、仪器、搜索引擎、模拟器)执行,中间结果交 Verifier 反思校验后回流给 Planner,Memory 独立在右侧负责经验/上下文的 retrieve 与 update。作者注明现实实现里 planner 的规划、反思、验证三种功能常由不同 agent 分担,图上为抽象而合并成一个框。
全篇的骨架图:Planner 接到 task request 后做任务分解,子任务下派到 Action Space(APIs、子 LLM、仪器、搜索引擎、模拟器)执行,中间结果交 Verifier 反思校验后回流给 Planner,Memory 独立在右侧负责经验/上下文的 retrieve 与 update。作者注明现实实现里 planner 的规划、反思、验证三种功能常由不同 agent 分担,图上为抽象而合并成一个框。

机制与做法

机制标签体系:把综述写成「配方书」

作者的核心手法是给每篇工作打机制级标签,而不是写「某某年某某人做了什么」的编年史。例如 P1(指令/模板 planner)一节下面,同一条正文里再按 5 种指令成分二次切分:procedural schema(工作流阶段+转移条件)、response format(ReAct 的 Thought-Action-Observation)、tool inventory、domain guideline(安全与资源约束)、persona,并给出每一成分对应的几十篇引用。这使得同一篇工作会在多个格子里重复出现——Coscientist 既是 P1(GOOGLE/PYTHON/DOCUMENTATION/EXPERIMENT 四条命令)又同时被列为 V1+V2+V3+V4 全套验证的代表。

作者管这叫 mix-and-match 的 recipe book:理论上可以按需要挑一个 planner 子类 × 一个 memory 子类 × 若干 action × 若干 verifier 来拼一个领域 agent。全书用同一个 running example 串起来——「设计一种 >200 mAh/g、循环 500 次稳定的锂电正极材料」,四个模块的每种子类型都用这个例子举一遍,这是本篇最实用的写法(verifier 图就是这么画的)。

四类 verifier 用同一个 running example(设计 >200 mAh/g、循环 500 次稳定的锂电正极)对比:V1 自我修正——planner 自评「循环 480 次不达标、Ni4+ 不安全,改 Mg 掺杂 + Al2O3 包覆」;V2 多 agent 批评——材料设计/安全/成本/合成四个角色分别打勾打叉,汇总为 not approved;V3 human-in-the-loop——专家化学家审阅后批准;V4 工具验证——代码跑通、DFT 算出 ΔE=-3.1 eV、模拟得每循环容量衰减 0.02%。看的时候注意四类验证的证据强度和成本是递进的,论文主张的是分层叠加而非择一。
四类 verifier 用同一个 running example(设计 >200 mAh/g、循环 500 次稳定的锂电正极)对比:V1 自我修正——planner 自评「循环 480 次不达标、Ni4+ 不安全,改 Mg 掺杂 + Al2O3 包覆」;V2 多 agent 批评——材料设计/安全/成本/合成四个角色分别打勾打叉,汇总为 not approved;V3 human-in-the-loop——专家化学家审阅后批准;V4 工具验证——代码跑通、DFT 算出 ΔE=-3.1 eV、模拟得每循环容量衰减 0.02%。看的时候注意四类验证的证据强度和成本是递进的,论文主张的是分层叠加而非择一。

Verifier 章:少见的把验证当一等公民写的综述

多数科学 agent 综述把验证塞进「反思」或「评估」里一笔带过,这篇单列一节并给出可操作的选型逻辑:任务危害性高(制药、危险化学)必须上 V3 human-in-the-loop;领域成熟、有现成模拟器和数据库(化学、物理、生物)优先 V4 工具验证;新兴领域只能靠模型/人工;成本敏感的快速迭代用轻量 V1 自我修正,高价值 campaign 才值得堆昂贵验证;追求全自动的系统(AI Scientist、CycleResearcher)只能靠 V1+V4,协作型系统(ResearchAgent)全程嵌专家。

最强的系统都是分层验证:AIGS、Agent Laboratory、AtomAgents、Coscientist 都同时用了 V1-V4 中的三到四种,形成 defense-in-depth。作者点出的开放问题也具体:meta-verification(评估验证信号本身的可靠性)、按不确定性动态调整验证深度、verification-aware learning(让 agent 学会生成更容易通过验证的方案)。这几条正是站内 AI Scientist 系列条目「审稿分数虚高」问题的机制层解释。

v3 的重写:从综述变成持续维护的地图

v1(2025-03-31)与 v2(2025-04-17)是同一份 2 MB 稿子;v3(2026-02-02)是一次实质重写,改成 ACL 模板、体积降到 817 KB,补进 AstaBench、PaperArena、ResearchBench、BioML-bench、RAS-Eval、SafeScientist、Bengio 的 Scientist AI 等 2025 下半年工作,并新增了「与 Hitchhiker's Guide / Agentic Science 的分工」这段自我定位。planner 章的 learned planner(SFT/RL)也是 v3 才补厚的——这条线在 v1 时期还几乎没有工作。

代价是版本之间有 10 个月空窗,且没有配套 awesome-list 仓库(见 reality),所以这张地图只能靠作者下一次传 arXiv 才更新。

关键结果

实证核查

扎实可核查的声称都对得上:机制分类粒度、引用体量、四件套被后续工作沿用都有实据,v3 也确实做了实质更新。短板在覆盖面和载体形态,不在声称虚高:没有配套仓库,地图只活在 PDF 里、v2 到 v3 有约 10 个月空窗;覆盖偏「领域内单任务 agent」,端到端 AI Scientist 与湿实验验证那条线漏了几篇重量级工作。另外 108 次引用里有一批同实验室的礼节性引用,采纳度要打折看。
宣称提出 mechanism-oriented taxonomy,并把工作按机制级细类归类,给出可 mix-and-match 的构建蓝图。
成立且粒度确实到了子类,但编号的排版层级不齐:source/acl_latex.tex 里 memory M1-M3、action T1-T4、verifier V1-V4 都是带编号的 subsubsection,planner 却只有 Prompt-Native / Learned 两个 subsubsection,P1-P6 与 L1-L2 这 8 类是节内的加粗条目(以及 forest 树状图的叶子节点),按目录翻会找不到。附录 Classification of All Related Work 用这套标签归类了 114 个唯一引用条目。全书用同一个锂电正极设计 running example 贯穿各子类型(verifier 图即此例)。但「蓝图」只是正文散文 + PDF 里的 forest 树状图,没有可查询的表格/CSV/网页,想按「我要 RL planner + 外部知识库 memory」检索得自己人肉翻附录。
综述综合了 >120 篇代表性论文与 >40 个领域 benchmark,是一份 comprehensive literature & benchmark atlas。
偏保守而非夸大。acl_latex.bib 共 269 条 entry,正文实际引用 204 个唯一 key(附录机制标签表只覆盖其中 114 篇,单看这张表反而低于「>120」,>120 指的是全篇引用而非归类表);benchmark 分类图点名的 benchmark 在 40 个以上(K-12/本科/专家三级 + 图表理解/假设发现/实验设计三支,含 GPQA、HLE、FrontierMath、ScienceAgentBench、MLE-bench、LAB-Bench、BixBench、AstaBench、Core-bench 等)。
作为「地图」类综述,隐含承诺跟得上领域进展。
arXiv 提交记录:v1 2025-03-31(2022 KB)、v2 2025-04-17(2022 KB,同尺寸,应为小修)、v3 2026-02-02(817 KB,改 ACL 模板并实质重写)。v3 补入 AstaBench、PaperArena、SafeScientist、RAS-Eval、Bengio Scientist AI 等 2025 下半年工作,说明作者在维护。但没有配套 awesome-list 仓库:catalog 的 code_url 为空,serper 搜「Towards Scientific Intelligence + github/awesome」只返回他人无关列表(luo-junyu/awesome-agent-papers、mpi-astronomy/awesome-llms-in-science 等),无本文官方仓库。因此 v2→v3 之间有约 10 个月完全冻结期,引用列表也无法社区增补。
覆盖度:声称是 LLM 科学 agent 领域的系统梳理。
站内同方向条目抽查:AI Scientist(2408.06292)、AI Scientist-v2(2504.08066)、AI co-scientist(2502.18864)、Agent Laboratory(2501.04227)、InternAgent/NovelSeek(2505.16938)、Robin(2505.13400)、AI-Researcher(2505.18705)、Coscientist、MLE-bench 均已收录。但在 .bib 里搜不到 Virtual Lab / Swanson 的 SARS-CoV-2 nanobody 工作(Nature 2025,站内 important,是少数有湿实验验证的多 agent 系统)、AgentRxiv(2503.18102)、Zochi、Denario(2510.26887)、Kosmos(2511.02824,早于 v3 三个月);2026 年工作(InternAgent-1.5、OmniScientist、end-to-end automation of AI research)自然也不在。结论:领域内单任务 agent(化学/材料/生物/天文)覆盖很密,「端到端自主科研 + 真实湿实验/评审验证」这条线偏薄,读它时必须搭站内 core 条目补齐。
机制分类被后续工作采纳。
S2 引用语境核查(108 次引用抽取上下文)确有实质沿用:Geophysical Research Letters《AI Agent for Hydrologic Modeling》以「modularity, memory, tool use, domain grounding」引之;Earth and Space Science 的 NASA 科学加速愿景明确引述其 prompt-based planning + 多种 memory 模态 + 工具交互;《From Research Question to Scientific Workflow》直接写「propose a mechanism-oriented taxonomy with four components: Planner, Memory, Action Space, Verifier」;URSA 通用科研 agent 也按 planner/memory/toolset 拆自己。JACS Au 2026 的自主化学材料创新综述同样引用。需打折的是:108 次里有一批是同实验室(CAS 自动化所)话题无关的礼节性引用(LLM serving/Hermes、document image MT、KTAE advantage estimation、VLM 消歧等),所以原始引用数高估了实际采纳度,但领域期刊那几条是真采纳。

与我们方向的关系

课题组该把它当零件目录用,而不是当领域入门读。具体位置:当你已经确定要做某个科研 agent、卡在「planner 该用 prompt 模板还是训一个、验证环节放什么」这类设计决策上时,翻它的对应小节,直接拿到该子类的 5-10 篇代表实现和优缺点判断,省掉自己 grep 文献的时间。附录的机制标签表尤其适合反向查:先想清自己需要哪种零件,再找谁做过。

读法建议:入门与全局图景仍看 LLM4SR(按流水线阶段)与 From Automation to Autonomy / Agentic Science(按自主性等级);这三篇给你「做到哪一步了」,本篇给你「零件怎么拼」,是正交关系,不必重复读。它的 verifier 章可以直接对照站内 the-ai-scientist / the-ai-scientist-v2 / zochi 的审稿分数争议看——那些系统在四类验证里只占了 V1+V4,缺 V2/V3,正是分数虚高的机制根源;伦理章(SafeScientist、RAS-Eval、ScienceBoard 可回放日志、知识图谱投毒)可以配 jr-ai-scientist-and-its-risk-report 一起读,是站内目前最系统的治理清单。它覆盖薄的地方(Virtual Lab 的湿实验闭环、Kosmos、AgentRxiv、2026 年的 end-to-end 系统)必须靠站内 core 条目自行补。

阅读笔记

本地 source/ 是 v3(2026-02)的 ACL 模板稿,不是 arXiv 上默认 HTML 渲染的 v1,读 tex 时按 v3 理解;arxiv.org/html/2503.24047v1 与本地内容差异不小(v1 无 learned planner 细分、无 2025 下半年 benchmark)。图 fig02-fig05 分别是 prompt planner 六类、learned planner、memory 三类、action space 四类的示意树,信息量也不低,但都是「概念方框图」,这里只选了整体架构图与 verifier 的 running example 图。

材料清单

TeX 源码
已存档:Raw/towards-scientific-intelligence/source/
v1 全文 HTMLarxiv.org/html/2503.24047v1
注意这是旧版,与本站分析依据的 v3 差异较大

相关条目

同子模块 · 全景综述与路线梳理
跨方向 · 同标签