← 返回资料站  /  AI Scientist
论文 实验自动化 ★ 必读

Autonomous chemical research with large language models (Coscientist)

Coscientist:GPT-4 驱动的自主化学实验智能体
一句话CMU 团队用 GPT-4 搭了一个多 LLM 智能体 Coscientist,自己上网查反应条件、写 Python 代码控制 Opentrons OT-2 液体处理机器人,在真实实验室里完成了 Suzuki 和 Sonogashira 交叉偶联反应(GC-MS 确认产物生成);发在 Nature 封面级位置,是 LLM 闭环做物理实验的第一批标志性工作,但完整 pipeline 以安全为由至今未开源。

这是什么

2023 年 3 月 GPT-4 发布后,CMU 的 Gomes 组在几个月内做出了这个工作:能不能让 LLM 不只是聊化学,而是真正设计并执行实验?他们搭建的 Coscientist 是一个多模块智能体——核心 Planner 是一个 GPT-4 chat 实例,动作空间只有四个命令:GOOGLE(联网搜索)、PYTHON(Docker 沙箱里跑代码)、DOCUMENTATION(检索硬件 API 文档)、EXPERIMENT(向机器人/云实验室提交代码)。用户只给一句自然语言指令,比如 'perform multiple Suzuki reactions'。

论文用六个任务展示能力:已知化合物的合成规划、硬件文档检索、在 Emerald Cloud Lab(ECL)云实验室执行高级命令、低层控制 Opentrons OT-2 液体处理器、多硬件+多数据源整合的综合实验、以及基于历史数据的反应条件优化。最重的结果是最后的物理实验:Coscientist 上网查好 Suzuki/Sonogashira 的条件和化学计量,算体积、写 OT-2 协议(含 heater-shaker 加热振荡模块,该模块发布于 GPT-4 训练数据截止之后),报错后自己查文档修好代码,跑完反应,GC-MS 检出目标产物 biphenyl(9.53 min)和 tolane(12.92 min)。

这篇和 ChemCrow 同期(互相引用),是 'AI Scientist' 讨论里绕不开的前史:它把闭环从计算实验推到了物理世界,发表于 Nature(2023-12-20),Semantic Scholar 引用已达 1237 次(Google Scholar 约 1967 次)。作者 Boiko 和 Gomes 后来创办了 aithera.ai。

系统架构(Fig.1):绿色 Planner(GPT-4)通过 GOOGLE / PYTHON / DOCUMENTATION / EXPERIMENT 四个命令调用 Web searcher、Docker 代码执行、文档检索和硬件自动化模块;蓝色框为用 LLM 的模块,白色框不用 LLM。下方 c 图是真实实验台:OT-2 液体处理器 + heater-shaker 模块 + 跑着 Coscientist web 服务的笔记本。
系统架构(Fig.1):绿色 Planner(GPT-4)通过 GOOGLE / PYTHON / DOCUMENTATION / EXPERIMENT 四个命令调用 Web searcher、Docker 代码执行、文档检索和硬件自动化模块;蓝色框为用 LLM 的模块,白色框不用 LLM。下方 c 图是真实实验台:OT-2 液体处理器 + heater-shaker 模块 + 跑着 Coscientist web 服务的笔记本。

机制与做法

架构:一个 Planner + 四个命令

Planner(GPT-4)接收用户 prompt 和各命令的返回,作为对话消息迭代决策。GOOGLE 命令背后是另一个 LLM(Web searcher),负责把意图改写成搜索词、调 Google Search API、浏览网页并把答案摘要回传;PYTHON 在隔离 Docker 容器里执行代码(纯执行,不涉及 LLM),报错信息回传给 Planner 自行修代码;DOCUMENTATION 由 Docs searcher(LLM)做文档检索摘要;EXPERIMENT 把生成的代码提交给硬件(OT-2 / ECL)或输出手动实验步骤。

文档检索走向量库路线:OT-2 Python API 文档分节用 OpenAI ada 模型 embedding,Planner 的查询也 embed 后做距离检索。对 ECL 的 Symbolic Lab Language(SLL,GPT-4 完全没见过的 DSL)做了三个实验:prompt-to-function(从全部实验函数中选对函数,全部案例选对)、prompt-to-SLL(生成的 ExperimentHPLC 代码真的在 ECL 云实验室执行成功,不过样品里注入了气泡)、prompt-to-samples(从 1110 个样品目录中检索库存溶液)。

核心物理实验(Fig.5):b/c 为源板上的可选试剂(炔/硼酸/四种芳基卤/两种 Pd 催化剂/两种碱)与液体处理器布局;d 是完整 agent 轨迹——GOOGLE 查条件、选碘苯并给出反应性理由(Ar-I 反应性最高)、PYTHON 算体积、报错后查文档修正、EXPERIMENT 执行;f 显示多次运行的试剂选择分布(从不犯化学错误);i/j 为 GC-MS 结果,反应混合物在 9.53/12.92 min 出现与 biphenyl/tolane 标准品匹配的信号。
核心物理实验(Fig.5):b/c 为源板上的可选试剂(炔/硼酸/四种芳基卤/两种 Pd 催化剂/两种碱)与液体处理器布局;d 是完整 agent 轨迹——GOOGLE 查条件、选碘苯并给出反应性理由(Ar-I 反应性最高)、PYTHON 算体积、报错后查文档修正、EXPERIMENT 执行;f 显示多次运行的试剂选择分布(从不犯化学错误);i/j 为 GC-MS 结果,反应混合物在 9.53/12.92 min 出现与 biphenyl/tolane 标准品匹配的信号。

物理实验:交叉偶联闭环

实验设置:源板上放好 phenylacetylene、phenylboronic acid、多种芳基卤(碘苯/溴苯/氯苯/对硝基碘苯)、两种 Pd 催化剂、两种碱(Et3N、DBU)和 DMF 溶剂;目标板装在 OT-2 的 heater-shaker 模块上。Coscientist 需要自己决定用哪些试剂、什么配比。它先 GOOGLE 反应条件(约一半引用来自 Wikipedia,ACS/RSC 期刊也在前五来源),选对了偶联配对——多次运行中从未犯化学错误,比如从不给 Sonogashira 选 phenylboronic acid;首选碘苯(重现了卤素反应性排序)。

然后用 PYTHON 算各试剂体积,写 OT-2 协议。第一版用错了 heater-shaker 的方法名,Coscientist 调 DOCUMENTATION 查文档后修正,协议成功运行。GC-MS 确认两个反应都有目标产物生成(与纯标准品的保留时间和碎片谱匹配)。注意:板子是人手搬的(作者明说 setup 尚未完全自动化,但决策全部由系统做出),且论文只做了定性检出,没有报告产率。

反应优化游戏(Fig.6):在 Perera Suzuki 数据集(上)和 Doyle Buchwald-Hartwig 数据集(下)的查表环境里迭代 20 轮。c 图三列对比 GPT-4 有 prior / 无 prior / GPT-3.5:GPT-4 的 NMA(累计最大优势)高于 Bayesian optimization 虚线,normalized advantage 随迭代上升说明在利用历史数据;GPT-3.5 因 JSON 格式失败数据点稀少。f/g:用 SMILES 替代化合物名性能不变,模型还能基于 SMILES 推理电子效应。
反应优化游戏(Fig.6):在 Perera Suzuki 数据集(上)和 Doyle Buchwald-Hartwig 数据集(下)的查表环境里迭代 20 轮。c 图三列对比 GPT-4 有 prior / 无 prior / GPT-3.5:GPT-4 的 NMA(累计最大优势)高于 Bayesian optimization 虚线,normalized advantage 随迭代上升说明在利用历史数据;GPT-3.5 因 JSON 格式失败数据点稀少。f/g:用 SMILES 替代化合物名性能不变,模型还能基于 SMILES 推理电子效应。

反应优化游戏:用 NMA 度量在两个真实数据集上迭代

为考察'能否利用已收集数据指导下一步',作者把 Perera 2018 的流动化学 Suzuki 数据集和 Doyle 2018 的 Buchwald-Hartwig 数据集(条件空间全枚举、产率已知,可当查表环境)做成 20 轮迭代的游戏:每轮 Coscientist 以 JSON 输出选定的条件组合和理由,环境返回该组合的产率。20 轮只覆盖总空间的 5.2% / 6.9%。

评估用 normalized advantage(相对随机策略的优势归一化)和 NMA(累计最大优势)。结果:GPT-4 有无 prior(10 个随机初始数据点)最终收敛到接近的 NMA;GPT-3.5 常因无法输出合法 JSON 而废掉大量轮次;GPT-4 两组的 NMA 都高于标准 Bayesian optimization 基线——但论文自己承认 BO 的 normalized advantage 不涨可能只是探索/利用平衡不同,'may not be indicative of their performance'。用 SMILES 代替化合物名输入,性能几乎不变,且模型能对 SMILES 直接做电子效应推理(例如'换一个吸电子性更强的 additive')。

合成规划基准:7 个化合物的人工打分

Web searcher 的评估是让各模型给 7 个已知药物/试剂(对乙酰氨基酚、阿司匹林、布洛芬、硝基苯胺等)写详细合成路线,人工按 1-5 打分(3 分以下算失败)。GPT-4 版 Web searcher 在 acetaminophen、aspirin、nitroaniline、phenolphthalein 上全满分,是唯一在 ibuprofen 上及格(≥3)的系统;所有无联网基线模型(GPT-3.5/GPT-4/Claude 1.3/Falcon-40B)都把 ibuprofen 合成写错。论文自己承认打分'inherently subjective'。这个基准只有 7 个化合物,规模很小,主要是演示 grounding(联网)对减少幻觉的价值。

关键结果

实证核查

有水分物理实验本身可信(Nature 透明同行评审,审稿人可访问 web 应用验证;GC-MS 谱图公开),历史地位实至名归;但'autonomous'有折扣(搬板靠人、关键处要引导提示)、化学难度是本科教科书级、产物只定性不定量,而且完整 pipeline 以'安全'为由不开源,外界至今无法复现论文原系统。
论文展示了完整的 Coscientist 系统,代码见 GitHub gomesgroup/coscientist。
仓库里只有实验输出数据和一个 'simple implementation'(coscientist.py 3.2KB + tools.py 1.6KB + run.py 1KB,共约 5.8KB Python),README 和 Data availability 都明说完整 pipeline、prompts、数据'因安全顾虑,待美国 AI 监管出台后才会完全公开',且 simple 版'may not produce the same results'。issue #4(2024-11,仍 open)抱怨论文中的案例代码未开源;issue #3 里维护者亲口确认 'due to safety reasons, we cannot release the full pipeline'。即论文原系统外界无法复现,只有审稿人验证过。
系统能'autonomous design, planning and performance of complex scientific experiments'(自主设计、规划、执行复杂科学实验)。
论文正文自己降级为 '(semi-)autonomously':交叉偶联实验中微孔板由人手搬运('our setup is not yet fully automated');颜色识别任务需要人为追加引导提示才解出;ECL 云实验室的 HPLC 例子中色谱柱、流动相、梯度等参数是 ECL 内部软件定的而非 LLM;所做化学(苯基硼酸+卤苯的 Suzuki)是教科书级反应,产物仅 GC-MS 定性检出、无分离产率。'复杂科学实验'的定语偏营销。
在反应条件优化上,GPT-4 版 Coscientist 表现优于标准 Bayesian optimization。
对比只在两个 2018 年公开数据集(Perera Suzuki、Doyle Buchwald-Hartwig)的查表环境上做,论文自己承认两点:(1)无法排除这些数据集已进入 GPT-4 训练数据('It is unclear if the GPT-4 training data contain any information from these datasets');(2)BO 的 normalized advantage 曲线不涨'可能只是探索/利用平衡不同,may not be indicative of their performance'。这条声称应打折看待。
GPT-4 + Web searcher 在合成规划上显著优于各基线模型。
基准仅 7 个常见化合物,由作者本人(D.A.B.)设计并打分,1-5 分制,论文承认 'labelling is inherently subjective and so, may be different between the labelers';仓库 synthesis_capabilities 目录提供了原始输出可查。结论方向可信(联网 grounding 有用),但量化数字没有统计意义。
工作独立于 AutoGPT/BabyAGI/LangChain 等 agent 框架并行完成,具有开创性。
时间线属实(2023 年上半年完成,12 月见刊),S2 引用 1237 次、后续 LLM 化学 agent 综述(如 Ramos et al. Chem. Sci. 2025,被引 435)均把它与 ChemCrow 并列为奠基工作;仓库 209 stars、2025-08 仍有 push。历史地位没有争议,争议在于可复现性和'自主'的成色。另注意利益关联:合作者 B. Kline 是 ECL 员工,G.G. 后来进入 ECL 的 AI 科学顾问委员会,Boiko 与 Gomes 共同创办 aithera.ai。

与我们方向的关系

对做 AI Scientist / 实验自动化方向的同学,这篇是必读前史:它验证的不是'LLM 懂化学',而是'LLM 作为 Planner + 工具调用(搜索/代码/文档/硬件 API)可以驱动物理实验闭环'。其架构(单 Planner + 四命令 + 文档向量检索)在 2023 年是手搓的,今天用任何 agent 框架一周就能复刻——这恰恰说明值得借鉴的是任务设计而非工程:比如用'发布于训练截止之后的硬件模块'来证明能力来自检索而非记忆,以及 normalized advantage / NMA 这套把优化能力与随机基线、BO 基线对齐的度量。

两个可直接搬用的坑与启示:(1)评估上,查表式优化游戏容易受训练数据污染质疑,若要类似实验需选 GPT-4 之后发布的数据集或做污染检查;(2)开放性上,'以安全为由不开源'导致这篇的原系统无人复现过,做我们自己的工作时要意识到这类声明对可信度的伤害——它的 simple implementation(<6KB)倒是个干净的最小 agent 教学样例。

阅读笔记

Nature 版有公开的 peer review file(透明评审),审稿人当时可访问部署好的 web 应用验证声称,这是其可信度的主要外部支撑。License 是 Apache 2.0 + Commons Clause,禁商用。仓库 issues 一共只有 4 个,没有真正的复现报告——因为没东西可复现。媒体报道(如 'AI 一次做出诺奖级实验')明显过誉:Sonogashira 反应相关的 Pd 催化偶联拿过 2010 诺奖,但用现成试剂盒跑一次教科书偶联和'诺奖级'是两回事。

材料清单

代码仓库github.com/gomesgroup/coscientist
209★ · 最近推送 2025-08-11
全文(PMC 免费版)pmc.ncbi.nlm.nih.gov/articles/PMC10733136/
Nature 原文的 PubMed Central 开放版本,含补充材料链接
simple implementationgithub.com/gomesgroup/coscientist/tree/main/simple_implementation
官方极简复刻(约 6KB Python),完整 pipeline 未开源
ChemCrow(同期姊妹工作)arxiv.org/abs/2304.05376
EPFL/Rochester 的 LLM+化学工具 agent,与本文并列的奠基工作

同类条目