← 返回资料站  /  AI Scientist
论文 端到端系统 ★ 必读

Towards an AI co-scientist

AI 合作科学家:用假设锦标赛把测试时算力换成假设质量
一句话Google 在 Gemini 2.0 上搭的六智能体系统,核心是「生成-评审-进化」+ Elo 锦标赛,让假设在自我博弈中被反复评审和改写;在 AML 药物重定位、肝纤维化靶点、cf-PICI 基因转移三个方向做了湿实验验证(KIRA6 在 KG-1a 细胞系 IC50 10 nM、Vorinostat 使 TGFβ 诱导的染色质改变下降 91%),2026 年正式发在 Nature。但代码不开源,主指标 Elo 是系统自评,「18 倍治疗窗」只在 4 个 AML 细胞系里的 1 个成立,「2 天重现 10 年工作」的那个假设其实是同组已发表结论的跨物种延伸。

这是什么

这是 Google Research / DeepMind 2025 年 2 月放出的系统论文(arXiv 2502.18864),2026 年以《Accelerating scientific discovery with Co-Scientist》正式发表于 Nature。它的定位不是「写论文的 AI」,而是「提出可被湿实验证伪的假设的 AI」:科学家用自然语言给一个 research goal(可以附上偏好、实验约束、几百篇 PDF),系统输出一份按 Elo 排序的假设清单和一份 research overview,附带实验方案和文献引用。作者反复强调它超越 deep research 类工具的地方在于产出「新知识」而不是文献综述。

系统由一个 Supervisor 加六个专职 agent 组成(Generation / Reflection / Ranking / Evolution / Proximity / Meta-review),跑在一个异步任务队列上,配一块持久化 context memory 支撑长时程推理。所有 agent 都用 Gemini 2.0,靠 prompt 分工,不做任何微调或 RL;测试时算力是唯一的「旋钮」——跑得越久,锦标赛轮数越多,Elo 越高。

验证部分是这篇的重头,也是它区别于同期 AI-Scientist 类工作的地方:三个真实生物医学问题,全部有专家 in the loop,全部落到体外实验。药物重定位(AML,4 个 AML 细胞系 + 1 个非 AML 对照 TK6)、新靶点发现(肝纤维化,人肝类器官)、机制解释(cf-PICI 跨物种传播,与 Imperial College 合作、同期发表在 Cell)。作者自己把这些定性为 preliminary evidence,不是临床结论。

系统全貌(论文 Fig 1)。(a) 科学家侧只做四件事:给 research goal、加自己的想法、写评审、聊天引导;系统侧是六个 agent 围着 Ranking agent 的锦标赛转,Tool Use 和 Memory 挂在右侧。(b) 是真正的执行架构:Supervisor 解析 goal 后往 worker 池分派 agent 任务,Context Memory 存状态,红箭头是 agent 之间的反馈回路。(c) 三个验证任务的输入输出对照——注意最下面一行标着 2015-2024 的十年实验研究 vs 2024 年 Co-Scientist 的 2 天,这就是被质疑最多的那个「10 年 vs 2 天」叙事。
系统全貌(论文 Fig 1)。(a) 科学家侧只做四件事:给 research goal、加自己的想法、写评审、聊天引导;系统侧是六个 agent 围着 Ranking agent 的锦标赛转,Tool Use 和 Memory 挂在右侧。(b) 是真正的执行架构:Supervisor 解析 goal 后往 worker 池分派 agent 任务,Context Memory 存状态,红箭头是 agent 之间的反馈回路。(c) 三个验证任务的输入输出对照——注意最下面一行标着 2015-2024 的十年实验研究 vs 2024 年 Co-Scientist 的 2 天,这就是被质疑最多的那个「10 年 vs 2 天」叙事。

机制与做法

六个 agent + 异步任务队列

Supervisor 先把自然语言 goal 解析成一份 research plan configuration(要不要求新颖、用什么标准评估、有哪些实验约束),然后往任务队列里塞任务、给 worker 分配 agent。它周期性统计系统状态(生成了多少假设、多少待评审、锦标赛进度、Generation 与 Evolution 各自的产出效率),据此调整下一轮各 agent 的采样权重,并判断是否到终止态。状态写进 context memory,组件挂了可以重启续跑。

六个 agent 的分工:Generation 做文献检索 + 模拟科学辩论 + 假设扩张;Reflection 当 peer reviewer;Ranking 跑 Elo 锦标赛;Proximity 算假设之间的相似度图,用于去重和安排对局;Evolution 改进 top 假设;Meta-review 汇总所有评审里的复现性问题,反向优化其他 agent。

测试时算力与质量的关系(论文 Fig 2),看的时候要盯住纵轴是「Self-Evaluation」。(a) 203 个 goal 上 Elo 随时间桶单调上升,未饱和。(b) 15 个专家精选难题:Co-Scientist 起步(约 1300)低于 o3(约 1415)和 DeepSeek R1(约 1378),第 7 桶后才反超;最值得注意的是最低那条虚线 Human Expert(约 1258)——在这个由系统自己打分的榜上,人类专家的 best guess 排在全部参赛者最末。(c) 换成 11 个 goal 的盲评专家打分后,差距立刻缩小:偏好排名 2.36 vs 2.45/2.45/2.73,impact 3.09 与 o1 持平,只有 novelty 3.64 明显领先。
测试时算力与质量的关系(论文 Fig 2),看的时候要盯住纵轴是「Self-Evaluation」。(a) 203 个 goal 上 Elo 随时间桶单调上升,未饱和。(b) 15 个专家精选难题:Co-Scientist 起步(约 1300)低于 o3(约 1415)和 DeepSeek R1(约 1378),第 7 桶后才反超;最值得注意的是最低那条虚线 Human Expert(约 1258)——在这个由系统自己打分的榜上,人类专家的 best guess 排在全部参赛者最末。(c) 换成 11 个 goal 的盲评专家打分后,差距立刻缩小:偏好排名 2.36 vs 2.45/2.45/2.73,impact 3.09 与 o1 持平,只有 novelty 3.64 明显领先。

Reflection 的四层评审:初审、全审、深度验证、观察评审

initial review 不用工具,快速砍掉明显有问题的;full review 开检索,查新颖性和正确性;deep verification 把假设拆成 assumption,再拆成 sub-assumption,去语境化后逐条独立判真假,用来抓复杂假设里的隐藏错误——注意它的处理是「判断这个错误是否 fundamental」,非 fundamental 的错误留给后续 Evolution 修;observation review 反过来问:这个假设能不能更好地解释文献里那些长尾的、现有解释不充分的实验观察。还有一个 simulation review,让模型逐步「模拟」机制或实验流程来找失败模式,前提假设是前沿 LLM 内部有一个可用的科学世界模型。

ablation 里最硬的一个数字来自这里:让 Reflection 评审一批「已发表因此不新颖」的想法,不接检索工具时它给出 6.14/10 的新颖性打分,接上检索后降到 2.38/10。这说明纯 LLM 的新颖性自评基本不可用,必须外挂检索。

AML 体外验证的剂量-反应曲线(论文 Fig 3,n=3)。(a-c) 是专家从 30 个候选里挑出的、有前期证据的三个药在 MOLM-13 上的结果。(d-h) 是「完全新颖」候选 KIRA6 在 4 个 AML 系加非恶性对照 TK6 上的结果,直接对照 IC50 就能看出论文宣称的 18 倍治疗窗只在 KG-1a(0.01 µM)对 TK6(0.18 µM)这一对上成立:NOMO-1 0.14 µM 与对照持平,MOLM-13 1.75 µM 和 HL-60 0.87 µM 比对照还差 5~10 倍。另注意 (e) 的点估计 0.01 µM 不在它自己的 95% CI(0.012–0.081 µM)里。
AML 体外验证的剂量-反应曲线(论文 Fig 3,n=3)。(a-c) 是专家从 30 个候选里挑出的、有前期证据的三个药在 MOLM-13 上的结果。(d-h) 是「完全新颖」候选 KIRA6 在 4 个 AML 系加非恶性对照 TK6 上的结果,直接对照 IC50 就能看出论文宣称的 18 倍治疗窗只在 KG-1a(0.01 µM)对 TK6(0.18 µM)这一对上成立:NOMO-1 0.14 µM 与对照持平,MOLM-13 1.75 µM 和 HL-60 0.87 µM 比对照还差 5~10 倍。另注意 (e) 的点估计 0.01 µM 不在它自己的 95% CI(0.012–0.081 µM)里。

Elo 锦标赛:用 pairwise debate 造选择压力

新假设初始 Elo 1200。Ranking agent 组织两两对局:top 假设之间用多轮 scientific debate 比较(缓解顺序偏置,聚焦新颖性/正确性/可测性),低排名的用单轮 pairwise 比较省算力。对局优先安排在 Proximity 图上相近的假设之间,以及新产生的和高分的假设。

关键点是 Elo 并不是被优化的目标函数,它是评审与辩论反馈闭环的副产品。论文也承认 Elo 的局限(引了对 Elo 假设的批评),并明确写 Elo 是 auto-evaluated、不基于 ground truth。为了给 Elo 找一点客观锚点,作者把 GPQA diamond 的题当作 research goal 输入,发现 Elo 桶越高、答对率越高,按最高 Elo 取答案时 top-1 准确率 78.4%。

Evolution 只加不改,Meta-review 用 prompt 拼接代替反传

Evolution agent 的六种改进策略(接检索补证据、改可行性、从他人假设取灵感、组合、简化、跳出框架)有一个刻意的设计约束:它只生成新假设,从不修改或替换原假设。新假设必须自己回到锦标赛里去赢,所以一次失败的「改进」不会污染 top 榜。这个约束很值得借鉴。

Meta-review agent 是这套系统里唯一的「学习」机制,但它不做反传:它把所有评审和辩论里反复出现的问题总结成一份 meta-review critique,直接追加到下一轮各 agent 的 prompt 后面。论文举的例子是,如果只有 90% 的单次评审会注意到血脑屏障通透性问题,meta-review 能让之后 100% 的评审都必须回答这个问题。整个系统因此没有任何 fine-tuning 或 RL,架构对底座模型不敏感(作者说可以换 Gemini 3 / GPT-5.4 / Opus 4.6)。

关键结果

实证核查

有水分系统设计是真的、湿实验是真做的、已经过 Nature 同行评审,这一层没问题;但三个最有传播力的声称都打了折:「2 天重现 10 年工作」是同组已发表结论的跨物种延伸且喂了自家数据,「18 倍治疗窗」只在 4 个 AML 细胞系里的 1 个成立,「超越专家和前沿模型」用的是系统自己的 Elo 评委,换成盲评专家后优势缩到 2.36 vs 2.45。代码闭源、访问名额已满,外部只能照伪代码复刻,现有复刻没能命中论文的任何候选药。
Co-Scientist 在「只有极少背景信息」(with only minimal background information,论文正文原话)的条件下,2 天内独立提出了 cf-PICI 借用多种噬菌体尾部扩张宿主范围这一「groundbreaking」假设,重现了实验室约 10 年的迭代研究(Fig 1c 明确标注 2015-2024 vs 2 days)。
两处对不上。一是先验并不空白:同一课题组(Penadés 组)2022 年就在 Cell Host & Microbe 发过题为《A widespread family of phage-inducible chromosomal islands only steals bacteriophage tails to spread in nature》的论文(Semantic Scholar 可查,2022,Cell Host and Microbe),「靠劫持噬菌体尾部传播」这个机制已经写进了标题;AI 的增量是把它推广到跨物种。二是输入口径不一致:IEEE Spectrum 2026 年对 Penadés 和 Costa 的采访明确写「They fed the system their data, background papers, and a pointed question about what hidden mechanism might explain the jump」(spectrum.ieee.org/ai-co-scientist),这与正文「minimal background information」不是一回事。另外该篇 supplementary note 10.8 里展示的 cf-PICI 示例输出其实是另一个(OMV 介导的 MCOMT)假设,不是那个被验证的正确答案。
新颖候选药 KIRA6 对 KG-1a 展现「highly selective cytotoxicity」,与非恶性对照 TK6 相比有 18 倍分离度,构成有前景的体外治疗窗。
用论文 Fig 3d-h 自己给的 IC50 一算就打折:KIRA6 在 4 个 AML 细胞系里只有 KG-1a(0.01 µM)明显优于 TK6 对照(0.18 µM);NOMO-1 是 0.14 µM,与对照基本持平;MOLM-13 1.75 µM、HL-60 0.87 µM,反而比非恶性对照差 5~10 倍。也就是说「选择性」只在 1/4 的细胞系成立,论文自己在正文里也承认 MOLM-13 和 HL-60「markedly less sensitive」,但摘要与图注只留下了 18 倍。更细的问题:KG-1a 的点估计 0.01 µM 落在它自己报的 95% CI(0.012–0.081 µM)之外,若取 CI 上界与 TK6 的 CI 下界(0.12 µM)比,窗口只有约 1.5 倍。n=3、无盲法(论文 Statistics and reproducibility 节自述)。
自动评估显示 Co-Scientist 随测试时算力增长持续超越 o1/o3-mini-high/DeepSeek R1 以及人类专家的 best guess,专家盲评也最偏好它的输出。
Elo 是系统自己的 Ranking agent 用 LLM debate 打出来的,论文在 Extended Data Fig 1 图注里写明「the Elo metric is auto-evaluated and not based on independent ground truth」。这个自评榜的一个可疑结果是:7 位博士/faculty 级专家的 best guess 被排在全部 7 个参赛者的最低位(Fig 2b,约 1258,低于 Gemini 2.0 Pro/Flash Thinking/o1/R1/o3),更像是评委偏好自家那种长篇结构化提案的格式。换成 11 个 goal 的盲评专家打分(Fig 2c)后优势就很小了:偏好排名 2.36 对 o1/Gemini 2.0 Pro 的 2.45,误差棒重叠,impact 3.09 与 o1 完全相同,只有 novelty(3.64 vs 3.09)拉开了距离。论文自己加了一句「These evaluations reflect subjective expert assessments, not objective ground truth」。唯一的客观锚点 GPQA diamond top-1 78.4%,还是从大量生成里按 Elo 挑最好的(best-of-N),而同期 o3-mini-high 单模型报的是 79.7%。
为了透明和可复现,提供了完整伪代码(Supplementary Note 8)和逐 agent 的原始 prompt(Note 9),并启动 experimental access program,预期通过 Google API 向数千名科学家开放。
Code availability 节原文:「The full source code for the Co-Scientist system is not publicly available」,理由是与内部专有基础设施深度耦合、算力需求巨大、自主 agent 的安全隐忧。访问通道实际是关着的:IEEE Spectrum(2026-08)报道 trusted tester program「currently at capacity」、表单已停止接收新申请。三个第三方按公开伪代码/prompt 做的复刻(Kaimen-Inc/Co-Scientist 237★、llnl/open-ai-co-scientist 63★、jataware/open-coscientist 58★)都只能复刻架构,LLNL 那个仓库还挂着「quality tests of generated hypotheses」等 20 个 open issue。
多智能体 harness(生成-辩论-进化的完整流水线)相比直接问模型能系统性提升假设质量。
目前唯一公开的横向对照来自复刻方 Kaimen-Inc 的 docs/BENCH_RESULTS.md(20 次 bench,记录了每次的 Elo、花费和全部假设):同一 preset 重复跑两次,direct→pipeline 的 Elo 差就换了符号(claude-haiku-4.5 +180 → −28),不同模型的 Δ Elo 从 +172 到 −89 没有规律,作者自己的结论是「whether it helps is not reproducible at this sample size」,原因是每个候选只出 1 个假设、每对约 2 场对局,锦标赛结果被「抽到哪个假设」主导。7 次带 gold set 的 AML 复现全部 0/3 或 0/5,48 个 AML 假设里没有一个命中论文那批候选药,只在机制层面收敛(28/48 落在 leukemic stem cell 靶向)。需要说明:这是外部小规模复刻,检索工具和算力量级都和原系统不同,只能说明「照公开描述做不出同等结果」,不构成对原系统的直接否证。
肝纤维化方向发现了新的表观遗传靶点,其中 Vorinostat 是已获 FDA 批准的抗癌药,构成跨领域(癌症→肝纤维化)的意外连接。
这条最扎实(Guan et al., Adv. Sci. 2025, doi 10.1002/advs.202508751,独立课题组、人肝类器官、Vorinostat 使 TGFβ 诱导的染色质结构改变下降 91%),但「novel」要打折:Peltz 自己在 PubMed 上检索到 7 篇已把 Vorinostat 与该语境放在一起的文献(psypost 报道),HDAC 抑制剂的抗纤维化作用在更早的文献里也有(如 Mol. Vis. 2015 关于角膜纤维化的工作)。系统做的是从既有线索里挑出并排序,不是无先验的凭空提出;另外三个靶点里只有两个在类器官上真的有抗纤维化活性。

与我们方向的关系

这篇是「端到端 AI Scientist」里工业界路线的代表,和写论文流派(AI Scientist、Agent Laboratory 那一支)的取舍正好相反:它不生成论文、不做实验执行,只把交付物压缩成「一份排好序的、可被湿实验证伪的假设清单」,把验证成本外包给真实实验室和领域专家。人力投入的数字很说明问题——AML 那个 goal 专家写 prompt <1 小时、最终筛选 ~3 小时,也就是说系统真正替掉的是文献搜索和假设枚举,没替掉判断。如果课题组要做 AI-for-science 的系统,这个「交付物边界」比它的架构更值得抄。

可直接借用的三个机制:(1) tournament + Elo 作为一种不需要梯度的选择压力,只要有一个还算靠得住的 pairwise judge,就能把测试时算力换成质量,而且 Proximity 图安排对局这个细节能显著降低比赛开销;(2) Evolution 只加不改、新假设必须回锦标赛赢——这是防止「改进」把 top 榜改坏的最省事做法;(3) Meta-review 把复现性问题追加进下一轮 prompt,等于用长上下文做了一次无反传的经验积累,在没有训练预算时很实用。同时要吸取它踩的坑:Reflection 不接检索时新颖性打分 6.14 → 接检索 2.38,说明任何「LLM 自评新颖性」的模块都必须外挂检索,否则数字是假的;主指标千万不要用自家系统产出的 Elo 单独汇报,这篇最受质疑的就是这一点(自评榜把人类专家排在最低)。

反面参考同样有价值:如果课题组要做类似的验证,注意它的统计功效——11 个 goal 的专家盲评、n=3 的体外三复孔、单细胞系的 18 倍窗口,都属于「够发但不够定论」的量级,而论文摘要和公司博客只留了最漂亮的那个数。做我们自己的评估时,把每个细胞系/每个任务的完整表格放出来(哪怕难看),比只报最优值更能站住。

阅读笔记

读法上的坑:arXiv 只提供 PDF(下载下来的 source.tar.gz 其实是 PDF,file 一下就知道),没有 tex 源,arxiv.org/html/2502.18864 也不存在,deepxiv 返回的 sections 为空且 keywords/tldr 明显串到了别的论文,所以只能 pdftotext + pdftocairo 手动切图。arXiv 上的版本已经被更新成 Nature 定稿,标题也从《Towards an AI co-scientist》改成了《Accelerating scientific discovery with Co-Scientist》(Nature, 2026, s41586-026-10644-y),系统名统一成 Co-Scientist,引用时注意别混。这篇最有复用价值的部分不在正文而在 Supplementary Note 8(六个 agent 的伪代码)和 Note 9(逐 agent 的完整 prompt)、Note 10(每个 agent 的真实输出示例,含一场完整的 Ranking 辩论),这也是三个第三方复刻的直接依据。另外 Fig 3 里 KG-1a 的 IC50 点估计(0.01 µM)落在自己的 95% CI(0.012–0.081 µM)之外,这个内部不一致 Nature 版仍然存在。

材料清单

Nature 正式版www.nature.com/articles/s41586-026-10644-y
Accelerating scientific discovery with Co-Scientist, Nature 2026;arXiv 版已同步更新为此定稿
同期论文:cf-PICIdoi.org/10.1016/j.cell.2025.08.018
Penadés et al., Cell 2025,AI 假设与实验结果的对照;配套实验论文见 Cell 188, 6636-6653
同期论文:肝纤维化doi.org/10.1002/advs.202508751
Guan et al., Adv. Sci. 2025,Vorinostat 等三个表观遗传靶点在人肝类器官上的验证
前置文献(新颖性核查)www.cell.com/cell-host-microbe/fulltext/S1931-3128(22)00573-X
同组 2022 年 Cell Host & Microbe:cf-PICI「只劫持噬菌体尾部」的机制已在标题里
第三方复刻 + benchgithub.com/Kaimen-Inc/Co-Scientist
237★,docs/BENCH_RESULTS.md 有 20 次 bench 的完整记录:7 次 AML gold set 全 0/3 或 0/5,direct vs pipeline 的 Elo 差不可复现
第三方复刻github.com/llnl/open-ai-co-scientist
LLNL 版,63★,20 个 open issue 含「quality tests of generated hypotheses」未做
第三方报道(正面)spectrum.ieee.org/ai-co-scientist
IEEE Spectrum 2026,采访 Peltz / Penadés / Costa,含「喂了自家数据和背景论文」的关键细节和批评意见
第三方报道(批评)techcrunch.com/2025/03/05/experts-dont-think-ai-is-ready-to-be-a-co-scientist/
MIT Sara Beery、病理医生 Favia Dubyk 等人对结果颗粒度和不可复现的质疑
评估数据集huggingface.co/datasets/Idavidrein/gpqa
GPQA diamond,论文里唯一带 ground truth 的客观指标来源(top-1 78.4%)

同类条目