Juraj Gottweis, Wei-Hung Weng, Alexander Daryin, Tao Tu, ... Demis Hassabis, Pushmeet Kohli, Alan Karthikesalingam, Vivek Natarajan (Google / Google DeepMind, 51 位作者) · Google / Google DeepMind · arXiv · 2025-02 · 被引 428
一句话Google 在 Gemini 2.0 上搭的六智能体系统,核心是「生成-评审-进化」+ Elo 锦标赛,让假设在自我博弈中被反复评审和改写;在 AML 药物重定位、肝纤维化靶点、cf-PICI 基因转移三个方向做了湿实验验证(KIRA6 在 KG-1a 细胞系 IC50 10 nM、Vorinostat 使 TGFβ 诱导的染色质改变下降 91%),2026 年正式发在 Nature。但代码不开源,主指标 Elo 是系统自评,「18 倍治疗窗」只在 4 个 AML 细胞系里的 1 个成立,「2 天重现 10 年工作」的那个假设其实是同组已发表结论的跨物种延伸。
这是什么
这是 Google Research / DeepMind 2025 年 2 月放出的系统论文(arXiv 2502.18864),2026 年以《Accelerating scientific discovery with Co-Scientist》正式发表于 Nature。它的定位不是「写论文的 AI」,而是「提出可被湿实验证伪的假设的 AI」:科学家用自然语言给一个 research goal(可以附上偏好、实验约束、几百篇 PDF),系统输出一份按 Elo 排序的假设清单和一份 research overview,附带实验方案和文献引用。作者反复强调它超越 deep research 类工具的地方在于产出「新知识」而不是文献综述。
验证部分是这篇的重头,也是它区别于同期 AI-Scientist 类工作的地方:三个真实生物医学问题,全部有专家 in the loop,全部落到体外实验。药物重定位(AML,4 个 AML 细胞系 + 1 个非 AML 对照 TK6)、新靶点发现(肝纤维化,人肝类器官)、机制解释(cf-PICI 跨物种传播,与 Imperial College 合作、同期发表在 Cell)。作者自己把这些定性为 preliminary evidence,不是临床结论。
关键点是 Elo 并不是被优化的目标函数,它是评审与辩论反馈闭环的副产品。论文也承认 Elo 的局限(引了对 Elo 假设的批评),并明确写 Elo 是 auto-evaluated、不基于 ground truth。为了给 Elo 找一点客观锚点,作者把 GPQA diamond 的题当作 research goal 输入,发现 Elo 桶越高、答对率越高,按最高 Elo 取答案时 top-1 准确率 78.4%。
Evolution 只加不改,Meta-review 用 prompt 拼接代替反传
Evolution agent 的六种改进策略(接检索补证据、改可行性、从他人假设取灵感、组合、简化、跳出框架)有一个刻意的设计约束:它只生成新假设,从不修改或替换原假设。新假设必须自己回到锦标赛里去赢,所以一次失败的「改进」不会污染 top 榜。这个约束很值得借鉴。
安全评估:1200 条对抗性 research goal(横跨 40 个生物医学与科学主题)+ 2000 多条安全 goal,拒绝分类器「全部通过」;但数据集因敏感性不公开,只能按需索取。
实证核查
有水分系统设计是真的、湿实验是真做的、已经过 Nature 同行评审,这一层没问题;但三个最有传播力的声称都打了折:「2 天重现 10 年工作」是同组已发表结论的跨物种延伸且喂了自家数据,「18 倍治疗窗」只在 4 个 AML 细胞系里的 1 个成立,「超越专家和前沿模型」用的是系统自己的 Elo 评委,换成盲评专家后优势缩到 2.36 vs 2.45。代码闭源、访问名额已满,外部只能照伪代码复刻,现有复刻没能命中论文的任何候选药。
Co-Scientist 在「只有极少背景信息」(with only minimal background information,论文正文原话)的条件下,2 天内独立提出了 cf-PICI 借用多种噬菌体尾部扩张宿主范围这一「groundbreaking」假设,重现了实验室约 10 年的迭代研究(Fig 1c 明确标注 2015-2024 vs 2 days)。
两处对不上。一是先验并不空白:同一课题组(Penadés 组)2022 年就在 Cell Host & Microbe 发过题为《A widespread family of phage-inducible chromosomal islands only steals bacteriophage tails to spread in nature》的论文(Semantic Scholar 可查,2022,Cell Host and Microbe),「靠劫持噬菌体尾部传播」这个机制已经写进了标题;AI 的增量是把它推广到跨物种。二是输入口径不一致:IEEE Spectrum 2026 年对 Penadés 和 Costa 的采访明确写「They fed the system their data, background papers, and a pointed question about what hidden mechanism might explain the jump」(spectrum.ieee.org/ai-co-scientist),这与正文「minimal background information」不是一回事。另外该篇 supplementary note 10.8 里展示的 cf-PICI 示例输出其实是另一个(OMV 介导的 MCOMT)假设,不是那个被验证的正确答案。
自动评估显示 Co-Scientist 随测试时算力增长持续超越 o1/o3-mini-high/DeepSeek R1 以及人类专家的 best guess,专家盲评也最偏好它的输出。
Elo 是系统自己的 Ranking agent 用 LLM debate 打出来的,论文在 Extended Data Fig 1 图注里写明「the Elo metric is auto-evaluated and not based on independent ground truth」。这个自评榜的一个可疑结果是:7 位博士/faculty 级专家的 best guess 被排在全部 7 个参赛者的最低位(Fig 2b,约 1258,低于 Gemini 2.0 Pro/Flash Thinking/o1/R1/o3),更像是评委偏好自家那种长篇结构化提案的格式。换成 11 个 goal 的盲评专家打分(Fig 2c)后优势就很小了:偏好排名 2.36 对 o1/Gemini 2.0 Pro 的 2.45,误差棒重叠,impact 3.09 与 o1 完全相同,只有 novelty(3.64 vs 3.09)拉开了距离。论文自己加了一句「These evaluations reflect subjective expert assessments, not objective ground truth」。唯一的客观锚点 GPQA diamond top-1 78.4%,还是从大量生成里按 Elo 挑最好的(best-of-N),而同期 o3-mini-high 单模型报的是 79.7%。
为了透明和可复现,提供了完整伪代码(Supplementary Note 8)和逐 agent 的原始 prompt(Note 9),并启动 experimental access program,预期通过 Google API 向数千名科学家开放。
Code availability 节原文:「The full source code for the Co-Scientist system is not publicly available」,理由是与内部专有基础设施深度耦合、算力需求巨大、自主 agent 的安全隐忧。访问通道实际是关着的:IEEE Spectrum(2026-08)报道 trusted tester program「currently at capacity」、表单已停止接收新申请。三个第三方按公开伪代码/prompt 做的复刻(Kaimen-Inc/Co-Scientist 237★、llnl/open-ai-co-scientist 63★、jataware/open-coscientist 58★)都只能复刻架构,LLNL 那个仓库还挂着「quality tests of generated hypotheses」等 20 个 open issue。
多智能体 harness(生成-辩论-进化的完整流水线)相比直接问模型能系统性提升假设质量。
目前唯一公开的横向对照来自复刻方 Kaimen-Inc 的 docs/BENCH_RESULTS.md(20 次 bench,记录了每次的 Elo、花费和全部假设):同一 preset 重复跑两次,direct→pipeline 的 Elo 差就换了符号(claude-haiku-4.5 +180 → −28),不同模型的 Δ Elo 从 +172 到 −89 没有规律,作者自己的结论是「whether it helps is not reproducible at this sample size」,原因是每个候选只出 1 个假设、每对约 2 场对局,锦标赛结果被「抽到哪个假设」主导。7 次带 gold set 的 AML 复现全部 0/3 或 0/5,48 个 AML 假设里没有一个命中论文那批候选药,只在机制层面收敛(28/48 落在 leukemic stem cell 靶向)。需要说明:这是外部小规模复刻,检索工具和算力量级都和原系统不同,只能说明「照公开描述做不出同等结果」,不构成对原系统的直接否证。
肝纤维化方向发现了新的表观遗传靶点,其中 Vorinostat 是已获 FDA 批准的抗癌药,构成跨领域(癌症→肝纤维化)的意外连接。