← 返回资料站  /  AI Scientist
论文 端到端系统 ★ 必读

Kosmos: An AI Scientist for Autonomous Discovery

Kosmos:用结构化世界模型撑起 12 小时长时程自主研究
一句话Edison Scientific(FutureHouse 商业化分拆)的数据驱动发现系统:给定一个开放研究目标和数据集,连续跑最长 12 小时、约 200 个 agent rollouts,平均写 42,000 行代码、读 1,500 篇文献,产出每句话都带 code/文献引用的研究报告;独立打分显示报告陈述准确率 79.4%,论文展示了 7 个跨领域案例(3 个复现人类未发表结论、4 个声称新贡献)。

这是什么

Kosmos 是 FutureHouse 团队(Robin、PaperQA2 的作者)分拆出的公司 Edison Scientific 于 2025 年 11 月发布的"AI scientist"。定位是数据驱动发现(data-driven discovery):用户提供一个开放式研究目标加一个不超过 5GB 的数据集,系统自主循环做数据分析、文献检索和假设生成,最后合成 3-4 份科研报告。它不做湿实验,也不像 Sakana 的 AI Scientist 那样局限在 ML 领域——论文展示的案例横跨代谢组学、钙钛矿太阳能电池、连接组学、统计遗传学、蛋白组学和转录组学。

核心卖点是长时程连贯性:此前的系统(包括他们自己的 Robin)跑不了几十个 action 就会失焦,而 Kosmos 用一个持续更新的结构化世界模型(structured world model)在数据分析 agent 和文献检索 agent 之间传递信息,声称能连贯执行 20 个 cycle、约 200 个 agent rollouts,代码产出是 Robin 的 9.8 倍。对关心 agent 长时程记忆与状态管理的人来说,这是把"上下文管理"当成系统第一性问题来解的代表性工程案例。

需要注意它是商业产品而非开源项目:系统跑在 platform.edisonscientific.com 上,学术用户前几次免费、之后每次运行 $200(Alzforum 2025-11 报道,创始人 Rodriques 自述当时已有 3 万用户)。论文只开源了论文插图的复现代码,系统本体和世界模型实现均未公开。

系统总览与主要指标:(a) 输入研究目标+数据集,世界模型协调数据分析 agent(圆点)与文献 agent(方块)的数百个 rollouts,产出溯源报告;(b) 与 Robin/Finch/PaperQA2 的代码量与读文献量对比(42,500 行 vs Robin 4,310 行);(c) 102 条陈述的分类准确率——注意解读类只有 58%;(e/f) 合作者估计的等效专家时间与有价值发现数随 cycle 数增长,阴影为 ±1 SD,离散度很大。
系统总览与主要指标:(a) 输入研究目标+数据集,世界模型协调数据分析 agent(圆点)与文献 agent(方块)的数百个 rollouts,产出溯源报告;(b) 与 Robin/Finch/PaperQA2 的代码量与读文献量对比(42,500 行 vs Robin 4,310 行);(c) 102 条陈述的分类准确率——注意解读类只有 58%;(e/f) 合作者估计的等效专家时间与有价值发现数随 cycle 数增长,阴影为 ±1 SD,离散度很大。

机制与做法

世界模型驱动的发现循环

每次运行由一个研究目标 + 数据集初始化。每个 cycle 里,Kosmos 并行发起最多 10 个任务,分派给两类通用 agent:数据分析 agent(BixBench 一系工作)在 Jupyter 环境写代码分析数据,文献检索 agent(PaperQA2 一系)读全文文献。任务结束后,各 rollout 的摘要写回世界模型;下一个 cycle 开始时,系统查询世界模型来提出新一轮任务。也就是说 agent 之间不共享原始对话历史,信息全部经由这个结构化状态中转——这是它能跑到别家 8 倍迭代数而不失焦的机制。跑满后(最多 20 cycle / 12 小时),从世界模型合成报告。

一次平均运行:166 个数据分析 rollouts 共写 42,500 行代码,36 个文献 rollouts 读约 1,500 篇论文。对比之下 Robin 平均 4,310 行代码。论文没有给出世界模型的具体 schema 和更新算法——这部分恰恰是最有价值的工程细节,属于商业机密没公开。

Discovery 6(自创方法的例子):给定 AD 患者 tau+/tau- 神经元 minipool 蛋白组,Kosmos 先做差异分析发现 ECM 通路在 pseudotime 后期下调(b),然后自主提出用 segmented regression 在连续 pseudotime 上定位 ECM 崩解 breakpoint(c-f,0.58 处,晚于 tau 阳性转折),下方橙色区域是人类用 bootstrap、滑窗相关和独立转录组数据做的验证。蓝/橙分区(Kosmos 产出 vs 人类验证)是全文所有案例图的固定版式。
Discovery 6(自创方法的例子):给定 AD 患者 tau+/tau- 神经元 minipool 蛋白组,Kosmos 先做差异分析发现 ECM 通路在 pseudotime 后期下调(b),然后自主提出用 segmented regression 在连续 pseudotime 上定位 ECM 崩解 breakpoint(c-f,0.58 处,晚于 tau 阳性转折),下方橙色区域是人类用 bootstrap、滑窗相关和独立转录组数据做的验证。蓝/橙分区(Kosmos 产出 vs 人类验证)是全文所有案例图的固定版式。

全程溯源与 statement 级审计

报告里每一句陈述必须引用出处:要么是数据分析 agent 生成的 Jupyter notebook(平台上可点开 trajectory 查看),要么是文献 agent 找到的原始文献。这个设计让人类可以逐句核查。

作者从 3 份代表性报告抽取 102 条 statements,请领域专家在拿不到 Kosmos 原始代码和引文的情况下独立复核:数据分析类 85.5% 可复现(n=55),文献类 82.1% 有原始文献支持(n=28),但"综合解读"类只有 57.9% 准确(n=19),总体 79.4%。作者自己承认 Kosmos 倾向于把统计显著等同于科学上有价值、爱发明难以解读的自创指标。

Discovery 7(唯一被认定"人类没发现过"的新机制):从小鼠脑老化 snRNAseq 出发,Kosmos 发现 Atp10a 随年龄在内嗅皮层下调,假设检验循环(d)排除了其他 flippase 代偿的可能,提出 flippase 集体下调→膜磷脂酰丝氨酸外翻→小胶质细胞吞噬的"eat-me"机制;人类随后在独立数据集和 AD Braak 0 vs 2 期人脑数据中验证(f/g)。看这张图可以理解 Kosmos 迭代假设探索的真实工作方式。
Discovery 7(唯一被认定"人类没发现过"的新机制):从小鼠脑老化 snRNAseq 出发,Kosmos 发现 Atp10a 随年龄在内嗅皮层下调,假设检验循环(d)排除了其他 flippase 代偿的可能,提出 flippase 集体下调→膜磷脂酰丝氨酸外翻→小胶质细胞吞噬的"eat-me"机制;人类随后在独立数据集和 AD Braak 0 vs 2 期人脑数据中验证(f/g)。看这张图可以理解 Kosmos 迭代假设探索的真实工作方式。

七个案例:从复现到新发现

案例设计有梯度:(1) 复现未发表/模型 cutoff 之后的人类结论——如小鼠低温神经保护代谢组(top15 代谢物 log10 fold-change 与人类分析 R²=0.998)、钙钛矿退火湿度是器件性能"fatal filter"(还额外发现 Jsc 随 DMF 分压线性下降,后被原作者验证);(2) 用新方法支持已有结论——如对心肌纤维化做 proteome-wide Mendelian randomization,与人工分析 31/32 蛋白重合、效应量相关 r=0.9991,均指向 SOD2;(3) 自创分析方法——在 AD 蛋白组 pseudotime 上用 segmented regression 定位 ECM 崩解的 breakpoint(0.58,晚于 tau 阳性转折 0.5);(4) 人类没发现的新机制——老化内嗅皮层神经元 flippase 家族集体下调 + 小胶质细胞吞噬通路上调的"eat-me"信号假说,在独立数据集和人类 AD Braak 分期数据中得到验证。

值得注意的是论文对失败也如实记录:Discovery 3 里 Kosmos 用 KS 检验错误地否决了明明视觉上成立的分布坍缩、powerlaw 包拟出无意义的负 μ 被人工忽略;Discovery 4 里 coloc pipeline 因 p 值存成 0 等级联问题直接跑崩,miR-222 结合位点注释也是错的。这些细节比宣传口径更能反映系统真实水平。

论文自认的边界

Discussion 部分列了不少硬限制:只能处理约 5GB 以内、清洗好的表格类数据,不擅长图像/原始测序文件;不能自主拉外部公共数据做正交验证;运行是随机的,多次独立运行不保证收敛到同一发现;结果对研究目标的措辞和数据预处理方式敏感(作者承认 Fig 2/5/6 的预备运行随预处理不同产出完全不同,"data not shown");运行中途无法人工干预。另外,平均每份报告约 25 条 claims、背后 8-9 条 agent trajectories,鉴别哪些发现真有价值仍然要靠领域专家人工筛,没有自动化方法。

关键结果

实证核查

有水分系统是真的、案例经过人类领域专家逐一验证、失败模式也如实披露,这部分比多数 AI scientist 论文扎实;但"autonomous discovery"和"等效 6 个月科研"的口径明显超出证据——评估者与作者高度重叠、数据集多为人类带着假设采集的,且系统闭源,最核心的世界模型实现无法核查。
论文标题与叙事:Kosmos 实现"Autonomous Discovery",一次运行等于人类 6 个月研究。
Hacker News 热帖(news.ycombinator.com/item?id=45823358)的高票质疑成立:7 个案例里多数是把人类为验证特定假设而采集、清洗甚至排好序的数据交给 Kosmos(如 Discovery 6 的 pseudotime 轴是人工预先算好的),它复现了同一结论——提出假设、设计实验这些环节仍是人做的。"6.14 个月"来自 7 个合作组的自报估计(σ=2.49,离散度近一半),而这些"leading academic groups"多数成员就是论文共同作者(UCL、WashU、Stanford 等合作者均在作者列表),不是独立第三方。
"独立科学家发现报告中 79.4% 的陈述准确"。
样本只有 3 份"代表性报告"里抽的 102 条 statements,由作者协调的专家复核;最关键的"综合解读"类只有 57.9% 准确且 n=19。Alzforum 报道(2025-11-21)中剑桥的 Georg Meisl 直言:按论文自己的指标五分之一结论是错的,"可靠性而非速度是我信任它做独立分析之前必须大幅改进的东西……现阶段更像咨询一位读书多的同事,而不是一次严谨分析"。
"每条陈述都可溯源,整个发现过程透明,便于独立验证"。
溯源只对平台用户成立,系统本身完全闭源:GitHub 上 EdisonScientific/kosmos-figures(29 stars,0 issues)只有论文插图的验证代码,不含系统实现;世界模型的 schema、更新和查询机制论文一字未提。想用只能上 Edison 平台按次付费(学术前 6 次免费,之后 $200/run,Alzforum 引 Rodriques 原话)。社区有人按论文自行重建了 jimmc414/Kosmos(574 stars,2026-04 仍在更新),但那是非官方猜测性实现,不能用来验证论文声称。
系统能跨领域稳定产出发现。
论文 Discussion 自己承认:运行结果随机、多次运行不保证收敛;对 objective 措辞和数据预处理敏感,Fig 2/5/6 的预备运行随预处理不同得到不同结论且"data not shown";正文记录的翻车包括 KS 检验误判分布坍缩(Disc. 3)、powerlaw 包拟出负 μ 被人工剔除(Disc. 3)、coloc pipeline 因 p=0 级联崩溃(Disc. 4)、miR-222 结合位点注释错误(Disc. 4)。也就是说论文展示的 7 个案例是多次运行 + 人工筛选后的高光集,不是平均水平。
旁证:发布后的实际采用情况。
商业面进展是真的:2025-12 Edison Scientific 拿到 $70M 种子轮(Spark Capital 领投),2026-05 与药企 Incyte 达成 R&D 合作(investor.incyte.com 官方公告),自称 5 万+ 用户;S2 显示论文引用 86 次(Google Scholar 口径 140)。但截至 2026-08 未见独立团队发表对其核心指标(79.4% 准确率、expert-months)的系统性复测。

与我们方向的关系

这篇是课题组关心的"长时程记忆与状态管理"方向上最完整的工程案例:它的答案是不让 agent 共享对话历史,而是把所有 rollout 的产出压缩进一个集中式结构化世界模型,读写都走这个中间层。200 个 rollouts 不失焦的关键就是这个"状态外置 + 摘要写回 + 查询驱动下一轮任务"的循环,可以直接对照我们自己系统里 context 爆炸的问题。遗憾是实现细节闭源,复刻只能参考社区版 jimmc414/Kosmos 的猜测性实现。

另外两个可借鉴的点:一是 statement 级溯源约束(每句话必须引用 notebook 或文献),这既是产品可信度设计,也实际上给评估提供了抓手;二是它的评估方法本身——按陈述类型(数据分析/文献/解读)分层审计准确率,暴露出"解读类"才是短板(57.9%),这个评估框架比笼统的"发现了 X"更值得抄。同时它也是一个反面提醒:评估者与作者重叠、案例经人工筛选,我们自己做系统评估时要避开这两个坑。

阅读笔记

读报告时注意:Kosmos 的"解读类"陈述错误率超过 40%,引用它的结论前先点开 trajectory 看 notebook。世界模型概念由 Andrew White 提出(见 Statement of contributions),与视频生成那一支的 world model 完全不是一回事,检索文献时别混。前代系统 Robin(arXiv 2505.13400)和文献 agent PaperQA2 是开源的,想理解 Kosmos 的组件可以从那两个仓库入手。

材料清单

TeX 源码
已存档:Raw/kosmos/source/
论文插图验证代码github.com/EdisonScientific/kosmos-figures
官方唯一开源部分:7 个案例的图表与验证分析,不含系统实现(29 stars)
社区复刻github.com/jimmc414/Kosmos
按论文重建的非官方开源实现,574 stars,2026-04 仍在更新;想理解世界模型机制可参考
Hacker News 讨论news.ycombinator.com/item?id=45823358
高票质疑:"发现"多为在人类为验证假设而采集的数据上复现同一结论
Alzforum 报道www.alzforum.org/news/research-news/introducing-kosmos-ai-scientist-makes-discoveries-overnight
含定价($200/run)、用户规模及多位领域科学家的正反评论
平台与文档docs.edisonscientific.com/
Edison 平台使用文档,学术账号有免费额度

同类条目