论文
端到端系统
★ 必读
Kosmos: An AI Scientist for Autonomous Discovery
Kosmos:用结构化世界模型撑起 12 小时长时程自主研究
Ludovico Mitchener, Angela Yiu, Benjamin Chang, et al. (Edison Scientific / FutureHouse) · Edison Scientific / FutureHouse · arXiv · 2025-11 · 被引 86
一句话 Edison Scientific(FutureHouse 商业化分拆)的数据驱动发现系统:给定一个开放研究目标和数据集,连续跑最长 12 小时、约 200 个 agent rollouts,平均写 42,000 行代码、读 1,500 篇文献,产出每句话都带 code/文献引用的研究报告;独立打分显示报告陈述准确率 79.4%,论文展示了 7 个跨领域案例(3 个复现人类未发表结论、4 个声称新贡献)。
这是什么 Kosmos 是 FutureHouse 团队(Robin、PaperQA2 的作者)分拆出的公司 Edison Scientific 于 2025 年 11 月发布的"AI scientist"。定位是数据驱动发现(data-driven discovery):用户提供一个开放式研究目标加一个不超过 5GB 的数据集,系统自主循环做数据分析、文献检索和假设生成,最后合成 3-4 份科研报告。它不做湿实验,也不像 Sakana 的 AI Scientist 那样局限在 ML 领域——论文展示的案例横跨代谢组学、钙钛矿太阳能电池、连接组学、统计遗传学、蛋白组学和转录组学。
核心卖点是长时程连贯性:此前的系统(包括他们自己的 Robin)跑不了几十个 action 就会失焦,而 Kosmos 用一个持续更新的结构化世界模型(structured world model)在数据分析 agent 和文献检索 agent 之间传递信息,声称能连贯执行 20 个 cycle、约 200 个 agent rollouts,代码产出是 Robin 的 9.8 倍。对关心 agent 长时程记忆与状态管理的人来说,这是把"上下文管理"当成系统第一性问题来解的代表性工程案例。
需要注意它是商业产品而非开源项目:系统跑在 platform.edisonscientific.com 上,学术用户前几次免费、之后每次运行 $200(Alzforum 2025-11 报道,创始人 Rodriques 自述当时已有 3 万用户)。论文只开源了论文插图的复现代码,系统本体和世界模型实现均未公开。
系统总览与主要指标:(a) 输入研究目标+数据集,世界模型协调数据分析 agent(圆点)与文献 agent(方块)的数百个 rollouts,产出溯源报告;(b) 与 Robin/Finch/PaperQA2 的代码量与读文献量对比(42,500 行 vs Robin 4,310 行);(c) 102 条陈述的分类准确率——注意解读类只有 58%;(e/f) 合作者估计的等效专家时间与有价值发现数随 cycle 数增长,阴影为 ±1 SD,离散度很大。 机制与做法 世界模型驱动的发现循环
每次运行由一个研究目标 + 数据集初始化。每个 cycle 里,Kosmos 并行发起最多 10 个任务,分派给两类通用 agent:数据分析 agent(BixBench 一系工作)在 Jupyter 环境写代码分析数据,文献检索 agent(PaperQA2 一系)读全文文献。任务结束后,各 rollout 的摘要写回世界模型;下一个 cycle 开始时,系统查询世界模型来提出新一轮任务。也就是说 agent 之间不共享原始对话历史,信息全部经由这个结构化状态中转——这是它能跑到别家 8 倍迭代数而不失焦的机制。跑满后(最多 20 cycle / 12 小时),从世界模型合成报告。
一次平均运行:166 个数据分析 rollouts 共写 42,500 行代码,36 个文献 rollouts 读约 1,500 篇论文。对比之下 Robin 平均 4,310 行代码。论文没有给出世界模型的具体 schema 和更新算法——这部分恰恰是最有价值的工程细节,属于商业机密没公开。
Discovery 6(自创方法的例子):给定 AD 患者 tau+/tau- 神经元 minipool 蛋白组,Kosmos 先做差异分析发现 ECM 通路在 pseudotime 后期下调(b),然后自主提出用 segmented regression 在连续 pseudotime 上定位 ECM 崩解 breakpoint(c-f,0.58 处,晚于 tau 阳性转折),下方橙色区域是人类用 bootstrap、滑窗相关和独立转录组数据做的验证。蓝/橙分区(Kosmos 产出 vs 人类验证)是全文所有案例图的固定版式。 全程溯源与 statement 级审计
报告里每一句陈述必须引用出处:要么是数据分析 agent 生成的 Jupyter notebook(平台上可点开 trajectory 查看),要么是文献 agent 找到的原始文献。这个设计让人类可以逐句核查。
作者从 3 份代表性报告抽取 102 条 statements,请领域专家在拿不到 Kosmos 原始代码和引文的情况下独立复核:数据分析类 85.5% 可复现(n=55),文献类 82.1% 有原始文献支持(n=28),但"综合解读"类只有 57.9% 准确(n=19),总体 79.4%。作者自己承认 Kosmos 倾向于把统计显著等同于科学上有价值、爱发明难以解读的自创指标。
Discovery 7(唯一被认定"人类没发现过"的新机制):从小鼠脑老化 snRNAseq 出发,Kosmos 发现 Atp10a 随年龄在内嗅皮层下调,假设检验循环(d)排除了其他 flippase 代偿的可能,提出 flippase 集体下调→膜磷脂酰丝氨酸外翻→小胶质细胞吞噬的"eat-me"机制;人类随后在独立数据集和 AD Braak 0 vs 2 期人脑数据中验证(f/g)。看这张图可以理解 Kosmos 迭代假设探索的真实工作方式。 七个案例:从复现到新发现
案例设计有梯度:(1) 复现未发表/模型 cutoff 之后的人类结论——如小鼠低温神经保护代谢组(top15 代谢物 log10 fold-change 与人类分析 R²=0.998)、钙钛矿退火湿度是器件性能"fatal filter"(还额外发现 Jsc 随 DMF 分压线性下降,后被原作者验证);(2) 用新方法支持已有结论——如对心肌纤维化做 proteome-wide Mendelian randomization,与人工分析 31/32 蛋白重合、效应量相关 r=0.9991,均指向 SOD2;(3) 自创分析方法——在 AD 蛋白组 pseudotime 上用 segmented regression 定位 ECM 崩解的 breakpoint(0.58,晚于 tau 阳性转折 0.5);(4) 人类没发现的新机制——老化内嗅皮层神经元 flippase 家族集体下调 + 小胶质细胞吞噬通路上调的"eat-me"信号假说,在独立数据集和人类 AD Braak 分期数据中得到验证。
值得注意的是论文对失败也如实记录:Discovery 3 里 Kosmos 用 KS 检验错误地否决了明明视觉上成立的分布坍缩、powerlaw 包拟出无意义的负 μ 被人工忽略;Discovery 4 里 coloc pipeline 因 p 值存成 0 等级联问题直接跑崩,miR-222 结合位点注释也是错的。这些细节比宣传口径更能反映系统真实水平。
论文自认的边界
Discussion 部分列了不少硬限制:只能处理约 5GB 以内、清洗好的表格类数据,不擅长图像/原始测序文件;不能自主拉外部公共数据做正交验证;运行是随机的,多次独立运行不保证收敛到同一发现;结果对研究目标的措辞和数据预处理方式敏感(作者承认 Fig 2/5/6 的预备运行随预处理不同产出完全不同,"data not shown");运行中途无法人工干预。另外,平均每份报告约 25 条 claims、背后 8-9 条 agent trajectories,鉴别哪些发现真有价值仍然要靠领域专家人工筛,没有自动化方法。
关键结果 单次运行(20 cycles、最长 12h)平均执行 166 个数据分析 rollouts / 42,500 行代码 + 36 个文献 rollouts / 1,500 篇论文,代码量是前代 Robin 的 9.8 倍。 102 条抽样陈述的专家复核:总体准确率 79.4%;数据分析类 85.5%、文献类 82.1%、综合解读类仅 57.9%。 合作学术组估计一次 20-cycle 运行相当于 6.14 个月的自己做研究(n=7, σ=2.49);按 15min/篇论文、2h/notebook 的机械换算则为 4.1 个专家月。 合作者报告有价值发现数量随 cycle 数近似线性增长:cycle 5 平均 5.8 个 → cycle 10 7.5 个 → cycle 20 11.0 个(仅测到 20 cycle)。 7 个案例中 3 个复现了 Kosmos 运行时无法访问的 preprint/未发表结论(含用早于 preprint cutoff 的模型重跑的对照),4 个声称对文献有新贡献;复现精度可到 R²=0.998(代谢组 fold-change)、r=0.9991(MR 效应量)。 cycle 20 的有价值发现被合作组评为:novelty 上 62% moderately novel / 25% largely novel / 12% completely novel;reasoning depth 50% high / 50% moderate——完全新颖的发现其实只占一成。 实证核查
有水分 系统是真的、案例经过人类领域专家逐一验证、失败模式也如实披露,这部分比多数 AI scientist 论文扎实;但"autonomous discovery"和"等效 6 个月科研"的口径明显超出证据——评估者与作者高度重叠、数据集多为人类带着假设采集的,且系统闭源,最核心的世界模型实现无法核查。
论文标题与叙事:Kosmos 实现"Autonomous Discovery",一次运行等于人类 6 个月研究。
Hacker News 热帖(news.ycombinator.com/item?id=45823358)的高票质疑成立:7 个案例里多数是把人类为验证特定假设而采集、清洗甚至排好序的数据交给 Kosmos(如 Discovery 6 的 pseudotime 轴是人工预先算好的),它复现了同一结论——提出假设、设计实验这些环节仍是人做的。"6.14 个月"来自 7 个合作组的自报估计(σ=2.49,离散度近一半),而这些"leading academic groups"多数成员就是论文共同作者(UCL、WashU、Stanford 等合作者均在作者列表),不是独立第三方。
"独立科学家发现报告中 79.4% 的陈述准确"。
样本只有 3 份"代表性报告"里抽的 102 条 statements,由作者协调的专家复核;最关键的"综合解读"类只有 57.9% 准确且 n=19。Alzforum 报道(2025-11-21)中剑桥的 Georg Meisl 直言:按论文自己的指标五分之一结论是错的,"可靠性而非速度是我信任它做独立分析之前必须大幅改进的东西……现阶段更像咨询一位读书多的同事,而不是一次严谨分析"。
"每条陈述都可溯源,整个发现过程透明,便于独立验证"。
溯源只对平台用户成立,系统本身完全闭源:GitHub 上 EdisonScientific/kosmos-figures(29 stars,0 issues)只有论文插图的验证代码,不含系统实现;世界模型的 schema、更新和查询机制论文一字未提。想用只能上 Edison 平台按次付费(学术前 6 次免费,之后 $200/run,Alzforum 引 Rodriques 原话)。社区有人按论文自行重建了 jimmc414/Kosmos(574 stars,2026-04 仍在更新),但那是非官方猜测性实现,不能用来验证论文声称。
系统能跨领域稳定产出发现。
论文 Discussion 自己承认:运行结果随机、多次运行不保证收敛;对 objective 措辞和数据预处理敏感,Fig 2/5/6 的预备运行随预处理不同得到不同结论且"data not shown";正文记录的翻车包括 KS 检验误判分布坍缩(Disc. 3)、powerlaw 包拟出负 μ 被人工剔除(Disc. 3)、coloc pipeline 因 p=0 级联崩溃(Disc. 4)、miR-222 结合位点注释错误(Disc. 4)。也就是说论文展示的 7 个案例是多次运行 + 人工筛选后的高光集,不是平均水平。
旁证:发布后的实际采用情况。
商业面进展是真的:2025-12 Edison Scientific 拿到 $70M 种子轮(Spark Capital 领投),2026-05 与药企 Incyte 达成 R&D 合作(investor.incyte.com 官方公告),自称 5 万+ 用户;S2 显示论文引用 86 次(Google Scholar 口径 140)。但截至 2026-08 未见独立团队发表对其核心指标(79.4% 准确率、expert-months)的系统性复测。
与我们方向的关系 这篇是课题组关心的"长时程记忆与状态管理"方向上最完整的工程案例:它的答案是不让 agent 共享对话历史,而是把所有 rollout 的产出压缩进一个集中式结构化世界模型,读写都走这个中间层。200 个 rollouts 不失焦的关键就是这个"状态外置 + 摘要写回 + 查询驱动下一轮任务"的循环,可以直接对照我们自己系统里 context 爆炸的问题。遗憾是实现细节闭源,复刻只能参考社区版 jimmc414/Kosmos 的猜测性实现。
另外两个可借鉴的点:一是 statement 级溯源约束(每句话必须引用 notebook 或文献),这既是产品可信度设计,也实际上给评估提供了抓手;二是它的评估方法本身——按陈述类型(数据分析/文献/解读)分层审计准确率,暴露出"解读类"才是短板(57.9%),这个评估框架比笼统的"发现了 X"更值得抄。同时它也是一个反面提醒:评估者与作者重叠、案例经人工筛选,我们自己做系统评估时要避开这两个坑。
阅读笔记 读报告时注意:Kosmos 的"解读类"陈述错误率超过 40%,引用它的结论前先点开 trajectory 看 notebook。世界模型概念由 Andrew White 提出(见 Statement of contributions),与视频生成那一支的 world model 完全不是一回事,检索文献时别混。前代系统 Robin(arXiv 2505.13400)和文献 agent PaperQA2 是开源的,想理解 Kosmos 的组件可以从那两个仓库入手。
材料清单 TeX 源码 已存档:Raw/kosmos/source/
同类条目