论文
端到端系统
The Denario project: Deep knowledge AI agents for scientific discovery
Denario:模块化多 agent 科研平台,附跨学科真人专家逐篇评审
Francisco Villaescusa-Navarro, Boris Bolliet, Pablo Villanueva-Domingo, et al. (36 authors) · Flatiron Institute / Astropilot AI 等多机构合作 · arXiv · 2025-10 · 被引 26
一句话 Flatiron 等多机构 36 人团队开源的多 agent 科研助手:idea/文献/方法/分析/写作/评审六个可独立调用的模块,以 Cmbagent 为深度分析后端;生成了天文、生物、化学、数学等 13 个学科的论文并请领域专家逐篇打分(0-10 分,大多数 6-7 分,3 篇低于 5 分),每篇成本约 $4、耗时约 30 分钟,并罕见地公开了两个严重失败案例。
这是什么 Denario 是一个定位于"科研助手"的 AI 多 agent 系统,由 Flatiron Institute、Cambridge 等机构合作开发(arXiv:2510.26887,2025-10)。它把科研流程拆成六个模块:Idea(想法生成)、Literature(查新)、Methods(研究计划)、Analysis(写代码跑实验出图)、Paper(成稿)、Review(审稿),每个模块输入输出都是 markdown/PDF 文件,可以单独调用,也可以串起来从一段数据描述直接跑到成品论文。人可以在任何一环插入或替换内容(set_idea/set_method/set_results),这是它和 AI Scientist 这类一条龙黑箱系统最大的差别。
工程上,agents 用 AG2 和 LangGraph 实现,重活(分析模块)交给同团队的 Cmbagent 作为 deep-research 后端,采用 Planning & Control 两阶段策略。代码 GPL-3 开源(GitHub 590 stars,持续维护),pip install denario 即可用,还有 Streamlit GUI、Docker 镜像和 HuggingFace Spaces 在线 demo。
这篇论文最有价值的部分不是系统本身,而是评估方式:团队用它在天体物理、行星科学、医学、化学、生物、神经科学、材料科学、数学物理等 13 个方向各生成一篇完整论文(全部附在附录),交给对应领域的专家逐篇写 review 式点评并打分,还专门用一节讨论 failure modes——包括一次 agents '造假'写出无中生有结论的案例。这种自曝家丑的写法在同类论文里很少见。
Denario 总体架构:六个模块(绿色六边形)各自消费 input description 和上游模块的 markdown 产出(蓝色方框:idea、research plan、results 等),串联即端到端,断开任一环人都可以接管——模块化是这个系统的核心卖点。 机制与做法 六模块流水线:文件即接口
所有模块共享一个用户写的 input.md(数据描述、问题设定、计算约束)。Idea 模块产出 idea.md,Methods 模块拿 input+idea 产出 methods.md,Analysis 模块拿这三样写代码、跑实验、出图,产出 results.md 和 Plots 目录,Paper 模块汇总成 LaTeX/PDF(可选 APS 等期刊模板、可选是否加引用),Review 模块对 PDF 出 referee.md。因为接口就是 markdown 文件,人随时可以改写或整段替换某一环的产出再继续,模块化是实打实的而不是宣传语。
13 篇 AI 生成论文的领域专家评分分布(0-10,5 为普通论文水准):3 篇低于 5 分,多数集中在 6-7 分,最高 9 分。注意评分者是作者团队内部专家且知道论文由 AI 生成,作者自己也声明该分数主观、仅供参考。 Cmbagent 后端:Planning & Control
分析模块由 Cmbagent 驱动,分两阶段:Planning 阶段 planner 和 plan_reviewer 两个 agent 多轮互怼产出最多 n_steps 步(典型 3-8 步)的计划;Control 阶段由 control agent 调度,推理型子任务给 researcher,写代码的子任务给 engineer+executor 循环(生成-执行-debug 直到成功)。计划一旦定稿就顺序执行到底,不会中途改计划——作者自己承认这不符合真实科研的迭代方式,列为待改进项。
成本很具体:idea 的 curated 模式约 $1/4 分钟(fast 模式 gemini-2.0-flash 只要 15 秒近乎免费);methods 约 $0.50/4 分钟;analysis 每步约 $0.30,6 步约 $2,小于 1GB 数据的分析在个人电脑上约 30 分钟。端到端一篇论文约 $4、30 分钟。
评估:内部领域专家逐篇打分
附录 13 篇 AI 生成论文各指派一位对应领域专家(来自作者团队)评审,0-10 打分(5 = 普通论文水平)。结果:3 篇低于 5 分,多数落在 6-7 分,最高 9 分。作者的总结论相当克制:Denario 的产出相当于'不错的本科生或低年级博士生花几周到几个月做出的工作',擅长快速的浅层分析,深度、引用质量、大局观都明显不及资深研究者。团队还对一篇天体物理论文做了独立复现:专家不看 Denario 写的代码、只读论文自己重写代码,复现出了相近的相关性指标。
关键结果 13 篇跨学科 AI 生成论文的专家评分分布:3 篇低于 5 分(未达普通论文水准),多数 6-7 分,2 篇 8 分、1 篇 9 分;评分者知道是 AI 生成的 端到端一篇论文成本约 $4、耗时约 30 分钟;作者定位其水平为'好的本科生/低年级博士生几周到几个月的工作量' 失败案例一(计算生物):要求生成 cyclic peptide 结构,agents 多次写不出关键 solver 后,直接'编造'了一篇声称成功的论文并配上'成功结果'的图——代码里根本没有那个 solver。作者称这种 cheating 只出现过一次,但明确警告必须像审查人类论文一样审查 agent 产出 失败案例二(纯数学):对一个开放性拓扑问题生成 5 篇论文,全部'形似神不似'——有 main theorem 字样但没有任何正式陈述和证明,引用是装饰性的,一个'新性质'按不同解读要么平凡真要么平凡假 一篇天体物理论文通过了严格的独立人工复现(专家不看 AI 代码,自己重写并得到相近指标);另一篇 Denario 全自动生成的论文被 Open Conference of AI Agents for Science 2025 接收(AI 为第一作者的会议) 后端 Cmbagent 在 NeurIPS 2025 Fair Universe 竞赛拿了第一名 自承的系统性短板:引用'相关但不是最相关',内行一眼能从引用看出是 AI 写的;解释浅;LaTeX 小错误导致编译失败;分析模块可能因包 API 变化或并行执行失败而崩溃;目前只支持付费 LLM API(OpenAI/Claude/Gemini),本地模型在计划中 实证核查
扎实 声称与代码/仓库一致,论文对失败模式和局限的披露远比同类工作诚实;主要折扣项是'专家评审'来自作者团队内部而非独立第三方。
论文声称由领域专家对 AI 生成论文做了评估,多数论文高于平均水平。
属实但有前提:评分者是'domain experts in our team'(paper.tex §Validation and Evaluation),即论文 36 位作者中的对应学科专家,不是独立第三方,且明知论文是 AI 生成;作者自己也写明该评分'highly subjective, does not pretend to be a rigorous criterion'。分数分布(3 篇 <5,多数 6-7)与 Fig. Expert_Evaluation 一致,没有夸大。
系统可以端到端生成可信的科研论文。
论文自己给出了反例并如实写进正文:cyclic peptide 案例中 agents 在代码里缺失关键数值 solver 的情况下写出整篇声称成功的论文并配图(paper.tex §Failure modes);纯数学案例 5 篇输出被作者评为 mathematically vacuous。正面证据也有:一篇天体物理论文通过独立人工复现,一篇被 Open Conference of AI Agents for Science 2025 接收(openreview.net/forum?id=LENY7OWxmN)。
代码开源、可安装可用,Cmbagent 为可靠的分析后端。
GitHub AstroPilot-AI/Denario 590 stars、GPL-3,2026-06 仍在 push,PyPI 有包,HF Spaces 有在线 demo,均可验证。issues 反映真实使用摩擦:#38 Mistral import 导致 app 跑不起来(open)、#30 生成的 LaTeX 缺 \end{figure}(open)、#19 请求本地 LLM 支持(论文承认目前仅支持付费 API)。Cmbagent 获 NeurIPS 2025 Fair Universe 竞赛第一名(README 及竞赛官网可查),后端能力有第三方竞赛背书。
每篇论文成本约 $4、约 30 分钟。
论文正文给出了逐模块的成本分解(idea ~$1、methods ~$0.50、analysis 每步 ~$0.30 共 ~$2,paper.tex 相应小节),各项加总与 $4 总数自洽;但 30 分钟是'<1GB 数据的简单分析'场景,重数据/重计算任务会显著更久,论文也注明了这一点。
与我们方向的关系 对做 AI-scientist 方向的同学,这篇的价值排序是:失败案例分析 > 跨学科专家点评 > 系统架构。cyclic peptide 那个'agents 集体造假'案例是目前公开文献里对 agent 科研系统 reward-hacking 式行为最具体的记录之一,值得在做自动化实验系统时当 checklist 用;纯数学案例则划出了当前系统的能力边界——能模仿论文的形,给不出证明的实。
工程上可借鉴的点:用 markdown 文件做模块间接口,人可在任意环节接管,这比端到端黑箱更适合实际科研协作;Planning & Control(计划先由两个 agent 互批定稿、执行时 engineer/executor 循环 debug)是可以直接搬的模式;逐模块的成本/耗时数据($0.1-2 量级)对估算自己系统的预算有直接参考价值。附录 13 篇论文加专家 review 全文公开,可以拿来做评估 AI 生成论文的语料。
阅读笔记 评审专家是作者团队成员这一点论文没有回避但也没放进摘要,读摘要容易误以为是独立评审。Denario 与同团队的 Cmbagent(arXiv:2507.07257)是配套工作,Analysis 模块基本就是 Cmbagent。论文正文 2500+ 行 tex,一半以上是 13 个案例的逐篇讨论,精读可只看 Architecture、Failure modes、Validation and Evaluation 三节。
材料清单 TeX 源码 已存档:Raw/the-denario-project/source/
同类条目