论文
端到端系统
★ 必读
The AI Scientist-v2: Workshop-Level Automated Scientific Discovery via Agentic Tree Search
AI Scientist-v2:用 agentic tree search 自动做实验,产出第一篇过 workshop 评审的全 AI 论文
Yutaro Yamada, Robert Tjarko Lange, Cong Lu, Shengran Hu, Chris Lu, Jakob Foerster, Jeff Clune, David Ha · Sakana AI / UBC / Vector Institute · arXiv · 2025-04 · 被引 363
一句话 Sakana AI 把 v1 重写成无模板、由 experiment manager agent 管理四阶段 agentic tree search 的端到端系统,向 ICLR 2025 ICBINB workshop 盲审投了 3 篇全 AI 生成的论文,其中 1 篇拿到 6/7/6(均分 6.33)越过接收线——这是"全 AI 论文过同行评审"的第一个可查证案例,但过程有明显的人工筛选,接收后也主动撤稿了。
这是什么 AI Scientist-v1(2024.08)是第一个宣称端到端自动科研的系统,但它依赖人写好的实验模板:LLM 只能在现成 codebase 上做线性的增量修改,idea 也是围绕模板生成的。v2 的核心动机就是去掉这个拐杖:idea 生成从'grant proposal 式'的抽象层面开始(带 Semantic Scholar 查新),实验代码完全从零写起,数据集统一走 HuggingFace 的 load_dataset,写作从 Aider 增量编辑改成 o1 单次生成加反思。
机制上最大的变化是把 v1 的线性实验循环换成了并行 agentic tree search(基于 WecoAI 的 AIDE 改造),由一个 experiment progress manager agent 把实验过程切成四个阶段(初步可行性 → 超参调优 → 研究议程执行 → 消融),每阶段选最优节点作为下一阶段的根。另外在两处引入 VLM:实验中即时审查生成的图,写作反思阶段检查图文一致性。
论文的招牌结果是一次和 ICLR 2025 workshop 'I Can't Believe It's Not Better'(ICBINB)组织者合作的评审实验:3 篇全自动生成的稿件混入 43 篇投稿盲审,评审者只被告知'可能有 AI 稿件'。其中一篇研究 compositional regularization 的负结果论文拿到 6/7/6,超过接收均线,排 top 45%。按事先约定,团队在 meta-review 前撤回了稿件,没有进入正式论文集。代码已开源(7000+ stars),S2 引用 363(截至 2026-08)。
系统总览:左边 idea 生成(LLM 提案 + Semantic Scholar 查新 + 打分归档),中间四阶段树式实验(初步验证 → 超参调优 → 研究议程 → 消融,每阶段选最优节点下传),右边写作(画图 + VLM 反馈 → 手稿 → LLM 审稿)。与 v1 最大的区别是中间这一列:没有人写的模板,全靠 tree search 从零长出实验代码。 机制与做法 无模板的 idea 生成
v1 的 idea 生成是'看着现成代码提改进',v2 改为从一个高层主题描述(Markdown 写的 workshop 主题/研究方向)出发,让 LLM 像写研究计划书一样开放式地提出假设和实验设计,过程中实时调 Semantic Scholar 查新颖性、找相关工作,而不是事后补查。产出是结构化的 idea JSON(标题、假设、实验列表),再喂给主 pipeline。这一步成本很低(几美元),ICLR 实验中一次生成约 40 个 idea(见下文评审实验流程)。
四个实验阶段的树结构细节:蓝色为正常节点、红色为 buggy 节点(会被 debug 子节点接管),Stage 2 的黄色是超参节点、Stage 4 的紫色是消融节点,浅绿/深绿是复制与聚合节点(多 seed 复现并汇总出带误差棒的图)。每阶段的粗边框'best node'由 LLM evaluator 选出,作为下一阶段的根。 四阶段实验管理器 + 并行 tree search
experiment progress manager 把实验切成四个有明确停止条件的阶段:Stage 1 初步可行性(跑通最小原型即止)、Stage 2 超参调优(训练曲线收敛且在至少两个数据集上跑通)、Stage 3 研究议程执行、Stage 4 消融(后两者以算力预算耗尽为限)。每阶段结束由 LLM evaluator 选最优节点传给下一阶段,并对最优实验跑多个 seed 的复制取均值和标准差。
每个树节点是一次完整实验:LLM 生成计划和 Python 代码 → 直接执行 → 报错则标记 buggy 并记录错误信息;成功则把 metrics 存成 numpy 文件、生成可视化,交给 VLM 审图,图有问题(缺 legend、标签不清、误导性画法)同样打回 buggy。扩展时按预设概率优先选 buggy 节点做 debug,否则按 best-first(LLM 综合评估 metrics、训练动态、图的质量)选非 buggy 节点做 refinement,多个节点并行展开。除普通节点外还有四种专用节点:hyperparameter(去重记录已试配置)、ablation、replication(多 seed)、aggregation(只汇总画图不做新实验)。关键参数在 bfts_config.yaml:num_workers(并行路径数)、steps(最大节点数)、max_debug_depth、debug_prob、num_drafts(Stage 1 独立树的数量)。
过评审的那篇 workshop 论文全貌(8 页,含附录):'Compositional Regularization: Unexpected Obstacles in Enhancing Neural Network Generalization',报告了一个负结果——时间一致性正则不能改善 LSTM 的组合泛化。拿到 6/7/6 过了 ICBINB 接收线,但作者自查发现其数据集有约 57% 的训练/测试重叠。 VLM 双重审图
VLM 在两个环节介入:实验阶段对每张生成图即时给反馈(作为节点 buggy/非 buggy 判定的一部分);写作反思阶段把图的截图、caption 和正文中引用该图的段落一起交给 VLM,检查图文对齐、视觉清晰度和正文/附录重复。这是 v2 相对 v1 明显提升论文'卖相'的部分——不过第三方复测发现这一步在某些模型配置下会被静默跳过(见核查)。
ICLR workshop 评审实验的真实流程
值得细看人到底参与了多少:人先给出 workshop 主题(第二批还改了 system prompt 引导向应用领域),系统生成约 40 个 idea,人从中挑 3 个;每个 idea 用不同随机 seed 完整跑多遍 pipeline,每遍产出一篇完整论文,人再从中挑一篇最连贯的投稿。作者的辩护是这属于'meta-selection'(像教授从多个学生的工作里挑一篇投稿),单次 run 内部确实无人编辑代码、结果、图或文字;但也明确承认本研究只回答'能否产出至少一篇过评审的论文',不衡量成功率。写作阶段用 o1 单次生成初稿,再进反思循环(带目标页数约束控制在 4 页内)。
关键结果 3 篇全 AI 稿件投 ICBINB workshop(共 43 篇投稿),1 篇拿到 6(weak accept)/7(accept)/6(weak accept),均分 6.33 超过接收线,排 top 45%;另两篇被拒。 过线的那篇是负结果论文:compositional regularization(对 LSTM embedding 加时间一致性正则)在合成算术任务上不能改善组合泛化,有时反而妨碍训练——正好切中 ICBINB'负结果'主题。 作者内部评审结论:三篇都达不到主会(main track)接收水平;过线那篇也只是 borderline accept,且存在引用错误(漏引 Hochreiter & Schmidhuber 1997)、图注解读错误(Fig.3 验证损失读反、Fig.5 结论与图矛盾)等硬伤。 作者查生成代码时发现该论文的合成数据集训练/测试集重叠约 57%,直接动摇结果可靠性;被吹的'attention 模型 100% 准确率'复测后发现主要是任务太简单。 成本:实验阶段(Claude 3.5 Sonnet)每 run 约 $15-20,写作阶段约 $5;一次完整 run 几小时。系统成功率依赖基座模型,README 明确承认 v2 成功率低于 v1、在有好模板时 v1 论文质量可能更高。 接收后按与 ICLR 领导层的事先约定在 meta-review 前撤稿,未进正式论文集;评审员事前被告知可能有 AI 稿并可 opt out,实验拿了 UBC 的 IRB 批准(H24-02652)。 实证核查
有水分 "第一篇过评审的全 AI 论文"在字面上成立且过程透明(盲审协议、IRB、主动撤稿都可查),但 headline 省略了多层人工筛选和 workshop 低门槛;代码真实开源且活跃,不过 issue 区显示 pipeline 相当脆,第三方复测发现关键组件在某些配置下静默失效。
产出了'第一篇完全由 AI 生成、通过同行评审的 workshop 论文',整个流程无人干预。
论文 §4.2 自己写明:人从约 40 个 AI 生成的 idea 里挑了 3 个,每个 idea 多 seed 跑出多篇完整论文后再由人挑最好的一篇投稿——是'多选一'后的最佳样本,不是随机抽样;作者也承认不衡量成功率。TechCrunch(2025-03-12)引 U Alberta 的 Matthew Guzdial 称此结果'a bit misleading',属于 cherry-pick;KCL 的 Mike Cook 指出新 workshop 评审多为资历较浅的研究者、且负结果主题'让 AI 写得像样'更容易,并强调'过评审不等于对领域有知识贡献'。另外稿件在 meta-review 前撤回,严格说没走完全程。
过线论文代表 workshop 级别的研究质量。
作者自己的代码检查(论文 §4.2 'Paper Assessment by the Authors')发现该论文合成数据集训练/测试重叠约 57%,'attention 模型 100% 准确率'主要源于任务过于简单;还有漏引经典文献、两处图注与图矛盾。作者内评三篇均不达主会水平。ICBINB 是当年新设的 workshop,仅 43 篇投稿,接收门槛显著低于主会——这些折扣论文正文都有交代,但 Sakana 官方 blog 和媒体传播中基本消失。
开源代码可复现整个系统。
仓库真实且活跃(7061 stars,最后 push 2025-12),tree search 部分明确基于 WecoAI/aideml。但 issue 区显示工程质量一般:issue #133 是一个带 OSF 预注册(osf.io/aqchj)的独立评测,报告在 24/24 次 write-up 运行中复现两个 bug——VLM 审图步骤因模型白名单不含所配置的 gemini-2.5-flash 而被静默跳过(即论文卖点之一的 VLM 反馈实际没跑),以及 find_pdf_path_for_review 的 UnboundLocalError(#125/#108/#131 多人重复报告);#122 报告单个 worker 失败会中止整个 tree search;#123 报告运行结束的清理逻辑会按 'python/torch' 子串 SIGTERM 机器上不相干的进程。
v2 全面超越 v1:去模板化、跨 ML 领域泛化。
README 的官方 Note 直接承认:'The AI Scientist-v2 doesn't necessarily produce better papers than v1'——v1 靠模板成功率高,v2 探索性强但成功率更低;FAQ 也承认经常出现'实验跑完但没生成 PDF 或 review'的情况。去模板化是真实的架构差异,但代价(稳定性、成功率)在摘要里没有体现。
每次实验成本约 $15-20(实验)+ $5(写作)。
出处是 README FAQ,与论文附录的模型配置一致(实验用 Claude 3.5 Sonnet,写作用 o1-preview,审稿/引用用 GPT-4o),量级可信;但这是单 run 成本,按 ICLR 实验的实际流程(每个 idea 多 seed 跑多遍再挑一篇),产出一篇可投稿论文的真实成本要乘上尝试次数,论文未给总账。
与我们方向的关系 对做研究自动化的组来说,这篇是'端到端系统'路线的关键坐标:它把 AIDE 式的 code-level tree search 提升到了完整科研流程(四阶段 + 专用节点类型 + LLM evaluator 选点),这个 experiment manager 的分阶段设计比 v1 的线性循环和很多硬编码 workflow graph 的 agent 更值得借鉴——阶段有明确停止条件、复制节点自动出均值方差,这些是让 AI 实验'像科学'的具体工程。VLM 审图作为节点合格判定的一环也是个实用 trick(虽然要注意它在开源版里可能静默失效)。
另一个可借鉴之处是评审实验本身的设计:与 workshop 组织者合作、评审知情但盲审、IRB、事先约定撤稿——这套协议是目前评估'AI 论文质量'最干净的做法,后续 Zochi(Intology)等系统的主会实验都在沿用类似框架。同时它也是研究'评审作为评价指标有多不可靠'的好案例:一篇作者自查有 57% 数据泄漏的论文照样过了三个人类评审,这对我们设计 AI 科研系统的自动评估器是重要警示——peer review 分数不能当 ground truth。
阅读笔记 读法建议:正文其实相当坦诚(cherry-pick 流程、57% 泄漏、内评不达主会都白纸黑字写了),水分主要在 blog/媒体层的传播话术,批判时引正文比引二手报道更有力。复现坑:默认 bfts_config.yaml 用 claude-3-5-sonnet 做实验;VLM 白名单硬编码(#133),换模型前先查 llm.py;写作阶段的 UnboundLocalError 会让进程非零退出但 PDF 其实已生成(#125)。同一团队 2026 年在 Nature 发了 'Towards end-to-end automation of AI research'(Lu et al.),可视为这条线的正式收尾。
材料清单 TeX 源码 已存档:Raw/the-ai-scientist-v2/source/
同类条目