论文
实验执行
AI Research Agents for Machine Learning: Search, Exploration, and Generalization in MLE-bench
把 ML 研究 Agent 形式化为「搜索策略 × 操作算子」并系统消融
Edan Toledo, Karen Hambardzumyan, Martin Josifoski, et al. (Meta FAIR / UCL, 25 authors) · Meta (FAIR) / UCL · NeurIPS 2025 · 2025-07 · 被引 56
一句话Meta FAIR + UCL 把 MLE-bench 上的研究 agent 统一建模为图搜索(选择策略 + 操作算子 + 适应度函数),系统消融 Greedy/MCTS/进化搜索与两套算子的组合,把 MLE-bench Lite 奖牌率从 39.6% 推到 47.7%,并定量证明 validation-test 泛化差距(9-17 个百分点)才是当前主要瓶颈;配套开源 aira-dojo 沙箱框架。
这是什么
在 AIDE 这类「LLM 写代码 → 跑实验 → 按验证分迭代改进」的 agent 成为 MLE-bench 主流方案之后,一个自然的问题是:性能到底来自哪一层?是搜索策略(greedy 还是更聪明的探索)、操作算子(draft/debug/improve 的 prompt 设计)、评估信号,还是单纯的环境和算力?这篇论文的贡献是把这些维度拆开、逐一消融,而不是再堆一个新 agent。
作者把研究 agent 形式化为在解空间上演化的有向图搜索,由五元组定义:适应度函数 F(5-fold CV 分数)、节点选择策略 π_sel、操作算子集 O(Draft/Debug/Improve/Memory/Crossover)、算子选择策略 π_op、终止条件 τ。AIDE 就是这个框架下的 greedy 特例。在此之上他们构造了三种搜索策略(Greedy、无 rollout 的 MCTS、进化算法)× 两套算子(原版 O_AIDE vs 改进版 O_AIRA)的完整组合矩阵,在 MLE-bench Lite(22 个 Kaggle 任务)上每个配置跑约 20 个 seed,每个 run 独占 1 张 H200 + 24 CPU 核,24 小时预算(部分实验延到 120 小时)。
配套开源的 aira-dojo 是支撑这套实验的框架:Apptainer 容器隔离 + Slurm 调度,论文称支撑了 1000 个 agent 并行跑最长 120 小时。它把 task 和 solver 抽象解耦,内置 MLE-bench 任务和论文中全部 agent 实现,NeurIPS 2025 接收,S2 引用 56。
把搜索预算从 24h 拉长到 90h 的 anytime 奖牌率(R1 模型):AIRA_greedy(深橙)持续爬到 ~51%,反超 24h 内更强的 AIRA_MCTS(紫,~43%),AIDE_greedy(浅橙)停在 ~40%。说明『哪种搜索策略最优』取决于时间预算,greedy 长跑更耐用。机制与做法
先证明瓶颈不在搜索策略:AIDE 算子下换什么搜索都没用
第一组实验固定 O_AIDE 算子集,把搜索策略从 greedy 换成 MCTS(扫 UCT 探索常数 c∈{0, 0.25, 0.75})和进化搜索,结果奖牌率几乎没有差别;去掉 Memory 算子同样几乎无影响。结论是:在弱算子下,搜索层面的探索被算子本身的行为锁死,算子集才是瓶颈——这直接反驳了『上更聪明的搜索就能提升 agent』的直觉。
泛化差距的直观呈现:AIDE_greedy 跑 90 小时,agent 自己看到的 validation 奖牌率(虚线)一路涨到 ~67%,真实 test 奖牌率(实线)12 小时后就停在 ~40%,且两线越拉越开——agent 后 78 小时的『进步』基本全是对验证集的过拟合。O_AIRA 算子:三处针对性改动
① Prompt 自适应复杂度:按当前节点已有子节点数动态提示生成『minimal / moderate / advanced』复杂度的方案,防止一上来就过度工程化;② Scoped memory:Draft/Improve 只看兄弟节点的记忆(促多样性、防 mode collapse),Debug 则看完整祖先调试链(防反复 undo-redo);③ Think tokens:显式鼓励推理模型用思考 token,平均使 completion token 翻倍。
效果:同为 greedy,AIRA_greedy 45.5% vs AIDE_greedy 39.8%(相对 +14%);换上好算子之后搜索策略才开始起作用——AIRA_MCTS(R1)达到 47% 的 SOTA,且各搜索策略的排名与弱算子时完全不同。有趣的是延长到 90 小时后 AIRA_greedy(~51%)反超 MCTS(~43%),说明最优搜索策略依赖于给定的时间预算。
泛化差距才是真正的天花板
Agent 用验证分导航搜索,但成绩按 held-out test 算。用 oracle 实验量化这个 gap:全程用 test 分数搜索+选择(Test/Test)比标准做法(Val/Val)高 9.4-16.6 个百分点,greedy 类 agent 受害最深。进一步拆解发现大头在『最后交哪个节点』:仅把最终节点选择换成 oracle(Val/Test)就能对 MCTS/EVO 关闭全部 gap,对 greedy 也关闭 60% 以上。实用启示:按验证分取 top-3 节点提交、报其中最好成绩,就能白捡约 10% 性能——最终节点选择策略是比搜索策略性价比高得多的改进方向。
AIDE_greedy 跑 90 小时的曲线(见图)更直观:agent 自我感知的 validation 奖牌率一路涨到 ~67%,真实 test 奖牌率 12 小时后就停在 ~40%,搜索时间越长自欺越严重。
关键结果
- 固定 AIDE 算子集时,MCTS / 进化搜索 / 调 UCT 探索常数对奖牌率几乎无影响;去掉 Memory 算子也几乎无影响——弱算子锁死搜索层探索。
- AIRA 算子(自适应复杂度 + scoped memory + think tokens)在同为 greedy 下把奖牌率从 39.8% 提到 45.5%;AIRA_MCTS(R1)达到 47%,MLE-bench Lite SOTA(对外宣传口径 39.6%→47.7%)。
- 同一个 AIDE_greedy o1-preview,只是搬进 aira-dojo 环境(H200 GPU、4h 单次执行上限)就从 MLE-bench 报告的 35.2% 涨到 45.9%(相对 +30%)——环境与算力配置的影响不小于算法本身。
- oracle 实验:用 test 分数替代 validation 分数导航+选择,可提升 9.4(MCTS)到 16.6(AIDE_greedy)个百分点;其中大部分 gap 来自最终提交节点选错,top-3 提交即可多拿约 10%。
- 24 小时预算下 MCTS 最优,但延长到 90 小时后 AIRA_greedy(~51%)反超 AIRA_MCTS(~43%),排名随预算变化。
- o1-preview 在此任务上强于更新的 o3 和 R1(45.9% vs 39.8%/40.8% 一档);模型新旧与 agent 任务表现不单调。
实证核查
扎实消融设计系统、每配置约 20 seed 且报 stratified bootstrap 置信区间,代码/配置与论文声称一致,连『环境本身贡献了大块提升』这种不利于自家 SOTA 叙事的结果都主动披露;主要保留是实验轨迹未公开、复现算力门槛高。
摘要头条:把 MLE-bench Lite 奖牌率从 39.6% 提到 47.7%,SOTA。
论文 5.2 节自己披露:同一个 AIDE_greedy o1-preview 仅换到 aira-dojo 环境(每 run 独占 1×H200 + 24 CPU + 100GB RAM,单次执行 4h 上限)就从 MLE-bench 原报告的 35.2% 涨到 45.9%。即头条提升中相当一部分来自环境/硬件配置而非搜索与算子创新;算子本身的净贡献是同环境下 39.8%→45.5%(sections/experiment_results_2.tex)。诚实披露了,但引用头条数字时要注意口径。
开源 aira-dojo 框架,含论文全部 agent,支持复现。
repo(facebookresearch/aira-dojo,162 stars,2026-04 仍在更新)确实包含 greedy/MCTS/EVO solver 与 mlebench 任务的完整 configs,与论文描述一致。但:实验轨迹和生成代码未发布(issue #12,open 无回复);README 有明显笔误——四条复现命令的注释与实际 config 名错位(aide_greedy_o3 注释写着 AIRA_GREEDY),还有路径错误(issue #10);跑通需要 Slurm 集群 + Apptainer superimage + 每 run 一张 H200 跑 24 小时,单配置 22 任务×20 seed 的复现成本极高,尚无第三方完整复现报告。
validation-test 泛化差距是当前 agent 的主要瓶颈,最终节点选择是关键。
论文用 oracle 对照实验自证:Test/Test 比 Val/Val 高 9.4-16.6pp,仅 oracle 化最终节点选择即可对 MCTS/EVO 关闭全部 gap(sections/experiment_results_3.tex);附录 90h 曲线(本地 fig03)显示 validation 奖牌率涨到 ~67% 而 test 停在 ~40%。属内部实验而非第三方验证,但每点约 20 seed 且给了置信区间,方法上可信;该结论与 MLE-bench 社区观察到的 agent 过拟合验证分现象一致。
框架『enabled 1,000 agents to run in parallel for up to 120 hours』。
README 原话,指 Meta 内部集群的规模,论文附录确有 90-120h 延长实验支撑;但这是自述而非可查证的外部事实,外部用户没有这个量级的资源。另注意代码 license 为 CC-BY-NC 4.0,禁止商用。
与我们方向的关系
对做实验执行类 autoresearch agent 的同学,这是目前最系统的设计空间地图:它把『搜索策略、算子、评估信号、环境、算力』分层拆解(论文的 pyramid 图),并给出反直觉结论——先把算子(prompt/memory/复杂度控制)做好,搜索策略才有意义;而比两者都便宜的改进是最终提交节点的选择策略(top-k 提交白捡 ~10%)。做自己的 agent 时可以直接借用这三个算子改动,成本极低。
泛化差距的定量结论对我们设计评估协议有直接借鉴:agent 报告的验证性能会随搜索时间持续虚高(90h 时 val 67% vs test 40%),任何以 agent 自评分数为奖励或筛选信号的系统(包括 RL 训练研究 agent)都要正面处理这个 reward hacking 式的问题。aira-dojo 本身(Apptainer 隔离 + Slurm + task/solver 解耦)也是搭自有评测沙箱时值得参考的工程模板,但注意 NC license。
阅读笔记
复现门槛:需 Slurm + Apptainer,官方配置每 run 一张 H200 跑 24h。README 的四条 MLE-bench Lite 复现命令注释与 config 名错位,照抄前先核对 _exp 配置名。o1-preview 已下线,论文中最强 baseline 数字无法再复现。实验轨迹未公开(issue #12)。
材料清单
TeX 源码已存档:Raw/ai-research-agents-for-machine-learning/source/
同类条目