← 返回资料站  /  AutoResearch
论文 端到端流水线 背景

MLR-Copilot: Autonomous Machine Learning Research based on Large Language Models Agents

MLR-Copilot:基于 LLM Agent 的三阶段机器学习研究流水线
一句话UT Dallas 2024 年 8 月(与 AI-Scientist 同期)提出的'想法生成→实验实现→执行调试'三阶段 ML 研究框架,人机协同而非全自动;在 5 个 MLAgentBench 风格任务上,最好配置(Claude-3.7)在人工指令辅助下 8 次试验成功率 50%(成功定义为比 SOTA prototype 提升 ≥10%)。

这是什么

MLR-Copilot 是较早的端到端 ML 研究自动化尝试,输入一篇研究论文,输出研究想法(hypothesis + experiment plan)和可执行的实验结果。整个流程分三个阶段:IdeaAgent 读论文生成想法与实验计划;ExperimentAgent 检索 prototype 代码(可选从 HuggingFace 检索模型和数据)把计划翻译成可执行代码;最后执行实验,支持迭代 debug 和人类反馈。与后来的 AI-Scientist 那类'全自动写论文'不同,它定位是 copilot——execution 阶段明确依赖 optional human feedback 来提高成功率。

论文 2024 年 8 月挂 arXiv(与 AI-Scientist 几乎同时),此后持续修订:后期版本给 IdeaAgent 加上了 RL 微调(用 OpenReview 上收集的 4,271 篇 ICLR/NeurIPS 2023-24 论文的评审反馈训练 novelty/feasibility/effectiveness 三个 reward model),实验表格里也补进了 Claude-3.7 的结果。S2 引用 67 次,作为早期流水线设计的背景参考。

MLR-Copilot 三阶段框架图:Stage 1 IdeaAgent(灰色)从输入论文生成 methodology 和 experimental plan;Stage 2 ExperimentAgent(红色)检索 prototype 代码和 HuggingFace 模型/数据后生成实现;Stage 3 执行实验,execution results 回流驱动迭代修正,human feedback 标注为 optional 但实验中成功率依赖它。
MLR-Copilot 三阶段框架图:Stage 1 IdeaAgent(灰色)从输入论文生成 methodology 和 experimental plan;Stage 2 ExperimentAgent(红色)检索 prototype 代码和 HuggingFace 模型/数据后生成实现;Stage 3 执行实验,execution results 回流驱动迭代修正,human feedback 标注为 optional 但实验中成功率依赖它。

机制与做法

三阶段流水线

Stage 1 想法生成:IdeaAgent 通过 Semantic Scholar API 抽取输入论文的 title/abstract/intro/related work,生成 research hypothesis 和 experimental plan。后期版本中该 agent 是 RL 微调过的 Llama3(沿用作者另一篇 idea-generation 训练工作 arXiv:2412.14626 的方法,训练代码不在本 repo)。Stage 2 实验实现:ExperimentAgent 以检索到的 SOTA prototype 代码为起点,可选从 HuggingFace 检索候选模型/数据集,把 plan 转成可执行代码。Stage 3 执行:跑实验、迭代 debug、接受人类反馈修正。

评测方式与结果

想法质量:5 位专家(发表 ≥3 篇论文)对 45 个 hypothesis 按 clarity/validity/rigor 等 5 维打 Likert 分,外加 GPT-4 自动评分;IdeaAgent 略优于 BaseLLM 和 ResearchAgent(如 manual clarity 4.4 vs 3.7/4.2),与原论文 hypothesis 的相似度更低(0.13 vs 0.32)。执行效果:在 SemRel、IMDB、spaceship-titanic、feedback(ELLIPSE)、identify-contrails 5 个任务上各跑 8 次(有人工指令辅助),one-pass prompting baseline 全部执行失败(成功率 0%),本框架 Claude-2.1/GPT-4/Claude-3.7 成功率分别为 27.5%/40%/50%,平均比 prototype 提升 38%~44%。执行引擎大量复用 MLAgentBench 的代码(repo 中 reactagent/ 目录,MIT license 保留)。

关键结果

实证核查

有水分代码开源且与论文描述的流水线一致,但执行引擎基本是 MLAgentBench 的封装、IdeaAgent 的 RL 训练代码不在库里;评测规模小、成功率依赖人工辅助,且关键结果是后期修订版补测的;repo 至今 0 个 issue,没有任何第三方复现记录。
开源了完整框架代码(GitHub du-nlp-lab/MLR-Copilot),提供 Colab、Docker 和 HF Spaces demo。
repo 属实(70 stars、5 forks,最后更新 2025-03),但核心执行引擎在 reactagent/ 目录,基本沿用 MLAgentBench(snap-stanford)的 environment/actions/agents 代码,README 的 License 一节也承认改自 MLAgentBench 和 Prompt2Model。历史 issue 总数为 0(gh api search/issues total_count=0),没有外部使用或复现的公开痕迹。
IdeaAgent 是 RL 微调的 LLM,用 4,271 篇 ICLR/NeurIPS 论文的 OpenReview 反馈训练三个 reward model。
RL 训练部分完全依赖作者另一篇论文(source/3_method.tex 第 8 行引 li2024learninggenerateresearchidea),训练代码和 reward model 都不在本 repo(repo 根目录无任何训练脚本);这是后期修订版加入的内容,2024-08 的初版没有。
摘要称框架 'autonomous',并称 'gained notable recognition from leading projects'。
执行阶段的成功率是 'aided with human instructions'(source/4_experiments.tex 第 65 行)测出来的,并非无人值守;'notable recognition' 一句是修订版(arXiv 更新至 2026-08,表格中出现 2024 年不存在的 Claude-3.7)加入的自我宣传,无具体出处。成功定义本身也宽松:8 次里只要 1 次比 prototype 提升 10% 即算一次成功。
在 5 个 ML 研究任务上验证了框架有效性。
5 个任务中 4 个直接取自 MLAgentBench(IMDB、spaceship-titanic、feedback、identify-contrails),都是 Kaggle 级别的标准 ML 任务而非开放研究问题;想法评测只有 45 个 hypothesis、5 位标注者,规模很小。声称与代码/任务设置一致,但外推到'自动化 ML 研究'的说法明显超出实验支撑。

与我们方向的关系

作为 autoresearch 方向的早期背景条目,它的价值在于确立了后来被反复沿用的三段式分解:ideation(读文献生成 hypothesis + plan)→ implementation(prototype 检索 + 代码生成)→ execution(跑实验 + debug 循环 + 人类反馈)。对比同期的 AI-Scientist 可以看到两条路线的分岔:MLR-Copilot 选择 human-in-the-loop 且以'改进现有 prototype'为目标,更务实但天花板低;AI-Scientist 追求全自动出论文。它对 MLAgentBench 执行环境的直接复用也说明:这一代系统的'实验执行'能力大多是同一套 ReAct 式代码环境的变体,真正的差异在 ideation 和检索环节。

阅读笔记

读 arXiv 版本时注意版本差异:v1(2024-08)没有 RL-tuned IdeaAgent 和 Claude-3.7 结果,这些是 2025-2026 年修订加入的;引用时最好注明版本。HF Spaces demo(du-lab/MLR-Copilot)是预定义示例的 GUI 录屏演示。

材料清单

TeX 源码
已存档:Raw/mlr-copilot/source/
代码仓库github.com/du-nlp-lab/MLR-Copilot
70★ · 最近推送 2025-03-30
HF Spaces demohuggingface.co/spaces/du-lab/MLR-Copilot
预定义示例的 GUI 演示
MLAgentBenchgithub.com/snap-stanford/MLAgentBench
执行环境的直接来源,4/5 评测任务出自这里
IdeaAgent 训练方法arxiv.org/abs/2412.14626
作者另一篇 RL 训练 idea generation 的论文(LDC,Li et al.),MLR-Copilot 的 RL 部分依赖它