论文
端到端流水线
背景
MLR-Copilot: Autonomous Machine Learning Research based on Large Language Models Agents
MLR-Copilot:基于 LLM Agent 的三阶段机器学习研究流水线
Ruochen Li, Teerth Patel, Qingyun Wang, Xinya Du · UT Dallas 等 · arXiv · 2024-08 · 被引 67
一句话UT Dallas 2024 年 8 月(与 AI-Scientist 同期)提出的'想法生成→实验实现→执行调试'三阶段 ML 研究框架,人机协同而非全自动;在 5 个 MLAgentBench 风格任务上,最好配置(Claude-3.7)在人工指令辅助下 8 次试验成功率 50%(成功定义为比 SOTA prototype 提升 ≥10%)。
这是什么
MLR-Copilot 是较早的端到端 ML 研究自动化尝试,输入一篇研究论文,输出研究想法(hypothesis + experiment plan)和可执行的实验结果。整个流程分三个阶段:IdeaAgent 读论文生成想法与实验计划;ExperimentAgent 检索 prototype 代码(可选从 HuggingFace 检索模型和数据)把计划翻译成可执行代码;最后执行实验,支持迭代 debug 和人类反馈。与后来的 AI-Scientist 那类'全自动写论文'不同,它定位是 copilot——execution 阶段明确依赖 optional human feedback 来提高成功率。
论文 2024 年 8 月挂 arXiv(与 AI-Scientist 几乎同时),此后持续修订:后期版本给 IdeaAgent 加上了 RL 微调(用 OpenReview 上收集的 4,271 篇 ICLR/NeurIPS 2023-24 论文的评审反馈训练 novelty/feasibility/effectiveness 三个 reward model),实验表格里也补进了 Claude-3.7 的结果。S2 引用 67 次,作为早期流水线设计的背景参考。
MLR-Copilot 三阶段框架图:Stage 1 IdeaAgent(灰色)从输入论文生成 methodology 和 experimental plan;Stage 2 ExperimentAgent(红色)检索 prototype 代码和 HuggingFace 模型/数据后生成实现;Stage 3 执行实验,execution results 回流驱动迭代修正,human feedback 标注为 optional 但实验中成功率依赖它。机制与做法
三阶段流水线
Stage 1 想法生成:IdeaAgent 通过 Semantic Scholar API 抽取输入论文的 title/abstract/intro/related work,生成 research hypothesis 和 experimental plan。后期版本中该 agent 是 RL 微调过的 Llama3(沿用作者另一篇 idea-generation 训练工作 arXiv:2412.14626 的方法,训练代码不在本 repo)。Stage 2 实验实现:ExperimentAgent 以检索到的 SOTA prototype 代码为起点,可选从 HuggingFace 检索候选模型/数据集,把 plan 转成可执行代码。Stage 3 执行:跑实验、迭代 debug、接受人类反馈修正。
评测方式与结果
想法质量:5 位专家(发表 ≥3 篇论文)对 45 个 hypothesis 按 clarity/validity/rigor 等 5 维打 Likert 分,外加 GPT-4 自动评分;IdeaAgent 略优于 BaseLLM 和 ResearchAgent(如 manual clarity 4.4 vs 3.7/4.2),与原论文 hypothesis 的相似度更低(0.13 vs 0.32)。执行效果:在 SemRel、IMDB、spaceship-titanic、feedback(ELLIPSE)、identify-contrails 5 个任务上各跑 8 次(有人工指令辅助),one-pass prompting baseline 全部执行失败(成功率 0%),本框架 Claude-2.1/GPT-4/Claude-3.7 成功率分别为 27.5%/40%/50%,平均比 prototype 提升 38%~44%。执行引擎大量复用 MLAgentBench 的代码(repo 中 reactagent/ 目录,MIT license 保留)。
关键结果
- 执行成功率(比 SOTA prototype 提升 ≥10% 记为成功,8 trials、有人工指令辅助):Claude-3.7 50%、GPT-4 40%、Claude-2.1 27.5%;one-pass prompting baseline 为 0%,全部因无法处理运行时错误而失败。
- 最难的任务是 identify-contrails(卫星图像分类):Claude-2.1 成功率 0%,Claude-3.7 也只有 12.5%;最容易的是 spaceship-titanic(表格数据,75%)。
- 想法评测中 IdeaAgent(RL 微调 Llama3)对 ResearchAgent 的优势不大:manual 5 维平均约 4.1 vs 3.9,主要差异在自动评测(GPT-4 打分)上被放大。
- 论文自己的框架图和 README 都明确 human feedback 是流程的一环——'autonomous' 更多是营销措辞,实际是 human-in-the-loop copilot。
实证核查
有水分代码开源且与论文描述的流水线一致,但执行引擎基本是 MLAgentBench 的封装、IdeaAgent 的 RL 训练代码不在库里;评测规模小、成功率依赖人工辅助,且关键结果是后期修订版补测的;repo 至今 0 个 issue,没有任何第三方复现记录。
开源了完整框架代码(GitHub du-nlp-lab/MLR-Copilot),提供 Colab、Docker 和 HF Spaces demo。
repo 属实(70 stars、5 forks,最后更新 2025-03),但核心执行引擎在 reactagent/ 目录,基本沿用 MLAgentBench(snap-stanford)的 environment/actions/agents 代码,README 的 License 一节也承认改自 MLAgentBench 和 Prompt2Model。历史 issue 总数为 0(gh api search/issues total_count=0),没有外部使用或复现的公开痕迹。
IdeaAgent 是 RL 微调的 LLM,用 4,271 篇 ICLR/NeurIPS 论文的 OpenReview 反馈训练三个 reward model。
RL 训练部分完全依赖作者另一篇论文(source/3_method.tex 第 8 行引 li2024learninggenerateresearchidea),训练代码和 reward model 都不在本 repo(repo 根目录无任何训练脚本);这是后期修订版加入的内容,2024-08 的初版没有。
摘要称框架 'autonomous',并称 'gained notable recognition from leading projects'。
执行阶段的成功率是 'aided with human instructions'(source/4_experiments.tex 第 65 行)测出来的,并非无人值守;'notable recognition' 一句是修订版(arXiv 更新至 2026-08,表格中出现 2024 年不存在的 Claude-3.7)加入的自我宣传,无具体出处。成功定义本身也宽松:8 次里只要 1 次比 prototype 提升 10% 即算一次成功。
在 5 个 ML 研究任务上验证了框架有效性。
5 个任务中 4 个直接取自 MLAgentBench(IMDB、spaceship-titanic、feedback、identify-contrails),都是 Kaggle 级别的标准 ML 任务而非开放研究问题;想法评测只有 45 个 hypothesis、5 位标注者,规模很小。声称与代码/任务设置一致,但外推到'自动化 ML 研究'的说法明显超出实验支撑。
与我们方向的关系
作为 autoresearch 方向的早期背景条目,它的价值在于确立了后来被反复沿用的三段式分解:ideation(读文献生成 hypothesis + plan)→ implementation(prototype 检索 + 代码生成)→ execution(跑实验 + debug 循环 + 人类反馈)。对比同期的 AI-Scientist 可以看到两条路线的分岔:MLR-Copilot 选择 human-in-the-loop 且以'改进现有 prototype'为目标,更务实但天花板低;AI-Scientist 追求全自动出论文。它对 MLAgentBench 执行环境的直接复用也说明:这一代系统的'实验执行'能力大多是同一套 ReAct 式代码环境的变体,真正的差异在 ideation 和检索环节。
阅读笔记
读 arXiv 版本时注意版本差异:v1(2024-08)没有 RL-tuned IdeaAgent 和 Claude-3.7 结果,这些是 2025-2026 年修订加入的;引用时最好注明版本。HF Spaces demo(du-lab/MLR-Copilot)是预定义示例的 GUI 录屏演示。
材料清单
TeX 源码已存档:Raw/mlr-copilot/source/