← 返回资料站  /  AutoResearch
基准 评测基准

MLE-Dojo: Interactive Environments for Empowering LLM Agents in Machine Learning Engineering

MLE-Dojo:把 200+ Kaggle 任务封装成 Gym 交互环境的 MLE agent 评测/训练框架
一句话Georgia Tech / Stanford 把 200+ 个真实 Kaggle 比赛封装成 Gym 风格交互环境(step/observation/reward),用 HumanRank(超过多少比例人类选手)做统一奖励,评了 8 个前沿 LLM(Gemini-2.5-Pro 综合 Elo 第一);号称同时支持 SFT/RL 训练 agent,但论文和代码里都没有真正的训练实验。

这是什么

MLE-bench(OpenAI)那类基准是静态的:给任务、跑一遍、算 medal,agent 与'环境'之间没有标准化的交互协议,更谈不上拿来做 RL 训练。MLE-Dojo 的定位是把 MLE 评测升级为 Gymnasium 兼容的交互环境:每个 Kaggle 任务是一个 env,agent 通过 env.step(action_type, args) 循环交互,环境返回结构化 observation(数据信息、执行结果、error message、历史)和 per-step reward,整个过程形式化为 POMDP。

任务池由三部分拼成:MLE-Bench 的 68 个(原 75 个里去掉 7 个过大/不可用的)、DSBench 的 74 个、团队自己从 Kaggle 新爬的 75 个,去重后 200+,覆盖 tabular / CV / NLP / 时间序列等 15 种任务类型,并按 150:50 切成 train/eval 两个子集——train 集就是为 agent 训练(采轨迹)准备的。每个任务标准化为统一格式:描述 + 重切分的 train/test 数据 + 本地评测类 + 人类 leaderboard 快照,跑在独立 Docker 容器 + sandbox(可配 GPU/内存/时限)里。

论文发表于 NeurIPS 2025(arXiv 2505.07782,2025-05),11 位作者含 Percy Liang、Bo Dai,S2 引用 26 次,GitHub 105 stars(MIT license),另有 HF Leaderboard 页面。

框架总览:左为 MLE-Agent 的典型循环(request_info → execute_code → evaluate),中间是 Gym 式 agent-环境交互(Actions:request_info / execute_code / evaluate_code / get_history / reset;Reward 用人类 leaderboard 相对位次 HumanRank),右为环境侧组件(任务描述、submission 规范、metric 计算器、代码解释器、历史)。
框架总览:左为 MLE-Agent 的典型循环(request_info → execute_code → evaluate),中间是 Gym 式 agent-环境交互(Actions:request_info / execute_code / evaluate_code / get_history / reset;Reward 用人类 leaderboard 相对位次 HumanRank),右为环境侧组件(任务描述、submission 规范、metric 计算器、代码解释器、历史)。

机制与做法

动作空间与交互回路

默认动作只有 5 个:request_info(取任务描述/数据结构)、validate_code(sandbox 里轻量试跑,不算提交,常被 agent 当调试/EDA 工具用)、execute_code(完整执行 + 生成 submission + 调用 metric 评分,每次调用等价一次 Kaggle 提交)、get_history、reset。动作空间通过 register 机制可扩展——注册新动作并写进 prompt,agent 就能用。环境侧四个核心模块(Error / Interface / Feedback / Metric)全部解耦,metric 按比赛子类化。

奖励用 HumanRank score:s = 1 - p/N,即当前 submission 在该比赛人类 leaderboard 上超过的选手比例,public/private 榜各算一次取平均。好处是天然归一化到 [0,1] 且跨任务可比,比 MLE-bench 的 medal(拿牌/不拿牌)细粒度得多——这也是它自称'能做 RL 奖励'的基础。

8 个模型的总 Elo:Gemini-2.5-Pro 第一(约 1210),DeepSeek-R1、o3-mini 紧随其后,GPT-4o/4o-mini 垫底——reasoning 模型在交互式 MLE 任务上全面占优。
8 个模型的总 Elo:Gemini-2.5-Pro 第一(约 1210),DeepSeek-R1、o3-mini 紧随其后,GPT-4o/4o-mini 垫底——reasoning 模型在交互式 MLE 任务上全面占优。

评测设置与主结果

在 eval 子集上评了 8 个模型(gpt-4o-mini/gpt-4o/o3-mini、Gemini-2.0-Flash/2.0-Pro/2.5-Pro、DeepSeek-v3/r1),统一 15 步交互、12 小时上限、32GB GPU 显存、输入 50k tokens,每任务跑 2 次取最好。指标用 HumanRank + Elo(模型两两对比)+ AUP 三件套。总 Elo:Gemini-2.5-Pro > DeepSeek-r1 ≈ o3-mini > Gemini-2.0-Pro > DeepSeek-v3 > Gemini-2.0-Flash > gpt-4o > gpt-4o-mini,reasoning 模型整体占优。任务难度上 CV 最难:没有一个 CV 任务平均 HumanRank 超过 60,一半以上低于 30。

行为分析比榜单有意思:o3-mini 超过 90% 的动作直接 execute_code(高自信,前 5 步就冲到高分然后平台),gpt-4o/4o-mini 只有约 20% 执行、大量 validate(保守,执行失败率低但 submission 相关错误照样多);DeepSeek-r1 失败率接近 50% 却仍是 top 模型——靠长解法在成功时拿高分。作者用'不同模型呈现出可区分的策略指纹'来论证环境的评测信度。

训练支持:目前只到'轨迹格式'为止

论文摘要强调 'supports comprehensive agent training via both supervised fine-tuning and reinforcement learning',落到代码上实际提供的是:per-step reward + 双视角历史记录(agent 侧 conversation history / 环境侧 environment records),以及 trajectories/ 目录下两个 JSON 格式样例。RL 训练循环、SFT 数据管线、与 verl/trl 之类框架的对接,repo 里都没有;论文里也没有任何训练出来的 agent 的实验。换句话说'可训练'是接口层面成立,训练本身要自己搭。

关键结果

实证核查

有水分环境、任务池、评测结果与代码基本对得上,工程是真做了;但最大卖点'可用于 RL/SFT 训练 agent'停留在接口和轨迹格式层面,论文零训练实验、repo 无训练代码,且社区采用度低(105 stars、6 个 issue),数据准备摩擦不小。
摘要称框架 'supports comprehensive agent training via both supervised fine-tuning and reinforcement learning',并 'uniquely enabling model-based agent tuning'。
论文全部实验只是对 8 个现成 LLM 的评测(source/sections/6_agent.tex),没有任何 SFT/RL 训练出的 agent;repo 顶层与 mledojo/ 包(agent/chat/competitions/gym/metrics)中没有训练管线,'训练支持'实际交付物是 trajectories/agent_trajectory.json 和 env_history.json 两个格式样例 + per-step HumanRank 奖励。tex 源码里还留着被注释掉的 'Fine-Tuning Agents' 小节和 'todo: another table of base LLM with fine-tuned version'——训练实验是计划过但没做。
'Built upon 200+ real-world Kaggle challenges',开箱即用。
任务数构成与 README 一致(68+74+75 去重),但实际使用摩擦大:每个比赛都要先去 Kaggle 官网手动接受 T&C 才能下载(README 明确 '❗️This action is needed for each competition');issue #4 指出部分比赛(如 tabular-playground-series-jan-2021)的 prepare.py 是空文件,作者答复这些依赖 DSBench 的脚本另行准备,且 MLE-Bench 剩余 7 个任务'会尽快补'(截至 2025-10 仓库最后一次 push 未见跟进)。issue #5 承认过一个任务的 metric 实现有错(已修)。
评测采用 15 步、12h、每任务两次取最好的设置,给出 8 模型 Elo/HumanRank/AUP 榜单。
设置在论文 6.1 写得明确、评测协议可复现(温度 0、限定 GPU/token 预算),HF 上有公开 Leaderboard space;但'两次取最好'(best of 2 runs)会系统性抬高分数且未报方差。第三方独立复现报告目前没有找到;社区信号弱:GitHub 105 stars、全部 issues 仅 6 个、S2 引用 26 次,作为 NeurIPS 2025 benchmark 属于偏冷。

与我们方向的关系

对想做 research/MLE agent RL 训练的组,MLE-Dojo 的价值主要是'环境骨架 + 奖励设计'可以直接抄:HumanRank(1 - p/N,对人类 leaderboard 的相对位次)是一个跨任务归一、天然稠密于 medal 的 reward,150 个 train 任务 + Gym API + Docker sandbox 也确实是能接 RL 框架的形态。但要清楚训练循环得自己写,而且 Kaggle 数据准备(逐赛事接受 T&C、下载、切分)是真实的时间成本,先挑 prepare/*.json 里体积小的任务起步。

作为评测参照:它与 MLE-bench 的关系是'交互式、细粒度奖励'对'静态、medal 制'的升级,行为分析(执行/验证比例、失败类型、步进曲线)那套分析方法对我们自己评 agent 也可复用。注意后续已有 MLE-Bench 官方的 RL 化尝试和其他交互式环境出现,选型时应对比数据新鲜度与社区维护度——本仓库 2025-10 之后没有新 push。

阅读笔记

tex 源码注释里保留了大量未完成计划(Fine-Tuning Agents、Outcome Verifiers 小节全被注释掉),可以看出'训练'部分是赶 deadline 砍掉的。Gemini-2.0/2.5-Pro 当时走免费 exp 配额,成本图里没有它们。DSBench 来源的 74 个任务准备脚本依赖上游仓库,复现时留意。

材料清单

TeX 源码
已存档:Raw/mle-dojo/source/
代码仓库github.com/MLE-Dojo/MLE-Dojo
105★ · 最近推送 2025-10-30
Leaderboardhuggingface.co/spaces/MLE-Dojo/Leaderboard
HF space,8 模型 Elo/HumanRank 榜单
issue #4github.com/MLE-Dojo/MLE-Dojo/issues/4
部分比赛 prepare.py 为空、7 个 MLE-Bench 任务缺失的讨论
轨迹格式样例github.com/MLE-Dojo/MLE-Dojo/tree/main/trajectories
agent_trajectory.json / env_history.json,'训练支持'的实际交付物

同类条目