基准
评测基准
★ 必读
MLE-bench: Evaluating Machine Learning Agents on Machine Learning Engineering
MLE-bench:用 75 个 Kaggle 竞赛测 agent 的 ML 工程能力
Jun Shern Chan, Neil Chowdhury, Oliver Jaffe, et al. (OpenAI) · OpenAI · ICLR 2025 · 2024-10 · 被引 365
一句话OpenAI 从 Kaggle 精选 75 个竞赛做成离线评测环境,agent 端到端做数据处理、训练、调参并提交 CSV,按真实人类 leaderboard 发奖牌;2024 年发布时最强组合 o1-preview + AIDE 只拿到 16.9% 的奖牌率,到 2026 年初 leaderboard 头部已冲到 64%,基准逼近饱和且暴露出十几个数据泄漏问题。
这是什么
MLE-bench 是 OpenAI Preparedness 团队 2024 年 10 月发布的基准(ICLR 2025),目标是量化 AI agent 自动做 machine learning engineering 的水平——这直接对应他们关心的『AI 加速 AI 研发』风险。做法是把 Kaggle 竞赛搬到离线环境:每个任务给 agent 竞赛描述、数据集和一台 GPU 机器,agent 自主写代码、训模型、生成 submission.csv,本地 grader 打分后对照该竞赛真实的 Private leaderboard 判定能否拿到 bronze/silver/gold 奖牌。
任务集从 Meta Kaggle 数据集里 5673 个已结束竞赛人工筛到 75 个(另留 7 个 dev split),按人类工程师所需时间标注复杂度:Low 22 个(<2 小时)、Medium 38 个(2-10 小时)、High 15 个(>10 小时),类型覆盖图像/文本分类、分割、表格、音频、seq2seq 甚至 training LLMs。headline 指标是 any medal 率,天花板刻意定得很高——按 Meta Kaggle 统计,人类历史上只有 9 个人在 75 个以上不同竞赛拿过奖牌。
它现在是 autonomous ML engineering / research agent 方向事实上的主战场:S2 引用 365+,GitHub 1.7k stars,官方 leaderboard 上挤满了 Microsoft R&D-Agent、Meta AIRA、Google CAIR MLE-STAR、百度 Famou-Agent、上交 ML-Master 等系统。也因为被卷得太狠,2026 年 4 月起官方暂停接收新提交,计划在 openai/frontier-evals 仓库发修复泄漏问题的 v2。
基准总体流程:每个竞赛打包 description、dataset(复刻的 train/test split)和 leaderboard 快照交给 agent,agent 自主训模型产出 submission.csv,本地 grader 打分后对照真实人类 Private leaderboard 判定奖牌。机制与做法
任务构造:复刻 train/test split 和 grader
每个竞赛样本包含四件东西:从竞赛页 Overview/Data 标签抓的 description、数据集、本地 grading 代码、以及 Private leaderboard 快照(2024 年 5-8 月截取)。因为 Kaggle 通常不公开真实测试集,团队从公开训练集里重新切出 train/test(默认新 test 取原 train 的 10%),并用 sample submission 在新旧测试集上得分相近来校验分布一致,以保证 agent 分数与人类 leaderboard『大致可比』。
grading 逻辑按每个竞赛描述的 metric 逐一手工实现(AUROC 到各种领域 loss)。数据总量不小:全量 75 个竞赛 3.3TB,准备一遍要跑约两天;官方推荐的 Lite 版即 Low split 的 22 个竞赛,只有 158GB。
三个 scaffold 的真实轨迹对比:MLAB 跑了 216 步 2 小时、OpenHands 19 步 2 分钟就收工,而 AIDE 用解树搜索撑满 24 小时——这直接解释了同为 GPT-4o 时 8.7% vs 0.8% / 4.4% 的奖牌率差距。奖牌判定与规则
奖牌阈值完全照搬 Kaggle 官方(随参赛队伍数变化,如 1000+ 队时 bronze = top 10%),agent 的提交插入 Private leaderboard 算排名。评测本身是确定性的,但 agent 高方差,官方规范要求至少 3 seeds 报 mean ± SEM,并按 Low/Medium/High/All 四个 split 分别报告。
两条反作弊规则:submission 必须由 agent 训练的模型产出、不许直接手写预测(防止模型背出记住的标签),也不许上网查题解。配套两个检测器:用 GPT-4o 读 agent 日志查违规,用 Dolos 把 agent 代码与该竞赛 top 50 公开 notebook 比对,相似度超 60% 判 plagiarism。论文报告在所有拿牌 run 里没查出违规或抄袭。
pass@k 曲线:多给尝试次数收益稳定,GPT-4o (AIDE) 的 pass@6 (17.0%) 就能追平 o1-preview (AIDE) 的 pass@1 (16.9%),说明当时的差距很大程度是单次采样可靠性问题。主实验:scaffold 比模型更能拉开差距
环境是 24 小时、36 vCPU + 440GB RAM + 一张 24GB A10 的 Docker 容器。先固定 GPT-4o 比三个开源 scaffold:专为 Kaggle 设计、做解树搜索的 AIDE 拿 8.7% 奖牌率,通用型的 OpenHands 4.4%、MLAB 只有 0.8%——后两者经常几分钟就宣布收工,而 AIDE 会一直逼着模型迭代满 24 小时(上限 500 个节点)。再固定 AIDE 换模型:o1-preview 16.9±1.1%(其中 gold 9.4%)、GPT-4o 8.7%、Claude 3.5 Sonnet 7.6%、Llama 3.1 405B 3.0%。o1-preview 平均一次跑下来拿 7 块金牌,而人类攒 5 块金牌就是 Kaggle Grandmaster——当然作者也自己列了 caveat:数据集和评分是复刻的,agent 还占了技术后发优势。
资源 scaling 实验很有信息量:GPT-4o (AIDE) 加第二张 GPU(10.2%)甚至去掉 GPU(9.1%)与标准配置(8.7%)都无显著差异,翻日志发现 agent 根本没尝试用第二张卡;而多给尝试次数收益明显,pass@6 从 8.7% 翻倍到 17.0%,恰好追平 o1-preview 的 pass@1。跑一遍全量要 1800 GPU 时,o1-preview 一个 seed 平均烧 127.5M input + 15M output tokens,复现成本很高。
污染检查:GPT-4o base model 对竞赛页面/题解讨论帖的 familiarity(token 概率)与归一化成绩的散点,Pearson 相关 -0.24(p=0.04),未见『越熟悉分越高』;注意该检查只覆盖 GPT-4o 一个模型。污染检查:只在 GPT-4o 上做了两个间接实验
担心模型预训练时背过 Kaggle 题解,团队做了两件事:一是用 token 概率定义模型对竞赛页面和 top 5 讨论帖的 familiarity,发现 familiarity 与归一化成绩相关系数 -0.24(p=0.04),不存在『越熟悉分越高』;二是人工改写全部 75 个竞赛描述抹掉出处,GPT-4o (AIDE) 成绩 8.4% vs 原版 8.5%,无差异。结论是『未发现系统性污染』,但作者明确承认这只测了 GPT-4o、防不住高层策略的复用,也不保证未来模型。
关键结果
- 2024 年发布时最好成绩:o1-preview + AIDE 在 16 seeds 下 any medal 16.9±1.1%(bronze 3.4 / silver 4.1 / gold 9.4),有效提交率 82.8%;同 scaffold 下 GPT-4o 8.7%、Claude 3.5 Sonnet 7.6%、Llama 3.1 405B 3.0%。
- scaffold 差距大于模型差距:同是 GPT-4o,AIDE 8.7% vs OpenHands 4.4% vs MLAB 0.8%;通用 scaffold 常常提前躺平、读超长文件塞爆 context、不管算力预算把机器跑挂。
- 重复采样收益显著:GPT-4o pass@6 达 17.0%,约等于 o1-preview pass@1;两个 agent 的 pass@6 都约为 pass@1 的两倍。
- 算力不敏感:CPU-only 9.1%、标准单 A10 8.7%、双 A10 10.2%,统计上无差异,agent 甚至不会去用第二张 GPU——瓶颈在 agent 的决策而非硬件。
- 污染两项检查(familiarity 相关性 -0.24、描述混淆 8.5%→8.4%)均未发现成绩虚高,但只覆盖 GPT-4o。
- 基准消耗惊人:全量一遍 1800 GPU 时 + 上亿 tokens;官方 Lite split(22 个 Low 竞赛,158GB)是穷人版标准姿势。
- 发布后 16 个月内 leaderboard 从 17.1% 卷到 64.4%(Famou-Agent 2.0 + Gemini-3-Pro,2026-02),Lite split 头部已到 80.3%,基准接近饱和,官方 2026-04 暂停收新提交、筹备 v2。
实证核查
有水分论文本身的实验和数字扎实,代码、agent、grading 全开源且被大量第三方跑通;但『分数与人类 leaderboard 可比』这一核心前提随时间被打穿:v1 数据集被确认存在十余个出题 bug 和测试标签泄漏,官方 leaderboard 还收录过公开承认用 test-set feedback 迭代的提交,当前榜首数字要打折扣看。
论文称『我们谨慎地重建 train/test split,期望 MLE-bench 分数与人类 leaderboard 可比』。
官方 README 的 Known Issues 一节自己列出了 14 个问题竞赛:random-acts-of-pizza 的 giver_username_if_known 字段直接泄漏标签、可平凡满分(issue #108);smartphone-decimeter-2022 的 nmea 文件(#93)、multi-modal-gesture 的 .mat 文件(#77)、hubmap-kidney 的 json 文件均泄漏测试信息;dog-breed-identification 的测试集来自公开的 Stanford Dogs、agent 可以搜到原标签(#128);另有 grading 代码 bug(#134)和三个『leaderboard 过挤、奖牌线无区分度』的竞赛。官方为不作废已有榜单,把修复推迟到 v2。
官方 leaderboard 号称衡量各 agent 系统真实的 ML 工程能力,可横向比较。
issue #124『Any point in this benchmark anymore?』直接质疑:PR #118(Disarray,77.8%)和 #119(LoongFlow)的作者公开承认用 test-set feedback 迭代方案,仍被收进榜单;维护者 joe-needham 回应承认这不符合 ML 规范,后续才加免责声明(PR #125)并把这类提交拆到『Additional Submissions』表(PR #130),且 #138 指出拆分执行得并不一致。2026-04-24 起官方干脆暂停接收新提交。看榜时务必区分主表和附表、并注意多数头部条目不开源(Source Code Available 列多为 X)。
论文称实验『未发现污染导致的系统性分数虚高』。
该结论仅基于 GPT-4o 的两个间接实验(familiarity 相关性与描述混淆),论文 Limitations 也自认防不住高层策略复用、不保证后续模型;第三方分析(如 Sally Liu 的 Medium 深读)指出论文没有做 cutoff 日期前后竞赛的成绩对比。而 75 个竞赛全部早于 2024 年(见论文 Fig. medal_rates_vs_deadline,最晚 deadline 在 2024 年中),对 2025-2026 年训练的新模型,污染风险只会更大,榜上 Gemini-3/GPT-5 系的高分无法用论文的方法背书。
开源『数据构建、评测逻辑和被评测的 agent』以便复现。
属实且被验证:openai/mle-bench 仓库(1.7k stars,截至 2026-04 仍在维护)包含 prepare/grade CLI、Docker 环境、AIDE/MLAB/OpenHands 三个 scaffold 的适配和 splits;Meta 的 AIRA 团队(arXiv:2507.02554,引用 56)、Microsoft R&D-Agent、上交 ML-Master 等十余个第三方团队都在其上跑出并公开了 grading reports,原始 AIDE + o1-preview 16.9%/17.1% 的基线数字与论文一致地挂在官方榜单上。
headline 指标『any medal 率』的天花板对标人类顶尖 Kaggler 多年积累。
这个对标随榜单通胀失效得很快:论文说只有 9 个人类在 75+ 竞赛拿过牌,而 2026-02 的 Famou-Agent 2.0 单次 24 小时 run 的 any medal 率已达 64.4%。但要注意这些高分建立在上述含泄漏竞赛未修复的 v1 上(官方要求提交时仍计入这些竞赛),因此『agent 已超人类 Grandmaster』类宣传不能直接从榜单数字推出。
与我们方向的关系
组里做 research agent / autonomous ML 的工作几乎绕不开它:这是当前引用最广的 ML 工程 agent 基准,审稿人默认会问 MLE-bench 数字。实操建议:用 Lite split(22 个竞赛,158GB)+ 24h + 单 A10 的官方标准配置,3 seeds 报 mean ± SEM;跑全量前先算账——1800 GPU 时加上亿 tokens 不是小数目。写论文对比榜单时,只引主表、注明是否 v1、避开 known-issues 竞赛做 per-task 分析。
方法层面有两条可借鉴的教训:一是 scaffold 设计(搜索结构、是否逼迫 agent 用满时间预算)比换更强的底模影响更大,AIDE 式 solution-tree search 是后续 AIRA、ML-Master、R&D-Agent 等系统的共同起点;二是评测方法本身是研究对象——test-set feedback、节点选择策略(AIDE 选『最佳』节点的机制会导致成绩回退)这些坑,MLE-bench 的 leaderboard 治理翻车就是现成的反面教材,组里自建 benchmark 时应从第一天就写清提交协议。
阅读笔记
v2 会发布在 openai/frontier-evals 仓库并加版本列,跟进新工作时注意区分 v1/v2 成绩。复现细节坑:数据准备依赖 Kaggle API 凭证且全量要跑约两天;README 推荐配置里 GPU 是 A10(24GB),与 Kaggle 免费 P100 不同;pandas 3 下 text-normalization 两个竞赛的 grader 会静默判零分(issue #150,截至 2026-08 未修)。
材料清单
TeX 源码已存档:Raw/mle-bench/source/
同类条目