基准
评测基准
★ 必读
MLGym: A New Framework and Benchmark for Advancing AI Research Agents
MLGym:把 AI 研究任务做成 Gym 环境的框架与基准
Deepak Nathani, Lovish Madaan, Nicholas Roberts, et al. (Meta GenAI & UCSB) · Meta · arXiv · 2025-02 · 被引 100
一句话 Meta 把 13 个开放式 AI 研究任务(CV/NLP/RL/博弈论等)封装成第一个 Gym 式环境,用 SWE-Agent 脚手架跑了 5 个前沿模型:o1-preview AUP 最高(1.176),但所有模型都只会调超参改架构,没有产生任何新假设或新算法;框架本身扎实开源,但'支持 RL 训练 agent'的核心卖点至今没有兑现代码。
这是什么 MLGym 是 Meta GenAI 与 UCSB 合作的 AI research agent 基础设施:把'给一份 baseline 代码和数据集,让 LLM agent 通过 shell 命令做实验、改代码、训模型、刷指标'这件事标准化成 Gymnasium 环境。配套的 MLGym-Bench 收录 13 个开放式任务,横跨数据科学(房价回归)、CV(CIFAR-10、Fashion-MNIST、MS-COCO captioning)、NLP(MNLI、基于 modded-nanogpt 的语言建模)、RL(Gymnax 的三个环境)、博弈论(囚徒困境、性别之战、Colonel Blotto)和算法推理(3-SAT 启发式优化)。
论文提出了一个 0-5 级的 AI Research Agent 能力分级:Level 0 复现已有论文、Level 1 改进给定 baseline、Level 2 无 SOTA 信息下达到 SOTA、Level 3 做出可发表的新贡献,以此类推。作者明确承认 MLGym-Bench 只覆盖 Level 1(给 baseline 让 agent 往上改),这个定位比 MLE-Bench(Kaggle 式)更偏'研究工作流',但离'自动做研究'还很远。
与 MLAgentBench、MLE-Bench 的主要区别在于工程设计:agent 与环境解耦(可以换任意脚手架公平对比底座模型)、任务/数据集用 YAML 配置定义、评测用任务自带的脚本而非统一提交 CSV(所以能容纳 RL、博弈论这类没法用 Kaggle 格式评的任务)。2025-08 的仓库 commit 显示论文更新了 COLM 2025 版本的结果。
MLGym 三层架构:左边 Agent(prompt + 底座模型)、中间 Gymnasium Environment(转发 action、管理工具文档/任务描述/数据权限)、右边实际执行的容器 Computer(shell + 工具 + 文件系统)。Agent 与环境解耦是它区别于 MLAgentBench/早期 SWE-Agent 的核心设计,换模型或换脚手架都不用动环境。 机制与做法 Gym 式四组件架构
框架分 Agent、Environment、Datasets、Tasks 四个解耦组件。Environment 是标准 Gymnasium 环境:在 docker/podman 容器里起一个 shell,装好任务依赖,把数据和 starter code 拷进独立 workspace,然后循环执行 agent 发来的 bash 命令并返回输出。安全上用非 root 的 agent 用户 + 文件权限管理:数据集和评测脚本对 agent 只读,agent 可以看评测逻辑但改不了,防止 reward hacking 式作弊。
Agent 组件只是底座 LLM 的包装(历史处理、成本管理),默认脚手架改自 SWE-Agent 的 ReAct 循环:每步一条命令,不允许交互式会话(REPL/vim),上下文只保留最近 5 轮交互。这种解耦意味着可以固定脚手架换模型,也可以固定模型换脚手架。
主结果:5 个模型的 performance profile(横轴 tau 为与最优模型的性能差距阈值,纵轴为达标任务比例,曲线越靠左上越好)。左图 Best Attempt(能力上限)、右图 Best Submission(最终提交)。o1-preview(黄)整体最高,GPT-4o(粉)明显掉队;两图差异反映部分模型'跑出过好结果但没能提交'。 任务定义与评测协议
每个任务是一个 YAML:数据集(本地或 HF)、只读评测脚本、conda 环境、可选 starter code、训练超时(防止 agent 单纯堆参数量刷分)。评测不用 MLE-Bench 那种统一交 CSV,而是每个任务自带 evaluate 脚本——RL 任务评固定 seed 下训出的策略的平均回报,博弈论任务拿 agent 写的策略函数和固定对手打 20 轮。
跨任务聚合用运筹学的 performance profile + AUP(area under performance profile)分数,避免不同量纲指标直接平均的问题;不能打败 baseline 或交不出合法方案的模型按 baseline 分数乘 1.05 惩罚计入。每个模型每任务跑 4 个 seed,上限 50 步;分别统计 Best Attempt(过程中 validate 出的最好成绩,代表能力上限)和 Best Submission(最终提交,代表'记得住最优解'的能力)。
性能(Best Attempt AUP@4)vs 平均 API 成本:o1-preview 最强但每 run 约 $9,Gemini-1.5-Pro 不到 $1 却拿到 o1 99% 的 AUP,是性价比拐点;GPT-4o 便宜但性能垫底。选底座模型跑批量 research agent 实验时这张图比排行榜有用。 工具与 ACI:论文实验只用了基础款
工具沿用 SWE-Agent 的搜索/文件查看/编辑命令,加上 validate(不结束 run 查测试集分数,可无限次用)和 submit(终局动作)。扩展了两组新工具:literature_search/parse_pdf_url(查 Semantic Scholar 并解析 PDF)和 memory_write/memory_read(嵌入检索式实验日志,给长任务续命上下文)。
值得注意的细节:论文正文明确写了'本文所有实验 agent 只用 SWE-Agent 工具和 validate 命令'——也就是说文献检索和 memory module 只是框架功能展示(附录给了 memory 帮助恢复最优配置的案例截图),主结果表并没有用上,不要把这两个模块当成有 benchmark 验证的结论。
50 步内的动作类型分布:第 1-2 步以 Bash(环境探查)和 View 为主,之后 Edit(蓝)长期占一半左右,Python(紫,跑训练/评测)和 Validate(绿)稳定穿插——典型的'改代码-跑实验-查分'循环;Search(浅蓝)几乎不可见,说明 agent 基本不做代码检索,也有模型早在第 5 步就 submit 弃疗。 行为分析:编辑循环为主,几乎不搜索
220 条轨迹(11 任务 x 5 模型 x 4 seed)的动作统计:Edit 占全部动作的 50%,配合 View/Python/Validate 构成'改代码-跑实验-看分数'的迭代循环;Search 类命令只占 1%。终止原因里 75% 是 Evaluation Error(提交物缺失或格式不对),GPT-4o 失败率最高、动作数最少(要么报错要么过早 submit),Claude-3.5-Sonnet 成绩好但失败率也高,Gemini-1.5-Pro 是唯一没交过非法方案的模型。
成本-性能 Pareto:o1-preview AUP 最高但平均每 run 约 $9,是最贵的;Gemini-1.5-Pro 约便宜 9 倍还能拿到 o1 99% 的 AUP,是性价比最优点。
关键结果 o1-preview 综合最强:Best Attempt AUP@4 = 1.150、Best Submission AUP@4 = 1.176,均列第一;Claude-3.5-Sonnet(1.142/1.135)和 Gemini-1.5-Pro(1.140/1.125)紧随其后,GPT-4o 垫底(1.000/1.029)。 所有模型都能在多数任务上打败 baseline(如 CIFAR-10 从 49.7% 提到 Claude 的 89.5%),但手段清一色是调超参、换标准架构组件——论文自己承认没有观察到任何新假设、新算法或实质性创新,这是对'AI 自动做研究'现状最有分量的负面证据之一。 单任务上没有全能王:Claude 拿下 CIFAR-10/Fashion-MNIST/Blotto/MetaMaze,Gemini 拿下 Breakout/MNLI,o1 拿下语言建模/MountainCar/房价。Llama-3.1-405B 在语言建模、GPT-4o 在 Breakout 上 4 个 seed 全军覆没(一个合法方案都交不出)。 Gemini-1.5-Pro 成本约为 o1-preview 的 1/9,却达到其 99% 的 AUP,是论文给出的性价比最优选择。 失败模式:75% 的终止错误是 Evaluation Error(提交物不合法);动作分布中 Edit 占 50%、Search 仅 1%,agent 基本不查资料,靠内部知识迭代。 每模型每任务只跑 4 seed、50 步、$4 成本上限,开放式任务下方差不小,单任务分数的可比性有限,AUP 聚合分更可靠。 实证核查
有水分 benchmark 与框架代码真实开源、结果自我批判、轨迹全部放出,这部分扎实;但标题级卖点'第一个能用 RL 训练 research agent 的 Gym 环境'至今只是接口层面的事实——仓库里没有任何 RL 训练代码,且部分任务数据缺失导致第三方无法完整复现。
摘要与 README 均称这是'first Gym environment for ML tasks, enabling research on RL algorithms for training such agents',收录理由也看中它'为训练 research agent 提供基础设施'。
仓库 mlgym/ 包只有 agent/backend/environment/evaluation/tools 等子模块,没有任何 RL 训练循环;GitHub issue #13(2025-04)中维护者 deepakn97 亲口确认'there is no RL training in this codebase at the moment',承诺基于 TorchRL 的训练集成'4 月底发布',后改口'3 周内',截至最后一次 push(2025-08-10)仍未出现(仓库内搜 torchrl 零命中)。'能训练'目前只停留在环境接口兼容 Gymnasium 这一层。
论文强调框架设计'enhance reproducibility',13 个任务开箱可复现。
issue #24(2025-07,仍 open)多名用户报告 3-SAT、COCO 等任务的本地数据缺失:configs/datasets/3SAT.yaml 指向 data/3SATTime/data,但 evaluate.py 需要的 dataset.pkl 不在仓库里,有复现团队明确请求原始数据的 SHA256 或生成脚本+种子,未获答复;issue #27(复现不出论文 Figure 8)因提问者未补充细节被直接关闭而非解决。issue #5 里承诺的 HuggingFace 数据集托管(2025-02)也一直没有落地。
结论'前沿模型只会调超参,不产生新假设/新算法'。
这一自我批判的结论与放出的证据一致:仓库 trajectories/mlgym_bench_v0 提供了论文全部 220 条轨迹,可用自带的 streamlit trajectory visualizer 逐步检查;Semantic Scholar 的 tldr 也以此为该文核心 takeaway(引用 100+,Google Scholar 显示 122)。这是论文最可信的部分。
README 称框架'makes it easy to add new tasks, integrate and evaluate models or agents'。
仓库维护是真实的:2025 年 2 月创建至 8 月持续有实质 commit(ruff/mypy 迁移、0.1.1 版本、社区贡献的 Titanic 任务 PR #22 被合并),619 stars,issue 响应大多及时。但注意 license 是 CC-BY-NC 4.0(非商用),比同类 MIT/Apache 框架限制更强,商业环境使用需要评估。
论文介绍了 literature search 和 memory module 两个针对研究任务的扩展工具。
论文 Section 3.5 自己写明'For all the experiments presented in this paper, the agent only uses the SWE-Agent tools and validation command'——两个扩展工具没有进入主实验,memory 的效果只有附录里的定性案例(fig11-14 截图),没有对照数字。引用该工作时不应把这两个模块当作经过 benchmark 验证的贡献。
与我们方向的关系 对想做 autoresearch 方向的同学,MLGym 的价值主要在基础设施而非结论:agent/环境解耦 + YAML 任务定义 + 脚本式评测的设计,是目前把'开放式研究任务'塞进可复现评测框架的较好范本,自己攒 research agent 评测时可以直接借用它的 performance profile/AUP 聚合方法和 Best Attempt vs Best Submission 的双指标设计(后者暴露了 agent '做出过好结果但最终没交上来'这一类真实失败)。
但如果目标是用 RL 训练自己的 research agent,要清楚 MLGym 目前只提供环境接口,训练循环需要自己写(或等他们迟迟未兑现的 TorchRL 集成);且 13 个任务里多数是 Level 1 调参型任务,reward 信号(beat baseline 的幅度)对训练来说相当稀疏。它更适合当评测床和 trajectory 数据来源(220 条现成轨迹可以直接拿来做行为分析或 SFT 数据研究),Meta 自己 2025 年 7 月的后续工作 AIRA 也转向了 MLE-Bench 做搜索式 agent,可对照阅读。
阅读笔记 复现坑:3-SAT 等任务的 dataset.pkl 缺失(issue #24),跑之前先检查 data/ 目录完整性;macOS 推荐 podman;评测需要 GPU 容器(nvidia-container-toolkit),Linux 上 CDI 配置容易报错(README 有 workaround)。论文实验模型都是 2024 年的(o1-preview/Claude-3.5/Gemini-1.5),数字已过时,看相对结论即可。
材料清单 TeX 源码 已存档:Raw/mlgym/source/
同类条目