基准
评测基准
SUPER: Evaluating Agents on Setting Up and Executing Tasks from Research Repositories
SUPER:考察 agent 从真实研究仓库配环境、跑实验的基准
Ben Bogin, Kejuan Yang, Shashank Gupta, et al. (Ai2) · Ai2 · EMNLP 2024 · 2024-09 · 被引 50
一句话Ai2 的 EMNLP 2024 基准,专测 LLM agent 从低星、低文档质量的真实研究仓库出发装依赖、改配置、跑通实验的能力;最强组合(GPT-4o + SWE-Agent)端到端只解出 16.3%,拆成子问题也只有 46.1%。
这是什么
自动复现科研成果的第一道坎不是写代码,而是把别人的仓库跑起来:装依赖、下数据、改配置、处理各种版本冲突和 CPU/GPU 不兼容。之前的 benchmark 要么用高星、文档齐全的仓库(SWE-bench),要么给现成环境(MLAgentBench),都绕开了这个最脏的环节。SUPER 刻意从 Papers With Code 里选 2021 年后的『low-profile』仓库——所选仓库的 GitHub star 中位数只有 14——来贴近研究者日常面对的真实情况。
基准分三个集合:Expert(45 个端到端任务,人工写任务 + Upwork 雇专家给出 gold solution notebook,连 git commit hash 和最终依赖版本都固定下来)、Masked(152 个从 gold solution 里挖空某段抠出来的子问题,比如『修复这个报错让训练跑通』)、AutoGen(602 个用 GPT-4o 从仓库 README 自动生成的任务,供大规模开发/训练用,抽样验证 81% 可行)。所有任务都设计成 CPU 可跑、单题 10 分钟计算内完成(比如只训 gpt2-small、只load 10 条数据),用 Modal 沙箱执行,每题计算成本 2-3 美分。
一条典型任务轨迹:用户要求按论文仓库在自己的数据集上训练并汇报 accuracy,agent 依次经历配环境(装依赖、下数据、改 data_utils.py)、解决问题(transformers 版本冲突导致 ImportError,降级到 4.28.1)、执行并汇报指标三个阶段——SUPER 考察的就是这条全链路。机制与做法
环境:以 Jupyter notebook 为引擎的混合执行
跑研究仓库既需要 shell 命令(pip install、跑脚本)又需要有状态的 Python,而之前的环境往往只支持其一。SUPER 用 Jupyter kernel 做执行引擎:agent 每步提交一个 cell(Python 和/或 bash),cell 之间保留状态,返回 observation 字符串。作者的 ReAct-SUPER agent 还加了一个 edit action(按内容匹配替换文件片段,不要求行号,匹配失败给提示),消融显示这一项就把准确率从 37.0% 提到 41.6%——没有它 agent 只会用 sed 硬改文件。
Masked 子问题的抽取方式:从专家 gold solution(左)中挖掉聚焦某一方面的 cells(中,如 issue solving),把不依赖它的 cells 预执行作为 prefix,agent 只需完成被挖掉的目标(右)。152 个子问题按依赖/数据/配置/CPU 等类别细分,可诊断 agent 具体卡在哪一环。评测:outcome + landmark 双指标
Accuracy 是 outcome-based:agent 提交的指标数值与专家 gold answer 对上(误差 1e-2 内)才算对,允许不同解法。但端到端全对信号太稀疏,所以每个 gold solution 还人工标 2-6 个 landmark 输出模式(如日志里的『training completed』),按命中比例给部分分,衡量『走到了哪一步』。AutoGen 集没有 gold answer,用 Script-Executed 代理指标(目标脚本无异常运行满最短时长),与 landmark 的一致率 90%,与 accuracy 只有 69%。
Masked 子问题:对 gold solution 做『完形填空』
从专家 notebook 里把聚焦某一方面的 cells(依赖冲突修复、数据配置、CPU 适配等)挖掉,剩余不依赖它的 cells 预执行作为 prefix,agent 只需解决被挖掉的那个窄问题。这样能按类别细分诊断:agent 在有明确报错的问题上表现尚可(CPU 适配 73%、issue 修复 61%、依赖 54%),在开放式问题上很差(数据配置 27%、trainer 配置 38%)——常见失败模式是不去读仓库代码、直接幻觉出不存在的脚本参数,以及一条路走到黑不回头。
关键结果
- 端到端 Expert 集:最好成绩 GPT-4o + SWE-Agent 也只有 16.3% accuracy(各 agent 12.2-16.3%),landmark 分更高,说明 agent 能推进部分步骤但很难走完全程。
- Masked 子问题集:GPT-4o + SWE-Agent 46.1% accuracy、74.9% landmark;一半以上的『局部技术难点』当时的 SOTA 也解不了。
- 开源模型断崖:Mixtral-8x22B 和 Llama 3.1 70B 在两个集合上都显著低于 GPT-4o;GPT-4o-mini 居中。
- edit action 消融:ReAct-SUPER vs 裸 ReAct,accuracy 41.6% vs 37.0%,landmark 72.5% vs 65.7%——给 agent 一个好用的文件编辑工具比换 prompt 管用。
- Reflexion 式反思重试(k=3)收益微弱:模型本身不会解的问题,反思几遍也不会。
- 错误分析:数据配置类子问题最难(27%),有明确报错信息的最容易(CPU 73%);agent 倾向于幻觉参数而不是读代码。
- 任务平均 gold solution 44.3 行代码、14.4 个 cell,轨迹长是主要挑战之一;每题 token 上限 400k-600k、执行时间 30 分钟。
实证核查
扎实代码、HF 数据集、论文全部实验轨迹均公开,声称与发布物一致,作者对第三方 issue 响应积极并修复;主要软肋是基准依赖『活的』外部仓库和 PyPI,结果随时间漂移,不同时间点跑的分数不可直接比。
论文称 GPT-4o 端到端仅解 16.3%,并公开全部 agent 轨迹供检查。
仓库 trajectories/ 目录确实包含 ReAct-SUPER 和 SWE-Agent 的完整轨迹(README 与论文脚注均指向该目录);HF 上 allenai/super 数据集提供 Expert 45 / Masked 152 / AutoGen 602 三个 split,与论文数字一致,另有 HF Space 排行榜。
任务通过固定 git commit hash 和依赖版本保证『未来可复现』。
第三方复现(issue #8, georg-wolflein, 2025-04)显示这只保证 gold solution 可复现,不保证 agent 分数稳定:2025 年 4 月重跑 7 个原本成功的 Expert 任务,output_match 从 6.5/7 掉到 3.67/7,原因是 agent 会装到基准构建时还不存在的不兼容新版依赖。作者(benbogin)承认这是预期内的漂移,建议只在同一时间窗口内比较不同 agent,且表示已离开 Ai2、无法承诺定期重跑官方结果。
数据集经过人工审核,gold solution 重跑三次结果一致。
发布后仍被用户发现若干数据瑕疵:issue #7 指出 dpt、quantifying-stereotypes 两任务的 commit hash 无效、logme-nlp 的 hash 带换行符(作者已修复),conv_graph 的 GitHub 链接指向子目录导致 git clone 直接失败(作者以『保持任务原样』为由未改);issue #5 指出 solution 依赖格式需要转换才能用。均为边角问题,核心数据可用。
README 宣称提供可直接运行的评测代码(Modal 沙箱,每题 2-3 美分)。
代码可用但维护低频:requirements.txt 曾因 openai/litellm 版本过期导致开箱即报 TypeError(issue #8 第 1 条,2025-04 修复,commit 0c03d77);仓库最后 push 为 2025-04,仅 58 star,issue #3(如何跑 Reflexion 复现)开着无实质解决。把它当『可跑的参考实现』而非持续维护的评测服务比较合适。
与我们方向的关系
对自动化科研方向,SUPER 定位的是 pipeline 里最卡壳的一环:后来的 CORE-Bench、PaperBench 等复现类基准测的都是这个环节的延伸。它的几个设计很值得抄:(1) 故意选 star 中位数 14 的低质量仓库,避免模型靠记忆或高质量文档作弊;(2) landmark 部分分 + masked 子问题双层设计,把稀疏的端到端信号变成可 hill-climb 的细粒度信号,这对我们自己设计评测很有参考价值;(3) 用固定 commit hash + 依赖 freeze 保证 gold 可复现,同时坦承 agent 分数会随生态漂移——做任何『在野外』的 agent 基准都绕不开这个问题,SUPER 的 issue #8 是一个很好的前车之鉴。
错误分析的结论也可直接指导 agent 设计:模型解『有报错信息』的问题远好于开放式配置问题,失败大多源于不读仓库代码就幻觉参数、以及不回溯的贪心决策——针对性地加代码检索/浏览工具和多方案回退机制,可能比换更强的底座模型收益更大(edit action 一项消融 +4.6 分就是证据)。
阅读笔记
论文实验全部在 2024 年 9 月跑,底座最强只到 GPT-4o;2025 年后的强推理模型在 SUPER 上的官方数字没有(作者离开 Ai2,leaderboard 更新停滞),引用时注意 16.3% 是 2024-09 的快照而非现状。想跑的话:需要 Modal 账号(每月 $30 免费额度够跑多轮),本地 backend 会直接在宿主机执行 agent 生成的代码,务必用 Docker。
材料清单
TeX 源码已存档:Raw/super/source/
同类条目