基准
评测基准
背景
RExBench: Can coding agents autonomously implement AI research extensions?
RExBench:coding agent 能自主实现论文的研究延伸吗
Nicholas Edwards, Yukyung Lee, Yujun Audrey Mao, Yulu Qin, Sebastian Schuster, Najoung Kim · Boston University(Najoung Kim TIN Lab)等 · ACL 2026 · 2025-06 · 被引 15
一句话 12 个基于真实 NLP/AI 论文代码库的"研究延伸"实现任务,专家写 gold 实现、私有基础设施自动执行判分;12 个受测 agent 全部在多数任务上失败,最好的 OpenHands + Claude 4 Sonnet 只有 33%(加人工提示也不过 43%,后补的 Claude 4.5 Opus 42%)。
这是什么 RExBench 来自 Boston University 的 Najoung Kim 组(TIN Lab)与 UCL、维也纳大学合作,2025 年 6 月挂出,ACL 2026 接收。它测的不是复现已有结果(那是 PaperBench 的活),而是在已有论文 + 代码库之上实现一个新的研究假设:例如把 WinoDict 里的合成新词换成不同词频的真实英文单词,看已有词义是否干扰 in-context 词汇习得。输入是论文、原代码库和一段专家写的延伸指令,agent 要输出对代码库的修改(git patch),跑出的实验数字落在 gold 实现的目标区间内才算成功。
设计上有两个刻意的取舍:一是抗数据污染——所有延伸想法或实现都是全新的,gold 实现存在私有 Bitbucket 仓库里(特意不用 GitHub,担心私有仓库也可能进过训练数据),评测脚本也不公开,只能提交 patch 到官方基础设施异步执行判分;二是为了自动判分,任务被限定为有明确数值目标的 specifically-scoped 问题,牺牲了一部分开放性。每个任务由 PhD 级领域专家先在评测虚拟机上复现原论文、再实现 gold 延伸(单卡 A100 上 12 小时内跑完),并由至少一名其他作者验证。
主结果:12 个 agent(绿=aider,黄=OpenHands,y 轴为 backbone LLM)在 Final Success / Execution Success / File Recall 三个指标上的表现,每任务 5 次运行。看点:File Recall 普遍 0.5-0.8 而 Final Success 最高仅 0.33(OpenHands + Claude 4 Sonnet),说明 agent 找得到该改的文件但实现不对;DeepSeek-R1 全线接近零。 机制与做法 任务与判分
12 个任务覆盖模型、数据、算法、评测四类改动维度,来源包括 COGS、Othello、Tree-of-Thoughts、WinoDict、Mission: Impossible LMs 等论文。三个指标:Final Success Rate(执行结果精确匹配或落在 gold 5 次跑 ±2σ 区间内,作者称实测无假阳性/假阴性)、Execution Success Rate(代码能否无错跑完)、File Recall(agent 改的文件覆盖 gold 改动文件的比例)。执行在 OpenStack + Apptainer 容器里,固定随机种子和硬件,限时 12 小时。
受测 agent 与结果
两个框架(aider、OpenHands)× 六个 backbone(GPT-5、o1、o4-mini、Claude 4 / 3.7 Sonnet、DeepSeek-R1),每任务跑 5 次。最好的 OpenHands + Claude 4 Sonnet:final success 33%、execution success 68%、file recall 76%;DeepSeek-R1 完全失败(0%)。File recall 普遍很高(0.5-0.8),说明 agent 能定位该改哪些文件,难在改对。给两级人工提示(定位信息 / 分步实现指引)后,最好也只到 43%,且弱 agent 基本吃不动提示。投稿后补测 Claude 4.5 Opus:42%(带提示 62%),仍未饱和。
错误分析:显式错误以 Python ValueError 和空 patch 为主;隐式错误(能跑通但数字不对)随模型变强反而增多(OpenHands + Claude 3.7 是 6 个,Claude 4 是 24 个),其中不少来自 agent 越权"过度编辑"指令之外的代码导致静默偏差——作者据此警告:过度依赖 coding agent 可能让错误结果混进科学文献。回归分析显示唯一显著的难度因子是 gold 解的代码改动行数(β=-0.038, p<0.01),代码库大小、仓库热度、论文引用数都不显著。
关键结果 12 个受测 agent 无一能完成多数任务;最佳组合 OpenHands + Claude 4 Sonnet 的 final success rate 为 33%,aider 系最好只有 13%(Claude 4 Sonnet)。 两级人工提示(信息定位 / 分步指引)把最好成绩提到 43%(OpenHands + Claude 4 Sonnet 和 GPT-5),但默认成功率为 0 的 agent 加提示也几乎不涨。 File recall 普遍 0.5-0.8,远高于 final success:agent 找得到该改的文件,但实现不对——瓶颈在正确实现而非代码定位。 更强的模型产生更多"隐式错误"(跑通但结果错):OpenHands + Claude 3.7 有 6 个,Claude 4 有 24 个,且专家也不易定位原因;逻辑错误与取值错误约 2:1。 唯一显著的难度预测因子是 gold 实现的代码改动行数(p<0.01);任务难度与代码库大小、GitHub 热度、论文引用数无显著关系。 投稿后补测 Claude 4.5 Opus:OpenHands 下 42%(execution success 70%,带提示 62%),模型更新确实稳步涨分但远未饱和。 成本方面 OpenHands + Claude 4 Sonnet 单任务 prompt token 最高达 1.85M(约为 aider 的 592 倍);aider 因非迭代设计固定 2 轮,便宜但上限低。 实证核查
扎实 声称与公开材料一致,防污染设计(gold 私有、评测封闭)在仓库 issue 中得到印证;代价是无法本地评测、社区参与度很低(8 stars、2 个 issue),第三方独立复现基本无从谈起。
论文称 benchmark 含 12 个研究延伸任务,配领域专家写的指令。
GitHub 仓库 tinlaboratory/rexbench 的 instructions/ 下确有 12 个任务目录(checkeval、cogs、explain-then-translate、winodict 等,gh api contents 核对),每个含 instructions.md;HF 上也有 tin-lab/RExBench 数据集。README 正文的任务清单漏列了 explain-then-translate(只写 11 个),属排版疏漏。
声称对数据污染鲁棒:gold 实现存私有 Bitbucket,评测脚本不公开,agent 无法接触参考解。
仓库 issue #2 有人请求公开评测脚本以便本地快速评测,作者 sebschu 明确拒绝,理由正是防止 LLM 在解上训练;issue #1 确认评测只能通过 rexbench.com/submission 提交 patch 异步进行。设计自洽,但副作用是外界无法独立验证判分逻辑,只能信任作者的'gold range 无假阳/假阴'说法。
最佳 agent 约 33% final success,加提示不超 43%。
论文 Figure(main_results.pdf)数字与摘要一致:OpenHands + Claude 4 Sonnet 0.33/0.68/0.76,附录补测的 Claude 4.5 Opus 为 42%(带提示 62%),仍支持'未饱和'结论。但注意:主结果基于每任务仅 5 次运行、共 12 个任务,单个 agent 的分数粒度粗(一个任务约 8 个百分点),误差条相当宽,排名细节不宜过度解读。
与我们方向的关系 对做 autoresearch 的同学,RExBench 是与 PaperBench 互补的清醒参照:PaperBench 考'复现别人已做出的东西',RExBench 考'在别人代码库上往前多走一步'——后者更接近真实科研工作流,而当前 frontier agent 成功率只有三四成。它的两个实证发现值得直接引用:(1) file recall 高、final success 低,说明瓶颈不在检索定位而在正确实现;(2) 强模型的失败更多是'跑通但数字错'的静默错误,这对任何想在 pipeline 里信任 agent 产出实验数字的设计都是警告——必须配独立验证环节。
方法上可借鉴的点:用'gold 实现 5 次运行 ±2σ'定义数值判分区间、控制种子/硬件/容器来压低执行方差、以及用代码改动行数做任务难度的量化 proxy。局限也要记住:仅 12 个任务、集中在 NLP、判分依赖作者私有基础设施,拿它的绝对数字做模型间精细比较意义有限。
阅读笔记 评测必须走 rexbench.com/submission 提交 git patch + agent 日志,本地跑不了判分(issue #2 作者明确不放脚本)。仓库本体只有任务指令,agent 实现在另外两个 repo(RExBench-aider / RExBench-OpenHands)。GitHub 8 stars、最后 push 2025-07,社区活跃度低,更像论文配套物而非活跃维护的基准。
材料清单 TeX 源码 已存档:Raw/rexbench/source/
同类条目