← 返回资料站  /  AutoResearch
基准 评测基准 背景

RExBench: Can coding agents autonomously implement AI research extensions?

RExBench:coding agent 能自主实现论文的研究延伸吗
一句话12 个基于真实 NLP/AI 论文代码库的"研究延伸"实现任务,专家写 gold 实现、私有基础设施自动执行判分;12 个受测 agent 全部在多数任务上失败,最好的 OpenHands + Claude 4 Sonnet 只有 33%(加人工提示也不过 43%,后补的 Claude 4.5 Opus 42%)。

这是什么

RExBench 来自 Boston University 的 Najoung Kim 组(TIN Lab)与 UCL、维也纳大学合作,2025 年 6 月挂出,ACL 2026 接收。它测的不是复现已有结果(那是 PaperBench 的活),而是在已有论文 + 代码库之上实现一个新的研究假设:例如把 WinoDict 里的合成新词换成不同词频的真实英文单词,看已有词义是否干扰 in-context 词汇习得。输入是论文、原代码库和一段专家写的延伸指令,agent 要输出对代码库的修改(git patch),跑出的实验数字落在 gold 实现的目标区间内才算成功。

设计上有两个刻意的取舍:一是抗数据污染——所有延伸想法或实现都是全新的,gold 实现存在私有 Bitbucket 仓库里(特意不用 GitHub,担心私有仓库也可能进过训练数据),评测脚本也不公开,只能提交 patch 到官方基础设施异步执行判分;二是为了自动判分,任务被限定为有明确数值目标的 specifically-scoped 问题,牺牲了一部分开放性。每个任务由 PhD 级领域专家先在评测虚拟机上复现原论文、再实现 gold 延伸(单卡 A100 上 12 小时内跑完),并由至少一名其他作者验证。

主结果:12 个 agent(绿=aider,黄=OpenHands,y 轴为 backbone LLM)在 Final Success / Execution Success / File Recall 三个指标上的表现,每任务 5 次运行。看点:File Recall 普遍 0.5-0.8 而 Final Success 最高仅 0.33(OpenHands + Claude 4 Sonnet),说明 agent 找得到该改的文件但实现不对;DeepSeek-R1 全线接近零。
主结果:12 个 agent(绿=aider,黄=OpenHands,y 轴为 backbone LLM)在 Final Success / Execution Success / File Recall 三个指标上的表现,每任务 5 次运行。看点:File Recall 普遍 0.5-0.8 而 Final Success 最高仅 0.33(OpenHands + Claude 4 Sonnet),说明 agent 找得到该改的文件但实现不对;DeepSeek-R1 全线接近零。

机制与做法

任务与判分

12 个任务覆盖模型、数据、算法、评测四类改动维度,来源包括 COGS、Othello、Tree-of-Thoughts、WinoDict、Mission: Impossible LMs 等论文。三个指标:Final Success Rate(执行结果精确匹配或落在 gold 5 次跑 ±2σ 区间内,作者称实测无假阳性/假阴性)、Execution Success Rate(代码能否无错跑完)、File Recall(agent 改的文件覆盖 gold 改动文件的比例)。执行在 OpenStack + Apptainer 容器里,固定随机种子和硬件,限时 12 小时。

受测 agent 与结果

两个框架(aider、OpenHands)× 六个 backbone(GPT-5、o1、o4-mini、Claude 4 / 3.7 Sonnet、DeepSeek-R1),每任务跑 5 次。最好的 OpenHands + Claude 4 Sonnet:final success 33%、execution success 68%、file recall 76%;DeepSeek-R1 完全失败(0%)。File recall 普遍很高(0.5-0.8),说明 agent 能定位该改哪些文件,难在改对。给两级人工提示(定位信息 / 分步实现指引)后,最好也只到 43%,且弱 agent 基本吃不动提示。投稿后补测 Claude 4.5 Opus:42%(带提示 62%),仍未饱和。

错误分析:显式错误以 Python ValueError 和空 patch 为主;隐式错误(能跑通但数字不对)随模型变强反而增多(OpenHands + Claude 3.7 是 6 个,Claude 4 是 24 个),其中不少来自 agent 越权"过度编辑"指令之外的代码导致静默偏差——作者据此警告:过度依赖 coding agent 可能让错误结果混进科学文献。回归分析显示唯一显著的难度因子是 gold 解的代码改动行数(β=-0.038, p<0.01),代码库大小、仓库热度、论文引用数都不显著。

关键结果

实证核查

扎实声称与公开材料一致,防污染设计(gold 私有、评测封闭)在仓库 issue 中得到印证;代价是无法本地评测、社区参与度很低(8 stars、2 个 issue),第三方独立复现基本无从谈起。
论文称 benchmark 含 12 个研究延伸任务,配领域专家写的指令。
GitHub 仓库 tinlaboratory/rexbench 的 instructions/ 下确有 12 个任务目录(checkeval、cogs、explain-then-translate、winodict 等,gh api contents 核对),每个含 instructions.md;HF 上也有 tin-lab/RExBench 数据集。README 正文的任务清单漏列了 explain-then-translate(只写 11 个),属排版疏漏。
声称对数据污染鲁棒:gold 实现存私有 Bitbucket,评测脚本不公开,agent 无法接触参考解。
仓库 issue #2 有人请求公开评测脚本以便本地快速评测,作者 sebschu 明确拒绝,理由正是防止 LLM 在解上训练;issue #1 确认评测只能通过 rexbench.com/submission 提交 patch 异步进行。设计自洽,但副作用是外界无法独立验证判分逻辑,只能信任作者的'gold range 无假阳/假阴'说法。
最佳 agent 约 33% final success,加提示不超 43%。
论文 Figure(main_results.pdf)数字与摘要一致:OpenHands + Claude 4 Sonnet 0.33/0.68/0.76,附录补测的 Claude 4.5 Opus 为 42%(带提示 62%),仍支持'未饱和'结论。但注意:主结果基于每任务仅 5 次运行、共 12 个任务,单个 agent 的分数粒度粗(一个任务约 8 个百分点),误差条相当宽,排名细节不宜过度解读。

与我们方向的关系

对做 autoresearch 的同学,RExBench 是与 PaperBench 互补的清醒参照:PaperBench 考'复现别人已做出的东西',RExBench 考'在别人代码库上往前多走一步'——后者更接近真实科研工作流,而当前 frontier agent 成功率只有三四成。它的两个实证发现值得直接引用:(1) file recall 高、final success 低,说明瓶颈不在检索定位而在正确实现;(2) 强模型的失败更多是'跑通但数字错'的静默错误,这对任何想在 pipeline 里信任 agent 产出实验数字的设计都是警告——必须配独立验证环节。

方法上可借鉴的点:用'gold 实现 5 次运行 ±2σ'定义数值判分区间、控制种子/硬件/容器来压低执行方差、以及用代码改动行数做任务难度的量化 proxy。局限也要记住:仅 12 个任务、集中在 NLP、判分依赖作者私有基础设施,拿它的绝对数字做模型间精细比较意义有限。

阅读笔记

评测必须走 rexbench.com/submission 提交 git patch + agent 日志,本地跑不了判分(issue #2 作者明确不放脚本)。仓库本体只有任务指令,agent 实现在另外两个 repo(RExBench-aider / RExBench-OpenHands)。GitHub 8 stars、最后 push 2025-07,社区活跃度低,更像论文配套物而非活跃维护的基准。

材料清单

TeX 源码
已存档:Raw/rexbench/source/
代码仓库github.com/tinlaboratory/rexbench
8★ · 最近推送 2025-07-09
项目主页 / 报告rexbench.com/
提交页rexbench.com/submission
评测唯一入口:提交 git patch + agent 日志,官方私有基础设施异步判分
agent 实现github.com/tinlaboratory/RExBench-OpenHands
论文 baseline 的 OpenHands 适配版;aider 版在 tinlaboratory/RExBench-aider

同类条目