基准
评测基准
InnovatorBench: Evaluating Agents' Ability to Conduct Innovative LLM Research
InnovatorBench:评测 agent 端到端做 LLM 创新研究的能力
Yunze Wu, Dayuan Fu, Weiye Si, et al. (GAIR, SJTU; corresponding: Pengfei Liu) · 上海交大 GAIR(Pengfei Liu 组) · ICLR 2026 · 2025-10 · 被引 12
一句话 GAIR 提出 20 个取自真实论文的 LLM 研究任务(数据构造/过滤/增强、loss 设计、reward 设计、scaffold 构建)+ 配套多机 GPU 环境 ResearchGym,要求 agent 真跑训练并超越原论文方案;最强的 Claude Sonnet 4 加权平均也只有 24.01/100,agent 要 11 小时以上才到性能饱和点(PaperBench 只要 1.75 小时)。
这是什么 InnovatorBench 是上海交大 GAIR(Pengfei Liu 组)做的'agent 做 LLM 研究'基准,ICLR 2026 接收。出发点是现有基准要么考纯工程(MLE-bench 式 Kaggle 任务,10 分钟就饱和),要么考纯复现(PaperBench),都没碰到真实研究里最花时间的部分:在多 GPU 集群上跑长时间训练、根据中间结果迭代方案。它的 20 个任务全部取自 14 篇有影响力的论文(来源含 NeurIPS/ICLR/COLM/EMNLP/ACL,如 DAPO),做法是把原论文 codebase 里'核心创意的实现'挖掉(并删掉 git 历史防泄漏),保留可运行的骨架(多数任务基于 LLaMA-Factory 或 verl),让 agent 自己把创新点做出来,目标是超过原论文的 reference solution。
任务分六类:Data Construction、Data Filtering、Data Augmentation、Loss Design、Reward Design、Scaffold Construction。评分是 Kaggle 式的:每个任务最多 4 次提交,格式错误直接 0 分;baseline 方案锚定在 0 分附近,原论文 reference solution 锚定在 80 分附近,超过 reference 继续线性加分到 100。评测脚本运行在 agent workspace 之外,防 reward hacking。每个任务还配一个可选 hint(约等于 ground-truth 思路),agent 用 view_hint 工具查看会被扣分;主实验禁用了 hint。
配套的 ResearchGym 是这篇工作的另一半:提供多机控制(agent 在带一张消费级 GPU 的 container 里,可通过 HTTP 服务调度若干台 8x80GB GPU 服务器)、异步命令执行(训练挂后台、agent 轮询 session 输出)、snapshot 保存/恢复,动作空间含命令、文件、浏览、搜索、文件解析等 30+ 个动作。任务时长 2-36 小时,单任务上限 48 小时或 4000 步,这个 time horizon 是同类基准里最长的。
整体架构:左边 ResearchGym 提供多机控制、共享文件系统和动作/观测循环;上方是任务数据包(task description、初始 workspace、hint、评测脚本);右边 agent 走 ReAct 循环,通过 eval 工具提交并拿到分数反馈,评测在 workspace 之外运行防作弊,snapshot 支持中断恢复。 机制与做法 任务包长什么样
每个任务给 agent 一个结构化 task description(motivation、高层目标、数据/checkpoint 路径与格式、时间和 GPU 约束、评测指标、辅助脚本、环境说明),刻意不给 step-by-step 步骤,鼓励 agent 自己探索超越 reference 的做法。workspace 里预装好 conda 环境(按原论文 setup 搭建,agent 可自行装包)、训练/验证/测试数据(测试集去掉 ground truth)、可继续 SFT/RL 的模型 checkpoint,以及挖掉核心实现的代码仓库和一组数据下载/训练/推理/提交脚本。Data Construction 和 Data Augmentation 两类任务允许联网,其余任务禁用搜索和浏览。
test-time scaling 对比:上图 InnovatorBench 各类任务的平均分随工作时长上升,约 11 小时后才饱和;下图 PaperBench(o1,数据取自其原论文)1.75 小时左右即饱和。注意两边的 agent 和模型并不相同,6.5x 只能看方向不能看精度。 跑分设置与主结果
作者用一个自研的 ReAct agent(带上下文过半自动 summarize)包装 Claude Sonnet 4、GPT-5、GLM-4.5、Kimi-K2 四个模型。加权平均 Final Score:Claude Sonnet 4 得 24.01(六类里四类第一),GPT-5 12.04,GLM-4.5 11.85,Kimi-K2 5.35。分布很有规律:数据类任务(构造/过滤/增强)普遍比算法类(loss/reward 设计)分高,因为数据处理容错、有 rejection sampling 之类的保底策略,而 loss/reward 写错一点就梯度爆炸或学出错误 policy。GPT-5 在 Scaffold Construction 一枝独秀(60.07,接近软件工程任务),但在 Reward Design、Data Augmentation 上是 0 分——trace 显示它训练启动后陷入高频 list sessions 循环导致提前退出;GLM-4.5 会幻觉出错误的工具参数卡在训练前。成本方面 Claude 平均每任务约 5.1 小时、33 美元(只算 LLM token)。
一个反直觉的 ablation:给 Claude 看 ground-truth hint,加权平均反而从 24.01 掉到 13.88——loss/reward 设计类涨了(探索变成照抄),但数据类大幅下降,因为 agent 死板复刻 hint 时在脚本层面引入实现错误。作者由此论证做研究需要创意和代码实现能力两条腿。
失败模式与 test-time scaling
case study 归纳了四种典型失败:Impatience(训练要 10 小时、预算还剩 21 小时,agent 却嫌慢把训练进程 kill 掉换'更高效'的方法)、资源管理失误(先起一个占 1 卡的推理任务,55 步之后忘了它的存在、又在同一台机器上起全卡训练,产生资源冲突)、选次优库(高吞吐场景坚持用 Transformers 推理而不换 vLLM)、模板化推理(合成 CoT 数据时生成语义空洞的模板套话拼接问答)。这些对做 long-horizon research agent 的人是很具体的 failure taxonomy。
test-time scaling 对比:agent 在 PaperBench 上约 1.75 小时性能就饱和,在 InnovatorBench 上要 11 小时以上,差 6.5 倍,主因是数据增强、reward 设计这类任务必须等真实训练跑完才能拿到反馈。
关键结果 20 个任务、14 篇源论文、6 大类;时长 2-36h,单任务上限 48h 或 4000 步,最多 4 次评测提交,是同类基准里 time horizon 最长的(对比表:MLE-bench 10 分钟、PaperBench 1-3 小时)。 最好成绩 Claude Sonnet 4 加权平均 Final Score 24.01/100(reference solution 锚定在 80 分),说明当前 frontier agent 离'做出原论文水平的创新'还很远。 数据类任务 >> 算法类任务:Claude 在 Data Filtering 拿 30.89,在 Loss/Reward Design 只有 12.98/11.56;GPT-5 和 GLM-4.5 在 Reward Design 均为 0 分,且原因主要是工具调用可靠性而非想法。 GPT-5 在 Scaffold Construction 拿 60.07 远超其他模型(Claude 36.63),作者归因于其代码更健壮(重列选项、超时重试 3 次、强制输出格式)——这类任务本质接近传统软件工程。 给 ground-truth hint 反而让 Claude 平均分从 24.01 降到 13.88:算法类涨、数据类崩,复刻 hint 时的脚本实现错误比自主探索伤害更大。 agent 需要 11+ 小时才到饱和点,是 PaperBench(1.75h)的 6.5 倍;每任务成本 Claude 约 33 美元、GLM-4.5 约 5.5 美元(仅 LLM token,不含 GPU)。 实证核查
有水分 基准设计和论文分析扎实,20 个任务配置在 repo 里可数;但工程门槛极高、几乎没有社区使用痕迹(17 stars、2 个 issue、leaderboard 'under construction'),关键对比(6.5x saturation)是拿自家 agent 对比 PaperBench 论文里 o1 的旧数,且主结果每模型似乎只跑一次、没有方差。
官方称是'benchmark-platform pair',README 架构图列出 evaluations/(20 个任务的评测逻辑)是仓库的一部分。
GitHub 仓库根目录实际只有 agents/、research_gym/、llm/、alpaca_eval-0.6.2/ 等,没有 evaluations/ 目录(gh api repos/GAIR-NLP/InnovatorBench/contents 确认 404);评测脚本和数据要从 HF 数据集 GAIR/InnovatorBench 下载后手动挪进来。20 个任务的环境配置确实齐全(research_gym/configs/tasks/task_1.yaml 到 task_20.yaml 都在)。HF 数据集本次网络原因未能核对规模。
论文称 agent 需要 6.5 倍于 PaperBench 的时间才到饱和点,以此论证基准难度是'下一代 code-based research benchmark'。
论文图 6(test-time-scaling)自己的 caption 承认 PaperBench 那条曲线'comes from the original paper'——即拿自家 ReAct agent + Claude/GPT-5 的曲线,对比 PaperBench 论文里 o1 + 不同 scaffold 的曲线,模型和 agent 框架都不同,6.5x 这个数不是受控对比。难度结论方向上可信(任务确实要等训练跑完),但倍数本身不严格。
定位为社区可用的标准基准,README 设 leaderboard 并欢迎提交。
发布近一年(2025-09 建仓,截至 2026-08)只有 17 stars、2 个 issue(一个问是否支持开源模型,一个是无关的推销帖,均已关闭),leaderboard 仍标注 'under construction',榜上只有作者自测的 4 个模型;未搜到第三方复现报告。部署门槛是重要原因:需要自建多台 docker + web server、逐任务改 yaml 里的 computer_ip、配 alpaca_eval 的 judge API key,且部分任务(LLM judge 打分、8x80GB GPU 节点)对个人研究者成本很高。
主结果表给出四个模型在六类任务上的 Final/Best Score,并据此排名。
论文实验设置(main.tex §5.1)未提多 seed 或多次运行,每类平均自 20 个任务、每模型看起来只跑一遍;考虑到作者自己展示的失败案例高度随机(如 GPT-5 的 list-sessions 死循环),单次运行的类别级分数(尤其 0 分项)方差可能很大,模型间小差距不宜过度解读。另外单任务成本 30+ 美元 LLM token 加多机 GPU,重复实验确实昂贵,这是客观约束。
与我们方向的关系 对做 autoresearch 的组,这个基准的价值在于它测的正是我们关心的那段能力:不是复现论文,而是在挖空的 codebase 上把创新点重新做出来、并在真实多卡训练循环里迭代。它与 MLE-bench(纯工程、分钟级)和 PaperBench(纯复现)形成互补,六类任务里 Loss/Reward Design 是当前 agent 最弱、也最接近'算法研究'本质的部分,可以作为我们自己 agent 的能力靶子。
两个可直接借鉴的点:一是 ResearchGym 的工程设计(异步 session 管理、多机 HTTP 调度、snapshot 恢复、上下文过半自动 summarize),做长时程 research agent 都绕不开这套基础设施,代码 Apache-2.0 可复用;二是失败分类(impatience、资源管理失忆、次优库选择、模板化推理)给 agent scaffold 的改进提供了具体清单——例如对'训练进行中'状态加显式的资源台账和等待策略,可能比换更强的底座模型收益更直接。用它评测自己 agent 前要预估好成本:全量 20 任务跑一遍,LLM token 数百美元 + 多台 8x80GB GPU 若干天。
阅读笔记 复现部署时注意:README 的安装步骤里 evaluations/ 和数据集都在 HF 上,需要手动搬运并逐任务改 task_i.yaml(computer_ip、web_server_host、数据路径),还要给 alpaca_eval 配 judge API key;task_10/task_16 需要手动复制 corpus 目录。仓库主语言标成 Jupyter Notebook 是因为 alpaca_eval 整包 vendor 进来了。论文正文一些数字有细微不一致(hint 表里 Data Construction best 26.87 vs 主表 26.88),不影响结论。
材料清单 TeX 源码 已存档:Raw/innovatorbench/source/
同类条目