← 返回资料站  /  AutoResearch
基准 评测基准 ★ 必读

EXP-Bench: Can AI Conduct AI Research Experiments?

EXP-Bench:AI 能独立完成 AI 研究实验吗?
一句话从 51 篇 NeurIPS/ICLR 2024 论文半自动抽取 461 个端到端研究实验任务(设计→实现→执行→结论),对 OpenHands/IterativeAgent × 5 个模型的评测显示:单项能力(设计/实现)最高 20-35%,但完整做对且可执行的比例只有 0.5%——目前对'AI 独立做 AI 研究实验'最直接也最悲观的度量。

这是什么

AutoResearch 方向的评测大多只测流水线的某一环:文献综述、想 idea、写代码、复现论文。EXP-Bench(Michigan 系,与 Curie agent 同一团队,后发表于 ICLR 2026)瞄准的是中间最硬的一环——'给定研究问题,把实验从头做到尾':agent 拿到一个具体的 research question、一段 high-level method 描述和一个被部分 mask 的真实论文代码库,需要产出结构化的实验设计、代码修改(以 git diff 形式提取)、真正跑起来并给出回答研究问题的结论。

任务不是人造题,而是从 51 篇有影响力的论文(NeurIPS 2024 占 53%、ICLR 2024 占 47%,按引用数和 repo 活跃度筛选)中抽出的 461 个真实实验,覆盖 Deep Learning、RL、CV、NLP、Time Series 等约 18 个类别,进一步拆成 12,737 个可单独打分的 subtask。例如从 MogaNet 论文中抽出'MogaNet 在 ImageNet-1K 上是否优于同量级轻量模型'这样的问题,ground truth 直接对齐原始代码里的训练脚本。

结论很刺眼:即使是表现最好的 OpenHands + o3-mini,设计/实现/结论三项全对的任务只有 1.4%,再要求代码真的可执行则跌到 0.5%。作者把 3,238 条错误分析归纳成 361 类失败模式,给出了'AI 现在到底卡在哪'的细粒度地图。

一个任务实例(源自 ICLR 2024 MogaNet):左侧是 agent 拿到的输入——research question('MogaNet 在 ImageNet-1K 上是否优于轻量基线')、high-level method 和被 mask 的 starter code;右侧是判分用的 ground truth——实验设计要点、精确到代码行的实现需求、以及论文原始结论。看这张图能直观理解 EXP-Bench 的任务粒度和 ground truth 硬度。
一个任务实例(源自 ICLR 2024 MogaNet):左侧是 agent 拿到的输入——research question('MogaNet 在 ImageNet-1K 上是否优于轻量基线')、high-level method 和被 mask 的 starter code;右侧是判分用的 ground truth——实验设计要点、精确到代码行的实现需求、以及论文原始结论。看这张图能直观理解 EXP-Bench 的任务粒度和 ground truth 硬度。

机制与做法

任务形式:输入-输出-判分三元组

每个任务给 agent 三样东西:(1) research question(如'PPO 和 Q-Learning 在 SMAX 环境里训练时间和归一化分数如何比较');(2) high-level method(实验思路,但不含具体解法);(3) 原论文代码库——其中能直接给出答案的脚本和根目录 README 会被 git 操作(含递归 submodule)mask 掉,防止抄答案。agent 需要输出实验设计(变量、流程)、代码修改(自动构建 git diff)和最终结论。

Ground truth 三件套全部来自原论文和原代码:设计要点清单、逐步实现需求(由 AST 追踪已验证脚本链生成的自然语言步骤,精确到文件和行号)、以及论文报告的实验结论。评测在干净的 Docker 容器(Ubuntu 24.04 + 4×A40 GPU)内进行,每任务限时 40 分钟。

全文最重要的一张图:评测标准逐层收紧时分数的塌缩。只查作弊(M)时平均约 20.6%,叠加结论+设计正确(M·C·D)跌到 3.7%,再加实现正确(+I)只剩 0.4%,最后要求真实可执行(+E)仅 0.2%。单项指标会严重高估 agent 的研究能力。
全文最重要的一张图:评测标准逐层收紧时分数的塌缩。只查作弊(M)时平均约 20.6%,叠加结论+设计正确(M·C·D)跌到 3.7%,再加实现正确(+I)只剩 0.4%,最后要求真实可执行(+E)仅 0.2%。单项指标会严重高估 agent 的研究能力。

半自动构建流水线:三阶段,机器抽取 + 轻量人工核对

Stage 1 选源:从顶会论文中按引用数、GitHub stars/forks 筛出带开源代码的工作。Stage 2 抽取:先对论文 PDF 做 OCR + 多模态索引,多轮 RAG 式查询抽出 research question / method / expected outcome;再让一个带终端和 PDF 阅读能力的 agent 在代码库里做目标条件搜索,定位实现该实验的脚本链,跑通后用 AST 追踪生成逐步实现需求。Stage 3 验证:脚本链在干净容器里执行,输出对得上论文才算数,失败则打回 Stage 2 迭代;最后人工核对结构化内容。

成本账很具体:流水线成熟后人工验证降到每篇论文约 20 分钟(之前约 2 小时),LLM 抽取成本平均每篇约 $60(o3-mini 抽任务 + Claude 3.7 Sonnet 抽实现)。这是它能扩到 51 篇/461 任务而 PaperBench 只有 20 篇的原因——人只做核对,不做从零复现。

461 个任务的领域分布:Deep Learning 最多(约 123 个),其后是 RL、Applications、Optimization、CV 等约 18 个类别;右上小图显示任务按来源分为 ICLR 2024(20 篇论文、约 200 任务)和 NeurIPS 2024(约 20 篇、约 260 任务)。
461 个任务的领域分布:Deep Learning 最多(约 123 个),其后是 RL、Applications、Optimization、CV 等约 18 个类别;右上小图显示任务按来源分为 ICLR 2024(20 篇论文、约 200 任务)和 NeurIPS 2024(约 20 篇、约 260 任务)。

评测判官:Monitor + LLM judge + 真实执行

打分分三层。先由 Monitor 查作弊:是否直接打开了论文 PDF、是否 git checkout 回含答案的 commit、是否用假数据/硬编码结果冒充实验产出(记 M 指标)。然后 o3-mini 作为 LLM judge 对照 ground truth 给出 D(设计正确率)、I(实现需求满足比例)、C(结论正确性)。最后 Code Execution Validator 在等价容器里真跑 agent 的代码改动,得出可执行性 E。

论文自己承认单项指标不可靠:C 方差大(agent 会编出貌似合理但没有实验支撑的结论)、E 会高估(mock 实现也能跑通),所以主推 conjunctive 指标(C·D、I·E、All·E)。这个'合取指标才见真相'的设计是全文方法论上最值得借鉴的一点。

各 agent+模型组合的平均单任务成本与耗时(括号内为综合排名):排名第 1 的 OH+o3-mini 只花约 $0.5/25 分钟,排名第 2 的 OH+3.7 Sonnet 却要约 $10/33 分钟——成本、耗时与研究能力几乎不相关。
各 agent+模型组合的平均单任务成本与耗时(括号内为综合排名):排名第 1 的 OH+o3-mini 只花约 $0.5/25 分钟,排名第 2 的 OH+3.7 Sonnet 却要约 $10/33 分钟——成本、耗时与研究能力几乎不相关。

失败模式分析:39.7% 是'漏掉关键实现组件'

对全部评测 trace 做两轮开放式归纳,3,238 条原始错误洞察压成 361 类。实现阶段最大头是 Missing Essential Implementation Components(39.71%),如漏掉 Mixup/CutMix/Label Smoothing 等增强、漏掉语义检索策略;执行阶段是环境/依赖配置错误(29.38%,如 PyTorch/Flax 缺失、环境未注册)和脚本/文件错误(23.84%,如 timm 里找不到 moganet_tiny、checkpoint 缺失);结论阶段 26.18% 干脆缺结论内容、19.66% 解读错误。整体画像:agent 能写出'看起来像那么回事'的代码和结论,但在把抽象需求落成完整可复现实验的每一步都在掉链子。

关键结果

实证核查

扎实数据集、评测 harness、失败分析全部公开且与论文声称对得上,后被 ICLR 2026 正式接收;主要保留意见是执行验证只覆盖不均匀的子集、judge 是 o3-mini 单模型、被测 agent/模型停留在 2025 年初,0.5% 这个数字不能直接外推到今天的前沿模型。
论文声称构建了 461 个任务、12,737 个 subtask 的公开数据集和完整评测 harness。
HuggingFace 数据集 Just-Curieous/EXP-Bench 可访问,viewer 中每条任务确实包含 research question、结构化 problem setup、精确到 文件:行号 的逐步实现需求(如 mappo_rnn_smax.py:5-19)、expected outcome 和源脚本列表;GitHub Just-Curieous/Curie 的 benchmark/exp_bench/ 目录下有 Dockerfile、evaluation/ 判官代码和并行评测脚本,README 给出完整复跑指令。声称与工件一致。
headline 数字:完整可执行实验成功率仅 0.5%(All·E✓)。
这个数字有细则:执行验证(E)因耗时只对部分 trace 运行,且各模型被执行检查的任务数差异极大(论文 Table 2 的 #E 列:o3-mini 420 个、3.7 Sonnet 235 个、Nova Pro 只有 56 个),未过 Monitor 的 trace 直接丢弃不执行。0.5% 本身可信,但跨模型的 All·E 对比建立在不均匀子集上;仓库 README 也警告单个 LLM+Agent 组合的评测'可能耗时数天',第三方完整复跑门槛高,截至 2026-08 未检索到独立复现报告。
评测由'严格的多组件 judge'完成,能可靠判定设计/实现/结论正确性。
D/I/C 三项全部由 o3-mini 单一 LLM judge 打分(执行 E 是真跑代码),而 o3-mini 同时也是被测 agent 之一、还是构建流水线的抽取模型;论文自己的稳定性分析(Fig.6)承认 C 和 E 单项方差大、会高估,靠合取指标缓解,但源码和附录中未见 judge 与人工打分的一致性统计(如 kappa)。判分体系自洽但缺独立校准,单项分数只能看趋势。
任务源自'有影响力的顶会论文',ground truth 经人工验证忠实于原论文。
附录列出了全部 51 篇源论文(含 Safe RLHF、JaxMARL、MogaNet 等,附引用数和 star 数);人工验证是'轻量核对'(流水线成熟后每篇约 20 分钟),并非逐任务从零复现,质量依赖流水线本身(供参考:抽取成本约 $60/篇)。另外仓库 issues 集中在 Curie 框架本身(环境路径、Docker 等),没有针对 EXP-Bench 任务质量的第三方质疑帖——也说明实际用它跑评测的外部用户还不多。
(收录信息核对)venue 标注为 NeurIPS 2025 D&B。
tex 源码确实用的 neurips_2025.sty(投过 NeurIPS 2025 D&B),但最终以 conference paper 发表于 ICLR 2026(proceedings.iclr.cc/paper_files/paper/2026/.../c411f5b2...pdf 首页标注 'Published as a conference paper at ICLR 2026',作者单位 UMich/Rice/Cisco/UC Berkeley)。S2 引用数 32(2026-08),OpenReview 页显示 cited by 40。

与我们方向的关系

对 autoresearch 方向这是一块必须踩的基石:它把'做实验'拆成 design/implementation/execution/conclusion 四个可分别打分的阶段,并用合取指标暴露'单项分数好看、端到端全崩'的假象——这套评测方法论(Monitor 防作弊 + LLM judge 部分分 + 真实执行验证 + conjunctive scoring)比它的具体数字更值得搬走。做 research agent 的同学可以直接用它的 461 个任务当训练/评测材料,失败模式表(361 类)就是现成的改进 checklist:优先解决环境配置和'漏关键组件'两类问题,收益最大。

读数字时注意时效:被测的是 2025 年初的 OpenHands + o3-mini/Claude 3.7 一代,40 分钟限时也偏紧,今天的前沿模型 + 更长预算下 0.5% 大概率被显著刷新(这正是 benchmark 设计目的)。另外它与同团队的 Curie agent、OpenAI 的 PaperBench 构成一个谱系:PaperBench 测'复现整篇论文',EXP-Bench 测'做单个实验',粒度更细、ground truth 更硬(对齐原代码而非评审 rubric),两者对照读收获更大。

阅读笔记

catalog 里 venue 写 NeurIPS 2025 D&B,实际最终发表于 ICLR 2026(见 reality 第 5 条),建站时建议标 ICLR 2026。EXP-Bench 不是独立仓库,而是 Curie 仓库的 benchmark/exp_bench/ 子目录,repo stars(371)是 Curie 整体的。figures/ 里 fig04 总览图是三个草稿版本叠在一张画布上,不宜直接用,选了任务示例图代替。

材料清单

TeX 源码
已存档:Raw/exp-bench/source/
代码仓库github.com/Just-Curieous/Curie
371★ · 最近推送 2025-09-28
评测代码github.com/Just-Curieous/Curie/tree/main/benchmark/exp_bench
Docker 化评测 harness(在 Curie 仓库子目录内,非独立 repo)
ICLR 2026 正式版proceedings.iclr.cc/paper_files/paper/2026/file/c411f5b2d9c55f1685e72db224ad8b0e-Paper-Conference.pdf
最终发表版本(catalog 标注的 NeurIPS 2025 D&B 非最终 venue)
OpenReviewopenreview.net/forum?id=KjgyAm383Z
评审意见与讨论
同团队 Curie agent 论文arxiv.org/abs/2502.16069
EXP-Bench 所在仓库的主项目:自动化严谨实验的 agent 框架

同类条目