基准
评测基准
CORE-Bench: Fostering the Credibility of Published Research Through a Computational Reproducibility Agent Benchmark
CORE-Bench:用 90 篇已发表论文测 agent 的计算可复现能力
Zachary S. Siegel, Sayash Kapoor, Nitya Nadgir, Benedikt Stroebl, Arvind Narayanan · Princeton · COLM 2025 · 2024-09 · 被引 107
一句话Princeton 把'给你代码和数据,把论文结果跑出来'做成了 270 个任务的 benchmark;2024 年最好的 agent 在最难档只有 21.5% 准确率,到 2025 年底被 Claude Code + Opus 4.5 以 77.8%(人工复核后 95.5%)基本打穿,官方宣布 benchmark solved 并推出 v1.1。
这是什么
计算可复现性(computational reproducibility)指用作者提供的代码和数据重新跑出论文里报告的结果。这件事听起来是体力活,实际上对人类研究者也很耗时(装依赖、找入口、对结果),是科研流程里公认的痛点。CORE-Bench 的出发点是:agent 想做'自动科研',先得会复现别人的工作——这是比产出新研究更基础、也更可验证的一步。
Benchmark 由 90 篇已发表论文(CS、社会科学、医学三个学科,Python 或 R 实现)构成,每篇造 3 个难度档,共 270 个任务、181 个 task questions。论文全部选自 CodeOcean 平台的 capsule——这些 capsule 本身已被验证可复现,巧妙绕开了'构建 benchmark 本身就得逐篇人工验证复现性'的成本问题。45 篇作训练集,45 篇作测试集,测试集 JSON 用 GPG 加密防爬(密码公开为 'reproducibility',只防搜索引擎不防人)。
任务形式:agent 拿到 task prompt(如 'Run main.py')和若干问题(如'报告 no DTW 时 HyperETA 的 MAPE'),需要在隔离环境(本地 Docker 或 Azure VM)里装依赖、跑代码、从输出(终端文本、图、PDF)里提取答案写进 report.json。每个任务至少含一个无法靠猜答对的开放数值题,且所有问题全对才算任务成功。
任务全貌:agent 拿到 task prompt + 问题和 CodeOcean 代码仓库,在隔离 VM 里跑代码,把答案写进 report.json,逐题判对错(图中第二题读图报相关系数即典型的视觉题)。机制与做法
三档难度阶梯
Easy:直接给 agent 一次成功运行的完整代码输出,只考信息抽取(在一堆文件/图里找到正确答案);Medium:给 Dockerfile 和 README,考执行 Docker 命令 + 抽取;Hard:只给 README,agent 要自己装全部依赖、确定正确的运行命令、跑通再抽取——最接近真实世界的复现场景。三档共用同一批问题,所以能定位 agent 到底卡在哪个能力上(检索、终端交互还是环境配置)。
问题分文本和视觉两类:文本题答案在终端输出、PDF 文本、HTML/markdown 表格里;视觉题要从生成的图表里读数(如'从 Kitchen-Autumn 图报告 hum 和 gas 的相关系数')。
Hard 档的成本-准确率散点(2024 年基线):最好的 CORE-Agent + GPT-4o 约 $3/任务只有 21% 准确率;同成本下通用 AutoGPT 只有 6.7%,说明少量任务定制的回报远大于换更贵的运行预算。此图为论文原始结果,2025 年底 Claude Code + Opus 4.5 已把 Hard 打到 77.8%。评分:预测区间而非精确匹配
作者对每个 capsule 人工复现 3 次,对每个问题构造 95% prediction interval,agent 的答案落在区间内才算对(实际只有 17/181 个问题的答案有随机性)。任务级判定是所有问题全对,防猜。
评测 harness 支持 Azure VM 并行(非 GPU 用 Standard_E2as_v5,GPU 用 NC4as_T4_v3),每任务单独开 VM,比串行评测省几天时间;每个 agent 默认 $4 API 成本上限。
基线:AutoGPT vs 定制化 CORE-Agent
基线用了通用 AutoGPT(只加了 query_vision_language_model 工具)和在其上改造的 CORE-Agent——主要改动是对 report.json 格式做程序化检查、按难度档加针对性提示,总共只花几天工作量。结论之一:极小的任务定制就能大幅拉高通用 agent 的表现,弱模型受益更明显(gpt-4o-mini 在 Easy 上从 8.9% 提到 44.4%)。
关键结果
- 最好的基线 CORE-Agent + GPT-4o:Easy 60.0%、Medium 57.8%、Hard 21.5%(测试集,3 次运行平均);通用 AutoGPT + GPT-4o 在 Hard 上只有 6.7%。
- 把成本上限从 $4 提到 $10,GPT-4o 在 Hard 训练集上只从 26% 涨到 31%:agent 成功时很快($0.54/成功任务),失败时是卡死在装依赖等循环里,给再多预算也没用。
- 文本题远比视觉题容易:CORE-Agent + GPT-4o 在 Easy 上文本题 87.9% vs 视觉题 59.3%。
- Python 任务显著比 R 容易——R capsule 经常输出整份 PDF 手稿要 agent 自己翻,且 R 依赖安装更慢更容易超时。
- 安全插曲:有 agent 跑去 CodeOcean 网站注册账号想找依赖信息,作者因此在发布版 harness 里封了 codeocean.com 域名。
- 后续:HAL leaderboard 上 Claude Code + Opus 4.5 在 Hard 上拿到 77.8%(人工复核修正判分错误后 95.5%),2025 年 12 月官方宣布 CORE-Bench solved;2026 年团队发了后续论文并推出修补 construct validity 问题的 CORE-Bench v1.1 和 OOD 任务集。
实证核查
扎实数据、harness、评测流程全部开源且被第三方(HAL、Nicholas Carlini 等)实际使用和复核;论文当年的声称与代码一致。需要知道的是它 2025 年底已饱和被宣布 solved,原始 harness 也停止维护,现在入手应直接用 hal-harness 和 v1.1。
论文声称最好的 agent 在最难任务上只有 21% 准确率,'自动化常规科研任务还有巨大提升空间'。
这一数字当时属实,但已过时:HAL 官方 leaderboard(hal.cs.princeton.edu/corebench_hard)显示 Claude Code + Opus 4.5 在 Hard 上达 77.78%,人工复核修正自动判分错误后为 95.5%,团队于 2025-12 宣布 CORE-Bench solved。后续论文 'Life After Benchmark Saturation'(arXiv:2606.26158)承认原版存在能被强 agent 利用的 shortcut 等 construct validity 问题,并发布 CORE-Bench v1.1 和 CORE-Bench OOD。
README 提供完整的安装和 quick-start 流程,harness '可以轻松评测你自己的 agent'。
原始 harness 已停止维护:issue #51(2025-11)报告按 README 步骤 quick-start 直接失败,作者回复推荐改用 princeton-pli/hal-harness 并更新了 README 顶部说明。仓库 79 stars,最后 push 2025-11,自造 harness 部分(Azure VM 管理等)历史 issue 不少(#42 Poetry 装不上、#32 GPU VM 创建失败、#41 AutoGPT crash),但都有响应和修复记录。
评测用 3 次人工复现构造 95% prediction interval 自动判分,'快速且可并行'。
自动判分基本可靠但并非无误:HAL 团队在 2025 年对 Opus 4.5 的 run 做人工复核时发现了判分错误(grading errors),修正后成绩从 77.78% 升到 95.5%——即自动评分在 benchmark 后期存在约十几个百分点的低估。这也是后续 v1.1 修补的内容之一。
测试集防污染:core_test.json 用 GPG 加密发布。
加密密码 'reproducibility' 直接写在 README 里(仓库 README 第 41 行),只能防爬虫不防训练数据收集;且任务对应的 code capsule 从 corebench.cs.princeton.edu 明文下载。作为 2024 年的 benchmark 这是当时的常规做法,但用今天的模型跑分时污染风险无法排除。
与我们方向的关系
对 autoresearch 方向,CORE-Bench 是'复现已有工作'这一环的标准参照:它证明了复现任务可以低成本规模化出题(借力 CodeOcean 这类已验证可复现的资源),用'全部问题答对 + prediction interval'的判分设计防猜、容忍随机性,这两个构造技巧对我们自己造评测都可直接借鉴。它的失败分析也有信息量——agent 主要死在依赖安装死循环和多文件结果检索上,而不是'不会科研'。
更重要的教训在它的生命周期:一年多就从 21% 打到饱和,且强 agent 暴露出弱 agent 时代看不见的 shortcut(construct validity 问题)。跟进时应直接看 CORE-Bench v1.1 / OOD 和 'Life After Benchmark Saturation'(arXiv:2606.26158)——那篇还做了人机协作复现的小型随机实验(agent 辅助人类提速约 2 倍),对我们思考'agent 辅助科研'的评测范式更有参考价值。
阅读笔记
跑评测别用原仓库 harness(已停止维护、quick-start 报错),用 princeton-pli/hal-harness。本地跑需要 Docker --privileged(Medium 档要 Docker-in-Docker)。论文正式发表于 TMLR(catalog 里标 COLM 2025,S2 显示 venue 为 Trans. Mach. Learn. Res.,以 S2 为准)。
材料清单
TeX 源码已存档:Raw/core-bench/source/
同类条目