← 返回资料站  /  AutoResearch
基准 评测基准

ResearchClawBench: A Benchmark for End-to-End Autonomous Scientific Research

ResearchClawBench:端到端自主科研评测基准
一句话上海 AI Lab 系 InternScience 出的 40 任务 x 10 学科的自主科研基准:给 agent 原始数据+相关文献,藏起目标论文,用专家 rubric 打分看能否'重发现'论文结论(50 分=达到论文水平)。最强的 Claude Code 平均只有 21.5 分,离可靠重发现还很远。

这是什么

ResearchClawBench(RCBench)把'AI 能不能自己做科研'变成一个可打分的问题。每个任务从一篇已发表的真实论文出发:专家把论文的核心科学问题改写成任务描述 q,配上约 4 篇相关文献和原始数据(.dat/.csv/.h5/.pdb 等),而目标论文本身对被测系统隐藏。agent 要在沙盒工作区里自己探索数据、写代码、出图,最后产出 report/report.md,再由 GPT-5.1 多模态 judge 对照专家从目标论文提取的加权 rubric 逐项打分。

评分体系叫 RADS(Reference-Anchored Discovery Score):目标论文不是标准答案而是'人类参考研究',50 分表示证据强度与论文相当(re-discovery),50 分以上表示超越论文、有 new-discovery 潜力。rubric 分两种模式:定量结果走 Mode A(和论文指标比数值),机制分析走 Mode B(比论证链完整度)。任务覆盖天文、化学、地球、能源、信息、生命、材料、数学、神经、物理 10 个学科,每学科 4 个任务。

论文同时评了 7 个 auto-research agent(Claude Code、Codex CLI、EvoScientist、OpenClaw 等)和 17 个原生 LLM——后者通过自带的轻量 ReAct 脚手架 ResearchHarness(WebSearch/ReadPDF/Bash/持久终端等工具,128k 触发上下文压缩)统一接入。repo(252 stars,MIT)持续在更新排行榜,还接受社区通过 HF Space 提交新任务(HF 镜像已多 16 个社区任务)。

主结果:左边 7 个 autonomous agents、右边 17 个 ResearchHarness LLM 的每任务 rubric 分数箱线图。红色虚线是 50 分的 re-discovery 门槛——所有系统的均值(Claude Code 21.5、Claude-Opus-4.7 20.7)都不到门槛一半,只有极少数单次 run 接近 50。
主结果:左边 7 个 autonomous agents、右边 17 个 ResearchHarness LLM 的每任务 rubric 分数箱线图。红色虚线是 50 分的 re-discovery 门槛——所有系统的均值(Claude Code 21.5、Claude-Opus-4.7 20.7)都不到门槛一半,只有极少数单次 run 接近 50。

机制与做法

任务构造:专家流水线 + 人工复现验证

流程是:专家挑'问题清晰、数据可得、有科研价值'的高质量论文 → 抽出核心问题改写成可执行任务 → 收集相关文献和原始数据 → 围绕论文关键 artifacts(图、数值、机制结论)写加权 rubric → 人类研究员用同样的工作区独立复现论文结果,验证每条 rubric 都可达成 → 交叉审核。以 Astronomy_000 为例:给两个黑洞的 mass/spin 后验采样数据,要求用贝叶斯框架约束超轻玻色子质量和自相互作用耦合,3 条 rubric 权重 0.2/0.3/0.5。

关键设计是'藏答案':target_study 目录(含原论文和 rubric)在 run_task.py 建工作区时不拷贝进 agent 的沙盒,agent 只能从任务描述、文献和数据出发。但联网搜索没有封——作者在 issue #5 里承认不阻止 agent 上网搜到原论文,理由是难以彻底屏蔽且'实验中没观察到这种 hacking 行为'。

10 个学科的任务场景总览:从黑洞超辐射、量子材料测量到纳米孔测序、多智能体寻路,每个学科 4 个任务,均配真实论文的原始实验数据。
10 个学科的任务场景总览:从黑洞超辐射、量子材料测量到纳米孔测序、多智能体寻路,每个学科 4 个任务,均配真实论文的原始实验数据。

评分:双模式 rubric + 严格 judge

judge 拿到任务说明、agent 报告(文本+图)和 rubric,对每条自动判定走 Mode A(Target Optimization,比定量指标:41-50 分=与论文相当,91-100=远超论文的突破)还是 Mode B(Diagnostic Analysis,比论证与证据:41-50=分析深度与论文相当)。rubric 每条带具体 criteria、必须核对的技术关键词和权重;image 类型条目用多模态视觉对比图表。prompt 明确要求 judge 对 AI 生成内容保持怀疑、报告长不加分。

除 rubric 总分外还评四个补充维度:Comprehensiveness、Depth、Instruction Following、Professionalism。结果很有意思:各系统 Professionalism 普遍 70+,但其余维度低得多,且四维与 rubric 分相关性弱——即模型早就会写'像模像样'的报告,卡壳的是拿出 rubric 要求的科学证据。

主结果与错误分析

全员低分:autonomous agents 里 Claude Code(Opus-4.6)最高 21.5,其后 EvoScientist 18.8、Codex CLI 18.4、Nanobot 垫底 12.8;ResearchHarness LLM 里 Claude-Opus-4.7 最高 20.7,LLM frontier mean(每任务取最好)也只有 26.5——没有任何系统接近 50 分的 re-discovery 线。Claude Code 也不是全面碾压,40 个任务只赢 12 个;各 agent 的任务难度高度一致(两两 task-level 相关中位数 0.77)。

对 7 agent x 40 任务共 280 次 run 的错误分析显示,失败集中在 Experiment Design Mismatch(协议/基线/验证设定与论文不符)、Evidence Mismatch(关键图表数值对不上)和 Scientific Core Missing,而不是执行失败或跑题——agent 能跑通、能出报告,但沿途一步步偏离目标论文的实验协议和证据链。Physics_002 案例:OpenClaw 恢复了最直接的 XEB fidelity 随深度下降趋势(单条 rubric 拿 47/50),但 qubit scaling 的 log-XEB、mirror-circuit 推断、gate-counting 误差模型全缺,总分仅 27.45。分数与花费的关系也弱:多烧钱多花时间并不稳定换来高分。

关键结果

实证核查

有水分基准本身诚实(分数低、代码全开源、排行榜持续维护、作者在 issue 里回应认真),但'专家验证每条 rubric 可达成'的声称被第三方审计打了折扣,且防污染只做了本地隔离、没封联网搜索。
论文声称数据构造经过'人类研究员独立复现验证,确保每条 rubric 都可达成'(README Data Construction 第 5 步、论文 Sec. 3.2)。
issue #10 中有用户让 Claude Code 系统审计了 40 个任务的 instruction 与 checklist 对齐情况:仅 27.5% 高度对齐,25% 存在错位,10%(4 个任务)严重错位——如 Chemistry_001 只给单一蛋白样本,checklist 却要求大规模训练收敛曲线和 76.4% 盲对接成功率;Chemistry_000 要求 7 个数据集但只提供 5 个。作者回复承认'部分任务仅靠当前任务包确实很难完全复现人类论文的全部核心证据',称会在后续版本复核 severe cases。该审计本身是 LLM 生成、未经独立人工核验,但作者没有否认具体案例。
目标论文对被测系统隐藏,评的是'重发现'能力而非检索能力。
本地隔离属实:evaluation/run_task.py L33 建工作区时不拷贝 target_study 目录。但联网搜索未封锁,agent 理论上可以搜到公开的原论文;作者在 issue #5 承认这一点,辩解是'难以彻底屏蔽 + 实验中未观察到 hacking 行为',但没有提供系统性的检测机制,防污染依赖 agent 自觉。
多模态 judge 对报告的文本和图表逐项评分。
evaluation/score.py L162 曾硬编码 judge 只看工作区前 5 张图([:5]),issue #9 报告有用户的 agent 因图多导致最后一个子任务被判 0 分;作者承认这是兼容性保护而非有意的评分规则,已加注释允许用户自行放宽。另 issue #6:GPT-5 系 judge 因 max_tokens 参数不兼容曾直接评分失败,已在上游 structai>=0.1.23 修复。用旧版代码复现论文分数的人需要注意这两点。
提供可复现的评测前沿,排行榜实时更新。
这部分扎实:repo 252 stars、MIT 协议、2026-08 仍活跃更新;README News 显示持续接入第三方 agent(InnoClaw、AutoSciRub、OpenEvo 等社区提交结果)并补了 Pass@5 稳定性统计;rcb-eval CLI 支持批量复跑。issue 里作者对每个技术问题都有具体回应并落实修复。

与我们方向的关系

对做 auto-research 的组来说,这是 2026 年评测重心从'单环节'(读文献、写代码、review)转向'完整科研闭环'的代表作,和 PaperBench 式严格复现的关键区别在 RADS:目标论文是锚点不是答案,50 分以上留了 new-discovery 空间。它的错误分类法(protocol mismatch / evidence mismatch / core missing)可以直接借来诊断自己 agent 的失败模式——结论'瓶颈在科学证据链而非报告写作'对设计 agent 的奖励信号和中间检查点很有指导意义。

两个可直接复用的组件:ResearchHarness(pip install researchharness)是个干净的 ReAct 脚手架,适合做'裸模型科研能力'的对照实验;rcb-eval CLI 配 YAML 可批量跑自家模型。但若要引用它的分数或投它的榜,先读 issue #10 的对齐审计,避开 Chemistry_001 那类数据不全的任务;自己跑评分时记得处理 score.py 的 5 图上限。

阅读笔记

作者 Wanghan Xu(SJTU/上海AI Lab 系),52 人作者名单,典型大团队工程项目。issue #10 的讨论质量很高,双方关于'anchor-based rubric 是否在测科研能力还是指令跟随'的争论值得完整读一遍;作者最后也认同 arena 式盲评(把人类锚点论文匿名混入模型报告一起排序)是有价值的补充方向。跑真实评测需要 SERPER_KEY/JINA_KEY/MINERU_TOKEN 三套第三方 API 凭证,judge 默认 GPT-5.1。

材料清单

TeX 源码
已存档:Raw/researchclawbench/source/
代码仓库github.com/InternScience/ResearchClawBench
252★ · 最近推送 2026-08-20
排行榜/官网internscience.github.io/ResearchClawBench-Home/
实时更新的 leaderboard 与 frontier 图
HF 数据集huggingface.co/datasets/InternScience/ResearchClawBench
40 官方任务镜像 + 16 个社区任务,附 download_tasks.py
ResearchHarnessgithub.com/InternScience/ResearchHarness
轻量 ReAct 脚手架,pip install researchharness
对齐审计讨论github.com/InternScience/ResearchClawBench/issues/10
第三方 instruction/checklist 错位审计与作者回应,评 verdict 的主要依据

同类条目