ResearchClawBench(RCBench)把'AI 能不能自己做科研'变成一个可打分的问题。每个任务从一篇已发表的真实论文出发:专家把论文的核心科学问题改写成任务描述 q,配上约 4 篇相关文献和原始数据(.dat/.csv/.h5/.pdb 等),而目标论文本身对被测系统隐藏。agent 要在沙盒工作区里自己探索数据、写代码、出图,最后产出 report/report.md,再由 GPT-5.1 多模态 judge 对照专家从目标论文提取的加权 rubric 逐项打分。
评分体系叫 RADS(Reference-Anchored Discovery Score):目标论文不是标准答案而是'人类参考研究',50 分表示证据强度与论文相当(re-discovery),50 分以上表示超越论文、有 new-discovery 潜力。rubric 分两种模式:定量结果走 Mode A(和论文指标比数值),机制分析走 Mode B(比论证链完整度)。任务覆盖天文、化学、地球、能源、信息、生命、材料、数学、神经、物理 10 个学科,每学科 4 个任务。
论文同时评了 7 个 auto-research agent(Claude Code、Codex CLI、EvoScientist、OpenClaw 等)和 17 个原生 LLM——后者通过自带的轻量 ReAct 脚手架 ResearchHarness(WebSearch/ReadPDF/Bash/持久终端等工具,128k 触发上下文压缩)统一接入。repo(252 stars,MIT)持续在更新排行榜,还接受社区通过 HF Space 提交新任务(HF 镜像已多 16 个社区任务)。

任务构造:专家流水线 + 人工复现验证
流程是:专家挑'问题清晰、数据可得、有科研价值'的高质量论文 → 抽出核心问题改写成可执行任务 → 收集相关文献和原始数据 → 围绕论文关键 artifacts(图、数值、机制结论)写加权 rubric → 人类研究员用同样的工作区独立复现论文结果,验证每条 rubric 都可达成 → 交叉审核。以 Astronomy_000 为例:给两个黑洞的 mass/spin 后验采样数据,要求用贝叶斯框架约束超轻玻色子质量和自相互作用耦合,3 条 rubric 权重 0.2/0.3/0.5。
关键设计是'藏答案':target_study 目录(含原论文和 rubric)在 run_task.py 建工作区时不拷贝进 agent 的沙盒,agent 只能从任务描述、文献和数据出发。但联网搜索没有封——作者在 issue #5 里承认不阻止 agent 上网搜到原论文,理由是难以彻底屏蔽且'实验中没观察到这种 hacking 行为'。

评分:双模式 rubric + 严格 judge
judge 拿到任务说明、agent 报告(文本+图)和 rubric,对每条自动判定走 Mode A(Target Optimization,比定量指标:41-50 分=与论文相当,91-100=远超论文的突破)还是 Mode B(Diagnostic Analysis,比论证与证据:41-50=分析深度与论文相当)。rubric 每条带具体 criteria、必须核对的技术关键词和权重;image 类型条目用多模态视觉对比图表。prompt 明确要求 judge 对 AI 生成内容保持怀疑、报告长不加分。
除 rubric 总分外还评四个补充维度:Comprehensiveness、Depth、Instruction Following、Professionalism。结果很有意思:各系统 Professionalism 普遍 70+,但其余维度低得多,且四维与 rubric 分相关性弱——即模型早就会写'像模像样'的报告,卡壳的是拿出 rubric 要求的科学证据。
主结果与错误分析
全员低分:autonomous agents 里 Claude Code(Opus-4.6)最高 21.5,其后 EvoScientist 18.8、Codex CLI 18.4、Nanobot 垫底 12.8;ResearchHarness LLM 里 Claude-Opus-4.7 最高 20.7,LLM frontier mean(每任务取最好)也只有 26.5——没有任何系统接近 50 分的 re-discovery 线。Claude Code 也不是全面碾压,40 个任务只赢 12 个;各 agent 的任务难度高度一致(两两 task-level 相关中位数 0.77)。
对 7 agent x 40 任务共 280 次 run 的错误分析显示,失败集中在 Experiment Design Mismatch(协议/基线/验证设定与论文不符)、Evidence Mismatch(关键图表数值对不上)和 Scientific Core Missing,而不是执行失败或跑题——agent 能跑通、能出报告,但沿途一步步偏离目标论文的实验协议和证据链。Physics_002 案例:OpenClaw 恢复了最直接的 XEB fidelity 随深度下降趋势(单条 rubric 拿 47/50),但 qubit scaling 的 log-XEB、mirror-circuit 推断、gate-counting 误差模型全缺,总分仅 27.45。分数与花费的关系也弱:多烧钱多花时间并不稳定换来高分。
对做 auto-research 的组来说,这是 2026 年评测重心从'单环节'(读文献、写代码、review)转向'完整科研闭环'的代表作,和 PaperBench 式严格复现的关键区别在 RADS:目标论文是锚点不是答案,50 分以上留了 new-discovery 空间。它的错误分类法(protocol mismatch / evidence mismatch / core missing)可以直接借来诊断自己 agent 的失败模式——结论'瓶颈在科学证据链而非报告写作'对设计 agent 的奖励信号和中间检查点很有指导意义。
两个可直接复用的组件:ResearchHarness(pip install researchharness)是个干净的 ReAct 脚手架,适合做'裸模型科研能力'的对照实验;rcb-eval CLI 配 YAML 可批量跑自家模型。但若要引用它的分数或投它的榜,先读 issue #10 的对齐审计,避开 Chemistry_001 那类数据不全的任务;自己跑评分时记得处理 score.py 的 5 图上限。