Autonomous Research Agents: A Survey of AI Scientists and the Verification Gap
自主研究 agent 综述:AI Scientist 与「可核查性缺口」
Tianyu Ding, Aditya Nannapaneni, Bingfan Liu, Ling Zhang · 2026-06 · 被引 0
一句话一篇审计型综述:144 条检索记录去重到 125,两轮筛选纳入 35 篇,对 26 条(24 个可运行系统 + 2 篇研究/立场文)按七个维度逐系统全文编码成表,量化出「83% 放代码,但只有 38% 放 seed 或执行 trace、只有 38% 报告任何新颖性核查手段;9 个够得上 L4 闭环的系统里 7 个只是指标触发的机械重跑,1 个纯作者自称,唯一一个有外部 oracle 的是 2020 年的前 LLM 时代材料学平台 CAMEO」。六个头条比率我都从它公开的附录表逐行重算过,完全对得上。
这是什么
这两年 AI Scientist 类系统的产出速度已经超过了评审端的核查能力:系统能吐出一份看起来像论文的东西,但审稿人没有办法判断里面的 claim 是不是真的。作者把这件事命名为 verification gap(可核查性缺口),并且刻意把范围收在计算类 AI/ML 研究——理由是这个领域的证据链(代码、benchmark、运行记录、稿件)原则上是可检视的,审稿人真的能去重跑一遍,所以「查不了」这件事在这里最没有借口。
它和站内已有的几篇 AI Scientist 综述(a-survey-of-ai-scientists、ai4research-survey、agentic-science-survey、llm4sr)最大的区别在方法:那几篇是叙述式盘点,按 taxonomy 分章介绍系统做了什么;这篇是编码式审计,先定七个维度(lifecycle stage / autonomy level / evaluation method / released artifacts / HITL points / novelty verification / result-selection disclosure),再对每个系统逐格填表,填不出来的写 n/d,最后把表格统计成比率。检索协议、去重数、排除原因、各个分母切片(24 可运行 / 22 LLM 时代 / 19 纯 AI-ML / 5 领域对照)都写在正文里。
四项交付物:一份全文编码的语料表(附录 26 行 × 8 列)、一张 lifecycle × autonomy 映射、一套 auditability gap 分析(失败模式 → 掩盖它的评测代理 → 最低证据要求)、一张面向审稿人的 reporting checklist。它自己把 checklist 拆成「我们真编码过的 5 项(附本语料达标率)」和「我们建议但没编码的 3 项(无比率)」两半,这个自我约束在综述里不常见。
2023–2026 自主研究 agent 的演化树,也是这篇综述的结构总览。底部主干从 tool-using scientific agents(2023)长到 research workflow agents 再到 AI scientist systems,然后分出五条支线,对应正文的五个板块:1 ideation & hypothesis(绿)、2 literature search & scientific writing(蓝)、3 coding, execution & analysis(橙)、4 review & closed-loop experimentation(紫)、5 verification, audit & reproducibility(红)。要看的重点是最右边那条红色支线:它被画成虚线且刻意延后,六个节点(seeds & traces、selection policy、novelty verification、reproducible artifacts、benchmark audits、external validation)里五个带警告三角,旁边直接标注 'Audit signals remain sparse'——即前四条支线的能力早已长起来,而支撑核查的信号到 2026 年仍然稀疏。这张图就是论文标题里 verification gap 的图示版。机制与做法
L0–L5 自主度阶梯,以及 L4 拆成 m/v 两档
不用形容词标注系统,而是先在五条轴上打分:initiative(谁选问题和下一步动作)、judgment(谁判定新颖性、有效性和证据是否够)、execution(是否无需逐步批准就能跑工具和实验)、iteration(是否根据结果修订假设)、accountability(trace/seed/prompt/人工干预是否披露)。由此归纳出 L0 辅助、L1 工具增强、L2 单阶段自治、L3 多阶段流水线、L4 闭环、L5 开放式(视为愿景,不填入表)。
关键设计是把 L4 再切一刀:L4-m(mechanical)指结果只是喂回一个内部指标或常数拟合来触发重跑;L4-v(validated)要求由外部 oracle(物理测量或独立 checker)来决定结果是否修订下一个科学假设。这一刀切下去,9 个 L4 系统里只剩 CAMEO 一个是 L4-v。作者明确说了两个「差一点」的判例:MASTER 优化的是计算任务成功率、人类专家是在跑完之后才看,物理世界从未 gate 下一个假设,所以判 mechanical;ChatBattery 确实有湿实验室合成,但那是对最终候选的终端确认,不是驱动每一轮迭代的 in-loop oracle,整体只给 L3。判据写得比结论重要——这是可以拿来复用的规则。
把 initiative/execution 和 judgment 分开是这套阶梯的核心论点:一个系统可以自动化研究「任务」(L2–L3)而完全不自动化科学「判断」,而后者才是核查要盯的东西。
七维编码 + 分母切片,把「披露了什么」做成可复算的比率
24 个可运行系统上的六个头条比率:releases code 83%(20/24)、releases prompts 71%(17/24)、releases seeds or traces 38%(9/24)、discloses result-selection policy 67%(16/24)、有 ≥1 个 HITL 入口 88%(21/24)、报告任何 novelty verification 手段 38%(9/24)。三个完全无 HITL 入口的是 ReviewAdvisor、LLM-AutoSciLab、Proactive Reviewer——一旦调用就一路跑到底。
为了防止有人说结论是靠 5 个领域对照行(CAMEO、ChemCrow、ChatBattery、MASTER、ARIA)撑起来的,它给了一张敏感性表:去掉这 5 行只看 19 个纯 AI/ML 系统,seeds/traces 是 8/19(42%)、novelty 是 7/19(37%),方向没变;只看 22 个 LLM 时代系统是 9/22(41%)和 9/22(41%)。也就是说「代码普遍开源、但可复现级和可核查级材料不普遍」这个落差不是切片切出来的假象。
编码可靠性这一段值得单独读:主编码是单人从全文(方法、实验、附录、以及有的话连代码仓库)读出来的;为了估标注可靠性,第二位编码者对随机 10 个系统在四个最主观维度上盲编码,结果 released artifacts 一致率 90%,但 autonomy level 只有 50%、novelty method 60%、selection disclosure 60%,总体 65%。而且第二轮只看摘要。作者据此明确要求:autonomy level 只当粗结构用,不做逐格 claim;把 mechanical-vs-validated 的拆分当结论,而不是靠某个精确的 L4 计数。
失败模式 → 掩盖它的代理 → 最低证据:把抱怨变成规范
gap 表把七种复发失败模式各写成一行:幻觉引用(被文献流畅的行文掩盖 → 要求 bib 可解析)、新颖性夸大(被 idea 打分掩盖 → 要求写清新颖性核查方法)、弱 baseline(被头条指标掩盖 → 要求 baseline 出处)、不可复现的运行(被单个分数掩盖 → 要求 seed 和 trace)、结果挑选(被 best-of-n 掩盖 → 要求报告尝试次数和挑选规则)、隐藏人力(被「autonomous」一词掩盖 → 要求逐阶段 HITL)、双用途风险(被任务导向掩盖 → 要求安全审查)。前四行标 documented(语料里有报告证据),后三行标 risk(合理但证据不足,只是提出来要求系统性测量),这个区分做得很干净。
checklist 的落地说明比表本身有用:一个 repo 链接不算数,除非包含重跑该结论所需的环境、脚本和数据;trace 指的是 seed 加上 prompt、tool-call、model、output 的完整记录,而不是截图或者精选 transcript;novelty check 必须说明搜索空间并附抽样的独立验证,LLM 自查是弱信号;reviewer independence 指产出 claim 的系统或模型不能同时是唯一接受它的机制。这几条基本就是站内 the-ai-scientist 和 cycleresearcher 那一类自指闭环评测踩过的坑的反面。
它还给出一个 U 型定性判断:ideation/hypothesis 端只能拿新颖性判断当检查,是阶梯上最弱、也最不挂钩最终有效性的信号;coding/execution 段因为 ground truth 可以是可执行 artifact 或 held-out 数字,信号最强;到 review 和闭环迭代又弱回去,变成 LLM 评 LLM。也就是自治活动最密集的阶段,和检查最靠得住的阶段,并不重合。
关键结果
- 检索 144 条记录 → 去重后 125 → 两轮筛选纳入 35 篇 → 全文编码 26 条(24 个可运行系统 + 2 篇研究/立场文)。被排除的 90 条主要是关键词碰撞(autonomous driving)、泛 ML/RL、物理天文、非 agent 的单次调用工具,以及只作为 baseline 保留的前 LLM 方法。
- 24 个可运行系统:83% 放代码、71% 放 prompt、88% 披露至少一个人工入口,但只有 38%(9/24)放 seed 或执行 trace、只有 38%(9/24)报告任何新颖性核查手段。结论一句话:发布代码的领域不等于结果能被重新推导出来的领域。
- 9 个 L4 闭环系统 = 7 个 artifact-backed 但机械(AI Scientist、AI Scientist-v2、SR-Scientist、MASTER、LLM-AutoSciLab、E2E AI Research、LLM-ACES,触发信号是内部指标/benchmark 分/任务成功率/自动评审)+ 1 个纯作者自称无外部核查(Claw AI Lab)+ 1 个有外部 oracle(CAMEO,2020 年,靠物理测量选下一个实验)。按它的编码规则,语料里没有任何一个 LLM 时代系统做到 in-loop 的外部验证。
- 报告新颖性核查的那 9 个系统,编码值全都是同一种:automated-lit(自动文献检索式自查)。没有一个系统报告过对自己新颖性检查器本身的独立验证。
- 自我可靠性检查很不客气:第二位编码者盲编码 10 个系统,artifacts 一致率 90%,autonomy level 只有 50%,novelty method 和 selection disclosure 各 60%,总体 65%;而且第二轮是只看摘要做的,只能界定标注主观性,不能验证一手全文阅读。作者据此把 novelty 和 selection 两个比率降级为「方向性」结论。
- checklist 中已编码的 5 项达标率分别是 HITL 88%、code 83%、seeds/traces 38%、novelty method 38%、attempts & selection 67%;另外 3 项(baseline provenance、reviewer independence、hypothesis preregistration)是建议项,明确标注「未编码、无语料比率」。
- 生命周期覆盖分布不均:execution/analysis/experiment-design 最挤(L3 各 7–8 个系统、L4 各 7–8 个),literature review 和 closed-loop iteration 最薄(L3 闭环迭代只有 2 个)。
- 六项安全/诚信问题被统一改写成「可核查性失败」:双用途风险(WMDP、SciSafeEval、ABC-Bench)、研究诚信(SoundnessBench、SciIntegrity-Bench)、评审通道攻击(隐藏 prompt 劫持 AI 评审、LLM 写的评审可被检测)。逻辑是:危害恰好发生在 claim 无法被独立审计的地方,所以 reporting checklist 同时也是它的安全工具。
实证核查
扎实六个头条比率我逐行从它自己的附录语料表重算,全部精确对上(83/71/38/67/88/38),9 个 L4 系统的名单也对得上,这在综述里算少见的可复算。扣分主要在三处:一是没有任何配套 repo,编码语料只以 LaTeX 表格形式存在,对一篇要求别人放 artifact 的可核查性综述是反讽;二是单人编码 + 只看摘要的第二轮,自认 65% 一致率;三是覆盖上漏掉了几个恰好属于「外部检查」证据的关键案例(Agents4Science、Zochi、Kosmos)。核心论断本身没有被这些问题推翻。
24 个可运行系统中 83% 放代码、38% 放 seed/trace、38% 报告新颖性核查、67% 披露结果挑选策略、88% 有人工入口;9 个 L4 里 7 机械 + 1 自称 + 1 外部验证。
可复算且完全对上。我用脚本解析 source/appendix_corpus.tex 的 26 行表格,按 Aut. 列排除 'study'(Ultimate Brain)和 'position'(AI+Robot Scientists)两行得到 24 个可运行系统,再按 Artifacts/Novelty/Sel./HITL 四列统计:code 20/24=83%、prompts 17/24=71%、seed 或 trace 9/24=38%、Novelty 非 n/d 非 none 9/24=38%、Sel.=yes 16/24=67%、HITL 非 none 21/24=88%,与正文 Table tab:stats 六行逐个一致;L4 行恰好 9 个(CAMEO、AI Scientist、AI Scientist-v2、SR-Scientist、MASTER、LLM-AutoSciLab、E2E AI Research、LLM-ACES,加 L4(c) 的 Claw AI Lab),与 tab:l4main 的 1+7+1 分解一致。它把原始编码表整张放进附录、比率能被读者从表里重算出来,这一点做到了自己 checklist 的要求。
「我们贡献一份编码语料(coded corpus)、一张 lifecycle × autonomy 映射、一份可核查性缺口分析和一张面向审稿人的报告 checklist」;同时 checklist 要求别人「code released / 提供可重跑的 artifact」。
没有任何配套仓库。在 source/ 全部 12 个 .tex 里 grep 'github.com'、'anonymous.4open'、'companion repo'、'we release'、'available at' 全部零命中;catalog 里 code_url、project_url 也都是空的;arXiv abs 页无 code 链接。所谓「coded corpus」只以一张 landscape longtable(appendix_corpus.tex,26 行 × 8 列)的形式存在于 PDF 里,没有 CSV/JSON,没有每格编码的出处指针(哪一页、哪个 commit 支撑了 'seeds, traces' 这个判断)。想复用或增量更新这份语料,只能像我这样去解析 LaTeX。对一篇主张「审稿人要能重跑」的审计型综述,这是最该被指出来的一处双标。另外 arXiv 只有 v1(2026-06-29 提交,submission history 只列 [v1]),两个月没更新版本;而它自己在 Threats to Validity 里承认这是一份「快照到 2026 年中」、绝对比率会很快过期的语料——没有更新机制,过期速度就是问题。
编码是「从每篇论文的全文(方法、实验、附录以及有代码的话连代码)」提取的,并给出了独立第二编码者的可靠性检查。
作者自己就把这条打了折,值得照抄进笔记:主编码是单人;第二编码者只对随机 10 个系统的四个维度盲编码,而且这一轮是只读摘要做的,一致率 released artifacts 90%、autonomy level 50%、novelty method 60%、selection disclosure 60%、总体 65%。作者明说这只界定了「这些维度能被多可重复地标注」,并没有独立验证头条比率所依赖的那次一手全文阅读。敏感性表的 caption 里还有一句关键自认:'Artifact availability was coded from public materials; we did not independently test whether released repositories rerun.' 所以「83% 放代码」严格讲是「83% 声称/挂出了代码」,不是「83% 的代码能跑」。对照站内 researchagent 条目的核查:它的官方仓库是论文挂出 9 个月后(2025-01-14)才创建的,且 open issue #5 报告按论文同款 GPT-4-1106-preview 跑官方代码时第 3 轮迭代就爆 context limit 输出乱码、作者未回应——在本综述里它照样被编码成 'code, prompts, seeds' 全绿。
七维编码值经过「归一化到受控词表」,可以逐系统对照。
抽查发现两处编码值得商榷,方向都和它自认的低一致率吻合。(1)Novelty 列在整张附录表里只出现过三种取值:automated-lit / n/d / none——而正文 codebook 明写这一维应包含 'against a literature graph, human' 等方法。ResearchAgent 恰好是靠引文图 + 实体知识库来做文献接地的(站内 researchagent 条目核查过 data/knowledge.jsonl 2.7MB 实体共现库确实存在),按 codebook 至少该算 literature-graph,这里被编码成 'none'。也就是说「38% 报告新颖性核查」和「无人独立验证过自己的新颖性检查器」这两句,一部分是受控词表本身塌缩成单一类别的结果。(2)同一个系统在正文表和附录表里的 Eval 值不一致:main_single.tex 第 429 行 AI Scientist 的 Eval 是 'auto LLM rev.',附录同一行写的是 'LLM-review, human'。而按站内 the-ai-scientist 条目的核查,v1 的 300+ 篇生成论文没有任何一篇经过真实人类评审(workshop 人评是 2025 年 v2 的事),附录那个 'human' 更像是把作者自己的定性检视记成了人评,属于给分偏松。
「系统梳理」该领域,并断言「语料中没有任何 LLM 时代系统在我们的编码规则下展示出经外部验证的 in-loop oracle」。
核心断言站得住(下面这几个案例都是事后/终端检查,不是驱动每轮迭代的 in-loop oracle),但作为「地图」它漏了三个正好落在「外部检查」这条主线上的关键案例,而这三个站内都有条目:Agents4Science 2025(agents4science-2025)——一整个把 AI 署名论文送去真人外部评审的会议,是这个领域少见的真外部检查数据点,在 references.bib 和 12 个 .tex 里 grep 'Agents4Science'/'Open Conference' 零命中;Zochi(zochi-technical-report,声称是首个通过 A* 会议同行评审的 AI 系统)grep 'Zochi'/'Intology' 零命中;Kosmos(kosmos,声称 7 项发现并做了外部专家逐条审计)在 references.bib 第 626 行有 @article{mitchener2025kosmos} 条目,但 grep 'mitchener2025kosmos' 在全部 .tex 里零引用——是个悬空的 bib 条目,收进了参考文献却从未在正文讨论。此外 NovelSeek/InternAgent-1.5、AIDE、Virtual Lab 也不在文中(AIDE 只有 bib 里 4 处 'aide' 且都是 aider 这个工具)。前两个漏项尤其可惜:它们本该作为「near-miss」写进 L4-v 的判例讨论里(像 MASTER 和 ChatBattery 那样被显式判定为不合格),而不是缺席。
分类学(lifecycle × autonomy、L4-m/L4-v、七维审计)可作为该领域的通用框架。
目前无法核查采纳情况:Semantic Scholar 记录引用数 0(meta.json 的 s2.citations),论文 2026-06-29 才挂出、只有 v1,距今两个月,没有任何后续工作引用其分类学的语境可查。所以「分类学是否被采纳」这一项对本条目只能存疑,现阶段应当把它当成一套自用的核查规则,而不是已被领域接受的标准。
与我们方向的关系
把它当【体检表】而不是【读物】用,分两步。第一步,直接拿它的 reporting checklist 去卡我们自己的 autoresearch 系统:HITL 入口有没有逐阶段列出来、seed 和完整 trace(seed + prompt + tool-call + model + output,不是精选 transcript)有没有随代码一起放、跑了多少次 n 和按什么规则挑出报告的那一次有没有写清、新颖性检查说明了搜索空间没有、以及最要命的 reviewer independence——产出 claim 的模型不能是唯一接受它的机制。这五项里我们最容易漏的就是 seed/trace 和挑选策略(它统计的语料里也正是这两项最薄:38% 和 67%)。第二步,拿它的 L4-m / L4-v 判据去审我们自己的闭环:如果驱动下一轮的信号是内部指标、benchmark 分或者自家的 LLM 评审,那就是 mechanical,不管流水线看起来多完整;要够 L4-v,必须有一个模型写不出来的外部信号 gate 住「下一个假设是什么」。它对 MASTER(人评在跑完之后)和 ChatBattery(湿实验只确认最终候选)的判定过程,是很好的自我审查模板。
配合站内条目读的顺序建议这样:先用它当地图和判据(本条目),然后立刻下到具体系统的实证核查——the-ai-scientist 和 the-ai-scientist-v2(它判为 L4-mechanical 的两个旗舰,站内条目里有 Beel et al. 42% 实验因代码错误失败、自动评审员 FPR 0.31 这些它没写进去的细节)、jr-ai-scientist-and-its-risk-report-from-a(它的 gap 表里 documented 那几行的证据来源之一)、cycleresearcher 和 can-ai-be-a-good-peer-reviewer(自指闭环评测的具体形态)、the-ideation-execution-gap(「novelty-as-judged 不等于 novelty-as-valid」这个论点的实证版:LLM 想法评分高但真做出来打折)。它没覆盖到、但恰好是「外部检查」证据的三条要单独补读:agents4science-2025(真人外部评审 AI 署名论文的会议)、zochi-technical-report(声称过 A* 评审)、kosmos(声称做了外部专家逐条审计)。反过来,如果只想要领域的叙述式全景,这篇不够用,该看 ai4research-survey 或 agentic-science-survey;这篇的价值全在那张能被重算的表和那套判据上。
阅读笔记
三点坑。(1)catalog 的收录理由写的是「144 篇初检筛到 26 篇」,和论文口径不完全一致:144 是去重前的检索记录数,去重后 125,全文筛选纳入 35 篇,其中 26 条做了全文编码,而所有披露比率的分母是 26 里的 24 个可运行系统。引用数字时要说清是哪一层。(2)meta.json 里 arxiv.updated 是 2026-08-31(抓取当天),容易误读成论文有更新;arXiv abs 页的 submission history 只列 [v1](2026-06-29),实际没有第二版。(3)想复用这份编码语料的话,直接解析 source/appendix_corpus.tex:26 行 8 列,按 '&' 切分、Aut. 列取值为 study/position 的两行就是那两篇非可运行的研究/立场文,排掉即得 24 的分母。
材料清单
TeX 源码已存档:Raw/autonomous-research-agents-verification-gap/source/
对照:被它判为 mechanical 的旗舰github.com/SakanaAI/AI-ScientistAI Scientist / v2 在本综述里编码为 L4 但 mechanical(触发信号是自家自动评审员和内部指标);站内 the-ai-scientist 条目有第三方复现(Beel et al., arXiv:2502.14297)的具体数字
相关条目
同子模块 · 自主研发能力评测
跨方向 · 同标签