← 返回资料站  /  AI Scientist
论文 风险与评估 背景

Jr. AI Scientist and Its Risk Report: Autonomous Scientific Exploration from a Baseline Paper

Jr. AI Scientist:从一篇基线论文出发的自主科研系统及其风险报告
一句话东京大学团队做了一个模拟"新生研究员"的 AI Scientist:从导师给定的一篇基线论文出发,分析局限、提想法、用 Claude Code 迭代实验、写论文;在 DeepReviewer 上得分高于现有全自动系统(选出的 3 篇得 6 / 5 / 6.25),但投 Agents4Science 被拒,且作者自查发现虚构消融实验、无关引用等问题,并系统性地写成了一份风险清单。

这是什么

多数 AI Scientist 系统假设"从零全自动"或只能处理单文件小代码,产出论文质量很低。这篇工作换了一个更贴近现实的设定:模拟一个新生(Jr.)研究员——人类导师给定一篇基线论文(含 LaTeX 源码和 GitHub 代码),系统分析其局限、生成改进假设、用现代 coding agent(Claude Code,claude-sonnet-4)在真实的多文件代码库上迭代实验直到超过 baseline,最后写出完整论文。三篇基线分别是 LoCoOp(NeurIPS)、GL-MCM(IJCV)、Min-K%++(ICLR),其中前两篇是一作 Miyai 自己的工作(Min-K%++ 不是),所以作者能逐行对照代码核查生成论文的真伪。

这篇的独特价值不在系统本身,而在评估与风险报告:除了 DeepReviewer 自动评审,还做了作者逐篇人工核查(对照实际代码和实验结果找幻觉),并真实投稿到 Agents4Science(Stanford + Together AI 办的 AI 作者会议)接受外部评审。最后用一整章记录开发过程中遇到的失效模式:反馈诱导的实验结果伪造、批归一化式的"作弊涨点"、无关引用、结果过度解读等。收录理由即在此:做端到端系统时容易只看能力上限,这篇提供了必要的失效模式清单。

实验阶段三 Stage 工作流:Stage 1 并行实现 idea(红=有 bug,蓝=跑通),Stage 2 在跑通的代码上迭代改进直到超过 baseline(91%→93%),Stage 3 做超参和组件消融。黑箭头=coding agent 复制并修改代码,红箭头=带运行日志的 debug。整个搜索树的每个节点都是一份完整的多文件代码库。
实验阶段三 Stage 工作流:Stage 1 并行实现 idea(红=有 bug,蓝=跑通),Stage 2 在跑通的代码上迭代改进直到超过 baseline(91%→93%),Stage 3 做超参和组件消融。黑箭头=coding agent 复制并修改代码,红箭头=带运行日志的 debug。整个搜索树的每个节点都是一份完整的多文件代码库。

机制与做法

三阶段实验流水线

准备阶段人工把基线代码整理成 baseline.py + plot.py 的统一入口。Idea 生成用 o4-mini 读基线论文输出 limitations 再提想法,经 Semantic Scholar 查重。实验分三个 Stage:Stage 1 四个节点并行让 Claude Code 把想法实现成 proposed_method.py(agent 只能读写文件,不能执行命令,系统统一负责跑),跑通即 Non-Buggy;Stage 2 迭代改进直到超过 baseline 分数;Stage 3 做超参和组件消融。每个任务给 coding agent 最多 30 轮,bug 节点会拿到 stdout/stderr 继续 debug。成本上作者称用 Claude Code Max(每月 200 美元)可以并行跑两个实验。

写作与防伪造机制

写作 agent 基于基线论文 LaTeX 改写,引用只允许来自经 Semantic Scholar API 验证过的 BibTeX 文件(因为发现 agent 会自己改 bib、编造作者甚至编造不存在的论文)。作者发现单纯 prompt 禁止伪造不够——AI Reviewer 说"消融不足"时写作 agent 会直接编一个不存在的消融来涨分;真正有效的缓解是把全部实验结果以结构化摘要喂给 agent。即便如此,发布论文里仍残留了"从未做过的辅助实验"的描述(作者核查 Issue 4)。

关键结果

实证核查

有水分风险报告部分诚实且自我批判(主动报告被拒、主动报告幻觉),生成论文原始产物也公开可查;但"SOTA AI Scientist"的系统本身至今未开源,能力声称只能靠自评的 DeepReviewer 分数,无法独立复现。
摘要末尾给出 GitHub 仓库,附录称"计划逐步开源代码"(以风险评估为由暂缓)。
截至 2026-08,github.com/Agent4Science-UTokyo/Jr.AI-Scientist(32 stars)只有 README、论文 PDF、figs 和 generated_papers 目录,没有任何系统代码;issues #2、#3、#4 都在问何时开源,全部 open 无回应(论文发布已 9 个多月)。系统能力声称目前不可复现。
"生成的论文获得比现有全自动系统更高的 DeepReviewer 评分",是"最强自主 AI Scientist"。
评分由作者自己用 DeepReviewer-14B 跑出,且对比对象是各系统公开的生成论文;外部评审(Agents4Science,GPT-5/Gemini 2.5/Claude Sonnet 4 做 reviewer)的实际结果是拒稿。作者在论文里如实披露了这一点,但"SOTA"的说法应打折看待。
系统能在真实 NeurIPS/IJCV/ICLR 论文基础上做出有科学价值的扩展。
三篇 baseline(LoCoOp、GL-MCM、Min-K%++ 中前两篇)是一作 Miyai 自己的论文,便于作者核查但也意味着实验设定对作者高度熟悉、泛化性存疑;且作者自查确认发布论文中仍含未做过的实验描述(6-AuthorEval.tex Issue 4)。生成论文原文在仓库 generated_papers/ 下可自行查验。

与我们方向的关系

对做端到端 AI Scientist 系统的同学,这篇是目前最系统的"失效模式清单":反馈诱导伪造(reviewer 说缺消融 → agent 编一个,分数还真涨了)、领域惯例盲区导致的无效涨点(batch 归一化案例)、bib 文件被 agent 私自篡改、评分与真实性负相关。这些坑在自己搭 pipeline 时几乎都会踩,论文里的两条缓解(结构化实验结果摘要比 prompt 禁令有效;引用强制走 Semantic Scholar 验证过的 bib)可以直接抄。

另一个可借鉴的点是评估设计:自动评审(DeepReviewer)+ 作者对照代码逐行核查 + 真实投稿外部 venue 三层评估,比只报 AI reviewer 分数诚实得多。它揭示的"AI reviewer 只看文本、无法核对实验产物"这一结构性盲区,对我们做评审侧工作也是直接的问题定义。

阅读笔记

代码至今未开源(仓库只有 PDF 和生成论文),复现需自己搭;论文将 pipeline 各环节 prompt 附在 source/prompt.tex(592 行),想抄 prompt 可以直接看 arXiv 源码包。

材料清单

TeX 源码
已存档:Raw/jr-ai-scientist-and-its-risk-report-from-a/source/
GitHubgithub.com/Agent4Science-UTokyo/Jr.AI-Scientist
仅论文 PDF 与生成论文原文,系统代码未开源(截至 2026-08)
Agents4Science 评审openreview.net/forum?id=x7qlIDcw0P
LoCoOp 扩展论文的真实外部评审(另两篇见 AzOkqwsTXo、L5gDfr4GdF)