项目
社区/会议
Agents4Science 2025: Open Conference of AI Agents for Science
Agents4Science 2025:首个 AI 当第一作者、AI 参与评审的公开会议
James Zou, Federico Bianchi, Owen Queen, Nitya Thakkar, Eric Sun (organizers) · Stanford University · Conference · 2025-10
一句话 Stanford 组织的首个要求 AI 担任论文第一作者、并用三个 LLM(GPT-5 / Gemini 2.5 Pro / Claude Sonnet 4)做初审的学术会议:收到 315 篇投稿,253 篇进入评审,最终接收 48 篇;全部投稿、评审、AI 参与度自报和引用审计数据公开,是研究 AI 生成科研质量分布与 LLM 评审可靠性的现成数据集。
这是什么 Agents4Science 是 James Zou(Stanford)团队组织的一次"沙盒实验":主流期刊和会议禁止 AI 署名作者、禁止 LLM 评审,导致大家其实在偷偷用 AI 却无法公开研究"AI 科学家到底行不行"。这个会议反其道而行——要求每篇投稿必须以 AI 模型为第一作者,人类只能做共同作者,并强制填写两份 checklist:一份改编自 NeurIPS 的方法/伦理规范,一份是 Agents4Science 特有的 AI 参与度披露(按假设提出、实验设计、数据分析、论文写作四个阶段,各自报 A/B/C/D 四档,D 表示 AI 贡献超过 95%)。
会议于 2025 年 10 月 22 日以免费 Zoom Webinar 形式举行,注册人数超过 1800。共收到 315 篇投稿,62 篇因不完整被 desk-reject,253 篇完整投稿由三个 LLM reviewer 评审,79 篇高分论文再交人类专家审阅,最终由程序委员会综合双方意见接收 48 篇(约为完整投稿的 19%)。所有投稿(含被拒稿)、AI 与人类的评审意见、autonomy 分级、引用核查结果都在 OpenReview 和官网公开。
组织者随后把主要发现写成了报告《Exploring the use of AI authors and reviewers at Agents4Science》(arXiv:2511.15534),发表在 Nature Biotechnology;Nature 和 Science 的新闻版都做了报道。对课题组来说,这个条目的价值不在某一篇论文,而在于它是目前唯一一个公开、成规模的"AI 写论文 + LLM 审论文"的自然实验记录。
组织者报告(arXiv:2511.15534)图 1:会议全景统计。a/b) 投稿领域分布(浅色为总投稿、深色为接收),AI/ML 占六成半,其余以数学、物理为主;c) 四个研究阶段的 AI 自主度分级(A=人类 ≥95% 到 D=AI ≥95%),对比全部投稿(左)与接收论文(右)可见接收论文的 Category D 比例整体更低、且前期阶段人类介入更多;d) 引用核查结果,每个点是一篇投稿,横轴总引用数、纵轴通过核查的引用数,偏离对角线越远幻觉引用越多——大量论文落在对角线下方。 机制与做法 投稿规则与 AI 参与度披露
每篇投稿必须由 AI 担任第一作者并对选题、执行、写作有实质贡献;73% 的接收论文只署一个模型,27% 署了多个模型。模型分布上 GPT 系列出现在 62.5% 的接收论文中,Gemini 和 Claude 各占 33.3%,也有用 Grok、Mistral、Qwen 的;专门的"AI Scientist"类研究 agent 只出现在 16.7% 的接收论文里——绝大多数人还是直接用通用商业 LLM 做科研。
AI 参与度自报的结果很有意思:全流程 Category D(四个阶段 AI 贡献都 ≥95%)是投稿中最常见的模式,占 23.3%,但在接收论文里降到 14.9%——纯 AI 自动跑出来的论文质量整体偏低,高质量工作往往有更多人类介入。模式上,人类在前期(假设提出、实验设计)介入更多,后期(数据分析、写作)AI 自主度更高。
三个 LLM 评审 + 人类专家的两级流程
评审用 GPT-5、Gemini 2.5 Pro、Claude Sonnet 4 三个 LLM reviewer,按 NeurIPS 2025 评审指南打 1-6 分,prompt 用 ICLR 2022/2025 的真实论文和人类分数做过校准。均分 ≥4.0 的 79 篇进入第二轮,由人类专家(拿同样的评审指南、看不到 LLM 评审)独立打分,最后组织者综合两边意见定接收、spotlight 和 best paper——所以严格说这不是"纯 AI 评审",AI 只负责初筛。
三个 LLM reviewer 的表现差异很大:两两 Pearson 相关只有 0.48;GPT-5 最严(平均 2.30 分),Gemini 2.5 Pro 最松(平均 4.23 分),Claude Sonnet 4 居中(3.0)。和人类专家比,GPT-5 与人类分数的平均绝对差 0.91、Claude 1.09,而 Gemini 高达 2.73,且报告点名 Gemini 的 sycophancy 最严重(有一篇被它吹成 "groundbreaking, technically flawless" 的论文,人类评审认为实验疑似 cherry-pick)。另一方面,LLM 评审确实能抓到具体的技术问题,比如正文 R²=0.0148 和表格 R²=0.005 的数值矛盾、摘要与正文结论冲突等。
引用核查与反作弊管线
组织者部署了自动引用核查 agent:抽取每条参考文献做 web 搜索匹配,匹配不上的标记为疑似幻觉,并在 OpenReview 上公开挂出核查意见。结果只有约 44%(111/253)的投稿没有任何被标记的引用,也就是说超过一半的 AI 生成论文含疑似幻觉引用——这与投稿作者自己在 limitations 里的抱怨("很大比例的引用是幻觉或只是松散相关")互相印证。
另外还有一条 prompt injection 检测管线,扫描全文找试图操纵 LLM 评审的对抗指令,实际抓到 2 篇作弊投稿,均未被接收。这两条管线(引用核查 + injection 检测)本身就是可以直接借鉴的工程组件。
关键结果 315 篇投稿 → 62 篇 desk-reject → 253 篇进入 LLM 评审 → 79 篇进入人类专家评审 → 48 篇接收(约 19%);1800+ 人注册参会。 全流程 ≥95% AI 完成(Category D)的论文占投稿的 23.3%,但只占接收论文的 14.9%:更多人类介入与更高质量正相关。 三个 LLM reviewer 两两 Pearson 相关仅 0.48;与人类分数的平均绝对差:GPT-5 0.91、Claude Sonnet 4 1.09、Gemini 2.5 Pro 2.73(且平均给 4.23 分、sycophancy 最重)。 仅约 44% 的投稿(111/253)通过引用核查、无疑似幻觉引用;幻觉引用是 AI 生成论文最普遍的质量问题。 接收论文中 62.5% 用 GPT 系模型,Gemini/Claude 各 33.3%;只有 16.7% 用了专门的科研 agent,通用 LLM 仍是主流工具。 反作弊管线检测到 2 篇投稿在正文中藏 prompt injection 操纵 LLM 评审,均被拒。 投稿领域上 AI/ML 占 64.3%,其余以数学(15 篇)、物理(10 篇)为主;作者来自 28 个国家,美国 40.5%、中国 17.5%。 实证核查
扎实 作为一个"公开实验"它非常诚实:全部投稿、评审、autonomy 自报、引用审计数据都公开可查,组织者报告的数字与公开数据一致,连 LLM 评审的失败案例(sycophancy、评分不一致)都自己写进了报告。需要打折的是媒体化的表述——"AI 评审的会议"实际是 AI 初筛 + 人类专家 + 组织者终审。
官方口号:"the 1st open conference where AI serves as both primary authors and reviewers",即 AI 同时担任作者和评审。
实际评审流程是两级:三个 LLM(GPT-5/Gemini 2.5 Pro/Claude Sonnet 4)只做初筛,均分 ≥4.0 的 79 篇再由人类专家独立评审,最终接收/spotlight/best paper 由组织者综合双方意见决定(arXiv:2511.15534 'LLM reviewers' 一节)。AI 评审并没有独立决定任何一篇论文的命运,准确说法是"AI 初筛 + 人类终审"。
会议展示了 LLM 作为评审的可行性,LLM reviewer 能给出有用反馈。
组织者自己的数据并不乐观:三个 LLM 打分两两 Pearson 相关仅 0.48,Gemini 2.5 Pro 与人类分数平均绝对差 2.73 且报告点名其 sycophancy(把疑似 cherry-pick 的论文吹成 groundbreaking)。Science 2025-12-10 的报道也总结为 'mixed results:擅长抓数值不一致和引用错误,但对 novelty/impact 的判断常常过于乐观'。可用性成立的部分主要是抓具体技术错误(如 R² 数值矛盾),而非价值判断。
会议声称提供完全透明的数据:全部投稿、评审、AI 参与度、审计结果公开。
属实且可核查:官网 submissions.html 提供全部 315 篇(含被拒稿)的评审分数、autonomy 等级(A-D 四档 x 四阶段)、topic 分类和 codebase audit 报告,OpenReview 群组(openreview.net/group?id=Agents4Science/2025/Conference)可看到逐篇 AI/人类评审原文和引用核查 bot 留言。这是目前唯一能做 'AI 论文 x AI 评审' meta 分析的公开数据源。
会议隐含的宣传点:AI 已能独立产出可接收的研究。
公开数据显示成色有限:全流程 ≥95% AI 的投稿接收占比(14.9%)明显低于其投稿占比(23.3%);过半投稿含被自动核查标记的幻觉引用(仅 111/253 全部通过);投稿作者自报的 limitations 集中在幻觉引用、overclaiming、代码错误和'只会在给定模板内出主意'。接收的 48 篇多为 simulation/框架类小工作(如 LLM 模拟就业市场、多 agent 模拟太空任务心理动态),没有出现被期刊级同行评审背书的成果。
与我们方向的关系 对做 AI-scientist 方向的课题组,这是三重资源:(1) 现成数据集——253 篇 AI 生成论文 + 每篇 3 份 LLM 评审 + 79 份人类评审 + autonomy 自报 + 引用审计,全在 OpenReview 上,可以直接做 LLM 评审可靠性、AI 论文质量分布、human-AI 分工模式的 meta 分析,而且这类分析本身就是一篇论文的体量;(2) 投稿渠道——如果组里在做自动科研 pipeline,Agents4Science 2026(如果续办)是少数能光明正大让 AI 署名投稿、拿到真实评审反馈的地方;(3) 工程参考——引用核查 agent 和 prompt injection 检测管线是任何 'LLM 评审/LLM 生成论文' 系统都该抄的两个组件。
两个值得记住的经验数字:LLM reviewer 间一致性(Pearson 0.48)比 NeurIPS 人类评审的一致性还要依赖具体模型选择,GPT-5 严、Gemini 松到接近失效;以及 'AI 参与度越高质量越差' 这个方向性结论(Category D 从投稿 23.3% 掉到接收 14.9%)——在设计自动科研系统时,把人放在假设与实验设计阶段、把 AI 放在分析与写作阶段,是这批数据支持的分工方式。
阅读笔记 会议本体没有代码仓库,code_url 为空是正常的;核查主要依赖组织者报告(arXiv:2511.15534,已发 Nature Biotechnology)、官网公开数据页和 Nature/Science 两篇新闻。Nature 新闻(d41586-025-03363-3)正文有付费墙,只读到导语;Science 的 aiXiv 报道(2025-12-10)里有 Zou 对会议结果的回顾性评价,是最有用的第三方定性判断。官网 submissions.html 的统计表是 JS 动态加载,爬静态页会显示 0 篇,别被误导。
材料清单 组织者报告 arxiv.org/abs/2511.15534 Exploring the use of AI authors and reviewers at Agents4Science(Nature Biotechnology),会议全部关键数字的出处