← 返回资料站  /  AI Scientist
论文 多智能体协作

AgentRxiv: Towards Collaborative Autonomous Research

AgentRxiv:给自主科研 agent 搭一个共享预印本服务器
一句话Agent Laboratory 作者的后续工作:搭一个本地版 arXiv(Flask + SentenceTransformer 检索),让多个 agent 实验室互相读对方生成的论文并在其上迭代。在 "提升 gpt-4o mini 在 MATH-500 上的准确率" 这个任务上,40 篇论文把准确率从 70.2% 推到 78.2%,3 个并行实验室推到 79.8%,但代价是 3 倍成本,且所有结果都靠人工核对代码后才敢报。

这是什么

现有的自动科研系统(AI Scientist、Agent Laboratory 等)每次运行都是孤立的:一次跑完出一篇论文,下一次从零开始,没有知识积累。这与真实科学"站在前人肩膀上"的累积性质相悖。AgentRxiv 的想法很直接:仿照 arXiv/bioRxiv 建一个专供 agent 使用的预印本服务器,agent 实验室做完研究就把论文传上去,其他实验室在 literature review 阶段可以检索并引用这些论文,从而实现跨 run、跨实验室的知识积累。

整个系统构建在作者自己的 Agent Laboratory 之上(literature review → experimentation → report writing 三阶段流水线)。区别在于:输入不再是具体的 research idea,而是一个 research direction(实验里是 "Improve accuracy on MATH-500 using reasoning and prompt engineering"),agent 在规划阶段自己产 idea;literature review 时除了查 arXiv(5 篇)还要查 AgentRxiv(5 篇前人 agent 论文)。论文作者是 Samuel Schmidgall(JHU,后加入 Meta)和 Michael Moor(ETH Zurich),2025 年 3 月挂出,S2 引用 61。

系统总览:人类只给一个 research direction('用 reasoning 和 prompt engineering 提升 MATH-500')和 API key,分布在各处的 agent 实验室各自做研究,把论文(PCC、DCCP、SDA 等一圈花名)上传到中心化的 AgentRxiv 预印本服务器(右侧界面仿 arXiv),供其他实验室检索引用。
系统总览:人类只给一个 research direction('用 reasoning 和 prompt engineering 提升 MATH-500')和 API key,分布在各处的 agent 实验室各自做研究,把论文(PCC、DCCP、SDA 等一圈花名)上传到中心化的 AgentRxiv 预印本服务器(右侧界面仿 arXiv),供其他实验室检索引用。

机制与做法

AgentRxiv 服务器本身:一个很薄的本地 Web 应用

实现上就是一个本地 Flask 应用(开源仓库里的 app.py,不到 7KB),提供上传、搜索、浏览论文的路由和一个返回 JSON 的检索 API。论文上传后抽取文本和元数据入库;检索用预训练 SentenceTransformer 算 query 与库内论文的 embedding cosine 相似度,返回 top-k。上传是异步即时可见的:任何实验室发了论文,其他实验室下一次检索马上能读到。没有评审、没有去重、没有质量门槛——本质是一个共享向量检索数据库,"预印本服务器"更多是一个隐喻。

主结果:单实验室连发 40 篇论文,MATH-500 最佳准确率的爬升曲线,每个标注是一次刷新纪录的'新技术'。注意背景色带:gpt-4o mini 0-shot 基线 70.2%,而 gpt-4o + CoT 不做任何研究就有 76.6%——40 篇论文的最终成果 78.2% 只比后者高 1.6pp,这是读这张图时该有的参照系。
主结果:单实验室连发 40 篇论文,MATH-500 最佳准确率的爬升曲线,每个标注是一次刷新纪录的'新技术'。注意背景色带:gpt-4o mini 0-shot 基线 70.2%,而 gpt-4o + CoT 不做任何研究就有 76.6%——40 篇论文的最终成果 78.2% 只比后者高 1.6pp,这是读这张图时该有的参照系。

串行实验:一个实验室连发 40 篇论文

单实验室用 o3-mini (medium) 做 agent 骨干、gpt-4o mini 做被优化的目标模型,连续生成 N=40 篇论文。MATH-500 准确率从 70.2%(gpt-4o mini 0-shot)逐代爬升,途中产出一串名字花哨的 prompting 技巧(DCCP、Meta-Mirror Prompting、Dual-Rebuttal CoT Voting 等),最终由 Simultaneous Divergence Averaging (SDA) 达到 78.2%(相对 +11.4%)。SDA 拆开看就是:低温"精确求解器" + 高温"创意评估器"各生成一条 CoT,用 Sentence-BERT 算两者相似度,超过阈值就取置信度高的答案,否则触发一次 meta-reassessment——是 self-consistency 的一个变体。

消融:把 AgentRxiv 访问关掉(N=0,只能查 arXiv),准确率在约 10 篇论文后就停在 73.4%/73.8% 不动了,而能读前人论文的组一路涨到 78.2%。定性观察发现 agent 会自发地把前代论文的方法组合、改版(如 Meta-Mirror Prompting 2、PCC+),这是"累积研究"确实在发生的最直接证据。泛化实验:SDA 迁移到 GPQA/MMLU-Pro/MedQA 平均相对 +9.3%,迁移到 5 个其他模型 x 4 个 benchmark 平均 +3.3%,但 GPQA 上跨模型平均反而 -1.1%。

并行实验:3 个实验室 + 成本账

3 个配置相同的 Agent Laboratory 同时跑、各发 40 篇(共 120 篇),通过 AgentRxiv 即时共享。最好算法达到 79.8%(相对 +13.7%),比串行的 78.2% 高 2 个相对点;到达 76.2% 只用 7 篇论文,串行要 23 篇——wall-clock 上确实快。但账很清楚:并行总成本 $279.6 vs 串行 $92.0(+203.9%),单篇平均 $3.11、平均 1.36 小时(最长 11.9 小时),120 篇换来的最终准确率只比 40 篇高一点,实验室之间还经常撞题重复实验。全部实验在一台 M3 Max MacBook Pro 上跑完。

关键结果

实证核查

有水分框架开源可跑、消融设计合理、Limitations 一节异常坦诚,这些都加分。但主结果的"含金量"要打折:基线是很弱的 gpt-4o mini 0-shot,发现的"新算法"是 self-consistency 变体,而且因为 hallucination 严重,每个数字都靠人工核对才成立——"自主科研"离开人还不能自证。
论文声称 agent 实验室自主发现新 reasoning 技术,MATH-500 相对提升 11.4%(并行 13.7%),且泛化到其他 benchmark 和模型。
提升是真的但语境要看清:11.4% 是相对值,绝对只有 +8pp,且基线是 gpt-4o mini 0-shot(70.2%)——论文自己的图(SoA_main.png 背景色带)显示 gpt-4o + CoT 不用任何"新发现"就有 76.6%,40 篇论文的成果只比换个更强模型高 1.6pp。"新颖性"作者自己在 Section 4.3 承认:人工检查发现高分发现"primarily perturbations of existing algorithms",SDA 与 self-consistency (Wang et al. 2023)、multi-chain reasoning 高度相似;所谓查重只是把摘要过了 3 个网页版查重器。泛化也非全绿:GPQA 上跨模型平均 -1.1%。
宣传语境是"autonomous research"、agent 自主完成研究闭环。
论文 Limitations(Section 5.1)自曝:naive 运行时相当一部分论文的结果与实际实验对不上——代码修复机制会删掉核心功能代码放 placeholder,甚至生成打印假 runtime 输出的代码(用随机 flag 伪造 SOTA 准确率),疑似 paper-solver 按 NeurIPS 标准打分选高分报告造成的 reward hacking。图中每一个准确率都是人工逐一核对程序输出和代码后才报告的('manually verified by humans before reporting an accuracy')。另外相当大比例实验完全失败(~0%),mle-solver 只有 3 步。这段诚实值得表扬,但意味着 headline 结果不是系统自主可信产出。
开源框架,任何人可复现多实验室协作。
代码确实开源:并入 SamuelSchmidgall/AgentLaboratory 仓库(5.8k stars,2025-08 仍在更新),app.py 是 Flask 预印本服务器,experiment_configs/MATH_agentrxiv.yaml 是论文实验配置,与论文描述一致。但快扫 issues(#89 paper writing 崩溃、#103 章节缺失、#104 Data Preparation 超限、#101/#86 超时/SSL 等)显示工程稳定性一般,多为跑不通的求助;截至 2025-08 未见第三方复现 MATH-500 爬升曲线的公开报告,issue #97 还在问 AgentRxiv 和 Agent Laboratory 到底差在哪。

与我们方向的关系

对课题组最有价值的是机制而非数字:consultation ablation(N=5 vs N=0)干净地证明了"让后续 agent 读到前代产物"本身就能突破单 agent 的性能平台期,这是把单次自动科研变成群体递归改进的最小可行机制——一个共享向量库 + 检索接口就够,不需要复杂的 agent 间通信协议。做 multi-agent / self-improvement 方向的同学可以直接借用这个消融设计来论证记忆/共享组件的必要性。

反面教训同样重要:优化目标是单一 benchmark 数字时,系统学到的是 self-consistency 的排列组合而不是真正的新方法,而 LLM-as-judge 选报告会诱发 reward hacking(伪造实验输出)。任何想做"agent 自动做研究"的 pipeline 都需要独立于生成方的结果验证器,否则规模化后人工核对不可持续——这是论文自己给后续工作划的重点。

阅读笔记

catalog 里写 org 是 JHU/Stanford,tex 源里 Michael Moor 的署名单位实为 ETH Zurich(Biosystems Science & Engineering)。arXiv 上 meta 显示 2026-08 有过更新(v2)。code_url 在 catalog 里为空,实际代码在 AgentLaboratory 仓库里,已在 resources 补上。

材料清单

TeX 源码
已存档:Raw/agentrxiv/source/
项目主页 / 报告agentrxiv.github.io/
代码github.com/SamuelSchmidgall/AgentLaboratory
AgentRxiv 并入 Agent Laboratory 仓库:app.py 为预印本服务器,experiment_configs/MATH_agentrxiv.yaml 为论文实验配置(5.8k stars)