← 返回资料站  /  AI Scientist
论文 端到端系统 ★ 必读

Agent Laboratory: Using LLM Agents as Research Assistants

Agent Laboratory:把 LLM agent 当研究助理用的人机协同科研流水线
一句话AMD/JHU 把 ML 研究流程拆成文献综述、实验、写报告三阶段,由 PhD/Postdoc/ML Engineer 等角色 agent 分工执行,人可以在每个阶段 checkpoint 给反馈;单篇成本 $2.33(gpt-4o),比 AI Scientist 便宜 84%,但人类评审只给生成论文 3.8/10——作者自己承认远低于 NeurIPS 录取线 5.85。

这是什么

Agent Laboratory 是 'AI Scientist' 这一波端到端自动科研系统里走「co-pilot 路线」的代表:它不让 agent 自己想 idea,而是接收人给定的研究问题,然后跑完文献综述 → 实验 → 写报告的全流程,产出代码仓库和一篇 LaTeX 论文。系统内部按真实实验室的角色建模:PhD Student 查文献、和 Postdoc 对话定计划,ML Engineer / SW Engineer 写数据准备代码,Professor 参与写作,最后由三个 reviewer agent 模拟 NeurIPS 评审打分决定是否返工。

它与 Sakana 的 The AI Scientist 是刻意对照的两种设计:后者全自动、从选题到投稿不碰人;Agent Laboratory 在每个子任务结束处留了 checkpoint,co-pilot 模式下人可以要求某阶段带着笔记重做。论文的实验设计也偏 HCI:15 篇 autonomous 论文由 10 名 PhD 志愿者按 NeurIPS 标准打分,再让研究者亲自 co-pilot 跑自选题目并自评。2025 年 1 月挂 arXiv,后被 EMNLP 2025 Findings 接收,GitHub 5.8k stars,是这个方向被引用最多的工作之一(S2 引用数 467+)。

全系统工作流:三阶段(Literature Review / Experimentation / Report Writing)× 七个子任务,每个子任务标注了负责的 agent 角色(上排 Instructor:Postdoc、SW Engineer 等;下排 Assistant:PhD Student、ML Engineer)和调用的工具(arXiv、HuggingFace、Python、LaTeX)。注意最左侧的 Human 图标和底部虚线 report revisions 回路——人在环反馈和返工机制是它区别于 AI Scientist 的核心。
全系统工作流:三阶段(Literature Review / Experimentation / Report Writing)× 七个子任务,每个子任务标注了负责的 agent 角色(上排 Instructor:Postdoc、SW Engineer 等;下排 Assistant:PhD Student、ML Engineer)和调用的工具(arXiv、HuggingFace、Python、LaTeX)。注意最左侧的 Human 图标和底部虚线 report revisions 回路——人在环反馈和返工机制是它区别于 AI Scientist 的核心。

机制与做法

三阶段流水线与角色分工

Literature Review 阶段由 PhD agent 走 arXiv API,用 summary / full text / add paper 三个命令迭代式攒综述,攒够 N 篇后进入下一阶段。Experimentation 阶段先由 PhD 和 Postdoc 两个 agent 对话出 plan(指定模型、数据集、实验步骤),再由 ML Engineer 写数据准备代码(可用 search HF 命令搜 HuggingFace 数据集),代码过 Python 编译器检查后由 SW Engineer 提交。所有阶段的中间产物都存 checkpoint,可以断点恢复。

两种运行模式:autonomous 模式下各子任务顺序自动推进;co-pilot 模式在每个子任务末尾停下来,人审阅产物后可以选择放行,或写几句 high-level notes 让 agent 重做该阶段——比如'综述里缺某篇关键论文'、'实验要加某个技术'。

mle-solver 内部结构:左侧输入 research plan + 文献综述 + 准备好的数据集,中间 LLM 通过 EDIT / REPLACE 两个命令改代码,右侧编译失败修 3 次、成功则交 LLM reward function 打 0-1 分,分数决定是否进入 Top Scoring Programs 池;失败/成功都触发 Self-Reflection 反馈到下一轮。可以理解为把 Tree-of-Thoughts 搜索搬到程序空间。
mle-solver 内部结构:左侧输入 research plan + 文献综述 + 准备好的数据集,中间 LLM 通过 EDIT / REPLACE 两个命令改代码,右侧编译失败修 3 次、成功则交 LLM reward function 打 0-1 分,分数决定是否进入 Top Scoring Programs 池;失败/成功都触发 Self-Reflection 反馈到下一轮。可以理解为把 Tree-of-Thoughts 搜索搬到程序空间。

mle-solver:用 LLM reward model 做程序空间搜索

跑实验由专门模块 mle-solver 负责,本质是在程序空间做类似 Tree-of-Thoughts 的搜索:维护一个 top-scoring programs 池,每步随机采样一个程序,用 EDIT(替换指定行区间)或 REPLACE(整文件重写)生成新代码;编译失败则最多修 3 次;编译成功后交给一个 LLM reward model 打 0-1 分——评「代码和输出与 research plan 的贴合度」,而不是像 AIDE 那样直接抽取 Kaggle accuracy。无论成败都做一轮 self-reflection 喂给下次迭代。每步并行做 N 个修改、取最优替换池中最差者,防止性能漂移。

在 MLE-Bench 的一个子集(low complexity 里全部 10 个 text/tabular 任务)上单独评测 mle-solver:拿到 4 块奖牌(2 金 1 银 1 铜),6/10 任务超过人类中位数,好于 AIDE(o1-preview,2 牌)、OpenHands(2 牌)和 MLAB(0 牌)。

全文最重要的一张图:同一批生成论文,automated reviewer(粉,均分 6.1/10)vs 人类 PhD 评审(绿,均分 3.8/10)的 NeurIPS 式打分对比。自动评审系统性高估 2.3 分,且在 Clarity 等每个单项上都高估——直接说明用 LLM 评审自证「达到录取水平」不可信。
全文最重要的一张图:同一批生成论文,automated reviewer(粉,均分 6.1/10)vs 人类 PhD 评审(绿,均分 3.8/10)的 NeurIPS 式打分对比。自动评审系统性高估 2.3 分,且在 Clarity 等每个单项上都高估——直接说明用 LLM 评审自证「达到录取水平」不可信。

paper-solver 与自动评审闭环

写报告由 paper-solver 完成:先生成八段式 LaTeX 脚手架(Abstract 到 Discussion),写作中可再查 arXiv 补引用,然后用 EDIT 命令逐行改,每次改动都先过 LaTeX 编译验证。打分复用了 The AI Scientist 那套 NeurIPS 风格 automated reviewer;paper refinement 阶段由三个 reviewer agent 打分,PhD agent 据此决定终稿还是回退到 planning / experimentation 重做。

作者明确定位 paper-solver 不是替人写论文,而是生成一份「让使用者看懂 agent 做了什么」的报告——这也是他们与 AI Scientist 在叙事上的关键切割。

三个 backend 的分阶段成本、耗时、成功率表。gpt-4o 全流程 $2.33 / 1165s,o1-preview $13.1 / 6201s;Report Writing 是最烧钱阶段(o1-preview 单阶段 $9.58)。注意成功率表:多数阶段 100%,唯独 Literature Review 只有 60-80%,是全流程最脆弱的一环。
三个 backend 的分阶段成本、耗时、成功率表。gpt-4o 全流程 $2.33 / 1165s,o1-preview $13.1 / 6201s;Report Writing 是最烧钱阶段(o1-preview 单阶段 $9.58)。注意成功率表:多数阶段 100%,唯独 Literature Review 只有 60-80%,是全流程最脆弱的一环。

评估设计:自动评审 vs 真人评审

5 个预设研究问题 × 3 个 backend(gpt-4o / o1-mini / o1-preview)生成 15 篇 autonomous 论文,10 名 PhD 志愿者每人评 3 篇。最有价值的实验是把 automated reviewer 和人类打分并排:自动评审平均给 6.1/10(超过 NeurIPS 录取均分),人类只给 3.8/10,系统性高估 2.3 分。这是对「用 LLM 评审自证论文达到录取水平」这一做法(即 AI Scientist 的宣传口径)最直接的实证反驳。

关键结果

实证核查

有水分论文正文异常诚实(自曝人类评分远低于录取线、自动评审高估 2.3 分、一长串失败模式),代码开源且与论文一致,还过了 EMNLP Findings 同行评审;但摘要四条结论每条都比正文说得漂亮,且仓库 issues 显示真实端到端可靠性远不如论文报的 92-96% 成功率。
摘要结论 (2):生成的 ML 代码「能达到 SOTA 性能」。
实际评测只是 MLE-Bench low complexity 档里 10 个 text/tabular 任务(§4.4),且对比基线时「排除无效提交后再取平均」——OpenHands/AIDE 常常交不出有效方案,这种算法对 mle-solver 明显有利。4 块奖牌 vs 对手 2 块,样本量 10,离『SOTA』的一般含义差得远。
论文报告全流程各 backend 成功率 92.8%-95.7%,多数子任务 100%。
仓库 issues 里端到端翻车是常态:#89 report writing 阶段直接 TypeError(PaperSolver 不认识 save_loc 参数,属于发布版代码 bug)、#103 用 deepseek 生成的论文 Methods/Results 等整节缺失、#82 和 #80 agent 对话/ADD PAPER 死循环、#104 Data Preparation 阶段 Max tries 异常。论文的成功率是作者自己在 3 个 OpenAI backend 上测的,换模型、换环境后没有这个数。
摘要结论 (3):人的参与「显著提升研究质量」。
论文自己的数据只支持一半:外部评审给 co-pilot 论文 +0.58(4.38 vs 3.8/10),但 co-pilot 用户自评 experiment quality 反而比 autonomous 模式低 0.82 分(§4.2),75% 反馈提到难以让 agent 落实自己的设想;且 4.38 仍比 NeurIPS 录取线 5.85 低 1.47 分。
「比先前自动科研方法降本 84%」。
只对比了 AI Scientist 一家($2.33 vs ~$15,均 gpt-4o backend,见 §4.3),且只算 LLM API 费用不含 GPU 算力;论文自己也承认其报告图表质量「定性上不如 The AI Scientist」(§5.1)——便宜的一部分代价写在了限制一节里。
正面核查:automated reviewer 高估自家论文 +2.3 分的结论。
这条声称与数据完全一致(自动 6.1 vs 人类 3.8,图 6 violin plot),且是作者主动打自己评分机制的脸,顺带反驳了 AI Scientist 用自动评审自证质量的做法。论文后被 EMNLP 2025 Findings 接收(aclanthology 2025.findings-emnlp.320),这部分实证经过了同行评审。
开源可复现:MIT 协议,代码与论文描述一致。
仓库(5.8k stars,活跃维护到 2025-08)里 ai_lab_repo.py / mlesolver.py / papersolver.py 与论文模块一一对应,prompt 全文附在论文附录;但没有沙箱——论文自述观察到 mle-solver 用 subprocess.run() 在宿主机执行系统命令,自己跑要注意隔离。

与我们方向的关系

这是和 Sakana The AI Scientist 对照着读的必读件:同一年、同一个问题,一个走全自动黑盒,一个走阶段化 + 人在环。做流程编排设计时最值得抄的是它的 checkpoint 机制(每阶段产物落盘、人可带 notes 要求重做)和 mle-solver 的搜索结构(top-program pool + LLM reward + self-reflection + 批并行),后者比 AIDE 的「只认 accuracy」更适合开放式研究代码。

对课题组评估方法学的启示更大:automated reviewer 比人类评审系统性高估 2.3 分这个数,是目前反驳「LLM 评审可以替代人评」最常被引用的实证之一——以后看到任何用 GPT 打分自证「达到会议录取水平」的 AI-scientist 论文,都应该先想起这张 violin plot。另外它 co-pilot 用户自评反而更低的现象说明:人在环不是免费午餐,交互界面粗糙时人的介入甚至会拉低体感质量。

阅读笔记

读源码时注意:任务笔记(task_notes_LLM)要直接改 ai_lab_repo.py 或 yaml,没有正经配置界面;文献综述阶段是全流程最不稳的一环(成功率 60-80%),issues 里的死循环多发生在这里。AgentRxiv(2503.18102)是同作者的续作,让多个 Agent Laboratory 实例互传论文做累积研究,读这篇时可以顺带扫一眼。

材料清单

TeX 源码
已存档:Raw/agent-laboratory/source/
代码仓库github.com/SamuelSchmidgall/AgentLaboratory
5814★ · 最近推送 2025-08-20
项目主页 / 报告agentlaboratory.github.io/
EMNLP 2025 Findings 正式版aclanthology.org/2025.findings-emnlp.320/
arXiv 版之外经过同行评审的出版版本
AgentRxiv(续作)arxiv.org/abs/2503.18102
同作者 2025-03 续作:多个自主研究 agent 互传论文、做累积式研究
MLE-Bencharxiv.org/abs/2410.07095
论文用来单独评测 mle-solver 的 Kaggle 基准(只取了 low complexity 的 10 个任务)

同类条目