AutoResearchAutomating the research pipeline

把科研流水线拆开逐环节自动化:想法生成、文献调研、实验执行、论文写作与自动评审——以及度量这一切的基准。

53条目 17必读 20论文26基准3博客1报告3项目
类型 分级 核查 标签

先读这三篇

进本方向的最短路径,由课题组指定
  1. 1PaperBench: Evaluating AI's Ability to Replicate AI Research复现与实现能力评测 · OpenAI · 2025OpenAI Preparedness 团队的复现基准:agent 拿到论文 PDF 后要从零写出完整代码库并跑通全部实验,由作者共建的 8,316 个…
  2. 2RE-Bench: Evaluating frontier AI R&D capabilities of language model agents against human experts自主研发能力评测 · METR · 2024METR 做了 7 个开放式 ML research engineering 环境,收集 61 名人类专家的 71 次 8 小时尝试作为基线,和 fro…
  3. 3Can LLMs Generate Novel Research Ideas? A Large-Scale Human Study with 100+ NLP Researchers想法生成与验证 · Stanford · 2024Stanford 招募 104 位 NLP 研究者做首个大规模盲评:49 人写 idea、79 人写 298 份盲审,LLM agent 生成的想法在 …

深度调研与文献

12

如何让 agent 自主检索文献与网页并综合成带引用的报告——deep research 产品与开源复现、论文检索与文献问答组件,及其专用评测。

报告 2025.10 有水分 ★ 必读

Tongyi DeepResearch Technical Report

Alibaba (通义) · arXiv · 19.9k★

首个性能对标 OpenAI Deep Research 的全开源深度调研模型(30B-A3B MoE),完整公开 agentic mid-training + RL post-training 和合成数据流水线,是研究'如何训练调研 agent'而不只是'如何提示'的最重要开放参照。

博客 2025.02 有水分 ★ 必读

Introducing Deep Research (OpenAI)

OpenAI · OpenAI blog

把'多步网络调研并产出带引用长报告'做成产品的开山之作(基于端到端 RL 训练的 o3 变体,HLE 26.6%),定义了 deep research 这一任务范式,之后所有开源复现和评测基准都以它为参照系。

项目 2023.07 有水分 ★ 必读

GPT Researcher

开源社区 (Assaf Elovic) · GitHub · 29.2k★

最早也最流行的开源自主调研 agent(29k+ stars,2026 年仍活跃维护),planner-executor 并行架构生成带引用的调研报告,早于 OpenAI Deep Research 一年半,是搭建自有深度调研流水线的首选起点。

项目 2025.02 扎实

LangChain Open Deep Research

LangChain · GitHub · 12.7k★

LangGraph 官方的开源 deep research 实现,监督者-研究员多 agent 架构写得很清楚,适合当参考架构读;12678 stars,但 2026-08 已归档,后续由 langchain-ai/deepagents 接棒。

项目 2025.02 扎实

smolagents Open Deep Research

Hugging Face · GitHub · 29.1k★

HF 用 24 小时复现 OpenAI Deep Research 的开源版本(smolagents 的 examples/open_deep_research),在 GAIA 上打出当时开源最好成绩,代码极简适合改造;smolagents 本体 29050 stars,2026-08 仍活跃。

背景与延伸

想法生成与验证

4

LLM 能否提出新颖且可行的研究想法——idea 生成方法,以及用大规模人类实验检验其真实价值(含想法到执行的落差)。

ML 工程自动化与竞技场

10

让 agent 端到端跑通 ML 实验与工程(改代码、训练、调参)的方法路线(树搜索/记忆/进化)与竞技场环境。以 Kaggle/MLE 式有明确指标的工程任务为主,含实验严谨性专项;方法与其配套评测环境同放一处,研究级能力评测见后两个桶。

论文 2025.02 扎实 ★ 必读

AIDE: AI-Driven Exploration in the Space of Code

Weco AI · arXiv · 1.5k★

把机器学习实验建模为代码空间中的树搜索(起草-调试-改进),是 MLE-bench 上长期的最强基线,被 OpenAI/METR 等用作评测脚手架,后续大量 ML 实验 agent(ML-Master、AIRA 等)都在其框架上改进,实验执行环节必读。

基准 2025.05 有水分

MLE-Dojo: Interactive Environments for Empowering LLM Agents in Machine Learning Engineering

Georgia Tech / Stanford · NeurIPS 2025 · 105★

把 200+ 个 Kaggle 任务封装成 Gym 风格交互环境,agent 可以在结构化反馈回路里反复实验-调试-改进,并且环境本身支持对 MLE agent 做强化学习训练——把 MLE-bench 式的静态评测升级为'可训练'环境,对想用 RL 训练研究型 agent 的组直接可用(NeurIPS 2025,GitHub 105 stars)。

背景与延伸

复现与实现能力评测

5

给定论文或仓库,考察 agent 能否配好环境、复现结果、实现论文描述的方法与扩展——研究能力的下界。

背景与延伸

自主研发能力评测

7

不给现成方案,考察 agent 自己提方法、改训练算法、扩展研究的能力,含 reward hacking 与结果伪造记录。

基准 2026.05 扎实 ★ 必读

MLS-Bench: A Holistic and Rigorous Assessment of AI Systems on Building Better AI

清华 / Princeton / UW / UC Berkeley 等联合(Bohan Lyu、Simon Du、Dawn Song、Chi Jin 等) · arXiv · 107★兼属 AI for AI

140 个任务×12 个 ML 领域,不再考'把一个 Kaggle 管线调到最好',而是考 agent 能否发明可跨数据集、跨种子、跨规模泛化的新 ML 方法(新 loss、优化器、训练流程),结论是当前 agent 擅长工程式调参、远未达到真正的方法发明;已被 Qwen3.8-Max、Kimi K3 等前沿模型采纳为官方评测,配持续维护的社区排行榜(GitHub 107 stars,2026-08 仍活跃更新)。

基准 2026.03 扎实 ★ 必读

PostTrainBench: Can LLM Agents Automate LLM Post-Training?

Tübingen(Bethge Lab / AISA,Andriushchenko、Bethge 等) · ICML 2026 · 538★兼属 AI for AI

给 CLI agent(Claude Code、Codex 等)一块 H100、10 小时和一个 base LLM,完全自主地做后训练(SFT/蒸馏/RL 自选),看能把目标基准分数拉到多高;最佳 agent 23.2% vs 官方 instruct 模型 51.1%,还系统记录了训练集掺测试集、直接下载现成 checkpoint 等 reward hacking 行为,是追踪'AI 自动化 AI 研发'进度和风险的核心标尺(ICML 2026,GitHub 538 stars,2026-08 仍活跃)。

基准 2025.05 扎实 ★ 必读

EXP-Bench: Can AI Conduct AI Research Experiments?

University of Michigan · NeurIPS 2025 D&B · 371★

从 51 篇顶会论文半自动抽取 461 个完整研究实验(设计-实现-执行-结论),端到端可执行且正确的比例仅 0.5%-1.4%,是目前对'AI 能否独立做 AI 研究实验'最直接、最悲观也最有信息量的度量。

基准 2025.10 有水分

InnovatorBench: Evaluating Agents' Ability to Conduct Innovative LLM Research

上海交大 GAIR(Pengfei Liu 组) · ICLR 2026 · 17★

端到端 LLM 研究基准+配套 ResearchGym 平台,20 个任务覆盖数据构造、损失设计、奖励设计、scaffold 构建等真实 LLM 研究环节,要求 agent 在多 GPU 环境里真跑训练拿结果,填补了 MLE-bench(纯工程)与 PaperBench(纯复现)之间'做创新研究'的空档(ICLR 2026,GitHub 17 stars,2026-02 更新)。

自动同行评审

6

AI 能否可靠地评审论文——开源评审模型、评审判断力评测、可信性批判与隐藏 prompt 操纵等对抗风险。

论文 2024.11 有水分 ★ 必读

CycleResearcher: Improving Automated Research via Automated Review

Westlake University NLP Lab · ICLR 2025 · 401★兼属 AI Scientist

不靠闭源大模型,而是训练了一对开源模型:CycleResearcher 写论文、CycleReviewer 打分,再用评审分数做强化学习反馈闭环。对课题组的价值在于它给出了"自动评审当奖励信号"的可复现实现,模型权重和 Research-14K 数据集都公开,是研究自我改进闭环的现成实验平台。

论文 2026.05 扎实

Stop Automating Peer Review Without Rigorous Evaluation

University of Zurich 等 · arXiv (position paper)

2026 年的立场论文,系统论证当前 AI 评审系统缺乏严格评估、不应直接用于产出评审意见,梳理了自动评审可靠性研究的证据缺口,为课题组界定'评审 agent 什么程度可信'提供批判性框架。

论文 2025.07 扎实

Hidden Prompts in Manuscripts Exploit AI-Assisted Peer Review

多机构 (CACM) · Communications of the ACM

剖析 2025 年 7 月曝光的真实事件:18 篇 arXiv 稿件用白色小字体隐藏'只输出好评'等提示词操纵 AI 评审。做自动评审系统必须面对的对抗性风险案例,直接影响评审 agent 的安全设计。

背景与延伸

科学发现与平台

9

跳出 ML 本行:数据驱动科学发现与跨学科科研能力的评测(含生物等垂直领域与知识型天花板基准),以及科研 agent 的产品化平台。

背景与延伸

兼收

1

主属其他方向、但与本方向直接相关的条目;彩点与角标标注其主方向。