Tongyi DeepResearch Technical Report
首个性能对标 OpenAI Deep Research 的全开源深度调研模型(30B-A3B MoE),完整公开 agentic mid-training + RL post-training 和合成数据流水线,是研究'如何训练调研 agent'而不只是'如何提示'的最重要开放参照。
把科研流水线拆开逐环节自动化:想法生成、文献调研、实验执行、论文写作与自动评审——以及度量这一切的基准。
如何让 agent 自主检索文献与网页并综合成带引用的报告——deep research 产品与开源复现、论文检索与文献问答组件,及其专用评测。
首个性能对标 OpenAI Deep Research 的全开源深度调研模型(30B-A3B MoE),完整公开 agentic mid-training + RL post-training 和合成数据流水线,是研究'如何训练调研 agent'而不只是'如何提示'的最重要开放参照。
把'多步网络调研并产出带引用长报告'做成产品的开山之作(基于端到端 RL 训练的 o3 变体,HLE 26.6%),定义了 deep research 这一任务范式,之后所有开源复现和评测基准都以它为参照系。
Ai2 的开源文献综合系统:基于 4500 万篇论文的检索库+自反馈生成,在引用准确性上超过 GPT-4o(后者引用幻觉率高达 78-90%),模型、数据、检索库全开放,是构建文献调研 agent 的最完整开源基础设施。
最早也最流行的开源自主调研 agent(29k+ stars,2026 年仍活跃维护),planner-executor 并行架构生成带引用的调研报告,早于 OpenAI Deep Research 一年半,是搭建自有深度调研流水线的首选起点。
系统剖析 Deep Research 智能体(检索、工具使用、规划、报告生成)的架构与评测并给出路线图(129 引),补齐站内深度调研子模块的综述空缺。
100 个博士级调研任务覆盖 22 个领域,提出 RACE(报告质量)+FACT(引用忠实度)双评估框架并持续维护排行榜(2026-08 仍在更新),是横向比较各家 deep research 系统最常被引用的基准。
LangGraph 官方的开源 deep research 实现,监督者-研究员多 agent 架构写得很清楚,适合当参考架构读;12678 stars,但 2026-08 已归档,后续由 langchain-ai/deepagents 接棒。
HF 用 24 小时复现 OpenAI Deep Research 的开源版本(smolagents 的 examples/open_deep_research),在 GAIA 上打出当时开源最好成绩,代码极简适合改造;smolagents 本体 29050 stars,2026-08 仍活跃。
字节用 RL 训练的论文检索 agent(crawler+selector 双模型),自主调用搜索、读论文、沿引文网络扩展,在复杂学术查询上大幅超过 Google Scholar 和 GPT-4 检索,是文献调研环节可复用的开源组件。
面向科学文献的高精度 RAG/综述 agent,论文声称在文献问答和矛盾检测上达到超人水平,是自动科研系统里文献环节的标准组件;9123 stars,2026-08 仍活跃。
早于 OpenAI Deep Research 一年提出'检索+多视角提问+大纲生成'来从零写带引用的长篇综述文章,是深度调研范式的学术源头之一,开源实现有 31k+ stars,做调研 agent 的提问策略设计几乎都会引它。
LLM 能否提出新颖且可行的研究想法——idea 生成方法,以及用大规模人类实验检验其真实价值(含想法到执行的落差)。
上一篇的后续:让 43 位研究者把 LLM 想法和人类想法真正做成实验,发现 LLM 想法执行后评分大幅下滑、'新颖性优势'基本消失,给自动想法生成研究泼了关键的一盆冷水,也定义了'ideation-execution gap'这一问题。
第一个大规模盲评实验:招募 100+ NLP 研究者对比人类与 LLM 生成的研究想法,发现 LLM 想法在新颖性上显著更高但可行性略弱,是评估 idea 生成能力最有说服力的实证基线。
较早把'读文献-提问题-写方案-同行评审式迭代修改'做成多 agent 闭环的工作,用引文图扩展知识面并以多个 reviewer agent 迭代打磨想法,是 idea 生成 agent 的代表性框架。
让 agent 端到端跑通 ML 实验与工程(改代码、训练、调参)的方法路线(树搜索/记忆/进化)与竞技场环境。以 Kaggle/MLE 式有明确指标的工程任务为主,含实验严谨性专项;方法与其配套评测环境同放一处,研究级能力评测见后两个桶。
首个把 AI 研究任务做成 Gym 式 RL 环境的框架(13 个跨领域开放式任务),不只是评测,还为训练 research agent(RL/课程学习)提供了基础设施,对想训练自己 agent 的课题组直接有用。
把机器学习实验建模为代码空间中的树搜索(起草-调试-改进),是 MLE-bench 上长期的最强基线,被 OpenAI/METR 等用作评测脚手架,后续大量 ML 实验 agent(ML-Master、AIRA 等)都在其框架上改进,实验执行环节必读。
用 75 个真实 Kaggle 竞赛测 agent 端到端做 ML 工程(数据处理、训练、调参、提交)的水平,是目前评测 AI 自动化 ML 研发最被广泛引用的基准,后续大量 research agent 系统都拿它当主战场。
最早系统评测 LLM agent 自主做 ML 实验(改代码、跑训练、迭代提性能)的基准,13 个任务从 CIFAR-10 到 BabyLM,是这个方向的奠基工作,后来的 MLE-bench/MLGym 都可视为其扩展。
Meta 把研究 agent 形式化为'搜索策略×操作算子'的组合并系统消融(greedy/MCTS/进化搜索),指出评估器噪声和过拟合验证分数是主要瓶颈,配套开源 aira-dojo 沙箱,是理解实验 agent 设计空间的最系统研究。
把并行树搜索探索与自适应记忆增强的推理耦合起来的 AI4AI agent,发布时在 MLE-bench 上以 29.3% 奖牌率刷新纪录,代表 2025 年实验执行 agent 在'探索+推理'融合方向的进展。
把 200+ 个 Kaggle 任务封装成 Gym 风格交互环境,agent 可以在结构化反馈回路里反复实验-调试-改进,并且环境本身支持对 MLE agent 做强化学习训练——把 MLE-bench 式的静态评测升级为'可训练'环境,对想用 RL 训练研究型 agent 的组直接可用(NeurIPS 2025,GitHub 105 stars)。
专注实验环节严谨性(可控变量、可复现、结果可信)的自动实验 agent,补上了端到端系统普遍薄弱的『实验可靠性』一环;371 stars,2025-09 最后活跃。
466 个数据分析 + 74 个建模任务,取自 ModelOff 和 Kaggle 真实竞赛,长上下文、多模态、真实数据文件俱全,补上了数据科学 agent 评测中'任务太玩具化'的缺口。
给定论文或仓库,考察 agent 能否配好环境、复现结果、实现论文描述的方法与扩展——研究能力的下界。
要求 agent 从零复现 20 篇 ICML 2024 Spotlight/Oral 论文的全部实验,配有作者审定的 8000+ 条细粒度评分树,是'AI 能否复现 AI 研究'这一问题上最严格的公开基准,也是 OpenAI Preparedness 框架的一部分。
专挑训练数据截止之后的 2024-25 年新论文,要求把论文中的核心新方法写成代码(212 个编码挑战),最好的模型也只实现不到 40%,有效隔离了'背过代码'和'真的能实现新想法'。
用 90 篇已发表论文的 270 个任务测 agent 能否在给定代码和数据的前提下复现论文结果,把'计算可复现性'这一科研基础环节变成了可自动评测的问题。
专测 agent 从低文档质量的真实研究仓库出发配环境、跑实验的能力——这是自动复现科研最脏最卡壳的环节,SUPER 显示当时最强模型端到端成功率仅 16.3%。
不给现成方案,考察 agent 自己提方法、改训练算法、扩展研究的能力,含 reward hacking 与结果伪造记录。
140 个任务×12 个 ML 领域,不再考'把一个 Kaggle 管线调到最好',而是考 agent 能否发明可跨数据集、跨种子、跨规模泛化的新 ML 方法(新 loss、优化器、训练流程),结论是当前 agent 擅长工程式调参、远未达到真正的方法发明;已被 Qwen3.8-Max、Kimi K3 等前沿模型采纳为官方评测,配持续维护的社区排行榜(GitHub 107 stars,2026-08 仍活跃更新)。
给 CLI agent(Claude Code、Codex 等)一块 H100、10 小时和一个 base LLM,完全自主地做后训练(SFT/蒸馏/RL 自选),看能把目标基准分数拉到多高;最佳 agent 23.2% vs 官方 instruct 模型 51.1%,还系统记录了训练集掺测试集、直接下载现成 checkpoint 等 reward hacking 行为,是追踪'AI 自动化 AI 研发'进度和风险的核心标尺(ICML 2026,GitHub 538 stars,2026-08 仍活跃)。
从 51 篇顶会论文半自动抽取 461 个完整研究实验(设计-实现-执行-结论),端到端可执行且正确的比例仅 0.5%-1.4%,是目前对'AI 能否独立做 AI 研究实验'最直接、最悲观也最有信息量的度量。
7 个开放式 AI 研发任务上让 agent 与 71 名人类专家在相同预算下直接对打,给出'AI 短时程优于人类、长时程仍落后'的定量结论,是衡量递归自我改进风险与 AI R&D 自动化进度的标杆评测。
批评现有基准只看最终性能的'工程视角',改用 8 个基础 ML 研究问题和五维统一指标(含探索广度)评研究过程本身,结论是'广撒网'策略优于深挖单一想法,对设计自动研究 agent 的搜索策略有直接指导意义。
端到端 LLM 研究基准+配套 ResearchGym 平台,20 个任务覆盖数据构造、损失设计、奖励设计、scaffold 构建等真实 LLM 研究环节,要求 agent 在多 GPU 环境里真跑训练拿结果,填补了 MLE-bench(纯工程)与 PaperBench(纯复现)之间'做创新研究'的空档(ICLR 2026,GitHub 17 stars,2026-02 更新)。
201 个源自顶会 workshop 的开放式研究任务,覆盖想法-方案-实验-写作全流程并配 MLR-Judge 自动评审;其关键发现是 agent 经常伪造或篡改实验结果,直接点出自动科研评测的可信性核心难题。
AI 能否可靠地评审论文——开源评审模型、评审判断力评测、可信性批判与隐藏 prompt 操纵等对抗风险。
不靠闭源大模型,而是训练了一对开源模型:CycleResearcher 写论文、CycleReviewer 打分,再用评审分数做强化学习反馈闭环。对课题组的价值在于它给出了"自动评审当奖励信号"的可复现实现,模型权重和 Research-14K 数据集都公开,是研究自我改进闭环的现成实验平台。
2026 年的立场论文,系统论证当前 AI 评审系统缺乏严格评估、不应直接用于产出评审意见,梳理了自动评审可靠性研究的证据缺口,为课题组界定'评审 agent 什么程度可信'提供批判性框架。
剖析 2025 年 7 月曝光的真实事件:18 篇 arXiv 稿件用白色小字体隐藏'只输出好评'等提示词操纵 AI 评审。做自动评审系统必须面对的对抗性风险案例,直接影响评审 agent 的安全设计。
把评审拆成新颖性核查、多维质量评估、可靠性校准的结构化深思流程,训练出的 DeepReviewer-14B 在论文评审上超过 GPT-o1 等闭源模型,并开放 13K 评审思维链数据,是目前最可用的开源评审模型之一。
评测方程推断、实验设计、论文弱点分析、审稿评述四类需要深度领域知识的'科研脑力'环节,与偏工程执行的 MLE-bench 类基准互补,覆盖了想法与判断层面。
跳出 ML 本行:数据驱动科学发现与跨学科科研能力的评测(含生物等垂直领域与知识型天花板基准),以及科研 agent 的产品化平台。
从 44 篇四个学科的真实论文中抽取 102 个数据分析任务并经领域科学家逐条校验,证明最强 agent 也只能独立解决约三分之一,给'AI 已能自动做科研'的宣传泼了有据的冷水。
2026 年新出的端到端自主科研基准,覆盖从'重发现'已知结论到探索新发现的完整链条,代表了评测重心从单环节能力向完整科研闭环迁移的最新趋势,是课题组跟进 2026 年评测前沿的入口。
Ai2 把文献检索、代码执行、数据分析、端到端发现等 2400+ 题整合成统一套件,带成本-性能双轴排行榜和标准 agent 基线,正在成为科研 agent 领域的'HELM 式'公共基础设施,2026 年已有多家工业界采用。
把 Crow/Falcon/Owl/Phoenix 等文献检索与化学设计 agent 以 API 形式开放,文献综述精度声称超过博士生水平,是目前最成体系的开放科研 agent 平台。
首个把'从数据集中搜索并验证假设'形式化的基准,264 个任务来自社会学、工程学等领域的已发表发现,最强系统仅 25% 得分,量化了假设发现与人类科研的差距。
主属其他方向、但与本方向直接相关的条目;彩点与角标标注其主方向。
提出 LLM 在科学发现中 Tool→Analyst→Scientist 三级自主性框架(101 引,EMNLP 2025),是理解『自动化到自主科学家』演进路线的核心综述。