Deep Research Agents: A Systematic Examination And Roadmap
Deep Research 智能体系统综述与路线图
Yuxuan Huang, Yihang Chen, Haozheng Zhang, et al. · UCL / 华为诺亚等 · 2025-06 · 被引 129
一句话UCL/华为诺亚等对 Deep Research (DR) agent 的系统综述(129 引):沿检索方式(API vs Browser)、工具使用、workflow(static/dynamic × single/multi-agent)、调优方法(prompt/SFT/RL)四条轴梳理约 50 个学界与工业系统,并指出 benchmark 与 DR 实际目标错位等问题;内容是 2025 年中的可靠快照,但配套 awesome 仓库自 2025-09 起停更,'持续更新'名不副实。
这是什么
Deep Research agent 指用 LLM 做多轮、长程信息调研并产出结构化报告的自主系统——OpenAI Deep Research、Gemini DR、Kimi-Researcher 属于这一类,开源侧则有 WebThinker、DeepResearcher、Search-R1 等一大批工作。2025 年上半年这个子领域爆发式增长(论文的 timeline 图里 2025 年每个月都有 5-10 个新系统),但缺一篇把概念边界、架构谱系、评测现状讲清楚的综述。
这篇是该子领域第一批系统综述之一(2025-06 v1,2025-09 v2),核心贡献是一套分类框架:信息获取分 API 检索 vs 浏览器探索;工具使用覆盖代码执行、多模态、MCP;workflow 分 static(人工预定义流水线)与 dynamic(planning-only / intent-to-planning / unified intent-planning 三种规划策略 × single-agent / multi-agent 两种组织方式);能力增强分 prompt、SFT、RL、以及非参数持续学习(case-based reasoning)。附带一个 awesome-deep-research-agent 仓库(637 stars)维护论文清单和逐系统对比表。
DR agent 的结构总览:用户输入 → 规划(可选意图澄清)→ 多 agent 经 MCP/function calling 迭代调用工具(离线检索、在线 API/浏览器检索、数据分析/代码/多模态生成)→ 多步循环后产出结构化报告。这张图就是论文对 'Deep Research' 的操作性定义。机制与做法
分类学:static vs dynamic workflow 是主轴
论文把 DR 系统按 workflow 是否由人预先固定分为两类:static workflow(Agent Laboratory、AI Scientist、AgentRxiv 等,流水线人工设计、agent 角色固定,简单但换任务要重设计)和 dynamic workflow(由 LLM 在线规划)。dynamic 再按'是否澄清用户意图'细分三档:planning-only(Grok DeepSearch、Manus,拿到 query 直接规划)、intent-to-planning(OpenAI DR,先反问澄清再规划)、unified intent-planning(Gemini DR,先出计划让用户确认修改)。执行侧则分 single-agent(一个强 LRM 全包规划+工具+写报告)与 multi-agent(搜索/数据分析/写作等专职 agent 由规划器调度)。
值得注意的是它把 AI Scientist、Agent Laboratory、AgentRxiv 这类自动科研系统也纳入 DR 范畴(归为 static workflow),即它对 DR 的定义比'联网写调研报告'更宽,基本等于'多步检索+工具+报告生成'的自主系统。
workflow 分类学:上半部分按规划策略分 static(人工预定义,如 Agent Laboratory / AI Scientist)与三种 dynamic(planning-only 如 Manus、intent-to-planning 如 OpenAI DR、unified intent-planning 如 Gemini DR);下半部分对比 static 流水线、single-agent(一个 LRM 全包)与 multi-agent(专职 agent 受规划器调度)三种执行架构。调优与非参数持续学习
能力增强一章从 prompt-based 讲到 SFT 再到 RL(Search-R1、R1-Searcher、ReSearch、DeepResearcher 这条 RL+检索的线),并给出各系统在 HotpotQA/2Wiki/NQ/TriviaQA/GPQA 上的成绩汇总表(如 DeepResearcher 在 NQ 61.9 / TriviaQA 85.0,Grok DeepSearch GPQA 84.6)。
单独设了一节'非参数持续学习',主推 case-based reasoning:agent 不改权重,靠检索复用外部 case bank 里的结构化轨迹在线适应,例子有 DS-Agent、Agent K、AgentRxiv(把共享 preprint 服务器视为集中式 case bank)、Alita(运行时按需配置新 MCP server)。这一节与本站 RSI / continual learning 方向直接相关。
评测批判与路线图
Benchmark 一章的批判比较到位:现有评测大量沿用 Wikipedia 来源的静态 QA(HotpotQA 等),这些内容已进模型参数,强模型可以'背答案'绕过检索流程,虚高成绩;且指标几乎只测检索抽取,不测 DR 的定义性产出——带表格/图/引用的结构化长报告。它点名 BrowseComp 是正确方向(过滤掉参数知识可解的题),并呼吁持续刷新的 leaderboard 和端到端报告评测。
路线图部分列了六个方向:经 MCP 打通私有数据源 + AI-native browser(Browserbase、Browser Use、Comet)、结构化事实核查循环、DAG 化异步并行执行、tool-integrated reasoning 的 RL 训练、多 agent 架构的端到端参数优化(HRL / RL 调度器)、以及自进化 agent(CBR + workflow 演化)。多为方向性论述,无实验支撑,按提案读即可。
关键结果
- 提出 static/dynamic workflow × single/multi-agent 的 DR 分类学,系统对比约 50 个学界与工业系统(检索方式、工具能力、base model、评测集逐一列表)。
- QA 成绩汇总:DeepResearcher(Qwen2.5-7B-Inst)NQ 61.9 / TriviaQA 85.0,SimpleDeepSearcher HotpotQA 73.5,Grok DeepSearch GPQA 84.6,Search-o1 2Wiki 71.4。
- 指出现有 benchmark 双重错位:静态 QA 可被参数知识'背答案';指标不覆盖结构化报告生成——这一判断在后来 DeepResearch Bench 等工作中得到印证。
- 工业系统(OpenAI/Gemini/Perplexity/Grok/Copilot/Qwen/Kimi)逐个分析实现路径,认为端到端 RL(OpenAI DR 路线)是能力上限最高的路径,但目前基本限于 single-agent。
- v2(2025-09)较 v1 扩充了非参数持续学习(CBR)一节和更多 2025 年 6-8 月系统(WebSailor、WebShaper、TTD-DR、Cognitive Kernel-Pro 等)。
实证核查
有水分作为 2025 年中的领域快照内容扎实、批判有见地,但'continuously updated repository'的承诺没有兑现(仓库停更近一年),且对开源 DR 系统一支的覆盖有明显遗漏,当地图用要打补丁。
摘要承诺配套'a curated and continuously updated repository'持续跟踪 DR 研究。
仓库 ai-agents-2030/awesome-deep-research-agent 最后一次 commit 是 2025-09-18('Update README.md'),至今(2026-08)停更近一年;2025-09 之后的收录建议 issue(#8 AgentFlow、#9 Search Self-play、#10 SearchHive、#21 Dr. Bench 等)全部 open 无人处理。论文本身也停在 v2(2025-09-03),2025 年 10 月后的 DR 进展(Tongyi DeepResearch 等)完全缺失。
自称对 DR agent 领域做'systematic examination',系统梳理信息获取、工具、架构与评测。
对照本站 deep-research 子方向条目抽查,tex 全文与 README 均未提及:GPT Researcher(2023 年起最流行的开源 DR 框架之一)、OpenScholar、PaSa、PaperQA2、LangChain/smolagents 两个 Open Deep Research 复现、DeepResearch Bench——这些全部发布于其 v2 成稿(2025-09)之前(grep source/main.tex 与 readme.md 零匹配)。覆盖明显偏向 web-QA/搜索 RL 一支(Search-R1 系收得很全),学术文献调研一支(OpenScholar/PaSa/PaperQA2)基本空白。
提出的 taxonomy 旨在'systematize existing approaches',暗示可作领域标准框架。
S2 计 129 引,抽查前 30 条引用语境:绝大多数只把它当'DR 领域综述/定义'的礼节性引用(如 FinDeepIndicator 用其 DR 定义,Interaction-finder 泛引'deep research workflows');static/dynamic workflow 这套术语未见被后续工作普遍采纳为标准分类。当'领域入口文献'的价值成立,当'标准分类学'的地位没有形成。
Benchmark 一章断言静态 QA 评测可被参数知识绕过、与 DR 报告生成目标错位。
这条批判可信且被后续证实:BrowseComp(OpenAI, 2025-04)的设计动机与之一致,DeepResearch Bench(2025-06,站内已收)正是按'端到端报告评测'思路补的缺——不过后者未被本综述收录。
与我们方向的关系
对课题组的定位是 autoresearch / deep-research 子方向的【入口地图】:开始接触 DR agent 时先读它的第 3 章分类学和第 6 章 benchmark 批判,建立'检索方式 × workflow × 调优方法'三轴坐标,再按坐标去读站内具体条目——工业系统对照 introducing-deep-research-openai,开源复现对照 langchain-open-deep-research / smolagents-open-deep-research / gpt-researcher,评测对照 deepresearch-bench。注意它的坐标停在 2025-09,之后的进展(如 tongyi-deepresearch-technical-report)要靠站内条目自行补齐;它漏掉的学术检索一支(OpenScholar/PaSa/PaperQA2)也在站内,读的时候把这两块补进它的地图。
两处内容与本组其他方向有交叉:'非参数持续学习'一节(CBR、AgentRxiv 共享 case bank、Alita 运行时扩展 MCP 工具)是 continual learning / RSI 视角下看 DR agent 的现成素材;路线图里 DAG 并行执行、RL 调度器、多 agent 端到端训练三条,可以当作选题时的 gap 清单——截至其成稿这些方向都还没有强 baseline。
阅读笔记
读 tex 源码(source/main.tex)比读 arXiv 页面方便,章节:§3 四条轴、§4 工业系统、§5(编号实为 Benchmarks)、§6 路线图。仓库 README 的三张大对比表(检索/工具/调优)信息密度高于正文,可当速查表,但记得数据截止 2025-09。'129 引'是 S2 2026-08 数据。
材料清单
TeX 源码已存档:Raw/deep-research-agents/source/
相关条目
同子模块 · 深度调研与文献
跨方向 · 同标签