项目
深度调研
★ 必读
GPT Researcher
GPT Researcher:最早、最流行的开源深度调研 agent
Assaf Elovic 及开源社区(500+ contributors) · 开源社区 (Assaf Elovic) · GitHub · 2023-07
一句话 2023 年 5 月启动的开源自主调研 agent(29.2k stars,2026 年 8 月仍在活跃维护),用 planner–executor 并行架构对任意问题生成 2000+ 词带引用的调研报告;在 CMU DeepResearchGym 基准上引用质量为全场最高(citation precision 89.1 / recall 94.3),但官网'全面第一'的宣传比论文实际结果说得更满。
这是什么 GPT Researcher 是 Assaf Elovic 于 2023 年 5 月开源的自主调研 agent,比 OpenAI Deep Research(2025 年 2 月)早了约一年半,README 自称'the first open deep research agent'基本成立。输入一个调研问题,它会自动规划子问题、并行搜索抓取网页、逐源摘要并追踪出处,最后聚合成一篇带引用的长报告(2000+ 词、20+ 来源),可导出 PDF/Word/Markdown。设计上明确引用了 Plan-and-Solve(2305.04091)和 RAG(2005.11401)两篇论文的思路,多 agent 工作流部分受 STORM(2402.14207)启发。
它的定位是'报告生成的 building block'而不是开箱即用的消费级产品:核心是一个 pip 包(GPTResearcher 类,conduct_research + write_report 两个调用),外面套了 FastAPI 后端、轻量 HTML 前端和 NextJS 生产前端。支持任意 LLM(OpenAI/Anthropic/本地模型,通过 OPENAI_BASE_URL 换端点)、22 种检索器(Tavily/Google/Bing/DuckDuckGo/arXiv/PubMed/Semantic Scholar/searx 等,见 gpt_researcher/retrievers/)、本地文档调研(PDF/Word/Excel/Markdown)以及 MCP 数据源混合检索。
2025 年初它加入了 Deep Research 递归模式(树状展开子主题,可配深度和广度),项目声称每次约 5 分钟、约 $0.4(o3-mini high reasoning)。仓库另有基于 LangGraph 的 multi_agents 流水线(researcher/editor/reviewer/revisor/writer 分工)和独立的 MCP server(gptr-mcp),可以把它接进 Claude Desktop 之类的宿主。Apache-2.0 协议,自托管和商用无门槛。
官方架构图:Task 先交给 Planner 生成研究子问题,Researcher 把每个 query 分发给并行的 execution agent 各自搜索抓取并摘要(图中三列彩色 query),Publisher 最后聚合成 PDF/Word/Markdown 报告。这个 planner–并行 executor–publisher 三段式是后来几乎所有 deep research 系统的原型。 机制与做法 Planner–Executor 并行架构
核心流程三段式:Planner agent 根据 query 先生成一个'任务定制 agent'(用 prompt 决定研究人设),再产出一组能共同覆盖该任务的研究子问题;每个子问题交给并行的 execution/crawler agent 去搜索、抓取、逐源摘要并记录出处;Publisher 最后把所有摘要过滤聚合成报告。并行化是它早期相对 AutoGPT 式串行 agent 的主要卖点——确定性更强、速度更快、不会在无限循环里打转。
代码上这套流程拆在 gpt_researcher/skills/ 里:researcher.py(检索执行)、context_manager.py(跨子问题的上下文压缩与去重)、curator.py(来源筛选)、writer.py(成稿)、deep_research.py(递归模式)。检索层是插件式的 retrievers/ 目录,scraper 支持 JS 渲染页面和 PDF。
DeepResearchGym 论文(2505.19253)Fig.3 人评双盲胜率矩阵:GPT-Researcher 对 OpenDeepSearch、HF-DeepSearch、Search-o1、Search-R1 的胜率全部是 100%。注意这张图只比了开源/学术系统——官网引用这个结果宣传'第一'时,没提 Perplexity 和 OpenAI 不在人评对比里,且自动指标上信息覆盖和报告质量其实是 Perplexity 领先。 Deep Research 递归模式
2025 年加入的 deep_research 是树状探索:每层对当前主题生成多个搜索方向(breadth),对有价值的分支递归下钻(depth),分支间并发执行,同时做跨分支的 context 管理避免重复。项目给的参考数字是每次约 5 分钟、$0.4(o3-mini high)。这两个数字是项目自报,没有第三方复测;第三方评测文章(digitalapplied,2026-08)也特别提醒官网首页'30-60 秒完成 deep research'和 README 的'5 分钟/$0.4'是两个不同的东西,预算要按后者算。
检索与数据源生态
retrievers/ 下有 22 个检索后端,除通用搜索(Tavily 默认、Google、Bing、Brave、DuckDuckGo、serper 等)外还有学术源(arxiv、pubmed_central、semantic_scholar、openalex),可以通过 RETRIEVER=tavily,mcp 做 web + MCP 混合检索——MCP 侧能接 GitHub 仓库、数据库、内部 API。本地文档模式(DOC_PATH)支持 PDF/纯文本/CSV/Excel/Markdown/PPT/Word,也支持本地+web 的 hybrid 调研。这个'任意 LLM × 任意检索器 × 本地文档'的配置矩阵是它作为自建流水线起点的最大价值。
评测与工程现状
仓库内置 evals/ 目录:simple_evals 改自 OpenAI SimpleQA 方法论,logs/ 里保留了 2025-02-22 的一次 100 题评测原始日志(gpt-4o,92 对 7 错 1 未答,accuracy 92.9%,平均 $0.096/题);另有 hallucination_eval。这些是自评,且只取了 SimpleQA 4326 题中的 100 题子集。
工程质量是它的软肋:2026 年中被指出 5 个 GitHub Actions workflow 没有一个跑 pytest(issue #1945),导致 v0.16.0 发布版因一个 import 顺序 bug 在 Python 3.14 以下完全不可 import(#1943);还有一批'静默降级'类 bug——搜索 snippet 被当成已抓取全文导致根本不抓网页(#1892、#1846)、ContextCompressor 快路径丢失来源 URL 导致报告引用 example.com(#1893)、空 context 时直接编造来源(#1572)。这些均已修复关闭,但说明这类长链路 agent 的失败模式往往是静默的,产出的报告表面看不出问题。
关键结果 GitHub 29,206 stars、Apache-2.0,创建于 2023-05-12,最近 push 2026-08-27,三年多持续活跃维护,是同类开源项目中生命力最强的(对比:Stanford STORM 自 2025-09 后基本停更)。 CMU DeepResearchGym(arXiv 2505.19253,Researchy Questions 测试集 top 1000 题、LLM-as-judge + 210 题人评):GPT-Researcher citation precision 89.11 / recall 94.29(用自带商业搜索 API 时),是唯一 precision 和 recall 双双超过 85% 的系统;人评双盲对比中对 OpenDeepSearch、HF-DeepSearch、Search-o1、Search-R1 四个开源/学术系统胜率均为 100%。 但同一张表里,信息覆盖(KPR)是 Perplexity sonar-deepsearch 领先(72.50 vs 60.61),报告质量 Clarity/Insight 也是 Perplexity 领先(89.50/89.26 vs 86.37/81.52);GPT-Researcher 只在引用质量维度第一。 自评 SimpleQA(100 题子集,gpt-4o):accuracy 92.9%,F1 92.5%,平均每题 $0.096,原始日志在 evals/simple_evals/logs/。 Deep Research 递归模式项目自报约 5 分钟/$0.4 每次(o3-mini high reasoning),无第三方复测。 22 个检索后端 + MCP 混合检索 + 本地文档(PDF/Word/Excel 等),LLM 侧任意 OpenAI 兼容端点即可,这个可配置面是所有开源同类里最宽的。 实证核查
有水分 工具本身真实、活跃、被广泛使用,在第三方基准上引用质量确实全场第一;但官网把'引用质量第一'夸大成了'引用质量、报告质量、信息覆盖全部第一、击败 Perplexity 和 OpenAI',与它引用的论文原表直接矛盾,且工程质量(CI 不跑测试、发过完全不可 import 的版本)配不上它的流行度。
README:'GPT Researcher the first open deep research agent'。
基本成立。GitHub API 显示仓库创建于 2023-05-12,首个 PyPI 版本 2023 年 7 月,比 OpenAI Deep Research(2025-02)早约 20 个月;第三方评测(digitalapplied.com 2026-08 的四系统横评)也确认'它先于它如今被拿来对比的那些厂商 deep research 模式'。
官网 gptr.dev:'Ranked #1 in Academic Benchmarks——CMU DeepResearchGym 上超过 Perplexity、OpenAI、OpenDeepSearch、HuggingFace,在引用质量、报告质量、信息覆盖上均取得最高分'。
与论文原文不符。DeepResearchGym(arXiv 2505.19253)Table 2:信息覆盖 KPR 是 Perplexity sonar-deepsearch 第一(72.50 vs GPT-Researcher 60.61),报告质量 Clarity/Insight 也是 Perplexity 第一(89.50/89.26 vs 86.37/81.52);GPT-Researcher 真正第一的只有引用质量(precision 89.11,唯一 P/R 双 >85% 的系统)。且被比下去的'OpenAI'是 gpt4-search-preview,不是 o3 版 Deep Research 产品;人评 100% 胜率那张图(论文 Fig.3)只包含开源/学术系统,不含 Perplexity 和 OpenAI。
README:'detailed, factual, and unbiased research reports with citations',通过多源聚合降低幻觉。
引用质量确有基准背书,但'factual'有已知反例:issue #1572(closed)报告在检索不到相关 context 时会整段编造看似真实的来源和内容;#1893(closed)ContextCompressor 快路径丢 URL 导致报告引用 https://example.com;#1892/#1846(closed)搜索 snippet 被误当已抓取全文、网页根本没抓。均已修复,但都属于'报告表面正常、实际根基是空的'的静默失败。
项目形象:29k stars 的成熟基础设施级项目。
工程纪律与流行度不匹配:issue #1945(closed)证实全部 5 个 CI workflow 都不跑 pytest(grep 可验证),tests/ 目录形同虚设;后果是 v0.16.0 因 import 顺序 bug 以'完全不可 import'的状态发上了 PyPI(#1943)。选型时应按'需要自己兜底测试的框架'对待,不能当稳定依赖。
Deep Research 模式:'~5 分钟、~$0.4 每次';SimpleQA 92.9% accuracy。
两者都是自报数字。SimpleQA 有仓库内原始日志(evals/simple_evals/logs/,2025-02-22,gpt-4o,100/4326 题子集,总花费 $9.60)可查证过程,但没有第三方独立复跑;$0.4/次的成本数字未见任何第三方复测,且与官网首页'30-60 秒完成 deep research'的宣传口径不一致(后者说的是普通模式)。
与我们方向的关系 对自主调研(autoresearch)方向,这是搭自有 deep research 流水线的默认起点:planner→并行 executor→publisher 的三段式已经成为这一类系统的标准形态,后来的 LangChain Open Deep Research、各家 deep research 产品在架构上并无本质偏离。它的 retrievers 插件层(22 个后端,含 arXiv/PubMed/Semantic Scholar 学术源)和 MCP 混合检索对我们接自有文献库、内部数据源特别有参考价值;evals/ 目录里 SimpleQA 式自评 + hallucination eval 的做法也可以直接抄。
两个值得记住的教训:一是 DeepResearchGym 的结果说明'引用质量'和'信息覆盖/洞察力'是可以脱钩的两个维度——GPT-Researcher 引用最扎实但覆盖度输给 Perplexity,评自己的系统时两个维度都要测;二是它的 bug 史(snippet 当全文、引用丢 URL、空 context 编造来源)几乎枚举了调研 agent 的典型静默失败模式,自建流水线时这几处都该加断言和回归测试。
阅读笔记 工程上采坑提示:pip 装的发布版质量波动大(出过不可 import 的 0.16.0),生产用建议 pin 到验证过的 commit;CI 不跑测试意味着升级前要自己跑 tests/。官网宣传口径(30-60 秒、benchmark 全面第一)一律以论文和 README 为准。评测对比时注意它在 DeepResearchGym 里用的是默认配置 + 自带商业搜索 API,换 retriever 数字会变(DRGym API 下 citation P/R 降为 85.36/90.82)。
材料清单 同类条目