← 返回资料站  /  AutoResearch
博客 深度调研 ★ 必读

Introducing Deep Research (OpenAI)

OpenAI Deep Research:把多步网络调研做成产品
一句话OpenAI 2025 年 2 月发布的 agent 产品:给一个问题,基于端到端 RL 训练的 o3 变体自主浏览网页 5-30 分钟、综合数百个来源,产出带引用的分析报告;HLE 26.6%(此前最好的 o3-mini high 为 13.0%)、GAIA validation 平均 72.57%(cons@64),定义了 deep research 这一任务范式。

这是什么

这是一篇产品发布博客,不是论文,但它是 autoresearch 方向绕不开的参照系:在此之前,'AI 检索'基本停留在单轮 RAG 或 perplexity 式的搜索摘要;Deep Research 第一次把'多步、长时间(5-30 分钟)、有回溯的网络调研 + 产出带逐句引用的长报告'做成了大规模商用产品。之后 Gemini Deep Research、Grok DeepSearch、以及一大批开源复现(HF open-deep-research、GPT Researcher 等)和评测基准(DeepResearch Bench、ResearchQA 等)都直接以它为对标。

产品形态:在 ChatGPT 里选 deep research 模式提问,可附带文件;模型自主搜索、打开网页、读 PDF/图片、用 python 工具做分析画图,途中根据看到的信息调整计划,最后在对话里给出一份研究报告,侧边栏展示步骤摘要和引用来源。发布时仅对 Pro 用户开放(每月 100 次),2025 年 4 月起用 o4-mini 轻量版把额度扩到 Plus 25 次/月、免费用户 5 次/月。

OpenAI 把它定位为'迈向 AGI 的重要一步',理由是'综合已有知识是创造新知识的前提'——这也是本站 autoresearch 方向关心它的原因:它是'AI 做研究'流水线中文献调研环节的工业级标杆。

Humanity's Last Exam 准确率对比(依官方博客表格重绘)。Deep Research 26.6% 约为此前最好成绩 o3-mini (high) 13.0% 的两倍;但注意只有它带 browsing + python 工具,其余模型均为裸跑,带星号的模型仅测文本子集——对比并不对等。
Humanity's Last Exam 准确率对比(依官方博客表格重绘)。Deep Research 26.6% 约为此前最好成绩 o3-mini (high) 13.0% 的两倍;但注意只有它带 browsing + python 工具,其余模型均为裸跑,带星号的模型仅测文本子集——对比并不对等。

机制与做法

端到端 RL,而不是工作流编排

官方给的技术信息只有一段,但很关键:模型是 o3 的一个变体,用'与 o1 相同的 reinforcement learning 方法',在'跨领域的困难浏览与推理任务'上做端到端训练,训练任务要求真实使用 browser 和 python 工具。也就是说,搜索什么、点开哪个链接、何时回溯、何时写结论,都是模型在 RL 中学出来的单一 policy,而不是像同期大多数开源方案那样由人手写的 plan-search-summarize 工作流。这是它与 24 小时后出现的 HF 复现品之间约 12 个百分点 GAIA 差距(67.36 vs 55.15,pass@1)的主要解释。

官方展示了一条重要曲线:pass rate 随允许的最大 tool calls 数量单调上升——'浏览和思考得越多,做得越好'。这条 test-time scaling 规律后来被 WebSailor、DeepResearcher 等一系列开源 RL 工作反复验证。

GAIA validation set 各难度级别成绩(依官方博客表格重绘)。越难的 Level 3 提升越明显(42.3 → 58.0);头条数字 72.57% 是 cons@64(64 次采样多数投票),单次 pass@1 为 67.36%,且 OpenAI 从未提交官方 test set 榜单。
GAIA validation set 各难度级别成绩(依官方博客表格重绘)。越难的 Level 3 提升越明显(42.3 → 58.0);头条数字 72.57% 是 cons@64(64 次采样多数投票),单次 pass@1 为 67.36%,且 OpenAI 从未提交官方 test set 榜单。

战绩:HLE 与 GAIA

Humanity's Last Exam(3000+ 道百余学科的专家级题)上得分 26.6%,而当时最好的 o3-mini (high) 只有 13.0%、o1 只有 9.1%。要注意官方脚注:deep research 是带 browsing + python 工具跑的,对比的其他模型全部裸跑,部分还只测了文本子集——这更像'带工具的 agent vs 裸模型'的对比,而非同条件模型对比。

GAIA(真实世界助手任务,分三级难度)上 pass@1 平均 67.36%、cons@64(64 次采样取多数)平均 72.57%,超过当时榜单最好成绩 63.64%;越难的 Level 3 提升越大(42.31 → 58.03)。

内部专家级任务评测里,官方给了一个有意思的观察:任务的预估经济价值比预估人类耗时更能预测模型通过率——模型觉得难的事和人类觉得费时的事并不重合。

官方承认的局限

博客的 Limitations 一节写得比较坦率:会幻觉事实、会做错误推断(声称比现有 ChatGPT 模型频率低,但依据是无法核查的内部评测);难以区分权威信息和传闻;置信度校准差,不会恰当表达不确定性;报告和引用可能有格式错误。这些问题在后来第三方实测中都被证实存在(见核查一节)。

后续演化

这个页面本身像一部编年史:2025-02-25 全量开放 Plus;2025-04-24 推出 o4-mini 轻量版分流额度;2025-07-17 并入 ChatGPT agent(带可视化浏览器);2026-02-10 支持连接任意 MCP/应用、限定可信站点检索、实时跟踪与中途插话。可以看到产品方向是从'一次性长报告'走向'可控、可接内部数据源的通用研究 agent'。

关键结果

实证核查

有水分产品真实、开创了范式且被大量复现,核心能力成立;但 GAIA '登顶外部榜单'的说法有水分(validation set + cons@64,从未提交官方 test 榜),官方页面自带的示例报告就被第三方抓到关键数字与引用源相反,'引用清晰易核验'的卖点打折。
官方称在 GAIA 上'reaches a new state of the art, topping the external leaderboard',头条数字 72.57%。
三处水分:(1) 72.57% 是 cons@64(64 次采样多数投票),pass@1 只有 67.36%;(2) 成绩是在 GAIA validation set 上自测的,OpenAI 从未向 HF 官方 test set 榜单提交(GAIA leaderboard 页面后来直接关闭了 validation 榜,注明 'no longer informative';多方指出 OpenAI 和 Manus 报的都是 validation 分,见 huggingface.co/spaces/gaia-benchmark/leaderboard 及 LinkedIn 上 S. Derhy 2025-03 的核查帖);(3) 官方脚注自己承认 GAIA 真值答案在网上广泛泄漏,只能靠屏蔽部分网站缓解,污染无法排除。
'Every output is fully documented, with clear citations…making it easy to reference and verify the information'——引用清晰、易于核验是核心卖点。
Benedict Evans(2025-02-17,ben-evans.com/benedictevans/2025/2/17/the-deep-research-problem)只核查了官方页面自带的示例报告(智能手机市场表)中一个数:日本 iOS/Android 份额。Deep Research 写 69% iOS / 31% Android,而它引用的源头(Statista 背后的 Kantar)给的数字几乎相反(63% Android / 36% iOS),日本监管机构调查为 47% iOS;且把 Statcounter(流量份额)当'adoption'本身就是选源错误。他的结论:'如果表里每个数都要我核查一遍,它就没帮我省时间'。该文在 HN 上有 302 分讨论(news.ycombinator.com/item?id=43133207)。注意这是 OpenAI 自己挑的宣传样例,不是刁钻的对抗测试。
HLE 26.6%,对比表中把 GPT-4o(3.3)、Claude 3.5 Sonnet(4.3)、DeepSeek-R1(9.4)等一并列出,呈现为断层领先。
官方表格脚注自己写明:deep research 带 browsing + python 工具,对比的所有其他模型均为无工具裸跑,DeepSeek-R1、o3-mini 还只测了文本子集。HLE 是可搜索到部分答案线索的知识型考试,带联网工具与不带联网的模型直接比,26.6% vs 3.3% 的对比幅度有相当部分来自工具而非模型本身。数字本身无第三方复核渠道(闭源 + 内部评测)。
端到端 RL 训练是其核心技术贡献,区别于手写工作流。
训练细节完全未公开(无论文、无 system card 级别的训练披露),无法直接核查;但可以做间接对照:HuggingFace 团队在发布后约 24 小时内用 smolagents(GPT-4o + 搜索 + 浏览工具,纯 prompt 工程无 RL)复现出 open-deep-research,GAIA validation 55.15%(huggingface.co/blog/open-deep-research;Ars Technica 2025-02-05 报道)。即框架+工具就能拿到大部分分数,OpenAI 的 RL 训练贡献了 55→67(pass@1)这一段。后来 DeepResearcher、WebSailor 等开源 RL 工作证实了'RL 训练的浏览 agent 优于 prompt 工作流'这一方向判断成立。
幻觉率'notably lower than existing ChatGPT models, according to internal evaluations'。
依据是内部评测,无法核查。第三方实测幻觉确实存在且不罕见:除 Ben Evans 外,arXiv 2604.03173 的引用幻觉测量给 openai-deepresearch 3.5% 的 hallucinated reference 率外加 10.1% 无法解析的引用;OpenAI 自己 2025-02-25 发布的 system card(simonwillison.net/2025/Feb/25/deep-research-system-card 有摘要)也保留了幻觉与说服性错误的风险描述。'比裸聊天模型少'大概率成立,'低到可以不核查'不成立。

与我们方向的关系

对本组 autoresearch 方向,这篇博客的价值在于定义了任务本身:输入一个研究问题,输出一份带引用的长报告,中间是长 horizon 的搜索-阅读-回溯循环。之后所有开源 deep research 系统(open-deep-research、GPT Researcher、DeepResearcher 等)和评测(DeepResearch Bench、GAIA 之后的各类 agentic search 基准)都在这个框架里做事。读它时最值得记住的三个技术信号:端到端 RL 优于手写工作流(但差距是十几个点而非数量级)、tool calls 越多成绩越好(test-time scaling 在 agent 任务上成立)、以及官方都承认的短板——来源可信度判别与置信度校准,这两点至今仍是 deep research 系统的主要失效模式,也是可以做文章的研究缝隙。

另一个可借鉴的是核查方法论本身:评它的战绩要问三个问题——validation 还是 test?pass@1 还是 cons@k?带不带工具的对比是否对等?这三个问题同样适用于审视之后所有 deep research 类工作的宣传数字。

阅读笔记

博客无个人署名、无论文、无代码,所有内部评测数字均不可复核,verdict 主要靠第三方旁证。页面本身经历了多轮更新(2025-02 到 2026-02),引用它的数字时注意区分首发内容和后续追加。GAIA 三级难度:L1 约需 5 步内工具调用,L3 需要任意长的行动序列;官方 cons@64 只在 GAIA 上报了,HLE 的 26.6% 未说明采样次数。

材料清单

HF 开源复现huggingface.co/blog/open-deep-research
发布约 24 小时后的 smolagents 复现,GAIA validation 55.15%,代码开源,是理解'框架贡献 vs RL 贡献'的最好对照组
第三方核查www.ben-evans.com/benedictevans/2025/2/17/the-deep-research-problem
Ben Evans 对官方示例报告的逐数核查,抓到引用源与结论相反的实锤;HN 讨论 302 分
System Cardopenai.com/index/deep-research-system-card/
2025-02-25 随 Plus 开放发布的安全与局限性文档
GAIA 榜单huggingface.co/spaces/gaia-benchmark/leaderboard
官方 test set 榜单;validation 榜已因'no longer informative'关闭,OpenAI 的成绩不在 test 榜上

同类条目