博客
深度调研
★ 必读
Introducing Deep Research (OpenAI)
OpenAI Deep Research:把多步网络调研做成产品
OpenAI · OpenAI · OpenAI blog · 2025-02
一句话OpenAI 2025 年 2 月发布的 agent 产品:给一个问题,基于端到端 RL 训练的 o3 变体自主浏览网页 5-30 分钟、综合数百个来源,产出带引用的分析报告;HLE 26.6%(此前最好的 o3-mini high 为 13.0%)、GAIA validation 平均 72.57%(cons@64),定义了 deep research 这一任务范式。
这是什么
这是一篇产品发布博客,不是论文,但它是 autoresearch 方向绕不开的参照系:在此之前,'AI 检索'基本停留在单轮 RAG 或 perplexity 式的搜索摘要;Deep Research 第一次把'多步、长时间(5-30 分钟)、有回溯的网络调研 + 产出带逐句引用的长报告'做成了大规模商用产品。之后 Gemini Deep Research、Grok DeepSearch、以及一大批开源复现(HF open-deep-research、GPT Researcher 等)和评测基准(DeepResearch Bench、ResearchQA 等)都直接以它为对标。
产品形态:在 ChatGPT 里选 deep research 模式提问,可附带文件;模型自主搜索、打开网页、读 PDF/图片、用 python 工具做分析画图,途中根据看到的信息调整计划,最后在对话里给出一份研究报告,侧边栏展示步骤摘要和引用来源。发布时仅对 Pro 用户开放(每月 100 次),2025 年 4 月起用 o4-mini 轻量版把额度扩到 Plus 25 次/月、免费用户 5 次/月。
OpenAI 把它定位为'迈向 AGI 的重要一步',理由是'综合已有知识是创造新知识的前提'——这也是本站 autoresearch 方向关心它的原因:它是'AI 做研究'流水线中文献调研环节的工业级标杆。
Humanity's Last Exam 准确率对比(依官方博客表格重绘)。Deep Research 26.6% 约为此前最好成绩 o3-mini (high) 13.0% 的两倍;但注意只有它带 browsing + python 工具,其余模型均为裸跑,带星号的模型仅测文本子集——对比并不对等。机制与做法
端到端 RL,而不是工作流编排
官方给的技术信息只有一段,但很关键:模型是 o3 的一个变体,用'与 o1 相同的 reinforcement learning 方法',在'跨领域的困难浏览与推理任务'上做端到端训练,训练任务要求真实使用 browser 和 python 工具。也就是说,搜索什么、点开哪个链接、何时回溯、何时写结论,都是模型在 RL 中学出来的单一 policy,而不是像同期大多数开源方案那样由人手写的 plan-search-summarize 工作流。这是它与 24 小时后出现的 HF 复现品之间约 12 个百分点 GAIA 差距(67.36 vs 55.15,pass@1)的主要解释。
官方展示了一条重要曲线:pass rate 随允许的最大 tool calls 数量单调上升——'浏览和思考得越多,做得越好'。这条 test-time scaling 规律后来被 WebSailor、DeepResearcher 等一系列开源 RL 工作反复验证。
GAIA validation set 各难度级别成绩(依官方博客表格重绘)。越难的 Level 3 提升越明显(42.3 → 58.0);头条数字 72.57% 是 cons@64(64 次采样多数投票),单次 pass@1 为 67.36%,且 OpenAI 从未提交官方 test set 榜单。战绩:HLE 与 GAIA
Humanity's Last Exam(3000+ 道百余学科的专家级题)上得分 26.6%,而当时最好的 o3-mini (high) 只有 13.0%、o1 只有 9.1%。要注意官方脚注:deep research 是带 browsing + python 工具跑的,对比的其他模型全部裸跑,部分还只测了文本子集——这更像'带工具的 agent vs 裸模型'的对比,而非同条件模型对比。
GAIA(真实世界助手任务,分三级难度)上 pass@1 平均 67.36%、cons@64(64 次采样取多数)平均 72.57%,超过当时榜单最好成绩 63.64%;越难的 Level 3 提升越大(42.31 → 58.03)。
内部专家级任务评测里,官方给了一个有意思的观察:任务的预估经济价值比预估人类耗时更能预测模型通过率——模型觉得难的事和人类觉得费时的事并不重合。
官方承认的局限
博客的 Limitations 一节写得比较坦率:会幻觉事实、会做错误推断(声称比现有 ChatGPT 模型频率低,但依据是无法核查的内部评测);难以区分权威信息和传闻;置信度校准差,不会恰当表达不确定性;报告和引用可能有格式错误。这些问题在后来第三方实测中都被证实存在(见核查一节)。
后续演化
这个页面本身像一部编年史:2025-02-25 全量开放 Plus;2025-04-24 推出 o4-mini 轻量版分流额度;2025-07-17 并入 ChatGPT agent(带可视化浏览器);2026-02-10 支持连接任意 MCP/应用、限定可信站点检索、实时跟踪与中途插话。可以看到产品方向是从'一次性长报告'走向'可控、可接内部数据源的通用研究 agent'。
关键结果
- HLE 26.6%,是当时公开最好成绩的两倍(o3-mini high 13.0%、o1 9.1%);官方称相比 o1 提升最大的领域是化学、人文社科和数学。
- GAIA validation:pass@1 平均 67.36%(L1 74.29 / L2 69.06 / L3 47.6),cons@64 平均 72.57%,超过此前 SOTA 的 63.64%。
- Pass rate 随最大 tool calls 数单调上升——推理时多搜多想直接换来更高的成功率,是 deep research 类任务 test-time scaling 的早期证据。
- 单次任务运行 5-30 分钟、'compute intensive',发布时只给 Pro 用户每月 100 次——可见单次调研的推理成本相当高。
- 任务的预估经济价值与通过率的相关性高于预估人类耗时与通过率的相关性:模型的难易观和人类不同。
- 范式被极快复现:发布约 24 小时后 HuggingFace 用 smolagents + GPT-4o 做的 open-deep-research 在 GAIA validation 达到 55.15%,说明相当一部分能力来自'强模型 + 搜索/浏览工具 + agent 框架'本身,端到端 RL 带来的是最后十几个点的差距。
实证核查
有水分产品真实、开创了范式且被大量复现,核心能力成立;但 GAIA '登顶外部榜单'的说法有水分(validation set + cons@64,从未提交官方 test 榜),官方页面自带的示例报告就被第三方抓到关键数字与引用源相反,'引用清晰易核验'的卖点打折。
官方称在 GAIA 上'reaches a new state of the art, topping the external leaderboard',头条数字 72.57%。
三处水分:(1) 72.57% 是 cons@64(64 次采样多数投票),pass@1 只有 67.36%;(2) 成绩是在 GAIA validation set 上自测的,OpenAI 从未向 HF 官方 test set 榜单提交(GAIA leaderboard 页面后来直接关闭了 validation 榜,注明 'no longer informative';多方指出 OpenAI 和 Manus 报的都是 validation 分,见 huggingface.co/spaces/gaia-benchmark/leaderboard 及 LinkedIn 上 S. Derhy 2025-03 的核查帖);(3) 官方脚注自己承认 GAIA 真值答案在网上广泛泄漏,只能靠屏蔽部分网站缓解,污染无法排除。
'Every output is fully documented, with clear citations…making it easy to reference and verify the information'——引用清晰、易于核验是核心卖点。
Benedict Evans(2025-02-17,ben-evans.com/benedictevans/2025/2/17/the-deep-research-problem)只核查了官方页面自带的示例报告(智能手机市场表)中一个数:日本 iOS/Android 份额。Deep Research 写 69% iOS / 31% Android,而它引用的源头(Statista 背后的 Kantar)给的数字几乎相反(63% Android / 36% iOS),日本监管机构调查为 47% iOS;且把 Statcounter(流量份额)当'adoption'本身就是选源错误。他的结论:'如果表里每个数都要我核查一遍,它就没帮我省时间'。该文在 HN 上有 302 分讨论(news.ycombinator.com/item?id=43133207)。注意这是 OpenAI 自己挑的宣传样例,不是刁钻的对抗测试。
HLE 26.6%,对比表中把 GPT-4o(3.3)、Claude 3.5 Sonnet(4.3)、DeepSeek-R1(9.4)等一并列出,呈现为断层领先。
官方表格脚注自己写明:deep research 带 browsing + python 工具,对比的所有其他模型均为无工具裸跑,DeepSeek-R1、o3-mini 还只测了文本子集。HLE 是可搜索到部分答案线索的知识型考试,带联网工具与不带联网的模型直接比,26.6% vs 3.3% 的对比幅度有相当部分来自工具而非模型本身。数字本身无第三方复核渠道(闭源 + 内部评测)。
端到端 RL 训练是其核心技术贡献,区别于手写工作流。
训练细节完全未公开(无论文、无 system card 级别的训练披露),无法直接核查;但可以做间接对照:HuggingFace 团队在发布后约 24 小时内用 smolagents(GPT-4o + 搜索 + 浏览工具,纯 prompt 工程无 RL)复现出 open-deep-research,GAIA validation 55.15%(huggingface.co/blog/open-deep-research;Ars Technica 2025-02-05 报道)。即框架+工具就能拿到大部分分数,OpenAI 的 RL 训练贡献了 55→67(pass@1)这一段。后来 DeepResearcher、WebSailor 等开源 RL 工作证实了'RL 训练的浏览 agent 优于 prompt 工作流'这一方向判断成立。
幻觉率'notably lower than existing ChatGPT models, according to internal evaluations'。
依据是内部评测,无法核查。第三方实测幻觉确实存在且不罕见:除 Ben Evans 外,arXiv 2604.03173 的引用幻觉测量给 openai-deepresearch 3.5% 的 hallucinated reference 率外加 10.1% 无法解析的引用;OpenAI 自己 2025-02-25 发布的 system card(simonwillison.net/2025/Feb/25/deep-research-system-card 有摘要)也保留了幻觉与说服性错误的风险描述。'比裸聊天模型少'大概率成立,'低到可以不核查'不成立。
与我们方向的关系
对本组 autoresearch 方向,这篇博客的价值在于定义了任务本身:输入一个研究问题,输出一份带引用的长报告,中间是长 horizon 的搜索-阅读-回溯循环。之后所有开源 deep research 系统(open-deep-research、GPT Researcher、DeepResearcher 等)和评测(DeepResearch Bench、GAIA 之后的各类 agentic search 基准)都在这个框架里做事。读它时最值得记住的三个技术信号:端到端 RL 优于手写工作流(但差距是十几个点而非数量级)、tool calls 越多成绩越好(test-time scaling 在 agent 任务上成立)、以及官方都承认的短板——来源可信度判别与置信度校准,这两点至今仍是 deep research 系统的主要失效模式,也是可以做文章的研究缝隙。
另一个可借鉴的是核查方法论本身:评它的战绩要问三个问题——validation 还是 test?pass@1 还是 cons@k?带不带工具的对比是否对等?这三个问题同样适用于审视之后所有 deep research 类工作的宣传数字。
阅读笔记
博客无个人署名、无论文、无代码,所有内部评测数字均不可复核,verdict 主要靠第三方旁证。页面本身经历了多轮更新(2025-02 到 2026-02),引用它的数字时注意区分首发内容和后续追加。GAIA 三级难度:L1 约需 5 步内工具调用,L3 需要任意长的行动序列;官方 cons@64 只在 GAIA 上报了,HLE 的 26.6% 未说明采样次数。
材料清单
同类条目