← 返回资料站  /  AutoResearch
基准 评测基准

DeepResearch Bench: A Comprehensive Benchmark for Deep Research Agents

DeepResearch Bench:深度研究 Agent 的百题博士级评测
一句话USTC 团队做的 deep research agent 基准:100 个博士级调研任务(50 中文 + 50 英文,22 个领域),配 RACE(报告质量)+ FACT(引用忠实度)两套自动评估;RACE 与人类判断的 pairwise 一致率 71.3%,略高于人类专家互评的 68.4%。排行榜维护至今(2026-08),是横向比较各家 deep research 产品最常被引用的基准之一。

这是什么

2025 年上半年 OpenAI、Gemini 相继推出 Deep Research 产品后,'给一个调研问题、产出带引用的长报告'成了 LLM agent 最热的落地形态,但当时没有像样的评测:用 GAIA/HLE 这类 QA 基准测不出报告写作能力,直接 LLM-as-judge 又没人验证过与人类判断的一致性。DeepResearch Bench 是第一个针对这个空档的系统性基准。

任务集的来源比较讲究:作者先分析了 96,147 条真实的联网搜索类用户 query,按 WebOrganizer 分类法归入 22 个主题域得到真实需求分布,再按这个分布邀请博士级专家(或 5 年以上从业者)出题、人工筛选,最终得到 100 个任务(中英各 50)。评测对象分两类:Deep Research Agent 产品(OpenAI DR、Gemini-2.5-Pro DR、Perplexity DR、Grok Deeper Search 等)和'LLM + 搜索工具'的普通配置。

这是一个持续维护的活基准:2025-07 起与 AGI-Eval 合作、HF 上挂 leaderboard 接受社区投稿;2026-02 同一实验室发布了侧重点不同的续作 DeepResearch Bench II(9,430 条细粒度二元 rubric);2026-05 因 Gemini-2.5-Pro 停服,官方评估器切换为 GPT-5.5 并重建排行榜。

整体框架图。上:从 96k 真实 query 提炼 22 域分布、由 100+ 领域专家出题;中:RACE 流程——judge 针对任务动态生成带权重的评分准则(如 Comprehensiveness 0.35 / Insight 0.2 / Instruction-Following 0.3 / Readability 0.15),目标报告与参照报告逐条准则对比打分,最终分 = ST/(ST+SR);下:FACT 流程——抽取 statement-URL 对、去重、抓取网页后逐对判定 support / not support。
整体框架图。上:从 96k 真实 query 提炼 22 域分布、由 100+ 领域专家出题;中:RACE 流程——judge 针对任务动态生成带权重的评分准则(如 Comprehensiveness 0.35 / Insight 0.2 / Instruction-Following 0.3 / Readability 0.15),目标报告与参照报告逐条准则对比打分,最终分 = ST/(ST+SR);下:FACT 流程——抽取 statement-URL 对、去重、抓取网页后逐对判定 support / not support。

机制与做法

RACE:参照对比 + 动态准则的报告质量评估

核心思路是解决两个已知问题:固定 rubric 无法适配 22 个领域的任务差异;单独给报告打分时 judge 倾向一律给高分、区分度不足。做法分三步:(1) Judge LLM 针对每个任务在 Comprehensiveness / Insight-Depth / Instruction-Following / Readability 四个固定维度下动态生成任务专属的评分准则和权重(多次采样取平均);(2) 把目标报告和一份高质量参照报告(reference)放在一起逐条准则对比打分;(3) 最终分数取相对值 S_tgt/(S_tgt+S_ref),所以榜上 45 vs 50 的差距对应人类评分里可能是 90 vs 100——作者明确说该看排名和相对差距,不要看绝对值。

人类一致性验证用 50 个中文任务 × 4 个 agent 的报告,70 多名有硕士学位的领域标注者每任务 3 人打分。RACE(Full) 的 Pairwise Agreement Rate 达 71.33%,超过人类专家互评一致率 68.44%;而 vanilla prompt 直接打分只有 58.89%。消融显示 reference 对比是最关键的组件(去掉后 PAR 掉到 66.56%)。Judge 选型上 Gemini-2.5-Pro 效果最好且单条查询约 $0.13。

四家 DRA 产品的主结果。左:RACE 五个维度,Gemini-2.5-Pro DR 总分 48.9 领先,OpenAI DR 47.0 紧随且在 Instruction-Following 上反超;右:FACT 两指标的错位——Perplexity 引用准确率最高(90.2%)但有效引用只有 31.3 条,Gemini 有效引用 111.2 条断层领先但准确率 81.4%,'检索广度'与'引用精度'是两种能力。
四家 DRA 产品的主结果。左:RACE 五个维度,Gemini-2.5-Pro DR 总分 48.9 领先,OpenAI DR 47.0 紧随且在 Instruction-Following 上反超;右:FACT 两指标的错位——Perplexity 引用准确率最高(90.2%)但有效引用只有 31.3 条,Gemini 有效引用 111.2 条断层领先但准确率 81.4%,'检索广度'与'引用精度'是两种能力。

FACT:逐条核查引用是否真的支持陈述

流程:Judge LLM 从报告里抽取 statement-URL 对并去重,然后用 Jina Reader 抓取每个 URL 的正文,让 judge 判断网页内容是否支持该陈述,输出 support / not support。汇总成两个指标:Citation Accuracy(引用准确率)和 Effective Citations(每任务平均有效引用数,衡量'检索到多少真材实料')。判 support 的 judge(Gemini-2.5-Flash)在 100 对抽样上与人类判断的一致率为 support 96% / not support 92%。

这两个指标刻意分开是有信息量的:Gemini-2.5-Pro DR 每报告平均 111.2 条有效引用(断层领先)但准确率只有 81.4%,Perplexity DR 准确率 90.2% 但只有 31.3 条有效引用——'广撒网'和'引得准'是两种不同的能力剖面。

评估器换代:活基准的代价

2026-05,因 Google 宣布 Gemini-2.5-Pro 于 6 月停服,团队在人工标注子集(50 任务 × 4 agent)上重新对比了三个候选 judge,GPT-5.5 以 71.82 的人类一致性总分胜出(人类互评基线 68.78),被定为新 RACE 评估器(FACT 用 GPT-5.4-mini)。旧评估器下的分数与新分数不可直接比较,官方做法是双榜并行一个月后全量迁移、重评原论文结果。这暴露了 LLM-as-judge 基准的结构性软肋:榜单寿命受制于 judge 模型的商业寿命,分数没有跨期可比性。

关键结果

实证核查

扎实数据与声称一致、代码可跑、排行榜真实运营且被大量第三方使用;但 judge 换代导致分数跨期不可比,人类标注子集未公开,复现细节有一些未解的对账问题。
论文声称基准包含 100 个博士级任务,覆盖 22 个领域,中英各半。
已验证:拉取 repo 的 data/prompt_data/query.jsonl 统计,恰好 100 条、language 字段 zh 50 / en 50、topic 去重 22 个。reference.jsonl(RACE 参照报告)和示例输出 claude-3-7-sonnet-latest.jsonl 也在 repo 中,评测管线(run_benchmark.sh + deepresearch_bench_race.py)可直接运行。
RACE 与人类判断高度一致(PAR 71.33% 超过人类互评 68.44%)。
数字本身可信但有两点折扣:(1) 验证只在 50 个中文任务 × 4 个 agent 上做,英文一半没有人类一致性验证,作者在 Limitations 里自己承认样本量有限;(2) 用于验证的人工标注数据集未公开,issue #30(open)专门请求公开该数据集,至今未放出,第三方无法独立复核一致性数字。另外 FAP/FAS 只有 60.2/59.1,逐任务级别的相关性远不如全局 Pearson 好看。
排行榜持续维护,分数可比。
维护是真的(2026-05 仍在更新,README 记录了完整的评估器迁移计划),但 2026-06 起 judge 从 Gemini-2.5-Pro 换成 GPT-5.5,官方明确旧分数需重评迁移、两套评估器的分数不可直接比较(issue #28、#46 讨论了 judge 停服问题)。引用该榜数字时必须注明是哪个评估器时代的分数。
repo 提供的示例结果可复现论文/榜单数字。
有未解的对账问题:issue #22(open)指出 repo 内 results/race/claude-3-7-sonnet-latest/race_result.txt 的数值与 GitHub 主页、HF 榜单、论文三处均对不上,且 0-1 与 0-100 量纲混用无说明;此前 issue #7 也问过同样问题没有明确结论。此外 FACT 依赖 Jina Reader 抓网页,遇到鉴权页面(如微信公众号)基本抓不到(issue #29,open),对引用中文封闭生态来源的 agent,Citation Accuracy 会被系统性低估。

与我们方向的关系

对做 autoresearch 的组来说这是绕不开的基准:如果我们要做 deep research agent 或报告生成系统,DRB 是目前社区默认的横向比较标尺(投稿门槛低,发邮件 + 提供 GPT-5.5 key 即可上榜)。跑一遍成本也可控:100 个任务,RACE judge 约 $0.13/query 量级。

方法论上有两点可以直接借鉴:(1) RACE 的'动态生成准则 + 参照报告相对打分'是治 LLM-as-judge 打分趋同的有效配方,消融数据(去 reference 掉 4.8 个点 PAR)说明参照对比比准则工程更重要,这对我们自己搭任何长文本评估管线都适用;(2) 它的教训同样有用——judge 模型停服导致整个榜单分数作废重评,自建评估体系时应从第一天就保留原始报告和中间打分,让换 judge 只需重跑评分而非重收数据(DRB 正是靠保留 raw article 才能迁移)。

阅读笔记

读数字时注意三个坑:RACE 分数是相对参照报告的比值,只看排名和差距、别看绝对值;榜单分为 Gemini-2.5-Pro 时代和 GPT-5.5 时代两套,不可混用;FACT 的 Citation Accuracy 受 Jina 抓取能力限制,对墙内来源偏低。续作 DRB II(arXiv 2601.08536)换成了 9,430 条二元 rubric 的路线,如果关注 rubric-based 评估可以顺藤摸瓜。

材料清单

TeX 源码
已存档:Raw/deepresearch-bench/source/
代码仓库github.com/Ayanami0730/deep_research_bench
817★ · 最近推送 2026-05-11
项目主页 / 报告deepresearch-bench.github.io/
数据集huggingface.co/datasets/muset-ai/DeepResearch-Bench-Dataset
100 个任务 + 各模型原始报告与评分
续作 DRB IIarxiv.org/abs/2601.08536
2026-02 发布,改用 9,430 条细粒度二元 rubric 评估,与 DRB 并行维护
AGI-Eval 托管评测agi-eval.cn/evaluation/detail?id=67
第三方平台上的在线评测入口

同类条目