报告
深度调研
★ 必读
Tongyi DeepResearch Technical Report
通义 DeepResearch 技术报告:全开源深度调研 agent 的完整训练配方
Tongyi DeepResearch Team (Baixuan Li, Bo Zhang, Dingchu Zhang, et al.) · Alibaba (通义) · arXiv · 2025-10 · 被引 21
一句话 阿里通义用 Qwen3-30B-A3B(激活仅 3.3B)训出对标 OpenAI Deep Research 的开源深度调研模型:agentic mid-training(CPT)+ SFT + 严格 on-policy 的改造版 GRPO,数据全靠自动合成,报告 HLE 32.9 / BrowseComp 43.4 / xbench-DeepSearch 75.0;模型和推理代码已开源,但训练数据、RL 训练代码和 Heavy Mode 并未随仓库放出,第三方复现普遍低于报告值。
这是什么 Deep Research 类系统(OpenAI Deep Research、Gemini Deep Research 等)能自主上网做多步检索和推理,替人完成数小时的调研任务,但此前基本闭源、中间过程不可见。通义这篇技术报告给出了第一个宣称性能对标闭源系统的全开源方案:30.5B 总参数、每 token 只激活 3.3B 的 MoE 模型,基于 Qwen3-30B-A3B-Base,工具空间为 Search、Visit、Python Interpreter、Google Scholar、File Parser 五件套,推理框架就是最朴素的 ReAct——作者明确引用 The Bitter Lesson 解释为什么不做复杂多 agent 结构。
这份报告的真正价值不在单点技巧,而在完整交代了'如何从一个通用 base model 训出调研 agent'的全流程:两阶段 agentic mid-training(Agentic CPT)注入 agent 行为先验 → 合成数据 SFT 冷启动 → 严格 on-policy 的 agentic RL → 最后 model merging。所有训练数据都由自动化流水线合成,不依赖人工标注。它背后是通义 WebAgent 系列(WebSailor、WebShaper、AgentFounder、WebResearcher 等 17+ 篇论文)的集大成,GitHub 仓库已近 2 万 star,是社区研究'训练调研 agent'最重要的开放参照。
八个基准上的主结果(Avg@3)。注意看灰色深浅:BrowseComp 上 OpenAI DeepResearch(51.5)和 xbench-2510 上 ChatGPT-5-Pro(75+)其实高于 Tongyi,报告正文的'几乎全面第一'要对照这张图打折理解;但在开源模型中确实是断档领先。 机制与做法 训练管线:mid-training 补 agent 先验,post-training 冲上限
核心论点是通用 base model 缺少 agentic inductive bias,直接做 agentic post-training 会让模型同时学'agent 能力'和'对齐',产生优化冲突。因此在 pre-training 和 post-training 之间插入两阶段 Agentic CPT(即 AgentFounder 那篇的做法):第一阶段 32K 上下文,第二阶段扩到 128K 并灌入 64K-128K 的长序列 agent 行为数据,全程用 next-token prediction 损失,并掺入通用预训练数据防止灾难性遗忘。
Post-training 分三步:先用合成 QA + 高性能开源模型生成的轨迹做 rejection sampling,SFT 冷启动(同样两阶段,40K → 128K);再做 agentic RL;最后把不同能力偏好的 checkpoint 做加权平均(model merging)得到最终模型。推理时有两种范式:标准 ReAct,以及基于 IterResearch 上下文管理的 Heavy Mode——每步不带完整历史,只保留问题 q、演进中的报告摘要 S_t 和上一步交互,靠 Markovian 状态重构避免上下文撑爆。
训练管线全景:Qwen 系列 base model → 两阶段 Agentic CPT(mid-training,32K → 128K 上下文)→ Agentic SFT 冷启动 → Agentic RL。mid-training 是这篇相对同期工作最大的差异点——先给 base model 注入 agent 行为先验,再做 post-training。 合成数据:从知识图谱随机游走到不确定性注入
Mid-training 数据覆盖 agent 工作流全生命周期:问题合成(基于实体锚定的开放世界记忆)、planning action、reasoning action、decision-making action 四类,另加环境规模化(environment scaling,每个环境建模为可读写数据库)合成的通用 function-calling 数据。
Post-training 的 QA 合成是 WebSailor + WebShaper 路线:先用随机游走构建高度互联的知识图谱和来自真实网站的同构表格,采样子图/子表生成初始 QA,再对问题做'不确定性注入'(如合并属性相似的实体)系统性提升难度,并用基于集合论的形式化建模来控制推理结构、减少捷径、支持自动验证答案正确性。报告给的数据质量证据:SFT 数据中超过 20% 样本长于 32k tokens 且涉及 10 次以上工具调用。
Agentic RL 框架:异步 rollout 服务与工具调用分离,rollout worker 在模拟/真实环境(Search、Visit、Python、Scholar、File Parser 五工具,统一 sandbox 封装)中交互产轨迹,reward 服务打 0/1 分并回流更新合成数据池,形成自动数据课程闭环。 Agentic RL:算法只做小改,重点全在环境和数据
算法是 GRPO 的改造版:纯 0/1 答案正确性奖励(不给 format reward)、token-level policy gradient、DAPO 式 clip-higher 鼓励探索、leave-one-out 降低 advantage 方差、严格 on-policy(importance ratio 恒为 1)。关键工程经验:直接在未过滤的负样本上优化会导致训练不稳甚至 policy collapse,所以会剔除部分负样本(如超长未给出答案的轨迹)。作者的结论写得很直白:agentic RL 的成败更多取决于数据质量和环境稳定性,而非具体算法。
环境侧分三层:Prior World Environment(零成本、无真实反馈)、基于 2024 Wikipedia 数据库 + 本地 RAG 的模拟环境(先在'风洞'里快速验证算法,模拟环境的 reward 曲线与真实环境高度一致)、真实 Web 环境(统一 sandbox 封装五个工具,带 QPS 限流、缓存、超时重试、降级和备用数据源切换,防止 API 抖动污染训练轨迹)。RL 基建是基于 rLLM 的 step-level 异步 rollout:推理服务和工具调用服务分离,多 agent 实例并行独立跑轨迹。
数据课程也是自动的:先用 SFT 模型采样,过滤掉全对/全错的问题只留中等难度;训练中持续监控,用中间 checkpoint 从全量数据池挖掘'对变强后的模型而言中等难度'的新题,reward 平台期时换血。context length 消融很有意思:用同一套 64k 模型筛的课程训 32k/48k/64k 三个模型,64k reward 上限最高;而 32k 模型的响应长度反而持续下降——超长解法拿零奖励,倒逼它学会更精简的动作序列。
Heavy Mode(test-time scaling:n 个并行 agent + 报告综合)对比:HLE 32.9→38.3、BrowseComp 43.4→58.3、BrowseComp-ZH 46.7→58.1。基础模式落后 OpenAI DeepResearch 的 BrowseComp 差距,靠多倍推理开销才反超。 Heavy Mode:上下文管理支撑的 test-time scaling
Heavy Mode 部署 n 个并行 agent,各自按上下文管理范式独立探索并产出压缩的最终报告 S_T 和答案,再由一个 synthesis 模型汇总所有报告给出最终答案。要点在于压缩报告使 n 条完整轨迹的信息能塞进一个上下文窗口(直接拼完整轨迹 2-3 条就爆)。Heavy Mode 把 HLE 从 32.9 提到 38.3、BrowseComp 从 43.4 提到 58.3、BrowseComp-ZH 从 46.7 提到 58.1。另一条 scaling 维度是交互轮数:BrowseComp 性能随环境交互次数/上下文长度增长而持续上升。
关键结果 主结果(Avg@3,温度 0.85、最多 128 次工具调用、128K 上下文):HLE 32.9、BrowseComp 43.4、BrowseComp-ZH 46.7、GAIA 70.9、xbench-DeepSearch 75.0、WebWalkerQA 72.2、FRAMES 90.6,总参数 30.5B、激活 3.3B。 Heavy Mode(并行研究 + 综合)再涨一截:HLE 38.3、BrowseComp 58.3、BrowseComp-ZH 58.1;Pass@3 更高:BrowseComp 59.64、BrowseComp-ZH 63.67、HLE 45.9,说明单次采样远未榨干模型潜力。 对比口径要注意:BrowseComp 上 OpenAI Deep Research 是 51.5、o3 是 49.7,都高于 Tongyi 的 43.4;BrowseComp-ZH 上 o3 的 58.1 也高于 46.7。'几乎所有基准第一'主要在 ReAct 类开源对手中成立。 新基准 xbench-DeepSearch-2510 上得分 55+,排在 ChatGPT-5-Pro(75+)之后,报告自己承认这一差距。 RL 训练曲线:reward 随训练持续上升、policy entropy 短暂上升后稳定收敛,不塌不炸;模拟 Wiki 环境的 reward 曲线与真实环境高度一致,支持'先模拟后真实'的开发流程。 Context length 消融:64k > 48k > 32k 的 reward 上限;32k 模型在为 64k 模型设计的课程上训练时响应长度反而下降,被逼学出更高效的解法。 通用能力不塌:AIME25、HMMT25、SimpleQA 上比只靠推理不用工具的 base model 有明显提升(搜索补知识、Python 补计算)。 作者自认的局限:128K 上下文对最难的长程任务仍不够;报告生成的忠实度仍在改进;RL 是严格 on-policy、效率有限,partial rollout 等 off-policy 技术是未来工作。 实证核查
有水分 模型权重(Apache-2.0)和推理/评测代码真实开放、社区采用广泛(近 2 万 star),训练方法论也通过系列论文交代得相当完整,这部分扎实;但'open-source the model, framework, and complete solutions'有明显折扣——训练数据、RL 训练代码、Heavy Mode、上下文管理实现都没放出,且多个第三方在官方脚本基础上复现的分数比报告低 5-20 个点。
报告称 'We open-source the model, framework, and complete solutions to empower the community'。
实际开源清单:HF 模型权重 + GitHub 仓库的 inference/(ReAct 推理与五个工具实现)和 evaluation/ 目录。官方 FAQ 明确写着训练数据不放出('We don't plan to release the training data')、Heavy Mode 未完全开源('not fully open-sourced yet');仓库根目录没有任何训练代码(只有 inference、evaluation、WebAgent、Agent 四个目录);issue #229 问论文里的 Context Management 在代码哪里,无官方回应。'complete solutions'实指方法论文,不是可跑的训练管线。
主表报告 BrowseComp 43.4、xbench-DeepSearch 75.0 等,并提供官方复现脚本。
第三方复现普遍偏低:issue #218 用官方 system prompt + Bing 搜索在 BrowseComp-en 只拿到约 20%(评论区归因于搜索后端差异极大);issue #223 按仓库工具和说明复现 xbench-DeepSearch,多次测试稳定在 62-68、达不到 75,另一位用户确认同样现象,官方未答复。官方 FAQ 对'为什么复现不出论文结果'的回答是必须用与训练一致的 prompt 和工具——即结果强依赖 Serper/Jina 等具体商业 API 配置,分数的可迁移性有限。
'achieves the highest scores on nearly all evaluated benchmarks... consistently surpasses both open and closed commercial systems'(主表把自家 7 列全部加粗)。
按报告自己的表 1:BrowseComp 上 OpenAI DeepResearch 51.5 > Tongyi 43.4,o3 49.7 > 43.4;BrowseComp-ZH 上 o3 58.1 > 46.7。加粗方式会误导快读的人;需要开销大得多的 Heavy Mode(n 个并行 agent + 综合)才追到 58.3/58.1。在'同为 ReAct 单 agent 的开源模型'口径下 SOTA 成立,'全面超越闭源系统'不成立。
HLE 32.9(Heavy Mode 38.3)代表深度调研/学术推理能力。
issue #251 指出该类评测存在 search-time data contamination:评测代码不限制 agent 搜到 HLE 原题及未加密镜像(第三方 HF 仓库、GitHub fork 等),agent 可以直接检索到标准答案;引用的审计工作 arXiv:2508.13180 显示同类系统约 3% 的题目可通过搜索直接找到 ground truth。该 issue 无官方回应,报告也未提任何搜索域黑名单或防泄漏措施,带搜索工具的 HLE 分数与纯推理分数不可直接比较。
模型开放可用,社区可以直接上手。
这部分属实且好于多数'开源'发布:权重在 HuggingFace/ModelScope 可下载(Apache-2.0),OpenRouter 有托管 API,仓库 19.9k star、持续维护(最近 push 2026-02),S2 引用 21 次。跑通推理需要自备 Serper、Jina、Dashscope、SandboxFusion 等一串 API key,门槛在工具链而非模型本身。
与我们方向的关系 对 autoresearch 方向,这是目前最完整公开的'训练调研 agent'配方,价值在于把问题从 prompt 工程转到训练:如果要做自己的 research agent,可直接借鉴的组件包括(1)知识图谱随机游走 + 不确定性注入的 QA 合成(WebSailor/WebShaper 有独立论文和部分代码);(2)'先模拟环境验证算法、再上真实环境'的开发流程——本地 Wiki + RAG 模拟环境成本低且 reward 曲线与真实环境一致,适合算力有限的学术组;(3)自动难度课程(过滤全对/全错、动态换血)和'剔除坏负样本防 collapse'这类 RL 工程经验。
同时它也是一个很好的'读技术报告要核查'案例:benchmark 表的加粗口径、对搜索后端的强依赖、以及带搜索评测的答案泄漏问题,都是我们自己做 agent 评测时要主动规避的坑。若做复现,预期比报告值低若干个点是正常现象,搜索 API 用什么、页面摘要模型用什么都会显著影响分数。
阅读笔记 报告本体较薄(正文约 20 页),大量细节分散在 WebAgent 系列论文里:数据合成看 WebSailor(2507.02592)/WebShaper(2507.15061),Agentic CPT 看 AgentFounder(2509.13310),上下文管理/Heavy Mode 看 WebResearcher(2509.13309)与 IterResearch。复现时注意:官方推理默认 Serper 搜索 + Jina 读网页 + OpenAI 兼容 API 做页面摘要,换任何一环分数都会动;评测协议是 Avg@3,温度 0.85。
材料清单 TeX 源码 已存档:Raw/tongyi-deepresearch-technical-report/source/
同类条目