论文
推理时自提升
背景
AREX: Towards a Recursively Self-Improving Agent for Deep Research
AREX:面向深度检索的递归自改进 agent
Shuqi Lu, Chaofan Li, Kun Luo, et al. (BAAI) · BAAI 等 · arXiv · 2026-07 · 被引 0
一句话BAAI 把 RSI 做成推理时双层闭环:内环做研究、外环逐约束审计答案并决定接受/精修/重启,再配一个学出来的 context-update 工具把交互历史压缩成'改进状态';4B 与 122B-A10B 两个开源模型在 BrowseComp 上从裸内环的 59.6 提到全系统的 82.5(+22.9)。
这是什么
深度检索(deep research)任务的答案往往要同时满足多个约束,找到答案很贵,但验证一个候选答案可以拆成逐约束的便宜检查——论文称之为 discovery-verification 不对称性。AREX 的想法是:与其让 agent 单纯搜得更久,不如让它递归地改进当前答案:每轮先用内环(search/visit/python 工具)搜证据、给出带 confidence score 的结构化答案,外环再逐约束审计,confidence 高就接受,低就评估轨迹后选择 REFINE(带着已验证信息继续)或 RESTART。
支撑长程递归的关键是一个模型自己学会调用的 update_context 工具:把不断膨胀的交互历史压缩成紧凑的 improvement state(已验证发现、当前/已否决候选、未解决约束、下一步计划),不依赖外部摘要模型。训练上走 agentic mid-training + 长程 RL,并针对稀疏奖励问题对'关键步'(拿到决定性证据、纠正错误方向、关键 context 更新)加重监督和 RL bonus。最终发布 AREX-Turbo(4B dense,基于 Qwen3.5-4B)和 AREX-Base(122B 总参/10B 激活 MoE,基于 Qwen3.5-122B-A10B)。
AREX 双环结构:下方内环(橙)做研究,每步可选调用 update_context 把轨迹刷新成 Refreshed Research State(已验证发现/候选/未解决约束/下一步计划);finish 后进入上方外环(蓝),confidence 高直接 ACCEPT,低则做轨迹评估后 REFINE 或 RESTART,进入下一轮递归。机制与做法
内外双环 + 自主上下文更新(ACU)
内环是标准的 ReAct 式研究循环,但多了可选的 update_context 动作;外环收到 finish 输出的结构化结果(临时答案+证据+confidence)后走 confidence 门控:高则接受,低则做 trajectory assessment,判断可恢复就 REFINE、不可恢复就 RESTART,新一轮的研究目标由未解决约束定向生成。实测 ACU 是主动行为而非被动截断:BrowseComp 上 80.3% 的 case 调用了 update_context,平均在 25.7K token 时触发(上限 128K,仅 0.01% 撞限触发);触发原因 66.9% 是'修正搜索策略',压缩内容里 96.4% 保留 next-step plan、95.5% 保留未解决约束。
关键步监督与 step-aware RL
长轨迹里大部分是例行工具调用,少数决定性步骤(获取关键证据、否决错误方向、关键 context 更新)loss 明显更高、更难学。作者用规则检测器离线标注这些 key steps(只保留最终答案通过验证的轨迹),mid-training 阶段对 key step 单独做 prefix-conditioned 的聚焦监督(前缀 mask 掉、只对该步算 loss);RL 阶段(turn-level 策略优化)对成功轨迹中的 key step 额外加有界 advantage bonus。消融:把 key-step 监督换成等预算的随机步重放,BrowseComp 从 82.5 掉到 74.1,是所有消融里降幅最大的。
关键结果
- BrowseComp 上机制拆解干净:无 ACU 无外环 59.6 → 加 ACU 71.4(+11.8) → 再加外环 82.5(+11.1),全系统比裸内环高 22.9 分,两个机制的增益近似可加。
- confidence score 可用作外环门控:正确答案 95.9% 落在 90-100 置信区间(有 ACU),错误答案 55.2% 落在 60 以下,答案级置信度就能筛出大量失败,不用重读整条轨迹。
- 主榜(论文自报):AREX-Base(10B 激活)BrowseComp 82.5、GAIA 85.4、WideSearch-en 82.0(称为已报告的最高分)、DeepSearchQA 89.9、HLE(text-only)52.4,超过 Qwen3.5-397B 等更大激活参数的模型;4B 的 AREX-Turbo 在 6 个 benchmark 中 5 个超过 Qwen3.5-35B(如 BrowseComp 70.7 vs 61.0)。
- 训练配方消融(BrowseComp):渐进式多轮能力训练换成混合训练 82.5→77.5;key-step 监督换随机步 82.5→74.1;step-aware RL 换标准 GRPO 也有下降。
实证核查
有水分两个模型权重确实开源在 HF(apache-2.0),机制消融给得细且自洽;但训练/评测代码未放出,主榜数字全为自报且尚无第三方复现,与单次作答的 baseline 对比时 AREX 的外环多轮重试意味着推理算力未必对齐——机制部分可信,'超过更大模型'的头条要打折看。
论文/主页宣称开源 AREX-Turbo(4B)与 AREX-Base(122B-A10B)模型权重。
已核实:huggingface.co/BAAI/AREX-Turbo 存在,safetensors、base_model=Qwen/Qwen3.5-4B、apache-2.0,downloads 748、likes 45、lastModified 2026-08-11;BAAI/AREX-Base 页面同样可访问,README 与论文一致(经 Jina Reader 抓取核对)。主页(vectorspacelab.github.io/arex-model)只有权重、论文和 arex-research.com 在线 demo,未提供训练代码或评测 harness。
'substantially outperforms comparable-scale baselines'——主榜上 AREX-Base 超过 Kimi-K2.6、DeepSeek-V4-Pro 等多个前沿系统的部分项目。
论文自己的消融表(main.tex tab:browsecomp-accuracy)显示外环多轮 self-improvement 在 BrowseComp 上贡献 +11.1 分;主榜里 baseline 多为单次作答系统,推理预算是否对齐论文未说明,即 82.5 这类数字里有相当一部分来自推理时多花算力。另外 S2 引用数 0(2026-07 发布),暂无第三方复现或独立评测报告可交叉验证。
与我们方向的关系
对课题组 RSI 方向的价值在于:它把'自改进'从改代码/改权重挪到了推理时的答案迭代,并证明这个闭环能力可以被 mid-training + RL 显式学出来(而不是靠 prompt 工程拼出来)。两个可直接借鉴的点:一是 discovery-verification 不对称性作为设计原则——把验证做成状态转移而非终点过滤;二是 key-step 聚焦监督,对长轨迹稀疏奖励问题给了一个简单可复用的配方(规则检测关键步 + prefix-conditioned 单步 loss + RL bonus),消融显示这是全配方里最关键的一环(-8.4 分)。ACU 的行为统计(80% 主动调用、平均 25K token 就压缩)也说明学出来的上下文管理和被动截断是两回事。
阅读笔记
只放权重不放训练/评测代码,复现只能做推理侧;主榜对比里 baseline 数字来源混杂(部分标注为 full HLE vs text-only HLE),细看需回 tab:benchmark-comparison 的脚注。
材料清单
TeX 源码已存档:Raw/arex/source/