← 返回资料站  /  Recursive Self-Improvement
论文 推理时自提升 背景

AREX: Towards a Recursively Self-Improving Agent for Deep Research

AREX:面向深度检索的递归自改进 agent
一句话BAAI 把 RSI 做成推理时双层闭环:内环做研究、外环逐约束审计答案并决定接受/精修/重启,再配一个学出来的 context-update 工具把交互历史压缩成'改进状态';4B 与 122B-A10B 两个开源模型在 BrowseComp 上从裸内环的 59.6 提到全系统的 82.5(+22.9)。

这是什么

深度检索(deep research)任务的答案往往要同时满足多个约束,找到答案很贵,但验证一个候选答案可以拆成逐约束的便宜检查——论文称之为 discovery-verification 不对称性。AREX 的想法是:与其让 agent 单纯搜得更久,不如让它递归地改进当前答案:每轮先用内环(search/visit/python 工具)搜证据、给出带 confidence score 的结构化答案,外环再逐约束审计,confidence 高就接受,低就评估轨迹后选择 REFINE(带着已验证信息继续)或 RESTART。

支撑长程递归的关键是一个模型自己学会调用的 update_context 工具:把不断膨胀的交互历史压缩成紧凑的 improvement state(已验证发现、当前/已否决候选、未解决约束、下一步计划),不依赖外部摘要模型。训练上走 agentic mid-training + 长程 RL,并针对稀疏奖励问题对'关键步'(拿到决定性证据、纠正错误方向、关键 context 更新)加重监督和 RL bonus。最终发布 AREX-Turbo(4B dense,基于 Qwen3.5-4B)和 AREX-Base(122B 总参/10B 激活 MoE,基于 Qwen3.5-122B-A10B)。

AREX 双环结构:下方内环(橙)做研究,每步可选调用 update_context 把轨迹刷新成 Refreshed Research State(已验证发现/候选/未解决约束/下一步计划);finish 后进入上方外环(蓝),confidence 高直接 ACCEPT,低则做轨迹评估后 REFINE 或 RESTART,进入下一轮递归。
AREX 双环结构:下方内环(橙)做研究,每步可选调用 update_context 把轨迹刷新成 Refreshed Research State(已验证发现/候选/未解决约束/下一步计划);finish 后进入上方外环(蓝),confidence 高直接 ACCEPT,低则做轨迹评估后 REFINE 或 RESTART,进入下一轮递归。

机制与做法

内外双环 + 自主上下文更新(ACU)

内环是标准的 ReAct 式研究循环,但多了可选的 update_context 动作;外环收到 finish 输出的结构化结果(临时答案+证据+confidence)后走 confidence 门控:高则接受,低则做 trajectory assessment,判断可恢复就 REFINE、不可恢复就 RESTART,新一轮的研究目标由未解决约束定向生成。实测 ACU 是主动行为而非被动截断:BrowseComp 上 80.3% 的 case 调用了 update_context,平均在 25.7K token 时触发(上限 128K,仅 0.01% 撞限触发);触发原因 66.9% 是'修正搜索策略',压缩内容里 96.4% 保留 next-step plan、95.5% 保留未解决约束。

关键步监督与 step-aware RL

长轨迹里大部分是例行工具调用,少数决定性步骤(获取关键证据、否决错误方向、关键 context 更新)loss 明显更高、更难学。作者用规则检测器离线标注这些 key steps(只保留最终答案通过验证的轨迹),mid-training 阶段对 key step 单独做 prefix-conditioned 的聚焦监督(前缀 mask 掉、只对该步算 loss);RL 阶段(turn-level 策略优化)对成功轨迹中的 key step 额外加有界 advantage bonus。消融:把 key-step 监督换成等预算的随机步重放,BrowseComp 从 82.5 掉到 74.1,是所有消融里降幅最大的。

关键结果

实证核查

有水分两个模型权重确实开源在 HF(apache-2.0),机制消融给得细且自洽;但训练/评测代码未放出,主榜数字全为自报且尚无第三方复现,与单次作答的 baseline 对比时 AREX 的外环多轮重试意味着推理算力未必对齐——机制部分可信,'超过更大模型'的头条要打折看。
论文/主页宣称开源 AREX-Turbo(4B)与 AREX-Base(122B-A10B)模型权重。
已核实:huggingface.co/BAAI/AREX-Turbo 存在,safetensors、base_model=Qwen/Qwen3.5-4B、apache-2.0,downloads 748、likes 45、lastModified 2026-08-11;BAAI/AREX-Base 页面同样可访问,README 与论文一致(经 Jina Reader 抓取核对)。主页(vectorspacelab.github.io/arex-model)只有权重、论文和 arex-research.com 在线 demo,未提供训练代码或评测 harness。
'substantially outperforms comparable-scale baselines'——主榜上 AREX-Base 超过 Kimi-K2.6、DeepSeek-V4-Pro 等多个前沿系统的部分项目。
论文自己的消融表(main.tex tab:browsecomp-accuracy)显示外环多轮 self-improvement 在 BrowseComp 上贡献 +11.1 分;主榜里 baseline 多为单次作答系统,推理预算是否对齐论文未说明,即 82.5 这类数字里有相当一部分来自推理时多花算力。另外 S2 引用数 0(2026-07 发布),暂无第三方复现或独立评测报告可交叉验证。

与我们方向的关系

对课题组 RSI 方向的价值在于:它把'自改进'从改代码/改权重挪到了推理时的答案迭代,并证明这个闭环能力可以被 mid-training + RL 显式学出来(而不是靠 prompt 工程拼出来)。两个可直接借鉴的点:一是 discovery-verification 不对称性作为设计原则——把验证做成状态转移而非终点过滤;二是 key-step 聚焦监督,对长轨迹稀疏奖励问题给了一个简单可复用的配方(规则检测关键步 + prefix-conditioned 单步 loss + RL bonus),消融显示这是全配方里最关键的一环(-8.4 分)。ACU 的行为统计(80% 主动调用、平均 25K token 就压缩)也说明学出来的上下文管理和被动截断是两回事。

阅读笔记

只放权重不放训练/评测代码,复现只能做推理侧;主榜对比里 baseline 数字来源混杂(部分标注为 full HLE vs text-only HLE),细看需回 tab:benchmark-comparison 的脚注。

材料清单

TeX 源码
已存档:Raw/arex/source/
模型权重huggingface.co/BAAI/AREX-Turbo
4B dense,apache-2.0;AREX-Base(122B-A10B)同在 BAAI org 下
项目主页vectorspacelab.github.io/arex-model/
含在线 demo 链接 arex-research.com;无训练代码