← 返回资料站  /  AI for AI
基准 评测基准

AI4AI-Bench: Benchmarking LLM Agents in Algorithmic Design for Recursive Self-Improvement

AI4AI-Bench:LLM agent 到底会不会改训练算法?
一句话10 个冻结科研仓库、10 个训练算法家族,agent 有 4 小时在一块 B300 上重写训练算法,补丁在全新环境从零重跑最多 12 小时、由冻结评测器打分。6 个系统 29 种配置共 290 个 cell,平均分 0.166(0.1 = 仓库自带算法,1.0 = 任务最优):最强的 Claude Opus 5 也只有 0.250,而且 263 份有效提交里 141 份根本没碰学习机制。

这是什么

递归自我改进(RSI)的核心问题是:AI 能不能改进'生产 AI 的过程'——也就是训练算法本身。一个更好的目标函数或更新规则会改善之后每一次训练的算力-能力兑换率,包括训练下一代 agent 的那次。但现有 agent 基准(MLE-bench、RE-Bench 一类)大多可以靠堆数据或调超参取胜,分不清'改了这次 run 的执行方式'和'改了模型学习的方式'。AI4AI-Bench 就是为隔离后者而设计的。

任务形式化为五元组 (C, a0, q, m, d):冻结仓库源码 C、起始模型 a0、探索期可无限查询的廉价 proxy 指标 q、以及 agent 永远见不到的最终指标 m。agent 提交的既不是数字也不是模型,而是改过的源码 C';C' 在全新容器里从零重跑,取最近 3 个 checkpoint 里最好的一个,由事先冻结、与 agent 环境完全隔离的评测器打分。基线是同一仓库自带算法在完全相同流程下的得分——赢了只能归因于代码改动本身。

10 个任务覆盖 SFT、多轮 agentic RL(RAGEN/Sokoban GRPO)、on-policy 蒸馏、Bradley-Terry reward modeling、DPO、diffusion RL(DDPO)、machine unlearning(NPO)、离散图扩散(DiGress)、weight averaging(Model Soup)和 one-shot pruning(OWL/Wanda)。10 个指标不可通约,所以统一映射到一个 ladder:0 = 无信息模型,0.1 = 仓库自带算法,1.0 = 任务最优(perplexity 类先取 -log 再线性映射)。

整体流程与 10 个任务一览。上排是四阶段 pipeline:冻结任务 → agent 4 小时探索(只有 source patch 能带出去)→ 全新容器 12 小时 formal 重跑 → 冻结评测器对至多 3 个 checkpoint 打分。下方是 10 个任务卡片,每张标了最终评测指标(如 OpenR1 用 LiveCodeBench pass@1、RAGEN 用 512 局 Sokoban 解题率、OWL 用 70% 稀疏度下的 WikiText-2 perplexity)。
整体流程与 10 个任务一览。上排是四阶段 pipeline:冻结任务 → agent 4 小时探索(只有 source patch 能带出去)→ 全新容器 12 小时 formal 重跑 → 冻结评测器对至多 3 个 checkpoint 打分。下方是 10 个任务卡片,每张标了最终评测指标(如 OpenR1 用 LiveCodeBench pass@1、RAGEN 用 512 局 Sokoban 解题率、OWL 用 70% 稀疏度下的 WikiText-2 perplexity)。

机制与做法

Explore / Formal 两阶段隔离

探索期 4 小时,agent 在一块 B300 上随便读代码、改代码、自己跑训练、无限查 proxy;时间一到,只有一个 source patch 能跨过边界——训好的权重、缓存、给自己留的笔记全部作废。Formal 阶段在全新容器里 apply patch 后从零训练最多 12 小时,产出至多 3 个 checkpoint 交给冻结的 validation + 评测器。两个不训练的任务(weight averaging、pruning)直接执行一次产出模型再打分。

论文对隔离边界的表述很诚实:这是 access and timing 上的隔离,不是样本不相交——有些任务的 proxy 就取自最终评测同一语料(否则探索预算跑不起完整评测)。保证的是'没有 agent 能用决定成绩的那个指标去筛选候选',而不是'agent 从没见过评测会读的数据'。

6 个系统 × reasoning effort 的平均分,虚线 0.1 = 仓库自带算法。所有 29 个配置都挤在 0.06-0.29 之间,即全部不到量表的三分之一;GPT-5.6 系随 effort 大致上升,Claude Opus 5 却在 medium(0.29)见顶后 high 档掉到 0.19——effort 与得分并不单调。
6 个系统 × reasoning effort 的平均分,虚线 0.1 = 仓库自带算法。所有 29 个配置都挤在 0.06-0.29 之间,即全部不到量表的三分之一;GPT-5.6 系随 effort 大致上升,Claude Opus 5 却在 medium(0.29)见顶后 high 档掉到 0.19——effort 与得分并不单调。

被测对象是 system,不是 model

作者把 model + harness + reasoning effort 的组合称为一个 system。6 个系统:GPT-5.6 三档(Sol/Terra/Luna)跑 Codex 全部 6 个 effort 级,Claude Opus 5 / Sonnet 5 跑 Claude Code 的 5 级,Kimi K3 跑 Claude Code 最高级——共 29 个配置 × 10 任务 = 290 个 cell。整个探索阶段 API 花费 $5,334(不含 12 小时重跑的 GPU 和评测算力)。

八个 patch family:改 run 还是改学习?

每份提交的 diff 由另一个 LLM 按定义归入 8 个 family,分两侧:4 个改'这次 run 怎么跑'(训练时长/存档频率、超参、选哪个 checkpoint、adapter 容量与位置),4 个改'模型怎么学'(loss 项、监督信号、更新规则、训练数据)。280 份提交中 17 份无可归类改动;剩下 263 份里 141 份完全停留在 run 侧,只有 122 份碰了学习机制——而任务说明白纸黑字写着'improve this training algorithm'。

碰了学习机制的平均 0.226,没碰的 0.126(gap 0.100,SE 0.022),去掉被 imitation learning 抬高的 agentic RL 任务后仍是 0.182 vs 0.128。reasoning effort 买到的主要是'敢下去改'的胆量:碰学习机制的比例从最低档的 8% 升到最高档的 64%,均分从 0.094 到 0.196——effort 让 agent 更愿意去改真正值钱的那一层,而不是让改动本身更好。

少数真改了算法的提交长什么样

论文精读了三个案例:(1) one-shot pruning 任务被一份提交改成三阶段 pipeline(新的权重选择/更新规则 + layerwise 蒸馏 + masked KD 微调),perplexity 从 53.4 降到 13 出头;(2) weight averaging 任务上,一份提交先给自己造了个快 500 倍的评测 rig(72 个模型的张量打包成 GPU 上一个矩阵,单次打分从 ~190s 降到 0.38s),再在上面比较 5 种合并方法,greedy soup 0.7025 胜出;(3) agentic RL 任务上拿满分的提交干脆把 GRPO 换成了模仿学习(生成棋盘 + 标最优解 + SFT,一份还加了 DAgger)。共性是:动手前先造出可测量的东西——而这正是 263 份提交里绝大多数缺的能力。

关键结果

实证核查

扎实代码、任务、290 条轨迹均可查证,与论文声称一致;论文对自身隔离边界的局限写得异常坦白。主要保留:发布仅 10 天、无第三方复现,官方盲评服务尚不存在,自评结果只能算非官方。
论文声称发布 10 个冻结研究仓库、覆盖 10 个训练算法家族的任务套件与评测器。
GitHub Einsia/AI4AI-Bench 的 tasks/ 下确有 10 个任务目录(ddpo_sd15_aesthetic、digress_qm9_graph_diffusion、dpo_preference_alignment、model_soup_clip_imagenetv2、opd_math_1p5b、openr1_code_livecodebench、openunlearning_tofu_npo_llama3p2_1b、owl_wanda_opt6p7b_70pct、ragen_sokoban_grpo、ultrafeedback_bt_rm_rewardbench),与论文 Table 1 一一对应;orchestrator/、tools/(prepare_assets、smoke test、check_setup)齐全,Apache-2.0,Docker 镜像发布在 hub.docker.com/r/chiyizhe/ai4ai。
'We release every scored submission'——290 条轨迹全部公开。
lab.einsia.ai/ai4ai/trajectories/ 确实可按 (task, model, harness, effort) 浏览全部 290 个配置,每个 case 含 baseline、candidate 算法描述、proxy 证据、formal replay、checkpoint 与 audit 记录。但页面自述这是 'a redacted English release, not a raw log dump'——是经过整理脱敏的英文摘要版,原始日志并未原样倾倒。
评测由'事先冻结、agent 不可见'的评测器完成,测量可复现。
仓库 README 和 tools/docs/evaluation.md 明确承认 'the current absence of a blind evaluation service':第三方自跑的评测默认打上 non-official local results 标签(warn receipts)。也就是说协议是公开可复跑的,但目前没有官方盲评通道,榜上数字只能信作者自己跑的。另外仓库发布 10 天时 0 issues、1 fork、31 stars,尚无任何第三方复现记录。
proxy 与最终指标严格隔离,agent 无法在最终指标上过拟合。
论文 §2.3 自己写明隔离是 access and timing 而非 sample disjointness:部分任务的 proxy 与最终评测取自同一语料。这一点作者主动披露,属于诚实的设计权衡而非隐瞒;但意味着'没在最终指标上调过'不等于'没见过评测数据'。
基线与提交在完全相同的规约下比较。
tex 源码 2_benchmark.tex 第 115-119 行留有一条未删的作者注释:agent 取 3 个 checkpoint 的最优,而基线是否用同样的 reduction 规则'必须写明——早期草稿两者规则不同时,pooled rate 差了约 30 个点'。正文最终未明确交代这一点,复现或引用 win rate 类数字时需要自己找 mapped_table.csv 核对。

与我们方向的关系

这是目前唯一把'改训练算法本身'从'跑实验/调超参'里隔离出来的 RSI 基准,直接回答课题组关心的问题:当前最强 agent 距离能自我改进的那一层还有多远——答案是连仓库自带算法到最优的 1/5 都走不完,且大多数提交根本不去碰学习机制。'effort 买的是胆量而非能力'(8%→64% 的提交敢改算法,分数只翻倍)这个分解方式值得借鉴:评 agent 时把'是否到达关键层'和'到达后做得多好'拆开看。

两个可直接复用的设计:(1) explore/formal 边界——只允许 source patch 跨过、从零重跑再打分,是防 agent 在评测指标上过拟合的干净做法,任何自改进闭环实验都可以套用;(2) 0/0.1/1.0 三点 ladder 把不可通约指标映成稠密分数,论文明说这是为将来用 RL 训练 agent 准备的 dense reward——如果课题组要在类似环境上做 RL,这个 scoring 可以直接拿来。三个成功案例(先造 500 倍速评测 rig 再搜索、把 RL 任务重构成 IL)也提示:自改进 agent 的关键瓶颈可能是'先建测量工具'这一步。

阅读笔记

复现门槛不低:官方配置是单块 B300,4h 探索 + 12h 重跑,290 个 cell 光探索期 API 就花了 $5,334,还不含 GPU。tex 源码里留了不少作者工作注释(包括 §4 提到 per-task figure 和 patch family 小节曾被 park),读起来像仍在打磨中的 v1;引用具体 win rate 前建议对照仓库 build/lark/mapped_table.csv。DDPO 任务的高分提交(aesthetic score 从基线冲到 17.67)本质是把 RL 换成对 reward 的直接可微优化,某种程度上是合规的 reward over-optimization,解读该任务分数时要留意。

材料清单

TeX 源码
已存档:Raw/ai4ai-bench/source/
代码仓库github.com/Einsia/AI4AI-Bench
31★ · 最近推送 2026-08-21
项目主页 / 报告lab.einsia.ai/ai4ai/
轨迹浏览器lab.einsia.ai/ai4ai/trajectories/
290 个配置全部可浏览:候选算法描述、proxy 证据、formal replay、audit 记录(整理脱敏版,非原始日志)
任务详情lab.einsia.ai/ai4ai/tasks/
10 个任务的资产、指标、基线说明
Docker 镜像hub.docker.com/r/chiyizhe/ai4ai
官方发布的任务运行镜像

同类条目