← 返回资料站  /  AI for AI
基准 评测基准

ALE-Bench: A Benchmark for Long-Horizon Objective-Driven Algorithm Engineering

ALE-Bench:长时程算法工程基准(AtCoder 启发式赛题)
一句话Sakana AI 与 AtCoder 合作,把 40 道 AtCoder Heuristic Contest(AHC)赛题做成可交互的长时程优化基准:问题无已知最优解,agent 在 4 小时到 2 周的模拟赛程里反复测试、可视化、改进方案,用与真人相同的 rank/performance/rating 体系对比;配套的 ALE-Agent(Gemini 2.5 Pro)在 2025 年 5 月的真实比赛 AHC047 中拿到 21/1000+(前 2%)。

这是什么

主流代码基准(APPS、CodeContests、LiveCodeBench)都是短时、pass/fail 式的题目,前沿模型已接近饱和。ALE-Bench 转向另一类比赛:score-based 的启发式优化赛(AHC / Topcoder Marathon Match 一脉),题目是配送路径、排班、生产规划这类 NP-hard 问题,没有已知最优解,拼的是谁的近似解分数更高。这类比赛人类要花 4 小时(short 赛制)到 1-2 周(long 赛制)不断迭代,天然适合考察 AI 的长时程改进能力。

基准包含 40 道 AHC 真题(截至 2025 年 4 月,另有 10 题的 lite 子集),每题打包四件东西:Markdown 题面(含图)、Rust 官方 scorer、可视化器(静态图 + 本地 web 交互两种模式)、真人排行榜数据。数据由 AtCoder 官方授权,评分协议完全复刻原赛制,因此 AI 的成绩可以直接换算成在真人榜上的 rank 和 performance(Elo 式,0-3500)。软件框架是一个 Python session 对象:开题即计时,agent 可以在限时内反复 view problem / test run(public eval)/ visualize,最后 submit 触发隐藏测试集的 private eval。

论文同时给了一个专用 agent 原型 ALE-Agent 作为强 baseline,并以 AtCoder 许可用它实名(账号 fishylene)参加了两场真实比赛,其中 AHC047 拿到 21 名(1000+ 人,前 2%)。NeurIPS 2025 Datasets & Benchmarks 接收。

总览图:左边是 AHC 题型的多样性(覆盖、路由、划分、调度、装箱、拼图等 9 类,每类给了示例赛题);右边是框架结构——ALE-Bench 打包 Problem/Scorer/Visualizer/Code Sandbox/Leaderboard 五件套,AI 通过 Problem→Test Run→Visualization→Submission 的交互循环参赛,和真人流程一致。
总览图:左边是 AHC 题型的多样性(覆盖、路由、划分、调度、装箱、拼图等 9 类,每类给了示例赛题);右边是框架结构——ALE-Bench 打包 Problem/Scorer/Visualizer/Code Sandbox/Leaderboard 五件套,AI 通过 Problem→Test Run→Visualization→Submission 的交互循环参赛,和真人流程一致。

机制与做法

评测协议:复刻真人参赛体验

AI 通过 ale_bench.start(problem_id=...) 开一个 session,真实计时模拟赛程。code sandbox 是 Docker 封装的 AtCoder 执行环境,支持 C++/Python/Rust;高分解法通常是 CPU 密集的(每 case 限时 2-10 秒),结果对硬件敏感,所以官方提供 Terraform 脚本在 AWS c6i 实例上标准化评测,并用 AHC039 官方榜验证过分数可完全对上(ALE-Agent 的分数恰好对应原赛 5 名)。

指标分两层:单题记 score、rank、performance;跨题聚合用 average performance 和 AtCoder rating。论文明确建议用 average performance 而不是 rating——rating 的设计是奖励高分不惩罚低分,一次爆种就能把 AI 的 rating 抬得虚高。

o4-mini-high 在 ahc041 上 4 小时迭代的轨迹:横轴是代码生成次数(约 170 次),黑线是历史最高 public score(红点为刷新点),虚线是代码文件大小。分数在中后段仍有跳升,代码从约 4KB 增长到 14KB——增量实现、越写越复杂,行为模式接近人类选手。
o4-mini-high 在 ahc041 上 4 小时迭代的轨迹:横轴是代码生成次数(约 170 次),黑线是历史最高 public score(红点为刷新点),虚线是代码文件大小。分数在中后段仍有跳升,代码从约 4KB 增长到 14KB——增量实现、越写越复杂,行为模式接近人类选手。

主实验:one-shot、4 小时迭代、scaffolding 三档

评了最多 22 个模型。one-shot 下只有 o3-high 平均 performance 过 1000,且所有模型没有任何一题达到 2000,reasoning 模型整体强于非 reasoning。4 小时 iterative-refinement(类 Self-Refine,吃 public eval 反馈)让所有模型平均 performance 提升 400+,最好的 o4-mini-high 达到 1520 / rating 2104(名义上前 11.8% 人类)。

scaffolding 一档对比了通用 agent OpenHands(几乎没提升,常提前退出)和专用 ALE-Agent。ALE-Agent 就两招:Method 1 在 prompt 里注入领域知识(模拟退火、beam search、邻域设计、加速技巧);Method 2 用 best-first + beam 式扩展做多样性解搜索,一次 4 小时能生成约 1000 份候选代码。Method 2 带来大头提升,最终在人类分布上进前 6.8%。

反刷分检查:长时程 vs 并行暴搜

作者自问:高分究竟来自真正的迭代改进还是海量独立采样?他们挑了 6 道 o4-mini-high 迭代模式拿到 2000+ performance 的题,每题独立跑 150 次 one-shot(与迭代模式的平均代码生成次数持平)。结果 150 次里的最好成绩仍系统性低于迭代模式约 300 performance,说明基准确实在测反馈驱动的改进而不是暴搜。

另做了污染检查(各模型 performance 对比赛日期作散点,knowledge cutoff 前后无跳变)和抄袭检查(AHC 主办方作者人工审了全部 12 份 2000+ performance 的 AI 代码,未见与人类题解雷同)。

关键结果

实证核查

扎实数据、代码、评测环境全开源且与 AtCoder 官方合作,分数可与真人榜直接对账;真实参赛结果公开可查;论文对自己指标的水分(rating 高估 AI)反而是主动披露的。'前 2%'这一战绩需要注意语境:是一场 4 小时短赛的一次性结果,长赛表现明显更弱。
官方宣传点:ALE-Agent 在真实比赛中排前 2%,'AI 攻克困难优化问题的转折点'。
AHC047(2025-05-18,4 小时短赛)以账号 fishylene 实名参赛得 21/1000+,AtCoder 榜单公开可查;但同期 AHC046 只得 154 名(前 16%),且博客自己承认在两周长赛、不适合模拟退火的题、调试和实验驱动设计上都不行。前 2% 是最好的一次,不是稳定水平——论文正文的 lite 集系统评测是前 6.8%。
论文声称基准测的是长时程问题解决能力,分数可与人类公平比较。
两点都做了实证:(1) 150 次独立 one-shot vs 同预算迭代的对照实验(附录表 result_repeated_one_shot),迭代稳定高约 300 performance;(2) 评分复现性用 AHC039 官方 extended standings 对账(seca3_sup_experiments.tex,ALE-Agent 2880 分恰好对应原赛第 5 名)。另外论文主动指出 rating 指标会高估 AI,建议用 average performance——这种自我拆台在 benchmark 论文里少见。
README 声称提供完整可复现的评测工具链(Docker sandbox、AWS Terraform、HF 数据集)。
仓库(214 stars)持续维护到 2026-08,已扩到 judge 版本 202510、支持 Python 3.10-3.14,还加了 MCP server;HF 数据集 40 题如论文所述(license 为 CC BY-ND 4.0,不可改作)。issues 基本是作者自己的 PR,外部问题不多:#23 复现性能提问已答复关闭,#41(private eval 在特定失败序列后中止)是当前唯一 open bug。注意 README 明确警告:按 AtCoder 2025-06 规则,不得用本仓库参加正式 AHC。

与我们方向的关系

对 ai4ai 方向这是核心参照物:它定义了'无 ground truth、只有分数梯度'的长时程优化任务该怎么评——真实计时 session、public/private 双评、与人类排位直接对账、反暴搜对照实验、污染与抄袭检查,这套核查纪律值得任何自建 benchmark 抄作业。它与 AutoML/科研 agent 的区别在于反馈信号极干净(一个标量分数),适合作为研究'反馈驱动的长程改进'的受控环境。

ALE-Agent 的教训也直接可用:通用 agent(OpenHands)在这类任务上近乎无效,而'领域知识 prompt + 多样性 best-first 搜索'两个朴素组件就能从前 50% 拉到前 6.8%,说明 inference-time search 的结构设计比基座模型更换收益大。后续 Sakana 的 ALE-Agent 演进(以及 AtCoder 因此专门立的 AI 参赛规则)可持续跟踪。

阅读笔记

复现要点:高分解法 CPU 密集、结果依赖硬件,务必用官方 AWS c6i 配置,本地跑分数没有可比性。session 对象里 private_seeds、standings 等属性实验中禁止访问(README 有明示),自建 agent 时别不小心作弊。数据集 CC BY-ND 4.0 不可派生,想改题目做变体需另获授权。

材料清单

TeX 源码
已存档:Raw/ale-bench/source/
代码仓库github.com/SakanaAI/ALE-Bench
214★ · 最近推送 2026-08-26
项目主页 / 报告sakana.ai/ale-bench/
Leaderboardsakanaai.github.io/ALE-Bench-Leaderboard/
官方持续更新的模型排行榜
AtCoder AI 规则info.atcoder.jp/entry/ahc-llm-rules-en
本工作直接促成的 AHC 生成式 AI 使用规则(2025-06)

同类条目