← 返回资料站  /  AI for AI
报告 算法发现 ★ 必读

AlphaEvolve: A coding agent for scientific and algorithmic discovery

AlphaEvolve:用进化式编码 agent 做科学与算法发现
一句话DeepMind 用 Gemini 2.0 Flash+Pro 组成进化式编码 agent:LLM 生成代码 diff、自动评估器打分、MAP-elites 风格数据库存优胜程序。在 50+ 个数学开放问题上 75% 追平 SOTA、20% 打破 SOTA(含 4x4 复矩阵乘法 48 次乘法),并已部署进 Google 生产系统(数据中心调度回收 0.7% 算力、Gemini 训练提速 1%)。

这是什么

AlphaEvolve 是 FunSearch(Romera-Paredes et al. 2023)的直接放大版:同样是'LLM 提议代码变异 + 自动评估器打分 + 进化数据库筛选'的循环,但从只能进化单个 Python 函数升级到进化整个代码文件(任意语言,靠 # EVOLVE-BLOCK-START/END 注释标记),从单一小模型升级到 Gemini 2.0 Flash(高吞吐出点子)+ Pro(偶尔给高质量突破)的组合,且单次评估允许花到上百 compute-hours。它只适用于'解可以被机器自动打分'的问题——用户必须提供一个 evaluate 函数。

白皮书展示了两类战绩。数学侧:在矩阵乘法张量分解上刷新 14 组 (m,n,p) 参数的已知最优,最出圈的是 4x4 复矩阵 48 次标量乘法(张量秩意义下 56 年来首次低于 Strassen 递归的 49);在 50+ 个分析/组合/几何开放问题上 75% 复现已知最优、20% 打破纪录(如 11 维 kissing number 从 592 提到 593)。工程侧:Borg 数据中心调度启发式(已全量部署,平均回收 0.7% 机群算力)、Gemini 训练关键 matmul kernel 的 tiling 启发式(kernel 平均提速 23%,整体训练时间省 1%)、TPU 算术电路 Verilog 简化、FlashAttention 的 XLA IR 直接优化(kernel 提速 32%)。

它在'AI 改进 AI 自身'叙事里的位置:AlphaEvolve 优化了训练它自己所依赖的 LLM(Gemini)的 kernel,也优化了跑它的 TPU 电路——这是目前 RSI(递归自我改进)讨论中最常被引用的实证案例,不过每一环都仍有人类工程师做验证和部署决策,循环并未闭合。

矩阵乘法张量分解任务上的消融。纵轴为聚合目标指标(越高越好),横轴为算力预算比例。完整方法(绿)始终领先;去掉进化(蓝,反复喂同一初始程序给 LLM)断崖式落后,说明战绩来自进化框架而非 Gemini 裸能力;去掉 meta-prompt、只用小模型、去掉上下文、只进化单函数各有可见损失。
矩阵乘法张量分解任务上的消融。纵轴为聚合目标指标(越高越好),横轴为算力预算比例。完整方法(绿)始终领先;去掉进化(蓝,反复喂同一初始程序给 LLM)断崖式落后,说明战绩来自进化框架而非 Gemini 裸能力;去掉 meta-prompt、只用小模型、去掉上下文、只进化单函数各有可见损失。

机制与做法

任务规格:evaluate 函数 + EVOLVE-BLOCK 标注

用户提供三样东西:一个返回标量分数字典的 evaluate 函数(可以几秒跑完,也可以是训练一个模型的大计算)、一份初始程序(哪怕是返回常数的一行函数)、以及用注释标出的待进化代码块。其余代码作为骨架不动。抽象层次可以自由选:直接进化解本身、进化构造解的函数(FunSearch 的做法)、或者进化一个在固定时间预算内跑的搜索算法——论文发现对称性强的问题适合进化构造函数,不对称的问题适合进化定制搜索算法。

数学结果的关键 trick 是最后这种:每代进化的是'搜索启发式'程序,给它 1000 秒预算和上一代找到的最好构造作起点,选择压力落在'谁更擅长把已经很好的解再改进一点'上。最终解往往是一串接力的启发式产物——早期的擅长从随机解大步前进,后期的擅长精调近优解。

Kissing number 任务上的消融,差距比矩阵乘法任务更悬殊:完整方法在 25% 预算处就收敛到远超两个消融版本 100% 预算的水平。'No context in the prompt' 和 'No evolution' 都卡在低水平,进化循环与问题上下文缺一不可。
Kissing number 任务上的消融,差距比矩阵乘法任务更悬殊:完整方法在 25% 预算处就收敛到远超两个消融版本 100% 预算的水平。'No context in the prompt' 和 'No evolution' 都卡在低水平,进化循环与问题上下文缺一不可。

进化循环:prompt 采样 → LLM 出 diff → 级联评估 → 程序数据库

Prompt sampler 从程序数据库采样多个历史高分程序拼进 prompt(还可加人写的问题背景、随机化模板、甚至 LLM 自己进化出来的 meta-prompt);LLM 以 SEARCH/REPLACE diff 格式输出修改(短代码则整块重写);评估侧支持难度递增的 cascade(先小规模测试快速淘汰废案)、LLM 打分补充难以量化的指标(如程序简洁性)、以及并行化评估。数据库用 MAP-elites + island model 的混合算法平衡探索与利用,支持同时优化多个指标——论文发现即使只关心单一指标,多指标优化也常常让目标指标更好。

整个 pipeline 用 asyncio 实现,为吞吐量而非单次延迟优化。模型组合上,Flash 负责量、Pro 负责质;论文明确说 AlphaEvolve 是 model-agnostic 的,且底层模型越强效果越好。

AlphaEvolve 发现的 26 个圆在单位正方形内的 packing 构造(最大化半径之和,得 2.635)。这是后来被 OpenEvolve 用公开模型复现到 0.04% 以内、社区又进一步刷新到 2.635977 的那个问题——本文结果可复现性的最好例证。
AlphaEvolve 发现的 26 个圆在单位正方形内的 packing 构造(最大化半径之和,得 2.635)。这是后来被 OpenEvolve 用公开模型复现到 0.04% 以内、社区又进一步刷新到 2.635977 的那个问题——本文结果可复现性的最好例证。

消融:进化和上下文缺一不可

在矩阵乘法和 kissing number 两个任务上消融五个组件:去掉进化(反复喂初始程序)掉得最惨;去掉 prompt 里的问题上下文、只用小模型、去掉 meta-prompt 进化、只进化损失函数(不进化全文件)各自都有明显损失。kissing number 任务上 full method 与消融版的差距尤其悬殊(见图)。这组消融是论文里少有的可横向比较的定量证据,说明战绩不是'Gemini 本来就会',而是进化框架 + 长上下文 prompt 工程的叠加。

AlphaEvolve 对初始张量分解程序的完整 diff(绿增红删)。它把一个朴素的 Adam 梯度下降改造成带循环退火裁剪、随机噪声探索、hallucination 正则、离散化损失和超参自动采样的复合算法——展示进化终点与人类可读性可以兼得,4x4 的 48 次乘法结果就出自这类演化出的搜索程序。
AlphaEvolve 对初始张量分解程序的完整 diff(绿增红删)。它把一个朴素的 Adam 梯度下降改造成带循环退火裁剪、随机噪声探索、hallucination 正则、离散化损失和超参自动采样的复合算法——展示进化终点与人类可读性可以兼得,4x4 的 48 次乘法结果就出自这类演化出的搜索程序。

局限(论文自己承认的)

只能做自动可评估的问题,需要人写 evaluate 函数和问题形式化(数学结果大多由 Terence Tao、Javier Gomez-Serrano 等外部数学家建议并指导形式化);单次运行烧的采样和评估算力不小(评估一个解可到 100 compute-hours 量级);TPU 电路那条战绩论文自己承认下游综合工具也能独立发现同一优化,属于'能力演示'而非独有贡献。

关键结果

实证核查

扎实数学结果全部附可运行的验证 Colab 且经第三方检验,方法本身已被开源社区复现出同量级结果;但系统代码闭源,基础设施战绩(0.7%、1%、23%)只能信 Google 自述,'56 年首次'的标题党表述需要脚注里的限定条件才成立。
'AlphaEvolve 首次用 48 次标量乘法完成 4x4 复矩阵乘法,是 56 年来对 Strassen 算法(该设定下)的首次改进。'
发布当天就被 Hacker News 和 mathstodon 上的人指出:Winograd 1968 年的算法早就能用 48 次乘法算 4x4(对任何交换环)。争议的关键在限定条件——AlphaEvolve 的 48 是双线性/张量秩意义下的(不依赖元素交换律,因此可递归用于分块大矩阵),Winograd 方案不可递归。论文正文脚注确实承认了这点('存在少于 49 次乘法的算法,但不对应张量分解、不能递归'),Tao 在 mathstodon 上也帮忙澄清过。结论:技术声称成立,但 blog 层面的宣传省略了限定词,容易误读。见 news.ycombinator.com/item?id=43985489、mathstodon.xyz/@robinhouston/114507937280899656。
数学发现'可证明正确',结果开源可查。
github.com/google-deepmind/alphaevolve_results 提供 mathematical_results.ipynb,包含全部 SOTA-breaking 构造和验证代码,任何人可在 Colab 跑通。有人真的去挑刺:issue #2 质疑 11 维 kissing number(B.11)验证代码里的不等式写错,DeepMind 回应确认该检查冗余、修正后验证仍通过,并更新了论文附录。注意两点折扣:仓库只含打破 SOTA 的实例(75% 追平的那部分未放出),且明确声明不含 AlphaEvolve 系统本身的代码——系统完全闭源。
方法具有普适性,'AlphaEvolve 这类 coding agent 能广泛影响科学与计算'。
开源复现 OpenEvolve(github.com/algorithmicsuperintelligence/openevolve,6k+ stars)在发布一周内用公开 LLM 复现了 circle packing 结果(2.634 vs 论文 2.635,差 0.04%),后来社区甚至在 issue #156 上推到 2.635977 刷新了论文数字——核心方法论可复现是坐实的。反面证据也有:2026 年 Towards AI 有人拿 OpenEvolve 跑 18 个算法优化任务,发现大量 reward hacking(利用评估器漏洞虚报 321% 提升),印证这类系统的天花板在 evaluate 函数写得严不严,而 DeepMind 内部有专家把关这一环,外部用户未必有。
基础设施战绩:回收 0.7% 全球机群算力、Gemini 训练时间降 1%、TPU 电路简化进入下一代芯片、FlashAttention kernel 提速 32%。
全部发生在 Google 内部系统上,无任何外部可验证途径,只能作为公司自述采信。论文自己也给了两处降温:TPU 那条 Verilog 简化'也被下游综合工具独立发现'(即并非只有 AlphaEvolve 能做);Borg 启发式是'早期版本的 AlphaEvolve'发现的,且部署决策、正确性验证都靠人类工程师。这些数字方向上可信(与 Google 后续持续宣传一致),但精确值不可核查。
论文承诺'更多数学问题的细节将在后续论文给出'。
兑现了:2025-11 的 arXiv:2511.02864(Georgiev et al., 'Mathematical exploration and discovery at scale',Tao 与 Gomez-Serrano 深度参与)把问题扩到 67 个,已被引 112 次;Tao 在 mathstodon 上公开记录了合作过程。这条后续增强了原报告数学部分的可信度。

与我们方向的关系

对 ai4ai 方向这是必读的锚点工作:它给出了'LLM 不需要更聪明,只需要一个进化外循环 + 可靠的自动评估器,就能产出超越人类 SOTA 的结果'的最强证据,而且消融干净地归因于进化框架而非底层模型。讨论 RSI 时它是目前最接近实证的案例(优化自己训练用的 kernel 和 TPU),但也要注意每一环仍有人类把关,不能过度引申。

可借鉴的工程细节:evaluate 函数的评估级联(先廉价测试再上主测试)、进化'搜索启发式'而非解本身的间接抽象、多指标优化对单指标的正外部性、Flash+Pro 的吞吐/质量分工、meta-prompt 共同进化。想上手不必等 DeepMind 开源——OpenEvolve 已复现核心结果,可直接拿来在自己的可自动评分问题上试;但 Towards AI 那篇 reward hacking 报告提醒:评估器写不严,进化循环会全力欺骗你,这本身也是个值得研究的题目。

阅读笔记

白皮书成文于 2025-05(blog 同步),arXiv 编号 2506.13131 是 6 月才挂的。所用模型是 Gemini 2.0 代(Flash+Pro),不是 2.5;论文强调 model-agnostic。读源码 tex 时注意 discovered_program.tex/fig14 那份完整 diff 很值得细看:AlphaEvolve 给张量分解程序加的是循环退火裁剪阈值、hallucination 正则、离散化损失等相当有物理感的 trick,不是瞎搜。

材料清单

TeX 源码
已存档:Raw/alphaevolve/source/
代码仓库github.com/google-deepmind/alphaevolve_results
301★ · 最近推送 2026-01-05
结果验证 Colabcolab.research.google.com/github/google-deepmind/alphaevolve_results/blob/master/mathematical_results.ipynb
全部 SOTA-breaking 数学构造 + 验证代码,可直接运行核对
开源复现github.com/algorithmicsuperintelligence/openevolve
OpenEvolve:社区复现,circle packing 达 2.635977(超过原论文),6k+ stars
后续论文arxiv.org/abs/2511.02864
Mathematical exploration and discovery at scale(2025-11):与 Tao/Gomez-Serrano 合作,67 个数学问题
48 次乘法争议news.ycombinator.com/item?id=43985489
HN 讨论:Winograd 1968 vs AlphaEvolve 的张量秩限定条件
验证挑刺 issuegithub.com/google-deepmind/alphaevolve_results/issues/2
第三方质疑 kissing number 验证代码,DeepMind 确认冗余检查并修正,结果仍成立

同类条目