ShinkaEvolve: Towards Open-Ended and Sample-Efficient Program Evolution
Sakana 的开源进化编码框架,主打样本效率(circle packing 只用约 150 次评估达到 SOTA),并演示了用它自动改进 MoE 负载均衡损失——直接是'AI 改进 AI 训练组件'的案例。
用 AI 改进 AI 本身:自动发现更好的算法、模型架构、GPU kernel、奖励函数与 agent 设计。
用 RL/进化搜索驱动程序生成,在数学与算法开放问题上发现超越人类已知的构造与实现(AlphaTensor 到 AlphaEvolve 一脉)。
Sakana 的开源进化编码框架,主打样本效率(circle packing 只用约 150 次评估达到 SOTA),并演示了用它自动改进 MoE 负载均衡损失——直接是'AI 改进 AI 训练组件'的案例。
Gemini 驱动的进化式编码 agent,发现了 48 次乘法的 4x4 矩阵乘法算法并优化了 Google 数据中心调度与 TPU 电路,是'AI 改进 AI 自身基础设施'最有说服力的实证,RSI 讨论绕不开它。
用 LLM 生成程序加进化搜索,首次在 cap set 等开放数学问题上发现超越人类已知的构造,是后续 AlphaEvolve/OpenEvolve/ShinkaEvolve 整条'LLM+进化搜索程序空间'路线的源头。
系统梳理 LLM 用于算法设计的四种角色与搜索方法(114 引,CSUR),正是 FunSearch/EoH/AlphaEvolve 这条线的领域地图,作者组是 EoH 原班人马。
LLM 与进化计算互相增强的双向综述加路线图(222 引,TEVC),是站内 AlphaEvolve/Promptbreeder/DiscoPOP 等进化式 AI4AI 工作的总纲。
基于 AtCoder 启发式赛题的长时程算法工程基准,考察 agent 在数小时到数天尺度上迭代改进无最优解问题的能力;配套的 ALE-Agent 在真人比赛中拿到前 2% 名次。
DeepMind AlphaEvolve(LLM 驱动的进化式程序/算法发现)的社区开源复现,已复现出多个超越基线的算法结果,是课题组做算法自动发现最容易上手的框架;7289 stars,2026-07 仍活跃。
RL 在汇编指令级发现更快的排序算法并合入 LLVM libc++,证明 AI 优化能落到所有软件依赖的底层库,是 AlphaTensor 到 AlphaEvolve 之间的关键一环。
把矩阵乘法算法发现建模成单人游戏、用 AlphaZero 式 RL 打破 Strassen 算法 50 年纪录,是'AI 发现 AI 底层计算算法'的奠基性早期工作(LLM 时代之前的路线代表)。
AI 自动发现或直接生成模型自身的组成部分:优化器、损失函数、奖励函数、网络架构与权重。
全自动 pipeline 跑了 1700+ 次训练实验、声称发现 106 个超越基线的线性注意力架构;标题营销味重、结论有争议,但作为 2025 年'LLM 驱动架构发现'规模最大的公开尝试值得批判性精读。
训练一个超网络,仅凭任务的自然语言描述就直接生成该任务的 LoRA 权重、零微调即用——'用模型生成模型参数'这一 AI4AI 分支的代表作。
推理时按任务动态缩放权重矩阵的奇异值分量实现自适应,是 Text-to-LoRA 的前奏,也连接课题组的持续学习方向(模型自己调整自己的权重)。
让 LLM 提出并进化偏好优化损失函数的代码,发现的 DiscoPOP 损失在多个对齐基准上超过 DPO——'用 LLM 发现训练 LLM 的算法'这一闭环的早期代表。
用 GPT-4 进化生成 RL 奖励函数代码,在 29 个机器人任务上超过人类专家写的 reward(并教会机械手转笔),证明 LLM 能自动设计 RL 训练的关键组件。
用程序空间的符号进化搜索发现了 Lion 优化器,比 AdamW 更省内存且被广泛实用采纳——机器发现的训练算法真正进入生产的少数案例(pre-LLM 路线)。
把 prompt 和复合 AI 系统当作可优化参数,用 LLM 反思、进化搜索或文本梯度自动改进整个系统。
用自然语言反思+遗传-帕累托进化优化整个 AI 系统的 prompt,在多任务上以少 35 倍 rollout 胜过 GRPO 强化学习;已集成进 DSPy、repo 6k+ star,是 2025 年后 prompt/系统优化的事实标杆。
把'自然语言反馈'类比成梯度,对复合 AI 系统(prompt、代码、分子设计、诊疗方案)做端到端文本反向传播优化,2025 年以 Optimizing generative AI by backpropagating language model feedback 发表于 Nature 正刊。它是 AI 优化 AI 系统这条线上被主流科学界正式接纳的代表作,与 OPRO/GEPA 构成必读三件套。
把 LM 流水线抽象成可声明式编程、可自动编译优化的模块(prompt 和权重都当可优化参数),是'用程序化方法自动改进 AI 系统'这一范式的事实标准框架(37k+ stars,2026-08 仍活跃);目录里已收的 GEPA 就是作为 DSPy 优化器落地的,缺了它这条线不完整。
把 LLM 本身当优化器、用自然语言描述优化轨迹来迭代改进 prompt('Take a deep breath'即出自此文),是 prompt 自动优化方向被引最多的奠基工作。
进化 task-prompt 的同时也进化'如何变异 prompt'的 mutation-prompt,自指式自改进的早期具体实现,概念上直接连到课题组的 RSI 方向;无官方开源代码。
在代码与 workflow 空间自动搜索、进化 agent 系统的结构与拓扑,而非依赖人工设计。
提出用 Meta Agent 在代码空间里编程式地搜索新 agent 设计,正式定义了'agent 自动设计'这个子领域,是 AFlow、Darwin Gödel Machine 等后续工作共同引用的起点。
把 TextGrad、AFlow、MIPRO 等自动优化器整合成统一框架,让多 agent 工作流的 prompt、拓扑随评测反馈自动进化,是 agent 自进化生态里维护最勤的开源项目;3274 stars,2026-08 仍活跃。
把 agent workflow 建模成代码图、用 MCTS 自动搜索,比 ADAS 更工程化且成本敏感(小模型跑出的 workflow 打平大模型),是 workflow 级自动设计的代表实现。
让 LLM 生成并优化 GPU kernel(CUDA/Triton/多卡),自动化 AI 训练与推理的底层算力栈;含该方向的标准基准。
端到端把 PyTorch 算子翻译并进化成 CUDA kernel,放出 1.7 万条 kernel 数据集;发布后被发现部分加速数字源于评测漏洞(reward hacking),连同其教训一起构成 kernel 自动优化方向的重要案例。
250 个 PyTorch 负载的 GPU kernel 生成基准,定义了 fast_p 正确性+加速比指标;AI CUDA Engineer、Kevin 等 kernel 自动优化工作都在它上面评测,是该子方向的标准尺子。
首个 Triton 算子生成基准:184 个真实 GitHub 算子 + 166 个 PyTorch 对齐算子,同时测编译正确性和 GPU 效率;相比 CUDA 向的 KernelBench,Triton 是当下 LLM 训练/推理 kernel 的主流 DSL,与课题组关心的训练系统栈更贴近(ACL 2025,引用 78,GitHub 138 stars)。
只收对真实加速幅度的实证测量与专项基准(时间地平线、RCT、改训练算法基准),不收情景推演。
提出'50% 任务时间地平线'指标并发现其每约 7 个月翻倍,是目前预测 AI 何时能自主完成研究级长任务(进而讨论 takeoff 时间线)被引用最多的经验规律。
首个专门隔离'改训练算法本身'能力的 RSI 基准:10 个冻结科研仓库(对齐、RL、剪枝、遗忘、模型合并等),agent 有 4 小时在 B300 上重写训练算法,补丁再从零重跑 12 小时由隐藏评测器打分;6 个系统 29 种配置平均分仅 0.166,多数提交根本没碰学习机制——直接量化了当前 agent 离递归自我改进还有多远,与课题组 RSI 方向强相关(2026-08 刚发布,GitHub 31 stars,290 条轨迹全部公开)。
系统梳理'AI 自动化 AI 研发到什么程度'的可测指标(实验型、调查型等),回答的正是 RSI 是否已经在真实研发流程中产生加速度这一课题组关心的问题。
随机对照试验发现资深开源开发者用 AI 工具反而慢了 19%,但自我感觉快了 20%;提醒课题组'AI 加速研发'的主观报告和客观测量可能严重背离,评测设计必须警惕这一点。
主属其他方向、但与本方向直接相关的条目;彩点与角标标注其主方向。
140 个任务×12 个 ML 领域,不再考'把一个 Kaggle 管线调到最好',而是考 agent 能否发明可跨数据集、跨种子、跨规模泛化的新 ML 方法(新 loss、优化器、训练流程),结论是当前 agent 擅长工程式调参、远未达到真正的方法发明;已被 Qwen3.8-Max、Kimi K3 等前沿模型采纳为官方评测,配持续维护的社区排行榜(GitHub 107 stars,2026-08 仍活跃更新)。
给 CLI agent(Claude Code、Codex 等)一块 H100、10 小时和一个 base LLM,完全自主地做后训练(SFT/蒸馏/RL 自选),看能把目标基准分数拉到多高;最佳 agent 23.2% vs 官方 instruct 模型 51.1%,还系统记录了训练集掺测试集、直接下载现成 checkpoint 等 reward hacking 行为,是追踪'AI 自动化 AI 研发'进度和风险的核心标尺(ICML 2026,GitHub 538 stars,2026-08 仍活跃)。