AI for AIAI discovering better AI

用 AI 改进 AI 本身:自动发现更好的算法、模型架构、GPU kernel、奖励函数与 agent 设计。

33条目 9必读 4报告23论文5基准1项目
类型 分级 核查 标签

先读这三篇

进本方向的最短路径,由课题组指定
  1. 1AlphaEvolve: A coding agent for scientific and algorithmic discovery算法自动发现 · Google DeepMind · 2025DeepMind 用 Gemini 2.0 Flash+Pro 组成进化式编码 agent:LLM 生成代码 diff、自动评估器打分、MAP-elit…
  2. 2GEPA: Reflective Prompt Evolution Can Outperform Reinforcement LearningPrompt 与系统优化 · UC Berkeley / Databricks (DSPy 团队) · 2025把 prompt 当可学习参数,用 LLM 对执行轨迹做自然语言反思 + 遗传-Pareto 进化搜索来优化整个 AI 系统:六个任务上平均比 GRPO…
  3. 3Automated Design of Agentic Systems (ADAS)Agent 自动设计 · UBC (Jeff Clune 组) · 2024Jeff Clune 组正式定义了 ADAS(Automated Design of Agentic Systems)这个子领域,并给出首个在完整代码空…

算法自动发现

10

用 RL/进化搜索驱动程序生成,在数学与算法开放问题上发现超越人类已知的构造与实现(AlphaTensor 到 AlphaEvolve 一脉)。

项目 2025.05 有水分

OpenEvolve: Open-source implementation of AlphaEvolve

codelion(社区) · GitHub · 7.3k★

DeepMind AlphaEvolve(LLM 驱动的进化式程序/算法发现)的社区开源复现,已复现出多个超越基线的算法结果,是课题组做算法自动发现最容易上手的框架;7289 stars,2026-07 仍活跃。

背景与延伸

架构与训练组件

6

AI 自动发现或直接生成模型自身的组成部分:优化器、损失函数、奖励函数、网络架构与权重。

论文 2025.07 有水分

AlphaGo Moment for Model Architecture Discovery (ASI-Arch)

GAIR / 上海交大 · arXiv · 1.2k★

全自动 pipeline 跑了 1700+ 次训练实验、声称发现 106 个超越基线的线性注意力架构;标题营销味重、结论有争议,但作为 2025 年'LLM 驱动架构发现'规模最大的公开尝试值得批判性精读。

论文 2025.01 有水分

Transformer^2: Self-adaptive LLMs

Sakana AI · ICLR 2025 · 1.2k★兼属 Continual Learning

推理时按任务动态缩放权重矩阵的奇异值分量实现自适应,是 Text-to-LoRA 的前奏,也连接课题组的持续学习方向(模型自己调整自己的权重)。

Prompt 与系统优化

5

把 prompt 和复合 AI 系统当作可优化参数,用 LLM 反思、进化搜索或文本梯度自动改进整个系统。

论文 2024.06 有水分 ★ 必读

TextGrad: Automatic "Differentiation" via Text

Stanford (Zou Group) · Nature (2025) / arXiv · 3.7k★

把'自然语言反馈'类比成梯度,对复合 AI 系统(prompt、代码、分子设计、诊疗方案)做端到端文本反向传播优化,2025 年以 Optimizing generative AI by backpropagating language model feedback 发表于 Nature 正刊。它是 AI 优化 AI 系统这条线上被主流科学界正式接纳的代表作,与 OPRO/GEPA 构成必读三件套。

论文 2023.10 扎实 ★ 必读

DSPy: Compiling Declarative Language Model Calls into Self-Improving Pipelines

Stanford NLP · ICLR 2024 · 37.7k★

把 LM 流水线抽象成可声明式编程、可自动编译优化的模块(prompt 和权重都当可优化参数),是'用程序化方法自动改进 AI 系统'这一范式的事实标准框架(37k+ stars,2026-08 仍活跃);目录里已收的 GEPA 就是作为 DSPy 优化器落地的,缺了它这条线不完整。

论文 2023.09 扎实 ★ 必读

Large Language Models as Optimizers (OPRO)

Google DeepMind · ICLR 2024 · 774★

把 LLM 本身当优化器、用自然语言描述优化轨迹来迭代改进 prompt('Take a deep breath'即出自此文),是 prompt 自动优化方向被引最多的奠基工作。

Agent 自动设计

3

在代码与 workflow 空间自动搜索、进化 agent 系统的结构与拓扑,而非依赖人工设计。

论文 2024.08 有水分 ★ 必读

Automated Design of Agentic Systems (ADAS)

UBC (Jeff Clune 组) · ICLR 2025 · 1.6k★

提出用 Meta Agent 在代码空间里编程式地搜索新 agent 设计,正式定义了'agent 自动设计'这个子领域,是 AFlow、Darwin Gödel Machine 等后续工作共同引用的起点。

论文 2025.07 有水分

EvoAgentX: An Automated Framework for Evolving Agentic Workflows

EvoAgentX(社区/格拉斯哥大学) · arXiv · 3.3k★

把 TextGrad、AFlow、MIPRO 等自动优化器整合成统一框架,让多 agent 工作流的 prompt、拓扑随评测反馈自动进化,是 agent 自进化生态里维护最勤的开源项目;3274 stars,2026-08 仍活跃。

论文 2024.10 扎实

AFlow: Automating Agentic Workflow Generation

DeepWisdom / MetaGPT 团队 · ICLR 2025 (Oral) · 582★

把 agent workflow 建模成代码图、用 MCTS 自动搜索,比 ADAS 更工程化且成本敏感(小模型跑出的 workflow 打平大模型),是 workflow 级自动设计的代表实现。

Kernel 自动优化

5

让 LLM 生成并优化 GPU kernel(CUDA/Triton/多卡),自动化 AI 训练与推理的底层算力栈;含该方向的标准基准。

基准 2025.02 扎实

KernelBench: Can LLMs Write Efficient GPU Kernels?

Stanford (Scaling Intelligence Lab) · ICML 2025 · 1.2k★

250 个 PyTorch 负载的 GPU kernel 生成基准,定义了 fast_p 正确性+加速比指标;AI CUDA Engineer、Kevin 等 kernel 自动优化工作都在它上面评测,是该子方向的标准尺子。

基准 2025.02 有水分

TritonBench: Benchmarking Large Language Model Capabilities for Generating Triton Operators

清华 THUNLP 等 · ACL 2025 · 138★

首个 Triton 算子生成基准:184 个真实 GitHub 算子 + 166 个 PyTorch 对齐算子,同时测编译正确性和 GPU 效率;相比 CUDA 向的 KernelBench,Triton 是当下 LLM 训练/推理 kernel 的主流 DSL,与课题组关心的训练系统栈更贴近(ACL 2025,引用 78,GitHub 138 stars)。

背景与延伸

AI 提升 AI 的实证度量

4

只收对真实加速幅度的实证测量与专项基准(时间地平线、RCT、改训练算法基准),不收情景推演。

报告 2025.03 扎实 ★ 必读

Measuring AI Ability to Complete Long Tasks

METR · arXiv · 315★

提出'50% 任务时间地平线'指标并发现其每约 7 个月翻倍,是目前预测 AI 何时能自主完成研究级长任务(进而讨论 takeoff 时间线)被引用最多的经验规律。

基准 2026.08 扎实

AI4AI-Bench: Benchmarking LLM Agents in Algorithmic Design for Recursive Self-Improvement

Einsia Lab(含清华背景团队) · arXiv · 31★兼属 RSI

首个专门隔离'改训练算法本身'能力的 RSI 基准:10 个冻结科研仓库(对齐、RL、剪枝、遗忘、模型合并等),agent 有 4 小时在 B300 上重写训练算法,补丁再从零重跑 12 小时由隐藏评测器打分;6 个系统 29 种配置平均分仅 0.166,多数提交根本没碰学习机制——直接量化了当前 agent 离递归自我改进还有多远,与课题组 RSI 方向强相关(2026-08 刚发布,GitHub 31 stars,290 条轨迹全部公开)。

论文 2026.03 扎实

Measuring AI R&D Automation

Centre for the Governance of AI (GovAI) · arXiv兼属 RSI

系统梳理'AI 自动化 AI 研发到什么程度'的可测指标(实验型、调查型等),回答的正是 RSI 是否已经在真实研发流程中产生加速度这一课题组关心的问题。

兼收

2

主属其他方向、但与本方向直接相关的条目;彩点与角标标注其主方向。

基准 2026.05 扎实 ★ 必读

MLS-Bench: A Holistic and Rigorous Assessment of AI Systems on Building Better AI

清华 / Princeton / UW / UC Berkeley 等联合(Bohan Lyu、Simon Du、Dawn Song、Chi Jin 等) · arXiv · 107★主属 AutoResearch

140 个任务×12 个 ML 领域,不再考'把一个 Kaggle 管线调到最好',而是考 agent 能否发明可跨数据集、跨种子、跨规模泛化的新 ML 方法(新 loss、优化器、训练流程),结论是当前 agent 擅长工程式调参、远未达到真正的方法发明;已被 Qwen3.8-Max、Kimi K3 等前沿模型采纳为官方评测,配持续维护的社区排行榜(GitHub 107 stars,2026-08 仍活跃更新)。

基准 2026.03 扎实 ★ 必读

PostTrainBench: Can LLM Agents Automate LLM Post-Training?

Tübingen(Bethge Lab / AISA,Andriushchenko、Bethge 等) · ICML 2026 · 538★主属 AutoResearch

给 CLI agent(Claude Code、Codex 等)一块 H100、10 小时和一个 base LLM,完全自主地做后训练(SFT/蒸馏/RL 自选),看能把目标基准分数拉到多高;最佳 agent 23.2% vs 官方 instruct 模型 51.1%,还系统记录了训练集掺测试集、直接下载现成 checkpoint 等 reward hacking 行为,是追踪'AI 自动化 AI 研发'进度和风险的核心标尺(ICML 2026,GitHub 538 stars,2026-08 仍活跃)。