← 返回资料站  /  AI for AI
论文 架构搜索

AlphaGo Moment for Model Architecture Discovery (ASI-Arch)

ASI-Arch:LLM 多智能体自动发现线性注意力架构
一句话GAIR(上海交大)用一个 LLM 多智能体闭环(提出想法→写代码→训练→分析)在线性注意力这个子领域跑了 1,773 次自动实验(约 20,000 GPU 小时),声称发现 106 个'SOTA'架构;pipeline 和架构代码全开源,但'SOTA'只是在 340M 参数、15B token 的小规模设定下比 DeltaNet 平均高约 2 个点、比 Mamba2 高 0.7 个点,标题里的'AlphaGo Moment'和'ASI'远超实际证据。

这是什么

这篇论文想回答的问题是:能不能让 LLM 自主完成'神经网络架构研究'的全流程,而不是像传统 NAS 那样只在人类预先定义的搜索空间里调组合。作者把系统命名为 ASI-Arch,并给它设定了一个非常具体的战场:线性注意力(linear attention)机制,以 DeltaNet 为演化起点,基于 flash-linear-attention 和 FLAME 训练框架做真实训练验证。

系统由三部分组成:多智能体 pipeline(Researcher 提出动机并写 PyTorch 代码、Engineer 负责训练与自动 debug、Analyst 做实验分析)、MongoDB 架构数据库(存全部历史实验和演化谱系,FAISS 做想法去重)、以及一个 RAG 'Cognition Base'(约几百篇论文的结构化知识,供 agent 检索)。整个循环是:从 top-50 候选池采样父架构 → 演化出新设计 → 真实训练评测 → 分析入库。

宣传口径非常高:标题叫'AlphaGo Moment',摘要称之为'ASI4AI(Artificial Superintelligence for AI research)的首次演示',并声称建立了'科学发现本身的第一条 scaling law'。这些说法在社区引发不少反感(HN 上的典型评论:'如果真是 AlphaGo 级别的突破,轮不到作者自己来做这个类比')。值得注意的是,团队后来在 OpenReview 上以低调得多的标题 'Neural Architecture Discovery via Autonomous Evolution' 重新投稿。

ASI-Arch 系统结构:左边 Cognition Base 从论文库抽取结构化知识供 RAG 检索;中间 Researcher(提动机→写代码→查新颖性/正确性)和 Engineer(真实训练 + LLM 评委打 fitness 分);右边 Analyst 汇总 loss/动机/代码/父子关系产出分析报告,回灌数据库形成闭环。三块分别对应 repo 的 cognition_base/、pipeline/、database/ 目录。
ASI-Arch 系统结构:左边 Cognition Base 从论文库抽取结构化知识供 RAG 检索;中间 Researcher(提动机→写代码→查新颖性/正确性)和 Engineer(真实训练 + LLM 评委打 fitness 分);右边 Analyst 汇总 loss/动机/代码/父子关系产出分析报告,回灌数据库形成闭环。三块分别对应 repo 的 cognition_base/、pipeline/、database/ 目录。

机制与做法

两阶段探索—验证

探索阶段用 ~20M 参数模型、1B token 训练(2000 步,batch 256,GPT-2 tokenizer,FineWeb-edu 数据),每个 benchmark 只抽 500 条样本快速评测,共跑 1,773 个新架构、约 10,000 GPU 小时。从中筛出在 loss 和 benchmark 上都超过同规模 DeltaNet 的 1,350 个候选。

验证阶段把候选放大到 340M 参数(对齐 DeltaNet 配置)、1B token 训练约 400 个架构(再花 ~10,000 GPU 小时),其中 106 个超过基线,即论文所称的'106 个 SOTA 架构'。最后只挑 5 个(PathGateFusionNet、ContentSharpRouter、FusionGatedFIRNet、HierGateNet、AdaMultiPathGateNet)在 340M/15B token 设定下与 DeltaNet、Gated DeltaNet、Mamba2 正面对比。

论文所称'scientific discovery 的 scaling law':横轴是累计 GPU 小时,纵轴是累计发现的超基线架构数,约 7,000 小时对应 106 个。注意这只是吞吐量的近线性累计曲线(且'发现'的判据是自家 benchmark 阈值),没有拟合任何定律形式——看这张图时应带着这个保留。
论文所称'scientific discovery 的 scaling law':横轴是累计 GPU 小时,纵轴是累计发现的超基线架构数,约 7,000 小时对应 106 个。注意这只是吞吐量的近线性累计曲线(且'发现'的判据是自家 benchmark 阈值),没有拟合任何定律形式——看这张图时应带着这个保留。

Fitness 函数:定量 + LLM 评委

为了避免只优化 loss/benchmark 导致 reward hacking,fitness 由三部分组成:相对基线的 benchmark 提升、loss 提升(都过 sigmoid 变换,压平极端值、放大微小改进),再加一个 LLM-as-judge 从创新性、复杂度、实现正确性等维度打的主观分。父架构只从 top-50 候选池里采样,由 database 侧的 candidate_manager 维护。

一个值得注意的细节:演化的选择信号直接用了评测 benchmark(PIQA、HellaSwag、ARC 等)的分数,做了上千轮迭代选择,却没有独立的 held-out 测试集,对 benchmark 过拟合的风险论文没有正面处理(HN 上也有人指出这一点)。

自动化程度

工程上比较实在的部分:Engineer 模块带自动 debugger,训练报错时 agent 读日志改代码重试,使 pipeline 能无人值守连续跑;Novelty/Validity checker 结合 FAISS 相似度检索防止重复想法;所有实验(含失败)入库供后续 agent 检索。这套'自我积累经验'的基建是论文比多数 AI-scientist 类工作扎实的地方,代码在 repo 的 pipeline/、database/、cognition_base/ 三个目录里都能对上。

关键结果

实证核查

有水分pipeline、数据、106 个架构代码确实全开源、结构与论文描述一致,工程是真的;但'AlphaGo Moment'、'ASI'、'SOTA'、'scaling law'这几个核心宣传词全都严重超出证据:提升幅度小、规模小、选择过程有 benchmark 过拟合风险、无第三方复现,作者自己重投时也把标题改掉了。
发现 106 个 state-of-the-art 线性注意力架构,'systematically surpass human-designed baselines'。
'SOTA'的定义是在 340M 参数、1B token 训练下超过 DeltaNet 这一个基线;只有 5 个架构做了 15B token 的正面对比,最好平均分 48.51 vs Mamba2 的 47.84(+0.67 个点),HellaSwag 一项还输给 Mamba2(论文 Table:source/table/main_results.tex)。在这个 scale 上 <1 个点的平均差距难以支撑'系统性超越人类设计'。
建立了'科学发现本身的第一条 empirical scaling law'。
论文对应的 Figure(fig/scaling.pdf)只是把'累计超基线架构数'对 GPU 小时作图并观察到'strong linear relationship'(main.tex L370),没有任何拟合形式、没有跨设定验证;而且'发现数'的分母是同一套 benchmark 阈值筛选,把它称为 scaling law 是修辞而非结论。
全自动、端到端的架构科研系统,代码和架构全部开源。
这部分基本属实:GitHub repo(GAIR-NLP/ASI-Arch,Apache-2.0)有 pipeline/(evolve/eval/analyse 三模块)、database/(MongoDB+FAISS+candidate_manager)、cognition_base/(OpenSearch RAG),与论文描述一一对应;data/106.json(3.7MB)包含 106 个架构。issues 里主要是安装/环境问题(#4 mongodb_api 缺依赖、#11 API 连接失败),没有'跑通全 pipeline 复现结果'的报告,也没有人声称复现出架构的性能优势。
标题与摘要将其定位为 AlphaGo Moment / ASI4AI 的首次演示。
社区普遍认为宣传远超实质:HN 讨论(news.ycombinator.com/item?id=44696443)集中批评标题和摘要像 PR 稿,并质疑用评测 benchmark 做上千轮演化选择的 test-set 过拟合问题;团队随后在 OpenReview(forum hzGsPt40N0)以'Neural Architecture Discovery via Autonomous Evolution'的中性标题重投,自己也放弃了'AlphaGo Moment'的说法。
摘要称 AI 研究受限于人类认知,ASI-Arch 'shatters this fundamental constraint'。
实际搜索空间仍然很受限:起点固定为 DeltaNet、领域固定为 linear attention、训练配方固定(FLAME + FineWeb-edu + 固定超参),agent 演化的只是 token-mixing 模块的 PyTorch 代码。这比传统 NAS 的搜索空间开放,但离'不受人类定义空间限制'还差得远。

与我们方向的关系

对做 AI4AI / 自动化科研的同学,这是 2025 年'LLM 驱动架构发现'规模最大、开源最完整的一次尝试,值得借鉴的是工程件而非结论:带自动 debug 的无人值守训练循环、FAISS 想法去重、把历史实验分析回灌给 planner 的记忆机制、以及'定量指标 + LLM judge'的复合 fitness 设计(sigmoid 压平防 reward hacking)。这些模块可以直接拆出来用在自己的自动实验系统里。

同样值得学的是它的反面:如果要做类似工作,务必留独立 held-out 评测防止演化过程对 benchmark 过拟合、报告统计显著性(1,773 次实验里筛出 106 个,本身就有多重比较问题)、并在多于一个 scale 上验证'小模型上的赢家在大模型上仍然赢'——这正是本文没做、也是社区质疑最集中的三点。

阅读笔记

复现门槛不低:需要 MongoDB + OpenSearch 双 Docker 服务,pipeline 依赖 OpenAI agents SDK,issues 里有 ARK_API_KEY(火山方舟)的报错,说明实际跑实验用的 LLM 后端和论文没完全说清。README 里'Paper: Coming Soon'的占位一直没改,repo 2025-12 后无实质更新。读论文时注意区分:1,773 是探索次数(20M 模型),400 是验证次数(340M/1B token),106 是超基线数,5 是做了 15B token 完整对比的数量——媒体转述经常把这几个数混在一起。

材料清单

TeX 源码
已存档:Raw/alphago-moment-for-model-architecture-asi/source/
代码仓库github.com/GAIR-NLP/ASI-Arch
1184★ · 最近推送 2025-12-03
架构画廊gair-nlp.github.io/ASI-Arch/
106 个发现架构的展示页;架构代码也在 repo 的 data/106.json
HN 讨论news.ycombinator.com/item?id=44696443
社区对标题营销和 benchmark 过拟合的批评
OpenReview 重投版本openreview.net/forum?id=hzGsPt40N0
改名为 'Neural Architecture Discovery via Autonomous Evolution',标题明显收敛