← 返回资料站  /  Recursive Self-Improvement
博客 一线 lab 立场 ★ 必读

When AI builds itself (Anthropic on recursive self-improvement)

当 AI 开始构建自己:Anthropic 谈递归自我改进的现状
一句话Anthropic Institute 2026 年 6 月的长文,首次系统公开内部数据:截至 2026 年 5 月,Anthropic 合并代码的 80%+ 由 Claude 撰写、工程师人均代码量达 2024 年的 8 倍,并用三个内部实验论证模型正接近'研究品味';结论是 RSI 尚未发生但'可能比多数机构准备好的时间来得更早',并主张世界应具备'可验证的多边暂停'选项。

这是什么

这是 Anthropic Institute 发表的立场文章(作者 Marina Favaro 和 Jack Clark,2026 年 6 月 4 日),主题是递归自我改进(recursive self-improvement, RSI)——AI 自主设计并开发自己的后继模型。文章的核心论点很直接:Anthropic 正把越来越多的 AI 开发工作交给 AI 自己做,这个趋势外推下去就是 RSI;它还没发生、也不是必然,'但可能比大多数机构准备好的时间来得更早'。

文章结构分七块:开发方式的时代划分(2021-2023 人写代码 → 2023-2025 chatbot 辅助 → 2025-2026 coding agent → 当下的自主 agent → 假想的 20XX '闭环');外部证据(METR time horizon、SWE-bench、CORE-Bench 饱和);内部证据(代码归因、Claude Code session 成功率、三个前沿实验);Anthropic 内部工作方式的变化;反方论证('What if we're wrong?');三种未来情景;政策主张。

值得注意的是这篇文章的写法:它是前沿 lab 里少见的、大量自曝 caveat 的一手陈述——几乎每个内部数字都附带脚注说明其局限(lines of code 高估生产力、员工自评有偏、实验不迁移到生产规模模型等)。Ethan Mollick 评价其 'empirical sections are strong';但它同时也是一篇服务于政策议程(可验证暂停机制)的宣传文本,这两重性质是读它时要始终记住的。

人均合并代码量(按季度,相对 2025 年前平均值的倍数,2021 Q2-2026 Q2)。2025 年前始终在 1x 上下波动,Claude Code 上线(2025 年初)后开始起飞:1.2x → 1.5x → 1.9x → 2.5x → 5.8x → 8.0x(2026 Q2,斜纹为不完整季度)。注意脚注:per-PR 行数在 99 分位截断,这是全文最被引用也最该打折的图——量≠质。
人均合并代码量(按季度,相对 2025 年前平均值的倍数,2021 Q2-2026 Q2)。2025 年前始终在 1x 上下波动,Claude Code 上线(2025 年初)后开始起飞:1.2x → 1.5x → 1.9x → 2.5x → 5.8x → 8.0x(2026 Q2,斜纹为不完整季度)。注意脚注:per-PR 行数在 99 分位截断,这是全文最被引用也最该打折的图——量≠质。

机制与做法

外部证据:time horizon 与基准饱和

文章引用 METR 的任务时长趋势:AI 能可靠独立完成的任务长度大约每 4 个月翻倍(此前是 7 个月)。具体锚点:Claude Opus 3(2024 年 3 月)约 4 分钟的任务,一年后 Sonnet 3.7 约 90 分钟,再一年后 Opus 4.6 达 12 小时;METR 测到 Claude Mythos Preview 能连续工作'至少' 16 小时——已到 METR 可测量的上限。脚注说明这是 50% 可靠性口径,80% 口径趋势线相同。

基准方面:SWE-bench 两年内从个位数到饱和;CORE-Bench(复现研究论文)从 2024 年的约 20% 到 15 个月后饱和。文章还给了个宏观旁证:GitHub 2025 年全年约 10 亿次 commit,到 2026 年年中已是每周 2.75 亿次。

内部 Claude Code session 成功率(周度、4 周滑动平均、LLM 判定),按 LLM 分类器给的四档难度分层。trivial/routine 两档早已高位平缓,关键看最下面的 open-ended problems 曲线:2025 年 11 月约 26%,2026 年 5 月达 76%——文中'六个月涨 50 个百分点'的出处。Mythos Preview 内部可用(2026 年 2 月末)处有一个明显跳变。
内部 Claude Code session 成功率(周度、4 周滑动平均、LLM 判定),按 LLM 分类器给的四档难度分层。trivial/routine 两档早已高位平缓,关键看最下面的 open-ended problems 曲线:2025 年 11 月约 26%,2026 年 5 月达 76%——文中'六个月涨 50 个百分点'的出处。Mythos Preview 内部可用(2026 年 2 月末)处有一个明显跳变。

内部证据:代码归因与 session 成功率

核心数字:截至 2026 年 5 月,Anthropic 合并代码中 80% 以上由 Claude 撰写(归因 pipeline 有缺口,领导层公开估计含脚本/实验代码在内超过 90%);在 2025 年 2 月 Claude Code 上线之前这个比例还是个位数。工程师人均每天合并的代码量,2026 年 Q2 是 2024 年的 8 倍——作者自己承认 lines of code 是重量不重质的指标,8 倍'几乎肯定高估了真实生产力增益'。2026 年 3 月对 130 名员工的调查中位数自评约 4 倍提速,作者也援引 METR 研究指出开发者普遍高估 AI 增益,认为真实值'somewhat lower'。

更有信息量的是按任务难度分层的内部 Claude Code session 成功率(LLM 判定):最难的 open-ended problems 一档,成功率在 2026 年 5 月达到 76%,六个月内涨了 50 个百分点(见图)。单点案例:2026 年 4 月 Claude 自主提交 800+ 个修复,把某类 API 错误降低 1000 倍,估算相当于 4 年人力;回溯分析显示,自动化 Claude review 本可拦下 claude.ai 历史事故背后约 1/3 的 bug。

'研究员走弯路时,Claude 能选出更好的下一步吗':129 个真实研究 session 切片上,各代模型建议胜过人类实际选择的比例。从 Haiku 3 的 22% 单调爬升到 Mythos Preview 的 64%(虚线为 90% 的 practical ceiling)。读图时记住样本全部选自'人类有改进空间'的时刻——在人类决策本已良好的对照集上模型只赢约 20%。
'研究员走弯路时,Claude 能选出更好的下一步吗':129 个真实研究 session 切片上,各代模型建议胜过人类实际选择的比例。从 Haiku 3 的 22% 单调爬升到 Mythos Preview 的 64%(虚线为 90% 的 practical ceiling)。读图时记住样本全部选自'人类有改进空间'的时刻——在人类决策本已良好的对照集上模型只赢约 20%。

三个前沿实验:从'写代码'到'研究品味'

训练代码加速实验:每次新模型发布时让它优化同一份小模型训练代码,在通过相同正确性检查的前提下尽量提速。Opus 4(2025 年 5 月)约 3x,Mythos Preview(2026 年 4 月)约 52x;熟练人类工程师花 4-8 小时约 4x。脚注承认倍数取决于初始代码的优化余量,不代表真实训练加速,重点是同口径的代际对比。

自动化安全研究实验(2026 年 4 月):让 Claude agent 群解一个开放的 weak-to-strong supervision 问题——提假设、做实验、并行 agent 间共享发现、迭代。以弱监督者单独表现为下限、用正确答案训练的强模型为上限:两名人类研究员一周恢复约 23% 的差距,agent 群用 800 累计小时、约 1.8 万美元算力恢复了 97%。Caveat:结果没能干净地迁移到生产规模模型,且问题选择和评分 rubric 都是人定的。

下一步判断测试:从 2026 年 1-3 月真实 Claude Code 研究 session(如诊断崩溃的训练 run)中选出 129 个'人类走了弯路'的时刻,只给模型看弯路前的上下文,问它下一步怎么走,由一个能看到 session 最终结局的 Claude judge 裁决。Opus 4.5(2025 年 11 月)51% 的情况下胜过人类的实际选择,Mythos Preview(2026 年 4 月)达 64%,'practical ceiling' 约 90%。作者自己标注了选择偏差:样本刻意选在人类决策有改进空间的时刻;在另外 127 个人类决策本来就不错的时刻上,模型只有约 20% 胜出。

三种未来与政策主张

文章给出三种情景:(1) 趋势撞上 S 曲线停滞(算力/能源瓶颈)——作者认为最不可能;(2) 效率增益持续复利、人类保留方向设定权——作者的预期路径,但受 Amdahl 定律制约(如人类 code review 成为瓶颈);(3) 完全 RSI,进展只受算力限制,最大不确定性是对齐——失配可能在后继模型代际间复利放大。

政策主张是全文的落点:世界应当拥有'放慢或暂停前沿开发'的选项,但前提是可验证的多边协调——单边暂停只会'换一个领跑者'。Anthropic 承诺:若验证机制存在且其他前沿开发者可验证地暂停,它预期自己也会暂停。难点被如实列出:训练 run 比导弹发射井难探测得多、算力是通用投入、违约激励巨大;INF 条约这类机制花了几十年建立,'我们没有那么长时间'。后续行动是组织与政策界、公民社会的对话并公开结果。

关键结果

实证核查

有水分作为一手陈述罕见地诚实——几乎每个数字都自带 caveat,coding 自动化加速这个核心事实无人质疑;但所有关键数字都是不可审计的内部自报,且'通往 RSI'的框架被第三方实证明显打折:真正的开放式研究能力仍差得远,连合著者 Jack Clark 自己后来都称之为'短 RSI 时间线的看空信号'。
官方声称:80%+ 合并代码由 Claude 撰写、人均代码量 8 倍、员工自评 4 倍提速,内部数据显示 Claude 正在加速 AI 开发。
全部为内部自报数据,无法外部审计;文章自己的脚注就承认归因 pipeline 有缺口、lines of code '几乎肯定高估'、员工自评受 METR 证实的高估偏差影响。Gary Marcus(garymarcus.substack.com/p/no-need-to-panic-about-anthropics)的定性:文章实际展示的只是'完全在人类控制下的更快的编码工具'加基准进展,却用 RSI 失控叙事包装,'to some degree a bait and switch'。
官方声称:自动化安全研究实验中 agent 群恢复 97% 性能差距(人类研究员仅 23%),暗示 AI 已能自主做研究。
文章自己的 caveat:结果没能迁移到生产规模模型,且问题选择和评分 rubric 均由人类设定——即最难的'定义问题'环节被排除在实验外。对照成本也不对等:agent 侧 800 累计小时 + 约 $18,000 算力 vs 人类两人一周。
官方声称:'下一步判断'测试显示模型正在获得 research taste,Mythos Preview 64% 胜过人类研究员的实际选择。
实验设计存在文中自认的选择偏差:129 个样本全部刻意选自'人类走了弯路'的时刻;偏差检查显示在人类决策本已良好的 127 个时刻上模型仅约 20% 胜出,裁判也是 Claude 自己。该数字不能读作模型判断力全面超过人类研究员。
官方声称:趋势外推指向 RSI,'可能比多数机构准备好的时间来得更早'。
2026 年 8 月 Princeton 的 shadow evaluation(Kirgis & Kapoor,MIT Technology Review 2026-08-18 报道)给出反证:让 Claude Opus 4.8 agent 花 6 天、$3,000 API 额度重做两篇未发表 NeurIPS 2026 投稿的研究问题,工程执行合格但研究'nowhere close to the mark'——在小合成数据集上跑离奇实验、轻易放弃有希望的假设、不会回溯。合著者 Jack Clark 本人随后在 Import AI 中称 AI 的'rote, formulaic thinking'是'短 RSI 时间线的看空信号'。
官方声称:52x 训练代码加速展示了代际能力跃迁。
文章脚注自认倍数取决于初始代码留下的优化余量,'不是真实世界的训练加速';这是一个封闭、目标和评测固定的优化任务,恰是 RL 最擅长的可自动验证任务类型——Kapoor 在上述研究中指出的能力分叉(可打分任务进步快、开放研究进步慢)正好适用。HN 讨论(news.ycombinator.com/item?id=48400842,534 分)的主流质疑也集中在'coding 加速 ≠ 自我改进'与 Anthropic 借安全叙事推动对竞争者/开源的管制。

与我们方向的关系

这是前沿 lab 对 RSI 现状最直接的一手陈述,对课题组的价值在于两点。第一,它给出了一组别处拿不到的内部量化锚点:代码归因比例、分难度的 agent session 成功率、同口径代际对比实验——尤其'下一步判断'测试的实验设计(从真实 session 切片、用知道结局的 judge 裁决)是评测 agent 研究判断力的可借鉴范式,连同它的选择偏差教训一起。

第二,把这篇和 Princeton shadow evaluation、METR 的开发者高估研究对照读,能看清当前 RSI 争论的真实分界线:'perspiration 自动化'(实现、调试、优化、可打分任务)证据扎实且在快速复利,'研究品味'(选题、定义问题、开放式探索)证据薄弱甚至为负。做 automated AI R&D 相关工作时,claim 落在哪一侧决定了该用什么标准去审。文末的可验证暂停机制部分则是理解 Anthropic 政策立场(以及它与开源社区冲突)的关键原文。

阅读笔记

文中的模型名(Claude Mythos Preview、Opus 4.6/4.7)是 2026 年的内部/新发布模型,引用时注意与公开版本区分。meta.json 为空,日期和作者系从原文和媒体报道(Scientific American 2026-06-05 称 6 月 4 日发布)核实。原文所有图表由 JS 渲染,页面静态 HTML 中只嵌了 3 张,已全部抓取;缺 timeline 时代划分图,信息量不大,不补。

材料清单

批评garymarcus.substack.com/p/no-need-to-panic-about-anthropics
Gary Marcus:所示只是更快的编码工具,RSI 叙事有 bait and switch 之嫌
反证研究报道www.technologyreview.com/2026/08/18/1142188/ai-recursive-self-improvement/
MIT Tech Review 报道 Princeton shadow evaluation:agent 做开放式研究'nowhere close';含 Jack Clark 本人的看空表态
社区讨论news.ycombinator.com/item?id=48400842
HN 主帖(534 分):质疑集中于 coding≠RSI 与政策动机