← 返回资料站  /  Recursive Self-Improvement
报告 研发自动化度量

AI Researchers' Views on Automating AI R&D and Intelligence Explosions (Interviewing AI researchers on automation of AI R&D)

访谈 25 位一线研究员:AI 自动化 AI 研发与智能爆炸,大家到底怎么想
一句话2025 年 8-9 月对 25 位来自 GDM/OpenAI/Anthropic/Meta 及 Berkeley/Princeton/Stanford 等机构研究员的半结构化访谈:大家在'编码→自主开发者'的路径上高度收敛,但在时间线和治理上严重分歧;frontier lab 与学术界之间存在明显的认知鸿沟,且多数人预期最强的 ASARA 模型会被留在公司内部不公开。

这是什么

这是一项定性访谈研究(qualitative interview study),不是 benchmark 也不是推演模型。作者在 2025 年 8-9 月访谈了 25 位研究员:7 位现任 frontier lab(定义为 xAI/Meta/GDM/OpenAI/Anthropic)研究员、4 位前 frontier lab 研究员、9 位学术界(教授到 PhD)、3 位业界、2 位非营利机构研究者。每场 40-60 分钟,匿名处理,主题围绕 ASARA(AI Systems for AI R&D Automation,'能实质性参与前沿模型开发的 AI 系统')的形态、部署方式、路径约束、风险和 red lines。

研究想回答四个问题:研究员如何设想 AI 自动化 AI 研究、关键 milestone 是什么;对 intelligence explosion 场景的分歧在哪;AI 自动化研发带来什么具体风险;以及对治理手段(尤其 red lines)的看法。相比之前 Owen(8 人)和 Leibowich et al.(5 人)聚焦瓶颈和能力预测的访谈,这篇的重心在风险、缓解措施和组织行为。

注意:catalog 里挂的 Epoch AI 链接(interviewing-ai-researchers-on-automation-of-ai-rnd)其实是另一篇 2024 年 David Owen 的 8 人访谈报告,与本条 arXiv 论文(Field/Douglas/Krueger,MATS 资助)是两个不同但同主题的工作,后者在 Related Work 里引用了前者。两篇可以对照着读。

受访者对'通往 ASARA 的轨迹是否清晰'的立场分布(每个点是一位受访者,按机构类型着色)。frontier lab 研究员(浅蓝)集中在 'Clear Trajectory' 一侧,学术界(白色)大多落在 'Major Obstacles',没有人选 'Unknown Unknowns'——这张图是论文核心论点'lab 与学术界的认知鸿沟'最直观的证据。
受访者对'通往 ASARA 的轨迹是否清晰'的立场分布(每个点是一位受访者,按机构类型着色)。frontier lab 研究员(浅蓝)集中在 'Clear Trajectory' 一侧,学术界(白色)大多落在 'Major Obstacles',没有人选 'Unknown Unknowns'——这张图是论文核心论点'lab 与学术界的认知鸿沟'最直观的证据。

机制与做法

取样与访谈设计

共邀请 182 人,25 人接受(响应率约 14%)。三条招募渠道:Google Scholar 按 'recursive self-improvement'、'AI R&D Automation' 等关键词找发过相关论文的作者(7 人);NeurIPS/ICLR 2024 相关 workshop(DL4C、Agentic AI for Science、Self-Improving Foundation Models 等)的作者(8 人);滚雪球 + MATS 项目人脉(10 人)。作者明确说刻意纳入了反对观点,但取样不是随机的。

访谈协议分三段:ASARA 会是什么样、走什么轨迹;组织动态(公开 vs 内部部署、各方会如何反应);风险与治理(缓解措施、red lines)。常追问'什么证据会让你改变看法',逼出可观察的 milestone。

受访者对 ASARA 风险等级的判断:11/25 'Minimal Concern'(其中学术界占 6)、7 人 'Serious Risk'、7 人 'Primary AI Risk'。注意这张图与摘要声称的 '20/25 认为是最严重最紧迫的 AI 风险之一'直接矛盾,引用时以此图为准。
受访者对 ASARA 风险等级的判断:11/25 'Minimal Concern'(其中学术界占 6)、7 人 'Serious Risk'、7 人 'Primary AI Risk'。注意这张图与摘要声称的 '20/25 认为是最严重最紧迫的 AI 风险之一'直接矛盾,引用时以此图为准。

编码分析:人工归纳 + Claude 辅助分类

转录用私有 Whisper/Otter.AI,去标识化后由第一作者独自做归纳式编码(inductive coding),相似概念聚成 code 再归主题——没有第二编码员,未计算 inter-rater reliability。

论文里 4 张分类图(部署预期、轨迹清晰度、风险优先级、red lines 立场)的分类是 AI 辅助完成的:把匿名转录逐份喂给 Claude,用结构化 prompt 判定受访者立场(允许 'unsure'),prompt 样例在附录。这个做法省人力但引入了模型判读误差,论文没有报告人工抽查的一致率。

核心结果结构

路径共识:17/25 描述了'先是超强 coding 模型 → 几乎就是超强 ML R&D'的三阶段进程——research speedup(工具提效,人是 oversight)→ collaboration(AI 自主做子任务)→ full loop automation(人变成瓶颈,公司会想办法把人移出回路)。4 份转录独立提出 METR 式 task horizon(从 1-2 小时到 40+ 小时任务)是追踪 ASARA 的核心可观察指标。

瓶颈判断:11 份访谈提到 compute 是限制因素,5 份提到 data('data 决定 self-improvement 的天花板',P3);15 人区分 ideation vs execution,普遍认为前者(research taste)更难,其中两人进一步指出真瓶颈不是'生成想法'而是'validation——从大量平庸想法里挑出好的',因为人类专家自己都做不好,而 ML 模型学的是数据的众数而非长尾。

治理态度:对 red lines 意见分裂,三大落地难题——specification(阈值越具体越偏离真实风险)、verification/enforcement('让人验证合规是噩梦',且可能需要威权级监控)、timing(定早了拖累有益进展,定晚了没用)。几乎所有人都更支持 transparency 类措施:强制报告 R&D 自动化进展、提高 internal deployment 可见性。

关键结果

实证核查

有水分访谈本身是真实、有信息量的一手定性材料,frontier lab vs 学术界的分歧刻画可信;但摘要的头条数字与论文自己的图表对不上,方法上单人编码 + Claude 辅助分类 + 非随机取样,转录不公开无法复核,headline 数字要打折使用。
摘要称 '20 of the 25 researchers identified automating AI research as one of the most severe and urgent AI risks'。
论文自己的 Figure 3(risk_priority_plot,本地 figures/fig03)显示 11/25 落在 'Minimal Concern',只有 7 人 'Serious Risk'、7 人 'Primary AI Risk',合计 14 人;正文也写 'A larger subset of participants, largely academics, expressed minimal concern'。20/25 这个数字在正文和图里都找不到支撑,与图 3 直接矛盾。
摘要称 '17/25 participants expected AI systems with advanced coding or R&D capabilities to be increasingly reserved for internal use'。
正文(Section 4.2)说的是:20 人明确回答了该问题,其中一半(10 人)预期 keep internal、20%(4 人)预期公开,另有 6 人 'Nuanced'(取决于政府干预和各家公司文化)。Figure 1(fig01)点数为 10/6/4。17/25 只有把 'Nuanced' 也算进 'expects internal' 再多凑 1 人才能得到,是对自己数据的宽松表述。
研究呈现为对 'leading researchers' 观点的系统刻画。
方法学上限明显且论文 Limitations 自己承认了一部分:邀请 182 人只有 25 人接受(约 14%),其中 10 人来自滚雪球和 MATS(AI safety 社区)人脉,样本偏向对该话题本就有立场的人;归纳编码由第一作者一人完成、无 inter-rater reliability;图 1-4 的立场分类由 Claude 对转录判定(附录给了 prompt),未报告人工校验一致率。转录不公开,所有定性结论无法第三方复核。
catalog 标注 org 为 Epoch AI,project_url 指向 epoch.ai 的 'Interviewing AI researchers on automation of AI R&D'。
该 Epoch 页面是 2024-08 David Owen(Epoch 研究员、UK AISI 资助)访谈 8 位研究员的另一篇报告(结论:8/8 认为工程任务是未来五年自动化主力,6/8 怀疑 AI 近期能通过其研发评估)。本条 arXiv 论文(2603.03338)作者是 Severin Field、Raymond Douglas、David Krueger,由 MATS 资助,与 Epoch 无隶属关系,只是在 Related Work 引用了 Owen 的研究。两个工作被 catalog 合并成了一个条目。另外 tex 源码里混用 'my findings'/'I discuss' 与 'we',成稿痕迹较粗糙。

与我们方向的关系

对课题组'研发自动化度量'方向,这篇的直接价值是提供了一份从业者自己认可的可观察 milestone 清单:METR 式 task horizon 被多位受访者独立当作核心指标('到 40 小时 task horizon 也许还要五次翻倍',P1)、'一次生成 1 万行全对的代码'、10x researcher uplift、以及'lab 开始把最强模型只留内部用'本身被当作一个 milestone。这些可以直接当作我们论证'为什么要度量 AI R&D 自动化'的一手引证。

更值得借鉴的是 ideation/execution 的拆分:15 人认为瓶颈在 research taste 一侧,而其中最锐利的观点是瓶颈其实是 validation(判别好想法)而非生成想法——这正好对应到自动化评测里'AI 能否给研究想法/实验结果打分'这类任务的设计。用时注意本条 reality 部分:摘要的 20/25、17/25 两个数字与论文自图不符,引用时应引正文和图的数字(风险感知 14/25 serious+primary、部署预期 10/20 keep internal)而不是摘要。

阅读笔记

读 tex 源码(source/sn-article.tex)比读 PDF 有额外收获:注释里留着大量 TODO 和合作者批注,以及被注释掉的旧表述('17/25 researchers largely expected... actively concealed'被注释掉后,摘要里却保留了 17/25),能看出摘要数字是早期版本遗留。引用数暂仅 2(S2)。ICML 2026 有 'AI with Recursive Self Improvement' workshop,论文以此佐证话题进入主流学术议程。

材料清单

TeX 源码
已存档:Raw/ai-researchers-views-on-automating-ai-r-d-ai/source/

同类条目