报告
研发自动化度量
AI Researchers' Views on Automating AI R&D and Intelligence Explosions (Interviewing AI researchers on automation of AI R&D)
访谈 25 位一线研究员:AI 自动化 AI 研发与智能爆炸,大家到底怎么想
Severin Field, Raymond Douglas, David Krueger · Epoch AI · arXiv / Epoch AI · 2026-03 · 被引 2
一句话 2025 年 8-9 月对 25 位来自 GDM/OpenAI/Anthropic/Meta 及 Berkeley/Princeton/Stanford 等机构研究员的半结构化访谈:大家在'编码→自主开发者'的路径上高度收敛,但在时间线和治理上严重分歧;frontier lab 与学术界之间存在明显的认知鸿沟,且多数人预期最强的 ASARA 模型会被留在公司内部不公开。
这是什么 这是一项定性访谈研究(qualitative interview study),不是 benchmark 也不是推演模型。作者在 2025 年 8-9 月访谈了 25 位研究员:7 位现任 frontier lab(定义为 xAI/Meta/GDM/OpenAI/Anthropic)研究员、4 位前 frontier lab 研究员、9 位学术界(教授到 PhD)、3 位业界、2 位非营利机构研究者。每场 40-60 分钟,匿名处理,主题围绕 ASARA(AI Systems for AI R&D Automation,'能实质性参与前沿模型开发的 AI 系统')的形态、部署方式、路径约束、风险和 red lines。
研究想回答四个问题:研究员如何设想 AI 自动化 AI 研究、关键 milestone 是什么;对 intelligence explosion 场景的分歧在哪;AI 自动化研发带来什么具体风险;以及对治理手段(尤其 red lines)的看法。相比之前 Owen(8 人)和 Leibowich et al.(5 人)聚焦瓶颈和能力预测的访谈,这篇的重心在风险、缓解措施和组织行为。
注意:catalog 里挂的 Epoch AI 链接(interviewing-ai-researchers-on-automation-of-ai-rnd)其实是另一篇 2024 年 David Owen 的 8 人访谈报告,与本条 arXiv 论文(Field/Douglas/Krueger,MATS 资助)是两个不同但同主题的工作,后者在 Related Work 里引用了前者。两篇可以对照着读。
受访者对'通往 ASARA 的轨迹是否清晰'的立场分布(每个点是一位受访者,按机构类型着色)。frontier lab 研究员(浅蓝)集中在 'Clear Trajectory' 一侧,学术界(白色)大多落在 'Major Obstacles',没有人选 'Unknown Unknowns'——这张图是论文核心论点'lab 与学术界的认知鸿沟'最直观的证据。 机制与做法 取样与访谈设计
共邀请 182 人,25 人接受(响应率约 14%)。三条招募渠道:Google Scholar 按 'recursive self-improvement'、'AI R&D Automation' 等关键词找发过相关论文的作者(7 人);NeurIPS/ICLR 2024 相关 workshop(DL4C、Agentic AI for Science、Self-Improving Foundation Models 等)的作者(8 人);滚雪球 + MATS 项目人脉(10 人)。作者明确说刻意纳入了反对观点,但取样不是随机的。
访谈协议分三段:ASARA 会是什么样、走什么轨迹;组织动态(公开 vs 内部部署、各方会如何反应);风险与治理(缓解措施、red lines)。常追问'什么证据会让你改变看法',逼出可观察的 milestone。
受访者对 ASARA 风险等级的判断:11/25 'Minimal Concern'(其中学术界占 6)、7 人 'Serious Risk'、7 人 'Primary AI Risk'。注意这张图与摘要声称的 '20/25 认为是最严重最紧迫的 AI 风险之一'直接矛盾,引用时以此图为准。 编码分析:人工归纳 + Claude 辅助分类
转录用私有 Whisper/Otter.AI,去标识化后由第一作者独自做归纳式编码(inductive coding),相似概念聚成 code 再归主题——没有第二编码员,未计算 inter-rater reliability。
论文里 4 张分类图(部署预期、轨迹清晰度、风险优先级、red lines 立场)的分类是 AI 辅助完成的:把匿名转录逐份喂给 Claude,用结构化 prompt 判定受访者立场(允许 'unsure'),prompt 样例在附录。这个做法省人力但引入了模型判读误差,论文没有报告人工抽查的一致率。
核心结果结构
路径共识:17/25 描述了'先是超强 coding 模型 → 几乎就是超强 ML R&D'的三阶段进程——research speedup(工具提效,人是 oversight)→ collaboration(AI 自主做子任务)→ full loop automation(人变成瓶颈,公司会想办法把人移出回路)。4 份转录独立提出 METR 式 task horizon(从 1-2 小时到 40+ 小时任务)是追踪 ASARA 的核心可观察指标。
瓶颈判断:11 份访谈提到 compute 是限制因素,5 份提到 data('data 决定 self-improvement 的天花板',P3);15 人区分 ideation vs execution,普遍认为前者(research taste)更难,其中两人进一步指出真瓶颈不是'生成想法'而是'validation——从大量平庸想法里挑出好的',因为人类专家自己都做不好,而 ML 模型学的是数据的众数而非长尾。
治理态度:对 red lines 意见分裂,三大落地难题——specification(阈值越具体越偏离真实风险)、verification/enforcement('让人验证合规是噩梦',且可能需要威权级监控)、timing(定早了拖累有益进展,定晚了没用)。几乎所有人都更支持 transparency 类措施:强制报告 R&D 自动化进展、提高 internal deployment 可见性。
关键结果 路径收敛、时间线分裂:17/25 认同 'coding → 自主 AI developer' 的渐进路径;除 2 人外都愿意把 intelligence explosion 当作自动化 AI 研究的自然后果来讨论,但对何时、多快毫无共识。 内部部署预期:在明确回答的 20 人中,一半预期 lab 会把能加速 AI 研究的模型留在内部,只有 20% 预期公开部署。留内部的理由:保竞争优势(12 份转录)、compute 有限('10 万美元的算力可能值 100 万美元的研究员工资',P10)、防蒸馏/扩散(6 份);会公开的理由:融资压力('lab 每年要再融 200 亿美元',P23)、政府介入('FBI 会去抄家',P4)。 认知鸿沟:frontier lab 研究员多认为轨迹清晰、内部日常讨论 recursive improvement 且受高层鼓励;学术界更多认为有 major obstacles,且'谈这个会被当 crackpot、可能丢 funding'(P18/P7)。lab 一侧归因于'亲身经历过两年前的反对论点全被证伪',学术一侧指出 lab 面向投资人有夸大能力的动机、以及'信 AGI 的人自我选择进了 lab'。 风险感知(按论文自己的图 3):11/25 minimal concern(以学术界为主)、7/25 serious risk、7/25 认为是 primary AI risk;18 份转录把 ASARA 视为'meta risk'——'递归自我改进全面放大所有其他风险'(P2),17 份担心 adaptation lag(监管和人类理解跟不上)。只有 2 人明确否定递归自我改进的可能性。 文化差异:中国研究员(P12)反馈国内社区对 intelligence explosion 普遍不信、公司'非常应用导向,就想用 AI 赚钱';德国/英国视角也比'硅谷心态'怀疑得多。 red lines 分裂但 transparency 共识:支持者也承认 specification/enforcement/timing 三大难题;5 人未被问及就主动表达'宁要强制报告和监测,不要硬性 red line'(P25),P4 认为固定阈值机会成本太大、事后会显得'很蠢'。 实证核查
有水分 访谈本身是真实、有信息量的一手定性材料,frontier lab vs 学术界的分歧刻画可信;但摘要的头条数字与论文自己的图表对不上,方法上单人编码 + Claude 辅助分类 + 非随机取样,转录不公开无法复核,headline 数字要打折使用。
摘要称 '20 of the 25 researchers identified automating AI research as one of the most severe and urgent AI risks'。
论文自己的 Figure 3(risk_priority_plot,本地 figures/fig03)显示 11/25 落在 'Minimal Concern',只有 7 人 'Serious Risk'、7 人 'Primary AI Risk',合计 14 人;正文也写 'A larger subset of participants, largely academics, expressed minimal concern'。20/25 这个数字在正文和图里都找不到支撑,与图 3 直接矛盾。
摘要称 '17/25 participants expected AI systems with advanced coding or R&D capabilities to be increasingly reserved for internal use'。
正文(Section 4.2)说的是:20 人明确回答了该问题,其中一半(10 人)预期 keep internal、20%(4 人)预期公开,另有 6 人 'Nuanced'(取决于政府干预和各家公司文化)。Figure 1(fig01)点数为 10/6/4。17/25 只有把 'Nuanced' 也算进 'expects internal' 再多凑 1 人才能得到,是对自己数据的宽松表述。
研究呈现为对 'leading researchers' 观点的系统刻画。
方法学上限明显且论文 Limitations 自己承认了一部分:邀请 182 人只有 25 人接受(约 14%),其中 10 人来自滚雪球和 MATS(AI safety 社区)人脉,样本偏向对该话题本就有立场的人;归纳编码由第一作者一人完成、无 inter-rater reliability;图 1-4 的立场分类由 Claude 对转录判定(附录给了 prompt),未报告人工校验一致率。转录不公开,所有定性结论无法第三方复核。
catalog 标注 org 为 Epoch AI,project_url 指向 epoch.ai 的 'Interviewing AI researchers on automation of AI R&D'。
该 Epoch 页面是 2024-08 David Owen(Epoch 研究员、UK AISI 资助)访谈 8 位研究员的另一篇报告(结论:8/8 认为工程任务是未来五年自动化主力,6/8 怀疑 AI 近期能通过其研发评估)。本条 arXiv 论文(2603.03338)作者是 Severin Field、Raymond Douglas、David Krueger,由 MATS 资助,与 Epoch 无隶属关系,只是在 Related Work 引用了 Owen 的研究。两个工作被 catalog 合并成了一个条目。另外 tex 源码里混用 'my findings'/'I discuss' 与 'we',成稿痕迹较粗糙。
与我们方向的关系 对课题组'研发自动化度量'方向,这篇的直接价值是提供了一份从业者自己认可的可观察 milestone 清单:METR 式 task horizon 被多位受访者独立当作核心指标('到 40 小时 task horizon 也许还要五次翻倍',P1)、'一次生成 1 万行全对的代码'、10x researcher uplift、以及'lab 开始把最强模型只留内部用'本身被当作一个 milestone。这些可以直接当作我们论证'为什么要度量 AI R&D 自动化'的一手引证。
更值得借鉴的是 ideation/execution 的拆分:15 人认为瓶颈在 research taste 一侧,而其中最锐利的观点是瓶颈其实是 validation(判别好想法)而非生成想法——这正好对应到自动化评测里'AI 能否给研究想法/实验结果打分'这类任务的设计。用时注意本条 reality 部分:摘要的 20/25、17/25 两个数字与论文自图不符,引用时应引正文和图的数字(风险感知 14/25 serious+primary、部署预期 10/20 keep internal)而不是摘要。
阅读笔记 读 tex 源码(source/sn-article.tex)比读 PDF 有额外收获:注释里留着大量 TODO 和合作者批注,以及被注释掉的旧表述('17/25 researchers largely expected... actively concealed'被注释掉后,摘要里却保留了 17/25),能看出摘要数字是早期版本遗留。引用数暂仅 2(S2)。ICML 2026 有 'AI with Recursive Self Improvement' workshop,论文以此佐证话题进入主流学术议程。
材料清单 TeX 源码 已存档:Raw/ai-researchers-views-on-automating-ai-r-d-ai/source/
同类条目