← 返回资料站  /  AutoResearch
论文 想法生成 ★ 必读

The Ideation-Execution Gap: Execution Outcomes of LLM-Generated versus Human Research Ideas

想法-执行落差:LLM 生成的研究想法真正做出来之后表现如何
一句话Stanford 团队招募 43 位研究者(人均 100+ 小时)把 LLM 想法和人类专家想法真正执行成论文再盲审:AI 想法执行后四项指标平均掉分 1.0-2.0 分(1-10 制),人类想法几乎不掉,ideation 阶段 AI 的'新颖性优势'在执行后消失甚至反超被翻盘。

这是什么

这是 Si, Hashimoto, Yang 上一篇 ICLR 2025 工作《Can LLMs Generate Novel Research Ideas?》(arXiv 2409.04109)的直接后续。上一篇的结论是:在只看 idea proposal 的盲审中,基于 Claude-3.5-Sonnet 的 ideation agent 生成的想法在 novelty 上显著高于 100+ 位 NLP 研究者写的想法。但那只是'看起来新颖'——一个好想法应该在执行之后产出更好的研究,而不是停留在 proposal 里好看。

这篇就是把这批想法真正做出来:43 位有研究经验的参与者(人均 Google Scholar 15 篇左右论文)被随机分配一个匿名想法(19 个人类想法、24 个 AI 想法,覆盖 7 个 NLP 话题),在三个月窗口内实现全部实验并写成 4 页 ACL 格式短文,人均花费约 103 小时。之后 58 位专家评审对每个项目写 4-5 份盲审(共 181 份),再与 ideation 阶段的评分对比。整个设计是预注册的 RCT(OSF: ckxtp),评审对想法来源双盲。

核心发现被命名为 ideation-execution gap:AI 想法在 ideation 阶段全面显著高于人类想法,但执行之后 novelty/excitement/effectiveness/overall 分别掉 1.05/1.76/1.88/1.98 分,而人类想法基本持平(-0.01/+0.08/-0.05/-0.63),差异在全部四项指标上显著(p<0.05, FDR 校正)。执行后 AI 想法在所有指标上均低于人类想法——排名翻转。这给'LLM 想法比人类更新颖'的叙事补上了关键的另一半:光评 idea 文本会系统性高估 LLM 想法。

研究总览:7 个 NLP 话题下的 19 个人类想法 + 24 个 AI 想法被随机分配给专家执行,再盲审。以 effectiveness 为例:执行前 AI 想法 6.00 明显高于人类 4.83,执行后跌到 4.13,反而低于人类的 4.78。
研究总览:7 个 NLP 话题下的 19 个人类想法 + 24 个 AI 想法被随机分配给专家执行,再盲审。以 effectiveness 为例:执行前 AI 想法 6.00 明显高于人类 4.83,执行后跌到 4.13,反而低于人类的 4.78。

机制与做法

执行实验设计:如何做一个想法执行的 RCT

想法直接复用上一篇 ideation study 的人类/AI 两个 condition(当时就刻意 scope 成三个月内可执行的 prompting 类研究)。66 人 onboard、43 人完成,参与者先选偏好话题、再在话题内随机分配人类或 AI 想法,避免自选高质量想法的 selection bias。报酬为 $20/小时 + $600 完成奖金 + 报销全部算力开销,且执行者拥有项目所有权、可以继续发展成正式投稿(确实有多个项目后来变成了论文,如 AegisLLM、PolyPrompt)。

为了保证评的是'原始想法'而非执行者的再创作,规则是:禁止对方法本身做实质修改,只允许改实验细节(数据集、baseline、超参等),且所有修改必须书面报备、由作者逐条人工审核。全程只有 1 个项目因想法过于含糊无法执行而被终止剔除。

主结果:每组柱子的阴影部分是执行后相对 ideation 阶段的掉分(Study2−Study1)。人类想法(黄)在 novelty/excitement/effectiveness 上几乎不掉,AI 想法(蓝)四项指标均大幅下滑 1.0-2.0 分,执行后反被人类反超(该反超本身不显著)。
主结果:每组柱子的阴影部分是执行后相对 ideation 阶段的掉分(Study2−Study1)。人类想法(黄)在 novelty/excitement/effectiveness 上几乎不掉,AI 想法(蓝)四项指标均大幅下滑 1.0-2.0 分,执行后反被人类反超(该反超本身不显著)。

评审:181 份盲审 + 两个控制指标

58 位评审(人均 597 引用)对 43 个项目共写 181 份盲审,每份约 52 分钟、报酬 $50,评审表与 ideation study 尽量对齐:novelty、excitement、soundness、effectiveness、overall(1-10)。评审能看到论文和完整代码库。

关键的对照设计是两个 control metrics:faithfulness(执行是否忠实于原想法,6.48 vs 6.42)和 codebase quality(3.58 vs 3.58),两个 condition 几乎相同——排除了'AI 想法掉分是因为被执行得更差'这一混淆解释。

gap 的成因:对比 ideation(黄)与 execution(蓝)评审意见中提及的因素占比。ideation 评审 80% 以上只谈 novelty/motivation,完全不看 empirical performance;execution 评审 93% 看实测性能、60% 挑实验设计毛病,baseline/ablation/资源开销等弱点全部浮出水面。
gap 的成因:对比 ideation(黄)与 execution(蓝)评审意见中提及的因素占比。ideation 评审 80% 以上只谈 novelty/motivation,完全不看 empirical performance;execution 评审 93% 看实测性能、60% 挑实验设计毛病,baseline/ablation/资源开销等弱点全部浮出水面。

核心度量:用 pre/post 差分吃掉想法异质性

直接比较执行后的人类 vs AI 平均分,在 N=43(每个想法算一个数据点)下统计功效不够:AI 想法虽然在所有指标上低于人类(如 excitement 3.90 vs 4.48),但 p 值都在 0.175-0.586,不显著。论文对此很坦率,承认预注册假设('执行分数有显著差异')没能被直接确认。

真正的统计信号来自差分:同一个想法在 ideation 和 execution 两个阶段各有评分,取 gap = 执行分 - ideation 分,可以控制掉想法质量本身的巨大方差。这个 ideation-execution gap 在人类和 AI 想法之间的差异在四项指标上全部显著(novelty p=0.025,excitement p=0.001,effectiveness p=0.003,overall p=0.004,均 FDR 校正)。另外若把每份 review 当独立数据点(N=181),执行后人类想法在 excitement/effectiveness/soundness/overall 上也显著更高(p=0.01),只有 novelty 不显著(p=0.21)。

归因:掉分从哪来

第一个假设是执行者改了 AI 想法导致失真——数据不支持:人类/AI 想法平均只被改 2.9/3.1 处,全是实验细节。唯一系统性的例外是 6 个 AI 想法把原提案里'招募母语者/专家做人工评测'降级成 LLM-as-a-judge(AI 想法爱提无法负担的人工评测,这正是 ideation 阶段 excitement 高分的来源之一);但把这 6 个想法剔除后所有结论不变,说明这只解释了 gap 的一小部分。

更主要的解释是评审关注点的系统性变化:作者把 181 份评审意见人工归类为 10 类因素,发现 ideation 评审几乎只看 novelty/motivation(80%+)且经常'假设实验会成功'地打分,而 execution 评审 93% 会看 empirical performance(ideation 阶段为 0)、60% 会挑实验设计毛病(ideation 约 25%),baseline、ablation、资源开销、泛化性等此前被完全忽略的弱点都暴露出来。换句话说:没有执行结果时,评审对'这个想法做出来会不会 work'的判断基本是猜的——ideation 分数与执行分数的相关性很弱,AI 想法的 excitement 甚至呈中度负相关。

关键结果

实证核查

扎实数据全部公开且可精确复算,预注册可查,论文对自身不显著的部分异常坦率;主要注意的是'翻转'只是方向性结论、以及想法范围仅限 prompting 类研究。
论文称 58 位评审共写 181 份盲审,并给出人类 N=85 / AI N=96 条 review 的各项均分(Table 3)。
评审原始数据已随 GitHub 仓库 NoviScl/AI-Researcher(404 stars)发布于 reviews_execution/data_points_all_execution.json:我下载后确认恰好 181 条记录(含分数和 free-text rationale),并重算了按 condition 分组的均值——novelty 4.93/4.73、excitement 4.52/3.90、effectiveness 4.84/4.12、soundness 5.38/4.73、overall 4.00/3.41,与论文 Table 3 完全一致。统计检验脚本(stats_overall.py 等)也在同目录。
论文称研究设计与假设已预注册(OSF),为 blinded RCT。
osf.io/ckxtp 可访问(HTTP 200)。但要注意:预注册的主假设是'人类与 AI 想法的执行分数有显著差异',这一条按论文自己承认在想法级别(N=43)并未达到显著(p=0.175-0.586);标题里的核心结论(ideation-execution gap 的组间差异)是差分指标,该指标确实四项全显著。读的时候要分清哪个结论有统计支撑、哪个只是方向性的。
论文与作者宣传称执行后'排名翻转,人类想法反超 AI 想法'。
这个'翻转'需要打折理解:执行后 AI 均分确实在所有指标上低于人类,但想法级别不显著,只有把每份 review 当独立样本(N=181,忽略了同一想法多份 review 的相关性)时 4/5 项指标显著;且 novelty 一项在任何聚合方式下都不显著(p=0.21/0.586)——即'AI 想法执行后连新颖性都不如人类'这种强读法没有依据,论文正文对此写得诚实,但二手转述普遍夸大。
结论被表述为'当前 LLM 生成真正有效研究想法的能力有限'。
适用范围有明确边界,论文 Limitations 也自认:想法全部来自 2024 年的 Claude-3.5-Sonnet agent、限定为三个月内可完成的 NLP prompting 类研究、N=43;对需要训练/大规模数据的研究类型和更新的模型是否成立未知。GitHub issues(24 个)全部关于 ideation agent 代码和数据索引,未发现对执行研究结论的质疑或反驳;发表约一年被引 50+,尚无第三方复现(这类实验重做一遍要几十万美元级投入,短期内大概率无人复现)。

与我们方向的关系

对做 autoresearch 的同学,这篇几乎是必须内化的方法论警钟:任何'LLM 想法被评为更新颖/更好'的结果,如果评的只是 idea 文本(无论人评还是 LLM judge),都要默认存在 1-2 分量级的执行折价,且折价对 AI 想法系统性更大。原因论文说得很清楚——不执行时评审在'假设实验会成功'的前提下打分,而 AI 想法恰好擅长生成这种听起来成立但实测不 work、或方案不可负担的提案。这直接质疑了大量用 idea-level 评分做 reward 或做 benchmark 的工作。

可借鉴的具体资产:(1) 差分设计——pre/post 执行评分之差能吃掉想法异质性,让 N=43 也出显著信号,做小样本人类实验值得学;(2) faithfulness/codebase quality 双控制指标排除执行质量混淆的写法;(3) 公开的 181 份含 rationale 的评审数据 + 43 个完整项目(论文/代码库/修改记录),可以直接拿来训练或评测'执行结果预测器'(proxy reward model)——论文 Future Work 点名了这个方向,也是把 gap 变成可优化目标的最现实路径。

阅读笔记

读的时候注意区分三层结论的证据强度:gap 差异(四项全显著,最硬)> 按 review 聚合的执行分差异(4/5 显著,但样本独立性假设存疑)> 想法级执行分差异/排名翻转(方向性,不显著)。另外 ideation 分数用的是上一篇 2024 年收集的旧评审,两次评审人群'相似但不相同',严格说 pre/post 不是同一批评审——论文靠评审表对齐来缓解,但这是残留的混淆源之一。

材料清单

TeX 源码
已存档:Raw/the-ideation-execution-gap/source/
数据与代码github.com/NoviScl/AI-Researcher
reviews_execution/ 含全部 181 份执行评审(分数+rationale)与统计脚本;README 中 Drive 链接可下载 43 个项目的完整论文、代码库和修改记录
预注册osf.io/ckxtp
OSF 上的研究设计与假设预注册
前作(ideation study)arxiv.org/abs/2409.04109
Can LLMs Generate Novel Research Ideas?(ICLR 2025),本文所有想法与 pre-execution 评分的来源

同类条目