← 返回资料站  /  AutoResearch
论文 想法生成 ★ 必读

Can LLMs Generate Novel Research Ideas? A Large-Scale Human Study with 100+ NLP Researchers

LLM 能想出新颖的研究想法吗?100+ NLP 研究者的大规模盲评实验
一句话Stanford 招募 104 位 NLP 研究者做首个大规模盲评:49 人写 idea、79 人写 298 份盲审,LLM agent 生成的想法在 novelty 上显著高于人类专家(5.64 vs 4.84,p<0.01,三种统计检验一致),feasibility 略低但不显著;同时揭示 LLM 想法多样性差(4000 个种子想法只有约 200 个不重复)、LLM 自评不可靠(53.3% 低于人类互评 56.1%)。

这是什么

2024 年前后出现了一批'AI 研究员'系统(AI Scientist、ResearchAgent 等),但没有人严格回答过最基本的问题:LLM 生成的研究想法,质量到底比得上人类专家吗?此前的评估要么用 LLM 当裁判,要么找几个作者自己打分,样本小、混淆变量多,结论不可信。

这篇论文的贡献主要不在 agent 本身(作者刻意用了极简设计),而在实验设计:招募 100+ 名真实 NLP 研究者,在 7 个固定话题(Bias、Coding、Safety、Multilingual、Factuality、Math、Uncertainty)下,让 49 位专家各写一个 idea,与 LLM agent 生成的 idea 做三条件盲评对比(Human / AI / AI + 人工重排),并对写作风格做标准化处理以防泄露来源。79 位评审(72 人有正式会议审稿经验)共产出 298 份盲审。

结论分两面:正面是 AI 想法的 novelty 和 excitement 显著更高,这是 LLM 想法生成能力第一个有统计效力的正面证据;反面是论文用自己的数据拆穿了两个流行假设——靠 over-generate 无限刷想法行不通(重复率随规模暴涨),靠 LLM-as-a-judge 自动评想法也行不通(一致性低于人类互评)。发表于 ICLR 2025(OpenReview: M23dTGWCZy)。

实验设计总览:7 个 NLP 话题下,人类专家与 AI agent 各产出 49 个 idea(外加 AI + 人工重排条件),由 79 位专家盲评。右侧直接标出 novelty 均分:Human 4.84 vs AI 5.64 vs AI+Rerank 5.81。
实验设计总览:7 个 NLP 话题下,人类专家与 AI agent 各产出 49 个 idea(外加 AI + 人工重排条件),由 79 位专家盲评。右侧直接标出 novelty 均分:Human 4.84 vs AI 5.64 vs AI+Rerank 5.81。

机制与做法

极简 ideation agent:检索 + 过量生成 + 排序

Agent 只有三个模块,骨干模型是 claude-3-5-sonnet-20240620。(1) Paper retrieval:让 LLM 生成 Semantic Scholar API 调用序列(KeywordQuery / PaperQuery / GetReferences),检索至多 120 篇相关论文,再让 LLM 按相关性、是否实证论文、启发性打 1-10 分重排;(2) Idea generation:每个话题过量生成 4000 个种子想法,prompt 里放 6 个人工总结的示范样例 + 随机抽 10 篇检索到的论文摘要做 RAG,并附上已生成想法的标题防止重复;(3) 用 all-MiniLM-L6-v2 句向量、0.8 余弦相似度阈值去重——去重后只剩约 5% 的不重复想法。

五个指标的三条件对比(红星 = 相对 Human 显著,Welch's t-test + Bonferroni)。AI 想法在 Novelty 和 Excitement 上显著更高,Feasibility 上人类略占优但不显著,Overall 只有 AI+Human Rerank 显著。
五个指标的三条件对比(红星 = 相对 Human 显著,Welch's t-test + Bonferroni)。AI 想法在 Novelty 和 Excitement 上显著更高,Feasibility 上人类略占优但不显著,Overall 只有 AI+Human Rerank 显著。

LLM ranker:拿 ICLR 审稿数据校准的 Swiss tournament

直接让 LLM 给 idea 打分校准很差,于是作者爬了 1200 篇 ICLR 2024 LLM 相关投稿做代理基准,改成成对比较:Claude-3.5-Sonnet zero-shot 判断'哪篇被接收'达到 71.4%(GPT-4o 只有 61.1%)。实际排序用 Swiss tournament:每轮把累计分相近的 proposal 配对比较,赢者加 1 分,跑 N=5 轮。Sanity check:用该 ranker 排 1.2K ICLR 投稿,top-10 与 bottom-10 的真实平均审稿分差 1.73 分,说明排序有信号但远非完美。

因为 ranker 不可靠,又加了第三个条件 AI Ideas + Human Rerank:一作亲自从生成池里重挑 49 个。结果这个条件与 LLM ranker 挑的只有 17/49 重叠——LLM 排序和人类专家眼光差距很大,这本身就是一个 finding。

LLM 想法生成的多样性瓶颈:左图为每个新 batch 中不重复想法比例(从约 55% 迅速跌向 0),右图为累计不重复想法数——4000 个种子想法只积累出约 200 个不重复,over-generate 的 scaling 很快平台化。
LLM 想法生成的多样性瓶颈:左图为每个新 batch 中不重复想法比例(从约 55% 迅速跌向 0),右图为累计不重复想法数——4000 个种子想法只积累出约 200 个不重复,over-generate 的 scaling 很快平台化。

人类研究的控制变量

招募渠道包括 1426 人的 OpenNLP Slack、Twitter、NAACL 2024 现场(作者穿着印二维码的 T 恤发名片)。49 位 idea 写作者来自 26 个机构、73% 是 PhD 在读,每人 10 天写一个 idea,报酬 $300,前 5 名另有 $1000 奖金;79 位评审来自 32 个机构,每份评审 $25,共收 298 份,保证没人评自己的 idea。

控制混淆的手段:三个条件匹配相同的话题分布;所有 idea 套统一的 project proposal 模板;用 LLM 对全部 idea 做风格标准化(消除人味/AI 味的写作线索);统计上跑三种检验——把每份 review、每个 idea、每个 reviewer 分别当独立样本,外加 linear mixed-effects model,novelty 的显著性在所有检验下都成立。

反向发现:多样性瓶颈与自评失灵

多样性:随着生成量增加,新 batch 里不重复想法的比例迅速跌向 0,4000 个种子想法累计只有约 200 个不重复——over-generate-and-rank 的 inference scaling 很快撞墙,继续采样只是复读。

自评:用人类评审分数排出 top/bottom 25% 的 idea 当金标准,测各种 LLM 评审器的判别准确率:GPT-4o 直接打分 50.0%(随机水平)、Claude-3.5 成对比较 53.3%、AI Scientist 的 reviewer agent 只有 43.3%(低于随机,且远低于其自报的 65%)——全部低于人类评审互评一致性 56.1%(NeurIPS'21 实验为 66.0%)。这条结果直接质疑了当时大量靠 LLM-as-a-judge 评 idea 的工作。

关键结果

实证核查

扎实实验设计和数据发布在同类工作里最规矩:298 份盲审原文和统计脚本全部公开,结论经三种检验;更难得的是作者自己做了后续执行实验并诚实报告'novelty 优势在执行后消失甚至反转'。核心声称成立,但引用这篇时必须带上 execution 后续,否则就是断章取义。
LLM 想法被评为比人类专家更 novel(p<0.05),结论对多种统计检验稳健。
可核查:仓库 NoviScl/AI-Researcher 的 reviews_ideation/ 目录公开了全部 298 份盲审(数值分 + 文字理由)和论文用的统计检验脚本,三个条件各 49 个 idea 也放出了 Google Drive 链接;source/results.tex 中三种检验(按 review/idea/reviewer 聚合)novelty 均显著。论文被 ICLR 2025 接收(OpenReview M23dTGWCZy),S2 引用 438。未见第三方反驳数据本身的报告。
论文自己承认:idea 阶段的 novelty 判断未必对应真实研究产出,并提出要做执行实验。
作者兑现了:后续论文 The Ideation-Execution Gap(arXiv:2506.20803,2025-06)招募 43 位研究者每人花 100+ 小时把 idea 做成 4 页短文再盲评。结果 LLM idea 的分数在执行后全指标显著下跌(p<0.05),多数指标上排名反转为人类 idea 更高——同一仓库 README 明确写着这个结论。也就是说本文的头条结论'AI 更 novel'只在'纸面 idea'层面成立,经不起执行检验。
Agent 靠过量生成 4000 个想法 + 排序找'diamond in the rough'。
论文自曝天花板:4000 个种子想法去重后只剩约 200 个不重复(LLM_discussion.tex,fig01 曲线快速平台化),inference scaling 在想法生成上很快失效。且 LLM ranker 挑的 top-49 与人类专家重挑的只有 17 个重叠,ranker 与人类品味差异大——'AI Ideas + Human Rerank 分数更高'这一点反过来说明纯自动管线的产出被高估。
代码和数据完整开源,可复现 agent 管线。
仓库(404 stars,MIT,2025-08 仍在维护)含 ai_researcher/ 完整管线代码、reviews_ideation/、reviews_execution/,README 给出每步 demo 成本($0.51-$2.9)。24 个 issues 里没有复现翻车帖,多为使用问题;但 #22/#23/#24 反映数据发布有小缺口(idea_id 与文本文件的映射、49 个人类 idea 的话题标签、AI_Rerank 条件的 ID 映射缺失),#16 求完整 4000 idea 池未获满足。
人类专家基线具有代表性(100+ 研究者、高资历)。
资历属实(73% PhD、72/79 评审有会议审稿经验),但论文自己的调查显示人类基线偏弱:37/49 参与者是为这 $300 任务现场想的 idea,自评只是个人历史想法的 top 43%。加上评审一致性仅 56.1%(低于 NeurIPS'21 的 66%),'AI 比人类专家更 novel'更准确的表述是'比时间受限的专家的中位数想法更 novel'。这些 caveat 论文都写了,属于诚实但常被转述丢掉的部分。

与我们方向的关系

对 autoresearch 方向这是必须精读的方法论基石:它定义了评估 idea 生成的严谨范式(盲评 + 风格标准化 + 话题匹配 + 多重统计检验),之后几乎所有 ideation 工作都拿它当基线或引它的结论。做自动科研 agent 的评估设计时,这里的 review 表单、三条件设置、评审一致性度量都可以直接借鉴;reviews_ideation/ 里 298 份带文字理由的专家盲审本身就是训练/校准 idea 评审器的稀缺数据。

两个反向发现对系统设计更有操作性:(1) over-generate-and-rank 的多样性瓶颈说明想法生成的 scaling 需要显式多样性机制(不同检索种子、多 persona、进化式变异),不能只靠加采样;(2) LLM-as-a-judge 在 idea 评估上低于人类互评一致性,意味着任何'我们的 agent 想法被 GPT-4 评为更好'式的结论都应默认存疑。另外读这篇必须配套读 2506.20803:ideation 阶段的 novelty 溢价在执行后消失,提示课题组如果做 idea 生成研究,评估终点应该尽量往执行结果靠。

阅读笔记

读 tex 源码比读正文摘要收获大:results.tex 保留了被注释掉的分话题表格(Bias、Multilingual 话题 AI 优势最大,Factuality 上 AI 反而低于人类),LLM_discussion.tex 有 AI Scientist reviewer 分布外只有 43.3% 的对比。注意 README 用的标题是 'Are LLMs Better than Experts...',与 arXiv 标题不同,是同一研究。仓库同时装着两篇论文(ideation + execution)的数据,别搞混 reviews_ideation 和 reviews_execution。

材料清单

TeX 源码
已存档:Raw/can-llms-generate-novel-research-ideas-a-100/source/
代码仓库github.com/NoviScl/AI-Researcher
404★ · 最近推送 2025-08-07
OpenReviewopenreview.net/forum?id=M23dTGWCZy
ICLR 2025 正式版与审稿意见
后续执行实验arxiv.org/abs/2506.20803
The Ideation-Execution Gap:43 位研究者实际执行这些 idea,LLM idea 分数执行后显著下跌、排名反转——读本文必须配套
盲审数据github.com/NoviScl/AI-Researcher/tree/main/reviews_ideation
298 份专家盲审原文(分数 + 文字理由)与统计脚本

同类条目