论文
想法生成
ResearchAgent: Iterative Research Idea Generation over Scientific Literature with Large Language Models
ResearchAgent:基于文献的迭代式研究想法生成
Jinheon Baek, Sujay Kumar Jauhar, Silviu Cucerzan, Sung Ju Hwang · KAIST / Microsoft Research · NAACL 2025 · 2024-04 · 被引 239
一句话 KAIST 与 Microsoft Research 的多 agent 框架:从一篇核心论文出发,用引文图 + 实体知识库扩充上下文,让 GPT-4 依次生成 problem/method/experiment design,再由多个 ReviewingAgent 按 5 项标准迭代打磨(约 3 轮饱和);在 300 篇 2023 年后论文的基准上,人评和 GPT-4 评均大幅超过无检索增强的 baseline,NAACL 2025 接收,引用 239。
这是什么 这篇 2024 年 4 月挂出的论文是'LLM 生成研究 idea'方向的早期代表作之一。它把 research idea generation 形式化为三步:problem identification、method development、experiment design,即 o = [p, m, d],并明确只做 ideation 这一段,不做后续的实验执行——和后来做全流程的 AI Scientist 类工作定位不同。
核心动机来自对人类科研的三个观察:研究者靠精读相关文献建立深度理解、靠跨领域概念联想产生新组合、靠同行评审迭代改进草稿。ResearchAgent 分别用引文图检索、实体共现知识库、多个 LLM reviewer agent 来模拟这三件事。论文的说法是'新 idea 往往是旧元素的新组合',所以系统被设计成从已有文献里做受控的组合与外推。
实验用 GPT-4(2023-11-06 版)作为底座,选 2023 年 5 月之后发表、引用超 20 的 300 篇论文作核心论文(刻意避开 GPT-4 训练截止,防数据泄漏),评测采用 GPT-4-as-judge 加 10 位领域专家人评。
系统总览:(A) 两个知识源——学术引文图(取核心论文的相关文献)和实体共现知识库(从 5 万篇论文标题摘要挖出的 entity pair 共现矩阵,按共现概率检索外部实体);(B) 生成流程——problem→method→experiment 三段生成,ReviewingAgents 用从人类评分归纳出的标准给 feedback,迭代修改。 机制与做法 两路知识增强:引文图 + 实体共现知识库
第一路模拟文献调研:给定核心论文 l0,沿 Semantic Scholar 引文图取直接相连的论文,再按摘要相似度筛一遍,把 {l0, l1, ..., ln} 塞进 prompt(每篇核心论文平均有 87 篇参考文献,必须筛)。
第二路是本文比较有特色的 entity-centric knowledge store:用 BLINK entity linker 对 2023-05 到 2023-12 的 50,091 篇论文的标题摘要抽实体,建一个 m×m 的稀疏共现矩阵。生成时,先取出当前论文组已有的实体集合,再按共现概率 P(e_j|e_i)×P(e_i) 检索 top-k 个'相关但不在当前论文里'的外部实体注入 prompt——目的是引入跨领域概念,比如给 hematology 的 idea 建议 'database'、给遗传学论文检索出 CRISPR。消融显示两路各有贡献,references 贡献更大;有趣的是随机实体也比不给实体好。
人评主结果(10 位专家、5 分制):蓝线 full ResearchAgent 在 problem/method/experiment 各 5 项指标上全面包住绿线(去掉实体检索)和红线(只给核心论文),其中 Originality、Innovativeness 等创造性指标差距最大——但注意这是 reference-free 主观评分,没有客观 novelty 核查。 ReviewingAgents:人类偏好对齐的迭代评审
problem/method/experiment 各配 5 项评审标准(如 problem 的 Clarity/Relevance/Originality/Feasibility/Significance),由多个 LLM reviewer 并行打分并给出针对低分项的 feedback,ResearchAgent 据此改写,如此循环。实验显示分数在第 3 轮迭代左右饱和,再往后收益递减。
评审标准不是人手写的:作者先让至少发过 3 篇论文的研究者对每个 criterion 标注 10 对 idea 的 5 分制评分,再 prompt LLM 从这些人类评分里归纳出详细的评分标准描述,声称这样能让 GPT-4 judge 的分数分布更接近人类分布(论文 Figure 里确实展示了对齐后分布偏度改善)。
评测设计与主要局限
没有 ground truth,全靠 reference-free 评测:GPT-4 按 15 项标准打 5 分制 + pairwise 对比,外加 10 位专家只评'基于自己论文生成的 idea'(保证懂行)。20% 样本双人标注,Spearman/Cohen's kappa 一致性较高;human-model agreement 也不低,作者以此论证 GPT-4 judge 可用。
换底座模型的实验值得注意:用 Llama-3、Mixtral、Qwen1.5、GPT-3.5 时性能显著下降,且知识增强带来的增益在弱模型上变得微弱——整套框架的收益相当依赖 GPT-4 级别的长上下文推理能力。
关键结果 人评与 GPT-4 评均显示:full ResearchAgent 在 problem/method/experiment 全部 15 项指标上超过 Naive(只给核心论文)和 w/o Entity Retrieval 两个 baseline,创造性类指标(Originality、Innovativeness)提升最明显,pairwise 胜率也最高。 迭代评审前 2-3 轮有效,problem 平均分从约 4.33 升到约 4.53 后饱和,继续迭代收益递减。 消融:去掉 references 或 entities 都掉分,references 更关键;给随机实体也比不给强,作者归因于 LLM 能过滤噪声。 核心论文引用数越高,生成 idea 的评分越高——高影响力论文更容易被挖出 research gap。 评审标准从每 criterion 仅 10 对人类标注中归纳;5 位标注者对归纳出的标准 2 人强同意、3 人中等同意。 换弱模型(Mixtral、GPT-3.5)后知识增强增益变得 marginal,框架收益强依赖 GPT-4 级底座。 实证核查
有水分 代码和数据最终放出且与论文结构对得上(六个 agent、5 万篇论文的知识库文件都在),但代码拖了 9 个月才开源;评测本质是 GPT-4 生成、GPT-4 打分的自评闭环,人评规模小(10 位专家),且有 issue 报告按论文配置复现时第 3 轮迭代就爆上下文。
官方仓库为 NAACL 2025 论文的完整实现,提供端到端 pipeline 与数据。
属实但迟到:arXiv 挂出于 2024-04,仓库 2025-01-14 才创建(issues #1-#3 都是催代码的,后关闭)。代码结构与论文一致:code/pipelines/agents/ 下确有 problem/method/experiment 各自的 identifier+validator 六个 agent;data/ 下 papers.jsonl(9.1MB)、references.jsonl(62MB)、knowledge.jsonl(2.7MB 实体共现库)俱在。目前 58 stars,无第三方完整复现报告。
通过迭代 review-refine 循环持续改进 idea,论文报告迭代到第 3-4 轮。
issue #5(open)报告:按论文同款 GPT-4-1106-preview 运行官方代码时,由于每轮把完整历史对话拼进上下文,第 3 轮迭代就超出 context limit 开始输出乱码,作者未回应。说明论文里'迭代 3 轮饱和'的曲线在公开代码上未必能原样复现;另有 open issue #4 报 S2 API 相关 ERROR、#7 问实体抽取细节,均无维护者回复。
生成的 idea 'novel, clear, and valid',由 human 和 model-based 双重评测验证。
评测是自指闭环:GPT-4 生成、GPT-4 打分,而'人类对齐'的评分标准仅由每项 criterion 10 对人类标注归纳而来(论文 Sec 4.2 脚注承认 5 位验证者中仅 2 人强同意)。人评只有 10 位专家、各自只评自己论文衍生的 idea,无新颖性的客观核查(如与已有文献查重)。后续 Si et al. 2024(ICLR 2025)的大规模盲评研究表明 LLM idea novelty 评分虽高但 feasibility 偏弱、LLM-judge 与人类相关性有限,这条方向上纯 LLM 评测的说服力普遍要打折。
entity-centric knowledge store 覆盖广泛文献、提供跨学科知识。
实际范围有限:只抽 2023-05 至 2023-12 共 50,091 篇论文的标题+摘要(正文不抽,论文脚注自认),每篇摘要平均仅抽出 2.17 个实体,且用的是未经科学领域训练的通用 BLINK linker。'encyclopedic'的说法比实现慷慨不少。
与我们方向的关系 对课题组的 auto-research 方向,这篇是 idea generation 子问题的标准引用点(NAACL 2025,引用 239)。可直接借鉴的组件有两个:一是把 ideation 拆成 problem→method→experiment 三段、每段配独立 validator 的分解方式,比一把梭生成完整 proposal 更可控;二是'从少量人类标注归纳评审 rubric 再交给 LLM judge'的对齐做法,成本低,适合我们自己搭评测时参考——但要吸取教训,10 对标注太少,分布对齐不等于判断对齐。
同样值得记住它的反面教材价值:迭代 refinement 约 3 轮饱和(和 self-refine 类工作一致),多轮历史拼接会爆上下文(issue #5),弱模型上知识增强增益消失。如果我们做 idea agent,评测必须引入论文查重/检索式 novelty 核查和更大规模盲评,否则会重蹈'GPT-4 自产自评'的可信度问题;对照可读 Si et al. 2024 的人类大规模盲评设计。
阅读笔记 论文正文没给单次生成成本;知识库检索用共现概率而非 embedding(附录说 embedding 检索是可替换项)。仓库 README 的 Running 一节只有一条命令,无 requirements.txt 说明,复现前先看 issues #4/#5。
材料清单 TeX 源码 已存档:Raw/researchagent/source/
对照阅读 arxiv.org/abs/2409.04109 Si et al. 2024《Can LLMs Generate Novel Research Ideas?》:79 位 NLP 研究者大规模盲评,结论(LLM idea novelty 高但 feasibility 弱)可校准本文纯 LLM 评测的乐观程度
同类条目