← 返回资料站  /  AutoResearch
论文 想法生成

ResearchAgent: Iterative Research Idea Generation over Scientific Literature with Large Language Models

ResearchAgent:基于文献的迭代式研究想法生成
一句话KAIST 与 Microsoft Research 的多 agent 框架:从一篇核心论文出发,用引文图 + 实体知识库扩充上下文,让 GPT-4 依次生成 problem/method/experiment design,再由多个 ReviewingAgent 按 5 项标准迭代打磨(约 3 轮饱和);在 300 篇 2023 年后论文的基准上,人评和 GPT-4 评均大幅超过无检索增强的 baseline,NAACL 2025 接收,引用 239。

这是什么

这篇 2024 年 4 月挂出的论文是'LLM 生成研究 idea'方向的早期代表作之一。它把 research idea generation 形式化为三步:problem identification、method development、experiment design,即 o = [p, m, d],并明确只做 ideation 这一段,不做后续的实验执行——和后来做全流程的 AI Scientist 类工作定位不同。

核心动机来自对人类科研的三个观察:研究者靠精读相关文献建立深度理解、靠跨领域概念联想产生新组合、靠同行评审迭代改进草稿。ResearchAgent 分别用引文图检索、实体共现知识库、多个 LLM reviewer agent 来模拟这三件事。论文的说法是'新 idea 往往是旧元素的新组合',所以系统被设计成从已有文献里做受控的组合与外推。

实验用 GPT-4(2023-11-06 版)作为底座,选 2023 年 5 月之后发表、引用超 20 的 300 篇论文作核心论文(刻意避开 GPT-4 训练截止,防数据泄漏),评测采用 GPT-4-as-judge 加 10 位领域专家人评。

系统总览:(A) 两个知识源——学术引文图(取核心论文的相关文献)和实体共现知识库(从 5 万篇论文标题摘要挖出的 entity pair 共现矩阵,按共现概率检索外部实体);(B) 生成流程——problem→method→experiment 三段生成,ReviewingAgents 用从人类评分归纳出的标准给 feedback,迭代修改。
系统总览:(A) 两个知识源——学术引文图(取核心论文的相关文献)和实体共现知识库(从 5 万篇论文标题摘要挖出的 entity pair 共现矩阵,按共现概率检索外部实体);(B) 生成流程——problem→method→experiment 三段生成,ReviewingAgents 用从人类评分归纳出的标准给 feedback,迭代修改。

机制与做法

两路知识增强:引文图 + 实体共现知识库

第一路模拟文献调研:给定核心论文 l0,沿 Semantic Scholar 引文图取直接相连的论文,再按摘要相似度筛一遍,把 {l0, l1, ..., ln} 塞进 prompt(每篇核心论文平均有 87 篇参考文献,必须筛)。

第二路是本文比较有特色的 entity-centric knowledge store:用 BLINK entity linker 对 2023-05 到 2023-12 的 50,091 篇论文的标题摘要抽实体,建一个 m×m 的稀疏共现矩阵。生成时,先取出当前论文组已有的实体集合,再按共现概率 P(e_j|e_i)×P(e_i) 检索 top-k 个'相关但不在当前论文里'的外部实体注入 prompt——目的是引入跨领域概念,比如给 hematology 的 idea 建议 'database'、给遗传学论文检索出 CRISPR。消融显示两路各有贡献,references 贡献更大;有趣的是随机实体也比不给实体好。

人评主结果(10 位专家、5 分制):蓝线 full ResearchAgent 在 problem/method/experiment 各 5 项指标上全面包住绿线(去掉实体检索)和红线(只给核心论文),其中 Originality、Innovativeness 等创造性指标差距最大——但注意这是 reference-free 主观评分,没有客观 novelty 核查。
人评主结果(10 位专家、5 分制):蓝线 full ResearchAgent 在 problem/method/experiment 各 5 项指标上全面包住绿线(去掉实体检索)和红线(只给核心论文),其中 Originality、Innovativeness 等创造性指标差距最大——但注意这是 reference-free 主观评分,没有客观 novelty 核查。

ReviewingAgents:人类偏好对齐的迭代评审

problem/method/experiment 各配 5 项评审标准(如 problem 的 Clarity/Relevance/Originality/Feasibility/Significance),由多个 LLM reviewer 并行打分并给出针对低分项的 feedback,ResearchAgent 据此改写,如此循环。实验显示分数在第 3 轮迭代左右饱和,再往后收益递减。

评审标准不是人手写的:作者先让至少发过 3 篇论文的研究者对每个 criterion 标注 10 对 idea 的 5 分制评分,再 prompt LLM 从这些人类评分里归纳出详细的评分标准描述,声称这样能让 GPT-4 judge 的分数分布更接近人类分布(论文 Figure 里确实展示了对齐后分布偏度改善)。

评测设计与主要局限

没有 ground truth,全靠 reference-free 评测:GPT-4 按 15 项标准打 5 分制 + pairwise 对比,外加 10 位专家只评'基于自己论文生成的 idea'(保证懂行)。20% 样本双人标注,Spearman/Cohen's kappa 一致性较高;human-model agreement 也不低,作者以此论证 GPT-4 judge 可用。

换底座模型的实验值得注意:用 Llama-3、Mixtral、Qwen1.5、GPT-3.5 时性能显著下降,且知识增强带来的增益在弱模型上变得微弱——整套框架的收益相当依赖 GPT-4 级别的长上下文推理能力。

关键结果

实证核查

有水分代码和数据最终放出且与论文结构对得上(六个 agent、5 万篇论文的知识库文件都在),但代码拖了 9 个月才开源;评测本质是 GPT-4 生成、GPT-4 打分的自评闭环,人评规模小(10 位专家),且有 issue 报告按论文配置复现时第 3 轮迭代就爆上下文。
官方仓库为 NAACL 2025 论文的完整实现,提供端到端 pipeline 与数据。
属实但迟到:arXiv 挂出于 2024-04,仓库 2025-01-14 才创建(issues #1-#3 都是催代码的,后关闭)。代码结构与论文一致:code/pipelines/agents/ 下确有 problem/method/experiment 各自的 identifier+validator 六个 agent;data/ 下 papers.jsonl(9.1MB)、references.jsonl(62MB)、knowledge.jsonl(2.7MB 实体共现库)俱在。目前 58 stars,无第三方完整复现报告。
通过迭代 review-refine 循环持续改进 idea,论文报告迭代到第 3-4 轮。
issue #5(open)报告:按论文同款 GPT-4-1106-preview 运行官方代码时,由于每轮把完整历史对话拼进上下文,第 3 轮迭代就超出 context limit 开始输出乱码,作者未回应。说明论文里'迭代 3 轮饱和'的曲线在公开代码上未必能原样复现;另有 open issue #4 报 S2 API 相关 ERROR、#7 问实体抽取细节,均无维护者回复。
生成的 idea 'novel, clear, and valid',由 human 和 model-based 双重评测验证。
评测是自指闭环:GPT-4 生成、GPT-4 打分,而'人类对齐'的评分标准仅由每项 criterion 10 对人类标注归纳而来(论文 Sec 4.2 脚注承认 5 位验证者中仅 2 人强同意)。人评只有 10 位专家、各自只评自己论文衍生的 idea,无新颖性的客观核查(如与已有文献查重)。后续 Si et al. 2024(ICLR 2025)的大规模盲评研究表明 LLM idea novelty 评分虽高但 feasibility 偏弱、LLM-judge 与人类相关性有限,这条方向上纯 LLM 评测的说服力普遍要打折。
entity-centric knowledge store 覆盖广泛文献、提供跨学科知识。
实际范围有限:只抽 2023-05 至 2023-12 共 50,091 篇论文的标题+摘要(正文不抽,论文脚注自认),每篇摘要平均仅抽出 2.17 个实体,且用的是未经科学领域训练的通用 BLINK linker。'encyclopedic'的说法比实现慷慨不少。

与我们方向的关系

对课题组的 auto-research 方向,这篇是 idea generation 子问题的标准引用点(NAACL 2025,引用 239)。可直接借鉴的组件有两个:一是把 ideation 拆成 problem→method→experiment 三段、每段配独立 validator 的分解方式,比一把梭生成完整 proposal 更可控;二是'从少量人类标注归纳评审 rubric 再交给 LLM judge'的对齐做法,成本低,适合我们自己搭评测时参考——但要吸取教训,10 对标注太少,分布对齐不等于判断对齐。

同样值得记住它的反面教材价值:迭代 refinement 约 3 轮饱和(和 self-refine 类工作一致),多轮历史拼接会爆上下文(issue #5),弱模型上知识增强增益消失。如果我们做 idea agent,评测必须引入论文查重/检索式 novelty 核查和更大规模盲评,否则会重蹈'GPT-4 自产自评'的可信度问题;对照可读 Si et al. 2024 的人类大规模盲评设计。

阅读笔记

论文正文没给单次生成成本;知识库检索用共现概率而非 embedding(附录说 embedding 检索是可替换项)。仓库 README 的 Running 一节只有一条命令,无 requirements.txt 说明,复现前先看 issues #4/#5。

材料清单

TeX 源码
已存档:Raw/researchagent/source/
代码仓库github.com/JinheonBaek/ResearchAgent
58★ · 最近推送 2025-08-24
对照阅读arxiv.org/abs/2409.04109
Si et al. 2024《Can LLMs Generate Novel Research Ideas?》:79 位 NLP 研究者大规模盲评,结论(LLM idea novelty 高但 feasibility 弱)可校准本文纯 LLM 评测的乐观程度
复现问题github.com/JinheonBaek/ResearchAgent/issues/5
issue #5:按论文配置第 3 轮迭代即超出上下文限制,复现前必看

同类条目