← 返回资料站  /  AutoResearch
论文 想法生成 背景

Nova: An Iterative Planning and Search Approach to Enhance Novelty and Diversity of LLM Generated Ideas

Nova:用迭代规划+检索扩大 LLM 想法搜索空间
一句话西湖大学等提出的 idea 生成 pipeline:针对 LLM 生成想法同质化的问题,每轮先规划该检索什么外部知识、再检索、再基于新知识改写 seed idea,迭代 3 轮;在 170 篇 seed 论文上,unique novel idea 数比不迭代多 3.4 倍,Swiss Tournament 中 top 分想法数(619)约为三个基线(223/237/249)的 2.5 倍以上。ACL 2025 Findings。

这是什么

已有的 LLM idea 生成系统(AI-Researcher、AI-Scientist、ResearchAgent)有个公认的毛病:多生成几十个想法后就开始重复、趋同,因为模型只在自身参数知识和一次性检索的少量文献里打转。Nova 的出发点是把'创新'看成一个知识获取问题——想法不够新,是因为没有主动去搜没见过的知识。

解法是一个三阶段 pipeline(见架构图):先从输入论文 + 引文 + 10 条科学发现方法论(基于 Kuhn 范式理论等)生成 15 个初始 seed idea;然后进入核心的迭代环节——让 LLM 针对每个 seed idea 规划'还需要哪些领域的知识',据此检索论文(自建 2022-2024 arXiv AI/NLP/CV 语料的 FAISS 检索),结合新知识把每个 idea 扩展成 10 个再自反思筛到 3 个,迭代 3 轮后得到 405 个 seed idea,k-means 聚成 100 类取中心输出;最后按 Si et al. 2024 的模板补全成完整 proposal。

Nova 三阶段 pipeline:左侧从输入论文 + 相关文献 + 科学发现理论生成初始 seed idea(带 self-correction);中间是核心循环——对每个 target idea 先 plan and search(规划要检索什么知识)、检索相关论文、生成新 seed idea 并更新 idea pool,迭代 3 轮;右侧把最终 seed idea 补全为含 research problem/method/experiment plan 的完整 proposal。
Nova 三阶段 pipeline:左侧从输入论文 + 相关文献 + 科学发现理论生成初始 seed idea(带 self-correction);中间是核心循环——对每个 target idea 先 plan and search(规划要检索什么知识)、检索相关论文、生成新 seed idea 并更新 idea pool,迭代 3 轮;右侧把最终 seed idea 补全为含 research problem/method/experiment plan 的完整 proposal。

机制与做法

迭代 planning + search 是唯一的新东西

与基线的差别不在检索本身(ResearchAgent 也检索),而在于检索目标由 LLM 根据当前 idea 动态规划(in-context learning 引导,而非实体/关键词匹配),且每轮用新检索到的知识替换掉旧 seed idea,搜索空间按 3 倍/轮扩张。消融显示 unique novel idea 数随迭代步单调上升:第 0/1/2/3 轮分别为 14.7/26.9/41.3/50.6 个(每 100 个想法中)。

初始生成阶段的辅助模块:knowledge tracking(按社交媒体/GitHub 热度追踪最新论文并让 LLM 总结趋势)、10 条科学发现理论作提示模板、self-check/self-critique/reflection 三种自纠错。这些都是 prompt 工程,没有训练。

评估方式

自动评估:170 篇 seed 论文(CVPR/ACL/ICLR 2024 高引 + HF Daily Papers),每篇每方法生成 100 个 idea,用 Claude-3.5-Sonnet 做 zero-shot pairwise 比较的 Swiss Tournament(5 轮)打分;novelty 用检索 top-10 相关论文 + all-MiniLM-L6-v2 embedding 相似度(阈值 0.3)判定;diversity 用去重比例(阈值 0.8),Nova 超过 80% non-duplicate,明显高于基线。

人评:10 位 NLP/ML/CV 方向 PhD/教授,20 个 topic,每 topic 从每个方法按自动评估分位数抽 5 个 idea 共 20 个。Nova 在人评 top-4 想法中占 37.5%(4 方法均分基准是 25%),worst-4 中只占 17.53%——方向与自动评估一致,但优势幅度远没有 Swiss 分数(2.5 倍)那么悬殊。

关键结果

实证核查

有水分方法本身是干净的 prompt pipeline,迭代提升 novelty 的消融趋势可信;但 headline 的 2.5 倍来自 LLM judge,人评优势明显缩水,且代码拖了近一年才由作者个人账号放出、可用性存疑,无第三方复现。
论文/arXiv 页未给代码链接(catalog 中 code_url 为空),但社区能搜到官方实现。
GitHub 上 hflyzju/Nova(README 与论文完全对应,含 pipeline 图和 FAISS 检索、agent、prompts 等完整目录)创建于 2025-05,实质代码 2025-09 才推上去——比论文(2024-10)晚了近一年;仅 7 stars,issues #1(2025-08)和 #2(2025-09)都是在催 code release 且零回复,#3 用户实际运行时遇到 import 冲突等环境问题。截至查证(2026-08)没有任何第三方复现报告。
'生成的 top-rated ideas 至少是 SOTA 的 2.5 倍'。
这个 2.5 倍完全由 Claude-3.5-Sonnet zero-shot pairwise ranker 判定(tex 源码 Experiment 节)。论文自己的人评(10 位专家、20 topics)里 Nova 在 top-4 中占 37.5%,对比 4 方法均分基准 25%,是 1.5 倍而非 2.5 倍量级——LLM judge 放大了优势。另外 novelty/diversity 判定依赖 all-MiniLM-L6-v2 相似度阈值(0.3/0.8),阈值选择直接决定'3.4 倍 unique novel'这个数。
被同行接受为该方向的有效方法。
S2 引用 63 次(截至 2026-08),被 ACL 2025 Findings 录用;后续工作(如 Idea Search 树搜索、divergent thinking 评测等)将其作为 idea 多样性方法引用,方向上的影响是真实的,但引用多为相关工作提及,未见复现其具体数字的工作。

与我们方向的关系

对 autoresearch 方向的直接启示:idea 同质化不是采样温度问题,而是知识边界问题——'让 LLM 自己规划要检索什么'比关键词/实体检索更能把想法推离初始论文的邻域,消融里 novelty 随迭代单调上升(14.7→50.6)是这一点最有说服力的证据。做 idea 生成模块时,'plan-then-retrieve 迭代 + 每轮替换 seed pool + 最后聚类去重'这套编排可以直接借用,成本是 token 用量按 3^T 增长。

另一个可借鉴/需警惕的点是评估:本文再次示范了 LLM-judge(Swiss Tournament)与人评的差距——同一组系统,LLM judge 给出 2.5 倍差距,人评只有 1.5 倍。自己做 idea 质量评估时应把 LLM judge 的倍数打折看待。

阅读笔记

代码仓库 hflyzju/Nova 是作者(疑为一作 Xiang Hu)个人账号,依赖自建 FAISS 学术检索服务(需先跑 index builder + Flask server),复现门槛不低且有环境坑(issue #3)。论文 tex 注释里留有被删掉的表格:Nova unique novel idea 均值 56.26(SD 12.12)vs AI-Researcher 44.91(SD 19.36)——这个更朴素的对比只有 1.25 倍,可作为 headline 数字的参照。

材料清单

TeX 源码
已存档:Raw/nova/source/
代码github.com/hflyzju/Nova
作者个人账号的官方实现,2025-09 才补全代码,7 stars,需自建 FAISS 学术检索服务

同类条目