← 资料站  /  AutoResearch  /  想法生成与验证
论文 想法生成与验证 背景

A Survey on Hypothesis Generation for Scientific Discovery in the Era of Large Language Models

LLM 时代的科学假设生成综述
一句话17 位作者(以 AstroLLaMA/UniverseTBD 的天文学家为主)写的 8 页短综述,提出一个 SHG(Scientific Hypothesis Generation)分类学并整理了评估方法清单。实测:正文引用列表只有 20 条,其中 2024 年以后的仅 2 篇、2025 年 0 篇,Si et al.、AI Scientist、ResearchAgent、SciMON 等 LLM 时代代表工作全部缺席;Evaluation 与 Challenges 两节共约 1600 词、零引用;分类学配图因 TikZ 定位 bug 少画了一个分支。真正可用的只有前 LLM 时代的 LBD 谱系那一段。

这是什么

这是一篇 2025 年 4 月挂到 arXiv 的短综述(2504.05496),用 COLM 2025 模板、页眉写着 "Preprint. Under review.",全文 11 页(正文 8 页 + 参考文献)。到 2026 年 8 月仍只有 v1(2025-04-07 提交,此后 16 个月没有任何更新),S2 上的 venue 依旧是 arXiv.org,COLM 没收。注意本地 meta.json 里的 "updated: 2026-08-31" 是抓取脚本写的当天日期,不是 arXiv 的版本时间,别被误导。

17 位作者中 Ioana Ciucă、Kartheik Iyer、Maja Jablonska、Michael J. Smith、Simone Astarita、Marc Huertas-Company、Sandor Kruk、Kevin Schawinski 都是 AstroLLaMA / UniverseTBD 那批做天文 LLM 的人,另有 Tirthankar Ghosal(做 scholarly NLP)。这个作者构成解释了文章的两个特征:一是天文/跨学科视角明显,二是行文更像一次社区协作产出的路线梳理,而不是一篇下过系统检索苦功的 survey。

文章自称做了四件事:(i) 梳理方法并提出分类学;(ii) 分析提升假设质量的技巧(novelty boosting、结构化推理);(iii) 综述评估策略;(iv) 讨论挑战与未来方向。检索方法写得很正式——只查 arXiv API、只限 cs.CL、给出三组共 19 个检索词(Table 1),声称覆盖 2005–2025。但从未报告检索到多少篇、筛掉多少、最终纳入多少,没有 PRISMA 式的数量链,所以"系统性"这一点无法核验。

论文的核心产出 Figure 1:SHG 分类树。左侧 SHG 分出 LBD、Text-Mining、Supervised Learning、Graph Based、LLM-Driven 五支,LLM-Driven 再分 Prompting / Fine-Tuning / RAG / Knowledge Graphs。看这张图要留意两处:一是 tex 源码里其实定义了 6 个分支,Human-Centric 因为没写定位参数被红色 LBD 盖住了,而正文 §3.1 讲的就是 Human-Centric;二是 Text-Mining 和 Graph Based 在正文里没有任何对应小节,RAG 的正文段落被注释掉了(Figure 2 的 pipeline 图也没有 RAG)。这张图适合当"这个领域有哪几类做法"的速览,但别把它当有内容支撑的分类学。
论文的核心产出 Figure 1:SHG 分类树。左侧 SHG 分出 LBD、Text-Mining、Supervised Learning、Graph Based、LLM-Driven 五支,LLM-Driven 再分 Prompting / Fine-Tuning / RAG / Knowledge Graphs。看这张图要留意两处:一是 tex 源码里其实定义了 6 个分支,Human-Centric 因为没写定位参数被红色 LBD 盖住了,而正文 §3.1 讲的就是 Human-Centric;二是 Text-Mining 和 Graph Based 在正文里没有任何对应小节,RAG 的正文段落被注释掉了(Figure 2 的 pipeline 图也没有 RAG)。这张图适合当"这个领域有哪几类做法"的速览,但别把它当有内容支撑的分类学。

机制与做法

SHG 分类学:6 个分支,图上只有 5 个

论文的核心产出是 Figure 1 的 SHG 分类树。tex 源码里定义了 6 个一级分支:Human-Centric、LBD、Text-Mining、Supervised Learning、Graph Based、LLM-Driven;LLM-Driven 下再分 Prompting / Fine-Tuning / RAG / Knowledge Graphs。

但渲染出来的图只有 5 个分支。原因在 source/colm2025_conference.tex 第 157–158 行:\node (human) [substage, fill=blue!20] {Human-Centric};\node (lbd) [substage, fill=red!20] {LBD}; 都没写 below=of ... 定位,两个节点被叠在同一位置,后画的红色 LBD 盖住了蓝色 Human-Centric。结果是正文 §3.1 明明在讲 Human-Centric,分类图上却找不到它。

更实质的问题是分支与正文对不上:Text-Mining 和 Graph Based 两个分支在正文里完全没有对应小节;Supervised Learning 只有一个 4 句话的 \paragraph,而且最后一句是断的——"Some of the recent works \citep{breiman2003statistical}.",句子没写完就交了。RAG 在 Figure 1 里是一个分支,但正文的 RAG 段落在源码里被 % 注释掉了,Figure 2 的 pipeline 图也没有 RAG。三处(图 1 / 图 2 / 正文)互不一致。

Table 1:论文用于 arXiv API 检索的全部 19 个检索词,分 Core Concepts / Recent Techniques / Traditional Techniques 三组。这张表的实用价值高于它在原文里的作用——Traditional Techniques 一列(Swanson hypothesis discovery、open discovery system、ABC model literature discovery、semantic predications、semantic indexing、literature based discovery)是前 LLM 时代 LBD 文献的有效检索词,我们自己扫这条历史线时可以直接复用。同时它也暴露了检索范围的问题:全部查询只在 arXiv 的 cs.CL 类目下执行,而这些传统系统基本发在期刊、KDD、BIBM,用这套词在 cs.CL 里是搜不到的。
Table 1:论文用于 arXiv API 检索的全部 19 个检索词,分 Core Concepts / Recent Techniques / Traditional Techniques 三组。这张表的实用价值高于它在原文里的作用——Traditional Techniques 一列(Swanson hypothesis discovery、open discovery system、ABC model literature discovery、semantic predications、semantic indexing、literature based discovery)是前 LLM 时代 LBD 文献的有效检索词,我们自己扫这条历史线时可以直接复用。同时它也暴露了检索范围的问题:全部查询只在 arXiv 的 cs.CL 类目下执行,而这些传统系统基本发在期刊、KDD、BIBM,用这套词在 cs.CL 里是搜不到的。

唯一扎实的部分:前 LLM 时代的 LBD 谱系

§3.2 的 Literature-based Discovery 是全文写得最实的一段,也是我们收录它的真正理由。它把线索串起来了:Swanson 1986 的"undiscovered public knowledge"与鱼油–雷诺氏症案例 → ARROWSMITH(Smalheiser & Swanson 1998,找连接两个不相交文献集 A、C 的中间词 B)→ MOLIERE(Sybrandt 2017,在 MEDLINE 上用 LDA 建语义网络找概念间短路径)→ KnIT(2014,从文献抽事实建可查询网络 + 信息扩散算法,案例是找磷酸化 p53 的新激酶)→ 基于 MeSH 的 profile 方法、DiseaseConnect、BrainSCANr。

这一段每个系统都有真引用,机制描述准确,是一条可以直接拿去按引用往下挖的线。全文 20 条引用里有 8 条服务于这一段。

评估方法清单:结构清楚,但一条引用都没有

§4 Evaluation Methodologies 把评估分成两半,组织得其实不错:人类专家侧分 Expert Assessment Protocols / Blind Review and Pairwise Comparison / Multi-Rater Reliability 三条;自动侧分 Text-based Relevance(BLEU、ROUGE 及其语义化替代)/ Model-Based Metrics(LLM-as-judge)/ Novelty Assessment(用科学领域预训练模型算与已有文献的语义距离、引用图/ideation chain 定位)/ Domain-Specific Evaluation(生物医学对齐 gene-disease 库、化学看结构合法性与合成路径、天文对接大规模观测数据、社科看理论根基)。

问题是:这 872 词里 \citep 的数量是 0。同样,§5 Challenges and Future Research Directions 735 词、§6 Conclusion 121 词,也都是零引用。也就是说这篇 survey 最被称道的"评估方法清单"给的是一张没有坐标的地图——每一句"Comparative studies have shown…""Some benchmark efforts have…"背后你都查不到是谁做的。对拿它当入门地图的人来说,这基本上抵消了清单本身的价值。

关键结果

实证核查

宣传大于实质摘要承诺的是 "comprehensive survey" 加一个分类学,实际交付的是 20 条引用(2024 年后仅 2 篇)、一张少画了分支的分类图、约 1700 词零引用的评估与展望,外加一份含伪造条目的 .bib。前 LLM 时代的 LBD 谱系那一段是真的可用,LLM 时代的部分基本是没有出处的综述性叙述。当"地图"用可以,但只能用它的上半张。
摘要:"This paper presents a comprehensive survey of hypothesis generation with LLMs by (i) reviewing existing methods … and proposing a taxonomy"。
source/colm2025_conference.bbl 里 \bibitem 计数为 20。按年份拆:1986–2018 共 14 条(Swanson×2、ARROWSMITH、MOLIERE、KnIT、DiseaseConnect、BrainSCANr、MeSH、LDA、Breiman、Popper、Nonaka、Smalheiser 2017、GPT-1),2022–2023 共 4 条(PaLM×2 重复、LLaMA、Mistral),2024 共 2 条(kgcoi、causal_graphs),2025 共 0 条。归入 "LLM 驱动假设生成方法" 的引用只有 kgcoi 和 causal_graphs 两篇。对照本站同方向条目,发表时间早于 2025-04 因而完全有条件纳入却缺席的包括:Si et al. 2409.04109(2024-09,本站 core)、ResearchAgent 2404.07738(2024-04,本站 important)、Nova 2410.14255(2024-10,本站 context),以及 AI Scientist、SciMON、MOOSE、Google AI co-scientist。以 20 条引用、其中 2 篇 LLM 方法论文的规模自称 comprehensive,与实际严重不符。
§4 系统梳理了人类专家评估协议(大规模专家盲评、pairwise 对战排名、评分者一致性)与自动新颖性指标两套评估方法。
这一节 872 词,\citep 计数 0(脚本剥掉注释行后对 \cite* 命令统计);§5、§6 同为 0。而 §4 描述的具体内容与 Si et al.(2409.04109)高度对应:"large panels of experts from diverse academic backgrounds … clarity, innovation potential, and expected impact" 对应其 79 名 NLP 研究者、多维打分表;"blind review protocols … AI-generated hypotheses can be as highly rated—or even surpass—those written by human researchers regarding novelty" 就是该文的头条结论;"Earlier studies have highlighted relatively low agreement levels among reviewers" 对应其评分者一致性分析。这篇文章既没在正文引用它,.bib 里也没有它的条目(grep "Novel Research Ideas"、"ResearchAgent"、"SciMON"、"co-scientist"、"HypoGeniC" 均为 0 命中)。结果是清单可读但不可追,读者拿不到任何一条协议的原始出处。
Figure 1 "Taxonomy of Methods for Scientific Hypothesis Generation (SHG)" 是本文的核心贡献。
tex 源码定义 6 个一级分支,渲染出来只有 5 个(见 figures/fig01_taxonomy.png):\node (human)\node (lbd) 均未写 below=of 定位参数,叠在同一坐标,红色 LBD 盖住蓝色 Human-Centric,而正文 §3.1 标题恰恰是 Human-Centric。此外 Text-Mining 与 Graph Based 两个分支在正文无任何对应小节;Supervised Learning 只有一个 \paragraph,末句 "Some of the recent works \citep{breiman2003statistical}." 是残句;LLM-Driven 下的 RAG 分支在正文里被整段注释掉(源码 % \textbf{Retrieval-Augmented Generation (RAG)} 起),且 Figure 2 的 pipeline 图不含 RAG。图、图、文三方不一致。
.bib 是为这篇 survey 系统检索所建的文献库。
51 个条目中 31 个从未被引用,其中一批 arXiv 编号统一以 12345 结尾,明显是占位/编造。逐个 curl 验证真实指向:2107.12345(bib 记作 Scott et al. "Hypothesis Generation in NLP: A Review")实际是 "Uniqueness of Meromorphic functions concerning k-th derivatives and difference operators";2001.03544(记作 Boyd-Graber et al. "Hypothesis Generation in NLP: A Survey")实际是 "Cleaning ability of mixed solutions of sulfonated fatty acid methyl esters";2207.07004(记作 Thompson/Mimno/McCallum "Generating Scientific Hypotheses with Language Models")实际是 "Dynamic Property and Magnetic Nonpotentiality of Two Types of Confined Solar Flares"。作者名也是拼凑的(如把 Tom Hope、Yoni Halpern、Steven Horng 挂到一篇不存在的 biomedical review 上)。所幸这些条目未被引用,不进 .bbl,所以没污染发表版的 20 条引用列表;但它说明这份文献库的相当一部分是 LLM 生成后未核对的产物。
本文提出的分类学可作为该领域的参考框架("aims to serve as a reference for researchers")。
S2 上 citationCount 15、influentialCitationCount 1。逐条读引用语境(S2 citations?fields=contexts):全部是背景点名,例如 "Recent surveys of LLM-based hypothesis generation [26, 27, 29, 34] emphasize…"、"a large international team has just released a survey of the use of LLMs for hypothesis generation (Alkan et al. 2025)"。没有一篇使用 Human-Centric/LBD/Text-Mining/Supervised/Graph/LLM-Driven 这套分类。反倒出现了误引:"More Than Can Be Said"(2026)写 "Some focus on novelty boosting (Alkan et al., 2025), such as SciMON…",把 SciMON 归到这篇综述名下,而 SciMON 在这篇里根本没出现。同期竞品、已进 TMLR 2025 的 "From Reasoning to Learning: A Survey on Hypothesis Discovery and Rule Learning with LLMs" 则把它与几篇一起归为 "tend to be subjective, human-centric, and thus difficult to generalize, offering limited theoretical insight"。
"We employed a systematic literature retrieval strategy…";检索覆盖 2005 至 2025 年。
§2.1 自述只查 arXiv API、只限 cs.CL 一个类目。这有两个结构性后果:一是它盛赞的生物医学 LBD 文献(ARROWSMITH、MOLIERE、KnIT、DiseaseConnect 全部发在期刊/KDD/BIBM,不在 arXiv cs.CL)按自己的检索规则根本捞不到,只能靠 "manual curation" 补,那检索协议就不构成约束;二是大量 AI Scientist 类 agent 工作挂在 cs.AI/cs.LG,被这个过滤条件直接排除。同时,声称的时间上限 2025 与引用列表最新年份 2024 不符,且全文从未给出检索命中数、筛选后数量、最终纳入数量,没有任何可复核的数量链。

与我们方向的关系

定位:把它当半张地图,只用上半张。真正值得读的是 §3.2 那一段 LBD 谱系(Swanson 1986 → ARROWSMITH 1998 → MOLIERE 2017 → KnIT → DiseaseConnect/BrainSCANr),约 1 页,有真引用、机制描述准确。这条线索是我们 ideation 子方向此前缺的历史纵深:它说明"从文献里找未被连起来的概念对"这个问题范式在 LLM 之前已经被做了 40 年,ABC 模型(A–B–C 中间词)、语义网络最短路径、信息扩散这几种机制现在被 LLM 系统重新包装了一遍。做 idea 生成时先花 20 分钟读这段,能避免把已被解决过的问题当新问题,也能给"新颖性"提供一个非 embedding 的定义方式。

阅读顺序建议:先读本条目的 §3.2 建立前 LLM 谱系,然后直接跳到本站的实证条目——can-llms-generate-novel-research-ideas-a-100(Si et al.,人类盲评的黄金标准,本篇 §4 的评估协议实际上就是它的无引用转述,读原文)、the-ideation-execution-gap(同组后续,把 idea 真跑出来,结论是新颖性优势在执行后消失)、researchagent 与 nova(具体系统)。LLM 时代的分类学不要用这篇,用 TMLR 2025 的 "From Reasoning to Learning: A Survey on Hypothesis Discovery and Rule Learning with LLMs",那篇过了同行评审、覆盖到 2025。本站 field-surveys 下的 ai-for-auto-research-roadmap 也比它完整。

反向用途(可能比正向更值)——它是一个现成的"综述该怎么写坏"的样本,建议课题组写 survey 前拿它对照自查四条:(1) 检索协议要给出命中/筛选/纳入的数量链,只限一个 arXiv 类目就别自称 systematic;(2) 分类学的每个分支必须有正文小节,图和文要同步(它的 Text-Mining、Graph Based 是空分支,Human-Centric 分支被图覆盖掉);(3) 评估与展望章节零引用等于没写,清单必须能追到原文;(4) .bib 里 LLM 生成的条目必须逐条 curl arXiv 验证——这篇漏出来 8 条伪造条目,其中 6 条编号直接是 12345 占位,另 2 条编号真实却指向完全无关的论文。这四条正好是我们做自动化 survey/deep-research 工具时的可检查项,可以直接写成 lint 规则。

阅读笔记

1) 本地 meta.json 的 arxiv.updated = 2026-08-31 是 fetch_raw 脚本写入的抓取日期,不是版本时间;arXiv abs 页 Submission history 只有 [v1] Mon, 7 Apr 2025,别据此以为它在持续更新。2) source/ 里没有任何图片文件,两张图都是 TikZ 现画的,figures/ 下的两张 PNG 是我从 arxiv.org/pdf/2504.05496v1 用 pdftoppm -r 160 渲染第 3、4 页再用 sips 裁出来的。3) tex 源码里被注释掉的内容比留下的还多(约 170 行),包括一份细到三级标题的完整大纲(Philosophical Perspectives、Abductive Reasoning、NLI、Mamba、Knowledge Graph Completion、数据集章节等)和 RAG、data-driven hypothesis generation 两个正文段落——看得出原计划是一篇大综述,最后按 COLM 8 页限制砍成了现在这样,砍的时候没做收尾。4) export.arxiv.org 的 query API 在本机连不上(返回空),验证版本用了 https://arxiv.org/abs/<id> 抓 Submission history;另外注意 arxiv.org/abs/<不存在的 id> 也可能返回 HTTP 200,curl -sI 判 200 不足以证明 ID 存在,必须看页面标题。

材料清单

TeX 源码
已存档:Raw/hypothesis-generation-survey/source/
更好的替代综述www.semanticscholar.org/paper/4123282c3cb0491de0714a93ca3ef3e46dcee5c6
From Reasoning to Learning: A Survey on Hypothesis Discovery and Rule Learning with LLMs(TMLR 2025)。已过同行评审、覆盖到 2025,想要 LLM 时代的分类学用这篇;它本身也引用并轻度批评了本条目。
必读原文arxiv.org/abs/2409.04109
Si et al., Can LLMs Generate Novel Research Ideas?(本站 core 条目 can-llms-generate-novel-research-ideas-a-100)。本篇 §4 的专家盲评/pairwise/评分者一致性内容实际是它的无引用转述,直接读原文。
第三方资源清单github.com/HKUST-KnowComp/Awesome-LLM-Scientific-Discovery
本篇没有自己的配套仓库或 awesome list。要持续跟踪的清单用这个,或 usail-hkust/Awesome-Foundation-Models-for-Scientific-Discovery。
被引语境api.semanticscholar.org/graph/v1/paper/acfa5bdaab738890ac854c8d3169d407c4d64791/citations?fields=title,year,contexts,isInfluential
15 条引用的原始语境,可自行复核"全是背景点名、无人采用其分类学"这一判断。

相关条目

同子模块 · 想法生成与验证
跨方向 · 同标签