AI4Research: A Survey of Artificial Intelligence for Scientific Research
AI4Research:AI 做科研的五阶段全景综述
Qiguang Chen, Mingda Yang, Libo Qin, et al. (Wanxiang Che 通讯) · 哈工大 / 香港理工等 · 2025-07 · 被引 53
一句话 哈工大 LARG 牵头的 960 篇引文超大规模综述,把「AI 做科研」拆成理解文献 / 写综述 / 科学发现 / 学术写作 / 同行评审五个阶段,并附各阶段的数据集与工具清单;当地图和文献索引好用,但论文停在 2025-08-05 的 v2、配套 awesome list 同日停更,AI R&D 评测与自改写 agent 这两条线基本缺席。
这是什么 这是 2025-07 放出的领域全景综述(v2 2025-08),作者 16 人,主体是哈工大社会计算与信息检索研究中心(LARG,车万翔组),合作方包括中南大学、港大、UIUC、普林斯顿、复旦、港中文、字节 Seed。它要回答的问题不是「某个 AI Scientist 系统怎么做」,而是「AI 介入科研这件事一共有几个环节、每个环节现在做到哪一步、有什么数据集和工具可用」。核心产出是一个五阶段分类学 + 一个 960 条引文的文献库 + 一份资源清单(sections/resources.tex 按阶段列 benchmark 和语料)。
五个阶段是:(1) Scientific Comprehension——读论文、读表格和图表;(2) Academic Survey——相关工作检索 + 综述报告生成;(3) Scientific Discovery——idea mining、新颖性与重要性评估、理论分析、实验执行、全自动发现;(4) Academic Writing——半自动与全自动写作;(5) Academic Peer Review——pre-review / in-review / post-review。相比站内其他同方向综述,它独有的是把「读入端」(文献与图表理解)和「综述自动生成」当成一等公民,并在应用章里单列社会科学、在未来方向里单列多语言问题。
论文的五阶段总览图:左下 Scientific Comprehension(文本 + 表格图表理解)→ 左上 Academic Survey(相关工作检索 + 综述报告生成)→ 右上 Scientific Discovery(idea mining / 重要性评估 / 理论分析 / 实验执行,再往上收敛到 full-automatic discovery)→ 右中 Academic Writing(半自动 / 全自动)→ 右下 Academic Peer Review(pre / in / post-review)。底部的时间轴是它对五个方向研究热度先后顺序的判断。看这张图基本等于看懂全文骨架,查文献时按格子定位章节。 机制与做法 分类学的组织方式:按科研流水线切,不按技术切
全文骨架就是科研工作流本身:先给 AI4Research 的成分定义(sections/definition.tex 还专门讨论了它与 AI4Science 的区别——AI4Science 是用 AI 做某个学科的科学问题,AI4Research 是用 AI 做科研这个活动本身),再顺着五个阶段各开一章,最后是应用(自然科学 / 应用科学与工程 / 社会科学)、七条未来方向(跨学科模型、伦理安全、协作科研、可解释性、实时优化实验、多模态、多语言)。
这种切法的好处是查找方便:想知道「表格图表理解现在有哪些工作」直接翻 comprehension.tex 的第二小节,想找 benchmark 直接翻 resources.tex 对应小节。代价是每个格子里的内容偏浅——单个阶段的深度不如站内专题综述,基本是「谁做了什么 + 引文」的密集罗列,少有横向对比表和失败分析。
配套 awesome list
GitHub 上的 LightChen233/Awesome-AI4Research 是这篇的 paper list 版本(238 stars),README 有 633 条 arXiv 链接,分节与论文的五阶段一致。查文献时它比 PDF 顺手:按小节扫标题、直接点链接,适合当某个子问题的起点索引。但它已随论文一起停更(见 reality),2025-08 之后的工作要自己补。
关键结果 960 条引文(source/main.bbl 中 \bibitem 计数 960),是站内 ai-scientist 方向综述里引文量最大的一篇。 五阶段分类学:Scientific Comprehension / Academic Survey / Scientific Discovery / Academic Writing / Academic Peer Review;Scientific Discovery 下再分 idea mining、novelty & significance assessment、theory analysis、experiment conduction、full-automatic discovery。 唯一在站内综述里把「文献与图表理解」(textual + table & chart comprehension)单列成章的一篇。 sections/resources.tex 按五阶段各列 benchmark、语料和工具,是这篇最实用的部分之一。 配套 repo README 有 633 条 arXiv 链接,时间分布集中在 2025 上半年(2505 最多 78 条),2507 只有 4 条。 S2 引用 53 次(2026-08 查),被引主要来自 2026 年的新工作,多为 intro 处的领域背书。 实证核查
有水分 数字类声称逐条对得上:main.bbl 确有 960 条 bibitem,资源清单、社会科学与多语言小节都在。打折的是「comprehensive」和「systematic taxonomy」这两个定性声称——AI R&D 能力评测与自改写 agent 这两条线基本没进它的视野,论文 v2 和配套 repo 在 2025-08-05 同一天封版后再没动过,五阶段分类学也没有被后续工作当框架用起来(53 次引用绝大多数是 intro 一句话的领域背书)。比站内同类综述低一档的原因就在这三条同时成立:覆盖有整块空白、事实停更、框架未被采纳。
摘要声称这是 AI4Research 的 comprehensive survey,系统覆盖五个主流任务。
拿站内同方向条目抽查 source/main.bbl:AI Scientist-v2、AlphaEvolve、MLE-bench、PaperBench、ScienceAgentBench、MLGym、EXP-Bench、MLR-Bench、CycleResearcher、NovelSeek、OpenScholar、PaperQA、AI co-scientist(Gottweis)、Coscientist(Boiko)都在;但 RE-Bench(METR,2024-11)、Darwin Gödel Machine(2025-05)、The Ideation-Execution Gap(2025-06)、ML-Master、AI-Researcher 全是 0 命中。即「衡量 AI 自动化 AI 研发的能力上限」和「agent 改写自己」这两条线在它的地图上是空白——这恰好是站内 autoresearch/ai-rd-eval 与 rsi 两个方向的主干。
配套 awesome list 定位为持续维护的社区资源。
GitHub API 查 LightChen233/Awesome-AI4Research:仓库历史总共只有 7 次 commit,最后一次是 2025-08-05T16:12,且几乎都是外部 PR 合并(#1 加 Yale NLP 论文、#2 加 Foam-Agent),不是作者自己的增量维护。arXiv 提交历史显示 v2 也是 2025-08-05T16:19 —— 论文和 repo 同一天封版,至今(2026-08)13 个月没更新。README 里最新的 arXiv 编号只到 2507。未 archive,但事实上停更。
第一条贡献是 introduce a systematic taxonomy,言下之意是给领域提供统一坐标系。
读 S2 全部 53 条引用的上下文:绝大多数是 intro 里一句话的领域背书(如 MacAma 的「the emergence of AI4Research [7]」、SciAtlas 的「[Chen et al., ...]」)。只有 Paper2Video(「under the umbrella of AI for Research (AI4Research) [4]」)、AutoPR、FlowPIE、OUTLINEFORGE 几篇把 AI4Research 当术语或框架来引。没有找到后续工作按它的五阶段来组织实验、划分 benchmark 或做能力矩阵。术语被接受了一部分,分类学本身没有被采纳为工作框架。
声称覆盖多学科应用、多语言与社会影响面。
这部分对得上:source/sections/application.tex 确有 AI for Social Science Research 子节,future.tex 有 Multilingual Integration in AI4Research 与 Ethics and Safety 子节,comprehension.tex 有 Table & Chart Scientific Comprehension 子节。这几块内容在站内其他 field-surveys 条目里都没有,是这篇不可替代的部分。
与我们方向的关系 把它当【地图和文献索引】,不要当教程。适用场景是两个:一是刚接触一个子问题、需要快速知道「这个方向上都有谁做过」时,先在 repo README 对应小节扫一遍标题;二是写自己论文的 related work 时,用它的五阶段做章节骨架、用 resources.tex 找该阶段的 benchmark。它的分辨率对做实现或做评测来说太粗——不要指望从中读到某个系统的成败细节。
使用时必须打两个补丁。第一,时间补丁:它的视野截止 2025-07,之后的 Kosmos、InternAgent-1.5、OmniScientist、AI4AI-Bench 这类工作它都没有,续读要靠站内更新的综述(agentic-science-survey 2025-08、a-survey-of-ai-scientists 2025-10、autonomous-research-agents-verification-gap 2026-06)。第二,视角补丁:它最强的是「读入端」(文献 / 表格图表理解)和综述生成,这两块可以直接配站内 deep-research 组的 OpenScholar、PaperQA2、PaSa 一起读;而它最弱的实验严谨性与能力评测,要换成 RE-Bench、PaperBench、MLE-bench、EXP-Bench 这些条目本身,自动评审那章则被站内 auto-review 组(尤其 stop-automating-peer-review-without-rigorous)完全覆盖并纠正。简单说:五阶段里的 1、2 两阶段读它,3、5 两阶段读站内专题条目。
阅读笔记 arXiv 停在 v2(2025-08-05),与 repo 最后一次 commit 同一天;S2 的 paper 详情端点当时返回 429,influentialCitationCount 未取到,引用数 53 来自 citations 端点计数。PDF 有 5.9MB,图多为示意插画,信息量最大的就是五阶段总览图。
材料清单 TeX 源码 已存档:Raw/ai4research-survey/source/
相关条目 同子模块 · 全景综述与路线梳理
跨方向 · 同标签