← 资料站  /  AutoResearch  /  自动同行评审
论文 自动同行评审 背景

Large language models for automated scholarly paper review: A survey

LLM 自动同行评审(ASPR)综述
一句话Information Fusion 2025 的 ASPR(automated scholarly paper review)综述:统计了哪些 LLM 被用来做评审(GPT-4 占 32%)、梳理 prompt/SFT/multi-agent 三类生成方法、15 个新数据集和十余个开源代码,并汇总出版商政策;是站内 auto-review 子模块的地图,但截稿于 2025 年中,漏掉 DeepReview、AAAR-1.0 等关键工作,且立场明显偏 pro-ASPR。

这是什么

这篇综述来自 Lin Jialiang 等人(厦门大学/广州理工背景),是他们 2023 年那篇 pre-LLM 时代 ASPR 综述的续篇,发表在 Information Fusion(Vol. 124, 103332),arXiv v1 2025-01,v2 2025-06,S2 引用 89。核心问题:LLM 进来之后,自动同行评审这件事的技术栈、资源和生态发生了什么变化。

结构上按'用什么模型 → LLM 解了哪些老瓶颈(长文本、多模态、多轮对话、即时知识)→ 三类生成方法(prompt engineering / SFT / multi-agent)→ 新数据集 → 开源代码与在线系统 → LLM 能增强评审的六个环节 → 五类现存问题 → 出版商政策 → 学界建议 → 挑战与方向'展开。注意作者立场:结论里明确写'we are confident that in the near future, the publishers will adopt ASPR with an open mind',是一篇为 ASPR 落地摇旗的综述,而非中立评估——读的时候要配合站内的批判性条目对冲。

ASPR 文献中各 LLM 的出现频次统计:GPT-4 占 32%、ChatGPT 10.7%、Claude 3 8.6%,长尾全是个位数;右侧两个饼图注意口径——'开源占 72.7%' 是按模型种类数算,按实际使用频次 GPT 系占 48.9% 仍主导。总样本仅 ~47 次出现,统计基数不大。
ASPR 文献中各 LLM 的出现频次统计:GPT-4 占 32%、ChatGPT 10.7%、Claude 3 8.6%,长尾全是个位数;右侧两个饼图注意口径——'开源占 72.7%' 是按模型种类数算,按实际使用频次 GPT 系占 48.9% 仍主导。总样本仅 ~47 次出现,统计基数不大。

机制与做法

模型使用统计与方法分类

作者统计 ASPR 文献中出现的 LLM:GPT-4 占 32%(15 次)、ChatGPT 10.7%、Claude 3 8.6%,其余都是个位数;按模型种类数算 open-source 占 72.7%,但按实际使用频次闭源系(GPT 系 48.9%)仍主导。方法上分三档:prompt engineering(Liang et al. 的自动 pipeline、ReviewerGPT 找错/checklist 验证)、SFT(ReviewMT 多轮对话、Reviewer2 两阶段生成、LimGen 局限性生成)、multi-agent(AgentReview 模拟五阶段评审流程、MARG 的 leader/worker/expert 分工、SEA 的标准化-评估-分析三模块、MAMORX 多模态评审)。

资源盘点与问题清单

数据集按评审阶段分类(screening / main review / comment generation / review quality assessment / author response),列了 RelevAI-Reviewer(25k+)、ReviewMT(26k+ 论文 92k+ 评审)、Reviewer2 数据集(27k+/99k+)、ReviewCritique(100 篇标注 LLM 评审缺陷)等约 15 个;开源代码表覆盖十余个 repo,点名 SEA 是可复现性最佳实践。问题清单五条:知识与理解不足、评审偏见、评论不准确、数据安全(投稿保密 vs 送 API)、定制能力受限;另汇总了各大出版商(Elsevier、Springer、IEEE 等)对 AI 参与评审的政策——多数禁止把稿件上传给 LLM。未来方向里把 generative attacks(对抗输入操纵评审结论)列为挑战之一,但只有一段泛泛讨论。

关键结果

实证核查

有水分作为领域地图基本合格(数据集/代码/政策三张表有用),但'holistic view'名不副实:截稿前已发表的 DeepReview、AAAR-1.0 均未收录,攻击面只有一段泛谈,表格还有引用张冠李戴;立场偏 pro-ASPR,与其自引证据(LLM 评审 F1 很低)相矛盾。
综述自称提供 LLM 时代 ASPR 的 'holistic view',系统覆盖新方法、新数据集、新系统。
grep 全文 tex + bbl(Raw/automated-scholarly-paper-review-survey/source/elsevier.tex, elsevier.bbl)零命中 DeepReview(2025-03,站内条目,auto-review 方向被引最多的系统之一)和 AAAR-1.0(2024-10,评审能力评测基准)——两者都早于 v2(2025-06-24)数月。攻击面(prompt injection 藏提示词操纵评审)只在 future directions 里泛谈一段,未覆盖任何具体攻击工作;2025-07 曝光的 hidden prompts 事件晚于 v2 不能苛责,但 2024 已有的对抗评审研究也只引了一篇(ye-are-2024)。
开源代码表(Table: Source code for LLM-driven ASPR)供读者按图索骥。
表格本身有明显的引用错误:ARIES 两处都被标成 \citep{couto-relevai-2024}(那是 RelevAI-Reviewer 的引用,ARIES 应为 darcy-aries-2024),见 elsevier.tex 的 source code 表。另外本综述无配套 repo/awesome list('Data availability: No data was used'),arXiv 只更新到 v2(2025-06),此后 auto-review 领域的进展(hidden prompts、Stop Automating Peer Review 等)不会再被吸收——当地图用有保鲜期。
结论断言 'we are confident that in the near future, the publishers will adopt ASPR with an open mind'。
与综述自己引用的证据相悖:其引的 Du et al. (ReviewCritique) 实验显示 LLM 做缺陷识别 F1 普遍很低且误报多;其自己汇总的出版商政策一节显示主流出版商目前多数禁止把稿件送 LLM。站内 'Stop Automating Peer Review Without Rigorous Evaluation' 条目正是对这种乐观叙事的系统性反驳。该团队(Lin et al.)自 2023 年起持续发 ASPR 系列论文,推广 ASPR 是其研究议程,读时需折价。

与我们方向的关系

对课题组的用法:这是 auto-review 子模块的【入口地图】,适合在读具体系统之前先过一遍——用它的三张表(LLM 使用统计、数据集分类、开源代码清单)快速建立领域坐标系,尤其是数据集表(按 screening/main review/comment generation/quality assessment/author response 五阶段分类)可以直接当选数据集的 checklist。读的顺序建议:本综述(地图)→ DeepReview(它漏掉的当前最强系统)→ AAAR-1.0(评审能力怎么测)→ Stop Automating Peer Review(方法论批判,对冲本综述的乐观立场)→ Hidden Prompts(攻击面,本综述几乎没覆盖)。

另一个提醒:本综述截稿 2025 年中且无维护中的 repo,2025 下半年之后的进展(reasoning model 评审、injection 防御、会议官方试点)需要自己补;它的价值在'LLM 之前→之后'的技术瓶颈对照(长文本/多模态/多轮/即时知识四节)和出版商政策汇总,这两块别处少见。

阅读笔记

同团队前作 lin-automated-2023 是 pre-LLM 时代的 ASPR 数据集综述,本篇是续篇,引用时注意区分。arXiv 页面提示引用 Information Fusion 版本。图里的 open-source 72.7% 是按模型种类数算的,按使用频次闭源占优,读图别被误导。

材料清单

TeX 源码
已存档:Raw/automated-scholarly-paper-review-survey/source/
期刊版doi.org/10.1016/j.inffus.2025.103332
Information Fusion Vol. 124, 103332 (2025),作者要求引用此版本
前作arxiv.org/abs/2111.07533
同团队前作 'Automated scholarly paper review: Concepts, technologies, and challenges'(Information Fusion 2023),本篇为 LLM 时代续篇

相关条目

同子模块 · 自动同行评审
跨方向 · 同标签