Can AI Be a Good Peer Reviewer?
AI 能当好审稿人吗?——评审全流程与评估方法综述
Sihong Wu, Owen Jiang, Yilun Zhao, Tiansheng Hu, Yiling Ma, Kaiyan Zhang, Manasi Patwardhan, Arman Cohan (Yale University / New York University / TCS Research) · ACL 2026 · 2026-04 · 被引 4
一句话 Yale + NYU + TCS Research 的 ACL 2026 综述,按 PRISMA/Kitchenham 流程从约 500 篇筛到 138 篇,把「AI 做评审」拆成三块:评审生成(五范式)、评审后任务(rebuttal / meta-review / 按评审改稿)、评估方法(四族),配 45 行数据集表和一份 75 条论文链接的配套清单(挂着 awesome list 的徽章,实际是论文附属清单);胜在覆盖到 2026 年初的 agentic + RL 工作和首次系统整理评审后环节,弱在不含自己的实验、部分二手信息有误、配套 repo 只是论文附属清单。
这是什么 自动评审这个方向在 2023 年前主要做的是子任务:从 metadata 预测录用、从正文回归评审分数(PeerRead、Checco 2021 那一类)。LLM 能一次性吃下整篇 manuscript 之后,任务变成端到端生成完整评审意见,方法侧迅速堆出 fine-tuning、multi-agent、RL 三条线,评估侧却没跟上——这就是本文说要填的空。
作者把讨论范围明确定义为「生成文本」的环节,并在附录 EC1 里排除了只预测分数、不生成评审文本的工作。全文结构是四段:§2 评审生成的五种范式,§3 评审后任务(rebuttal / meta-review / paper revision),§4 评估方法与数据集的分类学,§5 六条 future direction(novelty 评估、自动评估、跨领域、评审后环节、多模态、伦理与透明)。
文献检索过程写在附录 A:检索 ACL Anthology / OpenReview / arXiv / Semantic Scholar / DBLP / Google Scholar,关键词是 peer review generation、meta-review、rebuttal generation,时间窗 2018–2025,再对 PeerRead、DeepReview 做 snowballing。约 500 篇初筛 → 去重后约 400 篇 → 按 IC/EC 筛出 194 篇 → 其中 138 篇直接聚焦评审生成与评估。custom.bib 里实际有 178 条参考文献。
评审生成的五种范式(论文 Figure 2)。上半按时间分左右:左边「Earlier Methods」是 Foundational(论文 → 网络 → 摘要式输出)和 Fine-Tuning(用评审数据把通用模型调成评审模型);右边「Recent Methods」是 Agent-Based(多个模型互相传递、扮演不同角色)和 Reinforcement Learning(论文 + 评审构成奖励信号去优化策略)。下半那条「Review Generation Enhancement」是横切在四者之上的三种加法——External-Knowledge(接外部知识库,判新颖性用)、Iterative-Refinement(生成后反复自我修订)、Style Control(结构化/树状控制输出格式)。看这张图的用法:先定位自己的工作属于上半哪一格,再看能叠哪一条下半的增强。 机制与做法 生成侧:五范式分类
(1) Foundation approaches 指 2023 年前的多文档摘要、引文网络那类替代性做法;(2) Fine-tuning,代表是 ReviewMT 上微调(显著提高 review/decision hit rate)、OpenReviewer(在 79,000 条专家评审上全量微调 Llama-3.1-8B)、REVIEWER2(先生成 aspect prompt 再条件生成,缓解 SFT 的平均化倾向)、LimGen(专门推断作者没写出来的 limitation);(3) Agent-based 再分两支——Task Decomposition(MARG 的 leader-worker、SWIF²T 的 Planner/Investigator/Reviewer/Controller 四件套、ReviewAgents、DeepReview 的三阶段、MAMORX 的图表+引文多模态、DIAGPaper)与 Process Simulation(AgentReview 把 author/reviewer/AC 都做成 agent 的仿真测试床、ReviewMT 把评审重构为多轮长上下文对话);(4) RL,REMOR 用 GRPO 优化一个由 criticism / relevance / actionability 组成的复合 Human-aligned Peer Review Reward,CycleResearcher 用 CycleReviewer 当 reward model 形成 Research-Review-Refinement 闭环,ReviewRL 把检索增强的上下文构造和复合奖励结合。
(5) Review Generation Enhancement 是横切的三种加法:外部知识(ReviewRobot 的三张知识图谱 → MAMORX 用 agent 查学术库判新颖性 → 检索重排做 contribution-wise 对比)、迭代精修(MARG 用第二组 agent 逐条判定 comment 是否 revise/prune;把作者 rebuttal 当反馈信号的 RbtAct、GoodPoint、ActReview)、结构与风格控制(TreeReview 把评审做成递归分解的问题树,AutoRev 把论文建成 document graph)。附录 tab:backbone_comparison 单独对比了 CycleResearcher / DeepReview / OpenReviewer / REMOR 的底座模型、改造方式和是否开源。
评审质量评估的四族方法(论文 Figure 3)。① Human-centric:人给生成的评审打绝对分,或做 A/B 成对偏好(Reviewer Arena 那类);② Reference-based:拿生成评审和真人评审比,上半是 ROUGE/BLEU/BERTScore 这类表层指标,下半是先用 LLM 抽出关键 comment 再匹配算 hit rate 的 content overlap 指标;③ LLM-based:直接让 LLM 当 judge,按「Problem / Location / Explain」的结构化模板打分;④ Aspect-oriented:把评审拆成 validity、novelty 等维度分别标注,再对比 LLM 与人类的打分偏差——右下角那句 validity 过于乐观、novelty 过于悲观,是这一族最常见的诊断结论。注意摘要里写的是五族(多一个 unsupervised),正文和这张图都只有四族,以图为准。 评审后任务:本文相对同类综述的增量
Rebuttal 一节把线索排成:早期做 review-rebuttal 对齐与话语功能标注(DISAPERE、APE 的 argument-pair extraction)→ JITSUPEER 首次把 rebuttal generation 显式形式化为 attitude-root/theme 引导的生成 → ReviewMT、Re² 把它推到多轮对话 → 2026 年的 DRPG(concern 分解 / 证据检索 / 视角规划 / 生成四阶段)、Paper2Rebuttal(verify-then-write,带 grounding 与一致性检查点)、author-in-the-loop 的工作说明加入作者信号能提升事实正确性。
Meta-review 一节从 extract-then-write + 先判 accept/reject 再条件生成,讲到 MReD 的句级功能标签、PeerSum/RAMMER 的层级会话结构、ORSUM 的 checklist 引导多阶段自省,再到把 meta-review 重构成 document-grounded dialogue。Paper Revision 一节只有三个工作:ARIES(把评审意见对齐到具体编辑,首次定义任务)、CASIMIR(编辑意图分析)、arXivEdits(跨版本句级对齐 + span 级编辑意图)——作者自己也在 §5 承认这块 benchmark 与方法都还很稀疏。
评估侧:四族方法 + 45 行数据集表
四族是 Human-centric(GPT-4 vs 人类的十人 pilot、Liang 的 308 名研究者大规模 user study、Reviewer Arena 的成对偏好)、Reference-based(BLEU/ROUGE/BERTScore,以及 Liang 的两阶段「抽取关键 comment 再语义匹配算 hit rate」;还包括 RR-MCQ 这种拿已知答案考模型的做法)、LLM-based(zhang2025 的双 judge 必须同时投票才算 hit;PiCO 那类无参考的互评排名)、Aspect-oriented(ReviewCritique 的 23 类句级错误标注、focus-level 框架比对 LLM 与人类关注点分布、STRICTA 把评审拆成 aspect 级推理图、SEA 的 mismatch score;把 review injection 这类对抗测试也归到这里)。附录 metrics 把指标细分成 5 个小类,另有 tab:evaluation_proscons 逐族列优缺点。
数据集按 pre-2023 / post-2023 分两个时代,表里 45 行(PeerRead、DISAPERE、ASAP-Review、MReD、MOPRD、PeerSum、NLpeer、SubstanReview、ReviewCritique、ReviewEval、Review-5k、Reviewer2、DeepReview-13K、ARIES、AgentReview、RR-MCQ、ReviewMT、RMR-75K 等)。附录另给了数据采集渠道表(OpenReview API 等)和 PDF/HTML/JSON/XML 的格式转换工具表——这两张表对要自己攒评审语料的人最实用。
关键结果 筛选漏斗:约 500 篇初检 → 去重后约 400 → IC/EC 后 194 → 138 篇直接相关;bib 实际 178 条,数据集表 45 行,配套 repo 收录 75 条论文链接。 生成侧分五范式(foundation / fine-tuning / agent / RL / enhancement),评估侧正文分四族;摘要里却写成 human-centric、reference-based、LLM-as-judge、aspect-oriented、unsupervised 五族——unsupervised 在正文里已被并进 LLM-based,是没同步改的残留。 规模数字:OpenReviewer 在 79,000 条专家评审上微调 Llama-3.1-8B;ReviewCritique 标了 23 种句级错误类型;引用 Liang 2024 的语料级估计,顶级 AI 会议 6.5%–16.9% 的评审文本可能被 LLM 实质改写,且 deadline 前和低置信度评审里更集中。 评审后任务是本文相对 Zhuang 2025 那篇综述的主要增量,但三块的厚度差很多:rebuttal 8 个工作、meta-review 5 个、paper revision 只有 3 个。 六条 future direction 里作者最看重两条:LLM 判 novelty 仍然不可靠(SchNovel、NovBench 都验证了这点),以及评估还停在 BLEU 这类粗指标、需要「无监督快筛 + aspect 级诊断 + 小样本人评」的组合式框架。 自称「迄今最全面、最细粒度的评审流程与评估分类学」(limitations 节原话),但没有任何自己跑的实验或元分析,全部结论来自二手转述。 实证核查
有水分 作为地图是合格的:检索流程写得比同类综述透明,评审后环节的整理确实是新东西。但它是一篇纯文献综述,零自有实验,抽查发现二手信息有实质错误、摘要与正文的分类数不一致、配套 repo 只是论文附属清单而非在维护的 awesome list,分类学也还没被任何后续工作真正采纳。
附录表 tab:backbone_comparison 把 DeepReview 归为「Backbone: GPT-4 (API);Modification Type: Zero-shot (no finetuning);Open-source? No」,只是 Thinker + Writer 两个 agent。
这是错的。DeepReview(arXiv:2503.08569,ACL 2025,站内条目 deepreview)开源了代码 https://github.com/zhu-minjun/Researcher 、13K 条评审思维链数据集 https://huggingface.co/datasets/WestlakeNLP/DeepReview-13K ,并在 Qwen2.5 上训练发布了 DeepReviewer-7B/14B。它恰恰是这批工作里开源程度最高的之一,却被这张表标成闭源零样本。同一表格里 CycleResearcher / OpenReviewer / REMOR 的信息核对无误,说明是个别条目的核查疏漏,而不是整表不可信——但意味着表里的「是否开源」列不能直接引用。
摘要(arXiv v2 abstract)称评估方法覆盖 human-centric、reference-based、LLM-as-judge、aspect-oriented 与 unsupervised 五类;正文 §4 与 Figure 3 只有四类。
查 source/main/3-evaluation.tex:原先确有 \subsubsection{Unsupervised Evaluation}(PiCO 那一段),在提交版里被注释掉、内容并进 LLM-Based Evaluation 的最后一句,但摘要没同步。Figure 3 的 caption 明确写「(1) Human-centric;(2) Reference-based;(3) LLM-based;(4) Aspect-oriented」。真正的分类是四族;无监督评估只剩附录 metrics 里的一个小节 Unsupervised and Reward-Based Metrics。引用时按四族写,别照抄摘要。
论文和 README 都把 https://github.com/formula12/Awesome-Peer-Review 作为「A collection of papers」对外提供,README 顶部挂 awesome.re 徽章。
它是论文附属清单,不是在维护的 awesome list。gh api commits 显示全部历史只有 5 次提交:2025-07-12 建库两次,然后停摆九个月,2026-04-29 补 License + 改 README,2026-05-06 最后一次 Enhance README,此后三个多月无更新(截至 2026-08-31)。6 个 star,issues 与 PR 皆为 0(gh api issues 返回空)。内容上,按小节统计只有 75 条论文链接,对不上论文声称的 138 篇聚焦文献,更对不上 178 条 bib——想拿它当检索入口的话,得自己回 PDF 的参考文献表补。
论文自称遵循 PRISMA 2020 与 Kitchenham SLR 规范,「transparent reporting of search strings, last search date, de-duplication, per-stage counts」。
半兑现。per-stage counts 确实给了(500 → 400 → 194 → 138),这一点比多数 AI 综述做得好;但它自己列举的 PRISMA 要求里,last search date 全文没有出现,检索式只给了「such as」三个示例关键词而非完整 search string,也没有 PRISMA flow diagram,数量还都带 approximately/around。检索时间窗写 2018–2025,而正文实际引了大量 2026 年 1–4 月的 arXiv 预印本(DRPG、Paper2Rebuttal、DIAGPaper、NovBench、REM-CTX、RbtAct 等),说明真实截止时间远晚于声明的窗口,流程记录与实际操作不完全对应。
「few existing works provide a systematic analysis of the critical landscape of evaluation」,定位为填补评估分类学的空白,limitations 节称是「迄今最全面最细粒度」的分类学。
分类学目前还没有被后续工作采纳的证据。S2 上 4 篇引用(截至 2026-08-31,发表 4 个月)全是背景式顺带引用,无一使用它的分类:AI-Assisted Peer Review Across Research Communities 写「For a more comprehensive overview of methods for generating reviews, we refer to the survey by Wu et al. (2026)」;Review Arcade 把它和 Kobak 2025 并列当作「LLM 可作 ad-hoc 反馈」的出处;No Hidden Prompts Needed 只把它塞进一个四篇的方括号引用组;Zero-shot reasoning for simulating scholarly peer-review 无上下文。isInfluential 全为 false。arXiv 停在 v2(2026-04-30 提交,2026-05-01 修订),没有持续更新的迹象。
覆盖度上自称是评审全流程的 holistic overview。
抽查站内同方向条目发现三处实质缺口,且都不是被 EC1(排除只做分数预测的工作)挡掉的。(a) AAAR-1.0(arXiv:2410.22394,站内 aaar-1-0):bib 里搜不到,它包含 ReviewCritique 式的 weakness 识别子任务,属于本文定义的范围。(b) 2025-07 的隐藏 prompt 事件(站内 hidden-prompts-in-manuscripts-exploit-ai,Nikkei 报道 17 篇预印本被塞白字指令):bib 里 hidden / prompt injection / invisible 均无命中,只以 ye2024 的 review injection attack 实验一句带过,现实世界里已发生的攻击案例没进来——而这恰好是「伦理与透明部署」一节最该引的证据。(c) 反方向的 Zochi / Carl 这类 AI 生成论文通过真实同行评审的案例(站内 zochi-technical-report、meet-carl)完全没提,论文只讨论 AI 当审稿人、不讨论 AI 当被审对象,这个边界没有明说。至于 Stop Automating Peer Review Without Rigorous Evaluation(2026-05)晚于本文定稿,不算漏。
与我们方向的关系 当地图用,用在两个位置。第一是选题前的占位查重:要做评审相关的东西,先用 §2 的五范式和 §4 的四族评估对一遍,看自己的想法落在哪个格子里、格子里已经有谁——尤其是 §3 的评审后三块,rebuttal 和 meta-review 已经挺挤,paper revision from reviews 只有 ARIES / CASIMIR / arXivEdits 三个工作,是本文里最明显的空位。第二是攒数据集时当施工手册:附录的数据采集渠道表和格式转换工具表,加上 45 行数据集对照表,能省掉自己摸 OpenReview API 和 PDF 解析工具链的时间;附录 app:dataset-challenges 列的 post-2023 数据集通病(评审句子与论文内容对不上、对话数据角色混乱线程不全、细粒度标注规模太小、只有 NLP/ML 领域)基本就是我们自己攒语料时会踩的坑清单。
配合站内条目读的顺序:先读 automated-scholarly-paper-review-survey(2025-01,Zhuang 等)看 2025 年初的基线图景,再用本文补 2025 全年到 2026 年 4 月的 agentic / RL / 评审后环节;方法侧深挖走 deepreview(注意本文那张表把它标成闭源零样本是错的,以站内条目为准)和 cycleresearcher(RL 闭环的原型);评估这一侧的收尾必须接 stop-automating-peer-review-without-rigorous-evaluation(2026-05),那篇比本文更硬,直接质疑现有评估协议站不住脚,而本文只是把方法分类摆出来、没做批判性检验;安全侧接 hidden-prompts-in-manuscripts-exploit-ai,补上本文没收的真实攻击案例;再想到 AI 当被审对象的一面,看 zochi-technical-report。一句话:本文用来定位和查渠道,不要用来当结论来源——它没有一手实验,任何具体数字和「是否开源」这类事实都得回原文核。
阅读笔记 站内 catalog 的收录理由里有两处需要修正:一是「评估指标五族分类」,正文实际是四族,五族只出现在没同步改的摘要里;二是「2026 年后数据集污染问题的专门讨论」,附录 app:dataset-challenges 讲的是 post-2023 数据集的构建缺陷(任务错配、标注稀缺、领域窄),全文 grep contamination / leakage / data leak / cutoff 均无命中,并没有讨论训练数据污染。另外源码里留了不少作者互评痕迹,比如 introduction 里 RL 那组引用旁边有一条被注释掉的 \yilun{these four citations are wrong},提交版把引用换成了两条——说明作者自己也在核引用,读的时候对二手转述保持警惕是必要的。figures/ 里 fig01_yale.png 和 fig02_tcs.png 是页眉的机构 logo,不是内容图,已跳过。
材料清单 TeX 源码 已存档:Raw/can-ai-be-a-good-peer-reviewer/source/
相关条目 同子模块 · 自动同行评审
跨方向 · 同标签