← 返回资料站  /  AutoResearch
论文 自动评审

Stop Automating Peer Review Without Rigorous Evaluation

别在没有严格评估之前自动化同行评审
一句话ICML 2026 Oral 立场论文:用 75,800 条 ICLR 2026 真实评审 + 60 篇论文的受控实验证明,当前 AI 评审既丧失观点多样性(hivemind 效应)又极易被刷分——一次 $0.25 的零样本改写(paper laundering)就能让 AI 评审分平均 +0.45,结论是现在的 LLM 不该直接产出评审意见。

这是什么

同行评审危机(投稿爆炸、审稿人不够、LLM 代写评审已成规模)让会议开始把评审流程交给 AI:AAAI 2026 直接提供全 LLM 生成的评审,ICLR 2026 用 LLM 做 pre-review 筛稿,ICML 2026 推出双轨 LLM 政策但随即因水印检测 desk-reject 了 497 篇论文。这篇来自 Zurich、Stanford、Bocconi 的 position paper(Baumann, Pei, Koyejo, Hovy)反对这个趋势,论点很克制:不是'AI 永远不能审稿',而是'今天的 AI 系统不应该产出评审意见,部署前必须过严格评估'。

论文提出两个自动化评审的必要条件:C1 保持评审多样性(不能把多位专家的不同视角坍缩成一种声音)、C2 抗操纵(不能靠不改科学内容的花招刷分),然后用两组实验证明当前 AI 评审系统两条都不满足。作者还强调这两条只是必要条件——即使都满足,问责、验证、效率-监督权衡等问题仍需社区决议,所以最后呼吁建立'peer review automation 的科学':部署前红队测试、可接受的误报率、公开 system prompt 和模型版本、大规模 stakeholder 调研与人机交互 user study。

ICLR 2026 真实评审中的 hivemind 效应:全 AI 生成评审(红)跨论文两两相似度 InterSim 的分布整体右移,均值 0.486 vs 其他评审(青,含人写和 AI 辅助)的 0.467,p<0.0001 但 Cohen's d=0.29——统计上极显著,效应量属于小。
ICLR 2026 真实评审中的 hivemind 效应:全 AI 生成评审(红)跨论文两两相似度 InterSim 的分布整体右移,均值 0.486 vs 其他评审(青,含人写和 AI 辅助)的 0.467,p<0.0001 但 Cohen's d=0.29——统计上极显著,效应量属于小。

机制与做法

Hivemind 效应:两个相似度指标 + 真实数据与仿真双重验证

指标是 IntraSim(同一篇论文不同评审之间的两两 embedding 余弦相似度,用 OpenAI text-embedding-3-small)和 InterSim(同一类评审者跨不同论文的评审相似度)。in-the-wild 部分用 ICLR 2026 全部 75,800 条评审,配 Pangram 的 AI 生成标签(21% 即 15,899 条被判为全 AI 生成):全 AI 评审的 InterSim 均值 0.486 vs 其他评审 0.467(p<0.0001, Cohen's d=0.29,限定 weaknesses/questions 部分升到 d=0.35),且在全部 21 个 primary area 都显著。

仿真部分随机抽 60 篇 ICLR 2026 论文,用 Bianchi et al. 的 AI reviewer agent(GPT-5.1 / Claude Sonnet 4.5)重新生成评审:IntraSim 从人类的 0.811 升到 0.882(+8.7%, d=1.47);InterSim 上 GPT-5.1 比人类高 37.4%(d=3.55)。机制很直白——AI 评审爱复用万能句式:GPT 最常见的 'if not, can you comment on' 出现在 13.3% 的论文里,Claude 的 'how does the method handle' 出现在 21.7%,而人类评审最常见短语覆盖率不到 1%。附带的实用代价:AI 分数与人类分相关仅 r=0.15、AI 之间互相关 0.49 且系统性打高分(GPT 均值 7.3 vs 人类 4.3);在 8,015 篇论文上,人类均分预测最终录用 AUC=0.822,AI 均分只有 0.710。

paper laundering 的刷分效果:横轴是三个 AI 评审模型及平均,颜色是 4 个改写 prompt,实心/空心区分改写模型 GPT-5.1/GPT-5.4。几乎所有 24 个条件的 95% CI 都在 0(虚线)之上,总体平均 +0.45 分;GPT-5.4 当改写者效果最好,Claude 当评审最难被刷。
paper laundering 的刷分效果:横轴是三个 AI 评审模型及平均,颜色是 4 个改写 prompt,实心/空心区分改写模型 GPT-5.1/GPT-5.4。几乎所有 24 个条件的 95% CI 都在 0(虚线)之上,总体平均 +0.45 分;GPT-5.4 当改写者效果最好,Claude 当评审最难被刷。

Paper laundering:零样本改写刷 AI 评审分

把论文完整 LaTeX 源码 + 原始 AI 评审一起喂给 LLM,零样本 prompt 让它重写,编译回 PDF 再送 AI 评审,单篇成本约 $0.25。测了 4 个 prompt × 2 个改写模型(GPT-5.1/GPT-5.4)× 3 个评审模型共 24 个条件、每条件 60 篇:总体平均分数提升 +0.45(1-10 分制),几乎所有条件 Wilcoxon p<0.001。GPT 评审给 GPT 改写的论文涨分更多,和已知的 self-preference bias 一致。

词级 diff 分析证实涨分靠的是风格而非内容:改写主要增加 hedging 词('may''typically''suggests')和强调词('strong''robust'),少量'实质性'改动多是没有实验依据的幻觉解读。与 prompt injection 不同,laundering 不违反任何现行会议政策(作者可以公开声明用 AI 润色),这才是它危险的地方。副作用:被 laundering 的 60 篇论文两两 embedding 相似度 +6.5%(d=1.02),写作风格向 AI 偏好收敛,即'intellectual monoculture'。

从必要条件到 call to action

论文用一整节回应四种反方观点(如'AI 更一致更少偏见'——回答是一致性≠正确性,NeurIPS 2021 一致性实验揭示的人类噪声不能靠更单一的噪声源解决)。最后提出部署前三要求:对抗鲁棒性红队测试、验证过的准确率与可接受误报率(现有 AI 找错工具误报率高达 35%)、公开部署细节。正面范例是 ICLR 2025 Review Feedback Agent 的 2 万条评审 RCT,以及 NeurIPS 2026(三臂随机分组)和 EMNLP 2026(AI 评审仅 rebuttal 后展示给作者)正在跑的受控实验。

关键结果

实证核查

扎实数据来源公开可查、结论被独立团队方向性复现、以 ICML 2026 Oral 身份通过了(全人类)评审;主要折扣是论文本身没放代码、仿真规模小(60 篇、单一 reviewer prompt)且 in-the-wild 效应量其实不大(d=0.29),这些作者自己在 Limitations 里都承认了。
in-the-wild 分析基于 75,800 条 ICLR 2026 评审、21% 为 AI 生成(Pangram/EditLens 标签)。
标签来自第三方且公开:iclr.pangram.com 在线可访问,逐篇列出提交、评审及 AI 判定比例,任何人可复核。论文承认标签可能有分类误差,并在 Appendix(Pangram label validation via author complaints)用作者投诉作独立代理做了交叉验证;仿真实验有 ground-truth 标签,不依赖检测器。
paper laundering 能零样本刷高 AI 评审分(+0.45, p<0.001)。
已有独立团队方向性复现:Hatzel et al. 的 Review Arcade(arXiv:2605.28897,汉堡大学,2026-05)在 ACL ARR 2025 论文上测试 LLM 评审的可 game 性,发现迭代改写可让最多 35% 论文总分显著上升,且开源了代码(github.com/uhh-hcds/reviewarcade)。后续工作(如 OpenReview 6gYWcYQcWM 的 AI 评审 fabrication 论文)也把 paper laundering 作为既定失效模式引用。
论文以严格评估为旗号,自身实验可复现。
打折处:没有官方代码仓库(catalog 中 code_url 为空,serper 也搜不到),复现依赖闭源模型(GPT-5.1、GPT-5.4、Claude Sonnet 4.5、text-embedding-3-small),prompt 和流程只在 Appendix B 文字描述。仿真只有 60 篇论文、AI reviewer 用单一固定 prompt——作者在 Limitations 承认高 IntraSim 部分反映的是实验设置本身的同质性,而非所有 AI 评审配置的固有属性。
定位为社区应采纳的立场。
接收情况可查:ICML 2026 Oral(icml.cc/virtual/2026/events/oral 列表可见;作者在致谢里特意注明四位审稿人都选择了禁止 LLM 的 policy A)。S2 引用 11 次、Google Scholar 显示 19 次(2026-08 查),发布仅 4 个月。需要注意 in-the-wild 的核心效应量 d=0.29 属于小效应,'hivemind'的强证据主要来自受控仿真。

与我们方向的关系

对做评审 agent / 自动化科研评估的同学,这篇是必读的'反方基线':它给出了两个可操作的必要条件(review diversity、non-gameability)和现成的度量方法(IntraSim/InterSim + embedding 相似度、laundering 前后配对打分),任何自研评审 agent 都可以先用这套流水线自测。IntraSim/InterSim 的代价是只测语言相似不测论证相似(作者自己承认),课题组若做评审质量评估,可以在'论证多样性'度量上做增量。

paper laundering 这个威胁模型对 LLM-as-judge 的所有场景都成立(不只评审):任何用 LLM 打分的流水线,只要被打分对象也能过一遍 LLM 改写,分数就可能被风格因素污染,而且 GPT 评审偏爱 GPT 改写的 self-preference bias 会叠加。论文末尾列的 NeurIPS 2026 / EMNLP 2026 受控实验设计(随机分组 + 盲评 + 仅作者可见)是做 human-AI 评审对照研究的好模板。

阅读笔记

注意区分两组结果的证据强度:in-the-wild 的 d=0.29 是小效应且依赖 Pangram 检测标签;仿真里 d>1.4 的大效应又受'单一 prompt、两个模型'的设置同质性影响。两边各有短板但方向互相印证,这也是论文论证上比较老实的地方。另外 laundering 实验里有一个 prompt 专门指示改写模型去 jailbreak AI 评审,和普通润色 prompt 效果放在一起报告,读图时可留意。

材料清单

TeX 源码
已存档:Raw/stop-automating-peer-review-without-rigorous/source/
Pangram ICLR 2026 评审 AI 检测数据iclr.pangram.com
论文 in-the-wild 分析所用的 75,800 条评审 AI 生成标签,公开可查
独立复现(方向性)arxiv.org/abs/2605.28897
Review Arcade:在 ACL ARR 2025 上验证 LLM 评审可被迭代改写 game,代码开源
OpenReview 讨论openreview.net/forum?id=128yyxUoRk
ICML 2026 评审与作者 rebuttal

同类条目