论文
自动评审
DeepReview: Improving LLM-based Paper Review with Human-like Deep Thinking Process
DeepReview:用结构化深思流程做 LLM 论文评审
Minjun Zhu, Yixuan Weng, Linyi Yang, Yue Zhang · 西湖大学 · ACL 2025 · 2025-03 · 被引 106
一句话西湖大学把论文评审拆成新颖性核查 -> 多维评审 -> 可靠性校验三段推理链,用合成推理数据 DeepReview-13K 训练出 DeepReviewer-14B:Rating MSE 比 CycleReviewer-70B 低 44.8%,LLM-judge 总体胜率对 GPT-o1 达 88.21%——但这个胜率是 Gemini 当裁判的主观指标,Technical Accuracy 维度胜率只有 25.12%。
这是什么
LLM 直接给论文打分写评审有三个老问题:领域知识不够、推理会幻觉、输出缺乏结构。之前同组的 CycleReviewer(ICLR 2025)走的是'拿真实评审数据 SFT 大模型'的路线,DeepReview 在此基础上加了一层:不只学最终评审文本,还学中间的推理过程——像人类审稿人那样先查新颖性、再逐条评估、最后核对每条意见有没有论文证据支撑。
具体产出三样东西:DeepReview-13K 数据集(13,378 条训练 + 1,286 条测试,来自 ICLR 2024/2025 真实投稿与评审,每条带合成的三段推理链)、DeepReviewer-7B/14B 模型(基座 Phi-4 14B,LongRoPE 扩到 256K 上下文)、以及 Fast/Standard/Best 三档推理模式,推理时用指令控制走多长的推理路径。ACL 2025 接收,S2 引用已过 100,是目前开源评审模型里工程最完整的一支。
框架总览:左边是输入(论文全文 + 真实 ICLR 评审做 target),右边是模型要生成的三段推理链——z1 新颖性核查(生成研究问题 + OpenScholar 文献检索)、z2 多维评审(模拟多个 reviewer 给 Summary/Strengths/Weaknesses/Suggestion)、z3 可靠性校验(每条 weakness 找论文内证据),最后汇成 meta-review 和评分。左下角是三档推理模式:Fast 直出结果,Standard 走 z2+z3,Best 走全链。机制与做法
三段推理链怎么构造(全是模型合成的)
推理链 (z1, z2, z3) 不是人写的,是自动化流水线从真实评审数据反向构造的。Stage 1 新颖性核查:Qwen-2.5-72B 生成 3 个关键研究问题,Gemini-2.0-Flash-Thinking 做论文分析,再走 OpenScholar(Semantic Scholar API 检索约 60 篇 -> ReRank 取 top 10 -> Llama-3.1_OpenScholar-8B 生成对比报告)。Stage 2 多维评审:用 Qwen-2.5-72B 把真实的多个 reviewer 意见 + 作者 rebuttal 重构成带建设性建议的综合评审。Stage 3 可靠性校验:Gemini 对每条 weakness 要求给出论文内证据并标置信度,最后融合原 meta-review 生成新的 meta-review。
质量控制也是自动的:Qwen-2.5-72B 检查每条样本的逻辑一致性和字段完整性,不合格的删掉。也就是说,整套'human-like deep thinking'的监督信号,实际是 Qwen + Gemini 在真实评审文本的骨架上补写出来的思考过程。
Test-time scaling 实验:横轴是推理 token 数,红星是推理路径加深(Fast->Standard->Best),绿菱形是模拟审稿人数量 R=1..6。两条回归线整体向好但斜率都不陡——Decision Accuracy 从约 0.61 涨到 0.65,Rating Spearman 从 0.326 到 0.355;注意 R=1 的点明显掉队、R!=4 波动大(训练数据集中在 4 个审稿人),说明 reviewer scaling 的稳定性一般。训练与三档推理模式
基于 Phi-4 14B 全参微调,8x H100,40K 训练上下文(超长样本随机截断),23,500 步,batch 16,lr 5e-6。训练时把每条样本按推理路径裁剪成三种模式:Fast 直接出最终评分和分析(约 3K tokens 输出);Standard 走 z2+z3(约 8K);Best 走完整 z1+z2+z3,推理时还要真实调用 Semantic Scholar API + OpenScholar 做文献检索(约 14.5K tokens)。同一个模型,靠输入指令切换路径。
Standard/Best 模式下还能调模拟审稿人数量(R=1 到 6),相当于两个正交的 test-time scaling 旋钮:加深推理路径,或者加多模拟审稿人。
评测怎么做的
分数侧在 DeepReview-Bench(1,286 篇 ICLR 2024/2025 真实论文)上测 rating 预测(MSE/MAE)、accept/reject 决策(Acc/F1)、质量排序(Spearman)、两两选优(pairwise acc),对照真实评审均分。文本质量侧用 LLM-as-a-judge:Gemini-2.0-Flash-Thinking 当裁判,对生成评审做匿名两两比较,输出五个维度的胜率。注意裁判和数据构造用的是同一个模型,论文用'Gemini 裁判也判 DeepReviewer 赢过 Gemini 自己的评审'来论证客观性,但这个循环没有完全解开。
关键结果
- 分数预测是最硬的战绩:ICLR 2024 上 Rating MSE 1.31(CycleReviewer-70B 为 2.49,降 44.8%),Decision Accuracy 64.06% / F1 0.6307,全面领先 prompt-based 的 GPT-o1、DeepSeek-R1、Claude-3.5-Sonnet 等(AI Scientist 框架下这些模型 Rating MSE 在 4.2-4.9)。
- 细粒度维度(Soundness/Presentation/Contribution)的 MSE/MAE/Spearman 基本全部第一,如 ICLR 2024 Soundness MSE 0.1578,比 CycleReviewer-70B 低 33.6%。
- LLM-judge 胜率:Overall Judgment 对 GPT-o1 88.21%、对 DeepSeek-R1 80.20%、对 AgentReview(GPT-4o) 98.15%;但拆开看,对 GPT-o1 的 Technical Accuracy 胜率只有 25.12%(输 11.67%,其余平),优势主要在 Constructive Value 和 Analytical Depth。
- 抗提示注入攻击(未做任何对抗训练):插入恶意指令后 DeepReviewer 总分只涨 0.31(5.38->5.69),而 Gemini-2.0-Flash-Thinking 涨 4.26(4.23->8.49)、DeepSeek-V3 涨 1.41。
- Test-time scaling 存在但幅度温和:Fast->Best 模式 Rating Spearman 提升 8.97%(0.326->0.355);审稿人 R=1->6 时 Decision Accuracy 提升约 5 个点(60.84%->66.42%),且 R!=4 时性能波动明显(训练分布集中在 4 个审稿人)。
- 效率:Fast 模式只输出约 3K tokens,就在多项指标上超过输出 6K tokens 的 CycleReviewer-70B。
实证核查
有水分数据、模型、代码确实全开源,分数预测的提升幅度可信;但摘要里的'88.21% 胜率超 GPT-o1'是 Gemini 单裁判的主观指标(且该裁判同时参与了训练数据构造),Technical Accuracy 维度只赢 25%;开源 checkpoint 的实际可用性也有未解决的 issue。
'DeepReviewer-14B achieves win rates of 88.21% and 80.20% against GPT-o1 and DeepSeek-R1'(摘要头条战绩)。
查论文 Table 4(source/neurips_2024.tex):这是 Gemini-2.0-Flash-Thinking 当裁判的两两比较胜率,只是 Overall Judgment 一个维度;同一张表里对 GPT-o1 的 Technical Accuracy 胜率仅 25.12%(lose 11.67%,其余 tie)。而且裁判 Gemini 同时是训练数据 z1(论文分析)和 z3(可靠性校验)的生成模型,评测与数据构造存在同源循环。分数预测类指标(Rating MSE 降 44.8% 等)是对照真实 ICLR 评分的客观指标,这部分扎实。
'The code, model, dataset and demo have be released'——完全开源可用。
HF 上 DeepReviewer-7B/14B、DeepReview-13K(13,378 train / 1,286 test,与论文 Table 1 一致)确实都在,repo(zhu-minjun/Researcher,401 stars)持续维护。但可用性有真实问题:issue #23(2026-04,仍 open)报告 DeepReviewer-14B 在 vLLM 下输出乱码/重复代码片段,'loadable but not reliable',另一用户跟帖说 CycleReviewer-8B 同样复现;issue #13 报告 3090 上输出乱码(作者答复需 2x3090 + fp8);issue #7 确认实验指标复现代码未提供。license 是自定义的 CycleResearcher-License(非标准开源协议)。
'Human-like Deep Thinking Process'——模拟人类专家的深度思考。
读 Methodology(tex 278-340 行):三段推理链全部由 Qwen-2.5-72B + Gemini-2.0-Flash-Thinking 自动合成,人类真实数据只有最终的评审文本、rebuttal 和分数;'思考过程'是模型在已知结论的情况下反向补写的,质量控制也由 Qwen 自动完成,没有人工校验环节。这是常见的合成 CoT 蒸馏做法,'human-like' 更多是数据格式设计,不宜按字面理解。
Best 模式(文献检索 + 自校验)是效果最好的推理档位。
Best 模式依赖自建 OpenScholar 服务 + Semantic Scholar API key,部署门槛不低(README 有完整流程,issue #10-12 显示该功能是 2025 年 5 月才补上的)。且论文 Figure(fig10)显示 Fast->Best 的增益温和(Rating Spearman +8.97%),Decision Accuracy 上 Standard R=6 甚至略高于 Best;'多花 5 倍 tokens 换个位数百分比提升'的性价比要自己权衡。后续:团队 2026-03 已开源 DeepReviewer-v2(github.com/ResearAI/DeepReviewer-v2)并上线免费平台 deepscientist.cc。
与我们方向的关系
对做 autoresearch 的组来说,这是'评审模型'这条线上目前资料最全的开源工作:13K 带推理链的评审数据 + 可复用的合成数据流水线(真实评审骨架 + LLM 补写推理)+ 三档推理模式的训练技巧(同一模型按指令走不同长度推理路径,数据侧做 reasoning path cropping 即可),这三样都可以直接借鉴到自己的 evaluator/reward model 训练里。它的抗提示注入结果也提示:结构化多阶段推理本身就有一定防御性,不用专门对抗训练。
用它当自动评审器要注意:分数预测(相对排序、MSE)是它的强项,可以放进论文生成流水线当 reward/filter;但评审文本的'胜率'证据较弱,决策准确率也只有 64% 左右(ICLR 真实 accept/reject),不能当可靠的接收预测器。实际部署优先考虑 DeepReviewer-v2 或在线平台,v1 checkpoint 有已知的 vLLM 输出质量问题(issue #23)。
阅读笔记
论文 tex 用的还是 neurips_2024 模板(最终发表在 ACL 2025)。同 repo 是 CycleResearcher/CycleReviewer/DeepReviewer 三件套共用,README 的 74.24% decision accuracy 是 CycleReviewer 在自家 Review-5K 上的数字,与本文 DeepReview-Bench 上的 63-64% 不可直接比,读的时候别混。训练细节:Phi-4 14B 全参微调,LongRoPE 扩 256K 上下文,训练用 40K 窗口,超长样本随机截断。
材料清单
TeX 源码已存档:Raw/deepreview/source/
同类条目