论文
端到端系统
★ 必读
CycleResearcher: Improving Automated Research via Automated Review
CycleResearcher:用自动评审当奖励信号,闭环改进自动研究
Yixuan Weng, Minjun Zhu, Guangsheng Bao, et al. (Westlake University) · Westlake University NLP Lab · ICLR 2025 · 2024-10 · 被引 151
一句话 西湖大学训练了一对开源模型:CycleResearcher(12B/72B/123B)写 ML 论文、CycleReviewer(123B)模拟同行评审打分,用评审分数构造偏好对做 iterative SimPO 强化学习。模拟评审下生成论文均分 5.36(人类 preprint 5.24),但人类专家实评只有 4.8,且论文里的实验结果全是模型编造的。
这是什么 AI Scientist 等早期端到端系统全部依赖闭源 API 模型,只能靠 prompt 工程改进,没法把'研究质量'变成可优化的训练信号。这篇 ICLR 2025 论文换了条路:既然学术界本来就靠 submission-review-refinement 循环提升质量,那就把整个循环搬进训练——用一个开源模型当 policy(写论文),另一个当 generative reward model(审论文),reviewer 打的分直接用来构造 RL 的偏好数据。
为此他们造了两个数据集:Review-5k(ICLR 2024 的 4,991 篇论文 + 16,000 多条真实审稿意见,含 soundness/presentation/contribution/overall 分数)训练 CycleReviewer;Research-14k(2022-2024 年 ICLR/NeurIPS/ICML/ACL/EMNLP/CVPR 等会议 12,696 篇接收论文,整理成 outline+正文交替的结构,平均输出 28K token)训练 CycleResearcher。模型、数据集权重都在 HuggingFace 上发布(需签 license)。
要注意这个系统的边界:CycleResearcher 只负责文献综述、想 idea、设计实验和写稿,不跑实验——论文脚注和 Limitations 明确承认生成论文里的'实验结果'是编造的(fabricated/Hallucinated),实验执行留给 AI Scientist 之类的外部代码系统。所以它本质上是'论文文本生成 + 评审打分'的闭环,不是'科学发现'的闭环。
核心训练闭环:CycleResearcher(policy)从文献库生成 outline+正文组成论文,采样多篇(P1/P2/P3)交给 CycleReviewer(reward model)打分,按分数高低构造偏好对(win/lose),更新 policy 进入下一轮迭代。注意左上角 'Humans/AIs as Experimenters' 的小框——实验执行不在模型内,训练时实验结果直接由模型编造。 机制与做法 CycleReviewer:generative reward model 模拟一组审稿人
在 Review-5k 上用 LoRA-GA 微调 Mistral-Large-2(123B),8x H100 训 12 epochs。输入整篇论文,模型按'从最低分审稿人到最高分审稿人'的顺序依次生成多份完整审稿意见(strengths/weaknesses/各维度分数/overall 1-10 分),最后模拟 senior reviewer 汇总出 accept/reject 决定,取多个 reviewer 的平均分作为最终评价。
评价 reviewer 好坏本身没有 ground truth,他们用 Proxy MSE/MAE:把其余 n-1 个人类审稿人的均分当作真分数的无偏估计,衡量单个分数偏差。在 Review-5k 测试集上,CycleReviewer 的 Proxy MSE 1.43 / MAE 0.92,论文称比人类个体审稿人分别低 48.77% 和 26.89%(注意:按这两个百分比反推,人类个体应为 MSE 约 2.79 / MAE 约 1.26,与论文另处给出的人类基线数值对不上,引用时只用百分比或只用绝对值,别混着算);accept/reject 决定准确率 74.24%,接近人类个体的 75.40%,远超 GPT-4o(52.58%)和 Claude-3.5-Sonnet(48.05%)。
两个训练数据集的构造流程。上:Review-5k,从 ICLR 2024 抓论文(LaTeX/Markdown)配上 3 份真实审稿意见 + 1 份 meta-review(含各维度分数和最终决定)。下:Research-14k(图中标注仍是旧名 Research-8k),把 2022-2024 顶会接收论文切成 Main Text(M)与 Outline(O)交替的结构,让模型学会'先列提纲再写正文'。 CycleResearcher:outline 与正文交替生成整篇论文
基座是 Mistral-Nemo-12B、Qwen2.5-72B、Mistral-Large-2 123B 三档。输入是一个 bib 文件(所有参考文献 + 摘要),模型先生成 motivation/main idea 的 outline,再写 title/abstract/introduction/method,然后 outline 出实验设置,再生成实验设计和'模拟的实验结果',最后写分析和结论,拼成完整 LaTeX 论文。Research-14k 里每篇论文都按这个结构精确切分过,这是它能稳定产出格式完整长论文的关键。
SFT 阶段 8x H100 + DeepSpeed ZeRO2,12B 用 32K 上下文、72B/123B 用 24K,训 12,000 步。
rejection sampling 曲线:生成 1→100 篇取模拟评审最优,平均分从 5.36 涨到约 7.02,超过人类接收论文基线(粉线 5.69)。这张图既是论文卖点也是最大破绽——评审分可以被采样刷上去,恰说明 reward model 存在可利用的偏差。 Iterative SimPO:评审分当奖励,偏好对迭代优化
RL 阶段:收集 4,152 篇近期 arXiv ML 论文只留参考文献做知识库,让 CycleResearcher 以 temperature 0.4 采样 3 篇论文,CycleReviewer 打分后取最高分的当正样本、最低分的当负样本,构成偏好对数据集。用 SimPO(比 iterative DPO 省掉 reference model)加上 NLL loss 稳定训练,每轮采样全量数据的三分之一防过拟合,迭代多轮。
消融显示三个组件都重要:去掉 RL 均分从 5.36 掉到 5.12(accept rate 35.13%→29.80%);去掉迭代掉到 5.21;去掉 NLL loss 直接崩溃到 4.91、accept rate 只剩 12.03%(出现重复文本和严重错误)——长文本偏好优化里 NLL 正则是保命的。
结果与防滥用
模拟评审下 CycleResearcher-12B 均分 5.36、accept rate 35.13%,对比人类 preprint 5.24/29.63%、人类接收论文 5.69/100%、AI Scientist 4.31/0%。有趣的是 12B 比 72B(5.38)和 123B(5.15)没差多少甚至更好。rejection sampling 从 1 篇采到 100 篇,均分能从 5.36 涨到 7.02——超过人类接收论文的 5.69,这个数字更像是 reward model 被过度优化的信号而非真实质量。
人类评估:3 位有顶会审稿经验的 NLP 专家各盲评 20 篇(10 篇 CycleResearcher N=100 rejection sampling 的精选 + 10 篇 AI Scientist),CycleResearcher 均分 4.8,高于 AI Scientist 的 3.6,但明显低于 ICLR'24 投稿平均 5.5 和接收平均 6.4。防滥用方面用 Fast-DetectGPT 检测自家模型生成的论文,准确率 97.5-98.9%,并在 license 里禁止用于真实投稿和评审。
关键结果 CycleReviewer(123B)在 Review-5k 测试集上 Proxy MSE 1.43 / MAE 0.92,比人类个体审稿人低 48.77% / 26.89%;决定准确率 74.24%,接近人类个体 75.40%,大幅领先 GPT-4o(52.58%)、Gemini-1.5-pro(50.98%)等闭源模型 CycleResearcher-12B 生成论文在自家 CycleReviewer 模拟评审下均分 5.36、accept rate 35.13%(人类 preprint 5.24/29.63%,AI Scientist 4.31/0%);12B/72B/123B 三档差距很小(5.36/5.38/5.15),规模不是瓶颈 人类专家盲评(3 人各 20 篇):CycleResearcher 4.8 分 vs AI Scientist 3.6 分,但仍低于 ICLR'24 投稿均分 5.5 和接收均分 6.4——真实差距比模拟评审显示的大得多 rejection sampling 采 100 篇取最优,模拟均分从 5.36 升到 7.02,'超过'人类接收论文的 5.69——作者自己在附录用独立训练的 reward model 复测,分数掉 0.14、accept rate 掉 2.42%,承认存在 reward 过度优化的可能 消融:去掉 NLL loss 后训练崩溃(均分 4.91,accept rate 从 35.13% 跌到 12.03%,出现重复文本);去掉 RL 掉 0.24 分;去掉迭代掉 0.15 分 生成论文平均引用 37.8 篇参考文献,是 AI Scientist(8.2 篇)的 4.6 倍,得益于输入端喂了完整 bib+摘要 Fast-DetectGPT 检测自家模型生成内容的准确率:论文文本 97.5-98.9%,审稿文本 95.1% 实证核查
有水分 ICLR 2025 正式接收、模型/数据集真实发布、社区活跃(151 引用),框架本身是这个方向最早的可复现开源实现;但'接近人类 preprint 水平'的头条数字是自家 reviewer 打的模拟分,人评明显更低,生成论文的实验结果全是编的,而且 repo 至今不支持实验执行,部分 HF 权重还有损坏/不可用的问题。
论文摘要:生成论文模拟评审 5.36 分,'与人类 preprint 的 5.24 相比具有竞争力'。
这个分数是他们自己训练的 CycleReviewer 打的,存在自评偏置;同一篇论文里的人类评估(3 位专家盲评)只给了 4.8,低于 ICLR'24 投稿平均 5.5。更关键的是论文脚注和 Limitations 节明确写着生成论文的实验结果是 fabricated/Hallucinated(编造的)——即被打 5.36 分的是'实验数据凭空捏造'的论文,人类 preprint 可没有这个待遇。rejection sampling 采 100 篇能把模拟分推到 7.02、超过人类接收论文的 5.69,恰好说明这个 reward 可以被刷。
论文宣称自动化'从文献综述、稿件准备到评审、修改的完整研究循环'。
GitHub repo(zhu-minjun/Researcher)不含实验执行:issue #7 中作者亲口回复 'the CycleResearcher work does not currently support experimental',建议用户自己去接 SakanaAI/AI-Scientist 的代码跑实验。训练代码也没有释出,issue #8 里作者只说'用的是 OpenRLHF,自己照着设置就行'。repo 里实际提供的是推理封装(pip install ai_researcher)和 4 个教程 notebook。
Reproducibility Statement:'所有代码、数据集和模型权重都将以清晰的 license 发布,促进广泛的可复现性'。
权重和数据集确实在 HuggingFace WestlakeNLP 组织下发布了,但都是 gated(要签 CycleResearcher-License 并披露机构信息)。更实际的问题:issue #22(open)报告 CycleReviewer-ML-123B 缺最后一个 shard(model-00067-of-00067.safetensors)和 index 文件,根本无法加载;issue #23(open)报告 DeepReviewer-14B 在 vLLM 下输出乱码/重复代码片段,另一位用户跟帖说 CycleReviewer-ML-Llama3.1-8B 同样问题,截至 2026-08 均未修复。想复现的同学要有心理准备。
CycleReviewer 比人类个体审稿人 MAE 低 26.89%,决定准确率 74.24%。
这个对比用的是 Proxy MAE(拿其余 n-1 个审稿人均分当真值),本质上衡量的是'与审稿人共识的一致性'而不是评审质量——一个永远输出接近均值的模型在这个指标上天然占优,作者也承认指标只反映 score consistency。训练/测试都来自 ICLR 2024 一个会,跨领域泛化未验证。论文自己的 Limitations 还承认 CycleReviewer 知识截止 2024 年 1 月、离线无检索,评新颖性会出错。
小数字矛盾:introduction 说 acceptance rate 31.07%,主表(Table 2)是 35.13%。
对照 tex 源码,intro 贡献列表和附录 reward exploitation 表用 31.07%,正文 Table 2 和消融表用 35.13%/35.14%,同一个 12B 模型三个数字,论文未解释差异,应是不同批次评测没对齐。不影响主结论但反映实验管理粗糙。
工作的后续与社区反响。
repo 401 stars,持续维护到 2026-03(开源了 DeepReviewer-v2 和 deepscientist.cc 在线平台);S2 显示 151 次引用;同组后续 DeepReview(ACL 2025)、AutoFigure(ICLR 2026)延续这条线。作为'评审分当 RL 奖励'的开源先驱,这条路线被 ReviewRL(arXiv 2508.10308)等后续工作跟进,方向本身站住了。
与我们方向的关系 对课题组最有价值的不是'AI 写论文'本身,而是它给出了一个完整可复现的'自动评审当奖励信号'工程配方:generative reward model(顺序模拟多个 reviewer 再汇总)+ 采样 3 篇取最高/最低构造偏好对 + SimPO 加 NLL 正则 + 迭代重采样。消融里 NLL loss 一去就崩(accept rate 12.03%)这个教训对任何做长文本偏好优化的人都直接有用。Review-5k/Research-14k 两个数据集也是现成的实验材料。
同时它是研究 reward hacking 的天然案例:policy 和 reward 都开源、可控,rejection sampling 曲线(N=100 时模拟分 7.02 超过人类接收论文)就是 reward 被过度优化的直接证据,作者附录的独立 reward model 复测(掉 0.14)只能算初步排查。如果课题组想研究'自我改进闭环什么时候会刷分',在这套开源组件上做对照实验比在闭源系统上猜测靠谱得多。用之前注意先验证 HF 权重完整性(见 issue #22/#23)。
阅读笔记 读 tex 源码比读 PDF 有额外收获:注释里留着中文的原始摘要草稿和作者内部 todo,附录 Model Card 表格里模型还叫 WhizResearcher/WhizReviewer(旧名),123B 模型参数列还写着 12B,可见赶 deadline 痕迹。标题自带一行红色警告 'This work is not advocating the use of LLMs for paper writing'。生成论文样例(grokking 那篇,实验由 AI Scientist + GPT-o1 执行)以 PDF 形式附在论文附录里,source/CycleResearcher_papers/ 下有 6 篇。复现最省事的起点是 12B 模型 + repo 的 tutorial_1.ipynb;别用 123B(权重缺 shard)。
材料清单 TeX 源码 已存档:Raw/cycleresearcher/source/
同类条目