← 返回资料站  /  AI Scientist
报告 端到端系统

Zochi Technical Report (first AI system to pass A* conference peer review)

Zochi 技术报告:首个论文通过 A* 会议同行评审的 AI 科学家系统
一句话Intology 的 Zochi 是一个端到端的 "人工科学家" 多智能体系统,其生成的 jailbreak 论文 Tempest 被 ACL 2025 录用;技术报告本身覆盖的是更早一版(ICLR 2025 workshop 的 CS-ReFT、Siege、EGNN-Fusion 三篇),自评自动 reviewer 均分 7.67,人类专家在流程中做验证、画图和终稿润色。

这是什么

Zochi 由 Intology AI(Project Lead: Andy Zhou)推出,定位是能走完 "选题-假设-实验-写论文-投稿过审" 全流程的 artificial scientist。卖点是它不是自动化科研的某一环(如只做文献综述或只生成 idea),而是端到端产出被同行评审接受的论文。

这份技术报告(2025 年 3 月发布,repo 于 3 月 17 日建)记录的是较早一版 Zochi 的成果:三篇 ICLR 2025 workshop 论文——CS-ReFT(参数高效微调)、Siege(多轮越狱)、EGNN-Fusion(蛋白-核酸结合位点预测)。README 顶部明确注明:报告与代码对应的是早期版本;真正登上 ACL 2025 的是 Siege 的升级版 Tempest,那部分只在博客里宣布,不在这份报告中。

"首次通过 A* 会议评审" 这一标题来自后续的 ACL 2025 里程碑:Tempest 过了 ACL 主会评审。这是 Zochi 被收录进本站的核心理由,可与 Sakana AI Scientist v2 只到 workshop 级别的结果对照。

报告 Fig.1:自建 automated reviewer(o3-mini 后端,NeurIPS 打分口径)给各 AI 科研系统论文的均分。Zochi 7.67 分越过 6 分录用线,AI Scientist v2 / AI Scientist / Agent Lab / Carl 均在 3-4 分。注意这是 Intology 自评、样本自选的对比。
报告 Fig.1:自建 automated reviewer(o3-mini 后端,NeurIPS 打分口径)给各 AI 科研系统论文的均分。Zochi 7.67 分越过 6 分录用线,AI Scientist v2 / AI Scientist / Agent Lab / Carl 均在 3-4 分。注意这是 Intology 自评、样本自选的对比。

机制与做法

多智能体流程 + 迭代精化

系统把科研方法拆成若干专职 agent:文献分析/知识综合、假设生成与精化、实验设计与实现、数据分析、科学写作。工作流(报告 Fig.2)是:High-Level Research Direction → Ideation → Hypothesis Generation → Experiment Generation → Implementation & Execution → Results,结果不满意就回到 Refinement Step 再循环,满意才进 Paper Writer。

输入很灵活:可以给宽泛方向(如 "AI safety"),也可以给具体到方法层面的题目。系统跑在 H200 GPU 上、耗时数天。

报告 Fig.2:Zochi 工作流。从 High-Level Research Direction 出发,经 Ideation、Hypothesis Generation、Experiment Generation、实现与执行到 Results;结果不满意回到 Refinement Step 循环,满意才交给 Paper Writer。
报告 Fig.2:Zochi 工作流。从 High-Level Research Direction 出发,经 Ideation、Hypothesis Generation、Experiment Generation、实现与执行到 Results;结果不满意回到 Refinement Step 循环,满意才交给 Paper Writer。

三处强制人类验证(advisor-student 模式)

报告坦承这不是全自主系统。人类专家在三个节点做强制验证:大规模实验开始前、结果定型但写稿前、稿件完成后,验证重点是方法合理性和结果是否如实反映实验。

此外人类可随时给高层反馈(几句话级别),CS-ReFT 和 Siege 在实验期间被 "steer" 过几次以避开死路、省成本;论文里的示意图由人类绘制,终稿做了词句级编辑和补引用。报告称除了编辑终稿外,idea、实验、代码没有直接人工介入。

评估:自建 automated reviewer + MLE-Bench

自动评审沿用 Sakana AI Scientist 的 reviewer,但换成 o3-mini 后端,按 NeurIPS 打分指南给 1-10 分(6 为录用线)。Zochi 三篇早期草稿(无人工介入版)拿 8/8/7,均分 7.67,而 AI Scientist v2、Agent Lab、Carl 都在 3-4 分。

另在 MLE-Bench 10 个低难度 Kaggle 任务上测:80% 任务超过人类中位数、50% 拿到奖牌(2 金 3 银),高于 Agent Laboratory(40%)、AIDE(20%)。

关键结果

实证核查

有水分确有一篇 AI 产出的论文真过了 ACL 2025 评审,这一里程碑可核查、含金量真实;但 "A* 主会"、"自主"、以及报告里的对比数字都带明显折扣,系统本体不可复核。
Zochi 是首个通过 A* 会议(ACL 2025 主会)同行评审的 AI 系统。
评审确有其事:仓库 acl_reviews.txt 收录了 3 份 reviewer + 1 份 meta review。但个体 reviewer 的 Overall Assessment 是 2.5(Borderline)、3、3,而在 ACL 口径里 3 = "could be accepted to Findings of the ACL"、2.5 = Borderline;meta 给 4.0 = "could be accepted to an *ACL conference"。"主会" 一说主要依据 Intology 博客(intology.ai/blog/zochi-acl)贴出的作者投稿门户截图,reviewer 分数本身更贴近 Findings 级别,"A* 主会" 表述偏乐观。
技术报告与开源代码验证了 Zochi 的端到端能力。
README 顶部明确写 "technical report and code cover an earlier version of Zochi":报告和代码对应的是 ICLR workshop 版(CS-ReFT/Siege/EGNN-Fusion),而真正过 ACL 的 Tempest 只在博客宣布。也就是说,过 A* 评审的那篇工作,其生成过程并没有在这份报告里被记录,发布的 result repo 是 "清洗掉中间研究痕迹后" 的成品,无法据此复核 AI 的自主程度。
除编辑终稿外,idea、实验、代码没有直接人工介入,系统 "自主" 完成科研。
报告自己披露的人工介入并不小:三处强制人类验证、实验期间多次高层反馈以 "steer away from unproductive approaches"、论文所有示意图 (Fig.3/Fig.4 标注 figure was human-designed) 由人类绘制、终稿做词句级编辑并补漏引用。属于 human-in-the-loop 而非全自主;报告对此比较坦诚,但与 "autonomous artificial scientist" 的宣传口径有落差。
Zochi 论文自动评审均分 7.67,远超基线系统的 3-4 分。
这是 Intology 自建、把后端换成 o3-mini 的 reviewer 打的分,评的是自己挑的 "publicly available" 基线论文对比自家早期草稿,属自选样本的自评比较,不是中立第三方基准。真实人类评审的 6.6 分更有说服力,但样本仅 5 条。Siege 论文本身也被 ACL reviewer 指出只测了 3 个模型、单一 JailbreakBench 数据集,泛化性存疑。

与我们方向的关系

对做 AI-scientist / 自动化科研方向的同学,这是目前 "AI 论文过顶会评审" 最硬的一个案例,值得和 Sakana AI Scientist v2(只到 workshop)对照看差距。要点是:Zochi 走的是 human-in-the-loop 路线(强制验证 + 人画图 + 人润色),而不是全自主,复现或对标时不要被 "autonomous" 的措辞误导。

方法层面,Siege/Tempest 的 tree-search 多轮越狱、partial compliance 追踪,以及 CS-ReFT 的 representation-level 正交子空间路由,都是可单独拿来读的技术点(有清洗版代码可跑)。但系统本体闭源,想研究 "AI 如何自己做出这些" 的机制则无从下手。

阅读笔记

系统本体未开源(issue #1 只给 beta 申请表)。仓库里 acl_reviews.txt / siege_reviews.txt / csreft_reviews.txt 保存了真实评审意见,是核查的关键材料。技术报告 PDF 覆盖 ICLR workshop 版,ACL 里程碑要看 intology.ai/blog/zochi-acl。EGNN-Fusion 那篇未过评审。

材料清单

代码仓库github.com/IntologyAI/Zochi
315★ · 最近推送 2025-11-19
ACL 里程碑博客intology.ai/blog/zochi-acl
宣布 Tempest 被 ACL 2025 录用,含作者投稿门户截图
第三方报道casrai.org/news/fully-ai-generated-papers-passing-peer-review-zochi-sakana
CASRAI 对 Zochi/Sakana 过评审事件的中立梳理

同类条目