← 返回资料站  /  AI Scientist
博客 端到端系统 背景

Meet Carl: The First AI System To Produce Academically Peer-Reviewed Research

Carl:Autoscience 声称'第一个通过学术同行评审的 AI 系统'
一句话Autoscience Institute 2025 年 2 月的发布博客:其 AI 系统 Carl 的多篇论文通过 ICLR 2025 workshop(Tiny Papers track)双盲评审,号称'第一个产出学术同行评审研究的 AI 系统'——但论文随即全部主动撤回,论文本体、代码、评审记录至今均未公开,核心声称只能听公司一面之词。

这是什么

2025 年 2-3 月,'第一篇通过评审的 AI 论文'成了一场三方竞赛:Sakana 的 AI Scientist-v2、Intology 的 Zochi、以及本条目 Autoscience 的 Carl 几乎同期各自宣称拿下这一里程碑。Autoscience 的版本是:Carl 独立完成选题、假设、实验和写作,多篇论文通过 ICLR 2025 workshop Tiny Papers track 的双盲评审,'no substantive human involvement'。

博客描述 Carl 是一个基于现成 LLM 的自动化研究员,走 Ideation(从已有论文出发生成假设)→ Experimentation(写代码做实验、画图)→ Presentation(写成论文)的三段流水线。与 Sakana(公开了论文、代码和完整评审意见)形成鲜明对比的是,Autoscience 没有公开任何一篇 Carl 的论文、没有代码、没有 OpenReview 记录,连论文标题都没给,并以'workshop 组织者来不及建立针对 AI 作者的规范'为由把已录用论文全部撤回。这个条目主要作为这波竞赛的背景资料收录。

机制与做法

三段式流程与'有限'人工介入

流程本身没有公开技术细节(无论文、无架构图),只有博客的三句话描述:从相关文献生成 idea 和假设 → 写代码验证并生成图表 → 写成学术论文。底座是'recently released language models',博客明确提到用了 OpenAI o1-pro 和 Deep Research。

值得注意的是博客自己列出的四类人工介入:(1) Greenlighting——人在多个 checkpoint 给 continue/stop 信号控制算力开销;(2) 人工修改所有论文的 citations 和 LaTeX 排版;(3) o1-pro 和 Deep Research 当时没有 API,由人手动 copy/paste 中转;(4) 第一篇论文的 related works 整节由人类撰写、语言由人类润色。这份清单与标题里的 'no substantive human involvement' 之间的张力,是读这篇博客最该注意的地方。

自查与撤稿

Autoscience 称提交前做了内部验证:逐行读代码、重跑实验、查新颖性,还组织了一场有 MIT/Stanford/Berkeley 社区成员参加的 hackathon 来核验结果,并过了两个查重器和一个引用检查器。但这些全是公司自述,没有任何外部可查的产出。

录用后 Autoscience 主动撤回了全部论文,理由是 workshop 组织者来不及为'自主 AI 科学家'建立评审规范,并表示计划在 NeurIPS 2025 提议一个接收 AI 作者投稿的 workshop。后续:ICLR 的 Tiny Papers track 此后被停办;NeurIPS 2026 确实出现了 AutoMLR(Workshop for Autonomous Machine Learning Research,automlr.com);Autoscience 自身于 2026 年 3 月宣布 $14M 种子轮,并在 2026 年 1 月博客再次声称 Carl 产出了'第一篇全长(full-length)同行评审论文'。

关键结果

实证核查

宣传大于实质'workshop 短文通过评审后撤回'这件事本身大概率属实(多家媒体报道、公司持续经营并融资),但这是全部可查的内容:论文、代码、评审记录一概不公开,'第一个 AI 系统''no substantive human involvement'两个关键修饰又都经不起细看——前者取决于口径(与 Sakana 同期、且是 2 页 Tiny Papers),后者被博客自己的人工介入清单直接推翻。相比同期公开了论文/代码/评审的 Sakana 与留了 ACL 评审记录的 Zochi,这条更接近一份发布公关,故判宣传大于实质。
论文'with no substantive human involvement'通过双盲评审。
同一篇博客的 'Limited Human Intervention' 一节自己承认:人工撰写第一篇论文的 related works 并润色语言、人工修改所有论文的 citations 和 LaTeX、人工 copy/paste 中转 o1-pro/Deep Research、人在多个 checkpoint 控制流程。出处:autoscience.ai/blog/meet-carl 原文。
Carl 产出了可供社区检验的'学术同行评审研究'。
无法核查:论文全部撤回且从未公开,标题、venue 具体名称、OpenReview 链接、代码均无(公司无 code_url,serper 搜 'Autoscience Carl github/arxiv' 只有新闻转述,无一手材料)。对照:Sakana AI Scientist-v2 同期公开了论文、代码与评审意见。SSRN 上一篇 80 个 AI Scientist 系统的 survey(abstract 6889440)将 Carl 列为 Tier C,并注明其投稿的 Tiny Papers track 之后被停办。
'第一个'产出同行评审研究的 AI 系统。
时间线上与 Sakana AI Scientist-v2(ICLR 2025 workshop,同样过评审后撤回)基本同期,谁算'第一'取决于口径;且 Tiny Papers 是 2 页短文赛道。媒体(如 artificialintelligence-news.com 2025-03-03、rdworldonline.com 2025-04-26)均只转述公司说法,无独立验证。

与我们方向的关系

对课题组而言这条的价值不在技术(没有任何可复用的细节),而在于它是'AI 论文过评审'公关竞赛的一个标本:如何区分'过了 workshop 短文评审'与'产出了经得起检验的研究',以及评估此类声称时该看什么——论文/代码/评审记录是否公开、人工介入清单、投稿赛道的实际门槛。博客里那份自我披露的人工介入清单,反而是评估所有'全自主 AI Scientist'声称时可以套用的 checklist。

后续值得跟踪的是它引出的制度变化:ICLR 停办 Tiny Papers、NeurIPS 2026 出现专收自主研究系统投稿的 AutoMLR workshop——AI 产出的研究正在获得专门的评审通道,这对'AI Scientist 的产出如何进入学术体系'是比 Carl 本身更实质的进展。

阅读笔记

meta.json 为空、无 figures、无代码仓库,全部信息来自博客原文(经 Jina reader 抓取,WebFetch 只能拿到标题)+ serper 新闻检索。Autoscience 2026 年 1 月的新博客('Carl Generates First Full-Length Peer-Reviewed Paper')和 3 月 $14M 融资说明公司仍在运营,若课题组关注可另开条目跟进。

材料清单

后续博客www.autoscience.ai/blog
2026-01 声称 Carl 产出第一篇 full-length 同行评审论文
NeurIPS 2026 AutoMLR workshopautomlr.com/
接收自主研究系统投稿的 workshop,与其 2025 年提议方向一致

同类条目