← 返回资料站  /  AI Scientist
论文 端到端系统

AI-Researcher: Autonomous Scientific Innovation

AI-Researcher:港大的全自动科研系统与 Scientist-Bench
一句话HKU 数据科学组(HKUDS)做的端到端自动科研系统:给一堆参考文献(可选加想法),自动完成文献综述→选题→写代码→跑实验→写论文;配套 Scientist-Bench(22 篇顶会论文做 ground truth)。自报 Claude 后端实现完成率 93.8%,但 LLM 评审给 AI 论文的平均分全部为负(-0.53 到 -1.70),NeurIPS 2025 Spotlight。

这是什么

AI-Researcher 是「AI Scientist」赛道里国内团队最完整的开源实现之一(5705 stars)。系统接受两级输入:Level-1 给详细的研究想法描述 + 参考文献,考察『按指令做创新』;Level-2 只给 15-20 篇参考文献,让 agent 自己找 research gap、提想法并实现——这是与 Sakana AI Scientist 等工作对齐的『全自主』设定。整个流水线在 Docker 容器里跑:Resource Collector/Filter 收集与过滤文献代码、Idea Generator 出想法、Code Agent + Advisor Agent 迭代实现和 debug、最后 Writer Agent 用分层写作生成完整论文。

论文的另一半贡献是 Scientist-Bench:从 2022-2024 顶会论文里精选 22 篇(diffusion 4、VQ 6、GNN 7、推荐 5)作为 ground truth,用 LLM 从每篇抽取核心想法作为 Level-1 指令、选 15-20 篇关键引文作为输入,并做了匿名化处理(方法名遮蔽、技术细节抽象、引文匿名)防止模型直接背出原论文。评测分两阶段:先由 code review agent 验证实现是否忠实(Completeness/Correctness),再让 5 个 LLM(GPT-4o、o1-mini、o3-mini、Claude-3.5/3.7)按 ICLR 评审标准对『AI 论文 vs 人类原论文』做 -3~+3 的成对打分,每篇 16 次独立评估。

主结果:Claude 系后端在全量 Scientist-Bench 上的实现质量。绿柱为 Completeness(代码能否跑通,总体 93.8%,GNN 域只有 75%),橙柱为 Correctness(Judge Agent 1-5 打分,总体 2.65)。注意两个指标衡量的都是『实现』而非『研究质量』,且均为系统自评。
主结果:Claude 系后端在全量 Scientist-Bench 上的实现质量。绿柱为 Completeness(代码能否跑通,总体 93.8%,GNN 域只有 75%),橙柱为 Correctness(Judge Agent 1-5 打分,总体 2.65)。注意两个指标衡量的都是『实现』而非『研究质量』,且均为系统自评。

机制与做法

三阶段流水线:文献→算法→论文

第一阶段 Literature Review & Idea Generation:从 arXiv、GitHub、HF 等渠道自动收集资料,按引用数、代码维护度等指标过滤,再生成候选研究方向并排序。第二阶段是 Design→Implementation→Validation→Refinement 的循环:Code Agent 从零写整个 project(不给代码模板,只给结构建议),Advisor Agent 产出分析报告驱动迭代;agent 以 case_resolved / case_not_resolved 显式收尾,便于自动统计完成率。第三阶段 Writer Agent 统一用 GPT-4o 把想法、方法和实验结果写成全文论文。

工程上依赖 Docker 隔离环境(镜像 tjbtech1/airesearcher:v1)+ litellm 多模型接入,实验主推 Claude-3.5-sonnet(贵模型)+ 3.5-haiku(便宜模型)的组合;README 提供 gradio Web GUI。跑一个 benchmark instance 需要 GPU 和相当多的 API 调用。

失败案例对比:上排是 AI 生成论文的典型短板(只会普通 attention、理论分析停留在复杂度、实验设计泛泛、公式写得工程化),下排是对应人类论文的做法(Gumbel 重参数化、alignment-uniformity 理论、系统的 RQ 驱动实验、精心设计的形式化)。这是全文最能说明当前 LLM 科研上限的一张图。
失败案例对比:上排是 AI 生成论文的典型短板(只会普通 attention、理论分析停留在复杂度、实验设计泛泛、公式写得工程化),下排是对应人类论文的做法(Gumbel 重参数化、alignment-uniformity 理论、系统的 RQ 驱动实验、精心设计的形式化)。这是全文最能说明当前 LLM 科研上限的一张图。

评测:code review + LLM 成对评审

实现质量用两个自造指标:Completeness(限定预算内跑通可执行代码的比例)和 Correctness(Advisor 出报告、Judge Agent 打 1-5 分)。论文质量则是 AI 论文与人类原论文成对比较,随机交换顺序去位置偏置,5 个 LLM × 16 次评估取平均;报告 mean rating 和『comparable 率』(平均分 ≥ -1.0 的论文占比)。

为论证 LLM 评审可信,作者用 ICLR 2021-2023 的 32 对 accept/reject 论文验证:评审 agent 判对『谁被接收』的比例 65.6%-90.6%(多数 LLM >81%),Gemini-2.0-flash 最不稳被剔除。注意这只说明 LLM 能区分 accept/reject 的粗粒度差异,不等于能精确评估科研新颖性。

主要实验结论

Claude 系后端在全量 benchmark 上 Completeness 93.8%、Correctness 均分 2.65/5(VQ 最高 3.22,推荐最低 2.20);4o 系在子集上只有 50% completeness、correctness 1.0,典型失败是声称实现了 Diffusion Transformer 实际只写了个 ViT。Level-2(自主选题)completeness 100% 但 correctness 略降(2.5→2.25)。有意思的反直觉发现:Level-2 开放探索的论文评分反而普遍高于 Level-1 按指令做(comparable 率从 15.79%~78.95% 升到 40%~100%),作者解释为指令反而束缚了模型往自己擅长的方向走。失败分析指向两类根因:领域知识不足(只会常规方法、理论分析停留在复杂度层面)和长链推理不足(数学形式化能力弱)。

关键结果

实证核查

有水分论文实验部分数字诚实(AI 论文评分全为负,没吹赢人类),benchmark 和代码全开源,这部分扎实;但『approach human-level quality』的表述和 README 的营销口吻超出数据支撑,评测全靠 LLM-as-judge 且不同评审结论天差地别,repo 实际可运行性差、维护基本停摆。
摘要称 achieves remarkable implementation success rates and produces research papers that approach human-level quality。
论文自己的 Table(evaluation.tex tab:pairwise)显示五个 LLM 评审给 AI 论文的 overall mean rating 全部为负(-0.53 ~ -1.70),最严格的评审(o3-mini/Claude-3.5)下 comparable 率仅 13.64%;93.8% 是『代码能跑通』的比例而非『研究成功』,Correctness 只有 2.65/5。数字本身诚实,但『接近人类水平』是对最宽松评审(GPT-4o,81.8%)的选择性概括。
开源仓库开箱即用(README:Out-of-the-Box Functionality、minimal setup)。
issues 快扫显示可运行性很差:#80 Docker 镜像 tjbtech1/airesearcher:v1 pull access denied;#91『Can someone actually run this thing?』指出端口检查断言 assert port_info[0]==port_info[1] 写死导致标准端口映射直接崩;#79/#75/#73/#72 等大量环境/路径报错无人修;#83 直接标题『烂尾项目』。仓库 2025-10-16 后无提交,多数 issue 无维护者回应,团队精力似已转向闭源产品 novix.science。
评测框架 robust:5 个 LLM 评审、去位置偏置、与 ICLR 人类决定强对齐。
benchmark.tex 里写 LLM 评审与 ICLR 最终决定 perfectly align,但同一论文 evaluation.tex 的实测是 65.62%~90.62% 判对率,前后矛盾;且主实验里不同评审给的 comparable 率从 13.6% 到 81.8%,作者自己也承认单一 LLM 评审有偏。整个『论文质量』结论没有任何人类专家盲评,全部是 LLM-as-judge。
README 展示完整可复现的使用流程(含 paper_agent 脚本示例)。
README 的 run_paper.sh 示例里直接泄露了一个 OpenAI API key(sk-SKlup...,readme.md 第 1038 行),issue #85 已挂『[Security Alert] Exposed OpenAI API key detected』但至今未删——侧面反映工程管理粗糙。另外 Scientist-Bench 规模其实很小:22 篇 Level-1、6 篇 Level-2(评测正文只用 5 篇),四个领域全是 HKUDS 自己熟悉的方向(GNN/推荐占一半)。

与我们方向的关系

对做 AI Scientist / research agent 的同学,这篇的主要价值不在系统本身(维护已停),而在两点:一是 Scientist-Bench 的构造方法——用顶会论文抽 idea 做指令、匿名化防背题、code review + 成对 LLM 评审的两阶段评测,是目前少数可直接复用的『科研能力』评测方案(benchmark/ 和 benchmark_collection/ 目录全开源);二是它的实验给出了几个可引用的基线事实:后端 LLM 决定实现成败(Claude 87.5% vs 4o 50%)、自主选题反而好于按指令复现、失败集中在领域知识和数学形式化。

使用上的坑:别指望直接跑通官方 repo(Docker 镜像拉不下来、端口断言 bug),想复现建议自己重建环境或只用它的 benchmark 数据;引用其结论时注意所有质量评估都是 LLM-as-judge,评审间方差极大,谨慎当作『AI 论文接近人类水平』的证据。

阅读笔记

README 营销味浓(revolutionary breakthrough 之类),与论文正文的克制形成反差;正文对失败案例的分析(failure_cases 图)反而是全文最有信息量的部分。团队后续把方向转向了商业化产品 novix.science,开源版大概率不再维护。

材料清单

TeX 源码
已存档:Raw/ai-researcher/source/
代码仓库github.com/HKUDS/AI-Researcher
5705★ · 最近推送 2025-10-16
Scientist-Bench 数据与排行榜autoresearcher.github.io/leaderboard
22 篇 ground-truth 论文的 benchmark 数据在 repo 的 benchmark/ 目录,构建 pipeline 在 benchmark_collection/
商业化后续novix.science/chat
团队的 production-ready 闭源版本,repo 描述中官方推荐;开源版 2025-10 后停更

同类条目