论文
端到端系统
InternAgent (NovelSeek): When Agent Becomes the Scientist -- Building Closed-Loop System from Hypothesis to Verification
InternAgent(原 NovelSeek):从假设到验证的闭环自主科研系统
InternAgent Team (Bo Zhang, Shiyang Feng, Xiangchao Yan, Jiakang Yuan, et al.), Shanghai AI Laboratory · Shanghai AI Laboratory · arXiv · 2025-05 · 被引 25
一句话 上海 AI Lab 的端到端多智能体科研框架,在 12 个科学/AI 任务上自动完成"文献调研→idea 生成与自演化→方法构建→写码跑实验"的闭环:反应产率预测 R² 27.6→35.4(12 小时)、增强子活性预测 0.65→0.79(4 小时),每个 idea 生成成本约 $0.6、单次 coding+debug 约 $1,自称成本仅为 AI-Researcher 的 1/6。
这是什么 InternAgent(2025 年 5 月发布时叫 NovelSeek,7 月更名)是上海 AI Lab 推出的自主科研(Autonomous Scientific Research)框架。与 AI Scientist 那类"从零想 idea 写论文"的系统不同,它的定位更务实:给定一个科研任务的描述和 baseline 代码,系统自动调研文献、生成并演化改进 idea、把 idea 落成详细方法、再改代码跑实验验证,目标是把 baseline 指标往上推。产出不是论文而是"更好的方法 + 实验数字"。
覆盖 12 个任务,横跨科学侧(化学反应产率预测、分子动力学、增强子活性预测、转录预测、电力潮流估计、时序预测)和 AI 侧(图像/点云分类、语义分割、3D 检测、情感分类、VLM 微调)。任务既有单文件小代码,也有 repo 级多文件工程(如 AutoPCDet、AutoVLM),后者是 Dolphin 等前作不支持的。
论文强调三点:Scalability(12 个任务通吃)、Interactivity(人类专家可以在 idea 阶段插入反馈)、Efficiency(几小时到 30 小时拿到超过 baseline 的结果)。截至 2026 年中,仓库已演进到 InternAgent-1.5,加了 memory 模块、Deep Research、论文复现任务(sci_tasks)等,其解决方案优化子系统 MLEvolve 自称是 MLEBench 上排名第一的开源方法。
系统总览:上半部分是自演化 idea 生成(Orchestration Agent 调度 Survey/Code Review/Idea Innovation/Assessment 四个 agent,共享 context memory,人类反馈可插入)和 idea-to-methodology 构建(idea+文献 → 方法初始化 → critique 驱动的迭代精炼);下半部分是演化式实验执行:方法文档 + baseline 代码交给 coding agent(Aider/OpenHands),经 AutoDebug 的异常驱动循环直到跑通,再进入下一轮计划。 机制与做法 自演化 idea 生成(带人类反馈)
由一个 Orchestration Agent 调度多个专职 agent:Survey Agent 有两种模式——literature review 模式把任务拆成关键词组合广搜文献并按摘要相关性打分,deep research 模式下载全文精读后再生成新关键词迭代搜索;Code Review Agent 用 Python ast 做静态分析 + LLM 生成文档,理解 baseline 代码的结构和依赖(repo 级和 file 级都支持);Idea Innovation Agent 用高 temperature 的 LLM 生成 idea,再结合 critique 和文献做演化;Assessment Agent 从 coherence、credibility、verifiability、novelty、alignment 五个维度 0-10 打分加权排序,并刻意保证 top idea 之间的多样性。
默认配置:GPT-4o 跑 idea 侧,先调研 50 篇文献,生成 15 个 idea,每个 idea 演化成 3 个、每轮选 top 5,最多演化 4 轮。人类反馈是可选插入点,系统会在筛出高分 idea 后提示专家介入修正方向。
12 个支持任务全景:上方 6 个科学任务(反应产率、时序预测、电力潮流、分子动力学、转录预测、增强子活性),下方 6 个 AI 任务(3D/图像/情感分类、自动驾驶检测、MLLM 微调、语义分割),中间列出平台能力(idea 演化/评估、literature review、实现、code evolution、auto debug 等)。 Idea-to-Methodology:论文最强调的差异点
多数前作直接从一句话 idea 跳到写代码,失败率高。InternAgent 中间加了一层 Method Development Agent:先做 Methodology Initialization——把 idea、任务描述、baseline 代码分析、相关文献四路信息揉成一份带具体机制和公式的详细方法文档;再做 Methodology Refinement——结合自动评审和人类反馈迭代打磨。论文的消融和与 AI-Scientist-V2 的对比都把执行成功率的优势归因于这一层:coder 拿到的是可实现的详细 spec 而不是一句高层想法。
演化式实验执行与 exception-guided debugging
写码环节双策略:单文件小改动用 Aider,repo 级多文件改动用 OpenHands(默认 Claude-3.7-Sonnet 写码和 debug)。debug 走"执行→捕获异常和 traceback→理解上下文→制定修复策略→定点改码"的循环,最多 4 次;Aider 最多跑 5 轮、OpenHands 3 轮。
实验不是一把梭:每次实现后评估性能、记录决策,做 adaptive evolution(多轮计划-实现-评估)。消融显示去掉 adaptive evolution 后 AutoRYP 的改进 idea 数从 4/10 掉到 2/10,Auto2DCls 最高 Acc 从 83.3 掉到 81.6。
关键结果 反应产率预测(AutoRYP):baseline R² 27.6 → max 35.4 / avg 33.5(10 个 idea),12 小时;同设置下 Dolphin 只到 31.8。 增强子活性预测(AutoEAP):HK-PCC 0.65 → 0.79,4 小时,10 个 idea 中 8 个跑通且 8 个有提升(全表最高成功率)。 2D 语义分割(Auto2DSeg,repo 级):DeepLabV3Plus mIoU 78.8 → 81.0,30 小时;Dolphin 不支持 repo 级任务。 执行统计(improved/successful/tested,每任务 10 个 idea):简单任务如 AutoSenCls 达 9/9/10,但复杂任务明显吃力——AutoVLM 仅 1/5/10、AutoPCDet 2/5/10,对应提升也只有 +0.5 和 +0.9。 成本:每个 idea 生成约 $0.6(GPT-4o),每次 coding+debug $0.4-1.2(Claude-3.7-Sonnet);整个 session 约 $3,对比 AI-Researcher 的 $25-32、AI-Scientist-V2 的 $10-15(后两者在同任务上均未能超过 baseline,AI-Researcher 在 AutoRYP 上 R² 只有 12.3)。 few-shot 产率预测上,InternAgent 生成的方法不仅均值更高(train-set=60 时 34.8 vs 24.2),方差也更小(±1.1 vs ±4.2)。 实证核查
有水分 代码从发布时闭源逐步走到全量开源,仓库活跃、维护者对质疑逐条回应;论文同时报 max 和 average、公开完整的成功率统计(包括很难看的 1/5/10),数字呈现比同类工作诚实。打折的地方在于头条指标取自每任务 10 个 idea 里的最优值,与 AI-Scientist-V2 / AI-Researcher 的对比全部由作者自己跑、赛道设置(改进给定 baseline)对己方有利,至今无第三方复现——按本站尺度与 InternAgent-1.5 同档。
官方宣称提供完整的开源闭环系统,可复现论文流程。
有个时间差:论文 2025-05 挂出时代码并未开源,issue #1 里维护者以"API 成本"为由只给白名单试用,2025-07 部分开源,2025-10-13 才宣布 1.0 全量开源。现在的仓库(InternScience/InternAgent,1416 stars,2026-07 仍在更新)已是 1.5 版,结构与论文描述对得上:launch_discovery.py、tasks/ 下每个任务含 prompt.json + baseline code/ + launcher.sh,Aider/OpenHands/claudecode 多种 exp_backend。
开源代码完整、与论文/技术报告描述一致。
总体成立但有过瑕疵:issue #24 有用户发现 1.5 技术报告里的 Strategy-Procedural Memory 在发布代码中找不到,维护者承认是内部分支"疏忽没合并",事后补进了 main(agent_kb 模块);issue #20 有用户质疑 survey_agent 的检索结果没传给 generation_agent,维护者解释是走 paper_bank + do_survey 配置的间接链路,属预期行为。维护者对这类代码级质疑响应快且具体,是加分项。
摘要头条:产率预测 27.6→35.4(12h)、增强子 0.65→0.79(4h)、分割 78.8→81.0(30h)。
这些是每任务 10 个 idea 中的 max performance,平均值低一些(如 AutoRYP avg 33.5、Auto2DSeg avg 80.1),论文表格里两者都报了,统计表也如实给出 AutoVLM 只有 1/10 idea 有提升这种难看数字(sec/3_quantitative.tex 表 1-4)。头条取 max 是行业惯例但读者应自行折扣。
对比 AI-Scientist-V2 / AI-Researcher:性能全面占优且成本仅 1/6。
对比由作者自己跑(每任务 10 次,统一用 GPT-4o + Claude-3.7-Sonnet,给 AI-Researcher 喂了相同代码模板),只覆盖 AutoRYP 和 Auto2DCls 两个任务,没有第三方独立复现这一对比。竞品"完全写不出能跑的代码"的结论可能与其设计目标(自由探索式研究而非 baseline 改进)不完全对齐,属于对己方有利的赛道设置。
与我们方向的关系 对课题组是最值得上手改的国产开源基线:任务即插即用(一个任务只需 prompt.json + baseline 代码 + launcher.sh),README 给了免下载数据的 AutoDebug 玩具任务做 smoke test,exp_backend 支持 claudecode/Aider/OpenHands 切换,适合做"同一任务不同 agent 后端"的横向对比实验。idea-to-methodology 这个中间层的消融结果(执行成功率显著提升)对任何做 agent 写码验证 idea 的工作都是直接可借鉴的设计。
它的评测口径也值得学:improved/successful/tested 三元组比单报 best 数字诚实得多,可以直接搬到我们自己的系统评测里。反过来要警惕的是复杂任务(AutoVLM、AutoPCDet)上 10 个 idea 只有 1-2 个有提升,说明这类系统目前的甜点区仍是中小规模、指标明确的任务。
阅读笔记 谱系:同组前作 Dolphin(idea-代码闭环但仅单文件)→ NovelSeek/InternAgent 1.0(本篇)→ InternAgent 1.5(2026-02 技术报告 arXiv 2602.08990,加 memory/deep research/论文复现,称在 GAIA/HLE/GPQA/FrontierScience 领先)。读代码时注意现仓库是 1.5,与本论文(1.0)的实现有出入;论文实验配置在 sec/3_quantitative.tex 的 implementation detail 段。requirements 依赖极重(issue #22 有人抱怨),建议单独 conda 环境。
材料清单 TeX 源码 已存档:Raw/internagent-novelseek/source/
同类条目