论文
端到端系统
InternAgent-1.5: A Unified Agentic Framework for Long-Horizon Autonomous Scientific Discovery
InternAgent-1.5:面向长时程自主科学发现的统一 agent 框架
Shiyang Feng, Runmin Ma, Xiangchao Yan, et al. (Shanghai AI Laboratory, 57 authors) · Shanghai AI Laboratory · arXiv · 2026-02 · 被引 22
一句话 上海 AI Lab 把 InternAgent 重构成 Generation/Verification/Evolution 三个子系统,靠 deep research、solution refinement、长时程 memory 三项底座能力支撑跨周期运行;在 GAIA val 拿 86.06%、HLE 40.00%、GPQA-diamond 87.37%,并在地球/生命/生物/化学四个领域跑通了干湿实验闭环。
这是什么 InternAgent(前身 NovelSeek)是上海 AI Lab 的端到端自动科研系统,1.0 版(2025.05)把"假设生成→实验验证"流程跑通了 12 类科研任务。1.5 版技术报告(2026.02)的核心变化是架构重组:不再按流水线阶段组织,而是拆成三个循环耦合的子系统——Generation 负责调研文献、生成假设和方案,Verification 负责计算/实验验证,Evolution 负责把验证证据沉淀回知识、策略和长期记忆,再反哺下一轮。
三个子系统各自绑定一项"底座能力":Generation 靠 deep research(跨学科知识图谱 + FlowSearch 的 DAG 式知识流),Verification 靠 solution refinement(Graph-Augmented Monte Carlo Search 做多轮并行方案优化),Evolution 靠 Structured Cognitive Memory(程序性/情景/语义三层记忆)。这个组织方式直接回应了 2025-2026 年 AI scientist 领域的共识转移:瓶颈已经不是能否跑通单轮流程,而是长时程运行下系统如何不重复失败、不跑偏、还能持续变好。
评估分三层:通用科研推理 benchmark(GAIA、HLE、GPQA-diamond、FrontierScience、SGI-Bench)、算法发现(6 个科学数据任务 + 4 个 AI 算法任务)、经验发现(地球科学气候诊断/降尺度、生命科学靶点发现、生物科学荧光蛋白工程含湿实验、化学反应预测与 scaffold hopping)。湿实验通过 SCP(Science Context Protocol,兼容 MCP)协调自动化设备执行。
降水降尺度对比(2017-06,中国区域):左上 ERA5 0.25° 参考场,其余为各方法结果。Bilinear 和 Kriging 明显过度平滑、抹掉了强降水核心(RMSE 约 4.0e-05),InternAgent-1.5 自主设计的深度学习方案 RMSE 2.252e-05,细尺度梯度和局地对流极值保留得最接近参考场——这是论文"系统能自己发明工具而非只调用工具"主张的代表性证据。 机制与做法 Deep research:跨学科 KG + FlowSearch 知识流
数据侧维护一个跨学科知识图谱,节点不只是实体,还包括文档、方法、数据集、实验设定、问题陈述等科研元素,边编码 cites、by-product 等类型化关系,让跨领域依赖以"路径"而非孤立点的形式浮现。检索时图搜索(找连接 query 与相关方法的路径)与 dense retrieval 融合,输出路径结构化的证据链。
方法侧就是他们 2025.10 发的 FlowSearch:把研究过程建成 DAG,每个节点是 (任务类型 search/solve/answer, 内容, 状态, 知识上下文) 四元组,planner 增量扩展图、按依赖状态激活可执行节点,分给 agent 并行执行,结果沿边传播。回答时还叠加三路推理(直接回答 / 检索增强回答 / 自驱动回答)再聚合。GAIA 86.06% 主要就是这套 DR 管线打出来的。
AutoTSF 任务上研究目标的演化过程:从一个笼统的初始目标(改进 Transformer 时序预测)出发,Semantic-Knowledge Memory 驱动的 Evolve 每一轮都基于已有实验证据把目标细化成 3 个更具体的方向(图注意力、架构简化、跨序列交互),并在下一轮继续收敛。展示的是 SKM 如何在跨批次保持语义连续性的同时施加新颖性压力,是该系统"长时程不跑偏"机制最直观的图示。 Solution refinement:Graph-Augmented Monte Carlo Search
把实验优化形式化为在方案空间里搜 s* = argmax h(T,s),沿用 MCTS 的 selection/expansion/simulation/backpropagation 循环,但把刚性树换成动态 solution graph,expansion 阶段有四个算子:Primary Expansion(只看父节点做局部修改)、Intra-branch Evolution(带上同分支祖先轨迹做自反思)、Cross-branch Reference(分支停滞时引用其他分支的高分节点)、Multi-branch Aggregation(拆解多个 top 方案的组件重组成混合设计)。这是针对线性 refinement 和树搜索的三个痛点——轨迹孤立、搜索历史浪费、想法无法组合——的直接回应。
同一套搜索框架同时服务两类场景:算法发现里每个 proposal 是可执行程序,在受控环境编译评测;经验发现里 proposal 是完整实验流程,可以走仿真也可以通过 SCP 调度真实设备(测荧光强度等)。这部分的算法发现实现单独开源为 MLEvolve 仓库,README 称其为 MLEBench 上排第一的开源方法。
Structured Cognitive Memory:三层记忆
SPM(Strategy-Procedural Memory)不存原始轨迹,而是从历史轨迹蒸馏可复用的程序性结构(有效模式 + 失败根因诊断),新 query 来时按程序结构相似度 top-k 检索,注入 planner 和 executor 的 prompt。消融显示 SPM 在 GAIA 上把平均工具调用从 22.69 降到 18.52,Level 3 准确率从 53.85% 提到 61.54%——省调用的同时提分,是报告里最干净的一个消融。
TEM(Task-Episodic Memory)在单条研究轨迹内存每次实验的 (方法, 指标, 是否改进),混合语义 embedding 和稀疏词法特征做检索,注入假设精炼的上下文,作用是别重蹈本 session 里已失败的方向。SKM(Semantic-Knowledge Memory)跨 session 维护长期经验库和 Idea Graph,给候选研究目标算 novelty 分(1 减去与已探索区域的最大相似度),用"新颖性压力"防止在饱和的概念区域打转——这一条对做持续学习的人最值得细看。
关键结果 GAIA validation 平均 86.06%(Level 1: 92.45 / L2: 89.53 / L3: 61.54),超过 Manus 73.30 和 MiroThinker-v1.5-235B 的 80.8;但这是 Gemini-3-pro+o4-mini 双模型配置,换 Qwen3-235B 底座只有 58.79。 HLE 全集 40.00%、text-only 40.87%,略超 Gemini-3-pro-preview 单模型(38.04/38.00);GPQA-diamond 87.37%;FrontierScience Olympiad 77.20%、Research 12.00%(o4-mini 推理 + gpt-5-high 判分)。 SGI-Bench Deep Research 37.74%,比第二名 Gemini-3-pro 的 18.48% 高一倍——DR 管线是这个系统相对裸模型最大的增量。 6 个科学算法任务全面超过 1.0:如 AutoEAP 增强子活性预测 HK-PCC 从 DeepSTARR 基线 0.65 提到 0.91,AutoPower RMSE 0.00473→0.00318;4 个 AI 算法任务(以 2025 顶会方法为基线)提升幅度小得多:AutoTTS 70.9→72.5、AutoTTRL 23.3→23.9、AutoLM 0.880→0.904。 气候降尺度任务上自主设计的深度学习方案 RMSE 0.8488,优于 Kriging(3.1658)和 BCSD(0.9049);生命科学两个案例(HCC 的 GPR160、CRC 的 ARG2)是对 OriGene 已发表发现的复现,不是新发现。 SPM 消融:GAIA 平均准确率 82.42→86.06,平均工具调用 22.69→18.52,Level 3 工具调用从 55.65 降到 37.33。 实证核查
有水分 架构和多数结果有代码与响应积极的维护支撑,但复现链条有几处打折:1.5 代码比报告晚 3 个月才放出、论文核心组件 SPM 首发时漏掉、benchmark 评测代码不在仓库里、最好成绩依赖 Gemini-3-pro+o4-mini 闭源底座,且"经验发现"多为已知结论的复现。
论文 2.4.1 节详细描述了 Strategy-Procedural Memory(SPM)并给出 GAIA 消融数据。
GitHub issue #24 指出开源代码里找不到 SPM 实现;维护者承认 SPM 留在内部分支、'due to an oversight' 没随 1.5 发布合入,后补合进 main(实现为 agent_kb FastAPI 服务)。且它默认关闭(need_memory=true 才启用),知识库数据文件因体积原因不随仓库分发,需自行指定 BASE_KB_PATH/APPEND_KB_PATH——照默认配置跑出来的不是论文里的完整系统。
在 GAIA、HLE、GPQA、FrontierScience 上取得 leading performance。
issue #16 有人索要 HLE 评测代码,官方答复是遵循 benchmark 官方 pipeline、仓库不提供评测脚本,并提示'跑这些评测相当昂贵';报告发布(2026.02)时 1.5 代码未开源,只给 SCP API,多名用户追问后 2026.05.07 才放出代码。另外 FrontierScience 成绩用 o4-mini 推理 + gpt-5-high 判分,官方自己在 issue #18 里提醒该 benchmark 数据本身'may be some issues'(见 HF openai/frontierscience discussion #3);HF 团队导入 Papers with Code 后 InternAgent-1.5 在 FrontierScience-Olympiad 上排第 2,不是第 1(issue #25)。
系统实现端到端自主科学发现,在地球/生命/生物/物理领域'produces scientific findings'。
论文正文自己写明生命科学两案例是 reproduce OriGene 已发表的 GPR160(HCC)和 ARG2(CRC)靶点发现;荧光蛋白任务的结论(sfGFP 亮度高、折叠稳定)也是文献已知结论的实验确认。摘要层面的'产出科学发现'实际是'复现已知发现 + 若干任务上的指标改进',没有可核验的全新科学结论。
统一框架带来跨任务的强性能。
论文自己的表格显示性能强依赖底座:GAIA 上 Qwen3-235B 配置 58.79% vs Gemini-3-pro+o4-mini 配置 86.06%,差 27 个点;HLE 上系统相对 Gemini-3-pro 单模型只多约 2 个点(38.04→40.00)。框架的净增量在开源底座上要小得多。另一面,仓库维护是真实活跃的:26 个 issues 基本都有实质回复,SPM 补发、FlowSearch 合入、时序任务示例等都有落实,1416 stars,2026.07 仍在推送。
与我们方向的关系 这是理解"AI scientist 瓶颈从单轮流程转向长时程一致性"最系统的一份工程答卷,对课题组持续学习方向最有借鉴价值的是 Structured Cognitive Memory 的三层拆分:SPM 蒸馏程序性经验(而非存轨迹)、TEM 管 session 内快速适应、SKM 用 novelty score 施加探索压力防止概念区域饱和。SPM 消融(准确率升 + 工具调用降)是少见的"记忆同时提效提分"的干净证据,agent_kb 的 hybrid retrieval + 蒸馏写回实现可以直接读代码(internagent/mas/agents/dr_agents/ 与 agent_kb/)。
另一个可借鉴点是 Graph-Augmented Monte Carlo Search 的四个 expansion 算子,特别是 Cross-branch Reference 和 Multi-branch Aggregation——对任何做并行方案搜索/self-improvement 的工作都是可移植的设计。注意教训:复现时务必开 need_memory 并配好知识库,否则跑的是残缺系统;对比实验要固定底座模型,他们最亮眼的数字都来自 Gemini-3-pro+o4-mini 组合。
阅读笔记 版本时间线容易混:NovelSeek(2025.05)→ 改名 InternAgent(2025.07)→ 1.0 全量开源(2025.10)→ 1.5 技术报告(2026.02.10)→ 1.5 代码开源(2026.05.07)。solution optimization 子系统另有独立仓库 MLEvolve(自称 MLEBench 开源第一)。DR 能力也可以不装整套系统、通过 SCP(兼容 MCP)远程调用。仓库 license 是 NOASSERTION,商用前要确认。
材料清单 TeX 源码 已存档:Raw/internagent-1-5/source/
同类条目