论文
端到端系统
OmniScientist: An Omni-Modal Omni-Discipline AI Scientist
OmniScientist:直接读原始数据的全模态跨学科 AI 科学家
Bobo Li, Hao Fei, Tianjie Ju, Mong-Li Lee, Wynne Hsu · National University of Singapore 等 · arXiv · 2026-08 · 被引 0
一句话 NUS 团队做的端到端 AI 科学家:感知层 + ideation/experiment/writeup 三个 agent,直接吃图像、波形、音频、视频、点云、轨迹等 12 种模态的原始数据,在 5 个学科族 36 个真实数据案例上全部跑通(从原始数据到编译好的 PDF),LLM 评审均分 6.3;配套开源了桌面 App、CLI 和 Claude Code skill。
这是什么 现有 AI Scientist 系统(AI Scientist、Agent Laboratory 一类)基本只在文本、代码和预先算好的标量特征上推理:光谱、显微图像、地震波形这些真正承载科学证据的原始数据,要么被人工总结成几个数字再喂给 agent,要么干脆丢掉。论文的核心论点是,科学发现依赖的空间、时序、跨通道、过程性关系恰恰存在于原始数据里,agent 看不到就提不出真问题。
OmniScientist 的做法是在整个科研生命周期(选题、实验、写作)都接入一个 perception layer:把证据分成 perceptual / symbolic / quantitative / procedural 四个 evidence family、12 种模态,agent 可以随时调工具直接查看原始 artifact。系统同时用代码强制执行一系列检查:novelty 筛查、统计有效性、执行溯源(论文里每个数字必须出现在某次真实运行的 stdout 里)、引用必须解析到真实 DOI。
与多数只发论文的同类工作不同,它同时是一个正经的开源软件项目(MIT,TypeScript + Python):有桌面 App、终端 agent、Claude Code skill 三种形态,双模型架构(reasoning backbone 任选 + perception sidecar 默认 claude-sonnet-5),v0.1.x 已发多个 release,单次完整运行成本 $0.03–$4.34。
系统架构:顶部是 4 个 evidence family、12 种模态的原始证据;中间是 Ideation(观察→检索→提出可证伪假设)→ Experiment(设计→执行→检视,产出含 stdout/图/配置的 execution record)→ Writeup(只报告 execution record 支持的 claim)三阶段流水线;底部的 perception layer(空间/时序/跨通道/统计/动态)贯穿全程,虚线箭头表示三个阶段都能调用感知工具。 机制与做法 感知层:先算数字,再看图
感知层按 evidence family → modality 两级组织观察工具。为控制成本,agent 优先做 native numeric 分析(比如直接从信号里提 FFT 峰值、从表格里读分布),只有当空间/结构模式必要时才渲染成图交给 vision 模型看,且视觉检查有预算限制(ideation 阶段 min(24, max(8, 2g)) 次,g 为数据的 label group 数;experiment 阶段 8 次)。
论文的 perception gallery 展示了 16 个案例中 agent 在原始记录上圈出的具体特征('saw' 直接观察 → 'found' 验证后的实验结论),覆盖病理图像、光谱、三分量地震波形、音频、视频、CT 点云、气旋轨迹、公式、图结构等。
感知消融的主结果:5 个配对案例上,去掉感知(粉)vs 完整系统(青)的 7 维评分。multimodal grounding +2.8、significance +1.8 提升最大;注意最右边 factual accuracy 两条一样高——因为两种条件都过同一套 provenance check。这张图也直接暴露了摘要'提升全部 7 个维度'的说法不准确。 三个 agent + 代码强制的关卡
Ideation:ReAct 循环,先盘点材料并决定是否查看原始数据,再通过 OpenAlex/Crossref 查文献,生成至少 5 个候选 idea 并评估新颖性风险后选一个。出口检查用代码验证:必须有明确的 research question / hypothesis / 可证伪判据、至少 3 次文献检索,而且会自动把 'first'、'never explored' 这类过度自信措辞改写成 'appears under-explored based on this search'。
Experiment:在受控 run_python 环境里迭代写代码调试(最多 50 步、单次执行 150 秒超时),要求至少 4 组分析(主假设检验 + baseline/ablation/敏感性分析等对照)。出口检查(论文 Algorithm 1)是防造假的核心:每个报告数字必须能在真实 stdout 里找到、数据集必须真的从磁盘加载、multiple-comparison correction 的分母必须计入调试过程中尝试过的所有检验(防止偷偷缩小校正分母)、headline 结论必须来自 primary test(anti-HARKing)。null 结果会被打回重新选题(最多 2 次 fallback)。
Writeup:5 套学科写作规范(ML 论文带 Related Work,生物医学把 Methods 放最后,化学合并 Results and Discussion),每个 section 只从结构化实验记录里分到自己需要的切片,摘要最后写以保证数字一致;最终 claim check 再对照 execution record 审一遍才编译 PDF。
评测:36 案例 × 9 个 backbone,LLM 评审
36 个真实数据案例覆盖 5 个学科族(Earth/Life/Agri/Engineering/Physics)。perception 模型固定为 claude-sonnet-5,只换 reasoning backbone;打分由 2 个系统外家族的 LLM 评审(deepseek-v4-flash、gemini-2.5-flash-lite)按 7 个维度(0–10)进行。主 backbone Sonnet 5 完成 36/36,均分 6.3;GLM-5.2 在其 17 个完成案例上 6.5 最高;Qwen3.5-9B 只有 4.0。消融显示 prior-art search 去掉后掉分最狠(6.9→5.7)。
关键结果 36/36 案例全部端到端跑通(原始数据 → 编译 PDF),Sonnet 5 backbone 均分 6.3;按学科或模态分组,中位数稳定在 6.1–7.1 之间 对比 blind 变体(只给预计算标量特征):5 个配对案例中 head-to-head 胜率 85%,multimodal grounding +2.8、significance +1.8 提升最大;两个系统会提出完全不同的研究问题(如地震案例:感知版直接看波形提出可执行假设,blind 版设计的研究依赖数据里不存在的字段) leave-one-out 消融(地震案例):去掉 prior-art search 6.9→5.7 掉分最大,去掉 novelty check 使 novelty 评分掉整整 1 分 backbone 强弱主要体现在 factual accuracy 和 soundness 上,clarity 退化最小;7 维排序在各 backbone 间 Spearman 中位相关 0.82 单次完整运行成本 $0.03–$4.34(取决于 backbone),experiment 阶段占大头;评审分与稿件长度相关性仅 ρ=0.16 示例发现:STEAD 地震基准中 21.7% 的 noise 标签样本实际携带相干极化信号(1% 误报率下),agent 自己生成 surrogate null distribution 来检验——相当于自动审计了一个公开 benchmark 的标签质量 实证核查
有水分 工程和开源部分异常扎实(能装、能跑、有真实用户报 bug 且被修),但评测口径有水分:全靠 LLM 评审、关键消融只有 5 个配对案例,且摘要的'感知提升全部 7 个维度'与论文自己的图表矛盾。
开源了完整系统:reference engine + 桌面 App + CLI + Claude Code skill,papers/ 下有 5 篇端到端生成的样例论文。
属实。gh api 核对 repo:papers/ 确有 5 个 PDF(seismology_stead_noise.pdf 等),engine/examples/ 有 birdaudio、stead_seismic、histopath、feynman 等案例规范;v0.1.0–v0.1.3 四个 release,CI 全平台构建,带 SHA256SUMS 校验。issues 里有真实用户的 Windows 实测报告(#1 前端按钮未绑事件)和本地网关兼容问题(#3/#4/#5),均已关闭修复,repo 两周 139 stars。README 也诚实标注 Windows 桌面版'尚无真人完整跑通记录'。
摘要:'direct perception improves all 7 evaluation dimensions and wins 85% of head-to-head judgments'。
与正文自相矛盾:论文 Sec 5.3 和 eval_perception_bars 图明确写 factual accuracy 在两种条件下完全相同(因为都过同一套 provenance check),即只提升了 7 个维度中的 6 个。且 85% 胜率仅来自 5 个配对案例,样本量很小。
系统均分 6.3,跨 backbone 对比显示 GLM/Kimi 与 Claude 相当。
所有分数均来自 2 个 LLM 评审(deepseek-v4-flash、gemini-2.5-flash-lite),无人类评审;且 backbone 对比的案例覆盖极不均衡(论文 Table 4:Sonnet 5 跑了 36 例,GPT-5.6 只跑 10 例、Kimi K2.7 只跑 9 例、GLM-5.2 跑 18 例),'GLM 6.5 最高'是在不同子集上比的,不可直接横比。生成论文的科学价值(如 STEAD 的 21.7% 发现)尚无领域专家或第三方复核。
代码强制的 provenance:论文里每个数字都能追溯到真实运行的 stdout。
机制在论文 Algorithm 1 里写得具体(数字必须 ∈ stdout 集合、数据必须从磁盘加载、多重比较校正计入所有尝试过的检验),README 的 Provenance 一节与之一致,桌面端截图显示论文里高亮数字可点击跳转到产生它的运行记录。engine 开源可自行验证,但注意这只保证'数字没编造',不保证分析本身在科学上正确。
与我们方向的关系 这是目前'AI Scientist 该不该直接接触原始数据'这个问题上论据最完整的工作:5 个配对案例的机制分析(Table 8)显示,blind 系统和感知系统会提出完全不同的研究问题——这说明多模态感知改变的是科研轨迹本身,而不只是让论文写得更好看。对课题组做多模态科研 agent 的同学,perception layer 的两级组织(evidence family → modality)、'先数值后视觉'的预算控制策略,以及按 label group 数自适应的图像预算公式都可以直接借鉴。
更值得抄的可能是它的防造假工程:Algorithm 1 那套代码强制检查(数字溯源到 stdout、多重比较校正分母计入调试期所有检验、anti-HARKing、自动改写过度自信措辞)是对 AI Scientist 一类系统'编数字'顽疾的具体解法,且代码全开源。做 agent 评测的同学也要注意它的反面教训:LLM-judge-only + 小样本配对 + 摘要措辞略超正文,这些正是我们核查别人工作时该盯的点。
阅读笔记 arXiv 2608.13558,2026-08-13 挂出,8-16 开源,S2 引用数还是 0(太新)。工程栈有点特别:CLI 和桌面端全是 TypeScript/Bun,engine 才是 Python。想复现最省事的路径是 engine/:python engine/omniscientist/agentic.py --task stead_seismic --stage run,自带数据 fetch 脚本。跑一遍成本 $0.03–$4.34。注意 deepseek-v4-flash 既当默认 backbone 又当评审之一,评审虽然号称'系统外家族',但 deepseek 同时出现在被测 backbone 表和评审席上的边界值得留意(被测的是 v4-flash 作为 backbone 的运行吗——论文说评审来自 outside the systems under test,但 README 默认 backbone 恰是 deepseek-v4-flash)。
材料清单 TeX 源码 已存档:Raw/omniscientist/source/
同类条目