← 返回资料站  /  AutoResearch
博客 平台/工具链

FutureHouse Platform: Superintelligent AI Agents for Science

FutureHouse 平台:四个开放使用的科研文献/化学 agent
一句话非营利机构 FutureHouse 于 2025 年 5 月把 Crow/Falcon/Owl/Phoenix 四个科研 agent 以网页 + API 形式开放,自称'首个公开可用的 superintelligent 科学 agent';自测 LitQA 上 Crow precision 83.1% vs Claude 3.7+Search 的 63.2%,文献问答能力后来被 Ai2 AstaBench 第三方部分证实,但 'superintelligent' 属于营销话术。

这是什么

FutureHouse 是 Eric Schmidt 资助的 501(c)(3) 非营利科研机构,此前已发表 PaperQA2('超越人类水平的文献综合')、LAB-Bench、Aviary 等工作。这篇 2025-05-01 的博客宣布把内部 agent 打包成公开平台 platform.futurehouse.org,提供网页界面和 Python API(PyPI 包 futurehouse-client),定位是解决'科学的信息瓶颈'——博客引用 3800 万篇 PubMed 论文、50 万+ 临床试验的数字。

四个 agent 各司其职:Crow(通用文献问答,PaperQA2 的产品化,适合 API 调用)、Falcon(深度文献综述,接入 OpenTargets 等专业数据库)、Owl(前身 HasAnyone,专答'有没有人做过 X')、Phoenix(实验性,ChemCrow 的部署版,做化学合成规划、化合物新颖性/成本查询)。官方明确说 Phoenix 未充分 benchmark、'may make more mistakes'。

与通用 LLM+搜索的差异点:检索的是开放获取论文全文而非摘要/网页快照、内置来源质量评估、推理过程分阶段可见、API 支持大规模流水线调用(例如持续监控新文献)。平台免费使用(有 rate limit),这是它成为很多后续工作(Robin、Denario 等)文献模块的原因。

官方自测 LitQA 对比:蓝色 precision(答对/作答)、红色 accuracy(答对/全部)。Crow 83.1%/71.1%,略超 2024 版 PaperQA2;通用 frontier 模型 + exa 搜索全线落后,Claude 3.7 和 Gemini 2.5 Pro accuracy 只有 7.5%(大量拒答)。注意这是自家 benchmark、基线只配通用网页搜索,幅度参考即可。
官方自测 LitQA 对比:蓝色 precision(答对/作答)、红色 accuracy(答对/全部)。Crow 83.1%/71.1%,略超 2024 版 PaperQA2;通用 frontier 模型 + exa 搜索全线落后,Claude 3.7 和 Gemini 2.5 Pro accuracy 只有 7.5%(大量拒答)。注意这是自家 benchmark、基线只配通用网页搜索,幅度参考即可。

机制与做法

技术底座:PaperQA2 + Aviary

Crow 本质是开源 PaperQA2(Future-House/paper-qa,9.1k stars)的托管版:RAG 流程为 paper search → 全文 chunk 检索 → evidence gathering(对每个 chunk 做相关性打分与摘要)→ 引用溯源生成答案。agent 的执行框架是他们自己的 Aviary(language agent gym)+ LDP。Falcon 在此之上加大检索预算并接入专业数据库,做成长篇综述;Owl 则是针对'查新'任务的专用 prompt/流程变体。

平台本身不开源:futurehouse-client 只是 API SDK(GitHub 上无公开仓库,仅 PyPI + gitbook cookbook 文档),Falcon/Owl/Phoenix 的具体实现、检索语料范围都是黑盒。开源的 paper-qa 需要自备论文 PDF/索引,和平台版的开放获取全文语料并不等价。

四个 agent 的分工:Crow 简明文献问答、Falcon 深度综述、Owl 查新(precedent search)、Phoenix 化学合成规划(官方标注 Experimental)。
四个 agent 的分工:Crow 简明文献问答、Falcon 深度综述、Owl 查新(precedent search)、Phoenix 化学合成规划(官方标注 Experimental)。

自测 benchmark 的设计

博客的主证据是一张 LitQA(他们自建的、需要全文才能答对的文献选择题集)对比图:Crow precision 83.1% / accuracy 71.1%,对比 PaperQA2 (2024) 的 82.0%/60.5%,以及'frontier model + 搜索工具'基线——o3-mini (High+Search) 48.4%/39.0%、GPT-4.1 (Search) 44.5%/33.3%、Claude 3.7 (Thinking+Search) 63.2%/7.5%、Gemini 2.5 Pro (Search) 52.2%/7.5%。precision=答对/作答,accuracy=答对/全部,后两者 accuracy 极低是因为大量拒答。

注意两个口径问题:基线用的搜索工具是 exa.ai 通用网页搜索,而 LitQA 题目刻意要求付费墙外拿不到的全文细节,这对没有全文语料的基线天然不利;且 LitQA 是 FutureHouse 自家出的题、自家跑的分。'precision 超过 PhD 研究员'的说法沿用自 2024 年 PaperQA2 论文的人机对比实验,不是本次平台的新实验。

API 与流水线用法

官方给的组合范式:Falcon 综述某疾病通路 → Crow 逐个追问机制细节 → Owl 查新确认没人做过,即可批量筛选'未被探索的机制'假设;或者用 API 定时跑新发表文献做持续监控。一个月后发布的 Robin(multi-agent 科学发现系统,发现 ripasudil 治疗 dAMD 的候选)就是把 Crow/Falcon 当文献模块、Finch 当数据分析模块编排起来的,证明这套 API 确实撑得起下游系统。

关键结果

实证核查

有水分文献问答能力是真的强——五个月后 Ai2 的 AstaBench 独立评测确认 Falcon 是最好的 API 型商业科研 agent;但 'superintelligent' 是纯营销词,自测图的基线设置对通用模型不公平,平台实现闭源无法审计,且在第三方 citation 评测上并未领先同类专用工具。
官方称这是'首个公开可用的 superintelligent 科学 agent',文献检索 precision '超过 PhD 级研究员'。
'超过 PhD' 的实验出自 2024 年 PaperQA2 论文(LitQA2 上与雇佣的生物学研究员对比),不是平台新实验;'superintelligent' 无任何定义或新证据支撑。真实用户 Tom Ellis 试用当天评价'约相当于我 70% 的效率'(x.com/ProfTomEllis/status/1918078666396799003)。定性:文献问答确实达到或接近熟练研究者水平,但'超智能'言过其实。
博客 LitQA 图显示 Crow/Falcon/Owl '在检索 precision 和 accuracy 上超过所有主流 frontier 搜索模型'。
该对比是自家 benchmark 自家跑分:基线的搜索工具统一用 exa.ai 通用网页搜索,而 LitQA 题目专门设计成需要开放获取论文全文才能答对,基线拿不到语料属于设定使然;博客正文甚至不给具体数字,只放在图里(Crow 83.1/71.1 vs Claude 3.7+Search 63.2/7.5)。方向上可信(专用全文 RAG 确实该赢通用搜索),幅度不宜直接引用。
平台是'开放的科研 agent 基础设施',差异化在开放获取全文语料 + 来源质量评估 + 透明推理。
开放的只是使用权:GitHub Future-House org 下没有平台/futurehouse-client 仓库(gh api 404),SDK 仅发 PyPI(0.7.x)+ gitbook 文档,Falcon/Owl/Phoenix 实现和语料范围均闭源,无法核对'来源质量评估'如何做。开源的 paper-qa(9.1k stars,2026-08 仍活跃,~145 open issues 多为工程问题)只是 Crow 的底座,不含平台语料。
Crow/Falcon/Owl 经过充分 benchmark,能力最强。
Ai2 AstaBench(2025-10, arXiv:2510.21652)独立评测部分证实:Falcon 是最好的 API-based 商业科研 agent,文献理解约 80% 档;但同一评测中 Asta Scholar QA、Elicit、SciSpace Deep Review 在 ScholarQA-CS2 上都 ≥85% 压过它,且这些商业 agent '并不显著好于最简单的 ReAct 基线',也无法完成文献之外的科研任务(数据分析类无 agent 超过 34%)。

与我们方向的关系

对 auto-research 方向,这是目前最值得直接拿来用的文献基础设施:免费 API + Python SDK,Crow/Owl 适合做假设生成流水线里的'文献证据'和'查新'模块——Robin、Denario 都是这么用的。如果课题组要搭自己的科研 agent,与其自建文献 RAG,不如先接 futurehouse-client,或者用开源 paper-qa + 自备语料做可控复现。

方法论上值得记住两点:一是'专用全文语料 + 引用溯源'对文献任务的提升远大于换更强的底座模型(LitQA 上通用 frontier 模型 accuracy 全线崩溃);二是评这类系统要看第三方基准——AstaBench 这种控制了工具访问和成本的评测,比厂商自测图可信得多,我们自己发系统时也应主动上这类基准。

阅读笔记

meta.json 为空(博客无 arXiv/GitHub 元数据)。平台后续动态:2025-05 底 Robin 发布(Crow/Falcon/Finch 编排),2025-06 起平台加入 Finch(数据分析)。LitQA 图中 Claude 3.7 与 Gemini 2.5 Pro 的 accuracy 同为 7.5%,几乎全靠拒答保 precision。引用平台成绩时建议引 AstaBench 数字而非官方博客图。

材料清单

平台入口platform.futurehouse.org
网页界面,免费注册使用
API 文档futurehouse.gitbook.io/futurehouse-cookbook/futurehouse-client
futurehouse-client SDK(PyPI),平台本身闭源
开源底座github.com/Future-House/paper-qa
Crow 的基础 PaperQA2,9.1k stars,持续维护
第三方评测arxiv.org/abs/2510.21652
Ai2 AstaBench:Falcon 为最佳 API 型商业科研 agent,但被 Asta/Elicit/SciSpace 在 ScholarQA-CS2 上超过
下游应用www.futurehouse.org/research/demonstrating-end-to-end-scientific-discovery-with-robin-a-multi-agent-system
Robin:用 Crow/Falcon/Finch 编排出的端到端发现系统

同类条目