← 返回资料站  /  AutoResearch
论文 文献调研

PaperQA2: Language agents achieve superhuman synthesis of scientific knowledge

PaperQA2:文献问答/综述/矛盾检测的高精度 RAG agent
一句话FutureHouse 的科学文献 RAG agent:在自建基准 LitQA2 上 precision 85.2% 超过 PhD 标注者的 73.8%(accuracy 66.0% vs 67.7%,与人持平);写基因综述比对应 Wikipedia 条目错误率更低;每篇生物论文平均检出 2.34 个文献矛盾、70% 经专家确认。开源仓库 9k+ stars,至今活跃,是文献环节最常被引用的开源组件。

这是什么

PaperQA2 是 FutureHouse 做的面向科学文献的 agentic RAG 系统:不是一次性 retrieve-then-generate,而是把检索拆成工具(Paper Search、Gather Evidence、Citation Traversal、Generate Answer),由一个 LLM agent 自主决定调用顺序、必要时改写关键词重搜。论文核心卖点是一套「人机同题对比」的评测方法:找一批生物学 PhD/在读博士,给钱、给一周时间、不限工具,和系统做同样的文献任务,直接比 precision/accuracy。

评测覆盖三个任务:(1) LitQA2——248 道多选题,答案刻意设计在论文正文而非摘要中,靠比对引用 DOI 判分;(2) WikiCrow——用多次 PaperQA2 调用拼出人类蛋白编码基因的 Wikipedia 风格综述,与真实 Wikipedia 条目盲评对比;(3) ContraCrow——从论文抽取 claim,逐条问「文献里有没有矛盾证据」,输出 11 级 Likert 分。三个系统共享同一个 PaperQA2 底座,只换 prompt 配置(仓库里对应 wikicrow/contracrow 两套 bundled settings)。

对课题组来说它的意义是双重的:一份至今仍在维护的可用工具(pip install paper-qa,支持 LiteLLM 全系模型、本地 embedding、多模态 PDF 解析),以及一套「如何严肃地和领域专家对比」的评测范式——这在 2024 年的文献 agent 论文里是少见的。

A:PaperQA2 的四个工具(Paper Search、Gather Evidence、Citations Traversal、Generate Answer)围绕中央 agent 的架构,agent 维护 artifact state(chunk+评分)和 history state,自主决定调用顺序。B:三任务主结果——问答 precision 85.2% vs 人类 73.8%,综述 precision 86.1% vs Wikipedia 71.2%,每篇论文 2.34 个矛盾中 1.64 个经人类确认。
A:PaperQA2 的四个工具(Paper Search、Gather Evidence、Citations Traversal、Generate Answer)围绕中央 agent 的架构,agent 维护 artifact state(chunk+评分)和 history state,自主决定调用顺序。B:三任务主结果——问答 precision 85.2% vs 人类 73.8%,综述 precision 86.1% vs Wikipedia 71.2%,每篇论文 2.34 个矛盾中 1.64 个经人类确认。

机制与做法

四工具 agent 循环与 RCS

agent(默认 GPT-4 系列做 tool selection)把用户问题转成关键词查询走 Paper Search,候选论文解析分块入库;Gather Evidence 先做 top-k(默认 30)稠密向量召回,再做 LLM reranking and contextual summarization(RCS):每个 chunk 由 summary LLM 针对当前问题写约 100 词摘要并打相关性分,只有高分摘要进入最终 context。RCS 是和 Perplexity/Elicit 这类「直接塞原文片段」系统的关键差异,消融显示去掉 RCS model 后 accuracy 从 66.0 掉到 55.4(p<0.001)。

有意思的细节:RCS 只有配大模型才有用——GPT-3.5-Turbo 或 Llama3-70B 做 RCS 反而比完全不用 RCS 更差(53.2/32.0 vs 55.4),作者称之为 comprehension threshold。agent 本身也有增量:换成写死 search→gather→answer 顺序的 No Agent 版,accuracy 掉到 50.9;实际运行中 agent 平均每题 1.26 次搜索、0.46 次 citation traversal。

B:LitQA2 上各系统对比,注意 accuracy 一栏 PaperQA2 66.0 仍低于人类线 67.7,只有 precision 超人;非 RAG 前沿模型 accuracy 都在 5-26%。C:消融——No Agent 50.9、Llama3-70B 做 RCS 只有 32.0、No RCS 55.4,说明 agent 循环和大模型 RCS 都是必要件。D:Citation Traversal 对各阶段 DOI recall 的增益。
B:LitQA2 上各系统对比,注意 accuracy 一栏 PaperQA2 66.0 仍低于人类线 67.7,只有 precision 超人;非 RAG 前沿模型 accuracy 都在 5-26%。C:消融——No Agent 50.9、Llama3-70B 做 RCS 只有 32.0、No RCS 55.4,说明 agent 循环和大模型 RCS 都是必要件。D:Citation Traversal 对各阶段 DOI recall 的增益。

Citation Traversal 与 LitQA2 的设计

新增的 Citation Traversal 工具把已确认相关的 chunk 的引用/被引论文拉进语料,相当于用引文图做层次索引;消融掉之后各阶段 DOI recall 都显著下降(search recall 69.9%→63 左右)。注意:README 的 FAQ 明确说这个工具在开源仓库里还没有,属于内部版本。

LitQA2 的出题纪律值得借鉴:答案必须只出现在某篇近期论文的正文里(摘要里搜不到),先用现有 AI 系统和人工标注排掉能从别处答出来的题;允许选「信息不足」,同时报 precision(答了的对多少)和 accuracy(全部题对多少)。为防对基准过拟合,工程改动基本完成后新出了 101 道题,前 147 题和后 101 题上 accuracy 无显著差异。

WikiCrow 与 ContraCrow

WikiCrow 生成 240 篇基因文章(平均 1219 词、491 秒、$4.48/篇),从中抽 375 条陈述与配对 Wikipedia 条目盲评:cited-and-unsupported 比例 13.5% vs Wikipedia 的 24.9%,漏引率 3.5% vs 13.6%,cited 陈述 precision 86.1% vs 71.2%。错误归因分析显示优势主要来自 reasoning 错误更少(12 vs 26),attribution 错误相当。

ContraCrow 在 93 篇随机生物论文上平均每篇抽 35.16 条 claim,阈值 8 分以上判矛盾,平均每篇 2.34 条;专家复核 100 条中 70% 认可,折合每篇 1.64 条「可被人类确认的矛盾」。在自建的 ContraDetect 基准上 ROC AUC 0.842、precision 88%;对 42 条从未被报道过的 no-evidence 陈述,98% 正确选了 lack of evidence 而非误报矛盾。

关键结果

实证核查

有水分系统本身扎实:代码开源且维护到 2026-08、LitQA2 题目和 splits 公开、有防过拟合的 held-out 题、消融做得认真。但「superhuman」标题超卖——accuracy 与人持平,只有 precision 超人;且论文用的完整 pipeline(Citation Traversal、付费论文库、Grobid)开源仓库里并没有,官方自己承认外部跑不出论文数字。
标题与摘要声称 language agents 达到 superhuman synthesis,matches or exceeds subject matter expert performance。
main.tex 第 182 行自己的统计:precision 85.2% vs 73.8% 显著更高,但 accuracy 66.0% vs 67.7% 与人无显著差异(p=0.66)——即系统更「谨慎准」(21.9% 弃答),综合答对率并未超人。矛盾检测任务上,人类标注者互相 binary 一致率 75.5%,与 ContraCrow 一致率只有 60.4%(p=0.015),作者自己归因于模型 overconfidence。「超人」严格说只在 precision 和综述引用质量两个维度成立。
Data Availability 称「The code necessary to replicate these results ... is included on Github」。
仓库 README 的 FAQ「How come I get different results than your papers?」直接承认:内部工具集与开源版不同,Citation Traversal 尚未进 repo,论文实验依赖的论文访问 API/license 无法公开,论文实验从全文献关键词搜索起步而开源版要用户自备 PDF。issue #635(如何复现 WikiCrow 文章生成)自 2024 年开着,只有 bot 回复。开源版默认解析器也是 pypdf 而非论文用的 Grobid。能复现的是 LitQA2 splits(docs/2024-10-16_litqa2-splits.json5)和 wikicrow/contracrow 配置,不是论文原始 pipeline。
LitQA2 上超过人类专家,且与商业系统(Perplexity、Elicit)拉开大差距。
LitQA2 由同一团队出题并「guided design of PaperQA2」(摘要原话),是既当运动员又当出题人;缓解措施是后补的 101 道题上表现不掉(tab:litqa_before_after),这点做得比多数同类工作诚实。人类基线 n=9、每题 $3-12 激励、约一周时限,样本不大(precision 标准差 ±9.6%)。对商业系统的对比是 2024 年中的快照,不代表现状。
开源工具可用性。
这一半是真扎实:9125 stars,pushed 2026-08-26,Apache-2.0,持续大版本演进(2025-12 转 CalVer,新增 Docling/nemotron-parse 读取器、多模态、Office 文档支持),issue 区活跃且多为功能/bug 而非复现争议。作为工程库的口碑好于作为论文复现包。

与我们方向的关系

对做 autoresearch 的同学,PaperQA2 是文献调研环节的默认起点:pip 装完即可对本地 PDF 目录做带引用的问答,Settings 全部可配(LLM、embedding、RCS 深度、prompt),bundled settings 里 fast/high_quality/contracrow 可以直接当消融基线用。它的 RCS(先按 query 重写摘要再排序)和 agentic 重搜两个设计,消融数字明确,值得在自己的检索 pipeline 里对照实现。

更值得抄的是评测方法而非系统:LitQA2 式「答案只在正文、DOI 判分、允许弃答、分报 precision/accuracy」的出题纪律,加上 held-out 新题防过拟合、真人同题带激励对比——如果我们要声称自己的 agent 在某任务上达到什么水平,这是目前文献综述类工作里最可信的模板。同时注意它的教训:headline 用了 superhuman,细看只有 precision 超人,这种表述方式在评审和传播里都会被挑战。

阅读笔记

读论文数字时注意区分三个系统名:PaperQA2(底座)、WikiCrow(综述)、ContraCrow(矛盾检测)。开源包版本命名混乱:paper-qa>=5 即 PaperQA2,2025-12 起改 CalVer(v2025.12.x)。想复现 LitQA2 评测走 aviary.litqa 包 + docs/2024-10-16_litqa2-splits.json5;WikiCrow 生成的 240 篇文章在公开 GCS bucket(fh-public/wikicrow2)。另有安全 issue #1325:持久化索引用 pickle,反序列化不可信索引可致代码执行,多人共享索引时留意。

材料清单

TeX 源码
已存档:Raw/paperqa2/source/
代码仓库github.com/Future-House/paper-qa
9125★ · 最近推送 2026-08-26
项目主页 / 报告www.futurehouse.org
LitQA2 splitsgithub.com/Future-House/paper-qa/blob/main/docs/2024-10-16_litqa2-splits.json5
论文 train/eval/test 划分的 question ID 与建索引用的 DOI;题目本体在 LAB-Bench 仓库与 futurehouse/aviary-paper-data
WikiCrow 文章全集storage.googleapis.com/fh-public/wikicrow2/
本研究生成的全部 240+ 篇基因综述,GCS 公开 bucket
复现 FAQgithub.com/Future-House/paper-qa#faq
官方说明开源版与论文内部 pipeline 的差异(无 Citation Traversal、无付费论文库接入)

同类条目