← 返回资料站  /  AutoResearch
论文 文献调研 ★ 必读

OpenScholar: Synthesizing Scientific Literature with Retrieval-augmented LMs

OpenScholar:检索增强的开源文献综合系统
一句话Ai2/UW 的全开源文献问答系统:4500 万篇开放论文的检索库 + 自训练 retriever/reranker + 自反馈迭代生成,8B 模型在自建 ScholarQABench 上 correctness 超 GPT-4o 5%、超 PaperQA2 7%,引用几乎零幻觉(GPT-4o 无检索时 78-95% 引用是编造的);2026 年被 Nature 正式接收。

这是什么

文献综合(literature synthesis)是让 LLM 回答'某方向都有哪些方法、各自如何比较'这类需要跨多篇论文汇总并给出准确引用的问题。直接问 GPT-4o 这类问题的致命伤是引用幻觉:本文测得 GPT-4o 在无检索时编造的参考文献占 78.7%(CS)到 94.8%(biomedicine),Llama 3.1 更高达 92-98%。OpenScholar 的思路是把整套 RAG 管线专门为科学文献重造一遍:专用数据库、专用检索器、专用生成模型,全部开源。

系统由三部分组成:OpenScholar-DataStore(peS2o 语料,45M 篇开放获取论文切成 234M 个 250 词 passage 并全部建好 embedding,自称是最大的开源科学文献检索库)、在科学语料上训练的 bi-encoder retriever(110M)+ cross-encoder reranker(340M)、以及生成模型(可以套 GPT-4o,也可以用他们训练的 Llama-3.1-8B 版本 OS-8B)。配套发布了 ScholarQABench:2,967 个专家写的查询 + 208 个长式答案,覆盖 CS、物理、神经科学、生物医学四个领域。

这项工作 2024 年 11 月放出 arXiv,2026 年被 Nature 接收(s41586-025-10072-4),是文献调研 agent 方向少有的经过顶刊同行评审的系统。它后来演化为 Ai2 的 Asta 平台的 report generation 能力,ScholarQA-CS 基准也演化为 AstaBench 里的 ScholarQA-CS2;检索索引后来通过 Semantic Scholar API 公开服务。

全系统总览:上半是推理管线(OSDS 45M 论文 → retriever/reranker → 初稿 → 自反馈 + 追加检索 → 终稿)和用管线自举数据训练 8B 模型;下半是 ScholarQABench 的构成与主结果——左下自动评测中 OS-8B/OS-GPT4o 的 accuracy(51/57)与 citation(43/37)全面超过 PaperQA2、Perplexity、GPT-4o,右下人评中模型答案对专家答案的胜率。一张图基本讲完整篇论文。
全系统总览:上半是推理管线(OSDS 45M 论文 → retriever/reranker → 初稿 → 自反馈 + 追加检索 → 终稿)和用管线自举数据训练 8B 模型;下半是 ScholarQABench 的构成与主结果——左下自动评测中 OS-8B/OS-GPT4o 的 accuracy(51/57)与 citation(43/37)全面超过 PaperQA2、Perplexity、GPT-4o,右下人评中模型答案对专家答案的胜率。一张图基本讲完整篇论文。

机制与做法

三路检索 + 重排

初始检索走三路:(1) 自训练 bi-encoder(在 peS2o 上对 Contriever 继续预训练)从 datastore 里取 top-100 passage;(2) 用 LM 从 query 生成关键词,走 Semantic Scholar Search API 按引用数取 top-10 论文摘要——这是为了绕开 S2 API 不擅长长问题式查询的限制;(3) You.com API 限定 arXiv/PubMed 做 web 搜索取 top-10,开放获取的抓全文。

候选池上百到上千条后,用 cross-encoder reranker 精排。reranker 是拿 Llama 3 70B 对合成 query-passage 对打 1-5 分(4/5 为正、1/2 为负)造训练数据,微调 BGE-reranker 得到的。精排时还有 meta-filtering:每篇论文最多 3 个 passage、把归一化引用数加进相关性分。消融显示 reranker 是最关键的组件:去掉后 OS-8B 在 ScholarQA-CS 的 citation F1 从 47.9 掉到 28.2。

8B 模型训练数据配比:Tulu 通用指令数据占 53.8%,科学域数据(fact verification 15.4%、single-paper QA 10.8%、multi-paper QA 9.1%、SciRIFF 6.4%、feedback 2.5%、editing 2.0%)合计约一半。注意真正的管线自举数据(multi-paper QA + feedback + editing)只占 ~14%,却是能力的关键来源。
8B 模型训练数据配比:Tulu 通用指令数据占 53.8%,科学域数据(fact verification 15.4%、single-paper QA 10.8%、multi-paper QA 9.1%、SciRIFF 6.4%、feedback 2.5%、editing 2.0%)合计约一半。注意真正的管线自举数据(multi-paper QA + feedback + editing)只占 ~14%,却是能力的关键来源。

自反馈迭代生成(self-feedback inference)

生成不是一步到位:LM 先产出初稿 y0,然后对自己的初稿生成至多 3 条自然语言 feedback(如'只覆盖了 QA 任务的结果,补充其他任务类型')。若 feedback 指出内容缺失,LM 同时生成新的检索 query,触发追加检索,再逐条吸收 feedback 更新答案。最后一步是 citation verification:检查每个需要引用支撑的陈述,缺引用的做事后插入。

有意思的消融结果:self-feedback 对 GPT-4o 帮助明显(去掉后 ScholarQA-CS correctness 从 57.7 掉到 55.1、citation F1 从 39.5 掉到 31.0),但对训练过的 8B 模型收益很小甚至持平——小模型的能力主要来自训练而不是推理时循环。

专家人评界面实例:左侧是带 inline citation 的模型答案(问题是 32K+ 长上下文的 sequence parallelism 训练方法对比),右侧是可展开的参考文献,下方是 organization/coverage 等 1-5 分 rubric 打分。可以直观感受系统输出形态和人评的严谨程度。
专家人评界面实例:左侧是带 inline citation 的模型答案(问题是 32K+ 长上下文的 sequence parallelism 训练方法对比),右侧是可展开的参考文献,下方是 organization/coverage 等 1-5 分 rubric 打分。可以直观感受系统输出形态和人评的严谨程度。

用推理管线自产训练数据

8B 模型的训练数据是系统自举出来的:从 peS2o 采样高引论文摘要,让 Llama 3.1 70B 生成文献调研式问题,再跑完整 OpenScholar 管线产出带引用的答案,连同中间产物(feedback、初稿)一起做成三类训练样本:答案生成、feedback 生成、feedback 吸收。

之后两步过滤:pairwise filtering(比较终稿 yT 与初稿 y0 留更好的——约 20% 的情况初稿反而更好,因为多轮迭代会过度编辑、变冗余)和 rubric filtering(organization 与 factual precision/citation accuracy 双维度打分,两项都 ≥4.5 才保留)。最终 13k 领域数据混入 Tulu 通用指令数据和 SciRIFF,保持科学:通用约 1:1(实际配比 Tulu 占 53.8%),共约 130k 条训练 Llama 3.1 8B 两个 epoch(8xA100)。

评测与人评

ScholarQABench 的单文任务复用 SciFact/PubMedQA/QASA,多文任务新标注:ScholarQA-CS 是 100 个问题、平均每题 4.4 条专家 rubric,correctness 按 rubric 打分(通用标准 40% + 标注标准 60%);citation F1 检查每条陈述是否被所引 passage 支撑。

人评规模不大但设计认真:16 位专家(博士生/博后/教授,时薪约 25-40 美元/任务)在 108 个问题上做细粒度打分 + pairwise 比较,标注者不评自己写的答案,inter-annotator agreement 0.68。结果 OS-GPT4o 对专家答案胜率 70%、OS-8B 50.8%,而裸 GPT-4o 只有 31.9%;胜因主要是 coverage(29% 的偏好解释提到)。

关键结果

实证核查

扎实开放程度是同类工作里的天花板:模型、13k 训练数据、234M passage 的 embedding 索引全在 HF 上可下载,论文 2026 年被 Nature 接收,主要声称经受住了同行评审。水分点在 PaperQA2 对比是有折扣的自行复现、人评存在长度混淆(作者部分补救),以及本地复现的工程门槛远比 README 看起来高。
论文声称 open-source all of our code, models, datastore, data。
基本属实且是同类最全:HF 上可查 Llama-3.1_OpenScholar-8B、OpenScholar_Reranker、OS_Train_Data(13k)、OpenScholar-DataStore-V2/V3(含全部 passage/embedding/index,repo issue #6 中作者 RulinShao 给出分 shard 链接);GitHub Apache-2.0,1.6k stars。瑕疵:README 里的离线检索结果 Google Drive 链接已失效(issue #20,open,至今未修),训练数据链接曾 404(issue #2,已修)。
OpenScholar-8B 在 correctness 上超 PaperQA2 7%。
对比有折扣:论文脚注自认 PaperQA2 未公开检索语料,他们是用自家检索管线下载 PDF 喂给 PaperQA2 复现的,且无法访问 license-protected 论文,'may limit the effectiveness of our replication'。而且主表里 PaperQA2 的 citation F1(48.0)其实略高于 OS-8B(47.9)——赢的是 correctness(45.6 vs 51.1)和成本,不是引用质量。FutureHouse 官方页面仍称 PaperQA2 'superhuman',双方基准互不重叠,这场对比没有中立裁判。
在人评中专家 51%/70% 的情况下偏好模型答案胜过专家手写答案。
数字与论文附表一致(OS-8B 50.8% win / 12.3% tie),但规模小(16 位标注者、108 题)且模型答案长 2.0-2.4 倍;作者做了 50 题的长度控制实验(压缩到 ~333 词后 75% 胜或平)算是认真对待了这个混淆。标注者的自由解释也指出模型引用'occasionally outdated or less relevant'。结论方向可信,幅度别全信。
系统可复现、可本地部署。
组件全开源属实,但工程门槛高:234M embedding 的索引需要数百 GB 内存,issue #6 中有用户在 120GB RAM 机器上单 shard 加载 4-5 分钟、单 query 检索 300 秒;issue #5(14 条评论)多位用户卡在输入格式和 S2 API key 上(S2 曾暂停发新 key)。也有用户(tian969)确认在单张 H100 上跑通了 RAG+feedback 全管线。后来 Ai2 把检索索引做成了 Semantic Scholar API 的公开服务,降低了使用门槛(见 allenai.org/blog/nature-openscilm)。
arXiv 版声称 outperforms GPT-4o by 5%(摘要)。
这一系列声称经受住了最严格的一轮外部核查:论文 2026 年被 Nature 正式接收(s41586-025-10072-4),Nature news 也做了报道('Open-source AI tool beats giant LLMs in literature reviews',d41586-026-00347-9)。注意实验用的 datastore 是 peS2o v2(论文截至 2023 年 1 月),v3 才到 2024 年 10 月,且只含开放获取论文——闭源期刊文献(生物医学大头)天然缺失,这是所有基于 S2ORC 的系统的共同盲区。

与我们方向的关系

对做文献调研 agent 的组来说这是目前最完整的开源基础设施:45M 论文的 datastore(embedding 已建好)、训好的科学域 retriever/reranker、13k 高质量训练数据、以及 ScholarQABench 评测集,每一件都可以单独拆出来用。特别是想自己训领域 RAG 模型的话,'用推理管线自举训练数据 + pairwise/rubric 双重过滤'这套流程可以直接照搬,13k 数据就见效说明门槛不高。

两个反直觉结论值得记住:(1) reranker 比 self-feedback 循环重要得多,推理时的花哨迭代对训练过的小模型收益趋近于零——算力预算应该优先给检索质量和训练,而不是 agentic loop;(2) 论文评测里'战胜人类专家'的胜率主要由 coverage 驱动且受答案长度混淆影响,自己设计人评时要做长度控制。另外它已演化为 Asta/AstaBench 生态,后续跟进应看 DR Tulu 和 ScholarQA-CS2。

阅读笔记

复现提示:别按 README 从头建索引(需要数百 GB RAM),优先用 HF 上的分 shard 索引或直接走 Semantic Scholar API 的公开检索服务;README 的 Google Drive 离线检索结果已失效。评测用的是 peS2o v2(2023-01 截止),对比 2024 年后的文献问题会吃亏。源码目录里是 ICLR 2025 投稿格式的 tex,最终去了 Nature。

材料清单

TeX 源码
已存档:Raw/openscholar/source/
代码仓库github.com/AkariAsai/OpenScholar
1586★ · 最近推送 2025-08-13
项目主页 / 报告openscholar.allen.ai
Nature 正式版www.nature.com/articles/s41586-025-10072-4
2026 年接收的同行评审版本
ScholarQABenchgithub.com/AkariAsai/ScholarQABench
2,967 查询 + 208 长式答案的评测集,可单独用于评测自己的系统
DataStore V3huggingface.co/datasets/OpenSciLM/OpenScholar-DataStore-V3
45M 论文 / 234M passage 的文本 + embedding + index,分 shard 可下载
训练数据huggingface.co/datasets/OpenScholar/OS_Train_Data
13k 管线自举的指令数据
专家评测代码与结果github.com/AkariAsai/OpenScholar_ExpertEval
人评界面与原始标注
Ai2 后续(Asta)allenai.org/blog/nature-openscilm
OpenScholar → Asta report generation / AstaBench 的演化说明

同类条目