← 返回资料站  /  AutoResearch
基准 评测基准 背景

LAB-Bench: Measuring Capabilities of Language Models for Biology Research

LAB-Bench:面向生物学科研实操能力的语言模型基准
一句话FutureHouse 出品的 2,457 道多选题基准,测 LLM 做生物研究实操(文献检索、图表解读、数据库查询、序列操作、克隆方案)的能力;2024 年 7 月时的前沿模型全面大幅落后于 PhD 级人类专家,最难的 Cloning Scenarios 上模型基本靠排除法猜。

这是什么

LAB-Bench(Language Agent Biology Benchmark)针对的问题是:已有的科学基准(MMLU、GPQA 之类)测的是'教科书式'知识问答,而不是科研工作者每天实际在做的事。它把生物研究拆成 8 大类、30 个子任务,共 2,457 道多选题:文献召回与推理(LitQA2)、补充材料查找(SuppQA)、图表解读(FigQA/TableQA)、数据库查询(DbQA)、实验方案排错(ProtocolQA)、DNA/蛋白序列理解与操作(SeqQA),以及 41 道'human-hard'的分子克隆场景题(Cloning Scenarios,训练有素的分子生物学家也要 10-60 分钟一题)。

设计上有几个值得注意的点:每道题都给模型'信息不足、拒绝作答'的选项,因此同时报 accuracy(对/全部)、precision(对/作答)和 coverage(作答率)三个指标;公开 80%、私留 20% 用于监测训练污染,且数据里埋了 canary string;LitQA2/SuppQA/DbQA 这类题被刻意设计成'需要检索工具才能答',用于评测 RAG/agent 系统,而论文自己的基线只测了无工具的裸模型。

主结果图:7 个前沿模型在 8 大类任务上的 accuracy(上)、precision(中)、coverage(下),绿色横线为人类专家基线、虚线为随机水平。可以看到人类几乎全面领先;LitQA2/SuppQA/DbQA 这些需要检索的类别模型 coverage 极低(大量拒答);TableQA 是唯一被 Claude 3.5 Sonnet(绿柱)追平人类的类别。
主结果图:7 个前沿模型在 8 大类任务上的 accuracy(上)、precision(中)、coverage(下),绿色横线为人类专家基线、虚线为随机水平。可以看到人类几乎全面领先;LitQA2/SuppQA/DbQA 这些需要检索的类别模型 coverage 极低(大量拒答);TableQA 是唯一被 Claude 3.5 Sonnet(绿柱)追平人类的类别。

机制与做法

题目怎么造的

两条路线:LitQA2、SuppQA、FigQA、TableQA、ProtocolQA、CloningScenarios 由作者和外聘生物专家手工出题(FigQA/TableQA 用了一个有意思的技巧——让模型先生成 prototype 题,人类基于其中'模型自己都答不对/说胡话'的部分改写,相当于主动挖模型推理的 null space);SeqQA(15 个子任务,如 PCR 引物设计、限制性酶切片段数、ORF 翻译效率)和 DbQA(10 个子任务,对着 Ensembl、miRDB、GTRD 等数据库的特定版本出题)则程序化生成,便于扩量。

评测结果

对 7 个模型(Claude 3.5 Sonnet / 3 Opus / 3 Haiku、GPT-4o / 4-turbo、Gemini 1.5 Pro、Llama-3-70B)做无工具 zero-shot 评测,并招募 PhD 级生物研究者做人类基线(允许用互联网和序列软件,不允许用 AI;覆盖 69% 题目)。人类在几乎所有类别上大幅领先:如 SuppQA 人类 accuracy 约 0.85 vs 最好模型不到 0.15,LitQA2 上多个前沿模型因频繁拒答 accuracy 低于随机。仅有的例外是 TableQA——Claude 3.5 Sonnet 的 precision 反超人类;FigQA 上 3.5 Sonnet 也显著甩开其他模型(其余都接近随机)。

Cloning Scenarios 上所有模型 precision 虽略高于随机,但作者做了开放式作答的对照实验:Claude 3.5 Sonnet 和 GPT-4o 都只有 0.20 accuracy,答对的两题还是靠'猜最常见的酶/抗生素'(BsaI、Ampicillin)蒙的——说明多选题的高于随机主要来自排除干扰项,不是真会做克隆设计。

关键结果

实证核查

扎实数据、代码与论文声称一致:仓库里 8 大类目录和 jsonl 数据齐全,评测 harness 可直接复现论文基线;论文对模型的负面结果写得很实诚(拒答、靠猜),没有夸大。缺点是 2024 年中的结果对今天的模型已明显过时,且官方一直没做 leaderboard。
论文声称 2,400+ 题、8 大类约 30 个子任务,公开 80%、私留 20% 防污染。
GitHub 仓库(Future-House/LAB-Bench)根目录下 8 个类别目录齐全;SeqQA 目录下正好 15 个子任务 jsonl、DbQA 下 10 个,与论文 Table 1 一致;README 明确说明公开集约为全集 80%,并附 canary string(lab-bench:5c41:...)供训练方过滤。
论文声称提供复现其基线所需的全部 prompt 和代码。
仓库含 labbench Python 包(pip install -e labbench)、scripts/score_baselines.py 和 run_baselines.sh,README 给出完整的 agent_fn 接口和运行示例;全部 13 个 issues 里没有复现失败的报告,多为小修(依赖安装、格式)。License 为 CC-BY-SA-4.0,repo 127 stars,2025-09 仍在维护。
声称将持续更新扩展、用私有集监测污染,'expect it to serve as a useful tool going forward'。
部分兑现:repo 到 2025-09 仍有 push,S2 引用 168 次,后续被 FutureHouse 自家 agent(PaperQA2 等)及多篇 AI-for-science 工作用作评测;但 issue #5(要不要做 leaderboard)和 #6(评测 o1)长期 open 未回应,官方没有维护公开榜单,私有集污染监测结果也未见后续公开报告——想知道'现在的模型考多少分'得自己跑。

与我们方向的关系

对课题组做 AI Scientist / autoresearch 评测最有参考价值的是它的任务分解思路:把'科研能力'落到文献检索、supplementary 挖掘、图表读取、数据库版本化查询、序列操作这些可验证的原子操作上,而不是笼统的'科学问答'。其中'accuracy/precision/coverage 三指标 + 显式拒答选项'的设计,以及'公开 80% + 私有 20% 监测污染 + canary string'的发布方式,都可以直接抄。

另一个可借鉴点是 human-hard 题的定位:作者认为 Cloning Scenarios 这类'专家也要 10-60 分钟'的题,高分可能是 AI 助手有实用价值的 necessary and sufficient 条件,并提出用'human proof-of-possibility'替代传统人类基线——这对我们设计超出人类便捷标注能力的评测任务是个现成的方法论。注意它测的是裸模型,LitQA2/DbQA 等类别天然为 agent+工具设计,拿来做 agent 系统的领域对照基准很合适(FutureHouse 自己就用它评 PaperQA2)。

阅读笔记

结果是 2024-07 的,模型阵容停留在 Claude 3.5 Sonnet / GPT-4o 一代,数字不能代表现状;官方无 leaderboard,新模型要自己跑 run_baselines.sh。LitQA2 后来常被单独拿出来用(PaperQA2 论文里就是),引用时注意区分'LAB-Bench 全集'和'LitQA2 子集'。

材料清单

TeX 源码
已存档:Raw/lab-bench/source/
代码仓库github.com/Future-House/LAB-Bench
127★ · 最近推送 2025-09-27

同类条目