基准
评测基准
背景
BixBench: a Comprehensive Benchmark for LLM-based Agents in Computational Biology
BixBench:生信数据分析 agent 基准
Ludovico Mitchener, Jon M Laurent, Alex Andonian, et al. · FutureHouse · arXiv · 2025-02 · 被引 97
一句话FutureHouse 用真实生信分析笔记本构建的 agent 基准:61 个分析场景(capsule)、205 个开放式问题,要求 agent 在 Jupyter 环境里做多步探索性数据分析;最强的 Claude 3.5 Sonnet 开放答案模式仅 21% 准确率,MCQ 模式只比随机好一点。
这是什么
BixBench 是 FutureHouse(LAB-Bench、PaperQA 同一团队)与 ScienceMachine 合作做的生物信息学 agent 基准,2025 年 2 月底放出。此前的生医评测(LAB-Bench 等)多是知识问答或单步任务,BixBench 的定位是测'能不能真的做完一整个分析':给 agent 一份原始数据和研究问题,它需要在带常用生信包的 Docker/Jupyter 环境里写 Python/R/Bash 代码、跑完多步分析,再基于分析结果回答问题。
数据的核心单元叫 analysis capsule:由合同制的生信分析师(复现已发表分析或做 de novo 分析)产出,包含 hypothesis、输入数据、完整分析 notebook、结果描述等,并经其他专家评审。问题由 Claude 3.5 Sonnet 从 capsule 草拟 MCQ、再经人工专家逐题审改和去重,最终 205 题覆盖 61 个 capsule(平均每个 3.8 题)。问题设计目标是'只有真正做完分析才答得出来',同时提供开放答案和 MCQ(带/不带 refusal 选项)两种评测格式。
主结果:GPT-4o(绿)与 Claude 3.5 Sonnet(橙)在三种评测格式下的准确率(Wilson 95% CI)。虚线为随机猜基线,实线为不给数据的纯 recall 基线。开放答案模式两模型仅 15%/21% 但远高于 recall 基线(~3%);MCQ 带 refusal 时与随机(20%)相当,去掉 refusal 才升到 33-40%——提升部分被作者归因于 recall 而非真实分析。机制与做法
评测设置
官方 agent 框架(基于自家 aviary)给模型三个操作 notebook 的工具,在预装生信包的 Docker 环境里迭代写代码;每个 capsule 跑 5 个并行 replica,两个模型(GPT-4o、Claude 3.5 Sonnet)× 有/无图像输入,共 1,220 条 trajectory。开放答案由另一个 LLM 对照 ground truth 判分;MCQ 由第二个 LLM 读 agent 的 notebook 和回答后选选项,并做 majority voting。另设纯 recall 基线(不给数据直接问)来校准数据泄漏。
主要结果
开放答案模式:Claude 3.5 Sonnet 21%、GPT-4o 15%(v1 论文报 17%,v1.5 更新为 21%)。MCQ 带 refusal 选项时两个模型都在 20-25%,与随机(20%)相当;去掉 refusal 后升到 33-40%(随机 25%),作者认为这部分提升更多来自 recall 而非真实分析。图像输入的有无影响不大。
关键结果
- 最终数据集:61 个真实分析 capsule、205 个问题(v1 论文写 53 个场景/近 300 题,v1.5 经专家复审去重后收敛到这个规模)
- 开放答案准确率:Claude 3.5 Sonnet 21%,GPT-4o 15%;纯 recall 基线仅约 3%,说明题目确实依赖做分析
- MCQ 带 refusal 选项时表现与随机猜(20%)无显著差异;去掉 refusal 后 Claude 达 ~40%(随机 25%),疑似靠 recall 而非分析
- 5 个并行 replica 的 majority voting 提升有限;有无图像(看 plot)对准确率影响很小
- 评测成本不低:官方脚本全量 agentic 评测需 24-48 小时、5 replica × 多配置的 API 开销
实证核查
扎实数据、代码、原始 trajectory 全开放,仓库持续维护到 2025-10 并被 OpenCompass 集成;数字随 v1.5 修订(300 题→205 题、17%→21%)在论文和 README 中如实更新。个别题目质量有第三方 issue 质疑,但属于可接受的瑕疵。
v1 摘要称'50+ 场景、近 300 个开放式问题',最强模型 17% 准确率、MCQ 不比随机好。
v1.5 修订后为 61 capsule / 205 题(经专家复审+LLM 去重收敛,source/main.tex L236、L287),开放答案最好成绩更新为 Claude 3.5 Sonnet 21%、MCQ '略高于随机'。README 和更新版论文都如实改了口径,不是隐瞒,但引用 v1 数字的二手资料(包括本站收录理由里的'53 场景/~300 题/17%')已过时。
代码和评测框架开源、结果可复现。
GitHub 仓库(Apache-2.0,141 stars,最后 push 2025-10)提供 run_zeroshot.sh / run_agentic.sh 一键脚本、Docker 镜像 futurehouse/bixbench:aviary-notebook-env,以及原始 2,120 条 trajectory 的 CSV 下载(storage.googleapis.com/bixbench-results/)。issue #37 显示已被 OpenCompass 集成,#29(Docker 镜像缺 linux/amd64)等复现问题均已修复关闭。HF 数据集为 gated,需登录才能下载。
问题经多轮专家审校,'只有完成有效分析才能作答'。
第三方 issue #35 给出具体反例:capsule bix-22 中数个问题的过滤条件(如'基因长度<5000bp')在对应 notebook 里根本没出现,答案无法从 capsule 直接得出;该 issue 已关闭,说明质检并非无死角,用它评测时个别题目的 ground truth 可疑。
与我们方向的关系
对 autoresearch 方向,BixBench 是'开放式科学数据分析'类 agent 基准的代表:任务来自真实分析而非合成,评测的是长程 EDA 轨迹而非单步问答,且用低到接近随机的分数说明 2025 初的前沿模型离自动生信分析还很远。capsule 的构造流程(专家产出 notebook → LLM 出题 → 专家审题去重)和 refusal 选项/纯 recall 基线这两个防泄漏、防瞎猜的设计,做自建评测时可以直接借鉴。也要注意它暴露的坑:LLM 出题+人审仍会漏掉'题目与 notebook 不符'的坏题(issue #35),以及 MCQ 格式会被 recall 撑高分数。
阅读笔记
同团队前作 LAB-Bench 是知识问答型,BixBench 是其 agent 化升级。只测了 GPT-4o 和 Claude 3.5 Sonnet 两个模型、没有人类基线(作者承认是未做项);后续不少论文把 BixBench 当靶子刷分,引用已近百。
材料清单
TeX 源码已存档:Raw/bixbench/source/
同类条目