基准
评测基准
AstaBench: Rigorous Benchmarking of AI Agents with a Scientific Research Suite
AstaBench:科研 agent 的全流程严格评测套件
Jonathan Bragg, Mike D'Arcy, Nishant Balepur, et al. (Ai2, 39 authors) · Ai2 · arXiv · 2025-10 · 被引 34
一句话Ai2 把文献检索、代码执行、数据分析、端到端发现等 11 个 benchmark、2400+ 题整合成统一评测套件,配标准工具环境、成本核算和公开排行榜;对 57 个 agent 的评测显示:文献理解已到 ~85%,但数据驱动发现最高 34%、端到端实验全步骤完成率最高只有 5%。
这是什么
科研 agent(deep research 系统、AI Scientist 一类)层出不穷,但评测各自为政:工具不可复现、不报成本、没有统一接口、也缺乏认真调过的基线,导致'谁更强'基本说不清。AstaBench 是 Ai2 给出的系统性回应——先定义一套严格评测原则(可控比较、成本入账、标准接口、贴近真实用途、基线充分),再据此构建整个套件。
套件覆盖科研全流程四大类:文献理解(PaperFindingBench、ScholarQABench2、LitQA2-FT、ArxivDIGESTables)、代码与执行(CORE-Bench-Hard、DS-1000、SUPER-Expert)、数据分析(DiscoveryBench)、端到端发现(E2E-Bench 及 Hard 版),共 11 个 benchmark、2400+ 题,其中不少题目来自真实用户对已部署 Asta agent 的请求。整个套件跑在 InspectAI 框架上,配套 agent-eval 工具包和 HuggingFace 排行榜。
论文本体是 39 人的大工程,2025-10 挂 arXiv,已被 ICLR 2026 接收;随套件发布了 9 类 science-optimized 的 Asta agent 和大量基线(共 22 类 57 个 agent 的完整评测),排行榜按 accuracy × cost 双轴画 Pareto 前沿。它正在扮演科研 agent 领域'HELM 式'公共基础设施的角色。
AstaBench 总体架构:agent(LLM + 标准工具)与套件中的每个任务交互,任务用 rubric + LLM judge 评分,最终产出 accuracy × compute cost 双轴结果——排行榜按这两个维度画 Pareto 前沿,而不是只报单一分数。机制与做法
标准工具环境:可复现的文献搜索 + 沙箱
核心卖点是第一个'生产级、可复现'的科研环境。文献工具走 Asta MCP 服务(snippet_search、search_papers_by_relevance、get_citations 等 8 个工具),关键设计是支持按日期截断检索结果——把语料冻结在 benchmark 构建日之前,新发表的论文不会污染评测,这解决了文献类评测随时间漂移的老问题。
计算类任务提供 Docker 沙箱 + 有状态的 Jupyter 工具(python_session,变量跨调用保持,支持 shell magic),沙箱内代码还能回调宿主环境的工具(支持 CodeAct 式纯代码 agent)。任务自带的工具通过 InspectAI 的 state.tools 下发,agent 用不用标准工具会被记入 'tooling' 分类(Standard / Custom Interface / Custom),连同 openness(开源开权重→纯闭源 UI)一起在排行榜上标注,把混淆变量摆到明面上。
官方基线 Asta Paper Finder 的检索流程:BroadSearch 后按 dense 检索、snowball、引用追踪、S2 关键词、LLM suggest 多路取候选,MAB 自适应决定加载量,LLM 做相关性判断后按年份/venue 过滤再排序,可迭代或提前短路。它在 PaperFindingBench 上大幅领先 ReAct,是套件中'专用 agent 仍有价值'的代表案例。成本核算:accuracy-cost 双轴排行
agent-eval 工具包基于 Inspect 记录的 token 用量,用一份冻结的 litellm 价格快照换算成美元(含 cache 折扣、不含 batch 折扣),保证不同时间提交的评测在同一价格体系下可比;价格快照更新时全部重算。排行榜画 score vs. cost(log 轴)的 Pareto 前沿,直接回答'给定预算下选哪个 agent'。
这个设计立刻产出反直觉结论:用便宜模型不一定省钱——gemini-flash、llama-scout 的 per-token 价格比 o3/sonnet 低 3-25 倍,但弱模型步数更多、爱死循环,套上 ReAct 后总成本反而翻倍,分数还更低。
评分与基线
开放式任务(文献综述、端到端发现)用 rubric + LLM judge 评分,所以跑评测本身就需要 OpenAI/Anthropic/Google 三家的 key;E2E 任务把实验拆成步骤级 rubric 逐项打分。客观任务(DS-1000、LitQA2 等)用程序化判分。
基线覆盖从裸 ReAct 到 9 类专用 Asta agent(如多阶段检索的 Asta Paper Finder:BroadSearch 之后按 dense/snowball/citation/keyword/LLM-suggest 多路取候选、MAB 自适应加载、LLM 相关性判断、再过滤排序)。全部基线代码在 allenai/agent-baselines 开源。
关键结果
- 总榜最强是 Ai2 自家的 Asta v0(53.0%),比第二名 ReAct + GPT-5(44.0%)高约 9 个百分点,代价是更高的工程和推理成本;开源 + 开放权重的最好成绩只有 11.1%(smolagents + Llama-4-Scout),开闭差距巨大。
- 性价比之王是 ReAct + gpt-5-mini:32% 的总分、每题约 $0.04,比最强 agent 便宜一个数量级以上,分数只差 21 个百分点。
- 文献理解接近可用:ScholarQA、Elicit、SciSpace 在 ScholarQABench2 上都 ≥85%,主要靠引用子分数拉动;但商业科研 agent(FutureHouse Falcon、OpenAI Deep Research)只在文献类任务上强,无法覆盖全流程。
- 代码执行是重灾区:SUPER-Expert 上除 ReAct + GPT-5(41%)和 gpt-5-mini(37%)外,其余全部低于 25%;数据驱动发现(DiscoveryBench)最高仅 34%。
- 端到端发现基本没解决:单步平均完成度能到 ~70%,但一个实验约 10 步连乘后,全步骤完成率最高只有 5%。
- GPT-5 的增益高度不可预测:对 ReAct 大幅提升(SUPER +24.8%、LitQA2-Search +25.3%、E2E-Hard +21.1%),但让 ScholarQA、DataVoyager、smolagents 等多个专用 workflow agent 变差——作者猜测 GPT-5 被调优得偏向 ReAct 式工作流,若趋势持续,手工设计专用 workflow 的价值可能递减。
实证核查
扎实代码、数据、排行榜、基线全部真实可查,repo 持续维护并接收外部提交,ICLR 2026 接收;主要保留意见是'可复现'依赖 Ai2 托管服务、以及自家 agent 登顶自家榜单的利益关联。
论文声称提供'第一个可控、可复现评测的生产级科研环境'。
复现性有边界:文献工具依赖 Ai2 托管的 Asta MCP 服务(asta-tools.allen.ai),必须申请 ASTA_TOOL_KEY,默认限速约 4 req/s,README Troubleshooting 专门写了 429/504 报错处理;issue #155(open)就是用户在问 key 怎么拿。日期截断保证了语料可复现,但服务本身不可自托管,评测能力受制于 Ai2 的服务可用性。
'2400+ 题、11 个 benchmark 覆盖科研全流程'。
README 确实列出 11 个任务、4 大类,与论文一致;但其中约 7 个是对已有 benchmark 的改造收编(CORE-Bench、DS-1000、SUPER、DiscoveryBench、LitQA2 等),原创部分主要是 PaperFindingBench、ScholarQABench2、ArxivDIGESTables-Clean 和 E2E-Bench。数据在 HF(allenai/asta-bench)以 gated license 发布,需接受协议后用 HF_TOKEN 下载。
统一成本核算、排行榜公平可比。
机制真实存在且在运转:成本用冻结的 litellm 价格快照计算,repo 里有多次'bump litellm + rescore submissions'的 PR(#154、#147、#142 等,快照更新后全量重算);排行榜在 HF Spaces 上线并接收外部提交(issue #138 是外部团队 evoScientist 询问提交状态)。issue #130 曾要求澄清成本如何计入评分,说明规则理解上有过摩擦。repo 2026-08 仍在活跃更新(v0.4.x)。
Asta v0 以 53.0% 居总榜第一。
出题方自家 agent 登顶自家 benchmark,存在天然利益关联——Asta agent 针对这些任务和工具做过优化(论文自己也承认其开发成本'显著更高')。缓解因素:全部基线和 Asta agent 代码在 allenai/agent-baselines 开源,榜单开放外部提交,结论可被挑战。
评测严格、客观。
开放式任务(SQA、E2E)依赖 rubric + LLM judge,跑分需要同时持有 OpenAI/Anthropic/Google 三家 API key(README Environment variables 节);judge 模型本身是一个未完全消解的混淆变量。另外全套件复现门槛不低:官方内部实验用 128GB 内存 + 16 vCPU,SUPER/E2E 单题沙箱可吃 20-30GB 内存。
与我们方向的关系
对做科研 agent 的组来说,这基本是当前最完整的'统一考场':如果要声称自己的 agent 在科研辅助上有进步,在 AstaBench 上跑分并提交排行榜是成本最低的可信度来源。工程上值得直接借鉴的点:日期截断的文献检索(解决评测时间漂移)、冻结价格快照的成本核算、openness × tooling 双维度申报,这套方法论可以移植到我们自己构建的任何 agent 评测里。
结果层面的启示:文献理解类任务红利已薄(ReAct 基线就不差),真正的空白在代码执行、数据分析和端到端发现(最高分分别 41%、34%、5%),这是投入产出比最高的方向;另外'GPT-5 让专用 workflow agent 变差'这一观察值得跟踪——如果模型持续向 ReAct 式工作流对齐,精心设计的多阶段 pipeline 可能是贬值资产。
阅读笔记
跑全套件门槛较高:需要 ASTA_TOOL_KEY(向 Ai2 申请)、HF gated 数据集授权、三家 LLM key,内存建议 128GB(SUPER/E2E 单题 20-30GB)。README 的 Parallelism 一节写得很细(--max-samples≤CPU 核数、INSPECT_DOCKER_CLI_CONCURRENCY≥2N),自定义 solver 用 asyncio.to_thread 容易死锁。评测框架绑定 InspectAI,solver 与 scorer 的 inspect_ai 版本可解耦(scripts/eval_then_score.sh)。
材料清单
TeX 源码已存档:Raw/astabench/source/
同类条目