← 返回资料站  /  AutoResearch
基准 评测基准

AstaBench: Rigorous Benchmarking of AI Agents with a Scientific Research Suite

AstaBench:科研 agent 的全流程严格评测套件
一句话Ai2 把文献检索、代码执行、数据分析、端到端发现等 11 个 benchmark、2400+ 题整合成统一评测套件,配标准工具环境、成本核算和公开排行榜;对 57 个 agent 的评测显示:文献理解已到 ~85%,但数据驱动发现最高 34%、端到端实验全步骤完成率最高只有 5%。

这是什么

科研 agent(deep research 系统、AI Scientist 一类)层出不穷,但评测各自为政:工具不可复现、不报成本、没有统一接口、也缺乏认真调过的基线,导致'谁更强'基本说不清。AstaBench 是 Ai2 给出的系统性回应——先定义一套严格评测原则(可控比较、成本入账、标准接口、贴近真实用途、基线充分),再据此构建整个套件。

套件覆盖科研全流程四大类:文献理解(PaperFindingBench、ScholarQABench2、LitQA2-FT、ArxivDIGESTables)、代码与执行(CORE-Bench-Hard、DS-1000、SUPER-Expert)、数据分析(DiscoveryBench)、端到端发现(E2E-Bench 及 Hard 版),共 11 个 benchmark、2400+ 题,其中不少题目来自真实用户对已部署 Asta agent 的请求。整个套件跑在 InspectAI 框架上,配套 agent-eval 工具包和 HuggingFace 排行榜。

论文本体是 39 人的大工程,2025-10 挂 arXiv,已被 ICLR 2026 接收;随套件发布了 9 类 science-optimized 的 Asta agent 和大量基线(共 22 类 57 个 agent 的完整评测),排行榜按 accuracy × cost 双轴画 Pareto 前沿。它正在扮演科研 agent 领域'HELM 式'公共基础设施的角色。

AstaBench 总体架构:agent(LLM + 标准工具)与套件中的每个任务交互,任务用 rubric + LLM judge 评分,最终产出 accuracy × compute cost 双轴结果——排行榜按这两个维度画 Pareto 前沿,而不是只报单一分数。
AstaBench 总体架构:agent(LLM + 标准工具)与套件中的每个任务交互,任务用 rubric + LLM judge 评分,最终产出 accuracy × compute cost 双轴结果——排行榜按这两个维度画 Pareto 前沿,而不是只报单一分数。

机制与做法

标准工具环境:可复现的文献搜索 + 沙箱

核心卖点是第一个'生产级、可复现'的科研环境。文献工具走 Asta MCP 服务(snippet_search、search_papers_by_relevance、get_citations 等 8 个工具),关键设计是支持按日期截断检索结果——把语料冻结在 benchmark 构建日之前,新发表的论文不会污染评测,这解决了文献类评测随时间漂移的老问题。

计算类任务提供 Docker 沙箱 + 有状态的 Jupyter 工具(python_session,变量跨调用保持,支持 shell magic),沙箱内代码还能回调宿主环境的工具(支持 CodeAct 式纯代码 agent)。任务自带的工具通过 InspectAI 的 state.tools 下发,agent 用不用标准工具会被记入 'tooling' 分类(Standard / Custom Interface / Custom),连同 openness(开源开权重→纯闭源 UI)一起在排行榜上标注,把混淆变量摆到明面上。

官方基线 Asta Paper Finder 的检索流程:BroadSearch 后按 dense 检索、snowball、引用追踪、S2 关键词、LLM suggest 多路取候选,MAB 自适应决定加载量,LLM 做相关性判断后按年份/venue 过滤再排序,可迭代或提前短路。它在 PaperFindingBench 上大幅领先 ReAct,是套件中'专用 agent 仍有价值'的代表案例。
官方基线 Asta Paper Finder 的检索流程:BroadSearch 后按 dense 检索、snowball、引用追踪、S2 关键词、LLM suggest 多路取候选,MAB 自适应决定加载量,LLM 做相关性判断后按年份/venue 过滤再排序,可迭代或提前短路。它在 PaperFindingBench 上大幅领先 ReAct,是套件中'专用 agent 仍有价值'的代表案例。

成本核算:accuracy-cost 双轴排行

agent-eval 工具包基于 Inspect 记录的 token 用量,用一份冻结的 litellm 价格快照换算成美元(含 cache 折扣、不含 batch 折扣),保证不同时间提交的评测在同一价格体系下可比;价格快照更新时全部重算。排行榜画 score vs. cost(log 轴)的 Pareto 前沿,直接回答'给定预算下选哪个 agent'。

这个设计立刻产出反直觉结论:用便宜模型不一定省钱——gemini-flash、llama-scout 的 per-token 价格比 o3/sonnet 低 3-25 倍,但弱模型步数更多、爱死循环,套上 ReAct 后总成本反而翻倍,分数还更低。

评分与基线

开放式任务(文献综述、端到端发现)用 rubric + LLM judge 评分,所以跑评测本身就需要 OpenAI/Anthropic/Google 三家的 key;E2E 任务把实验拆成步骤级 rubric 逐项打分。客观任务(DS-1000、LitQA2 等)用程序化判分。

基线覆盖从裸 ReAct 到 9 类专用 Asta agent(如多阶段检索的 Asta Paper Finder:BroadSearch 之后按 dense/snowball/citation/keyword/LLM-suggest 多路取候选、MAB 自适应加载、LLM 相关性判断、再过滤排序)。全部基线代码在 allenai/agent-baselines 开源。

关键结果

实证核查

扎实代码、数据、排行榜、基线全部真实可查,repo 持续维护并接收外部提交,ICLR 2026 接收;主要保留意见是'可复现'依赖 Ai2 托管服务、以及自家 agent 登顶自家榜单的利益关联。
论文声称提供'第一个可控、可复现评测的生产级科研环境'。
复现性有边界:文献工具依赖 Ai2 托管的 Asta MCP 服务(asta-tools.allen.ai),必须申请 ASTA_TOOL_KEY,默认限速约 4 req/s,README Troubleshooting 专门写了 429/504 报错处理;issue #155(open)就是用户在问 key 怎么拿。日期截断保证了语料可复现,但服务本身不可自托管,评测能力受制于 Ai2 的服务可用性。
'2400+ 题、11 个 benchmark 覆盖科研全流程'。
README 确实列出 11 个任务、4 大类,与论文一致;但其中约 7 个是对已有 benchmark 的改造收编(CORE-Bench、DS-1000、SUPER、DiscoveryBench、LitQA2 等),原创部分主要是 PaperFindingBench、ScholarQABench2、ArxivDIGESTables-Clean 和 E2E-Bench。数据在 HF(allenai/asta-bench)以 gated license 发布,需接受协议后用 HF_TOKEN 下载。
统一成本核算、排行榜公平可比。
机制真实存在且在运转:成本用冻结的 litellm 价格快照计算,repo 里有多次'bump litellm + rescore submissions'的 PR(#154、#147、#142 等,快照更新后全量重算);排行榜在 HF Spaces 上线并接收外部提交(issue #138 是外部团队 evoScientist 询问提交状态)。issue #130 曾要求澄清成本如何计入评分,说明规则理解上有过摩擦。repo 2026-08 仍在活跃更新(v0.4.x)。
Asta v0 以 53.0% 居总榜第一。
出题方自家 agent 登顶自家 benchmark,存在天然利益关联——Asta agent 针对这些任务和工具做过优化(论文自己也承认其开发成本'显著更高')。缓解因素:全部基线和 Asta agent 代码在 allenai/agent-baselines 开源,榜单开放外部提交,结论可被挑战。
评测严格、客观。
开放式任务(SQA、E2E)依赖 rubric + LLM judge,跑分需要同时持有 OpenAI/Anthropic/Google 三家 API key(README Environment variables 节);judge 模型本身是一个未完全消解的混淆变量。另外全套件复现门槛不低:官方内部实验用 128GB 内存 + 16 vCPU,SUPER/E2E 单题沙箱可吃 20-30GB 内存。

与我们方向的关系

对做科研 agent 的组来说,这基本是当前最完整的'统一考场':如果要声称自己的 agent 在科研辅助上有进步,在 AstaBench 上跑分并提交排行榜是成本最低的可信度来源。工程上值得直接借鉴的点:日期截断的文献检索(解决评测时间漂移)、冻结价格快照的成本核算、openness × tooling 双维度申报,这套方法论可以移植到我们自己构建的任何 agent 评测里。

结果层面的启示:文献理解类任务红利已薄(ReAct 基线就不差),真正的空白在代码执行、数据分析和端到端发现(最高分分别 41%、34%、5%),这是投入产出比最高的方向;另外'GPT-5 让专用 workflow agent 变差'这一观察值得跟踪——如果模型持续向 ReAct 式工作流对齐,精心设计的多阶段 pipeline 可能是贬值资产。

阅读笔记

跑全套件门槛较高:需要 ASTA_TOOL_KEY(向 Ai2 申请)、HF gated 数据集授权、三家 LLM key,内存建议 128GB(SUPER/E2E 单题 20-30GB)。README 的 Parallelism 一节写得很细(--max-samples≤CPU 核数、INSPECT_DOCKER_CLI_CONCURRENCY≥2N),自定义 solver 用 asyncio.to_thread 容易死锁。评测框架绑定 InspectAI,solver 与 scorer 的 inspect_ai 版本可解耦(scripts/eval_then_score.sh)。

材料清单

TeX 源码
已存档:Raw/astabench/source/
代码仓库github.com/allenai/asta-bench
132★ · 最近推送 2026-08-01
项目主页 / 报告allenai.org/asta/bench
数据集huggingface.co/datasets/allenai/asta-bench
gated license,需接受协议后用 HF_TOKEN 访问
基线代码github.com/allenai/agent-baselines
9 类 Asta agent + ReAct/smolagents 等全部基线 solver
Asta MCP 工具allenai.org/asta/resources/mcp
文献搜索工具,申请 ASTA_TOOL_KEY 的入口
OpenReviewopenreview.net/forum?id=M7TNf5J26u
ICLR 2026 接收

同类条目