基准
评测基准
AAAR-1.0: Assessing AI's Potential to Assist Research
AAAR-1.0:AI 能帮上科研的"脑力活"吗
Renze Lou, Hanzi Xu, Sijia Wang, et al. · Penn State · ICML 2025 · 2024-10 · 被引 26
一句话Penn State 等提出的科研能力 benchmark(ICML 2025),用 EquationInference / ExperimentDesign / PaperWeakness / ReviewCritique 四个需要领域专家知识的任务测 LLM:最好的模型在方程推断上 F1 仅 47.98%(全预测正类的 naive baseline 就有 40%),实验设计 F1 只有 20-30%,结论是 LLM 离"科研判断力"还差得远。
这是什么
多数 LLM 评测测的是日常任务(写邮件、QA、写代码),而 MLE-bench、MLAgentBench 一类科研 agent 基准测的是工程执行(跑通实验、刷 Kaggle 分)。AAAR-1.0 补的是另一块:研究者日常真正烧脑的环节——判断一个公式对不对、给一篇只有 idea 的论文设计实验、给投稿挑毛病、判断审稿意见靠不靠谱。这些任务需要深度领域知识和推理,没有可执行的 ground truth,难做也难评。
基准含四个子任务:(1) EquationInference,1,049 个实例,给论文上下文和 4 个候选方程(1 真 3 假),做二分类判断;(2) ExperimentDesign,100 篇论文,给 pre-experiment 部分(abstract/intro 等),生成实验计划和动机解释,ground truth 由 10 位资深 PhD 标注并经多轮 peer discussion;(3) PaperWeakness,993 篇 ICLR 2023 投稿(500 收 500 拒,覆盖全部 13 个 track),让 LLM 当审稿人写 weakness,对照真实审稿人意见;(4) ReviewCritique,复用作者团队 EMNLP 2024 工作的数据集,100 篇论文 380 条人类审稿切成 11,376 个 segment,判断每段审稿意见是否 deficient。
数据构建下了不少人力成本:方程任务的负例由 GPT-4 合成后先经 LLM 过滤(去掉引入未定义符号的浅层 shortcut),再由 5 名资深 PhD 逐对用 LaTeX 编译器人工核验(又筛掉 27.6%);实验设计任务的标注者要求 4 年以上 AI 科研经验 + 顶会发表 + 常任 reviewer。这也解释了为什么 ExperimentDesign 只有 100 条——作者在 Limitations 里承认规模小、方差可能大。
四个任务的输入输出形式:左上 EquationInference(给上下文判断 4 个候选方程哪个是论文原方程)、左下 ExperimentDesign(给 pre-experiment 部分生成实验计划+动机解释)、右上 PaperWeakness(给投稿写 weakness 列表)、右下 ReviewCritique(判断某条审稿意见是否可靠)。机制与做法
任务形式:把"科研判断"变成可评的题
EquationInference 刻意做成二分类而非四选一——作者发现二分类(逐个判断每个方程对不对)对 LLM 更难,四选一可以靠排除法。输入用 arXiv 的 LaTeX 源码而非 PDF 解析文本,避免解析噪声;论文只取 ACL Anthology 2019-2023 的顶会录用论文,保证人写方程质量。
ExperimentDesign 强调的是实验"设计"而非"执行",与 AI-Scientist、MLAgentBench 一类跑代码的工作错位:先量化 LLM 能不能在自然语言层面规划出正确的实验,再谈昂贵的执行迭代。输入是去除了实验泄漏句(GPT-4 删掉约 9.8% 的句子)的 pre-experiment 上下文。
PaperWeakness 特意选 OpenReview 的 under-review 版本而非 arXiv(arXiv 上可能是已修掉 weakness 的 camera-ready),用 VILA 解析正文、PDFFigures-2.0 抽图表。
前三个任务的数据构建流水线。看点在质量控制环节:EqInfer 的负例由 GPT-4 合成后先 LLM 过滤浅层 shortcut、再由专家逐对编译核验;ExpDesign 由资深 PhD 标注后经 annotator-reviewer 多轮 peer discussion;Weakness 用 GPT-4 从原始审稿意见中原文抽取 weakness,VILA + PDFFigures 解析 PDF。评测指标:自建的语义匹配一套
自由生成的两个任务不能用 exact match。ExperimentDesign 用 GPT-4o 做 LLM-as-judge 算 entailment 式的 precision/recall(预测的每条实验是否被 ground-truth 列表蕴含,反之亦然),解释部分用 SentenceBERT 相似度(soft match)。作者展示了一个有意思的现象:开源模型爱直接复述题面里的实验描述,ROUGE 反而高,soft match 低——ROUGE 和语义指标呈负相关,说明传统 n-gram 指标在这类任务上会被表面重叠骗过。
PaperWeakness 的 ground truth 是多个审稿人各自的 weakness 列表(不拍扁合并),用嵌套的 max-similarity 算 S2F1;另提出一个仿 TF-IDF 的 ITF-IDF 多样性指标,同时惩罚"一篇 review 里车轱辘话"(informativeness)和"每篇论文都套同一句模板批评"(specificity)。这个指标上 LLM 与人类审稿差距最大。
主要实验设置
评测覆盖 OLMo/Mistral/Mixtral/Qwen2.5-72B/Llama3.1-70B 等开源模型和 Gemini 1.5 Pro / Claude 3.5 Sonnet / GPT-4o / o1-preview / o3-mini 等闭源模型,开源用 vllm、闭源经 litellm 统一调用。PaperWeakness 里还测了 AI-Scientist 的 reviewer 模块(self-reflection + ensembling 那套 prompt 技巧),结果反而比裸 GPT-4o 差,尤其是多样性指标——说明这个任务不是 prompt 工程能糊过去的。
长文档处理上有个实用发现:对整篇论文(20k 词)直接生成 weakness,效果不如 split-combine(切成 2-3k 词的块分别挑毛病再合并),甚至不如只看前 3,000 词——LLM 拿到全文时会整段整段地忽略内容。多模态消融也是负结果:把论文图表以图片形式喂给 GPT-4o / InternVL2,不涨点甚至掉点,表格图片尤其伤。
关键结果
- EquationInference:全预测正类的 naive baseline F1 就有 40%(正负 1:3),开源模型几乎全线跑不过它(OLMo-7B 13.64、Qwen2.5-72B 31.22、Llama3.1-70B 33.08);最好的 o3-mini 也只有 47.98% F1,precision 34.34%——普遍高 recall 低 precision,即 LLM 倾向把错方程也判成对的,拿它核查论文公式风险很大。
- ExperimentDesign:所有模型 F1 落在 20%-30%,既漏掉原论文的关键实验(低 recall),又生成一堆原文没有的实验(低 precision);人工评审 15 篇的生成实验发现多数属于可选/无关,但 o1 生成的"新实验"里有相当比例被专家判为必要,有一定启发价值。
- PaperWeakness:闭源模型整体优于开源,但 LLM 写的 weakness 普遍空泛、缺乏对前沿工作的了解,ITF-IDF 多样性与人类审稿有明显差距;AI-Scientist 的 reviewer 比裸 GPT-4o 还差。
- split-combine(分块挑毛病再合并)优于喂 20k 全文,全文输入甚至不如只看前 3,000 词——长上下文模型处理长科学文档仍不可靠。
- 多模态输入(论文图/表的图片)对 ExperimentDesign 和 PaperWeakness 都基本无增益甚至有害,表格图片掉点最明显。
- ReviewCritique(判断审稿意见段落是否 deficient):11,376 个 segment 上各 LLM 的 F1 都很低(结果沿用 du et al. EMNLP 2024),说明 LLM 当 meta-reviewer 更不靠谱。
实证核查
扎实数据真实可查、规模与论文声称完全一致,结论方向是"LLM 不行"而非自我宣传,局限(数据泄漏、规模小)作者自己写明了。要注意第四个任务是复用旧数据集,以及主结果基于 2024 年的模型,对 2025-2026 的推理模型参考价值打折。
论文声称构建了 1,049 条 EquationInference、100 篇 ExperimentDesign、993 篇 PaperWeakness 数据,并公开发布。
HF 数据集 Reza8848/AAAR-1.0 的 dataset card 与声称完全对得上:Equation_Inference/equation.1049.json(含 context_before/after、4 选项、答案字段)、Experiment_Design 100 个论文子目录(含 arXiv source 包)、Paper_Weakness/ICLR_2023 993 个子目录;GitHub 仓库(RenzeLou/AAAR-1.0,MIT)提供 litellm/vllm 两套完整评测脚本,与 README 描述一致。
AAAR-1.0 是包含四个任务的新 benchmark。
第四个任务 ReviewCritique 完整复用作者团队自己的 EMNLP 2024 工作(du et al., "LLMs Assist NLP Researchers"),数据和代码都指向另一个仓库 jiangshdd/ReviewCritique,论文里该任务的结果表格标注 'From [du2024llms]',并非新实验;摘要甚至还写着 'three fundamental tasks' 然后列了 (i)-(iv) 四项,是后加任务没改干净的痕迹。新贡献实际是前三个任务。
评测能反映 LLM 真实的科研辅助能力。
两处折扣作者已自认(Limitations 节):① 数据源是 2019-2023 的 arXiv/ACL 论文和 ICLR 2023 投稿,大概率在被测模型的预训练语料里,分数只能视为 upper bound;② ExperimentDesign 仅 100 条,方差大。另外方程任务的负例由 GPT-4 合成、ExpDesign 指标由 GPT-4o 当 judge,存在同源偏置的可能。主结果测的是 GPT-4o/o1-preview/Claude 3.5 一代,今天的 frontier 模型表现未知。
代码可复现社区可用。
仓库仅 20 stars、2 个 issue(均已关闭,其一是 litellm 环境 yml 为空的打包失误,后改用 requirements.txt 修复),最后一次 push 是 2025-04,没有公开的第三方复现报告;但论文被 ICML 2025 接收、S2 引用 26 次,数据本身已被验证可下载。复现门槛主要在闭源 API 成本和 LLM-as-judge 的评测费用。
与我们方向的关系
对 autoresearch 方向,AAAR-1.0 与 MLE-bench / MLAgentBench 这类"工程执行"基准正好互补:它测的是 idea 与判断层面——实验该怎么设计、论文毛病在哪、审稿意见靠不靠谱。如果课题组做 research agent,这套任务可以当作 agent 的"规划/评审模块"的单元测试,尤其 ExperimentDesign 的 100 条专家标注(每条经多轮 peer discussion)质量较高,适合小规模 sanity check。
方法层面有两个可借鉴的点:① 负例构造流水线(LLM 合成 → LLM 过滤浅层 shortcut → 专家编译核验)是把生成式任务转成可靠判别式评测的通用套路;② 负结果本身有指导意义——长文档 split-combine 优于全文输入、prompt 技巧堆叠(AI-Scientist reviewer)在深度任务上失效、图表图片输入无增益,这些在设计自己的论文处理 pipeline 时可以直接采信或复测。注意用它评今天的模型前要先考虑 ICLR 2023 数据的污染问题。
阅读笔记
论文 v1 挂 arXiv 是 2024-10,ICML 2025 录用版加入了第四个任务 ReviewCritique(复用 EMNLP 2024 数据),读旧版博客/解读时注意任务数从 3 变 4。EquationInference 仓库里同时提供 binary 和 multi-choice 两种脚本,论文主表用的是 binary(更难);跑分时别拿 multi-choice 的数和论文比。HF 数据 card 明确写了 'DO NOT use the data for training'。
材料清单
TeX 源码已存档:Raw/aaar-1-0/source/
同类条目