← 返回资料站  /  AutoResearch
基准 评测基准 ★ 必读

MLS-Bench: A Holistic and Rigorous Assessment of AI Systems on Building Better AI

MLS-Bench:AI 能发明可泛化的 ML 新方法吗
一句话140 个任务 × 12 个 ML 领域的"机器学习科学"基准:agent 要在受控的编辑范围内发明能跨数据集/种子/规模泛化的新方法(loss、优化器、架构组件等),并与复现好的人类 SOTA 基线同框比较。结论:前沿模型 Agent 模式平均最高 36.0 分(Claude Opus 4.6),仍低于 Human SOTA 的 42.6;调参式工程明显强于真正的方法发明;已被 Kimi K3、Qwen3.8-Max 等官方报告采纳。

这是什么

现有 ML agent 基准(MLE-Bench、MLE-Dojo 之类)考的基本是工程:给定一个 Kaggle 式的固定任务,把数据洗好、管线调好、分数刷高。但 ML 研究的核心产出不是刷分,而是方法级的想法——一个新 loss、新优化器、新架构组件,而且必须在提出它的那个 setting 之外仍然成立。MLS-Bench(ML Science Bench)就是针对这一点设计的:每个任务锁定一个研究问题(如"预训练优化器设计""3DGS densification 策略"),给 agent 完整代码库和至少 3 个复现过的强人类基线,只允许在划定的可编辑区域内改动,然后在至少 3 个评测 setting(不同数据集/环境/模型规模)上验证泛化性。

作者是清华、Princeton、UW、Berkeley 等的联合团队(Bohan Lyu 一作,Simon Du、Max Simchowitz、Jiantao Jiao、Dawn Song、Chi Jin 压阵),2026-05 放出,持续高频维护。全量 140 任务跑一遍需 704.7 H100-hours;另有覆盖全部 12 领域的 30 任务子集 MLS-Bench-Lite(99.2 H100-hours,4 张 H100 约一天),配公开排行榜。评分做了基线锚定归一化:最差基线=0 分、最强基线=50 分,setting 内算术平均、跨 setting 几何平均——某个 setting 崩掉就整体崩,补偿不了。

主实验结论:五个前沿模型(Claude Opus 4.6 / GPT-5.4 / Gemini 3.1 Pro / DeepSeek-V3.2 / Qwen 3.6 Plus)即便把强基线实现直接放进 context、允许 20 个 action + 3 次 test 迭代,Agent 模式平均分最高也只有 36.0,全部低于 Human SOTA 的 42.6。后续分析章节进一步论证:瓶颈不只在"提出新方法",更在规划实验、验证与规模化论断所需的科学判断力——加算力、加搜索、加 context 都解决不了。

总览图:左侧对比 Frontier-CS(开放优化)、MLE-Bench(Kaggle 式工程)与 MLS-Bench 的任务形态差异——MLS-Bench 的任务是"设计紧凑的 KV 状态并保持模型质量"这类方法级问题,自带基线列表和多 setting 评测;右侧是 12 个领域中 20 个代表性任务。
总览图:左侧对比 Frontier-CS(开放优化)、MLE-Bench(Kaggle 式工程)与 MLS-Bench 的任务形态差异——MLS-Bench 的任务是"设计紧凑的 KV 状态并保持模型质量"这类方法级问题,自带基线列表和多 setting 评测;右侧是 12 个领域中 20 个代表性任务。

机制与做法

任务结构与"基线校准的脚手架"

每个任务由七件东西定义:研究问题、带可编辑区域标注的代码库、至少 3 个复现的强基线、至少 3 个评测 setting、多种子策略、统一评分归一化、容量预算。可编辑范围的松紧用一个双向准则确定,论文称 baseline-calibrated scaffolding:范围要恰好宽到能把该问题所有已确立的强方法都表达为编辑序列(不能误杀合法新方法),同时每个基线在这个脚手架里重新实现后必须复现其发表成绩(证明脚手架忠实还原了原问题),两条都过任务才收录。

反作弊三板斧:(1) 评测 harness 冻结,跨方法共享的训练协议超参(epoch、batch size)锁死在保护区间,只有方法自身的超参可编辑;(2) 涉及模型组件的任务有参数量预算检查,超容量的提交直接拒收——消融显示去掉这个检查后 agent 会把模型放大到基线 3 倍参数量刷分,甚至超过 Human SOTA(见 fig06);(3) 防污染:每个任务都内置了作者能复现的最强已知方法作基线,单纯背出已知方案赢不了,且主实验关闭联网搜索。

容量预算检查的消融:横轴是提交模型与基线的参数量比,纵轴是相对最强基线的分数。去掉预算检查(叉)后,agent 普遍把模型放大(最高 3 倍参数)换取高分,Claude/Gemini/Qwen 的超容量提交甚至超过最强基线(>1.0);有检查(圈)时这些提交全部被拒。说明不设 validity 检查,agent 会走捷径刷分而非改进方法。
容量预算检查的消融:横轴是提交模型与基线的参数量比,纵轴是相对最强基线的分数。去掉预算检查(叉)后,agent 普遍把模型放大(最高 3 倍参数)换取高分,Claude/Gemini/Qwen 的超容量提交甚至超过最强基线(>1.0);有检查(圈)时这些提交全部被拒。说明不设 validity 检查,agent 会走捷径刷分而非改进方法。

规模选择与评分

很多方法小规模有效、大规模失效,但基准又不能贵到没人跑。MLS-Bench 的原则是:任何缩减后的评测 setting 必须复现已有基线的发表排序,能用原生规模就用原生,不行才最小限度缩小。LLM 预训练任务用 345M 参数模型 + ClimbMix 数据,下游用 lm-eval-harness 测 HellaSwag/ARC-Easy/PIQA/WinoGrande。

指标归一化把最差基线锚在 0、最强基线锚在 0.5(展示为 50 分),有理论上界的指标用幂变换、没有的用 sigmoid。Human SOTA 聚合后不恒等于 50:不同基线在不同指标/setting 上各有胜负时会低于 50(实际 12 领域平均 42.6),某基线达到理论上界时映射到 100。

测试时扩展实验:6 个任务上,多采样(橙)、多轮探索(蓝)、OpenEvolve 进化搜索(绿)的 best-so-far 分数随 token 消耗快速饱和,多数停在 Human SOTA(虚线)附近或之下;灰色实线 vs 虚线显示 OpenEvolve 在可见 setting 上维持高分的同时隐藏 setting 崩到 0。最右:TTT-Discover 测试时训练同样过拟合可见 setting。结论:算力堆不出泛化的方法。
测试时扩展实验:6 个任务上,多采样(橙)、多轮探索(蓝)、OpenEvolve 进化搜索(绿)的 best-so-far 分数随 token 消耗快速饱和,多数停在 Human SOTA(虚线)附近或之下;灰色实线 vs 虚线显示 OpenEvolve 在可见 setting 上维持高分的同时隐藏 setting 崩到 0。最右:TTT-Discover 测试时训练同样过拟合可见 setting。结论:算力堆不出泛化的方法。

主结果与消融

Agent 模式(20 action、3 test)平均分:Claude Opus 4.6 36.0 > Gemini 3.1 Pro 34.9 > GPT-5.4 27.8 > DeepSeek-V3.2 26.3 > Qwen 3.6 Plus 23.2,全部低于 Human SOTA 42.6。Vanilla(首个提案)更低,最高 28.1。Lite 榜上(8 action、1 test)GPT-5.5 Pro / Claude Opus 4.7 并列 36.1 领先。

把"科学创新"提示词换成"工程优化"提示词后,较弱的模型分数明显上涨(fig05),说明它们做调参、套已知技巧比发明新方法在行——这正是 MLE 类基准和本基准测的东西不同的直接证据。OOD 分析显示强模型在迭代中 in-distribution 与 OOD 的差距会收敛,即多 setting 设计确实在筛"能迁移的方法"。

"创新还是模仿"统计:横轴是按代码相似度(1/3-gram Jaccard)加权的基线分数,纵轴是 agent 得分,n=577 个 run,pooled r=+0.23(p<1e-8)。五个模型斜率全部为正,越弱的模型(DeepSeek、Qwen、GPT-5.4)斜率越显著——它们的成绩基本由"抄了哪个基线"决定,而非独立的方法创新。
"创新还是模仿"统计:横轴是按代码相似度(1/3-gram Jaccard)加权的基线分数,纵轴是 agent 得分,n=577 个 run,pooled r=+0.23(p<1e-8)。五个模型斜率全部为正,越弱的模型(DeepSeek、Qwen、GPT-5.4)斜率越显著——它们的成绩基本由"抄了哪个基线"决定,而非独立的方法创新。

四个分析实验:瓶颈在科学判断力

Test-time scaling(多采样/多轮探索/OpenEvolve 进化搜索/TTT-Discover 测试时训练):简单任务能涨但很快饱和;在只暴露 2/3 setting 的设置下,OpenEvolve 和测试时训练都出现明显的"可见 setting 涨、隐藏 setting 跌"的过拟合(fig08)。

Verifier-limited 自适应算力分配:允许 agent 在 51M–345M 代理模型规模间自选、50 action + 20 test,自由度严格更大,结果除 GPT-5.4 外全体变差;Claude Opus 4.6 花钱最凶(近指数式消耗预算)反而输。作者结论:当前模型缺的是选择信息量大的实验、把反馈变成可规模化证据的判断力。

Context engineering(联网搜索/基线论文推导/理论教材背景)收益普遍很小,且能被普通迭代 refinement 追平——瓶颈不是缺知识,是不会用。专家评估 + 1/3-gram Jaccard 代码相似度统计(n=577)显示:agent 提交大多是把看到的基线重组后包装成"新方法",真正新颖的组件罕见且缺乏动机论证;越弱的模型分数越跟它抄的那个基线走(fig11,pooled r=+0.23, p<1e-8)。

关键结果

实证核查

扎实代码、任务、镜像、排行榜全部真实可查,第三方(含 Kimi、Qwen 官方)确实在跑;更难得的是作者自曝家丑式的维护——发布后自查出 26 个任务存在答案泄漏、21 个并发评测 bug 并逐一修复。代价是基准本身是移动靶:评分口径和个别任务发布后有修订,论文表格数字与当前排行榜不可直接比。
论文声称 140 个任务、每任务 ≥3 个复现基线,配 Docker/Apptainer/Harbor 多运行时,可复现。
GitHub 仓库 tasks/ 目录下 140 个任务全部可见(README 附录表逐一列出外部依赖仓库、基线与评测 setting),Docker Hub bohanlyu2022/mlsbench-* 预构建镜像与 HF 数据集 Bohan22/MLS-Bench-Tasks 均存在。issues 里 rabhub、yrzhangalan、chang-github-00 等多位第三方用户实际跑通并报了几十个环境/数据准备问题,均被快速修复(如 #12-#23 host 依赖缺失、#47 H20 GPU sm_90 适配)——是真的有人在跑的基准,不是发布即弃。
论文声称 validity enforcement 保证分数增益只能来自方法本身(编辑区域约束、harness 冻结、防作弊)。
发布约 6 周后作者全量审计发现 26/140 任务存在 held-out 答案泄漏:编辑区守卫只限制 agent 往哪写代码,不限制代码运行时能读什么,agent 可以在进程内读到测试标签/真值图/数据生成器种子直接"预测"满分(issue/PR #54,2026-07-04 修复;#61 又补了 2 个)。随后 #81 修复了 21 个并发/staleness 评测 bug。这些漏洞在论文主实验之后才修,虽然作者称诚实解法分数逐位不变,但早期在这些任务上的 agent 跑分严格说存疑;好在披露完全透明、修复可查。
README 宣称被 Qwen3.8-Max、Kimi K3、Kimi-K2.7-Code 官方采纳。
属实。Kimi K3 技术报告(arXiv 2607.24653)将 MLS-Bench-Lite 列入正式评测(K3 48.3 vs Claude Fable 5 49.9 等),Qwen3.8-Max 官方博客注明"用 Claude Code harness + 5 小时超时"评测;mls-bench.com/leaderboard 现有 10 个模型的持续更新榜单,llm-stats.com、benchmarklist.com 等第三方聚合站也已收录。
评分与任务定义稳定、跨 run 可比。
打折扣:基准是移动靶。README News 承认论文主表聚合方式从几何平均改成了算术平均(称排名不变);Sparse L0 攻击任务因"强攻击轻易饱和"整个重新设计(换成 Sparse-RS k=24 威胁模型);仍有 open issue #82 证明 optimization-diagonal-net 的两个 d500 setting 因 --sigma 从未进入计算而逐字节重复(四个基线在两个 setting 上分数逐位相同),等于该任务双倍加权了同一评测。另外论文协议(Lite Vanilla 8-action,最高 36.1)与当前排行榜协议(Harbor 5 小时探索,最高 49.9)完全不同口径,引用数字时必须注明协议。
论文声称当前 agent 远未达到可靠超越人类方法的水平。
论文数据支持该结论(Agent 最高 36.0 vs Human SOTA 42.6),但注意最新一代模型 + 5 小时 agentic harness 下榜首已到 49.9,逼近"最强基线=50"的锚点,"远未达到"的窗口正在快速收窄;r/mlscaling 社区评论也指出这是迄今最接近考"research taste"的基准、广度对单个人类研究者也是超纲的(没有人类同时精通全部 12 个领域),即 Human SOTA 是拼起来的各领域最强,和单个 agent 比本身偏严格。

与我们方向的关系

对做 autoresearch 的组来说,这是目前区分"工程优化"与"方法发明"最认真的一个基准,直接回应了 MLE-Bench 一类基准测不到科学能力的批评。它的三个设计点值得抄:baseline-calibrated scaffolding(可编辑范围以"能表达所有已知强方法"为准绳并用基线复现来验收)、跨 setting 几何平均(单点崩溃无法被补偿)、容量预算检查(消融实证了不查就会被 hack)。做自动科研 agent 评测或自建任务时,这套 validity 论证方法比结论本身更有用。

它的失败分析也给 agent 方向指了路:瓶颈在实验规划与证据构建而非提出想法——自适应算力分配实验里自由度更大反而更差,这对设计 research agent 的 scaffold(要不要放开实验预算控制权)是直接的负面证据。另一个警示是 26 任务答案泄漏事件:编辑范围守卫 ≠ 运行时信息隔离,自建可执行基准时必须把 held-out 真值放到 agent 进程之外。追踪 mls-bench.com/leaderboard 也可作为前沿模型"科研能力"的持续观测点。

阅读笔记

论文实验协议有两套,引用数字要小心:主表是 20-action Agent 模式(五模型全量 140 任务),Lite 十模型只跑 8-action Vanilla;而 GitHub README 和官方排行榜用的是 Harbor + 5 小时探索预算,三者互不可比。复现建议直接走 Harbor + 预构建镜像(bohanlyu2022/mlsbench-harbor-*),README 的 conda 本地后端仅供开发。跑 LLM 预训练/RL 任务在 H200 上记得开 compute_scale(PR #9)。

材料清单

TeX 源码
已存档:Raw/mls-bench/source/
代码仓库github.com/imbernoulli/mls-bench
107★ · 最近推送 2026-08-25
项目主页 / 报告mls-bench.com
官方排行榜mls-bench.com/leaderboard
MLS-Bench-Lite 持续更新榜,Harbor + 5 小时探索预算口径,2026-08 榜首 Claude Fable 5 49.9 分
答案泄漏修复github.com/Imbernoulli/MLS-Bench/issues/54
26/140 任务 held-out 答案泄漏的审计与修复记录(核查本基准可信度的关键材料)
第三方采纳例arxiv.org/abs/2607.24653
Kimi K3 技术报告,将 MLS-Bench-Lite 列入官方评测(K3 48.3)
社区讨论www.reddit.com/r/mlscaling/comments/1tb2lgc/
r/mlscaling:评价其为迄今最接近考察 research taste 的基准,广度对人类研究者也超纲

同类条目