基准
评测基准
背景
Humanity's Last Exam
人类最后的考试:2500 道专家出的前沿学术难题
Long Phan, Alice Gatti, Ziwen Han, et al. (核心团队 CAIS + Scale AI,含近千名出题专家) · CAIS / Scale AI · arXiv · 2025-01 · 被引 376
一句话 CAIS 与 Scale AI 组织近千名领域专家出了 2500 道封闭式学术难题(数学占 41%),发布时最强模型准确率不到 10%;但到 2026 年 8 月官方榜已被推到 46%+,且 FutureHouse 审计发现化学/生物题约 29% 的标准答案与文献证据冲突。
这是什么 背景是老基准全面饱和:MMLU 上主流模型准确率已超 90%,GPQA、MATH 也接近天花板,难以再区分前沿模型。HLE(Humanity's Last Exam)的回应方式是把出题权交给全球领域专家,收集 2500 道覆盖上百个学科的封闭式难题(选择题 + 精确匹配短答案,含约一成多模态题),号称'同类中最后一个封闭式学术基准'。学科分布上数学占 41%,生物/医学 11%,CS/AI 10%,物理和人文社科各 9%。
要注意它测的是什么:每道题有唯一、可自动判分的标准答案,考的是前沿'知识 + 封闭推理',不是开放式研究能力——不涉及提出问题、设计实验、写代码跑实验这些科研 agent 的过程能力。它在科研 agent 评测格局里的位置是'学术知识天花板'参照系:各家发布会必刷的一个数字,而非对做研究能力的直接度量。论文 2025 年 1 月挂 arXiv,后发表于 Nature,S2 引用 376。
HLE 的征题漏斗:全球 70,000 次出题尝试先过 LLM difficulty check(必须考倒前沿模型),剩 13,000 份进入专家多轮评审,6,000 候选经组织者与专家批准后,产出 2,500 题公开集和一个未公开的 private set。 机制与做法 出题与筛选漏斗
全球征题(有 50 万美元奖金池激励,单题最高 5000 美元),共约 70,000 次提交尝试。第一道闸门是 LLM difficulty check:题目必须先把当时的前沿模型(GPT-4o、o1 等)考倒才能进入人工环节,这一步过滤后剩约 13,000 份提交;再经多轮专家评审与修改得到约 6,000 候选,最终由组织者和专家批准 2,500 题进入公开集,另留一个未公开的 private set 防训练集污染。数据集带 canary string 供厂商过滤训练数据。
评测方式
仓库(centerforaisafety/hle,MIT,1.6k stars)提供极简两步评测:run_model_predictions.py 走 openai 兼容接口出答案,run_judge_results.py 用 LLM judge 对短答案做语义等价判分,同时报告 calibration error(模型自报置信度与实际正确率的偏差)。发布时各模型不仅准确率低(<10%),校准误差也在 80-90+ ——即答错时依然非常自信。官方建议 reasoning 模型 max tokens 不低于 8192。
关键结果 发布时(2025-01)最强模型也只有个位数到 10% 左右:o1 约 9%,GPT-4o 约 3%,与它们在 MMLU(87-92%)、GPQA(50-75%)上的表现形成断崖对比。 所有被测模型 calibration error 极高(README 示例 92.3),答错时置信度依然很高,说明模型不'知道自己不知道'。 文本题与多模态题难度接近,o1-preview 在 text-only 子集上 15.2% 是发布时最高分。 分数涨得远比'最后的考试'这个名字快:2025-11 Gemini 3 Pro 达 37.5%,2026-08 Scale 官方榜(无工具)gemini-3.1-pro 46.4%,第三方带工具/多次采样的榜单已报 55-65%。19 个月约 6 倍。 数据集初版实为 3,000 题,2025 年春修订后定稿 2,500 题(官网自述'has been finalized with 2,500 questions'),README 里示例输出 n=2700 就是旧版痕迹——跨时间点的分数严格说不可直接比较。 实证核查
有水分 基准本身真实、代码数据全公开、被业界普遍采用;但'专家多轮评审、答案无歧义'这一核心质量声称被第三方审计明显打折,'最后的考试'定位也已被模型进展证伪。
论文声称每题答案'unambiguous and easily verifiable',经过多轮专家评审与组织者批准。
FutureHouse 2025-07 审计 text-only 化学/生物题,发现 29±3.7%(95% CI)的官方答案与同行评审文献存在直接冲突证据(futurehouse.org/research/hle-exam);后续有 HLE-Verified(arXiv 2602.13964)做系统性修订。仓库 issues 中 #19、#17、#13、#7 等多个已关闭 issue 都是用户报告标准答案错误后修正,官方至今保留答案纠错表单——题库处于持续修补状态。
定位为'the final closed-ended academic benchmark of its kind',用 LLM difficulty check 保证题目考倒前沿模型。
difficulty check 只对 2024 年底的模型成立。发布时 SOTA <10%,2026-08 Scale 官方榜(labs.scale.com/leaderboard/humanitys_last_exam,无工具)最高 46.4%,artificialanalysis 等第三方榜带工具已到 55%+,饱和速度与 MMLU 当年相当,'最后'并未成立。
公开发布完整数据集与评测代码,附 canary string 防污染,另留 private set。
属实:HF cais/hle 可下载,仓库 centerforaisafety/hle(1666 stars,2026-08 仍在维护)含完整评测脚本,README 与论文描述一致。但 private set 从未公开过任何对照结果,防污染效果无从验证;且数据集从 3,000 题修订到 2,500 题,版本漂移让不同时期的榜单数字不严格可比。
与我们方向的关系 对课题组的意义主要是'坐标系'而非方法:几乎所有 research agent / deep research 系统的宣传都会挂一个 HLE 分数,读那些论文时需要知道这个数字测的是封闭式知识问答(还可能带工具检索),与'能不能做研究'是两回事——尤其 FutureHouse 恰恰是用自己的文献检索 agent 才发现三成化学/生物答案有问题,这本身说明开放式核查能力和 HLE 分数是不同的能力轴。
可借鉴的点:(1) 用'先考倒前沿模型再收题'的对抗式征题漏斗 + 奖金激励,是低成本收集高难度数据的可复用模式;(2) 它的翻车方式也值得记住——即便近千名专家多轮评审,封闭式'唯一正确答案'在前沿知识上仍有约三成争议,做自动评测基准时 ground truth 的验证成本不能省。
阅读笔记 评测时留意三个坑:数据集有 2025 年春的 3000→2500 版本变更;judge 用 LLM 判分,判分模型不同结果有抖动;各家榜单 with/without tools、采样次数口径不一,对比分数先查口径。
材料清单 TeX 源码 已存档:Raw/humanitys-last-exam/source/
同类条目