报告
实证度量
★ 必读
Measuring AI Ability to Complete Long Tasks
测量 AI 完成长任务的能力:50% 时间地平线每 7 个月翻倍
Thomas Kwa, Ben West, Joel Becker, et al. (METR) · METR · arXiv · 2025-03 · 被引 134
一句话 METR 用 170 个软件/研究任务加人类基线,提出 '50% 任务完成时间地平线' 指标:模型能以 50% 成功率完成的任务,对应人类专家需要多长时间。2019-2025 年该指标每约 207 天翻一倍(R²=0.97),naive 外推 2029 年左右出现能做一个月量级任务的 AI;后续 TH1.1 与 2025-2026 年新模型证实趋势成立且在加速(post-2023 doubling 降到 131 天)。
这是什么 AI benchmark 层出不穷又快速饱和,分数之间无法互相换算,导致'AI 到底进步多快'这个问题一直缺一个跨年代、跨模型可比的量纲。METR(前身是 ARC Evals,专做前沿模型自主能力评估的非营利机构)提出用'人类完成同样任务需要的时间'作为难度标尺:如果一个模型能以 50% 成功率完成人类专家需要 1 小时的任务,它的 50% time horizon 就是 1 小时。这个定义把 GPT-2 到 o3 放到了同一根轴上。
任务池由三部分拼成:HCAST 的 97 个软件/网安/ML 任务(人类耗时 1 分钟到 30 小时)、RE-Bench 的 7 个 8 小时 ML 研究工程任务、以及专为测量 2023 年以前弱模型新造的 66 个 SWAA 单步小任务(1-30 秒)。人类基线来自 800+ 次实测(共 2529 小时),baseliner 是平均 5 年经验的软件/ML/网安从业者。评了 2019-2025 年间 12 个 frontier(加 4 个 near-frontier)模型,每个模型-任务对约跑 8 次。
核心发现:50% time horizon 从 GPT-2 的 2 秒涨到 o3 的约 110 分钟,对 release date 做对数线性回归得到 207 天(95% CI 166-240 天)的翻倍周期。这条线是 AI 2027 等 takeoff 时间线讨论中被引用最多的经验依据,也是 catalog 里'AI 何时能自主做研究'这一问题目前最主流的量化答案。
全文核心图:12 个 frontier 模型的 50% time horizon(对数轴,从 GPT-2 的 2 秒到 o3 的近 2 小时)对 release date 回归,doubling time 207 天,R²=0.97,阴影为层级 bootstrap 的 95% CI。这张图就是后来被无数转发的 'METR graph'。 机制与做法 从成功率到 time horizon:类 IRT 的 logistic 拟合
每个任务先二值化(连续分数按人类目标分数设阈值;RE-Bench 用 7-9 小时人类跑分均值做阈值),任务难度直接用成功人类基线时间的几何均值 t_task 表示。然后对每个模型拟合 logistic:p_success = σ((log h_agent − log t_task)·β_agent),h_agent 就是 50% time horizon。思路来自心理测量学的 Item Response Theory,区别是难度不从模型答题反推、而是直接锚定人类耗时。
置信区间用三层 hierarchical bootstrap(task family → task → run,10000 次)。单个模型的 horizon 误差棒很宽,但作者强调各模型误差高度相关(抽到偏易/偏难任务会同向抬高/压低所有模型),所以斜率(doubling time)比任何单点都可信。为防大 task family 主导,每个任务按 family 大小的 1/sqrt 加权。
方法流水线:HCAST(97 任务,1 分钟-30 小时)+ SWAA(66 个 1-30 秒单步任务)+ RE-Bench(7 个 8 小时任务)组成任务池;人类跑出耗时、agent 跑出成功率;logistic 拟合出每个模型 50% 成功率对应的任务时长,再对 release date 画趋势。 外部效度三连测
作者自己就把外部效度当成最大威胁,做了三组检验。一是把同一套方法套到 SWE-bench Verified 上:指数趋势仍在,但 doubling time 只有约 70 天(同期自家任务是 143 天),作者归因于 SWE-bench 的时间标注是'熟悉代码库的维护者视角',会系统性低估外包工程师完成简单任务的耗时。二是给 HCAST+RE-Bench 任务打 16 项 'messiness' 因子(是否资源受限、环境是否动态、有无清晰反馈回路等):控制任务长度后,模型在 messier 任务上成功率显著更低,但随时间的改进趋势在高/低 messiness 两个子集上相似,没有出现'脏任务上进步停滞'的证据。
三是用 METR 内部真实 PR(未污染)做小规模测试:发现外包者修一个 issue 比 repo 维护者慢 5-18 倍,而模型表现与'外包者耗时'标尺一致、显著差于'维护者耗时'标尺——也就是说 horizon 的绝对值严重依赖你拿哪群人当参照系。
'1 个月地平线 AI 何时到来'的敏感性分析:对任务/运行/模型 bootstrap、加权与正则化选择、基线噪声各做 10000 次扰动,按 2019-2025 趋势中位落在 2029 年中;按 2024-2025 加速趋势整体提前到 2027 前后。注意作者明确标注此图不含外部效度和趋势变化的不确定性。 80% 地平线与失败模式
把成功率阈值从 50% 提到 80%,doubling time 几乎不变(204 vs 207 天),但 horizon 绝对值缩短 4-6 倍——模型'偶尔能做成难任务'和'可靠完成中等任务'之间差距巨大,这对实际部署是关键警示。定性分析对比 GPT-4 1106 与 o1 各 30 余次失败运行:老模型最大的死法是重复无效动作(12/31),o1 已基本消除这一点(2/32),但'过早放弃任务'反而成了新模型的主要失败模式(16/32)。
外部效度检验:按任务长度(<1h / 1h+)和 messiness(16 项因子打分的高/低半)四分格看成功率随时间的变化。messier 任务成功率整体更低(右下格最惨),但四个格子的改进趋势斜率相似——没有'脏任务上进步停滞'的证据,这是趋势能外推的关键辩护。 外推到 1 个月地平线
以 167 工作小时(约一个人月)为阈值做 naive 外推:按 2019-2025 趋势,中位估计 2029 年中,80% CI 宽约 2 年;若按更陡的 2024-2025 趋势,一半概率落在 2027 年甚至 2026 年底。作者用 multiverse 敏感性分析(bootstrap 任务/运行/模型、加权与正则化选择、基线噪声)表明统计噪声不是主要不确定性来源,真正的大头是外部效度和趋势本身会不会变。
关键结果 50% time horizon 每 207 天(约 7 个月)翻倍,95% CI 166-240 天,log-linear 拟合 R²=0.97;GPT-2 仅 2 秒,GPT-4 约 5 分钟,Claude 3.7 Sonnet 约 50-59 分钟,o3 约 110 分钟。 o3 显著高于 2019-2025 长期趋势线(p=0.006);2023-2025 段趋势比全期快约 20%,2024 年后可能已加速到约 4-5 个月翻倍。 80% 成功率地平线的 doubling time(204 天)与 50% 几乎相同,但绝对值短 4-6 倍——可靠性远远落后于'碰运气式'能力。 模型平均成功率与人类耗时的对数强负相关(R²≈0.80-0.83);模型间任务级成功相关性平均 0.73,说明'哪些任务难'在模型间高度一致。 SWE-bench Verified 上复现出指数趋势但 doubling 仅约 70 天,差异主要来自时间标注参照系不同(维护者 vs 外包者,后者慢 5-18 倍)。 控制长度后模型在高 messiness 任务上表现更差,但高/低 messiness 子集的改进趋势斜率相似,未见'真实感任务上进步停滞'的证据。 Naive 外推:2028 中-2031 中之间出现 1 个月(167 小时)地平线的 AI,中位 2029;若按 2024-2025 加速趋势则提前到 2027 前后。 实证核查
扎实 核心经验规律(指数趋势与 doubling time)经 METR 自己的 TH1.1 换任务套件+换评估框架复测、以及 Epoch AI 等第三方持续追踪后依然成立甚至加速,代码与逐 run 数据全公开;但 horizon 的绝对值(y 轴)依赖一个小而偏的人类基线样本,外界有分量不轻的批评,外推部分只能当量级参考。
论文声称 50% time horizon 自 2019 年起每约 7 个月翻倍,且 2024 年可能加速。
这条趋势是少数经受住了时间检验的预测:METR 2026-01-29 发布 Time Horizon 1.1(任务从 170 增到 228、8 小时以上任务从 14 增到 31、评估框架从自研 Vivaria 换成 UK AISI 的 Inspect),混合趋势的 doubling time 与 TH1 完全一致(196 天),post-2023 段 TH1.1 测得 131 天 vs TH1 的 165 天,即趋势还在加速(metr.org/blog/2026-1-29-time-horizon-1-1)。2025-2026 年 GPT-5(约 2h17m)、Opus 4.5/4.6 等新模型都落在趋势线上方,LessWrong 上已有 'METR Time Horizons: Now 10x/Year' 的追踪帖;Epoch AI 也把 METR time horizon 做成了持续更新的 benchmark 页(epoch.ai/benchmarks/metr-time-horizons)。
y 轴的含义是'人类专业人员完成该任务所需时间',论文以此宣称模型能做'人类需 1 小时的任务'。
这是被批评最狠的一环。Nathan Witkin 2026-01 在 Transformer/Arachne 发表 'Against the METR graph':每个任务平均只有约 3 个 baseliner、多从 METR 社交圈招募;baseliner 按 $50-100/小时计酬(做得越慢挣得越多,速度奖金只给最快者,期望上仍激励拖长);METR 自己在附录承认短任务 25-75% 的时间花在读题和搞清提交格式上、且内部 PR 实验显示 repo 维护者比外包 baseliner 快 5-18 倍——绝对 horizon 值很可能系统性偏高。论文其实预埋了辩护('即使绝对值差 10 倍,趋势结论不变',见 Figure 1 caption),且第一作者 Thomas Kwa 在 LessWrong 上长文回应过这些局限。结论:斜率可信,y 轴刻度别太当真。
外推趋势预测 2028-2031 年(中位 2029)出现 1 个月地平线的 AI,可能带来大规模软件自动化。
这是纯 naive 外推,作者自己标注了'不含趋势变化与外部效度的不确定性,而后者才是大头'。第三方定量补充:Toby Ord(arXiv:2505.05115)指出 METR 数据与'恒定风险率/半衰期'模型高度一致——agent 在任务中每单位时间有近似恒定的失败概率,这自然解释了 80% horizon 比 50% 短约 5 倍,也意味着把 50% horizon 解读为'能干多长的活'会高估长任务能力;METR 自己 2025-07 的后续研究(How Does Time Horizon Vary Across Domains)显示 horizon 在不同领域(如自动驾驶、数学、agentic computer use)之间差异达数量级,软件任务是最长的之一。外推数字应当作量级参考而非时间表。
README 声称提供完整可复现的 DVC pipeline 和逐 run 数据。
属实:repo(METR/eval-analysis-public,315 stars,2026-03 仍在更新)含 src/horizon 包、time-horizon-1-0 与 1-1 两套 DVC pipeline、runs.jsonl 逐 run 数据(task_id/human_minutes/score_binarized 等字段齐全),time-horizon-1-0 report 覆盖 48+ 模型,远超论文的 12+4 个。瑕疵:长期没有 LICENSE 文件(issue #26/#28/#38 反复催),第三方复用的法律地位不明;issue #37 指出所谓 histogram 图其实不是直方图;issue #35 问'时间到底怎么计'无人回复;没有发现复现失败的报告。
任务套件'捕捉研究与软件工程所需技能',结果可推广到真实工作。
论文附录自己列了 5 项系统性差异(自动打分、无其他 agent 交互、低上下文需求、无资源约束、允许反复试错),TH1.1 博客还披露 31 个 8 小时以上长任务中只有 5 个有实测人类基线、其余靠估计。METR 2025 年另一项 RCT(开发者用 AI 反而慢 19%)也提醒 benchmark 能力与真实生产力之间有缺口。这些限制论文没有隐瞒,但媒体传播中普遍被丢掉。
与我们方向的关系 对课题组'AI 何时能自主完成研究级长任务'的核心问题,这是目前唯一一个跨 6 年、可持续更新、且经受了换套件复测的量化标尺,讨论 takeoff/自动化 AI 研发时间线绕不开它。用的时候记住三条纪律:引用斜率而非绝对值;区分 50% 和 80% horizon(后者才接近'可靠可用');外推到 research 任务时要过 messiness 和领域差异这两道折扣。
方法论本身也可借鉴:用人类耗时作为跨 benchmark 的统一难度量纲 + logistic 拟合提取 horizon,这套做法可以直接搬到我们自己的评测上(repo 里 src/horizon 是可安装的 Python 包,runs.jsonl 格式简单)。反面教训同样有价值:人类基线的招募方式和计酬设计会系统性污染 y 轴,如果我们要做自己的 baseline,应避免纯时薪激励、并记录参照人群与任务的专业匹配度。
阅读笔记 读的时候注意论文正文说 170 个任务而 headline 图写 169,是统计口径微差。arXiv v1 是 2025-03,后被 NeurIPS 2025 接收。后续跟进材料很多:HCAST 论文(arXiv:2503.17354)、Toby Ord half-life(arXiv:2505.05115)、METR 域间差异博客(2025-07)、TH1.1(2026-01)、metr.org/time-horizons 实时 dashboard。S2 引用数 134 明显低估了它的实际影响力——它更多被博客、政策报告和 AI 2027 这类 scenario 文引用。
材料清单 TeX 源码 已存档:Raw/measuring-ai-ability-to-complete-long-tasks/source/
同类条目