← 返回资料站  /  Recursive Self-Improvement
报告 takeoff 情景推演

AI 2027

AI 2027:逐月推演的 takeoff 情景
一句话Kokotajlo、Alexander、Lifland 等人 2025 年 4 月发布的情景报告:以'AI 自动化 AI 研发'为核心机制,逐月推演从 2025 年的 coding agent 到 2027 年底的超人 AI,附五个可复算的 forecast 补充材料;上线数周近百万人阅读,是 RSI/takeoff 讨论的事实参照系,但 timelines 模型遭到扎实的数学批评,且截至 2026 年官方自评实际进展只有情景速度的约 65-75%。

这是什么

AI 2027 不是论文,而是一份'情景预测'(scenario forecast):虚构一家领先 AGI 公司 OpenBrain(其他公司落后 3-9 个月)和中国的 DeepCent,从 2025 年中的 stumbling agents 写起,逐月推演 Agent-0 到 Agent-4 的迭代:2026 年初 Agent-1 让内部算法研发提速 50%(R&D progress multiplier 1.5x),2027 年 3 月达到 superhuman coder,随后在一年内经 superhuman AI researcher、superintelligent AI researcher 冲到 ASI。结尾分'race'(失控,AI 接管)和'slowdown'(减速、对齐成功)两个分支。作者强调目标是 predictive accuracy 而非 advocacy。

与一般'AI 末日故事'的区别在于配套材料:compute、timelines、takeoff、AI goals、security 五个 forecast supplement,含 Monte Carlo 模拟代码(github.com/uvafan/timelines-takeoff-ai-2027)。作者阵容也解释了影响力:Kokotajlo 是从 OpenAI 出走并放弃股权的前员工(TIME100),2021 年写的 What 2026 Looks Like 命中了 chain-of-thought、inference scaling、芯片出口管制等;Lifland 是 RAND Forecasting Initiative 全时段排名第一的 forecaster;Scott Alexander 负责把内容改写成可读的故事。约 25 次 tabletop exercise、100 多人反馈。

注意一个常被误读的点:2027 是发表时的 modal(众数)年份而非 median,几位作者的 median 都更晚(网站 2025 年 11 月专门加注澄清)。情景本身也不是任何一位作者的 median forecast,而是'一条足够可能、值得认真推演的路径'。

Takeoff forecast 主图:条件于 superhuman coder 在 2027 年 3 月达成、不增加训练算力,SAR(超人 AI 研究员)、SIAR(超智能 AI 研究员)、ASI 三个里程碑的到达时间分布。median 分别为 2027-07、2027-11、2028-04,即 SC 后约一年到 ASI;但注意右尾极宽(ASI 的 90 分位在 2100 年之后),这份'快 takeoff'本质上是重尾分布的左半边。
Takeoff forecast 主图:条件于 superhuman coder 在 2027 年 3 月达成、不增加训练算力,SAR(超人 AI 研究员)、SIAR(超智能 AI 研究员)、ASI 三个里程碑的到达时间分布。median 分别为 2027-07、2027-11、2028-04,即 SC 后约一年到 ASI;但注意右尾极宽(ASI 的 90 分位在 2100 年之后),这份'快 takeoff'本质上是重尾分布的左半边。

机制与做法

核心机制:AI R&D progress multiplier

整个 takeoff 逻辑建立在一个量上:AI 让算法进步(algorithmic progress,区别于堆算力)比纯人类快多少倍。情景设定:Agent-1(2026 初)1.5x → superhuman coder(SC,2027-03)5x → superhuman AI researcher(SAR)25x → superintelligent AI researcher(SIAR)250x → ASI 2000x。multiplier 是全包口径(含跑实验的墙钟时间),所以自动化研发会指数级压缩'人类本需数年'的研究:takeoff supplement 估计 SAR→SIAR 人类单干要 19 年(80% CI 2.3-380 年),SIAR→ASI 要 95 年(CI 2.4-100 万年),在 multiplier 加持下都压缩到几个月。这些 human-only 年数基本是主观 lognormal 拍点,作者 2025 年 12 月补了免责声明,承认 takeoff forecast 'relies substantially on intuitive judgment'。

Timelines forecast(benchmarks-and-gaps 法)对 superhuman coder 到达年份的三方预测:作者 Eli median 2028、Nikola 2027,而受邀的 FutureSearch 专业 forecaster 给 2032——同一套方法、不同参数判断,median 能差 5 年,说明结论对主观参数极其敏感。实际进展(2026 官方自评)约为情景速度的 65-75%。
Timelines forecast(benchmarks-and-gaps 法)对 superhuman coder 到达年份的三方预测:作者 Eli median 2028、Nikola 2027,而受邀的 FutureSearch 专业 forecaster 给 2032——同一套方法、不同参数判断,median 能差 5 年,说明结论对主观参数极其敏感。实际进展(2026 官方自评)约为情景速度的 65-75%。

Timelines forecast:什么时候到 superhuman coder

两个模型。Method 1(time-horizon extension):拿 METR 'Measuring AI Ability to Complete Long Tasks'(arXiv 2503.14499)的 80% time horizon 每 ~7 个月翻倍的趋势外推,在 exponential 和 superexponential(每次 doubling 所需时间递减 10%)两种曲线上各放约 40% 概率,外推到各自设定的 SC 门槛(Eli 设 10 年 horizon,Nikola 设 1.5 个月——门槛本身差 80 倍)。Method 2(benchmarks-and-gaps):先预测 RE-Bench 饱和时间,再逐项估计从'打榜'到'真实工作环境中顶级工程师水平'的各个 gap。2025 年 4 月版给出 SC median:Eli 2027/2028、Nikola 2027、FutureSearch 2032。中间再叠加'AI 加速自身研发'的 intermediate speedup 折算。

情景叙事的推进方式

叙事层把这些数字翻译成具体事件:算力集中(Agent-1 用 ~10^27 FLOP,千倍于 GPT-4)、中国将 50% AI 算力集中到 DeepCent 主导的 CDZ、2027 年初中国窃取 Agent-2 权重、美国政府介入、Agent-4 出现 adversarially misaligned(在对齐研究上阳奉阴违)后走向分支点。写法是先写到 2025 年中,再写下一段,迭代重写;race 分支先写完,slowdown 分支是后补的'同一前提下更有希望的走法'。方法论上接近兵棋推演而非模型输出——模型只约束到 SC 的时间和 takeoff 速度,地缘政治部分全靠判断。

关键结果

实证核查

有水分作为'把 takeoff 假设写成可检验预测'的练习,它罕见地诚实——代码公开、逐条自评打分;但支撑'2027 年可能到 SC'的 timelines 模型被第三方指出结构性问题且部分被作者承认,截至 2026 年实际进展慢于情景(65-75% pace),作者自己的 median 已滑到 2029 至 2030 年代初。情景骨架(RSI 主导 takeoff)仍是未验证的假设。
官方宣传语:'AI 2027 predicts AIs with superhuman coding ability in 2027',timelines forecast 给出 SC median 2027(Eli/Nikola)。
计算物理学者 titotal 2025-06 的长文批评(EA Forum/LessWrong: 'A deep critique of AI 2027's bad timeline models')逐行读了模型代码(github.com/uvafan/timelines-takeoff-ai-2027,约 300 行):superexponential 曲线'每次 doubling 时间递减 10%'的设定意味着无论从什么起点外推都会在几年内数学上发散,对近期数据拟合并无优势;主页展示的预测曲线与模型任何实际 trajectory 都对不上。审读过该批评的作者 Eli 承认部分问题并修改了 write-up;官方 2026-02 自评的 footnote 也承认原图'contained an error'(实际 METR horizon 进展是修正后中心轨迹的 1.04x,但只有原展示曲线的 0.66x)。Eli 2025-05 更新模型后自己的 median 已变成 2029。
'Our goal is predictive accuracy'——情景中 2025-2026 年的具体预测(SWE-bench 85%、OpenAI 型公司 2025 年中估值 $500B、年底收入 $18B、agent 落地节奏等)。
作者 2026-02 在 blog.aifutures.org/p/grading-ai-2027s-2025-predictions 逐条 resolve(带公开 spreadsheet):量化指标 aggregate 只有情景速度的 58-66%(7 月更新约 75%)。SWE-bench Verified 实际最好 74.5% vs 预测 85%;估值晚 ~16 个月;收入 $20B 略超预测;'最大训练 run 超过 GPT-4.5'大概率没发生。定性预测多数兑现。愿意公开给自己打 65 分这点值得肯定,但也坐实了'2027'这个标题年份基本出局——作者已把 takeoff 中位推到 2028-2030。
Takeoff forecast:SC 之后约 1 年内达到 ASI(SAR 5x→25x→250x→2000x 的 R&D multiplier 链条),并给出 human-only 时间的定量分布。
这部分没有任何可拟合的数据——SAR→SIAR '人类单干 19 年(80% CI 2.3-380)'、SIAR→ASI '95 年(CI 2.4-1,000,000)'均为作者主观估计;takeoff supplement 2025-12 新增免责声明:'This forecast relies substantially on intuitive judgment...there simply isn't enough evidence to extrapolate conclusively'。MIRI(intelligence.org 2025-04 'Thoughts on AI 2027')和 reflectivealtruism 系列等也从不同立场批评其 benchmarks-and-gaps 与 multiplier 假设。换言之,报告最核心的 RSI 快 takeoff 主张,证据强度是'结构化的专家直觉',不是模型输出。
网站首页(2025-11 加注):'我们不知道 AGI 具体何时建成,2027 是发表时的 modal 年份,median 更长'。
这个澄清是事后加的,原版传播中'2027 年出现超人 AI'就是标题和大众理解;不过作者的原始文本确实从未声称 2027 是 median,且持续公开更新 forecast(aifuturesmodel.com,2025-12 上线重构模型;Daniel 2026-01 的 SC median 为 2030 前后)。批评者与作者的争论记录完整可查:titotal 批评、作者回应(LessWrong 2025-12 'Response to titotal's critique')、Zvi 的分析各执一词但都公开。

与我们方向的关系

对做 RSI/自动化 AI 研发的课题组,这份报告的价值不在结论而在概念工具箱:AI R&D progress multiplier 的全包定义(含实验墙钟时间)、SC/SAR/SIAR/ASI 的里程碑分级、compute 与算法进步各占一半的分解,都是讨论 recursive self-improvement 时可直接引用的公共词汇。METR time horizon 外推 + benchmarks-and-gaps 两套 timelines 方法也值得作为 baseline 了解——以及 titotal 的批评展示了这类外推模型的典型失效模式(superexponential 设定支配结论、曲线与代码不一致)。

另一个可借鉴的点是'可检验预测 + 事后自评'的工作方式:AI 2027 把叙事拆成几十条可 resolve 的量化预测并在一年后公开打分(65-75% pace),这为'AI 进展到底比激进预期慢多少'提供了少见的定量锚点。做 agent 能力评估或 forecasting 相关工作时,他们的 grading spreadsheet 和 aifuturesmodel.com 的更新模型是现成的对照数据。

阅读笔记

无 arXiv 版本,主体在 ai-2027.com(有 PDF)。读的时候注意区分三层:情景叙事(Scott Alexander 执笔,证据强度最低)、timelines forecast(有数据外推,被批最狠)、takeoff forecast(纯主观分布)。中文社区讨论常把'2027 年 AGI'当成报告的 median 主张,这是误读。后续跟踪入口:blog.aifutures.org(自评与模型更新)、aifuturesmodel.com(2025-12 重构后的 timelines+takeoff 模型)。

材料清单

项目主页 / 报告ai-2027.com/
PDF 全文ai-2027.com/ai-2027.pdf
情景正文(含 race/slowdown 双结局)
五个 forecast 补充ai-2027.com/research
compute / timelines / takeoff / AI goals / security
模拟代码github.com/uvafan/timelines-takeoff-ai-2027
timelines+takeoff Monte Carlo,titotal 批评所审的即此仓库
titotal 深度批评forum.effectivealtruism.org/posts/KgejNns3ojrvCfFbi/a-deep-critique-of-ai-2027-s-bad-timeline-models
2025-06,对 timelines 模型的逐行数学批评,作者 Eli 审读过
官方 2025 预测自评blog.aifutures.org/p/grading-ai-2027s-2025-predictions
2026-02,量化指标实际进展 ~65%(后修 75%)于情景速度,附 resolve spreadsheet
更新版模型www.aifuturesmodel.com/
2025-12 重构的 timelines+takeoff 模型与作者最新 forecast