报告
能力实证
Early science acceleration experiments with GPT-5
GPT-5 加速科学的早期实验:13 个真实研究案例
Sébastien Bubeck, Christian Coester, Ronen Eldan, Timothy Gowers, Yin Tat Lee, Alexandru Lupsasca, Mehtaab Sawhney, Robert Scherrer, Mark Sellke, Brian K. Spears, Derya Unutmaz, Kevin Weil, Steven Yin, Nikita Zhivotovskiy · OpenAI · arXiv · 2025-11 · 被引 42
一句话 OpenAI 联合 9 家机构的数学家、物理学家、生物学家,把 GPT-5(多数是 GPT-5 Pro)接进自己正在做的课题,记录了 13 个案例:4 个被认定为新的数学结果(其中 Erdős #848 已被官方问题库标为解决),多个文献检索与提速案例,以及若干失败与误导案例;单个贡献都很小(专家数小时到数天的工作量),但全部可查、附 ChatGPT 对话原始链接。
这是什么 这不是一篇方法论文,而是一份 89 页的案例集。每一节由一位领域专家亲笔写:先交代问题背景,再贴出自己给 GPT-5 的原始 prompt 和模型输出,最后写清哪部分是模型的、哪部分靠人。作者包括 Timothy Gowers(菲尔兹奖)、Mehtaab Sawhney、Christian Coester、Alex Lupsasca、Brian Spears(LLNL)、Derya Unutmaz(Jackson Lab)等,组织者是 Sébastien Bubeck(OpenAI)。
全文分四章递进:第一章「独立重新发现前沿已知结果」(检验模型能不能在无训练数据泄漏的情况下重走一遍最新论文的路);第二章「深度文献检索」;第三章「与 AI 并行工作」的工作流案例;第四章「用 AI 得到的新科研结果」。摘要里最重的一句是「四个新的数学结果,由人类作者仔细验证」。
背景很重要:这份报告发布(2025-11-20)前一个月,OpenAI 副总裁 Kevin Weil 在推特上称「GPT-5 解决了 10 个此前未解决的 Erdős 问题」,被 Thomas Bloom、Terence Tao、Demis Hassabis 等公开纠正后删推——那 10 个其实是模型帮忙找到了早已发表的解法。这份报告可以理解为 OpenAI 把话重新说一遍的正式版本,行文明显更克制,而且主动写了失败案例。
§8 ICF 燃烧波案例的主结果图:横轴是燃料密度剖面的曲率、纵轴是平均斜率,颜色是 5 keV 波前在 1-3 ns 窗口内的平均传播速度(峰值约 85 km/s),白色虚线是最优脊线 s*(c)。这张图整套流程(模型设定、11×11 参数扫描、脊线提取、绘图代码)基本由 GPT-5 Pro 产出,人只做反馈和引导——看这张图时要同时注意它的边界:模型是静态无流动的简化反应-扩散模型,网格只有 11×11 并做了 Gaussian 平滑,所以脊线是定性结论,不能当 NIF 设计参数用。 机制与做法 验证协议:靠「时间窗 + 无联网 + 人工复核」排除记忆泄漏
Bubeck 的热身实验(§1)设计得比较干净:挑 Barzilai 等人一篇 2025 年新论文,该文 v1 证明梯度下降步长 η≤1/L 时目标函数值曲线本身是凸的,并给出必要条件 η≤1.75/L;v2 把充分条件补齐到 1.75/L。实验是只给模型 v1 的 PDF,问它能不能改进步长条件。GPT-5 Pro 推理 17 分 35 秒,给出 η≤1.5/L,证明经 Bubeck 人工核对正确,且与 v2 的人类证明思路不同(v2 需要对多个不等式做巧妙加权)。作者还去翻了 reasoning trace 确认没有联网、没看到 v2。
这种「半步」是全篇的典型量级:Bubeck 自己写,1/L→1.5/L 这种结果「某些领域专家几小时能做出来,大多数专家要几天」。§11(树的子图计数不等式)也用了同样的隔离手段:关掉 web search,而且被重证的那篇 Bubeck-Linial 后续论文十年只有 3 次引用,模型看起来确实不知道已有证明。
§3 生物学案例中交给 GPT-5 Pro 解读的未发表流式细胞术图:naive(上)与 memory(下)CD8+ T 细胞经 anti-CD3/CD28 激活后第 4 天的 PD-1/LAG-3 双染,三列分别是对照、3 mM 2-DG、无糖培养。可以看到 2-DG 把 naive 细胞的 PD1+LAG3+ 双阳比例从 93.7% 压到 0.80%,而无糖组只压到 37.4%(memory 组分别是 91.8%→55.1%→85.6%)——「2-DG 效应远强于单纯缺糖」正是模型推出 N-糖基化干扰而非单纯能量限制的依据。这也是全篇最无法外部核查的一节:所有验证材料都是同一实验室的未发表数据。 四个「新结果」各是什么,人机分工到什么颗粒度
(1) Erdős #848(组合数论):求 [N] 中使任意 a,b 满足 ab+1 不是无平方因子的最大集合。GPT-5 Pro 提出用单个元素 b 去筛其余元素的关键构造,配合网友 van Doorn/Weisenberg/Cambie 的既有进展,Sawhney 完成证明:最大集合就是 7 mod 25(或 18 mod 25)。(2) §11 树的子图计数:GPT-5 把 Y−9S−P≤6 的原 4 页分类讨论压缩成 1.5 页的局部顶点代数恒等式,并在此框架上首次证明了 Bubeck-Linial 2016 年留下的第二个不等式 29Y−42P−144S≤504。(3) §10 凸体追逐:GPT-5 一个 prompt 就给出反例证明 follow-the-leader 算法竞争比无穷,随后协助把任意在线算法的下界从 √d 抬到 (π/2)√⌊d/2⌋≈1.11√d。(4) §11.5 一个 2012 年 COLT 开放问题:偏好依附树中参数 w 是否可辨识,模型自己想到用叶子比例 L(t) 这个量并证明可辨识。
分工写得很细,也不掩饰模型的毛病。§11.5 说主要思路全是 GPT-5 的,但它省略了中间步骤,而无 scaffold 版本补细节时几次跑偏(错误声称 Robbins 1971 定理 1 直接给出 V_t→0 几乎必然收敛,实际只给收敛性),人推了几轮才拿到一个正确但冗长的证明。§2 的 Kerr 黑洞对称性,模型第一次推 5 分钟后直接断言「除平凡缩放外没有连续对称性」,要先做平直空间热身才拿到正确的 SL(2,R) 生成元。
文献检索是目前最扎实的用途;跨学科建模是「快速起步」而非「代替专家」
§5 的做法很实用:直接把 Erdős 问题的完整数学陈述丢给 GPT-5,而不是「猜正确的搜索词」。结果是在 1105 个问题(截至 2025-10-31 有 685 个标为 open)中,为 10 个问题找到了早已发表但被遗忘的解法(#223、339、494、515、621、822、883、903、1043、1079),为另外 10 个补上文献中的部分进展,还改了 #1041 的一处笔误。溢出效应更有意思:Bloom 和 Tao 随后开始在网站上贴「negative literature search」——多个模型都没找到既有解法,作为「该问题大概真的没解」的软证书。
§8(LLNL 的 Spears)是最完整的工作流样本:用一段长 prompt 让 GPT-5 Pro 从零搭一个静态反应-扩散 ICF 燃烧波模型(热斑 + 二次密度斜坡 + 冷燃料三区,含热传导、alpha 粒子非局域沉积、辐射损失),再让它设计数值实验、跑出参数扫描、最后给理论解释。作者的评价是「大部分结果由 GPT-5 产出,我只提供反馈和引导」,并明说对话质量「和跟国家实验室同行讨论时差不多」。附录贴了完整 Python 代码(约 70 行核心逻辑,11×11 的 slope-curvature 网格 + Gaussian 平滑)。
§3(Jackson Lab 的 Unutmaz)是唯一的湿实验案例:上传自家未发表的流式细胞术图,让模型解释为什么 2-DG(糖酵解抑制剂)在启动期短暂处理后两周仍留下 Th17 印记(IL-17A+ 提高 13 倍,CCR6/CD161 提高 16-20 倍)。模型给出的核心机制假设是 2-DG 干扰 N-连接糖基化 → IL2Rα(CD25) 表面表达下降 → IL-2/STAT5 信号减弱 → 解除对 Th17 分化的抑制,作者称这个连接他们此前没想到。
关键结果 §1:仅给 v1 论文,GPT-5 Pro 推理 17 分 35 秒把步长充分条件从 η≤1/L 改进到 η≤1.5/L(最优是 1.75/L),证明人工核对正确、且与 v2 的人类证明路线不同;作者称这个量级「专家几小时到几天」。 §5:GPT-5 帮 Erdős 问题库定位 10 个已发表但被遗忘的解法 + 10 个部分进展 + 1 处笔误,均为文献检索,不是新证明。 §9:Erdős #848 被真正解决——最大集合为 {n≤N: n≡7 mod 25},且密度 ≥(1/25−η)N 的集合必包含在 7 或 18 mod 25 之一中。 §11:GPT-5 把已知不等式 Y−9S−P≤6 的证明从 4 页压到 1.5 页,并首证开放的第二不等式 29Y−42P−144S≤504;两个证明「除少量文字编辑外全部 AI 生成」,过程中也产生了几个被人工否掉的错误证明。 §10:凸体追逐任意在线算法下界由 √d 提升到 (π/2)√⌊d/2⌋≈1.11√d;另外单个 prompt 推理 16 分 19 秒即给出 follow-the-leader 在二维嵌套情形竞争比无穷的反例。 §7:宇宙弦引力波功率谱的球面积分,GPT-5 Pro 推理 40 分钟给出奇数 n 的大 n 渐近式(与作者此前偶数 n 结果一致),方法完全不同(Legendre→Bessel 展开),还多给了作者不知道的次阶修正项 4π[ln(nπ)+γ−Ci(nπ)];作者称 Mathematica 做不到。 §8:参数扫描给出「浅斜率 + 中等负曲率」的最优燃料密度剖面脊线,5 keV 波前平均速度峰值约 85 km/s(1-3 ns 窗口内最小二乘拟合)。 §2:Kerr 背景稳态轴对称波方程的 SL(2,R) Lie 点对称性,模型首轮 5 分钟给出错误否定答案,加平直空间热身后才复现出正确生成元。 §12(反面案例):作者以为 GPT-5 Pro 给出的 clique-avoiding code 最小余维 ⌊n/2⌋ 是新结果,实际是 Alon《Graph-Codes》(2024) 的 Theorem 1.6;模型是在人类先自行发现该文献之后才报出这个引用。 实证核查
有水分 报告本身的行文相当诚实——附了可打开的对话原文,写了失败案例和归因事故,量级也不吹(自称「专家数小时到数天」)。打折的地方在于:四个新结果中只有 Erdős #848 有独立第三方痕迹,其余三个由 OpenAI 自家作者(且是原问题提出者)自我验证;生物学案例的验证材料全部是未发表内部数据;全篇没有任何尝试次数/成功率统计,「加速」的量级无法核算。
摘要:「本文包含四个新的数学结果(由人类作者仔细验证),说明 GPT-5 能帮人类数学家解决此前未解决的问题」。
四个中只有 Erdős #848 可外部核查:erdosproblems.com/848 现已标为 DECIDABLE/已解决,引用 Sawhney 的 4 页 note(https://www.math.columbia.edu/~msawhney/Problem_848.pdf)。另三个(§11 树不等式 29Y−42P−144S≤504、§10 凸体追逐 1.11√d 下界、§11.5 COLT 可辨识性)截至 2026-08 在 Semantic Scholar 的引用图里都没有独立的期刊/会议论文落地,验证者就是本报告作者本人——而 §11 的原猜想是 Bubeck 2016 年自己提的,§10 的下界线也是 Bubeck 参与的既有工作线,属于自评自验。
Sawhney/Sellke:Erdős #848 「由第一作者与 GPT-5 共同解决」。
这条经得起查,而且比报告说得更细。Sawhney 的独立 note 第 4 节明确写:证明在 ChatGPT 5 Pro 协助下得到,关键的 Lemma 2.2 变体由它提出(它注意到可以按 b 和公差排除某些素数);但它试图证明「不能有两个 mod 25 剩余类都有正密度」的多次尝试「以各种繁复且错误的方式」进行,人类用 mod 169 的类比反例把它们否掉,再顺着它的失败尝试想出正确路线;另外 note 里的辅助素数最初是 3,后来人发现用 2 更干净。对话链接 chatgpt.com/share/68ec50da-... 现仍可打开,标题「Inclusion exclusion proof」,日期 10 月 12 日,与描述一致。
OpenAI 对外口径(报告发布前一个月):「GPT-5 找到了 10 个此前未解决的 Erdős 问题的解,并在另外 11 个上取得进展」。
该说法(Kevin Weil,2025-10)在 Thomas Bloom、Terence Tao 指出后被删推,Demis Hassabis 公开称之为尴尬事件(the-decoder.com「Leading OpenAI researcher announced a GPT-5 math breakthrough that never happened」、eweek「GPT-5's Math 'Breakthrough' Gets F-Minus for Hype」)。本报告 §5 的表述已改正为「locating previously published solutions to 10 problems」,即文献检索,并逐一列出问题编号。读这份报告时要注意:同一批工作在营销口径下曾被说成「解题」,报告文本本身没有这么说。
「我们记录了人机交互过程,并在可能时提供 ChatGPT 对话记录」,以支撑可复现。
bib 里共 7 个 chatgpt.com/share 链接,抽查仍可访问,这一点比多数同类报告实在(catalog 中 code_url 为空,唯一可运行代码是 §8 附录里贴的 ICF 模拟脚本)。但报告自己在引言承认「结果依赖 prompt 与追问的细节,因而可能难以复现」,全篇没有给出任何一个案例的尝试次数、失败次数或 pass@k,§11 只含糊说「也生成了几个错误证明并被人工否掉」。因此「GPT-5 能做到 X」这类陈述实际是存在性证明,不能读成成功率。
§3:GPT-5 Pro 可以充当「真正的机制共同研究者」,并正确预测了 CAR-T 制备期短暂 2-DG 处理会增强杀伤活性。
该节所有验证依据均为同一实验室的未发表数据——原文用词是「we had internally validated in unpublished results」、「we have direct and unpublished experiments showing this exact reduction in signal strength」,配图(figures/CD8_figure、derya_image_1-3)也是未发表的流式面板。外部无法核查,而模型给出的 N-糖基化/TCR 信号强度机制属于可信叙事型假设,并未被模型自身检验。这是全篇最不可验证的一节,需当作案例陈述而非证据看。
报告呈现的是 GPT-5 在科研中的正面能力样本。
报告确实自留了反面样本,应给分:§12「Clique-avoiding codes: a cautionary tale」记录作者一度以为模型给出的 ⌊n/2⌋ 余维结果是新的,其实是 Alon《Graph-Codes》(2024) Theorem 1.6,且模型是在人类自己发现该文献之后才报出引用,结论是 LLM 「可能不准确地报告原始信息来源,足以骗过资深研究者」。§2 首轮错误否定、§7 首次运行挂死数小时被作者掐掉、§6 Gowers 明确写「LLM 尚未在我这里做出决定性贡献」且遇到过幻觉引用(作者名也搞错),都保留在文中。
与我们方向的关系 这是评估「AI 加速科研」真实水位最有价值的一手材料之一,原因不在结论而在体例:每个案例都写了 prompt 原文、模型思考时长、人做了什么、模型错在哪。我们做 AI-scientist 方向的能力评估时可以直接借用它的三条隔离手段——用训练截止后才出现的论文版本(v1→v2 这种同一问题的两个版本尤其好用)、关闭联网并检查 reasoning trace、由原问题提出者做人工复核。§1 的 v1/v2 设计特别值得抄:它把「模型能否复现已知结果」变成了一个有明确 ground truth 又不可能记忆泄漏的可控实验。
另一个直接可用的结论是任务谱系:目前最稳的是跨领域语义级文献检索(把定理陈述而不是关键词丢进去),其次是「否定我的想法」——Gowers 和 Coester 都报告模型在几十秒到十几分钟内构造反例、指出思路为何行不通,这比让它正面攻坚有效得多;最弱的是开放式提问,模型会顺着你说「你的想法确实成立」再编一段撑不住细节的论证。以及 §12 的教训要写进组内规范:LLM 给的引用和「这是新结果」的判断必须独立查证,归因错误比数学错误更难被发现。
阅读笔记 全文 89 页,arXiv HTML 版(https://arxiv.org/html/2511.16072v1)含所有对话框,读起来比 PDF 方便。建议的阅读顺序:引言 → §1(方法论范式)→ §5+§9(Erdős,附 Sawhney 独立 note 对读)→ §6(Gowers 的清醒评估)→ §12(反面案例)。§8 长达 509 行,想看完整 AI 辅助建模工作流再读。注意这是 arXiv 报告而非同行评审论文,「四个新结果」的验证主体是作者自己。另外 §1 结尾提到「我们内部能思考几小时的模型可以从零推出最优的 1.75/L」,这类关于未发布模型的声明完全无法核查。
材料清单 TeX 源码 已存档:Raw/early-science-acceleration-experiments-with/source/