← 返回资料站  /  AI Scientist
报告 能力实证

Early science acceleration experiments with GPT-5

GPT-5 加速科学的早期实验:13 个真实研究案例
一句话OpenAI 联合 9 家机构的数学家、物理学家、生物学家,把 GPT-5(多数是 GPT-5 Pro)接进自己正在做的课题,记录了 13 个案例:4 个被认定为新的数学结果(其中 Erdős #848 已被官方问题库标为解决),多个文献检索与提速案例,以及若干失败与误导案例;单个贡献都很小(专家数小时到数天的工作量),但全部可查、附 ChatGPT 对话原始链接。

这是什么

这不是一篇方法论文,而是一份 89 页的案例集。每一节由一位领域专家亲笔写:先交代问题背景,再贴出自己给 GPT-5 的原始 prompt 和模型输出,最后写清哪部分是模型的、哪部分靠人。作者包括 Timothy Gowers(菲尔兹奖)、Mehtaab Sawhney、Christian Coester、Alex Lupsasca、Brian Spears(LLNL)、Derya Unutmaz(Jackson Lab)等,组织者是 Sébastien Bubeck(OpenAI)。

全文分四章递进:第一章「独立重新发现前沿已知结果」(检验模型能不能在无训练数据泄漏的情况下重走一遍最新论文的路);第二章「深度文献检索」;第三章「与 AI 并行工作」的工作流案例;第四章「用 AI 得到的新科研结果」。摘要里最重的一句是「四个新的数学结果,由人类作者仔细验证」。

背景很重要:这份报告发布(2025-11-20)前一个月,OpenAI 副总裁 Kevin Weil 在推特上称「GPT-5 解决了 10 个此前未解决的 Erdős 问题」,被 Thomas Bloom、Terence Tao、Demis Hassabis 等公开纠正后删推——那 10 个其实是模型帮忙找到了早已发表的解法。这份报告可以理解为 OpenAI 把话重新说一遍的正式版本,行文明显更克制,而且主动写了失败案例。

§8 ICF 燃烧波案例的主结果图:横轴是燃料密度剖面的曲率、纵轴是平均斜率,颜色是 5 keV 波前在 1-3 ns 窗口内的平均传播速度(峰值约 85 km/s),白色虚线是最优脊线 s*(c)。这张图整套流程(模型设定、11×11 参数扫描、脊线提取、绘图代码)基本由 GPT-5 Pro 产出,人只做反馈和引导——看这张图时要同时注意它的边界:模型是静态无流动的简化反应-扩散模型,网格只有 11×11 并做了 Gaussian 平滑,所以脊线是定性结论,不能当 NIF 设计参数用。
§8 ICF 燃烧波案例的主结果图:横轴是燃料密度剖面的曲率、纵轴是平均斜率,颜色是 5 keV 波前在 1-3 ns 窗口内的平均传播速度(峰值约 85 km/s),白色虚线是最优脊线 s*(c)。这张图整套流程(模型设定、11×11 参数扫描、脊线提取、绘图代码)基本由 GPT-5 Pro 产出,人只做反馈和引导——看这张图时要同时注意它的边界:模型是静态无流动的简化反应-扩散模型,网格只有 11×11 并做了 Gaussian 平滑,所以脊线是定性结论,不能当 NIF 设计参数用。

机制与做法

验证协议:靠「时间窗 + 无联网 + 人工复核」排除记忆泄漏

Bubeck 的热身实验(§1)设计得比较干净:挑 Barzilai 等人一篇 2025 年新论文,该文 v1 证明梯度下降步长 η≤1/L 时目标函数值曲线本身是凸的,并给出必要条件 η≤1.75/L;v2 把充分条件补齐到 1.75/L。实验是只给模型 v1 的 PDF,问它能不能改进步长条件。GPT-5 Pro 推理 17 分 35 秒,给出 η≤1.5/L,证明经 Bubeck 人工核对正确,且与 v2 的人类证明思路不同(v2 需要对多个不等式做巧妙加权)。作者还去翻了 reasoning trace 确认没有联网、没看到 v2。

这种「半步」是全篇的典型量级:Bubeck 自己写,1/L→1.5/L 这种结果「某些领域专家几小时能做出来,大多数专家要几天」。§11(树的子图计数不等式)也用了同样的隔离手段:关掉 web search,而且被重证的那篇 Bubeck-Linial 后续论文十年只有 3 次引用,模型看起来确实不知道已有证明。

§3 生物学案例中交给 GPT-5 Pro 解读的未发表流式细胞术图:naive(上)与 memory(下)CD8+ T 细胞经 anti-CD3/CD28 激活后第 4 天的 PD-1/LAG-3 双染,三列分别是对照、3 mM 2-DG、无糖培养。可以看到 2-DG 把 naive 细胞的 PD1+LAG3+ 双阳比例从 93.7% 压到 0.80%,而无糖组只压到 37.4%(memory 组分别是 91.8%→55.1%→85.6%)——「2-DG 效应远强于单纯缺糖」正是模型推出 N-糖基化干扰而非单纯能量限制的依据。这也是全篇最无法外部核查的一节:所有验证材料都是同一实验室的未发表数据。
§3 生物学案例中交给 GPT-5 Pro 解读的未发表流式细胞术图:naive(上)与 memory(下)CD8+ T 细胞经 anti-CD3/CD28 激活后第 4 天的 PD-1/LAG-3 双染,三列分别是对照、3 mM 2-DG、无糖培养。可以看到 2-DG 把 naive 细胞的 PD1+LAG3+ 双阳比例从 93.7% 压到 0.80%,而无糖组只压到 37.4%(memory 组分别是 91.8%→55.1%→85.6%)——「2-DG 效应远强于单纯缺糖」正是模型推出 N-糖基化干扰而非单纯能量限制的依据。这也是全篇最无法外部核查的一节:所有验证材料都是同一实验室的未发表数据。

四个「新结果」各是什么,人机分工到什么颗粒度

(1) Erdős #848(组合数论):求 [N] 中使任意 a,b 满足 ab+1 不是无平方因子的最大集合。GPT-5 Pro 提出用单个元素 b 去筛其余元素的关键构造,配合网友 van Doorn/Weisenberg/Cambie 的既有进展,Sawhney 完成证明:最大集合就是 7 mod 25(或 18 mod 25)。(2) §11 树的子图计数:GPT-5 把 Y−9S−P≤6 的原 4 页分类讨论压缩成 1.5 页的局部顶点代数恒等式,并在此框架上首次证明了 Bubeck-Linial 2016 年留下的第二个不等式 29Y−42P−144S≤504。(3) §10 凸体追逐:GPT-5 一个 prompt 就给出反例证明 follow-the-leader 算法竞争比无穷,随后协助把任意在线算法的下界从 √d 抬到 (π/2)√⌊d/2⌋≈1.11√d。(4) §11.5 一个 2012 年 COLT 开放问题:偏好依附树中参数 w 是否可辨识,模型自己想到用叶子比例 L(t) 这个量并证明可辨识。

分工写得很细,也不掩饰模型的毛病。§11.5 说主要思路全是 GPT-5 的,但它省略了中间步骤,而无 scaffold 版本补细节时几次跑偏(错误声称 Robbins 1971 定理 1 直接给出 V_t→0 几乎必然收敛,实际只给收敛性),人推了几轮才拿到一个正确但冗长的证明。§2 的 Kerr 黑洞对称性,模型第一次推 5 分钟后直接断言「除平凡缩放外没有连续对称性」,要先做平直空间热身才拿到正确的 SL(2,R) 生成元。

文献检索是目前最扎实的用途;跨学科建模是「快速起步」而非「代替专家」

§5 的做法很实用:直接把 Erdős 问题的完整数学陈述丢给 GPT-5,而不是「猜正确的搜索词」。结果是在 1105 个问题(截至 2025-10-31 有 685 个标为 open)中,为 10 个问题找到了早已发表但被遗忘的解法(#223、339、494、515、621、822、883、903、1043、1079),为另外 10 个补上文献中的部分进展,还改了 #1041 的一处笔误。溢出效应更有意思:Bloom 和 Tao 随后开始在网站上贴「negative literature search」——多个模型都没找到既有解法,作为「该问题大概真的没解」的软证书。

§8(LLNL 的 Spears)是最完整的工作流样本:用一段长 prompt 让 GPT-5 Pro 从零搭一个静态反应-扩散 ICF 燃烧波模型(热斑 + 二次密度斜坡 + 冷燃料三区,含热传导、alpha 粒子非局域沉积、辐射损失),再让它设计数值实验、跑出参数扫描、最后给理论解释。作者的评价是「大部分结果由 GPT-5 产出,我只提供反馈和引导」,并明说对话质量「和跟国家实验室同行讨论时差不多」。附录贴了完整 Python 代码(约 70 行核心逻辑,11×11 的 slope-curvature 网格 + Gaussian 平滑)。

§3(Jackson Lab 的 Unutmaz)是唯一的湿实验案例:上传自家未发表的流式细胞术图,让模型解释为什么 2-DG(糖酵解抑制剂)在启动期短暂处理后两周仍留下 Th17 印记(IL-17A+ 提高 13 倍,CCR6/CD161 提高 16-20 倍)。模型给出的核心机制假设是 2-DG 干扰 N-连接糖基化 → IL2Rα(CD25) 表面表达下降 → IL-2/STAT5 信号减弱 → 解除对 Th17 分化的抑制,作者称这个连接他们此前没想到。

关键结果

实证核查

有水分报告本身的行文相当诚实——附了可打开的对话原文,写了失败案例和归因事故,量级也不吹(自称「专家数小时到数天」)。打折的地方在于:四个新结果中只有 Erdős #848 有独立第三方痕迹,其余三个由 OpenAI 自家作者(且是原问题提出者)自我验证;生物学案例的验证材料全部是未发表内部数据;全篇没有任何尝试次数/成功率统计,「加速」的量级无法核算。
摘要:「本文包含四个新的数学结果(由人类作者仔细验证),说明 GPT-5 能帮人类数学家解决此前未解决的问题」。
四个中只有 Erdős #848 可外部核查:erdosproblems.com/848 现已标为 DECIDABLE/已解决,引用 Sawhney 的 4 页 note(https://www.math.columbia.edu/~msawhney/Problem_848.pdf)。另三个(§11 树不等式 29Y−42P−144S≤504、§10 凸体追逐 1.11√d 下界、§11.5 COLT 可辨识性)截至 2026-08 在 Semantic Scholar 的引用图里都没有独立的期刊/会议论文落地,验证者就是本报告作者本人——而 §11 的原猜想是 Bubeck 2016 年自己提的,§10 的下界线也是 Bubeck 参与的既有工作线,属于自评自验。
Sawhney/Sellke:Erdős #848 「由第一作者与 GPT-5 共同解决」。
这条经得起查,而且比报告说得更细。Sawhney 的独立 note 第 4 节明确写:证明在 ChatGPT 5 Pro 协助下得到,关键的 Lemma 2.2 变体由它提出(它注意到可以按 b 和公差排除某些素数);但它试图证明「不能有两个 mod 25 剩余类都有正密度」的多次尝试「以各种繁复且错误的方式」进行,人类用 mod 169 的类比反例把它们否掉,再顺着它的失败尝试想出正确路线;另外 note 里的辅助素数最初是 3,后来人发现用 2 更干净。对话链接 chatgpt.com/share/68ec50da-... 现仍可打开,标题「Inclusion exclusion proof」,日期 10 月 12 日,与描述一致。
OpenAI 对外口径(报告发布前一个月):「GPT-5 找到了 10 个此前未解决的 Erdős 问题的解,并在另外 11 个上取得进展」。
该说法(Kevin Weil,2025-10)在 Thomas Bloom、Terence Tao 指出后被删推,Demis Hassabis 公开称之为尴尬事件(the-decoder.com「Leading OpenAI researcher announced a GPT-5 math breakthrough that never happened」、eweek「GPT-5's Math 'Breakthrough' Gets F-Minus for Hype」)。本报告 §5 的表述已改正为「locating previously published solutions to 10 problems」,即文献检索,并逐一列出问题编号。读这份报告时要注意:同一批工作在营销口径下曾被说成「解题」,报告文本本身没有这么说。
「我们记录了人机交互过程,并在可能时提供 ChatGPT 对话记录」,以支撑可复现。
bib 里共 7 个 chatgpt.com/share 链接,抽查仍可访问,这一点比多数同类报告实在(catalog 中 code_url 为空,唯一可运行代码是 §8 附录里贴的 ICF 模拟脚本)。但报告自己在引言承认「结果依赖 prompt 与追问的细节,因而可能难以复现」,全篇没有给出任何一个案例的尝试次数、失败次数或 pass@k,§11 只含糊说「也生成了几个错误证明并被人工否掉」。因此「GPT-5 能做到 X」这类陈述实际是存在性证明,不能读成成功率。
§3:GPT-5 Pro 可以充当「真正的机制共同研究者」,并正确预测了 CAR-T 制备期短暂 2-DG 处理会增强杀伤活性。
该节所有验证依据均为同一实验室的未发表数据——原文用词是「we had internally validated in unpublished results」、「we have direct and unpublished experiments showing this exact reduction in signal strength」,配图(figures/CD8_figure、derya_image_1-3)也是未发表的流式面板。外部无法核查,而模型给出的 N-糖基化/TCR 信号强度机制属于可信叙事型假设,并未被模型自身检验。这是全篇最不可验证的一节,需当作案例陈述而非证据看。
报告呈现的是 GPT-5 在科研中的正面能力样本。
报告确实自留了反面样本,应给分:§12「Clique-avoiding codes: a cautionary tale」记录作者一度以为模型给出的 ⌊n/2⌋ 余维结果是新的,其实是 Alon《Graph-Codes》(2024) Theorem 1.6,且模型是在人类自己发现该文献之后才报出引用,结论是 LLM 「可能不准确地报告原始信息来源,足以骗过资深研究者」。§2 首轮错误否定、§7 首次运行挂死数小时被作者掐掉、§6 Gowers 明确写「LLM 尚未在我这里做出决定性贡献」且遇到过幻觉引用(作者名也搞错),都保留在文中。

与我们方向的关系

这是评估「AI 加速科研」真实水位最有价值的一手材料之一,原因不在结论而在体例:每个案例都写了 prompt 原文、模型思考时长、人做了什么、模型错在哪。我们做 AI-scientist 方向的能力评估时可以直接借用它的三条隔离手段——用训练截止后才出现的论文版本(v1→v2 这种同一问题的两个版本尤其好用)、关闭联网并检查 reasoning trace、由原问题提出者做人工复核。§1 的 v1/v2 设计特别值得抄:它把「模型能否复现已知结果」变成了一个有明确 ground truth 又不可能记忆泄漏的可控实验。

另一个直接可用的结论是任务谱系:目前最稳的是跨领域语义级文献检索(把定理陈述而不是关键词丢进去),其次是「否定我的想法」——Gowers 和 Coester 都报告模型在几十秒到十几分钟内构造反例、指出思路为何行不通,这比让它正面攻坚有效得多;最弱的是开放式提问,模型会顺着你说「你的想法确实成立」再编一段撑不住细节的论证。以及 §12 的教训要写进组内规范:LLM 给的引用和「这是新结果」的判断必须独立查证,归因错误比数学错误更难被发现。

阅读笔记

全文 89 页,arXiv HTML 版(https://arxiv.org/html/2511.16072v1)含所有对话框,读起来比 PDF 方便。建议的阅读顺序:引言 → §1(方法论范式)→ §5+§9(Erdős,附 Sawhney 独立 note 对读)→ §6(Gowers 的清醒评估)→ §12(反面案例)。§8 长达 509 行,想看完整 AI 辅助建模工作流再读。注意这是 arXiv 报告而非同行评审论文,「四个新结果」的验证主体是作者自己。另外 §1 结尾提到「我们内部能思考几小时的模型可以从零推出最优的 1.75/L」,这类关于未发布模型的声明完全无法核查。

材料清单

TeX 源码
已存档:Raw/early-science-acceleration-experiments-with/source/
项目主页 / 报告arxiv.org/abs/2511.16072
Erdős #848 页面www.erdosproblems.com/848
第三方核查入口:该问题现标为已解决,引用 Sawhney 的 note
Sawhney 的 4 页独立 notewww.math.columbia.edu/~msawhney/Problem_848.pdf
§4 详述 GPT-5 Pro 的具体贡献与它错在哪,比报告本身更细
对话原文(Erdős #848)chatgpt.com/share/68ec50da-cf00-8005-b5f6-b683506e5853
抽查仍可访问;bib 中共 7 个此类 share 链接
arXiv HTML 全文arxiv.org/html/2511.16072v1
89 页,含全部对话框与图
「10 个 Erdős 问题」事故报道the-decoder.com/leading-openai-researcher-announced-a-gpt-5-math-breakthrough-that-never-happened/
本报告发布前一个月的营销口径翻车,读报告时的必要背景
第三方批评性精读medium.com/@AIchats/openais-science-acceleration-experiment-cc09dcae0b7c
Anatol Wegner 借 Gemini 3.0 逐节复核 §11 树不等式等新结果的技术细节