跳到主内容
爱游戏平台

GPT-6数学封神,遭顶尖数学家公开质疑“算力截胡”?OpenAI内部研究员撕开Astra真相:人脑更容易被污染,而AI只看概率

2026-09-09 · 林欣然 · 更新于 2026-09-15

这两周数学界很不平静。围绕着 OpenAI 最新发布的 GPT-6 Astra,学术圈掀起了一场前所未有的风暴:模型先是在专家级数学基准 FrontierMath Tier 4 上跑出了 98% 的通关级分数;紧接着,OpenAI 又放出一篇长达 165 页的技术报告,宣布利用内部系统调度 10,000 个 AI Agent 协同推演 88 小时,给出了千禧年七大数学难题之一——纳维-斯托克斯(Navier-Stokes)方程光滑驱动下奇异性爆破的机器验证证明。

这一爆炸性成果随即引爆了学术伦理争议,纽约大学教授 Tristan Buckmaster 与 Anthropic 数学家公开质疑 OpenAI 是否利用了用户存放在 Codex 中的草稿思路进行“算力截胡”;菲尔兹奖得主陶哲轩更是直言,当科技巨头凭借算力集群能在几天内“平推”公开研究线索时,传统的学术交流传统正面临巨大冲击。

但 Navier-Stokes 的震荡并不是凭空掉下来的,过去几个月 OpenAI 在纯数学领域早已步步为营:先是在 5 月构造出了埃尔德什(Erdős)单位距离猜想的历史级反例;8 月又仅花费约 2,000 美元推理成本,直接在十个跨代数、几何与理论计算机的硬核悬案上取得突破,一举锁定了高维球堆积中 Cohn-Elkies 线性规划的渐近极限,并显式构造出数学界追寻半个世纪的“非 Sofic 群”。AI 已经不再满足于在奥数竞赛里拿金牌,而是真刀真枪地推进了人类数学的认知边界。

在这一系列成果落地之际,顶级风投机构 a16z 的基础架构合伙人 Lisha Li(十多年前离开理论数学界进入创投)找来了两位身处风暴核心的对谈者:OpenAI 全职数学家 Mark Sellke 与 Mehtaab Sawhney。两人是极具代表性的年轻一代数学学者,曾共同师从著名华人数学家赵宇飞。去年夏天在看到模型展现出的推理飞跃后,他们选择离开传统教职加入 OpenAI,直接参与了这一波数学模型的研发与选题。

在这场一个多小时的深入对谈中,两位研究员从一线数学家的视角拆解了这套全新范式的本质:

要点速览

  • 关于死磕到底:  “作为职业数学家,你冒出一个点子去试,往往几天或几个星期没进展就放弃了。但对大模型来说,‘人类既然让我做,那我就死磕到底’——能否把一个抽象思路在技术细节上真正做通,往往占据了攻坚的大半壁江山。”
  • 关于思维污染:  “人类在一条死胡同里走得太远,最初的概念就会和失败细节纠缠在一起,你的内在‘上下文窗口’被污染了,很难清空执念另辟蹊径;但 AI 不受情绪干扰,它能冷静动态修正路径概率,甚至直接并行开启一个全新无污染的会话。”
  • 关于证明的审美:  “一年前我们还以为 AI 生成的证明多半会是一团上千页、晦涩难读的浆糊。现实却完全反了过来:现在动辄写出 200 页冗长证明的是人类,而 AI 驳倒近半个世纪未决的群论猜想,只用了区区 15 页纯正典雅的经典数学工具。”
  • 关于学术品味(Taste):  “能通过更具远见的战略判断直捣黄龙、更迅速地解决问题,就是对学术品味最硬核的度量。大模型不仅具备极佳的解题直觉,在人类追问‘能否推向极致’时,它能自发挖掘出此前深埋在表示论与高维几何底层的统一纽带。”
  • 关于未来分工:  “过去,谁推导出力透纸背的证明,谁就对它理解最深、享有最高话语权。当硬核推导的体力活被 AI 接管,人类的核心价值将转向搭建宏大框架、联通跨学科知识,以及把深奥复杂的结论解释通透——群体的认知整合将成为真正的核心舞台。”

以下为本次对谈的编译整理:

埃尔德什猜想被 GPT-5 用五分钟撕开了一道口子

主持人:感谢两位来参加对谈。在 AI 的带动下,数学领域的进展非常迅速,这让人很受鼓舞。两位既是活跃在一线的数学家,目前又在 OpenAI 工作,我很想借这个机会和你们聊聊最近取得的这些成果。

今天做客的是 Mark Sellke 和 Mehtaab Sawhney。我们其实有些渊源——Yufei Zhao 曾是你们的导师。我在十多年前就离开了学术界,而你们两位在数学领域的研究要深入得多。

我很想听听你们的想法:OpenAI 是如何切入这个方向的?随着 AI 快速演进,你们认为数学研究未来会走向何方?

我们可以先从几个基础问题聊起:在可以透露的范围内,你们在 OpenAI 具体做些什么?又是怎样从职业数学家转行加入 OpenAI 的?

Mark Sellke: 大体来说,去年模型在数学能力上开始突飞猛进时,我们俩都感到非常激动。

我比 Mehtaab 加入得稍微早一些。去年夏天我看到模型达到 IMO 金牌水准的成果,当时就想:“这也太厉害了,我得看看他们到底是怎么做到的。干脆去一探究竟。”

Mehtaab Sawhney: 到了秋天,Mark 给了我一个 GPT-5 账号。我开始试用这些模型,很快就确信这确实非常令人兴奋。

主持人:你们在这之前就合作过?认识很久了吧?

Mark Sellke: 对,我们之前确实合写过一篇论文。

主持人:所以 GPT-5 是促使你观念转变的关键节点。它到底神奇在哪里?你当时给它提了什么问题,整个过程又是怎样的?

Mehtaab Sawhney: 对我来说,最初的起点是一批未解决的问题。

著名数学家 Paul Erdős 曾提出过大量数学问题,现在有人把它们整理到了一个专门的网站上。我的研究方向正是组合数学,而这些问题很多都是该领域最重要的课题。平时翻翻那个网站挺有意思的。

但我经常遇到一件很让人头疼的事:看到一个标着“未解决”的问题,却不知道这个状态到底是不是最新的,因为数学文献往往很难做彻底的检索。

有一次,我把一个问题输入给 GPT-5。五分钟后,它就找到了一篇相关的参考文献。

我当时有几个朋友正好在琢磨网站上的那个问题;我们花过几个小时讨论,还不清楚这个问题到底能不能做出来。所以当有人告诉你“能做出来,方法是这样的”时,那种感觉真的很好。

GPT-5 给出了答案。我把这件事告诉了 Mark,对我而言,那确实是一个挺让人意外的时刻。

Mark Sellke: 后来我们做进一步调查,在当时又找到了大约十个类似的案例。

人类的脑子容易被挫败感污染

主持人:在海量文献中检索此前是否存在相关成果,对人类来说非常困难,但机器天生擅长这一点。

不过,随着过去一年进展加快,真正令人印象深刻的地方,显然已经远远超出了文献检索和浅层关联的范畴。

无论从宏观角度,还是结合最近 Astra 公布的某个具体问题,你们能否谈谈,近期的进展是如何深入到真正的数学推理层面的——也就是像职业数学家那样去思考?

Mark Sellke: 检索能力——也就是对所有文献了然于胸——仍然是一项相对优势,也决定了 AI 目前能解决哪些类型的问题。但它还有其他显著的长处。

另一个突出的优势在于,一旦有了思路,它能极其可靠地将其执行到位。

在数学中,当你有了想法之后,通常需要把各个环节落实理顺:比如验证   是否确实小于  ,并确保整个过程在技术上足够严谨。

人类很容易迷失在这些细枝末节中,但模型却总能把这类精细的技术推演处理得非常扎实。

主持人:比如在 Erdős 单位距离问题上,整体的大方向最初是由 Erdős 提出的,而真正的难点在于完成具体的推导吗?

对人类来说,时间是有限的。如果尝试了很多步之后进展依然不明朗——除非像 Andrew Wiles 那样独自苦思十年——否则投入产出比就不再合理了。而对 GPT 来说,它的反应是:“既然人类让我试这个,那我就去把它做出来。”

这是否就是近期大量难题迎来突破的原因?Astra 的成果主要源于这种执行能力,还是有其他关键因素?

Mehtaab Sawhney: 单位距离问题的例子很有代表性。从构造本身来看,它在概念上与前人尝试过的方法其实很接近。

作为研究一线的数学家,你常常冒出一个念头,觉得或许可行,试了几个小时、几天甚至几周,最后还是放弃了。而在研究中经常遇到的情况是:一两年后,你发现别人把你放弃的那个思路真正做通了。能否把一个思路彻底落实,往往占了整个攻关过程的很大比重。

具体到单位距离猜想,其中的细节极其繁琐。做数学研究时,你其实一直在与问题权衡博弈:“我或许该试试这个方法,但看起来希望不大,不值得投入时间。”

而模型将已有的知识储备与良好的数学品味结合起来,押对了方向。

在我们公布的思维链摘要中可以清楚地看到这一点:它的推理方式很像数学家。因为它准确掌握了几项核心事实,从而做出了合理的判断,有效缩减了搜索空间。

它并没有盲目去试每一种可能。它非常执着,但始终聚焦在一组精选的候选思路之中。依靠自身的知识积累与判断力,它找到了正确的路径。

很多人都思考过这个问题,既然底层的构造思路并不算全然陌生,就意味着此前很可能有严肃的数学家尝试过。这也正是看到模型成功解决该问题时最让人信服的地方。

Mark Sellke: 读这些证明时,我还有另一个感受:如果我自己想到了一个思路并尝试推进,很可能会陷入一个有缺陷的方案。

作为人类,一旦在错误的方向上走了一阵子,就很难把思维调整回来重新开始去走另一条路。

最初的想法在你的脑海中已经和那些行不通的环节绑定在了一起——你内在的“上下文窗口”被污染了。

你不可能把上周的自己复制一份,然后对他说:“不要走这条路,试试别的方案,换个方向重建直觉。”

但对 AI 来说,这完全是不费吹灰之力的事。一旦锁定了有希望的方向,要把技术细节做扎实,阻力一下子就小了很多。

比人类还要清醒理性的概率纠偏

主持人:你说借助 AI 很容易做到这点,但这也并不完全依赖人类的引导。从推理轨迹来看,它似乎是自主做出这些选择的。

它在回溯时,真的不会被之前的上下文干扰吗?你们观察到的是它在主动后退调整,还是仅仅碰巧采样到了正确路径?它真的能像数学家那样思考吗——在某条路走不通时主动回溯,同时不让上下文受到污染?

Mehtaab Sawhney: 它确实会犯错、回溯并重新评估,整个过程是经过权衡且非常严谨的。

人类数学家在做这类决策时并不总是很理智。某种方法只要第一次失败,你就会下意识调低整条路线的成功概率,这个过程不断重复,直到你完全放弃。

在我们看过的几个解答中,在决定是否放弃某个切入方向时,模型对路径可行性的概率更新,远比人类有效得多。

Mark Sellke: 不仅如此,它还能并行启动全新的模型会话,这也确保了你能摆脱死胡同。

主持人:所以它在同一个问题上用到了并行 agent。

但当它在单条轨迹内回溯时,表现得更像人类数学家了。我们本来也是通过犯错,才建立起直觉,明白为什么某些解题空间是行不通的。

Mark Sellke: 人类做研究也是这样。如果你卡住了,可能会把大体想法告诉合作者,对方也许就能想出推进的办法。只是在人类之间,这种协作交流耗时要长得多。

主持人:从原理上看,数学论文似乎并不是训练真实数学思维的好数据集。教科书可能更是如此。

它们并没有还原当初提出这些概念的真正动机。比如大家通常不建议初学者第一遍直接学 Rudin 的实分析,因为它太精致了,反而掩盖了当初形成特定定义时的摸索过程——比如实数为什么非要定义得这么抽象。

大多数研究论文在写作时,并不是为了教学,教人怎么像数学家一样思考。真正学习做数学的过程,极少会记录在已有的研究成果里。

如果模型的推理轨迹能展现出接近真实数学思维的过程,这种能力究竟是怎么来的?

Mark Sellke: OpenAI 开创了推理模型,以及训练 AI 进行推理的方法。我们正在各个方向开展大量工作,训练模型在不同领域、跨越更长的步骤进行更可靠的推理。

我们正在研发的是通用推理模型。我们在数学中所描述的许多行为——比如回溯或重新开始——其实并不是数学特有的。

虽然我们在这些数学例子中很具体地观察到了这些行为,但它们本质上是与具体领域无关的基础推理工具。只要在通用推理上进行足够充分的训练,这些模式就会自然涌现。

主持人:所以这是一种涌现能力。

OpenAI 的做法没有完全依赖自动形式化(autoformalization)来引导中间推理,这更贴近人类的思考方式。仅凭数学证明进行训练,是否能投射出“如何有效思考”,这一点原本并不明显。

拿代码来类比:代码是一个非常丰富的数据集,具有大量上下文和严密的内在结构,远比书里的普通文字更紧密。但代码模型依然很难理解数据集中没有的内容——也就是架构为什么非要这样设计的高层语义。

模型能够展现出涌现的高水平数学推理,而不仅仅是机械地暴力尝试步骤,这确实非常了不起。

Mark Sellke: 确实是这样。这也是我们决定在发布这些数学成果时,附带公开思维链摘要的主要原因。

如果没看过这些轨迹,只看到最终的证明,你难免会想:“模型是不是靠着不可理解的黑盒在瞎猜?它背后是不是某种完全陌生的逻辑?”

但实际上,它内部的推理过程,与人类专家的工作方式惊人相似。

Mehtaab Sawhney: 读起来很像在看同事的草稿笔记。它确实稍显零乱,就像你和合作者密切配合时,对方把原始想法直接写进邮件发给你。看这些轨迹,就像是把好几封这样的草稿串在一起。

主持人:Astra 发布的那十道题,你们两位参与选题了吗?你们最喜欢哪一道?

Mark Sellke: 我们确实参与了。

Mehtaab Sawhney: 我个人最喜欢球堆积(sphere packing)。

问题本身很直接:在   维空间中,半径为 1 的相同球体,最多能以多大的密度堆积在一起?

在 1 维时,问题很简单:就是实数轴,球就是一个单位区间,你可以不留缝隙地完全覆盖。

在 2 维时,就是大家熟知的经典排布:球按正六边形点阵排列。

主持人:这很显然吗?证明六边形点阵是最优的,有没有什么优美的证明?

Mehtaab Sawhney: 并没有表面上看起来那么显然。直到 20 世纪 40 年代和 60 年代,这个问题才得到严格解决。虽然有一个相对简短的论证,但也绝非显而易见。

主持人:那这种直觉从何而来?</

更多文章