数学界刚炸了锅: GPT-6 Astra自主破解两道数十年未解数学难题


数学界刚炸了锅,一个AI自己搞定了两道几十年没人解出来的数学难题!

2026年9月,OpenAI发布GPT-6 Astra。官方数据很漂亮:FrontierMath Tier 4测试98分,ARC-AGI-3接近满分,网络安全测试ExploitBench直接拿了100分。但真正让数学界坐不住的是另一份报告:这个模型在一个叫FrontierMath-Erdos的测试里,面对68道埃尔德什开放问题,只解决了2道。其他四个顶级模型——一道都没做出来。

等等。同一家公司,同一个模型,一边是98分,一边是3%的解题率。哪个才是真的?

两个都是真的。差别在于:FrontierMath Tier 4考的是“有答案的难题”,FrontierMath-Erdos考的是“没答案的难题”。前者测试解题能力,后者测试发现能力。98分和3%之间的鸿沟,就是AI在“已知”和“未知”之间的真实距离。

更狠的是成本。为了找到那2个解,AI花了超过22万美元的算力。另外63道题,它试了172次,全失败了。成功是真实的,但代价和失败率也是真实的。这事没完。

没有分母的成功,都是耍流氓

过去一年,AI公司隔三差五就宣布自家模型解决了某个数学难题。2026年5月,OpenAI说一个模型推翻了埃尔德什1946年提出的单位距离猜想。2026年1月,GPT-5.4 Pro在Lean里证明了三道埃尔德什问题。新闻一个比一个炸。

但菲尔兹奖得主陶哲轩在2026年的演讲里戳破了这个泡沫。他说这些成功案例“不是在受控科学条件下收集的”。公司只告诉你解决了哪个问题,但不告诉你试了多少个、花了多少钱、有多少人工干预。这就像有人只告诉你他中了彩票,但不告诉你他买了多少张。

陶哲轩给了一个更扎心的数字:AI在埃尔德什问题上的系统性测试成功率只有1%到2%。你看到的每一个“AI解决数学难题”的标题背后,可能藏着98次失败。

FrontierMath-Erdos这个测试就是冲着这个问题来的。它选了68道埃尔德什开放问题,所有模型在同样条件下跑。每个问题最多花300美元、72小时。不允许人工帮忙。解决了就是解决了,没解决就是没解决。所有结果都公开。

结果GPT-6 Astra解决了2道,其他四个模型——GPT-5.6 Sol、GPT-5.5、Claude Fable 5.1、Claude Fable 5——全是0。这个对比本身就说明问题:不是所有前沿模型都能做这事,只有最新的那个行。

但事情没这么简单。GPT-6 Astra的实际定价是GPT-5.6 Sol的2.5倍。报告里那300美元的预算,按实际价格算只够花160美元左右。模型以为还有140美元,其实已经超了。这个价格差让整个实验的设计出了偏差。

22万美元换5个解,贵吗?

报告里还藏了一组更惊人的数字。在标准测试之外,研究者让GPT-6 Astra用更大的预算和不同配置反复尝试同样的68道题。总共试了172次,花了超过22万美元的算力。

结果呢?5道题被解决了。不是68道,是5道。成功率不到3%。其中两道题只在三次尝试中成功了一次。有四个解的单个成本超过了300美元——最贵的一道花了617美元和41小时。

也就是说,如果你只想花300美元试一次,成功率是3%。如果你愿意砸钱反复试,成功率能提到7%左右。但22万美元换5个数学问题的解——这个性价比怎么算?

不过话说回来,对数学界来说,一道困扰了几十年的开放问题被解决,值多少钱?埃尔德什本人经常给问题悬赏,金额从几十美元到上千美元不等。但数学问题的真正价值不在赏金,在它开启的新方向。从这个角度看,22万美元可能不算贵。

而且别忘了另一个数字。OpenAI在2026年8月1日宣布,GPT-6 Astra的内部版本解决了10个数学和理论计算机科学的重大开放问题。覆盖了高维球体堆积、编码理论、群论、量子复杂度、格密码学等多个领域。其中一个问题——非Sofic群的存在性——自1999年以来一直悬而未决。而这10个问题的总token成本只有大约2000美元。

2000美元解决10个,22万美元解决5个。哪个才是真正的成本?答案取决于你怎么测、测什么、在什么条件下测。

被攻克的5道题和被遗忘的63道

GPT-6 Astra在FrontierMath-Erdos标准测试里解决的两道题分别是#74和#126。

#74是关于无限图染色的问题。埃尔德什、哈伊纳尔和塞迈雷迪1982年问:如果一个无限图虽然不是二分的,但每个有限子图都“几乎”是二分的(删掉少量边就能变成二分图),那这个图的色数一定是有限的吗?他们猜答案是“可以是无限的”。GPT-6 Astra证明了相反:如果删边的函数发散得足够慢,色数最多是3。证明是构造性的,用了一个层层递进的归纳论证。

#126是数论问题。埃尔德什和图兰在他们1934年的第一篇合作论文里问:给定n个自然数,考虑所有两两之和的质因子集合,这个集合最小能有多小?他们证明了至少有log n的量级。GPT-6 Astra证明了至少有n的1/2次方量级——远强于原来的下界。而且它给出了三个不同的证明。

在额外尝试中,GPT-6 Astra还解决了#1、#548和#571。#1是埃尔德什1931年提出的问题,可能是他悬而未决最久的一个。问题是关于“无和集”在区间里能有多密。GPT-6 Astra构造了一个反例。但证明是“非构造性的”——它证明了反例存在,但没给出具体需要多大的n。研究者说这个“非构造性不是方法本身固有的,稍加努力应该能去掉”。AI找到了一个存在性证明,但没找到具体的构造。

#548是埃尔德什-索斯猜想,1962年提出的图论问题。它问的是:如果一个图有足够多的边,是不是一定包含所有可能的树结构?GPT-6 Astra给出了完整证明,而且“出人意料地简短和优雅”。证明的核心是一个计数技巧。

#571是关于图兰数的极值图论问题。GPT-6 Astra证明了:对任意有理数α在1到2之间,都存在一个二分图,它的图兰数恰好以n的α次方量级增长。报告说这是五个解里“最难的一个”,人类要真正理解它“需要一些时间”。

但报告最后列了一张表:68道题里只有5道被至少解决了一次。另外63道——包括著名的向日葵猜想、埃尔德什-哈伊纳尔猜想、埃尔德什相似性问题、埃尔德什-加拉伊猜想——全部纹丝不动。56道题被尝试了2到5次,总共172次尝试,零成功。

形式化的门槛:谁在帮AI铺路?

这68道题能进入测试,前提是它们能被表述成Lean的形式。Lean是一个证明助手:你可以在里面写代码,也可以写数学证明,Lean会替你检查证明是否正确。

有些题的陈述来自一个叫Formal Conjectures的社区库,由谷歌DeepMind维护。有些题是研究者用“自动形式化流水线”生成的,但每一条都经过人工审核。换句话说,在AI开始“思考”之前,已经有一群人类数学家做了大量的翻译工作——把自然语言的数学问题转成机器可读的形式化语言。

这个“形式化成本”可能严重低估了AI的数学能力。一个模型可能找到了正确的论证思路,但没法把它翻译成Lean。或者论证依赖的某个标准定理在Mathlib(Lean的数学库)里没有,模型得先自己重新证明一遍。这就像让一个数学家不光要解题,还得先把所有工具造出来。

反过来也一样。如果一个问题已经被形式化了,AI的搜索空间就被大大缩小了。它不需要自己发现“这个问题该用什么框架来表述”——框架已经摆在面前了。AI能解决的数学问题,目前还受限于“能被形式化”这个前提。而大部分前沿数学研究——那些真正在探索未知边界的工作——恰恰是不能被轻易形式化的。

但有一个基准测试走了另一条路。OEIS Open的核心方法论主张:要求形式化Lean证明,是比HorizonMath和FM:OP使用的“生成器-验证器差距”方法更优越的开放问题测试范式。HorizonMath有136个问题,覆盖8个领域。FM:OP每个问题配一个定制验证程序。但这些方法的问题在于:验证是“证据”而不是“证明”——通过检查不代表真正确立了结论。

FrontierMath-Erdos用Lean形式化证明,把验证变成了确定性的事情。通过就是通过,不通过就是不通过。没有灰色地带。

代价是:不是所有问题都能被形式化。

一个更根本的问题

埃尔德什本人可能不会太在意AI用多少算力解决了他的问题。他更在意的是问题本身被解决了。他一生提出了超过1200个问题。其中608个至今仍然完全开放。9个被证明无法从ZFC公理中证明。他留下的最大遗产不是答案,是问题。

数学家丹尼尔·利特说过,在他自己的研究里,“发现关键引理的陈述往往比证明它们困难得多”,他的工作本质是“试图找出我们理解失效的最基本情形”。AI可以解决被形式化的问题。但谁来形式化那些还没被形式化的问题?

2026年3月,FrontierMath刚推出时,顶级模型的通过率不到2%。到2026年9月,GPT-6 Astra在FrontierMath Tier 4上拿了98分。从2%到98%,只用了半年。

但在开放问题上,成功率依然是3%。

这个差距说明了什么?说明AI在“解已知题”这件事上进步飞快,但在“发现新东西”这件事上还在爬。FrontierMath-Erdos的测试设计得很聪明:它用形式化验证堵住了作弊的口子,用固定预算和统一条件排除了“只报喜不报忧”的陷阱。它告诉我们,AI确实能解决开放数学问题——但代价很高,成功率很低,而且大部分问题根本啃不动。

GPT-6 Astra在网络安全测试里拿了100分,甚至能自己发现并利用零日漏洞。正因如此,OpenAI不得不把它的发布推迟数周来加安全护栏。一个能黑掉系统的AI,和一个能证明数学定理的AI,是同一个模型。这才是真正让人睡不着的事。

数学问题的解决只是故事的一半。另外一半是:这个能解决数学问题的AI,也能发现你系统里没人知道的漏洞。问题解决了,但新问题来了。

这事没完。


原文期刊:arXiv / 发表日期:2026年9月 / 原文标题:FrontierMath-Erdos: Benchmarking AI on Open Erdős Problems with Formal Verification / 作者单位背景:Epoch AI