素数间隙上界刚被AI从240一脚踹到186,但仔细一看,这张成绩单上写了四个字:条件成立!
你知道吗,两个相邻素数之间的最大距离,刚刚被GPT-6 Astra从240压到了186。这数字听着不大对吧,但数学家为了这54个数,整整等了十二年。可更让人后背发凉的是,AI还顺手扔出了一份机器能读的证明,只不过这份证明前面挂着三把锁,钥匙还在别人手里!
张益唐那一脚,踹开了7000万的大门
2013年之前,数学家连一个最基础的问题都回答不了:素数之间有没有一个固定的最大距离?也就是说,不管数有多大,是不是总有一对相邻素数挨得不超过某个数?这个问题叫素数有界间隙猜想。
那年,张益唐出场了。这人当时在美国一所普通大学当讲师,几乎没人听说过他。他往数学界扔了一篇论文,说:存在无穷多对相邻素数,距离不超过7000万。7000万听着吓人,对吧。但重点不是这个数有多大,而是它有限。在此之前,人类连“有限”都证明不了。张益唐把这个问题从天上拽到了地上,虽然落地的地方离我们还有7000万步远。
论文一出来,全世界的数论学家像打了鸡血一样扑上去。陶哲轩牵头搞了个叫Polymath 8的线上合作项目,一堆数学家在网上合力优化,很快把7000万压到了4680。接着梅纳德出手,用一套新方法,一脚踹到了600。同一年,Polymath 8b又往前拱了一步,把上界钉在了246。从7000万到246,人类只用了不到两年。
然后,246这个数字像一堵水泥墙,挡住了所有人。十二年,纹丝不动。
2026年9月1日,有人把墙踢了一条缝
2026年9月1日,一个叫朱莉娅·施塔德曼的研究者在网上挂了一篇论文。她把246推进到了240。就6个数。但这6个数,人类等了整整十二年。数学圈的人还没来得及开香槟,因为两天后,一个更狠的角色来了。
GPT-6 Astra一脚踹到186
2026年9月3日,OpenAI发布了GPT-6 Astra。总裁布罗克曼管它叫“代际飞跃”。这模型在FrontierMath Tier 4考了98%,在ARC-AGI-3考了99.9%,在ExploitBench拿了100%。但真正让数学家瞪大眼的,是它干的那件事。它宣布把素数间隙上界从240推进到了186。
十二年了,246那堵墙动都不动。施塔德曼刚踢了条缝,Astra上来就是一脚,踹飞了54个数。这就像跳高比赛,世界纪录卡在246米,有人刚跳到240米,脚还没落地,突然旁边飞过一个影子,直接砸在186米的横杆上。
Lean 4锁死的证明,前面却挂着三把锁
OpenAI为这个结果附了一个GitHub仓库,叫PrimeGaps186。里面是一整套Lean 4形式化证明。Lean这东西特别较真,它把数学证明写成代码,然后一个符号一个符号地检查逻辑。过去数学家写论文,同行评审靠人读,万一漏了细节谁也发现不了。现在Lean出马,连一个标点都不放过。
OpenAI这个仓库核心有三条声明。第一条叫dhl_40_2,证明了一个叫DHL[40,2]的命题,意思是任意40个满足特定条件的整数,都能找到无穷多个平移,让里面至少有两个素数。第二条把这个命题套到了一个直径正好是186的集合上。第三条宣布结论:素数间隙上界不超过186。
听着很完美,对吧。但你往下翻README,会看到一行小字,翻译过来是:“Lean的结果仍然依赖于三个明确的输入公理。”
哪三个?第一个叫三阶Kloosterman和估计,出自数学家德利涅1988年的工作。第二个叫Friedlander–Iwaniec特征和相关估计,来自Fouvry、Kowalski和Michel在2013年的一篇论文。第三个是一大堆数值积分上界——具体说,104个外部积分上界、45个内部积分上界,外加3个封顶边界。
这三个东西,在Lean的证明里被直接拿过来当公理用。Lean检查了从这些公理出发到最终结论的每一步推导,但它没去证明公理本身。这就好比盖了一栋摩天大楼,结构完美无缺,但地基是从隔壁借来的。哪天隔壁地基塌了,这楼也保不住。
更麻烦的是第三项。那些数值积分上界是用Python算出来的,程序跑完生成了一份叫prime_gap_186_fresh.json的证书。但这证书只是在Lean外面“重新算了一遍”,没在Lean里面证明这些数值本身成立。浮点运算有舍入误差,万一哪个积分上界因为四舍五入差了一丁点呢?OpenAI自己也承认:“这不解除任何Lean公理。”
条件性证明,到底算不算证明
这就引出一个让人坐不住的问题:GPT-6 Astra到底证明了什么?它证明的是——如果德利涅的定理成立,如果Fouvry–Kowalski–Michel的估计成立,如果那152个数值积分上界都算对了,那么素数间隙上界不超过186。
三个如果。前两个,数学界公认没问题。第三个,没人敢打包票。那152个数是程序算出来的,程序可能出bug,浮点数可能舍入出错。OpenAI用了个叫FLINT的数学库,还专门打补丁修了一个“带符号多项式卷积”的问题。但谁能保证没有下一个bug?
从另一个角度看,这恰恰展示了AI最可怕的能力。GPT-6 Astra没有发明新数学,DHL[40,2]这个框架是梅纳德和陶哲轩他们搭的。Astra做的事是:在已有框架里,找到一个直径186的可容许集合,然后设计了一套系数,让所有不等式刚好卡在临界点上。这需要极其精确的数值搜索和逻辑推演,人类不是做不到,但Astra一天就搞定了,还顺手打包成一个任何人能下载验证的GitHub仓库。
186之后,下一脚谁来踹
回头看时间线:2013年张益唐证明7000万;2014年压到600再压到246;2026年9月1日施塔德曼压到240;2026年9月3日GPT-6 Astra压到186。十二年的246,两天内被连推两次,第二次还是AI干的。
但186这个数字,离孪生素数猜想的终极目标——2——还差着93倍。从7000万到186,砍掉了99.9997%的距离。剩下的0.0003%呢?谁也不知道怎么啃。
GPT-6 Astra的Lean证明里锁死了两个关键数字:40和2。如果你想把间隙压到更小,光找到更小的可容许集合不够,你得改写DHL里那俩数字本身,那意味着重写整个筛法框架。目前没人知道怎么重写,AI也不知道,Lean也不知道。它们只能在地基牢靠的地方盖楼,但打地基这事还得靠人。
最让人睡不着觉的是那152个数值积分上界。它们躺在prime_gap_186_fresh.json里,被程序算出来了,被Lean引用过了,结论被宣布了。但没人能拍着胸脯说那152个数每一个都绝对准确。也许哪天有人手算复核,发现其中一个差了0.0000001,186就变成了187,甚至200。这种事儿在数学史上不是没发生过——1993年怀尔斯证明费马大定理,第一版就漏了个关键细节,后来补了一年才修上。
186是终点吗?不知道。谁会在明天早上从GitHub上醒来,扔出一个PrimeGaps100?用什么方法?推翻哪个假设?还是揪出那152个积分上界里的某一个漏洞?没人知道。唯一确定的是,186这个数字不会永远杵在那儿。它只是暂时还没等到那个能踹开它的人,或者AI,或者那份藏在json文件里的bug。