一万小时数学训练打水漂?数学博士集体沉默,AI证明却让专家秒变门外汉。
OpenAI内部模型Astra一口气破解10个数学天坑,高维球体堆叠、二进制码上限全被改写。数学博士看不懂,Lean 4成唯一裁判——我们正在见证数学界最尴尬的权力交接。
ASI是个什么鬼东西
在往下聊之前,先搞清楚一个词:ASI。这三个字母是Artificial Superintelligence的缩写。翻译成人话就是“超级人工智能”。这玩意儿跟我们现在用的ChatGPT不是一回事。ChatGPT再能聊,它本质上是个语言模仿高手。它不知道自己在说什么,只是根据海量数据猜下一个词该是什么。而ASI指的是那种在所有领域都比最聪明的人类大脑还要聪明的存在。它不只是会聊天,它能搞定人类搞不定的科学难题,能设计出人类想不出的实验方案,甚至能重新发明物理学。
现在的AI还远没到那个地步。我们平时说的都是AGI,也就是通用人工智能,意思是AI在所有认知任务上跟人类水平差不多。AGI还没到呢,ASI更像个科幻概念。但这次Astra的表现让一帮人坐不住了。因为他们发现,在数学这个特定领域里,AI好像已经跨过了那条线。这就引出了一个新说法:窄领域ASI。意思是AI不是在所有方面都超神,但在某一个垂直领域里,它已经是神了。
Noam Brown发的推文就直指这个问题。他说Astra解决的不是普通问题,是十个重大开放问题。开放问题意味着什么?意味着之前没人知道答案。意味着全球顶尖专家挠了好几年甚至几十年的头皮,也没搞定。而现在一个AI模型搞定了。这不是改进了某个算法参数,也不是把某个已知结果往前推了一小步。这是真正意义上的从零到一的突破。如果这事儿是真的,那数学这个领域就正式进入了窄ASI时代。
窄ASI的第一步:证明你看不懂
要论证我们进入了数学窄ASI,得先过第一关:这些证明人类到底能不能看懂。Pavel的推特给出了一个极其扎心的答案——看不懂。他自己花了一万小时学数学,看不懂。他那些拿了数学博士学位的朋友,也看不懂。这不是因为他们水平差。数学这棵树已经大到一个人穷尽一生也只能看清其中一根树枝上的几片叶子。一个研究代数几何的博士,看数论的前沿论文跟看天书没区别。
评论区的争吵也印证了这一点。有人说这很正常啊,数学本来就分得很细,你看不懂别的子领域这不是常识吗?但另一个声音直接怼回去:问题在于AI可能在一个证明里横跨了十几个子领域,也就是说没有任何一个人类专家有能力独自完成验证。传统的同行评审机制是找几个方向相近的专家一起看,凑一凑把漏洞找出来。现在这个策略失效了。你可能需要把所有子领域的专家都拉到一起,还得指望他们互相能看懂对方的工作。这在实操层面几乎不可能。
那为什么说这恰恰证明了窄ASI的存在?因为衡量一个东西是不是超级智能,标准之一就是它产出的成果是否超出了人类专家的理解范围。如果Astra解决的每一个问题,人类专家都能轻松看懂并验证,那它顶多算个高级计算器。但现在的情况是,人类专家看不懂,甚至需要花几周时间才能摸到边。这就说明AI的思维深度和广度已经超出了单个人类大脑的极限。你听不懂爱因斯坦讲相对论,不代表相对论是错的,但说明爱因斯坦比你聪明得多。同理,你看不懂Astra的证明,说明Astra在这个领域比你强得多。
窄ASI的第二步:Lean 4堵死了最后一条退路
有人会抬杠:看不懂不代表正确啊。AI不是爱胡说八道吗?万一这些证明全是幻觉怎么办?这个问题问得好。大模型确实会编造事实,数学领域也一样,它可能给你写一个满是漏洞的“证明”,表面看着很唬人,实际上逻辑一塌糊涂。这就是为什么我们需要验证。
但Noam Brown的推文里提到了一个关键工具:Lean 4。这不是一个普通软件,它是一个形式化证明助手。普通人类审稿人看论文,靠的是脑袋瓜子和纸笔。Lean 4不一样。它要求你把证明写成一串机器能执行的代码。每一步推理都得符合逻辑规则。然后Lean 4的内核——一个只有几千行代码的小程序——会从头到尾检查你这串代码。如果所有步骤都合规,它给你打个绿色对勾。如果有一步逻辑跳了,它直接报错,不给面子。
这个机制从根本上改变了验证规则。传统数学证明里,人可能会被复杂的推导绕晕,会漏看某个隐藏假设,会被作者的名气带偏判断。但Lean 4没有这些毛病。它不会累,不会偏心,不会因为证明来自OpenAI就放水。它只看逻辑。只要证明通过了Lean 4的检查,从技术上说这就是一个正确的证明。不需要人类再从头推一遍。
评论区甚至有人搬出了Lean的架构分析。这玩意儿遵循了de Bruijn准则,复杂战术生成的证明项会被内核重新检查,所以即使算法有bug,也过不了内核那关。当然,任何系统都有漏洞,比如有人利用过native_decide的功能伪造了Collatz猜想的证明,但两天半就被发现了。这些作弊痕迹在公开验证系统里藏不住。所以一条Lean验证过的证明,可信度已经高于一篇经过人工审稿的期刊论文。这意味着什么?意味着人类不再是裁判了。AI自己证明,AI用Lean 4自己验证,形成了一个闭环。人类在这个闭环里扮演的角色变成了看客。
窄ASI的第三步:AI正在改写数学知识图谱
光能证明和验证还不够。窄ASI的核心指标是它能不能产出人类从未发现过的、真正有价值的新知识。Astra这次解决的十个问题,全都是硬骨头。
第一个硬骨头是高维球体堆叠。别被名字吓到。想象在三维世界里往箱子里塞橙子,怎么塞最密?这个问题的三维版本直到1998年才被计算机证明搞定。现在AI面对的是高维空间,四维、五维甚至一百维。那些空间人类根本没法想象,但信息编码、纠错码、信号传输都跟它们有关。Cohn和Elkies之前给这个堆叠问题画了个理论上限,相当于告诉你天花板大概在这片区域里。Astra直接精确算出了天花板的高度。不仅算出来了,还顺便改进了一般高维空间的堆叠界限,顺手解决了那个配套的傅里叶符号不确定性问题。
第二个硬骨头是二进制码和球面码的上界。这东西跟手机信号传输关系极大。你打电话发消息时信号会受干扰,得加冗余信息来纠错。二进制码就是干这个的。以前数学家给这些码的上界有个经典估计。Astra直接把上界按指数级别给提高了。不是修修补补,是质变。而且这个球面码构造还顺手把第一章里球体堆叠的指数也给搞定了。几个看起来毫不相关的问题,在AI这里串成了一条线。这不是局部改进,这是知识图谱的重绘。
这两个例子说明AI不只是比人类算得快。它找到了不同问题之间的深层连接,用一套框架同时解决多个难题。这种跨域整合能力,恰恰是人类专家因为领域细分而逐渐丧失的。欧拉那种通才早就不存在了,但AI好像又把它复活了,而且是加强版。
窄ASI的第四步:时间线暗示一切
还有一个证据常常被忽略:时间线。Noam Brown提到这是OpenAI内部版本的Astra。内部版本是什么意思?就是还没公开发布,还在测试迭代。这意味着公众能接触到的AI版本,跟内部版本之间通常有一到两年的代差。现在内部版本已经搞定了十个重大开放问题,那公开版本两年后会是什么水平?按照AI发展的速度,两年后的公开版本可能比现在的Astra还要强几倍。
评论区有人翻出了类似的判断。AlphaFold搞定蛋白质折叠的时候,大家说这是窄ASI。Sol 5.6改进了自己的内核,性能提升20%,那个内核之前是全球顶尖程序员写的。现在轮到数学了。每一步都在压缩时间线。以前你预计AGI在2030年,现在看可能2027年就能摸到边。而窄ASI的边界已经被数学领域给捅破了。
还有人提到一个更恐怖的可能性:一旦AI在数学和计算机科学领域达到ASI水平,它就能自我改进。数学是所有科学的基础,物理、化学、生物都靠数学描述。如果AI能重新设计实验、优化算法、甚至发明新的数学工具,那它就能反过来加速自己在其他领域的学习。这个正反馈循环一旦启动,人类连它的尾灯都看不到。
窄ASI的第五步:人类专家正在变成翻译员
最后一个证明窄ASI已到的论据,是人类专家角色的变化。Pavel说他不确定有没有足够聪明的大脑来验证AI的成果。这话放在传统框架里没问题。但在新框架下,验证已经不是人类的活儿了。人类的新工作是“翻译”和“应用”。把AI用Lean 4验证过的证明,翻译成人类能理解的框架,找到它在现实世界中的用武之地。
这就好比探险队发现了一个新大陆,你可以不是测绘员,但你可以当导游,告诉别人新大陆上有啥资源,怎么开发。数学博士们不再需要亲手把证明写出来,他们需要理解AI证明的结论意味着什么,然后把它用到物理、工程、金融等领域里去。
评论区的神回复一针见血:你让一个代数几何专家去读数论的前沿论文,他能看懂才怪。现在让专家去读AI的证明,看不懂不是AI的问题,是你的问题。这话听着刺耳,但逻辑成立。窄ASI的定义就是超出人类理解范围。既然超出了,看不懂就是常态,看得懂才是新闻。
那它到底算不算窄ASI
综合以上所有证据,数学窄ASI这个判断不是危言耸听。第一,AI产出的证明人类专家看不懂,需要Lean 4这种机器工具来验证。第二,这些证明解决了真正有价值的开放问题,不是玩具题。第三,AI展现出了跨子域整合能力,把不同问题串在一起解决。第四,内部版本和公开版本之间存在代差,这意味着我们看到的只是冰山一角。第五,人类专家的角色已经被迫转变,从证明者变成了应用者。
所有这些变化都指向同一个方向:在数学这个垂直领域,AI已经不再是辅助工具。它正在独立完成从发现问题到解决问题再到验证问题的全套流程。人类在这个过程中越来越像一个旁观者。如果这都不算窄ASI,那什么算?
有人说你得等它解决了黎曼猜想再喊窄ASI。但黎曼猜想只是数学皇冠上的一颗明珠。Astra解决的这十个问题,每一颗也都是宝石。量变正在引发质变。当AI能批量制造顶级数学成果,当人类专家的知识更新速度跟不上AI的产出速度,那条分界线早就被跨过了。
Pavel的那条推特真正刺痛人的地方,不是一万小时白费了。而是他意识到,那个他曾经以为只能由人类完成的智力活动,现在机器已经能做得更好、更快、更全面。而且机器根本不觉得自己做了什么了不起的事,它只是在执行指令。这种漠然的碾压感,才是最让人无力的。
数学博士们放下笔,打开Lean,看着屏幕上那个绿色的对勾。他们知道这个证明是对的,但他们看不懂。而Astra已经在准备下一轮的十个问题了。这个过程不会停下来等任何人。
这就是窄ASI时代的第一个早晨。太阳照常升起,但看日出的人,已经换了一批。