OpenAI两千美金破解10道10年数学难题,数学家饭碗还稳吗?

一个2000美金成本的模型,十道十年未解的数学难题全给端了,你服不服?

OpenAI内部模型Astra花了两千美金就解决了十个数学和理论计算机科学领域的开放难题,涵盖高维几何、编码理论、算术电路复杂度、群论、算子代数、量子复杂度、格密码和极值组合数学。这些成果已用Lean证明助手形式化验证,论文和推理过程已公开,引起学界关于AI数学研究透明度和署名规范的激烈讨论。

一台电脑干翻十个数学分支

你听到这个消息的第一反应是什么?反正我第一反应是,那些数学家这几十年都在干嘛?不是,我意思是,这玩意儿也太猛了吧。两千美金,买个最新款iPhone都不够,结果人家OpenAI拿这钱跑了一次模型推理,直接甩出十个数学界的“老大难”问题的答案。这感觉就像你花两块钱买了张彩票,结果中了十个亿,而且这十个亿还是用你完全看不懂的密码写着的。

关键点在哪?关键点在于,这十个问题不是那种边角料的小打小闹。它们散落在高维几何、编码理论、群论这些听起来就让人头大的领域。其中任何一个能被人类搞定,都够发好几篇顶级论文,甚至拿个奖什么的。结果呢?一个还没正式发布的叫Astra的模型,跟玩儿似的就把活儿全干了。

你想想那个画面。一群顶尖数学家,可能头发都熬白了,在黑板前推来推去几十年。结果一台机器,通上电,花了两千刀电费,咔咔咔,答案出来了。这反差感,比你在期末考试前通宵复习,结果学霸说“我昨晚打游戏到三点”还要扎心。这不是进步,这是降维打击。这哪是工具啊,这简直是来砸场子的。

价格标签背后的认知失调

OpenAI特意强调,解决这十个问题的总成本,按照他们那个Sol API的定价,大约是2000美元。他们想表达的是:看,我们这模型多高效,多便宜。但普通人听到这个数字,心里大概率会冒出另一个想法:就这?一个数学难题,还没我一个月房租贵?

这里就出现了一个巨大的认知冲突。在我们的传统认知里,攻克一个数学难题是无价的,它代表人类智慧的巅峰,是十年磨一剑的孤独和荣耀。结果现在你告诉我,它明码标价,还这么便宜。这感觉就像你一直仰望的珠穆朗玛峰,突然有人告诉你,坐个观光电梯两块钱就能上去了。那种神圣感、那种距离感,瞬间就崩塌了。

我们习惯把“贵”和“有价值”划等号。一个菲尔兹奖得主的脑子,你觉得值多少钱?那肯定是无价之宝。但现在一个两千美金的程序就能干同样甚至更牛的事,那这个“无价”是不是该重新定义一下了?这种价格和价值的极端错位,是这次事件最让人心里发毛的地方。它不是在挑战你的钱包,它是在挑战你对“人类智慧”这个概念的定价体系。

大语言模型如何“思考”数学问题

别以为这模型是像你一样翻课本解题。它的运作方式,跟人类的思维模式完全是两个维度的东西。你可以把它想象成一个超级连接的知识网络。人类数学家做题,是靠逻辑推理、直觉、甚至试错。而Astra这类模型,它是在一个由无数数学符号、定理、证明方法构成的超高维空间里,寻找路径。

你在做几何题时,脑子里想着辅助线。模型在处理球体填充问题时,它可能同时在遍历几万种已知的边界条件、不等式和构造方法,用一种近乎暴力但又有某种内在逻辑的方式,去“摸”到那个最优解。这不是我们通常理解的“思考”,更像是一种极度压缩的、非人类可读的模式识别和生成。

你问它为什么选这条路,它给不出你像人类数学家那样“因为我感觉这里应该构造一个对偶空间”的解释。它只能给你一个结果,然后把推理过程(通常也极其拗口)用Lean代码给你敲出来。这就像你问一个顶级厨师为什么这道菜这么做,他告诉你“因为我的神经网络参数这么收敛的”。正确,但完全不符合人类的叙事逻辑。这种“黑盒”式的创造过程,是它给学术界带来的最大冲击之一。

数千行Lean代码的冰冷权威

说到Lean,这是这事儿最狠的一步。OpenAI不仅给出了答案,他们还把这十个证明全用Lean这个证明助手给形式化了。啥意思?就是说,他们把这些数学证明,翻译成了电脑能百分之百严格检查的一种编程语言。如果你的证明里有一丁点逻辑漏洞,哪怕是个标点符号级别的,Lean编译器就会报错,不通过。

这意味着什么?意味着这些证明的正确性,在理论上已经被机器验证过了。它们脱离了人类审稿人那种“我觉得这里有点问题,但似乎又能说得通”的模糊地带。这就像你写作文,以前是语文老师凭感觉给你打分,现在换成了一个能精确检查每个标点、每个语法、每个逻辑连词的程序。残酷,但极其高效。

这种形式化带来的是一种冰冷的权威感。以前数学家证明一个东西,大家还得争一争,吵一吵,甚至过几年发现有个致命漏洞。现在好了,机器说对,那就是对。这彻底改变了“信任”在数学研究中的建立方式。数学不再仅仅是关于思想的学科,它也变成了一种可以被编译和执行的工程学。这为数学的传播和后续使用,提供了一个前所未有的坚实底座。

“实验次数”的幽灵与透明度的战争

当然,这事儿也不是没争议。Hacker News的评论区里吵翻了天,核心就一个问题:你花了2000美金告诉我你解决了十个问题,但你究竟试了多少个?有没有一种可能,你们拿这模型去怼了成千上万个问题,最后只有这十个成功了,然后你挑出来说“我们只花了2000块”?

这就是“P值操纵”的数学版。如果不公布总的尝试次数和成功率的全貌,那这个2000美金的成本就是个精心剪辑的宣传片。打个比方,我说我蒙着眼投了十个三分球,全进了,这很神。但如果我告诉你,我是投了一万个,只剪了进的十个给你看呢?那感觉就完全不一样了。

OpenAI的人后来也承认,他们确实尝试了很多其他问题,没成功。但这“很多”究竟是多少?是二十个,还是两千个?这个关键数据的缺失,让他们的声明在严谨性上大打折扣。这种对实验方法论透明度的要求,本身就反映了AI介入科研后带来的新问题。这不仅仅是数学问题,这是一个关于如何报道和评估“AI驱动的科研发现”的元问题。

谁才是真正的作者

还有一个更核心的哲学问题,也是评论区里最火爆的:这十个数学成果,到底算谁发现的?OpenAI自己倒是拎得清,他们说“我们帮助准备了手稿,并用Lean形式化了证明,我们对其正确性负责,但数学论证本身是由我们的系统生成的。”

这话说得很圆滑,但也把矛盾给挑明了。如果是一个人类数学家,他做研究,写论文,那他就是作者。但现在,最关键的智力劳动——找到证明路径——是机器干的。人类干的是“辅助”工作。那这算不算学术不端?以后写简历,能写“我通过提示工程,促使AI证明了XX猜想”吗?

这就像你让一个超级画家(AI)按照你的要求(提示词)画了一幅旷世杰作,然后你在画上签上自己的名字,说这是你的作品。这显然不合适。但这幅画也确实是因为你的“要求”才存在的。这种模糊的“作者身份”,正在拷问我们现行的学术评价体系。我们是在奖励发现答案的人,还是在奖励提出问题、并懂得如何让机器去找答案的人?这其中的权重,需要完全重新洗牌。

数学家的饭碗与AI的无限算力

最终的最终,这个问题还是落到了普通人最关心的点上:数学家会不会失业?从目前的情况看,顶尖数学家,比如像陶哲轩那样的大佬,他们能把AI当超级计算器用,如虎添翼。但对于更广大的普通数学研究者,尤其是那些还在为证明一个小猜想而努力的人来说,这消息确实让人脊背发凉。

你花了十年工夫,在一个细分领域里成了世界级的专家。结果一个模型,可能花了几分钟,就把你研究的问题给秒了,还顺手把你整个领域往前推了一大步。这感觉,就像你辛辛苦苦练了一辈子的铁砂掌,结果对面掏出了一把加特林。你的技术还在,但它的价值在断崖式下跌。

未来的数学研究,可能真的会分化。一部分是“提问者”,负责提出好的、有意义的数学问题,设计探索的路径。另一部分是“验证者”,负责理解和消化AI产出的海量结果,并把它们融入人类的知识体系。至于中间那些靠解题技巧和复杂计算吃饭的岗位,确实会面临巨大的冲击。这不仅是数学的危机,更是整个智力劳动价值体系需要面对的一次地震。也许以后,数学家证明自己的价值,不再是“我证明了什么”,而是“我让AI证明了什么”。这转折,够冷的吧?

总结一下,AI两千美元干翻十个数学难题,这事儿大到让数学家重新思考自己是谁、在干嘛。我们得清醒:定义问题、验证答案,这才是人类未来在数学里的硬核任务,不能只当个点“运行”的看客。

原文期刊:OpenAI官方博客 / 发表日期:2026年8月1日 / 原文标题:Ten advances in mathematics and theoretical computer science

网友灌水

网友的观点主要分成了几派,吵得不可开交。

怀疑派:这账算得不清不楚

*   质疑“2000美元”的成本宣传:很多网友觉得这个数字有误导性。他们怀疑OpenAI可能尝试了成百上千个问题,只把成功的10个拿出来说事,就像“P值操纵”一样。
*   要求公开更多实验细节:大家想知道总共尝试了多少问题、成功率多少、给模型试了多少次,以及背后的“脚手架”花了多少钱。
*   怀疑是人类数学家代劳:也有人质疑,成果是否真的来自AI,还是OpenAI雇佣了顶尖数学家来做,AI只是个“花瓶”。

震撼派:数学界的“地震”

*   感叹AI的恐怖效率:有人直言这成果非常恐怖,甚至评价其中6-7个成果的水平,已经超过了中国顶尖数学家韦东奕最重要的论文。
*   引发“生存危机”:数学界的反应从“耸耸肩”到“存在主义危机”都有。有菲尔兹奖得主甚至惊呼“数学家们,你们得坐稳了”。
*   标志着研究范式的转变:大家普遍认为,AI的角色已经从解答难题的“工具”,变成了能主动探索思路、产出原创知识的“研究者”。奥特曼也感慨,AI短短几年就从做不好小学数学,进步到能解决研究级数学问题。

务实派:把它当成新“计算器”

*   视AI为强大工具:这部分人认为,AI就像“不知疲倦的博士生”,是能极大提升效率的助手。有数学家表示,用AI做日常工作,把原本需要几周的事一天就干完了。
*   接受人机协作的未来:他们觉得未来的研究会变成人类和AI合作,数学家的角色会从“亲力亲为”变成“指挥家”。有人甚至因为自己苦思的问题被AI解决而感到释然。
*   警惕“约翰·亨利”式的悲剧:同时也有声音提醒,固步自封、对抗趋势的数学家,可能会像传说中与蒸汽钻比赛累死的工人约翰·亨利一样,结局悲惨。

总而言之,网友们的讨论早已超越了“AI对不对”的层面,焦点已经变成了“这对数学家和数学的未来意味着什么”。