一个神经外科医生,用16个小时,干掉了数学界22年没啃下来的硬骨头!
脑外科医生顺手把数学界团灭了,这事你敢信?
2026年7月,北京协和医院神经外科博士后金山木,在ChatGPT Work平台上启动GPT-5.6-Sol跑了16个小时,成功证明了困扰全球数学界22年的Crouzeix猜想。提出猜想的法国数学家Michel Crouzeix本人,以及两位顶尖数学家审阅后,确认证明正确。
一个本科读地质、半路转行学医、数学全靠自学的人,用一款聊天软件,把一群顶尖数学家按在地上摩擦。
这事听起来像段子,但它真的发生了。
脑外科大夫的“副业”有点离谱
金山木的本职工作是神经外科博士后、住院医师。本科读的是北京大学地质学专业,2016年通过自主招生加分进去的。2019年跑去南阿尔卑斯山搞地质考察,2020年突然转行,通过协和医学院“4+4试点班”进了临床医学。2024年成为神经外科博士后。
数学教育?仅限于理工科本科生那点基础课。其余全靠自学。
那他怎么踩进数学这个坑的?在做经颅超声研究时,试图用超声波穿透复杂的人体颅骨结构,过程中接触到了矩阵分析。然后偶然了解到Crouzeix猜想。
一个脑外科大夫,为了搞清楚超声波怎么穿过脑袋,顺手把数学圈一个22年的悬案给端了。这跨界跨得有点离谱。
22年,全世界数学家都没搞定的事
Crouzeix猜想是法国数学家Michel Crouzeix在2004年提出的。核心内容:对于任意矩阵和任意多项式函数,矩阵经函数作用后的范数不超过该函数在矩阵数值域上最大值的两倍。
翻译成正常人能听懂的话:这东西描述的是矩阵算起来有多大,跟它在某个范围内表现出的最大值之间的关系。关键是那个“2”——Crouzeix说这个数永远不会超过2。
表述简单到高中生都能看懂。证明难度?高到让全球顶尖数学家头疼了二十多年。
2007年,Crouzeix本人只证明了常数在11.08时成立。2017年,全球顶尖专家在美国数学研究所开专题研讨会,苦战一周,把常数压到了2.414。从11.08到2.414,十年时间挪了不到9。然后卡住了,再无实质进展。
目标是2。全世界的数学脑袋凑在一起,距离终点还差0.414。这个0.414,又卡了将近十年。
专业选手搞不定,AI上场了
康奈尔大学数学家Alex Townsend,过去一年多一直在用GPT模型试Crouzeix猜想。职业数学家,用AI做辅助,搞了一年多,没成。
2026年7月30日,Townsend像往常一样打开arXiv。AI给他指了一篇三天前上传的论文,说这玩意被证了。作者:Shanmu Jin。
一个脑外科大夫。
Townsend和华盛顿大学教授Anne Greenbaum发表了公开文章,披露了与金山木的邮件往来。两人加上Crouzeix本人审阅了手稿,确认证明正确。论文尚未经过正式同行评审,但几个最权威的人已经点头了。
事情还没完。预印本发布仅8天后,数学家Emiel Lorist和Felix Schwenninger在2026年8月初发布了一篇仅5页的独立证明。思路完全不同。两人坦言,探索证明策略时同样用了ChatGPT 5.6。
一个AI把门踹开,后面的人跟着往里冲。
16小时,AI到底干了什么
金山木用的不是普通ChatGPT对话框。他用的是GPT-5.6-Sol,OpenAI在2026年7月9日正式推出的旗舰推理模型。在ChatGPT Work平台上运行。专门面向编程、研究、科学这类复杂工作的。
金山木设了一套提示词策略:要求模型在物理断网环境下进行纯粹原创思考;启动大量智能体沿不同路径发散探索,防止过早收敛;对候选策略进行对抗性审计;指令模型在获得完整证明前不得放弃。
设定完成,人走了。全程没干预。
GPT-5.6-Sol跑了16个小时。经历了数万次假设、推翻与重建。
数学家们的评价:AI没有采用人类预想中的繁杂硬估计,而是通过巧妙的采样策略简化出简洁的正性条件。Townsend和Greenbaum的感受:震惊。
一个脑外科大夫设了个闹钟,AI自己跑了一晚上,第二天早上数学界地震了。
这事到底意味着什么
这不是AI第一次在数学上搞出动静。
2026年5月,OpenAI说一个内部推理模型自主攻克了匈牙利数学家Paul Erdos在1946年提出的80年平面单位距离问题。2026年8月初,OpenAI又列了10个被内部版Astra模型解决或取得重大进展的数学问题。同月,Anthropic说未发布的Claude研究版在尝试黎曼猜想——虽然没证出来,但在相关问题上有意外进展。
AI在数学领域攻城略地的速度在加快。
但金山木这件事有个让人不舒服的地方。一个数学基础仅限于本科通识课的人,借助AI解决了一个专业数学家搞了22年没搞定的问题。这挑战的不是某个具体数学问题的难度,而是整个专业训练体系的有效性假设。
Townsend和Greenbaum的原话:这突显了GPT-5.6在过去几周变得“多么惊人地有能力”,尤其考虑到金山木缺乏数学专业训练。
翻译一下:一个没有受过专业数学训练的人,用一个工具,干掉了专业训练体系里最顶尖的一群人搞不定的事。
还差最后一步
论文还没经过正式同行评审。Crouzeix本人点头了,Townsend和Greenbaum也审了,但正式流程还没走完。
金山木已经把全部资料开源了:最终论文、提示词、历次迭代手稿、Lean 4形式化证明代码、公理审计报告。GitHub仓库里躺着全部研究过程。
任何人都可以去查,去验证,去挑刺。
但有一个细节值得琢磨:金山木最初只是想解决一个脑超声相关的问题。他进入矩阵分析是因为经颅超声的实际需求。他不是为了证明一个数学猜想才去学数学的,是为了让超声波更好地穿透脑袋。
一个脑外科大夫在研究怎么治病人的时候,顺手把数学界22年的心病给治了。
那问题来了:还有多少行业里的“外行”,正在用AI解决本专业专家搞不定的问题?还有多少“金山木”散落在各个角落,他们的电脑上,AI正在跑着某个让专家头疼了几十年的东西?
没人知道。因为下一个被AI踹开的门,可能根本不在数学界。
原文期刊:South China Morning Post(南华早报)/ 发表日期:2026年8月14日 / 原文标题:Chinese doctor stuns maths world by cracking decades-old problem using ChatGPT