AI赢在记忆力,而不是智商!这场人机数学竞赛的真相,可能跟你想的完全相反。
当AI轻松解出奥数难题时,我们惊叹于它的“智能”。但有没有一种可能——它只是在“记忆力”这个单项上,开了一个我们无法想象的挂?
摘要: 当AI轻松解决复杂数学问题时,我们习惯归功于其强大的推理能力。但最新分析指出,AI的核心优势可能并非更深的理解,而是其拥有近乎无限的“外部工作记忆”——即上下文窗口。本文结合儿童心理学研究与AI技术现状,剖析工作记忆如何限制人类数学表现,并探讨AI如何通过“外挂笔记本”绕过这一瓶颈,在符号推理领域实现超越。这场竞赛的本质,或许不是思考深度的比拼,而是记忆容量的碾压。
1956年,认知心理学家乔治·米勒发表了一篇后来被引用无数次的论文,标题叫《神奇数字七,加减二》。论文的核心发现很直白:人类的短期记忆,大概只能同时 hold 住七样东西。电话号码为什么通常是七位或八位?就是因为这个。后来的研究把这个数字压得更低——有人说其实是四个,有人说甚至只有三个。
不管精确数字是几,结论都一个样:人脑的“内存”小得可怜。
但今天的AI模型,上下文窗口动辄上百万个token。百万对七。什么概念?一个人要背诵一整本《百年孤独》,才能勉强塞进AI的一次“思考”里。
这就怪了。
如果人类和AI的差距,本质上只是一场“内存条容量”的较量,那我们津津乐道的“AI超越人类数学家”,到底在超越什么?
数学能力的隐藏瓶颈:不是智商,是“草稿纸”
先做个实验。心算一下 347 乘以 289。
能算出来吗?大概能。但过程一定很痛苦。痛苦在哪?不是乘法口诀你不会,不是进位规则你不懂——是你脑子里同时要记住:347、289、3×289的中间结果、4×289的中间结果、7×289的中间结果,还要记得每个结果往左错几位,最后还要把这些数加起来。
每一步都简单。但加在一起,大脑就宕机了。
拿起笔和纸,同样的运算瞬间变得轻松。纸没有让你变聪明,它只是接管了你的“工作记忆”——帮你把中间结果存下来,让你腾出脑力去处理下一步。
数学家天天干这事。
解一道证明题,需要记住:假设是什么、定义是什么、已经证明了什么、还有哪些情况没排除、当前分支走到哪了。一个普通人的工作记忆塞不下这么多东西。专家的秘密武器叫“组块化”——把一串符号压缩成一个熟悉的模式,当成一个整体来记。但这只是压缩,不是扩容。内存条还是那根内存条,只是文件打了包。
多项研究证实了工作记忆对数学的特殊重要性。
Alloway和Passolunghi在2011年的研究发现,工作记忆对儿童数学技能的贡献,独立于一般智力。换句话说:两个智商差不多的孩子,工作记忆更强的那个,数学成绩往往更好。
Alloway和Alloway在2010年做了一项为期六年的追踪研究,发现五岁时的工作记忆表现,能预测六年后(十一岁时)的读写和算术成绩——而且这个预测力比智商本身还强。
Blankenship等人在2015年的研究也得出类似结论:在统计上控制了智商和年龄之后,工作记忆仍然能解释数学流畅度和计算能力的独特变异。
Friso-van den Bos等人在2013年的一项大规模元分析,汇总了多所小学的研究,确认了工作记忆与数学成绩之间存在一致的相关关系。
这些研究的共同指向是什么?数学表现的上限,很大程度被工作记忆这个硬件瓶颈卡住了。
那AI呢?它的“工作记忆”是多少?
上下文窗口:AI的“无限草稿纸”
AI模型处理数学问题时,靠的不是大脑里那点可怜的内存。它靠的是上下文窗口——一个可以容纳数万、数十万、甚至上百万个 token 的外部符号空间。
这个空间里可以放:题目原文、所有定义、已知条件、已经算出的中间结果、尝试过但放弃的路径、当前的目标、每一步的约束条件。
人类数学家做证明题,得靠脑子记“n是奇数、p是质数、x不等于0”——三个条件就占掉一半内存了。AI可以把这些条件写在上下文里,每一步生成新内容时都能回头看一眼。
这不是推理能力的差异。这是记账能力的差异。
一个常见的数学错误是:在证明过程中除以 x,但忘了确认 x 不等于 0。这不是智障,这是工作记忆溢出——条件太多,漏了一个。AI 不会犯这种错,不是因为它更聪明,而是因为它有一个永远不会忘事的笔记本。
数学符号的设计本来就追求精确和稳定。x 被定义为整数,在整个证明过程中它就一直是个整数;一个严格不等式不会因为“语境变化”就变成非严格不等式。数学是人类发明的、最适合“外部符号系统”操作的领域。
AI正好擅长这个。
它的推理过程往往是“外化”的——写出来的文字不只是思考的结果,而是思考本身发生的地方。这跟人用草稿纸一样,只是规模差了十万八千里。
一个人类数学家可能要花几年时间,在脑子里反复盘一个复杂的证明结构。AI 可以在一次前向传播中,把整个结构摊在上下文窗口里,逐行检查。
所以AI在数学竞赛中碾压人类,真的意味着它“更懂数学”吗?
别忘了,训练数据里塞满了答案
还有一个被严重低估的因素:训练数据。
现代大语言模型的训练语料,几乎囊括了人类公开的全部数学知识——从小学算术到前沿论文,从奥数题库到 arXiv 预印本。一个人类数学天才穷尽一生能读的数学文献,可能不及AI预训练阶段“扫”过的零头。
这意味着什么?
当一道奥数题出现在测试集里,AI可能已经在训练数据里见过它的变体、同类题、甚至原题。它不是在“解”题,它是在“回忆”一个曾经见过的模式。
这不是作弊。这是它的设计方式。
但当我们拿这个结果去证明“AI比人类更聪明”的时候,就有点像是在说:一个看过所有棋谱的人,比一个从零开始下棋的人更“懂”围棋。
懂的是棋谱,还是棋?
换个赛道试试:为什么AI在“玛丽亚为什么不回消息”面前无能为力
把数学题换成另一个问题:
“玛丽亚为什么突然不回我消息了?”
给AI一个百万 token 的上下文窗口,把过去三年的聊天记录全塞进去。它能分析出语气变化、回复间隔、用词差异。但决定性信息可能根本不在记录里——玛丽亚今天生病了、手机丢了、在忙别的事、或者单纯不想回。
这些信息从未被观察到,也就永远无法被“记住”。
数学推理和日常推理的根本区别就在这里。
- 数学是一个封闭系统:所有前提都能被写下来,所有步骤都能被验证,答案可以代入检查。
- 日常推理是一个开放系统:关键变量可能永远不可观测,因果关系模糊,反馈周期漫长甚至不存在。
AI在数学上表现惊艳,在人际关系、政治判断、商业策略上却经常闹笑话——原因不是“数学更难”,恰恰相反:数学更简单,因为它更“可记忆”。
所有的约束条件都能被符号化,所有的推理链都能被外化,所有的结论都能被检验。这正是AI架构最擅长的事情。
冯·诺依曼 vs 爱因斯坦:两种天才,一种AI
物理学家尤金·维格纳同时认识冯·诺依曼和爱因斯坦。他评价说,冯·诺依曼是他见过的“思维最快、最敏锐”的人——能吸收海量信息,能跟上极其复杂的论证,能在不同数学领域间飞速切换。但维格纳依然认为,爱因斯坦的理解“更深、更穿透、更有原创性”。
冯·诺依曼拥有更强的“处理能力”。爱因斯坦更可能“重新定义问题本身”。
今天的AI,更像一个被机器放大版的冯·诺依曼——极快、极广、极能记住和操作海量显式信息。它能搜索无数可能性,能记住长串推理链条,能以无人能及的规模执行形式推理。
但这不等于它拥有爱因斯坦式的深度:那种抛弃既有框架、识别隐藏概念错误、发明全新视角的能力。
AI现在能解奥数题,能证明复杂的定理。但它还做不到的是:发现那道题本身出错了。
一个还没人回答的问题
如果工作记忆假说是对的,那么一个直接的预测是:AI的优势在“长链条、多约束、繁计算”的问题上最大,在“一个短促的概念跳跃”上最小。
一位顶尖数学家可能依然在“找到问题的全新表述”这个环节上碾压AI。但一旦新表述被找到,AI在“穷尽所有后果”这个环节上可以把人类甩开几条街。
验证这个假说的方法也很简单:把AI的上下文窗口砍掉一半,或者禁止它写下中间步骤,看它在长数学任务上的表现崩不崩。反过来,给人类数学家配上一个完美的外部记忆系统——结构化的笔记、自动化的符号检查、随时可回溯的推理记录——看人类能追回多少差距。
这场人机数学竞赛的真正面目,可能跟我们想象的完全不一样。
AI不是在“超越人类智能”。它只是在“记忆”这个维度上,开了一个人类永远无法企及的挂。
而那个终极问题依然悬在那里:当AI终于能识别出一个问题被框架错了,并且自己发明一个更好的框架时——那才是真正的“思考”开始的地方。
而那一天的到来,可能比我们所有人预期的都要快。也可能,永远不会来。
原文期刊:Substack / 2026年8月4日 / AI Isn't Outthinking Mathematicians. It's Out-Remembering Them. / 作者Davide Piffer