中国模型算法创新:Engram/N-Gram记忆体引爆AI新竞赛

Transformer 有了“记忆体”,AI 竞赛要彻底变天!

这可能是大模型诞生以来,最反直觉的一次硬件革命!

你有没有想过,大模型那动辄上千亿的参数,其实大部分都在“背课文”,而不是在“动脑子”?

最近,DeepSeek 和阿里通义的两项技术突破,正在把这种低效的运作模式彻底推翻!它们给 Transformer 装上了一个叫“Engram”或“N-Gram”的“记忆硬盘”。

这个改变,可能让 AI 的竞赛逻辑发生一百八十度的大转弯。我们普通人,可能很快就能在家里用普通电脑,跑起来跟现在顶级数据中心一样聪明的模型。这可不是什么科幻小说,而是正在发生的事情。

大模型最致命的短板:用计算来硬背课文!

现在的 AI 模型,特别是那个叫 Transformer 的架构,有个特别傻的毛病。它没有专门的“知识查找”功能。你问它“戴安娜王妃是谁”,它得先花好几层神经网络,像破案一样,从前面的“Wales 是英国一个地区”、“Princess of Wales 是个头衔”这些碎片信息里,慢慢拼凑出答案。这个过程,相当于让一个顶级数学家,不用计算器,而是靠心算去算 123456 乘以 7891011。能算出来,但累得半死,效率极低。

这种低效在大模型里被放到了无限大。为了能让模型“记住”更多的知识,唯一的办法就是拼命堆参数,把模型越做越大。这就催生了混合专家模型,也就是 MoE。MoE 的思路很巧妙,它不用每次激活全部参数,而是通过一个“门控网络”,针对每个输入,只唤醒一小部分最相关的“专家”去计算。

这就好比一个大型医院,不用让所有科室的医生都来看你的感冒,只需要把内科医生叫来就行。MoE 解决了“怎么少算”的问题,让模型可以在参数很大的情况下,保持计算量不爆炸。

但是,MoE 并没能解决“别瞎算”的根本问题。对于“戴安娜王妃”这种固定知识,模型依然要用复杂的计算去模拟一个简单的查找动作。这就好比明明有电话簿,你非要每次打电话都去全城挨家挨户敲门找人。这种“用计算模拟记忆”的做法,浪费了大量的算力和模型的“深度”。

本来可以用来做复杂推理的神经网络层,全被这种“背课文”的苦力活给占用了。

DeepSeek 的大招:给 AI 装上“记忆硬盘”

2026 年 1 月,DeepSeek 和北京大学联合发布了一篇重磅论文,提出了一个叫“Engram”的全新模块。Engram 这个词来自神经科学,意思是“记忆痕迹”。它的核心思想,就是给 Transformer 装上一个专门的“记忆硬盘”。这个硬盘不搞复杂计算,专门负责快速查找。它把语言里那些固定的、局部重复的模式,比如“United States”后面常跟“of America”,“The Statue of”后面常跟“Liberty”,统统交给 Engram 这个查表模块去处理。

这样一来,Transformer 的主干网络就能从这些琐碎的“背课文”任务中解放出来,把全部精力放在更高级的“推理”和“思考”上。

这个 Engram 模块的具体做法,是把经典的 N-Gram 方法给现代化了。N-Gram 是传统语言模型的老方法,就是通过统计前面几个词来猜下一个词的概率。DeepSeek 把它升级成了一个可通过哈希函数进行 O(1) 时间复杂度的确定性查找表。你可以把它想象成一个巨大的、带索引的字典。不管词表多大,查找一个词条的时间都是恒定的,快到飞起。

他们还在 Transformer 的层与层之间插入这个 Engram 模块。每个位置的输入会触发一次哈希查找,把当前词和前面几个词组成的 N-Gram,映射到一个巨大的嵌入表中,直接取出对应的向量。

为了防止不同词条“撞车”,也就是哈希冲突,DeepSeek 还加了个“门控机制”。它会用当前的隐藏状态作为“上下文”去判断,这个查到的记忆到底适不适合现在这个语境。如果不匹配,就自动把这条记忆“屏蔽”掉。这就让 Engram 既“记得住”,又不会“乱说话”。

实验数据相当惊人。

在 27B 参数规模下,Engram 模型在严格等参数量、等计算量的条件下,全面超越了同规模的纯 MoE 模型。
在 MMLU、CMMLU 这些知识类任务上,分别提升了 3.0、4.0 分。

更让人意外的是,它在 BBH、ARC-Challenge、HumanEval、MATH 这些推理、代码和数学任务上,也分别大涨了 5.0、3.7、3.0、2.4 分。

这背后的原因是,Engram 让模型的早期层不再需要费力去“拼凑特征”。分析显示,Engram-27B 模型第 5 层的表征能力,就已经接近纯 MoE 基线模型第 12 层的水平。这就相当于把模型的有效深度给“加深”了,释放出来的层数自然可以用在更高级的推理上。

这里的关键发现是,MoE(条件计算)和 Engram(条件记忆)之间,存在一个“U 型缩放定律”。研究人员发现,当把总参数中大约 20% 到 25% 的“稀疏预算”分配给 Engram 记忆模块时,模型的表现能达到最优。记忆太少,模型还得费力自己去“背”;记忆太多,又会挤占模型“思考”的能力。只有达到一个精妙的平衡,才能发挥出最大的威力。

阿里 Qwen 的实践:51B 参数的“记忆外挂”来了

如果说 DeepSeek 的论文是提出了一个革命性的构想,那么阿里通义千问团队在 2026 年 8 月 26 日发布的 Qwen3.8-Flash-Next 模型,就是把这一构想变成了现实。这个模型被定位为下一代 Qwen4 架构的技术预览版。

Qwen3.8-Flash-Next 是一个多模态 MoE 模型,主模型参数量为 125B,但每个 token 只激活 6B 参数。

最引人注目的是,它额外配备了一个高达 51B 参数的 N-Gram 嵌入表。这个表有多大呢?它有 2000 万个条目,专门用来存储常见的双词和三词组合的嵌入向量。这个巨大的“记忆外挂”被放置在模型的第 2 层,在模型进行复杂的矩阵乘法计算之前,就先通过查表提供额外的信息。

这个 51B 的 N-Gram 表最精妙的地方在于,它可以被卸载到主机的系统内存里。通过异步预取技术,CPU 可以在 GPU 进行计算的同时,提前把可能用到的 N-Gram 数据从内存甚至 SSD 里准备好,从而实现与模型计算的“重叠”。

有开发者实测发现,这个 N-Gram 表的访问非常“稀疏”,也就是说,并不是所有条目都会被频繁用到,特别适合放在系统内存里。
有开发者分享,用 92GB 总内存(含显卡显存),配合 SSD 卸载部分数据,跑起这个模型来,生成速度能达到每秒约 40 个 token。
还有人提到,即使把部分数据放在 NVMe 固态硬盘上,性能损失也微乎其微。

这意味什么?意味着我们普通人,可能很快就能在自己的电脑上,用远低于数据中心级的硬件配置,跑起来拥有千亿级别“知识储备”的超级模型。这是一个巨大的范式转移。

大模型的竞争,可能正从“谁堆的显卡多”,转向“谁的内存和硬盘大、谁的数据调度算法更 clever”。

等等,事情好像没那么简单

当你觉得“查表代替计算”这个逻辑简直完美无瑕,AI 的“记忆革命”已经势不可挡的时候,事情开始变得有意思了。

第一个反转来自社区的真实测试。
在 Qwen3.8-Flash-Next 发布后,有开发者用它对诗歌领域的“世界知识”进行了测试。结果发现,模型的表现并不完美。它能完整引用的诗句,全是像“Water, water, every where”、“In Xanadu”这类在 Quote 网站和诗歌选集里烂大街的“名句”。一旦需要回忆的不是“关于诗歌的名句”,而是“诗歌本身的文本”,模型就开始露馅了。它会生成一堆听起来很像、用词很华丽、但完全丢失了原意的“仿制品”。

这个测试残酷地揭示了一个事实:Engram 和 N-Gram 表,首先是一个“短语补全引擎”,而不是一个“事实回忆引擎” 。

第二个反转来自技术本身的局限性。
DeepSeek 的论文明确指出,Engram 的收益存在“U 型缩放定律”,并不是记忆模块越大越好。当记忆部分超过 20%-25% 的比例后,继续增加带来的收益会急剧下降,甚至会损害模型的推理能力。换句话说,Engram 不是万能的“记忆神药”,它有严格的“最佳剂量” 。想把所有知识都塞进一个巨大的查表里,这条路可能走不通。有研究者在小规模实验中发现,N-Gram 槽位虽然通过哈希能覆盖几乎所有可能的短语组合,但不同短语会“共享”同一个物理槽位。

这种“碰撞”在工程上虽然可控,但在理论上限制了它作为精确知识库的潜力。

第三个,也是最戏剧性的反转,来自 DeepSeek 自己。
2026 年 5 月,万众期待的 DeepSeek V4 技术报告正式发布。然而,整个 AI 社区在阅读这份报告时,都做了一个相同的动作:按下 Command+F,搜索那个让他们期待了四个月的词——“Engram”。结果,报告里根本没有提到 Engram。这个曾被所有人视为 V4 架构地基的“记忆模块”,竟然在最终的 V4 中缺席了。

DeepSeek V4 选择了更稳健的纯 MoE 路线。是 Engram 的工程化遇到了难以克服的挑战?还是它在更大规模上未能复现论文中的惊艳效果?抑或是 DeepSeek 正在秘密研发一个更强大的 Engram 2.0?所有这些问题的答案,都还是未知数。

写在最后:一个“未完成”的答案

看到这里,你可能已经有点晕了。我们到底该相信论文里惊艳的数据,还是社区里那些“翻车”的案例?该期待 Qwen 的 51B“记忆外挂”,还是对 DeepSeek V4 的“遗忘”感到困惑?

这正是这项技术最迷人的地方。它不像某些发布那样,宣称自己已经找到了终极答案。它更像一个刚刚被提出的“问题”,一个尚未完成的“实验”。

DeepSeek 的论文抛出了一个极具颠覆性的思路:把“记忆”和“计算”分开。阿里 Qwen 则把这条路给趟了出来,证明了在一个千亿级 MoE 模型上,挂载一个千亿级的“记忆硬盘”是可行的,而且成本效益惊人。训练成本仅为前代的九分之一,但编码和办公任务的能力反而更强了。这本身就是一场胜利。

但 Qwen3.8-Flash-Next 在诗歌测试中的“翻车”,以及 DeepSeek V4 对 Engram 的“遗忘”,又像一盆冷水,提醒我们事情远没想象中那么简单。记忆模块到底“记住”了什么?是完整的“知识”,还是仅仅是“短语的惯性”? 当模型学会了用“查表”来应付我们,它是不是在更深的层面上,放弃了真正的“理解”?

这也许就是技术演进最真实的样貌。它从来不是一条直线,而是在一次次的反转和悖论中,螺旋式上升。我们可能正站在一个分水岭上。一边是“越大越好”的 Scaling Law 逐渐触及天花板,另一边是“计算与记忆分离”的全新范式刚刚萌芽。

所以,回到最初的问题:N-Gram 表会彻底改变 AI 竞赛的格局吗?

答案可能就藏在 DeepSeek V4 报告里那个缺席的“Engram”中,也藏在 Qwen3.8-Flash-Next 那 51B 参数的“记忆外挂”首次被普通人跑起来的惊叹里。它还没有被完全证实,但也绝没有被证伪。

这个故事的下一章,将由 DeepSeek 的下一个模型、Qwen4 的正式版,以及无数在开源社区里尝试在各种硬件上跑通这些模型的开发者们,共同来书写。

而我们,正站在这个故事的起点,而不是终点。