Kimi K3缓存为何比DeepSeek V4大,2.78万亿参数与24层无压缩层的真相

金句:两万亿参数模型打架,偷看小抄那个真能赢吗?

Moonshot的K3缓存比DeepSeek V4大,这件事本身就像学霸考试带了两本笔记本。一本记重点,一本记全部。但重点来了,两本笔记本的重量差距,直接决定了谁跑得快、谁记得牢。这篇文章不聊代码,只聊缓存大小背后那点人性。缓存就是模型的小抄本,越大能记的东西越多,但翻书速度也越慢。

K3和V4这两个模型,在小抄本的设计上走了两条完全不同的路:

  1. 一条路是拼命压缩,什么都记一点点。
  2. 另一条路是保留四分之一的全貌,关键地方绝不偷懒。
这两种选择没有对错,只有取舍。就像有人喜欢用手机记所有事,有人只记关键词。现在我们把这两本小抄翻开,看看里面到底写了什么。

小抄本大小决定考试命运

缓存这个东西,说白了就是模型临时记东西的地方。模型读了一大段文字,比如一整本小说,它得把前面的人物关系、时间地点都记下来。不然读到后面就忘了前面谁是谁。这个临时记忆空间就是KV缓存。K3的缓存空间比V4大得多,因为K3本身参数就多。参数就像模型的脑细胞,脑细胞越多,记东西的空间自然越大。K3有2.78万亿个参数,V4只有1.6万亿个参数。差了一万多亿个脑细胞,缓存空间大一点很正常。

但这不是全部真相,真正的秘密藏在另一件事里。

K3的团队在缓存设计上做了个大胆的决定。他们把模型分成69层有损压缩层和24层无压缩层。
有损压缩就是记东西的时候丢掉一些细节,只留大概轮廓。就像你记一个电话号码,只记前三位和后四位,中间几位直接扔了。
而无压缩层就是老老实实把所有数字都记下来。K3这24层无压缩层,就是它缓存比V4大的第二个原因。

V4那边走的是另一条路,所有层都做压缩。每一层都用CSA或者HCA那种高压缩技术。压缩肯定会有信息丢失,就像把一张高清照片压成模糊缩略图。

但你压得越狠,缓存占的地方就越小。V4把所有层都压了,所以缓存空间省到了极致。这就像学霸只记公式不记例题,省地方,但遇到变形题可能懵。K3保留24层不压缩,就像学霸连例题解析都记了,缓存大但查起来更准。两边的算盘打得都不一样。

有损压缩那点亏心事

现在问题来了,有损压缩到底丢了什么。理论上说,K3在查历史细节这件事上应该比V4强。比如你给模型一万页合同,然后问其中某一页上的电话号码。K3有将近四分之一的层没有做压缩,所以它记得住那个号码的每一位数字。V4所有层都做了压缩,电话号码可能只记住了区号和后四位。中间几位被压缩算法判定为不重要直接扔了。这就是有损压缩的代价,它会丢掉那些看起来不重要但实际上要命的小细节。

但V4的团队肯定也想到了这个问题。他们把压缩做到极致,然后用工具来弥补。比如需要查电话号码的时候,先让模型从缓存里找大概位置,再调用外部工具去精确读取。这种方案就像你记不住电话号码,但手机里有通讯录,搜一下就有了。两种方案都能达到目的,只是路径完全相反。K3靠内存硬记,V4靠工具加压缩。这就像有人靠脑子记路,有人靠导航。哪个更好,得看路况。

在超长文本的场景下,比如让模型读一百万字的小说。K3的24层无压缩层能保证小说里某个配角的出场时间记得清清楚楚。V4的压缩层可能只记得主角干了啥,配角是谁都模糊了。但如果V4外接了一个检索工具,问配角的时候先去搜一遍全文,那也能找到。所以两种方案背后是两种不同的世界观。K3觉得内存就是用来记的,别省。V4觉得内存能省就省,反正有工具兜底。

压缩算法那点数学把戏

CSA和HCA这两种压缩技术,听起来很高端,本质就是把注意力矩阵变稀疏。注意力矩阵就是模型看文字的时候,每个词对其他词的关注程度。比如“我爱北京天安门”这句话,“我”关注“爱”,“爱”关注“北京”。如果每个词都关注所有词,那矩阵密密麻麻,缓存巨大。压缩算法做的就是砍掉一些关注度低的连接。比如“我”和“天安门”的关系没那么紧密,就把这个连接砍了。这样缓存就小了很多。

但砍连接这件事有讲究。砍多了,关键信息可能丢失。砍少了,缓存压缩效果不明显。V4在所有层都用这个砍连接的技术,所以缓存特别小。K3只在69层砍连接,剩下24层一点不砍。那24层里,每个词都关注所有词,连接密密麻麻。这就是K3缓存大的核心原因之一。但也是K3检索精度高的原因。不砍连接的层就像高清摄像头,每个像素都清楚。砍了连接的层就像监控录像,关键帧清楚,中间帧模糊。

MLA是K3用到的一种无压缩注意力机制。它在序列维度上不做压缩,但在头维度上做压缩。头维度可以理解成模型看文字的多个角度。比如一个头看语法,一个头看语义,一个头看情感。MLA把头维度压缩了,但保留序列维度完整。这就像你看了整部电影,但是只记住主角的长相。细节清晰,但视角单一。V4那边连头带序列一起压缩,所以缓存更小,但视角也少了。

两家实验室那点路线之争

现在最有趣的地方来了。V4和K3走的是两条完全不同的技术路线。V4赌的是压缩极限加上工具辅助。他们觉得未来模型的缓存会越来越小,因为压缩算法会越来越好。而且外部检索工具会越来越强,模型根本不需要记那么多东西。这种路线有点像云存储,本地什么都不存,需要什么直接从云端调。好处是模型轻便跑得快,坏处是断网就傻了。

K3赌的是保留关键层的完整性。他们觉得有些信息绝对不能丢,必须记在脑子里。这24层无压缩层就是他们的底牌。这些层负责高精度检索,其他69层负责泛化理解。这种路线有点像本地硬盘,所有重要东西都存自己电脑上。好处是随时能查,不用依赖外部工具。坏处是硬盘占地方,跑起来慢。

两种路线的设计空间非常广阔。V4那边可能在未来会发展出更聪明的压缩算法,把丢失的信息用数学方式补回来。就像照片压缩成JPG后,AI能还原出接近原图的画面。K3那边可能会增加更多无压缩层,让检索精度更高。但也可能转向混合方案,部分层压缩部分层不压缩。现在两家都在探索,没有谁绝对正确。

从工程角度看,V4的方案更极端,更考验算法能力。K3的方案更稳妥,更依赖硬件堆料。从用户角度看,如果你需要模型记住很多细节,K3可能更靠谱。如果你只是让模型做总结和归纳,V4性价比更高。这两种选择背后是两种不同的产品哲学。V4想用算法换成本,K3想用硬件换性能。

数字背后的那点人性博弈

我们回头再看这串数字。K3的2.78万亿参数,比V4的1.6万亿多了整整1.18万亿。这多出来的脑细胞大部分都用在缓存上了。但缓存大这件事,既是优点也是缺点。优点是检索准,缺点是速度慢。V4那边缓存小,速度快,但检索可能会丢细节。这就像你选手机,是要大内存还是快充。两个都想要,但预算有限只能选一个。

两个团队在做决策的时候,肯定吵过无数架。
压缩派说,不压缩就是浪费算力。
保留派说,压缩就是自断臂膀。

最后两边选了不同的平衡点。

V4的平衡点偏向极致压缩,K3偏向保留关键。这个平衡点没有标准答案,只有适不适合自己的场景。V4可能更看重推理速度,所以把缓存压到最小。K3可能更看重长文本理解,所以保留了24层高清层。

这种路线差异在AI行业很常见。就像有的公司All in大模型,有的公司All in小模型。有的公司走开源路线,有的公司走闭源路线。没有哪条路绝对正确,只有哪条路更适合当前的技术储备和产品目标。V4和K3的分歧,本质上是对未来计算范式的不同预判。V4觉得未来是算法优化的时代,K3觉得未来是算力堆砌的时代。

从投资角度看,V4的方案更省钱,适合资源有限的公司。K3的方案更烧钱,适合有雄厚硬件底子的公司。从技术演进角度看,V4的方案更激进,可能催生新算法。K3的方案更保守,但胜在稳定可靠。两种方案都会继续迭代,未来可能在某个点汇合。比如V4发现某些层真不能压,K3发现某些层压了也没事。到那时候,两家可能就殊途同归了。

最后说一个扎心的真相。无论缓存大小怎么设计,模型本身还是不懂自己记了什么。它只是机械地存储和检索,就像图书馆管理员只管分类,根本看不懂书的内容。所以我们在这讨论缓存大小,其实是在讨论图书馆的设计图纸。图纸画得再漂亮,书还是那本书,读者还是那个读者。但图纸画得好不好,直接决定了你找书的时候要等三秒还是三十秒。

全文总结:K3缓存大是因为参数多加上24层不压缩,V4缓存小是因为所有层都玩命压缩。两种方案一个偏精度一个偏速度,没有绝对赢家。差异背后是两家对技术路线和资源投入的不同选择,未来谁更优,还得看场景和迭代。但说真的,模型记再牢,也记不住自己昨天吃了啥。