模型明明同一个大脑,怎么就像换了个人?开源闭源到底谁在藏招?
摘要:2026年8月14日,智谱AI发布GLM-5.3,基座与5.2完全相同,仅靠后训练将Terminal-Bench 3.0分数从4.6提升至28.3,编程能力跃升约50%,并意外涌现顶级网安能力。这种“同基座、性能暴涨”的反常现象,引爆了关于“刷榜”“秘密配方”还是“巨头藏拙”的激烈争论。
同一个基座,两个世界
2026年8月14日,智谱AI甩出了新一代基座模型GLM-5.3。七千四百三十亿参数的MoE架构,一百二十八K输出窗口,MIT开源协议——这些数字单看没什么,顶多算常规升级。
但真正的风暴藏在官方博客开篇那句话里:基座与GLM-5.2完全相同,所有提升都来自后训练。
这就怪了!
GLM-5.2发布才两个月,顶着“开源最强编程模型”的帽子还没戴热乎。现在同一个大脑,同一个参数规模,同一个架构,就因为“又集训了一段时间”,性能直接翻倍?放在人类世界,这等于说一个高考状元没换脑子,暑假多做了几套卷子,回来就变爱因斯坦了。
事情没那么简单!
六倍差距:一个让人睡不着的数字
GLM-5.2的Terminal-Bench 3.0得分是4.6。这个分数没什么争议,因为公开榜单上写得清清楚楚。
GLM-5.3在这个同样测试上的得分是28.3。不是二十八点三,是四点六的六点一五倍。
同一套题,同一个评分标准,同一个模型家族,中间只隔了两个月的“后训练”。
更让人坐不住的是DeepSWE v1.1的对比:四十六点二跳到六十六点九。这一跳直接把GLM从“开源阵营里还不错”推进了“跟闭门顶尖选手扳手腕”的区间。要知道Claude Fable 5在这个测试上也就六十九点七。
如果你觉得四十六到六十六就是“涨了二十个点”,格局小了。在AI模型竞争里,从及格线到优秀线的这二十个点,往往是技术代差的分水岭。
后训练到底是什么鬼
基座模型,相当于给AI上了十二年义务教育。它把全世界公开的文本、代码、论文吞进去,学会了一套“世界观”和基础知识。这一步烧钱最狠,动辄几万张GPU跑几个月。
后训练,是义务教育结束后的“特种兵集训”。模型已经“知道了”所有知识,但还不知道“怎么用”才能效率最高、效果最好。后训练就是让它做大量任务、试错、被纠正、被强化,把“知识储备”转化成“干活能力”。
这听起来合理。真正不合理的地方在于:如果后训练能在一个基座上制造如此巨大的性能差距,那是不是意味着之前所有模型都在严重“低估”自己的基座潜力。
换句话说,现有的预训练基座,可能远远没有达到它们的智能上界。智谱自己也是这么说的:“可能我们还远未开发出这个基座的智能上界”。
刷榜论:最有说服力的脏水
各路AI社区的反应非常整齐,简直像集体提前写好了剧本。
第一波声音来得最快:刷榜。中国AI公司的老传统了,把公开测试集数据塞进训练集,模型在考场上见过原题,分数自然水涨船高。
这指控杀伤力不小,因为GLM-5.3的分数分布确实有“刷榜味”。几乎所有爆炸性增长都集中在编程和智能体相关测试上,尤其是Terminal-Bench这个最近才火起来、数据可能还没被充分清洗的新榜单。从4.6到28.3的六倍跃升,像不像提前拿到了模拟题。
但有个细节很扎眼:GLM-5.2和5.3是同一个基座。如果刷榜靠的是“在预训练阶段把测试数据混进去”,那GLM-5.2就应该已经刷过了。现在5.3晚发两个月、全靠后训练就实现分数翻倍,那只能说明后训练阶段也“针对性优化”了。
这个逻辑链条走到最后,会出现一个尴尬的推论:如果所有公开榜单都可能被污染,那GLM-5.3到底比5.2强了多少,成了一个无法从公开数据证实的问题。
智谱显然预判了这一点,所以自己掏钱搞了一个内部基准叫Z.ai Code Bench,故意用不公开的数据和更复杂的任务环境来评估。在这个内部测试里,5.3比5.2提升了约百分之五十,与公开榜单方向一致。但这份努力又引出了新麻烦:内部基准的客观性怎么保证呢?
隐藏大招:一个本不该出现的天赋
如果编程分数的跃升还可以用后训练解释,那么网络安全能力的爆发就完全没法按常理出牌了。
GLM-5.3在CyberGym漏洞推理评测上得分84.5%,压过了Claude Mythos 5的83.8%和GPT-5.6 Sol的83.6%,拿下开源第一。
在ExploitBench漏洞利用基准上,它比前代翻了一倍还多,从24.4涨到54.4。
更具体一点:智谱联合安全团队,用GLM-5.3在真实代码库里两周挖出2436个漏洞,其中1097个是中高危。甚至挖出了一个潜伏四十多年的DNS协议级漏洞,攻击者只需少量特殊请求就能把服务器压力放大近八万倍。
这些不是“写个网页、做个游戏”的玩具级任务。网络安全涉及协议规则、权限边界、攻击路径、系统级因果推理。这是代码能力向高阶任务的延伸。
问题来了:如果后训练只是把模型“知道的东西”打磨成“能做到的事”,那说明GLM的基座里本来就装了足够多的网络安全知识,只是之前没激活。可谁会在预训练阶段往一个“编程模型”的数据集里大量灌注漏洞挖掘数据,这不等于提前预设了它的进化方向吗。
“意外涌现”——智谱官方用的就是这个措辞。翻译成人话:我们也没完全搞明白它怎么就会了。
对比一下,如果OpenAI或者Anthropic突然宣布自家模型在某个完全新领域“意外涌现”出超能力,社区大概率会欢呼“AGI火花”。当同样的事情发生在智谱身上时,质疑声几乎同步响起:这是不是另一种形式的刷榜,挑了个没人注意的细分领域堆数据。
不能忽视的效率牌
在热闹的分数争议之外,有一个安静的变量被大多数人忽略了,可能这才是真正改变局面的东西。
在Z.ai Code Bench的High档位测试中,GLM-5.3用大约五万Token拿到了31.4%的准确率;Claude Opus 4.8用大约十二万Token拿到了29.5%。
准确率更高,Token消耗不到对方的一半。
这不是一个“谁跑分高”的问题,这是一个“谁能大规模落地”的问题。真实世界的编程不是跑一次基准测试就完事,它涉及规划、读文件、改代码、跑测试、看报错、再调整。几十次甚至上百次模型调用叠在一起,输出Token数量直接决定成本天花板。
按照GLM-5.2的定价估算,单次任务五万Token对应约零点二二美元的输出成本;如果换成十二万Token的方案,单次就奔着零点五三美元去了。乘以一万次任务,差距就是两千两百美元对五千三百美元。
换句话说,GLM-5.3可能不是在跟闭源巨头比“谁的代码更聪明”,而是在比“谁的聪明更便宜”。后者在很多实际场景里,可能比前者更有杀伤力。
最大的谜底:别人的手牌到底多大
GLM-5.3发布后,社交媒体上一个问题反复被追问:如果中国开源模型纯靠后训练就能把七千亿参数的基座推到逼近Claude Fable 5的程度,那OpenAI和Anthropic手上的牌到底有多大。
没人知道答案。
OpenAI和Anthropic从来没公布过旗舰模型的真实参数规模。流传出来的信息大多是“比外界猜测的小得多”。如果GPT-5.6 Sol或Claude Opus 5实际上只有几百亿活跃参数,那它们在很多基准上被GLM-5.3追近甚至反超,就变得不那么令人意外了。
但反过来想,如果那些闭源巨头的真实模型比公开版本大十倍甚至几十倍,那智谱这次放出的可能只是“公开赛道的领跑成绩”,而另一个维度的竞争根本没出现在任何公开榜单上。
更微妙的信号来自开源计划。智谱宣称GLM-5.3将在发布两周后、完成安全评估和加固后开放完整权重。这个安排耐人寻味:如果模型强到能两周挖出上千个真实漏洞,开源它相当于向全世界免费发放了一台漏洞挖掘机。防守方可以用,攻击方也能用。两周的“安全延迟”是技术需要还是合规缓冲,没人说得清。
数据里的幽灵
仔细看Terminal-Bench 3.0的分数表,GLM-5.3的28.3分遥遥领先,第二名Kimi K3是17.4,第三名直接没影了。这种“断层式领先”在AI基准测试史上反复出现过,每次出现都会引发同一场争吵:这是技术突破,还是数据污染。
智谱内部的“两周挖出2436个漏洞”数据同样微妙。其中包含一个潜伏四十余年的DNS协议级漏洞。四十年没被发现,一个后训练了两个月的模型发现了。如果不是数据污染在起作用,那意味着后训练确实解锁了某种远超人类专家的大规模系统推理能力。
但问题在于,我们无法独立验证这个漏洞是否“真的”是模型独立发现的,还是模型在整个安全团队的配合下完成的,也查不到模型在整个发现过程中的“思考”轨迹。唯一能确认的是数字本身:二十四三十六,一零八八,八万倍。
这些数字足够让人睡不着觉,也足够让人继续吵下去。
GLM-5.3的真实水平到底是被高估了还是被低估了,恐怕要等到两周后权重开源、大量独立开发者拿到本地运行版本、在各自不公开的任务集上跑完才知道。而关于闭源巨头到底在藏什么,答案或许永远不会出现在任何新闻稿里。