GLM-5.3在短篇创意写作基准测试中拿下第二名,仅次于Claude Fable 5!
等等,你确定这个“第二名”是真的吗?
2026年8月,智谱AI发布GLM-5.3。编程能力涨了50%,安全能力爆发,在Artificial Analysis智能指数上拿到60分,和Kimi K3并列开源模型第一。但真正让圈内炸锅的,是一份短篇创意写作排行榜——GLM-5.3(max)位居第二,仅次于Claude Fable 5,压过了GPT-5.6 Sol、Kimi K3等一堆旗舰模型。
一个主打编程和安全的模型,写故事居然能排到全球第二?
更诡异的是,同一时间,LMArena的创意写作榜上,人类投票的结果完全两样——Opus 4.6和Fable 5霸榜,GLM-5.3连前十都没进。同一个模型,AI评委说“你是亚军”,人类评委说“你谁啊”。到底谁在说谎?
这个“第二名”到底怎么来的
先搞清楚一件事:这个排行榜不是随便拉几个人打分,而是一套叫“Lech Mazur Writing Benchmark”的标准化测试。
规则是这样的:每个模型拿到同样的10个随机元素——一个人物、一个物件、一个核心概念、一个属性、一个动作、一个方法、一个场景、一个时间框架、一个动机、一种语气——然后按要求写一篇400到500词的短故事。每篇故事必须把这10个元素“有机地”编织进去。注意“有机”这两个字——不是清单式地罗列,而是让它们自然地成为故事的一部分。GLM-5.3写了500篇这样的故事。
然后,7个独立的LLM评委出场。它们从人物塑造、情节结构、氛围营造、叙事技巧、原创性、连贯性,以及10个元素的融入程度等16个维度打分。最终,GLM-5.3(max)拿到3.3分,91%的预估胜率,排名第二。
注意一个关键设定:所有模型写的是“同样的约束简报”,也就是面对完全相同的创作任务。这意味着分数是直接可比的——不是A写科幻、B写言情,而是大家都写同一套命题作文。
这套方法设计得相当严谨!但也存在争议。
Claude Opus 5断层领先
我们先直接看这份新鲜出炉的排行榜,结果简直让人惊掉下巴!Claude Opus 5拿下了4.2分,排在绝对的第一名。要知道,这个分数的含义跟平常的考试完全不一样!在这个系统里,0分才代表平均水平,4.2分意味着它打赢了百分之九十六的对决!这已经不是领先了,这简直是降维打击。
但是,你别看Claude Opus 5这么猛,就以为美国公司稳赢了!排在第二名和第三名的,分别是GLM-5.3和Kimi K3。这两个中国团队搞出来的大语言模型,硬生生把OpenAI的一众老牌选手挤到了身后!GPT-5.6只能屈居第五,而之前被吹上天的某些版本,更是直接跌出了前十。这说明什么!说明大语言模型写作的江湖,早就变天了。
更有意思的是排行榜底部的惨状!排在最后的Grok 4.5只拿了负4.8分,赢面只有百分之二。这意味着它写的故事,扔给评委几乎次次都被嫌弃!这就怪了,既然都是顶尖公司花几十亿砸出来的大语言模型,为什么写个几百字的小故事,差距能大到这种地步。事情没那么简单!
这里引出了一个争议:在这个测试里,分数高的模型,往往是最听话、最擅长硬凑元素的模型。而那些可能更有灵气、但因为漏掉一个元素就被淘汰的模型,反而拿不到好成绩!我们到底是在测写作能力,还是在测听指令的能力?对吗?
还有一个更大问题是:评委们是AI。
AI评AI写的故事,这算不算作弊
反对者第一个跳出来:你让AI写故事,再让AI打分,这跟让考生自己改卷有什么区别?
LMArena的创意写作榜用的是真人盲测——两个故事并排摆着,真人用户投票选哪个更好。在那一套体系里,GLM-5.3根本排不上号。Opus 4.6和Fable 5才是人类眼中的写作之王。
支持者的反驳也硬:真人评委就一定靠谱吗?LMArena上那些“高排名”模型写出来的句子,有人贴出来过——什么“她拥有一种叫做先见之明的认知诅咒,但只有事后才能看到”,还有“他们破烂的、根本不存在的衣服所属的特定时代”。这种文字能拿高分,只能说明投票的人类要么没仔细看,要么鉴赏力堪忧。
两边都有道理。AI评委的优势是稳定、可重复、不受情绪影响。但问题是,AI评委的训练数据本身就来自人类写作,它喜欢的风格会不会有某种系统性偏差?换句话说,AI评委可能正在“选美”——选的是它自己认为“像好故事”的故事,而不是人类真正爱读的故事。
这就怪了——一个为人类设计的创作测试,评委居然不是人类?
GLM-5.3学会制造冲突了
剥开这些排名大战的喧嚣,我们得看看这次拿了第二名的GLM-5.3到底进化了什么!发榜单的人给出了一个非常敏锐的观察,那就是GLM-5.3终于学会了制造冲突!它的上一代GLM-5.2 Max写故事的时候,主角总是一个人待在和谐的世界里自言自语,就像在写日记。
但是GLM-5.3不一样了,它会在房间里强行塞进第二个人。这个新人会阻碍主角;会评判主角;甚至会被主角改变!这样一来,主角的信念就必须在与人交锋中存活下来。而且GLM-5.3不再在故事结尾让旁白跳出来解释意义,它会让事件直接发生,让角色付出代价。这就怪了,这种教科书级别的写作技巧,机器是怎么突然开窍学会的。事情没那么简单!
GLM-5.2到5.3:同一副骨架,换了个人
GLM-5.3的底座和GLM-5.2一模一样——7530亿总参数的MoE架构,每次推理只激活约400亿参数。所有提升来自后训练。
这就像同一具身体,换了大脑。GLM-5.2写故事喜欢让主角独自行动,世界配合着他。故事往往停在“决定性事件的前夜”,让叙述者告诉你这件事意味着什么。而GLM-5.3会把第二个人放进房间——这个人会 withholding( withhold信息)、judging(做出评判),或者被改变。于是,一个信念必须“在与他人的接触中存活下来”。GLM-5.3会真正“上演考验,付出代价,然后把实践传给下一个来的人”。
翻译成人话:5.2写的是“一个人想了想”,5.3写的是“两个人吵了一架,然后其中一个人变了”。
在定量层面,GLM-5.3在每一对匹配比较中都被评委选中。也就是说,不是赢了大部分——是全部。
但有个讽刺的细节:有博主实测后发现,GLM-5.3的“文笔”不如5.1和5.2,被批评为“在不说人话方面取得了长足进步”。写少年少女的纯真情感时,还被“严防死守”。一个写故事拿了第二的模型,文笔反而退步了?
成本账:便宜,但别乱用
GLM-5.3的API定价和GLM-5.2完全一样:输入每百万token 1.40美元,输出4.40美元。
但单任务平均输出约18700个token,比上代多了20%。所以同样的单价,单任务贵了大概55%。不过横向比仍然是同级最便宜的——比Kimi K3省19%,比GPT-5.6 Sol省45%。
在Z.ai Code Bench上,GLM-5.3(max档)准确率34.5%,每任务平均输出约7.5万token;GLM-5.2只有23.4%,还要烧9.6万token。准确率更高、token花得更少——效率提升看得见。
但有个坑:轻量高频任务别用GLM-5.3。短分类、短摘要这种活儿,用它就是杀鸡用牛刀。它的主场是长程Agent、复杂编程、大型代码库。
那篇让GLM-5.3拿第二的故事,到底写了什么
截止目前,没有人贴出GLM-5.3那500篇故事中的任何一篇完整原文。排行榜上的“第二名”是一个数字,3.3分,91%胜率。但我们不知道它写了什么故事、什么人物、什么情节。
这就有意思了。一个写故事拿了全球第二的模型,我们居然读不到它写的故事。这就像宣布一个人得了文学奖,但从不公布获奖作品——你只能相信评委的判断。
而评委是AI。
一个没法绕过去的矛盾
回到开头那个问题:GLM-5.3到底是不是真的会写故事?
AI评委说“是”,而且是全球第二。
真人评委说“不确定”——至少LMArena的榜上没它的位置。
这不是谁对谁错的问题,而是一个更深层的困境:当创作的消费者和评判者都开始被AI渗透时,“好故事”的标准到底掌握在谁手里?
GLM-5.3在Terminal-Bench 3.0上从4.6分跳到28.3分,翻了六倍。在CyberGym漏洞发现上拿到84.5%。它发现了潜伏40多年的DNS协议级风险,潜在影响超过1000万处公网服务。这些是硬指标,可以做AB测试,可以复现。
但“这个故事好不好”不是硬指标。它是一个审美判断。而当审美判断本身也交给了AI——而且AI们还彼此意见不一——我们到底在测量什么?
也许GLM-5.3真的写出了很棒的故事。也许AI评委有某种我们还没发现的系统性偏好。也许人类评委的“口味”本身就不稳定。也许“好故事”这个概念,在被AI大规模介入生产和评判之后,正在悄悄改变它的含义。
唯一确定的是:GLM-5.3确实在Lech Mazur的测试里拿了第二。那个测试的方法公开、数据可查、评委是7个独立的LLM。但那个测试的“3.3分”到底对应什么样的故事质量——在没有读到任何一篇完整故事之前——谁也说不准。
这就是目前的局面:一个编程和安全能力暴涨的模型,在写故事这件事上被AI评委捧到了亚军位置,但没人读过它写的亚军作品。你觉得,它写的故事到底怎么样?