一个320亿参数的“全能生”和一个2840亿参数的“偏科生”,在同一个Agent框架下干活,结果跟你想象的不一样!
2026年8月,AI圈发生了两件大事。先是7月31日,DeepSeek把V4 Flash正式版推上线,一个总参数2840亿、激活才130亿的“小个子”,在Agent基准测试上跑出了让人看不懂的分数。不到一个月,8月26日,智谱把匿名跑了很久的“Ox-Alpha”揭了盖头,正式命名GLM-5.3 Flash,320亿总参数、激活18亿,MIT协议开源,Artificial Analysis Intelligence Index直接拿下57分,和Claude Opus 4.8平起平坐。
两个模型,前后脚发布,都冲着“便宜大碗能干活”来的,都号称要在Agent场景里大干一场。但你真把它们塞进Hermes Agent里跑一跑,事情就没那么美好了。
GLM 5.3 Flash:纸面数据炸裂,落地就开始翻车
先说说GLM 5.3 Flash的硬指标。320亿总参数、18亿激活参数,采用稀疏注意力加线性注意力的混合架构,光这一条就是开源前沿模型里的头一份。跟自家大哥GLM 5.3比,注意力计算量降了3倍,KV缓存降了4.4倍。在Terminal-Bench 2.1上拿了84.3分,压了DeepSeek V4 Flash的82.7分一头。AA综合智能指数57分,跟Claude Opus 4.8持平,比DeepSeek V4 Pro的53分和V4 Flash的52分都高。
价格更是离谱。限时五折的时候,输入每百万Token七分五美元,输出两毛五。就算恢复原价,输入一毛五、输出五毛,还是比DeepSeek V4 Flash最便宜的时候低。智谱自己说的——同样智力,四十分之一价格。
听着是不是觉得GLM赢定了?
但真把它塞进Hermes Agent里干活,画风就变了。
有用户反映,GLM 5.3 Flash在Hermes里连工具调用都磕磕绊绊,得自己打补丁才能跑顺。更麻烦的是,它对Agents.md文件的态度特别随意——你写的是“必须遵守的协议”,它当“仅供参考的建议”。一个Agent框架的核心就是让模型按规矩办事,模型把规矩当耳旁风,这活还怎么干?
还有人试过在Hermes里给GLM 5.3 Flash强调“你是多模态模型,能看图”,结果它照样回复“截图我暂时看不了”。原生多模态的招牌,到了实际场景里自己先不认账。
甚至有人在Codex里用GLM 5.3 Flash改一个H5页面文本框的复制按钮,空转了30分钟烧掉2000万Token。
纸面数据再漂亮,落地全是坑。这就怪了!
DeepSeek V4 Flash:参数少一半,干活稳一半
再看DeepSeek V4 Flash。总参数2840亿,激活130亿,MoE架构,支持100万Token上下文。7月31日上线的正式版,官方说得很实在——“模型结构、尺寸和预览版保持一致,仅重新进行了后训练”。
就靠这一手“重新后训练”,V4 Flash在Terminal Bench 2.1上从61.8分飙到82.7分。DeepSWE从7.3分冲到54.4分,涨了六倍多。在AIME 2026数学测试上拿到95.83%,跟V4 Pro的96.67%在统计上没有显著差异,成本却只有后者的九分之一。
价格方面,输入缓存命中每百万Token两毛,未命中一块,输出两块。比GLM贵一点,但在Agent场景里,这点差价换来的是一套能直接跑的系统。
开发者张泽把DeepSeek V4 Flash接入Hermes做实测:同样任务,V4 Flash加Hermes用了40秒,GPT-5.6 Sol加Codex用了一分47秒。V4 Flash在选择和调用skill的准确度上“总体上还不错,可以根据工具返回结果调整后续步骤”。
更关键的是,Hermes社区把DeepSeek V4 Flash列为推荐默认模型。一个开源Agent框架把哪个模型当默认,说明这个模型在真实场景里经得起折腾。
事情没那么简单!
跑分赢了,干活输了——问题出在哪?
GLM 5.3 Flash和DeepSeek V4 Flash的对比,暴露了一个被很多人忽略的问题:模型评测和实际干活,是两码事。
AA综合智能指数57分 vs 52分,Terminal-Bench 84.3 vs 82.7——这些数字让GLM在纸面上看起来是“更强的那个”。但一个模型在标准化测试里拿高分,不代表它在真实Agent工作流里能稳定输出。
Hermes Agent的工作逻辑是这样的:你给它一个任务,它调用模型,模型需要理解任务、拆解步骤、调用工具、根据反馈调整、最终交付结果。这个链条里每一步都在考验模型的实际工程能力,而不是在选择题里选对答案。
GLM 5.3 Flash的问题恰恰出在这里。它把Agents.md当建议而不是命令,说明它在指令遵循上不够“死板”。在Agent场景里,“死板”恰恰是美德——你让模型按规矩来,它就必须按规矩来,不能有自己的“想法”。工具调用需要打补丁才能跑,说明它的function calling在真实API环境下还不够健壮。多模态能力自己先不认,说明它的视觉能力在特定框架里还没打通。
DeepSeek V4 Flash为什么更稳?因为它从一开始就是冲着Agent场景去的。DeepSeek官方在7月31日的更新里特别提到,Agent能力“大幅增强”。他们甚至组建了专门的Agent Harness团队,挂帅的是在Jane Street干了九年的崔添翼。这不是在做一个通用模型顺便支持Agent,而是在做一个Agent模型。
这就好比两个人考试。一个模拟考每次都高分,但上了考场就紧张;另一个模拟考分数一般,但每次实战都稳。你要招人干活,选哪个?
Hermes Agent的“模型选择题”为什么这么难?
Hermes Agent本身是个很有意思的项目。Nous Research开发的,MIT协议开源,2026年2月上线后迅速拿到超过14万Star。它的核心卖点是“自进化”——能从任务里自动提炼技能、持久记忆用户偏好、跨会话精准回忆。在一台5美元的VPS上就能跑。
但它面临一个根本问题:再好的Agent框架,也得靠模型来干活。而模型的选择,远比想象中复杂。
GLM 5.3 Flash在8月27日就被Hermes Agent v0.20.6正式收录进模型选择器。但收录归收录,能不能好好干活是另一回事。有用户在Hermes的GitHub Issue里报告,GLM 5.3的请求在关闭思考模式时会失败。而Hermes在处理GLM 4.5以上的模型时,如果用户把推理关掉,系统仍然会发送disabled参数。这是一个典型的“框架和模型没对齐”的问题——模型有自己的脾气,框架按自己的习惯来,两边一碰就出bug。
DeepSeek V4 Flash也有自己的问题。有用户报告它在思考模式下会陷入无限推理循环。那些夸DS4 Flash在长代码任务上表现好的用户,往往都说自己把推理模式关掉了。这说明DeepSeek的思考模式在某些场景下还不够成熟,你得摸清楚它的脾气才能用好。
但区别在于,DeepSeek V4 Flash的这些问题是可以绕过去的——关掉思考模式就行。而GLM 5.3 Flash的问题是根本性的——它不把规矩当规矩,这种“性格”问题,靠调参数解决不了。
便宜不是一切,能干活才是
GLM 5.3 Flash的价格确实诱人。四十分之一的价格拿到跟Claude Opus 4.8同级的分数,谁看了不心动?但价格便宜的前提是“同样智力”——如果这个智力在特定场景里发挥不出来,再便宜也是浪费。
DeepSeek V4 Flash贵一点,但贵得有道理。它在Hermes Agent里是推荐默认模型,说明社区用下来觉得它靠谱。它在工具调用上支持得更扎实,Agents.md这类协议文件能老老实实执行。它可能不是纸面上最聪明的那个,但它是那个能把活干完的。
有用户在Hermes的讨论里说得很直白:“GLM 5.3 Flash很好,但如果你是编程新手,用DeepSeek”。新手最需要的不是一个“聪明但得自己调教”的模型,而是一个“笨但听话”的模型——你给它指令,它照做,出了问题你知道是哪里错了。GLM 5.3 Flash那种把协议当建议的风格,新手根本没法debug。
另一个用户说得更狠:“我做了大量评估,DS4F总是赢”。这个“赢”不是在跑分榜上赢,是在真实干活场景里赢。
跑分机器和干活机器的分水岭
GLM 5.3 Flash和DeepSeek V4 Flash的对比,其实揭示了一个更深层的变化:大模型竞争正在从“跑分竞赛”转向“干活竞赛”。
2023年大家在拼通用能力,2024年拼长上下文,2026年的关键词是Agent。Agent能力的核心不是模型在标准化测试里能得多少分,而是它在真实工作流里能不能稳定、可靠地完成任务。
GLM 5.3 Flash在Artificial Analysis Intelligence Index上拿57分,跟Claude Opus 4.8持平。但在Hermes Agent里,它连Agents.md都执行不好。这说明什么?说明现有的评测体系跟真实场景之间存在巨大的鸿沟。一个模型可以在所有标准测试里拿高分,但在实际Agent工作流里处处碰壁。
DeepSeek V4 Flash的AA指数只有52分——比GLM低了5分。但它Herm在es里是推荐默认模型。社区的选择说明了一个残酷的事实:跑分高不一定好用,跑分低不一定难用。
这不是说GLM 5.3 Flash不好。它可能在其他场景里表现优异——比如需要多模态理解的任务,或者不需要严格遵循协议的长文本处理。但在Hermes Agent这种需要模型“听话”的框架里,它确实水土不服。
问题来了:一个模型在标准化测试里拿高分,但在真实场景里频频翻车——我们到底该信哪个?
一个让开发者失眠的细节
DeepSeek V4 Flash在Hermes Agent里跑相同任务用了40秒,GPT-5.6 Sol加Codex用了一分47秒。速度快是好事,但速度快的代价是什么?是输出质量打了折扣。
如果你用DeepSeek V4 Flash写一个上线项目,40秒交付的代码和一分47秒交付的代码,差距有多大?这个差距在什么场景下可以接受,在什么场景下会出大问题?