Qwen GLM Grok Gemini四款实测:质量第一vs速度第一

大模型的“快”与“准”,你选哪个?

2026年8月的第二周,AI圈像被按下了快进键!



2026年8月12日到16日,前后不到五天,四款顶尖大模型扎堆上线。阿里扔出Qwen3.8系列——2.4万亿参数的MoE旗舰和270亿参数的稠密模型双双开源;智谱AI端出GLM-5.3,基座没换,能力却暴涨一截;马斯克的xAI甩出Grok 4.6,号称性能直逼Fable 5;谷歌匆忙推出Gemini 3.7 Flash,距离上一版只隔了三周。

这场面热闹得像过年。但真正让开发者蹲在屏幕前反复刷帖的,不是哪家发布会排场更大,而是一个来自社区的真实测试结果:有人用完全相同的提示词让四款模型同时生成“一个家庭在3D场景里吃午饭”,Qwen赢了质量,Gemini赢了速度,GLM在代码和安全上封神,而Grok……输出不完整。

这就怪了!


跑分再高,不如实测一刀

大模型发布最经典的套路是什么?先甩一串benchmark分数,然后宣布“我们在XX榜单上取得SOTA”。但跑分和真实使用之间的差距,有时候大得离谱。

先看Qwen3.8-27B。这是一款270亿参数的原生多模态稠密模型,原生支持262K tokens上下文,通过YaRN技术可扩展至100万tokens。270亿参数什么概念?经过量化后,24GB显存的RTX 3090或4090都有机会把模型完整装下。这意味着开发者可以在自己的电脑上跑一个接近Opus级别的模型。

它在SWE-bench Pro上比Claude Opus 4.6 Max高出8.3分,在OSWorld-Verified电脑操作评测中拿到84.3分,Opus只有72.7分。在19项与Claude Opus 4.6的重叠测试中,Qwen3.8-27B拿下了其中15项。这不是险胜,这是碾压。

但问题来了。有人反映在DGX服务器上跑Qwen3.8速度极慢,“什么都干不了”。同一个模型,有人欢呼“消费级显卡就能跑”,有人抱怨“超算都带不动”。这中间的落差来自哪里?量化版本和全精度版本之间的性能差距、推理框架的适配程度、甚至只是某一行配置没调对——这些细节在官方公告里永远看不到,只有在社区的血泪帖里才能翻出来。

再看GLM-5.3。总参数7430亿,基座模型和上一代GLM-5.2基本一致,能力跃升全部来自后训练阶段。在Terminal Bench 3.0上,得分从4.6直接飙到28.3;在CyberGym白盒代码审查中拿到84.5%,超过Mythos 5的83.8%和GPT-5.6 Sol的83.6%。更夸张的是,发布前两周智谱联合清华、南开等团队做了密集红队测试,累计发现2404个漏洞,其中1088个为中高危,最早的一个bug可以追溯到40年前。

一个模型能把四十年前的代码漏洞翻出来——这已经不是“编程能力强”能概括的了。GLM-5.3在安全赛道上的表现,是真正的“意外涌现”。

但事情没那么简单。GLM-5.3的7430亿参数是MoE架构的总参数,实际激活的参数远小于这个数字。而Qwen3.8-27B是稠密模型,270亿参数是实打实的每一次推理都要激活的数量。两种架构、两种路线、两种成本结构——把它们放在同一张表格里比“谁更强”,本身就是一个伪命题。


Grok 4.6:省token省到答案断了

Grok 4.6是这四款里最有戏剧性的一款。

xAI于2026年8月12日发布Grok 4.6,500K上下文窗口,定价每百万输入token 2美元、输出6美元。在Artificial Analysis Intelligence Index评测中拿到61分,与GPT-5.6 Sol的最高推理水平持平,仅比Fable 5 Max低一分。英伟达第一时间在评论区留言“恭喜发布”。

跑分漂亮,价格不贵,牌面拉满。但真实使用体验翻车了。

有测试者直言:“Grok是绝对的垃圾,几个提示词之后就只会喷出毫无价值的内容,纯粹浪费时间。”更普遍的问题是输出不完整——模型为了节省token,在答案还没写完的时候就强行截断。Independent analysis found that in over 10% of all runs, Grok 4.6 asserts, inside its own reasoning, that it cannot see the data. 模型在自己的推理过程中声称“看不到数据”——这不是输出质量问题,这是认知层面的断裂。

Grok 4.5的卖点是什么?够用、够快、够便宜。Grok 4.6为了在benchmark上追平第一梯队,被迫“想得更久、吐出更多token、花更长时间完成”。它失去了Grok 4.5引以为傲的速度和成本优势,却没有换来稳定可靠的输出质量。

这不是优化,这是 diet. 省token省到答案断了,那这顿饭等于没吃。

有人可能会说:token-thrifty本身是feature,不是bug。但当一个模型为了省token开始“跳过检查”、在推理中途宣称“看不到数据”、在超过10%的运行中自我断裂——这个feature就已经变成了 liability. 速度再快,如果第二轮的提示词只是让模型把上一轮没写完的话说完,那省下来的时间又还回去了.


Gemini 3.7 Flash:快是真快,编也是真编

谷歌的Gemini 3.7 Flash是另一极端的代表。

距离3.6 Flash发布仅三周,谷歌就端出了3.7 Flash。支持100万token输入上下文,单次最多输出6.4万token,可以处理文字、图片、音频和视频。价格方面,2026年底前每百万输入token仅0.75美元,输出3.75美元,是3.6 Flash原始定价的一半。输出速度约每秒340个token,在同类模型中排第一。

速度快、价格低、多模态全覆盖——听起来完美。但Artificial Analysis的智能指数中,3.7 Flash high设置只拿到56分,智能得分排在第17位。速度第一,智力第十七。

更致命的是幻觉问题。有开发者测试发现:“速度最快的Gemini 3.7 Flash,输出报告外表精美,但是幻觉、引用错误扎堆”。官方自己也承认幻觉“仍可能出现”。在需要精确引用和事实核查的场景里,一个外表精美但内容虚构的报告,比没有报告更危险。

这形成了2026年8月大模型发布季最吊诡的一幕:Grok为了省钱把答案写断了,Gemini为了省时间把答案编全了。一个是不给,一个是乱给。两种不同的失败模式,指向同一个结论:在“快”和“准”之间,目前没有模型能同时做到两者兼得.


27B干掉万亿参数?参数不是一切

这场测评里最反常识的发现,来自一个被反复验证的对比:Qwen3.8-27B——一个270亿参数的模型——在真实任务中 consistently 击败了参数量大得多的对手。

Jun Song在测试后写道:“27B clearly outperforms both in practice. It even beats Opus-5 on some tasks”. 一个270亿参数的模型,在真实任务中击败了Opus-5——后者的参数量是前者的多少倍?没人知道,因为闭源模型从来不公布参数。但按照行业惯例,顶尖闭源模型的参数规模至少在千亿级别。

这还不是最扎心的。Qwen3.8-27B不仅在编程和Agent任务上碾压同级对手,还在视觉质量上赢了——同一个“3D家庭午餐”的提示词,Qwen生成的画面质量被社区公认为第一。

参数规模崇拜在这一刻彻底破产。如果270亿参数能在真实任务中击败数千亿参数的对手,那“更大=更强”这条铁律就该被扔进垃圾桶了。

但也不要高兴太早。Qwen3.8-27B的胜利有一个前提:它花了更多时间。同样的提示词,Gemini 3.7 Flash两分钟出结果,其他模型花了六分钟以上。Qwen把更多计算资源花在了每一个输出上。这不是免费午餐,这是用时间换质量.

所以真正的 trade-off 不是“谁更强”,而是“你愿意等多久”。如果你要的是速度,Gemini 3.7 Flash;如果你要的是代码和安全,GLM-5.3;如果你要的是视觉质量和综合能力,Qwen3.8-27B;如果你要的是……省token,那Grok 4.6可能连答案都给不全。


后训练时代:基座没变,能力暴涨

GLM-5.3的发布揭示了一个更深层的变化。

智谱在官方公告中明确写道:“与GLM-5.2相比,基座模型没变,但通过极致的后训练Scaling大大提高了模型的智能上界”。总参数7430亿没变,架构没变,但能力体感提升了50%。

这意味着什么?意味着大模型的能力提升不再主要依赖“堆参数”了。后训练——包括更长的训练时间、更丰富的环境类型、更精细的强化学习——正在成为能力跃升的主引擎。

这是一个标志性的转折。过去两年,行业的主流叙事是“更大”:更大参数、更大集群、更大投入。但GLM-5.3证明了:在基座不变的前提下,通过极致的后训练同样可以实现能力的阶跃。这对整个行业的成本结构和竞争格局都会产生深远影响——不是每家公司都烧得起万亿参数的训练费用,但后训练的优化是所有人都能参与的游戏。

Empero AI在Qwen3.8-27B上做的蒸馏实验进一步印证了这一点。他们把Qwen3.8-27B蒸馏到9B、4B、2B三个尺寸,通过全参数SFT和精心策划的教师CoT,9B模型的MMLU CoT从54.6提升到75.1,2B模型从28.3提升到54.8。2B参数的小模型,经过蒸馏和微调后,智力水平翻了一倍。

大模型的“知识”可以被蒸馏到小模型里,小模型经过精心训练可以达到接近大模型的水平。参数规模的壁垒正在被打破。


开源vs闭源:权重在手,天下我有?

这一轮模型发布的另一个关键词是“开源”。

Qwen3.8-27B采用Apache 2.0协议,面向所有开发者、科研机构及企业开放权重,支持免费下载、部署及商用。截至目前,千问已累计开源460余个模型,全球下载总量超30亿次,衍生模型数超30万个。

GLM-5.3同样开源权重,在多项主流基准测试中排名最高的开源模型。OrcaRouter甚至发布了Qwen3.8-27B的“无审查”权重,专门用于AI红队测试和安全研究。

开源模型的生态正在以惊人的速度膨胀。但“开源”这个词本身正在变得模糊——权重开源不等于训练数据开源,不等于训练代码开源,不等于方法论开源。一个模型“开源”了,但你不知道它用的是什么数据、什么配方、什么trick.

更关键的是:开源模型的能力提升,很大程度上依赖于闭源模型的“蒸馏”——用顶尖闭源模型的输出作为训练数据. Empero AI的蒸馏实验就是一个典型例子:他们用Qwen3.8-27B(本身已经是顶级开源模型)的输出作为教师信号,训练更小的学生模型. 这种“开源模型蒸馏开源模型”的链条是健康的。但更多时候,开源模型的进步依赖于对闭源模型的“知识提取”——这本质上是在搭便车.

如果闭源模型有一天全面收紧输出质量、限制API调用频率、加强输出水印——开源模型的能力提升会不会断粮?这个问题没人能回答,但每个人都该想一想.


一个还没结束的实验

回到开头那个“3D家庭午餐”的测试。

同样的提示词,四款模型,四种结果。Qwen赢了质量,Gemini赢了速度,GLM在代码和安全上封神,Grok输出不完整. 但有一个细节被大多数人忽略了:Gemini 3.7 Flash在2分钟内完成了任务,其他模型花了6分钟以上.

三倍的速度差距。如果把这个差距放到真实工作流里——一个需要反复迭代、多次生成、持续修正的复杂任务——Gemini的速度优势会被放大还是被抵消?如果Gemini的每一次输出都有6.3%的幻觉率,那速度再快,有多少次生成是需要重做的?

没有人算过这笔账。Artificial Analysis测了速度、测了智力得分、测了token消耗,但没有人测过“一个真实任务从开始到可交付状态,各模型分别需要多少次重试、多少次人工修正、多少个小时”。

这个数据缺口,才是2026年8月这场大模型发布狂欢之后,最应该被填上的东西。

因为“快”和“准”之间的选择题,答案从来不取决于跑分表上的数字,而取决于你手里的活——以及你愿意为这个活付出多少遍重来的代价。