Qwen 3.8 27B叫板Opus:拉长思考时间补参数不足


Qwen 3.8 27B打败Opus?27B如何用20分钟思考干翻万亿参数巨无霸!

从今天起,本地运行的27B小模型,竟敢单挑硅谷万亿参数巨兽,这事儿绝没有表面上那么简单!

2026年8月15日,阿里通义实验室开源了Qwen 3.8 27B模型。这个仅有270亿参数的“小个子”,在DeepSWE编程基准测试中拿下了42.2%的通过率,硬生生把Anthropic家那个号称顶级旗舰的Opus 4.6 Max(40%)踩在脚下。发布仅仅六个小时,Hacker News上的讨论就炸了锅——710分,452条评论,热度和争议双双爆表。

Hacker News网友simonw在自己的M5 Max MacBook Pro上用LM Studio跑了个测试:让Qwen 3.8 27B生成“一只骑自行车的鹈鹕”的SVG图。结果相当惊艳——鹈鹕的喙画得极其传神,更关键的是,这只鸟的两条腿分别踩在自行车两侧。这种空间关系的正确理解,在以往的本地模型里极其罕见。但代价也足够让人倒吸一口凉气:整个推理过程消耗了22,276个思考token,只产出了3,223个输出token,耗时整整21分钟。simonw的评价特别意味深长:“那些嚷嚷着‘模型在刷benchmark’的人看看吧,就算作弊也阻止不了它花20分钟把问题想清楚。”

这事儿确实值得较真:一个能在普通人笔记本上跑起来的模型,宣称自己的能力跟半年前价值连城的顶级大模型平起平坐。这不仅挑战了“参数越大越聪明”的铁律,更让整个AI赛道的投资逻辑面临重估。当“巨无霸”引以为傲的能力被“小不点”追上,背后究竟是技术路线的胜利,还是benchmark的游戏?

这27B的小身板,凭啥跟万亿参数叫板

参数规模,一直是AI圈衡量模型能力的硬通货。打个比方——参数就像是人脑的神经元数量,参数越多,理论上能记住和处理的信息就越复杂。过去几年的军备竞赛,本质就是堆参数——从百亿到千亿再到万亿,数字越滚越大。2025年Anthropic发布的Opus 4.6 Max,参数规模据估算在万亿级别,是公认的顶级旗舰。运行这个庞然大物需要什么级别的硬件,普通人想都不敢想。

但Qwen 3.8 27B走了一条完全不同的路——只有270亿参数,比Opus小了整整两个数量级。按照以往的认知,这种体量的模型在复杂推理任务上,跟顶级旗舰的差距应该是一道鸿沟。然而这次放出的benchmark数据,直接颠覆了这条铁律。

DeepSWE是一个专门测试AI解决真实世界软件工程问题的基准,不是那种靠死记硬背就能蒙混过关的题目。42.2%对比40%——27B的小模型在解决实际编程任务上,竟然压过了万亿参数的庞然大物。这个结果,放在两年前说出来会被当成疯话。

不过,这里得先打一个问号。Hacker News网友NitpickLawyer就直接泼了冷水:“别开玩笑了。我是开源模型的铁杆用户,用过他们所有的版本,甚至在内部生产环境里跑。但要说Qwen在真实场景中打败了Opus,这是在做所有人的‘知识降级’。benchmark上数字上去了根本不代表实际好用。”他提醒那些看了benchmark就准备把Opus扔掉的开发者,冷静点,先上手试试再说。

benchmark这玩意儿到底有没有注水

这就要说到AI圈一个公开的秘密——benchmaxxing(刷榜)。简单说,就是模型的开发团队在训练时,有意无意地针对benchmark的题目风格、题型分布甚至具体的测试样本做了优化。结果是benchmark分数很好看,一旦面对真实世界千奇百怪、毫无套路的任务,立刻露馅。

这种担忧并非空穴来风。Hacker News网友EB66分享了自己公司的内部测试经验:“我们自己搞了一套针对实际业务场景的评估体系。大部分热门模型吹得天花乱坠,一上我们的测试就露馅。比如GLM 5.2在公共benchmark上分数高得吓人,但在我们的内部测试里一塌糊涂,远远落后于OpenAI、Anthropic、DeepSeek。”他坦言,根本不知道该怎么把公共benchmark的分数和实际表现对应起来——差距大到离谱。

另一位网友gpt5提供了一个更狠的视角——他追踪了Terminal-Bench从2.1到3.0的变化。2.1版本里,GLM 5.2拿了78%,GPT 5.6 Sol拿了88%。题目一换,到了3.0版本,GPT 5.6 Sol掉到了34.6%,GLM 5.2直接摔到4.6%。这个数据揭示了一个残酷的事实:benchmark的分数,很大程度上取决于“题目有没有被喂过”。题目一换,分数立刻崩塌。

所以,“Qwen 3.8 27B打败了Opus 4.6”这个说法,站在公共benchmark数据的角度是成立的——有数字为证。但“打败”这两个字到底意味着什么,值不值得认真对待,取决于一个更本质的问题:DeepSWE基准本身,有没有被Qwen团队提前“熟悉”过?

这个问题没有公开答案,各方只能靠猜测。但有一个观察角度值得留意——NVIDIA的高级科学家Jim Fan在X上评论过Qwen系列模型的“过度推理”倾向,大意是说:“某些模型在推理时产生的token数量远超常规,这本身就是一种‘测试时扩展’。它不靠增加参数,而是靠拉长思考链条来强行拉高benchmark分数。”这恰恰指向了Qwen 3.8 27B的一个核心争议点。

21分钟思考——这是聪明还是笨

回到simonw那个跑了21分钟的鹈鹕测试。22,276个推理token,只产出3,223个输出token——比例接近7比1。这意味着模型在给出最终答案之前,相当于在自己脑子里写了七倍篇幅的“草稿”。这个思考过程,在Hacker News的链接里是可以直接查看的。

Hacker News网友c7b专门补充了一个关键信息:Qwen 3.8的推理强度默认被设置成“xhigh”(极高),这个模式下模型会不遗余力地反复推演、自我纠偏、多角度审视问题。其他可选模式包括“medium”(中等)、“low”(低)和“none”(关闭)。他在llama.cpp的配置里用过--chat-template-kwargs '{"preserve_thinking":true,"reasoning_effort":"medium"}'这个参数切换模式,发现效果差异巨大。

从技术角度解释一下:所谓的“推理token”或“思考token”,是模型在输出最终答案之前,内部生成的一串“自言自语”——它会模拟各种可能性,推演因果关系,对比不同方案的利弊。这个过程非常消耗计算资源,但往往能显著提升答案质量。这种做法在OpenAI的o1系列模型上被大规模采用过,效果是立竿见影的。

但也有人对此持否定态度。Hacker News网友Casteil就对Qwen系列的“过度思考”颇有微词,他吐槽说:“这玩意儿会没完没了地‘等一下,我重新想想……’,然后用好几千个token翻来覆去地确认同一个问题。这种模式对极其复杂的代码任务可能有帮助,但对日常使用来说,简直无法忍受。”他做了个横向对比,提到使用Gemma 4 26B A3B时,同样的任务只需要Qwen十分之一的思考token就能获得类似的答案,速度快得不是一星半点。

所以问题来了:Qwen 3.8在DeepSWE上打败Opus的42.2分,究竟是因为模型本身更聪明,还是单纯靠“在脑子里多转了20分钟”来硬撑?换句话说——如果让Opus也用同样的“xhigh”推理模式跑一次,结果会怎样?这个对比目前还没人做过,但足以让42.2%这个数字少了几分说服力,多了几分待考证的悬疑感。

测试时扩展——不用堆参数也能变聪明

这里需要拆解一个最近在AI圈备受关注的新概念——测试时扩展。传统训练模型就像“中考之前拼命刷题”,把所有知识在训练阶段塞进模型参数里。而测试时扩展,则是“在考场上现想,多给点时间把题琢磨透”。Qwen 3.8 27B走的就是第二条路:模型参数本身只记录“思考方法”,而把具体的“思考过程”放在推理阶段实时完成。

这个思路的巧妙之处在于:它允许一个小模型通过“拉长思考时间”来弥补参数规模的不足,在某些复杂任务上逼近甚至超越参数远比自己多的大模型。代价也很直观——慢,而且是那种会让普通人抓狂的慢。Hacker News网友lacoolj在Threadripper Pro工作站上跑了同样的测试,用了将近90分钟才拿到结果——虽然他承认“感觉完全值得”。

另一个视角来自Hacker News网友hypfer,他在RTX 4090上通过精准配置llama.cpp的参数——开启MTP(多令牌预测)、调整KV cache量化类型、设置推理强度等等——硬是把生成速度拉到70-80 token/秒。这个数字意味着,那些看起来“天生很慢”的推理过程,通过针对性的工程优化,完全可以大幅缩短。MTP的原理相当巧妙:模型一次性预测未来多个token,而不是逐字逐句往外蹦,只要预测准确率够高,速度就能翻倍甚至更多。

有趣的是,Hacker News网友Aurornis指出:“Qwen模型在本地LLM社区里受到广泛尊重,但所有用过的人都知道,它们在benchmark上做了不少优化。即使满精度版本,它们的实际表现也从来比不上benchmark分数相近的竞品。”这段话可以这样理解:Qwen 3.8的42.2分,有一半功劳可能得归功于“测试时扩展”的推理机制,而不全是模型本身的硬实力。但换个角度看,如果“花更多时间思考”能换来更高的任务完成率,这对普通用户来说,到底是好事还是坏事?需要用户自己权衡——是愿意多等几分钟拿到更靠谱的答案,还是宁愿快一点、但可能出错?

本地部署——普通人离顶级AI到底有多远

抛开benchmark和数据争议,Qwen 3.8 27B真正让人兴奋的地方在于:它是普通人用日常设备就能跑起来的模型。这一点,跟那些只能通过API调用、按token收费的云端巨兽比起来,意义完全不同。

Hacker News网友KronisLV在评论里表达了对MoE版本(专家混合模型)的期待,提到Qwen 3.6的35B A3B版本在他那台64GB内存的笔记本上能跑到20 token/秒,而同尺寸的密集模型只有4 token/秒。MoE的核心思路是:模型里有大量“专家模块”,每次推理只激活其中一小部分(比如35B总参数里只激活3B),因此速度比“把全部参数都算一遍”的密集模型快得多。他用这个对比说明了一个核心问题——对普通用户来说,速度和质量之间的取舍,远比benchmark上的零点几个百分点更关键。

另一位网友peri-cl详细分享了自己的笔记本配置:64GB双通道DDR5-6400内存、AMD 7840U处理器,配合llama.cpp的Vulkan GPU后端,跑Qwen 3.6 35B A3B的Q4量化版本能达到20 token/秒。这个速度让他在笔记本上顺畅地跑代码补全和文档摘要,完全不需要依赖云服务。作为对比,同一个设备跑Qwen 3.8 27B这个密集模型,速度掉到了4 token/秒——只有前者的五分之一。

更让人瞠目结舌的是,Hacker News网友hypfer在RTX 4090上——把显示输出挪到核显上,腾出全部24GB显存给模型——配合针对性的llama.cpp参数优化,跑Qwen 3.8 27B能达到70-80 token/秒。这个速度意味着,在高端消费级显卡上,这个模型完全可以作为日常工具流畅使用,而不是“实验玩具”。

硬件门槛方面,Hacker News网友Almondsetat提到了一个关键选择:“Intel的B70显卡,1500美元,32GB显存,可以在这个模型上跑满上下文长度,性能相当不错。如果不想花5000到10000美元去跑DeepSeek,这是本地重构和小规模开发辅助的最佳预算选择。”相比之下,一块RTX 5090的价格足以让大部分个人用户望而却步。32GB显存正好卡在“能流畅跑27B模型”的及格线上——再低就捉襟见肘了。

参数更少但更聪明?这件事远没到结论

回到最初的问题:一个27B参数的小模型,凭什么敢跟万亿参数的巨无霸叫板?通过上面这些拆解,答案开始浮出水面——但不完全是Qwen团队在模型卡上宣称的那种“技术碾压”。

Qwen 3.8 27B确实在DeepSWE这样的benchmark上拿出了让人无法忽视的数字,42.2%对40%的领先虽然微弱,但对于一个体积只有对手几十分之一的模型来说,本身就是一个强烈的信号——参数规模不再是衡量能力的唯一标尺。测试时扩展、MTP预测、思考强度调节,这些工程手段正在以另一种方式“扩展”小模型的上限。

但另一方面,benchmaxxing的阴影始终存在。当Hacker News的资深用户反复提醒“它的实际表现从没达到过benchmark暗示的水平”时,那些耀眼的数据就需要被重新审视。21分钟推理、2万多思考token——这究竟是“更聪明”还是“更勤奋”,是一个必须被严肃对待的问题。

更重要的是,对普通用户而言,“跑得起来”和“跑得好”是两个维度的事情。Qwen 3.8 27B在高端显卡上确实表现出色,但在大多数人的笔记本上,那4 token/秒的速度恐怕很难被称作“可用”。速度、质量、硬件成本——这三者的平衡点,至今仍在快速移动。

所以那句话怎么说的来着——“大家都以为AI的竞争是参数的军备竞赛,但真正的战场可能已经在别处打响了。”

总结

当一个270亿参数的小模型在编程任务上击败万亿参数的行业旗舰时,这既是技术进步的缩影,也是行业泡沫的警钟。Benchmark数据可以提供参照,但永远无法替代真实使用场景的检验。对于普通用户而言,真正的价值不在于“谁在榜上赢了谁”,而在于——能否在自家电脑上,花可接受的时间,得到一个足够好的答案。Qwen 3.8 27B迈出了这一步,但距离“让每个人都用上顶级AI”,还有不短的路要走。

而最讽刺的是——当所有人都忙着比拼参数规模的时候,真正的突破口,偏偏诞生在参数更少的那一边。