通义千问新架构凭啥跑赢397B老大哥?125B参数只激活6B!
一个1250亿参数的模型,每次处理一个词却只让60亿参数干活,剩下的1190亿闲着,结果编程和办公任务反而干翻了上一代3970亿的大家伙。这不科学!
2026年8月26日,阿里通义千问团队干了一件让AI圈炸锅的事。他们把Qwen3.8-Flash-Next的权重开源了。主模型125B参数,额外加了51B的N-gram Embedding。每次处理一个token只激活6B参数。原生支持262144个token上下文,能扩展到100万个token。训练成本只有上一代Qwen3.7-Plus的九分之一。API定价输入每百万token一块钱,输出三块钱。DeepSWE 1.1跑出58.7分,SWE-bench Pro拿下62.5分,LiveCodeBench v6干到91.9分。14个基准测试里8个拿最优。
但问题来了:一个只激活60亿参数的模型,凭什么能打赢3970亿的前代?答案就藏在这个模型的四个零件里。
养了1000个人,每次只派8个上,业绩反而更好
大模型公司训练模型就像开工厂。以前的办法是拼命招人,谁人多谁厉害。Qwen3.7-Plus有3970亿参数,每次激活170亿。但Qwen3.8-Flash-Next走了一条完全不同的路。它有1250亿参数,每次只激活60亿。但活干得更好,成本只有前者的九分之一。
这事怎么做到的?模型里面有个东西叫MoE,专家混合架构。简单说就是养了一大堆专家,但每次来一个问题,只派几个最对口的专家去解决。Qwen3.8-Flash-Next用了512个专家,每个token只激活10个,再加1个共享专家。这就像一个医院有512个科室的医生,但每个病人只看最相关的两三个科室。人虽然多,但每次干活的人少,效率反而高。这反常识对吧,但数据就摆在那儿。
GDN:从记流水账到做会议纪要
传统Transformer有个死穴。你给它一篇100万token的小说,它得把每个词和前面所有词的关系全算一遍。100万乘100万,这计算量谁扛得住。这叫平方级复杂度。
研究人员琢磨出一个办法:把无限长的记忆压缩成固定大小的状态。计算量从平方级降到了线性级。但代价也很明显——压缩太狠,重要信息丢了,找东西的时候抓瞎。
怎么解决这个矛盾?学界发现两条路子:
一条叫门控机制,能自适应地擦除不需要的记忆;
一条叫增量更新规则,能精准修改需要保留的记忆。
2024年底,有人把这两件事合在一起干。门控负责擦,增量负责改,正好互补。这就是Gated DeltaNet。在13亿参数规模下,它击败了当时主流的Mamba2。在单针密码检索任务上更是碾压——91.8%对30.4%。
Qwen3.8-Flash-Next用了36层GDN,每四层里三层是GDN。它就像你的秘书,不管会开了多长,最后交给你的就那几页纸。读得快,但不丢重点。
QSA:查书架,不翻书堆
GDN压缩记忆,但有些信息你非得翻原始记录不可。这时候得靠Attention。但传统Attention在100万token上下文下跑不动。于是有了稀疏注意力——只翻相关的部分,不翻全部。
但稀疏注意力有个问题。你得先找出哪些部分相关。找这个过程本身就很贵。上下文越长,找的时间越长。
Qwen Sparse Attention(QSA)换了个思路。它不一个一个词找,先把序列按4个一组压成micro-block,在块级别上判断重要性。然后选最多512个块,也就是2048个词,只在这些块上做注意力计算。
就像你在图书馆找书。老办法是书架一本一本地翻。QSA是先看书架编号,直接走到那个书架前。实测数据:100万token下,Prefill快了7.6倍,Decode快了4.9倍。缓存命中率90%时,Prefill吞吐是Qwen3.7-Plus的8.6倍。
GDN负责记住,QSA负责查找。一个压缩记忆,一个精准检索。但网友实测发现个怪事。DGX Spark上跑只有12 tok/s,Strix Halo上跑出22 tok/s。一样模型,不同硬件,差一倍。新架构对硬件适配的要求极高,不是谁都能吃透。
Gated Residual:从单车道到四车道
2016年残差连接提出来以后,它就成了深度学习的标配。你给每一层修一条高速公路,信号可以无损传递。但传统Transformer只修了一条路。所有层都挤在这条路上读写信息。网络越深,早期的重要信息越容易被后面的信息冲淡。
2024年字节跳动提出了Hyper-Connection,把单条路扩成多条并行流。Qwen3.8-Flash-Next在此基础上做了进化,这就是Gated Residual。它把单车道扩成4条并行分支,每条分支用动态门控控制读写多少信息。有些分支负责局部传递,有些分支能把第一层的信息一路护送到最后一层。分析发现,其中一条分支自然形成了跨越大部分层的长距离通道。残差状态还能用FP8存,访存开销大幅降低。配合NVIDIA的FlashInfer实现,kernel级加速了2.05倍。
但网友实测发现一个问题。这个模型在xhigh推理等级下会过度思考,一个简单问题能翻来覆去地想10分钟,有时候想太多反而写出更烂的代码。有人猜是残差分支太多,信息在不同车道之间反复横跳,把自己绕进去了。没人能证实。
N-gram Embedding:51B的字典放书架,不占桌面
模型处理语言的第一步,是把词语转换成它认识的数字。这一步叫嵌入。传统嵌入查单个词。但它看不懂词组。比如“机器学习”和“机器”加“学习”,意思完全不一样。
研究人员开始探索N-gram嵌入——看当前词加上前面几个词组成的局部上下文。DeepSeek在2026年初发布了Engram模块,把N-gram嵌入做成了超大规模静态查表,复杂度接近O(1)。
Qwen3.8-Flash-Next借鉴了这个思路,额外塞了51B的N-gram Embedding参数。51B比很多完整模型都大。但它的计算代价几乎为零。因为这些参数可以放在Host Memory里,用的时候再调,不长期占显存。
就像你书桌上只放几本常用书,剩下51B本全放书架上。用哪本取哪本。不占桌面空间。但网友算了一笔账。125B加51B总共176B参数,4-bit量化要100GB以上。Unsloth放出的1-bit量化版都要73GB。正常模型1-bit也就十几GB。N-gram虽然不占显存,但存储开销还在。内存不够照样跑不起来。有人自己写了套推理引擎,把N-gram表扔到NVMe里分页加载,硬是在128GB的机器上跑了起来。但这不是普通人能搞定的。
Muon:让训练白捡近五分之一的时间
训练大模型最烧钱的就是时间。传统优化器AdamW从2014年用到现在,几乎是AI训练的默认选择。
但Muon优化器正在挑战这个格局。它不把参数压扁成一维向量再更新,而是直接在矩阵形态上做正交化。先算梯度的动量,再用算法把动量矩阵正交化,然后用这个矩阵去更新权重。研究表明,Muon在大语言模型训练中持续比Adam更快,尤其在尾部联想记忆学习方面表现突出。
Qwen团队做了三件事。第一,只有真正的二维线性映射参数才用Muon,其他辅助参数继续用AdamW。第二,把融合存储的矩阵拆成独立变换再分别正交化。第三,针对新架构重新拟合了Scaling Law,发现可以直接用更大的学习率和Batch Size。
最让人睡不着觉的是这个发现。Batch Size Warmup完全没必要。以前大家都觉得训练得从小Batch慢慢涨到大Batch。实验结果证明这步屁用没有,反而多消耗了18.8%的optimizer steps。去掉之后,同样的token预算下能多跑18.8%的步数。过去几年所有大模型的训练,是不是都在白白浪费近五分之一的计算资源。
Hacker News上有人问了一个没人能回答的问题。如果Batch Size Warmup真的毫无用处,为什么学术界和工业界用了这么多年没人发现。是大家都没去验证,还是验证了但结果不显著所以没发表。这个现象本身就很奇怪。
两个数字之间的裂缝
128GB内存就能跑起来。API输入每百万token一块钱。但你在xhigh模式问它一个问题,它能原地转圈转10分钟才给你答案。
1-bit压缩版本73GB。正常模型到这个压缩级别也就十几GB。同样一台机器,有人跑出12 tok/s,有人跑出22 tok/s。
还有那18.8%。之前训练大模型的人都要先从小批量慢慢涨到大批量,所有人都在这么做,所有人都觉得这么做有道理。现在有人说这个步骤完全没用,删了反而多跑出18.8%的步数。
如果这个判断是对的,那过去几年所有大模型的训练里,有多少类似的步骤在白白消耗算力。这个问题有人能回答吗。没人能回答!但这件事实实在在摆在这儿了。