2017年Google那篇《Attention Is All You Need》喊出“注意力就是一切”的时候,整个行业都疯了。LSTM和GRU这些循环神经网络一夜之间从王座上被踹下来。原因特别直白:RNN处理一句话得一个字一个字往后推,像排队买奶茶,前面不挪后面干瞪眼。Transformer不用排队,所有词同时看、同时算,GPU一下子就吃饱了。8张P100显卡跑12个小时,翻译质量就能刷新纪录。这谁顶得住?
但事情没那么简单。
2026年9月,OpenAI的GPT-6 Astra上线,The Information爆料说它用了一种叫“循环深度”(recurrent depth)的技术。同一组Transformer层反复运行,不增加参数量,却能把计算做得更深。消息一出,AI安全专家集体炸锅,首席科学家Jakub Pachocki被逼得亲自下场回应。
等等,2017年我们不是刚把循环扔出去吗?怎么2026年又捡回来了?
这就怪了!
2017年我们扔掉的到底是什么
2017年之前,处理人类语言的机器大脑几乎都靠一种叫循环神经网络的零件运转,这个零件的英文缩写是RNN,它最出名的变种叫长短期记忆网络,也就是LSTM。
LSTM的工作方式特别像一个只会逐字阅读的读者:你给它一句话"我今天很开心",它必须先读完"我",把"我"的意思存进脑子里,再读"今天",把"我"和"今天"合在一起理解,然后才能读"很",最后读"开心",每个字都必须等前一个字处理完才能开工。
这种排队式的阅读方法有一个致命问题:句子越长,排队越久,而且排在后面的字必须等前面的字全部算完,整台机器的几千个计算核心只能干等着一个核心慢慢挪,就像一条单车道的高速公路,车再多也只能一辆一辆过。
2017年Transformer干掉的了LSTM中这种循环,又叫“序列循环”。
什么是序列循环?你读这句话的时候,得一个字一个字往下走——“我”→“今天”→“吃了”→“一个”→“苹果”。每个字处理完,把结果传给下一个字。LSTM和GRU干的就是这事。
这玩意儿有个死穴:无法并行!第100个词必须等前99个词算完才能开始,GPU再多也没用。
注意力机制一脚踢开了排队栏杆
2017年,谷歌大脑团队发表了一篇论文,标题直接喊出了口号:《你只需要注意力》,这篇论文提出了Transformer架构,它干了一件当时看起来非常大胆的事:把LSTM里那个逐字排队的循环机制整个拆掉,换上了一个叫自注意力机制的新零件。
Transformer的革命性突破就一句话:去掉序列维度的循环,换成注意力机制。
自注意力机制的做法完全相反:它让句子里的每个字同时看所有其他字,"我""今天""很""开心"四个字在同一瞬间互相打量,每个字都在问其他三个字"你跟我有什么关系",然后一次性算出整句话的意思。
所有词同时计算相互之间的“注意力分数”,谁跟谁有关系,一炮算清楚。并行度拉满,训练速度起飞。这就是“Attention Is All You Need”的真正含义——你不需要序列循环了,有注意力就够了。
这种并行计算的方式让GPU芯片高兴坏了,因为GPU天生擅长同时处理大量相同的运算,以前被LSTM的排队机制憋得只能用一个核心干活,现在几千个核心可以同时开工,训练速度直接飙升了几十倍。
Transformer从来就不是“不要任何循环”,它只是不要“序列上的循环”。
Transformer并行优势催生暴力堆参数时代
Transformer的并行优势一释放,工程师们发现模型可以做得非常大了,以前LSTM因为串行计算太慢,参数量做到几千万就已经是极限,再大就训练不动了,而Transformer靠着并行优势,参数量轻松突破十亿、百亿、千亿。
从2018年到2024年,整个行业陷入了一场参数军备竞赛:OpenAI的GPT-3堆到1750亿参数,谷歌的PaLM堆到5400亿参数,Meta的LLaMA系列也在不断膨胀,所有人都在赌同一件事——模型越大,能力越强。
这场赌局在很长一段时间里确实赢了,更大的模型确实能写出更好的文章、翻译更准确的句子、回答更复杂的问题,但到了2025年前后,一个尴尬的现实开始浮出水面:参数再往上堆,收益越来越小,电费账单却越来越吓人,训练一个万亿参数模型的成本已经高到连科技巨头都开始肉疼。
2026年工程师把循环装回了Transformer
就在所有人以为循环机制已经彻底进了技术博物馆的时候,2025年到2026年间,一批研究者开始悄悄把"循环"这个词重新写进论文标题里,Looped Transformer、Universal Transformer、深度循环架构,这些名字频繁出现在各大AI实验室的技术报告中。
这就怪了,2017年费那么大劲才拆掉的零件,怎么又装回来了!
关键的区别藏在一个细节里:2026年装回来的循环,和2017年拆掉的循环,虽然中文都叫"循环",但它们装在机器的完全不同的位置上,干的也是完全不同的活。
2026年我们放回去的循环是什么
2026年放回去的循环,跟2017年扔掉的那个,压根不是一个东西。
这次放回去的叫“深度循环”(depth recurrence)或“循环深度”。什么意思?你把一个Transformer块(比如4层)当作一个整体,让它反复运行多次——不是沿着序列长度反复,而是在模型的“深度”方向上反复。
打个比方:
- 2017年之前的RNN是:一句话有100个字,你得跑100步,每一步处理一个字。
- 2026年的循环深度是:不管句子多长,你把同一个4层模块跑3遍,等效深度变成12层,但参数量还是4层的量。
前者是“时间上的循环”,后者是“空间上的循环”;前者卡在序列长度上,后者卡在模型深度上。
两个完全不同的维度。
有人把这叫“循环Transformer”(Looped Transformer)。学术圈给它起了各种名字:递归Transformer(Recursive Transformer)、循环深度Transformer(Recurrent-Depth Transformer)。但核心就一个动作:同一组参数,重复用。
ICLR 2026上,这个方向成了绝对主角。MeSH被ICLR 2026接收。LoopFormer也在ICLR 2026上亮相。SpiralFormer、DeepLoop、LT2、CART扎堆出现。这不是零星尝试,这是整个学术共同体在往同一个方向冲!
旧LSTM排队等候,新Looped Transformer反复咀嚼
LSTM的循环发生在时间轴上,也就是字与字之间,处理"我""爱""你"三个字时,它必须等"我"算完才能算"爱",等"爱"算完才能算"你",这种串行依赖直接锁死了并行计算的可能性。
2026年的Looped Transformer把循环搬到了深度方向上:它依然让所有字同时互相看,并行计算的优势一点没丢,但它把同一层注意力模块反复跑好几遍,第一遍算出来的结果再喂回同一层重新算,就像你读一段话,第一遍读了个大概意思,第二遍回头再读发现了隐含的讽刺,第三遍再读才真正理解了作者的弦外之音。
这两种循环的差别可以用一个场景说清楚:LSTM像一条流水线,每个工人必须等上一个人把零件递过来才能动手;Looped Transformer像一个独立工匠,所有零件同时摆在桌上,但他会反复端详同一组零件好几轮,每轮都能看出新的门道。
但循环深度真能打吗?数据说话
理想很丰满:8层参数跑3遍=24层深度,参数量省了三分之二。现实很骨感:多跑几轮≠多跑出东西。
阿里及合作高校的研究团队发现了一个尴尬现象:第一轮循环,hidden state变化很大,信息更新明显。第二轮、第三轮,变化幅度迅速萎缩。但注意,矩阵运算和Attention照样在跑,算力一点没少花。这就是“计算冗余”——循环次数增加了,后续计算带来的增量却越来越小。
为什么会这样?MeSH论文诊断出两个病根:一是“无差别计算”——每一轮循环干的事差不多,没有分工;二是“信息过载”——单一hidden state被塞了太多东西,越往后越不知道该关注什么。
怎么治?MeSH的方案是用一组显式记忆槽加上可学习的读写路由器,把那个被塞爆的单一隐状态拆开。效果:1.4B参数的递归模型,用少33%的参数反超同规模的标准Transformer。
另一篇论文《Loop, Think, & Generalize》做了更狠的实验。他们构造了一个多跳推理任务——比如“A的B的C是谁”这种需要连续推理多步的问题。标准Transformer(不循环)的系统性泛化准确率是0。循环深度Transformer(循环2次以上)成功实现了系统性泛化,而且循环次数越多收敛越快。更绝的是,训练时只用5跳以内的数据,测试时把循环次数加大,模型居然能泛化到10跳、甚至24跳的推理!
这不就是“给模型更多思考时间”的硬核实现吗?
但这条路没那么好走
循环深度听着很美,坑也不少。
第一个坑:训练不稳定。你把同一组参数反复用,梯度也在反复叠加。DeepNorm那种针对独立层的残差缩放规则直接失效。DeepLoop论文指出,参数被多次访问时,残差缩放指数得从1/4调到1/2。这不是小修小补,这是整个训练配方得重写。
第二个坑:推理成本没降。循环解决的是参数量问题,不是计算量问题。你把4层跑3遍,算的活儿还是12层的量。而且每一次循环都得存一份KV缓存,显存照样吃。MELT(Memory-Efficient Looped Transformer)专门解决这个问题,把计算和存储解耦——但这也说明问题本身有多严重。
第三个坑:不是所有循环模型都能打。CART(Context-Anchored Recurrent Transformer)在参数量对等的条件下,打不过密集基线模型,差了1-2%。把有效参数也算进去,差距拉到10%。诊断下来,~5%来自权重共享本身的损失,还有~5%来自架构设计。这说明什么?循环不是白嫖的,你省了参数就得付出表达能力下降的代价。
第四个坑:循环不是越多越好。《Loop, Think, & Generalize》发现,推理迭代超过某个点后,模型性能反而下降。模型对正确预测的置信度先升后降。这就是“过度思考”——想太多反而想错了。循环次数得动态调整,不能一刀切。
有意思的是,Looped-MoE(循环+混合专家)给出了一个解法。把密集的前馈网络换成稀疏的专家网络,每次循环激活不同的专家,相当于用同一组参数玩出了不同花样。Looped-MoE模型不仅比标准基线扩展得好,密集循环模型做不到的事它做到了。这说明循环要想真的work,不能只是简单重复,得让每次循环干不一样的事。
所以2017年到2026年到底发生了什么
这不是打脸。这是认知升级。
2017年的洞察是:序列上的循环是瓶颈,干掉它就能并行化。这个判断到今天依然正确。没有人要把LSTM那种序列循环重新塞回Transformer——那等于回到2016年。
2026年的洞察是:深度上的循环是机会,加上它就能参数化。你不需要24层×24套参数,你可以4层×6次循环,用一套参数完成同样深度的计算。这是把“计算深度”和“参数深度”解耦了。
两个洞察针对的是两个完全不同的维度,一点都不矛盾。一个说“不要在序列上循环”,一个说“可以在深度上循环”。前者关于并行化,后者关于参数效率。
但这里面藏着一个更深的翻转。2017年Transformer的成功,建立在“去掉循环、拥抱并行”之上。2026年循环深度的兴起,建立在“把循环放回来、但放在不同维度”之上。去掉的是循环,放回来的也是循环——但此循环非彼循环。
整个行业花了九年时间,绕着圈子回到了“循环”这个关键词上。但回到的不是原点,是螺旋上升后的同一个坐标轴上的不同位置。就像你绕地球一圈回到出发点,脚底下踩的还是那块地,但你已经不是出发时的你了。
那GPT-6 Astra到底在干什么
OpenAI没有公开Astra的技术细节。但The Information的爆料和各方分析指向一个方向:Astra很可能在架构的某个部分用了循环深度。
这意味着什么?意味着OpenAI在Scaling Law遇到瓶颈之后,开始寻找新的增长曲线。过去几年的套路是:模型不够强?加参数、加层数、加数据。现在这套路越来越贵,边际收益越来越低。循环深度提供了一条新路:参数不涨,计算深度涨。
但这也带来了一个新问题。循环发生在hidden state里,中间过程未必写成人类能读的思维链。模型在想什么、怎么想的,变得更难追踪。这也是AI安全专家集体跳出来的原因。
你让模型多想想,但它到底在想什么你不知道。它可能想对了,也可能想歪了,还可能想出了一条你完全无法理解的路。这让人不安。
最后,一个还没答案的问题
2017年的Transformer用并行化换掉了序列循环。2026年的循环深度用参数共享换掉了参数堆叠。
两次选择的背后是同一个逻辑:在算力、参数、数据三个维度的约束下,找到最优的分配方式。
但有一个问题至今没人回答:循环深度带来的“智能提升”,到底是从哪里来的?
是因为多轮迭代让模型有了“思考时间”?还是因为参数共享强制模型学会了更通用的表征?还是因为循环本身创造了一种新的计算范式,跟序列循环和标准Transformer都不一样?
MeSH用记忆槽解决了信息过载。DeepLoop用残差缩放解决了训练不稳定。SpiralFormer用多分辨率递归解决了计算粒度。LT2用线性时间注意力解决了计算复杂度。每一个都在回答“怎么让循环工作”,但没人回答“循环为什么工作”。
2026年9月7日,这个问题还挂在那里。GPT-6 Astra上线了,但它的内部到底怎么想的,没人知道!也许Jakub Pachocki那篇“小作文”会给出答案。也许不会。
但有一点是确定的:2017年我们以为“注意力就是一切”的时候,没人想到九年后“循环”会以这种方式杀回来。下一次翻转会是什么?没人知道。
但这恰恰是这件事最迷人的地方——你永远不知道下一个被扔出窗外的东西,会在什么时候、以什么面目,重新敲开你的门!