OpenAI Astra的48层循环两次:改变大模型发展方向


OpenAI Astra的48层循环两次未被证实,但它揭开了Astra真正的技术方向!

同一组Transformer层反复计算,正在改变AI堆参数、堆层数的老办法!

Astra、循环Transformer、recurrent depth正在把AI推理从“堆更多参数”转向“让同一组层多算几遍”,48层循环两次目前只是猜测;DeepLoop则解释了循环Transformer为何难训练,以及残差缩放如何稳定深度复用;更有研究把循环与MoE结合,让同一套物理层在不同轮次激活不同专家,进一步降低参数和计算搬运成本,真正值得关注的已经从“48层是不是两次”变成了“AI能不能用更少的参数换更多的计算”。

48层循环两次只是猜测

48层循环两次这个说法,目前没有得到OpenAI公开资料的直接证实,但它为什么听起来合理,因为Astra确实被报道采用了recurrent depth,也就是循环深度,让同一组Transformer层反复处理同一份信息,而不是每经过一层就换一套参数。

先把“层”这个词说清楚,普通Transformer可以想成一条流水线,第1层处理一次,第2层再处理一次,第3层继续处理,模型越深,信息经历的计算步骤通常越多,这就是大家常说的网络深度。

循环Transformer换了一种办法,它可以拿着同一组物理层反复跑,比如物理上只有48层,第1轮跑完以后,再把结果送回这48层重新计算,第2轮继续跑,这时候参数仍然只有一份,但计算路径已经变深了,这就是“循环”最诱人的地方。

于是,“48层循环两次”就成了一个很自然的推测,48层物理结构乘以2轮循环,可以形成大约96层的有效计算深度,同时避免真的保存96套完全不同的层参数,但这里一定要把“有效计算深度”和“物理层数量”分开,否则很容易把猜测说成事实,对吗?

GPT-4深度只差两倍

这个猜测真正有意思的地方,在于OpenAI首席科学家Jakub Pachocki最近给出了一个非常关键的限制条件,他公开表示,包括Astra在内的当前前沿模型,其计算图深度与GPT-4相比处于两倍以内。

这句话很容易被读成“Astra就是GPT-4的两倍深”,实际含义更宽,它给出的只是一个范围约束,并没有告诉外界Astra到底有多少物理层、循环多少次、哪些模块共享参数,也没有确认48层这个数字。

所以从公开信息能推出的结论只有一条:Astra的计算图深度没有突然膨胀到GPT-4的几十倍,外界流传的具体层数和循环次数仍然缺少公开证据,这个区别非常重要。

但有趣的地方来了,如果一个模型可以用少量物理层反复计算,那么“模型有多少层”这个问题突然变得没那么重要,我们真正应该问的是“一个token到底经历了多少次参数变换”,这才是循环Transformer真正改变的尺度单位!

循环Transformer省的是参数

传统Transformer想增加深度,最直接的方法就是继续往后堆层,第49层使用自己的参数,第50层使用自己的参数,第51层继续使用新的参数,这样做的好处是每一层都可以学习不同功能,代价也很直接,参数、显存和训练成本一起上涨。

循环Transformer则把一组层拿出来反复使用,第1轮用它们处理信息,第2轮还是用它们处理,第3轮继续用它们处理,模型获得了更长的计算路径,却不用为每一轮保存完整的新参数,这就是weight tying,也就是权重共享。

可问题也跟着来了,同一个老师连续给你讲三遍,并不等于三个老师分别讲一遍,模型每次看到的是同一套参数,因此每轮计算之间存在强烈的联系,表达能力可能下降,训练时的梯度也会因为反复经过同一组参数而发生累积。

所以循环Transformer的真正难题从“参数太多”变成了“同一套参数反复使用以后,梯度会不会把模型训练崩”,这就把故事直接带到了DeepLoop。

DeepLoop发现深度也会“重复计账”

DeepLoop研究解决的核心问题,就是循环Transformer里的参数重复访问,论文由Shuzhen Li、Yifan Zhang、Jiacheng Guo、Quanquan Gu和Mengdi Wang等研究者提出,并发表于2026年7月的arXiv。

普通的深层Transformer里,第10层和第20层通常是两套不同参数,第10层产生一次更新,第20层产生另一次更新,两次更新之间没有“同一个参数被重复访问”的问题。

循环Transformer就不同了,假设48层循环2次,第1轮第20层使用参数W,第2轮第20层还是使用W,于是训练W时,两次访问产生的梯度会共同影响同一个参数,这些更新并不会像完全独立的层那样自然分散。

DeepLoop抓住的就是这个差别,它认为循环深度不能只看“展开以后有多少层”,还必须看“同一套参数被访问了多少次”,这听起来只是一个数学细节,实际上却决定了循环模型能不能稳定训练。

残差缩放从四次方根变二次方根

DeepLoop最核心的变化非常漂亮,它把传统DeepNorm式的深度缩放规律,在参数访问高度相关的情况下从指数1/4推到了1/2。论文给出的循环版本设置为α=(2N)^(1/2),β=(8N)^(-1/2),其中N代表展开后的有效深度。

这里的α可以理解成残差流的缩放因子,β则控制残差分支输出投影的初始化增益,简单说就是:模型越深,数据在网络里反复流动的次数越多,训练时就越需要控制每一次参数更新对整体状态的冲击。

为什么指数会从1/4变成1/2,因为循环以后,同一参数收到的多次更新可能高度对齐,它们不像独立层那样互相抵消,反而可能朝着同一个方向叠加,这就像十个人推箱子,如果大家方向一致,力量会一起加上去。

但是这里还有一个非常重要的反转,DeepLoop并没有说“循环模型永远都必须用1/2”,它的理论分析指出,当不同循环访问之间的更新方向充分去相关时,标准DeepNorm的1/4仍然可以恢复,所以真正决定缩放规律的不是“有没有循环”四个字,而是重复访问之间到底有多强的相关性,这就有意思了!

GPT-2实验说明循环真的能受益

DeepLoop没有停留在公式上,研究者在GPT-2 small和GPT-2 medium规模的GPT式循环语言模型上进行了实验,并使用FineWeb-Edu等设置测试循环深度的影响。结果显示,在没有重复访问物理层的时候,DeepLoop与基线基本持平;一旦开启循环,DeepLoop开始改善验证损失和下游任务表现。

这个结果其实很关键,因为如果DeepLoop只是把一个模型的初始化参数随便改一下,那么在不循环的时候也应该明显改变结果,但实验恰恰显示R=1时基本没有额外收益,循环开启以后优势才逐渐出现。

换句话说,它瞄准的东西很明确:普通Transformer的问题由普通Transformer的训练规律解决,循环Transformer的问题则来自“同一套参数被反复访问”,因此训练配方也必须跟着改变。

这意味着未来如果真的有人把48层拿来循环两次、三次甚至更多次,最先遇到的可能并不是“参数够不够多”,而是“这些参数被重复使用以后还能不能稳定学习”,这才是循环架构真正的门槛。

稠密循环模型遇到了第二堵墙

循环Transformer解决了参数复用问题,却没有自动解决表达能力问题,因为同一组层重复运行,虽然计算深度增加了,但每一轮看到的参数仍然相同。

研究“Sparse Layers are Critical to Scaling Looped Language Models”进一步发现,传统的dense looped model在扩大规模时,性能扩展并不像标准的非循环Transformer那样理想,而把循环架构和Mixture-of-Experts,也就是混合专家模型结合起来,结果明显更有希望。

MoE可以先理解成一间有很多专家的小公司,每个专家擅长不同事情,模型每次处理一个token时,只叫其中少数几个专家干活,这样就能拥有很多参数容量,同时避免每次把所有参数全部算一遍。

于是循环和MoE碰到了一起,一个负责“同一组层多算几轮”,另一个负责“每轮只叫部分专家”,两者刚好解决不同问题,一个增加有效计算深度;一个扩大参数容量却控制激活计算量。

Looped-MoE让每一轮换专家

Looped-MoE最漂亮的地方,是同一个token连续经过同一个物理层时,路由器可能让它选择不同专家,第1轮找专家A,第2轮可能找专家B,第3轮又可能找专家C。

表面上看,物理层还是同一个层,但真正执行的计算已经变了,这就产生了一个非常重要的效果:同一套共享结构开始表现得像不同深度上的不同网络。

研究者把这种现象叫作routing divergence,也就是不同循环之间的路由发散,实验发现,很多token在不同循环中并不会重复选择完全相同的专家,因此循环虽然共享物理结构,却能通过专家选择制造出不同的计算路径。

这相当于给“同一层重复计算”装了一台自动换人的机器,层还是那一层,专家却变了,于是模型获得了一种额外的表达空间,这比简单地把48层再跑一遍聪明得多。

9B模型已经出现了新信号

另一项2026年的LoopMoE研究,把循环计算和稀疏专家放到同一个语言模型里,并进一步提出了IterAdaLN等机制,用来打破权重共享以后不同循环之间过于相似的问题。

这项工作做了一个特别值得注意的实验,在3B规模下,LoopMoE在9个下游基准中的8个超过匹配的Vanilla MoE,平均提升超过1个点;扩大到9B规模以后,它仍然保持对匹配Vanilla MoE的优势。

这里的意义比“某个榜单多了几个百分点”更大,因为研究者试图把总参数量、每token FLOPs以及激活子层比例等条件控制住,再比较循环与非循环结构,这样才能更接近回答一个真正的问题:同样的钱、同样的计算量,多做几轮共享计算到底有没有价值。

结果至少给出了一个明确方向,循环架构和稀疏MoE并非简单相加,而可能互相补短板,一个提供迭代计算,一个提供每轮不同的专家路径,这种组合已经开始显示出规模化优势。

早退可能比多循环更值钱

循环Transformer还有一个普通Transformer天然不那么方便拥有的能力,那就是early exit,也就是提前退出。

普通深层模型通常要一路跑到最后一层才能得到最终结果,如果中途停止,后面的层没有继续处理,输出往往还没有经过完整计算,因此很难统一判断“现在够不够好了”。

循环模型却天然存在一个个循环边界,第1轮结束可以检查一次,第2轮结束再检查一次,第3轮继续检查,研究发现循环模型在这些边界上的输出更容易接近最终结果,因此这些位置特别适合做提前退出。

这意味着模型面对简单问题时可以少循环几次,面对困难问题时再多算几轮,计算量于是从固定套餐变成了按题目难度收费,这种变化可能比单纯减少参数更加重要,因为真正烧钱的地方往往是推理时到底算了多少次。

这会改变“模型大小”的定义

以前大家讨论一个AI模型,喜欢问多少参数、多少层、多少显存,这些数字很直观,因为模型基本就是一堆固定参数加固定计算路径。

循环架构出现以后,同一个48层模型可以只跑一轮,也可以跑两轮、四轮甚至更多轮,参数量没有按照循环次数线性增加,但计算量增加了,模型最终得到的计算深度也增加了。

于是“模型有多大”和“模型想多久”开始分离,一个模型可以拥有相对紧凑的参数规模,却在困难任务上投入更多计算;简单任务则提前停止,这其实更接近人类做题时的状态。

一个简单的1+1不值得思考十分钟,一个复杂数学题却值得反复检查,这种动态计算以前更多依赖生成更长的推理文本,现在循环Transformer提供了另一条路:模型可以在内部状态里多算几遍,再决定什么时候开口。

GPU真正该优化的可能是“重复计算”

循环架构还会把硬件问题重新摆到桌面上。

传统Transformer每层参数通常不同,计算过程需要不断读取不同权重、移动激活值、执行矩阵运算,现代GPU大量时间都花在计算与内存搬运之间的平衡上。

循环Transformer如果反复使用同一组物理层,就存在一种非常诱人的优化空间:热数据可以尽可能留在高速缓存层级中,甚至让部分中间数据更长时间停留在更靠近计算单元的位置,从而减少反复加载相同权重的成本。

但这里也必须踩刹车,不能直接说“循环Transformer一定适合寄存器计算”,因为寄存器容量极小,GPU的寄存器、共享内存、L1/L2缓存和高带宽显存各自承担不同工作,真正能留下多少数据取决于模型规模、算子形状、并行方式以及硬件实现。

因此,“循环架构适合硬件优化”是一个很合理的方向,“未来一定在寄存器里反复跑完整Transformer”则属于更远一步的工程猜测,这两个层级必须分开。

真正的竞争从堆层变成算轮次

把这些研究放在一起看,一个变化非常清楚。

过去增加模型能力,常见办法是扩大参数、增加宽度、增加层数;循环Transformer提供另一条路线,让有限的物理层承担更多轮计算;DeepLoop解决重复访问造成的训练稳定性问题;Looped-MoE则让每一轮通过不同专家获得新的计算路径;early exit再让简单任务少算几轮。

所以“48层循环两次”真正值得关注的地方,从来不是48这个数字本身。

它代表了一种新的模型设计思路:参数负责记住能力,循环负责增加计算,路由负责改变路径,退出机制负责决定什么时候停下来。

如果Astra确实采用了这种思路,那么它的意义也许并不在于“OpenAI偷偷把模型做成了96层”,而在于AI模型开始把“拥有多少参数”和“愿意花多少计算”拆成两个可以独立调节的旋钮,这个变化比一个具体层数传闻更值得盯着看。

而真正没有答案的问题也已经出现了:如果同一组物理层可以稳定循环2次、4次甚至更多次,随着循环次数增加,模型究竟会在什么时候停止获得收益?现有研究已经观察到普通稠密循环模型在更高循环深度下扩展困难,而Looped-MoE又能部分恢复扩展能力,可实验中究竟存在一个怎样的循环次数临界点,仍然没有一个统一答案;甚至在部分研究里,循环边界的输出已经提前接近最终分布,但模型继续循环后仍可能改变答案,这个“已经够好了却还要继续算”的拐点,到底由什么决定,实验数据至今没有把它钉死。