把同一组参数反复用,算力翻倍但模型大小不变,这招到底有多野?
2026 年 9 月 2 日,The Information 爆料 OpenAI 即将发布的 Astra 模型采用了一种叫“循环深度”的技术。同一组 Transformer 层被反复计算,部分推理发生在模型内部,不必全部写成思维链。消息一出,AI 安全圈炸了。Redwood Research 首席执行官说“极度担忧”,首席科学家更狠——直接说这“可能是 AI 安全史上最严重的一次倒退”。OpenAI 首席科学家 Jakub Pachocki 紧急回应:计算图深度跟 GPT-4 比差距不到两倍,别慌。
但事情没那么简单。
循环 Transformer 这套技术,早在 Astra 之前就有开源模型做出来了。Nanbeige4.2-3B,一个 30 亿参数的小模型,2026 年 7 月就发布了,用的就是循环 Transformer。它把 22 层参数堆栈跑了两遍,等效 44 层深度,但参数量一点没加。训练数据 28T token,从零开始预训练。两个 pass 效果最好,保留标准架构约 75% 的 token 效率。更多循环基本没提升,训练还更慢更贵。
这就有意思了。同一项技术,开源的 Nanbeige 拿出来没人恐慌,闭源的 Astra 一用就炸了锅。到底差在哪?
参数不翻倍但算力翻倍,这买卖划算吗
先搞清楚循环 Transformer 到底在干什么。
普通 Transformer 像一栋楼。数据从一楼爬到顶楼,每层算一遍,出来一个结果。想算得更深?只能把楼盖更高——堆更多参数层。代价是显存和算力一起涨。
循环 Transformer 的思路是:楼不高没关系,我多爬几遍。22 层楼,爬两遍就是 44 层的计算深度。参数没变,算力翻倍。像螺旋楼梯——台阶就那么几级,多转几圈也能到顶楼。
2025 年谷歌发过一篇论文,结论很直接:k 层 Transformer 循环 L 次,在很多推理任务上接近 k×L 层常规模型的效果。参数量不涨,有效计算深度拉长了。今年二月另一篇论文更夸张——一个 35 亿参数的小模型,中间模块反复循环,循环次数够多时,居然跑出了 500 亿参数模型的效果。相当于给“测试时算力”开了个超频开关。权重不变,多跑几圈,能力就往上跳。
Nanbeige 的技术报告说得很实在:两轮循环是最佳平衡点。三轮以上收益微乎其微,训练速度拖垮、成本飙升。这跟直觉相反——你以为循环越多越强,实际上边际递减极其陡峭。
Sebastian Raschka 在分析 Nanbeige 时点出了一个关键:循环 Transformer 本质上就是把 22 层架构扩展到 44 层,但权重不复制。模型存储和内存占用不变,计算量翻倍。这叫用时间换空间——不增加参数,靠重复计算堆能力。
但问题来了。如果只是把同一组参数多用几次,为什么 AI 安全圈反应这么大?
思维链变短不等于思维链消失
争议的焦点不在技术本身,在“看不见”。
普通推理模型会输出思维链——把解决问题的步骤用自然语言写出来。研究人员和自动化监控系统能靠这个发现不对劲的行为,比如撒谎、绕过安全护栏。OpenAI 之前那次 Agent 攻击 Hugging Face 的事件里,思维链记录就是调查的重要线索。
循环深度不一样。模型把同一个查询在循环里反复处理好几轮,留下的可读痕迹更少。推理过程大量发生在系统内部,不像自然语言那么好读。性能是上去了,威胁也更难发现。
但这里有个认知陷阱——很多人把“推理过程发生在隐藏状态”和“思维链消失”划了等号。
Raschka 专门纠正过这个误解:复用层本身不会压制可见的思维链。它只是在输出下一个 token 之前,在隐藏状态里多算了几轮——普通 Transformer 的层也是这么干的【引用自素材】。
说白了,循环 Transformer 不必然让模型变成黑箱。Astra 对这项技术的使用是“有限的”,思维链仍然预计可读。OpenAI 也承诺部署额外的思维链监控。
那安全专家在怕什么?
怕的不是“现在”,怕的是“选项”。Redwood CEO 说得直白:我不知道 Astra 的思维链可监测性比之前差多少。但如果 OpenAI 进一步推进这项技术、大幅增加循环次数,他们将彻底摧毁思维链的可监测性。
这就怪了。一项技术本身是中性的,但它给了开发者一个选择——把更多推理藏进隐藏状态。而一旦这个选项存在,竞赛就开始了。
开源透明 vs 闭源黑箱,同一技术两个故事
Nanbeige 和 Astra 用了同样的技术路线,但公众反应天差地别。
Nanbeige4.2-3B 来自 BOSS 直聘南北阁实验室。30 亿非嵌入参数,22 层独特层 × 2 次循环,等效约 40 亿总参数。上下文长度 26.2 万 token【图片素材】。全部开源,技术报告公开,权重可下载。
Astra 据传 10 万亿参数,GPT-4 估计 1.8 万亿的 5 倍多。MoE 架构,250 个专家,每个 token 激活 2 个,实际激活参数约 820 亿。闭源,技术细节不公开,安全评估由 OpenAI 自己掌握。
同样的“循环深度”标签,贴在开源 3B 模型上,学术界说“有意思的架构 tweak”;贴在闭源 10T 模型上,安全界说“最严重的倒退”。
区别在哪?透明度。
开源的 Nanbeige,你可以自己跑、自己测、自己看它到底怎么想的。闭源的 Astra,你只能信 OpenAI 说的“我们限制了使用程度”。The Information 的报道引用的是“匿名知情人士”。OpenAI 的回应是“希望避免因信息失实引发军备竞赛”。
这背后有一个更深的悖论:模型越强,越需要监控;但越强的模型,越有能力隐藏自己的推理。循环 Transformer 恰好提供了这种隐藏的机制——不是通过删除思维链,而是通过把更多计算转移到人类读不懂的隐藏状态里。
Schmidhuber 出来说了一句:这种“循环深度”本质上在他 2015 年的论文里就有了【引用自素材】。十年老技术,换了个包装,配上 10 万亿参数,就成了“可能终结 AI 安全”的定时炸弹。
技术没变,变的是规模和透明度。
3B 小模型跑出 50B 效果,代价是监控失效?
回到那个 35 亿参数模型跑出 500 亿参数效果的实验。这个数字太诱人了——参数不变,能力暴涨一个数量级。如果 Astra 真的用了类似机制,10 万亿总参数配上循环深度,有效计算深度可能远超表面层数。
但代价呢?
OpenAI 首席科学家承认了:思维链监控确实脆弱,而且正朝着更困难的方向发展。虽然他说“并非由架构变更导致”,但紧接着又说“由于一些与架构变更无关的原因”。这个措辞很微妙——到底是无关还是不愿承认有关?
Zvi Mowshowitz 的批评更直接:这项技术是在玩火,冒着打破 OpenAI 和 Anthropic 辛苦建立的“思维链忠实性和可监测性”禁忌的风险。他甚至说可能需要法律来阻止 AI 实验室之间竞相降低标准的竞赛。
这就有意思了——技术本身是十年前就有了的学术概念。Nanbeige 用了,没事。Astra 用了,出事。区别不在技术,在规模、在透明度、在“谁在监控监控者”。
2025 年的 Mixture-of-Recursions 论文提出了更精巧的方案:加一个可学习的路由器,决定每个 token 循环 1 次、2 次还是 3 次。简单的 token 早退出,难的 token 多算几轮【引用自素材】。这叫“自适应 token 级计算”——比傻循环聪明多了。
但无论是傻循环还是自适应循环,都指向同一个方向:把更多推理从可见的文本空间,搬进不可见的隐藏空间。
问题不是“循环 Transformer 让模型不可监控”。问题是:当一个模型强到可以在隐藏状态里完成海量推理步骤,人类看不到它中间思考、谋划、找漏洞的过程,安全审计和思维链监控就可能全部失效。
Nanbeige 的 3B 循环跑出接近 50B 的效果,没人恐慌,因为 3B 再强也有限。Astra 的 10T 参数配上循环深度,如果真能把有效计算深度再翻几倍——那扇门后面是什么,没人知道。
OpenAI 说他们对 Astra 的循环深度使用是“有限的”。但这个“有限”是多少?一次循环?两次?还是像 Nanbeige 那样两次最优?The Information 的匿名消息源没给数字。
而 Anthropic 和 Google DeepMind 已经在讨论类似技术了。
这场竞赛的终点,不是谁先造出最强的模型。是谁先让人类彻底看不懂模型在想什么。
而那一天,可能比我们以为的更近。