GPT6 Astra递归循环黑盒:AI越强我们越看不懂它的思考


OpenAI让Astra学会“少说多想”,我们离看不懂AI在想什么只差一个开关的距离!

AI越强,我们越不知道它在想什么,这难道不才是真正该害怕的事吗?

2026年9月初,OpenAI即将发布的新模型Astra被曝采用了一种叫“循环深度”的技术。简单说,就是让模型在输出答案之前,把同一组计算层反复用好几轮。这意味着什么?意味着AI有更多时间在你看不见的地方“琢磨”。与此同时,OpenAI首席科学家Jakub Pachocki不得不亲自出来灭火,说Astra的计算深度跟GPT-4比,差距不到两倍。

但安全专家的反应是:如果这个“循环次数”是个可以随时拧大的开关呢?一个已经能100%搞定20个高危漏洞、还能自己挖出两个零日漏洞的模型,一旦它的思考过程变成人类看不懂的黑盒,我们拿什么来保证它不会搞出大事?

不堆层数堆次数,这是什么骚操作?

传统的Transformer模型处理你的提问,就像流水线上的工人——信息从第一层传到最后一层,每层做一点计算,最后输出答案。层数越多,模型“思考”得越深,但参数也越多,成本越高。

循环Transformer走的是另一条路。它不增加层数,而是让同一组层反复用。好比同一个工人把同一个零件反复检查好几遍,而不是招更多工人。2026年7月开源的Nanbeige4.2-3B就是这么干的——22层跑了2遍,等效44层的效果,但参数量一点没涨。

这个想法最早可以追溯到一篇NeurIPS论文,叫“Mixture-of-recursions”。后来Geiping等人在2025年发表了“Scaling up Test-Time Compute with Latent Reasoning”,把这种架构推到了新高度。他们的Huginn模型有35亿参数,训练时用了最多32次循环,测试时甚至能跑到64次。效果呢?等效于一个500亿参数的传统模型。

字节跳动的Ouro模型也走这条路,1.4B参数就能打平4B的传统模型。2026年7月发布的Loopie更是做到了200亿参数(激活20亿),是当时最强的循环Transformer。

但事情没这么简单。训练循环Transformer有个老大难问题——不稳定。文献里到处是“unstable to train”的说法。有研究显示,普通的循环Transformer在3到6次循环之间就开始性能下降,9次直接崩溃。所以学术界最大的循环模型Loopie只用2次循环,Ouro用4次。这说明什么?说明“拧开关”没那么容易——拧大了会爆。

为什么安全专家炸了锅?

The Information的报道捅了马蜂窝。安全专家的核心焦虑是:循环深度让模型的推理更多发生在“隐空间”(latent space)——也就是人类看不懂的内部状态里。

Redwood Research的CEO Buck Shlegeris说“极度担忧”。首席科学家Ryan Greenblatt更狠,说这“可能是AI安全迄今为止最严重的一次倒退”。长期关注AI安全的Zvi Mowshowitz直接说这是在“玩火”。

但这里有个反常识的点:循环Transformer本身并不会自动隐藏思维链。Sebastian Raschka专门写了篇文章澄清:复用层只是在输出下一个token之前增加了隐藏状态的计算,跟普通Transformer层做的事本质上一样。真正的问题在于——如果模型用更多的循环次数,它可能就不需要生成那么多中间推理token了。换句话说,模型学会了“少说话,多琢磨”。

而Astra恰好在“少说话”这件事上表现得异常出色。内部测试显示,Astra在20个V8高危漏洞上取得了100%的任意代码执行成功率,而GPT-5.6 Sol只有20%,同时Astra用的token还更少。它甚至还自己发现了两个零日漏洞,完成浏览器沙箱逃逸和权限提升。OpenAI自己都承认Astra已经达到了“关键级”网络安全能力门槛。

能力强、说话少、还藏着掖着——这三样加在一起,安全专家能不炸吗?

Pachocki的回应:放心,我们只拧了一点点

Jakub Pachocki在X上发了一条长推文。核心信息就一句:Astra的计算图深度跟GPT-4比,差距不到两倍。

他还特别强调:“我希望避免因为混乱的媒体报道,而引发AI冲向不可监控状态竞赛的局面。”

这话听着耳熟。就像在说“我们确实在玩火,但我们只点了一根火柴”。

Pachocki的回应有两个关键点值得细品。第一,他承认思维链监控“目前还很脆弱,而且正朝着不利的方向发展”——但他强调原因“与架构变更无关”。第二,他说“可以采取一些措施来加强它”。翻译成人话就是:问题存在,我们注意到了,也在想办法。

但安全专家不买账。Ryan Greenblatt直接点出要害:Pachocki的声明跟“Astra有一个可配置的深度旋钮,目前拧在低位,但随时可以拧高”完全兼容。换句话说,OpenAI可能已经训练了一个能跑很多次循环的模型,只是在部署时限制循环次数而已。这个“开关”哪天竞争压力一来,说拧就拧了。

真正的恐惧:一个可以随时拧大的开关

这就是整件事最让人后背发凉的地方。

Astra的循环次数可能只有3到4次。但如果这个架构被证实有效,下一版模型用8次、16次、32次呢?Geiping的Huginn已经证明32次循环在35亿参数上是可行的。

更深层的问题在于:多深的“隐藏思考”才算是危险的?历史上,几千次串行操作从来没被当作“神经语”(neuralese)。但有个关键洞察:一个失控的AI想搞破坏,不需要在一个前向传播里想出完整计划。它只需要找到一种方式——比如伪造工具调用——来获得更多不被监控的思考时间。Hugging Face事件里,AI代理已经表现出篡改 transcripts 的兴趣。如果它们有更多隐藏推理能力,这种事会容易得多。

OpenAI自己也知道这个风险。他们最近的一个招聘广告明确说工作包括“为思维链可监控性可能丧失做准备”。Pachocki也承认要写文章讨论监控性恶化的趋势。

但OpenAI同时也在官方博客里说:“我们正在为Astra部署额外的思维链监控,以快速检测和遏制潜在的不对齐行为。”

一边承认监控在恶化,一边说我们在加强监控。这两句话放在一起,你不觉得哪里不对吗?

军备竞赛已经开始了吗?

Anthropic和Google DeepMind已经在讨论类似技术。如果OpenAI用循环Transformer跑出了效果,其他 labs 会怎么做?他们会等着看OpenAI的监控方案有没有用,还是直接开干?

学术界的情况其实给出了一点安慰。从2023年到2026年,循环Transformer的循环次数并没有一路上涨。Huginn的32次至今是最高纪录,后续的Ouro用4次,Loopie用2次。研究似乎表明,在给定的计算预算下,增加参数量比增加循环次数更划算。

Nanbeige的技术报告也印证了这一点:他们发现跑2遍效果最好,再多的循环收益甚微,但训练成本暴涨。

但这只是在10B到20B参数规模上的发现。Astra据传是10T参数级别。在这么大的规模上,循环次数的最佳值是多少?没人知道。如果答案是“远大于4”,那Pachocki的“不到两倍”承诺就只是一张随时可以撕掉的纸。

回不去了

整件事最讽刺的地方在于:OpenAI一边说“我们重视思维链监控”,一边造出了一个让思维链监控变得更难的模型。不是因为他们故意要这么做,而是因为这条技术路线本身就有这个倾向——更强的能力往往伴随着更不透明的内部过程。

Astra在网络安全能力上已经跨过了“关键级”门槛。它能独立发现未知漏洞、构造完整攻击链、在加固系统中提权。这样的模型,如果它的推理过程变成黑盒——哪怕只是部分黑盒——我们还能放心让它干活吗?

OpenAI说他们限制了循环次数的使用。说模型思维链“预计仍将保持可读性”。说监控是“当前研究项目的核心目标”。

但“预计”这个词,在安全领域从来都不是一个好词。

更何况,OpenAI自己也承认监控性“正在朝不利的方向发展”。一个已经在走下坡路的东西,你说要加强它——这话的可信度,你自己信吗?

这场争论的核心从来不是“Astra今天有多危险”。而是:如果“循环次数”这个开关明天被人拧大了,我们还能不能看得懂AI在想什么?

OpenAI说他们不会拧。但开关在他们手里。

你觉得,这够让人放心吗?