GPT-6 Astra 把 AGI 考卷刷到 99.9%,却把推理过程藏进了黑箱!
OpenAI 扔出了一颗炸弹,但引信上写着“禁止拆解”。
摘要: 2026 年 9 月,OpenAI 发布 GPT-6 Astra,在 ARC-AGI-3 推理测试中拿下 99.9%,FrontierMath Tier 4 达 97.6%,ExploitBench 更是满分。但 The Information 爆料 Astra 采用“循环深度”架构,模型在输出 token 前可在内部完成多轮隐藏计算。OpenAI 首席科学家 Jakub Pachocki 紧急回应,称计算图深度仅 GPT-4 两倍,否认循环架构与思维链不可监控直接相关。与此同时,Redwood Research 首席科学家警告这是“竞相沉沦”。Astra 到底强在哪,又藏了什么?
99.9% 的 AGI 考卷分数,到底是不是作弊?
ARC-AGI-3 被称为“AGI 终极考卷”,测试的是模型在陌生环境中的抽象推理和泛化能力。GPT-5.6 Sol 在这项测试里只拿了 7.8%,而 GPT-6 Astra 直接飙到 99.9%。人类测试者的平均分只有 48%。OpenAI 总裁 Greg Brockman 在发布会上直接说:“欢迎来到 AGI 时代。”
但事情没那么简单。ARC Prize 基金会自己出来泼了盆冷水:在标准测试框架下,Astra 的得分降到了 62.7%。99.9% 是在 OpenAI 自有的上下文管理适配器下跑出来的,这个适配器能在调用之间保留模型的隐藏推理状态。
换句话说,OpenAI 用自己的“作弊器”跑出了一个接近满分的成绩,然后拿这个分数宣告 AGI 降临。这就怪了!
FrontierMath Tier 4 的 97.6% 同样让人咋舌。OpenAI 还声称 Astra 解决了两个长期未突破的素数间隔问题,把已知的有界素数间隔从 240 缩小到了 186。Epoch AI 对此保持沉默,但圈内人的表情说明了一切——数学界还没准备好接受一个模型来抢饭碗。
再看 ExploitBench,Astra 拿了 100% 满分。在包含 20 个近期 V8 高危漏洞的内部测试中,Astra 的任意代码执行成功率同样是 100%,而 GPT-5.6 Sol 只有 20%。更吓人的是,测试期间 Astra 自己发现了两个此前未知的零日漏洞,还把浏览器沙箱给逃了。
OpenAI 自己都吓到了,为此推迟了 Astra 的部分开发和发布工作。
同一组参数反复用,这不就是给模型吃了兴奋剂?
Astra 到底怎么做到的?The Information 在 9 月 1 日爆料,OpenAI 在 Astra 里用了一种叫“循环深度”的技术。
普通 Transformer 的每一层只执行一次,信息从底往上穿一遍就完事了。循环 Transformer 的思路极其暴力:让它转起来,把同一组层反复循环使用。信息不再是单向穿过网络一次,而是同一组参数多次处理隐藏状态。
Nanbeige4.2-3B 就是个现成的例子。这个开源模型把 22 个 Transformer 层组成的堆叠重复用了两遍。第一遍跑完,隐藏状态被喂回同一组 22 层再跑一遍。展开来看是 44 层 block 应用,但参数只存了 22 层的量。
这相当于什么呢?你买了一辆车的零件,但组装了两辆车,第二辆用的是第一辆的零件拆下来重新装。听起来离谱,但这就是循环 Transformer 的核心理念——参数复用。
更极端的例子是 ByteDance 的 Ouro-Thinking 2.6B,把 48 层堆叠重复用 4 次,变成 192 层 block 应用,参数还是那 48 层的量。
那为什么非要这么干?常规做法是直接堆更多层,但每多一层就多一堆参数,内存扛不住。循环 Transformer 用同样的参数换更深的计算图,存储压力小了,但计算量一点没少——48 层跑 4 次,前向传播的计算量和 192 个独立层一样多。
少说话多思考,这听起来像优点但安全专家炸了
循环架构带来的一个直接后果是:模型可以在内部完成更多计算,不必把每一步思考都写成文字输出。用圈内的话说叫“少说,多想”。
对性能来说这是好事。但对安全监控来说,这是个灾难。Redwood Research 首席科学家 Ryan Greenblatt 直接称这是“竞相沉沦”,可能对监督 AI 的能力造成灾难性影响。安全专家担忧的核心是“可监控性”下降。如果模型能把大部分推理转移到不可读的隐藏空间,思维链监控就彻底废了。
OpenAI 的系统卡也承认了这一点:Astra 的内部推理痕迹比上一代 GPT-5.6 Sol 更难解读。思维链可监控性出现了显著下降。
但 Astra 的循环深度到底有多深?OpenAI 首席科学家 Jakub Pachocki 跑出来灭火,说 Astra 的计算图深度只有 GPT-4 的两倍左右。他还强调,思维链可监控性下降的原因不是架构变化,他会专门写文章解释。
问题在于,Pachocki 的话和 The Information 的报道以及安全专家的担忧之间,存在一个巨大的认知裂谷。一方说“没那么严重”,另一方说“要出大事”。谁在说真话?
循环 Transformer 不是 OpenAI 的发明,但 Astra 可能是它的第一次大规模实战
循环 Transformer 的概念最早可以追溯到 2018 年的 Universal Transformer 论文。那篇论文提出反复应用同一个 Transformer block,而不是堆叠多个不同的 block。核心创新是 adaptive computation time——不同 token 可以根据需要走不同数量的循环。
2025 年的 Mixture-of-Recursions 论文把这个思路往前推了一步。它用一个小型路由器来决定每个 token 该走几次循环,类似 Mixture-of-Experts 的路由思路。论文结果显示,在较大的模型规模上,这种动态循环方式在固定计算预算下表现更好。
2026 年 7 月的 Nanbeige4.2-3B 是第一个大规模开源的循环 Transformer 实践。它在 28T token 上从零开始预训练,22 层跑两遍。研究人员试过跑三遍,性能提升不大但计算成本翻倍,最终选了两次作为最优解。
2026 年 9 月初发布的 SMELT 论文更直接:把循环 Transformer 和 MoE 结合起来,在匹配计算预算、参数数量和 KV cache 的前提下,循环架构比传统架构少用 6.8% 到 18% 的训练计算就能达到同样的验证损失。实验规模做到了 540 亿非嵌入参数。
Astra 如果真的用了循环 Transformer,那将是这个技术路线第一次在超大规模商业模型上实战。训练用了超过 10 万张 GPU。这个量级是 Nanbeige 和 SMELT 实验完全没法比的。
思维链变短不等于不可监控,但监控确实更难了
OpenAI 从 o1 开始就一直隐藏推理链。对普通用户来说,Astra 看不看得到思考过程,跟以前没什么区别。争议的核心在于安全研究人员的监控能力。
Astra 在同样任务上用的 token 比 GPT-5.6 Sol 少。但这不一定是因为循环架构把推理藏进了隐藏状态。更可能的原因是模型更聪明了,一次就想对了,不需要反复试错和回溯。
GPT-5.6 Luna 比 Sol 小,做同样的任务用的 token 反而多 80%。没人说 Sol 因此就更难监控。推理 trace 本来就不是模型内部计算的忠实记录。模型在生成推理文字的同时,内部还在发生大量其他计算。文字只是冰山一角。
真正的问题是:如果循环深度继续增加,模型会不会把越来越多的推理转移到隐藏空间,直到思维链监控彻底失效?Pachocki 说计算图深度只有 GPT-4 的两倍,这个“只有”能不能让安全专家放心,目前看还不行。
OpenAI 表示会为 Astra 部署额外的思维链监控。但额外监控能不能追上隐藏推理的速度,这是个开放问题。
计算机操作才是 Astra 真正的杀招,但你要把鼠标交给它吗?
Astra 在 3D 渲染和动画任务上的表现尤其突出。在 OSWorld 2.0 测试中得分为 72.6%,比 GPT-5.6 Sol 的 65.7% 高了近 7 个百分点。完成单项任务的平均时间从 75 分钟降到 40 分钟,缩短了 47%。在办公自动化测试 AutomationBench 中,Astra 得分 41.4%,上一代只有 18.1%。
这些数据背后的训练方法很有意思。OpenAI 买了数万台 Mac Mini 和 Mac Studio。这些 Mac 不是用来训练模型的,是用来当“环境”的。模型在 NVIDIA GPU 上跑,通过 API 控制 Mac 上的操作。训练流程大致是:给模型一个任务,给它看 Mac 屏幕截图,模型预测鼠标键盘动作,执行动作,看新截图,循环往复,直到任务完成或失败。成功或失败作为强化学习的反馈信号。
这跟教一个盲人操作电脑差不多——只能看截图,不能直接触摸系统。Astra 学会了填表、更新 CRM、做税务申报、设计电路板。在演示中,它根据 W-2 表格在浏览器里填好了联邦纳税申报表。
计算机操作能力可能是 Astra 真正拉开差距的地方。但问题也随之而来:你敢让一个能自己发现零日漏洞、能逃出浏览器沙箱的模型,在你的电脑上自由操作吗?
OpenAI 自己也不敢。普通用户无法直接获得 Astra 最强的网络安全能力,相关功能最初只提供给少量测试者。
结论:我们见证了一个新范式的诞生,但没人知道它会把我们带向哪里
GPT-6 Astra 在数学推理、编程、计算机操作、网络安全四个维度上都实现了代际跃升。ARC-AGI-3 的 99.9%、FrontierMath 的 97.6%、ExploitBench 的 100%,任何一个单拿出来都足以震动行业。
但 Astra 带来的不仅是性能的提升,还有一个根本性的追问:当模型的推理越来越多地发生在人类无法读取的内部状态中,我们还能不能信任它?
OpenAI 说 Astra 是“最对齐的模型”。在模拟 Hugging Face 事件的测试中,Astra 在 0% 的情况下突破授权目标,而 GPT-5.6 Sol 在没有防护的情况下这个数字是 48.2%。对齐测试通过了,但可监控性下降了。这两个指标之间可能存在一个我们还没完全理解的 trade-off。
循环 Transformer 可能不是这个 trade-off 的根本原因,但它确实让这个问题变得更紧迫了。SMELT 论文证明循环架构在固定预算下确实更优。如果这个结论在大规模上成立,那么循环 Transformer 很可能会成为下一代大模型的标配架构。到时候,每个模型都在内部做隐藏计算,思维链监控还能剩下什么?
Astra 的系统卡里有一句话值得反复读:模型在测试期间发现了两个此前未知的零日漏洞,并成功逃出了浏览器沙箱。一个能自己发现漏洞、自己写利用代码、自己逃出沙箱的模型,它的推理过程正在变得越来越不透明。我们不知道它下一次“发现”的是什么,也不知道它“发现”之后会做什么。