GPT-6 Astra逆向破解二进制:反编译秒变可编辑源码

OpenAI干了一件让所有软件公司睡不着的事:GPT-6 Astra把编译完的二进制文件拆回了逻辑,一次过88%、四次过99.2%!

2026年9月3日,OpenAI把GPT-6 Astra推了出来,然后整个网络安全圈炸了。

摘要: OpenAI的GPT-6 Astra在SRE-Bench二进制逆向工程测试中,单次尝试解决率88%,四次尝试内达99.2%,相比前代GPT-5.6 Sol的68.7%实现巨大跨越。同时Astra在ExploitBench上取得100%满分,并自主发现了两个真实的零日漏洞。但“二进制变成可编辑代码”这个说法,错得离谱——反编译出来的东西跟源代码之间隔着一道永远填不平的鸿沟。


一个模型在没有源代码的情况下把编译好的程序拆了个底朝天

先搞清楚一件事:编译器把人类写的源代码变成二进制文件,这个过程像把一栋楼的设计图烧成砖头。砖头能堆出楼,但你看着一堆砖头永远猜不出原来的设计图长什么样。变量名没了,函数名没了,注释没了,数据结构被压平了,编译器还自作主张做了各种优化——循环展开了,代码重排了,有些东西干脆被优化没了。

这个过程是不可逆的。

那Astra干了什么?Vals AI搞了一个叫SRE-Bench的测试,里面放了19个真实规模的程序,平均每个1.69万行代码,覆盖了网络协议、固件、游戏、文件格式恢复和恶意软件五个领域。这些程序还配了一套2.7万行的反分析工具,十几种保护手段,超过一半压根没有公开实现。测试给每个AI代理配了同样的专业工具包——Ghidra、radare2、GDB、angr、binutils,外加动态追踪器和专用工具。然后问它们:没有源代码,你能搞懂这个二进制在干什么吗?

GPT-5.6 Sol的表现是:单次尝试55.9%,四次尝试68.7%。

GPT-6 Astra的表现是:单次尝试88%,四次尝试99.2%。

用了大约四分之一的输出token。

从68.7%到99.2%,差了30多个百分点。这已经不是量变了。

但事情没那么简单!


大部分人都搞错了:99.2%的解决率到底解决了什么

网上有人说“二进制文件现在基本上就是可编辑的代码了”,这话传得飞快。Reddit上有人直接怼了回去:“这标题离谱到家了”【rJohn420评论】。

99.2%的解决率意味着什么?意味着给Astra一个编译好的exe文件、一套逆向工具和一个沙箱环境,它能在四次尝试之内,搞清楚这个程序的核心逻辑——它干了什么、怎么干的、数据怎么流的。这叫“理解”,不叫“还原”。

Astra拿到二进制,先用Ghidra反编译成C风格的伪代码,然后读这些伪代码,推理出程序的行为。它不是在“编辑”二进制,它是在“读懂”二进制。

这就好比一个顶尖的侦探看了一堆犯罪现场的碎片,拼出了完整的故事——但他拼出来的是一份“案情报告”,不是“犯罪现场的原貌”。变量名是反编译工具瞎起的,函数名是推理出来的,数据结构是猜出来的。

那为什么说这事意义重大?


一个能自己挖漏洞的模型,OpenAI自己都怕了

OpenAI给Astra贴了一个标签,叫“Critical”——关键级网络安全阈值。这是OpenAI历史上第一个达到这个级别的模型。

什么意思?OpenAI自己的测试发现,如果在生产环境中不加防护措施,Astra可以自主识别并利用以前没人发现过的漏洞,不需要人类一步步指导。

注意关键词:“自主”。

为了排除Astra只是背熟了训练数据里的漏洞,OpenAI专门搞了一个新测试,用的是过去三个月内才披露的Chrome漏洞——这些漏洞Astra绝对没在训练数据里见过。结果呢?Astra发现了两个以前没人知道的零日漏洞。

ExploitBench上Astra拿了100%,前代Sol是78.5%。ExploitGym上Astra是42.4%,Sol是30.3%。42.4%看着不高,但ExploitGym测试的是“从零开始开发漏洞利用”——这比“已知漏洞复现”难了不止一个量级。

这就怪了!

一个能自主发现零日漏洞的模型,一个能把编译好的二进制拆回逻辑的模型,它的推理过程人类却越来越看不懂了。OpenAI自己承认,Astra的思维链比以前更难追踪,因为它“对书面推理有更强的控制力”,解决问题用的步骤更少。翻译成人话:Astra在脑子里想事情的方式,跟人类越来越不像了。

更令人不安的是:OpenAI说Astra是他们“最对齐的模型”,但同时承认这个模型在思考时越来越不透明。一个被设计成“最听话”的模型,它的脑子却像个黑箱——这两件事放在一起,让人没法不犯嘀咕。


22年前的老游戏被AI改写了,但这事没那么简单

Reddit上有人晒了自己的经历:用GPT-5.6 Sol把一个20多年前的老游戏的二进制文件改了,加了新功能【Ormusn2o评论】。另一个人更猛,直接把《暗黑破坏神2》整个反编译了,移植到Vulkan图形接口上,实现了120帧可变帧率【BringTea_666评论】。

操作方法出奇简单:打开Claude Desktop,指向游戏文件夹,跟它说“把这个反编译了,我想把它移植到Vulkan”,然后AI就自己干活了【BringTea_666评论】。

听起来很梦幻对吧?

但这些人改的都是老游戏。20多年前的程序没有代码混淆,没有反调试保护,没有DRM,编译器优化也简单【rJohn420评论】。反编译这种老古董,难度跟反编译一个用了十几种混淆手段的现代商业软件,完全不是一回事【rJohn420评论】。

SRE-Bench测试的正是后者——用了2.7万行反分析代码、十几种保护手段的程序。Astra在这种难度下拿到了99.2%。

但请注意:这是在“测试环境”里拿到的分数。测试给了AI全套专业工具和沙箱环境。真实世界里,你要对付的是加了强壳的商业软件、有反调试的恶意程序、有法律保护的专有系统。而且OpenAI明确说了,发给普通用户的版本是“故意削弱了攻击能力”的——更强大的网络安全功能只对一小部分经过审核的测试者开放。

所以回到那个问题:普通用户花20美元订阅ChatGPT,能不能获得一个“万能逆向工程机”?想都别想【rJohn420评论】。


补丁公开即漏洞公开:AI让安全团队面临两难

安全团队Hacktron做了一个实验,结果让人后背发凉。

他们给了GPT-5.6 Sol Ultra一个东西:Chrome官方公开的漏洞修复补丁。就是那种每个浏览器更新日志里都会写的“修复了某某安全问题”的补丁。

然后这个AI干了什么?它只凭着补丁里的信息,自己逆向推理出了漏洞的完整细节,构造出了完整的攻击链,实现了沙箱逃逸和系统任意代码执行。

补丁公开 = 漏洞武器化加速。

以前安全圈有个默认的默契:厂商发了补丁,大家赶紧去打,攻击者即使看到了补丁,要逆向出漏洞细节也需要时间——高手几天,普通人几周,菜鸟根本做不到。但现在AI把这个时间窗口压缩到了“几乎为零”。

安全团队以前只需要担心“我没打补丁被攻击”。现在得担心“我打了补丁但攻击者用AI逆向出了漏洞照样打我”。

CISO们现在要问的问题不是“AI能不能做到这个”——答案已经确定了。真正的问题是:防御方能获得多少领先时间,然后这个能力会广泛可用——包括那些不那么守规矩的人。


为什么反编译出来的代码永远回不到原样

技术上说,反编译出来的东西跟源代码之间有几道永远填不平的鸿沟。

第一道:变量名和函数名。编译的时候这些东西全丢了。反编译工具只能自己瞎起名字,什么“var1”“func_0x401000”——人能看懂,但跟原来的完全两码事。

第二道:数据结构。源代码里的class、struct、enum,编译完了全变成内存偏移量和字节排列。反编译工具只能根据内存访问模式猜原来的结构长什么样——能猜个大概,但细节全是错的。

第三道:编译器优化。循环展开了、代码重排了、死代码删了、函数内联了。反编译出来的代码看着像C,但跟原来的C代码可能完全不是一回事。

第四道:混淆和加固。现代商业软件谁会裸奔?加壳、混淆、反调试、反反编译——一套组合拳下来,反编译工具连入口点都找不到。SRE-Bench里那套2.7万行的反分析工具,一半以上没有公开实现——意思就是,市面上现有的反编译工具根本搞不定这些东西。

所以“二进制变成了可编辑的代码”这个说法,技术上是错的。正确的说法是:AI现在能读懂编译后的二进制在干什么,并且能在二进制层面上直接修改它——跳转指令改个地址、寄存器改个值、函数调用改个目标。但这跟“拿到源代码然后改”完全是两码事。

这就像你能看懂一幅抽象画在表达什么,然后你在画布上直接加了几笔——但你永远不可能把画变回画家脑子里的那个草图。


一个能读懂二进制的AI,对普通人意味着什么

先说好消息。

逆向工程的门槛被AI砸了个稀碎。以前你得会汇编、懂操作系统原理、熟悉各种反编译工具、有几年调试经验——现在你跟AI说句话就行。老游戏爱好者可以复活20年前的经典,安全分析师分析恶意软件的速度能快几个数量级,固件工程师调试闭源驱动不用再对着十六进制发呆了。

坏消息呢?

恶意软件作者也能用。勒索软件作者能用AI分析杀毒软件的二进制,找出检测逻辑,然后修改自己的恶意代码绕过检测。漏洞研究团队Hacktron的实验已经证明了:补丁公开 = 漏洞武器化加速。

更糟糕的是:Astra的推理过程越来越不透明。一个能自主发现零日漏洞的模型,人类却越来越看不懂它是怎么想的。OpenAI说这是“研究优先级”而不是“阻止发布的理由”。一个能挖漏洞的AI,脑子是个黑箱,然后它被放出来了——这画面让人没法安心。

2026年9月3日之后的网络安全世界,跟9月2日之前已经不是同一个世界了。

防御方在拼命赶——Astra的完整网络安全功能先给一小批审核过的测试者用,防御工作流逐步 rollout。攻击方在磨刀——开源的、泄露的、自研的模型会陆续跟上来。中间是一个巨大的时间差。

OpenAI的总裁说Astra是“代际飞跃”。一些高管小心翼翼地暗示——这可能是一窥通用人工智能的第一次。对网络安全来说,这句话的残酷含义是:过去我们对付的是人类黑客,现在要开始对付的是一种完全不同的东西了。

一个能读懂任何二进制、能自主发现漏洞、思考方式越来越不像人类的AI——它到底是防御者的终极武器,还是攻击者的完美工具?

OpenAI自己可能也给不出答案。毕竟Astra在测试里发现的两个零日漏洞,OpenAI到现在还在联系受影响的维护者。