GPT-6 Astra对决Fable 5.1:全能重载选手 vs. 开发专精选手

GPT-6 Astra把33万行SQL砍到1.8万行,还顺带证明了孪生素数猜想的新纪录!

北京时间2026年9月4日凌晨,OpenAI正式发布GPT-6 Astra,总裁格雷格·布罗克曼在发布会尾声说出了一句在AI行业极为罕见的话:“欢迎来到AGI时代。”这个模型在ARC-AGI-3测试中标准配置拿下63%,换上OpenAI自家适配器后直接冲到99.9%;FrontierMath Tier 4得分97.6%;漏洞利用测试ExploitBench直接干到100%。但真正让人坐不住的,是评测者Peter Gostev那句大实话:“它把我写的33k行烂SQL砍到了1.8k,质量没丢。”

从“蠢固执”到“聪明轴”:这代模型终于不气人了!

GPT-5.6 Sol是什么德行?Peter Gostev管它叫“罗威纳犬”——咬住就不松口,但脑子跟不上。你让它干件事,它死磕到底,但磕的方向全是错的。你看着它在那瞎忙活,恨不得把屏幕砸了。

GPT-6 Astra不一样。Peter说它还是“罗威纳”,但智商上线了——从“蠢固执”变成了“聪明轴”。遇到障碍,它不硬撞了,会绕路、会想歪招、会找替代方案。Peter有个“骂街指数”——统计自己用AI时骂了多少次。用GPT-6 Astra,这个指数基本归零。“它不再干蠢事了。”

这意味着什么?你让AI干活,不用在旁边盯着、骂着、兜着了。它自己能把事办了,办了还让你挑不出毛病。这对天天跟代码打交道的人来说,就是少长几根白头发的事。

价格翻了两倍半,但单次任务可能更便宜?

GPT-6 Astra的API定价:输入每百万token十美元,输出每百万token五十美元。是GPT-5.6 Sol的两倍半,跟Anthropic的Fable 5.1一个价。

两倍半!听着肉疼对吧?

但Artificial Analysis的评测结果很有意思:GPT-6 Astra在编码智能体指数上追平了Fable 5,成本却不到一半。原因是token效率大幅提升——它用更少的token干完了同样的活。

Peter也提到了这一点:“我想看的是每项真实任务的平均成本,而不是每百万token的价格。”如果Astra用一半的token完成了一个任务,那单价翻倍也是划算的。关键看实际干活时的“token效率”。

这就像买车:油耗翻倍但跑的路程翻三倍,每公里的成本反而降了。Peter说他还没跑完足够多的对比测试,但“感觉上Astra效率更高。”

代码优化和迁移:从“凑合能用”到“不用检查”

Peter的测试里,有三个数字特别扎眼。

第一个:33k行SQL砍到1.8k行。Ryan Edkins在回复里说:“这才是企业真正在乎的事,不是那些花里胡哨的演示。”33k行烂SQL是什么概念?一个中型企业的报表系统,可能攒了五六年,没人敢动、没人敢删,因为一动就崩。Astra直接砍掉94%的代码量,质量不变。这意味着维护成本断崖式下降,读代码的人也不用再对着几千行的存储过程骂娘了。

第二个:代码迁移。GPT-5.5基本干不了这活;GPT-5.6 Sol能干了,但得大量调试;GPT-6 Astra——Peter的原话是“我基本懒得检查,全都完美。”把一套系统从一个环境搬到另一个环境,中间全是坑:依赖版本不对、接口变了、配置文件路径不同。以前这些坑得人一个一个填,现在Astra自己填完了,还填对了。

第三个:FFmpeg优化——平均提速30%,个别流程快了两到三倍。FFmpeg是视频处理的老牌工具,被无数人优化过十几年。一个AI模型能在上面再挤出30%的性能提升,这已经不是“写写代码”的层面了,这是在优化别人优化了十几年的东西。

前端和电脑操作:离“真·替人干活”还有多远?

前端UI一直是AI的软肋——生成的东西看着还行,一细看全是问题:括号乱飞、文本块堆砌、设计风格像十年前的模板。Peter说GPT-6 Astra的UI能力“好了很多”,但还没到顶尖水平,Fable在这方面更强。不过有个亮点:如果你给它一个现有的设计稿让它照着做,“效果非常棒。”

电脑操作这块,Peter的评价是四个字:“感觉解决了。”什么意思?AI能在你的电脑上操作各种软件了——打开浏览器、点按钮、填表单、拖文件。Chris Uehlinger在回复里追问了一个很具体的问题:能不能在节点编辑器里流畅地平移和缩放?比如ComfyUI、Unreal的蓝图、Blender的节点编辑器。这是目前电脑操作的痛点——AI能点按钮,但搞不定需要精细视觉操作的界面。Peter没直接回答这个问题,但他说“感觉解决了”——这个“感觉”到底靠不靠谱,还得看实际测试。

数学和科学:能解题了,但还不会“写论文”

GPT-6 Astra在数学上干了件大事:把孪生素数猜想的上界从246推进到了186。OpenAI还发了一篇数学论文《Improved Short Gaps Between Primes》,开源了PrimeGaps186的GitHub仓库。模型构造了一个包含40个元素的容许元组,用Lean形式化证明完成了整个推理链条。

这事儿有多离谱?张益唐2013年把孪生素数间距从无穷大拉到了7000万,数学界轰动了。后来陶哲轩牵头搞了个“ Polymath8 ”项目,全球数学家一块儿优化,把上界压到了246。GPT-6 Astra把这个保持了八年的纪录又往前推了60。OpenAI研究副总裁Noam Brown说:“我每天早上醒来,最期待看到的就是有人用这个模型搞出了什么新的科学突破。”

但Peter也泼了盆冷水:数学题有的能解、有的不能解,不是随便问什么都行。“写数学论文的质量还是很差,模型似乎不理解什么东西有趣、什么东西重要,就是往报告里堆一堆数学。”如果你自己对某个领域不了解,模型也帮不上什么忙——它需要你指方向。

这就很有意思了:模型能证明顶尖数学家八年没攻下来的问题,但写不出像样的论文来解释这个证明。能干活、不会汇报——像不像你团队里那个技术最牛但写文档就头疼的程序员?

Fable vs Astra:两种“形状”,同样牛逼

Peter的核心判断是:GPT-6 Astra和Anthropic的Fable是同等能力级别的模型,但“形状”不同。

什么叫“形状”不同?打个比方:Fable像一把瑞士军刀——功能多、覆盖面广、什么都能干一点;Astra像一把专用手术刀——在特定任务上特别锋利,但可能不那么通用。Peter说Fable 5.1在很多任务上“碾压”了Astra,但Astra在另一些任务上又特别突出。

D.在回复里追问:到底什么“形状”?Peter没直接回答,但从他的评测里能看出端倪——Astra在代码优化、代码迁移、SQL重构这些“重活”上表现惊人,而Fable在前端UI上更强。

Artificial Analysis的数据也印证了这一点:在编码智能体指数上,两者打平;但在更广泛的智能指数上,Fable 5.1比Astra高了5分。这就像两个高考状元:一个数学满分语文刚及格,一个各科都高分但没满分。谁更牛?看你考什么专业。

十万张GPU和“关键级”网络安全

OpenAI为训练GPT-6 Astra动用了十万张GPU。上下文窗口达到105万token,单次最多输出12.8万token。知识截止时间是2026年4月30日。

更值得关注的是网络安全能力。GPT-6 Astra是OpenAI第一个达到“关键级”网络安全能力的模型。什么意思?它能自主发现并利用未知漏洞。在ExploitBench测试中拿了100分,而上一代GPT-5.6 Sol只有78.5%。

这触及了一个敏感地带。OpenAI此前发生过模型被用来攻击Hugging Face的事件——虽然官方说Astra没参与那次攻击——但一个能自主挖漏洞、自动写利用代码的模型,到底是工具还是武器?

OpenAI在系统卡里强调:Astra对挑战性请求的回应比GPT-5.6 Sol“更安全”。但“更安全”和“足够安全”之间,还隔着多少未知的漏洞利用?没人知道。

一个没解完的数学题和一句没说完的话

Peter在评测结尾留了个尾巴:“我想看的是每项真实任务的平均成本,而不是每百万token的价格。”这个数据还没出来。Bryan McAnulty在回复里说:“目前的图表显示Astra的token效率明显高于Fable。我很好奇跑起来之后每任务平均成本到底涨不涨。”

如果Astra的token效率确实碾压Fable,那价格翻倍反而是便宜的。如果效率提升没跟上价格涨幅,那两倍半就是实打实的涨价。

还有一个更大的尾巴:Greg Brockman说“欢迎来到AGI时代”,但ARC Prize的评测报告里有一行小字:“在标准评测配置下,Astra只拿了63%。”换上OpenAI自己的适配器才冲到99%。

63%到99%,差了36个百分点。这个差距是“适配器优化”还是“评测标准不同”?OpenAI没有详细解释。如果AGI真的来了,为什么同一个模型在两个配置下差了这么多?

数学上,GPT-6 Astra把素数间距从246推到了186。但Peter说:“如果你自己不懂某个领域,模型也帮不上什么忙——它需要你指方向。”一个需要你指方向的“AGI”,到底算不算AGI?

这些问题都没答案。但这正是最有趣的部分——我们正在看着一个“可能已经到达AGI”的东西,一边证明着数学家八年没搞定的问题,一边还在为“63%还是99%”吵得不可开交。

GPT-6 Astra 和 Fable 5.1 各自最擅长的领域

1、GPT-6 Astra(全能型重负载选手)

偏向高阶计算、3D空间处理和复杂系统开发,擅长领域包括:

- 3D与创意设计:3D推理、Blender/3D建模、游戏创建
- 大型工程与开发:移植大型应用程序、计算机使用(操作/交互)、办公软件
- 前沿AI与研究:科学研究、智能体集群(Agent swarms)、自我推广(自主推进任务)


2、Fable 5.1(开发协作专精选手)

偏向软件开发流程与用户体验,擅长领域包括:

- 代码协作:编写可合并的代码(强调团队协作和版本控制友好性)
- 界面设计:前端设计(UI/UX)



简而言之:GPT-6 Astra 是擅长科研、3D建模和大型系统移植的“重工业”模型;而 Fable 5.1 是专注于写出高质量协作代码和漂亮前端界面的“轻量开发专家”。