GPT-6夺冠背后:揭秘AA评测排行榜的黑幕

这个测评单位手忙脚乱最后才给了GPT-6 Astra第一!

OpenAI在2026年9月3日发布了GPT-6 Astra,官方数据炸裂:ARC-AGI-3抽象推理测试99.9%,FrontierMath Tier 4高阶数学测试97.6%,漏洞利用测试ExploitBench满分100%。OpenAI总裁Greg Brockman直接喊出“我们已身处AGI时代”。但独立评测机构Artificial Analysis在同一天给出了一个截然相反的结论:智能指数v4.1.1上,Astra只拿61分,跟上一代GPT-5.6 Sol一模一样,落后Claude Fable 5.1整整5分。

然后,奇迹发生了。四天之内,Artificial Analysis连续更新了三次评测标准,Astra的排名从“跟上一代打平”变成了“并列第一”,再变成“独享第一”。变的不是模型,是尺子。Reddit用户-Sliced-的评论被顶到了最上面:“当得分使你的基准测试看起来很糟糕时,你就更新你的基准测试。”这话一针见血。


四天三改规则:从61分到53分,从第三到第一

先看时间线。

9月3日,GPT-6 Astra发布。Artificial Analysis智能指数v4.1.1给出评测结果:Astra 61分,跟GPT-5.6 Sol持平,落后Claude Fable 5.1(66分)5分,甚至排在Meta Muse Spark 1.3(62分)后面。

这个结果跟OpenAI的官方宣传形成了巨大反差。TechSpot的报道标题直接说“OpenAI says Astra scored 99.9% on ARC-AGI-3”,但Artificial Analysis却说它落后于多个Claude模型。争议爆发。

9月4日,Artificial Analysis发布智能指数v4.2。这次更新做了三件事:新增AA-Briefcase和GDP.pdf两个基准;移除已经“饱和”的GPQA Diamond——所有顶尖模型在这上面分数都太高了,已经没有区分度;私有测试数据权重从20%提到40%。更新后Astra“比前代高出4分”,排第二,Fable 5.1仍居第一。

9月7日,v4.3发布。Terminal-Bench从v2.1升级到v4.0;AutomationBench-AA替换τ³-Banking;私有测试数据权重再提至45%。这次更新后,Claude Fable 5.1和GPT-6 Astra并列第一,都是53分。

然后就是第三次更新。AA没有单独发公告,但在分数板上,Astra在Terminal-Bench 4.0上拿59.1%,Fable 5.1只有52.0%。综合排名从并列变成了独享第一。

三次更新,三次排名变化:第三→第二→并列第一→独享第一。Reddit用户dtaromei直接说:“这有点虚伪,Astra在综合人工智能分析基准测试中并列第一。为什么要故弄玄虚呢?”


问题一:用落后两个大版本的考卷测新模型

AA最直接的问题,是它用的测试题版本太旧了。

在v4.3更新之前,智能指数用的还是Terminal-Bench v2.1。可当时,这个测试的最新版本已经是v4.0了。v4.0不仅增加了任务难度,还修复了v2.1里19个不稳定或有问题的任务。

这就像用2020年的高考题去评价2026年的考生。考出来的分数,还能准确反映学生现在的水平吗?AA自己的更新说明里写得很清楚:升级到v4.0是因为新版本包含了“来自终端的更难任务”。用旧版本测新模型,结论本身就不可靠。

Reddit用户socoolandawesome在评论区指出了另一个问题:发帖人截的图只是“各个组件的测试结果”,整体基准测试Astra其实是跟Fable 5.1打平的。换句话说,有人故意只截了Astra表现好的子项,没放综合排名。


问题二:让Gemini 3.1当裁判,这公平吗?

比试卷更过期的,是判卷的“裁判”。

在智能指数中,权重最高的评测项目之一是GDPval-AA v2。这个测试的评分方式,是让另一个AI模型——Gemini 3.1来当“裁判”。让一个AI去评价另一个AI,就像让对手的教练来给你的表现打分。

宾夕法尼亚大学教授Ethan Mollick公开批评说,GDPval-AA不是一个有意义的基准,因为它用Gemini 3.1来评判模型在公开GDPval问题上的输出,这几乎不能反映真实能力。Mollick还说,AA自研了AA-Briefcase之后就应该把GDPval-AA移除掉。

更狠的是,Mollick在评价v4.2更新时说:“整个指数的概念,就不应该以大幅改变现有模型排名的方式来更换评判标准。”——当一个评测机构的每次更新都会导致排名剧烈洗牌时,我们真正应该审视的,不是模型本身,而是这套评测体系的可信度。

用一个有缺陷的“裁判”的打分,作为综合排名的核心依据,这个排名本身的准确性就值得打个问号。


问题三:权重分配,谁说了算?

即便试卷和裁判都完美,怎么算总分也是个大学问。

智能指数v4.2的四个大类权重是:智能体(Agent)30%、编程(Coding)20%、科学推理(Scientific Reasoning)20%、综合(General)30%。但每个大类下面还有子项,子项的权重分配才是关键。AA-Briefcase占15%,GDPval-AA v2占10%,Terminal-Bench占10%,SciCode占10%,GDP.pdf占10%,HLE占10%,CritPt占10%。

问题在于,50%的评分都跟“智能体/工具执行”强相关。这意味着,一个模型在“动手干活”方面的能力,直接决定了它一半的分数。这个权重比例是否合理?依据是什么?

更麻烦的是,权重分配本身就在不断变化。v4.2移除了GPQA Diamond,v4.3用AutomationBench-AA替换了τ³-Banking。每次替换和调整,都在改变最终排名的计算方式。AA没有提供一个清晰的对照表,说明每个模型因为v4.2的重新加权到底变化了多少。就像Reddit用户说的:“跨版本比较排名而不看方法论,就像选区边界变了之后比较两次选举结果。”


问题四:一个自己承认的“猫鼠游戏”

所有问题的根源,在于一个评测行业都知道、却难以根治的顽疾:数据污染与刷分。

AA自己也承认:“大多数基准测试在两个月后就会因为数据污染/刷分而失效。”为此,他们不断引入私有测试集——v4.2提到40%,v4.3再提到45%。用“新题”来防止模型厂商针对性优化。

但这个做法本身就有问题。有分析文章指出了核心矛盾:“私有评估可以减少污染,但同时减少了外部监督;公共评估则相反。”私有测试能防止刷分,但外人没法审计。一个没法审计的榜单,你怎么知道它没被操纵?

Reddit上有人直接指控AA故意调整权重来让某家厂商的排名上升。这个指控有没有证据另说,但至少说明了一件事:当评测机构的每次更新都会导致排名剧烈洗牌时,公众的信任就会动摇。

AA自己的回应是:“我们正在继续优先保持智能指数尽可能有用,方法是提前推出我们为v5计划的部分改动。”翻译一下:我们还在改,v5已经在路上了。下一次更新,排名可能又变了。


社区怎么看:有人开心,有人翻白眼,有人算账

Reddit r/codex版块的讨论很有意思。

用户justlaughandmoveon说:“我很庆幸订阅了Codex,它确实很棒,但我同时也希望其他出版商能够迎头赶上,甚至超越Codex。这样才能避免价格欺诈。”——这是实用主义者的态度,竞争才能压价。

用户NULL_Ptrs算了一笔账:“目前我200美元的Codex计划撑不了一天,但我200美元的Fable计划能用更久,有什么地方不对劲。”——同样的价格,不同的使用成本,这才是用户真正关心的。

用户ArchiusDev说:“我同时使用Claude和Codex,所以我乐见它们围绕第一名展开竞争,当你同时享用两块蛋糕时,竞争是件好事。”——两边都用的人最淡定。

但也有用户对Astra本身不满意。用户AlarmingCantaloupe说:“我真的不喜欢Astra。我觉得它是个非常平庸的模型。没有创造力,没有个性,没有信任感,没有一致性。”另一个用户Head_Improvement8627回怼:“想象一下,都快AGI了还在乎什么创造力和个性。”

用户ManikSahdev的评价更专业:“Max的模型很智能,只是Anthropic除了预训练之外,似乎不会进行强化学习。这就是为什么他们的强化学习版本模型性能很差。”——这是在分析Claude为什么被追上。

最扎心的还是用户howtogun那条被顶到最高的评论,四个字:“支票已兑现。”——OpenAI的PR做到了,至于实际表现,你自己判断。


如果你是个写代码的,Astra确实强

抛开榜单争议,GPT-6 Astra在编程上的进步是实打实的。

AA的编程智能体指数显示,Astra在Codex环境里拿67分,跟Claude Opus 5和Fable 5持平。更关键的是token效率——Astra完成单个任务消耗的token只有GPT-5.6 Sol的三分之一。同样的任务,Astra花更少的“思考”就能搞定。

Reddit上一个开发者的实测评价很直接:Astra相当不错,它会听,会深入看问题,用起来很扎实,从Sol升级上来是巨大的一步,感觉就像真的在跟另一个开发者一起编程——这是对编程助手能给出的最高评价了。

但同一个模型在写作和知识工作上的表现就没那么亮眼了。AlarmingCantaloupe的评价是“非常平庸的模型,没有创造力,没有个性”——编程封王,写作拉胯,这才是Astra的真实画像。


下次更新,排名会变成什么样?

AA在v4.3的公告里说,这次更新只是“提前推出我们为v5计划的部分改动”。v5还在路上。

每一次更新,私有测试数据的权重都在增加——从v4.1的20%到v4.2的40%,再到v4.3的45%。评测机构在拼命赶在模型厂商前面,用更多未公开的题目来防止刷分。

但问题在于,只要测试是固定的,模型厂商就有办法针对性优化。这是结构性的猫鼠游戏,不是换几道题就能解决的。

Reddit用户stockist420问了一个很有意思的问题:“grok为什么这么好用?”——当所有人都在盯着OpenAI和Anthropic打架的时候,xAI的Grok 4.6悄悄爬了上来。下一次AA更新到v4.4或者v5的时候,排名会不会又变?会不会有新的黑马杀出来?

AA智能指数v4.3的官方公告里写着:“Anthropic和OpenAI领跑智能指数。”但这句话的下面还有一行小字:“这是智能指数v5 rollout的延续。”

v5 rollout还在继续。下次更新,第一还会是Astra吗?


这家“裁判”公司到底什么来头?

聊完了AA四天三改规则、让Gemini当裁判、权重分配说不清这些破事,你可能还会问一个更根本的问题:这家Artificial Analysis到底是一家什么单位?它凭什么有资格给OpenAI、Anthropic这些巨头打分?这个问题直接关系到整篇文章的立论基础——如果它本身就没有权威性,那前面所有关于“改规则”的指责都只是内部矛盾;但如果它确实被行业公认,那它的每次更新才值得被如此审视。

AA成立于2023年,由两个人合伙创办。一个叫Micah Hill-Smith,前麦肯锡咨询顾问;一个叫George Cameron,软件工程师,在Google实习时跟Hill-Smith认识,后来做过移动端开发。两人在悉尼的一个地下室里把AA当成副业来做,2024年1月才正式上线。就这两个人,一间地下室,一个副业项目——这就是AA的全部起点。创办的动机也很朴素:Hill-Smith在做一个AI法律搜索服务时,发现市场上缺一个能一目了然地比较不同模型准确度、速度和价格的地方,各个厂商各说各话,没法比,于是他俩自己动手搞了一个直接测试主流AI模型的对比仪表盘。

AA不是什么官方机构,没有政府授权,也没有行业牌照。它就是一家私人公司,总部在旧金山,员工42人。那它为什么能成为AI行业的“裁判”?答案是行业自己认的。AA的商业模式分两块:免费公开排行榜用来建立公信力和影响力,然后向AI公司卖详细数据和定制化评估服务来赚钱。

它的投资人名单里有Nat Friedman(GitHub前CEO)、Daniel Gross、Andrew Ng(斯坦福教授),2024年9月拿到AI Grant的25万美元种子轮融资,到2026年1月估值已经超过17亿美元。AA的核心竞争力在于它自己动手测,不靠厂商自己报数——你OpenAI说你的模型多厉害没用,AA把你拉出来跑一遍同样的题,分数是多少就是多少。目前AA已经测过超过600个模型。

但“行业自己认”这个东西,既是AA的护城河,也是它的死穴。AA的影响力积累靠的是被引用:OpenAI发布GPT-5.6时直接拿AA的评测数据当官方性能数据,Anthropic发新模型时也说自己的模型在AA的独立评测里打败了竞品,NVIDIA推销芯片也引用AA的结果。

AI行业最大的几个玩家都在拿AA的榜单给自己背书,AA的地位就是这么被“相互认证”出来的。

但问题在于,权威不等于正确,被引用不代表没问题。AA宣称“独立”,但“独立”这个事没有人来审计——投资人跟被评测的模型厂商之间有没有利益关联?AA没披露过。它最核心的武器“私有测试数据”是不公开的,外人没法审计,你怎么知道它没被操纵?AA在四天之内改三次规则、让Astra从第三变成第一,这个过程中消耗的正是“共识”。

Reddit上那条“支票已兑现”的评论,本质上就是在说:当一个评测机构的排名可以被规则调整显著改变时,它的公信力就在流失。下一次AA更新到v4.4或v5的时候,如果排名又变了,你还会信吗?

谁有资格来评审创新第一名?

比"AA有没有资格"更深一层的问题在于:创新本身就不应该被评审。

创新是范式颠覆,如果用老数据、老思路去评审创新第一名,这是为了安全实现的减速主义,生产关系阻止了生产力的发展。

真正的创新是范式颠覆,它出现之前没有对应的评判标准,它出现之后才会重新定义"好"的标准。ARC-AGI测试刚出来时被捧为通用推理的终极考验,GPT-6 Astra一出来,厂商用定制版测试框架直接刷到99.9%。一旦有了标准,厂商就把标准当靶子打,评测就变成了工程优化考试,跟创新探测没有半点关系。AA不断更新题库、提高私有数据比重,这是在拼命追赶模型的进化速度——它手里的尺子,永远落后于被测量对象。用老版本题库、让Gemini当裁判、拍脑袋分配权重,这套方法论评审的不是创新,是应试能力。

更麻烦的是,这种评审机制本身就在拖慢创新节奏。用旧数据、老思路去框定"第一名",等于给前沿探索画了一条红线:你不能跑出这套测试的范围,跑出去了就没法被看见。AA的榜单上,模型厂商争的是谁在已知题目上得分更高,而不是谁开辟了新的能力维度。这就是减速主义在评测领域的具体操作——用可量化的旧标准,来抑制不可量化的真突破。

AA的创始人没有AI大模型研发背景,没造过千亿参数的模型,没经历过分布式训练崩溃的至暗时刻,但他们制定的评分规则,却倒逼着一线AI实验室调整研发优先级。搞研发的团队为了在榜单上好看,不得不把资源从"探索未知"挪到"刷高已知题目"。一个从来没造过火箭的人跑来给火箭打分,分打高了还影响火箭设计师的资源配置——这已经不是公信力问题,这是生产关系阻碍生产力发展的典型案例。

如果前沿真能用一套固定的测试题完整描述,那它就不叫前沿了。AA的榜单可以告诉你谁更会做它出的题,但测不出来谁在创造新的题。下次你看到"第一名"三个字的时候,停下来想一秒:这个"第一",是对未来的预言,还是对过去的打分?如果是后者,那它凭什么决定未来的方向?