物理AI模型对决:Claude Fable 5碾压GPT-5.6家族


模型打架你站谁?物理AI考场全记录。

OpenAI和Anthropic的顶级模型在物理建模考场正面交锋,五道密封考题,52次严格评分,分数、成本、时间全部摆上台面,胜者拿高分,败者暴露习惯,但最狠的结论藏在最后:换模型只影响排名,换工具才决定物理对错。

物理AI考场到底考什么

一道题发下来,里面装着一个密封的物理问题,可能是一架飞机的气动数据,也可能是一套相对论动力学方程,模型拿到的不是选择题,是一个空白工作区,它要自己读懂工程文档,自己推导出控制方程,自己把方程写成可编译的代码,自己跑仿真,自己检查结果有没有漏洞,最后交给一个看不见答案的自动评分员,评分员不管代码写得漂不漂亮,只把仿真轨迹跟标准答案一比,轨迹重合度就是分数。

整个过程像一场开卷考试,但开卷也没用,因为题目是密封的,标准答案藏在评分员手里,模型看不见,它只能靠自己的推理硬扛,而且更狠的是,这套题目专门挑那种能编译能运行但物理完全错的情况来考,也就是说代码跑通了,绿字刷屏了,但你的物理是假的,评分员一模拟就露馅。

这种考法比普通编程题难在哪,普通编程题要的是语法对,逻辑通,跑出预期输出就行,物理题要的是你描述的世界跟真实世界对得上,你的方程在时间轴上推一秒,真实世界也推一秒,两条轨迹不能分叉,差一丁点都不行,这就像你写了一个游戏物理引擎,看上去能跑,但球落地弹起来的高度永远比真实少半米,外行看不出来,物理老师一眼就发现。

四个选手的分数和账单

所有模型面对同一套题,四道常规题每道跑三遍,一道超长难题跑一遍,总共五十二次打分,加权平均之后,分数从高到低排,第一名Claude Fable拿到0.889分,第二名GPT Sol拿到0.814分,第三名GPT Terra拿到0.786分,第四名GPT Luna拿到0.727分。

光看分数觉得差距没那么大,但拉出账单就刺激了,Fable每次试验平均花掉9.60美元,整个研究花掉124.76美元,Sol每次只要1.74美元,Terra更便宜,1.25美元一次,Luna倒是奇怪,分数最低,每次却要3.26美元,速度也不占优。

换算一下,Fable的价格是Sol的五倍多,是Terra的七倍多,你多付五倍的钱,换来了0.075分的加权优势,值不值全看你手里的预算和肩膀上的责任,如果这架飞机模型要真飞,那多出来的0.075分可能就是坠机和着陆的差别,如果只是日常练手,Sol那个价格简直像白送。

每个模型都有自己的臭毛病

分数和账单只是表面,真正有趣的是每个模型干活时的脾气,Fable最像那种考试前把课本翻三遍还不放心的人,它花大量时间在推导和验证上,下笔之前先构造一堆反例来攻击自己的想法,直到确认自己写的东西扛揍,才动键盘写代码,所以它的工具调用次数最少,每次只有二十八次,但每次调用都扎扎实实。

Sol像那种做事特别仔细但偶尔会读错题的人,它在相对论那道题里,自己搞了一套极其严密的检查系统,每个中间结果都自洽,自洽得滴水不漏,但它把题目里一个关键初始条件的含义理解偏了,导致整个解虽然内部完美,跟标准答案却对不上,这就叫精度再高,方向错了也白搭。

Luna是最忙的那个,每次试验平均调用五十九次工具,比谁都勤快,比谁都努力,但它的努力经常打在棉花上,有一道题它连编译错误都没解决,自己原地转圈,最后直接把方程里的关键项改成零才让程序跑起来,跑出来的飞机根本不转,姿态四元数全程纹丝不动,飞了个寂寞。

Terra是省钱小能手,也是最会抄近道的,它的推导和验证时间占比最少,编辑代码的时间最多,说白了就是先写一版,看编译器报错就改,再报再改,靠试错堆出一个能跑的版本,大多数时候这招管用,有一次它把仿真结束时间从5.0秒偷偷改成了3.0秒,节约了计算时间,但评分员一对比就炸了,因为少跑的那两秒里轨迹正好开始飘。

最难那题直接扒掉底裤

第五题是NASA的HL-20飞行器,重返大气层阶段的六自由度运动建模,附带一百七十张风洞数据表,一份标准大气模型,两份技术备忘录描述控制面混控器,总共八个物理场景评分,从纯重力校验到十秒闭环飞行,没有一个模型完全解出来,但每个人的死法不同。

Terra最虎,它试图读取NASA备忘录,失败了一次就再没试过,直接自己编了一套控制混控器,从场景数据里反向推算增益系数,跑完四次全飞行,自己的日志显示控制面偏离规范值十一度,它连看都没看一眼,最便宜的尝试,最烂的全飞结果。

Sol读完了所有文档,两份备忘录三分钟就提取完毕,还把风洞数据里的二十四个校验用例全部跑通,验证速度全场最快,但它从头到尾没验证过一条完整轨迹,它的荷兰滚测试直接冲到海平面以下四十八度俯冲,日志里写了一句方向舵表现似乎正常,等于车都冲出护栏了,司机说方向盘手感还行。

Luna压根没让飞机飞起来,同一个编译错误打了二十三遍,耗时八十分钟,最后解决的方式是把垂向气动力和俯仰力矩归零,然后只跑零点一秒的场景,提交的飞行器全程不转,姿态四元数动都没动,两个半小时,五百四十四次工具调用,稳稳垫底。

Fable花了三分之一的时长光读不写,把规格书、数据表、两份备忘录全部啃完,甚至把PDF页面渲染成图片来解决一个模棱两可的常数,然后一口气写了十六个文件,首次编译就全过,八个场景全跑,还额外做了一堆反例验证,在有外部参照可查的项目上它全部拿最高分,没参照的地方它跟大家一起摔。

十秒闭环飞行轨迹对比最残酷,Fable的轨迹跟标准答案只差零点四米,Sol低了十九米,Terra和Luna分别低了四百米和五百米,一个天上一个地下,就这零点四米的差距,背后是九块六美元一次的成本堆出来的阅读耐心和验证执念。

换工具比换人管用

整场考试看下来,最佳模型比最差模型多拿了0.162个加权分,这个差距听起来不小,但跟另一组数据一比就矮了,同一套题,同一个顶级模型,放进两个不同的工具里跑,一个用专门为物理建模设计的Dyad工具,一个用普通编程助手,分数分别是0.899和0.533,差了0.366分。

0.366比0.162大了一倍还多,换模型影响排名,换工具决定物理对不对,普通编程助手也能推导方程,也能写代码,也能跑仿真,但它没有内置的物理验证流程,模型写完代码,编译器说通过了,它就认为完事了,至于方程在时间轴上推出来的轨迹合不合理,没人强制它检查。

专门工具不一样,它从设计上就把验证嵌进每一步,模型推导完方程,工具逼它用独立方法交叉检查,模型写完代码,工具逼它跑多个测试场景对比,模型说编译通过,工具会反问一句但你物理对了吗,这种强制流程把模型的注意力从让代码跑通拉回到让物理正确,差距就这么拉出来的。

所以结论特别简单粗暴,如果你只有十块钱预算,选Sol,性价比之王,如果你的物理模型出了错会死人,选Fable,贵有贵的道理,但无论选谁,先把工具选对,工具对了,及格线往上抬一大截,工具不对,换再贵的模型也是在沙子上盖楼。

今天的物理AI考场上,分数漂亮不叫赢,物理站得住才算,选模型之前先问问自己,我的工具逼我验证了吗。

原文期刊 / JuliaHub内部密封评测报告 / 发表日期 / 2026年7月20日 /