匿名模型Ox Alpha拿下了开源模型史上最贵的一次免费公测,你们猜它是谁家的?
2026年8月26日之前,全球AI圈都在猜一件事。OpenRouter和OpenCode上突然冒出来一个匿名模型,叫Ox Alpha。免费开放,迅速冲上两个平台的使用量榜首。Stripe的CEO Patrick Collison在X上发了句“令人印象非常深刻”。开发者们疯狂调用,没人知道它在什么芯片上跑,也没人知道它背后是谁。
8月26日晚,谜底揭晓。智谱正式发布并开源GLM-5.3-Flash,Ox Alpha就是它的匿名预览版。
官方宣布了三件事:性能追平Claude Opus 4.8,价格只有Opus的四十分之一,测试期间所有流量全部跑在国产芯片上。三件事,每一件都够炸。但素材里的数字和社区的真实反馈放在一起看,出现四组“官方说A,现实指向B”的错位。
官方说追平Opus,但这只模型扔进代码库后反应完全不同
官方博客放出一张Artificial Analysis Intelligence Index的图,GLM-5.3-Flash得分57,跟Claude Opus 4.8持平。DeepSWE v1.1上拿了63.4%,GLM-5.2只有46.2%,涨幅惊人。
但把它扔进真实代码库后,反馈是撕裂的。
完成SwiftUI和AppKit应用的复杂界面改版时,它干活利索。从零用PyGame搭一个RPG Maker,它也没掉链子。这些都是它能干的活。
但它也有完全搞不定的任务。有人拿它干了一周活,一次都没采纳它改的代码。有些活其他模型能轻松干完,它直接卡死。如果把它跟Qwen 3.8 27B放在一起比,它甚至还不如后者。唯一真正能打的场景是做网页界面,因为其他模型做界面实在太丑了,它只是丑得没那么明显。
同一个模型,在官方榜单和真实工作里完全不是一回事。这就怪了。
官方说四十分之一,但那只是打折价
官方宣称“Opus 4.8四十分之一的价格”。标准API价格是每百万Token输入0.15美元、输出0.5美元。Opus 4.8是输入5美元、输出25美元,确实差了三十多倍,按特定任务的加权比例算,可以凑出四十倍。
但Artificial Analysis图表里那个$0.045/任务的点,对应的其实是限时五折促销价。官方拿“打折后的价格”去画了那张“Pareto前沿”图。
订阅计划里还有另一个落差。Flash版的周额度是2.92亿Token,GLM-5.3是0.97亿,涨了3倍。但价格宣传是“十分之一”。3倍和10倍差得有点远。
价格确实便宜,但“四十分之一”这个数字在促销结束、额度算法透明之后,还能不能站住脚?
官方说国产芯片跑通了,但Ox Alpha免费期间慢得离谱
Ox Alpha期间的所有请求流量,全部由国产AI芯片集群支撑,超过10万张芯片。智谱基于SGLang自研推理引擎,在同样硬件上实现了3倍端到端性能提升,最终“硬件效率和每Token成本与主流英伟达GPU相当”。
这件事被看作一个分水岭——国产芯片第一次在真实生产流量中扛住了全球开发者的检验。
但宣传里有两个词很微妙。“相当”不是“超越”。“主流”没说具体是哪款,是H100、A100还是更低端的东西?FP8格式模型文件约328GB,DeepSeek V4 Flash只有160GB左右。架构优化确实砍掉了大量缓存,但总参数320B摆在那,比DeepSeek的Flash重了一倍。
Ox Alpha免费期间的体验也不太行,响应慢、延迟高、动不动就超时。官方解释是流量太大,但切到付费模式后并发会降下来,真实能力到底怎么样,还得再看。
从“能跑”到“付费用户等得起”,中间还隔着一道坎。
官方说MIT开源,但API条款里写着“输入输出归我”
模型权重以MIT协议开源,谁都可以下载、改、商用,这一点拿到很多好评。
但Z.ai自家API的服务条款里写着:“对输入和输出的永久、可转让、免版税、全球范围内的使用权”。“可基于绝对酌情权单方面终止账户,已付年费不退”。
模型开源了,服务没开源。OpenAI和Anthropic的条款虽然同样严苛,但至少没有直接声称对输入输出的所有权。好在第三方服务商已经开始托管这个模型,用别家的接口就能绕开Z.ai的条款。
但问题还在:如果大家都是“条款宽泛派”,那Z.ai的条款有什么特别的?这是行业通病,还是Z.ai独有?
四组错位指向同一件事:发布时的数据和真实使用完全两码事
官方博客的任务是卖模型,用最好的条件展示“能做多好”。真实测试是另一回事——预算有限、显卡跑不动、任务比考试题复杂得多。不是谁在说谎,而是同一个数字放在不同场景里,本来就不一样。
57分在Artificial Analysis里叫“追平Opus 4.8”。但在你真实代码库里,它可能是“界面改得利索,但复杂规划直接卡死”。
$0.045在“限时五折”里叫“四十分之一”。但在你每个月固定花多少钱买Token的账单里,可能只是“比Claude订阅便宜点”。
“国产芯片跑通”在技术验证里叫“里程碑”。但在“付费用户等不起超时”的现实里,叫“还得再优化”。
一个模型同时给你看性能、价格、硬件适配三组数字时,最值得问的不是“谁的数字更好看”,而是:这个数字对谁有用?在什么情况下成立?
用过的开发者分成了三派:买、骂、等
试过这个模型的人,大致分成三拨。
第一拨觉得“这价格闭眼入”。拿它配合Kimi K3做文档、从零搭RPG Maker,项目没完但过程挺顺。做SwiftUI重构的也说“快得离谱”。他们的逻辑很简单:不是最好的,但这个价位没有更好的。
第二拨认定“刷榜刷出来的,根本没法用”。理由也直白:干了一周活一次都没采纳它改的代码;翻来覆去想同一个问题,有时候干脆不返回结果,宁可用回DeepSeek。如果便宜但活干不完,再便宜也没意义。
第三拨在等“半价结束再说”。他们认可这模型有本事,但不接受拿促销价画Pareto前沿图的做法,想等标准价格跑一段时间、流量稳下来再判断。
三种态度面对同一组数据。问题不在模型本身,而在于每个人的活不一样、每月花多少Token不一样、能忍多慢的速度也不一样。没有统一答案,只能自己算账。
三条能直接带走的建议
第一条,跑自己最烦人的任务,别看benchmark。官方的57分告诉你这模型“最好能好到什么程度”,但不代表你在真实代码里也能拿到57分。拿它干3到5个你平时最头疼的活,看它会不会翻车,再决定要不要换。
第二条,算自己的账,别信“四十分之一”。算清楚你每个月花多少Token——用API和用订阅哪个更划算。订阅有固定月费,适合用得多的。API用多少付多少,适合时多时少的。别被口号带走,先打开用量后台看一眼。
第三条,看生态,不看单点。GLM-5.3-Flash真正改变的不是“谁跑分最高”,而是三件事同时发生了:模型能做这么好、芯片可以这么便宜、开源可以这么开放。以后选模型,除了看分数,还要看它支持哪些跑模型的软件、有多少第三方服务商在托管、能不能在普通电脑上跑起来。这些事比单次跑分更能决定三个月后你还愿不愿意用它。
Ox Alpha这个名字没白起:它本身就是根探针
回到Ox Alpha。它为什么叫Alpha?因为测试本来就是用来找问题的。它是模型,也是探针。它探出了性能落差的边界、定价策略的弹性、国产芯片的真实水位。
这些问题都没有答案。但探针已经伸进去了。