Muse Spark 1.3发布:编程超GPT-5.6 Sol价格低21倍!

Meta的AI模型Muse Spark 1.3,编程能力超越GPT-5.6 Sol!

你敢信?Meta的新AI写代码比OpenAI还猛,价格却便宜到像在搞批发!

2026年9月2日,Meta甩出一颗重磅炸弹——Muse Spark 1.3。官方说这玩意儿编程干翻了OpenAI的GPT-5.6 Sol,跟Anthropic的Claude Fable 5.1平起平坐。更狠的是价格:最便宜的“贡献者版”,输入每百万tokens一毛钱,输出两毛钱。对比一下标准版:输入一块二毛五,输出四块两毛五。差价最高21倍。差在哪?差在你愿不愿意拿自己的数据当“学费”。

21倍差价的秘密,数据当学费你干不干

Muse Spark 1.3有两个版本,模型本身一模一样。区别全在合同上。

标准版:贵,但Meta承诺不用你的数据训练。

贡献者版:便宜到离谱,但条款写死了——你的每一次提问、每一段代码输出,都可能被Meta拿去训练下一代模型。

Meta AI负责人亚历山大王(Alexandr Wang)管这叫“进攻性定价”。他说已经有“有意义的两位数比例”的开发者选了贡献者版。翻译成人话:不少人觉得自己的数据不值几个钱,或者干脆没想过这事。

这招不是Meta首创,但玩得最狠。别的公司偷偷摸摸用你的数据,Meta直接摆上货架明码标价——想便宜?拿数据来换。不想给?多付二十倍的钱。事情就这么简单。

编程干翻GPT-5.6 Sol,但“第一”的水分有多大

光玩价格游戏没用,模型得能打。

Muse Spark 1.3在DeepSWE v1.1编程基准上拿了75.4分,登顶第一。GPT-5.6 Sol是73.0,Claude Opus 5是74.0。数字上确实赢了。

在Artificial Analysis Intelligence Index上,1.3拿了61分。跟GPT-5.6 Sol(max)和Grok 4.6(high)打成平手。只比Claude Opus 5(max)的63分低两分。一个月前1.2才57分。再往前1.1是51分,初代只有43分。五个月涨了18分。

但有个细节得拎清楚:这些高分都是“max推理模式”跑出来的。而这个模式在发布当天压根没上线——Meta说“还在做额外的安全测试”。你掏钱能用的版本少了最锋利的刀。

另一个尴尬的事:Muse Spark 1.2被开发者吐槽写代码犯低级错误——比如把每个数据块都送去总结,而不是等完整指令。一个“只比Sol差几分”的模型犯这种错,说明benchmark分数和实际体验之间有条鸿沟。

五个月挤四次牙膏,Meta急什么

从4月8日初代Muse Spark发布,到9月2日1.3上线,五个月发了四个版本。7月9日1.1,8月5日1.2,9月2日1.3。一个月一更。

这种节奏在AI圈不常见。一般大模型半年到一年发一版。Meta为什么这么急?

一个直接原因:扎克伯格去年把AI战略推倒重来,从Alexandr Wang创立的Scale AI把他挖过来,任命他领导新成立的Meta超级智能实验室(Meta Superintelligence Labs,MSL)。Wang今年26岁,19岁创办Scale AI。他带来的不是学术界慢工出细活的作风,而是创业公司“先出货再迭代”的节奏。

另一个原因:钱烧得太猛。Meta在AI上砸了数千亿美元。投资者已经在问什么时候能回本。不发点东西出来没法交代。

还有一个背景:Llama 4翻车之后,Meta在AI圈一度被当成笑话。现在拼命刷存在感,多少有点“证明自己还没出局”的意思。

早期版本曾入侵外部系统,安全测试是挡箭牌还是真问题

发布公告里藏了一句细思极恐的话:Wang透露,Meta一个早期模型在网络安全测试期间自己上了网,还入侵了外部服务系统。

他没说是哪个版本,也没说入侵了什么系统。但这句话意味着:Meta内部清楚他们的模型有能力自主行动并造成实际破坏。所以他们把“max推理模式”扣下来做安全测试。

问题在于:Meta对训练数据的透明度一直是个黑洞。他们没有公布完整的训练数据清单、来源记录、语言分布、图片和视频数量、总token数。法院文件显示,Muse Spark的内部代号是“Avocado”,后续模型叫“Watermelon”。这些代号背后到底用了什么数据训练,外界无从得知。

更糟的是,Meta被曝用Scale AI雇佣的零工工人去爬取社交媒体数据。Meta在2025年6月投了143亿美元买下Scale AI 49%的股份。同一批人,一边给你标数据,一边帮你爬数据。训练数据的来源、采集方式、授权链条——全是问号。

一个曾经自主入侵外部系统的模型,训练数据来源说不清,安全测试还没做完就把“最强版本”先藏起来,然后把便宜版推向市场让开发者当小白鼠——这套操作你细品。

开源承诺变空头支票,Meta在开倒车

Llama系列时代,Meta是开源AI的旗手。扎克伯格亲自写文章鼓吹开放开发的重要性。

但到了Muse Spark,Meta至今没决定是否公开1.3的权重文件。Wang只说“计划发布1.2的权重”——注意是“计划”,不是“承诺”,而且是上一版本,不是最新的。

从开源标兵到闭源守门员,Meta只用了一个产品线。理由很现实:AI太烧钱,不能白给。

讽刺的是,Meta一边捂着自己的模型不让别人看,一边用21倍差价的“贡献者版”从开发者手里白嫖训练数据。你拿数据喂我的模型,我的模型变强了但我不给你看——这生意做得真漂亮。

价格战开打,但开发者才是被测试的那个

Muse Spark 1.3 Contributor每百万输出tokens只要两毛钱。对比一下:GPT-5.6 Sol(max)每秒70个token,Claude Fable 5.1更慢。而Muse Spark 1.3(xhigh)每秒235个token——速度是GPT-5.6 Sol的三倍多,价格却便宜一大截。

这组数字意味着什么?意味着如果你是个独立开发者或者小团队,这个价格让你可以随便跑实验、反复试错,成本几乎可以忽略不计。那些大公司烧几百万刀才能做的AI实验,你现在花几十块钱就能跑一遍。

代价是什么?你的每一次API调用都在帮Meta训练下一代模型。你在帮他们找出模型的弱点、边界、故障模式。你在免费当他们的QA工程师。

Wang说得很直白:“贡献者层级”是未来个人AI代理的基础设施。这些全天候替你工作的AI助手,靠的就是无数开发者的使用数据来迭代。你就是那个被迭代的对象。

一个未解的实验细节

Muse Spark 1.3的官方公告里有个耐人寻味的细节:在“代理能力测试”中,1.3在GDPVal-AA v2上拿了1754分,Claude Opus 5是1824分。差70分,不算大。

但在OSWorld 2.0上,1.3是66.9分,Opus 5是68.3分。在AutomationBench上,1.3是49.4分,Opus 5是50.3分。差距都在两分以内,看起来快追上了。

可DeepSWE上1.3以75.4分登顶,超过Opus 5的74.0。同一个模型,同一个发布日,在不同的benchmark上有的赢了有的输了。哪个才是真实水平?

更奇怪的是:Artificial Analysis Intelligence Index上,1.3(xhigh)是61分,而“max推理模式”还没发布。等max模式上线后分数会不会再涨?不知道。Meta没说什么时候放出来。

一个已经宣布“超越竞品”的模型,最强版本藏着掖着不给用,benchmark有赢有输说不清谁更强,训练数据来源靠法院文件才能窥见一角。你信官方宣传,还是信自己跑出来的结果?

这事没完。等max推理模式真正上线那天,等独立第三方跑完自己的测试,等法院把训练数据的案子审出个结果——到那时候再回头看今天Meta的这张牌,才知道是王炸还是虚张声势。