Meta发Muse Code:常驻后台不失忆,巨仓自主规划写码验证全闭环

导语:程序员们,扎克伯格今天扔了个代码炸弹。你们以为又是套壳工具?这次是能在你电脑终端里连着干24小时不喘气的玩命智能体。

Meta刚刚放出Muse Code测试版,一个能在巨型代码仓库里自己规划改动、写代码、跑验证的终端智能体。背后的Muse Spark 1.2模型在英伟达Hopper上连续调用超过1000次工具,跑了整整一天还在不断挖出性能优化点。重点不是它能写代码,是它能像老员工一样记住你整个项目的来龙去脉,干到一半电脑崩了还能从断点接着来,一分钱活不白干。更狠的是定价门槛低到一行命令就能装,贡献者层级几乎白送。这不是又一个大厂玩具,这是要把终端命令行的活儿全包了。

智能体跟代码助手的区别就像正式工和临时工

你平时用的AI写代码工具,不管是ChatGPT还是Copilot,它们的工作模式基本就是问答。你问一句,它答一段。你复制粘贴,它再给你补一段。像个忙得脚不沾地的临时工,随叫随到,但每次来都得重新跟你确认一遍项目是干啥的。Muse Code不是这个路子。它是个一启动就赖在你终端里不走的智能体,整个会话期间一直在后台跑着专门的任务进程。你让它干一件事,它不是生成一段代码就完事,而是会持续跟踪整个代码仓库的状态。

这就好比临时工和正式工的区别。临时工每次来都要问厕所在哪、打印机怎么用、项目老大是谁。正式工第一天就摸清了所有门路,第二天来直接干活。Muse Code那个后台进程干的就是这事:在你整个操作过程中持续积累上下文,而不是每个新任务都从零开始瞎猜。这种持续性上下文积累机制,让它在处理大型代码库时能记住之前改过什么地方、踩过什么坑,不用每次都重新理解项目结构。

更夸张的是任务拆解能力。当接到一个足够大的任务时,它会自动把活儿分散到多个独立的子智能体上,这些子智能体在隔离的工作树里并行干活。打个比方,你让十个程序员分别在自己的电脑上改不同模块,最后再合并。但问题是,这十个智能体不用开会、不用扯皮、不会互相踩代码。这种并行任务调度系统,直接把大型软件工程的自动化程度往上拽了一大截。

24小时不眠不休跑一千次工具调用,人类早崩溃了

扎克伯格团队干了一件事:把Muse Spark 1.2指向一个内核优化任务,然后让它跑了24小时。注意,是连着24小时,在英伟达Hopper架构的加速器上执行了超过1000次工具调用。一般来说,AI模型在跑代码任务时有个通病:开头猛如虎,后面怂如鼠。探索完初始方案后就懒得动了,觉得差不多得了。但这个模型不是,它在初始探索阶段结束之后,还不断挖出更多性能优化空间。

这背后暴露了一个认知冲突:人类程序员干24小时早精神涣散了,AI模型按理说也会因为奖励机制衰减而偷懒。但Muse Spark 1.2显然在奖励建模上做了手脚,让探索行为本身变成一种持续的正向反馈。说白了,它不满足于找到一个及格方案,而是把找优化点当成打游戏刷分,越刷越起劲。

这里的核心机制是持续探索策略,区别于传统模型的一次性最优解搜索。一般模型倾向于快速收敛到一个局部最优就停手,因为继续探索的边际收益递减。但Muse Spark 1.2通过调整探索奖励函数,把持续性改进的权重拉高,导致它在24小时里不断进行状态空间搜索。你让它跑优化,它不会交个差不多的作业就糊弄你,而是像那种非要考满分的学霸,明明已经及格了还在那死磕附加题。这对于需要极致性能的场景,比如操作系统内核、数据库引擎、高频交易系统,简直是降维打击。

干到一半电脑崩了?审计日志让你原地满血复活

这可能是Muse Code最损的一招,也是传统AI编码工具最怕的事。你用其他工具写代码,写到一半断网了、崩溃了、忘了保存,不好意思,重头再跟AI聊一遍。你甚至说不清楚刚才聊到哪了。Muse Code的设计逻辑是:每执行一个动作之前,先把记录写进本地事件日志。模型调用、工具运行、代码编辑,全部先记后做。

这意味着什么?如果任务中途崩溃,它能直接从日志里恢复,精确到上一秒断掉的地方,不用重新写提示词、不用重新解释需求、不用把之前的对话历史再喂一遍。这种事件溯源机制在分布式系统里常见,但塞进一个终端编码智能体里,等于给你的AI程序员配了个无限容量的撤销重做硬盘。

审计追踪这个概念在AI领域一直被念叨,但真正落地到每一步操作都有日志记录的,Muse Code算头一个。这不仅是防崩溃,更是防甩锅。代码出了bug,到底是模型瞎写的,还是你指令没给对,翻日志一清二楚。对于企业级开发来说,可审计性比速度更重要。你的代码是怎么来的、每一步谁做的、为什么这么改,全链条可追溯,合规审查直接省掉一半口水仗。

再往深处想,这事有个冷笑点。以前只有人类程序员被审计,现在轮到AI了。你写代码要写注释,AI改代码要写日志。大家终于公平了。而且这个本地日志恢复机制等于变相鼓励你往大了搞任务,反正崩了能续上。以前你不敢让AI跑超过半小时的活儿,怕断。现在你大可以甩给它一个重构整个模块的需求,然后去睡一觉,第二天起来它还在干活,就算半夜电脑自动重启了,它也能从日志里爬起来继续搬砖。

便宜到离谱的定价,背后藏着Meta的阳谋

扎克伯格在推文里说了,一行命令安装,贡献者层级就能开搞。评论区有人实测,贡献者层级的Muse Spark 1.2比OpenAI的GPT-5.6 Luna还便宜。注意,不是差不多便宜,是更便宜。为什么Meta敢这么定价?因为人家根本不想靠这个直接挣钱。

这背后是典型的平台锁定策略。先把终端编码智能体这个品类做成白菜价,让开发者和企业快速迁移到Muse生态。你用得越顺手,积累的审计日志越多,项目上下文越厚,就越难切换到竞争对手的工具。因为切换成本不只是钱的问题,是整个项目记忆的丢失。Muse Code的本地事件日志格式是Meta自己定的,迁移出去等于把所有历史操作记录全废掉。

再加上评论区反复有人追问是不是开源,Meta一概不正面回答。这说明他们打的是闭源但低价这张牌。用极致性价比把市场占住,等竞品反应过来,开发者已经在Muse Code里存了半年的项目上下文,拔不出来了。更损的是,贡献者层级几乎是白送,但数据训练条款写得模棱两可。开发者用免费层级跑代码,等于在帮Meta做模型调优的众包测试。你以为是薅羊毛,结果自己成了羊。

而且你看评论区那股热乎劲,有人说扎克伯格重返赛场了,有人说这是在用AI替换80%的中层管理。但最扎心的评论是那条:未来说把这个任务交给智能体,就跟现在说交给Dinesh一样自然。Dinesh是那个组里最靠谱的程序员。以后组长分配任务,不再是喊人,而是喊智能体。人变成了调度资源的角色,而不是亲自写代码的角色。这个转变已经在一行命令就能安装的Muse Code里开始发酵了。

讽刺的是,就在昨天,扎克伯格还在承认Muse之前表现不行。今天直接甩出1.2版本,在内部基准测试里干翻了Grok 4.5。从承认失败到发布竞品碾压级更新,中间隔了不到一个月。这种迭代速度说明一个问题:Meta在AI编码这条赛道上的技术储备,远比它之前表现出来的要深。之前装死,可能是在憋大招。

总结

Meta发布Muse Code终端编码智能体,能在巨型代码仓库中自主规划、写码、验证,后台常驻进程持续积累上下文不重置。24小时连续执行超1000次工具调用仍能挖掘性能优化,崩溃后从本地事件日志原地恢复,任务可拆分给并行子智能体。

创新点:在AI软件工程自动化领域,直指大型代码库的智能体式开发运维,挑战传统AI代码助手的问答式工作流。

解决痛点:模型跑优化任务越久越来劲,24小时不衰减;定价便宜到近乎白送,但切换成本高到让你不敢走。

总结一下:Muse Code不只是个代码生成器,它是个在终端里常驻、持续记忆、并行干活、崩溃续传、全程留痕的软件工程智能体。它把AI写代码这件事从问答模式彻底掰成了项目驻场模式。当这东西便宜到一行命令就能装,程序员们该琢磨的不是它能不能取代你,而是你愿不愿意承认,未来分配任务的优先级顺序里,智能体排在你前面。

然而最有意思的是,评论区吵翻天了,却没人问终端智能体写完代码之后谁来背锅。审计日志是给人看的,但锅还是得人背。



原文期刊:X(Twitter)平台扎克伯格官方账号
发表日期:2026年8月6日
原文标题:Releasing Muse Code in beta today
作者单位背景:Meta(原Facebook)创始人兼CEO