Grok 4.6刚上线,Grok 4.7已经在路上。马斯克给所有人剧透了一场更狠的操作:把SpaceX从创立第一天到现在的所有内部数据——包括Slack聊天记录、Jira工单、GitHub代码库、ERP财务系统——全部塞进Grok 4.7的肚子里进行补充训练。这哪里是升级模型,这是在用一家商业航天巨头二十多年的真实作战经验,喂出一个有实战手感的数字生命体。
2.1万亿参数加火箭数据,这套组合没有先例
Grok 4.7的参数规模飙到2.1万亿。这个数字单独拎出来,是堆料。但配上SpaceX全量数据集进行补充训练,就变成了两个维度的护城河叠加。
参数规模决定了模型的上限有多高,这是理论天花板。训练数据的质量决定了模型能真实触及到多高的天花板,这是实际落地。绝大多数模型死在“实际离上限隔着一光年”,根源就是喂进去的数据太水。
Grok 4.7吃的这套数据,如果说规模,它不算最大。但如果说“高密度有效信息”的含量,它可能是大模型历史上最奢侈的一顿饭。
外界关注的是“火箭数据”那层光环。比如猛禽发动机的燃烧室压力数据、梅林发动机的多次点火记录、星舰再入大气层时的遥测参数。这些东西固然是技术瑰宝,但美国国际武器贸易条例的管制范围划了一条明确的红线:涉及国防和航天硬件的核心技术预计不会纳入训练数据集。
那能喂给模型的到底是什么?
是可以推而广之的工程方法论。是一套把天马行空的物理构想变成可量产硬件的过程记录。是如何在炸了十几个原型之后仍然能保持迭代节奏的项目管理心法。是一个几千人团队在极端时间压力下协同作战的组织行为学样本。
把这些数据拆碎,再和代码库、工单、邮件混在一起喂给模型,Grok 4.7学到的是一种“在真实物理约束下解决问题的直觉”。这是任何公开论文和教科书都给不了的。
4.6已经上桌开吃,4.7在厨房里加火箭燃料
Grok 4.6在8月12日正式发布,当天就上了战场。SpaceXAI把它接入了Cursor、Grok Build、OpenRouter、Vercel和Cloudflare,开发者可以立刻上手开干。
有一个容易被忽略的细节:Grok 4.6不止上线了,还以一个第三方开发的开源插件形式,免费进入了VS Code、Antigravity和Cursor的插件市场,已经装了超过6万次。
这意味着什么?意味着全球数万名开发者,在毫无感知的情况下,已经多了一个可以免费调用的工程级大脑。这个大脑在Artificial Analysis Intelligence Index里拿了61分,和OpenAI的GPT-5.6 Sol Max打平,仅次于Anthropic的Claude Fable 5 Max的62分。
在编程和智能体任务上,Grok 4.6的DeepSWE v1.1基准测试得分从Grok 4.5的54%跳到了65.9%。APEX-Agents智能体基准从47.1%涨到57.5%,比GPT-5.6 Sol Max还高了一小截。
但最扎眼的是价格。Grok 4.6的API定价是每百万输入token两美元,每百万输出token六美元。这个价格大约是OpenAI和Anthropic同级模型的一半。用投资机构Atreides Management首席投资官Gavin Baker的话说:Grok 4.6的性能大致相当于Claude Fable 5 Max,但输入token价格低80%,输出token价格低88%。
便宜,快,而且能吃下五十万token的上下文窗口。光是这三点,就足够让依赖token计费的开发者群体心里算一笔很清楚的账了。
当一个模型吃过真实的苦头,它的回答里会带着伤疤
开发者们的实测反馈已经开始涌出来了。有人说用Grok 4.6做Minecraft模组开发,3D建模能力超出预期。有人说让它“做个小游戏”,Grok 4.6自己琢磨出了一个可玩的Candy World。还有人拿它跑Blender的3D建模,从建模、贴图到骨骼绑定再到动画,全流程一气呵成。
一个有趣的问题是,Grok 4.7经过那套火箭数据洗礼后,到底会变成什么样。
一个没吃过苦的模型,回答“火箭发动机燃料泵故障如何排查”这个问题时,会从流体力学方程开始推导,给出一个实验室条件下完全正确的诊断流程。
一个吃过SpaceX苦头的模型,可能会在第三行就建议检查某批次的轴承加工公差,因为在真实的Jira工单历史里,某次发射推迟就是因为供应商交付的零件超差了0.01毫米。
这种差距,在标准基准测试里根本测不出来。标准测试集问的是“知识有没有”,而真实世界里问的是“手感对不对”。SpaceX这二十多年积攒下来的数据,本质上就是一部用失败和爆炸写成的“反常识操作手册”。
大模型行业一直面临一个困境:模型的推理能力再强,缺乏真实世界的“负样本”数据,就永远只能当参谋,当不了一线指挥官。绝大多数公司不舍得把自己的内部运营数据喂给通用模型,那等于把家底抖给别人看。但马斯克这套玩法是自己造模型,自己喂数据,自己用。数据飞轮的闭环,从第一天就锁死了。
把火箭公司的内部管理流程喂给AI,等于给了它一个行业直觉
那段推文回复里有一个扎心的追问:Grok 4.7吃的“SpaceX公司数据”到底包不包括Slack、邮件、Jira、GitHub、ERP和CRM。
这些词单独拎出来,每一个都是企业信息化的标准组件。但把它们拼在一起,就构成了一家企业从战略决策到执行落地的完整毛细血管。
Slack和邮件,承载的是日常沟通和危机时刻的快速决策。Jira记录的是每一个任务的分解、流转和阻塞。GitHub代码库是这个世界上最高难度的实时嵌入式系统和飞行控制软件的诞生地。ERP和CRM锁住了供应链的每一个螺丝钉和客户名单的每一次变更。
把这一整套数据灌进大模型,模型学到的不再是“火箭发动机的原理是什么”,而是“在预算超支和发射窗口双重挤压下,SpaceX的工程师是怎么在Jira里拆解猛禽发动机的故障归零流程的”。
这种数据训练出来的模型,回答一个技术问题时,思考路径里会带着真实工业界的约束条件。它不再是个坐而论道的清谈客,而是一个上过战场的老兵。
这场实验的真正价值,不在火箭,而在重新定义数据资产
这个操作给所有人上了一课:企业数据资产的终极形态,不是报表,不是仪表盘,而是一个能听懂业务、理解上下文、带着组织记忆进行推理的数字执行官。
过去企业搞数字化转型,核心动作是“把线下流程搬到线上”。数据被记录、被存储、被展示,但数据的价值止步于“被看见”。决策还得靠人的经验和直觉来下判断。
如果Grok 4.7的这条路走通了,企业数字化转型的下半场就变成了“把线上数据喂给一个懂业务的模型,让模型辅助判断”。这时候,每一封邮件、每一张工单、每一行代码,都不再是躺在数据库里的历史记录,而是模型下一次推理时的上下文锚点。
那些嚷嚷着“AI取代人类”的论调可以歇一歇了。真实情况是,拥有高质量私域数据的企业,可以用AI把自己的组织能力复制一万份。Grok 4.7接收的这套训练,本质上是在把SpaceX的工程直觉和决策节奏,编码成一种可以被高频调用的数字资产。
这套资产不对外出售,不开放API,只服务于SpaceX和xAI自己的业务闭环。
Grok 4.6已经证明了“用一半价钱拿到前沿性能”这条路的可能性。而Grok 4.7要做的,是用一家把火箭送上天的公司的全部家底,重新定义什么叫“懂行”。
Grok 4.6 仍然是一个拥有 1.5 万亿个参数的模型,其规模与许多规模更大的模型相当,在某些方面甚至更胜一筹。换句话说,Grok 4.6 的表现远超其自身规模。Grok 4.7 及以后的模型规模将会更大。
彩蛋:Grok 4.6 已作为免费的 VS Code、Antigravity 和 Cursor 扩展程序提供(开源,与本公司无任何关联)。安装量超过 6 万次。
打开 VSX: https://open-vsx.org/extension/PawelHuryn/grok-vscode-phuryn
VS Code 应用市场: https://marketplace.visualstudio.com/items?itemName=PawelHuryn.grok-vscode-phuryn