2026年8月24日,英伟达宣布Groq 3 LPX推理加速器全面量产,Nebius成为首家部署该芯片的AI云服务商。每秒3400个输出token,4倍于对手的响应速度,AI智能体终于不用再让你等它慢慢“想”了。
2025年12月,英伟达花200亿美元从AI芯片创业公司Groq手里买下了一项技术授权。八个月后,这项技术变成了一台能每秒吐出3400个词的机器。
每秒3400个词是什么概念?你读这句话用了两秒钟,这台机器已经吐出了6800个词,这相当于把整篇《哈利·波特与魔法石》的第一章念完了。
这台机器叫Groq 3 LPX。它不是用来训练AI的,是用来让AI“开口说话”的。
事情没那么简单!
AI干活分两步:第一步是“看材料”,第二步是“写答案”。看材料的时候,AI要把几十万字的代码库、对话历史、文档说明全部吞进去,这叫“上下文处理”。写答案的时候,AI要一个字一个字往外蹦,这叫“token生成”。
传统GPU干两样活都行,但哪样都不是最快。这就好比让一个数学教授既当图书管理员又当代笔先生,翻书和写字都干,但都不够利索。
Groq 3 LPX只干一件事:写字。而且写得飞快。
为什么只干一件事反而更快?因为设计这台芯片的人把“记忆体”直接焊在了计算单元旁边。每个LPU芯片自带500MB的超高速SRAM内存,整个机架256个芯片加起来有128GB的片上内存。数据不用跑远路去别处取,就在手边。
这就怪了,128GB的内存放到今天连个手机都比不上,怎么就能跑得比谁都快?
答案藏在“带宽”两个字里。整个机架的SRAM带宽达到每秒40PB。40PB是什么概念?相当于每秒把整个美国国会图书馆的数字藏书搬空40遍。数据流动的速度,比数据本身的大小更重要。
Groq 3 LPX不是单独工作的。它趴在英伟达Vera Rubin NVL72超级计算机旁边,当个专职“写字工”。Vera Rubin的GPU负责“看材料”,把几万字的提示词、几十万行的代码库全部读完、理解透。然后Groq 3 LPX接过接力棒,一个字一个字往外蹦答案。
一个负责想,一个负责写。各干各的,谁也别拖谁的后腿。
Nebius成了第一个吃螃蟹的云服务商。这家AI云公司要把Groq 3 LPX装进自家的Nebius Token Factory推理平台。
Token Factory是什么?简单说就是一个“按字数收费”的AI模型超市。开发者不需要自己买服务器、装驱动、调参数,直接调用API就能让AI干活。Token Factory目前支持大约60个开源模型。现在好了,同样一个API调用,回来的答案速度快了四倍。
开发者不用改一行代码。这事儿听起来不大,其实是关键:过去每次换新硬件就得重写整个软件栈,这次不用。
那么,快到什么程度?
第三方评测机构Artificial Analysis跑了个测试:用Gemma 4 31B这个开源模型,给AI塞进10万token的上下文(大概相当于7万个中文字,一本中篇小说的量),Groq 3 LPX每秒吐出了3400个输出token。这是该模型有史以来跑出的最快纪录。英伟达说这比最接近的对手快了四倍。
四倍是什么概念?一个需要跑十分钟的多步骤智能体任务,现在两分半钟完事。
但这有个前提:对手的数据来自公开的生产环境,而Groq 3 LPX的数据来自英伟达自己的预发布测试端点。实验室数据和真实世界数据之间,永远隔着一道沟。
Nebius拿到Groq 3 LPX之后,等于在自己的AI工厂里同时跑两条流水线:Vera Rubin的GPU负责重体力活,即上下文处理和大规模计算;Groq 3 LPX负责轻快活,即低延迟的token生成。两条流水线共享同一套API接口、同一个操作界面。
这种“分工不分家”的设计,背后是英伟达下的一盘大棋。
过去十年,英伟达靠卖GPU成了AI硬件之王。但推理这件事,即让训练好的模型真正去干活,一直不是GPU最擅长的领域。2025年12月,英伟达花200亿美元从Groq手里买下推理技术授权。Groq是一家专门做推理芯片的创业公司,被行业看作英伟达的潜在挑战者。英伟达没把对手打死,而是花了三倍于对手估值的价钱,把人家的技术和团队一起“请”了进来。
Groq的创始人Jonathan Ross,前谷歌工程师,参与过谷歌早期AI芯片开发,带着核心团队加入了英伟达。Groq的云服务继续独立运营。而Groq自己的推理云也将成为Groq 3 LPX最早的一批用户之一。
这笔交易的大背景是AI行业的底层逻辑正在改变。
过去大家比拼的是“谁能训练出更大的模型”,这需要更强的算力、更多的GPU、更大的集群。现在模型越做越大,但真正让模型产生商业价值的环节变成了“推理”,让模型去干活、去回答问题、去写代码、去调用工具。推理的速度直接决定了用户体验、决定了成本、决定了能不能大规模商业化。
黄仁勋在今年3月说过一句话:推理是AI的增长引擎。Groq 3 LPX就是英伟达给这个增长引擎装的涡轮增压器。
但这事儿有个反常识的地方。
推理加速器不是什么新东西。市面上已经有一堆公司在做,Cerebras、AMD都在推自己的低延迟推理方案。OpenAI新发布的Ultrafast模式用Cerebras的芯片跑到了每秒750个token。Groq 3 LPX跑到了每秒3400个,将近五倍。
差距这么大,为什么?
因为Groq 3 LPX不是单独造了一个更快的芯片,而是重新设计了整条流水线。传统推理芯片的思路是“把单个芯片做得更快”。Groq 3 LPX的思路是“把活儿拆开,让专门的芯片干专门的活”。
Vera Rubin的GPU负责“预填充”,把所有的上下文信息提前算好。Groq 3 LPX负责“解码”,一个字一个字往外吐。GPU算完了把结果交给LPX,LPX只管吐字,不管别的。这种“异构解码”的思路,让整个系统的效率上了一个台阶。
Nebius成为第一个吃螃蟹的人,不是偶然。
这家公司的前身是“俄版谷歌”Yandex的欧洲业务。2024年俄乌战争后,Yandex把欧洲业务剥离出来独立运营,改名Nebius。2026年第一季度,Nebius的AI云收入同比暴涨841%,达到3.9亿美元。第二季度继续飙到5.75亿美元,同比增长514%。全年营收预计30亿到34亿美元。
一家从战火中剥离出来的公司,正在AI云市场里狂奔。
Nebius的CEO Roman Chernin说了一句话:“你游动,你才活着,我们必须不断前进。”拿到Groq 3 LPX,就是Nebius在“游动”的最新动作。
但这事儿还没完。
Groq 3 LPX的全面量产只是第一步。英伟达说这些机架今年晚些时候才会在Nebius正式上线。从“全面量产”到“真正可用”,中间还隔着部署、测试、调优、扩容,每一步都可能出岔子。
而且,3400个token每秒这个数字来自一个特定模型、特定上下文长度下的测试。换一个更大的模型、更长的上下文、更复杂的任务,这个数字还能不能保持?生产环境里的真实负载和实验室里的基准测试,从来不是一回事。
Nebius的CTO Danila Shtan说了一句话:“生成是推理中决定AI系统到底有多 responsive 的阶段,而这正是Groq 3 LPX要加速的东西。”话是这么说。但“到底有多responsive”,等今年晚些时候机架上电、开发者真正用起来、真实流量涌进来之后,答案才会揭晓。
每秒3400个词。实验室里跑出来了。现实世界里能不能跑出来?
这事还没完!