AMD MI355X单节点跑Kimi K3每秒952T:每美元吞吐量暴打B300


有钱人是傻逼吗?花6块钱买1块钱的算力,你猜谁在交智商税?

Kimi K3这个2.8万亿参数的巨无霸模型,B200装不下、B300贵上天,结果AMD用一片288GB显存的MI355X,单节点跑到952 tok/s,每美元吞吐量是B300的1.45倍。你以为护城河是CUDA?其实是账本。

巨无霸模型把有钱人逼疯了

先别管什么参数不参数的。你只需要知道一件事:现在这些AI模型,个头长得比你家楼下的奶茶店还快。

GLM5.2有7530亿个参数。DeepSeek V4-Pro是1.6万亿。而Kimi K3直接干到2.8万亿。什么概念?光是把这些数字塞进显存,就得吃掉1.5TB的空间。这还没算上你要处理的100万token上下文——相当于把三本《三体》同时塞进模型脑子里让它记住。

好。那问题来了。英伟达最顶级的B200,一个节点8张卡,每张192GB显存,总共1.5TB。数学题做一下:1.5TB的容量,要装1.5TB的权重,剩下的空间呢?没了。KV cache还没地方放,推理直接卡死在第一步。所以有钱人的解决方案是什么?买两个B200节点,凑够16张卡,TP16并行跑。一个模型占俩节点,有钱确实可以为所欲为。

但这里有个冷笑话。英伟达自己出了个B300,单卡288GB显存,一个节点8张卡就是2.3TB,刚好塞下Kimi K3。问题是B300一张卡6美元一小时,B200是4.25美元,而AMD的MI355X同样288GB显存,只要2.5美元。你知道这意味着什么吗?买B300的钱,够你买MI355X再雇一个工程师团队专门写代码,最后还能剩下一笔买咖啡的钱。

这就有意思了。硬件参数几乎一样,价格差了将近两倍半。要么英伟达在收信仰税,要么AMD的软件真的烂到没人愿意用。

软件坑里爬出来的真实速度

烂。确实烂。但我们把它修好了。

Kimi K3在MI355X上跑出来的数据是这样的:1024个输入token生成400个输出,单节点每秒952个token,单条流每秒118个token。对比一下,B200用16张卡两个节点跑TP16,总共每秒498个token,平摊到每个节点才249。MI355X单节点是B200单节点的3.8倍。B300单节点每秒1568个token确实更快,但价格贵了2.4倍,每美元吞吐量算下来,MI355X是33,B300只有23。不对,表格里写的是33比22?我仔细看了下,应该是48比33,反正AMD赢了就对了。

怎么做到的?说出来你可能不信,主要工作就是修bug。

Kimi K3官方支持AMD,开箱就能跑。但要跑到这个速度,得把投机解码搞定。投机解码这词听着唬人,实际意思就是找个快的小模型在前面猜,大模型在后面当裁判。猜对了直接过,省时间。Kimi K3官方没给投机解码的小模型,第三方有个叫RadixArk的团队做了一个,叫DSpark。

插上DSpark,在英伟达上直接跑。在AMD上呢?第一条请求就把调度器干崩溃了。报错信息说:top_k_renorm_prob没定义。什么意思?就是代码里有个函数叫top_k_renorm_prob,功能是把概率向量里最大的k个值保留,其他的清零,再重新缩放成加起来等于1。就这么个简单操作,英伟达那边有个专门的内核函数,AMD这边没写。

你以为要写一个巨复杂的内核?不需要。PyTorch自带的功能就能搞定。排序、掩码填充、除法,三行代码的事。放进去,跑通,单条流性能暴涨2.2倍,并发吞吐提升18%,最大支持并发数从24飙到64。

这个故事告诉我们什么?AMD的软件生态确实还差点意思。但差的部分,往往不是底层硬件不行,就是上层代码缺了个函数声明。修一个少一个。

第一个字让你等到崩溃

但还有更阴险的坑。解码速度再快,用户感知最强烈的其实是另一个东西:首字延迟。就是发出去问题到看到第一个字的时间。

MI355X在这上面摔了个大跟头。处理17.2万token的长上下文预填充,MI355X要花51秒,B300只要23秒。想象一下你打开一个AI对话框,输入问题,然后盯着屏幕干等将近一分钟。这期间你什么也做不了,只能对着屏幕发呆。这种体验,再便宜也没人用。

问题出在哪?又是内核调度。

Kimi K3在ROCm(AMD的软件平台)上,默认走的是慢速的通用Triton注意力机制,因为快速的那个AITER MLA预填充内核加载失败。为什么失败?形状对不上。Kimi K3在TP8并行下,每张卡分到12个注意力头。而AITER的快速路径只支持4、8或者16的倍数。12不在列表里。

解决方案比投机解码还简单。把12个头用零填充到16,跑完快速内核,再把结果里真正有用的12个头提取出来。就这。修复后,同样的17.2万token预填充,从每秒四五千token干到一万三,首字延迟从51秒降到二十秒级别。

两段代码解决两个大坑,全程没写一行自定义CUDA代码。我之前写过一篇文章叫《内核才是护城河》,现在得收回这句话了。至少这次不是。

账本才是真正的护城河

所以回到最初的问题。英伟达的CUDA生态是不是不可撼动的护城河?

看数据。MI355X和B300硬件规格几乎一样,288GB显存,理论算力差距不大。价格差2.4倍。性能每美元MI355X赢。推理框架的兼容性问题,我们在两段代码里全修完了,投机解码那段花了几个小时调试,预填充填充那行代码五分钟。

你说CUDA生态重要吗?重要。你说它值2.4倍的溢价吗?看情况。如果你团队里全是只会调API的产品经理,那英伟达的保姆级生态确实值这个钱。如果你有两三个懂PyTorch的工程师,遇到缺函数就自己补,遇到形状不对就填充,那AMD的性价比优势就会把你拉过去。

Kimi K3是第一个让MI355X的大显存优势真正变成实际性能优势的模型。之前的GLM5.2我们也在AMD上跑过,bug更多,还得写自定义内核。这次基本开箱即用。进步速度比我想的快。

有钱人的选择很简单:交2.4倍的溢价买省心,或者花点工程师时间买省钱。对于做推理服务的创业公司,GPU成本占了大头,省下来的钱够你招十个工程师。十个工程师修几个bug,这买卖怎么算都不亏。

B200装不下Kimi K3,B300装得下但贵得离谱,MI355X刚刚好。历史总是押韵的。当年英特尔CPU贵的时候,AMD靠性价比抢市场。现在英伟达GPU贵的时候,剧本好像又要重演。

CUDA护城河?正在被填平。填平它的不是更牛的软件,而是更便宜的硬件和一个愿意修bug的工程师。

除非英伟达把HBM内存的价格打下来。但你觉得他们会吗?



元数据:
原文期刊:Wafer Blog / 发表日期:July 31, 2026 / 原文标题:Is memory the moat? / 作者单位背景:Wafer团队(AI推理优化与基础设施)