2026六大AI芯片谁在裸泳:NVIDIA Google AMD Cerebras AWS Groq全拆解

# AI芯片选型大实话:B200六成算力在睡觉,这事厂商不会告诉你

2026年普林斯顿大学测了一组数据。NVIDIA最新的B200芯片,纸面算力比上一代翻了一倍,实际跑ResNet-50只快了85%,跑GPT-1.3B只快了55%。更扎心的是,在实际推理负载里,超过一半的算力单元是闲着的。你花两倍价钱买翻倍算力,结果拿到手有一半多的时间在等数据。这是芯片的问题,还是整个行业都在吹牛?

从2018年Hennessy和Patterson预言芯片架构要大爆发到现在,AI芯片确实炸了。NVIDIA、Google、AMD、Cerebras、AWS、Groq,各走各的路。但大家最后都撞上了同一堵墙——数据搬不动了。计算单元越做越快,数据从内存搬到计算单元的这条路,越走越窄。这才是今天所有AI芯片真正的麻烦。


NVIDIA:软件生态最熟,但硬件利用率最让人心虚

NVIDIA的做法是“什么活都能干”。你拿它的GPU搞AI训练、跑推理、渲染游戏、做科学计算,同一套编程模型全包了。这种灵活性的代价是硬件上要留很多“管理岗位”——调度器、缓存、寄存器,这些晶体管不干活,只负责安排别人干活。

B200的问题是,负责干活的张量核心翻倍了,但负责搬数据的通道没变宽。就好像厨房灶台多了一倍,但传菜的走道还是原来那么窄。普林斯顿团队发现,在做注意力计算的时候,真正算乘法的时间反而不是最长的,最长的是等数据从共享内存搬过来、等指数运算做完。这两个环节比矩阵乘法本身还慢25%到60%。张量核心翻倍了,它等数据的时间也跟着翻倍了。

学术界用FlashAttention-4这套新算法才把B200的利用率从行业平均的二三成拉到七成。但FlashAttention-4是2026年3月才发布的。在这之前买B200的人,烧了多久的钱在空转的晶体管上?NVIDIA的护城河从来不是硬件跑得最快,是用CUDA的人最多。全球几百万开发者只会这一套,换个平台得重新学。这才是你换不掉NVIDIA的真正原因,不是因为它最好,是因为你的人只会这个。


Google TPU:自产自销的印钞机,外人别想占便宜

Google走的是另一条路——这台机器只干一件事,就是算矩阵乘法。别的都不干,所以硬件上能把所有跟“灵活”沾边的东西都砍掉。没有缓存、没有线程调度器、没有乱序执行。所有调度工作交给编译器,编译器算好了每一步在哪,硬件就照着跑。硬件省下来的面积全堆乘法器。

Ironwood单芯片算力跟B200差不多,但Google从来不靠单芯片打天下。它的杀招是一个Pod里塞九千多颗芯片,用光学交换机把拓扑结构按工作量现场重组。训练和推理分成了两颗不同的芯片——TPU 8t管训练,TPU 8i管推理。因为训练和推理烧钱的节奏不一样,推理是每秒钟都在花钱,需求半年翻一倍,这个账得分开算。

但这套东西从头到尾就是给Google自己造的。你用的话得把你的模型改成XLA编译器喜欢的样子。Google工程师能做到,因为芯片和编译器是同一个人带的团队。你团队里的PyTorch工程师要切换到这套流程,代价是几个月的时间。TPU确实高效,但这个效率是“量身定制”的效率,不是“通用”的效率。


AMD:性价比能打,但热门算法跑起来比NVIDIA慢一截

AMD的策略是最朴素的——我给你更大的内存、更低的价格,你自己看值不值。

MI355X上跑Llama推理,每百万token成本两毛钱美金。H100是七毛六。B200是三十多美分。AMD比NVIDIA便宜四成。这省下来的钱是实实在在的。而且AMD的内存一直在加,从192GB到256GB再到288GB,每次都比同期的NVIDIA旗舰多那么一截。做推理的时候,大内存意味着你可以在更少的芯片上放下更大的模型。

但AMD的麻烦在于,它的计算单元从2012年到现在基本没改过结构。NVIDIA的张量核心从32个线程协同进化到单线程就能发射指令,越来越灵活。AMD的矩阵单元到现在还是64个线程绑在一起干活,这个单元算矩阵的时候,同一组线程不能同时干别的活。FlashAttention这类需要“一边算矩阵一边算softmax”的算法,NVIDIA硬件层面就支持流水线并行,AMD得靠程序员手工搭。结果就是FlashAttention-4到现在没有AMD的移植版本。热门新算法出来,AMD用户得等。这个等待的时间,如果你的团队要自己写,那省下来的硬件钱又搭进去了。


Cerebras:不切晶圆换来闪电速度,但一片晶圆只装得下44GB

别人造芯片是切蛋糕,一片晶圆切出几十颗芯片。Cerebras不切,整张晶圆就是一颗芯片。四万亿晶体管堆在300毫米的硅片上,每个核心自带48KB的SRAM,数据到了就算,算完了就传给下一个,中间没有任何等待。

代价是这片晶圆上只有44GB的存储。Llama 405B要拆到九到十片晶圆上才能装下。Cerebras的API定价比GPU云贵三到五倍,Llama 405B后来悄悄从API里下架了。2025年它86%的收入来自两家阿布扎比关联客户。一片CS-3售价两到三百万美金,你算算405B跑起来得烧多少。

SRAM的密度在5nm上只比7nm涨了10%。逻辑还在缩小,但存储单元不缩小了。整个AI芯片行业都在往低精度走——从FP32到FP16到FP8到FP4,每砍一半精度就能在同样面积上塞两倍计算单元。Cerebras砍不动,它还在用16位。一片晶圆的面积就是300毫米,这个天花板焊死了。Cerebras确实快,快得离谱。但它只适合那些“速度比价格重要一万倍”的场景。这是奢侈品,不是工业品。


AWS Trainium:云厂商自己的印钞机,外面的人不用操心

AWS造Trainium的逻辑跟Google一样——自己用,不对外卖。差别在于AWS的规模比Google大一个量级。

Trainium抄了TPU的作业:同样的脉动阵列、同样的编译器调度、同样的软件管理存储。AWS往里加了自己的东西——专门管芯片间通信的硬件单元,不占计算单元的周期。分布式训练里最耗时的all-reduce操作,别家得拿计算单元去跑通信,Trainium用专用硬件干。

Project Rainier在2025年底上线了五十万颗Trainium2。Anthropic的Claude跑在超过一百万颗Trainium上。AWS说Trainium2比Hopper-class GPU便宜三到四成。每一层硬件、网络、云服务都是自己的,这个利润率AWS自己定。

但软件生态还年轻。AWS的NKI(类似Triton的底层编程接口)2024年底还在beta。vLLM对Trainium的支持落后于NVIDIA。Anthropic得派自己的工程师进Annapurna写底层内核、往上修bug。Trainium在超大规默时确实能用,但在超大规默时你得自己带人去修。


Groq:把集群编译成交响乐,最后NVIDIA花两千亿买票

想象一条汽车流水线,零件每秒钟精确送到下一个工位,没有等待、没有返工。Groq就是这么干的。芯片上连缓存都没有,因为缓存意味着“可能命中也可能不命中”——这种不确定性被删掉了。编译器提前算好了每一个操作数在哪一个时钟周期出现在哪一个位置。跨芯片通信也提前排好了,整个集群没有交换机、每颗芯片自己就是路由器。

这换来了目前业界最低的单用户推理延迟。Artificial Analysis测到的数字是Cerebras和Groq在第一梯队,比GPU方案快两到三倍。但Groq的片上存储只有230MB。Llama 70B要摊到五百多颗芯片上。芯片便宜,但你要几百颗。SemiAnalysis的结论是Groq在“延迟最优”这个维度上赢了,在“吞吐量每美元”上比GPU差一个数量级。

2025年12月,NVIDIA花了两千亿美金拿到Groq技术授权,挖走了创始人Jonathan Ross和大部分团队。2026年3月这个技术重生了,以“NVIDIA Groq 3 LPX”的身份出现在Rubin NVL72旁边——GPUs跑注意力,LPUs跑前馈网络,各干各的。最追求确定性的架构,最后成了最追求灵活性的架构里的一个配角。


没有通吃的赢家,只有合不合适的场景

训练大模型。NVIDIA的CUDA生态最成熟,学术界新算法首发都在NVIDIA上。Google TPU只适合深度绑定Google的团队。AMD性价比高但得忍受热门算法晚到。AWS适合已经在AWS上跑业务的。Cerebras和Groq不适合训练。

高并发推理(大批量、成本敏感)。AMD的性价比最强,MI355X的每百万token成本比NVIDIA便宜四成。AWS Trainium在云上有定价优势。NVIDIA的软件成熟度抵消了一部分硬件差价。

极速推理(单用户延迟第一)。Cerebras和Groq独一档,比任何GPU方案快两到三倍。但你要为这个速度付三到五倍的溢价。

生态绑定。你团队里全是CUDA工程师,换平台的隐性成本(培训、重写、调试)可能比硬件差价还大。这是NVIDIA最大的护城河。


回到B200那个60%。

普林斯顿的数据说它超过一半算力在等数据。FlashAttention-4把利用率拉到七成,但这是学术界顶尖团队2026年3月才搞出来的。之前买B200的用户烧了多久的钱在空转上?这个问题NVIDIA没有回答。这个60%的数字至今悬在那里。下一次你批采购预算的时候,你到底是买算力,还是买能把算力喂饱的那群人?