AMD买taalas把模型刻进硅片:推理速度干掉英伟达48倍


AMD买了个能把AI模型刻进芯片里的公司,每秒能吐一万七千个词,但代价是你得跟这个模型过一辈子。

芯片巨头AMD最近干了一件事,买下了一家叫Taalas的初创公司。这家公司的技术听起来像科幻片,他们不搞内存存数据那套,而是把AI模型直接刻在硅片上。结果就是推理速度快到离谱,每秒能跑将近一万七千个token。但这背后藏着一个巨坑,一旦芯片造好,你想换个新模型?对不起,得重新刻,就跟纹身洗不掉似的。

把AI模型刻进硅片,这不叫芯片这叫“AI纹身”

咱们得先搞清楚现在AI芯片圈都在卷什么。现在大家用的GPU,不管是英伟达的H100还是AMD自己的MI系列,干的事儿都差不多,就是把模型参数存在显存里,然后每次推理的时候再调到计算单元里去算。这个来回调用的过程就像你去图书馆找书,书架远不远、书多不多直接决定了你找书的速度。所以现在的芯片厂都在拼带宽,拼内存大小,拼数据传输有多快。

但Taalas这家公司直接掀桌子了。他们想的是,既然每次都要找书,为什么不让书就在手边上?他们的做法是把模型权重直接固化到芯片的逻辑电路里,用物理走线来表示那个数值。这玩意儿叫MSIC,模型专用集成电路。你拿到这块芯片,它生下来就只认识那一个模型,比如它生下来就只认Llama 3.1 8B这个模型,别的它啥也干不了。

这操作像什么呢?就像你把期末考试所有答案都纹在手上了,考试时候看一眼就写,速度肯定比别人翻书快。但副作用是,你纹了数学答案就考不了英语,想换科目得重新纹。Taalas第一代测试芯片HC1,用台积电6纳米工艺造出来,跑Llama 3.1 8B的时候测出每秒16960个token的生成速度。去年这数据公布的时候,比英伟达的GPU快了48倍,比专门做AI加速的Cerebras也快了8.5倍。这差距已经不是什么弯道超车了,这简直是换个赛道重新跑。

不过注意一个细节,这里面提到的Llama 3.1是2024年中的模型,在AI圈已经是老古董了,但这芯片本来就是用来证明概念能跑通。这个每秒一万七千token是什么概念?你打一段话的功夫,它能写出一整本《三体》。这速度带来的直接后果是,AI的响应时间会从“等几秒”变成“你还没说完它就回了”,彻底改变你使用AI的体感。

跑得快有啥用,你跟这AI绑定一辈子

上面说了Taalas的技术能让推理速度快到飞起,接下来就得聊聊这背后的坑了。这个坑大到什么程度呢?大到可能只有那几个头部玩家才玩得起。

问题的核心是,一旦你决定用Taalas的芯片跑某个模型,你就被锁死了。任何超过LoRA适配器级别的改动,比如模型换了新版本,或者你想换个别的模型,都得重新流片。流片这词可能有点陌生,简单说就是把芯片设计送到晶圆厂去生产,这玩意儿成本极高,时间极长。重新流片一次,少说几百万美元,工期几个月到半年不等。

要知道现在AI圈卷成什么样子了。咱们处在AI爆发期,新模型几乎每个月都在往外冒。上个月刚刷榜的模型,下个月可能就被新出来的按在地上摩擦。用Taalas的方案就意味着,你得赌你选的那个模型在未来很长一段时间内都是最优解。这跟赌博没啥区别。赌赢了,你收获一个速度怪兽。赌输了,你手里就是一块昂贵的砖头。

不过这公司也给自己找了台阶下。他们说换模型不需要从头设计整个芯片,只要改两层金属层的布线就行,成本低很多,时间也短。但问题是谁来承担这笔成本?如果模型三个月迭代一版,你一年要改四次,那这个改版费算下来可能比你买一块GPU还贵。这技术就像你买了一辆只能加特定品牌特定标号汽油的车,一旦那个汽油停产了,你车就趴窝了。

原文里还提到一个细节,Taalas的芯片分为两大块,一块是存储模型权重的掩模ROM区域,一块是存KV缓存和微调适配器的SRAM区域。这个设计很有意思,说明他们其实知道模型可能会微调,所以留了那么一小块可以擦写的地方。但你也就只能微调一下,大改门都没有。

大厂玩得起,小厂玩不起,这买卖本来就不是卖给普通人的

说了速度,说了绑定,最后咱们来看看这技术到底给谁用的。根据原文透露的信息和逻辑推演,这套东西压根就不是卖给普通企业的,它的目标用户非常明确。

AMD买下Taalas之后,大概率会把它的芯片跟自家的Instinct加速器搭配使用。原文提到两种可能的部署方式,一种是把算得慢的提示词处理放在GPU上,把生成token的活儿丢给Taalas的芯片。另一种是客户先在Instinct上验证和调试模型,等确定下来这个模型就是最终版本了,再迁移到Taalas的专用芯片上去跑。两种方式本质都指向同一件事:这东西是量产用的,不是开发用的。

你想啊,OpenAI、Anthropic、Meta这些公司本来就是AMD的大客户,都在用AMD的Instinct系列GPU。这些头部模型开发商的特点是,他们自己训练出来的模型,权重是固定的,他们知道自己要什么。如果他们决定把某个版本的模型固化成专用芯片,那意味着他们的推理成本会断崖式下降。原文里提到,Taalas公司表示把模型权重刻进硅片的成本比训练一个大模型要便宜100倍。那对于这些每年花几十亿美金烧算力的公司来说,花几百万美金流个片把推理成本降下来,这笔账算得过来。

还有一个更深的层面,这技术可能会改变模型开发的玩法。现在为了让AI别胡说八道,开发者会用一个叫“测试时缩放”的技术,简单说就是让模型回答问题之前多“想”一会儿。但多想想意味着多消耗token,意味着更慢更贵。如果AMD的Taalas能把每个token的成本打到骨折,把生成速度提上去十几二十倍,那开发者就敢让模型想得更久,用更复杂的推理链条来换取更高的准确率。所以这技术不光是在硬件上跟英伟达竞争,它可能改变AI应用开发的成本结构,让更聪明的AI变得更便宜。

但要实现这个愿景,得有一个条件,就是你得舍得为特定模型下重注。这并不是所有人都能做到的。初创公司玩不起这套,小公司也玩不起,只有那些模型固定、流量巨大、对推理成本极度敏感的大规模服务商,才是Taalas技术的真正买单者。

说到底,AMD这步棋走的不是通用市场,它走的是细分赛道。英伟达卖的是万能瑞士军刀,AMD想卖的是定制菜刀,功能单一但切菜飞快。这两种思路谁对谁错不好说,但有一点可以确定,以后AI芯片的发展方向会越来越分化,通用和专用两条腿会越走越远。

买了个芯片公司看起来是买技术,实际上是买了一个关于“固定”和“灵活”的未来赌注。AMD赌的是,当AI模型大到一定程度以后,厂商会为了那十倍的速度提升而接受被绑定的代价。这个代价值不值,就看你的业务是三个月变一次还是三年变一次。

文章开头提到纹在手上的答案,但比纹身更残酷的是,这个“AI纹身”印上去就洗不掉。那些每秒一万七千个token背后的代价,是一场关于绑定和自由的认知博弈。你知道最讽刺的是什么吗?AI圈拼命想让模型变聪明,但最终让它跑得飞快的,恰恰是一个不那么聪明的笨办法。

The demo: https://chatjimmy.ai/



网友灌水


整体氛围:对技术速度感到震撼,同时围绕“固化模型”的商业逻辑、安全风险和技术替代性展开了激烈辩论。



1. 速度体验:真的有被爽到

网友们对 Taalas 的演示速度反应强烈。有人直接甩出 demo 链接,评论区瞬间变成“真香”现场——“这东西快得离谱”“感觉像魔法”。但也有人调侃说,演示用的模型太小了,而且它自己都不信自己跑在专用芯片上,跟用户犟嘴。

2. 技术硬核对比:AMD 自己家就能干

最扎心的评论来自一位硬件工程师。他表示 AMD 根本不用花钱收购,因为自己已经用 AMD 自家的 Xilinx Kria K26 开发板实现了同样的思路——把权重固化到 SRAM 里,绕开内存带宽瓶颈。他用 316 万参数的小模型跑出了单流每秒 1.9 万 token 的速度。言下之意:思路不新鲜,关键看谁能把大模型规模化。

3. 商业模式脑洞:AI 卡带时代来了

多位网友提出了一个复古又性感的设想——未来 AI 模型会像任天堂游戏卡带一样插在服务器上。想要哪个模型就买对应的物理芯片,升级模型就得换“卡带”。这个类比让复杂的技术一下子变得好懂,但也引出了下一个争议。

4. 核心争议点:权重放芯片上安全吗?

有人立刻提出灵魂拷问:如果模型权重被刻在物理芯片上,那有设备的人是不是可以直接把权重“抠”出来逆向工程?不过很快有人反驳,说大模型权重本身是 TB 级的,芯片里根本存不下,Taalas 只是把特定计算核固化,权重还是得从外部读取。还有人补刀:那些闭源厂商本来就不分享权重,跟芯片形态无关。

5. 对 AMD 收购的怀疑:为时过早还是及时卡位?

一部分网友觉得可惜,说还没来得及看到 Taalas 独立发布产品就被大厂吞了,担心技术最终被雪藏。另一部分人则认为这是双赢,小团队的技术终于有资金和产线落地。但最尖锐的批评是,SOTA 模型还在每月迭代,现在流片做固化等于赌一个模型能火半年,而赌错的代价是几百万美元和几个月的等待。

6. 中国开源模型的特殊机会

评论区有人指出,美国闭源模型的技术细节不公开,没法预判架构是否稳定,但中国的 DeepSeek、Qwen 等开源模型透明度高,架构迭代路径清晰,反而更适合这种“刻入硅片”的制造模式。