DeepSeek采购160000颗华为AI芯片:专攻推理不碰训练


DeepSeek下单16万颗华为昇腾芯片,专干推理不练模型!

2026年9月4日,彭博社爆出消息,DeepSeek打算在内蒙古乌兰察布的数据中心里,塞进至少16万颗华为昇腾950DT芯片。这笔订单总额大约25.6亿美元。如果真干成了,这就是目前已知规模最大的国产AI芯片集群。

但事情没那么简单。

DeepSeek目前训练大模型用的主力,还是英伟达的加速卡。它之前试过用华为芯片搞训练,最后又退回去了。现在下这么大一笔订单买华为芯片,干的却是推理的活儿——也就是跑已经训练好的模型,不是用来训练新模型。

这就怪了。

一家AI公司,花25.6亿美元买芯片,买回来不干最核心的训练,只干推理。这背后到底在算一笔什么账?

推理和训练,到底差在哪

先搞清楚推理和训练是两码事。

训练大模型,就像教一个小孩从零开始学知识。你得给他看海量的书、做海量的题,反复纠正他的错误,直到他建立起完整的知识体系。这个过程极其消耗算力,对芯片的并行计算能力、内存带宽、芯片间通信速度都有极高的要求。

推理就简单多了。模型已经训练好了,就像一个已经考上大学的人。你问他一个问题,他根据已有的知识给出答案。这个过程算力消耗小得多,对芯片的要求也低得多。

打个比方:训练是盖一栋摩天大楼,推理只是在大楼里开灯照明。

DeepSeek把16万颗华为芯片买回来只做推理,说明它认为华为芯片目前还撑不起训练的重活,但干推理这种轻活已经够用了。

华为昇腾950DT,到底什么水平

昇腾950DT是华为2026年第四季度才要推出的芯片。DT这两个字母,代表Decode & Training——解码和训练。华为设计这款芯片的时候,瞄准的本来就是训练场景。

规格上,950DT采用双Die统一内存架构,配备144GB HBM内存,内存访问带宽达到4TB/s,芯片间互联带宽2TB/s。这组数据放在全球市场上,大概能对标英伟达上一代Hopper架构的水平。

但注意一个关键信息:受高端存储等零部件短缺影响,华为2026年950DT的全年产量预计只有数十万颗。DeepSeek这一单就要吃掉16万颗,占了相当大比例。而且华为还要兼顾其他客户和少量海外出口订单,全部交付完这批货,乐观估计也要一年以上。

DeepSeek已经向北京方面请求协助,希望推动华为更快给它分配更多芯片。

为什么是内蒙古乌兰察布

DeepSeek选中乌兰察布,不是拍脑袋决定的。

2026年6月,DeepSeek刚完成首轮外部融资,募资超500亿元人民币(约74亿美元),投后估值突破500亿美元。拿到钱之后,它就把钱砸进了乌兰察布。

乌兰察布这个地方,以前以土豆出名。现在它有了新名片——算力。

截至2026年6月,乌兰察布数据中心已投运及规划容量合计约12.5GW。2026年上半年,内蒙古全区算力总规模达31.5万P,其中智算29.7万P,双双位居全国首位。

为什么是这里?三个原因。

第一,电便宜。乌兰察布的到户电价低至0.35元/度,只有北上广深的一半。一座1吉瓦级的数据中心全负荷运转时,消耗的电力大约相当于75万户家庭的用电量。电费差一点,总成本就差出天文数字。

第二,天气冷。乌兰察布年均气温只有4.3℃,数据中心每年有近10个月可以利用自然冷源制冷。散热是数据中心第二大能耗来源,这省下来的钱也不是小数目。

第三,离北京近。乌兰察布有2条直达北京的光缆,时延只有4.2毫秒。

算力跟着能源走,内蒙古正好踩在了这条逻辑线上。

16万颗芯片,到底多大

16万颗芯片放在一起,规模有多大?

做个对比。2024年,马斯克的xAI启用了10万颗芯片的运算集群。深圳2026年3月建成的智能算力集群,用的是1万颗昇腾芯片。美团6月宣布在5万卡国产算力集群上完成了模型训练。智谱建成了一座1吉瓦的数据中心,目前安装的国产加速卡大约1万张。

16万颗,比所有这些都大。DeepSeek如果成功部署,它的算力规模将开始接近西方科技公司 routinely 建造的大型数据中心。

但有一个前提:单颗芯片的性能得跟上。华为的昇腾芯片单颗性能被认为可以跟英伟达Hopper架构掰手腕。但Hopper已经是英伟达上一代的产品了,英伟达现在出货的主力是Blackwell,性能又上了一个台阶。

更扎心的一组数据:有报道称,4颗华为芯片的算力才能勉强对标1颗英伟达GPU。如果这个比例属实,16万颗华为芯片的总算力,大概只相当于4万颗英伟达GPU。

规模堆上去了,单颗性能的差距还在。

软件生态,被忽视的暗礁

芯片造出来只是第一步。要让芯片跑起来,还得有软件。

英伟达最大的护城河不是硬件,是CUDA——那个让开发者能在英伟达芯片上写程序的软件生态。十几年积累下来的代码库、工具链、开发者社区,不是一朝一夕能复制的。

华为有自研的CANN(华为昇腾AI计算架构)。DeepSeek和华为还在联合定义昇腾超节点,围绕长文本推理降低时延、提升吞吐、控制成本。

但软件生态的差距是结构性的。英伟达的芯片卖到全世界,全球的开发者都在给它写代码、修bug、做优化。华为的芯片主要在中国市场用,生态的丰富程度不在一个量级。

DeepSeek把16万颗华为芯片拿来只做推理,不碰训练,某种程度上也是在规避软件生态的短板——推理任务的软件栈相对成熟,对生态的依赖没那么深。

美国管制,双刃剑

美国对华AI芯片出口管制,是这件事最大的背景板。

英伟达的高端芯片,未经美国政府许可,大多不得销往中国。这直接导致中国企业买不到最好的英伟达产品,只能转向国产替代。

管制是一把双刃剑。它确实延缓了中国企业获取最先进算力的速度。但另一方面,它也硬生生逼出了一个国产芯片的市场。如果没有管制,中国企业会毫不犹豫地继续买英伟达——性能更好、生态更成熟、省心省力。管制把这些企业推向了华为,给了国产芯片一个宝贵的“被用起来”的机会。

DeepSeek这笔订单,就是这个逻辑的产物。

但有一个细节值得注意:DeepSeek虽然下了16万颗华为芯片的订单,但它训练大模型用的主力仍然是英伟达的芯片。甚至还有报道说,DeepSeek即将发布的新模型是用英伟达Blackwell芯片训练的,可能违反了美国出口管制。

这就形成一个吊诡的局面:一家中国AI公司,一边大张旗鼓地采购国产芯片搞推理,一边偷偷摸摸地用美国芯片搞训练。

价格战,算一笔经济账

DeepSeek为什么要花这么多钱自己建数据中心?

一个直接的原因是成本。

2026年4月,DeepSeek宣布V4-Pro模型API价格永久下调75%。输入缓存命中的价格降到0.025元/百万tokens。这个价格有多低?只有原来的四分之一。

DeepSeek自己承认:受限于高端算力,Pro的API服务吞吐十分有限,预计下半年昇腾950超节点批量上市后,Pro价格将大幅下调。

翻译成人话:我现在算力不够,服务能力跟不上,等华为的芯片大批量上来了,我还能再降价。

这就是DeepSeek的商业逻辑——用自建算力基础设施来降低运营成本,然后用低价格抢市场。OpenAI被DeepSeek逼得把模型定价砍了80%【引用内容中用户评论提及】。如果DeepSeek的算力成本继续降,价格战还有得打。

训练和推理,两条腿走路

DeepSeek现在的策略很清晰:训练用英伟达,推理用华为。

训练是AI公司的核心技术能力,决定了模型的质量上限。推理是AI公司的日常运营成本,决定了能不能赚钱。DeepSeek把最关键的训练押在英伟达身上,把最烧钱的推理交给华为来扛。

这个策略有两个好处。

第一,规避风险。如果哪天美国进一步收紧管制,连推理芯片都不让卖了,DeepSeek至少还有华为的芯片可以顶上——虽然性能差一点,但至少能干活。

第二,降低成本。推理是持续性的支出,用户问一个问题就要花一次算力。用华为芯片做推理,单价便宜,长期看能省下巨额成本。

但这也暴露了一个问题:DeepSeek对英伟达的依赖并没有真正解除。训练这个环节,它还是离不开英伟达。

华为的产能,最大的变量

这笔订单能不能按期交付,最大的变量不在DeepSeek,在华为。

华为2026年计划生产大约160万颗昇腾裸片,这些裸片大致可以支撑约60万颗910C芯片和部分其他型号。950DT只是其中的一个型号,全年产量被限制在数十万颗的低段水平。

DeepSeek一单就要16万颗,占掉了相当大的产能份额。而且华为还得照顾其他客户——美团、智谱、各大云厂商,谁都在抢国产芯片。

更麻烦的是高端存储等关键零组件的短缺。这些零部件全球供应链紧张,华为自己也解决不了。

全部交付完这批货,业内预测至少需要一年以上。一年时间,在AI这个行当里,足够技术迭代两轮了。

一个未解的悬念

DeepSeek和华为都没有对这件事公开置评。

彭博社的报道援引的是“知情人士”,不是官方公告。订单到底签没签、签了多少、什么时候交付,都还是未知数。

但有一件事是确定的:DeepSeek在乌兰察布的数据中心已经在推进了。2026年8月,DeepSeek官网挂出了IDC数据中心团队的招聘信息,岗位涵盖电气、暖通、自动化、能源、土木等专业。

不管华为的芯片什么时候到,这个数据中心迟早要建起来。

问题只剩下一个:等它建好的时候,里面装的会是16万颗华为芯片,还是别的什么东西?