OpenAI完成GPT-6预训练Bel底座! 自研芯片碾压英伟达

OpenAI偷偷造出10万亿参数怪物Bel,Jalapeño芯片让Nvidia坐了十年铁王座开始摇晃!

这是2026年8月最魔幻的一幕:OpenAI刚刚完成了一个代号"Bel"的预训练模型,参数超过10万亿,规模直追GPT-4.5。这个庞然大物将作为GPT-6的底座,甚至被内部认为可能成为世界上第一个"AGI阈值"级别的基座模型。

同一天,他们在Hot Chips会议上公布了自研推理芯片Jalapeño的首批测试结果——700瓦功耗干翻了Nvidia 1400瓦的旗舰产品,每千瓦吞吐量领先1.5到1.9倍。

一个拥有史上最强模型底座的公司,现在连造芯片的速度都超过了行业老大。而它的老对手Anthropic,一边在算力短缺里挣扎,一边却准备用一场可能打破历史纪录的千亿美元IPO杀进资本市场。这场AI竞赛的剧本,到底是谁写的?


十万亿参数是什么概念,你根本想象不到

先说说Bel到底有多大。

10万亿参数。这个数字意味着什么?GPT-4的参数规模大约是1.8万亿。Bel是它的五倍多。OpenAI此前的预训练底座"Spud"大约是4万亿参数的水平。Bel直接翻了2.5倍。

但真正的关键不在于参数本身,而在于一个反常识的事实。

预训练不是终点,它只是一个起点。有评论一针见血地指出,一旦你为一个10万亿参数的底座付了钱,就可以通过不同的后训练流程,把它不断变成GPT-6以及后续的一切。最昂贵的资产是那个基础底座本身。一旦拥有了它,后续的所有模型都是从这个底座上"长"出来的不同版本。竞争对手如果连这个底座都造不出来,差距只会越拉越大。

而OpenAI为了这个底座,已经等了两年多。自2024年5月GPT-4o发布以来,OpenAI再没有完成过一次完整的前沿预训练。中间经历了无数次中断的训练运行、安全相关的强化学习暂停、以及技术困难。Bel的完成,意味着那道困住OpenAI两年的"预训练墙"终于被推倒了。

但推倒这面墙只是第一步。


自己造芯片,用9个月干了别人几年的事

就在Bel传闻的同一天,OpenAI还公布了另一件事。

2026年8月25日,OpenAI在Hot Chips会议上详细披露了自研AI推理芯片Jalapeño的首批测试结果。这款芯片由OpenAI主导设计、博通代工,功耗仅700瓦,但在峰值吞吐量下每千瓦的AI工作量比对比系统高出1.5到1.9倍,端到端延迟降低了1.7到3.6倍。

更夸张的是,在高度交互的工作负载下,Jalapeño的性能提升了2.1到4.1倍。在DeepSeek R1模型上,单用户并发场景下达到了每秒超过700个token。在Kimi K2.5和GPT-OSS上,甚至跑出了接近每秒1400个token的速度。

但最让人震惊的不是这些数字,而是OpenAI是怎么做到的。

Jalapeño从设计到流片只用了9个月。准确地说,2024年中启动团队组建,2025年11月完成CoWoS设计流片,2026年8月就拿出A0步进工程样片的实测数据。从零开始搭建芯片团队到跑通全套推理基准测试,整个过程不到两年。作为对比,Meta和Microsoft的AI ASIC项目折腾了好几年还没落地。Google的TPU从第一代到真正大规模部署也花了更长时间。

OpenAI的秘诀是:用AI来设计AI芯片。他们自己的模型参与了芯片设计、验证和优化的全过程。据报道,AI辅助芯片设计在SIMD面积上减少了8%,在矩阵引擎面积上减少了10%。

更绝的是软件层面。OpenAI用自己内部版本的Codex来写Jalapeño的内核代码,每个内核的手工调优代码长达约3000行。从零开始搭建软件栈,却在极短时间内就把DeepSeek R1、Kimi K2.5和GPT-OSS跑了起来。团队展示了在不到8天时间内,Jalapeño从TP8配置扩展到TP32、从单系统扩展到全机架规模运行的进化速度。CUDA护城河可能真的要被端掉了。

这就形成了一个闭环:OpenAI用GPT系列模型设计出了Jalapeño芯片,Jalapeño芯片又用来更快更便宜地运行GPT系列模型。自己造武器,自己用武器造更好的武器。


3000行手写内核和那个叫Gluon的秘密武器

Jalapeño的软件栈有一个关键设计:它不依赖Nvidia的CUDA生态。

OpenAI为Jalapeño设计了一套叫Gluon的编程语言。Gluon基于Triton构建,保留了Triton的SPMD编程模型,但暴露了底层编程接口,包括直接对应PTX指令的API。最独特的是Gluon的"布局"抽象,它基于OpenAI自己发明的线性布局代数,能用数学工具精确描述硬件寄存器和张量元素之间的映射关系,并支持形式化验证的布局转换。

程序员用Gluon写出的每个内核是"持久化线程"模式,代码在芯片的多个tile上执行,工作的分配由程序员而不是硬件调度器来控制。这意味着他们可以精确控制数据预取、解耦乱序执行单元,甚至用信号量来同步预取数据的等待。

但真正让这套东西跑起来的是Codex。OpenAI的内部版本Codex已经能写出功能正确的、高效的Jalapeño内核。在DeepSeek R1的测试中,OpenAI的团队居然没有自己动手写MLA内核——他们让Codex直接生成了能用的版本。

每个内核约3000行代码,经过正确性检查和自定义消毒器验证。早期内核开发是人工辅助的,但随着内部版Codex的规模化部署,整个流程越来越自动化。OpenAI甚至打算把这个版本的Codex卖给企业客户。

这引出了一个更深层的问题。当模型自己能写芯片内核的时候,传统的芯片厂商引以为傲的"软件生态护城河"还有什么意义?OpenAI在Jalapeño上的实践表明,一个从零开始的软件栈,配合能写代码的AI模型,可以在极短时间内追平甚至超越积累多年的生态。


为什么要做一个不搞预解码分离的芯片

Jalapeño的架构设计有一个非常反主流的选择:它不做预填充-解码分离。

几乎所有现代GPU推理系统都在搞预填充-解码分离,把输入处理和输出生成分成两个独立的硬件池。但OpenAI认为这是一个错误的架构方向。

道理很简单。预填充和解码对硬件的压力模式不同。预填充阶段的算力需求大,解码阶段的内存带宽需求大。把两者分开,在理论上的确可以提高效率。但实际生产环境中,输入和输出序列长度、并发度、缓存命中率、延迟目标都在不断变化。一旦把设备分成预填充池和解码池,预填充需求太多时解码芯片空转,解码需求太多时预填充芯片空转。

你必须不断预测两者比例,不断重新平衡。而每一次重新平衡都意味着停机、迁移和浪费。

OpenAI选择了一个统一池架构,让每颗芯片都能处理任意类型的计算。为此,Jalapeño在架构上做了大量优化:超低延迟的内存子系统、简化的片上网络、去掉了GPU复杂的内存层次结构、用高速片上网络替代了GPU的复杂缓存一致性协议。

结果是:在Kim iK2.5上,Jalapeño单用户并发接近每秒700个token,是第二名性能的9倍以上。在GPT-OSS上,同等交互性下的吞吐量是GB200最高点的近两倍,在并发1的点上更是超过50倍。

OpenAI甚至给Jalapeño装了64位标量核心和FP32/INT32向量核心,能把Doom、流体力学模拟、鼠标拖拽可视化等通用程序跑起来。这根本不是一颗"专用推理芯片",这是一颗通用的AI计算芯片。


160千瓦的机架和那个叫Katsu/Vindaloo的散热系统

Jalapeño的野心不只是一颗芯片,而是一个完整的系统。

OpenAI设计了配套的机架系统。一个完整部署包含两个机架:一个CPU主机架叫"Katsu",一个ASIC机架叫"Vindaloo"。Katsu机架有16个主机托盘,每个托盘有两颗AMD EPYC CPU、1.5TB DRAM和400G前端网络。每个Katsu托盘通过8条外置PCIe DAC电缆连接到对应的Vindaloo托盘。

Vindaloo机架有16个ASIC托盘和8个交换托盘——6个用于本地域,2个用于全局域——后者被命名为"Chana"。每个Vindaloo托盘有8颗Jalapeño芯片,一个机架就是128颗。芯片之间通过背板铜缆直连,跟Nvidia的Oberon方案类似。

一个两机架系统功耗约160千瓦,跟一个双宽GB300机架差不多。但OpenAI可以用这种机架连接成更大的集群:本地域内128颗芯片全互联,全局域通过铜缆加光互连加光学电路交换,可以扩展到16个机架共2048颗芯片。

全局域走的是"rail-only"架构。每颗XPU有1.6Tb/s的全局带宽,通过背板上到全局交换托盘,再通过前面板的1.6T光模块经过无源光交换机出机架。整个集群的规模互联成本大约只占总系统成本的10%。

为什么要把扩展性做得这么好?因为未来的模型会更大。一旦Bel这种10万亿参数的底座跑起来,后续的后训练和推理需要的算力规模会远超今天。OpenAI在赌一件事:模型参数会继续增长到10万亿、20万亿,上下文窗口会到200万、400万token。到那时,能不能把2048颗芯片连成一个逻辑单元,就是能不能跑得动这些模型的分水岭。


算力是王,但王也有烦恼

Bel的训练需要消耗天文数字的算力。Jalapeño的部署需要时间——2026年底只能"非常小规模"部署,大规模部署要等到2027年。而在此之前,OpenAI还得继续向Nvidia采购GPU。

OpenAI把自己的IPO推迟到了2027年。而它的老对手Anthropic,正憋着一口气要在2026年年内冲上资本市场。目标估值2万亿美元,募资规模可能超过1000亿美元。如果成真,这将直接打破SpaceX此前创下的IPO纪录。

这就怪了。一个刚承认算力不够用的公司,现在要以上市公司身份面对公众股东。你是用"我们是AI领域的老大"这个故事去IPO,还是用"我们正在追赶但算力不够"这个故事?

有报道称,Anthropic在投资者推介时重点强调持续的营收增长能力,但投资者提出的关键质疑就是:你能不能获得足够的算力。算力增长一旦放缓,营收增长速度就会跟着往下掉。

而与此同时,OpenAI正在筹钱。The Information报道,OpenAI正在与潜在投资者谈判一轮大规模融资,目标是在2027年IPO之前建立足够的算力储备。OpenAI董事会成员曾透露,要维持前沿模型的研发节奏,未来几年可能需要筹集高达1000亿美元的资金。

但OpenAI有一个Nvidia没有的优势:他们不需要在芯片上赚钱。Jalapeño是用来降低自家推理成本的。Nvidia的芯片毛利率超过70%,Broadcom的代工毛利率虽然也不低,但OpenAI不需要把这个利润转嫁给客户。光是省下来的芯片采购成本,就足以支撑大规模部署。更别提Jalapeño的功耗只有700瓦,远低于Nvidia旗舰产品的1000瓦以上水平,同等算力下电费就能省一大截。

有分析认为,Jalapeño在每美元产出token数上已经和Vera Rubin打成平手。但注意,Jalapeño还没用推测解码——一旦加上,成本还会再降。而Vera Rubin的结果已经是带推测解码的数字了。


三个独立的故事,一个共同的赌局

现在把三条线并在一起看。

第一条线:Bel。一个10万亿参数的预训练底座,OpenAI等了两年多才做出来。它的意义不在于参数本身,而在于它证明了OpenAI的预训练能力没断档。有了这个底座,后续所有模型都在同一个起跑线上。

第二条线:Jalapeño。一颗用AI设计的芯片,9个月流片,700瓦功耗干翻1400瓦的对手。它的意义不在于比Nvidia快多少,而在于它证明了OpenAI可以不依赖任何人的硬件生态。自己造武器,自己用武器跑自己的模型,成本比所有人都低。

第三条线:Anthropic的IPO。一家承认算力不够的公司,准备在对手推出最强模型底座的同一年上市。估值2万亿美元,募资千亿美元。

这三条线之间有一个共同的赌局:谁能在算力竞赛中活到下一轮。

OpenAI的赌注是两条腿走路。一条腿是Bel这样的超大底座,保证模型能力不落后。另一条腿是Jalapeño这样的自研芯片,保证推理成本不失控。两条腿哪条断了都不行。但问题是,Jalapeño的大规模部署要等到2027年,而Bel的训练和后续推理需要的大量算力,在2026年下半年还得靠Nvidia。这中间有一个时间差。如果Anthropic在这个时间差里用IPO融到的钱疯狂采购算力,能不能追上来?

更复杂的是,OpenAI自己的IPO在2027年。而Bel加Jalapeño的组合,需要大量的前期投入。芯片流片要钱,部署要钱,训练Bel要钱。在IPO之前,这些钱从哪里来?

还有一个变量:Jalapeño的B0步进已经在工厂里了。相比A0步进,B0的每瓦性能提升约25%。A0步进的单芯片峰值算力是13.4 PFLOPs MXFP4,B0还会更高。如果B0的量产顺利,2027年大规模部署时的性能会比现在测试的数据更好。但如果B0出问题,整个计划就得往后推。


一个没人能回答的问题

回到最开始那个场景。

OpenAI手里攥着一个10万亿参数的Bel底座,一颗700瓦干翻1400瓦的Jalapeño芯片。他们的问题不是能不能做出最强的组合,而是能不能在算力、时间和资金的三重约束下,把这个组合完整地推向市场。

Anthropic手里有一个11天迭代一次的Fable/Mythos产品线,一个承认算力不够的CEO,一个即将到来的千亿美元IPO。他们的问题不是想不想赢,而是拿什么去赢。

2026年8月26日,这个问题的答案还在黑箱里。但有一件事是确定的:当Bel开始产出GPT-6、当Jalapeño大规模部署的那一天,整个AI行业的成本结构和竞争格局都会被彻底改写。

有一个细节值得反复琢磨。Jalapeño项目从启动到公布实测数据,用了大约26个月。如果你在2024年中问任何一个芯片行业的老兵,一颗全新架构的AI推理芯片从零开始、9个月流片、再用9个月出工程样片实测数据,他们会说不可能。但OpenAI做到了。用AI加速芯片设计这件事,从口号变成了现实。

而Bel的训练,从2024年5月GPT-4o发布到2026年8月完成,中间经历了无数次中断。如果你在2025年问OpenAI内部的人,Bel到底能不能做出来,可能没人敢打包票。但2026年8月,它真的跑完了。

这两件事加在一起,指向一个更大的判断:AI公司用AI来加速自身研发的闭环,已经真实地在运转了。芯片设计在用AI加速,内核代码用AI来写,模型的预训练和后训练也在用AI加速优化。每一个环节都在加速,而加速的工具就是上一轮产出的成果。

下一个问题就来了:如果这个闭环真的跑起来了,那其他没有这个闭环的公司,还有没有机会追上来?

2026年8月26日,没有人能回答这个问题。但有一件事是确定的:当Bel加Jalapeño的组合真正投入生产的那一天,整个AI行业的成本结构和竞争格局都会被彻底改写。而Anthropic的IPO招股书里,大概率不会写"我们预计对手的芯片比我们快两倍、成本比我们低一半"。


原文期刊:SemiAnalysis / 发表日期:2026年8月25日 / 原文标题:OpenAI Jalapeño: Better Than Nvidia Blackwell / 作者单位背景:SemiAnalysis半导体行业分析机构


SEO备选标题

1. 10万亿参数Bel底座刚完工,OpenAI自研芯片Jalapeño用700瓦干翻Nvidia
2. OpenAI芯片9个月流片成功,Bel预训练完成让GPT-6底座锁定10万亿参数
3. Jalapeño实测每千瓦吞吐量超Nvidia两倍,OpenAI用AI设计AI的闭环成了
4. 自研芯片Jalapeño加Bel底座双杀,OpenAI在Anthropic千亿IPO前夜亮出底牌