ChatGPT共同发明人发布Jev基模:号称永不幻觉、比GPT快200倍


一家硅谷公司刚刚宣布,他们造出了一个"永远不会胡说八道"的AI!

它比GPT快200倍,还便宜400倍,你敢信?

TypeSafe AI在2026年9月推出首个System One模型Jev,主打结构化输出、零幻觉、亚秒级响应,用全新RLCD训练方法颠覆传统大语言模型的自回归生成范式,为软件自动化提供可编程的类型安全AI接口。


硅谷创始人抛出一个诡异断言

Diogo Almeida在OpenAI待了几年,参与过ChatGPT背后的核心训练方法研发,是让语言模型学会"听人话"的关键推手之一。按理说,这样的履历下一步应该是继续做更大更聪明的聊天模型,或者去某家大厂当研究负责人。

他偏偏选了一条反方向的路:离职,闭关四年,然后在2026年9月14日站出来,创办TypeSafe AI,发布一个叫Jev的模型。

Jev的宣传点听起来像是在挑衅整个行业:比目前主流大模型快40到200倍,便宜100倍以上,而且从数学上保证不会出现类型错误!

问题来了,聊天机器人越做越聪明,编程助手越来越能干,为什么这位前OpenAI核心研究员要另起炉灶?他给出的理由只有一句话:模型在聊天上已经超人类好几年了,可自动化在哪里?


聊天很牛,自动化却卡在半路

先把背景交代清楚。GPT、Claude、Gemini这一类被大家熟知的AI,业内叫做大语言模型(Large Language Model,简称LLM)。它们的工作方式说白了就是"一个字一个字往外蹦",每蹦一个字都要看前面已经蹦出来的所有字,然后猜下一个字最可能是什么。

这种方式叫autoregressive(自回归)生成。好处是极其灵活,你让它写诗、写代码、聊天、翻译、总结,它都能干。坏处是慢,而且贵——一次响应动不动要几秒到几分钟,一百万个输出token能收你几十美元。

更麻烦的是,把这种AI塞进软件系统里时,程序员会发现一个尴尬的事实:模型输出的是一段文字,但软件需要的是结构化数据。你让它返回一个JSON,它有一定概率格式写错;你让它从五个选项里挑一个,它有可能给你编出第六个选项;你让它调用某个函数,它可能把函数名拼错。

这就是行业里说的"幻觉"(hallucination)问题。对聊天来说,AI偶尔胡诌一句无伤大雅,用户看到不对劲还能反问。但对自动化流水线来说,一个格式错误就能让整条线崩掉。这就怪了,模型智商都能考过律师资格证了,为什么连稳定输出一个合法JSON都做不到?


问题的根子出在训练目标上

要理解Jev为什么不一样,得先看看现有大模型是怎么被"教出来"的。

主流训练方法有两个:RLHF和RLVR。前者RLHF全称Reinforcement Learning with Human Feedback(基于人类反馈的强化学习),做法是让一堆人给模型的回答打分,模型学着讨好人类的口味;后者RLVR叫Reinforcement Learning with Verifiable Rewards(基于可验证奖励的强化学习),做法是让模型解数学题、写代码,然后拿标准答案对,答对了给奖励。

这两种方法训出来的模型,共同特点是"会说话",能生成让人满意的长文本,或者解出有标准答案的难题。

但注意,这两种目标都没有教模型一件事:诚实地说出"我有多大把握"!

一个模型如果95%的情况能做对某任务,但它无法告诉你剩下5%是哪些情况,那这个任务就没法交给它自动化处理。因为你不知道什么时候该信它,什么时候该拦下来。Almeida团队搞出的新方法叫RLCD,全称Reinforcement Learning for Calibrated Decisions(面向校准决策的强化学习),核心目标只有一个:让模型给出的概率是真实概率!

什么意思?如果模型说它80%确信答案是A,那把它说过80%的所有场合统计一遍,真的应该有80%的答案是A。这个性质叫"校准"(calibration)。听起来是常识,但目前所有主流LLM在这一点上都做得很差,普遍过度自信。


结构化输出到底是什么魔法

再来看Jev跟传统LLM操作层面的最大区别。

传统LLM你给它一段prompt,它给你一段文字回复。你想要结构化数据,得在prompt里央求它"请以JSON格式返回,字段包括……",然后祈祷它照办。就算它照办了,你还得写代码解析、验证、处理它偶尔犯的格式错误。

Jev的用法完全不同!你要先在代码里定义好:我要问哪些问题,每个问题的答案是从哪些选项里选,或者是哪个数值区间。这个定义是schema(模式/结构定义),相当于给AI画好格子。然后你把要判断的上下文(比如一段客户对话、一份工单描述)传进去,Jev返回一个填好的结构,每个格子里除了答案,还带着置信度概率。

举个具体的:假设你要判断"这个客户会不会流失",你可以定义三个问题:客户是否表达过不满、客户使用频率是高是中是低、流失风险是高是中是低。Jev一次性返回三个答案,每个答案配一个百分比概率。全程没有生成任何一个多余的字符,也不可能返回你没定义的字段。

这个"schema预先定义、输出严格匹配"的机制,就是Jev敢喊出"0%类型错误"的底气。它不是靠训练把错误率压到很低,而是从架构上让错误在数学上不可能发生!


并行采样打破速度天花板

零幻觉解决的是"能不能用"的问题,速度解决的是"划不划算"的问题。

传统LLM为什么慢?因为每次只能生成一个token,下一个token必须等上一个token算完才能开始。一个长回复要蹦一千个字,就得串行跑一千次前向计算。硬件再好,这个链条也拉不动。

Jev既然放弃了自由生成文字,就顺势放弃了自回归。它采用parallel sampling(并行采样):一次前向计算,把所有预定义位置的答案概率全部算出来。这不是简单的工程优化,而是模型架构层面的重新设计。

结果是什么?端到端响应时间70毫秒到500毫秒。作为对比,主流大模型的响应时间是3秒到329秒。速度差距40到200倍,不是宣传吹的,是数量级层面的鸿沟。

价格上,输入token每百万个0.042美元,输出token不收费。相比之下,前沿大模型的输入token价格从0.2美元到10美元一百万,输出token通常比输入贵5倍。算下来,同样一个决策任务,成本差距能到400多倍。事情没那么简单,这么便宜到底能不能持续?团队承认,这个价格无法证明没有补贴,需要长期运营来验证商业模型是否成立。


Doom游戏机器人现场演示实时决策

光说不练假把式。TypeSafe团队搞了几个演示,其中一个把Jev接进了经典FPS游戏Doom里,让它实时做操作决策。

设定是每秒查询Jev十次,每次给它游戏当前的结构化状态(不是图像,是文字描述的敌人位置、血量、弹药等数据),让它决定下一步动作:前进、后退、开火、换武器等等。团队里做这个演示的工程师一开始担心一秒十次调用太贵,结果算下来一小时才花7美元。

7美元是什么概念?相当于一个人在游戏里挂机一小时,AI在里面做了3.6万个独立的战术决策,全程实时反应,没有卡顿,没有崩溃。

如果换成传统大模型来做同样的事,光是响应速度就跟不上——游戏里子弹飞过来只有零点几秒的反应窗口,模型还在慢慢一个字一个字地生成"我建议向左侧翻滚",人物早就凉了。这个演示要证明的不是"AI会玩游戏",而是"AI可以进入延迟敏感的实时系统"。这个门槛过去只有专门写的规则代码能够到,现在有个通用智能模块能挤进来。


Wikiracing展示高基数选择的稳定性

另一个演示叫Wikiracing。规则是从维基百科的一个词条出发,只能点击词条里的链接跳转,看谁最快跳到指定的目标词条。

这个游戏难在哪?一个维基词条里往往有几百上千个链接可以点,AI每一步都要在这么多选项里挑一个最靠近目标的。这就是所谓的"high cardinality"(高基数)选择问题。传统LLM在这种场景下有个致命毛病:它可能会输出一个页面里根本不存在的链接名,也就是幻觉出一个虚假选项。你的程序拿着这个虚假链接去点,直接404。

Jev的做法是先给页面上所有真实链接打分,再从这些真实选项里选一个。因为schema已经限定了选项范围,模型物理上不可能编造。演示里,Jev往往用更少的步数就找到了目标,说明在真实选项之间做判断时它的智能水准也够用。

这里有个小插曲:三次挑战里居然有两次的起点都是"Rubber Duck"(橡皮鸭)词条,纯属巧合,团队直到别人提醒才发现。这种自嘲式的坦白,恰恰也说明演示不是刻意挑数据。


工作流评测把老模型甩开近百倍

TypeSafe还发明了一种新的评测方式,专门衡量AI嵌入到实际业务流程里的效果。

传统的AI评测都是"给一个问题,看答案对不对",允许模型和调用方式随便调,容易出现"针对评测集刷分"的情况。TypeSafe的做法是:固定一整套业务工作流(比如客户分类、工单路由、内容审核这种真实场景),然后让所有参赛模型跑同一套流程,跟当前最贵最强的两个模型(GPT-6 Astra和Fable 5.1)的平均判断做对比,看谁更接近这个"参考答案"。

在四个业务工作流上跑下来,Jev的结果占据了性能价格曲线的最优点,领先幅度接近两个数量级。他们首页上"快193.6倍、便宜444.6倍"的数字就是这么算出来的。

但是,这个评测有几个需要注意的地方!

第一:工作流是TypeSafe团队自己设计的,虽然团队声明没有刻意为自家模型量身定做,也不在训练数据里,但设计者的偏好可能无形中影响了任务形态。

第二:参考答案用的是OpenAI和Anthropic两家的模型平均,这会天然偏袒OpenAI和Anthropic系模型,同时低估DeepSeek这类中国模型的实际能力。

第三:对比时给LLM用的是一个叫System One Adapter的封装库,强制它们输出符合Jev接口格式的结构化决策。这种约束方式已经是让LLM做结构化输出最准的方法,但依然比让LLM自由发挥要慢要贵。


名字里藏着一个经济学老幽灵

产品名Jev不是随便取的,来自19世纪英国经济学家William Stanley Jevons(威廉·斯坦利·杰文斯)。

这位老兄1865年提出过一个著名的悖论:蒸汽机效率提高之后,人们本以为煤炭消耗会下降,结果因为用煤成本变便宜,各行各业开始疯狂用蒸汽机,煤炭总消耗反而暴涨。经济学教科书里管这叫"杰文斯悖论"(Jevons Paradox)。

TypeSafe团队引用这个典故的意思很明白:他们赌的不是"AI变便宜后大家用得少了",而是"AI每便宜一个数量级,就会解锁多一个数量级的新应用场景"。

而模型类别名"System One Model"来自诺贝尔经济学奖得主Daniel Kahneman(丹尼尔·卡尼曼)的名著《思考,快与慢》。书里把人类思维分成两套:System 1是快速直觉判断,比如你看到2+2立刻知道等于4;System 2是慢速深度推理,比如你算17乘以24得掰着手指或者拿笔算。

现在市面上的推理型大模型走的是System 2路线,靠长时间思考换准确率。Jev走的是System 1路线,赌大多数业务决策其实不需要深度推理,只需要又快又准的直觉判断。这就像说:与其造一个能下国际象棋的超级大脑,不如造一亿个能瞬间判断"这封邮件是不是垃圾邮件"的小脑袋。哪个能改变世界,还真不好说!


局限和争议一样藏在细节里

夸完了得说说不足。

Jev最大的限制是它彻底放弃了生成自由文本的能力。你没法用它写文章、写代码、跟客户聊天。它只能填格子。这意味着它不能替代ChatGPT这类产品,只能作为软件系统里的一个组件存在。用一个不太恰当的比喻:GPT像瑞士军刀,Jev像一把手术刀,各有各的活儿。

选项数量也有上限。官方说schema里每个字段的选项数(cardinality)上限是255。超过这个数量的场景(比如从一万个SKU里选一个商品),Jev要走两阶段流程:先独立打分,再显式选择。这时候速度优势会打折扣,也是Wikiracing演示里偶尔慢下来的原因。

还有一个绕不开的问题:Jev的"零幻觉"是schema层面的零幻觉,不是事实层面的零幻觉!它保证输出格式和选项一定合法,但不保证选出来的答案一定对。如果你定义了三个选项都是错的,Jev照样会自信地从里面挑一个还给你概率。这个责任转移到了写schema的程序员身上。

再有,团队承认他们发布的评测数字是"上限值",代表了理想情况下的性能优势。真实业务场景里,输入通常更长更杂,Jev相对LLM的领先幅度会缩小。首页上的193倍加速,在演示视频里已经不是200倍了,实际应用里大概率还要再打折。


三条能带走的判断留给你

看完这一切,你能带走三个具体的行动原则。

第一:当你在评估一个AI要不要用在你的系统里,别只看它有多聪明,要看它错的时候你能不能提前知道!校准的置信度比高准确率更值钱,因为前者能让你自动决定何时人工介入。

第二:当你在设计AI流程时,把每个决策拆成最小可枚举的选项,写死schema,不给模型自由发挥的空间。系统的稳定性来自约束,来自明确的边界,来自可预测的失败模式。

第三:当你在算AI账时,别只看单次调用的价格,要算这个AI能不能进入你之前AI进不去的场景。真正的成本革命不是同样的活儿更便宜,而是过去做不起的活儿现在做得起了。

Jev现在开放early access(早期访问),waitlist(候补名单)在陆续放人。团队自己都说,他们最想看到的不是Jev在已有场景里替换谁,而是有人拿着它去做那些之前想都不敢想的应用。

那个每秒10次调用玩Doom的机器人一小时成本7美元的实验,团队打算办活动让开发者一起来hack。至于会hack出什么东西,官方没给答案,因为他们自己也不知道!


校准概率这件事,真做到了吗

TypeSafe把“校准概率”当作Jev最核心的差异化能力。但这里需要拆开来看:校准概率在技术上意味着什么,以及它为什么这么难。

在机器学习中,校准是一个可以量化的属性。一个校准良好的模型,它的置信度输出应该可以直接解释为真实概率。比如模型说“80%”,那在所有给出80%的样本中,应该有大约80%是正例。这个属性在风控、医疗、保险等领域是刚需——因为下游系统需要根据概率来做成本收益计算。

但大模型天生不校准。RLHF训练的目标是让人类评分者觉得回答好,而不是让模型对自己的知识边界有准确的认识。结果就是模型过度自信:明明不知道,也敢说得斩钉截铁。一个模型如果做对95%的任务,但它不知道那5%的错误发生在哪里,你就没法自动化——因为你不知道什么时候该信任它,什么时候该人工兜底。

RLCD声称解决了这个问题。它的训练信号不是“人类喜欢哪个回答”,而是“哪个概率更诚实”。这个方向的转变是根本性的。如果做成了,它的意义比“更快更便宜”要大得多。

但问题是,RLCD这个概念在学术文献中已经存在,指的是Reinforcement Learning from Contrastive Distillation,一种用对比提示生成偏好数据的方法。TypeSafe的RLCD是完全不同的东西,只是共用了缩写。这本身不构成问题,但意味着TypeSafe没有发表详细的技术论文来解释RLCD的训练细节,外部研究者无法复现。

这不代表RLCD不work。它可能真的work。但在没有同行评审和独立复现的情况下,校准概率这个核心主张仍然是一个需要外部验证的假设。

TypeSafe自己也承认了这一点。在发布材料中,他们写道:“成本:我们无法证明它没有被补贴;我们需要长期来证明定价的可持续性。”在速度方面,他们承认评测是在西海岸的笔记本上跑的,服务目前也部署在那里。在基准测试方面,他们承认工作流是由自己的团队构建的,可能存在偏见。

这种透明度值得肯定。但它也告诉我们一个事实:Jev的“不会幻觉”是架构保证的,“校准概率”是训练声称的,“前沿智能”是相对评测的。三者之间有一道需要独立验证的鸿沟。