LLM决策架构迎来解耦拐点,TypeSafe的Jev用概率校准替代生成式推理

TypeSafe发布的Jev模型连一个完整的句子都写不出来,却把大语言模型做决策的成本砍掉了400倍!

你的应用里一半调用都在花冤枉钱,因为你在让作文状元做判断题!

TypeSafe推出Jev决策模型,用RLCD校准概率替代大语言模型生成式推理,在Agent评估和内容审核场景实现200倍加速和400倍降本,LLM决策架构面临解耦重构。


作文状元做判断题,一道题烧掉九百个词元

你打开手机里的智能客服,问了一句"我的快递到哪了",后台的大语言模型立刻开始疯狂运转,大语言模型先理解你的问题,再判断该走哪条处理流程,最后才生成一句回答,这一整套动作里,真正需要"写字"的只有最后那句回答,但前面的判断环节,大语言模型同样在一字一字地往外蹦词元(token),词元是大语言模型处理文字的最小计费单位,大约一个汉字对应一到两个词元,大语言模型每吐出一个词元,你就要付一次钱,就像出租车跳表一样,跑多少算多少。

英国活动网站NearHere的工程师做了一次实测,NearHere让通用大语言模型判断一条活动信息是否合规,大语言模型吭哧吭哧推理了910个输出词元,才憋出一个"通过"或"拒绝"的答案,910个词元就为了做一道判断题,这就像你请了一个高考状元来帮你批阅小学生的对错号,状元确实能批对,但你付的是状元的价格!

这就怪了,明明只需要一个"是"或"否",为什么大语言模型要写那么多字?

原因藏在大语言模型的底层机制里,大语言模型本质上是一个自回归文本生成器,大语言模型的工作方式就是根据前面的文字预测下一个词元,一个接一个地往外蹦,哪怕大语言模型心里早就知道答案是"是",大语言模型也得把推理过程一个字一个字地写出来,因为大语言模型没有"直接输出答案"这个功能,大语言模型只会写作文,不会做选择题。


Jev只交卷不写过程,70毫秒出分

TypeSafe在2026年9月扔出了一颗炸弹,TypeSafe发布了一个叫Jev的决策专用模型,Jev属于TypeSafe定义的"系统一模型(System One models)",这个名字借用了心理学家丹尼尔·卡尼曼的说法,卡尼曼把人类思维分成两套系统:系统一快如闪电、靠直觉做判断;系统二慢条斯理、靠逻辑做推理,Jev就是专门模拟系统一的那个快枪手。

Jev的工作方式简单到让人怀疑人生:你丢给Jev一段数据,比如一封邮件、一张工单、一段智能体运行记录,再附上一组选择题,比如"这封邮件是垃圾邮件吗,选是或否",或者"给这段客服对话打分,1到5分选一个",Jev收到题目后不写任何推理过程,不生成任何自然语言句子,直接在70毫秒到500毫秒之间返回每个选项的概率值,Jev不产生任何输出词元,Jev返回的是结构化的数字,一组概率分布,这意味着TypeSafe根本没法按输出词元向你收费,所以Jev的计费方式只算输入,每百万输入词元收0.042美元,折合下来单次决策成本大约0.0004美元。

拿Jev的数字跟通用大语言模型比一比,差距就出来了:TypeSafe自己的评测数据显示,在四种决策工作流上取平均值,Jev准确率68%,单次成本0.0004美元,耗时0.4秒;GPT-5.6 Terra准确率同样68%,单次成本0.03美元,耗时10秒;Anthropic的Opus 5准确率73%,单次成本0.18美元,耗时38秒!

Jev比Opus 5低了5个百分点的准确率,但Jev的成本只有Opus 5的四百分之一,Jev的速度快了将近一百倍,你花四百分之一的钱拿到了95%的准确率,这笔账怎么算都划算,但是TypeSafe自己公布的数字,你信几分?


零标注打平一万五千条训练数据

怀疑者很快就动手了,Jev发布才两天,独立测试就冒了出来。

一位开发者在GitHub上公开了一项垃圾邮件分类实验,这位开发者拿18514封邮件让Jev做零样本(zero-shot)判断,所谓零样本,就是你一条标注数据都不给Jev,只给Jev一段文字描述"什么叫垃圾邮件",然后让Jev直接判,Jev的准确率达到了98.3%,作为对照组,这位开发者又训练了一个TF-IDF逻辑回归分类器,TF-IDF是2003年就在用的经典文本分类技术,TF-IDF需要大量人工标注的训练数据才能工作,这个分类器吃了大约14800条标注邮件,训练完成后准确率98.4%,两个结果在18514封邮件上只有466封判断不一致,而且这466封几乎各对一半,统计上没有显著差异!

一个什么数据都没见过的Jev,靠一段文字描述,打平了一个吃了一万五千条标注数据的传统分类器,这在两年前根本不可想象,以前你想做文本分类只有两条路:要么花钱请人标注几千条数据训练专用分类器,要么花大价钱调用大语言模型逐条判断,现在Jev告诉你两条路都不用走,写一段定义就够了。

NearHere的实测也印证了这个趋势,NearHere用Jev做活动信息审核,Jev准确率96%,而谷歌的Gemini Flash-Lite只有86%,Jev还便宜了58倍,Every网站的评估负责人更夸张,777条判断跑完只用了0.7秒,花了大约四分之一美分,数据很漂亮,但是Jev有一个致命短板,这个短板可能让一部分用户直接掉头走人。


概率校准撕开大语言模型裁判的遮羞布

Jev最值钱的特性其实不是快,也不是便宜,而是Jev返回的概率值是真的可信。

这句话听起来像废话,概率值当然应该可信,但现实是大语言模型给出的概率几乎全是骗人的,2025年一项覆盖14个大语言模型的研究在JudgeBench基准上发现,大语言模型裁判普遍把自己的置信度挤在90%到100%的区间里,实际准确率却远远低于这个数字,这就好比一个学生每次考试都说"我有九成把握",结果卷子发下来只有六十分!

TypeSafe用一种叫RLCD(校准决策强化学习,Reinforcement Learning for Calibrated Decisions)的方法训练Jev,RLCD的核心目标只有一个:让Jev说出来的概率和实际正确率对齐,Jev说"我有70%的把握选A",那在大量同类问题上选A的正确率就应该真的接近70%,回到那个垃圾邮件实验,Jev的概率分布曲线非常干净:评分低于0.1的邮件里只有0.1%是垃圾邮件;评分高于0.9的邮件里99.9%是垃圾邮件;评分落在0.5到0.6区间的邮件里只有38%是垃圾邮件,这条曲线告诉你一个极其关键的信息——你可以放心地把评分高于0.9和低于0.1的邮件自动处理,只把0.3到0.7这个模糊区间的4.6%的邮件交给人工复核,剩下的95.4%全自动,整体准确率依然保持在99.5%。

大语言模型裁判做不到这件事,因为大语言模型裁判给你的置信度是假的,你根本不知道哪些判断是大语言模型真正有把握的,哪些是大语言模型在瞎蒙却装得很自信,一个准确率95%但无法告诉你哪5%会出错的裁判,实际上没法帮你实现自动化,因为人类还是得逐条复查!


决策层和生成层拆开后,架构彻底变了

Jev不写句子,这意味着Jev给不了你任何解释,TypeSafe的文档说得很直白:系统一模型不生成推理过程,NearHere的测试也证实了这一点,Jev返回的只有一个类别标签和一组概率数字,没有"为什么"。

在大语言模型裁判的世界里,解释是一份极其宝贵的副产品,大语言模型裁判告诉你"这段代码有bug,因为第42行的变量没有初始化",这段解释可以直接喂给编程智能体,让编程智能体自动修复代码,Jev只告诉你"这段代码有bug,概率0.87",然后就没有然后了,你的编程智能体拿到这个数字完全不知道该从哪里下手。

但是这个硬伤在Jev的价格面前变得可以忍受,因为你可以两件事同时做:用Jev对每一条智能体运行轨迹做全量实时质检,成本几乎可以忽略不计,然后从Jev标记出的失败样本里抽一小部分,扔给大语言模型裁判生成详细解释,再把这些解释喂给编程智能体做自动修复,Arize AI的联合创始人Aparna Dhinakaran算了一笔账:以0.0004美元和0.4秒的单次决策成本,你可以停止抽样检查,转而对每一次工具调用、每一个智能体步骤做百分之百全量监控,这在以前根本不可能,因为大语言模型裁判跑一遍全量数据的账单能让你的财务总监当场晕倒!

这种架构的核心思路是把决策层和生成层彻底拆开,过去你的应用里判断和写作混在同一个大语言模型调用里,大语言模型一边做选择题一边写作文,你为整篇作文付钱,实际上只需要那个选择题的答案,现在Jev把选择题单独拎出来了,每道选择题0.0004美元,70毫秒交卷,你终于可以把昂贵的大语言模型留给真正需要写字的环节。


解释性消失后,反馈回路怎么重建

架构拆开之后,一个新的问题浮出水面:当你的决策层全部换成Jev这类不写句子的模型,你的整个质量反馈回路该怎么重建?

过去的质量回路是这样的:大语言模型裁判检查一段输出,给出"不合格"的判断,同时附上一段200字的解释,你把这段解释塞进提示词,让编程智能体自动修改代码,下次大语言模型裁判再检查,发现改好了,回路闭合,现在裁判变成了Jev,Jev只扔给你一个"不合格,概率0.92",你的编程智能体对着这个数字发呆,不知道该改哪一行,你当然可以对失败样本二次调用大语言模型生成解释,但这意味着你的系统里多了一个异步环节,Jev实时标记问题,大语言模型异步生成解释,编程智能体排队等待修复,整个回路的延迟从秒级拉长到了分钟级甚至小时级,对于需要实时自愈的生产环境,这个延迟可能致命。

更深层的矛盾在于,Jev的概率校准虽然比大语言模型裁判可靠得多,但Jev在TypeSafe官方评测中68%的平均准确率意味着每三次判断就有一次是错的,在垃圾邮件这种容错率高的场景里98.3%的准确率足够惊艳,但在医疗诊断、金融合规、法律审查这些场景里,68%的准确率连上线的资格都没有,你依然需要Opus 5那个73%的准确率,外加Opus 5附带的详细推理过程,而且TypeSafe的评测数据还留下了一个悬而未决的疑点:Jev在四种工作流上的准确率方差极大,有的工作流表现接近大语言模型裁判,有的工作流差距明显,而目前公开的最大规模独立测试只有18514条数据,当数据量从一万八膨胀到一千八百万,Jev的概率校准曲线还能不能保持那么干净,没有人知道。