Jev颠覆AI架构范式:AI可以像数据库一样嵌入软件系统

AI不该当主角,它该像数据库一样消失在系统里!

Jev把判断变成了基础设施,你却要重新学怎么“定义正确”!

2026年9月,前OpenAI研究员Diogo Almeida发布Jev决策模型,它不聊天、不写文章,只输出Choice、Score、Noul三种结构化判断原语,延迟70毫秒,成本0.042美元每百万token,把AI从对话框里拽出来,塞进软件系统的底层当基础设施用。

数据库当年怎么改变企业,AI现在就该怎么改变软件

三十年前,企业花钱买数据库,图的不是分析报表,图的是可靠。银行要的是每一笔转账不出错,电信公司要的是计费系统不扯皮,零售商要的是库存数字别对不上。数据库给了企业一样以前没有的东西:一个所有系统都认账的操作现实。

一旦所有系统对“真相”达成一致,自动化就变得可能了,规模也就跟着来了。这个逻辑链条很朴素:先有可信的基础设施,才有建立在它之上的大规模自动化。

今天的AI站到了一个几乎一模一样的位置。企业早就不缺数据了,缺的是把数据变成一致行动的能力。每个团队各干各的,营销推激进获客、客服收紧政策、财务砍折扣、产品推高价功能,单独看每个决定都对,合在一起就是互相打架。

数据库解决的是“多个系统对同一份数据有不同版本”的问题,AI要解决的是“多个团队对同一份数据做出矛盾行动”的问题。数据库同步的是数据,AI要同步的是行动。

但是,这里有一个关键的转折。绝大多数人理解的AI,还是那个会跟你唠嗑的聊天框。你问它答,你写它改,整个行业把“像人一样说话”当成了智能的最高标准。这个默认设定正在被打破,而打破它的东西,恰恰不是“更会说话的AI”,是“根本不会说话的AI”。

不写作文的AI,才是开发者真正需要的那种

Diogo Almeida花了两年时间秘密开发了一种叫RLCD的训练方法,全称是“校准决策强化学习”。这个方法的目标不是让模型写出让人满意的文字,是让模型给出的概率和它的实际正确率对得上。模型说70%的时候,大概就是70%对的。

Jev的接口只有三种原语:Choice从一组选项里选一个,最多支持255个选项,返回每个选项被选中的概率;Score在指定范围内打分,比如判断客户流失风险是0.3还是0.8;Noul回答一个是非题,返回从0到1的概率值。

这三种原语合在一起做的事情,是把“判断”从“生成”里面剥离出来。对话模型的工作方式是逐字写出一整段话,每个字依赖前一个字,这个过程天然慢、天然贵、天然容易跑偏。Jev收到输入后一次性并行算出所有答案,没有逐字生成的环节,所以它快,所以它便宜,所以它不会在中途“写着写着就跑题了”。

官方数据是端到端延迟70到500毫秒,输入token每百万个收费0.042美元,输出因为不存在自回归生成过程所以完全免费。速度最高提升193.6倍,成本最高降低444.6倍。

一个用来做判断的AI,为什么非得先学会写作文?这个问题问出来的时候,答案就已经很明显了!

嵌入系统之后,它变成了一行代码就能调用的判断函数

Jev的定位是“System One Model”,对应心理学里的“系统一”——快速、直觉式的判断。它面向的是固定选项、连续评分、是非概率这些重复决策任务,不生成自然语言,不做多轮对话。

TypeSafe的官方定位说得很直接:Jev是“一个前沿智能的函数调用:非结构化状态输入,类型化概率决策输出”。翻译成大白话就是,你给它一段原始信息,它给你一个带置信度的答案。一行代码的事。

一个叫jev-browser的开源项目把这种嵌入用到了浏览器里。Claude负责规划,Jev负责每一步的具体判断。浏览器每走一步,代码把当前页面的元素和状态描述出来,一次请求同时问Jev几个问题:该点哪个元素、该做什么动作、这一步完成了没有、有没有报错。Jev只回答概率分布,不写一个字。

结果是一次从苏黎世到伦敦的航班搜索,完整跑完只花了7.1秒。调用大模型读页面的次数大幅下降,中位数大约是旧方案的五分之一。

另一个项目Jev Codex Router的逻辑更简单:Jev先判断每一轮编程任务的难度,再决定交给哪个档位的模型去处理。简单任务用便宜的模型,难任务用贵的模型,Jev自己只做那个“这题难不难”的判断。

这些项目有一个共同点,没有人把Jev当聊天机器人用。他们把它插进软件的执行链路里,处理那些高频、选项有限、需要快速翻篇的判断。Jev不是产品,它是产品里面的一行代码,就像你不会跟数据库“聊天”,你只会调用它。

数据库不会说谎,但数据库也不会替你决定什么是对的

Jev的营销话术里有一句被反复引用的话:“它不会产生幻觉”。这句话在字面上是对的,因为幻觉的经典定义是模型生成了一段看起来合理但事实上错误的内容,而Jev根本不做内容生成。

但是,一个合法的、类型正确的、概率值合理的输出,完全可以是错的。一封邮件被Jev以0.92的置信度分到了“技术问题”类别,但它其实是账单问题。这算不算幻觉?按照传统定义不算,因为Jev没有编造任何东西,它只是在一个给定选项里做了选择。按照实际使用的定义,这和一个大语言模型把账单问题写成技术问题,给用户造成的后果是一样的。

Jev消灭的是格式错误,不是判断错误。它让集成变得干净,但没有让判断变得正确。

这就像数据库。数据库不会说谎,你存进去什么它返回什么,格式永远正确,查询永远执行。但数据库也不会替你决定存进去的数据到底对不对。那个责任是你的。

Jev把这个逻辑推到了判断层面。它给你一个数字,0.87。这个数字精确得让你无法回避。你必须在代码里定义一个阈值,超过0.85就执行某个动作,低于0.85就转人工。这个阈值是你拍的,不是Jev拍的。Jev只负责告诉你它有多确定,确定之后的事情它一概不管。

以前你怪模型胡说八道,现在你得怪自己把阈值设错了!

判断便宜一百倍之后,软件开发的基本假设变了

Almeida在发布Jev时说了一句很关键的话:“如果AI要从根本上改变工作的方式,人就不能是智能的唯一消费者。大部分智能最终应该住在软件里面,安安静静地在后台运行。”

这句话翻译一下就是:如果判断便宜到可以忽略不计,你就可以在一件原本只能做一次判断的事情上做一百次判断,而你花的总钱数是一样的。Jev的名字取自“杰文斯悖论”——效率提高不会减少消耗,反而会增加消耗。

以前你在写软件时考虑的是“这个环节要不要加一个AI判断”,因为每个判断都又贵又慢,你得省着用。现在你可以默认每个环节都有一个判断层,就像你默认每个函数都可以有一个if语句一样。它变成了一种基础设施,而不是一种奢侈品。

Doom那个演示最能说明问题。Jev以每秒10次的频率接收游戏状态数据,做出“往哪走、打谁、捡什么”的判断,每小时的运行成本大约是7美元。7美元,一小时,每秒10次决策。这个价格在一年前你拿去问任何一个AI基础设施的工程师,他们都会说你在做梦。

But,Jev只能做有限类型的判断。它不能解释为什么,不能处理没见过的情况,不能在两个选项之间做真正的创造性权衡。它是阀门,不是大脑。但对于软件系统里绝大多数需要“拍一下板”的环节来说,一个可靠的阀门比一个善变的大脑有用得多!

当判断变成基础设施,谁来决定拆分的粒度

Jev的早期文档里有一行不起眼的说明:当一个决策涉及多个相互依赖的子目标时,系统建议你把它拆成一步一个决策。比如“添加两个待办事项,完成其中一个,清除已完成项”这样的指令,必须拆成三个独立的Jev调用。

这个限制指向一个更大的问题。当你把“判断”这件事拆解成足够小的单元之后,谁来决定拆分的粒度,谁来定义哪些判断可以串起来、哪些必须孤立。当一个系统里有几百个Jev调用点,每一个都在给出概率和置信度,这些概率之间的关系由谁来维护。

一个开发者在社交平台上说,他花了一个周末用Jev搭了一个DSPy的代理框架,跑出来的循环嵌套层数比他预想的多得多,他至今没搞清楚中间某一层的0.73到底是在判断什么。

数据库不会告诉你表该怎么设计,不会告诉你哪些字段该建索引,不会告诉你什么时候该反范式化。它只提供原语,设计是你的事。

Jev也一样。它把“判断”变成了一行代码,但那一行代码放在哪里、和谁相邻、阈值定在多少——这些事情它一概不管。它安静地待在那里,等你的下一个调用!