一个只会选ABCD的小模型,正在把大模型的账单砍到零头!
TypeSafe AI推出的Jev是一款专职做决策的小模型,每百万输入token只要0.042美元,输出免费,速度比GPT类大模型快200倍,成本低400倍,把AI智能体里那些"选一个""判断是否""打个分"的活儿全接走,浏览器操作7秒0.0039美元完成订票,500封邮件分类只花3.5美分。
花三美分给大模型做一道选择题
先讲一个让人脸红的真相:现在市面上99%的AI智能体(AI Agent,可以自己完成一连串任务的人工智能程序),每天都在用价值三美分一次的GPT-5去回答"是或否"这种小学生题目!
打个比方,你雇了一位年薪百万的博士,结果每天让他干的活是:帮你从三个文件夹里挑一个放文件,判断这封邮件要不要回,给客户的紧急程度打个分。这活儿高中生兼职都能干,你却付博士的价钱。
这就是当下AI智能体的普遍现状。一个AI智能体跑起来,内部有个循环:大模型想一步、工具执行一步、再让大模型评估结果、继续想下一步。这个循环里,真正需要"生成一段文字"的动作可能只有20%,剩下80%全是"从选项里挑一个"!
杰文斯悖论:token越便宜,账单越吓人
有个1865年的老规律叫杰文斯悖论(Jevons Paradox):英国经济学家威廉·斯坦利·杰文斯(William Stanley Jevons)当年发现,蒸汽机烧煤效率提高之后,全国煤炭消耗量不但没降,反而暴涨。
道理很简单:东西一便宜,用的人就更多,总账单反而更贵。
这条老规律现在正在AI行业身上复刻。OpenAI、Anthropic每个季度都在降价,GPT-4的价格一年跌到原来的十分之一。但是企业的AI账单降了吗?没有,反而涨得更凶。因为每便宜一次,工程师就往智能体里塞进十倍的调用。
TypeSafe AI这家公司干脆把新产品直接命名为Jev,就是取自杰文斯的名字,摆明了要来打破这个循环。Jev的定价是每百万输入token只要0.042美元,也就是1万次决策只花0.42美元,输出token永久免费。
这个价格意味着什么?意味着你可以放心大胆地让智能体每一步都去咨询Jev,不用心疼账单。
Jev到底是啥:一台只会做选择题的机器
Jev是TypeSafe AI推出的"System One"类型模型。这个说法借用了心理学家丹尼尔·卡尼曼(Daniel Kahneman)在《思考,快与慢》里提出的"系统一"概念:人脑中那个快速、直觉、不需要费劲思考就能出答案的部分。
Jev就是AI版的"系统一":你喂给Jev一段当前的状态描述,再给几个预定义的问题和选项,Jev返回带概率的类型化答案。
Jev不会写文章,不会聊天,不会解释推理过程,不会生成代码。Jev只做一件事:从你给的选项里挑一个,或者给一个分数,或者回答Yes或No。
这就是Jev跟GPT-5、Claude、Gemini这些大模型最本质的区别。那些大模型是"什么都能干"的通用模型,Jev是"只会做选择题"的专用模型。就像瑞士军刀跟专业手术刀的区别:前者什么都行但都不精,后者只干一件事但快到极致。
跟同类竞品比,Jev独有的杀手锏是啥
市面上做"小模型分类"的方案不止Jev一家,比如OpenAI的gpt-4o-mini、Anthropic的Claude Haiku、Google的Gemini Flash,都能干分类的活儿。但是Jev跟这些竞品之间,有一条别人复制不来的差异。
那些小模型本质上还是缩水版的大模型,还在走"生成文字→再解析成结构化答案"这条路。就算你要求Claude Haiku只回答Yes或No,Claude Haiku内部还是要走完整的自回归生成流程,只是生成的字数少了而已。
Jev不一样。Jev的架构直接砍掉了"生成"这一步。给Jev一个选择题,Jev内部计算每个选项的概率,直接吐出概率最高的那一个加上置信度数字。整个过程没有token被"生成"出来,所以输出token才能免费。
这就是为什么Jev能把速度做到快200倍、把成本做到低400倍。不是Jev的芯片更牛,而是Jev干脆不干那件耗时耗钱的事。
三种题型:Choice、Score、Noul怎么用
Jev提供三种决策原语,对应三种典型的选择题场景。
第一种叫Choice(多选一):你给Jev一个字典,字典的key是选项名,value是这个选项的判断标准描述。比如"下一步该派哪个worker执行",选项是"研究员""写手""审核员",每个选项配一句话说明什么情况下该选它。Jev返回选中的选项名加置信度。
第二种叫Score(等级打分):你给Jev一组有序标签,比如"低、中、高、紧急"。Jev读完状态描述,给出对应的等级。适合评估优先级、风险度、成熟度这类连续变量。
第三种叫Noul(是非判断):你给Jev一句陈述,Jev告诉你这句陈述在当前状态下是True还是False,附带概率。适合做安全检查、合规判断、完成度确认。
有个关键细节容易被忽视:Jev看不到你的字段名。你把变量取名叫safe\_to\_publish没用,Jev不知道这个名字暗含什么意思。真正的判断标准必须写在instructions里,选项差异必须写在criteria里。
十步搭建:从零开始跑通Jev决策路由
从零开始把Jev集成进你的智能体,一共十个步骤,前面几步是准备工作,后面几步是实战部署。
第一步是拆分任务。拿一个具体的任务,比如"研究三款AI智能体工具,起草明天的简报",把里面所有"决策点"标出来:源头够不够?下一步派谁?稿子能不能交给人审?这些是Jev的活。真正生成文字、执行调用、硬性规则判断,交给大模型和代码。
第二步进Playground试水。TypeSafe官方Playground支持你不写代码就构造一个state和一个question,直接看Jev返回什么。比如构造这样一段状态:
python
{
"goal": "Compare three AI-agent tools in a morning briefing.",
"completed_work": "No sources collected yet.",
"available_workers": ["Researcher", "Writer"],
"constraint": "Save drafts for review. Do not publish."
}
再定义三个选项:research(收集证据)、write(撰写草稿)、review(人工审核)。Jev会告诉你在当前状态下最合适选哪个,附带置信度数字。
第三步装SDK。Python 3.12以上,装官方包:
python
$ mkdir jev-starter
$ cd jev-starter
$ python3 -m venv .venv
$ .venv/bin/python -m pip install --upgrade typesafe-sdk
Windows用户对应改成PowerShell命令。如果你的智能体是Claude Code或者Codex这类支持skill的工具,还可以直接加官方skill:
python
npx skills add typesafe-ai/skills --skill typesafe-ai
第四步到第六步:把决策落地成本地队列
第四步是把Jev的输出变成实际的任务分发。写一个chief.py脚本,接收用户输入的任务目标,调用Jev选出下一步的目的地,然后按目的地把任务写成JSON文件存到本地对应的文件夹。
核心代码长这样:
python
import json
import os
from getpass import getpass
from pathlib import Path
from uuid import uuid4
from typesafe_sdk import Choice, TypeSafeAPIError, TypeSafeClient
if not os.environ.get("TYPESAFE_API_KEY"):
os.environ["TYPESAFE_API_KEY"] = getpass("TypeSafe API key: ").strip()
goal = input("Goal: ").strip()
if not goal:
raise SystemExit("Enter a goal.")
notes = input("Completed work: ").strip() or "Nothing yet."
state = {"goal": goal, "completed_work": notes}
try:
with TypeSafeClient(model="jev-1.13.0") as client:
result = client.system_one(
state=state,
questions={
"next_worker": Choice(
instructions="Choose the next step for a research briefing.",
criteria={
"research": "Collect evidence still needed for the goal.",
"write": "Draft the briefing from sufficient evidence.",
"review": "Goal unclear, outside scope, or work complete.",
},
)
},
)
except TypeSafeAPIError as error:
raise SystemExit(f"API error {error.status}; see Step 8.")
answer = result.choices["next_worker"]
destination = "review"
if answer.choice in {"research", "write"} and answer.confidence >= 0.85:
destination = answer.choice
folder = Path(file).resolve().parent / "queue" / destination
folder.mkdir(parents=True, exist_ok=True)
job = folder / f"{uuid4().hex}.json"
payload = dict(state, choice=answer.choice, confidence=answer.confidence,
destination=destination, status="queued")
job.write_text(json.dumps(payload, indent=2, ensure_ascii=False), encoding="utf-8")
print("Saved handoff:", job)
注意这里有个关键的设计:置信度阈值设定在0.85。低于这个数字的决策,一律送去人工审核队列,不允许自动分发。为啥?因为置信度不是准确率百分比,只是Jev自己觉得的把握程度,用工作流里的标注样本校准过再上生产才安全。
第五步是玩转前面提到的三种题型。Choice、Score、Noul可以任意组合,也可以在一次调用里并行发多个问题。
第六步叫"动态菜单"。这一步是Jev跟大模型分工的精髓:每一步的可选项要根据当前状态实时刷新,不能用死的列表。比如浏览器智能体,每次页面刷新之后重新提取当前页面上能点的按钮列表,只把这个列表喂给Jev选。
第七步到第十步:并行、护栏、成本、部署
第七步是并行提问。Jev的System 1架构支持一次API调用里塞多个问题,几个问题并行评估,几乎不增加耗时,只按额外的输入token加钱。
代码写起来就是往questions字典里多加几项:
python
result = client.system_one(
state=state,
questions={
"next_worker": Choice(
instructions="Choose the next step.",
criteria={...}
),
"urgency": Score(
instructions="Rate request urgency.",
labels=["low", "medium", "high", "critical"]
),
"safe_to_run": Noul(
instructions="The requested action is safe to execute without human review."
),
},
)
一次调用同时拿到"派谁执行""紧急度""是否安全"三个答案,这才是Jev真正省钱又省时的用法。
第八步是设护栏。任何智能体上生产都必须有三条底线:最大调用次数、最大花费额度、进度断点保存。中断之后重启,先检查上一步做到哪儿了,再决定要不要重复执行。Jev给出的高置信度答案,不能证明文件真的保存成功了、消息真的发出去了,实际执行的确认必须由代码单独完成。
第九步是算账。Jev 1.13的定价是每百万输入token 0.042美元,输出token免费。假设每次决策消耗1000个输入token,1万次决策一共0.42美元。这个价格意味着你可以放心让智能体每一步都问一下Jev。
第十步是选场景部署。下面几个真实案例告诉你Jev能干啥。
Browser Use:浏览器操作7秒查完机票
第一个实战案例来自Browser Use团队的Gregor Zunic。Browser Use是一个开源浏览器自动化项目,让AI控制浏览器完成购物、订票、填表这类操作。
传统方案怎么干?让GPT-4看整个页面截图,生成一段"我要点击第三个按钮然后输入日期"的自然语言指令,再解析成实际操作。一次决策要几秒钟,成本几分钱,一趟订票流程下来可能十几美元。
Browser Use接入Jev之后的做法不一样:每次页面变化之后,代码先提取当前DOM里所有能点的元素,形成一个动态选项列表。这个列表塞给Jev做Choice决策,Jev秒选下一个要点的元素。只有当需要在输入框里打字的时候,才调用一个小型大模型生成文字。
结果多快?查一趟机票7秒钟,花费0.0039美元。三厘美元查一次机票,什么概念?1000次机票搜索才4美元。传统GPT-4方案同样的活儿要几美元一次。
Browser Use团队还公开了另一个优化数据:把浏览器协议的中位调用次数从1092次降到101次,中位任务时间下降25%。这个下降不是靠换更快的模型,是靠"一次读全页面状态"和"忽略无关动画"这两个流程改造。
Riley Brown:500封邮件分类只花3.5美分
第二个案例来自开发者Riley Brown。Riley用Jev给收件箱里的邮件做分类,500封邮件几秒钟处理完,成本3.5美分。
Riley的做法很简单:每封邮件的正文当作state,给Jev一个Choice问题,选项是"直接回复""转研究员深挖""搁置等待""转人工审核"。Jev选完之后,代码把邮件搬到对应的文件夹或者转给下游的邮件处理智能体。
这个场景为什么Jev特别合适?因为邮件分类的判断标准是模糊的、语义的,纯规则写不出来。用GPT-4分类效果好但太贵,500封要几美元。用Jev既有语义理解能力,又能把成本压到糖果的价钱。
开发者Hassan做过类似的活儿,用Jev配合Kimi K3分类1018篇AI研究论文。整套流水线的做法是:Jev先做粗分类,置信度低的样本才送给Kimi K3二次判断。结果100封邮件里96封分类正确,总成本约0.07美元,中位延迟256毫秒。
这种"Jev打头阵、大模型兜底"的组合,是现在最经济的AI流水线设计。Jev快速处理80%的确定样本,大模型精细处理20%的模糊样本,成本压到极致。
LangChain的AutoModeMiddleware:给危险操作装刹车
第三个案例是LangChain的中间件设计。LangChain是最流行的开源AI智能体框架,提供了一层AutoModeMiddleware,用Jev在每次工具调用之前做安全检查。
代码只需要一行中间件:
python
from langchain.agents import create_agent
from langchain_typesafe.experimental.middleware import (
AutoModeMiddleware,
)
# Jev checks every tool call before execution
# Blocks risky actions, approves safe ones
guardrail = AutoModeMiddleware(tools=["bash"])
agent = create_agent("openai:gpt-5.6-luna", middleware=[guardrail])
这个中间件干啥?智能体每次准备执行bash命令之前,AutoModeMiddleware先把命令内容喂给Jev,让Jev判断这条命令是安全的还是危险的。危险的直接拦截,安全的放行。整个判断过程零生成token,几乎零延迟。
以前的做法是啥?要么完全信任大模型不发疯,要么每次执行前弹窗让人手动确认。前者不安全,后者不好用。Claude Code、Codex、Cursor这些闭源编程智能体内部都做了类似的分类器,只是一直藏在闭源代码里没开放出来。
现在Jev把这一层能力开放成公共API,任何智能体都能装上这道刹车。这一步是AI智能体从"玩具"走向"生产工具"的关键一步。
Model Router:让大模型和小模型智能分工
第四个案例是模型路由。同样是LangChain的中间件方案,这次是在智能体的顶层加一个ModelRouterMiddleware,根据任务复杂度自动选择用哪个大模型。
代码长这样:
python
from langchain.agents import create_agent
from langchain_typesafe.experimental.middleware import (
ModelChoice, ModelRouterMiddleware,
)
router = ModelRouterMiddleware(
choices={
"fast": ModelChoice(
model="openai:luna",
criteria="Direct lookups, extraction, localized changes.",
),
"powerful": ModelChoice(
model="openai:sol",
criteria="Architecture and high-stakes decisions.",
),
},
instructions="Choose the least costly model that can complete the task.",
)
agent = create_agent("openai:gpt-5.6-luna", middleware=[router])
意思是:Jev在每次任务开始前,判断这个任务是"简单查找型"还是"复杂决策型"。简单的派给便宜的Luna模型执行,复杂的派给贵但强的Sol模型执行。
这种分工设计的省钱效果吓人。因为智能体里绝大多数任务其实很简单,只有少数关键决策需要动用最贵的推理模型。以前一刀切都用GPT-5,账单必然爆炸。用Jev做路由之后,你可以做到80%的任务走廉价路径,20%走高端路径,总账单直接砍掉一大半。
这就是所谓的"harness"(外壳)设计。同样的大模型权重,配上不同的外壳工程,性能可以从42%跃升到78%。业界原话是:"harness才是差距所在,不是模型本身。"
上下文压缩:1秒把百万token压到8万
第五个案例最刺激,来自开发者Tamara和Alex Volkov。他们用Jev做上下文压缩,1秒把一段接近100万token的Claude会话精简到8.6万token。
上下文压缩是啥?大模型有上下文窗口限制,比如Claude的窗口是20万token,超过之后就得压缩历史对话,把老内容浓缩成摘要留下来,才能继续聊。
传统压缩方式:让另一个大模型把历史内容读一遍,生成一段摘要。这个过程慢,且贵,且摘要会丢失细节。
Alex Volkov的做法完全不同:让Jev逐条评估历史对话里的每一次工具调用,给每条打一个"相关性分数"(Score题型)。分数低的直接丢掉,分数高的原样保留。这个过程不是"总结",是"过滤"。
结果:1秒钟处理完100万token的会话,精简后只剩8.6万token,关键细节全部保留。因为Jev不生成新内容,只是打分挑选,速度和成本都碾压传统摘要方案。
Tamara的原话是:"2026年了,为啥压缩还在用总结提示词?Jev可以让压缩变成瞬时的。"
到底该把哪些活儿从大模型手里抢过来
看完这五个案例,一条清晰的原则浮出水面:智能体里所有"选一个""打个分""判断是否"的动作,都该从大模型手里抢过来交给Jev。
具体怎么判断?给你一个可操作的规则:如果这一步的输出是"从预定义选项里挑一个""给一个等级""回答Yes或No",就用Jev。如果这一步的输出是"生成一段全新的文字""写一段代码""解释一件事情",才用大模型。
按这个规则去审视你现有的智能体,你会发现一件让人肉疼的事:60%到80%的大模型调用其实都是选择题!你一直在用GPT-5做选择题,一直在烧冤枉钱。
三条具体行动指令给你带走:
第一:打开你当前的智能体代码,把所有大模型调用逐个标记,看哪些是"选择型"哪些是"生成型",把选择型的全部换成Jev调用。
第二:给你的智能体加一层AutoModeMiddleware,在每次危险工具调用前用Jev做安全分类,把误操作风险压到最低。
第三:给你的智能体加一层ModelRouterMiddleware,让Jev在任务开始前判断复杂度,简单任务走廉价模型,复杂任务走顶级模型。
一个还没解开的实验矛盾
最后留一个悬而未决的数字给你琢磨。Browser Use团队公开的机票查询演示,7秒钟花费0.0039美元。这个成本拆开看:Jev消耗了90558个输入token,按0.042美元每百万算,Jev部分成本约0.0038美元,剩下不到万分之一美元给了负责打字的小型大模型。
但是这个7秒钟的计时,是从"页面首次观测完成"之后才开始的,也不包括跑完之后的结果验证。Browser Use的运行时优化把浏览器协议的中位调用数从1092次砍到101次,但两个版本用的是完全相同的模型。
真正的问题来了:如果同一个模型,通过流程改造就能把浏览器调用降到十分之一、任务时间降25%,那你现在的智能体里到底藏了多少"重复调用大模型确认同一件事"的浪费?在你为Jev欢呼之前,先去数一数你自己代码里那些没必要的重复问询。这个数字,可能比你想象的更大!