开源Nimble:一个号称“开放式Jev”决策模型


该项目旨在提供一种快速、本地化的“类型化决策”模型,用于数据筛选和模型评估。

Nimble 的核心思想是“系统一”方法,即模型不生成推理过程,而是直接对给定的文本和模式(Schema)做出快速决策。它接收一段文本和一个扁平的模式(包含枚举或布尔类型的问题),然后为每个问题返回一个类型化的答案以及每个可能答案的概率。这种方式速度极快,因为模型只进行一次前向传播。

一个9B模型用两天时间训练出来,在自家评测上把未微调的27B模型甩开5个百分点,还能在你的苹果笔记本上免费跑!

它就是Bespoke Labs刚开源的Nimble,一个号称“开放式Jev”的决策模型!

2026年9月,AI研究机构Bespoke Labs发布开源项目Bespoke Nimble,一个能在本地运行的9B类型化决策模型。它用两天训练完成,在324条留出样本上准确率达到90.12%,超过未微调的27B模型,声称是Jev的开放替代方案。

决策不做解释,9B模型两天学会了

Nimble做的事情说起来简单得不像话。

你给它一段文本和一个“模式”。模式是一组扁平的问题,每个问题要么是从你给的选项里选一个,要么是回答是或否。它返回一个答案,加上每个可能答案的概率。

没有推理过程,没有解释,没有“让我想想”。一次前向传播,直接出结果。

Bespoke Labs把这种方法叫“系统一”决策,灵感来自TypeSafe的Jev。人类做快速判断时不写推理链,Nimble也不写。

这有什么用?路由请求、检查条件、应用策略、按评分标准打分。供应链分类、客服工单分级、内容审核判断——凡是“从已知选项中选一个”的场景,它理论上都能干。

数据是合成生成的,覆盖10个类别:商业、教育、家居、媒体、公共服务、科学、软件、供应链、旅行、职场。训练集2676条,留出集324条,全部由模型生成再经模型校验,没有人手审查过。

训练只跑了一个epoch。LoRA rank 16,学习率5e-5,有效批大小8,随机种子17。用的是Qwen3.5-9B作为底座。

然后数据就变了。

在324条留出样本上,未微调的Qwen3.5-9B拿到215条匹配,66.36%。Nimble拿到292条,90.12%。同一套题,同一个模型家族,微调之后涨了将近24个百分点。

27B的Qwen3.8在同评测上只有84.88%。一个9B的微调模型,干翻了27B的未微调模型。

但是等一下。

“开放配方”里藏着一半的配方

Bespoke Labs反复强调一件事:他们是开放数据、开放模型、开放配方的。

数据确实在仓库里,data/train.jsonldata/eval.jsonl,甚至还有校验脚本确认文件没有损坏。模型权重在Hugging Face上,bespokelabs/Bespoke-Nimble-9B,Apache-2.0许可。

但训练数据里的“对比式数据策划”方法,有一个细节值得停下来看。

他们的做法是这样的:写两个几乎一样的例子,只改动其中一个事实,让正确答案翻转。比如一个退款授权场景,第一版里授权书上签的是Mira,第二版改成Noah,其他一切不变,退款授权从true变成false。

“模型从这个对比里学到什么东西该改变决策。”

这个方法本身不新。有人在回复里说得很直白:“我们从2023年开始就在每一篇数据集论文里看到这个技巧了。”

但Bespoke Labs真正的赌注不在方法本身。

他们的训练数据没有任何概率标注。没有人类标注的置信度,没有教师模型的软标签,只有硬标签true/false或者从选项里选一个。

意思是:模型学到的是“选对还是选错”,而不是“多确定”。

那为什么模型输出的概率看起来还不错?

因为评分器在读logits。模型给每个候选答案的token打一个原始分数,评分器用softmax把这些分数转成概率。概率来自模型内部的数值关系,不是来自任何外部校准。

这就是问题所在。

概率看起来像置信度,但它不是

Nimble的README里有一段话,说得非常清楚,但也非常容易被忽略:

“概率不是答案正确的保证。Nimble只是把它们缩放到在你的候选答案上加起来等于1。0.9的概率不意味着答案有90%的正确率。”

读第二遍。

一个决策模型告诉你它有90%的把握,但那个90%不是“90%的时候是对的”的意思。它只是说,在你给的这几个选项里,模型内部的计算更偏向这一个。

如果正确答案不在你给的选项里,那个“90%”依然会显示出来,因为它只在候选答案之间做归一化。

这就好比你问一个人“咖啡还是茶”,他说咖啡的概率是0.9。但他可能根本不想喝饮料,只是你只给了这两个选项。

Bespoke Labs自己也知道这一点。他们建议:如果你觉得正确答案可能不在选项里,加一个“以上都不是”的选项。

一个开源的Jev替代项目在README里也承认了同样的问题:“字母的份额是一个带置信度缺口的排名,不是校准过的概率。”

另一个项目说得更直接:“概率是归一化的候选标签分数,不是已建立的真实世界正确性估计。”

这就怪了。一个决策系统,输出概率,但概率不是校准的。那用户拿到一个“0.87”,该信还是不该信?

开源Jev有几十个,但这个的差异点只有一个

搜索“Jev 开源替代”会看到一堆项目。

openjev跑在DiffusionGemma上,通过vLLM提供和Jev兼容的API。mini-jev是一个预注册实验,对比“读选项字母的logits”和“生成JSON”哪个更准。jevlike是一个从零搭的选项评分器。还有一个叫Open Alternative to Jev的项目,用打包共享状态的方式做并行决策。

Nimble和它们最大的区别是:它发布了一个微调过的模型,而不是一个推理框架。

其他项目都在做同一件事:拿一个现成的开源模型,用一种聪明的方式读它的输出,然后说“这就可以当Jev用”。它们不训练,只推理。

Nimble训练了。用LoRA微调了Qwen3.5-9B,而且发布出来了。

所以Nimble的评测数字是它自己的模型的数字,不是“拿Qwen3.5-4B读logits”的数字。它的90.12%是微调后的成绩,不是任何开源模型即插即用的成绩。

这是它的核心资产,也是它的局限。

用两天建的东西,边界比你想的多

Bespoke Labs说“我们一天之内建好了Nimble”。

这既是优点也是警告。

优点是速度快,说明流程可复现、工具链成熟。警告是,一天建好的东西,边界可能比你想的多。

Nimble只能处理文本,不能判断图片。模式必须是扁平的,没有嵌套字段。每个枚举字段最多26个选项。每个提示最多2048个token,超了直接拒绝。

最要紧的是:每个字段单独评分,一个字段看不到另一个字段的答案。

这意味着如果你的决策逻辑是“如果A是true,那B应该是false”,模型不会帮你检查这个一致性。你得在自己的代码里做。

有人问了一个很实际的问题:“Nimble的评测停留在QA任务上,还是也在技能/工具分类上和Jev做了对比?”

没有人回答这个问题。

90%的准确率,但只有324道题

Nimble的评测集有324条,来自6个源家族。训练集覆盖10个类别,但留出集只覆盖了6个。

324条样本能说明什么?能说明微调有效果,不能说明泛化能力有多强。

Bespoke Labs自己在README里写了一句话:“所有标签都是合成的。模型检查了它们,没有人复审。同一模型的不同调用可能犯同样的错误,检查可能漏掉一些错误。”

翻译:评测的“正确答案”本身可能是错的。

这不是Bespoke Labs独有的问题。整个Jev生态都在面对同样的困境。有人建了一个叫jev-benchmarks的项目,专门做“概率感知的评测”——不只看选对没有,还看概率是否校准、在固定错误预算下能自动处理多少任务。

但Nimble的评测没有做这些。它做的是“参考匹配数”,也就是答案对不对。概率质量、选择性自动化、失败拓扑——这些更深入的问题没有被测量。

有人在回复里一针见血:“杀手级产物是失败拓扑,不是那个90%。发布置信度在哪个类别上崩了,这样路由器才知道什么时候该升级而不是盲目信任一个聚合分数。”

Nimble没有发布这个。

回到你的MacBook,事情变了吗

Nimble确实能在MacBook上跑。

MLX路径支持苹果芯片,CUDA路径支持BF16的NVIDIA GPU。Mac上ParallelScorer会预处理一次共享上下文,然后并行评分所有字段。CUDA上每个字段单独评分,每次都用完整提示。

在M5 Pro 64GB上,324条样本的中位延迟是444毫秒。在H100上,同样的评估中位延迟降到106毫秒。Jev API的中位延迟是246.7毫秒。

“在H100上100毫秒,在你的MacBook上免费用。免费感受AGI。”Mahesh在发布帖里这样写。

但那个“免费感受AGI”的前提是,你接受一个9B模型做出的判断,它的概率没有校准,它的评测集只有324条,它的训练数据是合成的。

这不一定是个坏交易。对于很多场景——工单分级、简单路由、内容分类——你不需要Jev级别的校准,你只需要一个比“拿Qwen硬生成JSON”更好的方案。

Nimble比那个方案好。它快、免费、本地、类型化输出。

但它不是Jev。它是一个用两天时间、在特定领域合成数据上微调出来的9B分类器,带了一个概率输出的外观。

有人问了一个问题,没有人回答:这个对比式数据策划的配方,出了Jev的任务家族之外,还能不能迁移?

如果你打算用它,你最好自己回答这个问题。

模型:https://huggingface.co/bespokelabs/Bespoke-Nimble-9B