如果你这几天一直在网上冲浪,你大概已经见过 Jev 了——一个在 AI 社区掀起轩然大波的新模型。Jev 不是传统的 LLM。它是为做决策而生的,而不是为了写文本。在过去几天里深入研究了 Jev 之后,我真心觉得这波热度并非虚言,对于产品构建者来说,这里蕴含着巨大的潜力。
正如我之前所说,无论你是否从事技术岗位,了解 AI 背后的技术原理都至关重要。理解 Agent 系统如何运作,能让你更审慎地将这项技术应用到自己的产品中。
已经有好几个人联系我,说他们读遍了关于 Jev 的所有资料,却依然搞不懂它到底是什么。所以这篇文章就是写给他们的。这是一份面向普通用户的 Jev 指南。如果你之前读到的所有关于 Jev 的内容都让你困惑多于解答,那么这篇文章会有所不同。读完之后,你将建立起对 Jev 的基础认知:它是什么,它与 LLM 有何不同,以及你如何将其应用到正在构建的产品中。
软件中决策的重要性
软件充满了决策。这条客户消息需要紧急处理吗?这笔支付是欺诈行为吗?页面应该渲染成英文还是法文?
一个产品可能每天需要进行数百万次这样的决策。
但计算机能够做出的决策复杂度是有限的。上述问题可以通过一些简单的规则来回答。例如,我们可以根据用户的语言设置或 IP 地址来决定页面显示英文还是法文。但并非所有问题都如此简单。
举个例子,一张热狗的照片。没有任何一套简单的规则能让计算机判断我的照片里是否真的包含热狗。
于是,计算机科学家提出了一种让计算机做出更复杂决策的新方法:机器学习。事实证明,通过结合一些巧妙的算法和大量包含热狗的图片示例,计算机确实可以变得非常擅长识别含有热狗的图片。

GIF
我们的热狗模型是一种称为分类器(classifier)的模型。之所以叫这个名字,是因为它对事物进行分类。如今,分类器在软件中被广泛用于做出复杂的决策。
但分类器的问题在于,它们无法泛化到训练领域之外。我这个能识别热狗图片的分类器,帮不了我识别欺诈交易。而且由于训练分类器所需的数据和专业知识的门槛,许多类型的问题是计算机无法解决的。直到……
大型语言模型
当 OpenAI 在 2022 年 11 月发布 ChatGPT 时,它迅速风靡全球。它之所以如此受欢迎,并不是因为其绝对的智能水平,而是因为它具备强大的泛化能力。
ChatGPT 拥有对世界的基础理解,这意味着它可以同时谈论热狗和欺诈交易。
像 ChatGPT、Claude、Grok 和 Kimi 这样的大型语言模型的主要功能是生成文本。但任何使用过这些模型的人都知道,它们能够思考、推理并最终做出决策。作为一个例子,以下是 LLM 可能如何决定给定图像是否为热狗的过程。

GIF
是的,大型语言模型能够做出决策。而且它们可以在广泛的知识领域中做出决策。
LLM 会是圣杯吗?我们终于拥有了一个可以应用于当今软件决策的通用决策模型了吗?
嗯,实际上并没有。尽管 LLM 拥有惊人的能力,但它们相对较慢且昂贵。对于大多数软件应用场景来说,速度和成本都太不划算了。
如果我们有一个模型,能够在广泛的一般知识领域中快速且低成本地做出决策,那该多好啊……
介绍 Jev:一个可泛化的分类器
Jev 是一类新的模型,专为做出决策而非生成文本而优化。
Jev 保留了像 LLM 一样进行泛化的特性,同时又像分类器一样相对快速和廉价。据称,与同类 LLM 相比,Jev 的速度快 20-200 倍,成本低 40-400 倍。
这是如何实现的呢?因为 Jev 不像 LLM 那样逐个 token 返回答案,它直接返回一个决策结果。
这就是工程师们对其兴奋不已的原因。并不是说 Jev 达到了前所未有的智能水平;而是说它在如此高速和低成本的情况下,展现了前所未有的智能水平。
你不能和 Jev 聊天。它不是聊天机器人。Jev 期望输入三样东西:
- 你想要回答的问题
- 该问题的可能答案集合
- 回答问题所需的上下文(Jev 称之为“state”状态)
然后 Jev 会给出以下输出:
- 它选择的答案
- 该答案正确的概率
就这样。没有闲聊,只有决策。
Jev 支持三种类型的决策:
- Yes/no,Jev 称之为 “Noul”:返回陈述为真的估计概率
- Choice:从最多 255 个多项选择选项中选出答案,并提供每个选项正确的概率
- Score:按照 2 到 10 级的量表对某事物进行评分
这些选择使得高级决策能够在比以往方法更少的时间和成本内完成。让我们来看看每种类型的例子。
Noul(是/否)
假设我开了一家新的热狗摊,我想随着反馈的到来实时审查客户评价,以便相应地做出反应或回应。
对于每条评价,我们先问一个简单的问题:这条评价是否在抱怨食物?给 Jev 的输入可能如下所示。
1{2 "model": "jev-latest",3 "state": "Waited twenty minutes, but the hotdog was worth it. Would come back if the queue was shorter.",4 "questions": {5 "food_complaint": {6 "type": "noul",7 "instructions": "Does this review express dissatisfaction with the food itself?",8 "criteria": {9 "true": "Complains about the taste, temperature, or quality of the food.",10 "false": "Does not complain about the food. Complaints only about queues or service do not count."11 }12 }13 }14}
你可以看到,我们定义了想要回答的问题("instructions"),选择了“是”或“否”的标准,以及 Jev 做出准确决策所需的状态。
我们将上述问题交给 Jev。Jev 随后输出以下内容。
1{2 "answers": {3 "food_complaint": {4 "type": "noul",5 "noul": 0.046 }7 }8}
Jev 判定这条特定反馈只有 4% 的可能性是在抱怨食物。因此,我们可能会将这条评论归类为低优先级,并在有空时再跟进。
Choice(选择)
让我们通过要求 Jev 将反馈归类,来更深入地了解每条反馈项。这是我们向 Jev 发出的请求可能的样子。
1{2 "model": "jev-latest",3 "state": "Waited twenty minutes, but the hotdog was worth it. Would come back if the queue was shorter.",4 "questions": {5 "main_topic": {6 "type": "choice",7 "instructions": "What is the main topic of this review? Select the option that best captures its primary focus.",8 "criteria": {9 "queue": "Queue length or waiting time is the main focus.",10 "food": "The taste, temperature, or quality of the food is the main focus.",11 "service": "Staff friendliness, helpfulness, or how they handled the order is the main focus. Comments only about waiting time belong under queue.",12 "other": "The main focus is something other than food, waiting time, or staff service."13 }14 }15 }16}
我们为 Jev 可以做出的每个选择定义了描述,说明何时使用每个选项(即 "criteria")。Jev 返回以下内容。
1{2 "answers": {3 "main_topic": {4 "type": "choice",5 "choice": "queue",6 "probabilities": {7 "queue": 0.80,8 "food": 0.15,9 "service": 0.03,10 "other": 0.0211 },12 "confidence": 0.6013 }14 }15}
好的,Jev 选择了 “queue” 作为答案。你还可以看到它为每个选项附加了概率。
Score(评分)
现在让我们让 Jev 根据五个定义的等级,评估客户对我们热狗摊整体体验的满意程度。
1{2 "model": "jev-latest",3 "state": "Waited twenty minutes, but the hotdog was worth it. Would come back if the queue was shorter.",4 "questions": {5 "overall_satisfaction": {6 "type": "score",7 "instructions": "How satisfied is this customer with their overall experience? Consider both positive and negative comments.",8 "criteria": [9 "Very dissatisfied: strongly negative about the experience overall.",10 "Dissatisfied: mostly negative, despite any positives.",11 "Mixed: meaningful positives and negatives, with neither clearly dominating.",12 "Satisfied: mostly positive, despite some complaints.",13 "Very satisfied: strongly positive, with no meaningful complaints."14 ]15 }16 }17}
同样,我们提供了一个清晰的问题、一组可能的答案和状态。Jev 返回以下内容。
1{2 "answers": {3 "overall_satisfaction": {4 "type": "score",5 "score": 2.1,6 "probabilities": {7 "0": 0.05,8 "1": 0.15,9 "2": 0.50,10 "3": 0.25,11 "4": 0.0512 }13 }14 }15}
满分 4 分得了 2.1 分,还有改进空间。
Jev 的魔力在于,它能够比 LLM 更快、更便宜地做出这些决策。以下是针对我们热狗摊留下的 60 条反馈进行审查的并排比较。左边是 Jev,右边是一个 LLM(gpt-5.6 Luna)。

Jev 在速度和成本上的优势降低了通过软件做出决策的门槛。
应用 Jev
在你的产品中,任何可以通过决策来改善用户体验的地方,都可以考虑应用 Jev。以下是一些例子。
在知道某事是真还是假可以改变采取的行动时,使用 Yes/No。
- 这位客户的消息是否暗示他们即将取消订阅?
- 供应商的更新是否表明发货将错过截止日期?
- 学生的解释是否揭示了值得纠正的误解?
- 会议记录中是否包含无人负责落实的承诺?
- 玩家的消息是否表明他们卡住了,可能需要提示?
在从一组选项中进行选择以决定下一步行动时,使用 Choice。
- 哪个专家团队应该处理这个异常的客户请求?
- 哪个产品教程最匹配用户当前试图完成的任务?
- 游戏中的哪个角色应该回应玩家刚才说的话?
- 博物馆音频导览中的哪一段最能回答游客的问题?
- 哪种替代食材最能保留缺失食材在食谱中的作用?
在判断某事物满足标准的程度、好坏或接近程度,从而确定优先级或调整行动时,使用 Score。
- 这个软件 Bug 对客户实际工作流程的干扰有多大?
- 这份旅行行程与某人理想度假计划的契合度有多高?
- 这次客户访谈在多大程度上支持特定的产品假设?
- 这段场景对话偏离角色既定声音的程度有多远?
- 鉴于玩家已知的信息,这个游戏提示的揭示程度有多深?
是时候用 Jev 构建了
Jev 为我们为用户构建的软件和体验类型打开了全新的可能性世界。
既然你已经了解了 Jev 是什么以及它是如何工作的,你打算如何将这项技术应用到你正在构建的产品中呢?





