Jev:最快且最经济的自动化决策 AI

@ai_ai_ailover
日语2026年9月18日
117K
102
7
0
223

TL;DR

Jev 是一款专为分类和判断任务设计的 AI 模型,在工作自动化流程中相比通用 LLM 具有显著的速度和成本优势。

不写文案、却改变工作自动化的 AI

“这个咨询该由谁来处理?”“这段文字和文档有矛盾吗?”“这个请求需要调用高性能 AI 吗?”

在尝试实现工作自动化时,这类微小的决策会反复出现。你需要的不是宏大的解释,而是一个能让你推进到下一个任务的答案。然而,如果为每一个决策都调用高性能生成式 AI,处理时间和成本都会不断累积。

这里有一款非常有趣的 AI。它是 TypeSafe AI 于 2026 年 9 月 15 日发布的 “Jev”。它并非专为撰写文本而设计的模型,而是专门用于分类、判断和评分等任务。它是名为 “System One models”(系统一模型)的新系列中的首款产品。(TypeSafe AI

不过,让我们先澄清一个误解。Jev 并不是在所有指标上都超越全球所有 AI,也不是在所有用例中都是最便宜的。 它的亮点在于能够以低成本和高速度集成基于语义的判断流程。

这并不意味着你要替换日常使用的聊天 AI。这可能意味着减少你当前使用的 AI 或业务系统中不必要的等待时间和成本。从这个角度来看,Jev 的吸引力便显现出来。

注:功能、定价和可用性信息截至 2026 年 9 月 18 日。

1. Jev 不是“写作 AI”,而是“返回决策结果的 AI”

Jev 的基本前提是传入必要的信息和提问,并以预定义的格式接收结果。输入的信息被称为 “state”(状态),但不必将其复杂化。它只是用于判断的材料集合,例如咨询正文、客户合同细节或内部规则。你可以不仅以文本形式传递这些信息,还可以使用包含项目名称和值的 JSON 格式。(TypeSafe AI

例如,假设一位客户联系你说:“我觉得我被重复扣费了,请检查一下。”

你要求 Jev 做的不是撰写道歉邮件。而是做出如下判断:“这属于哪个部门处理:计费、技术还是销售?”、“是否明确提出了退款请求?”以及“是否需要紧急响应?”

接收这些结果的程序会对咨询进行标记或通知负责人。如果需要回复,则再请求另一个生成式 AI 起草文本。你将判断与写作分离开来。 这种集成方法已在官方文档中记录。(TypeSafe AI

请注意,Jev 本身不会自主去读取电子邮件或发送给客户。获取信息、检查访问权限和执行操作由周围的程序处理。Jev 负责处理中间所需的判断。软件调用 AI 的接口是 API。(TypeSafe AI

2. 三大核心功能:选择、评分和概率判断

Jev 主要有三种问题格式。理解这些有助于明确它可以处理哪些任务。

Choice(选择):从预定义选项中挑选

Choice 是一个从准备好的列表中选择一项的功能。它可以用于诸如“路由到销售、支持还是会计?”或“这篇文章是入门级、实用型还是新闻类?”这样的分类。

返回值不仅仅是选中的项。你还会收到每个候选项的概率以及用于处理置信度的值。目前,每个问题最多可以设置 255 个选项。如果输入可能不属于任何类别,包含“其他”或“信息不足”是标准做法。(TypeSafe AI

Score(评分):根据标准进行评级

Score 根据有序的评价标准对项目进行评级。

例如,将咨询紧迫性定义为“标准响应”、“需快速响应”或“业务中断;需立即响应”。与其模糊地询问“重要性满分 100 分是多少”,不如解释每个阶段的具体含义。

输出包括分数以及每个阶段的概率。这些代表相对于标准的定位,而不是销售额或发生次数的精确计算。(TypeSafe AI

Noul:返回条件满足的概率

Noul 用于回答是非题,例如“这段文字包含取消意图吗?”结果是介于 0 和 1 之间的值。

关键在于区分“发生的可能性”和“实际响应动作”。因为取消可能性高,所以是否通知经理或与用户确认,这是你的决定。Noul 返回判断依据;它不制定政策。(TypeSafe AI

3. 为什么快?并行判断而非长答案

Jev 不是按顺序生成解释,而是并行返回固定答案和概率。TypeSafe 解释说,它使用了一种称为 “RLCD” 的训练方法,优先考虑判断和概率的适当性。其目标不同于创建人类偏好的文本。(TypeSafe AI

对于用户来说,关键优势是能够将多个问题捆绑在一起,针对单条信息进行查询。

例如,阅读一条咨询,同时检查“分类”、“紧迫性”、“退款请求”和“不满程度”。与等待一个结果后再发送下一个问题相比,这减少了通信往返次数。官方表示,增加问题通常不会显著增加响应时间。(TypeSafe AI

但是,更多的问题意味着更多的输入 token。没有无限的免费查询。此外,由于每个问题是独立评估的,需要顺序逻辑的过程(读取之前的答案)需要单独的调用或代码分支。(TypeSafe AI

如果你在想,“普通的生成式 AI 也能做分类和 JSON 输出吧?”——你是对的。OpenAI 和其他公司提供了结构化输出。Jev 的价值不在于发明结构化输出,而在于针对重复性的狭窄判断任务,专门优化速度、价格和概率输出。(OpenAI Developers

4. 有多便宜?每百万次请求(每次 1,000 tokens)仅需 $42

Jev 的公开 API 定价为每百万输入 token $0.042。输出 token 免费。 这不是每月无限套餐,而是按输入量付费。费用以 “token” 计算,这是 AI 处理文本的单位。(TypeSafe AI

为了直观展示,假设每次计费的输入为 1,000 tokens(包括上下文和问题)。

数量

Jev 输入成本

约日元(按 $1=¥150 计算)

10,000

$0.42

¥63

100,000

$4.20

¥630

1,000,000

$42.00

¥6,300

这是基于公开费率的简单计算,并非实测数据。汇率是假设值。如果输入大小增加五倍,成本也会增加五倍。

此外,这不包括数据获取、服务器、转录、其他生成式 AI 以及系统开发/维护的费用。这并不意味着“所有 100 万个业务任务都可以用 ¥6,300 完成”。请将这两者分开考虑。

尽管如此,对于在海量数据集上应用相同的检查,这个单价值得考虑。当持续处理数万条评论、咨询或文档时,低价最为重要,而不仅仅是处理少数几个咨询。

5. 应该相信“快 194 倍,便宜 445 倍”吗?

官方网站列出了诸如“快 193.6 倍”和“便宜 444.6 倍”的数据。然而,这些是基于针对 System One 类型任务的特定工作流评估得出的。这种差异并不适用于所有处理场景。(TypeSafe AI

TypeSafe 自己也指出,这些倍数代表了可实现改进的上限。基准测试使用了大模型的预测,并未证明在所有经过人工验证的业务案例中具有优越性。公布的 70–500ms 响应时间也必须结合网络条件和输入内容来考虑。(TypeSafe AI

一个有用的参考是 Classmethod 于 9 月 17 日发布的测量结果。对四种输入类型各评估十次(共 40 次),中位响应时间约为 0.643–0.674 秒,每次调用的成本约为 $0.000025–$0.000027。请注意,这是使用四个不同且易于理解的输入重复进行的验证,并不能保证在广泛的真实世界场景中具有准确性。(Classmethod DevelopersIO

不要只看营销倍数,而要关注:“对我的工作来说足够准确吗?比现在更便宜吗?比现在更快吗?”用你自己的数据进行验证,以决定是否采用。

6. Jev 的十个实际应用案例

基于官方示例,以下是实际应用。这些不是现成的应用程序,但需要将 API 与周围的基础设施结合起来。

① 分类咨询并确定响应顺序

创建一个系统,从咨询文本中判断内容、紧迫性和不满程度,并将其路由到相关部门或待办列表。(TypeSafe AI

即使标记为“Bug”,接近功能需求的请求也与导致业务中断的请求不同。先从标记关键联系人开始,而不是自动回复。

② 整理 SNS 评论以辅助规划

应用分类将 SNS 评论归类为“问题”、“投诉”、“见证”或“购前犹豫”。用户生成内容的标签化是官方用例之一。(TypeSafe AI

如果很多人说“看起来很难”,就在下一篇文章中展示步骤。如果很多人询问价格,就修正价格说明。使用 Jev 来组织反应以辅助规划,而不是批量生产帖子。

③ 优先处理销售线索

评估咨询是否提及具体问题、实施时间表或与你服务的契合度。为销售代表排列阅读顺序。(TypeSafe AI

不要仅凭文本就断定“这个人肯定会买”。分数用于优先级排序,而不是丢弃线索。

④ 为 RAG 筛选内部文档中的相关信息

在检索增强生成中,验证检索到的片段是否真的与问题相关。使用 Jev 判断相关性/矛盾性,并过滤进入回答 AI 的内容。(TypeSafe AI

对于休假政策问题,排除无关政策并优先适用法规。将搜索与评估搜索结果分开。

⑤ 验证 AI 引用

检查 AI 生成的声明是否与引用的来源匹配。官方示例使用代码验证引用的存在,并使用 Jev 判断语义支持。(TypeSafe AI

如果文本说“已证明有效”,来源可能仅暗示可能性。检查内容一致性,而不仅仅是 URL 的存在。

⑥ 发布前的 AI 响应检查

检查 AI 的输入/输出是否有危险请求或违反规则的情况,并将可疑项路由给人类。代码根据判断决定通过/阻止/审查。(TypeSafe AI

这对于检查回复是否承诺未确认的条款或泄露信息很有用。由于判断可能会出错,不要将其作为唯一的安全措施。

⑦ 仅将复杂请求路由到高端 AI

简单查询交给标准代码;解释性请求交给生成式 AI;复杂问题交给高性能模型/人类。使用 Jev 进行初步分流。(TypeSafe AI

仅仅为了返回订单号的运输状态,不需要长时间的推理。但要验证路由开销是否真正节省了时间/成本。

⑧ 从文档中提取候选项

当发票产生多个金额/联系人时,问 Jev “哪个是总额?”或“哪个是联系人?”官方示例通过代码提取候选项,然后使用 Jev 进行选择。(TypeSafe AI

不要把图像 OCR 或提取留给 Jev。让代码处理数学/日期比较。仅在需要判断的地方使用 AI。

⑨ 文章/帖子的语义检查

程序可以统计字符数。但检查“术语是否为初学者解释清楚了?”或“正文是否回答了标题?”需要阅读能力。语义检查是官方用例之一。(TypeSafe AI

问“引言中目标读者是否清晰?”或“前提条件是否陈述清楚?”而不是“这好吗?”。将编辑工作留给作家/AI。

⑩ 智能家居/App 操作选择

官方演示将自然语言请求分类以选择设备类型/动作。将人类语音映射到可执行命令。(TypeSafe AI

类似的逻辑适用于选择 App 操作。但定义候选项、权限、执行和错误处理需要单独的工作。Jev 不会自由控制你的 PC。

7. 轻松使用 Claude Code 或 Codex 进行测试

作为入口点,官方 Playground 允许你使用文本和问题进行测试。对于 API 使用,从管理面板获取密钥。在启动时,它是早期访问版本,设有候补名单。(TypeSafe AI

还有官方的 TypeSafe Skills,供 Claude Code 或 Codex 等编码 AI 使用。这些技能教会 AI 如何构建问题、API 格式和集成。安装 Skill 并不会用 Jev 替换你当前的模型。(TypeSafe AI

编码 AI 的示例提示词:

查看官方 TypeSafe Skill 和最新文档。创建一个原型,使用 Jev 对咨询 CSV 进行分类。 字段:分类、紧迫性、退款请求。 在选项中包含“其他”和“信息不足”。 将问题/标准存储在可编辑的位置。 从环境变量 TYPESAFE_API_KEY 加载 API 密钥;切勿记录它。 首先在匿名化的小数据集上进行测试。 保存原始文本、判断、概率、置信度、模型版本、时间、token 计数。 将不确定的判断/API 错误路由给人工审查。 不要实现向客户发送消息、退款或删除数据。

这是用于原型的。首先通过与已知正确数据比较结果开始,而不是完全自动化。

8. 使用前限制和注意事项

不要假设日语准确率等同于英语。 官方文档指出英语是主要训练语言。虽然支持日语,但准确率并不等同。请用真实的日语表达进行评估。(TypeSafe AI

在测试中包含边缘情况,如“Daijoubu desu”(是/否歧义)或“Not really urgent”(真/假紧迫性),以查看哪些需要人工升级。

目前,输入仅限文本。不支持直接的图像/音频/视频。Jev 不生成文本、代码或解释性理由。(TypeSafe AI

存在限制。Jev 1.13 支持每个请求总共 64k tokens,state + 最长问题的组合上限为 32k。公共速率限制为每分钟 1,200 次调用,可能会变化。在批量处理期间计划重试/等待。(TypeSafe AI

弱点包括计算、计数、日期比较、复杂的间接推理以及包含大量无关信息的输入。恶意提示可能会影响判断。提供聚焦的信息和清晰的问题。(TypeSafe AI

“零幻觉”并不意味着“零错误”。 它保证输出格式的遵循,而不是正确选择的判定。在二元选择中选择“会计”而不是“销售”,对于特定的咨询来说可能仍然是错误的。“零”的说法指的是格式有效性。(TypeSafe AI

Choice/Score 中的置信度分数源自概率分布。“0.9”并不保证在你的特定业务中有 90% 的准确率。Noul 缺少此字段。通过业务特定的验证定义自动化阈值。(TypeSafe AI

检查数据处理。官方政策声明客户数据不用于模型训练,企业选项提供不保留服务。然而,“不用于训练”不同于“从不存储”。在输入客户信息之前审查合同。(TypeSafe AI

9. 最好用于特定部分,而非完全替换

我会从咨询分类、评论整理和草稿审查候选项开始。这些允许人工纠正并容易比较结果。最初避免委托最终的退款决定或关键的合同判断。

监控的不仅是准确率,还有遗漏的案例、人工审查量、处理时间和总成本。如果纠错劳动增加,较低的 API 费用就会失去价值。

有些人可能会失望,因为 Jev 不能写作或创建图像。但并非所有 AI 都需要做同样的工作。

让写作 AI 写作。让代码计算。让人类判断关键的专业事项。测试 Jev 是否能处理分类和验证这一庞大的中间层。

Jev 的魅力不在于做所有事情,而在于为必要的判断启用廉价、频繁的调用。 考虑它在你的“读取 → 排序 → 验证”工作流程中适合的位置。这种清晰度定义了测试这个 AI 的目的。

一键保存

使用 YouMind AI 深度阅读爆款文章

保存原文、追问细节、总结观点,并在一个 AI 工作空间里把爆款文章沉淀成可复用笔记。

了解 YouMind
写给创作者

把你的 Markdown 变成干净的 𝕏 文章

图片上传、表格、代码块,往 𝕏 上手动重排太痛苦。YouMind 把整篇 Markdown 一键转成干净、可直接发布的 𝕏 文章草稿。

试试 Markdown 转 𝕏

更多可拆解样本

近期爆款文章

探索更多爆款文章