这是给外行看的极简版总结。
把 AI 想象成做选择题,而不是写作文。
它不聊天。它做出你的软件可以执行决策:"是垃圾邮件吗?""这个 Agent 应该用哪个工具?""这需要人工介入吗?"
令人兴奋的是:在 TypeSafe 自己的工作流程基准测试中,它的速度大约比前沿 LLM 快 200 倍,成本低 400 倍,响应时间仅需几分之一秒。
为什么这很强大:想象一下,一个应用或 Agent 可以在不进行数百次昂贵、缓慢的 LLM 对话的情况下,做出数百个微小的判断。
把大模型留给复杂的思考和写作。用 Jev 来处理中间那些快速连续的决策。
哦对了,它是由 Diogo Almeida 随手做出来的——他是 ChatGPT 的共同创造者之一,也是 RLHF 的共同发明人之一,为此秘密研发了两年。
这就是宣传语。以下是实际数据。
九次 /last30days 扫描,完整阅读了每一个原始文件,并手动对照实时页面检查了每一篇热门帖子。发布两天后,启动帖已获得 6.6 万点赞和 3140 万浏览量。
https://x.com/CompleteSkeptic/status/2099925682726002904
基于此构建的一个浏览器 Agent 一天内获得了 180 万浏览量。还有一位开发者算了一笔账:大约 5,000 次请求花费约 2 美元,涵盖分类、模型路由、意图识别和引导等任务。
https://x.com/MichaelLee04/status/2100003037150683593
我没有亲自运行这些工作流。我将研究重点放在社区上,并对人们实际交付的项目进行了排名。在 31 个有明确来源和真实数据的候选工作流中,以下 9 个值得借鉴,每个都附带了可直接复制的代码片段。
🧠 机制原理,六十秒速览
你提供应用状态和一个类型化的问题,它返回一个带有概率的类型化决策。无需 JSON 提示,无需解析层,无需验证。
三种问题类型,这就是全部功能界面:Choice 从最多 255 个选项中选择一个,Score 将某物置于量表上,Noul 以 0 到 1 之间的数字回答是或否。每个答案都包含 probabilities(概率)和 confidence(置信度)分数。在一次调用中就同一状态询问二十个问题,它们会并行评估,因此二十个问题的成本与一个问题大致相同。输入价格为每百万 token $0.042。输出免费。
社区得出了与我推文相同的框架,且影响力更大:LLM 生成答案,Jev 做出决策,获得 2,278 个赞。
我的头条数据有一个脚注。TypeSafe 将响应时间定为 70 到 500 毫秒,比前沿模型快 40 到 200 倍。他们主页上展示的精确对比数据,来自其内部工作流评估,显示速度快 193.6 倍,成本低 444.6 倍。作为基准的对比对象很重要:
所以,看看他们的主页,首先映入眼帘的就是与 GPT-5 X Terra(OpenAI 的中端模型之一)的并排对比。
- Nimrod, YouTube, 13,747 次浏览
这个名字并不是对 Kahneman 的致敬,尽管该模型类别被称为 System One。
Jev 这个名字的真正来源不是 Kahneman,而是 19 世纪的经济学家 William Stanley Jevons。
- Dots and Arrows, YouTube, 14,597 次浏览
杰文斯悖论:让一种资源变得更便宜,人们就会消耗更多。以这一概念命名你的决策模型,本身就是一种宣言。
这也成了一个梗。Rob Shocks 在他的 231,655 次浏览的分析视频 中插入了一个 "My name is Jeff" 的片段,而获得 142 个赞的最高评论只写了 "My name is Jev killed me."(我叫 Jev,笑死我了)。Diogo 本人也一直在 回应这些玩笑,获得 129 个赞。
1. 🌐 一个浏览器 Agent,7 秒找到航班,花费 $0.0039
这是什么。 一个小型开源浏览器 Agent,由 Jev 选择下一次点击,只有当需要输入内容时,一个小 LLM 才会被唤醒。
谁在运行它。 Gregor Zunic,Browser Use 创始人。7.2K 赞,180 万浏览,7.6K 收藏。他在帖子中指出视频是以 1x 速度播放的。
https://x.com/gregpr07/status/2100411066966749359
为何入选。 这是任何人基于该模型构建的最受关注的项目,也是最清晰地展示了持续获胜的模式:每一步都有新的动作空间,DOM 作为状态,Jev 在候选项中进行选择,仅在必要时回退到生成式模型。LangChain 自己的文章提到,Browserbase 的 Kyle Jeong 正在以几分钱的成本做同样的事情。
代码库如下:browser-use/jev-ultrafast。在你自己写之前,先克隆它。
2. 🧹 即时压缩:为每个工具调用打分并丢弃垃圾
这是什么。 用一个 Jev 过程替换每个编码 Agent 在上下文达到上限时运行的摘要提示,该过程会为每个工具调用的相关性打分并删除无用部分。
谁在运行它。 Tamara Tran 提出问题并在同一下午给出了答案。5K 赞,55.44 万浏览。
https://x.com/tamarajtran/status/2100694549362553153
Alex Volkov 将其作为 Claude 插件运行并发布了数据:一秒内将会话从近 100 万 token 压缩到 8.6 万 token。1.9K 赞,3.5K 收藏。
https://x.com/altryne/status/2100739055923425589
为何入选。 因为 Diogo 的回复揭示了这一方向的未来。304 赞。
https://x.com/CompleteSkeptic/status/2100702845779775675
如果框架能在一秒钟内完成评分和丢弃,而不是进行摘要,那么上下文窗口就不再是你设计时需要围绕的核心限制。这是一个潜力股。Browser Use 在视频演示上更出色;但压缩功能是今天每个编码 Agent 用户都能立即感受到的痛点。
将此粘贴到 Claude Code 中,这正是 Alex 的确切安装指令:
1Install, and configure: https://github.com/tamaratran/fast-jev-compaction
3. 🛡️ 从框架中解耦的安全审查员
这是什么。 每个编码框架都会运行一个分类器,在自动模式允许执行命令前询问"这条命令应该执行吗?"直到本周,这个分类器一直存在于产品的封闭部分。
谁在运行它。 Vercel,在生产环境中。Guillermo Rauch:fx 中的默认模式是 auto,配备安全审查员分析每条命令,Jev 在 p95 延迟下比当前运行的模型快多达 18 倍,且准确率更高。3.7K 赞,39.24 万浏览。
https://x.com/rauchg/status/2100307962262872105
https://x.com/fazxes/status/2100300097695232164
为何入选。 因为这是一次带有 p95 数据的生产环境迁移,而且 LangChain 第二天就发布了开源版本 AutoModeMiddleware。Rob Shocks 的分析,拥有 231,655 次浏览和 3,526 个赞,适合发给想在十分钟内了解全貌的同事。
LangChain 的版本,逐字摘自他们的帖子:
1from langchain.agents import create_agent2from langchain_typesafe.experimental.middleware import (3 AutoModeMiddleware,4)56guardrail = AutoModeMiddleware(tools=["bash"])78agent = create_agent("openai:gpt-5.6-luna", middleware=[guardrail])
4. 🚦 作为中间件而非系统提示的模型路由
这是什么。 将 Jev 置于你的模型集群前端,让它决定哪个大脑处理每个请求,并将概率保留在 Agent 状态中,以便你可以审计选择结果。
谁在运行它。 LangChain,在 Sydney Runkle 的文章《使用 Jev 构建框架》中。232 赞,3.11 万浏览,是目前发布的关于如何接入的最清晰指南。
https://x.com/sydneyrunkle/status/2100754364545761643
为何入选。 在整个语料库中,模型路由是该模型被引用最多的用途;它是本文开头提到的"5,000 次请求花费 2 美元"帖子中的五种工作负载之一。LangChain 将其从系统提示中的一段文字变成了可读的十一行代码。
1from langchain.agents import create_agent2from langchain_typesafe.experimental.middleware import (3 ModelChoice,4 ModelRouterMiddleware,5)67router = ModelRouterMiddleware(8 choices={9 "fast": ModelChoice(10 model="openai:luna",11 criteria="Direct lookups, extraction, and localized changes.",12 ),13 "powerful": ModelChoice(14 model="openai:sol",15 criteria="Architecture and high-stakes decisions.",16 ),17 },18 instructions="Choose the least costly model that can complete the task.",19)2021agent = create_agent("openai:gpt-5.6-luna", middleware=[router])
通过 \pip install langchain-typesafe\ 安装并设置 \TYPESAFE_API_KEY\。
5. 🔎 RAG 精度:照常检索,然后删除不属于的内容
这是什么。 保持你的检索器原样不变。对返回的每个块运行一次 Jev,提出一个是非问题,并删除未通过的块。
谁在运行它。 Kush Bhuwalka 用一句话概括:对所有检索到的块运行 Jev 并删除无关项。416 赞。
https://x.com/kushbhuwalka/status/2100731050075050485
为何入选。 精度一直是 RAG 未解决的半个难题,因为解决方案总是需要对每个块进行一次额外的 LLM 调用,这在检索阶段没人负担得起。在输出 token 免费且亚秒级延迟的情况下,对每个块的判定比产生该块的嵌入查找还要便宜。这是我根据文档 API 编写的,采用了 Kush 描述的结构:
1from typesafe_sdk import Noul, TypeSafeClient23client = TypeSafeClient()45kept = []6for chunk in retrieved_chunks:7 verdict = client.system_one(8 state={"question": user_question, "chunk": chunk.text},9 questions={10 "relevant": Noul(11 instructions="The chunk contains information needed to answer the question",12 ),13 },14 )15 if verdict.answers["relevant"].noul > 0.5:16 kept.append(chunk)
6. 🎮 实时循环:Minecraft、Doom 和一个读取你心思的启动器
这是什么。 在每秒运行多次的循环中进行决策,前沿模型根本无法参与其中。
谁在运行它。 Wuyang Zhou 让 Jev 和 GPT-6 Astra 一起玩 Minecraft,Jev 负责快速反应,Astra 负责提前规划,同时对抗多个僵尸。374 赞,5.14 万浏览。
https://x.com/wuyang_zhou/status/2100727660875808913
Nader Dabit 构建了一个按键预言机:输入"我刚下载的 pdf",最新的 PDF 已经在每次按键时成为首选命中项,具有完全置信度,耗时约 100 毫秒。264 赞.
为何入选。 TypeSafe 自己的启动演示是 Doom,模型每秒被询问约十次该做什么。两个独立的解说者计算出了该循环的相同成本:
Jev 以每秒约 10 个决策的速度实时游玩,换算下来约为每小时 7 美元。
- AI WITH Rithesh, YouTube, 19,904 次浏览
每小时 7 美元实现每秒十个决策,使其处于与 LLM 完全不同的类别,而 Minecraft 的分工(快模型反应,慢模型规划)是本列表中每个实时选择的共同模式。
7. 📬 批量规模的电子邮件分类
这是什么。 将 Jev 指向收件箱导出文件,让它并行对每条消息进行分类、评分和标记。
谁在运行它。 YouTube 上的 vogel channel,60,996 次浏览和 526 个赞,使用 8 个工作进程以每批 100 封的方式处理了 1,500 封导出的电子邮件。LangChain 的文章将 Ryan Vogel 列为其关注的三个项目之一。Syntax,33,933 次浏览和 1,052 个赞,构建了同样的东西,外加一个家庭自动化演示,从提问到 API 调用仅需 300 毫秒。
为何入选。 这是语料库中被复制最多的演示,吞吐量计算是关键。
我们这里只剩下 5 美元的余额,这恰恰说明了这个模型有多便宜。
- vogel, YouTube, 60,996 次浏览
这是 TypeSafe 自己的快速入门,逐字摘录,已经是一个电子邮件分类管道:
1pip install typesafe-sdk
1from typesafe_sdk import Choice, Noul, Score, TypeSafeClient23client = TypeSafeClient()45response = client.system_one(6 state="Hi, I've been trying to connect my Stripe account for 3 days and it keeps failing. I'm losing sales. Please help ASAP.",7 questions={8 "department": Choice(9 instructions="Which team should handle this",10 criteria={11 "billing": "Payment or subscription issues",12 "technical": "Bugs or integration problems",13 "sales": "Pricing or account questions",14 },15 ),16 "frustration": Score(17 instructions="How frustrated the customer appears",18 criteria=[19 "Calm, just stating facts",20 "Frustrated but civil",21 "Very angry, strong language",22 ],23 ),24 "is_urgent": Noul(25 instructions="The message conveys urgency or time-sensitivity",26 ),27 },28)2930print(response.answers["department"].choice)31print(response.answers["frustration"].score)32print(response.answers["is_urgent"].noul)
8. 🗂️ 文档映射归约:四分之一美分完成 777 次判断
这是什么。 一组问题,所有文档,一次性处理。这是以前沿模型在经济上不可能实现、且经典分类器表现平平的工作负载。
谁在运行它。 Every 的评估负责人 Mike Taylor 进行了迄今最干净的测试:他自己的 27 篇文章加上 10 篇 AI 风格的文章,每篇 21 个问题,全部在一个请求中完成。777 次判断在不到 0.7 秒内完成,花费约四分之一美分。在他所有的十一次实验中,1,709 次判断花费不到一美分。AI Daily Brief,10,000 次浏览,当天就引用了这个数据。
为何入选。 TypeSafe 在其用例地图上将此列为一手类别:"大数据上的 AI Map Reduce"。免费的输出 token 改变了任何按行运行的任务的算术逻辑。来自文档的原始 HTTP 格式足够小,可以放在这里:
1{2 "model": "jev-latest",3 "state": "Hi, I've been trying to connect my Stripe account for 3 days and it keeps failing. I'm losing sales. Please help ASAP.",4 "questions": {5 "is_urgent": {6 "type": "noul",7 "instructions": "The message conveys urgency or time-sensitivity"8 }9 }10}
这将返回 \{"is_urgent": {"type": "noul", "noul": 0.999}}\。在 \questions\ 对象中提出二十个问题的成本与一个问题大致相同,因此在单次调用中询问你想了解的每一行的所有信息。
9. 🧪 浏览器中的 Jev 及其克隆版
这是什么。 接口,由希望拥有其形态但不依赖其服务的人在本地模型之上重新实现。
谁在运行它。 Shopify 的 Kshetrajna Raghavan 构建了 Reflex,一个在 WebGPU 上运行结构化决策并带有概率的 Qwen 模型,完全在浏览器中运行。Tobi Lütke 转发了它:206 赞,3.85 万浏览。
https://x.com/tobi/status/2100742327459303882
一个逆向工程的 jevlike 在发布两天后登上了 Hacker News 首页并获得 157 分,而 mini-jev(本地 LLM 上的相同接口)紧随其后一天出现。社区目录 awesome-jev-by-typesafe 在我抓取时有 409 颗星。
为何入选。 72 小时内出现三个独立克隆版,是本次扫描中关于接口是否是真正发明的最强信号。它还为你提供了离线逃生舱口,用于处理任何不能通过网络发送的内容,这一点很重要,因为真正的产品仅支持 API 且托管在美国。现在就在标签页中尝试 Reflex。
📖 TypeSafe 建议使用方式
四条规则,来自文档和创始人的回复:
- 每次调用问多个问题。它们并行评估,文档指出额外的问题几乎不会改变响应时间。上面每个给人留下深刻印象的选择都在就一个状态询问多件事。
- 基于置信度设定阈值。文档告诉你将低于 0.3 到 0.5 的任何值视为寻求人工帮助的信号,而不是直接行动。这就是分类器(给你标签)和决策系统(给你标签以及使用该标签的许可)之间的区别。
- 提供候选项,不要让它凭空创造。Browser Use 从 DOM 构建动作空间,Jev 进行选择。RAG 检索,Jev 过滤。启动器排序,Jev 重排序。Choice 支持最多 255 个选项;为边缘情况添加一个"其他"。
- 确保评分正确,否则其他都不重要。一位开发者花了一周时间试图破解它,他直言不讳地说:"如果你没搞对评分,它就不起作用。"选项集和问题措辞才是真正的工作;调用本身微不足道。
你可以在哪里试用:它已经集成在你使用的网关后面。Vercel AI Gateway 在 48 小时内接入,以 2,341 个赞成为该公司第二大帖子,仅次于秘密公告。
https://x.com/typesafeai/status/2100376436272173088
Cloudflare AI Gateway,749 个赞,以及 OpenRouter 测试版,387 个赞,均在同一周。直接访问是 \POST [https://api.typesafe.ai/v1/systemone](https://api.typesafe.ai/v1/systemone)\ 并使用 Bearer token。
⚖️ 诚实的注意事项
Hacker News 的发布线程 "Introducing System One Models and Jev",1,863 分和 490 条评论,大部分篇幅集中在营销中的一个短语:
另外,'不能产生幻觉'似乎不对?是的,它不能发出无效类型,但它仍然可以发出完全错误的有效值。
- jacobgold, Hacker News 发布线程, 1,863 分
Diogo 没有反驳。当一位评论者指出这是一个分类模型而不是 LLM 时,他称解释"非常准确!"并补充说他只会说 zero-shot(零样本)而不是 instruction-tuned(指令微调)。这才是诚实的定位,比发布日炒作所称的新型智能要小得多:一个带有校准概率和真实 API 的非常好的零样本分类器。
Reddit 上最大的 Jev 线程是关于谁先构建了它。r/LocalLLaMA 的 "I literally built the Jev architecture one year back and completely open-sourced it with model, dataset and paper",1,568 个赞和 164 条评论,引出了总结整个行业情绪的一条回复:
但你有没有发帖说它是下一个大事件?新手错误
- hapliniste, Reddit, 495 个赞
同一线程中获得 351 个赞的安慰性回复:由于之前的工作,没有人能申请通用想法的专利并将其封锁。
Every 的 Mike Taylor 将 12 个植入缺陷的段落分别通过 Jev 和高努力程度的 Fable 5.1 进行处理。Jev 的中位数为每段 0.35 秒,而 Fable 为 8.83 秒,快约 25 倍,便宜约 580 倍。它还发现了七个缺陷中的六个。Fable 发现了全部七个。他的结论:作为预警系统很有用,因为替代方案是完全不检查。针对 gpt-6-astra 的研究循环进行的第二个较小的并排测试显示端到端快约 7 倍,中位决策时间为 213ms 对比 2,436ms,两条路径均 3/3 正确,这是真实且有用的,但远未达到 200 倍。正如 AISeeKing 从图表中读出的那样,TypeSafe 自己的四个工作流平均值为与参考答案的 67.8% 一致性。
炒作疲劳也是真实的。在一个以"我真心认为这可能是一个游戏规则改变者"开头的 75,750 次浏览解说视频 中,获得 262 个赞的最高评论是"这可能是我最讨厌的一句话。"
而在整个扫描中最尖锐的反应是一位看完整个解说视频却一无所获的观众:
我看完了整个视频,仍然不知道 JEV 是什么或做什么。
- Nullzero98, YouTube, 19 个赞
这条评论正是这篇文章存在的原因。解决这个问题的规则来自一位多年来一直以这种方式构建的开发者,它可以印在贴纸上:AI 执行,代码决策。
🔍 我是如何选择这些内容的
跨 X、YouTube、Hacker News、Reddit、TikTok、Instagram、Digg、GitHub 和 arXiv 的十一次 /last30days 运行返回了 716 个项目。我完整阅读了每个原始文件,然后打开了每个有真实热度的帖子,并对照实时页面检查了其数据,因为关于这款两天龄产品的最大帖子并不在关键词搜索预期的位置。39 个候选工作流有明确的来源和真实的数据。我保留了 9 个。没有任何作者或频道占据超过两个选择。每个参与度数据都是我在抓取时 X 或 YouTube 显示的数值,并按照它们的舍入方式精确舍入。
关于代码:四个代码片段是逐字引用的。电子邮件分类块是来自他们文档的 TypeSafe 官方快速入门,原始 JSON 格式来自同一文档,两个中间件块是从 LangChain 的帖子中复制的。Alex Volkov 的压缩安装行是他的确切措辞。我自己根据文档 API 编写了 RAG 过滤器,采用了 Kush 描述的结构,它是一个骨架良好的草稿,而不是任何人在生产环境中运行过的东西。
嵌入仅用于那些赢得关注度的帖子。几百个赞以下的帖子改为内联链接,因为将一个帖子放大成引用卡片看起来只是证据而已。
🔑 精选案例中的共性模式
- 快模型负责反应,慢模型负责规划。无论是 Minecraft、发布帖中的维基百科竞速、Browser Use 还是上下文压缩(compaction),都遵循这一分工逻辑。
- 喂给它候选项。赢家从不让 Jev 凭空生成选项。他们通过代码从 DOM、检索器、工具调用轨迹或启动器索引中构建选项集,然后让它从中挑选。
- 免费输出 token 的价值远超速度指标本身。这里提到的每个按行或按块处理的工作负载,其可行性都由价格解锁。
- 置信度分数才是产品核心。如果没有一个经过校准的数值作为阈值依据,这只是一个快速分类器;有了它,它就变成了一个知道何时停止的决策层。
- 创新在于界面,而非权重。72 小时内出现了三个可用的克隆版本,而最大的 Reddit 讨论帖来自一位一年前就发布了该架构的人。
- 学术版本其实来得更早。arXiv 上的 TabAgent 提出了同样的论点:用分类器替代路由、门控和验证调用,只是没有配套的产品形态。
- 社区已经为它起了最贴切的名字。一位开发者在整理大家正在发布的项目时,将其命名为 "AI if statement",这是目前关于该模型最有用的三个词。
🧵 我会怎么用它
把大模型留给复杂的思考和写作任务。将这个小模型部署到循环中每一个廉价的判断环节,基于置信度设置阈值,并将低于 0.5 的情况升级给更大的模型或人工处理。今天就安装上下文压缩插件吧,因为那是你今晚就能感受到效果的功能。
📊 所有 Agents 反馈汇总
Reddit 113 个帖子 / 24,425 个赞 / 4,159 条评论;X 314 条推文 / 30,192 个赞 / 1,538 次转发,另有 13 条经人工对照实时页面核实;YouTube 75 个视频 / 4,545,636 次观看;TikTok 36 个视频 / 171,040 次观看;Instagram 14 条 Reels / 10,778 个赞;Hacker News 133 个故事 / 25,312 分 / 11,852 条评论;GitHub 6 个仓库 / 842 颗星;Digg 7 个聚类 / 119 篇帖子;arXiv 18 篇论文。数据汇总自 2026-09-17 执行的十一次 /last30days 运行结果,统计数值为去重前的各次运行总和。





