Jev 是什麼?9 種人們已經在用它打造的應用

@mvanhorn
英語2026年9月18日
137K
702
47
24
1.8K

TL;DR

Jev 是一款專為快速、低成本決策而非文字生成所設計的 AI 模型。本文詳細介紹九種實際應用場景,例如瀏覽器自動化、RAG 過濾和模型路由,並突顯其相較於傳統 LLM 的效率優勢。

Here is the tl;dr ELI5.

把 AI 想成選擇題,而不是作文。

它不聊天。它做出你的軟體可以據以行動的決策:「是垃圾郵件嗎?」「這個 Agent 該用哪個工具?」「這需要人類介入嗎?」

令人興奮的部分:根據 TypeSafe 自家工作流的基準測試,它比前沿 LLM 快約 200 倍、便宜約 400 倍,回應時間僅需幾分之一秒。

為什麼這很強大:想像一個 App 或 Agent 在不需要與 LLM 進行數百次昂貴且緩慢對話的情況下,就能做出數百個微小的判斷。

讓大模型負責艱難的思考與寫作。中間那些快速決策,交給 Jev

噢,對了,這是 Diogo Almeida 隨手做出的作品,他是 ChatGPT 的共同創造者之一,也是 RLHF 的共同發明人之一,並花了兩年時間潛心研發。

這就是行銷話術。以下是實際數據。

九次 /last30days 掃描,完整讀取每個原始檔案,並逐一核對每個熱門貼文與即時頁面。發布兩天后,啟動貼文已獲得 66K 個讚和 3,140 萬次觀看。

https://x.com/CompleteSkeptic/status/2099925682726002904

基於此構建的瀏覽器 Agent 一天內獲得了 180 萬次觀看。還有一位開發者計算了他的帳單:大約 5,000 次請求花費約兩美元,涵蓋分類、模型路由、意圖識別和引導。

https://x.com/MichaelLee04/status/2100003037150683593

我沒有親自執行這些工作流。我將研究指向社群,並對人們實際部署的內容進行排名。在 31 個有具名來源和真實數據的候選工作流中,這 9 個值得借鑑,每個都附有可直接複製的程式碼片段。

🧠 運作機制,六十秒速覽

你提供 App 的狀態加上類型化的問題,它回傳帶有概率的類型化決策。無需 JSON 提示詞,無需解析層,無需驗證。

三種問題類型,這就是全部介面:Choice 從最多 255 個選項中選一個,Score 將某物放在量表上,Noul 以 0 到 1 之間的數字回答是或否。每個答案都帶有 probabilitiesconfidence 分數。在一次呼叫中就同一狀態問二十個問題,它們會平行評估,因此二十個的成本約等於一個。輸入價格為每百萬 token $0.042。輸出免費。

社群採用了與我的推文相同的框架,但影響力更大:LLM 生成答案,Jev 做出決策,獲得 2,278 個讚。

我的標題數據附帶註腳。TypeSafe 將回應時間定為 70 到 500 毫秒,比前沿模型快 40 到 200 倍。他們主頁上來自自家工作流評估的確切配對數據是:快 193.6 倍,便宜 444.6 倍。比較的基準很重要:

所以,這是他們的主頁,他們首先向你展示的是與 GPT-5 X Terra(OpenAI 的中階模型之一)的並排對比。

這個名字並非致敬 Kahneman,儘管模型類別被稱為 System One。

這裡才是 Jev 名字的真正來源,不是 Kahneman,而是 19 世紀經濟學家 William Stanley Jevons。

傑文斯悖論(Jevons paradox):讓資源更便宜,人們就會消耗更多。以這命名你的決策模型就是一種立場聲明。

這也是一個梗。Rob Shocks 在他的 231,655 次觀看解析影片中剪輯了一段「My name is Jeff」的片段,頂部評論獲得 142 個讚,內容只是「My name is Jev killed me」。Diogo 也親自回應了這些玩笑,獲得 129 個讚。

1. 🌐 一個瀏覽器 Agent,7 秒找到航班,成本 $0.0039

這是什麼。 一個小型開源瀏覽器 Agent,由 Jev 決定下一次點擊,只有當需要輸入文字時才喚醒一個小型 LLM。

誰在運行。 Gregor Zunic,Browser Use 創辦人。7.2K 個讚,180 萬次觀看,7.6K 個書籤。他在貼文中指出影片是以 1x 速度播放。

https://x.com/gregpr07/status/2100411066966749359

為什麼入選。 這是任何人基於該模型構建的最受矚目的項目,也是最清晰地展示了持續勝出的模式:每一步都有新的動作空間,DOM 作為狀態,Jev 在候選項中選擇,僅將生成作為備用方案。LangChain 自己的文章提到 Browserbase 的 Kyle Jeong 也在做同樣的事情,成本僅為幾分之一美分。

關鍵在於倉庫:browser-use/jev-ultrafast。在你自己寫之前,先克隆它。

2. 🧹 即時壓縮:評分每個工具呼叫並丟棄垃圾

這是什麼。 取代每個編碼 Agent 在上下文達到上限時執行的摘要提示詞,改用 Jev 通過來評分每個工具呼叫的相關性並刪除無用部分。

誰在運行。 Tamara Tran 提出問題並在當天下午給出了答案。5K 個讚,554.4K 次觀看。

https://x.com/tamarajtran/status/2100694549362553153

Alex Volkov 將其作為 Claude 插件運行並公布了數據:一秒鐘內將一個會話從近 100 萬 token 壓縮到 86K。1.9K 個讚,3.5K 個書籤。

https://x.com/altryne/status/2100739055923425589

為什麼入選。 因為 Diogo 的回覆揭示了未來的走向。304 個讚。

https://x.com/CompleteSkeptic/status/2100702845779775675

如果一個框架可以在一秒鐘內評分並丟棄,而不是進行摘要,那麼上下文窗口就不再是你設計的核心限制。這是一個潛在的黑馬。Browser Use 在視頻演示上表現更好;壓縮則是每個編碼 Agent 用戶今天都能感受到的價值。

將此貼入 Claude Code,這是 Alex 確切的安裝指令:

text
1Install, and configure: https://github.com/tamaratran/fast-jev-compaction

3. 🛡️ 從框架中解耦的安全審查員

這是什麼。 每個編碼框架在自動模式允許命令執行前,都會運行一個分類器詢問「應該執行這個命令嗎?」直到本週,這個分類器一直存在於產品的封閉部分。

誰在運行。 Vercel,生產環境。Guillermo Rauch:fx 中的預設模式是 auto,配有安全審查員分析每個命令,而 Jev 在 p95 延遲上比目前運行的模型快多達 18 倍,準確度更高。3.7K 個讚,392.4K 次觀看。

https://x.com/rauchg/status/2100307962262872105

https://x.com/fazxes/status/2100300097695232164

為什麼入選。 因為這是一次帶有 p95 數據的生產遷移,而且 LangChain 第二天就發布了開源版本 AutoModeMiddlewareRob Shocks 的解析,231,655 次觀看和 3,526 個讚,適合發給想在十分鐘內了解全貌的隊友。

LangChain 的版本,逐字引用自他們的文章:

python
1from langchain.agents import create_agent
2from langchain_typesafe.experimental.middleware import (
3 AutoModeMiddleware,
4)
5
6guardrail = AutoModeMiddleware(tools=["bash"])
7
8agent = create_agent("openai:gpt-5.6-luna", middleware=[guardrail])

4. 🚦 作為中介軟體而非系統提示詞的模型路由

這是什麼。 將 Jev 置於你的模型艦隊前端,讓它挑選處理每個請求的大腦,並將概率保留在 Agent 狀態中以便審計選擇。

誰在運行。 LangChain,在 Sydney Runkle 的「Building a Harness with Jev」中。232 個讚,31.1K 次觀看,以及任何人發布的最清晰的如何連接指南。

https://x.com/sydneyrunkle/status/2100754364545761643

為什麼入選。 模型路由是整個語料庫中該模型最常被引用的任務;它是本文開頭提到的「5,000 次請求花 2 美元」貼文中的五个工作负载之一。LangChain 將其從系統提示詞中的一段話變成了你可以閱讀的十一行代碼。

python
1from langchain.agents import create_agent
2from langchain_typesafe.experimental.middleware import (
3 ModelChoice,
4 ModelRouterMiddleware,
5)
6
7router = ModelRouterMiddleware(
8 choices={
9 "fast": ModelChoice(
10 model="openai:luna",
11 criteria="Direct lookups, extraction, and localized changes.",
12 ),
13 "powerful": ModelChoice(
14 model="openai:sol",
15 criteria="Architecture and high-stakes decisions.",
16 ),
17 },
18 instructions="Choose the least costly model that can complete the task.",
19)
20
21agent = create_agent("openai:gpt-5.6-luna", middleware=[router])

使用 \pip install langchain-typesafe\ 安裝並設置 \TYPESAFE_API_KEY\

5. 🔎 RAG 精度:照常檢索,然後刪除不屬於那里的內容

這是什麼。 保持你的檢索器原樣。對其返回的每個區塊運行一次 Jev,問一個是非題,並刪除未通過的區塊。

誰在運行。 Kush Bhuwalka 用一句話概括:對其檢索到的所有區塊運行 Jev 並刪除無關的區塊。416 個讚。

https://x.com/kushbhuwalka/status/2100731050075050485

為什麼入選。 精度一直是 RAG 未解決的一半問題,因為解決方案總是在檢索時為每個區塊增加另一個 LLM 呼叫,沒人負擔得起。在輸出 token 免費和亞秒級延遲的情況下,每個區塊的判決比產生該區塊的嵌入查找還要便宜。這一條我是根據記錄的 API 寫的,採用 Kush 描述的形狀:

python
1from typesafe_sdk import Noul, TypeSafeClient
2
3client = TypeSafeClient()
4
5kept = []
6for chunk in retrieved_chunks:
7 verdict = client.system_one(
8 state={"question": user_question, "chunk": chunk.text},
9 questions={
10 "relevant": Noul(
11 instructions="The chunk contains information needed to answer the question",
12 ),
13 },
14 )
15 if verdict.answers["relevant"].noul > 0.5:
16 kept.append(chunk)

6. 🎮 即時迴圈:Minecraft、Doom 和一個讀心的啟動器

這是什麼。 在每秒運行多次的迴圈內的決策,前沿模型根本無法參與其中。

誰在運行。 Wuyang Zhou 讓 Jev 和 GPT-6 Astra 一起玩 Minecraft,Jev 負責快速反應,Astra 負責規劃,同時對抗多個殭屍。374 個讚,51.4K 次觀看。

https://x.com/wuyang_zhou/status/2100727660875808913

Nader Dabit 建立了一個鍵入預言機:輸入「我刚下载的 pdf」,最新的 PDF 已經成為每次鍵入時的頂級結果,具有完全信心,耗時約 100 毫秒。264 個讚

為什麼入選。 TypeSafe 自己的啟動演示是 Doom,模型每秒被詢問約十次該怎麼做。兩個獨立的解釋者計算出該迴圈的相同成本:

Jev 以實時方式遊玩,大約每秒 10 個決策,算下來大約每小時 7 美元。

每小時七美元換取每秒十個決策,使其與 LLM 處於不同的類別,而 Minecraft 的分工——快速模型反應,慢速模型規劃——是本列表中每個即時選擇共享的模式。

7. 📬 批次規模的電子郵件分流

這是什麼。 將 Jev 指向收件匣匯出檔,讓它平行排序、評分和標記每則訊息。

誰在運行。 YouTube 上的 vogel channel,60,996 次觀看和 526 個讚,以 8 個 worker 每批 100 封的方式處理了 1,500 封匯出的電子郵件。LangChain 的文章將 Ryan Vogel 列為其關注的三個專案之一。Syntax,33,933 次觀看和 1,052 個讚,建立了相同的東西,外加一個家庭自動化演示,從問題到 API 呼叫只需 300 毫秒。

為什麼入選。 這是語料庫中被複製最多的演示,吞吐量計算才是重點。

我們這裡只剩下 5 美元的餘額,這正好顯示這個模型有多便宜。

  • vogel, YouTube, 60,996 views

這是 TypeSafe 自己的快速入門,逐字引用,它已經是一個電子郵件分流管道:

bash
1pip install typesafe-sdk
python
1from typesafe_sdk import Choice, Noul, Score, TypeSafeClient
2
3client = TypeSafeClient()
4
5response = client.system_one(
6 state="Hi, I've been trying to connect my Stripe account for 3 days and it keeps failing. I'm losing sales. Please help ASAP.",
7 questions={
8 "department": Choice(
9 instructions="Which team should handle this",
10 criteria={
11 "billing": "Payment or subscription issues",
12 "technical": "Bugs or integration problems",
13 "sales": "Pricing or account questions",
14 },
15 ),
16 "frustration": Score(
17 instructions="How frustrated the customer appears",
18 criteria=[
19 "Calm, just stating facts",
20 "Frustrated but civil",
21 "Very angry, strong language",
22 ],
23 ),
24 "is_urgent": Noul(
25 instructions="The message conveys urgency or time-sensitivity",
26 ),
27 },
28)
29
30print(response.answers["department"].choice)
31print(response.answers["frustration"].score)
32print(response.answers["is_urgent"].noul)

8. 🗂️ 文件映射歸約:四分之一美分完成 777 個判斷

這是什麼。 一組問題,每個文件,同時進行。這是以前沿模型在經濟上不可能實現、且傳統分類器表現平庸的工作負載。

誰在運行。 Every 的評估負責人 Mike Taylor 進行了任何人發布的最乾淨的測試:他自己的 27 篇文章加上 10 篇 AI 風格對應文章,每篇 21 個問題,全部在一次請求中。777 個判斷在不到 0.7 秒內完成,成本約為四分之一美分。在他所有的十一個實驗中,1,709 個判斷花費不到一分錢。AI Daily Brief,10,000 次觀看,當天就引用了這個數字。

為什麼入選。 TypeSafe 在其用例地圖上將此列為第一方類別「Big Data 上的 AI Map Reduce」。免費輸出 token 改變了你每行運行的任何事物的算術。來自文件的原始 HTTP 形狀足夠小,可以放在這裡:

json
1{
2 "model": "jev-latest",
3 "state": "Hi, I've been trying to connect my Stripe account for 3 days and it keeps failing. I'm losing sales. Please help ASAP.",
4 "questions": {
5 "is_urgent": {
6 "type": "noul",
7 "instructions": "The message conveys urgency or time-sensitivity"
8 }
9 }
10}

這會返回 \{"is_urgent": {"type": "noul", "noul": 0.999}}\。\questions\ 物件中的二十個問題成本約等於一個,因此在一次呼叫中詢問你想了解的每一行的所有資訊。

9. 🧪 瀏覽器中的 Jev,以及克隆版

這是什麼。 介面,由想要這種形式但不想依賴的人基於本地模型重新實現。

誰在運行。 Shopify 的 Kshetrajna Raghavan 建立了 Reflex,一個 Qwen 模型在 WebGPU 上運行帶有概率的結構化決策,完全在瀏覽器中。Tobi Lütke 轉發了它:206 個讚,38.5K 次觀看。

https://x.com/tobi/status/2100742327459303882

一個逆向工程的 jevlike 在發布兩天後在 Hacker News 首頁獲得了 157 分,而 mini-jev,本地 LLM 上的相同介面,一天後跟進。社群目錄 awesome-jev-by-typesafe 在我抓取時有 409 顆星。

為什麼入選。 72 小時內出現三個獨立克隆版,是這次掃描中關於介面是否為真正發明的最強信號。它也為你提供了任何不能透過網路傳輸的東西的離線逃生艙,這很重要,因為真正的產品僅限 API 且託管在美國。現在就在標籤頁中嘗試 Reflex

📖 TypeSafe 建議的使用方式

四條規則,來自文件和創辦人自己的回覆:

  • 每次呼叫問多個問題。它們平行評估,文件說額外問題幾乎不影響回應時間。上述每個令人印象深刻的選擇都在就一個狀態詢問多件事。
  • 設定信心閾值。文件告訴你將低於 0.3 到 0.5 的任何東西視為詢問人類而非行動的信號。這是分類器(給你一個標籤)和決策系統(給你一個標籤加上使用它的許可)之間的區別。
  • 提供候選項,不要要求它發明。Browser Use 從 DOM 構建動作空間,Jev 進行選擇。RAG 檢索,Jev 過濾。啟動器排名,Jev 重新排名。Choice 支援最多 255 個選項;為邊緣情況添加一個「other」。
  • 確保評分正確,否則其他都不重要。一位開發者花了一週試圖破壞它,直言不諱地說:「如果你沒把評分搞對,它就沒用。」選項集和问题措辭才是工作;呼叫本身微不足道。

你可以在哪裡試用:它已經在你使用的閘道後面。Vercel AI Gateway 在 48 小時內接入,獲得 2,341 個讚,這是该公司的第二大貼文,僅次於潛伏期公告。

https://x.com/typesafeai/status/2100376436272173088

Cloudflare AI Gateway,749 個讚,以及 OpenRouter beta,387 個讚,同一週。直接存取是 \POST [https://api.typesafe.ai/v1/systemone](https://api.typesafe.ai/v1/systemone)\ 帶有 Bearer token。

⚖️ 誠實的警告

Hacker News 啟動討論串,"Introducing System One Models and Jev",1,863 分和 490 則評論,大部分篇幅集中在行銷中的一句話:

另外 'can't hallucinate' 似乎不對?是的,它不能發出無效類型,但它仍然可以發出完全錯誤的有效值。

  • jacobgold, Hacker News launch thread, 1,863 points

Diogo 沒有反駁。當一位評論者闡述這是一個分類模型而不是 LLM 時,他稱解釋「非常準確!」並補充說他會說 zero-shot 而不是 instruction-tuned。這是誠實的框架,比發布日炒作所說的新型智能要小得多:一個非常好的零樣本分類器,具有校準的概率和真正的 API。

Reddit 最大的 Jev 討論串是关于谁先建立的。r/LocalLLaMA 的 "I literally built the Jev architecture one year back and completely open-sourced it with model, dataset and paper",1,568 個讚和 164 則評論,引出了一句總結整個行業情緒的回覆:

但你發布時說它是下一個大事件了嗎?菜鳥錯誤

同一討論串中 351 個讚的安慰是:由於之前的工作,沒有人能申請專利並鎖定一般概念。

Every 的 Mike Taylor 讓 Jev 和高努力程度的 Fable 5.1 經過 12 個植入缺陷的段落。Jev 每個段落的中位數為 0.35 秒,對比 8.83 秒,大約快 25 倍,便宜約 580 倍。它也捕捉到了七個缺陷中的六個。Fable 捕捉到了全部七個。他的結論:作為早期預警系統很有用,因為替代方案是完全不檢查。針對 gpt-6-astra 的研究迴圈的第二個較小的並排對比得出端到端約 7 倍的結果,中位數決策 213ms 對比 2,436ms,兩條軌道都是 3/3 正確,這是真實且有用的,但遠非 200 倍。如 AISeeKing 從他們的圖表中讀取的,TypeSafe 自己的四工作流平均值與參考答案的一致性為 67.8%。

炒作疲勞也是真的。在一部以「我真的相信這可能是一個遊戲規則改變者」開頭的 75,750 次觀看解釋影片中,頂部評論獲得 262 個讚,內容是「這可能是我最討厭的句子。」

而在整個掃描中最尖銳的反應是一位觀眾看完完整的解釋後空手而歸:

我看完了整個影片,仍然不知道 JEV 是什麼或做什麼。

這條評論就是這篇文章存在的原因。解決這個問題的規則來自一位多年來一直以這種方式構建的開發者,它可以印在貼紙上:AI 執行,代碼決策。

🔍 我如何挑選這些

跨 X、YouTube、Hacker News、Reddit、TikTok、Instagram、Digg、GitHub 和 arXiv 的十一次 /last30days 運行返回了 716 個項目。我完整閱讀了每個原始檔案,然後打開每個有真實熱度的貼文並將其數據與即時頁面核對,因為關於一款兩天前產品的最大貼文並不在關鍵字搜尋預期的地方。39 個候選工作流有具名來源和真實數據。我保留了 9 個。沒有任何一個作者或頻道超過兩個選擇。每個互動數字都是 X 或 YouTube 在抓取時顯示的,並按照它們的四捨五入方式精確四捨五入。

關於代碼:四個有效負載是逐字的。電子郵件分流區塊是 TypeSafe 自己文件中的快速入門,原始 JSON 形狀來自同一份文件,兩個中介軟體區塊複製自 LangChain 的貼文。Alex Volkov 的壓縮安裝行是他的確切措辭。我自己根據記錄的 API 撰寫了 RAG 過濾器,採用 Kush 描述的形狀,這是一份骨架良好的草稿,而不是任何人在生產環境中運行的東西。

嵌入僅用於贏得關注的貼文。幾百個讚以下的所有內容都改為內聯連結,因為將一個小貼文放大成引用卡片看起來只像是證據。

🔑 精選案例中的共通模式

  • 快速模型負責反應,慢速模型負責規劃。Minecraft、發布串中的維基百科競賽、Browser Use 以及壓縮(compaction)功能都採用了這種分工模式。
  • 提供候選選項。成功者從不要求 Jev 生成選項。他們透過程式碼、DOM、檢索器、工具追蹤記錄或啟動器索引來建立選項集,然後讓模型從中挑選。
  • 免費輸出權限的作用比速度數據更大。這裡每個逐行和逐塊的工作負載都是因價格優勢而得以解鎖。
  • 信心分數才是產品核心。若沒有經過校準的閾值數字,這只是一個快速分類器;有了它,它就成為一個知道何時該停止的決策層。
  • 介面才是創新所在,而非權重參數。72 小時內出現三個可用的複製品,而最大的 Reddit 討論串來自一位一年前就發布了該架構的人。
  • 學術版本率先問世。arXiv 上的 TabAgent 提出了相同的論點:用分類器取代路由、門控和驗證呼叫,但並未附帶任何產品。
  • 社群已經為其取了最恰當的名稱。一位整理人們正在開發內容的 builder 將之命名為「AI if statement」,這是迄今為止關於該模型最有用的三個字。

🧵 我會如何運用它

保留大型模型處理艱澀的思考與寫作任務。將此模型應用於迴圈中每個低成本的判斷環節,設定信心閾值,並將低於 0.5 的情況升級給更大的模型或人類處理。今天就安裝壓縮插件,因為那是你今晚就能感受到差異的功能。

📊 所有 Agents 回報結果

Reddit 113 個討論串 / 24,425 個讚 / 4,159 則留言;X 314 篇貼文 / 30,192 個愛心 / 1,538 次轉發,另有 13 篇經人工核對即時頁面確認;YouTube 75 支影片 / 4,545,636 次觀看;TikTok 36 支影片 / 171,040 次觀看;Instagram 14 則 Reels / 10,778 個讚;Hacker News 133 篇文章 / 25,312 分 / 11,852 則留言;GitHub 6 個倉庫 / 842 顆星;Digg 7 個集群 / 119 篇貼文;arXiv 18 篇論文。彙整自 2026-09-17 執行的十一次 /last30days 運算結果,計數為去重前各次運算的總和。

一鍵儲存

使用 YouMind AI 深度閱讀爆款文章

保存原文、追問細節、總結觀點,並在一個 AI 工作空間裡把爆款文章沉澱成可複用筆記。

了解 YouMind
寫給創作者

把你的 Markdown 變成乾淨的 𝕏 文章

圖片上傳、表格、程式碼區塊,往 𝕏 上手動重排太痛苦。YouMind 把整篇 Markdown 一鍵轉成乾淨、可直接發佈的 𝕏 文章草稿。

試試 Markdown 轉 𝕏

更多可拆解樣本

近期爆款文章

探索更多爆款文章