如果你這幾天一直在網路上閒逛,你大概已經聽過 Jev 這個新的 AI 模型,它正在 AI 社群中掀起熱潮。Jev 不是一個傳統的 LLM。它是為了做出決策而設計的,而不是為了撰寫文字。過去幾天我深入研究了 Jev,我真的相信这波熱度並非虛傳,對於產品開發者來說,這裡蘊含著巨大的潛力。
正如我之前所說,無論你是否擔任技術職位,了解 AI 背後的技術原理都至關重要。理解 Agent 系統如何運作,能让你在自家產品中更審慎地應用這些技術。
我有好幾位讀者聯繫我,表示他們讀遍了所有關於 Jev 的資料,卻仍然不明白它究竟是什麼。所以這篇文章就是為他們寫的。這是給普通用戶(normies)的 Jev 指南。如果其他關於 Jev 的文章讓你充滿疑問而非答案,這篇文章會有所不同。讀完之後,你將對 Jev 是什麼、它與 LLM 有何不同,以及如何將其應用於你構建的產品中,建立起基礎的理解。
軟體中決策的重要性
軟體充滿了各種決策。這條客戶訊息是否需要緊急處理?這筆交易是否涉及詐欺?頁面應該以英文還是法文呈現?
一個產品可能每天需要進行數百萬次這類決策。
但電腦所能處理的決策複雜度是有限的。上述問題可以透過一些簡單的規則來回答。例如,我們可以根據使用者的語言設定或 IP 地址來決定頁面是用英文還是法文顯示。但並非所有問題都這麼簡單。
舉例來說,一張熱狗的照片。沒有任何一組簡單的規則能讓電腦判斷我的照片中是否真的包含熱狗。
因此,電腦科學家提出了一種讓電腦做出更複雜決策的新方法:機器學習。結果發現,透過結合一些精巧的演算法與大量包含熱狗的照片範例,電腦確實能夠變得相當擅長辨識含有熱狗的照片。

GIF
我們的熱狗模型是一種稱為分類器(classifier)的模型。之所以這樣稱呼,是因為它對事物進行分類。如今,分類器在軟體中被廣泛用於做出複雜決策。
但分類器的問題在於,它們無法泛化到訓練領域之外。我能辨識熱狗照片的分類器,無法幫我辨識詐欺交易。而且由於訓練分類器所需的數據和專業知識,許多類型的问题是電腦無法解決的。直到……
大型語言模型
當 OpenAI 在 2022 年 11 月發布 ChatGPT 時,它席捲了全球。它之所以如此受歡迎,並非因為其絕對的智慧,而是因為它的泛化能力。
ChatGPT 對世界擁有基礎的理解,這意味著它能同時就熱狗和詐欺交易進行對話。
像 ChatGPT、Claude、Grok 和 Kimi 這樣的大型語言模型,其主要功能是生成文字。但任何使用過這些模型的人都知道,它們能夠思考、推理,並最終做出決策。作為例子,以下是 LLM 可能如何決定給定圖像是否是熱狗的方式。

GIF
是的,大型語言模型能夠做出決策。而且它們能在廣泛的知識領域中做出決策。
LLM 會是聖杯嗎?我們終於能擁有一個通用的決策模型,應用於當今軟體中的各種決策了嗎?
嗯,實際上並不現實。儘管 LLM 擁有令人難以置信的能力,但它們相對較慢且昂貴。對於大多數軟體應用的場景來說,速度和成本都太不理想了。
要是我們有一個模型,既能跨越廣泛的通用知識領域做出決策,又能快速且低成本地完成該多好……
介紹 Jev:一個能泛化的分類器
Jev 是一類新型模型,專為做出決策而非生成文字而優化。
Jev 保留了像 LLM 一樣泛化的特性,同時又像分類器一樣相對快速且便宜。據宣稱,Jev 比同級別的 LLM 快 20-200 倍,成本低 40-400 倍。
這是因為 Jev 不像 LLM 那樣逐個 token 返回答案,它直接返回一個決策。
這就是工程師們對它感到興奮的原因。並不是說 Jev 展現了前所未有的智慧水平;而是說它在如此高速且低成本的情況下,展現了這種水平的智慧。
你不能與 Jev 聊天。它不是聊天機器人。Jev 期望輸入以下三項內容:
- 你想要回答的問題
- 該問題的可能答案集合
- 回答問題所需的上下文(Jev 稱之為「state」狀態)
然後 Jev 會給你以下輸出:
- 它所選定的答案
- 該答案正確的概率
就這樣。沒有閒聊,只有決策。
Jev 支持三種決策類型:
- 是/否,Jev 稱之為「Noul」:返回陳述為真的估計概率
- 選擇:從最多 255 個多選選項中進行選擇,並提供每個選項正確的概率
- 評分:針對 2 到 10 級的量表對某事物進行評級
這些選項使得高級決策能在比以往方法更短的時間和更低的成本下完成。讓我們來看一下每種情況的例子。
Noul(是/否)
假設我開了一家新的熱狗攤,我想隨著顧客回饋的到來即時審查,以便相應地反應或回應。
對於每一則評論,我們先問一個簡單的問題:這則評論是否是對食物的抱怨。輸入給 Jev 的內容可能如下所示。
1{2 "model": "jev-latest",3 "state": "Waited twenty minutes, but the hotdog was worth it. Would come back if the queue was shorter.",4 "questions": {5 "food_complaint": {6 "type": "noul",7 "instructions": "Does this review express dissatisfaction with the food itself?",8 "criteria": {9 "true": "Complains about the taste, temperature, or quality of the food.",10 "false": "Does not complain about the food. Complaints only about queues or service do not count."11 }12 }13 }14}
你可以看到,我們定義了想要回答的問題("instructions"),選擇是或否的標準,以及 Jev 做出準確決策所需的狀態。
所以我們將上述問題交給 Jev。Jev 然後輸出以下內容。
1{2 "answers": {3 "food_complaint": {4 "type": "noul",5 "noul": 0.046 }7 }8}
Jev 判定這則特定的回饋只有 4% 的可能性是在抱怨食物。因此,我們可能會將這則評論歸類為較低優先級,並在有空時再進行跟進。
選擇
讓我們通過要求 Jev 將回饋歸入類別,來更深入地了解每一項回饋。這是我們向 Jev 發出的請求可能的樣子。
1{2 "model": "jev-latest",3 "state": "Waited twenty minutes, but the hotdog was worth it. Would come back if the queue was shorter.",4 "questions": {5 "main_topic": {6 "type": "choice",7 "instructions": "What is the main topic of this review? Select the option that best captures its primary focus.",8 "criteria": {9 "queue": "Queue length or waiting time is the main focus.",10 "food": "The taste, temperature, or quality of the food is the main focus.",11 "service": "Staff friendliness, helpfulness, or how they handled the order is the main focus. Comments only about waiting time belong under queue.",12 "other": "The main focus is something other than food, waiting time, or staff service."13 }14 }15 }16}
我們定義了 Jev 可以做出的每個選擇,並附上了何時使用每個選擇的描述("criteria")。Jev 返回以下內容。
1{2 "answers": {3 "main_topic": {4 "type": "choice",5 "choice": "queue",6 "probabilities": {7 "queue": 0.80,8 "food": 0.15,9 "service": 0.03,10 "other": 0.0211 },12 "confidence": 0.6013 }14 }15}
好的,Jev 選擇了「queue」(排隊)作為答案。你也可以看到它為每個選項附加了概率。
評分
現在讓我們讓 Jev 根據五個定義的等級,評估顧客在我們熱狗攤整體體驗中的滿意度。
1{2 "model": "jev-latest",3 "state": "Waited twenty minutes, but the hotdog was worth it. Would come back if the queue was shorter.",4 "questions": {5 "overall_satisfaction": {6 "type": "score",7 "instructions": "How satisfied is this customer with their overall experience? Consider both positive and negative comments.",8 "criteria": [9 "Very dissatisfied: strongly negative about the experience overall.",10 "Dissatisfied: mostly negative, despite any positives.",11 "Mixed: meaningful positives and negatives, with neither clearly dominating.",12 "Satisfied: mostly positive, despite some complaints.",13 "Very satisfied: strongly positive, with no meaningful complaints."14 ]15 }16 }17}
同樣地,我們提供了一個清晰的問題、可能答案的集合以及狀態。Jev 返回以下內容。
1{2 "answers": {3 "overall_satisfaction": {4 "type": "score",5 "score": 2.1,6 "probabilities": {7 "0": 0.05,8 "1": 0.15,9 "2": 0.50,10 "3": 0.25,11 "4": 0.0512 }13 }14 }15}
滿分 4 分中得了 2.1 分,還有改進空間。
Jev 的神奇之處在於,它能比 LLM 更快、更便宜地做出這些決策。以下是對我們熱狗攤留下的 60 條回饋進行審查的並排比較。左邊是 Jev,右邊是一個 LLM(gpt-5.6 Luna)。

Jev 的速度和成本優勢降低了利用軟體做出決策的門檻。
應用 Jev
在你的產品中,任何可以通過做出決策來改善使用者結果的地方,都可以考慮應用 Jev。以下是一些例子。
在任何知道某事為真或為假允許你改變採取行動的地方,使用 Yes/No。
- 這位客戶的訊息是否暗示他們即將取消訂閱?
- 這份供應商更新是否表明貨運將錯過截止日期?
- 這位學生的解釋是否揭示了值得解決的誤解?
- 這份會議記錄是否包含無人負責承諾的事項?
- 這位玩家的訊息是否表明他們卡住了,可能需要提示?
在任何從一組選項中選擇允許你決定下一步發生的事情的地方,使用 Choice。
- 哪個專家團隊應該處理這個異常的客戶請求?
- 哪個產品教程最符合該使用者試圖完成的目標?
- 遊戲中的哪個角色應該回應玩家剛才說的話?
- 哪個博物館語音導覽片段最能回答訪客的問題?
- 哪個可用的替代品最能保留缺失食材在食譜中的作用?
在任何判斷某事物在多大程度上、多好或多接近滿足標準允許你優先排序或調整行動的地方,使用 Score。
- 這個軟體錯誤對客戶實際工作流程的干擾程度如何?
- 這份旅行行程與某人理想假期概念的匹配程度如何?
- 這次客戶訪談在多大程度上支持特定的產品假設?
- 這場戲的對話偏離角色既定聲音的程度如何?
- 鑑於玩家已知的資訊,這個遊戲提示的揭露程度如何?
開始用 Jev 構建
Jev 為我們能為使用者構建的軟體和體驗類型開啟了一個全新的可能性世界。
既然你已經了解了 Jev 是什麼以及它是如何工作的,你打算如何將其應用於你正在構建的產品中?





