YouMind
Anmelden

Jev wurde nicht für die Erstellung von Agents entwickelt

@kylejeong
ENGLISCH21. Sept. 2026
126K
173
21
5
324

TL;DR

Jev ist ein spezialisiertes KI-Modell für schnelle, strukturierte Entscheidungen und unterscheidet sich von Allzweck-Agents. Dieser Artikel erläutert seine Architektur, Kostenvorteile und die praktische Integration in Software-Workflows wie Stagehand.

Außer du hast die letzte Woche unter einem Stein verbracht, dann hast du Jev von @typesafeai bestimmt schon gesehen.

https://x.com/CompleteSkeptic/status/2099925682726002904

Sie beschreiben ihre Modelle als:

eine Klasse von KI-Modellen, die entwickelt wurden, um schnelle, strukturierte Entscheidungen zu treffen, die Software direkt nutzen kann. Ein System-One-Modell evaluiert einen

Zustand und gibt typisierte Antworten und Wahrscheinlichkeiten zurück.

Laut den Benchmarks von TypeSafe ist Jev 20–200-mal schneller und 40–400-mal günstiger als LLMs.

Aber warum ist das überhaupt relevant? Wir haben bereits zuvor Klassifikatoren trainiert (Autokorrektur auf dem Handy, Gmail-Filterung usw.), aber laut Twitter soll Jev etwas Besonderes sein.

In diesem Artikel möchte ich dir erklären, was Jev ist, warum es existiert und wie du es in deine Produktionssysteme integrieren kannst.

Was genau ist Jev?

„Stell dir Jev als einen Frontier-Intelligence-Funktionsaufruf vor: unstrukturierter Zustand rein, typisierte probabilistische Entscheidungen raus.“ – TypeSafe

Jev stellt drei primitive Funktionen bereit: Choice, Score und Noul.

  • Choice ist ein Fragetyp, der eine Option aus einer definierten Menge (maximal 255) auswählt. Die Antwort umfasst die ausgewählte Option, eine Wahrscheinlichkeit für jede Option sowie das Konfidenzniveau.
  • Score bewertet Inhalte anhand geordneter, beschreibender Stufen. Die Antwort umfasst einen Punktwert, eine Wahrscheinlichkeit für jede Stufe sowie das Konfidenzniveau.
  • Noul bittet das Modell, eine Ja/Nein-Frage zu evaluieren und die Wahrscheinlichkeit zurückzugeben, dass die Antwort „Ja“ lautet.

Hier ist ein Beispiel für Eingabe und Ausgabe in einem Customer-Support-Anwendungsfall:

json
1// Eingabe
2{
3 "model": "jev-latest",
4 "state": "Hallo, mir wurde meine monatliche Abonnementgebühr doppelt berechnet. Können Sie die zusätzliche Gebühr erstatten? Mein Konto funktioniert einwandfrei.",
5 "questions": {
6 "department": {
7 "type": "choice",
8 "instructions": "Welches Team sollte diese Nachricht bearbeiten?",
9 "criteria": {
10 "billing": "Gebühren, Zahlungen, Abonnements und Erstattungen",
11 "technical": "Bugs, Fehler und defekte Funktionen",
12 "account": "Login, Passwörter und Kontozugriff"
13 }
14 },
15 "requests_refund": {
16 "type": "noul",
17 "instructions": "Fordert der Kunde ausdrücklich eine Erstattung an?"
18 },
19 "frustration": {
20 "type": "score",
21 "instructions": "Wie frustriert klingt der Kunde?",
22 "criteria": [
23 "Ruhig: beschreibt das Problem höflich ohne Frustration",
24 "Frustriert: drückt Ärger oder Unzufriedenheit aus",
25 "Sehr frustriert: drückt starken Ärger aus oder droht mit Kündigung"
26 ]
27 }
28 }
29}
30// Ausgabe
31{
32 "model": "jev-1.13.0",
33 "answers": {
34 "department": {
35 "type": "choice",
36 "choice": "billing",
37 "confidence": 1,
38 "probabilities": {
39 "technical": 0,
40 "account": 0,
41 "billing": 1
42 }
43 },
44 "requests_refund": {
45 "type": "noul",
46 "noul": 0.99
47 },
48 "frustration": {
49 "type": "score",
50 "score": 0,
51 "legend": {
52 "0": "Ruhig: beschreibt das Problem höflich ohne Frustration",
53 "1": "Frustriert: drückt Ärger oder Unzufriedenheit aus",
54 "2": "Sehr frustriert: drückt starken Ärger aus oder droht mit Kündigung"
55 },
56 "confidence": 1,
57 "probabilities": {
58 "0": 1,
59 "1": 0,
60 "2": 0
61 }
62 }
63 },
64 "usage": {
65 "input_tokens": 442,
66 "output_tokens": 72
67 },
68 "request_id": "playground_12bbfa4198be5ca4de9818a45c0906a2055",
69 "evaluation_time_ms": 163.01120699790772
70}

Ich empfehle dir, das Dashboard-Onboarding durchzugehen, um besser zu verstehen, wie Zustände und Fragen zusammenwirken, um Ausgaben zu erzeugen.

Ist das nicht einfach nur ein Klassifikator?

Naja, ja und nein. Es ist eher so, als hätten ein LLM und ein Klassifikator ein Baby bekommen.

Traditionelle Klassifikatoren eignen sich gut für Aufgaben mit hohem Durchsatz und fester Taxonomie. Denk an LeNet-5, das erkennen konnte, welche Ziffer ein Bild darstellte. Allerdings sind Klassifikatoren meist extrem spezialisiert und domänenspezifisch. LLMs sind gut darin, Sequenzen zu generieren. Sie sind flexibel und ideal für offene Aufgaben, die zur Laufzeit definiert werden, aber sie sind auch langsamer (als ein Klassifikator), teurer und weniger vorhersagbar.

Jev ist ein „Foundation Model for Classification“, das die Natural-Language-Flexibilität eines LLMs mit den eingeschränkten, probabilistischen Ausgaben eines Klassifikators kombiniert. Du kannst eine Vielzahl von Aufgaben erledigen, ohne ein neues Modell trainieren zu müssen, während gleichzeitig Expertise über verschiedene Domänen hinweg (Code, Text, Logs, UI-Zustände, Events usw.) erhalten bleibt. Jev kann Ausgaben auch parallel generieren, was es viel schneller macht als ein LLM, das auf sequenzielle Generierung beschränkt ist.

TL;DR: Es ist ein wirklich intelligenter, generalisierbarer Klassifikator.

Warum existiert Jev?

Der CEO und Mitgründer von TypeSafe, Diogo Almeida, hat bei OpenAI daran gearbeitet, RLHF (Reinforcement Learning from Human Feedback) und das ChatGPT-Produkt zu entwickeln. RLHF ermöglichte es uns, LLMs darauf zu trainieren, Anweisungen und Prompts sehr gut zu befolgen, was ihrer autoregressiven Natur entspricht.

Dann verließ er OpenAI, um TypeSafe zu gründen und eine andere Klasse von Modellen zu trainieren, die KI-gestützte Software ermöglichen sollen, statt Agenten. Jev wird mit RLCD (Reinforcement Learning from Calibrated Decisions) trainiert. Das ist Fachjargon dafür, dass das Modell darauf trainiert wird, sehr gute Konfidenzwerte und Wahrscheinlichkeiten auszugeben, statt nur einfache Antworten.

TypeSafe glaubt daran, dass Software intelligent sein sollte. Agenten diffundieren nicht natürlich in die Art, wie Software historisch funktioniert hat, und Human-in-the-loop erschwert intelligente UND autonome Software. Jev ist ein Schritt hin zu Intelligenz als komponierbare, zuverlässige Primitive innerhalb von Softwaresystemen.

Das ist keine völlig neue Idee. Forscher fanden 2017 heraus, dass hohe prädiktive Genauigkeit nicht bedeutet, dass die Konfidenzschätzungen zuverlässig sind (daher sind LLMs hier keine perfekte Lösung).

Warum RLCD statt RLHF?

Das Problem bei RLHF ist, dass das, was Menschen wollen, nicht immer objektiv korrekt ist. Nur weil wir eine bestimmte Antwort in einem bestimmten Format bevorzugen, macht das die Modelle nicht intelligenter, sondern lediglich angenehmer im Umgang.

Es führt auch zum Mode Collapse. RLHF bringt LLMs dazu, zu einer einzigen Antwort zu konvergieren, obwohl manchmal mehrere Trajektorien „korrekt“ sein könnten.

„Eine Ausgabe kann für eine Person überzeugend wirken, ohne zuverlässig genug für unbeaufsichtigte Automatisierung zu sein. Menschliche Präferenz und maschinelle Vertrauenswürdigkeit sind unterschiedliche Optimierungsziele.“

Kyle Jeong - inline image

Mode Collapse gemäß Jev's Docs

Jev war NICHT dafür gedacht, Agenten zu bauen

Im Gegensatz zu dem, was du überall in deinem Feed siehst, ist Jev als eigenständiger Agent nicht besonders gut. Wir haben versucht, Versionen davon zu bauen, sowohl nur mit Jev als auch mit LLM + Jev.

https://x.com/kylejeong/status/2100622054945095934

Ehrlich gesagt ergeben Jev-Agenten coole Demos. Es gab eine Menge davon, die Jev nutzten, um Agentenaufgaben mit Lichtgeschwindigkeit auszuführen. Aber selbst die besten Demos sind noch nicht bereit für den Einsatz in der Produktion.

Ein Modell wie Jev ist für KI-gestützte Software gedacht. Es kann dir helfen, Entscheidungen zu treffen, die in deterministischem Code komponiert sind. Ohne Reasoning- oder Generative-Fähigkeiten ist es reine Ignoranz, es als eigenständigen Agenten zu verwenden.

Kyle Jeong - inline image

KI-gestützte Software

Anstatt Jev als eigenständigen Computer-Use-Agenten einzusetzen, sollte es im Customer-Support-Routing, bei der Rechnungsverarbeitung, bei Sicherheitswarnungen und beim Triage oder als Agent-Monitor verwendet werden.

Die Zahlen

Ihr erstes Modell Jev 1.13.0 kostet $42/btok (oder $0.042/mtok) für Input-Tokens und $0 für Output-Tokens. Zum Vergleich: Fable 5.1 kostet $10/mtok für Input, was $10.000 / Btok entspricht. Typische Enterprise-Workloads haben ein Verhältnis von 3:1 oder 4:1 zwischen Input- und Output-Tokens, daher bewegt sich Fable auf ~$20.000/Btok (mit $50/mtok Output).

Das Kontextfenster beträgt 64k Tokens pro Anfrage, wobei der Zustand plus die längste Frage in 32k Tokens passen muss.

In ihren internen Benchmarks übertreffen sie jedoch alle Modelle in Bezug auf Genauigkeit/Kosten & Genauigkeit/Geschwindigkeit von OpenAI, Anthropic und Deepseek (über Fireworks für die Inferenz).

Kyle Jeong - inline image

Genauigkeit/Kosten

Genug geredet, wie benutze ich es?

Du solltest jetzt genug Verständnis für Jev haben, um dir einige Anwendungsfälle für das auszudenken, woran du gerade arbeitest. (Falls nicht, hier ist eine Liste von Use Cases, die von TypeSafe empfohlen werden).

Anstatt deiner Kreativität Grenzen zu setzen, wie du es nutzen solltest, zeige ich dir, wie wir Jev in unser Framework Stagehand integriert haben.

In den letzten zwei Jahren hat sich Stagehand als Framework für KI und Agenten zur Steuerung eines Remote-Browsers weiterentwickelt. Bevor Agenten gut genug waren, haben wir AI-Primitives Act (eine Aktion abschließen), Extract (strukturierte Daten extrahieren) und Observe (potenzielle Aktionen auf einer Seite entdecken) erstellt, um Entwicklern zu helfen, selbstheilende Skripte zur Automatisierung des Webs zu schreiben.

Anstatt Playwright (oder andere Legacy-Frameworks) zu verwenden und den DOM manuell parsen zu müssen, um Selektoren für Aktionen bereitzustellen, ermöglicht dir Stagehand A/E/O, Natural Language zu verwenden, um Automationen zu erstellen.

typescript
1// Playwright
2await page.click('button[type="submit"]');
3
4// Stagehand
5stagehand.act("click the submit button")

Das ist hilfreich, wenn man Skripte zum ersten Mal schreibt (die Entwicklungsgeschwindigkeit ist viel höher), aber besonders nützlich für die Wartung von Skripten. Wenn sich eine Website ändert und DOM-Selektoren aktualisiert werden, müssen Playwright-Skripte neu geschrieben werden, um zur neuen Seite zu passen. Stagehand wählt Selektoren und Aktionen zur Laufzeit aus und ist „selbstheilend“.

Du kannst ungefähr sehen, wohin wir damit wollen. Jev passt hervorragend in diese Primitives. Ursprünglich verwendeten wir ein LLM (mit Kontext darüber, wie die Seite aussah und was das Ziel war), um zu entscheiden, was zu tun ist. Mit Jev können wir Choice verwenden, um zu entscheiden, mit welchen Selektoren interagiert werden soll.

Lass uns spezifisch Act nehmen, um den Ablauf zu durchgehen. Normalerweise geben wir dem LLM eine kompakte Darstellung der Seite basierend auf einem hybriden a11y-Tree. Mit Jev markieren wir zuerst Knoten im a11y-Tree als entweder interaktiv (auch Rich-Text-Editoren) oder nicht-interaktiv.

Wenn stagehand.act aufgerufen wird:

  • Jev klassifiziert die Anweisung in eine Aktion (wie click, fill oder scroll)
  • Stagehand parst Argumente und erstellt eine Kandidatenliste für diese Aktion (die nahen Seitenkontext einschließt)
  • Jev beantwortet „welcher Kandidat ist am besten“ und „passt irgendein Kandidat“ mit einem Akzeptanzschwellenwert von 0.7
  • Wenn die Kandidatenaktion akzeptiert wird, übernimmt Stagehand die Ausführung
  • Wenn die Aktion nicht akzeptiert wird, fällt Stagehand auf ein LLM zurück
Kyle Jeong - inline image

Act Flow

In frühen Tests sinkt die Median-Latenz von Act von 1,97 Sekunden auf 0,46 Sekunden, was etwa 4,3-mal schneller ist (oder 77 % weniger Zeit). Siehe den vollständigen PR-Stack.

Bei Computer Use ist Jev ein Teil des Puzzles, aber keine eigenständige Lösung. Wir sind nun in der Lage, deterministischere Software-Tools zu bauen, die Agenten nutzen können.

Kyle Jeong - inline image

Wann man Jev nutzt

Diffusion von KI in der realen Welt

Wird Jev produktionsreife Computer-Use-Agenten bauen? Nein. Ist es ein nützliches Teil des Puzzles? Ich denke, ja.

Es fühlt sich so an, als gäbe es eine Fülle von Ideen, die vor Jev keinen Sinn ergaben. Ich habe Leute gesehen, die Instant-Search, Smart Copy Paste und weitere einfache, aber extrem hilfreiche Tools gebaut haben.

KI sollte nicht auf eine Version einer Chat-Oberfläche beschränkt sein, ob synchron oder asynchron. Mit Modellen wie Jev können wir Software bauen, die Vorhersagemodelle integriert, ohne ein Chat-Eingabefeld. Obwohl Klassifikatoren schon so lange verfügbar sind, haben sie sich nie nützlicher angefühlt. Vielleicht brauchten wir nur Inspiration, um alles zu bauen.

-> Kyle

Mit einem Klick speichern

Virale Artikel mit YouMind per KI tief lesen

Speichere die Quelle, stelle gezielte Fragen, fasse die Argumentation zusammen und verwandle einen viralen Artikel in wiederverwendbare Notizen in einem einzigen KI-Arbeitsbereich.

YouMind entdecken
Für Creator

Verwandle dein Markdown in einen sauberen 𝕏-Artikel

Wenn du eigene Langtexte veröffentlichst, wird die 𝕏-Formatierung von Bildern, Tabellen und Codeblöcken mühsam. YouMind macht aus einem ganzen Markdown-Entwurf einen sauberen, sofort postbaren 𝕏-Artikel.

Markdown zu 𝕏 testen

Mehr Muster zum Entschlüsseln

Aktuelle virale Artikel

Mehr virale Artikel entdecken