Hallo Freunde, ich bin Jin Chenma.
Lass mich mit einer Frage beginnen: Welche gängigen Arten von großen KI-Modellen begegnen wir im Hinblick auf die verarbeiteten Inhalte normalerweise?
Die meisten Menschen kennen Text, Bilder, Audio und Video. In den letzten Jahren haben verschiedene Anbieter in diesen Bereichen kontinuierlich konkurriert und iteriert, wodurch die Fähigkeiten immer stärker und der Wettbewerb immer härter wurde.
Nachdem ich so viele Updates gesehen hatte, fragte ich mich ständig: Werden neben der Verbesserung bestehender Modelle auch neue Modellformen entstehen?
Kürzlich ging ein Modell namens Jev viral. Zuerst dachte ich: Ist das nur wieder ein Unternehmen, das ein neues großes Sprachmodell veröffentlicht?
Aber nach genauerer Recherche fand ich dieses Modell wirklich beeindruckend.
Dahinter steht TypeSafe AI, das eine Klasse von Modellen namens System One Models vorgeschlagen hat, die speziell für Urteilsaufgaben in Software entwickelt wurden. Jev ist ihr erstes öffentliches Modell.
Die bisherigen Kategorien (Text, Bild, Audio, Video) wurden nach Inhaltstyp unterschieden; diesmal haben sie den Blickwinkel geändert: Sie betrachten „Urteile fällen“ als eigenständige Aufgabe und entwerfen ein Modell rund um diese Funktion.
Ich denke, dieser Ansatz könnte tiefgreifende Auswirkungen auf die zukünftige Entwicklung und Arbeitsteilung bei KI-Modellen haben.
In diesem Artikel werde ich klar erklären, was Jev ist, wie es sich von Standard-LLMs unterscheidet, wo es eingesetzt werden kann und wie man damit anfängt.
Beginnen wir mit der QR-Code-Analogie
Wie versteht man Jev? Stell dir vor, du möchtest einen QR-Code generieren.
Normalerweise würdest du ein Tool zur QR-Code-Erstellung verwenden. Aber stell dir vor, du hast einen Künstler eingestellt, der alles zeichnen kann, und ihn gebeten, den QR-Code Pixel für Pixel zu zeichnen.
Natürlich ist dieser Künstler geschickt genug, um das zu tun. Aber für die Generierung eines QR-Codes gibt es dedizierte Tools. Du brauchst einfach nur einen funktionierenden QR-Code, nicht zusätzlich noch ein Landschaftsbild.

Ähnlich lässt sich Jev mit Large Language Models vergleichen:
LLMs können Artikel schreiben, Code erstellen und komplexe Probleme diskutieren. Wenn du ein LLM bittest, einen Kommentar zu lesen und die Stimmung des Nutzers einzuschätzen, kann es das definitiv tun.
Aber wenn die Aufgabe nur eine Auswahl oder eine Bewertung erfordert, überlege: Können wir ein schnelleres, günstigeres und programmatisch zugängliches Modell speziell für solche Aufgaben erstellen?
Genau das tut Jev.
Es verzichtet auf freie Textgenerierung, um sich auf Urteile mit klaren Antwortmöglichkeiten zu spezialisieren. Wenn du beispielsweise vier Optionen angibst – „Zufrieden“, „Unzufrieden“, „Gemischt“, „Nicht bestimmbar“ –, wählt es eine aus und liefert Wahrscheinlichkeiten für jede Option.
So wie QR-Codes spezielle Tools haben, können Aufgaben, die nur Entscheidungen und Bewertungen erfordern, von spezialisierten Modellen übernommen werden. Laut offiziellen Angaben reduziert Jev durch seine Optimierung für diese Urteilsaufgaben die Reaktionszeit und die Aufrufkosten.
Zum Beispiel erfordert das tägliche Filtern massiver Mengen an E-Commerce-Kommentaren die Beurteilung von Stimmung, Dringlichkeit und Bearbeitungsweisen. Schnellere und günstigere Urteile senken die allgemeinen Wartezeiten und Kosten. Programme erhalten die Ergebnisse und fahren mit der Klassifizierung oder der Übergabe an menschliche Mitarbeiter fort.
Der Ursprung von Jev
Wer hat Jev entwickelt? Warum ein Modell bauen, das ausschließlich für Urteile gedacht ist?
Jev stammt von TypeSafe AI, gegründet von Diogo Almeida, der zuvor an der Forschung zu Chat-Modellen bei OpenAI beteiligt war.
Er konzentrierte sich auf ein Problem: KI ist großartig im Chatten, aber warum ist es nicht einfach, diese Fähigkeiten in Software für automatisierte Aufgaben zu integrieren?
Software ist hervorragend darin, explizite Regeln auszuführen. Wenn Bedingung A erfüllt ist, führe Aktion B aus. Aber viele reale Urteile lassen sich schwer vorab mit festen Regeln definieren.
Wie beim Lesen von Kommentaren. Welche Ausdrücke sind Beschwerden? Welche sind Witze? Welche scheinen positiv, enthalten aber versteckte Kritik? Es ist schwierig, alle Sprachmuster der Nutzer mit wenigen Regeln abzudecken.
TypeSafe möchte semantische Urteile zu einer aufrufbaren Komponente machen. Wenn ein Programm Text verstehen oder den nächsten Schritt wählen muss, delegiert es diese kleine Aufgabe an das Modell, erhält das Ergebnis und setzt die Ausführung fort.
Sie nennen diese Modelle System One, angelehnt an das Konzept aus Thinking, Fast and Slow (Schnelles Denken, langsames Denken). Betrachte es als den schnellen, intuitiven Teil des Urteilens.
Der Name Jev leitet sich vom Ökonomen Jevons ab. Die Erwartung des Teams ist einfach: Je niedriger die Kosten für intelligente Aufrufe, desto mehr Orte werden sie nutzen.
Einige Schritte erschienen früher zu teuer für einen einzelnen KI-Aufruf. Wenn Urteile schnell und günstig genug sind, lohnt es sich, sie neu zu überdenken.
Wie unterscheidet sich Jev von LLMs?
KI-Urteile für Software-Aufrufe günstiger und einfacher zu machen, ist ein guter Ausgangspunkt. Aber bestehende LLMs können ebenfalls urteilen und strukturierte Ergebnisse liefern. Warum also Jev entwickeln?
Schauen wir uns zunächst an, wie LLMs Urteilsresultate an Programme übergeben.
LLMs unterstützen strukturierte Ausgabe, was bedeutet, dass Antworten in vordefinierte Felder passen. Zum Beispiel ein Feld für die Stimmung, eines für die Dringlichkeit, eines für die Bearbeitungsmethode. Das Programm weiß, was jede Position repräsentiert.
Du kennst vielleicht JSON, ein häufiges Format für strukturierte Daten. Entwickler können die Ausgaben von LLMs darauf beschränken, bestimmten Formaten zu folgen.
Wenn man also nur betrachtet, ob die finale Ausgabe Text oder JSON ist, wird der Hauptunterschied zwischen Jev und LLMs nicht deutlich.
Der Unterschied liegt darin, wie das Modell das Ergebnis erzeugt.
Standard-generative LLMs produzieren Antworten typischerweise Token für Token. Tokens sind kleine Textfragmente, die das Modell verarbeitet. Selbst wenn du festformatierte Daten anforderst, generiert es das Ergebnis meist schrittweise.
Jev verwendet eine spezialisierte Ausgabemethode für Urteilsaufgaben und liefert mehrere Urteile und Wahrscheinlichkeiten parallel. Du kannst mehrere Fragen zum selben Kommentar stellen und alle Ergebnisse in einer einzigen Anfrage erhalten.
Dieser Unterschied in der Ausgabe hängt mit der bereits erwähnten Geschwindigkeit und den Kosten zusammen. Software, die täglich massive Datenmengen verarbeitet, verursacht selbst bei kleinen Schritten erhebliche Kosten. Agenten, die Tools aufrufen und kontinuierliche Aufgaben ausführen, müssen wiederholt den nächsten Schritt entscheiden. Reaktionsgeschwindigkeit und Aufrufkosten beeinflussen direkt das Softwaredesign, die Betriebsausgaben und die Benutzererfahrung. Einige Schritte, die früher wegen Langsamkeit oder hoher Kosten übersprungen wurden, können nun KI-Urteile beinhalten.
Es gibt auch die Stabilität der Ausgabe. Wir definieren einen Satz von Optionen, und das Modell liefert Ergebnisse innerhalb dieses Rahmens zurück, was die Verarbeitung durch nachgelagerte Programme erleichtert.
Drei neue Funktionen von Jev
Das Herzstück von Jev bilden drei neue Funktionen. Ihre Designlogik ist interessant und lohnt eine genauere Betrachtung.
Kurz gesagt: Choice trifft Auswahlen aus gegebenen Optionen; Score vergibt Bewertungen basierend auf Kriterien; Noul beurteilt die Wahrscheinlichkeit, dass eine Aussage wahr ist.
Hier demonstriere ich diese Funktionen anhand eines praktischen Beispiels im offiziellen Playground.
Nutzen wir die Verarbeitung von E-Commerce-Kommentaren. Angenommen, du betreibst einen Online-Shop, der täglich Kundenbewertungen erhält. Du musst die Zufriedenheit einschätzen, Probleme identifizieren, die Nachverfolgung erfordern, die Bearbeitungsmethoden bestimmen und dringende Fälle priorisieren.
Wir senden diesen Kommentar an Jev:
„Das Produkt ist gut, aber der Versand dauerte zehn Tage, und der Kundenservice hat nicht geantwortet.“
Wir nutzen die drei Funktionen, um diesen Kommentar zu beurteilen, und schauen uns die Ergebnisse an.
Choice: Auswahlen treffen
Frage zuerst: Wie ist die allgemeine Stimmung?
Angebotene Optionen: Zufrieden, Unzufrieden, Gemischt, Nicht bestimmbar.
Ergebnis: „Gemischt“.
Das ist leicht zu verstehen. Der Nutzer lobt das Produkt, beschwert sich aber über Logistik und Service. Nur „Zufrieden“ oder „Unzufrieden“ zu wählen, würde einen Teil der Bedeutung verlieren.
Ebenso können wir fragen: Wie sollte dieser Kommentar als Nächstes behandelt werden?
Optionen: „An Mensch übergeben“, „Automatische Antwort“, „Keine Antwort nötig“. Regel hinzugefügt: Unbearbeitete Service-Beschwerden erfordern menschliche Nachverfolgung.
Ergebnis: „An Mensch übergeben“.
Beachte, dass der Inhalt der Multiple-Choice-Frage variieren kann. Stimmung, Abteilung, nächste Aktion – all das kann so formuliert werden. Die Optionen werden von uns bereitgestellt; Jev urteilt basierend auf dem Material und den Anforderungen.

Score: Bewertungen vergeben
Als Nächstes fragen wir: Wie dringend ist dieser Kommentar? Wie schnell müssen wir nachfassen?
Vor der Bewertung definieren wir Standards. Hier werden drei Ebenen festgelegt:
- 0: Allgemeine Rezension oder einfache Anfrage, keine offenen Beschwerden.
- 1: Offene Beschwerde bezüglich Logistik oder Service, aber ohne Sicherheitsprobleme, große Verluste oder enge Fristen.
- 2: Explizite Sicherheitsprobleme, große Verluste oder enge Fristen.
Jev gibt 1 zurück, was gemäß diesem Standard eine mittlere Dringlichkeit anzeigt.
Bewertungen hängen stark von deinen bereitgestellten Standards ab. Du kannst stattdessen die Qualität der Antwort oder die Relevanz bewerten, aber du musst definieren, was gut oder schlecht ist.
Es kann auch Bruchzahlen zwischen den Ebenen zurückgeben, nicht nur ganze Zahlen.

Noul: Wahrheit von Aussagen beurteilen
Schließlich geben wir ihm eine Aussage:
„Der Nutzer hat im Kommentar ausdrücklich eine Rückerstattung angefordert.“
Dieser Typ gibt eine Wahrscheinlichkeit zwischen 0 und 1 zurück, die die Likelihood darstellt, dass die Aussage wahr ist.
Ergebnis: 0,03 (3 %).
Der Nutzer ist unzufrieden, hat aber nicht ausdrücklich eine Rückerstattung verlangt. Daher gibt das Modell der „ausdrücklichen Rückerstattungsanforderung“ eine niedrige Wahrscheinlichkeit.

Betrachtet man alle zurückgegebenen Ergebnisse zusammen, ergibt sich ein klares Bild:

Diese vier Fragen wurden gemeinsam eingereicht, woraufhin alle Ergebnisse auf einmal geliefert wurden. Die API meldete eine Modell-Evaluationszeit von etwa 85 Millisekunden.
Nun hat das Programm nutzbare Informationen: Stimmungskategorie, Routing-Ziel, Prioritätsstufe, Rückerstattungsabsicht. Die Verarbeitung kann basierend auf diesen Ergebnissen fortgesetzt werden.
Wofür kann Jev genutzt werden?
Wir haben einen Kommentar verarbeitet. Auf einer E-Commerce-Plattform mit enormem täglichen Volumen erweitert sich dieser Einsatzbereich erheblich.
Erstens: Statistiken.
Welche Nutzer sind zufrieden? Wer beschwert sich über die Logistik? Welche Probleme benötigen den Kundenservice? Das Modell beurteilt die Bedeutung; das Programm aggregiert Zählungen und zeigt Kategorien an.
Zweitens: Vorfilterung, um zu entscheiden, was tiefergehend bearbeitet werden muss.
Allgemeine Rezensionen gehen in die Statistik. Elemente, die keine Antwort benötigen, überspringen individuelle Antworten. Offene Probleme werden an Menschen weitergeleitet. Für automatische Antworten geeignete Fälle, die von einem LLM generiert werden sollen, werden mit Kontext an größere Modelle übergeben.
Früher verursachte es hohe Anfangskosten, wenn ein teures allgemeines LLM alles erst einmal durchsiebte. Jetzt übernimmt Jev das Front-End-Screening und überlässt die Tiefenverarbeitung den LLMs.
Kann Keyword-Filterung funktionieren?
Teilweise, aber Keywords ignorieren den Kontext.
Beispiel:
„Die Qualität ist echt super, fiel nach einem Tag auseinander.“
Das Matching von „super Qualität“ klassifiziert dies fälschlicherweise als positiv. Liest man den ganzen Satz, erkennt man Sarkasmus.
Jev nimmt weiterhin natürliche Spracheingaben entgegen und versteht die volle Bedeutung. Seine Spezialisierung liegt im Aufgabentyp und im Ausgabeformat, nicht nur im Keyword-Matching.
Um Ergebnisse in Aktionen umzuwandeln, sind externe Programme erforderlich.
Gibt „An Mensch übergeben“ zurück, stellt das Programm die Warteschlange für manuelle Überprüfung bereit. Gibt „Automatische Antwort“ zurück, ruft das Programm ein LLM zur Generierung der Antwort auf. Aktionen werden durch Workflow-Regeln und Tools ausgeführt.
Bei Agenten wird dieses externe System, das Modellaufrufe, Tools und Workflows organisiert, oft als Harness bezeichnet. Jev passt in die Urteilspositionen innerhalb des Harness und hilft bei der Wahl der nächsten Schritte.
Daher glaube ich, dass Jev und LLMs komplementär sind, nicht exklusiv.
Konkret ersetzt man LLMs durch Jev für Klassifizierung und Bewertung. Später, beim Schreiben von Texten, Code oder komplexen mehrstufigen Schlussfolgerungen, verlässt man sich auf LLMs.
So kann ein System verschiedene Modelle für verschiedene Phasen nutzen und deren Fähigkeiten organisch kombinieren.

Wie erlebt man Jev?
Der direkteste Weg ist das Öffnen des TypeSafe Playground.
Melde dich an, gib den zu analysierenden Text in State (Material für das Urteil) ein. Stelle Fragen in Questions, wähle den Urteiltyp, fülle Optionen oder Bewertungskriterien aus und klicke auf Run, um die Ergebnisse zu sehen.
Probiere den vorherigen Kommentar aus oder tausche ihn gegen eine positive Rezension, um Änderungen zu beobachten.
Um es in deine Software zu integrieren, nutze die API.
Eine API ermöglicht es einer Software, Fähigkeiten für eine andere bereitzustellen. Hol dir einen API Key aus der Konsole. Dein Programm sendet Material und Fragen mit diesem Zugangscode, empfängt Ergebnisse und führt die nachfolgende Logik aus.
Offizielle SDKs werden ebenfalls bereitgestellt, die gängige Schnittstellenfunktionen für die Bequemlichkeit der Entwickler kapseln.
Preise: 0,042 USD pro Million Eingabe-Tokens, Ausgabe kostenlos. Eingaben umfassen Material, Fragen und Kriterien. Bei hohem Volumen im Kommentarfiltern kann dieses Pay-per-Call-Modell in bestehenden Flows genutzt werden.
Die Zukunft spezialisierter Urteilsmodelle
Nach der Recherche zu Jev war ich beeindruckt: Jemand hätte das schon lange tun sollen, aber niemand hat es getan.
Ich denke, dieser Ansatz ist richtig. Während alle darum wetteifern, die Leistung großer Modelle zu steigern, hat TypeSafe AI eine neue Spur eröffnet und maßgeschneiderte Modelle für Szenarien mit strukturierter Daten, probabilistischen Urteilen, Auswahlen und Entscheidungen geschaffen.
Kosten- und Geschwindigkeitsvorteile sind für Agenten vorteilhaft. Auf langsame Rückmeldungen großer Modelle zu warten, ist in einigen Kontexten ineffizient.
Ich glaube, dass andere Anbieter wahrscheinlich diesem Trend folgen werden, indem sie spezialisierte Modelle für die Urteilsphasen von Agenten bauen.
Ein Agent kann Modelle für schnelles Urteilen haben, andere für komplexes Denken/Schreiben/Codieren, plus Bild-/Audio-/Video-Modelle, die zusammenarbeiten.
Wenn Urteile schnell und günstig genug sind, können wir KI an Orten einsetzen, die previously als nicht lohnenswert für einen Aufruf galten. Für mich ist das der aufregendste Aspekt der Richtung von Jev.





