Die KI, die nicht schreibt, sondern die Automatisierung der Arbeit verändert
„Wer sollte diese Anfrage bearbeiten?“ „Widerspricht dieser Text der Dokumentation?“ „Brauchen wir für diese Anfrage eine leistungsstarke KI?“
Beim Versuch, Arbeitsabläufe zu automatisieren, tauchen solche kleinen Entscheidungen immer wieder auf. Was man braucht, ist keine ausführliche Erklärung, sondern eine Antwort, die es erlaubt, zur nächsten Aufgabe überzugehen. Doch jedes Mal eine hochleistungsfähige generative KI für jede einzelne Entscheidung aufzurufen, summiert sich in Verarbeitungszeit und Kosten.
Hier kommt eine sehr interessante KI ins Spiel: „Jev“, veröffentlicht von TypeSafe AI am 15. September 2026. Es handelt sich nicht um ein Modell zum Schreiben von Texten, sondern um eines, das speziell für Aufgaben wie Klassifizierung, Bewertung und Scoring entwickelt wurde. Es ist das erste einer neuen Serie namens „System One Models“. (TypeSafe AI
Lassen Sie uns jedoch zunächst ein Missverständnis ausräumen. Jev schlägt nicht alle KIs weltweit in jeder Metrik, noch ist es für jeden Anwendungsfall die günstigste Option. Der eigentliche Reiz liegt darin, dass es sinnbasierte Entscheidungsprozesse kostengünstig und schnell integrieren kann.
Es geht hier nicht darum, Ihre alltägliche Chat-KI auszutauschen. Vielmehr könnte es darum gehen, unnötige Wartezeiten und Kosten in den KI- oder Geschäftssystemen zu reduzieren, die Sie aktuell nutzen. Aus dieser Perspektive wird die Attraktivität von Jev deutlich.
Hinweis: Funktionen, Preise und Verfügbarkeit entsprechen dem Stand vom 18. September 2026.
1. Jev ist keine „Schreib-KI“, sondern eine „Entscheidungs-Liefer-KI“
Die Grundprämisse von Jev besteht darin, notwendige Informationen und Fragen zu übergeben und Ergebnisse in einem vordefinierten Format zurückzuerhalten. Die Eingabeinformationen werden als „State“ bezeichnet, aber man muss dies nicht kompliziert betrachten. Es ist einfach eine Sammlung von Materialien für die Entscheidung, wie z. B. Anfragetexte, Kundendetails oder interne Richtlinien. Dies kann nicht nur als Text, sondern auch als JSON mit Feldnamen und Werten übergeben werden. (TypeSafe AI
Nehmen wir an, ein Kunde kontaktiert Sie mit der Nachricht: „Ich glaube, ich wurde doppelt belastet, bitte prüfen.“
Was Sie von Jev verlangen, ist nicht das Verfassen einer Entschuldigungs-E-Mail. Es sind Entscheidungen wie: „Welche Abteilung ist zuständig: Buchhaltung, Technik oder Vertrieb?“, „Wird explizit eine Rückerstattung angefordert?“ und „Ist eine dringende Reaktion erforderlich?“
Das Programm, das diese Ergebnisse empfängt, kennzeichnet die Anfrage oder benachrichtigt den zuständigen Mitarbeiter. Wenn eine Antwort nötig ist, wird eine andere generative KI beauftragt, den Text zu entwerfen. Sie trennen die Entscheidung vom Schreiben. Diese Integrationsmethode ist offiziell dokumentiert. (TypeSafe AI
Beachten Sie, dass Jev selbst keine E-Mails liest oder autonom an Kunden sendet. Das Abrufen von Informationen, das Prüfen von Zugriffsrechten und das Ausführen von Aktionen werden von umgebenden Programmen übernommen. Jev erledigt die dazwischenliegenden Entscheidungen. Die Schnittstelle, über die Software die KI aufruft, ist die API. (TypeSafe AI
2. Drei Kernfunktionen: Auswählen, Bewerten und Wahrscheinlichkeitsurteil
Jev bietet drei Haupttypen von Frageformaten. Das Verständnis dieser Formate klärt, welche Aufgaben es bewältigen kann.
Choice (Auswahl): Aus vordefinierten Optionen wählen
Choice ist eine Funktion, die eine Option aus einer vorbereiteten Liste auswählt. Sie kann für Klassifizierungen wie „Leiten an Vertrieb, Support oder Buchhaltung?“ oder „Ist dieser Artikel Einsteigerfreundlich, Praxisorientiert oder Nachrichten?“ verwendet werden.
Der Rückgabewert ist nicht nur die Auswahl. Sie erhalten auch Wahrscheinlichkeiten für jede Kandidatenoption und Werte zur Handhabung der Konfidenz. Aktuell können bis zu 255 Optionen pro Frage definiert werden. Wenn Eingaben möglicherweise in keine Kategorie passen, ist es üblich, „Sonstiges“ oder „Unzureichende Information“ einzubeziehen. (TypeSafe AI
Score (Bewertung): Nach Kriterien bewerten
Score bewertet Elemente basierend auf geordneten Bewertungskriterien.
Definieren Sie beispielsweise die Dringlichkeit einer Anfrage als „Standardreaktion“, „Schnelle Reaktion erforderlich“ oder „Geschäftsbetrieb gestoppt; sofortige Reaktion erforderlich“. Erklären Sie statt einer vagen Frage nach „Wichtigkeit von 1 bis 100“, was jede Stufe bedeutet.
Die Ausgabe enthält Bewertungen sowie Wahrscheinlichkeiten für jede Stufe. Diese repräsentieren die Positionierung relativ zu den Kriterien, keine exakten Berechnungen von Umsatzbeträgen oder Häufigkeiten. (TypeSafe AI
Noul: Wahrscheinlichkeit der Bedingungserfüllung zurückgeben
Noul wird für Ja/Nein-Fragen wie „Enthält dieser Text eine Stornierungsabsicht?“ verwendet. Das Ergebnis ist ein Wert zwischen 0 und 1.
Wichtig ist, zwischen „Wahrscheinlichkeit des Auftretens“ und „tatsächlicher Reaktionsaktion“ zu unterscheiden. Ob Sie einen Manager informieren oder beim Nutzer nachfragen, weil die Stornierungswahrscheinlichkeit hoch ist, ist Ihre Entscheidung. Noul liefert Urteilsgrundlagen; es diktiert keine Politik. (TypeSafe AI
3. Warum ist es so schnell? Parallele Entscheidungen statt langer Antworten
Anstatt Erklärungen sequenziell zu generieren, gibt Jev feste Antworten und Wahrscheinlichkeiten parallel zurück. TypeSafe erklärt, dass eine Trainingsmethode namens „RLCD“ verwendet wird, die die Angemessenheit von Entscheidungen und Wahrscheinlichkeiten priorisiert. Das Ziel unterscheidet sich von der Erstellung menschenpräferierter Texte. (TypeSafe AI
Für Nutzer liegt der entscheidende Vorteil in der Möglichkeit, mehrere Fragen zu einem einzigen Informationspaket zu bündeln.
Lesen Sie beispielsweise eine Anfrage und prüfen Sie gleichzeitig „Klassifizierung“, „Dringlichkeit“, „Rückerstattungsanfrage“ und „Unzufriedenheitsgrad“. Dies reduziert die Kommunikations-Round-Trips im Vergleich zum Warten auf ein Ergebnis, bevor die nächste Frage gesendet wird. Offiziell führt das Hinzufügen von Fragen typischerweise nicht zu einer signifikanten Erhöhung der Antwortzeit. (TypeSafe AI
Allerdings bedeuten mehr Fragen auch mehr Input-Tokens. Unbegrenzte kostenlose Abfragen stehen nicht zur Verfügung. Da zudem jede Frage unabhängig evaluiert wird, erfordern Prozesse mit sequenzieller Logik (Lesen vorheriger Antworten) separate Aufrufe oder Code-Verzweigungen. (TypeSafe AI
Wenn Sie denken: „Können normale generative KIs nicht auch klassifizieren und JSON ausgeben?“ – da haben Sie recht. OpenAI und andere bieten strukturierte Ausgaben an. Der Wert von Jev liegt nicht in der Erfindung der strukturierten Ausgabe, sondern in der Optimierung von Geschwindigkeit, Preis und Wahrscheinlichkeitsausgaben speziell für repetitive, eng gefasste Entscheidungsaufgaben. (OpenAI Developers
4. Wie günstig ist es? 42 $ für 1 Million Anfragen bei jeweils 1.000 Tokens
Der öffentliche API-Preis für Jev beträgt 0,042 $ pro Million Input-Tokens. Output-Tokens sind kostenlos. Es handelt sich nicht um einen monatlichen Flatrate-Plan, sondern um Bezahlung nach Input-Volumen. Die Kosten werden in „Tokens“ berechnet, der Einheit, die KI zur Verarbeitung von Text nutzt. (TypeSafe AI
Zur Visualisierung nehmen wir 1.000 Tokens pro abrechenbarem Input (inklusive Kontext und Fragen) an.
Volumen | Jev Input-Kosten | Ca. Yen (bei $1=¥150) |
|---|---|---|
10.000 | $0,42 | ¥63 |
100.000 | $4,20 | ¥630 |
1.000.000 | $42,00 | ¥6.300 |
Dies ist eine einfache Berechnung basierend auf öffentlichen Tarifen, keine gemessenen Ist-Werte. Wechselkurse sind Annahmen. Wenn die Eingabegröße um das Fünffache steigt, steigen die Kosten um das Fünffache.
Außerdem schließt dies Datenabruf, Server, Transkription, andere generative KIs sowie Systementwicklung/-wartung aus. Es bedeutet nicht: „Alle 1 Million Geschäftsaufgaben können für ¥6.300 erledigt werden.“ Halten Sie diese Punkte getrennt.
Dennoch lohnt es sich, diesen Stückpreis in Betracht zu ziehen, wenn dieselben Prüfungen auf massive Datensätze angewendet werden. Niedrige Preise sind am wichtigsten, wenn Zehntausende von Kommentaren, Anfragen oder Dokumenten kontinuierlich verarbeitet werden sollen, und nicht nur wenige Anfragen.
5. Sollte man „194x schneller, 445x günstiger“ glauben?
Die offizielle Website listet Zahlen wie „193,6x schneller“ und „444,6x günstiger“ auf. Diese basieren jedoch auf spezifischen Workflow-Bewertungen, die auf System-One-Aufgaben abzielen. Solche Unterschiede gelten nicht für alle Verarbeitungsarten. (TypeSafe AI
TypeSafe selbst weist darauf hin, dass diese Multiplikatoren das obere Ende der erreichbaren Verbesserungen darstellen. Die Benchmarks verwenden Vorhersagen großer Modelle und beweisen keine Überlegenheit in allen menschlich verifizierten Geschäftsfällen. Veröffentlichte Antwortzeiten von 70–500 ms müssen auch im Zusammenhang mit Netzwerkbedingungen und Eingabeinhalten betrachtet werden. (TypeSafe AI
Ein nützlicher Referenzwert ist die am 17. September veröffentlichte Messung von Classmethod. Bei der Evaluierung von vier Eingabetypen jeweils zehnmal (insgesamt 40 Durchläufe) lagen die medianen Antwortzeiten bei ca. 0,643–0,674 Sekunden, und die Kosten pro Aufruf bei ca. $0,000025–$0,000027. Beachten Sie, dass dies eine Verifizierung unter Verwendung von vier unterschiedlichen, leicht verständlichen Eingaben war, die wiederholt wurden, und keine Garantie für Genauigkeit in breiten realen Szenarien darstellt. (Classmethod DevelopersIO
Schauen Sie über Marketing-Multiplikatoren hinaus und fragen Sie: „Ist es für meine Arbeit ausreichend genau, günstiger als jetzt und schneller als jetzt?“ Verifizieren Sie dies mit Ihren eigenen Daten, um zu entscheiden, ob eine Einführung sinnvoll ist.
6. Zehn praktische Anwendungsfälle für Jev
Basierend auf offiziellen Beispielen folgen hier praktische Anwendungen. Dies sind keine fertigen Apps, sondern erfordern die Kombination von APIs mit umgebender Infrastruktur.
① Anfragen klassifizieren und Reihenfolge der Bearbeitung bestimmen
Erstellen Sie ein System, das Inhalt, Dringlichkeit und Unzufriedenheitsgrad aus dem Anfragetext beurteilt und sie an Abteilungen oder Wartelisten weiterleitet. (TypeSafe AI
Selbst wenn etwas als „Bug“ gekennzeichnet ist, unterscheiden sich Anfragen, die nahe an Feature-Anforderungen liegen, von solchen, die den Geschäftsbetrieb stoppen. Beginnen Sie damit, kritische Kontakte zu markieren, statt automatisch zu antworten.
② SNS-Kommentare für die Planung organisieren
Wenden Sie Klassifizierung an, um SNS-Kommentare in „Fragen“, „Beschwerden“, „Testimonials“ oder „Kaufzweifel“ zu sortieren. Das Labeln von nutzergenerierten Inhalten ist ein offizieller Anwendungsfall. (TypeSafe AI
Wenn viele sagen „Scheint schwierig“, zeigen Sie im nächsten Post Schritte auf. Wenn viele nach dem Preis fragen, korrigieren Sie die Preiserklärung. Nutzen Sie Jev, um Reaktionen für die Planung zu organisieren, nicht um Massennachrichten zu produzieren.
③ Vertriebs-Leads priorisieren
Evaluieren Sie, ob Anfragen spezifische Probleme, Implementierungszeiträume oder Passgenauigkeit für Ihren Service erwähnen. Bestimmen Sie die Lesereihenfolge für Vertriebsmitarbeiter. (TypeSafe AI
Schließen Sie nicht allein aus dem Text auf „Diese Person wird definitiv kaufen“. Scores dienen der Priorisierung, nicht dem Verwerfen von Leads.
④ Relevante Infos aus internen Docs für RAG filtern
Bei der suchverstärkten Generierung (RAG) überprüfen Sie, ob abgerufene Snippets tatsächlich mit der Frage zusammenhängen. Nutzen Sie Jev, um Relevanz/Widersprüche zu beurteilen und zu filtern, was an die antwortende KI weitergegeben wird. (TypeSafe AI
Bei Fragen zur Urlaubsrichtlinie schließen Sie irrelevante Richtlinien aus und priorisieren Sie anwendbare Regelungen. Trennen Sie das Suchen von der Bewertung der Suchergebnisse.
⑤ KI-Zitate verifizieren
Prüfen Sie, ob KI-generierte Behauptungen mit den zitierten Quellen übereinstimmen. Offizielle Beispiele nutzen Code, um die Existenz von Zitaten zu verifizieren, und Jev, um die semantische Unterstützung zu beurteilen. (TypeSafe AI
Wenn der Text sagt „Nachweislich wirksam“, deutet die Quelle vielleicht nur auf eine Möglichkeit hin. Prüfen Sie die inhaltliche Übereinstimmung, nicht nur die Präsenz der URL.
⑥ Vorveröffentlichungs-Checks für KI-Antworten
Untersuchen Sie KI-Eingaben/Ausgaben auf gefährliche Anforderungen oder Regelverstöße und leiten Sie verdächtige Fälle an Menschen weiter. Code entscheidet basierend auf den Urteilen über Freigabe/Blockierung/Review. (TypeSafe AI
Nützlich, um zu prüfen, ob Antworten unbestätigte Bedingungen versprechen oder Informationen durchsickern lassen. Da Urteile fehlerhaft sein können, verlassen Sie sich nicht darauf als einzige Sicherheitsmaßnahme.
⑦ Nur komplexe Anfragen an High-End-KI routen
Einfache Abfragen gehen an Standardcode; erklärende Anfragen an generative KI; komplexe Probleme an Hochleistungsmodelle/Menschen. Nutzen Sie Jev für die initiale Triage. (TypeSafe AI
Es ist nicht nötig, lange Schlussfolgerungen anzustellen, nur um den Versandstatus für eine Bestellnummer zurückzugeben. Aber verifizieren Sie, ob der Routing-Overhead wirklich Zeit/Kosten spart.
⑧ Extrahierte Kandidaten aus Dokumenten auswählen
Wenn Rechnungen mehrere Beträge/Kontakte liefern, fragen Sie Jev: „Welcher ist der Gesamtbetrag?“ oder „Welcher ist der Kontakt?“ Offizielle Beispiele extrahieren Kandidaten per Code und wählen dann mit Jev aus. (TypeSafe AI
Überlassen Sie Bild-OCR oder Extraktion nicht Jev. Lassen Sie Code mathematische/Datumsvergleiche durchführen. Nutzen Sie KI nur dort, wo Urteilskraft gefragt ist.
⑨ Semantische Checks für Artikel/Posts
Programme zählen Zeichen. Aber zu prüfen, „Sind Begriffe für Anfänger erklärt?“ oder „Beantwortet der Haupttext die Überschrift?“, erfordert Lesen. Semantische Checks sind ein offizieller Anwendungsfall. (TypeSafe AI
Fragen Sie „Ist die Zielgruppe im Intro klar?“, „Sind Voraussetzungen genannt?“ statt „Ist das gut?“. Überlassen Sie das Redigieren Autoren/KI.
⑩ Auswahl von Smart Home/App-Operationen
Offizielle Demos klassifizieren natürlichsprachliche Anforderungen, um Gerätetypen/Aktionen auszuwählen. Ordnen Sie menschliche Sprache ausführbaren Befehlen zu. (TypeSafe AI
Ähnliche Logik gilt für die Auswahl von App-Operationen. Aber das Definieren von Kandidaten, Berechtigungen, Ausführung und Fehlerbehandlung erfordert separate Arbeit. Jev steuert Ihren PC nicht frei.
7. Einfach zu testen mit Claude Code oder Codex
Als Einstiegspunkt ermöglicht der offizielle Playground Tests mit Text und Fragen. Für die API-Nutzung holen Sie sich Schlüssel aus dem Admin-Panel. Zum Start erfolgt der Zugang im Early-Access-Modus mit einer Warteliste. (TypeSafe AI
Es gibt auch offizielle TypeSafe Skills für Coding-KIs wie Claude Code oder Codex. Diese bringen der KI bei, wie Fragen konstruiert, API-Formate genutzt und Integrationen erstellt werden. Die Installation eines Skills ersetzt Ihr aktuelles Modell nicht durch Jev. (TypeSafe AI
Beispiel-Prompt für Coding-KI:
Überprüfe das offizielle TypeSafe Skill und die neuesten Docs. Erstelle einen Prototyp, der Anfrage-CSVs mit Jev klassifiziert. Felder: Klassifizierung, Dringlichkeit, Rückerstattungsanfrage. Nimm „Sonstiges“ und „Unzureichende Info“ in die Optionen auf. Speichere Fragen/Kriterien an einer editierbaren Stelle. Lade den API-Key aus der Umgebungsvariable TYPESAFE_API_KEY; logge ihn niemals. Teste zuerst auf einem anonymisierten kleinen Datensatz. Speichere Originaltext, Urteil, Wahrscheinlichkeit, Konfidenz, Modellversion, Zeit, Tokenanzahl. Leite unsichere Urteile/API-Fehler an menschliches Review weiter. Implementiere NICHT das Senden an Kunden, Rückerstattungen oder Datenlöschung.
Dies dient dem Prototyping. Beginnen Sie mit dem Vergleich der Ergebnisse gegen bekannte korrekte Daten, nicht mit voller Automatisierung.
8. Einschränkungen und Vorsichtsmaßnahmen vor der Nutzung
Gehen Sie nicht davon aus, dass japanische Genauigkeit englischer entspricht. Offizielle Docs besagen, dass Englisch die primäre Trainingsprache ist. Während Japanisch unterstützt wird, ist die Genauigkeit nicht gleichwertig. Evaluieren Sie mit echten japanischen Formulierungen. (TypeSafe AI
Nehmen Sie Edge Cases wie „Daijoubu desu“ (Ja/Nein Mehrdeutigkeit) oder „Not really urgent“ (True/False Dringlichkeit) in Tests auf, um zu sehen, was an Menschen eskaliert werden muss.
Aktuell ist die Eingabe nur textbasiert. Kein direktes Bild/Audio/Video. Jev generiert keinen Text, Code oder erklärende Gründe. (TypeSafe AI
Es gibt Limits. Jev 1.13 unterstützt 64k Tokens pro Anfrage insgesamt und 32k für State + längste Frage kombiniert. Das öffentliche Rate Limit beträgt 1.200 Calls/min, kann sich ändern. Planen Sie Retries/Waits bei Massenverarbeitung ein. (TypeSafe AI
Schwächen liegen bei Berechnungen, Zählen, Datumsvergleichen, komplexer indirekter Schlussfolgerung und Eingaben mit viel irrelevanten Infos. Böswillige Prompts können Urteile beeinflussen. Liefern Sie fokussierte Infos und klare Fragen. (TypeSafe AI
„Zero Hallucination“ bedeutet nicht „Keine Fehler“. Es garantiert die Einhaltung des Ausgabeformats, nicht die richtige Optionsauswahl. Die Wahl von „Buchhaltung“ statt „Vertrieb“ bei einer binären Entscheidung kann für die spezifische Anfrage dennoch falsch sein. Die „Null“-Aussage bezieht sich auf die Formatgültigkeit. (TypeSafe AI
Konfidenz-Scores in Choice/Score werden aus Wahrscheinlichkeitsverteilungen abgeleitet. „0,9“ garantiert nicht 90 % Genauigkeit in Ihrem spezifischen Geschäft. Noul fehlt dieses Feld. Definieren Sie Automatisierungsschwellenwerte durch geschäftsspezifische Validierung. (TypeSafe AI
Prüfen Sie die Datenhandhabung. Die offizielle Richtlinie besagt, dass Kundendaten nicht für das Modelltraining verwendet werden, und Enterprise-Optionen bieten Nicht-Speicherung. Allerdings unterscheidet sich „nicht trainiert auf“ von „niemals gespeichert“. Überprüfen Sie Verträge, bevor Sie Kundeninfos eingeben. (TypeSafe AI
9. Am besten für spezifische Teile nutzen, nicht als vollständigen Ersatz
Ich würde mit Anfrageklassifizierung, Kommentarorganisation und Entwurfs-Review-Kandidaten beginnen. Diese ermöglichen menschliche Korrektur und einfachen Ergebnisvergleich. Vermeiden Sie es, finale Rückerstattungsentscheidungen oder kritische Vertragsurteile anfangs zu delegieren.
Überwachen Sie nicht nur die Genauigkeit, sondern auch übersehene Fälle, Volumen des menschlichen Reviews, Verarbeitungszeit und Gesamtkosten. Niedrigere API-Gebühren verlieren ihren Wert, wenn der Aufwand für Fehlerkorrekturen steigt.
Manche mögen enttäuscht sein, dass Jev nicht schreiben oder Bilder erstellen kann. Aber nicht alle KIs müssen denselben Job machen.
Lassen Sie Schreib-KIs schreiben. Lassen Sie Code rechnen. Lassen Sie Menschen kritische fachliche Urteile fällen. Testen Sie, ob Jev die massive Mittelschicht aus Klassifizierung und Verifikation bewältigen kann.
Der Charme von Jev liegt nicht darin, alles zu tun, sondern darin, günstige, häufige Aufrufe für notwendige Entscheidungen zu ermöglichen. Überlegen Sie, wo es in Ihrem „Lesen → Sortieren → Verifizieren“-Workflow passt. Diese Klarheit definiert den Zweck des Testens dieser KI.





