Hier ist die tl;dr ELI5.
Denk an Multiple-Choice-KI, nicht an KI-Aufsatzschreiben.
Sie chattet nicht. Sie trifft Entscheidungen, die deine Software umsetzen kann: „Spam oder kein Spam?“ „Welches Tool sollte dieser Agent nutzen?“ „Braucht das einen Menschen?“
Das Spannende: In den eigenen Workflow-Benchmarks von TypeSafe ist sie etwa 200x schneller und 400x günstiger als Frontier-LLMs, mit Antworten in Bruchteilen einer Sekunde.
Warum das mächtig ist: Stell dir eine App oder einen Agenten vor, der hunderte kleine Urteile fällt, ohne hunderte teure, langsame Gespräche mit einem LLM führen zu müssen.
Behalte das große Modell für das schwierige Denken und Schreiben. Nutze Jev für die schnellen Entscheidungen dazwischen.
Ach ja, und es wurde beiläufig von Diogo Almeida entwickelt, dem Mitgründer von ChatGPT und einem der Erfinder von RLHF, der zwei Jahre im Stealth-Modus daran gearbeitet hat.
Das ist der Pitch. Hier sind die Belege.
Neun /last30days-Scans, jede Rohdatei vollständig gelesen und jeder große Post manuell gegen die Live-Seite geprüft. Der Launch-Post steht nach zwei Tagen bei 66K Likes und 31,4 Mio. Views.
https://x.com/CompleteSkeptic/status/2099925682726002904
Ein darauf basierender Browser-Agent erzielte 1,8 Mio. Views an einem Tag. Und ein Entwickler zählte seine Rechnung: etwa 5.000 Requests für rund zwei Dollar, verteilt auf Klassifizierung, Model-Routing, Intent-Erkennung und Steering.
https://x.com/MichaelLee04/status/2100003037150683593
Ich habe diese Workflows nicht selbst ausgeführt. Ich habe die Recherche auf die Community gerichtet und bewertet, was Leute tatsächlich ausliefern. Von 31 Kandidaten-Workflows mit benannter Quelle und echten Zahlen sind dies die 9, die sich lohnen – jeweils mit dem Code zum Kopieren.
🧠 Die Mechanik in sechzig Sekunden
Du gibst ihr den Zustand deiner App plus eine typisierte Frage, und sie liefert eine typisierte Entscheidung mit einer Wahrscheinlichkeit zurück. Kein JSON-Prompting, keine Parsing-Schicht, nichts zu validieren.
Drei Fragetypen, und das ist die gesamte Oberfläche: \Choice\ wählt eine von bis zu 255 Optionen, \Score\ ordnet etwas auf einer Skala ein, \Noul\ beantwortet Ja oder Nein als Zahl zwischen 0 und 1. Jede Antwort enthält \probabilities\ und einen \confidence\-Wert. Stelle zwanzig Fragen zum gleichen Zustand in einem Call, und sie werden parallel ausgewertet, sodass zwanzig ungefähr so viel kosten wie eine. Input kostet $0,042 pro Million Tokens. Output ist kostenlos.
Die Community landete beim gleichen Framing wie mein Tweet, mit deutlich mehr Reichweite: LLMs generieren Antworten, Jev trifft Entscheidungen, 2.278 Likes.
Meine Headline-Zahlen haben einen Fußnoten-Haken. TypeSafe gibt die Response-Time mit 70 bis 500 Millisekunden an und behauptet, sie sei 40x bis 200x schneller als Frontier-Modelle. Das exakte Paar auf ihrer Startseite, aus ihren eigenen Workflow-Evals, ist 193,6x schneller und 444,6x günstiger. Die Baseline, gegen die gemessen wird, ist wichtig:
Also, hier ist ihre Startseite, und das Erste, was sie dir zeigt, ist der Side-by-Side-Vergleich mit GPT-5 X Terra, einem der Mid-Range-Modelle von OpenAI.
- Nimrod, YouTube, 13.747 Views
Der Name ist keine Kahneman-Referenz, obwohl die Modellklasse System One heißt.
Hierher kommt der Name Jev tatsächlich, und es ist nicht Kahneman, sondern ein Ökonom des 19. Jahrhunderts namens William Stanley Jevons.
- Dots and Arrows, YouTube, 14.597 Views
Jevons-Paradoxon: Mach eine Ressource billiger, und die Leute verbrauchen viel mehr davon. Dein Entscheidungsmodell danach zu benennen, ist eine These.
Es ist auch ein Witz. Rob Shocks schnitt in seinem Breakdown mit 231.655 Views einen Clip mit „My name is Jeff“, und der Top-Kommentar mit 142 Likes lautete einfach: „My name is Jev killed me.“ Diogo hat die Witze selbst kassiert, 129 Likes.
1. 🌐 Ein Browser-Agent, der Flüge in 7 Sekunden für $0,0039 findet
Was es ist. Ein kleiner Open-Source-Browser-Agent, bei dem Jev den nächsten Klick auswählt und ein kleines LLM nur dann aufwacht, wenn etwas getippt werden muss.
Wer es betreibt. Gregor Zunic, Gründer von Browser Use. 7,2K Likes, 1,8 Mio. Views, 7,6K Bookmarks. Er merkt im Post an, dass das Video mit 1x-Geschwindigkeit läuft.
https://x.com/gregpr07/status/2100411066966749359
Warum es einen Platz verdient hat. Es ist das meistgesehene Ding, das jemand auf dem Modell gebaut hat, und es ist die sauberste Illustration des Musters, das immer wieder gewinnt: ein neuer Action Space bei jedem Schritt, das DOM als State, Jev wählt aus den Kandidaten, Generierung nur als Fallback. LangChains eigener Writeup sagt, Kyle Jeong von Browserbase mache das Gleiche für Bruchteile eines Cents.
Der Payload ist das Repo: browser-use/jev-ultrafast. Klone es, bevor du dein eigenes schreibst.
2. 🧹 Sofortige Komprimierung: Bewerte jeden Tool-Call und wirf den Müll raus
Was es ist. Ersetze den Summarization-Prompt, den jeder Coding-Agent am Kontext-Limit ausführt, durch einen Jev-Pass, der jeden Tool-Call auf Relevanz bewertet und totes Gewicht löscht.
Wer es betreibt. Tamara Tran stellte die Frage und lieferte die Antwort noch am selben Nachmittag ab. 5K Likes, 554,4K Views.
https://x.com/tamarajtran/status/2100694549362553153
Alex Volkov führte es als Claude-Plugin aus und postete die Zahl: Eine Sekunde, um eine Session von fast 1M Tokens auf 86K zu reduzieren. 1,9K Likes, 3,5K Bookmarks.
https://x.com/altryne/status/2100739055923425589
Warum es einen Platz verdient hat. Weil Diogos Antwort der Hinweis darauf ist, wohin das führt. 304 Likes.
https://x.com/CompleteSkeptic/status/2100702845779775675
Wenn ein Harness in einer Sekunde bewerten und löschen kann, statt zusammenzufassen, hört der Context Window auf, das Ding zu sein, um das du designst. Das ist der Sleeper-Pick. Browser Use ist besser im Video; Komprimierung ist das, was jeder Coding-Agent-Nutzer heute spürt.
Füge dies in Claude Code ein, das ist Alexs exakte Installationszeile:
1Installiere und konfiguriere: https://github.com/tamaratran/fast-jev-compaction
3. 🛡️ Der Safety-Reviewer, entbündelt vom Harness
Was es ist. Jeder Coding-Harness führt einen Classifier aus, der fragt „Soll dieser Befehl ausgeführt werden?“, bevor der Auto-Modus ihn zulässt. Bis diese Woche lebte dieser Classifier im geschlossenen Teil des Produkts.
Wer es betreibt. Vercel, in Produktion. Guillermo Rauch: Der Default-Modus in fx ist auto, mit einem Safety-Reviewer, der jeden Befehl analysiert, und Jev ist bis zu 18x schneller bei p95 und genauer als das Modell, das es heute ausführt. 3,7K Likes, 392,4K Views.
https://x.com/rauchg/status/2100307962262872105
https://x.com/fazxes/status/2100300097695232164
Warum es einen Platz verdient hat. Weil es eine Produktions-Migration mit einer p95-Zahl ist, und weil LangChain die offene Version am nächsten Tag als \AutoModeMiddleware\ veröffentlichte. Der Rob-Shocks-Breakdown mit 231.655 Views und 3.526 Likes ist derjenige, den du einem Kollegen schicken solltest, der die Story in zehn Minuten braucht.
Die LangChain-Version, wörtlich aus ihrem Post:
1from langchain.agents import create_agent2from langchain_typesafe.experimental.middleware import (3 AutoModeMiddleware,4)56guardrail = AutoModeMiddleware(tools=["bash"])78agent = create_agent("openai:gpt-5.6-luna", middleware=[guardrail])
4. 🚦 Model-Routing als Middleware, nicht als System Prompt
Was es ist. Setze Jev vor deinen Modell-Fleet und lass es entscheiden, welches Gehirn jeden Request bearbeitet, wobei die Wahrscheinlichkeiten im Agent-State verbleiben, damit du die Wahl auditieren kannst.
Wer es betreibt. LangChain, in Sydney Runkles „Building a Harness with Jev“. 232 Likes, 31,1K Views, und der sauberste How-to-Wire-it-Artikel, den jemand veröffentlicht hat.
https://x.com/sydneyrunkle/status/2100754364545761643
Warum es einen Platz verdient hat. Model-Routing ist der am häufigsten zitierte Job für das Modell im gesamten Korpus; es ist einer der fünf Workloads im „5.000 Requests für $2“-Post oben in diesem Artikel. LangChain machte daraus elf Zeilen, die du lesen kannst, statt eines Absatzes in einem System Prompt.
1from langchain.agents import create_agent2from langchain_typesafe.experimental.middleware import (3 ModelChoice,4 ModelRouterMiddleware,5)67router = ModelRouterMiddleware(8 choices={9 "fast": ModelChoice(10 model="openai:luna",11 criteria="Direkte Lookups, Extraktion und lokale Änderungen.",12 ),13 "powerful": ModelChoice(14 model="openai:sol",15 criteria="Architektur und Entscheidungen mit hohem Risiko.",16 ),17 },18 instructions="Wähle das kostengünstigste Modell, das die Aufgabe erledigen kann.",19)2021agent = create_agent("openai:gpt-5.6-luna", middleware=[router])
Installiere mit \pip install langchain-typesafe\ und setze \TYPESAFE_API_KEY\.
5. 🔎 RAG-Präzision: Abrufen wie üblich, dann löschen, was nicht hingehört
Was es ist. Behalte deinen Retriever genau so, wie er ist. Führe Jev über jeden Chunk aus, den er zurückgibt, mit einer Ja-oder-Nein-Frage, und wirf die raus, die durchfallen.
Wer es betreibt. Kush Bhuwalka fasste es in einem Satz zusammen: Führe Jev über alle abgerufenen Chunks aus und lösche die irrelevanten. 416 Likes.
https://x.com/kushbhuwalka/status/2100731050075050485
Warum es einen Platz verdient hat. Präzision war die ungelöste Hälfte von RAG, weil die Lösung immer ein weiterer LLM-Call pro Chunk war, den sich niemand zur Retrieval-Zeit leisten konnte. Bei kostenlosen Output-Tokens und Sub-Sekunden-Latenz ist ein Urteil pro Chunk billiger als der Embedding-Lookup, der den Chunk erzeugt hat. Diesen habe ich gegen die dokumentierte API geschrieben, in der Form, die Kush beschrieb:
1from typesafe_sdk import Noul, TypeSafeClient23client = TypeSafeClient()45kept = []6for chunk in retrieved_chunks:7 verdict = client.system_one(8 state={"question": user_question, "chunk": chunk.text},9 questions={10 "relevant": Noul(11 instructions="Der Chunk enthält Informationen, die nötig sind, um die Frage zu beantworten",12 ),13 },14 )15 if verdict.answers["relevant"].noul > 0.5:16 kept.append(chunk)
6. 🎮 Echtzeit-Loops: Minecraft, Doom und ein Launcher, der deine Gedanken liest
Was es ist. Entscheidungen innerhalb eines Loops, der viele Male pro Sekunde läuft, wo ein Frontier-Modell gar nicht teilnehmen kann.
Wer es betreibt. Wuyang Zhou lässt Jev und GPT-6 Astra gemeinsam Minecraft spielen, Jev für die schnellen Reaktionen und Astra für die Planung voraus, während sie mehrere Zombies gleichzeitig bekämpfen. 374 Likes, 51,4K Views.
https://x.com/wuyang_zhou/status/2100727660875808913
Nader Dabit baute ein Keystroke-Oracle: Tippe „das pdf, das ich gerade heruntergeladen habe“ und das neueste PDF ist bereits der Top-Treffer, mit voller Konfidenz, bei jedem Tastendruck, in etwa 100 Millisekunden. 264 Likes.
Warum es einen Platz verdient hat. TypeSafes eigene Launch-Demo ist Doom, wobei das Modell etwa zehnmal pro Sekunde gefragt wird, was zu tun ist. Zwei unabhängige Erklärer kamen auf dieselben Kosten für diesen Loop:
Jev spielt in Echtzeit mit etwa 10 Entscheidungen pro Sekunde, und das ergibt etwa $7 pro Stunde.
- AI WITH Rithesh, YouTube, 19.904 Views
Zehn Entscheidungen pro Sekunde für sieben Dollar pro Stunde versetzt es in eine andere Kategorie als ein LLM, und die Minecraft-Aufteilung, schnelles Modell reagiert, langsames Modell plant, ist das Muster, das jeder Echtzeit-Pick in dieser Liste teilt.
7. 📬 E-Mail-Triage im Batch-Maßstab
Was es ist. Richte Jev auf einen Inbox-Export und lass es jede Nachricht parallel sortieren, bewerten und markieren.
Wer es betreibt. Der vogel Channel auf YouTube, 60.996 Views und 526 Likes, führte 1.500 exportierte E-Mails in Batches von 100 mit 8 Workern aus. LangChains Writeup nennt Ryan Vogel als eines der drei Projekte, die sie beobachten. Syntax, 33.933 Views und 1.052 Likes, baute das Gleiche plus eine Home-Automation-Demo, die von der Frage zum API-Call in 300 Millisekunden geht.
Warum es einen Platz verdient hat. Es ist die am häufigsten kopierte Demo im Korpus, und die Durchsatz-Rechnung ist der Punkt.
Wir haben hier unten nur noch ein Guthaben von $5, was nur zeigt, wie günstig dieses Modell ist.
- vogel, YouTube, 60.996 Views
Dies ist TypeSafes eigener Quickstart, wörtlich, und es ist bereits eine E-Mail-Triage-Pipeline:
1pip install typesafe-sdk
1from typesafe_sdk import Choice, Noul, Score, TypeSafeClient23client = TypeSafeClient()45response = client.system_one(6 state="Hi, ich versuche seit 3 Tagen, mein Stripe-Konto zu verbinden, und es schlägt ständig fehl. Ich verliere Verkäufe. Bitte helft mir ASAP.",7 questions={8 "department": Choice(9 instructions="Welches Team sollte sich darum kümmern",10 criteria={11 "billing": "Zahlungs- oder Abonnement-Probleme",12 "technical": "Bugs oder Integrationsprobleme",13 "sales": "Preis- oder Konto-Fragen",14 },15 ),16 "frustration": Score(17 instructions="Wie frustriert der Kunde erscheint",18 criteria=[19 "Ruhig, stellt nur Fakten dar",20 "Frustriert, aber höflich",21 "Sehr wütend, starke Sprache",22 ],23 ),24 "is_urgent": Noul(25 instructions="Die Nachricht vermittelt Dringlichkeit oder Zeitkritikalität",26 ),27 },28)2930print(response.answers["department"].choice)31print(response.answers["frustration"].score)32print(response.answers["is_urgent"].noul)
8. 🗂️ Map-Reduce über Dokumente: 777 Urteile für einen viertel Cent
Was es ist. Ein Satz Fragen, jedes Dokument, alles auf einmal. Der Workload, der mit Frontier-Modellen wirtschaftlich unmöglich und mit klassischen Classifiern mittelmäßig war.
Wer es betreibt. Mike Taylor, Head of Evals bei Every, führte den saubersten Test durch, den jemand veröffentlicht hat: 27 seiner eigenen Artikel plus 10 AI-stylisierte Gegenstücke, 21 Fragen jeweils, alles in einem Request. 777 Urteile in weniger als 0,7 Sekunden, für etwa einen viertel Cent. Über alle elf seiner Experimente hinweg: 1.709 Urteile für unter einem Cent. Der AI Daily Brief, 10.000 Views, griff die Zahl am selben Tag auf.
Warum es einen Platz verdient hat. TypeSafe listet dies als First-Party-Kategorie, „AI Map Reduce over Big Data“, auf ihrer Use-Case-Map. Kostenlose Output-Tokens ändern die Arithmetik bei allem, was du zeilenweise ausführst. Die rohe HTTP-Form, aus den Docs, ist klein genug, um hier reinzupassen:
1{2 "model": "jev-latest",3 "state": "Hi, ich versuche seit 3 Tagen, mein Stripe-Konto zu verbinden, und es schlägt ständig fehl. Ich verliere Verkäufe. Bitte helft mir ASAP.",4 "questions": {5 "is_urgent": {6 "type": "noul",7 "instructions": "Die Nachricht vermittelt Dringlichkeit oder Zeitkritikalität"8 }9 }10}
Das gibt \{"is_urgent": {"type": "noul", "noul": 0.999}}\ zurück. Zwanzig Fragen im \questions\-Objekt kosten ungefähr so viel wie eine, also frage alles ab, was du pro Zeile wissen willst, in einem einzigen Call.
9. 🧪 Jev im Browser, und die Klone
Was es ist. Die Schnittstelle, neu implementiert auf einem lokalen Modell von Leuten, die die Form wollten, ohne die Abhängigkeit.
Wer es betreibt. Kshetrajna Raghavan bei Shopify baute Reflex, ein Qwen-Modell, das strukturierte Entscheidungen mit Wahrscheinlichkeiten auf WebGPU ausführt, komplett im Browser. Tobi Lütke teilte es herum: 206 Likes, 38,5K Views.
https://x.com/tobi/status/2100742327459303882
Ein reverse-engineertes jevlike holte 157 Punkte auf der Hacker News Front Page zwei Tage nach dem Launch, und mini-jev, dieselbe Schnittstelle auf einem lokalen LLM, folgte einen Tag später. Der Community-Katalog, awesome-jev-by-typesafe, stand bei 409 Sternen, als ich ihn abrief.
Warum es einen Platz verdient hat. Drei unabhängige Klone innerhalb von 72 Stunden sind das stärkste Signal in diesem Sweep dafür, ob die Schnittstelle die echte Erfindung ist. Es gibt dir auch einen Offline-Notausgang für alles, was du nicht über die Leitung senden kannst, was wichtig ist, weil das echte Ding API-only und US-gehosted ist. Probiere Reflex jetzt in einem Tab aus.
📖 Wie TypeSafe sagt, dass man es nutzt
Vier Regeln, aus den Docs und aus den Antworten des Gründers selbst:
- Stelle viele Fragen pro Call. Sie werden parallel ausgewertet, und die Docs sagen, dass zusätzliche Fragen die Response-Time kaum verändern. Jeder Pick oben, der jemanden beeindruckte, fragte mehrere Dinge zu einem State.
- Threshold auf Confidence. Die Docs sagen dir, alles unter 0,3 bis 0,5 als Signal zu behandeln, einen Menschen zu fragen, statt zu handeln. Das ist der Unterschied zwischen einem Classifier, der dir ein Label gibt, und einem Entscheidungssystem, das dir ein Label plus Erlaubnis gibt, es zu nutzen.
- Gib ihm Kandidaten, bitte es nicht, welche zu erfinden. Browser Use baut den Action Space aus dem DOM und Jev wählt. RAG ruft ab und Jev filtert. Der Launcher rankt und Jev re-rankt. Choice unterstützt bis zu 255 Optionen; füge ein „other“ für Edge Cases hinzu.
- Bekomme das Grading richtig, sonst zählt nichts anderes. Ein Builder, der die Woche damit verbrachte, es kaputt zu bekommen, sagte es klar: „Wenn du das Grading nicht richtig hinbekommst, funktioniert es nicht.“ Der Optionssatz und die Formulierung der Frage sind die Arbeit; der Call selbst ist trivial.
Wo du es ausprobieren kannst: Es steckt bereits hinter den Gateways, die du nutzt. Vercel AI Gateway innerhalb von 48 Stunden, und mit 2.341 Likes ist das der zweitgrößte Post der Firma, nur hinter der Stealth-Ankündigung.
https://x.com/typesafeai/status/2100376436272173088
Cloudflare AI Gateway, 749 Likes, und OpenRouter im Beta-Stadium, 387 Likes, in derselben Woche. Direkter Zugriff ist \POST [https://api.typesafe.ai/v1/systemone](https://api.typesafe.ai/v1/systemone)\ mit einem Bearer Token.
⚖️ Die ehrliche Einschränkung
Der Hacker News Launch-Thread, "Introducing System One Models and Jev", 1.863 Punkte und 490 Kommentare, verbrachte den Großteil seiner Länge mit einer Phrase aus dem Marketing:
Außerdem scheint 'can't hallucinate' falsch zu sein? Klar, es kann keinen invaliden Typ ausgeben, aber es kann immer noch einen völlig falschen validen Wert ausgeben.
- jacobgold, Hacker News Launch-Thread, 1.863 Punkte
Diogoo kämpfte nicht dagegen. Als ein Kommentator darlegte, dass dies ein Klassifikationsmodell sei, kein LLM, nannte er die Erklärung „sehr akkurat!“ und fügte nur hinzu, dass er eher zero-shot als instruction-tuned sagen würde. Das ist das ehrliche Framing, und es ist deutlich kleiner als das, was der Hype am Launch-Tag eine neue Art von Intelligenz nannte: ein sehr guter Zero-Shot-Classifier mit kalibrierten Wahrscheinlichkeiten und einer echten API.
Reddits größter Jev-Thread handelt davon, wer es zuerst gebaut hat. r/LocalLLaMA's "Ich habe die Jev-Architektur buchstäblich vor einem Jahr gebaut und komplett open-source mit Modell, Dataset und Paper gemacht", 1.568 Upvotes und 164 Kommentare, zog die Antwort an, die die Stimmung der ganzen Branche zusammenfasst:
Aber hast du es gepostet und gesagt, es sei das nächste große Ding? Rookie mistake
- hapliniste, Reddit, 495 Upvotes
Der Trostpflaster-Kommentar mit 351 Upvotes im selben Thread: Wegen dieser Vorarbeit kann niemand die allgemeine Idee patentieren und wegsperren.
Every's Mike Taylor schickte 12 Passagen mit eingebauten Defekten durch Jev und durch Fable 5.1 bei High Effort. Jev kam mit einer Median-Zeit von 0,35 Sekunden pro Passage zurück gegenüber 8,83, etwa 25x schneller und ungefähr 580x günstiger. Es fing auch sechs der sieben Defekte. Fable fing alle sieben. Sein Urteil: Nützlich als Frühwarnsystem, weil die Alternative ist, gar nicht zu prüfen. Ein zweiter, kleinerer Side-by-Side in einem Research-Loop gegen gpt-6-astra kam auf etwa 7x End-to-End, Median Decision 213ms gegenüber 2.436ms, beide Lanes 3 von 3 korrekt, was echt und nützlich ist, aber weit weg von 200x. TypeSafes eigener Vier-Workflow-Durchschnitt, wie AISeeKing es von ihrem Chart ablas, liegt bei 67,8% Übereinstimmung mit den Referenzantworten.
Die Hype-Müdigkeit ist auch real. Der Top-Kommentar, 262 Likes, auf einem Erklärvideo mit 75.750 Views, das mit „Ich glaube wirklich, es könnte ein Game Changer sein“ begann, lautete: „Vielleicht mein Hass-Satz aller Zeiten.“
Und die schärfste Reaktion im gesamten Sweep war ein Zuschauer, der ein ganzes Erklärvideo sah und mit leeren Händen herauskam:
Ich habe das ganze Video gesehen und habe immer noch keine Ahnung, was JEV ist oder tut.
- Nullzero98, YouTube, 19 Likes
Dieser Kommentar ist der Grund, warum dieser Artikel existiert. Die Regel, die das auflöst, stammt von einem Entwickler, der ohnehin seit Jahren so baut, und sie passt auf einen Sticker: KI führt aus, Code entscheidet.
🔍 Wie ich diese ausgewählt habe
Elf /last30days-Läufe über X, YouTube, Hacker News, Reddit, TikTok, Instagram, Digg, GitHub und arXiv lieferten 716 Items. Ich las jede Rohdatei vollständig, öffnete dann jeden Post mit echtem Traktion und prüfte seine Zahlen gegen die Live-Seite, denn die größten Posts über ein zweitägiges Produkt waren nicht dort, wo die Keyword-Suche sie erwartet hatte. 39 Kandidaten-Workflows hatten eine benannte Quelle und eine echte Zahl. Ich behielt 9. Nicht mehr als zwei Picks lehnen sich an denselben Autor oder Kanal an. Jede Engagement-Zahl ist das, was X oder YouTube zum Zeitpunkt des Pulls anzeigte, genau so gerundet, wie sie es runden.
Zum Code: Vier Payloads sind wörtlich. Der E-Mail-Triage-Block ist TypeSafes eigener Quickstart aus ihren Docs, die rohe JSON-Form stammt aus denselben Docs, und die beiden Middleware-Blöcke sind aus LangChains Post kopiert. Alex Volkovs Komprimierungs-Installationszeile ist sein exakter Wortlaut. Ich schrieb den RAG-Filter selbst gegen die dokumentierte API in der Form, die Kush beschrieb, und es ist ein Entwurf mit gutem Fundament, nicht etwas, das jemand in Produktion laufen hat.
Embeds sind für Posts reserviert, die Aufmerksamkeit verdienten. Alles unter einigen hundert Likes wird stattdessen inline verlinkt, denn ein kleiner Post, der zu einer Quote Card aufgeblasen wird, sieht nur wie Beweis aus.
🔑 Muster über die Auswahl hinweg
- Das schnelle Modell reagiert, das langsame plant. Minecraft, der Wikipedia-Wettlauf im Launch-Thread, Browser Use und Compaction folgen alle demselben Prinzip.
- Füttere es mit Kandidaten. Die Gewinner bitten Jev nie darum, eine Option zu generieren. Sie erstellen den Optionsatz im Code – aus dem DOM, dem Retriever, dem Tool-Trace oder dem Launcher-Index – und lassen ihn wählen.
- Freie Output-Tokens leisten mehr als die Geschwindigkeitszahl. Jede zeilen- oder chunk-basierte Aufgabe wird hier durch den Preis ermöglicht.
- Der Konfidenzwert ist das Produkt. Ohne einen kalibrierten Schwellenwert ist dies nur ein schneller Klassifikator. Mit einem ist es eine Entscheidungsebene, die weiß, wann sie aufhören muss.
- Die Schnittstelle ist die Erfindung, nicht die Gewichte. Drei funktionierende Klone in 72 Stunden, und der größte Reddit-Thread stammt von jemandem, der die Architektur vor einem Jahr veröffentlicht hat.
- Die akademische Version war zuerst da. TabAgent auf arXiv vertritt dieselbe Argumentation für den Ersatz von Routing-, Gating- und Verifizierungsaufrufen durch Klassifikatoren, jedoch ohne angebundenes Produkt.
- Die Community hat bereits den richtigen Namen dafür geprägt. Ein Entwickler, der katalogisierte, was Leute veröffentlichten, prägte den Begriff „AI if statement“, was die nützlichsten drei Worte sind, die bisher über das Modell geschrieben wurden.
🧵 Was ich damit tun würde
Behalte das große Modell für schwieriges Denken und Schreiben. Setze dieses Modell für jede einfache Beurteilung im Loop ein, nutze den Konfidenz-Schwellenwert und eskaliere alles unter 0,5 an ein größeres Modell oder einen Menschen. Installiere heute noch das Compaction-Plugin, denn das ist das einzige, dessen Wirkung du noch heute Abend spüren wirst.
📊 Alle Agenten haben zurückgemeldet
Reddit: 113 Threads / 24.425 Upvotes / 4.159 Kommentare; X: 314 Posts / 30.192 Likes / 1.538 Reposts, plus 13 manuell gegen die Live-Seite verifizierte Posts; YouTube: 75 Videos / 4.545.636 Aufrufe; TikTok: 36 Videos / 171.040 Aufrufe; Instagram: 14 Reels / 10.778 Likes; Hacker News: 133 Stories / 25.312 Punkte / 11.852 Kommentare; GitHub: 6 Repos / 842 Sterne; Digg: 7 Cluster / 119 Posts; arXiv: 18 Papers. Zusammengetragen aus elf /last30days-Läufen am 17.09.2026, Zählungen sind Bruttowerte über die Läufe vor Deduplizierung.





