YouMind
Se connecter

Jev n'a pas été conçu pour créer des Agents

@kylejeong
ANGLAIS21 sept. 2026
126K
173
21
5
324

TL;DR

Jev est un modèle d'IA spécialisé pour des décisions rapides et structurées, distinct des agents à usage général. Cet article explique son architecture, ses avantages en termes de coûts et son intégration pratique dans des workflows logiciels comme Stagehand.

Sauf si vous avez vécu dans une grotte au cours de la dernière semaine, vous avez probablement vu Jev de @typesafeai.

https://x.com/CompleteSkeptic/status/2099925682726002904

Ils décrivent leurs modèles comme :

une classe de modèles d'IA conçus pour prendre des décisions rapides et structurées que les logiciels peuvent utiliser directement. Un modèle System One évalue un

état et renvoie des réponses typées et des probabilités.

Selon les benchmarks de TypeSafe, Jev est 20 à 200 fois plus rapide et 40 à 400 fois moins cher que les LLM.

Mais pourquoi cela compte-t-il vraiment ? Nous avons déjà entraîné des classificateurs par le passé (la correction automatique sur votre téléphone, le filtrage Gmail, etc.), mais selon Twitter, Jev est quelque chose de spécial.

Dans cet article, je vais vous expliquer ce qu'est Jev, pourquoi il existe, et comment vous pouvez l'intégrer dans vos systèmes de production.

Qu'est-ce que Jev exactement ?

« Considérez Jev comme un appel de fonction d'intelligence de pointe : état non structuré en entrée, décisions probabilistes typées en sortie. » - TypeSafe

Jev expose 3 primitives : Choice, Score et Noul.

  • Choice est un type de question qui sélectionne une option parmi un ensemble défini (de 255 maximum), dont la réponse inclut l'option sélectionnée, une probabilité pour chaque option et un niveau de confiance.
  • Score note le contenu par rapport à des niveaux descriptifs ordonnés, dont la réponse inclut un score, une probabilité pour chaque niveau et un niveau de confiance.
  • Noul demande au modèle d'évaluer une question oui/non et de renvoyer la probabilité que la réponse soit « oui ».

Voici un exemple d'entrée et de sortie pour un cas d'usage de support client :

json
1// Input
2{
3 "model": "jev-latest",
4 "state": "Hi, I was charged twice for my monthly subscription. Could you refund the extra charge? My account is working fine.",
5 "questions": {
6 "department": {
7 "type": "choice",
8 "instructions": "Which team should handle this message?",
9 "criteria": {
10 "billing": "Charges, payments, subscriptions, and refunds",
11 "technical": "Bugs, errors, and broken features",
12 "account": "Login, passwords, and account access"
13 }
14 },
15 "requests_refund": {
16 "type": "noul",
17 "instructions": "Is the customer explicitly requesting a refund?"
18 },
19 "frustration": {
20 "type": "score",
21 "instructions": "How frustrated does the customer sound?",
22 "criteria": [
23 "Calm: politely describes the issue without expressing frustration",
24 "Frustrated: expresses annoyance or dissatisfaction",
25 "Very frustrated: expresses strong anger or threatens to leave"
26 ]
27 }
28 }
29}
30// Output
31{
32 "model": "jev-1.13.0",
33 "answers": {
34 "department": {
35 "type": "choice",
36 "choice": "billing",
37 "confidence": 1,
38 "probabilities": {
39 "technical": 0,
40 "account": 0,
41 "billing": 1
42 }
43 },
44 "requests_refund": {
45 "type": "noul",
46 "noul": 0.99
47 },
48 "frustration": {
49 "type": "score",
50 "score": 0,
51 "legend": {
52 "0": "Calm: politely describes the issue without expressing frustration",
53 "1": "Frustrated: expresses annoyance or dissatisfaction",
54 "2": "Very frustrated: expresses strong anger or threatens to leave"
55 },
56 "confidence": 1,
57 "probabilities": {
58 "0": 1,
59 "1": 0,
60 "2": 0
61 }
62 }
63 },
64 "usage": {
65 "input_tokens": 442,
66 "output_tokens": 72
67 },
68 "request_id": "playground_12bbfa4198be5ca4de9818a45c0906a2055",
69 "evaluation_time_ms": 163.01120699790772
70}

Je vous recommande de parcourir leur onboarding du tableau de bord pour mieux comprendre comment l'état et les questions interagissent pour produire des résultats.

N'est-ce pas juste un classificateur ?

Eh bien, oui et non. C'est plutôt comme si un LLM et un classificateur avaient eu un enfant.

Les classificateurs traditionnels sont bons pour les tâches à volume élevé avec une taxonomie fixe. Pensez à LeNet-5 capable d'identifier quel chiffre représente une image. Cependant, les classificateurs sont généralement ultra-spécialisés et spécifiques à un domaine. Les LLM sont bons pour générer des séquences. Ils sont flexibles et excellents pour les tâches ouvertes définies à l'exécution, mais ils sont aussi plus lents (qu'un classificateur), plus chers et moins prévisibles.

Jev est un « modèle fondamental pour la classification », combinant la flexibilité du langage naturel d'un LLM avec la sortie contrainte et probabiliste d'un classificateur. Vous pouvez accomplir une grande variété de tâches sans avoir à entraîner un nouveau modèle, tout en maintenant une expertise dans divers domaines (code, texte, logs, états d'interface utilisateur, événements, etc.). Jev peut également générer des sorties en parallèle, ce qui le rend beaucoup plus rapide qu'un LLM limité à la génération séquentielle.

TL;DR c'est un classificateur généralisable très intelligent.

Pourquoi Jev existe-t-il ?

Le PDG et cofondateur de TypeSafe, Diogo Almeida, a travaillé chez OpenAI où il a contribué à créer RLHF (apprentissage par renforcement à partir des retours humains) et le produit ChatGPT. RLHF nous a permis d'entraîner les LLM à suivre très efficacement les instructions et les prompts, ce qui correspond à leur nature autorégressive.

Il a ensuite quitté OpenAI pour fonder TypeSafe et entraîner une autre classe de modèles destinés à permettre aux logiciels d'être alimentés par l'IA, plutôt que des agents. Jev est entraîné avec RLCD (apprentissage par renforcement à partir de décisions calibrées), ce qui signifie techniquement qu'ils entraînent le modèle à être très bon pour sortir des niveaux de confiance et des probabilités plutôt que des réponses brutes.

TypeSafe croit que le logiciel devrait être intelligent. Les agents ne s'intègrent pas naturellement dans le fonctionnement historique des logiciels, et le principe « human-in-the-loop » rend difficile la création de logiciels à la fois intelligents ET autonomes. Jev est une étape vers une intelligence composable et fiable, intégrée comme primitive dans les systèmes logiciels.

Ce n'est pas une idée entièrement nouvelle ; des chercheurs ont découvert en 2017 que une forte précision prédictive ne garantit pas des estimations de confiance fiables (les LLM ne sont donc pas une solution parfaite ici).

Pourquoi RLCD plutôt que RLHF ?

Le problème avec RLHF est que ce que les humains veulent n'est pas toujours objectivement correct. Le fait que nous préférions une certaine réponse dans un certain format ne rend pas les modèles plus intelligents, mais simplement plus agréables à utiliser.

Cela introduit également un effondrement de mode (mode collapse). RLHF pousse les LLM à converger vers une seule réponse, alors que parfois plusieurs trajectoires pourraient être considérées comme « correctes ».

« Une sortie peut être convaincante pour une personne sans être suffisamment fiable pour une automatisation sans supervision. La préférence humaine et la fiabilité machine sont des objectifs d'optimisation différents. »

Kyle Jeong - inline image

Effondrement de mode via la documentation de Jev

Jev n'a PAS été conçu pour construire des agents

Contrairement à ce que vous voyez partout sur votre fil d'actualité, Jev n'est pas très performant en tant qu'agent autonome. Nous avons essayé de construire des versions de celui-ci, à la fois Jev seul et LLM + Jev.

https://x.com/kylejeong/status/2100622054945095934

Honnêtement, les agents basés sur Jev font de bonnes démos impressionnantes. Il y en a eu beaucoup utilisant Jev pour effectuer des tâches d'agent à une vitesse fulgurante. Mais même les meilleures démos ne sont pas prêtes à être déployées en production.

Un modèle comme Jev est destiné aux logiciels alimentés par l'IA ; il peut vous aider à prendre des décisions composées dans du code déterministe. Sans capacités de raisonnement ou de génération, l'utiliser comme agent autonome relève purement de l'ignorance.

Kyle Jeong - inline image

Logiciels alimentés par l'IA

Plutôt que de laisser Jev agir comme un agent autonome d'utilisation d'ordinateur, il devrait être utilisé dans le routage du support client, le traitement des factures, les alertes de sécurité et le triage, ou comme moniteur d'agent.

Les chiffres

Leur premier modèle, Jev 1.13.0, coûte 42 $/btok (ou 0,042 $/mtok) en entrée et 0 $ pour les jetons de sortie. Pour référence, Fable 5.1 coûte 10 $/mtok en entrée, soit 10 000 $ / Btok. Les charges de travail typiques en entreprise ont un ratio entrée-sortie de 3:1 ou 4:1, ce qui porte Fable à environ 20 000 $/Btok (avec une sortie à 50 $/mtok).

La fenêtre de contexte est de 64k jetons par requête, où l'état + la question la plus longue doivent tenir dans 32k jetons.

Cependant, dans leurs benchmarks internes, ils surpassent tous les modèles en termes de précision/coût et précision/vitesse par rapport à OpenAI, Anthropic et Deepseek (via Fireworks pour l'inférence).

Kyle Jeong - inline image

précision/coût

Assez parlé, comment l'utiliser ?

Vous devriez maintenant avoir une bonne compréhension de Jev pour avoir imaginé quelques cas d'usage, quel que soit le projet sur lequel vous travaillez actuellement. (Si ce n'est pas le cas, voici une liste de cas d'usage recommandés par TypeSafe).

Plutôt que de limiter votre créativité sur la façon dont vous devriez l'utiliser, je vais vous montrer comment nous avons adapté Jev à notre framework Stagehand.

Au cours des deux dernières années, Stagehand a évolué en tant que framework permettant à l'IA et aux agents de contrôler un navigateur distant. Avant que les agents ne soient assez performants, nous avons créé des primitives IA : Act (exécuter une action), Extract (extraire des données structurées) et Observe (découvrir les actions potentielles sur une page) pour aider les développeurs à écrire des scripts auto-réparateurs pour automatiser le web.

Au lieu d'utiliser Playwright (ou d'autres frameworks hérités) et de devoir analyser manuellement le DOM pour fournir des sélecteurs dans les actions, Stagehand A/E/O vous permet d'utiliser le langage naturel pour construire des automatisations.

typescript
1// Playwright
2await page.click('button[type="submit"]');
3
4// Stagehand
5stagehand.act("click the submit button")

Ceci est utile lors de la rédaction initiale des scripts (la vitesse de développement est bien plus rapide), mais surtout pour la maintenance des scripts. Si un site web change et que les sélecteurs DOM sont mis à jour, les scripts Playwright doivent être réécrits pour correspondre à la nouvelle page. Stagehand choisit les sélecteurs et les actions à l'exécution, et sont « auto-réparateurs ».

Vous commencez à voir où nous voulons en venir. Jev s'intègre extrêmement bien dans ces primitives. À l'origine, nous utilisions un LLM (avec le contexte de l'apparence de la page et de l'objectif) pour décider quoi faire. Avec Jev, nous pouvons utiliser Choice pour décider avec quels sélecteurs interagir.

Utilisons spécifiquement Act pour détailler le flux. Normalement, nous donnerions au LLM une représentation concise de la page en utilisant un arbre d'accessibilité hybride. Avec Jev, nous commençons par marquer les nœuds dans l'arbre d'accessibilité comme étant interactifs (y compris les éditeurs de texte enrichi) ou non.

Lorsque stagehand.act est appelé :

  • Jev classe l'instruction en une action (comme cliquer, remplir ou faire défiler)
  • Stagehand analyse les arguments et construit une liste de candidats pour cette action (incluant le contexte de la page à proximité)
  • Jev répond à « quel candidat est le meilleur » et « est-ce qu'un candidat correspond » avec un seuil d'acceptation de 0,7
  • Si l'action candidate est acceptée, Stagehand gère l'exécution
  • Si l'action n'est pas acceptée, Stagehand revient à un LLM
Kyle Jeong - inline image

Flux Act

Lors des premiers tests, la latence médiane d'Act passe de 1,97 seconde à 0,46 seconde, soit environ 4,3 fois plus rapide (ou 77 % de temps en moins). Voir la pile complète des PR.

Avec l'utilisation d'ordinateur, Jev est une pièce du puzzle, mais pas une solution autonome. Nous sommes désormais capables de construire des outils logiciels plus déterministes que les agents peuvent utiliser.

Kyle Jeong - inline image

Quand utiliser Jev

Diffuser l'IA dans le monde réel

Jev construira-t-il des agents d'utilisation d'ordinateur de qualité production ? Non. Est-ce une pièce utile du puzzle ? Je pense que oui.

On dirait qu'il y a une abondance d'idées qui n'avaient aucun sens avant Jev. J'ai vu des gens construire des recherches instantanées, des collages intelligents, et d'autres outils simples mais extrêmement utiles.

L'IA ne devrait pas être confinée à une version quelconque d'une interface de chat, synchrone ou asynchrone. Avec des modèles comme Jev, nous pouvons construire des logiciels qui intègrent des modèles de prédiction sans boîte de saisie de chat. Bien que les classificateurs existent depuis longtemps, ils n'ont jamais semblé aussi utiles. Peut-être que tout ce dont nous avions besoin pour construire était de l'inspiration.

-> Kyle

Enregistrer en un clic

Lire les articles viraux en profondeur avec l’IA de YouMind

Enregistrez la source, posez des questions ciblées, résumez l’argument et transformez un article viral en notes réutilisables dans un seul espace de travail IA.

Découvrir YouMind
Pour les créateurs

Transformez votre Markdown en un article 𝕏 impeccable

Quand vous publiez vos propres textes longs, la mise en forme 𝕏 des images, tableaux et blocs de code est pénible. YouMind transforme un brouillon Markdown complet en un article 𝕏 impeccable, prêt à publier.

Essayer Markdown vers 𝕏

D'autres patterns à décoder

Articles viraux récents

Explorer plus d'articles viraux