Bonjour à tous, je suis Jin Chenma.
Commençons par une question : en termes de contenu traité, quels sont les types courants de grands modèles d'IA auxquels nous sommes généralement confrontés ?
La plupart des gens connaissent bien le texte, les images, l'audio et la vidéo. Au cours des dernières années, divers fournisseurs ont continuellement rivalisé et fait évoluer ces domaines, rendant les capacités plus puissantes et la concurrence plus féroce.
Après avoir vu tant de mises à jour, je me suis demandé : au-delà du renforcement des modèles existants, de nouvelles formes de modèles vont-elles émerger ?
Récemment, un modèle appelé Jev est devenu viral. Au début, je me suis dit : s'agit-il simplement d'une autre entreprise qui lance un nouveau grand modèle de langage ?
Mais après avoir creusé davantage, j'ai trouvé ce modèle véritablement impressionnant.
Derrière lui, TypeSafe AI a proposé une classe de modèles appelés System One Models, spécifiquement conçus pour les tâches de jugement dans les logiciels. Jev est leur premier modèle public.
Les catégories précédentes (texte, image, audio, vidéo) étaient divisées par type de contenu ; cette fois, ils ont changé d'angle : prendre le « jugement » comme une tâche autonome et concevoir un modèle autour de celle-ci.
Je pense que cette direction pourrait avoir un impact profond sur le développement futur et la division du travail dans les modèles d'IA.
Dans cet article, je vais expliquer clairement ce qu'est Jev, comment il diffère des LLM standards, où il peut être utilisé et comment commencer.
Commençons par l'analogie du code QR
Comment comprendre Jev ? Imaginez que vous souhaitez générer un code QR.
Normalement, vous utiliseriez un outil générateur de codes QR. Mais supposons que vous engagiez un artiste capable de dessiner n'importe quoi, en lui demandant de dessiner le code QR pixel par pixel.
Bien sûr, cet artiste est habile et peut le faire. Mais générer un code QR dispose d'outils dédiés. Vous avez juste besoin d'un code QR fonctionnel, pas d'un paysage peint avec celui-ci.

De même, en comparant Jev aux Grands Modèles de Langage (LLM) :
Les LLM peuvent écrire des articles, du code et discuter de problèmes complexes. Si vous demandez à un LLM de lire un commentaire et de juger le sentiment de l'utilisateur, il peut certainement le faire.
Mais si la tâche ne nécessite qu'un choix ou une note, considérez ceci : pouvons-nous créer un modèle plus rapide, moins cher et accessible par programmation spécifiquement pour de telles tâches ?
C'est exactement ce que fait Jev.
Il abandonne la génération libre de texte pour se spécialiser dans les jugements ayant des périmètres de réponse clairs. Par exemple, si vous fournissez quatre options — « Satisfait », « Insatisfait », « Mitigé », « Indéterminé » — il sélectionne l'une d'elles et fournit des probabilités pour chaque option.
Tout comme les codes QR ont des outils dédiés, les tâches nécessitant uniquement des choix et des notes peuvent être gérées par des modèles spécialisés. Selon les présentations officielles, l'optimisation de Jev pour ces tâches de jugement réduit le temps de réponse et les coûts d'appel.
Par exemple, filtrer massivement des commentaires e-commerce quotidiennement nécessite de juger le sentiment, l'urgence et les méthodes de traitement. Des jugements plus rapides et moins chers réduisent les temps d'attente globaux et les coûts. Les programmes reçoivent les résultats et procèdent au classement ou au transfert vers un humain.
L'origine de Jev
Qui a créé Jev ? Pourquoi construire un modèle uniquement pour le jugement ?
Jev vient de TypeSafe AI, fondée par Diogo Almeida, qui travaillait auparavant sur la recherche en modèles de chat chez OpenAI.
Il s'est concentré sur un problème : l'IA est excellente pour discuter, mais pourquoi ses capacités ne sont-elles pas faciles à intégrer dans des logiciels pour des tâches automatisées ?
Les logiciels excellent à exécuter des règles explicites. Si la condition A est remplie, faites l'action B. Mais beaucoup de jugements réels sont difficiles à pré-définir avec des règles.
Comme la lecture de commentaires. Quelles expressions sont des plaintes ? Quelles sont des blagues ? Celles qui semblent positives mais contiennent une critique cachée ? Il est difficile de couvrir tous les schémas de parole des utilisateurs avec quelques règles.
TypeSafe veut rendre le jugement sémantique un composant appelable. Quand un programme doit comprendre un texte ou choisir la prochaine étape, il délègue cette petite tâche au modèle, obtient le résultat et continue l'exécution.
Ils appellent ces modèles System One, empruntant le concept de Système 1 / Système 2 (ou Thinking, Fast and Slow). Pensez-y comme la partie de jugement rapide et intuitive.
Le nom Jev vient de l'économiste Jevons. L'attente de l'équipe est simple : plus le coût des appels intelligents est bas, plus les endroits où les gens les utiliseront seront nombreux.
Certaines étapes semblaient auparavant trop coûteuses pour un seul appel IA. Si le jugement est assez rapide et bon marché, cela devient intéressant à reconsidérer.
En quoi Jev diffère-t-il des LLM ?
Rendre les appels logiciels pour le jugement IA moins chers et plus faciles est un bon point de départ. Mais les LLM existants peuvent aussi juger et retourner des résultats structurés. Pourquoi construire Jev ?
Voyons d'abord comment les LLM livrent les résultats de jugement aux programmes.
Les LLM supportent la sortie structurée, ce qui signifie que les réponses s'insèrent dans des emplacements prédéfinis. Par exemple, un emplacement pour le sentiment, un autre pour l'urgence, un autre pour la méthode de traitement. Le programme sait ce que représente chaque position.
Vous connaissez peut-être JSON, un format courant pour les données structurées. Les développeurs peuvent contraindre les sorties des LLM à suivre des formats spécifiques.
Ainsi, regarder seulement si la sortie finale est du texte ou du JSON ne révèle pas la principale différence entre Jev et les LLM.
La différence réside dans la façon dont le modèle génère le résultat.
Les LLM génératifs standards produisent typiquement des réponses token par token. Les tokens sont de petits fragments de texte traités par le modèle. Même si vous demandez des données au format fixe, il génère généralement le résultat étape par étape.
Jev utilise une méthode de sortie spécialisée pour les tâches de jugement, fournissant plusieurs jugements et probabilités en parallèle. Vous pouvez poser plusieurs questions sur le même commentaire et obtenir tous les résultats en une seule requête.
Cette différence de sortie est liée à la vitesse et au coût mentionnés précédemment. Les logiciels traitant massivement des données quotidiennement engendrent des coûts significatifs même pour de petites étapes. Les agents, qui appellent des outils et exécutent des tâches continues, doivent décider de la prochaine étape à répétition. La vitesse de réponse et le coût d'appel affectent directement la conception logicielle, les frais opérationnels et l'expérience utilisateur. Certaines étapes précédemment ignorées en raison de la lenteur ou du coût élevé peuvent désormais inclure le jugement IA.
Il y a aussi la stabilité de la sortie. Nous définissons un ensemble d'options, et il retourne des résultats dans ce périmètre, facilitant le traitement par le programme en aval.
Trois nouvelles fonctionnalités de Jev
Le cœur de Jev réside dans trois nouvelles fonctionnalités. Leur logique de conception est intéressante et mérite examen.
Brièvement, Choice effectue des sélections parmi des options données ; Score attribue des notes basées sur des critères ; Noul juge la probabilité qu'une affirmation soit vraie.
Ici, j'utiliserai le Playground officiel pour démontrer ces fonctionnalités avec un exemple pratique.
Utilisons le traitement de commentaires e-commerce. Supposons que vous gériez une boutique en ligne recevant des avis clients quotidiens. Vous devez évaluer la satisfaction, identifier les problèmes nécessitant un suivi, déterminer les méthodes de traitement et prioriser les cas urgents.
Nous soumettrons ce commentaire à Jev :
« Le produit est bon, mais la livraison a pris dix jours, et le service client n'a pas répondu. »
Nous utiliserons les trois fonctionnalités pour juger ce commentaire et voir les résultats.
Choice : Effectuer des sélections
Premièrement, demandez : Quel est le sentiment général ?
Options fournies : Satisfait, Insatisfait, Mitigé, Indéterminé.
Résultat : « Mitigé ».
C'est facile à comprendre. L'utilisateur loue le produit mais se plaint de la logistique et du service. Choisir seulement « Satisfait » ou « Insatisfait » perd une partie du sens.
De même, nous pouvons demander : Comment ce commentaire doit-il être traité ensuite ?
Options : « Transférer à un humain », « Réponse automatique », « Pas de réponse nécessaire ». Règle ajoutée : Les plaintes non résolues concernant le service nécessitent un suivi humain.
Résultat : « Transférer à un humain ».
Notez que le contenu de la question à choix multiples peut varier. Sentiment, département, action suivante — tout peut être cadré ainsi. Les options sont fournies par nous ; Jev juge basé sur le matériel et les exigences.

Score : Attribuer des notes
Ensuite, demandez : Quelle est l'urgence de ce commentaire ? À quelle vitesse devons-nous assurer le suivi ?
Avant de noter, définissez les normes. Trois niveaux sont établis ici :
- 0 : Avis général ou simple demande, sans plainte non résolue.
- 1 : Plainte logistique ou de service non résolue, mais sans problème de sécurité, perte majeure ou délai serré.
- 2 : Problème de sécurité explicite, perte majeure ou délai serré.
Jev retourne 1, indiquant une urgence moyenne selon cette norme.
Les scores dépendent fortement des normes que vous fournissez. Vous pouvez passer à l'évaluation de la qualité de réponse ou de la pertinence, mais vous devez définir ce qui constitue le bon ou le mauvais.
Il peut aussi retourner des scores fractionnaires entre les niveaux, pas seulement des entiers.

Noul : Juger la véracité d'une affirmation
Enfin, donnez-lui une affirmation :
« L'utilisateur a explicitement demandé un remboursement dans le commentaire. »
Ce type retourne une probabilité entre 0 et 1, représentant la vraisemblance que l'affirmation soit vraie.
Résultat : 0,03 (3 %).
L'utilisateur est mécontent, mais n'a pas explicitement demandé un remboursement. Ainsi, le modèle donne une faible probabilité à la « demande explicite de remboursement ».

En regardant tous les résultats retournés ensemble, le tableau se clarifie :

Ces quatre questions ont été soumises ensemble, produisant tous les résultats d'un coup. L'API a signalé un temps d'évaluation du modèle d'environ 85 millisecondes.
Maintenant, le programme dispose d'informations utilisables : catégorie de sentiment, cible de routage, niveau de priorité, intention de remboursement. Le traitement peut continuer basé sur ces résultats.
À quoi peut servir Jev ?
Nous avons traité un commentaire. Sur une plateforme e-commerce avec un volume quotidien massif, cette utilisation s'étend davantage.
Premièrement, les statistiques.
Quels utilisateurs sont satisfaits ? Qui se plaint de la logistique ? Quels problèmes nécessitent le service client ? Le modèle juge le sens ; le programme agrège les comptes et affiche les catégories.
Deuxièmement, le filtrage initial pour décider ce qui nécessite un traitement plus approfondi.
Les avis généraux vont aux stats. Les éléments ne nécessitant pas de réponse sautent les réponses individuelles. Les problèmes non résolus vont aux humains. Les réponses automatiques adaptées à la génération par LLM sont passées aux modèles plus grands avec contexte.
Auparavant, avoir un LLM général coûteux filtrer tout d'abord entraînait des coûts initiaux élevés. Maintenant, Jev gère le filtrage frontal, laissant le traitement profond aux LLM.
Le filtrage par mots-clés peut-il fonctionner ?
Partiellement, mais les mots-clés manquent de contexte.
Exemple :
« La qualité est vraiment super, elle s'est désintégrée après un jour. »
Correspondre à « super qualité » classifie mal ceci comme positif. Lire la phrase entière révèle le sarcasme.
Jev prend toujours le langage naturel en entrée et comprend le sens complet. Sa spécialisation réside dans le type de tâche et le format de sortie, pas seulement la correspondance de mots-clés.
Transformer les résultats en actions nécessite des programmes externes.
Retourner « transférer à un humain », le programme met en file d'attente pour revue manuelle. Retourner « réponse automatique », le programme appelle un LLM pour générer la réponse. Les actions sont exécutées par des règles de workflow et des outils.
Dans les Agents, ce système externe organisant les appels de modèles, les outils et les workflows est souvent appelé le Harness. Jev s'intègre dans les positions de jugement au sein du Harness, aidant à choisir les prochaines étapes.
Par conséquent, je crois que Jev et les LLM sont complémentaires, pas mutuellement exclusifs.
Spécifiquement, remplacez les LLM par Jev pour la classification et la notation. Plus tard, pour écrire des textes, du code ou effectuer un raisonnement complexe multi-étapes, comptez sur les LLM.
Ainsi, un système peut utiliser différents modèles pour différentes étapes, combinant organiquement les capacités.

Comment expérimenter avec Jev ?
La façon la plus directe est d'ouvrir TypeSafe Playground.
Connectez-vous, placez le texte à analyser dans State (matériel pour le jugement). Définissez les questions dans Questions, sélectionnez le type de jugement, remplissez les options ou les critères de notation, cliquez sur Run pour voir les résultats.
Essayez le commentaire précédent ou échangez-le contre un avis positif pour observer les changements.
Pour l'intégrer dans votre logiciel, utilisez l'API.
L'API permet à un logiciel d'exposer des capacités pour un autre. Obtenez une Clé API depuis la console. Votre programme envoie les matériels et les questions avec cet identifiant, reçoit les résultats et exécute la logique subséquente.
Des SDK officiels sont également fournis, enveloppant les fonctions d'interface courantes pour la commodité des développeurs.
Tarification : 0,042 $ par million de tokens d'entrée, sortie gratuite. L'entrée inclut les matériels, les questions et les critères. Le filtrage de commentaires à haut volume peut utiliser ce modèle pay-per-call dans les flux existants.
Le futur des modèles de jugement spécialisés
Après avoir recherché Jev, j'ai été impressionné : quelqu'un aurait dû faire cela depuis longtemps, mais personne ne l'a fait.
Je pense que cette approche est correcte. Alors que tout le monde se précipite pour améliorer les performances des grands modèles, TypeSafe AI a ouvert une nouvelle piste, créant des modèles personnalisés pour les données structurées, le jugement probabiliste, la sélection et les scénarios de décision.
Les avantages en coût et vitesse sont bénéfiques pour les Agents. Attendre que les grands modèles renvoient lentement des données est inefficace dans certains contextes.
Je crois que d'autres fournisseurs suivront probablement cette tendance, construisant des modèles spécialisés pour les étapes de jugement des Agents.
Un Agent peut avoir des modèles pour le jugement rapide, d'autres pour la réflexion/écriture/code complexes, plus des modèles image/audio/vidéo, travaillant ensemble.
Quand le jugement est assez rapide et bon marché, nous pouvons placer l'IA dans plus d'endroits précédemment jugés non rentables pour un appel. Pour moi, c'est la partie la plus excitante de la direction de Jev.





