A menos que hayas vivido bajo una roca durante la última semana, seguro que has visto a Jev de @typesafeai.
https://x.com/CompleteSkeptic/status/2099925682726002904
Describen sus modelos como:
una clase de modelos de IA diseñados para tomar decisiones rápidas y estructuradas que el software puede usar directamente. Un modelo System One evalúa un
estado y devuelve respuestas tipadas y probabilidades.
Según los benchmarks de TypeSafe, Jev es 20-200 veces más rápido y 40-400 veces más barato que los LLMs.
Pero ¿por qué importa esto? Ya hemos entrenado clasificadores antes (el autocorrector de tu teléfono, el filtrado de Gmail, etc.), pero según Twitter, Jev es algo especial.
En este artículo, mi objetivo es enseñarte qué es Jev, por qué existe y cómo puedes integrarlo en tus sistemas de producción.
¿Qué es exactamente Jev?
Jev expone 3 primitivas: Choice, Score y Noul.
- Choice es un tipo de pregunta que selecciona una opción de un conjunto definido (de máximo 255), cuya respuesta incluye la opción seleccionada, una probabilidad para cada opción y la confianza.
- Score califica contenido contra niveles descriptivos ordenados, cuya respuesta incluye una puntuación, una probabilidad para cada nivel y la confianza.
- Noul pide al modelo que evalúe una pregunta de sí/no y devuelva la probabilidad de que la respuesta sea afirmativa.
Aquí tienes un ejemplo de entrada y salida para un caso de uso de soporte al cliente:
1// Entrada2{3 "model": "jev-latest",4 "state": "Hola, me han cobrado dos veces mi suscripción mensual. ¿Podrían reembolsar el cargo extra? Mi cuenta funciona bien.",5 "questions": {6 "department": {7 "type": "choice",8 "instructions": "¿Qué equipo debería manejar este mensaje?",9 "criteria": {10 "billing": "Cargos, pagos, suscripciones y reembolsos",11 "technical": "Bugs, errores y funciones rotas",12 "account": "Inicio de sesión, contraseñas y acceso a la cuenta"13 }14 },15 "requests_refund": {16 "type": "noul",17 "instructions": "¿El cliente solicita explícitamente un reembolso?"18 },19 "frustration": {20 "type": "score",21 "instructions": "¿Qué tan frustrado suena el cliente?",22 "criteria": [23 "Calmo: describe el problema educadamente sin expresar frustración",24 "Frustrado: expresa molestia o insatisfacción",25 "Muy frustrado: expresa fuerte enojo o amenaza con irse"26 ]27 }28 }29}30// Salida31{32 "model": "jev-1.13.0",33 "answers": {34 "department": {35 "type": "choice",36 "choice": "billing",37 "confidence": 1,38 "probabilities": {39 "technical": 0,40 "account": 0,41 "billing": 142 }43 },44 "requests_refund": {45 "type": "noul",46 "noul": 0.9947 },48 "frustration": {49 "type": "score",50 "score": 0,51 "legend": {52 "0": "Calmo: describe el problema educadamente sin expresar frustración",53 "1": "Frustrado: expresa molestia o insatisfacción",54 "2": "Muy frustrado: expresa fuerte enojo o amenaza con irse"55 },56 "confidence": 1,57 "probabilities": {58 "0": 1,59 "1": 0,60 "2": 061 }62 }63 },64 "usage": {65 "input_tokens": 442,66 "output_tokens": 7267 },68 "request_id": "playground_12bbfa4198be5ca4de9818a45c0906a2055",69 "evaluation_time_ms": 163.0112069979077270}
Te recomiendo revisar su onboarding del dashboard para entender mejor cómo funcionan juntos el estado y las preguntas para generar salidas.
¿No es esto solo un clasificador?
Bueno, sí y no. Es más bien como si un LLM y un clasificador tuvieran un bebé.
Los clasificadores tradicionales son buenos para tareas de alto volumen con taxonomías fijas. Piensa en LeNet-5 siendo capaz de identificar qué dígito representa una imagen. Sin embargo, los clasificadores suelen ser ultra especializados y específicos de dominio. Los LLMs son buenos generando secuencias. Son flexibles y geniales para tareas abiertas definidas en tiempo de ejecución, pero también son más lentos (que un clasificador), más caros y menos predecibles.
Jev es un "modelo fundacional para clasificación", combinando la flexibilidad de lenguaje natural de un LLM con la salida restringida y probabilística de un clasificador. Puedes completar una gran variedad de tareas sin tener que entrenar un nuevo modelo, manteniendo al mismo vez experiencia en una variedad de dominios diferentes (código, texto, logs, estados de UI, eventos, etc.). Jev también puede generar salida en paralelo, lo que lo hace mucho más rápido que un LLM limitado a generación secuencial.
TL;DR es un clasificador generalizable realmente inteligente.
¿Por qué existe Jev?
El CEO y cofundador de TypeSafe, Diogo Almeida, pasó tiempo en OpenAI ayudando a crear RLHF (aprendizaje por refuerzo desde retroalimentación humana) y el producto ChatGPT. RLHF nos permitió entrenar LLMs para que fueran muy buenos siguiendo instrucciones y prompts, lo cual coincide con su naturaleza autoregresiva.
Luego dejó OpenAI para fundar TypeSafe y entrenar una clase diferente de modelos para habilitar software impulsado por IA, en lugar de agentes. Jev se entrena con RLCD (aprendizaje por refuerzo desde decisiones calibradas), que es jerga de investigación para decir que entrenan al modelo para que sea muy bueno emitiendo confianza y probabilidades en lugar de respuestas.
TypeSafe cree que el software debe ser inteligente. Los agentes no se difunden naturalmente en cómo funcionaba históricamente el software, y el humano-en-el-bucle dificulta que el software sea inteligente Y autónomo. Jev es un paso hacia la inteligencia como una primitiva componible y confiable dentro de los sistemas de software.
Esta no es una idea completamente nueva; investigadores en 2017 encontraron que la alta precisión predictiva no significa estimaciones de confianza confiables (así que los LLMs no son una solución perfecta aquí).
¿Por qué RLCD sobre RLHF?
El problema con RLHF es que lo que los humanos quieren no siempre es objetivamente correcto. El hecho de que prefiramos cierta respuesta en cierto formato no hace a los modelos más inteligentes, sino más agradables de usar.
También introduce colapso de modo; RLHF hace que los LLMs converjan a una única respuesta donde a veces múltiples trayectorias podrían ser "correctas".

Colapso de modo vía Docs de Jev
Jev NO fue diseñado para construir agentes
Contrario a lo que ves por todas partes en tu timeline, Jev no es muy bueno como agente independiente. Hemos intentado construir versiones de ello, tanto solo Jev como LLM + Jev.
https://x.com/kylejeong/status/2100622054945095934
Honestamente, los agentes Jev hacen demos geniales. Ha habido un montón usándolo para hacer tareas de agente a velocidad relámpago. Pero incluso las mejores demos no están listas para desplegarse en producción.
Un modelo como Jev está destinado a software impulsado por IA; puede ayudarte a tomar decisiones compuestas en código determinista. Sin capacidades de razonamiento o generativas, usarlo como agente independiente es pura ignorancia.

Software Impulsado por IA
En lugar de dejar que Jev sea un agente de uso de computadora independiente, debería usarse en enrutamiento de soporte al cliente, procesamiento de facturas, alertas de seguridad y triaje, o como monitor de agentes.
Los números
Su primer modelo, Jev 1.13.0, cuesta $42/btok (o $0.042/mtok) de entrada y $0 por tokens de salida. Para referencia, Fable 5.1 es $10/mtok de entrada, lo que equivale a $10,000 / Btok. Las cargas de trabajo empresariales típicas son 3:1 o 4:1 para tokens de entrada-salida, así que Fable sube a ~ $20,000/Btok (con $50/mtok de salida).
La ventana de contexto es de 64k tokens por solicitud, donde el estado + la pregunta más larga deben caber en 32k tokens.
Sin embargo, en sus benchmarks internos superan a todos los modelos en precisión/costo y precisión/velocidad de OpenAI, Anthropic y Deepseek (vía Fireworks para inferencia).

precisión/costo
Basta de charla, ¿cómo lo uso?
Ahora deberías tener suficiente comprensión de Jev como para haber pensado en algunos casos de uso para lo que estés trabajando actualmente. (Si no, aquí hay una lista de casos de uso recomendados por TypeSafe).
En lugar de limitar tu creatividad sobre cómo deberías usarlo, te mostraré cómo hemos adaptado Jev a nuestro framework Stagehand.
Durante los últimos 2 años, Stagehand ha evolucionado como un framework para IA y Agentes para controlar un navegador remoto. Antes de que los agentes fueran suficientemente buenos, creamos primitivas de IA Act (completar una acción), Extract (extraer datos estructurados) y Observe (descubrir acciones potenciales en una página) para ayudar a los desarrolladores a escribir scripts auto-reparables para automatizar la web.
En lugar de usar Playwright (u otros frameworks heredados) y tener que analizar el DOM manualmente para proporcionar selectores en acciones, Stagehand A/E/O te permite usar lenguaje natural para construir automatizaciones.
1// Playwright2await page.click('button[type="submit"]');34// Stagehand5stagehand.act("click the submit button")
Esto es útil al escribir scripts por primera vez (la velocidad de desarrollo es mucho más rápida), pero especialmente útil para el mantenimiento de scripts. Si un sitio web cambia y los selectores del DOM se actualizan, entonces los scripts de Playwright deben reescribirse para coincidir con la nueva página. Stagehand elige selectores y acciones en tiempo de ejecución, y son "auto-reparables".
Puedes ver hacia dónde vamos con esto. Jev encaja extremadamente bien en estas primitivas. Originalmente usábamos un LLM (dado el contexto sobre cómo se veía la página y el objetivo) para decidir qué hacer. Con Jev podemos usar Choice para decidir con qué selectores interactuar.
Usemos Act específicamente para hablar sobre el flujo. Normalmente, daríamos al LLM una representación concisa de la página usando un árbol de accesibilidad híbrido. Con Jev, primero marcamos nodos en el árbol de accesibilidad como interactivos (incluso editores de texto enriquecido) o no.
Cuando stagehand.act es llamado:
- Jev clasifica la instrucción en una acción (como click, fill o scroll)
- Stagehand analiza argumentos y construye una lista de candidatos para esa acción (que incluye contexto cercano de la página)
- Jev responde "cuál candidato es el mejor" y "si algún candidato coincide" con un umbral de aceptación de 0.7
- Si la acción candidata es aceptada, Stagehand maneja la ejecución
- Si la acción no lo es, Stagehand recurre a un LLM

Flujo de Act
En pruebas tempranas, la latencia mediana de Act cae de 1.97 segundos a 0.46 segundos, lo que es aproximadamente 4.3× más rápido (o 77% menos tiempo). Ver el stack completo del PR.
Con el uso de computadora, Jev es una pieza del pastel pero no una solución independiente. Ahora somos capaces de construir herramientas de software más deterministas que los agentes pueden usar.

Cuándo usar Jev
Difundiendo IA en el mundo real
¿Construirá Jev agentes de uso de computadora de grado de producción? No. ¿Es una pieza útil del rompecabezas? Creo que sí lo será.
Se siente como que hay una abundancia de ideas que no tenían sentido antes de Jev. He visto gente construir búsqueda instantánea, copiar y pegar inteligente y otras herramientas simples pero extremadamente útiles.
La IA no debería confinarse a alguna versión de una interfaz de chat, sincrona o asincrónica. Con modelos como Jev, podemos construir software que incorpora modelos de predicción sin una caja de entrada de chat. Aunque los clasificadores han estado disponibles durante mucho tiempo, nunca se han sentido tan útiles. Tal vez todo lo que necesitábamos para construir era inspiración.
-> Kyle





