Hola, amigos. Soy Jin Chenma.
Permítanme comenzar con una pregunta: en cuanto al contenido que procesan, ¿cuáles son los tipos comunes de modelos grandes de IA con los que solemos encontrarnos?
La mayoría de las personas están familiarizadas con el texto, las imágenes, el audio y el video. En los últimos años, diversos proveedores han competido e iterado continuamente en estas direcciones, haciendo que las capacidades sean más potentes y la competencia más feroz.
Tras ver tantas actualizaciones, me seguí preguntando: además de hacer más fuertes a los modelos existentes, ¿surgirán nuevas formas de modelos?
Recientemente, un modelo llamado Jev comenzó a volverse viral. Al principio pensé: ¿será solo otra empresa lanzando un nuevo gran modelo de lenguaje?
Pero después de investigar más a fondo, descubrí que este modelo es realmente impresionante.
Detrás de él, TypeSafe AI propuso una clase de modelos llamados System One Models, diseñados específicamente para tareas de juicio en software. Jev es su primer modelo público.
Las categorías anteriores (texto, imagen, audio, video) se dividían por tipo de contenido; esta vez, cambiaron el ángulo: tomaron "tomar decisiones" como una tarea independiente y diseñaron un modelo alrededor de ella.
Creo que esta dirección podría tener un impacto profundo en el futuro desarrollo y la división del trabajo en los modelos de IA.
En este artículo, explicaré claramente qué es Jev, cómo difiere de los LLM estándar, dónde puede usarse y cómo empezar.
Empecemos con la analogía del código QR
¿Cómo entender Jev? Imagina que quieres generar un código QR.
Normalmente, usarías una herramienta generadora de códigos QR. Pero supongamos que contratas a un artista capaz de dibujar cualquier cosa y le pides que dibuje el código QR píxel por píxel.
Por supuesto, este artista es hábil y puede hacerlo. Pero para generar un código QR existen herramientas dedicadas. Solo necesitas un código QR funcional, no un paisaje pintado junto con él.

De manera similar, comparando Jev con los Grandes Modelos de Lenguaje (LLM):
Los LLM pueden escribir artículos, código y discutir problemas complejos. Si le pides a un LLM que lea un comentario y juzgue el sentimiento del usuario, ciertamente puede hacerlo.
Pero si la tarea solo requiere una elección o una puntuación, considera: ¿podemos crear un modelo más rápido, más barato y accesible programáticamente específicamente para tales tareas?
Esto es exactamente lo que hace Jev.
Renuncia a la generación libre de texto para especializarse en juicios con ámbitos de respuesta claros. Por ejemplo, si proporcionas cuatro opciones—"Satisfecho", "Insatisfecho", "Mixto", "Indeterminado"—selecciona una y proporciona probabilidades para cada opción.
Así como los códigos QR tienen herramientas dedicadas, las tareas que solo requieren elecciones y puntuaciones pueden ser manejadas por modelos especializados. Según las introducciones oficiales, la optimización de Jev para estas tareas de juicio reduce el tiempo de respuesta y los costos de llamada.
Por ejemplo, filtrar masivamente comentarios de comercio electrónico diariamente requiere juzgar el sentimiento, la urgencia y los métodos de manejo. Juicios más rápidos y baratos reducen los tiempos de espera generales y los costos. Los programas reciben resultados y proceden con la clasificación o la derivación a un humano.
El origen de Jev
¿Quién creó Jev? ¿Por qué construir un modelo únicamente para el juicio?
Jev proviene de TypeSafe AI, fundada por Diogo Almeida, quien previamente trabajó en investigación de modelos de chat en OpenAI.
Se centró en un problema: la IA es genial para chatear, pero ¿por qué no es fácil integrar estas capacidades en software para tareas automatizadas?
El software es excelente ejecutando reglas explícitas. Si se cumple la condición A, haz la acción B. Pero muchos juicios del mundo real son difíciles de predefinir con reglas.
Como leer comentarios. ¿Qué expresiones son quejas? ¿Cuáles son bromas? ¿Cuáles parecen positivas pero contienen críticas ocultas? Es difícil cubrir todos los patrones de habla de los usuarios con unas pocas reglas.
TypeSafe quiere convertir el juicio semántico en un componente invocable. Cuando un programa necesita entender texto o elegir el siguiente paso, delega esta pequeña tarea al modelo, obtiene el resultado y continúa la ejecución.
Llamam a estos modelos System One, tomando prestado el concepto de Pensar rápido, pensar despacio. Piensa en ello como la parte de juicio rápida e intuitiva.
El nombre Jev proviene del economista Jevons. La expectativa del equipo es directa: cuanto menor sea el costo de las llamadas inteligentes, más lugares utilizarán las personas.
Algunos pasos anteriormente parecían demasiado caros para una sola llamada de IA. Si el juicio es suficientemente rápido y barato, vale la pena reconsiderarlo.
¿Cómo difiere Jev de los LLM?
Hacer que las llamadas de software para el juicio de IA sean más baratas y fáciles es un buen punto de partida. Pero los LLM existentes también pueden juzgar y devolver resultados estructurados. ¿Por qué construir Jev?
Primero, veamos cómo los LLM entregan resultados de juicio a los programas.
Los LLM admiten salida estructurada, lo que significa que las respuestas encajan en espacios predefinidos. Por ejemplo, un espacio para el sentimiento, otro para la urgencia, otro para el método de manejo. El programa sabe qué representa cada posición.
Quizás conozcas JSON, un formato común para datos estructurados. Los desarrolladores pueden restringir las salidas de los LLM para que sigan formatos específicos.
Entonces, mirando solo si la salida final es texto o JSON, no se revela la principal diferencia entre Jev y los LLM.
La diferencia radica en cómo el modelo genera el resultado.
Los LLM generativos estándar típicamente producen respuestas token por token. Los tokens son pequeños fragmentos de texto procesados por el modelo. Incluso si solicitas datos de formato fijo, generalmente genera el resultado paso a paso.
Jev utiliza un método de salida especializado para tareas de juicio, proporcionando múltiples juicios y probabilidades en paralelo. Puedes hacer varias preguntas sobre el mismo comentario y obtener todos los resultados en una sola solicitud.
Esta diferencia de salida está relacionada con la velocidad y el costo mencionados anteriormente. El software que procesa grandes volúmenes de datos diariamente incurre en costos significativos incluso para pequeños pasos. Los agentes, que llaman a herramientas y ejecutan tareas continuas, necesitan decidir repetidamente el siguiente paso. La velocidad de respuesta y el costo de llamada afectan directamente el diseño del software, los gastos operativos y la experiencia del usuario. Algunos pasos que antes se omitían debido a la lentitud o al alto costo ahora pueden incluir juicio de IA.
También existe la estabilidad de la salida. Definimos un conjunto de opciones, y devuelve resultados dentro de ese ámbito, facilitando el procesamiento del programa posterior.
Tres nuevas características de Jev
El núcleo de Jev reside en tres nuevas características. Su lógica de diseño es interesante y vale la pena examinarla.
Brevemente, Choice realiza selecciones de opciones dadas; Score asigna calificaciones basadas en criterios; Noul juzga la probabilidad de que una afirmación sea verdadera.
Aquí, usaré el Playground oficial para demostrar estas características con un ejemplo práctico.
Usemos el procesamiento de comentarios de comercio electrónico. Supón que diriges una tienda en línea que recibe reseñas diarias de clientes. Necesitas medir la satisfacción, identificar problemas que requieren seguimiento, determinar métodos de manejo y priorizar casos urgentes.
Enviaremos este comentario a Jev:
"El producto es bueno, pero el envío tardó diez días y el servicio de atención al cliente no respondió."
Usaremos las tres características para juzgar este comentario y ver los resultados.
Choice: Realizando selecciones
Primero, pregunta: ¿Cuál es el sentimiento general?
Opciones proporcionadas: Satisfecho, Insatisfecho, Mixto, Indeterminado.
Resultado: "Mixto".
Esto es fácil de entender. El usuario elogia el producto pero se queja de la logística y el servicio. Elegir solo "Satisfecho" o "Insatisfecho" pierde parte del significado.
De manera similar, podemos preguntar: ¿Cómo debe manejarse este comentario a continuación?
Opciones: "Derivar a humano", "Respuesta automática", "No se necesita respuesta". Regla añadida: Las quejas de servicio no resueltas requieren seguimiento humano.
Resultado: "Derivar a humano".
Nota, el contenido de la pregunta de opción múltiple puede variar. Sentimiento, departamento, próxima acción—todo puede formularse de esta manera. Las opciones son proporcionadas por nosotros; Jev juzga basado en el material y los requisitos.

Score: Asignando calificaciones
A continuación, pregunta: ¿Qué tan urgente es este comentario? ¿Con qué rapidez debemos hacer seguimiento?
Antes de puntuar, define estándares. Se establecen tres niveles aquí:
- 0: Reseña general o consulta simple, sin quejas no resueltas.
- 1: Queja de logística o servicio no resuelta, pero sin problemas de seguridad, pérdidas mayores o plazos ajustados.
- 2: Problemas de seguridad explícitos, pérdidas mayores o plazos ajustados.
Jev devuelve 1, indicando urgencia media según este estándar.
Las puntuaciones dependen en gran medida de los estándares que proporciones. Puedes cambiar a evaluar la calidad de la respuesta o la relevancia, pero debes definir qué constituye bueno o malo.
También puede devolver puntuaciones fraccionarias entre niveles, no solo enteros.

Noul: Juzgando la verdad de las afirmaciones
Finalmente, dale una afirmación:
"El usuario solicitó explícitamente un reembolso en el comentario."
Este tipo devuelve una probabilidad entre 0 y 1, representando la probabilidad de que la afirmación sea verdadera.
Resultado: 0.03 (3%).
El usuario está molesto, pero no pidió explícitamente un reembolso. Entonces, el modelo da una baja probabilidad a "solicitud explícita de reembolso".

Mirar todos los resultados devueltos juntos clarifica el panorama:

Estas cuatro preguntas fueron enviadas juntas, produciendo todos los resultados a la vez. La API reportó un tiempo de evaluación del modelo de aproximadamente 85 milisegundos.
Ahora, el programa tiene información utilizable: categoría de sentimiento, destino de enrutamiento, nivel de prioridad, intención de reembolso. El procesamiento puede continuar basado en estos resultados.
¿Para qué puede usarse Jev?
Procesamos un comentario. En una plataforma de comercio electrónico con volumen diario masivo, este uso se expande aún más.
Primero, estadísticas.
¿Qué usuarios están satisfechos? ¿Quién se queja de la logística? ¿Qué problemas necesitan servicio de atención al cliente? El modelo juzga el significado; el programa agrega conteos y muestra categorías.
Segundo, filtrado inicial para decidir qué necesita procesamiento más profundo.
Las reseñas generales van a estadísticas. Los ítems que no requieren respuesta saltan las respuestas individuales. Los problemas no resueltos van a humanos. Las respuestas automáticas adecuadas para generación por LLM se pasan a modelos más grandes con contexto.
Anteriormente, tener un LLM general costoso que filtrara todo primero incurrió en altos costos iniciales. Ahora, Jev maneja el filtrado frontal, dejando el procesamiento profundo para los LLM.
¿Puede funcionar el filtrado por palabras clave?
Parcialmente, pero las palabras clave pierden el contexto.
Ejemplo:
"La calidad es realmente genial, se deshizo después de un día."
Coincidir con "calidad genial" clasifica erróneamente esto como positivo. Leer la oración completa revela sarcasmo.
Jev todavía toma entrada de lenguaje natural y entiende el significado completo. Su especialización está en el tipo de tarea y el formato de salida, no solo en la coincidencia de palabras clave.
Convertir resultados en acciones requiere programas externos.
Devuelve "derivar a humano", el programa pone en cola para revisión manual. Devuelve "respuesta automática", el programa llama a un LLM para generar la respuesta. Las acciones son ejecutadas por reglas de flujo de trabajo y herramientas.
En Agentes, este sistema externo que organiza llamadas de modelos, herramientas y flujos de trabajo a menudo se llama Harness. Jev encaja en las posiciones de juicio dentro del Harness, ayudando a elegir los siguientes pasos.
Por lo tanto, creo que Jev y los LLM son complementarios, no mutuamente excluyentes.
Específicamente, reemplaza los LLM con Jev para clasificación y puntuación. Más tarde, para escribir copias, código o razonamiento complejo de múltiples pasos, confía en los LLM.
Así, un sistema puede usar diferentes modelos para diferentes etapas, combinando capacidades orgánicamente.

¿Cómo experimentar con Jev?
La forma más directa es abrir TypeSafe Playground.
Inicia sesión, pon el texto a analizar en State (material para juicio). Configura preguntas en Questions, selecciona el tipo de juicio, llena opciones o criterios de puntuación, haz clic en Run para ver resultados.
Prueba el comentario anterior o intercambia por una reseña positiva para observar cambios.
Para integrarlo en tu software, usa la API.
La API permite que un software exponga capacidades para otro. Obtén una API Key desde la consola. Tu programa envía materiales y preguntas con esta credencial, recibe resultados y ejecuta la lógica subsiguiente.
También se proporcionan SDKs oficiales, envolviendo funciones de interfaz comunes para conveniencia del desarrollador.
Precios: $0.042 por millón de tokens de entrada, salida gratis. La entrada incluye materiales, preguntas y criterios. El filtrado de comentarios de alto volumen puede usar este modelo de pago por llamada en flujos existentes.
El futuro de los modelos de juicio especializados
Después de investigar Jev, me impresionó: alguien debería haber hecho esto hace mucho tiempo, pero nadie lo hizo.
Creo que este enfoque es correcto. Mientras todos compiten para mejorar el rendimiento de los modelos grandes, TypeSafe AI abrió una nueva pista, creando modelos personalizados para datos estructurados, juicio probabilístico, selección y escenarios de decisión.
Los beneficios de costo y velocidad son ventajosos para los Agentes. Esperar a que los modelos grandes devuelvan datos lentamente es ineficiente en algunos contextos.
Creo que otros proveedores probablemente seguirán esta tendencia, construyendo modelos especializados para etapas de juicio de Agentes.
Un Agente puede tener modelos para juicio rápido, otros para pensamiento complejo/escritura/código, además de modelos de imagen/audio/video, trabajando juntos.
Cuando el juicio es suficientemente rápido y barato, podemos colocar IA en más lugares previamente considerados no valiosos para la llamada. Para mí, esta es la parte más emocionante de la dirección de Jev.





