YouMind
Iniciar sesión

Modelo Jev explicado: Una nueva IA para decisiones rápidas y económicas

@jinchenma_ai
CHINO20 sept 2026
123K
237
32
17
355

TL;DR

Jev es un nuevo modelo de IA de TypeSafe AI diseñado específicamente para tareas de juicio como clasificación y puntuación, ofreciendo alternativas más rápidas y baratas a los LLM para flujos de trabajo con agentes.

Hola, amigos. Soy Jin Chenma.

Permíteme empezar con una pregunta: en cuanto al contenido que procesan, ¿cuáles son los tipos comunes de grandes modelos de IA con los que solemos encontrarnos?

La mayoría de las personas están familiarizadas con el texto, las imágenes, el audio y el video. En los últimos años, diversos proveedores han competido e iterado continuamente en estas direcciones, haciendo que las capacidades sean más potentes y la competencia más feroz.

Tras ver tantas actualizaciones, me seguí preguntando: además de hacer más fuertes a los modelos existentes, ¿surgirán nuevas formas de modelo?

Recientemente, un modelo llamado Jev se volvió viral. Al principio pensé: "¿Será solo otra empresa lanzando un nuevo gran modelo de lenguaje?".

Pero después de investigar más a fondo, descubrí que este modelo es realmente impresionante.

Detrás de él, TypeSafe AI propuso una clase de modelos llamados System One Models, diseñados específicamente para tareas de juicio en software. Jev es su primer modelo público.

Las categorías anteriores (texto, imagen, audio, video) se dividían por tipo de contenido; esta vez, cambiaron el enfoque: tomaron "tomar decisiones" como una tarea independiente y diseñaron un modelo alrededor de ella.

Creo que esta dirección podría tener un impacto profundo en el futuro desarrollo y la división del trabajo en los modelos de IA.

En este artículo, explicaré claramente qué es Jev, cómo difiere de los LLM estándar, dónde puede usarse y cómo empezar.

Empecemos con la analogía del código QR

¿Cómo entender Jev? Imagina que quieres generar un código QR.

Normalmente, usarías una herramienta generadora de códigos QR. Pero supongamos que contratas a un artista capaz de dibujar cualquier cosa y le pides que dibuje el código QR píxel por píxel.

Por supuesto, este artista es hábil y puede hacerlo. Pero para generar un código QR existen herramientas dedicadas. Solo necesitas un código QR funcional, no un paisaje pintado junto a él.

金尘马 - inline image

De manera similar, comparando Jev con los Grandes Modelos de Lenguaje (LLM):

Los LLM pueden escribir artículos, código y discutir problemas complejos. Si le pides a un LLM que lea un comentario y juzgue el sentimiento del usuario, ciertamente puede hacerlo.

Pero si la tarea solo requiere una elección o una puntuación, considera: ¿podemos crear un modelo más rápido, más barato y accesible programáticamente específicamente para tales tareas?

Esto es exactamente lo que hace Jev.

Renuncia a la generación libre de texto para especializarse en juicios con ámbitos de respuesta claros. Por ejemplo, si proporcionas cuatro opciones—"Satisfecho", "Insatisfecho", "Mixto", "Indeterminado"—selecciona una y proporciona probabilidades para cada opción.

Así como los códigos QR tienen herramientas dedicadas, las tareas que solo requieren elecciones y puntuaciones pueden ser manejadas por modelos especializados. Según las introducciones oficiales, la optimización de Jev para estas tareas de juicio reduce el tiempo de respuesta y los costos de llamada.

Por ejemplo, filtrar masivamente comentarios de comercio electrónico diariamente requiere juzgar el sentimiento, la urgencia y los métodos de manejo. Juicios más rápidos y baratos reducen los tiempos de espera generales y los costos. Los programas reciben resultados y proceden con la clasificación o la transferencia a humanos.

El origen de Jev

¿Quién creó Jev? ¿Por qué construir un modelo únicamente para el juicio?

Jev proviene de TypeSafe AI, fundada por Diogo Almeida, quien previamente trabajó en investigación de modelos de chat en OpenAI.

Se centró en un problema: la IA es genial para chatear, pero ¿por qué no es fácil integrar estas capacidades en software para tareas automatizadas?

El software destaca en ejecutar reglas explícitas. Si se cumple la condición A, haz la acción B. Pero muchos juicios del mundo real son difíciles de predefinir con reglas.

Como leer comentarios. ¿Qué expresiones son quejas? ¿Cuáles son bromas? ¿Cuáles parecen positivas pero contienen críticas ocultas? Es difícil cubrir todos los patrones de habla de los usuarios con unas pocas reglas.

TypeSafe quiere convertir el juicio semántico en un componente invocable. Cuando un programa necesita entender texto o elegir el siguiente paso, delega esta pequeña tarea al modelo, obtiene el resultado y continúa la ejecución.

Llaman a estos modelos System One, tomando prestado el concepto de Pensar rápido, pensar despacio. Piénsalo como la parte de juicio rápida e intuitiva.

El nombre Jev proviene del economista Jevons. La expectativa del equipo es directa: cuanto menor sea el costo de las llamadas inteligentes, más lugares utilizarán las personas.

Algunos pasos antes parecían demasiado caros para una sola llamada de IA. Si el juicio es suficientemente rápido y barato, vale la pena reconsiderarlo.

¿Cómo difiere Jev de los LLM?

Hacer que las llamadas de software para el juicio de IA sean más baratas y fáciles es un buen punto de partida. Pero los LLM existentes también pueden juzgar y devolver resultados estructurados. ¿Por qué construir Jev?

Primero, veamos cómo los LLM entregan resultados de juicio a los programas.

Los LLM admiten salida estructurada, lo que significa que las respuestas caben en espacios predefinidos. Por ejemplo, un espacio para el sentimiento, otro para la urgencia, otro para el método de manejo. El programa sabe qué representa cada posición.

Quizás conozcas JSON, un formato común para datos estructurados. Los desarrolladores pueden restringir las salidas de los LLM para que sigan formatos específicos.

Entonces, mirando solo si la salida final es texto o JSON, no se revela la principal diferencia entre Jev y los LLM.

La diferencia radica en cómo el modelo genera el resultado.

Los LLM generativos estándar típicamente producen respuestas token por token. Los tokens son pequeños fragmentos de texto procesados por el modelo. Incluso si solicitas datos de formato fijo, generalmente genera el resultado paso a paso.

Jev utiliza un método de salida especializado para tareas de juicio, proporcionando múltiples juicios y probabilidades en paralelo. Puedes hacer varias preguntas sobre el mismo comentario y obtener todos los resultados en una sola solicitud.

Esta diferencia de salida está relacionada con la velocidad y el costo mencionados anteriormente. El software que procesa grandes volúmenes de datos diariamente incurre en costos significativos incluso para pequeños pasos. Los agentes, que llaman a herramientas y ejecutan tareas continuas, necesitan decidir repetidamente el siguiente paso. La velocidad de respuesta y el costo de llamada afectan directamente el diseño del software, los gastos operativos y la experiencia del usuario. Algunos pasos que antes se omitían debido a la lentitud o alto costo ahora pueden incluir juicio de IA.

También existe la estabilidad de la salida. Definimos un conjunto de opciones, y devuelve resultados dentro de ese ámbito, facilitando el procesamiento del programa posterior.

Tres nuevas características de Jev

El núcleo de Jev reside en tres nuevas características. Su lógica de diseño es interesante y vale la pena examinarla.

Brevemente, Choice realiza selecciones de opciones dadas; Score asigna calificaciones basadas en criterios; Noul juzga la probabilidad de que una afirmación sea verdadera.

Aquí, usaré el Playground oficial para demostrar estas características con un ejemplo práctico.

Usemos el procesamiento de comentarios de comercio electrónico. Supongamos que diriges una tienda en línea que recibe reseñas diarias de clientes. Necesitas medir la satisfacción, identificar problemas que requieren seguimiento, determinar métodos de manejo y priorizar casos urgentes.

Enviaremos este comentario a Jev:

"El producto es bueno, pero el envío tardó diez días y el servicio de atención al cliente no respondió."

Usaremos las tres características para juzgar este comentario y ver los resultados.

Choice: Realizando selecciones

Primero, pregunta: ¿Cuál es el sentimiento general?

Opciones proporcionadas: Satisfecho, Insatisfecho, Mixto, Indeterminado.

Resultado: "Mixto".

Esto es fácil de entender. El usuario elogia el producto pero se queja de la logística y el servicio. Elegir solo "Satisfecho" o "Insatisfecho" pierde parte del significado.

De manera similar, podemos preguntar: ¿Cómo debe manejarse este comentario a continuación?

Opciones: "Transferir a humano", "Respuesta automática", "No se necesita respuesta". Regla añadida: Las quejas de servicio sin resolver requieren seguimiento humano.

Resultado: "Transferir a humano".

Nota, el contenido de la pregunta de opción múltiple puede variar. Sentimiento, departamento, próxima acción—todo puede formularse de esta manera. Las opciones son proporcionadas por nosotros; Jev juzga basado en el material y los requisitos.

金尘马 - inline image

Score: Asignando calificaciones

A continuación, pregunta: ¿Qué tan urgente es este comentario? ¿Con qué rapidez debemos hacer seguimiento?

Antes de puntuar, define estándares. Aquí se establecen tres niveles:

  • 0: Reseña general o consulta simple, sin quejas sin resolver.
  • 1: Queja de logística o servicio sin resolver, pero sin problemas de seguridad, pérdidas mayores o plazos ajustados.
  • 2: Problemas de seguridad explícitos, pérdidas mayores o plazos ajustados.

Jev devuelve 1, indicando urgencia media según este estándar.

Las puntuaciones dependen en gran medida de los estándares que proporciones. Puedes cambiar a evaluar la calidad de la respuesta o la relevancia, pero debes definir qué constituye bueno o malo.

También puede devolver puntuaciones fraccionarias entre niveles, no solo enteros.

金尘马 - inline image

Noul: Juzgando la verdad de una afirmación

Finalmente, dale una afirmación:

"El usuario solicitó explícitamente un reembolso en el comentario."

Este tipo devuelve una probabilidad entre 0 y 1, representando la posibilidad de que la afirmación sea verdadera.

Resultado: 0.03 (3%).

El usuario está descontento, pero no pidió explícitamente un reembolso. Así, el modelo da una baja probabilidad a "solicitud explícita de reembolso".

金尘马 - inline image

Mirar todos los resultados devueltos juntos aclara el panorama:

金尘马 - inline image

Estas cuatro preguntas fueron enviadas juntas, produciendo todos los resultados a la vez. La API reportó un tiempo de evaluación del modelo de aproximadamente 85 milisegundos.

Ahora, el programa tiene información utilizable: categoría de sentimiento, objetivo de enrutamiento, nivel de prioridad, intención de reembolso. El procesamiento puede continuar basado en estos resultados.

¿Para qué puede usarse Jev?

Procesamos un comentario. En una plataforma de comercio electrónico con volumen diario masivo, este uso se expande aún más.

Primero, estadísticas.

¿Qué usuarios están satisfechos? ¿Quiénes se quejan de la logística? ¿Qué problemas necesitan atención al cliente? El modelo juzga el significado; el programa agrega conteos y muestra categorías.

Segundo, filtrado inicial para decidir qué necesita procesamiento más profundo.

Las reseñas generales van a estadísticas. Los ítems que no requieren respuesta saltan las respuestas individuales. Los problemas sin resolver van a humanos. Las respuestas automáticas adecuadas para generación de LLM se pasan a modelos más grandes con contexto.

Anteriormente, tener un costoso LLM general que filtrara todo primero incurrió en altos costos iniciales. Ahora, Jev maneja el filtrado frontal, dejando el procesamiento profundo para los LLM.

¿Puede funcionar el filtrado por palabras clave?

Parcialmente, pero las palabras clave pierden el contexto.

Ejemplo:

"La calidad es realmente genial, se deshizo después de un día."

Coincidir con "calidad genial" clasifica erróneamente esto como positivo. Leer la oración completa revela sarcasmo.

Jev sigue tomando entrada de lenguaje natural y entiende el significado completo. Su especialización está en el tipo de tarea y el formato de salida, no solo en coincidencia de palabras clave.

Convertir resultados en acciones requiere programas externos.

Devuelve "transferir a humano", el programa pone en cola para revisión manual. Devuelve "respuesta automática", el programa llama a un LLM para generar la respuesta. Las acciones son ejecutadas por reglas de flujo de trabajo y herramientas.

En Agentes, este sistema externo que organiza llamadas de modelos, herramientas y flujos de trabajo a menudo se llama Harness. Jev encaja en las posiciones de juicio dentro del Harness, ayudando a elegir los siguientes pasos.

Por lo tanto, creo que Jev y los LLM son complementarios, no mutuamente excluyentes.

Específicamente, reemplaza los LLM con Jev para clasificación y puntuación. Más tarde, para escribir copias, código o razonamiento complejo de múltiples pasos, confía en los LLM.

Así, un sistema puede usar diferentes modelos para diferentes etapas, combinando capacidades orgánicamente.

金尘马 - inline image

¿Cómo experimentar con Jev?

La forma más directa es abrir TypeSafe Playground.

Inicia sesión, pon el texto a analizar en State (material para el juicio). Configura preguntas en Questions, selecciona el tipo de juicio, llena opciones o criterios de puntuación, haz clic en Run para ver resultados.

Prueba el comentario anterior o intercambia por una reseña positiva para observar cambios.

Para integrarlo en tu software, usa la API.

La API permite que un software exponga capacidades para otro. Obtén una API Key de la consola. Tu programa envía materiales y preguntas con esta credencial, recibe resultados y ejecuta la lógica subsiguiente.

También se proporcionan SDK oficiales, envolviendo funciones de interfaz comunes para conveniencia del desarrollador.

Precios: $0.042 por millón de tokens de entrada, salida gratis. La entrada incluye materiales, preguntas y criterios. El filtrado de comentarios de alto volumen puede usar este modelo de pago por llamada en flujos existentes.

El futuro de los modelos de juicio especializados

Después de investigar Jev, me impresionó: alguien debería haber hecho esto hace mucho tiempo, pero nadie lo hizo.

Creo que este enfoque es correcto. Mientras todos compiten por mejorar el rendimiento de los grandes modelos, TypeSafe AI abrió una nueva pista, creando modelos personalizados para escenarios de datos estructurados, juicio probabilístico, selección y decisión.

Los beneficios de costo y velocidad son amigables para los Agentes. Esperar a que los grandes modelos devuelvan datos lentamente es ineficiente en algunos contextos.

Creo que otros proveedores probablemente seguirán esta tendencia, construyendo modelos especializados para etapas de juicio de Agentes.

Un Agente puede tener modelos para juicio rápido, otros para pensamiento/escritura/código complejo, además de modelos de imagen/audio/video, trabajando juntos.

Cuando el juicio es suficientemente rápido y barato, podemos colocar IA en más lugares antes considerados no valiosos para una llamada. Para mí, esta es la parte más emocionante de la dirección de Jev.

Guardar con un clic

Lee artículos virales en profundidad con IA en YouMind

Guarda la fuente, haz preguntas concretas, resume el argumento y convierte un artículo viral en notas reutilizables en un único espacio de trabajo con IA.

Explora YouMind
Para creadores

Convierte tu Markdown en un artículo de 𝕏 impecable

Cuando publicas tus propios textos largos, dar formato en 𝕏 a imágenes, tablas y bloques de código es un fastidio. YouMind convierte un borrador completo en Markdown en un artículo de 𝕏 impecable y listo para publicar.

Prueba Markdown a 𝕏

Más patrones por descifrar

Artículos virales recientes

Explorar más artículos virales