YouMind
Iniciar sesión

¿Está Jev sobrevalorado? Lo probamos en 4 tareas empresariales reales.

@tonygentilcore
INGLÉS28 sept 2026
171K
336
35
12
874

TL;DR

Este artículo evalúa Jev, un modelo de decisión tipado, frente a LLM y clasificadores ajustados finamente (fine-tuned) en cuatro tareas empresariales en Glean. Destaca las fortalezas de Jev en velocidad y consistencia para el enrutamiento y la evaluación de citas, mientras señala sus limitaciones en el reranking y la clasificación estática.

Autores: @eddiedzhou, @mr_cheu, @MatZhao, @CosmicPegasis19, @manav_ai

Jev es un modelo para tomar decisiones tipadas. Le envías contexto junto con un conjunto fijo de preguntas y opciones, y en lugar de generar texto, te devuelve elecciones, puntuaciones y probabilidades. ¡Es un modelo de “Sistema Uno”!

Pero la clasificación no es nada nuevo, y tampoco lo son las salidas estructuradas, los modelos pequeños o la lectura de probabilidades a partir de logits. Esa historia explica en parte la reacción dividida que generó Jev...

Tony Gentilcore - inline image

Los escépticos tienen razón en varios puntos, pero Jev tiene un lugar real en este ecosistema. Para entenderlo mejor, vale la pena mapear todo el espacio de soluciones.

¿Cuáles son las alternativas?

Cuando un sistema necesita una etiqueta, una puntuación o una respuesta de sí o no, hay cuatro opciones razonables:

Enfoque

Por qué usarlo

Concesión (tradeoff)

Un LLM de propósito general

Zero-shot, flexible, también puede generar argumentos o explicaciones. Podría decirse que ofrece una “mayor inteligencia” gracias al cómputo en tiempo de inferencia (razonamiento).

Pagas la latencia y el costo de un modelo autorregresivo por una decisión pequeña

Un clasificador abierto zero-shot

Económico, local y controlable

Calidad variable; tú te encargas de elegir el modelo y del serving

Un clasificador fine-tuned

Generalmente la mejor apuesta para una tarea estable, de alto volumen y con buenas etiquetas

Recolección de datos, entrenamiento, despliegue, drift y una taxonomía menos flexible

Jev

Flexibilidad zero-shot detrás de una API alojada y limpia

Calidad dependiente de la tarea, sin texto generado y dependencia del proveedor

El argumento a favor de Jev: un equipo puede cambiar la pregunta y las opciones sin tener que recolectar un nuevo dataset de entrenamiento, y a la vez se ahorra el trabajo de servir un modelo correctamente. Nadie debería menospreciar eso. Decir “podríamos construirlo nosotros mismos” aplica a casi cualquier producto de infraestructura.

Las reproducciones abiertas mantienen a raya las afirmaciones de novedad. Implementaciones con Qwen y SGLang, DiffusionGemma y vLLM, y Kev replican gran parte de la forma de la API o del modelo.

Tony Gentilcore - inline image

85.7% para Jev y 79.6% para Kev-8B con n=764

Las pruebas externas de Parallel también encontraron que Jev es competitivo en reranking, aunque los modelos especializados siguieron ganando en dos tareas de clasificación.

Lo que hemos visto en Glean

Eso nos deja una pregunta práctica: ¿cuándo la combinación de flexibilidad zero-shot e inferencia alojada de Jev realmente supera a las alternativas? En Glean probamos cuatro decisiones acotadas donde ya teníamos una línea base y podíamos comparar calidad empresarial real. La mayoría de estas líneas base son sistemas basados en LLMs, así que para esos experimentos sabíamos que podíamos esperar mejoras de dos órdenes de magnitud en costo y latencia. Los resultados variaron desde materialmente peores que producción hasta más rápidos y precisos que un router basado en LLM.

Clasificación de consultas

La clasificación de consultas asigna una solicitud a una tarea amplia que usan los sistemas posteriores. Es una carga de trabajo natural para Jev porque, si bien a nivel de cada solicitud el espacio de etiquetas se conoce de antemano, la taxonomía puede cambiar más rápido de lo que tarda en reentrenarse un clasificador fine-tuned.

Para este experimento, nos enfocamos en medir la concordancia de Jev frente a las predicciones de nuestra línea base en producción, que está basada en LLM. Esperábamos —y observamos— una gran aceleración en el throughput offline con Jev, por lo que reportamos la concordancia como un proxy sencillo de calidad. También comparamos contra Laya, un modelo de decisión de pesos abiertos, y contra una versión fine-tuned de Laya. Este fine-tuning pudo ejecutarse localmente en unas pocas horas, y el modelo es lo suficientemente pequeño como para servirse en la máquina de un desarrollador.

Experimento

Concordancia en Tarea Amplia

Rendimiento

Jev zero-shot

66.8%

~

12 min (concurrencia de 4

)

Laya base

35.9%

~

90 s (máquina de desarrollo local)

Laya fine-tuned

74.5%

~

90 s (máquina de desarrollo local)

Como modelo listo para usar, conveniente y que no requiere entrenamiento, Jev supera claramente a Laya, pero —como era de esperarse— el fine-tuning hace que Laya brille, sobre todo considerando sus números de rendimiento. La concesión aquí es el esfuerzo para conseguir buenas etiquetas y configurar el entrenamiento. Jev probablemente siga siendo más atractivo cuando una tarea es nueva o sus etiquetas cambian constantemente.

Enrutamiento de modelos: transferencia de expertos

El enrutamiento de modelos es un problema relacionado con la clasificación de consultas. Aquí planteamos el enrutamiento como una transferencia de expertos, donde nuestro sistema elige qué experto/modelo debe manejar la solicitud. Nuestra línea base en producción actualmente le pide a un LLM que tome esa decisión de forma nativa dentro del loop agéntico del harness. Si bien esta es una prueba natural para ver si Jev puede reemplazar una llamada generativa con una decisión acotada, una limitación técnica importante es que Jev estrictamente sumará una llamada en caso de que no haya transferencia. Esto contrasta con la línea base de producción, que en casos de no transferencia puede empezar el trabajo de tool-calling con esa misma primera y única llamada al LLM.

Tony Gentilcore - inline image

Usamos una versión simplificada de nuestro enrutamiento de producción con solo 3 expertos, reprocesamos 751 entradas golden comparables a través del nuevo router de Jev y comparamos la ruta elegida con nuestro router actual basado en prompts (impulsado por un LLM tradicional), midiendo la precisión contra la etiqueta golden.

Tony Gentilcore - inline image

También aislamos 40 entradas donde la ruta existente sí hizo una llamada real de transferencia de experto (una n más pequeña) y comparamos la latencia de llamada en esas mismas entradas.

Tony Gentilcore - inline image

La aceleración mediana por entrada fue de 8.1×. Este es uno de los mejores resultados internos de Jev hasta ahora: en esta tarea de enrutamiento acotada, Jev fue más preciso y sustancialmente más rápido. La magnitud de la diferencia sugiere que el impuesto de “bloqueo” que pagamos en las solicitudes no enrutadas a expertos podría ser una buena concesión. Cabe aclarar que sigue siendo una comparación offline contra un set golden, y la muestra de latencia contiene solo 40 transferencias positivas, ¡así que aún hay mucho por validar y probar!

Reranking

¡Un tema muy cercano a Glean! Abajo, nuestra línea base de producción es el orden que genera el stack de búsqueda actual de Glean. En este experimento le pedimos a Jev que reordenara hasta 50 resultados.

Probamos cuatro formas de expresar la relevancia mediante las salidas tipadas de Jev:

Formulación

Cómo expresa la relevancia

Noul pointwise

Hace una pregunta separada de sí/no sobre relevancia para cada resultado y luego ordena según la probabilidad de “sí”.

Noul de estado compartido

Le muestra a Jev todo el conjunto de candidatos como contexto compartido y luego hace la misma pregunta de sí/no para cada resultado.

Score (puntuación)

Le pide a Jev que asigne a cada candidato una puntuación numérica de relevancia.

Choice (elección)

Trata a todos los candidatos como alternativas en una sola decisión y luego los rankea según sus probabilidades resultantes.

Ejecutamos esto en un evalset interno donde el usuario no tiene acceso a todos los canonicals, por lo que los números absolutos no reflejan nuestro ranking de producción, pero los relativos sí son interesantes.

“Choice” de Jev fue la formulación más fuerte. En un control pareado de 4,855 búsquedas capturadas, eliminando el desempate basado en producción, el resultado fue:

Tony Gentilcore - inline image

Jev Choice costó aproximadamente $0.00044 por consulta y tomó 0.195 segundos en p50 durante la prueba offline. Pero le asignó puntuaciones idénticas a unos 37 de los 41 candidatos en una consulta promedio. Usar el orden de producción para resolver esos empates elevó el Recall@6 de 40.2% a 44.3%, haciendo que el resultado sin corregir pareciera más sólido de lo que justificaban las puntuaciones de Jev por sí solas. Como siempre, hay muchas salvedades, pero en términos generales, Jev es una línea base económica y eficiente, no un reemplazo para el ranker de producción de Glean.

Evaluación de soporte de citas

La evaluación de citas plantea dos preguntas relacionadas: ¿las afirmaciones que requieren evidencia tienen citas adecuadas (recall de citas) y las fuentes citadas realmente respaldan las afirmaciones que se les atribuyen (precisión de citas)? A primera vista, como el espacio de salida/etiquetas es acotado (similar a la mayoría de las configuraciones de jueces), parece un caso obvio para Jev. Sin embargo, la rúbrica es compleja y puede requerir descomponer varias afirmaciones; además, Jev no produce la justificación que solemos usar para analizar errores, por lo que existe cierto riesgo tanto para la calidad como para la usabilidad.

Probamos Jev con una respuesta real de evaluación de producción de 1,448 palabras, manteniendo fijas la respuesta y la evidencia de las citas. Comparamos su pasada conjunta de precisión y recall con GPT-5.6 Luna sin razonamiento y con razonamiento xhigh. Para reducir la varianza, ejecutamos cada juez tres veces.

Juez

Tiempo original medido por respuesta

Costo original medido por respuesta

Jev

6.6 s

$

0.014

GPT-5.6 Luna, sin razonamiento

81.3–85.5 s

$

0.030–

$

0.047

GPT-5.6 Luna,

xhigh

227.4–259.7 s

$

0.047–

$

0.060

Ten en cuenta que el tiempo es direccional y no end-to-end: Jev reporta el wall time secuencial del cliente, mientras que las filas de Luna suman las duraciones de las llamadas al modelo. Los costos incluyen el caché observado.

También comparamos la consistencia en los mismos 28 párrafos. Un elemento cambiado significa que el juez modificó su veredicto sobre si un párrafo tenía cobertura de citas adecuada en al menos una de tres ejecuciones con inputs idénticos. El desacuerdo pareado cuenta cada párrafo entre los tres pares de ejecuciones, lo que da 84 comparaciones por juez.

Juez

Párrafos con veredicto de recall cambiado

Desacuerdos pareados de recall

Jev

1 de 28 (3.6%)

2 de 84 (2.4%)

GPT-5.6 Luna, sin razonamiento

7 de 28 (25.0%)

15 de 84 (17.9%)

GPT-5.6 Luna,

xhigh

5 de 28 (17.9%)

10 de 84 (11.9%)

El único cambio de Jev fue si un párrafo contaba como necesitado de cita; su categoría cruda de recall no cambió. Por lo tanto, los veredictos de cobertura de citas a nivel de párrafo de Jev fueron más repetibles que cualquiera de las configuraciones de Luna.

No estamos concluyendo que esto haga de Jev un juez más preciso (los sistemas aplicaron distintos criterios de soporte y denominadores de puntuación, y no tuvimos tiempo de hacer etiquetado humano independiente). Pero incluso con razonamiento xhigh (que prácticamente triplicó el tiempo de modelo de Luna), siguió siendo menos consistente que Jev. El resultado respalda a Jev como una forma rápida, económica y comparativamente repetible de implementar una política de citas acotada.

Conclusiones de los experimentos y guía práctica

En algunos casos, Jev destaca como una alternativa de baja fricción tanto a los LLMs tradicionales como a los clasificadores fine-tuned. Cuando la línea base es sólida (reranking) o es fácil hacer fine-tuning de un modelo más pequeño (clasificación de consultas), el beneficio es menor. Hay indicios de mayor calidad en algunas tareas (enrutamiento de modelos) y también señales de mejor consistencia y estabilidad (juez de citas). En algunas de nuestras cargas de trabajo más importantes, logra las reducciones esperadas de costo y latencia frente a los LLMs tradicionales.

Los resultados anteriores dan buenas pistas direccionales, y en Glean estamos muy entusiasmados con Jev. Después de dar algunos pasos más (principalmente de preparación operativa, como residencia de datos y garantías), planeamos llevar Jev a producción en algunos de estos casos de uso. Además, Jev tendrá un papel clave en nuestro hackathon interno esta semana, ¡y estamos ansiosos por compartir más resultados!

Un consejo general para cerrar: si la salida se puede listar de antemano, haz benchmark de Jev. Si la tarea y las etiquetas son estables y el volumen es alto, incluye también un clasificador fine-tuned en tu benchmark. Si la llamada necesita generar una consulta, una explicación u otro texto dinámico, mantén un modelo generativo en el loop. El tool calling es un buen ejemplo: Jev puede ayudar a elegir una herramienta, pero la mayoría de las herramientas de Glean aún necesitan argumentos generados dinámicamente (como las consultas de búsqueda).

Jev no cambia el hecho de que los clasificadores ya existían. Lo que hace es volver mucho más fácil de usar un buen clasificador zero-shot. Eso es un producto sólido, aunque no sea una nueva base para todos los sistemas de IA.

Guardar con un clic

Lee artículos virales en profundidad con IA en YouMind

Guarda la fuente, haz preguntas concretas, resume el argumento y convierte un artículo viral en notas reutilizables en un único espacio de trabajo con IA.

Explora YouMind
Para creadores

Convierte tu Markdown en un artículo de 𝕏 impecable

Cuando publicas tus propios textos largos, dar formato en 𝕏 a imágenes, tablas y bloques de código es un fastidio. YouMind convierte un borrador completo en Markdown en un artículo de 𝕏 impecable y listo para publicar.

Prueba Markdown a 𝕏

Más patrones por descifrar

Artículos virales recientes

Explorar más artículos virales