Autores: @eddiedzhou, @mr_cheu, @MatZhao, @CosmicPegasis19, @manav_ai
O Jev é um modelo para tomar decisões tipadas. Você envia o contexto junto com um conjunto fixo de perguntas e opções, e ele devolve escolhas, pontuações e probabilidades em vez de gerar texto. É um modelo "Sistema Um"!
Mas classificação não é novidade, assim como saídas estruturadas, modelos pequenos ou a leitura de probabilidades a partir de logits. Esse histórico explica parte da reação dividida ao Jev...

Os céticos têm um ponto válido, mas o Jev tem, sim, seu lugar neste ecossistema. Para entender melhor, precisamos mapear todo o espaço de soluções.
Quais são as alternativas?
Quando um sistema precisa de um rótulo, uma pontuação ou uma resposta de sim ou não, existem quatro opções razoáveis:
Abordagem
Por que usar
Contrapartida
Um LLM de uso geral
Zero-shot, flexível, também pode gerar argumentos ou explicações. Possivelmente oferece uma "inteligência superior" por meio de computação no momento da inferência (raciocínio).
Você paga a latência e o custo de um modelo autorregressivo por uma decisão pequena
Um classificador zero-shot aberto
Barato, local e controlável
Qualidade variável; você é responsável pela escolha do modelo e pelo serving
Um classificador fine-tuned
Geralmente a melhor aposta para tarefas estáveis e de alto volume com bons rótulos
Coleta de dados, treinamento, implantação, drift e uma taxonomia menos flexível
Jev
Flexibilidade zero-shot por trás de uma API hospedada e limpa
Qualidade dependente da tarefa, sem geração de texto e dependência de fornecedor
O argumento a favor do Jev: uma equipe pode mudar a pergunta e as opções sem precisar coletar um novo conjunto de treinamento, evitando todo o trabalho de servir um modelo direito. Ninguém deveria torcer o nariz para isso. Dizer "nós mesmos poderíamos construir isso" vale para a maioria dos produtos de infraestrutura.
As reproduções abertas colocam a alegação de novidade em perspectiva. Implementações usando Qwen e SGLang, DiffusionGemma e vLLM e Kev recriam boa parte da API ou da estrutura do modelo.

85,7% para o Jev e 79,6% para o Kev-8B em n=764
Os testes externos da Parallel também mostraram que o Jev é competitivo no reranking, embora modelos especializados ainda tenham vencido duas tarefas de classificação.
O que vimos na Glean
Isso nos deixa com uma questão prática: quando a combinação de flexibilidade zero-shot e inferência hospedada do Jev realmente supera as alternativas? Testamos quatro decisões delimitadas na Glean nas quais já tínhamos uma baseline e podíamos comparar a qualidade real em nível corporativo. A maioria dessas baselines são sistemas baseados em LLMs, então, para esses experimentos, sabíamos que deveríamos esperar uma melhoria de duas ordens de grandeza em custo e latência. Os resultados variaram de materialmente piores que a produção até mais rápidos e precisos que um roteador baseado em LLM.
Classificação de consultas
A classificação de consultas mapeia uma solicitação para uma tarefa ampla usada por sistemas downstream. É uma carga de trabalho natural para o Jev porque, embora o espaço de rótulos seja conhecido antecipadamente para cada requisição, a taxonomia ainda pode mudar mais rápido do que um classificador fine-tuned consegue ser retreinado.
Neste experimento, focamos em medir a concordância do Jev com as previsões da nossa baseline / produção, que é baseada em LLM. Esperávamos — e observamos — uma grande aceleração na vazão offline com o Jev, por isso relatamos a concordância como um indicador simples de qualidade. Também usamos como baseline o Laya, um modelo de decisão de pesos abertos, além de uma versão fine-tuned do Laya. Esse fine-tuning pôde rodar localmente em poucas horas, e o modelo é pequeno o suficiente para ser servido na máquina de um desenvolvedor.
Experimento
Concordância de Tarefa Ampla
Desempenho
Jev zero-shot
66,8%
~
12 min (concorrência de 4
)
Laya base
35,9%
~
90 s (máquina de desenvolvimento local)
Laya fine-tuned
74,5%
~
90 s (máquina de desenvolvimento local)
Como um modelo pronto para uso, conveniente e que não exige treinamento, o Jev claramente supera o Laya, mas, sem muita surpresa, o fine-tuning faz o Laya brilhar, especialmente considerando os números de desempenho. A contrapartida é o esforço para obter bons rótulos e configurar o treinamento. O Jev provavelmente continua sendo mais atrativo quando a tarefa é nova ou seus rótulos estão mudando.
Roteamento de modelos: transferência de especialistas
O roteamento de modelos é um problema relacionado à classificação de consultas. Aqui, tratamos o roteamento de modelos como transferência de especialistas, em que nosso sistema escolhe qual especialista / modelo deve lidar com a solicitação. Nossa baseline de produção atualmente pede a um LLM que tome essa decisão nativamente dentro do loop agêntico do harness. Embora esse seja um teste natural para saber se o Jev pode substituir uma chamada generativa por uma decisão delimitada, uma limitação técnica importante é que o Jev vai estritamente adicionar uma chamada caso não haja transferência. Isso contrasta com a baseline de produção, que, nos casos sem transferência, pode iniciar o trabalho de chamada de ferramentas já na mesma primeira chamada ao LLM.

Usamos uma versão simplificada do nosso roteamento de produção com apenas 3 especialistas, reprocessamos 751 entradas golden comparáveis pelo novo roteador Jev e comparamos a rota escolhida com nosso roteador atual baseado em prompts (alimentado por um LLM tradicional), medindo a acurácia em relação ao rótulo golden.

Também isolamos 40 entradas em que o caminho atual fez uma chamada real de transferência de especialista (um n menor) e comparamos a latência das chamadas nessas mesmas entradas.

A aceleração mediana por entrada foi de 8,1×. Este é um dos resultados internos mais fortes do Jev até agora: nessa tarefa de roteamento delimitado, o Jev foi mais preciso e substancialmente mais rápido. A magnitude da diferença sugere que o "imposto" de bloqueio que pagamos nas requisições não roteadas para especialistas pode valer a pena. Vale lembrar que ainda se trata de uma comparação offline com um conjunto golden, e a amostra de latência contém apenas 40 transferências positivas, então há muito mais a testar e validar!
Reranking
Um tema muito querido aqui na Glean! Abaixo, nossa baseline de produção é a ordem gerada pela stack de busca atual da Glean. Neste experimento, pedimos ao Jev para reordenar até 50 resultados.
Testamos quatro formas de expressar relevância por meio das saídas tipadas do Jev:
Formulação
Como expressa a relevância
Noul pontual (Pointwise)
Faz uma pergunta separada de sim ou não sobre relevância para cada resultado e depois ordena pela probabilidade de "sim".
Noul com estado compartilhado
Mostra ao Jev todo o conjunto de candidatos como contexto compartilhado e, em seguida, faz a mesma pergunta de sim ou não para cada resultado.
Pontuação
Pede ao Jev para atribuir uma pontuação numérica de relevância a cada candidato.
Escolha
Trata todos os candidatos como alternativas em uma única decisão e depois os classifica pelas probabilidades resultantes.
Rodamos isso em um evalset interno no qual o usuário não tem acesso a todos os itens canônicos, então os números absolutos não refletem nosso ranking de produção — mas os números relativos são interessantes.
A formulação "Escolha" do Jev foi a mais forte. Em um controle pareado de 4.855 consultas de busca capturadas, removendo o desempate baseado na produção, o resultado foi:

O Jev Escolha custou cerca de US$ 0,00044 por consulta e levou 0,195 segundo no p50 no teste offline. Mas ele atribuiu pontuações idênticas a cerca de 37 dos 41 candidatos em uma consulta média. Usar a ordem de produção para resolver esses empates elevou o Recall@6 de 40,2% para 44,3%, fazendo o resultado não corrigido parecer mais forte do que as pontuações do Jev sozinhas justificariam. Como de costume, há várias ressalvas aqui, mas, na direção certa, o Jev é uma baseline barata e eficiente, não um substituto para o ranker de produção da Glean.
Avaliação de suporte de citações
A avaliação de citações faz duas perguntas relacionadas: afirmações que precisam de evidências têm citações adequadas (recall de citações) e as fontes citadas realmente sustentam as afirmações atribuídas a elas (precisão de citações)? À primeira vista, como o espaço de saída / rótulos é delimitado (semelhante à maioria das configurações de juiz), isso parece um encaixe óbvio para o Jev. No entanto, a rubrica é complexa e pode exigir a decomposição de várias afirmações — além disso, o Jev não gera a justificativa que costumamos usar para análise de erros, o que traz algum risco tanto para a qualidade quanto para a usabilidade.
Testamos o Jev em uma resposta real de avaliação de produção com 1.448 palavras, mantendo a resposta e as evidências de citação fixas. Comparamos sua execução conjunta de precisão e recall com o GPT-5.6 Luna sem raciocínio e com raciocínio xhigh. Para reduzir a variância, rodamos cada juiz três vezes.
Juiz
Tempo original medido por resposta
Custo original medido por resposta
Jev
6,6 s
US$
0,014
GPT-5.6 Luna, sem raciocínio
81,3–85,5 s
US$
0,030–
US$
0,047
GPT-5.6 Luna,
xhigh
227,4–259,7 s
US$
0,047–
US$
0,060
Note que o tempo é indicativo, não de ponta a ponta: o Jev relata o wall time sequencial do cliente, enquanto as linhas do Luna somam as durações das chamadas ao modelo. Os custos incluem o cache observado.
Também comparamos a consistência nos mesmos 28 parágrafos. Um item alterado significa que o juiz mudou seu veredicto sobre se um parágrafo tinha cobertura de citação adequada em pelo menos uma de três execuções com entradas idênticas. A discordância pareada conta cada parágrafo entre os três pares de execuções, totalizando 84 comparações por juiz.
Juiz
Parágrafos com veredicto de recall alterado
Discordâncias pareadas de recall
Jev
1 de 28 (3,6%)
2 de 84 (2,4%)
GPT-5.6 Luna, sem raciocínio
7 de 28 (25,0%)
15 de 84 (17,9%)
GPT-5.6 Luna,
xhigh
5 de 28 (17,9%)
10 de 84 (11,9%)
A única mudança do Jev foi se um parágrafo contava como necessitando de citação; sua categoria bruta de recall não mudou. Portanto, os vereditos de cobertura de citação em nível de parágrafo do Jev foram mais repetíveis do que os de qualquer configuração do Luna.
Não estamos concluindo que isso torna o Jev o juiz mais preciso (os sistemas aplicaram critérios de suporte e denominadores de pontuação diferentes, e não tivemos tempo para fazer rotulações humanas independentes). Mas mesmo com raciocínio xhigh (que praticamente triplicou o tempo de modelo do Luna), ele continuou menos consistente que o Jev. O resultado reforça o Jev como uma forma rápida, barata e relativamente repetível de implementar uma política restrita de citações.
Conclusões dos Experimentos e Guia Prático
Em alguns casos, o Jev brilha como uma alternativa de baixo atrito tanto aos LLMs tradicionais quanto aos classificadores fine-tuned. Quando a baseline é forte (reranking) ou é fácil fazer fine-tuning de um modelo menor (classificação de consultas), o ganho é mais modesto. Há sinais de qualidade superior em algumas tarefas (roteamento de modelos), bem como indicações de melhor consistência e estabilidade (juiz de citações). Em algumas de nossas cargas de trabalho mais importantes, ele entrega as reduções esperadas de custo e latência em relação aos LLMs tradicionais.
Os resultados acima dão boas direções, e aqui na Glean estamos muito animados com o Jev. Depois de mais algumas etapas (principalmente prontidão operacional, como residência de dados e garantias), planejamos colocar o Jev em produção em alguns desses casos de uso. Além disso, o Jev terá um papel importante no nosso hackathon interno desta semana, e mal podemos esperar para compartilhar mais resultados!
Para fechar, alguns conselhos gerais: se a saída puder ser listada antecipadamente, faça benchmarks com o Jev. Se a tarefa e os rótulos forem estáveis e o volume for alto, faça benchmarks também com um classificador fine-tuned. Se a chamada precisar gerar uma consulta, explicação ou outro texto dinâmico, mantenha um modelo generativo no fluxo. Chamada de ferramentas é um bom exemplo: o Jev pode ajudar a escolher uma ferramenta, mas a maioria das ferramentas da Glean ainda precisa de argumentos gerados dinamicamente (como consultas de busca).
O Jev não muda o fato de que classificadores já existiam. Ele torna um bom classificador zero-shot muito mais fácil de usar. E isso é um produto sólido, mesmo que não seja uma nova fundação para todo sistema de IA.





