YouMind
Entrar

Modelo Jev Explicado: Uma Nova IA para Decisões Rápidas e Baratas

@jinchenma_ai
CHINÊS20 de set. de 2026
123K
237
32
17
355

TL;DR

O Jev é um novo modelo de IA da TypeSafe AI, projetado especificamente para tarefas de julgamento como classificação e pontuação, oferecendo alternativas mais rápidas e baratas aos LLMs para fluxos de trabalho com agentes.

Olá, pessoal. Aqui é Jin Chenma.

Vou começar com uma pergunta: em termos de conteúdo processado, quais são os tipos comuns de grandes modelos de IA que encontramos no dia a dia?

A maioria das pessoas está familiarizada com texto, imagens, áudio e vídeo. Nos últimos anos, diversos fornecedores competiram e iteraram continuamente nessas direções, tornando as capacidades mais robustas e a concorrência mais acirrada.

Depois de ver tantas atualizações, fiquei me perguntando: além de tornar os modelos existentes mais fortes, surgirão novas formas de modelos?

Recentemente, um modelo chamado Jev começou a viralizar. No início, pensei: será que é apenas mais uma empresa lançando um novo grande modelo de linguagem?

Mas, após investigar mais a fundo, descobri que este modelo é realmente impressionante.

Por trás dele, a TypeSafe AI propôs uma classe de modelos chamados System One Models (Modelos do Sistema Um), projetados especificamente para tarefas de julgamento em software. O Jev é o primeiro modelo público deles.

As categorias anteriores (texto, imagem, áudio, vídeo) eram divididas por tipo de conteúdo; desta vez, eles mudaram o ângulo: trataram "tomar decisões" como uma tarefa isolada e projetaram um modelo em torno dela.

Acredito que essa direção pode ter um impacto profundo no futuro desenvolvimento e na divisão de trabalho dos modelos de IA.

Neste artigo, vou explicar claramente o que é o Jev, como ele difere dos LLMs padrão, onde pode ser usado e como começar.

Começando pela Analogia do Código QR

Como entender o Jev? Imagine que você quer gerar um código QR.

Normalmente, você usaria uma ferramenta geradora de códigos QR. Mas suponha que você contratasse um artista capaz de desenhar qualquer coisa, pedindo para ele desenhar o código QR pixel por pixel.

Claro, esse artista é habilidoso e consegue fazer isso. Mas existem ferramentas dedicadas para gerar códigos QR. Você só precisa de um código QR funcional, não de uma paisagem pintada junto com ele.

金尘马 - inline image

Da mesma forma, comparando o Jev aos Grandes Modelos de Linguagem (LLMs):

Os LLMs podem escrever artigos, código e discutir problemas complexos. Se você pedir a um LLM para ler um comentário e julgar o sentimento do usuário, ele certamente conseguirá fazer isso.

Mas, se a tarefa exigir apenas uma escolha ou uma pontuação, considere: podemos criar um modelo mais rápido, mais barato e acessível programaticamente, específico para essas tarefas?

É exatamente isso que o Jev faz.

Ele abre mão da geração livre de texto para se especializar em julgamentos com escopos de resposta claros. Por exemplo, se você fornecer quatro opções — "Satisfeito", "Insatisfeito", "Misto", "Indeterminado" — ele seleciona uma e fornece probabilidades para cada opção.

Assim como os códigos QR têm ferramentas dedicadas, tarefas que exigem apenas escolhas e pontuações podem ser tratadas por modelos especializados. Segundo as introduções oficiais, a otimização do Jev para essas tarefas de julgamento reduz o tempo de resposta e os custos de chamada.

Por exemplo, filtrar massivamente comentários de e-commerce diariamente exige julgar sentimento, urgência e métodos de tratamento. Julgamentos mais rápidos e baratos reduzem os tempos gerais de espera e os custos. Os programas recebem os resultados e prosseguem com a classificação ou transferência para atendimento humano.

A Origem do Jev

Quem criou o Jev? Por que construir um modelo exclusivamente para julgamento?

O Jev vem da TypeSafe AI, fundada por Diogo Almeida, que anteriormente trabalhou em pesquisa de modelos de chat na OpenAI.

Ele focou em um problema: a IA é ótima em conversar, mas por que não é fácil integrar essas capacidades ao software para tarefas automatizadas?

O software é excelente em executar regras explícitas. Se a condição A for atendida, faça a ação B. Mas muitos julgamentos do mundo real são difíceis de pré-definir com regras.

Como ler comentários. Quais expressões são reclamações? Quais são piadas? Quais parecem positivas, mas contêm críticas ocultas? É difícil cobrir todos os padrões de fala dos usuários com algumas poucas regras.

A TypeSafe quer transformar o julgamento semântico em um componente chamável. Quando um programa precisa entender um texto ou escolher o próximo passo, ele delega essa pequena tarefa ao modelo, obtém o resultado e continua a execução.

Eles chamam esses modelos de System One, emprestando o conceito do livro Rápido e Devagar: Duas Formas de Pensar. Pense nisso como a parte de julgamento rápida e intuitiva.

O nome Jev vem do economista Jevons. A expectativa da equipe é direta: quanto menor o custo das chamadas inteligentes, mais lugares as pessoas usarão.

Alguns passos antes pareciam caros demais para uma única chamada de IA. Se o julgamento for suficientemente rápido e barato, vale a pena reconsiderá-los.

Como o Jev Diferente dos LLMs?

Tornar as chamadas de software para julgamento de IA mais baratas e fáceis é um bom ponto de partida. Mas os LLMs existentes também podem julgar e retornar resultados estruturados. Por que construir o Jev?

Primeiro, vamos ver como os LLMs entregam resultados de julgamento aos programas.

Os LLMs suportam saída estruturada, o que significa que as respostas se encaixam em slots predefinidos. Por exemplo, um slot para sentimento, outro para urgência, outro para método de tratamento. O programa sabe o que cada posição representa.

Você talvez conheça o JSON, um formato comum para dados estruturados. Desenvolvedores podem restringir as saídas dos LLMs para seguir formatos específicos.

Portanto, olhando apenas se a saída final é texto ou JSON, não revelamos a principal diferença entre o Jev e os LLMs.

A diferença reside em como o modelo gera o resultado.

Os LLMs generativos padrão geralmente produzem respostas token por token. Tokens são pequenos fragmentos de texto processados pelo modelo. Mesmo que você solicite dados em formato fixo, ele geralmente gera o resultado passo a passo.

O Jev usa um método de saída especializado para tarefas de julgamento, fornecendo múltiplos julgamentos e probabilidades em paralelo. Você pode fazer várias perguntas sobre o mesmo comentário e obter todos os resultados em uma única requisição.

Essa diferença de saída relaciona-se à velocidade e ao custo mencionados anteriormente. Processar grandes volumes de dados diariamente incorre em custos significativos, mesmo para pequenos passos. Agentes, que chamam ferramentas e executam tarefas contínuas, precisam decidir repetidamente o próximo passo. A velocidade de resposta e o custo da chamada afetam diretamente o design do software, as despesas operacionais e a experiência do usuário. Alguns passos antes pulados devido à lentidão ou alto custo agora podem incluir julgamento de IA.

Há também a estabilidade da saída. Definimos um conjunto de opções, e ele retorna resultados dentro desse escopo, facilitando o processamento pelo programa downstream.

Três Novas Funcionalidades do Jev

O núcleo do Jev reside em três novas funcionalidades. Sua lógica de design é interessante e vale a pena examinar.

Resumidamente, Choice (Escolha) faz seleções entre opções dadas; Score (Pontuação) atribui avaliações baseadas em critérios; Noul julga a probabilidade de uma afirmação ser verdadeira.

Aqui, usarei o Playground oficial para demonstrar essas funcionalidades com um exemplo prático.

Vamos usar o processamento de comentários de e-commerce. Suponha que você administre uma loja online recebendo avaliações diárias de clientes. Você precisa medir a satisfação, identificar problemas que exigem acompanhamento, determinar métodos de tratamento e priorizar casos urgentes.

Enviaremos este comentário ao Jev:

"O produto é bom, mas a entrega demorou dez dias e o atendimento ao cliente não respondeu."

Usaremos as três funcionalidades para julgar este comentário e ver os resultados.

Choice: Fazendo Seleções

Primeiro, pergunte: Qual é o sentimento geral?

Opções fornecidas: Satisfeito, Insatisfeito, Misto, Indeterminado.

Resultado: "Misto".

Isso é fácil de entender. O usuário elogia o produto, mas reclama da logística e do serviço. Escolher apenas "Satisfeito" ou "Insatisfeito" perde parte do significado.

Da mesma forma, podemos perguntar: Como este comentário deve ser tratado em seguida?

Opções: "Transferir para humano", "Resposta automática", "Sem necessidade de resposta". Regra adicionada: Reclamações de serviço não resolvidas exigem acompanhamento humano.

Resultado: "Transferir para humano".

Note que o conteúdo da questão de múltipla escolha pode variar. Sentimento, departamento, próxima ação — tudo pode ser enquadrado dessa maneira. As opções são fornecidas por nós; o Jev julga com base no material e nos requisitos.

金尘马 - inline image

Score: Atribuindo Avaliações

Em seguida, pergunte: Quão urgente é este comentário? Com quanta rapidez devemos acompanhar?

Antes de pontuar, defina os padrões. Três níveis foram estabelecidos aqui:

  • 0: Avaliação geral ou simples consulta, sem reclamações não resolvidas.
  • 1: Reclamação não resolvida de logística ou serviço, mas sem questões de segurança, perdas maiores ou prazos apertados.
  • 2: Questões explícitas de segurança, perdas maiores ou prazos apertados.

O Jev retorna 1, indicando urgência média conforme este padrão.

As pontuações dependem fortemente dos padrões que você fornece. Você pode mudar para avaliar a qualidade da resposta ou relevância, mas deve definir o que constitui bom ou ruim.

Ele também pode retornar pontuações fracionárias entre os níveis, não apenas inteiros.

金尘马 - inline image

Noul: Julgando a Verdade de Afirmações

Finalmente, dê a ele uma afirmação:

"O usuário solicitou explicitamente um reembolso no comentário."

Este tipo retorna uma probabilidade entre 0 e 1, representando a probabilidade de a afirmação ser verdadeira.

Resultado: 0,03 (3%).

O usuário está insatisfeito, mas não pediu explicitamente um reembolso. Portanto, o modelo dá uma baixa probabilidade a "pedido explícito de reembolso".

金尘马 - inline image

Ao olhar para todos os resultados retornados juntos, o quadro fica claro:

金尘马 - inline image

Estas quatro questões foram enviadas juntas, produzindo todos os resultados de uma vez. A API reportou um tempo de avaliação do modelo de aproximadamente 85 milissegundos.

Agora, o programa tem informações utilizáveis: categoria de sentimento, destino de roteamento, nível de prioridade, intenção de reembolso. O processamento pode continuar com base nesses resultados.

Para Que Pode Ser Usado o Jev?

Processamos um comentário. Em uma plataforma de e-commerce com volume massivo diário, esse uso se expande ainda mais.

Primeiro, estatísticas.

Quais usuários estão satisfeitos? Quem reclama da logística? Quais problemas precisam de atendimento ao cliente? O modelo julga o significado; o programa agrega contagens e exibe categorias.

Segundo, filtragem inicial para decidir o que precisa de processamento mais profundo.

Avaliações gerais vão para as estatísticas. Itens que não necessitam de resposta pulam respostas individuais. Problemas não resolvidos vão para humanos. Respostas automáticas adequadas para geração por LLM são passadas para modelos maiores com contexto.

Anteriormente, ter um caro LLM genérico para triar tudo primeiro incorria em altos custos iniciais. Agora, o Jev cuida da triagem frontal, deixando o processamento profundo para os LLMs.

Pode funcionar a filtragem por palavras-chave?

Parcialmente, mas palavras-chave perdem o contexto.

Exemplo:

"A qualidade é realmente ótima, desmontou depois de um dia."

Corresponder a "qualidade ótima" classifica erroneamente isto como positivo. Ler a frase inteira revela sarcasmo.

O Jev ainda aceita entrada de linguagem natural e entende o significado completo. Sua especialização está no tipo de tarefa e formato de saída, não apenas na correspondência de palavras-chave.

Transformar resultados em ações requer programas externos.

Retorna "transferir para humano", o programa coloca na fila para revisão manual. Retorna "resposta automática", o programa chama um LLM para gerar a resposta. As ações são executadas por regras de fluxo de trabalho e ferramentas.

Em Agentes, esse sistema externo que organiza chamadas de modelo, ferramentas e fluxos de trabalho é frequentemente chamado de Harness. O Jev se encaixa nas posições de julgamento dentro do Harness, ajudando a escolher os próximos passos.

Portanto, acredito que o Jev e os LLMs são complementares, não mutuamente exclusivos.

Especificamente, substitua os LLMs pelo Jev para classificação e pontuação. Mais tarde, para escrever textos, código ou raciocínio complexo multi-etapa, confie nos LLMs.

Assim, um sistema pode usar diferentes modelos para diferentes etapas, combinando capacidades organicamente.

金尘马 - inline image

Como Experimentar o Jev?

A maneira mais direta é abrir o TypeSafe Playground.

Faça login, coloque o texto a ser analisado em State (material para julgamento). Configure as perguntas em Questions, selecione o tipo de julgamento, preencha as opções ou critérios de pontuação, clique em Run para ver os resultados.

Experimente o comentário anterior ou troque por uma avaliação positiva para observar as mudanças.

Para integrar ao seu software, use a API.

A API permite que um software exponha capacidades para outro. Obtenha uma Chave de API (API Key) no console. Seu programa envia materiais e perguntas com esta credencial, recebe os resultados e executa a lógica subsequente.

SDKs oficiais também são fornecidos, encapsulando funções de interface comuns para conveniência do desenvolvedor.

Preços: $0,042 por milhão de tokens de entrada, saída gratuita. A entrada inclui materiais, perguntas e critérios. A filtragem de comentários de alto volume pode usar este modelo de pagamento por chamada nos fluxos existentes.

O Futuro dos Modelos Especializados de Julgamento

Após pesquisar o Jev, fiquei impressionado: alguém deveria ter feito isso há muito tempo, mas ninguém fez.

Acho que essa abordagem está correta. Enquanto todos correm para aumentar o desempenho dos grandes modelos, a TypeSafe AI abriu uma nova trilha, criando modelos personalizados para cenários de dados estruturados, julgamento probabilístico, seleção e decisão.

Os benefícios de custo e velocidade são amigáveis para Agentes. Esperar que grandes modelos retornem lentamente dados é ineficiente em alguns contextos.

Acredito que outros fornecedores provavelmente seguirão essa tendência, construindo modelos especializados para etapas de julgamento de Agentes.

Um Agente pode ter modelos para julgamento rápido, outros para pensamento/escrita/código complexos, além de modelos de imagem/áudio/vídeo, trabalhando em conjunto.

Quando o julgamento for suficientemente rápido e barato, poderemos colocar IA em mais lugares antes considerados não valiosos para a chamada. Para mim, esta é a parte mais empolgante da direção do Jev.

Salvar com um clique

Faça leitura profunda de artigos virais com IA no YouMind

Salve a fonte, faça perguntas específicas, resuma o argumento e transforme um artigo viral em notas reutilizáveis em um único espaço de trabalho com IA.

Explorar o YouMind
Para criadores

Transforme seu Markdown em um artigo 𝕏 impecável

Quando você publica seus próprios textos longos, formatar imagens, tabelas e blocos de código para o 𝕏 é uma dor de cabeça. O YouMind transforma um rascunho completo em Markdown em um artigo 𝕏 impecável e pronto para publicar.

Experimente Markdown para 𝕏

Mais padrões para decifrar

Artigos virais recentes

Explorar mais artigos virais