A menos que você tenha vivido numa caverna na última semana, já deve ter visto o Jev do @typesafeai.
https://x.com/CompleteSkeptic/status/2099925682726002904
Eles descrevem seus modelos como:
uma classe de modelos de IA construídos para tomar decisões estruturadas e rápidas que o software pode usar diretamente. Um modelo System One avalia um
estado e retorna respostas tipadas e probabilidades.
De acordo com os benchmarks da TypeSafe, o Jev é 20-200x mais rápido e 40-400x mais barato do que LLMs.
Mas por que isso importa? Já treinamos classificadores antes (autocorreção no celular, filtragem do Gmail, etc.), mas segundo o Twitter, o Jev é algo especial.
Neste artigo, meu objetivo é te ensinar o que é o Jev, por que ele existe e como você pode introduzi-lo em seus sistemas de produção.
Então, o que exatamente é o Jev?
O Jev expõe 3 primitivas: Choice, Score e Noul.
- Choice é um tipo de pergunta que seleciona uma opção de um conjunto definido (de no máximo 255), cuja resposta inclui a opção selecionada, uma probabilidade para cada opção e confiança.
- Score classifica conteúdo contra níveis descritivos ordenados, cuja resposta inclui uma pontuação, uma probabilidade para cada nível e confiança.
- Noul pede ao modelo para avaliar uma pergunta sim/não e retornar a probabilidade de a resposta ser "sim".
Aqui está um exemplo de entrada e saída para um caso de uso de suporte ao cliente:
1// Entrada2{3 "model": "jev-latest",4 "state": "Oi, fui cobrado duas vezes pela minha assinatura mensal. Poderiam reembolsar a cobrança extra? Minha conta está funcionando normalmente.",5 "questions": {6 "department": {7 "type": "choice",8 "instructions": "Qual equipe deve tratar esta mensagem?",9 "criteria": {10 "billing": "Cobranças, pagamentos, assinaturas e reembolsos",11 "technical": "Bugs, erros e recursos quebrados",12 "account": "Login, senhas e acesso à conta"13 }14 },15 "requests_refund": {16 "type": "noul",17 "instructions": "O cliente está solicitando explicitamente um reembolso?"18 },19 "frustration": {20 "type": "score",21 "instructions": "Quão frustrado o cliente parece estar?",22 "criteria": [23 "Calmo: descreve o problema educadamente sem expressar frustração",24 "Frustrado: expressa irritação ou insatisfação",25 "Muito frustrado: expressa raiva intensa ou ameaça sair"26 ]27 }28 }29}30// Saída31{32 "model": "jev-1.13.0",33 "answers": {34 "department": {35 "type": "choice",36 "choice": "billing",37 "confidence": 1,38 "probabilities": {39 "technical": 0,40 "account": 0,41 "billing": 142 }43 },44 "requests_refund": {45 "type": "noul",46 "noul": 0.9947 },48 "frustration": {49 "type": "score",50 "score": 0,51 "legend": {52 "0": "Calmo: descreve o problema educadamente sem expressar frustração",53 "1": "Frustrado: expressa irritação ou insatisfação",54 "2": "Muito frustrado: expressa raiva intensa ou ameaça sair"55 },56 "confidence": 1,57 "probabilities": {58 "0": 1,59 "1": 0,60 "2": 061 }62 }63 },64 "usage": {65 "input_tokens": 442,66 "output_tokens": 7267 },68 "request_id": "playground_12bbfa4198be5ca4de9818a45c0906a2055",69 "evaluation_time_ms": 163.0112069979077270}
Recomendo passar pelo onboarding do dashboard deles para entender melhor como estado e perguntas funcionam juntos para gerar as saídas.
Isso não é apenas um classificador?
Bem, sim e não. É mais como se um LLM e um classificador tivessem tido um bebê.
Classificadores tradicionais são bons para tarefas de alto volume e taxonomia fixa. Pense no LeNet-5 sendo capaz de identificar qual dígito uma imagem representava. No entanto, classificadores geralmente são ultra-especializados e específicos de domínio. LLMs são bons em gerar sequências. São flexíveis e ótimos para tarefas abertas definidas em tempo de execução, mas também são mais lentos (que um classificador), mais caros e menos previsíveis.
O Jev é um "modelo fundacional para classificação", combinando a flexibilidade de linguagem natural de um LLM com a saída restrita e probabilística de um classificador. Você pode completar uma grande variedade de tarefas sem precisar treinar um novo modelo, mantendo também a expertise em diversos domínios diferentes (código, texto, logs, estados de UI, eventos, etc.). O Jev também pode gerar saída em paralelo, o que o torna muito mais rápido que um LLM limitado à geração sequencial.
Resumindo: é um classificador generalizável realmente inteligente.
Por que o Jev existe?
O CEO e cofundador da TypeSafe, Diogo Almeida, passou um tempo na OpenAI ajudando a criar o RLHF (aprendizado por reforço a partir de feedback humano) e o produto ChatGPT. O RLHF nos permitiu treinar LLMs para serem muito bons em seguir instruções e prompts, o que corresponde à sua natureza autorregressiva.
Ele então deixou a OpenAI para fundar a TypeSafe e treinar uma classe diferente de modelos para habilitar software impulsionado por IA, em vez de agentes. O Jev é treinado com RLCD (aprendizado por reforço a partir de decisões calibradas), que é jargão de pesquisa para dizer que eles treinam o modelo para ser muito bom em emitir confiança e probabilidades, em vez de respostas.
A TypeSafe acredita que o software deve ser inteligente. Agentes não se difundem naturalmente na forma como o software historicamente funcionou, e o loop humano-torna difícil ter software inteligente E autônomo. O Jev é um passo em direção à inteligência como uma primitiva composável e confiável dentro dos sistemas de software.
Essa não é uma ideia completamente nova; pesquisadores em 2017 descobriram que alta precisão preditiva não significa estimativas de confiança confiáveis (então LLMs não são uma solução perfeita aqui).
Por que RLCD em vez de RLHF?
O problema com o RLHF é que o que os humanos querem nem sempre é objetivamente correto. Só porque preferimos uma certa resposta em um certo formato não torna os modelos mais inteligentes, mas sim mais agradáveis de trabalhar.
Também introduz colapso de modo; o RLHF faz os LLMs convergirem para uma única resposta onde às vezes múltiplas trajetórias poderiam ser "corretas".

Colapso de modo via Docs do Jev
O Jev NÃO foi feito para construir agentes
Ao contrário do que você vê espalhado pela sua timeline, o Jev não é muito bom como agente independente. Tentamos construir versões dele, tanto só com Jev quanto LLM + Jev.
https://x.com/kylejeong/status/2100622054945095934
Honestamente, agentes Jev fazem demos legais. Houve uma tonelada deles usando o Jev para realizar tarefas de agente em velocidade relâmpago. Mas até as melhores demos não estão prontas para serem implantadas em produção.
Um modelo como o Jev é destinado a software impulsionado por IA; ele pode ajudar você a tomar decisões compostas em código determinístico. Sem capacidades de raciocínio ou generativas, usá-lo como um agente independente é pura ignorância.

Software Impulsionado por IA
Em vez de deixar o Jev ser um agente independente de uso de computador, ele deve ser usado em roteamento de suporte ao cliente, processamento de faturas, alertas de segurança e triagem, ou como um monitor de agente.
Os números
Seu primeiro modelo, Jev 1.13.0, custa $42/btok (ou $0.042/mtok) de entrada e $0 para tokens de saída. Para referência, o Fable 5.1 custa $10/mtok de entrada, o que equivale a $10.000 / Btok. Cargas de trabalho empresariais típicas têm uma proporção de 3:1 ou 4:1 entre tokens de entrada e saída, então o Fable vai para ~ $20.000/Btok (com $50/mtok de saída).
A janela de contexto é de 64k tokens por solicitação, onde o estado + a pergunta mais longa devem caber em 32k tokens.
Nos benchmarks internos deles, no entanto, eles superam todos os modelos em acurácia/custo & acurácia/velocidade da OpenAI, Anthropic e Deepseek (via Fireworks para inferência).

acurácia/custo
Chega de conversa, como eu uso isso?
Você agora deve ter uma compreensão suficiente do Jev para ter pensado em alguns casos de uso, independentemente do que estiver trabalhando atualmente. (Se não, aqui está uma lista de casos de uso recomendados pela TypeSafe).
Em vez de limitar sua criatividade sobre como você deve usá-lo, vou mostrar como adaptamos o Jev ao nosso framework Stagehand.
Nos últimos 2 anos, o Stagehand evoluiu como um framework para IA e Agentes controlarem um navegador remoto. Antes de os agentes serem bons o suficiente, criamos primitivas de IA Act (completar uma ação), Extract (extrair dados estruturados) e Observe (descobrir ações potenciais em uma página) para ajudar desenvolvedores a escrever scripts auto-corrigíveis para automatizar a web.
Em vez de usar Playwright (ou outros frameworks legados) e ter que analisar o DOM manualmente para fornecer seletores nas ações, o A/E/O do Stagehand permite usar linguagem natural para construir automações.
1// Playwright2await page.click('button[type="submit"]');34// Stagehand5stagehand.act("clique no botão enviar")
Isso é útil ao escrever scripts pela primeira vez (a velocidade de desenvolvimento é muito maior), mas especialmente útil para manutenção de scripts. Se um site muda e os seletores do DOM são atualizados, os scripts do Playwright precisam ser reescritos para corresponder à nova página. O Stagehand escolhe seletores e ações em tempo de execução e são "auto-corrigíveis".
Dá pra ver onde estamos indo com isso. O Jev se encaixa extremamente bem nessas primitivas. Originalmente usávamos um LLM (dado o contexto de como a página parecia e o objetivo) para decidir o que fazer. Com o Jev, podemos usar Choice para decidir com quais seletores interagir.
Vamos usar especificamente o Act para discutir o fluxo. Normalmente, daríamos ao LLM uma representação concisa da página usando uma árvore de acessibilidade híbrida. Com o Jev, primeiro marcamos nós na árvore de acessibilidade como interativos (mesmo editores de rich-text) ou não.
Quando stagehand.act é chamado:
- O Jev classifica a instrução em uma ação (como click, fill ou scroll)
- O Stagehand analisa os argumentos e constrói uma lista de candidatos para essa ação (que inclui o contexto próximo da página)
- O Jev responde "qual candidato é melhor" e "algum candidato corresponde" com um limiar de aceitação de 0.7
- Se a ação candidata for aceita, o Stagehand cuida da execução
- Se a ação não for aceita, o Stagehand recorre a um LLM

Fluxo do Act
Nos testes iniciais, a latência mediana do Act cai de 1,97 segundos para 0,46 segundos, o que é cerca de 4,3× mais rápido (ou 77% menos tempo). Veja a pilha completa do PR.
Com uso de computador, o Jev é uma peça do quebra-cabeça, mas não uma solução independente. Agora somos capazes de construir ferramentas de software mais determinísticas que os agentes podem usar.

Quando usar o Jev
Difundindo IA no mundo real
O Jev construirá agentes de uso de computador de nível de produção? Não. É uma peça útil do quebra-cabeça? Acho que será.
Parece haver uma abundância de ideias que não faziam sentido antes do Jev. Vi pessoas construindo busca instantânea, colagem inteligente e outras ferramentas simples, mas extremamente úteis.
A IA não deve ficar confinada a alguma versão de uma interface de chat, síncrona ou assíncrona. Com modelos como o Jev, podemos construir software que incorpora modelos de previsão sem uma caixa de entrada de chat. Embora os classificadores estejam disponíveis há tanto tempo, nunca pareceram tão úteis. Talvez tudo o que precisávamos era inspiração.
-> Kyle





