YouMind
Iniciar sessão

Jev não foi criado para construir Agentes

@kylejeong
INGLÊS21/09/2026
126K
173
21
5
324

TL;DR

O Jev é um modelo de IA especializado para decisões estruturadas e rápidas, distinto dos agentes de propósito geral. Este artigo explica sua arquitetura, vantagens de custo e integração prática em fluxos de trabalho de software como o Stagehand.

A menos que você tenha vivido embaixo de uma pedra na última semana, você já viu o Jev do @typesafeai.

https://x.com/CompleteSkeptic/status/2099925682726002904

Eles descrevem seus modelos como:

uma classe de modelos de IA construídos para tomar decisões rápidas e estruturadas que o software pode usar diretamente. Um modelo System One avalia um

estado e retorna respostas tipadas e probabilidades.

De acordo com os benchmarks da TypeSafe, o Jev é 20-200x mais rápido e 40-400x mais barato do que LLMs.

Mas por que isso importa? Já treinamos classificadores antes (autocorreção no seu celular, filtragem do Gmail, etc.), mas segundo o Twitter, o Jev é algo especial.

Neste artigo, meu objetivo é te ensinar o que é o Jev, por que ele existe e como você pode introduzi-lo nos seus sistemas de produção.

Então, o que é exatamente o Jev?

"Pense no Jev como uma chamada de função de inteligência de fronteira: estado não estruturado entra, decisões probabilísticas tipadas saem." - TypeSafe

O Jev expõe 3 primitivas: Choice, Score e Noul.

  • Choice é um tipo de pergunta que seleciona uma opção de um conjunto definido (de no máximo 255), cuja resposta inclui a opção selecionada, uma probabilidade para cada opção e confiança.
  • Score classifica conteúdo contra níveis descritivos ordenados, cuja resposta inclui uma pontuação, uma probabilidade para cada nível e confiança.
  • Noul pede ao modelo para avaliar uma pergunta sim/não e retornar a probabilidade de a resposta ser sim.

Aqui está uma amostra de entrada e saída para um caso de uso de suporte ao cliente:

json
1// Entrada
2{
3 "model": "jev-latest",
4 "state": "Oi, fui cobrado duas vezes pela minha assinatura mensal. Poderiam reembolsar a cobrança extra? Minha conta está funcionando normalmente.",
5 "questions": {
6 "department": {
7 "type": "choice",
8 "instructions": "Qual equipe deve tratar esta mensagem?",
9 "criteria": {
10 "billing": "Cobranças, pagamentos, assinaturas e reembolsos",
11 "technical": "Bugs, erros e funcionalidades quebradas",
12 "account": "Login, senhas e acesso à conta"
13 }
14 },
15 "requests_refund": {
16 "type": "noul",
17 "instructions": "O cliente está solicitando explicitamente um reembolso?"
18 },
19 "frustration": {
20 "type": "score",
21 "instructions": "Quão frustrado o cliente parece estar?",
22 "criteria": [
23 "Calmo: descreve o problema educadamente sem expressar frustração",
24 "Frustrado: expressa irritação ou insatisfação",
25 "Muito frustrado: expressa raiva intensa ou ameaça sair"
26 ]
27 }
28 }
29}
30// Saída
31{
32 "model": "jev-1.13.0",
33 "answers": {
34 "department": {
35 "type": "choice",
36 "choice": "billing",
37 "confidence": 1,
38 "probabilities": {
39 "technical": 0,
40 "account": 0,
41 "billing": 1
42 }
43 },
44 "requests_refund": {
45 "type": "noul",
46 "noul": 0.99
47 },
48 "frustration": {
49 "type": "score",
50 "score": 0,
51 "legend": {
52 "0": "Calmo: descreve o problema educadamente sem expressar frustração",
53 "1": "Frustrado: expressa irritação ou insatisfação",
54 "2": "Muito frustrado: expressa raiva intensa ou ameaça sair"
55 },
56 "confidence": 1,
57 "probabilities": {
58 "0": 1,
59 "1": 0,
60 "2": 0
61 }
62 }
63 },
64 "usage": {
65 "input_tokens": 442,
66 "output_tokens": 72
67 },
68 "request_id": "playground_12bbfa4198be5ca4de9818a45c0906a2055",
69 "evaluation_time_ms": 163.01120699790772
70}

Recomendo passar pelo onboarding do dashboard deles para entender melhor como estados e perguntas funcionam juntos para gerar as saídas.

Isso não é apenas um classificador?

Bem, sim e não. É mais como se um LLM e um classificador tivessem tido um bebê.

Classificadores tradicionais são bons para tarefas de alto volume e taxonomia fixa. Pense no LeNet-5 sendo capaz de identificar qual dígito uma imagem representava. No entanto, classificadores geralmente são ultra-especializados e específicos de domínio. LLMs são bons em gerar sequências. São flexíveis e ótimos para tarefas abertas definidas em tempo de execução, mas também são mais lentos (que um classificador), mais caros e menos previsíveis.

O Jev é um "modelo fundacional para classificação", combinando a flexibilidade de linguagem natural de um LLM com a saída restrita e probabilística de um classificador. Você pode completar uma grande variedade de tarefas sem ter que treinar um novo modelo, mantendo também a expertise em diversos domínios diferentes (código, texto, logs, estados de UI, eventos, etc.). O Jev também pode gerar saída em paralelo, o que o torna muito mais rápido que um LLM limitado à geração sequencial.

TL;DR: é um classificador generalizável realmente inteligente.

Por que o Jev existe?

O CEO e cofundador da TypeSafe, Diogo Almeida, passou tempo na OpenAI ajudando a criar o RLHF (aprendizado por reforço a partir de feedback humano) e o produto ChatGPT. O RLHF nos permitiu treinar LLMs para serem muito bons em seguir instruções e prompts, o que corresponde à sua natureza autorregressiva.

Ele então deixou a OpenAI para fundar a TypeSafe e treinar uma classe diferente de modelos para habilitar software impulsionado por IA, em vez de agentes. O Jev é treinado com RLCD (aprendizado por reforço a partir de decisões calibradas), que é jargão de pesquisa para dizer que eles treinam o modelo para ser muito bom em emitir confiança e probabilidades, em vez de respostas.

A TypeSafe acredita que o software deve ser inteligente. Agentes não se difundem naturalmente na forma como o software historicamente funcionou, e o loop humano-torna difícil ter software inteligente E autônomo. O Jev é um passo em direção à inteligência como uma primitiva composável e confiável dentro de sistemas de software.

Essa não é uma ideia completamente nova; pesquisadores em 2017 descobriram que alta precisão preditiva não significa estimativas de confiança confiáveis (então LLMs não são uma solução perfeita aqui).

Por que RLCD em vez de RLHF?

O problema com o RLHF é que o que os humanos querem nem sempre é objetivamente correto. Só porque preferimos uma certa resposta em um certo formato não torna os modelos mais inteligentes, mas sim mais agradáveis de trabalhar.

Também introduz colapso de modo; o RLHF faz os LLMs convergirem para uma única resposta onde às vezes múltiplas trajetórias poderiam estar "corretas".

"Uma saída pode ser convincente para uma pessoa sem ser confiável o suficiente para automação desassistida. Preferência humana e confiabilidade da máquina são alvos de otimização diferentes."

Kyle Jeong - inline image

Colapso de modo via Docs do Jev

O Jev NÃO foi feito para construir agentes

Ao contrário do que você vê espalhado pela sua timeline, o Jev não é muito bom como agente independente. Tentamos construir versões dele, tanto só com Jev quanto LLM + Jev.

https://x.com/kylejeong/status/2100622054945095934

Honestamente, agentes Jev fazem demos legais. Houve uma tonelada deles usando o Jev para realizar tarefas de agente em velocidade relâmpago. Mas até as melhores demos não estão prontas para serem implantadas em produção.

Um modelo como o Jev é destinado a software impulsionado por IA; ele pode ajudar você a tomar decisões compostas em código determinístico. Sem capacidades de raciocínio ou generativas, usá-lo como um agente independente é pura ignorância.

Kyle Jeong - inline image

Software Impulsionado por IA

Em vez de deixar o Jev ser um agente independente de uso de computador, ele deve ser usado em roteamento de suporte ao cliente, processamento de faturas, alertas de segurança e triagem, ou como um monitor de agente.

Os números

Seu primeiro modelo, Jev 1.13.0, custa $42/btok (ou $0.042/mtok) de entrada e $0 para tokens de saída. Para referência, o Fable 5.1 custa $10/mtok de entrada, o que equivale a $10.000 / Btok. Cargas de trabalho típicas de empresas têm proporção de 3:1 ou 4:1 entre tokens de entrada e saída, então o Fable vai para ~ $20.000/Btok (com saída de $50/mtok).

A janela de contexto é de 64k tokens por solicitação, onde o estado + a pergunta mais longa devem caber em 32k tokens.

No entanto, em seus benchmarks internos, eles superam todos os modelos em acurácia/custo & acurácia/velocidade da OpenAI, Anthropic e Deepseek (via Fireworks para inferência).

Kyle Jeong - inline image

acurácia/custo

Chega de conversa, como eu uso isso?

Você agora deve ter entendimento suficiente sobre o Jev para ter pensado em alguns casos de uso, independentemente do que estiver trabalhando atualmente. (Se não, aqui está uma lista de casos de uso recomendados pela TypeSafe).

Em vez de limitar sua criatividade sobre como você deve usá-lo, vou mostrar como adaptamos o Jev ao nosso framework Stagehand.

Nos últimos 2 anos, o Stagehand evoluiu como um framework para IA e Agentes controlarem um navegador remoto. Antes dos agentes serem bons o suficiente, criamos primitivas de IA Act (completar uma ação), Extract (extrair dados estruturados) e Observe (descobrir ações potenciais em uma página) para ajudar desenvolvedores a escrever scripts auto-corrigíveis para automatizar a web.

Em vez de usar Playwright (ou outros frameworks legados) e ter que analisar o DOM manualmente para fornecer seletores nas ações, o A/E/O do Stagehand permite usar linguagem natural para construir automações.

typescript
1// Playwright
2await page.click('button[type="submit"]');
3
4// Stagehand
5stagehand.act("clique no botão enviar")

Isso é útil ao escrever scripts pela primeira vez (a velocidade de desenvolvimento é muito mais rápida), mas especialmente útil para manutenção de scripts. Se um site muda e os seletores do DOM são atualizados, os scripts do Playwright devem ser reescritos para corresponder à nova página. O Stagehand escolhe seletores e ações em tempo de execução e são "auto-corrigíveis".

Você pode meio que ver para onde estamos indo com isso. O Jev se encaixa extremamente bem nessas primitivas. Originalmente usávamos um LLM (dado o contexto de como a página parecia e o objetivo) para decidir o que fazer. Com o Jev, podemos usar Choice para decidir com quais seletores interagir.

Vamos usar especificamente Act para discutir o fluxo. Normalmente, daríamos ao LLM uma representação concisa da página usando uma árvore de acessibilidade híbrida. Com o Jev, primeiro marcamos nós na árvore de acessibilidade como interativos (mesmo editores de rich-text) ou não.

Quando stagehand.act é chamado:

  • O Jev classifica a instrução em uma ação (como click, fill ou scroll)
  • O Stagehand analisa argumentos e constrói uma lista de candidatos para essa ação (que inclui contexto próximo da página)
  • O Jev responde "qual candidato é melhor" e "algum candidato corresponde" com um limiar de aceitação de 0.7
  • Se a ação candidata for aceita, o Stagehand cuida da execução
  • Se a ação não for aceita, o Stagehand recorre a um LLM
Kyle Jeong - inline image

Fluxo de Act

Em testes iniciais, a latência mediana de Act cai de 1.97 segundos para 0.46 segundos, o que é cerca de 4.3× mais rápido (ou 77% menos tempo). Veja a pilha completa do PR.

Com uso de computador, o Jev é uma peça do bolo, mas não uma solução independente. Agora somos capazes de construir ferramentas de software mais determinísticas que os agentes podem usar.

Kyle Jeong - inline image

Quando usar o Jev

Difundindo IA no mundo real

O Jev construirá agentes de uso de computador de nível de produção? Não. É uma peça útil do quebra-cabeça? Acho que será.

Parece haver uma abundância de ideias que não faziam sentido antes do Jev. Vi pessoas construindo busca instantânea, copiar e colar inteligente e outras ferramentas simples, mas extremamente úteis.

A IA não deve ficar confinada a alguma versão de uma interface de chat, síncrona ou assíncrona. Com modelos como o Jev, podemos construir software que incorpora modelos preditivos sem uma caixa de entrada de chat. Embora classificadores estejam disponíveis há tanto tempo, eles nunca pareceram tão úteis. Talvez tudo o que precisávamos construir era inspiração.

-> Kyle

Guardar com um clique

Faça leitura aprofundada de artigos virais com IA no YouMind

Guarde a fonte, faça perguntas específicas, resuma o argumento e transforme um artigo viral em notas reutilizáveis num único espaço de trabalho com IA.

Explorar o YouMind
Para criadores

Transforme o seu Markdown num artigo 𝕏 impecável

Quando publica os seus próprios textos longos, formatar imagens, tabelas e blocos de código para o 𝕏 é uma dor de cabeça. O YouMind transforma um rascunho completo em Markdown num artigo 𝕏 impecável e pronto a publicar.

Experimente Markdown para 𝕏

Mais padrões para decifrar

Artigos virais recentes

Explorar mais artigos virais