Aqui está o resumo ELI5 (explique como se eu tivesse 5 anos).
Pense em múltipla escolha com IA, não em redação com IA.
Ele não conversa. Ele toma decisões que seu software pode executar: "É spam ou não?" "Qual ferramenta este agente deve usar?" "Isso precisa de um humano?"
A parte empolgante: cerca de 200x mais rápido e 400x mais barato do que LLMs de fronteira nos benchmarks de fluxo de trabalho da própria TypeSafe, com respostas em frações de segundo.
Por que isso é poderoso: imagine um app ou agente fazendo centenas de pequenas chamadas de julgamento sem centenas de conversas caras e lentas com um LLM.
Mantenha o modelo grande para o pensamento difícil e a escrita. Use o Jev para as decisões rápidas entre elas.
Ah, e ele foi feito casualmente por Diogo Almeida, co-criador do ChatGPT e um dos co-inventores do RLHF, que passou dois anos desenvolvendo-o em sigilo.
Essa é a proposta. Aqui está o que os dados mostram.
Nove varreduras /last30days, cada arquivo bruto lido por completo, e cada post importante verificado manualmente contra a página ao vivo. O post de lançamento está com 66K curtidas e 31,4 milhões de visualizações dois dias depois.
https://x.com/CompleteSkeptic/status/2099925682726002904
Um agente de navegador construído sobre ele teve 1,8 milhão de visualizações em um dia. E um desenvolvedor conferiu sua fatura: cerca de 5.000 requisições por aproximadamente dois dólares, distribuídos entre classificação, roteamento de modelos, intenção e direcionamento.
https://x.com/MichaelLee04/status/2100003037150683593
Eu não executei esses fluxos de trabalho. Apontei a pesquisa para a comunidade e classifiquei o que as pessoas estão realmente lançando. De 31 fluxos de trabalho candidatos com uma fonte nomeada e um número real, estes são os 9 vale a pena roubar, cada um com a carga útil para copiar.
🧠 A mecânica, em sessenta segundos
Você entrega o estado do seu aplicativo mais uma pergunta tipada, e ele devolve uma decisão tipada com uma probabilidade anexada. Sem prompting JSON, sem camada de parsing, nada para validar.
Três tipos de perguntas, e essa é toda a superfície: \Choice\ escolhe uma de até 255 opções, \Score\ coloca algo em uma escala, \Noul\ responde sim ou não como um número de 0 a 1. Cada resposta carrega \probabilities\ e uma pontuação de \confidence\. Faça vinte perguntas sobre o mesmo estado em uma chamada e elas serão avaliadas em paralelo, então vinte custam quase o que uma custa. A entrada custa $0,042 por milhão de tokens. A saída é gratuita.
A comunidade chegou ao mesmo enquadramento do meu tweet, com muito mais alcance: LLMs geram respostas, Jev toma decisões, 2.278 curtidas.
Meus números principais vêm com uma nota de rodapé. A TypeSafe coloca o tempo de resposta entre 70 e 500 milissegundos e de 40x a 200x mais rápido do que modelos de fronteira. O par exato na página inicial deles, das próprias avaliações de fluxo de trabalho, é 193,6x mais rápido e 444,6x mais barato. A linha de base contra a qual é medido importa:
Então, aqui está a página inicial deles, e a primeira coisa que eles te apresentam é a comparação lado a lado com o GPT-5 X Terra, um dos modelos intermediários da OpenAI.
- Nimrod, YouTube, 13.747 visualizações
O nome não é uma referência a Kahneman, embora a classe do modelo seja chamada System One.
Aqui é onde o nome Jev realmente vem, e não é Kahneman, é um economista do século XIX chamado William Stanley Jevons.
- Dots and Arrows, YouTube, 14.597 visualizações
Paradoxo de Jevons: torne um recurso mais barato e as pessoas consumirão muito mais dele. Nomear seu modelo de decisão após isso é uma declaração de tese.
Também é uma piada. Rob Shocks cortou para um clipe de "My name is Jeff" em sua análise de 231.655 visualizações e o comentário principal, com 142 curtidas, era apenas "My name is Jev me matou". Diogo tem recebido as piadas pessoalmente, 129 curtidas.
1. 🌐 Um agente de navegador que encontra voos em 7 segundos por $0,0039
O que é. Um pequeno agente de navegador open source onde o Jev escolhe o próximo clique e um pequeno LLM só acorda quando algo precisa ser digitado.
Quem executa. Gregor Zunic, fundador da Browser Use. 7,2K curtidas, 1,8M visualizações, 7,6K bookmarks. Ele observa no post que o vídeo roda em velocidade 1x.
https://x.com/gregpr07/status/2100411066966749359
Por que ganhou um lugar. É a coisa mais assistida que alguém construiu sobre o modelo, e é a ilustração mais limpa do padrão que continua vencendo: um novo espaço de ações a cada passo, o DOM como estado, Jev escolhendo entre os candidatos, geração apenas como fallback. O artigo da própria LangChain diz que Kyle Jeong da Browserbase está fazendo a mesma coisa por frações de centavo.
A carga útil é o repositório: browser-use/jev-ultrafast. Clone-o antes de escrever o seu próprio.
2. 🧹 Compactação instantânea: pontue cada chamada de ferramenta e descarte o lixo
O que é. Substitua o prompt de sumarização que todo agente de código executa no limite do contexto por uma passagem do Jev que pontua cada chamada de ferramenta por relevância e exclui o peso morto.
Quem executa. Tamara Tran fez a pergunta e lançou a resposta na mesma tarde. 5K curtidas, 554,4K visualizações.
https://x.com/tamarajtran/status/2100694549362553153
Alex Volkov executou-o como um plugin do Claude e publicou o número: um segundo para levar uma sessão de quase 1M tokens para 86K. 1,9K curtidas, 3,5K bookmarks.
https://x.com/altryne/status/2100739055923425589
Por que ganhou um lugar. Porque a resposta de Diogo é o indicador de para onde isso vai. 304 curtidas.
https://x.com/CompleteSkeptic/status/2100702845779775675
Se um harness pode pontuar e descartar em um segundo em vez de resumir, a janela de contexto deixa de ser a coisa ao redor da qual você projeta. Esta é a escolha surpresa. O Browser Use é melhor em vídeo; a compactação é aquela que todo usuário de agente de código sente hoje.
Cole isto no Claude Code, que é a linha de instalação exata de Alex:
1Instale e configure: https://github.com/tamaratran/fast-jev-compaction
3. 🛡️ O revisor de segurança, desacoplado do harness
O que é. Todo harness de código executa um classificador que pergunta "este comando deve ser executado?" antes que o modo automático permita. Até esta semana, esse classificador vivia na parte fechada do produto.
Quem executa. Vercel, em produção. Guillermo Rauch: o modo padrão no fx é auto, com um revisor de segurança analisando cada comando, e o Jev é até 18x mais rápido no p95 e mais preciso do que o modelo que o executa hoje. 3,7K curtidas, 392,4K visualizações.
https://x.com/rauchg/status/2100307962262872105
https://x.com/fazxes/status/2100300097695232164
Por que ganhou um lugar. Porque é uma migração de produção com um número p95 anexado, e porque a LangChain lançou a versão aberta no dia seguinte como \AutoModeMiddleware\. A análise do Rob Shocks, 231.655 visualizações e 3.526 curtidas, é aquela para enviar a um colega de equipe que quer a história em dez minutos.
A versão da LangChain, literalmente do post deles:
1from langchain.agents import create_agent2from langchain_typesafe.experimental.middleware import (3 AutoModeMiddleware,4)56guardrail = AutoModeMiddleware(tools=["bash"])78agent = create_agent("openai:gpt-5.6-luna", middleware=[guardrail])
4. 🚦 Roteamento de modelos como um middleware, não um system prompt
O que é. Coloque o Jev na frente da sua frota de modelos e deixe-o escolher qual cérebro lida com cada solicitação, com as probabilidades deixadas no estado do agente para que você possa auditar a escolha.
Quem executa. LangChain, no "Building a Harness with Jev" de Sydney Runkle. 232 curtidas, 31,1K visualizações, e a peça mais limpa de como conectá-lo que alguém publicou.
https://x.com/sydneyrunkle/status/2100754364545761643
Por que ganhou um lugar. O roteamento de modelos é o trabalho mais citado para o modelo em todo o corpus; é um dos cinco workloads no post de 5.000 requisições por $2 no topo deste artigo. A LangChain transformou isso de um parágrafo em um system prompt em onze linhas que você pode ler.
1from langchain.agents import create_agent2from langchain_typesafe.experimental.middleware import (3 ModelChoice,4 ModelRouterMiddleware,5)67router = ModelRouterMiddleware(8 choices={9 "fast": ModelChoice(10 model="openai:luna",11 criteria="Direct lookups, extraction, and localized changes.",12 ),13 "powerful": ModelChoice(14 model="openai:sol",15 criteria="Architecture and high-stakes decisions.",16 ),17 },18 instructions="Choose the least costly model that can complete the task.",19)2021agent = create_agent("openai:gpt-5.6-luna", middleware=[router])
Instale com \pip install langchain-typesafe\ e defina \TYPESAFE_API_KEY\.
5. 🔎 Precisão de RAG: recupere como de costume, depois delete o que não pertence
O que é. Mantenha seu recuperador exatamente como está. Execute o Jev sobre cada fragmento que ele retorna com uma única pergunta de sim ou não, e descarte aqueles que falham.
Quem executa. Kush Bhuwalka colocou em uma frase: execute o Jev em todos os fragmentos que ele recupera e apague os irrelevantes. 416 curtidas.
https://x.com/kushbhuwalka/status/2100731050075050485
Por que ganhou um lugar. A precisão tem sido a metade não resolvida do RAG porque a correção era sempre outra chamada de LLM por fragmento, o que ninguém podia pagar no momento da recuperação. Com tokens de saída gratuitos e latência sub-segundo, um veredito por fragmento é mais barato que a busca de incorporação que produziu o fragmento. Este eu escrevi contra a API documentada, na forma que Kush descreveu:
1from typesafe_sdk import Noul, TypeSafeClient23client = TypeSafeClient()45kept = []6for chunk in retrieved_chunks:7 verdict = client.system_one(8 state={"question": user_question, "chunk": chunk.text},9 questions={10 "relevant": Noul(11 instructions="The chunk contains information needed to answer the question",12 ),13 },14 )15 if verdict.answers["relevant"].noul > 0.5:16 kept.append(chunk)
6. 🎮 Loops em tempo real: Minecraft, Doom e um launcher que lê sua mente
O que é. Decisões dentro de um loop que roda muitas vezes por segundo, onde um modelo de fronteira não pode participar de forma alguma.
Quem executa. Wuyang Zhou tem o Jev e o GPT-6 Astra jogando Minecraft juntos, Jev nas reações rápidas e Astra planejando à frente, lutando contra vários zumbis ao mesmo tempo. 374 curtidas, 51,4K visualizações.
https://x.com/wuyang_zhou/status/2100727660875808913
Nader Dabit construiu um oráculo de teclado: digite "o pdf que baixei agora" e o PDF mais recente já é o principal resultado, com total confiança, a cada tecla, em cerca de 100 milissegundos. 264 curtidas.
Por que ganhou um lugar. A demo de lançamento da própria TypeSafe é Doom, com o modelo perguntado o que fazer cerca de dez vezes por segundo. Dois explicadores independentes descobriram o mesmo custo para esse loop:
Jev está jogando em tempo real cerca de 10 decisões por segundo, e isso dá cerca de $7 por hora.
- AI WITH Rithesh, YouTube, 19.904 visualizações
Dez decisões por segundo por sete dólares por hora coloca-o em uma categoria diferente de um LLM, e a divisão do Minecraft, modelo rápido reage enquanto modelo lento planeja, é o padrão que todas as escolhas em tempo real desta lista compartilham.
7. 📬 Triagem de e-mail em escala de lote
O que é. Aponte o Jev para uma exportação de caixa de entrada e faça-o classificar, pontuar e sinalizar cada mensagem em paralelo.
Quem executa. O canal vogel no YouTube, 60.996 visualizações e 526 curtidas, executou 1.500 e-mails exportados em lotes de 100 com 8 workers. O artigo da LangChain nomeia Ryan Vogel como um dos três projetos que está observando. Syntax, 33.933 visualizações e 1.052 curtidas, construiu a mesma coisa mais uma demonstração de automação residencial que vai da pergunta à chamada de API em 300 milissegundos.
Por que ganhou um lugar. É a demo mais copiada no corpus, e a matemática da vazão é o ponto.
Temos apenas um saldo de $5 aqui embaixo, o que apenas mostra quão barato este modelo é.
- vogel, YouTube, 60.996 visualizações
Este é o quickstart da própria TypeSafe, literalmente, e já é um pipeline de triagem de e-mail:
1pip install typesafe-sdk
1from typesafe_sdk import Choice, Noul, Score, TypeSafeClient23client = TypeSafeClient()45response = client.system_one(6 state="Hi, I've been trying to connect my Stripe account for 3 days and it keeps failing. I'm losing sales. Please help ASAP.",7 questions={8 "department": Choice(9 instructions="Which team should handle this",10 criteria={11 "billing": "Payment or subscription issues",12 "technical": "Bugs or integration problems",13 "sales": "Pricing or account questions",14 },15 ),16 "frustration": Score(17 instructions="How frustrated the customer appears",18 criteria=[19 "Calm, just stating facts",20 "Frustrated but civil",21 "Very angry, strong language",22 ],23 ),24 "is_urgent": Noul(25 instructions="The message conveys urgency or time-sensitivity",26 ),27 },28)2930print(response.answers["department"].choice)31print(response.answers["frustration"].score)32print(response.answers["is_urgent"].noul)
8. 🗂️ Map-reduce sobre documentos: 777 julgamentos por um quarto de centavo
O que é. Um conjunto de perguntas, cada documento, tudo de uma vez. O workload que tem sido economicamente impossível com modelos de fronteira e medíocre com classificadores clássicos.
Quem executa. Mike Taylor, chefe de avaliações na Every, executou o teste mais limpo que alguém publicou: 27 de seus próprios artigos mais 10 contrapartes estilizadas por IA, 21 perguntas cada, tudo em uma solicitação. 777 julgamentos em menos de 0,7 segundos, por cerca de um quarto de centavo. Em todas as suas onze experiências, 1.709 julgamentos por menos de um centavo. O AI Daily Brief, 10.000 visualizações, pegou o número no mesmo dia.
Por que ganhou um lugar. A TypeSafe lista isso como uma categoria de primeira mão, "AI Map Reduce over Big Data," em seu mapa de casos de uso. Tokens de saída gratuitos mudam a aritmética em qualquer coisa que você execute por linha. A forma HTTP bruta, dos docs, é pequena o suficiente para caber aqui:
1{2 "model": "jev-latest",3 "state": "Hi, I've been trying to connect my Stripe account for 3 days and it keeps failing. I'm losing sales. Please help ASAP.",4 "questions": {5 "is_urgent": {6 "type": "noul",7 "instructions": "The message conveys urgency or time-sensitivity"8 }9 }10}
Isso retorna \{"is_urgent": {"type": "noul", "noul": 0.999}}\. Vinte perguntas no objeto \questions\ custam quase o que uma custa, então pergunte tudo o que você quer saber por linha em uma única chamada.
9. 🧪 Jev no seu navegador, e os clones
O que é. A interface, reimplementada sobre um modelo local por pessoas que queriam a forma sem a dependência.
Quem executa. Kshetrajna Raghavan na Shopify construiu o Reflex, um modelo Qwen executando decisões estruturadas com probabilidades na WebGPU, inteiramente no navegador. Tobi Lütke passou adiante: 206 curtidas, 38,5K visualizações.
https://x.com/tobi/status/2100742327459303882
Um jevlike de engenharia reversa atraiu 157 pontos na página inicial do Hacker News dois dias após o lançamento, e o mini-jev, a mesma interface em um LLM local, seguiu um dia depois. O catálogo da comunidade, awesome-jev-by-typesafe, estava com 409 estrelas quando eu busquei.
Por que ganhou um lugar. Três clones independentes dentro de 72 horas são o sinal mais forte nesta varredura sobre se a interface é a verdadeira invenção. Também lhe dá uma saída offline para qualquer coisa que você não possa enviar pela rede, o que importa porque a coisa real é apenas via API e hospedada nos EUA. Experimente o Reflex em uma aba agora mesmo.
📖 Como a TypeSafe diz para usá-lo
Quatro regras, dos docs e das próprias respostas do fundador:
- Faça muitas perguntas por chamada. Elas são avaliadas em paralelo, e os docs dizem que perguntas extras mal alteram o tempo de resposta. Cada escolha acima que impressionou alguém estava pedindo várias coisas sobre um estado.
- Limiar na confiança. Os docs dizem para tratar qualquer coisa abaixo de 0,3 a 0,5 como um sinal para perguntar a um humano em vez de agir. Esta é a diferença entre um classificador, que te entrega um rótulo, e um sistema de decisão, que te entrega um rótulo mais permissão para usá-lo.
- Dê-lhe candidatos, não peça para inventar. O Browser Use constrói o espaço de ações a partir do DOM e o Jev escolhe. O RAG recupera e o Jev filtra. O launcher classifica e o Jev reclassifica. Choice suporta até 255 opções; adicione um "outro" para os casos extremos.
- Acerte a pontuação ou nada mais importa. Um builder que passou a semana tentando quebrá-lo disse claramente: "se você não acertar a pontuação, não funciona." O conjunto de opções e a redação da pergunta são o trabalho; a chamada em si é trivial.
Onde você pode experimentá-lo: já está atrás dos gateways que você usa. Vercel AI Gateway dentro de 48 horas, e com 2.341 curtidas, essa é a segunda maior publicação da empresa, atrás apenas do anúncio em sigilo.
https://x.com/typesafeai/status/2100376436272173088
Cloudflare AI Gateway, 749 curtidas, e OpenRouter em beta, 387 curtidas, na mesma semana. O acesso direto é \POST [https://api.typesafe.ai/v1/systemone](https://api.typesafe.ai/v1/systemone)\ com um token Bearer.
⚖️ A ressalva honesta
O tópico de lançamento no Hacker News, "Introducing System One Models and Jev", 1.863 pontos e 490 comentários, gastou a maior parte do seu comprimento em uma frase do marketing:
Além disso, 'não pode alucinar' parece errado? Claro, não pode emitir um tipo inválido, mas ainda pode emitir um valor válido completamente errado.
- jacobgold, tópico de lançamento no Hacker News, 1.863 pontos
Diogo não lutou contra isso. Quando um comentarista expôs que este é um modelo de classificação em vez de um LLM, ele chamou a explicação de "muito precisa!" e adicionou apenas que diria zero-shot em vez de ajustado por instruções. Esse é o enquadramento honesto, e é um negócio bem menor do que o hype do dia do lançamento estava chamando de um novo tipo de inteligência: um classificador zero-shot muito bom com probabilidades calibradas e uma API real.
O maior tópico do Reddit sobre o Jev é sobre quem o construiu primeiro. O "I literally built the Jev architecture one year back and completely open-sourced it with model, dataset and paper" do r/LocalLLaMA, 1.568 upvotes e 164 comentários, atraiu a resposta que resume o humor de toda a indústria:
Mas você postou dizendo que é a próxima grande coisa? Erro de novato
- hapliniste, Reddit, 495 upvotes
O consolo de 351 upvotes no mesmo tópico: por causa desse trabalho anterior, ninguém consegue patentear a ideia geral e trancá-la.
Mike Taylor da Every passou 12 passagens com defeitos plantados pelo Jev e pelo Fable 5.1 em alto esforço. O Jev voltou com uma mediana de 0,35 segundos por passagem contra 8,83, cerca de 25 vezes mais rápido e cerca de 580 vezes mais barato. Também detectou seis dos sete defeitos. O Fable detectou todos os sete. Seu veredito: útil como um sistema de alerta precoce, porque a alternativa é não verificar de forma alguma. Uma segunda comparação lado a lado menor em um loop de pesquisa contra gpt-6-astra saiu cerca de 7x fim a fim, decisão mediana 213ms contra 2.436ms, ambas as faixas 3 de 3 corretas, o que é real e útil e um longo caminho de 200x. A média de quatro fluxos de trabalho da própria TypeSafe, como AISeeKing leu do gráfico deles, é 67,8% de concordância com as respostas de referência.
O cansaço do hype também é real. O comentário principal, 262 curtidas, em um explicador de 75.750 visualizações que abriu com "Eu genuinamente acredito que poderia ser um divisor de águas" foi "Pode ser minha frase menos favorita de todos os tempos."
E a reação mais afiada em toda a varredura foi de um espectador que assistiu a um explicador completo e saiu de mãos vazias:
Assisti a este vídeo inteiro e ainda não tenho ideia do que o JEV é ou faz.
- Nullzero98, YouTube, 19 curtidas
Esse comentário é a razão pela qual este artigo existe. A regra que resolve isso vem de um desenvolvedor que tem construído dessa forma há anos de qualquer maneira, e cabe em um adesivo: IA executa, código decide.
🔍 Como eu escolhi estes
Onze execuções /last30days através de X, YouTube, Hacker News, Reddit, TikTok, Instagram, Digg, GitHub e arXiv retornaram 716 itens. Eu li cada arquivo bruto por completo, depois abri cada post com tração real e verifiquei seus números contra a página ao vivo, porque os maiores posts sobre um produto de dois dias não estavam onde a busca por palavras-chave esperava. 39 fluxos de trabalho candidatos tinham uma fonte nomeada e um número real. Eu mantive 9. Não mais do que duas escolhas dependem de um único autor ou canal. Cada figura de engajamento é o que o X ou YouTube exibiu no momento da coleta, arredondada exatamente da maneira que eles arredondam.
Sobre o código: quatro cargas úteis são literais. O bloco de triagem de e-mail é o quickstart da própria TypeSafe de seus docs, a forma JSON bruta é dos mesmos docs, e os dois blocos de middleware são copiados do post da LangChain. A linha de instalação de compactação de Alex Volkov é a redação exata dele. Eu escrevi o filtro RAG eu mesmo contra a API documentada na forma que Kush descreveu, e é um rascunho com bons fundamentos em vez de algo que alguém tenha executado em produção.
Embeds são reservados para posts que ganharam atenção. Tudo abaixo de algumas centenas de curtidas é vinculado inline em vez disso, porque um pequeno post ampliado em um cartão de citação só parece evidência.
🔑 Padrões entre as escolhas
- O modelo rápido reage, o modelo lento planeja. Minecraft, a corrida na Wikipedia no thread de lançamento, Browser Use e compactação seguem todos essa mesma divisão.
- Forneça candidatos. Os vencedores nunca pedem para o Jev gerar uma opção. Eles constroem o conjunto de opções no código, a partir do DOM, do recuperador (retriever), do trace da ferramenta, do índice do launcher, e deixam ele escolher.
- Tokens de saída gratuitos estão fazendo mais trabalho do que o número de velocidade. Cada carga de trabalho por linha e por bloco aqui é desbloqueada pelo preço.
- A pontuação de confiança é o produto. Sem um número calibrado para definir um limiar, isso é apenas um classificador rápido. Com um, torna-se uma camada de decisão que sabe quando parar.
- A interface é a invenção, não os pesos. Três clones funcionais em 72 horas, e o maior thread no Reddit é de alguém que publicou a arquitetura há um ano.
- A versão acadêmica chegou primeiro. TabAgent no arXiv faz o mesmo argumento para substituir chamadas de roteamento, gating e verificação por classificadores, sem um produto atrelado.
- A comunidade já cunhou o nome certo para isso. Um desenvolvedor catalogando o que as pessoas estavam lançando chegou a "AI if statement", que são as três palavras mais úteis escritas sobre o modelo até agora.
🧵 O que eu faria com isso
Mantenha o modelo grande para o pensamento difícil e a escrita. Coloque este em cada julgamento barato no loop, defina um limiar baseado na confiança e escale qualquer coisa abaixo de 0.5 para um modelo maior ou para um humano. Instale o plugin de compactação hoje, porque é aquele cujo impacto você sentirá ainda esta noite.
📊 Todos os Agentes Retornaram Dados
Reddit: 113 threads / 24.425 upvotes / 4.159 comentários; X: 314 posts / 30.192 curtidas / 1.538 reposts, além de 13 posts verificados manualmente contra a página ao vivo; YouTube: 75 vídeos / 4.545.636 visualizações; TikTok: 36 vídeos / 171.040 visualizações; Instagram: 14 reels / 10.778 curtidas; Hacker News: 133 histórias / 25.312 pontos / 11.852 comentários; GitHub: 6 repositórios / 842 stars; Digg: 7 clusters / 119 posts; arXiv: 18 papers. Compilado a partir de onze execuções de /last30days em 2026-09-17, contagens brutas entre execuções antes da deduplicação.





