Nos últimos 3 anos, passei bem mais de 2.000 horas programando com IA, e entrevistei pessoalmente algumas das pessoas mais produtivas na área de Engenharia Agentiva.
Abaixo está minha configuração completa de Engenharia Agentiva no terceiro trimestre de 2026.
Interface
Isso significa a IU / CLI de como você interage com os agentes. Minha interface principal é a bb.
É open source, completamente gratuita, e permite que você use qualquer assinatura, qualquer agente, qualquer modelo dentro de uma única GUI. Codex, Claude Code, Pi, Cursor CLI, OpenCode, Grok Build, Hermes, tudo na mesma IU.
O problema com aplicativos como Codex ou Cursor é que eles só permitem seus próprios modelos e sua própria assinatura. O objetivo é conseguir o máximo de tokens pelo menor custo possível.
Todos os recursos que você gosta nos aplicativos Codex ou Cursor estão dentro da bb, e ela está melhorando a cada semana (além disso, é totalmente open source e 100% gratuita para usar).
Outra coisa que uso muito é o cmux.
Quando você inicia um novo workspace no cmux, pode dividir a tela exatamente como faria no tmux (daí o nome semelhante), iniciar terminais diferentes em cada painel, e há um navegador integrado.
Onde o cmux falha é quando você tem muitos agentes e workspaces. A barra lateral esquerda realmente não é a primitiva certa. Funciona para algumas coisas, mas para um trabalho sério de engenharia agentiva em escala, não é o ideal.
Uso o Ghostty como meu terminal porque é muito rápido e nativo.
Dentro do Ghostty, você pode executar o Herdr, que é basicamente um tmux, mas para agentes, um runtime de backend para agentes. Muito minimalista, muito leve, vive no terminal, e quando um agente termina, seu estado aparece à esquerda: concluído, ocioso, bloqueado, em execução.
Rastrear os estados dos agentes de IA é ESSENCIAL. Minha previsão é que em 3 a 6 meses esse "rastreamento de estado de agente" se torne cada vez mais importante, porque você não estará falando com um único agente. Você estará falando com um agente gerente que gerencia muitos agentes trabalhadores.
A última interface que tenho que mencionar é o Corral, algo que desenvolvi eu mesmo.
Em vez de alternar aleatoriamente entre agentes quando eles terminam (no Herdr, não há uma ordem real), cada agente tem uma prioridade. Assim como as tarefas têm diferentes níveis de prioridade/importância. Quando um agente P1 termina, ele vai para o topo. Você nunca deve responder a um agente P4 quando um agente P1 terminou de executar. (sim... eu preciso tornar o corral open source. Ainda não cheguei lá.)
Modelos e Assinaturas
Você quer o máximo de tokens pelo menor custo possível. Este deve ser um dos principais objetivos de todo Engenheiro Agentivo (depois de fazer as coisas acontecerem).
Existem 4 assinaturas principais agora, e sim... isso pode ser completamente diferente daqui a 2 meses.
O melhor "custo-benefício" atualmente é o OpenCode Go. Custa apenas $10, e te dá Kimi K3, Grok 4.6, GLM 5.3, DeepSeek V4 Pro, e muitos outros modelos... Mas não tem os melhores modelos como Fable 5 e GPT-5.6 Sol (além disso, os limites de uso são bem pequenos).
Então, se você tem um pouco mais de dinheiro, aqui está o que deve fazer:
- $30 -- pegue OpenCode Go + ChatGPT Plus ($20)
- $50 -- Adicione a assinatura do Claude Code ($20) por cima.
- $70 -- Adicione os $20 por mês do Cursor, e você tem o nível mais baixo de todas as assinaturas.
- $110 -- OpenCode + um dos planos grandes. O plano de $100 do ChatGPT te dará um negócio melhor que o Claude. É o que é. A OpenAI tem mais poder computacional, eles estão dispostos a subsidiar mais.
- $210 -- Pegue ambos os planos de $100.
- E se você realmente leva a sério (como eu), pegue todos os planos de $200 (Codex, Claude, Cursor) porque esses têm 20x mais uso, e esses planos te oferecem o melhor negócio.
A propósito... o plano do Cursor é muito subestimado. O Cursor, também conhecido como Grok, vai se tornar uma ótima assinatura por causa da aquisição pela SpaceX. A SpaceXAI tem muito poder computacional, então eles podem jogar o jogo de subsidiar. E -- eu acho -- o plano Cursor/Grok te dá limites separados para o Cursor + Grok Bot, o que é simplesmente incrível.
O Grok Bot está rapidamente se tornando a nova forma de as pessoas interagirem com agentes, então ter uma assinatura do Cursor nunca foi tão importante (não é patrocinado lol, é só a verdade). Além disso, o novo modelo -- Grok 4.7 -- está chegando.
Não importa o que aconteça, não pague o preço da API. É o pior negócio que existe. Apenas pegue as assinaturas.
Agentes na Nuvem
É bastante óbvio que os agentes na nuvem são o futuro. Cursor, Amp, Devin, Codex... todas essas empresas estão apostando tudo em Agentes na Nuvem.
A prova de que os agentes na nuvem são o futuro está no gráfico abaixo.
[imagem aqui]
Esta é a participação interna da Cursor de PRs mesclados de agentes na nuvem: cerca de 10-15% no início deste ano, se aproximando de 60% agora. E isso são PRs mesclados, o material que realmente é usado. Em breve isso será 70%, depois 80% e depois 90%.
O problema de executar todos os agentes localmente, na sua máquina, é que não é escalável. Você não pode executar centenas de agentes ao mesmo tempo. Basta alguns agentes decidirem executar todo o seu conjunto de testes ao mesmo tempo e seu computador começará a fazer barulhos estranhos (até mesmo meu macbook pro de $7.000 sofre).
Agentes na Nuvem te fornecem ambientes isolados, sessões persistentes, acesso durável à internet e eletricidade. Se você fechar seu laptop, perde suas sessões. Perder a internet por alguns minutos, e os harnesses não conseguem se recuperar sozinhos.
O problema com as soluções existentes de agentes na nuvem é o nível INSANO de aprisionamento ao ecossistema. Configurar os ambientes e todos os seus segredos leva muitas horas, e então você fica preso: suas sessões estão lá, você está no modelo de preços deles, e dá a eles todos os seus dados. Mesmo que eles não treinem modelos com isso, existem muitas outras maneiras de usar seus dados.
A solução é ter seu próprio servidor. E graças à IA, isso leva cerca de 10 minutos para configurar (sério). Basta pegar um VPS, executar o Herdr nele, e conectar via SSH.
O Herdr te dá sessões de agente persistentes, e o SSH permite que você se conecte do seu celular, do seu laptop, de qualquer coisa. Você pode literalmente alcançar os 80/20 dos agentes na nuvem por alguns dólares, sem o aprisionamento.
Construa seu próprio ambiente na Nuvem
Eu uso a Hostinger para meus VPSs, e um plano KVM2 é suficiente. Aqui está o principal que quero transmitir... você não precisa ser um especialista em VPSs, DevOps, Linux, nada disso.
Apenas converse com seu agente em português claro!!!
No próximo vídeo, eu configuro tudo ao vivo. Um workspace cmux, um agente de codificação no painel esquerdo (Cursor CLI executando Grok 4.6), um painel de terminal vazio à direita.
Minha habilidade cmux permite que o agente encontre aquele outro painel e execute comandos nele. Eu mesmo fiz SSH no VPS novo, então disse ao agente "aprenda tudo sobre aquele servidor e configure o ambiente de desenvolvimento. Herdr, Node.js, Python 3, Git".
Ele analisou o VPS em segundos, instalou tudo, iniciou o Herdr, depois instalou o Pi Agent, encontrou uma chave OpenRouter no meu macbook, e passou por toda a configuração sozinho. Alguns prompts curtos depois, eu tinha o Pi executando GPT-5.6 Sol e uma segunda sessão executando Fable, ambos na nuvem, no meu próprio VPS, com acesso root completo.
Se algo acontecer com meu computador ou wifi... Se meu MacBook explodir, esses agentes continuam rodando. O passo a passo completo está no vídeo. Link para meu YouTube aqui.
Mais uma dica de velocidade... Eu dito com o SuperWhisper. A maioria de vocês lendo isso provavelmente digita a 40 ou 50 palavras por minuto. Isso é muito lento.
MAS! você pode falar a mais de 250 PPM. Uma ferramenta de IA de voz (como Superwhisper, Glaido, Whispr FLow) instantaneamente te torna 3-4x mais rápido ao enviar prompts. Use uma. Não seja burro.
Harness
O primeiro harness que preciso mencionar é o Pi Agent, o GOAT.
O harness mais minimalista que existe: apenas 4 ferramentas, sempre roda em modo YOLO, suporta qualquer modelo, qualquer provedor. Muito elegante, super configurável, e é por isso que tantas pessoas constroem em cima do Pi. É open source, completamente gratuito, basta ir em pi.dev e pegar. Inegociável. É o primeiro harness que coloco no VPS.
Cursor CLI. Muito subestimado, porque você pode usar todos os modelos: Grok, modelos GPT, modelos Anthropic, Kimi. Você pode marcar habilidades, e pode pré-enviar mensagens. Ótimo harness no geral.
A próxima categoria de Harnesses é o que gosto de chamar de harnesses "auto-melhoráveis".
Os dois mais populares são Hermes Agent e Prime Agent. Isso é para quando você não sabe o que está fazendo. Se uma tarefa tem muita incerteza, muito a ser descoberto, use um harness auto-melhorável, porque ele cria habilidades e melhora com você ao longo do tempo.
E, finalmente, os clássicos, Claude Code e Codex. Eu os tenho como aliases. Muita gente digita claude --dangerously-skip-permissions todos os dias. Extremamente lento, extremamente ineficiente. Eu digito cc e ele inicia o Claude Code com permissões ignoradas; cx inicia o Codex em modo YOLO.
VOCÊ DEVE criar aliases globais para os comandos longos que executa com frequência. Essa é uma das leis da engenharia agentiva: Como você pode fazer mais na mesma quantidade de tempo?
Habilidades
Meu repositório de habilidades viralizou no mês passado. (veja github.com/davidondrej/skills) Também é completamente gratuito, open source, tudo isso.
As HABILIDADES mais relevantes para Engenharia Agentiva são:
(1) /total-review
- Executa duas outras habilidades, /gpt-review e /fable-review, que revisam quaisquer alterações de código que você acabou de fazer com GPT-5.6 Sol e Fable 5, então deduplica ambas as listas em uma única lista dos problemas que realmente importam. É como pedir para todos os seus amigos mais inteligentes revisarem sua candidatura a um emprego, e eles só te dão os maiores problemas. Execute em alterações médias a grandes, especialmente se um modelo diferente as construiu. Se o Grok 4.6 fez o trabalho, você quer um modelo totalmente diferente revisando-o.
IMPORTANTE: qualquer coisa que você repita com frequência suficiente deve se tornar um preset.
Se for uma única etapa, use substituições de texto. Eu as tenho como snippets do Raycast. "Responda em resumo em português claro." "Torne sua resposta anterior mais simples e curta." "Adicione todos os arquivos ao stage, escreva um commit claro, faça push para o GitHub."
Se for um fluxo de trabalho de várias etapas, transforme-o em uma habilidade.
(2) /ask-then-build
- Eu uso essa habilidade todos os dias, antes de qualquer construção. Em vez de dizer "torne isso compatível com Windows" e deixar o modelo fazer silenciosamente escolhas arquiteturais importantes que você pode se arrepender depois, ela te guia pelas principais decisões uma de cada vez, com opções. Modelos de IA são ótimos para codificar, ótimos para implementação. Eles não têm bom gosto. Eles não têm bom julgamento. Você, como humano, precisa manter o controle disso.
(3) /deepapi
- Essa habilidade é o que uso para qualquer pesquisa aprofundada, qualquer raspagem de dados, qualquer coisa na web. Codex e Claude Code vêm com pesquisa web básica, mas sem raspagem, sem pesquisa aprofundada, e são facilmente bloqueados. Execute 8 pesquisas web rápidas e me dê as 3 melhores opções, raspe o Twitter, raspe o GitHub, encontre 3 formas de contatar uma pessoa. Todos na minha equipe usam. Item obrigatório.
(4) Guardrails e push lock
- Mais chato, mas absolutamente essencial, e você só configura uma vez. Guardrails globais de agente é um hook pré-chamada de ferramenta que garante que seus agentes nunca limpem seu disco, nunca sobrescrevam o histórico do Git, nunca toquem em seu gerenciador de senhas. E push lock, para quando você está executando 15+ agentes em paralelo: um bloqueio de kernel a nível de SO em todo o sistema. Merge, verificar, push, CI, deploy, health check.
Não instale todas as minhas habilidades. Apenas pegue as que você precisa.
Worktrees
Uma worktree é basicamente uma cópia do seu checkout principal em uma pasta separada e cria um novo branch Git lá, para que os agentes possam trabalhar em paralelo, completamente isolados.
Em um projeto pequeno, isso é completamente exagerado. Fique em um único branch e trabalhe mais rápido.
Em projetos médios a grandes onde você está executando 20-30+ agentes o tempo todo, não há como evitar. Sem worktrees, os agentes entrarão em conflito, reverterão as alterações uns dos outros e lutarão entre si. Outra coisa boa sobre o BB: ele tem worktrees embutidas. Ele lembra que nos meus repositórios grandes eu sempre quero uma nova worktree baseada em origin/main.
Outras Dicas de Engenharia Agentiva
Saiba quando usar cada modelo.
- Projetando um plano ou iniciando um novo projeto? Fable. Tem mais faíscas de genialidade. Corrigindo um bug profundo e sério? GPT-5.6 Sol, esforço máximo de raciocínio. Conversa padrão? Grok 4.6 no alto. Quase a mesma inteligência, mas 2x mais barato e 2x mais rápido. Front-end? Kimi K3.
- E quando um novo modelo importante for lançado, reserve um dia onde você use apenas aquele modelo. Não ouça o Twitter. Experimente você mesmo.
Saiba quando revisar.
- Não estou executando revisão total em cada alteração. Um pequeno ajuste de front-end vai para produção imediatamente.
- E NUNCA faça revisões recursivas. Se você disser a um modelo "encontre os 5 maiores problemas", ele encontrará 5 problemas mesmo que a base de código esteja perfeitamente bem. Esses modelos inventam bugs imaginários.
Pré-envio.
- Geralmente eu sei o que o agente fará em seguida, então eu enfileiro as mensagens com antecedência: "implemente o plano", "execute a revisão Fable nisso", "agora corrija essas coisas".
- Às vezes são 2 mensagens, às vezes 6.
- Nunca use um harness que não permita pré-enviar.
Subagentes são superutilizados.
- Muita gente apenas queima seus limites com eles. Eu os uso quando estou no controle. Quero selecionar qual modelo é executado no subagente, porque sei quais assinaturas e limites tenho.
- O futuro é um agente gerente lançando trabalhadores, mas você ainda precisa projetar esse sistema: as regras, as permissões, as condições em que um subagente é lançado. Não quero que algum cara da Anthropic ou OpenAI decida isso por mim.
ADRs.
- É assim que você coloca decisões em uma base de código. /docs/adr é uma das primeiras pastas que crio em qualquer projeto.
- Toda decisão arquitetural central recebe um arquivo curto: o que foi decidido, por que, e qual era o estado do projeto na época. Algumas coisas podem ser lidas a partir do código, mas nem tudo.
- O que não pode deve ser documentado, para que futuros agentes e humanos entendam instantaneamente por que foi construído dessa forma.
Testes.
- Os modelos atuais INCHAM seu repositório com testes: testes unitários, testes de integração, testes de banco de dados, mesmo nos menores repositórios onde não faz sentido.
- Se você disser ao modelo para adicionar testes, ele adiciona uma quantidade insana. Se você disser "não adicione testes", ele ainda adiciona alguns, e você chega na quantidade certa.
Acesso ao BD de produção.
- Qualquer produto com uso real precisa fazer isso... crie um papel Postgres somente leitura e dê isso aos seus agentes.
- Não dê a eles acesso de escrita. Basta uma alteração irreversível e você vai se arrepender.
- Mas nenhum acesso também é um erro. Com acesso somente leitura, você pode verificar a realidade de cada funcionalidade. Isso realmente acontece em produção? As pessoas estão realmente usando isso? Eu gostaria de ter feito isso antes.
Acompanhe sua produtividade agentiva.
- Acabamos de lançar um novo repositório open source sob o Vectal Labs chamado agentic-productivity. Ele rastreia seus commits, suas sessões de agente e seus prompts de usuário.
- Cada um é uma métrica ruim por si só, mas combine os 3 e olhe a tendência de longo prazo, e você pode ver se está realmente se tornando um engenheiro agentivo melhor.
Essa é a configuração no momento. Em um mês, provavelmente será diferente. Isso muda o tempo todo.
por David Ondrej (falado para o YouTube, depois reescrito para formato de artigo)





