Configuração de Engenharia Agêntica (após mais de 2.000 horas)

@DavidOndrej1
INGLÊS31/08/2026
270K
1.4K
121
46
3.9K

TL;DR

Uma análise profunda de uma stack profissional de programação com IA, detalhando o uso de agentes baseados em nuvem, ambientes VPS e habilidades personalizadas para automatizar tarefas complexas de desenvolvimento de software.

Nos últimos 3 anos, passei bem mais de 2.000 horas programando com IA, e entrevistei pessoalmente algumas das pessoas mais produtivas na área de Engenharia Agentic.

Abaixo está minha configuração completa de Engenharia Agentic no terceiro trimestre de 2026.

Interface

Isso se refere à interface de usuário (UI) / CLI com a qual você interage com os agentes. Minha interface principal é a bb.

É open source, completamente gratuita, e permite que você use qualquer assinatura, qualquer agente, qualquer modelo dentro de uma única interface gráfica. Codex, Claude Code, Pi, Cursor CLI, OpenCode, Grok Build, Hermes, tudo na mesma UI.

O problema com aplicativos como Codex ou Cursor é que eles só permitem seus próprios modelos e suas próprias assinaturas. O objetivo é conseguir o máximo de tokens pelo menor custo possível.

Todos os recursos que você gosta nos aplicativos Codex ou Cursor estão dentro da bb, e ela melhora a cada semana (além disso, é totalmente open source e 100% gratuita).

Outra coisa que uso muito é o cmux.

Quando você inicia um novo workspace no cmux, pode dividir a tela como faria no tmux (daí o nome semelhante), iniciar terminais diferentes em cada painel, e há um navegador integrado.

O ponto fraco do cmux é quando você tem muitos agentes e workspaces. A barra lateral esquerda realmente não é a primitiva ideal. Funciona para algumas coisas, mas para um trabalho sério de engenharia agentic em escala, não é o melhor.

Uso o Ghostty como meu terminal porque é muito rápido e nativo.

Dentro do Ghostty, você pode executar o Herdr, que é basicamente um tmux para agentes, um runtime de backend para agentes. Muito minimalista, muito leve, vive no terminal, e quando um agente termina, seu estado aparece à esquerda: concluído, ocioso, bloqueado, em execução.

Rastrear os estados dos agentes de IA é ESSENCIAL. Minha previsão é que em 3 a 6 meses esse "rastreamento de estado de agente" se torne cada vez mais importante, porque você não estará falando com um único agente. Você estará falando com um agente gerente que gerencia vários agentes trabalhadores.

A última interface que preciso mencionar é o Corral, algo que desenvolvi eu mesmo.

Em vez de alternar aleatoriamente entre agentes quando eles terminam (no Herdr, não há uma ordem real), cada agente tem uma prioridade. Assim como as tarefas têm diferentes níveis de prioridade/importância. Quando um agente P1 termina, ele vai para o topo. Você nunca deve responder a um agente P4 quando um agente P1 terminou de executar. (sim... eu preciso tornar o corral open source. ainda não cheguei lá.)

Modelos e Assinaturas

Você quer o máximo de tokens pelo menor custo possível. Este deve ser um dos principais objetivos de todo Engenheiro Agentic (depois de fazer as coisas acontecerem).

Existem 4 assinaturas principais agora, e sim... isso pode ser completamente diferente daqui a 2 meses.

O melhor "custo-benefício" atualmente é o OpenCode Go. Custa apenas $10 e oferece Kimi K3, Grok 4.6, GLM 5.3, DeepSeek V4 Pro e muitos outros modelos... Mas não tem os melhores modelos como Fable 5 e GPT-5.6 Sol (além disso, os limites de uso são bem pequenos).

Então, se você tem um pouco mais de dinheiro, aqui está o que deve fazer:

  • $30 -- pegue OpenCode Go + ChatGPT Plus ($20)
  • $50 -- Adicione a assinatura do Claude Code ($20) por cima.
  • $70 -- Adicione os $20 mensais do Cursor, e você terá o nível mais baixo de todas as assinaturas.
  • $110 -- OpenCode + um dos planos grandes. O plano de $100 do ChatGPT oferecerá um negócio melhor que o Claude. É o que é. A OpenAI tem mais poder computacional, eles estão dispostos a subsidiar mais.
  • $210 -- Pegue ambos os planos de $100.
  • E se você realmente leva a sério (como eu), pegue todos os planos de $200 (Codex, Claude, Cursor) porque eles têm uso 20x maior, e esses planos oferecem o melhor custo-benefício.

A propósito... o plano do Cursor é muito subestimado. O Cursor, também conhecido como Grok, vai se tornar uma ótima assinatura por causa da aquisição pela SpaceX. A SpaceXAI tem muito poder computacional, então eles podem jogar o jogo de subsidiar. E -- eu acho -- o plano Cursor/Grok oferece limites separados para Cursor + Grok Bot, o que é simplesmente incrível.

O Grok Bot está rapidamente se tornando a nova forma de interagir com agentes, então ter uma assinatura do Cursor nunca foi tão importante (não é patrocinado, é verdade). Além disso, o novo modelo -- Grok 4.7 -- está chegando.

Não importa o que aconteça, não pague o preço da API. É o pior negócio que existe. Apenas adquira as assinaturas.

Agentes na Nuvem

É bastante óbvio que agentes na nuvem são o futuro. Cursor, Amp, Devin, Codex... todas essas empresas estão apostando tudo em Agentes na Nuvem.

A prova de que agentes na nuvem são o futuro é o gráfico abaixo.

[imagem aqui]

Esta é a participação interna do Cursor de PRs mesclados de agentes na nuvem: cerca de 10-15% no início deste ano, aproximando-se de 60% agora. E isso são PRs mesclados, o material que realmente é usado. Em breve, isso será 70%, depois 80% e depois 90%.

O problema de executar todos os agentes localmente, na sua máquina, é que não é escalável. Você não pode executar centenas de agentes ao mesmo tempo. Basta alguns agentes decidirem executar todo o seu conjunto de testes ao mesmo tempo e seu computador começará a fazer barulhos estranhos (até meu MacBook Pro de $7.000 sofre).

Agentes na Nuvem oferecem ambientes isolados, sessões persistentes, acesso durável à internet e eletricidade. Se você fechar seu laptop, perde suas sessões. Se perder a internet por alguns minutos, os harnesses não conseguem se recuperar sozinhos.

O problema com as soluções existentes de agentes na nuvem é o nível INSANO de dependência do ecossistema. Configurar os ambientes e todos os seus segredos leva muitas horas, e então você fica preso: suas sessões estão lá, você está na precificação deles e dá a eles todos os seus dados. Mesmo que eles não treinem modelos com eles, há muitas outras maneiras de usar seus dados.

A solução é ter seu próprio servidor. E graças à IA, isso leva cerca de 10 minutos para configurar (sério). Basta pegar um VPS, executar o Herdr nele e conectar-se via SSH.

O Herdr oferece sessões de agente persistentes, e o SSH permite que você se conecte do seu celular, do seu laptop, de qualquer coisa. Você pode literalmente alcançar 80/20 dos agentes na nuvem por alguns dólares, sem a dependência.

Construa seu próprio ambiente na nuvem

Eu uso a Hostinger para meus VPSs, e um plano KVM2 é suficiente. Aqui está o principal que quero transmitir... você não precisa ser um especialista em VPSs, DevOps, Linux, nada disso.

Apenas converse com seu agente em português claro!!!

No próximo vídeo, eu configuro tudo ao vivo. Um workspace cmux, um agente de codificação no painel esquerdo (Cursor CLI executando Grok 4.6), um painel de terminal vazio à direita.

Minha habilidade cmux permite que o agente encontre aquele outro painel e execute comandos nele. Eu mesmo fiz SSH no VPS novo, depois disse ao agente "aprenda tudo sobre aquele servidor e configure o ambiente de desenvolvimento. Herdr, Node.js, Python 3, Git".

Ele analisou o VPS em segundos, instalou tudo, iniciou o Herdr, depois instalou o Pi Agent, encontrou uma chave OpenRouter no meu MacBook e passou por toda a configuração sozinho. Com alguns prompts curtos depois, eu tinha o Pi executando GPT-5.6 Sol e uma segunda sessão executando Fable, ambos na nuvem, no meu próprio VPS, com acesso root completo.

Se algo acontecer com meu computador ou wifi... Se meu MacBook explodir, esses agentes continuam rodando. O passo a passo completo está no vídeo. Link para meu YouTube aqui.

Mais uma dica de velocidade... eu dito com o SuperWhisper. A maioria de vocês que está lendo isso provavelmente digita a 40 ou 50 palavras por minuto. Isso é muito lento.

MAS! você pode falar a mais de 250 PPM. Uma ferramenta de IA de voz (como Superwhisper, Glaido, Whispr Flow) instantaneamente te torna 3-4x mais rápido ao enviar prompts. Use uma. Não seja burro.

Harness

O primeiro harness que preciso mencionar é o Pi Agent, o GOAT.

O harness mais minimalista que existe: apenas 4 ferramentas, sempre roda em modo YOLO, suporta qualquer modelo, qualquer provedor. Muito elegante, super configurável, e é por isso que tantas pessoas constroem em cima do Pi. É open source, completamente gratuito, basta ir em pi.dev e pegá-lo. Inegociável. É o primeiro harness que coloco no VPS.

Cursor CLI. Muito subestimado, porque você pode usar todos os modelos: Grok, modelos GPT, modelos Anthropic, Kimi. Você pode marcar skills e pode pré-enviar mensagens. Ótimo harness no geral.

A próxima categoria de Harnesses é o que gosto de chamar de harnesses "auto-melhoráveis".

Os dois mais populares são Hermes Agent e Prime Agent. Isso é para quando você não sabe o que está fazendo. Se uma tarefa tem muita incerteza, muito a ser descoberto, use um harness auto-melhorável, porque ele cria skills e melhora com você ao longo do tempo.

E, finalmente, os clássicos, Claude Code e Codex. Eu os tenho como aliases. Muita gente digita claude --dangerously-skip-permissions todos os dias. Extremamente lento, extremamente ineficiente. Eu digito cc e ele inicia o Claude Code com permissões ignoradas; cx inicia o Codex em modo YOLO.

VOCÊ DEVE criar aliases globais para os comandos longos que executa com frequência. Essa é uma das leis da engenharia agentic: Como você pode fazer mais no mesmo período de tempo?

Skills

Meu repositório de skills viralizou no mês passado. (veja github.com/davidondrej/skills) Também é completamente gratuito, open source, tudo isso.

As SKILLs mais relevantes para Engenharia Agentic são:

(1) /total-review

  • Executa duas outras skills, /gpt-review e /fable-review, que revisam quaisquer alterações de código que você acabou de fazer com GPT-5.6 Sol e Fable 5, depois deduplica ambas as listas em uma única lista dos problemas que realmente importam. É como pedir a todos os seus amigos mais inteligentes para revisar sua candidatura a um emprego, e eles só te dão os maiores problemas. Execute em alterações médias a grandes, especialmente se um modelo diferente as construiu. Se o Grok 4.6 fez o trabalho, você quer um modelo totalmente diferente revisando-o.

IMPORTANTE: qualquer coisa que você repita com frequência suficiente deve se tornar um preset.

Se for uma única etapa, use substituições de texto. Eu as tenho como snippets do Raycast. "Responda em resumo em português claro." "Torne sua resposta anterior mais simples e mais curta." "Adicione todos os arquivos ao stage, escreva um commit claro, faça push para o GitHub."

Se for um fluxo de trabalho de várias etapas, transforme-o em uma skill.

(2) /ask-then-build

  • Uso esta skill todos os dias, antes de qualquer construção. Em vez de dizer "torne isso compatível com Windows" e deixar o modelo fazer silenciosamente escolhas arquiteturais importantes que você pode lamentar depois, ela te guia pelas principais decisões uma de cada vez, com opções. Modelos de IA são ótimos para codificar, ótimos para implementação. Eles não têm bom gosto. Eles não têm bom julgamento. Você, como humano, precisa permanecer no controle disso.

(3) /deepapi

  • Esta skill é o que uso para qualquer pesquisa aprofundada, qualquer scraping, qualquer coisa na web. Codex e Claude Code vêm com pesquisa web básica, mas sem scraping, sem pesquisa aprofundada, e eles são facilmente bloqueados. Execute 8 pesquisas web rápidas e me dê as 3 melhores opções, faça scraping no Twitter, faça scraping no GitHub, encontre 3 maneiras de contatar uma pessoa. Todos na minha equipe usam. Item obrigatório.

(4) Guardrails e push lock

  • Mais chato, mas absolutamente essencial, e você só configura uma vez. Guardrails globais de agente são um hook pré-chamada de ferramenta que garante que seus agentes nunca limpem seu disco, nunca sobrescrevam o histórico do Git, nunca toquem em seu gerenciador de senhas. E push lock, para quando você está executando 15+ agentes em paralelo: um bloqueio de kernel a nível de SO em todo o sistema. Merge, verifique, faça push, CI, deploy, health check.

Não instale todas as minhas skills. Apenas pegue as que você precisa.

Worktrees

Uma worktree é basicamente uma cópia do seu checkout principal em uma pasta separada e cria um novo branch Git lá, para que os agentes possam trabalhar em paralelo, completamente isolados.

Em um projeto pequeno, isso é absolutamente exagerado. Fique em um único branch e trabalhe mais rápido.

Em projetos médios a grandes, onde você está executando 20-30+ agentes o tempo todo, não há como evitar. Sem worktrees, os agentes entrarão em conflito, reverterão as alterações uns dos outros e lutarão entre si. Outra coisa boa sobre o BB: ele tem worktrees integradas. Ele lembra que nos meus repositórios grandes eu sempre quero uma nova worktree baseada em origin/main.

Outras Dicas de Engenharia Agentic

Saiba quando usar cada modelo.

  • Projetando um plano ou iniciando um novo projeto? Fable. Tem mais faíscas de genialidade. Corrigindo um bug profundo e sério? GPT-5.6 Sol, esforço de raciocínio máximo. Conversa padrão? Grok 4.6 no alto. Quase a mesma inteligência, mas 2x mais barato e 2x mais rápido. Front-end? Kimi K3.
  • E quando um novo modelo importante for lançado, reserve um dia onde você use apenas aquele modelo. Não ouça o Twitter. Experimente você mesmo.

Saiba quando revisar.

  • Não estou executando total review em cada alteração. Um pequeno ajuste de front-end vai para produção imediatamente.
  • E NUNCA faça revisões recursivas. Se você disser a um modelo "encontre os 5 maiores problemas", ele encontrará 5 problemas mesmo que o código esteja perfeitamente bom. Esses modelos inventam bugs imaginários.

Pré-envio.

  • Geralmente sei o que o agente fará em seguida, então enfileiro as mensagens com antecedência: "implemente o plano", "execute a revisão Fable nisso", "agora corrija essas coisas".
  • Às vezes são 2 mensagens, às vezes 6.
  • Nunca use um harness que não permita pré-envio.

Subagentes são superutilizados.

  • Muita gente apenas queima seus limites com eles. Eu os uso quando estou no controle. Quero selecionar qual modelo é executado no subagente, porque sei quais assinaturas e limites tenho.
  • O futuro é um agente gerente lançando trabalhadores, mas você ainda precisa projetar esse sistema: as regras, as permissões, as condições em que um subagente é lançado. Não quero que algum cara da Anthropic ou OpenAI decida isso por mim.

ADRs.

  • É assim que você coloca decisões em um código. /docs/adr é uma das primeiras pastas que crio em qualquer projeto.
  • Toda decisão arquitetural central recebe um arquivo curto: o que foi decidido, por que, e qual era o estado do projeto na época. Algumas coisas podem ser lidas a partir do código, mas nem tudo.
  • O que não pode deve ser documentado, para que futuros agentes e humanos entendam instantaneamente por que foi construído dessa forma.

Testes.

  • Os modelos atuais INCHAM seu repositório com testes: testes unitários, testes de integração, testes de banco de dados, mesmo nos menores repositórios onde não faz sentido.
  • Se você disser ao modelo para adicionar testes, ele adiciona uma quantidade insana. Se você disser "não adicione testes", ele ainda adiciona alguns, e você chega na quantidade certa.

Acesso ao banco de dados de produção.

  • Qualquer produto com uso real precisa fazer isso... crie uma função Postgres somente leitura e dê-a aos seus agentes.
  • Não dê a eles acesso de escrita. Basta uma alteração irreversível e você vai se arrepender.
  • Mas nenhum acesso também é um erro. Com acesso somente leitura, você pode verificar a realidade de cada recurso. Isso realmente acontece em produção? As pessoas estão realmente usando isso? Eu gostaria de ter feito isso antes.

Acompanhe sua produtividade agentic.

  • Acabamos de lançar um novo repositório open source sob o Vectal Labs chamado agentic-productivity. Ele rastreia seus commits, suas sessões de agente e seus prompts de usuário.
  • Cada um é uma métrica ruim por si só, mas combine os 3 e observe a tendência de longo prazo, e você pode ver se está realmente se tornando um engenheiro agentic melhor.

Essa é a configuração no momento. Daqui a um mês, provavelmente será diferente. Isso muda o tempo todo.

por David Ondrej (falado para o YouTube, depois reescrito para formato de artigo)

Guardar com um clique

Faça leitura aprofundada de artigos virais com IA no YouMind

Guarde a fonte, faça perguntas específicas, resuma o argumento e transforme um artigo viral em notas reutilizáveis num único espaço de trabalho com IA.

Explorar o YouMind
Para criadores

Transforme o seu Markdown num artigo 𝕏 impecável

Quando publica os seus próprios textos longos, formatar imagens, tabelas e blocos de código para o 𝕏 é uma dor de cabeça. O YouMind transforma um rascunho completo em Markdown num artigo 𝕏 impecável e pronto a publicar.

Experimente Markdown para 𝕏

Mais padrões para decifrar

Artigos virais recentes

Explorar mais artigos virais