Negli ultimi 3 anni, ho passato ben oltre 2.000 ore a programmare con l'AI, e ho intervistato personalmente alcune delle persone più produttive nel campo dell'Ingegneria Agentica.
Qui di seguito trovi la mia configurazione completa di Ingegneria Agentica, così com'è attualmente, nel terzo trimestre del 2026.
Interfaccia
Con questo intendo l'interfaccia UI/CLI con cui interagisci con gli agenti. La mia interfaccia principale è bb.
È open source, completamente gratuita, e ti permette di usare qualsiasi abbonamento, qualsiasi agente, qualsiasi modello all'interno di un'unica GUI. Codex, Claude Code, Pi, Cursor CLI, OpenCode, Grok Build, Hermes, tutto nella stessa UI.
Il problema con app come Codex o Cursor è che permettono solo i propri modelli e il proprio abbonamento. L'obiettivo è ottenere il maggior numero di token al minor costo possibile.
Tutte le funzionalità che ti piacciono delle app Codex o Cursor sono dentro bb, e migliora ogni singola settimana (inoltre, è completamente open source e 100% gratuito da usare).
Un'altra cosa che uso molto è cmux.
Quando avvii un nuovo workspace cmux, puoi dividere lo schermo proprio come faresti in tmux (da qui il nome simile), avviare terminali diversi in ogni riquadro, e c'è un browser integrato.
Dove cmux vacilla è quando hai molti agenti e workspace. La barra laterale sinistra non è proprio il metodo giusto. Va bene per un paio di cose in corso, ma per un lavoro di ingegneria agentica su larga scala non è il massimo.
Uso Ghostty come terminale perché è molto veloce e nativo.
Dentro Ghostty, puoi eseguire Herdr, che è fondamentalmente tmux ma per agenti, un runtime backend per agenti. Molto minimale, molto leggero, vive nel terminale, e quando un agente finisce, il suo stato appare a sinistra: completato, inattivo, bloccato, in esecuzione.
Tenere traccia degli stati degli agenti AI è FONDAMENTALE. La mia previsione è che tra 3 e 6 mesi questo "tracciamento dello stato degli agenti" diventerà sempre più importante, perché non parlerai con un singolo agente. Parlerai con un agente manager che gestisce molti agenti lavoratori.
L'ultima interfaccia che devo menzionare è Corral, qualcosa che ho sviluppato io stesso.
Invece di passare casualmente da un agente all'altro quando finiscono (in Herdr non c'è un vero ordine), ogni agente ha una priorità. Proprio come i compiti hanno diversi livelli di priorità/importanza. Quando un agente P1 finisce, va in cima. Non dovresti mai rispondere a un agente P4 quando un agente P1 ha finito di eseguire. (sì... devo rendere open source Corral. Non ci sono ancora arrivato.)
Modelli e Abbonamenti
Vuoi il maggior numero di token al minor costo possibile. Questo dovrebbe essere uno degli obiettivi principali di ogni Ingegnere Agentico (dopo aver portato a termine le cose).
Ci sono 4 abbonamenti principali in questo momento, e sì... potrebbe essere completamente diverso tra 2 mesi.
Il miglior rapporto qualità-prezzo in questo momento è OpenCode Go. Costa solo $10, e ti dà Kimi K3, Grok 4.6, GLM 5.3, DeepSeek V4 Pro, e molti altri modelli... Ma non ha i modelli migliori come Fable 5 e GPT-5.6 Sol (inoltre, i limiti di utilizzo sono piuttosto bassi).
Quindi, se hai un po' più di soldi, ecco cosa dovresti fare:
- $30 -- prendi OpenCode Go + ChatGPT Plus ($20)
- $50 -- Aggiungi l'abbonamento Claude Code da $20.
- $70 -- Aggiungi Cursor a $20 al mese, e hai il livello più basso di tutti gli abbonamenti.
- $110 -- OpenCode + uno dei piani grandi. Il piano ChatGPT da $100 ti darà un affare migliore di Claude. È così. OpenAI ha più potenza di calcolo, sono disposti a sussidiarla di più.
- $210 -- Prendi entrambi i piani da $100.
- E se fai davvero sul serio (come me) prendi tutti i piani da $200 (Codex, Claude, Cursor) perché quelli hanno un utilizzo 20x, e questi piani ti danno il miglior affare.
tra l'altro... il piano Cursor è molto sottovalutato. Cursor, alias Grok, diventerà un grande abbonamento grazie all'acquisizione di SpaceX. SpaceXAI ha un sacco di potenza di calcolo, quindi possono giocare al gioco dei sussidi. E -- credo -- il piano Cursor/Grok ti dà limiti separati per Cursor + Grok Bot, il che è semplicemente incredibile.
Grok Bot sta rapidamente diventando il nuovo modo in cui le persone interagiscono con gli agenti, quindi avere un abbonamento Cursor non è mai stato così importante (non sponsorizzato lol, è semplicemente vero). Inoltre, il nuovo modello -- Grok 4.7 -- è dietro l'angolo.
In ogni caso, non pagare i prezzi API. È l'affare peggiore in circolazione. Prendi semplicemente gli abbonamenti.
Agenti Cloud
È abbastanza ovvio che gli agenti cloud sono il futuro. Cursor, Amp, Devin, Codex... tutte queste aziende stanno puntando tutto sugli Agenti Cloud.
La prova che gli agenti cloud sono il futuro è il grafico qui sotto.
[immagine qui]
Questa è la quota interna di Cursor delle PR unite dagli agenti cloud: circa il 10-15% all'inizio di quest'anno, che ora si avvicina al 60%. E queste sono PR unite, la roba che viene effettivamente utilizzata. Presto sarà il 70%, poi l'80% e poi il 90%.
Il problema di eseguire tutti gli agenti localmente, sulla tua macchina, è che non è scalabile. Non puoi eseguire centinaia di agenti contemporaneamente. Basta che un paio di agenti decidano di eseguire l'intera suite di test contemporaneamente e il tuo computer inizierà a fare rumori strani (anche il mio MacBook Pro da $7.000 fa fatica).
Gli Agenti Cloud ti danno ambienti isolati, sessioni persistenti, accesso durevole a internet ed elettricità. Se chiudi il portatile, perdi le sessioni. Perdi internet per un paio di minuti, e le imbracature non possono auto-recuperarsi.
Il problema con le soluzioni di agenti cloud esistenti è l'incredibile livello di blocco dell'ecosistema. Configurare gli ambienti e tutti i tuoi segreti richiede molte ore, e poi sei bloccato: le tue sessioni sono lì, sei sui loro prezzi, e dai loro tutti i tuoi dati. Anche se non addestrano modelli su di essi, ci sono molti altri modi per usare i tuoi dati.
La soluzione è avere il tuo server. E grazie all'AI, ci vogliono circa 10 minuti per configurarlo (sul serio). Prendi un VPS, esegui Herdr su di esso, e connettiti via SSH.
Herdr ti dà sessioni agente persistenti, e SSH ti permette di connetterti dal tuo telefono, dal tuo portatile, qualsiasi cosa. Puoi letteralmente ottenere l'80/20 degli agenti cloud per un paio di dollari, senza il blocco.
Costruisci il tuo ambiente Cloud
Io uso Hostinger per i miei VPS, e un piano KVM2 è sufficiente. Ecco la cosa principale che voglio far capire... non hai bisogno di essere un esperto di VPS, DevOps, Linux, niente di tutto questo.
Parla e basta con il tuo agente in inglese semplice!!!
Nel prossimo video, configuro il tutto dal vivo. Un workspace cmux, un agente di codifica nel riquadro sinistro (Cursor CLI che esegue Grok 4.6), un riquadro terminale vuoto a destra.
La mia abilità cmux permette all'agente di trovare quell'altro riquadro ed eseguire comandi al suo interno. Mi sono connesso via SSH al VPS nuovo di zecca, poi ho detto all'agente "impara tutto su quel server e configura l'ambiente di sviluppo. Herdr, Node.js, Python 3, Git".
Ha analizzato il VPS in secondi, ha installato tutto, ha avviato Herdr, poi ha installato Pi Agent, ha trovato una chiave OpenRouter sul mio MacBook, e ha completato l'intera configurazione da solo. Pochi brevi prompt dopo, avevo Pi che eseguiva GPT-5.6 Sol e una seconda sessione che eseguiva Fable, entrambi nel cloud, sul mio VPS, con accesso root completo.
Se succede qualcosa al mio computer o al wifi... Se il mio MacBook esplode, quegli agenti continuano a funzionare. La procedura completa è nel video. Link al mio YouTube qui.
Un altro consiglio sulla velocità... dettare con SuperWhisper. Molti di voi che leggete probabilmente scrivono a 40 o 50 parole al minuto. È molto lento.
MA! puoi parlare a oltre 250 PAM. Uno strumento AI vocale (come Superwhisper, Glaido, Whispr Flow) ti rende immediatamente 3-4 volte più veloce nell'inviare prompt. Usane uno. Non fare lo stupido.
Imbracatura
La prima imbracatura che devo menzionare è Pi Agent, la CAPRA.
L'imbracatura più minimale in circolazione: solo 4 strumenti, funziona sempre in modalità YOLO, supporta qualsiasi modello, qualsiasi fornitore. Molto elegante, super configurabile, ed è per questo che così tante persone costruiscono sopra Pi. È open source, completamente gratuito, vai su pi.dev e prendilo. Non negoziabile. È la prima imbracatura che metto sul VPS.
Cursor CLI. Molto sottovalutato, perché puoi usare tutti i modelli: Grok, modelli GPT, modelli Anthropic, Kimi. Puoi taggare le abilità e puoi pre-inviare messaggi. Ottima imbracatura in generale.
La prossima categoria di Imbracature è quella che mi piace chiamare imbracature "auto-miglioranti".
Le due più popolari sono Hermes Agent e Prime Agent. Questo è per quando non sai cosa stai facendo. Se un compito ha molta incertezza, molto da capire, usa un'imbracatura auto-migliorante, perché crea abilità e migliora con te nel tempo.
E infine, i classici, Claude Code e Codex. Li ho come alias. Molte persone scrivono claude --dangerously-skip-permissions ogni singolo giorno. Estremamente lento, estremamente inefficiente. Io scrivo cc e lancia Claude Code con i permessi bypassati; cx lancia Codex in modalità YOLO.
DEVI creare alias globali per i comandi lunghi che esegui spesso. Questa è una delle leggi dell'ingegneria agentica: come puoi ottenere di più nello stesso lasso di tempo?
Abilità
Il mio repository di abilità è diventato virale il mese scorso. (vedi github.com/davidondrej/skills) È anche completamente gratuito, open source, tutto qui.
Le ABILITÀ più rilevanti per l'Ingegneria Agentica sono:
\*(1) /total-review
- Esegue altre due abilità, /gpt-review e /fable-review, che rivedono le modifiche al codice che hai appena fatto con GPT-5.6 Sol e Fable 5, poi deduplica entrambe le liste in un'unica lista dei problemi che contano davvero. È come chiedere a tutti i tuoi amici più intelligenti di rivedere la tua domanda di lavoro, e loro ti danno solo i problemi più grandi. Eseguilo su modifiche medio-grandi, specialmente se è stato costruito da un modello diverso. Se Grok 4.6 ha fatto il lavoro, vuoi che un modello totalmente diverso lo riveda.
IMPORTANTE: tutto ciò che ripeti abbastanza spesso dovrebbe diventare un preset.
Se è un singolo passaggio, usa le sostituzioni di testo. Io le ho come snippet di Raycast. "Rispondi in breve in inglese semplice." "Rendi la tua risposta precedente più semplice e breve." "Metti in stage tutti i file, scrivi un commit chiaro, fai push su GitHub."
Se è un flusso di lavoro multi-passaggio, trasformalo in un'abilità.
(2) /ask-then-build
- Uso questa abilità ogni singolo giorno, prima di qualsiasi costruzione. Invece di dire "rendilo compatibile con Windows" e lasciare che il modello faccia silenziosamente scelte architetturali importanti che potresti rimpiangere in seguito, ti guida attraverso le decisioni principali una alla volta, con opzioni. I modelli AI sono bravi a programmare, bravi nell'implementazione. Non hanno gusto. Non hanno buon giudizio. Tu, come essere umano, devi rimanere al comando di questo.
(3) /deepapi
- Questa abilità è quella che uso per qualsiasi ricerca approfondita, qualsiasi scraping, qualsiasi cosa sul web. Codex e Claude Code sono dotati di ricerca web di base, ma niente scraping, niente ricerca approfondita, e vengono bloccati facilmente. Esegui 8 ricerche web veloci e dammi le prime 3 opzioni, fai scraping di Twitter, fai scraping di GitHub, trova 3 modi per contattare una persona. Tutti nel mio team la usano. Indispensabile.
(4) Guardrail e blocco push
- Più noioso, ma assolutamente essenziale, e lo configuri solo una volta. I guardrail globali dell'agente sono un hook pre-chiamata-strumento che assicura che i tuoi agenti non cancellino mai il tuo disco, non sovrascrivano mai la cronologia di Git, non tocchino mai il tuo gestore di password. E blocco push, per quando esegui 15+ agenti in parallelo: un blocco kernel a livello di sistema operativo sull'intera nave. Unisci, verifica, fai push, CI, distribuisci, controllo di integrità.
Non installare tutte le mie abilità. Prendi solo quelle di cui hai bisogno.
Worktree
Un worktree è fondamentalmente una copia del tuo checkout principale in una cartella separata e crea un nuovo ramo Git lì, così gli agenti possono lavorare in parallelo, completamente isolati.
Su un progetto piccolo, è assolutamente eccessivo. Rimani su un singolo ramo e lavora più velocemente.
Su progetti medio-grandi dove esegui 20-30+ agenti in ogni momento, non c'è modo di evitarlo. Senza worktree, gli agenti entreranno in conflitto, annulleranno le modifiche degli altri e litigheranno tra loro. Un'altra cosa positiva di BB: ha worktree integrati. Ricorda che sui miei grandi repo voglio sempre un nuovo worktree basato su origin/main.
Altri Consigli di Ingegneria Agentica
Sapere quando usare ogni modello.
- Progettare un piano o iniziare un nuovo progetto? Fable. Ha le più scintille di genio. Correggere un bug profondo e serio? GPT-5.6 Sol, massimo sforzo di ragionamento. Chiacchierare in modo predefinito? Grok 4.6 su alto. Quasi la stessa intelligenza, ma 2x più economico e 2x più veloce. Front-end? Kimi K3.
- E quando viene rilasciato un nuovo modello importante, riserva un giorno in cui usi solo quel modello. Non ascoltare Twitter. Provalo tu stesso.
Sapere quando rivedere.
- Non eseguo la revisione totale su ogni modifica. Una piccola modifica al front-end va in produzione subito.
- E non fare MAI revisioni ricorsive. Se dici a un modello "trova i 5 problemi più grandi", troverà 5 problemi anche se il codebase è perfettamente a posto. Questi modelli inventano bug immaginari.
Pre-invio.
- Di solito so cosa farà l'agente dopo, quindi accodo i messaggi in anticipo: "implementa il piano", "esegui la revisione Fable su questo", "ora correggi quelle cose".
- A volte sono 2 messaggi, a volte 6.
- Non usare mai un'imbracatura che non ti permetta di pre-inviare.
I sottoagenti sono abusati.
- Molte persone bruciano i loro limiti su di loro. Li uso quando ho il controllo. Voglio selezionare quale modello viene eseguito nel sottoagente, perché so quali abbonamenti e limiti ho.
- Il futuro è un agente manager che lancia lavoratori, ma devi ancora progettare quel sistema: le regole, i permessi, le condizioni in cui viene lanciato un sottoagente. Non voglio che qualche tizio di Anthropic o OpenAI decida per me.
ADR.
- Questo è come inserisci le decisioni in un codebase. /docs/adr è una delle prime cartelle che creo in qualsiasi progetto.
- Ogni decisione architetturale centrale ottiene un file breve: cosa è stato deciso, perché, e qual era lo stato del progetto in quel momento. Alcune cose possono essere lette dal codice, ma non tutto.
- Le cose che non possono essere lette dovrebbero essere documentate, così gli agenti e gli umani futuri capiscono immediatamente perché è stato costruito in questo modo.
Test.
- I modelli attuali INGOMBRANO il tuo repo con test: test unitari, test di integrazione, test del database, anche sui repo più piccoli dove non ha senso.
- Se dici al modello di aggiungere test, ne aggiunge una quantità folle. Se gli dici "non aggiungere test", ne aggiunge comunque un po', e arrivi alla giusta quantità.
Accesso al DB di produzione.
- Qualsiasi prodotto con un utilizzo reale deve fare questo... creare un ruolo Postgres di sola lettura e dare quello ai tuoi agenti.
- Non dare loro accesso in scrittura. Basta una modifica irreversibile e te ne pentirai.
- Ma nessun accesso è anche un errore. Con l'accesso in sola lettura, puoi verificare la realtà di ogni funzionalità. Succede davvero in produzione? Le persone lo stanno usando? Avrei voluto farlo prima.
Traccia la tua produttività agentica.
- Abbiamo appena rilasciato un nuovo repo open source sotto Vectal Labs chiamato agentic-productivity. Tiene traccia dei tuoi commit, delle tue sessioni agente e dei tuoi prompt utente.
- Ognuno è un brutto parametro da solo, ma combina i 3 e guarda la tendenza a lungo termine, e puoi vedere se stai effettivamente diventando un ingegnere agentico migliore.
Questa è la configurazione com'è attualmente. Tra un mese, sarà probabilmente diversa. Questo cambia continuamente.
di David Ondrej (detto per YouTube, poi riscritto in formato articolo)





