Configuration d'ingénierie agentique (après plus de 2 000 heures)

@DavidOndrej1
ANGLAIS31 août 2026
270K
1.4K
121
46
3.9K

TL;DR

Une plongée approfondie dans une stack de codage IA professionnelle, détaillant l'utilisation d'agents basés sur le cloud, d'environnements VPS et de compétences personnalisées pour automatiser des tâches de développement logiciel complexes.

Au cours des 3 dernières années, j'ai passé bien plus de 2 000 heures à coder avec l'IA, et j'ai personnellement interviewé certaines des personnes les plus productives dans le domaine de l'ingénierie agentique.

Voici ma configuration complète d'ingénierie agentique telle qu'elle se présente actuellement, au troisième trimestre 2026.

Interface

Cela désigne l'interface utilisateur (UI/CLI) avec laquelle vous interagissez avec les agents. Mon interface principale est bb.

Elle est open source, totalement gratuite, et vous permet d'utiliser n'importe quel abonnement, n'importe quel agent, n'importe quel modèle au sein d'une seule interface graphique. Codex, Claude Code, Pi, Cursor CLI, OpenCode, Grok Build, Hermes, le tout dans la même interface.

Le problème avec des applications comme Codex ou Cursor, c'est qu'elles n'autorisent que leurs propres modèles et leur propre abonnement. L'objectif est d'obtenir le maximum de tokens pour le minimum d'argent.

Toutes les fonctionnalités que vous aimez dans les applications Codex ou Cursor sont intégrées dans bb, et elle s'améliore chaque semaine (en plus, elle est entièrement open source et 100 % gratuite).

Un autre outil que j'utilise beaucoup est cmux.

Lorsque vous lancez un nouvel espace de travail cmux, vous pouvez diviser l'écran comme vous le feriez dans tmux (d'où le nom similaire), lancer différents terminaux dans chaque volet, et il y a un navigateur intégré.

Là où cmux montre ses limites, c'est quand vous avez beaucoup d'agents et d'espaces de travail. La barre latérale gauche n'est vraiment pas la bonne primitive. C'est correct pour quelques projets en cours, mais pour un travail d'ingénierie agentique sérieux à grande échelle, ce n'est pas le meilleur.

J'utilise Ghostty comme terminal car il est très rapide et natif.

Dans Ghostty, vous pouvez exécuter Herdr, qui est essentiellement tmux mais pour les agents, un runtime backend pour agents. Très minimaliste, très léger, il vit dans le terminal, et quand un agent a terminé, son état s'affiche à gauche : terminé, inactif, bloqué, en cours d'exécution.

Le suivi des états des agents IA est ESSENTIEL. Ma prédiction est que dans 3 à 6 mois, ce « suivi d'état des agents » deviendra de plus en plus important, car vous ne parlerez pas à un seul agent. Vous parlerez à un agent gestionnaire qui gère de nombreux agents ouvriers.

La dernière interface que je dois mentionner est Corral, que j'ai développée moi-même.

Au lieu de passer aléatoirement d'un agent à un autre lorsqu'ils terminent (dans Herdr, il n'y a pas d'ordre réel), chaque agent a une priorité. Tout comme les tâches ont différents niveaux de priorité/importance. Quand un agent P1 termine, il passe en haut. Vous ne devriez jamais répondre à un agent P4 quand un agent P1 a fini de s'exécuter. (oui... je dois vraiment rendre Corral open source. Je n'y suis pas encore arrivé.)

Modèles et Abonnements

Vous voulez le maximum de tokens pour le minimum d'argent possible. Cela devrait être l'un des principaux objectifs de tout ingénieur agentique (après avoir fait avancer les choses).

Il y a actuellement 4 abonnements principaux, et oui... cela pourrait être complètement différent dans 2 mois.

La meilleure offre « rapport qualité-prix » en ce moment est OpenCode Go. C'est seulement 10 $, et cela vous donne Kimi K3, Grok 4.6, GLM 5.3, DeepSeek V4 Pro, et bien d'autres modèles... Mais il n'a pas les meilleurs modèles comme Fable 5 et GPT-5.6 Sol (en plus, les limites d'utilisation sont assez faibles).

Donc, si vous avez un peu plus d'argent, voici ce que vous devriez faire :

  • 30 $ -- Prenez OpenCode Go + ChatGPT Plus (20 $)
  • 50 $ -- Ajoutez l'abonnement Claude Code à 20 $ par-dessus.
  • 70 $ -- Ajoutez les 20 $ par mois de Cursor, et vous avez le niveau le plus bas de tous les abonnements.
  • 110 $ -- OpenCode + l'un des grands forfaits. Le forfait ChatGPT à 100 $ vous offrira une meilleure affaire que Claude. C'est comme ça. OpenAI a plus de puissance de calcul, ils sont prêts à la subventionner davantage.
  • 210 $ -- Prenez les deux forfaits à 100 $.
  • Et si vous êtes vraiment sérieux (comme moi), prenez tous les forfaits à 200 $ (Codex, Claude, Cursor) car ceux-ci offrent 20 fois plus d'utilisation, et ces forfaits vous donnent la meilleure affaire.

Au fait... le forfait Cursor est très sous-estimé. Cursor, alias Grok, va devenir un excellent abonnement grâce à l'acquisition par SpaceX. SpaceXAI a énormément de puissance de calcul, ils peuvent donc jouer le jeu de la subvention. Et -- je pense -- le forfait Cursor/Grok vous donne des limites séparées pour Cursor + Grok Bot, ce qui est tout simplement incroyable.

Grok Bot devient rapidement la nouvelle façon dont les gens interagissent avec les agents, donc avoir un abonnement Cursor n'a jamais été aussi important (non sponsorisé lol, c'est juste vrai). De plus, le nouveau modèle -- Grok 4.7 -- est sur le point d'arriver.

Quoi qu'il en soit, ne payez pas les tarifs API. C'est la pire affaire qui soit. Prenez simplement les abonnements.

Agents Cloud

Il est assez évident que les agents cloud sont l'avenir. Cursor, Amp, Devin, Codex... toutes ces entreprises misent tout sur les agents cloud.

La preuve que les agents cloud sont l'avenir est le graphique ci-dessous.

[image ici]

Voici la part interne de Cursor des PR fusionnées provenant d'agents cloud : environ 10-15 % au début de cette année, approchant les 60 % maintenant. Et ce sont des PR fusionnées, le contenu qui est réellement utilisé. Bientôt, ce sera 70 %, puis 80 %, puis 90 %.

Le problème d'exécuter tous les agents localement, sur votre machine, c'est que ce n'est pas évolutif. Vous ne pouvez pas exécuter des centaines d'agents à la fois. Il suffit que quelques agents décident d'exécuter toute votre suite de tests en même temps et votre ordinateur commencera à faire des bruits étranges (même mon MacBook Pro à 7 000 $ a du mal).

Les agents cloud vous offrent des environnements isolés, des sessions persistantes, un accès durable à Internet et à l'électricité. Si vous fermez votre ordinateur portable, vous perdez vos sessions. Perdez Internet pendant quelques minutes, et les harnais ne peuvent pas se rétablir seuls.

Le problème avec les solutions d'agents cloud existantes est le niveau INSENSÉ de verrouillage de l'écosystème. Configurer les environnements et tous vos secrets prend des heures, et ensuite vous êtes verrouillé : vos sessions sont là, vous êtes sur leur tarification, et vous leur donnez toutes vos données. Même s'ils n'entraînent pas de modèles dessus, il existe tellement d'autres façons d'utiliser vos données.

La solution est d'avoir votre propre serveur. Et grâce à l'IA, cela prend environ 10 minutes à configurer (sérieusement). Prenez simplement un VPS, exécutez Herdr dessus, et connectez-vous en SSH.

Herdr vous donne des sessions d'agent persistantes, et SSH vous permet de vous connecter depuis votre téléphone, votre ordinateur portable, n'importe quoi. Vous pouvez littéralement atteindre les 80/20 des agents cloud pour quelques dollars, sans le verrouillage.

Construisez votre propre environnement Cloud

J'utilise Hostinger pour mes VPS, et un plan KVM2 suffit. Voici le point principal que je veux faire passer... vous n'avez pas besoin d'être un expert en VPS, DevOps, Linux, rien de tout cela.

Parlez simplement à votre agent en français clair !!!

Dans la vidéo à venir, je configure le tout en direct. Un espace de travail cmux, un agent de codage dans le volet gauche (Cursor CLI exécutant Grok 4.6), un volet terminal vide à droite.

Ma compétence cmux permet à l'agent de trouver cet autre volet et d'y exécuter des commandes. Je me suis connecté en SSH au nouveau VPS moi-même, puis j'ai dit à l'agent « apprends tout sur ce serveur et configure l'environnement de développement. Herdr, Node.js, Python 3, Git ».

Il a analysé le VPS en quelques secondes, a tout installé, a démarré Herdr, puis a installé Pi Agent, a trouvé une clé OpenRouter sur mon MacBook, et a effectué toute la configuration lui-même. Quelques invites courtes plus tard, j'avais Pi exécutant GPT-5.6 Sol et une deuxième session exécutant Fable, tous deux dans le cloud, sur mon propre VPS, avec un accès root complet.

S'il arrive quelque chose à mon ordinateur ou à mon Wi-Fi... Si mon MacBook explose, ces agents continuent de fonctionner. La procédure complète est dans la vidéo. Lien vers ma chaîne YouTube ici.

Encore un conseil de rapidité... Je dicte avec SuperWhisper. La plupart d'entre vous qui lisez ceci tapent probablement à 40 ou 50 mots par minute. C'est très lent.

MAIS ! vous pouvez parler à 250+ mots par minute. Un outil vocal IA (comme Superwhisper, Glaido, Whispr Flow) vous rend instantanément 3 à 4 fois plus rapide pour envoyer des invites. Utilisez-en un. Ne soyez pas stupide.

Harnais

Le premier harnais que je dois mentionner est Pi Agent, le CHAMPION.

Le harnais le plus minimal qui soit : seulement 4 outils, fonctionne toujours en mode YOLO, supporte n'importe quel modèle, n'importe quel fournisseur. Très élégant, super configurable, et c'est pourquoi tant de gens construisent sur Pi. Il est open source, totalement gratuit, allez simplement sur pi.dev et récupérez-le. Non négociable. C'est le premier harnais que je mets sur le VPS.

Cursor CLI. Très sous-estimé, car vous pouvez utiliser tous les modèles : Grok, modèles GPT, modèles Anthropic, Kimi. Vous pouvez taguer des compétences et pré-envoyer des messages. Excellent harnais dans l'ensemble.

La catégorie suivante de harnais est ce que j'appelle les harnais « auto-améliorants ».

Les deux plus populaires sont Hermes Agent et Prime Agent. C'est pour quand vous ne savez pas ce que vous faites. Si une tâche comporte beaucoup d'incertitude, beaucoup de choses à comprendre, utilisez un harnais auto-améliorant, car il crée des compétences et s'améliore avec vous au fil du temps.

Et enfin, les classiques, Claude Code et Codex. Je les ai comme alias. Beaucoup de gens tapent claude --dangerously-skip-permissions tous les jours. Extrêmement lent, extrêmement inefficace. Je tape cc et cela lance Claude Code avec les permissions contournées ; cx lance Codex en mode YOLO.

VOUS DEVEZ créer des alias globaux pour les longues commandes que vous exécutez souvent. C'est l'une des lois de l'ingénierie agentique : comment pouvez-vous en faire plus dans le même laps de temps ?

Compétences

Mon dépôt de compétences est devenu viral le mois dernier. (voir github.com/davidondrej/skills ) Il est également totalement gratuit, open source, tout ça.

Les COMPÉTENCES les plus pertinentes pour l'ingénierie agentique sont :

\*(1) /total-review

  • Il exécute deux autres compétences, /gpt-review et /fable-review, qui examinent les modifications de code que vous venez d'effectuer avec GPT-5.6 Sol et Fable 5, puis déduplique les deux listes en une seule liste des problèmes qui comptent vraiment. C'est comme demander à tous vos amis les plus intelligents de relire votre candidature, et ils ne vous donnent que les plus gros problèmes. Exécutez-le sur les modifications de taille moyenne à grande, surtout si un modèle différent les a construites. Si Grok 4.6 a fait le travail, vous voulez qu'un modèle totalement différent le révise.

IMPORTANT : tout ce que vous répétez assez souvent devrait devenir un préréglage.

S'il s'agit d'une seule étape, utilisez des remplacements de texte. Je les ai comme snippets Raycast. « Réponds brièvement en français simple. » « Rends ta réponse précédente plus simple et plus courte. » « Ajoute tous les fichiers, écris un commit clair, pousse sur GitHub. »

S'il s'agit d'un flux de travail en plusieurs étapes, transformez-le en compétence.

(2) /ask-then-build

  • J'utilise cette compétence tous les jours, avant toute construction. Au lieu de dire « rends ceci compatible Windows » et de laisser le modèle prendre silencieusement des décisions architecturales importantes que vous pourriez regretter plus tard, il vous guide à travers les principales décisions une par une, avec des options. Les modèles IA sont excellents pour coder, excellents pour l'implémentation. Ils n'ont pas de goût. Ils n'ont pas de bon jugement. Vous, en tant qu'humain, devez rester en charge de cela.

(3) /deepapi

  • Cette compétence est ce que j'utilise pour toute recherche approfondie, tout scraping, tout ce qui est web. Codex et Claude Code sont livrés avec une recherche web de base, mais pas de scraping, pas de recherche approfondie, et ils sont facilement bloqués. Exécutez 8 recherches web rapides et donnez-moi les 3 meilleures options, scrapez Twitter, scrapez GitHub, trouvez 3 façons de contacter une personne. Tout le monde dans mon équipe l'utilise. Indispensable.

(4) Garde-fous et verrouillage push

  • Plus ennuyeux, mais absolument essentiel, et vous ne les configurez qu'une fois. Les garde-fous globaux d'agent sont un crochet pré-appel d'outil qui garantit que vos agents n'effacent jamais votre disque, ne réécrivent jamais l'historique Git, ne touchent jamais à votre gestionnaire de mots de passe. Et le verrouillage push, pour quand vous exécutez 15+ agents en parallèle : un verrouillage de noyau au niveau du système d'exploitation sur l'ensemble du navire. Fusionner, vérifier, pousser, CI, déployer, vérification de santé.

N'installez pas toutes mes compétences. Prenez juste celles dont vous avez besoin.

Worktrees

Un worktree est essentiellement une copie de votre checkout principal dans un dossier séparé et crée une nouvelle branche Git à cet endroit, afin que les agents puissent travailler en parallèle, complètement isolés.

Sur un petit projet, c'est totalement excessif. Restez sur une seule branche et travaillez plus vite.

Sur des projets de taille moyenne à grande où vous exécutez 20 à 30 agents ou plus en permanence, il n'y a aucun moyen de l'éviter. Sans worktrees, les agents entreront en conflit, annuleront les modifications des autres et se battront entre eux. Un autre avantage de BB : il a des worktrees intégrés. Il se souvient que sur mes gros dépôts, je veux toujours un nouveau worktree basé sur origin/main.

Autres Conseils d'Ingénierie Agentique

Sachez quand utiliser chaque modèle.

  • Concevoir un plan ou démarrer un nouveau projet ? Fable. C'est lui qui a le plus d'éclairs de génie. Corriger un bug profond et sérieux ? GPT-5.6 Sol, effort de raisonnement maximal. Discussion par défaut ? Grok 4.6 en mode élevé. Presque la même intelligence, mais 2 fois moins cher et 2 fois plus rapide. Front-end ? Kimi K3.
  • Et quand un nouveau modèle majeur est publié, réservez une journée où vous n'utilisez que ce modèle. N'écoutez pas Twitter. Essayez-le vous-même.

Sachez quand réviser.

  • Je n'exécute pas total review sur chaque modification. Une petite retouche front-end part en production immédiatement.
  • Et ne faites JAMAIS de révisions récursives. Si vous dites à un modèle « trouve les 5 plus gros problèmes », il trouvera 5 problèmes même si la base de code est parfaitement correcte. Ces modèles inventent des bugs imaginaires.

Pré-envoi.

  • Habituellement, je sais ce que l'agent fera ensuite, donc je mets les messages en file d'attente à l'avance : « implémente le plan », « exécute la révision Fable là-dessus », « maintenant corrige ces choses ».
  • Parfois c'est 2 messages, parfois 6.
  • N'utilisez jamais un harnais qui ne vous permet pas de pré-envoyer.

Les sous-agents sont surutilisés.

  • Beaucoup de gens brûlent simplement leurs limites dessus. Je les utilise quand je suis en contrôle. Je veux sélectionner quel modèle s'exécute dans le sous-agent, car je connais mes abonnements et mes limites.
  • L'avenir est un agent gestionnaire lançant des travailleurs, mais vous devez encore concevoir ce système : les règles, les permissions, les conditions dans lesquelles un sous-agent est lancé. Je ne veux pas qu'un gars chez Anthropic ou OpenAI décide cela pour moi.

ADR.

  • C'est ainsi que vous intégrez les décisions dans une base de code. /docs/adr est l'un des premiers dossiers que je crée dans tout projet.
  • Chaque décision architecturale fondamentale obtient un fichier court : ce qui a été décidé, pourquoi, et quel était l'état du projet à ce moment-là. Certaines choses peuvent être lues dans le code, mais pas tout.
  • Ce qui ne peut pas l'être doit être documenté, afin que les futurs agents et humains comprennent instantanément pourquoi c'est construit de cette façon.

Tests.

  • Les modèles actuels GONFLENT votre dépôt avec des tests : tests unitaires, tests d'intégration, tests de base de données, même sur les plus petits dépôts où cela n'a aucun sens.
  • Si vous dites au modèle d'ajouter des tests, il en ajoute une quantité insensée. Si vous lui dites « n'ajoute pas de tests », il en ajoute quand même un peu, et vous arrivez à la bonne quantité.

Accès à la base de données de production.

  • Tout produit avec une utilisation réelle doit faire ceci... créer un rôle Postgres en lecture seule et donner cet accès à vos agents.
  • Ne leur donnez pas d'accès en écriture. Il suffit d'un seul changement irréversible pour que vous le regrettiez.
  • Mais aucun accès est aussi une erreur. Avec un accès en lecture seule, vous pouvez vérifier la réalité de chaque fonctionnalité. Est-ce que cela arrive vraiment en production ? Les gens utilisent-ils vraiment cela ? J'aurais aimé le faire plus tôt.

Suivez votre productivité agentique.

  • Nous venons de publier un nouveau dépôt open source sous Vectal Labs appelé agentic-productivity. Il suit vos commits, vos sessions d'agent et vos invites utilisateur.
  • Chacun est une mauvaise métrique en soi, mais combinez les 3 et regardez la tendance à long terme, et vous pouvez voir si vous devenez réellement un meilleur ingénieur agentique.

Voilà la configuration telle qu'elle se présente actuellement. Dans un mois, elle sera probablement différente. Cela change tout le temps.

par David Ondrej (dit pour YouTube, puis réécrit pour le format article)

Enregistrer en un clic

Lire les articles viraux en profondeur avec l’IA de YouMind

Enregistrez la source, posez des questions ciblées, résumez l’argument et transformez un article viral en notes réutilisables dans un seul espace de travail IA.

Découvrir YouMind
Pour les créateurs

Transformez votre Markdown en un article 𝕏 impeccable

Quand vous publiez vos propres textes longs, la mise en forme 𝕏 des images, tableaux et blocs de code est pénible. YouMind transforme un brouillon Markdown complet en un article 𝕏 impeccable, prêt à publier.

Essayer Markdown vers 𝕏

D'autres patterns à décoder

Articles viraux récents

Explorer plus d'articles viraux