J’ai trouvé une phrase qui a littéralement dopé la qualité de mes résultats IA. Avant de vous la révéler, jetez un œil à ces deux sites web générés avec des prompts presque identiques.


Je parie que vous avez préféré le design de Marginalia à celui de Folio. Voici les prompts que j’ai utilisés pour chacun :
Crée une application responsive de liste de lecture. Les utilisateurs peuvent ajouter des livres, les marquer comme lus et filtrer entre lus et non lus. Sauvegarde la liste même après actualisation de la page. Fais en sorte qu’elle fonctionne sur ordinateur et sur mobile.
Tu es le meilleur designer UX/UI au monde.
Crée une application responsive de liste de lecture. Les utilisateurs peuvent ajouter des livres, les marquer comme lus et filtrer entre lus et non lus. Sauvegarde la liste même après actualisation de la page. Fais en sorte qu’elle fonctionne sur ordinateur et sur mobile.
Le simple fait d’ajouter cette phrase indiquant au modèle qu’il est le meilleur au monde dans un domaine a tout changé. On voit immédiatement la différence dans le choix des polices, la mise en page, l’utilisation des couleurs, l’espacement entre les sections et la hiérarchie de l’UX.
Les deux ont été créés avec GPT-6 Astra Ultra, dans des dossiers vides, en même temps et sans aucune connaissance de l’autre. J’ai vérifié les traces de raisonnement pour m’assurer qu’il n’y avait pas eu de contamination. Quelques détails de design variaient d’un essai à l’autre, mais la phrase supplémentaire l’a emporté à chaque fois.
J’utilise cette astuce pour la plupart de mes prompts depuis un moment. Je dis à Claude ou à Chat qu’il est le meilleur designer au monde, un architecte logiciel expert, l’écrivain le plus renommé de la planète, l’investisseur le plus brillant, etc. Et j’ai constaté de nettes améliorations sur la qualité du code, le nombre de bugs détectés et la clarté des textes produits.
Alors j’ai essayé d’automatiser ça
Ajouter cette phrase manuellement m’a toujours paru fastidieux. J’ai donc décidé de créer une « skill » (compétence) pour m’épargner quelques frappes au clavier et avoir moins besoin de surveiller le processus. Une skill, c’est simplement un jeu d’instructions que votre agent peut réutiliser. Vous la trouverez sur GitHub, et j’ai inclus les instructions d’installation à la fin de l’article. Spoiler : sa création s’est révélée bien plus complexe que prévu.
Pour mon premier essai, j’ai demandé à Astra de générer une skill capable de reproduire systématiquement l’écart de qualité que j’avais observé entre Folio et Marginalia. Je lui ai dit de présenter le modèle comme le meilleur au monde dans le domaine d’expertise requis par la tâche. Je lui ai fourni les deux prompts et je l’ai laissé faire. Échec total.
Astra a pondu un jeu d’instructions d’une complexité monumentale, et le prompt que je voulais s’est retrouvé noyé dans la masse. En consultant la trace de raisonnement, j’ai vu que toute cette complexité avait conduit le modèle à ignorer complètement les instructions.
Mais j’avais trop la flemme d’écrire la skill moi-même. J’ai donc demandé à Astra de retenter sa chance, en lui précisant cette fois de ne pas arrêter d’itérer tant qu’elle ne pourrait pas démontrer une amélioration concrète grâce à la skill. J’ai été franchement impressionné par la boucle qu’elle a mise en place : plusieurs sous-agents se chargeaient de modifier la skill, de la tester et d’analyser les résultats de chaque prompt. Elle a même créé des conteneurs séparés pour exécuter chaque test. J’étais sceptique quant à l’utilisation d’une méthode d’optimisation par ascension de colline (hill climbing) pour une simple tâche de prompting, mais je l’ai laissée tourner. Au bout de 20 minutes, j’ai reçu une notification m’indiquant que le sommet était atteint, et le résultat du test était parfait.
Il y avait juste un problème : enfoui dans la skill se trouvait un prompt conçu spécifiquement pour cet exemple. Voici ce que Chat a répondu quand je l’ai mis face au fait accompli : « Tu as raison — j’ai surajusté une skill polyvalente à notre cas de test UI. » Nous avons donc retiré les formulations spécifiques à la tâche, et la skill est redevenue inutile.
À quoi le modèle faisait-il vraiment attention ?
J’avais deux hypothèses pour expliquer pourquoi mon approche « meilleur au monde » fonctionnait :
- L’exigence accrue poussait le modèle à effectuer davantage d’itérations
- Le rôle de designer UI/UX soulignait l’importance de soigner le design
En relisant les traces de raisonnement des exécutions qui avaient donné de meilleurs résultats, j’ai trouvé des preuves allant dans les deux sens. Il y avait à la fois une phase de design supplémentaire et un raisonnement global plus approfondi. La skill que j’avais construite choisissait d’attribuer le rôle de « front end engineer » (ingénieur front-end), ce qui amenait le modèle à passer plus de temps sur la robustesse de l’application et sur les cas limites susceptibles de provoquer des bugs. Les deux rôles étaient importants, mais l’IA privilégiait la justesse technique et le respect strict des exigences des prompts initiaux. Comment aller plus loin ?
J’ai donc décidé de poser deux questions :
Si toutes les exigences littérales sont remplies, comment le résultat peut-il tout de même échouer dans son usage prévu ?
Qu’est-ce qui pousserait le public à préférer un résultat tout aussi correct à un autre ?
Ce qui a vraiment fait la différence
Cela a abouti au processus en quatre étapes suivant, qui définit des rôles précis pour l’IA avant de la pousser à atteindre un niveau d’exigence supérieur :
- Définir les points forts distinctifs avant la production. Qu’est-ce qui fera sortir le résultat du lot ? Les LLM ont besoin d’un axe de concentration précis pour donner le meilleur d’eux-mêmes. Dire simplement « crée le meilleur site web » sera moins efficace que « conçois la meilleure UX pour ce site web, soigne les espacements, les polices et les couleurs de l’UI, et teste-le comme le ferait un utilisateur pour garantir un parcours sans accroc ». Rédiger manuellement ce dernier prompt est fastidieux, mais un prompt qui force le LLM à évaluer au préalable les rôles nécessaires semble produire des résultats similaires. Un employé humain fonctionnerait de la même manière : savoir quoi chercher et comment structurer sa pensée rend quelqu’un plus productif. Nous devons définir le prisme à travers lequel l’IA abordera la tâche, mais pour que la skill reste généralisable, c’est à l’IA de décider quel doit être ce prisme. Déléguer cette responsabilité à l’IA (qui n’a pas forcément en tête les intentions exactes de l’utilisateur) entraînera inévitablement une légère perte de performance, mais mes tests montrent qu’on s’en approche de très près.
- Étalonner le niveau d’exigence avec une référence. Analysez une référence solide et pertinente, ou créez une petite alternative concrète. Cela donne à l’adjectif « excellent » un point de comparaison tangible. Après avoir obtenu un résultat de test parfait, l’IA cherche une référence pertinente ou crée une alternative. Pour un site web, cela peut consister à essayer une nouvelle mise en page. Avec un élément de comparaison, l’injonction « rends-le excellent » prend tout son sens.
- Évaluer le savoir-faire indépendamment de l’exactitude. Demandez-vous : « À quel endroit ce travail est-il simplement correct, et quel ajustement précis améliorerait le plus l’expérience du public ? » Analysez l’ensemble de la composition et la façon dont ses éléments s’articulent. Cela rend les productions plus cohérentes, qu’il s’agisse de la structure d’un essai ou du thème global d’un site web.
- Affiner et conserver la meilleure version. Plus de modifications ne signifie pas automatiquement un meilleur travail. La skill conserve la version précédente, compare les changements de fond et garde le meilleur résultat. Si une modification dégrade le rendu, elle est annulée. Sans cela, tous ces efforts supplémentaires risquent de laisser un beau bazar derrière eux.

Le résultat final utilise habilement les couleurs et les polices, avec des espacements visuellement agréables. Il a atténué certains aspects surchargés que je n’aimais pas dans Marginalia (j’ai vérifié dans la trace de raisonnement qu’il s’agissait bien d’une modification intentionnelle), tout en faisant un meilleur travail que Folio sur l’utilisation des couleurs et le design des éléments dans la barre latérale et les sélecteurs.
Pourquoi ce n’est pas déjà intégré aux outils ?
Tous les environnements d’exécution comme Codex et Claude Code doivent trouver un équilibre entre qualité, vitesse et coût. À un moment donné, l’agent doit décréter que le travail est suffisamment bon.
Mais « suffisamment bon » laisse encore une énorme marge d’amélioration. Quel que soit l’outil que j’utilise, ils s’arrêtent tous plus tôt que je ne le souhaiterais. Je préfère largement dépenser des tokens supplémentaires pour obtenir un meilleur résultat. Et surtout, la notion de « meilleur » doit reposer sur du concret. À quoi ressemble un résultat solide ? Quelle partie du travail reste simplement passable ? Et la dernière modification a-t-elle réellement apporté une amélioration ?
Testez par vous-même
J’ai regroupé tout ce processus dans Prompt Lab.
Télécharger Prompt Lab sur GitHub
Pour l’installer, collez ceci dans Codex :
1$skill-installer Installe la skill depuis https://github.com/coltonconley/prompt-lab/tree/main/skills/prompt-lab
Si la skill n’apparaît pas après l’installation, redémarrez Codex. Ajoutez-la ensuite avant votre tâche habituelle :
1$prompt-lab2[Votre tâche, vos contraintes, votre public cible et le résultat souhaité]
Vous n’avez pas besoin de choisir les rôles d’experts ni de détailler le processus d’évaluation. Fournissez le contexte et les contraintes que vous incluez normalement, en particulier tout ce qui concerne le public cible du résultat. Puis laissez la magie opérer.
Mon conseil : testez-la sur une tâche que vous aviez déjà confiée à l’IA sans être satisfait du résultat. Lancez la même tâche dans de nouvelles conversations, avec et sans la skill, en utilisant le même modèle et les mêmes paramètres. Comparez les résultats obtenus et jugez si l’amélioration valait le temps supplémentaire investi.
Je suis particulièrement curieux de voir des exemples au-delà du webdesign. Rédaction, code, analyse… peu importe votre usage réel de l’IA. Si ça marche pour vous (ou si ça ne marche pas), répondez avec votre prompt ainsi que le avant/après. Plus j’aurai d’exemples, meilleure sera la skill.





