14 règles pour réduire la variance dans la génération d'images publiées par OpenAI (prompts inclus)

@yasu_ai_good
JAPONAIS14 août 2026
128K
169
13
1
552

TL;DR

Cet article détaille l'échafaudage de prompts officiel en 14 points d'OpenAI, conçu pour réduire la variance dans la génération d'images par IA. Il couvre des cas d'utilisation spécifiques, des flux de travail d'édition pour la cohérence des personnages, et comment automatiser la création de présentations Slides professionnelles en utilisant ces modèles.

Vous voulez créer des images avec la même atmosphère, mais à chaque fois le résultat est différent.

Quand vous alignez trois vignettes, on dirait qu'elles ont été créées par trois personnes différentes. Vous voulez générer le même personnage que la dernière fois, mais son visage change. Même en tapant « comme la dernière fois », cela ne semble pas fonctionner du tout.

C'est le premier mur auquel se heurtent la plupart des personnes qui commencent à utiliser la génération d'images par IA dans un cadre professionnel.

Pourtant, ce n'est pas parce que vos prompts sont mauvais. La cause est bien plus simple : vous les écrivez à partir de zéro à chaque fois.

En outre, OpenAI a officiellement apporté une réponse à ce problème. Un template qui décompose les prompts d'image en 14 éléments a été publié. Il comprend 11 types pour différents usages, 8 types pour la retouche, ainsi que des exemples complets.

Voici les quatre choses que je vais partager :

  • Le texte intégral des 14 éléments du template officiel et quoi écrire dans chacun.
  • Une liste de 11 types pour spécifier le cas d'usage en un mot, et 8 types pour la retouche.
  • La méthode officielle pour continuer à générer le « même visage » et le « même style ».
  • Un moyen d'éviter de coller ce template à chaque fois (avec un compte rendu de son exécution réelle).

La seconde moitié est basée sur des mesures réelles. J'ai fourni une image de référence, créé un template, et suivi le processus de création d'un document de 10 pages. Je vais écrire exactement combien de temps cela a pris, le fait que j'ai tout recommencé 7 fois, et comment j'ai découvert qu'il ne fallait pas utiliser ImageGen directement pour la création de documents.

Commençons par l'objet en question. Voici le cadre officiel.

Texte original officiel (issu du Shared Prompt Scaffolding du skill imagegen d'OpenAI)

text
1Use case: <slug de taxonomie>
2Asset type: <où l'élément sera utilisé>
3Primary request: <prompt principal de l'utilisateur>
4Input images: <Image 1 : rôle ; Image 2 : rôle> (optionnel)
5Scene/backdrop: <environnement>
6Subject: <sujet principal>
7Style/medium: <photo/illustration/3D/etc.>
8Composition/framing: <large/rapproché/plongée ; placement>
9Lighting/mood: <éclairage + ambiance>
10Color palette: <notes sur la palette>
11Materials/textures: <détails de surface>
12Text (verbatim): "<texte exact>"
13Constraints: <à conserver / à éviter>
14Avoid: <contraintes négatives>

Source : https://github.com/openai/skills/blob/main/skills/.system/imagegen/SKILL.md

Rien qu'en voyant ça, vous pourriez vous dire « c'est en anglais » et vous arrêter. C'est pourquoi, à partir d'ici, je vais traduire chaque élément en français et détailler comment les remplir. À la fin, je fournirai une version française du template, prête à copier-coller et à utiliser telle quelle.

Si le résultat varie à chaque fois, ce n'est pas parce que vos prompts sont mauvais

La cause réside dans la structure des instructions, pas dans leur contenu.

Vous tapez « crée une image d'en-tête de blog élégante » en texte libre. Le lendemain, vous tapez « image d'en-tête simple et cool ». Dans l'esprit d'un humain, ce sont les mêmes consignes, mais ce sont en réalité deux instructions différentes.

La première ne contient que « élégante » comme indice. La seconde contient « simple » et « cool ». Les parties que vous ne précisez pas sont comblées par l'IA à chaque fois. Comme la façon de les combler diffère à chaque fois, les images sont différentes à chaque fois.

⚡ Ce n'est pas l'IA qui hésite ; ce sont nos instructions.

C'est là que les 14 éléments entrent en jeu. Si les éléments sont fixes, vous pouvez voir d'un coup d'œil où vous avez oublié de remplir. Si vous ouvrez le fichier précédent et ne réécrivez que les lignes que vous voulez modifier, tout le reste sera identique à la dernière fois.

Arrêtez d'« écrire » vos prompts à chaque fois et passez à « les remplir ». C'est l'essence de cette discussion.

La politique officielle : « ne pas étendre arbitrairement »

Il y a une autre philosophie de conception qui est utile à connaître.

La définition officielle du skill indique :

text
1Si le prompt est déjà spécifique et détaillé, conservez cette spécificité et contentez-vous de le normaliser/structurer. Si le prompt est générique, vous pouvez ajouter des enrichissements pertinents lorsque cela améliore sensiblement le résultat.

Source : https://github.com/openai/skills/blob/main/skills/.system/imagegen/SKILL.md

Si l'instruction est spécifique, conservez cette spécificité et organisez simplement la structure. Ce n'est que lorsque l'instruction est vague qu'il est permis d'ajouter des éléments, dans la mesure où le résultat s'en trouve amélioré. Voilà comment c'est décidé.

En d'autres termes, plus vous écrivez de détails, moins l'IA a de latitude. Moins de latitude signifie moins de variations.

À l'inverse, pour des instructions vagues, l'IA est officiellement autorisée à « être serviable et à ajouter des éléments ». Les parties ajoutées par excès de zèle sont différentes à chaque fois. C'est là l'origine des variations.

📌 Par conséquent, les 14 éléments sont des outils pour donner des informations à l'IA, mais aussi pour lui retirer sa liberté. Si vous voyez les choses ainsi, vous ne les utiliserez pas à mauvais escient.

Avant cela : vous avez probablement déjà cet outil

Aucune installation n'est requise.

imagegen est un « skill système » présent dans Codex depuis le début. Ce n'est pas quelque chose que les utilisateurs ajoutent ensuite ; il est prêt à l'emploi dès le démarrage. Aucun contrat supplémentaire ni clé API n'est requis.

Dans la description officielle, le comportement par défaut est un mode qui utilise l'outil intégré image_gen, qui se présente ainsi :

Outil intégré (par défaut) : ne requiert pas de clé OPENAI_API_KEY.

Une clé API n'est nécessaire que pour le repli CLI (scripts/image_gen.py), qui ne s'exécute que sur demande explicite. Pour une utilisation normale, cela n'a pas d'importance.

⚠️ C'est là que 90 % des gens butent : le symbole d'appel diffère selon l'endroit.

Si vous ne le savez pas, vous resterez bloqué dès la première ligne. La documentation officielle le décrit ainsi :

text
1Dans Codex CLI ou l'extension IDE, exécutez /skills ou tapez $ pour mentionner un skill.
text
1Dans ChatGPT Work, utilisez le format @skill-creator.

Source : https://learn.chatgpt.com/docs/build-skills

Dans Codex CLI et les extensions IDE, c'est $. Dans ChatGPT Work, c'est @.

Même si c'est la même fonction, le symbole d'appel diffère. Lorsque la procédure trouvée en ligne ne fonctionne pas, c'est généralement parce que l'écran sur lequel vous vous trouvez est différent de celui de l'article. La syntaxe n'est pas fausse.

La documentation officielle indique également où il peut être utilisé :

text
1Les skills autonomes sont disponibles dans l'application de bureau ChatGPT, Codex CLI et l'extension IDE. Les skills inclus dans des plugins sont également disponibles dans Chat et Work, sur ChatGPT web, bureau et mobile.

Source : https://learn.chatgpt.com/docs/build-skills

Application de bureau, Codex CLI et extension IDE : ces trois environnements sont le terrain des skills autonomes.

🎯 Même les personnes qui ne peuvent pas utiliser le skill peuvent utiliser le template dès aujourd'hui.

C'est un point important, donc je vais le dire clairement. Pour les personnes qui n'utilisent ni Codex ni l'application de bureau, imagegen en lui-même n'est pas accessible. Si vous ouvrez simplement ChatGPT dans un navigateur, taper $ ne donnera rien.

Cependant, le template à 14 éléments n'est qu'un format texte. Vous pouvez le coller directement dans le champ de saisie de génération d'images de ChatGPT, Gemini ou Claude dans le navigateur. Le skill n'est qu'un « mécanisme qui écrit ce format pour vous », et le format lui-même peut être utilisé par n'importe qui.

Par conséquent, la valeur de cet article ne change pas selon que vous pouvez ou non utiliser le skill. Ceux qui le peuvent y verront de l'automatisation, et les autres un template à copier-coller.

Template de prompt : les 14 éléments

Voici le cœur du sujet. Examinons à quoi sert chaque champ, dans l'ordre. Il y a 14 éléments, mais vous n'avez pas besoin de tous les remplir. L'IA complète simplement les parties que vous n'avez pas remplies. Il suffit de remplir uniquement les éléments qui vous posent problème en termes de variations.

  1. Use case Ce champ permet de spécifier le genre de l'image à l'aide d'un mot fixe. Au lieu de mots libres, vous choisissez parmi les mots fournis officiellement (slug de taxonomie). Il y a 11 types au total, comme product-mockup, ui-mockup et logo-brand. Une liste est récapitulée dans un chapitre ultérieur. Le décider en premier détermine automatiquement comment remplir les éléments suivants. S'il s'agit d'une photo produit, vous aurez besoin d'éclairage. S'il s'agit d'un schéma, vous aurez besoin de texte. Une fois le cas d'usage décidé, les champs nécessaires sont également décidés.
  1. Asset type Indiquez où l'image sera finalement placée : « image d'en-tête de blog », « arrière-plan hero de page d'atterrissage », « icône d'interface de jeu ». Si le cas d'usage (n° 1) est une catégorie générale, ce champ correspond à l'emplacement concret. Même pour une même image de style photo, les marges et le format requis changent selon qu'elle est placée dans un en-tête ou dans une icône. C'est le champ qui permet de le préciser.
  1. Primary request C'est le champ dans lequel placer le « fais-moi ça » que vous tapez habituellement en texte libre. Dans l'explication officielle, c'est <user's main prompt>. En d'autres termes, ces 14 éléments ne sont pas un mécanisme pour jeter le texte libre. C'est une structure où vous placez le texte libre dans le champ n° 3 et disposez des conditions autour. Si ce champ est vide, rien ne démarre. À l'inverse, si vous ne remplissez que celui-ci, c'est l'état d'avant.
  1. Input images Lorsque vous transmettez
Remixer dans YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Pour les créateurs

Transformez votre Markdown en un article 𝕏 impeccable

Quand vous publiez vos propres textes longs, la mise en forme 𝕏 des images, tableaux et blocs de code est pénible. YouMind transforme un brouillon Markdown complet en un article 𝕏 impeccable, prêt à publier.

Essayer Markdown vers 𝕏

D'autres patterns à décoder

Articles viraux récents

Explorer plus d'articles viraux