Vuoi creare immagini con la stessa atmosfera, ma ogni volta esce un'immagine diversa.
Quando allinei tre miniature, sembrano fatte da tre persone diverse. Vuoi ottenere la stessa persona di prima, ma il suo volto cambia. Anche se scrivi "come la volta scorsa", non sembra funzionare affatto.
Questo è il muro contro cui si scontra la maggior parte delle persone che iniziano a usare la generazione di immagini con l'IA per lavoro.
Tuttavia, non è che i tuoi prompt siano sbagliati. La causa è molto più semplice: li scrivi da zero ogni volta.
Inoltre, OpenAI ha fornito ufficialmente una risposta a questo problema. È stato rilasciato un template che suddivide i prompt per le immagini in 14 elementi. Include 11 tipi per diversi usi, 8 tipi per la modifica ed esempi completati.
Ecco le quattro cose che condividerò con te:
- Il testo completo dei 14 elementi del template ufficiale e cosa scrivere in ciascuno.
- Un elenco di 11 tipi per specificare i casi d'uso in una parola e 8 tipi per la modifica.
- Il metodo ufficiale per continuare a generare lo "stesso volto" e lo "stesso stile".
- Un modo per evitare di incollare quel template ogni volta (incluso il resoconto di come l'ho effettivamente eseguito).
La seconda parte si basa su misurazioni reali. Ho passato un'immagine di riferimento, ho creato un template e ho seguito il processo di creazione di un documento di 10 pagine. Scriverò esattamente quanto tempo è servito, il fatto che l'ho rifatto 7 volte e come ho scoperto che non si dovrebbe usare ImageGen direttamente per la creazione di documenti.
Prima, ecco l'oggetto in questione. Questo è il framework ufficiale.
Testo originale ufficiale (da Shared Prompt Scaffolding della skill imagegen di OpenAI)
1Use case: <taxonomy slug>2Asset type: <where the asset will be used>3Primary request: <user's main prompt>4Input images: <Image 1: role; Image 2: role> (optional)5Scene/backdrop: <environment>6Subject: <main subject>7Style/medium: <photo/illustration/3D/etc>8Composition/framing: <wide/close/top-down; placement>9Lighting/mood: <lighting + mood>10Color palette: <palette notes>11Materials/textures: <surface details>12Text (verbatim): "<exact text>"13Constraints: <must keep/must avoid>14Avoid: <negative constraints>
Fonte: https://github.com/openai/skills/blob/main/skills/.system/imagegen/SKILL.md
Solo a guardarlo, potresti pensare "è in inglese" e fermarti, quindi d'ora in poi tradurrò ogni voce in italiano e ti spiegherò come compilarle. Alla fine, fornirò una versione italiana del template che puoi copiare e usare così com'è.
Il motivo per cui varia ogni volta non è che i tuoi prompt sono sbagliati
La causa sta nella struttura delle istruzioni, non nel contenuto.
Digiti "crea un'immagine di testata elegante per un blog" in testo libero. Il giorno dopo, digiti "immagine di testata semplice e accattivante". Nella mente di un essere umano, queste sono intese come lo stesso ordine, ma queste due sono istruzioni diverse.
La prima ha solo "elegante" come indizio. La seconda ha "semplice" e "accattivante". Le parti che non specifichi vengono riempite dall'IA ogni volta. Poiché il modo in cui vengono riempite è diverso ogni volta, le immagini sono diverse ogni volta.
⚡ Non è l'IA a essere incerta; sono le nostre istruzioni.
È qui che entrano in gioco i 14 elementi. Se gli elementi sono fissi, puoi vedere a colpo d'occhio dove hai dimenticato di compilare. Se apri il file precedente e riscrivi solo le righe che vuoi cambiare, tutto il resto sarà uguale alla volta scorsa.
Smetti di "scrivere" prompt ogni volta e passa a "compilarli". Questa è l'essenza di questa discussione.
La politica ufficiale è "non espandere arbitrariamente"
C'è un'altra filosofia di progettazione che è utile conoscere.
La definizione ufficiale della skill afferma:
```text
If the prompt is already specific and detailed, preserve that specificity and only normalize/structure it. If the prompt is generic, you may add tasteful augmentation when it will materially improve the result.





