Désormais, vous pouvez aussi devenir un photographe IA

@MANISH1027512
CHINOIS03 sept. 2026
144K
533
84
26
1.0K

TL;DR

Cet article propose un cadre détaillé pour la photographie IA, en se concentrant sur l'aléa borné via des pools de variables pour les expressions, les scènes et les techniques de prise de vue afin d'obtenir des résultats réalistes.

Comme je l'ai dit plus tôt, si les retweets dépassaient 100, je publierais cette Compétence.

L'objectif a été atteint ; tout le monde est vraiment soutenant.

https://x.com/MANISH1027512/status/2094786658914930945

Bon, je ne vais pas me contenter de publier la Compétence ; je vais aussi expliquer la logique derrière. Après avoir lu ceci, vous pourrez devenir un photographe IA et même développer votre propre style de compétences.

古一 - inline image
古一 - inline image
古一 - inline image
古一 - inline image

D'abord, le Cadre du Prompt Principal

Une influenceuse Instagram coréenne, peau claire, silhouette exagérée.

[Expression] + [Style Vestimentaire] + [Scène] + [Moment] + [Technique Photographique]

C'est tout ?

Oui, le squelette est aussi simple que ça.

Je n'ai cessé de répéter à tout le monde : jouer avec GPT-Image 2 n'est pas comme les autres outils — ne le contrôlez pas trop.

Si vous définissez strictement ce que la personne porte, comment ses mains sont placées, de quel côté sa tête penche, l'angle de la lumière et exactement ce qu'il y a en arrière-plan, GPT a tendance à avoir du mal avec les demandes contradictoires. Il essaiera de tout satisfaire, mais cela peut provoquer des conflits de rendu (par exemple, c'est ainsi que le bruit est généré).

Alors, contrôlez les points d'ancrage clés et déléguez le reste au modèle de manière appropriée.

Mais déléguer ne signifie pas simplement dire « tout est aléatoire ».

Ce qui est vraiment important, c'est :

Préparez un ensemble suffisamment riche de valeurs énumérées pour les points d'ancrage clés.

Par exemple, si vous dites au modèle « expression aléatoire », il parcourt facilement quelques-unes des plus courantes.

Mais si vous lui donnez :

Indifférent et dans le vague, légèrement plissé, regardant vers le bas et distrait, ne pouvant s'empêcher de rire, se retournant soudainement, un bref moment de perte, une expression naturelle piquée par le soleil, la paresse du réveil...

Les limites du hasard sont définies par vous.

C'est aussi ce que je comprends comme une différence majeure entre une Compétence et un Prompt ordinaire.

Que fait une Compétence ?

Ce n'est en fait pas si mystérieux.

Il s'agit d'épaissir continuellement ces variables clés en pools de variables / banques de matériaux.

Par exemple :

Pool d'Expressions

Pool de Styles Vestimentaires

Pool de Scènes

Pool de Moments

Pool de Types de Plans

Pool de Longueurs Focales

Pool de Positions de Caméra

Pool de Compositions

Pool d'Avant-plans

Pool d'Éclairages

Lors de la génération, vous recomposez à partir de ces pools.

Vous pouvez comprendre cela comme une sorte de hasard encadré :

Ce n'est pas laisser le modèle deviner à l'aveugle, ni prédéfinir chaque pixel.

C'est une logique sous-jacente très courante pour de nombreuses Compétences de génération d'images maintenant.

Squelette + Pools de Variables.

Voici une Version à Exécuter Directement dans ChatGPT

Copiez ce qui suit, et c'est pratiquement prêt à l'emploi :

n=10, 9:16 portrait photo candide réaliste. Le sujet est fixé comme suit : une influenceuse Instagram coréenne avec une grande présence devant la caméra, peau claire et silhouette exagérée. Expressions aléatoires : indifférent et dans le vague, légèrement plissé, expression naturelle piquée par la lumière du soleil, un demi-sourire, regardant vers le bas et distrait, yeux fermés sentant le vent, se retournant soudainement, regardant au loin, ne pouvant s'empêcher de rire, la paresse du réveil, une pause naturelle quand on est pris sur le fait, un léger froncement de sourcils, pensif, un bref moment de perte. Styles vestimentaires aléatoires : style BM, style pure désir, style belle-mère, style mature, style Chanel, style maison, style coréen léger mature, style français paresseux, style froid minimaliste, style Old Money, style vacances, style citadin commuting, style doux et cool, style Y2K, style privé de girl group coréen, look haut de gamme eau plate, vêtements privés haut de gamme à faible saturation, style privé décontracté. Scènes aléatoires : étang de lotus en plein été, vieux bateau en bois, passerelle en bois au bord du lac, ruisseau peu profond à la campagne, bord de l'eau dans une bambouseraie, cour aux murs blancs, fenêtre d'une vieille maison du sud, serre de fleurs en verre moderne, marches en pierre au bord du lac, route de montagne, bâtiment blanc au bord de la mer, toit-terrasse urbain, vieux bus, wagon de train à l'ancienne, chambre d'hôtes minimaliste, congélateur d'épicerie, lavage de fruits dans la rivière, banc à l'ombre des arbres, ruelle après la pluie, vieux pont, bord de piscine en été, bord de lac de roseaux, verger à la campagne, pavillon blanc, sous les feuilles de lotus. Moments aléatoires : vient de s'asseoir, se prépare à se lever, baisse la tête pour arranger la jupe, lève la main pour ajuster un chapeau, vent dans les cheveux, regarde derrière les feuilles, se penche pour toucher la surface de l'eau, pieds nus dans l'eau, marche lentement le long de la passerelle en bois, rêvasse à l'arrière du bateau, se tourne pour regarder au loin, lève la main pour arranger les cheveux après que le vent les a décoiffés, baisse la tête pour laver des fruits, fait une sieste près de la fenêtre, se retourne soudainement, yeux fermés au soleil, marche de l'ombre à la lumière du soleil, main sur la rambarde, balance les jambes assis sur des marches en pierre, utilise une énorme feuille de lotus pour se protéger du soleil, accroupi près de l'eau, se penche légèrement en arrière, se repose les mains au sol, pris accidentellement en passant devant l'objectif. Types de plans aléatoires : gros plan extrême du visage, plan serré épaule, plan poitrine, plan taille, plan genoux, portrait environnemental mi-corps, portrait environnemental corps entier, composition de petite figure dans un grand environnement. Longueurs focales aléatoires : 24 mm ultra grand-angle de près, 28 mm grand-angle, 35 mm portrait environnemental, 50 mm perspective naturelle, 85 mm portrait compressé, 105 mm téléobjectif voyeuriste longue distance. Positions de caméra aléatoires : angle très bas près de l'eau, contre-plongée sous une énorme feuille de lotus, angle bas au niveau du sol, contre-plongée sous la taille, candide à hauteur des yeux, légère plongée, plongée évidente, prise de vue d'en haut depuis des escaliers, plan de côté à travers les plantes, prise de vue derrière un cadre de porte, prise de vue de l'extérieur d'une fenêtre vers l'intérieur, plan longue distance depuis le premier rang d'un wagon, prise de vue de dos, perspective par-dessus l'épaule, angle hollandais, personne complètement décentrée, photographe caché derrière des objets environnementaux dans une perspective voyeuriste. Compositions aléatoires : espace négatif extrême, grande zone de ciel, grande zone d'eau, personne plaquée dans le tiers inférieur du cadre, personne placée à l'extrême côté, composition centrée mais obstruée par l'avant-plan, composition asymétrique, composition en diagonale, lignes de fuite en perspective, d'énormes objets naturels appuyant sur la personne, portrait environnemental à petite échelle, avant-plan occupant un tiers du cadre, avant-plan occupant la moitié du cadre, regard à travers les interstices des plantes, cadrage par une porte, cadrage par une fenêtre, feuilles de lotus formant un cadre circulaire naturel, découpage géométrique du cadre par l'architecture. Avant-plans aléatoires : fleurs de lotus complètement floues, énormes feuilles de lotus, feuilles d'arbres, feuilles de bambou, rideaux blancs, reflets dans le verre, reflets dans l'eau, pétales, roseaux, cadres de porte, cadres de fenêtre, vitres de voiture, sièges de bus, rideaux en plastique transparent, rambardes, bords de murs blancs, branches humides. L'avant-plan doit naturellement s'immiscer dans le cadre, formant une obstruction évidente ; ne montrez pas tous les éléments complètement. Éclairages aléatoires : lumière dure de midi en plein été, lumière tachetée d'ombre d'arbre, contre-jour latéral d'après-midi, contre-jour bas du soir, lumière diffuse claire après la pluie, lumière naturelle à fort contraste près de la fenêtre, lumière de remplissage par réflexion sur l'eau, lumière réfléchie par un mur blanc, fines ombres et lumières formées à travers les feuilles, hautes lumières partiellement surexposées, personne à la limite de la lumière et de l'ombre, arrière-plan lumineux avec personne légèrement sombre, visage de la personne éclairé par une seule petite tache de soleil. Couleurs aléatoires mais retenues : bleu ciel + vert émeraude + blanc, vert foncé + blanc laiteux + teint, bleu d'eau + blanc + gris, vert cyan + blanc cassé + quelques fleurs roses, nuit bleu foncé + lumière blanche froide, gris-bleu après la pluie + vert humide. Le cadre conserve au maximum 3-4 blocs de couleur principaux, évitant le fouillis multicolore. États photographiques aléatoires : candide naturel, non posé, capture accidentelle par le photographe, personne complètement inconsciente de l'objectif, léger flou de mouvement, flou partiel, effet de reflet fantôme sur le verre, véritable flare d'objectif, débordement de lumière sur les bords, légère surexposition, faible profondeur de champ, compression longue distance, distorsion grand-angle de près, grain naturel, léger bruit numérique, sensation instantanée d'un appareil photo portable. Exigences générales : photographie réaliste, forte texture photographique, portrait d'été oriental moderne, cadre propre, relations d'échelle grandes et claires, couches spatiales distinctes, pas d'ambiance studio, pas de prise de vue en studio commercial, pas de pose standard d'influenceur, pas tous les sujets regardant la caméra, pas de portraits centrés conventionnels, pas d'accessoires complexes, pas d'arrière-plans encombrés, pas de lissage excessif de la peau, pas de peau plastique. Chaque image doit combiner aléatoirement différentes scènes, styles vestimentaires, moments, types de plans, longueurs focales, positions de caméra, compositions, avant-plans et éclairages, en privilégiant les positions de caméra non conventionnelles et une sensation de prise candide accidentelle ; évitez la répétition entre les images d'un même lot.

Version Compétence

Dépôt open source :

https://github.com/vibeshotclub/vsc-skills/tree/main/vibeshot-candid-photography

Il n'y a pas de magie noire dans la version Compétence elle-même.

Le cœur est de continuer à augmenter l'épaisseur des pools de variables sur la base du cadre ci-dessus, permettant plus de combinaisons entre différentes variables.

Je suis sûr que vous, étant intelligent, pouvez déjà apprendre par analogie.

Enfin, laissez-moi vous présenter la communauté sur laquelle je travaille, VibeShotClub :

C'est un lieu de rassemblement pour les créateurs visuels AIGC qui bricolent vraiment sur le long terme.

Nous continuerons à organiser et à partager des Prompts, des Compétences, des workflows, des techniques de modèles et des cas excellents produits par la communauté.

Si vous aussi vous jouez sérieusement avec les images IA, les vidéos IA, ou construisez votre propre workflow créatif, vous êtes les bienvenus pour venir visiter.

Remixer dans YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Pour les créateurs

Transformez votre Markdown en un article 𝕏 impeccable

Quand vous publiez vos propres textes longs, la mise en forme 𝕏 des images, tableaux et blocs de code est pénible. YouMind transforme un brouillon Markdown complet en un article 𝕏 impeccable, prêt à publier.

Essayer Markdown vers 𝕏

D'autres patterns à décoder

Articles viraux récents

Explorer plus d'articles viraux