Da oggi, puoi essere anche tu un fotografo AI

144K
533
84
26
1.0K

TL;DR

Questo articolo fornisce un framework dettagliato per la fotografia AI, concentrandosi sulla casualità limitata attraverso pool di variabili per espressioni, scene e tecniche fotografiche, al fine di ottenere risultati realistici.

Come ho detto prima, se i retweet avessero superato i 100, avrei rilasciato questa Skill.

L'obiettivo è stato raggiunto; siete davvero tutti di grande supporto.

https://x.com/MANISH1027512/status/2094786658914930945

Bene, non mi limiterò a rilasciare la Skill; spiegherò anche la logica che c'è dietro. Dopo aver letto questo, potrai diventare un fotografo AI e persino espandere il tuo stile personale di skill.

古一 - inline image
古一 - inline image
古一 - inline image
古一 - inline image

Primo, il Framework del Prompt Principale

Una influencer coreana di Instagram, pelle chiara, figura prosperosa.

[Espressione] + [Stile di abbigliamento] + [Scena] + [Momento] + [Tecnica fotografica]

Tutto qui?

Sì, la struttura è fondamentalmente così semplice.

Ho continuato a ripetere a tutti: giocare con GPT-Image 2 non è come usare altri strumenti—non controllarlo eccessivamente.

Se definisci in modo rigido cosa indossa la persona, come tiene le mani, da che parte inclina la testa, da che angolo arriva la luce e cosa c'è esattamente sullo sfondo, GPT tende ad avere difficoltà con richieste contrastanti. Cercherà di soddisfare tutto, ma questo può causare conflitti di rendering (ad esempio, è così che si genera il rumore).

Quindi, controlla i punti di ancoraggio chiave e delega appropriatamente il resto al modello.

Ma delegare non significa semplicemente dire "tutto è casuale".

Ciò che è veramente importante è:

Prepara un set sufficientemente ricco di valori enumerati per i punti di ancoraggio chiave.

Ad esempio, se dici al modello "espressione casuale", tenderà a ripetere le stesse poche espressioni più comuni.

Ma se gli fornisci:

Indifferente e perso nel vuoto, leggermente socchiuso, guarda in basso distratto, non riesce a trattenere una risata, si volta improvvisamente, un breve momento di smarrimento, un'espressione naturale colpita dal sole, la pigrizia del risveglio...

I confini della casualità sei tu a definirli.

Questa è anche quella che io considero una grande differenza tra una Skill e un Prompt normale.

Cosa Fa una Skill?

In realtà non è così misterioso.

Si tratta di arricchire continuamente queste variabili chiave in pool di variabili / banche di materiali.

Ad esempio:

Pool di Espressioni

Pool di Stili di Abbigliamento

Pool di Scene

Pool di Momenti

Pool di Tipi di Inquadratura

Pool di Lunghezze Focali

Pool di Posizioni della Fotocamera

Pool di Composizioni

Pool di Primi Piani

Pool di Illuminazione

Durante la generazione, si ricombina da questi pool.

Puoi intenderlo come una sorta di casualità vincolata:

Non si lascia il modello a indovinare alla cieca, né si predefinisce ogni pixel.

Questa è una logica di base molto comune per molte Skill di generazione di immagini oggi.

Struttura + Pool di Variabili.

Ecco una Versione da Eseguire Direttamente in ChatGPT

Copia quanto segue ed è praticamente pronto all'uso:

n=10, 9:16 fotografia di ritratto spontanea realistica. Il soggetto è fissato come: una influencer coreana di Instagram con grande presenza davanti alla fotocamera, pelle chiara e figura prosperosa. Espressioni casuali: indifferente e perso nel vuoto, leggermente socchiuso, espressione naturale colpita dalla luce del sole, un mezzo sorriso, guarda in basso distratto, occhi chiusi per sentire il vento, si volta improvvisamente, guarda in lontananza, non riesce a trattenere una risata, la pigrizia del risveglio, una pausa naturale quando viene colto, un leggero cipiglio, pensieroso, un breve momento di smarrimento. Stili di abbigliamento casuali: stile BM, stile puro desiderio, stile matrigna, stile maturo, stile Chanel, stile casa, stile coreano leggero e maturo, stile francese pigro, stile minimalista freddo, stile Old Money, stile vacanza, stile pendolare urbano, stile dolce e cool, stile Y2K, stile privato dei gruppi femminili coreani, look acqua e sapone di alta gamma, abiti privati di alta gamma a bassa saturazione, stile privato rilassato. Scene casuali: stagno di loti di mezza estate, vecchia barca di legno, passerella di legno sul lago, ruscello di campagna poco profondo, riva del bosco di bambù, cortile con muro bianco, finestra di una vecchia casa del sud, serra di vetro moderna, gradini di pietra sul lago, strada di montagna, edificio bianco sul mare, tetto della città, vecchio autobus, vagone di un treno vecchio stile, B&B minimalista, congelatore del minimarket, lavare la frutta al fiume, panca all'ombra di un albero, vicolo dopo la pioggia, vecchio molo, bordo piscina estivo, canneto sul lago, frutteto di campagna, padiglione bianco, sotto le foglie di loto. Momenti casuali: appena seduto, si prepara ad alzarsi, guarda in basso per sistemare la gonna, alza una mano per aggiustare un cappello, vento che scompiglia i capelli, sbircia da dietro le foglie, si china per toccare la superficie dell'acqua, a piedi nudi nell'acqua, cammina lentamente lungo la passerella di legno, fissa perso a poppa della barca, si gira per guardare in lontananza, alza una mano per sistemare i capelli scompigliati dal vento, guarda in basso per lavare la frutta, sonnecchia vicino alla finestra, si volta improvvisamente, occhi chiusi al sole, cammina dall'ombra alla luce del sole, mano sulla ringhiera, dondola le gambe seduto sui gradini di pietra, usa un'enorme foglia di loto per ripararsi dal sole, si accovaccia vicino all'acqua, si sporge leggermente all'indietro, riposa con le mani a terra, catturato accidentalmente mentre passa davanti all'obiettivo. Tipi di inquadratura casuali: primissimo piano del viso, primo piano alle spalle, primo piano al petto, mezzo primo piano alla vita, mezzo campo sopra il ginocchio, ritratto ambientale a mezzo busto, ritratto ambientale a figura intera, composizione con figura in piccolo formato in grande ambiente. Lunghezze focali casuali: 24mm grandangolo estremo a distanza ravvicinata, 28mm grandangolo, 35mm ritratto ambientale, 50mm prospettiva naturale, 85mm ritratto compresso, 105mm teleobiettivo voyeuristico a lunga distanza. Posizioni della fotocamera casuali: angolazione molto bassa vicino all'acqua, angolazione bassa guardando in alto da sotto un'enorme foglia di loto, angolazione bassa a livello del suolo, angolazione bassa sotto la vita, candid a livello degli occhi, leggera angolazione alta, angolazione alta evidente, sparare dall'alto delle scale, ripresa laterale attraverso le piante, sparare da dietro lo stipite di una porta, sparare all'interno dall'esterno di una finestra, ripresa a lunga distanza dalla fila anteriore di un vagone, sparare da dietro la persona, prospettiva sopra la spalla, angolo olandese, persona completamente fuori centro, fotografo nascosto dietro oggetti ambientali in una prospettiva voyeuristica. Composizioni casuali: spazio negativo estremo, grande area di cielo, grande area d'acqua, persona schiacciata nel terzo inferiore dell'inquadratura, persona posizionata al bordo estremo, composizione centrale ma bloccata dal primo piano, composizione asimmetrica, composizione diagonale, linee guida prospettiche, enormi oggetti naturali che premono sulla persona, ritratto ambientale in piccolo formato, primo piano che occupa un terzo dell'inquadratura, primo piano che occupa metà dell'inquadratura, sbirciare attraverso fessure tra le piante, incorniciatura di porte, incorniciatura di finestre, foglie di loto che formano una cornice circolare naturale, taglio geometrico architettonico dell'inquadratura. Primi piani casuali: fiori di loto completamente fuori fuoco, enormi foglie di loto, foglie di alberi, foglie di bambù, tende bianche, riflessi di vetro, riflessi d'acqua, petali, canne, stipiti di porte, telai di finestre, vetri di auto, sedili di autobus, tende di plastica trasparente, ringhiere, bordi di muri bianchi, rami bagnati. Il primo piano deve intromettersi naturalmente nell'inquadratura, formando un'ostruzione evidente; non mostrare tutti gli elementi completamente. Illuminazione casuale: forte luce dura di mezzogiorno d'estate, luce screziata all'ombra degli alberi, controluce laterale pomeridiano, controluce a bassa angolazione serale, luce diffusa chiara dopo la pioggia, luce naturale ad alto contrasto vicino alla finestra, luce di riempimento del riflesso della superficie dell'acqua, luce di riflesso del muro bianco, luce e ombra fini formate attraverso le foglie, luci parzialmente sovraesposte, persona al confine tra luce e ombra, sfondo luminoso con persona leggermente scura, viso della persona illuminato solo da un piccolo fascio di luce solare. Colori casuali ma contenuti: cielo blu + verde smeraldo + bianco, verde scuro + bianco latte + tonalità della pelle, blu acqua + bianco + grigio, verde ciano + bianco sporco + qualche fiore rosa, notte blu scuro + luce bianca fredda, grigio-blu dopo la pioggia + verde bagnato. L'inquadratura trattiene al massimo 3-4 blocchi di colore principali, evitando il disordine multicolore. Stati fotografici casuali: candid naturale, non posato, cattura accidentale da parte del fotografo, persona completamente ignara dell'obiettivo, leggera sfocatura da movimento, parziale fuori fuoco, sdoppiamento del riflesso del vetro, vero flare dell'obiettivo, leggero trabocco dei bordi, leggera sovraesposizione, profondità di campo ridotta, compressione a lunga distanza, distorsione grandangolare a distanza ravvicinata, grana naturale, leggero rumore digitale, la sensazione istantanea di una fotocamera portatile. Requisiti generali: fotografia realistica, forte texture fotografica, ritratto estivo orientale moderno, inquadratura pulita, chiare relazioni su larga scala, strati spaziali distinti, nessuna sensazione da studio, nessuna ripresa da studio commerciale, nessuna posa standard da influencer, non tutti i soggetti guardano la fotocamera, nessun ritratto centrato convenzionale, nessun oggetto di scena complesso, nessuno sfondo disordinato, nessuna eccessiva levigatura della pelle, nessuna pelle di plastica. Ogni immagine deve combinare casualmente scene, stili di abbigliamento, momenti, tipi di inquadratura, lunghezze focali, posizioni della fotocamera, composizioni, primi piani e illuminazione diversi, dando priorità a posizioni della fotocamera non convenzionali e a una sensazione di cattura accidentale; evitare la ripetizione tra le immagini nello stesso lotto.

Versione Skill

Repository open source:

https://github.com/vibeshotclub/vsc-skills/tree/main/vibeshot-candid-photography

Non c'è magia nera nella versione Skill in sé.

Il nucleo è continuare ad aumentare lo spessore dei pool di variabili basandosi sul framework sopra, consentendo più combinazioni tra diverse variabili.

Credo che tu, essendo intelligente, possa già imparare per analogia.

Infine, lascia che ti presenti la community su cui ho lavorato, VibeShotClub:

Questo è un punto d'incontro per creatori visivi AIGC che stanno davvero armeggiando a lungo termine.

Continueremo a organizzare e condividere Prompt, Skill, flussi di lavoro, tecniche di modelli e casi eccellenti prodotti dalla community.

Se anche tu stai giocando seriamente con immagini AI, video AI o stai costruendo il tuo flusso di lavoro creativo, sei il benvenuto a venire a trovarci.

Rielabora in YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Per i creator

Trasforma il tuo Markdown in un articolo 𝕏 pulito

Quando pubblichi i tuoi testi lunghi, formattare immagini, tabelle e blocchi di codice per 𝕏 è una seccatura. YouMind trasforma un'intera bozza Markdown in un articolo 𝕏 pulito e pronto da pubblicare.

Prova Markdown verso 𝕏

Altri pattern da decodificare

Articoli virali recenti

Esplora altri articoli virali