De agora em diante, você também pode ser um fotógrafo de IA

@MANISH1027512
CHINÊS03 de set. de 2026
144K
533
84
26
1.0K

TL;DR

Este artigo apresenta um framework detalhado para fotografia com IA, focando na aleatoriedade limitada por meio de pools de variáveis para expressões, cenas e técnicas de câmera para alcançar resultados realistas.

Como eu disse antes, se os retweets ultrapassassem 100, eu lançaria esta Skill.

A meta foi atingida; todos são realmente muito solidários.

https://x.com/MANISH1027512/status/2094786658914930945

Certo, não vou apenas lançar a Skill; também vou explicar a lógica por trás dela. Depois de ler isto, você pode se tornar um fotógrafo de IA e até expandir seu próprio estilo de skills.

古一 - inline image
古一 - inline image
古一 - inline image
古一 - inline image

Primeiro, a Estrutura Central do Prompt

Uma influenciadora coreana do Instagram, pele clara, figura exagerada.

[Expressão] + [Estilo de Roupa] + [Cena] + [Momento] + [Técnica Fotográfica]

É só isso?

Sim, o esqueleto é basicamente simples assim.

Tenho enfatizado repetidamente para todos: usar o GPT-Image 2 não é como outras ferramentas—não tente controlar demais.

Se você definir estritamente o que a pessoa veste, como as mãos estão posicionadas, para que lado a cabeça inclina, de que ângulo a luz vem e exatamente o que está no fundo, o GPT tende a ter dificuldades com demandas conflitantes. Ele tentará satisfazer tudo, mas isso pode causar conflitos de renderização (por exemplo, é assim que o ruído é gerado).

Então, controle os pontos-chave de ancoragem e delegue o restante adequadamente ao modelo.

Mas delegar não significa apenas dizer "tudo é aleatório."

O que é realmente importante é:

Prepare um conjunto suficientemente robusto de valores enumerados para os pontos-chave de ancoragem.

Por exemplo, se você disser ao modelo "expressão aleatória", ele facilmente repete algumas das mais comuns.

Mas se você der a ele:

Indiferente e distraído, levemente semicerrando os olhos, olhando para baixo e disperso, sem conseguir conter o riso, olhando para trás de repente, um breve momento de perda, uma expressão natural queimada pelo sol, a preguiça de acabar de acordar...

Os limites da aleatoriedade são definidos por você.

Isso também é o que entendo como uma grande diferença entre uma Skill e um Prompt comum.

O que uma Skill está fazendo?

Na verdade, não é tão misterioso assim.

É sobre continuamente enriquecer essas variáveis-chave em pools de variáveis / bancos de materiais.

Por exemplo:

Pool de Expressões

Pool de Estilos de Roupa

Pool de Cenas

Pool de Momentos

Pool de Tipos de Enquadramento

Pool de Distâncias Focais

Pool de Posições da Câmera

Pool de Composições

Pool de Primeiro Plano

Pool de Iluminação

Ao gerar, você recombina a partir desses pools.

Você pode entender isso como um tipo de aleatoriedade limitada:

Não é deixar o modelo adivinhar cegamente, nem é pré-definir cada pixel.

Esta é uma lógica subjacente muito comum para muitas Skills de geração de imagem atualmente.

Estrutura + Pools de Variáveis.

Aqui está uma Versão para Executar Diretamente no ChatGPT

Copie o seguinte e já está basicamente pronto para usar:

n=10, 9:16 fotografia de retrato espontâneo e realista. O sujeito é fixo como: uma influenciadora coreana do Instagram com ótima presença de câmera, pele clara e figura exagerada. Expressões aleatórias: indiferente e distraído, levemente semicerrando os olhos, expressão natural queimada pela luz do sol, meio sorriso, olhando para baixo e disperso, olhos fechados sentindo o vento, olhando para trás de repente, olhando para cima ao longe, sem conseguir conter o riso, a preguiça de acabar de acordar, uma pausa natural ao ser fotografada, uma leve franzida de testa, pensativa, um breve momento de perda. Estilos de roupa aleatórios: estilo BM, estilo desejo puro, estilo madrasta, estilo maduro, estilo Chanel, estilo caseiro, estilo coreano leve maduro, estilo francês preguiçoso, estilo frio minimalista, estilo Old Money, estilo férias, estilo commuter urbano, estilo doce e cool, estilo Y2K, estilo privado de girl group coreano, visual elegante de água pura, roupas privadas de alta gama com baixa saturação, estilo privado relaxado. Cenas aleatórias: lago de lótus no meio do verão, barco de madeira antigo, passarela de madeira à beira do lago, riacho raso no campo, margem do rio no bosque de bambu, pátio de parede branca, janela de casa antiga no sul, casa de vidro moderna, degraus de pedra à beira do lago, estrada de montanha, prédio branco à beira-mar, terraço urbano, ônibus antigo, vagão de trem antigo, pousada minimalista, freezer de loja de conveniência, lavando frutas no rio, banco sob a sombra de uma árvore, beco depois da chuva, cais antigo, beira da piscina no verão, lagoa de juncos, pomar no campo, pavilhão branco, sob folhas de lótus. Momentos aleatórios: acabou de se sentar, se preparando para levantar, olhando para baixo para arrumar a saia, levantando a mão para ajustar um chapéu, vento soprando o cabelo, espiando por trás das folhas, se curvando para tocar a superfície da água, pisando descalço na água, andando devagar pela passarela de madeira, distraída na popa do barco, virando-se para olhar ao longe, levantando a mão para arrumar o cabelo depois que o vento o bagunçou, olhando para baixo para lavar frutas, cochilando perto da janela, olhando para trás de repente, olhos fechados tomando sol, andando da sombra para a luz do sol, mão no corrimão, balançando as pernas sentada em degraus de pedra, usando uma folha de lótus enorme para bloquear o sol, agachada perto da água, inclinando-se ligeiramente para trás, descansando com as mãos no chão, capturada acidentalmente ao passar pela lente. Tipos de enquadramento aleatórios: close-up extremo do rosto, close-up do ombro, close-up do peito, plano médio da cintura para cima, plano médio acima do joelho, retrato ambiental de meio corpo, retrato ambiental de corpo inteiro, composição de figura em pequena escala em grande ambiente. Distâncias focais aleatórias: 24mm grande angular ultra curta distância, 28mm grande angular, 35mm retrato ambiental, 50mm perspectiva natural, 85mm retrato comprimido, 105mm teleobjetiva voyeurística de longa distância. Posições da câmera aleatórias: ângulo muito baixo perto da água, ângulo baixo olhando para cima de baixo de uma folha de lótus enorme, ângulo baixo ao nível do chão, ângulo baixo abaixo da cintura, espontâneo ao nível dos olhos, ângulo alto leve, ângulo alto óbvio, fotografando de cima de escadas, foto lateral através de plantas, fotografando de trás de uma porta, fotografando para dentro do interior de uma janela, foto de longa distância da fileira da frente de um vagão, fotografando por trás da pessoa, perspectiva por cima do ombro, Dutch Angle, pessoa completamente descentralizada, fotógrafo escondido atrás de objetos ambientais em uma perspectiva voyeurística. Composições aleatórias: espaço negativo extremo, grande área de céu, grande área de água, pessoa pressionada no terço inferior do quadro, pessoa colocada no lado extremo, composição central mas bloqueada pelo primeiro plano, composição assimétrica, composição diagonal, linhas guia de perspectiva, objetos naturais enormes pressionando a pessoa, retrato ambiental de pequena escala, primeiro plano ocupando um terço do quadro, primeiro plano ocupando metade do quadro, espiando por lacunas de plantas, moldura de porta, moldura de janela, folhas de lótus formando uma moldura circular natural, corte geométrico arquitetônico do quadro. Primeiros planos aleatórios: flores de lótus completamente desfocadas, folhas de lótus enormes, folhas de árvore, folhas de bambu, cortinas brancas, reflexos de vidro, reflexos de água, pétalas, juncos, molduras de porta, molduras de janela, vidro de carro, assentos de ônibus, cortinas de plástico transparente, corrimãos, bordas de paredes brancas, galhos molhados. O primeiro plano deve invadir naturalmente o quadro, formando obstrução óbvia; não mostre todos os elementos completamente. Iluminação aleatória: luz forte do meio-dia de verão, luz salpicada de sombra de árvore, contraluz lateral da tarde, contraluz de ângulo baixo da noite, luz difusa clara depois da chuva, luz natural de alto contraste perto da janela, luz de preenchimento de reflexo da superfície da água, luz de reflexo de parede branca, luz e sombra finas formadas através de folhas, realces parcialmente superexpostos, pessoa no limite da luz e sombra, fundo claro com pessoa ligeiramente escura, rosto da pessoa iluminado por apenas um pequeno feixe de luz solar. Cores aleatórias, mas contidas: céu azul + verde esmeralda + branco, verde escuro + branco leitoso + tom de pele, azul água + branco + cinza, verde ciano + off-white + algumas flores rosa, noite azul escura + luz branca fria, cinza-azulado depois da chuva + verde molhado. O quadro retém no máximo 3-4 blocos de cor principais, evitando confusão multicolorida. Estados fotográficos aleatórios: espontâneo natural, não posado, captura acidental pelo fotógrafo, pessoa completamente alheia à lente, leve desfoque de movimento, desfoque parcial, fantasma de reflexo de vidro, flare de lente real, transbordamento de realce de borda, leve superexposição, profundidade de campo rasa, compressão de longa distância, distorção grande angular de curta distância, granulação natural, leve ruído digital, a sensação instantânea de uma câmera portátil. Requisitos gerais: fotografia da vida real, forte textura fotográfica, retrato moderno de verão oriental, quadro limpo, relações claras de grande escala, camadas espaciais distintas, sem sensação de estúdio, sem fotografia comercial de estúdio, sem poses padrão de influenciador, nem todos os sujeitos olhando para a câmera, sem retratos centrados convencionais, sem adereços complexos, sem fundos desordenados, sem suavização excessiva da pele, sem pele plástica. Cada imagem deve combinar aleatoriamente diferentes cenas, estilos de roupa, momentos, tipos de enquadramento, distâncias focais, posições da câmera, composições, primeiros planos e iluminação, priorizando posições de câmera não convencionais e uma sensação de captura acidental e espontânea; evite repetição entre imagens no mesmo lote.

Versão da Skill

Repositório de código aberto:

https://github.com/vibeshotclub/vsc-skills/tree/main/vibeshot-candid-photography

Não há magia negra na versão da Skill em si.

O núcleo é continuar aumentando a espessura dos pools de variáveis com base na estrutura acima, permitindo mais combinações entre diferentes variáveis.

Acredito que você, sendo inteligente, já pode aprender por analogia.

Finalmente, deixe-me apresentar a comunidade em que tenho trabalhado, VibeShotClub:

Este é um ponto de encontro para criadores visuais de AIGC que estão realmente mexendo e experimentando a longo prazo.

Continuaremos a organizar e compartilhar Prompts, Skills, fluxos de trabalho, técnicas de modelo e excelentes casos produzidos pela comunidade.

Se você também está levando a sério a criação de imagens de IA, vídeos de IA ou construindo seu próprio fluxo de trabalho criativo, você é bem-vindo para vir e visitar.

Recriar no YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Para criadores

Transforme seu Markdown em um artigo 𝕏 impecável

Quando você publica seus próprios textos longos, formatar imagens, tabelas e blocos de código para o 𝕏 é uma dor de cabeça. O YouMind transforma um rascunho completo em Markdown em um artigo 𝕏 impecável e pronto para publicar.

Experimente Markdown para 𝕏

Mais padrões para decifrar

Artigos virais recentes

Explorar mais artigos virais