Como eu disse antes, se os retweets ultrapassassem 100, eu lançaria esta Skill.
A meta foi atingida; todos são realmente muito solidários.
https://x.com/MANISH1027512/status/2094786658914930945
Certo, não vou apenas lançar a Skill; também vou explicar a lógica por trás dela. Depois de ler isto, você pode se tornar um fotógrafo de IA e até expandir seu próprio estilo de habilidades.




Primeiro, a Estrutura Central do Prompt
Uma influenciadora coreana do Instagram, pele clara, figura exagerada.
[Expressão] + [Estilo de Roupa] + [Cena] + [Momento] + [Técnica Fotográfica]
É só isso?
Sim, o esqueleto é basicamente simples assim.
Venho repetindo para todos: brincar com o GPT-Image 2 não é como outras ferramentas—não tente controlar demais.
Se você definir estritamente o que a pessoa veste, como as mãos estão posicionadas, para que lado a cabeça inclina, de que ângulo a luz vem e exatamente o que está no fundo, o GPT tende a ter dificuldade com demandas conflitantes. Ele tentará satisfazer tudo, mas isso pode causar conflitos de renderização (por exemplo, é assim que o ruído é gerado).
Então, controle os pontos de ancoragem principais e delegue o restante adequadamente ao modelo.
Mas delegar não significa apenas dizer "tudo é aleatório".
O que é realmente importante é:
Prepare um conjunto suficientemente denso de valores enumerados para os pontos de ancoragem principais.
Por exemplo, se você disser ao modelo "expressão aleatória", ele facilmente repetirá algumas das mais comuns.
Mas se você der a ele:
Indiferente e distraído, levemente semicerrando os olhos, olhando para baixo e distraído, sem conseguir conter o riso, olhando para trás de repente, um breve momento de perda, uma expressão natural queimada pelo sol, a preguiça de acordar...
Os limites da aleatoriedade são definidos por você.
Isso também é o que entendo como uma grande diferença entre uma Skill e um Prompt comum.
O que uma Skill está Fazendo?
Na verdade, não é tão misterioso assim.
Trata-se de continuamente engrossar essas variáveis-chave em pools de variáveis / bancos de materiais.
Por exemplo:
Pool de Expressões
Pool de Estilos de Roupa
Pool de Cenas
Pool de Momentos
Pool de Tipos de Enquadramento
Pool de Distâncias Focais
Pool de Posições da Câmera
Pool de Composições
Pool de Primeiro Plano
Pool de Iluminação
Ao gerar, você recombina a partir desses pools.
Você pode entender isso como um tipo de aleatoriedade limitada:
Não é deixar o modelo adivinhar cegamente, nem é pré-definir cada pixel.
Esta é uma lógica subjacente muito comum para muitas Skills de geração de imagem atualmente.
Estrutura + Pools de Variáveis.
Aqui está uma Versão para Executar Diretamente no ChatGPT
Copie o seguinte e está basicamente pronto para uso:
n=10, 9:16 retrato fotográfico espontâneo de vida real. O sujeito é fixado como: uma influenciadora coreana do Instagram com ótima presença de câmera, pele clara e figura exagerada. Expressões aleatórias: indiferente e distraída, levemente semicerrando os olhos, expressão natural queimada pela luz do sol, um meio sorriso, olhando para baixo e distraída, olhos fechados sentindo o vento, olhando para trás de repente, olhando para cima ao longe, sem conseguir conter o riso, a preguiça de acordar, uma pausa natural ao ser fotografada, uma leve carranca, pensativa, um breve momento de perda. Estilos de roupa aleatórios: estilo BM, estilo desejo puro, estilo madrasta, estilo maduro, estilo Chanel, estilo casa, estilo coreano leve maduro, estilo francês preguiçoso, estilo frio minimalista, estilo Old Money, estilo férias, estilo urbano de transporte, estilo doce e cool, estilo Y2K, estilo privado de girl group coreano, visual elegante de água pura, roupas privadas elegantes de baixa saturação, estilo privado relaxado. Cenas aleatórias: lago de lótus no meio do verão, barco de madeira velho, passarela de madeira à beira do lago, riacho raso no campo, margem de rio no bosque de bambu, pátio de parede branca, janela de casa antiga no sul, casa de vidro moderna, degraus de pedra à beira do lago, estrada de montanha, prédio branco à beira-mar, terraço urbano, ônibus velho, vagão de trem antigo, pousada minimalista, freezer de loja de conveniência, lavando frutas no rio, banco sob a sombra de uma árvore, beco depois da chuva, cais velho, beira da piscina no verão, lagoa de juncos, pomar no campo, pavilhão branco, sob folhas de lótus. Momentos aleatórios: acabou de sentar, se preparando para levantar, olhando para baixo para arrumar a saia, levantando a mão para ajustar um chapéu, vento soprando o cabelo, espiando por trás das folhas, se curvando para tocar a superfície da água, pisando descalço na água, andando devagar pela passarela de madeira, divagando na popa do barco, virando-se para olhar ao longe, levantando a mão para arrumar o cabelo depois que o vento o bagunçou, olhando para baixo para lavar frutas, cochilando perto da janela, olhando para trás de repente, olhos fechados tomando sol, andando da sombra para a luz do sol, mão no corrimão, balançando as pernas sentada em degraus de pedra, usando uma folha de lótus gigante para bloquear o sol, agachada perto da água, inclinando-se ligeiramente para trás, descansando com as mãos no chão, capturada acidentalmente ao passar pela lente. Tipos de enquadramento aleatórios: close extremo do rosto, close do ombro, close do peito, plano médio da cintura para cima, plano médio acima do joelho, retrato ambiental de meio corpo, retrato ambiental de corpo inteiro, composição de figura em pequena escala em grande ambiente. Distâncias focais aleatórias: 24mm ultra grande angular de perto, 28mm grande angular, 35mm retrato ambiental, 50mm perspectiva natural, 85mm retrato comprimido, 105mm teleobjetiva voyeurística de longa distância. Posições da câmera aleatórias: ângulo muito baixo perto da água, ângulo baixo olhando para cima debaixo de uma folha de lótus gigante, ângulo baixo ao nível do chão, ângulo baixo abaixo da cintura, espontâneo ao nível dos olhos, ângulo alto leve, ângulo alto óbvio, fotografando de cima das escadas, foto lateral através de plantas, fotografando de trás de uma moldura de porta, fotografando para o interior de fora de uma janela, foto de longa distância da fileira da frente de um vagão, fotografando de trás da pessoa, perspectiva por cima do ombro, ângulo holandês, pessoa completamente descentralizada, fotógrafo escondido atrás de objetos ambientais em uma perspectiva voyeurística. Composições aleatórias: espaço negativo extremo, grande área de céu, grande área de água, pessoa pressionada no terço inferior do quadro, pessoa colocada na extremidade lateral, composição central mas bloqueada pelo primeiro plano, composição assimétrica, composição diagonal, linhas guia de perspectiva, objetos naturais enormes pressionando a pessoa, retrato ambiental de pequena escala, primeiro plano ocupando um terço do quadro, primeiro plano ocupando metade do quadro, espiando por lacunas de plantas, moldura de porta, moldura de janela, folhas de lótus formando uma moldura circular natural, corte geométrico arquitetônico do quadro. Primeiros planos aleatórios: flores de lótus completamente desfocadas, folhas de lótus enormes, folhas de árvore, folhas de bambu, cortinas brancas, reflexos de vidro, reflexos de água, pétalas, juncos, molduras de porta, molduras de janela, vidro de carro, assentos de ônibus, cortinas de plástico transparente, corrimãos, bordas de paredes brancas, galhos molhados. O primeiro plano deve invadir naturalmente o quadro, formando obstrução óbvia; não mostre todos os elementos completamente. Iluminação aleatória: luz forte do meio-dia de verão, luz salpicada de sombra de árvore, contraluz lateral da tarde, contraluz de ângulo baixo da noite, luz difusa clara depois da chuva, luz natural de alto contraste perto da janela, luz de preenchimento de reflexo da superfície da água, luz de reflexo de parede branca, luz e sombra finas formadas através de folhas, realces parcialmente superexpostos, pessoa no limite da luz e sombra, fundo claro com pessoa ligeiramente escura, rosto da pessoa iluminado por apenas um pequeno pedaço de luz solar. Cores aleatórias, mas contidas: céu azul + verde esmeralda + branco, verde escuro + branco leitoso + tom de pele, azul água + branco + cinza, verde ciano + off-white + algumas flores rosa, noite azul escura + luz branca fria, cinza-azulado depois da chuva + verde molhado. O quadro retém no máximo 3-4 blocos de cor principais, evitando confusão multicolorida. Estados fotográficos aleatórios: espontâneo natural, não posado, captura acidental pelo fotógrafo, pessoa completamente alheia à lente, leve desfoque de movimento, desfoque parcial, fantasma de reflexo de vidro, flare de lente real, estouro de borda de realce, leve superexposição, profundidade de campo rasa, compressão de longa distância, distorção grande angular de perto, granulação natural, leve ruído digital, a sensação instantânea de uma câmera portátil. Requisitos gerais: fotografia de vida real, forte textura fotográfica, retrato moderno de verão oriental, quadro limpo, relações de grande escala claras, camadas espaciais distintas, sem sensação de estúdio, sem fotografia comercial de estúdio, sem pose padrão de influenciador, nem todos os sujeitos olhando para a câmera, sem retratos centrados convencionais, sem adereços complexos, sem fundos desordenados, sem suavização excessiva da pele, sem pele plástica. Cada imagem deve combinar aleatoriamente diferentes cenas, estilos de roupa, momentos, tipos de enquadramento, distâncias focais, posições da câmera, composições, primeiros planos e iluminação, priorizando posições de câmera não convencionais e uma sensação de captura acidental; evite repetição entre imagens no mesmo lote.
Versão da Skill
Repositório de código aberto:
https://github.com/vibeshotclub/vsc-skills/tree/main/vibeshot-candid-photography
Não há magia negra na versão da Skill em si.
O núcleo é continuar aumentando a densidade dos pools de variáveis com base na estrutura acima, permitindo mais combinações entre diferentes variáveis.
Acredito que você, sendo inteligente, já pode aprender por analogia.
Finalmente, deixe-me apresentar a comunidade em que tenho trabalhado, VibeShotClub:
Este é um ponto de encontro para criadores visuais de AIGC que estão realmente mexendo a longo prazo.
Continuaremos organizando e compartilhando Prompts, Skills, fluxos de trabalho, técnicas de modelo e excelentes casos produzidos pela comunidade.
Se você também está seriamente brincando com imagens de IA, vídeos de IA ou construindo seu próprio fluxo de trabalho criativo, você é bem-vindo para vir e visitar.





