Encontrei uma frase que turbinou a qualidade das minhas entregas com IA. Antes de te contar qual é, dá uma olhada nestes dois sites gerados por prompts praticamente idênticos.


Imagino que você tenha gostado mais do design do Marginalia do que do Folio. Aqui estão os prompts que usei para cada um:
Crie um app responsivo de lista de leitura. Os usuários podem adicionar livros, marcá-los como lidos e filtrar entre lidos e não lidos. Salve a lista mesmo quando a página for atualizada. Faça funcionar no desktop e no celular.
Você é o melhor designer de UX/UI do mundo.
Crie um app responsivo de lista de leitura. Os usuários podem adicionar livros, marcá-los como lidos e filtrar entre lidos e não lidos. Salve a lista mesmo quando a página for atualizada. Faça funcionar no desktop e no celular.
Só o fato de adicionar aquela única frase dizendo ao modelo que ele era o melhor do mundo naquilo já fez uma diferença enorme. Dá para notar a mudança na escolha das fontes, no layout da página, no uso das cores, no espaçamento entre as seções e na hierarquia da UX.
Ambos usaram o GPT-6 Astra Ultra, em pastas vazias, criados ao mesmo tempo e sem nenhum conhecimento sobre o outro. Conferi os traces para garantir que não houve contaminação. Algumas pequenas escolhas de design mudavam entre as execuções, mas a frase extra venceu todas as vezes.
Venho fazendo isso na maioria dos meus prompts há um bom tempo. Costumo dizer ao Claude ou ao Chat que ele é o melhor designer do mundo, um arquiteto de software especialista, o escritor mais renomado do planeta, o investidor mais inteligente, etc. Notei grandes melhorias na qualidade do código, na quantidade de bugs detectados e na clareza dos textos produzidos.
Então tentei automatizar isso
Sempre achei chato ter que adicionar isso manualmente, então decidi criar uma skill para economizar algumas teclas digitadas e precisar ficar menos tempo vigiando o processo. Uma skill nada mais é do que um conjunto de instruções que seu agente pode reutilizar. Você encontra ela no GitHub, e deixei as instruções de instalação no final. Acontece que criar essa skill deu bem mais trabalho do que eu imaginava.
Na minha primeira tentativa, pedi ao Astra para gerar uma skill capaz de reproduzir de forma consistente a diferença que vi entre o Folio e o Marginalia. Pedi para enquadrar o modelo como o melhor do mundo na especialidade que a tarefa exigisse. Entreguei os dois prompts e deixei ele trabalhar. Fracassou.
O Astra decidiu criar um conjunto de instruções absurdamente complicado, e o prompt que eu queria acabou soterrado no meio de tanta coisa. Dei uma olhada no reasoning trace e percebi que as instruções foram completamente ignoradas justamente por causa de toda essa complexidade.
Mas eu estava com muita preguiça para escrever a skill sozinho. Então fiz o Astra tentar de novo, só que dessa vez mandei não parar de iterar até conseguir mostrar uma melhoria evidente com o uso da skill. Fiquei genuinamente impressionado com o loop que ele criou: havia vários subagentes para editar a skill, testar a skill e revisar os resultados de cada prompt. Ele criou containers separados para rodar cada teste. Eu estava cético quanto a usar hill climbing para uma tarefa de prompting tão simples, mas deixei rolar. Depois de 20 minutos, recebi uma notificação de que o topo da colina havia sido alcançado, e o resultado do teste foi perfeito.
Porém, tinha um problema: escondido dentro da skill havia um prompt feito sob medida para aquele exemplo específico. Foi o que o Chat disse quando confrontado: "Você tem razão — eu superajustei (overfit) uma skill de propósito geral ao nosso caso de teste de UI." Então removemos a linguagem específica da tarefa, e a skill voltou a ser inútil.
No que o modelo estava prestando atenção?
Eu tinha duas hipóteses para explicar por que o enquadramento de "melhor do mundo" funcionava:
- O padrão mais alto forçava o modelo a rodar mais iterações
- O papel de designer de UI/UX reforçava a importância de acertar no design
Voltei aos reasoning traces das execuções que deram resultados melhores e encontrei evidências das duas coisas. Houve tanto a inclusão de uma fase de design quanto um gasto maior de raciocínio no geral. A skill que construí optou por chamar o papel de "engenheiro front-end" e, por isso, dedicou mais tempo à robustez do aplicativo e a casos extremos que poderiam causar bugs. Ambos os papéis eram importantes, mas a IA estava escolhendo focar na precisão técnica e em atender exatamente aos requisitos dos prompts originais. Como eu poderia levá-la além?
Então decidi fazer duas perguntas:
Se todos os requisitos literais fossem atendidos, como o resultado ainda assim poderia falhar no seu propósito?
O que faria o público preferir um resultado igualmente correto em vez de outro?
O que fez funcionar
O resultado foi o seguinte processo de quatro etapas, definindo papéis específicos para a IA assumir e depois empurrando-a para alcançar um padrão de entrega mais alto:
- Defina pontos fortes de destaque antes de produzir. O que faria o resultado se sobressair? LLMs precisam de um foco claro para entregar o melhor resultado possível. Apenas dizer "crie o melhor site" não funciona tão bem quanto "projete a melhor UX para este site, preste atenção ao espaçamento, às fontes e às cores da UI, e teste como um usuário faria para garantir o mínimo de atrito possível". Escrever esse último prompt manualmente é cansativo, mas um prompt que força o LLM a fazer uma meta-avaliação dos papéis necessários antes de prosseguir parece gerar resultados parecidos. Um funcionário humano agiria de forma semelhante; treinar alguém sobre o que procurar e como estruturar o pensamento torna a pessoa mais produtiva. Precisamos definir a lente pela qual a IA vai enxergar a tarefa, mas, para que a skill seja generalizável, precisamos deixar a IA decidir qual deve ser essa lente. Inevitavelmente perderemos um pouco de desempenho ao ceder essa responsabilidade à IA (que talvez não tenha em mente as intenções exatas do usuário), mas meus testes com a skill até agora sugerem que chegamos bem perto.
- Calibre o padrão com uma referência. Analise uma referência forte e relevante ou crie uma pequena alternativa concreta. Isso dá ao conceito de "excelente" algo tangível para comparação. Depois de alcançar um resultado de teste perfeito, a IA encontra uma referência relevante ou cria uma alternativa. No caso de um site, isso poderia ser experimentar um novo layout. Com uma alternativa para comparar, "faça ficar excelente" ganha muito mais peso.
- Avalie o capricho separadamente da precisão. Pergunte: "Onde isso está apenas aceitável, e qual refinamento específico melhoraria mais a experiência do público?" Avalie a composição como um todo e como suas partes funcionam juntas. Isso deixa as entregas mais coerentes, seja na estrutura de um texto ou no tema geral de um site.
- Refine e mantenha o resultado mais forte. Mais edições não significam automaticamente um trabalho melhor. A skill preserva a versão anterior, compara as mudanças substanciais e mantém o resultado mais forte. Se uma edição piorar as coisas, ela é revertida. Caso contrário, todo esse esforço extra pode acabar deixando uma bagunça para trás.

O resultado final usa cores e fontes de forma harmoniosa, com um espaçamento visualmente agradável. Reduziu parte daquela poluição visual que eu não curtia no Marginalia (algo que confirmei ter sido uma edição intencional no reasoning trace), mas fez um trabalho melhor que o Folio no uso de cores e no design dos elementos da barra lateral e dos seletores.
Por que isso já não vem embutido nas ferramentas?
Toda ferramenta como Codex e Claude Code precisa equilibrar qualidade, velocidade e custo. Em algum momento, o agente tem que decidir que o trabalho está bom o suficiente.
Mas o "bom o suficiente" ainda deixa muito espaço para melhorias. Independentemente da ferramenta que eu use, todas param antes do que eu gostaria. Prefiro gastar tokens extras para obter um resultado melhor. E, o mais importante, "melhor" precisa de algo concreto por trás. Como é um resultado forte? Qual parte do resultado ainda está apenas aceitável? E a última alteração realmente melhorou alguma coisa?
Teste você mesmo
Empacotei todo esse processo no Prompt Lab.
Para instalar, cole isto no Codex:
1$skill-installer Instale a skill de https://github.com/coltonconley/prompt-lab/tree/main/skills/prompt-lab
Se a skill não aparecer após a instalação, reinicie o Codex. Depois, adicione-a antes da sua tarefa normal:
1$prompt-lab2[Sua tarefa, restrições, público-alvo e resultado desejado]
Você não precisa escolher os papéis de especialista nem detalhar o processo de revisão. Inclua o contexto e as restrições que normalmente colocaria, especialmente qualquer informação importante sobre para quem é o resultado. Depois, deixe a mágica acontecer.
Minha sugestão: teste em algo que você já pediu para a IA fazer e não ficou satisfeito. Rode a mesma tarefa em chats novos, com e sem a skill, usando o mesmo modelo e configurações. Compare os resultados reais e veja se a melhoria valeu o tempo extra.
Tenho um interesse especial em exemplos que vão além do design de sites. Redação, programação, análise, qualquer coisa para a qual você realmente use IA. Se funcionar para você (ou se não funcionar), responda com seu prompt e o antes e depois. Quanto mais exemplos eu tiver, melhor a skill pode ficar.





