Encontrei uma frase que turbinou a qualidade das minhas entregas com IA. Antes de te contar qual é, dá uma olhada nestes dois sites gerados por prompts praticamente idênticos.


Imagino que você tenha gostado mais do design do Marginalia do que do Folio. Aqui estão os prompts que usei para cada um:
Crie um app responsivo de lista de leitura. Os usuários podem adicionar livros, marcá-los como lidos e filtrar entre lidos e não lidos. Salve a lista mesmo após atualizar a página. Faça funcionar no desktop e no celular.
Você é o melhor designer de UX/UI do mundo.
Crie um app responsivo de lista de leitura. Os usuários podem adicionar livros, marcá-los como lidos e filtrar entre lidos e não lidos. Salve a lista mesmo após atualizar a página. Faça funcionar no desktop e no celular.
Só de adicionar aquela única frase dizendo ao modelo que ele é o melhor do mundo em algo já fez uma diferença enorme. Dá para notar a mudança na escolha das fontes, no layout da página, no uso das cores, no espaçamento entre as seções e na hierarquia da UX.
Ambos usaram o GPT-6 Astra Ultra, em pastas vazias, criados ao mesmo tempo e sem nenhum conhecimento sobre o outro. Conferi os traces para garantir que não houve contaminação. Pequenas escolhas de design mudavam entre uma execução e outra, mas a frase extra venceu todas as vezes.
Venho fazendo isso na maioria dos meus prompts há um bom tempo. Costumo dizer ao Claude ou ao Chat que ele é o melhor designer do mundo, um arquiteto de software especialista, o escritor mais renomado do planeta, o investidor mais inteligente, etc. Notei grandes melhorias na qualidade do código, na quantidade de bugs detectados e na clareza dos textos produzidos.
Então tentei automatizar isso
Sempre achei tedioso adicionar essa parte manualmente, então decidi criar uma skill para economizar algumas teclas digitadas e precisar ficar menos vigiando o processo. Uma skill é apenas um conjunto de instruções que seu agente pode reutilizar. Você pode encontrá-la no GitHub, e deixei as instruções de instalação no final. Acontece que criar a skill deu bem mais trabalho do que eu imaginava.
Na minha primeira tentativa, pedi ao Astra para gerar uma skill capaz de reproduzir de forma consistente a diferença que vi entre o Folio e o Marginalia. Disse para enquadrar o modelo como o melhor do mundo na especialidade que a tarefa exigisse. Entreguei os dois prompts e deixei rolar. Deu errado.
O Astra decidiu criar um conjunto de instruções absurdamente complexo, e o prompt que eu queria acabou soterrado no meio de tudo. Dei uma olhada no reasoning trace e as instruções foram completamente ignoradas justamente por causa dessa complexidade toda.
Mas eu estava com muita preguiça para escrever a skill sozinho. Então pedi ao Astra para tentar de novo, desta vez dizendo para não parar de iterar até conseguir mostrar uma melhoria comprovada ao usar a skill. Fiquei realmente impressionado com o loop que ele criou: havia vários subagentes para editar a skill, testar a skill e revisar as saídas de cada prompt. Ele criou containers separados para rodar cada teste. Eu estava cético quanto a usar hill climbing para uma tarefa simples de prompting, mas deixei quieto. Depois de 20 minutos, recebi uma notificação de que o topo da colina havia sido alcançado, e o resultado do teste foi perfeito.
Porém, tinha um problema: escondido dentro da skill havia um prompt feito sob medida para aquele exemplo específico. Eis o que o Chat disse quando confrontado: "Você tem razão — eu superajustei (overfit) uma skill de propósito geral ao nosso caso de teste de UI". Então removemos a linguagem específica da tarefa, e a skill voltou a ser inútil.
No que o modelo estava prestando atenção?
Eu tinha duas hipóteses para explicar por que meu enquadramento de "melhor do mundo" funcionava:
- O padrão mais alto forçava o modelo a rodar mais iterações
- O papel de designer de UI/UX reforçava a importância de acertar no design
Voltei aos reasoning traces das execuções que trouxeram resultados melhores e encontrei evidências das duas coisas. Houve tanto a adição de uma fase de design quanto um gasto maior de raciocínio no geral. A skill que construí optou por chamar o papel de "engenheiro front-end" e, por isso, gastou mais tempo com a robustez do aplicativo e com casos extremos que poderiam causar bugs. Ambos os papéis eram importantes, mas a IA estava escolhendo focar na correção técnica e em atender exatamente aos requisitos dos prompts originais. Como eu poderia ir além?
Decidi então fazer duas perguntas:
Se todos os requisitos literais fossem atendidos, como o resultado ainda assim poderia falhar no seu objetivo?
O que faria o público preferir um resultado igualmente correto em vez de outro?
O que fez funcionar
O resultado foi o seguinte processo de quatro etapas, definindo papéis específicos para a IA assumir e depois empurrando-a para alcançar um padrão de entrega mais alto:
- Defina os pontos fortes antes de produzir. O que faria o resultado se destacar? LLMs precisam de um foco para entregar o melhor trabalho. Apenas dizer "crie o melhor site" não funciona tão bem quanto "projete a melhor UX para este site, preste atenção ao espaçamento, às fontes e às cores da UI, e teste como um usuário faria para garantir o mínimo possível de atrito". Escrever esse último prompt manualmente é chato, mas um prompt que força o LLM a fazer uma meta-avaliação dos papéis necessários antes de prosseguir parece gerar resultados parecidos. Um funcionário humano agiria de forma semelhante; treinar alguém sobre o que procurar e como estruturar o pensamento torna a pessoa mais produtiva. Precisamos definir a lente pela qual a IA vai enxergar a tarefa, mas, para que a skill seja generalizável, precisamos deixar a IA decidir qual deve ser essa lente. Inevitavelmente perderemos um pouco de desempenho ao ceder essa responsabilidade à IA (que talvez não tenha em mente as intenções exatas do usuário), mas meus testes com a skill até agora sugerem que chegamos bem perto.
- Calibre o padrão com uma referência. Analise uma referência forte e relevante ou crie uma pequena alternativa concreta. Isso dá ao conceito de "excelente" algo tangível para comparação. Depois de alcançar um resultado de teste perfeito, a IA encontra uma referência relevante ou cria uma alternativa. Para um site, isso poderia ser experimentar um novo layout. Com uma alternativa para comparar, "faça ficar excelente" passa a significar muito mais.
- Avalie o capricho separadamente da correção. Pergunte: "Onde isso está apenas aceitável, e qual refinamento específico melhoraria mais a experiência do público?". Avalie a composição inteira e como suas partes funcionam juntas. Isso deixa as entregas mais coerentes, seja na estrutura de um texto ou no tema geral de um site.
- Refine e mantenha o resultado mais forte. Mais edições não significam automaticamente um trabalho melhor. A skill preserva a versão anterior, compara as mudanças substanciais e mantém o resultado mais forte. Se uma edição piorar as coisas, ela é revertida. Caso contrário, todo esse esforço extra pode acabar deixando uma bagunça para trás.

O resultado final usa cores e fontes de forma bacana, com um espaçamento visualmente agradável. Reduziu um pouco daquele excesso de informação que eu não curtia no Marginalia (algo que confirmei ter sido uma edição intencional no reasoning trace), mas fez um trabalho melhor que o Folio no uso de cores e no design dos elementos da barra lateral e dos seletores.
Por que isso já não vem embutido nas ferramentas?
Toda ferramenta como Codex e Claude Code precisa equilibrar qualidade, velocidade e custo. Em algum momento, o agente tem que decidir que o trabalho está bom o suficiente.
Mas o "bom o suficiente" ainda deixa muito espaço para melhorias. Independentemente da ferramenta que eu use, todas param antes do que eu gostaria. Prefiro gastar tokens extras para obter um resultado melhor. E, o mais importante, "melhor" precisa de algo concreto por trás. Como é um resultado forte? Qual parte do resultado ainda está apenas aceitável? E a última alteração realmente melhorou alguma coisa?
Teste você mesmo
Empacotei todo esse processo no Prompt Lab.
Para instalar, cole isto no Codex:
1$skill-installer Instale a skill de https://github.com/coltonconley/prompt-lab/tree/main/skills/prompt-lab
Se a skill não aparecer após a instalação, reinicie o Codex. Depois, adicione-a antes da sua tarefa normal:
1$prompt-lab2[Sua tarefa, restrições, público-alvo e resultado desejado]
Você não precisa escolher os papéis de especialista nem detalhar o processo de revisão. Inclua o contexto e as restrições que normalmente colocaria, especialmente qualquer coisa importante sobre para quem é o resultado. Depois, deixe rolar.
Minha sugestão: teste em algo que você já pediu para a IA fazer e não ficou satisfeito. Rode a mesma tarefa em chats novos, com e sem a skill, usando o mesmo modelo e configurações. Compare as entregas reais e veja se a melhoria valeu o tempo extra.
Tenho interesse especial em exemplos além de design de sites. Redação, programação, análise, qualquer coisa para a qual você realmente use IA. Se funcionar para você (ou se não funcionar), responda com seu prompt e o antes e depois. Quanto mais exemplos eu tiver, melhor a skill pode ficar.





