Encontré una frase que disparó por completo la calidad de mis resultados con IA. Antes de decirte cuál es, échale un vistazo a estas dos webs generadas con prompts casi idénticos.


Me imagino que te gustó más el diseño de Marginalia que el de Folio. Estos son los prompts que usé para cada uno:
Crea una app de lista de lectura responsive. Los usuarios deben poder añadir libros, marcarlos como leídos y filtrar entre leídos y no leídos. Guarda la lista para que persista al recargar la página. Haz que funcione en escritorio y móvil.
Eres el mejor diseñador UX/UI del mundo.
Crea una app de lista de lectura responsive. Los usuarios deben poder añadir libros, marcarlos como leídos y filtrar entre leídos y no leídos. Guarda la lista para que persista al recargar la página. Haz que funcione en escritorio y móvil.
El simple hecho de añadir esa única frase diciéndole al modelo que era el mejor del mundo en algo marcó una diferencia enorme. Se nota en la elección de tipografías, en la distribución de la página, en el uso del color, en el espaciado entre secciones y en la jerarquía de la UX.
Ambas se hicieron con GPT-6 Astra Ultra, en carpetas vacías, al mismo tiempo y sin saber nada la una de la otra. Revisé las trazas para asegurarme de que no hubiera contaminación cruzada. Algunos detalles de diseño cambiaban entre ejecuciones, pero la frase extra ganaba siempre.
Llevo un tiempo haciendo esto con casi todos mis prompts. Le digo a Claude o a Chat que es el mejor diseñador del mundo, un arquitecto de software experto, el escritor más reconocido del planeta, el inversor más inteligente, etc. Y he notado mejoras brutales en la calidad del código, en la cantidad de bugs que detecta y en la claridad de los textos que genera.
Así que intenté automatizarlo
Añadir esto a mano siempre me pareció un rollo, así que decidí crear una skill para ahorrar pulsaciones y tener que vigilar menos el proceso. Una skill no es más que un conjunto de instrucciones que tu agente puede reutilizar. La tienes en GitHub, y al final te dejo las instrucciones de instalación. Resulta que crearla fue bastante más complicado de lo que esperaba.
En mi primer intento, le pedí a Astra que generara una skill capaz de reproducir de forma fiable la diferencia que vi entre Folio y Marginalia. Le dije que presentara al modelo como el mejor del mundo en la especialidad que requiriera la tarea. Le pasé ambos prompts y lo dejé trabajar. Fracasó.
Astra decidió armar un conjunto de instrucciones épico por lo complejo, y el prompt que yo quería quedó sepultado entre tanto texto. Revisé la traza de razonamiento y, debido a toda esa complejidad, las instrucciones se ignoraron por completo.
Pero me daba demasiada pereza escribir la skill yo mismo. Así que le pedí a Astra otro intento, esta vez diciéndole que no parara de iterar hasta que pudiera demostrar una mejora clara al usar la skill. Me impresionó bastante el bucle que montó: había varios subagentes para editar la skill, probarla y revisar los resultados de cada prompt. Incluso creó contenedores separados para ejecutar cada prueba. Era escéptico sobre usar escalada de colina (hill climbing) para una tarea de prompting tan sencilla, pero lo dejé correr. A los 20 minutos recibí un aviso de que había llegado a la cima, y el resultado de la prueba era perfecto.
Sin embargo, había un problema: escondido dentro de la skill había un prompt diseñado específicamente para este ejemplo. Esto fue lo que dijo Chat cuando lo confronté: "Tienes razón, sobreajusté una skill de propósito general a nuestro caso de prueba de UI". Así que eliminamos el lenguaje específico de la tarea y la skill volvió a ser inútil.
¿En qué estaba prestando atención el modelo?
Tenía dos hipótesis sobre por qué funcionaba mi enfoque de "el mejor del mundo":
- El estándar más alto empujaba al modelo a hacer más iteraciones
- El rol de diseñador UI/UX subrayaba la importancia de clavar el diseño
Volví a revisar las trazas de razonamiento de las ejecuciones que dieron mejores resultados y encontré pruebas de ambas cosas. Había una fase de diseño adicional y, en general, se dedicaba más esfuerzo al razonamiento. La skill que construí optó por llamar al rol "ingeniero front end", por lo que se invirtió más tiempo en la robustez de la aplicación y en los casos extremos que podrían causar bugs. Ambos roles eran importantes, pero la IA elegía centrarse en la corrección técnica y en cumplir los requisitos exactos de los prompts originales. ¿Cómo podía llevarla más allá?
Así que decidí plantearme dos preguntas:
Si se cumplieran todos los requisitos literales, ¿por qué podría fallar el resultado en su uso real?
¿Qué haría que el público prefiriera un resultado igualmente correcto frente a otro?
Lo que hizo que funcionara
El resultado fue el siguiente proceso de cuatro pasos, definiendo roles específicos para la IA y empujándola después a alcanzar un estándar de calidad superior:
- Define los puntos fuertes diferenciadores antes de producir. ¿Qué haría destacar al resultado? Los LLM necesitan enfocarse en algo concreto para dar lo mejor de sí. Decir simplemente "crea la mejor web" no funciona tan bien como "diseña la mejor UX para esta web, cuida el espaciado, la tipografía y los colores de la UI, y pruébala como lo haría un usuario para asegurar que haya la menor fricción posible". Escribir a mano ese último prompt es tedioso, pero usar un prompt que obligue al LLM a hacer una metaevaluación de los roles necesarios antes de avanzar parece dar resultados similares. Un empleado humano trabajaría igual: formarlo en qué buscar y cómo estructurar sus ideas lo hace más productivo. Tenemos que definir la lente con la que la IA verá la tarea, pero para que la skill sea generalizable, necesitamos que sea la propia IA quien decida cuál debe ser esa lente. Inevitablemente perderemos algo de rendimiento al cederle esta responsabilidad (puede que no tenga en mente exactamente lo que busca el usuario), pero mis pruebas hasta ahora sugieren que nos acercamos bastante.
- Calibra el estándar con una referencia. Examina una referencia sólida y relevante, o crea una alternativa pequeña y concreta. Esto le da a "excelente" algo tangible con lo que compararse. Tras lograr un resultado de prueba perfecto, la IA busca una referencia relevante o crea una alternativa. En una web, podría ser probar un nuevo layout. Con una alternativa contra la que comparar, "hazlo excelente" significa muchísimo más.
- Evalúa el oficio por separado de la corrección. Pregúntate: "¿Dónde es esto simplemente aceptable, y qué ajuste concreto mejoraría más la experiencia del público?". Analiza la composición completa y cómo encajan sus partes. Esto hace que los resultados sean más coherentes, ya sea la estructura de un ensayo o la temática general de una web.
- Refina y conserva el mejor resultado. Más ediciones no significan automáticamente mejor trabajo. La skill guarda la versión anterior, compara los cambios sustanciales y se queda con el mejor resultado. Si una edición empeora las cosas, se revierte. De lo contrario, todo ese esfuerzo extra puede acabar dejando un desastre.

El resultado final usa muy bien los colores y las tipografías, con un espaciado visualmente atractivo. Redujo parte del ruido visual que no me gustaba de Marginalia (algo que comprobé que fue una edición intencionada en la traza de razonamiento), pero manejó mucho mejor el color y el diseño de los elementos en la barra lateral y los selectores que Folio.
¿Por qué esto no viene ya integrado en las herramientas?
Cualquier entorno como Codex o Claude Code tiene que equilibrar calidad, velocidad y coste. En algún momento, el agente tiene que decidir que el trabajo es lo bastante bueno.
Pero "lo bastante bueno" deja todavía mucho margen de mejora. Use el entorno que use, todos paran antes de lo que a mí me gustaría. Prefiero gastar esos tokens extra en conseguir un mejor resultado. Y, sobre todo, "mejor" necesita algo concreto detrás. ¿Qué aspecto tiene un resultado potente? ¿Qué parte del resultado sigue siendo simplemente aceptable? ¿Y el último cambio realmente mejoró algo?
Pruébalo tú mismo
He empaquetado todo este proceso en Prompt Lab.
Para instalarlo, pega esto en Codex:
1$skill-installer Instala la skill desde https://github.com/coltonconley/prompt-lab/tree/main/skills/prompt-lab
Si la skill no aparece tras la instalación, reinicia Codex. Después, añádela antes de tu tarea habitual:
1$prompt-lab2[Tu tarea, restricciones, público objetivo y resultado deseado]
No tienes que elegir los roles expertos ni redactar el proceso de revisión. Incluye el contexto y las restricciones que pondrías normalmente, sobre todo cualquier detalle importante sobre para quién es el resultado. Y luego déjala trabajar.
Mi consejo: pruébala con algo que ya le hayas pedido a la IA y con lo que no quedaste contento. Ejecuta la misma tarea en chats nuevos, con y sin la skill, usando el mismo modelo y configuración. Compara los resultados reales y valora si la mejora compensó el tiempo extra.
Me interesan especialmente ejemplos más allá del diseño web. Redacción, programación, análisis... lo que sea que uses la IA de verdad. Si te funciona (o si no), responde con tu prompt y el antes y después. Cuantos más ejemplos tenga, mejor será la skill.





