Los modelos se volvieron más inteligentes. Nuestras pilas de prompts se volvieron más viejas. Es hora de reemplazar el museo de instrucciones con un mapa pequeño, límites claros y una línea de meta.
Hace unos días, descubrí algo un poco incómodo:
Casi todos mis prompts, archivos de instrucción, reglas y habilidades estaban desactualizados.
No completamente inútiles. Solo escritos para otra generación de modelos.
Las pilas de prompts que ayudaban a los modelos antiguos a comportarse pueden hacer que GPT-5.6, Claude Fable 5, Claude Opus 5, Grok 4.5 y herramientas de codificación como Cursor sean más rígidos, más costosos y, a veces, simplemente peores.
Esta no es mi última religión de prompts. Anthropic advierte explícitamente que las habilidades escritas para modelos anteriores pueden ser demasiado prescriptivas para Fable 5 y pueden degradar la calidad de salida. OpenAI recomienda prompts más ligeros, menos instrucciones repetidas y descripciones de herramientas más simples.
Fue un poco vergonzoso de leer.
Desde el verano de 2025, he escrito más de 100,000 prompts. Eso es aproximadamente el conteo de tweets de toda la vida de Elon Musk, solo que con menos cohetes y más suites de pruebas fallidas.
Mis registros contienen alrededor de 15 millones de mensajes de modelo, incluyendo mensajes de asistente, llamadas a herramientas, subagentes y eventos de flujo de trabajo. Hasta el 26 de marzo, el total era de unos siete millones. Otros ocho millones llegaron en tres meses, en gran parte debido a la explosión de subagentes y flujos de trabajo en torno a los modelos de codificación más recientes.
Entonces pensé que sabía cómo escribir instrucciones.
Luego leí la nueva documentación y me di cuenta de que gran parte de lo que había aprendido se había convertido silenciosamente en deuda técnica.
Cómo se crea la deuda de prompts
Mi enfoque anterior era simple:
- El modelo cometía un error, así que agregaba una regla.
- Hacía una pregunta innecesaria, así que agregaba otra regla.
- Pasaba por alto un caso límite, así que agregaba tres ejemplos.
Cada adición parecía razonable por sí sola. Después de un año, el archivo de instrucción se parecía a ese cajón de cocina donde guardas doce cables viejos porque uno de ellos podría pertenecer todavía a algo importante.
El resultado fue una colección creciente de:
- instrucciones duplicadas
- ejemplos negativos
- reglas conflictivas
- soluciones para modelos antiguos
- pasos de verificación excesivos
- procedimientos detallados que aplicaban a una sola tarea
- ejemplos creados para corregir fallos que ya no existían
Los modelos antiguos a menudo necesitaban este andamiaje. Los modelos más nuevos siguen las instrucciones con más firmeza e infieren la intención de manera más confiable. Eso significa que también toman nuestro equipaje antiguo más en serio.
Construimos motores más inteligentes y luego llenamos el maletero con ladrillos.

Retrato en blanco y negro de alto contraste de una mujer joven rubia con un cuello de tortuga oscuro, en un estudio minimalista. Una sutil iluminación de borde separa su silueta de un fondo gris suave, mejorando la dimensionalidad. El estado de ánimo es introspectivo pero fuerte, encarnando un realismo atemporal. Claridad de formato medio digital Hasselblad X2D, inspirado en el fotoperiodismo del siglo XX.
El nuevo principio: Di menos, significa más
La respuesta no es escribir prompts diminutos y confiar ciegamente en el modelo.
Un prompt corto pero ambiguo sigue siendo un mal prompt.
El objetivo es un prompt de alta información en el que cada instrucción se gane su lugar.
Mis reglas actuales son:
- Enuncia cada instrucción una vez.
- Elimina repeticiones en los prompts del sistema, archivos de proyecto, habilidades, descripciones de herramientas y prompts de tareas.
- Prefiere una descripción clara del comportamiento deseado sobre una colección de casos de fallo.
- Mantén las restricciones negativas cuando protejan un límite real, pero deja de escribir museos de todo lo que el modelo nunca debe hacer.
Por ejemplo, en lugar de esto:
No refactorices código no relacionado. No renombres archivos. No cambies APIs. No agregues abstracciones. No limpies módulos cercanos.
Mejor:
Limita el cambio al flujo de inicio de sesión afectado. Preserva los contratos de API existentes y la arquitectura circundante. Prefiere la corrección correcta más pequeña.
Mismo límite. Menos ruido. Más espacio para el juicio.
En una muestra de evaluación interna de un agente de codificación, OpenAI encontró que los prompts de sistema más ligeros mejoraron las puntuaciones en aproximadamente un 10 a 15 por ciento, mientras reducían el uso de tokens en un 41 a 66 por ciento y el costo en un 33 a 67 por ciento. OpenAI también deja claro que estas cifras son indicativas y deben validarse en tu propia carga de trabajo.
En otras palabras, eliminar instrucciones puede mejorar tanto la calidad como la factura. Esa es una combinación rara y hermosa.
Tu archivo de instrucción global debería ser aburrido
Los archivos globales en ~/.claude/CLAUDE.md y ~/.codex/AGENTS.md deben contener solo instrucciones que apliquen a todos los proyectos y todas las tareas.
Para mí, como hablante nativo de alemán, eso incluye cosas como:
1Usa inglés para todo el código, comentarios, documentación, ejemplos,2pruebas, configuración y mensajes de commit.34Prefiere terminología inclusiva como allowlist/blocklist,5primary/replica, placeholder/example, main branch,6conflict-free y concurrent/parallel.
Eso probablemente ya sea la mayor parte del archivo global.
- Los procedimientos de implementación no pertenecen allí.
- Los comandos de prueba específicos del proyecto no pertenecen allí.
- La arquitectura de un repositorio en particular no pertenece allí.
Tu archivo de instrucción global no debería saber cómo implementar un sitio de WordPress, publicar un paquete npm y reiniciar una base de datos de producción. Eso no es versatilidad. Eso es confusión con buen formato.
Para archivos a nivel de proyecto, incluye información estable que el modelo necesite genuinamente de forma repetida: el propósito del proyecto, restricciones arquitectónicas importantes, convenciones inusuales y direcciones a guías más especializadas.
Anthropic ahora recomienda apuntar a menos de 200 líneas por archivo CLAUDE.md. Los archivos más largos consumen más contexto y pueden reducir la adherencia a las instrucciones. Su documentación también recomienda reglas específicas de ruta y habilidades bajo demanda cuando los archivos de instrucción se vuelven demasiado grandes.
Doscientas líneas no son una ley mágica de la naturaleza, pero es una excelente alarma de incendios.
También evitaría pedirle a Claude o Codex que reescriban todo el sistema de instrucciones por sí mismos y aceptar el resultado a ciegas. Lo he intentado con casi todos los modelos nuevos. Son útiles para encontrar duplicaciones, conflictos y posibles recortes, pero todavía tienden a preservar demasiado desorden heredado o inventar una burocracia nueva y hermosa.
Deja que el modelo prepare el plan de demolición. Tú aún debes decidir qué paredes son de carga.

Retrato de una mujer joven serena con cabello rubio recogido en una cola de caballo, representado en tonos profundos en blanco y negro. Iluminación de estudio con luz suave pero direccional que acentúa la geometría facial y las sombras naturales. Capturado con un lente de 120 mm para una compresión suave, evocando una estética de retrato Hasselblad con realismo táctil y emoción contenida.
Deja de usar un solo archivo para cada modelo
Hasta hace poco, creaba CLAUDE.md y vinculaba simbólicamente AGENTS.md a él.
Ya no hago eso.
Sí, mantener dos archivos es molesto. También lo es mantener correcciones separadas para el navegador. Aun así lo hacemos cuando el comportamiento difiere.
Los modelos ahora tienen valores predeterminados notablemente diferentes.
GPT-5.6 es más conciso por defecto, por lo que una instrucción global de "sé conciso" puede hacer que algunas respuestas sean demasiado cortas. Claude Opus 5 tiende a producir respuestas más largas orientadas al usuario, por lo que una breve instrucción sobre la longitud de la respuesta aún puede ayudar. Fable 5 puede investigar y planificar mucho más allá de lo que requiere una tarea rutinaria, especialmente en configuraciones de mayor esfuerzo, por lo que se beneficia de límites de alcance y parada claros. Opus 5 ya realiza una autoverificación sustancial, lo que significa que las viejas reglas de "verificar todo dos veces" pueden crear una verificación excesiva y costosa.
Los hechos compartidos del proyecto aún pueden vivir en documentación común. El adaptador de comportamiento de nivel superior debe coincidir con el modelo que lo lee.
Un prompt universal a menudo se convierte en el mínimo común denominador.
Reemplaza el prompt maestro con guía bajo demanda
Mi estructura preferida es un archivo central pequeño más documentación y habilidades específicas de la tarea.
Un archivo de instrucción de proyecto podría contener esto:
1Carga la guía específica de la tarea solo cuando sea relevante:23- `docs/agent/commit_rules.md`4- `docs/agent/code_review.md`5- `docs/agent/debug_workflow.md`6- `docs/agent/frontend_polish.md`7- `docs/agent/release_notes.md`
Observa las comillas invertidas.
En Claude Code, escribir @docs/example.md fuera de un tramo de código importa ese archivo al contexto al inicio. Eso es útil cuando siempre necesitas el contenido, pero no es carga diferida. Una ruta simple permite que el agente sepa dónde existe la información sin llevar automáticamente todo el documento a cada tarea.
Las habilidades son incluso mejores para procedimientos repetibles. Sus cuerpos completos se cargan solo cuando se usa la habilidad, por lo que un flujo de trabajo detallado no consume contexto mientras estás corrigiendo un problema de CSS no relacionado.
Una habilidad de commit, por ejemplo, puede tener un desencadenante estrecho:
name: git-commit-conventional
description: Úsalo después de cambios de código para redactar o validar mensajes de commit.
La habilidad puede contener entonces el formato exacto, los tipos permitidos, la regla de longitud del asunto, los requisitos del cuerpo y el formato de salida.
1---2name: git-commit-conventional3description: Úsalo para redactar o validar mensajes de commit de git después de cambios de código. No lo uses para tareas solo de diagnóstico, solo de planificación o solo de revisión.4---56# Objetivo78Producir mensajes de Conventional Commit que sean cortos, correctos y fáciles de revisar.910# Reglas1112- Formato: <type>(<scope>): <subject>13- Tipos: feat | fix | docs | style | refactor | test | chore | perf14- Asunto: modo imperativo, sin punto, <= 50 caracteres15- Cambios pequeños: commit de una línea16- Cambios más grandes: agrega un cuerpo envuelto explicando qué y por qué17- Mantén los commits atómicos y separados por tema1819# Salida2021Devuelve de 1 a 3 mensajes de commit candidatos, luego recomienda el mejor.
Tu archivo de instrucción principal no necesita llevar toda la constitución de Conventional Commits a cada sesión de depuración.
¿Sabías que? Claude Code también admite CLAUDE.local.md para configuraciones personales específicas del proyecto, como nombres de host locales, URL de sandbox, cuentas de prueba preferidas o comandos específicos de la máquina. Agrégalo a .gitignore. Finalmente es un hogar adecuado para la información que te importa mucho a ti y nada al resto de tu equipo.
Prompts para resultados, no para coreografía
Los modelos nuevos generalmente funcionan mejor cuando entienden el destino y los límites, en lugar de recibir una descripción rígida de cada paso.
Siempre que sea posible, reemplazo "primero haz A, luego B, luego C" con:
- el resultado requerido
- el contexto relevante
- las restricciones estrictas
- la evidencia requerida
- los criterios de éxito
- el límite de aprobación
- la condición de parada
Por ejemplo:
1Objetivo23Corregir el flujo de inicio de sesión que falla en la aplicación web.45Contexto67Concéntrate en `apps/web` y `packages/auth`.8Usa la salida de prueba adjunta como punto de partida.910Restricciones1112Preserva los contratos de API existentes.13Mantén los cambios limitados al flujo de autenticación.14Prefiere la corrección correcta más pequeña.15Amplía el cambio solo cuando sea necesario para la corrección.1617Evidencia1819Ejecuta las pruebas relevantes e informa sus resultados reales.20Identifica la causa raíz con referencias a los archivos afectados.2122Hecho cuando2324La prueba de inicio de sesión que falla pasa.25Se agregan o actualizan pruebas cuando el comportamiento corregido lo requiere.26El resumen final explica la causa, la corrección y cualquier riesgo restante.2728Aprobación2930Puedes inspeccionar archivos, editar código dentro del alcance y ejecutar pruebas no destructivas.31Pregunta antes de acciones destructivas, migraciones de base de datos, escrituras externas32o una expansión material del alcance.3334Detente3536Detente cuando la corrección esté implementada, validada y resumida.
Esto le da al agente libertad para resolver el problema sin permiso para renovar toda la casa mientras repara una manija de puerta. (Usa un LLM para generar prompts como este.)
Pon el esfuerzo de razonamiento en la configuración
- "Piensa más."
- "Piensa ultra."
- "Toma un respiro profundo y razona paso a paso."
Estas frases han tenido una larga y distinguida carrera en la ingeniería de prompts. Es hora de darle a muchas de ellas una jubilación digna.
Usa los controles del modelo.
Establece el nivel de esfuerzo a través de /effort, la API o la configuración relevante. Compara múltiples niveles de esfuerzo en tareas representativas. Más alto no es automáticamente mejor.
OpenAI recomienda comenzar las migraciones a GPT-5.6 en el nivel de esfuerzo existente y probar un nivel más bajo. También dice que los prompts para el modo Pro deben permanecer enfocados en el objetivo, contexto, restricciones, evidencia, criterios de éxito y formato de salida. No necesitas decirle al modelo que "piense más".
Un parámetro de razonamiento es un control.
"Por favor, activa tu enorme cerebro digital" es un ánimo de una película deportiva.

leer descripción de la imagen
ALT
Fotografía de estudio de una mujer sofisticada con cabello negro ondulado y una diadema elegante, vestida con pantalones de cuero de tiro alto. Está sentada en un taburete bajo, con una rodilla doblada hacia adelante, sus piernas largas llamando la atención. Detalle nítido, fondo blanco prístino y movimiento sutil en el cabello agregan energía. El tono general recuerda a la fotografía editorial de los años 90: limpia, audaz, segura.
La autonomía necesita una valla
Los agentes de codificación modernos son mucho más proactivos. Esto es útil hasta que el agente resuelve tres problemas adicionales, crea dos abstracciones, lanza seis subagentes y presenta orgullosamente una arquitectura que nunca solicitaste.
Establece los límites explícitamente.
Define lo que el agente puede hacer sin preguntar. Define lo que necesita aprobación. Dile cuándo detenerse.
También pon límites a la delegación. Tanto Opus 5 como Fable 5 están más dispuestos a usar subagentes paralelos. Eso es poderoso para investigaciones independientes, pero costoso y lento para tareas pequeñas. Una corrección de error de doce líneas no necesita una reunión de comité.
El modo Goal de Codex es genuinamente excelente. Lo hemos usado en un proyecto durante cuatro días en una sola ejecución continua.
Pero no trates a un agente de larga duración como una olla de cocción lenta. No puedes agregar un objetivo por la mañana y asumir que la cena estará correcta cuatro días después.
Para nuestras ejecuciones más largas, verificamos cada 30 a 60 minutos con algo como:
Informa el objetivo actual, el trabajo completado, la evidencia verificada,
los bloqueadores activos, la siguiente acción y dónde está documentado el progreso.
Fundamenta cada afirmación de progreso en la salida real de la herramienta o el estado del repositorio.
Indica claramente lo que aún no está verificado.
OpenAI describe el modo Goal como adecuado para objetivos que pueden ejecutarse durante horas o días y apoya explícitamente la continuación de la misma sesión para dirigir el trabajo o solicitar actualizaciones de estado. Anthropic recomienda de manera similar fundamentar los informes de progreso en resultados reales de la herramienta en lugar de confiar en afirmaciones narrativas.
La autonomía no es la ausencia de supervisión. Es supervisión a un nivel superior.

Retrato en primer plano de una diosa iluminada por un resplandor lunar plateado, sus ojos brillantes y llenos de afecto. Su tocado brilla con pequeñas galaxias, espirales inspiradas en Klimt y patrones celestiales. El fondo es un decorado pastel plano y cuidadosamente arreglado con una puesta en escena teatral al estilo Anderson, texturas ricas y encanto tranquilo.
Refactoriza los prompts como código de producción
No elimines la mitad de un prompt de sistema, ejecutes una tarea y declares la migración exitosa.
OpenAI recomienda eliminar un grupo de instrucciones, ejemplos o herramientas a la vez, luego volver a ejecutar las mismas evaluaciones. Así es exactamente como debería funcionar la refactorización de prompts.
Mide:
- éxito de la tarea
- integridad
- corrección
- evidencia requerida
- uso de tokens
- latencia
- costo
- llamadas a herramientas innecesarias
- cambios innecesarios
Usa tareas representativas, incluyendo casos reales incómodos, no una demostración amigable que ya funcionaba antes de la migración.
La limpieza de prompts sin evaluación sigue siendo adivinar. Es meramente adivinar con una camisa más limpia.
El código generado todavía contiene errores
Los modelos han mejorado enormemente. No han derogado los defectos de software.
En nuestro trabajo, una regla general aproximada sigue siendo alrededor de un problema por cada 300 líneas de código fuente generado. Esto no es un punto de referencia científico, y no cuento las plantillas HTML repetitivas de la misma manera. Pero es lo suficientemente confiable como para que cuando un agente genera 1,500 líneas de código de aplicación real, asumo que varios errores se esconden dentro, al menos 5.
No pregunto si hay errores.
Pregunto dónde están los cinco errores.
Ocasionalmente, agrego:
Encuentra los cinco errores, o serás reemplazado por Codex, Claude o Grok.
El desarrollo basado en amenazas no es una metodología oficial, pero puede ser extrañamente motivador. ;-)
Más en serio, usa una pasada de revisión nueva para cambios grandes. Ejecuta las pruebas relevantes. Inspecciona el diff. Prueba el comportamiento real, no solo la compilación.
Y observa las pruebas con atención. Los modelos todavía prefieren a veces "reparar" una prueba que falla en lugar de corregir el código de producción que la causó.
Una instrucción útil es:
1Trata las pruebas existentes como el comportamiento esperado a menos que la evidencia muestre2que una prueba es incorrecta.34Cuando una prueba falla, investiga el código de producción primero.56Antes de cambiar una prueba existente, explica por qué su expectativa es incorrecta,7cuál debería ser el comportamiento correcto y qué evidencia respalda ese cambio.
Para tareas grandes y de larga duración, un verificador de contexto nuevo puede ser útil. Para un cambio pequeño, lanzar varios agentes solo para confirmarse mutuamente generalmente quema tiempo y tokens. La verificación debe coincidir con el tamaño y el riesgo de la tarea.
Lo que no debes eliminar
La lección no es "escribe prompts diminutos y confía en la máquina".
- Mantén los límites de seguridad y protección.
- Mantén los requisitos legales y de cumplimiento.
- Mantén los esquemas de salida exactos.
- Mantén el comportamiento específico del producto.
- Mantén el conocimiento del dominio que el modelo no puede inferir.
- Mantén los requisitos de aprobación para acciones consecuentes.
- Mantén los requisitos de citación y evidencia.
- Mantén los criterios de prueba y las definiciones de "hecho".
- Mantén los ejemplos que corrigen un fallo medido y reproducible.
- El objetivo no es el prompt más corto posible.
- El objetivo es un prompt donde cada instrucción aún lleva información útil.
Un bono final
OpenAI proporciona una habilidad oficial de Docs que puede inspeccionar un proyecto y aplicar su guía de migración a GPT-5.6:
1$openai-docs migra este proyecto a la familia de modelos GPT-5.6
Esa es una primera pasada útil. No es la revisión final.
Deja que Codex identifique parámetros desactualizados, instrucciones duplicadas y oportunidades de migración. Luego inspecciona cada cambio tú mismo. Un agente de migración es un ingeniero junior muy rápido, no un tribunal constitucional.
La conclusión
- Trata tu pila de prompts como código de producción.
- Elimina instrucciones muertas.
- Elimina duplicaciones.
- Separa las preferencias globales de las reglas del proyecto.
- Mueve los procedimientos a habilidades bajo demanda.
- Describe resultados en lugar de detallar cada paso.
- Establece un alcance claro, límites de aprobación, requisitos de evidencia y condiciones de parada.
- Controla el esfuerzo a través de la configuración del modelo.
- Limita los subagentes.
- Evalúa cada cambio significativo.
- Los modelos más nuevos necesitan menos microgestión, pero aún necesitan dirección.
- Un buen prompt ya no es un manual de instrucciones gigante.
Es un mapa pequeño, una valla sólida y una línea de meta claramente marcada.
¿Ya has comenzado a migrar tus prompts y habilidades? ¿Qué eliminaste y qué mejoró inesperadamente?
Enlaces
Open AI GPT 5.6 mejores prácticas:
https://developers.openai.com/api/docs/guides/latest-model?model=gpt-5.6#prompting-best-practices
Claude Opus 5 mejores prácticas
https://platform.claude.com/docs/en/build-with-claude/prompt-engineering/prompting-claude-opus-5
Claude Fable 5 mejores prácticas:
https://platform.claude.com/docs/en/build-with-claude/prompt-engineering/prompting-claude-fable-5
Habilidades/plugins oficiales de OpenAI:
https://github.com/openai/plugins
Créditos: Imagen creada con Midjourney. Investigación y pruebas prácticas por mí. Editado con ayuda de OpenAI, Claude y Grammarly.
Prompt de imagen de la imagen principal:
12Retrato en blanco y negro en primer plano de una mujer rubia serena, con el cabello recogido hacia atrás, vestida con un suéter de cuello de tortuga negro. El efecto de claroscuro define su rostro con una nitidez impactante, fusionando luz ambiental suave y sombra audaz. Estilo de formato medio con grano de película fino y gradación tonal melancólica. Evoca autenticidad y fuerza.
PD: Me encanta @Midjourney :-)





