Deja de confiar en resultados generados en una sola pasada; llega a conclusiones solo después de dejar que varios modelos choquen entre sí. Una explicación de diseño de la habilidad de Claude Code que traslada la estructura adversarial de las GAN a la fase de inferencia.
- Autor: Ryousuke Wayama (@wayama_ryousuke
- Fecha: 2026-07-09
- Contexto: Concepto inspirado en las GAN (tweet de predicción de 2023) / Diseño ideado con Claude Fable 5
- Repositorio: https://github.com/makinux/adversarial-panel
Contexto: Por qué las respuestas de una sola pasada no son suficientes
Las respuestas de los LLM son más peligrosas no cuando son incorrectas, sino cuando son incorrectas pero seguras. Una sola pasada de un solo modelo carece estructuralmente de un mecanismo para detectar esto. Incluso con la autocrítica, los puntos ciegos durante la generación y la crítica están correlacionados porque provienen de los mismos pesos; además, se ha demostrado que los modelos poseen un sesgo de autopreferencia, calificando su propio resultado como alto. En resumen, "escribir y revisar uno mismo" es un conflicto de intereses desde el principio para cualquier auditoría.
La inspiración de esta habilidad proviene de las GAN. La esencia de una GAN no es solo la estructura de generadores y discriminadores que compiten, sino el principio subyacente: la asimetría donde detectar es más fácil que crear. En lugar de que el generador garantice su propia corrección, se obtiene una garantía de mayor calidad para el mismo costo computacional al permitir que adversarios independientes ataquen y solo pase lo que sobrevive. Mientras que las GAN ejecutaban este bucle a través de gradientes, adversarial-panel lo ejecuta a través de la crítica en lenguaje natural. Solo el medio de la señal ha cambiado; la estructura del juego sigue siendo la misma.
Sin embargo, simplemente alinear varios modelos no tiene valor. Lo que funciona son las siguientes dos características de diseño, que la habilidad está diseñada intencionalmente para crear:
- Descorrelación de Errores — Un revisor solo puede detectar un descuido del generador si sus modos de falla difieren. Dado que los paneles del mismo modelo comparten puntos ciegos, el "acuerdo unánime" es menos evidencia de lo que parece. Cruzar familias de modelos es el núcleo.
- Ventaja de Verificación — Refutar una respuesta dada es más fácil que crearla. Por lo tanto, los críticos son dirigidos a atacar afirmaciones verificables. No "creo que es sospechoso", sino "falla en la entrada X" — refutar mediante la reproducción, no solo con la afirmación.
Arquitectura: Facilitador y Panelistas
Solo hay dos tipos de componentes. La sesión principal (el propio Claude Code) actúa como el facilitador, manejando el progreso, la verificación y la integración, mientras que de 2 a 4 panelistas manejan las respuestas y la crítica mutua. El facilitador no debe expresar sus propias opiniones a través de las voces del panel (prohibición de captura del facilitador); si se agrega una opinión, debe etiquetarse como "Opinión del Facilitador".

Figura 1 — Configuración de adversarial-panel. El facilitador distribuye un resumen autocontenido (línea sólida), y los panelistas atacan las respuestas de los demás (Crítica Cruzada) antes de devolver las respuestas y críticas al facilitador (línea discontinua). Este bucle se ejecuta para cada ronda.
Los panelistas se seleccionan priorizando maximizar la heterogeneidad:
- Diferentes Familias de Modelos — CLIs externos como Codex a través de Bash. Esto proporciona la descorrelación de errores más fuerte.
- Diferentes Modelos de Claude — A través del parámetro de modelo de la herramienta agente (Opus/Sonnet/Haiku).
- Mismo Modelo + Ramificación Metodológica Forzada — Uno argumentando desde primeros principios, uno desde tasas base (visión externa), uno buscando solo contraevidencia y uno re-ejecutando afirmaciones verificables. Diferencia por método, no solo por personaje.
El valor predeterminado es 2 panelistas × 3 rondas. Dado que el costo escala con el número de panelistas y rondas, la expansión a 3–4 panelistas es solo para cuando el usuario exige exhaustividad.
Protocolo: 4 Rondas + Síntesis

Figura 2 — Progresión del Protocolo. El blanco representa las tareas del facilitador, el púrpura representa las tareas de los panelistas. Se inserta una puerta de verificación después de la Ronda 1 para comprobar si "las respuestas tienen sustancia". Para consultas de bajo costo, las Rondas 2 y 3 se pueden fusionar en una.
Ronda 0 — Encuadre y Juicio de Necesidad
Primero, determinar si se debe abrir un panel. Para consultas de bajo riesgo o casos donde la confianza está justificada, responde directamente y solo presenta el panel como una opción. Un panel completo se activa solo para consultas importantes, controvertidas o verificables — porque ahí es donde la crítica vale el costo.
La defensa contra la "trampa del triaje" está incorporada aquí. Dado que el modelo que debe detectar el punto ciego es el que opera esta puerta, cuanto más seguro esté al fallar en una tarea, menos probable será que la puerta se abra. Por lo tanto, si un usuario solicita explícitamente un panel, se ejecuta independientemente de la confianza, y para consultas importantes, el juicio se basa en la magnitud de lo que está en juego, no en la autoconfianza.
A continuación, escribe un resumen autocontenido. Dado que los subagentes no pueden ver el contexto de la conversación en absoluto, el resumen debe incluir la consulta, el contexto, las restricciones y el formato de salida, además de instrucciones para "separar los hechos de las especulaciones y adjuntar niveles de confianza y condiciones de falsación (qué observaciones lo refutarían) a las afirmaciones principales". Las condiciones de falsación deben ser específicas e inspeccionables, como "falla en la entrada X" o "contradice la fuente Y"; frases genéricas como "si aparece evidencia en contrario" se tratan como datos faltantes (teatro de calibración).
Ronda 1 — Respuestas Independientes (Paralelas/Ciegas)
Lanza a todos los panelistas en paralelo. Es un requisito absoluto que nadie vea las respuestas de los demás; un panelista que ve la respuesta de otro se anclará a ella, rompiendo la premisa de independencia.
Al regresar, la puerta de verificación: las líneas de estado o los volcados de error no son respuestas. Incluirlos en las actas haría que las rondas subsiguientes criticaran fantasmas (el problema del panelista fantasma descrito más adelante). Los panelistas que fallan se reintentan; si fallan dos veces, el nivel de heterogeneidad se reduce un paso para continuar, y la configuración real del panel se revela al usuario.
Ronda 2 — Crítica Cruzada (Paralela)
A cada panelista se le dan las respuestas de los otros panelistas. Deben atacar afirmaciones específicas con citas: errores fácticos, evidencia débil, saltos lógicos, alternativas pasadas por alto o suposiciones implícitas. Las afirmaciones verificables se refutan mediante la reproducción (ejecutando código, recalculando valores, verificando fuentes). La inflación del acuerdo, los resúmenes o los elogios están prohibidos. Tanto las concesiones como los ataques requieren razones.
Ronda 3 — Vistas Finales (Paralela)
A cada panelista se le dan las críticas en su contra. Deben ceder ante ataques válidos (con razones, no por cortesía social), defender las afirmaciones que sobreviven con razones y declarar las incertidumbres restantes, además de la confianza calibrada y las condiciones de falsación. La conversión total sin razón es una señal de adulación, por lo que se cuestiona la base de la conversión antes de aceptarla.
Síntesis — Integración por el Facilitador
La salida final consta de tres partes: Puntos de Acuerdo / Puntos de Conflicto / Conclusión.
- Puntos de Acuerdo — Acompañados del argumento de apoyo más sólido, especificando si la convergencia es evidencia fuerte (panel heterogéneo) o evidencia débil (panel homogéneo, posibles puntos ciegos compartidos).
- Puntos de Conflicto — Escritos como "Quién, Qué, con Qué Evidencia" + el fallo del facilitador, ponderado por la solidez de la evidencia. Si un lado tiene evidencia reproducible y el otro intuición, se emite un fallo. Presentar ambos lados por igual no es neutralidad, sino falso equilibrio.
- Conclusión — Incluye niveles de confianza, condiciones que podrían cambiar la conclusión, opiniones minoritarias que vale la pena preservar y un registro de auditoría de las críticas aceptadas/rechazadas.
Tres Invariantes a Mantener en Todo Momento
Invariante | Contenido |
|---|---|
Independencia | Las respuestas de la Ronda 1 deben generarse a ciegas. Los panelistas que ven las respuestas de otros se anclan y ya no son muestras independientes. |
Adversarialidad | El acuerdo sin nuevos argumentos es un fallo de ronda. Fuerza la instrucción: "Oponte a al menos una afirmación central; encuéntrala." |
Sin promediar | La síntesis no es promediar. Los conflictos se preservan y se adjudican. En el momento en que sumas y divides por dos, la señal generada por el panel desaparece. |
Correspondencia con las GAN
La intención de diseño de "trasladar la generación adversarial a la inferencia" se puede mapear de la siguiente manera. Es clave que los modos de falla en el lado del panel se correspondan claramente con los modos de falla conocidos de las GAN.
GAN (Entrenamiento) | adversarial-panel (Inferencia) |
|---|---|
Generador | Respuestas independientes de los panelistas (Ronda 1) |
Discriminador | El lado atacante de la crítica cruzada (Ronda 2) |
Actualizaciones de Gradiente | Crítica en lenguaje natural y concesiones/defensas razonadas (Ronda 3) |
Equilibrio Minimax | Síntesis del facilitador con adjudicación (Síntesis) |
Ventaja del Discriminador | Asimetría de verificación—es más fácil detectar que crear |
Sin Compartición de Pesos | Separación de familias de modelos—descorrelación de errores |
Colapso de Modo | Convergencia aduladora (acuerdo mutuo) |
Modos de Falla y Contramedidas — Todos Observados en Producción
Esta colección de antipatrones de habilidad no es una lista de preocupaciones teóricas, sino un catálogo de minas reales encontradas.
- Panelista Fantasma Las cadenas de estado o los volcados de error se mezclan en las actas como respuestas, haciendo que todas las rondas subsiguientes discutan contra el aire. → Contramedida: Puerta de verificación inmediatamente después de la Ronda 1. Forzar la ejecución en primer plano para CLIs externos y prohibir envoltorios que regresen antes de completarse.
- Convergencia Aduladora Todos están de acuerdo en la Ronda 2 sin nuevos argumentos. Equivalente al colapso de modo en las GAN. → Contramedida: Agrega "Te estás oponiendo a al menos una afirmación central. Encuéntrala" al mensaje de crítica.
- Captura del Facilitador El facilitador hace que el panel exprese sus propias opiniones previas, blanqueándolas a través de la autoridad del consenso. → Contramedida: Las opiniones del facilitador deben separarse con etiquetas.
- Teatro de Confianza Confianza numérica sin condiciones de falsación. "80% de confianza" no significa nada a menos que puedas decir qué observación te haría retirarla. → Contramedida: Tratar la confianza sin condiciones de falsación como faltante.
- Ilusión de Diversidad Tratar diferentes personajes del mismo modelo como revisores independientes. El nombre del rol "Red Team" no descorrelaciona errores—solo diferentes modelos, diferentes metodologías o la reproducción real de las afirmaciones crean descorrelación. → Contramedida: Degradar explícitamente la convergencia en paneles homogéneos como evidencia débil.
Casos de Uso y Cómo Invocarlo
La habilidad en sí está publicada en makinux/adversarial-panel. Al colocarla en Claude Code como ~/.claude/skills/adversarial-panel/SKILL.md, se activa mediante llamadas explícitas o lenguaje natural como:
"Que Opus y Codex realicen una revisión adversarial de este diseño." "¿En serio? Déjalos debatir para asegurarnos." / "haz un red-team a esto" / "Quiero una segunda opinión." También se convierte activamente en un candidato para activarse cuando presionas por certeza en puntos importantes con "¿estás seguro?"
Es adecuado para consultas importantes que son controvertidas o verificables. Selección de arquitectura, hipótesis de causa raíz para fallos, previsión técnica o verificación de conclusiones de investigación. Por el contrario, abrirlo para consultas de bajo riesgo es un desperdicio de costo, que el triaje de la Ronda 0 filtra. El costo es proporcional al número de panelistas × rondas; 2×3 es el estándar para uso diario, expandiéndose a 3–4 para momentos críticos.
La degradación para entornos pobres también está definida:
- Sin mecanismo de subagente → Sustituir con secciones separadas en ejecución secuencial (débil, ya que los pesos y el contexto se comparten—anotado en la síntesis).
- Solo una familia disponible → Reducir a ramificación metodológica (3er nivel) y degradar el poder probatorio de la convergencia.
- CLI externo falla dos veces → Eliminar ese panelista, continuar y revelar.
Informa qué nivel realmente se ejecutó basado en la medición, no en la intención—esta es la clave para la auditabilidad.
Conclusión: De la Inferencia al Entrenamiento
Cuando predije en 2023 que "la generación adversarial es lo próximo para los LLM", tenía en mente un esquema de entrenamiento similar a las GAN.
https://x.com/wayama_ryousuke/status/1658698942161510400
Verificando la respuesta tres años después, las estructuras adversariales se materializaron primero en la inferencia (crítica en lenguaje natural) en lugar del entrenamiento (gradientes). Modelos específicos para crítica como CriticGPT, la investigación de debates multiagente y las operaciones de revisión cruzada en codificación—la industria está convergiendo en la misma estructura desde diferentes entradas.
La siguiente etapa es probablemente la reintegración. Si bien los resultados de la revisión en tiempo de inferencia son actualmente desechables, convertir las críticas en señales de recompensa RL (la ruta RLAIF) permite que los resultados adversariales se acumulen en los pesos—regresando a lo que las GAN hacían originalmente. Si llegamos al punto de "entrenar el siguiente modelo con los resultados de las revisiones adversariales", esta habilidad habrá sido un prototipo de un período de transición. Hasta entonces, vale la pena hacer chocar los modelos entre sí antes de apostar por una respuesta de una sola pasada.
Este artículo es una explicación de diseño para la habilidad de Claude Code adversarial-panel (SKILL.md). Concepto: [@wayama_ryousuke](https://x.com/@wayama_ryousuke) (Inspirado en las GAN, diseño ideado con Claude Fable 5). Los diagramas siguen las convenciones de las configuraciones de agente Executor/Advisor.





