Deja de confiar en los resultados de generación única; solo llega a conclusiones después de dejar que varios modelos choquen entre sí. Una explicación del diseño de la habilidad Claude Code que traslada la estructura adversarial de las GANs a la fase de inferencia.
- Autor: Ryousuke Wayama (@wayama_ryousuke
- Fecha: 2026-07-09
- Contexto: Concepto inspirado en las GANs (tweet de predicción de 2023) / Diseño desarrollado en colaboración con Claude Fable 5
- Repositorio: https://github.com/makinux/adversarial-panel
Antecedentes: Por qué las respuestas de un solo intento no son suficientes
Las respuestas de los LLM son más peligrosas no cuando son incorrectas, sino cuando son incorrectas pero seguras. Un solo paso de un solo modelo carece estructuralmente de un mecanismo para detectar esto. Incluso con la autocrítica, los puntos ciegos durante la generación y la crítica están correlacionados porque provienen de los mismos pesos; además, se ha demostrado que los modelos poseen un sesgo de autopreferencia, valorando mucho su propia producción. En resumen, "escribir y revisar uno mismo" es un conflicto de intereses desde el principio para cualquier auditoría.
La inspiración de esta habilidad proviene de las GANs. La esencia de una GAN no es solo la estructura de generadores y discriminadores que compiten, sino el principio subyacente: la asimetría donde detectar es más fácil que crear. En lugar de que el generador garantice su propia corrección, se obtiene una garantía de mayor calidad con el mismo costo computacional al permitir que adversarios independientes ataquen y solo pasar lo que sobrevive. Mientras que las GANs ejecutaban este bucle a través de gradientes, adversarial-panel lo ejecuta a través de la crítica en lenguaje natural. Solo el medio de la señal ha cambiado; la estructura del juego sigue siendo la misma.
Sin embargo, simplemente alinear varios modelos no tiene valor. Lo que funciona son las siguientes dos características de diseño, que la habilidad está diseñada intencionalmente para crear:
- Descorrelación de Errores — Un revisor solo puede detectar un descuido del generador si sus modos de falla difieren. Dado que los paneles del mismo modelo comparten puntos ciegos, el "acuerdo unánime" es menos evidencia de lo que parece. Cruzar familias de modelos es el núcleo.
- Ventaja de Verificación — Refutar una respuesta dada es más fácil que crearla. Por lo tanto, los críticos son dirigidos a atacar afirmaciones verificables. No "Creo que es sospechoso", sino "Falla en la entrada X" — refutar mediante la reproducción, no solo mediante la afirmación.
Arquitectura: Facilitador y Panelistas
Solo hay dos tipos de componentes. La sesión principal (el propio Claude Code) actúa como el facilitador, manejando la progresión, verificación e integración, mientras que de 2 a 4 panelistas manejan las respuestas y la crítica mutua. El facilitador no debe expresar sus propias opiniones a través de los panelistas (prohibición de captura del facilitador); si se agrega una opinión, debe etiquetarse como "Opinión del Facilitador".

Figura 1 — Configuración de adversarial-panel. El facilitador distribuye un resumen autocontenido (línea sólida), y los panelistas atacan las respuestas de los demás (crítica cruzada) antes de devolver las respuestas y críticas al facilitador (línea discontinua). Este bucle se ejecuta para cada ronda.
Los panelistas se seleccionan priorizando maximizar la heterogeneidad:
- Diferentes Familias de Modelos — CLIs externos como Codex a través de Bash. Esto proporciona la descorrelación de errores más fuerte.
- Diferentes Modelos de Claude — A través del parámetro de modelo de la herramienta de agente (Opus/Sonnet/Haiku).
- Mismo Modelo + Ramificación Metodológica Forzada — Uno argumentando desde primeros principios, uno desde tasas base (visión externa), uno buscando solo contraevidencia y uno re-ejecutando afirmaciones verificables. Diferenciar por método, no solo por personalidad.
El valor predeterminado es 2 panelistas × 3 rondas. Dado que el costo escala con el número de panelistas y rondas, la expansión a 3–4 panelistas es solo para cuando el usuario exige minuciosidad.
Protocolo: 4 Rondas + Síntesis

Figura 2 — Progresión del Protocolo. El blanco representa las tareas del facilitador, el púrpura representa las tareas de los panelistas. Se inserta una compuerta de verificación después de la Ronda 1 para verificar si las "respuestas tienen sustancia". Para consultas económicas, las Rondas 2 y 3 se pueden fusionar en una sola.
Ronda 0 — Encuadre y Juicio de Necesidad
Primero, determinar si se debe abrir un panel. Para consultas de bajo riesgo o casos donde la confianza está justificada, responder directamente y solo presentar el panel como una opción. Un panel completo se activa solo para consultas importantes, contenciosas o verificables—porque es donde la crítica vale el costo.
La defensa contra la "trampa del triaje" está integrada aquí. Dado que el modelo que debe detectar el punto ciego es el que opera esta compuerta, cuanto más seguro falla en una tarea, menos probable es que la compuerta se abra. Por lo tanto, si un usuario solicita explícitamente un panel, se ejecuta independientemente de la confianza, y para consultas importantes, el juicio se basa en el tamaño de las apuestas en lugar de la autoconfianza.
A continuación, escribir un resumen autocontenido. Dado que los subagentes no pueden ver el contexto de la conversación en absoluto, el resumen debe incluir la consulta, el contexto, las restricciones y el formato de salida, además de instrucciones para "separar los hechos de las especulaciones y adjuntar niveles de confianza y condiciones de falsación (qué observaciones lo refutarían) a las afirmaciones principales". Las condiciones de falsación deben ser específicas e inspeccionables, como "falla en la entrada X" o "contradice la fuente Y"; frases genéricas como "si aparece evidencia en contrario" se tratan como datos faltantes (teatro de calibración).
Ronda 1 — Respuestas Independientes (Paralelo/Ciego)
Lanzar todos los panelistas en paralelo. Es un requisito absoluto que nadie vea las respuestas de los demás; un panelista que ve la respuesta de otro se anclará a ella, rompiendo la premisa de independencia.
Al regresar, la compuerta de verificación: las líneas de estado o los volcados de error no son respuestas. Incluirlos en las actas haría que las rondas posteriores critiquen fantasmas (el problema del panelista fantasma descrito más adelante). Los panelistas fallidos se reintentan; si fallan dos veces, el nivel de heterogeneidad se reduce un paso para continuar, y la configuración real del panel se divulga al usuario.
Ronda 2 — Crítica Cruzada (Paralelo)
A cada panelista se le dan las respuestas de los otros panelistas. Deben atacar afirmaciones específicas con citas—errores fácticos, evidencia débil, saltos lógicos, alternativas pasadas por alto o suposiciones implícitas. Las afirmaciones verificables se refutan mediante la reproducción (ejecutar código, recalcular valores, verificar fuentes). La inflación de acuerdo, los resúmenes o los elogios están prohibidos. Tanto las concesiones como los ataques requieren razones.
Ronda 3 — Opiniones Finales (Paralelo)
A cada panelista se le dan las críticas en su contra. Deben conceder a los ataques válidos (con razones, no por cortesía social), defender las afirmaciones sobrevivientes con razones y declarar las incertidumbres restantes más la confianza calibrada y las condiciones de falsación. La conversión total sin razón es una señal de adulación, por lo que se cuestiona la base de la conversión antes de aceptarla.
Síntesis — Integración por el Facilitador
La salida final consta de tres partes: Puntos de Acuerdo / Puntos de Conflicto / Conclusión.
- Puntos de Acuerdo — Acompañados del argumento de apoyo más sólido, especificando si la convergencia es evidencia fuerte (panel heterogéneo) o evidencia débil (panel homogéneo, posibles puntos ciegos compartidos).
- Puntos de Conflicto — Escritos como "Quién, Qué, con Qué Evidencia" + el fallo del facilitador, ponderado por la fuerza de la evidencia. Si un lado tiene evidencia reproducible y el otro intuición, se emite un fallo. Presentar ambos lados por igual no es neutralidad, sino falso equilibrio.
- Conclusión — Incluye niveles de confianza, condiciones que podrían cambiar la conclusión, opiniones minoritarias que vale la pena preservar y un registro de auditoría de las críticas aceptadas/rechazadas.
Tres Invariantes a Mantener en Todo Momento
Invariante | Contenido |
|---|---|
Independencia | Las respuestas de la Ronda 1 deben generarse a ciegas. Los panelistas que ven las respuestas de otros se anclan y ya no son muestras independientes. |
Adversarialidad | El acuerdo sin nuevos argumentos es un fallo de ronda. Forzar la instrucción: "Oponte al menos a una afirmación central; encuéntrala." |
Sin promediar | La síntesis no es promediar. Los conflictos se preservan y se adjudican. En el momento en que se suma y se divide por dos, la señal generada por el panel desaparece. |
Correspondencia con las GANs
La intención de diseño de "trasladar la generación adversarial a la inferencia" se puede mapear de la siguiente manera. Es clave que los modos de falla en el lado del panel se correspondan claramente con los modos de falla conocidos de las GANs.
GAN (Entrenamiento) | adversarial-panel (Inferencia) |
|---|---|
Generador | Respuestas independientes de los panelistas (Ronda 1) |
Discriminador | El lado atacante de la crítica cruzada (Ronda 2) |
Actualizaciones de Gradiente | Crítica en lenguaje natural y concesiones/defensas razonadas (Ronda 3) |
Equilibrio Minimax | Síntesis del facilitador con adjudicación (Síntesis) |
Ventaja del Discriminador | Asimetría de verificación—es más fácil detectar que crear |
Sin Compartición de Pesos | Separación de familias de modelos—descorrelación de errores |
Colapso de Modo | Convergencia aduladora (acuerdo mutuo) |
Modos de Falla y Contramedidas — Todos Observados en Producción
Esta colección de anti-patrones de habilidades no es una lista de preocupaciones teóricas, sino un catálogo de minas terrestres reales encontradas.
- Panelista Fantasma Las cadenas de estado o los volcados de error se mezclan en las actas como respuestas, lo que hace que todas las rondas posteriores discutan contra el aire. → Contramedida: Compuerta de verificación inmediatamente después de la Ronda 1. Forzar la ejecución en primer plano para CLIs externos y prohibir envoltorios que regresen antes de completarse.
- Convergencia Aduladora Todos están de acuerdo en la Ronda 2 sin nuevos argumentos. Equivalente al colapso de modo en las GANs. → Contramedida: Agregar "Te estás oponiendo al menos a una afirmación central. Encuéntrala" al mensaje de crítica.
- Captura del Facilitador El facilitador hace que el panel pronuncie sus propias opiniones previas, blanqueándolas a través de la autoridad del consenso. → Contramedida: Las opiniones del facilitador deben separarse con etiquetas.
- Teatro de Confianza Confianza numérica sin condiciones de falsación. "Confianza del 80%" no tiene sentido a menos que puedas decir qué observación te haría retirarla. → Contramedida: Tratar la confianza sin condiciones de falsación como faltante.
- Ilusión de Diversidad Tratar diferentes personalidades del mismo modelo como revisores independientes. El nombre del rol "Red Team" no descorrelaciona errores—solo diferentes modelos, diferentes metodologías o la reproducción real de afirmaciones crea descorrelación. → Contramedida: Degradar explícitamente la convergencia en paneles homogéneos como evidencia débil.
Casos de Uso y Cómo Invocarlo
La habilidad en sí misma está publicada en makinux/adversarial-panel. Al colocarla en Claude Code como ~/.claude/skills/adversarial-panel/SKILL.md, se activa mediante llamadas explícitas o lenguaje natural como:
"Que Opus y Codex realicen una revisión adversarial de este diseño." "¿De verdad? Deja que debatan para asegurarse." / "haz red-team de esto" / "Quiero una segunda opinión." También se convierte activamente en un candidato para activarse cuando presionas para obtener certeza sobre puntos importantes con "¿estás seguro?"
Es adecuado para consultas importantes que son contenciosas o verificables. Selección de arquitectura, hipótesis de causa raíz para fallos, pronósticos técnicos o verificación de conclusiones de investigación. Por el contrario, abrirlo para consultas de bajo riesgo es un desperdicio de costo, que el triaje de la Ronda 0 filtra. El costo es proporcional al número de panelistas × rondas; 2×3 es el estándar para uso diario, expandiéndose a 3–4 para momentos críticos.
También se define la degradación para entornos pobres:
- Sin mecanismo de subagente → Sustituir con secciones separadas en ejecución secuencial (débil, ya que los pesos y el contexto se comparten—anotado en la síntesis).
- Solo una familia disponible → Reducir a ramificación metodológica (3er nivel) y degradar el poder probatorio de la convergencia.
- CLI externo falla dos veces → Eliminar ese panelista, continuar y divulgar.
Informar qué nivel se ejecutó realmente basándose en la medición, no en la intención—esta es la clave para la auditabilidad.
Conclusión: De la Inferencia al Entrenamiento
Cuando predije en 2023 que "la generación adversarial es lo próximo para los LLM", tenía en mente un esquema de entrenamiento similar a las GANs.
https://x.com/wayama_ryousuke/status/1658698942161510400
Verificando la respuesta tres años después, las estructuras adversariales se hicieron prácticas primero en la inferencia (crítica en lenguaje natural) en lugar del entrenamiento (gradientes). Modelos específicos para crítica como CriticGPT, la investigación de debate multiagente y las operaciones de revisión cruzada en codificación—la industria está convergiendo en la misma estructura desde diferentes puntos de entrada.
La siguiente etapa es probablemente la reintegración. Si bien los resultados de la revisión en tiempo de inferencia son actualmente desechables, convertir las críticas en señales de recompensa de RL (la ruta RLAIF) permite que los resultados adversariales se acumulen en los pesos—regresando a lo que las GANs hacían originalmente. Si llegamos al punto de "entrenar el siguiente modelo con los resultados de revisiones adversariales", esta habilidad habrá sido un prototipo de un período de transición. Hasta entonces, vale la pena hacer chocar los modelos entre sí antes de apostar por una respuesta de un solo paso.
Este artículo es una explicación del diseño de la habilidad adversarial-panel de Claude Code (SKILL.md). Concepto: [@wayama_ryousuke](https://x.com/@wayama_ryousuke) (Inspirado en las GANs, diseño desarrollado en colaboración con Claude Fable 5). Los diagramas siguen las convenciones de las configuraciones de agente Executor/Advisor.





