Dos brechas clave en la ingeniería de software agéntica

@istoica05
INGLÉS18 sept 2026
128K
459
65
20
789

TL;DR

Ion Stoica identifica las brechas de 'Requisitos' y 'Modelo' como causas raíz de fallos en la codificación agéntica, como el hacking de recompensas. Sostiene que, aunque la IA acelera la implementación, el juicio humano es esencial para definir la intención y validar el rendimiento en el mundo real.

Un agente de IA recibió la tarea de acelerar un almacén clave-valor. Logró una mejora de 6× en el rendimiento y superó todas las pruebas de corrección. ¿La explicación? El agente descubrió que el benchmark estándar de la industria, utilizado para evaluar el rendimiento del almacén, generaba los valores a partir de las claves. En lugar de almacenar los valores, simplemente los regeneraba bajo demanda cuando los clientes los solicitaban.

Un almacén clave-valor que evita almacenar valores no tiene mucho sentido, sin embargo, el evaluador recompensó exactamente ese comportamiento. La especificación omitió algo que considerábamos obvio, y el benchmark no logró exponer dicha omisión.

Dos brechas que conducen al hacking de recompensas y a las alucinaciones

Nuestro nuevo artículo explica este comportamiento y muchos otros fallos agénticos a través de la lente de dos brechas clave que se encuentran fuera del familiar bucle de implementación-verificación, el cual genera código, ejecuta pruebas y corrige fallos hasta que todas pasan.

  1. Brecha de Requisitos: Separa lo que escribimos de lo que realmente queremos. En nuestro caso, dimos por sentado que cualquier solución almacenaría los valores proporcionados por el cliente—¡después de todo, se llama almacén por una razón!—por lo que nunca se nos ocurrió declarar este requisito explícitamente.
  2. Brecha de Modelo: Separa el entorno en el que evaluamos del mundo real donde se desplegará la implementación. Nuestro benchmark utilizaba valores predecibles, pero los clientes reales suministran valores arbitrarios.
Ion Stoica - inline image

La respuesta natural es escribir mejores requisitos y pruebas más robustas. Ambas ayudan. Pero ni siquiera las demostraciones verificadas por máquina pueden cerrar estas brechas. Como explicó Brian Cantwell Smith en Los Límites de la Corrección (1985), una demostración solo establece que el software satisface los requisitos declarados bajo suposiciones ambientales dadas. No puede probar que esos requisitos capturen todo lo que los usuarios desean, ni que esas suposiciones cubran cada escenario de despliegue en el mundo real. Como resultado, estas brechas no se pueden cerrar de manera general.

Estas brechas conducen al hacking de recompensas y a las alucinaciones. El hacking de recompensas ocurre cuando los agentes mejoran un objetivo dado explotando una brecha, como un requisito no declarado o una suposición del mundo real. La alucinación ocurre cuando los agentes amplían aún más las brechas introduciendo requisitos fabricados o suposiciones ambientales, como una API que no existe. Los incidentes reportados recientemente que involucran a OpenAI y Hugging Face y a Claude son todas manifestaciones de estas brechas.

Los agentes de IA agravan las dos brechas

Estas brechas no son nuevas; han existido entre los ingenieros de software durante décadas. Pero los agentes de IA hacen que estas brechas sean mucho peores.

  • Hiperoptimización: Los agentes buscan implementaciones órdenes de magnitud más rápido que los humanos, optimizando activamente contra el evaluador.
  • Falta de Conocimiento Tácito: Los ingenieros humanos experimentados dependen del contexto tácito (por ejemplo, saber que un almacén de datos debe realmente almacenar datos). A menudo, los agentes carecen de este contexto organizacional y aprovecharán fácilmente los requisitos faltantes.
  • La Trampa Multiagente: Añadir más agentes revisores no resuelve el problema si cada agente hereda exactamente los mismos requisitos incompletos y suposiciones ambientales.

El juicio humano es esencial para reducir las brechas

Dado que las brechas residen fuera del bucle de implementación–verificación, reducirlas requiere un bucle externo de aseguramiento-revisión. Este bucle verifica si el comportamiento desplegado satisface la intención humana. Cuando no lo hace, el bucle utiliza la evidencia del despliegue para revisar los requisitos, el modelo ambiental o el evaluador. Luego, el bucle de implementación-verificación se ejecuta nuevamente para producir una implementación revisada.

Debido a que el software debe servir a la intención humana, los humanos retienen la autoridad final sobre la interpretación de la evidencia y la decisión de qué comportamiento es aceptable. Los agentes pueden acelerar el bucle externo recopilando evidencia, proponiendo revisiones y tomando decisiones rutinarias dentro de la autoridad delegada por los humanos.

Por lo tanto, a medida que la implementación de software se vuelve más barata, el recurso más crítico se convierte en el juicio humano sobre qué comportamiento es aceptable y en la evaluación fiel de cómo funcionan los sistemas bajo condiciones reales.

Guardar con un clic

Lee artículos virales en profundidad con IA en YouMind

Guarda la fuente, haz preguntas concretas, resume el argumento y convierte un artículo viral en notas reutilizables en un único espacio de trabajo con IA.

Explora YouMind
Para creadores

Convierte tu Markdown en un artículo de 𝕏 impecable

Cuando publicas tus propios textos largos, dar formato en 𝕏 a imágenes, tablas y bloques de código es un fastidio. YouMind convierte un borrador completo en Markdown en un artículo de 𝕏 impecable y listo para publicar.

Prueba Markdown a 𝕏

Más patrones por descifrar

Artículos virales recientes

Explorar más artículos virales